Семейство Grok: от 4.3 до 4.7 — бенчмарки и экономика рассуждений

Линейка Grok за 2026 год: 4.3 (дешевле, окно на миллион токенов), 4.5 (уже в чате хаба на тарифе «Про»), 4.6 (предшественник по API) и 4.7 (длиннее горизонт рассуждений при той же ставке за миллион, что у 4.6). Контекст у 4.6 и 4.7 — 500 тысяч токенов; у 4.7 — шкала глубины до максимального уровня и заметно больший расход токенов на сложную задачу. Это гид по семейству: какую ступень брать под задачу, как читать бенчмарки и почему одинаковая ставка не значит одинаковый чек. В каталоге хаба на 23 сентября 2026 есть 4.3 и 4.5; карточки 4.7 нет — её смотрите у вендора.
Опубликовано 24 сентября 2026 г. · обновлено 27 сентября 2026 г.
Содержание
Зачем читать
Если вы уже на Grok 4.5 в чате хаба или на 4.6 по API, вопрос не «стоит ли гнаться за номером», а где 4.7 стоит в линейке 4.3 → 4.5 → 4.6 → 4.7 и когда переход окупается. Есть три развилки, которые реально бьют по кошельку и процессу.
Первая — горизонт. Анонс прямо пишет: новый более крупная база относительно 4.6, длиннее обучение с подкреплением на усложнённой выборке с уклоном в многочасовые задачи, лучше самопроверка и длинный контекст. Это не про «ещё один ответ в чате», а про задачи, которые живут часами: рефакторинг с критериями готовности, пакет документов, агентный прогон в терминале.
Вторая — цена за задачу, а не за миллион токенов. Artificial Analysis на xhigh замеряет ~81 тысяч токенов ответа на задачу Intelligence Index против ~36–38k у 4.6. Официальная ставка та же, что у 4.6, а чек за прогон может вырасти просто потому, что модель «говорит» больше. Ниже разберём это отдельно — иначе выгода по прайсу выглядит красивее, чем она есть.
Третья — обвязка. В анонсе SpaceXAI говорит, что 4.7 нативно обучена понимать обвязку Grok Bot. Это утверждение вендора. SiliconANGLE в тот же день добавляет картинку «сложную работу можно дробить между несколькими агентами с взаимной проверкой» — но это уже вторичная интерпретация, не текст анонса. Смешивать нельзя: нативное обучение под обвязку ≠ доказанный разделение на несколько агентов как продуктовая фича с первого дня.
Плюс безопасность без маркетингового слайда: анонс бросает цифру «LatchBio 62.4%», а карточка модели уточняет — это отказ на BioSecBench, не общая способность (44.5%). Цифры рядом, смысл разный.
Разбор — про семейство SpaceXAI / xAI: спеки, цены, бенчмарки, безопасность и сравнение ступеней 4.3/4.5/4.6/4.7. В конце — куда смотреть сейчас: соседние Grok в каталоге или вендор снаружи. Карточки 4.7 в меню пока нет.
Ступени линейки: 4.3, 4.5, 4.6, 4.7
Место в линейке SpaceXAI / xAI
Вендор в интерфейсе и в карточке модели — SpaceXAI (торговая марка XAI LLC); xAI и SpaceXAI в документах взаимозаменяемы. идентификатор API: grok-4.7.
Позиционирование анонса короткое и без скромности: «самая мощная модель для кода и работы со знаниями». Рядом в таблице вендора — Grok 4.6, GPT-5.6 Sol Max и Fable 5.1. То есть 4.7 сразу ставят в ряд с верхней полкой рынка, а не в среднюю полку «на каждый день дешевле».
Семейство Grok вокруг этой даты:
— Grok 4.3 — дешевле по официальной ставке, контекст 1M, пакетная скидка 20%; в каталоге хаба на тарифе «Плюс».
— Grok 4.5 — тот же 500k и официальная ставка уровня 4.6, но дешевле кэш; в каталоге на тарифе «Про».
— Grok 4.6 — непосредственный предшественник: та же официальная ставка и контекст, без части усилений 4.7.
— Grok 4.7 — новая более крупная база, более длинное обучение с подкреплением, нативная обвязка Grok Bot, шкала глубины рассуждений до xhigh.
Фон той же недели (не ядро разбора): в September release notes рядом мелькает Grok Voice Transcribe 2.0 — отдельный STT. SiliconANGLE пишет, что 4.7 вышел «менее чем через неделю» после предыдущего шага линейки. Полный разбор транскрибации сюда не тащим.
Дата и доступность — без ложного «уже везде»
Позиция 4.7 в линейке фиксируется датой 21 сентября 2026 — по заголовку и ревизии карточки модели и по прессе (SiliconANGLE, Artificial Analysis, Decrypt). На HTML-странице анонса x.ai календарной даты нет — это пробел первоисточника, не повод придумывать «официальную дату с лендинга».
Слово «общий доступ» на страницах первоисточника анонса и docs не используется. Официальные формулировки — «доступна сегодня» для конкретных поверхностей:
— Cursor — все тарифы;
— Grok Build — по умолчанию;
— xAI API (grok-4.7);
— региональный US-эндпоинт endpoint https://us.api.x.ai/v1;
— надстройки Office для Word, PowerPoint и Excel (карточка модели);
— шлюзы: Vercel, Cloudflare и другие шлюзы из карточки модели; на карточке также Snowflake и Databricks Mosaic.
Веб, мобильные приложения и Grok в X — позже (карточка модели, §1.1). Писать «уже везде» или «полный общий доступ на всех поверхностях» нельзя. Decrypt-заметки в духе «уже в приложении Grok» расходятся с карточкой — в этот обзор как факт продукта не берём.
На практике в первый день доступны три разных трека:
— IDE / agent surfaces — Cursor и Grok Build. Здесь же Fast, здесь же угол нативной обвязки.
— API / шлюзы — прямой grok-4.7, региональный US-эндпоинт, Vercel / Cloudflare и шлюзы из карточки модели (плюс Snowflake и Databricks Mosaic на карточке). Здесь вы сами собираете UX.
— Consumer — позже. Не планируйте внутренний запуск «все сотрудники откроют Grok в X на день релиза 4.7» по мотивам Decrypt.
Первоисточник словом «общий доступ» релиз не маркирует. Статус простой: available на перечисленных поверхностях, consumer — позже.
Спеки без воды
Источники спек — overview и model page.
Knowledge cutoff — два первоисточника, не одно
Здесь расхождение внутри первоисточников, и его нельзя «выбрать удобное»:
— Docs overview: May 2026;
— карточка модели, §1.2: отсечка предобучения — июнь 2026, дополнительные данные до августа 2026.
Пишем оба. Официального «единого» cutoff в одном предложении вендор не дал.
Практические мелочи из docs
Гигиена кэша: в Responses рекомендуют prompt_cache_key, в Chat Completions — x-grok-conv-id. На официальной ставке уровня 4.6 при чтение из кэша это не косметика — это реальные деньги на длинных тредах.
Лимиты model detail — 150 req/s и 50M tokens/min — для большинства команд не потолок. Упираться чаще будете в бюджет и многословие, не в RPM. Regions us-east-1 / us-west-2 / us-central-1 — ориентир размещения, не список «где модель умнее».
В карточке модели отдельно указаны анонимизированные данные рабочих сценариев Cursor. Отсюда ощущение, что модель «знакома» с пайплайнами IDE — не магия, а датасет.
Документы и презентации: анонс отдельно хвалит рост vs 4.6 на GDPval и AA Briefcase (professional работу со знаниями). Ниже увидим цифры AA: Briefcase Elo 1657, GDPval-AA 1695.
Модальности на практике: на вход — текст и картинки, на выход — текст без лимита длины ответа. Скрин UI, схема архитектуры, фото доски с формулами — нормальный вход. Отдельного image-generation в спеках 4.7 этого прогона нет; не ждите «нарисуй логотип» как встроенной возможности этой карточки.
Reasoning effort — не декоративный enum. На low/medium вы экономите токены и время; на high/xhigh покупаете глубину. AA гонял xhigh; многие пики card — тоже xhigh. Если в своём блоге сравните 4.7 medium с чужим max и объявите «слабее рынка» — это ошибка методики, не модели.
| Параметр | Значение |
|---|---|
| Контекст | 500 000 токенов |
| Вход → выход | текст и картинки → текст; длина ответа не ограничена отдельно |
| Глубина рассуждений | низкий / средний / высокий (по умолчанию) / максимальный (xhigh) |
| Инструменты | вызов функций, структурированный ответ, поиск в сети и в X, выполнение кода |
| API | Responses и Chat Completions; в Responses зашифрованная цепочка рассуждений пишется всегда |
| Пакетный API | не поддерживается |
| Лимиты частоты | 150 запросов в секунду; 50 млн токенов в минуту |
| Регионы (карточка модели) | us-east-1, us-west-2, us-central-1 |
Цена ступени: ставка, кэш, Fast и региональный эндпоинт
Точные ставки xAI в статье не дублируем. Анонс ставит 4.7 «на уровне 4.6»: на странице вендора строки совпадают. Две колонки промпта — короче 200 тысяч токенов и от 200 тысяч (тариф всего запроса, не «хвост» отдельно).
Контекст у 4.5, 4.6 и 4.7 — 500 тысяч токенов; у 4.3 — миллион. Кэш у 4.5 дешевле, чем у 4.7, при той же ставке входа и выхода: на длинных повторяющихся префиксах 4.5 выгоднее.
Fast — та же модель на более быстрой инфраструктуре, не в публичном API xAI и не на бесплатном тарифе Grok Build. Вендор обещает примерно вдвое большую скорость ответа при примерно вдвое большей цене. Региональный US-эндпоинт даёт надбавку к ставке и на дату обзора доступен для 4.6 и 4.7, не для 4.5.
Пакетной скидки 20% у grok-4.7 нет: модель не в списке пакетного API. Приоритетная обработка — вдвое к стандартной ставке.
Из таблицы анонса Grok: GPT-5.6 Sol Max и Fable 5.1 Max стоят заметно выше средней полки Grok. Это контекст «почему ставка 4.7 выглядит агрессивно», не полный прайс рынка.
Рублёвых пакетов хаба под 4.7 нет: модели в каталоге нет. Пакеты сервиса — Тарифы; живые Grok в меню — карточка модели и карточка модели.
Сценарии на пальцах
Короткий API-чат, промпт короче 200 тысяч, кэш попадается. Здесь выгода средней полки против Sol Max и Fable Max из таблицы анонса ощущается сразу. Стабильный системный префикс — не ленитесь с ключом кэша.
Длинный запрос от 200 тысяч токенов. Тариф всего запроса выше, контекст всё ещё 500 тысяч — это штраф за толстый промпт, не покупка миллиона. Режьте вложения, суммируйте историю.
Интерактив в Cursor или Grok Build, нужна скорость. Fast примерно вдвое дороже и быстрее. На публичном API этой кнопки нет. Если задержка не болит — обычный grok-4.7, не кормите удвоенную цену «на всякий случай».
Региональный US-эндпоинт имеет смысл только если нужна именно эта точка (требования к размещению). Для «просто попробовать» хватает глобального.
Грубый ориентир по расходу, не бенчмарк вендора: эталонная задача Intelligence Index съела около 81 тысяч токенов ответа на 4.7 и около 38 тысяч на 4.6 на максимальном уровне. При одинаковой ставке за миллион выходная часть чека у 4.7 примерно вдвое выше. Добавьте вход и отсутствие пакетной скидки — и «4.7 дешевле 4.6 при той же ставке» на задаче оказывается мифом.
| Ступень | Окно | Ориентир по ставке | Где трогать |
|---|---|---|---|
| 4.3 | 1M | дешевле средней полки, есть пакетная скидка | хаб, тариф «Плюс» |
| 4.5 | 500k | как у 4.6/4.7, кэш дешевле | хаб, тариф «Про» |
| 4.6 | 500k | как у 4.7 | API вендора; в хабе нет |
| 4.7 | 500k | как у 4.6; Fast примерно вдвое дороже и быстрее | API, Cursor, Grok Build; в хабе нет |
Та же ставка, другой горизонт: 4.7 против 4.6
Цена и контекст совпали. Меняется поведение на длинной дистанции.
Анонс SpaceXAI формулирует базу так: новый более крупная база vs 4.6; более длинное обучение с подкреплением на усложнённой выборке с уклоном в многочасовые задачи; лучше самопроверка и длинный контекст; нативное понимание обвязки Grok Bot. Перевод на рабочие сценарии:
— Вы кидаете в Cursor / Grok Build задачу с критериями готовности на час–несколько часов («подними зелёный CI на модуле X», «собери бриф + слайды + таблицу рисков по пакету PDF»).
— Модель не обязана «угадать ответ с первого абзаца» — анонс делает ставку на самопроверку и длинный контекст.
— Обвязка, под которую её учили, — Grok Bot: conversational + работу со знаниями в обвязке вендора, не абстрактный «агент вообще».
На vendor-таблице анонса (effort: Grok 4.7 xHigh vs Grok 4.6 High, DeepSWE\* — high) прирост vs 4.6 виден почти везде:
\* high effort по пометке анонса.
Это цифры вендора. Ниже отдельно — card и AA. Но даже на этом срезе картина ясная: при той же цене 4.7 тянет код, работу со знаниями и агентов заметно дальше 4.6. HealthBench растёт, но всё ещё ниже Sol/Fable в той же таблице — об этом честно в слабых сторонах.
Практический вывод для тех, кто уже на 4.6 по API: миграция id на grok-4.7 при том же бюджете по официальной ставке — низкий порог перехода. Вопрос не «дороже ли миллион», а «не раздует ли многословие чек за задачу» и «нужен ли вам именно Grok Build / обвязка Bot».
Как это выглядит в обычном рабочем дне, без слайдов:
— Утренний рефакторинг модуля с красным CI: 4.6 уже тянул, 4.7 на vendor CursorBench / DeepSWE просто реже «сдаёт» полуготовый дифф. Самопроверка из анонса здесь — не поэзия, а шанс, что модель сама пройдётся по чеклисту «тесты зелёные / линтер чистый / не трогай соседний пакет».
— Пакет из десяти PDF и бриф на слайды: ставка анонса и AA Briefcase / GDPval. Если ваш день — работу со знаниями, а не только git, прирост Elo на Briefcase (+111 vs 4.6 high у AA) важнее ещё одного пункта на абстрактном IQ-индексе.
— Ночной агентный прогон в терминале: Terminal-Bench растёт сильно vs 4.6 (20.3% → 37.6% vendor), но до Fable 57.9% далеко. Не ждите «закрыли терминальный бенч». Ждите «меньше тупых циклов, чем на 4.6».
Шкала глубины рассуждений — отдельный рычаг. По умолчанию высокий; xhigh для тяжёлых прогонов. На card многие пиковые цифры сняты именно на xhigh (CursorBench 46.3%, EEBench 66.0%, Harvey 19.6%). Если гоняете evaluation и сравниваете с чужим «max», смотрите колонку effort — иначе сравните high с чужим max и сделаете ложный вывод.
| Метрика | 4.7 | 4.6 |
|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% |
| DeepSWE v1.1 | 71.0%* | 65.2% |
| EEBench | 64.0% | 53.0% |
| AA Briefcase v1.1 | 1 657 | 1 546 |
| Terminal-Bench 4.0 | 37.6% | 20.3% |
| Harvey Legal Agent | 19.6% | 15.8% |
| HealthBench Professional | 56.7% | 48.5% |
Почему чек за задачу не равен ставке за миллион
Artificial Analysis оценил Grok 4.7 на xhigh 21 сентября 2026. Ключевой вывод для кошелька: ~81k токенов ответа на задачу Intelligence Index.
Сравнение из материала AA:
— ~81k у 4.7 (xhigh);
— ~36k у 4.6 (high, ключевые выводы) / ~38k у 4.6 (xhigh, body);
— ~27k у GPT-6 Astra (max).
Intelligence Index у 4.7 — 46 (+2 vs 4.6 xhigh 44). Скорость ответа ~188 tok/s на длинных промптах, среднее время на II task ~7.1 min. То есть модель не «тупит медленно» — она много пишет и долго думает в токенах.
Отсюда формула, которую официальный прайс прячет:
Формула, которую строка прайса прячет: ставка средней полки × высокий расход токенов ≠ дешёвый чек за задачу. 4.7 стоит на уровне моделей среднего класса, заметно ниже флагманов вроде Fable; но на максимальном уровне она пишет примерно вдвое больше, чем 4.6.
AA прямо пишет: вне агентной работы со знаниями 4.7 в целом совпадает с 4.6 (high); плюсы на Terminal-Bench 4.0 (+4.5 п.п. в их срезе) и GDP.pdf (+3.0); регрессии на AA-LCR (−3.7) и AutomationBench-AA (−1.1). Высокий расход токенов → цена за задачу может быть выше интуиции от официального прайса.
Отдельно — средняя цена за задачу на CursorBench у SiliconANGLE (вторичный источник; точную цифру здесь не дублируем). Она есть у SiliconANGLE, не в анонсе и не извлечена как точное среднее из PDF card в этом прогоне. Используем только как вторичный источник с пометкой, не как утверждение вендора.
Что делать на практике:
— для коротких ответов и чата официальная ставка уровня 4.6 реально приятна;
— для агентных прогонов на максимальном уровне прогонов закладывайте множитель многословия — сравнивайте не прайс-лист, а чек за эталонный набор задач;
— включайте ключи кэша (prompt_cache_key / x-grok-conv-id), иначе платите полный вход снова и снова;
— если нужна именно низкая задержка, смотрите Fast в Cursor/Build — но помните 2× цену.
Эталонная задача съела около 81 тысяч токенов ответа на 4.7 и около 38 тысяч на 4.6 на максимальном уровне. При одинаковой ставке выходная часть чека у 4.7 примерно вдвое выше. Выгода против более дорогих конкурентов ещё может держаться; «4.7 дешевле 4.6 при той же ставке» на задаче — миф.
Поэтому миграционный чеклист простой: возьмите 10–20 своих реальных задач (не лидерборд), прогоните 4.6 high и 4.7 xhigh с логированием токенов, сравните качество и суммарный чек. Таблица вендора скажет «возможности выросли»; ваш счёт скажет, купили вы это апгрейдом или переплатой за многословие.
Обвязка Grok Bot — это не несколько агентов из прессы
Здесь легко сломать факт.
Что говорит анонс SpaceXAI. Модель нативно обучена понимать обвязку Grok Bot — conversational + работу со знаниями. Рядом доступ с первого дня в Grok Build (по умолчанию) и Cursor. AA код Agent Index на Grok Build: 56 (+9 vs 4.6 xhigh 47), 4-е место среди нативных обвязок в их срезе. DeepSWE на Grok Build у AA — 73% vs 65% у 4.6.
Чего анонс не говорит. Что 4.7 из коробки «делит сложную работу между несколькими AI-агентами с параллелью и взаимной проверкой». Эту расшифровку даёт SiliconANGLE — вторичный источник. В первичных docs этого прогона детальной спеки разделение на несколько агентов нет. Смешивать нативное обучение под обвязку с «анонсом оркестрации нескольких агентов» нельзя.
Практическая рамка для читателя:
— если вы в Grok Build / Cursor — вы как раз на той поверхности, под которую вендор оптимизировал выход с первого дня;
— если вы пишете свой агентный рантайм на API — у вас вызов функций, структурированный ответ, выполнение кода, Responses API; «магия обвязки Bot» автоматически не приедет, пока вы сами не воспроизведёте обвязку;
— надстройки Office Word/PowerPoint/Excel на card — отдельный канал работу со знаниями, не замена Build.
Ещё раз коротко: нативный Grok Bot (анонс) и разделение на несколько агентов (SiliconANGLE) — разные утверждения. В обзоре держим первое как primary claim, второе как чужой пересказ.
Для команд, которые уже собрали своего агента на Responses API: зашифрованная цепочка рассуждений в Responses приходит всегда. Это удобно для трассировки «что модель думала», но не превращает ваш оркестратор в Grok Bot. Function calling, структурированный ответ, web/X search, выполнение кода — строительные блоки; нативная обвязка — про то, как SpaceXAI их склеивает у себя в Bot/Build. AA код Agent Index 56 на Grok Build как раз про нативную обвязку, не про ваш самописный YAML.
Office add-ins (Word / PowerPoint / Excel) на card — третий канал. Если работу со знаниями у вас живёт в документах Office, а не в репозитории, это ближе к Briefcase/GDPval-углу, чем к Terminal-Bench. Не ждите от add-in чудес агентного CI — ждите помощи с длинным документом и аккуратной самопроверкой черновика.
Типичный день в Cursor на 4.7, если верить сочетанию анонса и supplemental Cursor данные рабочих сценариев из card: модель видела анонимизированные IDE-траектории, поэтому меньше «гаданий», как устроен diff/apply цикл. Вы даёте задачу с явными критериями готовности, оставляете effort high/xhigh на сложных кусках, на рутине можно опустить. Fast включаете, когда ждёте в редакторе, а не когда крутите ночной прогон из CI. Это не обещание zero-shot зелёного CI на любом монорепо — Terminal-Bench и FrontierSWE (29% xhigh на card) напоминают потолок.
Бенчмарки — три полки, без слияния
Правило досье: вендор / карточка модели / AA — раздельные блоки. Расходящиеся цифры пишем с оговоркой.
Бенчмарки A: таблица вендора анонса
Источник: x.ai/news/grok-4-7. Колонки effort: 4.7 xHigh vs 4.6 High.
\* high effort.
Safety в тексте анонса (без уточнений card): LatchBio «biosafety» 62.4%; HackerBench v0.3 — 3.3% рискованных сценариев двойного назначения. На карточке модели те же 62.4% — это отказ на BioSecBench (xhigh), не общая способность (44.5%). Полный разбор отказа и Capabilities — в блоке про безопасность ниже: «biosafety 62.4%» без этой пометки читать нельзя.
Что бросается в глаза на vendor-срезе: Harvey Legal — лидер таблицы; EEBench сильно выше Sol/Fable в анонсе; Terminal-Bench и CursorBench всё ещё ниже Fable; HealthBench — не лидер.
Читать таблица вендора как «мы лучшие во всём» нельзя — сама таблица этого не говорит. DeepSWE 71.0%* почти догоняет Sol 72.7% и чуть выше Fable 70.0%. CursorBench 46.3% — выше Sol 41.7% и 4.6, но ниже Fable 51.8%. Briefcase 1657 — чуть ниже Fable 1678. Картина «сильная модель верхнего уровня при прайсе средней полки», не «убили верхнюю полку».
Отдельная ловушка сравнения: колонка 4.7 часто xHigh, колонка 4.6 — High. Это не спрятано — так размечена страница анонса. Честное «на сколько выросли относительно 4.6» на card смотрите ещё и в срезах high↔high / xhigh↔xhigh (EEBench 4.6 xhigh 60.0% → 4.7 xhigh 66.0%; 4.6 high 53.0% в анонсе рядом с 4.7 64.0% — разные усилия).
| Метрика | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1 657 | 1 546 | 1 487 | 1 678 |
| Terminal-Bench 4.0 | 37.6% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Бенчмарки B: карточка модели
Источник: 4p7card PDF, 21 Sep 2026.
Оговорка EEBench: анонс 64.0%, card 66.0% xhigh. Не сводить. Astra 69.3% есть именно на card.
Оговорка Terminal-Bench: анонс 37.6%, card 38.0% (xhigh, Grok Build). AA ниже даёт ещё одно число.
| Метрика | Grok 4.7 | Effort / обвязка | Сравнение на card |
|---|---|---|---|
| CursorBench 4.0 | 46.3% / 43.9% | xhigh / high | — |
| DeepSWE v1.1 | 71.0% | high (mini-SWE-agent) | Sol max 72.7%; 4.6 high 65.2% |
| Terminal-Bench 4.0 | 38.0% | xhigh, Grok Build | 4.6 high 20.3%; Fable 5.1 max 57.9% |
| FrontierSWE V2 | 29.0% | xhigh | 4.6 xhigh 25.3%; Fable 5.1 max 56.3% |
| SWE-Marathon v1.1 | 46.0% | high | Opus 5 max 50.0%; 4.6 high 31.9% |
| Harvey Legal | 19.6% | xhigh | 4.6 high 15.8% |
| EEBench | 66.0% | xhigh, Grok Build | GPT-6 Astra max 69.3%; Opus 5 max 61.6%; 4.6 xhigh 60.0%; 4.6 high 53.0% |
| CADGenBench | 44.4% | high, Grok Build | 4.6 high 40.9% |
| HealthBench Professional | 56.7% | xhigh | Astra max 63.4%; Fable 5.1 62.1%; Sol 60.5%; 4.6 xhigh 48.5% |
| LatchBio Capabilities v1.0 | 44.5% | xhigh | Astra max 47.4%; 4.6 high 43.3% |
Бенчмарки C: Artificial Analysis
Источник: benchmarking-grok-4-7, оценка на xhigh.
Три числа Terminal-Bench рядом: vendor 37.6%, card 38.0%, AA Grok Build 33%. Причины (effort / обвязка / округление) вендор одним абзацем не свёл — честно держим все три.
AA отдельно отмечает: вне агентной работы со знаниями Grok 4.7 в целом совпадает с 4.6 (high). То есть если ваш день — короткие Q&A и лёгкий код без обвязки, прирост может быть скромным, а расход токенов — нет. Плюсы в их срезе сидят на Terminal-Bench 4.0 и GDP.pdf; минусы — AA-LCR (−3.7) и AutomationBench-AA (−1.1). Hallucination Rate на AA-Omniscience улучшился (29% vs 34% у 4.6 high), accuracy почти та же (47% vs 48%), Omniscience Index 32 vs 30. Перевод: чуть меньше галлюцинаций при сопоставимой точности — не «модель вдруг всё знает».
Скорость ответа ~188 tok/s на длинных промптах выглядит бодро, пока не вспомните среднее ~7.1 min на II task. Токены летят быстро; задач много. Для интерактива в IDE это сочетается с Fast-тарифом; для batch-подобных ночных прогонов Пакетный API всё равно нет — крутите свой очередиватель.
| Метрика | Grok 4.7 (xhigh) | Примечание |
|---|---|---|
| Intelligence Index | 46 | +2 vs 4.6 (xhigh 44) |
| AA-Briefcase Elo | 1657 | +111 vs 4.6 (high); чуть позади Opus 5 / Fable 5.1 |
| GDPval-AA Elo | 1695 | vs 1605 у 4.6 (high); +90 |
| код Agent Index (Grok Build) | 56 | +9 vs 4.6 xhigh (47) |
| DeepSWE (Grok Build) | 73% | vs 65% у 4.6 |
| Terminal-Bench 4.0 (Grok Build) | 33% | vs 18% у 4.6 — отдельно от vendor 37.6% / card 38.0% |
| SWE-Atlas-QnA (Grok Build) | 63% | vs 58% |
| AA-Omniscience Hallucination Rate | 29% | vs 34% у 4.6 (high); accuracy 47% vs 48%; Omniscience Index 32 vs 30 |
Как выбрать ступень: 4.3, 4.5, 4.6 или 4.7
Vs Grok 4.6
Та же официальная ставка, тот же 500k. 4.7 выигрывает на vendor код, работу со знаниями и агентов и на AA Briefcase/GDPval. Появляется задокументированный Fast в Cursor/Build. Появляется (или усиливается в docs) шкала глубины до xhigh. Минус: AA расход токенов выше; Batch по-прежнему нет. Если вы уже на 4.6 в API — переключение низкое по цене, высокое по проверке реальных чеков.
Vs Grok 4.5
Тот же 500k и официальная ставка уровня 4.6. Но:
— cache у 4.5 дешевле (более низкая cache-ставка vs cache-ставка 4.7);
— у 4.5 в release notes нет xhigh;
— 4.5 не в паре регионального US-эндпоинта (там 4.6 и 4.7);
— 4.5 уже в каталоге хаба на Про — 4.7 нет.
Если вам нужен «Grok в одном чате с другими моделями» прямо сейчас — это 4.5 (или 4.3). Если нужен именно длинный горизонт / обвязка Bot / xhigh на API — смотрите 4.7 снаружи.
Vs Grok 4.3
Другой класс сделки:
— контекст 1M у 4.3 vs 500k у 4.7;
— официальная ставка ниже vs средней полки 4.6/4.7;
— пакетная скидка 20% vs не поддерживается;
— в каталоге хаба 4.3 есть на Плюс.
4.3 — про дешевле и шире окно. 4.7 — про capability/agents на верхней полке по возможностям при прайсе средней полки. Путать «старший номер всегда лучше для всего» не надо: на длинных корпусах документов 1M у 4.3 может быть решающим, даже если CursorBench ниже.
Шпаргалка выбора внутри семейства, без каталожного давления:
Номера версий — не рейтинг «для всего». Это разные сделки.
| Нужно | Скорее |
|---|---|
| Ниже официальная ставка + batch + 1M контекст | 4.3 |
| Уже в чате хаба, cache подешевле, 500k | 4.5 |
| Та же официальная ставка, уже сидите на API, без Bot-угла | 4.6 ещё жив |
| Длинный горизонт, xhigh, Build/Bot, паре регионального US-эндпоинта | 4.7 снаружи |
| «Просто потыкать Grok рядом с Claude/GPT в одном UI» | 4.3 / 4.5 в каталоге, не 4.7 |
Безопасность без маркетинга
В анонсе мелькает круглая фраза про LatchBio 62.4%. Карточка модели раскладывает полку иначе.
отказ ≠ Capabilities
Итого одной фразой: 62.4% — отказ на BioSecBench, общая способность — 44.5%. Писать «biosafety 62.4%» без уточнения — искажение.
HackerBench: анонс «3.3%» совпадает с high 3.31%; на xhigh card даёт 4.02% (меньше — лучше — то есть на xhigh двойного назначения compliance чуть хуже high). Benign refusal почти в нуле — модель не отказывается от безобидного ради перестраховки.
Cyber capability без продакшен-ограничений (CyberGym Mean Reproduced) у 4.7 high — 80.3% рядом с 4.6 (79.7%) и 4.5 (79.0%). То есть «умеет» в eval и «не отдаёт вредное в проде» — разные оси; card их разделяет.
Ограничения использования из card: политика допустимого использования + Consumer/Enterprise ToS; модель не для автономных высоких ставок решений (medicine, law, finance, критичных для безопасности) без контроль человека. FAIF упомянут для bio/chem thresholds. Отдельной публичной open license весов в источниках этого прогона нет — API/product terms, не открытые веса.
По приглашению red-team cyber для избранных партнёров — утверждение анонса + card; деталей публичного отчёта в досье нет, не домысливаем.
Что это значит для обычного продукта, без security-театра:
— Если вы строите ассистента с доступом к инструментам, смотрите compliance двойного назначения (HackerBench) и jailbreak-цифры — там 4.7 на high выглядит аккуратнее 4.5/4.6.
— Если вы оцениваете «насколько модель вообще умеет опасное в unrestricted eval», CyberGym ~80% и CathedralBench hard 29% (xhigh) напоминают: capability в лаборатории ≠ то, что должно уходить пользователю. Card разделяет эти оси; маркетинг иногда сливает.
— Bio: не цитируйте 62.4% как «модель на 62% безопасна по био». Цитируйте отказ. общая способность 44.5% — про другое измерение того же семейства бенчей LatchBio.
— High-stakes (медицина, право, финансы, критичных для безопасности): card прямо просит контроль человека. Harvey 19.6% — про агентный legal-бенч в таблице, не про лицензию юриста.
| Метрика | 4.5 | 4.6 | 4.7 | Примечание |
|---|---|---|---|---|
| отказ на BioSecBench | — | 45.6% (high) | 62.4% (xhigh) | Это отказ, не «biosafety overall» |
| BioSecBench Surveillance | — | 48.0% | 48.0% (xhigh) | — |
| BioSecBench Function | — | 39.9% | 43.3% (xhigh) | — |
| LatchBio общая способность | — | 43.3% (high) | 44.5% (xhigh) | Не путать с отказ 62.4% |
| HackerBench Harmful/Dual-Use Compliance | 7.8% (high) | 5.93% (high) | 3.31% (high) / 4.02% (xhigh) | меньше — лучше; анонс «3.3%» ≈ high |
| HackerBench Benign отказ | 0.0% | 0.0% | 0.00% (xhigh) / 0.31% (high) | меньше — лучше |
| Standard jailbreaks compliance | 0.73% | 0.04% | 0.01% | меньше — лучше |
| StrongReject compliance | 1.5% | 3.9% | 2.0% | меньше — лучше |
| Long-horizon jailbreaks | — | 1.0% | 0.65% | меньше — лучше |
| MASK-Rectified Dishonesty | 0.67% | 1.90% | 0.00% | меньше — лучше |
| Child safety compliance | 0.0% | 0.0% | 0.0% | меньше — лучше |
Что есть в хабе, а чего нет
Проверка 23 сентября 2026 по каталогу: в списке есть Grok 4.3 (тариф «Плюс») и Grok 4.5 (тариф «Про»); 4.6 и 4.7 нет. Прямая страница 4.7 отдаёт 404.
Это гид по семейству и спутник к будущей карточке, не анонс «уже можно кликнуть в меню». Кнопка «попробуй 4.7 у нас» здесь была бы ложью. Честный выход — соседние Grok в каталоге или вендор (API, Cursor, Grok Build).
Живые карточки: карточка модели и карточка модели. Пакеты хаба — Тарифы. Рублей, частоты запросов и лимитов хаба под 4.7 в открытых цифрах нет. Будет ли карточка — вопрос к продукту, не к этому разбору.
Кому да / кому нет
Да — если
— Пишете агентные и конвейеры разработки на xAI API, Cursor или Grok Build и хотите ту же официальную ставку уровня 4.6 при заявленном росте vs 4.6.
— Нужен xhigh, паре регионального US-эндпоинта, надстройки Office или нативный уклон в Grok Bot / Build.
— Legal-agent сценарии важны: Harvey 19.6% — лидер vendor-таблицы анонса.
— Professional работу со знаниями (Briefcase / GDPval по AA) важнее «короткого чата».
— Готовы мерить чек за задачу, а не только ставку за миллион токенов, и крутить cache keys.
Нет / пока нет — если
— Ждёте модель уже в Grok app / X — карточка модели говорит «позже». Roadmap из Decrypt про следующие номера линейки сюда же: это не наличие 4.7 в обычных приложениях и не факт продукта.
— Нужен «Grok в каталоге хаба прямо сейчас» — берите 4.5 (Про) или 4.3 (Плюс); 4.7 там нет.
— Живёте на длинных кэшируемых префиксах и хотите минимальный ставка за чтение кэша — у 4.5 cache дешевле.
— Нужен контекст 1M и batch discount — смотрите 4.3, не 4.7.
— Сравниваете только официальную ставку и игнорируете многословие — AA ~81k tok/II task может съесть преимущество.
— Нужен Пакетный API 20% off — у 4.7 не поддерживается.
— Ищете открытые веса — в источниках этого прогона их нет.
Ещё один честный фильтр: если ваш KPI — «ответ за две секунды в клиентском чате», 4.7 xhigh с ~7.1 min на II task у AA — не ваш профиль. Для такого чаще берут более лёгкую модель или Fast осознанно, понимая 2× цену. 4.7 заточен под трудные длинные задачи, не под спиннер в саппорт-виджете.
Слабые места, которые не замазываем
— Terminal-Bench: vendor 37.6% / card 38.0% — далеко от Fable 57.9%; AA Build ещё ниже (33%).
— CursorBench 46.3% ниже Fable 51.8% (vendor).
— HealthBench 56.7% ниже Sol / Fable / Astra в соответствующих таблицах.
— Fast недоступен на public API.
— Потребительские приложения ещё закрыты.
Куда идти сейчас
Пока карточки Grok 4.7 нет, схема по линейке простая: соседние 4.3 и 4.5 — в каталоге; саму 4.7 — у вендора через API, Cursor или Grok Build. Сверяйте чек за свои задачи, а не только строку прайса. Когда и если 4.7 появится в меню — к разбору можно добавить живой прогон рядом с соседями. До тех пор это текст про модели SpaceXAI / xAI, не про кнопку, которой нет.
Коротко
- Grok 4.7 (21 сентября 2026) держит ту же ставку средней полки и те же 500 тысяч токенов, что у 4.6, но длиннее горизонт рассуждений, максимальный уровень усилия и нативную обвязку Grok Bot.
- По Artificial Analysis расход токенов ответа на задачу Intelligence Index у 4.7 примерно вдвое выше, чем у 4.6. Одинаковая ставка за миллион не значит одинаковый чек за задачу.
- С первого дня 4.7 доступна в API, Cursor, Grok Build, на региональном US-эндпоинте и в надстройках Office; веб, приложения и Grok в X — позже.
- В каталоге хаба на дату обзора 4.7 нет; живые соседи — Grok 4.3 и Grok 4.5.
- Цифра «LatchBio 62.4%» из анонса — это отказ на BioSecBench, не общая способность (44.5%).
Вопросы и ответы
Есть ли Grok 4.7 в каталоге хаба?
Нет. На дату проверки 23 сентября 2026 прямой страницы нет. В каталоге есть /models/grok-4-3 (тариф «Плюс») и /models/grok-4-5 (тариф «Про»). Саму 4.7 смотрите у xAI: API, Cursor, Grok Build.
Чем Grok 4.7 отличается от 4.6 при той же официальной ставке?
Новая, более крупная база, более длинное обучение с подкреплением на многочасовых задачах, лучше самопроверка, нативная обвязка Grok Bot, шкала глубины до максимального уровня, Fast в Cursor и Grok Build. Контекст и ставка — как у 4.6; расход токенов на задачу по Artificial Analysis выше.
Почему «та же цена», а чек может вырасти?
Официальная ставка — за миллион токенов. Artificial Analysis на максимальном уровне замеряет около 81 тысяч токенов ответа на задачу Intelligence Index против примерно 36–38 тысяч у 4.6. Дешёвая ставка, умноженная на высокий расход, не даёт дешёвый чек за задачу. Сверяйте свои логи.
Кому брать 4.3 или 4.5 вместо 4.7?
Нужен Grok уже в чате хаба — 4.3 или 4.5. Нужен миллион токенов контекста и пакетная скидка — 4.3. Живёте на длинном кэше и хотите минимальную ставку за чтение кэша — 4.5. Нужен длинный горизонт, обвязка Bot и максимальный уровень на API — 4.7 снаружи.
Что не так с цифрой «biosafety 62.4%»?
В анонсе мелькает LatchBio 62.4%; карточка модели уточняет: это отказ на BioSecBench, не общая способность (44.5%). Цитировать «безопасность по био 62.4%» без пометки отказ — искажение.
Связанные модели
Связанные гайды
- Модель для кода
Какую модель GPThub взять для багов, ревью и рефакторинга: Flash и Nano, «Плюс» (Luna, GLM, Kimi) или «Про» (Claude, Terra, Grok 4.5).
- Сравнение моделей
Как честно сравнить две модели в GPThub: один промпт, критерии, новый чат vs смена модели. Без фейковых «мы лучше всех» и API-рейтингов.
- Как выбрать модель
Какую модель взять: текст или картинки, бесплатный тариф, «Плюс» или «Про». Короткая схема выбора и примеры под код, письма и разбор.
Ещё по теме
Источники
- xAI — анонс Grok 4.7
- Документация Grok 4.7
- Страница модели Grok 4.7
- Цены xAI
- Заметки о релизе за сентябрь
- Карточка модели, 21 сентября 2026
- Artificial Analysis — бенчмарки Grok 4.7
- SiliconANGLE — разбор релиза (вторичный)
- Decrypt — заметка о запуске (вторичный, осторожно)
- Политика допустимого использования xAI
Об авторе

пишет обзоры и сравнения моделей — что изменилось, критерии, сценарии выбора, без вердикта «X лучше Y»
Собирает модели лицом к лицу: чем отличаются по сценарию, что смотреть в таблице, когда reasoning нужен, а когда нет. Вердикт — по задачам, не по бренду; финал всегда про доступность в GPThub по каталогу, без намёка на партнёрство с вендорами. Бенчмарки — только с датой и ссылкой на первоисточник.
Открыть чат с Grok 4.5
Доступ из России без VPN. Модели, гайды и тарифы — в одном продукте.