Сравнения~21 минДенис Карпов

Семейство Grok: от 4.3 до 4.7 — бенчмарки и экономика рассуждений

Тёмный горизонт с лаймовой сеткой перспективы

Линейка Grok за 2026 год: 4.3 (дешевле, окно на миллион токенов), 4.5 (уже в чате хаба на тарифе «Про»), 4.6 (предшественник по API) и 4.7 (длиннее горизонт рассуждений при той же ставке за миллион, что у 4.6). Контекст у 4.6 и 4.7 — 500 тысяч токенов; у 4.7 — шкала глубины до максимального уровня и заметно больший расход токенов на сложную задачу. Это гид по семейству: какую ступень брать под задачу, как читать бенчмарки и почему одинаковая ставка не значит одинаковый чек. В каталоге хаба на 23 сентября 2026 есть 4.3 и 4.5; карточки 4.7 нет — её смотрите у вендора.

Опубликовано 24 сентября 2026 г. · обновлено 27 сентября 2026 г.

Зачем читать

Если вы уже на Grok 4.5 в чате хаба или на 4.6 по API, вопрос не «стоит ли гнаться за номером», а где 4.7 стоит в линейке 4.3 → 4.5 → 4.6 → 4.7 и когда переход окупается. Есть три развилки, которые реально бьют по кошельку и процессу.

Первая — горизонт. Анонс прямо пишет: новый более крупная база относительно 4.6, длиннее обучение с подкреплением на усложнённой выборке с уклоном в многочасовые задачи, лучше самопроверка и длинный контекст. Это не про «ещё один ответ в чате», а про задачи, которые живут часами: рефакторинг с критериями готовности, пакет документов, агентный прогон в терминале.

Вторая — цена за задачу, а не за миллион токенов. Artificial Analysis на xhigh замеряет ~81 тысяч токенов ответа на задачу Intelligence Index против ~36–38k у 4.6. Официальная ставка та же, что у 4.6, а чек за прогон может вырасти просто потому, что модель «говорит» больше. Ниже разберём это отдельно — иначе выгода по прайсу выглядит красивее, чем она есть.

Третья — обвязка. В анонсе SpaceXAI говорит, что 4.7 нативно обучена понимать обвязку Grok Bot. Это утверждение вендора. SiliconANGLE в тот же день добавляет картинку «сложную работу можно дробить между несколькими агентами с взаимной проверкой» — но это уже вторичная интерпретация, не текст анонса. Смешивать нельзя: нативное обучение под обвязку ≠ доказанный разделение на несколько агентов как продуктовая фича с первого дня.

Плюс безопасность без маркетингового слайда: анонс бросает цифру «LatchBio 62.4%», а карточка модели уточняет — это отказ на BioSecBench, не общая способность (44.5%). Цифры рядом, смысл разный.

Разбор — про семейство SpaceXAI / xAI: спеки, цены, бенчмарки, безопасность и сравнение ступеней 4.3/4.5/4.6/4.7. В конце — куда смотреть сейчас: соседние Grok в каталоге или вендор снаружи. Карточки 4.7 в меню пока нет.

Ступени линейки: 4.3, 4.5, 4.6, 4.7

Место в линейке SpaceXAI / xAI

Вендор в интерфейсе и в карточке модели — SpaceXAI (торговая марка XAI LLC); xAI и SpaceXAI в документах взаимозаменяемы. идентификатор API: grok-4.7.

Позиционирование анонса короткое и без скромности: «самая мощная модель для кода и работы со знаниями». Рядом в таблице вендора — Grok 4.6, GPT-5.6 Sol Max и Fable 5.1. То есть 4.7 сразу ставят в ряд с верхней полкой рынка, а не в среднюю полку «на каждый день дешевле».

Семейство Grok вокруг этой даты:

— Grok 4.3 — дешевле по официальной ставке, контекст 1M, пакетная скидка 20%; в каталоге хаба на тарифе «Плюс».

— Grok 4.5 — тот же 500k и официальная ставка уровня 4.6, но дешевле кэш; в каталоге на тарифе «Про».

— Grok 4.6 — непосредственный предшественник: та же официальная ставка и контекст, без части усилений 4.7.

— Grok 4.7 — новая более крупная база, более длинное обучение с подкреплением, нативная обвязка Grok Bot, шкала глубины рассуждений до xhigh.

Фон той же недели (не ядро разбора): в September release notes рядом мелькает Grok Voice Transcribe 2.0 — отдельный STT. SiliconANGLE пишет, что 4.7 вышел «менее чем через неделю» после предыдущего шага линейки. Полный разбор транскрибации сюда не тащим.

Дата и доступность — без ложного «уже везде»

Позиция 4.7 в линейке фиксируется датой 21 сентября 2026 — по заголовку и ревизии карточки модели и по прессе (SiliconANGLE, Artificial Analysis, Decrypt). На HTML-странице анонса x.ai календарной даты нет — это пробел первоисточника, не повод придумывать «официальную дату с лендинга».

Слово «общий доступ» на страницах первоисточника анонса и docs не используется. Официальные формулировки — «доступна сегодня» для конкретных поверхностей:

— Cursor — все тарифы;

— Grok Build — по умолчанию;

— xAI API (grok-4.7);

— региональный US-эндпоинт endpoint https://us.api.x.ai/v1;

— надстройки Office для Word, PowerPoint и Excel (карточка модели);

— шлюзы: Vercel, Cloudflare и другие шлюзы из карточки модели; на карточке также Snowflake и Databricks Mosaic.

Веб, мобильные приложения и Grok в X — позже (карточка модели, §1.1). Писать «уже везде» или «полный общий доступ на всех поверхностях» нельзя. Decrypt-заметки в духе «уже в приложении Grok» расходятся с карточкой — в этот обзор как факт продукта не берём.

На практике в первый день доступны три разных трека:

— IDE / agent surfaces — Cursor и Grok Build. Здесь же Fast, здесь же угол нативной обвязки.

— API / шлюзы — прямой grok-4.7, региональный US-эндпоинт, Vercel / Cloudflare и шлюзы из карточки модели (плюс Snowflake и Databricks Mosaic на карточке). Здесь вы сами собираете UX.

— Consumer — позже. Не планируйте внутренний запуск «все сотрудники откроют Grok в X на день релиза 4.7» по мотивам Decrypt.

Первоисточник словом «общий доступ» релиз не маркирует. Статус простой: available на перечисленных поверхностях, consumer — позже.

Спеки без воды

Источники спек — overview и model page.

Knowledge cutoff — два первоисточника, не одно

Здесь расхождение внутри первоисточников, и его нельзя «выбрать удобное»:

— Docs overview: May 2026;

— карточка модели, §1.2: отсечка предобучения — июнь 2026, дополнительные данные до августа 2026.

Пишем оба. Официального «единого» cutoff в одном предложении вендор не дал.

Практические мелочи из docs

Гигиена кэша: в Responses рекомендуют prompt_cache_key, в Chat Completions — x-grok-conv-id. На официальной ставке уровня 4.6 при чтение из кэша это не косметика — это реальные деньги на длинных тредах.

Лимиты model detail — 150 req/s и 50M tokens/min — для большинства команд не потолок. Упираться чаще будете в бюджет и многословие, не в RPM. Regions us-east-1 / us-west-2 / us-central-1 — ориентир размещения, не список «где модель умнее».

В карточке модели отдельно указаны анонимизированные данные рабочих сценариев Cursor. Отсюда ощущение, что модель «знакома» с пайплайнами IDE — не магия, а датасет.

Документы и презентации: анонс отдельно хвалит рост vs 4.6 на GDPval и AA Briefcase (professional работу со знаниями). Ниже увидим цифры AA: Briefcase Elo 1657, GDPval-AA 1695.

Модальности на практике: на вход — текст и картинки, на выход — текст без лимита длины ответа. Скрин UI, схема архитектуры, фото доски с формулами — нормальный вход. Отдельного image-generation в спеках 4.7 этого прогона нет; не ждите «нарисуй логотип» как встроенной возможности этой карточки.

Reasoning effort — не декоративный enum. На low/medium вы экономите токены и время; на high/xhigh покупаете глубину. AA гонял xhigh; многие пики card — тоже xhigh. Если в своём блоге сравните 4.7 medium с чужим max и объявите «слабее рынка» — это ошибка методики, не модели.

ПараметрЗначение
Контекст500 000 токенов
Вход → выходтекст и картинки → текст; длина ответа не ограничена отдельно
Глубина рассужденийнизкий / средний / высокий (по умолчанию) / максимальный (xhigh)
Инструментывызов функций, структурированный ответ, поиск в сети и в X, выполнение кода
APIResponses и Chat Completions; в Responses зашифрованная цепочка рассуждений пишется всегда
Пакетный APIне поддерживается
Лимиты частоты150 запросов в секунду; 50 млн токенов в минуту
Регионы (карточка модели)us-east-1, us-west-2, us-central-1

Цена ступени: ставка, кэш, Fast и региональный эндпоинт

Точные ставки xAI в статье не дублируем. Анонс ставит 4.7 «на уровне 4.6»: на странице вендора строки совпадают. Две колонки промпта — короче 200 тысяч токенов и от 200 тысяч (тариф всего запроса, не «хвост» отдельно).

Контекст у 4.5, 4.6 и 4.7 — 500 тысяч токенов; у 4.3 — миллион. Кэш у 4.5 дешевле, чем у 4.7, при той же ставке входа и выхода: на длинных повторяющихся префиксах 4.5 выгоднее.

Fast — та же модель на более быстрой инфраструктуре, не в публичном API xAI и не на бесплатном тарифе Grok Build. Вендор обещает примерно вдвое большую скорость ответа при примерно вдвое большей цене. Региональный US-эндпоинт даёт надбавку к ставке и на дату обзора доступен для 4.6 и 4.7, не для 4.5.

Пакетной скидки 20% у grok-4.7 нет: модель не в списке пакетного API. Приоритетная обработка — вдвое к стандартной ставке.

Из таблицы анонса Grok: GPT-5.6 Sol Max и Fable 5.1 Max стоят заметно выше средней полки Grok. Это контекст «почему ставка 4.7 выглядит агрессивно», не полный прайс рынка.

Рублёвых пакетов хаба под 4.7 нет: модели в каталоге нет. Пакеты сервиса — Тарифы; живые Grok в меню — карточка модели и карточка модели.

Сценарии на пальцах

Короткий API-чат, промпт короче 200 тысяч, кэш попадается. Здесь выгода средней полки против Sol Max и Fable Max из таблицы анонса ощущается сразу. Стабильный системный префикс — не ленитесь с ключом кэша.

Длинный запрос от 200 тысяч токенов. Тариф всего запроса выше, контекст всё ещё 500 тысяч — это штраф за толстый промпт, не покупка миллиона. Режьте вложения, суммируйте историю.

Интерактив в Cursor или Grok Build, нужна скорость. Fast примерно вдвое дороже и быстрее. На публичном API этой кнопки нет. Если задержка не болит — обычный grok-4.7, не кормите удвоенную цену «на всякий случай».

Региональный US-эндпоинт имеет смысл только если нужна именно эта точка (требования к размещению). Для «просто попробовать» хватает глобального.

Грубый ориентир по расходу, не бенчмарк вендора: эталонная задача Intelligence Index съела около 81 тысяч токенов ответа на 4.7 и около 38 тысяч на 4.6 на максимальном уровне. При одинаковой ставке за миллион выходная часть чека у 4.7 примерно вдвое выше. Добавьте вход и отсутствие пакетной скидки — и «4.7 дешевле 4.6 при той же ставке» на задаче оказывается мифом.

СтупеньОкноОриентир по ставкеГде трогать
4.31Mдешевле средней полки, есть пакетная скидкахаб, тариф «Плюс»
4.5500kкак у 4.6/4.7, кэш дешевлехаб, тариф «Про»
4.6500kкак у 4.7API вендора; в хабе нет
4.7500kкак у 4.6; Fast примерно вдвое дороже и быстрееAPI, Cursor, Grok Build; в хабе нет

Та же ставка, другой горизонт: 4.7 против 4.6

Цена и контекст совпали. Меняется поведение на длинной дистанции.

Анонс SpaceXAI формулирует базу так: новый более крупная база vs 4.6; более длинное обучение с подкреплением на усложнённой выборке с уклоном в многочасовые задачи; лучше самопроверка и длинный контекст; нативное понимание обвязки Grok Bot. Перевод на рабочие сценарии:

— Вы кидаете в Cursor / Grok Build задачу с критериями готовности на час–несколько часов («подними зелёный CI на модуле X», «собери бриф + слайды + таблицу рисков по пакету PDF»).

— Модель не обязана «угадать ответ с первого абзаца» — анонс делает ставку на самопроверку и длинный контекст.

— Обвязка, под которую её учили, — Grok Bot: conversational + работу со знаниями в обвязке вендора, не абстрактный «агент вообще».

На vendor-таблице анонса (effort: Grok 4.7 xHigh vs Grok 4.6 High, DeepSWE\* — high) прирост vs 4.6 виден почти везде:

\* high effort по пометке анонса.

Это цифры вендора. Ниже отдельно — card и AA. Но даже на этом срезе картина ясная: при той же цене 4.7 тянет код, работу со знаниями и агентов заметно дальше 4.6. HealthBench растёт, но всё ещё ниже Sol/Fable в той же таблице — об этом честно в слабых сторонах.

Практический вывод для тех, кто уже на 4.6 по API: миграция id на grok-4.7 при том же бюджете по официальной ставке — низкий порог перехода. Вопрос не «дороже ли миллион», а «не раздует ли многословие чек за задачу» и «нужен ли вам именно Grok Build / обвязка Bot».

Как это выглядит в обычном рабочем дне, без слайдов:

— Утренний рефакторинг модуля с красным CI: 4.6 уже тянул, 4.7 на vendor CursorBench / DeepSWE просто реже «сдаёт» полуготовый дифф. Самопроверка из анонса здесь — не поэзия, а шанс, что модель сама пройдётся по чеклисту «тесты зелёные / линтер чистый / не трогай соседний пакет».

— Пакет из десяти PDF и бриф на слайды: ставка анонса и AA Briefcase / GDPval. Если ваш день — работу со знаниями, а не только git, прирост Elo на Briefcase (+111 vs 4.6 high у AA) важнее ещё одного пункта на абстрактном IQ-индексе.

— Ночной агентный прогон в терминале: Terminal-Bench растёт сильно vs 4.6 (20.3% → 37.6% vendor), но до Fable 57.9% далеко. Не ждите «закрыли терминальный бенч». Ждите «меньше тупых циклов, чем на 4.6».

Шкала глубины рассуждений — отдельный рычаг. По умолчанию высокий; xhigh для тяжёлых прогонов. На card многие пиковые цифры сняты именно на xhigh (CursorBench 46.3%, EEBench 66.0%, Harvey 19.6%). Если гоняете evaluation и сравниваете с чужим «max», смотрите колонку effort — иначе сравните high с чужим max и сделаете ложный вывод.

Метрика4.74.6
CursorBench 4.046.3%40.4%
DeepSWE v1.171.0%*65.2%
EEBench64.0%53.0%
AA Briefcase v1.11 6571 546
Terminal-Bench 4.037.6%20.3%
Harvey Legal Agent19.6%15.8%
HealthBench Professional56.7%48.5%

Почему чек за задачу не равен ставке за миллион

Artificial Analysis оценил Grok 4.7 на xhigh 21 сентября 2026. Ключевой вывод для кошелька: ~81k токенов ответа на задачу Intelligence Index.

Сравнение из материала AA:

— ~81k у 4.7 (xhigh);

— ~36k у 4.6 (high, ключевые выводы) / ~38k у 4.6 (xhigh, body);

— ~27k у GPT-6 Astra (max).

Intelligence Index у 4.7 — 46 (+2 vs 4.6 xhigh 44). Скорость ответа ~188 tok/s на длинных промптах, среднее время на II task ~7.1 min. То есть модель не «тупит медленно» — она много пишет и долго думает в токенах.

Отсюда формула, которую официальный прайс прячет:

Формула, которую строка прайса прячет: ставка средней полки × высокий расход токенов ≠ дешёвый чек за задачу. 4.7 стоит на уровне моделей среднего класса, заметно ниже флагманов вроде Fable; но на максимальном уровне она пишет примерно вдвое больше, чем 4.6.

AA прямо пишет: вне агентной работы со знаниями 4.7 в целом совпадает с 4.6 (high); плюсы на Terminal-Bench 4.0 (+4.5 п.п. в их срезе) и GDP.pdf (+3.0); регрессии на AA-LCR (−3.7) и AutomationBench-AA (−1.1). Высокий расход токенов → цена за задачу может быть выше интуиции от официального прайса.

Отдельно — средняя цена за задачу на CursorBench у SiliconANGLE (вторичный источник; точную цифру здесь не дублируем). Она есть у SiliconANGLE, не в анонсе и не извлечена как точное среднее из PDF card в этом прогоне. Используем только как вторичный источник с пометкой, не как утверждение вендора.

Что делать на практике:

— для коротких ответов и чата официальная ставка уровня 4.6 реально приятна;

— для агентных прогонов на максимальном уровне прогонов закладывайте множитель многословия — сравнивайте не прайс-лист, а чек за эталонный набор задач;

— включайте ключи кэша (prompt_cache_key / x-grok-conv-id), иначе платите полный вход снова и снова;

— если нужна именно низкая задержка, смотрите Fast в Cursor/Build — но помните 2× цену.

Эталонная задача съела около 81 тысяч токенов ответа на 4.7 и около 38 тысяч на 4.6 на максимальном уровне. При одинаковой ставке выходная часть чека у 4.7 примерно вдвое выше. Выгода против более дорогих конкурентов ещё может держаться; «4.7 дешевле 4.6 при той же ставке» на задаче — миф.

Поэтому миграционный чеклист простой: возьмите 10–20 своих реальных задач (не лидерборд), прогоните 4.6 high и 4.7 xhigh с логированием токенов, сравните качество и суммарный чек. Таблица вендора скажет «возможности выросли»; ваш счёт скажет, купили вы это апгрейдом или переплатой за многословие.

Обвязка Grok Bot — это не несколько агентов из прессы

Здесь легко сломать факт.

Что говорит анонс SpaceXAI. Модель нативно обучена понимать обвязку Grok Bot — conversational + работу со знаниями. Рядом доступ с первого дня в Grok Build (по умолчанию) и Cursor. AA код Agent Index на Grok Build: 56 (+9 vs 4.6 xhigh 47), 4-е место среди нативных обвязок в их срезе. DeepSWE на Grok Build у AA — 73% vs 65% у 4.6.

Чего анонс не говорит. Что 4.7 из коробки «делит сложную работу между несколькими AI-агентами с параллелью и взаимной проверкой». Эту расшифровку даёт SiliconANGLE — вторичный источник. В первичных docs этого прогона детальной спеки разделение на несколько агентов нет. Смешивать нативное обучение под обвязку с «анонсом оркестрации нескольких агентов» нельзя.

Практическая рамка для читателя:

— если вы в Grok Build / Cursor — вы как раз на той поверхности, под которую вендор оптимизировал выход с первого дня;

— если вы пишете свой агентный рантайм на API — у вас вызов функций, структурированный ответ, выполнение кода, Responses API; «магия обвязки Bot» автоматически не приедет, пока вы сами не воспроизведёте обвязку;

— надстройки Office Word/PowerPoint/Excel на card — отдельный канал работу со знаниями, не замена Build.

Ещё раз коротко: нативный Grok Bot (анонс) и разделение на несколько агентов (SiliconANGLE) — разные утверждения. В обзоре держим первое как primary claim, второе как чужой пересказ.

Для команд, которые уже собрали своего агента на Responses API: зашифрованная цепочка рассуждений в Responses приходит всегда. Это удобно для трассировки «что модель думала», но не превращает ваш оркестратор в Grok Bot. Function calling, структурированный ответ, web/X search, выполнение кода — строительные блоки; нативная обвязка — про то, как SpaceXAI их склеивает у себя в Bot/Build. AA код Agent Index 56 на Grok Build как раз про нативную обвязку, не про ваш самописный YAML.

Office add-ins (Word / PowerPoint / Excel) на card — третий канал. Если работу со знаниями у вас живёт в документах Office, а не в репозитории, это ближе к Briefcase/GDPval-углу, чем к Terminal-Bench. Не ждите от add-in чудес агентного CI — ждите помощи с длинным документом и аккуратной самопроверкой черновика.

Типичный день в Cursor на 4.7, если верить сочетанию анонса и supplemental Cursor данные рабочих сценариев из card: модель видела анонимизированные IDE-траектории, поэтому меньше «гаданий», как устроен diff/apply цикл. Вы даёте задачу с явными критериями готовности, оставляете effort high/xhigh на сложных кусках, на рутине можно опустить. Fast включаете, когда ждёте в редакторе, а не когда крутите ночной прогон из CI. Это не обещание zero-shot зелёного CI на любом монорепо — Terminal-Bench и FrontierSWE (29% xhigh на card) напоминают потолок.

Бенчмарки — три полки, без слияния

Правило досье: вендор / карточка модели / AA — раздельные блоки. Расходящиеся цифры пишем с оговоркой.

Бенчмарки A: таблица вендора анонса

Источник: x.ai/news/grok-4-7. Колонки effort: 4.7 xHigh vs 4.6 High.

\* high effort.

Safety в тексте анонса (без уточнений card): LatchBio «biosafety» 62.4%; HackerBench v0.3 — 3.3% рискованных сценариев двойного назначения. На карточке модели те же 62.4% — это отказ на BioSecBench (xhigh), не общая способность (44.5%). Полный разбор отказа и Capabilities — в блоке про безопасность ниже: «biosafety 62.4%» без этой пометки читать нельзя.

Что бросается в глаза на vendor-срезе: Harvey Legal — лидер таблицы; EEBench сильно выше Sol/Fable в анонсе; Terminal-Bench и CursorBench всё ещё ниже Fable; HealthBench — не лидер.

Читать таблица вендора как «мы лучшие во всём» нельзя — сама таблица этого не говорит. DeepSWE 71.0%* почти догоняет Sol 72.7% и чуть выше Fable 70.0%. CursorBench 46.3% — выше Sol 41.7% и 4.6, но ниже Fable 51.8%. Briefcase 1657 — чуть ниже Fable 1678. Картина «сильная модель верхнего уровня при прайсе средней полки», не «убили верхнюю полку».

Отдельная ловушка сравнения: колонка 4.7 часто xHigh, колонка 4.6 — High. Это не спрятано — так размечена страница анонса. Честное «на сколько выросли относительно 4.6» на card смотрите ещё и в срезах high↔high / xhigh↔xhigh (EEBench 4.6 xhigh 60.0% → 4.7 xhigh 66.0%; 4.6 high 53.0% в анонсе рядом с 4.7 64.0% — разные усилия).

МетрикаGrok 4.7Grok 4.6GPT-5.6 SolFable 5.1
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11 6571 5461 4871 678
Terminal-Bench 4.037.6%20.3%37.3%57.9%
Harvey Legal Agent19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

Бенчмарки B: карточка модели

Источник: 4p7card PDF, 21 Sep 2026.

Оговорка EEBench: анонс 64.0%, card 66.0% xhigh. Не сводить. Astra 69.3% есть именно на card.

Оговорка Terminal-Bench: анонс 37.6%, card 38.0% (xhigh, Grok Build). AA ниже даёт ещё одно число.

МетрикаGrok 4.7Effort / обвязкаСравнение на card
CursorBench 4.046.3% / 43.9%xhigh / high—
DeepSWE v1.171.0%high (mini-SWE-agent)Sol max 72.7%; 4.6 high 65.2%
Terminal-Bench 4.038.0%xhigh, Grok Build4.6 high 20.3%; Fable 5.1 max 57.9%
FrontierSWE V229.0%xhigh4.6 xhigh 25.3%; Fable 5.1 max 56.3%
SWE-Marathon v1.146.0%highOpus 5 max 50.0%; 4.6 high 31.9%
Harvey Legal19.6%xhigh4.6 high 15.8%
EEBench66.0%xhigh, Grok BuildGPT-6 Astra max 69.3%; Opus 5 max 61.6%; 4.6 xhigh 60.0%; 4.6 high 53.0%
CADGenBench44.4%high, Grok Build4.6 high 40.9%
HealthBench Professional56.7%xhighAstra max 63.4%; Fable 5.1 62.1%; Sol 60.5%; 4.6 xhigh 48.5%
LatchBio Capabilities v1.044.5%xhighAstra max 47.4%; 4.6 high 43.3%

Бенчмарки C: Artificial Analysis

Источник: benchmarking-grok-4-7, оценка на xhigh.

Три числа Terminal-Bench рядом: vendor 37.6%, card 38.0%, AA Grok Build 33%. Причины (effort / обвязка / округление) вендор одним абзацем не свёл — честно держим все три.

AA отдельно отмечает: вне агентной работы со знаниями Grok 4.7 в целом совпадает с 4.6 (high). То есть если ваш день — короткие Q&A и лёгкий код без обвязки, прирост может быть скромным, а расход токенов — нет. Плюсы в их срезе сидят на Terminal-Bench 4.0 и GDP.pdf; минусы — AA-LCR (−3.7) и AutomationBench-AA (−1.1). Hallucination Rate на AA-Omniscience улучшился (29% vs 34% у 4.6 high), accuracy почти та же (47% vs 48%), Omniscience Index 32 vs 30. Перевод: чуть меньше галлюцинаций при сопоставимой точности — не «модель вдруг всё знает».

Скорость ответа ~188 tok/s на длинных промптах выглядит бодро, пока не вспомните среднее ~7.1 min на II task. Токены летят быстро; задач много. Для интерактива в IDE это сочетается с Fast-тарифом; для batch-подобных ночных прогонов Пакетный API всё равно нет — крутите свой очередиватель.

МетрикаGrok 4.7 (xhigh)Примечание
Intelligence Index46+2 vs 4.6 (xhigh 44)
AA-Briefcase Elo1657+111 vs 4.6 (high); чуть позади Opus 5 / Fable 5.1
GDPval-AA Elo1695vs 1605 у 4.6 (high); +90
код Agent Index (Grok Build)56+9 vs 4.6 xhigh (47)
DeepSWE (Grok Build)73%vs 65% у 4.6
Terminal-Bench 4.0 (Grok Build)33%vs 18% у 4.6 — отдельно от vendor 37.6% / card 38.0%
SWE-Atlas-QnA (Grok Build)63%vs 58%
AA-Omniscience Hallucination Rate29%vs 34% у 4.6 (high); accuracy 47% vs 48%; Omniscience Index 32 vs 30

Как выбрать ступень: 4.3, 4.5, 4.6 или 4.7

Vs Grok 4.6

Та же официальная ставка, тот же 500k. 4.7 выигрывает на vendor код, работу со знаниями и агентов и на AA Briefcase/GDPval. Появляется задокументированный Fast в Cursor/Build. Появляется (или усиливается в docs) шкала глубины до xhigh. Минус: AA расход токенов выше; Batch по-прежнему нет. Если вы уже на 4.6 в API — переключение низкое по цене, высокое по проверке реальных чеков.

Vs Grok 4.5

Тот же 500k и официальная ставка уровня 4.6. Но:

— cache у 4.5 дешевле (более низкая cache-ставка vs cache-ставка 4.7);

— у 4.5 в release notes нет xhigh;

— 4.5 не в паре регионального US-эндпоинта (там 4.6 и 4.7);

— 4.5 уже в каталоге хаба на Про — 4.7 нет.

Если вам нужен «Grok в одном чате с другими моделями» прямо сейчас — это 4.5 (или 4.3). Если нужен именно длинный горизонт / обвязка Bot / xhigh на API — смотрите 4.7 снаружи.

Vs Grok 4.3

Другой класс сделки:

— контекст 1M у 4.3 vs 500k у 4.7;

— официальная ставка ниже vs средней полки 4.6/4.7;

— пакетная скидка 20% vs не поддерживается;

— в каталоге хаба 4.3 есть на Плюс.

4.3 — про дешевле и шире окно. 4.7 — про capability/agents на верхней полке по возможностям при прайсе средней полки. Путать «старший номер всегда лучше для всего» не надо: на длинных корпусах документов 1M у 4.3 может быть решающим, даже если CursorBench ниже.

Шпаргалка выбора внутри семейства, без каталожного давления:

Номера версий — не рейтинг «для всего». Это разные сделки.

НужноСкорее
Ниже официальная ставка + batch + 1M контекст4.3
Уже в чате хаба, cache подешевле, 500k4.5
Та же официальная ставка, уже сидите на API, без Bot-угла4.6 ещё жив
Длинный горизонт, xhigh, Build/Bot, паре регионального US-эндпоинта4.7 снаружи
«Просто потыкать Grok рядом с Claude/GPT в одном UI»4.3 / 4.5 в каталоге, не 4.7

Безопасность без маркетинга

В анонсе мелькает круглая фраза про LatchBio 62.4%. Карточка модели раскладывает полку иначе.

отказ ≠ Capabilities

Итого одной фразой: 62.4% — отказ на BioSecBench, общая способность — 44.5%. Писать «biosafety 62.4%» без уточнения — искажение.

HackerBench: анонс «3.3%» совпадает с high 3.31%; на xhigh card даёт 4.02% (меньше — лучше — то есть на xhigh двойного назначения compliance чуть хуже high). Benign refusal почти в нуле — модель не отказывается от безобидного ради перестраховки.

Cyber capability без продакшен-ограничений (CyberGym Mean Reproduced) у 4.7 high — 80.3% рядом с 4.6 (79.7%) и 4.5 (79.0%). То есть «умеет» в eval и «не отдаёт вредное в проде» — разные оси; card их разделяет.

Ограничения использования из card: политика допустимого использования + Consumer/Enterprise ToS; модель не для автономных высоких ставок решений (medicine, law, finance, критичных для безопасности) без контроль человека. FAIF упомянут для bio/chem thresholds. Отдельной публичной open license весов в источниках этого прогона нет — API/product terms, не открытые веса.

По приглашению red-team cyber для избранных партнёров — утверждение анонса + card; деталей публичного отчёта в досье нет, не домысливаем.

Что это значит для обычного продукта, без security-театра:

— Если вы строите ассистента с доступом к инструментам, смотрите compliance двойного назначения (HackerBench) и jailbreak-цифры — там 4.7 на high выглядит аккуратнее 4.5/4.6.

— Если вы оцениваете «насколько модель вообще умеет опасное в unrestricted eval», CyberGym ~80% и CathedralBench hard 29% (xhigh) напоминают: capability в лаборатории ≠ то, что должно уходить пользователю. Card разделяет эти оси; маркетинг иногда сливает.

— Bio: не цитируйте 62.4% как «модель на 62% безопасна по био». Цитируйте отказ. общая способность 44.5% — про другое измерение того же семейства бенчей LatchBio.

— High-stakes (медицина, право, финансы, критичных для безопасности): card прямо просит контроль человека. Harvey 19.6% — про агентный legal-бенч в таблице, не про лицензию юриста.

Метрика4.54.64.7Примечание
отказ на BioSecBench—45.6% (high)62.4% (xhigh)Это отказ, не «biosafety overall»
BioSecBench Surveillance—48.0%48.0% (xhigh)—
BioSecBench Function—39.9%43.3% (xhigh)—
LatchBio общая способность—43.3% (high)44.5% (xhigh)Не путать с отказ 62.4%
HackerBench Harmful/Dual-Use Compliance7.8% (high)5.93% (high)3.31% (high) / 4.02% (xhigh)меньше — лучше; анонс «3.3%» ≈ high
HackerBench Benign отказ0.0%0.0%0.00% (xhigh) / 0.31% (high)меньше — лучше
Standard jailbreaks compliance0.73%0.04%0.01%меньше — лучше
StrongReject compliance1.5%3.9%2.0%меньше — лучше
Long-horizon jailbreaks—1.0%0.65%меньше — лучше
MASK-Rectified Dishonesty0.67%1.90%0.00%меньше — лучше
Child safety compliance0.0%0.0%0.0%меньше — лучше

Что есть в хабе, а чего нет

Проверка 23 сентября 2026 по каталогу: в списке есть Grok 4.3 (тариф «Плюс») и Grok 4.5 (тариф «Про»); 4.6 и 4.7 нет. Прямая страница 4.7 отдаёт 404.

Это гид по семейству и спутник к будущей карточке, не анонс «уже можно кликнуть в меню». Кнопка «попробуй 4.7 у нас» здесь была бы ложью. Честный выход — соседние Grok в каталоге или вендор (API, Cursor, Grok Build).

Живые карточки: карточка модели и карточка модели. Пакеты хаба — Тарифы. Рублей, частоты запросов и лимитов хаба под 4.7 в открытых цифрах нет. Будет ли карточка — вопрос к продукту, не к этому разбору.

Кому да / кому нет

Да — если

— Пишете агентные и конвейеры разработки на xAI API, Cursor или Grok Build и хотите ту же официальную ставку уровня 4.6 при заявленном росте vs 4.6.

— Нужен xhigh, паре регионального US-эндпоинта, надстройки Office или нативный уклон в Grok Bot / Build.

— Legal-agent сценарии важны: Harvey 19.6% — лидер vendor-таблицы анонса.

— Professional работу со знаниями (Briefcase / GDPval по AA) важнее «короткого чата».

— Готовы мерить чек за задачу, а не только ставку за миллион токенов, и крутить cache keys.

Нет / пока нет — если

— Ждёте модель уже в Grok app / X — карточка модели говорит «позже». Roadmap из Decrypt про следующие номера линейки сюда же: это не наличие 4.7 в обычных приложениях и не факт продукта.

— Нужен «Grok в каталоге хаба прямо сейчас» — берите 4.5 (Про) или 4.3 (Плюс); 4.7 там нет.

— Живёте на длинных кэшируемых префиксах и хотите минимальный ставка за чтение кэша — у 4.5 cache дешевле.

— Нужен контекст 1M и batch discount — смотрите 4.3, не 4.7.

— Сравниваете только официальную ставку и игнорируете многословие — AA ~81k tok/II task может съесть преимущество.

— Нужен Пакетный API 20% off — у 4.7 не поддерживается.

— Ищете открытые веса — в источниках этого прогона их нет.

Ещё один честный фильтр: если ваш KPI — «ответ за две секунды в клиентском чате», 4.7 xhigh с ~7.1 min на II task у AA — не ваш профиль. Для такого чаще берут более лёгкую модель или Fast осознанно, понимая 2× цену. 4.7 заточен под трудные длинные задачи, не под спиннер в саппорт-виджете.

Слабые места, которые не замазываем

— Terminal-Bench: vendor 37.6% / card 38.0% — далеко от Fable 57.9%; AA Build ещё ниже (33%).

— CursorBench 46.3% ниже Fable 51.8% (vendor).

— HealthBench 56.7% ниже Sol / Fable / Astra в соответствующих таблицах.

— Fast недоступен на public API.

— Потребительские приложения ещё закрыты.

Куда идти сейчас

Пока карточки Grok 4.7 нет, схема по линейке простая: соседние 4.3 и 4.5 — в каталоге; саму 4.7 — у вендора через API, Cursor или Grok Build. Сверяйте чек за свои задачи, а не только строку прайса. Когда и если 4.7 появится в меню — к разбору можно добавить живой прогон рядом с соседями. До тех пор это текст про модели SpaceXAI / xAI, не про кнопку, которой нет.

Коротко

  • Grok 4.7 (21 сентября 2026) держит ту же ставку средней полки и те же 500 тысяч токенов, что у 4.6, но длиннее горизонт рассуждений, максимальный уровень усилия и нативную обвязку Grok Bot.
  • По Artificial Analysis расход токенов ответа на задачу Intelligence Index у 4.7 примерно вдвое выше, чем у 4.6. Одинаковая ставка за миллион не значит одинаковый чек за задачу.
  • С первого дня 4.7 доступна в API, Cursor, Grok Build, на региональном US-эндпоинте и в надстройках Office; веб, приложения и Grok в X — позже.
  • В каталоге хаба на дату обзора 4.7 нет; живые соседи — Grok 4.3 и Grok 4.5.
  • Цифра «LatchBio 62.4%» из анонса — это отказ на BioSecBench, не общая способность (44.5%).

Вопросы и ответы

Есть ли Grok 4.7 в каталоге хаба?

Нет. На дату проверки 23 сентября 2026 прямой страницы нет. В каталоге есть /models/grok-4-3 (тариф «Плюс») и /models/grok-4-5 (тариф «Про»). Саму 4.7 смотрите у xAI: API, Cursor, Grok Build.

Чем Grok 4.7 отличается от 4.6 при той же официальной ставке?

Новая, более крупная база, более длинное обучение с подкреплением на многочасовых задачах, лучше самопроверка, нативная обвязка Grok Bot, шкала глубины до максимального уровня, Fast в Cursor и Grok Build. Контекст и ставка — как у 4.6; расход токенов на задачу по Artificial Analysis выше.

Почему «та же цена», а чек может вырасти?

Официальная ставка — за миллион токенов. Artificial Analysis на максимальном уровне замеряет около 81 тысяч токенов ответа на задачу Intelligence Index против примерно 36–38 тысяч у 4.6. Дешёвая ставка, умноженная на высокий расход, не даёт дешёвый чек за задачу. Сверяйте свои логи.

Кому брать 4.3 или 4.5 вместо 4.7?

Нужен Grok уже в чате хаба — 4.3 или 4.5. Нужен миллион токенов контекста и пакетная скидка — 4.3. Живёте на длинном кэше и хотите минимальную ставку за чтение кэша — 4.5. Нужен длинный горизонт, обвязка Bot и максимальный уровень на API — 4.7 снаружи.

Что не так с цифрой «biosafety 62.4%»?

В анонсе мелькает LatchBio 62.4%; карточка модели уточняет: это отказ на BioSecBench, не общая способность (44.5%). Цитировать «безопасность по био 62.4%» без пометки отказ — искажение.

Связанные модели

Связанные гайды

  • Модель для кода

    Какую модель GPThub взять для багов, ревью и рефакторинга: Flash и Nano, «Плюс» (Luna, GLM, Kimi) или «Про» (Claude, Terra, Grok 4.5).

  • Сравнение моделей

    Как честно сравнить две модели в GPThub: один промпт, критерии, новый чат vs смена модели. Без фейковых «мы лучше всех» и API-рейтингов.

  • Как выбрать модель

    Какую модель взять: текст или картинки, бесплатный тариф, «Плюс» или «Про». Короткая схема выбора и примеры под код, письма и разбор.

Ещё по теме

Источники

Об авторе

Денис Карпов

Денис Карпов

пишет обзоры и сравнения моделей — что изменилось, критерии, сценарии выбора, без вердикта «X лучше Y»

Собирает модели лицом к лицу: чем отличаются по сценарию, что смотреть в таблице, когда reasoning нужен, а когда нет. Вердикт — по задачам, не по бренду; финал всегда про доступность в GPThub по каталогу, без намёка на партнёрство с вендорами. Бенчмарки — только с датой и ссылкой на первоисточник.

Открыть чат с Grok 4.5

Доступ из России без VPN. Модели, гайды и тарифы — в одном продукте.