Сравнения~18 минДенис Карпов

GPT-6 Astra — когда флагман окупается и когда достаточно GPT-6 Sol

Интерфейс GPT-6 Astra с активным computer use на фоне терминала и браузера

3 сентября 2026 года OpenAI выпустила GPT-6 Astra — первую broadly deployed модель компании уровня Critical по внутренней классификации Preparedness. Это флагман семейства GPT-6 с контекстным окном 1.05M токенов, полноценным computer use и reasoning-режимами от low до max. OpenAI называет Astra универсальным инструментом для сложных профессиональных задач — от автоматизации через GUI до глубокой научной работы. Там, где предыдущие модели упирались в потолок архитектуры или политик безопасности. 22 сентября OpenAI добавила в семейство GPT-6 Sol и Luna. Это специализированные варианты для код/агентной нагрузки и высокочастотных запросов. GPT-6 Sol стоит в пять раз дешевле Astra, Luna — в сто раз. Обе поддерживают тот же контекст 1.05M. Это создало развилку: платить за флагман нужно только там, где он даёт измеримое преимущество. Computer use с длинным горизонтом, научные пайплайны через терминал, задачи с высокими требованиями к alignment. Для типового кода или массовой обработки текста средние и дешёвые модели закрывают потребность при кратно меньших затратах. Важная оговорка по цифрам — без неё легко перепутать поколения. Таблицы бенчмарков в анонсе Astra от 3 сентября сравнивают её с GPT-5.6 Sol (предыдущий mid-уровень), а не с GPT-6 Sol. Отдельной полной таблицы GPT-6 Sol в том же анонсе нет. OpenAI говорит, что GPT-6 Sol и Luna переносят advances Astra в более быстрые и дешёвые оболочки. Routing-логика «GPT-6 Sol по умолчанию → Astra на hard» опирается на позиционирование семьи и на дельты против GPT-5.6 Sol. Это ориентир, а не независимый re-run GPT-6 Sol. В каталоге GPThub на момент написания Astra отсутствует — страница /models/gpt-6-astra отдаёт 404. Доступны соседние модели линейки OpenAI: gpt-5-6-terra, gpt-5-6-luna, gpt-5-nano. Попробовать семейство GPT-5.6 можно в чате сервиса. Для GPT-6 Astra на текущий момент нужен прямой доступ через API OpenAI, Azure или Bedrock. Цены — официальная ставка вендора, курс редакции ×100 в ₽ (ориентир для читателя, не курс ЦБ и не тариф хаба). Standard-режим для запросов до 272K токенов: вход 1000 ₽ за миллион, кэш чтения 100 ₽, cache writes 1250 ₽, выход 5000 ₽. Для длинных запросов свыше 272K тарификация удваивается на входе и в полтора раза на выходе — применяется ко всему запросу, не к «хвосту». Batch/Flex short — 500/2500, Fast short — 2000/10000. GPT-6 Sol обходится в 200/1000, Luna — 10/50. Для сравнения list-цен: Anthropic Opus 5.5 — 400/2000, Fable 5.1 — 1000/5000 (та же полка, что Astra). Вызовы инструментов — search, computer use — тарифицируются отдельно за каждый call.

Опубликовано 28 сентября 2026 г.

Зачем читать

Развилка простая: если задача требует взаимодействия с GUI, работы с научными данными уровня FrontierMath, или вы строите агента, который должен удерживать контекст на десятках шагов с минимальным drift — Astra даёт заметный отрыв по таблице OpenAI.

OSWorld 2.0 offline partial: 72.6% против 65.7% у GPT-5.6 Sol при экономии 47% времени (~40 мин против ~75). Terminal-Bench Science: 64.6% против 22.4%. AutomationBench: 41.4% против 18.1%. В этих сценариях разница в цене компенсируется скоростью решения и качеством результата — особенно когда retry и sandbox-часы дороже токенов.

Короткий ответ для занятых: если ваш агент делает GUI-задачу за ~40 минут на Astra против ~75 минут на средней полке — экономия 35 минут sandbox-времени на каждую задачу. На потоке в 100 задач в день это ~58 часов машинного времени, которые не нужно оплачивать и ждать. Если работа — bulk-кодинг без GUI, пятикратная премия к цене GPT-6 Sol не окупается (дельта по FrontierCode Main — 5.8 п.п.). Если профиль — science через терминал или long-horizon computer use, альтернативы по таблице OpenAI нет.

Если задача — кодогенерация без GUI, рефакторинг, код-ревью, массовая обработка документов — модель средней полки закрывает её почти так же. DeepSWE v1.1 против GPT-5.6 Sol: Astra 74.1%, Sol 5.6 72.7% (разница 1.4 п.п.). FrontierCode Main: 53.3% против 47.5%. GPT-6 Sol по цене в пять раз дешевле Astra. OpenAI называет её инструментом именно под сложный код и агентные задачи. Luna — под высокочастотные сценарии, где задержка и пропускная способность важнее абсолютной точности: саппорт, классификация, лёгкий промт-инжиниринг.

Сравнение с Opus 5.5 неоднозначное — и это нормально. Anthropic использует другой harness, другие настройки safeguards, другой effort. По primary Anthropic: Terminal-Bench 4.0 — Opus 5.5 66.4% против 57.9% у Astra; AutomationBench — 40.0% против 41.4%; Terminal-Bench Science — 58.7% против 64.6%; HLE с инструментами — 67.7% против 57.2%. Сводить это к «кто лучше» одной строкой нельзя.

По цене Astra в 2.5 раза дороже Opus 5.5 list (1000/5000 против 400/2000) и стоит ровно как Fable 5.1. Если задача — терминальный кодинг или HLE-подобные экзамены, и бюджет жёсткий, Opus 5.5 на бумаге выглядит рациональнее. Если нужен science через терминал или computer use по таблице OpenAI — у Astra свой козырь.

Где Astra проигрывает без оговорок «но harness другой»: HLE с инструментами (57.2% против 65.0% у Fable 5.1 и 63.8% у Opus 5 в таблице OpenAI), AA CodingAgent Index (67.0 против 68.1 у Opus 5), FrontierCode Main, где Fable 5 обходит Astra (53.5% против 53.3%). «Лучшая модель для software engineering на сегодня» — claim OpenAI, а не арифметика по каждому индексу.

![Сравнение стоимости запроса Astra, GPT-6 Sol, Luna и Opus 5.5 в рублях за миллион токенов](01-cost-table.png)

Что такое GPT-6 Astra

GPT-6 Astra — флагманская модель семейства GPT-6, первая в линейке OpenAI с уровнем Preparedness «Critical». Это означает, что модель прошла расширенный цикл тестирования на cyber-риски, alignment, monitorability и допущена к развёртыванию с дополнительными governance-мерами. В shipping-конфигурации Astra отказывает в advanced offensive cyber-задачах — в том числе в proof-of-concept эксплойтов — и помогает в defender-задачах вроде secure code review и патчинга.

ExploitBench показал 100% в режиме без production-safeguards; в ChatGPT и Codex модель последовательно отклоняет запросы на создание PoC. Bench ≠ prod — это не оговорка мелким шрифтом, а центральный факт анонса.

API-идентификатор — gpt-6-astra. Knowledge cutoff: 30 апреля 2026 года. Контекстное окно 1 050 000 токенов, максимальный вход 922 000, максимальный выход 128 000. Поддержка модальностей: text + image на входе, text на выходе; audio и video не поддерживаются. Fine-tuning не поддерживается.

Доступность: ChatGPT Plus, Pro, Business, Enterprise — rollout «over the coming days» с момента анонса 3 сентября; API OpenAI; Azure OpenAI Service; AWS Bedrock. Точной публичной даты «полностью GA для всех Plus» в changelog этого прохода нет — фиксируем формулировку анонса, без превращения «coming days» в свершившийся факт. В Enterprise Astra по умолчанию отключена на момент запуска: администратор должен явно включить модель. Это связано с уровнем Critical и требованием явного opt-in.

Reasoning-режимы задаются параметром reasoning.effort: low, medium, high, xhigh, max. Режима none нет — в отличие от GPT-6 Sol и Luna, где none доступен. Даже минимальный effort у Astra активирует внутренний chain-of-thought, что влияет на задержку и стоимость.

22 сентября OpenAI выпустила GPT-6 Sol (gpt-6-sol) и GPT-6 Luna (gpt-6-luna). GPT-6 Sol заточена под сложный код и agentic-задачи, Luna — под высокочастотную обработку. Обе имеют контекст 1.05M и максимальный выход 128K. Cutoff: GPT-6 Sol 20 апреля 2026, Luna 18 мая 2026. Effort у GPT-6 Sol и Luna включает none — можно отключить reasoning там, где он не нужен. Astra остаётся «best overall» по формулировке OpenAI.

В семействе GPT-6 нет модели Terra. GPT-5.6 Terra присутствует в каталоге сервисов, но в GPT-6 эта ветка не анонсирована — статус неизвестен, обещать появление нельзя.

![Семейство GPT-6: Astra в центре, Sol и Luna по бокам, схема routing по типу задачи](02-family.png)

Спеки и инструменты

Контекст 1.05M и макс. выход 128K — рабочий запас для агентских сессий с длинным логом действий. Максимальный вход 922K оставляет место под длинный ответ; если задача требует генерации на десятки тысяч токенов, выход всё равно упирается в 128K. Claude Opus 5.5 по своему primary держит контекст 1M при sync-выходе до 128K — то есть по окну Astra и Opus 5.5 на одной полке, а не «Astra в пять раз шире». Сравнивать окна без ссылки на model page конкурента не стоит; здесь достаточно: у Astra окно большое, но не уникальное в классе флагманов 2026 года.

Endpoints: Chat Completions API, Responses API, Batch API. Live API, Realtime API, Assistants API, Embeddings, Images, Videos, Audio — не поддерживаются. Astra не подходит для real-time voice или video; assistant с файловым стейтом придётся собирать обёрткой самостоятельно.

Responses API даёт доступ к инструментам: web_search, file_search, image_generation, code_interpreter, hosted_shell, apply_patch, skills, computer_use, mcp, tool_search. Плюс streaming, structured outputs, function calling, prompt caching. Computer use — ключевая возможность: модель управляет курсором, кликает, вводит текст, читает экран. Hosted shell и apply_patch дают доступ к файловой системе и патчингу кода внутри sandbox. MCP позволяет подключать внешние источники через унифицированный интерфейс.

Каждый вызов инструмента тарифицируется отдельно. Web search, computer use, hosted shell — дополнительная fee per call сверх базовой стоимости токенов. Точные тарифы на tool calls OpenAI публикует в документации API; в базовый прайс 1000/5000 ₽ они не входят.

Prompt caching работает автоматически: совпавший префикс тарифицируется по 100 ₽ за миллион вместо 1000. Cache writes — 1250 ₽ за миллион. Для агентских сценариев, где system prompt не меняется между вызовами, это одна из главных статей экономии.

Rate limits зависят от уровня API-ключа. Бесплатный уровень Astra не поддерживает. Уровень 1: 500 RPM, 500K TPM, Batch 1.5M. Уровень 5: 15K RPM, 40M TPM, Batch 15B. Для production-нагрузки нужен минимум уровня 3 (5K RPM, 2M TPM), чтобы не упираться в throttling при параллельных запросах. Zero Data Retention доступен для eligible API; Private Safety Processing OpenAI тестирует — на момент анонса это не GA-фича.

![Стилизованный JSON Responses API с computer_use и hosted_shell для gpt-6-astra](03-api-json.png)

ПараметрЗначение
Контекст1 050 000 токенов
Макс. вход922 000 токенов
Макс. выход128 000 токенов
Knowledge cutoff30 апреля 2026
Модальностиtext + image → text
Reasoning effortlow / medium / high / xhigh / max
Fine-tuningНе поддерживается
EndpointsChat, Responses, Batch
Tools (Responses API)10 инструментов + streaming / SO / FC / cache
Zero Data RetentionДоступен для eligible API

Computer use и профессиональная работа

Computer use в GPT-6 Astra — полноценное управление десктопным окружением: модель видит экран, двигает курсор, кликает, вводит текст, читает результат. OSWorld 2.0 offline partial — многошаговые задачи в Linux GUI без сети — Astra 72.6% за ~40 минут. GPT-5.6 Sol — 65.7% за ~75 минут. Это не только точность, но и −47% времени. Opus 5 в той же таблице OpenAI — 70.2%: Astra впереди, но не с разгромным отрывом.

В production агент на Astra быстрее завершает задачу и меньше жжёт sandbox — если задача именно GUI.

ScreenSpot-Pro без инструментов — локализация элементов GUI по тексту — Astra 92.7%, GPT-5.6 Sol 76.9%, Fable 5.1 87.3%. Разница заметна для автоматизированного тестирования frontend, где модель ищет кнопку по неточному описанию без доступа к DOM.

AutomationBench — рутинные офисные задачи: формы, CRM, календарь. Astra 41.4%, GPT-5.6 Sol 18.1%, Fable 5.1 31.4%, Opus 5 26.9%. Anthropic в своём первичном разборе AutomationBench запускала без fallback, а срабатывание safeguards считала failure — это занижает score Opus относительно практики. Даже с поправкой на методологию Astra в таблице OpenAI выглядит устойчивее на многошаговых задачах со steering — когда пользователь корректирует действия по ходу.

Agents' Last Exam — удержание цели на длинных цепочках: Astra 59.3%, GPT-5.6 Sol 53.6%, Opus 5 55.5%. Тест на drift: промежуточные решения не должны уводить модель от исходной задачи.

Практические сценарии из анонса OpenAI: формы, CRM, календарь; research с черновиками; научные данные и графики; websites с frontend QA; установка, тестирование, troubleshooting софта. Sites в ChatGPT — Astra собирает лендинг или дашборд, разворачивает и прогоняет базовые сценарии. Модель лучше заполняет пробелы в спецификации: при неполном ТЗ делает разумные предположения вместо остановки.

Async-режим в Codex позволяет Astra работать в фоне, пока разработчик пишет код. Experimental notes across context windows — пометки в контексте для самой себя между сессиями; searchable earlier windows в анонсе заявлены по умолчанию «in the coming weeks» — это roadmap-формулировка, не подтверждённый GA на дату проверки.

Код: OpenAI позиционирует Astra как «лучшую модель для software engineering на сегодня». Terminal-Bench 4.0: Astra 57.9%, GPT-5.6 Sol 37.3%, Fable 5.1 55.8%, Opus 5 52.6%, Gemini 3.8 Flash 19.1%. DeepSWE v1.1 (реальные PR): Astra 74.1%, Sol 5.6 72.7%, Fable 5.1 67.4%, Opus 5 73.7%, Gemini 3.8 Flash 73.8%. FrontierCode 1.1 Main: Astra 53.3%, Sol 5.6 47.5%, Fable 5.1 50.9%, Opus 5 53.4%.

На DeepSWE и FrontierCode Main отрыв от Opus 5 — в зоне шума; на Terminal-Bench 4.0 отрыв от Fable 5.1 — пара пунктов. Громкий claim держится на сумме, не на каждом столбце.

Mind2Web с Codex harness: Astra в связке с Codex выполняет задачи в 1.9 раза быстрее, чем Sol 5.6 (анонс сравнивает со средней полкой предыдущего поколения — GPT-5.6 Sol). Это скорость, не точность: меньше итераций, меньше правок.

![Сравнение AutomationBench и OSWorld 2.0 для Astra, Sol 5.6 и Opus 5 с временем выполнения](04-agent-bench.png)

Бенчмарки: наука, код и оговорки

Начнём с науки — здесь разрыв со средней полкой в таблице OpenAI самый резкий.

FrontierMath T4 v2 — исследовательская математика без паттерн-матчинга по обучающим данным. Astra: 97.6%, в prose анонса около 98%. GPT-5.6 Sol: 83.0%. Fable 5.1: 87.8%. Opus 5: 73.2%. Это не «немного лучше» — почти насыщение бенча. OpenAI сообщает, что Astra помогла улучшить границы для prime gaps; PDF выложен на cdn.openai.com. Когда модель вносит вклад в открытую математическую проблему, это уже не чистый маркетинговый слайд — но и не повод объявлять «ИИ решил теорию чисел».

GPQA Diamond: Astra 96.0%, Sol 5.6 94.6%, Fable и Opus 5 по 93.7%. Потолок у всех флагманов; разница 2–3 п.п. — зона шума переоценки.

ARC-AGI-3: Astra 99.9%, Sol 5.6 7.8%, Opus 5 30.2%. Число Sol 5.6 выглядит как опечатка — это не она: ARC-AGI-3 устроен так, что либо модель ухватила принцип генерации задач, либо нет. Astra ухватила. ARC-AGI-2 ровнее: Astra 95.0%, Sol 5.6 92.5%, Fable 90.0%, Opus 5 90.4%.

Terminal-Bench Science 0.1: Astra 64.6%, Sol 5.6 22.4%, Fable 5.1 52.6%, Opus 5 30.0%. Разрыв со средней полкой почти втрое. Профиль Astra: не «знать физику», а поставить эксперимент, обработать данные, построить график и интерпретировать результат.

HLE с инструментами — место, где Astra проигрывает в таблице OpenAI: 57.2% против 65.0% у Fable 5.1 и 63.8% у Opus 5. HLE — смесь узких доменов; специализированные модели там удерживают преимущество. Сглаживать это «но у неё science» не нужно: на HLE Astra слабее конкурентов по тем же цифрам вендора.

По HealthBench Professional (length-adjusted) в таблице OpenAI: Astra 63.4%, Sol 5.6 60.5%, Fable 5.1 58.1%, Opus 5 56.4%.

По коду. Terminal-Bench 4.0: Astra 57.9%, Fable 5.1 55.8%, Opus 5 52.6%, Sol 5.6 37.3%, Gemini 3.8 Flash 19.1%. DeepSWE: Astra 74.1%, Gemini 3.8 Flash 73.8%, Opus 5 73.7%, Sol 5.6 72.7% — плотная группа. На FrontierCode 1.1 Extended по данным OpenAI Astra 64.5%, Fable 5 64.9%, Fable 5.1 63.6%, Opus 5 63.6%, Sol 5.6 60.6%. На FrontierCode Main — Astra 53.3%, Fable 5 53.5%, Opus 5 53.4%, Fable 5.1 50.9%, Sol 5.6 47.5%. В competitive programming Fable 5 на Main фактически обходит Astra.

AA CodingAgent Index v1.4: Opus 5 68.1, Fable 5 67.2, Astra 67.0, Sol 5.6 65.1, Gemini 3.8 Flash 61.2. Astra в тройке, не первая. Claim OpenAI про best SWE защитим суммой сценариев; по отдельному индексу Opus 5 и Fable держатся не хуже.

Обязательная оговорка. OpenAI запускала Astra на max effort при любых настройках и в research-окружении; в production ChatGPT и API результаты могут отличаться. Max effort — максимум времени на reasoning, самая дорогая и медленная конфигурация. На medium числа будут ниже — насколько, OpenAI не публикует. Часть оценок Claude в таблице OpenAI — с модификациями / Mythos (меньше safeguards); footnotes анонса это признают.

Сверка с Opus 5.5 — primary Anthropic, не таблица OpenAI. Разные harness, effort, safeguards: Anthropic считает срабатывание защиты как failure и запускала AutomationBench без fallback. Цифры для ориентира: Terminal-Bench 4.0 — Opus 5.5 66.4% против 57.9% у Astra; AutomationBench — 40.0% против 41.4%; Terminal-Bench-Science — 58.7% против 64.6%; HLE с инструментами — 67.7% против 57.2%.

Расклад: Opus 5.5 сильнее в терминальном кодинге и HLE; Astra — в science через терминал; в офисной автоматизации почти вровень. Плюс цена: Opus 5.5 list в 2.5 раза дешевле. Единственный корректный вывод — два флагмана сильны в разных местах; выбор по задаче и бюджету, не по одной строчке.

Fable 5.1 на той же ценовой полке, что Astra (1000/5000 ₽). На HLE Fable впереди; на ScreenSpot-Pro и AutomationBench — позади Astra; на Terminal-Bench 4.0 — почти вровень. Платить полку Fable/Astra имеет смысл, когда нужен конкретный профиль (CU / science / alignment у Astra), а не «потому что флагман».

![Сводная таблица science-бенчмарков FrontierMath, ARC-AGI-3, Terminal-Bench Science и HLE](05-science.png)

Цена флагмана и routing GPT-6 Sol / Luna

Astra дорогая. У прайсинга есть неочевидная механика, и без неё легко сжечь бюджет на пороге 272K.

Standard для запросов до 272K входных: 1000 ₽ / 1M вход, 100 ₽ кэш, 1250 ₽ cache writes, 5000 ₽ выход. Long свыше 272K: 2000 / 200 / 2500 / 7500 — long-ставка применяется ко всему запросу, не к части сверх порога. Между 271K и 273K стоимость скачет примерно вдвое. В агентских пайплайнах с длинным контекстом этот порог надо держать в голове.

Batch и Flex short: 500 / 2500 — половина Standard. Fast short: 2000 / 10000 — двойная цена за приоритет. Regional-инференс: +10%. Для GPT-6 в EU residency доступен только Standard processing — комплаенс в EU сужает варианты обработки.

Astra в пять раз дороже GPT-6 Sol по входу и выходу. Luna дешевле GPT-6 Sol ещё в двадцать раз. Все трое делят контекст 1.05M и макс. выход 128K — routing внутри семьи не ломает лимиты пайплайна. Cutoff: GPT-6 Sol 20 апреля 2026, Luna 18 мая 2026, Astra 30 апреля. Effort none есть у GPT-6 Sol и Luna, у Astra — нет: Astra всегда думает хотя бы на low.

Порядок величины для быстрой прикидки бюджета: короткая агентная задача «прочитала 20K входа, сгенерировала 5K выхода» стоит ~45 ₽ на Astra против ~9 ₽ на GPT-6 Sol и ~0,45 ₽ на Luna. Вывод из прикидки тот же, что из таблицы: массовую рутину — вниз по линейке, Astra — точечно на задачи, где retry дороже токенов.

Когда платить за Astra вместо GPT-6 Sol? Когда стоимость ошибки или повторного запуска выше разницы в цене. Если агент на средней полке делает задачу с трёх попыток, а Astra — с одной, экономика выравнивается. OSWorld против GPT-5.6 Sol это иллюстрирует: ~40 мин против ~75. Terminal-Bench Science 64.6% против 22.4% — на научных терминальных задачах средней полки предыдущего поколения просто не конкурент. Обратная сторона: на FrontierCode Main дельта Astra vs GPT-5.6 Sol — 5.8 п.п. при пятикратной цене. Для bulk-кодинга GPT-6 Sol почти всегда рациональнее по позиционированию и цене. Luna — классификация, извлечение, суммаризация на объёме, где 10 ₽ за миллион входных превращают стоимость в копейки.

Практичная схема: Luna на входном потоке → GPT-6 Sol на основной агентской работе → эскалация на Astra по триггеру (не решено за N попыток; science-контекст; computer use с долгим горизонтом; цена ошибки высока). Effort у Astra тоже рычаг routing: не каждая задача заслуживает max. Если бюджет жёсткий и задача ближе к терминальному кодингу / HLE — смотрите ещё Opus 5.5 list: 400/2000 при сильных цифрах Anthropic на этих бенчах.

Лимиты: бесплатный уровень не поддерживается. Уровень 1 — 500 RPM / 500K TPM / Batch 1.5M. Уровень 2 — 5K / 1M / 3M. Уровень 3 — 5K / 2M / 100M. Уровень 4 — 10K / 4M / 200M. Уровень 5 — 15K / 40M / 15B. Batch на уровне 3 — 100M против 2M realtime: ночные прогоны длинных контекстов логичнее гнать через Batch.

Tool fees: web_search, computer use, file_search и остальные — per call отдельно от токенов. В агентских сценариях с десятками вызовов эта строка может догнать токены. Закладывайте её до запуска пайплайна, не после первого инвойса.

![Стоимость одной агентской задачи на Astra, GPT-6 Sol и Luna с учётом попыток и tool fees](06-task-cost.png)

МодельВход ₽/1MВыход ₽/1MРоль
GPT-6 Astra10005000лучший overall, флагман
GPT-6 Sol2001000сложный кодинг и агентские задачи
GPT-6 Luna1050эффективный высокий объём
Opus 5.5 (list)4002000флагман Anthropic, дешевле в 2.5×
Fable 5.1 (list)10005000флагман, паритет по цене с Astra

Critical cyber, safeguards и Daybreak

Разберём без алармизма и без маркетингового тумана.

OpenAI отнесла GPT-6 Astra к Critical Preparedness по cyber — первая broadly deployed модель компании на этом уровне. Capability без production-safeguards: ExploitBench 100% против 78.5% у GPT-5.6 Sol и 70% у Opus 5; ExploitGym 42.4% против 30.3% / 30.4% / 22.0% (Sol 5.6 / Fable 5.1 / Opus 5); ExploitBench Jun–Aug 2026 (после cutoff) 39.0% против 5.5% у Sol 5.6; SRE-Bench (1 attempt) 88.0% против 55.9% / 12.5%; SEC-Bench Pro 85.4% против 79.1%.

Критическая оговорка OpenAI: cyber-показатели — without production safeguards. Bench меряет потолок. Shipping Astra в ChatGPT и API отказывает в advanced cyber, включая PoC, и разрешает defender-задачи: secure code review, патчинг, анализ уязвимостей со стороны защиты. Писать «Astra решает 100% эксплойтов» без этой оговорки — вводить в заблуждение. Примеры отказных промптов приводить не буду: суть в политике, не в рецептах.

Daybreak — управляемая киберзащита: топ-модели, Codex harness, доверенные процессы, партнёры. OpenAI расширяет доступ и снижает ограничения «in the coming weeks» для vulnerability/PoC validation, malware analysis, detection engineering — конкретной даты на 29 сентября 2026 нет. Verified defenders получают приоритетный доступ; заявлена субсидия 1B токенов на 6 месяцев. Логика: если capability такого уровня существует, лучше на синей стороне. Для массового каталога хаба Daybreak — отдельный trusted-контур, не карточка «попробуй в чате».

Alignment против GPT-5.6 Sol. Internal CU safety: 2.4% против 22.0% (Fable 9.5%). С AutoReview — 1.8% против 4.3%. Internal hallucination: 4.2% против 12.2%. «Beyond authorized target» — с 48% у Sol 5.6 до 0% у Astra. Astra ни разу не пыталась обойти отказ Codex Auto-Review. Втрое меньше inaccurate capability claims. По анонсу — примерно вдвое меньше higher-severity misaligned flags на >54k internal Codex tasks; лучше prompt-injection / browsing / workplace safety.

Против джейлбрейков Astra устойчивее Sol 5.6, refusal-порог настраиваемый. Misalignment monitoring включён на всех tool-using инференсах (это заметный compute cost). Auto-review — в ChatGPT и Codex; в API — stop-условия на стороне разработчика.

Честная ложка дёгтя: monitorability ниже, чем у GPT-5.6 Sol. Больше контроля над CoT — в adversarial settings модель может уклоняться от мониторов (sandbagging / sabotage). Steganographic CoT в тестах «not seen», но сам факт проверки говорит о характере риска. Сильнее reasoning — труднее аудит. System card: deploymentsafety.openai.com/gpt-6-astra — читать целиком, не по пересказам, если отвечаете за безопасность в организации.

Для продуктов-агрегаторов следствие простое: жёсткие cyber-refusals режут наступающие сценарии; defender-задачи остаются; Daybreak не равен массовому доступу.

![Схема Daybreak: verified defenders, субсидия токенов и граница bench ≠ prod](07-daybreak.png)

Кому да, кому нет

Честный вердикт без восторгов анонса.

Astra — модель для тех, у кого задачи дороже токенов. Научные вычисления через терминал, computer use с длинным горизонтом, агентские пайплайны с дорогим retry — здесь Astra по таблице OpenAI впереди, и разрыв в Terminal-Bench Science или ARC-AGI-3 не компенсировать дешёвыми попытками на средней полке. FrontierMath T4 на 97.6% — рабочий инструмент research, не витрина.

Но Astra не универсальный апгрейд. В competitive programming Fable 5 держится на равных или впереди. В HLE Astra проигрывает Fable и Opus. В AA CodingAgent Index — не первая. В bulk-кодинге GPT-6 Sol даёт близкий практический результат за 20% цены по позиционированию семьи. Luna закрывает высокий объём за копейки. Opus 5.5 list в 2.5 раза дешевле при сильных цифрах Anthropic на Terminal-Bench 4.0 и HLE. Платить пятикратную премию к GPT-6 Sol за задачи, где дельта к средней полке — несколько пунктов, расточительно.

Про доступность в каталоге сервиса: GPT-6 Astra там пока нет — карточка модели → 404, публичных планов подключения нет. Из OpenAI в живом каталоге — GPT-5.6 Terra, GPT-5.6 Luna и GPT-5 Nano. Если нужен рабочий инструмент OpenAI сегодня — соседи по полке: Terra как более тяжёлый вариант, Luna как mid/cheap. В семье GPT-6 модели Terra нет: 22 сентября анонсировали только GPT-6 Sol и Luna. Когда и появится ли Astra в каталоге — вопрос открытый.

СценарийAstra?Почему
Научные данные, эксперименты, графикиДаTerminal-Bench Science 64.6% vs 22.4% у Sol 5.6
Исследовательская математикаДаFrontierMath T4 97.6%
Computer use, долгие агентские цепочкиДаOSWorld 72.6%, Agents' Last Exam 59.3%
Дорогие production-задачи, где retry дорогДаМеньше попыток, меньше sandbox-времени
Bulk-кодинг, рутинные PRНетGPT-6 Sol: ~20% цены, профиль код/агентный
Массовая классификация и извлечениеНетLuna: 10 ₽/1M входных
Терминальный кодинг / HLE при жёстком бюджетеСкорее Opus 5.5Сильнее в primary Anthropic + дешевле в 2.5×
Competitive programmingСкорее нетFable 5 и Opus 5 на равных или впереди
Тонкий бюджет без эскалацииНетLong ×2, tool fees, нет бесплатного уровня

Вопросы и ответы

Astra или GPT-6 Sol — что брать для агентского кодинга?

GPT-6 Sol, если задачи рутинные и бюджет ограничен: 200/1000 ₽ против 1000/5000. По DeepSWE в таблице OpenAI против GPT-5.6 Sol разница всего 1.4 п.п. — ориентир, не независимый бенч GPT-6 Sol. Astra — если цепочки длинные, задачи разнородные и retry дорогой: Terminal-Bench 4.0 57.9% против 37.3% у Sol 5.6; в Codex harness на Mind2Web Astra быстрее в 1.9 раза. Рабочая схема — GPT-6 Sol по умолчанию, эскалация на Astra по триггеру.

Как Astra сравнивается с Opus 5.5 и Fable 5.1?

По-разному. В primary Anthropic Opus 5.5 впереди в Terminal-Bench 4.0 (66.4% vs 57.9%) и HLE (67.7% vs 57.2%); Astra впереди в Terminal-Bench-Science (64.6% vs 58.7%); почти вровень в AutomationBench. Fable 5.1 на той же цене, что Astra; сильнее на HLE, слабее на ScreenSpot-Pro / AutomationBench. Harness, effort и правила safeguards разные — Anthropic считает срабатывание защиты как failure. Выбор по задаче и бюджету: Opus дешевле в 2.5 раза list; Fable/Astra — одна полка.

Правда, что Astra решает 100% эксплойтов?

ExploitBench — да, 100%, без production safeguards. Shipping Astra отказывает в advanced cyber, включая PoC, и разрешает defender-задачи. Для verified defenders — Daybreak с субсидированными токенами; timing расширения «coming weeks» без конкретной даты. Отождествлять bench с продом — ошибка.

Когда long-тариф выгоднее, чем беспокоиться о пороге 272K?

Long включается автоматически свыше 272K и применяется ко всему запросу: 2000/7500 против 1000/5000. Если контекст стабильно выше 272K — длинные кодовые базы, многошаговые сессии с experimental notes — вы уже в long; оптимизация через кэш стабильного префикса (200 ₽ / 1M кэшированных в long). Если контекст колеблется у порога, trimming до 272K экономит примерно вдвое.

Есть ли GPT-6 Astra в каталоге GPThub?

Нет. На проверке 29 сентября 2026 Astra, GPT-6 Sol и GPT-6 Luna отсутствуют (/models/gpt-6-astra → 404). Из OpenAI в хабе — GPT-5.6 Terra, GPT-5.6 Luna и GPT-5 Nano. Даты добавления Astra никто не называл. Если нужна модель OpenAI сейчас — карточки gpt-5-6-terra и gpt-5-6-luna.

Зачем Critical Preparedness, если в проде PoC всё равно отказывают?

Critical фиксирует capability ceiling и governance: расширенный цикл тестов, opt-in в Enterprise, misalignment monitoring, Daybreak для защитников. Это прозрачность про потолок, а не обещание «в чате можно всё из ExploitBench». Для защитного code review shipping-режим как раз и нужен; для наступающих PoC — отказ.

Связанные модели

Связанные гайды

  • Модель для кода

    Какую модель GPThub взять для багов, ревью и рефакторинга: Flash и Nano, «Плюс» (Luna, GLM, Kimi) или «Про» (Claude, Terra, Grok 4.5).

  • Сравнение моделей

    Как честно сравнить две модели в GPThub: один промпт, критерии, новый чат vs смена модели. Без фейковых «мы лучше всех» и API-рейтингов.

  • Как выбрать модель

    Какую модель взять: текст или картинки, бесплатный тариф, «Плюс» или «Про». Короткая схема выбора и примеры под код, письма и разбор.

Источники

Об авторе

Денис Карпов

Денис Карпов

пишет обзоры и сравнения моделей — что изменилось, критерии, сценарии выбора, без вердикта «X лучше Y»

Собирает модели лицом к лицу: чем отличаются по сценарию, что смотреть в таблице, когда reasoning нужен, а когда нет. Вердикт — по задачам, не по бренду; финал всегда про доступность в GPThub по каталогу, без намёка на партнёрство с вендорами. Бенчмарки — только с датой и ссылкой на первоисточник.

Попробовать GPT-5.6 Terra в чате

Доступ из России без VPN. Модели, гайды и тарифы — в одном продукте.

GPT-6 Astra — когда флагман окупается и когда достаточно GPT-6 Sol — статьи GPThub