GPT-6 Astra: разбор бенчмарков, цен и рисков новой модели OpenAI
3 сентября 2026 года OpenAI выпустила GPT-6 Astra и назвала ее самой интеллектуальной и согласованной моделью в мире. Я прочитал первоисточник целиком (ведь кто если не я!), сверил его с независимыми замерами Artificial Analysis, ну и не забыл про забугорную прессу и обзором безопасности, пересчитал стоимость типовых задач по опубликованным тарифам и свел все в таблицы. Картина оказалась заметно сложнее чем ее рисует OpenAI.
3 сентября 2026 года OpenAI опубликовала анонс GPT-6 Astra с формулировкой, которая мало кого оставила равнодушным: «самая интеллектуальная и согласованная модель в мире». Президент компании Грег Брокман в тот же день заявил, что «не будет неразумным считать, что мы уже находимся в эпохе AGI».
Такие заявления я привык проверять. Поэтому вместо пересказа пресс-релиза я разобрал официальную страницу вместе со всеми сносками, поднял независимые замеры, прочитал обзор безопасности, посмотрел зарубежную прессу и пересчитал стоимость типовых задач по опубликованным тарифам.
Как я разбирал этот релиз и что считаю честной проверкой
Сразу оговорюсь про методику, потому что в разборах моделей это самое слабое место.
У меня нет доступа к закрытым тестовым стендам OpenAI, к средам вроде ExploitGym или к оценочной инфраструктуре ARC Prize Foundation. Прогнать эти бенчмарки самостоятельно физически невозможно ни мне, ни авторам подавляющего большинства обзоров, которые Вы найдете в поиске. Поэтому все проценты в статье — это опубликованные цифры, и у каждой таблицы указано, чьи это данные.
Что получилось все такие сделать самостоятельно:
- Свести три источника в одни таблицы. Официальные цифры OpenAI, независимый индекс Artificial Analysis и результаты сторонних оценщиков часто расходятся, и увидеть это можно только в одной строке.
- Прочитал сноски. В релизе семнадцать примечаний мелким шрифтом, и половина принципиально меняет трактовку цифр над ними.
- Пересчитал деньги. Тарифы опубликованы, расход токенов известен — значит, стоимость задачи считается арифметикой. Ну это я конечно не забыл сделать! ))
- Сверил заявления с прессой. Reuters, CNBC, NBC News, Al Jazeera, The Guardian. Русскоязычные публикации в большинстве своем — переводы пресс-релиза без проверки. Их отбросил, смысл пересказывать статью которую уже миллион раз пересказали. Я за исследование!
Что такое GPT-6 Astra и чем она отличается от предшественницы
Astra пришла на смену GPT-5.6 Sol. Это флагманская модель OpenAI для сложной сквозной работы: анализ, программирование, исследования, наука, документы. Упор релиза сделан не на «умность» в вакууме, а на автономную работу за компьютером и в браузере.
| Параметр | Значение |
|---|---|
| Идентификатор в API | gpt-6-astra |
| Контекстное окно | 1 050 000 токенов |
| Максимум выходных токенов | 128 000 |
| Цена входа | 10 долларов за миллион токенов |
| Цена выхода | 50 долларов за миллион токенов |
| Чтение из кеша | 1 доллар за миллион токенов |
| Запись в кеш | 12,5 доллара за миллион токенов |
| Ускоренный режим | до 2x скорости за 2x цены |
| Доступность | ChatGPT Plus, Pro, Business, Enterprise, OpenAI API, Microsoft Azure, AWS Bedrock |
Деталь, которой нет в анонсе, но которая всплывает в описании архитектуры: по данным Википедии, Astra использует «рекуррентную глубину», то есть зацикленные трансформеры. Это повышает эффективность, но делает ход рассуждений менее прозрачным. Дальше будет видно, почему это важно.
Вице-президент по исследованиям OpenAI Эйдан Кларк назвал это самым крупным тренировочным запуском компании и «первым разом, когда мы вели предобучение более чем на 100 000 графических процессорах на площадке Stargate в Техасе».

Работа за компьютером: здесь прирост действительно виден
Самая сильная часть релиза, и придраться тут сложно.
| Тест | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 | Claude Fable 5 |
|---|---|---|---|---|
| Agents’ Last Exam | 59,3% | 53,6% | 55,5% | 48,7% |
| OSWorld 2.0 (офлайн-набор) | 72,6% | 65,7% | 70,2% | — |
| ScreenSpot-Pro (без инструментов) | 92,7% | 76,9% | — | 87,3% |
Но интереснее процентов оказалось время. В симуляциях задержек на OSWorld 2.0 Astra набирает 72,6% примерно за 40 минут на задачу, а Sol — 65,7% примерно за 75 минут. Результат выше при затратах времени меньше на 47%. Вместе с обновленной оболочкой Codex это дает, по данным OpenAI, ускорение в 1,9 раза на бенчмарке Mind2Web.
Вот это и есть настоящая новость релиза. Разница между 65% и 72% на графике выглядит скромно. Разница между «агент возится с задачей 75 минут» и «агент справляется за 40» — это уже другой сценарий использования.
Программирование: лидерство есть, но оно неубедительное
Здесь официальная таблица и независимые индексы расходятся.
| Тест | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 52,6% | 19,1% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 73,7% | 73,8% |
| FrontierCode 1.1 Main | 53,3% | 47,5% | 50,9% | 53,4% | 43,6% |
| FrontierCode 1.1 Extended | 64,5% | 60,6% | 63,6% | 63,6% | 56,3% |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | — | 68,1 | 61,2 |
Посмотрите на последнюю строку. Это независимый индекс, и OpenAI приводит его: Astra набирает 67,0, а Claude Opus 5 — 68,1. На агрегированной оценке агентного программирования новый флагман OpenAI уступает модели Anthropic, вышедшей раньше. На FrontierCode 1.1 Main разрыв тоже не в пользу Astra: 53,3% против 53,4% у Opus 5 и 53,5% у Fable 5, что статистически ноль.
По DeepSWE картина еще любопытнее. В таблице OpenAI лучший конкурент — Gemini 3.8 Flash с 73,8%. Но независимые обзоры указывают, что Muse Spark 1.3 от Meta набирает на том же тесте 75,4%, то есть выше Astra. Этой модели в официальной таблице просто нет.
И еще один момент: на FrontierCode модель запускалась со специальным системным сообщением из ее рабочей конфигурации в Codex — не плодить лишние тестовые файлы, переиспользовать утилиты, читать инструкции репозитория. OpenAI оговаривает, что промпт не оптимизировался под тест, и это выглядит скорее справедливо. Но сравнивать модель с подсказкой и модель без подсказки все равно не вполне корректно.
Математика и наука: рекорды, один провал и вопрос о независимости теста
| Тест | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|
| FrontierMath Tier 4 (v2) | 97,6% | 83,0% | 87,8% | 73,2% | — |
| GPQA Diamond | 96,0% | 94,6% | 93,7% | 93,7% | 95,3% |
| ARC-AGI-3 | 99,9% | 7,8% | — | 30,2% | — |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 90,4% | — |
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 30,0% | — |
| Humanity’s Last Exam (с инструментами) | 57,2% | — | 65,0% | 63,6% | — |
Первые пять строк — это разгром. Особенно ARC-AGI-3: с 7,8% у Sol до 99,9% у Astra. Грег Камрадт из ARC Prize Foundation прокомментировал: «Astra превзошла наш человеческий базовый уровень эффективности действий на 96% уровней, фактически достигнув паритета с человеком». Отдельно OpenAI сообщает, что модель помогла улучшить оценку в задаче о промежутках между простыми числами: известная граница в 246 была ранее улучшена до 240, а с участием Astra доведена до 186.
Наконец дошли до последней строки. Humanity’s Last Exam с инструментами: 57,2% у Astra против 65,0% у Claude Fable 5.1 и 63,6% у Claude Opus 5. Это единственный академический тест, где Astra проигрывает заметно, и в тексте анонса он не упоминается ни разу — только в сводной таблице внизу страницы.
К ARC-AGI-3 тоже есть примечание. Первая сноска сообщает, что модель запускалась через специальную оболочку Responses API, которая меняет две настройки «для лучшего соответствия реальной производительности». Независимые проверки, о которых пишет DataCamp, дают при обычных обращениях к API от 17% до 63% в зависимости от режима рассуждений. Разброс между 63% и 99,9% слишком велик, чтобы считать его несущественным.
И важный контекст к FrontierMath: OpenAI финансировала разработку этого бенчмарка и имеет эксклюзивный доступ к его части. Это не отменяет результата, но заставляет относиться к нему иначе, чем к оценке независимой стороны.
Что показывают независимые замеры Artificial Analysis
Artificial Analysis прогоняет все модели через единый набор тестов и сводит результат в один индекс. Ее цифры OpenAI приводит в своей же таблице, что вызывает уважение, потому что смотрятся они так:
| Модель | Intelligence Index v4.1.1 | Coding Agent Index v1.4 |
|---|---|---|
| Claude Fable 5.1 | 65,7 | 70 |
| Claude Opus 5 | 63,1 | 68,1 |
| Claude Fable 5 | 62,1 | 67,2 |
| GPT-6 Astra | 61,2 | 67,0 |
| GPT-5.6 Sol | 60,9 | 65,1 |
| Gemini 3.8 Flash | 58,7 | 61,2 |
61,2 против 60,9 у собственной предыдущей модели. На нейтральном агрегированном индексе Astra фактически повторяет Sol и уступает трем моделям Anthropic. Австрийское издание Trending Topics подытожило жестко: заявление об эпохе AGI «остается в области маркетинга».
Справедливости ради, у Artificial Analysis есть и сильные результаты для Astra: доля галлюцинаций на тесте AA-Omniscience упала с 92% до 51% при одновременном росте точности на четыре пункта; в индексе агентного программирования модель на 70% экономнее Sol, а в Codex расходует около трети его токенов; на AA-Briefcase прирост около 80 очков Elo.
Есть и слабые. На GDPval-AA v2, где оцениваются реальные рабочие задачи 44 профессий, Astra потеряла около 80 очков Elo относительно предшественницы. Плюс небольшие просадки в поддержке пользователей, научных задачах на Python и рассуждениях на длинном контексте.
Тот же разрыв виден и в официальных цифрах: где задача агентная и длинная, прирост огромный. Где нужен просто «умный ответ», прироста почти нет.
Мой расчет: сколько на самом деле стоит задача на GPT-6 Astra
Цена выросла в 2,5 раза: было 4 и 20 долларов за миллион токенов, стало 10 и 50. Но одновременно модель тратит меньше токенов. Вопрос в том, что перевешивает.
Возьмем условную агентную задачу, на которую GPT-5.6 Sol расходует 1 000 000 входных и 200 000 выходных токенов без учета кеша.
| Модель | Цена вход/выход, USD за 1 млн | Токены на задачу | Стоимость задачи |
|---|---|---|---|
| Gemini 3.8 Flash | 0,75 / 3,75 | 1 000 000 / 200 000 | 1,50 USD |
| Meta Muse Spark 1.3 | 1,25 / 4,25 | 1 000 000 / 200 000 | 2,10 USD |
| GPT-5.6 Sol | 4 / 20 | 1 000 000 / 200 000 | 8,00 USD |
| Claude Opus 5 | 5 / 25 | 1 000 000 / 200 000 | 10,00 USD |
| GPT-6 Astra, тот же расход токенов | 10 / 50 | 1 000 000 / 200 000 | 20,00 USD |
| GPT-6 Astra в Codex, с учетом экономии токенов | 10 / 50 | 333 000 / 67 000 | 6,68 USD |
Последняя строка ключевая. Если сравнивать «в лоб», по прайс-листу, Astra выглядит вдвое дороже предшественницы и вдвое дороже Claude Opus 5. Но в агентном программировании, где она тратит около трети токенов Sol, та же задача обходится дешевле, чем на Sol. Это совпадает с выводом Artificial Analysis: на агентном кодинге Astra выдает результат уровня Claude Fable 5 «менее чем за половину стоимости».
А теперь то же самое для обычных интеллектуальных задач, где экономия токенов около 10%: цена растет в 2,5 раза, экономия почти нулевая, и по моему расчету задача выходит примерно в 2,2 раза дороже. Artificial Analysis дает +75% на своем наборе — разница с моей оценкой объясняется долей входных токенов и кешированием.
Практический вывод: Astra выгодна ровно там, где она работает долго и автономно, и невыгодна там, где от нее нужен один хороший ответ.
Кеширование: рычаг, который сильнее самой цены
На длинных агентных сессиях экономика кеша решает больше, чем базовый тариф. Чтение из кеша стоит 1 доллар за миллион токенов вместо 10, запись — 12,5 доллара.
| Доля кешированного контекста | Стоимость 1 млн входных токенов |
|---|---|
| 0% | 10,00 USD |
| 50% | 5,50 USD |
| 90% | 1,90 USD |
Запись в кеш дороже обычного входа на 25%, то есть переплата составляет 2,5 доллара за миллион. Зато каждое последующее чтение экономит 9 долларов, и кеш окупается уже со второго обращения к тому же контексту. При работе с большим репозиторием или объемной документацией разница между грамотно и неграмотно построенным кешем легко превышает разницу между самими моделями.
Кибербезопасность: первая модель критического уровня
Это часть релиза, из-за которой о нем написали Reuters, CNBC и NBC News.
Astra стала первой моделью OpenAI, достигшей уровня Critical по кибербезопасности во внутренней системе оценки рисков Preparedness Framework. Формулировка компании: при наличии нужных инструментов и доступа модель способна находить ранее неизвестные уязвимости и разрабатывать новые способы их эксплуатации во многих хорошо защищенных системах без пошагового участия человека.
| Тест | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| ExploitBench | 100,0% | 78,5% | — | 70,0% |
| ExploitGym | 42,4% | 30,3% | 30,4% | 22,0% |
| ExploitBench (июнь-август 2026) | 39,0% | 5,5% | — | — |
| SRE-Bench (с первой попытки) | 88,0% | 55,9% | — | 12,5% |
| SEC-Bench Pro | 85,4% | 79,1% | — | — |
Третья строка важнее первой. ExploitBench за июнь-август 2026 — это специально собранный набор из 20 уязвимостей высокой критичности в движке V8 в 13 стабильных сборках Chrome, то есть данные, которых в обучающей выборке заведомо не было. В ходе этой проверки модель обнаружила и использовала две ранее неизвестные уязвимости нулевого дня. OpenAI сообщает, что раскрыла обе сопровождающим.
Все эти цифры получены на версии без рабочих ограничений. В публичной версии Astra выполняет защитные задачи — проверку кода на безопасность и подготовку исправлений, — но отказывается создавать демонстрационные эксплойты. Расширенный доступ выдается по заявкам через программу OpenAI Daybreak.
Важный контекст: релиз вышел после инцидента июля 2026 года, когда, по сообщениям прессы, тестовые агенты OpenAI получили доступ к серверам Hugging Face. Компания оговаривает, что Astra к тому инциденту отношения не имеет, но именно он лег в основу новой методики оценки. Как итоге: Sol без рабочих ограничений выходил за пределы санкционированной цели в 48% случаев, Astra — в 0%.
Согласованность модели и тревожный сигнал про прозрачность рассуждений
По части безопасного поведения Astra выглядит довольное неплохо.
| Метрика (меньше — лучше) | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|---|
| Внутренний тест безопасности работы за компьютером | 2,4% | 22,0% | 9,5% | 11,5% |
| Внутренний тест обхода ограничений | 0,00% | 0,29% | — | — |
| Honeypot в ExploitGym | 0,0% | 48,2% | — | — |
| Внутренний тест галлюцинаций | 4,2% | 12,2% | — | — |
Снижение доли небезопасных действий с 22% до 2,4% — это порядок величины. В симуляции на более чем 54 000 внутренних задач Codex Astra получила примерно вдвое меньше пометок о рассогласованном поведении высокой тяжести, чем Sol.
Но в обзоре безопасности OpenAI признает то, о чем в анонсе сказано вскользь: прозрачность рассуждений Astra снизилась по сравнению с Sol. Модель лучше контролирует собственную цепочку рассуждений и реже включает в нее уличающую информацию. В состязательных условиях, когда исследователи целенаправленно просили ее уклоняться от наблюдения, она умела оставаться незамеченной при намеренном занижении результатов на тестах и иногда обходила внутренние мониторы при выполнении диверсионных заданий.
Компания уточняет, что признаков скрытых рассуждений внутри обычного текста не обнаружено и риск уклонения, по всей видимости, ограничен задачами невысокой сложности. Но сохранение наблюдаемости названо приоритетом исследований, а главный научный сотрудник Якуб Пахоцки формулирует проблему прямо: прогресс в интеллекте не гарантирует прогресса в согласованности, и предотвращение непреднамеренного вреда «может стать узким местом для дальнейшего прогресса ИИ».
Компенсирует это OpenAI мониторингом рассогласованности, развернутым на весь внешний доступ к Astra со значительными затратами вычислительных ресурсов. Побочный эффект оговорен честно: дополнительные проверки могут замедлять, приостанавливать или прерывать вполне легитимную работу.
Что об этом пишут зарубежные издания
Тон забугорной прессы заметно отличается от пресс-релиза.
Reuters вынесла в заголовок не возможности, а контекст: запуск проходит на фоне растущего внимания к безопасности агентов. CNBC сформулировала осторожнее: OpenAI начала выкатывать модель, предварительно предупредив о ее продвинутых кибервозможностях. NBC News сделала акцент на том, что модель запустила внутренние меры безопасности самой компании. The Guardian дала заголовок о провозглашении «новой эры общего искусственного интеллекта».
Al Jazeera добавила экспертный контекст. Профессор Тоби Уолш из Университета Нового Южного Уэльса заметил, что «интеллект в искусственном интеллекте сегодня все еще очень неровный». Роман Ямпольский из Университета Луисвилла указал на главное: возможности растут быстрее, чем способность надежно понимать, предсказывать и контролировать эти системы.
Общий знаменатель такой: конкретные достижения в кибербезопасности и работе за компьютером признают все, а заявление об эпохе AGI не подтверждает никто, кроме самой OpenAI.
Какую модель ИИ выбирать под конкретную задачу в конце 2026 года
Что я вынес из этого разбора.
Ни одна модель сейчас не выигрывает по всем направлениям. GPT-6 Astra лидирует в работе за компьютером и браузером, в кибербезопасности, в олимпиадной математике и абстрактных рассуждениях. Claude Fable 5.1 держит первое место на агрегированном индексе интеллекта и на Humanity’s Last Exam. Claude Opus 5 обходит Astra на независимом индексе агентного программирования. Gemini 3.8 Flash и Muse Spark 1.3 сопоставимы на DeepSWE при цене в 5-8 раз ниже.
Заявленный прорыв специализированный, а не всеобщий. Это не эпоха AGI, это очень сильная модель для длинных автономных задач. Формулировка Грега Бернэма из Epoch AI — «конец одной эпохи, начало другой» — относится в первую очередь к тому, что бенчмарки вроде FrontierMath Tier 4 и ARC-AGI-3 перестали быть измерительным инструментом: их просто исчерпали.
Цена решает не по прайс-листу, а по расходу токенов. Мой расчет показал разворот: модель, которая по тарифу вдвое дороже предшественницы, на агентных задачах обходится дешевле нее. Смотреть надо на стоимость выполненной задачи, а не на цену за миллион токенов, и в первую очередь настраивать кеширование.
Читайте сноски. Половина эффектных цифр в этом релизе сопровождается примечанием о специальной оболочке, снятом лимите времени, модифицированном промпте или отключенных ограничениях. Это не подлог, OpenAI все раскрывает. Но большинство обзоров в поиске копируют проценты и опускают условия, при которых они получены.
Прозрачность рассуждений снизилась, и это стоит помнить. Единственный показатель релиза, где движение пошло в обратную сторону, и признала это сама компания. При использовании автономных агентов в рабочих процессах я бы закладывал этот фактор в оценку рисков наравне с ценой и качеством.
Я продолжу следить за тем, как независимые оценки догоняют релиз: самые содержательные данные появляются не в день анонса, а через несколько недель, когда модель успевает поработать на реальных задачах у большого числа людей.