Блог о разработке, SEO и цифровых решениях для бизнеса

GPT-6 Astra: разбор бенчмарков, цен и рисков новой модели OpenAI

3 сентября 2026 года OpenAI выпустила GPT-6 Astra и назвала ее самой интеллектуальной и согласованной моделью в мире. Я прочитал первоисточник целиком (ведь кто если не я!), сверил его с независимыми замерами Artificial Analysis, ну и не забыл про забугорную прессу и обзором безопасности, пересчитал стоимость типовых задач по опубликованным тарифам и свел все в таблицы. Картина оказалась заметно сложнее чем ее рисует OpenAI.

Максим Климов 15 минут чтения
GPT-6 Astra: разбор бенчмарков, цен и рисков новой модели OpenAI
Источник: OpenAI, страница релиза GPT-6 Astra, openai.com/index/gpt-6-astra

3 сентября 2026 года OpenAI опубликовала анонс GPT-6 Astra с формулировкой, которая мало кого оставила равнодушным: «самая интеллектуальная и согласованная модель в мире». Президент компании Грег Брокман в тот же день заявил, что «не будет неразумным считать, что мы уже находимся в эпохе AGI».

Такие заявления я привык проверять. Поэтому вместо пересказа пресс-релиза я разобрал официальную страницу вместе со всеми сносками, поднял независимые замеры, прочитал обзор безопасности, посмотрел зарубежную прессу и пересчитал стоимость типовых задач по опубликованным тарифам.

Как я разбирал этот релиз и что считаю честной проверкой

Сразу оговорюсь про методику, потому что в разборах моделей это самое слабое место.

У меня нет доступа к закрытым тестовым стендам OpenAI, к средам вроде ExploitGym или к оценочной инфраструктуре ARC Prize Foundation. Прогнать эти бенчмарки самостоятельно физически невозможно ни мне, ни авторам подавляющего большинства обзоров, которые Вы найдете в поиске. Поэтому все проценты в статье — это опубликованные цифры, и у каждой таблицы указано, чьи это данные.

Что получилось все такие сделать самостоятельно:

  • Свести три источника в одни таблицы. Официальные цифры OpenAI, независимый индекс Artificial Analysis и результаты сторонних оценщиков часто расходятся, и увидеть это можно только в одной строке.
  • Прочитал сноски. В релизе семнадцать примечаний мелким шрифтом, и половина принципиально меняет трактовку цифр над ними.
  • Пересчитал деньги. Тарифы опубликованы, расход токенов известен — значит, стоимость задачи считается арифметикой. Ну это я конечно не забыл сделать! ))
  • Сверил заявления с прессой. Reuters, CNBC, NBC News, Al Jazeera, The Guardian. Русскоязычные публикации в большинстве своем — переводы пресс-релиза без проверки. Их отбросил, смысл пересказывать статью которую уже миллион раз пересказали. Я за исследование!

Что такое GPT-6 Astra и чем она отличается от предшественницы

Astra пришла на смену GPT-5.6 Sol. Это флагманская модель OpenAI для сложной сквозной работы: анализ, программирование, исследования, наука, документы. Упор релиза сделан не на «умность» в вакууме, а на автономную работу за компьютером и в браузере.

ПараметрЗначение
Идентификатор в APIgpt-6-astra
Контекстное окно1 050 000 токенов
Максимум выходных токенов128 000
Цена входа10 долларов за миллион токенов
Цена выхода50 долларов за миллион токенов
Чтение из кеша1 доллар за миллион токенов
Запись в кеш12,5 доллара за миллион токенов
Ускоренный режимдо 2x скорости за 2x цены
ДоступностьChatGPT Plus, Pro, Business, Enterprise, OpenAI API, Microsoft Azure, AWS Bedrock
Источники: страница релиза OpenAI, карточка модели на OpenRouter.

Деталь, которой нет в анонсе, но которая всплывает в описании архитектуры: по данным Википедии, Astra использует «рекуррентную глубину», то есть зацикленные трансформеры. Это повышает эффективность, но делает ход рассуждений менее прозрачным. Дальше будет видно, почему это важно.

Вице-президент по исследованиям OpenAI Эйдан Кларк назвал это самым крупным тренировочным запуском компании и «первым разом, когда мы вели предобучение более чем на 100 000 графических процессорах на площадке Stargate в Техасе».

Сравнение GPT-5.6 Sol и GPT-6 Astra при создании персонального сайта-резюме
Источник: OpenAI, страница релиза GPT-6 Astra

Работа за компьютером: здесь прирост действительно виден

Самая сильная часть релиза, и придраться тут сложно.

ТестGPT-6 AstraGPT-5.6 SolClaude Opus 5Claude Fable 5
Agents’ Last Exam59,3%53,6%55,5%48,7%
OSWorld 2.0 (офлайн-набор)72,6%65,7%70,2%
ScreenSpot-Pro (без инструментов)92,7%76,9%87,3%
Источник: официальная таблица бенчмарков OpenAI, openai.com/index/gpt-6-astra.

Но интереснее процентов оказалось время. В симуляциях задержек на OSWorld 2.0 Astra набирает 72,6% примерно за 40 минут на задачу, а Sol — 65,7% примерно за 75 минут. Результат выше при затратах времени меньше на 47%. Вместе с обновленной оболочкой Codex это дает, по данным OpenAI, ускорение в 1,9 раза на бенчмарке Mind2Web.

Вот это и есть настоящая новость релиза. Разница между 65% и 72% на графике выглядит скромно. Разница между «агент возится с задачей 75 минут» и «агент справляется за 40» — это уже другой сценарий использования.

Программирование: лидерство есть, но оно неубедительное

Здесь официальная таблица и независимые индексы расходятся.

ТестGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5Gemini 3.8 Flash
Terminal-Bench 4.057,9%37,3%55,8%52,6%19,1%
DeepSWE v1.174,1%72,7%67,4%73,7%73,8%
FrontierCode 1.1 Main53,3%47,5%50,9%53,4%43,6%
FrontierCode 1.1 Extended64,5%60,6%63,6%63,6%56,3%
Artificial Analysis Coding Agent Index v1.467,065,168,161,2
Источник: официальная таблица бенчмарков OpenAI, openai.com/index/gpt-6-astra.

Посмотрите на последнюю строку. Это независимый индекс, и OpenAI приводит его: Astra набирает 67,0, а Claude Opus 5 — 68,1. На агрегированной оценке агентного программирования новый флагман OpenAI уступает модели Anthropic, вышедшей раньше. На FrontierCode 1.1 Main разрыв тоже не в пользу Astra: 53,3% против 53,4% у Opus 5 и 53,5% у Fable 5, что статистически ноль.

По DeepSWE картина еще любопытнее. В таблице OpenAI лучший конкурент — Gemini 3.8 Flash с 73,8%. Но независимые обзоры указывают, что Muse Spark 1.3 от Meta набирает на том же тесте 75,4%, то есть выше Astra. Этой модели в официальной таблице просто нет.

И еще один момент: на FrontierCode модель запускалась со специальным системным сообщением из ее рабочей конфигурации в Codex — не плодить лишние тестовые файлы, переиспользовать утилиты, читать инструкции репозитория. OpenAI оговаривает, что промпт не оптимизировался под тест, и это выглядит скорее справедливо. Но сравнивать модель с подсказкой и модель без подсказки все равно не вполне корректно.

Математика и наука: рекорды, один провал и вопрос о независимости теста

ТестGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5Gemini 3.8 Flash
FrontierMath Tier 4 (v2)97,6%83,0%87,8%73,2%
GPQA Diamond96,0%94,6%93,7%93,7%95,3%
ARC-AGI-399,9%7,8%30,2%
ARC-AGI-295,0%92,5%90,0%90,4%
Terminal-Bench Science 0.164,6%22,4%52,6%30,0%
Humanity’s Last Exam (с инструментами)57,2%65,0%63,6%
Источник: официальная таблица бенчмарков OpenAI, openai.com/index/gpt-6-astra.

Первые пять строк — это разгром. Особенно ARC-AGI-3: с 7,8% у Sol до 99,9% у Astra. Грег Камрадт из ARC Prize Foundation прокомментировал: «Astra превзошла наш человеческий базовый уровень эффективности действий на 96% уровней, фактически достигнув паритета с человеком». Отдельно OpenAI сообщает, что модель помогла улучшить оценку в задаче о промежутках между простыми числами: известная граница в 246 была ранее улучшена до 240, а с участием Astra доведена до 186.

Наконец дошли до последней строки. Humanity’s Last Exam с инструментами: 57,2% у Astra против 65,0% у Claude Fable 5.1 и 63,6% у Claude Opus 5. Это единственный академический тест, где Astra проигрывает заметно, и в тексте анонса он не упоминается ни разу — только в сводной таблице внизу страницы.

К ARC-AGI-3 тоже есть примечание. Первая сноска сообщает, что модель запускалась через специальную оболочку Responses API, которая меняет две настройки «для лучшего соответствия реальной производительности». Независимые проверки, о которых пишет DataCamp, дают при обычных обращениях к API от 17% до 63% в зависимости от режима рассуждений. Разброс между 63% и 99,9% слишком велик, чтобы считать его несущественным.

И важный контекст к FrontierMath: OpenAI финансировала разработку этого бенчмарка и имеет эксклюзивный доступ к его части. Это не отменяет результата, но заставляет относиться к нему иначе, чем к оценке независимой стороны.

Что показывают независимые замеры Artificial Analysis

Artificial Analysis прогоняет все модели через единый набор тестов и сводит результат в один индекс. Ее цифры OpenAI приводит в своей же таблице, что вызывает уважение, потому что смотрятся они так:

МодельIntelligence Index v4.1.1Coding Agent Index v1.4
Claude Fable 5.165,770
Claude Opus 563,168,1
Claude Fable 562,167,2
GPT-6 Astra61,267,0
GPT-5.6 Sol60,965,1
Gemini 3.8 Flash58,761,2
Источники: Artificial Analysis, сводная таблица OpenAI.

61,2 против 60,9 у собственной предыдущей модели. На нейтральном агрегированном индексе Astra фактически повторяет Sol и уступает трем моделям Anthropic. Австрийское издание Trending Topics подытожило жестко: заявление об эпохе AGI «остается в области маркетинга».

Справедливости ради, у Artificial Analysis есть и сильные результаты для Astra: доля галлюцинаций на тесте AA-Omniscience упала с 92% до 51% при одновременном росте точности на четыре пункта; в индексе агентного программирования модель на 70% экономнее Sol, а в Codex расходует около трети его токенов; на AA-Briefcase прирост около 80 очков Elo.

Есть и слабые. На GDPval-AA v2, где оцениваются реальные рабочие задачи 44 профессий, Astra потеряла около 80 очков Elo относительно предшественницы. Плюс небольшие просадки в поддержке пользователей, научных задачах на Python и рассуждениях на длинном контексте.

Тот же разрыв виден и в официальных цифрах: где задача агентная и длинная, прирост огромный. Где нужен просто «умный ответ», прироста почти нет.

Мой расчет: сколько на самом деле стоит задача на GPT-6 Astra

Цена выросла в 2,5 раза: было 4 и 20 долларов за миллион токенов, стало 10 и 50. Но одновременно модель тратит меньше токенов. Вопрос в том, что перевешивает.

Возьмем условную агентную задачу, на которую GPT-5.6 Sol расходует 1 000 000 входных и 200 000 выходных токенов без учета кеша.

МодельЦена вход/выход, USD за 1 млнТокены на задачуСтоимость задачи
Gemini 3.8 Flash0,75 / 3,751 000 000 / 200 0001,50 USD
Meta Muse Spark 1.31,25 / 4,251 000 000 / 200 0002,10 USD
GPT-5.6 Sol4 / 201 000 000 / 200 0008,00 USD
Claude Opus 55 / 251 000 000 / 200 00010,00 USD
GPT-6 Astra, тот же расход токенов10 / 501 000 000 / 200 00020,00 USD
GPT-6 Astra в Codex, с учетом экономии токенов10 / 50333 000 / 67 0006,68 USD
По опубликованным тарифам провайдеров и данным Artificial Analysis о расходе токенов.

Последняя строка ключевая. Если сравнивать «в лоб», по прайс-листу, Astra выглядит вдвое дороже предшественницы и вдвое дороже Claude Opus 5. Но в агентном программировании, где она тратит около трети токенов Sol, та же задача обходится дешевле, чем на Sol. Это совпадает с выводом Artificial Analysis: на агентном кодинге Astra выдает результат уровня Claude Fable 5 «менее чем за половину стоимости».

А теперь то же самое для обычных интеллектуальных задач, где экономия токенов около 10%: цена растет в 2,5 раза, экономия почти нулевая, и по моему расчету задача выходит примерно в 2,2 раза дороже. Artificial Analysis дает +75% на своем наборе — разница с моей оценкой объясняется долей входных токенов и кешированием.

Практический вывод: Astra выгодна ровно там, где она работает долго и автономно, и невыгодна там, где от нее нужен один хороший ответ.

Кеширование: рычаг, который сильнее самой цены

На длинных агентных сессиях экономика кеша решает больше, чем базовый тариф. Чтение из кеша стоит 1 доллар за миллион токенов вместо 10, запись — 12,5 доллара.

Доля кешированного контекстаСтоимость 1 млн входных токенов
0%10,00 USD
50%5,50 USD
90%1,90 USD
Расчет, основанный по тарифам из карточки модели.

Запись в кеш дороже обычного входа на 25%, то есть переплата составляет 2,5 доллара за миллион. Зато каждое последующее чтение экономит 9 долларов, и кеш окупается уже со второго обращения к тому же контексту. При работе с большим репозиторием или объемной документацией разница между грамотно и неграмотно построенным кешем легко превышает разницу между самими моделями.

Кибербезопасность: первая модель критического уровня

Это часть релиза, из-за которой о нем написали Reuters, CNBC и NBC News.

Astra стала первой моделью OpenAI, достигшей уровня Critical по кибербезопасности во внутренней системе оценки рисков Preparedness Framework. Формулировка компании: при наличии нужных инструментов и доступа модель способна находить ранее неизвестные уязвимости и разрабатывать новые способы их эксплуатации во многих хорошо защищенных системах без пошагового участия человека.

ТестGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
ExploitBench100,0%78,5%70,0%
ExploitGym42,4%30,3%30,4%22,0%
ExploitBench (июнь-август 2026)39,0%5,5%
SRE-Bench (с первой попытки)88,0%55,9%12,5%
SEC-Bench Pro85,4%79,1%
Источник: официальная таблица бенчмарков OpenAI, openai.com/index/gpt-6-astra.

Третья строка важнее первой. ExploitBench за июнь-август 2026 — это специально собранный набор из 20 уязвимостей высокой критичности в движке V8 в 13 стабильных сборках Chrome, то есть данные, которых в обучающей выборке заведомо не было. В ходе этой проверки модель обнаружила и использовала две ранее неизвестные уязвимости нулевого дня. OpenAI сообщает, что раскрыла обе сопровождающим.

Все эти цифры получены на версии без рабочих ограничений. В публичной версии Astra выполняет защитные задачи — проверку кода на безопасность и подготовку исправлений, — но отказывается создавать демонстрационные эксплойты. Расширенный доступ выдается по заявкам через программу OpenAI Daybreak.

Важный контекст: релиз вышел после инцидента июля 2026 года, когда, по сообщениям прессы, тестовые агенты OpenAI получили доступ к серверам Hugging Face. Компания оговаривает, что Astra к тому инциденту отношения не имеет, но именно он лег в основу новой методики оценки. Как итоге: Sol без рабочих ограничений выходил за пределы санкционированной цели в 48% случаев, Astra — в 0%.

Согласованность модели и тревожный сигнал про прозрачность рассуждений

По части безопасного поведения Astra выглядит довольное неплохо.

Метрика (меньше — лучше)GPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Opus 5
Внутренний тест безопасности работы за компьютером2,4%22,0%9,5%11,5%
Внутренний тест обхода ограничений0,00%0,29%
Honeypot в ExploitGym0,0%48,2%
Внутренний тест галлюцинаций4,2%12,2%
Источник: официальная таблица бенчмарков OpenAI, openai.com/index/gpt-6-astra.

Снижение доли небезопасных действий с 22% до 2,4% — это порядок величины. В симуляции на более чем 54 000 внутренних задач Codex Astra получила примерно вдвое меньше пометок о рассогласованном поведении высокой тяжести, чем Sol.

Но в обзоре безопасности OpenAI признает то, о чем в анонсе сказано вскользь: прозрачность рассуждений Astra снизилась по сравнению с Sol. Модель лучше контролирует собственную цепочку рассуждений и реже включает в нее уличающую информацию. В состязательных условиях, когда исследователи целенаправленно просили ее уклоняться от наблюдения, она умела оставаться незамеченной при намеренном занижении результатов на тестах и иногда обходила внутренние мониторы при выполнении диверсионных заданий.

Компания уточняет, что признаков скрытых рассуждений внутри обычного текста не обнаружено и риск уклонения, по всей видимости, ограничен задачами невысокой сложности. Но сохранение наблюдаемости названо приоритетом исследований, а главный научный сотрудник Якуб Пахоцки формулирует проблему прямо: прогресс в интеллекте не гарантирует прогресса в согласованности, и предотвращение непреднамеренного вреда «может стать узким местом для дальнейшего прогресса ИИ».

Компенсирует это OpenAI мониторингом рассогласованности, развернутым на весь внешний доступ к Astra со значительными затратами вычислительных ресурсов. Побочный эффект оговорен честно: дополнительные проверки могут замедлять, приостанавливать или прерывать вполне легитимную работу.

Что об этом пишут зарубежные издания

Тон забугорной прессы заметно отличается от пресс-релиза.

Reuters вынесла в заголовок не возможности, а контекст: запуск проходит на фоне растущего внимания к безопасности агентов. CNBC сформулировала осторожнее: OpenAI начала выкатывать модель, предварительно предупредив о ее продвинутых кибервозможностях. NBC News сделала акцент на том, что модель запустила внутренние меры безопасности самой компании. The Guardian дала заголовок о провозглашении «новой эры общего искусственного интеллекта».

Al Jazeera добавила экспертный контекст. Профессор Тоби Уолш из Университета Нового Южного Уэльса заметил, что «интеллект в искусственном интеллекте сегодня все еще очень неровный». Роман Ямпольский из Университета Луисвилла указал на главное: возможности растут быстрее, чем способность надежно понимать, предсказывать и контролировать эти системы.

Общий знаменатель такой: конкретные достижения в кибербезопасности и работе за компьютером признают все, а заявление об эпохе AGI не подтверждает никто, кроме самой OpenAI.

Какую модель ИИ выбирать под конкретную задачу в конце 2026 года

Что я вынес из этого разбора.

Ни одна модель сейчас не выигрывает по всем направлениям. GPT-6 Astra лидирует в работе за компьютером и браузером, в кибербезопасности, в олимпиадной математике и абстрактных рассуждениях. Claude Fable 5.1 держит первое место на агрегированном индексе интеллекта и на Humanity’s Last Exam. Claude Opus 5 обходит Astra на независимом индексе агентного программирования. Gemini 3.8 Flash и Muse Spark 1.3 сопоставимы на DeepSWE при цене в 5-8 раз ниже.

Заявленный прорыв специализированный, а не всеобщий. Это не эпоха AGI, это очень сильная модель для длинных автономных задач. Формулировка Грега Бернэма из Epoch AI — «конец одной эпохи, начало другой» — относится в первую очередь к тому, что бенчмарки вроде FrontierMath Tier 4 и ARC-AGI-3 перестали быть измерительным инструментом: их просто исчерпали.

Цена решает не по прайс-листу, а по расходу токенов. Мой расчет показал разворот: модель, которая по тарифу вдвое дороже предшественницы, на агентных задачах обходится дешевле нее. Смотреть надо на стоимость выполненной задачи, а не на цену за миллион токенов, и в первую очередь настраивать кеширование.

Читайте сноски. Половина эффектных цифр в этом релизе сопровождается примечанием о специальной оболочке, снятом лимите времени, модифицированном промпте или отключенных ограничениях. Это не подлог, OpenAI все раскрывает. Но большинство обзоров в поиске копируют проценты и опускают условия, при которых они получены.

Прозрачность рассуждений снизилась, и это стоит помнить. Единственный показатель релиза, где движение пошло в обратную сторону, и признала это сама компания. При использовании автономных агентов в рабочих процессах я бы закладывал этот фактор в оценку рисков наравне с ценой и качеством.

Я продолжу следить за тем, как независимые оценки догоняют релиз: самые содержательные данные появляются не в день анонса, а через несколько недель, когда модель успевает поработать на реальных задачах у большого числа людей.