OpenAI выпустила GPT-6 Astra 3 сентября 2026 года для computer use, coding, исследований и длинных агентных задач. Наиболее убедительный delta относится к агентному выполнению, инструментам, эффективности coding и кибервозможностям, а не к равномерному росту всех показателей общего интеллекта.
До → после
| Метрика | Sol / база | Astra |
|---|---|---|
| Terminal-Bench 4.0 | 37,3% | 57,9% |
| ARC-AGI-3 standard harness | — | 62,7% |
| ARC-AGI-3 provider adapter | — | 99,9% |
| Эффективность действий | медиана человека | меньше действий на 96% уровней |
| AA Coding Agent Index | ~65 | 67 |
| AA Intelligence Index | 61 | 61 |
| Цена API | $4/$20 | $10/$50 |
ARC Prize измеряет 62,7% со стандартным harness и 99,9% с provider adapter, сохраняющим opaque reasoning state между запросами. Это показывает, что эффективная агентная способность зависит от модели + состояния/памяти + инструментов + harness. Цитировать 99,9% без этого условия было бы некорректно.
OpenAI сообщает 57,9% на Terminal-Bench 4.0 против 37,3% у Sol. Artificial Analysis независимо подтверждает прогресс в coding: индекс 67 и примерно втрое меньше токенов в Codex harness при максимальном effort. Но цена токена Astra в 2,5 раза выше.
На широком Artificial Analysis Intelligence Index Astra и Sol имеют 61. Astra использует немного меньше output tokens, но общая задача обходится дороже; отдельные тесты показывают как рост, так и регрессии.
OpenAI классифицирует Astra как первый Cyber Critical по своему Preparedness Framework. Это внутренняя классификация, не универсальная внешняя сертификация, но она приводит к более сильным safeguards и означает иной режим риска.
В Codex появились durable notes и поиск по предыдущим context windows для уменьшения потери информации при compaction. Это системная память, а не доказательство человеческой постоянной памяти базовой модели. System Card также показывает больший контроль формы письменного reasoning, что усложняет мониторинг.
Новый уровень
Наиболее доказанный скачок — agentic execution: терминальные задачи, coding efficiency, действие в новых средах и cyber capability. Независимые оценки не подтверждают, что Astra лучше во всех измерениях общего интеллекта, и benchmark не доказывает AGI.
Статус доказательств: развернутая модель + system card OpenAI + независимые ARC Prize и Artificial Analysis; широкая реальная репликация еще ранняя.
Источники: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra