HarmonyFidelisHarmonyFidelis
Войти
НовостиКрупные проектыУчастникиАкадемия

GPT-6 Astra сделал крупный скачок в агентных и кибервозможностях, но не во всех измерениях общего интеллекта

Terminal-Bench 4.0 вырос с 37,3% у GPT-5.6 Sol до 57,9% у Astra; модель также достигла уровня Cyber Critical OpenAI. Независимые оценки подтверждают агентный прогресс, но показывают зависимость от harness, равный Sol общий индекс и более высокую цену.

GPT-6 Astra сделал крупный скачок в агентных и кибервозможностях, но не во всех измерениях общего интеллекта

OpenAI выпустила GPT-6 Astra 3 сентября 2026 года для computer use, coding, исследований и длинных агентных задач. Наиболее убедительный delta относится к агентному выполнению, инструментам, эффективности coding и кибервозможностям, а не к равномерному росту всех показателей общего интеллекта.

До → после

МетрикаSol / базаAstra
Terminal-Bench 4.037,3%57,9%
ARC-AGI-3 standard harness—62,7%
ARC-AGI-3 provider adapter—99,9%
Эффективность действиймедиана человекаменьше действий на 96% уровней
AA Coding Agent Index~6567
AA Intelligence Index6161
Цена API$4/$20$10/$50

ARC Prize измеряет 62,7% со стандартным harness и 99,9% с provider adapter, сохраняющим opaque reasoning state между запросами. Это показывает, что эффективная агентная способность зависит от модели + состояния/памяти + инструментов + harness. Цитировать 99,9% без этого условия было бы некорректно.

OpenAI сообщает 57,9% на Terminal-Bench 4.0 против 37,3% у Sol. Artificial Analysis независимо подтверждает прогресс в coding: индекс 67 и примерно втрое меньше токенов в Codex harness при максимальном effort. Но цена токена Astra в 2,5 раза выше.

На широком Artificial Analysis Intelligence Index Astra и Sol имеют 61. Astra использует немного меньше output tokens, но общая задача обходится дороже; отдельные тесты показывают как рост, так и регрессии.

OpenAI классифицирует Astra как первый Cyber Critical по своему Preparedness Framework. Это внутренняя классификация, не универсальная внешняя сертификация, но она приводит к более сильным safeguards и означает иной режим риска.

В Codex появились durable notes и поиск по предыдущим context windows для уменьшения потери информации при compaction. Это системная память, а не доказательство человеческой постоянной памяти базовой модели. System Card также показывает больший контроль формы письменного reasoning, что усложняет мониторинг.

Новый уровень

Наиболее доказанный скачок — agentic execution: терминальные задачи, coding efficiency, действие в новых средах и cyber capability. Независимые оценки не подтверждают, что Astra лучше во всех измерениях общего интеллекта, и benchmark не доказывает AGI.

Статус доказательств: развернутая модель + system card OpenAI + независимые ARC Prize и Artificial Analysis; широкая реальная репликация еще ранняя.

Источники: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra