HarmonyFidelisHarmonyFidelis
ログイン
ニュース主要プロジェクト主要機関アカデミー

GPT-6 Astraはエージェント実行とサイバー能力で大きく前進したが、一般知能が一様に上がったわけではない

Terminal-Bench 4.0はGPT-5.6 Solの37.3%からAstraの57.9%へ上昇し、OpenAIのCyber Critical基準にも到達した。一方、独立評価はharness依存性と一般指数の横ばい、高い価格も示す。

GPT-6 Astraはエージェント実行とサイバー能力で大きく前進したが、一般知能が一様に上がったわけではない

OpenAIは2026年9月3日、computer use、coding、research、長時間のagentic work向けにGPT-6 Astraを公開した。最も明確なdeltaはエージェント実行、tool use、coding効率、cyber能力であり、あらゆる一般知能指標が同じ幅で上がったわけではない。

前後比較

指標Sol / 基準Astra
Terminal-Bench 4.037.3%57.9%
ARC-AGI-3 standard harness—62.7%
ARC-AGI-3 provider adapter—99.9%
行動効率人間中央値96%のlevelで少ないaction
AA Coding Agent Index~6567
AA Intelligence Index6161
API価格$4/$20$10/$50

ARC Prizeはstandard harnessで62.7%、provider adapterで99.9%を測定した。後者はrequest間でopaque reasoning stateを保持する。これは矛盾ではなく、実効agent能力がmodel + state/memory + tools + harnessで決まることを示す。99.9%だけを条件なしで引用するのは不正確である。

OpenAIのTerminal-Bench 4.0はSolの37.3%から57.9%へ上昇した。Artificial Analysisもcoding方向の改善を確認し、Coding Agent Index 67、Codex harnessでは最大effort時にSolの約3分の1のtoken使用量を報告する。ただしtoken単価は2.5倍である。

広いArtificial Analysis Intelligence IndexではAstraもSolも61。tokenはやや効率化したが一般task当たりcostは高く、個別evalには改善と回帰の両方がある。

OpenAIはAstraを初のCyber Criticalモデルと分類した。これはOpenAI内部のPreparedness基準で、外部の普遍的認証ではない。それでもdeployment safeguardsが強化される別の能力領域に入ったことを意味する。

Codexでは長いrunでdurable notesと過去context検索を使い、compactionによる情報損失を減らす。これはsystem-level memoryであり、人間型の持続記憶の証明ではない。System Cardはreasoning表現のcontrollability増加も報告し、monitoring上の新しい課題として扱う。

新しい状態

最も確かな進歩はagentic execution、coding効率、未知環境でのaction efficiency、cyber能力である。独立評価は「すべての一般知能が向上した」「AGIが証明された」という結論を支持しない。

証拠:実運用モデル、OpenAI system card、ARC Prize/Artificial Analysis独立測定。大規模な実世界検証はまだ初期。

Sources: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra