OpenAIは2026年9月3日、computer use、coding、research、長時間のagentic work向けにGPT-6 Astraを公開した。最も明確なdeltaはエージェント実行、tool use、coding効率、cyber能力であり、あらゆる一般知能指標が同じ幅で上がったわけではない。
前後比較
| 指標 | Sol / 基準 | Astra |
|---|---|---|
| Terminal-Bench 4.0 | 37.3% | 57.9% |
| ARC-AGI-3 standard harness | — | 62.7% |
| ARC-AGI-3 provider adapter | — | 99.9% |
| 行動効率 | 人間中央値 | 96%のlevelで少ないaction |
| AA Coding Agent Index | ~65 | 67 |
| AA Intelligence Index | 61 | 61 |
| API価格 | $4/$20 | $10/$50 |
ARC Prizeはstandard harnessで62.7%、provider adapterで99.9%を測定した。後者はrequest間でopaque reasoning stateを保持する。これは矛盾ではなく、実効agent能力がmodel + state/memory + tools + harnessで決まることを示す。99.9%だけを条件なしで引用するのは不正確である。
OpenAIのTerminal-Bench 4.0はSolの37.3%から57.9%へ上昇した。Artificial Analysisもcoding方向の改善を確認し、Coding Agent Index 67、Codex harnessでは最大effort時にSolの約3分の1のtoken使用量を報告する。ただしtoken単価は2.5倍である。
広いArtificial Analysis Intelligence IndexではAstraもSolも61。tokenはやや効率化したが一般task当たりcostは高く、個別evalには改善と回帰の両方がある。
OpenAIはAstraを初のCyber Criticalモデルと分類した。これはOpenAI内部のPreparedness基準で、外部の普遍的認証ではない。それでもdeployment safeguardsが強化される別の能力領域に入ったことを意味する。
Codexでは長いrunでdurable notesと過去context検索を使い、compactionによる情報損失を減らす。これはsystem-level memoryであり、人間型の持続記憶の証明ではない。System Cardはreasoning表現のcontrollability増加も報告し、monitoring上の新しい課題として扱う。
新しい状態
最も確かな進歩はagentic execution、coding効率、未知環境でのaction efficiency、cyber能力である。独立評価は「すべての一般知能が向上した」「AGIが証明された」という結論を支持しない。
証拠:実運用モデル、OpenAI system card、ARC Prize/Artificial Analysis独立測定。大規模な実世界検証はまだ初期。
Sources: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra