OpenAI于2026年9月3日发布GPT-6 Astra,面向computer use、coding、research和长周期agent任务。最清楚的delta集中在智能体执行、工具使用、编码效率和网络安全能力,而不是所有一般智能指标同步上升。
前后比较
| 指标 | Sol/基线 | Astra |
|---|---|---|
| Terminal-Bench 4.0 | 37.3% | 57.9% |
| ARC-AGI-3标准harness | — | 62.7% |
| ARC-AGI-3 provider adapter | — | 99.9% |
| 行动效率 | 人类中位数 | 96%关卡动作更少 |
| AA Coding Agent Index | ~65 | 67 |
| AA Intelligence Index | 61 | 61 |
| API价格 | $4/$20 | $10/$50 |
ARC Prize在标准harness下测得62.7%,而在保留请求间opaque reasoning state的provider adapter下测得99.9%。这不是简单矛盾,而是说明前沿agent的有效能力越来越依赖模型 + 状态/记忆接口 + 工具 + harness。脱离条件引用99.9%会造成误导。
OpenAI报告Terminal-Bench 4.0从Sol的37.3%升至57.9%。Artificial Analysis独立评测也确认coding方向的改进:Coding Agent Index为67,最大effort的Codex harness中token使用量约为Sol的三分之一。但Astra的token单价为Sol的2.5倍。
在更广泛的Artificial Analysis Intelligence Index中,Astra和Sol都是61。Astra输出token略少,但一般任务成本更高,而且不同子测试中既有进步也有退步。因此不能把代际升级理解成所有认知维度的统一提升。
OpenAI把Astra列为首个Cyber Critical模型。这是OpenAI内部Preparedness分类,不是外部通用认证,但意味着能力/风险进入需要更强监控和行动控制的新阶段。
Codex还增加durable notes和旧context窗口搜索,减少长任务compaction造成的信息损失。这是系统级记忆,不是基础模型拥有人类式持续记忆的证明。System Card同时显示Astra更能控制书面reasoning的形式,OpenAI将其视为monitorability问题。
新状态
证据最强的变化是agentic execution:更多终端任务成功、更高行动效率、更好的coding agent效率以及新的cyber能力等级。独立数据不支持“所有一般智能都更强”或“benchmark证明AGI”的说法。
证据状态:已部署模型 + OpenAI system card + ARC Prize与Artificial Analysis独立测量;大规模真实世界验证仍早期。
来源: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra