HarmonyFidelisHarmonyFidelis
登录
新闻重大项目主要机构学院

GPT-6 Astra在智能体执行与网络安全上跨越一代,但并非一般智能的全面跃升

Terminal-Bench 4.0从GPT-5.6 Sol的37.3%升至Astra的57.9%,Astra也达到OpenAI的Cyber Critical等级。独立评测确认了智能体效率提升,同时显示harness依赖、总体智能指数持平和更高价格。

GPT-6 Astra在智能体执行与网络安全上跨越一代,但并非一般智能的全面跃升

OpenAI于2026年9月3日发布GPT-6 Astra,面向computer use、coding、research和长周期agent任务。最清楚的delta集中在智能体执行、工具使用、编码效率和网络安全能力,而不是所有一般智能指标同步上升。

前后比较

指标Sol/基线Astra
Terminal-Bench 4.037.3%57.9%
ARC-AGI-3标准harness—62.7%
ARC-AGI-3 provider adapter—99.9%
行动效率人类中位数96%关卡动作更少
AA Coding Agent Index~6567
AA Intelligence Index6161
API价格$4/$20$10/$50

ARC Prize在标准harness下测得62.7%,而在保留请求间opaque reasoning state的provider adapter下测得99.9%。这不是简单矛盾,而是说明前沿agent的有效能力越来越依赖模型 + 状态/记忆接口 + 工具 + harness。脱离条件引用99.9%会造成误导。

OpenAI报告Terminal-Bench 4.0从Sol的37.3%升至57.9%。Artificial Analysis独立评测也确认coding方向的改进:Coding Agent Index为67,最大effort的Codex harness中token使用量约为Sol的三分之一。但Astra的token单价为Sol的2.5倍。

在更广泛的Artificial Analysis Intelligence Index中,Astra和Sol都是61。Astra输出token略少,但一般任务成本更高,而且不同子测试中既有进步也有退步。因此不能把代际升级理解成所有认知维度的统一提升。

OpenAI把Astra列为首个Cyber Critical模型。这是OpenAI内部Preparedness分类,不是外部通用认证,但意味着能力/风险进入需要更强监控和行动控制的新阶段。

Codex还增加durable notes和旧context窗口搜索,减少长任务compaction造成的信息损失。这是系统级记忆,不是基础模型拥有人类式持续记忆的证明。System Card同时显示Astra更能控制书面reasoning的形式,OpenAI将其视为monitorability问题。

新状态

证据最强的变化是agentic execution:更多终端任务成功、更高行动效率、更好的coding agent效率以及新的cyber能力等级。独立数据不支持“所有一般智能都更强”或“benchmark证明AGI”的说法。

证据状态:已部署模型 + OpenAI system card + ARC Prize与Artificial Analysis独立测量;大规模真实世界验证仍早期。

来源: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra