OpenAI a lancé GPT-6 Astra le 3 septembre 2026 comme nouveau modèle frontière pour l’usage d’ordinateur, le code, la recherche et les tâches agentiques longues. Le delta est assez important pour Pulse, mais il ne se résume pas à « GPT-6 est plus intelligent ». Les progrès les plus nets concernent l’exécution agentique, l’efficacité sur les tâches de code/outils et la cybersécurité. Les évaluations indépendantes confirment une partie de ce saut tout en montrant que les performances générales ne progressent pas uniformément.
Avant → après
| Mesure | GPT-5.6 Sol / référence | GPT-6 Astra |
|---|---|---|
| Terminal-Bench 4.0, évaluation OpenAI | 37,3 % | 57,9 % |
| ARC-AGI-3, harness standard ARC Prize | — | 62,7 % |
| ARC-AGI-3, provider adapter | — | 99,9 % |
| Efficacité d’action ARC-AGI-3 | médiane humaine | moins d’actions sur 96 % des niveaux |
| Artificial Analysis Coding Agent Index | ~65 | 67 |
| Artificial Analysis Intelligence Index | 61 | 61 |
| Prix API par million de tokens | $4 / $20 | $10 / $50 |
| Classification cyber OpenAI | sous Critical | Critical |
Cette table montre pourquoi un score unique est trompeur : certaines capacités augmentent fortement alors qu’un indice indépendant agrégé reste inchangé.
L’effet du harness est une partie du résultat
ARC Prize mesure 62,7 % sur ARC-AGI-3 Semi-Private avec son harness standard, mais 99,9 % avec l’adaptateur fournisseur qui conserve un état de raisonnement opaque entre requêtes et permet une continuité plus riche. Les deux valeurs sont réelles dans leurs conditions respectives. Omettre le harness transformerait une mesure conditionnelle en claim universel.
Le résultat révèle un changement important de l’ingénierie des agents : la capacité effective dépend de plus en plus de modèle + mémoire/état + outils + harness. ARC Prize rapporte aussi qu’Astra utilise moins d’actions que l’humain médian sur 96 % des niveaux et construit des représentations symboliques compactes d’environnements nouveaux. Cela soutient une amélioration de l’adaptation dans ce benchmark, pas une preuve d’AGI.
Agents de code : le gain indépendant le plus clair
OpenAI rapporte 57,9 % sur Terminal-Bench 4.0 contre 37,3 % pour Sol. Artificial Analysis observe la même direction avec un Coding Agent Index de 67, environ deux points au-dessus de Sol max. Le gain le plus intéressant est l’efficacité : dans son harness Codex, Astra consomme environ trois fois moins de tokens à effort maximal. Malgré un prix par token 2,5× supérieur, le coût par tâche de code peut donc rester proche de Sol lorsque moins d’itérations sont nécessaires.
Intelligence générale : résultat indépendant mixte
Sur l’Artificial Analysis Intelligence Index, Astra max obtient 61, comme GPT-5.6 Sol. Le modèle utilise environ 10 % de tokens de sortie en moins, mais le prix plus élevé porte le coût par tâche d’environ 75 % au-dessus de Sol sur ce mix général. Certains sous-tests progressent, notamment Humanity’s Last Exam et le travail long horizon AA-Briefcase ; d’autres régressent, dont GDPval-AA v2 et plusieurs évaluations spécialisées. Astra est donc un saut générationnel sur certains axes sans être supérieur partout.
Changement de régime en cybersécurité
OpenAI classe Astra comme son premier modèle au niveau Critical en capacité cyber selon son Preparedness Framework. C’est une classification interne, non une certification universelle indépendante. Elle implique néanmoins un nouveau régime de déploiement : surveillance, isolation et contrôles d’action renforcés. Reuters situe le lancement dans un contexte de scrutiny accru sur la sécurité des agents.
Le point technique n’est pas de détailler des méthodes offensives, mais de constater qu’un agent capable de mener des trajectoires techniques plus longues exige une architecture de confinement différente d’un assistant principalement conversationnel.
Mémoire et longues trajectoires
Un changement public du système Codex est la possibilité de conserver des notes au-delà du remplissage de la fenêtre de contexte et de rechercher les fenêtres antérieures. Conceptuellement :
ancien : long run → compaction → perte de détails → redécouverte
nouveau : long run → notes durables + historique recherchable → reprise d’état
C’est un progrès de mémoire système. Il ne prouve pas une mémoire humaine persistante du modèle de base.
Une limite nouvelle : monitorabilité
Le system card indique qu’Astra contrôle davantage la forme de son raisonnement écrit que GPT-5.6 Sol dans des tests dédiés. OpenAI considère cela comme un problème de monitoring : si la forme du raisonnement est plus manipulable, elle devient un signal de supervision moins fiable. Cela ne démontre pas qu’Astra cache habituellement une intention malveillante ; cela affaiblit une hypothèse de surveillance.
Nouvel état de l’art
Le changement le mieux démontré concerne l’exécution agentique : davantage de tâches terminal réussies, meilleure efficacité d’action en environnement nouveau, gains importants en code et passage à un nouveau niveau de capacité cyber. Les évaluations indépendantes empêchent cependant la conclusion simpliste « tout est meilleur » : l’indice général peut rester plat, certains tests régressent et le coût dépend fortement de l’usage.
Statut de preuve
Modèle déployé · évaluations et system card OpenAI · mesures indépendantes ARC Prize et Artificial Analysis · validation réelle à grande échelle encore précoce.
Aucun benchmark présenté ici n’est traité comme preuve que l’AGI est atteinte.
Sources
- https://openai.com/index/gpt-6-astra/
- https://openai.com/index/safety-overview-gpt-6-astra/
- https://deploymentsafety.openai.com/gpt-6-astra/vision
- https://arcprize.org/blog/astra
- https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra
- https://www.reuters.com/legal/litigation/openai-launches-new-astra-model-amid-growing-scrutiny-over-agents-safety-2026-09-03/