A OpenAI lançou GPT-6 Astra em 3 de setembro de 2026 para uso de computador, programação, pesquisa e tarefas agentivas longas. O delta mais claro está em execução agentiva, ferramentas e capacidade cyber, não numa melhora uniforme de toda métrica de inteligência.
Antes → depois
| Medida | Sol / referência | Astra |
|---|---|---|
| Terminal-Bench 4.0 | 37,3% | 57,9% |
| ARC-AGI-3 harness padrão | — | 62,7% |
| ARC-AGI-3 provider adapter | — | 99,9% |
| Eficiência de ações | mediana humana | menos ações em 96% dos níveis |
| AA Coding Agent Index | ~65 | 67 |
| AA Intelligence Index | 61 | 61 |
| Preço API | $4/$20 | $10/$50 |
ARC Prize mede 62,7% no harness padrão e 99,9% quando o adaptador preserva estado opaco entre chamadas. Isso mostra que desempenho agentivo é uma propriedade de modelo + memória/estado + ferramentas + harness. O valor 99,9% sem a condição do harness seria enganoso.
OpenAI relata 57,9% no Terminal-Bench 4.0 contra 37,3% do Sol. Artificial Analysis confirma forte ganho em coding: índice 67 e aproximadamente três vezes menos tokens no harness Codex em esforço máximo. O preço por token, porém, é 2,5× maior.
No índice geral de Artificial Analysis, Astra e Sol marcam 61. Há menor uso de tokens, mas maior custo por tarefa geral, além de ganhos e regressões em diferentes avaliações. Portanto o salto não é uniforme.
A OpenAI classifica Astra como seu primeiro modelo Critical em capacidade de cibersegurança. É uma classificação interna de preparedness, não uma certificação universal, mas exige controles de implantação e monitoramento mais fortes.
No Codex, notas persistentes e busca em janelas anteriores reduzem a perda de contexto após compactação. Isso é memória de sistema. O system card também mostra maior controle sobre a forma do raciocínio escrito, o que cria um problema de monitorabilidade.
Novo estado
O progresso melhor demonstrado está em execução agentiva, coding, eficiência de ação e cyber. Os dados independentes não sustentam que Astra seja melhor em toda medida geral nem que qualquer benchmark prove AGI.
Evidência: modelo implantado + system card + ARC Prize e Artificial Analysis independentes; replicação real ampla ainda inicial.
Fontes: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra ; https://openai.com/index/safety-overview-gpt-6-astra/