HarmonyFidelisHarmonyFidelis
Entrar
NotíciasGrandes projetosAtoresAcademia

GPT-6 Astra dá um salto em agentes e cibersegurança, não uma alta uniforme de inteligência geral

Astra sobe Terminal-Bench 4.0 de 37,3% para 57,9% contra GPT-5.6 Sol e atinge o nível cyber Critical da OpenAI. ARC Prize e Artificial Analysis confirmam ganhos agentivos, mas mostram dependência do harness, índice geral igual ao Sol e preço maior.

GPT-6 Astra dá um salto em agentes e cibersegurança, não uma alta uniforme de inteligência geral

A OpenAI lançou GPT-6 Astra em 3 de setembro de 2026 para uso de computador, programação, pesquisa e tarefas agentivas longas. O delta mais claro está em execução agentiva, ferramentas e capacidade cyber, não numa melhora uniforme de toda métrica de inteligência.

Antes → depois

MedidaSol / referênciaAstra
Terminal-Bench 4.037,3%57,9%
ARC-AGI-3 harness padrão—62,7%
ARC-AGI-3 provider adapter—99,9%
Eficiência de açõesmediana humanamenos ações em 96% dos níveis
AA Coding Agent Index~6567
AA Intelligence Index6161
Preço API$4/$20$10/$50

ARC Prize mede 62,7% no harness padrão e 99,9% quando o adaptador preserva estado opaco entre chamadas. Isso mostra que desempenho agentivo é uma propriedade de modelo + memória/estado + ferramentas + harness. O valor 99,9% sem a condição do harness seria enganoso.

OpenAI relata 57,9% no Terminal-Bench 4.0 contra 37,3% do Sol. Artificial Analysis confirma forte ganho em coding: índice 67 e aproximadamente três vezes menos tokens no harness Codex em esforço máximo. O preço por token, porém, é 2,5× maior.

No índice geral de Artificial Analysis, Astra e Sol marcam 61. Há menor uso de tokens, mas maior custo por tarefa geral, além de ganhos e regressões em diferentes avaliações. Portanto o salto não é uniforme.

A OpenAI classifica Astra como seu primeiro modelo Critical em capacidade de cibersegurança. É uma classificação interna de preparedness, não uma certificação universal, mas exige controles de implantação e monitoramento mais fortes.

No Codex, notas persistentes e busca em janelas anteriores reduzem a perda de contexto após compactação. Isso é memória de sistema. O system card também mostra maior controle sobre a forma do raciocínio escrito, o que cria um problema de monitorabilidade.

Novo estado

O progresso melhor demonstrado está em execução agentiva, coding, eficiência de ação e cyber. Os dados independentes não sustentam que Astra seja melhor em toda medida geral nem que qualquer benchmark prove AGI.

Evidência: modelo implantado + system card + ARC Prize e Artificial Analysis independentes; replicação real ampla ainda inicial.

Fontes: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra ; https://openai.com/index/safety-overview-gpt-6-astra/