HarmonyFidelisHarmonyFidelis
Iniciar sesión
ActualidadGrandes proyectosActoresAcademia

GPT-6 Astra da un salto en agentes y ciberseguridad, no una mejora uniforme de inteligencia general

Astra sube Terminal-Bench 4.0 de 37,3% a 57,9% frente a GPT-5.6 Sol y alcanza el nivel cyber Critical de OpenAI. ARC Prize y Artificial Analysis confirman grandes avances agentivos, pero también dependencia del harness, un índice general igual a Sol y mayor precio.

GPT-6 Astra da un salto en agentes y ciberseguridad, no una mejora uniforme de inteligencia general

OpenAI lanzó GPT-6 Astra el 3 de septiembre de 2026 para uso de ordenador, programación, investigación y trabajo agentivo prolongado. El cambio real se concentra en ejecución agentiva, herramientas y ciberseguridad, no en una subida uniforme de toda medida de inteligencia.

Antes → después

MedidaSol / referenciaAstra
Terminal-Bench 4.0 OpenAI37,3%57,9%
ARC-AGI-3 harness estándar—62,7%
ARC-AGI-3 provider adapter—99,9%
Acción ARC-AGI-3mediana humanamenos acciones en 96% de niveles
AA Coding Agent Index~6567
AA Intelligence Index6161
Precio API$4/$20$10/$50

ARC Prize obtiene 62,7% con su harness estándar y 99,9% cuando el adaptador conserva estado opaco entre llamadas. No es una contradicción: muestra que la capacidad de un agente depende del modelo + memoria/estado + herramientas + harness. El 99,9% sin esta condición sería una comparación engañosa.

OpenAI informa 57,9% en Terminal-Bench 4.0 frente a 37,3% para Sol. Artificial Analysis confirma la dirección: Astra marca 67 en su Coding Agent Index y usa aproximadamente un tercio de los tokens de Sol a esfuerzo máximo en el harness Codex. Como el token cuesta 2,5× más, la eficiencia por tarea puede aun así ser similar en código.

La evidencia general es más mixta. Artificial Analysis da 61 a Astra y 61 a Sol en su Intelligence Index; el menor uso de tokens no compensa totalmente el precio, y el coste por tarea general aumenta. Hay mejoras en algunos tests y regresiones en otros.

OpenAI también clasifica Astra como su primer modelo Critical en capacidad de ciberseguridad. Es una clasificación interna de riesgo/capacidad, no una certificación externa de inteligencia. Implica controles de despliegue más fuertes y muestra que el salto agentivo tiene consecuencias de seguridad.

En Codex, Astra introduce notas persistentes y búsqueda de ventanas previas para reducir la pérdida de información tras compactaciones. Es memoria de sistema, no prueba de memoria humana del modelo. El system card también indica mayor control sobre la forma del razonamiento escrito, lo que OpenAI considera un reto de monitorización.

Nuevo estado

El delta mejor demostrado es agentivo: más tareas terminal completas, mejor eficiencia de acción, mejor coding y un nuevo umbral cyber. No hay base para afirmar que todos los aspectos de inteligencia general mejoran ni que un benchmark pruebe AGI.

Evidencia: modelo desplegado + system card del proveedor + ARC Prize y Artificial Analysis independientes; validación masiva todavía temprana.

Fuentes: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra ; https://openai.com/index/safety-overview-gpt-6-astra/