OpenAI lanzó GPT-6 Astra el 3 de septiembre de 2026 para uso de ordenador, programación, investigación y trabajo agentivo prolongado. El cambio real se concentra en ejecución agentiva, herramientas y ciberseguridad, no en una subida uniforme de toda medida de inteligencia.
Antes → después
| Medida | Sol / referencia | Astra |
|---|---|---|
| Terminal-Bench 4.0 OpenAI | 37,3% | 57,9% |
| ARC-AGI-3 harness estándar | — | 62,7% |
| ARC-AGI-3 provider adapter | — | 99,9% |
| Acción ARC-AGI-3 | mediana humana | menos acciones en 96% de niveles |
| AA Coding Agent Index | ~65 | 67 |
| AA Intelligence Index | 61 | 61 |
| Precio API | $4/$20 | $10/$50 |
ARC Prize obtiene 62,7% con su harness estándar y 99,9% cuando el adaptador conserva estado opaco entre llamadas. No es una contradicción: muestra que la capacidad de un agente depende del modelo + memoria/estado + herramientas + harness. El 99,9% sin esta condición sería una comparación engañosa.
OpenAI informa 57,9% en Terminal-Bench 4.0 frente a 37,3% para Sol. Artificial Analysis confirma la dirección: Astra marca 67 en su Coding Agent Index y usa aproximadamente un tercio de los tokens de Sol a esfuerzo máximo en el harness Codex. Como el token cuesta 2,5× más, la eficiencia por tarea puede aun así ser similar en código.
La evidencia general es más mixta. Artificial Analysis da 61 a Astra y 61 a Sol en su Intelligence Index; el menor uso de tokens no compensa totalmente el precio, y el coste por tarea general aumenta. Hay mejoras en algunos tests y regresiones en otros.
OpenAI también clasifica Astra como su primer modelo Critical en capacidad de ciberseguridad. Es una clasificación interna de riesgo/capacidad, no una certificación externa de inteligencia. Implica controles de despliegue más fuertes y muestra que el salto agentivo tiene consecuencias de seguridad.
En Codex, Astra introduce notas persistentes y búsqueda de ventanas previas para reducir la pérdida de información tras compactaciones. Es memoria de sistema, no prueba de memoria humana del modelo. El system card también indica mayor control sobre la forma del razonamiento escrito, lo que OpenAI considera un reto de monitorización.
Nuevo estado
El delta mejor demostrado es agentivo: más tareas terminal completas, mejor eficiencia de acción, mejor coding y un nuevo umbral cyber. No hay base para afirmar que todos los aspectos de inteligencia general mejoran ni que un benchmark pruebe AGI.
Evidencia: modelo desplegado + system card del proveedor + ARC Prize y Artificial Analysis independientes; validación masiva todavía temprana.
Fuentes: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra ; https://openai.com/index/safety-overview-gpt-6-astra/