HarmonyFidelisHarmonyFidelis
Anmelden
NachrichtenGroßprojekteAkteureAkademie

GPT-6 Astra macht einen großen Agenten- und Cyber-Sprung, aber keinen einheitlichen Sprung allgemeiner Intelligenz

Astra steigt auf Terminal-Bench 4.0 von 37,3% auf 57,9% gegenüber GPT-5.6 Sol und erreicht OpenAIs Critical-Cyberstufe. Unabhängige Tests bestätigen Agentengewinne, zeigen aber Harness-Abhängigkeit, einen unveränderten allgemeinen Index und höhere Preise.

GPT-6 Astra macht einen großen Agenten- und Cyber-Sprung, aber keinen einheitlichen Sprung allgemeiner Intelligenz

OpenAI veröffentlichte GPT-6 Astra am 3. September 2026 für Computer Use, Coding, Forschung und lange Agentenaufgaben. Der stärkste Delta liegt bei agentischer Ausführung, Toolnutzung und Cyberfähigkeit, nicht bei einer einheitlichen Verbesserung jeder Intelligenzmetrik.

Vorher → nachher

MessungSol / ReferenzAstra
Terminal-Bench 4.037,3%57,9%
ARC-AGI-3 Standard-Harness—62,7%
ARC-AGI-3 Provider Adapter—99,9%
Aktionseffizienzmenschlicher Medianweniger Aktionen auf 96% der Levels
AA Coding Agent Index~6567
AA Intelligence Index6161
API-Preis$4/$20$10/$50

ARC Prize misst 62,7% mit dem Standard-Harness und 99,9% mit einem Provider-Adapter, der opaken Zustand zwischen Aufrufen erhält. Das ist keine widersprüchliche Messung, sondern zeigt, dass Agentenleistung zunehmend von Modell + Zustandsschnittstelle + Tools + Harness abhängt.

OpenAI meldet 57,9% auf Terminal-Bench 4.0 statt 37,3% für Sol. Artificial Analysis bestätigt einen Coding-Fortschritt: Index 67 und ungefähr dreimal weniger Token im Codex-Harness bei maximalem Aufwand. Der Listenpreis pro Token ist jedoch 2,5× höher.

Auf dem breiteren Artificial Analysis Intelligence Index stehen Astra und Sol beide bei 61. Astra ist token-effizienter, aber teurer pro allgemeiner Aufgabe; manche Teilbenchmarks steigen, andere fallen. Der Generationssprung ist also nicht auf jeder Achse gleich.

OpenAI stuft Astra erstmals als Critical in Cyberfähigkeit ein. Das ist eine interne Preparedness-Klassifikation, keine externe Zertifizierung. Sie führt aber zu strengeren Monitoring- und Aktionskontrollen und markiert einen qualitativ anderen Risikobereich.

Codex erhält außerdem dauerhafte Notizen und durchsuchbare frühere Kontextfenster, um Informationsverlust nach Kompaktion zu reduzieren. Das ist Systemgedächtnis, kein Beleg für menschlich persistentes Modellgedächtnis. Der System Card zeigt auch höhere Kontrolle über die Form schriftlicher Reasoning-Traces, was ihre Überwachung schwieriger machen kann.

Neuer Stand

Am stärksten belegt ist der Sprung bei agentischer Ausführung: Terminal-Arbeit, Coding-Effizienz, neue Umgebungen und Cyberfähigkeit. Die unabhängigen Daten rechtfertigen keine Aussage, Astra sei auf jeder allgemeinen Intelligenzdimension besser oder ein AGI-Beweis.

Evidenz: bereitgestelltes Modell, Hersteller-System-Card, unabhängige ARC-Prize- und Artificial-Analysis-Messungen; breite Realwelt-Replikation noch jung.

Quellen: https://openai.com/index/gpt-6-astra/ ; https://arcprize.org/blog/astra ; https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra ; https://openai.com/index/safety-overview-gpt-6-astra/