
GPT-6 Astra vs Qwen3.8-Max: Zwei agentische Flaggschiffe und das Kleingedruckte unter jedem
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Im September 2026 gibt es zwei Geschichten über „agentische Flaggschiffe“, und beide handeln von GPT-6 Astra und Qwen3.8-Max. OpenAI veröffentlichte GPT-6 Astra am 3. September als das Modell, das laut eigenen Angaben das weltweit beste für Computernutzung, Softwareentwicklung, Wissenschaft und Cybersicherheit ist; Alibabas Qwen3.8-Max, erhältlich seit dem 3. August, ist das agentische Flaggschiff des stärksten chinesischen Labors – dasjenige, das Artificial Analysis in seinem Agentic Index unter den Spitzenreitern des Feldes führt und im offenen Ökosystem der engste Rivale der Autonomie-Behauptungen der Spitzenmodelle ist. Beide sind wirklich stark, und beide werden mit Schlagzeilenzahlen verkauft, die bei näherer Betrachtung schrumpfen: OpenAIs 99,9-%-ARC-AGI-3-Ergebnis fällt auf 62,7 %, wenn ARC Prize seine eigene neutrale Testumgebung einsetzt, und Qwen3.8-Max’ agentische Brillanz geht mit einem unabhängig gemessenen Halluzinations-Regress einher sowie mit der Angewohnheit, 64 Züge und über einen Dollar für Aufgaben auszugeben, die sein Vorgänger in 14 erledigte. Dies ist ein Vergleich zweier Modelle – und zweier Arten, einen Benchmark zu lesen.
Die beiden Schlagzeilen
OpenAIs Pitch für GPT-6 Astra setzt auf Breite plus Autonomie: ein einziges Modell, das einen Browser steuert, Code schreibt und korrigiert, wissenschaftliche Analysen durchführt und – einzigartig – neuartige Sicherheitsschwachstellen gut genug findet, dass OpenAI das gesamte Modell im Rahmen seines Preparedness Framework als „kritisch“ einstufte und die leistungsfähigsten Einstellungen auf geprüfte Partner beschränkte. In den Launch-Materialien werden eine perfekte 100% bei ExploitBench, 97,6% bei FrontierMath Tier 4, 96,0% bei GPQA Diamond sowie der Sättigungswert bei ARC-AGI-3 beansprucht. Alibabas Pitch für Qwen3.8-Max ist schmaler, aber gezielt: ein agentisches Arbeitstier für $2/$6, das bei unabhängigen Agenten-Evaluierungen an der Spitze oder nahe der Spitze liegt, wobei die zugrunde liegenden Gewichte (unter einer eigenen Lizenz) veröffentlicht werden, statt in einer Blackbox eingeschlossen zu sein.
Was das unabhängige Scoreboard sagt
Artificial Analysis vergibt derzeit für GPT-6 Astra (max) einen Intelligenzwert von 61 – Rang 8 unter den 202 erfassten Modellen – und für Qwen3.8-Max einen Intelligenzwert von 58, Rang 24. Diese Lücke von drei Punkten ist kleiner als der Preisabstand und kleiner als die Marketing-Versprechen der Anbieter. Beim separaten Agentic-Index von AA erreicht Qwen3.8-Max einen Wert von 58 und liegt damit auf Augenhöhe mit den besten proprietären Spitzenmodellen, während AA für GPT-6 Astra bislang überhaupt keinen Agentic-Index veröffentlicht. Die ehrliche Lesart: Bei der rein gemessenen Intelligenz liegen diese beiden eng beieinander, und die Einordnung als „das intelligenteste Modell der Welt“ in den Launch-Materialien von OpenAI entspricht nicht dem, was AAs unabhängige Bewertung zeigt.
• Intelligenz — GPT-6 Astra (max): AA Intelligence 61, Rang #8/202. Qwen3.8-Max: AA Intelligence 58, Rang #24/202; AA Agentic 58.
• Listenpreis — GPT-6 Astra: $10.00 / $50.00 pro 1M, $1.00 Cache-Lesezugriffe, 2× Eingabe über 272K Token. Qwen3.8-Max: $2.00 / $6.00 pro 1M, $0.25 Cache-Lesezugriffe.
• Kontext / Ausgabe — GPT-6 Astra: 1,05M Eingabe / 128K Ausgabe. Qwen3.8-Max: 1M Eingabe / ~128K Ausgabe.
• Agentische Evidenz — GPT-6 Astra: ARC-AGI-3 99,9 % (OpenAI-Testumgebung) gegenüber 62,7 % (Standardtestumgebung von ARC Prize); WANDR 0,682 bei 11,98 $/Aufgabe (laut Perplexity). Qwen3.8-Max: AA GDPval 1.739 Elo bei 64 Schritten/Aufgabe (~1,14 $/Aufgabe); Code Arena WebDev #1 mit 1.691 Elo.
• Unabhängige Warnsignale — GPT-6 Astra: noch nicht im ChatGPT-Auswahlmenü, gestaffelte API, Zugeständnis bei der Überwachbarkeit. Qwen3.8-Max: AA-Omniscience-Halluzinationsregression von 23 % auf 40 % gegenüber der Vorgängergeneration.
• Gewichte — GPT-6 Astra: proprietär. Qwen3.8-Max: Max-Klassen-Checkpoint (Qwen3.8-2.4T-A95B) seit dem 12. August unter einer benutzerdefinierten Lizenz öffentlich; AA listet das gehostete Flaggschiff weiterhin als proprietär.

Das Kleingedruckte, kommentiert
Nehmen Sie zuerst die ARC-AGI-3-Kennzahl, denn sie ist das klarste Beispiel dafür, wie eine Zahl sowohl wahr als auch irreführend sein kann. OpenAI meldet 99,9 % für GPT-6 Astra auf seiner eigenen Provider-Adapter-Harness – ein Setup, das auf das Modell abgestimmt ist. ARC Prize, die Organisation, die den Benchmark pflegt, ließ GPT-6 Astra auf seiner providerneutralen Standard-Harness laufen und maß 62,7 %. Beides ist auf dem neuesten Stand; keines ist 99,9 % auf einer Harness, die der Hersteller des Modells nicht kontrolliert. Dieselbe Vorsicht gilt für Perplexitys WANDR-Wert von 0,682 – der höchste, den Perplexity je verzeichnet hat, aber gemessen von einem Unternehmen, das gleichzeitig GPT-6 Astra in seine eigenen Produkte integriert und daher ein kommerzielles Interesse hat. Dieses Muster verdient es, benannt zu werden: OpenAIs spektakulärste Zahlen stammen alle von Harnessen, die OpenAI oder seine Partner kontrollieren, und die einzige völlig unabhängige Zahl – AA's Intelligence 61 – ist lediglich ausgezeichnet.
Beim Qwen3.8-Max ist das Kleingedruckte umgekehrt: Seine Stärken wurden unabhängig gemessen, und auch seine Schwäche wurde unabhängig gemessen. Der GDPval-Score von 1.739 Elo ist echt – aber die Testläufe von Artificial Analysis zeigen, dass Qwen3.8-Max ihn erreicht, indem es pro Aufgabe 64 Turns und rund 1,14 $ aufwendet, gegenüber 14 Turns und 0,53 $ bei der Vorgängergeneration. Das ist eine Anstrengungssteuer: Das Modell erkauft sich seine agentische Obergrenze mit Reasoning-Tokens, was für alle von Bedeutung ist, die pro Token bezahlen. Und die Omniscience-Evaluierung von AA maß einen Rückschritt bei der Halluzinationsrate von 23 % auf 40 % gegenüber der vorherigen Qwen-Generation – ein echtes unabhängiges Warnsignal genau für die autonomen, mehrschrittigen Workloads, bei denen eine selbstsichere falsche Antwort am teuersten ist. Ein Modell, das sich über 64 Turns in Fehler hineinredet, ist nicht offensichtlich sicherer freizugeben als eines, dessen Hersteller einräumt, dass seine Überwachbarkeit abgenommen hat.

Preis, Bereitstellung und die ehrliche Art, sich zu entscheiden.
Beim Preis gibt es keinen Wettbewerb: Qwen3.8-Max kostet $2.00 / $6.00 pro Million und ist damit ein Fünftel des Eingabepreises von GPT-6 Astra und ein Achtel seines Ausgabepreises, mit einem 1M-Token-Kontext ohne den Astra-Aufschlag für lange Prompts. Bei der Bereitstellbarkeit hat Qwen3.8-Max diese Woche einen weiteren Vorteil – es ist heute abrufbar, und es ist live auf OrcaRouter zum Listenpreis von Alibaba, ohne Aufschlag weitergereicht und mit automatischem Failover. GPT-6 Astra, das noch ausgerollt wird und für die meisten Nutzer mit Stand vom 4. September in ChatGPT noch nicht auswählbar ist, ist über die eigene API von OpenAI und die großen Cloud-Marktplätze erreichbar, während der Zugang ausgeweitet wird. Das praktische Muster für ein Team, das agentische Pipelines baut, besteht darin, die Arbeitslast auf das Modell zu legen, das man heute aufrufen kann, und das andere als Benchmark zu betrachten, den man im Auge behalten sollte. Wenn man „agentische“ Behauptungen lieber selbst bewerten als ihnen vertrauen möchte, ist eine Routing-Ebene das richtige Werkzeug: Qwen3.8-Max, Kimi K3, Grok 4.6 und 200+ weitere Modelle sitzen auf OrcaRouter hinter einem einzigen Schlüssel, und die Routing-DSL kann mehrere davon zu einem einzigen Aufruf kombinieren — so kann man die eigene Aufgabensuite gegen die Kandidaten laufen lassen und die Ergebnisse selbst ablesen, anstatt zwischen dem Kleingedruckten zweier Anbieter zu wählen.
Zwei Fragen, die diese Begegnung immer wieder aufwirft
Warum meldet OpenAI 99,9 % bei ARC-AGI-3, während ARC Prize 62,7 % misst? Weil es nicht derselbe Test ist. Die Provider-Adapter-Harness von OpenAI ist eine Version des Benchmarks, die für die Aufrufweise von GPT-6 Astra in der Produktion konfiguriert ist; die Standard-Harness von ARC Prize ist eine neutrale Konfiguration, die darauf ausgelegt ist, jedes Modell fair zu vergleichen. Das Ergebnis von 62,7 % ist dasjenige, das sich auf „Was passiert, wenn ich das Modell selbst aufrufe?“ verallgemeinern lässt, und es ist immer noch die beste Punktzahl, die ARC Prize mit dieser Harness aufgezeichnet hat.
Hat Qwen3.8-Max offene Gewichte? Teilweise, mit einem Lizenzvorbehalt. Alibaba veröffentlichte den Max-Klassen-Checkpoint Qwen3.8-2.4T-A95B am 12. August unter einer speziellen Lizenz – die Gewichte sind herunterladbar, aber das ist nicht die Apache-2.0-Offenheit des kleineren Qwen3.8-27B, und Artificial Analysis führt das gehostete Flaggschiff weiterhin als proprietär. Falls Ihre Anforderung lautet: „Ich kann genau das Modell ausführen, für das ich bezahle“, ist diese Unterscheidung wichtig; falls Ihre Anforderung lautet: „Ich kann die Architektur prüfen und eine nahe Variante selbst hosten“, erfüllt Qwen3.8-Max diese und GPT-6 Astra nicht.
Das Fazit
{{1}}Wählen Sie GPT-6 Astra, wenn Sie die spezifischen Fähigkeiten benötigen, die es derzeit als einziges bietet — Offensiv-Sicherheitsarbeit, wissenschaftliches Reasoning an der Frontlinie, die schwierigsten autonomen Computer-Use-Aufgaben — und Ihre Organisation die Zugangshürden überwinden und den Preis stemmen kann.{{/1}} {{2}}Wählen Sie Qwen3.8-Max, wenn Sie ein Spitzenmodell für agentische Aufgaben möchten, das Sie noch diese Woche für 2 $/6 $ tatsächlich einsetzen können, mit den Gewichten als Notausgang und einer Halluzinations-Regression, von der Sie jetzt wissen, dass Sie darauf testen müssen.{{/2}} {{3}}Die grundsätzlichere Lehre liegt im Kleingedruckten selbst: Im September 2026 werden die beiden führenden "agentischen" Flaggschiffe mit Schlagzahlen verkauft, die keiner der Hersteller vollständig kontrolliert — und der rationale Käufer liest die Testumgebung, zählt die Turns und führt eigene Aufgaben aus, bevor er sich für eine Seite entscheidet.{{/3}}

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
