Hero-Titelkarte mit der Aufschrift „Gemini 4 Argon vs. GPT-6 Astra“, mit einem Chip mit der Aufschrift „Index 52,6 vs. 52,7“ und einem Chip mit der Aufschrift „Kosten pro Index-Aufgabe 1,99 $ vs. 3,26 $“ sowie einer Fußzeile mit der Aufschrift „Argon-Zahlen vom Anbieter gemeldet; Index- und Kostenzahlen laut Artificial Analysis, 30.09.2026.“
Guides & Insights

Gemini 4 Argon vs. GPT-6 Astra: Ein Kopf-an-Kopf-Rennen im Index und ein Preis, der um zwei Drittel nach unten geht

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Frontier-Modelle, 0,11 Punkte auseinander im Intelligence Index von Artificial Analysis. Gemini 4 Argon erreicht 52,56. GPT-6 Astra erreicht 52,67. Müsste man sich zwischen ihnen aufgrund der gemessenen allgemeinen Leistungsfähigkeit entscheiden, könnte man eine Münze werfen, und der Unterschied zwischen den beiden Werten ist kleiner als das Konfidenzintervall von jedem der beiden. Das ist eine wirklich seltene Situation in einem Markt, in dem die zehn besten Modelle zusammengenommen etwa fünfzehn Punkte abdecken, und sie macht dies zum am leichtesten zu beurteilenden Duell von Gemini 4 Argon, weil das Leistungsargument vorbei ist, bevor es beginnt, und alles, was übrig bleibt, Ökonomie und Zugang sind.

Die beiden sind allerdings keine Zwillinge. Argon wurde am 30.09.2026 von Google DeepMind angekündigt und wird schrittweise eingeführt, beginnend mit vertrauenswürdigen Cyber-Verteidigern im Fairwind Program. GPT-6 Astra wurde Anfang September ausgeliefert – unsere Katalogkarte gibt als Datum den 04.09.2026 an, Artificial Analysis listet den 03.09.2026 – und ist eine Live-Route, die Sie heute Nachmittag zu 10 $ pro Million Input-Token und 50 $ pro Million Output-Token aufrufen können, mit einem Kontextfenster von 1.050.000 Token und einer Obergrenze von 128.000 Token für die Ausgabe. Bei einem dieser Modelle gibt es einen Preis, nach dem Sie heute abgerechnet werden können.

Wo eine Lücke von 0,11 Punkten real ist und wo sie Rauschen ist

Ein Index ist ein zusammengesetztes Maß, daher können sich zwei Modelle, die beim zusammengesetzten Wert gleichauf liegen, in seinen Bestandteilen bedeutsam unterscheiden. Hier stimmen die Bestandteile größtenteils überein, mit drei Ausnahmen, die es wert sind, genannt zu werden.

• Terminal-Bench 4.0 — GPT-6 Astra 59,1 % gegenüber Gemini 4 Argon 57,1 %. Astra führt knapp.

• Langkontext-Reasoning — GPT-6 Astra 80,7 % gegenüber Gemini 4 Argon 79,7 %.

• GPQA Diamond — GPT-6 Astra 96,1 %. Argon veröffentlicht zu diesem Board keine Zahl.

• CritPt — GPT-6 Astra 31,7 % gegenüber Gemini 4 Argon 27,1 %.

SciCode — Gemini 4 Argon 61,8 % versus GPT-6 Astra 56,5 %.

• Humanity's Last Exam — Gemini 4 Argon 57,1 % gegen GPT-6 Astra 54,7 %.

• AutomationBench-AA — Gemini 4 Argon 77,5 % gegenüber GPT-6 Astra 68,5 %.

• GDPval — Gemini 4 Argon 1.611 gegenüber GPT-6 Astra 1.542.

• Allwissenheit — GPT-6 Astra 43,4 gegen Gemini 4 Argon 42,4.

ITBench-SRE — GPT-6 Astra 48,6 % im Vergleich zu keinem veröffentlichten Argon-Wert.

• Ausgabegeschwindigkeit — GPT-6 Astra 51,2 Token pro Sekunde gegenüber Gemini 4 Argon 48,9. Effektiv gleichauf.

• Latenz bis zum ersten Token auf dem Index-Harness — Gemini 4 Argon 2,8 Sekunden gegenüber GPT-6 Astra 320,2 Sekunden.

Astra hat Vorteile beim wissenschaftlichen Multiple-Choice-Schlussfolgern, bei Physikproblemen zu kritischen Punkten und beim SRE-Benchmark. Argon hat Vorteile beim wissenschaftlichen Programmieren, beim schwierigeren End-to-End-Aufgabenset und bei mit GDP bewerteten Arbeiten. Keiner der beiden Vorsprünge ist groß genug, um für sich allein die Grundlage einer Migration zu sein.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

Die Latenzzeile ist ein anderes Thema. 320 Sekunden bis zum ersten Token bedeuten fünfeinhalb Minuten Stille, bevor überhaupt etwas ausgegeben wird – gegenüber unter drei Sekunden bei Argon. Beide messen dasselbe – die Zeit bis zum ersten Chunk bei den Indexläufen von Artificial Analysis –, also ist das vergleichbar. Astras Reasoning ist immer aktiv und von niedrigem bis maximalem Aufwand konfigurierbar; ein Lauf mit maximalem Aufwand bei einer schwierigen Aufgabe denkt tatsächlich minutenlang, bevor er spricht. Ob das ein Mangel ist, hängt ganz von Ihrer Schnittstelle ab. Bei einem Batch-Job kostet es nichts. Für alles, bei dem ein Nutzer einen Lade-Spinner beobachtet, ist es der für Nutzer sichtbarste Unterschied zwischen diesen beiden Modellen – größer als jede Benchmark-Lücke auf der Seite.

Der Preisschritt, der das eigentliche Thema ist

Hier wird der Gleichstand entschieden, und zwar auf eine Weise, die leicht falsch modelliert werden kann, weil Astras Tarifkarte drei Stufen hat, die sich ähnlich sehen.

• Standard, bis zu 272.000 Eingabe-Tokens — GPT-6 Astra: 10,00 $ Eingabe / 50,00 $ Ausgabe, Cache-Lesevorgänge zu 1,00 $, Cache-Schreibvorgänge zu 12,50 $.

• Langer Kontext, über 272.000 Eingabe-Tokens — GPT-6 Astra 20,00 $ Eingabe / 75,00 $ Ausgabe, Cache-Lesevorgänge zu 2,00 $. Die gesamte Anfrage wird zum höheren Tarif neu bepreist, nicht nur der Überschuss: 2× Eingabe und 1,5× Ausgabe.

• Fast-Modus — 2× des geltenden Standardtarifs, also 20,00 $ Eingabe / 100,00 $ Ausgabe. Das ist die 100-$-Zahl, die zitiert wird, als wäre sie der Long-Context-Tarif; das ist sie nicht.

• Gemini 4 Argon — 2,00 $ Eingabe / 10,00 $ Ausgabe pauschal zu Einführungskonditionen, Cache-Eingabe bei 0,10 $, ohne veröffentlichten Step-Tarif und ohne veröffentlichten Fast-Tarif.

Argon ist also bei der Eingabe fünfmal günstiger und bei der Ausgabe fünfmal günstiger als Astras Standard-Tarif sowie zehnmal günstiger bei der Eingabe oberhalb von 272K. Zwei unabhängige Kostenmessungen belegen dasselbe aus einer anderen Richtung: Artificial Analysis setzt Argon bei 1,99 $ pro Index-Aufgabe an gegenüber 3,26 $ bei Astra und 2.407 $ für den gesamten Index gegenüber 5.324 $ bei Astra. Das Verhältnis pro Aufgabe ist kleiner als das Verhältnis pro Token, aus demselben Grund wie gegenüber DeepSeek – Argon benötigt weniger Token bis zum Abschluss –, aber es ist immer noch 1,6×.

Vals’ BIP-gewichtetes Board erzählt eine dritte Version derselben Geschichte: Argon zuerst mit 68,90 % und 15,68 $ pro Durchlauf, Astra auf Platz sechs mit 63,13 % und 18,46 $. Astra ist dort teurer und erzielt eine niedrigere Punktzahl. Googles Material ist ausdrücklich dahingehend, dass es sich bei der Preisgestaltung um einen Einführungspreis handelt, ein Wort, das bedeutet, dass er sich ändern kann, und die ehrliche Lesart ist, dass Argons Preisvorteil real ist und seine Dauerhaftigkeit nicht garantiert ist.

Zwei Architekturfakten, die mehr entscheiden als Benchmarks

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Ausgabegrenze zuerst. Gemini 4 Argon generiert bis zu 1.000.000 Tokens in einer einzigen Trajektorie – Googles Ankündigung hebt dies als Erweiterung von 64K in der vorherigen Generation hervor. GPT-6 Astra kommt auf maximal 128.000. Beide haben ein Kontextfenster von rund einer Million Tokens, es geht also ausschließlich darum, wie viel das Modell auf einmal schreiben kann. Für die Langtextgenerierung, vollständige Code-Patch-Änderungen oder das Verfassen von Dokumenten in einem Durchgang ist das ein achtfacher Unterschied bei dem, was ein einzelner Aufruf produzieren kann. Für Chat, Extraktion und kurze Agent-Schritte sind beide Obergrenzen praktisch unendlich, und der Unterschied kostet Ihnen nichts.

Modalität an zweiter Stelle, und hier liegt der Vorteil in einer Hinsicht umgekehrt. GPT-6 Astra akzeptiert Text, Bilder und Dateien. Gemini 4 Argon akzeptiert Text, Bilder, Video und Dateien, und Googles Markteinführungsmaterial setzt speziell auf das Verständnis langer Videos – ein LVBench-Wert von 91,7 %, der vom Anbieter angegeben wird. Wenn Ihre Pipeline Video einliest, ist Astra kein Ersatz. Auch Audio wird in Argons veröffentlichter Modalitätsliste nicht genannt, gehen Sie also nicht davon aus, dass das Upgrade es mitbringt.

Was man tatsächlich tun sollte

Astra ist verfügbar und Argon nicht, und damit sind die meisten Entscheidungen für den nächsten Monat geklärt. Der konkrete Weg, der keine Arbeit verschwendet: Setzen Sie auf GPT-6 Astra auf, wenn Ihr Workload ein immer aktives Reasoning-Modell mit hoher wissenschaftlicher Genauigkeit und nachgewiesener agentischer Erfolgsbilanz benötigt, behalten Sie Ihren Modellnamen in der Konfiguration und legen Sie Ihre Client-Timeouts anhand von Astras gemessenem Verhalten statt aus Optimismus fest – ein fünfminütiger First-Token-Lauf löst ein standardmäßiges 60-Sekunden-Timeout aus, und ein Stream, der bei 300 Sekunden abbricht, sieht wie ein Ausfall aus. Wenn Sie bei mehr als 272K Eingabe-Tokens kostenempfindlich sind, modellieren Sie die Preisänderung explizit, bevor Sie sich festlegen, denn der Schritt verdoppelt an einer einzigen Grenze die Eingabe und erhöht die Ausgabe um die Hälfte.

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

Der interessante Mittelweg ist, dass Sie sich nicht auf einen einzigen Standard festlegen müssen. Astra und Argon – sobald Argon verfügbar ist – sind dieselbe Art von Modell für dieselbe Art von Arbeit, was sie zu natürlichen Failover-Partnern statt zu Konkurrenten um denselben Platz macht. Auf OrcaRouter ist openai/gpt-6-astra zum Anbieterlistenpreis ohne Aufschlag live, auf demselben OpenAI-kompatiblen Endpunkt wie über 200 weitere Modelle, mit automatischem Failover über Anbieter hinweg und einer Routing-DSL, um eine Primär-/Backup-Konfiguration auf einem Schlüssel auszudrücken. Wenn Argon unter der ID, die Google veröffentlicht, in den Katalog aufgenommen wird, ist der Wechsel ein String – kein zweiter Vertrag, keine Integrationsarbeit und kein Neuaufbau dessen, was Sie in der Zwischenzeit rund um Astra gebaut haben.

Was würde den Gleichstand dauerhaft brechen?

Ein veröffentlichter Argon-Preis nach der Einführungsphase sowie eine unabhängige Reproduktion von Googles agentischen Behauptungen — der Wert von 77,9 % für DeepSWE v1.1 und das Ergebnis von 68 % für CWE-bench v1 stammen beide aus Anbieterangaben, und hinter keinem steht ein externer Lauf. Beides könnte Argon deutlich nach oben oder unten bewegen, denn ein Indexvorsprung von 0,11 Punkten ist kein Puffer gegen einen 1,6-fachen Kostennachteil, falls sich der Kostenvorteil als temporär erweist, und er ist kein Defizit, falls Google den Einführungspreis hält und Astaras Long-Context-Stufe in der Produktion stärker durchschlägt als erwartet.

Vorerst: Was die gemessene allgemeine Leistungsfähigkeit betrifft, sind diese beiden dasselbe Modell in zwei Wrappern. Astra ist diejenige mit einer Live-Route, einer bekannten Preisstufe und einer fünfminütigen Denkpause. Argon ist diejenige mit einer günstigeren Karte und ohne Endpunkt. Das Unentschieden ist echt, und eine Seite davon ist kaufbar.