Hero-Titelkarte mit der Aufschrift „GPT-6 vs Gemini 4 Argon“, dazu ein Chip mit der Aufschrift „Argon: schrittweiser Rollout an Sicherheitspartner seit 2026-09-30“, zwei Index-Chips mit der Aufschrift „GPT-6 Astra 52.7“ und „Gemini 4 Argon 52.6“ sowie eine Fußzeile mit der Aufschrift „Indexwerte gemäß Artificial Analysis v4.3.2; Argon-Spezifikationen vom Anbieter angegeben und nicht käuflich erwerbbar.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

GPT-6 vs. Gemini 4 Argon: Ein beinahe Gleichstand zwischen einem Modell auf einer Preisliste und einem auf einer Warteliste

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das engste Modellpaar auf dem aktuellen Frontier-Board ist kein Paar, das man kaufen kann. Gemini 4 Argon erreicht 52,6 auf dem Intelligence Index v4.3.2 von Artificial Analysis. GPT-6 Astra, das Flaggschiff von OpenAI, erreicht 52,7. Das ist eine Differenz von einem Zehntelpunkt über zehn Evaluierungen hinweg, und beide Werte stammen aus derselben Revision derselben Suite. Es ist die engste Paarung an der Tabellenspitze im Set.

In dieser Zahl liegt eine Symmetrie, und in der Verfügbarkeit überhaupt keine. Google kündigte Gemini 4 Argon am 30. September 2026 zu einem angegebenen Einführungspreis von 2,00 US-Dollar pro Million Eingabe-Tokens und 10,00 US-Dollar pro Million Ausgabe-Tokens an; der Rollout erfolgt zuerst für eine namentlich genannte Kohorte von Cyber-Verteidigern über ein Programm, das Google Fairwind nennt. Es hat keine veröffentlichte API-Modellkennung, kein Datum für die allgemeine Verfügbarkeit und keinen Endpunkt, den ein Kunde heute aufrufen kann. GPT-6 Astra ist seit dem 3. September 2026 käuflich zu erwerben, und seit dem 7. Oktober 2026 ist die GPT-6-Familie zudem die Familie, an die ChatGPT mehr als 1,2 Milliarden wöchentliche Nutzer weiterleitet — wobei GPT-6 Sol, nicht Astra, die kostenpflichtigen Tarifstufen dieses Rollouts antreibt.

Der Vergleich ist also real, aber in einer Weise asymmetrisch, die verändert, wie er gelesen werden sollte. Argons Zahlen beschreiben ein Modell in einem kontrollierten Rollout. Die Zahlen von GPT-6 beschreiben ein Produkt mit einer Preisliste. Alles Folgende gilt unter der Klausel „wenn man es kaufen könnte“, und nichts davon beantwortet die Frage „sollte man wechseln“, denn es gibt noch nichts, wozu man wechseln könnte.

Was ist tatsächlich über das Gegenstück bekannt, das existiert?

Beginnen Sie mit der Seite, die existiert, denn der Vergleich hat nur eine umsetzbare Hälfte. GPT-6 erscheint in drei Stufen, und nur zwei davon sind hier relevant:

• GPT-6 Astra — das Flaggschiff, Modell-ID gpt-6-astra, veröffentlicht am 3. September 2026, Kontext mit 1.050.000 Token, Ausgabe mit 128.000 Token, Eingabe von Text/Bild/Datei, Aufwand von niedrig bis maximal, 10,00 $ pro Million Eingabe- und 50,00 $ Ausgabe-Token, mit Preisanpassung auf 20,00 $/75,00 $ für die gesamte Anfrage über 272.000 Eingabe-Token
• GPT-6 Sol — die mittlere Stufe, veröffentlicht am 22. September 2026, dieselben Kontext- und Ausgabeobergrenzen, 2,00 $/10,00 $ mit der Langkontext-Stufe von 4,00 $/15,00 $, und das Modell, das OpenAI am 7. Oktober 2026 unter ChatGPT Plus, Pro, Business und Enterprise anbot
• GPT-6 Luna — die Budget-Stufe zu 0,10 $/0,50 $, die ChatGPT Free und Go bedient

Argons Seite dieser Liste ist eine Zeile lang. Googles Ankündigung lieferte einen Einführungspreis, eine Einordnung der Fähigkeiten – praxisnahe Programmierung, Wissensarbeit in Unternehmen und Cyberverteidigung – und einen Rollout-Plan. Sie lieferte keinen Modell-String, kein Kontextfenster, keine maximale Ausgabe, keinen Tarif für gecachte Eingaben, keinen Deprecation-Zeitplan und kein Datum für einen breiteren Zugang. Das Fehlen einer Modellkennung ist das praktisch Bedeutsame: Jedes online zu findende Codebeispiel, das einen Modell-String für Gemini 4 Argon zitiert, ist reine Spekulation, denn es gibt keinen String, den man zitieren könnte.

Die einzige vollständig vergleichbare Messung – und was sie verbirgt

Eine einzige Kennzahl ermöglicht es dir, Argon mit einem GPT-6-Modell zu vergleichen, ohne dass ein „Wenn“ daranhängt, denn Artificial Analysis hat beide getestet: die Kosten für die Erzeugung einer fertigen Antwort in der Evaluationssuite.

• Kosten pro abgeschlossener Index-Aufgabe — Gemini 4 Argon $1,99 vs. GPT-6 Astra $3,26, eine 1,6-fache Spanne zugunsten von Argon
• Generierte Output-Tokens über die gesamte Suite — Gemini 4 Argon 112,8 Mio. vs. GPT-6 Astra 108,8 Mio., praktisch gleichauf
• Intelligenz-Index, v4.3.2 — Gemini 4 Argon 52,6 vs. GPT-6 Astra 52,7, ein Kopf-an-Kopf-Rennen
• Angegebener Preis — $2,00 Eingabe und $10,00 Ausgabe pro 1 Mio. bei Argon, als Einführungspreis im Vergleich zu Astras regulärem Preis von $10,00/$50,00
• Kontextfenster — GPT-6 Astra 1.050.000 Tokens vs. bei Argon nicht veröffentlicht

Lesen Sie die erste Zeile noch einmal, denn sie ist die einzige Überraschung auf dieser Seite. Argon liegt mit seinen offiziellen Tarifen bei einem Fünftel von Astra, und seine Kosten pro Aufgabe sind bei derselben Suite 39 % niedriger. Ein Modell, das genauso gut abschneidet wie das Flaggschiff, bei einem Fünftel des Input-Tarifs, wäre die Geschichte des Quartals – wenn man es so nennen könnte.

A two-column comparison scoreboard for GPT-6 Astra and Gemini 4 Argon, showing GPT-6 Astra at an Intelligence Index of 52.7, $3.26 per index task and a 1,050,000-token context window, against Gemini 4 Argon at 52.6, $1.99 and dimensions marked not published, with prices of $10.00/$50.00 against a stated introductory $2.00/$10.00 and an availability row reading phased rollout only. A footer reads "Index figures per Artificial Analysis v4.3.2; Argon figures vendor-stated, no purchase path."

Die zweite Zeile ist der Grund, warum die erste Zeile weniger dramatisch ist, als sie aussieht, und sie läuft dem üblichen Verbositätsargument zuwider. Argon und Astra schrieben fast exakt dieselbe Anzahl an Tokens, um fast exakt denselben Score zu erzielen. Es gibt keine Verbositätslücke, die die Kostenspanne erklären könnte – der Unterschied von 1,27 $ kommt aus der Preisliste, nicht daher, dass ein Modell weitschweifig ist. Das macht ihn zu einem saubereren Vergleich als die meisten in diesem Batch und die fehlende Verfügbarkeit zum einzigen, was zwischen Argon und einer eindeutigen Empfehlung steht.

Goo​gles eigene Tabelle ist nicht die unabhängige.

Goo​gle hat eine Launch-Tabelle für Argon veröffentlicht, die es über neunzehn Benchmarks hinweg mit GPT-6 Astra vergleicht. Liest man nur diese Tabelle, gewinnt Argon vierzehn, Astra vier, und einer endet unentschieden. Das ist ein auffälliges Ergebnis, und man sollte sorgfältig damit umgehen: Jede Zahl darin stammt von Goo​gle, wurde von Goo​gle ausgewählt und angeordnet, und nichts davon wurde unabhängig reproduziert. Es ist Goo​gles Argument für Argon, wofür eine Launch-Tabelle gedacht ist, und in einen Vergleich gehört es als gekennzeichnete Anbieterbehauptung, nicht als Beleg.

Vergleicht man es mit dem unabhängigen Lauf, ändert sich der Charakter des Bildes. In der Testsuite von Artificial Analysis liegen die beiden bei 52,6 und 52,7 gleichauf — ein viel kleinerer Vorsprung, als ein 14-zu-4-Durchmarsch nahelegt, und das in einer Testsuite, die kein Anbieter selbst zusammengestellt hat. Die ehrliche Zusammenfassung lautet, dass Argon plausibel Astra ebenbürtig und im Software-Engineering möglicherweise sogar besser ist, dass die eigene Tabelle des Anbieters eine größere Lücke nahelegt, als die unabhängige zeigt, und dass sich nichts davon klärt, solange nicht jemand außerhalb von Google es auf etwas anderem als den Aufgaben von Google laufen lässt.

A screenshot of the top of the Artificial Analysis leaderboard table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings, showing Claude Opus 5.5 (max with fallback) at 58 and $5.98, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, then GPT-6 Astra (max) at 53 and $3.26 on the row immediately above Gemini 4 Argon (high) at 53 and $1.99, with GPT-6 Astra (xhigh) and GPT-6.1 Sol (max) at 52 below them - the near-tie rendered as adjacent rows at the same index.

Warum ein unveröffentlichtes Modell trotzdem einen Abschnitt wert ist

Weil Googles Rollout-Muster selbst eine Information ist und darauf hinweist, wohin die nächste Veröffentlichung der Pro-Klasse geht. Google verbrachte 2026 damit, Modelle der Flash-Klasse auszuliefern — die 3.5-, 3.6- und 3.8-Flash-Reihe, die Lite-Varianten, ein auf Cybersicherheit abgestimmtes 3.8 Flash —, während die Pro-Klasse auf Gemini 3.1 Pro Preview festsaß, einem Modell, das seit Februar 2026 in der Vorschau ist, ohne Zusage zur allgemeinen Verfügbarkeit und ohne Abschaltdatum. Argon ist die erste Bewegung an der Spitze der Produktlinie seit sieben Monaten, und es ging zuerst an Verteidiger statt an Entwickler.

Diese Abfolge ist eine kohärente Entscheidung — Cybersicherheit ist die Arbeitslast, bei der ein Frontier-Modell mit agentischer Werkzeugnutzung und Autonomie über lange Zeithorizonte den klarsten und am besten messbaren Nutzen hat, und sie ist zugleich die Arbeitslast, bei der ein Anbieter vor der allgemeinen Veröffentlichung eine kontrollierte Kohorte wünscht. Das ist kein Beweis dafür, dass das Modell nicht bereit ist. Es ist ein Beweis dafür, dass Goo​gle die allgemeine Verfügbarkeit als spätere Entscheidung behandelt statt als eine am Starttag, was genau das ist, was die fehlende Modellkennung und das fehlende Datum auf andere Weise aussagen.

Für einen Entwickler ist die Konsequenz einfach: Mit Argon kann man nicht planen. Mit GPT-6 Astra oder GPT-6 Sol kann man planen, weil beide Kennungen, Endpunkte, Preislisten und einen Anbieter haben, der bereits eine Abkündigungsrichtlinie für die Produktlinie veröffentlicht hat. Ein Modell ohne Kennung ist ein Modell, für das man keinen Adapter schreiben kann.

Was würde diesen Vergleich ändern?

Drei Dinge – und jedes einzelne davon macht den obigen Artikel zu einer geklärten Frage. Das erste ist eine Modellkennung – ein echter String, der über Googles API ausgeliefert wird, denn das ist der Punkt, an dem ein Adapter schreibbar wird und eine Schätzung des Integrationsaufwands aussagekräftig wird. Das zweite ist ein Datum der allgemeinen Verfügbarkeit, das eine Vorschau von einem Produkt unterscheidet und genau das Datum ist, das Argons Ankündigung vollständig ausgelassen hat. Das dritte ist unabhängiges Benchmarking auf Aufgaben, die Google nicht ausgewählt hat; eine vom Anbieter zusammengestellte Benchmark-Suite ist eine Behauptung, und eine von jemand anderem zusammengestellte Benchmark-Suite ist eine Messung.

Solange es nicht alle drei gibt, ist Argons Rolle in einem Vergleich eher die einer Obergrenze als die einer Option. Seine Zahlen verraten Ihnen, wohin sich die Gemini-Pro-Stufe entwickelt, und geben Ihnen ein Gefühl dafür, wie viel Preisspielraum Google an der Spitze der Reihe hat. Sie sagen Ihnen nicht, worauf Sie aufbauen sollten.

Was ist zu tun?

Wenn der Grund, aus dem Sie hier sind, der ist, dass Argons Zahlen gut aussehen, dann ist der sinnvolle Schritt, dieselbe Art von Workload gegen das Modell zu testen, das Sie heute tatsächlich aufrufen können, und für Software-Engineering und langfristige agentische Arbeit bedeutet das GPT-6 Astra. Es steht in OrcaRouters Katalog — nach Googles eigenem Muster der Durchleitungspreise — die 10,00 $/50,00 $ des Anbieters mit der Tarifstufe 20,00 $/75,00 $ für langen Kontext, bei 0 % Aufschlag, sodass eine Preisänderung des Anbieters Sie am selben Tag erreicht und nicht erst zum nächsten Abrechnungszyklus. GPT-6 Sol zu 2,00 $/10,00 $ ist ebenfalls dort, und für die meisten Workloads ist es der bessere Kauf: Es erreicht 47,6 gegenüber Astras 52,7 und kostet pro abgeschlossener Aufgabe etwa ein Drittel.

Die Routing-Ebene ist das, was den Rollout-Plan eines Anbieters überlebbar macht. Wenn Argon tatsächlich eine Kennung erhält, muss daraus kein Migrationsprojekt werden: Eine Routing-Regel kann einen Teil Ihres Traffics dorthin leiten oder die Modell-Fusion-Konfiguration nutzen, um ein Panel laufen zu lassen und Antworten zu vergleichen, während GPT-6 Astra oder Sol dahinter der Standard bleibt. Automatisches Failover deckt den Fall ab, der hier am wichtigsten ist — ein Modell in einem kontrollierten Rollout ist genau die Art von Route, die ohne Vorwarnung rate-limitiert oder zurückgezogen werden kann, und ein Fallback-Pfad bedeutet, dass daraus eine langsame Anfrage statt eines Ausfalls wird.

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the OpenAI vendor label, a 2026-09-04 release date, a 1,050,000-token context window, a 128K-token maximum output, text, image and file input, and pricing of $10.00 per million input tokens and $50.00 per million output tokens.

Was man nicht tun sollte, ist, einen Migrationsplan rund um eine Launch-Tabelle für ein Modell ohne Endpunkt aufzusetzen. Der Abstand zu GPT-6 Astra beträgt einen Zehntelpunkt, und der Preisunterschied ist real, aber keines von beidem ist es wert, eine Integration für etwas neu aufzubauen, an das man keine Anfrage senden kann.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert