Hero-Titelkarte mit dem Text "Gemini 4 Argon vs. GPT-6 Sol — ein Fünftel des Preises, viermal die Rechnung", mit Chips mit der Aufschrift "Argon 2 $ / 10 $", "Sol 2 $ / 10 $" und "Kosten pro Index-Aufgabe 1,99 $ vs. 1,05 $", und einer Fußzeile mit dem Text "Argon-Zahlen vom Anbieter gemeldet; Index-Zahlen laut Artificial Analysis, abgerufen am 2026-10-01." Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Gemini 4 Argon vs. GPT-6 Sol: Ein Fünftel des Preises, viermal die Rechnung

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Führe die Artificial-Analysis-Index-Suite auf Gemini 4 Argon aus, und sie schlägt mit 2.407 $ zu Buche. Führe dieselbe Suite auf GPT-6 Sol aus, und sie schlägt mit 1.546 $ zu Buche. Derselbe Index, dieselben Aufgaben, dieselbe Woche. Die beiden Modelle haben identische Listenpreise – 2,00 $ pro Million Input-Tokens und 10,00 $ pro Million Output-Tokens, Argon als angegebener Einführungspreis von Google und Sol als OpenAIs regulärer Preis – und dennoch unterscheiden sich die Endkosten für identische Arbeit um 56 %, zugunsten des Modells, das fünf Punkte niedriger abschneidet. Genau diese Kluft ist der Grund, warum sich dieser Vergleich lohnt, und sie hat nichts mit der Preisliste zu tun.

Google kündigte am 2026-09-30 Gemini 4 Argon an und nannte es die nächste Ära der Frontier-Intelligenz, bepreist mit 2 $ Input und 10 $ Output, wobei zwischengespeicherter Input mit 95 % Rabatt zu haben ist, und wird über das Fairwind Program an vertrauenswürdige Cyber-Verteidiger ausgerollt. GPT-6 Sol ist seit dem 2026-09-22 allgemein verfügbar, als OpenAI die mittlere Stufe der GPT-6-Reihe zu 2 $ Input und 10 $ Output mit einem Cache-Rabatt von 90 % auslieferte. Das eine ist heute über einen OpenAI-kompatiblen Endpunkt käuflich, das andere ist für niemanden außerhalb einer namentlich genannten Kohorte käuflich, was die praktische Weggabelung in diesem Artikel ist. Doch die obige Kosteninversion bleibt bestehen, selbst wenn man die Verfügbarkeit völlig außer Acht lässt, und zu verstehen, warum, ist der nützliche Teil.

Die Umkehrung, klar formuliert

Artificial Analysis veröffentlicht sowohl einen Intelligence Index als auch eine Aufstellung darüber, was es kostet, diesen Index auszuführen. Zusammen gelesen sagen sie Folgendes:

Intelligenz-Index — Gemini 4 Argon 52,6 gegenüber GPT-6 Sol 47,5. Eine Lücke von fünf Punkten, gemessen mit Argon auf seiner hoch-Aufwandsstufe und Sol auf max, sodass der Vergleich großzügiger gegenüber Sol als gegenüber Argon ausfällt.

• Listenpreis pro Million Tokens — identisch. 2,00 $ für Eingabe / 10,00 $ für Ausgabe bei beiden. Cache-Lesevorgänge sind der einzige Unterschied: 0,10 $ bei Argon, 0,20 $ bei Sol.

• Kosten pro Indexierungsaufgabe — Gemini 4 Argon 1,99 $ gegenüber GPT-6 Sol 1,05 $. Argon kostet pro Aufgabe etwa doppelt so viel, obwohl es pro Token gleich viel kostet.

• Kosten für die Ausführung der vollständigen Suite — Gemini 4 Argon 2.407 $ gegenüber GPT-6 Sol 1.546 $.

• Gemessene Ausgabegeschwindigkeit — GPT-6 Sol 77,0 Token pro Sekunde gegenüber Gemini 4 Argon 48,9, ein Unterschied von 1,6×, der sich sowohl in der Latenz als auch in den Ausgaben niederschlägt.

Es gibt eine Zeile in dieser Liste, die alle anderen erklärt, und es ist nicht der Preis. Es ist die Token-Anzahl. Bei den eigenen Aufgaben des Index generierte Gemini 4 Argon ungefähr 561.000 Ausgabe-Tokens pro Aufgabe; GPT-6 Sol generierte ungefähr 282.000. Argon denkt doppelt so lange, um dieselbe Frage zu beantworten, und bei identischem Preis pro Token ist das genau die doppelte Rechnung.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

Warum die Token der Preis sind

Diese Korrektur ist es wert, verinnerlicht zu werden, bevor irgendjemand eine Migration budgetiert, denn die Intuition läuft in die falsche Richtung. Wenn ein Modell genauso bepreist ist wie sein Wettbewerber und doppelt so viele Ausgabe-Tokens verbraucht, um fertig zu werden, dann ist der Preis pro Token nicht der Preis. Der Preis ist der Preis pro Token multipliziert mit der Anzahl der Tokens, die das Modell beschließt auszugeben, und dieser zweite Faktor ist eine Eigenschaft des Modells, nicht des Tarifblatts.

Die Marge variiert je nach Aufgabe enorm, was es noch schlimmer macht – man kann nicht einfach einen pauschalen Multiplikator anwenden und weitermachen:

• Terminal-Bench 4.0 — Argon 165.330 Ausgabe-Tokens pro Aufgabe gegenüber 97.372 bei Sol. Argon kostet hier 6,78 $ pro Aufgabe gegenüber 4,00 $ bei Sol, obwohl Argon 57,1 % gegenüber 43,9 % bei Sol erreicht.

• CritPt — Argon 109.533 Tokens gegenüber Sols 31.848. Ein Token-Verhältnis von 3,4× bei einer Aufgabe, bei der Sol tatsächlich höher punktet, 30,9 % zu 27,1 %.

• GDPval — Argon 74.571 Tokens gegenüber 41.567 von Sol, für 1,82 $ pro Aufgabe gegenüber 1,32 $.

• Allwissenheit — ein Token-Verhältnis von 938 zu 2.662 zu Argons Gunsten, bei 0,010 $ pro Aufgabe gegenüber Sols 0,027 $. Die einzige Aufgabenfamilie, bei der sich die Richtung umkehrt.

• Langkontext-Reasoning — Argon 2.197 Token gegenüber Sols 954, und die einzige Aufgabe in der Suite, bei der Sol beim Score eindeutig gewinnt, 83,7 % zu 79,7 %.

CritPt ist der aufschlussreiche. Ein Modell, das dreieinhalb Mal so viele Tokens verbraucht, um auf dieselbe Frage eine etwas schlechtere Antwort zu liefern, ist keine Geschichte über Leistungsfähigkeit; es ist eine Geschichte über Ausgabegewohnheiten. Argons Reasoning zieht sich in die Länge, und bei manchen Aufgabenformen schlägt diese Länge in Punkte um, bei anderen schlägt sie einfach in Dollar um. Die 52,6 des Index und Sols 47,5 sind der Aggregatwert, und Aggregate verbergen genau das.

Woher die fünf Punkte eigentlich kommen

Da die Indexlücke und die Kostenlücke in entgegengesetzte Richtungen weisen, lohnt es sich zu wissen, welche Aufgaben jeweils dafür verantwortlich sind.

Terminal-Bench 4.0 — Gemini 4 Argon 57,1 % gegenüber GPT-6 Sol 43,9 %. Argons größter Einzelsieg und die Aufgabenfamilie, die dem langfristigen agentischen Coding am nächsten kommt.

• Allwissenheit — Gemini 4 Argon 42,4 gegenüber GPT-6 Sol 27,1. Ein Abstand von fünfzehn Punkten bei der Faktenabdeckung, die größte proportionale Lücke in der Testsuite.

• AutomationBench-AA — Gemini 4 Argon 77,5 % gegenüber GPT-6 Sol 61,6 %.

• SciCode — Gemini 4 Argon 61,8 % gegenüber GPT-6 Sol 57,6 %.

• Humanity's Last Exam — Gemini 4 Argon 57,1 % gegen GPT-6 Sol 47,9 %.

• GDPval — Gemini 4 Argon 1.611 versus GPT-6 Sol 1.487.

• ApexAgents / AA-Briefcase — GPT-6 Sol 1.482,78 Elo gegen Argons 1.493,84, eine 11-Punkte-Lücke, die innerhalb der veröffentlichten Konfidenzintervalle liegt und als Unentschieden bezeichnet werden sollte.

• Langkontext-Reasoning — GPT-6 Sol 83,7 % gegenüber Gemini 4 Argon 79,7 %. Sols einziger klarer Sieg.

• CritPt — GPT-6 Sol 30,9 % gegenüber Gemini 4 Argon 27,1 %. Sol gewinnt erneut, knapp.

Das Bild ist also nicht: „Argon ist besser“. Vielmehr ist es so, dass Argon bei den beiden Dingen besser ist, die in seinen Launch-Unterlagen an erster Stelle standen – End-to-End-Ausführung von Geschäftsaufgaben und langfristige Softwareentwicklung –, und dass Sol gleichauf oder vorn liegt, was die akademisch angehauchte Reasoning-Leiter und das Aufrechterhalten von Kohärenz über einen langen Kontext angeht. Für Leserinnen und Leser, deren Workload eine Retrieval-Pipeline mit einem 400K-Token-Prompt ist, ist Sol zugleich das bessere und das günstigere Modell – eine ungewöhnliche und komfortable Position.

Die Spezifikationsunterschiede, die die Benchmark-Diskussion überdauern

• Maximale Ausgabe — Gemini 4 Argon 1.000.000 Token in einer einzigen Trajektorie, die Google als die größte in der Branche und als eine Erhöhung gegenüber der 64K-Obergrenze der vorherigen Generation beschreibt. GPT-6 Sol 128.000 Token.

• Kontextfenster — Das Herstellerdatenblatt von GPT-6 Sol gibt ungefähr 1.050.000 Token an; bei Argon sind es 1.000.000. Artificial Analysis hat Sol mit seinem Test-Harness bei 872.000 Token gemessen, was eine Messung im Test-Harness und keine Datenblattangabe ist – behandle das Datenblatt als Spezifikation und die Zahl aus dem Test-Harness als das, was der Evaluator tatsächlich in Anspruch genommen hat.

• Eingabemodalitäten – beide akzeptieren Text, Bilder und Dateien. Argons Launch-Material setzt zudem auf Langvideo-Verständnis, wo Google 91,7 % auf LVBench beansprucht und es als State of the Art bezeichnet; das ist eine vom Anbieter gemeldete Zahl, und kein unabhängiges Gremium hat sie bisher reproduziert.

• Video-Eingabe — Schwach. Artificial Analysis listet Argon mit deaktivierter Video-Eingabe in seinen Charts und nennt Video beim Launch ausdrücklich, während Sols Karte Video überhaupt nicht aufführt. Wenn Video in Ihrer Pipeline eine tragende Rolle spielt, klärt keine der beiden Karten das, und Sie sollten testen, bevor Sie die Architektur festlegen.

• Reasoning-Aufwand — Sol bietet über die API einen konfigurierbaren Aufwand (von none bis max, Standard: medium) und wurde bei max erfasst. Argon wurde bei high erfasst; niemand hat dieselbe Testsuite mit seiner höchsten Einstellung veröffentlicht.

Die Ausgabengrenze von 1 Mio. Tokens ist diejenige, die tatsächlich eine Architektur verändern könnte und nicht bloß ein Budget. Alles, was Sie derzeit in ein Dutzend verkettete Aufrufe aufteilen, um unter einer 128K-Grenze zu bleiben – ein Patch-Set über mehrere Dateien, einen vollständigen Audit-Bericht, ein langes Dokument in einem Durchgang –, wird zu einem einzigen Aufruf mit weniger Stellen, an denen eine Agentenschleife den Zustand verlieren kann. Ob das den doppelten Preis pro Aufgabe wert ist, hängt ganz davon ab, ob Sie diese Arbeitslast haben. Wenn ja, ist es das wahrscheinlich wert. Wenn Ihre Aufrufe Klassifizieren-und-Zurückgeben sind, ist es Geld, das für Spielraum ausgegeben wird, den niemand nutzen wird.

Die Effort-Einstellung, die niemand erreicht hat, und warum sie wichtig ist

Ein Vorbehalt verdient einen eigenen Absatz, weil er dagegen spricht, die Fünf-Punkte-Indexlücke als reinen Fähigkeitsunterschied zu lesen. Artificial Analysis führt Gemini 4 Argon mit seiner hohen Reasoning-Effort-Einstellung und GPT-6 Sol mit maximaler Einstellung auf. Das sind nicht dieselbe Sprosse auf den beiden Leitern, und die Richtung der Diskrepanz ist interessant: Sol wurde mit seiner teuersten Einstellung ausgeführt und Argon mit einer mittleren.

Es folgen zwei Lesarten, und die Daten können nicht zwischen ihnen unterscheiden. Entweder würde Argon bei max höher als 52,6 abschneiden – aber auch mehr als 561.000 Tokens pro Aufgabe verbrauchen und mehr als 1,99 $ kosten – oder es würde etwa gleich abschneiden, was bedeuten würde, dass der Aufwandsregler in dieser Suite nicht viel bewirkt. Es gibt keinen veröffentlichten Lauf, der das klärt. Wer 52,6 als Obergrenze von Argon zitiert, zitiert eine Konfiguration, kein Modell, und die Konfiguration ist die, die sein Anbieter zuerst zu veröffentlichen wählte.

Dieselbe Logik gilt für Sols 47,5, nur in die entgegengesetzte Richtung: max steht an der Spitze seiner Leiter, daher liegt der Wert näher an einer Obergrenze als an einer Untergrenze. Ein fairer Kampf bei gleichem Aufwand könnte die Lücke verkleinern und könnte auch den Kostenvergleich umkehren, da die Tokens, die max verbraucht, die Tokens sind, die 10 $ pro Million kosten.

Die Verfügbarkeitsverzweigung, die die tatsächliche Antwort bestimmt

Gemini 4 Argon ist nicht allgemein verfügbar. In Googles Ankündigung heißt es, dass es über das Fairwind-Programm an eine Reihe vertrauenswürdiger Cyber-Verteidiger ausgerollt werde, dass das Unternehmen am freiwilligen Prozess der US-Regierung für den Modellzugang vor der Veröffentlichung teilnehme und dass der allgemeine Zugang für Entwickler, Unternehmen und Verbraucher „so schnell wie möglich“ komme, beginnend mit zahlenden API-Kunden und Google AI Ultra-Abonnenten. Es gibt keine Modellkennung, keinen Endpunkt, kein Kontingent und kein Datum. Es ist in keiner öffentlichen API verfügbar, auch nicht in unserer – prüfen Sie den Katalog, und Sie erhalten einen 404-Fehler, weil es dort noch nicht existiert.

GPT-6 Sol ist ein aufrufbares Produkt. Auf OrcaRouter ist es openai/gpt-6-sol, auf demselben OpenAI-kompatiblen Endpunkt wie die anderen über 200 Modelle im Katalog, zum Listenpreis von OpenAI, durchgereicht mit null Aufschlag, sodass die oben genannten $2/$10 und der Long-Context-Schritt bei 272.000 Tokens auf $4/$15 das sind, was Sie tatsächlich zahlen, und nicht, was eine Preisliste behauptet. Automatisches Failover über Anbieter hinweg deckt den Fall ab, dass die Route mitten im Lauf schlechter wird, und die Routing-DSL ermöglicht es einer einzelnen Anwendung, ihren günstigen Klassifizierungsverkehr an ein kleineres Modell und ihren schwierigen Reasoning-Verkehr an Sol zu senden, ohne ein zweites SDK.

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Diese letzte Konstellation ist für die meisten Teams die ehrliche Antwort auf diesen Vergleich. Das Kostenargument für Argon ist real, aber es gilt nur für eine Workload, bei der langfristig angelegte Agentenarbeit dominiert; das Kostenargument dagegen ist bei jeder anderen Workload real; und du kannst es diesen Monat ohnehin nicht kaufen. Der günstige Weg ist, jetzt eine Evaluierungs-Harness aufzubauen – deine eigenen Prompts, dein eigenes Scoring, gegen Sol mit ein paar Effort-Einstellungen laufen zu lassen –, damit du, wenn Argon zahlende API-Kunden erreicht, eine gemessene Antwort auf eine Frage hast, die alle anderen anhand eines Leaderboards beantworten werden.

Was würde es klären

Drei Dinge, in der Reihenfolge, wie stark sie das Urteil verändern würden. Die allgemeine Verfügbarkeit von Argon zu einem echten, nicht als Einführungspreis angelegten Preis – das Wort „introductory“ bedeutet, dass sich die 2 $/10 $ ändern können, und Googles eigene Abfolge priorisiert zahlende API-Kunden, sodass der erste veröffentlichte Tarif nach dem Start derjenige ist, den man im Auge behalten sollte. Ein veröffentlichter Artificial-Analysis-Lauf mit Argon auf dessen höchster Effort-Einstellung, der zeigen würde, ob 52,6 eine Obergrenze ist oder nur knapp darunter liegt. Und eine unabhängige Reproduktion des DeepSWE-v1.1-Werts – Google beansprucht 77,9 % und nennt ihn einen neuen State of the Art; der Wert ist vom Anbieter gemeldet und bis heute außerhalb von Google nicht reproduziert.

Bis dahin ist die Trennung sauber und leicht ironisch. GPT-6 Sol ist das besser verifizierte Modell, das schnellere, das günstigere pro abgeschlossener Aufgabe und dasjenige, das Sie heute Nachmittag aufrufen können. Gemini 4 Argon ist das höher punktende Modell auf der Bestenliste, die sein Anbieter zu veröffentlichen beschloss, etwa doppelt so teuer in der tatsächlichen Nutzung und noch nicht im Verkauf. Die Wahl zwischen ihnen ist kein Urteil über die Leistungsfähigkeit. Es ist ein Urteil darüber, welcher dieser beiden Sätze Ihren Monat beschreibt.

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.