
GPT-6.1 Sol vs. Gemini 4 Argon: Nur einen halben Punkt auseinander – und nur eines davon steht zum Verkauf
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Alles, was man zwischen GPT-6.1 Sol und Gemini 4 Argon vergleichen kann, ist messbar, und nichts davon ist handlungsrelevant, denn nur eines der beiden Modelle kann gekauft werden. Gemini 4 Argon wurde am 30. September 2026 in einem DeepMind-Beitrag angekündigt, der Koray Kavukcuoglu zugeschrieben wird, mit einem angegebenen Einführungspreis von 2,00 US-Dollar pro Million Input-Token und 10,00 US-Dollar pro Million Output-Token, und wird zuerst für eine benannte Kohorte von Cyber-Verteidigern im Rahmen des Fairwind Program ausgerollt. Es hat keine Modellkennung, keinen API-Endpunkt, keinen veröffentlichten Preis pro Token, auf dessen Grundlage man abgerechnet werden könnte, und keine Seite, die man als Kunde erreichen kann. GPT-6.1 Sol wurde am 29. September 2026 zu 2,00 US-Dollar und 10,00 US-Dollar veröffentlicht und ist jetzt verfügbar. Im Artificial Analysis Intelligence Index liegen die beiden 0,8 Punkte auseinander — Argon 52,6, Sol 51,8 —, was dies zur engsten Paarung in dieser Charge und, allein auf den Index bezogen, zu einem toten Rennen macht. Auf dem Maßstab, der über echte Deployments entscheidet, ist eines dieser Modelle überhaupt kein Kandidat.
Diese Asymmetrie ist keine Spitzfindigkeit, und sie ist auch keine Sensation. Sie ist die Tatsache, die bestimmen sollte, wie der Vergleich gelesen wird: Argons Zahlen beschreiben ein Modell in einer kontrollierten Einführung bei einer Kohorte, und die von GPT-6.1 Sol beschreiben ein Produkt auf einer Preisliste. Sie zu vergleichen ist dennoch lohnenswert – Argon ist das, womit der Anbieter derzeit wirbt, und seine Messwerte sagen etwas Reales darüber aus, wo die Spitze der Gemini-Reihe steht –, doch jede Schlussfolgerung muss die Wendung „wenn es käuflich zu erwerben wäre“ tragen, und keine von ihnen trägt die Wendung „sollten Sie wechseln“.
Der Index erlaubt genau einen Vergleich, und es ist beinahe ein Gleichstand

Beide Modelle sind auf Artificial Analysis vertreten, und beide führen eine Bewertung sowie eine Aufstellung darüber, was die Erzeugung dieser Bewertung gekostet hat.
• Intelligence Index, v4.3.2 — Gemini 4 Argon 52,6 vs. GPT-6.1 Sol 51,8, eine Differenz von 0,8 Punkten
• Kosten pro Indexierungsaufgabe — Gemini 4 Argon 1,99 $ vs. GPT-6.1 Sol 0,72 $, eine 2,8-fache Spanne für diese 0,8 Punkte
• Kosten für die Ausführung der vollständigen Suite — Gemini 4 Argon 2.407 $ vs. GPT-6.1 Sol 1.082 $
• Ausgegebene Output-Tokens in dieser Suite — Gemini 4 Argon 110M vs. GPT-6.1 Sol 67M, ein 1,6-facher Unterschied in der Ausführlichkeit
• Angegebener Einführungspreis — 2,00 $ für Eingabe und 10,00 $ für Ausgabe pro Million Tokens bei beiden, wobei gecachte Eingabe bei Argon 95 % günstiger ist
• Kontextfenster — GPT-6.1 Sol 1.050.000 Tokens; Argon ist nicht veröffentlicht
Die vierte Zeile erklärt die zweite. Ein Kostenunterschied von 2,8× pro Aufgabe bei nahezu identischen Listenpreisen rührt daher, dass 1,6× so viele Tokens zu einem vergleichbaren Ausgabepreis geschrieben werden, plus dem, was das dahinterstehende Reasoning-Volumen kostet. Argon ist kein teures Modell, wenn man sein Datenblatt ansieht. Bei der Evaluation ist es ein redseliges, und die Rechnung wird beim Output beglichen.
Die Konfigurationen unterscheiden sich, und die Richtung des Unterschieds schmeichelt dem günstigeren Modell. Artificial Analysis führt Gemini 4 Argon in seiner Einstellung mit hohem Aufwand und GPT-6.1 Sol auf Maximalstufe auf – Sol wird also in seiner teuersten Einstellung gemessen und Argon bei etwas unterhalb seiner Obergrenze. Die 0,8-Punkte-Lücke ist daher die für Sol großzügige Version des Vergleichs: Gäbe man Argon seine höchste Einstellung, würde die Lücke wahrscheinlich größer; gäbe man Sol eine niedrigere Einstellung, würden seine Kosten weiter sinken. Keine der beiden Änderungen verändert die Verfügbarkeitslinie, die einzige Linie, die eine Deployment-Entscheidung besiegelt.
Überhaupt einen Abstand von 0,8 Punkten ablesen
Ein Unterschied von unter einem Punkt bei einem Gesamtwert aus zehn Bewertungen ist kein Ranking. Es sind zwei Modelle im selben Bereich.
Was der Index für Argon nicht veröffentlicht, sind die Komponentendetails, die die Einordnung lesbar machen würden – welche Evaluierungen es gewinnt, wo es schwach ist, wie es sich über die Teilwerte verhält, aus denen sich der Gesamtwert zusammensetzt. Die Seite von GPT-6.1 Sol enthält diese Zeilen; die von Argon enthält eine Schlagzeile und einen Kostenwert. Ein Vergleich, der allein auf der Schlagzeile aufbaut, kann sagen, dass die beiden gleichauf sind, und nichts weiter, und genau das sollte er sagen, statt aus einem Vorsprung von 0,8 Punkten einen Sieger zu konstruieren.
Es gibt einen externen Datenpunkt, den es sich hinzuzufügen lohnt, und er weist in die andere Richtung. In einer nach der Ankündigung kursierenden Coding-Evaluierung eines Drittanbieters belegte Argon den dritten Platz hinter GPT-6 Astra und Claude Opus 5.5 – ein starkes Ergebnis für ein Modell in einem kontrollierten Rollout und eines, das konsistent mit einer 52,6 im Composite ist. Es ist außerdem eine einzelne Beobachtung aus einer einzelnen Evaluierung, veröffentlicht in den ersten Tagen nach einer Ankündigung, was es eher zu einem Hinweis als zu einer Erfolgsbilanz macht. Ordne es ein und mach weiter.
Wofür die beiden Preiskarten tatsächlich gedacht sind
Die angegebene Rate für Argon verdient mehr Sorgfalt als die Indexzeile, denn in ihr stehen zwei Zahlen.
Der Einführungstarif beträgt 2,00 $ für Eingabe und 10,00 $ für Ausgabe, bei 95 % Rabatt auf gecachte Eingabe, was Argon auf einer Preiskarte zu einem preisgleichen 1:1-Match für GPT-6.1 Sol machen würde. Die eigene Fußnote des Anbieters besagt, dass der Tarif nach einer Einführungsphase, die er nicht definiert, 4,00 $ je Million Eingabe-Tokens und 20,00 $ je Million Ausgabe-Tokens beträgt. Dieses zweite Paar ist keine Hypothese – es ist die veröffentlichte Zahl, bei der das Modell voraussichtlich landen wird – und sie landet genau auf dem aktuellen Frontier-Listenpreis, statt darunter. Ein Vergleich, der nur das Einführungspaar angibt, gibt eine Werbezahl für ein Modell an, das noch nicht allgemein verfügbar ist, was zwei Grade der Vorläufigkeit in einer Zeile bedeutet.
Die Karte von GPT-6.1 Sol ist die entgegengesetzte Art von Objekt. 2,00 $ und 10,00 $ sind der reguläre Tarif, keine Aktion; die Long-Context-Stufe auf 4,00 $ / 15,00 $ oberhalb von 272.000 Prompt-Tokens ist veröffentlicht und gilt für eine definierte Grenze; zwischengespeicherte Eingaben zu 0,10 $ sind heute live und abrechenbar. Es gibt darin nichts, das eine Fußnote über einen Zeitraum erfordert, den der Anbieter nicht definieren will.
Das ist die Substanz hinter der Verfügbarkeitszeile. Nicht, dass Argon ein schlechteres Modell ist – der Index sagt, die beiden seien gleichauf –, sondern dass eine dieser beiden Karten eine Verpflichtung und die andere eine Absicht ist.
Der Rollout selbst ist der Vergleich.

Das Fairwind-Programm ist der Teil von Argons Ankündigung, den ein technischer Vergleich gern überspringt, und es ist der Teil, der hier am meisten zählt.
Der Anbieter übergibt das Modell zuerst einer namentlich genannten Kohorte von Cyber-Verteidigern, vor allen anderen, ohne angekündigtes Datum für eine allgemeine Freigabe, ohne Entwickler-Warteliste und ohne veröffentlichte Kennung, auf die sich ein Kunde festlegen könnte. Das ist eine legitime Art, ein Frontier-Modell zu veröffentlichen, und für Fähigkeiten dieser Klasse nicht ungewöhnlich. Es bedeutet außerdem, dass jede Aussage über die Kosten, die Latenz, den Durchsatz und die Zuverlässigkeit von Argon unter realem Verkehr derzeit nicht gemessen ist: Es gibt keinen Produktionsverkehr, der gemessen werden könnte. Der eigene Benchmark-Lauf des Anbieters existiert, und der Composite von Artificial Analysis existiert, und zusammengenommen sind sie die Bewertung eines Labors und die Suite eines Evaluators. Das ist die gesamte Datenlage.
GPT-6.1 Sol ist acht Tage alt und auf andere Weise dünn: eine unabhängige Konfiguration, kein Praktiker-Korpus und ein ausgeliefertes Produkt, dessen Fehlermodi noch nirgends niedergeschrieben sind. Keines der beiden Modelle ist gut belegt. Eines von ihnen hat jedoch eine Rechnung.
Wofür ist dieser Vergleich also
Drei Verwendungen, und keine davon ist eine Kaufentscheidung.
Zuerst die Kalibrierung. Wenn Sie verfolgen, wo Argon im Vergleich zu GPT-6.1 Sol steht, ist 52,6 gegenüber 51,8 bei einer Kostenstreuung von 2,8× pro Aufgabe die aktuelle Antwort, und sie besagt, dass die Gemini-4-Reihe bei der Leistungsfähigkeit wettbewerbsfähig ist, während sie ihre kommerziellen Konditionen noch aushandelt. Achten Sie darauf, dass der Einführungspreis möglicherweise durch das Paar $4.00 / $20.00 ersetzt wird, was bei unveränderter Leistungsfähigkeit aus einem Preisgleichstand einen Preisaufschlag machen würde.
Zweitens: eine abwartende Haltung. Ein Modell, das angekündigt, gemessen und nicht routbar ist, ist der klarste Fall, den es gibt, um eine Abstraktion zwischen Ihrer Anwendung und Ihrer Modellwahl beizubehalten. Beide Modelle in diesem Beitrag sind von unserer Seite des Zauns aus auf dieselbe Weise erreichbar: GPT-6.1 Sol ist auf OrcaRouter zu seinen eigenen $2.00 / $10.00 mit gecachtem Input zu $0.10 und ohne Aufschlag verfügbar, sodass heute eine Workload dagegen zum Listenpreis des Anbieters aufgebaut werden kann. Sollte Argon eine Kennung und eine Preisliste erhalten, sollte die Evaluierung eine Konfigurationsänderung statt einer Neuimplementierung sein – und bis dahin ist der richtige Umfang an Engineering-Aufwand für Argon der Umfang, der das wahr bleiben lässt.
Drittens, eine falsifizierbare Watchlist. Jeder der folgenden Punkte würde daraus statt eines Artikels über den bisherigen Wissensstand einen Vergleich machen, auf dessen Grundlage man einkaufen kann: eine Modellkennung in der Entwicklerdokumentation, einen Eintrag in seinem Model-Card-Index, einen Beitrag zur allgemeinen Verfügbarkeit mit veröffentlichten Pro-Token-Preisen oder dass Artificial Analysis eine zweite Konfiguration auf einer anderen Effort-Stufe veröffentlicht. Bis einer dieser Punkte eintritt, beschreibt ein Artikel, der behauptet, Argon sei im Produktivbetrieb billiger, schneller oder besser als GPT-6.1 Sol, ein Modell, das niemand außerhalb einer einzigen Kohorte ausgeführt hat.

Der ehrliche Schlusssatz ist ein einziger Satz, und er handelt von der Form der Frage, nicht vom Punktestand. Gemini 4 Argon und GPT-6.1 Sol liegen auf dem einzigen unabhängigen Board, auf dem beide auftauchen, so dicht beieinander, dass der Index nicht zwischen ihnen wählen kann; was zwischen ihnen entscheidet, ist, dass der eine verfügbar ist und der andere ein Versprechen – und ein Versprechen ist nichts, wohin man Produktionsverkehr leitet. Behalte Argon im Auge, übernimm Sol, wenn Preis und Modalitäten zu deiner Arbeit passen, und halte die Abstraktion dünn genug, dass der Tag, an dem Argon real wird, eine Zeile Konfiguration ist und kein Projekt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
