
GPT-6 vs. Gemini 3.1 Pro: Googles Pro-Kategorie hat seit Februar kein neues Modell veröffentlicht
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Gemini 3.1 Pro steht seit siebeneinhalb Monaten auf Googles Preisliste und hat die Vorschau nie verlassen. Es wurde am 19. Februar 2026 angekündigt, wird weiterhin unter einem Endpunkt namens Gemini 3.1 Pro Preview bereitgestellt, und Stand heute gibt es weder eine Zusage zur allgemeinen Verfügbarkeit noch ein Abschaltdatum – die beiden Termine, die verraten würden, wo das Modell im Plan seines eigenen Anbieters steht. GPT-6 Sol hingegen wurde am 22. September 2026 ausgeliefert, und am 7. Oktober 2026 wurde es das Modell hinter den kostenpflichtigen Tarifen von ChatGPTs globalem Rollout für mehr als 1,2 Milliarden wöchentliche Nutzer.
Die Schlagzeilen-Gegenüberstellung ist also nicht der Vergleich zwischen zwei Flaggschiff-Klassen. Sie ist der zwischen einem ausgelieferten Produkt und einer offenen Vorschau, und dieser Unterschied wiegt am Ende mehr als die Benchmark-Lücke. Vergleicht man sie direkt auf Artificial Analysis’ Intelligence Index v4.3.2, erzielt Googles sieben Monate alte Vorschau 29,7 gegenüber GPT-6 Sols 47,6, während sie pro abgeschlossener Index-Aufgabe 1,25× mehr berechnet – 1,30 $ gegenüber 1,04 $. Beide dieser Zahlen sind real, und beide müssen mit einem Vorbehalt versehen werden, bevor Sie Geld dafür ausgeben.
Was dies lesenswert macht, statt es abzutun, ist, dass die Preview durchaus etwas gewinnt. Sie schlägt GPT-6 Sol bei GPQA Diamond, bei der agentischen Tool-Nutzung von τ²-Bench und bei einer Langkontext-Messung – und sie akzeptiert Audio und Video als Eingabe, was GPT-6 Sol nicht tut. Eine sieben Monate alte Preview, die noch zwei von vier Kämpfen gewinnt, ist nicht abzuschreiben. Es handelt sich um ein Werk, dessen Lebenszyklus, nicht dessen Leistungsfähigkeit, das Problem ist.
Die Zahlen – und der Revisionsvorbehalt, der mit ihnen einhergehen muss
Artificial Analysis führt seine Testsuite erneut aus und veröffentlicht die Scores unter der aktuellen Index-Revision neu, was bedeutet, dass dasselbe Modell je nachdem, wann man sie liest, zwei verschiedene Zahlen aufweisen kann. Für Gemini 3.1 Pro ist diese Abweichung ungewöhnlich groß: Frühere Berichterstattung über dieses Modell meldete 57 in einer älteren Revision, während die Seite in ihrem heutigen Stand 29,7 auf v4.3.2 meldet. Beide Zahlen sind authentisch, und beide stehen auf derselben Website.
Das ist wichtig, weil sich nur Werte aus derselben Revision subtrahieren lassen. Die 29,7 und die 47,6 sind das hier zu verwendende Paar, da beide aus v4.3.2 stammen – demselben Durchlauf, in dem Claude Opus 5.5 57,6 und GPT-6 Astra 52,7 erzielt. Die Auswertung aus demselben Durchlauf, eine Zeile pro Dimension:
• Intelligence Index, v4.3.2 — GPT-6 Sol 47,6 vs. Gemini 3.1 Pro 29,7
• Kosten pro abgeschlossener Index-Aufgabe — Gemini 3.1 Pro 1,30 $ vs. GPT-6 Sol 1,04 $; das ältere Modell ist pro fertiger Antwort 25 % teurer
• Eingabepreis — 2,00 $ pro 1 Mio. bei beiden, beim Headline-Preis gleichauf
• Ausgabepreis — GPT-6 Sol 10,00 $ vs. Gemini 3.1 Pro 12,00 $; Sol ist 17 % günstiger
• Langkontext-Klausel — GPT-6 Sol berechnet die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens mit 4,00 $/15,00 $ neu; Gemini 3.1 Pro wechselt oberhalb von 200.000 zu 4,00 $/18,00 $
• Kontextfenster — GPT-6 Sol 1.050.000 Tokens vs. Gemini 3.1 Pro 1.048.576, praktisch gleichauf
• Maximale Ausgabe — GPT-6 Sol 128.000 Tokens vs. Gemini 3.1 Pro 65.536; Sol ist fast doppelt so hoch
• Eingabemodalitäten — GPT-6 Sol Text, Bild, Datei vs. Gemini 3.1 Pro Text, Bild, Audio, Video, PDF

Zwei Zeilen darin verdienen eine genauere Betrachtung, weil sie die naheliegende Lesart umkehren. Die Zeile zu den Kosten pro Aufgabe besagt, dass die auf den ersten Blick günstigere Preisliste zu dem Modell gehört, das pro abgeschlossener Aufgabe teurer ist – der Ausgabepreis von 12 $ bei Gemini 3.1 Pro plus sein Reasoning-Volumen leisten mehr Arbeit, als sein plakativer Eingabepreis von 2 $ vermuten lässt. Und die Langkontext-Stufe sollte auf beiden Seiten noch einmal gelesen werden: Die Stufe von Gemini 3.1 Pro beginnt bei 200.000 Tokens, niedriger als die 272.000 von GPT-6 Sol, setzt aber den Ausgabepreis auf 18,00 $ neu an, während Sol auf 15,00 $ neu ansetzt. Keine der beiden ist eine einheitliche Preisliste, und die Schnittpunkte decken sich nicht.
Wo die Vorschau noch gewinnt
Das Modell von Google ist kein Relikt. Hole die Bewertungen ab, die beide Karten enthalten:
• GPQA Diamond — Gemini 3.1 Pro 94,1 % vs. GPT-6 Sol, in dieser Revision keine vergleichbare Zahl veröffentlicht
• τ²-Bench agentische Tool-Nutzung — Gemini 3.1 Pro 95,6 % vs. GPT-6 Sol, nicht auf demselben Leaderboard veröffentlicht
• Long-Context-Recall — Gemini 3.1 Pro 82,0 % vs. GPT-6 Sol 83,7 %, eine Differenz von 1,7 Punkten
• SciCode — Gemini 3.1 Pro 58,7 % vs. GPT-6 Sol 57,6 %, praktisch gleichauf
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0 % vs. GPT-6 Sol 43,9 %; die einzige Kategorie, in der die Vorschauversion nicht wettbewerbsfähig ist

Ein GPQA-Diamond-Wert von 94,1 % und ein Wert von 95,6 % bei agentischer Tool-Nutzung sind Frontier-Zahlen, keine Legacy-Werte, und sie sind der Grund, warum die Indexlücke von 17,9 Punkten die praktische Distanz überzeichnet. Der Index ist ein zusammengesetzter Wert über zehn Evaluierungen, und die Verluste von Gemini 3.1 Pro konzentrieren sich dort, wo die Suite stark auf Software-Engineering ausgerichtet ist — Terminal-Bench 4.0 mit 4,0 % ist ein katastrophaler Ausreißer neben seinen 58,7 % bei SciCode und seinen 73,8 % bei Terminal-Bench 2.1. Ein Modell, das bei einem agentischen Benchmark nahe der Spitze und bei dessen Nachfolger nahe dem unteren Ende liegt, sagt dir etwas über sein Trainingsdatum, nicht über sein Leistungsmaximum.
Audio- und Videoeingabe ist der andere konkrete Vorteil, und sie ist ein Ausschlusskriterium, kein gradueller Unterschied. Wenn Ihre Pipeline eine Besprechungsaufnahme oder eine Bildschirmaufnahme als Eingabe verwendet, kann Gemini 3.1 Pro sie verarbeiten und GPT-6 Sol nicht. Kein noch so großer Vorsprung bei den Indexwerten ersetzt das.
Was „noch in der Vorschau“ dich konkret kostet
Der Preview-Status ist kein kosmetisches Etikett, und die Kosten sind von der Art, die sich erst zeigen, nachdem man auf etwas aufgebaut hat.
Ein Preview-Endpunkt bringt keine Zusage zur allgemeinen Verfügbarkeit mit sich, was bedeutet, dass der Anbieter nicht versprochen hat, dass das Modell nach einem Zeitplan vorhanden sein wird, auf den man sich verlassen kann. Er bringt auch kein Abschaltdatum mit sich, was nach der guten Variante davon klingt – nichts wird eingestellt –, aber es lässt sich auch anders lesen: Google hat keinen Lebenszyklus für ein Modell veröffentlicht, das sich seit Februar in diesem Zustand befindet, während im selben Zeitraum Modelle der Flash-Klasse ausgeliefert wurden. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, die 3.6er- und 3.8er-Flash-Reihe: Die Pro-Klasse blieb, wo sie war, und der Nachfolger kam stattdessen als Gemini 4 Argon, den Google am 30. September 2026 in einem schrittweisen Rollout für eine benannte Kohorte von Sicherheitspartnern ankündigte, ohne dass ein Datum für die allgemeine Verfügbarkeit genannt wurde.
Das ist das Muster, um das es bei diesem Vergleich wirklich geht. Wenn Sie eine dauerhafte Pipeline auf Gemini 3.1 Pro Preview aufbauen, bauen Sie auf einem Modell auf, dessen eigener Anbieter nicht gesagt hat, wann es den Preview-Status verlässt, ersetzt oder eingestellt wird. Die Position von GPT-6 Sol ist das Gegenteil: Es ist ein allgemein verfügbares API-Produkt mit veröffentlichter Preisliste, und seit dem 7. Oktober 2026 ist es außerdem der Standard in der App, die die meisten Ihrer Kolleginnen und Kollegen verwenden. Vom Anbieter berichtet und bislang noch nicht reproduziert: Laut OpenAI setzt GPT-6 in ChatGPT Antworten unter Verwendung von Text, Grafiken, Diagrammen und interaktiven Steuerelementen zusammen – über eine Funktion, die OpenAI Intelligent UI nennt –, Antworten, die eine Websuche erfordern, beginnen 44 % früher als bei GPT-5.6 Instant, und die Effort-Stufe Extra High beginnt genauso schnell zu antworten wie GPT-5.6 auf Medium. Nichts davon ändert etwas an einer API-Integration. All das ist der Grund, warum GPT-6 inzwischen der allgegenwärtige Standard ist – und die Preview nicht.
Es gibt auch eine einfache Version des Arguments. Sie zahlen 25 % mehr pro abgeschlossener Aufgabe, bei einem niedrigeren Fähigkeitswert, für ein Modell, dessen Lebenszyklus nicht deklariert ist. Das Gegenargument ist real — Sie bekommen GPQA Diamond mit 94 % und Audio-Eingabe —, aber es ist ein spezifisches Argument für eine spezifische Arbeitslast, kein allgemeiner Grund, das Modell zu bevorzugen.
Eine Vorschau testen, ohne darauf zu wetten
Der Fehler, den man bei einem Modell in der Position von Gemini 3.1 Pro vermeiden sollte, ist, „sollten wir es einsetzen" als eine einzige binäre Entscheidung zu behandeln. Das ist sie nicht. Sowohl Gemini 3.1 Pro Preview als auch GPT-6 Sol stehen im Katalog von OrcaRouter hinter einem OpenAI-kompatiblen Endpoint und einem einzigen Schlüssel, mit 0 % Aufschlag auf den Listenpreis des Anbieters — die Preview lässt sich also in einen echten Request-Pfad einbinden, an den eigenen Workloads messen und behalten oder verwerfen, ohne einen zweiten Anbietervertrag oder eine Codeänderung.
Automatisches Failover ist das, was dies für ein Modell in einem Preview-Lebenszyklus sicher macht. Leite den Audio- und Video-Datenverkehr an Gemini 3.1 Pro weiter, wo es das Einzige der beiden ist, das die Eingabe annehmen kann; leite den Datenverkehr für Software-Engineering und lange Ausgaben an GPT-6 Sol weiter; und konfiguriere den Fallback so, dass, falls der Preview-Endpunkt abgekündigt, gedrosselt oder still im Preis geändert wird, die Anfrage auf einem allgemein verfügbaren Modell landet, statt fehlzuschlagen. Das ist die Struktur, die eine sieben Monate alte Preview verdient – nicht Vermeidung, sondern ein Weg, der nicht von ihr abhängt.
Wenn Sie noch einen Schritt weiter gehen möchten, setzt die Routing-DSL mehrere Modelle zu einem einzigen logischen Aufruf zusammen, sodass eine Anfrage gegen Gemini 3.1 Pro und GPT-6 Sol versucht und die Antwort nach Ihren eigenen Kriterien statt nach denen eines einzelnen Anbieters ausgewählt werden kann. Modell-Fusion macht dasselbe in die andere Richtung – ein Panel von Modellen, die eine Frage beantworten –, was ein vernünftiger Weg ist, herauszufinden, wo sich die spezifischen Stärken einer Preview bezahlt machen, bevor man einen Produktionspfad darauf festlegt.

Das Urteil – und die Zahl, auf die man achten sollte
Für neue Arbeiten ist GPT-6 Sol die sicherere Wahl in vier der sechs Dimensionen, die über ein Deployment entscheiden, und pro abgeschlossener Aufgabe ist es günstiger, während es bei derselben Revision 17,9 Indexpunkte mehr erzielt. Für Workloads, die Audio- oder Videoeingabe benötigen, oder dort, wo ein GPQA Diamond von 94,1 % das ist, was Sie kaufen, gewinnt Gemini 3.1 Pro Preview nach wie vor, und das Preview-Label ist eher ein Risiko, das es zu managen gilt, als ein Grund, sich abzuwenden.
Die Zahl, auf die es ankommt, ist nicht der Index. Es ist das Datum im Namen des Endpunkts von Gemini 3.1 Pro. Wenn das Preview-Suffix wegfällt – oder wenn Argon mit einer echten API-Kennung allgemein verfügbar wird –, ändert sich dieser Vergleich vollständig, und die siebenmonatige Lücke zwischen dem letzten Release der Pro-Stufe und heute wird zu dem, worum es in dem Artikel eigentlich geht.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
