
GPT-6 Sol vs. Gemini 3.1 Pro: Die Preisdifferenz ist kleiner, als es der jeweilige Launch-Post zugibt
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Beide Modelle kosten 2,00 $ pro Million Eingabe-Token. GPT-6 Sol berechnet 10,00 $ pro Million Ausgabe; Gemini 3.1 Pro berechnet 12,00 $. Gemessen an den Listenpreisen liegen GPT-6 Sol und das sechs Monate alte Gemini 3.1 Pro innerhalb von 20 % voneinander, was dies zum am wenigsten dramatischen Preisvergleich im aktuellen Lineup macht – und zum irreführendsten, denn keines der beiden Modelle rechnet bei Langkontext-Arbeit tatsächlich mit seinem Listenpreis ab, und die beiden Tarifgrenzen liegen an unterschiedlichen Stellen und werden in unterschiedliche Richtungen neu bepreist.
Das ist der Vergleich, den man ordentlich durchführen sollte. GPT-6 Sol wurde am 22. September 2026 zu $2/$10 eingeführt, eine Senkung um 50 % gegenüber GPT-5.6 Sol, mit einer Long-Context-Stufe oberhalb von 272.000 Eingabe-Tokens, die den Input etwa verdoppelt und den Output um die Hälfte erhöht. Gemini 3.1 Pro ist seit dem 19. Februar 2026 zu $2/$12 verfügbar, mit einer Stufengrenze bei 200.000 Tokens, die auf $4/$18 führt, und einem Batch-Tarif von $1/$6. Gleicher Nennpreis, andere Tarifkarten-Geometrie, und die folgende Rechnung entscheidet, welche für Ihren Traffic günstiger ist.
Zwei Tarifkarten, maßstabsgetreu gezeichnet
• Basiseingabe — GPT-6 Sol 2,00 $ pro 1 Mio. vs. Gemini 3.1 Pro 2,00 $ pro 1 Mio.
• Basis-Output — GPT-6 Sol 10,00 $ pro 1 Mio. vs. Gemini 3.1 Pro 12,00 $ pro 1 Mio.
• Langkontext-Schwelle — GPT-6 Sol über 272K Eingabe vs. Gemini 3.1 Pro über 200K Eingabe
• Langkontext-Tarif — GPT-6 Sol etwa 4,00 $ / 15,00 $ vs. Gemini 3.1 Pro 4,00 $ / 18,00 $
• Umfang der Neubepreisung — GPT-6 Sol bepreist die gesamte Anfrage neu vs. Gemini 3.1 Pro bepreist die gesamte Anfrage neu
• Cache — GPT-6 Sol rund 90 % günstiger bei gecachter Eingabe als Gemini 3.1 Pro, dessen Cache-Preise zum Start nicht erneut genannt wurden
• Batch — Batch-Tarif von GPT-6 Sol nicht veröffentlicht vs. Gemini 3.1 Pro 1,00 $ / 6,00 $
• Kontextfenster — GPT-6 Sol 872K laut Artificial Analysis, 1,05M angegeben vs. Gemini 3.1 Pro 1M Eingabe
• Maximale Ausgabe — GPT-6 Sol 128K vs. Gemini 3.1 Pro etwa 64K bis 66K
• AA Intelligence Index (v4.3.2) — GPT-6 Sol 48 gegen Gemini 3.1 Pro 30

Daraus ergeben sich zwei strukturelle Punkte. Erstens liegen die Long-Context-Grenzen nahe beieinander, sind aber nicht identisch – 272K gegenüber 200K – und beide wenden den höheren Satz auf die gesamte Anfrage an statt nur auf den Überschuss. Ein Aufruf mit 210K Tokens kostet bei Gemini 3.1 Pro den Premium-Tarif und bei GPT-6 Sol den Basistarif. In diesem 72.000-Token-Band unterscheiden sich die beiden Modelle preislich am stärksten.
Zweitens ist der Ausgaberaum nicht vergleichbar. GPT-6 Sol erlaubt 128K Tokens Ausgabe; Gemini 3.1 Pro endet bei etwa 64K bis 66K. Wenn Ihre Arbeitslast lange Artefakte erzeugt – vollständige Dateineuschreibungen, Langformentwürfe, ausgedehnte Chain-of-Thought-Traces, die Sie tatsächlich behalten –, ist diese Obergrenze wichtiger als der 2-Dollar-Unterschied bei den Ausgabepreisen.
Ein durchgerechnetes Beispiel, denn die Schlagzeilenraten verbergen die Antwort.
Nehmen Sie eine realistische monatliche Arbeitslast: 10 Millionen Input-Tokens und 2 Millionen Output-Tokens, alles mit kurzem Kontext.
• GPT-6 Sol — 10 Mio. Eingabe zu 2,00 $ ergeben 20,00 $, 2 Mio. Ausgabe zu 10,00 $ ergeben 20,00 $. Gesamt: 40,00 $.
• Gemini 3.1 Pro — 10 Mio. Eingabe zu 2,00 $ sind 20,00 $, 2 Mio. Ausgabe zu 12,00 $ sind 24,00 $. Gesamt: 44,00 $
GPT-6 Sol ist 9 % günstiger. Das ist die gesamte Differenz, und sie ist klein genug, dass eine einzige Engineering-Entscheidung an anderer Stelle im Stack sie zunichtemachen kann.
Machen Sie nun dieselbe Arbeitslast langkontextig – einen Agenten, der bei jedem Aufruf 300K Token Arbeitszustand mitführt. Beide Modelle überschreiten ihre Schwellenwerte.
• GPT-6 Sol — Input bei rund 4,00 $ ergibt 40,00 $, Output bei rund 15,00 $ ergibt 30,00 $. Gesamt: 70,00 $
• Gemini 3.1 Pro — Eingabe bei $4,00 ergibt $40,00, Ausgabe bei $18,00 ergibt $36,00. Gesamt: $76,00
Beide Rechnungen verdoppeln sich nahezu, und GPT-6 Sol bleibt vorn, doch der Abstand liegt weiterhin unter 10 %. Langer Kontext kippt dieses Duell nicht; er macht beide Optionen nur teuer.
Der interessante Fall ist Caching und Batching, wo die beiden Anbieter unterschiedliche Wetten eingegangen sind. Wenn 80 % Ihrer Eingabe ein stabiler Präfix sind, verändert der Cache-Rabatt von GPT-6 Sol von ungefähr 90 % die Rechnung erheblich — 8 Mio. gecachte Token zu etwa 0,20 $ pro Million sind 1,60 $, plus 2 Mio. frische Token zu 2,00 $ für 4,00 $, plus 20,00 $ Ausgabe, was insgesamt fast 25,60 $ ergibt. Der Batch-Tarif von Gemini 3.1 Pro erledigt dieselbe Art von Arbeit aus der anderen Richtung: Bei 1,00 $ Eingabe und 6,00 $ Ausgabe landet dieselbe 10-Mio./2-Mio.-Arbeitslast bei 10,00 $ plus 12,00 $, also 22,00 $.
Die ehrliche Zusammenfassung lautet also: GPT-6 Sol gewinnt bei interaktivem Traffic und bei Workloads mit gecachtem Prefix, Gemini 3.1 Pro gewinnt bei allem, was sich batchen lässt, und der Unterschied zwischen den beiden besten Fällen beträgt ein paar Dollar pro zehn Millionen Token. Das ist keine Preisfrage. Es ist eine Frage der Workload-Form.
Die Fähigkeitslücke ist die eigentliche Entscheidung
Einundfünfzig Indexpunkte trennen diese Modelle auf demselben Board: GPT-6 Sol bei 48, Gemini 3.1 Pro bei 30. Das ist nicht knapp, und es ist der Grund, warum die Preisparität eher eine Kuriosität als eine Wettbewerbsbedrohung ist.
Der Intelligence Index von Artificial Analysis ist ein zusammengesetztes Maß, und zusammengesetzte Maße können schmeicheln. Doch ein so großer Abstand hält sich über die Komponenten-Benchmarks hinweg, die jeder Anbieter veröffentlicht:
• AA Intelligence Index — GPT-6 Sol 48, auf Platz 18 von 212 vs. Gemini 3.1 Pro 30, auf Platz 81 von 212
• Ausgabegeschwindigkeit — GPT-6 Sol 104,4 Token/Sek. vs. Gemini 3.1 Pro 115,0 Token/Sek.
• Zeit bis zum ersten Token — GPT-6 Sol 107,18 s vs. Gemini 3.1 Pro 32,96 s, gegenüber einem Board-Median von 3,87 s
• GPQA Diamond — Gemini 3.1 Pro 94,3 % (von Google gemeldet)
• ARC-AGI-2 — Gemini 3.1 Pro 77,1 % (von Google gemeldet)
• HLE — Gemini 3.1 Pro 44,4 % (laut Google)
• SWE-bench Verified — Gemini 3.1 Pro 80,6 % (Angabe von Google)
• Terminal-Bench 2.0 — Gemini 3.1 Pro 68,5 % (von Google angegeben)
• LiveCodeBench Pro — Gemini 3.1 Pro 2887 Elo (von Google angegeben)
Lesen Sie diese Google-Zahlen genau, denn sie sind nicht schwach. 94,3 % bei GPQA Diamond und 77,1 % bei ARC-AGI-2 sind starke Ergebnisse, und sie wurden im Februar veröffentlicht. Der Grund, warum der Index Gemini 3.1 Pro immer noch dreißig Punkte niedriger einordnet, ist, dass der Index agentische und langfristige Aufgaben stark gewichtet, und genau dort zeigen sich die sechs Monate zwischen diesen beiden Veröffentlichungen. Gemini 3.1 Pro ist ein starkes Reasoning-Modell. GPT-6 Sol ist ein starker Agent.
Die Latenz ist der Punkt, an dem Gemini 3.1 Pro klar gewinnt, und das ist kein kleiner Sieg. Ein erstes Token nach 33 Sekunden ist in absoluten Zahlen langsam – der Board-Median liegt bei 3,87 Sekunden –, doch es ist ein Drittel der 107 Sekunden von GPT-6 Sol. Für alles, worauf ein Mensch wartet, ist Gemini 3.1 Pro von diesen beiden der Einzige, der überhaupt brauchbar ist. Das erste Token von GPT-6 Sol nach 107 Sekunden ist die Zahl, die den meisten Pilotprojekten das Aus bereiten wird, und es lohnt sich festzuhalten, dass sein Durchsatz, sobald es einmal läuft, hervorragend ist: 104,4 Token pro Sekunde liegen nicht nennenswert hinter den 115,0 von Gemini. Das Modell ist nicht langsam. Es braucht nur lange, bis es anfängt.
Das Ding, dem Gemini 3.1 Pro nicht entkommen ist
Gemini 3.1 Pro befindet sich seit Februar in der Vorschau. Sechs Monate sind eine lange Zeit, um ein Vorschau-Label zu tragen, und Google hat in der Zwischenzeit die Flash-Modelle 3.5, 3.6 und 3.8 veröffentlicht, ohne 3.1 Pro in die allgemeine Verfügbarkeit zu überführen. Auf OrcaRouter lautet der routbare Slug weiterhin gemini-3.1-pro-preview, und eine separate gemini-3.1-pro-preview-customtools-Variante existiert daneben.
Für die Beschaffung ist das in einer Hinsicht relevant, in der Benchmarks es nicht sind. Preview-Endpunkte können sich unter Ihnen ändern, kurzfristig abgekündigt werden und andere Rate Limits haben als ein GA-Modell. Wenn Sie heute auf Gemini 3.1 Pro aufbauen, bauen Sie auf einer Preview auf, und Sie sollten das Migrationsrisiko entsprechend einpreisen – insbesondere da Googles eigene neuere Flash-Modelle es in mehreren Dimensionen bereits überholt haben.
GPT-6 Sol hat dieses Problem nicht, aber ein anderes: Die Verfügbarkeit zum Start war eingeschränkter, als die Ankündigung nahelegte. Es ist in der API, in ChatGPT Work und in Codex in kostenpflichtigen Tarifen verfügbar – und Enterprise-Administratoren müssen es aktivieren, bevor ihre Nutzer es sehen können. In ChatGPT Chat ist es nicht. Ein Flaggschiff, das die Consumer-Oberfläche auslässt, ist ein Flaggschiff, das auf Entwickler ausgerichtet ist.
Das billige und das gute zusammen laufen lassen
Das ist der seltene Vergleich, bei dem die Antwort offensichtlich „beides“ lautet, und die Preisgestaltung stützt das. Gemini 3.1 Pro ist das Modell, das man vor einen Menschen setzt: schnelles erstes Token, Batch-Tarife, die Massenaufträge günstig machen, starke veröffentlichte Reasoning-Werte. GPT-6 Sol ist das Modell, das man hinter eine Warteschlange stellt: langsam beim Start, exzellenter Durchsatz, einundfünfzig Indexpunkte besser und preislich innerhalb von 20 % des Modells, das es bei interaktiver Arbeit ersetzt.
Gemini 3.1 Pro ist bei OrcaRouter zum Listenpreis von Google verfügbar, im Durchleitungsmodell bedeutet das, dass eine Preisänderung von Google bei uns noch am selben Tag aktiv ist, statt auf eine Neuverhandlung durch einen Reseller zu warten. GPT-6 Sol ist zum Zeitpunkt dieses Textes nicht in unserem Katalog — erreichbar ist es über OpenAIs eigene API —, eine Route, die beide umfasst, bedeutet also einen Schlüssel für Gemini und daneben eine direkte OpenAI-Integration. Das Routing zwischen einem schnellen Vorschaumodell und einem langsameren Frontier-Modell ist genau der Fall, für den das automatische Failover gebaut wurde: Wenn der Vorschau-Endpunkt schlechter wird oder abgekündigt wird, wechselt die Route, und man erfährt es aus einer Logzeile statt von den eigenen Nutzern.

Die Entscheidungsregel
Wähle Gemini 3.1 Pro, wenn ein Mensch wartet, wenn sich die Arbeit für Stapelverarbeitung eignet oder wenn die Ausgabe kurz bleibt. Ein erstes Token nach 33 Sekunden ist nicht gut, aber es ist dreimal besser als bei GPT-6 Sol, und der Batch-Preis von 1 $/6 $ ist der günstigste Weg, ein großes Korpus durch ein starkes Reasoning-Modell zu bewegen. Akzeptiere, dass du dich auf einem Preview-Endpunkt befindest, und plane die Migration.
Wählen Sie GPT-6 Sol, wenn die Arbeit agentisch, langfristig und unbeaufsichtigt ist und wenn Ihr Kontext unter 272K Tokens bleibt. Es erzielt 48 gegenüber 30, es erzeugt 128K Ausgabe gegenüber etwa 64K, und seine Cached-Prefix-Preisgestaltung mit 90 % Rabatt macht repetitive agentische Schleifen ungewöhnlich günstig. Sein erstes Token nach 107 Sekunden ist ein Merkmal seiner Denkweise, kein Fehler, und es wird erst dann zum Problem, wenn Sie es jemandem vorführen.
Wähle nicht nach dem Preis. Die beiden liegen bei einer Workload mit kurzem Kontext innerhalb von 9 % voneinander und bei einer mit langem Kontext innerhalb von 10 %. Der monatliche Unterschied von neun Dollar bei einem Buch mit zehn Millionen Tokens ist kein Grund, eines der beiden Modelle zu wählen, und der 51-Punkte-Abstand im Index ist es.

In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
