
GPT-6.1 Sol vs. Gemini 3.1 Pro: Sieben Monate Vorschau gegen acht Tage Auslieferung
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Gemini 3.1 Pro steht seit siebeneinhalb Monaten auf der Preisliste des Anbieters und hat die Preview nie verlassen. Angekündigt am 19. Februar 2026, heute dokumentiert an einem Endpunkt, der auf -preview endet, ohne Zusage einer allgemeinen Verfügbarkeit und – bezeichnenderweise – auch ohne Abschaltdatum. GPT-6.1 Sol ist acht Tage alt, ausgeliefert am 29. September 2026 zu 2,00 $ pro Million Input- und 10,00 $ pro Million Output-Tokens. Stellt man sie im Artificial Analysis Intelligence Index nebeneinander, ist die sieben Monate alte Preview nicht bloß konkurrenzfähig, sondern liegt in der neuesten Index-Revision 22 Punkte vom neueren Modell entfernt – 29,7 gegenüber 51,8 in v4.3.2 –, während sie pro Index-Aufgabe 1,8× mehr kostet, 1,30 $ gegenüber 0,72 $. Genau diese Kombination macht den Vergleich interessant statt zur Formsache: In diesem Ranking liegt das ältere Modell sowohl bei der Leistungsfähigkeit zurück als auch bei den Kosten vorn – für eine Preview, die eigentlich hätte aufsteigen sollen, ist das die falsche Reihenfolge. Doch der Vorbehalt zur Index-Revision wiegt hier schwerer als irgendwo sonst in diesem Set, denn eine 29,7 und eine 53 werden auf derselben Seite genannt, und sie sind nicht dieselbe Messung.
Beide sind große multimodale Modelle mit Kontextfenstern der 1-Million-Klasse. Gemini 3.1 Pro verarbeitet Text, Bilder, Video, Audio und PDFs mit einer Ausgabegrenze von 65.536 Tokens und einer Preisstufe bei 200.000 Tokens, oberhalb derer sich der Satz verdoppelt. GPT-6.1 Sol verarbeitet Text, Bilder und Dateien mit einem Fenster von 1.050.000 Tokens, einer Ausgabegrenze von 128.000 Tokens, fünf Stufen für den Reasoning-Aufwand und einer Long-Context-Stufe oberhalb von 272.000 Prompt-Tokens. Das eine ist ein ausgeliefertes Produkt mit Support-Zusage. Das andere ist eine Vorschau mit einem offenen Lebenszyklus, und dieser Unterschied ist am Ende mehr wert als die Indexlücke.
An die Indexnummer muss die Revision angehängt werden.
Artificial Analysis führt seine Testsuite erneut aus und veröffentlicht die Scores unter der aktuellen Index-Revision neu, was bedeutet, dass dasselbe Modell zwei unterschiedliche Zahlen tragen kann, je nachdem, wann man liest. Bei Gemini 3.1 Pro ist diese Lücke ungewöhnlich groß: Frühere eigene Berichterstattung zu diesem Modell meldete 57 auf einer älteren Revision, während die Seite in ihrer heutigen Fassung 29,7 auf v4.3.2 meldet, der Version mit zehn Bewertungen, die auch die 51,8 von GPT-6.1 Sol trägt. Beide Werte sind real, und beide stehen auf derselben Website.
Was das für einen Vergleich bedeutet, ist eng umgrenzt und wichtig. Nur Zahlen aus derselben Revision lassen sich voneinander subtrahieren. Ein 29,7 und ein 51,8 aus v4.3.2 ergeben einen Abstand von 22 Punkten; ein 57 und ein 51,8 ergeben einen Abstand von fünf Punkten in die andere Richtung. Der 22-Punkte-Wert ist der hier zu verwendende, weil es der ist, bei dem beide Modelle mit derselben Suite auf derselben Skala gemessen wurden — und weil die Kosten-pro-Aufgabe-Werte, 1,30 $ gegenüber 0,72 $, aus demselben Durchlauf stammen.
• Intelligenzindex, v4.3.2 — GPT-6.1 Sol 51,8 vs. Gemini 3.1 Pro 29,7
• Kosten pro Index-Aufgabe — GPT-6.1 Sol 0,72 $ gegenüber Gemini 3.1 Pro 1,30 $
• Kosten für den vollständigen Durchlauf — GPT-6.1 Sol $1,082 vs. Gemini 3.1 Pro $1,935
• Kontextfenster — GPT-6.1 Sol 1.050.000 Tokens vs. Gemini 3.1 Pro 1.000.000 Tokens
• Maximale Ausgabe — GPT-6.1 Sol 128.000 Token vs. Gemini 3.1 Pro 65.536 Token
• Eingabemodalitäten — Text, Bild und Datei bei beiden, plus Video, Audio und PDF bei Gemini 3.1 Pro
Zwei dieser Zeilen sprechen für die Preview und verdienen es, klar ausgesprochen zu werden. Gemini 3.1 Pro akzeptiert Video und Audio, was GPT-6.1 Sol nicht tut; wenn Ihre Pipeline eine Bildschirmaufzeichnung oder einen Anruf einliest, ist das eine Fähigkeitslücke, die kein Score schließt. Und seine Obergrenze von 65.536 Token für die Ausgabe ist halb so hoch wie die von GPT-6.1 Sol, was bei der Generierung langer Formate zählt, aber bei agentischer Arbeit selten bindet, wo Ausgaben kurz und Turns zahlreich sind.
Warum die neuere Zahl diejenige ist, die Ihre Entscheidung beeinflussen sollte
Die Preisfrage ist interessanter als die Indexfrage.
Die Preisliste für Gemini 3.1 Pro beläuft sich auf 2,00 $ für Eingabe und 12,00 $ für Ausgabe pro Million Tokens, bei zwischengespeicherter Eingabe zu 0,20 $ und Cache-Schreibvorgängen zu 0,375 $, mit einer Tarifgrenze bei 200.000 Prompt-Tokens, oberhalb derer die Sätze 4,00 $ und 18,00 $ betragen. GPT-6.1 Sol kostet 2,00 $ für Eingabe und 10,00 $ für Ausgabe, bei zwischengespeicherter Eingabe zu 0,10 $, Cache-Schreibvorgängen zu 2,50 $ und einer Grenze bei 272.000 Tokens, oberhalb derer die Sätze 4,00 $ und 15,00 $ betragen. Der beworbene Eingabepreis ist identisch. Der Ausgabepreis ist bei GPT-6.1 Sol um 20 % niedriger, und die Long-Context-Stufe ist auf beiden Achsen niedriger. Die beiden Preislisten unterscheiden sich beim Caching: 0,10 $ gegenüber 0,20 $ pro Million zwischengespeicherter Eingabe-Tokens, wobei das Preview-Modell Cache-Schreibvorgänge günstiger bepreist, mit 0,375 $ gegenüber 2,50 $.

Dieses letzte Paar kehrt die vordergründige Lesart um. Wenn Ihre Arbeitslast cache-lastig ist – ein langer, fester System-Prompt, der bei jedem Turn erneut gesendet wird, oder ein Dokument, das während einer Sitzung mehrfach gelesen wird –, ist die Cache-Write-Zeile von Gemini 3.1 Pro dramatisch günstiger, und seine Cache-Read-Zeile ist doppelt so hoch. Welches Modell gewinnt, hängt davon ab, wie oft Sie erneut lesen, was Sie geschrieben haben, und diese Zahl steht in Ihren eigenen Logs, und kein Benchmark veröffentlicht sie. Eindeutig ist der Indexpreis: Bei identischer Evaluierungsarbeit lag das acht Tage alte Modell am Ende 33 % günstiger, und die sieben Monate alte Preview lag insgesamt 79 % teurer als das neuere Modell.
Das Vorschau-Badge ist die operative Tatsache
Das ist der Teil des Vergleichs, den eine Punktetabelle nicht transportieren kann, und bei einem Produktionseinsatz wiegt er schwerer als alles oben Genannte.
Gemini 3.1 Pro befindet sich seit Februar in der Vorschau, ohne Ankündigung der allgemeinen Verfügbarkeit und ohne Abschaltdatum. Beide fehlenden Angaben sind wichtig und wirken in entgegengesetzte Richtungen. Kein GA bedeutet keine Lebenszyklus-Verpflichtung: Vorschau-Endpunkte fallen nicht unter dieselben Bedingungen für Abkündigungsmitteilungen wie allgemein verfügbare und können unter einem Aufrufer ohne Versionssprung überarbeitet werden – der übliche Grund, in der Produktion eine exakte Modellkennung statt eines Alias festzuschreiben. Kein Abschaltdatum bedeutet, dass Sie auch kein Migrationsfenster planen können – das Modell hat das Quartal, in dem es nach allgemeiner Erwartung aus der Vorschau hervorgehen sollte, bereits überdauert, und diese Familie hat schon einmal ein Pro-Modell abgeschaltet.
Die Position von GPT-6.1 Sol ist das Spiegelbild. Es ist acht Tage alt, was bedeutet, dass seine unabhängige Evaluierungshistorie nur eine Konfiguration umfasst und seine Fehlermodi nicht dokumentiert sind; es gibt keinen Praktiker-Korpus, den man konsultieren kann, wenn es sich fehlverhält. Seine Veröffentlichung selbst war die Nachricht, und es wird mit einer Supportstruktur ausgeliefert, über die die Vorschau nicht verfügt.
Das sind unterschiedliche Risiken, nicht unterschiedlich viel Risiko. Wähle die Vorschau, und du wettest darauf, dass der Anbieter weiterhin einen Endpunkt bereitstellt, ohne vertraglich dazu verpflichtet zu sein. Wähle das acht Tage alte Modell, und du wettest darauf, dass ein einziger Benchmark-Lauf und acht Tage Verfügbarkeit ausreichend Belege für deine Workload sind. Der Index hilft bei keinem von beiden.
Das Einzige, was das einfach machen würde
Eine Ankündigung der allgemeinen Verfügbarkeit für Gemini 3.1 Pro, mit einer Modellkennung aus dem -Preview-Namensraum und einer veröffentlichten Lebenszyklus-Zusage, würde den Großteil davon lösen. Sie würde die 22-Punkte-Indexlücke oder die 1,8×-Kostenlücke pro Aufgabe nicht schließen, aber sie würde das Deprecation-Risiko beseitigen, das den Vergleich derzeit unausgewogen macht, und sie würde es einem Team ermöglichen, das Modell zu übernehmen, ohne eine Preview-Kennung festzuschreiben und zu hoffen.
Das Ausbleiben dieser Ankündigung nach siebeneinhalb Monaten ist selbst eine Information. Eine Vorschau, die Updates validieren sollte, bevor sie – nach der Formulierung des Anbieters vom Februar – „bald“ GA werden, hatte dafür zwei volle Quartale Zeit. Entweder läuft die Validierung noch, oder die Vorschau ist das Produkt – und von außen kann ein Anrufer nicht sagen, was davon zutrifft. Was ein Anrufer tun kann, ist, die Unsicherheit einzupreisen und entsprechend zu routen.
Beide auf einer Taste, sodass die Antwort pro Arbeitslast ausfallen kann.

Gemini 3.1 Pro ist auf OrcaRouter zu den eigenen angegebenen Tarifen verfügbar – 2,00 $ / 12,00 $, ab 200.000 Prompt-Tokens steigt der Tarif auf 4,00 $ / 18,00 $, Cache-Lesevorgänge kosten 0,20 $. GPT-6.1 Sol ist auf OrcaRouter für 2,00 $ / 10,00 $ erhältlich, ab 272.000 Prompt-Tokens steigt der Tarif auf 4,00 $ / 15,00 $, Cache-Lesevorgänge kosten 0,10 $. Bei beiden gilt der Listenpreis des Anbieters, ohne Aufschlag, ein Schlüssel und eine Rechnung.
Das macht die heiklen Teile dieses Vergleichs günstig auflösbar. Video- und Audio-Ingest bleibt bei der Preview, weil nichts anderes im Paar es akzeptiert; die volumenintensive Text- und Coding-Arbeit geht an das neuere Modell, das pro Aufgabe günstiger und bei identischer Evaluierungsarbeit 33 % günstiger ist. Wenn der Preview-Endpunkt überarbeitet oder zurückgezogen wird, verschiebt ein automatisches Failover diese Aufrufe auf eine andere Route, statt sie fehlschlagen zu lassen — genau die Absicherung, die das Lebenszyklusrisiko einer Preview erfordert. Und weil beide hinter einem einzigen OpenAI-kompatiblen Endpunkt sitzen, lässt sich der Preisvergleich, auf den es tatsächlich ankommt, an einem Nachmittag mit Ihrem eigenen Traffic durchführen, statt ihn anhand einer Preisliste zu diskutieren.

Die vertretbare Lesart ist also nicht, welches Modell besser ist. Sie ist vielmehr, dass diese beiden nahezu gleich bepreist werden, obwohl sie in ihrer Lebenszyklusreife sieben Monate und auf der aktuellen unabhängigen Rangliste 22 Punkte auseinanderliegen, und dass die tatsächlichen Vorteile des Preview-Modells – Video- und Audioeingabe, kostengünstige Cache-Schreibvorgänge – eng begrenzt und spezifisch sind. Wenn Ihr Workload diese Modalitäten benötigt, ist Gemini 3.1 Pro die einzige der beiden Optionen, und die Indexlücke ist der Preis für den Eintritt. Wenn nicht, wird Ihnen ein Preview-Endpunkt mit offener Zukunft zu Kosten pro Aufgabe angeboten, die 80 % über denen eines Modells liegen, das letzte Woche veröffentlicht wurde, und die Beweislast kehrt sich um.
