
Was ist Gemini 3.1 Pro? Googles Pro-Stufe hat sich seit sieben Monaten nicht bewegt
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Gemini 3.1 Pro ist das einzige aktive Modell der Pro-Klasse in seiner eigenen Familie. Es wurde am 19. Februar 2026 angekündigt, und sieben Monate später führt die eigene Modelldokumentation des Anbieters es noch immer unter „Vorschau“ am Endpunkt gemini-3.1-pro-preview — keine allgemeine Verfügbarkeit, kein Abschaltdatum, kein Nachfolger veröffentlicht. In denselben sieben Monaten brachte der Anbieter fünf Flash-Releases auf den Markt, und die neueste davon, Gemini 3.8 Flash, erzielt jetzt elf Punkte mehr auf dem unabhängigen Index, den die meisten zitieren. Diese Lücke ist der Grund, warum eine Seite, die erklärt, was Gemini 3.1 Pro ist, damit beginnen muss, was es nicht ist.
Wenn Sie nur die Zwei-Satz-Version möchten: Gemini 3.1 Pro ist ein Closed-Weights-Reasoning-Modell mit nativer Multimodalität von Google DeepMind, das Text, Bilder, Videos, Audio und PDFs liest und Text schreibt. Sie rufen es über Googles eigene APIs oder über einen Router auf, der es bereitstellt; es verarbeitet bis zu 1.048.576 Tokens Eingabe und kostet 2,00 $ pro Million Eingabe-Tokens und 12,00 $ pro Million Ausgabe-Tokens bei einem Prompt von unter 200.000 Tokens. Es bewährt sich als langkontextfähiges multimodales Arbeitstier. Es ist nicht mehr das Modell, das Sie wählen, weil es das intelligenteste verfügbare ist.
Wo es innerhalb seiner eigenen Familie einzuordnen ist
Das ist der Teil, den die meisten Artikel überspringen, und es ist der Teil, der am meisten zählt. Die Gemini 3-Familie ist nicht eine Leiter mit einem Pro an der Spitze. Es sind zwei Leitern, die nicht mehr vergleichbar sind.
Die Flash-Leiter ist die, die sich verschoben hat. Googles Modelldokumentation, gelesen am 23. September 2026, listet Gemini 3.8 Flash, Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking als neue stabile Releases auf, wobei Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash und Gemini 3.5 Flash-Lite dahinter weiterhin stabil sind. Gemini 3.8 Flash erschien am 2. September 2026 – das dritte Flash-Release in sechs Wochen.
Die Pro-Reihe ist diejenige, die nicht weitergeführt wurde. In der Dokumentation von Google sind Gemini 3.5 Pro, 3.6 Pro, 3.7 Pro und 3.8 Pro nicht aufgeführt. Gemini 3 Pro, das Modell, das Gemini 3.1 Pro ersetzen sollte, wird als abgeschaltet geführt. Gemini 2.5 Pro existiert weiterhin, aber der Zugriff ist auf frühere Nutzer beschränkt. Damit bleibt Gemini 3.1 Pro der einzige Gemini-3-Endpunkt der Pro-Klasse, den man heute aufrufen kann – nicht weil er ein Rennen gewonnen hat, sondern weil niemand sonst angetreten ist.
Googles im Februar dargelegter Plan war, dass die Vorschau lange genug dauern würde, um „diese Updates zu validieren“ und Bereiche wie ehrgeizige agentische Workflows voranzutreiben, bevor das Modell „bald allgemein verfügbar“ wurde. Das sind Googles Worte in der Ankündigung vom Februar. Sieben Monate später ist das nicht eingetreten, und es lohnt sich, die Berichterstattung rund um die Verzögerung klar als Berichterstattung und nicht als Tatsache zu benennen: SemiAnalysis kam zu dem Schluss, dass die Arbeit an Gemini 3.5 Pro stillschweigend eingestellt worden sei, und das Wall Street Journal berichtete, wie von Sekundärmedien zitiert, dass der interne 3.5-Pro-Kandidat fallengelassen wurde, weil er die Flash-Serie nicht übertreffen konnte. Googles eigene Aussage lautet, dass 3.5 Pro weiterhin in eingeschränkten Partnertests verbleibt, ohne bestätigten Monat. Wir konnten keine Google-Erklärung finden, die die Einstellung bestätigt oder dementiert, und wir werden nicht an ihrer Stelle Partei ergreifen.
Die praktische Konsequenz ist eine Namensfalle. Wenn Sie nach dem „neuesten Gemini Pro“ suchen, ist das aktuellste Modell der Pro-Klasse, das Sie finden werden, von Februar, während die Versionsnummern auf der Flash-Seite auf 3.8 gestiegen sind. Versionsnummern geben hier keine Rangfolge der Leistungsfähigkeit über die Klassen hinweg an; sie gehören zu zwei getrennten Release-Trains.
Die Spezifikationen, die zählen
Jede unten stehende Angabe stammt aus Googles eigener Gemini-API-Dokumentation vom 23. September 2026, sofern nicht anders gekennzeichnet.
• Eingabekontext — 1.048.576 Token, dasselbe Fenster mit einer Million Token, das Google seit der 2.5-Generation ausliefert. Die Ausgabe ist separat auf 65.536 Token begrenzt, was eine Obergrenze für die Antwort darstellt, nicht für die Konversation.
• Eingabemodalitäten — Text, Bild, Video, Audio und PDF. Ausgabemodalitäten — nur Text. Keine Audioerzeugung, keine Bilderzeugung, keine Live API, dies ist also nicht das Modell für einen Echtzeit-Sprachagenten oder eine Bild-Pipeline. Google bietet für diese Aufgaben separate Gemini 3.x Flash-Varianten an.
• Reasoning — unterstützt, mit Steuerung der Denkstufe. Thinking-Tokens werden zum Ausgabetarif abgerechnet, weshalb der Ausgabepreis die Zahl ist, die Ihre Rechnung dominiert.
• Tooling — Caching, Codeausführung, Funktionsaufrufe, Search grounding, Maps grounding, strukturierte Ausgaben, URL-Kontext, die Batch API, Flex-Inferenz und Priority-Inferenz werden alle als unterstützt aufgeführt. File search wird nur in AI Studio als unterstützt aufgeführt.
• Lizenz und Gewichte — proprietär. Es gibt keine offenen Gewichte, keinen herunterladbaren Checkpoint und keinen Weg zum Selbsthosting. Jeder Zugang zu diesem Modell ist eine gehostete API.
• Endpunkte — gemini-3.1-pro-preview ist der Modellcode. Google listet außerdem eine gemini-3.1-pro-preview-customtools Variante auf. Ein Preview-Endpunkt kann sich unter Ihnen ändern, ohne dass die Version erhöht wird, was der übliche Grund dafür ist, in der Produktion exakte Modell-IDs statt Aliase festzulegen.
• Dokumentiertes Aktualisierungsdatum — auf der Modellseite steht „Last update: February 2026“. Wir konnten kein auf Googles eigener Modellseite angegebenes Wissens-Cutoff-Datum finden; Drittanbieter-Listings nennen Januar 2025, und wir kennzeichnen das als unbestätigt, statt es als Tatsache zu wiederholen.
Was es kostet
Gemini 3.1 Pro hat ein Preiskliff, und das ist die Art von Detail, die aus einer scheinbar günstigen Schätzung eine doppelt so hohe Rechnung macht. Die veröffentlichte Entwicklerpreisgestaltung von Google staffelt sich nach der Prompt-Größe statt nach der Modellversion.
• Standard-Tarif, Prompts bis zu 200.000 Tokens — 2,00 $ pro Million Eingabe-Tokens, 12,00 $ pro Million Ausgabe-Tokens, wobei Thinking-Tokens als Ausgabe gezählt werden.
• Standard-Tarif, Prompts über 200.000 Tokens — 4,00 $ Eingabe und 18,00 $ Ausgabe. Beide Raten verdoppeln sich ab derselben Schwelle. Das ist die Falle: Eine Long-Context-Workload zahlt genau deshalb das Doppelte des beworbenen Tarifs, weil sie die Funktion nutzt, für die sie das Modell gekauft hat.
• Kontext-Caching — 0,20 $ oder 0,40 $ pro Million gecachter Token, je nachdem, ob Sie über oder unter der Schwelle von 200.000 liegen, zuzüglich Cache-Speicher, der mit 4,50 $ pro Million Token pro Stunde berechnet wird.
• Batch- und Flex-Tarife — 1,00 $ Eingabe und 6,00 $ Ausgabe unter 200.000 Token, darüber 2,00 $ und 9,00 $. Etwa halber Preis für Arbeit, die warten kann.
• Prioritätsstufe — 3,60 $ Eingabe und 21,60 $ Ausgabe unterhalb der Schwelle, 7,20 $ und 32,40 $ oberhalb davon.
• Free-Tarif — für dieses Modell nicht verfügbar. Es gibt kein kostenloses Ratenlimit, mit dem man prototypisieren könnte.
Zwei Dinge sollte man über die Verlässlichkeit dieser Zahlen wissen. Googles eigene Preisseite ist hier die maßgebliche Quelle, und wir lesen sie direkt, daher sind die oben genannten Zahlen auf dem Stand vom 23. September 2026. Doch Drittanbieter-Auflistungen für dieses Modell sind wirklich uneinheitlich – ein Tracker nennt einen Satz von 2,50 $ / 15,00 $, ein anderer einen Mischpreis von 4,50 $ – und die Staffelung ist der Grund dafür. Wenn eine Seite Ihnen eine einzelne Zahl für Gemini 3.1 Pro nennt, ohne Ihnen zu sagen, für welche Prompt-Größenstufe sie gilt, ist diese Zahl für eine realistische Schätzung nicht brauchbar.
Worin es messbar gut ist – und worin messbar nicht.
Beginne mit dem, was Google behauptet, und halte das dann getrennt von dem, was unabhängige Evaluatoren gemessen haben, denn die beiden sind seit Februar deutlich auseinandergedriftet.
Googles eigene Ankündigung enthält genau eine Benchmark-Zahl: eine „verifizierte Punktzahl von 77,1 %“ bei ARC-AGI-2, die Google als mehr als das Doppelte der Reasoning-Leistung von Gemini 3 Pro beschreibt. Das ist die Zahl des Anbieters, aus Googles eigenem Beitrag abgelesen, und die einzige, die wir dort bestätigen konnten. In der Berichterstattung zum Launch machte ein viel größerer Satz die Runde — GPQA Diamond, SWE-bench Verified, Terminal-Bench 2.0, LiveCodeBench, Humanity’s Last Exam —, doch diese Zahlen tauchen in Googles eigener Ankündigung nicht auf, und die Sekundärberichte widersprechen sich bei denen, die wir überprüft haben (GPQA Diamond erscheint sowohl als 94,1 als auch als 94,3, je nachdem, wen man liest). Wir geben sie nicht als gesicherte Ergebnisse aus.
Das unabhängige Bild ist der Punkt, an dem die Geschichte eine Wendung nimmt. In der Version des Artificial Analysis Intelligence Index, die am 23. September 2026 live war, erreicht Gemini 3.1 Pro Preview 30 Punkte und belegt Rang 81 von 212 Modellen in dieser Klasse. Das mediane Modell der Klasse erreicht 25 Punkte, es liegt also über dem Durchschnitt – und der Spitzenreiter in derselben Grafik, Claude Opus 5 bei seiner maximalen Reasoning-Einstellung, erreicht 58 Punkte. Der Index selbst ist eher ein versioniertes Lineal als ein festes: Artificial Analysis hat ihn nach dem Februar-Launch überarbeitet, und die eigenen Revisionshinweise verzeichnen neue Evaluierungen, die in den Composite aufgenommen wurden. Gemini 3.1 Pro wurde als uneingeschränkter Spitzenreiter auf dem Index gemeldet, wie er zum Zeitpunkt seines Februar-Launches stand, mit 57 Punkten. Das ist nicht dasselbe Lineal wie die 30, und wir werden die beiden Zahlen nicht nebeneinanderstellen, als würden sie einen Rückgang abbilden.
Was die aktuelle Zuordnung tatsächlich zeigt, ist ein echtes Profil, und zwar ein einseitiges:
• Intelligenz — 30 im Index, Rang 81 von 212. Über dem Median, weit von der Frontier entfernt.
• Geschwindigkeit — 116,5 Ausgabe-Token pro Sekunde, Rang 38 von 212. Bemerkenswert schnell für ein Reasoning-Modell.
• Kosten — $0.67 für die Ausführung einer Intelligence-Index-Aufgabe, Rang 31 von 212. Das ist günstig pro Arbeitseinheit, weil das Modell sparsam mit Thinking-Tokens umgeht.
• Ausführlichkeit — 67 Mio. Output-Tokens, um den Index abzuschließen, gegenüber einem Klassenmedian von 88 Mio. Rang 39 von 212; Artificial Analysis bezeichnet es als „ziemlich knapp“. Zum Vergleich: Gemini 3.8 Flash verbraucht mit hohem Reasoning 170 Mio. Tokens in derselben Suite und kostet 1,24 $ pro Aufgabe — mehr als Gemini 3.1 Pro, obwohl der Preis pro Token niedriger ist.
Die ehrliche Einschätzung ist also nicht: „Das alte Modell wird überall geschlagen.“ Gemini 3.1 Pro ist schnell und token-effizient, und auf Basis der Kosten pro Aufgabe schlägt es sein eigenes neueres Schwestermodell. Was es einbüßt, ist die Spitze der Leistungsfähigkeit, und bei jeder Arbeitslast, bei der Qualität die bindende Restriktion ist, ist das die einzige Achse, die zählt.

Die Frage der Verfügbarkeit im September
Es gibt eine aktuelle Entwicklung rund um dieses Modell, und dabei handelt es sich um eine Frage, nicht um eine Veröffentlichung. Seit dem 18. September 2026 berichten Nutzer in Googles eigenem Entwicklerforum für AI Studio, dass Gemini 3.1 Pro aus der Modellauswahl von AI Studio verschwunden sei – der Titel des Threads datiert die Änderung auf den 18.09.2026 –, wobei zahlende Nutzer sagen, sie seien auf Gemini 3.8 Flash und von dort auf 3.7 und 3.6 Flash umgestellt worden. In dem Thread, den wir gelesen haben, hatte kein Google-Mitarbeiter geantwortet, es gibt keinen Abkündigungshinweis, und es wurde keine Ursache genannt. Als wir am 23. September 2026 nachsahen, war das Modell weiterhin aufgeführt und weiterhin über die Gemini API sowie über unseren eigenen Katalog aufrufbar.
Wir stufen dies als ungelöste Nutzerberichte in Googles eigenem Forum ein, nicht als Stilllegung und nicht als Ausfall. Aber wenn Ihr Produktionspfad speziell von diesem Modell abhängt, ist das ein Grund, einen Fallback konfiguriert zu haben, statt anzunehmen, dass ein Preview-Endpunkt eine feste Einrichtung ist.
Wer sollte es auswählen, und wer nicht?
Wählen Sie Gemini 3.1 Pro, wenn Ihr Problem lang und multimodal ist. Das Fenster von einer Million Token mit nativer Video-, Audio- und PDF-Eingabe ist nach wie vor der Grund, hier zu sein, und das Alter des Modells ändert daran nichts. Konkret: Analyse ganzer Repositories, Prüfung von Stunden aufgezeichneter Meetings oder Videomaterials, Extrahieren strukturierter Daten aus gemischtmedialen Dokumentensammlungen oder jede Pipeline, in der ein einzelner Prompt berechtigterweise über 200.000 Token hinausläuft und die Alternative eine Retrieval-Schicht ist, die Sie selbst erstellen und bewerten müssten. Seine Token-Effizienz ist ein echtes zweites Argument – es absolviert eine Task-Suite mit 67 Mio. Ausgabe-Token, während Gemini 3.8 Flash 170 Mio. verbraucht, sodass die Rechnung pro Aufgabe niedriger ausfallen kann, obwohl der Preis pro Token höher erscheint.
Wählen Sie in drei Fällen etwas anderes. Wenn Sie Googles derzeit beste Antwort auf eine schwierige Reasoning-Frage oder eine Coding-Aufgabe mit langem Horizont wollen, übertrifft Gemini 3.8 Flash Gemini 3.1 Pro im aktuellen unabhängigen Index, ist allgemein verfügbar und nicht nur als Preview, kostet bis zum 31. Dezember 2026 0,75 $ pro Million Eingabe- und 3,75 $ pro Million Ausgabe-Token und bietet eine kostenlose Stufe, die Gemini 3.1 Pro nicht hat. Es verbraucht mehr Thinking-Tokens, um dorthin zu gelangen – das ist der Kompromiss, und er ist real. Wenn Sie die absolute Spitze brauchen, ist das derzeit kein Google-Modell: Im selben Index-Chart führt Claude Opus 5 mit maximalem Reasoning mit 58 gegenüber Gemini 3.1 Pro mit 30. Und wenn Ihr Workload latenz- oder kostenempfindlich und wenig anspruchsvoll ist – Klassifizierung, Extraktion, Routing, kurze Zusammenfassung –, erledigt eine Flash-Lite-Stufe oder ein kleines Open-Weights-Modell die Aufgabe für einen Bruchteil von 2,00 $ pro Million Eingabe-Token, und dafür Pro-Tarife zu zahlen, ist reine Verschwendung.
Was wir nicht tun würden, ist, Gemini 3.1 Pro auszuwählen, weil es das neueste Pro von Google ist. Es ist nicht neu, und Stand dieses Monats hat Google keinen veröffentlichten Nachfolger dafür.
Es vorhersagen, ohne bei einem Preview-Endpoint alles aufs Spiel zu setzen.
Der unangenehme Teil einer siebenmonatigen Vorschau ist, dass sie gut genug ist, um darauf aufzubauen, und nicht stabil genug, um sie vorauszusetzen. Zwei Abhilfen verdienen es, genannt zu werden.
Binde den exakten Modellcode fest statt eines Alias. Ein Preview-Endpunkt kann an Ort und Stelle überarbeitet werden, daher ist gemini-3.1-pro-preview in einer Konfigurationsdatei sicherer als eine frei schwebende Referenz auf „latest Pro“, und es macht eine stille Änderung in einem Diff sichtbar.
Behalte das Routing über dem Modell. Auf OrcaRouter ist Gemini 3.1 Pro google/gemini-3.1-pro-preview, bereitgestellt über denselben Schlüssel und denselben Endpunkt wie jedes andere Modell, das wir anbieten, einschließlich einer nativen /v1beta/models/{model}:generateContent-Form für Code, der gegen das Gemini SDK geschrieben wurde, und einer OpenAI-kompatiblen /v1/chat/completions für alles andere. Da die Preise mit 0 % Aufschlag durchgereicht werden, sind die 2,00 $ / 12,00 $ auf Googles Preisliste der Betrag, den du hier zahlst, und eine Preisänderung des Anbieters ist noch am selben Tag live statt erst im nächsten Abrechnungszyklus. Der Grund, warum das speziell für ein Preview-Modell wichtig ist, ist Failover: Eine konfigurierte Fallback-Kette bedeutet, dass an dem Tag, an dem Gemini 3.1 Pro nicht verfügbar ist, dein Retry beim nächsten Modell in der Kette landet, bevor die Antwort beginnt, statt erst, nachdem es deine Nutzer bemerkt haben. Das ist der Unterschied zwischen einer Preview, auf der du ausliefern kannst, und einer Preview, die du nur demonstrieren kannst.
Unser eigener Katalogeintrag für das Modell führt die Spezifikationen auf, wie wir sie bereitstellen — Kontext von einer Million Token, maximale Ausgabe von 65.536 Token, Audio-/Datei-/Bild-/Text-/Video-Eingabe, Textausgabe und eine mediane Zeit bis zum ersten Token von 10,00 Sekunden über die letzten sieben Tage, was man wissen sollte, bevor Sie annehmen, dass dies ein Chat-Latenz-Modell ist. Das ist es nicht.

Was ist noch offen?
Drei Dinge, die wir nicht abschließen konnten und die wir lieber offen benennen, als sie zu kaschieren. Google hat nicht gesagt, ob Gemini 3.1 Pro jemals allgemein verfügbar sein wird, und es gibt kein veröffentlichtes Abschaltdatum – weder für den einen noch für den anderen Fall. Die AI-Studio-Berichte sind fünf Tage später noch ungeklärt, und wir konnten keine Anbieterreaktion finden. Und die Nachfolgerfrage lässt sich nur mit Nein beantworten: Googles Pro-Seite bewirbt seit Monaten eine kommende Pro-Veröffentlichung, Berichten zufolge wurde der interne Kandidat verworfen, weil er die Flash-Reihe nicht übertreffen konnte, und mit Stand 23. September 2026 wurde nichts veröffentlicht. Falls ein Gemini 3.5 Pro oder ein Gemini 4 Pro erscheint, ändert sich die Position von Gemini 3.1 Pro in dieser Familie zum ersten Mal seit Februar – und das, nicht seine ursprüngliche Markteinführung, ist das Ereignis, das es zu beobachten gilt.

Gemini 3.1 Pro ist auf OrcaRouter zu Googles Listenpreis verfügbar, hinter demselben Schlüssel wie alles andere, was wir anbieten. Sehen Sie sich die Modellseite von Gemini 3.1 Pro an für aktuelle Preise, Kontextgrenzen und eine Fallback-Kette, die Sie konfigurieren können, bevor die nächste Preview-Revision erscheint.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
