Titelkarte mit der Aufschrift „Grok 4.7 vs. Gemini 3.1 Pro“ und dem Untertitel „Das Leaderboard hat sich bewegt; das Modell nicht“, sowie drei Karten: AA Index v4.3.2 46 vs. 30, Standardpreis pro 1 Mio. $2/$6 vs. $2/$12 und Status GA vs. Vorschau.
Guides & Insights

Grok 4.7 vs. Gemini 3.1 Pro: Die Rangliste hat sich verschoben, das Modell nicht.

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 19. Februar 2026 veröffentlichte Artificial Analysis einen Artikel mit der Überschrift „Gemini 3.1 Pro Preview: Der neue Spitzenreiter in der KI“. Er führte sechs von zehn Bewertungen an und lag vier Punkte vor Claude Opus 4.6. Ruft man heute die Seite desselben Modells auf, steht dort die Zahl 30 – Rang 69 von 200. Der Anbieter hat nichts geändert. Geändert hat sich der Maßstab: Artificial Analysis überarbeitete seinen Intelligence Index am 19. September 2026 auf v4.3.2, bewertete jedes Modell im Katalog anhand eines anderen Evaluierungssets neu, und ein Februar-Spitzenreiter wurde zu einem September-Mittelfeldplatz, während das Modell selbst unangetastet im Preview-Status blieb. Das ist der Hintergrund für einen Vergleich mit Grok 4.7 – am 21. September 2026 vom Anbieter veröffentlicht – und der Grund, warum es in diesem Duell weniger darum geht, welches Modell klüger ist, als darum, auf welches der beiden man sich noch verlassen kann, dass es nächsten Monat noch dieselbe Sache ist.

Was jedes davon tatsächlich ist

Gemini 3.1 Pro ist Googles neuestes Modell der Pro-Klasse und hat nie die allgemeine Verfügbarkeit erreicht. Es erschien am 19. Februar 2026 als gemini-3.1-pro-preview, und Googles Deprecation-Tabelle führt es weiterhin mit „kein Abschaltdatum angekündigt“ auf – eine Preview, die nun seit sieben Monaten im Preview-Status ist, während Google darunter eine Flash-Leiter auslieferte: 3.5 Flash im Mai, 3.6 im Juli, 3.7 im August, 3.8 im September. Es gibt kein GA-Pro-Modell, das neuer als Gemini 3 Pro ist. Es bietet ein Eingabefenster von 1.048.576 Token und eine Ausgabegrenze von 65.536 Token, nimmt Text, Bilder, Video, Audio und PDF als Eingabe und gibt Text aus und bietet eine Thinking-Level-Steuerung auf niedrig, mittel und hoch, ohne Budget-Parameter und ohne Minimal-Einstellung. Die Gewichte sind geschlossen.

Grok 4.7 ist einen Tag alt und ebenfalls Closed-Weight. Es hat einen 500k-Token-Kontext – die Hälfte von Geminis – und nimmt Text und Bilder entgegen, kann also Video oder Audio überhaupt nicht verarbeiten, was der deutlichste Unterschied bei den Fähigkeiten in diesem Vergleich ist. Es wird mit 2,00 $ pro Million Eingabe-Token und 6,00 $ pro Million Ausgabe-Token für unter 200k Prompt-Token aufgeführt, mit einem Sprung auf 4,00 $ und 12,00 $ oberhalb dieser Grenze, wobei Cache-Lesevorgänge 0,50 $ und 1,00 $ kosten; xAI führt außerdem eine schnellere Variante mit etwa doppelter Ausgabegeschwindigkeit und doppeltem Preis auf. Für es wird in der hier geprüften Dokumentation keine maximale Ausgabegröße veröffentlicht.

Das Lineal bewegte sich. Das ist die Geschichte.

Beide Modelle werden derzeit anhand des Artificial Analysis Intelligence Index v4.3.2 bewertet, der Terminal-Bench 2.1 durch Terminal-Bench 4.0 und tau3-Banking durch AutomationBench-AA ersetzt und die GDPval-AA-Elo-Skala neu verankert hat. Der Wert jedes Modells verschob sich, als der Index erschien. Der Wert von Gemini 3.1 Pro verschob sich stärker als bei den meisten, weil seine Stärken vom Februar in Evaluierungen konzentriert waren, die der neue Index entweder gestrichen oder neu gewichtet hat. Liest man heute die beiden Spalten nebeneinander:

Gesamtwert — Grok 4.7 (xhigh): 46 im Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 in derselben Revision, auf Platz 69 von 200.

Langkontext — Grok 4.7: 500k-Fenster, AA-LCR v1.1 77 %. Gemini 3.1 Pro: 1M-Fenster — doppelt so groß — und eine Ausgabegrenze von 65K, die nur etwa halb so groß ist wie das, was eine agentische Langkontext-Sitzung üblicherweise benötigt.

Eingabemodalität — Grok 4.7: Text und Bild. Gemini 3.1 Pro: Text, Bild, Video, Audio und PDF. Nicht annähernd gleich, und keine Benchmark-Lücke – sondern eine Fähigkeitslücke.

Geschwindigkeit — Grok 4.7: noch keine veröffentlichte Messung. Gemini 3.1 Pro: 124,4 Ausgabe-Tokens pro Sekunde, auf Platz 39 von 200, mit einer Zeit bis zum ersten Token von 63,62 Sekunden über Google AI Studio.

Preis, Standardtarif — Grok 4.7: 2,00 $ Eingabe / 6,00 $ Ausgabe pro 1 Mio. Gemini 3.1 Pro: 2,00 $ Eingabe / 12,00 $ Ausgabe. Identische Eingabe, doppelte Ausgabe.

Preis, Tarifstufe für langen Kontext — Grok 4.7: verdoppelt sich auf $4.00 / $12.00 bei 200k Prompt-Tokens. Gemini 3.1 Pro: steigt auf $4.00 / $18.00 bei derselben 200k-Grenze. Gleicher Input, 50 % mehr Output.

Reifegrad — Grok 4.7: einen Tag alt, Hersteller-Benchmarks größtenteils nicht reproduziert. Gemini 3.1 Pro: seit sieben Monaten auf dem Markt, aber weiterhin ein Preview-Build ohne GA-Zusage und ohne Abschaltdatum.

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

Das Vorschauproblem ist jetzt ein echtes Problem.

Eine siebenmonatige Vorschau wäre eher eine Kuriosität als ein Risiko, wenn dabei nichts schiefgelaufen wäre. Etwas ist schiefgelaufen. Ab dem 18. September 2026 begannen Nutzer zu berichten, dass Gemini 3.1 Pro aus der Modellauswahl von AI Studio verschwunden sei, und zum Zeitpunkt dieses Textes gab es weder eine Reaktion von Google-Mitarbeitern noch einen Deprecation-Hinweis noch eine genannte Ursache – ein ungelöster Verfügbarkeitsvorfall statt einer bestätigten Stilllegung. Vergleichen Sie das mit der Ankündigungshistorie: Google sagte im Mai 2026 auf der I/O, Gemini 3.5 Pro werde „im nächsten Monat ausgerollt“, und Presseberichte Ende August besagten, dieses Modell sei verworfen worden, weil interne Kandidaten „nicht ausreichend besser als die Flash-Serie“ gewesen seien. Googles eigene Pro-Seite wirbt weiterhin mit „3.5 Pro kommt bald“, was den Widerspruch auf einem einzigen Bildschirm darstellt. Wie auch immer die Lösung ausfällt, die praktische Lesart ist, dass Gemini 3.1 Pro ein Preview-Endpunkt ohne GA-Datum, ohne benannten Nachfolger und mit einem aktuellen Fragezeichen bei der Verfügbarkeit ist.

Das Risiko von Grok 4.7 ist das Spiegelbild und von geringerer Art. Es ist einen Tag alt, daher sind seine Zahlen dünn — Artificial Analysis hat keine Geschwindigkeits- oder Latenzmessung veröffentlicht, und die eigene Benchmark-Suite von xAI dafür wurde nicht unabhängig reproduziert. Was nicht in Frage steht, ist, dass das Modell allgemein verfügbar, bepreist, dokumentiert und in seiner Identität stabil ist. Ein Modell, dessen Identität stabil und dessen Zahlen unbewiesen sind, ist viel einfacher, darauf aufzubauen, als ein Modell, dessen Zahlen veröffentlicht und dessen Verfügbarkeit es nicht ist.

Was der Split in der Praxis kostet

Angenommen, Sie treffen eine Auswahl für eine Dokumentenpipeline. Bei 100k Eingabe-Tokens und 8k Ausgabe kostet Grok 4.7 $0,20 für Eingabe und $0,048 für Ausgabe – etwa ein Viertel. Gemini 3.1 Pro kostet $0,20 für Eingabe und $0,096 für Ausgabe – etwa dreißig Cent. Die beiden liegen innerhalb von zwanzig Prozent auseinander, und wenn es sich bei Ihren Dokumenten um Scans, PDFs, Audio oder Video handelt, ist Gemini der Einzige der beiden, der sie überhaupt lesen kann. Das ist kein Benchmark-Argument; es beendet den Vergleich für diese Arbeitslast.

Nehmen wir nun an, Sie entscheiden sich für einen Long-Context-Agenten. Bei 300k Input und 8k Output kostet Grok 4.7 $1,20 für Input und $0,096 für Output, insgesamt etwa $1,30. Gemini 3.1 Pro kostet $1,20 für Input und $0,144 für Output, insgesamt etwa $1,35. Effektiv identisch – und hier werden Geminis 1M-Fenster und die Obergrenze von 65K Output zur entscheidenden Einschränkung, denn bei einer 65K-Grenze brechen lange agentische Läufe zusammen. Keines der beiden Modelle ist in diesem Duell die günstige Option, und keines ist nach Frontier-Maßstäben teuer.

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

Routing um ein bewegliches Ziel herum

OrcaRouter führt Gemini 3.1 Pro, gelistet auf einer eigenen Modellseite zu den Tarifen des Anbieters — $2,00 in und $12,00 out, mit dem 1M-Fenster und einer maximalen Ausgabe von 65k —, weil wir die Listenpreise der Anbieter mit 0 % Aufschlag weitergeben. Das ist in einem Fall wie diesem keine Marketingfloskel: Google hat einen Preview-Build mit unbestimmter Laufzeit, dessen Verfügbarkeit im September schwankte, und das Nützliche, was ein Router tut, ist, die Integration stabil zu halten, während sich das dahinterliegende Ding ändert. Automatisches Failover bedeutet, dass ein Preview-Endpunkt, der nicht mehr antwortet, zu einem Routing-Ereignis statt zu einem Ausfall wird, und mit der Routing-DSL lässt sich ein multimodales Modell mit einem reinen Textmodell in einem einzigen Aufruf kombinieren — was genau der Form entspricht, die dieses Paar nahelegt: Gemini liest das Video, und Grok übernimmt das Reasoning über dessen Transkript. Grok 4.7 ist zum Zeitpunkt dieses Textes nicht im OrcaRouter-Katalog; wer es heute aufrufen will, muss über xAIs eigene API und die Drittplattformen gehen, die es führen.

Das Muster, das sich zu bauen lohnt: Gemini 3.1 Pro für alles beibehalten, was Video, Audio oder PDF verarbeiten muss, und seinen Preview-Status als operatives Risiko behandeln, das man umgeht, statt als Grund, es zu meiden. Grok 4.7 für die Text- und Bildarbeit einsetzen, wo sein niedrigerer Ausgabepreis und sein höherer Gesamtscore zum Tragen kommen und wo das Modell, das Sie heute integrieren, auch in sechs Monaten noch das Modell ist, das Sie aufrufen werden. Das Einzige, was Sie nicht tun sollten, ist, die Platzierung auf Rang 69 als Urteil über das Modell zu lesen – sie ist ein Urteil über eine Benchmark-Revision, und dieselbe Revision, die Gemini 3.1 Pro herabgestuft hat, hat auch Dutzende Modelle herabgestuft, die Google nie angefasst hat.

Der Anruf.

Im aktuellen Index liegt Grok 4.7 um sechzehn Punkte vor Gemini 3.1 Pro, und beim Ausgabepreis kostet es in der Standardstufe halb so viel und in der Long-Context-Stufe ein Drittel weniger. Wenn Ihre Workload aus Text und Bildern besteht, reicht das für die Entscheidung. Wenn Ihre Workload Video, Audio oder gescannte Dokumente umfasst, ist Gemini 3.1 Pro der einzige Kandidat von beiden, und der Vergleich endet dort — Sie kaufen eine Fähigkeit, nicht eine Punktzahl. Der Vorbehalt, der bei beiden angebracht ist, betrifft eher die Provenienz als die Performance: Das eine ist eine sieben Monate alte Vorschau ohne GA-Termin und mit einem Verfügbarkeitsvorfall im September im Rücken, das andere ist einen Tag alt, mit einer Schlagzeilenzahl und ohne unabhängige Reproduktion von irgendetwas anderem. Keine der beiden ist eine endgültige Wahl. Für beide lohnt es sich, sie zu routen, statt sich festzulegen.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert