Titelkaart met de tekst “Grok 4.7 vs Gemini 3.1 Pro” en de ondertitel “De ranglijst verschoof; het model niet”, en drie kaarten: AA Index v4.3.2 46 vs 30, Standaardprijs per 1M $2/$6 vs $2/$12, en Status GA vs preview.
Guides & Insights

Grok 4.7 vs Gemini 3.1 Pro: De ranglijst verschoof, het model niet

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 19 februari 2026 publiceerde Artificial Analysis een artikel met de kop "Gemini 3.1 Pro Preview: de nieuwe leider in AI." Het leidde zes van de tien evaluaties en stond vier punten voor op Claude Opus 4.6. Lees vandaag de pagina van datzelfde model en het getal is 30, op de negenenzestigste plaats van 200. De leverancier veranderde niets. Wat veranderde, is de meetlat: Artificial Analysis herzag zijn Intelligence Index naar v4.3.2 op 19 september 2026, waarbij elk model in de catalogus opnieuw werd gescoord tegen een andere evaluatieset, en een leider uit februari werd een middenmoter in september, terwijl het model zelf onaangeroerd in preview bleef staan. Dat is de achtergrond voor een vergelijking met Grok 4.7 — uitgebracht door de leverancier op 21 september 2026 — en het is de reden dat deze confrontatie minder gaat over welk model slimmer is dan over op welke van deze twee je nog kunt vertrouwen dat die volgende maand hetzelfde is.

Wat elk van deze werkelijk is

Gemini 3.1 Pro is Google's nieuwste model in de Pro-klasse en het heeft nooit algemene beschikbaarheid bereikt. Het werd uitgebracht als gemini-3.1-pro-preview op 19 februari 2026, en in de deprecatietabel van Google staat het nog steeds vermeld met "geen uitschakeldatum aangekondigd" — een preview die nu al zeven maanden in preview is, terwijl Google eronder een Flash-ladder uitbracht: 3.5 Flash in mei, 3.6 in juli, 3.7 in augustus, 3.8 in september. Er is geen GA Pro-model dat nieuwer is dan Gemini 3 Pro. Het heeft een invoervenster van 1.048.576 tokens en een uitvoerplafond van 65.536 tokens, accepteert tekst, afbeeldingen, video, audio en PDF als invoer met tekst als uitvoer, en biedt een denkniveau-instelling op laag, gemiddeld en hoog, zonder budgetparameter en zonder minimale instelling. De gewichten zijn gesloten.

Grok 4.7 is een dag oud en heeft ook gesloten gewichten. Het heeft een context van 500k tokens — de helft van die van Gemini — en accepteert tekst en afbeeldingen, dus het kan helemaal geen video of audio opnemen, wat het meest uitgesproken verschil in mogelijkheden in deze vergelijking is. De prijs wordt vermeld als $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens onder 200k prompttokens, oplopend naar $4,00 en $12,00 boven die grens, met gecachte leesbewerkingen tegen $0,50 en $1,00; xAI vermeldt ook een snellere variant met ongeveer tweemaal de outputsnelheid en tweemaal de prijs. In de hier geraadpleegde documentatie wordt geen maximum voor de output voor dit model vermeld.

De heerser bewoog. Dat is het verhaal.

Beide modellen worden momenteel gescoord op de Artificial Analysis Intelligence Index v4.3.2, die Terminal-Bench 2.1 heeft vervangen door Terminal-Bench 4.0 en tau3-Banking door AutomationBench-AA, en de GDPval-AA Elo-schaal opnieuw heeft verankerd. Het cijfer van elk model verschoof toen die werd ingevoerd. Dat van Gemini 3.1 Pro verschoof verder dan dat van de meeste modellen, omdat zijn sterke punten van februari geconcentreerd waren in evaluaties die de nieuwe index ofwel buiten gebruik heeft gesteld ofwel opnieuw heeft gewogen. Als je de twee kolommen vandaag naast elkaar leest:

Samengesteld — Grok 4.7 (xhigh): 46 op de Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 op dezelfde revisie, op plaats #69 van 200.

Lange context — Grok 4.7: venster van 500k, AA-LCR v1.1 77%. Gemini 3.1 Pro: venster van 1M — twee keer zo groot — en een uitvoerplafond van 65K, ongeveer de helft van wat een agentische sessie met lange context doorgaans nodig heeft.

Invoermodaliteit — Grok 4.7: tekst en afbeelding. Gemini 3.1 Pro: tekst, afbeelding, video, audio en pdf. Niet eens in de buurt, en geen kloof in benchmarks — een kloof in capaciteiten.

Snelheid — Grok 4.7: nog geen gepubliceerde meting. Gemini 3.1 Pro: 124,4 outputtokens per seconde, rang #39 van 200, met een tijd tot het eerste token van 63,62 seconden via Google AI Studio.

Prijs, standaardniveau — Grok 4.7: $2,00 in / $6,00 uit per 1 mln. Gemini 3.1 Pro: $2,00 in / $12,00 uit. Identieke input, dubbele output.

Prijs, tarief voor lange context — Grok 4.7: verdubbelt naar $4,00 / $12,00 bij 200k prompt-tokens. Gemini 3.1 Pro: stijgt naar $4,00 / $18,00 bij dezelfde grens van 200k. Dezelfde input, 50% meer output.

Volwassenheid — Grok 4.7: één dag oud, leveranciersbenchmarks grotendeels niet gereproduceerd. Gemini 3.1 Pro: zeven maanden op de markt, maar nog steeds een preview-build zonder GA-toezegging en zonder stopdatum.

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

Het previewprobleem is nu een echt probleem

Een preview van zeven maanden zou eerder een curiositeit dan een risico zijn als er niets mis mee was gegaan. Er is echter wel iets misgegaan. Vanaf 18 september 2026 begonnen gebruikers te melden dat Gemini 3.1 Pro was verdwenen uit de modelselector van AI Studio, en op het moment van schrijven is er geen reactie van Google-medewerkers, geen deprecatiebericht en geen opgegeven oorzaak — een onopgelost beschikbaarheidsincident in plaats van een bevestigde buitengebruikstelling. Zet dat naast de aankondigingsgeschiedenis: Google zei op I/O in mei 2026 dat Gemini 3.5 Pro "volgende maand zou worden uitgerold", en berichtgeving in de pers eind augustus zei dat dat model was geschrapt omdat interne kandidaten "niet voldoende beter waren dan de Flash-serie." Googles eigen Pro-pagina adverteert nog steeds met "3.5 Pro komt binnenkort", wat de tegenstrijdigheid op één scherm is. Wat de uitkomst ook is, de praktische interpretatie is dat Gemini 3.1 Pro een preview-endpoint is zonder GA-datum, zonder genoemde opvolger, en met op dit moment een vraagteken bij de beschikbaarheid.

Het risico van Grok 4.7 is het spiegelbeeld en kleiner van aard. Het is één dag oud, dus de cijfers zijn schaars — Artificial Analysis heeft geen snelheids- of latentiemeting gepubliceerd, en de eigen benchmarksuite van xAI ervoor is niet onafhankelijk gereproduceerd. Wat niet ter discussie staat, is dat het model algemeen beschikbaar, geprijsd, gedocumenteerd en stabiel in identiteit is. Een model waarvan de identiteit stabiel is en waarvan de cijfers onbewezen zijn, is veel makkelijker om op voort te bouwen dan een model waarvan de cijfers gepubliceerd zijn en waarvan de beschikbaarheid dat niet is.

Wat de splitsing in de praktijk kost

Stel dat je kiest voor een documentpipeline. Bij 100k invoertokens en 8k uitvoertokens kost Grok 4.7 $0,20 voor invoer en $0,048 voor uitvoer — ongeveer 25 cent. Gemini 3.1 Pro kost $0,20 voor invoer en $0,096 voor uitvoer — ongeveer dertig cent. De twee ontlopen elkaar niet meer dan twintig procent, en als je documenten scans, pdf's, audio of video zijn, is Gemini de enige van de twee die ze überhaupt kan lezen. Dat is geen benchmarkargument; het beslecht de vergelijking voor die workload.

Stel nu dat je kiest voor een agent met een lange context. Bij 300k input en 8k output kost Grok 4.7 $1,20 aan input en $0,096 aan output, ongeveer $1,30. Gemini 3.1 Pro kost $1,20 aan input en $0,144 aan output, ongeveer $1,35. In feite identiek — en hier worden Gemini's venster van 1M en het outputplafond van 65K juist de beperking die de doorslag geeft, want een limiet van 65K is precies waar lange agentische runs omvallen. Geen van beide modellen is de goedkope optie in deze confrontatie, en geen van beide is duur naar de maatstaven van de frontier.

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

Routeren rond een bewegend doelwit

OrcaRouter heeft Gemini 3.1 Pro in huis, vermeld op de eigen modelpagina tegen de tarieven van de provider — $2,00 in en $12,00 uit, met het venster van 1M en een maximale output van 65k — omdat wij de listprijzen van de provider doorgeven met 0% opslag. Dat is in een geval als dit geen marketingpraatje: Google heeft een preview-build met onbepaalde looptijd waarvan de beschikbaarheid in september wankelde, en wat een router nuttigs doet, is de integratie stabiel houden terwijl wat erachter zit verandert. Automatische failover betekent dat een preview-endpoint dat niet meer antwoordt een routeringsgebeurtenis wordt in plaats van een storing, en met de routing-DSL kun je een multimodaal model met een model dat alleen tekst aankan combineren in één aanroep — precies de vorm die dit duo suggereert: Gemini leest de video en Grok doet het redeneren op basis van het transcript. Grok 4.7 staat op het moment van schrijven niet in de OrcaRouter-catalogus; wie het vandaag wil aanroepen, moet via xAI's eigen API en de platforms van derden die het aanbieden.

Het patroon dat de moeite waard is om te bouwen: houd Gemini 3.1 Pro voor alles wat video, audio of pdf moet verwerken, en beschouw de preview-status als een operationeel risico om omheen te werken in plaats van als een reden om het te vermijden. Zet Grok 4.7 in op het tekst- en beeldwerk waar de lagere outputprijs en de hogere samengestelde score van toepassing zijn, en waar het model dat je vandaag integreert het model is dat je over zes maanden nog steeds aanroept. Het enige wat je niet moet doen, is de negenenzestigste plaats in de ranglijst lezen als een oordeel over het model — het is een oordeel over een herziening van een benchmark, en dezelfde herziening die Gemini 3.1 Pro degradeerde, degradeerde ook tientallen modellen die Google nooit heeft aangeraakt.

De oproep

Op de huidige index gaat Grok 4.7 Gemini 3.1 Pro met zestien punten voor, en qua outputprijs kost het de helft in de standaardlaag en is het een derde goedkoper in de long-contextlaag. Als je workload tekst en afbeeldingen omvat, is dat genoeg om de beslissing te nemen. Als je workload video, audio of gescande documenten omvat, is Gemini 3.1 Pro de enige kandidaat van de twee en daar houdt de vergelijking op — je koopt een capaciteit, geen score. De kanttekening die bij beide zou moeten horen, gaat over herkomst, niet over prestatie: de ene is een zeven maanden oude preview zonder GA-datum en met een beschikbaarheidsincident in september achter de rug, de andere is een dag oud met een spraakmakend cijfer en geen onafhankelijke reproductie van al het overige. Geen van beide is een uitgemaakte keuze. Beide zijn het waard om te routeren in plaats van je eraan vast te leggen.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt