
Mistral Large 4 vs Gemini 3.1 Pro: Acht maanden, twee richtingen
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 151 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Gemini 3.1 Pro is sinds 19 februari 2026 op de markt en staat nog steeds bijna bovenaan elke brede capaciteitentabel, waaronder de tabellen waarin het wordt vergeleken met modellen die dit najaar zijn uitgebracht. Mistral Large 4 is hooguit drie weken oud — een preview die op 6 oktober 2026 werd aangekondigd, waarbij de gewichten voor eind oktober zijn beloofd en er geen licentie is genoemd. Op de Intelligence Index van Artificial Analysis, afgelezen op 6 oktober, scoort de acht maanden oude Gemini 3.1 Pro 29,7 tegenover de 38,4 van de nieuwkomer. Dat is het eerlijke startpunt voor deze vergelijking, en het is het tegenovergestelde van wat de releasedata suggereren.
De verklaring is niet mysterieus. Gemini 3.1 Pro is een vlaggenschip uit de previewlijn dat Google nooit naar een stabiele release heeft gepromoveerd, en de pagina van Artificial Analysis erover is gelabeld als "Gemini 3.1 Pro Preview" — dezelfde pagina waar een lagere index naast een GPQA Diamond van topniveau staat. Het is een model dat voor breedte is gebouwd: een zeer groot contextvenster, een brede set modaliteiten en redeneervermogen dat sterk is bij kennisvragen. Mistral Large 4 is voor een heel andere kaart van de wereld gebouwd, en de prijs is daaraan aangepast.
Wat elk is
Gemini 3.1 Pro is Googles frontier multimodale redeneermodel, API-id gemini-3.1-pro-preview, met een contextvenster van 1.048.576 tokens en een uitvoerplafond van 65.536 tokens. Het accepteert tekst, afbeeldingen, video, audio en bestanden. Het wordt aangeboden via de catalogus van OrcaRouter tegen Googles eigen tarieven. In Googles documentatie staat geen niet-previewversie van Gemini 3.1 Pro vermeld; de previewnaam is het product.
Mistral Large 4 is een sparse mixture-of-experts met 1,05 biljoen parameters, 49 miljard actieve parameters en een toegewijde vision-encoder van 1,6 miljard parameters, aangeboden als "Mistral Large 4 Preview" onder de API-id mistral-large-4-0. De documentatie van Mistral vermeldt een contextvenster van 1 miljoen tokens; Artificial Analysis meet 524.288 op de configuratie die het test. De maximale output is niet gepubliceerd. Mistral beschrijft het als zijn grootste en meest capabele model tot nu toe en zegt dat de gewichten eind oktober arriveren.
De cijfers, met hun herkomst eraan gehecht
Beide modellen hebben onafhankelijke pagina's, dus de onderstaande vergelijking is een vergelijking binnen dezelfde testomgeving in plaats van leverancier-tegen-leverancier:
• Intelligentie-index v4.3 — Mistral Large 4 Preview 38,4 vs Gemini 3.1 Pro 29,7
• Kosten per indextaak — $1,13 vs $1,30
• Redeneren met lange context — 81,3% vs. 82,0%
• GPQA Diamond — niet gepubliceerd voor de preview vs 94,1%
• Humanity's Last Exam — 35,0% vs 47,0%
Terminal-Bench 4.0 — 26,8% vs 4,0%
• SciCode — 54,2% vs 58,7%
• AutomationBench, zakelijke workflows — 59,9% vs 35,4%
• MMMU-Pro, multimodale redenering — 76,4% vs 82,4%
• Contextvenster — 1M opgegeven / 524,288 getest vs 1.048.576 geleverd
• Uitvoerplafond — niet gepubliceerd vs 65.536 tokens
• Prijs per miljoen, input / output — $1,36 / $4,18 lijst, $0,68 / $2,09 actie, vs $2,00 / $12,00 onder 200K tokens en $4,00 / $18,00 daarboven
• Gewichten — beloofd, licentie niet vermeld, vs propriëtair

De alleropvallendste rij is Terminal-Bench 4.0. Gemini 3.1 Pro scoort 4,0% — geen typfout, en geen hallucinatie in de tabel: het weerspiegelt een model uit februari dat draait op een terminal-agent-harness die dateert van na het model. De 26,8% van Mistral Large 4 is zes keer hoger op dezelfde test. Wie Gemini heeft afgeschreven op basis van een oud agentic-coding-getal, zou het weer moeten meenemen op basis van zijn GPQA Diamond, en wie Mistral heeft afgeschreven op basis van de index-rang, zou eerst naar de terminalrij moeten kijken.
Waar Gemini 3.1 Pro nog steeds de betere kaarten heeft
Kennis en breedte. Een score van 94,1% op GPQA Diamond is het hoogste cijfer in dit hele artikel, aan beide kanten, en het is een wetenschapsbenchmark op masterniveau — geen getal waar een model zich naartoe praat. Humanity's Last Exam met 47,0% tegenover 35,0%, en een SciCode-score die de nieuwkomer nipt voorblijft, vertellen hetzelfde verhaal. Als je werklast bestaat uit het nauwkeurig beantwoorden van moeilijke vragen uit een kenniscorpus, blijft Gemini 3.1 Pro acht maanden na release het sterkere model.
Modaliteitsbreedte is het tweede voordeel. Gemini 3.1 Pro ondersteunt video en audio naast tekst en afbeeldingen. Mistral Large 4 ondersteunt tekst en afbeeldingen. Als uw pipeline opgenomen vergaderingen, schermopnamen of sensoraudio verwerkt, is er hier slechts één model dat de volledige invoer kan zien.
Het outputplafond is het derde. 65.536 tokens is een gepubliceerd, gegarandeerd plafond; Mistral heeft er voor de preview helemaal geen gepubliceerd. Niets in een aankondigingsbericht zal je in productie sneller parten spelen dan een niet-vermelde outputlimiet.
En Gemini's contextvenster wordt daadwerkelijk geserveerd op 1.048.576 tokens, terwijl Mistrals 1M het cijfer van de leverancier is tegenover een onafhankelijk uitgelezen 524.288. Voor een workload die zich aan het uiterste einde van het venster bevindt, is het verschil tussen een opgegeven en een gemeten aantal een herschrijving.
Waar Mistral Large 4 de beslissing verandert
Agentisch werk, en dan met name alles wat met een terminal te maken heeft, is waar de twee modellen niet langer vergelijkbaar zijn. Mistrals eigen lanceringsbericht bundelt 61,7% op DeepSWE v1.1, 59,4% op SWE-Atlas-QnA en 28,3% op Terminal-Bench 4.0 tot een Coding Agent Index van 49,8%, en zegt ronduit dat het op die gecombineerde maatstaf vóór DeepSeek V4 Pro 0813 en Qwen3.8 Max eindigde. Die drie cijfers zijn, in Mistrals woorden, cijfers die Artificial Analysis privé heeft geëvalueerd voordat zijn testharnas openbaar werd; ze staan nog niet op de openbare index en moeten als 'door de leverancier gepubliceerd' worden gelabeld totdat ze daar wel op staan.
Onafhankelijk bewijs wijst in dezelfde richting. Op AutomationBench — 657 bedrijfsworkflows over Gmail, Sheets, Slack en Salesforce — scoort Mistral Large 4 59,9%, vóór Kimi K3, MiMo-V2.6-Pro en DeepSeek V4 Pro, en in dezelfde testomgeving komt Gemini 3.1 Pro helemaal niet voor omdat de benchmark later is dan dat model. Een blinde menselijke studie uitgevoerd door Surge AI beoordeelde Mistral Large 4 Preview als tweede van vijf modellen op codeerkwaliteit met een 3,74, vóór GLM-5.3 en Kimi K3 en alleen achter Claude Opus 5.
De cyberclaim is de scherpste in de post van Mistral en het waard om precies te vermelden: 82% op de Artificial Analysis Cyber Index-test die een model vraagt een echte kwetsbaarheid te reproduceren en vervolgens te patchen, beschreven als de hoogste van alle modellen, met 93% op de 40 wedstrijdoefeningen van Cybench, en de bewering van Mistral dat het in de wereldwijde top vijf van de algehele Cyber Index staat, terwijl het de open-weightmodellen die buiten China zijn ontwikkeld, aanvoert. Dat zijn door de leverancier aangehaalde cijfers op een onafhankelijke index. Het praktische voordeel daarvan is dat Mistral het model heeft gebouwd om het werk te doen in plaats van te weigeren.
De goedkoopste regel in de tabel is ook van Mistral, maar slechts nipt: $1,13 per taak tegenover $1,30, een voorsprong van 13% die het promotietarief oplevert en die de tariefkaart teniet zou doen. Gemini 3.1 Pro is een model uit 2026 met prijzen uit 2026 en het is niet duur om er een indextaak op uit te voeren.
De tiebreaker die niemand benchmarkt
Er zijn twee dingen in het spel die de tabellen niet kunnen weergeven. Het eerste is licentiëring. Gemini 3.1 Pro is propriëtair en zal dat blijven; Mistral Large 4 is een preview waarvan het hele verkoopargument is dat het een downloadbaar artefact wordt dat je onder je eigen beleid kunt draaien, op je eigen hardware, onder Europees recht — Mistral heeft het getraind op 3.800 Grace Blackwell GPU's in zijn eigen datacenters en serveert de preview daar. Dat argument is niets waard totdat de repository verschijnt en de licentie een naam heeft. Het is veel waard op de dag dat dat gebeurt.

Het tweede is operationeel risico. Een preview die nog wordt verfijnd, verandert onder je vandaan. Op OrcaRouter zijn beide kanten van deze vergelijking bereikbaar via één OpenAI-compatibel endpoint tegen de lijstprijzen van providers met 0% opslag — Gemini 3.1 Pro staat live in de catalogus tegen de tarieven van Google, terwijl Mistral Large 4 moet worden bereikt via de eigen API van Mistral en verschillende platforms van derden, aangezien het geen route is die wij aanbieden. De routing-DSL is hier het nuttige onderdeel: stuur classificatie en extractie naar het model dat die week goedkoper is, escaleer de moeilijkste rest, en laat automatische failover de slechte dagen van de preview opvangen in plaats van dat je piketrooster ze opvangt.

Het vonnis
Vraag wat de workload is, niet welk model beter is. Voor kenniswerk, audio- en video-invoer, een gegarandeerd uitvoerplafond en een geserveerd venster van een miljoen tokens is Gemini 3.1 Pro nog steeds het sterkere model, en zijn leeftijd is geen gebrek — het zijn acht maanden waarin anderen de grenzen ervan hebben leren kennen. Voor agentische codering, terminalwerk en beveiligingsoperaties loopt Mistral Large 4 voor met een marge die ruim genoeg is om de indexrang misleidend te maken, en het is de enige van de twee die uiteindelijk zelf gehost zou kunnen worden.
De beslissende factor om in de gaten te houden is eind oktober. Als de gewichten onder een permissieve licentie arriveren, concurreert Mistral Large 4 niet langer met Gemini 3.1 Pro op prijs en begint het op het gebied van controle met Gemini 3.1 Pro te concurreren, en dat is een andere strijd. Als ze onder een restrictieve licentie arriveren, verandert het antwoord van dit artikel niet veel — maar de reden wel.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
