Een titelkaart voor Mistral Large 4 vs MiniMax M3, opgebouwd rond een maandelijks verschil van $48 bij 100 miljoen tokens, waarbij MiniMax M3 video-invoer en 512K uitvoer ondersteunt en Mistral Large 4 een preview met alleen afbeeldingen.
Guides & Insights

Mistral Large 4 vs MiniMax M3: Wat vijf maanden vooruitgang kost

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

MiniMax M3 is het goedkoopste model in deze klasse en dat is het al sinds 31 mei 2026. Met $0,30 per miljoen inputtokens, $1,20 per miljoen outputtokens en $0,06 per miljoen gecachete tokens onderbiedt het Mistral Large 4: op input is het ruwweg half zo duur, op output twee keer zo goedkoop — en anders dan het nieuwere model kun je het vandaag kopen zonder dat er een preview-label aan hangt. Mistral Large 4, een open-weightmodel met 1,05 biljoen parameters dat sinds 6 oktober 2026 in publieke preview is, kost $0,68 en $2,09 en belooft de gewichten tegen het einde van de maand. Twee open-weightvlaggenschepen, vijf maanden uit elkaar, en die vijf maanden zijn op precies één plek zichtbaar: de onafhankelijke Intelligence Index-score van 29,2 voor M3 tegenover een score voor Mistral Large 4 die nog niet bestaat.

Dat is de eerlijke vorm van deze vergelijking, en die is interessanter dan een prijstabel doet vermoeden. M3 is gebouwd rond een specifieke architectonische gok — MiniMax Sparse Attention, volgehouden over meer dan een miljoen tokens context, met video als eersteklas invoer — en wint op papier in twee categorieën die Mistral Large 4 niet betwist: ruwe uitvoerlengte en native video. Overal elders is het nieuwere model het model dat een koper liever zou hebben, tegen een prijs die nog steeds laag genoeg is dat het verschil zelden de aankoop bepaalt.

Twee architecturen, twee weddenschappen

MiniMax M3 is MiniMax' vlaggenschip open-weight basismodel en het eerste dat geavanceerde coding- en agentische prestaties, een contextvenster van een miljoen tokens en native multimodaliteit in één release combineert. Het accepteert tekst, afbeeldingen en video en retourneert tekst, en het is gebouwd op MiniMax Sparse Attention, een architectuur die is ontworpen om tot 1.048.576 tokens context te ondersteunen met een gegarandeerde ondergrens van 512K. De pretraining-pijplijn is opnieuw opgebouwd om voorbij 100 biljoen tokens te schalen, met multimodale data vanaf de eerste stap in plaats van er later aan vastgeschroefd. De maximale output is 512.000 tokens.

Mistral Large 4 zet in op iets anders. Het is een granulair mixture-of-experts-model, 49 miljard actieve parameters van in totaal 1,05 biljoen, met een vision-encoder van 1,6 miljard parameters, vanaf nul getraind op 3.800 NVIDIA Grace Blackwell GPU's in Mistrals eigen Europese datacenters, op data uit meer dan 160 talen. Het verwerkt tekst en afbeeldingen — geen video — binnen een context van ongeveer een miljoen tokens, en Mistral positioneert het rond soevereine deployment: Europese infrastructuur, open gewichten en de mogelijkheid om het te draaien volgens je eigen beleid, met cybersecurity als de vlaggenschip-use-case.

• Contextvenster — MiniMax M3 1.048.576 tokens vs Mistral Large 4 ongeveer 1.000.000

• Maximale uitvoer — MiniMax M3 512.000 tokens vs. Mistral Large 4 nog niet gedocumenteerd

• Invoermodaliteit — MiniMax M3 tekst, afbeelding en video vs Mistral Large 4 tekst en afbeelding

• Invoerprijs — MiniMax M3 $0,30 per 1 mln vs Mistral Large 4 $0,68 per 1 mln

• Uitvoerprijs — MiniMax M3 $1,20 per 1M vs. Mistral Large 4 $2,09 per 1M

• Gecachte invoer — MiniMax M3 $0,06 per 1 miljoen vs Mistral Large 4 $0,07 per 1 miljoen

• Parameters — Mistral Large 4 1.1T totaal / 49B actief vs MiniMax M3 niet bekendgemaakt

• Uitgebracht — MiniMax M3 31 mei 2026 vs Mistral Large 4 6 oktober 2026, preview

• Gewichten — beide onder een open licentie, die van Mistral Large 4 beloofd tegen eind oktober 2026

A two-column scoreboard comparing Mistral Large 4 and MiniMax M3 on input and output price, Artificial Analysis Index, input modalities, maximum output and release date.

Het scorebord is niet dichtbij, en het is ook niet eerlijk.

Op de Artificial Analysis Intelligence Index v4.3.2 scoort MiniMax M3 29,2 en staat het op de 62e plaats van 147 modellen. Dat is een middenmootresultaat en het is geen kritiek op het model — de Index werd herzien na de release van M3 en bevat evaluaties die nog niet bestonden toen MiniMax aan het trainen was. De codeersubscore vertelt een beter verhaal: 58,6 op de AA Coding index, 46e van 138, en 65,2% op Terminal-Bench 2.1. Het behaalt 92,9% op GPQA Diamond, 83% op long-context recall, en 47,1% op SciCode.

Mistral Large 4 heeft geen Index-score op hetzelfde leaderboard; de pagina staat live onder de titel "Mistral Large 4 Preview" en het cijfer ontbreekt. Wat Mistral wél publiceert, is dat ML4 op de gecombineerde Coding Agent Index aan kop gaat vóór DeepSeek V4 Pro 0813 en Qwen3.8 Max, met 49,8%, en dat het op AutomationBench — 657 zakelijke workflows verdeeld over Gmail, Sheets, Slack en Salesforce — 59,9% scoort, vóór Kimi K3, MiMo-V2.6-Pro en DeepSeek V4 Pro. MiniMax wordt in geen van beide vergelijkingen genoemd, wat op zichzelf een signaal is over welk model Mistral als de echte concurrent beschouwt.

De eerlijke lezing is dus deze: M3 is een capabel, goedkoop en goed gedocumenteerd model met een algemene score in de middenmoot en een respectabel coderingsprofiel, vijf maanden oud. ML4 is een previewmodel met een hoger geclaimd plafond, geen gepubliceerde algemene score, en een reeks agentische cijfers die Artificial Analysis privé heeft geëvalueerd en zal publiceren op de Coding Agent Index wanneer die harness uitkomt. Als je vandaag een cijfer nodig hebt, geeft M3 je er een. Als je een paar weken kunt wachten, zal ML4 je er ook een geven, en Mistral gokt erop dat die hoger zal zijn.

Waar M3 helemaal geen concurrentie van ML4 heeft

Twee rijen op die lijst zijn geen afweging, ze zijn een afwezigheid.

Video-invoer is native, naast tekst en afbeeldingen. Mistral Large 4 verwerkt alleen tekst en afbeeldingen, en niets anders — wat Mistral zelf doet, draait om grounding op gigapixel-satellietbeelden en technische tekeningen, wat nog steeds beeldwerk is. Als jouw pipeline schermopnames, bewakingsbeelden of videodocumentatie verwerkt, kan ML4 niet het model zijn, wat de prijs ook is. Dat is geen gat dat Mistral met een nieuwe prijsstelling zal dichten.

Outputlengte is het tweede. M3 genereert tot 512.000 tokens in één enkele reactie. Mistral heeft geen uitvoerplafond voor ML4 gepubliceerd. Het genereren van een lang gestructureerd artefact in één doorgang — een volledig rapport, een groot migratiescript, een complete specificatie — is de werkbelasting waarbij een plafond van 512K meer waard is dan een punt op de Intelligence Index, en zolang Mistral de limiet van ML4 niet documenteert, is M3 de enige van de twee waarop je die werkbelasting kunt plannen.

De door de leverancier gerapporteerde agentische cijfers van M3 versterken hetzelfde profiel. MiniMax plaatst het op 83,5 op BrowseComp voor autonoom webonderzoek, 70 op OSWorld-verified voor computergebruik, 74,2 op MCP Atlas voor toolgebruik, 76,7 op GDPval-rubrieken en 59 op SWE Bench Pro. Die zijn afkomstig uit MiniMax' eigen evaluaties en zijn niet onafhankelijk gereproduceerd, en ze steken vreemd af tegen zijn Index-score van 29,2 — en dat is precies waarom het onderscheid tussen leverancier en onafhankelijk van belang is. Een model kan de door een leverancier gekozen benchmarks aanvoeren en op een neutraal gemiddelde van tien evaluaties in de middenmoot belanden, en beide dingen kunnen waar zijn.

Is de 2x het waard

Het prijsverschil is hier in absolute termen oprecht klein, wat de afweging verandert in vergelijking met een mismatch tegen een gesloten flagship. Neem een maand van honderd miljoen tokens bij een input/output-verdeling van 4:1: 80 miljoen inputtokens en 20 miljoen output. M3 rekent $24 plus $24, in totaal $48. Mistral Large 4 rekent $54,40 plus $41,80, in totaal $96,20. De meerprijs is ongeveer $48 per maand — echt geld op schaal, maar wel het soort kloof dat door één vermeden fout wordt terugverdiend.

Caching verkleint het verschil verder, en slechts marginaal in het voordeel van M3: $0,06 tegen $0,07 per miljoen gecachte tokens is een afrondingsfout op dit prijspunt. Beide zijn goedkoop genoeg dat de beslissing moet worden genomen op basis van mogelijkheden en geschiktheid, niet op basis van de factuur, wat het tegenovergestelde is van hoe deze vergelijking op het eerste gezicht overkomt.

Wat de meerprijs oplevert, is span. ML4 werd vijf later getraind op nieuwere data, in een mixture-of-experts-opzet met een parameteraantal waarvan 49 miljard actief, en Mistral voert er reinforcement learning op uit met een opgegeven 33 miljard tokens per dag, met een run die nog niet verzadigd is. M3 is klaar; ML4 verbetert volgens een gepubliceerde cadans. Wanneer een leverancier zegt dat het model dat je vandaag koopt de zwakste versie is waarvoor je ooit zult betalen, en de meerprijs ten opzichte van het zittende model minder dan een dollar per miljoen tokens is, is het nieuwere model meestal de betere standaardkeuze. De uitzondering zijn de twee workloads hierboven, waar het oudere model het enige is dat past.

Routeren rond de kloof

A screenshot of the OrcaRouter model page for MiniMax M3, showing the minimax/minimax-m3 route from MiniMax, its text, image and video input, and the $0.30 input and $1.20 output price per million tokens.

Dit is een combinatie waarbij het draaien van beide geen hedge is, maar het eigenlijke antwoord, omdat de twee modellen sterk zijn op disjuncte gebieden. Video in, lange artefacten eruit, of een computer-use-lus: M3. Document- en beeldanalyse, agentische workflows, of alles wat op Europese infrastructuur onder uw eigen beleid moet draaien: ML4. Er is geen routeringsregel die een van beide overbodig maakt.

Beide bevinden zich achter één OpenAI-compatibel endpoint op OrcaRouter met 0% opslag en de lijstprijzen van providers worden ongewijzigd doorgegeven, wat een prijsverschil over vijf maanden eerlijk houdt — als MiniMax het tarief van M3 verlaagt of Mistral het previewtarief beëindigt, verandert het getal waaraan je route wordt geëvalueerd dezelfde dag. De routing-DSL is wat de uiteenlopende sterktes omzet in één aanroeppervlak: een regel die de modaliteit van het verzoek inspecteert, stuurt payloads met video naar M3 en al het overige naar ML4, met de zekerheid dat korte beschikbaarheidsdipjes van een previewmodel worden opgevangen door automatische failover in plaats van doorgegeven aan je gebruikers. Waar één enkele output meer uitmaakt dan één enkele prijs, kan modelfusie beide laten draaien en een panel laten kiezen, wat een redelijke manier is om het door Mistral geclaimde plafond te kopen terwijl M3's gedocumenteerde gedrag als ondergrens behouden blijft.

A decision card headed When each one wins, matching MiniMax M3 to video input and 512K output at $0.30 and $1.20, and Mistral Large 4 to image and document work that runs in Europe.

Vonnis

MiniMax M3 is het juiste antwoord voor twee workloads en een verdedigbaar antwoord voor een derde. Video-invoer, generatie van meerdere honderdduizenden tokens in één enkele pass en computer-use-agents zijn zijn terrein, zijn prijs is de laagste van alle flagships in deze klasse, en zijn gepubliceerde middenmoot-scores betekenen dat je precies weet wat je krijgt. Vijf maanden oud is niet oud voor een model dat in zijn eigen niche niet is opgevolgd.

Mistral Large 4 is de betere standaardoptie voor al het overige. Een maand met honderd miljoen tokens kost ongeveer $48 meer, het aantal parameters en de Europese trainingsachtergrond wijzen op een hoger plafond, de cybersecurityclaims zijn specifiek genoeg om controleerbaar te zijn, en de beloofde open gewichten plus on-premises deployment voldoen aan eisen waaraan het API-only-enterpriseverhaal van M3 niet voldoet. De prijs van die gok is dat je je vastlegt op een model waarvan de score op de Independent Intelligence Index niet is gepubliceerd en waarvan Mistral zegt dat het gedrag binnen enkele weken aanzienlijk zal veranderen.

De twee data die dit oplossen: eind oktober 2026, wanneer de gewichten van ML4 ofwel beschikbaar komen, ofwel de open-weightsbelofte zwak begint te lijken, en de publicatie van de Coding Agent Index, waar Mistrals privé geëvalueerde 49,8% de publieke 58,6 coding-score van M3 op dezelfde revisie ontmoet. Tot dan is M3 het model dat je kunt verifiëren en ML4 het model waarop je inzet — en bij een maandelijkse meerprijs van $48 voor honderd miljoen tokens is dat geen grote weddenschap.