Een gegenereerde titelkaart voor het artikel 'Mistral Large 4 vs Claude Opus 5' met de titel in een vet, geometrisch schreefloos lettertype, de ondertitel 'Het verschil is kleiner dan het prijsverschil' eronder, en daarboven een rij van drie platte lijnpictogrammen — twee balken van ongelijke hoogte, een prijskaartje en een menselijke beoordelingsschaal — op een witte achtergrond met accenten in een blauw-cyaan gradiënt en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Mistral Large 4 vs Claude Opus 5: Het verschil is kleiner dan het prijsverschil

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het enige head-to-head-cijfer dat iemand heeft gepubliceerd voor Mistral Large 4 tegen Claude Opus 5 komt uit een blinde menselijke evaluatie, en het ligt dichter bij elkaar dan de benchmarktabellen suggereren. Surge AI verborg de modelidentiteiten en vroeg professionele annotatoren om code-output te beoordelen op een schaal van 1–5; Claude Opus 5 eindigde eerste met 4,22 en Mistral Large 4 Preview tweede met 3,74, vóór Kimi K3, GLM-5.3 en GLM-5.2. Op het onafhankelijke geaggregeerde cijfer liggen de twee helemaal niet naast elkaar — 50,8 tegen 38,4 op de Intelligence Index van Artificial Analysis, afgelezen op 6 oktober. Wat deze combinatie een middag waard maakt, is dat het model dat 12 punten lager scoort, ongeveer een vijfde zoveel kost om er een taak op uit te voeren.

Van beide cijfers moet de herkomst worden vermeld, want het zijn niet hetzelfde soort getal. De Surge AI-evaluatie is een menselijk onderzoek door een derde partij dat Mistral heeft laten uitvoeren en gepubliceerd — een sterkere vorm van bewijs dan een zelf uitgevoerde benchmark, en toch een onderzoek waarvan Mistral de publicatie in de hand had. De indexscores zijn de eigen runs van Artificial Analysis, onderling vergelijkbaar, en dus het juiste paar om je redenering op te baseren. Geen van beide vertelt je op welk model je moet voortbouwen; samen bakenen ze de vraag af.

Twee producten, niet twee generaties van één

Claude Opus 5 is een closed-weight vlaggenschip van de leverancier, uitgebracht op 24 juli 2026, geleverd met een contextvenster van 1M tokens en tot 128K outputtokens, voor $5 per miljoen input en $25 per miljoen output, met gecachte reads tegen $0,50. Het is het meest capabele model van de leverancier in de Opus-lijn en is duidelijk gepositioneerd voor agentisch werk met een lange horizon — en blijft coherent tijdens sessies met meerdere stappen en intensief gebruik van tools.

Mistral Large 4 is een preview, aangekondigd op 6 oktober 2026, die Mistral beschrijft als een sparse mixture-of-experts met 1,05 biljoen parameters, 49 miljard actieve parameters en een vision-encoder met 1,6 miljard parameters. Het API-id is mistral-large-4-0, het is native multimodaal, en de documentatie van Mistral geeft het een contextvenster van 1M tokens, terwijl Artificial Analysis 524.288 leest op de configuratie die het test. De gewichten zijn beloofd voor eind oktober en de licentie is nog niet genoemd.

Dit is dus geen nieuwer model tegenover een ouder model. Het is een propriëtair frontiermodel tegenover een uitdager die open-weight moet worden, en de twee worden navenant geprijsd.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

Dezelfde index, beide modellen

Afgelezen op 6 oktober van hun Artificial Analysis-pagina's, op Intelligence Index v4.3:

• Intelligentie-index — Mistral Large 4 Preview 38,4 vs. Claude Opus 5 50,8

• Kosten per indextaak — $1,13 voor Mistral Large 4 Preview tegenover $5,86 voor Claude Opus 5

• Terminal-Bench 4.0 — 26,8% vs. 49,0%, het grootste enkele verschil tussen beide

• Humanity's Last Exam — 35,0% vs 54,9%

• MMMU-Pro, multimodale redenering — 76,4% vs 84,7%

• AutomationBench, zakelijke workflows — 59,9% vs 56,6%, de enige rij waarin Mistral Large 4 vooroploopt

• Contextvenster — 1M opgegeven door Mistral en 524.288 op de geteste configuratie, tegenover 1M geleverd

• Uitvoerplafond — niet gepubliceerd voor de preview vs. 128K tokens

• Prijs per miljoen, input / output — $1,36 / $4,18 als lijstprijs, momenteel $0,68 / $2,09 in de aanbieding, vs $5,00 / $25,00

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

Het patroon is leesbaar. Opus 5 ligt voor op de twee moeilijkste, redeneerintensieve rijen — terminalwerk en open-ended kennis — en ligt voor op multimodaal begrip, ondanks dat Mistral Large 4 het model is dat op zijn visie wordt verkocht. Mistral Large 4 leidt de rij voor workflowautomatisering, de rij die het dichtst komt bij wat een bedrijfsonderdeel daadwerkelijk van een model vraagt te doen, en doet dat tegen een vijfde van de prijs per taak.

Waar Mistral Large 4 echt wint

De meest interessante bewering in Mistrals lanceringspost is niet een benchmarkscore. Het is dat Mistral Large 4 op een van de tests van de Artificial Analysis Cyber Index — een echte kwetsbaarheid in opensourcesoftware reproduceren en die vervolgens patchen — 82% scoort, naar verluidt het hoogste van alle modellen, en dat verschillende toonaangevende gesloten modellen bijna nul scoren op dezelfde test omdat ze de taak weigeren. Mistral noemt Claude Opus 5.5 en GPT-6 Astra als voorbeelden van die weigering.

Dat is een leveranciersinterpretatie van een door de leverancier aangehaald cijfer, en zo moet het ook worden gelezen. Het is ook een reëel operationeel verschil als het standhoudt: een model dat een kwetsbaarheid niet vindt, kan niet worden gebruikt om te bewijzen dat die echt is, wat de eerste stap is van de meeste incidentrespons. Mistral koppelt de 82% aan een score van 93% op de 40 wedstrijdoefeningen van Cybench en aan een tegenclaim dat zijn weigeringspercentage bij cyberprompts die afkomstig zijn uit JailbreakBench, StrongREJECT en AgentHarm hoger is dan dat van andere open-weightmodellen — het argument daarbij is dat je het vermogen en de discipline in hetzelfde model wilt, in plaats van het een voor het ander in te ruilen.

Afgezien van cyber berust het pleidooi voor Mistral Large 4 op drie dingen die Opus 5 niet biedt. Het is getraind en wordt aangeboden op Europese infrastructuur onder Europees recht, wat van belang is voor kopers met verplichtingen op het gebied van dataresidentie. Het zal, belooft Mistral, te downloaden zijn — het doel van de hele exercitie, aangezien zelfimplementatie nu juist het toegangsrisico tijdens een incident wegneemt dat Mistral met zoveel nadruk beschrijft. En het is per taak goedkoop genoeg dat het gebruiken ervan als eerste ronde en het escaleren van de moeilijke rest naar een frontier-model economisch verstandig is in plaats van een afrondingsfout.

Waar Claude Opus 5 zijn prijs nog steeds waard is

Een indexkloof van 12 punten is niet klein, en het rij-voor-rij-beeld laat zien waar die zit. Terminal-Bench 4.0 is bijna het dubbele — 49,0% tegen 26,8% — en terminalwerk is de dichtstbijzijnde publieke proxy voor agentic coding, en dat is grotendeels waarvoor teams dit jaar frontiermodellen aanschaffen. Humanity's Last Exam laat een verschil van 20 punten zien. Voor langetermijnautonomie zijn het adaptieve redeneerontwerp van Opus 5, het uitvoerplafond van 128K en een geserveerde context van 1M de configuratie die je wilt als je workload een agent-sessie van meerdere uren is in plaats van één enkele moeilijke vraag.

Het uitvoerplafond is het subtielere verschil. Mistral heeft geen maximale uitvoerlengte gepubliceerd voor de preview, en de 128K van Opus 5 heft echt een beperking op voor codegeneratie en lange gestructureerde documenten. Als je pipeline bestanden oplevert in plaats van antwoorden, controleer dat getal dan voordat je overstapt, want het is het soort verschil dat alleen in productie opduikt.

De kosten per taak zijn het getal om aan vast te houden.

Prijzen per token vleien goedkope modellen en geven een misleidend beeld van dure. De eigen kosten per taak van de index — totale uitgaven om één evaluatietaak te voltooien, met cache en al — zijn het getal dat contact met een budget overleeft: $1,13 tegenover $5,86.

Dat is geen vrijbrief om alles naar het goedkopere model te verhuizen, want een taak waarin het goedkope model faalt, is een taak die je twee keer betaalt. Het is een vrijbrief om op te houden met één frontier-model als de enige optie te behandelen. Op OrcaRouter staat Claude Opus 5 in de catalogus tegen de lijstprijs van de leverancier met 0% opslag, in hetzelfde OpenAI-compatibele endpoint als ruim 200 andere modellen, en dat is wat een pijplijn met twee modellen een middagje werk maakt in plaats van een tweede leverancierscontract. Mistral Large 4 staat vandaag niet in de catalogus — de preview is te bereiken via Mistral's eigen API en verschillende platforms van derden. Wanneer de gewichten beschikbaar komen en een provider het host, geldt dezelfde pass-throughregel: wat de leverancier in rekening brengt, is wat jou in rekening wordt gebracht, en een prijsverlaging van de leverancier is dezelfde dag nog op je factuur te zien.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

Voor een onbewezen preview is failover de routeringsfunctie die er het meest toe doet. Een deel van het productieverkeer naar Mistral Large 4 sturen terwijl Opus 5 de rest voor zijn rekening neemt, betekent dat een regressie verandert in een reroute in plaats van een storing, en zo leer je de echte faalmodi van het model kennen op je eigen data in plaats van op een leaderboard.

Wat lost dit binnen drie weken op?

Drie feiten staan nog open, en elk ervan beïnvloedt het antwoord. Als de gewichten onder een permissieve licentie verschijnen, wordt Mistral Large 4 het enige model in dit paar dat je zelf kunt hosten, en de afweging voor gereguleerde kopers slaat sterk door. Als de promotieprijs van $0.68 / $2.09 terugkeert naar de tarieven van $1.36 / $4.18 op de tariefkaart, wordt de kloof per taak kleiner maar blijft beslissend. En als Artificial Analysis de privé geëvalueerde codeercijfers ongewijzigd naar zijn openbare index verplaatst, wordt het codeerverhaal door een derde geverifieerd in plaats van door de leverancier gepubliceerd namens een derde.

Tot dan: Opus 5 is de veilige standaard voor productie en zijn meerprijs waard voor agentisch en terminalintensief werk. Mistral Large 4 is de interessante gok — goedkoop genoeg per taak om ernaast te draaien, bekwaam genoeg op het gebied van automatisering en cyber om vandaag al verkeer te verdienen, en met de belofte van zelfimplementatie die geen enkel gesloten model in deze vergelijking kan evenaren.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt