En genererad titelbild för artikeln 'Mistral Large 4 vs Claude Opus 5' som visar titeln i fet geometrisk sans-serif, undertexten 'Klyftan är mindre än prisgapet' under den, och en rad av tre platta linjeikoner ovanför — två staplar av olika höjd, en prislapp och en mänsklig betygsskala — på en vit bakgrund med blå- och cyan-gradientaccenter och OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Mistral Large 4 vs Claude Opus 5: Klyftan är mindre än prisklyftan

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det enda direktjämförande mått som någon har publicerat för Mistral Large 4 mot Claude Opus 5 kommer från en blind mänsklig utvärdering, och det är närmare än vad benchmark-tabellerna antyder. Surge AI dolde modellernas identiteter och bad professionella annotatörer att betygsätta kodningsutdata på en skala 1–5; Claude Opus 5 slutade etta på 4,22 och Mistral Large 4 Preview slutade tvåa på 3,74, före Kimi K3, GLM-5.3 och GLM-5.2. I det oberoende aggregatet är de två inte alls grannar — 50,8 mot 38,4 på Artificial Analysis Intelligence Index, avläst den 6 oktober. Det som gör att den här duon är värd en eftermiddag är att modellen som får 12 poäng lägre kostar ungefär en femtedel så mycket att köra en uppgift på.

Båda siffrorna behöver få sin proveniens angiven, eftersom de inte är samma sorts tal. Surge AI-utvärderingen är en tredjepartsstudie med människor som Mistral beställde och publicerade – en starkare form av bevis än ett egenkört riktmärke, och fortfarande en studie vars publicering Mistral kontrollerade. Indexpoängen är Artificial Analysis egna körningar, jämförbara med varandra, och därför det rätta paret att resonera utifrån. Ingen av dem säger vilken modell du ska bygga på; tillsammans ringar de in frågan.

Två produkter, inte två generationer av en och samma.

Claude Opus 5 är ett flaggskepp med slutna vikter från leverantören, släppt den 24 juli 2026, och tillhandahålls med ett kontextfönster på 1 miljon token och upp till 128 000 utdatatoken, för 5 USD per miljon indatatoken och 25 USD per miljon utdatatoken, med cachade läsningar för 0,50 USD. Det är leverantörens mest kapabla modell i Opus-linjen och är tydligt positionerad för långsiktigt agentiskt arbete — att förbli sammanhängande över sessioner i flera steg med omfattande verktygsanvändning.

Mistral Large 4 är en förhandsversion som tillkännagavs den 6 oktober 2026 och som Mistral beskriver som en sparse mixture-of-experts-modell med 1,05 biljoner parametrar, 49 miljarder aktiva parametrar och en vision-encoder med 1,6 miljarder parametrar. Dess API-id är mistral-large-4-0, den är nativt multimodal, och Mistrals dokumentation anger ett kontextfönster på 1M tokens medan Artificial Analysis läser 524 288 i den konfiguration den testar. Vikterna utlovas till slutet av oktober och licensen har inte namngetts.

Så det här är inte en nyare modell mot en äldre. Det är en proprietär frontiermodell mot en utmanare som ska bli öppen vikt, och de två prissätts därefter.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

Samma index, båda modellerna

Avläst den 6 oktober från deras Artificial Analysis-sidor, enligt Intelligence Index v4.3:

• Intelligensindex — Mistral Large 4 Preview 38,4 vs Claude Opus 5 50,8

• Kostnad per indextask — 1,13 $ för Mistral Large 4 Preview mot 5,86 $ för Claude Opus 5

• Terminal-Bench 4.0 — 26,8 % mot 49,0 %, den största enskilda skillnaden mellan dem

• Humanity's Last Exam — 35,0 % vs 54,9 %

• MMMU-Pro, multimodalt resonemang — 76,4 % vs 84,7 %

• AutomationBench, affärsarbetsflöden — 59,9 % mot 56,6 %, den enda raden där Mistral Large 4 leder

• Kontextfönster — 1M angivet av Mistral och 524 288 i den testade konfigurationen, mot 1M som serveras

• Utdatatak – publiceras inte för förhandsversionen vs 128K tokens

• Pris per miljon, indata / utdata — $1.36 / $4.18 i listpris, för närvarande $0.68 / $2.09 till kampanjpris, jämfört med $5.00 / $25.00

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

Mönstret är tydligt. Opus 5 ligger före på de två svåraste resonemangstunga raderna – terminalarbete och öppen kunskap – och ligger före inom multimodal förståelse trots att Mistral Large 4 är modellen som säljs in med sin vision. Mistral Large 4 leder raden för arbetsflödesautomatisering, vilket är den rad som ligger närmast vad en affärsenhet faktiskt ber en modell göra, och det gör den till en femtedel av priset per uppgift.

Där Mistral Large 4 verkligen vinner

Det mest intressanta påståendet i Mistrals lanseringsinlägg är inte en benchmarkpoäng. Det är att Mistral Large 4 på ett av Artificial Analysis Cyber Index-testerna – återskapa en verklig sårbarhet i programvara med öppen källkod och sedan patcha den – får 82 %, vilket sägs vara högst av alla modeller, och att flera ledande slutna modeller får nära noll på samma test eftersom de vägrar uppgiften. Mistral nämner Claude Opus 5.5 och GPT-6 Astra som exempel på den vägran.

Det är en leverantörstolkning av en siffra som leverantören åberopar, och den bör läsas så. Det är också en verklig operativ skillnad om den håller: en modell som inte återskapar en sårbarhet kan inte användas för att bevisa att en sådan är verklig, vilket är det första steget i de flesta incidenthanteringsprocesser. Mistral kombinerar 82 % med en poäng på 93 % på Cybenchs 40 tävlingsövningar och ett motpåstående att dess avvisningsfrekvens för cyberpromptar hämtade från JailbreakBench, StrongREJECT och AgentHarm är högre än för andra modeller med öppna vikter – argumentet är att man vill ha förmågan och disciplinen i samma modell i stället för att byta bort den ena mot den andra.

Bortom cyber vilar argumenten för Mistral Large 4 på tre saker som Opus 5 inte erbjuder. Den tränas och driftas på europeisk infrastruktur under europeisk lagstiftning, vilket spelar roll för köpare med skyldigheter kring datalagringsplats. Den kommer, lovar Mistral, att gå att ladda ner – själva poängen med hela övningen, eftersom egen driftsättning är det som undanröjer risken för åtkomst under en pågående incident som Mistral lägger stor vikt vid att beskriva. Och den är tillräckligt billig per uppgift för att det ska vara ekonomiskt klokt, snarare än ett avrundningsfel, att använda den som första genomgång och eskalera det svåra restarbetet till en frontier-modell.

Där Claude Opus 5 fortfarande är värt sitt pris

Ett indexgap på 12 punkter är inte litet, och rad-för-rad-bilden visar var det finns. Terminal-Bench 4.0 är nästan dubbelt så högt – 49,0 % mot 26,8 % – och terminalarbete är den närmaste offentliga approximationen av agentisk kodning, vilket är större delen av det som team köper frontier-modeller för i år. Humanity's Last Exam skiljer dem åt med 20 poäng. När det gäller autonomi över långa tidshorisonter är Opus 5:s adaptiva resonemangsdesign, dess utdatatak på 128K och en serverad 1M-kontext den konfiguration du vill ha om din arbetsbelastning är en agentsession som varar i flera timmar snarare än en enda svår fråga.

Utdatataket är den tystare skillnaden. Mistral har inte publicerat någon maximal utdatalängd för förhandsversionen, och Opus 5:s 128K är en verklig befrielse från begränsningar för kodgenerering och långa strukturerade dokument. Om din pipeline producerar filer snarare än svar bör du kontrollera den siffran innan du byter, eftersom det är den typ av gap som bara visar sig i produktion.

Kostnaden per uppgift är siffran att hålla fast vid

Per-token-priser smickrar billiga modeller och ger en missvisande bild av dyra. Indexets egen kostnad per uppgift — den totala utgiften för att slutföra en utvärderingsuppgift, cache och allt inräknat — är det tal som överlever kontakten med en budget: $1,13 mot $5,86.

Det är inte ett tillstånd att flytta allt till den billigare modellen, eftersom en uppgift som den billiga modellen misslyckas med är en uppgift du betalar för två gånger. Det är ett tillstånd att sluta behandla en enda frontmodell som det enda alternativet. På OrcaRouter, Claude Opus 5 finns i katalogen till leverantörens listpris med 0 % påslag, i samma OpenAI-kompatibla slutpunkt som över 200 andra modeller, vilket är det som gör en pipeline med två modeller till ett eftermiddagsarbete i stället för ett andra leverantörsavtal. Mistral Large 4 finns inte i katalogen i dag – förhandsversionen nås via Mistrals eget API och flera tredjepartsplattformar. När dess vikter blir tillgängliga och en leverantör hostar den gäller samma vidarefaktureringsregel: vad leverantören tar betalt är vad du debiteras, och en prissänkning från leverantören syns på din faktura samma dag.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

För en obeprövad förhandsversion är failover den routningsfunktion som spelar störst roll. Att skicka en andel av produktionstrafiken till Mistral Large 4 medan Opus 5 hanterar resten innebär att en regression blir en omdirigering i stället för ett avbrott, och du lär dig modellens verkliga felmönster på dina egna data i stället för på en leaderboard.

Vad löser detta inom tre veckor

Tre fakta är fortfarande öppna, och var och en förändrar svaret. Om vikterna släpps under en tillåtande licens blir Mistral Large 4 den enda modellen i detta par som du kan självhosta, och kalkylen för reglerade köpare förskjuts kraftigt. Om kampanjprissättningen 0,68 $ / 2,09 $ återgår till 1,36 $ / 4,18 $ i prislistan, minskar gapet per uppgift men förblir avgörande. Och om Artificial Analysis flyttar de privat utvärderade kodningssiffrorna oförändrade till sitt offentliga index, blir kodningsbilden tredjepartsverifierad i stället för publicerad av leverantören på en tredje parts vägnar.

Till dess: Opus 5 är den säkra produktionsstandarden och värd sitt högre pris för agentiskt och terminaltungt arbete. Mistral Large 4 är den intressanta satsningen — tillräckligt billig per uppgift för att köras vid sidan av den, tillräckligt kapabel inom automation och cyber för att förtjäna trafik redan idag, och med ett löfte om egen driftsättning som ingen sluten modell i den här jämförelsen kan matcha.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen