
Mistral Large 4 vs Gemini 3.1 Pro: Åtta månader, två riktningar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 151 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Gemini 3.1 Pro har funnits på marknaden sedan den 19 februari 2026 och rankas fortfarande nära toppen i varje bred kapacitetstabell, inklusive de där den jämförs med modeller som släpptes i höstas. Mistral Large 4 är högst tre veckor gammal – en förhandsversion som tillkännagavs den 6 oktober 2026, med sina vikter utlovade till slutet av oktober och ingen licens angiven. På Artificial Analysis Intelligence Index, avläst den 6 oktober, får den åtta månader gamla Gemini 3.1 Pro 29,7 mot nykomlingens 38,4. Det är den ärliga utgångspunkten för den här jämförelsen, och det är motsatsen till vad releasedatumen antyder.
Förklaringen är inte mystisk. Gemini 3.1 Pro är ett flaggskepp i förhandsvisningslinjen som Google aldrig har befordrat till en stabil version, och Artificial Analysiss sida för den är märkt "Gemini 3.1 Pro Preview" – samma sida där ett lägre index sitter bredvid en GPQA Diamond i toppklass. Det är en modell byggd för bredd: ett mycket stort kontextfönster, en bred uppsättning modaliteter och resonemang som är starka på kunskapsfrågor. Mistral Large 4 är byggd för en helt annan karta över världen, och prissätts därefter.
Vad var och en är
Gemini 3.1 Pro är Googles främsta multimodala resonemangsmodell, API-id gemini-3.1-pro-preview, med ett kontextfönster på 1 048 576 token och ett utdatatak på 65 536 token. Den tar emot text, bilder, video, ljud och filer. Den serveras från OrcaRouters katalog till Googles egna priser. Googles dokumentation listar ingen icke-preview-version av Gemini 3.1 Pro; preview-namnet är produkten.
Mistral Large 4 är ett glest mixture-of-experts-system med 1,05 biljoner parametrar, 49 miljarder aktiva parametrar och en dedikerad visionsencoder med 1,6 miljarder parametrar, och erbjuds som "Mistral Large 4 Preview" under API-id:t mistral-large-4-0. Mistrals dokumentation anger ett kontextfönster på 1 miljon token; Artificial Analysis avläser 524 288 på den konfiguration som testas. Maximal utdata publiceras inte. Mistral beskriver den som sin största och mest kapabla modell hittills och säger att vikterna kommer i slutet av oktober.
Siffrorna, med deras proveniens bifogad.
Båda modellerna har oberoende sidor, så jämförelsen nedan utgår från samma testrigg snarare än leverantör mot leverantör:
• Intelligensindex v4.3 — Mistral Large 4 Preview 38,4 vs Gemini 3.1 Pro 29,7
• Kostnad per indextask — 1,13 $ mot 1,30 $
• Långkontextresonemang — 81,3 % vs 82,0 %
• GPQA Diamond — inte publicerat för förhandsvisningen vs 94,1 %
• Humanity's Last Exam — 35,0 % mot 47,0 %
• Terminal-Bench 4.0 — 26,8 % mot 4,0 %
• SciCode — 54,2 % mot 58,7 %
• AutomationBench, affärsarbetsflöden — 59,9 % mot 35,4 %
• MMMU-Pro, multimodalt resonemang — 76,4 % vs 82,4 %
• Kontextfönster — 1M angivet / 524 288 testat vs 1 048 576 serverat
• Utdatatak – inte publicerat vs 65 536 tokens
• Pris per miljon, indata / utdata — $1.00 / $4.18 listpris, $0.68 / $2.09 kampanjpris, mot $2.00 / $12.00 under 200K tokens och $4.00 / $18.00 över
• Vikter — utlovade, licens ej namngiven, vs proprietär

Den enskilt mest slående raden är Terminal-Bench 4.0. Gemini 3.1 Pro får 4,0 % – inte ett stavfel, och inte en hallucination i tabellen: det återspeglar en modell från februari som körs i ett terminalagent-ramverk som tillkom efter den. Mistral Large 4:s 26,8 % är sex gånger högre i samma test. Den som har uteslutit Gemini utifrån en gammal siffra för agentisk kodning bör räkna in den igen utifrån sitt GPQA Diamond, och den som har uteslutit Mistral utifrån indexplacering bör först titta på terminalraden.
Där Gemini 3.1 Pro fortfarande har övertaget
Kunskap och bredd. En GPQA Diamond på 94,1 % är den högsta siffran någonstans i den här artikeln, på båda sidor, och det är ett vetenskapsbenchmark på avancerad nivå – inte en siffra som en modell pratar sig till. Humanity's Last Exam med 47,0 % mot 35,0 %, och en SciCode-poäng som knappt överträffar nykomlingen, säger samma sak. Om din arbetsbelastning består i att besvara svåra frågor korrekt utifrån en kunskapskorpus, förblir Gemini 3.1 Pro den starkare modellen åtta månader efter lanseringen.
Modalitetsbredd är den andra fördelen. Gemini 3.1 Pro hanterar video och ljud såväl som text och bilder. Mistral Large 4 hanterar text och bilder. Om din pipeline läser in inspelade möten, skärminspelningar eller sensorljud, kan bara en modell här se hela indata.
Utdatataket är det tredje. 65 536 token är ett publicerat, garanterat tak; Mistral har inte publicerat något sådant för förhandsversionen över huvud taget. Inget i ett lanseringsinlägg är mer sannolikt att ställa till problem för dig i produktion än en outtalad utdatagräns.
Och Geminis kontextfönster levereras verkligen med 1 048 576 token, medan Mistrals 1M är leverantörens siffra mot en oberoende uppmätt 524 288. För en arbetsbelastning som ligger i den bortre änden av fönstret är skillnaden mellan ett angivet och ett uppmätt tal en omskrivning.
Där Mistral Large 4 ändrar beslutet
Agentiskt arbete, och särskilt allt som rör en terminal, är där de två modellerna slutar vara jämförbara. Mistrals eget lanseringsinlägg sammanställer 61,7 % på DeepSWE v1.1, 59,4 % på SWE-Atlas-QnA och 28,3 % på Terminal-Bench 4.0 till ett Coding Agent Index på 49,8 %, och säger klart och tydligt att det placerade sig före DeepSeek V4 Pro 0813 och Qwen3.8 Max på det kombinerade måttet. De tre siffrorna är, med Mistrals ord, siffror som Artificial Analysis utvärderade privat innan deras testramverk blev offentligt; de finns ännu inte i det offentliga indexet och bör märkas som leverantörspublicerade tills de är det.
Oberoende bevis pekar i samma riktning. På AutomationBench – 657 affärsarbetsflöden som omfattar Gmail, Sheets, Slack och Salesforce – får Mistral Large 4 59,9 %, före Kimi K3, MiMo-V2.6-Pro och DeepSeek V4 Pro, och i samma testramverk förekommer Gemini 3.1 Pro inte alls, eftersom benchmarken är senare än den. En blind mänsklig studie som genomförts av Surge AI rankade Mistral Large 4 Preview som tvåa av fem modeller i kodningskvalitet med 3,74, före GLM-5.3 och Kimi K3 och bara efter Claude Opus 5.
Cyberpåståendet är det skarpaste i Mistrals inlägg och värt att återge exakt: 82 % på testet Artificial Analysis Cyber Index, som ber en modell att återskapa en verklig sårbarhet och sedan patcha den, vilket beskrivs som det högsta av alla modeller, med 93 % på Cybenchs 40 tävlingsövningar, och Mistrals påstående att den rankas bland de fem bästa globalt på Cyber Index totalt samtidigt som den är ledande bland modeller med öppna vikter utvecklade utanför Kina. Det är leverantörsangivna siffror på ett oberoende index. Deras praktiska fördel är att Mistral byggde modellen för att utföra arbetet i stället för att vägra göra det.
Den billigaste raden i tabellen tillhör också Mistral, men bara knappt: 1,13 dollar per uppgift mot 1,30 dollar, en fördel på 13 % som kampanjpriset ger och som prislistan skulle utplåna. Gemini 3.1 Pro är en 2026-modell med 2026-prissättning, och det är inte dyrt att köra en indexuppgift på den.
Tiebreakern som ingen benchmarkar
Två saker spelar in som tabellerna inte kan visa. Den första är licensiering. Gemini 3.1 Pro är proprietärt och kommer att förbli så; Mistral Large 4 är en förhandsversion vars hela säljargument är att den blir en nedladdningsbar artefakt som du kan köra enligt din egen policy, på din egen hårdvara, under europeisk lag — Mistral tränade den på 3 800 Grace Blackwell GPU:er i sina egna datacenter och tillhandahåller förhandsversionen där. Det argumentet är värt ingenting förrän repositoriet dyker upp och licensen har ett namn. Det är värt mycket den dag det sker.

Den andra är operativ risk. En förhandsversion som fortfarande förfinas kommer att förändras under fötterna på dig. På OrcaRouter kan båda sidorna av den här jämförelsen nås via en enda OpenAI-kompatibel slutpunkt till leverantörslistpriser med 0 % påslag – Gemini 3.1 Pro finns live i katalogen till Googles priser, medan Mistral Large 4 måste nås via Mistrals eget API och flera tredjepartsplattformar, eftersom det inte är en rutt som vi erbjuder. Routing-DSL:en är den användbara delen här: skicka klassificering och extrahering till den modell som är billigast den veckan, eskalera de svåra restfallen och låt automatisk failover absorbera förhandsversionens dåliga dagar i stället för att din jourrotation gör det.

Domen
Fråga vad arbetsbelastningen är, inte vilken modell som är bättre. För kunskapsarbete, ljud- och videoinmatning, ett garanterat utdatatak och ett serverat fönster på en miljon token är Gemini 3.1 Pro fortfarande den starkare modellen och dess ålder är inte en brist — det är åtta månader av att andra har hittat dess gränser. För agentisk kodning, terminalarbete och säkerhetsoperationer ligger Mistral Large 4 före med en marginal som är så bred att indexrankningen är missvisande, och det är den enda av de två som kan komma att bli självhostbar.
Den avgörande faktorn att hålla koll på är slutet av oktober. Om vikterna kommer under en tillåtande licens, slutar Mistral Large 4 att konkurrera med Gemini 3.1 Pro på pris och börjar konkurrera med den när det gäller kontroll, och det är en annan kamp. Om de kommer under en restriktiv sådan, förändras inte den här artikelns svar särskilt mycket — men anledningen gör det.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
