
MiMo-V2.6-Pro vs DeepSeek V4 Pro: Två öppna flaggskepp, tio indexpoäng ifrån varandra
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro och DeepSeek V4 Pro är samma typ av objekt – kinesiska flaggskepp inom mixture-of-experts med biljoner parametrar, MIT-licensierade, 1M-tokens kontext, öppna vikter som du kan ladda ner i dag – och de skiljer sig med tio poäng på Artificial Analysis Intelligence Index v4.3.2, 46 mot 36. De är också oense om vad ett flaggskepp är till för. DeepSeek V4 Pro, som släpptes den 13 augusti 2026, är en textbaserad resonemangsmodell: 1,6 biljoner parametrar med 49 miljarder aktiva, och ingen inmatning av bild, ljud eller video någonstans i dess publicerade gränssnitt. Xiaomi MiMo-V2.6-Pro, som släpptes den 21 september 2026, har 1,02 biljoner parametrar med 42 miljarder aktiva och tar emot text, bild, video och ljud. Den skillnaden avgör fler driftsättningar än de tio poängen gör, och det är det första att avgöra innan du jämför något annat.
Samma licens, olika maskiner
Börja med det som verkligen är identiskt, för det är mer än man skulle förvänta sig mellan två konkurrerande labb. Båda släpps under en MIT-licenstagg i offentliga repositorier, vilket innebär kommersiell driftsättning, modifiering och vidare träning utan intäktsgrind eller klausul om användningsområde. Båda uppger ett kontextfönster på 1M token. Båda är sparse mixture-of-experts-konstruktioner – arkitekturen har blivit standard i den här skalan, inte en särskiljande faktor. Och båda tränades av labb som publicerar mindre om metod än vad västerländska frontier-labb gör.
• Parametrar — MiMo-V2.6-Pro 1,02T totalt / 42B aktiva; DeepSeek V4 Pro 1,6T totalt / 49B aktiva
• Indatamodalitet — MiMo-V2.6-Pro text, bild, video, ljud; DeepSeek V4 Pro endast text
• Kontext — 1M tokens båda; DeepSeek V4 Pro begränsar utdata till 384K tokens
• Indexpoäng — MiMo-V2.6-Pro 46 på Intelligence Index v4.3.2; DeepSeek V4 Pro 36 på samma version
• Kostnad per Index-uppgift — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67
• Listpris — MiMo-V2.6-Pro $0,43 / $0,87 per 1 miljon tokens; DeepSeek V4 Pro $1,32 / $3,96 så som Artificial Analysis listar den, före DeepSeeks eget schema för högtrafik och lågtrafik
• Hastighet — MiMo-V2.6-Pro 134,3 utdatatokens/sekund; DeepSeek V4 Pro 97,4
• Tid till första token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s
Läs den listan två gånger, för två rader är kontraintuitiva. Den mindre modellen får tio poäng högre — 42 miljarder aktiva parametrar som slår 49 miljarder är inte en avrundningsskillnad, det är ett resultat av efterträning, och det är den enskilt tydligaste signalen i den här jämförelsen på att förstärkningsinlärningens kvalitet har gått om rå skala som hävstång. Och den billigare modellen är också den snabbare, både vad gäller genomströmning och kostnad per uppgift, vilket är motsatsen till den vanliga avvägningen. Xiaomi säljer inte en rabatt till dig i utbyte mot tålamod. DeepSeeks försprång är tid till första token, 1,62 sekunder mot 2,15 — verkligt, men den enda kategorin där V4 Pro leder.

Varför samma indexversion har betydelse här
Att jämföra modeller med öppna vikter över olika indexrevisioner är så de flesta publicerade jämförelser går fel, så versionsnumret är inte en fotnot. Artificial Analysis byggde om Intelligence Index till v4.3 i september 2026, och poängen förändrades avsevärt över den gränsen – Claude Opus 5 tappade tre poäng mellan v4.2 och v4.3, och fältet för öppna vikter sorterades om. Båda siffrorna ovan är v4.3.2, vilket innebär att 46 och 36 är direkt jämförbara med varandra. De är inte jämförbara med de äldre siffror som citeras någon annanstans för någon av modellerna.
Det är inte ett hypotetiskt scenario. DeepSeek V4 Pro rapporterades allmänt ligga på 53 på en tidigare indexskala i augusti 2026, och vår egen bevakning av den perioden innehöll det. På v4.3.2 visar samma modell 36. Ingenting med modellen förändrades; mätstickan gjorde det. Om du har ett kalkylblad med 53 i bredvid en 46 för MiMo-V2.6-Pro, har du en jämförelse som pekar dig mot fel modell. Den korrekta parningen är 46 mot 36, och den korrekta slutsatsen är att modellen som släpptes fem veckor senare, med två tredjedelar av parameterantalet, ligger väsentligt före.
Rapporteringsgapet mellan de två labben
Det finns en andra, subtilare skillnad, och den gäller vad varje labb är villigt att få kontrollerat.
MiMo-V2.6-Pros 46 är en mätning från Artificial Analysis. Utvärderingshuset körde sin egen svit – tio utvärderingar inom resonemang, kunskap, matematik och kodning – på den släppta modellen och publicerade resultatet, tillsammans med driftssiffrorna: 134,3 tokens/sekund, 2,15 sekunder till första token, 99 % cacherabatt, 0,13 USD per indexuppgift och en total utvärderingskostnad på 206,66 USD. Det är en tredje parts siffra om Xiaomis modell.
DeepSeek V4 Pros framträdande agentiska siffror är DeepSeeks egna, och gapet mellan dem och de oberoende har dokumenterats. Bolagets lanseringsmaterial rapporterar Terminal-Bench 2.1 på 87,9, DeepSWE på 62,7, CyberGym på 83,3 och SWE-bench Verified på 80,6. Oberoende körningar anger Terminal-Bench 2.1 till 78,7 – ungefär nio punkter under leverantörens siffra – och Artificial Analysis Coding Index till 68,8. Ingen av leverantörens siffror har reproducerats, och storleken på Terminal-Bench-gapet är anledningen till att behandla resten av uppsättningen som påståenden snarare än mätningar.
Xiaomi har sin egen version av samma problem. Dess instrumentpanel rapporterar att MiMo-V2.6-Pro går från 58,4 till 72,57 på DeepSWE v1.1 under dess körning med förstärkningsinlärning, utvärderad i Xiaomis eget testramverk med mini-swe-agent som genomsnitt av tre. Det är inte en inlämning till en resultattavla och ingen utomstående part har kört om den. Så ingen av modellerna kommer med en friskförklaring när det gäller leverantörsbenchmarkar. Skillnaden är att MiMo-V2.6-Pro också kommer med en oberoende sammansatt poäng som DeepSeeks lansering inte hade vid motsvarande tidpunkt – och om du väljer mellan dem utifrån bevis snarare än marknadsföring, är det den asymmetrin som bör väga tungt.

Hur det här ser ut i produktion
Modalitetsskillnaden är den praktiska skiljelinjen, och den talar till DeepSeeks fördel mindre ofta än vad tiopoängsgapet antyder. Om din pipeline tar in skärmbilder, PDF-filer renderade som bilder, videobilder eller ljud, hanterar MiMo-V2.6-Pro det inbyggt i en enda modell, och DeepSeek V4 Pro kan inte hantera det alls – du skulle behöva en separat visionsmodell framför, vilket innebär ett andra avtal, ett andra felläge och en andra faktura. Om din arbetsbelastning är textbaserat resonemang är den extra modaliteten dödvikt som du inte betalar något för.
Kostnaden per indextask är den andra siffran att ta med. $0,13 mot $0,67 är en femfaldig skillnad på en kontrollerad, identisk uppsättning uppgifter, mätt på samma sätt för båda. DeepSeek har ett debiteringsschema för hög- och lågtrafik som kan sänka den effektiva taxan avsevärt beroende på när du gör anropet, så den verkliga kvoten krymper under lågtrafik och vidgas under högtrafik – en detalj som spelar roll om din trafik är stötvis och du inte kan välja när den anländer.
Det är här DeepSeek-sidan har en verklig fördel som inte har något med modellen att göra: den finns på vår plattform. DeepSeek V4 Pro är nåbar som deepseek/deepseek-v4-pro via en OrcaRouter-nyckel till leverantörens listpris med 0 % påslag, med automatisk failover mellan leverantörer och routnings-DSL:en tillgänglig ovanpå — så peak/off-peak-aritmetiken, leverantörsspridningen och reservvägen är allt saker du konfigurerar snarare än saker du bygger. MiMo-V2.6-Pro finns inte på vår plattform, och vi säger det rakt ut: att nå den i dag innebär Xiaomis egen plattform eller en av tredjepartskatalogerna som listar den, och Artificial Analysis räknade en enda API-leverantör för den vid insamlingstillfället. En väg är inte en produktionsväg, vilket är det starkaste argumentet för att behandla MiMo-V2.6-Pro som en modell att utvärdera nu och att routa till med omsorg, med något annat bakom.
Vilken, och när?
Välj DeepSeek V4 Pro om ditt arbete är enbart textbaserat, om du behöver taket på 384K utdata, om du vill ha den snabbaste tiden till första token av de två, eller om du redan finns på vår plattform och vill ha ett spår med öppna vikter och en biljon parametrar med failover och utan ny integration. Det är den sittande modellen av en anledning, och att vara fem veckor äldre har inneburit fem veckor av verktyg, kvantisering och serveringsrecept som en septembermodell ännu inte har samlat på sig.
Välj MiMo-V2.6-Pro om uppgiften är multimodal, om kostnaden per uppgift dominerar din enhetsekonomi, om genomströmning är viktigare än en halv sekunds latens, eller om du vill ha den nuvarande ledaren inom öppna vikter på ett oberoende uppmätt index. MIT-licensen för båda innebär att viktsfrågan är avgjord oavsett — du kan köra endera på din egen hårdvara, finjustera den och släppa den kommersiellt.
Den konfiguration som är värd att överväga är inte ett val över huvud taget. En router låter dig behålla DeepSeek-spåret för enbart textbaserat resonemang till lågtrafikpriser och lägga till ett MiMo-spår för de multimodala förfrågningarna, med en reservlösning framför den smalare vägen. Det är inte att säkra mot alla utfall; det är att matcha varje förfrågan med den modell som faktiskt hanterar den, vilket är ett billigare och mer hållbart svar än att välja en vinnare och hoppas att arbetsbelastningen aldrig ändrar form.

Frågan som denna jämförelse ännu inte kan besvara
Båda modellernas mest citerade benchmarks körs av leverantören och har inte reproducerats. För DeepSeek V4 Pro har den luckan varit öppen sedan augusti och är anledningen till att dess oberoende resultat ligger lägre än dess lanseringssiffror. För MiMo-V2.6-Pro finns det oberoende sammanvägda resultatet, men inte den agentiska uppdelningen — Artificial Analysis publicerar en 46:a och inte spridningen per utvärdering under den, vilket är detaljen som avgör om en modell hör hemma i en agentloop eller en frågebesvarande pipeline.
Fram till att den spridningen publiceras och till dess att någon kör om Xiaomis DeepSWE-harness är den försvarbara positionen smalare än marknadsföringen från något av labben: MiMo-V2.6-Pro leder på ett oberoende sammansatt mått och på uppmätt kostnad per uppgift, DeepSeek V4 Pro leder inom mognad, utdatalängd, latens för första token och att vara nåbar via en väg som har redundans bakom sig. Fem veckor är ett kort försprång, och det är det enda DeepSeek har.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
