OrcaRouter modellradar-hero-kort för jämförelsen mellan MiMo-V2.6-Pro och DeepSeek V4 Pro, med underrubriken 'Två öppna flaggskepp, tio indexpoäng ifrån varandra.', med en panel per modell och en sidfot som noterar att båda är MIT-licensierade med ett kontextfönster på 1M tokens och att poängen är v4.3.2 och inte jämförbara med tidigare indexversioner.
Guides & Insights

MiMo-V2.6-Pro vs DeepSeek V4 Pro: Två öppna flaggskepp, tio indexpoäng ifrån varandra

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Xiaomi MiMo-V2.6-Pro och DeepSeek V4 Pro är samma typ av objekt – kinesiska flaggskepp inom mixture-of-experts med biljoner parametrar, MIT-licensierade, 1M-tokens kontext, öppna vikter som du kan ladda ner i dag – och de skiljer sig med tio poäng på Artificial Analysis Intelligence Index v4.3.2, 46 mot 36. De är också oense om vad ett flaggskepp är till för. DeepSeek V4 Pro, som släpptes den 13 augusti 2026, är en textbaserad resonemangsmodell: 1,6 biljoner parametrar med 49 miljarder aktiva, och ingen inmatning av bild, ljud eller video någonstans i dess publicerade gränssnitt. Xiaomi MiMo-V2.6-Pro, som släpptes den 21 september 2026, har 1,02 biljoner parametrar med 42 miljarder aktiva och tar emot text, bild, video och ljud. Den skillnaden avgör fler driftsättningar än de tio poängen gör, och det är det första att avgöra innan du jämför något annat.

Samma licens, olika maskiner

Börja med det som verkligen är identiskt, för det är mer än man skulle förvänta sig mellan två konkurrerande labb. Båda släpps under en MIT-licenstagg i offentliga repositorier, vilket innebär kommersiell driftsättning, modifiering och vidare träning utan intäktsgrind eller klausul om användningsområde. Båda uppger ett kontextfönster på 1M token. Båda är sparse mixture-of-experts-konstruktioner – arkitekturen har blivit standard i den här skalan, inte en särskiljande faktor. Och båda tränades av labb som publicerar mindre om metod än vad västerländska frontier-labb gör.

• Parametrar — MiMo-V2.6-Pro 1,02T totalt / 42B aktiva; DeepSeek V4 Pro 1,6T totalt / 49B aktiva

• Indatamodalitet — MiMo-V2.6-Pro text, bild, video, ljud; DeepSeek V4 Pro endast text

• Kontext — 1M tokens båda; DeepSeek V4 Pro begränsar utdata till 384K tokens

• Indexpoäng — MiMo-V2.6-Pro 46 på Intelligence Index v4.3.2; DeepSeek V4 Pro 36 på samma version

• Kostnad per Index-uppgift — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67

• Listpris — MiMo-V2.6-Pro $0,43 / $0,87 per 1 miljon tokens; DeepSeek V4 Pro $1,32 / $3,96 så som Artificial Analysis listar den, före DeepSeeks eget schema för högtrafik och lågtrafik

• Hastighet — MiMo-V2.6-Pro 134,3 utdatatokens/sekund; DeepSeek V4 Pro 97,4

• Tid till första token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s

Läs den listan två gånger, för två rader är kontraintuitiva. Den mindre modellen får tio poäng högre — 42 miljarder aktiva parametrar som slår 49 miljarder är inte en avrundningsskillnad, det är ett resultat av efterträning, och det är den enskilt tydligaste signalen i den här jämförelsen på att förstärkningsinlärningens kvalitet har gått om rå skala som hävstång. Och den billigare modellen är också den snabbare, både vad gäller genomströmning och kostnad per uppgift, vilket är motsatsen till den vanliga avvägningen. Xiaomi säljer inte en rabatt till dig i utbyte mot tålamod. DeepSeeks försprång är tid till första token, 1,62 sekunder mot 2,15 — verkligt, men den enda kategorin där V4 Pro leder.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Varför samma indexversion har betydelse här

Att jämföra modeller med öppna vikter över olika indexrevisioner är så de flesta publicerade jämförelser går fel, så versionsnumret är inte en fotnot. Artificial Analysis byggde om Intelligence Index till v4.3 i september 2026, och poängen förändrades avsevärt över den gränsen – Claude Opus 5 tappade tre poäng mellan v4.2 och v4.3, och fältet för öppna vikter sorterades om. Båda siffrorna ovan är v4.3.2, vilket innebär att 46 och 36 är direkt jämförbara med varandra. De är inte jämförbara med de äldre siffror som citeras någon annanstans för någon av modellerna.

Det är inte ett hypotetiskt scenario. DeepSeek V4 Pro rapporterades allmänt ligga på 53 på en tidigare indexskala i augusti 2026, och vår egen bevakning av den perioden innehöll det. På v4.3.2 visar samma modell 36. Ingenting med modellen förändrades; mätstickan gjorde det. Om du har ett kalkylblad med 53 i bredvid en 46 för MiMo-V2.6-Pro, har du en jämförelse som pekar dig mot fel modell. Den korrekta parningen är 46 mot 36, och den korrekta slutsatsen är att modellen som släpptes fem veckor senare, med två tredjedelar av parameterantalet, ligger väsentligt före.

Rapporteringsgapet mellan de två labben

Det finns en andra, subtilare skillnad, och den gäller vad varje labb är villigt att få kontrollerat.

MiMo-V2.6-Pros 46 är en mätning från Artificial Analysis. Utvärderingshuset körde sin egen svit – tio utvärderingar inom resonemang, kunskap, matematik och kodning – på den släppta modellen och publicerade resultatet, tillsammans med driftssiffrorna: 134,3 tokens/sekund, 2,15 sekunder till första token, 99 % cacherabatt, 0,13 USD per indexuppgift och en total utvärderingskostnad på 206,66 USD. Det är en tredje parts siffra om Xiaomis modell.

DeepSeek V4 Pros framträdande agentiska siffror är DeepSeeks egna, och gapet mellan dem och de oberoende har dokumenterats. Bolagets lanseringsmaterial rapporterar Terminal-Bench 2.1 på 87,9, DeepSWE på 62,7, CyberGym på 83,3 och SWE-bench Verified på 80,6. Oberoende körningar anger Terminal-Bench 2.1 till 78,7 – ungefär nio punkter under leverantörens siffra – och Artificial Analysis Coding Index till 68,8. Ingen av leverantörens siffror har reproducerats, och storleken på Terminal-Bench-gapet är anledningen till att behandla resten av uppsättningen som påståenden snarare än mätningar.

Xiaomi har sin egen version av samma problem. Dess instrumentpanel rapporterar att MiMo-V2.6-Pro går från 58,4 till 72,57 på DeepSWE v1.1 under dess körning med förstärkningsinlärning, utvärderad i Xiaomis eget testramverk med mini-swe-agent som genomsnitt av tre. Det är inte en inlämning till en resultattavla och ingen utomstående part har kört om den. Så ingen av modellerna kommer med en friskförklaring när det gäller leverantörsbenchmarkar. Skillnaden är att MiMo-V2.6-Pro också kommer med en oberoende sammansatt poäng som DeepSeeks lansering inte hade vid motsvarande tidpunkt – och om du väljer mellan dem utifrån bevis snarare än marknadsföring, är det den asymmetrin som bör väga tungt.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

Hur det här ser ut i produktion

Modalitetsskillnaden är den praktiska skiljelinjen, och den talar till DeepSeeks fördel mindre ofta än vad tiopoängsgapet antyder. Om din pipeline tar in skärmbilder, PDF-filer renderade som bilder, videobilder eller ljud, hanterar MiMo-V2.6-Pro det inbyggt i en enda modell, och DeepSeek V4 Pro kan inte hantera det alls – du skulle behöva en separat visionsmodell framför, vilket innebär ett andra avtal, ett andra felläge och en andra faktura. Om din arbetsbelastning är textbaserat resonemang är den extra modaliteten dödvikt som du inte betalar något för.

Kostnaden per indextask är den andra siffran att ta med. $0,13 mot $0,67 är en femfaldig skillnad på en kontrollerad, identisk uppsättning uppgifter, mätt på samma sätt för båda. DeepSeek har ett debiteringsschema för hög- och lågtrafik som kan sänka den effektiva taxan avsevärt beroende på när du gör anropet, så den verkliga kvoten krymper under lågtrafik och vidgas under högtrafik – en detalj som spelar roll om din trafik är stötvis och du inte kan välja när den anländer.

Det är här DeepSeek-sidan har en verklig fördel som inte har något med modellen att göra: den finns på vår plattform. DeepSeek V4 Pro är nåbar som deepseek/deepseek-v4-pro via en OrcaRouter-nyckel till leverantörens listpris med 0 % påslag, med automatisk failover mellan leverantörer och routnings-DSL:en tillgänglig ovanpå — så peak/off-peak-aritmetiken, leverantörsspridningen och reservvägen är allt saker du konfigurerar snarare än saker du bygger. MiMo-V2.6-Pro finns inte på vår plattform, och vi säger det rakt ut: att nå den i dag innebär Xiaomis egen plattform eller en av tredjepartskatalogerna som listar den, och Artificial Analysis räknade en enda API-leverantör för den vid insamlingstillfället. En väg är inte en produktionsväg, vilket är det starkaste argumentet för att behandla MiMo-V2.6-Pro som en modell att utvärdera nu och att routa till med omsorg, med något annat bakom.

Vilken, och när?

Välj DeepSeek V4 Pro om ditt arbete är enbart textbaserat, om du behöver taket på 384K utdata, om du vill ha den snabbaste tiden till första token av de två, eller om du redan finns på vår plattform och vill ha ett spår med öppna vikter och en biljon parametrar med failover och utan ny integration. Det är den sittande modellen av en anledning, och att vara fem veckor äldre har inneburit fem veckor av verktyg, kvantisering och serveringsrecept som en septembermodell ännu inte har samlat på sig.

Välj MiMo-V2.6-Pro om uppgiften är multimodal, om kostnaden per uppgift dominerar din enhetsekonomi, om genomströmning är viktigare än en halv sekunds latens, eller om du vill ha den nuvarande ledaren inom öppna vikter på ett oberoende uppmätt index. MIT-licensen för båda innebär att viktsfrågan är avgjord oavsett — du kan köra endera på din egen hårdvara, finjustera den och släppa den kommersiellt.

Den konfiguration som är värd att överväga är inte ett val över huvud taget. En router låter dig behålla DeepSeek-spåret för enbart textbaserat resonemang till lågtrafikpriser och lägga till ett MiMo-spår för de multimodala förfrågningarna, med en reservlösning framför den smalare vägen. Det är inte att säkra mot alla utfall; det är att matcha varje förfrågan med den modell som faktiskt hanterar den, vilket är ett billigare och mer hållbart svar än att välja en vinnare och hoppas att arbetsbelastningen aldrig ändrar form.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

Frågan som denna jämförelse ännu inte kan besvara

Båda modellernas mest citerade benchmarks körs av leverantören och har inte reproducerats. För DeepSeek V4 Pro har den luckan varit öppen sedan augusti och är anledningen till att dess oberoende resultat ligger lägre än dess lanseringssiffror. För MiMo-V2.6-Pro finns det oberoende sammanvägda resultatet, men inte den agentiska uppdelningen — Artificial Analysis publicerar en 46:a och inte spridningen per utvärdering under den, vilket är detaljen som avgör om en modell hör hemma i en agentloop eller en frågebesvarande pipeline.

Fram till att den spridningen publiceras och till dess att någon kör om Xiaomis DeepSWE-harness är den försvarbara positionen smalare än marknadsföringen från något av labben: MiMo-V2.6-Pro leder på ett oberoende sammansatt mått och på uppmätt kostnad per uppgift, DeepSeek V4 Pro leder inom mognad, utdatalängd, latens för första token och att vara nåbar via en väg som har redundans bakom sig. Fem veckor är ett kort försprång, och det är det enda DeepSeek har.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen