
MiMo-V2.6-Pro vs DeepSeek V4 Pro: twee open vlaggenschepen, tien indexpunten uit elkaar
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro en DeepSeek V4 Pro zijn hetzelfde soort object — Chinese mixture-of-experts-vlaggenschepen met een biljoen parameters, MIT-gelicentieerd, 1M-tokencontext, open gewichten die je vandaag kunt downloaden — en ze liggen tien punten uit elkaar op de Artificial Analysis Intelligence Index v4.3.2, 46 tegenover 36. Ze zijn het ook oneens over waar een vlaggenschip voor dient. DeepSeek V4 Pro, uitgebracht op 13 augustus 2026, is een redeneermodel dat alleen tekst aankan: 1,6 biljoen parameters, waarvan 49 miljard actief, en nergens in het gepubliceerde oppervlak is er visuele, audio- of video-invoer. Xiaomi MiMo-V2.6-Pro, uitgebracht op 21 september 2026, heeft 1,02 biljoen parameters, waarvan 42 miljard actief, en accepteert tekst, afbeeldingen, video en audio. Dat verschil bepaalt meer implementaties dan de tien punten, en het is het eerste dat je moet beslechten voordat je iets anders vergelijkt.
Dezelfde licentie, andere machines
Begin met wat werkelijk identiek is, want het is meer dan je zou verwachten bij twee concurrerende labs. Beide worden geleverd onder een MIT-licentietag op openbare repositories, wat betekent dat commerciële inzet, aanpassing en verdere training mogelijk zijn zonder omzetdrempel of clausule over gebruiksgebied. Beide claimen een contextvenster van 1M tokens. Beide zijn sparse mixture-of-experts-ontwerpen — de architectuur is op deze schaal de standaard geworden, geen onderscheidende factor. En beide zijn getraind door labs die minder over methode publiceren dan westerse frontier-labs doen.
• Parameters — MiMo-V2.6-Pro 1,02T totaal / 42B actief; DeepSeek V4 Pro 1,6T totaal / 49B actief
• Inputmodaliteit — MiMo-V2.6-Pro tekst, afbeelding, video, audio; DeepSeek V4 Pro alleen tekst
• Context — beide 1M tokens; DeepSeek V4 Pro beperkt de uitvoer tot 384K tokens
• Indexscore — MiMo-V2.6-Pro 46 op Intelligence Index v4.3.2; DeepSeek V4 Pro 36 op dezelfde versie
• Kosten per Index-taak — MiMo-V2.6-Pro $ 0,13; DeepSeek V4 Pro $ 0,67
• Vermeld tarief — MiMo-V2.6-Pro $0,43 / $0,87 per 1 mln. tokens; DeepSeek V4 Pro $1,32 / $3,96 zoals Artificial Analysis het vermeldt, vóór DeepSeeks eigen piek-/dalschema
• Snelheid — MiMo-V2.6-Pro 134,3 outputtokens per seconde; DeepSeek V4 Pro 97,4
• Tijd tot eerste token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s
Lees die lijst twee keer, want twee rijen zijn tegenintuïtief. Het kleinere model scoort tien punten hoger — 42 miljard actieve parameters die 49 miljard verslaan is geen afrondingsverschil, het is een resultaat van post-training, en het is het allerduidelijkste signaal in deze vergelijking dat de kwaliteit van reinforcement learning ruwe schaal heeft voorbijgestreefd als hefboom. En het goedkopere model is ook het snellere, zowel qua doorvoer als qua kosten per taak, wat het tegenovergestelde is van de gebruikelijke afweging. Xiaomi verkoopt je geen korting in ruil voor geduld. De voorsprong van DeepSeek is de tijd tot het eerste token, 1,62 seconde tegen 2,15 — reëel, maar de enige categorie waarin V4 Pro vooroploopt.

Waarom dezelfde indexversie hier van belang is
Het vergelijken van open-weightmodellen over indexrevisies heen is hoe de meeste gepubliceerde vergelijkingen misgaan, dus het versienummer is geen voetnoot. Artificial Analysis heeft de Intelligence Index in september 2026 herbouwd als v4.3, en de scores verschoven aanzienlijk over die grens heen — Claude Opus 5 verloor drie punten tussen v4.2 en v4.3, en het veld van open-weightmodellen herschikte zich. Beide cijfers hierboven zijn v4.3.2, wat betekent dat de 46 en de 36 rechtstreeks met elkaar vergelijkbaar zijn. Ze zijn niet vergelijkbaar met de oudere cijfers die je elders voor elk van beide modellen aangehaald ziet.
Dat is geen hypothetisch scenario. DeepSeek V4 Pro werd in augustus 2026 breed gerapporteerd op 53 op een eerdere indexschaal, en onze eigen berichtgeving uit die periode vermeldde dat. Op v4.3.2 staat hetzelfde model op 36. Er is niets aan het model veranderd; de meetlat wel. Als je een spreadsheet hebt met 53 erin naast een 46 voor MiMo-V2.6-Pro, heb je een vergelijking die je op het verkeerde model zal wijzen. De juiste combinatie is 46 tegenover 36, en de juiste conclusie is dat het model dat vijf weken later werd uitgebracht, met twee derde van het aantal parameters, wezenlijk voorloopt.
De rapportagekloof tussen de twee laboratoria
Er is een tweede, subtieler verschil, en het gaat erom wat elk lab bereid is te laten controleren.
De 46 van MiMo-V2.6-Pro is een meting van Artificial Analysis. Het evaluatiebureau voerde zijn eigen suite uit — tien evaluaties op het gebied van redeneren, kennis, wiskunde en programmeren — op het uitgebrachte model en publiceerde het resultaat, samen met de operationele cijfers: 134,3 tokens/seconde, 2,15 seconden tot het eerste token, een cachekorting van 99%, $0,13 per indextaak, en een totale evaluatiekost van $206,66. Dat is een cijfer van een derde partij over het model van Xiaomi.
De prominente agentische cijfers van DeepSeek V4 Pro zijn die van DeepSeek zelf, en het verschil tussen die cijfers en de onafhankelijke cijfers is gedocumenteerd. Het lanceermateriaal van het bedrijf meldt Terminal-Bench 2.1 op 87,9, DeepSWE op 62,7, CyberGym op 83,3 en SWE-bench Verified op 80,6. Onafhankelijke runs zetten Terminal-Bench 2.1 op 78,7 — ongeveer negen punten onder het cijfer van de leverancier — en de Artificial Analysis Coding Index op 68,8. Geen van die leverancierscijfers is gereproduceerd, en de grootte van het Terminal-Bench-verschil is de reden om de rest van de reeks als beweringen in plaats van metingen te behandelen.
Xiaomi heeft zijn eigen versie van hetzelfde probleem. Het dashboard meldt dat MiMo-V2.6-Pro gedurende zijn reinforcement-learningrun stijgt van 58,4 naar 72,57 op DeepSWE v1.1, geëvalueerd op Xiaomi's eigen harness met mini-swe-agent op basis van het gemiddelde van drie. Dat is geen inzending voor een leaderboard en geen enkele externe partij heeft het opnieuw uitgevoerd. Dus geen van beide modellen komt met een schoon rapport op leveranciersbenchmarks. Het verschil is dat MiMo-V2.6-Pro ook komt met een onafhankelijke samengestelde score die de lancering van DeepSeek op het equivalente moment niet had — en als je tussen hen kiest op basis van bewijs in plaats van op marketing, is dat de asymmetrie die gewicht in de schaal zou moeten leggen.

Hoe dit er in productie uitziet
Het modaliteitsverschil is de praktische splitsing, en het valt minder vaak in het voordeel van DeepSeek uit dan de kloof van tien punten doet vermoeden. Als je pipeline screenshots, als afbeeldingen gerenderde PDF's, videoframes of audio binnenhaalt, verwerkt MiMo-V2.6-Pro dit native in één model, en DeepSeek V4 Pro kan dit helemaal niet aan — je zou een apart visiemodel ervoor moeten zetten, wat een tweede contract, een tweede storingsmodus en een tweede rekening betekent. Als je workload alleen tekstredenering is, is de extra modaliteit overbodige ballast die je niets kost.
Kosten per indextaak is het andere getal om in gedachten te houden. $0,13 tegenover $0,67 is een vijfvoudige kloof op een gecontroleerde, identieke takenreeks, op dezelfde manier gemeten voor beide. DeepSeek hanteert een factureringsschema met piek- en daluren dat het effectieve tarief aanzienlijk kan verlagen, afhankelijk van wanneer u aanroept, dus de verhouding in de praktijk wordt kleiner tijdens daluren en groter tijdens piekuren — een detail dat van belang is als uw verkeer met pieken komt en u niet kunt kiezen wanneer het arriveert.
Dit is waar de DeepSeek-kant een echt voordeel heeft dat niets met het model te maken heeft: het staat op ons platform. DeepSeek V4 Pro is bereikbaar als deepseek/deepseek-v4-pro via een OrcaRouter-sleutel tegen de lijstprijs van de provider met 0% opslag, met automatische failover tussen providers en de routing-DSL daarbovenop — dus de piek-/dalberekening, de spread tussen providers en de fallbackroute zijn allemaal zaken die je configureert in plaats van dingen die je bouwt. MiMo-V2.6-Pro staat niet op ons platform, en dat zeggen we ronduit: het vandaag bereiken betekent het eigen platform van Xiaomi of een van de externe catalogi die het vermelden, en Artificial Analysis telde op het moment van vastleggen één API-provider ervoor. Eén route is geen productieroute, wat het sterkste argument is om MiMo-V2.6-Pro te behandelen als een model om nu te evalueren en om er zorgvuldig naartoe te routeren, met iets anders erachter.
Welke, en wanneer?
Kies DeepSeek V4 Pro als je werk alleen tekst is, als je het uitvoerplafond van 384K nodig hebt, als je van de twee de snelste tijd tot het eerste token wilt, of als je al op ons platform zit en een open-weights-baan met een biljoen parameters wilt met failover en zonder nieuwe integratie. Het is niet voor niets de incumbent, en vijf weken ouder zijn heeft vijf weken aan tooling, kwantisatie en serving-recepten opgeleverd die een model uit september nog niet heeft opgebouwd.
Kies MiMo-V2.6-Pro als de taak multimodaal is, als de kosten per taak je unit economics domineren, als doorvoer belangrijker is dan een halve seconde latentie, of als je de huidige open-weights-koploper op een onafhankelijk gemeten index wilt. De MIT-licentie op beide betekent dat de kwestie van de gewichten hoe dan ook is beslecht — je kunt beide op je eigen hardware draaien, fine-tunen en commercieel uitbrengen.
De configuratie die het overwegen waard is, is helemaal geen keuze. Een router laat je de DeepSeek-route behouden voor tekstuele redeneringen tegen off-peaktarieven en een MiMo-route toevoegen voor de multimodale verzoeken, met een fallback vóór de dunnere route. Dat is geen indekken; het is elk verzoek koppelen aan het model dat het daadwerkelijk aankan, wat een goedkoper en duurzamer antwoord is dan een winnaar kiezen en hopen dat de werklast nooit van vorm verandert.

De vraag die deze vergelijking nog niet kan beantwoorden
De meest geciteerde benchmarks van beide modellen zijn door de leverancier uitgevoerd en niet gereproduceerd. Voor DeepSeek V4 Pro is dat gat sinds augustus open en dat is de reden dat de onafhankelijke scores lager uitvallen dan de lanceringscijfers. Voor MiMo-V2.6-Pro bestaat de onafhankelijke samengestelde score wel, maar de agentische uitsplitsing niet — Artificial Analysis publiceert een 46 en niet de spreiding per evaluatie eronder, en dat is precies het detail dat bepaalt of een model thuishoort in een agent-loop of een vraag-en-antwoordpijplijn.
Totdat die spreiding is gepubliceerd en totdat iemand Xiaomi's DeepSWE-harness opnieuw uitvoert, is de verdedigbare positie enger dan de marketing van beide labs: MiMo-V2.6-Pro is koploper op een onafhankelijke samengestelde score en op gemeten kosten per taak, DeepSeek V4 Pro is koploper op volwassenheid, lengte van de output, latentie van het eerste token en bereikbaarheid via een route met redundantie erachter. Vijf weken is een kleine voorsprong, en het is de enige die DeepSeek heeft.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
