
Xiaomi MiMo-V2.6-Pro voert de Open-Weights Index aan met 46 — en publiceert de trainingsrekening
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro is nu het hoogst gerangschikte open-weightmodel op de Artificial Analysis Intelligence Index, met 46 op v4.3.2 — één punt voorsprong op GLM-5.3 en twee punten voorsprong op Kimi K3, en twintig punten boven de 26 die zijn voorganger MiMo-V2.5-Pro op de eerdere indexschaal behaalde. Dat cijfer is geproduceerd door Artificial Analysis, dat daarvoor zijn eigen harness draaide, niet door Xiaomi, en het is het meest bruikbare feit in deze release. Het op één na meest bruikbare feit is de prijs die ernaast staat: $0,43 per miljoen inputtokens, $0,87 per miljoen outputtokens, tegenover $5,00 en $25,00 voor Claude Opus 5 — een model dat vijf indexpunten hoger staat. Het derde is iets waarvan niemand verwachtte dat Xiaomi het zou prijsgeven: een publieke uiteenzetting van wat de reinforcement-learning-run die MiMo-V2.6-Pro produceerde daadwerkelijk kostte.
De score is een meting, geen bewering.
Bijna alles wat over de lancering van een Chinees model wordt gepubliceerd, komt als een leverancierscijfer, en lezers hebben geleerd dat met een korreltje zout te nemen. Deze is anders, en het loont om precies te zijn over dat verschil, want de berichtgeving over de lancering heeft het al vertroebeld.
Artificial Analysis evalueerde MiMo-V2.6-Pro zelf, op de v4.3.2-composite — tien evaluaties die redeneren, kennis, wiskunde en programmeren bestrijken, waaronder AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience en AA-LCR v1.1. De 46 is wat die suite opleverde. Het registreerde ook de operationele kenmerken die bepalen of een model bruikbaar is in plaats van louter goed: 134,3 outputtokens per seconde, 2,15 seconden tot het eerste token, een cachekorting van 99%, en een gemeten kostenpost van $0,13 per Intelligence Index-taak.
Twee daarvan verdienen nadruk. Met 134,3 tokens per seconde staat MiMo-V2.6-Pro op de elfde plaats van 114 modellen qua snelheid — voor een mixture-of-expertsmodel met een biljoen parameters is dat een servingresultaat, niet alleen een trainingsresultaat. En de $0,13 per taak is het getal dat contact met een budget overleeft: het is wat de index daadwerkelijk kostte om tegen dit model te draaien, op dezelfde manier gemeten voor elk model op het scorebord, wat het vergelijkbaar maakt op een manier waarop hoofdtarieven per token dat niet zijn.

Wat de index wel en niet dekt
De open-weights-kroon is echt, maar smaller dan hij lijkt. Met 46 leidt MiMo-V2.6-Pro de open-weights-categorie. Hij leidt de index niet. De top van v4.3 is Claude Fable 5.1 op maximale inspanning met standaard fallback en GPT-6 Astra op maximale inspanning, beide op 53, met Claude Opus 5 op 51 en Claude Fable 5 op 50. De eerlijke framing is dus een gat van vijf punten naar de frontier op een samengestelde score die breedte beloont, en een verbetering van twintig punten ten opzichte van Xiaomi's eigen vorige generatie.
• Koploper open gewichten — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• Top van dezelfde index — Claude Fable 5.1 (max, fallback) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51
• Snelheid — 134,3 outputtokens per seconde, elfde van 114 gemeten modellen; de mediaan voor de grootteklasse is 77,9
• Tijd tot eerste token — 2,15 seconden, tegenover een mediaan van 2,34 seconden
• Kosten per Intelligence Index-taak — $0,13, waarbij het uitvoeren van de hele evaluatie $206,66 kost
• Vermeld tarief — $0,43 per miljoen invoertokens, $0,87 per miljoen uitvoer, een cachekorting van 99%, en een gemengd tarief van $0,18 bij een 7:2:1-mix van cachetreffer/invoer/uitvoer
Eén cijfer op de Artificial Analysis-pagina is een echte kanttekening in plaats van een opschepperij: het telde op het moment van schrijven één enkele API-provider voor MiMo-V2.6-Pro. Dat is op dit moment de praktische bottleneck voor dit model, en het is geen kwaliteitsprobleem — het is een beschikbaarheidsprobleem. Een model dat via één route bereikbaar is, heeft geen failover. Als die route verslechtert, verslechtert je applicatie mee, en juist het failoververhaal is wat een router hoort te bieden. De relevante observatie voor iedereen die rond deze release plannen maakt, is dat wij MiMo-V2.6-Pro niet hosten, en dat zullen we niet anders voordoen; de route ernaartoe is vandaag Xiaomi's eigen platform en het handjevol catalogi van derden dat het vermeldt.

De twee getallen die niet door elkaar mogen worden gehaald
Xiaomi heeft ook eigen benchmarkcijfers gepubliceerd, en die zijn een ander soort object dan de 46. Het dashboard van het bedrijf meldt dat MiMo-V2.6-Pro tijdens zijn reinforcement learning-run op DeepSWE v1.1 van 58,4 naar 72,57 gaat, geëvalueerd met mini-swe-agent op average-of-three. Dat is Xiaomi's harness, Xiaomi's grader, Xiaomi's offline run. Het is niet ingediend bij het openbare DeepSWE-leaderboard en het is door niemand gereproduceerd.
Lees de twee naast elkaar en de verleiding is om 72,57 te behandelen als een score op hetzelfde niveau als de 74% die de openbare DeepSWE-ranglijst in de hoogste categorie vermeldt. Ze staan niet op dezelfde schaal. Het ranglijstcijfer is een ingediende configuratie, Pass@1, met een gepubliceerd betrouwbaarheidsinterval en een gemiddelde kostprijs per taak; het cijfer van de leverancier is een interne evaluatie waar niets van dat alles aan is verbonden. Ons eigen artikel van 21 september maakte dit punt toen de cijfers nog dashboardaflezingen waren, en het geldt nog steeds nu de gewichten zijn vrijgegeven. Een testharnas van een leverancier kan volledig eerlijk zijn en toch geen vermelding op de ranglijst zijn, omdat de vermelding op de ranglijst een bewering is over een specifieke configuratie onder specifieke omstandigheden die een derde partij opnieuw kan uitvoeren.
Dezelfde discipline geldt voor de trainingsuitgaven. Xiaomi rapporteert ongeveer $3.474.715 voor de Pro- en Flash-runs — $2.620.670 voor Pro, $854.044 voor Flash — elk met meer dan dertig reinforcement-learningstappen en ongeveer 750.000 trajecten, voltooid in minder dan zes dagen. Dit zijn de eigen compute-accountingcijfers van het bedrijf. Ze zijn interessant omdat labs ze bijna nooit publiceren, en het is geen API-prijs, geen kostenpost die u zult betalen, en geen getal dat door een derde partij is geauditeerd.
Wat Xiaomi daadwerkelijk heeft geleverd
De release is een sparse mixture-of-experts-model met 1,02 biljoen totale parameters, 42 miljard geactiveerd per token, een contextvenster van 1M tokens en native multimodaliteit voor tekst, beeld, video en audio. Het zustermodel Xiaomi MiMo-V2.6-Flash heeft dezelfde architectuur op kleinere schaal: 309 miljard totaal en 15 miljard actief. De gepubliceerde gewichten hebben een MIT-licentietag, en de releasebundel bevat een technisch rapport, deploymentinstructies en — volgens Xiaomi — de trainingsomgevingen voor reinforcement learning en code die nodig zijn om de post-training te onderzoeken en te reproduceren.
Dat laatste punt is het wezenlijke verschil tussen deze lancering en een typische API-aankondiging, en het is de moeite waard om het los te zien van de marketing. Het publiceren van de RL-omgeving is een claim dat de trainingsopzet controleerbaar is. Of de gepubliceerde omgevingen voldoende zijn om een 72,57 te reproduceren, is een aparte vraag die zal worden beslecht door mensen die het proberen, niet door de releasenotes. Xiaomi's eigen trainingsnotities beschrijven een run waarin programmeertaken, taken voor algemene agents, visuele taken en cybersecuritytaken in één enkele doorgang werden gecombineerd, met beoordelaars die succesvolle trajecten rangschikken en de beloning herverdelen naar betere paden — en ze registreren ook storingen: een GPU-herstart wegens out-of-memory, veroorzaakt door een disbalans in de expertbelasting, een netwerkstoring tussen het trainingscluster en de grader-implementatie, en een Flash-herstart nadat een infrastructuurfout ongeveer drie uur onopgemerkt bleef. Het publiceren van de fouten naast de successen is het onderdeel dat de rest van de openbaarmaking geloofwaardig maakt.
Wat het kost om te bellen, en waar de routeringskwestie ligt
Voor $0,43 en $0,87 per miljoen tokens is MiMo-V2.6-Pro geprijsd als een model uit het middensegment en scoort het in benchmarks als een open-weights frontier-model. Xiaomi handhaafde de standaardprijsstelling van de vorige MiMo-V2.5-generatie in plaats van het nieuwe checkpoint omhoog te herprijzen, waardoor het tarief laag lijkt in verhouding tot het aantal parameters. Een cachekorting van 99% betekent dat een agent-loop met veel cachegebruik zijn context voor vrijwel niets leest, en dat is waar de rekening van een agent met een lange horizon daadwerkelijk oploopt.
Er is een versie van deze transactie die netjes routeert en een versie die dat niet doet. De versie die dat wel doet: de frontier-modellen waarmee je MiMo-V2.6-Pro zou vergelijken — Claude Opus 5 voor $5,00/$25,00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — zijn allemaal bereikbaar via één OrcaRouter-sleutel tegen de lijstprijs van de provider met 0% opslag, dus een prijsverlaging van een leverancier op een van hen is dezelfde dag bij ons live, en een routeringsregel kan een verzoek naar een tweede model sturen wanneer het eerste traag of niet beschikbaar is. Dat is hier belangrijker dan gewoonlijk, want het model met de beste open-weights-score is ook het model met de dunste route ernaartoe. De twee combineren — een goedkope open-weights-baan voor bulkwerk en een frontier-baan voor de moeilijke staart — is een routeringsbeslissing, en het is het soort beslissing dat ophoudt een gok te zijn op het moment dat beide banen op dezelfde sleutel zitten.
Nog een product om goed uit elkaar te houden, want het is makkelijk te verwarren met het model: Xiaomi biedt ook MiMo-V2.6-Pro-UltraSpeed aan, een gehoste dienstlaag die op dezelfde checkpoint is gebouwd. Xiaomi's eigen materiaal claimt tot twintig keer de outputsnelheid van de standaard Pro-dienst bij dezelfde kwaliteit; catalogusvermeldingen van derden spreken van ongeveer tien keer. Dat zijn twee verschillende getallen voor dezelfde laag, niemand heeft latentieverdelingen per verzoek gepubliceerd die deze met elkaar rijmen, en de laag kent een wezenlijk hoger tarief. Niets aan UltraSpeed verandert wat de gewichten kunnen doen — het verandert hoe snel andermans servers ze zullen draaien.
Wat zou deze afbeelding veranderen?
Drie dingen, in volgorde van hoeveel ze zouden uitmaken.
Een tweede en derde serveerroute. Het aantal modellen met slechts één aanbieder op Artificial Analysis is de beperkende factor voor al het overige. Meer routes betekenen failover, betekenen prijsconcurrentie op de serveerlaag, en betekenen dat het model in een productiepad kan worden gezet in plaats van als experiment.
Onafhankelijke reproductie van de DeepSWE-cijfers. De 46 is al onafhankelijk; de 72,57 niet. Als externe runs in de buurt ervan uitkomen, wordt de zaak voor het model aanzienlijk sterker. Als ze materieel lager uitvallen, blijft het cijfer van Artificial Analysis het cijfer dat vertrouwd moet worden, en voegt het leverancierscijfer zich bij de lange lijst van lanceerclaims die het contact niet hebben overleefd.

Uitsplitsingen per evaluatie. Het samengestelde cijfer is een samengesteld cijfer. Welke van de tien evaluaties MiMo-V2.6-Pro wint en welke verliest, is het verschil tussen een model dat je inzet voor agentic coding en een model dat je inzet voor retrieval-intensieve vraagbeantwoording, en de index alleen vertelt je dat niet. Dat detail is waar je vervolgens op moet letten, en het is wat een routeringsconfiguratie nodig heeft voordat het de moeite waard is om op te schrijven.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
