Hero-titelkaart voor het artikel 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro', met als kicker 'OrcaRouter · modelradar — serveerniveaus', en de ondertitel 'Eén 1T-checkpoint, twee manieren om het te kopen: $0,435/$0,87 per miljoen tokens, of $4,35/$8,70 voor een beweerde tienvoudige snelheid.' Daaronder twee kaarten: links 'Standard tier', met de tekst '134,3 outputtokens/sec gemeten door Artificial Analysis; 1M context; MIT-gewichten op Hugging Face'; rechts 'UltraSpeed tier', met de tekst '$4,35 in / $8,70 uit per 1M; hetzelfde checkpoint, dezelfde kwaliteitsclaim; alleen gehost'. Vier chips tonen 'AA Index: 46', 'Totale parameters: 1,0T', 'Actieve parameters: 42B' en 'DeepSWE: 72,57 door leverancier gerapporteerd'. Het OrcaRouter-logo is in de rechteronderhoek samengesteld.
Guides & Insights

Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: één checkpoint, tien keer de prijs

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Xiaomi MiMo-V2.6-Pro-UltraSpeed en Xiaomi MiMo-V2.6-Pro zijn geen twee modellen. Het is één model dat op twee manieren wordt verkocht. Beide worden geserveerd vanaf hetzelfde MiMo-V2.6-checkpoint met een biljoen parameters dat Xiaomi in september 2026 publiceerde — de Pro-tier van de Xiaomi MiMo-V2.6-serie, waarvan de kleinere broer Xiaomi MiMo-V2.6-Flash is. Het verschil tussen de twee Pro-aanbiedingen zit volledig in hoe snel de tokens eruit komen en hoeveel je ervoor betaalt. De standaard-tier vraagt $0,435 per miljoen inputtokens en $0,87 per miljoen outputtokens. De UltraSpeed-tier vraagt $4,35 en $8,70. Dat is een strakke verhouding van tien tegen één aan beide zijden van de meter, en die koopt een claim van ruwweg tien keer de outputsnelheid — een claim die Xiaomi doet over zijn eigen servingstack, en waarvoor nog geen enkele onafhankelijke benchmark een cijfer heeft gepubliceerd.

De interessante vraag is dus niet welk model beter is. Het is of een tienvoudige multiple de juiste prijs is voor tien keer de snelheid, en dat blijkt een precedent te hebben dat het lezen waard is voordat je er een productiepad aan vastlegt.

De snelle tier is een servingbeslissing, geen modelbeslissing.

Xiaomi's eigen framing van de UltraSpeed-lijn is dat deze qua kwaliteit gelijk is aan het standaardmodel en alleen verschilt in doorvoer. Dat is belangrijker dan het klinkt, want het neemt de gebruikelijke reden weg om te twijfelen aan een nieuwe tier. Je zet niet in op de persoonlijkheid van een andere checkpoint, het weigeringsgedrag ervan of de eigenaardigheden in de opmaak. Je zet erop in dat dezelfde gewichten, uitgevoerd via een agressievere servingconfiguratie, zich hetzelfde gedragen bij jouw prompts. Als dat standhoudt, is wisselen tussen de twee tiers een configuratiewijziging, geen migratie.

Wat zich in die serveerconfiguratie bevindt, is voor deze generatie niet gedocumenteerd. Het vorige UltraSpeed-niveau, gebouwd op het MiMo-V2.5-Pro-checkpoint in juni 2026, werd door Xiaomi beschreven als het gebruik van FP4-kwantisatie alleen op de expertlagen, een blokparallel speculatief decoderingsschema genaamd DFlash, en een runtime genaamd TileRT, en het draaide op één enkele node met acht GPU's. Xiaomi heeft niet het equivalente detail voor het V2.6-niveau gepubliceerd. Beschouw de eerdere stack als context voor hoe de snelheid wordt verkregen, niet als een beschrijving van wat er nu draait.

De line-up waarin het zit is kort. Naast de twee Pro-varianten staat MiMo-V2.6-Flash, het kleinere broertje met 309 miljard totale parameters en 15 miljard actieve. Pro is het vlaggenschip met sparse mixture-of-experts: Artificial Analysis vermeldt het op 1,0 biljoen totale parameters, met 42 miljard actieve per token, een contextvenster van 1 miljoen tokens en een MIT-licentie met gewichten op Hugging Face. Dat zijn de cijfers om aan vast te houden, want de hele vergelijking berust erop.

Wat is daadwerkelijk geverifieerd, en wat niet?

A two-column scoreboard titled 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro — the scoreboard'. The left column, badged VENDOR-REPORTED, is headed 'MiMo-V2.6-Pro-UltraSpeed' and reads: Output speed — about 10x the standard tier, Xiaomi's claim; Price in — $4.35 per 1M tokens; Price out — $8.70 per 1M tokens; Context — 1M tokens; Weights — hosted only, none published; Independent speed test — none published. The right column, badged INDEPENDENTLY MEASURED, is headed 'MiMo-V2.6-Pro' and reads: Output speed — 134.3 tokens/sec per Artificial Analysis; Price in — $0.435 per 1M tokens; Price out — $0.87 per 1M tokens; Context — 1M tokens; Weights — MIT, on Hugging Face; Independent speed test — Artificial Analysis, 114-model class. A footer reads 'UltraSpeed figures are Xiaomi's own serving claims with no independent verification. MiMo-V2.6-Pro figures per Artificial Analysis, read 2026-09-22.' The OrcaRouter logo is composited in the bottom-right corner.

De asymmetrie tussen de twee kolommen hierboven is het allerbelangrijkste in dit artikel. Bijna alles wat meetbaar is aan deze combinatie is gemeten aan de langzame kant.

Artificial Analysis heeft MiMo-V2.6-Pro gebenchmarkt en publiceert een Intelligence Index van 46 ervoor — de hoogste score in de klasse van 114 modellen waarin het het model indeelt. Het meet 134,3 outputtokens per seconde via de API van Xiaomi, tegen een klassemediaan van 77,9, en een tijd tot de eerste chunk van 2,15 seconden tegen een mediaan van 2,34. Het vermeldt de kosten per Intelligence Index-taak op $0,13, een cachekorting van 99% op de invoerprijs, en output-uitvoerigheid op 140 miljoen tokens. Dat zijn onafhankelijke cijfers voor een specifiek genoemde configuratie, en ze zijn het enige harde aanknopingspunt voor doorvoer waarover deze vergelijking beschikt.

Voor UltraSpeed is de geverifieerde lijst veel korter:

• Uitvoersnelheid — ongeveer tien keer het standaardniveau, volgens opgave van Xiaomi en herhaald door de platforms die het vermelden. Geen enkele derde partij heeft een meting in tokens per seconde voor dit specifieke niveau gepubliceerd.

• Prijs — $4,35 per miljoen inputtokens en $8,70 per miljoen outputtokens, een tienvoud van de standaardlaag voor beide. Er wordt geen cachetier naast die twee tarieven vermeld.

• Kwaliteit — "komt overeen met het origineel", opnieuw een bewering van de leverancier. Er is geen onafhankelijke evaluatie van het UltraSpeed-eindpunt gepubliceerd, dus de bewering dat de kwaliteit ongewijzigd is, is ongetoetst in plaats van weerlegd.

• Context en modaliteit — 1.048.576 tokens en native tekst-, afbeeldings-, video- en audio-invoer, geërfd van het basischeckpoint.

Er is ook een leveranciersbenchmark die het noemen waard is, precies vanwege de manier waarop die zich heeft verspreid. Xiaomi's openbare reinforcement-learningdashboard, dat in september 2026 de V2.6 post-trainingruns streamde, rapporteert DeepSWE v1.1-scores van 72,57 voor de Pro-run en 65,68 voor Flash. Die komen uit Xiaomi's eigen offline-evaluatie met een mini-swe-agent-harness op basis van het gemiddelde van drie runs; ze zijn nooit ingediend voor het openbare leaderboard en ze zijn buiten het lab niet gereproduceerd. Als je 72,57 als leaderboardscore hebt zien aangehaald, dan is dat een leveranciersgetal in de kleren van een leaderboard.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 22, 2026, headed 'MiMo-V2.6-Pro Intelligence, Performance & Price Analysis' with the labels 'Open weights model' and 'Released September 2026'. The metric strip reads Intelligence #1/114, Speed #11/114, Cost #12/114 and Verbosity #18/114. The cost panel reads $0.435 in and $0.87 out per million tokens, a 99% cache discount, and $0.13 per Intelligence Index task; the speed panel reads 134.3 output tokens per second, ranked eleventh of 114 against a median of 77.9, with a first-chunk time of 2.15 seconds; verbosity reads 140M output tokens. The comparison summary states the model scores 46 on the Artificial Analysis Intelligence Index against a class median of 18, is notably fast at 134 tokens per second against a median of 78, is somewhat verbose, supports text, image, speech and video input and outputs text, and has a 1M-token context window. Technical specifications list reasoning enabled, input modalities text and image, output text, a 1M context window, 1.0T total parameters, 42B active parameters, an MIT licence, and model weights on Hugging Face.

Het precedent: vorige keer rekende Xiaomi drie keer zoveel, niet tien keer

Dit is niet Xiaomi's eerste snelheidsklasse, en de vorige is de nuttigste vergelijking in het hele verhaal — omdat de vermenigvuldiger veranderde.

MiMo-V2.5-Pro-UltraSpeed verscheen in juni 2026, gebouwd op het V2.5-Pro-checkpoint, en de prijs lag op ongeveer drie keer het outputtarief van het standaardmodel. De pitch van Xiaomi was toen dezelfde als nu: ongeveer tien keer de outputsnelheid. Berichtgeving destijds meldde een aanhoudende doorvoer van rond de 1.000 tokens per seconde met pieken in de buurt van 1.200, op één enkele node met acht GPU's, hoewel de modelpagina zelf een breder bereik van 500 tot 1.000 vermeldde — en niets daarvan was onafhankelijk geverifieerd. Toegang was alleen mogelijk via een aanvraagformulier, niet via open inschrijving.

Zet de twee naast elkaar en de verschuiving is het verhaal. De snelheidsfactor bleef op ongeveer tien staan. De prijsfactor ging van drie naar tien. Dat is een heel andere deal voor hetzelfde soort upgrade, en Xiaomi heeft geen uitleg gepubliceerd voor de wijziging. Het kan wijzen op werkelijk duurdere serving — een groter checkpoint, een agressievere decoderingsconfiguratie, of beperktere capaciteit bij de lancering. Het kan wijzen op prijsstelling in het lanceervenster voor een tier die pas één dag beschikbaar is. Wat er nog niet is, is een publieke rechtvaardiging die je kunt controleren.

Eén praktisch verschil is het vermelden waard voor iedereen die de V2.5-tier heeft gebruikt: die was een proef met beperkte toegang. De V2.6-tier staat vermeld als algemeen beschikbaar via Xiaomi's eigen API en verschillende platforms van derden, tegen de gepubliceerde tarieven, zonder aanvraagprocedure. Wat er verder ook is veranderd, de drempel om het te proberen is gedaald.

Wat tien keer kost bij een echte workload

Percentages verhullen de vorm hiervan, dus hier is de rekensom voor een concrete agent-run — een die gedurende zijn levensduur 20 miljoen inputtokens leest en 2 miljoen outputtokens uitzendt. Dat is een zware maar niet exotische agentische workload, het soort waarbij een model in een lus toolaanroepen uitvoert en zijn eigen context herleest.

• Standaardniveau, invoer — 20 mln tokens tegen $0,435 per miljoen: $8,70.

• Standaardniveau, output — 2 mln tokens bij $ 0,87 per miljoen: $ 1,74.

• Standaardniveau, totaal — $10,44 per run.

• UltraSpeed-niveau, invoer — 20 mln tokens tegen $4,35 per miljoen: $87,00.

• UltraSpeed-niveau, output — 2 mln. tokens tegen $8,70 per miljoen: $17,40.

• UltraSpeed-niveau, totaal — $104,40 per uitvoering.

Het verschil is $93,96, en het is precies tien keer de rekening, niet tien keer één regel ervan, omdat beide tarieven samen schalen. Nu de andere kant van het grootboek. Bij de 134,3 outputtokens per seconde die Artificial Analysis voor de standaardlaag meet, duurt het genereren van 2 miljoen outputtokens iets meer dan vier uur pure generatietijd. Bij tien keer die snelheid duurt het ongeveer vijfentwintig minuten. Dus de extra $94 levert op deze run ergens rond de drieënhalf uur kloktijd terug — ruwweg $27 per bespaard uur, als je het zo wilt stellen.

Of die ruil goed is, hangt volledig af van wat de kloktijd je waard is, en er is één complicatie die tegen een naïeve lezing ingaat. De invoerprijs van de standaardtier heeft een cachekorting van 99% op de pagina van Artificial Analysis, wat betekent dat de invoerhelft van de rekening bijna niets kan worden bij workloads die dezelfde context herlezen. De vermelding van UltraSpeed toont de twee hoofdtarieven en geen cachetier. Als je workload cache-intensief is, is de effectieve factor geen tien — die is veel slechter, want je verliest de korting aan de kant waar je bijna niets betaalde. Als je workload output-intensief en cache-arm is, zit tien keer dicht bij het werkelijke getal. Meet je eigen mix voordat je een van beide cijfers vertrouwt.

De open-weights-asymmetrie

Er is een structureel verschil tussen de twee niveaus dat niets met prijs of snelheid te maken heeft, en dat wel eens belangrijker kan zijn dan beide.

MiMo-V2.6-Pro wordt uitgebracht onder een MIT-licentie, met gewichten die op Hugging Face zijn gepubliceerd. Dat maakt commerciële inzet, aanpassing en verdere training mogelijk, en het betekent dat het standaardmodel een prijsondergrens heeft die geen enkele leverancier kan opheffen: als het gehoste tarief niet meer zinvol is, kunt u het checkpoint zelf serveren. U zult op uw eigen hardware niet de doorvoer van Xiaomi evenaren, en u betaalt voor de GPU's, maar de optie bestaat en die zet een maximum op wat de gehoste variant kan vragen.

UltraSpeed heeft geen dergelijke ondergrens. Er zijn geen UltraSpeed-gewichten, omdat het niveau de servingstack is en niet het model — de checkpoint is dezelfde die al openbaar is, en wat je huurt, is het vermogen van Xiaomi om het snel te draaien. Dat is een legitiem product om te verkopen, en het heeft dezelfde opzet als elk ander snelheidsniveau op de markt. Het betekent wel dat er op het tienvoudige tarief geen concurrentiedruk bestaat, behalve van andere aanbieders die dezelfde open gewichten draaien, en geen uitweg via zelfhosting als de prijs opnieuw verandert.

Screenshot of Xiaomi's MiMo homepage captured September 22, 2026, headed 'HELLO, I'M MiMo'. Two product cards are visible: 'Xiaomi MiMo-V2.6-Series', subtitled 'Frontier intelligence, all the modalities, built in public', and 'Xiaomi MiMo-V2.5-TTS Series'. Below them a 'Build with MiMo' section lists two numbered routes, '01 Web Demo' and '02 API Access', with the lines 'Interact with MiMo directly through the web' and 'Developer portal for quick integration of MiMo capabilities'.

Lees dat eens tegen het beschikbaarheidsbeeld aan. Het standaard-checkpoint is bereikbaar via Xiaomi's eigen kanalen en verschillende platformen van derden, en het is bovendien een download. De UltraSpeed-tier is bereikbaar via Xiaomi's eigen API en verschillende platformen van derden, en dat is de enige manier om eraan te komen. Voor wie een langdurige afhankelijkheid afweegt, is dat verschil in optionaliteit het waard om mee te wegen naast het tarief per token.

Wie moet welke nemen

De beslissing valt duidelijk uiteen naar gelang hoeveel van je kosten outputtokens zijn en hoeveel van je latencybudget generatie is in plaats van wachtrijvorming.

• Gebruik UltraSpeed wanneer de workload output-intensief, cache-licht en interactief is — generatie van lange teksten, agent-loops waarbij het model veel redeneerwerk schrijft tussen tool calls, of alles waarbij een mens aan de andere kant van het verzoek zit te wachten.

• Kies de standaardlaag wanneer de workload cache-intensief, batchtolerant of aan de marge kostengevoelig is — bulkclassificatie, retrieval-augmented beantwoording over een vast corpus, nachtelijke evaluatieruns, alles waarbij vier uur genereren prima is omdat niemand meekijkt.

• Kies de standaardlaag wanneer je de optie wilt om zelf te hosten. Als je compliancehouding vereist dat je gewichten zelf in handen hebt, is UltraSpeed tegen geen enkele prijs voor jou beschikbaar.

• Kies geen van beide voordat je hebt gemeten. De bewering dat het tien keer is, is hier het cijfer waar alles op rust, en die is momenteel alleen door de leverancier gesteld. Eén middag waarin je je eigen prompts door beide niveaus laat lopen, leert je meer dan welke gepubliceerde cijfers dan ook, omdat het enige doorvoercijfer dat iemand onafhankelijk heeft geverifieerd, aan de langzame kant van de vergelijking hoort.

Wat dat laatste punt betreft: de mechanica van het testen van een serveertier is dezelfde als die van het testen van een model, en daar verdient een routeringslaag zijn plek. OrcaRouter biedt meer dan 200 modellen achter één API-sleutel tegen de lijstprijs van de provider, met 0% markup die wordt doorgegeven, zodat een prijswijziging van een leverancier dezelfde dag aan jouw kant terechtkomt in plaats van bij de volgende contractverlenging. Automatische failover betekent dat een tier die je nog aan het evalueren bent, nooit alleen op een productiepad staat, en met de routerings-DSL kun je één klasse van verzoeken naar het snelle endpoint sturen en al het andere naar het standaard-endpoint, zonder twee integraties te onderhouden. Niets daarvan vereist specifiek de modellen van Xiaomi — het punt is dat beslissingen op tierniveau zoals deze goedkoop terug te draaien zijn wanneer de tiers achter één sleutel zitten.

Wat zou dit oplossen?

De eerlijke stand van zaken bij de vraag MiMo-V2.6-Pro-UltraSpeed versus MiMo-V2.6-Pro is dat de helft ervan gemeten is en de helft ervan beweerd wordt. De standaardvariant heeft een onafhankelijke Intelligence Index, een onafhankelijk doorvoercijfer en gepubliceerde open gewichten. De snelle variant heeft een prijs, een contextvenster en een belofte van de leverancier dat het hetzelfde model is dat sneller gaat.

Drie dingen zouden het gat dichten. Een onafhankelijke meting van de doorvoer op het UltraSpeed-endpoint — Artificial Analysis heeft de standaardlaag via de API van Xiaomi gemeten, dus dezelfde behandeling is mogelijk en is simpelweg nog niet gebeurd. Een cachebeleid voor de snelle laag, want het ontbreken daarvan verandert een tien keer zo hoge rekening bij cache-intensief werk in iets ergers. En elk gepubliceerd detail over de V2.6-servingstack, op de manier waarop Xiaomi FP4-experts, DFlash en TileRT voor de V2.5-generatie documenteerde.

Tot die tijd is de tienvoudige prijs echt en is de tienvoudige snelheid een bewering. Als je workload output-intensief is en er wacht iemand, dan is die bewering het waard om te testen op je eigen prompts — en om te testen achter een laag die je dezelfde middag nog laat terugschakelen als ze niet standhoudt.