Hero-titelkort för artikeln "MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro", med överrubriken "OrcaRouter · modellradar — serving-nivåer", och underrubriken "En 1T-checkpoint, två sätt att köpa den: $0,435/$0,87 per miljon tokens, eller $4,35/$8,70 för en påstådd tiofaldig hastighet." Under den två kort: till vänster "Standardnivå", med texten "134,3 utdata-tokens/sek uppmätt av Artificial Analysis; 1M kontext; MIT-vikter på Hugging Face"; till höger "UltraSpeed-nivå", med texten "$4,35 in / $8,70 ut per 1M; samma checkpoint, samma kvalitetspåstående; endast hostad". Fyra chip lyder "AA Index: 46", "Totala parametrar: 1,0T", "Aktiva parametrar: 42B" och "DeepSWE: 72,57 leverantörsrapporterat". OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: En enda checkpoint, tio gånger priset

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Xiaomi MiMo-V2.6-Pro-UltraSpeed och Xiaomi MiMo-V2.6-Pro är inte två modeller. De är en modell som säljs på två sätt. Båda serveras från samma MiMo-V2.6-checkpoint med en biljon parametrar som Xiaomi publicerade i september 2026 – Pro-nivån i Xiaomi MiMo-V2.6-serien, vars mindre syskon är Xiaomi MiMo-V2.6-Flash. Skillnaden mellan de två Pro-erbjudandena ligger helt i hur snabbt tokens kommer ut och hur mycket du betalar för dem. Standardnivån begär 0,435 USD per miljon indata-tokens och 0,87 USD per miljon utdata-tokens. UltraSpeed-nivån begär 4,35 och 8,70 USD. Det är ett rent tio-mot-ett-förhållande på båda sidor av mätaren, och det köper ett påstående om ungefär tio gånger högre utdatahastighet – ett påstående som Xiaomi gör om sin egen serveringsstack, och som ingen oberoende benchmark ännu har publicerat en siffra för.

Så den intressanta frågan är inte vilken modell som är bättre. Det är huruvida en tiofaldig multipel är rätt pris för tio gånger hastigheten, och det visar sig ha ett prejudikat som är värt att läsa innan du binder en produktionsväg till det.

Den snabba nivån är ett servingbeslut, inte ett modellbeslut

Xiaomis egen framställning av UltraSpeed-serien är att den matchar standardmodellen i kvalitet och skiljer sig endast i genomströmning. Det spelar större roll än det låter, eftersom det tar bort den vanliga anledningen att tveka inför en ny nivå. Du satsar inte på personligheten hos en annan checkpoint, dess avböjningsbeteende eller dess formateringssärdrag. Du satsar på att samma vikter, körda genom en mer aggressiv serveringskonfiguration, kommer att bete sig på samma sätt på dina promptar. Om det håller är byte mellan de två nivåerna en konfigurationsändring, inte en migrering.

Vad som finns i den serveringskonfigurationen har inte dokumenterats för den här generationen. Den tidigare UltraSpeed-nivån, byggd på MiMo-V2.5-Pro-checkpointen i juni 2026, beskrevs av Xiaomi som att den använde FP4-kvantisering endast på expertlagren, en blockparallell spekulativ avkodningsmetod som kallas DFlash och en runtime som kallas TileRT, och den kördes på en enda nod med åtta GPU:er. Xiaomi har inte publicerat motsvarande information för V2.6-nivån. Betrakta den tidigare stacken som kontext för hur hastigheten uppnås, inte som en beskrivning av vad som körs nu.

Modellserien den ingår i är kort. Vid sidan av de två Pro-nivåerna finns MiMo-V2.6-Flash, det mindre syskonet med 309 miljarder totala parametrar och 15 miljarder aktiva. Pro är det glesa mixture-of-experts-flaggskeppet: Artificial Analysis anger den till 1,0 biljoner totala parametrar med 42 miljarder aktiva per token, ett kontextfönster på 1 miljon token och en MIT-licens med vikter på Hugging Face. Det är de siffrorna man ska hålla fast vid, eftersom hela jämförelsen vilar på dem.

Vad är faktiskt verifierat, och vad är inte det

A two-column scoreboard titled 'MiMo-V2.6-Pro-UltraSpeed vs MiMo-V2.6-Pro — the scoreboard'. The left column, badged VENDOR-REPORTED, is headed 'MiMo-V2.6-Pro-UltraSpeed' and reads: Output speed — about 10x the standard tier, Xiaomi's claim; Price in — $4.35 per 1M tokens; Price out — $8.70 per 1M tokens; Context — 1M tokens; Weights — hosted only, none published; Independent speed test — none published. The right column, badged INDEPENDENTLY MEASURED, is headed 'MiMo-V2.6-Pro' and reads: Output speed — 134.3 tokens/sec per Artificial Analysis; Price in — $0.435 per 1M tokens; Price out — $0.87 per 1M tokens; Context — 1M tokens; Weights — MIT, on Hugging Face; Independent speed test — Artificial Analysis, 114-model class. A footer reads 'UltraSpeed figures are Xiaomi's own serving claims with no independent verification. MiMo-V2.6-Pro figures per Artificial Analysis, read 2026-09-22.' The OrcaRouter logo is composited in the bottom-right corner.

Asymmetrin mellan de två kolumnerna ovan är det enskilt viktigaste i den här artikeln. Nästan allt mätbart om den här parningen har mätts på den långsamma sidan.

Artificial Analysis har benchmarkat MiMo-V2.6-Pro och publicerar ett Intelligence Index på 46 för den – toppbetyget i den 114-modellsklass som den grupperar modellen i. Den uppmäter 134,3 utdatatoken per sekund via Xiaomis API, mot en klassmedian på 77,9, och en tid till första chunk på 2,15 sekunder mot en median på 2,34. Den anger kostnaden per Intelligence Index-uppgift till 0,13 USD, en cacherebatt på 99 % på indatapriset, och utdatans utförlighet på 140 miljoner token. Dessa är oberoende siffror för en namngiven konfiguration, och de är det enda hårda genomströmningsankaret som denna jämförelse har.

För UltraSpeed är den verifierade listan mycket kortare:

• Utdatningshastighet – ungefär tio gånger standardnivån, vilket uppges av Xiaomi och upprepas av de plattformar som listar den. Ingen tredje part har publicerat en mätning av tokens per sekund för den här specifika nivån.

• Pris — 4,35 USD per miljon indatatokens och 8,70 USD per miljon utdatatokens, en tiofaldig multipel av standardnivån för båda. Ingen cachenivå anges vid sidan av dessa två priser.

• Kvalitet – "matchar originalet", återigen ett leverantörspåstående. Ingen oberoende utvärdering av UltraSpeed-endpointen har publicerats, så påståendet att kvaliteten är oförändrad är otestat snarare än motbevisat.

• Kontext och modalitet — 1 048 576 tokens och inbyggd text-, bild-, video- och ljudinmatning, ärvda från bascheckpointen.

Det finns också ett leverantörsbenchmark som är värt att nämna just på grund av hur det har spridit sig. Xiaomis offentliga dashboard för förstärkningsinlärning, som strömmade V2.6-efterträningskörningarna i september 2026, rapporterar DeepSWE v1.1-poäng på 72,57 för Pro-körningen och 65,68 för Flash. Dessa kommer från Xiaomis egen offline-utvärdering med en mini-swe-agent-harness vid medelvärde av tre, de skickades aldrig in till den offentliga resultattavlan, och de har inte reproducerats utanför labbet. Om du har sett 72,57 citerat som en resultattavlepoäng, är det ett leverantörsnummer som bär en resultattavlas kläder.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 22, 2026, headed 'MiMo-V2.6-Pro Intelligence, Performance & Price Analysis' with the labels 'Open weights model' and 'Released September 2026'. The metric strip reads Intelligence #1/114, Speed #11/114, Cost #12/114 and Verbosity #18/114. The cost panel reads $0.435 in and $0.87 out per million tokens, a 99% cache discount, and $0.13 per Intelligence Index task; the speed panel reads 134.3 output tokens per second, ranked eleventh of 114 against a median of 77.9, with a first-chunk time of 2.15 seconds; verbosity reads 140M output tokens. The comparison summary states the model scores 46 on the Artificial Analysis Intelligence Index against a class median of 18, is notably fast at 134 tokens per second against a median of 78, is somewhat verbose, supports text, image, speech and video input and outputs text, and has a 1M-token context window. Technical specifications list reasoning enabled, input modalities text and image, output text, a 1M context window, 1.0T total parameters, 42B active parameters, an MIT licence, and model weights on Hugging Face.

Precedenten: förra gången tog Xiaomi tre gånger, inte tio

Det här är inte Xiaomis första hastighetsnivå, och den föregående är den mest användbara jämförelsen i hela historien – eftersom multiplikatorn ändrades.

MiMo-V2.5-Pro-UltraSpeed lanserades i juni 2026, byggd på V2.5-Pro-checkpointen, och priset låg på ungefär tre gånger standardmodellens avgift för utdata. Xiaomis budskap då var samma budskap som de framför nu: ungefär tio gånger utdatahastigheten. Rapporteringen vid den tiden uppgav en ihållande genomströmning på omkring 1 000 tokens per sekund med toppar nära 1 200, på en enda nod med åtta GPU:er, även om modellsidan själv angav ett bredare intervall på 500 till 1 000 – och inget av det verifierades oberoende. Åtkomst var låst bakom ett ansökningsformulär i stället för öppen registrering.

Ställ de två sida vid sida och skiftet är hela historien. Hastighetsmultiplikatorn låg kvar på ungefär tio. Prismultiplikatorn flyttades från tre till tio. Det är en mycket annorlunda affär för samma typ av uppgradering, och Xiaomi har inte publicerat någon förklaring till ändringen. Det skulle kunna återspegla en genuint dyrare serving – en större checkpoint, en mer aggressiv avkodningskonfiguration eller snävare kapacitet vid lansering. Det skulle kunna återspegla prissättning under lanseringsfönstret för en nivå som har varit tillgänglig i en enda dag. Det som ännu saknas är en offentlig motivering som går att kontrollera.

En praktisk skillnad är värd att påpeka för alla som använde V2.5-nivån: den var en begränsad testversion. V2.6-nivån anges som allmänt tillgänglig via Xiaomis eget API och flera tredjepartsplattformar, till de publicerade priserna, utan något ansökningssteg. Vad som än annars förändrades, minskade friktionen för att prova den.

Vad tio gånger kostar vid en verklig arbetsbelastning

Procentandelar döljer formen på detta, så här är aritmetiken för en konkret agentkörning – en som läser 20 miljoner indatatokens och avger 2 miljoner utdatatokens under sin livstid. Det är en tung men inte exotisk agentisk arbetsbelastning, den typ där en modell loopar över verktygsanrop och läser om sin egen kontext.

• Standardnivå, indata — 20M tokens till $0,435 per miljon: $8,70.

• Standardnivå, utdata — 2M tokens till $0,87 per miljon: $1,74.

• Standardnivå, totalt — 10,44 USD per körning.

• UltraSpeed-nivå, indata — 20M tokens till $4,35 per miljon: $87,00.

• UltraSpeed-nivå, utdata — 2M tokens till $8.70 per miljon: $17.40.

• UltraSpeed-nivå, totalt — 104,40 USD per körning.

Skillnaden är $93,96, och den är exakt tio gånger hela räkningen i stället för tio gånger en rad av den, eftersom båda satserna skalas i samma takt. Nu till andra sidan av kalkylen. Vid de 134,3 utdatatokens per sekund som Artificial Analysis mäter för standardnivån tar genereringen av 2 miljoner utdatatokens lite drygt fyra timmar i ren genereringstid. Vid tio gånger den hastigheten tar det ungefär tjugofem minuter. Så de extra $94 köper tillbaka någonstans i storleksordningen tre och en halv timmes verklig tid i den här körningen – ungefär $27 för varje sparad timme, om man vill uttrycka det så.

Om det bytet är bra beror helt och hållet på vad väggklockan är värd för dig, och det finns en hake som talar emot en naiv tolkning. Standardnivåns indatapris har en cacherabatt på 99 % på Artificial Analysis sida, vilket innebär att indatahalvan av räkningen kan kollapsa till nästan ingenting för arbetsbelastningar som läser samma kontext igen. UltraSpeeds listning visar de två rubrikpriserna och ingen cachenivå. Om din arbetsbelastning är cachetung är den effektiva multipeln inte tio – den är mycket sämre, eftersom du förlorar rabatten på den sida där du nästan inte betalade något. Om din arbetsbelastning är utdatatung och cachelätt är tio gånger nära det verkliga talet. Mät din egen mix innan du litar på någon av siffrorna.

Open-weights-asymmetrin

Det finns en strukturell skillnad mellan de två nivåerna som inte har något med pris eller hastighet att göra, och den kan spela större roll än någon av dem.

MiMo-V2.6-Pro levereras under en MIT-licens med modellvikter publicerade på Hugging Face. Det tillåter kommersiell driftsättning, modifiering och vidareträning, och det innebär att standardmodellen har ett prisgolv som ingen leverantör kan ta bort: om den hostade avgiften inte längre är rimlig kan du själv köra checkpointen. Du kommer inte att matcha Xiaomis genomströmning på din egen hårdvara, och du kommer att betala för GPU:erna, men alternativet finns och det sätter ett tak för vad den hostade nivån kan ta betalt.

UltraSpeed har inget sådant golv. Det finns inga UltraSpeed-vikter, eftersom nivån är serveringsstacken snarare än modellen – checkpointen är samma som redan är offentlig, och det du hyr är Xiaomis förmåga att köra den snabbt. Det är en legitim sak att sälja, och det har samma form som alla andra hastighetsnivåer på marknaden. Det innebär att den tiofaldiga taxan inte har någon konkurrens som håller den i schack, förutom andra leverantörer som kör samma öppna vikter, och ingen nödutgång via egen hosting om priset rör sig igen.

Screenshot of Xiaomi's MiMo homepage captured September 22, 2026, headed 'HELLO, I'M MiMo'. Two product cards are visible: 'Xiaomi MiMo-V2.6-Series', subtitled 'Frontier intelligence, all the modalities, built in public', and 'Xiaomi MiMo-V2.5-TTS Series'. Below them a 'Build with MiMo' section lists two numbered routes, '01 Web Demo' and '02 API Access', with the lines 'Interact with MiMo directly through the web' and 'Developer portal for quick integration of MiMo capabilities'.

Läs det mot tillgänglighetsbilden. Standardcheckpointen är nåbar via Xiaomis egna kanaler och flera tredjepartsplattformar, och den går även att ladda ner. UltraSpeed-nivån är nåbar via Xiaomis eget API och flera tredjepartsplattformar, och det är det enda sättet att få den. För den som överväger ett långvarigt beroende är den skillnaden i valmöjligheter värd att prissätta tillsammans med priset per token.

Vem ska ta vilken

Beslutet delar sig tydligt utifrån hur mycket av din kostnad som utgörs av utdatatokens och hur mycket av din latensbudget som är generering snarare än köande.

• Använd UltraSpeed när arbetsbelastningen är utdatatung, cachelätt och interaktiv – långformsgenerering, agentloopar där modellen skriver mycket resonemang mellan verktygsanrop, eller vad som helst där en människa väntar i andra änden av begäran.

• Välj standardnivån när arbetsbelastningen är cacheintensiv, tolerant mot batchkörning eller kostnadskänslig i marginalen – massklassificering, hämtningsförstärkta svar över en fast korpus, utvärderingskörningar över natten, allt där fyra timmars generering är okej eftersom ingen tittar.

Ta standardnivån när du vill ha möjligheten att självhosta. Om din regelefterlevnadsposition kräver vikter du kan hålla, är UltraSpeed inte tillgängligt till något pris.

• Ta ingen av dem förrän du har mätt. Påståendet om tio gånger är den bärande siffran här, och den är för närvarande leverantörsangiven. En enda eftermiddag med att köra dina egna prompter genom båda nivåerna säger dig mer än någon av de publicerade siffrorna, eftersom det enda genomströmningstal som någon oberoende har verifierat tillhör den långsamma sidan av jämförelsen.

När det gäller den sista punkten är mekaniken för att testa en serving-nivå densamma som för att testa en modell, och det är där ett routningslager förtjänar sin plats. OrcaRouter har fler än 200 modeller bakom en enda API-nyckel till leverantörens listpris med 0 % påslag som förs vidare, så slår en prisändring från leverantören igenom hos dig samma dag i stället för vid nästa avtalsförnyelse. Automatisk failover innebär att en nivå som du fortfarande utvärderar aldrig ligger på en produktionsväg på egen hand, och routnings-DSL:en låter dig skicka en klass av förfrågningar till den snabba slutpunkten och allt annat till den vanliga slutpunkten utan att underhålla två integrationer. Inget av det kräver specifikt Xiaomis modeller — poängen är att nivåspecifika beslut som detta är billiga att rulla tillbaka när nivåerna ligger bakom en och samma nyckel.

Vad skulle avgöra detta

Det ärliga läget i frågan om MiMo-V2.6-Pro-UltraSpeed kontra MiMo-V2.6-Pro är att hälften av den är uppmätt och hälften är påstådd. Standardnivån har ett oberoende Intelligence Index, en oberoende genomströmningssiffra och publicerade öppna vikter. Den snabba nivån har ett pris, ett kontextfönster och ett leverantörslöfte om att det är samma modell som går snabbare.

Tre saker skulle stänga gapet. En oberoende genomströmningsmätning på UltraSpeed-slutpunkten — Artificial Analysis mätte standardnivån via Xiaomis API, så samma behandling är möjlig och har helt enkelt inte skett ännu. En cachepolicy för den snabba nivån, eftersom avsaknaden av en sådan är det som förvandlar en tio gånger större räkning till något värre vid cacheintensivt arbete. Och någon publicerad detalj om V2.6-serveringsstacken, på det sätt som Xiaomi dokumenterade FP4-experter, DFlash och TileRT för V2.5-generationen.

Fram till dess är tiopriset verkligt och tiofaldig hastighet ett påstående. Om din arbetsbelastning är utmatningstung och någon väntar är det påståendet värt att testa med dina egna prompter — och värt att testa bakom ett lager som låter dig byta tillbaka samma eftermiddag om det inte håller.