
Xiaomi MiMo-V2.6-Pro toppar Open-Weights Index på 46 — och publicerar träningsnotan
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro är nu den högst rankade modellen med öppna vikter på Artificial Analysis Intelligence Index, med 46 på v4.3.2 — en poäng före GLM-5.3 och två poäng före Kimi K3, och tjugo poäng över de 26 som föregångaren MiMo-V2.5-Pro noterade på den tidigare indexskalan. Den siffran togs fram av Artificial Analysis som körde sin egen testrigg, inte av Xiaomi, och det är det enskilt mest användbara faktumet i det här släppet. Det näst mest användbara faktumet är priset som anges bredvid: $0,43 per miljon input-tokens, $0,87 per miljon output-tokens, mot $5,00 och $25,00 för Claude Opus 5 — en modell som ligger fem indexpoäng högre. Det tredje är det som ingen förväntade sig att Xiaomi skulle lämna ut: en offentlig redovisning av vad den förstärkningsinlärningskörning som producerade MiMo-V2.6-Pro faktiskt kostade.
Poängen är en mätning, inte ett påstående
Nästan allt som publiceras om en lansering av en kinesisk modell kommer i form av en leverantörssiffra, och läsarna har lärt sig att bortse från den. Den här är annorlunda, och skillnaden förtjänar att beskrivas exakt, eftersom rapporteringen om lanseringen redan har suddat ut den.
Artificial Analysis utvärderade MiMo-V2.6-Pro självt, på v4.3.2-kompositen – tio utvärderingar som täcker resonemang, kunskap, matematik och kodning, inklusive AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience och AA-LCR v1.1. Siffran 46 är vad den testsviten gav. Den registrerade också de driftsegenskaper som avgör huruvida en modell är användbar snarare än bara bra: 134,3 utdatatoken per sekund, 2,15 sekunder till första token, 99 % cacherabatt och en uppmätt kostnad på $0,13 per Intelligence Index-uppgift.
Två av dessa förtjänar att framhållas. De 134,3 tokens per sekund placerar MiMo-V2.6-Pro på elfte plats bland 114 modeller när det gäller hastighet – för en mixture-of-experts-modell med en biljon parametrar är det ett resultat för modellservering, inte bara ett träningsresultat. Och 0,13 dollar per uppgift är siffran som håller när den möter en budget: det är vad indexet faktiskt kostade att köra mot den här modellen, mätt på samma sätt för varje modell på resultattavlan, vilket gör den jämförbar på ett sätt som rubrikernas per-token-priser inte är.

Vad indexet omfattar och inte omfattar
Kronan för öppna vikter är verklig men snävare än det låter. Med 46 leder MiMo-V2.6-Pro kategorin för öppna vikter. Den leder inte indexet. Toppen av v4.3 är Claude Fable 5.1 vid maximal ansträngning med standardfallback och GPT-6 Astra vid maximal ansträngning, båda på 53, med Claude Opus 5 på 51 och Claude Fable 5 på 50. Så den ärliga beskrivningen är ett gap på fem punkter till frontlinjen i ett sammansatt mått som belönar bredd, och en förbättring på tjugo punkter jämfört med Xiaomis egen tidigare generation.
• Ledare inom öppna vikter — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• Toppen av samma index — Claude Fable 5.1 (max, reserv) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51
• Hastighet – 134,3 utdatatokens/sekund, elfte av 114 uppmätta modeller; medianen för storleksklassen är 77,9
• Tid till första token — 2,15 sekunder, jämfört med ett medianvärde på 2,34 sekunder
• Kostnad per Intelligence Index-uppgift — 0,13 USD, där hela utvärderingen kostade 206,66 USD att köra
Listpris — 0,43 USD per miljon indatatokens, 0,87 USD per miljon utdata, 99 % cacherabatt och ett sammanvägt pris på 0,18 USD vid en fördelning på 7:2:1 mellan cacheträffar/indata/utdata
En siffra på sidan Artificial Analysis är ett genuint förbehåll snarare än en skrytpunkt: den räknade en enda API-leverantör för MiMo-V2.6-Pro när detta skrevs. Det är den praktiska flaskhalsen för den här modellen just nu, och det är inte ett kvalitetsproblem – det är ett tillgänglighetsproblem. En modell som nås via en enda väg har ingen failover. Om den vägen försämras försämras din applikation med den, och failover-berättelsen är precis vad en router finns för att tillhandahålla. Den relevanta observationen för alla som planerar utifrån den här lanseringen är att vi inte hostar MiMo-V2.6-Pro, och vi kommer inte att låtsas något annat; vägen till den i dag är Xiaomis egen plattform och de få tredjepartskataloger som listar den.

De två numren som inte får blandas ihop
Xiaomi publicerade också egna benchmarksiffror, och de är en annan typ av objekt än 46. Företagets dashboard rapporterar att MiMo-V2.6-Pro går från 58,4 till 72,57 på DeepSWE v1.1 under sin förstärkningsinlärningskörning, utvärderad med mini-swe-agent som medelvärde av tre. Det är Xiaomis testramverk, Xiaomis bedömare, Xiaomis offline-körning. Den har inte skickats in till den offentliga DeepSWE-topplistan och den har inte reproducerats av någon.
Läser man de två sida vid sida är frestelsen att behandla 72,57 som en poäng i nivå med de 74 % som den offentliga DeepSWE-tavlan listar i toppskiktet. De är inte på samma skala. Siffran på resultattavlan är en inlämnad konfiguration, Pass@1, med ett publicerat konfidensintervall och en genomsnittlig kostnad per uppgift; leverantörens siffra är en intern utvärdering utan något av detta kopplat till sig. Vår egen artikel från den 21 september påpekade detta när siffrorna fortfarande var avläsningar i instrumentpanelen, och det gäller fortfarande nu när vikterna har släppts. Ett testramverk från en leverantör kan vara helt ärligt och ändå inte vara en post på resultattavlan, eftersom posten på resultattavlan är ett påstående om en specifik konfiguration under specifika villkor som en tredje part kan köra om.
Samma disciplin gäller för träningsutgifterna. Xiaomi rapporterar ungefär 3 474 715 dollar sammanlagt för Pro- och Flash-körningarna – 2 620 670 dollar för Pro, 854 044 dollar för Flash – med över trettio förstärkningsinlärningssteg vardera och omkring 750 000 trajektorier per körning, slutförda på under sex dagar. Det är företagets egna beräkningsredovisningssiffror. De är intressanta eftersom labb nästan aldrig publicerar dem, och de är inte ett API-pris, inte en kostnad du kommer att betala och inte en siffra som någon tredje part har granskat.
Vad Xiaomi faktiskt levererade
Släppet är en gles mixture-of-experts-modell med totalt 1,02 biljoner parametrar, varav 42 miljarder aktiveras per token, ett kontextfönster på 1M token och inbyggd multimodallitet för text, bild, video och ljud. Dess syskon Xiaomi MiMo-V2.6-Flash har samma arkitektur i mindre skala, 309 miljarder totalt och 15 miljarder aktiva. De publicerade vikterna bär en MIT-licenstagg, och släpppaketet innehåller en teknisk rapport, driftsättningsinstruktioner och – enligt Xiaomi – de träningsmiljöer och den kod för förstärkningsinlärning som behövs för att undersöka och reproducera efterträningen.
Den sista punkten är den väsentliga skillnaden mellan den här lanseringen och ett typiskt API-tillkännagivande, och den förtjänar att skiljas från marknadsföringen. Att publicera RL-miljön är ett påstående om att träningsupplägget kan granskas. Huruvida de publicerade miljöerna är tillräckliga för att reproducera en 72,57 är en separat fråga som kommer att avgöras av dem som försöker, inte av versionsinformationen. Xiaomis egna träningsanteckningar beskriver en träningskörning som blandade kodning, allmänna agentuppgifter, visuella uppgifter och cybersäkerhetsuppgifter i en enda omgång, med bedömare som rangordnar framgångsrika trajektorier och omfördelar belöning till bättre vägar – och de dokumenterar även misslyckanden: en GPU-omstart på grund av minnesbrist som orsakades av obalans i expertbelastning, ett nätverksfel mellan träningsklustret och bedömartjänstens driftsättning, samt en Flash-omstart efter att ett infrastrukturfel förblev oupptäckt i ungefär tre timmar. Att publicera felen tillsammans med framgångarna är den del som gör resten av redogörelsen trovärdig.
Vad det kostar att ringa, och var routingfrågan ligger
Med $0,43 och $0,87 per miljon tokens är MiMo-V2.6-Pro prissatt som en mellanklassmodell och benchmarkad som en frontier-modell med öppna vikter. Xiaomi behöll standardprissättningen från föregående MiMo-V2.5-generation i stället för att prissätta den nya checkpointen uppåt, vilket är varför priset verkar lågt i förhållande till parameterantalet. En cacherabatt på 99 % innebär att en cachetung agentloop läser sin kontext för i praktiken ingenting, och det är där notan för en långhorisontell agent faktiskt ackumuleras.
Det finns en version av den här affären som routar problemfritt och en version som inte gör det. Den version som gör det: de frontiermodeller som du skulle jämföra MiMo-V2.6-Pro med — Claude Opus 5 till $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — är alla nåbara via en enda OrcaRouter-nyckel till leverantörens listpris med 0 % påslag, så en leverantörsprissänkning på någon av dem är live hos oss samma dag, och en routningsregel kan skicka en begäran till en andra modell när den första är långsam eller otillgänglig. Det spelar större roll än vanligt här, eftersom modellen med bästa open-weights-poäng också är den med den tunnaste vägen dit. Att kombinera de två — en billig open-weights-bana för bulkarbete och en frontierbana för den svåra svansen — är ett routningsbeslut, och det är den typen av beslut som slutar vara en chansning i samma stund som båda banorna ligger på samma nyckel.
Ytterligare en produkt att hålla reda på, eftersom den lätt förväxlas med modellen: Xiaomi erbjuder också MiMo-V2.6-Pro-UltraSpeed, en hostad serving-nivå som bygger på samma checkpoint. Xiaomis eget material hävdar upp till tjugo gånger högre utdatahastighet än standardtjänsten Pro vid samma kvalitet; tredjepartskatalogers listningar anger ungefär tio gånger. Det är två olika siffror som beskriver samma nivå, ingen har publicerat latensfördelningar per begäran som förenar dem, och nivån har en väsentligt högre taxa. Inget med UltraSpeed förändrar vad vikterna kan göra — det förändrar hur snabbt någon annans servrar kommer att köra dem.
Vad skulle förändra den här bilden?
Tre saker, i ordning efter hur mycket de skulle betyda.
En andra och tredje serveringsväg. Att antalet leverantörer är ett på Artificial Analysis är den begränsande faktorn för allt annat. Fler vägar innebär failover, innebär priskonkurrens på serveringslagret och innebär att modellen kan sättas in i en produktionsväg i stället för i ett experiment.
Oberoende reproduktion av DeepSWE-siffrorna. 46 är redan oberoende; 72,57 är det inte. Om externa körningar landar nära den stärks argumenten för modellen avsevärt. Om de landar väsentligt lägre är Artificial Analysis-siffran fortfarande den man bör lita på, och leverantörens siffra ansluter sig till den långa listan av lanseringspåståenden som inte överlevde kontakt.

Uppdelningar per utvärdering. Det sammansatta måttet är ett sammansatt mått. Vilka av de tio utvärderingarna MiMo-V2.6-Pro vinner och vilka den förlorar är skillnaden mellan en modell du driftsätter för agentisk kodning och en modell du driftsätter för hämtningstungt frågebesvarande, och indexet ensamt berättar inte det för dig. Den detaljen är vad du bör hålla utkik efter härnäst, och det är vad en routningskonfiguration behöver innan den är värd att skriva ned.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
