OrcaRouter modellradar-hjältekort för Xiaomi MiMo-V2.6-Pro, med modellnamnet som rubrik och raden "Öppna vikter, 46 på indexet, $0.43 / $0.87", med två paneler märkta Vad som släpptes och Vad det kostar.
Guides & Insights

Xiaomi MiMo-V2.6-Pro toppar Open-Weights Index på 46 — och publicerar träningsnotan

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Xiaomi MiMo-V2.6-Pro är nu den högst rankade modellen med öppna vikter på Artificial Analysis Intelligence Index, med 46 på v4.3.2 — en poäng före GLM-5.3 och två poäng före Kimi K3, och tjugo poäng över de 26 som föregångaren MiMo-V2.5-Pro noterade på den tidigare indexskalan. Den siffran togs fram av Artificial Analysis som körde sin egen testrigg, inte av Xiaomi, och det är det enskilt mest användbara faktumet i det här släppet. Det näst mest användbara faktumet är priset som anges bredvid: $0,43 per miljon input-tokens, $0,87 per miljon output-tokens, mot $5,00 och $25,00 för Claude Opus 5 — en modell som ligger fem indexpoäng högre. Det tredje är det som ingen förväntade sig att Xiaomi skulle lämna ut: en offentlig redovisning av vad den förstärkningsinlärningskörning som producerade MiMo-V2.6-Pro faktiskt kostade.

Poängen är en mätning, inte ett påstående

Nästan allt som publiceras om en lansering av en kinesisk modell kommer i form av en leverantörssiffra, och läsarna har lärt sig att bortse från den. Den här är annorlunda, och skillnaden förtjänar att beskrivas exakt, eftersom rapporteringen om lanseringen redan har suddat ut den.

Artificial Analysis utvärderade MiMo-V2.6-Pro självt, på v4.3.2-kompositen – tio utvärderingar som täcker resonemang, kunskap, matematik och kodning, inklusive AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience och AA-LCR v1.1. Siffran 46 är vad den testsviten gav. Den registrerade också de driftsegenskaper som avgör huruvida en modell är användbar snarare än bara bra: 134,3 utdatatoken per sekund, 2,15 sekunder till första token, 99 % cacherabatt och en uppmätt kostnad på $0,13 per Intelligence Index-uppgift.

Två av dessa förtjänar att framhållas. De 134,3 tokens per sekund placerar MiMo-V2.6-Pro på elfte plats bland 114 modeller när det gäller hastighet – för en mixture-of-experts-modell med en biljon parametrar är det ett resultat för modellservering, inte bara ett träningsresultat. Och 0,13 dollar per uppgift är siffran som håller när den möter en budget: det är vad indexet faktiskt kostade att köra mot den här modellen, mätt på samma sätt för varje modell på resultattavlan, vilket gör den jämförbar på ett sätt som rubrikernas per-token-priser inte är.

Scoreboard card headed 'Xiaomi MiMo-V2.6-Pro — the scoreboard', listing the index score of 46 on Intelligence Index v4.3.2 as the highest of any open-weights model, the open-weights field behind it at GLM-5.3 45 and Kimi K3 44, the top of the same index at Claude Fable 5.1 53, GPT-6 Astra 53 and Claude Opus 5 51, serving at 134.3 output tokens per second and 2.15 seconds to first token, a price of $0.43 in and $0.87 out per million tokens with a 99% cache discount and $0.13 per index task, MIT-licensed weights at 1.02T total and 42B active parameters with a 1M-token context window and text, image, video and audio input, and a route count of one API provider.

Vad indexet omfattar och inte omfattar

Kronan för öppna vikter är verklig men snävare än det låter. Med 46 leder MiMo-V2.6-Pro kategorin för öppna vikter. Den leder inte indexet. Toppen av v4.3 är Claude Fable 5.1 vid maximal ansträngning med standardfallback och GPT-6 Astra vid maximal ansträngning, båda på 53, med Claude Opus 5 på 51 och Claude Fable 5 på 50. Så den ärliga beskrivningen är ett gap på fem punkter till frontlinjen i ett sammansatt mått som belönar bredd, och en förbättring på tjugo punkter jämfört med Xiaomis egen tidigare generation.

• Ledare inom öppna vikter — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44

• Toppen av samma index — Claude Fable 5.1 (max, reserv) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51

• Hastighet – 134,3 utdatatokens/sekund, elfte av 114 uppmätta modeller; medianen för storleksklassen är 77,9

• Tid till första token — 2,15 sekunder, jämfört med ett medianvärde på 2,34 sekunder

• Kostnad per Intelligence Index-uppgift — 0,13 USD, där hela utvärderingen kostade 206,66 USD att köra

Listpris — 0,43 USD per miljon indatatokens, 0,87 USD per miljon utdata, 99 % cacherabatt och ett sammanvägt pris på 0,18 USD vid en fördelning på 7:2:1 mellan cacheträffar/indata/utdata

En siffra på sidan Artificial Analysis är ett genuint förbehåll snarare än en skrytpunkt: den räknade en enda API-leverantör för MiMo-V2.6-Pro när detta skrevs. Det är den praktiska flaskhalsen för den här modellen just nu, och det är inte ett kvalitetsproblem – det är ett tillgänglighetsproblem. En modell som nås via en enda väg har ingen failover. Om den vägen försämras försämras din applikation med den, och failover-berättelsen är precis vad en router finns för att tillhandahålla. Den relevanta observationen för alla som planerar utifrån den här lanseringen är att vi inte hostar MiMo-V2.6-Pro, och vi kommer inte att låtsas något annat; vägen till den i dag är Xiaomis egen plattform och de få tredjepartskataloger som listar den.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, showing the Intelligence Index score of 46 on version 4.3.2, the listed price of $0.43 per million input tokens and $0.87 per million output tokens, a 99% cache discount, output speed of 134.3 tokens per second, time to first token of 2.15 seconds, and the open-weights attribution with the MIT licence.

De två numren som inte får blandas ihop

Xiaomi publicerade också egna benchmarksiffror, och de är en annan typ av objekt än 46. Företagets dashboard rapporterar att MiMo-V2.6-Pro går från 58,4 till 72,57 på DeepSWE v1.1 under sin förstärkningsinlärningskörning, utvärderad med mini-swe-agent som medelvärde av tre. Det är Xiaomis testramverk, Xiaomis bedömare, Xiaomis offline-körning. Den har inte skickats in till den offentliga DeepSWE-topplistan och den har inte reproducerats av någon.

Läser man de två sida vid sida är frestelsen att behandla 72,57 som en poäng i nivå med de 74 % som den offentliga DeepSWE-tavlan listar i toppskiktet. De är inte på samma skala. Siffran på resultattavlan är en inlämnad konfiguration, Pass@1, med ett publicerat konfidensintervall och en genomsnittlig kostnad per uppgift; leverantörens siffra är en intern utvärdering utan något av detta kopplat till sig. Vår egen artikel från den 21 september påpekade detta när siffrorna fortfarande var avläsningar i instrumentpanelen, och det gäller fortfarande nu när vikterna har släppts. Ett testramverk från en leverantör kan vara helt ärligt och ändå inte vara en post på resultattavlan, eftersom posten på resultattavlan är ett påstående om en specifik konfiguration under specifika villkor som en tredje part kan köra om.

Samma disciplin gäller för träningsutgifterna. Xiaomi rapporterar ungefär 3 474 715 dollar sammanlagt för Pro- och Flash-körningarna – 2 620 670 dollar för Pro, 854 044 dollar för Flash – med över trettio förstärkningsinlärningssteg vardera och omkring 750 000 trajektorier per körning, slutförda på under sex dagar. Det är företagets egna beräkningsredovisningssiffror. De är intressanta eftersom labb nästan aldrig publicerar dem, och de är inte ett API-pris, inte en kostnad du kommer att betala och inte en siffra som någon tredje part har granskat.

Vad Xiaomi faktiskt levererade

Släppet är en gles mixture-of-experts-modell med totalt 1,02 biljoner parametrar, varav 42 miljarder aktiveras per token, ett kontextfönster på 1M token och inbyggd multimodallitet för text, bild, video och ljud. Dess syskon Xiaomi MiMo-V2.6-Flash har samma arkitektur i mindre skala, 309 miljarder totalt och 15 miljarder aktiva. De publicerade vikterna bär en MIT-licenstagg, och släpppaketet innehåller en teknisk rapport, driftsättningsinstruktioner och – enligt Xiaomi – de träningsmiljöer och den kod för förstärkningsinlärning som behövs för att undersöka och reproducera efterträningen.

Den sista punkten är den väsentliga skillnaden mellan den här lanseringen och ett typiskt API-tillkännagivande, och den förtjänar att skiljas från marknadsföringen. Att publicera RL-miljön är ett påstående om att träningsupplägget kan granskas. Huruvida de publicerade miljöerna är tillräckliga för att reproducera en 72,57 är en separat fråga som kommer att avgöras av dem som försöker, inte av versionsinformationen. Xiaomis egna träningsanteckningar beskriver en träningskörning som blandade kodning, allmänna agentuppgifter, visuella uppgifter och cybersäkerhetsuppgifter i en enda omgång, med bedömare som rangordnar framgångsrika trajektorier och omfördelar belöning till bättre vägar – och de dokumenterar även misslyckanden: en GPU-omstart på grund av minnesbrist som orsakades av obalans i expertbelastning, ett nätverksfel mellan träningsklustret och bedömartjänstens driftsättning, samt en Flash-omstart efter att ett infrastrukturfel förblev oupptäckt i ungefär tre timmar. Att publicera felen tillsammans med framgångarna är den del som gör resten av redogörelsen trovärdig.

Vad det kostar att ringa, och var routingfrågan ligger

Med $0,43 och $0,87 per miljon tokens är MiMo-V2.6-Pro prissatt som en mellanklassmodell och benchmarkad som en frontier-modell med öppna vikter. Xiaomi behöll standardprissättningen från föregående MiMo-V2.5-generation i stället för att prissätta den nya checkpointen uppåt, vilket är varför priset verkar lågt i förhållande till parameterantalet. En cacherabatt på 99 % innebär att en cachetung agentloop läser sin kontext för i praktiken ingenting, och det är där notan för en långhorisontell agent faktiskt ackumuleras.

Det finns en version av den här affären som routar problemfritt och en version som inte gör det. Den version som gör det: de frontiermodeller som du skulle jämföra MiMo-V2.6-Pro med — Claude Opus 5 till $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — är alla nåbara via en enda OrcaRouter-nyckel till leverantörens listpris med 0 % påslag, så en leverantörsprissänkning på någon av dem är live hos oss samma dag, och en routningsregel kan skicka en begäran till en andra modell när den första är långsam eller otillgänglig. Det spelar större roll än vanligt här, eftersom modellen med bästa open-weights-poäng också är den med den tunnaste vägen dit. Att kombinera de två — en billig open-weights-bana för bulkarbete och en frontierbana för den svåra svansen — är ett routningsbeslut, och det är den typen av beslut som slutar vara en chansning i samma stund som båda banorna ligger på samma nyckel.

Ytterligare en produkt att hålla reda på, eftersom den lätt förväxlas med modellen: Xiaomi erbjuder också MiMo-V2.6-Pro-UltraSpeed, en hostad serving-nivå som bygger på samma checkpoint. Xiaomis eget material hävdar upp till tjugo gånger högre utdatahastighet än standardtjänsten Pro vid samma kvalitet; tredjepartskatalogers listningar anger ungefär tio gånger. Det är två olika siffror som beskriver samma nivå, ingen har publicerat latensfördelningar per begäran som förenar dem, och nivån har en väsentligt högre taxa. Inget med UltraSpeed förändrar vad vikterna kan göra — det förändrar hur snabbt någon annans servrar kommer att köra dem.

Vad skulle förändra den här bilden?

Tre saker, i ordning efter hur mycket de skulle betyda.

En andra och tredje serveringsväg. Att antalet leverantörer är ett på Artificial Analysis är den begränsande faktorn för allt annat. Fler vägar innebär failover, innebär priskonkurrens på serveringslagret och innebär att modellen kan sättas in i en produktionsväg i stället för i ett experiment.

Oberoende reproduktion av DeepSWE-siffrorna. 46 är redan oberoende; 72,57 är det inte. Om externa körningar landar nära den stärks argumenten för modellen avsevärt. Om de landar väsentligt lägre är Artificial Analysis-siffran fortfarande den man bör lita på, och leverantörens siffra ansluter sig till den långa listan av lanseringspåståenden som inte överlevde kontakt.

Timeline card headed 'MiMo-V2.6-Pro — what was disclosed, and by whom', with six dated rows: 21 September 2026 weights, technical report, deployment instructions and RL environments published; 22 September 2026 Xiaomi's launch page carrying the DeepSWE v1.1 figures and the training-spend accounting; the independent Artificial Analysis score of 46 on v4.3.2; the vendor harness result moving 58.4 to 72.57 on DeepSWE v1.1; the vendor accounting of $2,620,670 for Pro and $854,044 for Flash across the RL runs; and a route count of one API provider.

Uppdelningar per utvärdering. Det sammansatta måttet är ett sammansatt mått. Vilka av de tio utvärderingarna MiMo-V2.6-Pro vinner och vilka den förlorar är skillnaden mellan en modell du driftsätter för agentisk kodning och en modell du driftsätter för hämtningstungt frågebesvarande, och indexet ensamt berättar inte det för dig. Den detaljen är vad du bör hålla utkik efter härnäst, och det är vad en routningskonfiguration behöver innan den är värd att skriva ned.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen