
Xiaomi MiMo-V2.6-Pro: En DeepSWE-poäng på 72,57, en körning som stoppades och fortfarande inget releasedatum
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro avslutade sin offentligt streamade körning för förstärkningsinlärning den 20 september med en DeepSWE v1.1-poäng på 72,57 som ligger på Xiaomis egen instrumentpanel — 1,4 poäng under de 74 % som GPT-6 Astra, Gemini 3.8 Flash och Claude Opus 5 delar på toppen av samma resultattavla. Xiaomi MiMo-V2.6-Flash, den mindre modellen som tränades vid sidan av den, stannade den 19 september på 65,68. Båda körningarna avslutades vid steg 30, och den sammanlagda kostnaden som Xiaomi publicerade tillsammans med dem uppgick till $3 474 715 när vi hämtade sidan i morse.
Det är hela den goda nyheten, och den är verkligen god. Resten av historien är en klyfta mellan en siffra och en produkt. Varken Xiaomi MiMo-V2.6-Pro eller Xiaomi MiMo-V2.6-Flash har ett utgivningsdatum, ett modellkort, en API-identifierare, ett publicerat pris eller en uppsättning nedladdningsbara vikter. Det finns ingen endpoint att anropa. Det som finns är en träningsdashboard som vem som helst kan titta på, en benchmark-siffra som Xiaomis egen testrigg tog fram, och en community som har tillbringat sex dagar med att läsa en telemetrisida på samma sätt som folk brukade läsa teblad.
Så det här är en artikel om vad vi vet hittills, och den ärliga versionen av den skiljer på tre saker som den senaste veckans rapportering tyst har blandat ihop: vad Xiaomi officiellt har uppgett, vad en enda observatör rapporterade om det, och vad något av det betyder för någon som väljer en kodningsmodell i dag.
Vad Xiaomi faktiskt lade ut online
Den 16 september öppnade MiMo-teamet, lett av Luo Fuli, en live-sida på Xiaomis egen domän som visade post-träningen av två ännu inte släppta modeller i realtid: antal steg, belöningskurvor, token-genomströmning, antal sandlådor, GPU-felmeddelanden och en kostnadsräknare som tickar upp medan du tittar. Xiaomis inramning, enligt rapporteringen, är att man lade ungefär sex månader på en fråga – hur långt förstärkningsinlärning kan skalas – och beslutade att köra experimentet offentligt i stället för att tillkännage ett resultat.
Instrumentpanelen är ovanligt uppriktig för att vara en leverantörsartefakt. Den listar sina egna fel i ett notisflöde: en Pro-omstart vid steg 17 orsakad av ett GPU-minnesfel (out-of-memory) på grund av obalans i expertbelastningen, vilket teamet säger sig ha åtgärdat genom att justera sin strategi för träningsparallelism; ett nätverksanslutningsfel mellan Pro-träningsklustret och graderingsdeploymenten som tvingade fram en omstart och ett beslut att stryka cyberdatasetet från den kommande Pro-körningen efter ”dåliga mönster i rollout-loggarna”; en Flash-omstart från steg 15 efter att en klass av infrastrukturfel förblev oupptäckt i ungefär tre timmar; och en Pro-omstart från ett VRAM-fel på en enda nod. Den noterar också att uppgifter som bedömdes vara ”relativt enkla för den nuvarande pro-modellen” filtrerades bort — ett erkännande som de flesta efterträningsrapporter lämnar osagt.

De två körningskorten är den del som spelar roll för alla som följer tidsåtgången. Båda modellerna är märkta stoppade: MiMo-V2.6-Pro efter 5 dagar och 7 timmars väggklockstid, MiMo-V2.6-Flash efter 3 dagar och 11 timmar, båda vid steg 30, den 20 september respektive den 19 september. Pro förbrukade 75 miljarder tokens och 753 000 sampel för sina 2,62 miljoner dollar; Flash förbrukade 81,4 miljarder tokens för 854 000 dollar. Varje steg drar en batch på 1 568 prompts med 16 rollouts per prompt – 25 088 trajektorier per steg, som körs helt asynkront.
Det är värt att säga rakt ut: Xiaomi har inte sagt om "stoppad" betyder att körningen är avslutad, pausad eller checkpointad. Ett stoppat kort är inte ett slutförandemeddelande, och ingen utanför teamet vet vilket av dem det är.
Vad är bekräftat, och vad är inte
Siffran 72,57 är inte ett rykte. Den är tryckt på Xiaomis dashboard, i ett diagram märkt DeepSWE v1.1, mini-swe-agent, avg@3, bredvid Pro-körningens orange kurva. Flash-modellens 65,68 finns i samma diagram. Siffran förekommer också – som 62,24 och senare 65,97 – i tidigare ögonblicksbilder av samma panel, vilket är det som ger kurvan dess form: en stadig klättring över 30 steg snarare än en enda tursam utvärdering.
Det som är enbart rapporterat är utgångspunkten. Påståendet som cirkulerar på X den 21 september, från kontot @nrehiew_, är att Pro-modellen gick "från 58,41 till 72,57" på DeepSWE och att körningarna har slutförts. Slutpunkten matchar leverantörens instrumentpanel exakt. Baslinjen 58,41 är det kontots tolkning av var kurvan börjar – diagrammets vänstraste Pro-punkt ligger faktiskt i de höga 50-talen – och Xiaomi har inte publicerat någon siffra för steg 1. Påståendet om slutförande är på samma sätt en tolkning av två kort markerade som stoppade, vilket är en rimlig tolkning och inte ett uttalande från Xiaomi. Betrakta förbättringen på 14 punkter som riktningsmässigt robust och numeriskt ungefärlig.

Det finns ytterligare en åtskillnad som bevakningen har hoppat över, och det är den som avgör hur mycket siffran är värd. Instrumentpanelens benchmarkpaneler är Xiaomis egna utvärderingar: företaget körde testramverket på sina egna checkpoints och publicerade resultaten. Testramverket är samma som den offentliga resultattavlan använder – mini-swe-agent, DeepSWE v1.1 – vilket gör siffran mer jämförbar än en leverantörs egenutvecklade benchmark skulle vara. Men en egenkörd utvärdering är inte en post på resultattavlan, och 72.57 finns inte på Datacurves resultattavla, eftersom ingen har skickat in den.
Taket på 74 % är stramare än rubriken antyder.
Vilket sätter jämförelsen i fokus. Datacurves DeepSWE v1.1-topplista, senast uppdaterad 3 september 2026, listar 113 uppgifter i 91 repositorier på fem språk, och dess tre främsta konfigurationer ligger lika på 74 % Pass@1: GPT-6 Astra vid xhigh resonemangsansträngning, Gemini 3.8 Flash vid high och Claude Opus 5 vid max. Siffrorna som står intill dessa resultat är de intressanta.
• Konfidens — GPT-6 Astra 74 % ±3, Gemini 3.8 Flash 74 % ±1, Claude Opus 5 74 % ±4. På samma resultattavla ligger GPT-5.6 Sol på 73 % ±3 och GLM-5.3 och Kimi K3 på 69 %. Intervallen överlappar långt förbi andra decimalen.
• Kostnad per uppgift — Gemini 3.8 Flash ligger i genomsnitt på 2,36 USD, GPT-6 Astra på 6,52 USD och Claude Opus 5 på 11,84 USD. Topplistans eget diagram markerar Gemini 3.8 Flash som den mest effektiva konfigurationen på tavlan, och spridningen mellan dessa tre är ungefär fem mot ett för en godkännandegrad som benchmarken inte kan skilja åt.
• Steg — Gemini 3.8 Flash behövde i genomsnitt 166 agentsteg per uppgift, Claude Opus 5 99, GPT-6 Astra 29. Den identiska poängen döljer tre mycket olika arbetssätt, och den billiga är den som arbetar hårdast.

Så när den rapporterade 72,57 beskrivs som "att närma sig toppen av resultattavlan" är den korrekta versionen snävare och mindre dramatisk. Den ligger inom ungefär en och en halv poäng från en trevägad oavgjordhet vars medlemmar inte kan skiljas från varandra av benchmarkens egna felstaplar. Det är ett starkt resultat för en modell som fortfarande är i efterträning, producerad av leverantören snarare än av benchmarkens underhållare, på en resultattavla som modellen inte har skickats in till. Resultattavlans senaste uppdatering är helt före Xiaomis körning, vilket är anledningen till att inget MiMo ännu visas på den.
Varför Xiaomi tränar offentligt
Transparensen är ingen slump. Xiaomis senaste släpp med öppna vikter var Xiaomi MiMo-V2.5 och Xiaomi MiMo-V2.5-Pro i slutet av april, båda under MIT-licensen – kommersiellt användbara, finjusterbara och vidaredistribuerbara. MiMo-V2.5-Pro är en mixture-of-experts-modell med 1,02 biljoner parametrar och 42B aktiva parametrar, en hybrid-attention-arkitektur och ett kontextfönster på 1M tokens, och dess lanseringsmaterial gjorde de agentiska anspråken explicita: en kompilator skriven från grunden i Rust genom hundratals verktygsanrop, en skrivbordsapplikation på åttatusen rader byggd under elva timmars agentarbete.
Att streama nästa generations postträning är ett annat slags påstående. Ett labb som publicerar sina belöningskurvor, antalet sandboxar och sina GPU-fel i realtid ber om att bli bedömt utifrån process snarare än utifrån en lanseringspresentation, och det signalerar en tidslinje. Luo Fuli har sagt att de tekniska detaljerna i RL-arbetet kommer att släppas med öppen källkod bit för bit under de kommande veckorna. Det är det närmaste ett schema som någon har erbjudit: metodik först, modell senare.
Det passar också ett mönster som Xiaomi har använt tidigare, där en modell dyker upp offentligt under ett annat namn innan företaget gör anspråk på den. Företagets vanor är att träna i tysthet, testa öppet och sedan släppa med vikter.
Vad du kan köra idag
Det finns inget i MiMo-V2.6-familjen. Om du vill ha en Xiaomi MiMo-modell just nu är det V2.5-generationen som finns – öppna vikter via Xiaomis egna kanaler och flera tredjepartsplattformar, med publicerade modellkort och priser. Det finns inget MiMo-V2.6-API, ingen modellidentifierare och ingen prislista, och varje sida som anger en MiMo-V2.6-identifierare eller ett per-token-pris fyller i en lucka som Xiaomi har lämnat tom. Strängarna `mimo-v2.6-pro` och `mimo-v2.6-flash` på instrumentpanelen är namn på träningsjobb, inte publicerade slutpunkter.
Den andra praktiska konsekvensen är vad man ska göra under tiden. Om anledningen till att MiMo-V2.6-Pro är intressant för dig är att det kan vara ett billigare sätt att nå kodningsprestanda på frontlinjenivå, är de konfigurationer som det mäts mot redan anropbara, och topplistan säger att den billiga är konkurrenskraftig: Gemini 3.8 Flash tangerar den högsta godkännandegraden med $2,36 per uppgift och flaggas som topplistans mest effektiva konfiguration. Gemini 3.8 Flash, Claude Opus 5 och GPT-6 Astra är alla nåbara via en enda OrcaRouter-API-nyckel till leverantörens listpris med 0 % påslag som förs vidare — så en leverantörsprisändring är live hos oss samma dag i stället för vid nästa faktureringscykel — med failover konfigurerad per modell i stället för per leverantör. Och när ett labb väl öppnar en modell som den här, är det minst åtagandekrävande sättet att utvärdera den att routa den bakom samma nyckel: du kan sätta den framför verklig trafik utan att satsa en produktionsväg på en checkpoint som ingen har karaktäriserat.
Vad skulle egentligen förändra den här historien?
Fyra signaler, ungefär i ordning efter hur mycket de skulle avgöra:
• Vikter på Hugging Face under en angiven licens, vilket är hur V2.5-generationen kom och det starkaste beviset för att RL-körningen producerade en leveransklar modell snarare än ett experiment som tog slut.
• Ett modellkort med parameterantal, kontextlängd och arkitektur — inga av V2.6-siffrorna är offentliga, och instrumentpanelen visar dem inte. Att anta att V2.6-Pro ärver V2.5-Pros 1.02T/42B-form vore en gissning.
• En API-identifierare och en prislista, vilket är ögonblicket då DeepSWE-siffran blir ett köpbeslut snarare än en åskådarsport.
• En inlämning till Datacurves DeepSWE-resultattavla, vilket skulle placera MiMo-V2.6-Pro i samma tabell och under samma felstaplar som de modeller den jämförs med. En utvärdering som körts av leverantören och en inlämning till en resultattavla är inte samma anspråk, och gapet mellan dem är exakt en rad i den tabellen.
Fram till dess är den ärliga sammanfattningen att Xiaomi har visat den mest transparenta efterträningskörningen som något stort labb har publicerat, på två modeller som företaget inte har släppt, med en självrapporterad benchmark-siffra som hamnar nära – men inte tar sig in i – toppen av listan. Metodbeskrivningen utlovas inom de kommande veckorna. Releasedatumet utlovas inte alls.
