
MiMo-V2.6: Vad Xiaomis RL-artikel faktiskt visar, och vad den lämnar obekräftat
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 36 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 182 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
De flesta modellartiklar som publicerats denna månad är arkitekturartiklar. Den tekniska rapporten bakom Xiaomi MiMo-V2.6-Pro och Xiaomi MiMo-V2.6-Flash är inte det. Med titeln MiMo-V2.6: Att skala förstärkningsinlärning mot självförbättring, inlämnad den 21 september 2026 och tillskriven LLM-Core Xiaomi, ägnar den nästan inget av sin längd åt den sparsa mixture-of-experts-stommen och nästan allt åt en fråga: vad som händer när hela efterträningsbudgeten går till en enda blandad körning med förstärkningsinlärning. DeepSeek-V4.1-Flashs rapport är däremot ett minnesdokument — dess längd går till komprimerad spars uppmärksamhet, KV-återanvändning mellan lager och FP4-lagring. Ställ de två sida vid sida och de är argument om varifrån kapacitet kommer, och de är inte överens.
Rapporten är värd att läsas på sina egna villkor, men den är värd att läsas noggrant, eftersom det är en självrapport från labbet som utförde körningen. Den namnger sina mekanismer, visar sina ablationsstudier, publicerar sina misslyckanden och rapporterar i samma andetag siffror som inte kan kontrolleras utifrån. Att skilja dessa två saker åt är det mesta av arbetet. Den här texten gör det, och den är skriven den 23 september 2026 – två dagar efter att checkpoints lades upp, medan artikeln är det nyaste och minst bekräftade som finns om dem.
Varför datumet på pappret spelar större roll än vanligt
Xiaomis MiMo-V2.6-Pro- och MiMo-V2.6-Flash-checkpoints landade på modellhubben den 21 september 2026, MIT-licensierade och utan åtkomstbegränsningar. Rapporten är daterad samma dag och nådde toppen av trendlistan på preprint-sajten där den lades upp. Den tidpunkten är anledningen till att detta är en nyhetsartikel snarare än en tillbakablick: rapporten är inte en senare förklaring av en modell som alla redan har benchmarkat. Den anländer samtidigt som vikterna, innan någon utanför Xiaomi har publicerat en oberoende körning.

Den ordningen är också artikelns främsta svaghet som bevis. Allt nedströms om den – DeepSWE-kurvan, förbättringarna av passningsfrekvensen, försvaret mot reward hacking – är ett påstående om en träningsprocess som ägde rum en gång, i ett labb, på ett kluster, och som ingen annan har reproducerat. Tråden som flaggade rapporten betraktar det som det intressanta: detta är en data- och experimentartikel, inte en arkitekturartikel, och experiment är precis den sorts resultat som antingen replikeras eller inte.
Tre axlar för skalning, och bara en av dem är ett hårdvaruproblem
Rapportens inramning är att beräkningskraften för förstärkningsinlärning skalades längs tre axlar samtidigt, och den tredje är den som förändrar hur man tänker på metoden.
• Batchstorlek och genomströmning — 1 568 sampel per uppdatering, utökade till sexton rollouts vardera, alltså ungefär 25 000 trajektorier per steg, vilket förbrukar 2,7 till 3,7 miljarder tokens per steg vid kontextlängder på upp till en miljon tokens. Rollout-arkitekturen är helt asynkron, vilket är det som över huvud taget gör den batchstorleken hanterbar.
• Miljöer — en enda blandad körning över kod-, generella agent-, visuella och cyberuppgifter, under flera agentramverk samtidigt, i stället för separata RL-körningar per domän. Xiaomis egen kortform för detta är "You Only RL Once." Argumentet för att blanda är att vinster i en förmåga förstärker de andra; risken är att en långsam uppgiftstyp svälts ut, vilket rapporten säger att man hanterar med adaptiv schemaläggning.
• Bedömarberäkning — axeln som inte handlar om GPU:er i vanlig bemärkelse. Binärt godkänt/underkänt kan inte rangordna två lösningar som båda godkänns, så själva belöningssignalen blir det du skalar. En agentisk bedömare jämför de sexton försöken för en uppgift gemensamt och producerar en graderad signal i stället för en bit.
Den tredje axeln är där frasen "self-improvement" i titeln förtjänar sin plats, och där rapporten är som mest utsatt. En modell som betygsätter sina egna rollouts är en yta för reward-hacking, och rapporten behandlar den som en sådan.
De två mekanismerna som är värda att faktiskt förstå
Gruppvis omfördelning av fördelar
Efter varje steg producerar policyn sexton försök per uppgift och alla placeras i en delad arbetsyta så att en utvärderingsmodell kan granska dem tillsammans i stället för en i taget. Godkända patchar poängsätts sedan utifrån fem axlar: om angreppssättet passar problemet, om implementationen är precis utan onödiga reservlösningar, om ändringen är minimal, om den redigerar något utanför sitt omfång, och om den matchar den omgivande kodstilen. Godkända patchar med lägre rang får mindre positiv förstärkning. En patch som har bekräftats vara ett hack nollställs och behandlas som ett misslyckande.
Konsekvensen är en träningssignal som driver mot kortare, billigare lösningar snarare än enbart korrekta sådana – rapporten beskriver detta som att styra mot färre tokens per uppgift. Det är den delen man bör hålla fast vid, eftersom huvudresultaten senare i rapporten pekar i motsatt riktning.
Gruppvis belöningssyntes
Den offline-halvan av samma idé. I stället för att härleda kvalitet enbart från en live-bedömare, förberäknar teamet uppgiftsspecifika bedömningskriterier och multiplicerar den binära testbelöningen med kvalitets- och beteendepoäng som hämtas från dessa bedömningskriterier. Rapporten beskriver detta som att bygga bedömningskriterierna från kontrasterande rollouts – det vill säga från fall där utfallet skilde sig, vilket är där informationen finns.
Betygsättning är inte gratis. Rapporten uppskattar kostnaden för bedömare till ungefär 12,7 % av MiMo-V2.6-Pros totala kostnad för förstärkningsinlärning. Den siffran är det mest användbara i rapporten för alla som överväger att kopiera metoden, eftersom den förvandlar ”skala upp dina bedömare” från en idé till en budgetpost.
Den frysta routern är det resultat som de flesta team kommer att kopiera först
Rapportens stabilitetsavsnitt innehåller ett fynd som står för sig självt, oberoende av MiMo-V2.6 och oberoende av hur väl modellen presterar.
Med träningsbara routrar för mixture-of-experts drev expertbelastningen iväg kraftigt under tjugo steg. Variationskoefficienten mellan experter steg från 0,78 till 2,0. Toppbelastningen på den mest belastade experten gick från sex gånger genomsnittet till sexton gånger. Andelen kalla experter – de som nästan inte får någon trafik – gick från 0,5 % till 22 %. Att återställa routervikterna till deras utgångsvärden vid steg 20 återställde balansen omedelbart.
Xiaomis svar var att frysa MoE-routern för körningen. Resonemanget är inte subtilt: i den här batchskalan är routinginstabilitet ett träningsdynamikproblem som man helt enkelt kan avstå från att ha, och routern är inte där förstärkningsinlärningen gör sitt arbete. Huruvida frysningen kostar något i slutlig kvalitet besvaras inte av en ablation i det publicerade materialet, och det är rimligt att vilja ha.
Vad fyndet inte säger är något om serving. Router-lastbalansering under en träningskörning och expertutnyttjande under produktionstrafik är olika frågor, och rapporten behandlar bara den första.
Siffrorna, med sina etiketter fästa
Rapportens huvudresultat är stilrena till formen och röriga i detaljerna, och röran är ingen skandal – det är tre olika mätningar av tre olika objekt som delar ett namn.
• DeepSWE v1.1, undanhållen — MiMo-V2.6-Pro steg från 58,4 till 72,6 under körningen; MiMo-V2.6-Flash från 48,7 till 65,7. Benchmarken består av 113 repository-engineering-uppgifter med lång horisont som bedöms av funktionella verifierare över fem programmeringsspråk, och måttet är average@3 — den genomsnittliga andelen godkända verifierarkontroller över tre utvalda försök, vilket inte är samma sak som huruvida något av de tre försöken lyckades. Att tolka avg@3 som pass@3 kommer att överdriva varje siffra på sidan.
• Samma benchmark, mätt någon annanstans — de publicerade modellkorten visar 71,9 för Pro och 67,9 för Flash. Xiaomis offentliga träningsdashboard visade 72,57 och 65,68. Så det finns tre publicerade siffror per modell, två av dem från Xiaomi, och avvikelsens riktning är olika för varje syskon. Ingen av dem är fel; de beskriver en ögonblicksbild av en dashboard, en kortpost och en rapportrad, vid olika tidpunkter och möjligen under olika testramverk.
• Destillation — MiMo-V2.6-Distill-Qwen-9B, finjusterad från Qwen3.5-9B på MiMo-genererade demonstrationer, flyttade SWE-bench Verified från 61,1 till 66,2. Detta är det mest överförbara talet i artikeln, eftersom en 9B-studentmodell är en storlek som de flesta team faktiskt kan köra.
• Ett internt mini-benchmark för cybersäkerhet – 31,3 till 47,0. Internt betyder internt: uppgifterna är inte publicerade, så deltat kan inte reproduceras ens i princip.
• Artificial Analysis Intelligence Index – 46 för MiMo-V2.6-Pro. Den här är av ett annat slag. Den togs fram av Artificial Analysis, som körde sin egen utvärderingsrigg mot den släppta checkpointen, inte av Xiaomi, vilket gör den till den enda rubriksiffran i detta släpp som en läsare kan betrakta som uppmätt snarare än rapporterad. Det är också siffran att jämföra med GLM-5.3, Kimi K3 och den slutna frontlinjen, och den ligger fem poäng under Claude Opus 5.


Rapporten är ärlig om begränsningarna hos sin egen tabell, och detta är meningen som är värd att citera tillbaka till alla som inte är det: jämförelserna blandar offentliga och interna benchmarks och isolerar inte förstärkningsinlärningens bidrag från arkitektur eller förträning. En modell som är bättre efter RL är inte ett bevis för att RL är orsaken.
Det finns ett andra förbehåll, och det är det som går emot inramningen. De rapporterade vinsterna åtföljs i allmänhet av ökad tokenanvändning. Rapporten presenterar det som varaktig förmågeförbättring snarare än som effektivitet, och det gör den rätt i. Men GAR var uttryckligen utformat för att styra mot kortare vägar och färre tokens per uppgift, och det aggregerade resultatet visar inte att arbetsbelastningen blir billigare. Förmågan ökade; kostnaden per uppgift gick inte ner. Om du läser ”självförbättring” som ”modellen kommer att behöva mindre av mina pengar nästa kvartal”, stöder rapporten inte den läsningen.
Vad rapporten lämnar overifierat
Per den 23 september 2026 har ingen tredje part publicerat en oberoende omkörning av DeepSWE-, Terminal Bench- eller CyberGym-kolumnerna. Åtskillnaden som spelar roll är mellan indexpunkten och allt annat: 46 är en mätning som någon annan har gjort, och 72,6 är ett påstående om en träningskörning som ingen kan återutföra, eftersom körningen kostade enligt uppgift 2,6 miljoner dollar för Pro och 0,9 miljoner dollar för Flash och inte kommer att ske två gånger.
Det som Xiaomi faktiskt publicerade, vilket de flesta labb inte gör, är träningsdynamiken, ramverket för förstärkningsinlärning och uppgiftsmiljöerna – över 7 000 graderade miljöer inom programvaruteknik, reproduktion av sårbarheter, kunskapsarbete och webbdesign. Det är artefakten med den längsta livslängden. Vikterna berättar vad körningen producerade; miljöerna berättar hur du själv kör experimentet, vilket är det enda sättet som några av RL-påståendena någonsin kan avgöras.
Försvaret mot reward-hacking förtjänar ett specifikt förbehåll. Det beskrivs som flerskiktat — belöningsutformning, adversariell utvärdering, anomalidetektion och korsvis kontroll mellan verifierare — och det beskrivs helt och hållet av den part som skulle bli generad om det misslyckades. Ett försvar mot att en modell manipulerar en modellbaserad bedömare är inte något som en självrapport kan avsluta. Mekanismen namnges och felmoden erkänns, vilket är mer än vad de flesta artiklar gör, och det är fortfarande en öppen fråga.
Vad du faktiskt kan göra med det här idag
Båda checkpointarna är nedladdningsbara, utan gating, under en MIT-licenstagg: Xiaomi MiMo-V2.6-Pro-RL och Xiaomi MiMo-V2.6-Flash-RL, omnimodala, med en kontext på en miljon tokens, där Flash-indexet rapporterar 172,9 GB viktdata över 65 shards i FP8. Xiaomi har inte publicerat någon prislista per token för V2.6-generationen, så valet idag är att självhosta mot en hostad modell som du redan betalar för.
Den jämförelsen är där artikelns verkliga värde ligger, och den är ofördelaktig för artikeln på ett användbart sätt. Påståendet som prövas är inte "är MiMo-V2.6-Pro bra" – det svarar de 46 på. Det är "ger förstärkningsinlärning på blandade agentiska uppgifter resonemang som överförs till min arbetsbelastning", och det enda ärliga sättet att svara på det är att köra båda och jämföra, vilket är ett routingproblem innan det är ett forskningsproblem. DeepSeek-V4.1-Flash är bara en API-nyckel bort till $0.15 och $0.60 per miljon tokens, Qwen3.8-Flash och GLM-5.3-Flash ligger på samma nyckel, och om du vill sätta en egenhostad MiMo-checkpoint bakom samma endpoint i en vecka och se om DeepSWE-kurvan dyker upp i dina egna utvärderingar, är det en konfigurationsändring snarare än en migrering. OrcaRouter hostar inte Xiaomis modeller, och inget här bör läsas som att det påstår något annat – men de modeller du skulle benchmarka dem mot är alla nåbara genom en enda OrcaRouter API-nyckel till leverantörens listpris med 0 % påslag som förs vidare, med automatisk failover om en checkpoint du testar visar sig vara instabil under belastning.
Fallet med oprövad modell är precis det som failover byggdes för. En checkpoint som publicerades för två dagar sedan, med en utvärdering utförd av leverantören och ingen oberoende omkörning, är precis det du vill prova utan att sätta en produktionsväg bakom den.
Vem bör läsa artikeln?
Om du kör efterträning, läs den för routerfyndet och siffran för bedömningskostnaden. Båda är portabla, båda är billiga att testa, och ingen av dem kräver att man tror på något om MiMo-V2.6:s benchmarktabell. Särskilt resultatet med den frysta routern är den typ av sak som kostar en eftermiddag att prova och sparar en körning.
Om du väljer en modell, läs indexsiffran och hoppa över resten. Artificial Analysis uppmätte 46 på den släppta artefakten; det är den enda siffran i den här utgåvan som inte kom från leverantören, och den placerar MiMo-V2.6-Pro i toppen av fältet för öppna vikter och fem poäng bakom Claude Opus 5. Allt annat i rapporten beskriver hur Xiaomi kom dit, och hur Xiaomi kom dit är inget man kan köpa.
Och om du läser rapporteringen snarare än artikeln är det du bör hålla utkik efter ordet "självförbättring". Rapportens egna resultat visar att kapaciteten ökar i takt med tokenanvändningen, vilket är ett verkligt och repeterbart fynd om skalning av förstärkningsinlärning. Det är inte ett påstående om att modellen blev billigare att köra, och de artiklar som följer efter den här är de som kommer att berätta för dig om den till slut blir det.
