
MiMo-V2.6: Wat Xiaomi's RL-paper werkelijk laat zien, en wat het onbevestigd laat
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 36 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 182 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
De meeste modelpapers die deze maand zijn gepubliceerd, zijn architectuurpapers. Het technische rapport achter Xiaomi MiMo-V2.6-Pro en Xiaomi MiMo-V2.6-Flash is dat niet. Getiteld MiMo-V2.6: Reinforcement learning opschalen richting zelfverbetering, ingediend op 21 september 2026 en toegeschreven aan LLM-Core Xiaomi, besteedt het vrijwel niets van zijn lengte aan de sparse mixture-of-experts-backbone en bijna alles aan één vraag: wat gebeurt er wanneer het volledige post-trainingbudget in één enkele gemengde reinforcement-learning-run wordt gestopt. Het rapport van DeepSeek-V4.1-Flash is daarentegen een geheugendocument — de lengte ervan gaat naar gecomprimeerde sparse attention, cross-layer KV-hergebruik en FP4-opslag. Zet de twee naast elkaar en het zijn betogen over waar capaciteit vandaan komt, en ze zijn het niet met elkaar eens.
Het rapport is op zichzelf de moeite waard, maar het is de moeite waard om het zorgvuldig te lezen, want het is een zelfrapportage van het lab dat de run heeft gedraaid. Het benoemt zijn mechanismen, toont zijn ablaties, publiceert zijn mislukkingen, en in één adem rapporteert het cijfers die niet van buitenaf te controleren zijn. Het scheiden van die twee dingen is het grootste deel van het werk. Dit stuk doet dat, en het is geschreven op 23 september 2026 — twee dagen nadat de checkpoints online kwamen, terwijl de paper het nieuwste en minst bevestigde is dat daarover verschenen is.
Waarom de datum op het papier belangrijker is dan gewoonlijk
Xiaomi's MiMo-V2.6-Pro en MiMo-V2.6-Flash-checkpoints zijn op 21 september 2026 op de modelhub verschenen, onder MIT-licentie en zonder toegangsbeperkingen. Het rapport is dezelfde dag gedateerd en bereikte de top van de trendinglijst op de preprintsite waar het is gepost. Die timing is de reden dat dit een nieuwsbericht is en niet een terugblik: de paper is geen latere uitleg van een model dat iedereen al heeft gebenchmarkt. Hij verschijnt tegelijk met de gewichten, voordat iemand buiten Xiaomi een onafhankelijke run heeft gepubliceerd.

Die volgorde is ook de belangrijkste zwakte van het paper als bewijs. Alles wat daaruit voortvloeit — de DeepSWE-curve, de winst in slagingspercentages, de verdediging tegen reward hacking — is een bewering over een trainingsproces dat één keer heeft plaatsgevonden, in één lab, op één cluster, en dat niemand anders heeft gereproduceerd. De thread die het rapport signaleerde, ziet dat als het interessante deel: dit is een paper over data en experimenten, geen architectuurpaper, en experimenten zijn precies het soort resultaat dat ofwel repliceert, ofwel niet.
Drie assen van opschaling, en slechts één daarvan is een hardwareprobleem.
De framing van het rapport is dat de rekenkracht voor reinforcement learning langs drie assen tegelijk werd opgeschaald, en de derde is degene die verandert hoe je over de methode denkt.
• Batch en doorvoer — 1.568 samples per update, die elk worden uitgebreid naar zestien rollouts, dus ruwweg 25.000 trajecten per stap, wat 2,7 tot 3,7 miljard tokens per stap verbruikt bij contextlengtes tot een miljoen tokens. De rollout-architectuur is volledig asynchroon, en dat is precies wat die batchgrootte überhaupt hanteerbaar maakt.
• Environments — één enkele gemengde run over code-, algemene agent-, visuele en cyber-taken, onder meerdere agent-harnesses tegelijk, in plaats van afzonderlijke RL-runs per domein. Xiaomi's eigen verkorte term hiervoor is "You Only RL Once." Het argument voor mengen is dat winst in het ene vermogen de andere versterkt; het risico is dat een langzaam taaktype uitgehongerd raakt, wat volgens het rapport wordt opgevangen met adaptieve planning.
• Grader compute — de as die niet over GPU's in de gebruikelijke zin gaat. Binaire pass/fail kan twee oplossingen die beide slagen niet rangschikken, dus het beloningssignaal zelf wordt het ding dat je opschaalt. Een agentische grader vergelijkt de zestien pogingen voor een taak gezamenlijk en produceert een gegradeerd signaal in plaats van een bit.
Die derde as is waar de uitdrukking "self-improvement" in de titel haar plaats verdient, en waar het rapport het meest blootligt. Een model dat zijn eigen rollouts beoordeelt, is een oppervlak voor reward-hacking, en het rapport behandelt het als zodanig.
De twee mechanismen die het echt waard zijn om te begrijpen
Groepsgewijze herverdeling van voordelen
Na elke stap produceert het beleid zestien pogingen per taak, en ze worden allemaal in een gedeelde werkruimte geplaatst, zodat een evaluatormodel ze samen kan onderzoeken in plaats van een voor een. Geslaagde patches worden vervolgens op vijf assen beoordeeld: of de aanpak bij het probleem past, of de implementatie nauwkeurig is zonder onnodige fallbacks, of de wijziging minimaal is, of er iets buiten de scope wordt gewijzigd, en of het overeenkomt met de omliggende codestijl. Lager gerangschikte geslaagde patches krijgen minder positieve bekrachtiging. Een patch die als hack wordt bevestigd, wordt op nul gezet en als een mislukking behandeld.
Het gevolg is een trainingssignaal dat aanstuurt op kortere, goedkopere oplossingen in plaats van louter correcte — het rapport ziet dit als sturen op minder tokens per taak. Dat is het punt om aan vast te houden, want de opvallende resultaten verderop in het paper wijzen de andere kant op.
Groepsgewijze beloningssynthese
De offlinehelft van hetzelfde idee. In plaats van kwaliteit puur uit een live beoordelaar af te leiden, berekent het team taakspecifieke rubrics vooraf en vermenigvuldigt het de binaire testbeloning met kwaliteits- en gedragsscores die aan die rubrics worden ontleend. Het rapport beschrijft dit als het opbouwen van de rubrics uit contrasterende rollouts — dat wil zeggen uit gevallen waarin de uitkomst verschilde, en daar zit de informatie.
Beoordelen is niet gratis. Het rapport stelt de kosten van beoordelaars op ongeveer 12,7% van de totale reinforcement-learningkosten van MiMo-V2.6-Pro. Dat enkele cijfer is het nuttigste in het artikel voor iedereen die overweegt de methode over te nemen, omdat het "schaal je beoordelaars op" van een idee verandert in een begrotingspost.
De bevroren router is het resultaat dat de meeste teams als eerste zullen kopiëren
De stabiliteitssectie van het rapport bevat een bevinding die op zichzelf staat, onafhankelijk van MiMo-V2.6 en onafhankelijk van hoe goed het model presteert.
Met trainbare mixture-of-experts-routers liep de expertbelasting over twintig stappen ernstig uit de pas. De variatiecoëfficiënt tussen experts steeg van 0,78 naar 2,0. De piekbelasting op de drukste expert ging van zes keer het gemiddelde naar zestien keer. Het aandeel koude experts — degenen die bijna geen verkeer krijgen — ging van 0,5% naar 22%. Het terugzetten van de routergewichten naar hun beginwaarden bij stap 20 herstelde het evenwicht onmiddellijk.
Het antwoord van Xiaomi was om de MoE-router gedurende de run te bevriezen. De redenering is niet subtiel: op deze batchschaal is routeringsinstabiliteit een probleem in de trainingsdynamiek dat je eenvoudig kunt weigeren te hebben, en de router is niet de plek waar de reinforcement learning haar werk doet. Of het bevriezen iets kost aan de uiteindelijke kwaliteit, wordt niet beantwoord door een ablatie in het gepubliceerde materiaal, en dat is een terechte wens.
Wat de bevinding niet zegt, is iets over serving. Loadbalans van de router tijdens een trainingsrun en de benutting van experts onder productieverkeer zijn verschillende vragen, en het rapport behandelt alleen de eerste.
De nummers, met hun labels eraan bevestigd
De belangrijkste resultaten van het rapport zijn helder van vorm en rommelig in detail, en die rommel is geen schandaal — het zijn drie verschillende metingen van drie verschillende objecten die dezelfde naam dragen.
• DeepSWE v1.1, apart gehouden — MiMo-V2.6-Pro steeg tijdens de run van 58.4 naar 72.6; MiMo-V2.6-Flash van 48.7 naar 65.7. De benchmark bestaat uit 113 repository-engineeringtaken met een lange horizon die door functionele verifiers worden beoordeeld in vijf programmeertalen, en de metriek is average@3 — de gemiddelde slaagkans van de verifier over drie gesamplede pogingen, wat niet hetzelfde is als of één van de drie pogingen is geslaagd. avg@3 lezen als pass@3 zal elk getal op de pagina te hoog voorstellen.
• Dezelfde benchmark, elders gemeten — de vrijgegeven modelkaarten vermelden 71,9 voor Pro en 67,9 voor Flash. Het openbare trainingsdashboard van Xiaomi vermeldde 72,57 en 65,68. Er zijn dus drie gepubliceerde cijfers per model, waarvan twee van Xiaomi, en de richting van de discrepantie verschilt per variant. Geen van de drie is fout; ze beschrijven een dashboardmomentopname, een kaartvermelding en een rapportregel, op verschillende momenten en mogelijk onder verschillende testopstellingen.
• Distillatie — MiMo-V2.6-Distill-Qwen-9B, fijn afgestemd op Qwen3.5-9B met door MiMo gegenereerde demonstraties, bracht SWE-bench Verified van 61,1 naar 66,2. Dit is het meest overdraagbare getal in het artikel, omdat een 9B-student een grootte is die de meeste teams daadwerkelijk kunnen draaien.
• Een interne mini-benchmark voor cyberbeveiliging — 31,3 tot 47,0. Intern betekent intern: de taken zijn niet gepubliceerd, dus het verschil kan zelfs in principe niet worden gereproduceerd.
• De Artificial Analysis Intelligence Index — 46 voor MiMo-V2.6-Pro. Deze is anders van aard. Hij werd geproduceerd doordat Artificial Analysis zijn eigen testharnas op de vrijgegeven checkpoint liet draaien, niet door Xiaomi, waardoor het het enige hoofdcijfer in deze release is dat een lezer als gemeten in plaats van gerapporteerd kan beschouwen. Het is ook het getal om te vergelijken met GLM-5.3, Kimi K3 en de gesloten frontier, en het ligt vijf punten onder Claude Opus 5.


Het rapport is eerlijk over de beperkingen van zijn eigen tabel, en dit is de zin die het waard is om terug te citeren tegen iedereen die dat niet is: de vergelijkingen mengen publieke en interne benchmarks en isoleren de bijdrage van reinforcement learning niet van architectuur of pre-training. Een model dat na RL beter is, is geen bewijs dat RL daar de oorzaak van is.
Er is een tweede voorbehoud, en dat is degene die tegen de framing indruist. De gerapporteerde winsten gaan doorgaans gepaard met een stijgend tokengebruik. Het rapport presenteert dat als duurzame verbetering van capaciteiten in plaats van als efficiëntie, en dat is terecht. Maar GAR was expliciet ontworpen om te sturen naar kortere paden en minder tokens per taak, en het geaggregeerde resultaat laat niet zien dat de werklast goedkoper wordt. De capaciteit ging omhoog; de kosten per taak gingen niet omlaag. Als je "zelfverbetering" leest als "het model zal volgende kwartaal minder van mijn geld nodig hebben", dan ondersteunt het paper die lezing niet.
Wat het rapport ongeverifieerd laat
Op 23 september 2026 heeft geen enkele derde partij een onafhankelijke herhaling gepubliceerd van de kolommen DeepSWE, Terminal Bench of CyberGym. Het onderscheid dat ertoe doet, is dat tussen het indexpunt en al het overige: 46 is een meting die iemand anders heeft gedaan, en 72,6 is een bewering over een trainingsrun die niemand opnieuw kan uitvoeren, omdat de run naar verluidt $2,6 miljoen kostte voor Pro en $0,9 miljoen voor Flash en niet twee keer zal plaatsvinden.
Wat Xiaomi wel publiceerde en de meeste labs niet, zijn de trainingsdynamiek, het framework voor reinforcement learning en de taakomgevingen — meer dan 7.000 beoordeelde omgevingen op het gebied van software-engineering, kwetsbaarheidsreproductie, kenniswerk en webdesign. Dat is het artefact met de langste houdbaarheid. De gewichten vertellen je wat de run heeft opgeleverd; de omgevingen vertellen je hoe je het experiment zelf kunt uitvoeren, en dat is de enige manier waarop welke RL-bewering dan ook ooit wordt beslecht.
De verdediging tegen reward hacking verdient een specifiek voorbehoud. Ze wordt beschreven als meerlagig — beloningsontwerp, adversariële evaluatie, anomaliedetectie en kruiscontrole tussen verificateurs — en ze wordt volledig beschreven door de partij die in verlegenheid zou raken bij een falen ervan. Een verdediging tegen een model dat een op een model gebaseerde beoordelaar probeert te misleiden, is niet iets dat een zelfrapportage kan afronden. Het mechanisme wordt genoemd en de faalmodus wordt erkend, wat meer is dan de meeste papers doen, en het blijft een open vraag.
Wat je hier vandaag daadwerkelijk mee kunt doen
Beide checkpoints zijn downloadbaar, zonder toegangsbeperkingen, onder een MIT-licentietag: Xiaomi MiMo-V2.6-Pro-RL en Xiaomi MiMo-V2.6-Flash-RL, omnimodaal, een context van één miljoen tokens, waarbij de Flash-index 172,9 GB aan gewichtsgegevens over 65 shards in FP8 rapporteert. Xiaomi heeft geen tariefkaart per token voor de V2.6-generatie gepubliceerd, dus de keuze vandaag is self-hosting tegenover een gehost model waarvoor u al betaalt.
Die vergelijking is waar de echte waarde van het paper zit, en ze valt op een nuttige manier ongunstig uit voor het paper. De claim die wordt getest is niet "is MiMo-V2.6-Pro goed" — daar geven de 46 antwoorden antwoord op. Het is "levert reinforcement learning op gemengde agentic taken redeneringen op die overdraagbaar zijn naar mijn workload", en de enige eerlijke manier om dat te beantwoorden is beide draaien en vergelijken, wat eerder een routeringsprobleem is dan een onderzoeksprobleem. DeepSeek-V4.1-Flash ligt op één API-sleutel afstand voor $0.15 en $0.60 per miljoen tokens, Qwen3.8-Flash en GLM-5.3-Flash zitten op dezelfde sleutel, en als je een zelfgehost MiMo-checkpoint een week achter hetzelfde endpoint wilt zetten om te zien of de DeepSWE-curve opduikt in je eigen evals, dan is dat een configuratiewijziging in plaats van een migratie. OrcaRouter host de modellen van Xiaomi niet, en niets hier mag worden gelezen als een bewering van het tegendeel — maar de modellen waarmee je ze zou benchmarken zijn allemaal bereikbaar via één OrcaRouter-API-sleutel tegen de lijstprijs van de provider met 0% markup doorgegeven, met automatische failover als een checkpoint dat je aan het uitproberen bent onstabiel blijkt onder belasting.
Het geval van het onbewezen model is precies waarvoor failover is gebouwd. Een checkpoint dat twee dagen geleden is gepubliceerd, met een door de leverancier uitgevoerde evaluatie en zonder onafhankelijke herhaling, is precies het ding dat je wilt proberen zonder er een productiepad achter te zetten.
Wie moet het artikel lezen
Als je post-training doet, lees het voor de routerbevinding en het grader-cost-cijfer. Beide zijn overdraagbaar, beide zijn goedkoop om te testen, en geen van beide hangt af van of je iets gelooft over de benchmarktabel van MiMo-V2.6. Vooral het frozen-routerresultaat is het soort ding dat een middag kost om te proberen en een run bespaart.
Als je een model kiest, lees het indexpunt en sla de rest over. Artificial Analysis mat 46 op het uitgebrachte artefact; dat is het enige cijfer in deze release dat niet van de leverancier kwam, en het plaatst MiMo-V2.6-Pro bovenaan het open-weightsveld en vijf punten achter Claude Opus 5. Al het andere in het rapport beschrijft hoe Xiaomi daar is gekomen, en hoe Xiaomi daar is gekomen is niet iets dat je kunt kopen.
En als je de berichtgeving leest in plaats van het artikel, is het woord "zelfverbetering" waar je op moet letten. De eigen resultaten van het rapport laten zien dat het vermogen stijgt naarmate het tokengebruik toeneemt, wat een echte en herhaalbare bevinding is over het opschalen van reinforcement learning. Het is geen claim dat het model goedkoper is geworden om te draaien, en de artikelen die hierop volgen, zijn de artikelen die je zullen vertellen of dat uiteindelijk gebeurt.
