Hero-titelkaart voor het artikel 'Xiaomi MiMo-V2.6-Pro: 72,57 op DeepSWE', met als kicker 'OrcaRouter · modelradar — niet uitgebracht', en de ondertitel 'Een run die stopte, een model dat nog niet is uitgebracht — wat bevestigd is, en wat niet.' Daaronder twee kaarten: links, 'Op Xiaomi's eigen dashboard', met de tekst 'DeepSWE v1.1: 72,57 — run gestopt bij stap 30, 20 sep'; rechts, 'Nog niet gepubliceerd', met de tekst 'Geen modelkaart, geen API-id, geen prijs, geen gewichten'. Vier chips vermelden 'Flash-zustermodel: 65,68', 'Totale uitgaven: $ 3.474.715', 'Bovenaan de ranglijst: 74%' en 'Eval uitgevoerd door de leverancier, niet ingediend'. Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Xiaomi MiMo-V2.6-Pro: een DeepSWE-score van 72,57, een run die stopte, en nog steeds geen releasedatum

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Xiaomi MiMo-V2.6-Pro beëindigde op 20 september zijn openbaar gestreamde reinforcement-learning-run met een DeepSWE v1.1-score van 72,57 op Xiaomi's eigen dashboard — 1,4 punten onder de 74% die GPT-6 Astra, Gemini 3.8 Flash en Claude Opus 5 delen aan de top van hetzelfde klassement. Xiaomi MiMo-V2.6-Flash, het kleinere model dat ermee samen werd getraind, stopte op 19 september op 65,68. Beide runs eindigden bij stap 30, en de gecombineerde rekening die Xiaomi ernaast publiceerde bedroeg $3.474.715 toen we de pagina vanmorgen vastlegden.

Dat is het hele goede nieuws, en het is oprecht goed. De rest van het verhaal is een gat tussen een getal en een product. Noch Xiaomi MiMo-V2.6-Pro noch Xiaomi MiMo-V2.6-Flash heeft een releasedatum, een modelkaart, een API-identificatie, een gepubliceerde prijs of een set downloadbare gewichten. Er is geen endpoint om aan te roepen. Wat bestaat, is een trainingsdashboard dat iedereen kan bekijken, een benchmarkcijfer dat Xiaomi's eigen testharnas heeft opgeleverd, en een community die zes dagen lang een telemetriepagina heeft gelezen zoals mensen vroeger theebladeren lazen.

Dus dit is een stuk over wat we tot nu toe weten, en de eerlijke versie ervan scheidt drie dingen die de berichtgeving van de afgelopen week stilletjes door elkaar heeft gehaald: wat Xiaomi publiekelijk heeft vastgelegd, wat één enkele waarnemer daarover heeft gemeld, en wat dit alles betekent voor iemand die vandaag een codemodel kiest.

Wat Xiaomi daadwerkelijk online heeft gezet

Op 16 september opende het MiMo-team, onder leiding van Luo Fuli, een livepagina op het eigen domein van Xiaomi die de post-training van twee niet-uitgebrachte modellen in realtime toonde: stappenaantallen, beloningscurves, token-doorvoer, sandbox-aantallen, GPU-foutmeldingen en een kostenteller die oploopt terwijl je toekijkt. De framing van Xiaomi, volgens de berichtgeving, is dat het ongeveer zes maanden aan één vraag heeft gewerkt — hoe ver reinforcement learning kan worden opgeschaald — en besloot dat experiment in het openbaar uit te voeren in plaats van een resultaat aan te kondigen.

Het dashboard is ongewoon openhartig voor een leveranciersartefact. Het somt zijn eigen fouten op in een meldingenfeed: een Pro-herstart bij stap 17, veroorzaakt door een GPU-out-of-memory-fout als gevolg van onbalans in de expertbelasting, die het team naar eigen zeggen heeft verholpen door de trainingsparallelisatiestrategie aan te passen; een netwerkconnectiviteitsfout tussen het Pro-trainingscluster en de beoordelingsdeployment, waardoor een herstart en de beslissing werden afgedwongen om de cyberdataset uit de aanstaande Pro-run te laten vallen na "slechte patronen in de rollout-logs"; een Flash-herstart vanaf stap 15 nadat een categorie infrastructuurfouten ongeveer drie uur onopgemerkt bleef; en een Pro-herstart door een VRAM-fout op één enkele node. Het merkt ook op dat taken die als "relatief gemakkelijk voor het huidige pro-model" werden beoordeeld, eruit werden gefilterd — een bekentenis die de meeste post-trainingrapporten achterwege laten.

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

De twee run-kaarten zijn het onderdeel dat ertoe doet voor iedereen die de timing volgt. Beide modellen zijn aangeduid als gestopt: MiMo-V2.6-Pro na 5 dagen en 7 uur kloktijd, MiMo-V2.6-Flash na 3 dagen en 11 uur, elk bij stap 30, op respectievelijk 20 september en 19 september. Pro verbruikte 75 miljard tokens en 753k samples voor zijn $2,62 mln.; Flash verbruikte 81,4 miljard tokens voor $854k. Elke stap trekt een batch van 1.568 prompts met 16 rollouts per prompt — 25.088 trajectorieën per stap, volledig asynchroon uitgevoerd.

Om het maar ronduit te zeggen: Xiaomi heeft niet gezegd of "gestopt" betekent dat de run is afgerond, gepauzeerd of dat er een checkpoint is gemaakt. Een kaart met de status "gestopt" is geen melding van voltooiing, en niemand buiten het team weet welke van de drie het is.

Wat is bevestigd, en wat niet

De 72.57 is geen gerucht. Het staat gedrukt op Xiaomi's dashboard, in een grafiek met het label DeepSWE v1.1, mini-swe-agent, avg@3, naast de oranje curve van de Pro-run. De 65.68 van het Flash-model staat op dezelfde grafiek. Het cijfer verschijnt ook — als 62.24 en later 65.97 — in eerdere snapshots van hetzelfde paneel, en dat is wat de curve zijn vorm geeft: een gestage klim over 30 stappen in plaats van één gelukkige evaluatie.

Wat alleen gerapporteerd is, is het startpunt. De bewering die op 21 september op X circuleert, afkomstig van het account @nrehiew_, is dat het Pro-model op DeepSWE "van 58.41 naar 72.57" ging en dat de runs zijn voltooid. Het eindpunt komt exact overeen met het dashboard van de leverancier. De baseline van 58.41 is de lezing van dat account van waar de curve begint — het meest linkse Pro-punt in de grafiek zit inderdaad in de hoge 50 — en Xiaomi heeft geen cijfer voor stap 1 gepubliceerd. De bewering over voltooiing is eveneens een interpretatie van twee kaarten die als gestopt zijn gemarkeerd, wat een redelijke lezing is en geen verklaring van Xiaomi. Behandel de verbetering van 14 punten als qua richting solide en numeriek bij benadering.

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

Er is nog één onderscheid dat de berichtgeving heeft overgeslagen, en dat is precies het onderscheid dat bepaalt hoeveel het getal waard is. De benchmarkpanelen van het dashboard zijn Xiaomi's eigen evaluaties: het bedrijf liet de harness op zijn eigen checkpoints draaien en publiceerde de resultaten. De harness is dezelfde als die de openbare ranglijst gebruikt — mini-swe-agent, DeepSWE v1.1 — waardoor het cijfer beter vergelijkbaar is dan dat van een zelfontwikkelde benchmark van een leverancier zou zijn. Maar een zelf uitgevoerde evaluatie is geen vermelding op de ranglijst, en 72,57 staat niet op de ranglijst van Datacurve, omdat niemand het heeft ingediend.

Het plafond van 74% is krapper dan de kop doet vermoeden

Dat brengt de vergelijking scherp in beeld. De DeepSWE v1.1-ranglijst van Datacurve, voor het laatst bijgewerkt op 3 september 2026, vermeldt 113 taken verdeeld over 91 repositories in vijf talen, en de drie beste configuraties staan gelijk op 74% Pass@1: GPT-6 Astra met xhigh reasoning effort, Gemini 3.8 Flash met high, en Claude Opus 5 met max. Interessant zijn de getallen die naast die scores staan.

• Betrouwbaarheid — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. Op dezelfde ranglijst staat GPT-5.6 Sol op 73% ±3 en staan GLM-5.3 en Kimi K3 op 69%. De intervallen overlappen elkaar ruim voorbij de tweede decimaal.

• Kosten per taak — Gemini 3.8 Flash kost gemiddeld $2,36, GPT-6 Astra $6,52 en Claude Opus 5 $11,84. De eigen grafiek van de ranglijst markeert Gemini 3.8 Flash als de meest efficiënte configuratie op de ranglijst, en de verhouding tussen die drie is ongeveer vijf tegen één voor een slaagpercentage dat de benchmark niet kan onderscheiden.

• Stappen — Gemini 3.8 Flash had gemiddeld 166 agentstappen per taak nodig, Claude Opus 5 99, GPT-6 Astra 29. De gelijke score verbergt drie zeer verschillende werkstijlen, en de goedkope is degene die het hardst werkt.

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

Dus wanneer de gerapporteerde 72,57 wordt beschreven als "de top van de ranglijst naderen", is de nauwkeurige versie beperkter en minder dramatisch. Het ligt binnen ongeveer anderhalve punt van een driewegsgelijkspel waarvan de leden niet van elkaar te onderscheiden zijn door de foutmarges van de benchmark zelf. Het is een sterk resultaat voor een model dat zich nog in post-training bevindt, geproduceerd door de leverancier in plaats van door de beheerders van de benchmark, op een ranglijst waarvoor het model niet is ingediend. De laatste update van de ranglijst dateert volledig van vóór Xiaomi's run, daarom staat er nog niets van MiMo op.

Waarom Xiaomi in het openbaar traint

De transparantie is niet toevallig. De laatste open-weightrelease van Xiaomi was Xiaomi MiMo-V2.5 en Xiaomi MiMo-V2.5-Pro eind april, beide onder de MIT-licentie — commercieel bruikbaar, fine-tunebaar, herdistribueerbaar. MiMo-V2.5-Pro is een mixture-of-experts-model met 1,02 biljoen parameters en 42 miljard actieve parameters, een hybride-attentiearchitectuur en een contextvenster van 1M tokens, en het lanceringsmateriaal maakte de agentische claims expliciet: een compiler die vanaf nul in Rust is geschreven gedurende honderden tool calls, een desktopapplicatie van achtduizend regels die in elf uur agentwerk is gebouwd.

Het streamen van de post-training van de volgende generatie is een ander soort bewering. Een lab dat zijn rewardcurves, zijn sandboxaantallen en zijn GPU-fouten in realtime publiceert, vraagt om op proces te worden beoordeeld in plaats van op een lanceringspresentatie, en het signaleert een tijdlijn. Luo Fuli heeft gezegd dat de technische details van het RL-werk de komende weken stukje bij stukje open source zullen worden gemaakt. Dat is het dichtst in de buurt van een planning die wie dan ook heeft geboden: eerst de methodologie, later het model.

Het past ook in een patroon dat Xiaomi eerder heeft gebruikt, waarbij een model onder een andere naam in het openbaar verschijnt voordat het bedrijf er aanspraak op maakt. Het bedrijf heeft de gewoonte om in stilte te trainen, openlijk te testen en vervolgens inclusief de gewichten uit te brengen.

Wat je vandaag kunt uitvoeren

Niets in de MiMo-V2.6-familie. Als je nu een Xiaomi MiMo-model wilt, is de V2.5-generatie wat er bestaat — open gewichten via Xiaomi's eigen kanalen en verschillende platforms van derden, met gepubliceerde modelkaarten en prijzen. Er is geen MiMo-V2.6 API, geen modelidentificatie en geen prijslijst, en elke pagina die een MiMo-V2.6-identificatie of tarief per token citeert, vult een leegte in die Xiaomi heeft achtergelaten. De strings `mimo-v2.6-pro` en `mimo-v2.6-flash` op het dashboard zijn namen van trainingsjobs, geen gepubliceerde endpoints.

De andere praktische consequentie is wat je ondertussen kunt doen. Als MiMo-V2.6-Pro voor jou interessant is omdat het een goedkopere manier zou kunnen zijn om codeprestaties op frontend-niveau te bereiken, dan zijn de configuraties waarmee het wordt vergeleken al aanroepbaar, en het leaderboard zegt dat de goedkope variant concurrerend is: Gemini 3.8 Flash evenaart het hoogste slaagpercentage met $2,36 per taak en wordt aangemerkt als de meest efficiënte configuratie van het board. Gemini 3.8 Flash, Claude Opus 5 en GPT-6 Astra zijn allemaal bereikbaar via één OrcaRouter-API-sleutel tegen de lijstprijs van de provider, met 0% markup die wordt doorgegeven — dus een prijswijziging van een leverancier is bij ons dezelfde dag live in plaats van bij de volgende factureringscyclus — met failover per model in plaats van per leverancier. En wanneer een lab een model zoals dit opent, is het routeren ervan achter dezelfde sleutel de manier met de minste verplichtingen om het te evalueren: je kunt het voor echt verkeer zetten zonder een productiepad te verwedden op een checkpoint dat niemand heeft gekarakteriseerd.

Wat zou dit verhaal daadwerkelijk veranderen?

Vier signalen, ruwweg in de volgorde van de mate waarin ze uitsluitsel zouden geven:

• Gewichten op Hugging Face onder een vermelde licentie, wat de manier is waarop de V2.5-generatie verscheen en het sterkste bewijs dat de RL-run een model opleverde dat uitgebracht kon worden in plaats van een experiment dat eindigde.

• Een modelkaart met parameteraantallen, contextlengte en architectuur — geen van de cijfers van V2.6 is openbaar, en het dashboard toont ze niet. Aannemen dat V2.6-Pro de 1.02T/42B-vorm van V2.5-Pro erft, zou een gok zijn.

• Een API-identifier en een prijslijst, het moment waarop het DeepSWE-cijfer een aankoopbeslissing wordt in plaats van een kijksport.

• Een inzending voor Datacurve's DeepSWE-board, die MiMo-V2.6-Pro in dezelfde tabel en onder dezelfde foutbalken zou plaatsen als de modellen waarmee het wordt vergeleken. Een door de leverancier uitgevoerde evaluatie en een leaderboard-inzending zijn niet dezelfde bewering, en het verschil daartussen is precies één rij van die tabel.

Tot die tijd is de eerlijke samenvatting dat Xiaomi de meest transparante post-training-run heeft laten zien die een groot lab heeft gepubliceerd, op twee modellen die het niet heeft uitgebracht, met één zelfgerapporteerd benchmarkcijfer dat dicht bij — maar niet in — de top van het klassement uitkomt. De methodologische uiteenzetting wordt de komende weken beloofd. De releasedatum wordt helemaal niet beloofd.