
Xiaomi MiMo-V2.6-Flash is uit: een open model van 309B dat je zelf host
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiMo-V2.6-Flash was op 21 september 2026 om 15:39 UTC niet langer een trainingsjob, toen het MiMo-team van Xiaomi het checkpoint publiceerde als XiaomiMiMo/MiMo-V2.6-Flash-RL op Hugging Face — zonder toegangsbeperking, MIT-gelicenseerd, technisch rapport bijgevoegd, 65 gewichtsshardes in de index. XiaomiMiMo/MiMo-V2.6-Pro-RL volgde achttien seconden later. Een week eerder waren beide modellen twee kaarten met "gestopt" erop op een openbaar trainingsdashboard, en de veelvuldig herhaalde bewering erover was dat er geen gewichten bestonden. Nu zijn het bestanden die iedereen kan downloaden en serveren. Dat is een echte verandering in wat je met het model kunt doen, wat iets anders is dan een aankondiging erover.
Begin met de tijdstempel, want de release kwam zonder de gebruikelijke leverancierschoreografie. Xiaomi's eigen blog, gecontroleerd op 22 september, toont de lancering van MiMo-V2-Flash in december 2025 nog steeds als het nieuwste bericht. Er is geen lanceringsessay voor V2.6, geen gepubliceerde prijslijst voor de nieuwe generatie, en geen aanroepbare modelidentifier die Xiaomi voor een van beide checkpoints heeft aangekondigd. Wat bestaat is een repository, een technisch rapport, deployment-recepten en een reeks door de leverancier uitgevoerde benchmarktabellen — plus een vijandig klein detail in de modelkaart dat alleen van belang is voor mensen die van plan zijn het ding daadwerkelijk te laden.
De twee kaarten die je kunt vasthouden
Beide checkpoints zijn native omnimodaal met een geclaimde 1M-tokencontext, en beide hebben de MIT-licentie — commercieel bruikbaar, fine-tunebaar, herdistribueerbaar, geen omzetdrempel en geen onderzoeksclausule. De kaart noemt Flash de "efficiëntiegebalanceerde checkpoint" van de serie en Pro het vlaggenschip; het interessante deel is hoe de twee van elkaar verschillen zodra je naar de configuraties kijkt in plaats van naar de marketingzin.
• Aantal parameters — MiMo-V2.6-Flash 309B totaal met 15B geactiveerd per token; MiMo-V2.6-Pro 1,02T totaal met 42B geactiveerd. Beide sparse mixture-of-experts.
Backbone — Flash is 48 lagen (39 sliding-window, 9 global attention), verborgen grootte 4096, 256 gerouteerde experts waarvan 8 geactiveerd, een sliding-window van 128 tokens, geen gedeelde experts. Het eerste blok is global attention met een dense feed-forward netwerk; alles daarna wordt afgewisseld.
• Encoders — een MiMo ViT met 681M parameters (28 lagen, 24 sliding-window plus 4 volledige), een audiotokenizer van 308M en een audiopatch-encoder van 127M, zodat tekst, beeld, video en audio allemaal in hetzelfde model binnenkomen in plaats van via drie aan elkaar geschroefde pijplijnen.
• Speculatieve decoding — een vijf-laags multi-tokenvoorspellings-drafter, in DFlash-stijl, die in de kaart wordt beschreven als het voorspellen van zeven tokens vooruit per forward pass voor parallelle verificatie.
• Opslag — de gepubliceerde index meldt 172,9 GB aan gewichtsdata over 65 shards, in FP8 (e4m3) met een dynamisch activatieschema. Lees dat als ruwweg negen bytes per parameter: Xiaomi heeft het grote model geleverd, niet een kwantisatie op laptopformaat ervan.
Drie getallen die niet overeenkomen
Dit is de moeite waard om ronduit te zeggen, want ze beïnvloeden alle drie een uitrolbeslissing in plaats van een benchmarkargument, en geen ervan is kwaadwillig — ze lijken op documentatiedrift tussen het verslag, de repositorypagina en de meegeleverde bestanden.
De eerste is de speculatieve decoder. De modelsamenvatting zegt dat de MTP-kop een vijf-laags drafter is die bij elke doorgang zeven tokens voorspelt. De config.json in dezelfde repository stelt num_nextn_predict_layers in op 3. Beide getallen kunnen niet hetzelfde artefact beschrijven, en de config is degene die de runtime zal lezen. Als u geheugen aan het dimensioneren bent voor speculatieve decoding, vertrouw dan op de config en verifieer na het laden.
De tweede is subtieler en is helemaal geen fout, maar veeleer een naamgevingsconventie die als een fout leest. De repository heet MiMo-V2.6-Flash-RL, wat de veronderstelling wekt dat het een reinforcement-learning-adapter is in plaats van een model. Het ís het model. Het achtervoegsel -RL duidt de post-training-afstamming aan — deze checkpoint is de output van de mixed-RL-run die Xiaomi streamde, niet een LoRA die bovenop een of andere base zit. De gewichtsindex bevestigt het: tienduizenden tensoren die de volledige backbone, de vision-encoder, de audio-stack en de drafter bestrijken.
De derde is degene die je als eerste tegenkomt als je hardware dimensioneert op basis van de repositorypagina in plaats van de kaart. Het Safetensors-blok op die pagina vermeldt 159B parameters. Dat is geen van de twee getallen op de kaart — niet het totaal van 309B, niet de 15B actief — en het is het cijfer dat een capaciteitsplanner het meest waarschijnlijk zal overnemen, omdat het naast de downloadknop staat. Xiaomi heeft het verschil niet uitgelegd en wij kunnen het niet van buitenaf beslechten; de waarschijnlijkste lezing is een telconventie over gekwantiseerde tensors in plaats van een ander model. De veilige zet is om in plaats daarvan op basis van de gepubliceerde gewichtgegevens te dimensioneren: 172,9 GB FP8 over 65 shards is een getal dat hoe dan ook in VRAM betaald moet worden, ongeacht hoe de parameters worden geteld.
Wat de benchmarks zeggen, en wie ze heeft uitgevoerd
Elk cijfer hieronder komt uit Xiaomi's eigen evaluatietabellen in de modelkaart. Niets ervan is onafhankelijk gereproduceerd, niets ervan staat op een openbaar leaderboard, en de vergelijkingskolommen zijn de eigen runs van de leverancier met dezelfde harnassen tegen de modellen van andere bedrijven. Beschouw de vorm van de resultaten als informatief en de decimalen als decoratie.
• Codeagent — DeepSWE v1.1: Flash 67.9, Pro 71.9, tegenover Claude Opus 5 op 74.0, GPT-5.6 Sol op 73.0 en Claude Fable 5 op 70.0. Op Terminal Bench 2.1 komt Flash uit op 87.6 tegenover de 89.1 van Opus 5 — een verschil dat zo klein is dat mogelijk de harness, en niet het model, de doorslag geeft.
• Algemene agent — AutomationBench v1.0.6 zet Flash op 52,3, hoger dan zowel GPT-5.6 Sol (45,8) als Claude Opus 5 (50,3) in Xiaomi's run. Toolathlon-Verified: Flash 73,6, Pro 76,9, Opus 5 80,6.
• Cybersecurity — de meest scheefgetrokken kolom in de tabel. CyberGym: Flash 95,1, boven zijn eigen grotere broer op 94,0, met MiMo-V2.5-Pro op 40,0. Dan valt de bodem eruit: ExploitGym 6,0 voor Flash tegen 22,1 voor Opus 5, ExploitBench 25,3 tegen 70,0, SEC Bench Pro 47,5 tegen 79,1 voor GPT-5.6 Sol.
• Visuele agent — MiMo VisualCoding: Flash 71,5, Pro 72,3, Opus 5 70,0.
Eén getal is het waard om eruit te lichten, want het is precies het soort ding dat een lanceringsbericht meestal verbergt. Xiaomi's RL-dashboard publiceerde Flash op 65.68 op DeepSWE v1.1 — en de modelkaart toont nu 67.9 voor dezelfde benchmark op het voltooide checkpoint. Dat zijn niet dezelfde metingen. Het dashboardcijfer was gelabeld als mini-swe-agent, avg@3, op een trainingsmomentopname; de tabel op de kaart is de offline-evaluatie van de vrijgegeven gewichten door de leverancier. Het verschil van twee punten is de winst van het laatste deel van de run plus wat er ook veranderd is in de evaluatieopstelling, en niemand buiten Xiaomi kan momenteel de twee scheiden. Als je sinds vorige week 65.68 hebt geciteerd, is dat nu een verouderd getal voor een ander artefact.

Wat het kost om het daadwerkelijk te draaien
Open gewichten zijn een licentie, geen rekening, en dit is waar de release minder feestelijk wordt. De deploymentsectie van de kaart zelf raadt SGLang aan (tensor parallel 16, data parallel 2, met het EAGLE-achtige meerlaagse speculatieve pad ingeschakeld) of een vLLM-recept bij tensor parallel 8, en merkt op dat stabiele vLLM achter kan lopen op de architectuur. Dat is een multi-node-servingtaak voor een 309B-model waarvan de gewichten ongeveer 173 GB innemen voordat je KV-cache voor een context van 1M tokens toevoegt. Aanbevolen sampling is temperatuur 1.0, top_p 0.95.
Dus de eerlijke framing van "open source" hier is: Xiaomi heeft de licentiebarrière weggehaald en de hardwarebarrière precies waar die was gelaten. Het fine-tunen van Flash op je eigen traces is nu legaal en mogelijk; het op iets kleiners dan een serieuze GPU-node doen is dat niet. Dat is een reëel en ander aanbod dan een gehoste endpoint, en daarom concurreren de twee manieren om deze generatie te gebruiken niet — ze dekken verschillende budgetten.
Als je de mogelijkheid wilt zonder de node, vormen de modellen waartegen Xiaomi in die tabel benchmarkt het praktische alternatief: GPT-5.6 Sol, Claude Opus 5 en Claude Fable 5 zijn vandaag allemaal aanroepbaar, en je krijgt ze met één API-sleutel tegen de lijstprijs van de provider, met 0% markup doorgegeven via OrcaRouter, dus de beslissing die je eigenlijk neemt is "een node kopen" versus "de aanroepen meten". Als je wilt zien hoe de aanroepbare tier presteert op dezelfde codingtaken voordat je een keuze maakt, is het codingboard sneller te lezen dan de leverancierstabel. Wat je vandaag op geen enkele router kunt doen, is MiMo-V2.6-Flash zelf aanroepen — wij routeren geen enkel Xiaomi-model, en de beschikbaarheidsregel in de eigen kaart van Xiaomi verwijst naar de eigen kanalen van Xiaomi: het MiMo API-platform, AI Studio, MiMo Code en de desktop-app.

De vraag over de prijsstelling is nog steeds open.
Xiaomi heeft geen tarief per token gepubliceerd voor MiMo-V2.6-Flash. Berichtgeving over de lancering zegt dat de serie de API-prijzen van MiMo-V2.5 zal behouden, en dat is een bewering in de pers, geen prijslijst van de leverancier — de gepubliceerde buitenlandse tarieven van de V2.5-generatie lagen rond een tiende dollar per miljoen invoertokens, waarbij gecachte invoer een orde van grootte goedkoper was, maar niets op Xiaomi's site bevestigt dat de nieuwe checkpoints deze overnemen. Totdat er een prijslijst verschijnt, is elk cijfer dat je voor een MiMo-V2.6-endpoint ziet iemands gevolgtrekking.
Er ontbreken nog twee andere dingen, en beide staan op Xiaomi's eigen to-dolijst, niet op die van iemand anders. Luo Fuli's verklaring tijdens de RL-livestream was dat de trainingsomgevingen en de RL-code open source zouden worden gemaakt, en het lanceringsmateriaal herhaalt die toezegging; de repositories leveren momenteel gewichten, een technisch rapport en deploymentinstructies, niet de trainingsstack. En er is geen onafhankelijke evaluatie: geen inzending voor het leaderboard, geen herrun door derden van de DeepSWE- of CyberGym-kolommen. Dat is het gat dat er het meest toe doet voor iedereen die beslist of een 309B-model met een actief budget van 15B een node waard is.
Wat zou het beeld veranderen?
Drie signalen zijn het volgen waard, ruwweg in de volgorde van hoeveel ze een beslissing zouden beïnvloeden. Een gepubliceerde prijslijst verandert dit van een selfhostingproject in een regelpost die je kunt vergelijken met de gehoste frontier. Een run door een derde partij op dezelfde testharnassen — DeepSWE of Terminal Bench, ingediend in plaats van zelfgerapporteerd — zou beslechten of de 67.9 een echte positie is of een gunstige configuratie. En de RL-omgevingen, als ze er komen, zouden voor de meeste teams het interessantere artefact zijn, omdat ze precies zijn wat je nodig hebt om de zelfverbeteringslus op je eigen data te reproduceren.
Tot dan toe is de praktische interpretatie van deze release beperkt en duidelijk. MiMo-V2.6-Flash is een legitiem open-weight, MIT-gelicentieerd, omnimodaal agentmodel van een omvang die een cluster veronderstelt — en het is het eerste checkpoint in de MiMo-V2.6-generatie dat je in handen kunt houden, wat vorige week nog niet over dit model gezegd kon worden.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
