Ett hero-titelkort med texten 'Xiaomi MiMo-V2.6-Flash har släppts' ovanför undertexten '309B öppna vikter, MIT-licens, 1M-token-kontext – publicerad 21 september 2026', med fyra pillerformade badges: '309B totalt / 15B aktiva', '173 GB FP8-vikter', '1M-token-kontext' och 'Teknisk rapport ingår'.
Guides & Insights

Xiaomi MiMo-V2.6-Flash har släppts: en öppen modell på 309B som du kör själv

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MiMo-V2.6-Flash slutade vara ett träningsjobb den 21 september 2026 kl. 15:39 UTC, när Xiaomis MiMo-team publicerade checkpointen som XiaomiMiMo/MiMo-V2.6-Flash-RL på Hugging Face – utan åtkomstbegränsning, MIT-licensierad, med teknisk rapport bifogad, 65 viktshardar i indexet. XiaomiMiMo/MiMo-V2.6-Pro-RL följde arton sekunder senare. En vecka tidigare var båda modellerna två kort märkta "stoppade" på en offentlig träningsdashboard, och den allmänt upprepade formuleringen om dem var att inga vikter fanns. Nu är de filer som vem som helst kan ladda ner och köra. Det är en verklig förändring av vad man kan göra med modellen, vilket är en annan sak än ett tillkännagivande om en.

Börja med tidsstämpeln eftersom lanseringen kom utan den vanliga leverantörskoreografin. Xiaomis egen blogg, kontrollerad den 22 september, visar fortfarande lanseringen av MiMo-V2-Flash i december 2025 som sitt senaste inlägg. Det finns ingen lanseringsessä för V2.6, ingen publicerad prislista för den nya generationen och ingen anropbar modellidentifierare som Xiaomi har tillkännagivit för någon av kontrollpunkterna. Det som finns är ett kodförråd, en teknisk rapport, distributionsrecept och en uppsättning benchmarktabeller körda av leverantören – plus en fientlig liten detalj i modellkortet som bara spelar roll för dem som planerar att faktiskt läsa in saken.

De två korten du kan hålla

Båda checkpointarna är nativt omnimodala med en påstådd 1M-tokenkontext, och båda har MIT-licensen — kommersiellt användbara, finjusterbara, redistribuerbara, ingen intäktsgräns och ingen forskningsklausul. Kortet kallar Flash för seriens "effektivitetsbalanserade checkpoint" och Pro för flaggskeppet; det intressanta är hur de två skiljer sig åt när man tittar på konfigurationerna snarare än på marknadsföringsmeningen.

Antal parametrar – MiMo-V2.6-Flash 309B totalt med 15B aktiverade per token; MiMo-V2.6-Pro 1,02T totalt med 42B aktiverade. Båda är glesa mixture-of-experts-modeller.

• Backbone — Flash är 48 lager (39 med glidfönster, 9 med global uppmärksamhet), dold storlek 4096, 256 routade experter med 8 aktiverade, ett glidfönster på 128 token, inga delade experter. Det första blocket är global uppmärksamhet med ett tätt feed-forward-nätverk; allt efter det varvas.

• Kodare — en 681M-parameters MiMo ViT (28 lager, 24 med glidande fönster plus 4 fulla), en 308M ljudtokeniserare och en 127M ljudpatchkodare, så att text, bild, video och ljud alla går in i samma modell i stället för tre ihopbultade pipelines.

• Spekulativ avkodning – en utkastare för multi-token-prediktion med fem lager, i DFlash-stil, som i kortet beskrivs förutsäga sju token framåt per framåtpassning för parallell verifiering.

• Lagring — det publicerade indexet rapporterar 172,9 GB viktdata över 65 shards, i FP8 (e4m3) med ett dynamiskt aktiveringsschema. Tolka det som ungefär nio byte per parameter: Xiaomi levererade den stora modellen, inte en laptop-anpassad kvantisering av den.

Tre siffror som inte stämmer överens

Det här är värt att säga rakt ut, för alla tre påverkar ett driftsättningsbeslut snarare än ett benchmark-argument, och inget av dem är illasinnat – de ser ut som dokumentationsdrift mellan redogörelsen, reposidan och de medföljande filerna.

Den första är den spekulativa avkodaren. Modellsammanfattningen säger att MTP-huvudet är en utkastare med fem lager som förutsäger sju token per pass. config.json i samma repositorium anger num_nextn_predict_layers till 3. Båda siffrorna kan inte beskriva samma artefakt, och det är konfigurationen som körtiden kommer att läsa. Om du dimensionerar minne för spekulativ avkodning, lita på konfigurationen och verifiera efter inläsning.

Den andra är subtilare och är inte ett fel alls, utan snarare en namnkonvention som verkar vara ett. Repositoriet heter MiMo-V2.6-Flash-RL, vilket inbjuder till antagandet att det är en adapter för förstärkningsinlärning snarare än en modell. Det är modellen. Suffixet -RL markerar härkomsten från efterträningen – denna checkpoint är resultatet av den blandade RL-körningen som Xiaomi streamade, inte en LoRA som ligger ovanpå någon annan bas. Viktsindexet bekräftar det: tiotusentals tensorer som täcker hela stommen, visionskodaren, ljudstacken och draftaren.

Den tredje är den du stöter på först om du dimensionerar hårdvara från repositorie-sidan i stället för från kortet. Safetensors-blocket på den sidan anger 159B parametrar. Det är inget av kortets två tal – varken totalt 309B eller 15B aktiva – och det är den siffra som en kapacitetsplanerare är mest benägen att kopiera, eftersom den står bredvid nedladdningsknappen. Xiaomi har inte förklarat skillnaden och vi kan inte avgöra den utifrån; den mest sannolika tolkningen är en räkningskonvention för kvantiserade tensorer snarare än en annan modell. Det säkra draget är i stället att dimensionera utifrån de publicerade viktdata: 172,9 GB FP8 över 65 shards är en siffra som måste betalas i VRAM oavsett hur parametrarna räknas.

Vad benchmarkarna säger, och vem som körde dem

Varje siffra nedan kommer från Xiaomis egna utvärderingstabeller i modellkortet. Inget av det har oberoende reproducerats, inget av det förekommer på en offentlig resultattavla, och jämförelsekolumnerna är leverantörens egna körningar av samma utvärderingsramverk mot andra företags modeller. Betrakta resultatens form som informativ och decimalerna som dekoration.

• Kodagent — DeepSWE v1.1: Flash 67,9, Pro 71,9, mot Claude Opus 5 på 74,0, GPT-5.6 Sol på 73,0 och Claude Fable 5 på 70,0. På Terminal Bench 2.1 landar Flash på 87,6 mot Opus 5:s 89,1 — en skillnad så liten att det kan vara testramverket, inte modellen, som avgör den.

• Allmän agent — AutomationBench v1.0.6 placerar Flash på 52,3, högre än både GPT-5.6 Sol (45,8) och Claude Opus 5 (50,3) i Xiaomis körning. Toolathlon-Verified: Flash 73,6, Pro 76,9, Opus 5 80,6.

• Cybersäkerhet — den mest obalanserade kolumnen i tabellen. CyberGym: Flash 95,1, högre än sin egen större syskonmodell på 94,0, med MiMo-V2.5-Pro på 40,0. Sedan faller botten ur: ExploitGym 6,0 för Flash mot 22,1 för Opus 5, ExploitBench 25,3 mot 70,0, SEC Bench Pro 47,5 mot 79,1 för GPT-5.6 Sol.

• Visuell agent — MiMo VisualCoding: Flash 71,5, Pro 72,3, Opus 5 70,0.

Ett nummer är värt att lyfta fram eftersom det är den typ av sak som ett lanseringsinlägg brukar dölja. Xiaomis RL-dashboard publicerade Flash med 65,68 på DeepSWE v1.1 — och modellkortet anger nu 67,9 för samma benchmark på den färdiga checkpointen. Det är inte samma mätning. Siffran i instrumentpanelen märktes mini-swe-agent, avg@3, på en träningsögonblicksbild; kortets tabell är leverantörens offlineutvärdering av de släppta vikterna. Skillnaden på två punkter är vinsten från den sista delen av körningen plus allt som förändrades i utvärderingsupplägget, och ingen utanför Xiaomi kan för närvarande skilja de två åt. Om du har citerat 65,68 sedan förra veckan är det nu ett inaktuellt nummer för en annan artefakt.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Flash-RL repository page on Hugging Face, showing the MIT licence tag, the Safetensors block reporting 'Model size 159B params' and 'This model isn't deployed by any Inference Provider', and the repository file listing that includes the technical report and the weight shards.

Vad det faktiskt kostar att driva det

Öppna vikter är en licens, inte en räkning, och det är här släppet blir mindre festligt. Kortets eget driftsättningsavsnitt rekommenderar SGLang (tensor-parallellism 16, dataparallellism 2, med den EAGLE-liknande flerlagers spekulativa vägen aktiverad) eller ett vLLM-recept vid tensor-parallellism 8, och noterar att stabil vLLM kan släpa efter arkitekturen. Det är ett flernodigt serveringsjobb för en 309B-modell vars vikter upptar cirka 173 GB innan man lägger till KV-cache för en kontext på 1M tokens. Rekommenderad sampling är temperature 1.0, top_p 0.95.

Så den ärliga formuleringen av "öppen källkod" här är: Xiaomi tog bort licensbarriären och lämnade hårdvarubarriären precis där den var. Att finjustera Flash på dina egna traces är nu lagligt och möjligt; att göra det på något mindre än en seriös GPU-nod är det inte. Det är ett verkligt och annorlunda erbjudande jämfört med en hostad endpoint, och det är därför de två sätten att använda den här generationen inte konkurrerar — de täcker olika budgetar.

Om du vill ha kapaciteten utan noden är modellerna som Xiaomi jämför mot i den tabellen det praktiska alternativet: GPT-5.6 Sol, Claude Opus 5 och Claude Fable 5 går alla att anropa idag, och de är en API-nyckel till leverantörens listpris med 0 % påslag som skickas vidare på OrcaRouter, så beslutet du faktiskt fattar är "köpa en nod" kontra "mäta anropen". Om du vill se hur den anropbara nivån står sig i samma kodningsuppgifter innan du bestämmer dig för något av alternativen, är kodningstavlan en snabbare läsning än leverantörens tabell. Det du inte kan göra på någon router idag är att anropa MiMo-V2.6-Flash själv – vi dirigerar ingen Xiaomi-modell, och tillgänglighetsraden i Xiaomis eget kort pekar på Xiaomis egna kanaler: MiMo API-plattformen, AI Studio, MiMo Code och skrivbordsappen.

A single-column scoreboard headed 'MiMo-V2.6-Flash - the numbers that decide a deployment', listing 309B total and 15B activated parameters, a 1M-token context, text/image/video/audio modalities, the MIT licence with no revenue cap, 172.9 GB of FP8 weights across 65 shards, DeepSWE v1.1 at 67.9 against 74.0 for Claude Opus 5, CyberGym at 95.1, and SGLang tp16/dp2 or vLLM tp8 serving with no vendor price published.

Prisfrågan är fortfarande öppen.

Xiaomi har inte publicerat någon taxa per token för MiMo-V2.6-Flash. Rapporteringen om lanseringen säger att serien behåller MiMo-V2.5:s API-prissättning, och det är ett påstående i pressen snarare än ett prisblad från leverantören – de publicerade utländska priserna för V2.5-generationen låg runt en tiondels dollar per miljon indatatokens, med cachad indata en storleksordning billigare, men inget på Xiaomis webbplats bekräftar att de nya checkpoints ärver dem. Tills en prislista dyker upp är varje siffra du ser för en MiMo-V2.6-endpoint någons slutledning.

Två andra saker saknas fortfarande, och båda står på Xiaomis egen att göra-lista snarare än någon annans. Luo Fulis uttalande under RL-livestreamen var att träningsmiljöerna och RL-koden skulle göras tillgängliga som öppen källkod, och lanseringsmaterialet upprepar det löftet; reporna innehåller för närvarande vikter, en teknisk rapport och driftsättningsinstruktioner, inte träningsstacken. Och det finns ingen oberoende utvärdering: ingen inlämning till resultattavlan, ingen tredjepartskörning av DeepSWE- eller CyberGym-kolumnerna. Det är gapet som betyder mest för den som ska avgöra om en 309B-modell med en aktiv budget på 15B är värd en nod.

Vad skulle förändra bilden

Tre signaler är värda att hålla ögonen på, i grov ordning efter hur mycket de skulle påverka ett beslut. En publicerad prislista förvandlar detta från ett self-hosting-projekt till en post du kan jämföra mot den värdbaserade frontlinjen. En tredjepartskörning på samma testramverk – DeepSWE eller Terminal Bench, inlämnad i stället för självrapporterad – skulle avgöra om 67.9 är en verklig position eller en gynnsam konfiguration. Och RL-miljöerna, om de blir verklighet, skulle vara den mer intressanta artefakten för de flesta team, eftersom de är vad du skulle behöva för att återskapa självförbättringsslingan på dina egna data.

Fram till dess är den praktiska tolkningen av detta släpp snäv och tydlig. MiMo-V2.6-Flash är en legitim omnimodal agentmodell med öppna vikter och MIT-licens, i en storlek som förutsätter ett kluster — och det är den första checkpointen i MiMo-V2.6-generationen som du kan hålla i dina händer, vilket är mer än vad som kunde sägas om den förra veckan.

A screenshot of Xiaomi's MiMo blog, captured 22 September 2026, showing the site navigation and the December 16, 2025 post 'Introducing MiMo-V2-Flash' as the newest entry, with the line 'Today, we are releasing and open-sourcing MiMo-V2-Flash', the availability note listing Hugging Face, the API Platform and AI Studio, and a 'Benchmark Comparison' table with columns for SWE-Bench Verified, SWE-Bench Multilingual, Tau2-Bench, AIME25, GPQA-Diamond, HLE and Arena-Hard.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen