Scheda hero del radar modelli di OrcaRouter intitolata "MiMo-V2.6-Flash vs MiMo-V2.6", con sottotitolo "Una serie, due checkpoint e un nome che svolge un doppio ruolo", con un pannello sinistro per MiMo-V2.6-Flash che riporta 309B totali / 15B attivi, 172,9 GB di pesi FP8 e checkpoint Efficiency, un pannello destro per MiMo-V2.6-Pro che riporta 1,02T totali / 42B attivi, "il nome che la gente scrive per il flagship" e Stessa licenza MIT, e tre badge sotto che riportano Pubblicato il 21 settembre 2026, dichiarazione di contesto da 1M di token e Nessun endpoint Xiaomi da chiamare.
Guides & Insights

MiMo-V2.6-Flash vs MiMo-V2.6: una serie, due checkpoint e un nome che svolge un doppio ruolo

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Chiedi a due persone cos'è MiMo-V2.6 e potresti ottenere due modelli diversi. Il rilascio di Xiaomi di settembre 2026 è una serie con due checkpoint pubblicati — MiMo-V2.6-Flash con 309 miliardi di parametri e MiMo-V2.6-Pro da 1,02 trilioni — e il nome nudo MiMo-V2.6 viene usato sia per la famiglia sia, nella maggior parte della copertura, per il livello più alto della generazione. Quindi una pagina intitolata "MiMo-V2.6-Flash vs MiMo-V2.6" è in realtà il checkpoint dell'efficienza contrapposto al nome che le persone scrivono quando intendono il flagship. Entrambi i checkpoint sono arrivati su Hugging Face a diciotto secondi di distanza il 21 settembre 2026, entrambi hanno la licenza MIT ed entrambi sono prima di tutto download — non c'è alcun endpoint Xiaomi da chiamare. Quasi nient'altro li accomuna.

Questo conta più di quanto non farebbe di solito un cavillo sul nome, perché i due non sono una scala dimensionale su cui potrai salire più avanti. Sono addestramenti separati, con tabelle di benchmark separate, footprint di memoria separati e — come mostrano i numeri pubblicati — un paio di punti in cui il più piccolo vince nettamente.

Due checkpoint, un minuto pubblicato

I repository sono XiaomiMiMo/MiMo-V2.6-Flash-RL, creato alle 15:39:51 UTC, e XiaomiMiMo/MiMo-V2.6-Pro-RL, creato alle 15:39:33 UTC. Nessuno dei due è soggetto a restrizioni di accesso. Entrambi allegano un rapporto tecnico e una model card, ed entrambi sono descritti da Xiaomi come il prodotto di un'unica esecuzione di apprendimento per rinforzo misto che ha riunito compiti di coding, agenti generali, visivi e cybersicurezza in un'unica passata di addestramento anziché in esecuzioni separate per dominio.

• Parametri — MiMo-V2.6-Flash: 309B totali, 15B attivati per token. MiMo-V2.6-Pro: 1,02T totali, 42B attivati. Entrambi sono modelli sparse mixture-of-experts.

• Backbone — Flash ha 48 livelli, 39 a finestra scorrevole e 9 ad attenzione completa, dimensione nascosta 4096, 256 esperti instradati con 8 attivati, una finestra scorrevole di 128 token e nessun esperto condiviso. Pro applica la stessa idea di attenzione ibrida a una larghezza molto maggiore.

• Modalità — entrambi sono nativamente omnimodali, accogliendo testo, immagini, video e audio in un unico modello anziché in tre pipeline assemblate insieme. Flash dispone di un vision transformer da 681M parametri, di un audio tokenizer da 308M e di un audio patch encoder da 127M.

• Contesto — 1M token, dichiarati per entrambi, con la configurazione che supporta un massimo di 1.048.576 token di embedding di posizione.

• Licenza — MIT su entrambi, senza soglia di ricavi, senza vincoli di uso accettabile oltre a quelli abituali e senza clausola di ricerca. L'impiego commerciale, la modifica e la ridistribuzione sono tutti consentiti.

• File dei pesi — Flash pubblica 172,9 GB di dati di pesi FP8 su 65 shard. Pro ha all'incirca il triplo del numero di parametri, quindi il suo download si colloca nell'ordine del mezzo terabyte prima di qualsiasi quantizzazione che tu applichi da solo.

• Dove vengono serviti — Hugging Face, la piattaforma API di Xiaomi stessa, AI Studio, MiMo Code e l'app desktop MiMo. La scheda segnala che attualmente nessuno dei due checkpoint è distribuito da un provider di inferenza di terze parti sull'Hub stesso.

La collisione che costa hardware alle persone

La confusione in questo abbinamento non è davvero tra Flash e Pro. È tra MiMo-V2.6-Flash e il modello che l'ha preceduto.

MiMo-V2-Flash è stato rilasciato a dicembre 2025, e il post sul blog con cui Xiaomi lo annuncia descrive un modello mixture-of-experts con 309 miliardi di parametri totali, 15 miliardi attivi, uno schema di attenzione ibrido che alterna finestra scorrevole e attenzione completa, e un'aggressiva finestra scorrevole di 128 token. Confrontatelo con l'elenco puntato qui sopra. Il checkpoint del 2026 e quello del 2025 hanno la stessa configurazione di punta, la stessa dimensione della finestra scorrevole e lo stesso budget di attivazione — a nove mesi di distanza, da sessioni di addestramento diverse, con capacità diverse e una diversa tabella di benchmark.

Quindi una ricerca di "MiMo V2.6 Flash" ti restituirà tranquillamente pagine su MiMo-V2-Flash, complete di un valore di contesto di 256K e un prezzo di un decimo di dollaro per milione di token di input che appartiene al modello precedente. Se stai dimensionando un nodo, non è un errore cosmetico. Il checkpoint precedente e quello nuovo sono download diversi con ricette di serving diverse, e quello nuovo dichiara quattro volte il contesto.

C'è una seconda trappola, più silenziosa, nella denominazione. Entrambi i repository terminano con -RL, che si legge come un adattatore di apprendimento per rinforzo posto sopra qualche altro modello base. Non sono adattatori. Il suffisso indica la discendenza post-addestramento: questi sono i checkpoint completi che sono usciti dall'esecuzione RL in streaming. L'indice dei pesi lo conferma — decine di migliaia di tensori che coprono l'intera backbone, l'encoder visivo, lo stack audio e il drafter speculativo.

Cosa dice la tabella del fornitore stesso

Ogni cifra in questa sezione proviene dalle tabelle di valutazione di Xiaomi nelle due model card. Xiaomi ha eseguito gli harness sui propri checkpoint. Niente di tutto ciò è stato riprodotto al di fuori del laboratorio, niente di tutto ciò appare su una classifica pubblica, e le colonne di confronto sono le esecuzioni del fornitore stesso degli stessi harness contro i modelli di altre aziende. Tratta la classifica come informativa e i decimali come decorazione.

• Agente di programmazione — DeepSWE v1.1: Flash 67.9, Pro 71.9. Terminal Bench 2.1: Flash 87.6, Pro 89.9. ProgramBench: Flash 26.0. MiMo Code Bench: Flash 61.2.

• Agente generale — AutomationBench v1.0.6: Flash 52,3, Pro 53,1. Toolathlon-Verified: Flash 73,6, Pro 76,9. OSWorld-Verified: Flash 80,8, Pro 82,0. Agents' Last Exam: Flash 27,6. Terminal Bench 4.0: Flash 28,8.

• Sicurezza informatica — l'unica colonna in cui il modello più piccolo è in testa. CyberGym: Flash 95,1 contro il 94,0 di Pro. MiMo Cyber Bench: Flash 77,2. Poi il fondo crolla: ExploitGym 6,0, ExploitBench 25,3, SEC Bench Pro 47,5.

• Agente visuale — MiMo VisualCoding: Flash 71,5, Pro 72,3.

Scorrendo quei punti elenco, la sintesi onesta è che Pro è avanti quasi ovunque, di margini ridotti, e che i margini sono abbastanza ridotti da rientrare nel rumore di un harness autogestito. Su DeepSWE i due distano quattro punti su una scala in cui lo stesso checkpoint si è spostato di due punti tra due valutazioni di Xiaomi stessa.

Quel ultimo punto merita un paragrafo a sé, perché è la cosa più utile in entrambe le schede. La dashboard RL pubblica di Xiaomi, che ha trasmesso in streaming entrambe le esecuzioni di addestramento fino a settembre, ha pubblicato Flash a 65.68 su DeepSWE v1.1 usando un harness mini-swe-agent con media di tre. La scheda finale riporta 67.9 per i pesi rilasciati. Nel frattempo, il valore della dashboard di Pro era 72.57 e la sua scheda riporta 71.9 — è sceso. Due checkpoint della stessa esecuzione, valutati due volte, e il divario tra le due valutazioni è della stessa entità del divario tra i due modelli. Se dalla settimana scorsa stai citando i numeri della dashboard, descrivono snapshot di addestramento, non gli artefatti che scaricheresti oggi.

Scoreboard card headed 'MiMo-V2.6-Flash vs MiMo-V2.6-Pro', with paired rows for parameters (309B total / 15B active against 1.02T total / 42B active), weights on disk (172.9 GB FP8 across 65 shards against about three times Flash), DeepSWE v1.1 (67.9 against 71.9, with the RL dashboard's earlier 65.68 and 72.57 noted), CyberGym (95.1 against 94.0), independent score (None published against an Artificial Analysis Index of 46 at 134.3 output tokens per second) and price, plus a sourcing footer stating that every benchmark is Xiaomi's own run except the Pro index score.

Nessuno dei due si trova su un router

Ecco la parte che decide la maggior parte delle valutazioni reali. Xiaomi non vende nessuno dei due checkpoint: non esiste un prezzo per token pubblicato per la generazione MiMo-V2.6 sul suo sito, né un identificatore di modello richiamabile che abbia annunciato per l'uno o per l'altro. Quello che esiste invece è un download, più — solo per Pro — un singolo fornitore API che Artificial Analysis conteggia come erogatore a 0,435 $ per milione di token di input e 0,87 $ per milione di output. Si tratta di un'inserzione di un fornitore, non di un listino del venditore, e per Flash non c'è assolutamente nulla di comparabile. Le cifre che circolano su pagine di cataloghi di terze parti vanno lette allo stesso modo.

Quindi la scelta tra Flash e Pro non è una scelta tra due endpoint con metriche diverse. È una scelta tra due bollette GPU, e quella più piccola è circa un terzo di quella più grande. Questo è l'intero argomento commerciale a favore di Flash, ed è più forte di quanto suggerisca la tabella di benchmark, perché i due modelli sono a pochi punti di distanza l'uno dall'altro sui compiti per cui la maggior parte delle persone acquista.

Quello che resta è la consueta ripartizione a tre vie. Noleggiare la frontiera, possedere un modello piccolo o possederne uno grande. La colonna della frontiera è quella su cui Xiaomi basa i propri benchmark nelle sue tabelle — Claude Opus 5, GPT-5.6 Sol e Claude Fable 5 si collocano tutti qualche punto sopra Pro su DeepSWE nel confronto fornito dal venditore, e tutti e tre sono richiamabili oggi tramite una sola chiave API su OrcaRouter al prezzo di listino del fornitore, con 0% di ricarico applicato. Questo conta per la decisione specifica che hai davanti: una variazione di prezzo del fornitore ricade dalla tua parte lo stesso giorno anziché al rinnovo contrattuale successivo, così l'aritmetica tra noleggiare e possedere resta onesta man mano che i prezzi dell'hosting si muovono. Il failover automatico significa anche che un modello che stai ancora valutando non deve mai restare da solo su un percorso di produzione mentre decidi.

Quello che non puoi fare su nessun router oggi — incluso il nostro — è chiamare MiMo-V2.6-Flash o MiMo-V2.6-Pro. Non instradiamo alcun modello Xiaomi, e la riga sulla disponibilità nella scheda di Xiaomi stessa rimanda ai canali di Xiaomi: la piattaforma API MiMo, AI Studio, MiMo Code e l'app desktop.

Quale checkpoint, e quando?

Scegli MiMo-V2.6-Flash se vuoi la generazione MiMo-V2.6 e l'hardware è il vincolo determinante. Rinunci a circa quattro punti DeepSWE e a un punto o due sulla maggior parte dei benchmark per agenti rispetto al modello di punta. Ottieni un checkpoint che occupa circa un terzo della memoria, che supera Pro su CyberGym nella tabella di Xiaomi stessa e che condivide la stessa licenza, la stessa dichiarazione di contesto da 1 milione di token e la stessa multimodalità. Per un team che svolge attività di valutazione della cybersicurezza, quella colonna CyberGym non è un errore di arrotondamento.

Scegli MiMo-V2.6-Pro se il carico di lavoro è di tipo coding o agentico a lungo orizzonte e il nodo è già pagato. È il modello migliore su quasi ogni colonna, è quello che Artificial Analysis ha effettivamente misurato — un Intelligence Index di 46 sulla scala ricalibrata v4.3, primo tra i 114 modelli della sua classe open-weights, 134,3 token di output al secondo, e listato a $0,435 per milione di token in input e $0,87 per milione in output — e una misurazione indipendente vale più di una tabella fornita dal venditore quando stai pianificando la produzione.

Non prendere né l'uno né l'altro finché non hai letto i file di configurazione anziché i riassunti. La scheda di Flash descrive un drafter speculativo a cinque livelli che predice sette token per passaggio; il config.json nello stesso repository imposta num_nextn_predict_layers a 3. Il riassunto della scheda non è ciò che legge il runtime. E il blocco Safetensors sulla pagina del repository riporta 159B parametri per Flash e 524B per Pro, nessuno dei quali corrisponde al totale o al conteggio degli attivi in nessuna delle due schede del modello. Xiaomi non ha spiegato la discrepanza. Determina invece la dimensione dai dati sui pesi pubblicati, perché quello è il numero che paghi in VRAM indipendentemente da come vengono conteggiati i parametri.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence and multimodal tags, the model card heading 'Scaling Reinforcement Learning Toward Self-Improvement', a Safetensors block reporting a 159B model size, and an inference-providers panel stating that the model is not deployed by any inference provider.

Cosa lo risolverebbe

Tre cose, in ordine approssimativo di utilità. Una valutazione di terze parti sugli stessi harness — DeepSWE o Terminal Bench, inviata anziché auto-dichiarata — vi direbbe se il divario di quattro punti tra Flash e Pro è una posizione reale o una configurazione favorevole. Un listino prezzi pubblicato trasformerebbe l'intera comparazione da un progetto hardware in una voce di costo che si può mettere accanto alla frontiera ospitata. E gli ambienti RL, che Xiaomi ha detto che renderà open source, sono l'artefatto che la maggior parte dei team vorrebbe davvero, perché sono ciò di cui avreste bisogno per riprodurre il loop sulle vostre stesse tracce.

Fino a quel momento, la lettura pratica è limitata. MiMo-V2.6 è due checkpoint, non uno, e il nome nudo e crudo di solito indica quello costoso. Se oggi devi scegliere all'interno della serie, il default onesto è Flash, a meno che una colonna di benchmark a cui tieni in modo particolare non dica il contrario — e se non sei pronto ad acquistare un nodo, nessuno dei due è ancora la risposta giusta.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing an Intelligence Index of 46 on the updated scale, ranked first of 114, output speed of 134.3 tokens per second, a price of $0.435 per million input tokens and $0.87 per million output with a 99% cache discount and $0.13 cost per Intelligence Index task, a 1M-token context window, and 1.02T total with 42B active parameters under the MIT licence with weights on Hugging Face.