
MiMo-V2.6-Pro vs MiMo-V2.6-Flash: un divario di prezzo di 3 volte che due benchmark non spiegano
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Nelle tabelle di valutazione di Xiaomi stessa, MiMo-V2.6-Flash batte MiMo-V2.6-Pro. La riga è CyberGym, e il margine è 95,1 a 94,0. È una riga su quindici, ed è il motivo per cui conviene leggere con attenzione il resto di questo confronto invece di dare per scontato che il modello di punta sia sempre la risposta — perché MiMo-V2.6-Flash costa circa un terzo di quanto costa MiMo-V2.6-Pro, e sulla maggior parte delle righe i due si collocano a pochi punti di distanza l'uno dall'altro.
Entrambi i modelli sono stati pubblicati come repository Hugging Face il 21 settembre 2026, sotto licenza MIT, a diciotto secondi di distanza, come addestramenti separati anziché come pioli di un'unica scala. Xiaomi MiMo-V2.6-Pro è il livello da mille miliardi di parametri. MiMo-V2.6-Flash è il livello di efficienza. La domanda a cui questa pagina risponde è quale dei due appartenga al tuo percorso di produzione, e la risposta onesta dipende da un numero che non esiste in nessuno dei due rilasci.
Che cosa è ciascuno
• Parametri — Xiaomi MiMo-V2.6-Pro da 1,02T totali con 42B attivi per token, contro Xiaomi MiMo-V2.6-Flash da circa 309B totali con 15B attivi
• Architettura — entrambi con mixture-of-experts sparsi e input omnimodale nativo; Flash è documentato con 48 layer, 39 a finestra scorrevole e 9 ad attenzione completa, dimensione nascosta 4096, 256 esperti instradati con 8 attivi e nessun esperto condiviso, insieme a un vision transformer da 681M, un tokenizer audio da 308M e un audio patch encoder da 127M
• Contesto — 1M token su entrambi, con fino a 128.000 token di output su entrambi
• Licenza — MIT su entrambi, pesi non soggetti a gate su entrambi
• Prezzo — $0,435 in input e $0,87 in output per milione di token per Pro, contro $0,14 e $0,28 per Flash: un divario di 3,1x su entrambi i lati della scheda
• Input con cache hit — $0,0036 per milione su Pro, $0,0028 su Flash
• Spesa per l'addestramento — Xiaomi riporta circa $2,62M per la run RL di Pro e $854K per Flash, ciascuna completata in meno di sei giorni attraverso 30 passaggi di reinforcement learning e circa 750.000 traiettorie
• Punteggio indipendente dell'indice — 46 per Xiaomi MiMo-V2.6-Pro su Artificial Analysis Intelligence Index v4.3.2; nessuno pubblicato per MiMo-V2.6-Flash
Quell'ultima riga è quella da tenere a mente. Tutto ciò che sta sopra, tranne il punteggio Pro, è dichiarato da Xiaomi.
Dove il triplo del prezzo non compra quasi nulla
La Tabella 3 di Xiaomi mette i due a confronto fianco a fianco sugli harness su cui la serie è stata addestrata, e nel lavoro agentico a lungo orizzonte i margini sono risicati:
• DeepSWE v1.1 — Pro 71,9, Flash 67,9
• MiMo Code Bench — Pro 63,2, Flash 61,2
• AutomationBench v1.0.6 — Pro 53,1, Flash 52,3
• Toolathlon-Verified — Pro 76,9, Flash 73,6
• Terminal Bench 2.1 — Pro 89,9, Flash 87,6
• OSWorld-Verified — Pro 82,0, Flash 80,8
• JobBench — Pro 62,0, Flash 61,2
• MiMo Visual Coding — Pro 72,3, Flash 71,5
• CyberGym — Pro 94,0, Flash 95,1
• MiMo Cyber Bench — Pro 80,2, Flash 77,2
Scorri quella colonna e il vantaggio dell'ammiraglia è per lo più compreso tra uno e quattro punti, con una riga persa del tutto. In un flusso di lavoro in cui la differenza tra 67,9 e 71,9 è la differenza tra un'attività che si completa e un'attività che fallisce, un prezzo triplo è conveniente. In un flusso di lavoro in cui è la differenza tra due risposte accettabili, non lo è. Le tabelle dei fornitori con cifre decimali come queste invitano a una falsa precisione: nessuno al di fuori di Xiaomi le ha eseguite, e un divario di due punti su un harness valutato internamente rientra ampiamente nell'intervallo che un valutatore diverso o una politica di retry diversa può spostare.

Dove compra molto
C'è un gruppo di righe in cui il divario smette di essere una questione di arrotondamento. Ognuna di esse è lavoro di sicurezza:
• ExploitGym — Pro 17.8, Flash 6.0
• ExploitBench — Pro 47.9, Flash 25.3
• SEC Bench Pro — Pro 66.3, Flash 47.5
• Agents' Last Exam — Pro 31.6, Flash 27.6
• Terminal Bench 4.0 — Pro 34.9, Flash 28.8
Su ExploitGym il modello di punta è tre volte il modello più economico, che è lo stesso fattore del prezzo, e su SEC Bench Pro è 1,4x. Questo schema è quello che ti aspetteresti da un modello con 42B parametri attivi rispetto a uno con 15B: un compito che richiede una lunga catena di ragionamento senza credito parziale è il tipo di compito in cui la capacità extra si manifesta, e CyberGym che si trova nella direzione opposta è l'eccezione che prova che le due run hanno imparato cose diverse anziché la stessa cosa a dimensioni diverse.
Quindi la divisione corrisponde a un confine reale del carico di lavoro, non a uno di marketing. Il lavoro degli agenti ad alto volume con un criterio di successo indulgente — recupero, classificazione, modifiche di routine, chiamate che un nuovo tentativo può salvare — è territorio Flash. Il lavoro in cui una risposta sbagliata è costosa e una risposta parziale è inutile — sviluppo di exploit, revisione della sicurezza, sessioni di terminale con stato a più passaggi — è dove il livello Pro si guadagna il multiplo.
Il numero che non esiste
MiMo-V2.6-Flash non ha una pagina modello su Artificial Analysis. Il suo gemello sì. Questa asimmetria è la cosa più importante in assoluto su questa pagina, perché significa che l'unico valore misurato in modo indipendente in tutta la serie MiMo-V2.6 è il 46 accanto a Xiaomi MiMo-V2.6-Pro. Ogni numero di Flash riportato qui sopra — inclusa la riga CyberGym che vince — deriva da un harness Xiaomi, un grader Xiaomi e un'esecuzione offline Xiaomi.
Si può ragionevolmente sostenere che questo sia temporaneo: il modello ha un giorno di vita al momento in cui scriviamo e la valutazione da parte di terzi richiede tempo. Si può anche ragionevolmente sostenere che sia strutturale, dato che Flash è la fascia di volume e le fasce di volume attirano meno attenzione nel benchmarking. In ogni caso, la conseguenza pratica oggi è che non puoi confrontare Flash con nulla al di fuori della sua stessa famiglia con la stessa fiducia con cui puoi confrontare Pro. Se stai scegliendo tra Flash e un modello non Xiaomi in base al rapporto qualità-prezzo, stai confrontando un dato del fornitore con un dato misurato da qualcun altro.
Entrambe le schede modello riportano la stessa seconda avvertenza. Nessuno dei due repository è distribuito da alcun fornitore di inferenza — Hugging Face lo afferma esplicitamente su ciascuna pagina, e Artificial Analysis ha contato un solo fornitore API per Pro. Noi non ospitiamo nessuno dei due checkpoint, quindi nessuno dei due è instradabile tramite noi. La via per entrambi è la piattaforma di Xiaomi stessa e i cataloghi di terze parti che li includono.

Il prezzo che paghi in hardware, non in token.
Il prezzo per token è solo metà di quanto ti costa un checkpoint, e i due differiscono molto più nettamente su disco che sul tariffario. MiMo-V2.6-Flash pubblica 172,9 GB di pesi FP8 su 65 shard. Xiaomi MiMo-V2.6-Pro ha circa tre volte i parametri, il che colloca il suo download grezzo nell'ordine del mezzo terabyte prima di qualsiasi quantizzazione — e il suo stesso repository riporta una dimensione del modello Safetensors di 524B parametri, una cifra che non concilia né con il totale di 1,02T né con il conteggio dei 42B attivi.
Quel divario cambia la forma della decisione. Flash a 172,9 GB è un modello che un piccolo team può self-hostare su capacità noleggiata e trattare come una commodity. Pro, a circa tre volte tanto, è una decisione da cluster — la copertura attorno al lancio collocava i due run di addestramento rispettivamente a circa 4.000 e 8.000 GPU equivalenti a H200. Se il tuo motivo per guardare ai pesi aperti è che vuoi avere l'opzione di smettere di pagare per token, i due checkpoint offrono quell'opzione a scale di impegno molto diverse.
Scegliere tra loro
La regola che sopravvive alle avvertenze di cui sopra è scegliere in base alla classe di carico di lavoro anziché alla media dei benchmark. Flash per tutto ciò che saresti disposto a ritentare; Pro per tutto ciò in cui un nuovo tentativo non ti salva. Poi misura, perché nessuno dei due modelli ha un punteggio indipendente sui benchmark che ti interessano davvero.
Misurare due checkpoint fianco a fianco è il punto in cui un router fa qualcosa che un contratto per singolo modello non può fare. Mettere un livello economico sulla maggior parte del tuo traffico ed escalare solo i casi difficili a quello costoso è la stessa decisione di questa pagina, espressa come configurazione anziché come riscrittura — e quella composizione è esattamente ciò per cui esiste il livello di routing. Conta anche per il prezzo stesso: trasmettiamo il prezzo di listino del provider con 0% di markup, quindi se Xiaomi riduce la tariffa su uno dei due checkpoint, il numero dalla nostra parte cambia lo stesso giorno anziché al prossimo rinnovo del contratto. Questo vale per i modelli che trattiamo. Nello specifico per la coppia MiMo-V2.6, oggi, stai ancora acquistando direttamente da Xiaomi.
Cosa lo risolverebbe
Due cose farebbero passare questa da una questione di giudizio a una questione aritmetica. Una pagina di Artificial Analysis per MiMo-V2.6-Flash collocherebbe entrambi i checkpoint sullo stesso asse del costo per attività che attualmente pone Pro a $0,133 per attività dell'Intelligence Index, e il confronto si risolverebbe da sé. Una replica di terze parti del cluster di sicurezza — ExploitGym, ExploitBench, SEC Bench Pro — confermerebbe se il divario di 3x su quelle righe sia una proprietà del modello o una proprietà del valutatore.
Fino ad allora, la posizione difendibile è che Xiaomi MiMo-V2.6-Flash sia l'acquisto migliore per la maggior parte dei team nella maggior parte dei casi, e che Xiaomi MiMo-V2.6-Pro sia l'acquisto migliore per la ristretta categoria di lavori in cui il fallimento è l'esito costoso. L'unica riga in cui vince Flash non ribalta questo — ma è un utile promemoria che il premium del modello di punta è un'affermazione su un carico di lavoro, non su un modello.

