Card hero con titolo "MiMo-V2.6-Pro vs MiMo-V2.6-Flash" e sottotitolo "Un divario di prezzo di 3x, e cosa non lo spiega", e due pannelli: un pannello sinistro con titolo "MiMo-V2.6-Pro" che riporta "$0,435 / $0,87 per 1M" e "42B parametri attivi", e un pannello destro con titolo "MiMo-V2.6-Flash" che riporta "$0,14 / $0,28 per 1M" e "15B parametri attivi", sopra un piè di pagina che riporta "Entrambi con licenza MIT · entrambi con contesto da 1M · indice pubblicato solo per Pro".
Guides & Insights

MiMo-V2.6-Pro vs MiMo-V2.6-Flash: un divario di prezzo di 3 volte che due benchmark non spiegano

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Nelle tabelle di valutazione di Xiaomi stessa, MiMo-V2.6-Flash batte MiMo-V2.6-Pro. La riga è CyberGym, e il margine è 95,1 a 94,0. È una riga su quindici, ed è il motivo per cui conviene leggere con attenzione il resto di questo confronto invece di dare per scontato che il modello di punta sia sempre la risposta — perché MiMo-V2.6-Flash costa circa un terzo di quanto costa MiMo-V2.6-Pro, e sulla maggior parte delle righe i due si collocano a pochi punti di distanza l'uno dall'altro.

Entrambi i modelli sono stati pubblicati come repository Hugging Face il 21 settembre 2026, sotto licenza MIT, a diciotto secondi di distanza, come addestramenti separati anziché come pioli di un'unica scala. Xiaomi MiMo-V2.6-Pro è il livello da mille miliardi di parametri. MiMo-V2.6-Flash è il livello di efficienza. La domanda a cui questa pagina risponde è quale dei due appartenga al tuo percorso di produzione, e la risposta onesta dipende da un numero che non esiste in nessuno dei due rilasci.

Che cosa è ciascuno

• Parametri — Xiaomi MiMo-V2.6-Pro da 1,02T totali con 42B attivi per token, contro Xiaomi MiMo-V2.6-Flash da circa 309B totali con 15B attivi
• Architettura — entrambi con mixture-of-experts sparsi e input omnimodale nativo; Flash è documentato con 48 layer, 39 a finestra scorrevole e 9 ad attenzione completa, dimensione nascosta 4096, 256 esperti instradati con 8 attivi e nessun esperto condiviso, insieme a un vision transformer da 681M, un tokenizer audio da 308M e un audio patch encoder da 127M
• Contesto — 1M token su entrambi, con fino a 128.000 token di output su entrambi
• Licenza — MIT su entrambi, pesi non soggetti a gate su entrambi
• Prezzo — $0,435 in input e $0,87 in output per milione di token per Pro, contro $0,14 e $0,28 per Flash: un divario di 3,1x su entrambi i lati della scheda
• Input con cache hit — $0,0036 per milione su Pro, $0,0028 su Flash
• Spesa per l'addestramento — Xiaomi riporta circa $2,62M per la run RL di Pro e $854K per Flash, ciascuna completata in meno di sei giorni attraverso 30 passaggi di reinforcement learning e circa 750.000 traiettorie
• Punteggio indipendente dell'indice — 46 per Xiaomi MiMo-V2.6-Pro su Artificial Analysis Intelligence Index v4.3.2; nessuno pubblicato per MiMo-V2.6-Flash

Quell'ultima riga è quella da tenere a mente. Tutto ciò che sta sopra, tranne il punteggio Pro, è dichiarato da Xiaomi.

Dove il triplo del prezzo non compra quasi nulla

La Tabella 3 di Xiaomi mette i due a confronto fianco a fianco sugli harness su cui la serie è stata addestrata, e nel lavoro agentico a lungo orizzonte i margini sono risicati:

• DeepSWE v1.1 — Pro 71,9, Flash 67,9
• MiMo Code Bench — Pro 63,2, Flash 61,2
• AutomationBench v1.0.6 — Pro 53,1, Flash 52,3
• Toolathlon-Verified — Pro 76,9, Flash 73,6
• Terminal Bench 2.1 — Pro 89,9, Flash 87,6
• OSWorld-Verified — Pro 82,0, Flash 80,8
• JobBench — Pro 62,0, Flash 61,2
• MiMo Visual Coding — Pro 72,3, Flash 71,5
• CyberGym — Pro 94,0, Flash 95,1
• MiMo Cyber Bench — Pro 80,2, Flash 77,2

Scorri quella colonna e il vantaggio dell'ammiraglia è per lo più compreso tra uno e quattro punti, con una riga persa del tutto. In un flusso di lavoro in cui la differenza tra 67,9 e 71,9 è la differenza tra un'attività che si completa e un'attività che fallisce, un prezzo triplo è conveniente. In un flusso di lavoro in cui è la differenza tra due risposte accettabili, non lo è. Le tabelle dei fornitori con cifre decimali come queste invitano a una falsa precisione: nessuno al di fuori di Xiaomi le ha eseguite, e un divario di due punti su un harness valutato internamente rientra ampiamente nell'intervallo che un valutatore diverso o una politica di retry diversa può spostare.

Two-column scoreboard headed 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash — the scoreboard'. The left column, MiMo-V2.6-Pro, reads Active params 42B, Price $0.435 / $0.87, DeepSWE v1.1 71.9, CyberGym 94.0, ExploitGym 17.8, Independent index 46. The right column, MiMo-V2.6-Flash, reads Active params 15B, Price $0.14 / $0.28, DeepSWE v1.1 67.9, CyberGym 95.1, ExploitGym 6.0, Independent index none published. A footer reads 'All benchmark figures are Xiaomi's own runs; only the Pro index score is independent.'

Dove compra molto

C'è un gruppo di righe in cui il divario smette di essere una questione di arrotondamento. Ognuna di esse è lavoro di sicurezza:

• ExploitGym — Pro 17.8, Flash 6.0
• ExploitBench — Pro 47.9, Flash 25.3
• SEC Bench Pro — Pro 66.3, Flash 47.5
• Agents' Last Exam — Pro 31.6, Flash 27.6
• Terminal Bench 4.0 — Pro 34.9, Flash 28.8

Su ExploitGym il modello di punta è tre volte il modello più economico, che è lo stesso fattore del prezzo, e su SEC Bench Pro è 1,4x. Questo schema è quello che ti aspetteresti da un modello con 42B parametri attivi rispetto a uno con 15B: un compito che richiede una lunga catena di ragionamento senza credito parziale è il tipo di compito in cui la capacità extra si manifesta, e CyberGym che si trova nella direzione opposta è l'eccezione che prova che le due run hanno imparato cose diverse anziché la stessa cosa a dimensioni diverse.

Quindi la divisione corrisponde a un confine reale del carico di lavoro, non a uno di marketing. Il lavoro degli agenti ad alto volume con un criterio di successo indulgente — recupero, classificazione, modifiche di routine, chiamate che un nuovo tentativo può salvare — è territorio Flash. Il lavoro in cui una risposta sbagliata è costosa e una risposta parziale è inutile — sviluppo di exploit, revisione della sicurezza, sessioni di terminale con stato a più passaggi — è dove il livello Pro si guadagna il multiplo.

Il numero che non esiste

MiMo-V2.6-Flash non ha una pagina modello su Artificial Analysis. Il suo gemello sì. Questa asimmetria è la cosa più importante in assoluto su questa pagina, perché significa che l'unico valore misurato in modo indipendente in tutta la serie MiMo-V2.6 è il 46 accanto a Xiaomi MiMo-V2.6-Pro. Ogni numero di Flash riportato qui sopra — inclusa la riga CyberGym che vince — deriva da un harness Xiaomi, un grader Xiaomi e un'esecuzione offline Xiaomi.

Si può ragionevolmente sostenere che questo sia temporaneo: il modello ha un giorno di vita al momento in cui scriviamo e la valutazione da parte di terzi richiede tempo. Si può anche ragionevolmente sostenere che sia strutturale, dato che Flash è la fascia di volume e le fasce di volume attirano meno attenzione nel benchmarking. In ogni caso, la conseguenza pratica oggi è che non puoi confrontare Flash con nulla al di fuori della sua stessa famiglia con la stessa fiducia con cui puoi confrontare Pro. Se stai scegliendo tra Flash e un modello non Xiaomi in base al rapporto qualità-prezzo, stai confrontando un dato del fornitore con un dato misurato da qualcun altro.

Entrambe le schede modello riportano la stessa seconda avvertenza. Nessuno dei due repository è distribuito da alcun fornitore di inferenza — Hugging Face lo afferma esplicitamente su ciascuna pagina, e Artificial Analysis ha contato un solo fornitore API per Pro. Noi non ospitiamo nessuno dei due checkpoint, quindi nessuno dei due è instradabile tramite noi. La via per entrambi è la piattaforma di Xiaomi stessa e i cataloghi di terze parti che li includono.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence tag and multimodal tags including 8-bit precision and fp8, a Safetensors panel reporting a model size of 159B parameters, an Inference Providers panel stating 'This model isn't deployed by any Inference Provider', a model tree listing one finetune and six quantizations, and a collection block headed MiMo-V2.6 holding three items.

Il prezzo che paghi in hardware, non in token.

Il prezzo per token è solo metà di quanto ti costa un checkpoint, e i due differiscono molto più nettamente su disco che sul tariffario. MiMo-V2.6-Flash pubblica 172,9 GB di pesi FP8 su 65 shard. Xiaomi MiMo-V2.6-Pro ha circa tre volte i parametri, il che colloca il suo download grezzo nell'ordine del mezzo terabyte prima di qualsiasi quantizzazione — e il suo stesso repository riporta una dimensione del modello Safetensors di 524B parametri, una cifra che non concilia né con il totale di 1,02T né con il conteggio dei 42B attivi.

Quel divario cambia la forma della decisione. Flash a 172,9 GB è un modello che un piccolo team può self-hostare su capacità noleggiata e trattare come una commodity. Pro, a circa tre volte tanto, è una decisione da cluster — la copertura attorno al lancio collocava i due run di addestramento rispettivamente a circa 4.000 e 8.000 GPU equivalenti a H200. Se il tuo motivo per guardare ai pesi aperti è che vuoi avere l'opzione di smettere di pagare per token, i due checkpoint offrono quell'opzione a scale di impegno molto diverse.

Scegliere tra loro

La regola che sopravvive alle avvertenze di cui sopra è scegliere in base alla classe di carico di lavoro anziché alla media dei benchmark. Flash per tutto ciò che saresti disposto a ritentare; Pro per tutto ciò in cui un nuovo tentativo non ti salva. Poi misura, perché nessuno dei due modelli ha un punteggio indipendente sui benchmark che ti interessano davvero.

Misurare due checkpoint fianco a fianco è il punto in cui un router fa qualcosa che un contratto per singolo modello non può fare. Mettere un livello economico sulla maggior parte del tuo traffico ed escalare solo i casi difficili a quello costoso è la stessa decisione di questa pagina, espressa come configurazione anziché come riscrittura — e quella composizione è esattamente ciò per cui esiste il livello di routing. Conta anche per il prezzo stesso: trasmettiamo il prezzo di listino del provider con 0% di markup, quindi se Xiaomi riduce la tariffa su uno dei due checkpoint, il numero dalla nostra parte cambia lo stesso giorno anziché al prossimo rinnovo del contratto. Questo vale per i modelli che trattiamo. Nello specifico per la coppia MiMo-V2.6, oggi, stai ancora acquistando direttamente da Xiaomi.

Cosa lo risolverebbe

Due cose farebbero passare questa da una questione di giudizio a una questione aritmetica. Una pagina di Artificial Analysis per MiMo-V2.6-Flash collocherebbe entrambi i checkpoint sullo stesso asse del costo per attività che attualmente pone Pro a $0,133 per attività dell'Intelligence Index, e il confronto si risolverebbe da sé. Una replica di terze parti del cluster di sicurezza — ExploitGym, ExploitBench, SEC Bench Pro — confermerebbe se il divario di 3x su quelle righe sia una proprietà del modello o una proprietà del valutatore.

Fino ad allora, la posizione difendibile è che Xiaomi MiMo-V2.6-Flash sia l'acquisto migliore per la maggior parte dei team nella maggior parte dei casi, e che Xiaomi MiMo-V2.6-Pro sia l'acquisto migliore per la ristretta categoria di lavori in cui il fallimento è l'esito costoso. L'unica riga in cui vince Flash non ribalta questo — ma è un utile promemoria che il premium del modello di punta è un'affermazione su un carico di lavoro, non su un modello.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing the Xiaomi attribution and 'Released September 2026', an Intelligence card reading 46 ranked #1 of 114, a Speed card reading 125.2 output tokens per second, a Cost card reading $0.435 in and $0.87 out per million tokens with a 99% cache discount and $0.13 cost per Intelligence Index task, and a Verbosity card reading 140M output tokens, with a technical specifications panel listing 1M context window, 1.0T total parameters, 42B active, MIT licence and weights on Hugging Face.