
Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: un checkpoint, dieci volte il prezzo
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed e Xiaomi MiMo-V2.6-Pro non sono due modelli. Sono un unico modello venduto in due modi. Entrambi vengono serviti dallo stesso checkpoint MiMo-V2.6 da mille miliardi di parametri che Xiaomi ha pubblicato a settembre 2026 — il livello Pro della serie Xiaomi MiMo-V2.6, il cui fratello minore è Xiaomi MiMo-V2.6-Flash. La differenza tra le due offerte Pro sta interamente in quanto velocemente vengono emessi i token e quanto si paga per essi. Il livello standard prevede $0,435 per milione di token di input e $0,87 per milione di token di output. Il livello UltraSpeed prevede $4,35 e $8,70. Si tratta di un netto rapporto di dieci a uno su entrambi i lati del contatore, e in cambio si ottiene la dichiarazione di una velocità di output all’incirca dieci volte superiore — una dichiarazione che Xiaomi fa riguardo al proprio stack di serving, e per la quale nessun benchmark indipendente ha ancora pubblicato un numero.
Quindi la domanda interessante non è quale modello sia migliore. È se un multiplo di dieci sia il prezzo giusto per una velocità dieci volte superiore, e a quanto pare esiste un precedente che vale la pena leggere prima di impegnare su di esso un percorso di produzione.
Il tier veloce è una decisione di serving, non una decisione di modello
La presentazione ufficiale di Xiaomi per la linea UltraSpeed è che eguaglia il modello standard in qualità e differisce solo nel throughput. Questo conta più di quanto sembri, perché elimina il solito motivo per cui si esita di fronte a un nuovo livello. Non stai scommettendo sulla personalità di un checkpoint diverso, sul suo comportamento di rifiuto o sulle sue peculiarità di formattazione. Stai scommettendo che gli stessi pesi, eseguiti attraverso una configurazione di serving più aggressiva, si comportino allo stesso modo sui tuoi prompt. Se questo vale, passare da un livello all'altro è un cambio di configurazione, non una migrazione.
Ciò che sta dentro quella configurazione di servizio non è stato documentato per questa generazione. Il precedente livello UltraSpeed, basato sul checkpoint MiMo-V2.5-Pro in giugno 2026, è stato descritto da Xiaomi come l'uso della quantizzazione FP4 solo sui layer esperti, uno schema di decodifica speculativa a blocchi paralleli chiamato DFlash e un runtime chiamato TileRT, e girava su un singolo nodo con otto GPU. Xiaomi non ha pubblicato i dettagli equivalenti per il livello V2.6. Considera lo stack precedente come contesto su come si ottiene la velocità, non come una descrizione di ciò che è in esecuzione ora.
La line-up in cui si inserisce è breve. Accanto ai due livelli Pro c'è MiMo-V2.6-Flash, il fratello minore con 309 miliardi di parametri totali e 15 miliardi attivi. Pro è il flagship sparse mixture-of-experts: Artificial Analysis lo elenca con 1.000 miliardi di parametri totali, 42 miliardi attivi per token, una finestra di contesto di 1 milione di token e una licenza MIT con pesi su Hugging Face. Questi sono i numeri da tenere a mente, perché l'intero confronto si basa su di essi.
Cosa è effettivamente verificato e cosa no

L'asimmetria tra le due colonne sopra è la cosa più importante in assoluto di questo articolo. Quasi tutto ciò che è misurabile di questa coppia è stato misurato sul lento lato.
Artificial Analysis ha sottoposto MiMo-V2.6-Pro a benchmark e ne pubblica un Intelligence Index di 46 — il punteggio più alto nella classe di 114 modelli in cui raggruppa il modello. Misura 134,3 token di output al secondo tramite l'API di Xiaomi, rispetto a una mediana di classe di 77,9, e un tempo al primo chunk di 2,15 secondi rispetto a una mediana di 2,34. Indica il costo per attività dell'Intelligence Index a 0,13 $, uno sconto cache del 99% sul prezzo di input e una verbosità dell'output di 140 milioni di token. Queste sono cifre indipendenti su una configurazione denominata, e sono l'unico ancoraggio concreto di throughput di cui questo confronto dispone.
Per UltraSpeed, la lista verificata è molto più breve:
• Velocità di output — circa dieci volte il livello standard, dichiarato da Xiaomi e ripetuto dalle piattaforme che lo elencano. Nessuna terza parte ha pubblicato una misurazione in token al secondo per questo specifico livello.
• Prezzo — 4,35 $ per milione di token di input e 8,70 $ per milione di token di output, un multiplo di dieci volte rispetto al livello standard per entrambi. Non viene indicato alcun livello di cache accanto a queste due tariffe.
• Qualità — "corrisponde all'originale", ancora una dichiarazione del fornitore. Nessuna valutazione indipendente dell'endpoint UltraSpeed è stata pubblicata, quindi l'affermazione che la qualità sia invariata è non testata anziché smentita.
• Contesto e modalità — 1.048.576 token e input nativo di testo, immagini, video e audio, ereditato dal checkpoint di base.
C'è anche un benchmark di fornitore che vale la pena citare proprio per come è circolato. La dashboard pubblica di reinforcement learning di Xiaomi, che ha trasmesso in streaming le esecuzioni di post-training V2.6 a settembre 2026, riporta punteggi DeepSWE v1.1 di 72,57 per l'esecuzione Pro e 65,68 per Flash. Questi provengono dalla valutazione offline di Xiaomi stessa, usando un harness mini-swe-agent in media su tre; non sono mai stati inviati alla classifica pubblica e non sono stati riprodotti al di fuori del laboratorio. Se hai visto citare 72,57 come punteggio di classifica, quello è un numero di fornitore che indossa gli abiti di una classifica.

Il precedente: l'ultima volta Xiaomi ha fatto pagare tre volte, non dieci
Questo non è il primo livello di velocità di Xiaomi, e quello precedente è il confronto più utile di tutta la storia — perché il moltiplicatore è cambiato.
MiMo-V2.5-Pro-UltraSpeed è arrivato a giugno 2026, basato sul checkpoint V2.5-Pro, e il suo prezzo era circa tre volte la tariffa di output del modello standard. La proposta di Xiaomi allora era la stessa che sta facendo ora: circa dieci volte la velocità di output. Le coperture dell'epoca riportavano un throughput sostenuto di circa 1.000 token al secondo con picchi vicini a 1.200, su un singolo nodo a otto GPU, sebbene la pagina del modello stessa indicasse un intervallo più ampio, da 500 a 1.000 — e nulla di tutto ciò è stato verificato in modo indipendente. L'accesso era vincolato a un modulo di candidatura anziché a una registrazione aperta.
Mettili uno accanto all'altro e il cambiamento è il punto. Il moltiplicatore di velocità è rimasto intorno a dieci. Il moltiplicatore di prezzo è passato da tre a dieci. Si tratta di un accordo molto diverso per lo stesso tipo di upgrade, e Xiaomi non ha pubblicato una spiegazione per il cambiamento. Potrebbe riflettere un servizio genuinamente più costoso — un checkpoint più grande, una configurazione di decodifica più aggressiva o una capacità più limitata al lancio. Potrebbe riflettere una tariffazione della finestra di lancio su un livello disponibile da un solo giorno. Ciò che ancora non ha è una giustificazione pubblica che si possa verificare.
Una differenza pratica vale la pena segnalarla a chiunque abbia usato il livello V2.5: quello era un trial ad accesso limitato. Il livello V2.6 è indicato come generalmente disponibile tramite l'API di Xiaomi e diverse piattaforme di terze parti, alle tariffe pubblicate, senza una procedura di candidatura. Qualunque altro aspetto sia cambiato, l'attrito per provarlo si è ridotto.
Quanto costa dieci volte su un carico di lavoro reale
Le percentuali nascondono la forma di questo, quindi ecco l'aritmetica su un'esecuzione concreta di un agente: una che legge 20 milioni di token in input ed emette 2 milioni di token in output nel corso della sua vita. Si tratta di un carico di lavoro agentico pesante ma non esotico, del tipo in cui un modello itera su chiamate a strumenti e rilegge il proprio contesto.
• Livello Standard, input — 20 milioni di token a $0,435 per milione: $8,70.
• Livello standard, output — 2M token a $0,87 per milione: $1,74.
• Livello Standard, totale — $10,44 per esecuzione.
• Livello UltraSpeed, input — 20M token a $4.35 per milione: $87.00.
• Livello UltraSpeed, output — 2M token a $8,70 per milione: $17,40.
• Livello UltraSpeed, totale — $104,40 per esecuzione.
La differenza è di $93,96 ed è esattamente dieci volte la fattura, anziché dieci volte una singola voce della stessa, perché entrambe le tariffe aumentano nella stessa proporzione. Ora l'altro lato del libro contabile. Alla velocità di 134,3 token di output al secondo che Artificial Analysis misura per il livello standard, generare 2 milioni di token di output richiede poco più di quattro ore di puro tempo di generazione. A dieci volte quella velocità, richiede circa venticinque minuti. Quindi i $94 extra recuperano all'incirca tre ore e mezza di tempo reale su questa esecuzione — all'incirca $27 per ogni ora risparmiata, se vogliamo metterla così.
Che quello scambio sia vantaggioso dipende interamente da quanto vale per te il tempo effettivo, e c’è un dettaglio che va contro una lettura ingenua. Nella pagina di Artificial Analysis, il prezzo di input del livello standard beneficia di uno sconto cache del 99%, il che significa che la metà del conto relativa all’input può ridursi quasi a zero su carichi di lavoro che rileggono lo stesso contesto. La scheda di UltraSpeed mostra le due tariffe principali e nessun livello cache. Se il tuo carico di lavoro è intensivo in cache, il moltiplicatore effettivo non è dieci — è molto peggiore, perché perdi lo sconto proprio sul lato dove pagavi quasi nulla. Se il tuo carico di lavoro è intensivo in output e leggero in cache, dieci volte è vicino al numero reale. Misura il tuo mix prima di fidarti dell’uno o dell’altro valore.
L'asimmetria degli open-weights
C'è una differenza strutturale tra i due livelli che non ha nulla a che fare con il prezzo o la velocità, e potrebbe contare più di entrambi.
MiMo-V2.6-Pro è distribuito con licenza MIT e i pesi sono pubblicati su Hugging Face. Ciò consente la distribuzione commerciale, la modifica e l'ulteriore addestramento, e significa che il modello standard ha un limite minimo sotto il suo prezzo che nessun fornitore può alzare: se la tariffa ospitata smette di avere senso, puoi servire tu stesso il checkpoint. Non eguaglierai il throughput di Xiaomi sul tuo hardware e pagherai le GPU, ma l'opzione esiste e pone un tetto a ciò che il livello ospitato può addebitare.
UltraSpeed non ha una simile soglia minima. Non esistono pesi UltraSpeed, perché il livello è lo stack di serving più che il modello — il checkpoint è lo stesso che è già pubblico, e ciò che stai noleggiando è la capacità di Xiaomi di eseguirlo velocemente. È una cosa legittima da vendere, e ha la stessa forma di ogni altro livello di velocità sul mercato. Significa però che la tariffa dieci volte tanto non ha alcun freno concorrenziale, se non altri fornitori che eseguono gli stessi pesi aperti, e nessuna via di fuga tramite self-hosting se il prezzo cambia di nuovo.

Leggete questo alla luce del quadro di disponibilità. Il checkpoint standard è raggiungibile attraverso i canali proprietari di Xiaomi e diverse piattaforme di terze parti, ed è anche disponibile come download. Il tier UltraSpeed è raggiungibile tramite l'API proprietaria di Xiaomi e diverse piattaforme di terze parti, e questo è l'unico modo per ottenerlo. Per chiunque stia valutando una dipendenza di lunga durata, quella differenza di opzionalità merita di essere messa nel conto insieme alla tariffa per token.
Chi dovrebbe prendere quale
La decisione si divide nettamente a seconda di quanta parte del tuo costo sia costituita da token di output e quanta parte del tuo budget di latenza sia generazione anziché accodamento.
• Usa UltraSpeed quando il carico di lavoro è intensivo in output, con scarso utilizzo di cache e interattivo — generazione di testi lunghi, cicli di agenti in cui il modello produce molto ragionamento tra una chiamata a uno strumento e l'altra, o qualsiasi situazione in cui una persona è in attesa dall'altra parte della richiesta.
• Scegli il livello standard quando il carico di lavoro è ad alta intensità di cache, tollerante ai batch o sensibile ai costi al margine — classificazione in blocco, risposte aumentate dal retrieval su un corpus fisso, esecuzioni di valutazione notturne, qualsiasi cosa in cui quattro ore di generazione vadano bene perché nessuno sta guardando.
• Scegli il livello standard quando vuoi l'opzione di ospitare autonomamente. Se la tua postura di conformità richiede pesi che puoi detenere, UltraSpeed non è disponibile per te a nessun prezzo.
• Non scegliere né l'uno né l'altro prima di aver misurato. L'affermazione del fattore dieci è il numero portante qui ed è attualmente dichiarata dal fornitore. Un solo pomeriggio passato a eseguire i tuoi prompt su entrambi i livelli ti dice più di qualsiasi cifra pubblicata, perché l'unico numero di throughput che qualcuno ha verificato in modo indipendente appartiene al lato lento del confronto.
Su quest'ultimo punto, la meccanica di testare un tier di servizio è la stessa di testare un modello, ed è lì che un livello di routing si guadagna il suo posto. OrcaRouter porta più di 200 modelli dietro un'unica chiave API al prezzo di listino del provider, con un ricarico dello 0% passato inalterato, così una variazione di prezzo di un fornitore arriva dalla tua parte lo stesso giorno anziché al prossimo rinnovo contrattuale. Il failover automatico fa sì che un tier che stai ancora valutando non si trovi mai da solo su un percorso di produzione, e il DSL di routing ti consente di inviare una classe di richieste all'endpoint veloce e tutto il resto a quello standard senza mantenere due integrazioni. Niente di tutto ciò richiede specificamente i modelli di Xiaomi — il punto è che decisioni a livello di tier come questa sono facili da invertire quando i tier stanno dietro un'unica chiave.
{{1}}Cosa risolverebbe questo{{/1}}
La verità sulla questione MiMo-V2.6-Pro-UltraSpeed versus MiMo-V2.6-Pro è che metà di essa è misurata e metà è asserita. Il livello standard ha un Intelligence Index indipendente, un valore di throughput indipendente e pesi aperti pubblicati. Il livello veloce ha un prezzo, una finestra di contesto e la promessa del fornitore che si tratta dello stesso modello che va più veloce.
Tre cose colmerebbero il divario. Una misurazione indipendente del throughput sull'endpoint UltraSpeed — Artificial Analysis ha misurato il tier standard tramite l'API di Xiaomi, quindi lo stesso trattamento è possibile e semplicemente non è ancora avvenuto. Una politica di cache per il tier veloce, dato che la sua assenza è ciò che trasforma una bolletta dieci volte più alta in qualcosa di peggio sui carichi di lavoro ad alto uso di cache. E qualsiasi dettaglio pubblicato sullo stack di serving V2.6, come Xiaomi ha documentato gli esperti FP4, DFlash e TileRT per la generazione V2.5.
Fino ad allora, il prezzo moltiplicato per dieci è reale e la velocità moltiplicata per dieci è un'affermazione. Se il tuo carico di lavoro è intensivo in output e qualcuno sta aspettando, vale la pena mettere alla prova quell'affermazione sui tuoi stessi prompt — e vale la pena testarla dietro uno strato che ti permetta di tornare indietro lo stesso pomeriggio se non regge.
