
MiMo-V2.6-Pro vs DeepSeek V4 Pro: due flagship open, a dieci punti di distanza nell'indice
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro e DeepSeek V4 Pro sono lo stesso tipo di oggetto — flagship cinesi mixture-of-experts da mille miliardi di parametri, con licenza MIT, contesto da 1M di token, pesi aperti che puoi scaricare già oggi — e sono separati da dieci punti sull'Artificial Analysis Intelligence Index v4.3.2, 46 contro 36. Sono anche in disaccordo su a cosa serva un flagship. DeepSeek V4 Pro, pubblicato il 13 agosto 2026, è un modello di ragionamento solo testuale: 1,6 trilioni di parametri con 49 miliardi attivi, e nessun input di visione, audio o video in alcuna parte della sua superficie pubblicata. Xiaomi MiMo-V2.6-Pro, pubblicato il 21 settembre 2026, ha 1,02 trilioni di parametri con 42 miliardi attivi e accetta testo, immagini, video e audio. Questa differenza decide più deployment di quanto non facciano i dieci punti, ed è la prima cosa da stabilire prima di confrontare qualsiasi altra cosa.
Stessa licenza, macchine diverse
Partiamo da ciò che è realmente identico, perché è più di quanto ci si aspetterebbe tra due laboratori concorrenti. Entrambi sono distribuiti con un'etichetta di licenza MIT su repository pubblici, il che significa distribuzione commerciale, modifica e addestramento ulteriore senza soglie di ricavi né clausole di limitazione del campo d'uso. Entrambi dichiarano una finestra di contesto da 1M token. Entrambi presentano un design sparse mixture-of-experts — l'architettura è diventata lo standard a questa scala, non un elemento distintivo. Ed entrambi sono stati addestrati da laboratori che pubblicano meno dei laboratori di frontiera occidentali riguardo ai metodi.
• Parametri — MiMo-V2.6-Pro 1,02T totale / 42B attivi; DeepSeek V4 Pro 1,6T totale / 49B attivi
• Modalità di input — MiMo-V2.6-Pro testo, immagine, video, audio; DeepSeek V4 Pro solo testo
• Contesto — 1M token entrambi; DeepSeek V4 Pro limita l'output a 384K token
• Punteggio dell'indice — MiMo-V2.6-Pro 46 su Intelligence Index v4.3.2; DeepSeek V4 Pro 36 sulla stessa versione
• Costo per attività Index — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67
• Tariffa di listino — MiMo-V2.6-Pro $0,43 / $0,87 per 1M token; DeepSeek V4 Pro $1,32 / $3,96 come lo elenca Artificial Analysis, prima del programma peak/off-peak di DeepSeek stesso
• Velocità — MiMo-V2.6-Pro 134,3 token di output/secondo; DeepSeek V4 Pro 97,4
• Tempo al primo token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s
Leggi quella lista due volte, perché due righe sono controintuitive. Il modello più piccolo totalizza dieci punti in più — 42 miliardi di parametri attivi che ne battono 49 miliardi non è una differenza di arrotondamento, è un risultato di post-addestramento, ed è il segnale più chiaro in questo confronto che la qualità del reinforcement learning ha superato la scala grezza come leva. E il modello più economico è anche il più veloce, sia in throughput sia in costo per attività, che è l'opposto del solito compromesso. Xiaomi non ti sta vendendo uno sconto in cambio di pazienza. Il vantaggio di DeepSeek è il tempo al primo token, 1,62 secondi contro 2,15 — reale, ma è l'unica categoria in cui V4 Pro è in testa.

Perché qui è importante la stessa versione dell'indice
Confrontare modelli open-weights tra diverse revisioni dell'indice è l'errore che sta alla base di gran parte dei confronti pubblicati, quindi il numero di versione non è una nota a piè di pagina. Artificial Analysis ha ricostruito l'Intelligence Index come v4.3 a settembre 2026, e i punteggi sono cambiati in modo sostanziale lungo quel confine — Claude Opus 5 ha perso tre punti tra la v4.2 e la v4.3, e il campo open-weights si è riordinato. Entrambe le cifre sopra riportate sono v4.3.2, il che significa che il 46 e il 36 sono direttamente confrontabili tra loro. Non sono confrontabili con i numeri più vecchi che troverete citati altrove per l'uno o per l'altro modello.
Non è un'ipotesi. DeepSeek V4 Pro è stato ampiamente riportato a 53 su una precedente scala dell'indice nell'agosto 2026, e la nostra stessa copertura di quel periodo lo riportava. Su v4.3.2 lo stesso modello segna 36. Nulla è cambiato nel modello; è cambiato il metro di misura. Se hai un foglio di calcolo con 53 accanto a un 46 per MiMo-V2.6-Pro, hai un confronto che ti indirizzerà verso il modello sbagliato. L'abbinamento corretto è 46 contro 36, e la conclusione corretta è che il modello rilasciato cinque settimane dopo, con due terzi del numero di parametri, è sostanzialmente avanti.
Il divario di rendicontazione tra i due laboratori
C'è una seconda differenza, più sottile, e riguarda ciò che ogni laboratorio è disposto a far verificare.
Il 46 di MiMo-V2.6-Pro è una misurazione di Artificial Analysis. L'ente di valutazione ha eseguito la propria suite — dieci valutazioni su ragionamento, conoscenza, matematica e programmazione — sul modello rilasciato e ha pubblicato il risultato, insieme ai numeri operativi: 134,3 token/secondo, 2,15 secondi al primo token, uno sconto del 99% sulla cache, 0,13 $ per attività di indicizzazione e un costo totale della valutazione di 206,66 $. Questo è un numero di una terza parte sul modello di Xiaomi.
I dati principali sulle capacità agentiche del DeepSeek V4 Pro sono quelli di DeepSeek stessa, e lo scarto tra questi e quelli indipendenti è stato documentato. Il materiale di lancio dell'azienda riporta Terminal-Bench 2.1 a 87,9, DeepSWE a 62,7, CyberGym a 83,3 e SWE-bench Verified a 80,6. Le esecuzioni indipendenti collocano Terminal-Bench 2.1 a 78,7 — circa nove punti al di sotto del dato del fornitore — e l'Artificial Analysis Coding Index a 68,8. Nessuno di quei numeri del fornitore è stato riprodotto, e l'entità dello scarto su Terminal-Bench è il motivo per cui il resto del set va considerato come dichiarazioni anziché come misurazioni.
Xiaomi ha la propria versione dello stesso problema. La sua dashboard riporta che MiMo-V2.6-Pro passa da 58,4 a 72,57 su DeepSWE v1.1 durante la sua esecuzione di apprendimento per rinforzo, valutato sull'harness di Xiaomi con mini-swe-agent in media su tre. Non è una submission a una classifica e nessuna parte esterna lo ha rieseguito. Quindi nessuno dei due modelli si presenta con un certificato di buona salute sui benchmark dei fornitori. La differenza è che MiMo-V2.6-Pro arriva anche con un punteggio composito indipendente che il lancio di DeepSeek non aveva nel momento equivalente — e se stai scegliendo tra i due sulle prove anziché sul marketing, è quell'asimmetria che dovrebbe avere peso.

Come appare in produzione
La differenza di modalità è il bivio pratico, e gioca a favore di DeepSeek meno spesso di quanto il divario di dieci punti suggerisca. Se la tua pipeline acquisisce screenshot, PDF renderizzati come immagini, fotogrammi video o audio, MiMo-V2.6-Pro li gestisce nativamente in un unico modello, mentre DeepSeek V4 Pro non è in grado di gestirli affatto — servirebbe un modello di visione separato a monte, il che significa un secondo contratto, una seconda modalità di errore e una seconda bolletta. Se il tuo carico di lavoro è il ragionamento solo testuale, la modalità aggiuntiva è un peso morto per cui non stai pagando nulla.
Il costo per ogni attività di indicizzazione è l'altro dato da considerare. 0,13 $ contro 0,67 $ è un divario di cinque volte su un insieme di attività controllato e identico, misurato allo stesso modo per entrambi. DeepSeek adotta un programma di fatturazione peak/off-peak che può ridurre sostanzialmente la sua tariffa effettiva a seconda di quando effettui la chiamata, quindi il rapporto nel mondo reale si restringe nelle ore off-peak e si amplia in quelle di punta — un dettaglio che conta se il tuo traffico è a raffica e non puoi scegliere quando arriva.
Qui è dove il lato DeepSeek ha un vantaggio reale che non ha nulla a che fare con il modello: è sulla nostra piattaforma. DeepSeek V4 Pro è raggiungibile come deepseek/deepseek-v4-pro tramite una chiave OrcaRouter al prezzo di listino del provider con 0% di markup, con failover automatico tra i provider e il DSL di routing disponibile in aggiunta — così l'aritmetica peak/off-peak, lo spread tra provider e il percorso di fallback sono tutte cose che configuri anziché cose che costruisci. MiMo-V2.6-Pro non è sulla nostra piattaforma, e lo diciamo chiaramente: raggiungerlo oggi significa passare dalla piattaforma di Xiaomi stessa o da uno dei cataloghi di terze parti che lo elencano, e Artificial Analysis ha contato un solo provider API per esso al momento della rilevazione. Una sola rotta non è una rotta di produzione, ed è l'argomento più forte per trattare MiMo-V2.6-Pro come un modello da valutare ora e verso cui instradare con cautela, con qualcos'altro alle spalle.
Quale, e quando
Scegli DeepSeek V4 Pro se il tuo lavoro è solo testuale, se hai bisogno del tetto di output di 384K, se vuoi il tempo al primo token più rapido dei due, o se sei già sulla nostra piattaforma e vuoi una corsia open-weights da mille miliardi di parametri con failover e senza nuove integrazioni. È l'incumbent per una ragione, ed essere cinque settimane più vecchio ha significato cinque settimane di tooling, quantizzazione e ricette di serving che un modello di settembre non ha ancora accumulato.
Scegli MiMo-V2.6-Pro se l'attività è multimodale, se il costo per attività domina la tua economia unitaria, se la produttività conta più di mezzo secondo di latenza, o se vuoi l'attuale leader tra i modelli open-weights su un indice misurato in modo indipendente. La licenza MIT su entrambi significa che la questione dei pesi è comunque risolta — puoi eseguire l'uno o l'altro sul tuo hardware, metterlo a punto e distribuirlo commercialmente.
La configurazione che vale la pena considerare non è affatto una scelta. Un router ti consente di mantenere la corsia DeepSeek per il ragionamento solo testuale a tariffe fuori picco e di aggiungere una corsia MiMo per le richieste multimodali, con un fallback davanti alla rotta più sottile. Non è una strategia di copertura; è abbinare ogni richiesta al modello che la gestisce davvero, il che è una soluzione più economica e più duratura che scegliere un vincitore e sperare che il carico di lavoro non cambi mai forma.

La domanda a cui questo confronto non può ancora rispondere
I benchmark più citati di entrambi i modelli sono eseguiti dai fornitori e non riprodotti. Per DeepSeek V4 Pro, questo divario è aperto da agosto ed è il motivo per cui i suoi punteggi indipendenti risultano inferiori ai numeri del lancio. Per MiMo-V2.6-Pro, il punteggio composito indipendente esiste, ma la ripartizione agentica no — Artificial Analysis pubblica un 46 e non la distribuzione per singola valutazione che vi sta sotto, che è il dettaglio che ti dice se un modello appartiene a un ciclo agentico o a una pipeline di question answering.
Finché quel distacco non sarà pubblicato e finché qualcuno non rieseguirà l'harness DeepSWE di Xiaomi, la posizione difendibile è più ristretta di quella sostenuta dal marketing di ciascuno dei due laboratori: MiMo-V2.6-Pro è in testa su un punteggio composito indipendente e sul costo misurato per attività, DeepSeek V4 Pro è in testa quanto a maturità, lunghezza dell'output, latenza del primo token e possibilità di essere raggiunto tramite una rotta che può contare su ridondanza. Cinque settimane sono un breve vantaggio di partenza, e l'unico che DeepSeek ha.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
