Scheda hero del radar modelli di OrcaRouter per il confronto tra MiMo-V2.6-Pro e DeepSeek V4 Pro, con il sottotitolo "Due flagship open, distanti dieci punti indice", con un pannello per modello e un piè di pagina che segnala che entrambi sono con licenza MIT con una finestra di contesto da 1M token e che i punteggi sono v4.3.2 e non sono confrontabili con le versioni precedenti dell'indice.
Guides & Insights

MiMo-V2.6-Pro vs DeepSeek V4 Pro: due flagship open, a dieci punti di distanza nell'indice

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Xiaomi MiMo-V2.6-Pro e DeepSeek V4 Pro sono lo stesso tipo di oggetto — flagship cinesi mixture-of-experts da mille miliardi di parametri, con licenza MIT, contesto da 1M di token, pesi aperti che puoi scaricare già oggi — e sono separati da dieci punti sull'Artificial Analysis Intelligence Index v4.3.2, 46 contro 36. Sono anche in disaccordo su a cosa serva un flagship. DeepSeek V4 Pro, pubblicato il 13 agosto 2026, è un modello di ragionamento solo testuale: 1,6 trilioni di parametri con 49 miliardi attivi, e nessun input di visione, audio o video in alcuna parte della sua superficie pubblicata. Xiaomi MiMo-V2.6-Pro, pubblicato il 21 settembre 2026, ha 1,02 trilioni di parametri con 42 miliardi attivi e accetta testo, immagini, video e audio. Questa differenza decide più deployment di quanto non facciano i dieci punti, ed è la prima cosa da stabilire prima di confrontare qualsiasi altra cosa.

Stessa licenza, macchine diverse

Partiamo da ciò che è realmente identico, perché è più di quanto ci si aspetterebbe tra due laboratori concorrenti. Entrambi sono distribuiti con un'etichetta di licenza MIT su repository pubblici, il che significa distribuzione commerciale, modifica e addestramento ulteriore senza soglie di ricavi né clausole di limitazione del campo d'uso. Entrambi dichiarano una finestra di contesto da 1M token. Entrambi presentano un design sparse mixture-of-experts — l'architettura è diventata lo standard a questa scala, non un elemento distintivo. Ed entrambi sono stati addestrati da laboratori che pubblicano meno dei laboratori di frontiera occidentali riguardo ai metodi.

• Parametri — MiMo-V2.6-Pro 1,02T totale / 42B attivi; DeepSeek V4 Pro 1,6T totale / 49B attivi

• Modalità di input — MiMo-V2.6-Pro testo, immagine, video, audio; DeepSeek V4 Pro solo testo

• Contesto — 1M token entrambi; DeepSeek V4 Pro limita l'output a 384K token

• Punteggio dell'indice — MiMo-V2.6-Pro 46 su Intelligence Index v4.3.2; DeepSeek V4 Pro 36 sulla stessa versione

• Costo per attività Index — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67

• Tariffa di listino — MiMo-V2.6-Pro $0,43 / $0,87 per 1M token; DeepSeek V4 Pro $1,32 / $3,96 come lo elenca Artificial Analysis, prima del programma peak/off-peak di DeepSeek stesso

• Velocità — MiMo-V2.6-Pro 134,3 token di output/secondo; DeepSeek V4 Pro 97,4

• Tempo al primo token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s

Leggi quella lista due volte, perché due righe sono controintuitive. Il modello più piccolo totalizza dieci punti in più — 42 miliardi di parametri attivi che ne battono 49 miliardi non è una differenza di arrotondamento, è un risultato di post-addestramento, ed è il segnale più chiaro in questo confronto che la qualità del reinforcement learning ha superato la scala grezza come leva. E il modello più economico è anche il più veloce, sia in throughput sia in costo per attività, che è l'opposto del solito compromesso. Xiaomi non ti sta vendendo uno sconto in cambio di pazienza. Il vantaggio di DeepSeek è il tempo al primo token, 1,62 secondi contro 2,15 — reale, ma è l'unica categoria in cui V4 Pro è in testa.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Perché qui è importante la stessa versione dell'indice

Confrontare modelli open-weights tra diverse revisioni dell'indice è l'errore che sta alla base di gran parte dei confronti pubblicati, quindi il numero di versione non è una nota a piè di pagina. Artificial Analysis ha ricostruito l'Intelligence Index come v4.3 a settembre 2026, e i punteggi sono cambiati in modo sostanziale lungo quel confine — Claude Opus 5 ha perso tre punti tra la v4.2 e la v4.3, e il campo open-weights si è riordinato. Entrambe le cifre sopra riportate sono v4.3.2, il che significa che il 46 e il 36 sono direttamente confrontabili tra loro. Non sono confrontabili con i numeri più vecchi che troverete citati altrove per l'uno o per l'altro modello.

Non è un'ipotesi. DeepSeek V4 Pro è stato ampiamente riportato a 53 su una precedente scala dell'indice nell'agosto 2026, e la nostra stessa copertura di quel periodo lo riportava. Su v4.3.2 lo stesso modello segna 36. Nulla è cambiato nel modello; è cambiato il metro di misura. Se hai un foglio di calcolo con 53 accanto a un 46 per MiMo-V2.6-Pro, hai un confronto che ti indirizzerà verso il modello sbagliato. L'abbinamento corretto è 46 contro 36, e la conclusione corretta è che il modello rilasciato cinque settimane dopo, con due terzi del numero di parametri, è sostanzialmente avanti.

Il divario di rendicontazione tra i due laboratori

C'è una seconda differenza, più sottile, e riguarda ciò che ogni laboratorio è disposto a far verificare.

Il 46 di MiMo-V2.6-Pro è una misurazione di Artificial Analysis. L'ente di valutazione ha eseguito la propria suite — dieci valutazioni su ragionamento, conoscenza, matematica e programmazione — sul modello rilasciato e ha pubblicato il risultato, insieme ai numeri operativi: 134,3 token/secondo, 2,15 secondi al primo token, uno sconto del 99% sulla cache, 0,13 $ per attività di indicizzazione e un costo totale della valutazione di 206,66 $. Questo è un numero di una terza parte sul modello di Xiaomi.

I dati principali sulle capacità agentiche del DeepSeek V4 Pro sono quelli di DeepSeek stessa, e lo scarto tra questi e quelli indipendenti è stato documentato. Il materiale di lancio dell'azienda riporta Terminal-Bench 2.1 a 87,9, DeepSWE a 62,7, CyberGym a 83,3 e SWE-bench Verified a 80,6. Le esecuzioni indipendenti collocano Terminal-Bench 2.1 a 78,7 — circa nove punti al di sotto del dato del fornitore — e l'Artificial Analysis Coding Index a 68,8. Nessuno di quei numeri del fornitore è stato riprodotto, e l'entità dello scarto su Terminal-Bench è il motivo per cui il resto del set va considerato come dichiarazioni anziché come misurazioni.

Xiaomi ha la propria versione dello stesso problema. La sua dashboard riporta che MiMo-V2.6-Pro passa da 58,4 a 72,57 su DeepSWE v1.1 durante la sua esecuzione di apprendimento per rinforzo, valutato sull'harness di Xiaomi con mini-swe-agent in media su tre. Non è una submission a una classifica e nessuna parte esterna lo ha rieseguito. Quindi nessuno dei due modelli si presenta con un certificato di buona salute sui benchmark dei fornitori. La differenza è che MiMo-V2.6-Pro arriva anche con un punteggio composito indipendente che il lancio di DeepSeek non aveva nel momento equivalente — e se stai scegliendo tra i due sulle prove anziché sul marketing, è quell'asimmetria che dovrebbe avere peso.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

Come appare in produzione

La differenza di modalità è il bivio pratico, e gioca a favore di DeepSeek meno spesso di quanto il divario di dieci punti suggerisca. Se la tua pipeline acquisisce screenshot, PDF renderizzati come immagini, fotogrammi video o audio, MiMo-V2.6-Pro li gestisce nativamente in un unico modello, mentre DeepSeek V4 Pro non è in grado di gestirli affatto — servirebbe un modello di visione separato a monte, il che significa un secondo contratto, una seconda modalità di errore e una seconda bolletta. Se il tuo carico di lavoro è il ragionamento solo testuale, la modalità aggiuntiva è un peso morto per cui non stai pagando nulla.

Il costo per ogni attività di indicizzazione è l'altro dato da considerare. 0,13 $ contro 0,67 $ è un divario di cinque volte su un insieme di attività controllato e identico, misurato allo stesso modo per entrambi. DeepSeek adotta un programma di fatturazione peak/off-peak che può ridurre sostanzialmente la sua tariffa effettiva a seconda di quando effettui la chiamata, quindi il rapporto nel mondo reale si restringe nelle ore off-peak e si amplia in quelle di punta — un dettaglio che conta se il tuo traffico è a raffica e non puoi scegliere quando arriva.

Qui è dove il lato DeepSeek ha un vantaggio reale che non ha nulla a che fare con il modello: è sulla nostra piattaforma. DeepSeek V4 Pro è raggiungibile come deepseek/deepseek-v4-pro tramite una chiave OrcaRouter al prezzo di listino del provider con 0% di markup, con failover automatico tra i provider e il DSL di routing disponibile in aggiunta — così l'aritmetica peak/off-peak, lo spread tra provider e il percorso di fallback sono tutte cose che configuri anziché cose che costruisci. MiMo-V2.6-Pro non è sulla nostra piattaforma, e lo diciamo chiaramente: raggiungerlo oggi significa passare dalla piattaforma di Xiaomi stessa o da uno dei cataloghi di terze parti che lo elencano, e Artificial Analysis ha contato un solo provider API per esso al momento della rilevazione. Una sola rotta non è una rotta di produzione, ed è l'argomento più forte per trattare MiMo-V2.6-Pro come un modello da valutare ora e verso cui instradare con cautela, con qualcos'altro alle spalle.

Quale, e quando

Scegli DeepSeek V4 Pro se il tuo lavoro è solo testuale, se hai bisogno del tetto di output di 384K, se vuoi il tempo al primo token più rapido dei due, o se sei già sulla nostra piattaforma e vuoi una corsia open-weights da mille miliardi di parametri con failover e senza nuove integrazioni. È l'incumbent per una ragione, ed essere cinque settimane più vecchio ha significato cinque settimane di tooling, quantizzazione e ricette di serving che un modello di settembre non ha ancora accumulato.

Scegli MiMo-V2.6-Pro se l'attività è multimodale, se il costo per attività domina la tua economia unitaria, se la produttività conta più di mezzo secondo di latenza, o se vuoi l'attuale leader tra i modelli open-weights su un indice misurato in modo indipendente. La licenza MIT su entrambi significa che la questione dei pesi è comunque risolta — puoi eseguire l'uno o l'altro sul tuo hardware, metterlo a punto e distribuirlo commercialmente.

La configurazione che vale la pena considerare non è affatto una scelta. Un router ti consente di mantenere la corsia DeepSeek per il ragionamento solo testuale a tariffe fuori picco e di aggiungere una corsia MiMo per le richieste multimodali, con un fallback davanti alla rotta più sottile. Non è una strategia di copertura; è abbinare ogni richiesta al modello che la gestisce davvero, il che è una soluzione più economica e più duratura che scegliere un vincitore e sperare che il carico di lavoro non cambi mai forma.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

La domanda a cui questo confronto non può ancora rispondere

I benchmark più citati di entrambi i modelli sono eseguiti dai fornitori e non riprodotti. Per DeepSeek V4 Pro, questo divario è aperto da agosto ed è il motivo per cui i suoi punteggi indipendenti risultano inferiori ai numeri del lancio. Per MiMo-V2.6-Pro, il punteggio composito indipendente esiste, ma la ripartizione agentica no — Artificial Analysis pubblica un 46 e non la distribuzione per singola valutazione che vi sta sotto, che è il dettaglio che ti dice se un modello appartiene a un ciclo agentico o a una pipeline di question answering.

Finché quel distacco non sarà pubblicato e finché qualcuno non rieseguirà l'harness DeepSWE di Xiaomi, la posizione difendibile è più ristretta di quella sostenuta dal marketing di ciascuno dei due laboratori: MiMo-V2.6-Pro è in testa su un punteggio composito indipendente e sul costo misurato per attività, DeepSeek V4 Pro è in testa quanto a maturità, lunghezza dell'output, latenza del primo token e possibilità di essere raggiunto tramite una rotta che può contare su ridondanza. Cinque settimane sono un breve vantaggio di partenza, e l'unico che DeepSeek ha.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno