
MiMo-V2.6-Pro vs Gemini 3.1 Pro: un divario di 16 punti che esiste solo su una versione dell'indice
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Metti Xiaomi MiMo-V2.6-Pro e Gemini 3.1 Pro Preview fianco a fianco sull'Artificial Analysis Intelligence Index e ottieni 46 contro 30 — un vantaggio di sedici punti per un modello che costa un quinto tanto in input. Mettili fianco a fianco sui numeri che entrambi i fornitori hanno pubblicato ai rispettivi lanci e Gemini 3.1 Pro vince di undici. Entrambe le letture provengono dallo stesso valutatore. Il motivo per cui sono in disaccordo è la cosa più utile da capire sul confronto tra modelli a settembre 2026: l'indice è stato ricostruito sotto entrambi, e un punteggio ha senso solo accanto al numero di versione che l'ha prodotto.
Il composito v4.3.2 è quello attuale. Esegue dieci valutazioni — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1 — e su di esso, alla lettura del 22 settembre 2026, il modello di Xiaomi ottiene 46 e quello di Google 30. Al lancio, il 19 febbraio 2026, Gemini 3.1 Pro Preview era riportato a 57 sulla scala allora in uso, che dominava la classifica. Quelle due cifre di Gemini non sono un calo. Sono due metri di misura diversi.
Cosa è realmente ciascun modello
Gemini 3.1 Pro Preview è il modello di ragionamento di frontiera di Google, rilasciato il 19 febbraio 2026 e che porta ancora l'etichetta preview sette mesi dopo. Ha una finestra di contesto da 1M di token, limita l'output a 65.536 token — indicati come 64K da Artificial Analysis e 65K sulla nostra pagina del modello — e accetta in input testo, immagini, PDF, audio e video, restituendo testo. È proprietario, con un numero di parametri non divulgato e un knowledge cutoff di gennaio 2025. La stessa API di Google applica un costo di $2,00 per milione di token in input e $12,00 per milione in output sotto i 200K di input, che sale a $4,00 e $18,00 al di sopra, con input in cache a $0,20.
Xiaomi MiMo-V2.6-Pro è diventato disponibile a livello generale il 22 settembre 2026, con i repository dei checkpoint di reinforcement learning comparsi il giorno precedente. È un modello sparse mixture-of-experts con 1.020 miliardi di parametri totali e 42 miliardi attivati per token, con una finestra di contesto di 1 milione di token, multimodalità nativa su testo, immagine, video e audio, e pesi scaricabili con licenza MIT. Xiaomi ha mantenuto il prezzo della precedente generazione MiMo-V2.5 invece di aumentare il prezzo del nuovo checkpoint: 0,43 $ per milione di token di input e 0,87 $ per milione di token di output, con uno sconto del 99% sulla cache e una tariffa combinata di 0,18 $ con un mix 7:2:1 di cache-hit/input/output.
• Pesi — Xiaomi MiMo-V2.6-Pro con licenza MIT e scaricabile; Gemini 3.1 Pro Preview proprietario, solo API
• Parametri — MiMo-V2.6-Pro 1.02T totali / 42B attivi; Gemini 3.1 Pro Preview non divulgati
• Contesto — 1M token in entrambi i casi; Gemini 3.1 Pro Preview limita l'output a 65.536 token, MiMo-V2.6-Pro non pubblica alcun limite equivalente
Modalità — MiMo-V2.6-Pro accetta testo, immagini, video e audio; Gemini 3.1 Pro Preview accetta testo, immagini, PDF, audio e video
• Prezzo di listino — MiMo-V2.6-Pro 0,43 $ / 0,87 $ per 1M token; Gemini 3.1 Pro Preview 2,00 $ / 12,00 $ sotto i 200K di input, 4,00 $ / 18,00 $ sopra
• Cache — MiMo-V2.6-Pro sconto del 99%; Gemini 3.1 Pro Preview $0,20 per 1M di letture dalla cache
• Velocità — MiMo-V2.6-Pro 134.3 token di output/secondo; Gemini 3.1 Pro Preview 121.8
• Tempo al primo token — MiMo-V2.6-Pro 2,15 secondi; Gemini 3.1 Pro Preview 63,62 secondi
• Costo misurato per eseguire l'indice — MiMo-V2.6-Pro 206,66 $, ovvero 0,13 $ per attività; Gemini 3.1 Pro Preview 1.310,21 $, ovvero 0,67 $ per attività

L'etichetta di anteprima è la vera differenza
Tutto ciò che precede è una specifica. L'unica riga che cambia il modo in cui dovresti leggere l'intero confronto è la parola "preview". Un modello preview è un candidato che Google non si è impegnata a mantenere su quell'endpoint. Questo conta per una pagina di confronto in un modo in cui un divario di sedici punti nell'indice non conta, perché un modello su cui non puoi contare che sia ancora lì tra sei mesi non è un modello su cui standardizzi — e la stessa famiglia di Google lo ha già superato. Gemini 3.6 Flash e Gemini 3.8 Flash si collocano sopra Gemini 3.1 Pro su coding e lavoro agentico a un costo inferiore, motivo per cui una recensione tecnica dell'uscita di 3.1 Pro lo ha descritto come decisamente di generazione precedente. La pagina AA stessa lo elenca al rango 71 di 202 per intelligenza.
Il modello di Xiaomi si trova nella posizione opposta. È stato rilasciato questa settimana, i pesi sono disponibili con licenza MIT, e le caratteristiche di serving sono il suo punto di forza. 134,3 token di output al secondo lo collocano all'undicesimo posto su 114 modelli misurati per velocità, e 2,15 secondi per il primo token sono circa trenta volte più veloci dei 63,62 secondi di Gemini 3.1 Pro Preview. Per un'applicazione interattiva, non è un semplice criterio di spareggio. È la differenza tra un prodotto e una demo, ed è il numero che più probabilmente rimarrebbe invisibile in una tabella di benchmark.
Dove vanno effettivamente i soldi
L'aritmetica per token sottovaluta il divario tra questi due, perché i modelli non consumano lo stesso numero di token per completare lo stesso lavoro. Il dato più chiaro è quello misurato da Artificial Analysis per eseguire il suo indice completo Intelligence Index su ciascuno: $206,66 per MiMo-V2.6-Pro e $1.310,21 per Gemini 3.1 Pro Preview. Stessa suite, stesso harness, misurati allo stesso modo — una differenza di 6,3x su un insieme di attività identico, e che tiene già conto del fatto che i modelli di ragionamento emettono molti token pensando. Gemini 3.1 Pro Preview ha generato 67 milioni di token di output nell'indice; la mediana per i modelli nella sua fascia di prezzo è di 90 milioni, quindi è in realtà più economico per punto rispetto ai suoi pari, eppure costa sei volte di più valutarlo rispetto al modello Xiaomi.
Poi mettici contro un loop di produzione. Un'esecuzione di un agente da 30 passi che legge 200.000 token di contesto a ogni passo e ne scrive 2.000 a ogni passo equivale a 6 milioni di token in input e 60.000 in output per esecuzione. Su Gemini 3.1 Pro Preview sotto la soglia dei 200K sono $12,00 di input e $0,72 di output — $12,72 per esecuzione. Su MiMo-V2.6-Pro sono $2,58 e $0,05 — $2,63. Supera i 200.000 token di input sul modello Google e la tariffa di input raddoppia a $4,00, punto in cui lo stesso loop costa $24,00 prima dell'output. Il caching sposta entrambi i numeri, ma uno sconto del 99% su un modello economico rispetto a una lettura della cache da $0,20 su uno costoso lascia al modello costoso un vantaggio di un ordine di grandezza su un loop con molto contesto.

La questione del routing, detta onestamente
Ecco la parte che è facile sbagliare. Gemini 3.1 Pro Preview è su OrcaRouter come google/gemini-3.1-pro-preview, raggiungibile tramite una chiave compatibile con OpenAI al prezzo di listino del provider con 0% di ricarico — così un cambiamento di prezzo di Google è attivo dalla nostra parte lo stesso giorno anziché al ciclo di fatturazione successivo. Xiaomi MiMo-V2.6-Pro non è su OrcaRouter. Nessun modello Xiaomi lo è, e dirlo chiaramente è più utile che lasciare che una pagina di modello lasci intendere il contrario. Raggiungerlo oggi significa la piattaforma di Xiaomi stessa o uno dei cataloghi di terze parti che lo elencano.
È proprio questa asimmetria a motivare il ruolo di un router in questo confronto, anziché ridurlo a una nota a piè di pagina. I due modelli non competono per le stesse richieste. Gemini 3.1 Pro Preview è l'incumbent che potresti già pagare, e la domanda a cui questa pagina risponde è se il nuovo modello economico possa conquistare una quota del suo traffico. Eseguire correttamente quel test significa inviare i tuoi prompt a entrambi e confrontare le risposte, non leggere un indice — e farlo aprendo un secondo contratto, una seconda chiave e un secondo rapporto di fatturazione è l'attrito che impedisce che il test venga mai realizzato. Una sola chiave, entrambe le corsie dove le instradiamo, e il confronto diventa un cambio di configurazione. Il failover automatico copre l'altra metà: un modello preview può essere ritirato o soggetto a limiti di frequenza con breve preavviso, e una seconda corsia dietro lo stesso endpoint è ciò che trasforma tutto questo da un'interruzione in una decisione di routing.

Quale scegliere
Scegli Gemini 3.1 Pro Preview quando l'attività richiede input PDF e audio in modo nativo, quando sei già all'interno dell'ecosistema Google, o quando hai specificamente bisogno del comportamento di quel modello e puoi convivere con il rischio di deprecazione di un endpoint in anteprima. Il suo tempo al primo token di 63 secondi significa che, in pratica, è un modello per batch e carichi di lavoro offline, qualunque cosa dica il marketing sull'interattività.
Scegli MiMo-V2.6-Pro quando il volume è il vincolo, quando il ciclo è ricco di contesto e ripetitivo, quando vuoi i pesi sul tuo hardware — la licenza MIT consente la distribuzione commerciale, la modifica e l'ulteriore addestramento — o quando la latenza del primo token fa parte del prodotto. È il raro caso di un modello economico che è anche quello veloce, e questa combinazione vale più di quanto suggeriscano i sedici punti di indice.
A cambiare questo quadro sarebbe un successore non in anteprima di Gemini 3.1 Pro, oppure una riproduzione indipendente delle cifre DeepSWE che Xiaomi ha pubblicato dal proprio harness — 72,57 per Pro, 65,68 per Flash, passando rispettivamente da 58,4 e 48,8 nel corso della run di reinforcement learning. Quei numeri sono riportati dal fornitore, valutati sul grader di Xiaomi con mini-swe-agent alla media su tre, e non sottoposti a una classifica pubblica. Finché qualcuno non li rieseguirà, il 46 di Artificial Analysis è il numero da citare, ed è misurato con lo stesso metro del 30.
OrcaRouter mette oltre 200 modelli dietro un unico endpoint compatibile con OpenAI al prezzo di listino del provider con 0% di ricarico, così una variazione di prezzo del fornitore è attiva lo stesso giorno.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
