
MiMo-V2.6-Pro vs Kimi K3: due modelli open weights da duemila miliardi di parametri, con quattordici volte di differenza nel costo per attività
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Entrambi sono modelli mixture-of-experts con pesi aperti, provenienti da laboratori cinesi, con una finestra di contesto da 1 milione di token. Entrambi sono disponibili per il download. Sull'Artificial Analysis Intelligence Index v4.3.2, consultato il 22 settembre 2026, Kimi K3 di MoonshotAI ottiene 44 e MiMo-V2.6-Pro di Xiaomi ottiene 46. Due punti. Il costo misurato per eseguire la stessa suite di valutazione su ciascuno è di $3.658,07 per Kimi K3 e $206,66 per MiMo-V2.6-Pro — un fattore di diciassette. Se hai già deciso che vuoi pesi aperti in questa classe, è quel rapporto, non i due punti, a essere decisivo.
Kimi K3 è il modello affermato in questa coppia: rilasciato il 16 luglio 2026, con i pesi completi arrivati il 27 luglio, e mesi di valutazione indipendente alle spalle. Xiaomi MiMo-V2.6-Pro è diventato disponibile in generale il 22 settembre 2026, con i suoi repository dei checkpoint di reinforcement learning apparsi il giorno precedente. Il confronto è quindi tra un modello aperto collaudato a prezzo premium e uno nuovissimo a prezzo di commodity, e la parte interessante è quanto sia risultato stretto il divario di capacità misurato.
Cosa è realmente ciascun modello
Kimi K3 è un modello di ragionamento multimodale a pesi aperti da 2,8 trilioni di parametri, descritto al momento del rilascio come il primo modello aperto della classe dei tre trilioni. Attiva 16 esperti su 896 per token — circa 104 miliardi di parametri attivi — e utilizza Kimi Delta Attention e Attention Residuals per mantenere efficientemente un contesto di 1M di token, con output fino a 1M di token per richiesta. È un ragionamento sempre attivo con visione nativa. L'API first-party di Moonshot costa 3,00 $ per milione di token di input, 0,30 $ per milione di token di input in cache e 15,00 $ per milione di token di output, a tariffa fissa, senza livelli basati sulla lunghezza del contesto, e Artificial Analysis riporta uno sconto cache del 90% e una tariffa combinata di 2,31 $. Ha misurato 42,8 token di output al secondo — notevolmente lento rispetto a una mediana di 77,9 per modelli di dimensioni comparabili — e 3,93 secondi al primo token.
Xiaomi MiMo-V2.6-Pro è un modello sparse mixture-of-experts da 1,02 trilioni di parametri totali e 42 miliardi attivati per token, con una finestra di contesto da 1 milione di token e multimodalità nativa su testo, immagini, video e audio. I suoi pesi riportano un'etichetta di licenza MIT. Xiaomi ha mantenuto il prezzo della generazione precedente invece di rincarare il nuovo checkpoint, ed è per questo che è listato a 0,43 $ per milione di token di input e 0,87 $ per milione di token di output, con uno sconto cache del 99% e un costo misto di 0,18 $. Ha misurato 134,3 token di output al secondo — undicesimo su 114 modelli per velocità — e 2,15 secondi al primo token.
• Parametri attivi — MiMo-V2.6-Pro 42B per token; Kimi K3 circa 104B, attivando 16 esperti su 896
• Parametri totali — MiMo-V2.6-Pro 1,02T; Kimi K3 2,8T
• Punteggio dell'indice — MiMo-V2.6-Pro 46; Kimi K3 44, entrambi Artificial Analysis v4.3.2
• Prezzo di listino — MiMo-V2.6-Pro 0,43 $ / 0,87 $ per 1M; Kimi K3 3,00 $ / 15,00 $, input in cache 0,30 $
• Tariffa mista — MiMo-V2.6-Pro 0,18 $ per 1 mln; Kimi K3 2,31 $
• Costo per l'esecuzione dell'indice — MiMo-V2.6-Pro 206,66 $; Kimi K3 3.658,07 $
• Velocità — MiMo-V2.6-Pro 134,3 token di output al secondo; Kimi K3 42,8, rispetto a una mediana di 77,9 per la classe di dimensioni
• Tempo al primo token — MiMo-V2.6-Pro 2,15 secondi; Kimi K3 3,93 secondi
• Contesto — 1M token entrambi; Kimi K3 pubblica output fino a 1M token per richiesta
• Pesi — entrambi scaricabili; MiMo-V2.6-Pro riporta un'etichetta MIT

La velocità è la differenza che l'indice nasconde
Il divario composito di due punti è il numero meno interessante qui, e il 134,3 contro 42,8 token al secondo è il più interessante. Un modello che genera tre volte più velocemente non è tre volte migliore, ma è la differenza tra una classe di applicazioni che funziona e una che non funziona — e la pagina di Artificial Analysis dedicata a Kimi K3 lo segnala come notevolmente lento per la sua classe di dimensioni. Per un ciclo di agente a lungo orizzonte che effettua dozzine di chiamate sequenziali, il throughput si accumula come la latenza: una differenza tripla per chiamata non è una differenza tripla end-to-end, ma è la differenza tra una sessione che un utente aspetta fino in fondo e una che abbandona.
Il vantaggio di Kimi K3 è sul lato degli input del bilancio. I suoi 3,93 secondi al primo token sono più lenti dei 2,15 di MiMo-V2.6-Pro, ma non di un ordine di grandezza tale da separare ciascuno di essi da un modello di ragionamento di frontiera a massimo sforzo. È nella generazione che K3 paga la sua dimensione, e la generazione è ciò per cui si viene fatturati.
I numeri del fornitore, e quello che viene letto male
Entrambi i laboratori hanno pubblicato i valori di DeepSWE v1.1 ottenuti dai propri sistemi di valutazione, e i due sono in circolazione come se fossero comparabili. Non lo sono, ed è proprio questa coppia il punto in cui quell'errore fa più danni, perché i numeri sembrano così vicini tra loro.
Xiaomi riferisce che MiMo-V2.6-Pro passa da 58,4 a 72,57 su DeepSWE v1.1 nel corso della sua sessione di reinforcement learning, valutato con mini-swe-agent come media di tre prove sul grader di Xiaomi. La sessione è documentata come 30 step e circa 750.000 traiettorie per modello, completata in meno di sei giorni con una spesa dichiarata di circa 2,62 milioni di dollari per il modello Pro e 854.044 dollari per il più piccolo Flash. Una lettura ampiamente diffusa di quella sessione colloca Kimi K3 a 68,51 sullo stesso benchmark, il che renderebbe il modello Xiaomi il vincitore con quattro punti di vantaggio. Quella lettura è un dato della community, non un numero di Moonshot, e le due misurazioni usano metriche diverse — media di tre prove contro un tasso di superamento — quindi sottrarle è aritmetica su scale non omogenee. Nessuno dei due fornitori ha inviato una configurazione alla board pubblica di Datacurve per questi modelli.
Il numero davvero comparabile è l'indice, perché Artificial Analysis ha eseguito entrambi direttamente: 46 per MiMo-V2.6-Pro e 44 per Kimi K3, su v4.3.2, con la ripartizione per valutazione non pubblicata per nessuno dei due. Quel margine di due punti è abbastanza piccolo da rientrare nel rumore di un composito di dieci valutazioni, e la conclusione onesta è che, in termini di capacità misurata, questi due modelli sono di fatto alla pari.
Che cosa offre il premium di Kimi K3
Sarebbe sbagliato interpretare il divario di costo come puro margine. Kimi K3 è un modello da 2,8 trilioni di parametri contro quello da 1,02 trilioni di Xiaomi, e attiva all'incirca due volte e mezzo i parametri per token. È stato il primo modello aperto nella sua classe dimensionale e vanta una serie di risultati indipendenti che MiMo-V2.6-Pro semplicemente non ha avuto il tempo di accumulare: secondo quanto riportato dalla stessa Artificial Analysis, al momento del suo rilascio si è classificato terzo nell'Intelligence Index, dietro Claude Fable 5 e GPT-5.6 Sol, con GDPval-AA v2 a Elo 1668, primo posto in AutomationBench-AA al 53%, secondo in AA-Briefcase a Elo 1547 e primo nella Frontend Code Arena a 1679. Si tratta di misurazioni indipendenti, non di dichiarazioni di lancio, e descrivono un modello con un'ampiezza che un margine composito di due punti non riesce a cogliere.
C'è anche una questione di capacità correlata. La domanda per Kimi K3 avrebbe sopraffatto la capacità di servizio al lancio, causando pause temporanee degli abbonamenti API e limiti di capacità a monte su alcuni gateway. Un modello difficile da ottenere è un modello su cui è difficile costruire, e si tratta di un problema di disponibilità più che di qualità.

Un solo endpoint, e una risposta chiara su ciò che instradiamo
Kimi K3 è su OrcaRouter come kimi/kimi-k3 — una chiave compatibile con OpenAI, il prezzo di listino del provider passato con 0% di ricarico, così un cambiamento di prezzo di Moonshot è attivo dalla nostra parte lo stesso giorno, e il failover automatico tra provider copre i limiti di capacità che hanno afflitto questo modello fin dal lancio. Xiaomi MiMo-V2.6-Pro non è su OrcaRouter. Nessun modello Xiaomi lo è, e la via per accedervi oggi è la piattaforma di Xiaomi stessa o uno dei cataloghi di terze parti che lo includono. Vale la pena dirlo chiaramente anziché lasciare che una pagina del modello lasci intendere il contrario.
Il che rende questo abbinamento un buon esempio di ciò a cui serve il layer di routing. Due modelli aperti, a pari merito sull'unica misura indipendente su cui entrambi sono stati testati, con un divario di diciassette volte sul costo misurato per attività — non è una scelta, è una configurazione a due corsie. Metti la maggior parte del tuo traffico sulla corsia economica e instrada la coda verso l'altra in base a un predicato che definisci tu, oppure esegui il failover quando una rotta si degrada. Con i modelli dietro un'unica chiave, l'esperimento che ti dice quale quota debba prendere ciascuno è una modifica di configurazione sui tuoi prompt anziché una conversazione con l'ufficio acquisti — e se Xiaomi riprezza MiMo-V2.6-Pro una volta chiusa la finestra di lancio, o Moonshot taglia le tariffe di K3 in risposta alla concorrenza, entrambe le mosse si applicano dalla nostra parte lo stesso giorno anziché al successivo ciclo di fatturazione.

Quale scegliere
Scegli Kimi K3 quando ti serve l'ampiezza che deriva da un modello di queste dimensioni e misurato in modo indipendente — visione, coding a lungo orizzonte su repository di grandi dimensioni, uso agentico degli strumenti — o quando lo stai già utilizzando e il costo di migrazione è reale. È il modello più approfonditamente caratterizzato dei due, e il suo tetto di output di 1M di token è insolito. Metti in conto la velocità di generazione: a 42,8 token al secondo, in termini interattivi è un modello per batch e carichi di lavoro offline, qualunque cosa suggerisca la sua qualità di ragionamento.
Scegli MiMo-V2.6-Pro quando throughput ed economia unitaria sono il vincolo, quando il ciclo è ricco di contesto e ripetitivo, quando conta la latenza del primo token, o quando vuoi i pesi sul tuo hardware con una licenza permissiva. È il raro caso di un modello economico che è anche quello veloce, e sull'unico punteggio indipendente che entrambi i modelli condividono, è avanti di un margine abbastanza piccolo da essere un pareggio.
Scegli entrambi se hai un router. La modalità di errore da evitare è standardizzare su uno dei due a causa di un rapporto da titolo: pagare tariffe Kimi K3 per un lavoro di riassunto che un modello a 46 indici completa in modo identico, oppure scoprire che un'attività di programmazione su scala repository richiede il modello 2.8T dopo che hai spostato tutto sulla corsia economica. Nessuno dei due è un problema di modello, ed entrambi sono configurazione.
OrcaRouter mette oltre 200 modelli dietro un unico endpoint compatibile con OpenAI al prezzo di listino del provider con 0% di ricarico, così una variazione di prezzo del fornitore è attiva lo stesso giorno.
