
Xiaomi MiMo-V2.6-Pro vs MiniMax M3: Il punteggio migliore ha la strada più sottile
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro è diventato disponibile al pubblico il 22 settembre 2026 e ha conquistato la prima posizione tra i modelli open-weights nell'Artificial Analysis Intelligence Index con 46 su v4.3.2. MiniMax M3 detiene una versione di quel titolo dal suo lancio, il 31 maggio 2026, e oggi, sullo stesso indice, totalizza 29 — diciassette punti in meno. Il punteggio è la cosa meno interessante della coppia. MiniMax M3 serve a 168,9 token di output al secondo contro 134,3, risponde in 0,92 secondi contro 2,15, costa meno per token di input ed è raggiungibile tramite quindici fornitori di API contro uno di Xiaomi. Il modello più nuovo e con il punteggio più alto è quello più difficile da chiamare davvero, ed è proprio di questa inversione che parla questo confronto.
Entrambi con pesi aperti, entrambi multimodali, a quattordici settimane di distanza
I due modelli sono stretti parenti quanto a intento progettuale. Entrambi sono modelli sparse mixture-of-experts provenienti da laboratori cinesi, entrambi offrono una finestra di contesto da 1M di token, entrambi accettano immagini e video in modo nativo anziché tramite un adattatore aggiunto a posteriori, ed entrambi pubblicano i pesi. Quattordici settimane separano i loro rilasci, e il divario nell'indice tra loro è la distanza che la frontiera open-weights ha percorso in quella finestra.
• Parametri totali — Xiaomi MiMo-V2.6-Pro 1,02T; MiniMax M3 circa 427B, entrambi MoE sparsi
• Attivi per token — Xiaomi MiMo-V2.6-Pro 42B; MiniMax M3 circa 23–25B
• Contesto — 1M token ciascuno, con MiniMax M3 che garantisce un minimo di 512K
• Modalità di input — testo, immagine e video per entrambi; Xiaomi aggiunge l'input audio
• Pesi — licenza MIT su Xiaomi MiMo-V2.6-Pro; MiniMax M3 è distribuito con la MiniMax Community Licence, che non è permissiva e richiede un accordo separato per l'uso commerciale
• Rilasciato — Xiaomi MiMo-V2.6-Pro 21–22 settembre 2026; MiniMax M3 31 maggio 2026
• Raggiungibilità — un provider API conteggiato per Xiaomi MiMo-V2.6-Pro su Artificial Analysis; quindici per MiniMax M3
Quell'ultima riga è quella da tenere d'occhio. Tutto il resto della scheda favorisce il modello più recente. Quella riga no, ed è la riga che decide se un modello può trovare posto in un percorso produttivo.
Che cosa misura l’indice, e chi lo ha misurato
Artificial Analysis ha eseguito entrambi i modelli direttamente su v4.3.2 — un composito di dieci valutazioni che copre ragionamento, conoscenza, matematica e programmazione, tra cui AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. Né il 46 né il 29 sono numeri del fornitore, il che qui conta perché entrambi i laboratori hanno anche pubblicato valori di benchmark propri che sono numeri del fornitore, e i due tipi non devono essere mescolati.
Il 46 colloca Xiaomi MiMo-V2.6-Pro in testa al campo dei pesi aperti su quel composito. Non lo colloca però in testa all'indice: Claude Fable 5.1 e GPT-6 Astra si attestano entrambi a 53, e Claude Opus 5 a 51. Il 29 di MiniMax M3 lo pone al sedicesimo posto su 114 modelli misurati, ben al di sopra della mediana della sua classe dimensionale ma molto lontano dalla frontiera con cui veniva confrontato a giugno.
MiniMax M3 ha le prove che Xiaomi non ha
Questa è la parte del confronto che viene saltata, ed è la parte che un acquirente dovrebbe valutare con maggiore attenzione. MiniMax M3 è nella classifica pubblica DeepSWE v1.1 con una voce ufficiale: 20,4% Pass@1 e 48,7% Pass@4, pubblicata l'8 giugno 2026 dopo che un aggiornamento dell'inferenza MiniMax ha corretto una generazione anomala di token e migliorato il comportamento della cache per contesti lunghi. Quella voce era accompagnata da un conteggio dell'efficienza, e il conteggio non è lusinghiero: una mediana di 311 step dell'agente, circa 91.000 token di output e circa 5,04 $ per attività. Supera compiti di ingegneria a lungo orizzonte, e lo fa in modo costoso.
Il dato di benchmark di punta di Xiaomi per il suo nuovo modello è 72,57 su DeepSWE v1.1, in rialzo rispetto a una baseline di 58,4, misurato con mini-swe-agent come media di tre esecuzioni sull'harness di Xiaomi. Non è una voce in classifica e non è stata presentata come tale. Mettere 72,57 accanto al 20,4 di MiniMax e ricavarne una vittoria di 52 punti è aritmetica tra due misurazioni diverse: la classifica pubblica Pass@1 per una configurazione specifica, con un intervallo di confidenza e un costo medio per task, e una terza parte può rieseguire la misurazione; alla cifra del fornitore, invece, non è allegato nulla di tutto ciò. Il 72,57 può benissimo essere onesto. Semplicemente non è lo stesso tipo di oggetto.
Anche MiniMax ha pubblicato cifre di lancio proprie, e la stessa avvertenza vale per ognuna: SWE-Bench Pro a 59,0, BrowseComp a 83,5, SVG-Bench a 63,7 e Terminal-Bench 2.1 a 66,0, eseguite sull'infrastruttura di MiniMax con il suo scaffolding. Considerale affermazioni sul modello, non misurazioni dello stesso.
Velocità, latenza e i due numeri che determinano una bolletta
Il divario di throughput va in direzione opposta rispetto a quello di qualità, ed è abbastanza ampio da essere rilevante. MiniMax M3 genera 168,9 token di output al secondo contro i 134,3 di Xiaomi MiMo-V2.6-Pro, e i suoi 0,92 secondi al primo token sono circa due volte e mezzo più rapidi dei 2,15 di Xiaomi. Per un prodotto interattivo, la latenza del primo token è il numero che l'utente percepisce; per una pipeline batch, il throughput è il numero che determina il tempo reale.
Sul costo, i due sono più vicini di quanto suggeriscano le tariffe di listino, e la direzione dipende dal tuo traffico. MiniMax M3 è listato a $0,30 per milione di token di input e $1,20 per milione di output; Xiaomi MiMo-V2.6-Pro è listato a $0,43 e $0,87. M3 costa meno per l'alimentazione, Xiaomi costa meno per la generazione. Una volta applicati gli sconti sulla cache — 80% per M3, 99% per Xiaomi — le tariffe combinate si attestano a $0,22 e $0,18 per milione su un mix 7:2:1 di cache-hit/input/output. Artificial Analysis registra anche un costo di $0,13 per attività dell'Intelligence Index per Xiaomi MiMo-V2.6-Pro, misurato allo stesso modo su ogni modello presente nella classifica, che è il singolo dato di costo più comparabile disponibile per i due.

Quindici rotte contro una, e quanto vale il failover
Un vantaggio di diciassette punti sull'indice non serve a nulla se l'endpoint è inattivo. Artificial Analysis ha contato un solo provider API per Xiaomi MiMo-V2.6-Pro al momento della stesura, e quel conteggio è un fatto riguardante il rilascio più che il modello: un checkpoint pubblicato tre giorni fa non ha avuto il tempo di propagarsi. MiniMax M3, vecchio di quattro mesi, è servito da quindici.
Quella differenza è ciò per cui serve un router, ed è il punto in cui i due modelli divergono commercialmente. MiniMax M3 è su OrcaRouter come minimax/minimax-m3: un endpoint compatibile con OpenAI, con il prezzo di listino del provider trasferito senza alcun markup, quindi i $0,30 e i $1,20 citati sopra sono i numeri di MiniMax e non i nostri, e una variazione di prezzo di MiniMax è attiva dalla nostra parte lo stesso giorno. I suoi quindici upstream sono ciò che rende significativa una catena di failover automatico — una richiesta che si blocca su un provider viene ritentata su un altro prima che inizi la risposta, il che è una garanzia diversa da quella di un modello che ha un solo posto a cui andare. Xiaomi MiMo-V2.6-Pro non è su OrcaRouter; nessun modello Xiaomi lo è, e raggiungerlo oggi significa la piattaforma di Xiaomi stessa e i cataloghi di terze parti che lo elencano.
Se li vuoi entrambi nella stessa applicazione, la forma pratica è un'unica chiave che contiene i modelli che hai già scelto, con il nuovo arrivato valutato rispetto a essi anziché adottato sulla base di un punteggio vecchio di tre giorni. Questa è una decisione di instradamento, e la proprietà utile è che una corsia di fallback non costa nulla fino al giorno in cui ti salva.

Quale scegliere?
Se ti serve un modello multimodale a pesi aperti da un milione di token in produzione questa settimana, la risposta è MiniMax M3, e non c'è gara: quindici fornitori, primo token in meno di un secondo, un percorso commerciale sufficientemente permissivo solo se hai letto la licenza della community, e una voce ufficiale di benchmark a lungo orizzonte che puoi ispezionare. L'avvertimento sull'efficienza è reale: metti in budget 91.000 token di output per attività, non solo la tariffa per token.
Se stai scegliendo un modello per un lavoro che inizierai il mese prossimo, Xiaomi MiMo-V2.6-Pro è il modello più capace di un ampio margine misurato, a una tariffa mista inferiore e con una licenza MIT che elimina del tutto la questione della licenza. Quello che non ha ancora è un secondo posto dove essere eseguito. La cosa da tenere d'occhio è il numero di provider: quando passa da uno, il divario di diciassette punti smette di essere un risultato di ricerca e diventa una decisione di distribuzione.
Fino ad allora, la sintesi onesta è che il modello migliore è quello da cui non puoi eseguire il failover, e il modello più debole è quello che puoi mettere davanti ai clienti stasera.

Da dove provengono i numeri in questo pezzo
I punteggi dell'indice, il throughput, la latenza, gli sconti sulla cache e il numero di fornitori per entrambi i modelli sono misurazioni di Artificial Analysis sull'Intelligence Index v4.3.2, rilevate il 22 settembre 2026, e il 29 di MiniMax M3 si colloca sulla stessa versione del composito del 46 di Xiaomi MiMo-V2.6-Pro. I dati di DeepSWE v1.1 per MiniMax M3 provengono dalla voce pubblica della classifica dell'8 giugno 2026. Il passaggio di DeepSWE da 58,4 a 72,57, la spesa per il reinforcement learning di circa 2,62 milioni di dollari per l'esecuzione Pro su trenta step, e i numeri di SWE-Bench Pro, BrowseComp, SVG-Bench e Terminal-Bench per MiniMax M3 sono tutti comunicati dai fornitori sui rispettivi harness dei laboratori stessi e non sono stati riprodotti in modo indipendente. Le tariffe per token sono i prezzi di listino dei fornitori stessi.
