Una scheda del titolo per il confronto tra Xiaomi MiMo-V2.6-Pro e MiniMax M3, con due schede tecniche contrapposte: Xiaomi MiMo-V2.6-Pro con Intelligence Index v4.3.2 46, velocità di output di 134,3 token/secondo, costo misto di 0,18 $ per 1M e 1 provider API, contro MiniMax M3 con Index 29, 168,9 token/secondo, 0,22 $ e 15 provider API.
Guides & Insights

Xiaomi MiMo-V2.6-Pro vs MiniMax M3: Il punteggio migliore ha la strada più sottile

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Xiaomi MiMo-V2.6-Pro è diventato disponibile al pubblico il 22 settembre 2026 e ha conquistato la prima posizione tra i modelli open-weights nell'Artificial Analysis Intelligence Index con 46 su v4.3.2. MiniMax M3 detiene una versione di quel titolo dal suo lancio, il 31 maggio 2026, e oggi, sullo stesso indice, totalizza 29 — diciassette punti in meno. Il punteggio è la cosa meno interessante della coppia. MiniMax M3 serve a 168,9 token di output al secondo contro 134,3, risponde in 0,92 secondi contro 2,15, costa meno per token di input ed è raggiungibile tramite quindici fornitori di API contro uno di Xiaomi. Il modello più nuovo e con il punteggio più alto è quello più difficile da chiamare davvero, ed è proprio di questa inversione che parla questo confronto.

Entrambi con pesi aperti, entrambi multimodali, a quattordici settimane di distanza

I due modelli sono stretti parenti quanto a intento progettuale. Entrambi sono modelli sparse mixture-of-experts provenienti da laboratori cinesi, entrambi offrono una finestra di contesto da 1M di token, entrambi accettano immagini e video in modo nativo anziché tramite un adattatore aggiunto a posteriori, ed entrambi pubblicano i pesi. Quattordici settimane separano i loro rilasci, e il divario nell'indice tra loro è la distanza che la frontiera open-weights ha percorso in quella finestra.

• Parametri totali — Xiaomi MiMo-V2.6-Pro 1,02T; MiniMax M3 circa 427B, entrambi MoE sparsi

• Attivi per token — Xiaomi MiMo-V2.6-Pro 42B; MiniMax M3 circa 23–25B

• Contesto — 1M token ciascuno, con MiniMax M3 che garantisce un minimo di 512K

• Modalità di input — testo, immagine e video per entrambi; Xiaomi aggiunge l'input audio

• Pesi — licenza MIT su Xiaomi MiMo-V2.6-Pro; MiniMax M3 è distribuito con la MiniMax Community Licence, che non è permissiva e richiede un accordo separato per l'uso commerciale

• Rilasciato — Xiaomi MiMo-V2.6-Pro 21–22 settembre 2026; MiniMax M3 31 maggio 2026

• Raggiungibilità — un provider API conteggiato per Xiaomi MiMo-V2.6-Pro su Artificial Analysis; quindici per MiniMax M3

Quell'ultima riga è quella da tenere d'occhio. Tutto il resto della scheda favorisce il modello più recente. Quella riga no, ed è la riga che decide se un modello può trovare posto in un percorso produttivo.

Che cosa misura l’indice, e chi lo ha misurato

Artificial Analysis ha eseguito entrambi i modelli direttamente su v4.3.2 — un composito di dieci valutazioni che copre ragionamento, conoscenza, matematica e programmazione, tra cui AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. Né il 46 né il 29 sono numeri del fornitore, il che qui conta perché entrambi i laboratori hanno anche pubblicato valori di benchmark propri che sono numeri del fornitore, e i due tipi non devono essere mescolati.

Il 46 colloca Xiaomi MiMo-V2.6-Pro in testa al campo dei pesi aperti su quel composito. Non lo colloca però in testa all'indice: Claude Fable 5.1 e GPT-6 Astra si attestano entrambi a 53, e Claude Opus 5 a 51. Il 29 di MiniMax M3 lo pone al sedicesimo posto su 114 modelli misurati, ben al di sopra della mediana della sua classe dimensionale ma molto lontano dalla frontiera con cui veniva confrontato a giugno.

MiniMax M3 ha le prove che Xiaomi non ha

Questa è la parte del confronto che viene saltata, ed è la parte che un acquirente dovrebbe valutare con maggiore attenzione. MiniMax M3 è nella classifica pubblica DeepSWE v1.1 con una voce ufficiale: 20,4% Pass@1 e 48,7% Pass@4, pubblicata l'8 giugno 2026 dopo che un aggiornamento dell'inferenza MiniMax ha corretto una generazione anomala di token e migliorato il comportamento della cache per contesti lunghi. Quella voce era accompagnata da un conteggio dell'efficienza, e il conteggio non è lusinghiero: una mediana di 311 step dell'agente, circa 91.000 token di output e circa 5,04 $ per attività. Supera compiti di ingegneria a lungo orizzonte, e lo fa in modo costoso.

Il dato di benchmark di punta di Xiaomi per il suo nuovo modello è 72,57 su DeepSWE v1.1, in rialzo rispetto a una baseline di 58,4, misurato con mini-swe-agent come media di tre esecuzioni sull'harness di Xiaomi. Non è una voce in classifica e non è stata presentata come tale. Mettere 72,57 accanto al 20,4 di MiniMax e ricavarne una vittoria di 52 punti è aritmetica tra due misurazioni diverse: la classifica pubblica Pass@1 per una configurazione specifica, con un intervallo di confidenza e un costo medio per task, e una terza parte può rieseguire la misurazione; alla cifra del fornitore, invece, non è allegato nulla di tutto ciò. Il 72,57 può benissimo essere onesto. Semplicemente non è lo stesso tipo di oggetto.

Anche MiniMax ha pubblicato cifre di lancio proprie, e la stessa avvertenza vale per ognuna: SWE-Bench Pro a 59,0, BrowseComp a 83,5, SVG-Bench a 63,7 e Terminal-Bench 2.1 a 66,0, eseguite sull'infrastruttura di MiniMax con il suo scaffolding. Considerale affermazioni sul modello, non misurazioni dello stesso.

Velocità, latenza e i due numeri che determinano una bolletta

Il divario di throughput va in direzione opposta rispetto a quello di qualità, ed è abbastanza ampio da essere rilevante. MiniMax M3 genera 168,9 token di output al secondo contro i 134,3 di Xiaomi MiMo-V2.6-Pro, e i suoi 0,92 secondi al primo token sono circa due volte e mezzo più rapidi dei 2,15 di Xiaomi. Per un prodotto interattivo, la latenza del primo token è il numero che l'utente percepisce; per una pipeline batch, il throughput è il numero che determina il tempo reale.

Sul costo, i due sono più vicini di quanto suggeriscano le tariffe di listino, e la direzione dipende dal tuo traffico. MiniMax M3 è listato a $0,30 per milione di token di input e $1,20 per milione di output; Xiaomi MiMo-V2.6-Pro è listato a $0,43 e $0,87. M3 costa meno per l'alimentazione, Xiaomi costa meno per la generazione. Una volta applicati gli sconti sulla cache — 80% per M3, 99% per Xiaomi — le tariffe combinate si attestano a $0,22 e $0,18 per milione su un mix 7:2:1 di cache-hit/input/output. Artificial Analysis registra anche un costo di $0,13 per attività dell'Intelligence Index per Xiaomi MiMo-V2.6-Pro, misurato allo stesso modo su ogni modello presente nella classifica, che è il singolo dato di costo più comparabile disponibile per i due.

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and MiniMax M3 covering Intelligence Index v4.3.2 (46 vs 29), output speed (134.3 vs 168.9 tokens/second), time to first token (2.15s vs 0.92s), blended rate ($0.18 vs $0.22 per 1M), API providers (1 vs 15) and long-horizon evidence (vendor harness only vs public Pass@1 entry).

Quindici rotte contro una, e quanto vale il failover

Un vantaggio di diciassette punti sull'indice non serve a nulla se l'endpoint è inattivo. Artificial Analysis ha contato un solo provider API per Xiaomi MiMo-V2.6-Pro al momento della stesura, e quel conteggio è un fatto riguardante il rilascio più che il modello: un checkpoint pubblicato tre giorni fa non ha avuto il tempo di propagarsi. MiniMax M3, vecchio di quattro mesi, è servito da quindici.

Quella differenza è ciò per cui serve un router, ed è il punto in cui i due modelli divergono commercialmente. MiniMax M3 è su OrcaRouter come minimax/minimax-m3: un endpoint compatibile con OpenAI, con il prezzo di listino del provider trasferito senza alcun markup, quindi i $0,30 e i $1,20 citati sopra sono i numeri di MiniMax e non i nostri, e una variazione di prezzo di MiniMax è attiva dalla nostra parte lo stesso giorno. I suoi quindici upstream sono ciò che rende significativa una catena di failover automatico — una richiesta che si blocca su un provider viene ritentata su un altro prima che inizi la risposta, il che è una garanzia diversa da quella di un modello che ha un solo posto a cui andare. Xiaomi MiMo-V2.6-Pro non è su OrcaRouter; nessun modello Xiaomi lo è, e raggiungerlo oggi significa la piattaforma di Xiaomi stessa e i cataloghi di terze parti che lo elencano.

Se li vuoi entrambi nella stessa applicazione, la forma pratica è un'unica chiave che contiene i modelli che hai già scelto, con il nuovo arrivato valutato rispetto a essi anziché adottato sulla base di un punteggio vecchio di tre giorni. Questa è una decisione di instradamento, e la proprietà utile è che una corsia di fallback non costa nulla fino al giorno in cui ti salva.

The OrcaRouter model page for minimax/minimax-m3, showing MiniMax as the vendor, the 2026-05-31 release date, Vision, Tools, JSON and Reasoning capability tags, a 1M-token context window, 512K maximum output, $0.30 per 1M input and $1.20 per 1M output, and a p50 time to first token of 8.49 seconds.

Quale scegliere?

Se ti serve un modello multimodale a pesi aperti da un milione di token in produzione questa settimana, la risposta è MiniMax M3, e non c'è gara: quindici fornitori, primo token in meno di un secondo, un percorso commerciale sufficientemente permissivo solo se hai letto la licenza della community, e una voce ufficiale di benchmark a lungo orizzonte che puoi ispezionare. L'avvertimento sull'efficienza è reale: metti in budget 91.000 token di output per attività, non solo la tariffa per token.

Se stai scegliendo un modello per un lavoro che inizierai il mese prossimo, Xiaomi MiMo-V2.6-Pro è il modello più capace di un ampio margine misurato, a una tariffa mista inferiore e con una licenza MIT che elimina del tutto la questione della licenza. Quello che non ha ancora è un secondo posto dove essere eseguito. La cosa da tenere d'occhio è il numero di provider: quando passa da uno, il divario di diciassette punti smette di essere un risultato di ricerca e diventa una decisione di distribuzione.

Fino ad allora, la sintesi onesta è che il modello migliore è quello da cui non puoi eseguire il failover, e il modello più debole è quello che puoi mettere davanti ai clienti stasera.

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

Da dove provengono i numeri in questo pezzo

I punteggi dell'indice, il throughput, la latenza, gli sconti sulla cache e il numero di fornitori per entrambi i modelli sono misurazioni di Artificial Analysis sull'Intelligence Index v4.3.2, rilevate il 22 settembre 2026, e il 29 di MiniMax M3 si colloca sulla stessa versione del composito del 46 di Xiaomi MiMo-V2.6-Pro. I dati di DeepSWE v1.1 per MiniMax M3 provengono dalla voce pubblica della classifica dell'8 giugno 2026. Il passaggio di DeepSWE da 58,4 a 72,57, la spesa per il reinforcement learning di circa 2,62 milioni di dollari per l'esecuzione Pro su trenta step, e i numeri di SWE-Bench Pro, BrowseComp, SVG-Bench e Terminal-Bench per MiniMax M3 sono tutti comunicati dai fornitori sui rispettivi harness dei laboratori stessi e non sono stati riprodotti in modo indipendente. Le tariffe per token sono i prezzi di listino dei fornitori stessi.