
Xiaomi MiMo-V2.6-Pro in testa all'Open-Weights Index con 46 — e pubblica il conto dell'addestramento
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro è ora il modello open-weights con il punteggio più alto sull'Artificial Analysis Intelligence Index, a 46 su v4.3.2 — un punto di vantaggio su GLM-5.3 e due su Kimi K3, e venti punti al di sopra del 26 che il suo predecessore MiMo-V2.5-Pro ha registrato sulla precedente scala dell'indice. Quel numero è stato prodotto da Artificial Analysis eseguendo il proprio harness, non da Xiaomi, ed è il fatto più utile in assoluto in questo rilascio. Il secondo fatto più utile è il prezzo stampato accanto: 0,43 $ per milione di token di input, 0,87 $ per milione di output, contro 5,00 $ e 25,00 $ per Claude Opus 5 — un modello che si colloca cinque punti più in alto nell'indice. Il terzo è quello che nessuno si aspettava che Xiaomi consegnasse: un resoconto pubblico di quanto sia effettivamente costata l'esecuzione di reinforcement learning che ha prodotto MiMo-V2.6-Pro.
Il punteggio è una misurazione, non un'affermazione
Quasi tutto ciò che viene pubblicato sul lancio di un modello cinese arriva come un numero del fornitore, e i lettori hanno imparato a scontarlo. Questo è diverso, e la differenza merita di essere precisata, perché la copertura del lancio l'ha già offuscata.
Artificial Analysis ha valutato MiMo-V2.6-Pro stesso, sulla composite v4.3.2 — dieci valutazioni che coprono ragionamento, conoscenza, matematica e coding, tra cui AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. Il 46 è ciò che quella suite ha restituito. Ha anche registrato le caratteristiche operative che decidono se un modello è utilizzabile e non solo buono: 134,3 token di output al secondo, 2,15 secondi al primo token, uno sconto sulla cache del 99% e un costo misurato di 0,13 $ per attività dell'Intelligence Index.
Due di questi meritano di essere sottolineati. I 134,3 token al secondo collocano MiMo-V2.6-Pro all'undicesimo posto su 114 modelli per velocità — per un modello mixture-of-experts da mille miliardi di parametri, questo è un risultato di serving, non solo di training. E lo 0,13 $ per attività è il numero che sopravvive al contatto con un budget: è quanto è effettivamente costato eseguire l'indice su questo modello, misurato allo stesso modo per ogni modello della classifica, il che lo rende comparabile in un modo in cui i tassi per token da titolo non lo sono.

Cosa copre e cosa non copre l'indice
La corona degli open-weights è reale ma più stretta di quanto non appaia. Con 46, MiMo-V2.6-Pro guida la categoria open-weights. Non guida l'indice. La vetta della v4.3 è occupata da Claude Fable 5.1 con effort massimo e fallback predefinito e da GPT-6 Astra con max effort, entrambi a 53, con Claude Opus 5 a 51 e Claude Fable 5 a 50. Quindi la lettura onesta è un divario di cinque punti dalla frontiera su un composito che premia l'ampiezza, e un miglioramento di venti punti rispetto alla generazione precedente di Xiaomi stessa.
• Leader open-weights — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• In testa allo stesso indice — Claude Fable 5.1 (max, fallback) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51
• Velocità — 134,3 token di output al secondo, undicesimo su 114 modelli misurati; la mediana per la classe dimensionale è 77,9
• Tempo al primo token — 2,15 secondi, rispetto a una mediana di 2,34 secondi
• Costo per attività dell'Intelligence Index — $0,13, con un costo di esecuzione dell'intera valutazione pari a $206,66
• Tariffa di listino — 0,43 $ per milione di token di input, 0,87 $ per milione di output, uno sconto cache del 99% e un costo combinato di 0,18 $ con un mix 7:2:1 di cache-hit/input/output
Un numero sulla pagina di Artificial Analysis è una vera avvertenza più che un vanto: al momento della stesura contava un solo fornitore di API per MiMo-V2.6-Pro. Questo è il collo di bottiglia pratico per questo modello in questo momento, e non è un problema di qualità — è un problema di disponibilità. Un modello raggiungibile attraverso un'unica via non ha failover. Se quella via si degrada, la tua applicazione si degrada con essa, e il failover è esattamente ciò che un router ha il compito di fornire. L'osservazione rilevante per chiunque pianifichi in base a questo rilascio è che non ospitiamo MiMo-V2.6-Pro, e non fingeremo il contrario; la via per raggiungerlo oggi è la piattaforma di Xiaomi stessa e i pochi cataloghi di terze parti che lo elencano.

I due numeri che non devono essere confusi
Xiaomi ha anche pubblicato cifre di benchmark proprie, e sono un tipo di oggetto diverso dal 46. La dashboard dell'azienda riporta MiMo-V2.6-Pro che passa da 58,4 a 72,57 su DeepSWE v1.1 durante la sua esecuzione di reinforcement learning, valutata con mini-swe-agent come media di tre. Quello è l'harness di Xiaomi, il grader di Xiaomi, l'esecuzione offline di Xiaomi. Non è stato sottoposto alla classifica pubblica DeepSWE e non è stato riprodotto da nessuno.
Leggi i due fianco a fianco e la tentazione è di considerare 72.57 come un punteggio alla pari del 74% che la classifica pubblica DeepSWE elenca al livello più alto. Non sono sulla stessa scala. Il dato della classifica è una configurazione sottoposta, Pass@1, con un intervallo di confidenza pubblicato e un costo medio per attività; il dato del fornitore è una valutazione interna senza nulla di tutto ciò allegato. Il nostro articolo del 21 settembre lo ha già fatto notare quando i numeri erano ancora letture da dashboard, e vale ancora ora che i pesi sono stati resi noti. Un harness di un fornitore può essere del tutto onesto e comunque non essere una voce di classifica, perché una voce di classifica è un'affermazione su una configurazione specifica in condizioni specifiche che una terza parte può rieseguire.
La stessa disciplina vale per la spesa destinata all'addestramento. Xiaomi dichiara circa 3.474.715 dollari tra le esecuzioni Pro e Flash — 2.620.670 dollari per Pro, 854.044 dollari per Flash — oltre trenta passi di apprendimento per rinforzo ciascuna e circa 750.000 traiettorie a testa, completate in meno di sei giorni. Sono le cifre di rendicontazione del calcolo della stessa azienda. Sono interessanti perché i laboratori non le pubblicano quasi mai, e non sono un prezzo API, non sono un costo che pagherai e non sono un numero che terzi abbiano verificato.
Cosa ha effettivamente spedito Xiaomi
Il rilascio è un modello sparse mixture-of-experts da 1,02 trilioni di parametri totali, con 42 miliardi attivati per token, una finestra di contesto di 1M token e multimodalità nativa su testo, immagini, video e audio. Il suo gemello Xiaomi MiMo-V2.6-Flash è la stessa architettura su scala più piccola, 309 miliardi in totale e 15 miliardi attivi. I pesi pubblicati riportano un tag di licenza MIT, e il pacchetto di rilascio include un rapporto tecnico, le istruzioni di deployment e — secondo Xiaomi — gli ambienti di addestramento di reinforcement learning e il codice necessari per esaminare e riprodurre il post-training.
Quest'ultimo elemento è la differenza sostanziale tra questo lancio e un tipico annuncio API, e vale la pena separarlo dal marketing. Pubblicare l'ambiente RL è un'affermazione che il setup di addestramento è esaminabile. Se gli ambienti pubblicati siano sufficienti a riprodurre un 72.57 è una questione separata che sarà risolta da chi proverà a farlo, non dalle note di rilascio. Le note di addestramento di Xiaomi descrivono una run che mescolava compiti di coding, general-agent, visivi e di cybersicurezza in un'unica passata, con grader che classificano le traiettorie riuscite e ridistribuiscono la ricompensa verso percorsi migliori — e registrano anche guasti: un riavvio per esaurimento della memoria GPU causato da uno squilibrio del carico degli esperti, un guasto di rete tra il cluster di addestramento e il deployment dei grader, e un riavvio di Flash dopo che un errore infrastrutturale è rimasto non rilevato per circa tre ore. Pubblicare i guasti insieme ai successi è la parte che rende credibile il resto della divulgazione.
Quanto costa chiamare e dove si colloca la questione dell'instradamento
A $0.43 e $0.87 per milione di token, MiMo-V2.6-Pro ha un prezzo da modello di fascia media e benchmark da modello frontier open-weights. Xiaomi ha mantenuto il prezzo standard della precedente generazione MiMo-V2.5 invece di riprezzare al rialzo il nuovo checkpoint, ed è per questo che la tariffa sembra bassa rispetto al numero di parametri. Uno sconto del 99% sulla cache significa che un ciclo di agente a forte uso di cache legge il proprio contesto praticamente a costo zero, ed è qui che si accumula davvero il conto di un agente a lungo orizzonte.
Esiste una versione di questo scambio che si instrada in modo pulito e una versione che no. La versione che lo fa: i modelli di frontiera con cui confronteresti MiMo-V2.6-Pro — Claude Opus 5 a $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — sono tutti raggiungibili tramite un'unica chiave OrcaRouter al prezzo di listino del provider con 0% di ricarico, quindi un taglio di prezzo del fornitore su uno qualsiasi di essi è attivo dalla nostra parte lo stesso giorno, e una regola di instradamento può inviare una richiesta a un secondo modello quando il primo è lento o non disponibile. Qui questo conta più del solito, perché il modello con il miglior punteggio open-weights è anche quello con la via più sottile per raggiungerlo. Comporre i due — una corsia open-weights economica per il lavoro di massa e una corsia di frontiera per la coda difficile — è una decisione di instradamento, ed è il tipo di decisione che smette di essere una scommessa nel momento in cui entrambe le corsie si trovano sulla stessa chiave.
Un altro prodotto da tenere bene a mente, perché è facile confonderlo con il modello: Xiaomi offre anche MiMo-V2.6-Pro-UltraSpeed, un livello di serving ospitato costruito a partire dallo stesso checkpoint. Il materiale di Xiaomi stessa dichiara fino a venti volte la velocità di output del servizio Pro standard alla stessa qualità; le voci di catalogo di terze parti descrivono all'incirca dieci volte. Sono due numeri diversi che descrivono lo stesso livello, nessuno ha pubblicato distribuzioni di latenza per richiesta che li riconcilino, e il livello comporta una tariffa sostanzialmente più alta. Nulla di UltraSpeed cambia ciò che i pesi possono fare — cambia la velocità con cui i server di qualcun altro li eseguiranno.
Cosa cambierebbe questo quadro?
Tre cose, in ordine di quanto conterebbero.
Una seconda e una terza via di erogazione. Il fatto che su Artificial Analysis ci sia un solo provider è il vincolo per tutto il resto. Più vie significano failover, significano concorrenza sui prezzi a livello di erogazione e significano che il modello può essere inserito in un percorso di produzione anziché in un esperimento.
Riproduzione indipendente dei dati DeepSWE. Il 46 è già indipendente; il 72,57 no. Se le esecuzioni esterne si avvicinano a quel valore, la tesi a favore del modello si rafforza considerevolmente. Se si attestano sensibilmente al di sotto, il numero di Artificial Analysis resta quello di cui fidarsi e la cifra del fornitore si aggiunge alla lunga lista di dichiarazioni di lancio che non hanno superato il contatto con la realtà.

Ripartizioni per valutazione. Il composito è un composito. Quali delle dieci valutazioni vince MiMo-V2.6-Pro e quali perde è la differenza tra un modello da distribuire per il coding agentico e un modello da distribuire per il question answering ad alta intensità di recupero, e l'indice da solo non te lo dice. Questo dettaglio è ciò a cui prestare attenzione in seguito, ed è ciò di cui una configurazione di routing ha bisogno prima che valga la pena di metterla per iscritto.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
