Card del titolo principale per l'articolo 'Xiaomi MiMo-V2.6-Pro: 72.57 su DeepSWE', introdotta dall'occhiello 'OrcaRouter · radar dei modelli — non pubblicato', con il sottotitolo 'Una run che si è fermata, un modello che non è ancora stato rilasciato — cosa è confermato e cosa no.' Sotto, due card: a sinistra, 'Sulla dashboard di Xiaomi stessa', che recita 'DeepSWE v1.1: 72.57 — run fermata al passo 30, 20 set'; a destra, 'Ancora inedito', che recita 'Nessuna model card, nessun id API, nessun prezzo, nessun peso'. Quattro chip recitano 'Gemello Flash: 65.68', 'Spesa totale: 3.474.715 $', 'Top della classifica: 74%' e 'Valutazione eseguita dal fornitore, non inviata'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Xiaomi MiMo-V2.6-Pro: un punteggio DeepSWE di 72,57, una run che si è fermata e ancora nessuna data di uscita

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Xiaomi MiMo-V2.6-Pro ha interrotto la propria esecuzione di apprendimento per rinforzo trasmessa pubblicamente in streaming il 20 settembre con un punteggio DeepSWE v1.1 di 72,57 che si trovava sulla dashboard di Xiaomi — 1,4 punti sotto il 74% che GPT-6 Astra, Gemini 3.8 Flash e Claude Opus 5 condividono in cima alla stessa classifica. Xiaomi MiMo-V2.6-Flash, il modello più piccolo addestrato insieme a esso, si è fermato il 19 settembre a 65,68. Entrambe le esecuzioni si sono concluse al passo 30, e il conto complessivo che Xiaomi ha pubblicato insieme a esse ammontava a 3.474.715 $ quando abbiamo acquisito la pagina stamattina.

Questa è tutta la buona notizia, ed è davvero buona. Il resto della storia è un divario tra un numero e un prodotto. Né Xiaomi MiMo-V2.6-Pro né Xiaomi MiMo-V2.6-Flash hanno una data di rilascio, una scheda del modello, un identificatore API, un prezzo pubblicato o un set di pesi scaricabili. Non c'è alcun endpoint da chiamare. Ciò che esiste è una dashboard di addestramento che chiunque può guardare, una cifra di benchmark prodotta dall'harness di Xiaomi stesso, e una comunità che ha passato sei giorni a leggere una pagina di telemetria come la gente era solita leggere le foglie del tè.

Quindi questo è un pezzo su ciò che sappiamo finora, e la versione onesta separa tre cose che la copertura dell'ultima settimana ha finito per mescolare sottovoce: ciò che Xiaomi ha dichiarato ufficialmente, ciò che un singolo osservatore ha riportato al riguardo e cosa significhi tutto questo per chi oggi deve scegliere un modello di coding.

Cosa ha effettivamente messo online Xiaomi

Il 16 settembre il team MiMo, guidato da Luo Fuli, ha aperto una pagina live sul dominio di Xiaomi che mostra in tempo reale il post-addestramento di due modelli non ancora rilasciati: conteggi degli step, curve di ricompensa, throughput dei token, numero di sandbox, notifiche di guasto delle GPU e un contatore dei costi che sale mentre guardi. Secondo la copertura, l'inquadramento di Xiaomi è che ha dedicato circa sei mesi a una sola domanda — fino a che punto si può scalare l'apprendimento per rinforzo — e ha deciso di condurre quell'esperimento in pubblico anziché annunciare un risultato.

La dashboard è insolitamente schietta per un artefatto di un fornitore. Elenca i propri fallimenti in un feed di avvisi: un riavvio di Pro al passo 17 causato da un errore di memoria esaurita (out-of-memory) della GPU dovuto a uno squilibrio di carico degli esperti, che il team afferma di aver risolto modificando la propria strategia di parallelismo nell'addestramento; un guasto di connettività di rete tra il cluster di addestramento Pro e il deployment di grading che ha forzato un riavvio e una decisione di eliminare il dataset cyber dalla prossima esecuzione di Pro dopo "schemi errati nei log di rollout"; un riavvio di Flash dal passo 15 dopo che una classe di errore infrastrutturale è rimasta non rilevata per circa tre ore; e un riavvio di Pro a causa di un guasto VRAM su un singolo nodo. Inoltre, nota che i task giudicati "relativamente facili per l'attuale modello pro" sono stati filtrati — un'ammissione che la maggior parte dei rapporti post-addestramento lascia non detta.

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

Le due schede di esecuzione sono la parte che conta per chiunque tenga traccia dei tempi. Entrambi i modelli sono etichettati come fermati: MiMo-V2.6-Pro dopo 5 giorni e 7 ore di tempo effettivo, MiMo-V2.6-Flash dopo 3 giorni e 11 ore, ciascuno allo step 30, rispettivamente il 20 settembre e il 19 settembre. Pro ha consumato 75B token e 753k campioni per i suoi $2,62M; Flash ha consumato 81,4B token per $854k. Ogni step estrae un batch di 1.568 prompt con 16 rollout per prompt — 25.088 traiettorie per step, eseguite in modo completamente asincrono.

Vale la pena dirlo chiaramente: Xiaomi non ha detto se "stopped" significhi che l'esecuzione è conclusa, sospesa o salvata a checkpoint. Una card in stato "stopped" non è un avviso di completamento, e nessuno al di fuori del team sa quale delle tre sia.

Cosa è confermato, e cosa no.

Il 72,57 non è una voce. È stampato sulla dashboard di Xiaomi, in un grafico etichettato DeepSWE v1.1, mini-swe-agent, avg@3, accanto alla curva arancione della run Pro. Il 65,68 del modello Flash si trova sullo stesso grafico. La cifra compare anche — come 62,24 e poi 65,97 — in istantanee precedenti dello stesso pannello, ed è ciò che dà forma alla curva: una salita costante lungo 30 step anziché una singola valutazione fortunata.

Quello che è solo riportato è il punto di partenza. L'affermazione che circola su X il 21 settembre, dall'account @nrehiew_, è che il modello Pro è passato "da 58.41 a 72.57" su DeepSWE e che le esecuzioni sono state completate. Il valore finale corrisponde esattamente alla dashboard del fornitore. Il valore di riferimento 58.41 è la lettura di quell'account di dove inizia la curva — il punto Pro più a sinistra del grafico si colloca effettivamente nella fascia alta dei 50 — e Xiaomi non ha pubblicato una cifra per lo step-1. L'affermazione sul completamento è parimenti un'interpretazione di due schede contrassegnate come fermate, che è una lettura ragionevole e non una dichiarazione di Xiaomi. Considera il miglioramento di 14 punti come direzionalmente solido e numericamente approssimativo.

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

C'è un'ulteriore distinzione che la copertura ha tralasciato, ed è quella che determina quanto vale il numero. I pannelli di benchmark della dashboard sono valutazioni di Xiaomi stessa: l'azienda ha eseguito l'harness sui propri checkpoint e pubblicato i risultati. L'harness è lo stesso utilizzato dalla classifica pubblica — mini-swe-agent, DeepSWE v1.1 — il che rende la cifra più comparabile di quanto lo sarebbe un benchmark interno di un fornitore. Ma una valutazione eseguita autonomamente non è una voce in classifica, e 72.57 non compare nella board di Datacurve, perché nessuno l'ha inviata.

Il tetto del 74% è più stretto di quanto suggerisca il titolo.

Il che mette a fuoco il confronto. La classifica DeepSWE v1.1 di Datacurve, aggiornata l'ultima volta il 3 settembre 2026, elenca 113 attività distribuite su 91 repository in cinque linguaggi, e le sue prime tre configurazioni sono a pari merito al 74% di Pass@1: GPT-6 Astra con sforzo di ragionamento xhigh, Gemini 3.8 Flash a high, e Claude Opus 5 a max. I numeri che si trovano accanto a quei punteggi sono quelli interessanti.

• Confidenza — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. Nella stessa classifica, GPT-5.6 Sol si trova al 73% ±3 e GLM-5.3 e Kimi K3 al 69%. Gli intervalli si sovrappongono ben oltre la seconda cifra decimale.

• Costo per attività — Gemini 3.8 Flash costa in media $2.36, GPT-6 Astra $6.52, Claude Opus 5 $11.84. Il grafico della classifica stessa segnala Gemini 3.8 Flash come la configurazione più efficiente del tabellone, e il divario tra questi tre è all'incirca cinque a uno per un tasso di superamento che il benchmark non riesce a distinguere.

• Passaggi — Gemini 3.8 Flash ha richiesto in media 166 passaggi dell'agente per attività, Claude Opus 5 99, GPT-6 Astra 29. Il punteggio in parità nasconde tre stili di lavoro molto diversi, e quello economico è quello che lavora di più.

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

Quindi, quando il 72,57 riportato viene descritto come "vicino alla vetta della classifica", la versione accurata è più ristretta e meno drammatica. È a circa un punto e mezzo da una parità a tre i cui membri non possono essere separati tra loro dalle stesse barre d'errore del benchmark. È un risultato forte per un modello ancora in post-addestramento, prodotto dal fornitore anziché dai manutentori del benchmark, su una classifica alla quale il modello non è stato inviato. L'ultimo aggiornamento della classifica precede del tutto l'esecuzione di Xiaomi, ed è per questo che non vi compare ancora nulla di MiMo.

Perché Xiaomi si sta allenando in pubblico

La trasparenza non è casuale. L'ultimo rilascio open-weight di Xiaomi è stato Xiaomi MiMo-V2.5 e Xiaomi MiMo-V2.5-Pro alla fine di aprile, entrambi sotto licenza MIT — utilizzabili commercialmente, sottoponibili a fine-tuning, ridistribuibili. MiMo-V2.5-Pro è un modello mixture-of-experts da 1,02 trilioni di parametri con 42B parametri attivi, un'architettura ad attenzione ibrida e una finestra di contesto da 1M token, e il suo materiale di lancio ha reso esplicite le affermazioni agentiche: un compilatore scritto da zero in Rust attraverso centinaia di chiamate a strumenti, un'applicazione desktop di ottomila righe costruita in undici ore di lavoro di un agente.

Trasmettere in streaming il post-training della prossima generazione è un tipo diverso di rivendicazione. Un laboratorio che pubblica in tempo reale le sue curve di ricompensa, i suoi conteggi delle sandbox e i suoi guasti alle GPU chiede di essere giudicato sul processo anziché su una presentazione di lancio, e sta segnalando una tempistica. Luo Fuli ha detto che i dettagli tecnici del lavoro di RL saranno resi open source pezzo per pezzo nelle prossime settimane. È la cosa più vicina a un programma che qualcuno abbia offerto: prima la metodologia, il modello dopo.

Rientra anche in uno schema che Xiaomi ha già usato in passato, in cui un modello appare in pubblico sotto un altro nome prima che l'azienda lo rivendichi. Le abitudini dell'azienda sono addestrare in silenzio, testare apertamente e poi rilasciare con i pesi.

Cosa puoi eseguire oggi

Niente nella famiglia MiMo-V2.6. Se vuoi un modello Xiaomi MiMo adesso, la generazione V2.5 è ciò che esiste — pesi aperti attraverso i canali di Xiaomi stessa e diverse piattaforme di terze parti, con schede pubblicate e prezzi. Non esiste alcuna API MiMo-V2.6, nessun identificatore di modello e nessun listino prezzi, e qualsiasi pagina che citi un identificatore MiMo-V2.6 o una tariffa per token sta riempiendo uno spazio vuoto che Xiaomi ha lasciato tale. Le stringhe `mimo-v2.6-pro` e `mimo-v2.6-flash` sulla dashboard sono nomi di job di addestramento, non endpoint pubblicati.

L'altra conseguenza pratica è cosa fare nel frattempo. Se il motivo per cui MiMo-V2.6-Pro ti interessa è che potrebbe essere un modo più economico per raggiungere prestazioni di coding di livello frontier, le configurazioni con cui viene messo a confronto sono già richiamabili, e la leaderboard dice che quella economica è competitiva: Gemini 3.8 Flash eguaglia il miglior tasso di successo a 2,36 $ per attività ed è segnalata come la configurazione più efficiente della classifica. Gemini 3.8 Flash, Claude Opus 5 e GPT-6 Astra sono tutti raggiungibili tramite un'unica chiave API OrcaRouter al prezzo di listino del provider, con 0% di markup applicato — così una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno, invece che al ciclo di fatturazione successivo — con il failover configurato per modello anziché per fornitore. E quando un laboratorio apre davvero un modello come questo, instradarlo dietro la stessa chiave è il modo a basso impegno per valutarlo: puoi metterlo davanti a traffico reale senza scommettere un percorso di produzione su un checkpoint che nessuno ha caratterizzato.

Che cosa cambierebbe davvero questa storia

Quattro segnali, all'incirca in ordine di quanto sarebbero decisivi:

• Pesi su Hugging Face sotto una licenza dichiarata, ovvero il modo in cui è arrivata la generazione V2.5 e la prova più forte che l’esecuzione RL abbia prodotto un modello distribuibile anziché un esperimento che si è concluso.

• Una scheda del modello con conteggio dei parametri, lunghezza del contesto e architettura — nessuno dei valori numerici di V2.6 è pubblico, e la dashboard non li mostra. Presumere che V2.6-Pro erediti la struttura 1.02T/42B di V2.5-Pro sarebbe un'ipotesi.

• Un identificatore API e un listino prezzi, ovvero il momento in cui la cifra DeepSWE diventa una decisione d'acquisto anziché uno sport da spettatori.

• Una sottomissione alla board DeepSWE di Datacurve, che metterebbe MiMo-V2.6-Pro sulla stessa tabella e sotto le stesse barre di errore dei modelli con cui viene confrontato. Una eval eseguita dal vendor e una sottomissione a una leaderboard non sono la stessa affermazione, e il divario tra le due è esattamente una riga di quella tabella.

Fino ad allora, il riassunto onesto è che Xiaomi ha mostrato il run di post-training più trasparente che un grande laboratorio abbia mai pubblicato, su due modelli che non ha rilasciato, con un valore di benchmark autodichiarato che si avvicina — ma non entra — ai vertici della classifica. La descrizione della metodologia è promessa nelle prossime settimane. La data di rilascio non è affatto promessa.