
MiMo-V2.6: Cosa mostra davvero il paper di Xiaomi sul RL, e cosa lascia non verificato
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 36 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 182 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
La maggior parte dei paper sui modelli pubblicati questo mese sono paper di architettura. Il rapporto tecnico dietro Xiaomi MiMo-V2.6-Pro e Xiaomi MiMo-V2.6-Flash non lo è. Intitolato MiMo-V2.6: Scalare l'apprendimento per rinforzo verso l'auto-miglioramento, presentato il 21 settembre 2026 e attribuito a LLM-Core Xiaomi, non dedica quasi nulla della sua lunghezza alla backbone sparsa mixture-of-experts e quasi tutta a una domanda: cosa succede quando l'intero budget di post-addestramento va in un'unica esecuzione di apprendimento per rinforzo misto. Il rapporto di DeepSeek-V4.1-Flash, al contrario, è un documento sulla memoria — la sua lunghezza va all'attenzione sparsa compressa, al riuso KV cross-layer e allo storage FP4. Mettili uno accanto all'altro e sono argomentazioni su da dove viene la capacità, e non sono d'accordo.
Il rapporto vale la pena di essere letto di per sé, ma vale la pena leggerlo con attenzione, perché è un'autodichiarazione del laboratorio che ha eseguito la run. Nomina i propri meccanismi, mostra le proprie ablazioni, pubblica i propri fallimenti e, nello stesso respiro, riporta numeri che non possono essere verificati dall'esterno. Separare queste due cose è la maggior parte del lavoro. Questo pezzo lo fa, ed è scritto il 23 settembre 2026 — due giorni dopo la pubblicazione dei checkpoint, mentre il paper è la cosa più recente e meno corroborata che li riguardi.
Perché la data sul documento conta più del solito
I checkpoint di MiMo-V2.6-Pro e MiMo-V2.6-Flash di Xiaomi sono approdati sull'hub dei modelli il 21 settembre 2026, con licenza MIT e senza restrizioni. Il report è datato lo stesso giorno e ha raggiunto la vetta della classifica dei trend sul sito di preprint su cui è stato pubblicato. Questa tempistica è il motivo per cui si tratta di un pezzo di cronaca anziché di una retrospettiva: il paper non è una spiegazione successiva di un modello che tutti hanno già sottoposto a benchmark. Sta arrivando insieme ai pesi, prima che chiunque al di fuori di Xiaomi abbia pubblicato un'esecuzione indipendente.

Quell'ordine è anche il principale punto debole del paper come prova. Tutto ciò che ne sta a valle — la curva DeepSWE, i miglioramenti nel tasso di successo, la difesa contro il reward-hacking — è un'affermazione su un processo di addestramento avvenuto una sola volta, in un solo laboratorio, su un solo cluster, e che nessun altro ha riprodotto. Il thread che ha segnalato il report considera proprio quella la parte interessante: questo è un paper di dati ed esperimenti, non un paper di architettura, e gli esperimenti sono esattamente il tipo di risultato che o si replica o no.
Tre assi di scalabilità, e solo uno di essi è un problema hardware
Il modo in cui il rapporto inquadra la questione è che la potenza di calcolo dell'apprendimento per rinforzo è stata scalata lungo tre assi contemporaneamente, e il terzo è quello che cambia il modo in cui si pensa al metodo.
• Batch e throughput — 1.568 campioni per aggiornamento, espansi a sedici rollout ciascuno, quindi circa 25.000 traiettorie per passo, con un consumo da 2,7 a 3,7 miliardi di token per passo a lunghezze di contesto fino a un milione di token. L'architettura di rollout è completamente asincrona, ed è ciò che rende quella dimensione di batch anche solo sostenibile.
• Ambienti — un'unica esecuzione mista su attività di codice, agente generale, visive e cyber, sotto diversi harness per agenti contemporaneamente, anziché esecuzioni RL separate per dominio. La definizione sintetica coniata da Xiaomi per questo è "You Only RL Once". L'argomento a favore della combinazione è che i progressi in una capacità rafforzano le altre; il rischio è che un tipo di attività lenta venga trascurata, cosa che, secondo il rapporto, viene gestita con una pianificazione adattiva.
• Grader compute — l'asse che non riguarda le GPU nel senso usuale. Il pass/fail binario non può classificare due soluzioni che passano entrambe, quindi il segnale di ricompensa stesso diventa ciò che si scala. Un grader agentico confronta congiuntamente i sedici tentativi per un compito e produce un segnale graduato invece di un bit.
È sul terzo asse che l'espressione "auto-miglioramento" nel titolo si guadagna il suo posto, ed è lì che il report è più esposto. Un modello che valuta i propri rollout è una superficie di reward hacking, e il report lo tratta come tale.
I due meccanismi che vale davvero la pena comprendere
Ridistribuzione del vantaggio di gruppo
Dopo ogni passo, la policy produce sedici tentativi per ciascun compito e li colloca tutti in uno spazio di lavoro condiviso, così che un modello valutatore possa esaminarli insieme anziché uno alla volta. Le patch che superano il test vengono poi valutate su cinque assi: se l'approccio è adatto al problema, se l'implementazione è precisa senza inutili fallback, se la modifica è minima, se modifica qualcosa al di fuori dell'ambito e se è coerente con lo stile del codice circostante. Le patch che superano il test con un rango inferiore ricevono un rinforzo positivo minore. Una patch confermata come hack viene riportata a zero e trattata come un fallimento.
La conseguenza è un segnale di addestramento che spinge verso soluzioni più brevi ed economiche anziché semplicemente corrette — il rapporto lo inquadra come un orientamento verso meno token per attività. Questa è la parte da tenere a mente, perché i risultati principali presentati più avanti nel documento indicano la direzione opposta.
Sintesi della Ricompensa per Gruppo
La metà offline della stessa idea. Anziché derivare la qualità puramente da un grader live, il team precalcola rubriche specifiche per attività e moltiplica la ricompensa binaria del test per i punteggi di qualità e comportamento tratti da tali rubriche. Il report descrive questo come la costruzione delle rubriche a partire da rollout contrastanti — cioè da casi in cui l'esito differiva, che è dove si trova l'informazione.
La valutazione non è gratuita. Il report stima il costo dei valutatori a circa il 12,7% del costo totale di reinforcement learning di MiMo-V2.6-Pro. Quel singolo dato è la cosa più utile nel paper per chiunque stia considerando di copiare il metodo, perché trasforma «scala i tuoi valutatori» da un'idea in una voce di bilancio.
Il router congelato è il risultato che la maggior parte dei team copierà come prima cosa.
La sezione sulla stabilità del rapporto contiene un risultato che si regge da solo, indipendente da MiMo-V2.6 e da quanto bene si comporti il modello.
Con router Mixture-of-Experts addestrabili, il carico degli esperti è andato gravemente alla deriva nell'arco di venti passi. Il coefficiente di variazione tra gli esperti è salito da 0,78 a 2,0. Il carico di picco sull'esperto più occupato è passato da sei volte la media a sedici volte. La quota di esperti freddi — quelli che ricevono quasi nessun traffico — è passata dallo 0,5% al 22%. Ripristinare i pesi del router ai loro valori iniziali al passo 20 ha ripristinato immediatamente l'equilibrio.
La risposta di Xiaomi è stata congelare il router MoE per l'esecuzione. Il ragionamento non è sottile: a questa scala di batch, l'instabilità del routing è un problema di dinamiche di addestramento che si può semplicemente scegliere di non avere, e il router non è dove l'apprendimento per rinforzo fa il suo lavoro. Se congelare costi qualcosa in termini di qualità finale non trova risposta in un'ablazione nel materiale pubblicato, ed è legittimo volerlo sapere.
Ciò che il risultato non dice nulla riguardo al serving. Il bilanciamento del carico del router durante un'esecuzione di training e l'utilizzo degli esperti sotto il traffico di produzione sono questioni diverse, e il rapporto affronta soltanto la prima.
I numeri, con le loro etichette attaccate
I risultati principali del rapporto sono puliti nella forma e disordinati nei dettagli, e il disordine non è uno scandalo — sono tre misurazioni diverse di tre oggetti diversi che condividono un nome.
• DeepSWE v1.1, in hold-out — MiMo-V2.6-Pro è salito da 58,4 a 72,6 nel corso dell'esecuzione; MiMo-V2.6-Flash da 48,7 a 65,7. Il benchmark comprende 113 attività di ingegneria dei repository a lungo orizzonte, valutate da verificatori funzionali su cinque linguaggi di programmazione, e la metrica è average@3 — il tasso medio di superamento dei verificatori su tre tentativi campionati, che non è la stessa cosa del fatto che uno qualsiasi dei tre tentativi sia riuscito. Interpretare avg@3 come pass@3 sovrastimerà ogni numero nella pagina.
• Lo stesso benchmark, misurato altrove — le schede del modello rilasciate riportano 71.9 per Pro e 67.9 per Flash. La dashboard pubblica di addestramento di Xiaomi riportava 72.57 e 65.68. Quindi ci sono tre valori pubblicati per modello, due dei quali provengono da Xiaomi, e la direzione della discrepanza è diversa per ciascuno dei due modelli. Nessuno di essi è sbagliato; descrivono un'istantanea della dashboard, una voce della scheda e una riga di report, in momenti diversi e possibilmente con harness diversi.
• Distillazione — MiMo-V2.6-Distill-Qwen-9B, messo a punto da Qwen3.5-9B su dimostrazioni generate da MiMo, ha portato SWE-bench Verified da 61,1 a 66,2. Questo è il numero più trasferibile nell'articolo, perché uno studente da 9B è una dimensione che la maggior parte dei team può effettivamente eseguire.
• Un mini-benchmark interno di cybersicurezza — da 31,3 a 47,0. Interno significa interno: i compiti non sono pubblicati, quindi il delta non può essere riprodotto nemmeno in linea di principio.
• L'Artificial Analysis Intelligence Index — 46 per MiMo-V2.6-Pro. Questo è diverso per natura. È stato prodotto da Artificial Analysis eseguendo il proprio harness sul checkpoint rilasciato, non da Xiaomi, il che lo rende l'unica cifra di punta in questo rilascio che un lettore può considerare misurata anziché dichiarata. È anche il numero da confrontare con GLM-5.3, Kimi K3 e la frontiera chiusa, e si colloca cinque punti sotto Claude Opus 5.


Il rapporto è onesto riguardo ai limiti della propria tabella, e questa è la frase che vale la pena citare a chiunque non lo sia: i confronti mescolano benchmark pubblici e interni e non isolano il contributo dell'apprendimento per rinforzo da quello dell'architettura o del pre-addestramento. Un modello che è migliore dopo il RL non è prova che il RL ne sia la causa.
C'è una seconda avvertenza, ed è quella che rema contro l'impostazione. I guadagni riportati si accompagnano generalmente a un aumento dell'uso di token. Il rapporto lo presenta come un miglioramento sostenuto delle capacità anziché come efficienza, e fa bene. Ma GAR è stato progettato esplicitamente per orientare verso percorsi più brevi e meno token per attività, e il risultato aggregato non mostra che il carico di lavoro costi meno. Le capacità sono aumentate; il costo per attività non è diminuito. Se interpreti "auto-miglioramento" come "il modello avrà bisogno di meno soldi miei il prossimo trimestre", l'articolo non supporta questa lettura.
Ciò che il rapporto lascia non verificato
Al 23 settembre 2026, nessuna terza parte ha pubblicato una replica indipendente delle colonne DeepSWE, Terminal Bench o CyberGym. La distinzione che conta è tra il punto dell'indice e tutto il resto: 46 è una misurazione effettuata da qualcun altro, e 72,6 è un'affermazione su un'esecuzione di addestramento che nessuno può rieseguire, poiché l'esecuzione è costata, stando a quanto riportato, 2,6 milioni di dollari per Pro e 0,9 milioni di dollari per Flash e non si ripeterà.
Ciò che Xiaomi ha pubblicato e che la maggior parte dei laboratori non pubblica sono le dinamiche di addestramento, il framework di apprendimento per rinforzo e gli ambienti dei compiti: più di 7.000 ambienti valutati in ingegneria del software, riproduzione di vulnerabilità, lavoro intellettuale e web design. Questo è l'artefatto con la vita utile più lunga. I pesi ti dicono cosa ha prodotto l'esecuzione; gli ambienti ti dicono come eseguire tu stesso l'esperimento, che è l'unico modo in cui qualsiasi affermazione sul RL possa mai essere risolta.
La difesa dal reward-hacking merita un'avvertenza specifica. È descritta come multilivello — progettazione del reward, valutazione avversariale, rilevamento delle anomalie e controllo incrociato tra verificatori — ed è descritta interamente dalla parte a cui un suo fallimento risulterebbe imbarazzante. Una difesa contro un modello che inganna un valutatore basato su modello non è il genere di cosa che un'autodichiarazione possa chiudere. Il meccanismo è nominato e la modalità di fallimento è riconosciuta, il che è più di quanto faccia la maggior parte degli articoli, e resta comunque una questione aperta.
Cosa puoi davvero fare con questo oggi
Entrambi i checkpoint sono scaricabili, senza restrizioni, con licenza MIT: Xiaomi MiMo-V2.6-Pro-RL e Xiaomi MiMo-V2.6-Flash-RL, omnimodali, con contesto da un milione di token, e l'indice Flash riporta 172,9 GB di dati dei pesi distribuiti su 65 shard in FP8. Xiaomi non ha pubblicato un listino prezzi per token per la generazione V2.6, quindi oggi la scelta è tra l'auto-hosting e un modello hosted che già paghi.
È in quel confronto che risiede il valore concreto del paper, e il risultato non è lusinghiero per il paper, in un modo che è comunque utile. L'affermazione sotto esame non è «MiMo-V2.6-Pro è valido?» — a questo rispondono le 46 risposte. È «l'apprendimento per rinforzo su compiti agentici misti produce un ragionamento che si trasferisce al mio carico di lavoro?», e l'unico modo onesto di rispondere è eseguire entrambi e confrontarli, il che è un problema di routing prima ancora che un problema di ricerca. DeepSeek-V4.1-Flash è a una chiave API di distanza, a $0,15 e $0,60 per milione di token, Qwen3.8-Flash e GLM-5.3-Flash si trovano sulla stessa chiave, e se volete mettere un checkpoint MiMo self-hosted dietro lo stesso endpoint per una settimana e vedere se la curva DeepSWE compare nei vostri eval, si tratta di un cambio di configurazione, non di una migrazione. OrcaRouter non ospita i modelli di Xiaomi, e nulla di quanto detto qui va letto come un'affermazione contraria — ma i modelli con cui li confrontereste sono tutti raggiungibili tramite una sola chiave API di OrcaRouter al prezzo di listino del provider, con 0% di markup applicato, con failover automatico se un checkpoint che state provando si rivela instabile sotto carico.
Il caso del modello non comprovato è quello per cui è stato creato il failover. Un checkpoint pubblicato due giorni fa, con una valutazione eseguita dal fornitore e nessuna ripetizione indipendente, è esattamente ciò che vuoi provare senza metterci dietro un percorso di produzione.
Chi dovrebbe leggere il paper
Se fai post-training, leggilo per il risultato sul router e il dato sul costo del grader. Entrambi sono trasferibili, entrambi sono economici da testare e nessuno dei due richiede di credere a qualcosa sulla tabella di benchmark di MiMo-V2.6. Il risultato del router congelato, in particolare, è il genere di cosa che costa un pomeriggio da provare e ti fa risparmiare una run.
Se stai scegliendo un modello, leggi il punto dell'indice e salta il resto. Artificial Analysis ha misurato 46 sull'artefatto rilasciato; è l'unico numero di questa release che non proviene dal fornitore, e colloca MiMo-V2.6-Pro in cima al campo dei modelli open-weight e a cinque punti dietro Claude Opus 5. Tutto il resto del rapporto descrive come Xiaomi ci è arrivata, e come Xiaomi ci è arrivata non è qualcosa che si può comprare.
E se state leggendo la copertura mediatica invece dell'articolo, la cosa a cui fare attenzione è la parola «auto-miglioramento». I risultati stessi del report mostrano un aumento delle capacità insieme all'uso di token, il che è un risultato reale e riproducibile sullo scaling dell'apprendimento per rinforzo. Non è un'affermazione che il modello sia diventato più economico da eseguire, e gli articoli che seguiranno questo sono quelli che vi diranno se alla fine lo diventerà.
