
Xiaomi MiMo-V2.6-Flash è uscito: un modello aperto da 309B che puoi servire da solo
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiMo-V2.6-Flash ha smesso di essere un job di addestramento il 21 settembre 2026 alle 15:39 UTC, quando il team MiMo di Xiaomi ha pubblicato il checkpoint come XiaomiMiMo/MiMo-V2.6-Flash-RL su Hugging Face — senza gating, con licenza MIT, technical report allegato, 65 shard di pesi nell'indice. XiaomiMiMo/MiMo-V2.6-Pro-RL è arrivato diciotto secondi dopo. Una settimana prima, entrambi i modelli erano due schede contrassegnate come "stopped" su una dashboard pubblica di addestramento, e la frase ripetuta ovunque su di loro era che non esistevano pesi. Ora sono file che chiunque può scaricare e servire. Questo è un vero cambiamento in ciò che puoi fare con il modello, che è una cosa diversa da un annuncio su di esso.
Apri con il timestamp, perché il rilascio è arrivato senza la solita coreografia del fornitore. Il blog di Xiaomi stesso, consultato il 22 settembre, mostra ancora il lancio di MiMo-V2-Flash del dicembre 2025 come suo post più recente. Non c'è alcun articolo di lancio di V2.6, nessun listino prezzi pubblicato per la nuova generazione e nessun identificatore di modello richiamabile che Xiaomi abbia annunciato per nessuno dei due checkpoint. Quello che esiste è un repository, un report tecnico, ricette di deployment e una serie di tabelle di benchmark eseguite dal fornitore — più un piccolo dettaglio ostile nella model card che conta solo per chi ha intenzione di caricare davvero la cosa.
Le due carte che puoi tenere
Entrambi i checkpoint sono nativamente omnimodali, con un contesto dichiarato da 1M token, e entrambi hanno la licenza MIT — utilizzabili commercialmente, fine-tunabili, ridistribuibili, senza soglia di ricavi e senza clausola di ricerca. La scheda definisce Flash il "checkpoint bilanciato sull'efficienza" della serie e Pro il flagship; la parte interessante è come i due differiscano quando si guardano le configurazioni invece della frase di marketing.
• Numero di parametri — MiMo-V2.6-Flash 309B totali con 15B attivati per token; MiMo-V2.6-Pro 1.02T totali con 42B attivati. Entrambi mixture-of-experts sparsi.
• Backbone — Flash è composto da 48 layer (39 a finestra scorrevole, 9 di attenzione globale), dimensione nascosta 4096, 256 esperti instradati con 8 attivati, una finestra scorrevole di 128 token, nessun esperto condiviso. Il primo blocco è attenzione globale con una rete feed-forward densa; tutto ciò che segue si alterna.
• Encoder — un MiMo ViT da 681M di parametri (28 livelli, 24 a finestra scorrevole più 4 completi), un tokenizer audio da 308M e un encoder di patch audio da 127M, così testo, immagini, video e audio entrano tutti nello stesso modello invece che in tre pipeline messe insieme alla bell'e meglio.
• Decodifica speculativa — un drafter a previsione multi-token a cinque livelli, in stile DFlash, descritto nella scheda come in grado di prevedere sette token in anticipo per ogni forward pass ai fini della verifica parallela.
• Archiviazione — l'indice pubblicato riporta 172,9 GB di dati dei pesi distribuiti su 65 shard, in FP8 (e4m3) con uno schema di attivazione dinamico. Interpretalo come circa nove byte per parametro: Xiaomi ha distribuito il modello grande, non una sua quantizzazione delle dimensioni di un laptop.
Tre numeri che non concordano
Vale la pena dirlo chiaramente, perché tutti e tre incidono su una decisione di distribuzione più che su un'argomentazione da benchmark, e nessuno di essi è losco — sembrano un disallineamento della documentazione tra la stesura, la pagina del repository e i file distribuiti.
Il primo è il decoder speculativo. Il riepilogo del modello afferma che l'head MTP è un drafter a cinque livelli che predice sette token per passaggio. config.json nello stesso repository imposta num_nextn_predict_layers a 3. Entrambi i numeri non possono descrivere lo stesso artefatto, e la config è quella che il runtime leggerà. Se stai dimensionando la memoria per il decoding speculativo, fidati della config e verifica dopo il caricamento.
Il secondo è più sottile e non è affatto un errore, quanto piuttosto una convenzione di denominazione che sembra tale. Il repository si chiama MiMo-V2.6-Flash-RL, il che induce a supporre che si tratti di un adattatore di reinforcement learning anziché di un modello. È il modello. Il -RL suffisso indica la discendenza post-training — questo checkpoint è il risultato della run RL mista che Xiaomi ha trasmesso in streaming, non un LoRA appoggiato sopra qualche altra base. L'indice dei pesi lo conferma: decine di migliaia di tensori che coprono l'intera backbone, l'encoder visivo, lo stack audio e il drafter.
Il terzo è quello che si incontra per primo se si dimensiona l'hardware dalla pagina del repository invece che dalla scheda. Il blocco Safetensors su quella pagina riporta 159B parametri. Non è nessuno dei due numeri della scheda — non i 309B totali, non i 15B attivi — ed è la cifra che chi pianifica la capacità è più propenso a copiare, perché si trova accanto al pulsante di download. Xiaomi non ha spiegato la differenza e non possiamo risolverla dall'esterno; l'interpretazione più probabile è una convenzione di conteggio sui tensori quantizzati, più che un modello diverso. La mossa sicura è dimensionare a partire dai dati di peso pubblicati: 172,9 GB di FP8 su 65 shard è un numero che va pagato in VRAM indipendentemente da come si contano i parametri.
Cosa dicono i benchmark, e chi li ha eseguiti
Ogni cifra riportata di seguito proviene dalle tabelle di valutazione di Xiaomi presenti nella scheda del modello. Nessuno di questi dati è stato riprodotto in modo indipendente, nessuno di essi compare su una classifica pubblica, e le colonne di confronto sono esecuzioni effettuate dal fornitore stesso delle stesse suite di valutazione su modelli di altre aziende. Considerate la forma dei risultati indicativa e i decimali una mera decorazione.
• Agente di codice — DeepSWE v1.1: Flash 67,9, Pro 71,9, contro Claude Opus 5 a 74,0, GPT-5.6 Sol a 73,0 e Claude Fable 5 a 70,0. Su Terminal Bench 2.1, Flash arriva a 87,6 contro l'89,1 di Opus 5 — un divario abbastanza piccolo da poter essere deciso dall'harness, non dal modello.
• Agente generalista — AutomationBench v1.0.6 colloca Flash a 52.3, al di sopra sia di GPT-5.6 Sol (45.8) sia di Claude Opus 5 (50.3) nell'esecuzione di Xiaomi. Toolathlon-Verified: Flash 73.6, Pro 76.9, Opus 5 80.6.
• Cybersecurity — la colonna più sbilanciata della tabella. CyberGym: Flash 95.1, sopra il suo stesso fratello maggiore a 94.0, con MiMo-V2.5-Pro a 40.0. Poi il fondo crolla: ExploitGym 6.0 per Flash contro 22.1 per Opus 5, ExploitBench 25.3 contro 70.0, SEC Bench Pro 47.5 contro 79.1 per GPT-5.6 Sol.
• Agente visuale — MiMo VisualCoding: Flash 71.5, Pro 72.3, Opus 5 70.0.
Vale la pena estrarre un numero, perché è il tipo di cosa che un post di lancio di solito nasconde. La dashboard RL di Xiaomi ha pubblicato Flash a 65.68 su DeepSWE v1.1 — e la model card ora riporta 67.9 per lo stesso benchmark sul checkpoint finale. Non sono la stessa misurazione. Il valore della dashboard era etichettato mini-swe-agent, avg@3, su uno snapshot di training; la tabella della card è la valutazione offline del fornitore dei pesi rilasciati. La differenza di due punti è il guadagno dell'ultima parte dell'esecuzione più qualunque cosa sia cambiata nella configurazione di valutazione, e nessuno fuori da Xiaomi può attualmente separare le due cose. Se hai citato 65.68 dalla settimana scorsa, ora è un numero obsoleto per un artefatto diverso.

Quanto costa davvero eseguirlo
I pesi aperti sono una licenza, non una fattura, ed è qui che il rilascio diventa meno celebrativo. La sezione deployment della scheda stessa consiglia SGLang (tensor parallel 16, data parallel 2, con il percorso speculativo multi-layer in stile EAGLE abilitato) o una recipe vLLM con tensor parallel 8, e osserva che la versione stabile di vLLM potrebbe essere in ritardo rispetto all'architettura. Si tratta di un lavoro di serving multi-nodo per un modello da 309B i cui pesi occupano circa 173 GB prima di aggiungere la KV cache per un contesto di 1M token. Il campionamento consigliato prevede temperature 1.0, top_p 0.95.
Quindi la formulazione onesta di "open source" in questo caso è: Xiaomi ha rimosso la barriera della licenza e ha lasciato la barriera hardware esattamente dov’era. Ora il fine-tuning di Flash sui propri trace è legale e possibile; farlo su qualsiasi cosa più piccola di un serio nodo GPU non lo è. È un’offerta reale e diversa da un endpoint ospitato, ed è per questo che i due modi di usare questa generazione non competono — coprono budget diversi.
Se vuoi la funzionalità senza il nodo, i modelli con cui Xiaomi si confronta in quella tabella sono l'alternativa pratica: GPT-5.6 Sol, Claude Opus 5 e Claude Fable 5 sono tutti disponibili oggi, e sono una chiave API al prezzo di listino del provider, con 0% di ricarico applicato su OrcaRouter, quindi la decisione che stai effettivamente prendendo è «comprare un nodo» oppure «misurare le chiamate». Se vuoi vedere come si comporta il livello richiamabile sugli stessi compiti di programmazione prima di impegnarti in un modo o nell'altro, la scheda di programmazione è una lettura più rapida della tabella del fornitore. Ciò che non puoi fare su nessun router oggi è chiamare MiMo-V2.6-Flash stesso — non instradiamo alcun modello Xiaomi, e la riga sulla disponibilità nella scheda di Xiaomi stessa rimanda ai canali di Xiaomi: la piattaforma API MiMo, AI Studio, MiMo Code e l'app desktop.

La questione del prezzo è ancora aperta
Xiaomi non ha pubblicato una tariffa per token per MiMo-V2.6-Flash. I resoconti sul lancio affermano che la serie manterrà i prezzi API di MiMo-V2.5, e questa è una dichiarazione stampa più che un listino del fornitore — le tariffe pubblicate per l'estero della generazione V2.5 erano circa un decimo di dollaro per milione di token di input, con l'input in cache un ordine di grandezza più economico, ma nulla sul sito di Xiaomi conferma che i nuovi checkpoint le ereditino. Finché non compare un listino prezzi, qualsiasi cifra tu veda per un endpoint MiMo-V2.6 è una deduzione di qualcuno.
Mancano ancora altre due cose, ed entrambe sono sulla lista delle cose da fare di Xiaomi, non di qualcun altro. La dichiarazione di Luo Fuli durante la livestream sull'RL era che gli ambienti di addestramento e il codice RL sarebbero stati resi open source, e il materiale di lancio ribadisce questo impegno; attualmente i repository includono pesi, un rapporto tecnico e istruzioni di deployment, non lo stack di addestramento. E non esiste una valutazione indipendente: nessun invio a una leaderboard, nessuna riesecuzione da parte di terzi delle colonne DeepSWE o CyberGym. È il divario che conta di più per chiunque debba decidere se un modello da 309B con un budget attivo di 15B valga un nodo.
Cosa cambierebbe il quadro
Tre segnali meritano attenzione, in ordine approssimativo di quanto influenzerebbero una decisione. Un listino prezzi pubblicato trasforma questo da progetto di self-hosting in una voce di costo che puoi confrontare con la frontiera dei servizi ospitati. Un'esecuzione di terze parti sugli stessi harness — DeepSWE o Terminal Bench, inviata anziché autodichiarata — chiarirebbe se il 67.9 è una posizione reale o una configurazione favorevole. E gli ambienti RL, se arriveranno, sarebbero l'artefatto più interessante per la maggior parte dei team, perché sono ciò di cui avresti bisogno per riprodurre il ciclo di auto-miglioramento sui tuoi dati.
Fino ad allora, la lettura pratica di questo rilascio è ristretta e chiara. MiMo-V2.6-Flash è un legittimo modello agente omnimodale open-weight, con licenza MIT, di una dimensione che presuppone un cluster — ed è il primo checkpoint della generazione MiMo-V2.6 che puoi tenere tra le mani, il che è più di quanto si potesse dire la settimana scorsa.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
