
MiMo-V2.6-Flash vs Qwen3.8-Max: un download contro un contatore, e solo uno dei due ha un punteggio
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Un solo numero decide come viene di solito scritto questo confronto, e non è un benchmark. Qwen3.8-Max è un modello hosted che Artificial Analysis misura in modo continuativo, perciò ha un Intelligence Index attuale di 45 sulla scala v4.3 ricalibrata, una velocità di output di 39,2 token al secondo e un prezzo di listino di 2,00 $ per milione di token in input e 6,00 $ per milione in output. MiMo-V2.6-Flash, che Xiaomi ha pubblicato come pesi scaricabili il 21 settembre 2026, non ha nulla di tutto ciò: nessun listino prezzi di un provider, nessun identificativo di modello annunciato da Xiaomi e nessuna pagina su Artificial Analysis. Tutto ciò che è stato pubblicato sulle capacità di MiMo-V2.6-Flash proviene dalle tabelle di valutazione dello stesso Xiaomi nella sua scheda modello. Nessun dato è stato rieseguito da qualcuno che non lavori per Xiaomi.
Quell'asimmetria non è un punto a sfavore del modello. È un fatto relativo a che tipo di acquisto sia ciascuno, e cambia ciò che puoi davvero concludere da un confronto diretto. Il resto di questo articolo riguarda le tre cose che puoi realmente confrontare — la forma dell'affermazione, il costo di un token e la licenza — più un numero che è reale, misurato in modo indipendente e non appartiene a nessuno dei due modelli citati nel titolo.
Innanzitutto, quale Qwen 3.8, e quale MiMo?
Entrambi i nomi in quel titolo sono famiglie che fingono di essere checkpoint, e le sostituzioni non sono innocue.
• Qwen3.8-Max — il modello di punta ospitato di Alibaba, presentato il 3 agosto 2026. Un modello sparse mixture-of-experts da 2,4 trilioni di parametri con circa 95 miliardi di parametri attivi per token, contesto da 1M di token e input di testo, immagini e video. È il modello che il resto di questo articolo tratta come l'avversario.
• Qwen3.8-Max (0902) — lo snapshot datato 2 settembre dello stesso modello, offerto come voce a sé stante con gli stessi prezzi di 2,00 $ e 6,00 $ e un tetto di output di 131.072 token. La pagina attuale di Artificial Analysis è dedicata a questa build, il che conta quando si cita un punteggio di indice.
• Qwen3.8-2.4T-A95B — il checkpoint open-weight dello stesso core, scaricabile dal 12 agosto 2026 con la Licenza Qwen3.8-Max. È solo testo, il thinking è sempre attivo e il suo contesto nativo è 262K anziché un milione. Non è il modello del titolo.
• MiMo-V2.6-Flash — il checkpoint sparse mixture-of-experts di Xiaomi da 309B totali e 15B attivi, senza gating su Hugging Face con licenza MIT, nativamente omnimodale, con una dichiarazione di contesto da 1M di token. È il membro efficiente di un rilascio in due checkpoint il cui flagship è MiMo-V2.6-Pro, con 1,02T totali e 42B attivi.
• MiMo-V2-Flash — il modello di dicembre 2025. Stessi 309B totali, stessi 15B attivi, stessa finestra scorrevole di 128 token. Run di addestramento diverso, tabella di benchmark diversa e un contesto da 256K. Qualsiasi pagina che metta "MiMo-V2-Flash" a confronto con un modello Qwen sta confrontando la generazione sbagliata, e la sola scheda tecnica non te lo dirà.
La collisione MiMo è la più insidiosa delle due trappole, perché i numeri che identificano il modello sono anche, per l'appunto, i numeri che sono identici tra i checkpoint 2025 e 2026. La collisione Qwen è più lieve, ma ha un prezzo: i pesi aperti da 2,4T e l'API ospitata sono artefatti diversi con termini diversi, e un confronto che li scambia sbaglierà sia la capacità sia la licenza.
L'indice è stato ricostruito e il numero che la maggior parte delle pagine stampa ancora è sparito
Ecco la modalità di errore a cui prestare attenzione prima che compaia qualsiasi punteggio.
Artificial Analysis ha ricalibrato il suo Intelligence Index alla v4.3 il 7 settembre 2026. I punteggi precedenti a tale data non sono comparabili ai punteggi successivi, e la pagina live di Qwen3.8-Max riporta un Aggiornato badge che segnala un risultato rettificato. Il dato di 58 largamente diffuso per Qwen3.8-Max appartiene alla vecchia scala. L'attuale Qwen3.8-Max (0902) segna 45, classificandosi al 19º posto tra i 202 modelli che Artificial Analysis colloca in quella classe.
Non è pedanteria. Un 58 accanto a un 46 si legge come un divario di dodici punti. Gli stessi due modelli sulla stessa scala attuale distano un solo punto — e il 46 non è nemmeno il modello di cui parla questo articolo:
• Qwen3.8-Max (0902), misurato in modo indipendente — Intelligence Index 45 su v4.3. Velocità di output 39,2 token al secondo, classificato 151° su 202, che la pagina stessa segnala come lenta. Costo per attività dell'Intelligence Index 5,41 $. Token di output generati per completare l'indice: 190M.
• MiMo-V2.6-Pro, misurato in modo indipendente — Intelligence Index 46, primo classificato tra i 114 modelli della classe open-weights. Velocità di output 134,3 token al secondo. Costo per attività dell'Intelligence Index 0,13 $. Token di output per completare l'indice: 140M.
• MiMo-V2.6-Flash, il vero oggetto — non esiste alcuna pagina di Artificial Analysis. Nulla da citare.
Se si leggono tutti e tre insieme, il riassunto onesto è scomodo per entrambi i fornitori. Il termine di paragone che tutti vogliono — Flash contro Qwen3.8-Max su una scala neutrale — non esiste e non può essere costruito dalle tabelle dei fornitori, perché i due fornitori hanno eseguito harness diversi su checkpoint diversi in momenti diversi e poi si sono confrontati con modelli di altre aziende che avevano eseguito a loro volta. Ciò che esiste è un divario di un punto tra il Qwen di punta e il più grande checkpoint di Xiaomi, a circa un quarantesimo del costo per attività di indice. Questo è il numero reale più interessante di questo confronto, e riguarda un modello che nessuna delle due parti del titolo nomina.

Cosa ti diranno e cosa non ti diranno le tabelle dei fornitori
Entrambi i fornitori pubblicano numeri. Non sono lo stesso tipo di numero, e allinearli colonna per colonna produce un grafico più che un risultato — ma la forma delle affermazioni vale comunque la pena di essere letta, perché ti dice su cosa ha puntato ciascun laboratorio.
• Agente di programmazione — Xiaomi riporta MiMo-V2.6-Flash a 67.9 su DeepSWE v1.1, 87.6 su Terminal Bench 2.1, 26.0 su ProgramBench e 61.2 su MiMo Code Bench. Alibaba riporta Qwen3.8-Max a 67.7 su SWE-bench Pro e 86.6 su Terminal-Bench 2.1. I valori di Terminal-Bench sono abbastanza vicini che è plausibile che sia l'harness, non il modello, a determinare l'ordine.
• Agente generale — Xiaomi riporta AutomationBench v1.0.6 52,3, Toolathlon-Verified 73,6, OSWorld-Verified 80,8 e Agents' Last Exam 27,6 per Flash. Alibaba riporta OSWorld-Verified 86,1, WideSearch 81,9 e Agent's Last Exam 52,4 per Qwen3.8-Max. Sui due benchmark che entrambi i laboratori hanno eseguito, le cifre riportate da Qwen sono superiori — sull'harness di Alibaba stessa.
• Conoscenza e sicurezza — Xiaomi esegue CyberGym (Flash 95.1), MiMo Cyber Bench (77.2), ExploitGym (6.0), ExploitBench (25.3) e SEC Bench Pro (47.5). Alibaba esegue GPQA Diamond (92.6), Humanity's Last Exam (43.6) e PaperBench (93.0). Quasi nessuna sovrapposizione, quindi quasi nulla da confrontare.
L'unica cosa davvero utile che una tabella di un fornitore può mostrare è un'incoerenza interna, e quella di Xiaomi ne ha una. La sua dashboard RL pubblica, che ha trasmesso in streaming la sessione di addestramento fino a settembre, ha pubblicato MiMo-V2.6-Flash a 65.68 su DeepSWE v1.1 utilizzando un harness mini-swe-agent con media di tre. La scheda del modello finale riporta 67.9 per i pesi rilasciati. Questi descrivono rispettivamente uno snapshot di addestramento e un artefatto rilasciato, e la differenza di due punti è della stessa grandezza del divario tra i due checkpoint di Xiaomi. Se hai continuato a citare il numero della dashboard da settimana scorsa, è obsoleto.
Il disegno di legge, che è il punto in cui i due modelli smettono di essere comparabili.
Questa è la sezione che decide i deployment, e non c'è partita.
• Qwen3.8-Max è a consumo. 2,00 $ per milione di token di input e 6,00 $ per milione di token di output secondo il listino internazionale di Alibaba, con uno sconto sulla cache che Artificial Analysis misura all'88% e un costo di 5,41 $ per attività dell'Intelligence Index. La documentazione di Alibaba per la regione Cina indica 12 CNY e 36 CNY per milione per la stessa coppia. Puoi chiamarlo oggi pomeriggio e ricevere una fattura.
• MiMo-V2.6-Flash è un download. Xiaomi non pubblica alcuna tariffa per token per la generazione MiMo-V2.6 sul proprio sito e non ha annunciato alcun identificatore richiamabile per nessuno dei due checkpoint, quindi non c'è nulla da misurare. Quello che c'è, invece, è 172,9 GB di dati dei pesi FP8 su 65 shard, prima della KV cache per un contesto da 1M token, e una sezione di deployment che raccomanda SGLang con tensor parallel 16 e un fattore data-parallel di 2, oppure una ricetta vLLM con tensor parallel 8 — un job di serving multi-nodo.
• Gli annunci di terze parti non sono un listino prezzi. Le pagine di catalogo riportano effettivamente cifre per la serie MiMo-V2.6, e Artificial Analysis conta un unico provider API che serve MiMo-V2.6-Pro a $0,435 e $0,87 per milione. Quello è l'annuncio di un provider per il checkpoint più grande, non un prezzo Xiaomi, e per Flash non esiste affatto.
Quindi l'aritmetica è una voce a consumo rispetto a una decisione di capitale. Con qualche centinaio di milioni di token al mese, Qwen3.8-Max è una bolletta che puoi prevedere e Flash è un nodo che compreresti per servire un modello che nessuno al di fuori di Xiaomi ha misurato. Con miliardi di token al mese, il percorso open inizia a vincere sul costo, e questo è il punto in cui la licenza smette di essere una nota legale a piè di pagina e diventa un fattore di approvvigionamento.
Le licenze non sono la stessa autorizzazione
MIT è quanto di più permissivo si possa trovare tra i pesi aperti. La Licenza Qwen3.8-Max non è MIT, e la differenza ha un peso concreto.
MiMo-V2.6-Flash è distribuito con licenza MIT, senza soglia di fatturato, senza trigger basato sul numero di utenti, senza accordo commerciale separato e senza clausola di ricerca. La distribuzione commerciale, la modifica, la ridistribuzione e l'ulteriore addestramento sono tutti consentiti, e il repository è ad accesso libero.
La Licenza Qwen3.8-Max concede l'uso, la modifica, la distribuzione, la sublicenza, la vendita, il deployment, l'hosting e il fine-tuning, a due condizioni. Un prodotto o servizio che superi i 100 milioni di utenti attivi mensili o i 20 milioni di dollari USA di ricavi mensili deve mostrare il nome del modello in modo ben visibile nella propria interfaccia. Inoltre, un'attività di model-as-a-service o di assistente AI per il lavoro con ricavi aggregati superiori a 50 milioni di dollari USA in qualsiasi periodo di dodici mesi consecutivi necessita di una licenza separata da Alibaba prima dell'uso commerciale. L'uso interno è esentato, purché il modello o le sue capacità non siano esposti a terzi.
Per la maggior parte dei team, nessuna delle due condizioni è vincolante. Per un business di piattaforma che ha successo, una lo è — e lo è esattamente nel momento in cui il modello è diventato un elemento portante. Si noti inoltre che tali condizioni si applicano ai pesi scaricabili da 2,4T, non all'API ospitata, dove invece valgono i termini del fornitore. I due percorsi hanno obblighi diversi, il che è un'ulteriore ragione per non confrontare il checkpoint aperto con quello ospitato come se fossero lo stesso prodotto.
Dove OrcaRouter è adatto, e dove non lo è
Qwen3.8-Max è instradabile su OrcaRouter, sia sulla voce base che sullo snapshot datato 0902, tramite una chiave API al prezzo di listino del provider con markup dello 0% passato. Ciò è importante qui in particolare per due motivi. Primo, la build 0902 è una voce separata anziché una sostituzione silenziosa, quindi il DSL di routing può fissare il traffico sensibile alla riproducibilità allo snapshot datato mentre tutto il resto segue il tier base — nessuna seconda integrazione, nessuna modifica al codice. Secondo, poiché il prezzo di listino viene passato in avanti anziché maggiorato, una modifica al listino prezzi di Alibaba arriva dalla tua parte lo stesso giorno invece che al prossimo rinnovo contrattuale, il che è ciò che mantiene onesta l'aritmetica sopra riportata tra a consumo e a nodo mentre i prezzi si muovono. I carichi di lavoro ad alto uso di cache mantengono anche lo sconto cache del provider anziché perderne una parte nel margine di un rivenditore.

MiMo-V2.6-Flash non è instradabile da nessuna parte, incluso il nostro. Non instradiamo alcun modello Xiaomi, e la riga di disponibilità nella scheda di Xiaomi stessa rimanda ai canali di Xiaomi: la piattaforma API MiMo, AI Studio, MiMo Code e l'app desktop. Se vuoi questo checkpoint, devi scaricare 172,9 GB e trovare un nodo.

Quale, e quando
Scegli Qwen3.8-Max se vuoi capacità senza hardware, se il tuo volume è incerto o se vuoi avere la possibilità di un numero indipendente prima di impegnarti. Accetta che 45 sull'indice attuale sia una posizione a metà della frontiera anziché una posizione di vertice, che 39,2 token al secondo siano abbastanza lenti da contare all'interno di un ciclo di agente, e che 190M di token in output per completare l'Intelligence Index siano circa il doppio della mediana — la verbosità costa denaro sul lato del contatore tariffato sull'output.
Scegli MiMo-V2.6-Flash se il vincolo è la licenza, il percorso dei dati o una bolletta di lungo periodo che puoi ammortizzare — e se hai il nodo. I termini MIT senza soglia di ricavi sono davvero un permesso diverso da una licenza con una soglia di MAU e un trigger di condivisione dei ricavi, e per un'azienda che prevede di diventare grande, questa è la ragione per sceglierlo. Prevedi nel budget il serving multi-nodo, dimensiona dai dati sui pesi pubblicati piuttosto che dalla pagina del repository, e considera ogni numero nella scheda di Xiaomi come dichiarato dal fornitore finché qualcuno fuori dal laboratorio non lo rifà.
E se stai scegliendo oggi anziché il prossimo trimestre, prova prima l'opzione a consumo. Un mese di Qwen3.8-Max ti dice di cosa ha davvero bisogno il tuo carico di lavoro. Un nodo ti dice solo ciò che speravi ti dicesse.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
