
MiMo-V2.6-Pro vs Qwen3.8-Max: un punto di indice, sei volte il prezzo
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max è un modello da 2,4 trilioni di parametri che ne attiva 95 miliardi per token e gira su un singolo provider. Xiaomi MiMo-V2.6-Pro è un modello da 1,02 trilioni di parametri che ne attiva 42 miliardi per token, ottiene un punto in più sullo stesso indice indipendente e costa circa un sesto per chiamata. Questi fatti coesistono in modo scomodo, e come li risolvi è l'intera decisione tra i due. In breve: su Artificial Analysis Intelligence Index v4.3.2, Xiaomi MiMo-V2.6-Pro ottiene 46 e Qwen3.8-Max 45 — un pareggio all'interno del rumore — mentre il listino prezzi riporta $0,43 e $0,87 per milione di token contro $2,00 e $6,00.
Cosa è realmente ciascun modello
Qwen3.8-Max è il modello di punta di Alibaba, disponibile in generale dal 3 agosto 2026, ed è stato il modello più grande mai rilasciato dalla linea Qwen al momento del suo debutto. È un mixture-of-experts sparso costruito sull'architettura Qwen 3.5, con 2,4 trilioni di parametri totali e circa 95 miliardi attivi per token, una finestra di contesto da 1 milione di token, fino a 131.000 token di output e input multimodale su testo, immagini e video. Alibaba ha ridotto la tariffa internazionale a 2,00 $ per milione di token in input e 6,00 $ per milione in output, con l'input in cache a 0,25 $, e l'ha presentata come circa il 40% del prezzo di input di Claude Opus 5. Un aggiornamento puntuale, Qwen3.8-Max-0902, è arrivato il 2 settembre 2026 ed è quello che Artificial Analysis attualmente valuta a 45.
Xiaomi MiMo-V2.6-Pro ha raggiunto la disponibilità generale il 22 settembre 2026, tre giorni prima della stesura di questo confronto, con i suoi repository di checkpoint di reinforcement learning apparsi il giorno precedente. È un mixture-of-experts sparso con 1,02 trilioni di parametri totali e 42 miliardi attivi per token, con la stessa finestra di contesto da 1M token, multimodalità nativa su testo, immagine, video e audio, e pesi pubblicati con licenza MIT. Xiaomi ha mantenuto il prezzo della generazione precedente invece di aumentare il prezzo del nuovo checkpoint, motivo per cui è listato a $0,43 e $0,87 con uno sconto cache del 99% e un prezzo misto di $0,18.
• Calcolo attivo per token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, meno della metà
• Parametri totali — Qwen3.8-Max 2.4T; Xiaomi MiMo-V2.6-Pro 1.02T
• Punteggio dell'indice — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, entrambi su Artificial Analysis v4.3.2
• Velocità di output — Xiaomi MiMo-V2.6-Pro 134,3 token al secondo; Qwen3.8-Max 39,2, rispetto a una mediana della fascia di 72,5
• Tempo al primo token — Xiaomi MiMo-V2.6-Pro 2,15 secondi; Qwen3.8-Max 2,93
• Prezzo di listino — Xiaomi MiMo-V2.6-Pro $0,43 / $0,87 per 1M; Qwen3.8-Max $2,00 / $6,00
• Tariffa combinata — Xiaomi MiMo-V2.6-Pro $0,18 per 1 milione con rapporto 7:2:1 cache-hit/input/output; Qwen3.8-Max $1,18
• Pesi — Xiaomi MiMo-V2.6-Pro con licenza MIT e scaricabile; Qwen3.8-Max è stato reso disponibile come endpoint proprietario, con una release open-weight solo testuale che elimina il contesto da 1M e l'input visivo
• Raggiungibilità — un provider API conteggiato per ciascuno su Artificial Analysis
Il punteggio è in parità. La velocità no.
Un punto su un composito di dieci valutazioni non è una differenza su cui qualcuno dovrebbe agire, e il segnale più utile è ciò che è accaduto al di sotto di esso. Il modello con meno della metà dei parametri attivi per token ha ottenuto un punteggio marginalmente superiore e ha generato output tre volte e mezzo più velocemente — 134,3 token al secondo contro 39,2, dove la mediana per modelli di ragionamento comparabili è 72,5. Qwen3.8-Max è il più lento dei modelli di classe frontier misurati su quella pagina, e questa è una conseguenza progettuale dell'attivazione di 95 miliardi di parametri per token, non un incidente del serving.
La latenza racconta una storia opposta a quella suggerita dal numero di parametri. Qwen3.8-Max raggiunge il primo token in 2,93 secondi contro i 2,15 di Xiaomi, e il divario è molto più piccolo di quello di throughput — Qwen3.8-Max è lento una volta che inizia a scrivere, non lento a partire. Per un'interfaccia di chat in cui la risposta è breve, quella differenza si nota appena. Per un ciclo di agente che genera decine di migliaia di token di output, il throughput è l'intero tempo effettivo, e un divario di 3,4× si accumula a ogni turno dell'esecuzione.

Dove le tabelle dei fornitori divergono, e perché ciò non è una contraddizione
Alibaba ha pubblicato un'ampia tabella per Qwen3.8-Max ed è davvero forte: Terminal-Bench 2.1 a 86,6, SWE-bench Pro a 67,7, PaperBench a 93,0, GPQA Diamond a 92,6, IFBench a 82,8, OSWorld-Verified a 86,1 e Humanity's Last Exam a 43,6. Sono cifre ottenute dal fornitore, su harness propri di Alibaba e alcune su benchmark di Alibaba stesso, quindi sono affermazioni più che misurazioni — ma sono affermazioni su benchmark ampiamente utilizzati, il che le rende più comparabili tra laboratori rispetto al risultato di un harness su misura.
Il numero di punta di Xiaomi è 72,57 su DeepSWE v1.1, in aumento rispetto a una baseline di 58,4, misurato con mini-swe-agent come media di tre esecuzioni sul grader di Xiaomi stesso, nell'ambito di un addestramento di apprendimento per rinforzo che Xiaomi ha documentato come trenta passi e circa 750.000 traiettorie, con una spesa pubblicata di circa 2,62 milioni di dollari. Non è stato inviato alla classifica pubblica DeepSWE e nessuna terza parte lo ha riprodotto. Mettere 72,57 contro il 67,7 di Qwen su SWE-bench Pro e dichiarare una vittoria di Xiaomi di cinque punti significherebbe fare un confronto incrociato tra due benchmark diversi, due harness diversi e due convenzioni di punteggio diverse. Esiste esattamente un'unica misura sulla quale entrambi i modelli sono stati testati da qualcuno diverso dal loro produttore, e dice 46 a 45.
Due dei numeri più rilevanti di Qwen3.8-Max non sono affatto punteggi. Alibaba ha annunciato che i pesi sarebbero stati resi open source insieme a Qwen3.8-27B, ma il checkpoint che è arrivato è solo testo e non include il contesto completo da 1M token né l'input visivo che ha l'endpoint Max in servizio. Quindi "Qwen3.8-Max è a pesi aperti" e "Qwen3.8-Max è un endpoint multimodale con contesto da 1M" sono entrambe affermazioni vere su artefatti diversi, e un piano di deployment basato sulla prima aspettandosi la seconda non sopravviverà al contatto. Nel frattempo, la point release 0902 ha portato il modello in cima a un'arena pubblica di sviluppo web senza un cambio di numero di versione: un promemoria che il modello che hai benchmarkato ad agosto non è necessariamente quello che serve le tue richieste a settembre.
Il fatto che i pesi siano aperti significa che puoi ospitare l'uno o l'altro sul tuo server?
Per Xiaomi MiMo-V2.6-Pro, in linea di principio sì: licenza MIT, nessun accordo commerciale necessario. In pratica un checkpoint da 1,02T di parametri con 42B attivi richiede un cluster di serving multi-nodo, che rappresenta un ordine di impegno diverso rispetto alla chiamata di un'API. Pubblicare i pesi rende legale l'hosting autonomo, ma non lo rende economico.
Per Qwen3.8-Max la risposta è più limitata di quanto la reputazione suggerisca. Il rilascio open è solo testo e senza la finestra di contesto completa, quindi ospitarlo autonomamente ti dà un modello sostanzialmente più piccolo di quello sul quale è stato misurato il 45. Se ciò che vuoi è la configurazione sottoposta a benchmark, l'endpoint servito è il prodotto, e l'endpoint è proprietario.
Chiamare l'uno o l'altro, e l'aritmetica che lo decide
Entrambi i modelli sono conteggiati presso un unico provider API da Artificial Analysis, una cosa insolita per due modelli di punta, e questo rende il failover la domanda pratica più che un semplice optional. Qwen3.8-Max è su OrcaRouter come qwen/qwen3.8-max — un endpoint compatibile OpenAI al prezzo di listino di Alibaba con markup 0%, quindi i 2,00 $ e i 6,00 $ di cui sopra vengono trasferiti invariati e una variazione di prezzo da parte di Alibaba è attiva sulla nostra piattaforma lo stesso giorno. Le nostre misurazioni collocano il p50 dell'endpoint intorno ai 3,3 secondi, ed è questo il dato su cui pianificare anziché il caso teorico migliore, e una catena di fallback fa sì che una richiesta bloccata venga ritentata su un altro upstream prima che inizi la risposta. Xiaomi MiMo-V2.6-Pro non è su OrcaRouter; nessun modello Xiaomi lo è, e la via per raggiungerlo oggi è la piattaforma di Xiaomi stessa e i cataloghi di terze parti che lo elencano.
È sull'aritmetica dei costi che questo confronto si decide davvero, e non è l'aritmetica che i tassi principali suggeriscono. Con un mix 7:2:1 di cache-hit/input/output, le tariffe ponderate sono $0,18 e $1,18 per milione — un divario di 6,6×, più ampio dei divari di 4,6× sull'input e 6,9× sull'output, perché lo sconto del 99% sulla cache di Xiaomi è più profondo dell'88% di Alibaba. Artificial Analysis registra anche un costo di $0,13 per attività dell'Intelligence Index per Xiaomi MiMo-V2.6-Pro, misurato in modo identico su ogni modello della classifica. Esegui lo stesso carico di lavoro su entrambi e il modello più economico è quello che ha ottenuto il punteggio più alto, cosa insolita da poter scrivere e motivo per cui questo confronto non è una formalità.

Chi dovrebbe passare e chi no
Se oggi usi Qwen3.8-Max e funziona, non c'è alcun caso urgente per cambiare. Il divario dell'indice è un punto, il comportamento di visione e contesto lungo è comprovato nel tuo carico di lavoro, e Alibaba sta ancora sviluppando la linea — l'aggiornamento 0902 lo dimostra. L'argomento a favore del passaggio è il throughput e il costo misto, ed è un argomento forte solo se il tuo traffico è a prevalenza di output o a lungo orizzonte: agenti, generazione di codice, qualsiasi cosa che scriva molto più di quanto legga.
Se si parte da zero, l'ordinamento è difficile da contestare sulla base delle prove pubblicate. Il modello Xiaomi è più veloce, più economico su ogni asse, con licenza MIT e marginalmente in vantaggio sull'unico composito gestito in modo indipendente che copre entrambi. I contrappesi sono reali e specifici: tre giorni di cronologia di produzione, una singola rotta di servizio e nessuna voce pubblica di benchmark da esaminare. Questa combinazione depone a favore di valutarlo in una corsia accanto a un incumbent anziché sostituirne uno — ed è a questo che serve una configurazione di routing, e perché la mossa utile è mettere il candidato e l'incumbent dietro un'unica chiave anziché scegliere un vincitore da un tabellone.

Cosa cambierebbe questa risposta?
Tre cose. Un secondo e un terzo provider per Xiaomi MiMo-V2.6-Pro eliminerebbero l'unica obiezione strutturale che lo riguarda e trasformerebbero il divario di prezzo in una decisione concreta anziché in una scelta allettante. Un'esecuzione indipendente della configurazione DeepSWE o confermerebbe il 72,57 o lo archivierebbe, e in entrambi i casi l'esito vale più del numero stesso. E le ripartizioni per valutazione sulla v4.3.2 mostrerebbero quale delle dieci valutazioni vince ciascun modello — il composito è un composito, e un modello che è in testa nel coding agentico e uno che è in testa nel question answering ad alta intensità di recupero possono ottenere lo stesso punteggio indice pur essendo inadatti ai compiti l'uno dell'altro.
