Una scheda di titolo per il confronto tra MiMo-V2.6-Pro e Qwen3.8-Max, che mostra due schede tecniche una di fronte all'altra: Xiaomi MiMo-V2.6-Pro con Intelligence Index v4.3.2 46, 42B parametri attivi per token, 134,3 token/secondo e 0,18 $ per 1M blended, contro Qwen3.8-Max con Index 45, 95B attivi per token, 39,2 token/secondo e 1,18 $.
Guides & Insights

MiMo-V2.6-Pro vs Qwen3.8-Max: un punto di indice, sei volte il prezzo

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen3.8-Max è un modello da 2,4 trilioni di parametri che ne attiva 95 miliardi per token e gira su un singolo provider. Xiaomi MiMo-V2.6-Pro è un modello da 1,02 trilioni di parametri che ne attiva 42 miliardi per token, ottiene un punto in più sullo stesso indice indipendente e costa circa un sesto per chiamata. Questi fatti coesistono in modo scomodo, e come li risolvi è l'intera decisione tra i due. In breve: su Artificial Analysis Intelligence Index v4.3.2, Xiaomi MiMo-V2.6-Pro ottiene 46 e Qwen3.8-Max 45 — un pareggio all'interno del rumore — mentre il listino prezzi riporta $0,43 e $0,87 per milione di token contro $2,00 e $6,00.

Cosa è realmente ciascun modello

Qwen3.8-Max è il modello di punta di Alibaba, disponibile in generale dal 3 agosto 2026, ed è stato il modello più grande mai rilasciato dalla linea Qwen al momento del suo debutto. È un mixture-of-experts sparso costruito sull'architettura Qwen 3.5, con 2,4 trilioni di parametri totali e circa 95 miliardi attivi per token, una finestra di contesto da 1 milione di token, fino a 131.000 token di output e input multimodale su testo, immagini e video. Alibaba ha ridotto la tariffa internazionale a 2,00 $ per milione di token in input e 6,00 $ per milione in output, con l'input in cache a 0,25 $, e l'ha presentata come circa il 40% del prezzo di input di Claude Opus 5. Un aggiornamento puntuale, Qwen3.8-Max-0902, è arrivato il 2 settembre 2026 ed è quello che Artificial Analysis attualmente valuta a 45.

Xiaomi MiMo-V2.6-Pro ha raggiunto la disponibilità generale il 22 settembre 2026, tre giorni prima della stesura di questo confronto, con i suoi repository di checkpoint di reinforcement learning apparsi il giorno precedente. È un mixture-of-experts sparso con 1,02 trilioni di parametri totali e 42 miliardi attivi per token, con la stessa finestra di contesto da 1M token, multimodalità nativa su testo, immagine, video e audio, e pesi pubblicati con licenza MIT. Xiaomi ha mantenuto il prezzo della generazione precedente invece di aumentare il prezzo del nuovo checkpoint, motivo per cui è listato a $0,43 e $0,87 con uno sconto cache del 99% e un prezzo misto di $0,18.

• Calcolo attivo per token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, meno della metà

• Parametri totali — Qwen3.8-Max 2.4T; Xiaomi MiMo-V2.6-Pro 1.02T

• Punteggio dell'indice — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, entrambi su Artificial Analysis v4.3.2

• Velocità di output — Xiaomi MiMo-V2.6-Pro 134,3 token al secondo; Qwen3.8-Max 39,2, rispetto a una mediana della fascia di 72,5

• Tempo al primo token — Xiaomi MiMo-V2.6-Pro 2,15 secondi; Qwen3.8-Max 2,93

• Prezzo di listino — Xiaomi MiMo-V2.6-Pro $0,43 / $0,87 per 1M; Qwen3.8-Max $2,00 / $6,00

• Tariffa combinata — Xiaomi MiMo-V2.6-Pro $0,18 per 1 milione con rapporto 7:2:1 cache-hit/input/output; Qwen3.8-Max $1,18

• Pesi — Xiaomi MiMo-V2.6-Pro con licenza MIT e scaricabile; Qwen3.8-Max è stato reso disponibile come endpoint proprietario, con una release open-weight solo testuale che elimina il contesto da 1M e l'input visivo

• Raggiungibilità — un provider API conteggiato per ciascuno su Artificial Analysis

Il punteggio è in parità. La velocità no.

Un punto su un composito di dieci valutazioni non è una differenza su cui qualcuno dovrebbe agire, e il segnale più utile è ciò che è accaduto al di sotto di esso. Il modello con meno della metà dei parametri attivi per token ha ottenuto un punteggio marginalmente superiore e ha generato output tre volte e mezzo più velocemente — 134,3 token al secondo contro 39,2, dove la mediana per modelli di ragionamento comparabili è 72,5. Qwen3.8-Max è il più lento dei modelli di classe frontier misurati su quella pagina, e questa è una conseguenza progettuale dell'attivazione di 95 miliardi di parametri per token, non un incidente del serving.

La latenza racconta una storia opposta a quella suggerita dal numero di parametri. Qwen3.8-Max raggiunge il primo token in 2,93 secondi contro i 2,15 di Xiaomi, e il divario è molto più piccolo di quello di throughput — Qwen3.8-Max è lento una volta che inizia a scrivere, non lento a partire. Per un'interfaccia di chat in cui la risposta è breve, quella differenza si nota appena. Per un ciclo di agente che genera decine di migliaia di token di output, il throughput è l'intero tempo effettivo, e un divario di 3,4× si accumula a ogni turno dell'esecuzione.

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and Qwen3.8-Max covering Intelligence Index v4.3.2 (46 vs 45), active parameters (42B vs 95B per token), output speed (134.3 vs 39.2 tokens/second), time to first token (2.15s vs 2.93s), blended rate ($0.18 vs $1.18 per 1M) and weight availability (MIT, full multimodal vs a text-only release without the 1M context).

Dove le tabelle dei fornitori divergono, e perché ciò non è una contraddizione

Alibaba ha pubblicato un'ampia tabella per Qwen3.8-Max ed è davvero forte: Terminal-Bench 2.1 a 86,6, SWE-bench Pro a 67,7, PaperBench a 93,0, GPQA Diamond a 92,6, IFBench a 82,8, OSWorld-Verified a 86,1 e Humanity's Last Exam a 43,6. Sono cifre ottenute dal fornitore, su harness propri di Alibaba e alcune su benchmark di Alibaba stesso, quindi sono affermazioni più che misurazioni — ma sono affermazioni su benchmark ampiamente utilizzati, il che le rende più comparabili tra laboratori rispetto al risultato di un harness su misura.

Il numero di punta di Xiaomi è 72,57 su DeepSWE v1.1, in aumento rispetto a una baseline di 58,4, misurato con mini-swe-agent come media di tre esecuzioni sul grader di Xiaomi stesso, nell'ambito di un addestramento di apprendimento per rinforzo che Xiaomi ha documentato come trenta passi e circa 750.000 traiettorie, con una spesa pubblicata di circa 2,62 milioni di dollari. Non è stato inviato alla classifica pubblica DeepSWE e nessuna terza parte lo ha riprodotto. Mettere 72,57 contro il 67,7 di Qwen su SWE-bench Pro e dichiarare una vittoria di Xiaomi di cinque punti significherebbe fare un confronto incrociato tra due benchmark diversi, due harness diversi e due convenzioni di punteggio diverse. Esiste esattamente un'unica misura sulla quale entrambi i modelli sono stati testati da qualcuno diverso dal loro produttore, e dice 46 a 45.

Due dei numeri più rilevanti di Qwen3.8-Max non sono affatto punteggi. Alibaba ha annunciato che i pesi sarebbero stati resi open source insieme a Qwen3.8-27B, ma il checkpoint che è arrivato è solo testo e non include il contesto completo da 1M token né l'input visivo che ha l'endpoint Max in servizio. Quindi "Qwen3.8-Max è a pesi aperti" e "Qwen3.8-Max è un endpoint multimodale con contesto da 1M" sono entrambe affermazioni vere su artefatti diversi, e un piano di deployment basato sulla prima aspettandosi la seconda non sopravviverà al contatto. Nel frattempo, la point release 0902 ha portato il modello in cima a un'arena pubblica di sviluppo web senza un cambio di numero di versione: un promemoria che il modello che hai benchmarkato ad agosto non è necessariamente quello che serve le tue richieste a settembre.

Il fatto che i pesi siano aperti significa che puoi ospitare l'uno o l'altro sul tuo server?

Per Xiaomi MiMo-V2.6-Pro, in linea di principio sì: licenza MIT, nessun accordo commerciale necessario. In pratica un checkpoint da 1,02T di parametri con 42B attivi richiede un cluster di serving multi-nodo, che rappresenta un ordine di impegno diverso rispetto alla chiamata di un'API. Pubblicare i pesi rende legale l'hosting autonomo, ma non lo rende economico.

Per Qwen3.8-Max la risposta è più limitata di quanto la reputazione suggerisca. Il rilascio open è solo testo e senza la finestra di contesto completa, quindi ospitarlo autonomamente ti dà un modello sostanzialmente più piccolo di quello sul quale è stato misurato il 45. Se ciò che vuoi è la configurazione sottoposta a benchmark, l'endpoint servito è il prodotto, e l'endpoint è proprietario.

Chiamare l'uno o l'altro, e l'aritmetica che lo decide

Entrambi i modelli sono conteggiati presso un unico provider API da Artificial Analysis, una cosa insolita per due modelli di punta, e questo rende il failover la domanda pratica più che un semplice optional. Qwen3.8-Max è su OrcaRouter come qwen/qwen3.8-maxun endpoint compatibile OpenAI al prezzo di listino di Alibaba con markup 0%, quindi i 2,00 $ e i 6,00 $ di cui sopra vengono trasferiti invariati e una variazione di prezzo da parte di Alibaba è attiva sulla nostra piattaforma lo stesso giorno. Le nostre misurazioni collocano il p50 dell'endpoint intorno ai 3,3 secondi, ed è questo il dato su cui pianificare anziché il caso teorico migliore, e una catena di fallback fa sì che una richiesta bloccata venga ritentata su un altro upstream prima che inizi la risposta. Xiaomi MiMo-V2.6-Pro non è su OrcaRouter; nessun modello Xiaomi lo è, e la via per raggiungerlo oggi è la piattaforma di Xiaomi stessa e i cataloghi di terze parti che lo elencano.

È sull'aritmetica dei costi che questo confronto si decide davvero, e non è l'aritmetica che i tassi principali suggeriscono. Con un mix 7:2:1 di cache-hit/input/output, le tariffe ponderate sono $0,18 e $1,18 per milione — un divario di 6,6×, più ampio dei divari di 4,6× sull'input e 6,9× sull'output, perché lo sconto del 99% sulla cache di Xiaomi è più profondo dell'88% di Alibaba. Artificial Analysis registra anche un costo di $0,13 per attività dell'Intelligence Index per Xiaomi MiMo-V2.6-Pro, misurato in modo identico su ogni modello della classifica. Esegui lo stesso carico di lavoro su entrambi e il modello più economico è quello che ha ottenuto il punteggio più alto, cosa insolita da poter scrivere e motivo per cui questo confronto non è una formalità.

The OrcaRouter model page for qwen/qwen3.8-max, showing the model's vendor, capability tags, context window and the per-million-token input and output rates passed through from Alibaba's list price.

Chi dovrebbe passare e chi no

Se oggi usi Qwen3.8-Max e funziona, non c'è alcun caso urgente per cambiare. Il divario dell'indice è un punto, il comportamento di visione e contesto lungo è comprovato nel tuo carico di lavoro, e Alibaba sta ancora sviluppando la linea — l'aggiornamento 0902 lo dimostra. L'argomento a favore del passaggio è il throughput e il costo misto, ed è un argomento forte solo se il tuo traffico è a prevalenza di output o a lungo orizzonte: agenti, generazione di codice, qualsiasi cosa che scriva molto più di quanto legga.

Se si parte da zero, l'ordinamento è difficile da contestare sulla base delle prove pubblicate. Il modello Xiaomi è più veloce, più economico su ogni asse, con licenza MIT e marginalmente in vantaggio sull'unico composito gestito in modo indipendente che copre entrambi. I contrappesi sono reali e specifici: tre giorni di cronologia di produzione, una singola rotta di servizio e nessuna voce pubblica di benchmark da esaminare. Questa combinazione depone a favore di valutarlo in una corsia accanto a un incumbent anziché sostituirne uno — ed è a questo che serve una configurazione di routing, e perché la mossa utile è mettere il candidato e l'incumbent dietro un'unica chiave anziché scegliere un vincitore da un tabellone.

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

Cosa cambierebbe questa risposta?

Tre cose. Un secondo e un terzo provider per Xiaomi MiMo-V2.6-Pro eliminerebbero l'unica obiezione strutturale che lo riguarda e trasformerebbero il divario di prezzo in una decisione concreta anziché in una scelta allettante. Un'esecuzione indipendente della configurazione DeepSWE o confermerebbe il 72,57 o lo archivierebbe, e in entrambi i casi l'esito vale più del numero stesso. E le ripartizioni per valutazione sulla v4.3.2 mostrerebbero quale delle dieci valutazioni vince ciascun modello — il composito è un composito, e un modello che è in testa nel coding agentico e uno che è in testa nel question answering ad alta intensità di recupero possono ottenere lo stesso punteggio indice pur essendo inadatti ai compiti l'uno dell'altro.