Card hero del radar dei modelli OrcaRouter per il confronto tra MiMo-V2.6-Pro e Claude Opus 5, con il sottotitolo "Cinque punti indice. Ventuno volte il prezzo.", con un pannello per modello.
Guides & Insights

MiMo-V2.6-Pro vs Claude Opus 5: 21 volte più economico, cinque punti indice dietro

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Xiaomi MiMo-V2.6-Pro e Claude Opus 5 sono i due estremi di un unico scambio, e lo scambio ha un prezzo. Sull'Artificial Analysis Intelligence Index v4.3.2, Claude Opus 5 (max effort) ottiene 51 e Xiaomi MiMo-V2.6-Pro ottiene 46. Sul listino prezzi, Claude Opus 5 costa $5,00 per milione di token in input e $25,00 per milione in output; MiMo-V2.6-Pro costa $0,43 e $0,87. Fai la divisione e la risposta è 11,6x in input e 28,7x in output — e 21x sulla tariffa mista che Artificial Analysis pubblica per ciascuno. Cinque punti indice costano ventuno volte il denaro. Che sia un affare o uno spreco dipende interamente da cosa fa il tuo carico di lavoro con il quinto punto, e la maggior parte dei team non lo calcola mai prima di impegnarsi.

I due modelli, in parole semplici

Claude Opus 5 è il modello di punta proprietario di Anthropic, rilasciato il 24 luglio 2026, con una finestra di contesto di 1M token e un numero di parametri non divulgato. Xiaomi MiMo-V2.6-Pro è un modello sparse mixture-of-experts con 1,02 trilioni di parametri totali e 42 miliardi attivati, con una finestra di contesto di 1M token, multimodalità nativa su testo, immagini, video e audio, e pesi pubblicati con licenza MIT.

• Pesi — MiMo-V2.6-Pro con licenza MIT e scaricabile; Claude Opus 5 proprietario, solo API

• Parametri — MiMo-V2.6-Pro 1,02T totali / 42B attivi; Claude Opus 5 non divulgati

• Contesto — 1M token entrambi; Claude Opus 5 limita l'output a 128K sulla Messages API e a 300K sulla Batch API

• Modalità — MiMo-V2.6-Pro accetta testo, immagini, video e audio; la superficie di input pubblicata di Claude Opus 5 è testo e immagini

• Prezzo di listino — MiMo-V2.6-Pro 0,43 $ / 0,87 $ per 1 milione di token; Claude Opus 5 5,00 $ / 25,00 $

• Cache — MiMo-V2.6-Pro indica uno sconto del 99% sulla cache; Claude Opus 5 legge la cache a 0,50 $ per 1 mln, con scritture a 6,25 $ e un TTL di 5 minuti

• Costo misurato per attività dell'Intelligence Index — MiMo-V2.6-Pro 0,13 $; Claude Opus 5 5,86 $

• Servizio — MiMo-V2.6-Pro 134,3 token di output al secondo e 2,15 s al primo token; Claude Opus 5 57,9 token al secondo

Quell'ultima coppia è quella che si perde. Il modello più economico è anche quello più veloce — di un fattore 2,3 sul throughput di output — perché è servito su hardware che Xiaomi e i suoi partner controllano e possono fare batching in modo aggressivo. Claude Opus 5 al massimo sforzo è un modello di ragionamento che svolge più lavoro per token; il divario di velocità non è un difetto, è un prodotto diverso. Ma significa che la corsia economica non sta pagando il suo sconto in latenza. Lo sta pagando in cinque punti indice e nella coda dei task dove vive quel quinto punto.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

Dove si trovano in realtà i cinque punti

Un divario di cinque punti su un punteggio composito di dieci valutazioni non è distribuito in modo uniforme, e l'aggregato nasconde la cosa che conta. Entrambi i modelli sono stati eseguiti sulla stessa suite v4.3.2, che include AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. Le pagine pubblicate non riportano i punteggi per singola valutazione per nessuno dei due modelli, il che è un limite reale su entrambi i fronti di questo confronto e vale la pena dirlo anziché nasconderlo.

Ciò che risulta agli atti è indicativo. Claude Opus 5 al massimo sforzo ha totalizzato 49,0% su Terminal-Bench 4.0 all'interno della suite v4.3, dietro GPT-6 Astra al 59,1% e Claude Fable 5.1 al 52,0%. Su AutomationBench-AA, Opus 5 ha completato ogni obiettivo senza violazioni dei guardrail nel 28,3% dei flussi di lavoro, contro il 41,6% di GPT-6 Astra e il 32,1% di Fable 5.1. Questi sono numeri agentici concreti, e sono esattamente le categorie in cui un divario composito di cinque punti ha meno probabilità di essere distribuito in modo uniforme — la voce di indice di MiMo-V2.6-Pro non pubblica uno scorporo agentico comparabile.

Nel frattempo, i numeri dei vendor che entrambe le aziende pubblicano non sono comparabili tra loro, e vale la pena essere schietti sul perché. Il materiale di lancio di Anthropic riporta SWE-bench Verified al 96,0% e SWE-bench Pro al 79,2%; un tracker nota che Opus 5 è stato rilasciato senza una voce SWE-bench autonoma, e non esiste una cifra SWE-bench Verified verificata in modo indipendente per esso. Il materiale di Xiaomi riporta MiMo-V2.6-Pro che passa da 58,4 a 72,57 su DeepSWE v1.1 durante la sua esecuzione RL, sull'harness di Xiaomi con mini-swe-agent alla media di tre, non inviato al board pubblico DeepSWE. Due harness di vendor, due task diversi, nessuna sovrapposizione. Mettere 96,0% accanto a 72,57 e trarre una conclusione sarebbe inventare un confronto che non esiste.

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

Il confronto dei costi, fatto come si deve

L'aritmetica per token sottostima il divario, perché i due modelli non consumano lo stesso numero di token per completare lo stesso lavoro. Artificial Analysis ha misurato quanto è effettivamente costato a ciascuno eseguire l'intero Intelligence Index: 0,13 $ per MiMo-V2.6-Pro, 5,86 $ per Claude Opus 5. Si tratta di un divario di 45 volte su un insieme di attività controllato e identico, ed è il singolo numero più equo disponibile perché entrambi sono stati misurati allo stesso modo.

Ora metti a confronto un plausibile ciclo di produzione. Un'esecuzione di un agente in 30 passaggi che legge 200.000 token di contesto per passaggio e ne scrive 2.000 per passaggio equivale a 6 milioni di token di input e 60.000 token di output per esecuzione. Su Claude Opus 5 a listino sono $30,00 di input e $1,50 di output — $31,50 per esecuzione prima di qualsiasi caching. Su MiMo-V2.6-Pro sono $2,58 di input e $0,05 di output — $2,63. Con gli sconti sulla cache offerti da entrambi i fornitori, il lato input crolla su entrambi i modelli, e il rapporto si sposta invece di scomparire: uno sconto cache del 99% su un modello economico rispetto a una lettura cache da $0,50 su uno costoso lascia comunque il modello costoso avanti di un ordine di grandezza su un ciclo ad alto contenuto di contesto.

Il che è l'intero argomento a favore di una corsia economica e contro un passaggio totale. Se il tuo carico di lavoro è un loop di agenti a lungo termine che rilegge lo stesso contesto centinaia di volte, la differenza di costo per esecuzione non è un errore di arrotondamento — è la differenza tra una funzionalità che puoi permetterti di eseguire per utente e una che non puoi. Questo è l'argomento a favore di mettere MiMo-V2.6-Pro davanti alla maggior parte del tuo traffico. Non è un argomento a favore dell'eliminazione di Claude Opus 5, perché i compiti in cui il quinto punto dell'indice si ripaga da solo sono, per costruzione, i compiti in cui il fallimento di un modello economico è costoso.

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

Come si presenta qui una decisione di routing

Claude Opus 5 è raggiungibile tramite un'unica chiave OrcaRouter al prezzo di listino del provider con 0% di ricarico, come anthropic/claude-opus-5, con i modelli di frontiera con cui lo confronteresti affiancati ad esso sulla stessa chiave. Poiché lasciamo passare il prezzo di listino del provider senza ricarico, una variazione di prezzo del fornitore su uno dei due lati è attiva dalla nostra parte lo stesso giorno, invece di attendere un nuovo preventivo. Il DSL di routing è dove si trova la parte interessante: puoi comporre i due modelli in un'unica chiamata invece di scegliere tra l'uno e l'altro, inviare la maggior parte del carico alla corsia economica e instradare la coda — le attività che non superano un autocontrollo, o che soddisfano un predicato di complessità — verso quella costosa. Il failover è l'altra metà. Claude Opus 5 ha un'ampia copertura di provider; MiMo-V2.6-Pro era elencato da un unico provider API quando Artificial Analysis l'ha rilevato, il che rappresenta una rotta sottile per un modello che metteresti in un percorso di produzione. Un router in grado di fare fallback è ciò che rende sicuro adottare la corsia economica.

Vale la pena dirlo chiaramente, perché è facile pensare il contrario: non ospitiamo MiMo-V2.6-Pro. Oggi per raggiungerlo bisogna passare dalla piattaforma di Xiaomi stessa o da uno dei cataloghi di terze parti che lo elencano. La questione del routing qui riguarda come usare un modello come questo insieme a quelli che offriamo noi, non l'affermazione che sia uno dei nostri.

Quale scegliere?

Scegli Claude Opus 5 quando il costo del fallimento di un'attività supera quello dei token abbastanza da rendere cinque punti di indice un'assicurazione a buon mercato — lavoro agentico a lungo orizzonte con effetti collaterali reali, uso di strumenti in cui una chiamata sbagliata è peggio di una lenta, qualsiasi cosa in cui stai già pagando una persona per verificare l'output. La cifra di $5,86 per attività-indice non è un motivo per evitarlo; è il prezzo del livello, e quel livello esiste per una ragione.

Scegli MiMo-V2.6-Pro quando il volume è il vincolo, quando il carico di lavoro è ricco di contesto e ripetitivo, quando vuoi i pesi nella tua infrastruttura — la licenza MIT consente la distribuzione commerciale, la modifica e ulteriore addestramento — o quando stai costruendo qualcosa la cui economia unitaria funziona solo a un quinto di centesimo per mille token. I suoi 134,3 token/secondo lo rendono utilizzabile in modo interattivo, cosa che la maggior parte dei modelli aperti da mille miliardi di parametri non è.

Scegli entrambi, se hai un router, perché la risposta onesta a «quale sia migliore» è che non competono per le stesse richieste. La modalità di fallimento da evitare è quella che costa di più: standardizzare sul modello economico perché il rapporto in evidenza è 21x, scoprire al terzo mese che una specifica classe di richieste richiede quello costoso, e non avere alcun percorso per instradarla lì. La seconda modalità di fallimento è l'immagine speculare — pagare tariffe da Opus 5 per un lavoro di riassunto che un modello con indice 46 completa in modo identico. Nessuna delle due è un problema di modello. Entrambe sono problemi di configurazione, e la configurazione è la parte che puoi cambiare un martedì pomeriggio.