OrcaRouter modellradar-hjältekort för jämförelsen mellan MiMo-V2.6-Pro och Claude Opus 5, med underrubriken ”Fem indexpoäng. Tjugoen gånger priset.”, med en panel per modell.
Guides & Insights

MiMo-V2.6-Pro vs Claude Opus 5: 21x billigare, fem indexpunkter efter

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Xiaomi MiMo-V2.6-Pro och Claude Opus 5 är de två ändarna av en enda affär, och affären har ett pris. På Artificial Analysis Intelligence Index v4.3.2 får Claude Opus 5 (max effort) 51 poäng och Xiaomi MiMo-V2.6-Pro 46 poäng. På prislistan kostar Claude Opus 5 $5,00 per miljon input-tokens och $25,00 per miljon output; MiMo-V2.6-Pro kostar $0,43 och $0,87. Gör divisionen och svaret blir 11,6x på input och 28,7x på output — och 21x på den blandade taxa som Artificial Analysis publicerar för var och en. Fem indexpoäng kostar tjugoen gånger pengarna. Huruvida det är ett fynd eller ett slöseri beror helt och hållet på vad din arbetsbelastning gör med den femte poängen, och de flesta team räknar aldrig ut det innan de bestämmer sig.

De två modellerna, enkelt uttryckt

Claude Opus 5 är Anthropics proprietära flaggskepp, lanserat den 24 juli 2026, med ett kontextfönster på 1 miljon token och ett icke offentliggjort antal parametrar. Xiaomi MiMo-V2.6-Pro är en gles mixture-of-experts-modell med totalt 1,02 biljoner parametrar och 42 miljarder aktiverade, med ett kontextfönster på 1 miljon token, inbyggd multimodalitet över text, bild, video och ljud, samt MIT-licensierade publicerade vikter.

• Vikter — MiMo-V2.6-Pro MIT-licensierad och nedladdningsbar; Claude Opus 5 proprietär, endast API

• Parametrar — MiMo-V2.6-Pro 1,02T totalt / 42B aktiva; Claude Opus 5 ej offentliggjorda

• Kontext — 1M tokens i båda; Claude Opus 5 begränsar utdata till 128K på Messages API och 300K på Batch API

• Modalitet — MiMo-V2.6-Pro tar emot text, bild, video och ljud; Claude Opus 5:s publicerade indatayta är text och bild

• Listpris — MiMo-V2.6-Pro $0.43 / $0.87 per 1 miljon tokens; Claude Opus 5 $5.00 / $25.00

• Cache — MiMo-V2.6-Pro listar en cacherbatt på 99 %; Claude Opus 5 läser cache för $0.50 per 1M med skrivningar för $6.25 vid en 5-minuters TTL

• Uppmätt kostnad per Intelligence Index-uppgift — MiMo-V2.6-Pro 0,13 $; Claude Opus 5 5,86 $

• Servering — MiMo-V2.6-Pro 134,3 utdatatokens per sekund och 2,15 s till första token; Claude Opus 5 57,9 tokens per sekund

Det sista paret är det som tappas bort. Den billigare modellen är också den snabbare – med en faktor 2,3 i utdata-genomströmning – eftersom den serveras på hårdvara som Xiaomi och deras partner kontrollerar, och den kan batcha aggressivt. Claude Opus 5 vid maximal ansträngning är en resonemangsmodell som gör mer arbete per token; hastighetsgapet är inte en defekt, det är en annan produkt. Men det betyder att det billiga spåret inte betalar för sin rabatt i latens. Det betalar för den i fem indexpoäng och i svansen av uppgifter där den femte poängen bor.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

Var de fem punkterna faktiskt är

En skillnad på fem punkter i ett sammansatt mått av tio utvärderingar är inte jämnt fördelad, och sammanställningen döljer det som spelar roll. Båda modellerna kördes på samma v4.3.2-svit, som omfattar AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience och AA-LCR v1.1. De publicerade sidorna redovisar inte poäng per utvärdering för någon av modellerna, vilket är en verklig begränsning på båda sidor av den här jämförelsen och värt att säga i stället för att släta över.

Det som är dokumenterat är riktningsgivande. Claude Opus 5 med maximal ansträngning fick 49,0 % på Terminal-Bench 4.0 inom v4.3-sviten, efter GPT-6 Astra på 59,1 % och Claude Fable 5.1 på 52,0 %. På AutomationBench-AA slutförde Opus 5 varje mål utan överträdelse av skyddsräcken i 28,3 % av arbetsflödena, mot 41,6 % för GPT-6 Astra och 32,1 % för Fable 5.1. Det är hårda agentiska siffror, och de är precis de kategorier där ett sammansatt gap på fem punkter har minst sannolikhet att vara jämnt fördelat — MiMo-V2.6-Pros egen indexpost publicerar inte någon jämförbar agentisk uppdelning.

Samtidigt är de leverantörssiffror som båda företagen publicerar inte jämförbara med varandra, och det är värt att säga rakt ut varför. Anthropics lanseringsmaterial rapporterar SWE-bench Verified till 96,0 % och SWE-bench Pro till 79,2 %; en tracker noterar att Opus 5 släpptes utan en fristående SWE-bench-post, och det finns ingen oberoende granskad SWE-bench Verified-siffra för den. Xiaomis material rapporterar att MiMo-V2.6-Pro går från 58,4 till 72,57 på DeepSWE v1.1 under sin RL-körning, i Xiaomis eget utvärderingsramverk med mini-swe-agent, med ett medelvärde av tre körningar, utan att ha skickats in till den offentliga DeepSWE-tavlan. Två leverantörers utvärderingsramverk, två olika uppgifter, ingen överlappning. Att ställa 96,0 % bredvid 72,57 och dra en slutsats vore att hitta på en jämförelse som inte finns.

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

Kostnadsjämförelsen, ordentligt gjord

Aritmetik per token underskattar gapet, eftersom de två modellerna inte förbrukar samma antal tokens för att slutföra samma uppgift. Artificial Analysis mätte vad var och en faktiskt kostade att köra hela Intelligence Index: 0,13 USD för MiMo-V2.6-Pro, 5,86 USD för Claude Opus 5. Det är en 45x-skillnad i en kontrollerad, identisk uppgiftsuppsättning, och det är den rättvisaste enskilda siffran som finns att tillgå eftersom båda mättes på samma sätt.

Ställ nu en rimlig produktionsloop mot det. En agentkörning på 30 steg som läser 200 000 token kontext per steg och skriver 2 000 token per steg är 6 miljoner input-token och 60 000 output-token per körning. Med Claude Opus 5 till listpris är det 30,00 USD i input och 1,50 USD i output – 31,50 USD per körning före eventuell cachelagring. Med MiMo-V2.6-Pro är det 2,58 USD i input och 0,05 USD i output – 2,63 USD. Med de cacherabatter som båda leverantörerna erbjuder kollapsar inputsidan på båda modellerna, och förhållandet förskjuts snarare än försvinner: en cacherabatt på 99 % på en billig modell jämfört med en cacheläsning på 0,50 USD på en dyr modell gör fortfarande att den dyra modellen ligger en storleksordning före i en kontexttung loop.

Vilket är hela argumentet för en billig väg och emot ett fullständigt utbyte. Om din arbetsbelastning är en långsiktig agentloop som läser samma kontext hundratals gånger, är kostnadsskillnaden per körning inte en avrundningsmiss — det är skillnaden mellan en funktion du har råd att köra per användare och en du inte har råd med. Det är argumentet för att sätta MiMo-V2.6-Pro framför huvuddelen av din trafik. Det är inte ett argument för att ta bort Claude Opus 5, eftersom de uppgifter där den femte indexpoängen betalar sig själv per konstruktion är de uppgifter där en billig modells misslyckande är dyrt.

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

Hur ett routingbeslut ser ut här

Claude Opus 5 är nåbar genom en enda OrcaRouter-nyckel till leverantörens listpris med 0 % påslag, som anthropic/claude-opus-5, med de frontier-modeller du skulle jämföra den mot som sitter bredvid den på samma nyckel. Eftersom vi för vidare leverantörens listpris utan påslag blir en prisförändring från leverantören på endera sidan aktiv hos oss samma dag i stället för att vänta på en ny offert. Det intressanta ligger i routnings-DSL:en: du kan kombinera de två modellerna i ett enda anrop i stället för att välja mellan dem, skicka merparten av en arbetsbelastning till den billiga filen och routa svansen – uppgifterna som misslyckas i en självkontroll, eller som matchar ett komplexitetspredikat – till den dyra. Failover är den andra halvan. Claude Opus 5 har brett leverantörsstöd; MiMo-V2.6-Pro listades av en enda API-leverantör när Artificial Analysis fångade den, vilket är en tunn väg för en modell du skulle lägga i en produktionsväg. En router som kan växla över är det som gör det tryggt att införa den billiga filen.

Det är värt att säga rakt ut, för det är lätt att anta motsatsen: vi hostar inte MiMo-V2.6-Pro. Att få tillgång till den i dag innebär att använda Xiaomis egen plattform eller någon av de tredjepartskataloger som listar den. Routningsargumentet här handlar om hur du använder en modell som denna tillsammans med dem vi faktiskt erbjuder, inte om ett påstående att den är en av våra.

Vilken ska man välja?

Välj Claude Opus 5 när kostnaden för att uppgiften misslyckas överstiger tokenkostnaden tillräckligt mycket för att fem indexpoäng ska vara en billig försäkring – långsiktigt agentiskt arbete med verkliga bieffekter, verktygsanvändning där ett felaktigt anrop är värre än ett långsamt, allt där du redan betalar en människa för att kontrollera resultatet. Siffran $5,86 per indexuppgift är inte ett skäl att undvika det; det är priset för nivån, och nivån finns av en anledning.

Välj MiMo-V2.6-Pro när volymen är begränsningen, när arbetsbelastningen är kontexttung och repetitiv, när du vill ha vikterna i din egen infrastruktur — MIT-licensen tillåter kommersiell driftsättning, modifiering och vidare träning — eller när du bygger något vars enhetsekonomi bara går ihop vid en femtedels cent per tusen tokens. Dess 134,3 tokens/sekund gör den genomförbar för interaktiv användning på ett sätt som de flesta öppna modeller med biljoner parametrar inte är.

Ta båda, om du har en router, för det ärliga svaret på "vilken är bättre" är att de inte konkurrerar om samma förfrågningar. Det felscenario du bör undvika är det som kostar mest: att standardisera på den billiga modellen eftersom rubrikförhållandet är 21x, upptäcka under tredje månaden att en specifik klass av förfrågningar behöver den dyra, och inte ha någon väg att dirigera dem dit. Det andra felscenariot är spegelbilden — att betala Opus 5-taxor för ett sammanfattningsjobb som en 46-indexmodell löser identiskt. Inget av dem är ett modellproblem. Båda är konfigurationsproblem, och konfigurationen är den del du kan ändra en tisdagseftermiddag.