
MiMo-V2.6-Pro vs Qwen3.8-Max: En indexpoäng, sex gånger priset
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max är en modell med 2,4 biljoner parametrar som aktiverar 95 miljarder av dem per token och körs hos en enda leverantör. Xiaomi MiMo-V2.6-Pro är en modell med 1,02 biljoner parametrar som aktiverar 42 miljarder per token, får en poäng högre på samma oberoende index och kostar ungefär en sjättedel så mycket att anropa. De fakta går inte ihop särskilt väl, och hur du löser dem är hela beslutet mellan de två. Kortversionen: på Artificial Analysis Intelligence Index v4.3.2 får Xiaomi MiMo-V2.6-Pro 46 och Qwen3.8-Max 45 – oavgjort inom bruset – medan prislistan visar $0,43 och $0,87 per miljon tokens mot $2,00 och $6,00.
Vad varje modell faktiskt är
Qwen3.8-Max är Alibabas flaggskepp, allmänt tillgängligt sedan den 3 augusti 2026, och det var den största modellen som Qwen-serien hade släppt när den lanserades. Det är en gles mixture-of-experts byggd på Qwen 3.5-arkitekturen med 2,4 biljoner totala parametrar och ungefär 95 miljarder aktiva per token, ett kontextfönster på 1 miljon token, upp till 131 000 token utdata och multimodala indata för text, bild och video. Alibaba sänkte den internationella taxan till 2,00 USD per miljon indatatoken och 6,00 USD per miljon utdatatoken, med cachad indata på 0,25 USD, och framhöll det som ungefär 40 % av Claude Opus 5:s indatapris. En punktuppdatering, Qwen3.8-Max-0902, följde den 2 september 2026 och det är den som Artificial Analysis för närvarande benchmarkar till 45,0.
Xiaomi MiMo-V2.6-Pro nådde allmän tillgänglighet den 22 september 2026, tre dagar innan denna jämförelse skrevs, med sina checkpoint-repositorier för förstärkningsinlärning som dök upp dagen innan. Det är en gles mixture-of-experts med 1,02 biljoner totala parametrar och 42 miljarder aktiva per token, med samma kontextfönster på 1 miljon token, inbyggd multimodualitet för text, bild, video och ljud, och vikter publicerade under MIT-licensen. Xiaomi behöll prissättningen från föregående generation i stället för att prissätta den nya checkpointen uppåt, vilket är anledningen till att den listas till $0,43 och $0,87 med 99 % cacherabatt och ett blandat pris på $0,18.
• Aktiv beräkning per token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, mindre än hälften
• Totala parametrar — Qwen3.8-Max 2,4T; Xiaomi MiMo-V2.6-Pro 1,02T
• Indexpoäng — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, båda enligt Artificial Analysis v4.3.2
• Utdatashastighet — Xiaomi MiMo-V2.6-Pro 134,3 tokens/sekund; Qwen3.8-Max 39,2, jämfört med en median för nivån på 72,5
• Tid till första token — Xiaomi MiMo-V2.6-Pro 2,15 sekunder; Qwen3.8-Max 2,93
• Listpris — Xiaomi MiMo-V2.6-Pro $0.43 / $0.87 per 1 miljon; Qwen3.8-Max $2.00 / $6.00
• Blandad taxa – Xiaomi MiMo-V2.6-Pro $0,18 per 1M vid 7:2:1 cacheträff/indata/utdata; Qwen3.8-Max $1,18
• Vikter — Xiaomi MiMo-V2.6-Pro är MIT-licensierad och nedladdningsbar; Qwen3.8-Max tillhandahölls som en proprietär slutpunkt, med en endast textbaserad utgåva med öppna vikter som tar bort 1M-kontexten och visionsindata
• Nåbarhet – en API-leverantör räknas för var och en på Artificial Analysis
Ställningen är oavgjord. Hastigheten är det inte.
En poäng på ett sammansatt mått av tio utvärderingar är inte en skillnad som någon bör agera utifrån, och den mer användbara signalen är vad som ligger bakom den. Modellen med mindre än hälften så många aktiva parametrar per token fick marginellt högre poäng och genererade utdata tre och en halv gång snabbare — 134,3 tokens per sekund mot 39,2, där medianen för jämförbara resonemangsmodeller är 72,5. Qwen3.8-Max är den långsammaste av modellerna i frontier-klassen som mäts på den sidan, och det är en designkonsekvens av att aktivera 95 miljarder parametrar per token snarare än en tillfällighet i serveringen.
Latensen berättar en motsatt historia mot den som parameterantalen antyder. Qwen3.8-Max når sin första token på 2,93 sekunder mot Xiaomis 2,15, och gapet är mycket mindre än genomströmningsgapet – Qwen3.8-Max är långsam när den väl börjar skriva, inte långsam att starta. För ett chattgränssnitt där svaret är kort märks den skillnaden knappt. För en agentloop som genererar tiotusentals utdatatoken är genomströmningen hela väggklockstiden, och ett gap på 3,4× ackumuleras över varje tur i körningen.

Där leverantörstabellerna inte stämmer överens, och varför det inte är en motsägelse
Alibaba har publicerat en omfattande tabell för Qwen3.8-Max, och den är verkligen stark: Terminal-Bench 2.1 på 86,6, SWE-bench Pro på 67,7, PaperBench på 93,0, GPQA Diamond på 92,6, IFBench på 82,8, OSWorld-Verified på 86,1 och Humanity's Last Exam på 43,6. Det är siffror som leverantören själv har tagit fram med Alibabas egna testramverk, och några av dem på Alibabas egna benchmarks, så det är påståenden snarare än mätningar – men det är påståenden på flitigt använda benchmarks, vilket gör dem mer jämförbara mellan labb än ett resultat från ett skräddarsytt testramverk.
Xiaomis huvudresultat är 72,57 på DeepSWE v1.1, upp från en baslinje på 58,4, mätt med mini-swe-agent som medelvärde av tre i Xiaomis eget bedömningsverktyg, under en körning med förstärkningsinlärning som Xiaomi dokumenterade som trettio steg och ungefär 750 000 trajektorier till en publicerad kostnad på omkring 2,62 miljoner dollar. Det har inte skickats in till den offentliga DeepSWE-topplistan och ingen tredje part har reproducerat det. Att ställa 72,57 mot Qwens 67,7 på SWE-bench Pro och utropa en fempoängsseger för Xiaomi vore att läsa tvärs över två olika benchmarks, två olika testramverk och två olika poängsättningskonventioner. Det finns exakt en linjal som båda modellerna har körts mot av någon annan än deras skapare, och den säger 46 mot 45.
Två av de mer betydelsefulla Qwen3.8-Max-siffrorna är inte poäng alls. Alibaba meddelade att vikterna skulle släppas som öppen källkod tillsammans med Qwen3.8-27B, och den checkpoint som landade är endast text och har inte den fullständiga 1M-token-kontexten eller den bildindata som den tillhandahållna Max-slutpunkten har. Så "Qwen3.8-Max har öppna vikter" och "Qwen3.8-Max är en multimodal 1M-kontextslutpunkt" är båda sanna påståenden om olika artefakter, och en driftsättningsplan byggd på den första men som förväntar sig den andra kommer inte att överleva kontakt. 0902-delversionen flyttade under tiden modellen till toppen av en offentlig webbutvecklingsarena utan att versionsnumret ändrades — en påminnelse om att modellen du benchmarkade i augusti inte nödvändigtvis är modellen som betjänar dina förfrågningar i september.
Betyder öppna vikter att man kan självhosta någon av dem?
För Xiaomi MiMo-V2.6-Pro: i princip ja: MIT-licens, inget kommersiellt avtal krävs. I praktiken kräver en checkpoint på 1,02T parametrar med 42B aktiva ett serveringskluster över flera noder, vilket är en helt annan nivå av åtagande än att anropa ett API. Att publicera vikterna gör självhosting lagligt, inte billigt.
För Qwen3.8-Max är svaret snävare än ryktet antyder. Den öppna utgåvan är endast text och utan det fullständiga kontextfönstret, så att självhosta den ger dig en väsentligt mindre modell än den som 45 mättes på. Om det du vill ha är den benchmarkade konfigurationen är den serverade slutpunkten produkten, och slutpunkten är proprietär.
Att anropa endera, och aritmetiken som avgör det
Båda modellerna räknas hos en enda API-leverantör av Artificial Analysis, vilket är ovanligt för två flaggskeppsmodeller och gör failover till den praktiska frågan snarare än en trevlig extrafunktion. Qwen3.8-Max finns på OrcaRouter som qwen/qwen3.8-max — en OpenAI-kompatibel endpoint till Alibabas eget listpris med 0 % påslag, så $2.00 och $6.00 ovan förs vidare oförändrade och en prisändring på Alibabas sida är live hos oss samma dag. Våra egna mätningar sätter endpointens p50 till omkring 3,3 sekunder, vilket är siffran att planera efter snarare än det teoretiska bästa fallet, och en fallback-kedja innebär att en fördröjd begäran görs om mot en annan uppström innan svaret börjar. Xiaomi MiMo-V2.6-Pro finns inte på OrcaRouter; ingen Xiaomi-modell gör det, och vägen dit idag är Xiaomis egen plattform och de tredjepartskataloger som listar den.
Det är i kostnadsaritmetiken som den här duellen faktiskt avgörs, och det är inte den aritmetik som rubrikpriserna antyder. Vid en fördelning på 7:2:1 mellan cacheträffar/indata/utdata är de sammanvägda priserna 0,18 och 1,18 dollar per miljon – en skillnad på 6,6×, större än skillnaderna på 4,6× för indata och 6,9× för utdata, eftersom Xiaomis cacherabatt på 99 % är djupare än Alibabas på 88 %. Artificial Analysis registrerar också en kostnad på 0,13 dollar per Intelligence Index-uppgift för Xiaomi MiMo-V2.6-Pro, mätt på samma sätt för varje modell på resultattavlan. Kör man samma arbetsbelastning genom båda är det den billigare modellen som fick högre poäng, vilket är en ovanlig sak att kunna skriva, och anledningen till att den här jämförelsen inte är en formalitet.

Vilka bör byta, och vilka bör inte
Om du använder Qwen3.8-Max i dag och det fungerar finns det inget akut skäl att byta. Indexgapet är en poäng, visionen och långkontextbeteendet är bevisade i din arbetsbelastning, och Alibaba utvecklar fortfarande produktlinjen – uppdateringen 0902 visar det. Argumentet för att byta är genomströmning och blandad kostnad, och det är ett starkt argument bara om din trafik är utdatatung eller långsiktig: agenter, kodgenerering, allt som skriver mycket mer än det läser.
Om du börjar från noll är rangordningen svår att argumentera emot utifrån de publicerade bevisen. Xiaomi-modellen är snabbare, billigare på varje axel, MIT-licensierad och marginellt före i den enda oberoende körda sammansatta mätning som täcker båda. Motvikterna är verkliga och specifika: tre dagars produktionshistorik, en enda serveringsväg och ingen offentlig benchmark-post att granska. Den kombinationen talar för att utvärdera den i en bana vid sidan av en befintlig lösning i stället för att ersätta en — vilket är vad en routingkonfiguration är till för, och varför det användbara draget är att sätta kandidaten och den befintliga lösningen bakom en och samma nyckel i stället för att utse en vinnare från en resultattavla.

Vad skulle ändra det här svaret?
Tre saker. En andra och tredje leverantör för Xiaomi MiMo-V2.6-Pro skulle undanröja den enda strukturella invändningen mot den och göra prisskillnaden till ett reellt beslut snarare än ett frestande sådant. En oberoende körning av DeepSWE-konfigurationen skulle antingen bekräfta 72,57 eller avskriva det, och båda utfallen är värda mer än siffran i sig. Och uppdelningar per utvärdering på v4.3.2 skulle visa vilka av de tio utvärderingarna varje modell vinner — det sammansatta måttet är just sammansatt, och en modell som leder inom agentisk kodning och en som leder inom retrieval-tungt frågebesvarande kan få samma indexpoäng samtidigt som de är olämpliga för varandras uppgifter.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
