Een titelkaart voor de vergelijking MiMo-V2.6-Pro versus Qwen3.8-Max, met twee tegenover elkaar staande spec-kaarten: Xiaomi MiMo-V2.6-Pro met Intelligence Index v4.3.2 46, 42B actieve parameters per token, 134,3 tokens/seconde en $0,18 per 1M gemengd, tegenover Qwen3.8-Max met Index 45, 95B actief per token, 39,2 tokens/seconde en $1,18.
Guides & Insights

MiMo-V2.6-Pro vs Qwen3.8-Max: één indexpunt, zes keer de prijs

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Qwen3.8-Max is een model met 2,4 biljoen parameters dat per token 95 miljard daarvan activeert en bij één enkele provider draait. Xiaomi MiMo-V2.6-Pro is een model met 1,02 biljoen parameters dat per token 42 miljard activeert, één punt hoger scoort op dezelfde onafhankelijke index en ongeveer een zesde kost om aan te roepen. Die feiten staan ongemakkelijk naast elkaar, en hoe je ze met elkaar verzoent, is precies de hele beslissing tussen de twee. De korte versie: op de Artificial Analysis Intelligence Index v4.3.2 scoort Xiaomi MiMo-V2.6-Pro 46 en Qwen3.8-Max 45 — een gelijkspel binnen de ruis — terwijl het prijsblad $0,43 en $0,87 per miljoen tokens vermeldt tegen $2,00 en $6,00.

Wat elk model daadwerkelijk is

Qwen3.8-Max is het vlaggenschip van Alibaba, algemeen beschikbaar sinds 3 augustus 2026, en het was het grootste model dat de Qwen-lijn ooit had uitgebracht op het moment dat het verscheen. Het is een sparse mixture-of-experts gebouwd op de Qwen 3.5-architectuur met 2,4 biljoen parameters in totaal en ongeveer 95 miljard actieve per token, een contextvenster van 1 miljoen tokens, tot 131.000 tokens output en multimodale input voor tekst, beeld en video. Alibaba verlaagde het internationale tarief naar $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens, met gecachte input tegen $0,25, en presenteerde dat als ongeveer 40% van de inputprijs van Claude Opus 5. Een puntupdate, Qwen3.8-Max-0902, volgde op 2 september 2026 en dat is wat Artificial Analysis momenteel benchmarkt op 45.

Xiaomi MiMo-V2.6-Pro bereikte algemene beschikbaarheid op 22 september 2026, drie dagen voordat deze vergelijking werd geschreven, met zijn checkpoint-repositories voor reinforcement learning die de dag ervoor verschenen. Het is een sparse mixture-of-experts met 1,02 biljoen totale parameters en 42 miljard actieve per token, met hetzelfde contextvenster van 1M tokens, native multimodaliteit voor tekst, beeld, video en audio, en gewichten gepubliceerd onder de MIT-licentie. Xiaomi handhaafde de prijsstelling van de vorige generatie in plaats van het nieuwe checkpoint naar boven bij te prijzen, waardoor het wordt vermeld tegen $0,43 en $0,87 met een cachekorting van 99% en een blended $0,18.

• Actieve rekenkracht per token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, minder dan de helft

• Totaal aantal parameters — Qwen3.8-Max 2,4T; Xiaomi MiMo-V2.6-Pro 1,02T

• Indexscore — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, beide op Artificial Analysis v4.3.2

• Uitvoersnelheid — Xiaomi MiMo-V2.6-Pro 134,3 tokens/seconde; Qwen3.8-Max 39,2, tegenover een mediaan van 72,5 voor de klasse

• Tijd tot eerste token — Xiaomi MiMo-V2.6-Pro 2,15 seconden; Qwen3.8-Max 2,93

• Lijstprijs — Xiaomi MiMo-V2.6-Pro $0,43 / $0,87 per 1 mln.; Qwen3.8-Max $2,00 / $6,00

• Gecombineerd tarief — Xiaomi MiMo-V2.6-Pro $0,18 per 1 miljoen bij 7:2:1 cache-hit/invoer/uitvoer; Qwen3.8-Max $1,18

• Gewichten — Xiaomi MiMo-V2.6-Pro met MIT-licentie en downloadbaar; Qwen3.8-Max fungeerde als een propriëtair endpoint, met een open-weight-release voor alleen tekst die de 1M-context en visuele input laat vallen

• Bereikbaarheid — één API-provider geteld voor elk op Artificial Analysis

De score is gelijk. De snelheid niet.

Eén punt op een samengestelde score van tien evaluaties is geen verschil waarop iemand zou moeten handelen, en het nuttigere signaal is wat zich daaronder afspeelde. Het model met minder dan de helft van de actieve parameters per token scoorde marginaal hoger en genereerde uitvoer drieënhalf keer sneller — 134,3 tokens per seconde tegen 39,2, waar de mediaan voor vergelijkbare redeneermodellen 72,5 is. Qwen3.8-Max is het traagste van de frontier-klasse modellen die op die pagina zijn gemeten, en dat is een ontwerpgevolg van het activeren van 95 miljard parameters per token, niet een toeval in de serving.

Latentie vertelt het tegenovergestelde verhaal van wat de parametertellingen suggereren. Qwen3.8-Max bereikt zijn eerste token in 2,93 seconden tegenover 2,15 bij Xiaomi, en het verschil is veel kleiner dan het doorvoerverschil — Qwen3.8-Max is traag zodra het begint te schrijven, niet traag om te beginnen. Voor een chatinterface waarin het antwoord kort is, komt dat verschil nauwelijks naar boven. Voor een agent-loop die tienduizenden outputtokens genereert, is doorvoer de hele doorlooptijd, en een verschil van 3,4× stapelt zich op bij elke ronde van de run.

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and Qwen3.8-Max covering Intelligence Index v4.3.2 (46 vs 45), active parameters (42B vs 95B per token), output speed (134.3 vs 39.2 tokens/second), time to first token (2.15s vs 2.93s), blended rate ($0.18 vs $1.18 per 1M) and weight availability (MIT, full multimodal vs a text-only release without the 1M context).

Waar de leverancierstabellen van elkaar afwijken, en waarom dat geen tegenstrijdigheid is

Alibaba heeft een brede tabel voor Qwen3.8-Max gepubliceerd en die is echt sterk: Terminal-Bench 2.1 op 86.6, SWE-bench Pro op 67.7, PaperBench op 93.0, GPQA Diamond op 92.6, IFBench op 82.8, OSWorld-Verified op 86.1 en Humanity's Last Exam op 43.6. Dat zijn door de leverancier uitgevoerde cijfers op Alibaba's eigen harnesses en sommige daarvan op Alibaba's eigen benchmarks, dus het zijn claims in plaats van metingen — maar het zijn claims op veelgebruikte benchmarks, wat ze beter vergelijkbaar maakt tussen labs dan een resultaat van een op maat gemaakte harness.

Xiaomi's opvallendste cijfer is 72,57 op DeepSWE v1.1, een stijging ten opzichte van een baseline van 58,4, gemeten met mini-swe-agent als gemiddelde van drie runs op Xiaomi's eigen beoordelingssysteem, gedurende een reinforcement-learning-run die Xiaomi documenteerde als dertig stappen en ongeveer 750.000 trajecten, tegen een gepubliceerde besteding van ongeveer $2,62 miljoen. Het is niet ingediend bij het openbare DeepSWE-leaderboard en geen enkele derde partij heeft het gereproduceerd. Het afzetten van 72,57 tegen de 67,7 van Qwen op SWE-bench Pro en het uitroepen van een overwinning van vijf punten voor Xiaomi zou neerkomen op het vergelijken over twee verschillende benchmarks, twee verschillende testharnassen en twee verschillende scoringsconventies heen. Er is precies één meetlat waartegen beide modellen door iemand anders dan hun maker zijn afgezet, en die zegt 46 tegen 45.

Twee van de belangrijkere Qwen3.8-Max-cijfers zijn helemaal geen scores. Alibaba kondigde aan dat de gewichten open source zouden worden gemaakt naast Qwen3.8-27B, en de checkpoint die is verschenen is alleen tekst en bevat niet de volledige 1M-tokencontext of de visuele input die het aangeboden Max-endpoint heeft. Dus "Qwen3.8-Max heeft open gewichten" en "Qwen3.8-Max is een multimodaal endpoint met 1M-context" zijn beide ware uitspraken over verschillende artefacten, en een deploymentplan dat op het eerste is gebouwd maar het tweede verwacht, zal het contact niet overleven. De 0902-pointrelease bracht het model ondertussen naar de top van een publieke arena voor webontwikkeling zonder wijziging van het versienummer — een herinnering eraan dat het model dat je in augustus hebt gebenchmarkt niet noodzakelijk het model is dat in september je verzoeken bedient.

Betekent open weights dat je een van beide zelf kunt hosten?

Voor Xiaomi MiMo-V2.6-Pro: in principe ja: MIT-licentie, geen commerciële overeenkomst nodig. In de praktijk vereist een checkpoint van 1,02T parameters met 42B actief een servingcluster met meerdere nodes, wat een andere orde van commitment is dan het aanroepen van een API. Het publiceren van gewichten maakt zelfhosting legaal, niet goedkoop.

Voor Qwen3.8-Max is het antwoord beperkter dan de reputatie doet vermoeden. De open release is alleen tekst en mist het volledige contextvenster, dus als je die zelf host, krijg je een aanzienlijk kleiner model dan het model waarop de 45 is gemeten. Als je de gebenchmarkte configuratie wilt, is het aangeboden endpoint het product, en dat endpoint is propriëtair.

Het aanroepen van een van beide, en de rekenkundige bewerking die daarover beslist

Beide modellen worden door Artificial Analysis bij één enkele API-provider geteld, wat ongebruikelijk is voor twee vlaggenschipmodellen, en dat maakt failover de praktische vraag in plaats van een extraatje. Qwen3.8-Max staat op OrcaRouter als qwen/qwen3.8-maxéén OpenAI-compatibel endpoint tegen Alibaba's eigen lijstprijs met 0% opslag, dus de $2,00 en $6,00 hierboven worden ongewijzigd doorgegeven en een prijswijziging aan Alibaba's kant is dezelfde dag live bij ons. Volgens onze eigen metingen ligt de p50 van het endpoint rond 3,3 seconden, en dat is het getal waarop je moet plannen in plaats van het theoretische beste geval, en een fallback-keten betekent dat een vastgelopen verzoek opnieuw wordt geprobeerd bij een andere upstream voordat het antwoord begint. Xiaomi MiMo-V2.6-Pro staat niet op OrcaRouter; geen enkel Xiaomi-model staat erop, en de route ernaartoe is vandaag Xiaomi's eigen platform en de catalogi van derden die het vermelden.

De kostenrekensom is waar dit duel daadwerkelijk wordt beslecht, en het is niet de rekensom die de kopcijfers suggereren. Bij een 7:2:1-mix van cachehits/input/output bedragen de gecombineerde tarieven $0,18 en $1,18 per miljoen — een verschil van 6,6×, groter dan de input- en outputverschillen van 4,6× en 6,9×, omdat de cachekorting van 99% bij Xiaomi groter is dan de 88% bij Alibaba. Artificial Analysis registreert ook een kostenpost van $0,13 per Intelligence Index-taak voor Xiaomi MiMo-V2.6-Pro, op identieke wijze gemeten voor elk model in de ranglijst. Draai dezelfde workload op beide en het goedkopere model is juist het model dat hoger scoorde, wat een ongebruikelijke constatering is om te kunnen opschrijven, en de reden dat deze vergelijking geen formaliteit is.

The OrcaRouter model page for qwen/qwen3.8-max, showing the model's vendor, capability tags, context window and the per-million-token input and output rates passed through from Alibaba's list price.

Wie moet overstappen, en wie niet

Als je vandaag op Qwen3.8-Max zit en het werkt, is er geen dringende reden om over te stappen. Het indexverschil is een punt, het vision- en long-contextgedrag is bewezen in jouw workload, en Alibaba ontwikkelt de lijn nog steeds — de 0902-update laat dat zien. Het argument om over te stappen is doorvoer en gemengde kosten, en het is alleen een sterk argument als je verkeer outputintensief of langdurig is: agents, codegeneratie, alles wat veel meer schrijft dan leest.

Als je helemaal opnieuw begint, is de rangorde op basis van het gepubliceerde bewijs moeilijk te betwisten. Het Xiaomi-model is sneller, goedkoper op elk vlak, MIT-gelicentieerd, en marginaal voor op de enige onafhankelijk uitgevoerde composietbenchmark die beide dekt. De tegenwichten zijn reëel en specifiek: drie dagen productiegeschiedenis, één enkele serveerroute, en geen openbare benchmarkvermelding om te inspecteren. Die combinatie pleit ervoor om het in een baan naast een gevestigde oplossing te evalueren in plaats van er een te vervangen — dat is waar een routeringsconfiguratie voor dient, en waarom de nuttige zet is om de kandidaat en de gevestigde oplossing achter één sleutel te plaatsen in plaats van een winnaar op een scorebord te kiezen.

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

Wat zou dit antwoord veranderen?

Drie dingen. Een tweede en derde aanbieder voor Xiaomi MiMo-V2.6-Pro zou het enige structurele bezwaar ertegen wegnemen en de prijskloof veranderen in een actuele beslissing in plaats van een verleidelijke. Een onafhankelijke run van de DeepSWE-configuratie zou de 72,57 ofwel bevestigen ofwel intrekken, en welke uitkomst dan ook is meer waard dan het getal zelf. En uitsplitsingen per evaluatie op v4.3.2 zouden laten zien welke van de tien evaluaties elk model wint — de samengestelde score is een samengestelde score, en een model dat vooroploopt op agentisch coderen en een dat vooroploopt op retrieval-intensieve vraagbeantwoording kunnen dezelfde indexscore behalen terwijl ze ongeschikt zijn voor elkaars taken.