Een gegenereerde titelkaart die Xiaomi MiMo-V2.6-Pro en Grok 4.6 bij hoge inspanning vergelijkt. Op de linkerkaart staat Intelligence Index v4.3.2: 46, Contextvenster: 1M tokens, $0,43 in / $0,87 uit per 1M, en 134,3 tokens per seconde; op de rechterkaart staat Intelligence Index v4.3.2: 44, Contextvenster: 500K tokens, $2,00 in / $6,00 uit per 1M, en 63,0 tokens per seconde. In een voettekst staat: Beide scores op Artificial Analysis Intelligence Index v4.3.2. DeepSWE-cijfers zijn door de leverancier uitgevoerd en niet vergelijkbaar. Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

MiMo-V2.6-Pro vs Grok 4.6: Beide leveranciers publiceerden DeepSWE-cijfers, en geen van beide staat op de ranglijst

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee leveranciers, één benchmark, twee getallen die niet van elkaar kunnen worden afgetrokken. Het lanceringsmateriaal van SpaceXAI voor Grok 4.6 meldt 65,9% op DeepSWE v1.1. Het materiaal van Xiaomi voor MiMo-V2.6-Pro meldt 72,57 op DeepSWE v1.1. Samen gelezen suggereren ze dat het goedkopere open-weightsmodel het propriëtaire frontier-model met bijna zeven punten verslaat. Nauwkeurig gelezen zeggen ze bijna niets, omdat het ene een percentage uit een lanceringsdeck is op het eigen testharnas van de leverancier en het andere een gemiddelde van drie is uit een reinforcement-learning-run op Xiaomi's eigen beoordelingssysteem, en geen van beide is ingediend bij het openbare DeepSWE-scorebord. De vergelijking tussen MiMo-V2.6-Pro en Grok 4.6 die de toets der kritiek doorstaat, staat op de onafhankelijke index, en daar is het antwoord het omgekeerde van de leverancierscijfers: 46 tegen 44, in het voordeel van Xiaomi, met twee punten.

Grok 4.6 werd op 12 augustus 2026 uitgebracht door SpaceXAI en is hier de gevestigde speler — een geleverd, breed ingezet frontiermodel met een gedocumenteerde prijslijst en maanden van onafhankelijke metingen achter zich. Xiaomi MiMo-V2.6-Pro werd algemeen beschikbaar op 22 september 2026, met zijn checkpoint-repositories voor reinforcement learning die de dag ervoor verschenen, en het is de nieuwkomer. Beide zijn in staat tot redeneren, beide zijn gebouwd voor langdurig agentisch werk, en het prijsverschil tussen hen is groot genoeg dat de onervarenheid van de nieuwkomer het enige is dat de vergelijking tegenhoudt.

Wat elk model daadwerkelijk is

Grok 4.6 is propriëtair, verwerkt tekst- en afbeeldingsinvoer en retourneert tekst, en heeft een kennisafsluitdatum van 1 februari 2026. Het contextvenster is 500.000 tokens, de helft van de grootte van die van zijn belangrijkste concurrenten en de meest bepalende specificatie op zijn specificatieblad. De lijsttarieven zijn $2,00 per miljoen invoertokens, $0,50 per miljoen gecachte invoer en $6,00 per miljoen uitvoer onder 200.000 prompttokens, met een sprong bij die grens: op of boven 200K worden de tarieven $4,00, $1,00 en $12,00, en het hogere tarief brengt het hele verzoek in rekening in plaats van het deel dat de grens overschrijdt. Prioriteitsverwerking verdubbelt het standaardtarief. Artificial Analysis mat 63,0 uitvoertokens per seconde en 42,79 seconden tot het eerste token bij maximale inspanning, en $2.351,83 om de volledige index te draaien.

Xiaomi MiMo-V2.6-Pro is een sparse mixture-of-experts-model met 1,02 biljoen totale parameters en 42 miljard geactiveerde parameters per token, met een contextvenster van 1M tokens en native multimodaliteit voor tekst, afbeelding, video en audio. Het is MIT-gelicenseerd met downloadbare gewichten, en Xiaomi behield de prijsstelling van de vorige generatie in plaats van de prijs van het nieuwe checkpoint te verhogen — $0,43 per miljoen inputtokens en $0,87 per miljoen outputtokens, een cachediscount van 99%, en een gemengde prijs van $0,18 bij een 7:2:1-mix van cache-hits/input/output. Artificial Analysis mat 134,3 outputtokens per seconde, 2,15 seconden tot de eerste token, en $206,66 om de index te draaien — $0,13 per taak.

• Gewichten — MiMo-V2.6-Pro MIT-gelicenseerd en downloadbaar; Grok 4.6 propriëtair, alleen via API

• Parameters — MiMo-V2.6-Pro 1,02T totaal / 42B actief; Grok 4.6 niet bekendgemaakt

• Context — MiMo-V2.6-Pro 1M tokens; Grok 4.6 500K, met een prijskloof bij 200K aan input

• Modaliteit — MiMo-V2.6-Pro accepteert tekst, afbeelding, video en audio; het gepubliceerde invoeroppervlak van Grok 4.6 is tekst en afbeelding

• Indexscore — MiMo-V2.6-Pro 46; Grok 4.6 44, beide Artificial Analysis v4.3.2

• Catalogusprijs — MiMo-V2.6-Pro $0,43 / $0,87 per 1 mln; Grok 4.6 $2,00 / $6,00, verdubbelt boven 200K invoer

• Gemengd tarief — MiMo-V2.6-Pro $0,18 per 1 miljoen; Grok 4.6 $1,35

• Kosten om de index te draaien — MiMo-V2.6-Pro $206,66; Grok 4.6 $2.351,83

• Snelheid — MiMo-V2.6-Pro 134,3 outputtokens per seconde; Grok 4.6 63,0

• Tijd tot eerste token — MiMo-V2.6-Pro 2,15 seconden; Grok 4.6 42,79 seconden

• Kennisafsluitdatum — MiMo-V2.6-Pro niet gepubliceerd; Grok 4.6 1 februari 2026

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.6, subtitled Two vendor DeepSWE figures, neither submitted to the public board. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; list price $0.43 / $0.87 per 1M; context window 1M tokens; speed 134.3 tokens per second; DeepSWE v1.1 72.57 vendor-run, avg@3; public DeepSWE entry none. The right column, Grok 4.6 (high), reads Intelligence Index v4.3.2 44; list price $2.00 / $6.00 per 1M; context window 500K tokens; speed 63.0 tokens per second; DeepSWE v1.1 65.9% vendor-reported; public DeepSWE entry ~67% submitted. A footer notes the two DeepSWE figures come from different vendor harnesses with different metrics and must not be subtracted, and that Grok 4.6 list rates double at or above 200K input tokens. The OrcaRouter logo is composited in the bottom-right corner.

De benchmark die beide leveranciers hebben uitgevoerd, en waarom die niet vergelijkbaar is

DeepSWE v1.1 is een echte, openbare, door derden uitgevoerde evaluatie van coding-agents, beheerd door Datacurve, en het is de enige taakfamilie waartegen beide bedrijven ervoor kozen te publiceren. Dat maakt het verleidelijk. Het mag niet worden gebruikt als een head-to-head, en de reden is niet dat een van beide leveranciers liegt — het is dat de twee cijfers verschillende metingen van dezelfde taaknaam beschrijven.

Xiaomi's 72,57 is een gemiddelde van drie op zijn eigen harness met mini-swe-agent, geproduceerd tijdens een reinforcement-learning-run in plaats van op basis van een bevroren release candidate, en gerapporteerd naast een beginwaarde van 58,4. De run is gedocumenteerd als 30 stappen en ongeveer 750.000 trajecten per model, voltooid in minder dan zes dagen bij een gepubliceerde besteding van ongeveer $2,62 miljoen voor het Pro-model. Het is niet ingediend bij Datacurves board. SpaceXAI's 65,9% voor Grok 4.6 is een launch-deck-cijfer uit de eigen evaluatieset van de leverancier, gerapporteerd naast winst ten opzichte van Grok 4.5 van 11,9 punten op dezelfde benchmark — en het publieke board bevat een ingediende Grok 4.6-configuratie op ongeveer 67%, wat dicht genoeg bij het leverancierscijfer ligt om te suggereren dat de harness op zijn minst ruwweg overeenkomt. Dat geldt niet voor het Xiaomi-cijfer, dat helemaal geen publieke tegenhanger heeft.

Dus de eerlijke uitspraak is deze: op het openbare scorebord is Grok 4.6 aanwezig en MiMo-V2.6-Pro afwezig. Op de onafhankelijke samengestelde index zijn beide daadwerkelijk door dezelfde beoordelaar getest, en het model van Xiaomi leidt met twee punten. Die twee feiten zijn niet met elkaar in tegenspraak. Ze meten simpelweg verschillende dingen, en het tweede is degene die je moet citeren.

De 500K-context is de spec die echte workloads bepaalt

Een half miljoen tokens is naar elke normale maatstaf een groot contextvenster en voor 2026 een klein. De modellen waarmee MiMo-V2.6-Pro wordt gegroepeerd, zitten allemaal op 1M, en de praktische consequentie blijkt precies bij de workloads waarvoor Grok 4.6 wordt gepromoot. Een langdurig draaiende coding-agent die een repository, een tool-transcript en een opgebouwd plan bijhoudt, zal in één sessie de 200.000 tokens aan prompt overschrijden — en vanaf die grens verdubbelen de tarieven van Grok 4.6 en gelden ze met terugwerkende kracht voor de hele aanvraag. Dezelfde sessie op MiMo-V2.6-Pro loopt tot een miljoen tokens zonder wijziging van tariefniveau.

Dat is tegelijkertijd een specificatieverschil en een verschil in prijsstructuur, en dat tweede is makkelijk te missen bij het vergelijken van de hoofdtarieven. Een gemengd tarief van $1,35 voor Grok 4.6 tegenover $0,18 voor MiMo-V2.6-Pro is een verschil van 7,5x. Bij een prompt die de 200K-grens overschrijdt, wordt het groter, tot iets dichter bij 15x, omdat het Grok-tarief verdubbelt en dat van Xiaomi niet verandert.

Het tegenargument is ook vastgelegd, en dat verdient het. De lanceringsthese van Grok 4.6 was beurtefficiëntie in plaats van ruwe context: in de agentische evaluatie waarin het op identieke taken werd afgezet tegen Claude Opus 5, eindigde het in ongeveer 53 beurten en circa 500 miljoen inputtokens, tegenover ongeveer 103 beurten en twee miljard tokens voor het andere model, tegen een geschatte $0,84 per taak — het laagste cijfer onder de frontiermodellen in die vergelijking. Een model dat half zo vaak door de lus gaat, heeft niet zoveel context nodig en verbruikt niet zoveel tokens. Dat is een oprecht architectonisch voordeel en het is het sterkste argument voor Grok 4.6 tegen elk goedkoper alternatief per token, inclusief dit.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Elk van hen bereiken

Grok 4.6 staat op OrcaRouter als grok/grok-4.6, bereikbaar via één OpenAI-compatibel endpoint tegen de lijstprijs van de provider met 0% opslag — dus een prijswijziging van SpaceXAI, inclusief een wijziging van die 200K-drempel, is dezelfde dag live aan onze kant. Xiaomi MiMo-V2.6-Pro staat niet op OrcaRouter. Geen enkel Xiaomi-model staat erop, en de route ernaartoe is vandaag Xiaomi's eigen platform of een van de catalogi van derden die het vermelden. Dat gewoon zeggen is nuttiger dan een modelpagina de indruk te laten wekken dat het anders is.

Wat die asymmetrie in de praktijk waard is, is een goedkoop experiment. Grok 4.6 is het model waarvoor je mogelijk al betaalt. MiMo-V2.6-Pro is een verbetering van twee punten op de index tegen een fractie van het tarief, deze week gelanceerd, met één enkele serveerroute erachter. De vraag die het beantwoorden waard is, is niet welke in abstracto beter is, maar hoeveel van je Grok-verkeer het Xiaomi-model kan overnemen bij je eigen prompts — en die beantwoorden door een tweede contract, een tweede sleutel en een tweede facturatieverhouding te openen, is de wrijving die voorkomt dat de test plaatsvindt. Met één endpoint en automatische failover tussen providers is de vergelijking een configuratiewijziging, en het failover-deel is hier belangrijker dan gewoonlijk: een model dat deze week is uitgebracht en door één API-provider werd vermeld toen Artificial Analysis het vastlegde, is niet iets om in een productiepad te zetten zonder een uitwijkroute.

Screenshot of the OrcaRouter model page for Grok 4.6, captured 22 September 2026, showing the breadcrumb Home > Models > SpaceXAI > Grok 4.6, the model id grok/grok-4.6 dated 2026-08-12, the Vision, Tools, JSON and Reasoning capability badges, and the on-this-page index for code samples, pricing, performance, public benchmarks, community buzz, comparisons and FAQ. The rate card sits below the visible area of the capture.

Welke moet je pakken?

Kies Grok 4.6 wanneer gespreksbeurt-efficiëntie hetgeen is dat je optimaliseert — lange agent-loops waarin het vermogen van het model om in de helft van de stappen klaar te zijn meer waard is dan het tarief per token — of wanneer je een model wilt waar maanden van onafhankelijke metingen achter zitten in plaats van een week. De 63 tokens per seconde en de tijd tot het eerste token van 42,79 seconden maken het in interactieve termen een model voor batch- en offline-workloads, en de 500K-context met een prijskloof bij 200K pleit ervoor prompts kort te houden.

Kies MiMo-V2.6-Pro wanneer je contextzware, repetitieve loops draait die over Grok's 200K-klif heen zouden gaan, wanneer je de latentie van de eerste token laag genoeg nodig hebt om een mens te laten wachten, wanneer je de gewichten in je eigen infrastructuur wilt, of wanneer het volume het verschil van 7,5x in blended tarief tot het beslissende getal maakt. De voorsprong van twee punten op de index is klein genoeg om niet op zichzelf de reden te zijn; de kosten van $206,66 tegenover $2.351,83 om dezelfde evaluatiesuite te draaien zijn een betere reden.

Wat de openstaande vraag zou beslechten, is een ingediende DeepSWE-configuratie voor MiMo-V2.6-Pro. Grok 4.6 heeft er al een. Op het moment dat Xiaomi's model op de openbare ranglijst verschijnt met een opgegeven harness, een betrouwbaarheidsinterval en kosten per taak, is 72,57 niet langer een leveranciersgetal en wordt de vergelijking hierboven een echte — en gezien het verschil van twee punten op de index kan het beide kanten op.

OrcaRouter zet 200+ modellen achter één OpenAI-compatibel endpoint tegen de listprijs van de provider met 0% opslag, zodat een prijswijziging van een leverancier dezelfde dag nog live is.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt