
MiMo-V2.6-Pro vs Grok 4.6: Båda leverantörerna publicerade DeepSWE-siffror, och ingen av dem finns på resultattavlan
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Två leverantörer, ett riktmärke, två tal som inte kan subtraheras. SpaceXAI:s lanseringsmaterial för Grok 4.6 rapporterar 65,9 % på DeepSWE v1.1. Xiaomis material för MiMo-V2.6-Pro rapporterar 72,57 på DeepSWE v1.1. Lästa tillsammans antyder de att den billigare modellen med öppna vikter slår den proprietära toppmodellen med nästan sju procentenheter. Läser man dem noggrant säger de nästan ingenting, eftersom det ena är ett procenttal från en lanseringspresentation i leverantörens egen testrigg och det andra är ett medelvärde av tre från en körning med förstärkningsinlärning i Xiaomis egen bedömare, och ingen av dem har skickats in till den offentliga DeepSWE-tavlan. Jämförelsen mellan MiMo-V2.6-Pro och Grok 4.6 som håller för granskning finns på det oberoende indexet, och där är svaret det omvända mot leverantörernas siffror: 46 mot 44, till Xiaomis fördel, med två poäng.
Grok 4.6 släpptes den 12 augusti 2026 av SpaceXAI och är den etablerade aktören här — en lanserad, brett tillhandahållen frontier-modell med en dokumenterad prislista och månader av oberoende mätningar bakom sig. Xiaomi MiMo-V2.6-Pro blev allmänt tillgänglig den 22 september 2026, med sina repositorier för förstärkningsinlärnings-checkpoints som dök upp dagen innan, och den är nykomlingen. Båda har resonemangsförmåga, båda är byggda för långvarigt agentiskt arbete, och prisgapet mellan dem är tillräckligt stort för att nykomlingens oerfarenhet är det enda som hindrar jämförelsen.
Vad varje modell faktiskt är
Grok 4.6 är proprietär, tar text- och bildinmatning och returnerar text, och har en kunskapsavskärning den 1 februari 2026. Dess kontextfönster är 500 000 token, vilket är hälften så stort som dess huvudkonkurrenters och den enskilt mest avgörande specifikationen i dess specifikationsblad. Dess listpriser är 2,00 USD per miljon indatatoken, 0,50 USD per miljon cachad indata och 6,00 USD per miljon utdata under 200 000 prompt-token, med ett stup vid den gränsen: vid eller över 200K blir priserna 4,00 USD, 1,00 USD och 12,00 USD, och den högre nivån debiterar hela begäran i stället för den del som ligger över gränsen. Prioriterad bearbetning fördubblar standardpriset. Artificial Analysis uppmätte 63,0 utdatatoken per sekund och 42,79 sekunder till första token vid maximal ansträngning, samt 2 351,83 USD för att köra hela indexet.
Xiaomi MiMo-V2.6-Pro är en sparse mixture-of-experts-modell med totalt 1,02 biljoner parametrar och 42 miljarder aktiverade per token, med ett kontextfönster på 1 miljon tokens och inbyggd multimodalitet över text, bild, video och ljud. Den är MIT-licensierad med nedladdningsbara vikter, och Xiaomi behöll föregående generations prissättning i stället för att prissätta den nya checkpointen uppåt — 0,43 USD per miljon indata-tokens och 0,87 USD per miljon utdata-tokens, 99 % cacherabatt och ett sammanvägt pris på 0,18 USD vid en mix av 7:2:1 cacheträffar/indata/utdata. Artificial Analysis uppmätte 134,3 utdata-tokens per sekund, 2,15 sekunder till första token och 206,66 USD för att köra indexet — 0,13 USD per uppgift.
• Vikter — MiMo-V2.6-Pro MIT-licensierad och nedladdningsbar; Grok 4.6 proprietär, endast API
• Parametrar — MiMo-V2.6-Pro 1,02T totalt / 42B aktiva; Grok 4.6 ej offentliggjorda
• Kontext — MiMo-V2.6-Pro 1M tokens; Grok 4.6 500K, med ett prisstup vid 200K indata
• Modalitet — MiMo-V2.6-Pro accepterar text, bild, video och ljud; Grok 4.6:s publicerade indatayta är text och bild
• Indexpoäng — MiMo-V2.6-Pro 46; Grok 4.6 44, båda Artificial Analysis v4.3.2
• Listpris — MiMo-V2.6-Pro $0,43 / $0,87 per 1M; Grok 4.6 $2,00 / $6,00, fördubblas över 200K indata
• Blandad taxa — MiMo-V2.6-Pro $0,18 per 1 miljon; Grok 4.6 $1,35
• Kostnad för att köra indexet — MiMo-V2.6-Pro $206.66; Grok 4.6 $2,351.83
• Hastighet — MiMo-V2.6-Pro 134,3 utdatatokens/sekund; Grok 4.6 63,0
• Tid till första token — MiMo-V2.6-Pro 2,15 sekunder; Grok 4.6 42,79 sekunder
• Kunskapsavgränsning — MiMo-V2.6-Pro inte publicerad; Grok 4.6 1 februari 2026

Benchmarken som båda leverantörerna körde, och varför den inte är jämförbar
DeepSWE v1.1 är en verklig, offentlig utvärdering av kodningsagenter från tredje part som drivs av Datacurve, och det är den enda uppgiftsfamilj som båda företagen valde att publicera mot. Det gör det frestande. Den bör inte användas som en direktjämförelse, och anledningen är inte att någon av leverantörerna ljuger – det är att de två siffrorna beskriver olika mätningar av samma uppgiftsnamn.
Xiaomis 72,57 är ett medelvärde av tre i deras eget testramverk med mini-swe-agent, framställt under en förstärkningsinlärningskörning snarare än från en fryst releasekandidat, och rapporterades tillsammans med en startsiffra på 58,4. Körningen dokumenteras som 30 steg och ungefär 750 000 trajektorier per modell, slutförd på under sex dagar till en publicerad kostnad av omkring 2,62 miljoner dollar för Pro-modellen. Den har inte lämnats in till Datacurves resultattavla. SpaceXAI:s 65,9 % för Grok 4.6 är en siffra från lanseringspresentationen från leverantörens egen utvärderingsuppsättning, rapporterad tillsammans med förbättringar på 11,9 punkter jämfört med Grok 4.5 i samma benchmark — och den offentliga resultattavlan visar en inlämnad Grok 4.6-konfiguration på omkring 67 %, vilket är tillräckligt nära leverantörens siffra för att antyda att testramverket åtminstone är ungefär i linje. Det gäller inte Xiaomis siffra, som inte har någon offentlig motsvarighet alls.
Så det ärliga påståendet är detta: på den offentliga resultattavlan finns Grok 4.6 med och MiMo-V2.6-Pro saknas. I den oberoende sammanställningen hade båda faktiskt testats av samma utvärderare, och Xiaomis modell leder med två poäng. Dessa två fakta står inte i motsättning till varandra. De mäter helt enkelt olika saker, och det är den andra man bör citera.
500K-kontexten är specifikationen som avgör verkliga arbetsbelastningar
En halv miljon tokens är ett stort kontextfönster enligt alla normala mått och ett litet sådant för 2026. De modeller som MiMo-V2.6-Pro grupperas med ligger alla på 1M, och den praktiska konsekvensen visar sig i exakt de arbetsbelastningar som Grok 4.6 marknadsförs för. En långvarig kodagent som håller ett kodförråd, en verktygstranskription och en ackumulerad plan kommer att passera 200 000 tokens i prompten under en session – och vid den gränsen fördubblas Grok 4.6:s priser och tillämpas retroaktivt på hela begäran. Samma session på MiMo-V2.6-Pro går upp till en miljon tokens utan att prisnivån ändras.
Det är en skillnad i specifikation och en skillnad i prissättningsstruktur samtidigt, och den senare är lätt att missa när man jämför annonserade priser. Ett blandat pris på 1,35 USD för Grok 4.6 mot 0,18 USD för MiMo-V2.6-Pro är en skillnad på 7,5x. För en prompt som passerar 200K vidgas den till något närmare 15x, eftersom Grok-priset fördubblas medan Xiaomis inte rör sig.
Motargumentet finns också protokollfört, och det förtjänar det. Grok 4.6:s lanseringstes var tureffektivitet snarare än rå kontext: i den agentiska utvärderingen där den mättes mot Claude Opus 5 på identiska uppgifter avslutade den på ungefär 53 turer och omkring 500 miljoner indatatoken, mot ungefär 103 turer och två miljarder token för den andra modellen, till en uppskattad kostnad av 0,84 dollar per uppgift – den lägsta siffran bland frontmodellerna i den jämförelsen. En modell som går runt loopen hälften så många gånger behöver inte lika mycket kontext, och den bränner inte lika många token. Det är en verklig arkitektonisk fördel, och det är det starkaste argumentet för Grok 4.6 mot något billigare per-token-alternativ, inklusive detta.

Att ta sig till var och en av dem
Grok 4.6 finns på OrcaRouter som grok/grok-4.6, nås via en OpenAI-kompatibel slutpunkt till leverantörens listpris med 0 % påslag – så en prisförändring från SpaceXAI, inklusive en ändring av den där 200K-gränsen, är live hos oss samma dag. Xiaomi MiMo-V2.6-Pro finns inte på OrcaRouter. Ingen Xiaomi-modell gör det, och vägen dit idag är Xiaomis egen plattform eller en av tredjepartskatalogerna som listar den. Att säga det rakt ut är mer användbart än att låta en modellsida antyda något annat.
Vad den asymmetrin är värd i praktiken är ett billigt experiment. Grok 4.6 är modellen du kanske redan betalar för. MiMo-V2.6-Pro är en förbättring på två indexpunkter till en bråkdel av priset, lanserad den här veckan, med en enda serveringsväg bakom sig. Frågan som är värd att besvara är inte vilken som är bättre i abstrakt mening, utan hur mycket av din Grok-trafik Xiaomi-modellen kan ta sig an på dina egna prompter — och att besvara den genom att teckna ett andra avtal, en andra nyckel och en andra faktureringsrelation är den friktion som hindrar testet från att bli av. Med en enda slutpunkt och automatisk failover mellan leverantörer är jämförelsen en konfigurationsändring, och failover-halvan spelar större roll än vanligt här: en modell som släpptes den här veckan och listades av en API-leverantör när Artificial Analysis fångade den är inget man lägger i en produktionsväg utan en väg att falla tillbaka till.

Vilken att välja
Välj Grok 4.6 när tureffektivitet är det du optimerar — långa agentloopar där modellens förmåga att bli klar på halva antalet steg är värd mer än dess pris per token — eller när du vill ha en modell med månader av oberoende mätningar bakom sig i stället för en vecka. Dess 63 tokens per sekund och 42,79 sekunders tid till första token gör den till en modell för batch- och offline-arbetsbelastningar i interaktiva termer, och dess 500K-kontext med en 200K-prisklippa talar för att hålla prompterna korta.
Välj MiMo-V2.6-Pro när du kör kontexttunga, repetitiva loopar som skulle korsa Groks 200K-kliff, när du behöver latensen för första token tillräckligt låg för att en människa ska vänta, när du vill ha vikterna i din egen infrastruktur, eller när volymen gör 7,5x-gapet i blandad taxa till det avgörande numret. Dess ledning på två punkter i indexet är tillräckligt liten för att den inte bör vara skälet i sig; kostnaden på $206,66 mot $2 351,83 för att köra samma utvärderingssvit är ett bättre skäl.
Det som skulle avgöra den öppna frågan är en inlämnad DeepSWE-konfiguration för MiMo-V2.6-Pro. Grok 4.6 har redan en. I samma ögonblick som Xiaomis modell dyker upp på den offentliga resultattavlan med en angiven harness, ett konfidensintervall och en kostnad per uppgift, upphör 72,57 att vara en leverantörssiffra och jämförelsen ovan blir en verklig sådan – och med tanke på gapet på två punkter i indexet skulle det kunna gå åt endera hållet.
OrcaRouter sätter 200+ modeller bakom en enda OpenAI-kompatibel slutpunkt till leverantörens listpris med 0 % påslag, så att en leverantörs prisändring är live samma dag.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
