
MiMo-V2.6-Pro vs Kimi K3: twee open gewichten met een biljoen parameters, veertien keer uit elkaar qua kosten per taak
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Beide zijn open-weights mixture-of-experts-modellen van Chinese labs met een contextvenster van 1M tokens. Beide zijn beschikbaar om te downloaden. Op de Artificial Analysis Intelligence Index v4.3.2, afgelezen op 22 september 2026, scoort Kimi K3 van MoonshotAI 44 en MiMo-V2.6-Pro van Xiaomi 46. Twee punten. De gemeten kosten voor het draaien van diezelfde evaluatiesuite tegen elk zijn $3.658,07 voor Kimi K3 en $206,66 voor MiMo-V2.6-Pro — een factor zeventien. Als je al hebt besloten dat je open weights in deze klasse wilt, is die verhouding, niet de twee punten, de beslissing.
Kimi K3 is het gevestigde model in dit paar: uitgebracht op 16 juli 2026, met de volledige gewichten die op 27 juli volgden, en maanden van onafhankelijke evaluatie erachter. Xiaomi MiMo-V2.6-Pro werd algemeen beschikbaar op 22 september 2026, waarbij de repositories met reinforcement-learning-checkpoints de dag ervoor verschenen. De vergelijking gaat dus tussen een bewezen open model met premiumprijsstelling en een gloednieuw model met commodityprijsstelling, en het interessante deel is hoe klein de gemeten capaciteitskloof bleek te zijn.
Wat elk model daadwerkelijk is
Kimi K3 is een multimodaal redeneermodel met open gewichten en 2,8 biljoen parameters, dat bij de release werd omschreven als het eerste open model in de klasse van drie biljoen. Het activeert per token 16 van de 896 experts — ongeveer 104 miljard actieve parameters — en gebruikt Kimi Delta Attention en Attention Residuals om efficiënt een context van 1M tokens vast te houden, met een uitvoer van maximaal 1M tokens per verzoek. Het is always-on redeneren met native vision. De first-party API van Moonshot rekent $3,00 per miljoen inputtokens, $0,30 per miljoen gecachte input en $15,00 per miljoen output, vast en zonder staffel naar contextlengte, en Artificial Analysis meldt een cachediscount van 90% en een gemengd tarief van $2,31. Het haalde 42,8 outputtokens per seconde — opvallend langzaam tegenover een mediaan van 77,9 voor modellen van vergelijkbare grootte — en 3,93 seconden tot de eerste token.
Xiaomi MiMo-V2.6-Pro is een sparse mixture-of-experts-model met in totaal 1,02 biljoen parameters en 42 miljard geactiveerde parameters per token, met een contextvenster van 1M tokens en native multimodaliteit voor tekst, afbeelding, video en audio. De gewichten dragen een MIT-licentiemarkering. Xiaomi handhaafde de prijsstelling van de vorige generatie in plaats van het nieuwe checkpoint duurder te prijzen, daarom wordt het vermeld tegen $0,43 per miljoen invoertokens en $0,87 per miljoen uitvoertokens, met 99% cachekorting en een blended tarief van $0,18. Het haalde 134,3 uitvoertokens per seconde — elfde van 114 modellen op het gebied van snelheid — en 2,15 seconden tot het eerste token.
• Actieve parameters — MiMo-V2.6-Pro 42B per token; Kimi K3 ongeveer 104B, waarbij 16 van 896 experts worden geactiveerd
• Totaal aantal parameters — MiMo-V2.6-Pro 1,02T; Kimi K3 2,8T
• Indexscore — MiMo-V2.6-Pro 46; Kimi K3 44, beide Artificial Analysis v4.3.2
• Lijstprijs — MiMo-V2.6-Pro $0,43 / $0,87 per 1 mln.; Kimi K3 $3,00 / $15,00, gecachede invoer $0,30
• Gemengd tarief — MiMo-V2.6-Pro $0,18 per 1 miljoen; Kimi K3 $2,31
• Kosten om de index te draaien — MiMo-V2.6-Pro $206,66; Kimi K3 $3.658,07
• Snelheid — MiMo-V2.6-Pro 134,3 outputtokens/seconde; Kimi K3 42,8, tegenover een mediaan van 77,9 voor de grootteklasse
• Tijd tot eerste token — MiMo-V2.6-Pro 2,15 seconden; Kimi K3 3,93 seconden
• Context — 1M tokens beide; Kimi K3 publiceert output tot 1M tokens per verzoek
• Gewichten — beide downloadbaar; MiMo-V2.6-Pro draagt een MIT-tag

Snelheid is het verschil dat de index verbergt
Het samengestelde gat van twee punten is het minst interessante getal hier, en de 134,3 tegenover 42,8 tokens per seconde is het meest. Een model dat drie keer sneller genereert is niet drie keer beter, maar het is het verschil tussen een categorie applicaties die wel werkt en een die dat niet doet — en de eigen Artificial Analysis-pagina van Kimi K3 bestempelt het als opvallend traag voor zijn grootteklasse. Voor een agentlus met een lange horizon die tientallen opeenvolgende aanroepen doet, stapelt de doorvoer zich op zoals de latentie dat doet: een drievoudig verschil per aanroep is geen drievoudig end-to-endverschil, maar het is het verschil tussen een sessie die een gebruiker uitzit en een die hij opgeeft.
Het voordeel van Kimi K3 zit aan de invoerzijde van de balans. De 3,93 seconden tot het eerste token is trager dan de 2,15 van MiMo-V2.6-Pro, maar niet met de orde van grootte die elk van beide scheidt van een frontier-redeneermodel op maximale inspanning. Waar K3 voor zijn omvang betaalt, is bij de generatie, en generatie is waarvoor je wordt gefactureerd.
De leveranciersnummers, en degene die verkeerd wordt gelezen
Beide labs publiceerden DeepSWE v1.1-cijfers uit hun eigen harnesses, en de twee circuleren alsof ze vergelijkbaar zijn. Dat zijn ze niet, en juist bij dit paar richt die fout de meeste schade aan, omdat de cijfers zo dicht bij elkaar lijken te liggen.
Xiaomi rapporteert dat MiMo-V2.6-Pro tijdens zijn reinforcement-learning-run van 58,4 naar 72,57 gaat op DeepSWE v1.1, geëvalueerd met mini-swe-agent op basis van average-of-three op Xiaomi's eigen grader. De run is gedocumenteerd als 30 stappen en ongeveer 750.000 trajecten per model, voltooid in minder dan zes dagen tegen een gepubliceerde besteding van ongeveer $2,62 miljoen voor het Pro-model en $854.044 voor de kleinere Flash. Een wijdverbreide lezing van die run plaatst Kimi K3 op 68,51 op dezelfde benchmark, wat het Xiaomi-model met vier punten tot winnaar zou maken. Die lezing is een cijfer uit de community, geen Moonshot-cijfer, en de twee metingen gebruiken verschillende maatstaven — average-of-three tegenover een slagingspercentage — dus ze van elkaar aftrekken is rekenen met niet-overeenkomende schalen. Geen van beide leveranciers heeft een configuratie ingediend bij het openbare board van Datacurve voor deze modellen.
Het getal dat echt vergelijkbaar is, is de index, omdat Artificial Analysis beide zelf heeft uitgevoerd: 46 voor MiMo-V2.6-Pro en 44 voor Kimi K3, op v4.3.2, waarbij de uitsplitsing per evaluatie voor geen van beide is gepubliceerd. Die marge van twee punten is klein genoeg om binnen de ruis van een samengestelde score van tien evaluaties te vallen, en de eerlijke conclusie is dat deze twee modellen qua gemeten capaciteit effectief gelijk staan.
Wat de premium van Kimi K3 oplevert
Het zou onjuist zijn om het kostenverschil als pure marge te lezen. Kimi K3 is een model met 2,8 biljoen parameters tegenover Xiaomi's 1,02 biljoen, en het activeert per token ongeveer tweeënhalf keer zoveel parameters. Het was het eerste open model in zijn grootteklasse, en het beschikt over een reeks onafhankelijke resultaten die MiMo-V2.6-Pro simpelweg nog niet de tijd heeft gehad om op te bouwen: volgens de eigen rapportage van Artificial Analysis stond het op het moment van zijn release derde op de Intelligence Index, achter Claude Fable 5 en GPT-5.6 Sol, met GDPval-AA v2 op Elo 1668, een eerste plaats op AutomationBench-AA met 53%, een tweede plaats op AA-Briefcase met Elo 1547, en een eerste plaats in de Frontend Code Arena met 1679. Dat zijn onafhankelijke metingen, geen aankondigingsclaims, en ze beschrijven een model met een breedte die een samengestelde marge van twee punten niet vangt.
Er hangt ook een capaciteitsverhaal aan vast. De vraag naar Kimi K3 zou bij de lancering de serveercapaciteit hebben overweldigd, wat leidde tot tijdelijke onderbrekingen van API-abonnementen en limieten op de upstream-capaciteit bij sommige gateways. Een model dat moeilijk te verkrijgen is, is een model waarop moeilijk voort te bouwen valt, en dat is een beschikbaarheidsprobleem, geen kwaliteitsprobleem.

Eén endpoint, en een duidelijk antwoord over wat we routeren
Kimi K3 staat op OrcaRouter als kimi/kimi-k3 — één OpenAI-compatibele sleutel, de adviesprijs van de provider wordt met 0% opslag doorgegeven, dus een prijswijziging van Moonshot is dezelfde dag nog live aan onze kant, en automatische failover tussen providers dekt de capaciteitslimieten die dit model sinds de lancering achtervolgen. Xiaomi MiMo-V2.6-Pro staat niet op OrcaRouter. Geen enkel Xiaomi-model staat erop, en de route ernaartoe loopt vandaag via Xiaomi's eigen platform of een van de catalogi van derden die het aanbieden. Dat kun je maar beter ronduit zeggen in plaats van een modelpagina de indruk te laten wekken dat het anders is.
Wat van deze combinatie een goed voorbeeld maakt van waar de routeringslaag voor bedoeld is. Twee open modellen, gelijk op de enige onafhankelijke maatstaf waartegen beide zijn getest, zeventienvoudig uit elkaar liggend op de gemeten kosten per taak — dat is geen keuze, het is een tweebaansconfiguratie. Zet het grootste deel van je verkeer op de goedkope baan en routeer de staart naar de andere op basis van een predicaat dat jij bepaalt, of schakel over wanneer een route verslechtert. Met de modellen achter één sleutel is het experiment dat je vertelt welk aandeel elk moet krijgen een configuratiewijziging in je eigen prompts in plaats van een inkoopgesprek — en als Xiaomi de prijs van MiMo-V2.6-Pro herziet zodra het lanceervenster sluit, of Moonshot de tarieven van K3 verlaagt als reactie op de concurrentie, komen beide wijzigingen dezelfde dag ons ten goede in plaats van pas bij de volgende factureringscyclus.

Welke moet je pakken?
Kies Kimi K3 wanneer je de breedte nodig hebt die gepaard gaat met een model van deze omvang en deze onafhankelijk gemeten — vision, coderen met een lange horizon over grote repositories, agentisch toolgebruik — of wanneer je het al draait en de migratiekosten reëel zijn. Het is van de twee het model dat het grondigst is gekarakteriseerd, en zijn uitvoerplafond van 1M tokens is ongebruikelijk. Houd rekening met de generatiesnelheid: met 42,8 tokens per seconde is het in interactieve termen een batch- en offlineworkloadmodel, wat de kwaliteit van zijn redenering ook suggereert.
Kies MiMo-V2.6-Pro wanneer doorvoer en unit economics de beperkende factor zijn, wanneer de loop contextzwaar en repetitief is, wanneer first-tokenlatentie ertoe doet, of wanneer je de weights op je eigen hardware wilt onder een permissieve licentie. Het is het zeldzame geval van een goedkoop model dat ook het snelle is, en op de enige onafhankelijke score die beide modellen delen, staat het voor met een marge die klein genoeg is om een gelijkspel te zijn.
Kies beide als je een router hebt. De faalmodus die je moet vermijden, is je op een van beide standaardiseren vanwege een in het oog springende ratio: Kimi K3-tarieven betalen voor een samenvattingsklus die een 46-index-model identiek afrondt, of ontdekken dat een codeertaak op repositoryschaal het 2,8T-model nodig heeft nadat je alles naar de goedkope baan hebt verhuisd. Geen van beide is een modelprobleem, en beide zijn configuratie.
OrcaRouter zet 200+ modellen achter één OpenAI-compatibel endpoint tegen de listprijs van de provider met 0% opslag, zodat een prijswijziging van een leverancier dezelfde dag nog live is.
