Een gegenereerde titelkaart met de tekst "Kimi K4" en de ondertitel "wat het lek zegt, en wat het niet zegt", een badge "LEK / NIET GEVERIFIEERD", drie gestapelde regels met "Geen modelkaart", "Geen gewichten" en "Geen prijs of route", en een voettekstregel "Per 25 september 2026", met het OrcaRouter-logo gecompositeerd in de rechteronderhoek.
Guides & Insights

Kimi K4: wat het lek werkelijk beweert, en waarom "minder actieve parameters" het echte verhaal zou zijn

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Een enkele post heeft vier onaangekondigde modelnamen tegelijk in omloop gebracht. De lijst begint met K​imi K4, de vermeende volgende generatie van Moonshot AI, naast GLM-5.5 Flash en GLM-5.4 van Z.ai en D​eepSeek V4.1P — en de eigen nadruk van de auteur ligt niet op een van de vlaggenschipnamen, maar op een vermoeden over de rekenkunde achter K4: dat het misschien minder parameters activeert dan het model dat het vervangt. Die bewering is niet geverifieerd. Er is geen K​imi K4-modelkaart, geen gewichten, geen API-identifier, geen prijs en geen route, en hetzelfde geldt voor elke Z.ai-naam in de lijst. Wat nu de moeite waard is, is uitzoeken welke van deze beweringen controleerbaar zouden zijn, hoe de uitgebrachte baseline eruitziet, en wat een schaarsere K4 daadwerkelijk zou betekenen.

Het signaal, en zijn

Dit is een vroeg signaal, en het moet als zodanig worden gelezen. De post die het bevat is een interpretatie van naamgevingsconventies voor modellen, niet een verslag van een waarneming: hij markeert "GLM-5.5 Flash, GLM-5.4" als interessante nomenclatuur en noemt Kimi K4 "heel vreemd", en biedt vervolgens een speculatief mechanisme — minder geactiveerde experts — zonder te beweren een config, een checkpoint-lijst of een staging-endpoint te hebben gezien.

Niets in het openbare dossier weerspreekt de namen, en niets bevestigt ze ook. Die asymmetrie is normaal voor deze fase van een releasecyclus, en precies daarom is de nuttige stap om de baseline en de tests vast te leggen, niet om verder te speculeren. Een naam in een post is een hypothese over een product, niet het bewijs ervan.

De baseline waartegen een Kimi K4 zou worden afgemeten

Kimi K3 is echt, uitgebracht en ongewoon goed gedocumenteerd, wat het een solide referentiepunt maakt. Moonshots eigen modelkaart beschrijft een Mixture-of-Experts-model met 2,8 biljoen parameters dat per token 104 miljard parameters activeert, verdeeld over 93 lagen — één dense laag en 92 sparse lagen. De sparsiteit is agressief en wordt ronduit vermeld: 16 van de 896 experts worden per token geactiveerd, bovenop 2 gedeelde experts, wat Moonshot toeschrijft aan een verbetering van ongeveer 2,5× in schaalefficiëntie ten opzichte van Kimi K2.

De attention-stack is waar K3 breekt met de vorige generatie. Van de 92 sparse lagen gebruiken 69 K​imi Delta Attention — een hybride lineair-aandachtsmechanisme — en 24 gebruiken gated MLA, een 3:1-verdeling die een minderheid van full-attention-lagen behoudt en de rest naar het goedkopere lineaire pad duwt. Lagen hebben elke 12 blokken een attention-residu, de activatiefunctie is SiTU-GLU, en het hele model wordt getraind met MXFP4-gewichten en MXFP8-activaties onder kwantisatiebewuste training. Contextlengte is 1.048.576 tokens, vocabulairegrootte is 163.840, en vision loopt via een MoonViT-V2-encoder met 401M parameters, waardoor K3 native beeldverwerking ondersteunt in plaats van multimodaal via een bolt-on.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

Dat zijn de cijfers die een opvolger moet verzetten. Let op wat ze impliceren over het idee van "minder actieve parameters": K3 is al een buitengewoon sparse model. Het activeert per token ongeveer 3,7% van zijn totale aantal parameters. Een K4 die minder dan 104B activeert, zou geen vet wegsnijden uit een overgeprovisioneerd ontwerp — hij zou een sparsityratio terugdraaien die Moonshot publiekelijk als een overwinning heeft gepresenteerd, en dat zou hij doen in de generatie waarin de rest van het veld de andere kant op gaat.

Wat 'minder actieve parameters' zou betekenen als het waar is

Er zijn twee lezingen beschikbaar en ze wijzen in tegengestelde richtingen. De welwillende lezing is architecturaal: Moonshot zou de KDA-hybride verder kunnen uitbreiden, meer full-attentionlagen vervangen door lineaire lagen en het expertbudget opnieuw kunnen balanceren, zodat een lager activeringsaantal een langere context, een goedkopere serving-voetafdruk of een betere kwaliteit-per-flop-verhouding oplevert. Volgens die lezing is een kleiner aantal actieve parameters een verfijning van dezelfde these die K3 al stelt — dat sparsity een schaalstrategie is, geen compromis.

De andere lezing is dat K4 helemaal geen uniforme opvolger is. De productlijn van Kimi heeft dit jaar al een vertakking gekend, en rapporten hebben op uiteenlopende manieren gezinspeeld op K3.1, K3.2 en K4 als drie verschillende producten. Een K4 die minder activeert dan K3, in een familie die met een aparte codeervariant komt, is minstens even consistent met een herpositionering als met een gewone upgrade. Beide lezingen zijn speculatie. Geen van beide wordt door een post beslecht.

Er is ook een licentiedimensie die niemand heeft behandeld. De gewichten van K3 worden vrijgegeven onder de Kimi K3 License, een aangepaste 'andere' licentie in plaats van een standaard open-sourcelicentie, en het is het eerste open 3T-klassemodel. Of een schaarsere K4 die licentie erft, of die versmalt, is voor iedereen die op de gewichten voortbouwt belangrijker dan een paar punten indexscore.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

De andere drie namen in hetzelfde bericht

GLM-5.5 Flash en GLM-5.4 vormen het verrassendere duo, en niet vanwege de cijfers. Het gepubliceerde plafond van Z.ai is GLM-5.3, dat op 14 augustus 2026 verscheen met 743B parameters, waarna GLM-5.3-Flash op 26 augustus volgde en de BF16- en Flash-BF16-gewichten op 25 augustus werden vrijgegeven. Z.ai's eigen documentatie vermeldt precies drie actuele model-identificaties: glm-5.3, glm-5.3-flash en glm-5.2. Er is geen GLM-5.4, geen GLM-5.5 en geen GLM-5.5 Flash — en de richting van de naamgeving is het vreemde deel, want een 5.5-generatie die aan een 5.4-generatie voorafgaat, is niet hoe Z.ai ooit een familie heeft genummerd. Versienummers die in een lek buiten de volgorde opduiken, zijn een bekend faalpatroon: het zijn meestal aangrenzende producten, interne codenamen of een aanduiding van een serveerlaag in plaats van een nieuw basismodel.

D​eepSeek V4.1P is de naam waarin de auteur van het signaal zegt het meest geïnteresseerd te zijn, en het is de gemakkelijkste van de vier om te controleren. De API-documentatie van D​eepSeek noemt precies twee huidige modelstrings: deepseek-flash en deepseek-v4-pro. Het achtervoegsel "P" heeft geen tegenhanger in enige D​eepSeek-identifier, en de meest recente release van gewichten in D​eepSeek's eigen organisatie is DeepSeek-V4.1-Flash, gepubliceerd op 10 september 2026. Een V4.1P zou het meest plausibel een Pro-tier broer of zus van dat model zijn — maar "het meest plausibel" is een gok over een string, niet over een product.

Hoe zou je weten dat ook maar iets hiervan echt is?

De vier namen falen op dezelfde manier voor dezelfde test, waardoor het wachten eerder eenvoudig dan martelend is. Een echte release laat artefacten achter, en elk daarvan is eenvoudig te controleren:

• Een modelkaart in de eigen Hugging Face-organisatie van de leverancier. De nieuwste toevoeging van Moonshot is Kimi-K3, aangemaakt op 13 juni 2026; de nieuwste van Z.ai is de GLM-5.3-familie van 25 augustus; de nieuwste van DeepSeek is DeepSeek-V4.1-Flash van 10 september. In geen van de drie bestaat er iets nieuwers.

• Een configuratie die de discussie beslecht. Voor K4 specifiek zijn de velden waarnaar je moet zoeken num_experts en num_experts_per_token — K3's waarden zijn 896 en 16. Een K4-configuratie met een lager aantal per token is de bewering in deze lek die in één bestand wordt bevestigd of weerlegd.

• Een routeerbaar model. Een naam die in een catalogus staat, is een naam met een prijs, een contextvenster en een provider erachter; een naam die alleen in een post staat, heeft geen van die dingen.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Wat je vandaag kunt routeren

De praktische kant van dit lek is dat de generatie die het beschrijft niet is waarop je kunt bouwen. Wat live is, is de vorige, en de taak van de router is om de kloof tussen generaties een routingbeslissing te maken in plaats van een migratieproject. Kimi K3 is nu beschikbaar met zijn volledige context van 1M tokens en native vision, geprijsd op $3,00 per miljoen inputtokens en $15,00 per miljoen outputtokens, met cache-reads tegen $0,30 — gefactureerd tegen het tarief van de provider zonder opslag, waardoor een prijswijziging van de leverancier op K3 dezelfde dag op je factuur doorwerkt in plaats van bij de volgende herprijzingsronde. Kimi K3 op OrcaRouter bevat de volledige specificatielijst en het actuele tarief.

Hetzelfde geldt voor de rest van het aanbod. GLM-5.3, GLM-5.3-Flash en DeepSeek V4.1 Flash zijn allemaal routeerbaar naast Kimi K3, via één OpenAI-compatibel endpoint dat 200+ modellen dekt, met automatische failover wanneer een provider verslechtert en een routing-DSL om voorkeuren uit te drukken — kostenplafonds, kwaliteitsondergrenzen, latentiebudgetten — als beleid in plaats van logica per aanroep. Wanneer een K​imi K4, GLM-5.5 Flash of D​eepSeek V4.1P verschijnt, is de migratie een stringwijziging in het routingbeleid en niets anders. Met model fusion kun je de uitvoer van meerdere modellen op hetzelfde endpoint combineren wanneer een taak daarbij baat heeft.

Om expliciet te zijn over wat dat niet is: geen van de vier gelekte namen is vandaag een route op OrcaRouter. We hosten ze niet en kunnen ze niet serveren.

Kortom

De interessante bewering hier is niet de versienummers. Het is het mechanisme — een vlaggenschip van de volgende generatie dat minder parameters activeert dan zijn voorganger, zou de bewering zijn dat Moonshot gelooft dat sparsity, niet het ruwe aantal activaties, de as is die het waard is om op door te duwen, en de 16-van-896 expert-split van K3 is al een argument in die richting. Elk onderdeel van de bewering is niet geverifieerd: Kimi K4, GLM-5.5 Flash, GLM-5.4 en DeepSeek V4.1P hebben geen modelkaarten, geen gewichten, geen API-identificaties en geen prijzen, en de eigen catalogi van de leveranciers stoppen in elk van deze gevallen een generatie eerder. Beschouw de namen als een voorproefje op een vraag, niet als een antwoord — en als je vandaag open gewichten van frontierklasse bij 1M context nodig hebt, is Kimi K3 het model dat al bestaat.

Wanneer een K​imi K4 eenmaal arriveert, automatische failoverwat voorkomt dat de migratie een incident wordt

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt