
Kimi K4: wat het lek werkelijk beweert, en waarom "minder actieve parameters" het echte verhaal zou zijn
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 506 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 183 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Een enkele post heeft vier onaangekondigde modelnamen tegelijk in omloop gebracht. De lijst begint met Kimi K4, de vermeende volgende generatie van Moonshot AI, naast GLM-5.5 Flash en GLM-5.4 van Z.ai en DeepSeek V4.1P — en de eigen nadruk van de auteur ligt niet op een van de vlaggenschipnamen, maar op een vermoeden over de rekenkunde achter K4: dat het misschien minder parameters activeert dan het model dat het vervangt. Die bewering is niet geverifieerd. Er is geen Kimi K4-modelkaart, geen gewichten, geen API-identifier, geen prijs en geen route, en hetzelfde geldt voor elke Z.ai-naam in de lijst. Wat nu de moeite waard is, is uitzoeken welke van deze beweringen controleerbaar zouden zijn, hoe de uitgebrachte baseline eruitziet, en wat een schaarsere K4 daadwerkelijk zou betekenen.
Het signaal, en zijn
Dit is een vroeg signaal, en het moet als zodanig worden gelezen. De post die het bevat is een interpretatie van naamgevingsconventies voor modellen, niet een verslag van een waarneming: hij markeert "GLM-5.5 Flash, GLM-5.4" als interessante nomenclatuur en noemt Kimi K4 "heel vreemd", en biedt vervolgens een speculatief mechanisme — minder geactiveerde experts — zonder te beweren een config, een checkpoint-lijst of een staging-endpoint te hebben gezien.
Niets in het openbare dossier weerspreekt de namen, en niets bevestigt ze ook. Die asymmetrie is normaal voor deze fase van een releasecyclus, en precies daarom is de nuttige stap om de baseline en de tests vast te leggen, niet om verder te speculeren. Een naam in een post is een hypothese over een product, niet het bewijs ervan.
De baseline waartegen een Kimi K4 zou worden afgemeten
Kimi K3 is echt, uitgebracht en ongewoon goed gedocumenteerd, wat het een solide referentiepunt maakt. Moonshots eigen modelkaart beschrijft een Mixture-of-Experts-model met 2,8 biljoen parameters dat per token 104 miljard parameters activeert, verdeeld over 93 lagen — één dense laag en 92 sparse lagen. De sparsiteit is agressief en wordt ronduit vermeld: 16 van de 896 experts worden per token geactiveerd, bovenop 2 gedeelde experts, wat Moonshot toeschrijft aan een verbetering van ongeveer 2,5× in schaalefficiëntie ten opzichte van Kimi K2.
De attention-stack is waar K3 breekt met de vorige generatie. Van de 92 sparse lagen gebruiken 69 Kimi Delta Attention — een hybride lineair-aandachtsmechanisme — en 24 gebruiken gated MLA, een 3:1-verdeling die een minderheid van full-attention-lagen behoudt en de rest naar het goedkopere lineaire pad duwt. Lagen hebben elke 12 blokken een attention-residu, de activatiefunctie is SiTU-GLU, en het hele model wordt getraind met MXFP4-gewichten en MXFP8-activaties onder kwantisatiebewuste training. Contextlengte is 1.048.576 tokens, vocabulairegrootte is 163.840, en vision loopt via een MoonViT-V2-encoder met 401M parameters, waardoor K3 native beeldverwerking ondersteunt in plaats van multimodaal via een bolt-on.

Dat zijn de cijfers die een opvolger moet verzetten. Let op wat ze impliceren over het idee van "minder actieve parameters": K3 is al een buitengewoon sparse model. Het activeert per token ongeveer 3,7% van zijn totale aantal parameters. Een K4 die minder dan 104B activeert, zou geen vet wegsnijden uit een overgeprovisioneerd ontwerp — hij zou een sparsityratio terugdraaien die Moonshot publiekelijk als een overwinning heeft gepresenteerd, en dat zou hij doen in de generatie waarin de rest van het veld de andere kant op gaat.
Wat 'minder actieve parameters' zou betekenen als het waar is
Er zijn twee lezingen beschikbaar en ze wijzen in tegengestelde richtingen. De welwillende lezing is architecturaal: Moonshot zou de KDA-hybride verder kunnen uitbreiden, meer full-attentionlagen vervangen door lineaire lagen en het expertbudget opnieuw kunnen balanceren, zodat een lager activeringsaantal een langere context, een goedkopere serving-voetafdruk of een betere kwaliteit-per-flop-verhouding oplevert. Volgens die lezing is een kleiner aantal actieve parameters een verfijning van dezelfde these die K3 al stelt — dat sparsity een schaalstrategie is, geen compromis.
De andere lezing is dat K4 helemaal geen uniforme opvolger is. De productlijn van Kimi heeft dit jaar al een vertakking gekend, en rapporten hebben op uiteenlopende manieren gezinspeeld op K3.1, K3.2 en K4 als drie verschillende producten. Een K4 die minder activeert dan K3, in een familie die met een aparte codeervariant komt, is minstens even consistent met een herpositionering als met een gewone upgrade. Beide lezingen zijn speculatie. Geen van beide wordt door een post beslecht.
Er is ook een licentiedimensie die niemand heeft behandeld. De gewichten van K3 worden vrijgegeven onder de Kimi K3 License, een aangepaste 'andere' licentie in plaats van een standaard open-sourcelicentie, en het is het eerste open 3T-klassemodel. Of een schaarsere K4 die licentie erft, of die versmalt, is voor iedereen die op de gewichten voortbouwt belangrijker dan een paar punten indexscore.

De andere drie namen in hetzelfde bericht
GLM-5.5 Flash en GLM-5.4 vormen het verrassendere duo, en niet vanwege de cijfers. Het gepubliceerde plafond van Z.ai is GLM-5.3, dat op 14 augustus 2026 verscheen met 743B parameters, waarna GLM-5.3-Flash op 26 augustus volgde en de BF16- en Flash-BF16-gewichten op 25 augustus werden vrijgegeven. Z.ai's eigen documentatie vermeldt precies drie actuele model-identificaties: glm-5.3, glm-5.3-flash en glm-5.2. Er is geen GLM-5.4, geen GLM-5.5 en geen GLM-5.5 Flash — en de richting van de naamgeving is het vreemde deel, want een 5.5-generatie die aan een 5.4-generatie voorafgaat, is niet hoe Z.ai ooit een familie heeft genummerd. Versienummers die in een lek buiten de volgorde opduiken, zijn een bekend faalpatroon: het zijn meestal aangrenzende producten, interne codenamen of een aanduiding van een serveerlaag in plaats van een nieuw basismodel.
DeepSeek V4.1P is de naam waarin de auteur van het signaal zegt het meest geïnteresseerd te zijn, en het is de gemakkelijkste van de vier om te controleren. De API-documentatie van DeepSeek noemt precies twee huidige modelstrings: deepseek-flash en deepseek-v4-pro. Het achtervoegsel "P" heeft geen tegenhanger in enige DeepSeek-identifier, en de meest recente release van gewichten in DeepSeek's eigen organisatie is DeepSeek-V4.1-Flash, gepubliceerd op 10 september 2026. Een V4.1P zou het meest plausibel een Pro-tier broer of zus van dat model zijn — maar "het meest plausibel" is een gok over een string, niet over een product.
Hoe zou je weten dat ook maar iets hiervan echt is?
De vier namen falen op dezelfde manier voor dezelfde test, waardoor het wachten eerder eenvoudig dan martelend is. Een echte release laat artefacten achter, en elk daarvan is eenvoudig te controleren:
• Een modelkaart in de eigen Hugging Face-organisatie van de leverancier. De nieuwste toevoeging van Moonshot is Kimi-K3, aangemaakt op 13 juni 2026; de nieuwste van Z.ai is de GLM-5.3-familie van 25 augustus; de nieuwste van DeepSeek is DeepSeek-V4.1-Flash van 10 september. In geen van de drie bestaat er iets nieuwers.
• Een configuratie die de discussie beslecht. Voor K4 specifiek zijn de velden waarnaar je moet zoeken num_experts en num_experts_per_token — K3's waarden zijn 896 en 16. Een K4-configuratie met een lager aantal per token is de bewering in deze lek die in één bestand wordt bevestigd of weerlegd.
• Een routeerbaar model. Een naam die in een catalogus staat, is een naam met een prijs, een contextvenster en een provider erachter; een naam die alleen in een post staat, heeft geen van die dingen.

Wat je vandaag kunt routeren
De praktische kant van dit lek is dat de generatie die het beschrijft niet is waarop je kunt bouwen. Wat live is, is de vorige, en de taak van de router is om de kloof tussen generaties een routingbeslissing te maken in plaats van een migratieproject. Kimi K3 is nu beschikbaar met zijn volledige context van 1M tokens en native vision, geprijsd op $3,00 per miljoen inputtokens en $15,00 per miljoen outputtokens, met cache-reads tegen $0,30 — gefactureerd tegen het tarief van de provider zonder opslag, waardoor een prijswijziging van de leverancier op K3 dezelfde dag op je factuur doorwerkt in plaats van bij de volgende herprijzingsronde. Kimi K3 op OrcaRouter bevat de volledige specificatielijst en het actuele tarief.
Hetzelfde geldt voor de rest van het aanbod. GLM-5.3, GLM-5.3-Flash en DeepSeek V4.1 Flash zijn allemaal routeerbaar naast Kimi K3, via één OpenAI-compatibel endpoint dat 200+ modellen dekt, met automatische failover wanneer een provider verslechtert en een routing-DSL om voorkeuren uit te drukken — kostenplafonds, kwaliteitsondergrenzen, latentiebudgetten — als beleid in plaats van logica per aanroep. Wanneer een Kimi K4, GLM-5.5 Flash of DeepSeek V4.1P verschijnt, is de migratie een stringwijziging in het routingbeleid en niets anders. Met model fusion kun je de uitvoer van meerdere modellen op hetzelfde endpoint combineren wanneer een taak daarbij baat heeft.
Om expliciet te zijn over wat dat niet is: geen van de vier gelekte namen is vandaag een route op OrcaRouter. We hosten ze niet en kunnen ze niet serveren.
Kortom
De interessante bewering hier is niet de versienummers. Het is het mechanisme — een vlaggenschip van de volgende generatie dat minder parameters activeert dan zijn voorganger, zou de bewering zijn dat Moonshot gelooft dat sparsity, niet het ruwe aantal activaties, de as is die het waard is om op door te duwen, en de 16-van-896 expert-split van K3 is al een argument in die richting. Elk onderdeel van de bewering is niet geverifieerd: Kimi K4, GLM-5.5 Flash, GLM-5.4 en DeepSeek V4.1P hebben geen modelkaarten, geen gewichten, geen API-identificaties en geen prijzen, en de eigen catalogi van de leveranciers stoppen in elk van deze gevallen een generatie eerder. Beschouw de namen als een voorproefje op een vraag, niet als een antwoord — en als je vandaag open gewichten van frontierklasse bij 1M context nodig hebt, is Kimi K3 het model dat al bestaat.
Wanneer een Kimi K4 eenmaal arriveert, automatische failoverwat voorkomt dat de migratie een incident wordt
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
