
Kimi K4: vad läckan faktiskt påstår, och varför "färre aktiva parametrar" skulle vara den egentliga nyheten
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 506 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 183 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Ett enda inlägg har satt fyra omeddelade modellnamn i omlopp på en gång. Listan börjar med Kimi K4, den påstådda nästa generationen från Moonshot AI, sida vid sida med GLM-5.5 Flash och GLM-5.4 från Z.ai och DeepSeek V4.1P — och författarens egen betoning ligger inte på något av flaggskeppsnamnen utan på en misstanke om aritmetiken bakom K4: att den kan aktivera färre parametrar än modellen den ersätter. Det påståendet är overifierat. Det finns inget modellkort för Kimi K4, inga vikter, ingen API-identifierare, inget pris och ingen väg, och detsamma gäller varje Z.ai-namn i listan. Det som är värt att göra nu är att ta reda på vilka av dessa påståenden som skulle gå att kontrollera, hur den levererade baslinjen ser ut och vad en glesare K4 faktiskt skulle innebära.
Signalen och dess nivå
Detta är en tidig signal, och den bör läsas som en sådan. Inlägget som förmedlar den är en tolkning av namngivningskonventioner för modeller snarare än en rapport om en observation: det lyfter fram "GLM-5.5 Flash, GLM-5.4" som intressant nomenklatur och kallar Kimi K4 för "mycket märklig", och erbjuder sedan en spekulativ mekanism – färre aktiverade experter – utan att hävda att ha sett en konfig, en checkpoint-listning eller en staging-endpoint.
Ingenting i de offentliga handlingarna motsäger namnen, och ingenting bekräftar dem heller. Den asymmetrin är normal för det här skedet av en releasecykel, och det är precis därför det användbara draget är att fastställa baslinjen och testerna, inte att spekulera vidare. Ett namn i ett inlägg är en hypotes om en produkt, inte ett bevis för en sådan.
Baslinjen som en Kimi K4 skulle mätas mot
Kimi K3 är på riktigt, har släppts och är ovanligt väl dokumenterad, vilket gör den till en fast referenspunkt. Moonshots eget modellkort beskriver en Mixture-of-Experts-modell med 2,8 biljoner parametrar som aktiverar 104B parametrar per token, fördelad över 93 lager – ett tätt lager och 92 glesa. Glesheten är aggressiv och anges rakt ut: 16 av 896 experter aktiveras per token, utöver 2 delade experter, vilket Moonshot tillskriver en förbättring av skalningseffektiviteten på ungefär 2,5× jämfört med Kimi K2.
Attention-stacken är där K3 bryter med den föregående generationen. Av dess 92 sparsa lager använder 69 Kimi Delta Attention – en hybridmekanism för linjär attention – och 24 använder gated MLA, en 3:1-uppdelning som behåller en minoritet av lager med full attention och flyttar resten till den billigare linjära vägen. Lager bär en attention-residual var 12:e block, aktiveringsfunktionen är SiTU-GLU, och hela modellen tränas med MXFP4-vikter och MXFP8-aktiveringar under kvantiseringsmedveten träning. Kontextlängden är 1 048 576 tokens, vokabulären är 163 840, och vision körs genom en MoonViT-V2-kodare med 401M parametrar, vilket ger K3 inbyggd bildkapacitet snarare än multimodalitet via påbyggnad.

Det är siffrorna en efterträdare måste flytta. Notera vad de antyder om idén om "färre aktiva parametrar": K3 är redan en synnerligen gles modell. Den aktiverar ungefär 3,7 % av sitt totala antal parametrar per token. En K4 som aktiverar färre än 104B skulle inte skära bort fett från en överdimensionerad design – den skulle backa från en gleshetsgrad som Moonshot offentligt har framställt som en vinst, och den skulle göra det i generationen där resten av fältet går i motsatt riktning.
Vad "färre parametrar" skulle innebära om det
Det finns två läsningar, och de pekar i motsatta riktningar. Den välvilliga är arkitektonisk: Moonshot skulle kunna utöka KDA-hybriden ytterligare, ersätta fler full-attention-lager med linjära sådana och ombalansera expertbudgeten så att ett lägre antal aktiveringar ger en längre kontext, ett billigare serveringsavtryck eller ett bättre kvalitet-per-flop-förhållande. Under den läsningen är färre aktiva parametrar en förfining av samma tes som K3 redan framför — att gleshet är en skalningsstrategi, inte en kompromiss.
Den andra tolkningen är att K4 inte alls är en enhetlig efterträdare. Kimis linje har redan förgrenats en gång i år, och rapporter har på olika sätt antytt K3.1, K3.2 och K4 som tre olika produkter. En K4 som aktiverar mindre än K3, i en familj som levererar en separat kodningsvariant, är minst lika förenlig med en ompositionering som med en ren uppgradering. Båda tolkningarna är spekulation. Ingen av dem avgörs av ett inlägg.
Det finns också en licensdimension som ingen har tagit upp. K3:s vikter släpps under Kimi K3 License, en anpassad "övrig" licens snarare än en standardlicens för öppen källkod, och det är den första öppna modellen i 3T-klassen. Huruvida en glesare K4 ärver den licensen, eller inskränker den, spelar större roll för alla som bygger på vikterna än några indexpoäng.

De andra tre namnen i samma inlägg
GLM-5.5 Flash och GLM-5.4är det mer överraskande paret, och inte på grund av siffrorna. Z.ai:s publicerade tak är GLM-5.3, som släpptes den 14 augusti 2026 med 743B parametrar, med GLM-5.3-Flash som följde den 26 augusti och BF16- och Flash-BF16-viktutgåvorna som landade den 25 augusti. Z.ai:s egen dokumentation listar exakt tre aktuella modellidentifierare: glm-5.3, glm-5.3-flash och glm-5.2. Det finns ingen GLM-5.4, ingen GLM-5.5 och ingen GLM-5.5 Flash – och namngivningsriktningen är det märkliga, eftersom en 5.5-generation som föregår en 5.4 inte är hur Z.ai någonsin har numrerat en familj. Versionsnummer som dyker upp i fel ordning i en läcka är ett välbekant felmönster: de tenderar att vara närliggande produkter, interna kodnamn eller en beteckning för en serving-nivå snarare än en ny basmodell.
DeepSeek V4.1P är namnet som signalens avsändare säger sig vara mest intresserad av, och det är det lättaste av de fyra att kontrollera. DeepSeeks API-dokumentation anger exakt två aktuella modellsträngar: deepseek-flash och deepseek-v4-pro. Suffixet "P" har ingen motsvarighet i någon DeepSeek-identifierare, och det senaste viktsläppet inom DeepSeeks egen organisation är DeepSeek-V4.1-Flash, som publicerades den 10 september 2026. En V4.1P skulle med största sannolikhet vara ett syskon på Pro-nivå till den modellen – men "med största sannolikhet" är en gissning om en sträng, inte en produkt.
Hur skulle du veta att något av det här är verkligt?
De fyra namnen misslyckas med samma test på samma sätt, vilket gör väntan enkel snarare än plågsam. En riktig release lämnar artefakter, och var och en av dem är billig att kontrollera:
• Ett modellkort i leverantörens egen Hugging Face-organisation. Moonshots nyaste är Kimi-K3, skapad 13 juni 2026; Z.ais nyaste är GLM-5.3-familjen från 25 augusti; DeepSeeks nyaste är DeepSeek-V4.1-Flash från 10 september. Inget nyare finns i någon av de tre.
• En konfiguration som avgör saken. För K4 specifikt är fälten att leta efter num_experts och num_experts_per_token — K3 visade 896 och 16. En K4-konfiguration med ett lägre värde per token är det som bekräftar eller motbevisar påståendet i denna läcka i en enda fil.
• En routbar modell. Ett namn som förekommer i en katalog är ett namn med ett pris, ett kontextfönster och en leverantör bakom sig; ett namn som bara finns i ett inlägg har inget av dessa.

Vad du kan dirigera idag
Den praktiska versionen av detta läckage är att generationen som det beskriver inte är något man kan bygga på. Det som är live är den föregående, och routerns uppgift är att göra gapet mellan generationer till ett routingbeslut i stället för ett migreringsprojekt. Kimi K3 är tillgänglig nu med sin fulla kontext på 1M tokens och inbyggd vision, prissatt till $3.00 per miljon indata-tokens och $15.00 per miljon utdata-tokens, med cacheläsningar på $0.30 — faktureras enligt leverantörens pris utan påslag, vilket är anledningen till att en prisändring från leverantören på K3 når din faktura samma dag i stället för vid nästa omprissättningscykel. Kimi K3 på OrcaRouter har hela specifikationen och aktuell taxa.
Detsamma gäller för resten av sortimentet. GLM-5.3, GLM-5.3-Flash och DeepSeek V4.1 Flash kan alla dirigeras vid sidan av Kimi K3, via en enda OpenAI-kompatibel slutpunkt som täcker 200+ modeller, med automatisk redundansväxling när en leverantör försämras och ett routing-DSL för att uttrycka preferenser – kostnadstak, kvalitetsgolv, latensbudgetar – som policy i stället för logik per anrop. När en Kimi K4, GLM-5.5 Flash eller DeepSeek V4.1P väl dyker upp är migreringen en strängändring i routingpolicyn och inget annat. Modellfusion låter dig kombinera utdata från flera modeller på samma slutpunkt när en uppgift drar nytta av det.
För att vara tydlig om vad det inte är: inget av de fyra läckta namnen är en route på OrcaRouter idag. Vi hostar dem inte och kan inte serva dem.
Slutsats
Det intressanta påståendet här är inte versionsnumren. Det är mekanismen – en flaggskeppsmodell för nästa generation som aktiverar färre parametrar än sin föregångare skulle vara ett uttalande om att Moonshot anser att gleshet, inte rått antal aktiveringar, är den axel som är värd att driva på, och K3:s expertuppdelning på 16 av 896 är redan ett argument i den riktningen. Varje del av påståendet är obekräftad: Kimi K4, GLM-5.5 Flash, GLM-5.4 och DeepSeek V4.1P har inga modellkort, inga vikter, inga API-identifierare och inga priser, och leverantörernas egna kataloger slutar en generation tidigare i samtliga fall. Betrakta namnen som en förhandsvisning av en fråga, inte ett svar – och om du behöver öppna vikter i frontier-klass med 1M kontext idag, är Kimi K3 modellen som redan finns.
När en Kimi K4 väl anländer, automatisk failover är det som hindrar migreringen från att bli en incident
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
