Eine generierte Titelkarte mit der Aufschrift „Kimi K4“ und dem Untertitel „was das Leak aussagt und was nicht“, ein LEAK-/UNVERIFIED-Badge, drei untereinander stehende Zeilen mit der Aufschrift „Keine Modellkarte“, „Keine Gewichte“ und „Kein Preis oder Route“ sowie eine Fußzeile „Stand: 25. September 2026“, mit dem OrcaRouter-Logo in der unteren rechten Ecke eingefügt.
Guides & Insights

Kimi K4: Was das Leak tatsächlich behauptet – und warum „weniger aktive Parameter" die eigentliche Geschichte wären

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ein einzelner Post hat vier nicht angekündigte Modellnamen auf einmal in Umlauf gebracht. Die Liste beginnt mit Kimi K4, der vermeintlichen nächsten Generation von Moonshot AI, zusammen mit GLM-5.5 Flash und GLM-5.4 von Z.ai sowie DeepSeek V4.1P — und die Betonung des Autors liegt nicht auf einem der Flaggschiff-Namen, sondern auf einem Verdacht bezüglich der Arithmetik hinter K4: dass es möglicherweise weniger Parameter aktiviert als das Modell, das es ersetzt. Diese Behauptung ist unbestätigt. Es gibt keine Kimi K4 Model Card, keine Gewichte, keine API-Kennung, keinen Preis und keine Route, und dasselbe gilt für jeden Z.ai-Namen in der Liste. Was jetzt sinnvoll ist, ist herauszufinden, welche dieser Behauptungen überprüfbar wären, wie die ausgelieferte Baseline aussieht und was ein sparsameres K4 tatsächlich bedeuten würde.

Das Signal und seine Stufe

Dies ist ein frühes Signal, und es sollte als ein solches gelesen werden. Der Beitrag, der es trägt, ist eine Deutung der Modellnamenskonventionen und kein Bericht über eine Sichtung: Er bezeichnet „GLM-5.5 Flash, GLM-5.4“ als interessante Namensgebung und nennt Kimi K4 „sehr seltsam“, bietet dann einen spekulativen Mechanismus — weniger aktivierte Experten —, ohne zu behaupten, eine Konfiguration, eine Checkpoint-Auflistung oder einen Staging-Endpunkt gesehen zu haben.

Nichts in den öffentlichen Aufzeichnungen widerspricht den Namen, und nichts untermauert sie auch. Diese Asymmetrie ist normal für diese Phase eines Release-Zyklus, und genau deshalb besteht der sinnvolle Schritt darin, die Baseline und die Tests zu korrigieren, anstatt weiter zu spekulieren. Ein Name in einem Beitrag ist eine Hypothese über ein Produkt, kein Beweis für dessen Existenz.

Die Vergleichsbasis, an der ein Kimi K4 gemessen würde

Kimi K3 ist real, ausgeliefert und ungewöhnlich gut dokumentiert, was es zu einem festen Referenzpunkt macht. Moonshots eigene Modellkarte beschreibt ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern, das pro Token 104B Parameter aktiviert, verteilt über 93 Schichten – eine dichte Schicht und 92 dünn besetzte. Die Sparsity ist aggressiv und wird klar angegeben: 16 von 896 Experten feuern pro Token, zusätzlich zu 2 geteilten Experten, was Moonshot eine etwa 2,5-fache Verbesserung der Skalierungseffizienz gegenüber Kimi K2 zuschreibt.

Der Attention-Stack ist der Punkt, an dem K3 mit der vorherigen Generation bricht. Von seinen 92 Sparse-Layern verwenden 69 K​imi Delta Attention – einen hybriden Linear-Attention-Mechanismus – und 24 nutzen gated MLA, eine 3:1-Aufteilung, die eine Minderheit von Full-Attention-Layern beibehält und den Rest auf den günstigeren linearen Pfad verlagert. Layer tragen alle 12 Blöcke ein Attention-Residual, die Aktivierungsfunktion ist SiTU-GLU, und das gesamte Modell wird mit MXFP4-Gewichten und MXFP8-Aktivierungen unter Quantization-Aware Training trainiert. Die Kontextlänge beträgt 1.048.576 Token, die Vokabulargröße beträgt 163.840, und Vision läuft über einen MoonViT-V2-Encoder mit 401M Parametern, wodurch K3 nativ bildfähig ist und nicht durch Bolt-on multimodal.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

Das sind die Zahlen, die ein Nachfolger vorweisen muss. Man beachte, was sie für die Idee „weniger aktive Parameter“ bedeuten: K3 ist bereits ein außergewöhnlich dünn besetztes Modell. Es aktiviert pro Token etwa 3,7 % seiner gesamten Parameterzahl. Ein K4, der weniger als 104B aktiviert, würde nicht Fett aus einem überdimensionierten Design wegschneiden – er würde ein Sparsitätsverhältnis zurücknehmen, das Moonshot öffentlich als Erfolg dargestellt hat, und das in der Generation, in der der Rest des Feldes genau die entgegengesetzte Richtung einschlägt.

Was „weniger aktive Parameter“ bedeuten würde, wenn es zutrifft

Zwei Lesarten sind verfügbar, und sie deuten in entgegengesetzte Richtungen. Die wohlwollende ist architektonisch: Moonshot könnte den KDA-Hybrid weiter ausbauen, weitere Full-Attention-Schichten durch lineare ersetzen und das Expertenbudget neu ausbalancieren, sodass eine geringere Aktivierungszahl einen längeren Kontext, einen günstigeren Serving-Footprint oder ein besseres Qualität-pro-Flop-Verhältnis erkauft. Unter dieser Lesart ist eine geringere Zahl aktiver Parameter eine Verfeinerung derselben These, die K3 bereits formuliert – dass Sparsity eine Skalierungsstrategie ist, kein Kompromiss.

Die andere Lesart ist, dass K4 überhaupt kein einheitlicher Nachfolger ist. Kimis Linie hat sich in diesem Jahr bereits einmal verzweigt, und Berichte haben verschiedentlich auf K3.1, K3.2 und K4 als drei verschiedene Produkte hingedeutet. Ein K4, der weniger aktiviert als K3 – in einer Familie, die eine separate Coding-Variante ausliefert –, ist mindestens ebenso gut mit einer Neupositionierung vereinbar wie mit einem reinen Upgrade. Beide Lesarten sind Spekulation. Keine von beiden wird durch einen Post entschieden.

Es gibt außerdem eine Lizenzdimension, die niemand angesprochen hat. Die Gewichte von K3 werden unter der Kimi K3 License veröffentlicht, einer benutzerdefinierten „sonstigen“ Lizenz statt einer standardmäßigen Open-Source-Lizenz, und es ist das erste offene Modell der 3T-Klasse. Ob ein sparsameres K4 diese Lizenz erbt oder sie einschränkt, ist für alle, die auf den Gewichten aufbauen, wichtiger als ein paar Punkte beim Index-Score.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

Die anderen drei Namen im selben Beitrag

GLM-5.5 Flash und GLM-5.4 sind das überraschendere Paar – und zwar nicht wegen der Zahlen. Die von Z.ai veröffentlichte Obergrenze ist GLM-5.3, das am 14. August 2026 mit 743B Parametern erschien, gefolgt von GLM-5.3-Flash am 26. August, während die Veröffentlichungen der BF16- und Flash-BF16-Gewichte auf den 25. August fielen. Die eigene Dokumentation von Z.ai listet genau drei aktuelle Modell-IDs auf: glm-5.3, glm-5.3-flash und glm-5.2. Es gibt kein GLM-5.4, kein GLM-5.5 und kein GLM-5.5 Flash – und die Namensrichtung ist das Seltsame daran, denn eine 5.5-Generation, die einer 5.4-Generation vorausgeht, entspricht nicht der Art und Weise, wie Z.ai jemals eine Familie nummeriert hat. Versionsnummern, die in einem Leak in falscher Reihenfolge auftauchen, sind ein bekanntes Fehlermuster: Meist handelt es sich um benachbarte Produkte, interne Codenamen oder eine Bezeichnung für eine Serving-Stufe statt um ein neues Basismodell.

D​eepSeek V4.1P ist der Name, für den sich der Autor des Signals nach eigenen Angaben am meisten interessiert, und er ist von den vier am einfachsten zu überprüfen. Die API-Dokumentation von D​eepSeek nennt genau zwei aktuelle Modell-Strings: deepseek-flash und deepseek-v4-pro. Das Suffix „P“ hat in keiner D​eepSeek-Kennung eine Entsprechung, und die jüngste Veröffentlichung von Gewichten in D​eepSeeks eigener Organisation ist DeepSeek-V4.1-Flash, veröffentlicht am 10. September 2026. Ein V4.1P wäre am plausibelsten ein Geschwistermodell der Pro-Stufe dieses Modells – aber „am plausibelsten“ ist eine Vermutung über eine Zeichenkette, nicht über ein Produkt.

Wie würdest du wissen, dass irgendetwas davon echt ist?

Die vier Namen scheitern auf dieselbe Weise an demselben Test, was das Warten unkompliziert statt qualvoll macht. Ein echtes Release hinterlässt Artefakte, und jedes davon ist mit geringem Aufwand zu prüfen:

• Eine Modellkarte in der eigenen Hugging-Face-Organisation des Anbieters. Moonshots neuester Eintrag ist Kimi-K3, erstellt am 13. Juni 2026; Z.ais neueste sind die GLM-5.3-Familie vom 25. August; DeepSeeks neueste ist DeepSeek-V4.1-Flash vom 10. September. In keinem der drei existiert etwas Neueres.

• Eine Konfiguration, die die Debatte entscheidet. Bei K4 sind speziell die Felder zu suchen: num_experts und num_experts_per_token — bei K3 lauten sie 896 und 16. Eine K4-Konfiguration mit einer niedrigeren Pro-Token-Zahl ist die Behauptung in diesem Leak, die in einer einzigen Datei bestätigt oder widerlegt wird.

• Ein routbares Modell. Ein Name, der in einem Katalog erscheint, ist ein Name mit einem Preis, einem Kontextfenster und einem Anbieter dahinter; ein Name, der nur in einem Beitrag vorkommt, hat nichts davon.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Was Sie heute routen können

Die praktische Seite dieses Leaks ist, dass die Generation, die er beschreibt, nicht das ist, worauf man aufbauen kann. Live ist die vorherige, und die Aufgabe des Routers besteht darin, die Lücke zwischen den Generationen zu einer Routing-Entscheidung zu machen statt zu einem Migrationsprojekt. Kimi K3 ist jetzt verfügbar, mit seinem vollständigen Kontext von 1 Mio. Token und nativer Vision, zu einem Preis von 3,00 $ pro Million Input-Token und 15,00 $ pro Million Output-Token, mit Cache-Reads zu 0,30 $ — abgerechnet zum Anbieterpreis ohne Aufschlag, weshalb eine Preisänderung des Anbieters bei K3 noch am selben Tag auf Ihrer Rechnung landet und nicht erst im nächsten Preisanpassungszyklus. Kimi K3 auf OrcaRouter enthält das vollständige Datenblatt und den aktuellen Tarif.

Dasselbe gilt für den Rest des Boards. GLM-5.3, GLM-5.3-Flash und DeepSeek V4.1 Flash sind alle neben Kimi K3 über einen einzigen OpenAI-kompatiblen Endpunkt routbar, der über 200 Modelle abdeckt – mit automatischem Failover, wenn ein Anbieter schwächelt, und einer Routing-DSL, mit der sich Präferenzen – Kostenobergrenzen, Qualitätsuntergrenzen, Latenzbudgets – als Policy statt als Logik pro Aufruf ausdrücken lassen. Wenn ein K​imi K4, GLM-5.5 Flash oder D​eepSeek V4.1P erscheint, ist die Migration eine String-Änderung in der Routing-Policy und sonst nichts. Modell-Fusion ermöglicht es, die Ausgaben mehrerer Modelle am selben Endpunkt zu kombinieren, wenn eine Aufgabe davon profitiert.

Um explizit klarzustellen, was das nicht ist: Keiner der vier geleakten Namen ist heute eine Route auf OrcaRouter. Wir hosten sie nicht und können sie nicht ausliefern.

Fazit

Bei der interessanten Behauptung hier geht es nicht um die Versionsnummern. Es geht um den Mechanismus – ein Flaggschiff der nächsten Generation, das weniger Parameter als sein Vorgänger aktiviert, wäre eine Aussage, dass Moonshot glaubt, dass nicht die rohe Aktivierungsanzahl, sondern Sparsität die Achse sei, die es voranzutreiben gilt, und K3s 16-von-896-Expertenaufteilung ist bereits ein Argument in diese Richtung. Jeder Teil der Behauptung ist unbestätigt: Kimi K4, GLM-5.5 Flash, GLM-5.4 und DeepSeek V4.1P haben keine Modellkarten, keine Gewichte, keine API-Identifikatoren und keine Preise, und die eigenen Kataloge der Anbieter enden in jedem Fall eine Generation früher. Betrachten Sie die Namen als Vorschau auf eine Frage, nicht als Antwort – und wenn Sie heute offene Gewichte der Frontier-Klasse bei 1M Kontext benötigen, ist Kimi K3 das Modell, das bereits existiert.

Wenn ein ​Kimi K4 dann tatsächlich eintrifft, automatisches Failover ist das, was die Migration davor bewahrt, zu einem Incident zu werden

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert