Une carte de titre générée affichant « Kimi K4 » avec le sous-titre « ce que dit la fuite, et ce qu'elle ne dit pas », un badge FUITE / NON VÉRIFIÉ, trois lignes empilées indiquant « Pas de fiche modèle », « Pas de poids » et « Pas de prix ni de route », et une ligne de pied de page « En date du 25 septembre 2026 », avec le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

Kimi K4 : ce que la fuite affirme réellement, et pourquoi « moins de paramètres actifs » serait la véritable histoire

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Un seul post a mis en circulation quatre noms de modèles non annoncés d'un coup. La liste commence par K​imi K4, la supposée prochaine génération de Moonshot AI, aux côtés de GLM-5.5 Flash et GLM-5.4 de Z.ai et D​eepSeek V4.1P — et l'accent mis par l'auteur lui-même ne porte sur aucun des noms phares, mais sur un soupçon concernant l'arithmétique sous-jacente à K4 : qu'il pourrait activer moins de paramètres que le modèle qu'il remplace. Cette affirmation n'est pas vérifiée. Il n'existe pas de fiche de modèle K​imi K4, pas de poids, pas d'identifiant d'API, pas de prix et pas de route, et il en va de même pour chaque nom de Z.ai dans la liste. Ce qu'il vaut la peine de faire maintenant, c'est de déterminer lesquelles de ces affirmations seraient vérifiables, à quoi ressemble la référence livrée, et ce qu'un K4 plus clairsemé signifierait réellement.

Le signal, et son niveau

C'est un signal précoce, et il faut le lire comme tel. Le billet qui le porte relève d'une lecture des conventions de nommage des modèles plutôt que d'un signalement d'observation : il signale « GLM-5.5 Flash, GLM-5.4 » comme une nomenclature intéressante et qualifie Kimi K4 de « très étrange », puis avance un mécanisme spéculatif — moins d'experts activés — sans prétendre avoir vu une configuration, une liste de checkpoints ou un endpoint de staging.

Rien dans les informations publiques ne contredit ces noms, et rien ne les corrobore non plus. Cette asymétrie est normale à ce stade d’un cycle de publication, et c’est exactement pourquoi la démarche utile consiste à corriger la base de référence et les tests, plutôt qu’à spéculer davantage. Un nom dans un billet est une hypothèse sur un produit, pas une preuve de son existence.

La référence à laquelle un Kimi K4 serait comparé

Kimi K3 est réel, livré, et exceptionnellement bien documenté, ce qui en fait un point de référence solide. La fiche modèle de Moonshot décrit un modèle Mixture-of-Experts de 2,8 billions de paramètres qui active 104 milliards de paramètres par token, répartis sur 93 couches — une couche dense et 92 creuses. La parcimonie est agressive et énoncée sans détour : 16 experts sur 896 s'activent par token, en plus de 2 experts partagés, ce que Moonshot crédite d'une amélioration d'environ 2,5× de l'efficacité de mise à l'échelle par rapport à Kimi K2.

La pile d'attention est l'endroit où K3 rompt avec la génération précédente. Sur ses 92 couches clairsemées, 69 utilisent Kimi Delta Attention — un mécanisme d'attention linéaire hybride — et 24 utilisent MLA à portes, une répartition 3:1 qui conserve une minorité de couches d'attention complète et pousse le reste sur le chemin linéaire moins coûteux. Les couches comportent un résidu d'attention tous les 12 blocs, la fonction d'activation est SiTU-GLU, et le modèle entier est entraîné avec des poids MXFP4 et des activations MXFP8 dans le cadre d'un entraînement conscient de la quantification. La longueur de contexte est de 1 048 576 jetons, le vocabulaire est de 163 840, et la vision passe par un encodeur MoonViT-V2 de 401 M de paramètres, ce qui rend K3 nativement capable de traiter des images plutôt que multimodal par ajout.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

Voilà les chiffres qu’un successeur doit faire bouger. Notez ce qu’ils impliquent pour l’idée de « moins de paramètres actifs » : K3 est déjà un modèle extraordinairement sparse. Il active environ 3,7 % de son nombre total de paramètres par token. Un K4 qui activerait moins de 104B ne serait pas en train de couper le gras d’une conception surdimensionnée — il reviendrait sur un taux de parcimonie que Moonshot a publiquement présenté comme une victoire, et il le ferait dans la génération où le reste du domaine va dans l’autre sens.

Ce que « moins de paramètres actifs » signifierait si c’était vrai

Deux lectures sont possibles et elles pointent dans des directions opposées. La lecture charitable est architecturale : Moonshot pourrait étendre davantage l’hybride KDA, remplacer davantage de couches d’attention complète par des couches linéaires et rééquilibrer le budget des experts afin qu’un nombre d’activations plus faible achète un contexte plus long, une empreinte de service moins coûteuse, ou un meilleur rapport qualité/FLOP. Dans cette lecture, moins de paramètres actifs est un raffinement de la même thèse que K3 énonce déjà — que la sparsité est une stratégie de mise à l’échelle, et non un compromis.

L'autre lecture est que le K4 n'est pas du tout un successeur uniforme. La lignée de Kimi s'est déjà ramifiée une fois cette année, et des rapports ont diversement évoqué K3.1, K3.2 et K4 comme trois produits différents. Un K4 qui active moins que le K3, dans une famille qui propose une variante de codage distincte, est au moins aussi cohérent avec un repositionnement qu'avec une simple mise à niveau. Les deux lectures sont des spéculations. Ni l'une ni l'autre n'est tranchée par un post.

Il y a aussi une dimension de licence que personne n’a abordée. Les poids de K3 sont publiés sous la licence Kimi K3, une licence personnalisée « autre » plutôt qu’une licence open source standard, et il s’agit du premier modèle ouvert de classe 3T. Qu’un K4 plus clairsemé hérite de cette licence, ou la restreigne, compte davantage pour quiconque construit sur ces poids que quelques points de score d’indice.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

Les trois autres noms dans la même publication

GLM-5.5 Flash et GLM-5.4 forment la paire la plus surprenante, et ce n'est pas à cause des chiffres. Le plafond publié par Z.ai est GLM-5.3, livré le 14 août 2026 avec 743 milliards de paramètres, GLM-5.3-Flash ayant suivi le 26 août et les publications de poids BF16 et Flash-BF16 étant arrivées le 25 août. La documentation de Z.ai elle-même ne répertorie que trois identifiants de modèle actuels : glm-5.3, glm-5.3-flash et glm-5.2. Il n'existe pas de GLM-5.4, ni de GLM-5.5, ni de GLM-5.5 Flash — et c'est le sens du nommage qui est étrange, car une génération 5.5 précédant une 5.4 n'est pas de cette façon que Z.ai a jamais numéroté une famille. Des numéros de version apparaissant dans le désordre dans une fuite constituent un mode d'échec bien connu : il s'agit généralement de produits adjacents, de noms de code internes ou d'un libellé de niveau de service plutôt que d'un nouveau modèle de base.

DeepSeek V4.1P est le nom auquel l'auteur du signal déclare s'intéresser le plus, et c'est le plus facile des quatre à vérifier. La documentation de l'API de DeepSeek nomme exactement deux chaînes de modèles actuelles : deepseek-flash et deepseek-v4-pro. Le suffixe « P » n'a d'équivalent dans aucun identifiant DeepSeek, et la publication de poids la plus récente au sein de l'organisation DeepSeek elle-même est DeepSeek-V4.1-Flash, publiée le 10 septembre 2026. Un V4.1P serait, selon toute vraisemblance, un modèle frère de gamme Pro de celui-ci — mais « selon toute vraisemblance » est une supposition à propos d'une chaîne, pas d'un produit.

Comment saurais-tu que tout cela est réel ?

Les quatre noms échouent au même test de la même manière, ce qui rend l’attente simple plutôt qu’angoissante. Une vraie sortie laisse des artefacts, et chacun d’eux est peu coûteux à vérifier :

• Une carte de modèle dans l’organisation Hugging Face propre au fournisseur. La dernière entrée de Moonshot est Kimi-K3, créée le 13 juin 2026 ; les nouveautés les plus récentes de Z.ai sont la famille GLM-5.3 du 25 août ; la plus récente de DeepSeek est DeepSeek-V4.1-Flash du 10 septembre. Rien de plus récent n’existe chez aucun des trois.

• Une configuration qui tranche le débat. Pour K4 spécifiquement, les champs à rechercher sont num_experts et num_experts_per_token — ceux de K3 affichent 896 et 16. Une configuration K4 avec un chiffre par token inférieur est la revendication de cette fuite, confirmée ou réfutée dans un seul fichier.

• Un modèle routable. Un nom qui apparaît dans un catalogue est un nom avec un prix, une fenêtre de contexte et un fournisseur derrière lui ; un nom qui n’est présent que dans un post ne possède rien de tout cela.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Ce que vous pouvez router aujourd'hui

La version pratique de cette fuite, c'est que la génération qu'elle décrit n'est pas celle sur laquelle vous pouvez bâtir. Ce qui est en production, c'est la précédente, et le rôle du routeur est de faire de l'écart entre les générations une décision de routage plutôt qu'un projet de migration. Kimi K3 est disponible dès maintenant avec son contexte complet de 1 M de tokens et sa vision native, au tarif de 3,00 $ par million de tokens d'entrée et de 15,00 $ par million de tokens de sortie, les lectures de cache étant à 0,30 $ — facturé au tarif du fournisseur sans marge, ce qui explique qu'un changement de prix du fournisseur sur K3 se répercute sur votre facture le jour même plutôt qu'au prochain cycle de réévaluation. Kimi K3 sur OrcaRouter présente la fiche technique complète et le tarif actuel.

Il en va de même pour le reste de la gamme. GLM-5.3, GLM-5.3-Flash et DeepSeek V4.1 Flash sont tous routables aux côtés de Kimi K3, via un unique point de terminaison compatible OpenAI couvrant plus de 200 modèles, avec bascule automatique dès qu'un fournisseur se dégrade et un DSL de routage permettant d'exprimer vos préférences — plafonds de coût, seuils de qualité, budgets de latence — sous forme de politique plutôt que de logique propre à chaque appel. Lorsqu'un Kimi K4, GLM-5.5 Flash ou DeepSeek V4.1P fait son apparition, la migration se résume à une modification de chaîne dans la politique de routage, et à rien d'autre. La fusion de modèles vous permet de combiner les sorties de plusieurs modèles sur le même point de terminaison lorsqu'une tâche y gagne.

Pour être explicite sur ce que cela n’est pas : aucun des quatre noms divulgués n’est une route sur OrcaRouter aujourd’hui. Nous ne les hébergeons pas et ne pouvons pas les servir.

En résumé

La revendication intéressante ici n'est pas les numéros de version. C'est le mécanisme — un modèle phare de nouvelle génération qui active moins deparamètres que son prédécesseur serait l'affirmation que Moonshot estime que c'est la parcimonie, et non le nombre brut d'activations, qui constitue l'axe qu'il vaut la peine de pousser, et la répartition en 16 experts sur 896 de K3 plaide déjà en ce sens. Chaque élément de cette affirmation est non vérifié : K​imi K4, GLM-5.5 Flash, GLM-5.4 et D​eepSeek V4.1P n'ont ni fiches de modèle, ni poids, ni identifiants d'API, ni tarifs, et les catalogues des éditeurs eux-mêmes s'arrêtent une génération plus tôt dans chaque cas. Considérez ces noms comme l'annonce d'une question, non d'une réponse — et si vous avez besoin dès aujourd'hui de poids ouverts de classe frontière avec un contexte de 1M, Kimi K3 est le modèle qui existe déjà.

Quand un K​imi K4 finira par arriver, le basculement automatique est ce qui empêche la migration de se transformer en incident