
Kimi K4 : ce que la fuite affirme réellement, et pourquoi « moins de paramètres actifs » serait la véritable histoire
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 506 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 183 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Un seul post a mis en circulation quatre noms de modèles non annoncés d'un coup. La liste commence par Kimi K4, la supposée prochaine génération de Moonshot AI, aux côtés de GLM-5.5 Flash et GLM-5.4 de Z.ai et DeepSeek V4.1P — et l'accent mis par l'auteur lui-même ne porte sur aucun des noms phares, mais sur un soupçon concernant l'arithmétique sous-jacente à K4 : qu'il pourrait activer moins de paramètres que le modèle qu'il remplace. Cette affirmation n'est pas vérifiée. Il n'existe pas de fiche de modèle Kimi K4, pas de poids, pas d'identifiant d'API, pas de prix et pas de route, et il en va de même pour chaque nom de Z.ai dans la liste. Ce qu'il vaut la peine de faire maintenant, c'est de déterminer lesquelles de ces affirmations seraient vérifiables, à quoi ressemble la référence livrée, et ce qu'un K4 plus clairsemé signifierait réellement.
Le signal, et son niveau
C'est un signal précoce, et il faut le lire comme tel. Le billet qui le porte relève d'une lecture des conventions de nommage des modèles plutôt que d'un signalement d'observation : il signale « GLM-5.5 Flash, GLM-5.4 » comme une nomenclature intéressante et qualifie Kimi K4 de « très étrange », puis avance un mécanisme spéculatif — moins d'experts activés — sans prétendre avoir vu une configuration, une liste de checkpoints ou un endpoint de staging.
Rien dans les informations publiques ne contredit ces noms, et rien ne les corrobore non plus. Cette asymétrie est normale à ce stade d’un cycle de publication, et c’est exactement pourquoi la démarche utile consiste à corriger la base de référence et les tests, plutôt qu’à spéculer davantage. Un nom dans un billet est une hypothèse sur un produit, pas une preuve de son existence.
La référence à laquelle un Kimi K4 serait comparé
Kimi K3 est réel, livré, et exceptionnellement bien documenté, ce qui en fait un point de référence solide. La fiche modèle de Moonshot décrit un modèle Mixture-of-Experts de 2,8 billions de paramètres qui active 104 milliards de paramètres par token, répartis sur 93 couches — une couche dense et 92 creuses. La parcimonie est agressive et énoncée sans détour : 16 experts sur 896 s'activent par token, en plus de 2 experts partagés, ce que Moonshot crédite d'une amélioration d'environ 2,5× de l'efficacité de mise à l'échelle par rapport à Kimi K2.
La pile d'attention est l'endroit où K3 rompt avec la génération précédente. Sur ses 92 couches clairsemées, 69 utilisent Kimi Delta Attention — un mécanisme d'attention linéaire hybride — et 24 utilisent MLA à portes, une répartition 3:1 qui conserve une minorité de couches d'attention complète et pousse le reste sur le chemin linéaire moins coûteux. Les couches comportent un résidu d'attention tous les 12 blocs, la fonction d'activation est SiTU-GLU, et le modèle entier est entraîné avec des poids MXFP4 et des activations MXFP8 dans le cadre d'un entraînement conscient de la quantification. La longueur de contexte est de 1 048 576 jetons, le vocabulaire est de 163 840, et la vision passe par un encodeur MoonViT-V2 de 401 M de paramètres, ce qui rend K3 nativement capable de traiter des images plutôt que multimodal par ajout.

Voilà les chiffres qu’un successeur doit faire bouger. Notez ce qu’ils impliquent pour l’idée de « moins de paramètres actifs » : K3 est déjà un modèle extraordinairement sparse. Il active environ 3,7 % de son nombre total de paramètres par token. Un K4 qui activerait moins de 104B ne serait pas en train de couper le gras d’une conception surdimensionnée — il reviendrait sur un taux de parcimonie que Moonshot a publiquement présenté comme une victoire, et il le ferait dans la génération où le reste du domaine va dans l’autre sens.
Ce que « moins de paramètres actifs » signifierait si c’était vrai
Deux lectures sont possibles et elles pointent dans des directions opposées. La lecture charitable est architecturale : Moonshot pourrait étendre davantage l’hybride KDA, remplacer davantage de couches d’attention complète par des couches linéaires et rééquilibrer le budget des experts afin qu’un nombre d’activations plus faible achète un contexte plus long, une empreinte de service moins coûteuse, ou un meilleur rapport qualité/FLOP. Dans cette lecture, moins de paramètres actifs est un raffinement de la même thèse que K3 énonce déjà — que la sparsité est une stratégie de mise à l’échelle, et non un compromis.
L'autre lecture est que le K4 n'est pas du tout un successeur uniforme. La lignée de Kimi s'est déjà ramifiée une fois cette année, et des rapports ont diversement évoqué K3.1, K3.2 et K4 comme trois produits différents. Un K4 qui active moins que le K3, dans une famille qui propose une variante de codage distincte, est au moins aussi cohérent avec un repositionnement qu'avec une simple mise à niveau. Les deux lectures sont des spéculations. Ni l'une ni l'autre n'est tranchée par un post.
Il y a aussi une dimension de licence que personne n’a abordée. Les poids de K3 sont publiés sous la licence Kimi K3, une licence personnalisée « autre » plutôt qu’une licence open source standard, et il s’agit du premier modèle ouvert de classe 3T. Qu’un K4 plus clairsemé hérite de cette licence, ou la restreigne, compte davantage pour quiconque construit sur ces poids que quelques points de score d’indice.

Les trois autres noms dans la même publication
GLM-5.5 Flash et GLM-5.4 forment la paire la plus surprenante, et ce n'est pas à cause des chiffres. Le plafond publié par Z.ai est GLM-5.3, livré le 14 août 2026 avec 743 milliards de paramètres, GLM-5.3-Flash ayant suivi le 26 août et les publications de poids BF16 et Flash-BF16 étant arrivées le 25 août. La documentation de Z.ai elle-même ne répertorie que trois identifiants de modèle actuels : glm-5.3, glm-5.3-flash et glm-5.2. Il n'existe pas de GLM-5.4, ni de GLM-5.5, ni de GLM-5.5 Flash — et c'est le sens du nommage qui est étrange, car une génération 5.5 précédant une 5.4 n'est pas de cette façon que Z.ai a jamais numéroté une famille. Des numéros de version apparaissant dans le désordre dans une fuite constituent un mode d'échec bien connu : il s'agit généralement de produits adjacents, de noms de code internes ou d'un libellé de niveau de service plutôt que d'un nouveau modèle de base.
DeepSeek V4.1P est le nom auquel l'auteur du signal déclare s'intéresser le plus, et c'est le plus facile des quatre à vérifier. La documentation de l'API de DeepSeek nomme exactement deux chaînes de modèles actuelles : deepseek-flash et deepseek-v4-pro. Le suffixe « P » n'a d'équivalent dans aucun identifiant DeepSeek, et la publication de poids la plus récente au sein de l'organisation DeepSeek elle-même est DeepSeek-V4.1-Flash, publiée le 10 septembre 2026. Un V4.1P serait, selon toute vraisemblance, un modèle frère de gamme Pro de celui-ci — mais « selon toute vraisemblance » est une supposition à propos d'une chaîne, pas d'un produit.
Comment saurais-tu que tout cela est réel ?
Les quatre noms échouent au même test de la même manière, ce qui rend l’attente simple plutôt qu’angoissante. Une vraie sortie laisse des artefacts, et chacun d’eux est peu coûteux à vérifier :
• Une carte de modèle dans l’organisation Hugging Face propre au fournisseur. La dernière entrée de Moonshot est Kimi-K3, créée le 13 juin 2026 ; les nouveautés les plus récentes de Z.ai sont la famille GLM-5.3 du 25 août ; la plus récente de DeepSeek est DeepSeek-V4.1-Flash du 10 septembre. Rien de plus récent n’existe chez aucun des trois.
• Une configuration qui tranche le débat. Pour K4 spécifiquement, les champs à rechercher sont num_experts et num_experts_per_token — ceux de K3 affichent 896 et 16. Une configuration K4 avec un chiffre par token inférieur est la revendication de cette fuite, confirmée ou réfutée dans un seul fichier.
• Un modèle routable. Un nom qui apparaît dans un catalogue est un nom avec un prix, une fenêtre de contexte et un fournisseur derrière lui ; un nom qui n’est présent que dans un post ne possède rien de tout cela.

Ce que vous pouvez router aujourd'hui
La version pratique de cette fuite, c'est que la génération qu'elle décrit n'est pas celle sur laquelle vous pouvez bâtir. Ce qui est en production, c'est la précédente, et le rôle du routeur est de faire de l'écart entre les générations une décision de routage plutôt qu'un projet de migration. Kimi K3 est disponible dès maintenant avec son contexte complet de 1 M de tokens et sa vision native, au tarif de 3,00 $ par million de tokens d'entrée et de 15,00 $ par million de tokens de sortie, les lectures de cache étant à 0,30 $ — facturé au tarif du fournisseur sans marge, ce qui explique qu'un changement de prix du fournisseur sur K3 se répercute sur votre facture le jour même plutôt qu'au prochain cycle de réévaluation. Kimi K3 sur OrcaRouter présente la fiche technique complète et le tarif actuel.
Il en va de même pour le reste de la gamme. GLM-5.3, GLM-5.3-Flash et DeepSeek V4.1 Flash sont tous routables aux côtés de Kimi K3, via un unique point de terminaison compatible OpenAI couvrant plus de 200 modèles, avec bascule automatique dès qu'un fournisseur se dégrade et un DSL de routage permettant d'exprimer vos préférences — plafonds de coût, seuils de qualité, budgets de latence — sous forme de politique plutôt que de logique propre à chaque appel. Lorsqu'un Kimi K4, GLM-5.5 Flash ou DeepSeek V4.1P fait son apparition, la migration se résume à une modification de chaîne dans la politique de routage, et à rien d'autre. La fusion de modèles vous permet de combiner les sorties de plusieurs modèles sur le même point de terminaison lorsqu'une tâche y gagne.
Pour être explicite sur ce que cela n’est pas : aucun des quatre noms divulgués n’est une route sur OrcaRouter aujourd’hui. Nous ne les hébergeons pas et ne pouvons pas les servir.
En résumé
La revendication intéressante ici n'est pas les numéros de version. C'est le mécanisme — un modèle phare de nouvelle génération qui active moins deparamètres que son prédécesseur serait l'affirmation que Moonshot estime que c'est la parcimonie, et non le nombre brut d'activations, qui constitue l'axe qu'il vaut la peine de pousser, et la répartition en 16 experts sur 896 de K3 plaide déjà en ce sens. Chaque élément de cette affirmation est non vérifié : Kimi K4, GLM-5.5 Flash, GLM-5.4 et DeepSeek V4.1P n'ont ni fiches de modèle, ni poids, ni identifiants d'API, ni tarifs, et les catalogues des éditeurs eux-mêmes s'arrêtent une génération plus tôt dans chaque cas. Considérez ces noms comme l'annonce d'une question, non d'une réponse — et si vous avez besoin dès aujourd'hui de poids ouverts de classe frontière avec un contexte de 1M, Kimi K3 est le modèle qui existe déjà.
Quand un Kimi K4 finira par arriver, le basculement automatique est ce qui empêche la migration de se transformer en incident
