
Kimi Linear se propage : chaque modèle que nous pouvons vérifier exécute réellement KDA
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 198 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1653Intelligence69Code60Maths
« Wow ! Kimi-Linear gagne des adeptes ! C'est comme le troisième modèle externe que je vois. » C'était tout le post — une ligne de @teortaxesTex du 5 août 2026, avec une capture d'écran jointe et pas un seul modèle nommé. Le lien raccourci qu'il contient mène à l'image, pas à un dépôt, donc il n'y a rien sur quoi cliquer ni rien pour corroborer. L'affirmation est vérifiable de toute façon, et elle compte plus que ce que laisse entendre un simple message d'une ligne : si des labos autres que Moonshot AI s'appuient désormais sur la conception d'attention derrière Kimi-Linear-48B-A3B-Instruct et Kimi K3, alors Kimi Delta Attention a cessé d'être l'astuce maison d'un seul labo et a commencé à devenir un ingrédient que d'autres adoptent. Nous sommes donc partis à la recherche des modèles, et non de la capture d'écran. La réponse courte : le cas le plus solide est Ling-3.0-flash, dont la fiche modèle décrit un empilement 5:1 de couches KDA et MLA ; le cas le plus utile est un checkpoint de recherche d'un labo américain qui quantifie le coût du KDA pur ; et à l'échelle des modèles de pointe, en dehors de Moonshot, personne ne l'a lancé.
Ce que l'affirmation est, et ce qu'elle n'est pas.
Un praticien, une capture d'écran, aucun modèle nommé, aucune corroboration. C'est là toute la base probante de « gagner en adoption » et cela doit être lu comme une invitation à vérifier plutôt que comme une nouvelle. Nous n'avons pas pu reproduire la capture d'écran, donc rien de ce qui suit ne la confirme — tout ce qui suit est ce que les métadonnées publiques des modèles montraient le 5 août 2026, lorsque nous avons mené notre recherche, ainsi que ce que chaque laboratoire déclare dans sa propre fiche modèle. Lorsqu'un chiffre provient de la propre mesure d'un fournisseur, il est étiqueté comme tel, car dans cette histoire particulière, presque tous les chiffres mis en avant le sont.
Un seul écran sur Kimi Linear, parce qu'« adoption » signifie adopter ceci
Kimi Linear est une architecture d'attention, publiée par la Kimi Team sous la référence arXiv 2510.26692 le 30 octobre 2025 ; ce n'est pas un produit. Son cœur est Kimi Delta Attention (KDA), qui s'appuie sur Gated DeltaNet et remplace sa porte d'oubli grossière par une décroissance fine par canal, de sorte que l'état récurrent apprend à conserver ce qu'il faut canal par canal plutôt que globalement. La mise à jour est restructurée sous une forme en blocs de type diagonale-plus-bas-rang, précisément pour atterrir sur les tensor cores au lieu de les laisser inactifs. C'est ce cadrage matériel qui fait tout l'intérêt de la conception : l'attention linéaire a toujours été peu coûteuse en théorie, et généralement décevante en pratique.
Les checkpoints publiés — Kimi-Linear-48B-A3B-Base et Kimi-Linear-48B-A3B-Instruct — comptent 48B de paramètres au total avec 3B actifs, une fenêtre de contexte de 1M de tokens et une licence MIT. Les couches alternent selon un rapport d'environ 3:1, vingt couches KDA pour sept couches Multi-Head Latent Attention, de sorte que trois couches sur quatre sont du type récurrent économique et chaque quatrième couche maintient une attention globale exacte.
Ce que rapporte Moonshot, toutes les mesures étant effectuées par rapport à une baseline MLA complète entraînée selon une recette identique — des chiffres fournisseur, non reproduits de manière indépendante :
• Débit de décodage — un temps par jeton de sortie jusqu'à 6 fois plus rapide avec un contexte de 1M par rapport au MLA complet.
• Cache KV — jusqu'à 75% plus petit, c'est de là que vient le débit
• Contexte long — RULER à 128k : 84.3 pour Kimi Linear avec une accélération de 3.98x, contre 81.3 pour la baseline MLA.
• Contexte court — MMLU-Pro à 4k : 51.0 contre 47.2 pour la baseline MLA et 47.9 pour un hybride Gated DeltaNet, à peu près à la même vitesse que l'attention complète, de sorte que la conception ne gagne pas la vitesse sur les longs contextes en sacrifiant la qualité sur les contextes courts.
• Ablation du pré-entraînement — l'hybride 3:1 atteint une perplexité de validation de 5,65 tandis que l'attention complète se situe à 5,77
La limite honnête de tout cela : les preuves comparatives appariées s'arrêtent à 48B. Personne n'a construit un jumeau à attention complète de 2,8T de Kimi K3 pour établir une comparaison, et lors d'une vérification des faits fin juillet 2026 sur les affirmations concernant l'architecture K3, aucune sonde indépendante de rappel en contexte long sans raccourci n'avait été publiée pour l'un ou l'autre modèle. Le discours sur l'efficacité est bien étayé. Le discours sur le fait de « surpasser l'attention complète » est étayé à l'échelle de la recherche par le laboratoire qui a rédigé l'article.

Jusqu'ici, la traction a ressemblé à des téléchargements plutôt qu'à des architectures d'autres : 98 164 téléchargements le mois dernier, 570 likes, un fournisseur d'inférence répertorié sur Hugging Face, et une arborescence de modèles de 2 adaptateurs, 8 finetunes et 24 quantifications. Populaire, clairement. Copié, c'est une autre question.
Le cas d'adoption le plus solide : Ling-3.0-flash
Ling-3.0-flash est celui qui concrétise cette affirmation. Sa fiche Hugging Face décrit une architecture d'attention linéaire hybride native construite à partir d'une pile alternée de rapport 5:1 combinant Kimi Delta Attention et MLA — 35 couches KDA pour 7 couches MLA à portes — sur un modèle Mixture-of-Experts de 124 milliards de paramètres avec 5,1 milliards actifs par jeton, un contexte de 256K entraîné selon une progression allant de 8K à 32K puis à 256K, et une licence MIT. Ce n'est pas un jouet de recherche issu d'un amateur ; c'est un modèle commercialisé provenant d'un laboratoire établi, et il cite le module d'attention de Moonshot dans sa propre description d'architecture.
C'est aussi plus agressif à ce sujet que Moonshot. Moonshot conserve une couche d'attention exacte sur quatre ; Ling-3.0-flash en conserve une sur six. Si une conception est un passif, on la couvre ; on ne dépense pas moins de couches globales que ceux qui l'ont inventée. Lu en parallèle avec la génération précédente, c'est un changement : les enquêtes d'architecture de février 2026 qui cataloguaient cette classe de modèles avaient le précédent fleuron Ling sur Lightning Attention associé à MLA dans un rapport de 7:1. Le mécanisme a changé entre les générations, et la direction dans laquelle il a changé était vers KDA.
Deux réserves que nous ne passerons pas sous silence. C'est ce que rapporte la fiche : nous avons lu la description de l'architecture du dépôt lui-même et sa configuration, qui déclare un type de modèle personnalisé bailing_hybrid avec une implémentation BailingMoeV3 — nous n'avons pas audité les noyaux pour confirmer que les calculs sont bien KDA plutôt que simplement inspirés de KDA. Et le dépôt ne porte aucun tag KDA ; ce qui apparaît dans une recherche par tag est une conversion GGUF tierce que quelqu'un d'autre a étiquetée. Ce qui est un avertissement utile sur la méthode, et mène directement aux deux sections suivantes.
Arcee AI a mené l'expérience que Moonshot n'a pas menée.
L'utilisation externe la plus informative de KDA n'est pas du tout un produit. Environ six semaines après l'article Kimi Linear, à la mi-décembre 2025, Arcee AI a publié deux checkpoints de recherche sous licence Apache-2.0 — AFM-4.5B-Base-KDA-Only et AFM-4.5B-Base-KDA-NoPE — avec leur propre implémentation ArceeKDAForCausalLM, explicitement étiquetés kimi-delta-attention. Leur question était celle que la conception hybride de Moonshot évite soigneusement : l'attention complète peut-elle être entièrement remplacée ? Ils ont donc converti les 24 couches d'attention en KDA, sans laisser de couches d'attention globales, et ont distillé le résultat à partir du modèle AFM-4.5B-Base original comme enseignant à une longueur de séquence de 32k.
Leurs résultats rapportés, enseignant versus élève pure-KDA :
• MMLU — 63.1 à 55.8, une baisse réelle mais surmontable
• GSM8K — 52.1 à 26.8, environ réduit de moitié
• HellaSwag — 78,0 à 74,3, quasi intact.

La forme de ces dégâts est la partie intéressante. Les connaissances générales et la poursuite du sens commun survivent en grande partie au passage à travers un état récurrent de taille fixe. L'arithmétique multi-étapes, qui nécessite la récupération exacte de résultats intermédiaires que le modèle a écrits plusieurs étapes plus tôt, ne le fait pas. Arcee rapporte également que la dégradation en contexte long est progressive, sans précipice marqué. Pris ensemble, c'est la preuve publique la plus claire de pourquoi chaque déploiement KDA sérieux est hybride : les couches globales une-sur-quatre de Moonshot et les une-sur-six d'Ant ne sont pas de la timidité, ce sont les éléments qui préservent l'arithmétique.
Ce que ce n'est pas : un verdict sur KDA à grande échelle. Il s'agit d'une distillation de 4,5B, et non d'un pré-entraînement, et la distillation dans une architecture modifiée perd des choses que le pré-entraînement à partir de zéro ne perdrait pas. Considérez-le comme l'ablation qu'un fournisseur n'avait aucun intérêt à publier — provenant d'un laboratoire indépendant qui n'avait aucun enjeu dans la réponse.
La longue traîne : un groupe de minuscules dépôts KDA en une seule semaine
Sous les deux cas sérieux se trouve un éparpillement de petits cas, et ce sont les dates qui les rendent dignes d'être mentionnés. NEXIVON-1B-BASE, mis en ligne le 31 juillet 2026, déclare son type de modèle comme étant, littéralement, kda — Apache-2.0, 285 téléchargements, aucun like. qingyi-kda-0.6b, la même semaine, est un finetune de Qwen3-0.6B-Base incluant une implémentation personnalisée de qingyi_kda. Scrapegoat-Tiny-Coder, également cette semaine-là, combine un tag kda avec une conception « dual-track parallel attention » qui lui est propre. Deux autres, maccy-106m-base et maccy-96m-16k-base, ont été étiquetés kimi-delta-attention les 27 et 28 juillet.
Aucun de ces éléments n'est important en soi — des likes à un chiffre, des auteurs inconnus, des nombres de paramètres à l'échelle de la recherche. Collectivement, ils sont probablement ce que compte le décompte « troisième modèle externe que je vois », et nous ne pouvons pas confirmer lesquels des trois, puisque le post n'en nomme aucun. Le signal qu'ils contiennent n'est pas les modèles, ce sont les dix jours : quatre petites exécutions d'entraînement indépendantes ont tenté d'atteindre KDA en une semaine et demie, ce qui se produit lorsqu'un noyau cesse d'être un artefact de recherche et devient quelque chose que l'on peut glisser dans un script d'entraînement en un week-end.
Ce que le balayage n'a pas trouvé
Nous avons interrogé Hugging Face pour trouver tous les dépôts portant le type de modèle kimi_linear. Il y en avait 47. Tous sauf trois portent « Kimi » dans le nom, et ceux qui ne sont pas de Moonshot sont des dérivés plutôt que des adoptants : des quantifications AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF et MLX à chaque profondeur de bits ; des variantes 35B à élagage d'experts REAP de Cerebras ; et des builds FlagRelease FlagOS du checkpoint Instruct pour les accélérateurs NVIDIA, MetaX et Hygon. Ce dernier groupe est vraiment intéressant pour une autre raison — quelqu'un a fait le travail pour faire fonctionner KDA sur du silicium chinois domestique — mais rien de tout cela n'est un autre laboratoire concevant un autre modèle.
Aucun modèle à l'échelle frontière hors Moonshot ne déclare KDA. Ling-3.0-flash, avec 124B au total et 5.1B actifs, est le plafond de l'adoption externe en ce moment.
Et la méthode a une faille qui mérite d'être nommée, car elle va à l'encontre de notre propre résultat négatif. Un laboratoire qui réimplémente KDA enregistre son propre type de modèle — arcee_kda, qingyi_kda, bailing_hybrid — de sorte que les balayages de tags sous-comptent systématiquement exactement les adoptants que nous recherchons, et un modèle peut utiliser le mécanisme sans jamais écrire « KDA » dans sa fiche. L'absence d'un tag est une preuve faible, pas une preuve. S'il existe un quatrième ou cinquième adoptant discret, c'est précisément ainsi qu'il resterait invisible.
Tous les autres ont choisi une attention linéaire différente.
La raison pour laquelle « Kimi Linear gagne du terrain » est une histoire en soi, c'est que, pendant la majeure partie de 2026, ce n'était pas le cas. L'attention linéaire hybride a balayé le domaine des modèles open-weight — mais pas cette variante-ci. Selon les études d'architecture publiées en février 2026 : Qwen3-Next 80B-A3B et Qwen3.5-397B-A17B associent tous deux Gated DeltaNet à une attention gated dans un rapport de 3:1, ce qui signifie que Qwen3.5-397B-A17B exécute 45 couches récurrentes contre 15 couches de pleine attention sur 60. Le précédent fleuron de Ling utilisait Lightning Attention avec MLA dans un rapport de 7:1. Nemotron 3 Nano 30B-A3B et Super 120B-A12B sont des hybrides Mamba-2, avec seulement 6 couches d'attention dans une pile de 52 couches et 8 dans une pile de 88 couches, respectivement. GLM-5 a conservé MLA et y a ajouté une attention sparse par-dessus. MiniMax-M2.5 a fait exactement l'inverse et a conservé une attention multi-têtes classique, apparemment pour des raisons de fiabilité. Et Kimi K2.5, le propre fleuron de Moonshot avant K3, reposait sur MLA — le laboratoire a publié KDA en octobre 2025 et ne l'a intégré à son modèle de pointe qu'en juillet 2026.
Donc la catégorie a gagné et la variante non. Tout le monde s'accorde à dire que les trois quarts de vos couches peuvent être récurrentes ; personne ne s'accordait sur quelle récurrence. Le différenciateur de KDA est le portail de décroissance par canal, et son coût est que vous avez besoin de ses noyaux personnalisés et de sa plomberie de mise en cache de préfixes plutôt que de la voie Gated DeltaNet que la moitié de l'écosystème avait déjà. Jusqu'à ce mois-ci, un laboratoire a payé ce coût.
L'adoption qui a déjà eu lieu se trouve dans les stacks de service.
Les architectures ne se répandent pas parce qu'elles sont élégantes ; elles se répandent quand l'infrastructure les rend peu coûteuses. Cette partie est déjà faite pour KDA, et cela s'est produit plus rapidement que l'adoption des model cards. vLLM et SGLang ont tous deux livré un support dès le premier jour lorsque les poids de Kimi K3 sont arrivés le 27 juillet 2026, Moonshot intégrant son implémentation de préfixe-caching KDA directement dans vLLM plutôt que de maintenir un fork. SGLang a livré des kernels fusionnés KDA et Gated DeltaNet et a rapporté une capacité logique KV passant de 1,5M à 12,2M de tokens sur un matériel identique — sa propre mesure, et le chiffre d'efficacité tiers le plus concret de toute cette histoire. Les kernels de référence vivent dans fla-core, que n'importe quelle petite session d'entraînement peut importer.
C'est la différence entre Arcee nécessitant un effort de recherche délibéré en décembre 2025 et quatre dépôts anonymes déclarant nonchalamment KDA en une semaine de juillet 2026. Le mécanisme est devenu une dépendance que vous installez. Que la frontière suive ou non est une question distincte, mais l'argument de friction contre KDA a largement disparu.
Ce que cela change si vous n'achetez que des jetons
Rien à voir avec votre code. Vous n'appelez jamais KDA ; vous le ressentez comme ce que coûte un contexte d'un million de jetons et combien de temps prend le premier jeton. Kimi K3 est le modèle où cela se manifeste commercialement aujourd'hui — sur OrcaRouter, cela revient à 3,00 $ par million de jetons en entrée et 15,00 $ par million en sortie, avec le contexte complet d'un million de jetons et un p50 mesuré du temps jusqu'au premier jeton de 8,88 secondes sur les sept derniers jours. Ces chiffres économiques sont, en substance, ce que permet l'hybride KDA 3:1 : servir un contexte d'un million de jetons à un prix qui est simplement coûteux plutôt que prohibitif.

Le point de contrôle de recherche est une proposition différente. Kimi-Linear-48B-A3B-Instruct est sous licence MIT avec un fournisseur d'inférence répertorié sur sa page Hugging Face, et il n'est pas sur OrcaRouter — si vous voulez l'exécuter, cela signifie auto-hébergement ou ce fournisseur. L'arithmétique pour l'auto-hébergement est plus favorable que le nombre de paramètres ne le suggère : 48B de poids en bf16 représente environ 96 Go, donc deux cartes de 80 Go, tandis que les conversions 4 bits MLX et GGUF avoisinent les 25-30 Go et tiennent sur une seule carte ou un Mac bien équipé. Ling-3.0-flash n'est pas non plus sur OrcaRouter aujourd'hui. Nous n'allons pas prétendre le contraire pour faire un point sur le routage.
Là où le routage compte vraiment ici, c'est le coût d'une erreur de pari sur l'architecture. Les modèles d'attention linéaire hybrides sont exactement la catégorie où le tableau de référence du fournisseur et votre charge de travail peuvent diverger — un état récurrent de taille fixe échoue sur des schémas de récupération qu'aucun score agrégé ne révèle, et c'est la leçon de ce nombre GSM8K réduit de moitié. Exécuter la comparaison via une seule clé API sur plus de 200 modèles signifie que le test est un changement de chaîne de modèle plutôt qu'un cycle d'approvisionnement, au prix catalogue du fournisseur avec une marge de 0 % de notre côté, et avec un basculement automatique pour qu'un modèle à contexte long que vous êtes encore en train d'évaluer ne soit pas un point unique de défaillance dans un chemin de production. Essayez-le sur votre propre trafic à contexte long pendant une journée. C'est une réponse moins chère que n'importe quel tableau de référence, y compris le nôtre.
Des questions qui méritent vraiment d'être posées
Kimi Linear est-il la même chose que Kimi K3 ?
Non, et les confondre est l’erreur la plus courante dans la couverture des deux. Kimi Linear est l’article d’architecture plus un modèle de recherche de 48B au total, dont 3B actifs, avec un contexte de 1M, publié sous licence MIT fin 2025 pour démontrer qu’un hybride à forte dominante KDA bat le MLA complet à entraînement égal. Kimi K3 est le fleuron de 2,8 billions de paramètres de Moonshot datant de juillet 2026 — 104B actifs, nativement multimodal, contexte de 1M — qui a porté l’idée du KDA à 3:1 à l’échelle des modèles frontières et ajouté les Attention Residuals, une astuce distincte dont le laboratoire rapporte qu’elle offre environ 25 % d’efficacité d’entraînement pour moins de 2 % de coût supplémentaire. Mécanisme commun, échelle, capacités et prix entièrement différents. Les benchmarks de l’un vous apprennent très peu sur l’autre.
Pourquoi un laboratoire choisirait-il {{1}}KDA{{/1}} plutôt que {{2}}Gated DeltaNet{{/2}}, étant donné que la plupart ont choisi {{3}}Gated DeltaNet{{/3}} ?
KDA est un raffinement strict de Gated DeltaNet, donc la question est de savoir si le raffinement vaut le coût de bascule. Le raffinement est la porte : Gated DeltaNet fait décroître sa mémoire récurrente avec un scalaire par étape, tandis que KDA apprend une décroissance par canal de caractéristiques, ce qui permet à l'état de conserver un nom de variable sur dix mille jetons tout en purgeant la phrase où il est apparu. L'ablation de Moonshot situe cela à une perplexité de validation d'environ 0,12 à 48B, et sa formulation DPLR par blocs a été écrite pour garder les cœurs tensoriels occupés, si bien que l'expressivité supplémentaire ne coûte pas le débit qu'elle rapporte. En revanche, Gated DeltaNet disposait déjà d'un large support de noyaux et de frameworks avant que l'un ou l'autre ne soit à la mode, ce qui représente un gain de temps d'ingénierie bien réel. La réponse de 2026 était en grande partie « pas rentable ». Ling-3.0-flash est le premier pari à l'échelle de la production dans l'autre sens.
Est-ce que tout cela devrait changer ce que je déploie ce trimestre ?
Uniquement si vous utilisez des contextes très longs. Si vos prompts font moins d'environ 32k tokens, l'attention linéaire hybride est un détail d'implémentation sans incidence sur votre choix de modèle ; choisissez comme d'habitude selon la qualité, le prix et la latence. Si vous atteignez 128k et au-delà, il est bon de savoir que les modèles qui maintiennent vos coûts à un niveau raisonnable à cette longueur sont de plus en plus des hybrides KDA, et que leurs scores publiés en long contexte sont des benchmarks agrégés plutôt que des sondes de rappel adversariales. Testez la récupération à votre longueur de contexte réelle plutôt que de vous fier à un score RULER. Ce conseil serait identique si le mécanisme était Gated DeltaNet ou Mamba-2.
Où cela laisse l'affirmation
Dans la bonne direction, et plus petit qu'il n'y paraît. Ce qui est vérifiable au 5 août 2026, c'est un modèle de production issu d'un laboratoire établi, une paire de modèles de recherche d'un laboratoire américain indépendant qui a publié honnêtement les inconvénients, une poignée de dépôts sub-1B des dix derniers jours, et un écosystème d'inférence qui a déjà absorbé le noyau. C'est plus qu'un « truc d'un seul labo » et bien moins qu'une norme. Ce qu'il faut surveiller, ce ne sont pas trois modèles externes — c'est de savoir si la prochaine version open-weight de pointe d'un laboratoire autre que Moonshot inclura un gating par canal, et si quiconque en dehors de Moonshot publie un jour une sonde de rappel qui teste ce que l'état à taille fixe oublie réellement. Les deux vous en diraient plus qu'une autre capture d'écran.
