Kimi Linear Verspreidt Zich-1.png
Engineering & Research

Kimi Linear verspreidt zich: elk model dat we kunnen verifiëren draait daadwerkelijk KDA

Auteur

Jim Song

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

"Wow! Kimi-Linear wint terrein! Dit is alweer het derde externe model dat ik zie." Dat was het hele bericht — één regel van @teortaxesTex op 5 augustus 2026, met een screenshot erbij en geen enkel model bij naam genoemd. De verkorte link erin verwijst naar de afbeelding, niet naar een repo, dus er valt niets door te klikken en niets om te bevestigen. De bewering is toch controleerbaar, en het belang ervan is groter dan een oneliner doet vermoeden: als andere labs dan Moonshot AI nu voortbouwen op het aandachtsontwerp achter Kimi-Linear-48B-A3B-Instruct en Kimi K3, dan is Kimi Delta Attention niet langer een intern trucje van één lab, maar wordt het een ingrediënt waar andere partijen voor kiezen. Dus gingen we op zoek naar de modellen in plaats van naar het screenshot. Het korte antwoord: het sterkste voorbeeld is Ling-3.0-flash, wiens eigen modelkaart een 5:1-stapeling van KDA- en MLA-lagen beschrijft; het meest bruikbare voorbeeld is een onderzoekscheckpoint van een Amerikaans lab dat kwantificeert wat pure KDA kost; en op frontiermodelschaal heeft niemand buiten Moonshot het uitgebracht.

Wat de bewering is, en wat het niet is

Eén beoefenaar, één screenshot, geen model genoemd, geen bevestiging. Dat is de volledige bewijsbasis voor 'ingang vinden', en het moet worden gelezen als een aansporing om het na te gaan, niet als nieuws. We konden het screenshot niet reproduceren, dus niets hieronder is een bevestiging ervan — alles wat volgt is wat we op 5 augustus 2026 in openbare modelmetadata aantroffen, plus wat elk laboratorium in zijn eigen modelkaart vermeldt. Waar een getal afkomstig is van een eigen meting van de leverancier, wordt het als zodanig gelabeld, omdat in dit specifieke verhaal bijna elk belangrijk getal dat is.

Eén scherm op Kimi Linear, omdat 'adoptie' betekent dat je dit adopteert

Kimi Linear is een attention-architectuur, gepubliceerd door het Kimi Team als arXiv 2510.26692 op 30 oktober 2025, geen product. De kern is Kimi Delta Attention (KDA), die Gated DeltaNet neemt en de grove forget gate vervangt door fijnmazig, per-kanaal verval, zodat de recurrente toestand leert wat hij kanaal voor kanaal moet bewaren in plaats van alles in één keer. De update wordt geherstructureerd in chunked, Diagonal-Plus-Low-Rank-vorm, specifiek zodat hij op tensor cores terechtkomt in plaats van ze ongebruikt te laten. Dat hardwarekader is precies het punt van het ontwerp: lineaire aandacht is altijd goedkoop in theorie geweest, en meestal teleurstellend in de praktijk.

De vrijgegeven checkpoints — Kimi-Linear-48B-A3B-Base en Kimi-Linear-48B-A3B-Instruct — hebben in totaal 48B parameters met 3B actief, een contextvenster van 1M tokens en een MIT-licentie. De lagen wisselen elkaar grofweg af in een verhouding van 3:1, twintig KDA-lagen tegenover zeven Multi-Head Latent Attention-lagen, dus drie van de vier lagen zijn het goedkope recurrente type en elke vierde laag behoudt exacte globale aandacht.

Wat Moonshot rapporteert, alles gemeten tegen een volledige MLA-baseline die is getraind met een identiek recept — leverancierscijfers, niet onafhankelijk gereproduceerd:

• Decoderingsdoorvoer — tot 6x snellere tijd per uitvoertoken bij 1M context versus volledige MLA

• KV-cache — tot 75% kleiner, en daar komt de doorvoer vandaan

• Lange context — RULER op 128k: 84,3 voor Kimi Linear met een 3,98x versnelling, tegenover 81,3 voor de MLA-basislijn

• Korte context — MMLU-Pro bij 4k: 51,0 tegen 47,2 voor de MLA-baseline en 47,9 voor een Gated DeltaNet-hybride, op ongeveer dezelfde snelheid als volledige aandacht. Het ontwerp koopt dus geen snelheid voor lange context door kwaliteit bij korte context op te geven.

• Pretraining-ablatie — de 3:1-hybride bereikt 5.65 validatieperplexiteit terwijl volledige aandacht op 5.77 uitkomt

De eerlijke grens aan dit alles: het gematchte-basislijnbewijs stopt bij 48B. Niemand heeft een full-attention 2.8T-tegenhanger van Kimi K3 gebouwd om mee te vergelijken, en vanaf een feitencheck eind juli 2026 van de beweringen over de K3-architectuur zijn er voor geen van beide modellen onafhankelijke shortcut-vrije long-context-recallprobes gepubliceerd. Het efficiëntieverhaal wordt goed ondersteund. Het verhaal dat het "beter presteert dan full attention" wordt op onderzoeksschaal ondersteund door het lab dat het artikel schreef.

Kimi Linear Is Spreading-2.png

De tractie zag er tot nu toe uit als downloads, niet als andermans architecturen: 98.164 downloads in de afgelopen maand, 570 likes, één inference-provider vermeld op Hugging Face, en een modelboom van 2 adapters, 8 finetunes en 24 quantisaties. Populair, duidelijk. Gekopieerd is een andere vraag.

De sterkste adoptiecase: Ling-3.0-flash

Ling-3.0-flash is degene die de claim werkelijkheid maakt. Zijn Hugging Face-kaart beschrijft een native hybride lineaire aandachtsarchitectuur opgebouwd uit een afwisselende 5:1-stapel van Kimi Delta Attention en MLA — 35 KDA-lagen tot 7 gated MLA-lagen — op een Mixture-of-Experts-model met 124B parameters en 5,1B actief per token, een 256K-context getraind in een progressie van 8K naar 32K naar 256K, en een MIT-licentie. Dat is geen onderzoeksspeeltje van een hobbyist; het is een uitgebracht model van een gevestigd lab, en het noemt Moonshot's aandachtsmodule in zijn eigen architectuurbeschrijving.

Het is ook agressiever dan Moonshot. Moonshot gebruikt bij één op de vier lagen een exact-aandachtslaag; Ling-3.0-flash bij één op de zes. Als een ontwerp een risico vormt, dekk je het af; je gebruikt niet minder globale lagen dan degenen die het hebben uitgevonden. Naast de eerdere generatie gelezen, is dat een omslag: de architectuuroverzichten van februari 2026 die deze modelklasse in kaart brachten, toonden het vorige Ling-vlaggenschip met Lightning Attention en MLA in een verhouding van 7:1. Het mechanisme veranderde tussen generaties, en het veranderde in de richting van KDA.

Twee kanttekeningen die we niet zullen verdoezelen. Dit is zoals gerapporteerd op de modelkaart: we lazen de eigen architectuurbeschrijving van de repository en de configuratie, die een aangepast bailing_hybrid-modeltype declareert met een BailingMoeV3-implementatie — we hebben de kernels niet gecontroleerd om te bevestigen dat de wiskunde KDA is in plaats van KDA-geïnspireerd. En de repository draagt helemaal geen KDA-tag; wat naar voren komt in een tag-zoekopdracht is een GGUF-conversie van derden die iemand anders heeft gelabeld. Dat is een nuttige waarschuwing over de methode en leidt direct naar de volgende twee secties.

Arcee AI voerde het experiment uit dat Moonshot niet deed.

Het meest informatieve externe gebruik van KDA is helemaal geen product. Ongeveer zes weken na het Kimi Linear-paper, medio december 2025, publiceerde Arcee AI twee Apache-2.0-onderzoekscheckpoints — AFM-4.5B-Base-KDA-Only en AFM-4.5B-Base-KDA-NoPE — onder hun eigen ArceeKDAForCausalLM-implementatie, expliciet getagd als kimi-delta-attention. Hun vraag was precies de vraag die Moonshots hybride ontwerp zorgvuldig vermijdt: kan volledige aandacht volledig worden vervangen? Dus converteerden ze alle 24 aandachtslagen naar KDA, zonder globale aandachtslagen over te houden, en destilleerden het resultaat uit de originele AFM-4.5B-Base als teacher bij een sequentielengte van 32k.

Hun gerapporteerde resultaten, leraar versus pure-KDA-student:

• MMLU — 63.1 tot 55.8, een echte maar overleefbare daling

{{1}}GSM8K{{/1}} — van 52.1 naar 26.8, ongeveer gehalveerd

• HellaSwag — 78.0 tot 74.3, vrijwel intact

Kimi Linear Is Spreading-3.png

De vorm van die schade is het interessante deel. Brede kennis en voortzetting op basis van gezond verstand overleven grotendeels de doorgang door een recurrente toestand van vaste grootte. Meerstapsrekenkunde, die tussentijdse resultaten exact moet ophalen die het model enkele stappen geleden schreef, overleeft die doorgang niet. Arcee rapporteert ook dat de achteruitgang bij lange contexten geleidelijk verloopt, zonder steile klif. Alles bij elkaar genomen is dit het duidelijkste publieke bewijs waarom elke serieuze KDA-implementatie een hybride is: de één-op-de-vier globale lagen van Moonshot en de één-op-de-zes van Ant zijn geen lafheid; ze vormen het deel dat de rekenkunde overeind houdt.

Wat het niet is: een oordeel over KDA op schaal. Dit is een 4.5B-distillatie, geen pretraining-run, en distillatie naar een gewijzigde architectuur verliest dingen die pretraining vanaf nul niet zou verliezen. Lees het als de ablatie die een leverancier geen enkele prikkel had om te publiceren — van een onafhankelijk lab dat geen belang had bij het antwoord.

De lange staart: een cluster van kleine KDA-repos in één week

Onder de twee serieuze gevallen bevindt zich een handvol kleine, en het zijn de data die ze het vermelden waard maken. NEXIVON-1B-BASE, geüpload op 31 juli 2026, geeft als modeltype letterlijk kda op — Apache-2.0, 285 downloads, geen likes. qingyi-kda-0.6b, in dezelfde week, is een Qwen3-0.6B-Base-finetune met een eigen qingyi_kda-implementatie. Scrapegoat-Tiny-Coder, ook die week, combineert een kda-tag met een eigen "dual-track parallel attention"-ontwerp. Twee andere, maccy-106m-base en maccy-96m-16k-base, werden op 27 en 28 juli getagd met kimi-delta-attention.

Geen van deze is op zichzelf belangrijk — likes in de enkele cijfers, onbekende auteurs, parameteraantallen op onderzoeksschaal. Gezamenlijk zijn ze waarschijnlijk waar de telling van 'derde extern model dat ik zie' naar verwijst, en we kunnen niet bevestigen welke drie, aangezien het bericht er geen noemde. Het signaal erin zit niet in de modellen, maar in de tien dagen: vier onafhankelijke kleine trainingsruns bereikten KDA binnen anderhalve week, wat gebeurt wanneer een kernel geen onderzoeksartefact meer is en iets wordt dat je in een weekend in een trainingsscript kunt droppen.

Wat de schoorsteenveger niet vond

We hebben Hugging Face doorzocht op elke repository die het modeltype kimi_linear bevat. Dat waren er 47. Op drie na hebben allemaal 'Kimi' in de naam, en degene die niet van Moonshot zelf zijn, zijn afgeleiden in plaats van adoptanten: AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF en MLX-kwantiseringen op elke bitdiepte; REAP-expert-gesnoeide 35B-varianten van Cerebras; en FlagRelease FlagOS-builds van de Instruct-checkpoint voor NVIDIA-, MetaX- en Hygon-versnellers. Die laatste groep is om een andere reden echt interessant — iemand heeft het werk gedaan om KDA op binnenlandse Chinese silicium te laten draaien — maar niets ervan is een ander lab dat een ander model ontwerpt.

Geen enkel frontiermodel buiten Moonshot claimt KDA. Ling-3.0-flash met 124B totaal en 5.1B actief is op dit moment het plafond van externe adoptie.

En de methode heeft een gat dat een naam verdient, omdat het ingaat tegen ons eigen negatieve resultaat. Een lab dat KDA opnieuw implementeert, registreert zijn eigen modeltype — arcee_kda, qingyi_kda, bailing_hybrid — dus tag-sweeps tellen systematisch precies de adopters die we zoeken te laag, en een model kan het mechanisme gebruiken zonder ooit "KDA" op zijn kaart te schrijven. Afwezigheid van een tag is zwak bewijs, geen bewijs. Als er een vierde of vijfde stille adopter is, zou het op precies deze manier onzichtbaar blijven.

Alle anderen kozen een andere lineaire aandacht.

The reason "Kimi Linear is gaining adoption" is a story at all is that, for most of 2026, it wasn't. Hybrid linear attention swept the open-weight field — but not this variant of it. Per the architecture surveys published in February 2026: Qwen3-Next 80B-A3B and Qwen3.5-397B-A17B both pair Gated DeltaNet with gated attention at 3:1, meaning Qwen3.5-397B-A17B runs 45 recurrent layers against 15 full-attention ones out of 60. The previous Ling flagship used Lightning Attention with MLA at 7:1. Nemotron 3 Nano 30B-A3B and Super 120B-A12B are Mamba-2 hybrids, with just 6 attention layers in a 52-layer stack and 8 in an 88-layer stack respectively. GLM-5 stayed with MLA and added sparse attention on top. MiniMax-M2.5 went the other way entirely and kept plain multi-head attention, reportedly for reliability. And Kimi K2.5, Moonshot's own flagship before K3, was MLA — the lab published KDA in October 2025 and did not put it in its frontier model until July 2026.

Dus de categorie won en de variant niet. Iedereen is het erover eens dat driekwart van je lagen recurrent kan zijn; niemand was het eens over welke recurrentie. Het onderscheidend vermogen van KDA is de per-kanaal-vervalpoort, en de prijs daarvan is dat je de eigen kernels en prefix-caching-infrastructuur nodig hebt in plaats van het Gated DeltaNet-pad dat de helft van het ecosysteem al had. Tot deze maand betaalde één laboratorium die prijs.

De adoptie die al heeft plaatsgevonden, zit in de serving stacks.

Architecturen verspreiden zich niet omdat ze elegant zijn; ze verspreiden zich wanneer de infrastructuur ze goedkoop maakt. Dat onderdeel is voor KDA al geregeld, en het ging sneller dan de adoptie van de modelkaart. Zowel vLLM als SGLang leverden ondersteuning vanaf dag nul toen de gewichten van Kimi K3 op 27 juli 2026 uitkwamen, waarbij Moonshot zijn KDA-prefix-cachingimplementatie upstreamde naar vLLM zelf in plaats van een fork te onderhouden. SGLang leverde gefuseerde KDA- en Gated DeltaNet-kernels en rapporteerde dat de logische KV-capaciteit op identieke hardware steeg van 1,5M naar 12,2M tokens — zijn eigen meting, en het meest concrete efficiëntiecijfer van derden in dit hele verhaal. De referentiekernels bevinden zich in fla-core, die elke kleine trainingsrun kan importeren.

Dat is het verschil tussen Arcee die in december 2025 een bewuste onderzoeksinspanning nodig had en vier anonieme repos die in één week van juli 2026 terloops KDA verklaarden. Het mechanisme werd een afhankelijkheid die je installeert. Of de frontier volgt is een aparte vraag, maar het wrijvingsargument tegen KDA is grotendeels verdampt.

Wat er verandert als je alleen tokens koopt

Niets over jouw code. Je roept KDA nooit aan; je ervaart het als wat een context van een miljoen tokens kost en hoe lang het eerste token erover doet. Kimi K3 is het model waar dat zich vandaag commercieel laat zien — op OrcaRouter kost het $3,00 per miljoen invoertokens en $15,00 per miljoen uitvoertokens, met de volledige 1M-tokencontext en een gemeten p50-time-to-first-token van 8,88 seconden over de afgelopen zeven dagen. Die cijfers zijn in wezen wat de 3:1-KDA-hybride oplevert: het bedienen van een context van een miljoen tokens tegen een prijs die louter duur is in plaats van onbetaalbaar.

Kimi Linear Is Spreading-4.png

Het research-checkpoint is een ander verhaal. Kimi-Linear-48B-A3B-Instruct heeft een MIT-licentie met één inference-provider vermeld op de Hugging Face-pagina, en staat niet op OrcaRouter — als je het wilt draaien, betekent dat self-hosting of die provider. De rekensom voor self-hosting is gunstiger dan het aantal parameters doet vermoeden: 48B-gewichten in bf16 is ruwweg 96 GB, dus twee 80 GB-kaarten, terwijl de 4-bit MLX- en GGUF-conversies rond de 25-30 GB uitkomen en op een enkele kaart of een goed uitgeruste Mac passen. Ling-3.0-flash staat vandaag evenmin op OrcaRouter. We gaan niet doen alsof dat anders is om een punt over routing te maken.

Waar routing hier wel van belang is, zijn de kosten van een verkeerde gok op een architectuur. Hybride lineaire aandachtmodellen zijn precies de categorie waarin de benchmarktabel van de leverancier en uw workload kunnen verschillen — een recurrente toestand van vaste grootte faalt op retrievalpatronen die geen enkele aggregaatscore blootlegt, en dat is de les van dat gehalveerde GSM8K-getal. De vergelijking via één API-sleutel over 200+ modellen uitvoeren betekent dat de test een gewijzigde modelstring is in plaats van een aanschafcyclus, tegen de lijstprijs van de provider met 0% opslag aan onze kant, en met automatische failover, zodat een long-contextmodel dat u nog evalueert geen single point of failure is in een productiepad. Probeer het een dag op uw eigen long-contextverkeer. Dat is een goedkoper antwoord dan welke benchmarktabel dan ook, inclusief de onze.

Vragen die het echt waard zijn om te stellen

Is Kimi Linear hetzelfde als Kimi K3?

Nee, en ze door elkaar halen is de meest voorkomende fout in de berichtgeving over beide. Kimi Linear is het architectuurpaper plus een onderzoeksmodel van 48B totaal en 3B actief, met een context van 1M, eind 2025 onder MIT uitgebracht om aan te tonen dat een KDA-zware hybride volledige MLA verslaat bij gelijke training. Kimi K3 is het vlaggenschip van Moonshot met 2,8 biljoen parameters uit juli 2026 — 104B actief, native multimodaal, 1M context — dat het KDA-3:1-concept naar frontierschaal bracht en Attention Residuals toevoegde, een aparte truc waarvan het lab meldt dat die ongeveer 25% trainingsefficiëntie oplevert voor minder dan 2% extra kosten. Gedeeld mechanisme, totaal andere schaal, capaciteit en prijs. Benchmarks van de ene zeggen heel weinig over de andere.

Waarom zou een lab voor KDA kiezen in plaats van Gated DeltaNet, terwijl de meesten voor Gated DeltaNet kozen?

KDA is een strikte verfijning van Gated DeltaNet, dus de vraag is of de verfijning de overstapkosten waard is. De verfijning is de poort: Gated DeltaNet laat zijn recurrente geheugen vervallen met één scalair per stap, terwijl KDA een verval per feature-kanaal leert, waardoor de toestand een variabelenaam over tienduizend tokens kan vasthouden terwijl het de zin waarin die voorkwam wegspoelt. Moonshots ablatie plaatst dat op ongeveer 0,12 validatie-perplexiteit bij 48B, en de gechunkte DPLR-formulering is geschreven om tensor-kernen bezig te houden, dus de extra expressiviteit kost niet de doorvoer die het oplevert. Daartegenover had Gated DeltaNet al brede kernel- en framework-ondersteuning voordat een van beide modieus was, wat echte technische tijd waard is. Het antwoord van 2026 was vooral "niet de moeite waard". Ling-3.0-flash is de eerste weddenschap op productieschaal die de andere kant op gaat.

Zou iets hiervan veranderen wat ik dit kwartaal uitrol?

Alleen als je zeer lange contexten draait. Als je prompts onder ongeveer 32k tokens blijven, is hybride lineaire aandacht een implementatiedetail zonder invloed op je modelkeuze; kies zoals gewoonlijk op kwaliteit, prijs en latentie. Als je richting 128k en verder gaat, is het de moeite waard om te weten dat de modellen die je kosten bij die lengte beheersbaar houden steeds vaker KDA-hybriden zijn, en dat hun gepubliceerde long-context-scores geaggregeerde benchmarks zijn in plaats van adversarial-recall-probes. Test retrieval op je werkelijke contextlengte in plaats van een RULER-score te vertrouwen. Dat advies zou identiek zijn als het mechanisme Gated DeltaNet of Mamba-2 was.

Waar dit de claim laat

De richting klopt, en het is kleiner dan het klinkt. Wat op 5 augustus 2026 verifieerbaar is, is één productiemodel van een gevestigd lab, één onderzoekspaar van een onafhankelijk Amerikaans lab dat de eerlijke keerzijde publiceerde, een handvol sub-1B-repo's van de afgelopen tien dagen, en een serving-ecosysteem dat de kernel al heeft opgenomen. Dat is meer dan "een truc van één lab" en veel minder dan een standaard. Het getal om in de gaten te houden is niet drie externe modellen — het is of de volgende frontier open-weight release van een lab dat niet Moonshot is, per-channel gating levert, en of iemand buiten Moonshot ooit een recall-probe publiceert die test wat de fixed-size state daadwerkelijk vergeet. Beide zouden je meer vertellen dan nog een screenshot.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube