Kimi Linear Sprider sig-1.png
Engineering & Research

Kimi Linear sprider sig: Varje modell vi kan verifiera kör faktiskt KDA

Författare

Jim Song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

"Wow! Kimi-Linear håller på att få spridning! Det här är typ den tredje externa modellen jag ser." Det var hela inlägget — en rad från @teortaxesTex den 5 augusti 2026, med en skärmdump bifogad och inte en enda modell namngiven. Den förkortade länken i inlägget leder till bilden, inte till ett repo, så det finns inget att klicka vidare till och inget att bekräfta. Påståendet går ändå att kontrollera, och det betyder mer än vad en enradare antyder: om andra labb än Moonshot AI nu bygger på uppmärksamhetsarkitekturen bakom Kimi-Linear-48B-A3B-Instruct och Kimi K3, så har Kimi Delta Attention slutat vara ett enskilt labbs interna trick och börjat bli en ingrediens som andra köper in sig i. Så vi gick ut och letade efter modellerna i stället för skärmdumpen. Det korta svaret: det starkaste exemplet är Ling-3.0-flash, vars eget modellkort beskriver en 5:1-stack av KDA- och MLA-lager; det mest användbara exemplet är ett amerikanskt labbs forskningscheckpoint som kvantifierar vad ren KDA kostar; och på frontlinjeskala, utanför Moonshot, har ingen släppt den.

Vad påståendet är, och vad det inte är

En enda utövare, en enda skärmdump, ingen namngiven modell, ingen bekräftelse. Det är hela bevismaterialet för "ökad användning", och det bör läsas som en uppmaning att gå och kolla snarare än som en nyhet. Vi kunde inte återskapa skärmdumpen, så inget nedan är en bekräftelse av den – allt som följer är vad offentlig modellmetadata visade den 5 augusti 2026, när vi sökte efter den, plus vad varje labb säger i sitt eget modellkort. Där en siffra kommer från en leverantörs egen mätning är den märkt på det sättet, för i just den här historien är nästan varje rubriksiffra det.

En skärm på Kimi Linear, eftersom "adoption" betyder att adoptera detta

Kimi Linear är en uppmärksamhetsarkitektur, publicerad av Kimi Team som arXiv 2510.26692 den 30 oktober 2025, inte en produkt. Dess kärna är Kimi Delta Attention (KDA), som tar Gated DeltaNet och ersätter dess grova glömgrind med finkornig, per-kanal dämpning, så att det återkommande tillståndet lär sig vad det ska behålla kanal för kanal snarare än i sin helhet. Uppdateringen omstruktureras till en chunkad Diagonal-Plus-Low-Rank-form, specifikt för att den ska hamna på tensor-kärnor i stället för att lämna dem overksamma. Den hårdvarufokuseringen är själva poängen med designen: linjär uppmärksamhet har alltid varit billig i teorin och oftast en besvikelse i praktiken.

De släppta checkpoints — Kimi-Linear-48B-A3B-Base och Kimi-Linear-48B-A3B-Instruct — har 48B totala parametrar med 3B aktiva, ett 1M-token-kontextfönster och en MIT-licens. Lagren alternerar ungefär i förhållandet 3:1, tjugo KDA-lager till sju Multi-Head Latent Attention-lager, så att tre av fyra lager är av den billiga rekurrenta typen och vart fjärde behåller exakt global uppmärksamhet.

Vad Moonshot rapporterar, allt mätt mot en full-MLA-baslinje tränad på ett identiskt recept — leverantörssiffror, inte oberoende reproducerade:

• Avkodningsgenomströmning — upp till 6x snabbare tid per utdatatoken vid 1M kontext jämfört med full MLA.

• KV cache — upp till 75% mindre, vilket är varifrån genomströmningen kommer

• Lång kontext — RULER vid 128k: 84,3 för Kimi Linear med en 3,98x hastighetsökning, jämfört med 81,3 för MLA-baslinjen

• Kort kontext — MMLU-Pro vid 4k: 51.0 mot 47.2 för MLA-baslinjen och 47.9 för en Gated DeltaNet-hybrid, i ungefär samma hastighet som full attention, så designen får inte långkontexthastighet på bekostnad av kortkontextkvalitet.

• Förträningsablation — 3:1-hybriden når 5,65 i valideringsperplexitet medan full attention hamnar på 5,77

Den ärliga gränsen för allt detta: den matchade baslinjens bevis stannar vid 48B. Ingen har byggt en full-attention 2.8T tvilling till Kimi K3 att jämföra med, och i en faktakoll i slutet av juli 2026 av K3-arkitekturens påståenden hade inga oberoende genvägsfria långkontextåterkallningssonder publicerats för någon av modellerna. Effektivitetsberättelsen är väl underbyggd. Berättelsen om att "överträffar full attention" är underbyggd i forskningsskala av laboratoriet som skrev studien.

Kimi Linear Is Spreading-2.png

Dragkraften hittills har sett ut som nedladdningar snarare än som andras arkitekturer: 98 164 nedladdningar senaste månaden, 570 gillningar, en inferensleverantör listad på Hugging Face, och ett modellträd med 2 adaptrar, 8 finjusteringar och 24 kvantiseringar. Populär, helt klart. Att den kopierats är en annan fråga.

Det starkaste adoptionsfallet: Ling-3.0-flash

Ling-3.0-flash är den som förverkligar påståendet. Dess Hugging Face-kort beskriver en nativ hybrid linjär uppmärksamhetsarkitektur byggd av en 5:1 alternerande stack av Kimi Delta Attention och MLA — 35 KDA-lager till 7 gated MLA-lager — på en 124B-parameter Mixture-of-Experts-modell med 5.1B aktiva parametrar per token, en 256K-kontext tränad i en progression från 8K till 32K till 256K och en MIT-licens. Det är inte en forskningsleksak från en hobbyist; det är en lanserad modell från ett etablerat labb, och den namnger Moonshots uppmärksamhetsmodul i sin egen arkitekturbeskrivning.

Den är också mer aggressiv när det gäller detta än Moonshot. Moonshot behåller ett exakt-attentionslager av fyra; Ling-3.0-flash behåller ett av sex. Om en design är en belastning så säkrar du dig; du lägger inte färre globala lager än de som uppfann den. Läst tillsammans med den tidigare generationen är det ett byte: arkitekturöversikterna från februari 2026 som katalogiserade denna modellklass hade den tidigare Ling-flaggskeppsmodellen med Lightning Attention ihop med MLA i förhållandet 7:1. Mekanismen ändrades mellan generationerna, och riktningen den ändrades i var mot KDA.

Två varningsord som vi inte vill sopa under mattan. Detta är vad modellkortet rapporterar: vi läste repots egen arkitekturbeskrivning och dess konfiguration, som deklarerar en anpassad modelltyp bailing_hybrid med en BailingMoeV3-implementering — vi granskade inte kärnorna för att bekräfta att matematiken är KDA snarare än KDA-inspirerad. Och repot har ingen KDA-tagg alls; det som dyker upp i en taggsökning är en tredjeparts GGUF-konvertering som någon annan har märkt. Vilket är en användbar varning om metod, och leder direkt till de två följande avsnitten.

Arcee AI genomförde experimentet som Moonshot inte gjorde.

Den mest informativa externa användningen av KDA är inte alls en produkt. Ungefär sex veckor efter Kimi Linear-artikeln, i mitten av december 2025, publicerade Arcee AI två Apache-2.0-forskningscheckpoints — AFM-4.5B-Base-KDA-Only och AFM-4.5B-Base-KDA-NoPE — under sin egen ArceeKDAForCausalLM-implementering, uttryckligen taggade kimi-delta-attention. Deras fråga var den som Moonshots hybriddesign noggrant undviker: kan full attention ersättas helt och hållet? Så de konverterade alla 24 attention-lager till KDA, utan några globala attention-lager kvar, och destillerade resultatet från den ursprungliga AFM-4.5B-Base som lärare vid 32k sekvenslängd.

Deras rapporterade resultat, lärare jämfört med ren KDA-elev:

• MMLU — 63.1 till 55.8, en verklig men överlevbar nedgång

• GSM8K — 52.1 till 26.8, ungefär halverat

• HellaSwag — 78.0 till 74.3, nästan intakt

Kimi Linear Is Spreading-3.png

Formen på den skadan är den intressanta delen. Bred kunskap och sunt förnuft i fortsättningsgenerering överlever oftast att pressas genom ett rekurrent tillstånd med fast storlek. Flerstegsaritmetik, som kräver exakt hämtning av mellanresultat som modellen skrev för flera steg sedan, gör inte det. Arcee rapporterar också att försämringen vid lång kontext är mjuk, utan något tvärt stup. Sammantaget är det de tydligaste offentliga bevisen för varför varje seriös KDA-distribution är en hybrid: Moonshots en-av-fyra globala lager och Ants en-av-sex är inte feghet, de är den del som bevarar aritmetiken.

Vad det inte är: en dom om KDA i stor skala. Detta är en 4.5B-destillation, inte en förträningskörning, och destillation till en förändrad arkitektur förlorar saker som förträning från grunden inte skulle göra. Läs det som ablationen som en leverantör inte hade något incitament att publicera — från ett oberoende labb som inte hade något intresse av svaret.

Den långa svansen: en klunga små KDA-repon under en enda vecka

Under de två allvarliga fallen ligger en spridning av små sådana, och det är datumen som gör dem värda att nämna. NEXIVON-1B-BASE, uppladdad den 31 juli 2026, anger sin modelltyp som, bokstavligen, kda — Apache-2.0, 285 nedladdningar, inga gillningar. qingyi-kda-0.6b, samma vecka, är en finjusterad Qwen3-0.6B-Base med en anpassad qingyi_kda-implementering. Scrapegoat-Tiny-Coder, även den veckan, kombinerar en kda-tagg med en egen 'dual-track parallel attention'-design. Två till, maccy-106m-base och maccy-96m-16k-base, var taggade kimi-delta-attention den 27 och 28 juli.

Ingen av dessa är viktig för sig själv — ensiffriga gillningar, okända författare, parameterantal i forskningsskala. Tillsammans är de förmodligen vad som räknas i "tredje externa modellen jag ser"-antalet, och vi kan inte bekräfta vilka tre, eftersom inlägget inte nämnde några. Signalen i dem är inte modellerna, utan de tio dagarna: fyra oberoende små träningskörningar nådde KDA inom en och en halv vecka, vilket händer när en kernel slutar vara en forskningsartefakt och blir något du kan stoppa in i ett träningsskript över en helg.

Vad svepet inte hittade

Vi frågade Hugging Face om varje repository som innehåller modelltypen kimi_linear. Det fanns 47. Alla utom tre har "Kimi" i namnet, och de som inte är Moonshots egna är derivat snarare än användare: AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF och MLX-kvantiseringar i varje bitdjup; REAP expertbeskurna 35B-varianter från Cerebras; och FlagRelease FlagOS-byggen av Instruct-checkpointen för NVIDIA, MetaX och Hygon-acceleratorer. Den sista gruppen är genuint intressant av en annan anledning — någon gjorde arbetet för att få KDA att köra på inhemskt kinesiskt kisel — men inget av det är ett annat labb som designar en annan modell.

Ingen modell av frontier-klass utanför Moonshot deklarerar KDA. Ling-3.0-flash med 124B totalt och 5.1B aktiva är taket för extern användning just nu.

Och metoden har ett hål värt att namnge, eftersom den går emot vårt eget negativa resultat. Ett labb som återimplementerar KDA registrerar sin egen modelltyp — arcee_kda, qingyi_kda, bailing_hybrid — så taggsökningar systematiskt missar just de användare vi letar efter, och en modell kan använda mekanismen utan att någonsin skriva "KDA" i sitt modellkort. Avsaknad av en tagg är svag evidens, inte bevis. Om det finns en fjärde eller femte tyst användare, så är det precis så här den skulle förbli osynlig.

Alla andra valde en annan linjär attention.

Att ”Kimi Linear vinner mark” överhuvudtaget är en nyhet beror på att den inte gjorde det under större delen av 2026. Hybrid linjär attention svepte över fältet för öppna vikter – men inte denna variant av den. Enligt de arkitekturkartläggningar som publicerades i februari 2026: Qwen3-Next 80B-A3B och Qwen3.5-397B-A17B parar båda ihop Gated DeltaNet med gated attention i förhållandet 3:1, vilket innebär att Qwen3.5-397B-A17B kör 45 återkommande lager mot 15 fullständiga attention-lager av 60. Den tidigare Ling-flaggskeppsmodellen använde Lightning Attention med MLA i förhållandet 7:1. Nemotron 3 Nano 30B-A3B och Super 120B-A12B är Mamba-2-hybrider, med endast 6 attention-lager i en 52-lagers stack respektive 8 i en 88-lagers stack. GLM-5 behöll MLA och lade till sparse attention ovanpå. MiniMax-M2.5 gick en helt annan väg och behöll vanlig multi-head attention, enligt uppgift för tillförlitlighetens skull. Och Kimi K2.5, Moonshots eget flaggskepp före K3, var MLA – labbet publicerade KDA i oktober 2025 och inkluderade det inte i sin frontier-modell förrän i juli 2026.

Så kategorin vann och varianten gjorde det inte. Alla är överens om att tre fjärdedelar av dina lager kan vara rekurrenta; ingen var överens om vilken rekurrens. KDAs differentierare är per-kanal-avklingningsgrinden, och dess kostnad är att du behöver dess anpassade kärnor och dess prefix-cachningsinfrastruktur snarare än den Gated DeltaNet-väg som hälften av ekosystemet redan använde. Fram till denna månad betalade ett labb den kostnaden.

Den adoption som redan skett finns i serverstackarna.

Arkitekturer sprids inte för att de är eleganta; de sprids när infrastrukturen gör dem billiga. Den delen är redan avklarad för KDA, och det skedde snabbare än modellkortsadoptionen. Både vLLM och SGLang levererade stöd från dag ett när Kimi K3:s vikter släpptes den 27 juli 2026, med Moonshot som upstreamade sin KDA-prefixcache-implementering till själva vLLM i stället för att underhålla en fork. SGLang levererade fusionerade KDA- och Gated DeltaNet-kärnor och rapporterade att den logiska KV-kapaciteten steg från 1,5M till 12,2M token på identisk hårdvara — sin egen mätning, och den mest konkreta tredjepartssiffran för effektivitet i hela den här historien. Referenskärnorna ligger i fla-core, som vilken liten träningskörning som helst kan importera.

Det är skillnaden mellan att Arcee krävde en medveten forskningsinsats i december 2025 och att fyra anonyma repo nonchalant deklarerade KDA på en vecka i juli 2026. Mekanismen blev ett beroende du installerar. Huruvida frontlinjen följer efter är en separat fråga, men friktionsargumentet mot KDA har till stor del avdunstat.

Vad ändras om du bara köper tokens

Ingenting om din kod. Du anropar aldrig KDA; du upplever det som vad en kontext på en miljon tokens kostar och hur lång tid den första token tar. Kimi K3 är modellen där det visar sig kommersiellt idag — på OrcaRouter kostar den 3,00 USD per miljon inmatade tokens och 15,00 USD per miljon utmatade, med hela 1M-token-kontexten och en uppmätt p50-tid till första token på 8,88 sekunder under de senaste sju dagarna. Den ekonomin är i huvudsak vad 3:1 KDA-hybriden ger: att betjäna en kontext på en miljon tokens till ett pris som är endast dyrt snarare än oöverkomligt.

Kimi Linear Is Spreading-4.png

Forskningscheckpointen är en annan historia. Kimi-Linear-48B-A3B-Instruct är MIT-licensierad med en inferensleverantör listad på sin Hugging Face-sida, och den finns inte på OrcaRouter – om du vill köra den innebär det egen drift eller den leverantören. Kalkylen för egen drift är mer fördelaktig än vad parameterantalet antyder: 48B-vikter i bf16 är ungefär 96 GB, så två 80 GB-kort, medan 4-bitars MLX- och GGUF-konverteringar hamnar runt 25–30 GB och ryms på ett enda kort eller en välutrustad Mac. Ling-3.0-flash finns inte heller på OrcaRouter idag. Vi tänker inte låtsas något annat för att göra en poäng om routing.

Där routing verkligen spelar roll här är kostnaden av att ha fel om ett arkitekturval. Hybrida linjära uppmärksamhetsmodeller är precis den klass där leverantörens benchmarktabell och din arbetsbelastning kan gå isär — ett tillstånd med fast storlek för återkommande modeller misslyckas med hämtningsmönster som inget aggregerat resultat exponerar, vilket är lärdomen från den halverade GSM8K-siffran. Att köra jämförelsen via en API-nyckel över 200+ modeller innebär att testet är en ändrad modellsträng snarare än en upphandlingscykel, till leverantörens listpris med 0% påslag från vår sida, och med automatisk failover så att en långkontextmodell du fortfarande utvärderar inte är en enda felpunkt i en produktionsväg. Prova det på din egen långkontextstrafik i en dag. Det är ett billigare svar än någon benchmarktabell, inklusive vår.

Frågor som faktiskt är värda att ställa

I don't have enough information to definitively answer whether "Kimi Linear" and "Kimi K3" are the same product. What I can tell you: **Kimi K3** is a model released by Moonshot AI (月之暗面) — specifically their K3 series. However, I'm not familiar with any official product or model officially called "Kimi Linear." I can't confirm that they are the same thing. To get an accurate answer, I'd recommend: - Checking the official Moonshot AI documentation or announcements - Looking at the context where you saw "Kimi Linear" (e.g., a specific platform, API docs, or community discussion) - Searching for recent news about Kimi model naming conventions Could you share where you encountered the term "Kimi Linear"? That might help clarify whether it's an alias, a codename, a third-party implementation, or something else entirely.

Nej, och att blanda ihop dem är det vanligaste felet i bevakningen av båda. Kimi Linear är arkitekturpapperet plus en forskningsmodell med totalt 48B parametrar, 3B aktiva och ett 1M-kontext, släppt under MIT i slutet av 2025 för att demonstrera att en KDA-tung hybrid slår full MLA vid matchad träning. Kimi K3 är Moonshots flaggskepp med 2,8 biljoner parametrar från juli 2026 — 104B aktiva, naturligt multimodala, 1M-kontext — som tog KDA-at-3:1-idén till frontlinjens skala och lade till Attention Residuals, ett separat trick som laboratoriet rapporterar ger cirka 25 % träningseffektivitet för mindre än 2 % extra kostnad. Gemensam mekanism, helt annorlunda skala, kapacitet och pris. Riktmärken från den ena säger mycket lite om den andra.

Varför skulle ett labb välja KDA framför Gated DeltaNet, med tanke på att de flesta valde Gated DeltaNet?

KDA är en strikt förfining av Gated DeltaNet, så frågan är om förfiningen är värd bytekostnaden. Förfiningen är grinden: Gated DeltaNet dämpar sitt återkommande minne med en skalär per steg, medan KDA lär sig en dämpning per funktionskanal, vilket låter tillståndet behålla ett variabelnamn över tio tusen token samtidigt som meningen där det förekom spolas ut. Moonshots ablation placerar det på ungefär 0,12 i valideringsperplexitet vid 48B, och dess chunkade DPLR-formulering skrevs för att hålla Tensor Cores upptagna, så den extra uttrycksfullheten kostar inte den genomströmning den tjänar in. Mot det hade Gated DeltaNet redan brett stöd för kernel och ramverk innan någon av dem var på modet, vilket är värt verklig ingenjörstid. Svaret under 2026 var mestadels ”inte värt det.” Ling-3.0-flash är den första produktionsskaliga satsningen åt andra hållet.

Borde något av detta ändra vad jag distribuerar detta kvartal?

{{1}}Endast om du kör mycket långa kontexter.{{/1}} {{2}}Om dina prompts är under cirka 32k tokens är hybrid linjär attention en implementeringsdetalj utan betydelse för ditt modellval; välj baserat på kvalitet, pris och latens som vanligt.{{/2}} {{3}}Om du pressar 128k och längre är det värt att veta att modellerna som håller dina kostnader rimliga vid den längden i allt högre grad är KDA-hybrider, och att deras publicerade långkontextpoäng är aggregerade riktmärken snarare än adversariella återkallningssonder.{{/3}} {{4}}Testa hämtning vid din faktiska kontextlängd istället för att lita på ett RULER-poäng. Det rådet skulle vara identiskt om mekanismen vore Gated DeltaNet eller Mamba-2.{{/4}}

Var detta lämnar påståendet

Riktningsmässigt rätt, och mindre än det låter som. Vad som är verifierbart den 5 augusti 2026 är en produktionsmodell från ett etablerat labb, ett forskningspar från ett oberoende amerikanskt labb som publicerade den ärliga nackdelen, en handfull sub-1B-repos från de senaste tio dagarna, och ett servingekosystem som redan har absorberat kärnan. Det är mer än "ett labbs trick" och mycket mindre än en standard. Siffran att hålla ögonen på är inte tre externa modeller – det är huruvida nästa frontier-släpp med öppna vikter från ett labb som inte är Moonshot levererar per-kanal-gating, och huruvida någon utanför Moonshot någonsin publicerar en recall-probe som testar vad tillståndet med fast storlek faktiskt glömmer. Båda skulle säga dig mer än en annan skärmdump.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube