Kimi Linear się rozprzestrzenia-1.png
Engineering & Research

Kimi Linear się rozprzestrzenia: każdy model, który możemy zweryfikować, faktycznie uruchamia KDA

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

"Wow! Kimi-Linear się przyjmuje! To już chyba trzeci zewnętrzny model, jaki widzę." To był cały post — jedna linijka od @teortaxesTex z 5 sierpnia 2026 roku, z załączonym zrzutem ekranu i bez wymienienia choćby jednego modelu z nazwy. Skrócony link w nim prowadzi do obrazka, a nie do repozytorium, więc nie ma dokąd przejść ani czym tego potwierdzić. To twierdzenie da się jednak zweryfikować, a jego znaczenie jest większe, niż mogłoby sugerować jedno zdanie: jeśli laboratoria inne niż Moonshot AI budują teraz na projekcie mechanizmu uwagi stojącym za Kimi-Linear-48B-A3B-Instruct i Kimi K3, to Kimi Delta Attention przestała być wewnętrznym trikiem jednego laboratorium, a zaczęła być składnikiem, który inni wdrażają u siebie. Zamiast więc wierzyć zrzutowi ekranu, poszliśmy szukać modeli. Krótka odpowiedź: najbardziej przekonującym przykładem jest Ling-3.0-flash, którego karta modelu opisuje stos warstw KDA i MLA w proporcji 5:1; najbardziej użytecznym przypadkiem jest badawczy checkpoint z amerykańskiego laboratorium, który wycenia, ile kosztuje czyste KDA; a w skali frontier, poza Moonshotem, nikt jej nie wypuścił.

Czym jest twierdzenie, a czym nie jest

Jeden praktyk, jeden zrzut ekranu, żaden model nie wymieniony, żadne potwierdzenie. To cała podstawa dowodowa na „zyskiwanie popularności” i należy to czytać jako sygnał do sprawdzenia, a nie jako wiadomość. Nie udało nam się odtworzyć zrzutu ekranu, więc nic poniżej nie jest jego potwierdzeniem — wszystko, co następuje, to to, co publiczne metadane modelu pokazały 5 sierpnia 2026 r., kiedy go przeszukiwaliśmy, plus to, co każde laboratorium podaje we własnej karcie modelu. Jeśli liczba pochodzi z własnego pomiaru dostawcy, jest tak oznaczona, ponieważ w tej konkretnej historii prawie każda liczba w nagłówkach taka jest.

Jeden ekran w Kimi Linear, ponieważ „adopcja” oznacza zaadoptowanie tego.

Kimi Linear to architektura uwagi, opublikowana przez zespół Kimi jako arXiv 2510.26692 w dniu 30 października 2025 roku, a nie produkt. Jej rdzeniem jest Kimi Delta Attention (KDA), która bierze Gated DeltaNet i zastępuje jego zgrubną bramkę zapominania drobnoziarnistym, kanałowym zanikiem, dzięki czemu stan rekurencyjny uczy się, co zachować kanał po kanale, a nie całościowo. Aktualizacja jest przekształcana do segmentowanej formy Diagonal-Plus-Low-Rank, specjalnie po to, aby trafiała na rdzenie tensorowe, a nie pozostawiała je bezczynnymi. To sprzętowe ujęcie jest sednem projektu: uwaga liniowa zawsze była tania w teorii i zwykle rozczarowująca w praktyce.

Opublikowane checkpointy — Kimi-Linear-48B-A3B-Base i Kimi-Linear-48B-A3B-Instruct — to 48B parametrów łącznie, z czego 3B aktywnych, okno kontekstowe o długości 1M tokenów oraz licencja MIT. Warstwy przeplatają się w proporcji mniej więcej 3:1 — dwadzieścia warstw KDA na siedem warstw Multi-Head Latent Attention — więc trzy z czterech warstw to tania odmiana rekurencyjna, a co czwarta zachowuje dokładną globalną uwagę.

Co raportuje Moonshot, wszystko mierzone względem pełnej linii bazowej MLA wytrenowanej na identycznej recepturze — liczby od dostawcy, nie niezależnie odtworzone:

• Przepustowość dekodowania — nawet 6 razy szybszy czas na token wyjściowy przy kontekście 1M w porównaniu z pełnym MLA.

• KV cache — nawet o 75% mniejszy, co przekłada się na przepustowość

• Długi kontekst — RULER przy 128k: 84.3 dla Kimi Linear z przyspieszeniem 3.98x, wobec 81.3 dla linii bazowej MLA

Krótki kontekst — MMLU-Pro przy 4k: 51,0 wobec 47,2 dla linii bazowej MLA i 47,9 dla hybrydy Gated DeltaNet, przy mniej więcej tej samej prędkości co pełna uwaga, więc ten projekt nie zyskuje szybkości dla długiego kontekstu kosztem jakości dla krótkiego kontekstu.

• Ablacja pretreningu — hybryda 3:1 osiąga walidacyjne perplexity 5,65, podczas gdy pełne attention wynosi 5,77.

Uczciwe ograniczenie tego wszystkiego: dowody z dopasowanych linii bazowych kończą się na 48B. Nikt nie zbudował bliźniaka Kimi K3 z pełną uwagą o 2.8T parametrów, z którym można by porównać, a według weryfikacji faktów dotyczących architektury K3 z końca lipca 2026 r. dla żadnego z modeli nie opublikowano niezależnych testów przywoływania długiego kontekstu bez skrótów. Narracja o wydajności jest dobrze poparta. Narracja o „przewyższaniu pełnej uwagi” jest poparta w skali badawczej przez laboratorium, które napisało artykuł.

Kimi Linear Is Spreading-2.png

Jak dotąd popularność przejawiała się raczej pobraniami niż cudzymi architekturami: 98 164 pobrania w ostatnim miesiącu, 570 polubień, jeden dostawca wnioskowania wymieniony na Hugging Face oraz drzewo modelu obejmujące 2 adaptery, 8 dostrojeń i 24 kwantyzacje. Popularny, to oczywiste. Kopiowany to już inna kwestia.

Najmocniejszy przypadek adopcji: Ling-3.0-flash

Ling-3.0-flash to ten, który czyni to twierdzenie prawdziwym. Jego karta na Hugging Face opisuje natywną hybrydową architekturę uwagi liniowej zbudowaną z naprzemiennego stosu 5:1 warstw Kimi Delta Attention i MLA — 35 warstw KDA na 7 warstw MLA z bramkowaniem — w modelu Mixture-of-Experts o 124 mld parametrów, z 5,1 mld aktywnymi na token, kontekstem 256K trenowanym w progresji 8K → 32K → 256K oraz licencją MIT. To nie zabawka badawcza od hobbysty; to model w produkcji z uznanego laboratorium, który we własnym opisie architektury wymienia moduł uwagi Moonshota.

Jest również bardziej agresywny w tej kwestii niż Moonshot. Moonshot utrzymuje jedną warstwę dokładnej atencji na cztery; Ling-3.0-flash utrzymuje jedną na sześć. Jeśli projekt stanowi obciążenie, zabezpieczasz go; nie przeznaczasz mniej warstw globalnych niż ludzie, którzy go wymyślili. Czytane w zestawieniu z wcześniejszą generacją, to zmiana: przeglądy architektur z lutego 2026 roku, które katalogowały tę klasę modeli, przedstawiały poprzedni flagowy model Ling oparty na Lightning Attention w połączeniu z MLA w stosunku 7:1. Mechanizm zmienił się między generacjami, a kierunek tej zmiany prowadził w stronę KDA.

Dwa zastrzeżenia, których nie będziemy tuszować. To pochodzi z karty modelu: przeczytaliśmy opis architektury samego repozytorium i jego konfigurację, która deklaruje niestandardowy typ modelu bailing_hybrid z implementacją BailingMoeV3 — nie audytowaliśmy jąder, aby potwierdzić, że matematyka jest KDA, a nie inspirowana KDA. A repozytorium nie ma w ogóle żadnego tagu KDA; to, co pojawia się w wyszukiwaniu tagów, to konwersja GGUF strony trzeciej, którą ktoś inny oznaczył. Co jest użyteczną przestrogą metodyczną i prowadzi bezpośrednio do kolejnych dwóch sekcji.

Arcee AI przeprowadziła eksperyment, którego Moonshot nie przeprowadził.

Najbardziej pouczające zewnętrzne zastosowanie KDA wcale nie jest produktem. Około sześć tygodni po publikacji Kimi Linear, w połowie grudnia 2025 roku, Arcee AI opublikowało dwa badawcze punkty kontrolne na licencji Apache-2.0 — AFM-4.5B-Base-KDA-Only i AFM-4.5B-Base-KDA-NoPE — w ramach własnej implementacji ArceeKDAForCausalLM, oznaczone wprost jako kimi-delta-attention. Ich pytanie brzmiało dokładnie tak, jakiego hybrydowa konstrukcja Moonshota starannie unika: czy pełny mechanizm uwagi można zastąpić w całości? W związku z tym zamienili wszystkie 24 warstwy uwagi na KDA, nie pozostawiając żadnych globalnych warstw uwagi, a wynik wydestylowali z oryginalnego AFM-4.5B-Base jako nauczyciela przy długości sekwencji 32k.

Ich zgłoszone wyniki, nauczyciel kontra czysty uczeń KDA:

• MMLU — z 63.1 do 55.8, realny, ale do przeżycia spadek

• GSM8K — z 52,1 do 26,8, mniej więcej o połowę mniej

• HellaSwag — 78.0 do 74.3, prawie bez zmian

Kimi Linear Is Spreading-3.png

Kształt tych uszkodzeń jest najciekawszą częścią. Szeroka wiedza i kontynuacja oparta na zdrowym rozsądku w większości przetrwają przepuszczenie przez stan rekurencyjny o stałym rozmiarze. Arytmetyka wieloetapowa, która wymaga dokładnego odzyskania wyników pośrednich zapisanych przez model kilka kroków wcześniej, już nie. Arcee informuje również, że degradacja długiego kontekstu jest łagodna, bez gwałtownego spadku. Razem wzięte, są to najwyraźniejsze publiczne dowody na to, dlaczego każde poważne wdrożenie KDA jest hybrydą: globalne warstwy co czwarta u Moonshota i co szósta u Anta to nie nieśmiałość, lecz część, która utrzymuje arytmetykę.

Czym to nie jest: werdyktem na temat KDA w dużej skali. To destylacja modelu 4.5B, a nie trening od podstaw, a destylacja do zmienionej architektury traci rzeczy, których trening od zera by nie stracił. Należy to czytać jako ablację, którą dostawca nie miał motywacji publikować — pochodzącą z niezależnego laboratorium, które nie miało interesu w wyniku.

Długi ogon: grupa malutkich repozytoriów KDA w ciągu jednego tygodnia

Pod dwoma poważnymi przypadkami kryje się kilka drobnych, a to daty sprawiają, że warto o nich wspomnieć. NEXIVON-1B-BASE, przesłany 31 lipca 2026 r., deklaruje swój typ modelu jako dosłownie kda — Apache-2.0, 285 pobrań, zero polubień. qingyi-kda-0.6b, w tym samym tygodniu, to fine-tuning Qwen3-0.6B-Base z własną implementacją qingyi_kda. Scrapegoat-Tiny-Coder, również w tym tygodniu, łączy tag kda z własnym projektem „dual-track parallel attention”. Jeszcze dwa modele, maccy-106m-base i maccy-96m-16k-base, zostały oznaczone tagiem kimi-delta-attention 27 i 28 lipca.

Żadna z tych rzeczy nie jest istotna sama w sobie — jednocyfrowe polubienia, nieznani autorzy, liczba parametrów w skali badawczej. Zbiorczo są one prawdopodobnie tym, co zlicza zestawienie „trzeci zewnętrzny model, jaki widzę”, a nie możemy potwierdzić, które trzy, skoro post nie wymienił żadnego. Sygnał w nich to nie modele, lecz dziesięć dni: cztery niezależne małe treningi sięgnęły po KDA w ciągu półtora tygodnia, co ma miejsce, gdy jądro przestaje być artefaktem badawczym, a staje się czymś, co można wrzucić do skryptu treningowego w weekend.

Czego nie znalazło przeszukanie

Zapytaliśmy Hugging Face o każde repozytorium zawierające typ modelu kimi_linear. Było ich 47. Wszystkie oprócz trzech mają „Kimi” w nazwie, a te, które nie są autorstwa Moonshot, są pochodnymi, a nie adoptującymi: kwantyzacje AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF i MLX na każdej głębi bitowej; warianty REAP z przycinaniem ekspertów 35B od Cerebrasa; oraz kompilacje FlagRelease FlagOS checkpointu Instruct dla akceleratorów NVIDIA, MetaX i Hygon. Ta ostatnia grupa jest z innego powodu naprawdę interesująca — ktoś wykonał pracę, aby uruchomić KDA na rodzimych chińskich układach krzemowych — ale żadna z tych rzeczy nie jest kolejnym laboratorium projektującym kolejny model.

Żaden model w skali frontier poza Moonshot nie deklaruje KDA. Ling-3.0-flash z 124B całkowitych i 5.1B aktywnych jest obecnie pułapem zewnętrznej adopcji.

Ta metoda ma lukę, która zasługuje na nazwę, ponieważ przeczy naszemu własnemu negatywnemu wynikowi. Laboratorium, które ponownie implementuje KDA, rejestruje własny typ modelu — arcee_kda, qingyi_kda, bailing_hybrid — więc przeszukiwanie tagów systematycznie zaniża liczbę właśnie tych, których szukamy, a model może korzystać z mechanizmu, nigdy nie wpisując "KDA" w swojej karcie. Nieobecność w tagu to słaby dowód, nie zaś dowód niezbity. Jeśli istnieje czwarty lub piąty cichy użytkownik, właśnie w ten sposób pozostałby niewidoczny.

Wszyscy pozostali wybrali inną uwagę liniową.

The reason "Kimi Linear is gaining adoption" is a story at all is that, for most of 2026, it wasn't. Hybrid linear attention swept the open-weight field — but not this variant of it. Per the architecture surveys published in February 2026: Qwen3-Next 80B-A3B and Qwen3.5-397B-A17B both pair Gated DeltaNet with gated attention at 3:1, meaning Qwen3.5-397B-A17B runs 45 recurrent layers against 15 full-attention ones out of 60. The previous Ling flagship used Lightning Attention with MLA at 7:1. Nemotron 3 Nano 30B-A3B and Super 120B-A12B are Mamba-2 hybrids, with just 6 attention layers in a 52-layer stack and 8 in an 88-layer stack respectively. GLM-5 stayed with MLA and added sparse attention on top. MiniMax-M2.5 went the other way entirely and kept plain multi-head attention, reportedly for reliability. And Kimi K2.5, Moonshot's own flagship before K3, was MLA — the lab published KDA in October 2025 and did not put it in its frontier model until July 2026.

Więc kategoria wygrała, a wariant nie. Wszyscy zgadzają się, że trzy czwarte twoich warstw może być rekurencyjnych; nikt nie zgodził się co do tego, która rekurencja. Cechą wyróżniającą KDA jest bramka zaniku per kanał, a jej kosztem jest to, że potrzebujesz jej niestandardowych jąder i jej prefiksowego buforowania zamiast ścieżki Gated DeltaNet, którą połowa ekosystemu już miała. Aż do tego miesiąca jedno laboratorium poniosło ten koszt.

Adopcja, która już nastąpiła, dotyczy stosów serwujących.

Architektury nie rozpowszechniają się dlatego, że są eleganckie; rozpowszechniają się, gdy infrastruktura czyni je tanimi. Ta część jest już gotowa dla KDA i stało się to szybciej niż adopcja kart modeli. Zarówno vLLM, jak i SGLang zapewniły wsparcie od pierwszego dnia, gdy 27 lipca 2026 r. opublikowano wagi Kimi K3, a Moonshot wniósł swoją implementację cache'owania prefiksów KDA do samego vLLM, zamiast utrzymywać fork. SGLang dostarczył scalone jądra KDA i Gated DeltaNet i odnotował wzrost logicznej pojemności KV z 1,5 mln do 12,2 mln tokenów na identycznym sprzęcie — to pomiar samego SGLang i najbardziej konkretna liczba wydajnościowa od podmiotu trzeciego w całej tej historii. Referencyjne jądra znajdują się w fla-core, które każdy mały przebieg treningowy może zaimportować.

To jest różnica między Arcee, które wymagało celowego wysiłku badawczego w grudniu 2025 roku, a czterema anonimowymi repozytoriami od niechcenia deklarującymi KDA w jednym tygodniu lipca 2026 roku. Mechanizm stał się zależnością, którą się instaluje. To, czy granica podąży, to osobne pytanie, ale argument tarcia przeciwko KDA w dużej mierze wyparował.

Co to zmienia, jeśli kupujesz tylko tokeny

Nic o twoim kodzie. Nigdy nie wywołujesz KDA; doświadczasz go jako kosztu kontekstu miliona tokenów i czasu, jaki zajmuje pierwszy token. Kimi K3 to model, w którym to uwidacznia się komercyjnie dziś — na OrcaRouter kosztuje $3.00 za milion tokenów wejściowych i $15.00 za milion tokenów wyjściowych, z pełnym kontekstem 1M tokenów i zmierzonym p50 czasu do pierwszego tokena wynoszącym 8.88 sekundy w ciągu ostatnich siedmiu dni. Ta ekonomika jest w istocie tym, co zapewnia hybryda KDA 3:1: obsługę kontekstu miliona tokenów w cenie, która jest po prostu droga, a nie zaporowa.

Kimi Linear Is Spreading-4.png

Checkpoint badawczy to inna propozycja. Kimi-Linear-48B-A3B-Instruct jest na licencji MIT, z jednym dostawcą wnioskowania wymienionym na jego stronie Hugging Face, a nie ma go na OrcaRouter — jeśli chcesz go uruchomić, oznacza to self-hosting lub tego dostawcę. Arytmetyka self-hostingu jest przyjaźniejsza, niż sugerowałaby liczba parametrów: wagi 48B w bf16 to mniej więcej 96 GB, więc dwie karty po 80 GB, podczas gdy konwersje 4-bitowe MLX i GGUF oscylują w okolicach 25–30 GB i mieszczą się na pojedynczej karcie lub dobrze wyposażonym Macu. Ling-3.0-flash również nie jest dziś dostępny na OrcaRouter. Nie będziemy udawać, że jest inaczej, aby udowodnić coś na temat routingu.

To, gdzie routing naprawdę ma znaczenie, to koszt pomyłki przy wyborze architektury. Hybrydowe modele z liniową uwagą to dokładnie ta klasa, w której tabela benchmarków dostawcy i Twoje obciążenie mogą być ze sobą sprzeczne — stan rekurencyjny o stałym rozmiarze zawodzi na wzorcach wyszukiwania, których nie ujawnia żaden zagregowany wynik, a to jest lekcja z tego zmniejszonego o połowę wyniku GSM8K. Przeprowadzenie porównania przez jeden klucz API na ponad 200 modelach oznacza, że test to zmieniony ciąg znaków modelu, a nie proces zakupowy — po cenniku dostawcy, z 0% narzutu po naszej stronie i z automatycznym przełączaniem awaryjnym, aby model długiego kontekstu, który wciąż oceniasz, nie był pojedynczym punktem awarii na ścieżce produkcyjnej. Wypróbuj to przez dzień na własnym ruchu długiego kontekstu. To tańsza odpowiedź niż jakakolwiek tabela benchmarków, w tym nasza.

Pytania, które naprawdę warto zadać

Czy Kimi Linear to to samo co Kimi K3?

Nie, a mylenie ich to najczęstszy błąd w relacjonowaniu obu tych rzeczy. Kimi Linear to artykuł o architekturze plus model badawczy o łącznej liczbie 48B parametrów, z 3B aktywnymi, z kontekstem 1M, wydany na licencji MIT pod koniec 2025 roku, aby pokazać, że hybryda oparta na KDA pokonuje pełne MLA przy tych samych parametrach treningu. Kimi K3 to flagowy model Moonshota z lipca 2026 roku o 2,8 biliona parametrów — 104B aktywnych, natywnie multimodalny, kontekst 1M — który przeniósł pomysł KDA w proporcji 3:1 na skalę frontiera i dodał Attention Residuals, osobną sztuczkę, która według laboratorium daje około 25% oszczędności w treningu przy niespełna 2% dodatkowych kosztów. Wspólny mechanizm, ale zupełnie inna skala, możliwości i cena. Benchmarki jednego mówią bardzo niewiele o drugim.

Dlaczego laboratorium miałoby wybrać KDA zamiast Gated DeltaNet, skoro większość wybrała Gated DeltaNet?

KDA jest ścisłym udoskonaleniem Gated DeltaNet, więc pytanie brzmi, czy to udoskonalenie jest warte kosztu przejścia. Tym udoskonaleniem jest bramka: Gated DeltaNet osłabia swoją pamięć rekurencyjną jednym skalarem na krok, podczas gdy KDA uczy się zaniku dla każdego kanału cech, co pozwala stanowi przechowywać nazwę zmiennej przez dziesięć tysięcy tokenów, jednocześnie usuwając zdanie, w którym się pojawiła. Ablacja Moonshota szacuje to na około 0.12 perplexity walidacyjnej przy 48B, a jej sformułowanie DPLR w wersji fragmentarycznej zostało zaprojektowane tak, aby utrzymać rdzenie tensorowe w ciągłej pracy, więc dodatkowa ekspresyjność nie kosztuje przepustowości, którą zyskuje. Przeciwko temu przemawia fakt, że Gated DeltaNet miał już szerokie wsparcie w jądrach i frameworkach, zanim którekolwiek z nich stało się modne, co jest warte realnego czasu inżynierskiego. Odpowiedź w 2026 roku brzmiała w większości „nie warto”. Ling-3.0-flash to pierwszy zakład na skalę produkcyjną w przeciwnym kierunku.

Czy którekolwiek z tego powinno zmienić to, co wdrażam w tym kwartale?

Tylko jeśli używasz bardzo długich kontekstów. Jeśli twoje prompty mają poniżej około 32k tokenów, hybrydowa uwaga liniowa to szczegół implementacyjny, który nie ma wpływu na wybór modelu; wybieraj jak zwykle na podstawie jakości, ceny i opóźnień. Jeśli sięgasz do 128k i więcej, warto wiedzieć, że modele, które utrzymują koszty na rozsądnym poziomie przy takiej długości, to w coraz większym stopniu hybrydy KDA, a ich publikowane wyniki dla długich kontekstów to zagregowane benchmarki, a nie adwersarialne sondy przywoływania informacji. Przetestuj wyszukiwanie przy swojej rzeczywistej długości kontekstu, zamiast ufać wynikowi RULER. Ta rada byłaby identyczna, gdyby mechanizm był Gated DeltaNet lub Mamba-2.

Co to oznacza dla twierdzenia

Kierunkowo słuszne i mniejsze, niż się wydaje. To, co można zweryfikować 5 sierpnia 2026 r., to jeden produkcyjny model z uznanego laboratorium, jedna para badawcza z niezależnego amerykańskiego laboratorium, które opublikowało uczciwą ocenę wad, garść repozytoriów sub-1B z ostatnich dziesięciu dni oraz ekosystem serwowania, który już wchłonął rdzeń. To więcej niż „sztuczka jednego laboratorium” i znacznie mniej niż standard. Liczba, na którą warto patrzeć, to nie trzy zewnętrzne modele — lecz to, czy kolejne wydanie open-weight z najwyższej półki od laboratorium innego niż Moonshot dostarczy bramkowanie per-kanałowe, oraz czy ktokolwiek poza Moonshot opublikuje sondę przypominania, która testuje, co stan o stałym rozmiarze faktycznie zapomina. Oba powiedzą ci więcej niż kolejny zrzut ekranu.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube