
Kimi Linear si sta diffondendo: ogni modello che possiamo verificare esegue effettivamente KDA
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenNUOVOQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 198 tok/s
- orcaNUOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1653Intelligenza69Codice60Matematica
"Wow! Kimi-Linear sta prendendo piede! È tipo il terzo modello esterno che vedo." Questo era l'intero post: una riga di @teortaxesTex del 5 agosto 2026, con uno screenshot allegato e senza un solo modello nominato. Il link abbreviato nel post porta all'immagine, non a un repository, quindi non c'è nulla da cliccare né nulla che la confermi. L'affermazione è comunque verificabile, e conta più di quanto una riga lasci intendere: se altri laboratori oltre a Moonshot AI stanno ora costruendo sul design dell'attenzione alla base di Kimi-Linear-48B-A3B-Instruct e Kimi K3, allora Kimi Delta Attention ha smesso di essere un trucco interno di un singolo laboratorio ed è diventata un ingrediente che altri adottano. Così siamo andati a cercare i modelli invece dello screenshot. In breve: il caso più solido è Ling-3.0-flash, la cui scheda del modello descrive uno stack 5:1 di layer KDA e MLA; il caso più utile è un checkpoint di ricerca di un laboratorio statunitense che quantifica il costo della pura KDA; e su scala frontier, fuori da Moonshot, nessuno l'ha ancora rilasciata.
Cos'è l'affermazione e cosa non è
Un singolo professionista, uno screenshot, nessun modello nominato, nessuna conferma. Questa è l'intera base probatoria per «in fase di adozione», e dovrebbe essere letta come un invito a verificare piuttosto che come una notizia. Non siamo riusciti a riprodurre lo screenshot, quindi nulla di quanto segue ne è una conferma: tutto ciò che segue è ciò che mostravano i metadati pubblici dei modelli il 5 agosto 2026, quando abbiamo effettuato la verifica, oltre a ciò che ogni laboratorio dichiara nella propria scheda modello. Quando un numero proviene da una misurazione del fornitore stesso, è etichettato come tale, perché in questa particolare storia quasi ogni numero di rilievo lo è.
Una schermata su Kimi Linear, perché "adozione" significa adottare questo.
Kimi Linear è un'architettura di attenzione, pubblicata dal Kimi Team come arXiv 2510.26692 il 30 ottobre 2025, non un prodotto. Il suo cuore è Kimi Delta Attention (KDA), che prende Gated DeltaNet e sostituisce il suo gate di dimenticanza grossolano con un decadimento fine, per canale, così lo stato ricorrente impara cosa conservare canale per canale anziché in blocco. L'aggiornamento è ristrutturato in forma a blocchi, Diagonal-Plus-Low-Rank, proprio per atterrare sui tensor core invece di lasciarli inattivi. Questa prospettiva hardware è il punto del progetto: l'attenzione lineare è sempre stata economica in teoria, e di solito deludente in pratica.
I checkpoint rilasciati — Kimi-Linear-48B-A3B-Base e Kimi-Linear-48B-A3B-Instruct — hanno 48B di parametri totali con 3B attivi, una finestra di contesto di 1 milione di token e una licenza MIT. I layer si alternano in un rapporto di circa 3:1: venti layer KDA per sette layer Multi-Head Latent Attention, quindi tre layer su quattro sono del tipo ricorrente a basso costo e ogni quarto mantiene un'attenzione globale esatta.
{{1}}Ciò che Moonshot riporta, tutto misurato rispetto a una baseline full-MLA addestrata con una ricetta identica — numeri forniti dal fornitore, non riprodotti in modo indipendente:{{/1}}
• Throughput di decodifica — fino a 6 volte più veloce in termini di tempo per token di output a 1M di contesto rispetto alla MLA completa.
• KV cache — fino al 75% più piccola, ed è da qui che deriva il throughput.
• Contesto lungo — RULER a 128k: 84.3 per Kimi Linear con un'accelerazione di 3.98x, contro 81.3 per la baseline MLA
• Contesto breve — MMLU-Pro a 4k: 51.0 contro 47.2 per la baseline MLA e 47.9 per un ibrido Gated DeltaNet, a circa la stessa velocità dell'attenzione completa, quindi il design non sta ottenendo velocità sul contesto lungo sacrificando la qualità sul contesto breve.
• Ablazione del pre-addestramento — l'ibrido 3:1 raggiunge una perplessità di validazione di 5.65, mentre l'attenzione completa si attesta a 5.77.
{{1}}Il limite onesto in tutto questo:{{/1}} {{2}}le prove con baseline appaiate si fermano a 48B.{{/2}} {{3}}Nessuno ha costruito un gemello full-attention da 2.8T di Kimi K3 da confrontare,{{/3}} {{4}}e, a partire da un fact-check di fine luglio 2026 sulle affermazioni riguardanti l'architettura K3,{{/4}} {{5}}nessun test indipendente di richiamo a lungo contesto senza scorciatoie era stato pubblicato per nessuno dei due modelli.{{/5}} {{6}}La narrazione sull'efficienza è ben supportata.{{/6}} {{7}}La narrazione del "supera l'attenzione completa" è supportata{{/7}} {{8}}a scala di ricerca dal laboratorio che ha scritto l'articolo.{{/8}}

Finora, la trazione è sembrata più una questione di download che di architetture altrui: 98.164 download nell'ultimo mese, 570 mi piace, un provider di inferenza elencato su Hugging Face e un albero di modelli con 2 adapter, 8 fine-tuning e 24 quantizzazioni. Popolare, chiaramente. Che sia stato copiato è un'altra questione.
Il caso di adozione più forte: Ling-3.0-flash
Ling-3.0-flash è quello che rende reale l'affermazione. La sua scheda Hugging Face descrive un'architettura di attenzione lineare ibrida nativa costruita da uno stack alternato 5:1 di Kimi Delta Attention e MLA — 35 layer KDA su 7 layer MLA gated — su un modello Mixture-of-Experts da 124B parametri con 5.1B attivi per token, un contesto di 256K addestrato in una progressione da 8K a 32K a 256K, e una licenza MIT. Non è un giocattolo di ricerca di un hobbista; è un modello in produzione di un laboratorio affermato, e nomina il modulo di attenzione di Moonshot nella propria descrizione dell'architettura.
È anche più aggressivo in questo rispetto a Moonshot. Moonshot mantiene un layer di attenzione esatta ogni quattro; Ling-3.0-flash ne mantiene uno ogni sei. Se un design è un punto debole, lo copri; non usi meno layer globali di chi lo ha inventato. Letto insieme alla generazione precedente, è un cambio di rotta: gli studi di architettura del febbraio 2026 che catalogavano questa classe di modelli avevano il precedente flagship Ling su Lightning Attention abbinato a MLA con un rapporto di 7:1. Il meccanismo è cambiato tra le generazioni, e la direzione in cui è cambiato era verso KDA.
Due avvertenze che non passeremo sotto silenzio. Questo è quanto dichiarato nella scheda: abbiamo letto la descrizione dell'architettura del repository e la sua configurazione, che dichiara un tipo di modello personalizzato bailing_hybrid con un'implementazione BailingMoeV3 — non abbiamo esaminato i kernel per confermare che la matematica sia KDA piuttosto che ispirata a KDA. E il repository non riporta alcun tag KDA; ciò che compare in una ricerca per tag è una conversione GGUF di terze parti etichettata da qualcun altro. Il che è un utile avvertimento sul metodo e porta direttamente alle prossime due sezioni.
Arcee AI ha condotto l'esperimento che Moonshot non ha fatto.
L'uso esterno più informativo di KDA non è affatto un prodotto. Circa sei settimane dopo l'articolo Kimi Linear, a metà dicembre 2025, Arcee AI ha pubblicato due checkpoint di ricerca Apache-2.0 — AFM-4.5B-Base-KDA-Only e AFM-4.5B-Base-KDA-NoPE — sotto la propria implementazione ArceeKDAForCausalLM, etichettati esplicitamente come kimi-delta-attention. La loro domanda era quella che il design ibrido di Moonshot evita accuratamente: l'attenzione completa può essere sostituita interamente? Così hanno convertito tutti i 24 livelli di attenzione in KDA, senza lasciare livelli di attenzione globale, e hanno distillato il risultato dall'originale AFM-4.5B-Base come insegnante a una lunghezza di sequenza di 32k.
I loro risultati riportati, insegnante contro studente pure-KDA:
• MMLU — da 63.1 a 55.8, un calo reale ma superabile
• GSM8K — da 52.1 a 26.8, circa dimezzato
• HellaSwag — da 78,0 a 74,3, quasi invariato

La forma di quel danno è la parte interessante. La conoscenza ampia e la continuazione basata sul senso comune sopravvivono per lo più all'essere spinte attraverso uno stato ricorrente di dimensione fissa. L'aritmetica a più passaggi, che richiede il recupero esatto dei risultati intermedi che il modello ha scritto diversi passaggi fa, non sopravvive. Arcee riporta anche che il degrado del contesto lungo è graduale, senza un precipizio netto. Nell'insieme, è la prova pubblica più chiara del perché ogni implementazione KDA seria sia ibrida: i layer globali uno ogni quattro di Moonshot e uno ogni sei di Ant non sono timidezza, ma la parte che conserva l'aritmetica.
Ciò che non è: un verdetto su KDA a larga scala. Questa è una distillazione da 4.5B, non un run di pre-training, e la distillazione in un'architettura modificata perde cose che il pre-training da zero non perderebbe. Leggetelo come lo studio di ablazione che un fornitore non aveva alcun incentivo a pubblicare — da un laboratorio indipendente che non aveva alcun interesse nella risposta.
La lunga coda: un gruppo di piccoli repo KDA in una sola settimana
Sotto i due casi seri si trova una manciata di casi minori, e sono le date a renderli degni di menzione. NEXIVON-1B-BASE, caricato il 31 luglio 2026, dichiara il proprio tipo di modello come, letteralmente, kda — Apache-2.0, 285 download, nessun like. qingyi-kda-0.6b, nella stessa settimana, è un fine-tuning di Qwen3-0.6B-Base che include un'implementazione personalizzata di qingyi_kda. Scrapegoat-Tiny-Coder, sempre in quella settimana, combina un tag kda con un design "dual-track parallel attention" tutto suo. Due altri, maccy-106m-base e maccy-96m-16k-base, sono stati etichettati kimi-delta-attention il 27 e 28 luglio.
Nessuna di queste cose è importante di per sé — mi piace a una cifra, autori sconosciuti, conteggi di parametri su scala di ricerca. Collettivamente, sono probabilmente ciò che sta contando il totale del "terzo modello esterno che vedo", e non possiamo confermare quali tre, poiché il post non ne ha nominato nessuno. Il segnale in essi non sono i modelli, sono i dieci giorni: quattro piccole sessioni di addestramento indipendenti hanno raggiunto KDA entro una settimana e mezza, il che accade quando un kernel smette di essere un artefatto di ricerca e diventa qualcosa che puoi inserire in uno script di addestramento in un fine settimana.
Ciò che la perquisizione non ha trovato
Abbiamo interrogato Hugging Face per ogni repository che contiene il tipo di modello kimi_linear. Erano 47. Tutti tranne tre hanno "Kimi" nel nome, e quelli che non sono di Moonshot sono derivati piuttosto che adottanti: quantizzazioni AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF e MLX a ogni profondità di bit; varianti REAP con potatura esperta da 35B di Cerebras; e build FlagRelease FlagOS del checkpoint Instruct per gli acceleratori NVIDIA, MetaX e Hygon. Quest'ultimo gruppo è genuinamente interessante per un motivo diverso: qualcuno ha fatto il lavoro per far girare KDA su silicio cinese domestico, ma nessuno di questi è un altro laboratorio che progetta un altro modello.
Nessun modello su scala di frontiera al di fuori di Moonshot dichiara KDA. Ling-3.0-flash con 124B totali e 5.1B attivi è il tetto dell'adozione esterna in questo momento.
E il metodo ha un buco che merita di essere nominato, perché va contro il nostro stesso risultato negativo. Un laboratorio che reimplementa KDA registra il proprio tipo di modello — arcee_kda, qingyi_kda, bailing_hybrid — quindi le ricerche per tag sottostimano sistematicamente proprio gli adottanti che stiamo cercando, e un modello può usare il meccanismo senza mai scrivere "KDA" nella sua scheda. L'assenza da un tag è una prova debole, non una prova. Se esiste un quarto o quinto adottante silenzioso, è esattamente così che rimarrebbe invisibile.
Tutti gli altri hanno scelto un'attenzione lineare diversa.
Il motivo per cui "Kimi Linear sta guadagnando adozione" è una notizia è che, per la maggior parte del 2026, non lo era. L'attenzione lineare ibrida ha dominato il campo dei modelli open-weight — ma non questa sua variante. Secondo le analisi delle architetture pubblicate a febbraio 2026: Qwen3-Next 80B-A3B e Qwen3.5-397B-A17B abbinano entrambi Gated DeltaNet all'attenzione gated in un rapporto 3:1, il che significa che Qwen3.5-397B-A17B ha 45 strati ricorrenti contro 15 a piena attenzione su 60. Il precedente modello di punta Ling usava Lightning Attention con MLA in rapporto 7:1. Nemotron 3 Nano 30B-A3B e Super 120B-A12B sono ibridi Mamba-2, con solo 6 strati di attenzione in uno stack di 52 strati e 8 in uno stack di 88 strati, rispettivamente. GLM-5 ha mantenuto MLA e ha aggiunto sopra l'attenzione sparsa. MiniMax-M2.5 ha preso una strada completamente opposta e ha mantenuto la semplice attenzione multi-testa, a quanto si dice per affidabilità. E Kimi K2.5, il flagship di Moonshot prima di K3, era MLA: il laboratorio ha pubblicato KDA a ottobre 2025 e non lo ha integrato nel suo modello di frontiera fino a luglio 2026.
Quindi la categoria ha vinto e la variante no. Tutti concordano che tre quarti dei tuoi strati possono essere ricorrenti; nessuno concordava su quale ricorrenza. Il differenziatore di KDA è il gate di decay per canale, e il suo costo è che hai bisogno dei suoi kernel personalizzati e della sua infrastruttura di prefix-caching invece del percorso Gated DeltaNet che metà dell'ecosistema aveva già. Fino a questo mese, un solo laboratorio ha sostenuto quel costo.
L'adozione che è già avvenuta è negli stack di serving.
Le architetture non si diffondono perché sono eleganti; si diffondono quando l'infrastruttura le rende economiche. Per KDA questa parte è già fatta, ed è successo più in fretta dell'adozione della model card. Sia vLLM che SGLang hanno fornito supporto day-zero quando i pesi di Kimi K3 sono stati pubblicati il 27 luglio 2026, con Moonshot che ha integrato la propria implementazione di prefix-caching KDA direttamente in vLLM invece di mantenere un fork. SGLang ha distribuito kernel fusi KDA e Gated DeltaNet e ha riportato una capacità KV logica passata da 1,5M a 12,2M token su hardware identico — una sua misurazione, e la cifra di efficienza di terze parti più concreta dell'intera vicenda. I kernel di riferimento vivono in fla-core, che qualsiasi piccolo run di addestramento può importare.
Questa è la differenza tra Arcee che richiede un deliberato sforzo di ricerca nel dicembre 2025 e quattro repository anonimi che dichiarano disinvoltamente KDA in una settimana di luglio 2026. Il meccanismo è diventato una dipendenza che installi. Che la frontiera segua è una questione separata, ma l'argomento dell'attrito contro KDA è in gran parte svanito.
Cosa cambia se acquisti solo token
Non c'entra nulla il tuo codice. Non chiami mai KDA; lo percepisci come ciò che costa un contesto da un milione di token e quanto tempo impiega il primo token. Kimi K3 è il modello in cui questo si manifesta commercialmente oggi — su OrcaRouter gira a $3,00 per milione di token in input e $15,00 per milione in output, con l'intero contesto da 1M token e un p50 time-to-first-token misurato di 8,88 secondi negli ultimi sette giorni. Questi costi sono, in sostanza, ciò che si ottiene con l'ibrido KDA 3:1: servire un contesto da un milione di token a un prezzo semplicemente caro, non proibitivo.

Il checkpoint di ricerca è un altro discorso. Kimi-Linear-48B-A3B-Instruct è con licenza MIT con un solo provider di inferenza elencato nella sua pagina Hugging Face, e non è su OrcaRouter — se vuoi eseguirlo, significa self-hosting o quel provider. L'aritmetica del self-hosting è più favorevole di quanto suggerisca il numero di parametri: i pesi 48B in bf16 sono circa 96 GB, quindi due schede da 80 GB, mentre le conversioni MLX e GGUF a 4 bit si aggirano intorno ai 25-30 GB e stanno su una singola scheda o su un Mac con specifiche elevate. Allo stesso modo, Ling-3.0-flash non è su OrcaRouter oggi. Non fingeremo il contrario per fare un punto sul routing.
Dove il routing conta davvero è il costo di sbagliare una scommessa architetturale. I modelli ibridi a attenzione lineare sono esattamente la classe in cui la tabella di benchmark del fornitore e il tuo carico di lavoro possono discordare: uno stato ricorrente a dimensione fissa fallisce su pattern di recupero che nessun punteggio aggregato espone, ed è questa la lezione di quel numero GSM8K dimezzato. Eseguire il confronto tramite una sola chiave API su oltre 200 modelli significa che il test è una stringa di modello cambiata piuttosto che un ciclo di approvvigionamento, al prezzo di listino del fornitore con 0% di margine da parte nostra, e con failover automatico, così che un modello a contesto lungo ancora in valutazione non sia un singolo punto di guasto in un percorso di produzione. Provalo sul tuo traffico a contesto lungo per un giorno. È una risposta più economica di qualsiasi tabella di benchmark, inclusa la nostra.
Domande che vale davvero la pena porre
Kimi Linear è la stessa cosa di Kimi K3?
No, e confonderli è l'errore più comune nella copertura di entrambi. Kimi Linear è il paper sull'architettura più un modello di ricerca da 48B totali, 3B attivi, con un contesto di 1M, rilasciato sotto licenza MIT alla fine del 2025 per dimostrare che un ibrido pesante su KDA supera la MLA completa a parità di addestramento. Kimi K3 è il modello di punta di Moonshot da 2,8 trilioni di parametri, risalente a luglio 2026 — 104B attivi, nativamente multimodale, contesto di 1M — che ha portato l'idea del KDA a rapporto 3:1 a scala di frontiera e ha aggiunto gli Attention Residuals, un trucco separato che il laboratorio riporta offrire circa il 25% di efficienza di addestramento per meno del 2% di costo aggiuntivo. Meccanismo condiviso, scala, capacità e prezzo completamente diversi. I benchmark dell'uno dicono molto poco sull'altro.
Perché un laboratorio sceglierebbe KDA invece di Gated DeltaNet, dato che la maggior parte ha scelto Gated DeltaNet?
KDA è un raffinamento stretto di Gated DeltaNet, quindi la domanda è se il raffinamento valga il costo del passaggio. Il raffinamento è il gate: Gated DeltaNet attenua la sua memoria ricorrente con uno scalare per passo, mentre KDA apprende un decadimento per canale di feature, il che consente allo stato di mantenere un nome di variabile per diecimila token, eliminando al contempo la frase in cui compariva. L'ablation di Moonshot lo colloca a circa 0,12 di perplessità di validazione a 48B, e la sua formulazione DPLR a chunk è stata scritta per tenere occupati i tensor core, quindi l'espressività aggiuntiva non costa il throughput che guadagna. A fronte di ciò, Gated DeltaNet aveva già un ampio supporto di kernel e framework prima che entrambi fossero di moda, e questo vale un reale investimento di tempo ingegneristico. La risposta del 2026 è stata per lo più "non ne vale la pena". Ling-3.0-flash è la prima scommessa su scala produttiva nella direzione opposta.
Dovrebbe qualcosa di tutto ciò cambiare ciò che distribuisco questo trimestre?
Solo se stai eseguendo contesti molto lunghi. Se i tuoi prompt sono sotto circa 32k token, l'attenzione lineare ibrida è un dettaglio implementativo che non incide sulla scelta del modello; scegli in base a qualità, prezzo e latenza come al solito. Se superi i 128k, vale la pena sapere che i modelli che mantengono i tuoi costi ragionevoli a quella lunghezza sono sempre più ibridi KDA, e che i loro punteggi pubblicati sul contesto lungo sono benchmark aggregati piuttosto che test di recupero avversariali. Testa il recupero alla tua lunghezza di contesto reale invece di fidarti di un punteggio RULER. Questo consiglio sarebbe identico se il meccanismo fosse Gated DeltaNet o Mamba-2.
Dove questo lascia l'affermazione
Nella direzione giusta, e più piccolo di quanto sembri. Ciò che è verificabile al 5 agosto 2026 è un modello di produzione di un laboratorio affermato, un paio di ricerche di un laboratorio indipendente statunitense che ha pubblicato l'onesto lato negativo, una manciata di repository sub-1B degli ultimi dieci giorni e un ecosistema di serving che ha già assorbito il kernel. Questo è più di un "trucco di un singolo laboratorio" e molto meno di uno standard. Il numero da osservare non è tre modelli esterni — è se la prossima release open-weight di frontiera di un laboratorio che non sia Moonshot includerà il gating per canale, e se qualcuno al di fuori di Moonshot pubblicherà mai una sonda di recall che testi cosa lo stato a dimensione fissa dimentica davvero. Entrambe le cose ti direbbero più di un altro screenshot.
