
Kimi Linear 正在擴散:我們能驗證的每個模型實際上都在運行 KDA
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 198 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1653智能69程式60數學
「哇!Kimi-Linear 正在獲得採用!這已經是我看到的第三個外部模型了。」這就是那則貼文的全部內容——@teortaxesTex 在 2026 年 8 月 5 日發布的一句話,附了一張截圖,卻一個模型名稱都沒提到。貼文中的縮短連結解析到那張圖片,而不是某個程式碼儲存庫,所以既沒有東西可以點進去,也沒有任何東西可以佐證。不過這個說法終究還是可以查證,而且它的重要性遠比一句話所呈現的還要大:如果除了 Moonshot AI 之外,其他實驗室現在也都在以Kimi-Linear-48B-A3B-Instruct與Kimi K3背後的注意力設計為基礎進行開發,那麼 Kimi Delta Attention 已經不再只是一家實驗室的內部手法,而是開始成為其他人願意採用的要素。於是我們沒有盯著截圖,而是直接去找那些模型。簡而言之,最有力的案例是Ling-3.0-flash,其模型卡本身描述了 KDA 與 MLA 層以 5:1 比例堆疊的結構;最有用的案例是一家美國實驗室的研究檢查點,量化了純 KDA 所付出的代價;而在前沿規模上,除了 Moonshot 之外,還沒有人把它真正推出。
此主張是什麼,以及它不是什麼。
一位從業者、一張截圖、未指名型號、無任何佐證。這就是「獲得採用」的全部證據基礎;與其說它是新聞,不如說它是在提示你自行查證。我們無法重現那張截圖,所以以下內容並非對它的確認——以下一切都是我們在 2026 年 8 月 5 日掃描時,公開模型元資料所顯示的內容,加上各家實驗室在其模型卡中的自行表述。凡數字出自供應商自身的測量,文中都會如此標註,因為在這個特別的故事裡,幾乎每個頭條數字都是如此。
Kimi Linear 上的一個畫面,因為「採用」意味著採用這個
Kimi Linear 是一種注意力架構,由 Kimi Team 於 2025 年 10 月 30 日以 arXiv 2510.26692 發表,並非產品。其核心是 Kimi Delta Attention(KDA),它採用 Gated DeltaNet,並將其粗略的遺忘閘替換為細粒度、逐通道的衰減,使循環狀態能逐通道學習該保留什麼,而非整體性地取捨。更新被重構為分塊的對角加低秩(Diagonal-Plus-Low-Rank)形式,目的正是為了讓它落在張量核心上執行,而不是讓張量核心閒置。這種硬體框架思維正是設計的重點:線性注意力在理論上向來便宜,但在實務上通常令人失望。
已發布的檢查點 — Kimi-Linear-48B-A3B-Base 和 Kimi-Linear-48B-A3B-Instruct — 總參數為 48B,其中 3B 為活躍參數,支援 100 萬 token 的上下文窗口,並採用 MIT 許可證。層的配置大致以 3:1 的比例交替,二十個 KDA 層對應七個 Multi-Head Latent Attention 層,因此每四層中有三層是廉價的循環層,而每第四層保留精確的全域注意力。
Moonshot 所報告的內容,全部以採用相同配方訓練的完整 MLA 基線為對照標準——這些是廠商數據,並非獨立重現的結果:
• 解碼吞吐量 — 在 1M 上下文下,每個輸出 token 的時間比完整 MLA 快最多 6 倍
• KV cache — 體積減少高達 75%,吞吐量的提升正源於此
• 長上下文 — RULER 在 128k 下:Kimi Linear 為 84.3,加速 3.98 倍,而 MLA 基線為 81.3
簡短背景 — 在4k長度下的MMLU-Pro:得分為51.0,對比MLA基線的47.2和Gated DeltaNet混合模型的47.9,且速度與完整注意力機制大致相同,因此該設計並未以犧牲短上下文品質來換取長上下文速度。
• 預訓練消融 — 3:1 混合模型達到 5.65 的驗證困惑度,而完整注意力落在 5.77
關於這一切,誠實的限制在於:匹配基線的證據止於 48B。沒有人建立一個完整注意力機制的 2.8T 規模 Kimi K3 雙生版本來進行對照;且截至 2026 年 7 月下旬對 K3 架構聲明的事實查核為止,兩種模型都尚未有獨立的、無捷徑的長上下文召回探測發表。效率方面的論述有充分證據支持。而「優於完整注意力」的論述,則由撰寫論文的實驗室在研究規模上提供支持。

目前為止,所謂的吸引力看起來像是下載次數,而不是別人的架構:過去一個月有 98,164 次下載、570 個讚、Hugging Face 上列出了一個推論提供者,以及一個包含 2 個適配器、8 個微調和 24 個量化的模型樹。顯然很受歡迎。但被複製則是另一回事。
最強採用案例:Ling-3.0-flash
Ling-3.0-flash 就是讓這項宣稱成真的模型。它的 Hugging Face 卡片描述了一種原生混合線性注意力架構,由 Kimi Delta Attention 與 MLA 以 5:1 交錯堆疊而成——35 層 KDA 配上 7 層 gated MLA——建構在一個 124B 參數的 Mixture-of-Experts 模型上,每個 token 啟用 5.1B 參數,具備 256K 上下文,並以 8K 到 32K 再到 256K 的遞進方式訓練,且採用 MIT 授權。這不是業餘愛好者的研究玩具;這是來自成熟實驗室的正式發行模型,而且它在自己的架構描述中直接指名了 Moonshot 的注意力模組。
它在這方面也比 Moonshot 更為激進。Moonshot 每四層保留一個精確注意力層;Ling-3.0-flash 每六層保留一個。如果某種設計是短板,你該對沖它;不該比發明它的人使用更少的全局層。結合前一代來看,這是一項轉變:2026 年 2 月的架構調查在歸類此類模型時,顯示前一代 Ling 旗艦將 Lightning Attention 與 MLA 以 7:1 的比例搭配。機制在世代之間發生了變化,而其變化方向是朝向 KDA。
我們不會粉飾的兩個告誡。這是卡片上所記載的:我們讀取了該儲存庫自身的架構描述及其設定,其中宣告了一個自訂的 `bailing_hybrid` 模型類型,帶有 `BailingMoeV3` 實作——我們並未稽核其 kernel,以確認其數學運算是 KDA,而非僅是受 KDA 啟發。此外,該儲存庫完全沒有任何 KDA 標籤;在標籤搜尋中出現的,是他人加上標籤的第三方 GGUF 轉換。這對於方法而言是一個有用的提醒,並直接銜接至接下來的兩個章節。
Arcee AI 執行了 Moonshot 沒做的實驗。
KDA最具啟發性的外部應用根本不是一個產品。在Kimi Linear論文發表大約六週後,2025年12月中旬,Arcee AI以自家ArceeKDAForCausalLM實作發布了兩個Apache-2.0研究檢查點——AFM-4.5B-Base-KDA-Only和AFM-4.5B-Base-KDA-NoPE——並明確標記為kimi-delta-attention。他們提出的問題正是Moonshot的混合設計所謹慎迴避的:完整注意力能否被完全取代?於是他們將全部24個注意力層轉換為KDA,不保留任何全域注意力層,並以原始AFM-4.5B-Base作為教師模型,在32k序列長度下對結果進行蒸餾。
他們所報告的結果,教師模型對比純KDA學生模型:
• MMLU — 從 63.1 降至 55.8,一個真實但可承受的下降
• GSM8K — 從 52.1 降至 26.8,大約減少了一半
• HellaSwag — 78.0 降至 74.3,幾乎保持不變

那處損傷的形狀才是有趣的部分。廣博知識與常識續寫,大多能在被推過固定大小的遞迴狀態後存活下來。多步算術則不然,因為它需要精確取回模型在幾個步驟前寫下的中間結果。Arcee 也回報,長上下文退化是平順的,沒有陡峭的斷崖。綜合而論,這是目前最清楚的公開證據,說明為何每個嚴肅的 KDA 部署都是混合式架構:Moonshot 每四層配置一層全局層、Ant 每六層配置一層全局層,並非膽怯,而是那些層負責保住算術能力。
它並非:對大規模 KDA 的定論。這是一次 4.5B 蒸餾,而非從零開始的預訓練運行;將蒸餾應用於已變更的架構時,會丟失從零預訓練所不會丟失的東西。請將其視為廠商毫無動機發布的消融實驗——出自一個對答案沒有利害關係的獨立實驗室。
長尾:在短短一週內出現的一批小型 KDA 儲存庫
在這兩個嚴肅案例之下,散落著一些小案例,而日期才是讓它們值得一提的原因。NEXIVON-1B-BASE,於2026年7月31日上傳,其模型類型聲明為字面上的kda——Apache-2.0授權,285次下載,沒有讚數。同一週的qingyi-kda-0.6b,是Qwen3-0.6B-Base的微調版本,附帶自訂的qingyi_kda實作。同樣在那週的Scrapegoat-Tiny-Coder,將kda標籤與其自行設計的「雙軌並行注意力」結合。另外兩個模型,maccy-106m-base和maccy-96m-16k-base,分別於7月27日和28日被標記為kimi-delta-attention。
這些單獨來看都不重要——個位數的讚、不知名的作者、研究規模的參數量。但它們加在一起,大概就是「我看到的第三個外部模型」這項統計所計算的內容,而我們無法確認是哪三個,因為那則貼文一個都沒指名。其中的訊號不在於那些模型,而在於那十天:四個獨立的小型訓練在一個半星期內就達到了 KDA,這種情況發生在一個核心不再只是研究產物、而是變成你可以利用一個週末就放進訓練腳本裡的東西時。
掃蕩未發現的事物
我們查詢了 Hugging Face 上所有帶有 kimi_linear 模型類型的儲存庫,共有 47 個。除了三個之外,其餘名稱中都含有「Kimi」,而那些不是 Moonshot 自家的模型,與其說是採用者,不如說是衍生品:各種位元深度的 AWQ、GPTQ、FP8、NVFP4、SINQ、GGUF 和 MLX 量化;來自 Cerebras 的 REAP 專家剪枝 35B 變體;以及為 NVIDIA、MetaX 和 Hygon 加速器建置的 FlagRelease FlagOS Instruct 檢查點版本。最後一組之所以真正有趣,是出於另一個原因——有人付出了努力,讓 KDA 能在中國國產晶片上運行——但這些都算不上是另一個實驗室在設計另一種模型。
Moonshot 之外沒有任何前沿規模的模型宣稱 KDA。Ling-3.0-flash 以總參數 124B、活躍參數 5.1B,是目前外部採用的天花板。
而這個方法有一個值得指出的漏洞,因為它與我們自身的負面結果相牴觸。重新實作 KDA 的實驗室會註冊自己的模型類型——arcee_kda、qingyi_kda、bailing_hybrid——因此標籤掃描會系統性地漏算我們正在尋找的那些採用者,而且一個模型可以在其模型卡上完全不寫「KDA」的情況下使用該機制。未出現在標籤中只是薄弱的證據,而非證明。如果還有第四或第五個低調的採用者,這正是它會繼續保持隱形的方式。
其他所有人都選擇了不同的線性注意力。
「Kimi Linear 正在獲得採用」之所以能成為話題,是因為在 2026 年的大部分時間裡,情況並非如此。混合線性注意力橫掃了開放權重領域——但這個變體除外。根據 2026 年 2 月發布的架構調查:Qwen3-Next 80B-A3B 和 Qwen3.5-397B-A17B 都以 3:1 的比例將 Gated DeltaNet 與門控注意力搭配使用,這表示 Qwen3.5-397B-A17B 在 60 層中,有 45 層是循環層、15 層是全注意力層。先前的 Ling 旗艦型號則以 7:1 的比例使用 Lightning Attention 搭配 MLA。Nemotron 3 Nano 30B-A3B 和 Super 120B-A12B 是 Mamba-2 混合模型,分別在 52 層堆疊中僅有 6 層注意力層,在 88 層堆疊中有 8 層。GLM-5 維持 MLA,並在其上添加了稀疏注意力。MiniMax-M2.5 則完全反其道而行,保留了樸素的多頭注意力,據稱是為了可靠性。至於 Kimi K2.5,也就是 Moonshot 在 K3 之前的自家旗艦,採用的是 MLA——該實驗室於 2025 年 10 月發表了 KDA,但直到 2026 年 7 月才將其用於前沿模型。
所以這個類別勝出了,而變體沒有。大家都同意你四分之三的層可以是循環的;但沒有人同意採用哪種循環方式。KDA 的差異化在於每通道衰減閘,而它的代價是你需要它的自定義內核和前綴緩存配套,而不是半個生態系統早已採用的 Gated DeltaNet 路徑。直到這個月,只有一個實驗室付出了這個代價。
已經發生的採用,是在服務堆疊中
架構的普及不是因為它們優雅,而是因為基礎設施讓它們變便宜。對 KDA 來說,這部分已經完成了,而且比模型卡導入的速度更快。當 Kimi K3 的權重在 2026 年 7 月 27 日釋出時,vLLM 和 SGLang 都在第一天就提供支援;Moonshot 也將其 KDA prefix-caching 實作直接上游整合至 vLLM 本身,而非維護一個分支。SGLang 提供了融合 KDA 與 Gated DeltaNet 的 kernel,並回報在相同硬體上邏輯 KV 容量從 150 萬 token 提升至 1220 萬 token——這是它自己的測量數據,也是整個故事中最具體的第三方效率數字。參考 kernel 位於 fla-core 中,任何小型訓練執行都能直接匯入。
這就是Arcee在2025年12月需要刻意投入研究努力,與四個匿名儲存庫在2026年7月的一週內隨意宣稱KDA之間的差異。這個機制變成了一個你安裝的依賴項。前沿是否跟進是另一個問題,但反對KDA的阻力論點已大致消散。
如果你只是購買代幣,會有什麼不同
與你的程式碼無關。你從不直接呼叫 KDA;你體驗到的是百萬 token 上下文的成本,以及第一個 token 需要多久時間。Kimi K3 正是這點在商業上顯現的模型——在 OrcaRouter 上,它的收費是每百萬輸入 token 3.00 美元、每百萬輸出 token 15.00 美元,具備完整的 1M-token 上下文,且在過去七天內測得的 p50 首 token 延遲為 8.88 秒。這些經濟效益,本質上就是 3:1 KDA 混合架構所換來的:以一個僅是昂貴、而非令人卻步的價格,來服務百萬 token 的上下文。

研究用檢查點(research checkpoint)則是另一回事。Kimi-Linear-48B-A3B-Instruct 採用 MIT 授權,其 Hugging Face 頁面上僅列出一家推論供應商,且該模型不在 OrcaRouter 上——若想執行它,就只能自行架設或使用那家供應商。自行架設的帳面數字比參數量所暗示的更為友善:48B 權重以 bf16 格式存放約需 96 GB,因此需要兩張 80 GB 顯示卡;而 4-bit MLX 與 GGUF 轉換版本則落在 25–30 GB 左右,單張顯示卡或一台規格良好的 Mac 即可勝任。Ling-3.0-flash 目前同樣不在 OrcaRouter 上。我們不會為了在路由問題上闡述觀點而佯裝並非如此。
在這裡,路由真正重要的地方在於對架構賭注判斷錯誤的代價。混合線性注意力模型正是供應商基準表與你的工作負載可能不一致的類別——固定大小的遞迴狀態在檢索模式上會失效,而這些模式是任何總體分數都無法揭露的,這就是 GSM8K 分數減半所帶來的教訓。透過一個 API 金鑰在 200 多個模型上進行比較,意味著測試只是改變模型字串,而不是經歷採購流程,以供應商列表價格計價,我方零加成,且具備自動故障轉移,因此,你仍在評估的長上下文模型不會成為生產路徑中的單點故障。在你自己一天的長上下文流量上試試看。這比任何基準表(包括我們的)都來得更便宜。
真正值得提出的問題
Kimi Linear 和 Kimi K3 是同一回事嗎?
不,將兩者混為一談是報導它們時最常見的錯誤。Kimi Linear 是架構論文加上一個總參數 48B、活躍參數 3B 的研究模型,具有 1M 上下文,於 2025 年底以 MIT 授權釋出,目的是證明在相同訓練條件下,以 KDA 為主的混合架構能勝過完整 MLA。Kimi K3 則是 Moonshot 於 2026 年 7 月推出的 2.8 兆參數旗艦模型——活躍參數 104B、原生多模態、1M 上下文——它將 KDA 3:1 的構想擴展到前沿規模,並加入了 Attention Residuals,這是實驗室報告的另一項技巧,能以不到 2% 的額外成本換來約 25% 的訓練效率。兩者共享機制,但規模、能力與價格截然不同。從其中一個得出的基準測試結果,對另一個幾乎說明不了什麼。
既然大多數人都選擇了 Gated DeltaNet,為什麼會有實驗室選擇 KDA 而不是它呢?
KDA 是 Gated DeltaNet 的嚴格改良,因此問題在於這項改良是否值得切換成本。改良的關鍵在於閘門:Gated DeltaNet 每一步用一個純量來衰減其遞迴記憶,而 KDA 則為每個特徵通道學習一個衰減值,這使得狀態能在跨越一萬個 token 的範圍內記住某個變數名稱,同時將它出現過的句子清除。Moonshot 的消融實驗顯示,在 48B 規模下這大約帶來 0.12 的驗證困惑度改善;而其分塊式 DPLR 公式是為了讓 Tensor cores 保持忙碌而設計,因此額外的表達能力並不會犧牲它所換得的吞吐量。相比之下,Gated DeltaNet 早在兩者風行之前就已具備廣泛的 kernel 與框架支援,這點值得實際的工程時間投入。2026 年的答案大多是「不值得」。而 Ling-3.0-flash 是第一個反其道而行的生產級規模賭注。
這些是否會改變我本季度該部署的內容?
只有在執行非常長的上下文時才需要考慮。如果你的提示詞低於約 32k tokens,混合線性注意力只是一個實作細節,對你的模型選擇沒有影響;照常依據品質、價格和延遲來挑選即可。如果你要推進到 128k 以上,值得注意的是,能在這種長度下維持成本合理的模型,越來越傾向於 KDA 混合模型,而且它們公布的長上下文分數是綜合基準測試,而非對抗性召回探測。請在你真實的上下文長度下測試檢索能力,而不是相信 RULER 分數。就算機制換成 Gated DeltaNet 或 Mamba-2,這項建議也完全相同。
如此一來,該主張的處境為何
{{1}}方向正確,而且比聽起來要小。{{/1}}{{2}}截至2026年8月5日可驗證的是:一個來自成熟實驗室的量產模型、一對來自獨立美國實驗室並發表了誠實缺點的研究組合、過去十天內少數sub-1B的repo,以及一個早已吸收該核心的服務生態系。{{/2}}{{3}}這比「單一實驗室的把戲」多,但距離「標準」還很遠。{{/3}}{{4}}該關注的數字不是三個外部模型——而是下一個非Moonshot實驗室發布的前沿開放權重版本是否具備逐通道門控,以及Moonshot以外的任何人是否會發布一個測試固定大小狀態究竟遺忘什麼的召回探針。{{/4}}{{5}}這兩者都會比另一張截圖告訴你更多。{{/5}}
