
Kimi Linear Đang Lan Rộng: Mọi Mô Hình Chúng Tôi Có Thể Xác Minh Thực Sự Chạy KDA
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 198 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1653Trí tuệ69Lập trình60Toán
"Chà! Kimi-Linear đang được áp dụng! Đây giống như mô hình bên ngoài thứ ba mà tôi thấy." Đó là toàn bộ bài đăng — một dòng từ @teortaxesTex vào ngày 5 tháng 8 năm 2026, kèm theo một ảnh chụp màn hình và không nêu tên một mô hình nào. Liên kết rút gọn trong đó trỏ đến hình ảnh chứ không phải kho mã nguồn (repo), nên không có gì để bấm vào xem thêm và cũng không có gì để đối chiếu. Dù vậy, tuyên bố này vẫn kiểm chứng được, và nó quan trọng hơn những gì một câu ngắn gọn cho thấy: nếu các phòng nghiên cứu khác ngoài Moonshot AI đang xây dựng dựa trên thiết kế cơ chế attention đằng sau Kimi-Linear-48B-A3B-Instruct và Kimi K3, thì Kimi Delta Attention đã không còn là thủ thuật nội bộ của một phòng nghiên cứu mà bắt đầu trở thành một thành phần mà người khác tin dùng. Vì vậy, chúng tôi đã đi tìm các mô hình thay vì dựa vào ảnh chụp màn hình. Câu trả lời ngắn gọn: trường hợp thuyết phục nhất là Ling-3.0-flash, có thẻ mô hình mô tả một ngăn xếp 5:1 gồm các lớp KDA và MLA; trường hợp hữu ích nhất là một checkpoint nghiên cứu từ một phòng nghiên cứu Mỹ, định lượng chi phí của KDA thuần túy; và ở quy mô frontier, ngoài Moonshot ra, chưa ai phát hành nó.
Tuyên bố nói gì, và không nói gì
Một học viên, một ảnh chụp màn hình, không nêu tên mô hình, không xác nhận độc lập. Đó là toàn bộ cơ sở bằng chứng cho việc "được áp dụng rộng rãi," và điều đó nên được đọc như một lời gợi ý để đi kiểm tra thay vì là tin tức. Chúng tôi không thể tái tạo lại ảnh chụp màn hình, vì vậy không có gì dưới đây là xác nhận của nó — mọi thứ sau đây là những gì siêu dữ liệu mô hình công khai hiển thị vào ngày 5 tháng 8 năm 2026, khi chúng tôi quét tìm nó, cùng với những gì mỗi phòng thí nghiệm nêu trong model card của riêng họ. Khi một con số đến từ phép đo của chính nhà cung cấp, nó được ghi nhãn như vậy, bởi vì trong câu chuyện cụ thể này, gần như mọi con số tiêu đề đều như vậy.
Một màn hình trên Kimi Linear, vì 'adoption' có nghĩa là áp dụng cái này.
Kimi Linear là một kiến trúc attention, được nhóm Kimi công bố dưới mã arXiv 2510.26692 vào ngày 30 tháng 10 năm 2025, không phải là một sản phẩm. Cốt lõi của nó là Kimi Delta Attention (KDA), kiến trúc này lấy Gated DeltaNet và thay thế cổng quên (forget gate) thô bằng bộ suy giảm (decay) chi tiết theo từng kênh, nhờ đó trạng thái hồi quy học được cách giữ lại thông tin theo từng kênh thay vì giữ hoặc loại bỏ toàn bộ. Bản cập nhật được cấu trúc lại thành dạng chunked, Diagonal-Plus-Low-Rank với mục đích cụ thể là chạy trên tensor cores thay vì để chúng nhàn rỗi. Cách đóng khung theo góc độ phần cứng đó chính là trọng tâm của thiết kế: linear attention luôn rẻ về mặt lý thuyết, nhưng thường gây thất vọng trong thực tế.
Các checkpoint được phát hành — Kimi-Linear-48B-A3B-Base và Kimi-Linear-48B-A3B-Instruct — có tổng cộng 48B tham số với 3B tham số hoạt động, cửa sổ ngữ cảnh 1M token và giấy phép MIT. Các lớp xen kẽ theo tỷ lệ xấp xỉ 3:1, gồm hai mươi lớp KDA và bảy lớp Multi-Head Latent Attention, do đó ba trong bốn lớp thuộc dạng hồi quy tiết kiệm chi phí và cứ lớp thứ tư lại duy trì cơ chế chú ý toàn cục chính xác.
Những gì Moonshot báo cáo, tất cả được đo lường dựa trên một baseline MLA đầy đủ được huấn luyện trên cùng một công thức — số liệu từ nhà cung cấp, không được tái tạo độc lập:
• Thông lượng giải mã — thời gian cho mỗi token đầu ra nhanh hơn tới 6 lần ở ngữ cảnh 1M so với MLA đầy đủ
• KV cache — nhỏ hơn tới 75%, đây chính là yếu tố mang lại thông lượng cao
• Ngữ cảnh dài — RULER ở 128k: 84.3 cho Kimi Linear với tốc độ nhanh hơn 3.98 lần, so với 81.3 cho đường cơ sở MLA
Ngữ cảnh ngắn — MMLU-Pro ở mức 4k: 51,0 so với 47,2 đối với đường cơ sở MLA và 47,9 đối với một biến thể lai Gated DeltaNet, ở tốc độ gần như tương đương với cơ chế chú ý đầy đủ, vì vậy thiết kế này không phải đánh đổi tốc độ ngữ cảnh dài để hy sinh chất lượng ngữ cảnh ngắn.
• Phép loại bỏ tiền huấn luyện — mô hình lai 3:1 đạt perplexity 5,65 trên tập kiểm định trong khi attention đầy đủ dừng ở mức 5,77
Giới hạn trung thực cho tất cả điều đó: bằng chứng đối chứng có cơ sở dừng ở 48B. Không ai xây dựng một bản song sinh 2.8T với full-attention của Kimi K3 để so sánh, và tính đến cuộc kiểm tra thực tế vào cuối tháng 7 năm 2026 về các tuyên bố kiến trúc K3, chưa có bài thăm dò thu hồi ngữ cảnh dài độc lập không dùng phím tắt nào được công bố cho cả hai mô hình. Câu chuyện về hiệu quả được hỗ trợ tốt. Câu chuyện "vượt trội full attention" được hỗ trợ ở quy mô nghiên cứu bởi phòng thí nghiệm đã viết bài báo.

Sự phổ biến, cho đến nay, được thể hiện qua số lượt tải về hơn là qua các kiến trúc mà người khác tạo ra: 98.164 lượt tải trong tháng qua, 570 lượt thích, một nhà cung cấp suy luận được niêm yết trên Hugging Face, và một cây mô hình gồm 2 adapter, 8 bản tinh chỉnh và 24 bản lượng tử hóa. Rõ ràng là phổ biến. Còn việc bị sao chép lại là một vấn đề khác.
Trường hợp áp dụng mạnh nhất: Ling-3.0-flash
Ling-3.0-flash chính là mô hình biến tuyên bố đó thành hiện thực. Thẻ Hugging Face của nó mô tả một kiến trúc chú ý tuyến tính lai thuần bản địa được xây dựng từ một ngăn xếp xen kẽ theo tỷ lệ 5:1 giữa Kimi Delta Attention và MLA — 35 lớp KDA trên 7 lớp MLA có cổng — trên một mô hình Mixture-of-Experts 124B tham số với 5,1B tham số kích hoạt cho mỗi token, ngữ cảnh 256K được huấn luyện theo tiến trình 8K đến 32K đến 256K, và giấy phép MIT. Đó không phải là đồ chơi nghiên cứu của một người đam mê nghiệp dư; mà là một mô hình thương mại từ một phòng thí nghiệm có uy tín, và nó nêu tên mô-đun chú ý của Moonshot trong phần mô tả kiến trúc của chính nó.
Nó cũng quyết liệt hơn Moonshot về điểm này. Moonshot giữ một lớp exact-attention trong bốn; Ling-3.0-flash giữ một trong sáu. Nếu một thiết kế là điểm yếu thì bạn phòng ngừa nó; bạn không dùng ít lớp toàn cục hơn những người đã phát minh ra nó. Đối chiếu với thế hệ trước, đây là một sự đảo ngược: các khảo sát kiến trúc tháng 2/2026 vốn phân loại lớp mô hình này đã ghi nhận mẫu Ling flagship trước đây dùng Lightning Attention kết hợp MLA theo tỷ lệ 7:1. Cơ chế đã thay đổi giữa các thế hệ, và hướng thay đổi là dịch chuyển về phía KDA.
Hai điều cần lưu ý mà chúng tôi sẽ không che đậy. Đây là thông tin được ghi trên thẻ: chúng tôi đã đọc mô tả kiến trúc của chính kho lưu trữ và cấu hình của nó, trong đó khai báo loại mô hình tùy chỉnh bailing_hybrid với bản triển khai BailingMoeV3 — chúng tôi không kiểm tra các kernel để xác nhận rằng phép toán là KDA chứ không chỉ lấy cảm hứng từ KDA. Và kho lưu trữ không hề gắn tag KDA nào; thứ xuất hiện khi tìm kiếm theo tag chỉ là bản chuyển đổi GGUF của bên thứ ba do người khác gán nhãn. Điều này là một lời cảnh báo hữu ích về phương pháp, và dẫn thẳng đến hai phần tiếp theo.
Arcee AI đã chạy thí nghiệm mà Moonshot không làm.
Việc sử dụng KDA bên ngoài giàu thông tin nhất không phải là một sản phẩm. Khoảng sáu tuần sau bài báo Kimi Linear, vào giữa tháng 12 năm 2025, Arcee AI đã công bố hai checkpoint nghiên cứu theo giấy phép Apache-2.0 — AFM-4.5B-Base-KDA-Only và AFM-4.5B-Base-KDA-NoPE — dưới bộ triển khai ArceeKDAForCausalLM của riêng họ, được gắn thẻ một cách tường minh là kimi-delta-attention. Câu hỏi của họ chính là câu mà thiết kế lai của Moonshot cẩn thận lảng tránh: liệu attention toàn phần có thể bị thay thế hoàn toàn? Vì vậy, họ đã chuyển đổi toàn bộ 24 lớp attention sang KDA, không để lại lớp attention toàn cục nào, và chưng cất kết quả từ AFM-4.5B-Base gốc làm giáo viên ở độ dài chuỗi 32k.
Kết quả họ báo cáo, giáo viên so với học sinh pure-KDA thuần túy:
• MMLU — từ 63.1 xuống 55.8, một mức sụt giảm thực sự nhưng vẫn có thể vượt qua được
• GSM8K — từ 52.1 xuống 26.8, giảm khoảng một nửa
• HellaSwag — 78.0 xuống 74.3, gần như nguyên vẹn

Hình dạng của vết hư hỏng đó mới là phần thú vị. Kiến thức rộng và suy luận lẽ thường phần lớn vẫn sống sót khi bị đẩy qua một trạng thái tuần hoàn có kích thước cố định. Số học nhiều bước — thứ cần truy xuất chính xác các kết quả trung gian mà mô hình đã viết vài bước trước — thì không. Arcee cũng báo cáo rằng sự suy giảm khi ngữ cảnh dài diễn ra từ từ, không có vách đá dựng đứng. Gộp lại, đây là bằng chứng công khai rõ ràng nhất cho việc vì sao mọi triển khai KDA nghiêm túc đều là kiến trúc lai: lớp toàn cầu một-phần-tư của Moonshot và một-phần-sáu của Ant không phải là sự thận trọng, mà chính là phần giữ được phép toán.
Điều này không phải là: một lời phán quyết về KDA ở quy mô lớn. Đây là một bản chưng cất 4.5B, không phải một lần tiền huấn luyện, và việc chưng cất vào một kiến trúc đã thay đổi sẽ làm mất đi những gì mà tiền huấn luyện từ đầu sẽ không làm mất. Hãy đọc nó như một phép thử ablation mà nhà cung cấp không có động cơ để công bố — từ một phòng thí nghiệm độc lập không có lợi ích gì trong kết quả.
Phần đuôi dài: một cụm các kho KDA nhỏ trong vỏn vẹn một tuần
{{1}}Bên dưới hai trường hợp nghiêm trọng là một loạt các trường hợp nhỏ, và chính ngày tháng khiến chúng đáng được nhắc đến.{{/1}} {{2}}NEXIVON-1B-BASE, được tải lên ngày 31 tháng 7 năm 2026, khai báo loại mô hình của nó là, theo nghĩa đen, kda — Apache-2.0, 285 lượt tải xuống, không có lượt thích.{{/2}} {{3}}qingyi-kda-0.6b, cùng tuần đó, là một bản finetune Qwen3-0.6B-Base cung cấp kèm một triển khai qingyi_kda tùy chỉnh.{{/3}} {{4}}Scrapegoat-Tiny-Coder, cũng trong tuần đó, kết hợp thẻ kda với một thiết kế "dual-track parallel attention" của riêng nó.{{/4}} {{5}}Hai mô hình nữa, maccy-106m-base và maccy-96m-16k-base, được gắn thẻ kimi-delta-attention vào ngày 27 và 28 tháng 7.{{/5}}
Không điều nào trong số này tự nó quan trọng — lượt thích chỉ vài chữ số, tác giả vô danh, số lượng tham số ở quy mô nghiên cứu. Gộp lại, chúng có lẽ là thứ mà bảng đếm "mô hình bên ngoài thứ ba tôi thấy" đang đếm, và chúng ta không thể xác nhận đó là ba mô hình nào, vì bài đăng không nêu tên. Tín hiệu trong chúng không nằm ở các mô hình, mà nằm ở mười ngày: bốn lần chạy huấn luyện nhỏ độc lập đã chạm tới KDA trong vòng một tuần rưỡi, điều này xảy ra khi một kernel không còn là một sản phẩm nghiên cứu mà trở thành thứ bạn có thể nhét vào một tập lệnh huấn luyện trong một ngày cuối tuần.
Điều mà cuộc quét không tìm thấy
Chúng tôi đã truy vấn Hugging Face để tìm mọi kho lưu trữ chứa loại mô hình kimi_linear. Có 47 kho. Tất cả trừ ba kho đều có "Kimi" trong tên, và những kho không phải của Moonshot là các biến thể chứ không phải người áp dụng: các lượng tử hóa AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF và MLX ở mọi độ sâu bit; các biến thể 35B đã được tỉa chuyên gia REAP từ Cerebras; và các bản dựng FlagRelease FlagOS của checkpoint Instruct cho các bộ tăng tốc NVIDIA, MetaX và Hygon. Nhóm cuối cùng thực sự thú vị vì một lý do khác — ai đó đã làm việc để khiến KDA chạy trên silicon nội địa Trung Quốc — nhưng không có gì trong số đó là một phòng thí nghiệm khác thiết kế một mô hình khác.
Không có mô hình quy mô tiên phong nào ngoài Moonshot công bố KDA. Ling-3.0-flash với tổng 124B và 5.1B tham số hoạt động là giới hạn tối đa cho việc áp dụng bên ngoài hiện nay.
Và phương pháp này có một lỗ hổng đáng được nêu tên, vì nó đi ngược lại kết quả phủ định của chính chúng ta. Một phòng thí nghiệm triển khai lại KDA sẽ đăng ký loại mô hình của riêng họ — arcee_kda, qingyi_kda, bailing_hybrid — nên các cuộc quét thẻ một cách có hệ thống đếm thiếu chính xác những người áp dụng mà chúng ta đang tìm kiếm, và một mô hình có thể sử dụng cơ chế này mà không bao giờ viết "KDA" trong thẻ của nó. Sự vắng mặt trong một thẻ là bằng chứng yếu, không phải là chứng cứ. Nếu có người áp dụng thầm lặng thứ tư hoặc thứ năm, thì đây chính là cách họ sẽ tiếp tục vô hình.
Mọi người khác đều chọn một cơ chế chú ý tuyến tính khác.
Lý do khiến việc "Kimi Linear đang được áp dụng" trở thành một câu chuyện đáng nói là vì trong phần lớn năm 2026, điều đó đã không xảy ra. Attention tuyến tính lai (hybrid linear attention) đã quét sạch lĩnh vực mô hình open-weight — nhưng không phải biến thể này. Theo các khảo sát kiến trúc được công bố vào tháng 2 năm 2026: Qwen3-Next 80B-A3B và Qwen3.5-397B-A17B đều kết hợp Gated DeltaNet với gated attention theo tỷ lệ 3:1, nghĩa là Qwen3.5-397B-A17B chạy 45 lớp hồi quy so với 15 lớp full-attention trong tổng số 60 lớp. Mô hình chủ lực Ling trước đó sử dụng Lightning Attention với MLA theo tỷ lệ 7:1. Nemotron 3 Nano 30B-A3B và Super 120B-A12B là các mô hình lai Mamba-2, với chỉ 6 lớp attention trong kiến trúc 52 lớp và 8 lớp trong kiến trúc 88 lớp. GLM-5 vẫn dùng MLA và bổ sung thêm sparse attention lên trên. MiniMax-M2.5 đi theo hướng hoàn toàn ngược lại và giữ nguyên multi-head attention thuần túy, được cho là để đảm bảo độ tin cậy. Còn Kimi K2.5 — mô hình chủ lực của chính Moonshot trước K3 — là MLA; phòng thí nghiệm đã công bố KDA vào tháng 10 năm 2025 và mãi đến tháng 7 năm 2026 mới đưa nó vào mô hình frontier của mình.
Vậy là danh mục đã thắng, còn biến thể thì không. Mọi người đều đồng ý rằng ba phần tư số lớp của bạn có thể là hồi quy; nhưng không ai thống nhất được kiểu hồi quy nào. Điểm khác biệt của KDA là cổng suy giảm theo từng kênh, và cái giá phải trả là bạn cần kernel tùy chỉnh và hệ thống prefix-caching của nó, thay vì đi theo con đường Gated DeltaNet mà một nửa hệ sinh thái đã có sẵn. Cho đến tháng này, mới chỉ có một phòng thí nghiệm trả cái giá đó.
Việc áp dụng đã diễn ra nằm trong các ngăn xếp phục vụ.
Kiến trúc không lan truyền chỉ vì chúng thanh lịch; chúng lan truyền khi hạ tầng làm cho chúng trở nên rẻ. Phần đó đã hoàn tất cho KDA, và nó xảy ra nhanh hơn cả việc áp dụng model-card. Cả vLLM và SGLang đều có hỗ trợ ngay từ ngày đầu khi trọng số của Kimi K3 được phát hành vào ngày 27 tháng 7 năm 2026, với việc Moonshot hợp nhất ngược (upstream) bản triển khai prefix-caching KDA của mình vào chính vLLM thay vì duy trì một fork riêng. SGLang phát hành các kernel hợp nhất KDA và Gated DeltaNet và báo cáo dung lượng KV logic tăng từ 1,5M lên 12,2M token trên cùng một phần cứng — phép đo của chính họ, và là con số hiệu quả cụ thể nhất từ bên thứ ba trong toàn bộ câu chuyện này. Các kernel tham chiếu nằm trong fla-core, mà bất kỳ phiên huấn luyện nhỏ nào cũng có thể import.
Đó là sự khác biệt giữa việc Arcee cần một nỗ lực nghiên cứu có chủ đích vào tháng 12 năm 2025 và bốn kho lưu trữ ẩn danh thản nhiên tuyên bố KDA trong một tuần của tháng 7 năm 2026. Cơ chế này đã trở thành một dependency mà bạn cài đặt. Việc các mô hình tiên phong có đi theo hay không là một câu hỏi riêng biệt, nhưng lập luận về rào cản chống lại KDA phần lớn đã tan biến.
Điều gì thay đổi nếu bạn chỉ mua token
Không liên quan gì đến mã của bạn. {{1}}Bạn không bao giờ gọi KDA; bạn trải nghiệm nó qua chi phí của một ngữ cảnh triệu token và thời gian token đầu tiên xuất hiện.{{/1}} {{2}}Kimi K3 là mô hình mà điều đó thể hiện rõ về mặt thương mại ngày nay{{/2}} {{3}}— trên OrcaRouter, nó có giá $3,00 cho mỗi triệu token đầu vào và $15,00 cho mỗi triệu token đầu ra, với ngữ cảnh 1M token đầy đủ và thời gian đến token đầu tiên (p50) đo được là 8,88 giây trong bảy ngày qua.{{/3}} {{4}}Về cơ bản, những con số kinh tế đó chính là thứ mà kiến trúc lai KDA tỷ lệ 3:1 mang lại: phục vụ ngữ cảnh triệu token với mức giá chỉ đắt chứ không phải ở mức không thể chi trả.{{/4}}

Checkpoint nghiên cứu là một vấn đề khác. Kimi-Linear-48B-A3B-Instruct được cấp phép MIT với một nhà cung cấp suy luận được liệt kê trên trang Hugging Face của nó, và nó không nằm trên OrcaRouter — nếu bạn muốn chạy nó, điều đó có nghĩa là tự lưu trữ hoặc dùng nhà cung cấp đó. Phép tính cho việc tự lưu trữ thân thiện hơn so với con số tham số gợi ý: trọng số 48B ở dạng bf16 khoảng 96 GB, vì vậy cần hai thẻ 80 GB, trong khi các chuyển đổi MLX và GGUF 4-bit nằm ở mức khoảng 25-30 GB và phù hợp với một thẻ duy nhất hoặc một chiếc Mac có cấu hình tốt. Ling-3.0-flash cũng không nằm trên OrcaRouter hiện nay. Chúng tôi sẽ không giả vờ ngược lại để làm rõ một quan điểm về định tuyến.
Nơi định tuyến thực sự quan trọng ở đây là cái giá phải trả khi đặt cược sai vào một kiến trúc. Các mô hình chú ý tuyến tính lai chính là nhóm mà bảng điểm chuẩn của nhà cung cấp và khối lượng công việc của bạn có thể không khớp nhau — trạng thái hồi quy kích thước cố định thất bại trên các mẫu truy xuất mà không một điểm số tổng hợp nào phản ánh, và đó là bài học từ con số GSM8K bị giảm một nửa. Việc chạy so sánh qua một API key trên hơn 200 mô hình có nghĩa là bài kiểm tra chỉ là việc đổi một chuỗi tên mô hình chứ không phải một quy trình mua sắm, ở mức giá niêm yết của nhà cung cấp với 0% phụ phí từ phía chúng tôi, cùng với khả năng chuyển đổi dự phòng tự động để một mô hình ngữ cảnh dài mà bạn vẫn đang đánh giá không trở thành điểm lỗi duy nhất trong một đường vận hành sản xuất. Hãy thử nó trên lưu lượng ngữ cảnh dài của chính bạn trong một ngày. Đó là một câu trả lời rẻ hơn bất kỳ bảng điểm chuẩn nào, kể cả của chúng tôi.
Những câu hỏi thực sự đáng để hỏi
Kimi Linear có phải là cùng một thứ với Kimi K3 không?
Không, và việc gộp chung chúng là lỗi phổ biến nhất khi đưa tin về cả hai. Kimi Linear là bài báo kiến trúc cộng với mô hình nghiên cứu có tổng 48B tham số, 3B tham số kích hoạt và ngữ cảnh 1M, được phát hành theo giấy phép MIT vào cuối năm 2025 để chứng minh rằng một mô hình lai thiên về KDA vượt trội MLA đầy đủ ở cùng điều kiện huấn luyện. Kimi K3 là mô hình chủ lực 2,8 nghìn tỷ tham số của Moonshot ra mắt vào tháng 7 năm 2026 — 104B tham số kích hoạt, đa phương thức tự nhiên, ngữ cảnh 1M — đã đưa ý tưởng KDA theo tỷ lệ 3:1 lên quy mô tiên phong và bổ sung Attention Residuals, một kỹ thuật riêng biệt mà phòng nghiên cứu cho biết giúp tăng khoảng 25% hiệu quả huấn luyện với chi phí tăng thêm dưới 2%. Cơ chế chung, nhưng quy mô, khả năng và mức giá hoàn toàn khác nhau. Điểm chuẩn từ cái này cho bạn biết rất ít về cái kia.
Tại sao một phòng thí nghiệm lại chọn KDA thay vì Gated DeltaNet, trong khi hầu hết đều chọn Gated DeltaNet?
KDA là một sự tinh chỉnh nghiêm ngặt của Gated DeltaNet, nên câu hỏi đặt ra là sự tinh chỉnh đó có đáng để trả chi phí chuyển đổi hay không. Sự tinh chỉnh nằm ở cổng (gate): Gated DeltaNet suy giảm bộ nhớ hồi quy của nó với một vô hướng mỗi bước, còn KDA học một tốc độ suy giảm cho từng kênh đặc trưng, cho phép trạng thái lưu giữ một tên biến qua mười nghìn token trong khi loại bỏ câu mà biến đó xuất hiện. Ablation của Moonshot ước tính điều đó vào khoảng 0.12 độ perplexity xác thực ở 48B, và công thức DPLR theo khối của nó được viết để giữ cho các tensor core luôn bận rộn, vì vậy độ biểu đạt tăng thêm không làm mất đi thông lượng mà nó mang lại. Ngược lại, Gated DeltaNet vốn đã có hỗ trợ kernel và framework rộng rãi từ trước khi cả hai trở nên thịnh hành, điều này đáng giá rất nhiều thời gian kỹ thuật. Câu trả lời của năm 2026 phần lớn là "không đáng". Ling-3.0-flash là canh bạc quy mô sản xuất đầu tiên theo hướng ngược lại.
Bất kỳ điều nào trong số này có nên thay đổi những gì tôi triển khai trong quý này không?
Chỉ khi bạn đang chạy các ngữ cảnh rất dài. Nếu prompt của bạn dưới khoảng 32k token, cơ chế chú ý tuyến tính lai chỉ là một chi tiết triển khai không ảnh hưởng đến việc chọn mô hình; hãy chọn theo chất lượng, giá cả và độ trễ như thường lệ. Nếu bạn đang dùng 128k token trở lên, bạn nên biết rằng các mô hình giúp chi phí của bạn ở mức hợp lý ở độ dài đó ngày càng là các mô hình lai KDA, và rằng điểm số ngữ cảnh dài được công bố của chúng là các benchmark tổng hợp chứ không phải các bài kiểm tra truy hồi đối kháng. Hãy kiểm tra khả năng truy hồi ở độ dài ngữ cảnh thực tế của bạn thay vì tin vào điểm RULER. Lời khuyên đó vẫn y nguyên nếu cơ chế là Gated DeltaNet hoặc Mamba-2.
Điều này đưa tuyên bố về đâu?
Định hướng đúng, và nhỏ hơn so với những gì nghe có vẻ. Điều có thể kiểm chứng vào ngày 5 tháng 8 năm 2026 là: một mô hình sản xuất từ một phòng lab có uy tín, một cặp nghiên cứu từ một phòng lab độc lập của Mỹ đã trung thực công bố mặt hạn chế, một số ít repo dưới 1B trong mười ngày qua, và một hệ sinh thái phục vụ đã hấp thụ kernel. Điều đó nhiều hơn "một mẹo của một phòng lab" và ít hơn nhiều so với một tiêu chuẩn. Con số cần theo dõi không phải là ba mô hình bên ngoài — mà là liệu bản phát hành trọng số mở tiên phong tiếp theo từ một phòng lab không phải Moonshot có kèm cơ chế gating theo kênh hay không, và liệu có ai ngoài Moonshot công bố một probe hồi tưởng để kiểm tra xem trạng thái kích thước cố định thực sự quên điều gì hay không. Cả hai sẽ cho bạn biết nhiều hơn một ảnh chụp màn hình khác.
