
Kimi Linear กำลังแพร่กระจาย: ทุกโมเดลที่เราสามารถตรวจสอบได้ รัน KDA จริง ๆ
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 198 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3055ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1653ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
"ว้าว! Kimi-Linear กำลังถูกนำไปใช้มากขึ้นเรื่อยๆ! นี่น่าจะเป็นโมเดลภายนอกตัวที่สามที่ฉันเห็น" นั่นคือทั้งโพสต์ — หนึ่งบรรทัดจาก @teortaxesTex เมื่อวันที่ 5 สิงหาคม 2026 พร้อมแนบภาพหน้าจอมา และไม่มีการเอ่ยชื่อโมเดลแม้แต่ตัวเดียว ลิงก์แบบย่อในโพสต์นั้นชี้ไปที่รูปภาพ ไม่ใช่ที่เก็บโค้ด จึงไม่มีอะไรให้คลิกเข้าไปดู และไม่มีอะไรให้ยืนยัน ข้อกล่าวอ้างนี้ตรวจสอบได้อยู่แล้ว และมันสำคัญมากกว่าที่ประโยคสั้นๆ หนึ่งบรรทัดจะบ่งบอก: หากห้องแล็บอื่นนอกเหนือจาก Moonshot AI กำลังต่อยอดจากการออกแบบแอตเทนชันที่อยู่เบื้องหลัง Kimi-Linear-48B-A3B-Instruct และ Kimi K3, แสดงว่า Kimi Delta Attention ไม่ได้เป็นเพียงเทคนิคภายในแล็บเดียวอีกต่อไป และเริ่มกลายเป็นส่วนประกอบที่ผู้อื่นนำไปใช้ เราจึงออกไปค้นหาโมเดลเหล่านั้นแทนที่จะดูแค่ภาพหน้าจอ คำตอบสั้นๆ คือ: กรณีที่แข็งแกร่งที่สุดคือ Ling-3.0-flash, ซึ่งโมเดลการ์ดของมันเองอธิบายถึงการซ้อนกันของเลเยอร์ KDA และ MLA ในอัตราส่วน 5:1; กรณีที่มีประโยชน์ที่สุดคือเช็คพอยต์งานวิจัยของห้องแล็บในสหรัฐฯ ที่วัดต้นทุนของ KDA บริสุทธิ์; และในระดับ frontier นอกเหนือจาก Moonshot แล้ว ยังไม่มีใครปล่อยมันออกมา
ข้อกล่าวอ้างคืออะไร และสิ่งที่ไม่ใช่
ผู้ปฏิบัติงานหนึ่งคน ภาพหน้าจอหนึ่งภาพ ไม่มีการระบุโมเดล ไม่มีการยืนยัน นั่นคือหลักฐานทั้งหมดสำหรับ "การได้รับการยอมรับ" และควรอ่านเป็นการแจ้งเตือนให้ไปตรวจสอบ มากกว่าเป็นข่าว เราไม่สามารถทำซ้ำภาพหน้าจอนั้นได้ ดังนั้นสิ่งใดก็ตามข้างล่างนี้ไม่ใช่การยืนยันภาพดังกล่าว — ทั้งหมดที่ตามมาคือสิ่งที่ข้อมูลเมตาโมเดลสาธารณะแสดงเมื่อวันที่ 5 สิงหาคม 2026 ขณะที่เราตรวจค้น และบวกกับสิ่งที่แต่ละห้องปฏิบัติการระบุในโมเดลการ์ดของตัวเอง ในกรณีที่ตัวเลขมาจากการวัดของผู้จำหน่ายเอง ก็จะระบุไว้เช่นนั้น เพราะในเรื่องนี้ ตัวเลขสำคัญแทบทุกตัวก็มาจากแหล่งนั้น
หน้าจอเดียวบน Kimi Linear เพราะ "adoption" หมายถึงการนำสิ่งนี้ไปใช้
Kimi Linear คือสถาปัตยกรรมแอตเทนชันที่เผยแพร่โดยทีม Kimi ในชื่อ arXiv 2510.26692 เมื่อวันที่ 30 ตุลาคม ค.ศ. 2025 ไม่ใช่ผลิตภัณฑ์ แกนกลางของมันคือ Kimi Delta Attention (KDA) ซึ่งนำ Gated DeltaNet มาแทนที่ forget gate แบบหยาบด้วยการสลายแบบละเอียดระดับช่องสัญญาณ (per-channel decay) ทำให้สถานะเวียนเกิดเรียนรู้ที่จะเก็บรักษาข้อมูลทีละช่องสัญญาณแทนที่จะเก็บทั้งหมดแบบเหมารวม การอัปเดตถูกจัดโครงสร้างใหม่เป็นรูปแบบ chunked แบบ Diagonal-Plus-Low-Rank โดยเฉพาะเพื่อให้ประมวลผลบนเทนเซอร์คอร์แทนที่จะปล่อยให้ไม่ได้ใช้งาน การวางกรอบเชิงฮาร์ดแวร์นี้คือหัวใจของการออกแบบ: linear attention มีต้นทุนต่ำในทางทฤษฎีเสมอมา แต่มักจะน่าผิดหวังในทางปฏิบัติ
จุดตรวจสอบที่เผยแพร่ — Kimi-Linear-48B-A3B-Base และ Kimi-Linear-48B-A3B-Instruct — มีพารามิเตอร์รวม 48B โดยทำงานจริง 3B หน้าต่างบริบท 1M โทเคน และใช้ลิขสิทธิ์แบบ MIT ชั้นต่างๆ เรียงสลับกันในอัตราส่วนประมาณ 3:1 กล่าวคือมีชั้น KDA ยี่สิบชั้นต่อชั้น Multi-Head Latent Attention เจ็ดชั้น ดังนั้นสามในสี่ชั้นเป็นแบบเกิดซ้ำที่มีต้นทุนต่ำ และทุกชั้นที่สี่จะยังคงความสนใจแบบ global ที่แม่นยำ
สิ่งที่ Moonshot รายงาน ทั้งหมดวัดเทียบกับเบสไลน์ full-MLA ที่ฝึกด้วยสูตรเดียวกัน — ตัวเลขจากผู้ขาย ไม่ได้ทำซ้ำโดยอิสระ:
• อัตราการประมวลผลการถอดรหัส — เวลาต่อโทเคนเอาต์พุตเร็วกว่าสูงสุด 6 เท่าที่บริบทขนาด 1M เมื่อเทียบกับ MLA เต็มรูปแบบ
• KV cache — เล็กลงได้ถึง 75% ซึ่งคือที่มาของ throughput
• บริบทยาว — RULER ที่ 128k: 84.3 สำหรับ Kimi Linear ด้วยความเร็วที่เพิ่มขึ้น 3.98 เท่า เทียบกับ 81.3 สำหรับพื้นฐาน MLA
• บริบทสั้น — MMLU-Pro ที่ 4k: 51.0 เทียบกับ 47.2 สำหรับเบสไลน์ MLA และ 47.9 สำหรับไฮบริด Gated DeltaNet ที่ความเร็วใกล้เคียงกับ full attention โดยประมาณ ดังนั้นการออกแบบนี้จึงไม่ได้แลกความเร็วบริบทยาวด้วยการลดทอนคุณภาพบริบทสั้น
• การตัดทอนการเทรนล่วงหน้า — ไฮบริดแบบ 3:1 ให้ความเพอร์เพล็กซิตี้บนชุดตรวจสอบเท่ากับ 5.65 ในขณะที่ full attention ได้ที่ 5.77
ขีดจำกัดที่แท้จริงของทั้งหมดนั้น: หลักฐานกลุ่มควบคุมที่จับคู่กันสิ้นสุดที่ 48B ไม่มีใครสร้างคู่แฝดแบบ full-attention ขนาด 2.8T ของ Kimi K3 เพื่อนำมาเปรียบเทียบ และ ณ การตรวจสอบข้อเท็จจริงของสถาปัตยกรรม K3 ช่วงปลายเดือนกรกฎาคม 2026 ยังไม่มีการเผยแพร่การทดสอบการเรียกคืนบริบทระยะยาวแบบไม่ใช้ทางลัดโดยอิสระสำหรับทั้งสองโมเดล เรื่องราวด้านประสิทธิภาพได้รับการสนับสนุนอย่างดี เรื่อง "outperforms full attention" ได้รับการสนับสนุนในระดับงานวิจัยโดยห้องแล็บที่เขียนบทความ

กระแสตอบรับจนถึงตอนนี้ดูเหมือนจะมาจากจำนวนดาวน์โหลด มากกว่าการถูกนำไปใช้ในสถาปัตยกรรมของผู้อื่น: 98,164 ดาวน์โหลดในเดือนที่แล้ว, 570 ไลก์, ผู้ให้บริการอินเฟอเรนซ์หนึ่งรายที่ระบุบน Hugging Face และแผนผังโมเดลที่มีอะแดปเตอร์ 2 ตัว, ฟิวน์จูน 8 ตัว และควอนไทเซชัน 24 ตัว เห็นได้ชัดว่าเป็นที่นิยม ส่วนการถูกก็อปปี้เป็นอีกเรื่องหนึ่ง
กรณีการนำไปใช้ที่แข็งแกร่งที่สุด: Ling-3.0-flash
Ling-3.0-flash คือตัวที่ {{1}}ทำให้ข้อกล่าวอ้างนั้นเป็นจริง{{/1}} การ์ด Hugging Face ของมันอธิบายถึง{{2}}สถาปัตยกรรม linear attention แบบไฮบริดเนทีฟที่สร้างจากสแตกสลับอัตราส่วน 5:1 ของ Kimi Delta Attention และ MLA — 35 ชั้น KDA ต่อ 7 ชั้น gated MLA{{/2}} — บน{{3}}โมเดล Mixture-of-Experts ขนาด 124B พารามิเตอร์ โดยมี 5.1B แอ็กทีฟต่อโทเคน{{/3}}, {{4}}บริบท 256K ที่ฝึกแบบค่อยเป็นค่อยไปจาก 8K ไป 32K ไป 256K{{/4}} และ{{5}}ใบอนุญาต MIT{{/5}} นั่นไม่ใช่{{6}}ของเล่นเพื่อการวิจัยจากมือสมัครเล่น{{/6}}; มันคือ{{7}}โมเดลที่วางจำหน่ายจริงจากห้องแล็บที่ได้รับการยอมรับ{{/7}} และมันเอ่ยชื่อ{{8}}โมดูลแอตเทนชันของ Moonshot ในคำอธิบายสถาปัตยกรรมของตัวเอง{{/8}}
มันยังดำเนินเรื่องนี้อย่างเข้มข้นกว่า Moonshot อีกด้วย Moonshot คงเลเยอร์ exact-attention หนึ่งชั้นในทุกสี่ชั้น ส่วน Ling-3.0-flash คงหนึ่งชั้นในทุกหกชั้น หากการออกแบบใดเป็นจุดอ่อน คุณก็ต้องป้องกันความเสี่ยงไว้ คุณไม่ควรใช้ global layers น้อยกว่าคนที่คิดค้นมันขึ้นมา เมื่ออ่านเทียบกับรุ่นก่อนหน้า นี่คือการเปลี่ยนแปลง: การสำรวจสถาปัตยกรรมในเดือนกุมภาพันธ์ 2026 ที่จัดหมวดหมู่โมเดลคลาสนี้ ระบุว่า Ling รุ่นเรือธงก่อนหน้านี้ใช้ Lightning Attention คู่กับ MLA ในอัตราส่วน 7:1 กลไกเปลี่ยนไประหว่างรุ่น และทิศทางที่เปลี่ยนไปคือมุ่งสู่ KDA
ข้อควรระวังสองประการที่เราจะไม่ปิดบัง ประการแรกมาจากการรายงานตามการ์ด: เราอ่านคำอธิบายสถาปัตยกรรมของตัว repository เองและการกำหนดค่า ซึ่งประกาศโมเดลประเภท bailing_hybrid แบบกำหนดเองพร้อมการใช้งาน BailingMoeV3 — เราไม่ได้ตรวจสอบเคอร์เนลเพื่อยืนยันว่าคณิตศาสตร์เป็น KDA จริงหรือเป็นเพียงแรงบันดาลใจจาก KDA และ repository นี้ไม่มีแท็ก KDA เลย สิ่งที่ปรากฏในการค้นหาแท็กคือการแปลง GGUF จากบุคคลที่สามซึ่งมีคนอื่นเป็นผู้ติดป้ายกำกับ ซึ่งเป็นคำเตือนที่มีประโยชน์เกี่ยวกับวิธีการ และนำไปสู่สองส่วนถัดไปโดยตรง
Arcee AI ทำการทดลองที่ Moonshot ไม่ได้ทำ
การใช้ KDA จากภายนอกที่ให้ข้อมูลเชิงลึกมากที่สุดไม่ใช่ผลิตภัณฑ์แต่อย่างใด ประมาณหกสัปดาห์หลังจากเอกสาร Kimi Linear ในช่วงกลางเดือนธันวาคม 2025 Arcee AI ได้เผยแพร่เช็คพอยต์งานวิจัยสองตัวภายใต้สัญญาอนุญาต Apache-2.0 ได้แก่ AFM-4.5B-Base-KDA-Only และ AFM-4.5B-Base-KDA-NoPE ภายใต้การใช้งาน ArceeKDAForCausalLM ของตนเอง ซึ่งมีการแท็กอย่างชัดเจนว่า kimi-delta-attention คำถามของพวกเขาคือสิ่งที่การออกแบบแบบไฮบริดของ Moonshot หลีกเลี่ยงอย่างรอบคอบ: ความสนใจแบบเต็มรูปแบบสามารถถูกแทนที่ได้ทั้งหมดหรือไม่? ดังนั้นพวกเขาจึงแปลงเลเยอร์ความสนใจทั้ง 24 ชั้นเป็น KDA โดยไม่เหลือเลเยอร์ความสนใจระดับโลกไว้ และกลั่นผลลัพธ์จาก AFM-4.5B-Base ดั้งเดิมเป็นครูที่ความยาวลำดับ 32k
ผลลัพธ์ที่รายงานของพวกเขา ครูเทียบกับนักเรียน KDA บริสุทธิ์:
• MMLU — 63.1 เป็น 55.8 การลดลงจริงแต่ยังพอรับมือได้
• GSM8K — จาก 52.1 เป็น 26.8 ลดลงประมาณครึ่งหนึ่ง
• HellaSwag — 78.0 ถึง 74.3 เกือบคงเดิม

รูปร่างของความเสียหายนั้นคือส่วนที่น่าสนใจ ความรู้กว้างๆ และการสานต่อตามสามัญสำนึกส่วนใหญ่ยังคงอยู่รอดเมื่อถูกส่งผ่านสถานะ recurrent ที่มีขนาดคงที่ แต่การคำนวณเลขหลายขั้นตอน ซึ่งต้องเรียกคืนผลลัพธ์ระหว่างทางที่โมเดลเขียนไว้หลายขั้นตอนก่อนหน้าอย่างแม่นยำ กลับไม่รอด Arcee ยังรายงานว่าการเสื่อมคุณภาพในบริบทยาวเป็นไปอย่างค่อยเป็นค่อยไป ไม่มีจุดตกแบบหักศอก เมื่อมองโดยรวม นี่คือหลักฐานสาธารณะที่ชัดเจนที่สุดว่าทำไมการใช้งาน KDA ที่จริงจังทุกครั้งจึงเป็นระบบลูกผสม: เลเยอร์ระดับโลกหนึ่งในสี่ของ Moonshot และหนึ่งในหกของ Ant ไม่ใช่ความขี้ขลาด แต่เป็นส่วนที่รักษาความสามารถในการคำนวณเลขไว้
สิ่งนี้ไม่ใช่: คำตัดสินเรื่อง KDA ในระดับใหญ่ นี่คือการกลั่น (distillation) ขนาด 4.5B ไม่ใช่การฝึกก่อน (pretraining) และการกลั่นเข้าสู่สถาปัตยกรรมที่เปลี่ยนไปนั้นสูญเสียสิ่งที่การฝึกจากศูนย์จะไม่สูญเสีย จงอ่านมันในฐานะการทดสอบแบบ ablation ที่ผู้ขายไม่มีแรงจูงใจจะเผยแพร่ — จากห้องปฏิบัติการอิสระที่ไม่มีส่วนได้ส่วนเสียกับคำตอบ
หางยาว: กลุ่มของ repos KDA ขนาดเล็กในหนึ่งสัปดาห์
ภายใต้กรณีร้ายแรงสองกรณีนั้น ยังมีกรณีเล็กๆ กระจายอยู่ และวันที่ต่างหากที่ทำให้กรณีเหล่านี้น่าสนใจ NEXIVON-1B-BASE อัปโหลดเมื่อวันที่ 31 กรกฎาคม 2026 ประกาศประเภทโมเดลของมันตามตัวอักษรว่า kda — Apache-2.0 ดาวน์โหลด 285 ครั้ง ไม่มีไลก์ qingyi-kda-0.6b ในสัปดาห์เดียวกัน เป็นฟินจูนของ Qwen3-0.6B-Base ที่มาพร้อมการใช้งาน qingyi_kda แบบกำหนดเอง Scrapegoat-Tiny-Coder ในสัปดาห์นั้นเช่นกัน รวมแท็ก kda เข้ากับการออกแบบ "dual-track parallel attention" ของตัวเอง อีกสองตัว maccy-106m-base และ maccy-96m-16k-base ถูกแท็กเป็น kimi-delta-attention ในวันที่ 27 และ 28 กรกฎาคม
ไม่มีสิ่งใดในนี้ที่สำคัญด้วยตัวของมันเอง — ไลก์เลขตัวเดียว ผู้เขียนที่ไม่รู้จัก จำนวนพารามิเตอร์ระดับงานวิจัย โดยรวมแล้ว สิ่งเหล่านี้อาจเป็นสิ่งที่การนับ "โมเดลภายนอกตัวที่สามที่ฉันเห็น" กำลังนับอยู่ และเราไม่สามารถยืนยันได้ว่าสามตัวคืออะไร เพราะโพสต์ไม่ได้ระบุชื่อใด ๆ สัญญาณที่อยู่ในนั้นไม่ใช่ตัวโมเดล แต่เป็นสิบวัน: การฝึกขนาดเล็กอิสระสี่รันเข้าถึง KDA ภายในหนึ่งสัปดาห์ครึ่ง ซึ่งเกิดขึ้นเมื่อเคอร์เนลหยุดเป็นเพียงสิ่งประดิษฐ์จากงานวิจัยและกลายเป็นสิ่งที่คุณสามารถใส่ลงในสคริปต์การฝึกได้ในช่วงสุดสัปดาห์
สิ่งที่การค้นหาไม่พบ
เราค้นหาใน Hugging Face เพื่อหารีโพซิทอรีทั้งหมดที่มีประเภทโมเดล kimi_linear มีอยู่ 47 รายการ ทั้งหมดยกเว้นสามรายการมีคำว่า "Kimi" ในชื่อ และสิ่งที่ไม่ได้เป็นของ Moonshot เองล้วนเป็นเวอร์ชันดัดแปลง (derivatives) มากกว่าจะเป็นผู้นำไปใช้โดยตรง: การควอนไทซ์ AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF และ MLX ในทุกระดับบิต; REAP ซึ่งเป็นตัวแปร 35B ที่ผ่านการ prune แบบ expert จาก Cerebras; และบิลด์ FlagRelease FlagOS ของ checkpoint Instruct สำหรับตัวเร่ง NVIDIA, MetaX และ Hygon กลุ่มสุดท้ายนี้ชวนสนใจอย่างแท้จริงด้วยเหตุผลอีกอย่าง — มีใครบางคนทำการบ้านเพื่อให้ KDA ทำงานบนซิลิคอนจีนในประเทศ — แต่ไม่มีสิ่งใดเลยที่มาจากห้องแล็บอื่นที่ออกแบบโมเดลใหม่
ไม่มีโมเดลระดับ frontier-scale นอก Moonshot ที่ประกาศ KDA โดย Ling-3.0-flash ที่มีขนาดรวม 124B และแอ็กทีฟ 5.1B คือเพดานสูงสุดของการนำไปใช้งานภายนอกในตอนนี้
และวิธีการนี้มีช่องโหว่ที่สมควรได้รับการตั้งชื่อ เนื่องจากมันขัดกับผลลัพธ์เชิงลบของเราเอง ห้องปฏิบัติการที่นำ KDA ไปใช้ใหม่จะลงทะเบียนประเภทโมเดลของตนเอง เช่น arcee_kda, qingyi_kda, bailing_hybrid ดังนั้นการกวาดแท็กจึงนับจำนวนผู้ใช้งานที่เรากำลังมองหาน้อยเกินไปอย่างเป็นระบบ และโมเดลสามารถใช้กลไกนี้ได้โดยไม่ต้องเขียนคำว่า "KDA" ลงในการ์ดของมันเลย การไม่ปรากฏในแท็กเป็นหลักฐานที่อ่อนแอ ไม่ใช่ข้อพิสูจน์ หากมีผู้ใช้งานเงียบรายที่สี่หรือห้า นี่คือวิธีที่มันจะคงมองไม่เห็นอย่างแท้จริง
คนอื่นๆ เลือก linear attention ที่แตกต่างกัน
เหตุผลที่ "Kimi Linear กำลังได้รับการนำไปใช้" กลายเป็นเรื่องราวก็เพราะว่า ในช่วงเกือบทั้งปี 2026 มันไม่เป็นเช่นนั้น แอตเทนชันเชิงเส้นแบบไฮบริดครองวงการโมเดลน้ำหนักเปิด — แต่ไม่ใช่เวอร์ชันนี้ ตามแบบสำรวจสถาปัตยกรรมที่เผยแพร่ในเดือนกุมภาพันธ์ 2026: Qwen3-Next 80B-A3B และ Qwen3.5-397B-A17B ต่างจับคู่ Gated DeltaNet กับ gated attention ในอัตราส่วน 3:1 หมายความว่า Qwen3.5-397B-A17B ใช้เลเยอร์แบบ recurrent 45 เลเยอร์ เทียบกับเลเยอร์ full-attention 15 เลเยอร์ จากทั้งหมด 60 เลเยอร์ โมเดลเรือธง Ling รุ่นก่อนหน้าใช้ Lightning Attention ร่วมกับ MLA ในอัตราส่วน 7:1 Nemotron 3 Nano 30B-A3B และ Super 120B-A12B เป็นไฮบริดแบบ Mamba-2 โดยมีเลเยอร์ attention เพียง 6 เลเยอร์ในสแต็ก 52 เลเยอร์ และ 8 เลเยอร์ในสแต็ก 88 เลเยอร์ ตามลำดับ GLM-5 ยังคงใช้ MLA และเพิ่ม sparse attention ขึ้นไปอีกชั้น MiniMax-M2.5 ไปอีกทางโดยสิ้นเชิง โดยคง multi-head attention ธรรมดาไว้ รายงานว่ามาเพื่อความน่าเชื่อถือ และ Kimi K2.5 โมเดลเรือธงของ Moonshot ก่อน K3 เป็นแบบ MLA — ห้องแล็บเผยแพร่ KDA ในเดือนตุลาคม 2025 และไม่ได้ใส่ลงในโมเดลระดับแนวหน้าจนถึงเดือนกรกฎาคม 2026
ดังนั้น หมวดหมู่ชนะ แต่ตัวแปรไม่ชนะ ทุกคนเห็นพ้องว่าสามในสี่ของเลเยอร์ของคุณสามารถเป็นแบบ recurrent ได้ แต่ไม่มีใครเห็นพ้องว่าจะใช้ recurrence แบบใด จุดแตกต่างของ KDA คือ per-channel decay gate และต้นทุนของมันคือคุณต้องใช้ custom kernels และโครงสร้างพื้นฐานสำหรับ prefix-caching ของมัน แทนที่จะใช้เส้นทาง Gated DeltaNet ที่ครึ่งหนึ่งของระบบนิเวศมีอยู่แล้ว จนถึงเดือนนี้ มีเพียงห้องปฏิบัติการเดียวที่จ่ายต้นทุนนั้น
การนำไปใช้ที่เกิดขึ้นแล้วอยู่ในสแตกการให้บริการ
สถาปัตยกรรมไม่ได้แพร่หลายเพราะความสวยงาม แต่แพร่หลายเมื่อโครงสร้างพื้นฐานทำให้มันมีต้นทุนต่ำ ส่วนนั้นเสร็จสิ้นแล้วสำหรับ KDA และมันเกิดขึ้นเร็วกว่าการนำโมเดลการ์ดไปใช้ (model-card adoption) ทั้ง vLLM และ SGLang ให้การสนับสนุนตั้งแต่วันแรกที่น้ำหนักของ Kimi K3 ถูกปล่อยออกมาในวันที่ 27 กรกฎาคม 2026 โดย Moonshot ได้ส่งโค้ด (upstream) การใช้งาน prefix-caching ของ KDA เข้าไปในตัว vLLM เอง แทนที่จะดูแล fork แยกต่างหาก SGLang ได้ส่งเคอร์เนลแบบ fused ของ KDA และ Gated DeltaNet และรายงานความจุ KV เชิงตรรกะเพิ่มขึ้นจาก 1.5M เป็น 12.2M โทเค็นบนฮาร์ดแวร์เดียวกัน — เป็นการวัดของพวกเขาเอง และเป็นตัวเลขประสิทธิภาพจากบุคคลที่สามที่ชัดเจนที่สุดในเรื่องทั้งหมดนี้ เคอร์เนลอ้างอิงอยู่ใน fla-core ซึ่งการเทรนขนาดเล็กใดๆ ก็สามารถนำเข้าได้
นั่นคือความแตกต่างระหว่าง Arcee ที่ต้องใช้ความพยายามในการวิจัยอย่างตั้งใจในเดือนธันวาคม 2025 กับสี่ anonymous repos ที่ประกาศ KDA อย่างไม่เป็นทางการภายในหนึ่งสัปดาห์ของเดือนกรกฎาคม 2026 กลไกดังกล่าวกลายเป็น dependency ที่คุณติดตั้งได้ ไม่ว่าฟรอนเทียร์จะตามมาหรือไม่นั้นเป็นอีกคำถามหนึ่ง แต่ข้อโต้แย้งเรื่องอุปสรรคต่อ KDA ส่วนใหญ่ได้หายไปแล้ว
มันเปลี่ยนอะไรถ้าคุณแค่ซื้อโทเคนเท่านั้น
ไม่มีอะไรเกี่ยวกับโค้ดของคุณ คุณไม่เคยเรียกใช้ KDA คุณเพียงรับรู้มันผ่านค่าใช้จ่ายของบริบทหนึ่งล้านโทเคนและระยะเวลาที่โทเคนแรกใช้ Kimi K3 คือโมเดลที่สิ่งนี้ปรากฏให้เห็นในเชิงพาณิชย์ในปัจจุบัน — บน OrcaRouter มันมีราคา $3.00 ต่อล้านโทเคนนำเข้าและ $15.00 ต่อล้านโทเคนขาออก พร้อมบริบทเต็ม 1M โทเคน และค่า p50 ของเวลาจนถึงโทเคนแรกที่วัดได้ 8.88 วินาทีในช่วงเจ็ดวันที่ผ่านมา ต้นทุนเหล่านี้ โดยพื้นฐานแล้ว คือสิ่งที่ไฮบริด KDA แบบ 3:1 มอบให้ นั่นคือการให้บริการบริบทหนึ่งล้านโทเคนในราคาที่เพียงแค่แพง ไม่ใช่แพงจนเกินเอื้อม

จุดตรวจสอบสำหรับงานวิจัยเป็นคนละเรื่องกัน Kimi-Linear-48B-A3B-Instruct ใช้สัญญาอนุญาต MIT โดยมีผู้ให้บริการอินเฟอเรนซ์หนึ่งรายระบุไว้บนหน้า Hugging Face และโมเดลนี้ไม่ได้อยู่ใน OrcaRouter — หากคุณต้องการเรียกใช้งาน นั่นหมายถึงการโฮสต์ด้วยตนเองหรือใช้ผู้ให้บริการรายนั้น ตัวเลขสำหรับการโฮสต์ด้วยตนเองนั้นเป็นมิตรกว่าที่จำนวนพารามิเตอร์บ่งบอก: น้ำหนักโมเดล 48B ในรูปแบบ bf16 มีขนาดประมาณ 96 GB ดังนั้นจึงต้องใช้การ์ด 80 GB สองใบ ในขณะที่เวอร์ชันแปลง 4-bit แบบ MLX และ GGUF อยู่ที่ประมาณ 25-30 GB และพอดีกับการ์ดใบเดียวหรือ Mac ที่สเปกดี Ling-3.0-flash ก็ไม่ได้อยู่ใน OrcaRouter ในตอนนี้เช่นกัน เราจะไม่แสร้งทำเป็นว่าเป็นอย่างอื่นเพื่อสร้างประเด็นเกี่ยวกับการจัดเส้นทาง
จุดที่การจัดเส้นทาง (routing) มีความสำคัญจริงๆ คือต้นทุนของการเดิมพันสถาปัตยกรรมที่ผิดพลาด โมเดลไฮบริดแบบเชิงเส้นแอตเทนชัน (hybrid linear attention models) คือกลุ่มที่ตาราง benchmark ของผู้ขายกับปริมาณงานจริงของคุณอาจไม่สอดคล้องกัน — สถานะรีเคอร์เรนต์ขนาดคงที่ไม่สามารถรองรับรูปแบบการดึงข้อมูล (retrieval patterns) ที่ไม่มีคะแนนรวมใดเปิดเผยได้ ซึ่งเป็นบทเรียนจากตัวเลข GSM8K ที่ลดลงครึ่งหนึ่ง การเปรียบเทียบผ่าน API key เดียวครอบคลุมโมเดลมากกว่า 200 รายการ ทำให้การทดสอบเป็นเพียงการเปลี่ยนสตริงโมเดล ไม่ใช่วงจรการจัดซื้อ ในราคารายการของผู้ให้บริการ โดยไม่มีมาร์กอัปจากฝั่งเรา และมีการ failover อัตโนมัติ เพื่อให้โมเดลรองรับบริบทยาว (long-context) ที่คุณยังประเมินอยู่ไม่เป็นจุดเดียวที่ทำให้ระบบการผลิตล้มเหลว ลองใช้กับปริมาณงาน long-context ของคุณเองสักหนึ่งวัน นั่นคือคำตอบที่ประหยัดกว่าตาราง benchmark ใดๆ รวมถึงของเราเอง
คำถามที่ควรค่าแก่การถามจริงๆ
Kimi Linear เหมือนกับ Kimi K3 หรือไม่?
ไม่ใช่ และการปะปนทั้งสองอย่างนี้เป็นข้อผิดพลาดที่พบบ่อยที่สุดในการรายงานข่าวของทั้งคู่ Kimi Linear คือเอกสารทางสถาปัตยกรรมพร้อมกับโมเดลงานวิจัยขนาด 48B รวม, 3B แอ็กทีฟ, บริบท 1M, เผยแพร่ภายใต้ MIT ในช่วงปลายปี 2025 เพื่อแสดงให้เห็นว่าไฮบริดที่เน้น KDA ชนะ MLA เต็มรูปแบบเมื่อเทียบที่การเทรนเดียวกัน Kimi K3 คือเรือธงพารามิเตอร์ 2.8 ล้านล้านของ Moonshot จากกรกฎาคม 2026 — 104B แอ็กทีฟ, มัลติโมดัลโดยกำเนิด, บริบท 1M — ซึ่งนำแนวคิด KDA-อัตราส่วน 3:1 ไปสู่สเกลระดับ frontier และเพิ่ม Attention Residuals ซึ่งเป็นเทคนิคแยกที่ห้องแล็บรายงานว่าช่วยเพิ่มประสิทธิภาพการเทรนประมาณ 25% โดยมีต้นทุนเพิ่มไม่ถึง 2% กลไกเดียวกัน แต่ขนาด ความสามารถ และราคาแตกต่างกันโดยสิ้นเชิง ผล benchmark จากอันหนึ่งบอกอะไรเกี่ยวกับอีกอันได้น้อยมาก
ทำไมห้องแล็บถึงเลือก KDA มากกว่า Gated DeltaNet ในเมื่อส่วนใหญ่เลือก Gated DeltaNet?
KDA คือการปรับปรุงที่เข้มงวดของ Gated DeltaNet ดังนั้นคำถามคือการปรับปรุงนี้คุ้มค่ากับต้นทุนในการเปลี่ยนหรือไม่ จุดที่ปรับปรุงคือเกต: Gated DeltaNet ทำให้หน่วยความจำแบบวนซ้ำสลายตัวด้วยสเกลาร์หนึ่งตัวต่อขั้นตอน ขณะที่ KDA เรียนรู้การสลายตัวต่อช่องฟีเจอร์ ซึ่งทำให้สถานะสามารถเก็บชื่อตัวแปรไว้ตลอดหนึ่งหมื่นโทเคน ในขณะที่ล้างประโยคที่ชื่อนั้นปรากฏอยู่ ผลการทดสอบแบบ ablation ของ Moonshot ประเมินว่าอยู่ที่ประมาณ 0.12 ของ validation perplexity ที่ 48B และสูตร DPLR แบบ chunked ถูกเขียนขึ้นเพื่อให้ tensor cores ทำงานไม่ว่าง ดังนั้นความสามารถในการแสดงออกที่เพิ่มขึ้นจึงไม่ได้แลกกับปริมาณงานที่มันให้มา ในทางกลับกัน Gated DeltaNet มีการรองรับเคอร์เนลและเฟรมเวิร์กอย่างกว้างขวางอยู่แล้วก่อนที่ทั้งสองอย่างจะกลายเป็นกระแส ซึ่งคุ้มกับเวลาในการพัฒนาจริง คำตอบในปี 2026 ส่วนใหญ่คือ "ไม่คุ้ม" Ling-3.0-flash คือการเดิมพันระดับโปรดักชันครั้งแรกในทิศทางตรงกันข้าม
สิ่งใดในนี้ควรเปลี่ยนสิ่งที่ฉันจะนำไปใช้ในไตรมาสนี้หรือไม่?
เฉพาะเมื่อคุณกำลังใช้งานบริบทที่ยาวมากเท่านั้น หากพรอมต์ของคุณอยู่ต่ำกว่าประมาณ 32k โทเคน hybrid linear attention ก็เป็นเพียงรายละเอียดเชิงการนำไปปฏิบัติที่ไม่มีผลต่อการเลือกโมเดลของคุณ จงเลือกโดยพิจารณาจากคุณภาพ ราคา และความหน่วงตามปกติ หากคุณใช้งานที่ 128k ขึ้นไป ควรรู้ไว้ว่าโมเดลที่ช่วยให้ต้นทุนของคุณยังคงสมเหตุสมผลที่ความยาวระดับนั้นนั้นเป็นไฮบริดแบบ KDA มากขึ้นเรื่อย ๆ และค่าคะแนนบริบทระยะยาวที่พวกเขาเผยแพร่เป็นเกณฑ์วัดแบบรวม มากกว่าที่จะเป็นการทดสอบการเรียกคืนเชิง adversarial จงทดสอบการเรียกคืนข้อมูลที่ความยาวบริบทจริงของคุณ แทนที่จะเชื่อคะแนน RULER คำแนะนำเช่นนี้จะเหมือนกันไม่ว่ากลไกจะเป็น Gated DeltaNet หรือ Mamba-2
แล้วข้อกล่าวอ้างจะอยู่ตรงไหน
ทิศทางถูกต้อง และเล็กกว่าที่ฟังดู สิ่งที่ตรวจสอบได้ในวันที่ 5 สิงหาคม 2026 คือโมเดลการผลิตหนึ่งตัวจากแล็บที่จัดตั้งแล้ว งานวิจัยหนึ่งคู่จากแล็บอิสระในสหรัฐฯ ที่เผยแพร่ข้อเสียอย่างตรงไปตรงมา โมเดล sub-1B สองสามตัวจากสิบวันที่ผ่านมา และระบบนิเวศการให้บริการที่ซึมซับเคอร์เนลไปแล้ว นั่นมากกว่า 'กลอุบายของแล็บเดียว' และน้อยกว่ามาตรฐานมาก ตัวเลขที่ต้องจับตามองไม่ใช่โมเดลภายนอกสามตัว — แต่คือว่าการปล่อยโมเดล open-weight แนวหน้าตัวถัดไปจากแล็บที่ไม่ใช่ Moonshot จะมาพร้อม per-channel gating หรือไม่ และมีใครนอก Moonshot เผยแพร่ recall probe ที่ทดสอบว่าสถานะขนาดคงที่ลืมอะไรไปจริงหรือไม่ ทั้งสองอย่างจะบอกคุณได้มากกว่าภาพหน้าจออีกหนึ่งภาพ
