
Kimi K4: ข่าวรั่วไหลอ้างไว้จริง ๆ ว่าอะไร และทำไม "พารามิเตอร์ที่แอคทีฟน้อยลง" ถึงเป็นเรื่องราวที่แท้จริง
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 506 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 183 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
โพสต์เพียงชิ้นเดียวทำให้ชื่อโมเดลที่ยังไม่ได้ประกาศเปิดตัวถึงสี่ชื่อถูกพูดถึงพร้อมกันในทันที รายชื่อเริ่มต้นด้วย Kimi K4 ซึ่งถูกคาดหมายว่าเป็นเจเนอเรชันถัดไปจาก Moonshot AI อยู่เคียงข้าง GLM-5.5 Flash และ GLM-5.4 จาก Z.ai และ DeepSeek V4.1P — และสิ่งที่ผู้เขียนเน้นเองไม่ใช่ชื่อเรือธงใด ๆ แต่เป็นข้อสงสัยเกี่ยวกับคณิตศาสตร์ที่อยู่เบื้องหลัง K4 นั่นคือมันอาจเปิดใช้งานพารามิเตอร์น้อยลงกว่าโมเดลที่มันเข้าแทนที่ ข้อกล่าวอ้างนี้ยังไม่ได้รับการยืนยัน ไม่มีโมเดลการ์ดของ Kimi K4 ไม่มีเวต ไม่มีตัวระบุ API ไม่มีราคา และไม่มีเส้นทาง และก็เป็นเช่นเดียวกันกับทุกชื่อของ Z.ai ในรายการนี้ สิ่งที่คุ้มค่าที่จะทำในตอนนี้คือการหาว่าข้อกล่าวอ้างใดในบรรดานี้ที่ตรวจสอบได้ เส้นฐานที่ส่งมอบจริงเป็นอย่างไร และ K4 ที่เบาบางลงจริง ๆ จะหมายความว่าอะไร
สัญญาณ และระดับของมัน
นี่เป็นสัญญาณระยะแรก และควรอ่านในฐานะเช่นนั้น โพสต์ที่นำสัญญาณนี้เป็นการตีความแนวทางการตั้งชื่อโมเดลมากกว่ารายงานการพบเห็น: โพสต์ดังกล่าวชี้ว่า "GLM-5.5 Flash, GLM-5.4" เป็นชื่อเรียกที่น่าสนใจ และเรียก Kimi K4 ว่า "แปลกมาก" จากนั้นเสนอกลไกเชิงคาดเดา — จำนวน expert ที่ถูกเปิดใช้งานน้อยลง — โดยไม่อ้างว่าได้เห็น config, รายการ checkpoint หรือ staging endpoint
ไม่มีสิ่งใดในบันทึกสาธารณะที่ขัดแย้งกับชื่อเหล่านั้น และไม่มีสิ่งใดยืนยันชื่อเหล่านั้นเช่นกัน ความไม่สมมาตรนี้เป็นเรื่องปกติสำหรับขั้นนี้ของวงจรการเปิดตัว และนี่คือเหตุผลที่แนวทางที่มีประโยชน์คือการกำหนดค่าพื้นฐานและชุดทดสอบให้แน่นอน ไม่ใช่การคาดเดาเพิ่มเติม ชื่อที่อยู่ในโพสต์เป็นเพียงสมมติฐานเกี่ยวกับผลิตภัณฑ์ ไม่ใช่หลักฐานว่ามีผลิตภัณฑ์นั้นอยู่จริง
ค่าพื้นฐานที่ Kimi K4 จะถูกนำมาวัดเทียบด้วย
Kimi K3 เป็นของจริง ถูกปล่อยออกมาแล้ว และมีเอกสารประกอบที่ละเอียดอย่างผิดปกติ ซึ่งทำให้มันเป็นจุดอ้างอิงที่มั่นคง การ์ดโมเดลของ Moonshot เองอธิบายถึงโมเดล Mixture-of-Experts ขนาด 2.8 ล้านล้านพารามิเตอร์ ที่เปิดใช้งาน 104B พารามิเตอร์ต่อโทเคน กระจายอยู่เหนือ 93 เลเยอร์ — หนึ่งเลเยอร์แบบหนาแน่น และ 92 เลเยอร์แบบเบาบาง ความเบาบางนี้รุนแรงและถูกระบุไว้อย่างชัดเจน: ผู้เชี่ยวชาญ 16 จาก 896 ตัวทำงานต่อโทเคน นอกเหนือจากผู้เชี่ยวชาญที่ใช้ร่วมกัน 2 ตัว ซึ่ง Moonshot ให้เครดิตกับสิ่งนี้ว่าช่วยปรับปรุงประสิทธิภาพในการขยายขนาดได้ประมาณ 2.5 เท่าเมื่อเทียบกับ Kimi K2
โครงสร้างสแต็กของกลไก attention คือจุดที่ K3 แตกต่างจากรุ่นก่อนหน้า จากเลเยอร์แบบ sparse ทั้งหมด 92 เลเยอร์ มี 69 เลเยอร์ที่ใช้ Kimi Delta Attention ซึ่งเป็นกลไก linear attention แบบไฮบริด และอีก 24 เลเยอร์ใช้ gated MLA เป็นการแบ่งสัดส่วน 3:1 ที่คงเลเยอร์ full attention ไว้เพียงส่วนน้อย และผลักเลเยอร์ที่เหลือไปยังเส้นทาง linear ที่ประหยัดกว่า แต่ละเลเยอร์มี attention residual ทุก ๆ 12 บล็อก ฟังก์ชัน activation คือ SiTU-GLU และโมเดลทั้งหมดถูกฝึกด้วยน้ำหนัก MXFP4 และค่า activation MXFP8 ภายใต้การฝึกแบบ quantization-aware training ความยาว context อยู่ที่ 1,048,576 โทเคน ขนาด vocabulary คือ 163,840 และระบบ visión ทำงานผ่านเอนโคเดอร์ MoonViT-V2 ขนาด 401 ล้านพารามิเตอร์ ทำให้ K3 สามารถรองรับภาพได้โดยกำเนิด แทนที่จะเป็น multimodal แบบต่อพ่วง

นั่นคือตัวเลขที่รุ่นสืบทอดต้องทำให้ได้ สังเกตสิ่งที่พวกมันสื่อเกี่ยวกับแนวคิด 'พารามิเตอร์ที่ใช้งานน้อยลง': K3 เป็นโมเดลแบบสปาร์สอย่างยิ่งอยู่แล้ว มันเปิดใช้งานประมาณ 3.7% ของจำนวนพารามิเตอร์ทั้งหมดต่อโทเคน K4 ที่เปิดใช้งานน้อยกว่า 104B จะไม่ใช่การตัดไขมันส่วนเกินออกจากดีไซน์ที่ให้ทรัพยากรเกินความจำเป็น — แต่มันจะเป็นการถอยกลับจากอัตราส่วนความเบาบางที่ Moonshot ได้ประกาศต่อสาธารณะว่าเป็นชัยชนะ และมันจะทำเช่นนั้นในรุ่นที่ส่วนที่เหลือของวงการกำลังไปในทิศทางตรงกันข้าม
“พารามิเตอร์ที่ใช้งานอยู่น้อยลง” จะหมายความว่าอะไรหากมันเป็นจริง
มีการตีความได้สองแบบ และทั้งสองชี้ไปในทิศทางที่ตรงกันข้ามกัน แบบที่เอื้ออาทรนั้นเป็นเชิงสถาปัตยกรรม: Moonshot อาจกำลังขยายไฮบริด KDA ให้ไกลออกไปอีก โดยแทนที่เลเยอร์ full-attention ด้วยเลเยอร์เชิงเส้นมากขึ้น และปรับสมดุลงบประมาณผู้เชี่ยวชาญใหม่ เพื่อให้จำนวนการเปิดใช้งานที่ต่ำลงแลกมาได้ซึ่งบริบทที่ยาวขึ้น ฐานการให้บริการที่ถูกลง หรืออัตราส่วนคุณภาพต่อฟล็อปที่ดีขึ้น ภายใต้การตีความนั้น จำนวนพารามิเตอร์ที่ใช้งานน้อยลงถือเป็นการปรับปรุงข้อเสนอเดียวกันที่ K3 ระบุไว้แล้ว — ว่าความเบาบางเป็นกลยุทธ์การขยายขนาด ไม่ใช่การประนีประนอม
การตีความอีกแบบหนึ่งคือ K4 ไม่ใช่ผู้สืบทอดแบบเดียวกันทั้งหมดเลย สายของ Kimi ได้แยกออกไปแล้วหนึ่งครั้งในปีนี้ และรายงานต่างๆ ก็บอกเป็นนัยถึง K3.1, K3.2 และ K4 ในฐานะผลิตภัณฑ์ที่แตกต่างกันสามแบบ K4 ที่เปิดใช้งานน้อยกว่า K3 ในตระกูลที่จัดส่งตัวแปรสำหรับเขียนโค้ดแยกต่างหาก อย่างน้อยก็สอดคล้องกับการวางตำแหน่งใหม่พอๆ กับการอัปเกรดตรงๆ การตีความทั้งสองแบบเป็นการคาดเดา ไม่มีแบบใดถูกตัดสินด้วยโพสต์
ยังมีมิติด้านสัญญาอนุญาตที่ยังไม่มีใครพูดถึงด้วย เวตของ K3 เผยแพร่ภายใต้ Kimi K3 License ซึ่งเป็นสัญญาอนุญาตแบบกำหนดเองประเภท “other” แทนที่จะเป็นสัญญาอนุญาตโอเพนซอร์สมาตรฐาน และมันเป็นโมเดลโอเพนระดับ 3T ตัวแรก การที่ K4 ที่เบาบางกว่าจะสืบทอดสัญญาอนุญาตนั้นหรือทำให้มันแคบลง สำคัญต่อใครก็ตามที่สร้างงานต่อยอดบนเวตเหล่านี้มากกว่าคะแนนดัชนีสักไม่กี่จุด

ชื่ออีกสามชื่อในโพสต์เดียวกัน
GLM-5.5 Flash และ GLM-5.4 เป็นคู่ที่สร้างความประหลาดใจได้มากกว่า และไม่ใช่เพราะตัวเลขที่ออกมา เพดานที่ Z.ai ประกาศไว้คือ GLM-5.3 ซึ่งเปิดตัวเมื่อวันที่ 14 สิงหาคม 2026 ด้วยพารามิเตอร์ 743B ตามมาด้วย GLM-5.3-Flash ในวันที่ 26 สิงหาคม และการปล่อยน้ำหนัก BF16 กับ Flash-BF16 เมื่อวันที่ 25 สิงหาคม เอกสารของ Z.ai เองระบุตัวระบุโมเดลปัจจุบันไว้เพียงสามตัวเท่านั้น คือ glm-5.3, glm-5.3-flash และ glm-5.2 ไม่มี GLM-5.4 ไม่มี GLM-5.5 และไม่มี GLM-5.5 Flash — และทิศทางการตั้งชื่อนั่นแหละคือส่วนที่แปลก เพราะรุ่น 5.5 ที่มาก่อนรุ่น 5.4 ไม่ใช่สิ่งที่ Z.ai เคยใช้กำหนดหมายเลขให้ตระกูลโมเดลใด ๆ เลย เลขเวอร์ชันที่โผล่ผิดลำดับในข้อมูลที่หลุดออกมาเป็นรูปแบบความล้มเหลวที่คุ้นเคยดี โดยมักเป็นผลิตภัณฑ์ที่อยู่ติดกัน โค้ดเนมภายใน หรือป้ายกำกับระดับการให้บริการ มากกว่าจะเป็นโมเดลฐานใหม่
DeepSeek V4.1P เป็นชื่อที่ผู้เขียนสัญญาณบอกว่าสนใจมากที่สุด และเป็นชื่อที่ตรวจสอบได้ง่ายที่สุดในสี่ชื่อ เอกสาร API ของ DeepSeek ระบุสตริงโมเดลปัจจุบันไว้เพียงสองรายการเท่านั้น: deepseek-flash และ deepseek-v4-pro คำต่อท้าย "P" ไม่มีคู่เทียบในตัวระบุของ DeepSeek ใด ๆ และการเผยแพร่น้ำหนักโมเดลล่าสุดในองค์กรของ DeepSeek เองคือ DeepSeek-V4.1-Flash ซึ่งเผยแพร่เมื่อวันที่ 10 กันยายน 2026 V4.1P น่าจะเป็นรุ่นพี่น้องระดับ Pro ของโมเดลนั้นมากที่สุด — แต่ "น่าจะมากที่สุด" เป็นการคาดเดาเกี่ยวกับสตริง ไม่ใช่ผลิตภัณฑ์
คุณจะรู้ได้ยังไงว่าสิ่งไหนในนี้เป็นเรื่องจริง
ทั้งสี่ชื่อไม่ผ่านการทดสอบเดียวกันด้วยวิธีเดียวกัน ซึ่งทำให้การรอเป็นเรื่องตรงไปตรงมาแทนที่จะทรมาน การเปิดตัวจริงย่อมทิ้งอาร์ติแฟกต์ไว้ และแต่ละชิ้นก็ตรวจสอบได้ง่าย:
• การ์ดโมเดลในองค์กร Hugging Face ของผู้จำหน่ายเอง รายการใหม่ล่าสุดของ Moonshot คือ Kimi-K3 ซึ่งสร้างเมื่อวันที่ 13 มิถุนายน 2026; รายการใหม่ล่าสุดของ Z.ai คือตระกูล GLM-5.3 จากวันที่ 25 สิงหาคม; รายการใหม่ล่าสุดของ DeepSeek คือ DeepSeek-V4.1-Flash จากวันที่ 10 กันยายน ไม่มีอะไรใหม่กว่านี้อยู่ในทั้งสามราย
• คอนฟิกที่ยุติข้อถกเถียง สำหรับ K4 โดยเฉพาะ ฟิลด์ที่ต้องมองหาคือ num_experts และ num_experts_per_token — ของ K3 ระบุไว้ที่ 896 และ 16 คอนฟิก K4 ที่มีตัวเลขต่อโทเคนต่ำกว่านี้คือข้อกล่าวอ้างในข้อมูลรั่วไหลนี้ที่จะถูกยืนยันหรือหักล้างได้ในไฟล์เดียว
• โมเดลที่กำหนดเส้นทางได้ (routable) ชื่อที่ปรากฏในแค็ตตาล็อกคือชื่อที่มีราคา มีหน้าต่างบริบท (context window) และมีผู้ให้บริการอยู่เบื้องหลัง ส่วนชื่อที่มีอยู่แค่ในโพสต์ไม่มีสิ่งเหล่านี้เลย

สิ่งที่คุณสามารถกำหนดเส้นทางได้ในวันนี้
นัยในทางปฏิบัติของข้อมูลที่หลุดมานี้คือ เจเนอเรชันที่มันอธิบายไว้นั้นไม่ใช่สิ่งที่คุณสร้างต่อยอดได้ สิ่งที่ใช้งานจริงอยู่ในขณะนี้คือรุ่นก่อนหน้า และหน้าที่ของเราเตอร์คือทำให้ช่องว่างระหว่างเจเนอเรชันเป็นการตัดสินใจด้านการกำหนดเส้นทาง มากกว่าที่จะเป็นโปรเจกต์โยกย้ายระบบ Kimi K3 พร้อมใช้งานแล้วในขณะนี้ ด้วยคอนเท็กซ์ 1M โทเคนเต็มรูปแบบและความสามารถด้านวิชันแบบเนทีฟ ในราคา $3.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $15.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน โดยการอ่านจากแคชอยู่ที่ $0.30 — คิดค่าบริการตามอัตราของผู้ให้บริการโดยไม่มีมาร์กอัป ซึ่งเป็นเหตุให้การเปลี่ยนแปลงราคาของผู้ขายสำหรับ K3 สะท้อนถึงบิลของคุณภายในวันเดียวกัน แทนที่จะเป็นรอบการปรับราคาครั้งถัดไป Kimi K3 บน OrcaRouterมีเอกสารข้อมูลจำเพาะฉบับเต็มและอัตราปัจจุบัน
เช่นเดียวกันกับส่วนที่เหลือของบอร์ด GLM-5.3, GLM-5.3-Flash และ DeepSeek V4.1 Flash ล้วนกำหนดเส้นทางได้เคียงข้าง Kimi K3 ผ่านเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ซึ่งครอบคลุม โมเดลกว่า 200 รายการ พร้อมการสลับสำรองอัตโนมัติ (failover) เมื่อผู้ให้บริการมีประสิทธิภาพลดลง และ DSL สำหรับกำหนดเส้นทางเพื่อแสดงความต้องการ — เพดานต้นทุน พื้นคุณภาพ งบความหน่วง — เป็นนโยบายแทนตรรกะรายการเรียกแต่ละครั้ง เมื่อ Kimi K4, GLM-5.5 Flash หรือ DeepSeek V4.1P ปรากฏขึ้นจริง การโยกย้ายก็เป็นเพียงการเปลี่ยนสตริงในนโยบายการกำหนดเส้นทางเท่านั้น ไม่มีอย่างอื่นอีก การหลอมรวมโมเดลช่วยให้คุณรวมเอาต์พุตจากหลายโมเดลบนเอนด์พอยต์เดียวกันได้ เมื่องานได้รับประโยชน์จากสิ่งนั้น
เพื่อให้ชัดเจนว่าสิ่งนั้นไม่ใช่อะไร: ชื่อที่รั่วไหลทั้งสี่ชื่อไม่มีชื่อใดเป็นเส้นทางบน OrcaRouter ในปัจจุบัน เราไม่ได้โฮสต์ชื่อเหล่านี้และไม่สามารถให้บริการได้
ประเด็นสำคัญ
ข้อกล่าวอ้างที่น่าสนใจตรงนี้ไม่ใช่หมายเลขเวอร์ชัน มันคือกลไก — เรือธงรุ่นถัดไปที่เปิดใช้งาน น้อยกว่าพารามิเตอร์เมื่อเทียบกับรุ่นก่อนหน้า จะเป็นข้อความที่ Moonshot เชื่อว่าความเบาบาง ไม่ใช่จำนวนการเปิดใช้งานดิบ คือแกนที่ควรผลักดัน และการแบ่งผู้เชี่ยวชาญ 16 จาก 896 ของ K3 ก็เป็นข้อโต้แย้งในทิศทางนั้นอยู่แล้ว ทุกส่วนของข้อกล่าวอ้างยังไม่ได้รับการยืนยัน: Kimi K4, GLM-5.5 Flash, GLM-5.4 และ DeepSeek V4.1P ไม่มีการ์ดโมเดล ไม่มีเวต ไม่มีตัวระบุ API และไม่มีราคา และแคตตาล็อกของผู้ขายเองก็หยุดอยู่ที่รุ่นก่อนหน้าในแต่ละกรณี ให้มองชื่อเหล่านี้เป็นตัวอย่างของคำถาม ไม่ใช่คำตอบ — และหากคุณต้องการเวตเปิดระดับแนวหน้าพร้อมบริบท 1M ในวันนี้ Kimi K3 คือโมเดลที่มีอยู่แล้ว
เมื่อ Kimi K4 มาถึงจริง ๆ การสลับระบบสำรองอัตโนมัติคือสิ่งที่ป้องกันไม่ให้การย้ายระบบกลายเป็นอุบัติการณ์
