การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า "Kimi K4" พร้อมคำบรรยายใต้ภาพ "สิ่งที่ข้อมูลรั่วไหลบอก และสิ่งที่มันไม่ได้บอก" ป้าย "รั่วไหล / ยังไม่ยืนยัน" สามบรรทัดเรียงซ้อนกันว่า "ไม่มีโมเดลการ์ด" "ไม่มีเวต" และ "ไม่มีราคาหรือเส้นทาง" และบรรทัดส่วนท้ายว่า "ณ วันที่ 25 กันยายน 2026" โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุมขวาล่าง
Guides & Insights

Kimi K4: ข่าวรั่วไหลอ้างไว้จริง ๆ ว่าอะไร และทำไม "พารามิเตอร์ที่แอคทีฟน้อยลง" ถึงเป็นเรื่องราวที่แท้จริง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โพสต์เพียงชิ้นเดียวทำให้ชื่อโมเดลที่ยังไม่ได้ประกาศเปิดตัวถึงสี่ชื่อถูกพูดถึงพร้อมกันในทันที รายชื่อเริ่มต้นด้วย K​imi K4 ซึ่งถูกคาดหมายว่าเป็นเจเนอเรชันถัดไปจาก Moonshot AI อยู่เคียงข้าง GLM-5.5 Flash และ GLM-5.4 จาก Z.ai และ D​eepSeek V4.1P — และสิ่งที่ผู้เขียนเน้นเองไม่ใช่ชื่อเรือธงใด ๆ แต่เป็นข้อสงสัยเกี่ยวกับคณิตศาสตร์ที่อยู่เบื้องหลัง K4 นั่นคือมันอาจเปิดใช้งานพารามิเตอร์น้อยลงกว่าโมเดลที่มันเข้าแทนที่ ข้อกล่าวอ้างนี้ยังไม่ได้รับการยืนยัน ไม่มีโมเดลการ์ดของ K​imi K4 ไม่มีเวต ไม่มีตัวระบุ API ไม่มีราคา และไม่มีเส้นทาง และก็เป็นเช่นเดียวกันกับทุกชื่อของ Z.ai ในรายการนี้ สิ่งที่คุ้มค่าที่จะทำในตอนนี้คือการหาว่าข้อกล่าวอ้างใดในบรรดานี้ที่ตรวจสอบได้ เส้นฐานที่ส่งมอบจริงเป็นอย่างไร และ K4 ที่เบาบางลงจริง ๆ จะหมายความว่าอะไร

สัญญาณ และระดับของมัน

นี่เป็นสัญญาณระยะแรก และควรอ่านในฐานะเช่นนั้น โพสต์ที่นำสัญญาณนี้เป็นการตีความแนวทางการตั้งชื่อโมเดลมากกว่ารายงานการพบเห็น: โพสต์ดังกล่าวชี้ว่า "GLM-5.5 Flash, GLM-5.4" เป็นชื่อเรียกที่น่าสนใจ และเรียก K​imi K4 ว่า "แปลกมาก" จากนั้นเสนอกลไกเชิงคาดเดา — จำนวน expert ที่ถูกเปิดใช้งานน้อยลง — โดยไม่อ้างว่าได้เห็น config, รายการ checkpoint หรือ staging endpoint

ไม่มีสิ่งใดในบันทึกสาธารณะที่ขัดแย้งกับชื่อเหล่านั้น และไม่มีสิ่งใดยืนยันชื่อเหล่านั้นเช่นกัน ความไม่สมมาตรนี้เป็นเรื่องปกติสำหรับขั้นนี้ของวงจรการเปิดตัว และนี่คือเหตุผลที่แนวทางที่มีประโยชน์คือการกำหนดค่าพื้นฐานและชุดทดสอบให้แน่นอน ไม่ใช่การคาดเดาเพิ่มเติม ชื่อที่อยู่ในโพสต์เป็นเพียงสมมติฐานเกี่ยวกับผลิตภัณฑ์ ไม่ใช่หลักฐานว่ามีผลิตภัณฑ์นั้นอยู่จริง

ค่าพื้นฐานที่ Kimi K4 จะถูกนำมาวัดเทียบด้วย

Kimi K3 เป็นของจริง ถูกปล่อยออกมาแล้ว และมีเอกสารประกอบที่ละเอียดอย่างผิดปกติ ซึ่งทำให้มันเป็นจุดอ้างอิงที่มั่นคง การ์ดโมเดลของ Moonshot เองอธิบายถึงโมเดล Mixture-of-Experts ขนาด 2.8 ล้านล้านพารามิเตอร์ ที่เปิดใช้งาน 104B พารามิเตอร์ต่อโทเคน กระจายอยู่เหนือ 93 เลเยอร์ — หนึ่งเลเยอร์แบบหนาแน่น และ 92 เลเยอร์แบบเบาบาง ความเบาบางนี้รุนแรงและถูกระบุไว้อย่างชัดเจน: ผู้เชี่ยวชาญ 16 จาก 896 ตัวทำงานต่อโทเคน นอกเหนือจากผู้เชี่ยวชาญที่ใช้ร่วมกัน 2 ตัว ซึ่ง Moonshot ให้เครดิตกับสิ่งนี้ว่าช่วยปรับปรุงประสิทธิภาพในการขยายขนาดได้ประมาณ 2.5 เท่าเมื่อเทียบกับ Kimi K2

โครงสร้างสแต็กของกลไก attention คือจุดที่ K3 แตกต่างจากรุ่นก่อนหน้า จากเลเยอร์แบบ sparse ทั้งหมด 92 เลเยอร์ มี 69 เลเยอร์ที่ใช้ Kimi Delta Attention ซึ่งเป็นกลไก linear attention แบบไฮบริด และอีก 24 เลเยอร์ใช้ gated MLA เป็นการแบ่งสัดส่วน 3:1 ที่คงเลเยอร์ full attention ไว้เพียงส่วนน้อย และผลักเลเยอร์ที่เหลือไปยังเส้นทาง linear ที่ประหยัดกว่า แต่ละเลเยอร์มี attention residual ทุก ๆ 12 บล็อก ฟังก์ชัน activation คือ SiTU-GLU และโมเดลทั้งหมดถูกฝึกด้วยน้ำหนัก MXFP4 และค่า activation MXFP8 ภายใต้การฝึกแบบ quantization-aware training ความยาว context อยู่ที่ 1,048,576 โทเคน ขนาด vocabulary คือ 163,840 และระบบ visión ทำงานผ่านเอนโคเดอร์ MoonViT-V2 ขนาด 401 ล้านพารามิเตอร์ ทำให้ K3 สามารถรองรับภาพได้โดยกำเนิด แทนที่จะเป็น multimodal แบบต่อพ่วง

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

นั่นคือตัวเลขที่รุ่นสืบทอดต้องทำให้ได้ สังเกตสิ่งที่พวกมันสื่อเกี่ยวกับแนวคิด 'พารามิเตอร์ที่ใช้งานน้อยลง': K3 เป็นโมเดลแบบสปาร์สอย่างยิ่งอยู่แล้ว มันเปิดใช้งานประมาณ 3.7% ของจำนวนพารามิเตอร์ทั้งหมดต่อโทเคน K4 ที่เปิดใช้งานน้อยกว่า 104B จะไม่ใช่การตัดไขมันส่วนเกินออกจากดีไซน์ที่ให้ทรัพยากรเกินความจำเป็น — แต่มันจะเป็นการถอยกลับจากอัตราส่วนความเบาบางที่ Moonshot ได้ประกาศต่อสาธารณะว่าเป็นชัยชนะ และมันจะทำเช่นนั้นในรุ่นที่ส่วนที่เหลือของวงการกำลังไปในทิศทางตรงกันข้าม

“พารามิเตอร์ที่ใช้งานอยู่น้อยลง” จะหมายความว่าอะไรหากมันเป็นจริง

มีการตีความได้สองแบบ และทั้งสองชี้ไปในทิศทางที่ตรงกันข้ามกัน แบบที่เอื้ออาทรนั้นเป็นเชิงสถาปัตยกรรม: Moonshot อาจกำลังขยายไฮบริด KDA ให้ไกลออกไปอีก โดยแทนที่เลเยอร์ full-attention ด้วยเลเยอร์เชิงเส้นมากขึ้น และปรับสมดุลงบประมาณผู้เชี่ยวชาญใหม่ เพื่อให้จำนวนการเปิดใช้งานที่ต่ำลงแลกมาได้ซึ่งบริบทที่ยาวขึ้น ฐานการให้บริการที่ถูกลง หรืออัตราส่วนคุณภาพต่อฟล็อปที่ดีขึ้น ภายใต้การตีความนั้น จำนวนพารามิเตอร์ที่ใช้งานน้อยลงถือเป็นการปรับปรุงข้อเสนอเดียวกันที่ K3 ระบุไว้แล้ว — ว่าความเบาบางเป็นกลยุทธ์การขยายขนาด ไม่ใช่การประนีประนอม

การตีความอีกแบบหนึ่งคือ K4 ไม่ใช่ผู้สืบทอดแบบเดียวกันทั้งหมดเลย สายของ K​imi ได้แยกออกไปแล้วหนึ่งครั้งในปีนี้ และรายงานต่างๆ ก็บอกเป็นนัยถึง K3.1, K3.2 และ K4 ในฐานะผลิตภัณฑ์ที่แตกต่างกันสามแบบ K4 ที่เปิดใช้งานน้อยกว่า K3 ในตระกูลที่จัดส่งตัวแปรสำหรับเขียนโค้ดแยกต่างหาก อย่างน้อยก็สอดคล้องกับการวางตำแหน่งใหม่พอๆ กับการอัปเกรดตรงๆ การตีความทั้งสองแบบเป็นการคาดเดา ไม่มีแบบใดถูกตัดสินด้วยโพสต์

ยังมีมิติด้านสัญญาอนุญาตที่ยังไม่มีใครพูดถึงด้วย เวตของ K3 เผยแพร่ภายใต้ Kimi K3 License ซึ่งเป็นสัญญาอนุญาตแบบกำหนดเองประเภท “other” แทนที่จะเป็นสัญญาอนุญาตโอเพนซอร์สมาตรฐาน และมันเป็นโมเดลโอเพนระดับ 3T ตัวแรก การที่ K4 ที่เบาบางกว่าจะสืบทอดสัญญาอนุญาตนั้นหรือทำให้มันแคบลง สำคัญต่อใครก็ตามที่สร้างงานต่อยอดบนเวตเหล่านี้มากกว่าคะแนนดัชนีสักไม่กี่จุด

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

ชื่ออีกสามชื่อในโพสต์เดียวกัน

GLM-5.5 Flash และ GLM-5.4 เป็นคู่ที่สร้างความประหลาดใจได้มากกว่า และไม่ใช่เพราะตัวเลขที่ออกมา เพดานที่ Z.ai ประกาศไว้คือ GLM-5.3 ซึ่งเปิดตัวเมื่อวันที่ 14 สิงหาคม 2026 ด้วยพารามิเตอร์ 743B ตามมาด้วย GLM-5.3-Flash ในวันที่ 26 สิงหาคม และการปล่อยน้ำหนัก BF16 กับ Flash-BF16 เมื่อวันที่ 25 สิงหาคม เอกสารของ Z.ai เองระบุตัวระบุโมเดลปัจจุบันไว้เพียงสามตัวเท่านั้น คือ glm-5.3, glm-5.3-flash และ glm-5.2 ไม่มี GLM-5.4 ไม่มี GLM-5.5 และไม่มี GLM-5.5 Flash — และทิศทางการตั้งชื่อนั่นแหละคือส่วนที่แปลก เพราะรุ่น 5.5 ที่มาก่อนรุ่น 5.4 ไม่ใช่สิ่งที่ Z.ai เคยใช้กำหนดหมายเลขให้ตระกูลโมเดลใด ๆ เลย เลขเวอร์ชันที่โผล่ผิดลำดับในข้อมูลที่หลุดออกมาเป็นรูปแบบความล้มเหลวที่คุ้นเคยดี โดยมักเป็นผลิตภัณฑ์ที่อยู่ติดกัน โค้ดเนมภายใน หรือป้ายกำกับระดับการให้บริการ มากกว่าจะเป็นโมเดลฐานใหม่

DeepSeek V4.1P เป็นชื่อที่ผู้เขียนสัญญาณบอกว่าสนใจมากที่สุด และเป็นชื่อที่ตรวจสอบได้ง่ายที่สุดในสี่ชื่อ เอกสาร API ของ DeepSeek ระบุสตริงโมเดลปัจจุบันไว้เพียงสองรายการเท่านั้น: deepseek-flash และ deepseek-v4-pro คำต่อท้าย "P" ไม่มีคู่เทียบในตัวระบุของ DeepSeek ใด ๆ และการเผยแพร่น้ำหนักโมเดลล่าสุดในองค์กรของ DeepSeek เองคือ DeepSeek-V4.1-Flash ซึ่งเผยแพร่เมื่อวันที่ 10 กันยายน 2026 V4.1P น่าจะเป็นรุ่นพี่น้องระดับ Pro ของโมเดลนั้นมากที่สุด — แต่ "น่าจะมากที่สุด" เป็นการคาดเดาเกี่ยวกับสตริง ไม่ใช่ผลิตภัณฑ์

คุณจะรู้ได้ยังไงว่าสิ่งไหนในนี้เป็นเรื่องจริง

ทั้งสี่ชื่อไม่ผ่านการทดสอบเดียวกันด้วยวิธีเดียวกัน ซึ่งทำให้การรอเป็นเรื่องตรงไปตรงมาแทนที่จะทรมาน การเปิดตัวจริงย่อมทิ้งอาร์ติแฟกต์ไว้ และแต่ละชิ้นก็ตรวจสอบได้ง่าย:

• การ์ดโมเดลในองค์กร Hugging Face ของผู้จำหน่ายเอง รายการใหม่ล่าสุดของ Moonshot คือ Kimi-K3 ซึ่งสร้างเมื่อวันที่ 13 มิถุนายน 2026; รายการใหม่ล่าสุดของ Z.ai คือตระกูล GLM-5.3 จากวันที่ 25 สิงหาคม; รายการใหม่ล่าสุดของ D​eepSeek คือ DeepSeek-V4.1-Flash จากวันที่ 10 กันยายน ไม่มีอะไรใหม่กว่านี้อยู่ในทั้งสามราย

• คอนฟิกที่ยุติข้อถกเถียง สำหรับ K4 โดยเฉพาะ ฟิลด์ที่ต้องมองหาคือ num_experts และ num_experts_per_token — ของ K3 ระบุไว้ที่ 896 และ 16 คอนฟิก K4 ที่มีตัวเลขต่อโทเคนต่ำกว่านี้คือข้อกล่าวอ้างในข้อมูลรั่วไหลนี้ที่จะถูกยืนยันหรือหักล้างได้ในไฟล์เดียว

• โมเดลที่กำหนดเส้นทางได้ (routable) ชื่อที่ปรากฏในแค็ตตาล็อกคือชื่อที่มีราคา มีหน้าต่างบริบท (context window) และมีผู้ให้บริการอยู่เบื้องหลัง ส่วนชื่อที่มีอยู่แค่ในโพสต์ไม่มีสิ่งเหล่านี้เลย

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

สิ่งที่คุณสามารถกำหนดเส้นทางได้ในวันนี้

นัยในทางปฏิบัติของข้อมูลที่หลุดมานี้คือ เจเนอเรชันที่มันอธิบายไว้นั้นไม่ใช่สิ่งที่คุณสร้างต่อยอดได้ สิ่งที่ใช้งานจริงอยู่ในขณะนี้คือรุ่นก่อนหน้า และหน้าที่ของเราเตอร์คือทำให้ช่องว่างระหว่างเจเนอเรชันเป็นการตัดสินใจด้านการกำหนดเส้นทาง มากกว่าที่จะเป็นโปรเจกต์โยกย้ายระบบ Kimi K3 พร้อมใช้งานแล้วในขณะนี้ ด้วยคอนเท็กซ์ 1M โทเคนเต็มรูปแบบและความสามารถด้านวิชันแบบเนทีฟ ในราคา $3.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $15.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน โดยการอ่านจากแคชอยู่ที่ $0.30 — คิดค่าบริการตามอัตราของผู้ให้บริการโดยไม่มีมาร์กอัป ซึ่งเป็นเหตุให้การเปลี่ยนแปลงราคาของผู้ขายสำหรับ K3 สะท้อนถึงบิลของคุณภายในวันเดียวกัน แทนที่จะเป็นรอบการปรับราคาครั้งถัดไป Kimi K3 บน OrcaRouterมีเอกสารข้อมูลจำเพาะฉบับเต็มและอัตราปัจจุบัน

เช่นเดียวกันกับส่วนที่เหลือของบอร์ด GLM-5.3, GLM-5.3-Flash และ DeepSeek V4.1 Flash ล้วนกำหนดเส้นทางได้เคียงข้าง Kimi K3 ผ่านเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ซึ่งครอบคลุม โมเดลกว่า 200 รายการ พร้อมการสลับสำรองอัตโนมัติ (failover) เมื่อผู้ให้บริการมีประสิทธิภาพลดลง และ DSL สำหรับกำหนดเส้นทางเพื่อแสดงความต้องการ — เพดานต้นทุน พื้นคุณภาพ งบความหน่วง — เป็นนโยบายแทนตรรกะรายการเรียกแต่ละครั้ง เมื่อ Kimi K4, GLM-5.5 Flash หรือ DeepSeek V4.1P ปรากฏขึ้นจริง การโยกย้ายก็เป็นเพียงการเปลี่ยนสตริงในนโยบายการกำหนดเส้นทางเท่านั้น ไม่มีอย่างอื่นอีก การหลอมรวมโมเดลช่วยให้คุณรวมเอาต์พุตจากหลายโมเดลบนเอนด์พอยต์เดียวกันได้ เมื่องานได้รับประโยชน์จากสิ่งนั้น

เพื่อให้ชัดเจนว่าสิ่งนั้นไม่ใช่อะไร: ชื่อที่รั่วไหลทั้งสี่ชื่อไม่มีชื่อใดเป็นเส้นทางบน OrcaRouter ในปัจจุบัน เราไม่ได้โฮสต์ชื่อเหล่านี้และไม่สามารถให้บริการได้

ประเด็นสำคัญ

ข้อกล่าวอ้างที่น่าสนใจตรงนี้ไม่ใช่หมายเลขเวอร์ชัน มันคือกลไก — เรือธงรุ่นถัดไปที่เปิดใช้งาน น้อยกว่าพารามิเตอร์เมื่อเทียบกับรุ่นก่อนหน้า จะเป็นข้อความที่ Moonshot เชื่อว่าความเบาบาง ไม่ใช่จำนวนการเปิดใช้งานดิบ คือแกนที่ควรผลักดัน และการแบ่งผู้เชี่ยวชาญ 16 จาก 896 ของ K3 ก็เป็นข้อโต้แย้งในทิศทางนั้นอยู่แล้ว ทุกส่วนของข้อกล่าวอ้างยังไม่ได้รับการยืนยัน: Kimi K4, GLM-5.5 Flash, GLM-5.4 และ DeepSeek V4.1P ไม่มีการ์ดโมเดล ไม่มีเวต ไม่มีตัวระบุ API และไม่มีราคา และแคตตาล็อกของผู้ขายเองก็หยุดอยู่ที่รุ่นก่อนหน้าในแต่ละกรณี ให้มองชื่อเหล่านี้เป็นตัวอย่างของคำถาม ไม่ใช่คำตอบ — และหากคุณต้องการเวตเปิดระดับแนวหน้าพร้อมบริบท 1M ในวันนี้ Kimi K3 คือโมเดลที่มีอยู่แล้ว

เมื่อ K​imi K4 มาถึงจริง ๆ การสลับระบบสำรองอัตโนมัติคือสิ่งที่ป้องกันไม่ให้การย้ายระบบกลายเป็นอุบัติการณ์

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube