
Qwen 4 Max vs Kimi K3: คำสัญญาเรื่องโอเพนเวตส์ มาบรรจบกับการส่งมอบโอเพนเวตส์
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
Moonshot AI เปิดตัว Kimi K3 เมื่อวันที่ 16 กรกฎาคม 2026 แล้วก็ทำสิ่งที่ห้องแล็บส่วนใหญ่เพียงแต่พูดถึง นั่นคือการเผยแพร่น้ำหนักโมเดล เช็กพอยต์ขนาด 2.8 ล้านล้านพารามิเตอร์มาถึงเมื่อวันที่ 27 กรกฎาคม 2026 ภายใต้สัญญาอนุญาต Modified MIT ห่างจากการเปิดตัวสิบเอ็ดวัน ในขณะเดียวกัน การประชุม Yunqi เมื่อวันที่ 22 กันยายน 2026 ถูกใช้เพื่อประกาศ Qwen 4 Max ในฐานะเรือธงของตระกูล Qwen 4 สี่ระดับ ซึ่งรวมถึง Qwen 4 27B แบบเปิดน้ำหนัก — ระดับที่ถูกสัญญาไว้ ไม่ได้ส่งมอบ สองข้อเท็จจริงนั้นคือการเปรียบเทียบ ทุกอย่างอื่นเกี่ยวกับ Qwen 4 Max ยังไม่เป็นที่ทราบในขณะนี้ และช่องว่างระหว่างระดับเปิดที่ถูกสัญญากับระดับที่ส่งมอบแล้วคือจุดที่การเปรียบเทียบนี้มีอะไรจะบอกจริง ๆ
สิ่งที่ Kimi K3 นำเสนอในเดือนกรกฎาคม
Kimi K3 เป็นโมเดล Mixture-of-Experts ที่มีพารามิเตอร์ 2.8 ล้านล้าน ซึ่งเปิดใช้งานผู้เชี่ยวชาญ 16 จาก 896 คนต่อโทเคน ซึ่งทำให้พารามิเตอร์ประมาณ 104 พันล้านตัวทำงานในแต่ละขั้นตอน โดยมีความยาวบริบท 1,048,576 โทเคนทั้งฝั่งอินพุตและเอาต์พุต และรองรับอินพุตข้อความ รูปภาพ และวิดีโอ โดยมีเอาต์พุตเป็นข้อความ API ของบริษัทเองมีราคาอยู่ที่ $3.00 ต่ออินพุต 1 ล้านโทเคน, $15.00 ต่อเอาต์พุต 1 ล้านโทเคน และ $0.30 ต่อแคชอินพุต 1 ล้านโทเคน และราคาจากบุคคลที่สามต่ำกว่านั้น
สถาปัตยกรรมคือส่วนที่พรีวิวของ Alibaba เองก็สะท้อนออกมาเช่นกัน Kimi K3 สร้างขึ้นบน Kimi Delta Attention และ Attention Residuals ซึ่ง Moonshot อ้างว่ามอบประสิทธิภาพในการสเกลได้ดีกว่า Kimi K2 ราว 2.5 เท่า และถอดรหัสได้เร็วขึ้นถึง 6.3 เท่าเมื่อบริบทมีขนาดถึงล้านโทเคน นั่นคือปัญหาเดียวกับที่ QSA ของ Qwen มุ่งแก้ — ทำให้ attention มีต้นทุนที่จ่ายไหวในความยาวระดับสุดขั้ว — ซึ่งหมายความว่าสองตระกูลนี้ไม่ได้แข่งขันกันที่ขนาดมากนัก แต่แข่งขันกันว่าการออกแบบ sparse attention ของฝ่ายใดจะคงทนต่อกาลเวลามากกว่ากัน
คะแนนที่ Moonshot เผยแพร่ตอนเปิดตัว ซึ่งเป็นข้อมูลที่ผู้ขายรายงานและยังไม่มีผู้ทำซ้ำได้ในตอนนั้น:
• ดัชนีความฉลาด Artificial Analysis Intelligence Index — 57 ซึ่งในขณะนั้นอยู่อันดับที่สามรองจาก Claude Fable 5 และ GPT-5.6 Sol ตัวเลขดังกล่าวถูกบันทึกไว้ภายใต้การปรับปรุงดัชนีฉบับก่อนหน้า นับตั้งแต่นั้นดัชนีได้ถูกสร้างใหม่ถึงสองครั้ง ดังนั้นจึงเป็นค่าที่เป็นhistoricalมากกว่าค่าปัจจุบัน
• Frontend Code Arena — อันดับหนึ่งที่ 1,679 Elo นำหน้าโมเดลทั้งสองที่ทำคะแนนได้สูงกว่าในดัชนีทั่วไป
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42 นำหน้า Opus 4.8 และ GPT-5.6 Sol
• DeepSearchQA — 0.95 อันดับหนึ่ง และ MATH-Vision 0.98 อันดับหนึ่งเช่นกัน
• GPQA-Diamond — 0.94
เอกสารเปิดตัวของ Moonshot เองยอมรับว่า K3 ยังตามหลัง Claude Fable 5 และ GPT-5.6 Sol ในด้านความสามารถโดยรวม ซึ่งเป็นประโยคที่มีประโยชน์มากกว่าข้ออ้างเรื่องอันดับหนึ่งใดๆ ที่กล่าวถึงข้างต้น รูปแบบที่น่าสนใจของตัวเลขคือ โมเดลที่อยู่อันดับสามในดัชนีทั่วไปกลับได้ที่หนึ่งในโค้ดส่วนหน้าและที่หนึ่งในการค้นหาแบบระยะยาว — โปรไฟล์ที่บอกว่าดัชนีรวมกำลังซ่อนเครื่องมือเฉพาะทางไว้ มากกว่าที่จะอธิบายเครื่องมือทั่วไป

สิ่งที่ Alibaba ได้สัญญาไว้ และคำสัญญานั้นมีค่าเพียงใด
การประกาศเปิดตัว Qwen 4 ระบุชื่อไว้สี่ระดับ โดยมี Qwen 4 Max เป็นเรือธง, Qwen 4 Flash สำหรับปริมาณงาน, Qwen 4 Plus เป็นตัวกลางที่สมดุล และ Qwen 4 27B เป็นระดับโมเดลน้ำหนักเปิดสำหรับใช้งานในเครื่อง หัวหน้าฝ่าย Qwen LLM หลิว ต้า อี้เหิง อธิบายว่าครอบครัวโมเดลนี้ฝึกบนสถาปัตยกรรมรุ่นใหม่ และกล่าวว่าจะเปิดตัวในไม่ช้า ยังไม่มีวันที่ ไม่มีโมเดลการ์ด ไม่มีตัวระบุ API ไม่มีรายชื่อบนคลาวด์ ไม่มีราคา และไม่มีคะแนนที่เผยแพร่สำหรับทั้งสี่รุ่น
มีสองเรื่องเฉพาะเจาะจงเกี่ยวกับประกาศนั้นที่มักถูกรายงานคลาดเคลื่อน และทั้งสองเรื่องมีความสำคัญสำหรับใครก็ตามที่พยายามวางแผนโดยอิงจากประกาศนั้น:
• ตัวเลข 5 ล้านล้านถึง 10 ล้านล้านพารามิเตอร์ที่แนบมากับการรายงานข่าวเกี่ยวกับ Qwen 4 ไม่ใช่ข้อมูลจำเพาะของ Qwen 4 แต่เป็นของแผนงาน Qwen 4.5 และ Qwen 5 ยังไม่มีการเผยแพร่จำนวนพารามิเตอร์ใด ๆ สำหรับ Qwen 4 Max
• การที่ชื่อระดับยังคงใช้ต่อไปไม่ได้ทำให้ข้อมูลจำเพาะถูกส่งต่อมาด้วย หน้าต่างบริบท ราคา และไลเซนส์ของ Qwen 4 Max ยังไม่เป็นที่ทราบ ตัวเลขของ Qwen3.8-Max ที่วางจำหน่ายจริง — 1,000,000 โทเคน ในราคา $2.00 และ $6.00 ต่อล้าน — เป็นข้อมูลของโมเดลที่แตกต่างออกไป
เหตุผลที่ระดับ 27B เป็นระดับที่น่าสนใจไม่เกี่ยวอะไรกับผล benchmark เลย มันเป็นระดับเดียวในสาย Qwen 4 ที่ผ่านมาเปิดตัวในรูปแบบ open weights และเจเนอเรชัน Qwen 3.8 ได้แสดงให้เห็นว่าสิ่งนั้นปลดล็อกอะไรได้บ้าง: ภายในไม่กี่วันหลังจาก weights ของ 27B เปิดตัว ชุมชนก็ผลิต MLX conversions, NVFP4 quantisations และ fine-tunes สารพัดแบบออกมาแล้ว การที่ 27B ถูกประกาศออกมาคือคำมั่นต่อระบบนิเวศปลายน้ำ และเป็นการส่งมอบที่คาดการณ์ได้แน่นอนที่สุดบน roadmap
แต่สิ่งที่คาดเดาได้ไม่ได้รับการส่งมอบ น้ำหนักของ Kimi K3 คือไฟล์ที่คุณดาวน์โหลดได้วันนี้ ส่วนน้ำหนักของ Qwen 4 27B เป็นเพียงบรรทัดหนึ่งในทอล์กงานประชุม
เวตแบบเปิดกับเวตที่รันได้เป็นข้อกล่าวอ้างที่ต่างกัน
มีกับดักในการมองว่า Kimi K3 เป็นคำตอบแบบน้ำหนักเปิด และควรพูดตรง ๆ เพราะมันเป็นการกล่าวเกินจริงที่พบบ่อยที่สุดในการรายงานข่าวเกี่ยวกับโมเดลแนวหน้าของจีน โมเดลผสมผู้เชี่ยวชาญขนาด 2.8 ล้านล้านพารามิเตอร์เป็นสิ่งประดิษฐ์ระดับศูนย์ข้อมูล การเผยแพร่น้ำหนักหมายความว่าคุณได้รับอนุญาตให้รันมัน ตรวจสอบมัน ไฟน์จูนมัน และควอนไทซ์มันได้ สิ่งเหล่านี้ไม่ได้หมายความว่าคุณสามารถรันมันบนเวิร์กสเตชันได้ การให้บริการอย่างมีประสิทธิภาพสำหรับเช็กพอยต์ขนาดนั้นต้องใช้ตัวเร่งความเร็วหลายสิบตัว และงานควอนไทซ์ที่ตามมาหลังการเปิดตัวแบบเปิด — ตัวแปรสไตล์ NVFP4 และ REAP ที่แพร่หลายภายในไม่กี่สัปดาห์ — เป็นเรื่องของการทำให้โมเดลพร้อมให้บริการพอ ๆ กับการทำให้มันเล็กลง
ดังนั้น การอ่านใบอนุญาตของ Kimi K3 อย่างตรงไปตรงมาคือมันแคบกว่าแต่ยังคงมีความสำคัญ: มันเป็นโมเดลแนวหน้าที่ตรวจสอบได้ แก้ไขได้ และโฮสต์เองได้ ภายใต้ใบอนุญาต Modified MIT สำหรับองค์กรที่มีฮาร์ดแวร์ไว้ให้บริการมัน นั่นเป็นสินทรัพย์เชิงกลยุทธ์ที่แท้จริง และไม่เหมาะเลยสำหรับใครก็ตามที่อ่านคำว่า "open weights" ว่า "รันบนแล็ปท็อปของฉัน"
ข้อแม้เดียวกันนี้จะใช้กับ Qwen 4 27B ด้วย หากและเมื่อมันเปิดตัว — และข้อแม้นี้ใช้ได้ไม่คมชัดเท่า เพราะระดับโอเพนเวต 27B นั้นเป็นขนาดที่รันในเครื่องได้จริง ในแบบที่เรือธง 2.8T ไม่ใช่ นั่นคือเหตุผลว่าทำไมระดับ Qwen 4 27B จึงสมควรได้รับความสนใจมากกว่าระดับ Max ในการเปรียบเทียบนี้ แม้ว่าสิ่งที่การประกาศนำด้วยจะเป็นระดับ Max ก็ตาม

คำถามเชิงพาณิชย์ที่อยู่ใต้คำถามเรื่องใบอนุญาต
อัตราค่าบริการจากผู้ให้บริการโดยตรงของ Kimi K3 ที่ $3.00 สำหรับอินพุต และ $15.00 สำหรับเอาต์พุตต่อล้านโทเค็นถือเป็นตำแหน่งระดับพรีเมียม และ Moonshot ก็ชี้ชัดว่าได้ตั้งราคาไว้สูงกว่าปลายล่างราคาถูกของตลาดจีนอย่างตั้งใจ เมื่อเทียบกับ Qwen3.8-Max ที่ $2.00 และ $6.00 นั่นคือหนึ่งเท่าครึ่งของอัตราอินพุต และสองเท่าครึ่งของอัตราเอาต์พุต — ช่องว่างที่มากพอจนงานเวิร์กโหลดต้องคำนึงถึงจุดแข็งเฉพาะของ Kimi K3 ซึ่งรวมถึงโค้ดฝั่งฟรอนต์เอนด์และการค้นหาแบบระยะยาว จึงจะคุ้มค่ากับการจ่ายในราคาพรีเมียม
OrcaRouter จัดเส้นทางให้ kimi/kimi-k3 ควบคู่ไปกับตระกูล Qwen 3.8 บน endpoint เดียวที่รองรับ OpenAI โดยไม่บวกเพิ่มเลย 0% ซึ่งหมายความว่าคุณถูกคิดค่าบริการตามราคาตามรายการของผู้ให้บริการ ไม่ใช่ราคาเทียบเท่าที่ถูกบวกเพิ่ม ในเชิงเปรียบเทียบที่ส่วนต่างราคาอยู่ที่ปัจจัย 2.5 เท่าสำหรับเอาต์พุต การไม่มีกำไรส่วนเพิ่มของแพลตฟอร์มจึงไม่ใช่รายละเอียดเล็กน้อย — การบวกเพิ่มสิบเปอร์เซ็นต์บนอัตราเอาต์พุต 15.00 ดอลลาร์ คิดเป็น 1.50 ดอลลาร์ต่อล้านโทเค็น ซึ่งมากกว่าต้นทุนอินพุตทั้งหมดของโมเดลที่ถูกกว่าในการจับคู่นี้ด้วยซ้ำ endpoint เดียวกันนี้ยังมีการสลับไปใช้งานสำรองอัตโนมัติและ routing DSL สำหรับกำหนดนโยบายอย่างชัดแจ้ง ซึ่งเป็นวิธีที่คุณลองใช้โมเดลที่มีโปรไฟล์แบบ Kimi K3 กับทราฟฟิกโปรดักชันบางส่วน โดยไม่ต้องเดิมพันทั้งเส้นทางกับผู้ให้บริการที่คุณยังไม่เคยรันมาก่อน
สิ่งที่ OrcaRouter ไม่มีให้บริการคือ Qwen 4 Max หรือ Qwen 4 ระดับใด ๆ เพราะยังไม่มีผลิตภัณฑ์เหล่านี้ในตอนนี้

สิ่งที่ควรให้ความสนใจ และสิ่งที่ควรเพิกเฉย
สัญญาณสามอย่างจะทำให้การเปรียบเทียบนี้เปลี่ยนไป และสัญญาณเหล่านี้เฉพาะเจาะจงพอที่ควรคอยจับตามอง:
• น้ำหนักโมเดล Qwen 4 27B ไม่ใช่ตาราง benchmark ของรุ่น Max — แต่เป็น checkpoint 27B สัญญาอนุญาต และขนาดของมัน นั่นคือการเปิดตัวที่จะบอกคุณว่าความมุ่งมั่นเรื่อง open-weight ของ Alibaba ในรุ่นนี้เป็นของจริงเท่ากับรุ่นก่อนหน้าหรือไม่
• สัญญาอนุญาตของ Qwen 4 Max หากมี หาก Alibaba เผยแพร่น้ำหนักโมเดลสำหรับเรือธงของตนแบบเดียวกับที่เคยทำกับ Qwen3.8-Max ข้อโต้แย้งเรื่องน้ำหนักโมเดลแบบเปิดในการเปรียบเทียบนี้ก็จะไม่ใช่ข้อได้เปรียบของ Kimi อีกต่อไป แต่จะกลายเป็นเสมอกัน
• การประเมินใหม่ที่เป็นอิสระเกี่ยวกับ Kimi K3 — คะแนนเปิดตัวของ Moonshot เป็นการรายงานเอง และดัชนี Artificial Analysis ได้ถูกสร้างใหม่ถึงสองครั้งนับตั้งแต่นั้น ดังนั้นทั้ง 57 และ Frontend Code Arena Elo จึงต้องปรับฐานใหม่ก่อนที่จะนำไปเปรียบเทียบกับสิ่งใดในปัจจุบัน
สิ่งที่ควรเพิกเฉยคือตารางสเปกของ Qwen 4 Max ใด ๆ ที่ปรากฏก่อนที่ Alibaba จะเผยแพร่โมเดลการ์ด และข้ออ้างใด ๆ ว่าโอเพนเวตของ Kimi K3 ทำให้สามารถรันในเครื่องได้ ข้อผิดพลาดทั้งสองนี้กำลังแพร่กระจายอยู่แล้ว ในระหว่างนี้ การเปรียบเทียบที่คุณนำไปใช้ได้จริงคือระหว่างสองโมเดลที่มีอยู่จริง: Kimi K3 ในราคาพรีเมียม พร้อมน้ำหนักที่ส่งมอบแล้วและโปรไฟล์การเขียนโค้ดที่แตกต่างอย่างแท้จริง กับ Qwen3.8-Max ในอัตราค่าเอาต์พุตที่ต่ำกว่าครึ่ง พร้อมหน้าต่างหนึ่งล้านโทเคนแบบคงที่และน้ำหนักของตัวเอง นั่นคือทางเลือกจริง ที่มีราคาระบุไว้ทั้งสองฝ่าย และไม่ต้องรอให้สไลด์ในงานประชุมกลายเป็นผลิตภัณฑ์
การเปรียบเทียบในบทความนี้3
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
