
GLM-5.3 vs Kimi K3: บีบโมเดลฐาน 743B หรือสร้างโมเดลใหม่ 2.8T — เดิมพันไหนคุ้ม?
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0455ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0247ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0247ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0157ความฉลาด82การเขียนโค้ด
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2646ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1849ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1541ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1251ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0547ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0347ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2140ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128ความฉลาด49การเขียนโค้ด
การแข่งขันโมเดลโอเพนเวตของจีนเพิ่งแยกออกเป็นสองคำตอบสำหรับคำถามเดียวกัน Moonshot AI สร้างKimi K3จากศูนย์ — โมเดลฐานแบบ mixture-of-experts ที่มีพารามิเตอร์ 2.8 ล้านล้าน โมเดลโอเพนเวตที่ใหญ่ที่สุดเท่าที่เคยเปิดตัว ประกาศเมื่อวันที่ 16 กรกฎาคม 2026 และปล่อยน้ำหนักตามมาในวันที่ 27 กรกฎาคม GL M-5.3คือการเดิมพันที่ตรงกันข้าม: Z.ai คงโมเดลฐานเดิมขนาด 743 พันล้านพารามิเตอร์ที่ขับเคลื่อน GLM-5.2 และใช้วงจรการปล่อยรุ่นทั้งหมดไปกับ post-training โดยให้เหตุผลว่าเพดานสติปัญญาของโมเดลฐานไม่เคยเป็นปัญหา ทั้งคู่เป็นเรือธงที่รองรับบริบท 1M เน้นการเขียนโค้ดและเอเจนต์ และทั้งคู่อ้างว่าเป็นโมเดลโอเพนสำหรับเขียนโค้ดอันดับหนึ่งในตลาด ทั้งสองไม่สามารถเป็นวิธีที่ดีที่สุดในการใช้งบประมาณเดียวกันได้ และเกณฑ์วัดก็แบ่งออกกลางๆ อย่างแท้จริง — ซึ่งทำให้เรื่องนี้ไม่ใช่การเปรียบเทียบ แต่เป็นการลงประชามติว่าควรสร้างโมเดล frontier ตัวถัดไปอย่างไร
สองข้อเดิมพันเกี่ยวกับการสร้างโมเดลแนวหน้า
Z.ai เรียก GLM-5.3 ว่าเป็น "deep dig" (การขุดลึก) มากกว่าจะเป็นการอัปเกรดข้ามรุ่น ตัวฐานเป็นโมเดล 743B ชุดเดียวกับ GLM-5.2 ทุกไบต์ ส่วนต่างทั้งหมดอยู่ที่ช่วง post-training ซึ่งรันผ่านเฟรมเวิร์กโอเพนซอร์ส slime บนงานที่กินเวลาทำงานด้านวิศวกรรมทั้งช่วง ตั้งแต่การวินิจฉัยปัญหา แก้ไข ตรวจสอบ และส่งมอบ บนคลัสเตอร์ ระบบจัดเก็บข้อมูล และโค้ดเบสที่ใช้งานจริง บางงานใช้เวลาหลายวันเทียบเท่ากับงานของวิศวกรอาวุโสหนึ่งคน ตัวเลขการพัฒนาที่ผู้ผลิตรายงานนั้นสูงมาก: ผลงานใน Code Bench ของตัวเองเพิ่มขึ้น 50%, Terminal-Bench 3.0 จาก 4.6 เป็น 28.3, DeepSWE v1.1 จาก 46.2 เป็น 66.9 และความสามารถทางไซเบอร์ที่ทำให้ต้องมีการตรวจสอบความปลอดภัยก่อนปล่อยค่าน้ำหนัก (weights) ของโมเดล ส่วน Moonshot เลือกไปอีกทาง Kimi K3 เป็นโมเดลฐานใหม่เอี่ยม — มีพารามิเตอร์รวม 2.8T โดยมีพารามิเตอร์ที่ทำงาน (active) ประมาณ 104B ต่อโทเคน (16 จาก 896 เอ็กซ์เพิร์ต) ใช้สถาปัตยกรรม Kimi Delta Attention รองรับอินพุตรูปภาพและวิดีโอในตัว (native) มีระบบให้เหตุผล (reasoning) ที่เปิดตลอดเวลาและไม่สามารถปิดได้ และมีหน้าต่างบริบท (context window) 1M ทั้งฝั่งอินพุตและเอาต์พุต ในขณะที่ Z.ai เดิมพันว่าโมเดลแบบเดิมที่มีมากขึ้นก็เพียงพอแล้ว Moonshot กลับเดิมพันว่าตัวฐานโมเดลต่างหากคือเพดาน

การเปรียบเทียบแบบตัวต่อตัว พร้อมแหล่งที่มา
สถานที่เดียวที่ทั้งสองโมเดลปรากฏบนหน้าเดียวกันคือตารางเปิดตัวของ Z.ai เอง ดังนั้นตัวเลขที่เปรียบเทียบกันจึงมาจากที่นั่น — ซึ่งระบุว่าเป็นข้อมูลที่รายงานโดยผู้พัฒนา ไม่ได้ผ่านการตรวจสอบโดยอิสระ ตัวเลขเดี่ยวของ Kimi K3 สอดคล้องกับสิ่งที่ Moonshot เผยแพร่ในเดือนกรกฎาคมและสิ่งที่ Artificial Analysis วัดได้ แต่ยังไม่มีห้องแล็บที่เป็นกลางรายใดทดสอบทั้งสองตัว
• Terminal-Bench 3.0 — GLM-5.3 ที่ 28.3 เทียบกับ Kimi K3 ที่ 17.4 (ตารางของ Z.ai). ช่องว่างด้านการเขียนโค้ดที่ใหญ่ที่สุดในการแข่งขันครั้งนี้ บนเวอร์ชันใหม่ล่าสุดและยากที่สุด
• Terminal-Bench 2.1 — GLM-5.3 ได้ 88.2 ส่วน Kimi K3 ได้ 88.3 สูสีกันมาก
• DeepSWE v1.1 — GLM-5.3 ได้ 66.9 เทียบกับ Kimi K3 ได้ 67.5 Kimi ชนะไปแบบฉิวเฉียด
• SWE-Marathon v1.1 — GLM-5.3 ทำได้ 42.5 ส่วน Kimi K3 ทำได้ 48.1 นี่คือชัยชนะด้านการเขียนโค้ดที่ดีที่สุดของ Kimi.
• ExploitGym — GLM-5.3 ได้ 105/130 เทียบกับ Kimi K3 ที่ 36/70 นับเป็นการกวาดชัยชนะที่เกือบสมบูรณ์ของ GLM.
• GDPval-AA v2 (งานด้านความรู้) — GLM-5.3 ได้ 1,769 เทียบกับ Kimi K3 ที่ 1,682.
• การเข้าถึง — GLM-5.3: การสมัครสมาชิก Coding Plan น้ำหนักถูกจำกัดจนถึงประมาณวันที่ 28 สิงหาคม Kimi K3: API ใช้งานได้แล้วในราคา $3 / $15 ดาวน์โหลดน้ำหนักได้ตั้งแต่วันที่ 27 กรกฎาคม

คูเมืองความปลอดภัยคือการแยกที่แท้จริง
ตัดเรื่องเกณฑ์วัดการเขียนโค้ดออกไป ความแตกต่างที่ชี้ขาดคือความมั่นคงปลอดภัยทางไซเบอร์ GLM-5.3 รายงานคะแนน 84.5 บน CyberGym เทียบกับ 80.0 ของ Kimi K3 และคะแนน ExploitBench ที่ 54.4 เกือบเป็นสองเท่าของ 32.2 ของ Kimi K3 บน ExploitGym ช่องว่างนั้นไม่ใช่แค่ความต่าง แต่เป็นคนละระดับกัน — 105 กับ 130 เทียบกับ 36 กับ 70 ในการรัน 2 ชั่วโมงและ 6 ชั่วโมง นั่นคือเหตุผลว่าทำไมการเปิดตัวทั้งสองครั้งจึงให้ความรู้สึกต่างกันมากในทางปฏิบัติ: น้ำหนักของ Kimi K3 เปิดเผยสู่สาธารณะภายใต้สัญญาอนุญาต Modified MIT ในขณะที่ของ GLM-5.3 ถูกเก็บไว้เพื่อการเสริมความปลอดภัย (safety hardening) เพราะ Z.ai กล่าวว่าโมเดลเก่งพอในการค้นหาและใช้ประโยชน์จากช่องโหว่ จนการปล่อยน้ำหนักออกมาทันทีรู้สึกขาดความรับผิดชอบ หากงานของคุณเกี่ยวข้องกับการตรวจสอบโค้ดของคนอื่น หรือการปกป้องโค้ดของคุณเองจากการล่า Vulnerability แบบอัตโนมัติ นี่คือประเด็นที่เกี่ยวข้องมากที่สุดเพียงหนึ่งเดียวในการเปรียบเทียบทั้งหมด — และเป็นประเด็นที่ผ่านการตรวจสอบโดยอิสระน้อยที่สุดด้วย
ที่ที่ Kimi K3 โต้กลับ
ชัยชนะของ Kimi K3 รวมกลุ่มกันอยู่ตรงจุดที่ GLM-5.3 อ่อนแอที่สุด นั่นคืองาน repository ที่ใช้ระยะเวลายาวนาน โดยมันยังได้เปรียบใน DeepSWE และ SWE-Marathon เป็นผู้นำใน Toolathlon Verified และหน้าต่างเอาต์พุต 1 ล้านโทเคนของมันหมายความว่ามันสามารถเขียนโค้ดเบสทั้งหมดหรือ trace ของ agent แบบยาวได้ในรอบเดียว ระบบ reasoning ที่เปิดตลอดเวลาของมันจะสตรีม trace ทั้งหมดไปยัง API ซึ่งนักพัฒนาได้กล่าวว่ามีประโยชน์สำหรับการดีบัก agent มากกว่าคำอธิบายสรุปแบบทึบแสง (opaque) อย่างเห็นได้ชัด — โดยมีข้อแม้ในทางปฏิบัติว่าคุณต้องส่งคืนฟิลด์ reasoning แบบคำต่อคำตลอดการเรียกใช้เครื่องมือ (tool calls) และไม่มีการ prefill ของ assistant ในดัชนี Intelligence Index ของ Artificial Analysis นั้น Kimi K3 อยู่ที่ 57 เป็นอันดับที่สี่โดยรวม โดยมีต้นทุนต่องานประมาณ 0.94 ดอลลาร์สหรัฐที่วัดจากชุดมาตรฐานของมัน นอกจากนี้ยังเป็นโมเดลที่แพงที่สุดที่ห้องแล็บจีนเคยเปิดตัว: 3 ดอลลาร์ต่อล้านโทเคนนำเข้าและ 15 ดอลลาร์ต่อล้านโทเคนเอาต์พุต ซึ่งเป็นราคาระดับ Sonnet ในขณะที่ GLM-5.3 ยังไม่สามารถคิดราคาต่อโทเคนได้เลยเพราะมันมีอยู่ในแผนการสมัครสมาชิกเท่านั้น
ความเป็นจริงด้านการเข้าถึงและต้นทุน
Kimi K3 อยู่บน OrcaRouter ตอนนี้ในราคารายการของ Moonshot เอง — $3 / $15 ต่อล้านโทเคน, $0.30 สำหรับการอ่านแบบแคช, มาร์กอัป 0% — ดังนั้นงานเอเจนต์บริบท 1M จึงสามารถเรียกใช้ได้ด้วยคีย์เดียวกันกับสแตกที่เหลือของคุณ และน้ำหนักแบบเปิดเป็นตัวเลือกทางออกหากคุณต้องการโฮสต์เอง GLM-5.3 เป็นรุ่นที่หายาก: การสมัครสมาชิกรายเดือน $18 ถึง $168 พร้อมระบบคะแนนที่ใช้เครดิต 6.9 เท่าสำหรับอินพุตและ 24 เท่าสำหรับเอาต์พุต ราคานอกช่วงพีคที่ลดการเผาผลาญลงครึ่งหนึ่งนอกเวลา 14:00–18:00 ตามเวลาจีน และไม่มี API แบบต่อโทเคนจนกว่าการตรวจสอบความปลอดภัยจะผ่าน ชั้นการจัดเส้นทางทำให้ความไม่สมดุลนี้แบนลงในช่วงสองสัปดาห์: เมื่อ API ของ GLM-5.3 มาอยู่บนคีย์เดียวกัน การเรียกแบบแผงสามารถรันเรือธงโอเพนโค้ดทั้งสองตัวกับงานของคุณเอง และให้ผู้ตัดสินทำให้ผลลัพธ์สอดคล้องกัน — และหากคุณรอไม่ไหว น้ำหนักที่เผยแพร่แล้วของ Kimi K3 ทำให้มันเป็นเพียงหนึ่งในสองตัวที่คุณสามารถนำไปใช้ภายในองค์กรได้อย่างเต็มรูปแบบในวันนี้

เดิมพันไหนกำลังจ่าย
คำตัดสินที่ตรงไปตรงมาหลังจากผ่านไปหนึ่งสัปดาห์คือ การเดิมพันทั้งสองให้ผลตอบแทน แต่ในปริมาณงานที่แตกต่างกัน หากงานของคุณเกี่ยวกับเทอร์มินัลเป็นหลัก เกี่ยวข้องกับความปลอดภัย และถูกขับเคลื่อนโดยเอเจนต์ GLM-5.3 คือทิศทางที่แข็งแกร่งกว่าตามหลักฐานที่ Z.ai เผยแพร่ — และช่องว่างด้านความปลอดภัยทางไซเบอร์ก็ใหญ่พอที่จะคุ้มค่ากับการรอสองสัปดาห์เพื่อให้ได้ weights มาตรวจสอบด้วยตัวเอง หากงานของคุณคือเซสชัน repository ที่ยาว อินพุตแบบมัลติโหมด หรืออะไรก็ตามที่คุณต้องการ weights อยู่ในมือวันนี้ Kimi K3 คือตัวเดียวในสองตัวที่พร้อมใช้งานจริง — และชัยชนะด้าน deep-repo ของมันคือสิ่งที่คุณสามารถตรวจสอบได้ทันทีจาก live API ของมัน สิ่งหนึ่งที่ต้องจำไว้ให้ดี: ตัวเลขทุกตัวในการเปรียบเทียบแบบตัวต่อตัวนี้มาจากตารางของ Z.ai เอง ดังนั้นให้ถือว่าความแตกต่างด้านการเขียนโค้ดเป็นเพียงแนวโน้มจนกว่าห้องปฏิบัติการอิสระจะทดสอบทั้งสองตัว นั่นคือการตรวจสอบแบบที่การรอสองสัปดาห์จะนำมาให้อย่างแท้จริง
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
