การ์ดไตเติลสำหรับการเปรียบเทียบ GLM-5.3 กับ Kimi K3: ลูกบาศก์ขนาดเล็กทางซ้ายติดป้าย GLM-5.3 พร้อมข้อความระบุ 743B base post-trained และลูกบาศก์ขนาดใหญ่ทางขวาติดป้าย Kimi K3 พร้อมข้อความระบุ 2.8T base built from scratch
Guides & Insights

GLM-5.3 vs Kimi K3: บีบโมเดลฐาน 743B หรือสร้างโมเดลใหม่ 2.8T — เดิมพันไหนคุ้ม?

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การแข่งขันโมเดลโอเพนเวตของจีนเพิ่งแยกออกเป็นสองคำตอบสำหรับคำถามเดียวกัน Moonshot AI สร้างKimi K3จากศูนย์ — โมเดลฐานแบบ mixture-of-experts ที่มีพารามิเตอร์ 2.8 ล้านล้าน โมเดลโอเพนเวตที่ใหญ่ที่สุดเท่าที่เคยเปิดตัว ประกาศเมื่อวันที่ 16 กรกฎาคม 2026 และปล่อยน้ำหนักตามมาในวันที่ 27 กรกฎาคม G​L M-5.3คือการเดิมพันที่ตรงกันข้าม: Z.ai คงโมเดลฐานเดิมขนาด 743 พันล้านพารามิเตอร์ที่ขับเคลื่อน GLM-5.2 และใช้วงจรการปล่อยรุ่นทั้งหมดไปกับ post-training โดยให้เหตุผลว่าเพดานสติปัญญาของโมเดลฐานไม่เคยเป็นปัญหา ทั้งคู่เป็นเรือธงที่รองรับบริบท 1M เน้นการเขียนโค้ดและเอเจนต์ และทั้งคู่อ้างว่าเป็นโมเดลโอเพนสำหรับเขียนโค้ดอันดับหนึ่งในตลาด ทั้งสองไม่สามารถเป็นวิธีที่ดีที่สุดในการใช้งบประมาณเดียวกันได้ และเกณฑ์วัดก็แบ่งออกกลางๆ อย่างแท้จริง — ซึ่งทำให้เรื่องนี้ไม่ใช่การเปรียบเทียบ แต่เป็นการลงประชามติว่าควรสร้างโมเดล frontier ตัวถัดไปอย่างไร

สองข้อเดิมพันเกี่ยวกับการสร้างโมเดลแนวหน้า

Z.ai เรียก GLM-5.3 ว่าเป็น "deep dig" (การขุดลึก) มากกว่าจะเป็นการอัปเกรดข้ามรุ่น ตัวฐานเป็นโมเดล 743B ชุดเดียวกับ GLM-5.2 ทุกไบต์ ส่วนต่างทั้งหมดอยู่ที่ช่วง post-training ซึ่งรันผ่านเฟรมเวิร์กโอเพนซอร์ส slime บนงานที่กินเวลาทำงานด้านวิศวกรรมทั้งช่วง ตั้งแต่การวินิจฉัยปัญหา แก้ไข ตรวจสอบ และส่งมอบ บนคลัสเตอร์ ระบบจัดเก็บข้อมูล และโค้ดเบสที่ใช้งานจริง บางงานใช้เวลาหลายวันเทียบเท่ากับงานของวิศวกรอาวุโสหนึ่งคน ตัวเลขการพัฒนาที่ผู้ผลิตรายงานนั้นสูงมาก: ผลงานใน Code Bench ของตัวเองเพิ่มขึ้น 50%, Terminal-Bench 3.0 จาก 4.6 เป็น 28.3, DeepSWE v1.1 จาก 46.2 เป็น 66.9 และความสามารถทางไซเบอร์ที่ทำให้ต้องมีการตรวจสอบความปลอดภัยก่อนปล่อยค่าน้ำหนัก (weights) ของโมเดล ส่วน Moonshot เลือกไปอีกทาง Kimi K3 เป็นโมเดลฐานใหม่เอี่ยม — มีพารามิเตอร์รวม 2.8T โดยมีพารามิเตอร์ที่ทำงาน (active) ประมาณ 104B ต่อโทเคน (16 จาก 896 เอ็กซ์เพิร์ต) ใช้สถาปัตยกรรม Kimi Delta Attention รองรับอินพุตรูปภาพและวิดีโอในตัว (native) มีระบบให้เหตุผล (reasoning) ที่เปิดตลอดเวลาและไม่สามารถปิดได้ และมีหน้าต่างบริบท (context window) 1M ทั้งฝั่งอินพุตและเอาต์พุต ในขณะที่ Z.ai เดิมพันว่าโมเดลแบบเดิมที่มีมากขึ้นก็เพียงพอแล้ว Moonshot กลับเดิมพันว่าตัวฐานโมเดลต่างหากคือเพดาน

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

การเปรียบเทียบแบบตัวต่อตัว พร้อมแหล่งที่มา

สถานที่เดียวที่ทั้งสองโมเดลปรากฏบนหน้าเดียวกันคือตารางเปิดตัวของ Z.ai เอง ดังนั้นตัวเลขที่เปรียบเทียบกันจึงมาจากที่นั่น — ซึ่งระบุว่าเป็นข้อมูลที่รายงานโดยผู้พัฒนา ไม่ได้ผ่านการตรวจสอบโดยอิสระ ตัวเลขเดี่ยวของ Kimi K3 สอดคล้องกับสิ่งที่ Moonshot เผยแพร่ในเดือนกรกฎาคมและสิ่งที่ Artificial Analysis วัดได้ แต่ยังไม่มีห้องแล็บที่เป็นกลางรายใดทดสอบทั้งสองตัว

Terminal-Bench 3.0 — G​LM-5.3 ที่ 28.3 เทียบกับ Kimi K3 ที่ 17.4 (ตารางของ Z.ai). ช่องว่างด้านการเขียนโค้ดที่ใหญ่ที่สุดในการแข่งขันครั้งนี้ บนเวอร์ชันใหม่ล่าสุดและยากที่สุด

Terminal-Bench 2.1 — GLM-5.3 ได้ 88.2 ส่วน Kimi K3 ได้ 88.3 สูสีกันมาก

DeepSWE v1.1 — GLM-5.3 ได้ 66.9 เทียบกับ Kimi K3 ได้ 67.5 Kimi ชนะไปแบบฉิวเฉียด

SWE-Marathon v1.1 — G​LM-5.3 ทำได้ 42.5 ส่วน Kimi K3 ทำได้ 48.1 นี่คือชัยชนะด้านการเขียนโค้ดที่ดีที่สุดของ Kimi.

ExploitGym — G​LM-5.3 ได้ 105/130 เทียบกับ Kimi K3 ที่ 36/70 นับเป็นการกวาดชัยชนะที่เกือบสมบูรณ์ของ G​LM.

GDPval-AA v2 (งานด้านความรู้) — G​LM-5.3 ได้ 1,769 เทียบกับ Kimi K3 ที่ 1,682.

การเข้าถึง — G​LM-5.3: การสมัครสมาชิก Coding Plan น้ำหนักถูกจำกัดจนถึงประมาณวันที่ 28 สิงหาคม Kimi K3: API ใช้งานได้แล้วในราคา $3 / $15 ดาวน์โหลดน้ำหนักได้ตั้งแต่วันที่ 27 กรกฎาคม

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

คูเมืองความปลอดภัยคือการแยกที่แท้จริง

ตัดเรื่องเกณฑ์วัดการเขียนโค้ดออกไป ความแตกต่างที่ชี้ขาดคือความมั่นคงปลอดภัยทางไซเบอร์ G​LM-5.3 รายงานคะแนน 84.5 บน CyberGym เทียบกับ 80.0 ของ Kimi K3 และคะแนน ExploitBench ที่ 54.4 เกือบเป็นสองเท่าของ 32.2 ของ Kimi K3 บน ExploitGym ช่องว่างนั้นไม่ใช่แค่ความต่าง แต่เป็นคนละระดับกัน — 105 กับ 130 เทียบกับ 36 กับ 70 ในการรัน 2 ชั่วโมงและ 6 ชั่วโมง นั่นคือเหตุผลว่าทำไมการเปิดตัวทั้งสองครั้งจึงให้ความรู้สึกต่างกันมากในทางปฏิบัติ: น้ำหนักของ Kimi K3 เปิดเผยสู่สาธารณะภายใต้สัญญาอนุญาต Modified MIT ในขณะที่ของ G​LM-5.3 ถูกเก็บไว้เพื่อการเสริมความปลอดภัย (safety hardening) เพราะ Z.ai กล่าวว่าโมเดลเก่งพอในการค้นหาและใช้ประโยชน์จากช่องโหว่ จนการปล่อยน้ำหนักออกมาทันทีรู้สึกขาดความรับผิดชอบ หากงานของคุณเกี่ยวข้องกับการตรวจสอบโค้ดของคนอื่น หรือการปกป้องโค้ดของคุณเองจากการล่า Vulnerability แบบอัตโนมัติ นี่คือประเด็นที่เกี่ยวข้องมากที่สุดเพียงหนึ่งเดียวในการเปรียบเทียบทั้งหมด — และเป็นประเด็นที่ผ่านการตรวจสอบโดยอิสระน้อยที่สุดด้วย

ที่ที่ Kimi K3 โต้กลับ

ชัยชนะของ Kimi K3 รวมกลุ่มกันอยู่ตรงจุดที่ G​LM-5.3 อ่อนแอที่สุด นั่นคืองาน repository ที่ใช้ระยะเวลายาวนาน โดยมันยังได้เปรียบใน DeepSWE และ SWE-Marathon เป็นผู้นำใน Toolathlon Verified และหน้าต่างเอาต์พุต 1 ล้านโทเคนของมันหมายความว่ามันสามารถเขียนโค้ดเบสทั้งหมดหรือ trace ของ agent แบบยาวได้ในรอบเดียว ระบบ reasoning ที่เปิดตลอดเวลาของมันจะสตรีม trace ทั้งหมดไปยัง API ซึ่งนักพัฒนาได้กล่าวว่ามีประโยชน์สำหรับการดีบัก agent มากกว่าคำอธิบายสรุปแบบทึบแสง (opaque) อย่างเห็นได้ชัด — โดยมีข้อแม้ในทางปฏิบัติว่าคุณต้องส่งคืนฟิลด์ reasoning แบบคำต่อคำตลอดการเรียกใช้เครื่องมือ (tool calls) และไม่มีการ prefill ของ assistant ในดัชนี Intelligence Index ของ Artificial Analysis นั้น Kimi K3 อยู่ที่ 57 เป็นอันดับที่สี่โดยรวม โดยมีต้นทุนต่องานประมาณ 0.94 ดอลลาร์สหรัฐที่วัดจากชุดมาตรฐานของมัน นอกจากนี้ยังเป็นโมเดลที่แพงที่สุดที่ห้องแล็บจีนเคยเปิดตัว: 3 ดอลลาร์ต่อล้านโทเคนนำเข้าและ 15 ดอลลาร์ต่อล้านโทเคนเอาต์พุต ซึ่งเป็นราคาระดับ Sonnet ในขณะที่ G​LM-5.3 ยังไม่สามารถคิดราคาต่อโทเคนได้เลยเพราะมันมีอยู่ในแผนการสมัครสมาชิกเท่านั้น

ความเป็นจริงด้านการเข้าถึงและต้นทุน

Kimi K3 อยู่บน OrcaRouter ตอนนี้ในราคารายการของ Moonshot เอง — $3 / $15 ต่อล้านโทเคน, $0.30 สำหรับการอ่านแบบแคช, มาร์กอัป 0% — ดังนั้นงานเอเจนต์บริบท 1M จึงสามารถเรียกใช้ได้ด้วยคีย์เดียวกันกับสแตกที่เหลือของคุณ และน้ำหนักแบบเปิดเป็นตัวเลือกทางออกหากคุณต้องการโฮสต์เอง G​​LM-5.3 เป็นรุ่นที่หายาก: การสมัครสมาชิกรายเดือน $18 ถึง $168 พร้อมระบบคะแนนที่ใช้เครดิต 6.9 เท่าสำหรับอินพุตและ 24 เท่าสำหรับเอาต์พุต ราคานอกช่วงพีคที่ลดการเผาผลาญลงครึ่งหนึ่งนอกเวลา 14:00–18:00 ตามเวลาจีน และไม่มี API แบบต่อโทเคนจนกว่าการตรวจสอบความปลอดภัยจะผ่าน ชั้นการจัดเส้นทางทำให้ความไม่สมดุลนี้แบนลงในช่วงสองสัปดาห์: เมื่อ API ของ G​​LM-5.3 มาอยู่บนคีย์เดียวกัน การเรียกแบบแผงสามารถรันเรือธงโอเพนโค้ดทั้งสองตัวกับงานของคุณเอง และให้ผู้ตัดสินทำให้ผลลัพธ์สอดคล้องกัน — และหากคุณรอไม่ไหว น้ำหนักที่เผยแพร่แล้วของ Kimi K3 ทำให้มันเป็นเพียงหนึ่งในสองตัวที่คุณสามารถนำไปใช้ภายในองค์กรได้อย่างเต็มรูปแบบในวันนี้

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

เดิมพันไหนกำลังจ่าย

คำตัดสินที่ตรงไปตรงมาหลังจากผ่านไปหนึ่งสัปดาห์คือ การเดิมพันทั้งสองให้ผลตอบแทน แต่ในปริมาณงานที่แตกต่างกัน หากงานของคุณเกี่ยวกับเทอร์มินัลเป็นหลัก เกี่ยวข้องกับความปลอดภัย และถูกขับเคลื่อนโดยเอเจนต์ G​LM-5.3 คือทิศทางที่แข็งแกร่งกว่าตามหลักฐานที่ Z.ai เผยแพร่ — และช่องว่างด้านความปลอดภัยทางไซเบอร์ก็ใหญ่พอที่จะคุ้มค่ากับการรอสองสัปดาห์เพื่อให้ได้ weights มาตรวจสอบด้วยตัวเอง หากงานของคุณคือเซสชัน repository ที่ยาว อินพุตแบบมัลติโหมด หรืออะไรก็ตามที่คุณต้องการ weights อยู่ในมือวันนี้ Kimi K3 คือตัวเดียวในสองตัวที่พร้อมใช้งานจริง — และชัยชนะด้าน deep-repo ของมันคือสิ่งที่คุณสามารถตรวจสอบได้ทันทีจาก live API ของมัน สิ่งหนึ่งที่ต้องจำไว้ให้ดี: ตัวเลขทุกตัวในการเปรียบเทียบแบบตัวต่อตัวนี้มาจากตารางของ Z.ai เอง ดังนั้นให้ถือว่าความแตกต่างด้านการเขียนโค้ดเป็นเพียงแนวโน้มจนกว่าห้องปฏิบัติการอิสระจะทดสอบทั้งสองตัว นั่นคือการตรวจสอบแบบที่การรอสองสัปดาห์จะนำมาให้อย่างแท้จริง

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube