การ์ดไตเติลหลักสำหรับการเปรียบเทียบ GLM-5.3 และ GLM-5.2 พร้อมคำบรรยายใต้ชื่อว่า 'สมองเดียวกัน เบนช์มาร์กเพิ่มเป็นสองเท่า' โดยมีการ์ดโมเดลสองใบที่แชร์บล็อกฐาน 743B MoE แบบเชื่อมต่อกันเพียงชุดเดียว และลูกศรอัปเกรดโค้งที่ติดป้ายว่า 'เฉพาะหลังการเทรน' ชี้จาก GLM-5.2 ไปยัง GLM-5.3
Guides & Insights

GLM-5.3 เทียบกับ GLM-5.2: สมองเดียวกัน แต่คะแนน Benchmark เพิ่มขึ้นเท่าตัว

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

กรอบการนำเสนอของ Zhipu AI เองสำหรับการอัปเกรดจาก GLM-5.2 เป็น GLM-5.3 คือคำอธิบายที่ตรงไปตรงมา: ตำราเรียนไม่ได้เปลี่ยนไป มีเพียงการฝึกฝนของนักเรียนเท่านั้นที่เปลี่ยน GLM-5.3 ซึ่งเปิดตัวเมื่อวันที่ 14 สิงหาคม 2026 สร้างขึ้นบนฐาน MoE ที่มีพารามิเตอร์ 743 พันล้านตัวเดียวกันกับ GLM-5.2 ทุกประการ ซึ่งครองตำแหน่งสูงสุดในกลุ่มโมเดลโอเพนเวตบนดัชนี Artificial Analysis Intelligence Index เมื่อเดือนมิถุนายน สถาปัตยกรรมไม่เปลี่ยนแปลง ขนาดของโมเดลไม่เปลี่ยนแปลง ราคา $1.40 / $4.40 ต่อล้านโทเคนไม่เปลี่ยนแปลง — และกระนั้น Z.ai รายงานว่าโมเดลที่เทรนใหม่นี้ทำคะแนนได้ดีเป็นสองเท่าหรือมากกว่ารุ่นก่อนในหลายเบนช์มาร์กด้านการเขียนโค้ดและความปลอดภัยที่ทั้งสองเวอร์ชันเผยแพร่ ไม่ว่า GLM-5.3 จะเป็นการอัปเกรดที่ต้องทำหรือควรรอดู ขึ้นอยู่กับว่าคุณเชื่อถือโมเดลที่พัฒนาขึ้นมากขนาดนี้โดยไม่เปลี่ยนสถาปัตยกรรมของตัวเองมากแค่ไหน และขึ้นอยู่กับว่าความสามารถด้านไซเบอร์ที่เพิ่งเกิดขึ้นใหม่นี้เป็นฟีเจอร์ที่คุณต้องการให้ถูกจำกัดด้วยหน้าต่างความปลอดภัยสองสัปดาห์หรือไม่

สมองเดิมที่ถูกฝึกใหม่

ทุกสิ่งที่ทำให้ GLM-5.2 เป็นเซิร์ฟเวอร์ที่ใช้งานได้จริงยังคงครบถ้วน: โมเดล MoE ขนาด 743B พร้อมพารามิเตอร์ที่ทำงานจริงประมาณ 40B, กลไก IndexShare sparse attention ที่ลด FLOPs ลงที่บริบท 1M, ใบอนุญาต MIT, หน้าต่างบริบท 1M และอัตราการส่งผ่าน token ที่วัดได้ประมาณ 145–168 tokens/วินาทีจากการสังเกตอย่างอิสระ G​LM-5.3 แตกต่างเพียงมิติเดียว — การฝึกหลังการเทรน (post-training) Z.ai ขยายขั้นตอน reinforcement learning ด้วยเฟรมเวิร์ก IndexShare, SAO และ Slime เพิ่มสภาพแวดล้อมของงานระยะยาว (long-horizon tasks) ขึ้นอีกหลายสิบเท่า และขยายขอบเขตจากงานแก้ไขบั๊กโค้ดไปสู่การค้นหาช่องโหว่ด้านความปลอดภัยและวิศวกรรมระบบ ผลลัพธ์คือโมเดลที่มีพฤติกรรมแตกต่างไปบนฮาร์ดแวร์เดียวกัน ซึ่งเป็นเหตุผลที่ชัดเจนว่าคำถามเรื่องการอัปเกรดไม่ใช่ "ฉันต้องใช้ GPU ใหม่หรือไม่" แต่เป็น "ฉันต้องการพฤติกรรมแบบใหม่หรือไม่"

เดลต้าของเกณฑ์มาตรฐาน ในทั้งสองทิศทาง

เมื่ออ่านเป็นภาพก่อน-หลังของตัวเลขที่ Z.ai เผยแพร่ การก้าวกระโดดครั้งนี้นับว่าใหญ่ที่สุดในประวัติศาสตร์ของโมเดลโอเพนเวตส์ Terminal-Bench 3.0 — เวอร์ชันที่ปรับปรุงใหม่ซึ่งเข้มงวดขึ้น และเป็นเวอร์ชันที่ทั้งสองรุ่นถูกให้คะแนน — เพิ่มจาก 4.6 เป็น 28.3 คิดเป็นการเพิ่มขึ้นถึงหกเท่า DeepSWE v1.1 เพิ่มจาก 46.2 เป็น 66.9 ซึ่งคือความแตกต่างระหว่าง "โมเดลโอเพนที่ดี" กับการ "เทียบชั้นผู้นำโมเดลปิดได้" ชุดย่อย CLI ของ Agents' Last Exam ขยับจาก 23.8 เป็น 28.5 การค้นหาช่องโหว่ของ CyberGym เพิ่มจาก 77.2 เป็น 84.5 ExploitBench เพิ่มขึ้นมากกว่าสองเท่า จาก 24.4 เป็น 54.4 และปริมาณงานของ ExploitGym เพิ่มจาก 29 และ 39 งานที่ทำสำเร็จ (ในสองและหกชั่วโมง) เป็น 105 และ 130 Z.ai สรุปว่านี่คือการพัฒนาด้านการเขียนโค้ดประมาณ 50% และรูปแบบของการเพิ่มขึ้นดังกล่าว — ซึ่งกระจุกตัวอยู่ในการเขียนโค้ดระยะยาว ระบบอัตโนมัติในเทอร์มินัล และความปลอดภัย — สอดคล้องกับโมเดลที่ผ่าน post-training เพียงอย่างเดียว: ความรู้ดิบยังคงเท่าเดิม แต่สิ่งที่แข็งแกร่งขึ้นคือความสามารถในการทำงานหลายขั้นตอนอย่างแท้จริง

• Terminal-Bench 3.0 — GLM-5.2 4.6 เทียบกับ GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 เทียบกับ GLM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 เทียบกับ G​LM-5.3 28.5

• CyberGym การค้นหาช่องโหว่ — GLM-5.2 77.2 เทียบกับ G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 เทียบกับ G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

ศักยภาพที่ไม่มีใครวางแผนไว้

ผลด้านความปลอดภัยที่เกิดขึ้นสมควรมีย่อหน้าแยกต่างหาก เพราะ Z.ai กล่าวว่าสิ่งเหล่านี้ไม่ใช่แผนที่วางไว้ ทีมหลังการฝึกเพิ่มสภาพแวดล้อมสำหรับการค้นหาช่องโหว่ โดยคาดหวังเพียงการปรับปรุงเล็กน้อย แต่โมเดลกลับเริ่มเชื่อมโยงการโจมตีแบบสมบูรณ์ได้เอง ซึ่งเป็นพฤติกรรมที่เกิดขึ้นโดยไม่ตั้งใจ ทำให้ Z.ai ต้องระงับการเผยแพร่น้ำหนักโมเดลไว้ประมาณสองสัปดาห์เพื่อเสริมความปลอดภัย ในการทดสอบจริงกับทีมรักษาความปลอดภัย G​LM-5.3 มีส่วนช่วยค้นพบช่องโหว่ 2,436 รายการใน 269 โปรเจกต์ โดย 1,097 รายการเป็นความเสี่ยงระดับปานกลางถึงสูง รวมถึงจุดบกพร่องที่ไม่มีใครตรวจพบมานานหลายทศวรรษในซอฟต์แวร์ที่ใช้งานอย่างแพร่หลาย GLM-5.2 มีความสามารถด้านความปลอดภัยในความหมายทั่วไป กล่าวคือ อ่านโค้ดเพื่อหาบั๊กได้ ส่วน G​LM-5.3 มีความสามารถในอีกความหมายหนึ่ง: มันคือสิ่งที่หน้าต่างความปลอดภัยพูดถึง นี่คือการเปลี่ยนแปลงในเชิงชนิด ไม่ใช่เชิงระดับ และเป็นเหตุผลที่แข็งแกร่งที่สุดในการมองว่าโมเดลทั้งสองเป็นผลิตภัณฑ์ที่แตกต่างกัน แม้จะมีพื้นฐานร่วมกัน

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

ข้อควรระวังเรื่องความสม่ำเสมอ

ตัวถ่วงดุลกับตัวเลขทั้งหมดข้างต้นคือ การทดสอบจากบุคคลที่สามในช่วงแรกอธิบายว่า G​LM-5.3 มีความไม่สม่ำเสมอในแบบที่ GLM-5.2 ไม่เป็นเช่นนั้น ผู้ตรวจสอบอิสระรายงานว่าโมเดลเดียวกันนี้ทำงานเหมือนวิศวกรเอาต์ซอร์สที่ผ่านแบบเฉียดฉิวในบางงาน และให้ผลลัพธ์ระดับมืออาชีพในงานอื่นๆ โดยความแตกต่างนั้นสัมพันธ์กับความชัดเจนของข้อกำหนดที่ระบุไว้ นั่นคือรูปแบบความล้มเหลวที่คุณคาดเดาได้จากโมเดลที่ได้ประโยชน์ทั้งหมดมาจากการฝึกหลังการเทรนที่เน้นสภาพแวดล้อมเป็นหลัก มันสรุปนัยทั่วไปจากรูปแบบของงานที่มันถูกฝึกมา และพรอมพ์ที่ระบุไม่ชัดเจนก็ตกอยู่นอกเหนือรูปแบบเหล่านั้น ไม่มีผลลัพธ์อิสระใดที่สะอาดเท่าตารางที่เผยแพร่ของ Z.ai และไม่มีตัวเลขใดของ Z.ai ที่ถูกทำซ้ำอย่างอิสระได้ในตอนนี้ สำหรับการผลิต สิ่งนี้ชี้ให้เห็นถึงการประเมินอย่างชัดเจนบนเวิร์กโหลดของคุณเองก่อนการย้ายระบบ — ข้อควรระวังเดียวกันกับที่ GLM-5.2 สมควรได้รับ แต่ตอนนี้มีช่วงห่างระหว่างกรณีดีที่สุดและแย่ที่สุดที่กว้างขึ้น

ราคา การเข้าถึง และคำถามเรื่องการรอคอย

ราคาเท่ากัน ซึ่งช่วยขจัดอุปสรรคในการอัปเกรดตามปกติ: ทั้งสองรุ่นมีราคา $1.40 / $4.40 ต่อล้านโทเคน โดย G​LM-5.3 ต้องเปิดใช้โหมดคิด (thinking) ความแตกต่างที่แท้จริงคือการเข้าถึง GLM-5.2 สามารถดาวน์โหลดได้แล้ววันนี้ภายใต้สัญญา MIT รองรับการโฮสต์เองบนพื้นที่ FP8 ที่ต่ำกว่าเทราไบต์ และเรียกใช้ผ่าน OrcaRouter ในราคารายการโดยไม่มีมาร์กอัป — เป็นโมเดลที่คุณสามารถเลือกใช้ได้ทันที มีความเสถียร และผ่านการประเมินอย่างอิสระ G​LM-5.3 ใช้งานได้แล้วตอนนี้ผ่าน ZCode / AutoClaw ของ Z.ai และ G​LM Coding Plan แต่ API สาธารณะและน้ำหนักของโมเดล (weights) ถูกจำกัดการเข้าถึงในช่วงหน้าต่างความปลอดภัย และตัวเลข benchmark ทั้งหมดเป็นข้อมูลที่ผู้ผลิตประกาศ รอการทดสอบซ้ำจากบุคคลที่สาม ดังนั้น คำตอบที่ตรงไปตรงมาสำหรับคำถามว่า "ควรจะรอไหม" มีสองส่วน: สำหรับการใช้งานจริงที่ต้องไม่ถดถอย GLM-5.2 ยังคงเป็นตัวเลือกที่ปลอดภัยในฐานะโมเดลน้ำหนักเปิด (open-weights) ในวันนี้ และเมื่อใดที่ API ของ G​LM-5.3 เปิดให้บริการและการทดสอบอิสระผ่านเกณฑ์ การเปลี่ยนก็แค่เปลี่ยนเส้นทาง ไม่ใช่เขียนใหม่ — คุณคงการตั้งค่าแบบคีย์เดียวเดิมไว้แล้วแค่สลับช่องทาง สำหรับงานสำรวจและการประเมินความปลอดภัย G​LM-5.3 คุ้มค่าที่จะลองใช้ตอนนี้ผ่านเครื่องมือของ Z.ai โดยเข้าใจว่าความได้เปรียบที่เผยแพร่ยังไม่ได้รับการยืนยัน และพฤติกรรมของมันแปรผันมากกว่าโมเดลเดิมที่มันแทนที่

คำตัดสินที่ตรงไปตรงมา

G​LM-5.3 เป็นโมเดลที่ดีกว่าตามตัวเลขของ Z.ai เอง — ดีกว่าอย่างเห็นได้ชัดในงานเขียนโค้ดระยะยาว และแตกต่างโดยสิ้นเชิงในด้านความปลอดภัย — และมันไม่เป็นภาระต่อเวิร์กโฟลว์ของคุณ เพราะพื้นฐาน, ฟุตพริ้นต์ และราคายังไม่เปลี่ยนแปลง แต่ “ดีกว่าในการประเมินของผู้ขาย” และ “ดีกว่าในไปป์ไลน์ของคุณ” ถูกคั่นด้วยสองสิ่งที่ GLM-5.2 มีอยู่แล้ว และ G​LM-5.3 ยังไม่มี: การทำซ้ำอย่างอิสระและการเผยแพร่น้ำหนัก หากคุณรัน GLM-5.2 อยู่แล้ว เส้นทางอัปเกรดนั้นถูกที่สุดในประวัติศาสตร์ของ open-weights — ฮาร์ดแวร์เดียวกัน ราคาเดียวกัน พื้นผิว API เดียวกัน และรอเพียงสองสัปดาห์สำหรับน้ำหนัก การตัดสินใจไม่ใช่เรื่องว่า G​LM-5.3 ดีกว่า GLM-5.2 หรือไม่ แต่เป็นเรื่องที่ว่าคุณยินดีวางใจการผลิตบนโมเดลที่การปรับปรุง และความสามารถด้านความปลอดภัยที่เพิ่งเกิดขึ้น ยังไม่ได้รับการยืนยันจากใครนอก Z.ai

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube