
GLM-5.3 เทียบกับ GLM-5.2: สมองเดียวกัน แต่คะแนน Benchmark เพิ่มขึ้นเท่าตัว
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
กรอบการนำเสนอของ Zhipu AI เองสำหรับการอัปเกรดจาก GLM-5.2 เป็น GLM-5.3 คือคำอธิบายที่ตรงไปตรงมา: ตำราเรียนไม่ได้เปลี่ยนไป มีเพียงการฝึกฝนของนักเรียนเท่านั้นที่เปลี่ยน GLM-5.3 ซึ่งเปิดตัวเมื่อวันที่ 14 สิงหาคม 2026 สร้างขึ้นบนฐาน MoE ที่มีพารามิเตอร์ 743 พันล้านตัวเดียวกันกับ GLM-5.2 ทุกประการ ซึ่งครองตำแหน่งสูงสุดในกลุ่มโมเดลโอเพนเวตบนดัชนี Artificial Analysis Intelligence Index เมื่อเดือนมิถุนายน สถาปัตยกรรมไม่เปลี่ยนแปลง ขนาดของโมเดลไม่เปลี่ยนแปลง ราคา $1.40 / $4.40 ต่อล้านโทเคนไม่เปลี่ยนแปลง — และกระนั้น Z.ai รายงานว่าโมเดลที่เทรนใหม่นี้ทำคะแนนได้ดีเป็นสองเท่าหรือมากกว่ารุ่นก่อนในหลายเบนช์มาร์กด้านการเขียนโค้ดและความปลอดภัยที่ทั้งสองเวอร์ชันเผยแพร่ ไม่ว่า GLM-5.3 จะเป็นการอัปเกรดที่ต้องทำหรือควรรอดู ขึ้นอยู่กับว่าคุณเชื่อถือโมเดลที่พัฒนาขึ้นมากขนาดนี้โดยไม่เปลี่ยนสถาปัตยกรรมของตัวเองมากแค่ไหน และขึ้นอยู่กับว่าความสามารถด้านไซเบอร์ที่เพิ่งเกิดขึ้นใหม่นี้เป็นฟีเจอร์ที่คุณต้องการให้ถูกจำกัดด้วยหน้าต่างความปลอดภัยสองสัปดาห์หรือไม่
สมองเดิมที่ถูกฝึกใหม่
ทุกสิ่งที่ทำให้ GLM-5.2 เป็นเซิร์ฟเวอร์ที่ใช้งานได้จริงยังคงครบถ้วน: โมเดล MoE ขนาด 743B พร้อมพารามิเตอร์ที่ทำงานจริงประมาณ 40B, กลไก IndexShare sparse attention ที่ลด FLOPs ลงที่บริบท 1M, ใบอนุญาต MIT, หน้าต่างบริบท 1M และอัตราการส่งผ่าน token ที่วัดได้ประมาณ 145–168 tokens/วินาทีจากการสังเกตอย่างอิสระ GLM-5.3 แตกต่างเพียงมิติเดียว — การฝึกหลังการเทรน (post-training) Z.ai ขยายขั้นตอน reinforcement learning ด้วยเฟรมเวิร์ก IndexShare, SAO และ Slime เพิ่มสภาพแวดล้อมของงานระยะยาว (long-horizon tasks) ขึ้นอีกหลายสิบเท่า และขยายขอบเขตจากงานแก้ไขบั๊กโค้ดไปสู่การค้นหาช่องโหว่ด้านความปลอดภัยและวิศวกรรมระบบ ผลลัพธ์คือโมเดลที่มีพฤติกรรมแตกต่างไปบนฮาร์ดแวร์เดียวกัน ซึ่งเป็นเหตุผลที่ชัดเจนว่าคำถามเรื่องการอัปเกรดไม่ใช่ "ฉันต้องใช้ GPU ใหม่หรือไม่" แต่เป็น "ฉันต้องการพฤติกรรมแบบใหม่หรือไม่"
เดลต้าของเกณฑ์มาตรฐาน ในทั้งสองทิศทาง
เมื่ออ่านเป็นภาพก่อน-หลังของตัวเลขที่ Z.ai เผยแพร่ การก้าวกระโดดครั้งนี้นับว่าใหญ่ที่สุดในประวัติศาสตร์ของโมเดลโอเพนเวตส์ Terminal-Bench 3.0 — เวอร์ชันที่ปรับปรุงใหม่ซึ่งเข้มงวดขึ้น และเป็นเวอร์ชันที่ทั้งสองรุ่นถูกให้คะแนน — เพิ่มจาก 4.6 เป็น 28.3 คิดเป็นการเพิ่มขึ้นถึงหกเท่า DeepSWE v1.1 เพิ่มจาก 46.2 เป็น 66.9 ซึ่งคือความแตกต่างระหว่าง "โมเดลโอเพนที่ดี" กับการ "เทียบชั้นผู้นำโมเดลปิดได้" ชุดย่อย CLI ของ Agents' Last Exam ขยับจาก 23.8 เป็น 28.5 การค้นหาช่องโหว่ของ CyberGym เพิ่มจาก 77.2 เป็น 84.5 ExploitBench เพิ่มขึ้นมากกว่าสองเท่า จาก 24.4 เป็น 54.4 และปริมาณงานของ ExploitGym เพิ่มจาก 29 และ 39 งานที่ทำสำเร็จ (ในสองและหกชั่วโมง) เป็น 105 และ 130 Z.ai สรุปว่านี่คือการพัฒนาด้านการเขียนโค้ดประมาณ 50% และรูปแบบของการเพิ่มขึ้นดังกล่าว — ซึ่งกระจุกตัวอยู่ในการเขียนโค้ดระยะยาว ระบบอัตโนมัติในเทอร์มินัล และความปลอดภัย — สอดคล้องกับโมเดลที่ผ่าน post-training เพียงอย่างเดียว: ความรู้ดิบยังคงเท่าเดิม แต่สิ่งที่แข็งแกร่งขึ้นคือความสามารถในการทำงานหลายขั้นตอนอย่างแท้จริง
• Terminal-Bench 3.0 — GLM-5.2 4.6 เทียบกับ GLM-5.3 28.3
• DeepSWE v1.1 — GLM-5.2 46.2 เทียบกับ GLM-5.3 66.9
• Agents' Last Exam (CLI) — GLM-5.2 23.8 เทียบกับ GLM-5.3 28.5
• CyberGym การค้นหาช่องโหว่ — GLM-5.2 77.2 เทียบกับ GLM-5.3 84.5
• ExploitBench — GLM-5.2 24.4 เทียบกับ GLM-5.3 54.4


ศักยภาพที่ไม่มีใครวางแผนไว้
ผลด้านความปลอดภัยที่เกิดขึ้นสมควรมีย่อหน้าแยกต่างหาก เพราะ Z.ai กล่าวว่าสิ่งเหล่านี้ไม่ใช่แผนที่วางไว้ ทีมหลังการฝึกเพิ่มสภาพแวดล้อมสำหรับการค้นหาช่องโหว่ โดยคาดหวังเพียงการปรับปรุงเล็กน้อย แต่โมเดลกลับเริ่มเชื่อมโยงการโจมตีแบบสมบูรณ์ได้เอง ซึ่งเป็นพฤติกรรมที่เกิดขึ้นโดยไม่ตั้งใจ ทำให้ Z.ai ต้องระงับการเผยแพร่น้ำหนักโมเดลไว้ประมาณสองสัปดาห์เพื่อเสริมความปลอดภัย ในการทดสอบจริงกับทีมรักษาความปลอดภัย GLM-5.3 มีส่วนช่วยค้นพบช่องโหว่ 2,436 รายการใน 269 โปรเจกต์ โดย 1,097 รายการเป็นความเสี่ยงระดับปานกลางถึงสูง รวมถึงจุดบกพร่องที่ไม่มีใครตรวจพบมานานหลายทศวรรษในซอฟต์แวร์ที่ใช้งานอย่างแพร่หลาย GLM-5.2 มีความสามารถด้านความปลอดภัยในความหมายทั่วไป กล่าวคือ อ่านโค้ดเพื่อหาบั๊กได้ ส่วน GLM-5.3 มีความสามารถในอีกความหมายหนึ่ง: มันคือสิ่งที่หน้าต่างความปลอดภัยพูดถึง นี่คือการเปลี่ยนแปลงในเชิงชนิด ไม่ใช่เชิงระดับ และเป็นเหตุผลที่แข็งแกร่งที่สุดในการมองว่าโมเดลทั้งสองเป็นผลิตภัณฑ์ที่แตกต่างกัน แม้จะมีพื้นฐานร่วมกัน

ข้อควรระวังเรื่องความสม่ำเสมอ
ตัวถ่วงดุลกับตัวเลขทั้งหมดข้างต้นคือ การทดสอบจากบุคคลที่สามในช่วงแรกอธิบายว่า GLM-5.3 มีความไม่สม่ำเสมอในแบบที่ GLM-5.2 ไม่เป็นเช่นนั้น ผู้ตรวจสอบอิสระรายงานว่าโมเดลเดียวกันนี้ทำงานเหมือนวิศวกรเอาต์ซอร์สที่ผ่านแบบเฉียดฉิวในบางงาน และให้ผลลัพธ์ระดับมืออาชีพในงานอื่นๆ โดยความแตกต่างนั้นสัมพันธ์กับความชัดเจนของข้อกำหนดที่ระบุไว้ นั่นคือรูปแบบความล้มเหลวที่คุณคาดเดาได้จากโมเดลที่ได้ประโยชน์ทั้งหมดมาจากการฝึกหลังการเทรนที่เน้นสภาพแวดล้อมเป็นหลัก มันสรุปนัยทั่วไปจากรูปแบบของงานที่มันถูกฝึกมา และพรอมพ์ที่ระบุไม่ชัดเจนก็ตกอยู่นอกเหนือรูปแบบเหล่านั้น ไม่มีผลลัพธ์อิสระใดที่สะอาดเท่าตารางที่เผยแพร่ของ Z.ai และไม่มีตัวเลขใดของ Z.ai ที่ถูกทำซ้ำอย่างอิสระได้ในตอนนี้ สำหรับการผลิต สิ่งนี้ชี้ให้เห็นถึงการประเมินอย่างชัดเจนบนเวิร์กโหลดของคุณเองก่อนการย้ายระบบ — ข้อควรระวังเดียวกันกับที่ GLM-5.2 สมควรได้รับ แต่ตอนนี้มีช่วงห่างระหว่างกรณีดีที่สุดและแย่ที่สุดที่กว้างขึ้น
ราคา การเข้าถึง และคำถามเรื่องการรอคอย
ราคาเท่ากัน ซึ่งช่วยขจัดอุปสรรคในการอัปเกรดตามปกติ: ทั้งสองรุ่นมีราคา $1.40 / $4.40 ต่อล้านโทเคน โดย GLM-5.3 ต้องเปิดใช้โหมดคิด (thinking) ความแตกต่างที่แท้จริงคือการเข้าถึง GLM-5.2 สามารถดาวน์โหลดได้แล้ววันนี้ภายใต้สัญญา MIT รองรับการโฮสต์เองบนพื้นที่ FP8 ที่ต่ำกว่าเทราไบต์ และเรียกใช้ผ่าน OrcaRouter ในราคารายการโดยไม่มีมาร์กอัป — เป็นโมเดลที่คุณสามารถเลือกใช้ได้ทันที มีความเสถียร และผ่านการประเมินอย่างอิสระ GLM-5.3 ใช้งานได้แล้วตอนนี้ผ่าน ZCode / AutoClaw ของ Z.ai และ GLM Coding Plan แต่ API สาธารณะและน้ำหนักของโมเดล (weights) ถูกจำกัดการเข้าถึงในช่วงหน้าต่างความปลอดภัย และตัวเลข benchmark ทั้งหมดเป็นข้อมูลที่ผู้ผลิตประกาศ รอการทดสอบซ้ำจากบุคคลที่สาม ดังนั้น คำตอบที่ตรงไปตรงมาสำหรับคำถามว่า "ควรจะรอไหม" มีสองส่วน: สำหรับการใช้งานจริงที่ต้องไม่ถดถอย GLM-5.2 ยังคงเป็นตัวเลือกที่ปลอดภัยในฐานะโมเดลน้ำหนักเปิด (open-weights) ในวันนี้ และเมื่อใดที่ API ของ GLM-5.3 เปิดให้บริการและการทดสอบอิสระผ่านเกณฑ์ การเปลี่ยนก็แค่เปลี่ยนเส้นทาง ไม่ใช่เขียนใหม่ — คุณคงการตั้งค่าแบบคีย์เดียวเดิมไว้แล้วแค่สลับช่องทาง สำหรับงานสำรวจและการประเมินความปลอดภัย GLM-5.3 คุ้มค่าที่จะลองใช้ตอนนี้ผ่านเครื่องมือของ Z.ai โดยเข้าใจว่าความได้เปรียบที่เผยแพร่ยังไม่ได้รับการยืนยัน และพฤติกรรมของมันแปรผันมากกว่าโมเดลเดิมที่มันแทนที่
คำตัดสินที่ตรงไปตรงมา
GLM-5.3 เป็นโมเดลที่ดีกว่าตามตัวเลขของ Z.ai เอง — ดีกว่าอย่างเห็นได้ชัดในงานเขียนโค้ดระยะยาว และแตกต่างโดยสิ้นเชิงในด้านความปลอดภัย — และมันไม่เป็นภาระต่อเวิร์กโฟลว์ของคุณ เพราะพื้นฐาน, ฟุตพริ้นต์ และราคายังไม่เปลี่ยนแปลง แต่ “ดีกว่าในการประเมินของผู้ขาย” และ “ดีกว่าในไปป์ไลน์ของคุณ” ถูกคั่นด้วยสองสิ่งที่ GLM-5.2 มีอยู่แล้ว และ GLM-5.3 ยังไม่มี: การทำซ้ำอย่างอิสระและการเผยแพร่น้ำหนัก หากคุณรัน GLM-5.2 อยู่แล้ว เส้นทางอัปเกรดนั้นถูกที่สุดในประวัติศาสตร์ของ open-weights — ฮาร์ดแวร์เดียวกัน ราคาเดียวกัน พื้นผิว API เดียวกัน และรอเพียงสองสัปดาห์สำหรับน้ำหนัก การตัดสินใจไม่ใช่เรื่องว่า GLM-5.3 ดีกว่า GLM-5.2 หรือไม่ แต่เป็นเรื่องที่ว่าคุณยินดีวางใจการผลิตบนโมเดลที่การปรับปรุง และความสามารถด้านความปลอดภัยที่เพิ่งเกิดขึ้น ยังไม่ได้รับการยืนยันจากใครนอก Z.ai
