
GLM 5.3 Prime กับ GLM-5.3: ราคาสองเท่าเพื่อเวทเดียวกันและนาฬิกาจับเวลา
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ในการเปรียบเทียบนี้ไม่มีข้อกังขาเกี่ยวกับคุณภาพ และนั่นคือสิ่งที่ทำให้มันไม่ธรรมดา GLM 5.3 Prime และ GLM-5.3 เป็นโมเดลเดียวกัน — น้ำหนักเดียวกัน, คอนเท็กซ์ 1,000,000 โทเคนเดียวกัน, เพดานเอาต์พุต 131,072 โทเคนเดียวกัน, การใช้เหตุผลแบบบังคับเหมือนกันพร้อมระดับความพยายามสามระดับเดียวกัน, คะแนนเดียวกันในทุกเบนช์มาร์กที่เผยแพร่ GLM-5.3 ถูกประกาศเมื่อวันที่ 14 สิงหาคม 2026 เปิดให้ใช้ผ่าน API เมื่อวันที่ 18 สิงหาคม และเปิดเผยน้ำหนักโมเดลเมื่อวันที่ 25 สิงหาคม; Prime ID ปรากฏขึ้นในช่วงปลายเดือนกันยายนในฐานะวิธีที่สองในการซื้อสิ่งที่เหมือนกันทุกประการ แถวเดียวในการเปรียบเทียบที่แตกต่างคือแถวที่สำคัญต่อใบแจ้งหนี้ของคุณ และมันต่างกันพอดี 2.0×
ดังนั้นคำถามจึงไม่ใช่ว่าจะใช้โมเดลไหน แต่คือว่าเลนการให้บริการที่อ้างว่ามีปริมาณงานส่งออก 1.5–2 เท่านั้นคุ้มกับราคาที่แพงเป็น 2 เท่าหรือไม่ และนั่นเป็นเลขคณิตที่คุณคิดได้ในย่อหน้าเดียว บทความส่วนใหญ่เกี่ยวกับคู่นี้ข้ามการคำนวณไปแล้วไปถกกันเรื่องเบนช์มาร์กซึ่งโดยการออกแบบแล้วเหมือนกันทุกประการ นี่คือผลบวก
เฉพาะแถวที่แตกต่างเท่านั้น

• ราคา — GLM 5.3 Prime $2.80 / $8.80 ต่อ 1M เทียบกับ GLM-5.3 $1.40 / $4.40 ต่อ 1M
• อินพุตที่แคชไว้ — $0.56 ต่อ 1M เทียบกับ $0.26 ต่อ 1M
• ตัวคูณ — 2.0× ในทุกรายการ ทั้งสองทิศทาง โดยไม่มีข้อยกเว้น
• ปริมาณงานที่ประมวลผลได้ — ผู้ขายรายงานว่า 1.5–2× บนเลนแบบเร่งความเร็ว เทียบกับเลนมาตรฐาน; ไม่มีการวัดค่า Prime ID อย่างเป็นอิสระ
• ดัชนีความฉลาด — 45 เท่ากันทั้งคู่ เพราะเป็นโมเดลเดียวกันที่ให้คะแนนเพียงครั้งเดียว
• บริบท — 1,000,000 โทเคนทั้งคู่
• เอาต์พุตสูงสุด — 131,072 โทเคนทั้งคู่
• การให้เหตุผล — บังคับใช้ทั้งคู่ ต่ำ / สูง / สูงสุด โดยค่าเริ่มต้นคือ สูงสุด ทั้งคู่
• รูปแบบข้อมูล — ข้อความเข้า ข้อความออก ทั้งคู่
• น้ำหนักโมเดล — ของ GLM-5.3 ดาวน์โหลดได้ภายใต้สัญญาอนุญาตเฉพาะ; Prime ไม่มีน้ำหนักโมเดลเลย
• ความพร้อมใช้งาน — GLM-5.3 บน API ของ Z.ai เองและทุกแพลตฟอร์มที่ให้บริการ; Prime บนแพลตฟอร์มเดียว ผ่านผู้ให้บริการต้นทางที่มีชื่อระบุหนึ่งราย
สังเกตว่าค่าแถวที่เหมือนกันส่งผลอย่างไรต่อบทความเปรียบเทียบทั่วไป ในที่นี้ไม่มีข้อโต้แย้งเรื่องความลึกของการใช้เหตุผล ไม่มีข้อโต้แย้งเรื่องบริบทขนาดยาว ไม่มีข้อโต้แย้งเรื่องการเรียกใช้เครื่องมือ ไม่มีข้อโต้แย้งเรื่องสิทธิ์ในการให้บริการที่แยกผลิตภัณฑ์สองตัวนี้ออกจากกัน เพราะช่องทางการให้บริการไม่ได้เปลี่ยนพฤติกรรมของโมเดล หากคุณเคยอ่านการเปรียบเทียบแบบตัวต่อตัวของคู่นี้ที่พบว่า Prime "มีความสามารถมากกว่า" ในงานบางงาน ข้อค้นพบนั้นเป็นเพียงสัญญาณรบกวน — น้ำหนักชุดเดียวกันไม่ได้สร้างการแจกแจงที่แตกต่างกัน และวิธีเดียวที่ทั้งสองต่างกันคือความเร็วที่โทเค็นมาถึง และจำนวนโทเค็นที่ความพยายามในการใช้เหตุผลตามค่าเริ่มต้นทำให้โมเดลส่งออก
จุดคุ้มทุน ทำอย่างถูกต้อง
ถ้าคิดราคาสองเลนต่อหน่วยงาน ทั้งหมดก็จะยุบเหลืออัตราส่วนเดียว ถ้า Prime ให้ทรูพุต 2.0 เท่าในราคา 2.0 เท่า คุณกำลังซื้อผลลัพธ์เท่าเดิมในต้นทุนเท่าเดิม และเพียงแลกเงินกับเวลาจริง — เป็นการซื้อความหน่วงล้วน ๆ โดยไม่มีส่วนเพิ่มและไม่มีส่วนลด ถ้า Prime ให้ทรูพุต 1.5 เท่าในราคา 2.0 เท่า คุณกำลังจ่ายประมาณ 1.33 เท่าต่อโทเค็นต่อวินาที ซึ่งเป็นส่วนเพิ่มหนึ่งในสามสำหรับสิทธิพิเศษในการรอน้อยลง นั่นคือสองปลายของช่วงที่ผู้ขายอ้างเอง และทั้งสองปลายเป็นกรณีดีที่สุด เพราะมันสมมติว่า 1.5–2× นั้นคงอยู่กับงานของคุณ ไม่ใช่กับเงื่อนไขการวัดประสิทธิภาพของผู้ขาย
ส่วนเพิ่มนั้นแย่กว่านั้นในทางปฏิบัติด้วยเหตุผลหนึ่ง นั่นคือ throughput ถูกวัดจากการร้องขอที่เครื่องอุ่นแล้ว สั้น และไม่มีการแย่งชิงทรัพยากร และมันเป็นเมตริกที่ไวต่อทุกสิ่งอื่นมากที่สุด เซสชันเอเจนต์แบบ long-context จะอ่านบันทึกบทสนทนาที่ค่อย ๆ โตขึ้นซ้ำใหม่ในทุกเทิร์น ซึ่งไปลงภาระที่ prefill และการอ่านแคช แทนที่จะเป็น decode ในสภาวะคงตัว — และ Prime ก็คิดค่าอ่านแคชเป็นสองเท่าเช่นกัน การวัดแบบอิสระของโมเดลฐานให้ค่า GLM-5.3 อยู่ที่ประมาณ 61 โทเคนเอาต์พุตต่อวินาที เทียบกับค่าเฉลี่ยของคลาสที่ 67 แต่ตัวเลขนั้นเป็นค่ามัธยฐานจากชุดประเมินมาตรฐาน ไม่ใช่หางการกระจายที่คุณจะเจอภายใต้โหลด สรุปตามตรงก็คือ ต้นทุนต่อหน่วย throughput ของ Prime อยู่ระหว่าง 1.0× ถึง 1.33× ของเลนฐาน และปลายที่ 1.0× นั้นต้องให้กรณีดีที่สุดของผู้ขายเป็นจริงเป๊ะ ๆ
น้ำหนักเท่ากันนั้นหมายความมากกว่าที่ฟังดู

ประโยชน์ในทางปฏิบัติของชุดน้ำหนักที่ใช้ร่วมกันก็คือ ทุกสิ่งที่คุณสร้างขึ้นโดยอิงกับ GLM-5.3 จะยังใช้ได้ต่อไปหลังการสลับในทั้งสองทิศทาง รูปร่างของพรอมป์ตถ่ายโอนได้ สคีมาของเครื่องมือถ่ายโอนได้ คีย์แคชถ่ายโอนได้ และ eval ที่คุณรันเพื่อพิสูจน์ความเหมาะสมของ flagship ตั้งแต่แรกยังคงใช้ได้กับทั้งสอง ID ไม่มีการปรับจูนใหม่ ไม่มีการตั้ง baseline ใหม่ ไม่มีความประหลาดใจในโหมดความล้มเหลว เพราะโหมดความล้มเหลวเป็นของโมเดล ไม่ใช่ของเลนที่ให้บริการมัน
เรื่องนี้ตัดได้ทั้งสองทาง และทิศทางที่สองคือทิศทางที่ต้องทำจนเป็นนิสัย หากค่าเริ่มต้นของการให้เหตุผลของ GLM-5.3 ที่ระดับ max ทำให้มันพูดยืดยาวกับงานของคุณ Prime ก็จะสืบทอดความยืดยาวนั้นมาพร้อมกับอย่างอื่นทั้งหมดด้วย เลนที่เร็วกว่าซึ่งสร้างโทเคนมากกว่าที่คุณต้องการไม่ได้เร็วขึ้นแบบต้นทางถึงปลายทาง ก่อนจะจ่ายแพงขึ้น 2 เท่าเพื่อแลกกับความเร็ว ลองลดระดับ effort ลงเป็น high หรือ low แล้ววัดผลดู — โดยปกติการตั้งค่า effort ส่งผลต่อความหน่วงแบบต้นทางถึงปลายทางมากกว่าการเลือก serving lane เสียอีก และไม่เสียค่าใช้จ่ายใด ๆ เลย
ความไม่สมมาตรเพียงหนึ่งเดียวที่รายการราคาไม่ได้แสดงให้เห็น
ค่าถ่วงน้ำหนักของ GLM-5.3 เปิดให้เข้าถึงได้ ใครก็ตามที่มีฮาร์ดแวร์สามารถดาวน์โหลดไปและนำโมเดลไปให้บริการในราคาทุน โดยไม่มีค่าใช้จ่ายต่อโทเคนและไม่ต้องเลือกระหว่างช่องทางให้บริการ การควอนไทซ์ที่เล็กที่สุดในทางปฏิบัติอยู่ที่ราว 217 GB ของหน่วยความจำตัวเร่งความเร็ว ซึ่งถือเป็นการติดตั้งแบบหลายโหนดสำหรับทีมส่วนใหญ่ และเป็นเพียงเศษเสี้ยวเล็กน้อยสำหรับบางราย และสัญญาอนุญาตมีเกณฑ์รายได้ขั้นต่ำ ซึ่งเมื่อเกินเกณฑ์นั้น ผู้ให้บริการ Model-as-a-Service รายใหญ่ต้องผ่านการตรวจสอบความปลอดภัยก่อนให้บริการในเชิงพาณิชย์
Prime ไม่มีเวท มันเป็นเลนที่โฮสต์บนดีพลอยเมนต์ของคนอื่น และรายการของมันระบุผู้ให้บริการอัปสตรีมเพียงรายเดียวที่อยู่เบื้องหลังเอนด์พอยต์ นั่นคือความไม่สมมาตรที่ควรค่าแก่การกล่าวถึง: สำหรับโมเดลพื้นฐาน คุณกำลังเลือกระหว่างราคาต่อโทเคนกับต้นทุนตัดจำหน่ายของคุณเอง และสำหรับ Prime คุณกำลังเลือกระหว่างราคาต่อโทเคนกับไม่มีอะไรเลย ทีมที่รัน GLM-5.3 บนฮาร์ดแวร์ของตนเองอยู่แล้วมีตัวเลือกที่สามในการเปรียบเทียบนี้ซึ่งรายการราคาไม่เคยแสดง และมันมักจะเป็นตัวเลือกที่ถูกที่สุดในสามตัวเลือกนี้
ในจุดที่เครื่องจับเวลาชนะอย่างแท้จริง
มีเวิร์กโหลดที่การจ่ายเพิ่ม 1.33× ต่อโทเคนเป็นสิ่งที่ถูกต้องอย่างชัดเจน และเวิร์กโหลดเหล่านั้นมีคุณสมบัติร่วมกันหนึ่งอย่าง: มีสิ่งอื่นที่ไม่ใช่งบโทเคนของคุณที่เป็นคอขวด ไม่ว่าจะเป็นมนุษย์ที่กำลังรอการตอบกลับในหน้าจอแชต ขั้นตอนแบบซิงโครนัสในไปป์ไลน์ที่ขั้นถัดไปไม่สามารถเริ่มได้จนกว่าโมเดลจะตอบกลับ หรือลูปเอเจนต์ที่เรียกแบบต่อเนื่องสิบครั้ง โดยที่เวลาแฝงของทุกการเรียกจะถูกคูณด้วยความยาวของเชน และเวลารวมตามนาฬิกาจริงคือสิ่งที่ผู้ใช้ของคุณได้สัมผัสจริง ในกรณีเหล่านั้น คุณไม่ได้กำลังซื้อโทเคน คุณกำลังซื้อเวลาที่โทเคนเหล่านั้นจะใช้ไปกลับคืนมา และตัวคูณ 2× บนใบแจ้งหนี้ก็ไม่ใช่ตัวเลขที่ตัดสินว่าฟีเจอร์นั้นจะทำงานได้หรือไม่
นอกรูปแบบนั้น เลขคณิตก็หันมาต่อต้าน Prime อย่างรวดเร็ว การสร้างแบบเป็นชุดในชั่วข้ามคืนไม่สนใจว่าคำขอแต่ละรายการจะตอบกลับเร็วแค่ไหน การจำแนกประเภทปริมาณมากก็ไม่สนใจเช่นกัน และเมื่อขยาย規模 ส่วนเพิ่ม 2× สำหรับการอ่านแคชก็ทบต้นกลายเป็นรายการค่าใช้จ่ายจริง และงานใดก็ตามที่ความยาวในการใช้เหตุผลของโมเดลเองเป็นพจน์หลัก เช่น โจทย์คณิตศาสตร์ยาก ๆ หรือสายการวางแผนยาว ๆ กำลังจ่ายค่าความเร็วไปกับส่วนของคำขอที่ไม่เคยเป็นส่วนที่ช้าตั้งแต่แรก
ทั้งสองช่องทาง คีย์เดียว ไม่ต้องผสานรวมครั้งที่สอง

วิธีที่ทีมส่วนใหญ่ลงเอยด้วยการแก้ปัญหานี้ไม่ใช่การเลือกเลนใดเลนหนึ่ง แต่เป็นการจัดเส้นทางสลับไปมาระหว่างกันต่างหาก และนั่นจะสมเหตุสมผลก็ต่อเมื่อทั้งสอง ID สามารถเข้าถึงได้ในลักษณะเดียวกัน OrcaRouter ให้บริการ GLM-5.3 ในอัตราตามที่ผู้ให้บริการระบุไว้ที่ $1.40 และ $4.40 ต่อล้านโทเคน โดยเราบวกเพิ่มเป็นศูนย์ — เป็นการส่งต่อราคาตามที่ผู้ให้บริการระบุไว้โดยตรง แทนที่จะมาตั้งราคาใหม่ ดังนั้นเมื่อผู้ให้บริการปรับอัตรา ฝั่งเราก็มีผลทันทีในวันเดียวกับที่ฝั่งเขาปรับ GLM-5.3-Flash ก็มีให้ใช้เช่นกัน ในราคา $0.07 และ $0.25 ซึ่งสำคัญเพราะเส้นทางที่ยกระดับจากโมเดลราคาถูกไปสู่โมเดลเรือธงคือรูปแบบที่ทราฟฟิกโปรดักชันส่วนใหญ่ต้องการจริง ๆ
ID ทั้งสองอยู่ภายใต้คีย์ API เดียว ร่วมกับโมเดลอื่นอีกกว่า 200 รายการ ซึ่งเปลี่ยนการตัดสินใจเลือกเลนให้เป็นการเปลี่ยนชื่อโมเดลภายในเส้นทางการเรียกเดียว แทนที่จะเป็นสัญญาที่สองและการผสานรวมที่สอง DSL สำหรับกำหนดเส้นทางคือจุดที่สิ่งนี้มีประโยชน์สำหรับคู่นี้โดยเฉพาะ: ส่งคำเรียกที่ไวต่อความหน่วงไปยังเลนแบบเร่งความเร็ว และส่งอย่างอื่นไปยังเลนมาตรฐาน หรือยกระดับเมื่อการตรวจสอบล้มเหลวแทนที่จะเดา การสลับไปใช้งานสำรองอัตโนมัติรองรับกรณีที่ผู้ให้บริการต้นทางรายเดียวเสื่อมประสิทธิภาพ ซึ่งเป็นความเสี่ยงเฉพาะที่ชั้นบริการเร็วแบบผู้ให้บริการรายเดียวต้องแบกรับ
สิ่งหนึ่งที่เราจะไม่บอกเป็นนัย: OrcaRouter ไม่ได้โฮสต์ GLM 5.3 Prime และหน้าโมเดลของมันส่งคืน 404 ที่นี่ หากเลนเร่งความเร็วคือสิ่งที่คุณต้องการ คุณจะซื้อมันจากแพลตฟอร์มที่ขายมัน สิ่งที่เราทำได้คือมอบเลนพื้นฐาน โมเดล Flash และจุดเดียวสำหรับสลับเส้นทางระหว่างทั้งสอง
วิธีตัดสินใจใน 30 วินาที
ถามว่ามีอะไรกำลังรอการตอบกลับอยู่หรือไม่ หากมีบุคคลหรือบริการปลายน้ำถูกบล็อก และปริมาณงานถูกจำกัดด้วยความหน่วงมากกว่าปริมาณงานต่อหน่วยเวลา และคุณได้ยืนยันแล้วว่าความพยายามในการให้เหตุผลไม่ใช่ปัจจัยขับเคลื่อนหลักของความหน่วงของคุณ ค่าพรีเมียมของ Prime ก็คือราคาของฟีเจอร์นั้น และคุณควรจ่ายมัน หากไม่มีอะไรกำลังรออยู่ — งานแบบแบตช์ การประเมินแบบออฟไลน์ การสกัดข้อมูลแบบกลุ่ม หรืออะไรก็ตามที่คิวช่วยดูดซับความล่าช้าไว้ — คุณกำลังจ่ายส่วนเพิ่มหนึ่งในสามต่อหน่วยของปริมาณงานสำหรับตัวเลขที่ไม่มีใครจะดูเลย และเลนพื้นฐานคือคำตอบที่ถูกต้อง
ประเด็นที่กว้างกว่านั้นคือเรื่องวิธีที่ตระกูลนี้ถูกขาย GLM-5.3 เปิดตัวเพียงครั้งเดียวในเดือนสิงหาคม และเดือนกันยายนก็ก่อให้เกิดราคาอย่างน้อยสี่แบบที่แตกต่างกันสำหรับมัน ขึ้นอยู่กับว่าคุณเข้าไปในช่องทางใด แพลตฟอร์มใด และโมเดลพี่น้องตัวใด Prime เป็นราคาที่แพงที่สุดในบรรดาตัวเลือกเหล่านั้น และมีเอกสารประกอบน้อยที่สุด เพราะบริษัทที่ชื่ออยู่บนเวตนั้นไม่ได้ระบุรายการมันไว้ นั่นไม่ใช่ข้อโต้แย้งต่อการซื้อมัน มันเป็นข้อโต้แย้งให้คุณรู้ ก่อนที่คุณจะส่งทราฟฟิกโปรดักชันผ่านมัน ว่าสิ่งเดียวที่คุณซื้อเพิ่มจากโมเดลฐานคืออะไร ก่อนอื่นเลยคือความเร็ว — และความเร็วนั้นคิดค่าบริการตามโทเคน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
