การ์ดชื่อเรื่องแบบฮีโร่สำหรับ GLM 5.3 Prime ที่อ่านว่า 'GLM 5.3 Prime: ราคาสองเท่า น้ำหนักเท่ากัน' มีคำโปรยย่อยว่า 'GLM-5.3, สิงหาคม 2026, ถูกขายต่อเป็นช่องทางให้บริการที่เร็วกว่าในเดือนกันยายน' พร้อมชิปสามอันที่อ่านว่า 'อินพุต / 1M: $2.80 เทียบกับ $1.40', 'เอาต์พุต / 1M: $8.80 เทียบกับ $4.40' และ 'ตัวคูณ: 2.0x พอดี' และบรรทัดท้ายว่า 'น้ำหนักเท่ากัน บริบทเท่ากัน เบนช์มาร์กเท่ากัน - ราคาเป็นสิ่งเดียวที่แตกต่าง'
Guides & Insights

GLM 5.3 Prime: น้ำหนัก GLM-5.3 ชุดเดิม ในราคาสูงเป็นสองเท่าของเรตการ์ดพอดี

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

GLM 5.3 Prime มีค่าใช้จ่าย $2.80 ต่อหนึ่งล้านโทเคนอินพุต และ $8.80 ต่อหนึ่งล้านโทเคนเอาต์พุต GLM-5.3 โมเดลที่มันทำงานอยู่บนนั้น มีค่าใช้จ่าย $1.40 และ $4.40 นั่นไม่ใช่ความต่างจากการปัดเศษหรือส่วนต่างจากโปรโมชัน — มันคือ 2.0 เท่าพอดีในทั้งสองบรรทัด และเป็นสิ่งเดียวที่สองผลิตภัณฑ์นี้ต่างกัน GLM 5.3 Prime ไม่ใช่โมเดลใหม่ มันใช้ค่าน้ำหนักของ GLM-5.3 เอง ชุดที่ Z.ai เปิดเมื่อวันที่ 25 สิงหาคม 2026 อยู่เบื้องหลังสแต็กการให้บริการที่เร็วกว่า ตัว GLM-5.3 เองถูกประกาศเมื่อวันที่ 14 สิงหาคม 2026 และเข้าสู่ API เมื่อวันที่ 18 สิงหาคม ไม่มีอะไรเกี่ยวกับโมเดลพื้นฐานที่เปลี่ยนแปลงไปเมื่อ ID Prime ปรากฏขึ้นในช่วงปลายเดือนกันยายน สิ่งที่เปลี่ยนไปคือมีคนติดป้ายราคาป้ายที่สองให้กับมัน

ถ้าคุณกำลังอ่านสิ่งนี้เพราะรายการโมเดลแสดงชื่อที่ไม่คุ้นเคยข้าง ๆ ชื่อที่คุ้นเคย คำตอบสั้น ๆ คือ คุณกำลังมองระดับการให้บริการ ไม่ใช่การเปิดตัว คำตอบแบบยาวกว่านั้นคุ้มค่าสองนาที เพราะการคำนวณนั้นลงตัวผิดปกติ และที่มาที่ไปก็คลุมเครือผิดปกติ

"Prime" tier คืออะไร ในหนึ่งย่อหน้า

ระดับการให้บริการคือรหัสผลิตภัณฑ์ตัวที่สองที่ชี้ไปยังเวตชุดเดียวกัน ปรับจูนเพื่ออัตราการประมวลผลแทนที่จะปรับเพื่อต้นทุน คุณไม่ได้โมเดลที่ใหญ่ขึ้น คอนเท็กซ์ที่ยาวขึ้น โหมดการให้เหตุผลที่ดีขึ้น หรือพื้นผิวเครื่องมือที่กว้างขึ้น คุณได้โทเคนออกไปเร็วขึ้น และคุณจ่ายสำหรับสิทธิพิเศษนั้นต่อทุกโทเคน แทนที่จะจ่ายตามเวลาจริงบนนาฬิกาที่คุณประหยัดไป การแลกเปลี่ยนนี้มีจริงและบางครั้งก็ถูกต้อง — ลูปเอเจนต์หลายขั้นตอนที่เรียกตามลำดับสิบครั้งได้ประโยชน์จริงจากการที่แต่ละครั้งส่งคืนผลเร็วขึ้น — แต่มันเป็นการซื้อความหน่วง ไม่ใช่การซื้อขีดความสามารถ และควรถูกกำหนดราคาในฐานะเช่นนั้น

คำบรรยายของผู้จำหน่ายสำหรับ GLM 5.3 Prime พูดตรง ๆ ถึงส่วนที่ปกติไม่พูดกัน: มันคือ "ตัวแปรความเร็วสูงของ GLM-5.3 จาก Z.ai ซึ่งสืบทอดความสามารถทั้งหมดไว้ พร้อมทั้งมอบอัตราการส่งออก 1.5–2 เท่าผ่านการเร่งความเร็วการอนุมาน" ความสามารถทั้งหมด หน้าต่างบริบทเดียวกันที่ 1,000,000 โทเค็น เพดานเอาต์พุต 131,072 โทเค็นเท่ากัน ข้อความเข้า ข้อความออก การให้เหตุผลเป็นสิ่งจำเป็น โดยมี low, high และ max เป็นระดับความพยายาม และ max เป็นค่าเริ่มต้น — เหมือนกับโมเดลฐานทุกประการ

การ์ดอัตราค่าใช้จ่าย แบบเคียงข้างกัน

• อินพุต — GLM 5.3 Prime $2.80 ต่อ 1M เทียบกับ GLM-5.3 $1.40 ต่อ 1M
• เอาต์พุต — GLM 5.3 Prime $8.80 ต่อ 1M เทียบกับ GLM-5.3 $4.40 ต่อ 1M
• อินพุตแคช — GLM 5.3 Prime $0.56 ต่อ 1M เทียบกับ GLM-5.3 $0.26 ต่อ 1M
• ตัวคูณ — 2.0× ในทั้งสามบรรทัด ในทั้งสองทิศทาง
• บริบท — 1,000,000 โทเคนทั้งสอง
• เอาต์พุตสูงสุด — 131,072 โทเคนทั้งสอง
• การให้เหตุผล — บังคับใช้กับทั้งสอง มีสามระดับความพยายามเหมือนกัน และค่าเริ่มต้นเหมือนกัน

รายการแคชคือสิ่งที่คนมักมองข้าม การอ่านแคชคือโทเคนที่ถูกที่สุดที่คุณจะซื้อได้จากโมเดลระดับแนวหน้า และเป็นจุดที่งานของเอเจนต์ใช้จ่ายงบประมาณจริง ๆ — พรอมป์ตระบบ คำจำกัดความของเครื่องมือ และบันทึกการสนทนาที่ค่อย ๆ ยาวขึ้น ถูกอ่านซ้ำในทุกเทิร์น การเพิ่มอัตราแคชเป็นสองเท่าจะทำให้รายการที่ใหญ่ที่สุดในเซสชันเอเจนต์ที่ยาวนานเพิ่มเป็นสองเท่า ซึ่งหมายความว่าค่าพรีเมียมที่แท้จริงของงานจริงใกล้เคียง 2× มากกว่าที่ส่วนต่างราคาแบบพาดหัวสำหรับโทเคนอินพุตใหม่ชี้ให้เห็น หากคุณหวังว่าเลนเร็วจะถูกกว่าในทางปฏิบัติเพราะคุณแคชอย่างเชิงรุก มันไม่เป็นเช่นนั้น

ใครเป็นคนขายมันจริงๆ

นี่คือจุดที่รายการเริ่มน่าสนใจ และเป็นจุดที่ผู้อ่านที่รอบคอบควรอ่านให้ช้าลง เอกสารของ Z.ai เอง หน้าภาพรวมโมเดล และหน้าราคาที่เผยแพร่ ไม่ได้ระบุ SKU Prime ไว้เลย หากคุณค้นหา model ID ของผู้ขายรายนี้ด้วย glm-5.3-primeก็จะไม่พบอะไรเลย ระดับความเร็ว (speed tier) ของ Z.ai เองนั้นเป็นผลิตภัณฑ์อีกตัวหนึ่งบนสายผลิตภัณฑ์อื่นโดยสิ้นเชิง — GLM-5.3-FlashX ซึ่งอยู่ในตระกูล Flash ที่ราคาถูกกว่า เปิดตัวเมื่อวันที่ 18 กันยายน 2026 และมีราคาอยู่ที่ $0.37 และ $1.25 ต่อล้านโทเคน

ดังนั้น Prime จึงเป็นผลิตภัณฑ์ฝั่งแพลตฟอร์มที่สร้างบนเวตของ Z.ai รายละเอียดสองอย่างชี้ให้เห็นว่าเป็นแพลตฟอร์มของใคร อย่างแรกคือถ้อยคำ "1.5–2× output throughput" ซึ่งเป็นถ้อยคำเดียวกับที่ผู้ให้บริการคลาวด์รายใหญ่ใช้สำหรับโหมดเสิร์ฟแบบเร่งความเร็วของตัวเอง — โหมดที่คุณเปิดใช้โดยเปลี่ยน model ID โดยที่ความสามารถและขีดจำกัดการใช้งานไม่เปลี่ยนแปลงอย่างชัดเจน อย่างที่สองคือรายการดังกล่าวระบุผู้ให้บริการต้นทางเพียงรายเดียวที่อยู่เบื้องหลัง endpoint ผู้ให้บริการรายเดียวที่อยู่เบื้องหลัง SKU ระดับเร็วไม่ใช่วิธีที่โมเดล open-weights ถูกให้บริการ แต่เป็นภาพของ deployment แบบเร่งความเร็วของแพลตฟอร์มเองเมื่อมองจากภายนอก

ไม่มีสิ่งใดในนั้นทำให้ GLM 5.3 Prime เป็นผลิตภัณฑ์ที่แย่ แต่สิ่งเหล่านั้นทำให้มันเป็นผลิตภัณฑ์ที่มีซัพพลายเออร์เพียงรายเดียว ซึ่งเป็นคำถามด้านความยืดหยุ่นที่คุณควรถามก่อนจะให้ทราฟฟิกโปรดักชันวิ่งผ่านมัน

คำกล่าวอ้างเรื่องความเร็วนั้นมีค่าแค่ไหน

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-FlashX - the two speed tiers'. The GLM 5.3 Prime column reads 'Input / 1M: $2.80', 'Output / 1M: $8.80', 'Cached input: $0.56', 'Runs on: GLM-5.3 weights', 'Weights: none, hosted lane', 'Price vs GLM-5.3: 2.0x'; the GLM-5.3-FlashX column reads 'Input / 1M: $0.37', 'Output / 1M: $1.25', 'Cached input: not listed', 'Runs on: Flash family weights', 'Weights: none, hosted lane', 'Price vs GLM-5.3: under 0.3x'; the footer reads 'Both are serving tiers, not models. Prime per its tier listing; FlashX per the vendor rate card.'

ตัวเลข 1.5–2× เป็นคำกล่าวอ้างด้านทรูพุตที่วัดภายใต้เงื่อนไขของผู้ขายเอง และทรูพุตเป็นเมตริกที่ไวต่อเงื่อนไขเหล่านั้นมากที่สุด จำนวนโทเคนเอาต์พุตต่อวินาทีบนแคชอุ่นที่มีพรอมป์ต์สั้นและคลัสเตอร์ที่ไม่ได้ใช้งาน ไม่ใช่ตัวเลขที่เอเจนต์บริบทยาวพบเห็น การวัดอิสระของโมเดลฐานให้ค่า GLM-5.3 ที่ประมาณ 61 โทเคนเอาต์พุตต่อวินาที และ GLM-5.3-Flash ที่ราว 46 บนชุดข้อมูลที่ค่าเฉลี่ยของคลาสอยู่ที่ 67 — ดังนั้นเลนที่ถูกกว่าก็ช้ากว่าด้วย ซึ่งตรงข้ามกับสิ่งที่ชื่อสื่อ นั่นคือค่ามัธยฐานจากชุดประเมินมาตรฐาน ไม่ใช่ค่าสูงสุด

ยังมีต้นทุนที่ละเอียดอ่อนกว่านั้นอีกด้วย ค่าเริ่มต้นของความพยายามในการให้เหตุผลสำหรับทั้งสอง ID คือ maxซึ่งเป็นค่าที่ทำให้เกิดสายความคิดที่ยาวที่สุด ความเร็วและความละเอียดของคำตอบในที่นี้ดึงไปในทิศทางตรงกันข้าม: ระดับที่เร็วซึ่งให้เหตุผลที่ความยาวสูงสุดก็ยังอาจช้าตั้งแต่ต้นจนจบเมื่อเจอปัญหายาก เพราะคอขวดคือจำนวนโทเค็นที่โมเดลตัดสินใจจะสร้าง ไม่ใช่อัตราที่มันสร้างโทเค็นเหล่านั้น หากภาระงานของคุณเน้นการให้เหตุผล ให้ลดไปที่ high หรือ lowก่อนที่คุณจะจ่าย 2× เพื่อการเร่งความเร็ว — ระดับความพยายามจะส่งผลต่อเวลาแฝงของคุณมากกว่าระดับการให้บริการ

สามวิธีในการซื้อรุ่นเดียวกัน

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text input and text output with tools, JSON and reasoning, a 2026-08-18 date beside 'Public benchmarks by Z.ai', a p50 time to first token of 3.91 seconds, and a stat strip reading $1.26 input, $3.96 output, 3.91 s p50 TTFT, 10.00 s p95 TTFT and 1,733.9M tokens.

GLM-5.3 ตอนนี้มีอยู่ในสามรูปแบบที่ซื้อได้ และพวกมันไม่ใช่สามโมเดล:

• GLM-5.3 ในราคา $1.40 / $4.40 — เรตการ์ดพื้นฐาน ความสามารถเต็มรูปแบบ เวอร์ชันที่มีการเผยแพร่น้ำหนักแบบเปิดให้คุณโฮสต์เองได้
• GLM 5.3 Prime ในราคา $2.80 / $8.80 — น้ำหนักตัวเดียวกันผ่านสแต็กที่เร่งความเร็วแล้ว ผู้ให้บริการต้นทางรายเดียว ไม่มีการส่งมอบน้ำหนัก
• GLM-5.3-FlashX ในราคา $0.37 / $1.25 — ไม่ใช่ GLM-5.3 เลย แต่เป็นระดับความเร็วบนตระกูล Flash ที่ราคาถูกกว่า และเป็นวิธีซื้อความหน่วงที่ถูกที่สุดโดยห่างไกล

บรรทัดที่สามคือบรรทัดที่คุ้มค่าจะจ้องมอง หากสิ่งที่คุณต้องการจริง ๆ คือโทเค็นที่เร็วขึ้น และคุณยืดหยุ่นว่าจะได้โทเค็นเหล่านั้นจาก GLM ตัวไหน FlashX มอบการเร่งความเร็วบนโมเดลที่ราคาถูกอยู่แล้วประมาณหนึ่งในสิบของรุ่นเรือธง ในราคาน้อยกว่าครึ่งหนึ่งของค่าใช้จ่ายของรุ่นเรือธงแบบไม่เร่งความเร็ว Prime จะสมเหตุสมผลก็ต่อเมื่อคุณต้องการคุณภาพการให้เหตุผลของ GLM-5.3 โดยเฉพาะ และต้องการมันเร็วขึ้นโดยเฉพาะ

เรื่องนี้อยู่ตรงไหนในฝั่งของเรา

A tall screenshot of the same OrcaRouter model page for GLM 5.3 (captured September 24, 2026) showing the PRICING block reading $1.26 per 1M input tokens, $3.96 per 1M output tokens and $0.234 per 1M cache read in USD, a token and cost estimator, and a PERFORMANCE panel for the last 7 days reading p50 TTFT 3.91 s, output speed 73.6 tokens per second, p95 TTFT 10.00 s and an error rate of 0.14%.

เราควรพูดให้ชัดเจนในเรื่องหนึ่ง: OrcaRouter ไม่ได้โฮสต์ GLM 5.3 Prime และเราไม่ได้โฮสต์ GLM-5.3-FlashX เช่นกัน หน้าของโมเดลทั้งสองส่งคืน 404 บนเว็บไซต์ของเรา หากคุณต้องการระดับเร่งความเร็ว คุณจะต้องซื้อจากแพลตฟอร์มที่ขายมัน หรือจาก API ของผู้ขายเองสำหรับโมเดลพื้นฐาน

สิ่งที่เราโฮสต์คือ GLM-5.3 และ GLM-5.3-Flash ในราคาตามที่ผู้ให้บริการประกาศไว้ โดยเราบวกเพิ่มเป็นศูนย์ — ราคา $1.40 และ $4.40 เดียวกับที่คุณเห็นบนตารางราคาของ Z.ai เอง ส่งผ่านไปตามเดิม ไม่ได้ตั้งราคาใหม่เรื่องนี้สำคัญกว่าที่ฟังดู สำหรับโมเดลที่ราคาขยับไปแล้วสองครั้งในหกสัปดาห์ เพราะเราไม่บวกส่วนต่าง ราคาที่ผู้ขายเปลี่ยนแปลงจึงมีผลฝั่งเราภายในวันเดียวกับที่มีผลฝั่งเขา โดยไม่ต้องทำ migration หรือเปิดตั๋วซัพพอร์ต ทั้งสอง ID อยู่ภายใต้ API key เดียวกัน ร่วมกับโมเดลอื่นอีกกว่า 200 ตัว ดังนั้นการทำ A/B ระหว่าง GLM-5.3 กับ GLM-5.3-Flash จึงเป็นแค่การเปลี่ยนชื่อโมเดลในบรรทัดเดียว ไม่ใช่สัญญาฉบับที่สอง และ ระบบ failover อัตโนมัติช่วยคุ้มครองคุณหากผู้ให้บริการ upstream รายใดรายหนึ่งมีประสิทธิภาพลดลง — ซึ่งเป็นความเสี่ยงเฉพาะที่มาพร้อมกับ fast tier ที่พึ่งพาผู้ให้บริการรายเดียว

คุณควรจ่าย 2× หรือไม่

จ่ายไปเลย ถ้ามนุษย์หรือบริการอัปสตรีมกำลังถูกบล็อกรอการตอบกลับ งานของคุณมีข้อจำกัดด้านแลเทนซีมากกว่าด้านทรูพุต และคุณยืนยันแล้วว่าความพยายามในการใช้เหตุผลเป็นตัวขับเคลื่อนที่แท้จริงของแลเทนซีของคุณ อย่าจ่าย ถ้าคุณกำลังรันการสร้างแบบกลุ่มข้ามคืน ถ้าปริมาณของคุณสูงพอที่ค่าพรีเมียมต่อโทเคน 2 เท่าจะแพงเกินกว่าประหยัดเวลาจริงที่คุณได้ หรือถ้าคุณหวังว่าชั้นนี้จะแอบเป็นโมเดลที่ดีกว่า มันไม่ใช่ มันคือ GLM-5.3 ที่มีนาฬิกาจับเวลาเดินอยู่ และนาฬิกาจับเวลาคิดเงินตามโทเคน

คำอธิบายที่ตรงไปตรงมาสำหรับตระกูล GLM-5.3 ทั้งหมดในตอนนี้ก็คือ Z.ai เปิดตัวโมเดลเพียงหนึ่งรุ่นในเดือนสิงหาคม และตลาดใช้เดือนกันยายนไปกับการนำมันมาแพ็กเกจใหม่ในราคาที่แตกต่างกันสี่แบบ GLM 5.3 Prime เป็นแพ็กเกจที่แพงที่สุดในบรรดาแพ็กเกจเหล่านั้น อีกทั้งยังเป็นรุ่นที่มีร่องรอยเอกสารน้อยที่สุดด้วย เพราะบริษัทที่ชื่ออยู่บนเวตไม่ได้ระบุรายการนี้ไว้ นั่นไม่ใช่เหตุผลที่จะหลีกเลี่ยงมัน แต่เป็นเหตุผลที่ทำให้คุณต้องรู้ให้ชัดเจนว่ากำลังซื้ออะไรอยู่ ก่อนจะนำมันเข้าสู่เส้นทางโปรดักชัน

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube