
GLM 5.3 Prime: น้ำหนัก GLM-5.3 ชุดเดิม ในราคาสูงเป็นสองเท่าของเรตการ์ดพอดี
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 177 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1323 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
GLM 5.3 Prime มีค่าใช้จ่าย $2.80 ต่อหนึ่งล้านโทเคนอินพุต และ $8.80 ต่อหนึ่งล้านโทเคนเอาต์พุต GLM-5.3 โมเดลที่มันทำงานอยู่บนนั้น มีค่าใช้จ่าย $1.40 และ $4.40 นั่นไม่ใช่ความต่างจากการปัดเศษหรือส่วนต่างจากโปรโมชัน — มันคือ 2.0 เท่าพอดีในทั้งสองบรรทัด และเป็นสิ่งเดียวที่สองผลิตภัณฑ์นี้ต่างกัน GLM 5.3 Prime ไม่ใช่โมเดลใหม่ มันใช้ค่าน้ำหนักของ GLM-5.3 เอง ชุดที่ Z.ai เปิดเมื่อวันที่ 25 สิงหาคม 2026 อยู่เบื้องหลังสแต็กการให้บริการที่เร็วกว่า ตัว GLM-5.3 เองถูกประกาศเมื่อวันที่ 14 สิงหาคม 2026 และเข้าสู่ API เมื่อวันที่ 18 สิงหาคม ไม่มีอะไรเกี่ยวกับโมเดลพื้นฐานที่เปลี่ยนแปลงไปเมื่อ ID Prime ปรากฏขึ้นในช่วงปลายเดือนกันยายน สิ่งที่เปลี่ยนไปคือมีคนติดป้ายราคาป้ายที่สองให้กับมัน
ถ้าคุณกำลังอ่านสิ่งนี้เพราะรายการโมเดลแสดงชื่อที่ไม่คุ้นเคยข้าง ๆ ชื่อที่คุ้นเคย คำตอบสั้น ๆ คือ คุณกำลังมองระดับการให้บริการ ไม่ใช่การเปิดตัว คำตอบแบบยาวกว่านั้นคุ้มค่าสองนาที เพราะการคำนวณนั้นลงตัวผิดปกติ และที่มาที่ไปก็คลุมเครือผิดปกติ
"Prime" tier คืออะไร ในหนึ่งย่อหน้า
ระดับการให้บริการคือรหัสผลิตภัณฑ์ตัวที่สองที่ชี้ไปยังเวตชุดเดียวกัน ปรับจูนเพื่ออัตราการประมวลผลแทนที่จะปรับเพื่อต้นทุน คุณไม่ได้โมเดลที่ใหญ่ขึ้น คอนเท็กซ์ที่ยาวขึ้น โหมดการให้เหตุผลที่ดีขึ้น หรือพื้นผิวเครื่องมือที่กว้างขึ้น คุณได้โทเคนออกไปเร็วขึ้น และคุณจ่ายสำหรับสิทธิพิเศษนั้นต่อทุกโทเคน แทนที่จะจ่ายตามเวลาจริงบนนาฬิกาที่คุณประหยัดไป การแลกเปลี่ยนนี้มีจริงและบางครั้งก็ถูกต้อง — ลูปเอเจนต์หลายขั้นตอนที่เรียกตามลำดับสิบครั้งได้ประโยชน์จริงจากการที่แต่ละครั้งส่งคืนผลเร็วขึ้น — แต่มันเป็นการซื้อความหน่วง ไม่ใช่การซื้อขีดความสามารถ และควรถูกกำหนดราคาในฐานะเช่นนั้น
คำบรรยายของผู้จำหน่ายสำหรับ GLM 5.3 Prime พูดตรง ๆ ถึงส่วนที่ปกติไม่พูดกัน: มันคือ "ตัวแปรความเร็วสูงของ GLM-5.3 จาก Z.ai ซึ่งสืบทอดความสามารถทั้งหมดไว้ พร้อมทั้งมอบอัตราการส่งออก 1.5–2 เท่าผ่านการเร่งความเร็วการอนุมาน" ความสามารถทั้งหมด หน้าต่างบริบทเดียวกันที่ 1,000,000 โทเค็น เพดานเอาต์พุต 131,072 โทเค็นเท่ากัน ข้อความเข้า ข้อความออก การให้เหตุผลเป็นสิ่งจำเป็น โดยมี low, high และ max เป็นระดับความพยายาม และ max เป็นค่าเริ่มต้น — เหมือนกับโมเดลฐานทุกประการ
การ์ดอัตราค่าใช้จ่าย แบบเคียงข้างกัน
• อินพุต — GLM 5.3 Prime $2.80 ต่อ 1M เทียบกับ GLM-5.3 $1.40 ต่อ 1M
• เอาต์พุต — GLM 5.3 Prime $8.80 ต่อ 1M เทียบกับ GLM-5.3 $4.40 ต่อ 1M
• อินพุตแคช — GLM 5.3 Prime $0.56 ต่อ 1M เทียบกับ GLM-5.3 $0.26 ต่อ 1M
• ตัวคูณ — 2.0× ในทั้งสามบรรทัด ในทั้งสองทิศทาง
• บริบท — 1,000,000 โทเคนทั้งสอง
• เอาต์พุตสูงสุด — 131,072 โทเคนทั้งสอง
• การให้เหตุผล — บังคับใช้กับทั้งสอง มีสามระดับความพยายามเหมือนกัน และค่าเริ่มต้นเหมือนกัน
รายการแคชคือสิ่งที่คนมักมองข้าม การอ่านแคชคือโทเคนที่ถูกที่สุดที่คุณจะซื้อได้จากโมเดลระดับแนวหน้า และเป็นจุดที่งานของเอเจนต์ใช้จ่ายงบประมาณจริง ๆ — พรอมป์ตระบบ คำจำกัดความของเครื่องมือ และบันทึกการสนทนาที่ค่อย ๆ ยาวขึ้น ถูกอ่านซ้ำในทุกเทิร์น การเพิ่มอัตราแคชเป็นสองเท่าจะทำให้รายการที่ใหญ่ที่สุดในเซสชันเอเจนต์ที่ยาวนานเพิ่มเป็นสองเท่า ซึ่งหมายความว่าค่าพรีเมียมที่แท้จริงของงานจริงใกล้เคียง 2× มากกว่าที่ส่วนต่างราคาแบบพาดหัวสำหรับโทเคนอินพุตใหม่ชี้ให้เห็น หากคุณหวังว่าเลนเร็วจะถูกกว่าในทางปฏิบัติเพราะคุณแคชอย่างเชิงรุก มันไม่เป็นเช่นนั้น
ใครเป็นคนขายมันจริงๆ
นี่คือจุดที่รายการเริ่มน่าสนใจ และเป็นจุดที่ผู้อ่านที่รอบคอบควรอ่านให้ช้าลง เอกสารของ Z.ai เอง หน้าภาพรวมโมเดล และหน้าราคาที่เผยแพร่ ไม่ได้ระบุ SKU Prime ไว้เลย หากคุณค้นหา model ID ของผู้ขายรายนี้ด้วย glm-5.3-primeก็จะไม่พบอะไรเลย ระดับความเร็ว (speed tier) ของ Z.ai เองนั้นเป็นผลิตภัณฑ์อีกตัวหนึ่งบนสายผลิตภัณฑ์อื่นโดยสิ้นเชิง — GLM-5.3-FlashX ซึ่งอยู่ในตระกูล Flash ที่ราคาถูกกว่า เปิดตัวเมื่อวันที่ 18 กันยายน 2026 และมีราคาอยู่ที่ $0.37 และ $1.25 ต่อล้านโทเคน
ดังนั้น Prime จึงเป็นผลิตภัณฑ์ฝั่งแพลตฟอร์มที่สร้างบนเวตของ Z.ai รายละเอียดสองอย่างชี้ให้เห็นว่าเป็นแพลตฟอร์มของใคร อย่างแรกคือถ้อยคำ "1.5–2× output throughput" ซึ่งเป็นถ้อยคำเดียวกับที่ผู้ให้บริการคลาวด์รายใหญ่ใช้สำหรับโหมดเสิร์ฟแบบเร่งความเร็วของตัวเอง — โหมดที่คุณเปิดใช้โดยเปลี่ยน model ID โดยที่ความสามารถและขีดจำกัดการใช้งานไม่เปลี่ยนแปลงอย่างชัดเจน อย่างที่สองคือรายการดังกล่าวระบุผู้ให้บริการต้นทางเพียงรายเดียวที่อยู่เบื้องหลัง endpoint ผู้ให้บริการรายเดียวที่อยู่เบื้องหลัง SKU ระดับเร็วไม่ใช่วิธีที่โมเดล open-weights ถูกให้บริการ แต่เป็นภาพของ deployment แบบเร่งความเร็วของแพลตฟอร์มเองเมื่อมองจากภายนอก
ไม่มีสิ่งใดในนั้นทำให้ GLM 5.3 Prime เป็นผลิตภัณฑ์ที่แย่ แต่สิ่งเหล่านั้นทำให้มันเป็นผลิตภัณฑ์ที่มีซัพพลายเออร์เพียงรายเดียว ซึ่งเป็นคำถามด้านความยืดหยุ่นที่คุณควรถามก่อนจะให้ทราฟฟิกโปรดักชันวิ่งผ่านมัน
คำกล่าวอ้างเรื่องความเร็วนั้นมีค่าแค่ไหน

ตัวเลข 1.5–2× เป็นคำกล่าวอ้างด้านทรูพุตที่วัดภายใต้เงื่อนไขของผู้ขายเอง และทรูพุตเป็นเมตริกที่ไวต่อเงื่อนไขเหล่านั้นมากที่สุด จำนวนโทเคนเอาต์พุตต่อวินาทีบนแคชอุ่นที่มีพรอมป์ต์สั้นและคลัสเตอร์ที่ไม่ได้ใช้งาน ไม่ใช่ตัวเลขที่เอเจนต์บริบทยาวพบเห็น การวัดอิสระของโมเดลฐานให้ค่า GLM-5.3 ที่ประมาณ 61 โทเคนเอาต์พุตต่อวินาที และ GLM-5.3-Flash ที่ราว 46 บนชุดข้อมูลที่ค่าเฉลี่ยของคลาสอยู่ที่ 67 — ดังนั้นเลนที่ถูกกว่าก็ช้ากว่าด้วย ซึ่งตรงข้ามกับสิ่งที่ชื่อสื่อ นั่นคือค่ามัธยฐานจากชุดประเมินมาตรฐาน ไม่ใช่ค่าสูงสุด
ยังมีต้นทุนที่ละเอียดอ่อนกว่านั้นอีกด้วย ค่าเริ่มต้นของความพยายามในการให้เหตุผลสำหรับทั้งสอง ID คือ maxซึ่งเป็นค่าที่ทำให้เกิดสายความคิดที่ยาวที่สุด ความเร็วและความละเอียดของคำตอบในที่นี้ดึงไปในทิศทางตรงกันข้าม: ระดับที่เร็วซึ่งให้เหตุผลที่ความยาวสูงสุดก็ยังอาจช้าตั้งแต่ต้นจนจบเมื่อเจอปัญหายาก เพราะคอขวดคือจำนวนโทเค็นที่โมเดลตัดสินใจจะสร้าง ไม่ใช่อัตราที่มันสร้างโทเค็นเหล่านั้น หากภาระงานของคุณเน้นการให้เหตุผล ให้ลดไปที่ high หรือ lowก่อนที่คุณจะจ่าย 2× เพื่อการเร่งความเร็ว — ระดับความพยายามจะส่งผลต่อเวลาแฝงของคุณมากกว่าระดับการให้บริการ
สามวิธีในการซื้อรุ่นเดียวกัน

GLM-5.3 ตอนนี้มีอยู่ในสามรูปแบบที่ซื้อได้ และพวกมันไม่ใช่สามโมเดล:
• GLM-5.3 ในราคา $1.40 / $4.40 — เรตการ์ดพื้นฐาน ความสามารถเต็มรูปแบบ เวอร์ชันที่มีการเผยแพร่น้ำหนักแบบเปิดให้คุณโฮสต์เองได้
• GLM 5.3 Prime ในราคา $2.80 / $8.80 — น้ำหนักตัวเดียวกันผ่านสแต็กที่เร่งความเร็วแล้ว ผู้ให้บริการต้นทางรายเดียว ไม่มีการส่งมอบน้ำหนัก
• GLM-5.3-FlashX ในราคา $0.37 / $1.25 — ไม่ใช่ GLM-5.3 เลย แต่เป็นระดับความเร็วบนตระกูล Flash ที่ราคาถูกกว่า และเป็นวิธีซื้อความหน่วงที่ถูกที่สุดโดยห่างไกล
บรรทัดที่สามคือบรรทัดที่คุ้มค่าจะจ้องมอง หากสิ่งที่คุณต้องการจริง ๆ คือโทเค็นที่เร็วขึ้น และคุณยืดหยุ่นว่าจะได้โทเค็นเหล่านั้นจาก GLM ตัวไหน FlashX มอบการเร่งความเร็วบนโมเดลที่ราคาถูกอยู่แล้วประมาณหนึ่งในสิบของรุ่นเรือธง ในราคาน้อยกว่าครึ่งหนึ่งของค่าใช้จ่ายของรุ่นเรือธงแบบไม่เร่งความเร็ว Prime จะสมเหตุสมผลก็ต่อเมื่อคุณต้องการคุณภาพการให้เหตุผลของ GLM-5.3 โดยเฉพาะ และต้องการมันเร็วขึ้นโดยเฉพาะ
เรื่องนี้อยู่ตรงไหนในฝั่งของเรา

เราควรพูดให้ชัดเจนในเรื่องหนึ่ง: OrcaRouter ไม่ได้โฮสต์ GLM 5.3 Prime และเราไม่ได้โฮสต์ GLM-5.3-FlashX เช่นกัน หน้าของโมเดลทั้งสองส่งคืน 404 บนเว็บไซต์ของเรา หากคุณต้องการระดับเร่งความเร็ว คุณจะต้องซื้อจากแพลตฟอร์มที่ขายมัน หรือจาก API ของผู้ขายเองสำหรับโมเดลพื้นฐาน
สิ่งที่เราโฮสต์คือ GLM-5.3 และ GLM-5.3-Flash ในราคาตามที่ผู้ให้บริการประกาศไว้ โดยเราบวกเพิ่มเป็นศูนย์ — ราคา $1.40 และ $4.40 เดียวกับที่คุณเห็นบนตารางราคาของ Z.ai เอง ส่งผ่านไปตามเดิม ไม่ได้ตั้งราคาใหม่เรื่องนี้สำคัญกว่าที่ฟังดู สำหรับโมเดลที่ราคาขยับไปแล้วสองครั้งในหกสัปดาห์ เพราะเราไม่บวกส่วนต่าง ราคาที่ผู้ขายเปลี่ยนแปลงจึงมีผลฝั่งเราภายในวันเดียวกับที่มีผลฝั่งเขา โดยไม่ต้องทำ migration หรือเปิดตั๋วซัพพอร์ต ทั้งสอง ID อยู่ภายใต้ API key เดียวกัน ร่วมกับโมเดลอื่นอีกกว่า 200 ตัว ดังนั้นการทำ A/B ระหว่าง GLM-5.3 กับ GLM-5.3-Flash จึงเป็นแค่การเปลี่ยนชื่อโมเดลในบรรทัดเดียว ไม่ใช่สัญญาฉบับที่สอง และ ระบบ failover อัตโนมัติช่วยคุ้มครองคุณหากผู้ให้บริการ upstream รายใดรายหนึ่งมีประสิทธิภาพลดลง — ซึ่งเป็นความเสี่ยงเฉพาะที่มาพร้อมกับ fast tier ที่พึ่งพาผู้ให้บริการรายเดียว
คุณควรจ่าย 2× หรือไม่
จ่ายไปเลย ถ้ามนุษย์หรือบริการอัปสตรีมกำลังถูกบล็อกรอการตอบกลับ งานของคุณมีข้อจำกัดด้านแลเทนซีมากกว่าด้านทรูพุต และคุณยืนยันแล้วว่าความพยายามในการใช้เหตุผลเป็นตัวขับเคลื่อนที่แท้จริงของแลเทนซีของคุณ อย่าจ่าย ถ้าคุณกำลังรันการสร้างแบบกลุ่มข้ามคืน ถ้าปริมาณของคุณสูงพอที่ค่าพรีเมียมต่อโทเคน 2 เท่าจะแพงเกินกว่าประหยัดเวลาจริงที่คุณได้ หรือถ้าคุณหวังว่าชั้นนี้จะแอบเป็นโมเดลที่ดีกว่า มันไม่ใช่ มันคือ GLM-5.3 ที่มีนาฬิกาจับเวลาเดินอยู่ และนาฬิกาจับเวลาคิดเงินตามโทเคน
คำอธิบายที่ตรงไปตรงมาสำหรับตระกูล GLM-5.3 ทั้งหมดในตอนนี้ก็คือ Z.ai เปิดตัวโมเดลเพียงหนึ่งรุ่นในเดือนสิงหาคม และตลาดใช้เดือนกันยายนไปกับการนำมันมาแพ็กเกจใหม่ในราคาที่แตกต่างกันสี่แบบ GLM 5.3 Prime เป็นแพ็กเกจที่แพงที่สุดในบรรดาแพ็กเกจเหล่านั้น อีกทั้งยังเป็นรุ่นที่มีร่องรอยเอกสารน้อยที่สุดด้วย เพราะบริษัทที่ชื่ออยู่บนเวตไม่ได้ระบุรายการนี้ไว้ นั่นไม่ใช่เหตุผลที่จะหลีกเลี่ยงมัน แต่เป็นเหตุผลที่ทำให้คุณต้องรู้ให้ชัดเจนว่ากำลังซื้ออะไรอยู่ ก่อนจะนำมันเข้าสู่เส้นทางโปรดักชัน
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
