การ์ดชื่อเรื่องแบบฮีโร่สำหรับ GLM-5.3-FlashX มีคำบรรยายใต้ชื่อว่า 'น้ำหนักโมเดลเดียวกัน ราคาเป็น 2.5 เท่า' พร้อมชิปที่ระบุข้อความ 'สูงสุด 200 tok/s (ผู้ขาย)', '$0.37 / $1.25 ต่อ 1M' และ 'บริบท 1M' และบรรทัดส่วนท้ายว่า 'ระดับการให้บริการเปิดตัวเมื่อวันที่ 18 กันยายน 2026'
Guides & Insights

GLM-5.3-FlashX วางจำหน่ายในราคา 2.5 เท่าของโมเดลที่มันรันอยู่

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ตัวเลขที่ต้องสังเกตไม่ใช่ 200 แต่คือ 2.5 เมื่อวันที่ 18 กันยายน 2026 Z.ai ได้นำ GLM-5.3-FlashXไปวางบน API ของตนที่ความเร็วสูงถึง 200 โทเคนเอาต์พุตต่อวินาที — และตั้งราคาไว้ที่ 2.5 เท่าของราคาที่เรียกเก็บสำหรับ GLM-5.3-Flash ซึ่งเป็นโมเดลแบบเปิดน้ำหนักที่ใช้เป็นฐานในการสร้าง ไม่มีอะไรเกี่ยวกับตัวโมเดลเองเปลี่ยนแปลงไป น้ำหนักเดียวกัน โครงข่ายหลักแบบ mixture-of-experts ขนาด 320B-A18B เดียวกัน คอนเท็กซ์ 1 ล้านโทเคนเดียวกัน การรองรับข้อความ รูปภาพ วิดีโอ และไฟล์แบบเนทีฟเหมือนกัน สิ่งที่เปลี่ยนไปคือสแต็กการให้บริการที่อยู่ข้างใต้มัน และสิ่งที่ Z.ai กำลังเรียกเก็บตอนนี้สำหรับสิทธิพิเศษในการได้อยู่ใกล้ส่วนหน้าของคิวมากขึ้น

นั่นทำให้ FlashX เป็นสิ่งที่หาได้ยากในตลาดโมเดล: การเปิดตัวที่ไม่มีเบนช์มาร์กแนบมาด้วยเลย Z.ai ไม่ได้เผยแพร่การประเมินที่จำเพาะต่อ FlashX เพราะไม่มีโมเดลใหม่ให้ประเมิน ตัวเลขขีดความสามารถทุกตัวที่ใช้กับ GLM-5.3-Flash ก็ใช้กับที่นี่ด้วย รวมถึงตัวเลขที่ดูไม่น่าประทับใจเท่ากับที่การรายงานข่าวการเปิดตัวชี้ให้เห็น

เดลต้าทั้งหมด ในรอบเดียว

• ความเร็ว — GLM-5.3-FlashX ทำได้สูงสุดถึง 200 tok/s (ค่าสูงสุดที่ผู้จำหน่ายรายงาน) เทียบกับ GLM-5.3-Flash ที่ 98 tok/s ตามที่วัดโดย Artificial Analysis บน API ของ Z.ai เองbr> • ราคา — $0.37 ต่อ 1M อินพุต / $1.25 ต่อ 1M เอาต์พุต เทียบกับ $0.15 / $0.50 ตามราคาที่ประกาศbr> • อินพุตที่แคชไว้ — $0.075 ต่อ 1M เทียบกับ $0.03 ต่อ 1Mbr> • ความฉลาด — เหมือนกันทุกประการ; FlashX สืบทอดคะแนนของโมเดลฐานbr> • บริบท — 1M โทเคนทั้งคู่br> • น้ำหนัก — GLM-5.3-Flash เป็นน้ำหนักเปิดภายใต้สัญญาอนุญาต MIT; FlashX เป็นระดับบริการแบบโฮสต์และไม่มีน้ำหนักของตัวเอง

200 กับ 98 ไม่ใช่ตัวเลขประเภทเดียวกัน และก็ควรพูดตรง ๆ เรื่องนี้ ตัวหนึ่งเป็นเพดานที่ผู้ขายบอกว่าบริการสามารถไปถึงได้ อีกตัวคือสิ่งที่ห้องแล็บอิสระวัดได้จากคำขอจริงจำนวนมาก ผู้ใช้ที่กำลังตัดสินใจว่าจะจ่าย 2.5 เท่าหรือไม่ ควรถือว่า 200 เป็นโฆษณา และไปวัดเวิร์กโหลดของตัวเอง

A single-column scoreboard titled 'GLM-5.3-FlashX - the scoreboard' with rows reading 'Speed: up to 200 tok/s (vendor peak)', 'Measured speed: 98 tok/s (base model)', 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Context: 1M tokens' and 'Weights: hosted tier only', with a footer reading 'Speed is a vendor-reported peak; base-model figures per Artificial Analysis.'

สิ่งที่ Z.ai พูดนั่นแหละที่ทำงานอยู่

ความเร็วที่เพิ่มขึ้นนี้มาจากโครงสร้างพื้นฐาน ไม่ใช่คณิตศาสตร์ Z.ai อธิบายว่า FlashX ทำงานบนคลัสเตอร์ตัวเร่งความเร็วในประเทศจีนประมาณ 100,000 ตัว พร้อมสแต็กการให้บริการที่สร้างขึ้นโดยเฉพาะ: เอนจินอินเฟอเรนซ์ที่อิงกับ SGLang, การควอนไทซ์ W8A8, การควอนไทซ์แคชแบบผสม INT8/FP8/BF16 และสถาปัตยกรรมแบบแยกส่วน encode–prefill–decode ที่แยกขั้นตอนการเข้ารหัสมัลติโมดัลออกจากขั้นตอนการสร้างโทเค็น เพื่อไม่ให้ฝ่ายใดฝ่ายหนึ่งบล็อกอีกฝ่าย บริษัทรายงานปริมาณงานการให้บริการแบบ end-to-end ประมาณ 3 เท่าเมื่อเทียบกับค่าพื้นฐานเริ่มต้นบนฮาร์ดแวร์เดียวกัน และกล่าวว่าเอเจนต์ด้านโครงสร้างพื้นฐานที่ขับเคลื่อนด้วย GLM-5.3 ช่วยปรับแต่งสแต็กนี้

ทั้งหมดนั้นเป็นข้อมูลที่ผู้ขายรายงาน และจนถึงตอนนี้ยังไม่มีใครนอก Z.ai ทำซ้ำได้ มันยังเป็นส่วนที่น่าเชื่อถือที่สุดของเรื่องนี้อีกด้วย: การเปิดตัวระดับ serving-tier แบบนี้มักเป็นชัยชนะทางวิศวกรรม และตัวเลือกสถาปัตยกรรมที่อธิบายไว้ก็เป็นชุดเครื่องมือมาตรฐานสำหรับการเพิ่มประสิทธิภาพแบบนี้โดยเฉพาะ สิ่งที่มันไม่ใช่คือหลักประกัน ตัวเลข 200 tok/s เป็นค่าสูงสุด และค่าสูงสุดจะเกิดขึ้นกับเอาต์พุตสั้น แคชที่อุ่นอยู่แล้ว และคลัสเตอร์ที่ไม่แออัด คำขอแบบมัลติโมดัลบริบทยาว — ภาระงานที่ FlashX ถูกนำเสนออย่างชัดเจนว่าออกแบบมาเพื่อ — เป็นประเภทที่มีแนวโน้มจะทำได้น้อยที่สุด

ราคาคือการตัดสินใจด้านผลิตภัณฑ์ที่แท้จริง

ในราคาป้าย GLM-5.3-FlashX มีราคา $0.37 ต่อล้านโทเคนอินพุต และ $1.25 ต่อล้านโทเคนเอาต์พุต โดยอินพุตที่แคชไว้ราคา $0.075 และพื้นที่จัดเก็บแคชฟรีในช่วงเวลาจำกัด สำหรับราคาในประเทศของ Z.ai นั่นคือ ¥2 ขาเข้า และ ¥7 ขาออก เทียบกับ ¥0.8 และ ¥2.8 สำหรับ Flash รุ่นพื้นฐาน — อัตราส่วน 2.5 เท่าเดียวกัน โดยระบุเป็นสกุลเงินที่ Z.ai ใช้ขายในประเทศ

A screenshot of Z.ai's official pricing documentation page (captured September 19, 2026) showing the 'Latest Models' table with GLM-5.3-Flash at $0.15 input, $0.03 cached input and $0.50 output per 1M tokens, and GLM-5.3-FlashX at $0.37, $0.075 and $1.25.

การคำนวณเริ่มทำให้รู้สึกไม่สบายใจอย่างรวดเร็วในทิศทางที่ผู้คนแทบไม่ค่อยตรวจสอบ โทเค็นเอาต์พุตคือจุดที่ตัวคูณกัดหนักที่สุด เพราะเอาต์พุตเป็นด้านที่มีค่าใช้จ่ายสูงบนทุกโมเดลในตระกูลนี้: เอาต์พุตของ FlashX เป็น 2.5 เท่าของเอาต์พุต Flash และเอาต์พุตก็มีราคาสูงกว่าอินพุตอยู่แล้วประมาณ 3.4 เท่าทั้งสองตัว งานแบบแบตช์ที่สร้างโทเค็นเอาต์พุตหนึ่งล้านโทเค็นต่อวันจะขยับจาก $0.50 เป็น $1.25 — ส่วนต่าง $274 ต่อปีสำหรับปริมาณงานที่ตามนิยามแล้วไม่มีใครรออยู่

จุดที่คุ้มค่าคือความหน่วงที่คุณสามารถเฉลี่ยต้นทุนได้ ลูปเอเจนต์ที่เรียกแบบลำดับต่อเนื่องสิบครั้งจะประหยัดส่วนต่างต่อการเรียกได้สิบเท่า และถ้าส่วนต่างนั้นคือสองหรือสามวินาที คุณก็ทวงเวลาจริงคืนมาได้ครึ่งนาทีต่อหนึ่งงาน สำหรับการเติมโค้ดแบบอินเทอร์แอกทีฟ บทสนทนาแบบเรียลไทม์ หรือไปป์ไลน์ใดก็ตามที่มนุษย์หรือบริการต้นทางต้องรอโทเคนถัดไป การแลกเปลี่ยนแบบนั้นมักถูกต้อง Z.ai ยังระบุชัดเจนว่าโมเดลนี้ยังไม่อยู่ใน GLM Coding Plan ของตนในปัจจุบัน ผู้ใช้แบบสมัครสมาชิกจึงไม่ได้รับ FlashX รวมมาให้ — พวกเขาจ่ายต่อโทเคนสำหรับตัวนี้

หากสแต็กของคุณเชื่อมต่อกับผู้ให้บริการมากกว่าหนึ่งรายอยู่แล้ว การสลับก็เป็นเพียงการเปลี่ยนสตริงชื่อโมเดลเท่านั้น ไม่มีอะไรอื่น นี่คือเหตุผลเชิงปฏิบัติที่ทำให้ routing ดำรงอยู่ในฐานะเลเยอร์: บน OrcaRouter ราคาตามรายการของผู้ขายจะถูกส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นการเปลี่ยนแปลงราคาของ Z.ai หรือการลดราคาโปรโมชันจะสะท้อนในวันเดียวกับที่เกิดขึ้นต้นทาง และการมี endpoint เดียวที่อยู่หน้าโมเดลกว่า 200 ตัวหมายความว่าการประเมิน FlashX เทียบกับ Flash เป็นเพียงการแก้ไขคอนฟิก ไม่ใช่โปรเจกต์การผสานรวม การทำ failover ก็สำคัญเช่นกัน — serving tier ใหม่เอี่ยมบนคลัสเตอร์ใหม่เอี่ยมเป็น dependency ประเภทที่ควรมี fallback อยู่ข้างหลังพอดี

สิ่งที่ยังไม่เปลี่ยนแปลง และเหตุใดจึงสำคัญยิ่งกว่า

FlashX สืบทอดโปรไฟล์ความสามารถของ GLM-5.3-Flash มาแบบเต็มรูปแบบ และโปรไฟล์นั้นแคบกว่าที่การรายงานข่าวเปิดตัวบอกเป็นนัย เอกสารของ Z.ai จัดให้โมเดลฐานอยู่ระดับเดียวกับ Claude Opus 4.8 บน Artificial Analysis Intelligence Index ขณะที่ Artificial Analysis เองในปัจจุบันจัดอันดับ GLM-5.3-Flash ไว้ที่ 42 บนดัชนีนั้น ซึ่งวัดบน API ของ Z.ai เอง — เป็นคะแนนที่แข็งแกร่ง สูงกว่าค่ามัธยฐานของโมเดล open-weight ในคลาสเดียวกันมาก และยังห่างไกลจากระดับฟรอนเทียร์ที่การเปรียบเทียบของผู้ขายชี้ให้เห็น ข้อความทั้งสองเป็นความจริง เพียงแต่ไม่ใช่ข้อความเดียวกัน และช่องว่างระหว่างสองข้อความนั้นคือเหตุผลที่บล็อกนี้ติดป้ายตัวเลขของผู้ขายว่าเป็นตัวเลขของผู้ขาย

โมเดลฐานนี้มีความสามารถจริงและเปิดกว้างจริง GLM-5.3-Flash เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 ภายใต้สัญญาอนุญาต MIT พร้อมน้ำหนักบน Hugging Face และการออกแบบ attention แบบไฮบริด linear-plus-sparse ของมัน — การบีบอัด IndexPool, hyper-connections แบบมีข้อจำกัดบน manifold — ลดการคำนวณ attention ลงประมาณ 3 เท่า และ KV cache ประมาณ 4.4 เท่า เมื่อเทียบกับ GLM-5.3 ซึ่งเป็นสิ่งที่ทำให้โมเดล 320B ที่มีพารามิเตอร์ที่ใช้งานจริง 18B มีต้นทุนต่ำพอที่จะให้บริการได้เลย เอาต์พุตจำกัดไว้ที่ 131,072 โทเคน มันเร็วเมื่อเทียบกับราคา ไม่ได้เร็วเมื่อเทียบกับระดับเดียวกัน: Artificial Analysis วัดได้ 98 โทเคนต่อวินาที เทียบกับค่ามัธยฐานของคู่แข่งที่สูงกว่า 70 แต่ต่ำกว่าโมเดลที่เร็วที่สุดในกระดาน

FlashX ไม่ได้เปลี่ยนแปลงสิ่งเหล่านั้นเลย มันเปลี่ยนระยะเวลาที่คุณต้องรอสำหรับมัน

การอ่านอย่างตรงไปตรงมา

ซื้อ FlashX หากงานของคุณถูกจำกัดด้วยความหน่วง (latency-bound) และคุณตัดสินใจแล้วว่า GLM-5.3-Flash คือโมเดลที่ใช่สำหรับคุณ — ไม่ว่าจะเป็นเอเจนต์ที่เรียกใช้งานต่อกันเป็นทอด ๆ เอดิเตอร์ที่เติมข้อความให้อัตโนมัติแบบอินไลน์ หรืออินเทอร์เฟซเสียงหรือแชตที่ "ช่วงเว้นจังหวะ" คือหัวใจของผลิตภัณฑ์ จงใช้ GLM-5.3-Flash ต่อไป หรือใช้น้ำหนักโมเดลแบบเปิดที่คุณโฮสต์เองได้ หากงานของคุณเป็นการประมวลผลแบบเป็นชุด แบบออฟไลน์ หรือถูกจำกัดด้วยปริมาณงาน (throughput-bound) มากกว่าความหน่วง ความฉลาดที่คุณต้องจ่ายเพิ่ม 2.5 เท่านั้น ก็คือความฉลาดที่คุณมีอยู่แล้ว

คำถามที่ยังเปิดอยู่คือ การวัดผลที่เป็นอิสระพูดถึง 200 ว่าอย่างไร ยังไม่มีใครนอก Z.ai เผยแพร่ตัวเลข吞吐ของ FlashX และจนกว่าจะมีคนทำ จุดยืนที่ซื่อตรงคือ FlashX เป็นชั้นบริการที่มีศักยภาพซึ่งขายด้วยตัวเลขพีคเท่านั้น นอกจากนี้ยังถือเป็นการทดสอบเชิงพาณิชย์ที่สำคัญอย่างชัดเจน: แล็บที่ใช้เวลาหนึ่งปีแจกโมเดลเกือบระดับแนวหน้าในราคาหนึ่งในสิบของเรือธง กำลังถามว่าผู้พัฒนาจะยอมจ่ายเพื่อความเร็วเพียงอย่างเดียวหรือไม่ คำตอบจะกำหนดว่าระดับถัดไปจะถูกตั้งราคาอย่างไร

A screenshot of the OrcaRouter models catalogue (captured September 19, 2026) showing the header '199 models - 15 providers - one API key, one bill', the filter chips for input modalities, context length, input price, status, series and supported parameters, and the 'How to call any model' panel with the POST https://api.orcarouter.ai/v1/chat/completions endpoint.

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube