
GLM-5.3-FlashX วางจำหน่ายในราคา 2.5 เท่าของโมเดลที่มันรันอยู่
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ตัวเลขที่ต้องสังเกตไม่ใช่ 200 แต่คือ 2.5 เมื่อวันที่ 18 กันยายน 2026 Z.ai ได้นำ GLM-5.3-FlashXไปวางบน API ของตนที่ความเร็วสูงถึง 200 โทเคนเอาต์พุตต่อวินาที — และตั้งราคาไว้ที่ 2.5 เท่าของราคาที่เรียกเก็บสำหรับ GLM-5.3-Flash ซึ่งเป็นโมเดลแบบเปิดน้ำหนักที่ใช้เป็นฐานในการสร้าง ไม่มีอะไรเกี่ยวกับตัวโมเดลเองเปลี่ยนแปลงไป น้ำหนักเดียวกัน โครงข่ายหลักแบบ mixture-of-experts ขนาด 320B-A18B เดียวกัน คอนเท็กซ์ 1 ล้านโทเคนเดียวกัน การรองรับข้อความ รูปภาพ วิดีโอ และไฟล์แบบเนทีฟเหมือนกัน สิ่งที่เปลี่ยนไปคือสแต็กการให้บริการที่อยู่ข้างใต้มัน และสิ่งที่ Z.ai กำลังเรียกเก็บตอนนี้สำหรับสิทธิพิเศษในการได้อยู่ใกล้ส่วนหน้าของคิวมากขึ้น
นั่นทำให้ FlashX เป็นสิ่งที่หาได้ยากในตลาดโมเดล: การเปิดตัวที่ไม่มีเบนช์มาร์กแนบมาด้วยเลย Z.ai ไม่ได้เผยแพร่การประเมินที่จำเพาะต่อ FlashX เพราะไม่มีโมเดลใหม่ให้ประเมิน ตัวเลขขีดความสามารถทุกตัวที่ใช้กับ GLM-5.3-Flash ก็ใช้กับที่นี่ด้วย รวมถึงตัวเลขที่ดูไม่น่าประทับใจเท่ากับที่การรายงานข่าวการเปิดตัวชี้ให้เห็น
เดลต้าทั้งหมด ในรอบเดียว
• ความเร็ว — GLM-5.3-FlashX ทำได้สูงสุดถึง 200 tok/s (ค่าสูงสุดที่ผู้จำหน่ายรายงาน) เทียบกับ GLM-5.3-Flash ที่ 98 tok/s ตามที่วัดโดย Artificial Analysis บน API ของ Z.ai เองbr> • ราคา — $0.37 ต่อ 1M อินพุต / $1.25 ต่อ 1M เอาต์พุต เทียบกับ $0.15 / $0.50 ตามราคาที่ประกาศbr> • อินพุตที่แคชไว้ — $0.075 ต่อ 1M เทียบกับ $0.03 ต่อ 1Mbr> • ความฉลาด — เหมือนกันทุกประการ; FlashX สืบทอดคะแนนของโมเดลฐานbr> • บริบท — 1M โทเคนทั้งคู่br> • น้ำหนัก — GLM-5.3-Flash เป็นน้ำหนักเปิดภายใต้สัญญาอนุญาต MIT; FlashX เป็นระดับบริการแบบโฮสต์และไม่มีน้ำหนักของตัวเอง
200 กับ 98 ไม่ใช่ตัวเลขประเภทเดียวกัน และก็ควรพูดตรง ๆ เรื่องนี้ ตัวหนึ่งเป็นเพดานที่ผู้ขายบอกว่าบริการสามารถไปถึงได้ อีกตัวคือสิ่งที่ห้องแล็บอิสระวัดได้จากคำขอจริงจำนวนมาก ผู้ใช้ที่กำลังตัดสินใจว่าจะจ่าย 2.5 เท่าหรือไม่ ควรถือว่า 200 เป็นโฆษณา และไปวัดเวิร์กโหลดของตัวเอง

สิ่งที่ Z.ai พูดนั่นแหละที่ทำงานอยู่
ความเร็วที่เพิ่มขึ้นนี้มาจากโครงสร้างพื้นฐาน ไม่ใช่คณิตศาสตร์ Z.ai อธิบายว่า FlashX ทำงานบนคลัสเตอร์ตัวเร่งความเร็วในประเทศจีนประมาณ 100,000 ตัว พร้อมสแต็กการให้บริการที่สร้างขึ้นโดยเฉพาะ: เอนจินอินเฟอเรนซ์ที่อิงกับ SGLang, การควอนไทซ์ W8A8, การควอนไทซ์แคชแบบผสม INT8/FP8/BF16 และสถาปัตยกรรมแบบแยกส่วน encode–prefill–decode ที่แยกขั้นตอนการเข้ารหัสมัลติโมดัลออกจากขั้นตอนการสร้างโทเค็น เพื่อไม่ให้ฝ่ายใดฝ่ายหนึ่งบล็อกอีกฝ่าย บริษัทรายงานปริมาณงานการให้บริการแบบ end-to-end ประมาณ 3 เท่าเมื่อเทียบกับค่าพื้นฐานเริ่มต้นบนฮาร์ดแวร์เดียวกัน และกล่าวว่าเอเจนต์ด้านโครงสร้างพื้นฐานที่ขับเคลื่อนด้วย GLM-5.3 ช่วยปรับแต่งสแต็กนี้
ทั้งหมดนั้นเป็นข้อมูลที่ผู้ขายรายงาน และจนถึงตอนนี้ยังไม่มีใครนอก Z.ai ทำซ้ำได้ มันยังเป็นส่วนที่น่าเชื่อถือที่สุดของเรื่องนี้อีกด้วย: การเปิดตัวระดับ serving-tier แบบนี้มักเป็นชัยชนะทางวิศวกรรม และตัวเลือกสถาปัตยกรรมที่อธิบายไว้ก็เป็นชุดเครื่องมือมาตรฐานสำหรับการเพิ่มประสิทธิภาพแบบนี้โดยเฉพาะ สิ่งที่มันไม่ใช่คือหลักประกัน ตัวเลข 200 tok/s เป็นค่าสูงสุด และค่าสูงสุดจะเกิดขึ้นกับเอาต์พุตสั้น แคชที่อุ่นอยู่แล้ว และคลัสเตอร์ที่ไม่แออัด คำขอแบบมัลติโมดัลบริบทยาว — ภาระงานที่ FlashX ถูกนำเสนออย่างชัดเจนว่าออกแบบมาเพื่อ — เป็นประเภทที่มีแนวโน้มจะทำได้น้อยที่สุด
ราคาคือการตัดสินใจด้านผลิตภัณฑ์ที่แท้จริง
ในราคาป้าย GLM-5.3-FlashX มีราคา $0.37 ต่อล้านโทเคนอินพุต และ $1.25 ต่อล้านโทเคนเอาต์พุต โดยอินพุตที่แคชไว้ราคา $0.075 และพื้นที่จัดเก็บแคชฟรีในช่วงเวลาจำกัด สำหรับราคาในประเทศของ Z.ai นั่นคือ ¥2 ขาเข้า และ ¥7 ขาออก เทียบกับ ¥0.8 และ ¥2.8 สำหรับ Flash รุ่นพื้นฐาน — อัตราส่วน 2.5 เท่าเดียวกัน โดยระบุเป็นสกุลเงินที่ Z.ai ใช้ขายในประเทศ

การคำนวณเริ่มทำให้รู้สึกไม่สบายใจอย่างรวดเร็วในทิศทางที่ผู้คนแทบไม่ค่อยตรวจสอบ โทเค็นเอาต์พุตคือจุดที่ตัวคูณกัดหนักที่สุด เพราะเอาต์พุตเป็นด้านที่มีค่าใช้จ่ายสูงบนทุกโมเดลในตระกูลนี้: เอาต์พุตของ FlashX เป็น 2.5 เท่าของเอาต์พุต Flash และเอาต์พุตก็มีราคาสูงกว่าอินพุตอยู่แล้วประมาณ 3.4 เท่าทั้งสองตัว งานแบบแบตช์ที่สร้างโทเค็นเอาต์พุตหนึ่งล้านโทเค็นต่อวันจะขยับจาก $0.50 เป็น $1.25 — ส่วนต่าง $274 ต่อปีสำหรับปริมาณงานที่ตามนิยามแล้วไม่มีใครรออยู่
จุดที่คุ้มค่าคือความหน่วงที่คุณสามารถเฉลี่ยต้นทุนได้ ลูปเอเจนต์ที่เรียกแบบลำดับต่อเนื่องสิบครั้งจะประหยัดส่วนต่างต่อการเรียกได้สิบเท่า และถ้าส่วนต่างนั้นคือสองหรือสามวินาที คุณก็ทวงเวลาจริงคืนมาได้ครึ่งนาทีต่อหนึ่งงาน สำหรับการเติมโค้ดแบบอินเทอร์แอกทีฟ บทสนทนาแบบเรียลไทม์ หรือไปป์ไลน์ใดก็ตามที่มนุษย์หรือบริการต้นทางต้องรอโทเคนถัดไป การแลกเปลี่ยนแบบนั้นมักถูกต้อง Z.ai ยังระบุชัดเจนว่าโมเดลนี้ยังไม่อยู่ใน GLM Coding Plan ของตนในปัจจุบัน ผู้ใช้แบบสมัครสมาชิกจึงไม่ได้รับ FlashX รวมมาให้ — พวกเขาจ่ายต่อโทเคนสำหรับตัวนี้
หากสแต็กของคุณเชื่อมต่อกับผู้ให้บริการมากกว่าหนึ่งรายอยู่แล้ว การสลับก็เป็นเพียงการเปลี่ยนสตริงชื่อโมเดลเท่านั้น ไม่มีอะไรอื่น นี่คือเหตุผลเชิงปฏิบัติที่ทำให้ routing ดำรงอยู่ในฐานะเลเยอร์: บน OrcaRouter ราคาตามรายการของผู้ขายจะถูกส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นการเปลี่ยนแปลงราคาของ Z.ai หรือการลดราคาโปรโมชันจะสะท้อนในวันเดียวกับที่เกิดขึ้นต้นทาง และการมี endpoint เดียวที่อยู่หน้าโมเดลกว่า 200 ตัวหมายความว่าการประเมิน FlashX เทียบกับ Flash เป็นเพียงการแก้ไขคอนฟิก ไม่ใช่โปรเจกต์การผสานรวม การทำ failover ก็สำคัญเช่นกัน — serving tier ใหม่เอี่ยมบนคลัสเตอร์ใหม่เอี่ยมเป็น dependency ประเภทที่ควรมี fallback อยู่ข้างหลังพอดี
สิ่งที่ยังไม่เปลี่ยนแปลง และเหตุใดจึงสำคัญยิ่งกว่า
FlashX สืบทอดโปรไฟล์ความสามารถของ GLM-5.3-Flash มาแบบเต็มรูปแบบ และโปรไฟล์นั้นแคบกว่าที่การรายงานข่าวเปิดตัวบอกเป็นนัย เอกสารของ Z.ai จัดให้โมเดลฐานอยู่ระดับเดียวกับ Claude Opus 4.8 บน Artificial Analysis Intelligence Index ขณะที่ Artificial Analysis เองในปัจจุบันจัดอันดับ GLM-5.3-Flash ไว้ที่ 42 บนดัชนีนั้น ซึ่งวัดบน API ของ Z.ai เอง — เป็นคะแนนที่แข็งแกร่ง สูงกว่าค่ามัธยฐานของโมเดล open-weight ในคลาสเดียวกันมาก และยังห่างไกลจากระดับฟรอนเทียร์ที่การเปรียบเทียบของผู้ขายชี้ให้เห็น ข้อความทั้งสองเป็นความจริง เพียงแต่ไม่ใช่ข้อความเดียวกัน และช่องว่างระหว่างสองข้อความนั้นคือเหตุผลที่บล็อกนี้ติดป้ายตัวเลขของผู้ขายว่าเป็นตัวเลขของผู้ขาย
โมเดลฐานนี้มีความสามารถจริงและเปิดกว้างจริง GLM-5.3-Flash เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 ภายใต้สัญญาอนุญาต MIT พร้อมน้ำหนักบน Hugging Face และการออกแบบ attention แบบไฮบริด linear-plus-sparse ของมัน — การบีบอัด IndexPool, hyper-connections แบบมีข้อจำกัดบน manifold — ลดการคำนวณ attention ลงประมาณ 3 เท่า และ KV cache ประมาณ 4.4 เท่า เมื่อเทียบกับ GLM-5.3 ซึ่งเป็นสิ่งที่ทำให้โมเดล 320B ที่มีพารามิเตอร์ที่ใช้งานจริง 18B มีต้นทุนต่ำพอที่จะให้บริการได้เลย เอาต์พุตจำกัดไว้ที่ 131,072 โทเคน มันเร็วเมื่อเทียบกับราคา ไม่ได้เร็วเมื่อเทียบกับระดับเดียวกัน: Artificial Analysis วัดได้ 98 โทเคนต่อวินาที เทียบกับค่ามัธยฐานของคู่แข่งที่สูงกว่า 70 แต่ต่ำกว่าโมเดลที่เร็วที่สุดในกระดาน
FlashX ไม่ได้เปลี่ยนแปลงสิ่งเหล่านั้นเลย มันเปลี่ยนระยะเวลาที่คุณต้องรอสำหรับมัน
การอ่านอย่างตรงไปตรงมา
ซื้อ FlashX หากงานของคุณถูกจำกัดด้วยความหน่วง (latency-bound) และคุณตัดสินใจแล้วว่า GLM-5.3-Flash คือโมเดลที่ใช่สำหรับคุณ — ไม่ว่าจะเป็นเอเจนต์ที่เรียกใช้งานต่อกันเป็นทอด ๆ เอดิเตอร์ที่เติมข้อความให้อัตโนมัติแบบอินไลน์ หรืออินเทอร์เฟซเสียงหรือแชตที่ "ช่วงเว้นจังหวะ" คือหัวใจของผลิตภัณฑ์ จงใช้ GLM-5.3-Flash ต่อไป หรือใช้น้ำหนักโมเดลแบบเปิดที่คุณโฮสต์เองได้ หากงานของคุณเป็นการประมวลผลแบบเป็นชุด แบบออฟไลน์ หรือถูกจำกัดด้วยปริมาณงาน (throughput-bound) มากกว่าความหน่วง ความฉลาดที่คุณต้องจ่ายเพิ่ม 2.5 เท่านั้น ก็คือความฉลาดที่คุณมีอยู่แล้ว
คำถามที่ยังเปิดอยู่คือ การวัดผลที่เป็นอิสระพูดถึง 200 ว่าอย่างไร ยังไม่มีใครนอก Z.ai เผยแพร่ตัวเลข吞吐ของ FlashX และจนกว่าจะมีคนทำ จุดยืนที่ซื่อตรงคือ FlashX เป็นชั้นบริการที่มีศักยภาพซึ่งขายด้วยตัวเลขพีคเท่านั้น นอกจากนี้ยังถือเป็นการทดสอบเชิงพาณิชย์ที่สำคัญอย่างชัดเจน: แล็บที่ใช้เวลาหนึ่งปีแจกโมเดลเกือบระดับแนวหน้าในราคาหนึ่งในสิบของเรือธง กำลังถามว่าผู้พัฒนาจะยอมจ่ายเพื่อความเร็วเพียงอย่างเดียวหรือไม่ คำตอบจะกำหนดว่าระดับถัดไปจะถูกตั้งราคาอย่างไร

การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
