การ์ดชื่อเรื่องหลักสำหรับ GLM-5.3-FlashX vs DeepSeek V4.1 Flash พร้อมคำบรรยายใต้ชื่อว่า 'ระดับความเร็วที่ช้ากว่ารุ่นราคาถูก' โดยมีชิปที่ระบุข้อความว่า '200 vs 214.7 tok/s', '$0.37 / $1.25 vs $0.15 / $0.60' และ 'AA 42 vs 40' และบรรทัดส่วนท้ายว่า 'GLM-5.3-FlashX เปิดตัวเมื่อวันที่ 18 กันยายน 2026'
Guides & Insights

GLM-5.3-FlashX กับ DeepSeek V4.1 Flash: ระดับความเร็วที่ช้ากว่ารุ่นราคาถูก

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ระดับความเร็วพรีเมียมของ Z.ai มีปัญหา และมันถูกเรียกว่า DeepSeek V4.1 Flash. เมื่อ Z.ai เปิดตัว GLM-5.3-FlashX เมื่อวันที่ 18 กันยายน 2026 มันขายระดับใหม่นี้ด้วยตัวเลขเพียงตัวเดียว: สูงสุด 200 โทเคนเอาต์พุตต่อวินาที ซึ่งประมาณห้าเท่าของอัตราการประมวลผลของ GLM-5.3-Flash ที่มันสร้างขึ้นมา ในราคา 2.5 เท่า การวัดโดยอิสระได้ระบุว่าโมเดลราคาประหยัดของ DeepSeek อยู่ที่ 214.7 โทเคนต่อวินาที โดยมีเวลาถึงโทเคนแรก 1.15 วินาที — เร็วกว่าทั้งสองค่านั้นเมื่อเทียบกับเพดานที่ Z.ai กำลังโฆษณา และในราคาที่ FlashX เทียบไม่ติด หากคุณกำลังซื้อความเร็ว ตลาดได้เคลื่อนไปก่อนที่ FlashX จะมาถึง

การวางกรอบแบบนั้นไม่ยุติธรรมกับ FlashX ในแง่หนึ่งโดยเฉพาะ และยุติธรรมในทุกแง่อื่น ๆ ทั้งสองโมเดลเป็นอนุพันธ์แบบ open-weight ที่มีบริบท 1M ซึ่งถูกออกแบบมาเพื่อต้นทุน และทั้งคู่ก็เก่งจริงในสิ่งที่ถูกสร้างมาเพื่อทำ แต่พวกมันถูกสร้างมาเพื่อคนละครึ่งของปัญหาเดียวกัน และช่องว่างราคาระหว่างสองตัวนี้ตอนนี้กว้างพอที่คำถามว่า "ตัวไหนดีกว่า" จะมีคำตอบสั้น ๆ เพียงบรรทัดเดียวสำหรับงานส่วนใหญ่

จุดที่แต่ละอย่างได้เปรียบจริง ๆ

• ราคาตามประกาศ — GLM-5.3-FlashX $0.37 / $1.25 ต่อ 1M อินพุต/เอาต์พุต เทียบกับ DeepSeek V4.1 Flash $0.15 / $0.60 นอกช่วงพีก และ $0.30 / $1.20 ช่วงพีกbr> • อินพุตที่แคชไว้ — FlashX $0.075 ต่อ 1M เทียบกับ DeepSeek $0.003 นอกช่วงพีก ซึ่งเป็นช่องว่างถึง 25 เท่าที่ทบต้นอย่างหนักในลูปเอเจนต์br> • อัตราทรูพุตที่วัดได้ — FlashX สูงสุด 200 tok/s (ค่าสูงสุดจากผู้จำหน่าย ไม่มีตัวเลขจากแหล่งอิสระเผยแพร่) เทียบกับ DeepSeek 214.7 tok/s (Artificial Analysis บน API ของ DeepSeek)br> • เวลาถึงโทเคนแรก — ไม่มีการเผยแพร่สำหรับ FlashX เทียบกับ 1.15 วินาทีที่วัดได้สำหรับ DeepSeek V4.1 Flashbr> • ความฉลาดจากแหล่งอิสระ — FlashX สืบทอดคะแนน 42 ของ GLM-5.3-Flash บน Artificial Analysis Intelligence Index เทียบกับ DeepSeek V4.1 Flash ที่ 40br> • สถาปัตยกรรม — MoE รวม 320B / ใช้งาน 18B เทียบกับ 552B รวม โดยใช้งานประมาณ 8B ในช่วงพรีฟิล และ 16B ในช่วงดีโคดbr> • รูปแบบอินพุต — ข้อความ รูปภาพ วิดีโอ และไฟล์ เทียบกับข้อความและรูปภาพbr> • เพดานเอาต์พุต — 131,072 โทเคน เทียบกับประมาณ 384,000br> • น้ำหนักเปิด — GLM-5.3-Flash ใช้สัญญาอนุญาต MIT; FlashX เป็นระดับโฮสต์ที่ไม่มีน้ำหนักเป็นของตัวเอง และ DeepSeek V4.1 Flash ใช้สัญญาอนุญาต MIT

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

อ่านรายการนั้นสองครั้ง เพราะรูปร่างของมันคือเรื่องราว FlashX ชนะแค่สองแถว และทั้งสองก็แคบ: ความได้เปรียบสองจุดบนดัชนีความฉลาดอิสระ และอินพุตวิดีโอ DeepSeek ชนะราคา ราคาแคช ความเร็วที่วัดได้ ความยาวเอาต์พุต และความกว้างของโมดัลลิตีในแง่ที่สำคัญ — มันรับภาพและสร้างคำตอบยาว ช่องว่างดัชนีสองจุดอยู่ภายในสัญญาณรบกวนของการรันเบนช์มาร์กครั้งเดียว และไม่ควรเป็นสิ่งที่ตัดสินสถาปัตยกรรมของคุณ

ระดับความเร็วที่ช้ากว่ารุ่นราคาถูก

นี่คือส่วนที่ควรค่าแก่การพิจารณา Z.ai สร้าง FlashX เพื่อแก้ปัญหาจริง: GLM-5.3-Flash นั้นช้า Artificial Analysis วัดได้ที่ 98 โทเค็นเอาต์พุตต่อวินาที ซึ่งสูงกว่าค่ามัธยฐานของกลุ่มโมเดลน้ำหนักเปิดขนาดเดียวกัน แต่ยังห่างไกลจากระดับอินเทอร์แอคทีฟ การแก้ไขของบริษัทคือการสร้างสแต็กการให้บริการใหม่ — ตัวเร่งความเร็วในประเทศราว 100,000 ตัว เอนจินที่ใช้ SGLang การทำควอนไทเซชัน W8A8 แคช KV แบบความแม่นยำผสม และสถาปัตยกรรมแบบแยกส่วน encode–prefill–decode — และรายงานว่ามีปริมาณงานแบบ end-to-end ประมาณ 3 เท่าเมื่อเทียบกับค่าพื้นฐานบนฮาร์ดแวร์เดียวกัน

DeepSeek แก้ปัญหาเดียวกันในชั้นสถาปัตยกรรม และทำได้ก่อนใคร การแยก Causal Encoder–Decoder ของ V4.1 Flash เปิดใช้งานพารามิเตอร์ประมาณ 8B ในช่วง prefill และ 16B ในช่วง decode แทนที่จะเป็นตัวเลขคงที่ และ Compressed Sparse Attention 2 พร้อมแคช KV แบบ FP4 ลดแคชส่วนกลางเหลือ 890 ไบต์ต่อโทเคน — ประมาณหนึ่งในสี่ของ HBM และหนึ่งในแปดของพื้นที่จัดเก็บ SSD ที่รุ่นก่อนต้องใช้ ผลลัพธ์คือโมเดลที่ทำงานที่ 214.7 โทเคนต่อวินาที ตามการวัดของแล็บที่เป็นกลาง บน API first-party เดียวกัน โดยไม่ต้องมีแพ็กเกจพรีเมียม

200 ของ Z.ai เป็นค่าสูงสุดที่ผู้ให้บริการรายงาน และ 214.7 ของ DeepSeek เป็นค่ามัธยฐานจากการทดสอบอิสระ ซึ่งเป็นการเปรียบเทียบที่เสียเปรียบ Z.ai มากที่สุดเท่าที่จะเป็นไปได้ และเป็นเหตุผลที่ควรถือตัวเลขนี้ไว้อย่างหลวม ๆ เป็นไปได้อย่างเต็มที่ว่า FlashX จะเอาชนะ DeepSeek ได้ในคำขอที่เครื่องอุ่นแล้ว ให้ผลลัพธ์สั้น และไม่แออัด แต่เป็นไปไม่ได้ที่จะรู้ เพราะไม่มีใครนอก Z.ai เผยแพร่ตัวเลข throughput ของ FlashX สิ่งที่รู้ได้ในวันนี้คือ สองโมเดลอยู่ในช่วงความเร็วเดียวกัน และหนึ่งในนั้นมีราคาเพียงหนึ่งในสาม

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

จุดที่ความได้เปรียบด้านราคาของ DeepSeek กลายเป็นเชิงโครงสร้าง

DeepSeek V4.1 Flash คิดค่าบริการ $0.15 ต่อหนึ่งล้านโทเคนอินพุต และ $0.60 ต่อหนึ่งล้านโทเคนเอาต์พุตในช่วงนอกเวลาพีค โดยเพิ่มเป็นสองเท่าคือ $0.30 และ $1.20 ในช่วงเวลาวันธรรมดาสองช่วง (01:00–04:00 และ 06:00–10:00 UTC) ส่วน FlashX คิดราคาคงที่ที่ $0.37 และ $1.25 เมื่อนำมาเทียบกัน ราคาคงที่ที่ดูเหมือนเป็นจุดเด่นกลับกลายเป็นโครงสร้างที่แพงกว่าสำหรับใครก็ตามที่สามารถจัดตารางงานได้

บรรทัดอินพุตที่แคชไว้คือรายการที่กำหนดภาระงานของเอเจนต์ DeepSeek คิดค่าบริการ $0.003 ต่อโทเค็นอินพุตที่แคชไว้หนึ่งล้านโทเค็นในช่วงออฟพีค; FlashX คิด $0.075 ซึ่งมากกว่ายี่สิบห้าเท่า เอเจนต์ที่ส่งพรอมป์ระบบยาวและสคีมาของเครื่องมือซ้ำในทุกขั้นตอนจะจ่ายส่วนต่างนั้นในทุกขั้นตอน และเป็นรายการเดียวที่มีแนวโน้มมากที่สุดที่จะครองบิลจริง Z.ai ระบุว่าการจัดเก็บแคชฟรีในช่วงเวลาจำกัด ซึ่งเป็นส่วนลดสำหรับการจัดเก็บมากกว่าการอ่านที่สะสมจริง

มีสิ่งที่ถ่วงดุลอยู่ และนั่นคือความซื่อสัตย์เกี่ยวกับต้นทุนที่แท้จริงของตัวเลขของ DeepSeek เอง การประเมินที่ผู้ขายดำเนินการเองซึ่งรองรับคะแนนพาดหัวของ V4.1 Flash ถูกสร้างขึ้นที่ความพยายามในการใช้เหตุผลสูงสุด และ DeepSeek ระบุว่า การเลื่อนจาก effort 25 ไปเป็น effort 100 ทำให้ DeepSWE v1.1 เพิ่มจาก 66.0 เป็น 74.2 ในขณะที่ใช้ output tokens ประมาณ 2.5 เท่า เมื่อต้องใช้โทเคน 2.5 เท่า ต้นทุนที่แท้จริงของการตั้งค่าความพยายามสูงจะใกล้เคียงกับ FlashX มากกว่าที่ป้ายราคาบอกเป็นนัย — และโมเดลนี้ได้รับการบันทึกว่าเป็นโมเดลที่ช่างพูดมาก โดยสร้าง output tokens 250M บน Intelligence Index เทียบกับค่ามัธยฐานที่ 130M อัตราต่อโทเคนที่ถูกบนโมเดลช่างพูดไม่เท่ากับงานที่ราคาถูก ใครก็ตามที่เปรียบเทียบสองตัวนี้ในเรื่องราคา ควรเปรียบเทียบต้นทุนต่องานที่ทำสำเร็จ ไม่ใช่ต้นทุนต่อล้านโทเคน และควรคาดว่าจะต้องวัดจริงมากกว่าการประมาณ

จะตัดสินใจอย่างเป็นรูปธรรมได้อย่างไร

ถ้าภาระงานของคุณคือเอเจนต์ที่ทำงานต่อเนื่องยาวนานซึ่งมีคำนำหน้าคงที่ DeepSeek V4.1 Flash คือตัวเลือกที่ควรเลือก และอัตราส่วนอินพุตที่แคชไว้เพียงอย่างเดียวก็ตัดสินได้แล้ว ถ้าคุณต้องมีการเข้าใจวิดีโอหรือการป้อนไฟล์ในคำขอเดียวกัน FlashX เป็นเพียงตัวเดียวในสองตัวนี้ที่รองรับสิ่งเหล่านั้น ซึ่งเป็นความแตกต่างด้านความสามารถจริง ไม่ใช่ความแตกต่างบนสเปกชีต ถ้าคุณต้องได้เอาต์พุตที่สร้างยาว เพดานเอาต์พุตประมาณ 384K ของ DeepSeek เทียบกับ 131,072 ของ FlashX นั้นสำคัญต่อการสร้างรายงาน ไฟล์โค้ดยาว และสิ่งใดก็ตามที่สังเคราะห์แทนที่จะตอบคำถาม ถ้าคุณต้องได้คะแนนอิสระที่แข็งแกร่งที่สุดบนดัชนี benchmark เดียว คะแนน 42 ต่อ 40 ของ FlashX นั้นเป็นความต่างจริง แต่เล็กเกินกว่าจะใช้เป็นพื้นฐาน

โมเดลทั้งสองเข้าถึงได้จากปลายทางเดียว หากสแต็กของคุณถูกจัดเส้นทางไว้อยู่แล้ว ซึ่งเป็นวิธีที่ถูกที่สุดในการตัดสินเรื่องนี้ บน OrcaRouter ราคาตามรายการของผู้ขายจะถูกส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นส่วนลดนอกช่วงพีคของ DeepSeek และการปรับราคาของ Z.ai ในอนาคตจะสะท้อนในวันเดียวกับที่เกิดขึ้นจริง และการสลับไปมาระหว่างสองตัวนี้ก็เป็นแค่การเปลี่ยนสตริงชื่อโมเดล ไม่ใช่การทำอินทิเกรชัน การสลับอัตโนมัติเมื่อระบบล่มเป็นสิ่งที่ควรมีไว้ โดยเฉพาะกับ FlashX: มันเป็นระดับการให้บริการที่เพิ่งเปิดได้สามสัปดาห์บนคลัสเตอร์ใหม่ และโหมดความล้มเหลวที่คุณกำลังประกันความเสี่ยงไว้คือเพดานความจุ ไม่ใช่โมเดลที่หยุดทำงาน

สรุปแบบตรง ๆ: DeepSeek V4.1 Flash เป็นค่าเริ่มต้นที่ดีกว่าสำหรับงานโปรดักชันส่วนใหญ่ — ถูกกว่าต่อโทเคน ถูกกว่าต่อโทเคนที่แคชไว้ วัดแล้วเร็วกว่า และรองรับเอาต์พุตที่ยาวกว่า GLM-5.3-FlashX เป็นตัวเลือกที่เหมาะสมในขอบเขตที่แคบกว่า ซึ่งคุณต้องการอินพุตวิดีโอหรือไฟล์ และต้องการให้มีดัชนีอิสระที่สูงกว่าเล็กน้อยหนุนอยู่ Z.ai ตั้งราคาระดับความเร็วไว้ในระดับพรีเมียม แล้วเปิดตัวเข้าสู่ตลาดที่โมเดลเร็วราคาถูกมีอยู่แล้ว นั่นคือการเปรียบเทียบทั้งหมด

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube