
GLM-5.3-FlashX กับ DeepSeek V4.1 Flash: ระดับความเร็วที่ช้ากว่ารุ่นราคาถูก
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ระดับความเร็วพรีเมียมของ Z.ai มีปัญหา และมันถูกเรียกว่า DeepSeek V4.1 Flash. เมื่อ Z.ai เปิดตัว GLM-5.3-FlashX เมื่อวันที่ 18 กันยายน 2026 มันขายระดับใหม่นี้ด้วยตัวเลขเพียงตัวเดียว: สูงสุด 200 โทเคนเอาต์พุตต่อวินาที ซึ่งประมาณห้าเท่าของอัตราการประมวลผลของ GLM-5.3-Flash ที่มันสร้างขึ้นมา ในราคา 2.5 เท่า การวัดโดยอิสระได้ระบุว่าโมเดลราคาประหยัดของ DeepSeek อยู่ที่ 214.7 โทเคนต่อวินาที โดยมีเวลาถึงโทเคนแรก 1.15 วินาที — เร็วกว่าทั้งสองค่านั้นเมื่อเทียบกับเพดานที่ Z.ai กำลังโฆษณา และในราคาที่ FlashX เทียบไม่ติด หากคุณกำลังซื้อความเร็ว ตลาดได้เคลื่อนไปก่อนที่ FlashX จะมาถึง
การวางกรอบแบบนั้นไม่ยุติธรรมกับ FlashX ในแง่หนึ่งโดยเฉพาะ และยุติธรรมในทุกแง่อื่น ๆ ทั้งสองโมเดลเป็นอนุพันธ์แบบ open-weight ที่มีบริบท 1M ซึ่งถูกออกแบบมาเพื่อต้นทุน และทั้งคู่ก็เก่งจริงในสิ่งที่ถูกสร้างมาเพื่อทำ แต่พวกมันถูกสร้างมาเพื่อคนละครึ่งของปัญหาเดียวกัน และช่องว่างราคาระหว่างสองตัวนี้ตอนนี้กว้างพอที่คำถามว่า "ตัวไหนดีกว่า" จะมีคำตอบสั้น ๆ เพียงบรรทัดเดียวสำหรับงานส่วนใหญ่
จุดที่แต่ละอย่างได้เปรียบจริง ๆ
• ราคาตามประกาศ — GLM-5.3-FlashX $0.37 / $1.25 ต่อ 1M อินพุต/เอาต์พุต เทียบกับ DeepSeek V4.1 Flash $0.15 / $0.60 นอกช่วงพีก และ $0.30 / $1.20 ช่วงพีกbr> • อินพุตที่แคชไว้ — FlashX $0.075 ต่อ 1M เทียบกับ DeepSeek $0.003 นอกช่วงพีก ซึ่งเป็นช่องว่างถึง 25 เท่าที่ทบต้นอย่างหนักในลูปเอเจนต์br> • อัตราทรูพุตที่วัดได้ — FlashX สูงสุด 200 tok/s (ค่าสูงสุดจากผู้จำหน่าย ไม่มีตัวเลขจากแหล่งอิสระเผยแพร่) เทียบกับ DeepSeek 214.7 tok/s (Artificial Analysis บน API ของ DeepSeek)br> • เวลาถึงโทเคนแรก — ไม่มีการเผยแพร่สำหรับ FlashX เทียบกับ 1.15 วินาทีที่วัดได้สำหรับ DeepSeek V4.1 Flashbr> • ความฉลาดจากแหล่งอิสระ — FlashX สืบทอดคะแนน 42 ของ GLM-5.3-Flash บน Artificial Analysis Intelligence Index เทียบกับ DeepSeek V4.1 Flash ที่ 40br> • สถาปัตยกรรม — MoE รวม 320B / ใช้งาน 18B เทียบกับ 552B รวม โดยใช้งานประมาณ 8B ในช่วงพรีฟิล และ 16B ในช่วงดีโคดbr> • รูปแบบอินพุต — ข้อความ รูปภาพ วิดีโอ และไฟล์ เทียบกับข้อความและรูปภาพbr> • เพดานเอาต์พุต — 131,072 โทเคน เทียบกับประมาณ 384,000br> • น้ำหนักเปิด — GLM-5.3-Flash ใช้สัญญาอนุญาต MIT; FlashX เป็นระดับโฮสต์ที่ไม่มีน้ำหนักเป็นของตัวเอง และ DeepSeek V4.1 Flash ใช้สัญญาอนุญาต MIT

อ่านรายการนั้นสองครั้ง เพราะรูปร่างของมันคือเรื่องราว FlashX ชนะแค่สองแถว และทั้งสองก็แคบ: ความได้เปรียบสองจุดบนดัชนีความฉลาดอิสระ และอินพุตวิดีโอ DeepSeek ชนะราคา ราคาแคช ความเร็วที่วัดได้ ความยาวเอาต์พุต และความกว้างของโมดัลลิตีในแง่ที่สำคัญ — มันรับภาพและสร้างคำตอบยาว ช่องว่างดัชนีสองจุดอยู่ภายในสัญญาณรบกวนของการรันเบนช์มาร์กครั้งเดียว และไม่ควรเป็นสิ่งที่ตัดสินสถาปัตยกรรมของคุณ
ระดับความเร็วที่ช้ากว่ารุ่นราคาถูก
นี่คือส่วนที่ควรค่าแก่การพิจารณา Z.ai สร้าง FlashX เพื่อแก้ปัญหาจริง: GLM-5.3-Flash นั้นช้า Artificial Analysis วัดได้ที่ 98 โทเค็นเอาต์พุตต่อวินาที ซึ่งสูงกว่าค่ามัธยฐานของกลุ่มโมเดลน้ำหนักเปิดขนาดเดียวกัน แต่ยังห่างไกลจากระดับอินเทอร์แอคทีฟ การแก้ไขของบริษัทคือการสร้างสแต็กการให้บริการใหม่ — ตัวเร่งความเร็วในประเทศราว 100,000 ตัว เอนจินที่ใช้ SGLang การทำควอนไทเซชัน W8A8 แคช KV แบบความแม่นยำผสม และสถาปัตยกรรมแบบแยกส่วน encode–prefill–decode — และรายงานว่ามีปริมาณงานแบบ end-to-end ประมาณ 3 เท่าเมื่อเทียบกับค่าพื้นฐานบนฮาร์ดแวร์เดียวกัน
DeepSeek แก้ปัญหาเดียวกันในชั้นสถาปัตยกรรม และทำได้ก่อนใคร การแยก Causal Encoder–Decoder ของ V4.1 Flash เปิดใช้งานพารามิเตอร์ประมาณ 8B ในช่วง prefill และ 16B ในช่วง decode แทนที่จะเป็นตัวเลขคงที่ และ Compressed Sparse Attention 2 พร้อมแคช KV แบบ FP4 ลดแคชส่วนกลางเหลือ 890 ไบต์ต่อโทเคน — ประมาณหนึ่งในสี่ของ HBM และหนึ่งในแปดของพื้นที่จัดเก็บ SSD ที่รุ่นก่อนต้องใช้ ผลลัพธ์คือโมเดลที่ทำงานที่ 214.7 โทเคนต่อวินาที ตามการวัดของแล็บที่เป็นกลาง บน API first-party เดียวกัน โดยไม่ต้องมีแพ็กเกจพรีเมียม
200 ของ Z.ai เป็นค่าสูงสุดที่ผู้ให้บริการรายงาน และ 214.7 ของ DeepSeek เป็นค่ามัธยฐานจากการทดสอบอิสระ ซึ่งเป็นการเปรียบเทียบที่เสียเปรียบ Z.ai มากที่สุดเท่าที่จะเป็นไปได้ และเป็นเหตุผลที่ควรถือตัวเลขนี้ไว้อย่างหลวม ๆ เป็นไปได้อย่างเต็มที่ว่า FlashX จะเอาชนะ DeepSeek ได้ในคำขอที่เครื่องอุ่นแล้ว ให้ผลลัพธ์สั้น และไม่แออัด แต่เป็นไปไม่ได้ที่จะรู้ เพราะไม่มีใครนอก Z.ai เผยแพร่ตัวเลข throughput ของ FlashX สิ่งที่รู้ได้ในวันนี้คือ สองโมเดลอยู่ในช่วงความเร็วเดียวกัน และหนึ่งในนั้นมีราคาเพียงหนึ่งในสาม

จุดที่ความได้เปรียบด้านราคาของ DeepSeek กลายเป็นเชิงโครงสร้าง
DeepSeek V4.1 Flash คิดค่าบริการ $0.15 ต่อหนึ่งล้านโทเคนอินพุต และ $0.60 ต่อหนึ่งล้านโทเคนเอาต์พุตในช่วงนอกเวลาพีค โดยเพิ่มเป็นสองเท่าคือ $0.30 และ $1.20 ในช่วงเวลาวันธรรมดาสองช่วง (01:00–04:00 และ 06:00–10:00 UTC) ส่วน FlashX คิดราคาคงที่ที่ $0.37 และ $1.25 เมื่อนำมาเทียบกัน ราคาคงที่ที่ดูเหมือนเป็นจุดเด่นกลับกลายเป็นโครงสร้างที่แพงกว่าสำหรับใครก็ตามที่สามารถจัดตารางงานได้
บรรทัดอินพุตที่แคชไว้คือรายการที่กำหนดภาระงานของเอเจนต์ DeepSeek คิดค่าบริการ $0.003 ต่อโทเค็นอินพุตที่แคชไว้หนึ่งล้านโทเค็นในช่วงออฟพีค; FlashX คิด $0.075 ซึ่งมากกว่ายี่สิบห้าเท่า เอเจนต์ที่ส่งพรอมป์ระบบยาวและสคีมาของเครื่องมือซ้ำในทุกขั้นตอนจะจ่ายส่วนต่างนั้นในทุกขั้นตอน และเป็นรายการเดียวที่มีแนวโน้มมากที่สุดที่จะครองบิลจริง Z.ai ระบุว่าการจัดเก็บแคชฟรีในช่วงเวลาจำกัด ซึ่งเป็นส่วนลดสำหรับการจัดเก็บมากกว่าการอ่านที่สะสมจริง
มีสิ่งที่ถ่วงดุลอยู่ และนั่นคือความซื่อสัตย์เกี่ยวกับต้นทุนที่แท้จริงของตัวเลขของ DeepSeek เอง การประเมินที่ผู้ขายดำเนินการเองซึ่งรองรับคะแนนพาดหัวของ V4.1 Flash ถูกสร้างขึ้นที่ความพยายามในการใช้เหตุผลสูงสุด และ DeepSeek ระบุว่า การเลื่อนจาก effort 25 ไปเป็น effort 100 ทำให้ DeepSWE v1.1 เพิ่มจาก 66.0 เป็น 74.2 ในขณะที่ใช้ output tokens ประมาณ 2.5 เท่า เมื่อต้องใช้โทเคน 2.5 เท่า ต้นทุนที่แท้จริงของการตั้งค่าความพยายามสูงจะใกล้เคียงกับ FlashX มากกว่าที่ป้ายราคาบอกเป็นนัย — และโมเดลนี้ได้รับการบันทึกว่าเป็นโมเดลที่ช่างพูดมาก โดยสร้าง output tokens 250M บน Intelligence Index เทียบกับค่ามัธยฐานที่ 130M อัตราต่อโทเคนที่ถูกบนโมเดลช่างพูดไม่เท่ากับงานที่ราคาถูก ใครก็ตามที่เปรียบเทียบสองตัวนี้ในเรื่องราคา ควรเปรียบเทียบต้นทุนต่องานที่ทำสำเร็จ ไม่ใช่ต้นทุนต่อล้านโทเคน และควรคาดว่าจะต้องวัดจริงมากกว่าการประมาณ
จะตัดสินใจอย่างเป็นรูปธรรมได้อย่างไร
ถ้าภาระงานของคุณคือเอเจนต์ที่ทำงานต่อเนื่องยาวนานซึ่งมีคำนำหน้าคงที่ DeepSeek V4.1 Flash คือตัวเลือกที่ควรเลือก และอัตราส่วนอินพุตที่แคชไว้เพียงอย่างเดียวก็ตัดสินได้แล้ว ถ้าคุณต้องมีการเข้าใจวิดีโอหรือการป้อนไฟล์ในคำขอเดียวกัน FlashX เป็นเพียงตัวเดียวในสองตัวนี้ที่รองรับสิ่งเหล่านั้น ซึ่งเป็นความแตกต่างด้านความสามารถจริง ไม่ใช่ความแตกต่างบนสเปกชีต ถ้าคุณต้องได้เอาต์พุตที่สร้างยาว เพดานเอาต์พุตประมาณ 384K ของ DeepSeek เทียบกับ 131,072 ของ FlashX นั้นสำคัญต่อการสร้างรายงาน ไฟล์โค้ดยาว และสิ่งใดก็ตามที่สังเคราะห์แทนที่จะตอบคำถาม ถ้าคุณต้องได้คะแนนอิสระที่แข็งแกร่งที่สุดบนดัชนี benchmark เดียว คะแนน 42 ต่อ 40 ของ FlashX นั้นเป็นความต่างจริง แต่เล็กเกินกว่าจะใช้เป็นพื้นฐาน
โมเดลทั้งสองเข้าถึงได้จากปลายทางเดียว หากสแต็กของคุณถูกจัดเส้นทางไว้อยู่แล้ว ซึ่งเป็นวิธีที่ถูกที่สุดในการตัดสินเรื่องนี้ บน OrcaRouter ราคาตามรายการของผู้ขายจะถูกส่งผ่านโดยบวกเพิ่ม 0% ดังนั้นส่วนลดนอกช่วงพีคของ DeepSeek และการปรับราคาของ Z.ai ในอนาคตจะสะท้อนในวันเดียวกับที่เกิดขึ้นจริง และการสลับไปมาระหว่างสองตัวนี้ก็เป็นแค่การเปลี่ยนสตริงชื่อโมเดล ไม่ใช่การทำอินทิเกรชัน การสลับอัตโนมัติเมื่อระบบล่มเป็นสิ่งที่ควรมีไว้ โดยเฉพาะกับ FlashX: มันเป็นระดับการให้บริการที่เพิ่งเปิดได้สามสัปดาห์บนคลัสเตอร์ใหม่ และโหมดความล้มเหลวที่คุณกำลังประกันความเสี่ยงไว้คือเพดานความจุ ไม่ใช่โมเดลที่หยุดทำงาน
สรุปแบบตรง ๆ: DeepSeek V4.1 Flash เป็นค่าเริ่มต้นที่ดีกว่าสำหรับงานโปรดักชันส่วนใหญ่ — ถูกกว่าต่อโทเคน ถูกกว่าต่อโทเคนที่แคชไว้ วัดแล้วเร็วกว่า และรองรับเอาต์พุตที่ยาวกว่า GLM-5.3-FlashX เป็นตัวเลือกที่เหมาะสมในขอบเขตที่แคบกว่า ซึ่งคุณต้องการอินพุตวิดีโอหรือไฟล์ และต้องการให้มีดัชนีอิสระที่สูงกว่าเล็กน้อยหนุนอยู่ Z.ai ตั้งราคาระดับความเร็วไว้ในระดับพรีเมียม แล้วเปิดตัวเข้าสู่ตลาดที่โมเดลเร็วราคาถูกมีอยู่แล้ว นั่นคือการเปรียบเทียบทั้งหมด

การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
