
GLM-5.3-FlashX vs DeepSeek V4.1 Flash: Hạng tốc độ còn chậm hơn cả mô hình giá rẻ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Gói tốc độ cao cấp của Z.ai có một vấn đề, và nó mang tên DeepSeek V4.1 Flash. Khi Z.ai ra mắt GLM-5.3-FlashX vào ngày 18 tháng 9 năm 2026, hãng đã bán gói mới này bằng một con số duy nhất: tối đa 200 token đầu ra mỗi giây, gấp khoảng năm lần thông lượng của GLM-5.3-Flash mà nó được xây dựng dựa trên, với mức giá gấp 2,5 lần. Các phép đo độc lập đã đặt mô hình giá rẻ của DeepSeek ở mức 214,7 token mỗi giây với thời gian tới token đầu tiên là 1,15 giây — nhanh hơn ở cả hai chỉ số so với mức trần mà Z.ai đang quảng cáo, và ở mức giá mà FlashX không thể nào bì tới. Nếu bạn đang mua tốc độ, thị trường đã dịch chuyển trước khi FlashX xuất hiện.
Cách đặt vấn đề đó là bất công với FlashX ở một điểm cụ thể, và công bằng ở mọi điểm khác. Cả hai mô hình đều là các dẫn xuất trọng số mở với ngữ cảnh 1M được thiết kế để tối ưu chi phí, và cả hai đều thực sự giỏi ở việc mà chúng được tạo ra để làm. Nhưng chúng được xây dựng cho hai nửa khác nhau của cùng một bài toán, và khoảng cách giá giữa chúng giờ đây đã đủ lớn đến mức "cái nào tốt hơn" có câu trả lời chỉ một dòng cho hầu hết khối lượng công việc.
Nơi mỗi cái thực sự dẫn trước
• Giá niêm yết — GLM-5.3-FlashX $0.37 / $1.25 cho mỗi 1M token đầu vào/đầu ra so với DeepSeek V4.1 Flash $0.15 / $0.60 ngoài giờ cao điểm, $0.30 / $1.20 vào giờ cao điểmbr> • Đầu vào được lưu đệm — FlashX $0.075 mỗi 1M so với DeepSeek $0.003 ngoài giờ cao điểm, khoảng cách 25× cộng dồn rất nhanh trong các vòng lặp agentbr> • Thông lượng đo được — FlashX đạt tối đa 200 tok/s (đỉnh theo nhà cung cấp, chưa công bố số liệu độc lập) so với DeepSeek 214,7 tok/s (Artificial Analysis, trên API của DeepSeek)br> • Thời gian đến token đầu tiên — chưa công bố cho FlashX so với 1,15 giây đo được cho DeepSeek V4.1 Flashbr> • Chỉ số thông minh độc lập — FlashX thừa hưởng mức 42 của GLM-5.3-Flash trên Artificial Analysis Intelligence Index so với DeepSeek V4.1 Flash ở mức 40br> • Kiến trúc — MoE 320B tổng / 18B hoạt động so với 552B tổng với khoảng 8B hoạt động khi prefill và 16B khi decodebr> • Dạng đầu vào — văn bản, hình ảnh, video và tệp so với văn bản và hình ảnhbr> • Giới hạn đầu ra — 131.072 token so với khoảng 384.000br> • Trọng số mở — GLM-5.3-Flash dùng giấy phép MIT; FlashX là gói dịch vụ lưu trữ không có trọng số riêng, còn DeepSeek V4.1 Flash dùng giấy phép MIT

Hãy đọc danh sách đó hai lần, vì chính hình dạng của nó mới là câu chuyện. FlashX thắng đúng hai dòng, và cả hai đều hẹp: lợi thế hai điểm trên một chỉ số trí tuệ độc lập, và đầu vào video. DeepSeek thắng về giá, giá đã cache, tốc độ đo được, độ dài đầu ra và độ rộng phương thức theo đúng nghĩa quan trọng — nó nhận hình ảnh và tạo ra câu trả lời dài. Khoảng cách hai điểm trên chỉ số nằm trong mức nhiễu của một lần chạy benchmark duy nhất và không nên là thứ quyết định kiến trúc của bạn.
Mức tốc độ chậm hơn mẫu rẻ tiền
Đây là phần đáng để dừng lại suy ngẫm. Z.ai xây dựng FlashX để giải quyết một vấn đề có thật: GLM-5.3-Flash chạy chậm. Artificial Analysis đo được nó đạt 98 token đầu ra mỗi giây, cao hơn mức trung vị của các mô hình trọng số mở cùng kích cỡ, nhưng còn xa mới đạt mức tương tác. Cách khắc phục của công ty là tái cấu trúc toàn bộ ngăn xếp phục vụ — khoảng 100.000 bộ tăng tốc nội địa, một engine dựa trên SGLang, lượng tử hóa W8A8, KV cache chính xác hỗn hợp, và kiến trúc phân tách encode–prefill–decode — và họ báo cáo thông lượng đầu-cuối khoảng 3× so với đường cơ sở trên cùng phần cứng.
DeepSeek đã giải quyết cùng vấn đề đó ở tầng kiến trúc, và đã làm được trước tiên. Cách tách Causal Encoder–Decoder của V4.1 Flash kích hoạt khoảng 8B tham số khi prefill và 16B khi decode, thay vì một con số cố định, còn Compressed Sparse Attention 2 với bộ đệm KV FP4 cắt giảm bộ đệm toàn cục xuống còn 890 byte mỗi token — khoảng một phần tư HBM và một phần tám dung lượng lưu trữ SSD mà phiên bản tiền nhiệm cần. Kết quả là một mô hình chạy ở tốc độ 214,7 token mỗi giây theo đo đạc của một phòng thí nghiệm trung lập, trên cùng một API chính hãng, mà không cần gói cao cấp.
200 của Z.ai là mức đỉnh do nhà cung cấp công bố, còn 214,7 của DeepSeek là trung vị độc lập, đây là phép so sánh bất lợi nhất có thể dành cho Z.ai và là lý do để giữ nó một cách dè dặt. Hoàn toàn có thể FlashX đánh bại DeepSeek trong một yêu cầu đã ấm, đầu ra ngắn và không tắc nghẽn. Không thể biết chắc, vì không ai ngoài Z.ai công bố các con số thông lượng của FlashX. Điều có thể biết được ngày nay là hai mô hình nằm trong cùng một dải tốc độ, và một trong hai có giá chỉ bằng một phần ba.

Khi lợi thế về giá của DeepSeek trở nên mang tính cấu trúc
DeepSeek V4.1 Flash tính $0,15 cho mỗi triệu token đầu vào và $0,60 cho mỗi triệu token đầu ra ngoài giờ cao điểm, tăng gấp đôi lên $0,30 và $1,20 trong hai khung giờ các ngày trong tuần (01:00–04:00 và 06:00–10:00 UTC). FlashX có mức giá cố định là $0,37 và $1,25. Đặt cạnh nhau để so sánh thì mức giá cố định trông có vẻ như một ưu điểm đó thực ra lại là cấu trúc đắt đỏ hơn đối với bất kỳ ai có thể sắp xếp công việc theo lịch.
Mục đầu vào được cache là mục quyết định khối lượng công việc của agent. DeepSeek tính $0.003 mỗi triệu token đầu vào được cache ngoài giờ cao điểm; FlashX tính $0.075, cao hơn gấp hai mươi lăm lần. Một agent gửi lại system prompt dài và lược đồ công cụ ở mỗi bước sẽ phải trả khoản chênh lệch đó ở mỗi bước, và đây là khoản mục đơn lẻ có khả năng chiếm phần lớn nhất trong một hóa đơn thực tế. Z.ai ghi lưu trữ cache là miễn phí trong thời gian có hạn, tức là ưu đãi cho lưu trữ chứ không phải cho các lượt đọc vốn thực sự tích lũy.
Có một đối trọng, và đó là sự trung thực về cái giá mà chính các con số của DeepSeek phải trả. Những đánh giá do nhà cung cấp thực hiện đằng sau các điểm số nổi bật của V4.1 Flash được tạo ra ở mức nỗ lực suy luận tối đa, và DeepSeek ghi nhận rằng việc chuyển từ mức nỗ lực 25 lên mức nỗ lực 100 đưa DeepSWE v1.1 từ 66,0 lên 74,2 trong khi tiêu tốn khoảng 2,5× số token đầu ra. Với 2,5× số token, chi phí thực tế của cấu hình nỗ lực cao gần với FlashX hơn nhiều so với mức giá niêm yết gợi ý — và mô hình được ghi nhận là rất dài dòng, tạo ra 250M token đầu ra trên Intelligence Index so với mức trung vị là 130M. Một mức giá rẻ trên mỗi token ở một mô hình nói nhiều không giống với một tác vụ rẻ. Bất kỳ ai so sánh hai mô hình này về giá nên so sánh chi phí cho mỗi tác vụ đã hoàn thành, chứ không phải chi phí trên một triệu token, và nên kỳ vọng đo lường thay vì ước tính.
Làm thế nào để quyết định một cách cụ thể
Nếu khối lượng công việc của bạn là một tác nhân chạy dài hạn với tiền tố ổn định, DeepSeek V4.1 Flash là lựa chọn, và chỉ riêng tỷ lệ đầu vào được lưu trong bộ nhớ đệm đã quyết định điều đó. Nếu bạn cần hiểu video hoặc đầu vào tệp trong cùng một lệnh gọi, FlashX là cái duy nhất trong hai cái hỗ trợ chúng — đó là khác biệt thực sự về năng lực, không phải khác biệt trên bảng thông số kỹ thuật. Nếu bạn cần các đầu ra dài được tạo, giới hạn đầu ra khoảng 384K của DeepSeek so với 131,072 của FlashX có ý nghĩa đối với việc tạo báo cáo, các tệp mã dài và bất cứ thứ gì tổng hợp thay vì trả lời. Nếu bạn cần điểm độc lập mạnh nhất trên một chỉ số benchmark đơn lẻ, con số 42 của FlashX so với 40 là thật nhưng quá nhỏ để dựa vào.
Cả hai mô hình đều có thể truy cập từ một endpoint nếu stack của bạn đã được định tuyến sẵn, và đây là cách rẻ nhất để giải quyết chuyện này. Trên OrcaRouter giá niêm yết của nhà cung cấp được chuyển nguyên qua với mức markup 0%, nên mức giảm giá ngoài giờ cao điểm của DeepSeek và mọi thay đổi giá trong tương lai của Z.ai đều được cập nhật ngay trong ngày chúng xảy ra, còn việc chuyển đổi giữa hai mô hình chỉ là đổi một chuỗi mô hình chứ không phải một tích hợp. Tính năng chuyển đổi dự phòng tự động đặc biệt đáng có đối với FlashX: đây là một tầng phục vụ mới được ba tuần tuổi trên một cụm mới, và kiểu lỗi mà bạn đang phòng ngừa là giới hạn dung lượng, chứ không phải một mô hình ngừng hoạt động.
Tóm tắt thẳng thừng: DeepSeek V4.1 Flash là lựa chọn mặc định tốt hơn cho hầu hết công việc production — rẻ hơn trên mỗi token, rẻ hơn trên mỗi token được cache, được đo là nhanh hơn, và có khả năng tạo đầu ra dài hơn. GLM-5.3-FlashX là lựa chọn đúng trong một dải hẹp hơn, nơi bạn cần đầu vào video hoặc tệp và muốn một chỉ số độc lập cao hơn một chút đứng đằng sau nó. Z.ai đã định giá một hạng tốc độ ở mức cao cấp và tung nó ra thị trường nơi mô hình nhanh, rẻ đã tồn tại sẵn. Đó là toàn bộ sự so sánh.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
