Thẻ tiêu đề hero cho GLM-5.3-FlashX vs DeepSeek V4.1 Flash, với phụ đề 'Phân khúc tốc độ lại chậm hơn cả mô hình giá rẻ', cùng các chip ghi '200 vs 214.7 tok/s', '$0.37 / $1.25 vs $0.15 / $0.60' và 'AA 42 vs 40', và dòng chân trang 'GLM-5.3-FlashX ra mắt ngày 18 tháng 9 năm 2026'.
Guides & Insights

GLM-5.3-FlashX vs DeepSeek V4.1 Flash: Hạng tốc độ còn chậm hơn cả mô hình giá rẻ

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Gói tốc độ cao cấp của Z.ai có một vấn đề, và nó mang tên DeepSeek V4.1 Flash. Khi Z.ai ra mắt GLM-5.3-FlashX vào ngày 18 tháng 9 năm 2026, hãng đã bán gói mới này bằng một con số duy nhất: tối đa 200 token đầu ra mỗi giây, gấp khoảng năm lần thông lượng của GLM-5.3-Flash mà nó được xây dựng dựa trên, với mức giá gấp 2,5 lần. Các phép đo độc lập đã đặt mô hình giá rẻ của DeepSeek ở mức 214,7 token mỗi giây với thời gian tới token đầu tiên là 1,15 giây — nhanh hơn ở cả hai chỉ số so với mức trần mà Z.ai đang quảng cáo, và ở mức giá mà FlashX không thể nào bì tới. Nếu bạn đang mua tốc độ, thị trường đã dịch chuyển trước khi FlashX xuất hiện.

Cách đặt vấn đề đó là bất công với FlashX ở một điểm cụ thể, và công bằng ở mọi điểm khác. Cả hai mô hình đều là các dẫn xuất trọng số mở với ngữ cảnh 1M được thiết kế để tối ưu chi phí, và cả hai đều thực sự giỏi ở việc mà chúng được tạo ra để làm. Nhưng chúng được xây dựng cho hai nửa khác nhau của cùng một bài toán, và khoảng cách giá giữa chúng giờ đây đã đủ lớn đến mức "cái nào tốt hơn" có câu trả lời chỉ một dòng cho hầu hết khối lượng công việc.

Nơi mỗi cái thực sự dẫn trước

• Giá niêm yết — GLM-5.3-FlashX $0.37 / $1.25 cho mỗi 1M token đầu vào/đầu ra so với DeepSeek V4.1 Flash $0.15 / $0.60 ngoài giờ cao điểm, $0.30 / $1.20 vào giờ cao điểmbr> • Đầu vào được lưu đệm — FlashX $0.075 mỗi 1M so với DeepSeek $0.003 ngoài giờ cao điểm, khoảng cách 25× cộng dồn rất nhanh trong các vòng lặp agentbr> • Thông lượng đo được — FlashX đạt tối đa 200 tok/s (đỉnh theo nhà cung cấp, chưa công bố số liệu độc lập) so với DeepSeek 214,7 tok/s (Artificial Analysis, trên API của DeepSeek)br> • Thời gian đến token đầu tiên — chưa công bố cho FlashX so với 1,15 giây đo được cho DeepSeek V4.1 Flashbr> • Chỉ số thông minh độc lập — FlashX thừa hưởng mức 42 của GLM-5.3-Flash trên Artificial Analysis Intelligence Index so với DeepSeek V4.1 Flash ở mức 40br> • Kiến trúc — MoE 320B tổng / 18B hoạt động so với 552B tổng với khoảng 8B hoạt động khi prefill và 16B khi decodebr> • Dạng đầu vào — văn bản, hình ảnh, video và tệp so với văn bản và hình ảnhbr> • Giới hạn đầu ra — 131.072 token so với khoảng 384.000br> • Trọng số mở — GLM-5.3-Flash dùng giấy phép MIT; FlashX là gói dịch vụ lưu trữ không có trọng số riêng, còn DeepSeek V4.1 Flash dùng giấy phép MIT

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

Hãy đọc danh sách đó hai lần, vì chính hình dạng của nó mới là câu chuyện. FlashX thắng đúng hai dòng, và cả hai đều hẹp: lợi thế hai điểm trên một chỉ số trí tuệ độc lập, và đầu vào video. DeepSeek thắng về giá, giá đã cache, tốc độ đo được, độ dài đầu ra và độ rộng phương thức theo đúng nghĩa quan trọng — nó nhận hình ảnh và tạo ra câu trả lời dài. Khoảng cách hai điểm trên chỉ số nằm trong mức nhiễu của một lần chạy benchmark duy nhất và không nên là thứ quyết định kiến trúc của bạn.

Mức tốc độ chậm hơn mẫu rẻ tiền

Đây là phần đáng để dừng lại suy ngẫm. Z.ai xây dựng FlashX để giải quyết một vấn đề có thật: GLM-5.3-Flash chạy chậm. Artificial Analysis đo được nó đạt 98 token đầu ra mỗi giây, cao hơn mức trung vị của các mô hình trọng số mở cùng kích cỡ, nhưng còn xa mới đạt mức tương tác. Cách khắc phục của công ty là tái cấu trúc toàn bộ ngăn xếp phục vụ — khoảng 100.000 bộ tăng tốc nội địa, một engine dựa trên SGLang, lượng tử hóa W8A8, KV cache chính xác hỗn hợp, và kiến trúc phân tách encode–prefill–decode — và họ báo cáo thông lượng đầu-cuối khoảng 3× so với đường cơ sở trên cùng phần cứng.

DeepSeek đã giải quyết cùng vấn đề đó ở tầng kiến trúc, và đã làm được trước tiên. Cách tách Causal Encoder–Decoder của V4.1 Flash kích hoạt khoảng 8B tham số khi prefill và 16B khi decode, thay vì một con số cố định, còn Compressed Sparse Attention 2 với bộ đệm KV FP4 cắt giảm bộ đệm toàn cục xuống còn 890 byte mỗi token — khoảng một phần tư HBM và một phần tám dung lượng lưu trữ SSD mà phiên bản tiền nhiệm cần. Kết quả là một mô hình chạy ở tốc độ 214,7 token mỗi giây theo đo đạc của một phòng thí nghiệm trung lập, trên cùng một API chính hãng, mà không cần gói cao cấp.

200 của Z.ai là mức đỉnh do nhà cung cấp công bố, còn 214,7 của DeepSeek là trung vị độc lập, đây là phép so sánh bất lợi nhất có thể dành cho Z.ai và là lý do để giữ nó một cách dè dặt. Hoàn toàn có thể FlashX đánh bại DeepSeek trong một yêu cầu đã ấm, đầu ra ngắn và không tắc nghẽn. Không thể biết chắc, vì không ai ngoài Z.ai công bố các con số thông lượng của FlashX. Điều có thể biết được ngày nay là hai mô hình nằm trong cùng một dải tốc độ, và một trong hai có giá chỉ bằng một phần ba.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

Khi lợi thế về giá của DeepSeek trở nên mang tính cấu trúc

DeepSeek V4.1 Flash tính $0,15 cho mỗi triệu token đầu vào và $0,60 cho mỗi triệu token đầu ra ngoài giờ cao điểm, tăng gấp đôi lên $0,30 và $1,20 trong hai khung giờ các ngày trong tuần (01:00–04:00 và 06:00–10:00 UTC). FlashX có mức giá cố định là $0,37 và $1,25. Đặt cạnh nhau để so sánh thì mức giá cố định trông có vẻ như một ưu điểm đó thực ra lại là cấu trúc đắt đỏ hơn đối với bất kỳ ai có thể sắp xếp công việc theo lịch.

Mục đầu vào được cache là mục quyết định khối lượng công việc của agent. DeepSeek tính $0.003 mỗi triệu token đầu vào được cache ngoài giờ cao điểm; FlashX tính $0.075, cao hơn gấp hai mươi lăm lần. Một agent gửi lại system prompt dài và lược đồ công cụ ở mỗi bước sẽ phải trả khoản chênh lệch đó ở mỗi bước, và đây là khoản mục đơn lẻ có khả năng chiếm phần lớn nhất trong một hóa đơn thực tế. Z.ai ghi lưu trữ cache là miễn phí trong thời gian có hạn, tức là ưu đãi cho lưu trữ chứ không phải cho các lượt đọc vốn thực sự tích lũy.

Có một đối trọng, và đó là sự trung thực về cái giá mà chính các con số của DeepSeek phải trả. Những đánh giá do nhà cung cấp thực hiện đằng sau các điểm số nổi bật của V4.1 Flash được tạo ra ở mức nỗ lực suy luận tối đa, và DeepSeek ghi nhận rằng việc chuyển từ mức nỗ lực 25 lên mức nỗ lực 100 đưa DeepSWE v1.1 từ 66,0 lên 74,2 trong khi tiêu tốn khoảng 2,5× số token đầu ra. Với 2,5× số token, chi phí thực tế của cấu hình nỗ lực cao gần với FlashX hơn nhiều so với mức giá niêm yết gợi ý — và mô hình được ghi nhận là rất dài dòng, tạo ra 250M token đầu ra trên Intelligence Index so với mức trung vị là 130M. Một mức giá rẻ trên mỗi token ở một mô hình nói nhiều không giống với một tác vụ rẻ. Bất kỳ ai so sánh hai mô hình này về giá nên so sánh chi phí cho mỗi tác vụ đã hoàn thành, chứ không phải chi phí trên một triệu token, và nên kỳ vọng đo lường thay vì ước tính.

Làm thế nào để quyết định một cách cụ thể

Nếu khối lượng công việc của bạn là một tác nhân chạy dài hạn với tiền tố ổn định, DeepSeek V4.1 Flash là lựa chọn, và chỉ riêng tỷ lệ đầu vào được lưu trong bộ nhớ đệm đã quyết định điều đó. Nếu bạn cần hiểu video hoặc đầu vào tệp trong cùng một lệnh gọi, FlashX là cái duy nhất trong hai cái hỗ trợ chúng — đó là khác biệt thực sự về năng lực, không phải khác biệt trên bảng thông số kỹ thuật. Nếu bạn cần các đầu ra dài được tạo, giới hạn đầu ra khoảng 384K của DeepSeek so với 131,072 của FlashX có ý nghĩa đối với việc tạo báo cáo, các tệp mã dài và bất cứ thứ gì tổng hợp thay vì trả lời. Nếu bạn cần điểm độc lập mạnh nhất trên một chỉ số benchmark đơn lẻ, con số 42 của FlashX so với 40 là thật nhưng quá nhỏ để dựa vào.

Cả hai mô hình đều có thể truy cập từ một endpoint nếu stack của bạn đã được định tuyến sẵn, và đây là cách rẻ nhất để giải quyết chuyện này. Trên OrcaRouter giá niêm yết của nhà cung cấp được chuyển nguyên qua với mức markup 0%, nên mức giảm giá ngoài giờ cao điểm của DeepSeek và mọi thay đổi giá trong tương lai của Z.ai đều được cập nhật ngay trong ngày chúng xảy ra, còn việc chuyển đổi giữa hai mô hình chỉ là đổi một chuỗi mô hình chứ không phải một tích hợp. Tính năng chuyển đổi dự phòng tự động đặc biệt đáng có đối với FlashX: đây là một tầng phục vụ mới được ba tuần tuổi trên một cụm mới, và kiểu lỗi mà bạn đang phòng ngừa là giới hạn dung lượng, chứ không phải một mô hình ngừng hoạt động.

Tóm tắt thẳng thừng: DeepSeek V4.1 Flash là lựa chọn mặc định tốt hơn cho hầu hết công việc production — rẻ hơn trên mỗi token, rẻ hơn trên mỗi token được cache, được đo là nhanh hơn, và có khả năng tạo đầu ra dài hơn. GLM-5.3-FlashX là lựa chọn đúng trong một dải hẹp hơn, nơi bạn cần đầu vào video hoặc tệp và muốn một chỉ số độc lập cao hơn một chút đứng đằng sau nó. Z.ai đã định giá một hạng tốc độ ở mức cao cấp và tung nó ra thị trường nơi mô hình nhanh, rẻ đã tồn tại sẵn. Đó là toàn bộ sự so sánh.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày