
GLM-5.3-FlashX so với GLM-5.3-Flash: Cùng trọng số, giá gấp 2,5 lần, chỉ khác một con số
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Bạn không thể mua GLM-5.3-FlashX và nhận được một mô hình tốt hơn. Đó không phải là lời chỉ trích — mà chính là toàn bộ tiền đề. GLM-5.3-FlashX, ra mắt trên API của Z.ai vào ngày 18 tháng 9 năm 2026, chạy cùng bộ trọng số như GLM-5.3-Flash: cùng kiến trúc hỗn hợp chuyên gia (mixture-of-experts) với tổng 320B tham số, 18B tham số hoạt động, cùng ngữ cảnh 1M token, cùng khả năng nhập văn bản, hình ảnh, video và tệp gốc, cùng giới hạn đầu ra 131.072 token. Z.ai không công bố bất kỳ kết quả đánh giá nào cho FlashX vì không có gì mới để đánh giá. Điều khác biệt nằm ở tốc độ sinh token và chi phí, và đó là hai con số duy nhất mà người mua cần cân nhắc.
Đó là một quyết định rõ ràng hơn so với hầu hết các so sánh mô hình, và cũng khó hơn, bởi vì không có câu chuyện về năng lực nào để núp đằng sau. Hoặc là độ trễ đáng giá gấp 2,5 lần đối với bạn, hoặc là không.
Một mô hình, hai mức giá
• FlashX là gì — một tầng phục vụ, không phải một bản phát hành model; cùng trọng số, cùng điểm số, cùng giới hạnbr> • Giá đầu vào — $0.37 mỗi 1M token trên FlashX so với $0.15 mỗi 1M trên Flash theo giá niêm yếtbr> • Giá đầu ra — $1.25 mỗi 1M so với $0.50 mỗi 1M, hệ số nhân thực sự làm thay đổi hóa đơnbr> • Đầu vào được cache — $0.075 mỗi 1M so với $0.03 mỗi 1Mbr> • Tốc độ — lên đến 200 token đầu ra mỗi giây (đỉnh do nhà cung cấp báo cáo) so với 98 tok/s do Artificial Analysis đo độc lậpbr> • Truy cập qua gói đăng ký — GLM-5.3-Flash được bao gồm trong GLM Coding Plan của Z.ai với hạn mức gấp 3×; FlashX thì khôngbr> • Tự triển khai — GLM-5.3-Flash là trọng số mở theo giấy phép MIT trên Hugging Face; FlashX không có trọng số để tải về

Tại thị trường quê nhà của Z.ai, tỷ lệ tương tự được nêu thẳng thắn: ¥2 đầu vào và ¥7 đầu ra cho FlashX so với ¥0,8 và ¥2,8 cho Flash. Nhiều hãng truyền thông Trung Quốc mô tả buổi ra mắt theo cùng một cách — tốc độ gấp 5 lần với mức giá gấp 2,5 lần — và tất cả đều lưu ý rằng trí tuệ không thay đổi.
Độ trễ là một khoản mục, và nó không được định giá theo token.
Lý do khiến mức 2,5× không tự động bị coi là một thỏa thuận tồi là vì giá token và chi phí tác vụ là hai đại lượng khác nhau. Một công việc theo lô tạo ra một triệu token đầu ra qua đêm chỉ trả 0,50 đô la trên Flash và 1,25 đô la trên FlashX cho phần đầu ra, và không nhận lại được gì cho 0,75 đô la tăng thêm vì không ai đang chờ. Một vòng lặp tác nhân thực hiện mười cuộc gọi tuần tự cũng trả cùng mức phụ trội trên mỗi token, nhưng mỗi cuộc gọi trả về nhanh hơn, và khoản tiết kiệm nằm ở thời gian thực tế chứ không phải trên hóa đơn. Nếu FlashX thực sự trả về trong một phần nhỏ thời gian, mười lượt có thể trả lại hàng chục giây độ trễ cho mỗi tác vụ — và nếu tác vụ đó đang chặn một con người hoặc một dịch vụ thượng nguồn, thì số giây đó đáng giá hơn số token.
Định vị của chính Z.ai đi theo đúng hướng này. Nó hướng FlashX đến lập trình có độ đồng thời cao, các lệnh gọi agent nhiều bước, đối thoại thời gian thực, hoàn thiện mã và công việc đa phương thức ngữ cảnh dài, đồng thời hướng các khối lượng công việc nhạy cảm về giá, không nhạy cảm với độ trễ — theo lô ngoại tuyến, tạo hàng loạt, bất cứ thứ gì được lên lịch — trở lại Flash cơ sở. Đó là sự phân chia đúng đắn, và đáng chú ý rằng nhà cung cấp chính là bên vạch ra sự phân chia đó.
Chỗ mà lập luận sụp đổ là ở phía thông lượng. 200 token mỗi giây của FlashX là mức đỉnh mà nhà cung cấp báo cáo; còn 98 của mô hình cơ sở là trung vị do một phòng thí nghiệm độc lập đo được. Mức đỉnh đạt được trên các đầu ra ngắn với bộ nhớ đệm ấm và một cụm nhàn rỗi. Một yêu cầu đa phương thức ngữ cảnh dài — đúng loại khối lượng công việc mà FlashX hướng đến — là trường hợp ít có khả năng đạt tới mức đó nhất, và không ai ngoài Z.ai đã công bố số liệu để giải quyết câu hỏi này. Nếu khối lượng công việc của bạn bị giới hạn bởi thông lượng thay vì độ trễ, một con số đỉnh chẳng cho bạn biết được bao nhiêu về những gì bạn thực sự sẽ nhận được.
Cửa thoát hiểm mà FlashX không có
Có một lựa chọn thứ ba trong so sánh này, và nó tồn tại chỉ vì mô hình cơ sở là mở. GLM-5.3-Flash đã phát hành vào ngày 26 tháng 8 năm 2026 theo giấy phép MIT, với trọng số trên Hugging Face và ModelScope, và hiện nay nó được phục vụ bởi các stack suy luận bao gồm SGLang, vLLM, TokenSpeed và KTransformers. Nếu khối lượng của bạn đủ cao để biện minh cho phần cứng, thì so sánh trung thực không phải là Flash so với FlashX — mà là $1.25 cho mỗi triệu token đầu ra của FlashX so với chi phí phân bổ trên mỗi token của chính bạn trên các bộ tăng tốc của chính bạn.

Lựa chọn đó có một mức giá gia nhập thực sự. Bản phát hành FP8 cần khoảng 328 GB bộ nhớ GPU để phục vụ, tức là một triển khai đa nút đối với hầu hết các đội ngũ và là điều không thể bắt đầu đối với số còn lại. Nhưng điều đó đáng được nêu ra bởi vì chính sự bất đối xứng này khiến cho mức giá của FlashX trở thành một phép thử có chủ đích thay vì một điều tất yếu: Z.ai đang tính phí cao cho một cấu hình phục vụ mà, đối với mô hình cơ sở, khách hàng về nguyên tắc có thể tự xây dựng. Khoản phí cao đó là để mua sự tiện lợi, không phải để mua năng lực, và sự tiện lợi có một mức giá thị trường giảm dần theo thời gian.
Thực chất của việc thay đổi giá là gì
Những tính toán kinh tế đằng sau lần ra mắt này rõ ràng một cách bất thường. GLM-5.3-Flash được phát hành với mức giá bằng một phần mười GLM-5.3 — thậm chí chỉ bằng một nửa mức đó trong đợt khuyến mãi ra mắt — và nó đã được sử dụng rất nhiều, bao gồm một giai đoạn thử nghiệm ẩn danh trước khi phát hành mà Z.ai sau đó đã xác nhận. FlashX là lần đầu tiên dòng sản phẩm này đi theo hướng ngược lại: cùng một mô hình, nhưng được định giá cao hơn. Các nhà phân tích được trích dẫn trên báo chí tài chính Trung Quốc coi đây là một phép thử thương mại có chủ đích nhằm xem liệu các nhà phát triển có sẵn sàng trả tiền cho tốc độ như một yếu tố riêng biệt hay không, sau một năm mua thị phần bằng năng lực gần tầm tiên tiến nhất với mức giá phổ thông.
Hai chi tiết củng cố cách hiểu đó. FlashX bị loại khỏi GLM Coding Plan trong khi Flash cơ bản được bao gồm với hạn mức gấp ba, nên người dùng thuê bao không thể gộp gói mới vào cam kết hiện có — họ trả tiền theo token. Và mức giá là cố định, không có giảm giá ngoài giờ cao điểm, khác với cấu trúc theo thời điểm trong ngày mà một số đối thủ dùng để lấp đầy công suất nhàn rỗi. Mức 2,5× cố định cho một gói tốc độ là cái giá dành cho những người không thể chờ đợi, và Z.ai đang tìm hiểu xem có bao nhiêu người như vậy.
Lựa chọn giữa chúng
Hãy chọn FlashX nếu một người hoặc một dịch vụ đang bị chặn ở token tiếp theo và bản thân mô hình đã là lựa chọn đúng — hoàn thành nội tuyến, tác nhân tương tác, trò chuyện thời gian thực, bất cứ thứ gì mà chính sự chờ đợi là sản phẩm. Hãy chọn GLM-5.3-Flash cho công việc theo lô, ngoại tuyến và khối lượng lớn, cho bất cứ thứ gì bạn có thể lên lịch, và cho bất kỳ khối lượng công việc nào mà bạn đang trả tiền cho khối lượng đầu ra thay vì độ trễ đầu ra. Nếu khối lượng của bạn lớn và nhóm của bạn có thể vận hành các bộ tăng tốc, hãy tính giá trọng số cơ sở tự vận hành trước khi tính giá FlashX; sự so sánh sẽ thuận lợi hơn mức mà giá token gợi ý.
Dù bạn chọn cách nào, hãy coi hai cái đó là có thể hoán đổi cho nhau tại điểm gọi. Chúng nhận cùng prompt, trả về cùng định dạng và cho ra cùng chất lượng — thứ duy nhất thay đổi là một chuỗi model, và đây là kiểu A/B test rẻ nhất để chạy. Trên OrcaRouter giá niêm yết của nhà cung cấp được chuyển nguyên qua với mức markup 0%, nên một thay đổi về giá hay khuyến mãi của Z.ai sẽ được áp dụng ngay ngày nó lên sóng ở phía thượng nguồn, và cả hai hạng đều nằm sau một endpoint duy nhất đứng trước hơn 200 model. Với một quyết định phụ thuộc hoàn toàn vào độ trễ đo được, việc có thể chuyển đổi giữa chúng ngay giữa thí nghiệm mà không cần đụng đến phần tích hợp của bạn đã là phần lớn công việc.
Phán quyết này hẹp hơn một so sánh mô hình thông thường, và đó chính là điểm mấu chốt. FlashX không phải là một mô hình tốt hơn và cũng không giả vờ như vậy. Đó là cùng một mô hình với hàng đợi ngắn hơn, được bán ở mức giá chỉ hợp lý nếu hàng đợi chính là vấn đề của bạn. Hãy tự đo thời gian đến token đầu tiên của mình trên cả hai trước khi quyết định — con số 200 của nhà cung cấp chỉ là mức trần, khối lượng công việc của bạn mới là thước đo duy nhất đáng quan tâm, và sự khác biệt giữa hai hạng chỉ cách một thay đổi cấu hình.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
