Thẻ tiêu đề hero cho GLM-5.3-FlashX vs GLM-5.3-Flash, với phụ đề 'Cùng trọng số, hai mức giá', cùng các chip ghi '200 vs 98 tok/s', '$0.37 / $1.25 vs $0.15 / $0.50' và 'Trí tuệ giống hệt nhau', và dòng chân trang 'GLM-5.3-FlashX ra mắt ngày 18 tháng 9 năm 2026'.
Guides & Insights

GLM-5.3-FlashX so với GLM-5.3-Flash: Cùng trọng số, giá gấp 2,5 lần, chỉ khác một con số

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Bạn không thể mua GLM-5.3-FlashX và nhận được một mô hình tốt hơn. Đó không phải là lời chỉ trích — mà chính là toàn bộ tiền đề. GLM-5.3-FlashX, ra mắt trên API của Z.ai vào ngày 18 tháng 9 năm 2026, chạy cùng bộ trọng số như GLM-5.3-Flash: cùng kiến trúc hỗn hợp chuyên gia (mixture-of-experts) với tổng 320B tham số, 18B tham số hoạt động, cùng ngữ cảnh 1M token, cùng khả năng nhập văn bản, hình ảnh, video và tệp gốc, cùng giới hạn đầu ra 131.072 token. Z.ai không công bố bất kỳ kết quả đánh giá nào cho FlashX vì không có gì mới để đánh giá. Điều khác biệt nằm ở tốc độ sinh token và chi phí, và đó là hai con số duy nhất mà người mua cần cân nhắc.

Đó là một quyết định rõ ràng hơn so với hầu hết các so sánh mô hình, và cũng khó hơn, bởi vì không có câu chuyện về năng lực nào để núp đằng sau. Hoặc là độ trễ đáng giá gấp 2,5 lần đối với bạn, hoặc là không.

Một mô hình, hai mức giá

• FlashX là gì — một tầng phục vụ, không phải một bản phát hành model; cùng trọng số, cùng điểm số, cùng giới hạnbr> • Giá đầu vào — $0.37 mỗi 1M token trên FlashX so với $0.15 mỗi 1M trên Flash theo giá niêm yếtbr> • Giá đầu ra — $1.25 mỗi 1M so với $0.50 mỗi 1M, hệ số nhân thực sự làm thay đổi hóa đơnbr> • Đầu vào được cache — $0.075 mỗi 1M so với $0.03 mỗi 1Mbr> • Tốc độ — lên đến 200 token đầu ra mỗi giây (đỉnh do nhà cung cấp báo cáo) so với 98 tok/s do Artificial Analysis đo độc lậpbr> • Truy cập qua gói đăng ký — GLM-5.3-Flash được bao gồm trong GLM Coding Plan của Z.ai với hạn mức gấp 3×; FlashX thì khôngbr> • Tự triển khai — GLM-5.3-Flash là trọng số mở theo giấy phép MIT trên Hugging Face; FlashX không có trọng số để tải về

A two-column scoreboard titled 'GLM-5.3-FlashX vs GLM-5.3-Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: hosted tier only'; the GLM-5.3-Flash column reads 'Price: $0.15 / $0.50 per 1M', 'Cached input: $0.03 per 1M', 'Speed: 98 tok/s (measured)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: MIT open weights'; the footer reads 'Same weights and same scores; only serving speed and price differ.'

Tại thị trường quê nhà của Z.ai, tỷ lệ tương tự được nêu thẳng thắn: ¥2 đầu vào và ¥7 đầu ra cho FlashX so với ¥0,8 và ¥2,8 cho Flash. Nhiều hãng truyền thông Trung Quốc mô tả buổi ra mắt theo cùng một cách — tốc độ gấp 5 lần với mức giá gấp 2,5 lần — và tất cả đều lưu ý rằng trí tuệ không thay đổi.

Độ trễ là một khoản mục, và nó không được định giá theo token.

Lý do khiến mức 2,5× không tự động bị coi là một thỏa thuận tồi là vì giá token và chi phí tác vụ là hai đại lượng khác nhau. Một công việc theo lô tạo ra một triệu token đầu ra qua đêm chỉ trả 0,50 đô la trên Flash và 1,25 đô la trên FlashX cho phần đầu ra, và không nhận lại được gì cho 0,75 đô la tăng thêm vì không ai đang chờ. Một vòng lặp tác nhân thực hiện mười cuộc gọi tuần tự cũng trả cùng mức phụ trội trên mỗi token, nhưng mỗi cuộc gọi trả về nhanh hơn, và khoản tiết kiệm nằm ở thời gian thực tế chứ không phải trên hóa đơn. Nếu FlashX thực sự trả về trong một phần nhỏ thời gian, mười lượt có thể trả lại hàng chục giây độ trễ cho mỗi tác vụ — và nếu tác vụ đó đang chặn một con người hoặc một dịch vụ thượng nguồn, thì số giây đó đáng giá hơn số token.

Định vị của chính Z.ai đi theo đúng hướng này. Nó hướng FlashX đến lập trình có độ đồng thời cao, các lệnh gọi agent nhiều bước, đối thoại thời gian thực, hoàn thiện mã và công việc đa phương thức ngữ cảnh dài, đồng thời hướng các khối lượng công việc nhạy cảm về giá, không nhạy cảm với độ trễ — theo lô ngoại tuyến, tạo hàng loạt, bất cứ thứ gì được lên lịch — trở lại Flash cơ sở. Đó là sự phân chia đúng đắn, và đáng chú ý rằng nhà cung cấp chính là bên vạch ra sự phân chia đó.

Chỗ mà lập luận sụp đổ là ở phía thông lượng. 200 token mỗi giây của FlashX là mức đỉnh mà nhà cung cấp báo cáo; còn 98 của mô hình cơ sở là trung vị do một phòng thí nghiệm độc lập đo được. Mức đỉnh đạt được trên các đầu ra ngắn với bộ nhớ đệm ấm và một cụm nhàn rỗi. Một yêu cầu đa phương thức ngữ cảnh dài — đúng loại khối lượng công việc mà FlashX hướng đến — là trường hợp ít có khả năng đạt tới mức đó nhất, và không ai ngoài Z.ai đã công bố số liệu để giải quyết câu hỏi này. Nếu khối lượng công việc của bạn bị giới hạn bởi thông lượng thay vì độ trễ, một con số đỉnh chẳng cho bạn biết được bao nhiêu về những gì bạn thực sự sẽ nhận được.

Cửa thoát hiểm mà FlashX không có

Có một lựa chọn thứ ba trong so sánh này, và nó tồn tại chỉ vì mô hình cơ sở là mở. GLM-5.3-Flash đã phát hành vào ngày 26 tháng 8 năm 2026 theo giấy phép MIT, với trọng số trên Hugging Face và ModelScope, và hiện nay nó được phục vụ bởi các stack suy luận bao gồm SGLang, vLLM, TokenSpeed và KTransformers. Nếu khối lượng của bạn đủ cao để biện minh cho phần cứng, thì so sánh trung thực không phải là Flash so với FlashX — mà là $1.25 cho mỗi triệu token đầu ra của FlashX so với chi phí phân bổ trên mỗi token của chính bạn trên các bộ tăng tốc của chính bạn.

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 19, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input, a 2026-08-26 release date by Z.ai, the 320B total / 18B active parameter line, and the billing row reading $0.07 per 1M input and $0.25 per 1M output tokens with a 6.68-second p50 time to first token.

Lựa chọn đó có một mức giá gia nhập thực sự. Bản phát hành FP8 cần khoảng 328 GB bộ nhớ GPU để phục vụ, tức là một triển khai đa nút đối với hầu hết các đội ngũ và là điều không thể bắt đầu đối với số còn lại. Nhưng điều đó đáng được nêu ra bởi vì chính sự bất đối xứng này khiến cho mức giá của FlashX trở thành một phép thử có chủ đích thay vì một điều tất yếu: Z.ai đang tính phí cao cho một cấu hình phục vụ mà, đối với mô hình cơ sở, khách hàng về nguyên tắc có thể tự xây dựng. Khoản phí cao đó là để mua sự tiện lợi, không phải để mua năng lực, và sự tiện lợi có một mức giá thị trường giảm dần theo thời gian.

Thực chất của việc thay đổi giá là gì

Những tính toán kinh tế đằng sau lần ra mắt này rõ ràng một cách bất thường. GLM-5.3-Flash được phát hành với mức giá bằng một phần mười GLM-5.3 — thậm chí chỉ bằng một nửa mức đó trong đợt khuyến mãi ra mắt — và nó đã được sử dụng rất nhiều, bao gồm một giai đoạn thử nghiệm ẩn danh trước khi phát hành mà Z.ai sau đó đã xác nhận. FlashX là lần đầu tiên dòng sản phẩm này đi theo hướng ngược lại: cùng một mô hình, nhưng được định giá cao hơn. Các nhà phân tích được trích dẫn trên báo chí tài chính Trung Quốc coi đây là một phép thử thương mại có chủ đích nhằm xem liệu các nhà phát triển có sẵn sàng trả tiền cho tốc độ như một yếu tố riêng biệt hay không, sau một năm mua thị phần bằng năng lực gần tầm tiên tiến nhất với mức giá phổ thông.

Hai chi tiết củng cố cách hiểu đó. FlashX bị loại khỏi GLM Coding Plan trong khi Flash cơ bản được bao gồm với hạn mức gấp ba, nên người dùng thuê bao không thể gộp gói mới vào cam kết hiện có — họ trả tiền theo token. Và mức giá là cố định, không có giảm giá ngoài giờ cao điểm, khác với cấu trúc theo thời điểm trong ngày mà một số đối thủ dùng để lấp đầy công suất nhàn rỗi. Mức 2,5× cố định cho một gói tốc độ là cái giá dành cho những người không thể chờ đợi, và Z.ai đang tìm hiểu xem có bao nhiêu người như vậy.

Lựa chọn giữa chúng

Hãy chọn FlashX nếu một người hoặc một dịch vụ đang bị chặn ở token tiếp theo và bản thân mô hình đã là lựa chọn đúng — hoàn thành nội tuyến, tác nhân tương tác, trò chuyện thời gian thực, bất cứ thứ gì mà chính sự chờ đợi là sản phẩm. Hãy chọn GLM-5.3-Flash cho công việc theo lô, ngoại tuyến và khối lượng lớn, cho bất cứ thứ gì bạn có thể lên lịch, và cho bất kỳ khối lượng công việc nào mà bạn đang trả tiền cho khối lượng đầu ra thay vì độ trễ đầu ra. Nếu khối lượng của bạn lớn và nhóm của bạn có thể vận hành các bộ tăng tốc, hãy tính giá trọng số cơ sở tự vận hành trước khi tính giá FlashX; sự so sánh sẽ thuận lợi hơn mức mà giá token gợi ý.

Dù bạn chọn cách nào, hãy coi hai cái đó là có thể hoán đổi cho nhau tại điểm gọi. Chúng nhận cùng prompt, trả về cùng định dạng và cho ra cùng chất lượng — thứ duy nhất thay đổi là một chuỗi model, và đây là kiểu A/B test rẻ nhất để chạy. Trên OrcaRouter giá niêm yết của nhà cung cấp được chuyển nguyên qua với mức markup 0%, nên một thay đổi về giá hay khuyến mãi của Z.ai sẽ được áp dụng ngay ngày nó lên sóng ở phía thượng nguồn, và cả hai hạng đều nằm sau một endpoint duy nhất đứng trước hơn 200 model. Với một quyết định phụ thuộc hoàn toàn vào độ trễ đo được, việc có thể chuyển đổi giữa chúng ngay giữa thí nghiệm mà không cần đụng đến phần tích hợp của bạn đã là phần lớn công việc.

Phán quyết này hẹp hơn một so sánh mô hình thông thường, và đó chính là điểm mấu chốt. FlashX không phải là một mô hình tốt hơn và cũng không giả vờ như vậy. Đó là cùng một mô hình với hàng đợi ngắn hơn, được bán ở mức giá chỉ hợp lý nếu hàng đợi chính là vấn đề của bạn. Hãy tự đo thời gian đến token đầu tiên của mình trên cả hai trước khi quyết định — con số 200 của nhà cung cấp chỉ là mức trần, khối lượng công việc của bạn mới là thước đo duy nhất đáng quan tâm, và sự khác biệt giữa hai hạng chỉ cách một thay đổi cấu hình.

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 19, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, $0.15 per 1M input and $0.50 per 1M output tokens, and a measured 98 output tokens per second against an average of 71.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày