Thẻ tiêu đề hero cho GLM-5.3-FlashX, phụ đề 'Cùng trọng số, giá gấp 2,5 lần', với các chip ghi 'Lên tới 200 tok/s (nhà cung cấp)', '$0,37 / $1,25 mỗi 1M' và 'ngữ cảnh 1M', cùng dòng chân trang 'Tier phục vụ ra mắt ngày 18 tháng 9 năm 2026'.
Guides & Insights

GLM-5.3-FlashX ra mắt với mức giá gấp 2,5 lần so với mô hình mà nó chạy trên đó

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Con số đáng chú ý không phải là 200. Mà là 2,5. Vào ngày 18 tháng 9 năm 2026, Z.ai đã đưa GLM-5.3-FlashX lên API của mình với tốc độ lên tới 200 token đầu ra mỗi giây — và định giá nó ở mức gấp 2,5 lần mức họ thu cho GLM-5.3-Flash, mô hình trọng số mở mà nó được xây dựng dựa trên. Không có gì về bản thân mô hình thay đổi. Cùng trọng số, cùng xương sống mixture-of-experts 320B-A18B, cùng ngữ cảnh 1 triệu token, cùng khả năng xử lý gốc văn bản, hình ảnh, video và tệp. Điều thay đổi là ngăn xếp phục vụ bên dưới nó, và việc Z.ai giờ đây thu phí cho đặc quyền được ngồi gần hơn về phía trước hàng đợi.

Điều đó khiến FlashX trở thành một điều hiếm thấy trên thị trường mô hình: một màn ra mắt không kèm theo benchmark nào. Z.ai chưa công bố đánh giá nào dành riêng cho FlashX, bởi vì không có mô hình mới nào để đánh giá. Mọi con số về năng lực áp dụng cho GLM-5.3-Flash đều áp dụng ở đây, kể cả những con số kém lung linh hơn so với mức mà các bài đưa tin ra mắt gợi ý.

Toàn bộ vùng đồng bằng, chỉ trong một lượt.

• Tốc độ — GLM-5.3-FlashX đạt tới 200 tok/s (mức đỉnh do nhà cung cấp báo cáo) so với GLM-5.3-Flash ở mức 98 tok/s theo đo lường của Artificial Analysis trên chính API của Z.aibr> • Giá — 0,37 USD cho mỗi 1M đầu vào / 1,25 USD cho mỗi 1M đầu ra, so với 0,15 / 0,50 USD theo giá niêm yếtbr> • Đầu vào được lưu đệm — 0,075 USD cho mỗi 1M so với 0,03 USD cho mỗi 1Mbr> • Trí tuệ — giống hệt nhau; FlashX kế thừa điểm số của mô hình cơ sởbr> • Ngữ cảnh — 1M token ở cả haibr> • Trọng số — GLM-5.3-Flash là trọng số mở theo giấy phép MIT; FlashX là một gói dịch vụ lưu trữ và không có trọng số riêng

200 và 98 không phải cùng loại con số, và đáng để nói thẳng điều đó. Một cái là mức trần mà nhà cung cấp nói dịch vụ có thể đạt tới. Cái còn lại là những gì một phòng thí nghiệm độc lập đo được trên các yêu cầu thực tế. Người dùng đang cân nhắc có nên trả gấp 2,5 lần hay không nên coi 200 là quảng cáo và hãy tự đo khối lượng công việc của chính mình.

A single-column scoreboard titled 'GLM-5.3-FlashX - the scoreboard' with rows reading 'Speed: up to 200 tok/s (vendor peak)', 'Measured speed: 98 tok/s (base model)', 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Context: 1M tokens' and 'Weights: hosted tier only', with a footer reading 'Speed is a vendor-reported peak; base-model figures per Artificial Analysis.'

Những gì Z.ai nói đang làm công việc

Tốc độ tăng thêm đến từ hạ tầng, không phải từ toán học. Z.ai mô tả FlashX chạy trên một cụm gồm khoảng 100.000 bộ tăng tốc nội địa Trung Quốc với một ngăn xếp phục vụ được thiết kế riêng: một engine suy luận dựa trên SGLang, lượng tử hóa W8A8, lượng tử hóa bộ nhớ đệm hỗn hợp INT8/FP8/BF16, và một kiến trúc phân tách mã hóa–tiền nạp–giải mã, tách giai đoạn mã hóa đa phương thức khỏi các giai đoạn sinh token để không bên nào chặn bên kia. Công ty báo cáo thông lượng dịch vụ đầu-cuối tăng khoảng 3 lần so với đường cơ sở ban đầu trên cùng phần cứng, và cho biết một tác nhân hạ tầng được vận hành bởi GLM-5.3 đã giúp tinh chỉnh ngăn xếp này.

Tất cả những điều đó đều do nhà cung cấp báo cáo và, cho đến nay, chưa được bất kỳ ai ngoài Z.ai tái lập. Đây cũng là phần hợp lý nhất của câu chuyện: các đợt ra mắt ở tầng phục vụ như thế này thường là những thắng lợi về mặt kỹ thuật, và các lựa chọn kiến trúc được mô tả chính là bộ công cụ tiêu chuẩn cho đúng kiểu cải thiện này. Điều chúng không phải là một sự bảo đảm. Con số 200 tok/s là mức đỉnh, và mức đỉnh đạt được trên các đầu ra ngắn, bộ đệm đã nóng và một cụm không bị tắc nghẽn. Các yêu cầu đa phương thức ngữ cảnh dài — loại khối lượng công việc mà FlashX được quảng bá rõ ràng nhắm tới — lại là những trường hợp ít có khả năng đạt được nó nhất.

Giá cả chính là quyết định sản phẩm thực sự.

Theo giá niêm yết, GLM-5.3-FlashX có giá $0,37 mỗi triệu token đầu vào và $1,25 mỗi triệu token đầu ra, với đầu vào được lưu vào bộ nhớ đệm có giá $0,075 và lưu trữ bộ nhớ đệm miễn phí trong thời gian có hạn. Trong bảng giá nội địa của Z.ai, mức đó là ¥2 cho đầu vào và ¥7 cho đầu ra, so với ¥0,8 và ¥2,8 đối với Flash cơ bản — cùng tỷ lệ 2,5×, được nêu bằng đơn vị tiền tệ mà Z.ai bán trong nước.

A screenshot of Z.ai's official pricing documentation page (captured September 19, 2026) showing the 'Latest Models' table with GLM-5.3-Flash at $0.15 input, $0.03 cached input and $0.50 output per 1M tokens, and GLM-5.3-FlashX at $0.37, $0.075 and $1.25.

Phép tính nhanh chóng trở nên khó chịu theo hướng mà ít người kiểm tra. Token đầu ra là nơi hệ số nhân tác động mạnh nhất, vì đầu ra là phía đắt đỏ ở mọi mô hình trong dòng này: đầu ra của FlashX gấp 2,5 lần đầu ra của Flash, và đầu ra vốn đã có giá gấp ~3,4 lần đầu vào ở cả hai. Một tác vụ theo lô tạo ra một triệu token đầu ra mỗi ngày sẽ chuyển từ $0.50 lên $1.25 — chênh lệch $274 mỗi năm đối với một khối lượng công việc mà theo định nghĩa, không ai đang chờ đợi.

Điểm đáng giá là độ trễ mà bạn có thể khấu hao. Một vòng lặp tác nhân thực hiện mười cuộc gọi tuần tự sẽ tiết kiệm khoản chênh lệch mỗi cuộc gọi mười lần, và nếu khoản chênh lệch đó là hai hoặc ba giây, bạn đã giành lại được nửa phút thời gian thực tế mỗi tác vụ. Đối với hoàn thiện mã tương tác, đối thoại thời gian thực, hoặc bất kỳ pipeline nào mà con người hoặc dịch vụ thượng nguồn bị chặn ở token tiếp theo, sự đánh đổi đó thường là hợp lý. Z.ai cũng nói rõ rằng mô hình hiện không thuộc GLM Coding Plan của mình, vì vậy người dùng đăng ký không được nhận FlashX đi kèm — họ phải trả tiền theo token cho nó.

Nếu stack của bạn đã nói chuyện với nhiều hơn một nhà cung cấp, thì việc chuyển đổi chỉ là thay đổi chuỗi model và không gì khác. Đó là lý do thực tế khiến routing tồn tại như một lớp: trên OrcaRouter giá niêm yết của nhà cung cấp được chuyển nguyên với mức markup 0%, nên khi Z.ai thay đổi giá hoặc cắt giảm khuyến mãi, thay đổi đó đến cùng ngày như khi nó diễn ra ở thượng nguồn, và một endpoint duy nhất đứng trước hơn 200 model nghĩa là việc đánh giá FlashX so với Flash chỉ là một chỉnh sửa cấu hình chứ không phải một dự án tích hợp. Failover cũng quan trọng ở đây — một tầng phục vụ hoàn toàn mới trên một cụm hoàn toàn mới đúng là kiểu phụ thuộc đáng để có một phương án dự phòng phía sau.

Điều gì chưa thay đổi, và tại sao nó lại quan trọng hơn

FlashX thừa hưởng trọn vẹn hồ sơ năng lực của GLM-5.3-Flash, và hồ sơ đó hẹp hơn so với hàm ý của các bài đưa tin ra mắt. Các tài liệu của Z.ai đặt mô hình cơ sở ngang bằng với Claude Opus 4.8 trên Artificial Analysis Intelligence Index. Bản thân Artificial Analysis hiện xếp GLM-5.3-Flash ở mức 42 trên chỉ số đó, được đo trên API của chính Z.ai — một điểm số vững chắc, cao hơn hẳn mức trung vị của các mô hình trọng số mở cùng phân khúc, và còn cách xa tầng tiên phong mà so sánh của nhà cung cấp hàm ý. Cả hai phát biểu đều đúng; chỉ là chúng không phải cùng một phát biểu, và khoảng cách giữa chúng chính là lý do blog này dán nhãn số liệu của nhà cung cấp là số liệu của nhà cung cấp.

Mô hình cơ sở này thực sự có năng lực và thực sự mở. GLM-5.3-Flash ra mắt ngày 26 tháng 8 năm 2026 theo giấy phép MIT với trọng số trên Hugging Face, và thiết kế attention kết hợp tuyến tính với thưa — nén IndexPool, siêu kết nối ràng buộc đa tạp — cắt giảm tính toán attention khoảng 3× và KV cache khoảng 4,4× so với GLM-5.3, và đó chính là điều khiến một mô hình 320B với 18B tham số hoạt động trở nên đủ rẻ để phục vụ. Đầu ra bị giới hạn ở 131.072 token. Nó nhanh so với mức giá, chứ không nhanh so với phân khúc của mình: Artificial Analysis đo được 98 token mỗi giây, so với mức trung vị của các mô hình cùng nhóm là trên 70 nhưng dưới mức của những mô hình nhanh nhất trên bảng xếp hạng.

FlashX không thay đổi bất kỳ điều nào trong số đó. Nó thay đổi khoảng thời gian bạn phải chờ đợi.

Cái nhìn trung thực

Hãy mua FlashX nếu khối lượng công việc của bạn bị ràng buộc bởi độ trễ và bạn đã quyết định GLM-5.3-Flash là mô hình phù hợp — một agent gọi nối tiếp nhau, một trình soạn thảo hoàn tất ngay trong dòng, một giao diện thoại hay trò chuyện nơi khoảng dừng chính là sản phẩm. Hãy tiếp tục dùng GLM-5.3-Flash, hoặc dùng trọng số mở mà bạn có thể tự lưu trữ, nếu công việc của bạn chạy theo lô, ngoại tuyến, hay bị ràng buộc bởi thông lượng thay vì độ trễ. Trí tuệ mà bạn đang trả gấp 2,5 lần chính là trí tuệ bạn đã có sẵn.

Câu hỏi còn bỏ ngỏ là liệu đo lường độc lập nói gì về 200. Chưa có ai ngoài Z.ai công bố số liệu thông lượng của FlashX, và cho đến khi có người làm vậy, lập trường trung thực là FlashX chỉ là một hạng phục vụ đầy hứa hẹn được bán dựa trên một con số đỉnh. Đáng chú ý, đây cũng là một phép thử thương mại: một phòng thí nghiệm đã dành một năm để cho không một mô hình gần tầm tiên tiến với giá bằng một phần mười mô hình chủ lực của mình giờ đang hỏi liệu các nhà phát triển có sẵn sàng trả tiền chỉ để có tốc độ hay không. Câu trả lời sẽ định hình cách định giá hạng tiếp theo.

A screenshot of the OrcaRouter models catalogue (captured September 19, 2026) showing the header '199 models - 15 providers - one API key, one bill', the filter chips for input modalities, context length, input price, status, series and supported parameters, and the 'How to call any model' panel with the POST https://api.orcarouter.ai/v1/chat/completions endpoint.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày