Thẻ tiêu đề được tạo ra hiển thị dòng chữ 'GLM-5.3-Flash Revealed' với phụ đề 'Mô hình đa phương thức biên giới mã nguồn mở của Zhipu chính là Ox Alpha ẩn danh — nay có giá chỉ bằng một phần mười GLM-5.3', cùng các biểu tượng đường nét phẳng gồm chip sét, huy hiệu MIT và biểu tượng hình ảnh-video.
Guides & Insights

Tiết Lộ GLM-5.3-Flash: 'Ox Alpha' Ẩn Danh Hóa Ra Chính Là Mô Hình Tiên Phong Đa Phương Thức Mở Của Zhipu Ngay Từ Đầu

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mô hình đã dành một tuần đứng đầu bảng xếp hạng sử dụng trên nền tảng viết mã của bên thứ ba cuối cùng cũng đã có tên và giá. Vào ngày 26 tháng 8 năm 2026, Zhipu AI xác nhận rằng mô hình miễn phí "Ox Alpha" mà các nhà phát triển đã sử dụng miệt mài kể từ ngày 20 tháng 8 chính là GLM-5.3-Flash — một mô hình hỗn hợp chuyên gia (mixture-of-experts) với tổng 320 tỷ tham số, 18 tỷ tham số kích hoạt (320B-A18B), là bản phát hành đa phương thức gốc đầu tiên trong dòng GLM-5, đồng thời là một trong những mô hình cấp tiên phong (frontier-grade) rẻ nhất trên mọi bảng giá tại thời điểm ra mắt. Zhipu định giá GLM-5.3-Flash bằng một phần mười mức giá API của flagship GLM-5.3, hoặc một phần hai mươi trong thời gian giảm giá có hạn, và trọng số mở — theo giấy phép MIT — đã được đưa lên Hugging Face ngay cùng ngày. Không giống như GLM-5.3, vốn có trọng số vẫn đang chờ đến cuối tháng, mô hình này là thứ bạn có thể tự lưu trữ (self-host) ngay trong tuần này, chứ không phải tuần sau.

Tóm lại là: {{1}}Zhipu đã mã nguồn mở mô hình lớn rẻ nhất từ trước đến nay của mình, và mô hình này vượt qua chính GLM-5.2 của họ trên các benchmark dù chỉ chạy với một phần nhỏ số tham số được kích hoạt{{/1}}, và nhà cung cấp xếp chỉ số Artificial Analysis Intelligence Index của mô hình ở mức 57 — ngang bằng với Claude Opus 4.8, theo tài liệu ra mắt của Zhipu. {{2}}Mọi con số benchmark gắn với lần ra mắt này đều do nhà cung cấp công bố và chưa được kiểm chứng lại tại thời điểm viết bài; giá bán và số lượng tham số là những dữ kiện thực tế hiện tại.{{/2}}

Những gì thực sự đã được phát hành

GLM-5.3-Flash là một mô hình MoE với tổng 320B tham số / 18B tham số kích hoạt, gồm 45 lớp, đưa lượng tham số kích hoạt của nó ở mức chỉ hơn một nửa một chút so với khoảng 32B tham số kích hoạt của GLM-5.2. Khả năng nổi bật nhất là phương thức nhập liệu: mô hình này hỗ trợ nguyên bản đầu vào văn bản, hình ảnh và video — là mô hình GLM-5 đầu tiên làm được điều này — thay vì xử lý hình ảnh qua một bộ chuyển đổi (adapter) riêng. Ngữ cảnh lên tới 1 triệu token, và Zhipu tuyên bố chi phí phục vụ ngữ cảnh dài chỉ bằng khoảng một phần ba so với GLM-5.3.

{{1}}Về mặt kiến trúc, Zhipu mô tả đây là mô hình tiên phong mã nguồn mở đầu tiên sử dụng thiết kế lai kết hợp sparse-attention và linear-attention,{{/1}}{{2}}đi kèm với Manifold-Constrained Hyper-Connections (mHC) để mở rộng quy mô và cơ chế IndexPool{{/2}}{{3}}nhằm nén bốn vector khóa indexer thành một pool có trọng số duy nhất để giảm độ trễ cho ngữ cảnh dài.{{/3}}{{4}}Quá trình tiền huấn luyện được chạy trên kho ngữ liệu đa phương thức gồm 30 nghìn tỷ token.{{/4}}{{5}}Chưa có điều nào trong số này được kiểm định độc lập — đây là mô tả của Zhipu về chính mô hình của mình — nhưng các tuyên bố về hiệu quả phục vụ đủ cụ thể để có thể kiểm tra khi các trọng số được đưa vào ngăn xếp suy luận mã nguồn mở.{{/5}}

Bảng thông số kỹ thuật ngày ra mắt, nhìn tổng quan:

• Tham số — 320B tổng / 18B hoạt động, 45 lớp, MoE.

• Phương thức — đầu vào gốc: văn bản, hình ảnh và video; đầu ra văn bản.

Cửa sổ ngữ cảnh — lên tới 1.000.000 token.

• Giấy phép — MIT, trọng số mở có sẵn trên Hugging Face khi ra mắt.

• Giá — $0,15 / $0,50 mỗi triệu token (đầu vào / đầu ra), $0,03 mỗi triệu token đầu vào đã lưu bộ nhớ đệm; chương trình khuyến mãi giảm 50% đến hết ngày 9 tháng 9 năm 2026 sẽ giảm mức giá đó xuống còn $0,075 / $0,25 / $0,015. Theo giá niêm yết, mức này chỉ bằng khoảng một phần mười so với mức $1,40 / $4,40 của GLM-5.3.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

Tuần Ox Alpha

Sự công bố khép lại một tuần đồn đoán. Vào ngày 20 tháng 8, một mô hình ẩn danh đã xuất hiện trên nền tảng API AI bên thứ ba với cửa sổ ngữ cảnh 1 triệu token, hỗ trợ đầu vào văn bản/hình ảnh/video, và mức giá bằng 0, và nó nhanh chóng trở thành mô hình được gọi nhiều nhất trên bảng xếp hạng tuần của nền tảng. Cộng đồng đã truy vết nó về gia đình GLM của Zhipu trong vòng 48 giờ — cùng mô thức ẩn danh-rồi-xác nhận từng giúp nhận diện các mô hình từ các phòng thí nghiệm Trung Quốc khác trước đây — và phần lớn các nhà phân tích dự đoán đó là biến thể Flash của GLM-5.3. Thông báo ngày 26 tháng 8 đã xác nhận dự đoán đó và bổ sung chi tiết rằng tuần miễn phí là một bài thử nghiệm có chủ đích: Zhipu cho biết đợt chạy ẩn danh đã lập kỷ lục về số lượt gọi trên các nền tảng lập trình nơi nó được cung cấp, với toàn bộ lưu lượng được phục vụ từ chip nội địa Trung Quốc.

Bối cảnh tuần miễn phí đó quan trọng đối với kỳ vọng về giá. Một mô hình được cung cấp miễn phí trong một tuần, sau đó ra mắt với mức giá bằng 1/10 giá của sản phẩm chủ lực, kèm theo một đợt chiết khấu có thời hạn xuống còn 1/20 giá, là một động thái tạo lập thị trường có chủ đích ở phân khúc bình dân — và phần cần chú ý chính là từ khóa "có thời hạn". Mức chiết khấu là một quyết định về giá có thể rút lại; còn trọng số mở MIT thì không.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Nó có giá bao nhiêu, tính bằng đô la thực tế

Bảng giá của Zhipu đã được công bố bằng đô la thực tế, không chỉ là tỷ lệ: 0,15 USD cho mỗi triệu token đầu vào, 0,50 USD cho mỗi triệu token đầu ra và 0,03 USD cho mỗi triệu token đầu vào được lưu trong bộ nhớ đệm. So với mức giá công bố 1,40 USD / 4,40 USD của GLM-5.3, con số này rơi vào khoảng một phần mười so với giá niêm yết, và chương trình khuyến mãi ra mắt giảm 50% kéo dài đến ngày 9 tháng 9 năm 2026 sẽ đưa giá xuống còn 0,075 USD / 0,25 USD / 0,015 USD — khoảng một phần hai mươi. Zhipu cũng công bố chi phí của mô hình cho mỗi tác vụ AA Intelligence Index là khoảng 0,045 USD, do nhà cung cấp báo cáo, đây chính là con số đằng sau cách diễn đạt "1/40 của Opus 4.8". Đối với một mô hình đạt điểm số trong cùng phân khúc với các mô hình được định giá cao hơn 10–40 lần, các con số kinh tế nổi bật là thực; điều khoản chi tiết là chương trình giảm giá ra mắt chỉ mang tính tạm thời và chi phí mỗi tác vụ phụ thuộc vào mức độ dài dòng của mô hình khi vận hành thực tế.

Câu chuyện về hiệu quả chính là nơi Zhipu khẳng định lợi thế chi phí đến từ đâu. So với GLM-5.3, hãng báo cáo chi phí tính toán attention giảm 3,0 lần và KV cache giảm 4,4 lần, đồng thời tuyên bố có chi phí tính toán attention thấp nhất trong số các mô hình phân khúc bình dân được so sánh — GLM-5.3, DeepSeek V4 FlashKimi K3 — trong khi thừa nhận KV cache của họ vẫn lớn hơn một chút so với DeepSeek V4 Flash và Kimi K3. Về phía phục vụ, Zhipu báo cáo hiệu suất phục vụ đầu cuối được cải thiện gấp 3 lần so với đường cơ sở trên chip nội địa Trung Quốc, đạt chi phí mỗi token mà họ gọi là tương đương với GPU NVIDIA chủ đạo. Tất cả đều do hãng tự báo cáo và chưa con số nào được kiểm chứng độc lập; đây là những con số phù hợp để đối chiếu với các trọng số mở.

Vì sao màn ra mắt lại quan trọng

Gạt các benchmark sang một bên, việc ra mắt này vẫn thay đổi cục diện của các mô hình mở theo hai cách. Thứ nhất, đây là mô hình đa phương thức trọng số mở trong phân khúc tiên phong với mức giá bình dân — sự kết hợp giữa giấy phép MIT, ngữ cảnh 1M, khả năng nhập ảnh/video trực tiếp và chi phí chỉ vài xu cho mỗi tác vụ không có sản phẩm tương đương trực tiếp nào từ các phòng lab tiên phong của Mỹ, vốn có các mô hình đa phương thức tương đương với chi phí đắt hơn hẳn một bậc và được phát hành dưới dạng mã nguồn đóng. Thứ hai, nó làm suy yếu chính mô hình chủ lực của Zhipu: GLM-5.3 là mô hình 743B đạt 60 điểm đo lường độc lập trên Chỉ số AA Intelligence trong tháng này, còn GLM-5.3-Flash được định vị là “trí tuệ tiên phong, chi phí chớp nhoáng” trong cùng gia đình mô hình đó. Câu chuyện của Zhipu là một mô hình nhỏ hơn, rẻ hơn có thể nắm bắt được phần lớn năng lực của mô hình chủ lực — và nếu các tuyên bố về khả năng lập trình và agent của hãng đứng vững, thì đây cũng chính là luận điểm về nền kinh tế post-training mà cả ngành đã xoay quanh suốt cả năm.

Một lưu ý giúp chúng ta giữ được cái nhìn khách quan. Điểm AA Index 57 của GLM-5.3-Flash đến từ tài liệu ra mắt của chính Zhipu, chưa phải từ bảng xếp hạng Artificial Analysis, và so sánh về khả năng viết mã với Claude Opus 4.8 là đánh giá nội bộ Z.ai Code Bench của Zhipu. Hãy coi con số 57 và sự ngang bằng về viết mã chỉ là những tuyên bố chưa kiểm chứng cho đến khi có phép đo độc lập — mô hình đã được thử nghiệm rộng rãi một cách ẩn danh, nên số liệu từ bên thứ ba sẽ sớm được công bố.

Hãy thử xem, và lớp định tuyến khớp như thế nào.

Quyền truy cập ngay từ ngày đầu tiên thông qua API riêng của Zhipu, trọng số mở trên Hugging Face (zai-org/GLM-5.3-Flash, MIT) và các sản phẩm lập trình của Zhipu — ZCode và GLM Coding Plan, bao gồm một loạt thẻ trải nghiệm hằng ngày. Đối với việc tự lưu trữ, giấy phép MIT cùng hỗ trợ của vLLM và SGLang đồng nghĩa với việc các tuyên bố về hiệu suất phục vụ nêu trên có thể được kiểm chứng trực tiếp.

Về phía định tuyến, GLM-5.3-Flash hiện chưa nằm trong danh sách của OrcaRouter tính đến bản cập nhật này. Phần còn lại của dòng GLM như sau: GLM-5.3 đã hoạt động trên phía chúng tôi cùng ngày API của Zhipu được mở, với giá niêm yết của Zhipu và biên độ tăng 0% được chuyển qua. Cơ chế chuyển qua đó chính là thứ tạo nên sự khác biệt cho một đợt ra mắt như thế này — khi nhà cung cấp thay đổi giá, dù mức chiết khấu được giữ nguyên hay bảng giá thay đổi sau đó, điều đó sẽ hiển thị trên phía chúng tôi cùng ngày, không cần đàm phán lại. Nếu bạn muốn chạy Flash cùng phần còn lại của dòng GLM trên một khóa API khi nó được tích hợp, đó chính là thiết lập phù hợp; cho đến lúc đó, các trọng số trên Hugging Face là cách nhanh nhất để bạn tự thử nghiệm.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Xem gì tiếp theo

Ba điều sẽ làm rõ câu chuyện thực sự trong vài tuần tới. Thứ nhất, một phép đo độc lập từ Artificial Analysis đối với mô hình {{1}}57{{/1}} — mô hình này đã chạy công khai với tên gọi Ox Alpha, nên bảng xếp hạng sẽ sớm được cập nhật. Thứ hai, liệu chương trình giảm giá 50% — hiện dự kiến kết thúc vào ngày 9 tháng 9 năm 2026 — có được gia hạn sau ngày đó hay không, vì điều đó quyết định chi phí ở trạng thái ổn định của Flash. Thứ ba, bộ trọng số GLM-5.3, vẫn được hứa hẹn phát hành vào khoảng ngày 28 tháng 8 — cùng tuần bộ trọng số MIT của Flash được công bố, điều này sẽ cho cộng đồng trọng số mở hai cấp độ của cùng một dòng mô hình để so sánh cùng lúc.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube