
Ox Alpha Lộ Diện: Z.AI Phát Hành Mở Trọng Số với Tên Gọi GLM-5.3-Flash
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 144 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Vào tối thứ Tư, ngày 26 tháng 8, bí ẩn đã kết thúc đúng như phân tích pháp y đã dự đoán. Z.AI — phòng thí nghiệm Bắc Kinh đứng sau dòng GLM — đã phát hành mô hình mà họ đã thử nghiệm dưới vỏ bọc ẩn danh dưới dạng sản phẩm trọng số mở, với tên gọi GLM-5.3-Flash, chính xác là tên phụ mà phân tích tokenizer pháp y và các thị trường dự đoán đã hội tụ về. Ox Alpha, mô hình ẩn danh đã đứng đầu bảng xếp hạng sử dụng kể từ khi xuất hiện vào ngày 20 tháng 8, giờ đây là một mô hình đã được công bố, có thể tự lưu trữ: giấy phép MIT, 320B tổng tham số với 18B hoạt động trên mỗi token, cửa sổ ngữ cảnh 1.048.576 token và khả năng nhập văn bản/hình ảnh/video như đã quảng cáo trên trang niêm yết, cùng bộ trọng số trên Hugging Face. Việc tiết lộ cũng đã giải đáp câu đố lớn nhất của tuần ẩn danh — làm thế nào một mô hình không thuộc về ai có thể xử lý 100 nghìn tỷ token mỗi ngày: Z.AI cho biết hệ thống phục vụ chạy hoàn toàn trên khoảng 100.000 chip AI nội địa Trung Quốc, lần đầu tiên silicon Trung Quốc gánh vác lưu lượng toàn cầu ở quy mô tiên phong. Công suất đó cũng đã làm nảy sinh phỏng đoán sai phổ biến nhất trong tuần — ở quy mô đó, nhiều nhà quan sát, được khích lệ bởi các bài đăng khó hiểu từ các nhà nghiên cứu Google DeepMind, cho rằng Ox Alpha chắc chắn là Gemini chạy trên phần cứng NVIDIA; việc tiết lộ cũng đã đính chính điều đó. Cùng đêm đó, Alibaba đã phát hành Qwen3.8-Flash-Next, bản xem trước trọng số mở của kiến trúc Qwen4 — chỉ trong một buổi tối, hai bản phát hành trọng số mở đẳng cấp tiên phong từ các phòng thí nghiệm Trung Quốc. Bốn bản phát hành ẩn danh trước Ox Alpha cuối cùng đều được các phòng thí nghiệm Trung Quốc nhận là của mình: Zhipu AI có GLM-5, Xiaomi có MiMo-V2-Pro, Ant Group có Lingxi Ling-2.6-flash, và Meituan có LongCat-2.0. Ox Alpha không còn là thử nghiệm độc quyền của nền tảng; nó là mô hình mà các nhà phát triển có thể tự lưu trữ.
Mọi con số trong bài viết này đều là tuyên bố của chính nhà vận hành, dữ liệu do chính nền tảng niêm yết, thông báo công khai hoặc kết quả giám định từ cộng đồng. Các con số DeepSWE là kết quả đo lường cộng đồng của nhà nghiên cứu độc lập Ben Davis — một đợt chạy đủ 113 nhiệm vụ, không phải mục chính thức trên bảng xếp hạng, mặc dù con số ~63% hiện khớp chặt với điểm DeepSWE v1.1 do chính nhà cung cấp Z.AI công bố là 63,4. Câu hỏi về danh tính đã khép lại: vào ngày 26 tháng 8, Z.AI phát hành Ox Alpha dưới dạng mô hình trọng số mở với tên gọi GLM-5.3-Flash — giấy phép MIT, tổng 320B tham số với 18B tham số hoạt động — xác nhận tên phụ mà các kết quả giám định tokenizer và bộ mã hóa video đã hội tụ về. Kiến trúc, số tham số và giá cả hiện đã được công ty công bố; điều vẫn chỉ là tuyên bố từ phía nhà cung cấp chứ chưa được xác minh độc lập là bộ benchmark và tuyên bố của Z.AI rằng hệ thống phục vụ trong tuần ẩn danh đã chạy trên khoảng 100.000 chip AI nội địa Trung Quốc, với chi phí trên mỗi token tương đương phần cứng NVIDIA chủ đạo — một tuyên bố của công ty đã được nhiều trang tin nhắc lại, chứ không phải con số được kiểm toán. Giả thuyết Gemini ban đầu — được nhen nhóm bởi công suất 100T token/ngày và được khuyến khích bởi những bài đăng bí ẩn của các nhà nghiên cứu Google DeepMind — đã sai, và đợt phát hành đã khép lại vấn đề. Xếp hạng chất lượng được quy cho nhà phân tích teortaxesTex — cùng gợi ý của ông rằng một Ox Alpha được huấn luyện thêm có thể trở thành con ngựa thồ cho một GLM 5.5 mạnh hơn — là đánh giá riêng của chính nhà phân tích đó từ một bài đăng trên mạng xã hội, chứ không phải phép đo độc lập hay tuyên bố của Zhipu. Bản demo hoạt ảnh lặp được mô tả bên dưới cũng là một báo cáo từ cộng đồng — bài đăng của một nhà phát triển trên X, được nhắc lại trên các diễn đàn nhà phát triển Trung Quốc — chứ không phải tuyên bố về năng lực của nhà cung cấp, và nhà vận hành chưa công bố bất kỳ tính năng nào như vậy.
Những gì chúng ta biết — và những gì chúng ta không biết
Phiên bản nhanh:
• Nhà điều hành mô tả Ox Alpha là "một mô hình tiên phong được xây dựng cho việc lập trình hiệu quả, công việc tác tử bền bỉ và sử dụng trong sản xuất thực tế" — một mô hình lý luận nhắm đến kỹ thuật phần mềm theo chiều dài dài hạn và các quy trình làm việc kết hợp văn bản với ngữ cảnh trực quan.
• Nó có cửa sổ ngữ cảnh 1.048.576 token (1M), giới hạn đầu ra 131.072 token, và nhận đầu vào văn bản, hình ảnh và video — là bản phát hành ẩn danh đầu tiên quảng bá khả năng nhập video, và là một khả năng mà bản phát hành GLM-5.3-Flash xác nhận là tích hợp sẵn chứ không phải gắn thêm vào.
• Nó miễn phí trong một tuần: $0 cho mỗi triệu token đầu vào và đầu ra, với nhà điều hành tuyên bố "giới hạn tốc độ hào phóng, sử dụng gần như không giới hạn" và công suất phục vụ 100 nghìn tỷ token mỗi ngày — công suất mà tiết lộ sau đó cho biết là được cung cấp trên khoảng 100.000 chip nội địa Trung Quốc.
• Đã xác nhận: vào ngày 26 tháng 8, Z.AI đã phát hành Ox Alpha dưới dạng mô hình trọng số mở với tên gọi GLM-5.3-Flash — giấy phép MIT, tổng cộng 320B tham số với 18B tham số kích hoạt — chính xác là điều mà tokenizer tên phụ, bộ mã hóa video, phân tích pháp y mã lỗi cùng các thị trường dự đoán đã hội tụ. Nhà phân tích độc lập teortaxesTex đánh giá mô hình này ở mức xấp xỉ GLM-5.3, ngoài khả năng thị giác, và cho rằng một Ox Alpha được huấn luyện thêm có thể là xương sống đằng sau một GLM 5.5 mạnh hơn nhiều.
• Khả năng đọc đa phương thức dạng flash giờ đã có bản demo đi kèm: khi được yêu cầu tạo một hoạt ảnh lặp về cảnh một con bồ nông đạp xe và mở một chiếc điện thoại đang phát chính hoạt ảnh đó, Ox Alpha đã đáp lại bằng một hoạt ảnh lặp khép kín dưới dạng một tệp HTML/SVG duy nhất — một bản demo từ cộng đồng, không phải tuyên bố từ nhà cung cấp.
• Dữ liệu hoạt động ban đầu trên nền tảng đã cho thấy lưu lượng sản xuất thực tế, bao gồm một tác nhân mã hóa từ Nous Research và trình soạn thảo Zed.
• Công ty giờ đã phát hành nó — vào ngày 26 tháng 8, Z.AI đã ra mắt Ox Alpha dưới dạng GLM-5.3-Flash trọng số mở theo giấy phép MIT, chấm dứt cùng lúc các câu hỏi về danh tính, thông số kỹ thuật và giá: tổng cộng 320B tham số với 18B hoạt động, có khả năng đa phương thức gốc, với giá niêm yết của Z.AI là $0.15 đầu vào / $0.50 đầu ra mỗi triệu token và chương trình khuyến mãi ra mắt giảm 50% được nêu là chỉ kéo dài đến ngày 9 tháng 9 — một mốc đến nay đã qua tám ngày, song mức giá ưu đãi vẫn là mức đang được áp dụng. Z.AI cũng tiết lộ rằng việc phục vụ 100T token/ngày trong tuần ẩn danh chạy trên khoảng 100.000 chip Trung Quốc nội địa, lần đầu tiên ở quy mô đó. Điều mà màn tiết lộ không bao gồm là một benchmark độc lập — bảng điểm của mô hình do nhà cung cấp báo cáo — nên con số độc lập đại diện nhất vẫn là lần chạy DeepSWE đầy đủ 113 nhiệm vụ của Ben Davis ở khoảng 63%, ngang bằng với GPT-5.6 Sol mid.
Ox Alpha là gì
Theo mô tả trên nền tảng, Ox Alpha là "một mô hình suy luận được thiết kế cho lập trình, công việc tác tử liên tục và khối lượng công việc sản xuất — kỹ thuật phần mềm tầm xa, suy luận phức tạp và quy trình làm việc kết hợp văn bản với ngữ cảnh trực quan." Đó là một định vị cụ thể: nó được xây dựng cho các vòng lặp tác tử chạy dài và cho mã nguồn, không phải cho trò chuyện thông thường. Ngữ cảnh 1M là dấu hiệu nhận biết — đủ chỗ cho một phiên tác tử kéo dài nhiều giờ hoặc một kho mã lớn — và giới hạn đầu ra 131K cho phép tạo ra các kết quả dài trong một lần. Nó hỗ trợ gọi công cụ và hàm cũng như đầu ra JSON có cấu trúc, phần còn lại của danh sách kiểm tra tác tử.

Đầu vào video là điểm đặc trưng nhất trên bảng thông số. Không mẫu ẩn danh nào trước đó quảng cáo tính năng này, và một mô hình có thể xử lý khung hình video cũng như văn bản và hình ảnh được thiết kế cho một nhóm khối lượng công việc khác với các bản phát hành tinh chỉnh hội thoại trước đó. Đây cũng là một trong những dấu hiệu nhận dạng mạnh nhất mà một mô hình có thể mang theo, như phân tích pháp y sẽ chứng minh sau này. Tất cả những điều này — mô tả, thông số kỹ thuật, con số tốc độ — đều đến từ nhà vận hành và bảng niêm yết của nền tảng. Bản phát hành GLM-5.3-Flash xác nhận các thông số chính (320B-A18B, đa phương thức gốc); các con số tốc độ và dung lượng vẫn là tuyên bố từ nhà cung cấp.
Câu chuyện đa phương thức đã có một bản demo cụ thể trong tuần này. Nhà phát triển Chetaslua — người có các thăm dò phía máy chủ thuộc chuỗi dấu vết nhận dạng — đã đăng một bài kiểm tra trong đó anh yêu cầu Ox Alpha tạo một vòng lặp về một con bồ nông đạp xe và mở một chiếc điện thoại phát lại chính hoạt ảnh đó: một vòng lặp tự quy chiếu bên trong vòng lặp. Báo cáo của anh cho thấy mô hình tạo ra một hoạt ảnh HTML/SVG trong một tệp duy nhất — một con bồ nông với chân hai đoạn thực sự đạp, tốc độ bánh xe đồng bộ với tốc độ mặt đất, nền parallax, và phần cao trào chiếc điện thoại trong vòng lặp. Các diễn đàn nhà phát triển Trung Quốc đã riêng rẽ chạy các prompt bồ nông đạp xe của riêng họ và thảo luận về kết quả, vì vậy demo này không phải là một tuyên bố đơn lẻ không thể kiểm chứng. Vì đầu ra là mã, điều này nhất quán với thông số kỹ thuật chỉ xuất văn bản của nền tảng: khả năng hiểu đa phương thức và tạo mã sáng tạo hoạt động cùng nhau, chứ không phải tổng hợp video gốc. Kết luận của Chetaslua — rằng đây là thành quả của đa phương thức, và một mô hình mã nguồn mở có năng lực sẽ xuất hiện cùng với nó — là dự đoán của riêng anh, không phải tuyên bố của nhà cung cấp; nhà vận hành chưa công bố gì cả.
Ưu đãi miễn phí trong một tuần
Chương trình khuyến mãi diễn ra rất mạnh tay. Miễn phí trong suốt tuần chạy, với "giới hạn tốc độ hào phóng, mức sử dụng gần như không giới hạn", cùng công suất được tuyên bố lên tới 100 nghìn tỷ token mỗi ngày, kèm ghi chú của nhà vận hành mời người dùng "hãy xem bạn có thể làm được gì". Hiểu theo nghĩa đen, 100 nghìn tỷ token mỗi ngày sẽ đưa nhà vận hành này vào nhóm các nhà cung cấp suy luận (inference) lớn nhất hiện nay — tuyên bố này nghe không giống một thông số kỹ thuật mà giống một thử thách kiểm tra sức chịu đựng hơn, và điều đó khớp với một mô-típ quen thuộc: phát hành ẩn danh chính là cách một phòng thí nghiệm thu hút lưu lượng truy cập thực tế quy mô tiên phong (frontier-scale) mà không cần đặt tên mình lên cửa. Việc xác nhận thông tin đã làm cho tuyên bố về quy mô trở nên cụ thể thay vì chỉ dễ hình dung hơn: Z.AI tiết lộ rằng hệ thống phục vụ 100 nghìn tỷ token/ngày chạy trên khoảng 100.000 chip AI nội địa Trung Quốc — lần đầu tiên một bản phát hành đẳng cấp tiên phong được vận hành ở quy mô đó mà không cần phần cứng NVIDIA. Việc tiết lộ đó vẫn mới chỉ là tuyên bố của công ty, hiện đã được nhiều hãng truyền thông nhắc lại nhưng chưa được kiểm toán độc lập, và nó đi kèm với một khẳng định thứ hai, mềm mỏng hơn từ phía nhà cung cấp: Z.AI cho biết chi phí mỗi token trên cụm chip nội địa là tương đương với GPU NVIDIA chủ đạo trên thị trường.
Mặt khác của “miễn phí trong một tuần” là mức giá theo sau đó không được biết — thông tin tiết lộ đã trả lời điều đó. Giá niêm yết đã công bố của Z.AI cho GLM-5.3-Flash là $0.15 mỗi triệu token đầu vào, $0.50 mỗi triệu token đầu ra và $0.03 mỗi triệu token đầu vào được lưu đệm. Một chương trình khuyến mãi ra mắt giảm 50% được nêu là kéo dài đến ngày 9 tháng 9 năm 2026, đưa mức đó xuống $0.075 / $0.25. Tám ngày sau ngày đó, mức giá ưu đãi vẫn là mức giá đang được phục vụ: đọc lại vào ngày 17 tháng 9 năm 2026, trang model z-ai/glm-5.3-flash niêm yết đầu vào ở $0.075, đầu ra ở $0.25 và lượt đọc bộ đệm ở $0.0173 mỗi triệu token, mà không có nhãn khuyến mãi nào trên đó. So với giá niêm yết $1.40 / $4.40 của GLM-5.3, đó là khoảng một phần hai mươi. Hệ quả thực tế là ngày kết thúc 9 tháng 9 đã cũ thay vì còn ràng buộc — một nhà phát triển lập ngân sách dựa trên $0.15 / $0.50 đang lập ngân sách dựa trên một con số mà hiện tại không ai đang bị tính. Điều mà các trang định giá không giải đáp được là lý do. Danh sách model của chính Z.AI vẫn ghi $0.15 / $0.50 cho GLM-5.3-Flash, nên việc chương trình khuyến mãi đã được gia hạn, được biến thành vĩnh viễn hay chỉ đơn giản là vẫn tiếp tục chạy không phải là điều chúng tôi có thể dẫn nguồn; mức giá ưu đãi là sự thật quan sát được vào ngày này, còn nguyên nhân vẫn bỏ ngỏ.
Benchmark đầy đủ đầu tiên — và nó đạt ngang bằng với GPT-5.6 Sol mid.
Ox Alpha vẫn chưa có tên trên các bảng theo dõi độc lập như Artificial Analysis hay LMArena — từ "frontier" là do chính nhà vận hành tự nhận, còn các con số benchmark mà Z.AI công bố cùng bản phát hành GLM-5.3-Flash (DeepSWE v1.1 63,4, AutomationBench 48,8, chỉ số Artificial Analysis Intelligence Index 57) đều do nhà cung cấp tự báo cáo, chứ không phải điểm số độc lập. Điểm thay đổi kể từ khi ra mắt là các con số do cộng đồng đo lường đang bắt đầu được lan truyền — và bức tranh đã thu hẹp lại. Trên Kingbench, các lần chạy đầu tiên đưa Ox Alpha lên 87,5, chỉ dưới mức 91,25 của GLM-5.3. Trên DeepSWE, nhà nghiên cứu độc lập Ben Davis ban đầu chạy một tập con 10 tác vụ và báo cáo Pass@1 đạt 80%, vượt qua Claude Fable 5 (65%), GLM-5.3 và Grok 4.6 (62%) cùng GPT-5.6 Sol (52%). Sau đó ông đã hoàn thành một lần chạy đầy đủ trên toàn bộ bộ DeepSWE gồm 113 tác vụ, và kết quả sau khi hiệu chỉnh là khoảng 63% — gần ngang bằng với GPT-5.6 Sol mid. Con số 80% ở tập con là con số gây chú ý, nhưng mười tác vụ chỉ chiếm chưa đến 9% benchmark; chính Davis cũng xác nhận con số của bộ đầy đủ mới là con số "hợp lý hơn nhiều". Đây là những số liệu do cộng đồng đo được, không phải benchmark của nhà cung cấp, cũng không phải điểm số chính thức trên bảng xếp hạng — nhưng lần chạy đầy đủ là con số mang tính đại diện nhất mà bất kỳ ai thu được từ mô hình này, và hiện nó khớp chặt với điểm DeepSWE v1.1 là 63,4 do chính Z.AI tự báo cáo — một sự đối chiếu chéo hữu ích, dù con số của công ty chỉ là một tuyên bố chứ không phải một phép đo.
Một sự so sánh giờ đây quan trọng hơn nhiều so với thời điểm ra mắt. DeepSeek V4 Pro 0813 — bản GA của model chủ lực DeepSeek, phát hành ngày 13/8 — ghi nhận điểm DeepSWE 62.7 trên bảng benchmark của chính DeepSeek, so với mức 12.8 của DeepSeek V4 Pro Preview trước đó. Cả hai con số đều do nhà phát hành tự công bố, chưa được phòng thí nghiệm độc lập tái kiểm chứng tính đến thời điểm bài viết này. Khi đặt cạnh mức ~63% của GLM-5.3-Flash trong một phiên chạy toàn bộ bài test từ cộng đồng và kết quả DeepSWE v1.1 63.4 của chính Z.AI, điểm 62.7 của DeepSeek cho thấy hai tuyên bố nổi tiếng nhất của Trung Quốc về coding agent đều nằm trong cùng dải điểm đầu 60. Khoảng cách 10 điểm từng được xem là dấu ấn của Ox Alpha thực ra được đo so với DeepSeek V4 Flash 0731, mẫu nhỏ giá rẻ hơn; còn khi so với model chủ lực của DeepSeek, GLM-5.3-Flash chỉ ngang bằng, không hề nhỉnh hơn 10 điểm.
Bài học còn lại nói về chính con số. Nhà phân tích teortaxesTex — người đã theo dõi những ước tính này từ tuần ẩn danh — lưu ý rằng báo cáo đầu tiên về Ox Alpha cũng đưa ra 80% DeepSWE: đó là bộ 10 tác vụ gây chú ý của Davis, và kết quả cuối cùng trên toàn bộ bộ 113 tác vụ là 63%. Với con số chính thức 62.7 của DeepSeek V4 Pro 0813 trong cùng dải, nhận định của ông là vẫn chưa có gì đạt tới mức 80% được tái lập hợp lệ — con số 80% cứ xuất hiện sớm trong đời sống công khai của một mô hình rồi lại ổn định ở mức thấp 60 khi toàn bộ bộ dữ liệu được chạy. Đó là cách đọc của nhà phân tích, không phải phép đo, nhưng đó là lăng kính phù hợp cho tiêu đề DeepSWE tiếp theo, kể cả bất kỳ tiêu đề nào về chính GLM-5.3-Flash.

Điều cũng tồn tại là việc sử dụng thực tế. Dữ liệu hoạt động của nền tảng cho thấy lưu lượng truy cập sản xuất thực sự trong những giờ đầu tiên — bao gồm Hermes Agent, dự án lập trình tác nhân từ Nous Research, và trình soạn thảo Zed. Cả hai đều chính xác là các trường hợp sử dụng "công việc tác nhân liên tục và lập trình" mà mô hình được định vị để phục vụ. Đó không phải là điểm số, mà là tín hiệu: các nhà phát triển có khối lượng công việc thực tế đã quyết định rằng một canh bạc ẩn danh, miễn phí, đẳng cấp tiên phong đáng để kết nối. Trước khi bản chạy DeepSWE đầy đủ ra mắt, sự chấp nhận sớm đó là bằng chứng duy nhất hiện có; con số ~63% của tập đầy đủ giờ đây mang lại cho mô hình một mốc chuẩn để đối chiếu với nó.
Chữ in nhỏ về việc lưu giữ dữ liệu
Thông báo tuần miễn phí quảng bá rằng {{1}}"không lưu giữ dữ liệu nào".{{/1}} Phần niêm yết của mô hình trên nền tảng kể một câu chuyện thận trọng hơn: các lời nhắc và phản hồi được nhà cung cấp lưu giữ nhưng không được dùng để huấn luyện, theo {{2}}các điều khoản mô hình ẩn{{/2}} của nền tảng. Sự khác biệt này có ý nghĩa nếu bạn sắp dán mã độc quyền vào một {{3}}cửa sổ 1 triệu token{{/3}} thuộc sở hữu của một nhà cung cấp vốn ẩn danh cho đến khi Z.AI lên tiếng vào ngày 26 tháng 8. Hãy coi {{4}}"không lưu giữ dữ liệu nào"{{/4}} chỉ là lời tiếp thị cho đến khi Z.AI công bố các điều khoản nói rõ điều đó — và hãy định tuyến bất cứ thứ gì bạn không muốn bị ghi nhật ký qua một mô hình riêng biệt, có thể xác định danh tính.
Sách lược mô hình ẩn danh
Ox Alpha là bản phát hành ẩn danh thứ năm trong vòng sáu tháng, và bốn bản trước đó đều có cùng một kết cục — một màn ra mắt ẩn danh, một đợt lưu lượng truy cập miễn phí tăng vọt, rồi một công ty đứng ra nhận trách nhiệm:
• Pony Alpha (tháng 2 năm 2026) — được Zhipu AI xác nhận là GLM-5 khoảng năm ngày sau khi ra mắt, mô hình MoE chủ lực với 744 tỷ tham số.
• Hunter Alpha (11 tháng 3) — một mô hình miễn phí với nghìn tỷ tham số, ngữ cảnh 1M, trở thành câu chuyện đồn đoán của mùa xuân, được nhiều người đoán là DeepSeek V4; hóa ra là MiMo-V2-Pro của Xiaomi, với mô hình đi kèm Healer Alpha được xác định là MiMo-V2-Omni.
• Elephant Alpha (tháng 4) — một mô hình văn bản miễn phí, tập trung vào hiệu suất mà Ant Group tuyên bố là Lingxi Ling-2.6-flash khoảng hai tuần sau khi nó xuất hiện.
• Owl Alpha (cuối tháng 4) — mô hình tập trung vào tác nhân với khả năng gọi công cụ gốc và ngữ cảnh ~1M mà Meituan xác nhận là LongCat-2.0 vào ngày 30 tháng 6, mô hình nghìn tỷ tham số đầu tiên được huấn luyện và phục vụ hoàn toàn trên chip nội địa Trung Quốc.
• Ox Alpha (20 tháng 8) — được tiết lộ vào ngày 26 tháng 8 với tên gọi GLM-5.3-Flash, một mô hình open-weight, được cấp phép MIT, có 320B tham số với 18B hoạt động; danh tính, giấy phép và thông số kỹ thuật đều chính thức vào đúng ngày chiếc mặt nạ được gỡ bỏ.

Tại sao lại ra mắt một mô hình tốt đằng sau lớp mặt nạ? Cách đọc chuẩn, vốn được chu kỳ Hunter Alpha hiện thực hóa, là việc ẩn danh loại bỏ thiên kiến thương hiệu khỏi các đánh giá, và việc sử dụng miễn phí sẽ huy động dữ liệu đánh giá từ thế giới thực ở quy mô tiên phong trong khi mọi người tranh cãi về chủ sở hữu. Như một phân tích về mô thức này đã nói, "việc thiếu vắng thương hiệu chính là cách tiếp thị." Điểm thắng cộng thêm là tốc độ: một mô hình ẩn danh có thể tiếp cận cộng đồng nhà phát triển toàn cầu trong vài giờ mà không cần sự kiện ra mắt, và chính sự bí ẩn trở thành kênh phân phối.
Ai là Ox Alpha?
Cho đến khi bản phát hành ngày 26 tháng 8, chưa có công ty nào tuyên bố sở hữu nó và Zhipu AI vẫn im lặng — nhưng tình hình bằng chứng cứng đã thay đổi trong vòng 48 giờ sau khi mô hình ra mắt, và các phân tích pháp y dưới đây là lý do khiến việc tiết lộ — với tên gọi GLM-5.3-Flash — ít gây bất ngờ. Con số công suất thoạt đầu đã phần nào đi ngược lại các phân tích pháp y: 100 nghìn tỷ token mỗi ngày trông giống dấu hiệu của một phòng thí nghiệm hàng đầu trên hạ tầng NVIDIA, và giả thuyết rằng Ox Alpha là một Gemini mới — được cổ vũ bởi các bài đăng bí ẩn từ các nhà nghiên cứu Google DeepMind — đã có đà thực sự cho đến khi bằng chứng tokenizer, và sau đó là bản phát hành của chính Z.AI, chốt lại vụ việc. Tín hiệu mạnh nhất là tokenizer. Một công cụ lấy dấu vân tay do cộng đồng xây dựng, modelprint, đã chạy chín lần thăm dò hạ tầng đối với Ox Alpha và phát hiện nó khớp với GLM-5.3 của Z.ai ở sáu điểm, với cả bốn số token được chuẩn hóa đều khớp với dòng GLM trong khi ứng viên không phải GLM tốt nhất chỉ đạt hai trên bốn. Nhà nghiên cứu độc lập Ben Davis báo cáo rằng số token của Ox Alpha khớp chính xác với GLM-5.3 qua 25 lời nhắc kiểm tra, chỉ có sự khác biệt cố định +75 token mà ông cho là do một bộ bao ngoài ẩn. Khớp tokenizer là tín hiệu nhận dạng khó giả mạo nhất — một mô hình không thể thay đổi cách phân đoạn văn bản mà không huấn luyện lại.
Đường dẫn video là chữ ký thứ hai. Mức tiêu thụ token video của Ox Alpha khớp chính xác với GLM-5V-Turbo trong bốn mẫu có kiểm soát — cùng cơ chế lấy mẫu khung hình, chia tỷ lệ thời lượng và độ phân giải — trong khi MiMo v2.5, Qwen 3.8 Max và GLM-4.6V đều có sự khác biệt. Đó là một dấu hiệu rõ ràng: khả năng xử lý video nằm sâu trong mô hình, không phải là một tính năng gắn thêm. Phần còn lại của chuỗi dấu vân tay cũng khớp với cùng một nhận định: Ox Alpha từ chối đầu vào âm thanh giống như GLM-5V, dùng chung mã lỗi "1301" đặc trưng của GLM, có phong cách đầu ra tương tự (khoảng 1,3 biểu tượng cảm xúc trên 1.000 ký tự), mang cùng cấu hình tham số và API hạn chế đã xuất hiện trên danh sách GLM-5.3 của nền tảng hai ngày trước khi Ox Alpha ra mắt, và có thời điểm cắt kiến thức vào khoảng tháng 11 năm 2025.
Việc nhận dạng này có tiền lệ trong chính cuốn sổ tay chiến thuật của Zhipu: Pony Alpha, bản phát hành ẩn danh hồi tháng 2, hóa ra là GLM-5, được nhận dạng khoảng năm ngày sau khi ra mắt. Nhận định của giới phân tích đang lan truyền trong tuần này — rằng Ox Alpha là GLM-5.3, được cho là mô hình Flash — cũng được Pliny the Liberator nhắc lại, người cho biết tác nhân của ông đã xác nhận "Ox-alpha là từ Zai, thuộc dòng GLM-5.X". Nhà phân tích độc lập teortaxesTex cũng đưa ra cùng nhận định về chất lượng và bổ sung thêm một khẳng định về thời gian: ông đánh giá Ox Alpha ở mức xấp xỉ GLM-5.3, nếu không kể phần thị giác, và nhận thấy tốc độ xoay vòng là điểm ấn tượng nhất — nén GLM-5.3 vốn chỉ hỗ trợ văn bản và phát hành nó kèm thị giác hoạt động được chỉ trong vài ngày sau khi ra mắt vào ngày 14 tháng 8. Đó là đánh giá của một nhà phân tích, không phải điểm số độc lập, và ông lập luận rằng điều này nên khiến người ta phải chững lại trước câu chuyện "Trung Quốc phát hành các mô hình nóng hổi vừa ra lò". Bài đăng mới nhất của ông xếp thêm một phỏng đoán về lộ trình lên trên nhận định đó: chu kỳ cập nhật GLM-5 có thể ngắn; Ox Alpha đủ gần với GLM-5.3 đến mức việc dùng nó làm tác nhân phụ gần như chẳng có ý nghĩa gì — "cứ chạy thẳng ox @4 thay vào đó" là cách nói tắt của ông cho việc chạy trực tiếp mô hình; và một Ox Alpha được huấn luyện thêm sẽ rất hợp lý để làm con ngựa thồ, theo cách nói của ông là "con vật thồ hàng", cho một GLM 5.5 mạnh hơn nhiều. Đó là suy đoán của một nhà phân tích về lộ trình, không phải tuyên bố của Zhipu. Ngược lại, câu hỏi về tên phụ đã được ngã ngũ: vào ngày 26 tháng 8, Z.AI đã phát hành Ox Alpha dưới tên gọi GLM-5.3-Flash. Điểm vướng mắc từng khiến nhãn Flash bị xếp vào phía "giả định" — GLM-5.3 ra mắt ngày 14 tháng 8 dưới dạng mô hình chỉ có văn bản, trong khi Ox Alpha quảng bá khả năng nhận video đầu vào — chính là điều bản phát hành đã giải quyết: GLM-5.3-Flash là một mô hình riêng biệt, vốn dĩ đa phương thức, chứ không phải cùng một mô hình chỉ có văn bản. Các giả thuyết thay thế — nhóm MiMo của Xiaomi, DeepSeek — đã được nêu ra nhưng phần lớn bị bác bỏ dựa trên bằng chứng về tokenizer và video, và bản phát hành đã giải quyết dứt điểm câu hỏi về dòng họ mô hình. Lập luận của Davis về việc nên quan tâm đến nhãn Flash hóa ra lại là lập luận thiết thực: vì Ox Alpha thực sự là GLM-5.3-Flash, hoạt động ở mức trung của GPT-5.6 Sol, giờ đây nó có thể chạy cục bộ — các trọng số nằm trên Hugging Face, còn SGLang, vLLM và TokenSpeed phục vụ mô hình này — điều này biến một mô hình lập trình tiên phong hạng trung thành chi phí phần cứng một lần thay vì hóa đơn trả theo từng token cho bất kỳ ai sẵn sàng tự lưu trữ nó.
Khuôn khổ địa chính trị là của các nhà phân tích, không phải của bằng chứng: "Điều này gây áp lực to lớn hơn nữa lên các US Frontier Labs, và khoảng cách với Trung Quốc đang thu hẹp." Đó là cách diễn giải về ý nghĩa của một mô hình cấp Zhipu miễn phí chạy ở quy mô tiên phong đối với trật tự cạnh tranh — và việc công bố phần cứng mang lại lợi thế mà các nhà phân tích không có. Phục vụ 100 nghìn tỷ token mỗi ngày trên khoảng 100.000 chip nội địa là minh chứng quy mô lớn đầu tiên cho thấy một ngăn xếp Trung Quốc không dùng silicon NVIDIA có thể gánh lưu lượng suy luận tiên phong — kịch bản mà CEO NVIDIA Jensen Huang đã cảnh báo trên podcast Dwarkesh mùa xuân này, khi ông lập luận rằng các biện pháp kiểm soát xuất khẩu sẽ thúc đẩy ngăn xếp độc lập với NVIDIA của Trung Quốc và một mô hình tiên phong chạy tốt nhất trên phần cứng nội địa Trung Quốc sẽ là "kết cục tồi tệ" đối với Hoa Kỳ. Con số chi phí ngang bằng của Z.AI vẫn chỉ là tuyên bố từ nhà cung cấp, nhưng bản thân sự kiện là có thật. Cùng buổi tối đó cũng minh chứng cụ thể ở phía mô hình: khi Z.AI phát hành GLM-5.3-Flash, Alibaba đã tung ra Qwen3.8-Flash-Next, bản xem trước trọng số mở của kiến trúc Qwen4. Hai bản phát hành trọng số mở tầm tiên phong của Trung Quốc trong một đêm chính là hình dạng cụ thể của điều mà các nhà quan sát gọi là "một ngày trọng đại cho mã nguồn mở Trung Quốc."
Tuần này bạn có nên xây dựng dựa trên nó không?
Tuần miễn phí đã kết thúc, nhưng bản thử nghiệm vẫn còn rẻ: mức giá thực tế được áp dụng vào ngày 17 tháng 9 là 0,075 USD cho đầu vào / 0,25 USD cho đầu ra trên mỗi triệu token, chứ không phải mức giá niêm yết 0,15 / 0,50 USD — chương trình khuyến mãi ra mắt giảm 50% vốn được thông báo sẽ kết thúc vào ngày 9 tháng 9 vẫn còn hiệu lực tám ngày sau đó. Nếu bạn làm công việc tác tử (agentic) tầm xa, viết mã trên ngữ cảnh dài, hoặc vận hành các pipeline nặng về video, thì đó chính xác là giao điểm mà Ox Alpha được định vị — và với việc trọng số được mở, bạn có thể chạy thử nghiệm trên phần cứng của riêng mình thay vì phải nhờ vào sự dễ dãi của một nền tảng vô danh. Hai lưu ý. Thứ nhất, nhãn "frontier" vẫn chỉ là một tuyên bố: bảng điểm của GLM-5.3-Flash là do nhà cung cấp báo cáo, và con số độc lập vững chắc duy nhất — kết quả DeepSWE ~63% của Davis — là mạnh, nhưng còn cách xa mức 80% gây sốt của tập con 10 tác vụ ban đầu. Thứ hai, mức giá 0 USD đã bị giới hạn về thời gian, và màn hé lộ đã định giá cho những gì đến sau — rẻ so với năng lực, nhưng không còn miễn phí nữa. Điều mà bản phát hành trọng số mở loại bỏ chính là sự phụ thuộc: các tệp đã được phát hành, nên mô hình có thể được tự lưu trữ thay vì đi thuê. Đó là hình hài của một bản thử nghiệm, không phải của một sự phụ thuộc.
Cách an toàn cho môi trường production để chạy một bài test như vậy là dùng chuỗi dự phòng: mô hình thử nghiệm trả lời khi nó còn khỏe, và ngay lúc nó khựng lại, báo lỗi hoặc biến mất thì yêu cầu sẽ chuyển sang một mô hình đã được kiểm chứng. Đó chính là việc mà một lớp định tuyến phải làm. Việc công bố thông tin khiến lựa chọn dự phòng trở nên quá dễ: Ox Alpha chính là GLM-5.3-Flash, và bản thân mô hình đang chạy trực tiếp trên OrcaRouter dưới tên thật của nó với mức giá 0,075 USD đầu vào / 0,25 USD đầu ra cho mỗi triệu token, còn giá đọc cache là 0,0173 USD — mức giá khai trương giảm 50% được công bố sẽ kết thúc vào ngày 9 tháng 9 và, tính đến ngày 17 tháng 9, vẫn là mức giá trên trang chứ không phải con số niêm yết 0,15 / 0,50 USD. Mô hình được chuyển tiếp với mức markup 0%, một API duy nhất cho hơn 200 mô hình, kèm khả năng chuyển đổi dự phòng tự động để cú tăng vọt lưu lượng trong tuần ra mắt không trở thành sự cố ngừng dịch vụ của bạn. Hãy thử nghiệm mô hình mới ở tuyến đầu với một phương án dự phòng đã được kiểm chứng đứng sau trong chuỗi; khi giá thay đổi, con số bạn thấy trên OrcaRouter chính là con số bạn phải trả, ngay trong cùng ngày. Hoặc bỏ qua API hoàn toàn — vì trọng số là mã mở, nên việc tự vận hành GLM-5.3-Flash phía sau đúng chuỗi đó cũng nằm trong tầm tay.
Xem gì
Sáu điều sẽ kể nốt phần còn lại của câu chuyện. Bài kiểm chuẩn độc lập: bảng điểm của GLM-5.3-Flash là do nhà cung cấp tự báo cáo, lần chạy DeepSWE ~63% của Davis là con số độc lập vững chắc duy nhất tính đến nay, mức 62.7 chính thức của DeepSeek V4 Pro 0813 giờ nằm cùng dải, và một mục trên Artificial Analysis hay LMArena — hoặc một cuộc đối đầu trực tiếp độc lập — sẽ là phép kiểm tra cuối cùng xem "tiên phong" là sự thật hay chỉ là khẩu hiệu. Quỹ đạo giá: câu hỏi về trạng thái ổn định đã có câu trả lời dựa trên bằng chứng hiện có — chương trình khuyến mãi 50% được nói là sẽ kết thúc vào ngày 9 tháng 9, vậy mà đến ngày 17 tháng 9, mức giá ưu đãi 0,075 USD / 0,25 USD vẫn là mức đang được phục vụ, nên con số để lập ngân sách là mức khuyến mãi chứ không phải giá niêm yết 0,15 USD / 0,50 USD; điều còn bỏ ngỏ là nguyên nhân, vì giá niêm yết của chính Z.AI vẫn chưa hề nhúc nhích. Tuyên bố về phần cứng: Z.AI nói rằng tuần ẩn danh đó đã vận hành trên khoảng 100.000 chip nội địa với chi phí ngang bằng NVIDIA — phép thử công khai đầu tiên ở quy mô ấy là liệu tuyên bố này có trụ nổi trước sự soi xét độc lập hay không, và liệu chồng công nghệ nội địa có trở thành mặc định cho dòng GLM hay không. Bài toán ứng dụng: liệu lượng truy cập đứng đầu nền tảng mà Ox Alpha thu hút khi còn đeo mặt nạ có chuyển hóa thành các triển khai tự vận hành và qua API hay không, giờ khi nó đã có tên, có giấy phép và có giá. Phần tiếp theo: liệu GLM-5.3-Flash có biến Ox Alpha thành một bàn đạp hay không — gợi ý của teortaxesTex là một phiên bản được huấn luyện thêm sẽ trở thành trụ cột làm việc chính cho một GLM 5.5 mạnh hơn nhiều, điều đó sẽ khiến bản phát hành này thành nền móng của GLM kế tiếp. Và phản ứng: với việc Qwen3.8-Flash-Next ra mắt cùng đêm và một màn hé lộ về chip nội địa phía sau, áp lực đang đè lên các phòng thí nghiệm tiên phong của Mỹ — và lên cuộc tranh luận về kiểm soát xuất khẩu — buộc phải đáp lời; hãy dõi xem liệu một sản phẩm theo sau nhanh, một động thái về giá, hay một phản ứng chính sách có xuất hiện ở phía bên kia khoảng cách hay không.
Kết luận thẳng thắn: Ox Alpha là một thử nghiệm rẻ một cách bất thường theo cả hai hướng. Nền tảng này đã kiểm tra liệu một mô hình ẩn danh tầm cỡ tiên phong với mức 0 USD có thể giành được lưu lượng sản xuất thực tế trong một tuần hay không — và nó đã làm được, đủ thuyết phục để Z.AI không chỉ đứng ra vào ngày thứ sáu mà còn phát hành trọng số dưới dạng mô hình mở ngay đêm đó. Bạn có cơ hội kiểm chứng liệu mô hình có xứng đáng có một chỗ trong stack của bạn hay không, giờ đây mà không còn rủi ro ẩn danh: GLM-5.3-Flash là một mô hình có tên cụ thể, được cấp phép MIT, có thể tự host, với mức giá đã công bố, và câu hỏi về phần cứng cũng đã có câu trả lời — Z.AI nói rằng dịch vụ phục vụ 100T token/ngày chạy trên khoảng 100.000 chip nội địa Trung Quốc, do công ty tuyên bố nhưng nay đã được đưa tin rộng rãi. Điều còn phải tìm hiểu là liệu "tiên phong" có trụ được trước đo lường độc lập hay không, liệu tuyên bố ngang bằng chi phí nhờ chip nội địa của Z.AI có đứng vững ở quy mô lớn hay không, vì sao chương trình khuyến mãi ra mắt giảm 50% vẫn là mức giá đang được áp dụng tám ngày sau ngày kết thúc 9 tháng 9 đã nêu, và liệu màn tiết lộ này có định vị GLM-5.3-Flash là mẫu chủ lực cho một GLM 5.5 mạnh hơn hay không, như teortaxesTex gợi ý. Hãy chạy thử nghiệm, nhưng hãy chạy nó với một phương án dự phòng ở bên dưới.
So sánh trong bài viết này4
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
