GLM-5.3-Flash Lộ Diện — "Ox Alpha" Ẩn Danh Hóa Ra Là Mô Hình Tiên Phong Đa Phương Thức Mã Nguồn Mở Của Zhipu Ngay Từ Đầu. Hình minh họa tái tạo.
Guides & Insights

GLM-5.3-Flash, sau năm tuần: một 42 độc lập, một đợt khai thác lỗ hổng cấp Mythos, và GLM Agent đã tự xây dựng lại ngăn xếp phục vụ của chính nó

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GLM-5.3-Flash đã phục vụ lưu lượng sản xuất được năm tuần, và vào ngày 17 tháng 9 năm 2026, Zhipu AI đã nói một điều về nơi nó chạy: công ty tiết lộ rằng mọi yêu cầu sản xuất đối với GLM-5.3-Flash giờ đây đều chạy trên một cụm gồm hơn 100.000 bộ tăng tốc AI do Trung Quốc sản xuất trong nước, rằng nó đã đi từ lần khởi động đầu tiên trên phần cứng đó đến việc gánh toàn bộ khối lượng công việc trực tiếp trong chưa đầy hai tuần, và rằng thông lượng đầu cuối đã tăng 3,2 lần trong cùng khoảng thời gian đó. Phần đi xa nhất là ai đã làm công việc đó. Phần lớn việc đó không phải do nhóm hạ tầng làm mà do một tác nhân được chính GLM-5.3 điều khiển thực hiện, tác nhân này đọc các điểm nghẽn, đề xuất cách sửa và viết mã hệ thống suy luận, trong khi các kỹ sư đặt mục tiêu, xây dựng môi trường phản hồi và xem xét mọi thứ liên quan đến ngữ nghĩa số, tính đồng thời hoặc rủi ro sản xuất. GLM-5.3-Flash là mô hình đa phương thức 320 tỷ tổng, 18 tỷ hoạt động (320B-A18B) mà Zhipu ra mắt và mở mã nguồn vào ngày 26 tháng 8 năm 2026 — "Ox Alpha" ẩn danh mà công ty tiết lộ ngày hôm đó — và người anh em lớn hơn của nó, GLM-5.3, là mô hình chủ lực 743B mà nó được định giá để so sánh. Không con số nào trong ba con số của công bố hôm nay đến từ chúng tôi hay bất kỳ ai khác: chúng là của chính Zhipu. Mô hình chủ lực cũng không còn là phép so sánh duy nhất đáng quan tâm nữa: trên ExploitBench, một đánh giá độc lập về việc một mô hình leo được bao xa trên thang khai thác lỗ hổng Chrome thực tế, GLM-5.3-Flash hiện đã được đo ngang bằng với Claude Mythos Preview, mô hình tiên phong đóng mà nhà phát triển chỉ phát hành cho những chuyên gia phòng thủ đã được thẩm định, với chi phí mỗi lần thử chỉ bằng một phần nhỏ.

Đó là tin tốt, và nó có thật, nhưng lại do nhà cung cấp tự công bố. Ba điều khác đã thay đổi kể từ khi bài đăng này lần đầu xuất hiện vào ngày ra mắt, và hai trong số đó lại đi theo hướng ngược lại. Artificial Analysis giờ đã công bố phép đo của riêng mình về mô hình, và con số của họ không phải là con số của Zhipu. Ưu đãi ra mắt từng khiến đây trở thành mô hình có năng lực rẻ nhất trên thị trường đã hết hạn đúng kế hoạch vào ngày 9 tháng 9 và không được gia hạn. Và một đơn vị đánh giá bên thứ ba, Generality Labs, đã công bố một lần chạy ExploitBench của riêng mình, trong đó GLM-5.3-Flash đạt điểm cao hơn mức trung bình ba lần chạy của Claude Mythos Preview trên cùng thang đo — với chi phí chỉ khoảng sáu xu trên mỗi đô la. Với bất kỳ ai đã đánh dấu mô hình này vào cuối tháng 8 là “mô hình rẻ”, bài toán hôm nay đã khác so với trước, và tiêu đề trung thực là một tiêu đề mang tính hỗn hợp: kinh tế phục vụ đã thực sự được cải thiện, giá tăng vì một chương trình khuyến mãi đã kết thúc, chỉ số trí tuệ được trích dẫn rộng rãi đã không trụ nổi sau lần đầu chạm trán với một bộ khung đánh giá độc lập, và so sánh năng lực vốn nghiêng về phía mô hình lại là một lần chạy duy nhất chưa được bình duyệt mà chính các tác giả của nó nói rằng không nên đọc quá nhiều vào đó.

Zhipu là nguồn duy nhất cho kích thước cụm, mốc thời gian hai tuần và mức 3,2 lần — không có đánh giá độc lập nào cho bất kỳ con số nào trong đó, và chính công ty nói rằng họ chưa đạt được khả năng tự cải thiện đệ quy, mô tả kết quả là một vòng lặp quy mô tối thiểu chứ không phải thứ thật sự. Những gì có thể kiểm chứng, chúng tôi đã kiểm chứng: một tạo tác cụ thể duy nhất trong bài tường thuật nằm ngoài các bức tường của Zhipu — một bản sửa độ chính xác trong kernel Flash Linear Attention — thực sự đã được hợp nhất vào thượng nguồn, và chúng tôi đã xác nhận điều đó. Khi một con số bên dưới đến từ Zhipu, bài viết ghi rõ như vậy. Khi nó đến từ Artificial Analysis, bài viết ghi nguồn đó thay vào. Khi nó đến từ Generality Labs — đơn vị đánh giá an toàn đứng sau các con số khai thác trong bài viết này — bài viết ghi rõ điều đó, cùng với những lưu ý mà chính các tác giả của nó đã kèm theo: một lần chạy, 41 lỗi, một phương pháp tự công bố, không có bên thứ ba tái lập, và một câu hỏi về nhiễm bẩn mà họ tự chủ động nêu ra. Khi một con số là của Anthropic — những số liệu duy nhất ở đây đến từ một phòng thí nghiệm có lợi ích cạnh tranh trong câu trả lời — phần thân bài nói rõ mô hình nào thực sự được đo, vì không phải tất cả chúng đều là mô hình này.

Những gì thực sự đã được phát hành

GLM-5.3-Flash là một mô hình mixture-of-experts với tổng 320B tham số / 18B tham số hoạt động, gồm 45 lớp, khiến dấu chân tham số hoạt động của nó chỉ nhỉnh hơn một nửa so với mức khoảng 32B của GLM-5.2. Khả năng đáng chú ý nhất nằm ở tính đa phương thức: mô hình tiếp nhận đầu vào văn bản, hình ảnh và video một cách gốc — đây là mô hình GLM-5 đầu tiên làm được điều này — thay vì định tuyến phần thị giác qua một adapter riêng. Ngữ cảnh kéo dài tới 1 triệu token, và Zhipu tuyên bố chi phí phục vụ cho ngữ cảnh dài chỉ rơi vào khoảng một phần ba so với GLM-5.3.

Về kiến trúc, Zhipu mô tả đây là mô hình tiên phong mã nguồn mở đầu tiên kết hợp attention lai thưa-và-tuyến tính với Manifold-Constrained Hyper-Connections (mHC) để mở rộng quy mô, cùng cơ chế IndexPool nén bốn vector khóa của indexer thành một pool có trọng số nhằm cắt giảm độ trễ ngữ cảnh dài. Quá trình tiền huấn luyện chạy trên một kho ngữ liệu đa phương thức 30 nghìn tỷ token. Không có nội dung nào trong đó được kiểm toán độc lập — đây là Zhipu đang mô tả mô hình của chính mình — nhưng những tuyên bố về hiệu quả phục vụ đủ cụ thể để có thể kiểm chứng ngay khi các trọng số đã hiện diện trước ngăn xếp suy luận mã nguồn mở, và bản tường thuật ngày 17 tháng 9 bổ sung bức tranh chi tiết đầu tiên về cách phía phục vụ thực sự được xây dựng.

Bảng thông số kỹ thuật ngày ra mắt, nhìn tổng quan:

• Tham số — 320B tổng / 18B hoạt động, 45 lớp, MoE.

• Phương thức — đầu vào văn bản, hình ảnh và video gốc; đầu ra văn bản.

Cửa sổ ngữ cảnh — lên tới 1.000.000 token.

• Giấy phép — MIT, trọng số mở trên Hugging Face ngay từ ngày ra mắt.

• Giá — $0.15 / $0.50 mỗi triệu token (đầu vào / đầu ra), $0.03 mỗi triệu token đầu vào được lưu đệm.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

Thẻ đó là ảnh chụp nhanh ngày ra mắt, và hai hàng của nó đã thay đổi kể từ ngày 26 tháng 8. Chỉ số AA Index vẫn là tuyên bố của chính Zhipu và hiện đã bị đo lường độc lập phản bác — sẽ nói thêm bên dưới. Mức giá giảm mà nó hiển thị đã không còn; chương trình khuyến mãi đã kết thúc vào ngày 9 tháng 9. Số lượng tham số, cửa sổ ngữ cảnh, giấy phép và phương thức là thông tin hiện tại không đổi, và chúng là phần chính mà hình ảnh muốn thể hiện.

Tuần lễ Ox Alpha, và điều mà chương trình tặng miễn phí thực sự đang kiểm tra

Tiết lộ này đã khép lại một tuần đồn đoán. Vào ngày 20 tháng 8, một mô hình ẩn danh đã xuất hiện trên một nền tảng API AI của bên thứ ba với cửa sổ ngữ cảnh 1 triệu token, đầu vào văn bản/hình ảnh/video và mức giá bằng không, và nó nhanh chóng trở thành mô hình được gọi nhiều nhất trên bảng xếp hạng hàng tuần của nền tảng đó. Cộng đồng đã nhận dạng nó thuộc về họ GLM của Zhipu trong vòng 48 giờ — cùng kiểu mẫu ẩn danh rồi sau đó được nhận là của mình vốn trước đây đã giúp nhận diện các mô hình từ những phòng thí nghiệm Trung Quốc khác — và nhiều nhà phân tích đoán rằng đó là một biến thể Flash của GLM-5.3. Thông báo ngày 26 tháng 8 đã xác nhận phỏng đoán: tuần miễn phí là một cuộc thử nghiệm có chủ đích, và công ty cho biết lượt chạy ẩn danh đã xử lý hơn 62 nghìn tỷ token trong sáu ngày trên khắp các nền tảng lập trình nơi nó được cung cấp, tất cả đều được phục vụ từ chip nội địa Trung Quốc.

Điều khoản cuối cùng đó thoạt trông như một chú thích vào thời điểm ấy. Hóa ra nó mới là điểm mấu chốt. Tuần miễn phí chủ yếu không phải là một chiêu trò tiếp thị, cũng không hẳn là một bài kiểm thử tải cho mô hình; đó là một bài kiểm thử tải cho đội máy gia tốc bên dưới nó, được chạy ở quy mô mà nếu thất bại thì sẽ vừa công khai vừa không tốn phí. Ba tuần sau, Zhipu mô tả chính đội máy gia tốc đó là thứ đang gánh 100% lưu lượng vận hành thực tế của mô hình.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Logic định giá của tuần đó vẫn đúng, chỉ có một điểm cần chỉnh. Một mẫu sản phẩm được cho không ở mức $0 trong một tuần rồi ra mắt với giá bằng một phần mười giá của mẫu flagship, kèm mức giảm thêm 50%, là một nước đi tạo lập thị trường có chủ đích ở phân khúc bình dân, và yếu tố “giới hạn thời gian” luôn là phần cần để mắt tới. Chúng tôi đã đánh dấu đó là thứ có thể bị rút lại. Nó đã bị rút lại đúng lịch — điều này đáng nói thẳng, vì việc ưu đãi hết hạn là thay đổi duy nhất trong câu chuyện này xuất hiện trên hóa đơn.

Ngăn xếp phục vụ mà một agent đã dựng lại

Bài viết kỹ thuật ngày 17 tháng 9 của Zhipu là mô tả chi tiết đầu tiên về cách GLM-5.3-Flash được phục vụ trên silicon Trung Quốc, và luận điểm trung tâm của nó là một mô hình đã giúp tối ưu hóa chính hệ thống vận hành nó. Công ty gọi cơ chế này là phản hồi dày đặc: các bài kiểm tra tính đúng đắn, nhật ký thực thi, vết, vi benchmark và chỉ số đầu-cuối được kết nối với nhau để một agent có thể xác thực một giả thuyết ngay tại chỗ thay vì chờ triển khai đầy đủ và kiểm thử tải sau mỗi thay đổi. Để điều đó hoạt động, Zhipu nói rằng phản hồi phải mang tính cục bộ, rẻ và có thể kiểm tra một cách khách quan — gắn với một kernel hoặc đường mã cụ thể, đủ nhanh để lặp lại, và đúng hoặc sai mà không cần con người can thiệp.

Khi vòng lặp đó đã được thiết lập, tác nhân đã tìm ra và khắc phục ba vấn đề mà công ty đã mô tả chi tiết:

• Một đường song song theo ngữ cảnh trong kernel KDA đã mất độ chính xác khi các chuỗi dài ra, vì tl.dot mặc định dùng TF32 dù đầu vào là FP32, khiến sai số làm tròn tăng dồn theo độ dài ngữ cảnh. Bản sửa lỗi cố định độ chính xác đầu vào thành tf32x3, với phương án dự phòng là ieee trên các nền tảng không hỗ trợ TF32. Đây là điểm thú vị nhất trong cả ba, vì đây là tuyên bố duy nhất trong bài viết vượt ra khỏi hạ tầng của chính Zhipu: thay đổi này đã được hợp nhất upstream trong Flash Linear Attention dưới dạng PR #1180, mà chúng tôi đã kiểm tra và xác nhận đã được hợp nhất vào ngày 27 tháng 8 năm 2026.

• Việc truyền KV không chồng lấn với cơ chế lập lịch của DeepEP. Cả dispatch nội nút lẫn combine nội nút đều không giải phóng Python GIL trong phiên bản DeepEP đang dùng, khiến luồng truyền bị đình trệ phía sau chúng; các bản tiếng Anh và tiếng Trung của cùng bài viết đó đưa ra mức chi phí phát sinh lần lượt là trên 20% và trên 30%. Sau khi khắc phục, Zhipu nói rằng khoảng cách so với baseline chỉ prefill của mình đã giảm xuống dưới 1%.

• Một kernel giải mã đang tính lại cùng một phép chuẩn hóa FP32 và gating bốn lần, mỗi lần cho một tile chiều V. Việc tách công việc chia đã giảm 9,6% thời gian kernel, và việc gộp các tile vào một thread block duy nhất — nhờ đó phép chuẩn hóa chỉ chạy một lần — đã tạo ra tốc độ nhanh hơn 1,71 lần.

Xung quanh những sửa lỗi đó là các thay đổi mang tính cấu trúc: ReplaySSM, vốn đánh đổi năng lực tính toán để lấy bộ nhớ trên chip bởi vì các bộ tăng tốc có ít bộ nhớ trên chip hơn so với các GPU mà ngăn xếp phần mềm vốn được viết cho; song song hóa tensor trong nội bộ nút để giảm bớt cùng áp lực đó; bộ nhớ đệm hỗn hợp INT8, FP8 và BF16 để kéo giãn dung lượng; và kiến trúc tách rời Encode-Prefill-Decode, vốn lập lịch ba giai đoạn suy luận riêng rẽ thay vì như một pipeline duy nhất. Zhipu cũng thẳng thắn nêu tên các hạn chế — bộ nhớ trên chip và băng thông liên kết hạn chế, phần mềm chưa trưởng thành, độ phủ kernel chưa đầy đủ và tài liệu còn mỏng — và cho biết mình chưa đạt được khả năng tự cải thiện đệ quy, mô tả kết quả này như một vòng lặp ở quy mô tối thiểu.

Hãy đọc bản tường thuật này với thái độ hoài nghi, vì động cơ đã quá rõ. Zhipu sẽ không nói bao nhiêu phần công việc do agent làm so với bao nhiêu do các kỹ sư làm, và không có cuộc kiểm toán độc lập nào bên ngoài đối với con số thông lượng, mốc thời gian hai tuần hay quy mô cụm máy. Cách dựng khung phản hồi dày đặc cũng mang tính tự phục vụ theo một cách cụ thể: nó khiến tuyên bố nghe ấn tượng nhất (“mô hình của chúng tôi đã tự cải thiện”) dựa trên bằng chứng khó kiểm chứng nhất (một vòng lặp nội bộ không ai có thể thanh tra). Điều giữ cho câu chuyện không trở thành tiếp thị thuần túy là tuyên bố cụ thể nhất của nó có thể bị phản bác và hóa ra là đúng — bản sửa lỗi kernel tf32x3 thực sự có trong kho upstream, ghi ngày 27 tháng 8, ba tuần trước đợt báo chí xoay quanh nó.

Nó có giá bao nhiêu, tính bằng đô la thực tế

Bảng giá là của Zhipu, và nó đơn giản: $0.15 mỗi triệu token đầu vào, $0.50 mỗi triệu token đầu ra và $0.03 mỗi triệu token đầu vào được lưu trong bộ nhớ đệm. Đó là giá niêm yết tính đến hôm nay. Chương trình khuyến mãi ra mắt giảm 50% kéo dài đến ngày 9 tháng 9 năm 2026 và đã không được gia hạn, nên những con số $0.075 / $0.25 / $0.015 từng lan truyền rộng rãi vào cuối tháng 8 không còn khả dụng trên API của chính nhà cung cấp nữa. So với mức $1.40 / $4.40 đã công bố của GLM-5.3, Flash vẫn ở mức khoảng một phần mười theo giá niêm yết — khoản giảm giá là phần thưởng cộng thêm trên một mức giá vốn đã là điểm mấu chốt, chứ không phải bản thân mức giá. Artificial Analysis tính toán mức giá hỗn hợp khoảng $0.10 mỗi triệu token trên tỷ lệ 7:2:1 giữa cache-hit/đầu vào/đầu ra, và ghi tốc độ đầu ra vào khoảng 117 token mỗi giây, mức mà họ mô tả là nhanh đáng kể, dù AA lưu ý rằng các số liệu tốc độ mô tả API chính chủ của mô hình chứ không phải một bài kiểm tra do AA thực hiện.

Câu chuyện chi phí rộng hơn của Zhipu là lý do mức giá có thể đứng ở đó. Trong báo cáo bán niên công bố ngày 31 tháng 8, công ty cho biết chi phí suy luận trên mỗi token đơn vị trên cụm 100.000 bộ tăng tốc nội địa của mình đã giảm 80% kể từ đầu năm 2026, và biên lợi nhuận gộp API đã tăng từ -0,4% lên 24,6% nhờ quy mô, định giá và phục vụ rẻ hơn. Đây là những con số của công ty, do một doanh nghiệp báo cáo với cổ đông, và chưa được chúng tôi kiểm toán; hãy coi chúng là rõ ràng về xu hướng hơn là chính xác. Phần phục vụ ở trên là cơ chế đằng sau tuyên bố đó — ít lượt chạy kernel dư thừa hơn, ít áp lực bộ nhớ hơn, khả năng chồng lấn tốt hơn — một câu chuyện đáng tin hơn một tỷ lệ phần trăm trần trụi, kể cả khi tỷ lệ phần trăm mới là thứ sẽ được trích dẫn.

Các tuyên bố về hiệu quả so với mẫu flagship không thay đổi: tính toán attention giảm 3,0 lần và KV cache giảm 4,4 lần so với GLM-5.3, theo báo cáo của nhà cung cấp, trong đó Zhipu thừa nhận KV cache của mình vẫn hơi lớn hơn của DeepSeek V4 Flash và Kimi K3. Tuyên bố lúc ra mắt về cải thiện phục vụ đầu cuối gấp 3 lần trên chip nội địa nay được nêu là 3,2 lần, đo từ lần khởi động đầu tiên đến khi toàn bộ lưu lượng production chạy qua. Cả hai con số đều là của Zhipu, và hai bản báo cáo đưa ra chúng cách nhau ba tuần — không có nội dung nào ở đây được tái lập bên ngoài công ty.

Vì sao tiết lộ này lại quan trọng — và con số tiêu đề đã đi đâu mất

Đây là đính chính quan trọng nhất đối với bất kỳ ai đã đọc bài đưa tin ra mắt và ghi nhớ con số đó. Tài liệu của Zhipu đặt GLM-5.3-Flash ở mức 57 trên Artificial Analysis Intelligence Index, ngang bằng Claude Opus 4.8. Artificial Analysis kể từ đó đã công bố phép đo của riêng mình về mô hình này trên Intelligence Index v4.3, và kết quả là 42 — so với 47 của GPT-5.6 Sol (max) trên cùng phiên bản. Con số 57 chưa bao giờ là một con số độc lập; nó là của Zhipu, và phép đo độc lập đặt mô hình thấp hơn khoảng năm điểm so với dải cận tiên phong và thấp hơn đáng kể so với con số đầu đề của nhà cung cấp. Trên cùng chỉ số hiện hành, bản thân GLM-5.3 đo được 45, nên con số 60 cho mô hình chủ lực xuất hiện trong bài đưa tin ra mắt của chúng tôi không còn khớp với những gì Artificial Analysis công bố hôm nay. Khoảng cách 15 điểm giữa tuyên bố và phép đo không phải là chênh lệch do làm tròn, và đó là điều hữu ích nhất mà người đọc có thể rút ra từ bản cập nhật này — kèm theo một lưu ý mà phần bên dưới bổ sung, bởi vì phép đo độc lập thứ hai trong câu chuyện này lại chỉ ra điều ngược lại.

Điều còn trụ lại sau sự chỉnh sửa đó thì hẹp hơn nhưng vẫn là thật. GLM-5.3-Flash là một mô hình đa phương thức trọng số mở với ngữ cảnh 1M cùng khả năng nhập hình ảnh và video gốc, với giá niêm yết chỉ bằng khoảng một phần mười so với người anh em chủ lực của nó — một sự kết hợp không có tương đương trực tiếp từ các phòng thí nghiệm tiên phong của Mỹ, nơi những mô hình đa phương thức tương đương có giá cao hơn đáng kể và được phát hành dưới dạng đóng. Cách định vị của chính Zhipu, "trí tuệ tiên phong, chi phí flash", lại chính là phần bị tổn hại: với điểm đo được là 42, nó là một mô hình giá rẻ mạnh mẽ, chứ không phải một mô hình tiên phong được bán giảm giá. Các phép đo độc lập cũng đặt nó thoải mái trên mức trung vị của những mô hình trọng số mở có kích thước tương đương, một thành tựu thực sự đối với một mô hình 18B tham số hoạt động với chi phí suy luận chỉ bằng một phần mười — chỉ có điều đó là một thành tựu khác với những gì mà các bài đưa tin ra mắt ngụ ý.

Con số độc lập còn lại — và nó đã nghiêng về phía mô hình.

Nếu kết quả của Artificial Analysis khiến GLM-5.3-Flash bị hạ một bậc, thì kết quả này lại đi theo hướng ngược lại, và đó là sự thật kỳ lạ nhất trong câu chuyện. ExploitBench, được xây dựng tại Carnegie Mellon, không hỏi liệu một mô hình có thể làm sập mục tiêu hay không. Nó chấm điểm cả quá trình leo thang: tiếp cận đoạn mã dễ bị tổn thương, kích hoạt lỗi, xây dựng các primitive tái sử dụng được, và cuối cùng là chiếm đoạt toàn bộ luồng điều khiển với khả năng thực thi mã tùy ý, được chấm một cách máy móc dựa trên V8 trong môi trường sản xuất với hộp cát bảo mật được bật. Generality Labs đã chạy GLM-5.3-Flash trên 41 lỗi với ngân sách 1 tỷ token cho mỗi lỗi thay vì giới hạn 300 lượt thường lệ của benchmark, với lập luận rằng số lượt là một đại diện kém cho những gì người mua thực sự chi ra và đô la mới là ràng buộc trung thực. GLM-5.3-Flash đạt khả năng thực thi mã tùy ý hoàn toàn trên 13 trong số 41 lỗi, và điểm năng lực trung bình là 64,8% mức tối đa của thang đo. Ba lượt chạy đã công bố của Claude Mythos Preview đạt 9, 10 và 11 trên cùng thang đo — trung bình là 10, tức 62,2%. Cách diễn đạt của chính Generality, in bên dưới biểu đồ, là GLM-5.3-Flash "có thể ngang tầm Mythos về mảng cyber" theo phép đo này. Lượt chạy ExploitBench của chính Anthropic, công bố ngày 29 tháng 9, báo cáo cùng thứ tự đó ở tỷ lệ tuyệt đối thấp hơn nhiều — dù là trên GLM-5.3 hàng đầu, không phải bản Flash: nó đếm số khai thác đầu-cuối trên mỗi lần thử thay vì tiến độ theo thang, và đặt GLM-5.3 ở mức 50 trên 410 so với 56 trên 410 của Mythos Preview. Quy tắc đếm khác nhau, thứ tự tương tự — đó chính xác là lý do vì sao không bao giờ nên trích dẫn một con số ExploitBench mà không kèm theo quy tắc.

Lý do thực sự quan trọng nằm ở mẫu số bên dưới nó. Lần chạy đó định giá token đầu ra của GLM-5.3-Flash ở mức $0.25 mỗi triệu — mức giá ra mắt giảm 50% của nó, vốn đã hết hạn — so với mức $125 mỗi triệu mang tính lịch sử của Claude Mythos Preview, một khoảng cách gấp 500 lần. Ở mức chi phí ngang bằng, lần chạy đó chi $16.81 cho mỗi lỗ hổng, so với $297.17 của Mythos, và đó là nguồn gốc của con số khoảng 6%. Hãy đọc tuyên bố này cho kỹ, bởi phiên bản đang lan truyền là phiên bản sai. Điều đó không phải là GLM-5.3-Flash là một nhà phát triển exploit giỏi hơn Claude Mythos Preview. Mà là một đô la token GLM-5.3-Flash mua được xấp xỉ những gì một đô la token Mythos mua được trong nhiệm vụ cụ thể này, và rằng bạn có thể chi trả cho nhiều đô la token loại trước hơn hẳn.

Những lưu ý của chính Generality đáng giá hơn dòng tít. Họ nói thẳng rằng một lần chạy duy nhất không thiết lập được sự ngang bằng trên toàn bộ lĩnh vực an ninh mạng, rằng vấn đề nhiễm dữ liệu vẫn còn bỏ ngỏ — ExploitBench có thể đã được dùng để huấn luyện theo cách nào đó — và rằng bốn trong số 41 mẫu bị lỗi và được chấm điểm bằng cách dùng lại kết quả quan sát được cuối cùng trước đó, điều mà nếu có gì cũng chỉ càng đánh giá thấp mô hình. Họ cũng công bố một bài tiếp theo vào ngày 28 tháng 9 khiến toàn bộ phép so sánh trở nên phức tạp hơn. Khi chạy GLM-5.3-Flash qua bảy harness tác tử khác nhau với ngân sách 250 triệu token, trên mười mẫu được chọn để bao quát dải độ khó, cùng một bộ trọng số đạt 10,6 dưới harness Codex — cao hơn mốc tham chiếu 10,02 của Claude Mythos Preview — và 6,2 dưới harness Claude Code, thấp hơn cả cấu hình giới hạn số lượt ban đầu của benchmark ở mức 6,4. Harness làm điểm số thay đổi nhiều hơn cả phép so sánh mô hình, và các tác giả nói rằng tập con mười mẫu có lẽ không đại diện. Việc biểu đồ lan truyền rộng rãi vào ngày 2 tháng 10 với lập luận rằng mở rộng compute lúc suy luận đang xóa nhòa khoảng cách giữa các tầng mô hình là một tuyên bố về ngành, không phải một phát hiện của đánh giá: điều mà đánh giá phát hiện là một mô hình mở giá rẻ, khi được cấp ngân sách thay vì giới hạn số lượt, có thể chạm tới chuyên gia khai thác lỗ hổng của một phòng thí nghiệm tiên phong trên một thang đo.

Đây không còn là câu chuyện của một phòng thí nghiệm duy nhất nữa. Đánh giá của chính nhóm Frontier Red Team thuộc Anthropic, công bố ngày 29 tháng 9, đã cho GLM-5.3-Flash — người anh em nhỏ hơn — chạy trong một phiên có con người tham gia trực tiếp: khi được giao các chi tiết công khai của một lỗ hổng Chrome đã được vá cùng một lỗi khác, mà không có chỉ dẫn đáng kể nào, mô hình đã nối chúng lại thành một exploit ARM64 đáng tin cậy, vượt qua được cơ chế tăng cường xác thực con trỏ, trong 20 phút sự tập trung của con người và tám giờ mô hình làm việc — 20,40 USD theo mức giá API của Zhipu. Chính đánh giá này là nguồn của con số 50 trên 410 trong ExploitBench ở trên, và phần đó đo GLM-5.3, mô hình chủ lực 743B, chứ không phải Flash — một sự khác biệt mà các bài đưa tin về báo cáo phần lớn đã làm mờ đi. Hai bên độc lập, những bộ khung thử nghiệm khác nhau, ngân sách khác nhau, cùng một hướng đi. Cả hai cũng đều chỉ là những lần chạy đơn lẻ của một phòng thí nghiệm và không cái nào là kết quả được tái lập, và chỉ có lượt chạy Generality mới báo cáo một con số đô-la cho Flash thay vì cho mô hình chủ lực. Cách hiểu thực tế chính là điều Anthropic nói thẳng ra: trọng số có thể tải xuống được, việc abliterate GLM-5.3-Flash mất khoảng 600 giờ GPU, và một mô hình tốn chưa đến một đô-la mỗi giờ để vận hành là một dạng vấn đề về tính sẵn có khác với một mô hình nằm sau một chương trình thẩm định.

Hãy thử xem, và lớp định tuyến khớp như thế nào.

Việc truy cập rất đơn giản. API của chính Zhipu phục vụ nó ở mức giá niêm yết nêu trên, các trọng số cấp phép MIT có trên Hugging Face tại zai-org/GLM-5.3-Flash ở FP8 và BF16, và các sản phẩm lập trình của Zhipu — ZCode và GLM Coding Plan — đóng gói kèm nó. Để tự vận hành, cả vLLM và SGLang đều hỗ trợ nó. Hai lưu ý thực tế nếu bạn đi theo hướng đó: cookbook của SGLang có một cảnh báo thay đổi đang mở rằng đầu vào thị giác có thể bị âm thầm loại bỏ trên các bản dựng transformers trước 5.13, điều này sẽ không báo lỗi và chỉ đơn giản cho bạn kết quả đọc chỉ có văn bản đối với một yêu cầu hình ảnh; và đường AMD vẫn chưa phải là một công thức triển khai. PR kích hoạt gfx950 vào ngày ra mắt ban đầu (sgl-project/sglang #37653) đã bị đóng mà không được hợp nhất vào ngày 6 tháng 9 và được thay thế bằng một tập hợp rộng hơn các pull request gfx950 day-zero — mHC qua AITER, bộ đánh chỉ mục DSA k-pool, phục vụ FP8 và MXFP4 — một số trong đó vẫn còn mở vào ngày 17 tháng 9. Việc kích hoạt trên phần cứng lớp MI350X đang được tiến hành, chưa được phát hành, và vẫn chưa có số liệu thông lượng AMD độc lập nào.

Về phía định tuyến, tình hình đã thay đổi kể từ khi ra mắt: GLM-5.3-Flash hiện đã có trong danh sách của OrcaRouter, cùng với phần còn lại của dòng GLM. Chúng tôi chuyển thẳng giá niêm yết của nhà cung cấp với mức chênh lệch 0% và không có phụ phí router, đây chính xác là cơ chế quan trọng đối với một mô hình vừa thay đổi giá — khoản giảm giá hết hạn ở phía Zhipu chính là mức giá bạn trả ở đây, ngay trong cùng ngày, không phải thương lượng lại hợp đồng thứ hai và không phải sửa mã nguồn. Việc chuyển thẳng giá đó có cả hai mặt, và cần nói rõ điều này: một chương trình khuyến mãi hết hạn là mức tăng giá thực sự trên hóa đơn của bạn, và nó xảy ra ở đây đúng vào thời điểm nó xảy ra ở phía thượng nguồn. Nếu bạn đang cân nhắc Flash so với GLM-5.3 hay một mô hình tiết kiệm khác, cả hai đều nằm sau một khóa duy nhất với khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, đó là cách rẻ để thử một mô hình mà các điểm số độc lập vẫn đang dần ổn định mà không đặt cược một đường production vào nó. Đây cũng là hình dạng phù hợp với kết quả ở trên, và vì một lý do thẳng thắn hơn cả sự tiện lợi: cùng một bộ trọng số đạt 10.6 hoặc 6.2 trên cùng một bài đánh giá, tùy thuộc vào việc harness tác nhân nào điều khiển chúng, nên điều mà người mua thực sự kiểm tra là sự kết hợp giữa scaffold và mô hình, và việc hoán đổi mô hình đằng sau một scaffold cố định dưới một khóa duy nhất thì rẻ hơn so với việc cam kết với một trong hai.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Xem gì tiếp theo

Bốn điều sẽ định đoạt phần còn lại của câu chuyện này. Thứ nhất, liệu 42 có thay đổi: mô hình này đã được công chúng sử dụng rộng rãi từ tháng Tám, nên nếu đánh giá nội bộ của Zhipu và harness của AA không đồng nhất vì một lý do cấu trúc — cách tính token suy luận, độ dài dòng, một đánh giá mà nhà cung cấp đã đặt trọng số lớn — thì điều đó sẽ xuất hiện khi chỉ số được sửa đổi thay vì là một khoảng cách một lần. Thứ hai, liệu kết quả khai thác có tái lập được không. Generality Labs đã chạy 41 lỗi một lần, trên harness riêng của mình, và nói rõ như vậy; phần theo dõi harness cho thấy cùng một trọng số dịch chuyển bốn điểm chỉ do lựa chọn harness, nên con số có thể giải quyết vấn đề là một nhóm thứ hai chạy lại 41 lỗi đó với ngân sách cố định bằng đô la và giữ nguyên harness. Thứ ba, liệu câu chuyện về silicon nội địa có thêm nguồn thứ hai. Zhipu là bên duy nhất có thể nêu ra kích thước cụm, tiến độ hai tuần và con số 3,2 lần, và tuyên bố duy nhất có thể xác minh độc lập trong đó — bản sửa lỗi kernel đã hợp nhất — là một tuyên bố nhỏ. Thứ tư, giá cả: ưu đãi giảm giá đã biến mất, và câu hỏi thú vị là liệu nó có quay trở lại như một chương trình khuyến mãi khi Zhipu cần khối lượng, hay liệu giá niêm yết giờ đây là mức sàn.

Mạch xuyên suốt là việc GLM-5.3-Flash đang được yêu cầu chứng minh hai điều khác nhau cùng một lúc — rằng một mô hình rẻ có thể đủ tốt, và rằng các accelerator Trung Quốc có thể phục vụ nó ở quy mô lớn — và công bố ngày 17 tháng 9 là câu trả lời của Zhipu cho câu hỏi thứ hai, được đưa ra bởi một mô hình đã góp phần viết nên nó. Câu hỏi thứ nhất giờ có hai con số độc lập gắn với nó và chúng chỉ về hai hướng ngược nhau: điểm 42 trên chỉ số trí tuệ, thấp hơn đáng kể so với con số tiêu đề của nhà cung cấp, và một lần chạy khai thác đạt ngang tầm chuyên gia của một phòng thí nghiệm tiên phong với chi phí chỉ bằng một phần hai mươi. Cả hai đều có thể đúng cùng lúc, và khoảng cách giữa chúng — không phải con số nào — mới là nơi các quyết định thực sự được đưa ra.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày