
GLM 5.5 hay GLM 5.3-Vision? Một mô hình ẩn danh khớp với dấu vân tay của Z.ai vừa xuất hiện
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 150 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Một mô hình chưa được xác định với đặc điểm phục vụ — tốc độ, thời gian đến token đầu tiên, tỷ lệ trúng cache — khớp với ngăn xếp GLM của Z.ai đang bắt đầu thu hút sự chú ý của các nhà phân tích năng lực, và phỏng đoán tạm thời là nó có thể được đặt tên GLM 5.3-Vision hoặc GLM 5.5. Vào ngày 20 tháng 8, nhà phân tích năng lực tính toán teortaxesTex đã đăng rằng một mô hình ẩn danh mà anh theo dõi "rõ ràng không phải DeepSeek, ít nhất là vậy," rằng "cho đến nay chưa có gì loại trừ GLM," và rằng "tốc độ, ttft, tỷ lệ trúng cache cũng khớp với GLM." Nhận định của anh: dự kiến nó sẽ được gọi là GLM 5.3-Vision hoặc 5.5, đạt khoảng 61 điểm trên Artificial Analysis Intelligence Index — cao hơn một điểm so với mức GLM-5.3 đã ra mắt hiện đang đạt. Chưa có gì được xác nhận ở đây. Không có thẻ mô hình, không có thông báo từ Z.ai, và không có API. Trang này coi sự quan sát này đúng như bản chất của nó: một tín hiệu rò rỉ sớm, chưa được tái xác nhận, đáng để theo dõi chính vì GLM-5.5 đã là mô hình chủ lực được mong đợi của Z.ai suốt cả tháng và vẫn chưa xuất hiện. Năm ngày sau bài đăng đó, một điểm dữ liệu thứ hai — lần này có thể kiểm chứng đầy đủ — đã đến: vào ngày 25 tháng 8, vLLM — runtime suy luận đứng sau hầu hết việc phục vụ mô hình quy mô lớn — đã mở một pull request Do-Not-Merge cho phép hỗ trợ kernel masked-MHA cho các kích thước head của GLM-5. Nó không nêu tên biến thể nào và cũng không chứng minh việc ra mắt; đó là công việc nền móng cho ngăn xếp phục vụ, kiểu hoạt động hậu trường mà một mô hình mới để lại phía sau.
Điều mà tín hiệu thực sự nói
Nguồn là một bài đăng X duy nhất từ teortaxesTex, đề ngày 20 tháng 8 — cũng chính là tài khoản mà tín hiệu thời điểm "khoảng một tuần" về đợt ra mắt GLM-5.3 hồi tháng 8 đã khớp đến từng ngày. Cách trình bày nêu rõ mức độ bằng chứng: "bằng chứng mạnh (chưa tái lập)." Nhà phân tích loại trừ DeepSeek, không tìm thấy gì mâu thuẫn với GLM, và trích dẫn ba phép đo ở cấp độ serving — throughput, thời gian đến token đầu tiên, và tỷ lệ trúng cache — là khớp với stack của Z.ai. Sau đó là hai cái tên ứng viên, và một điểm số dự kiến: "Hiện tại tôi kỳ vọng nó sẽ được gọi là GLM 5.3-Vision hoặc 5.5, và đạt khoảng 61 trên AA."
Hãy xem xét từng phần một cách riêng biệt. Các tuyên bố về danh tính (không phải DeepSeek, khớp với GL M) là suy luận dấu vân tay từ cách mô hình được phục vụ, không phải từ thẻ mô hình. Điểm số là một kỳ vọng, không phải một phép đo. Các tên gọi chỉ là phỏng đoán. Điều khiến tín hiệu đáng giá hơn nhiễu là nó nhất quán về mặt định hướng với mọi thứ khác mà chúng ta biết về lộ trình của Z.ai trong tháng này: GLM-5.3 được phát hành chỉ với văn bản, yêu cầu lớn nhất từ cộng đồng là thị giác, và GLM-5.5 đã được nhiều nguồn tin đưa tin (qua JPMorgan, Reuters, CGTN, và một ghi chú của Goldman vào ngày 18 tháng 8) là sẽ ra mắt "trong tháng 8" — thời điểm cuối tháng chính là bây giờ.
Tại sao dấu vân tay phục vụ lại quan trọng
{{1}}Time-to-first-token và tỷ lệ trúng bộ nhớ đệm là những dấu hiệu ở cấp hạ tầng.{{/1}} {{2}}Chúng được định đoạt bởi cách một nhà cung cấp xây dựng ngăn xếp suy luận của họ — bộ lập lịch, cách bố trí bộ nhớ đệm, chính sách xử lý theo lô — chứ không phải bởi tên mô hình mà một prompt gọi đến.{{/2}} {{3}}Khi một nhà phân tích nói rằng TTFT và tỷ lệ trúng bộ nhớ đệm của một mô hình ẩn danh khớp với GLM, họ đang nói rằng ngăn xếp phục vụ phía sau nó hoạt động giống như của Z.ai, thứ gần nhất với một dấu vân tay mà bạn có thể có được mà không cần trọng số hay thẻ mô hình.{{/3}} {{4}}Đó không phải là bằng chứng.{{/4}} {{5}}Một nhà cung cấp khác có thể sao chép cùng một ngăn xếp, hoặc Z.ai có thể phục vụ một mô hình cho một đối tác.{{/5}} {{6}}Nhưng đó là một tuyên bố cụ thể, có thể kiểm chứng, và lời dè dặt "chưa tái lập" cho bạn biết nhà phân tích không trình bày nó như một điều đã ngã ngũ.{{/6}}
Việc loại trừ DeepSeek cũng đáng chú ý. DeepSeek V4 Pro đã GA vào ngày 13 tháng 8 và bản Flash của nó là bản phát hành open-weight Trung Quốc tốc độ cao khác trong tháng này. Một mô hình ẩn danh loại trừ DeepSeek nhưng chỉ vào GLM sẽ thu hẹp phạm vi xuống pipeline của Z.ai — và pipeline của Z.ai có hai ứng viên khả dĩ, đó chính xác là nhánh rẽ mà tín hiệu nêu tên.
Tín hiệu thứ hai: serving stack đang được xây dựng cho attention của GLM-5
Vào ngày 25 tháng 8, một điểm dữ liệu thứ hai đã xuất hiện — điểm này có thể kiểm chứng hoàn toàn. vLLM, runtime suy luận đứng sau hầu hết các hệ thống phục vụ mô hình quy mô lớn, đã nhận được pull request #53785, có tiêu đề "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Đã xác minh với kho lưu trữ, PR này kích hoạt đường dẫn prefill masked-MHA cho cấu trúc attention của GLM-5: 64 heads, KV rank 512, kích thước head QK 192+64, và kích thước head V 256 — bố cục QK/V 256/256, theo mô tả trong PR. PR này phụ thuộc vào một thay đổi của FlashAttention để hỗ trợ mặt nạ (mask) cho head-dimension-256, tạm thời cố định FlashAttention vào một commit fork (đó là lý do cho nhãn Do Not Merge), và bổ sung các ngưỡng định tuyến đã benchmark cho đường dẫn mới: giới hạn pure-prefill của FlashMLA là 8K / 20K / 48K / 112K token tại TP 1/2/4/8, và giới hạn 64K được làm tròn cho FlashInfer tại TP8. Tác giả lưu ý rằng không có PR mở nào khác bao phủ hỗ trợ masked-MHA cho GLM-5.
Hãy đọc nó đúng như bản chất: công việc nền tảng cho ngăn xếp phục vụ, không phải một thông báo. PR không nêu tên GLM 5.5 hay GLM 5.3-Vision — nó ghi "GLM-5" — và việc kích hoạt đường dẫn prefill MHA có mặt nạ cho kích thước head của GLM-5 là công việc hạ tầng trên một dòng họ mà hệ sinh thái vLLM đã chạy trên đường dẫn sparse-MLA (nguồn gốc của chính GLM-5.3 hiện được phục vụ ở đó). Nó cũng không đơn lẻ: các PR anh em trong tháng này đã bao gồm kiểm tra kích thước MLA của FlashInfer cho GLM-5, phương án dự phòng sparse-MLA bằng Triton cho các mô hình lớp GLM-5, và hỗ trợ kích thước theo báo cáo của FlashAttention. Hai chi tiết khiến nó nằm trong tầm ngắm của trình theo dõi rò rỉ. Thứ nhất, cấu trúc hình học mà nó nhắm tới — 64 head, hạng KV 512, 256/256 QK/V — khác biệt với 192/128 của DeepSeek, vốn cũng chính là sự tách biệt "không phải DeepSeek, khớp với GLM" mà dấu vân tay của mô hình ẩn danh rút ra, giờ đây có thể thấy ở mức kernel chú ý. Thứ hai, thời điểm: PR được mở vào ngày 25 tháng 8, nằm trong cùng khoảng thời gian tháng 8 mà GLM-5.5 đã được trông đợi suốt cả tháng. Không điều nào trong số đó chứng minh mô hình ẩn danh là GLM thế hệ tiếp theo — điều này cũng có thể chỉ là kỹ thuật trên mô hình đã ra mắt — nhưng đó là loại hoạt động nền mà hệ sinh thái phục vụ thường làm trước khi ra mắt một mô hình, và nó có thể kiểm chứng theo cách mà không bài đăng X nào có thể.
Hai tên gọi, một nhánh: GLM 5.3-Vision so với GLM 5.5
Hai danh tính ứng viên thực sự là những sản phẩm khác nhau, và vụ rò rỉ không làm rõ được cái nào đang có trên bo mạch.
GLM 5.3-Vision sẽ là một biến thể có khả năng xử lý hình ảnh của mô hình được phát hành vào ngày 14 tháng 8. GLM-5.3 chỉ nhận đầu vào văn bản — Artificial Analysis liệt kê nó là văn bản vào, văn bản ra, không hỗ trợ hình ảnh — và khoảng trống đó là lời phàn nàn lớn nhất của cộng đồng. Khi Tang Jie của Z.ai chạy một chiến dịch thu thập phản hồi toàn cầu, các bình luận về cơ bản đều nhất trí mong muốn khả năng xử lý hình ảnh, và Z.ai đã có sẵn các nền tảng (mô hình đa phương thức GLM-5V-Turbo và bộ mã hóa CogVLM) mà họ chưa tích hợp vào dòng sản phẩm chủ lực. Một biến thể 5.3-Vision sẽ là cách nhanh nhất để lấp khoảng trống đó.
• GLM 5.5 chính là sản phẩm chủ lực. Các thông số được báo cáo nhưng chưa xác nhận chỉ ra nền tảng trên một nghìn tỷ tham số (tăng từ 743B của GLM-5.3), kế thừa ngữ cảnh 1M token, trọng số mở, và tập trung mạnh hơn vào tác nhân/lập trình. Mọi ghi chú của nhà phân tích trong tháng này đều coi 5.5 là bản lớn — công cụ mà đồng sáng lập Z.ai là Tang Jie đã ám chỉ sẽ thu hẹp khoảng cách với các mô hình đóng hạng Fable. Nó dự kiến ra mắt trong tháng 8 và vẫn chưa được phát hành tính đến thời điểm viết bài.
Cùng một dấu vân tay không thể cho bạn biết đây là cái nào trong hai — bản 5.3 tinh chỉnh thị giác và một flagship mới đều có thể chạy trên cùng một ngăn xếp phục vụ. Sự mơ hồ đó là trạng thái trung thực của tín hiệu, và hai cái tên trong bài đăng của nhà phân tích phản ánh điều đó thay vì giải quyết nó.
img src="2.png" alt="Bảng so sánh hai cột có tựa đề 'GLM 5.5 vs GLM-5.3 — bảng điểm'. Cột trái GLM 5.5 (bị rò rỉ): 'Chỉ số AA ~61 (dự kiến, chưa xác minh)', 'Trạng thái: chưa phát hành', 'Kích thước >1T tham số (đồn đoán)', 'Thị giác: dự kiến', 'Ngữ cảnh: 1M (dự kiến)', 'Giá: TBD'. Cột phải GLM-5.3 (đã phát hành): 'Chỉ số AA 60', 'Trạng thái: API hoạt động từ 19/8', 'Kích thước 743B MoE / 40B hoạt động', 'Thị giác: chỉ văn bản', 'Ngữ cảnh: 1M', 'Giá: $1.40 / $4.40'. Chân trang ghi 'Số liệu GLM 5.5 là dự kiến chưa xác minh; GLM-5.3 theo Artificial Analysis.'" />

Điểm ~61 trên Chỉ số Thông minh AA sẽ có ý nghĩa gì?
Điểm dự kiến là phần nhạy cảm nhất của thông tin rò rỉ. Chỉ số Trí tuệ Phân tích Nhân tạo (v4.1.1) hiện xếp GLM-5.3 ở mức 60 — ngang bằng với Kimi K3 cho điểm số trọng số mở cao nhất, và vượt 7 điểm so với mức 53 của GLM-5.2. Cao hơn một bậc, ở mức 61, là vùng của GPT-5.6 Sol, với Claude Fable 5 ở mức 62 và Claude Opus 5 ở mức 63. Nói một cách đơn giản: một mô hình thuộc dòng GLM đạt 61 điểm sẽ là điểm số trọng số mở cao nhất trên chỉ số, vượt trội hoàn toàn so với Kimi K3 và GLM-5.3, và thực chất đã chạm đến ranh giới mô hình đóng tiên tiến nhất.
Điều đáng nhấn mạnh là 61 không phải là gì. Nó là kỳ vọng của teortaxesTex về những gì một cuộc đánh giá độc lập sẽ đưa ra, không phải là điểm số Artificial Analysis đã công bố, cũng không phải con số từ nhà cung cấp. Một phép chiếu có thể sai theo cả hai hướng — một biến thể thị giác có thể mất một hoặc hai điểm trên chỉ số nặng về văn bản, và một mẫu flagship >1T có thể đạt kết quả cao hơn hoặc thấp hơn tùy thuộc vào quá trình hậu huấn luyện của nó. Giá trị của con số nằm ở tuyên bố mà nó chứa đựng: dù mô hình ẩn danh này cuối cùng là ai, nó được kỳ vọng sẽ vượt qua người dẫn đầu trọng số mở hiện tại thay vì chỉ đơn thuần đạt ngang bằng.

Điều gì đã được xác nhận, và điều gì chưa được xác nhận?
Giữ sổ sách sạch sẽ, vì một bài viết rò rỉ sống hay chết phụ thuộc vào điều đó.
• Đã xác nhận: GLM-5.3 là có thật, phát hành ngày 14 tháng 8, API hoạt động từ ngày 18/19 tháng 8, đạt 60 điểm trên Chỉ số Thông minh AA (được Artificial Analysis đo lường độc lập), giá $1.40 / $4.40 cho mỗi 1 triệu token, chỉ hỗ trợ đầu vào văn bản, với trọng số mở đã được xác nhận vào thứ Sáu, ngày 28 tháng 8. Những sự thật này không phụ thuộc vào thông tin rò rỉ.
• Đã xác nhận: GLM-5.5 vẫn chưa được phát hành. Tính đến thời điểm viết bài này, chưa có thẻ mô hình, chưa có bảng giá và chưa có khả năng truy cập; cửa sổ tháng 8 và con số hơn 1 nghìn tỷ tham số chỉ do các nhà phân tích đưa tin, không phải cam kết từ Z.ai.
• Chưa được xác nhận: rằng mô hình ẩn danh tồn tại như một sản phẩm riêng biệt, rằng đó là GLM, rằng tên của nó sẽ là GLM 5.3-Vision hoặc 5.5, và rằng nó đạt điểm 61. Cả bốn điều này đều dựa trên một bài đăng chưa được kiểm chứng lại của một nhà phân tích.
• Cũng chưa được xác nhận: liệu mô hình ẩn danh này có thực sự khác biệt với chính GLM-5.3 hay không. Một điểm cuối GLM-5.3 đang hoạt động dưới một bí danh không được gắn nhãn sẽ tạo ra cùng một dấu vân tay phục vụ (serving fingerprint). Cho đến khi một cái tên, một thẻ mô hình (model card), hoặc một bản công bố trọng số (weight drop) làm rõ điều đó, cách đọc "mô hình mới" là tiên nghiệm mạnh (strong prior) nhưng không phải là một sự thật.
Xem gì tiếp theo
• Thứ Sáu, ngày 28 tháng 8 — các trọng số GLM-5.3. Nếu mô hình ẩn danh thực chất là một phiên bản 5.3 được đổi tên hoặc là 5.3-Vision, việc phát hành trọng số và thẻ mô hình sẽ giải quyết nhanh chóng.
• Một lần quan sát xác nhận thứ hai. Dấu vân tay của một nhà phân tích chỉ là một giả thuyết; một lần đọc độc lập thứ hai trên cùng một mục ẩn danh, hoặc một danh sách Artificial Analysis nêu tên nó, sẽ nâng nó lên thành bằng chứng.
• Bất kỳ tuyên bố nào từ Z.ai. GLM-5.5 được báo cáo là sẽ ra mắt trong khoảng tháng 8, và tháng này gần như đã kết thúc. Việc đặt tên chính thức, một trang giá, hoặc một mục trong nhật ký thay đổi API là sự kiện biến thông tin rò rỉ này thành một câu chuyện ra mắt.
• Liệu điểm số AA có thực sự đạt 61 hay không. Nếu mô hình ẩn danh là thật và thuộc họ GLM, một điểm chỉ số độc lập gần 61 sẽ là số liệu trọng số mở đầu tiên vượt qua 60.
Liệu công việc attention của vLLM có được gắn tên một mô hình hay không. PR #53785 nhắm đến kích thước head của "GLM-5" mà không nêu tên 5.3-Vision hay 5.5; một bản merge, một mục trong danh sách mô hình được hỗ trợ, hoặc một model card ghép hình dạng đó với một tên cụ thể sẽ là tín hiệu rõ ràng nhất cho đến nay.
Cách xử lý khi có rò rỉ như thế này
Rò rỉ là lý do để chuẩn bị, không phải để chuyển nền tảng. Nếu mô hình tiếp theo thuộc dòng GLM đạt vị trí đầu hoặc gần đầu bảng xếp hạng open-weights, câu hỏi thực tế là có nên định tuyến lưu lượng thực đến nó hay không — và một mô hình chưa được kiểm chứng với lời khẳng định từ nhà cung cấp cùng dự đoán của một nhà phân tích chính là trường hợp bạn cần một tấm lưới an toàn thay vì một vụ cá cược. GLM-5.3 phát hành tuần trước đã hoạt động trên OrcaRouter — trang mô hình hiển thị giá $1.26 / $3.96 cho mỗi 1M token, chiết khấu 10% khi ra mắt so với giá niêm yết $1.40 / $4.40 của nhà cung cấp, chuyển qua không tăng giá — và thiết lập định tuyến này chính là thứ mà bản 5.5 hoặc 5.3-Vision sẽ kế thừa ngay khi ra mắt. Hướng một phần lưu lượng đến mô hình mới qua bộ định tuyến với cơ chế tự động chuyển sang mô hình đã kiểm chứng — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — và bạn có được tín hiệu chất lượng trên chính khối lượng công việc của mình thay vì một bản trình chiếu. Nếu dự đoán từ rò rỉ là đúng, bạn biết trước; nếu sai, cơ chế chuyển đổi dự phòng sẽ hấp thụ rủi ro và không có gì được phát hành lỗi. Cùng một khóa, không cần hợp đồng thứ hai, và không cần chọn giữa hai tên ứng viên cho đến khi Z.ai chọn.
GLM sắp ra mắt — câu hỏi mở duy nhất là nó sẽ mang tên gì. GLM 5.3-Vision sẽ là cách Z.ai khép lại khoảng trống bị phàn nàn nhiều nhất trên mô hình vừa phát hành; GLM 5.5 sẽ là mô hình chủ lực nghìn tỷ tham số mà cả tháng nay mọi người đều hướng tới. Mục ẩn danh teortaxesTex được ghi dấu vân tay vào ngày 20 tháng 8 là đối tượng cụ thể đầu tiên trông giống một trong hai, và điểm dự kiến 61 trên AA Intelligence Index của nó sẽ đưa nó lên trước mọi mô hình mở hiện có trên bảng. Năm ngày sau dấu vân tay, hệ thống phục vụ cũng có động thái: công trình attention GLM-5 của vLLM chính là loại nền tảng mà một mô hình mới để lại, dù nó không nêu tên biến thể nào. Không điều nào được xác nhận, và trang này sẽ cập nhật ngay khi tên, thẻ thông số hoặc trọng số làm rõ vấn đề. Cho đến lúc đó, động thái ít rủi ro là chuẩn bị sẵn sàng định tuyến — chứ không phải đặt cược hệ thống vào một dấu vân tay.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
