
GLM 5.3 Prime: Vẫn cùng trọng số GLM-5.3, với mức giá đúng gấp đôi bảng giá niêm yết
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 177 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1323 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
GLM 5.3 Prime có giá 2,80 đô-la cho mỗi triệu token đầu vào và 8,80 đô-la cho mỗi triệu token đầu ra. GLM-5.3, mô hình mà nó chạy trên đó, có giá 1,40 đô-la và 4,40 đô-la. Đó không phải là chênh lệch do làm tròn hay mức chênh lệch khuyến mãi — mà chính xác là 2,0× ở cả hai dòng, và đó là điểm duy nhất mà hai sản phẩm này khác nhau. GLM 5.3 Prime không phải là một mô hình mới. Nó mang chính bộ trọng số của GLM-5.3, bộ trọng số mà Z.ai đã mở vào ngày 25 tháng 8 năm 2026, được phục vụ bởi một ngăn xếp nhanh hơn. Bản thân GLM-5.3 được công bố vào ngày 14 tháng 8 năm 2026 và có mặt trên API vào ngày 18 tháng 8. Không có gì ở mô hình cơ sở thay đổi khi ID Prime xuất hiện vào cuối tháng 9. Điều thay đổi là có người đã gắn thêm một mức giá thứ hai lên nó.
Nếu bạn đang đọc bài này vì một danh sách mô hình đã cho bạn thấy một cái tên lạ đứng cạnh một cái tên quen thuộc, thì câu trả lời ngắn gọn là: bạn đang nhìn vào một bậc phục vụ (serving tier), chứ không phải một bản phát hành. Câu trả lời dài hơn đáng để bỏ ra hai phút, bởi vì phép tính thì sạch sẽ một cách lạ thường, còn lai lịch thì mờ mịt một cách lạ thường.
Gói “Prime” là gì, trong một đoạn văn.
Một tầng phục vụ là một ID sản phẩm thứ hai trỏ đến cùng các trọng số, được tinh chỉnh cho thông lượng thay vì cho chi phí. Bạn không nhận được một mô hình lớn hơn, một ngữ cảnh dài hơn, một chế độ suy luận tốt hơn hay một bề mặt công cụ rộng hơn. Bạn nhận được token ra khỏi cửa nhanh hơn, và bạn trả tiền cho đặc quyền đó trên từng token thay vì trên thời gian đồng hồ thực mà bạn tiết kiệm được. Sự đánh đổi đó là có thật và đôi khi là đúng đắn — một vòng lặp agent nhiều bước thực hiện mười lệnh gọi tuần tự thực sự hưởng lợi từ việc mỗi lệnh gọi trả về sớm hơn — nhưng đó là một giao dịch mua độ trễ, không phải mua năng lực, và nó nên được định giá như vậy.
Mô tả của nhà cung cấp cho GLM 5.3 Prime nói thẳng điều thường được giữ kín: nó là "biến thể tốc độ cao của GLM-5.3 do Z.ai phát triển, kế thừa toàn bộ năng lực của nó trong khi đạt thông lượng đầu ra gấp 1,5–2× nhờ tăng tốc suy luận." Toàn bộ năng lực. Cùng cửa sổ ngữ cảnh 1.000.000 token. Cùng giới hạn đầu ra 131.072 token. Văn bản vào, văn bản ra. Suy luận là bắt buộc, với thấp, cao và tối đa mức nỗ lực và tối đa là mặc định — giống hệt mô hình cơ sở.
Bảng giá, so sánh song song
• Đầu vào — GLM 5.3 Prime $2.80 mỗi 1M so với GLM-5.3 $1.40 mỗi 1M
• Đầu ra — GLM 5.3 Prime $8.80 mỗi 1M so với GLM-5.3 $4.40 mỗi 1M
• Đầu vào được lưu đệm — GLM 5.3 Prime $0.56 mỗi 1M so với GLM-5.3 $0.26 mỗi 1M
• Hệ số nhân — 2.0× trên cả ba dòng, ở cả hai chiều
• Ngữ cảnh — 1,000,000 token trên cả hai
• Đầu ra tối đa — 131,072 token trên cả hai
• Suy luận — bắt buộc trên cả hai, cùng ba mức nỗ lực, cùng mặc định
Dòng cache là thứ mọi người thường bỏ sót. Một lượt đọc cache là token rẻ nhất mà bạn sẽ mua từ một mô hình tiên tiến, và đó chính là nơi các khối lượng công việc agent thực sự tiêu ngân sách — prompt hệ thống, định nghĩa công cụ và bản ghi hội thoại ngày càng dài đều được đọc lại ở mỗi lượt. Tăng gấp đôi giá cache sẽ nhân đôi khoản mục lớn nhất trong một phiên agent dài, nghĩa là mức phụ trội thực tế trên một khối lượng công việc thật gần với 2× hơn là mức chênh lệch được quảng cáo trên token đầu vào mới gợi ý. Nếu bạn hy vọng làn nhanh sẽ rẻ hơn trên thực tế vì bạn cache mạnh tay, thì không phải vậy.
Ai thực sự đang bán nó?
Đây là chỗ danh sách trở nên thú vị, và cũng là chỗ người đọc kỹ càng nên chậm lại. Tài liệu của chính Z.ai, phần tổng quan mô hình và trang giá đã công bố của họ không liệt kê SKU Prime nào. Tìm mã mô hình của nhà cung cấp cho glm-5.3-prime thì bạn chẳng thấy gì. Gói tốc độ của chính Z.ai là một sản phẩm khác trên một dòng hoàn toàn khác — GLM-5.3-FlashX, nằm trong dòng Flash rẻ hơn, ra mắt ngày 18 tháng 9 năm 2026, và có giá $0.37 và $1.25 mỗi triệu token.
Vậy nên Prime là một sản phẩm phía nền tảng, được xây dựng trên trọng số của Z.ai. Hai chi tiết cho thấy đó là nền tảng của ai. Thứ nhất là cách diễn đạt "1.5–2× output throughput", vốn là cùng cách nói mà một nhà cung cấp đám mây lớn dùng cho chế độ phục vụ tăng tốc của riêng họ — một chế độ bạn bật bằng cách chuyển đổi model ID, với các khả năng và giới hạn sử dụng được giữ nguyên một cách rõ ràng. Thứ hai là danh sách chỉ nêu đúng một nhà cung cấp thượng nguồn đằng sau endpoint. Một nhà cung cấp duy nhất đằng sau một SKU phân hạng nhanh không phải là cách một mô hình trọng số mở được phục vụ; đó là cách một triển khai tăng tốc của chính nền tảng trông như thế nào từ bên ngoài.
Không điều nào trong số đó khiến GLM 5.3 Prime trở thành một sản phẩm tồi. Nó chỉ khiến nó thành một sản phẩm chỉ có một nhà cung cấp, và đó là câu hỏi về khả năng phục hồi mà bạn nên đặt ra trước khi định tuyến lưu lượng production qua nó.
Tuyên bố về tốc độ có giá trị đến đâu

Con số 1,5–2× là một tuyên bố về thông lượng được đo trong điều kiện của chính nhà cung cấp, và thông lượng là chỉ số nhạy cảm nhất với những điều kiện đó. Số token đầu ra mỗi giây trên một bộ nhớ đệm đã được làm nóng với prompt ngắn và một cụm nhàn rỗi không phải là con số mà một agent ngữ cảnh dài nhìn thấy. Đo lường độc lập đối với mô hình cơ sở đặt GLM-5.3 ở khoảng 61 token đầu ra mỗi giây và GLM-5.3-Flash ở khoảng 46, trên một tập mà mức trung bình của nhóm là 67 — vì vậy làn rẻ hơn cũng là làn chậm hơn, ngược lại với điều mà tên gọi gợi ý. Đó là các trung vị trên một tập đánh giá được chuẩn hóa, không phải các đỉnh.
Ngoài ra còn có một chi phí khó thấy hơn. Mức nỗ lực suy luận mặc định trên cả hai ID là max, đây là cài đặt tạo ra các chuỗi suy nghĩ dài nhất. Tốc độ và độ dài đầu ra kéo theo hai hướng ngược nhau ở đây: một tầng nhanh cũng suy luận ở độ dài tối đa vẫn có thể chậm từ đầu đến cuối với một bài toán khó, vì nút thắt cổ chai là số token mà mô hình quyết định tạo ra, chứ không phải tốc độ mà nó tạo ra chúng. Nếu khối lượng công việc của bạn nặng về suy luận, hãy giảm xuống high hoặc low trước khi bạn trả gấp 2 lần để tăng tốc — mức nỗ lực sẽ làm thay đổi độ trễ của bạn nhiều hơn tầng phục vụ.
Ba cách để mua cùng một mẫu

GLM-5.3 hiện tồn tại dưới ba hình thức có thể mua được, và chúng không phải là ba mô hình:
• GLM-5.3 ở mức $1.40 / $4.40 — bảng giá cơ bản, đầy đủ năng lực, phiên bản có trọng số mở được công bố mà bạn có thể tự lưu trữ
• GLM 5.3 Prime ở mức $2.80 / $8.80 — cùng trọng số nhưng chạy qua một stack tăng tốc, một nhà cung cấp thượng nguồn, không liên quan đến trọng số
• GLM-5.3-FlashX ở mức $0.37 / $1.25 — hoàn toàn không phải GLM-5.3, mà là bậc tốc độ trên dòng Flash rẻ hơn, và là cách rẻ nhất để mua độ trễ
Dòng thứ ba là dòng đáng để nhìn kỹ. Nếu điều bạn thực sự muốn là token nhanh hơn và bạn linh hoạt về việc lấy chúng từ mẫu GLM nào, thì FlashX mang lại khả năng tăng tốc trên một mô hình vốn đã chỉ tốn khoảng một phần mười so với flagship, với chi phí chưa bằng một nửa mức mà flagship tốn khi không được tăng tốc. Prime chỉ hợp lý nếu bạn thực sự cần chất lượng suy luận của GLM-5.3 và thực sự cần nó sớm hơn.
Vị trí của điều này ở phía chúng tôi

Chúng ta nên nói thẳng một điều: OrcaRouter không lưu trữ GLM 5.3 Prime, và chúng tôi cũng không lưu trữ GLM-5.3-FlashX. Cả hai trang mô hình đều trả về 404 trên trang web của chúng tôi. Nếu bạn muốn bậc tăng tốc, bạn sẽ phải mua nó từ nền tảng bán nó, hoặc từ API riêng của nhà cung cấp dành cho mô hình cơ sở.
Chúng tôi host GLM-5.3 và GLM-5.3-Flash theo đúng giá niêm yết của nhà cung cấp, không cộng thêm bất kỳ khoản chênh lệch nào — đúng mức $1.40 và $4.40 mà bạn thấy trên bảng giá của chính Z.ai, được chuyển thẳng nguyên giá thay vì bị định giá lại. Điều đó quan trọng hơn vẻ ngoài của nó đối với một mô hình mà giá đã thay đổi hai lần chỉ trong sáu tuần. Vì chúng tôi không cộng thêm chênh lệch, nên khi nhà cung cấp thay đổi giá, phía chúng tôi cũng áp dụng ngay trong cùng ngày họ áp dụng, không cần migration hay ticket hỗ trợ. Cả hai ID đều nằm sau một API key duy nhất, cùng với hơn 200 mô hình khác, nên việc A/B giữa GLM-5.3 và GLM-5.3-Flash chỉ là đổi tên mô hình trong một dòng thay vì phải ký thêm hợp đồng thứ hai, và failover tự động sẽ bảo vệ bạn nếu một nhà cung cấp thượng nguồn đơn lẻ bị suy giảm — đây chính là rủi ro đặc thù mà một tier nhanh chỉ phụ thuộc vào một nhà cung cấp duy nhất phải gánh chịu.
Bạn có nên trả 2× không
Hãy trả khoản đó nếu một con người hoặc một dịch vụ thượng nguồn đang bị chặn để chờ phản hồi, khối lượng công việc bị giới hạn bởi độ trễ chứ không phải bởi thông lượng, và bạn đã xác nhận rằng nỗ lực suy luận chính là nguyên nhân thực sự gây ra độ trễ của mình. Đừng trả khoản đó nếu bạn đang chạy sinh hàng loạt qua đêm, nếu khối lượng của bạn đủ lớn đến mức mức phụ thu token gấp 2× vượt qua thời gian thực tế mà bạn tiết kiệm được, hoặc nếu bạn đang hy vọng gói này sẽ lặng lẽ là một mô hình tốt hơn. Không phải vậy. Đó là GLM-5.3 với một chiếc đồng hồ bấm giây đang chạy, và chiếc đồng hồ bấm giây tính phí theo token.
Cách diễn giải trung thực cho toàn bộ dòng GLM-5.3 ở thời điểm hiện tại là Z.ai đã phát hành một mô hình vào tháng 8 và thị trường đã dành trọn tháng 9 để đóng gói lại nó dưới bốn mức giá khác nhau. GLM 5.3 Prime là gói đắt nhất trong số đó. Nó cũng là gói có hồ sơ dấu vết mỏng nhất, bởi vì công ty đứng tên trên phần trọng số không liệt kê nó. Đó không phải là lý do để tránh nó. Đó là lý do để biết chính xác mình đang mua gì trước khi đưa nó vào lộ trình sản xuất.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
