
GLM 5.3 Prime vs GLM-5.3: Gấp đôi giá cho cùng trọng số và một chiếc đồng hồ bấm giây
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 177 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1323 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Không có câu hỏi nào về chất lượng trong so sánh này, và chính điều đó khiến nó trở nên khác thường. GLM 5.3 Prime và GLM-5.3 là cùng một mô hình — cùng trọng số, cùng ngữ cảnh 1.000.000 token, cùng giới hạn đầu ra 131.072 token, cùng suy luận bắt buộc với cùng ba mức nỗ lực, cùng điểm số trên mọi benchmark đã công bố. GLM-5.3 được công bố vào ngày 14 tháng 8 năm 2026, ra mắt API vào ngày 18 tháng 8, và được mở trọng số vào ngày 25 tháng 8; ID Prime xuất hiện vào cuối tháng 9 như một cách thứ hai để mua đúng thứ y hệt. Hàng duy nhất trong so sánh có sự khác biệt là hàng quan trọng với hoá đơn của bạn, và nó khác biệt đúng 2,0×.
Vậy câu hỏi không phải là nên dùng mô hình nào. Mà là liệu một làn phục vụ tự nhận đạt thông lượng đầu ra gấp 1,5–2 lần có đáng với mức giá gấp đôi hay không, và đó là phép tính mà bạn có thể làm trong một đoạn văn. Hầu hết các bài viết về cặp này đều bỏ qua phép tính và tranh luận về những benchmark mà, xét theo cách dựng, vốn giống hệt nhau. Đây là phép tính.
Chỉ những hàng khác biệt

• Giá — GLM 5.3 Prime $2.80 / $8.80 mỗi 1M so với GLM-5.3 $1.40 / $4.40 mỗi 1M
• Đầu vào được cache — $0.56 mỗi 1M so với $0.26 mỗi 1M
• Hệ số nhân — 2.0× trên mọi dòng, ở cả hai chiều, không có ngoại lệ
• Thông lượng — nhà cung cấp báo cáo 1.5–2× trên làn tăng tốc so với làn tiêu chuẩn; không tồn tại phép đo độc lập nào cho ID Prime
• Chỉ số Thông minh — 45 trên cả hai, vì đây là một mô hình được chấm điểm một lần
• Ngữ cảnh — 1,000,000 token trên cả hai
• Đầu ra tối đa — 131,072 token trên cả hai
• Suy luận — bắt buộc trên cả hai, thấp / cao / tối đa, mặc định tối đa trên cả hai
• Phương thức — văn bản vào, văn bản ra, trên cả hai
• Trọng số — của GLM-5.3 có thể tải xuống theo một giấy phép riêng; Prime hoàn toàn không có trọng số
• Tính khả dụng — GLM-5.3 trên API riêng của Z.ai và mọi nền tảng cung cấp nó; Prime trên một nền tảng, đằng sau một nhà cung cấp thượng nguồn được nêu tên
Hãy lưu ý các hàng giống hệt nhau tác động thế nào đến bài so sánh thông thường. Ở đây không có lập luận về độ sâu suy luận, không có lập luận về ngữ cảnh dài, không có lập luận về gọi công cụ, không có lập luận về giấy phép phục vụ nào tách biệt hai sản phẩm này, bởi vì một làn phục vụ không làm thay đổi hành vi của mô hình. Nếu bạn đã đọc một bài đối đầu trực tiếp của cặp sản phẩm này mà thấy Prime "có năng lực hơn" ở một tác vụ nào đó, thì phát hiện đó là nhiễu — cùng một bộ trọng số không tạo ra một phân phối khác, và cách duy nhất chúng khác nhau là tốc độ các token đến và số lượng token mà mức suy luận mặc định khiến mô hình phát ra.
Điểm hòa vốn, được thực hiện đúng cách
Định giá hai làn theo đơn vị công việc và toàn bộ vấn đề thu gọn thành một tỷ lệ. Nếu Prime mang lại thông lượng gấp 2,0× với mức giá gấp 2,0×, bạn đang mua cùng một sản lượng với cùng chi phí và chỉ đơn thuần đánh đổi tiền để lấy thời gian thực — một giao dịch mua độ trễ thuần túy, không tăng giá cũng không giảm giá. Nếu Prime mang lại thông lượng gấp 1,5× với mức giá gấp 2,0×, bạn đang trả khoảng 1,33× cho mỗi token mỗi giây, tức mức tăng giá một phần ba để có đặc quyền chờ ít hơn. Đó là hai đầu của chính dải mà nhà cung cấp tuyên bố, và cả hai đầu đều là kịch bản tốt nhất, vì chúng giả định mức 1,5–2× đúng với khối lượng công việc của bạn thay vì với các điều kiện đo chuẩn của nhà cung cấp.
Trên thực tế, mức phụ trội còn tệ hơn thế vì một lý do: thông lượng được đo trên một yêu cầu ấm, ngắn và không bị tranh chấp, và đây là chỉ số nhạy cảm nhất với mọi thứ khác. Một phiên agent dùng ngữ cảnh dài sẽ đọc lại bản ghi ngày càng dài ở mỗi lượt, khiến tải dồn vào prefill và đọc cache thay vì giải mã ở trạng thái ổn định — và Prime cũng tính gấp đôi cho việc đọc cache. Đo lường độc lập đối với mô hình cơ sở cho thấy GLM-5.3 đạt khoảng 61 token đầu ra mỗi giây, so với mức trung bình cùng phân khúc là 67, nhưng con số đó là trung vị trên một bộ đánh giá chuẩn hóa, không phải phần đuôi mà bạn sẽ gặp khi chịu tải. Tóm tắt trung thực là chi phí trên mỗi đơn vị thông lượng của Prime nằm đâu đó trong khoảng từ 1,0× đến 1,33× làn cơ sở, và để đạt mức 1,0× thì trường hợp tốt nhất của nhà cung cấp phải đúng chính xác như vậy.
Cùng trọng số có ý nghĩa nhiều hơn ta tưởng.

Lợi ích thực tiễn của một bộ trọng số dùng chung là mọi thứ bạn đã xây dựng dựa trên GLM-5.3 đều tồn tại qua việc chuyển đổi theo cả hai hướng. Hình dạng prompt được giữ nguyên, schema công cụ được giữ nguyên, khóa cache được giữ nguyên, và bài đánh giá bạn đã chạy để biện minh cho mô hình chủ lực ngay từ đầu vẫn hợp lệ trên cả hai ID. Không cần tinh chỉnh lại, không cần thiết lập lại đường cơ sở, không bất ngờ trong các chế độ lỗi, vì các chế độ lỗi thuộc về mô hình chứ không thuộc về làn phục vụ nó.
Điều đó đúng theo cả hai chiều, và chiều thứ hai mới là chiều bạn cần ghi nhớ. Nếu mức mặc định cho reasoning của GLM-5.3 là max khiến nó dài dòng trên tác vụ của bạn, thì Prime cũng thừa hưởng luôn tính dài dòng đó cùng với mọi thứ khác. Một làn chạy nhanh hơn nhưng sinh ra nhiều token hơn mức bạn cần thì không hề nhanh hơn xét từ đầu đến cuối. Trước khi trả gấp 2 lần để tăng tốc, hãy hạ mức effort xuống high hoặc low rồi đo lường — thiết lập effort thường tác động đến độ trễ đầu-cuối nhiều hơn là làn phục vụ, mà lại chẳng tốn kém gì.
Sự bất đối xứng duy nhất mà bảng giá không cho thấy
Trọng số của GLM-5.3 đã mở. Bất kỳ ai có phần cứng đều có thể tải chúng về và phục vụ mô hình với chi phí gốc, không có hóa đơn theo token và không phải chọn giữa các kênh phục vụ. Mức lượng tử hóa thực tế nhỏ nhất rơi vào khoảng 217 GB bộ nhớ tăng tốc, con số này là một triển khai đa nút đối với hầu hết các nhóm và chỉ là sai số làm tròn đối với một số ít, và giấy phép có một ngưỡng doanh thu mà trên mức đó, các đơn vị vận hành model-as-a-service quy mô lớn phải trải qua một cuộc đánh giá bảo mật trước khi phục vụ nó cho mục đích thương mại.
Prime không có trọng số. Nó là một làn được host trên triển khai của người khác, và danh sách của nó nêu tên đúng một nhà cung cấp thượng nguồn đứng sau endpoint. Đó là sự bất đối xứng đáng được gọi tên: với mô hình cơ sở, bạn đang chọn giữa mức giá theo token và chi phí khấu hao của chính bạn, còn với Prime, bạn đang chọn giữa mức giá theo token và không gì khác. Một nhóm đã chạy GLM-5.3 trên phần cứng của riêng họ có lựa chọn thứ ba trong so sánh này mà bảng giá không bao giờ thể hiện, và nó thường là lựa chọn rẻ nhất trong ba.
Nơi đồng hồ bấm giây thực sự chiếm ưu thế
Có những khối lượng công việc mà mức phụ trội 1,33× cho mỗi token rõ ràng là đúng đắn, và chúng có chung một đặc điểm: một thứ gì đó khác ngoài ngân sách token của bạn mới là điểm nghẽn. Một người đang chờ phản hồi trong một giao diện trò chuyện. Một bước đồng bộ trong một pipeline mà giai đoạn tiếp theo không thể bắt đầu cho đến khi mô hình trả về. Một vòng lặp agent thực hiện mười lời gọi tuần tự, nơi độ trễ của mỗi lời gọi được nhân lên theo độ dài chuỗi và tổng thời gian thực tế mới là thứ người dùng của bạn thực sự trải nghiệm. Trong những trường hợp đó, bạn không mua token, bạn đang mua lại khoảng thời gian mà số token đó lẽ ra sẽ chiếm mất, và mức 2× trên hóa đơn không phải là con số quyết định liệu tính năng có hoạt động hay không.
Ngoài hình thái đó, bài toán chi phí nhanh chóng trở nên bất lợi cho Prime. Việc sinh hàng loạt qua đêm không quan tâm mỗi yêu cầu riêng lẻ trả về nhanh đến mức nào. Phân loại khối lượng lớn cũng vậy, và ở quy mô lớn, mức phụ trội gấp 2× cho các lượt đọc cache sẽ cộng dồn thành một khoản mục chi phí thực sự. Và bất kỳ khối lượng công việc nào mà độ dài suy luận của chính mô hình là thành phần chi phối — một bài toán khó, một chuỗi lập kế hoạch dài — đều đang trả tiền cho việc tăng tốc ở phần yêu cầu vốn chưa bao giờ là phần chậm.
Cả hai làn, một chìa khóa, không cần tích hợp thứ hai

Cách mà hầu hết các đội ngũ giải quyết vấn đề này không phải là chọn một làn đường duy nhất mà là định tuyến qua lại giữa chúng, và điều đó chỉ hợp lý nếu cả hai ID đều có thể truy cập theo cùng một cách. OrcaRouter cung cấp GLM-5.3 theo mức giá niêm yết của nhà cung cấp là $1.40 và $4.40 cho mỗi triệu token, không có phụ phí nào từ phía chúng tôi — giá niêm yết của nhà cung cấp được chuyển thẳng thay vì định giá lại, nên khi nhà cung cấp thay đổi mức giá thì phía chúng tôi cập nhật ngay trong cùng ngày họ công bố. GLM-5.3-Flash cũng có mặt tại đây, với mức $0.07 và $0.25, điều này quan trọng vì một tuyến định tuyến nâng cấp từ mô hình rẻ lên mô hình chủ lực chính là dạng mà hầu hết lưu lượng vận hành thực sự mong muốn.
Cả hai ID đều nằm sau một API key cùng với hơn 200 mô hình khác, điều này biến việc quyết định làn thành việc thay đổi tên mô hình trong cùng một đường gọi thay vì phải có hợp đồng thứ hai và tích hợp thứ hai. DSL định tuyến là nơi điều đó trở nên hữu ích cho cặp cụ thể này: gửi các cuộc gọi nhạy cảm với độ trễ đến làn tăng tốc và mọi thứ khác đến làn tiêu chuẩn, hoặc chuyển cấp khi kiểm tra thất bại thay vì dựa vào phỏng đoán. Chuyển đổi dự phòng tự động xử lý trường hợp một nhà cung cấp thượng nguồn duy nhất bị suy giảm, đây là rủi ro cụ thể mà một tầng nhanh chỉ có một nhà cung cấp phải gánh chịu.
Một điều chúng tôi sẽ không ngụ ý: OrcaRouter không lưu trữ GLM 5.3 Prime, và trang mô hình của nó trả về 404 tại đây. Nếu làn tăng tốc là thứ bạn muốn, bạn sẽ mua nó từ nền tảng bán nó. Điều chúng tôi có thể làm là cung cấp cho bạn làn cơ bản, mô hình Flash, và một nơi để định tuyến giữa chúng.
Cách quyết định trong ba mươi giây
Hãy tự hỏi liệu có thứ gì đang chờ phản hồi hay không. Nếu một người hoặc một dịch vụ hạ nguồn đang bị chặn, và khối lượng công việc bị ràng buộc bởi độ trễ thay vì bởi thông lượng, và bạn đã xác nhận rằng nỗ lực suy luận không phải là yếu tố thực sự chi phối độ trễ của bạn, thì phí premium của Prime chính là cái giá của tính năng đó và bạn nên trả nó. Nếu không có gì đang chờ — các tác vụ theo lô, đánh giá ngoại tuyến, trích xuất hàng loạt, bất cứ thứ gì mà hàng đợi hấp thụ độ trễ — thì bạn đang trả mức phí cao hơn một phần ba trên mỗi đơn vị thông lượng cho một con số mà không ai sẽ bao giờ để ý, và base lane mới là câu trả lời đúng.
Điểm rộng hơn nằm ở cách dòng sản phẩm này đã được bán. GLM-5.3 được phát hành một lần, vào tháng 8, và tháng 9 đã tạo ra ít nhất bốn mức giá riêng biệt cho nó, tùy thuộc vào làn nào, nền tảng nào và mô hình anh em nào mà bạn rơi vào. Prime là mức đắt nhất trong số đó và cũng ít được tài liệu hóa nhất, bởi vì công ty có tên trên các trọng số không liệt kê nó. Đó không phải là lập luận chống lại việc mua nó. Đó là lập luận cho việc phải biết, trước khi bạn định tuyến lưu lượng production qua nó, rằng thứ duy nhất bạn đang mua hơn mô hình cơ sở là một chiếc đồng hồ bấm giây — và rằng chiếc đồng hồ bấm giây đó tính phí theo token.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
