GLM 5.2 API: Giá cả, Truy cập và Cách sử dụng

GLM 5.2 API: Giá cả, Truy cập và Cách sử dụng

Tác giả

Fengya Tian

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

GLM-5.2 đã có sẵn rộng rãi từ ngày 16 tháng 6 năm 2026, và API của nó nhanh chóng trở thành một trong những chủ đề phát triển được tìm kiếm nhiều nhất trong mùa hè — vì một lý do đơn giản: nó mang lại hiệu suất lập trình và tác nhân gần ngưỡng tiên tiến với giá 1,40 đô la mỗi triệu token đầu vào và 4,40 đô la mỗi triệu token đầu ra, với cửa sổ ngữ cảnh 1 triệu token. Không có danh sách chờ, không có cổng xem trước: bạn có thể lấy key và triển khai ngay hôm nay.

Hướng dẫn này bao gồm tất cả những gì ô tìm kiếm thực sự muốn biết: GLM 5.2 APIcó giá bao nhiêu, bốn cách để truy cập (bao gồm một cách miễn phí), cách thức hoạt động của các chế độ suy luận và mức độ nỗ lực, cách quyết định giữa API và Gói lập trình, và cách chạy GLM-5.2 cùng lúc với các mô hình khác của bạn thông qua một điểm cuối duy nhất.

Câu trả lời nhanh

API GLM 5.2 hiện đã có sẵn chưa?Có — có sẵn từ ngày 16 tháng 6 năm 2026, model ID `glm-5.2`.

Giá là bao nhiêu? $1.40 / $4.40 mỗi triệu token (đầu vào/đầu ra), với đầu vào được lưu trong bộ nhớ đệm là $0.26 và lưu trữ bộ nhớ đệm miễn phí trong thời gian có hạn.

Cửa sổ ngữ cảnh? 1M token đầu vào, lên đến 128K token đầu ra.

Có tùy chọn miễn phí không? Các trọng số được cấp phép MIT để tự lưu trữ, và các tầng miễn phí của gateway cho phép bạn dùng thử mà không cần thẻ. Chi tiết bên dưới.

Nó có đa phương thức không? Không — text in, text out. Vision nằm trong dòng GLM-V riêng của Z.ai.

Tại sao các nhà phát triển muốn API này

Phiên bản ngắn gọn của câu chuyện về điểm chuẩn: trên bảng công bố của Z.ai, GLM-5.2 là mô hình mã nguồn mở mạnh nhất hiện có về khả năng lập trình — 81.0 trên Terminal-Bench 2.1 (so với 63.5 của GLM-5.1), 62.1 trên SWE-bench Pro, và chỉ kém Claude Opus 4.8 một điểm trên chuẩn FrontierSWE dài hạn — với chi phí chỉ bằng một phần nhỏ so với các mô hình tiên tiến. Sự kết hợp đó, cùng với ngữ cảnh 1M được huấn luyện đặc biệt cho khối lượng công việc của tác nhân lập trình, là lý do tại sao API này đáng để tích hợp chứ không chỉ là thú vị.

Những gì bạn nhận được với GLM 5.2 API

Bề mặt API hiện đại và không gây bất ngờ — theo nghĩa tích cực. Bạn gọi model `glm-5.2` và nhận được: cửa sổ ngữ cảnh 1M token với tối đa 128K token đầu ra; chế độ suy nghĩ bạn có thể bật hoặc tắt cho mỗi yêu cầu; các mức nỗ lực suy luận có thể cấu hình lên đến `max` cho các vấn đề khó nhất; truyền phát thời gian thực; gọi hàm để sử dụng công cụ và tác tử; đầu ra JSON có cấu trúc; và cơ chế lưu đệm ngữ cảnh thông minh chiết khấu cho đầu vào lặp lại. Tích hợp công cụ kiểu MCP được hỗ trợ cho các framework tác tử.

Một ranh giới cần biết trước khi bạn thiết kế xung quanh nó: GLM-5.2 chỉ hỗ trợ văn bản. Ảnh chụp màn hình, PDF dạng pixel và đọc biểu đồ thuộc về mô hình đa phương thức — hoặc dòng GLM-V của Z.ai hoặc mô hình của nhà cung cấp khác trên một làn đường riêng.

Giá API GLM 5.2

Giá chính thức từ bên thứ nhất là $1.40 cho mỗi triệu token đầu vào và $4.40 cho mỗi triệu token đầu ra — giống hệt GLM-5.1, nghĩa là bước nhảy vọt về khả năng vào tháng Sáu không đi kèm tăng giá. Token đầu vào đã lưu cache được tính phí ở mức $0.26 cho mỗi triệu, và Z.ai đang miễn phí lưu trữ cache trong thời gian có hạn. Không có phụ phí ngữ cảnh dài: toàn bộ cửa sổ 1M được tính phí theo mức giá tiêu chuẩn.

Trong bối cảnh đó, con số này thấp hơn nhiều so với các mô hình đóng mà nó được so sánh — Claude Sonnet 5 có giá $3 / $15 và Claude Opus 4.8 $5 / $25 — và điều này khiến kỷ luật bộ nhớ đệm trở thành đòn bẩy lớn nhất trên hóa đơn của bạn: các vòng lặp agent đọc lại ngữ cảnh dự án ổn định chỉ trả $0.26 thay vì $1.40 cho mỗi lần truy cập. Hai điểm lưu ý về ngân sách: mức độ nỗ lực cao hơn tiêu tốn nhiều token suy luận hơn, và các máy chủ bên thứ ba công bố mức giá riêng của họ (một số thấp hơn bên thứ nhất), vì vậy hãy kiểm tra số liệu hiện tại tại nơi bạn thực sự triển khai.

Cách lấy GLM 5.2 API key

Tuyến 1 — nền tảng Z.ai. Tạo tài khoản trên nền tảng dành cho nhà phát triển của Z.ai, tạo một khóa, và gọi `glm-5.2` pay-per-token với mức giá chính thức ở trên. Đây là tuyến trực tiếp, từ bên thứ nhất.

Lộ trình 2 — GLM Coding Plan. Một gói đăng ký kết nối GLM-5.2 với các công cụ lập trình (GLM-5.2 đã xuất hiện ở đó trước khi ra mắt API công khai). Nếu việc sử dụng của bạn là một nhà phát triển dùng trợ lý IDE liên tục cả ngày, một gói cước phẳng có thể vượt qua thanh toán theo token; hãy kiểm tra giá gói hiện tại trên Z.ai.

Route 3 — một cổng AI. Gọi GLM-5.2 thông qua một cổng đa mô hình như OrcaRouter: một điểm cuối tương thích OpenAI, ID mô hình `z-ai/glm-5.2`, với cùng mức giá $1.40 / $4.40 và markup token bằng 0 — cùng với Claude, GPT, Gemini, DeepSeek và hơn 200 mô hình khác. Một khóa, không cần xoay sở tài khoản theo từng nhà cung cấp, và bao gồm chuyển đổi dự phòng.

Route 4 — tự lưu trữ. Các trọng số có trên Hugging Face theo giấy phép MIT không có giới hạn khu vực. Hãy dự tính trung thực: đây là một MoE có khoảng 750B tham số, vì vậy hãy lên kế hoạch cho bộ nhớ GPU ở quy mô cụm — một lộ trình dành cho các nhóm nền tảng, không phải máy tính xách tay.

Gọi API: cần thiết lập gì và tại sao

Việc tích hợp được thiết kế một cách nhàm chán có chủ đích — các hoàn chỉnh trò chuyện kiểu OpenAI với chuỗi mô hình `glm-5.2` (hoặc `z-ai/glm-5.2` thông qua OrcaRouter, cũng cung cấp endpoint `/v1/responses`). Các tham số thực sự thay đổi kết quả:

Bật hoặc tắt chế độ suy nghĩ. Hãy bật chế độ này để viết mã, tác nhân và phân tích; tắt nó để thực hiện các tác vụ nhanh, rẻ như phân loại và các lượt trò chuyện ngắn.

Mức độ nỗ lực.Bộ điều chỉnh giữa chất lượng, độ trễ và chi phí. Hãy dành các cài đặt cao nhất (`max`) cho những vấn đề thực sự khó; thống kê từ cổng công cộng cho thấy thời gian trung bình đến token đầu tiên nằm trong khoảng vài giây khi mô hình suy nghĩ, vì vậy UX nhạy cảm với độ trễ đòi hỏi mức nỗ lực thấp hơn.

Cấu trúc prompt thân thiện với bộ nhớ đệm.Đặt nội dung ổn định (system prompt, project context, few-shot examples) lên đầu và giống nhau qua các lần gọi, để mức giá lưu trữ $0.26 đảm nhận phần việc nặng nhọc.

Gọi hàm + đầu ra có cấu trúc.Cả hai đều là hạng nhất; các tác nhân được xây dựng trên lược đồ công cụ kiểu OpenAI có thể chuyển đổi với những thay đổi tối thiểu.

API hay Kế hoạch Lập trình?

Một quyết định khiến nhiều đội nhóm bối rối, vì vậy đây là sự phân chia rõ ràng. The API là hạ tầng tính theo mức sử dụng: phù hợp cho sản phẩm, pipeline, và bất cứ thứ gì có tính lập trình, nơi chi phí tăng theo mức sử dụng và caching thưởng cho kỹ thuật tốt. The Coding Plan là một chỗ ngồi giá phẳng cho con người: phù hợp cho các nhà phát triển cá nhân sống trong các công cụ lập trình AI, nơi một tháng nặng sẽ tốn nhiều token hơn. Nhiều đội nhóm chạy cả hai một cách hợp lý — các gói cho con người, API cho sản phẩm.

Có cách nào miễn phí để sử dụng GLM 5.2 không?

Ba câu trả lời trung thực. Tự lưu trữ không cần giấy phép (MIT) nhưng tốn kém phần cứng — miễn phí như tự do ngôn luận, không phải như bữa trưa miễn phí. Các tầng miễn phí của Gateway: Gói Hacker miễn phí của OrcaRouter cho phép bạn gọi các mô hình — bao gồm GLM-5.2 — mà không cần thẻ tín dụng, đây là cách nhanh nhất với chi phí bằng không để đánh giá nó với các prompt thực tế. Tín dụng dùng thử trên nền tảng riêng của Z.ai thay đổi theo thời gian và khu vực, vì vậy hãy kiểm tra ưu đãi đăng ký hiện tại thay vì tin vào các bài blog cũ một tháng.

Sử dụng API GLM 5.2 thông qua OrcaRouter

Nếu GLM-5.2 sẽ chia sẻ quy trình sản xuất với các mô hình khác — và với ranh giới chỉ xử lý văn bản cùng hồ sơ độ trễ suy luận, thông thường nên làm như vậy — một lớp định tuyến sẽ giúp bạn tiết kiệm công sức kết nối nhiều nhà cung cấp. OrcaRouter đã phục vụ GLM-5.2 với giá của bên thứ nhất, không tính phí chênh lệch, thông qua cùng endpoint tương thích OpenAI với hơn 200 mô hình khác: định tuyến lưu lượng mã hóa và tác nhân khối lượng lớn đến GLM-5.2, gửi các tác vụ thị giác đến mô hình đa phương thức, chuyển các suy luận khó nhất đến mô hình hàng đầu, và để tính năng chuyển đổi dự phòng tự động xử lý các sự cố nhà cung cấp. Khả năng quan sát theo từng mô hình cho thấy chi phí của mỗi làn đường cho mỗi tác vụ hoàn thành — đó là cách "rẻ theo token" được xác nhận là "rẻ theo kết quả."

Điểm mấu chốt

API GLM 5.2 là một trong những lần ra mắt hiếm hoi mà sự cường điệu vẫn sống sót khi tiếp xúc với trang giá: mã hóa gần như tiên tiến nhất với giá $1.40 / $4.40, một ngữ cảnh thực sự 1M, và bốn đường truy cập bao gồm một đường hoàn toàn miễn phí. Hãy lấy một key, cấu trúc prompt của bạn cho cache, và để một router quyết định khi nào GLM-5.2 là làn đường phù hợp.

Sẵn sàng gọi GLM 5.2 chỉ trong vài phút? Tạo một tài khoản OrcaRouter miễn phí, lấy một khóa API, và truy cập GLM-5.2 với giá không chênh lệch — cùng với Claude, GPT, Gemini và hơn 200 mô hình khác — thông qua một điểm cuối tương thích với OpenAI.

Câu hỏi thường gặp

API GLM 5.2 có hoạt động với Claude Code và các công cụ lập trình hiện có không?

Đáng chú ý — bảng benchmark của Z.ai báo cáo điểm Terminal-Bench tốt nhất của GLM-5.2 (82,7) sử dụng Claude Code làm harness, và GLM Coding Plan được định vị như một giải pháp thay thế trực tiếp cho các quy trình làm việc kiểu Claude Code. Hầu hết các framework tác nhân tương thích với OpenAI đều kết nối bằng cách thay đổi base-URL và tên model.

Dữ liệu của tôi sẽ đi đâu nếu tôi sử dụng API GLM 5.2?

API chính thức được vận hành bởi Z.ai; các đội nhóm có yêu cầu nghiêm ngặt về cư trú dữ liệu hoặc tuân thủ quy định nên xem xét các điều khoản của nó, chọn một máy chủ bên thứ ba tại khu vực ưa thích của họ, hoặc sử dụng các trọng số được cấp phép MIT để chạy GLM-5.2 hoàn toàn trong cơ sở hạ tầng của riêng họ — một lựa chọn mà các mô hình đóng không thể cung cấp.

GLM 5.2 API không hỗ trợ xử lý hình ảnh hoặc tập tin; nó chỉ dành riêng cho đầu vào văn bản.

Không — đó là đầu vào văn bản, đầu ra văn bản. Z.ai cung cấp các mô hình thị giác riêng biệt (dòng GLM-V) để hiểu hình ảnh, vì vậy các sản phẩm đa phương thức thường định tuyến các yêu cầu hình ảnh đến một mô hình thị giác và giữ GLM-5.2 trên làn văn bản.

Sự khác biệt giữa glm-5.2 và z-ai/glm-5.2 là gì?

Cùng một mô hình, nhưng cửa khác nhau: `glm-5.2` là ID mô hình trên API của bên thứ nhất của Z.ai, trong khi `z-ai/glm-5.2` là ID có không gian tên được sử dụng bởi các cổng như OrcaRouter. Giá cả đều giống nhau $1.40 / $4.40 trên OrcaRouter, nơi không tính phí đánh dấu token.


© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube