GLM-5.3 là mô hình chủ lực mới nhất của Z.ai (Zhipu AI) dành cho các tác vụ kỹ thuật phần mềm phức tạp và các tác vụ đại lý dài hạn. Nó mang lại mức cải thiện khoảng 50% trải nghiệm lập trình so với GLM-5.2, đạt ngang bằng Mythos 5 về các khả năng an ninh mạng được chọn lọc, đồng thời tạo ra sự cân bằng tốt hơn giữa hiệu suất thô và hiệu quả token. Đây là mô hình văn bản vào / văn bản ra được xây dựng cho mã nguồn quy mô kho lưu trữ, kỹ thuật đa bước tự động và các luồng công việc đại lý phải duy trì tính mạch lạc trong thời gian dài. GLM-5.3 sử dụng cùng giao diện API như dòng GLM-5 với hai thay đổi mà người gọi phải xử lý: chế độ suy luận luôn bật (thinking.type chỉ chấp nhận enabled; truyền disabled giờ sẽ khiến yêu cầu thất bại), và độ sâu suy luận được kiểm soát bởi reasoning_effort với các giá trị low / high / max, mặc định là max. Mô hình hỗ trợ gọi công cụ gốc và đầu ra JSON có cấu trúc, đồng thời sử dụng định dạng chat-completions tương thích OpenAI.
GLM 5.3 là mô hình ngôn ngữ lớn được liệt kê dưới nhà cung cấp z-ai và được phục vụ thông qua OrcaRouter. Mục danh mục mô tả mô hình này chỉ hỗ trợ văn bản, với ngữ cảnh đầu vào lên tới 1.000.000…
Với ngữ cảnh 1.000.000 token, GLM 5.3 có thể xử lý các tài liệu mà thông thường cần phải được chia thành nhiều phần nhỏ. Bạn có thể đưa toàn bộ một cuốn tiểu thuyết, một cuốn sổ tay kỹ thuật dài, hoặc hàng trăm trang lịch sử hội thoại vào prompt. Lợi ích thực tế chính là mô hình có thể xem xét toàn bộ tài liệu cùng một lúc khi trả lời. Điều này giúp các tác vụ như tóm tắt, trích xuất dữ kiện và phân tích so sánh trở nên khả thi mà không cần logic truy xuất tùy chỉnh. Điều đó cũng có nghĩa là bạn có thể đặt câu hỏi về một khối văn bản lớn trong các lượt hội thoại tiếp theo, vì toàn bộ cuộc trò chuyện vẫn nằm trong cửa sổ ngữ cảnh. Tuy nhiên, việc sử dụng prompt 1M token không hề miễn phí; token đầu vào được tính phí 1,40 USD mỗi triệu token, vì vậy một prompt đầy đủ sẽ tốn khoảng 1,40 USD và con số này chưa bao gồm phần đầu ra. Không có tính năng truy xuất chuyên dụng nào được mô tả trong danh mục, vì vậy mô hình chỉ đơn giản sử dụng những gì có trong ngữ cảnh.
Độ dài đầu ra tối đa cho GLM 5.3 là 128,000 token. Con số này cao hơn nhiều so với giới hạn mặc định điển hình từ 4,000 đến 8,000 trên nhiều mô hình khác. Nó cho phép mô hình tạo ra các báo cáo dài, tệp mã, bản dịch máy hoặc bản nháp nhiều chương chỉ trong một lần gọi. Với giá đầu ra là $4.40 cho mỗi triệu token, một câu trả lời có độ dài 128,000 token sẽ tiêu tốn khoảng $0.56 cho token đầu ra (128,000 / 1,000,000 * 4.40). Số token thực tế trên mỗi từ có thể khác nhau, nhưng điều này giúp hình dung được chi phí ở mức trần. OrcaRouter tính phí dựa trên token, do đó đầu ra ngắn hơn sẽ có chi phí thấp hơn tương ứng. Không có thông tin nào cho thấy giới hạn đầu ra có thể được đặt cao hơn; 128,000 là mức trần được liệt kê trong danh mục. Khi thiết kế một ứng dụng, bạn có thể cần xử lý một luồng đầu ra rất dài hoặc sử dụng streaming để trình bày kết quả dần dần, vì mô hình có thể tạo ra rất nhiều văn bản.
Danh mục liệt kê phương thức đầu vào cho Z.ai GLM 5.3 là văn bản. Điều này có nghĩa là mô hình chấp nhận các tin nhắn văn bản thuần túy, bao gồm lịch sử hội thoại, lời nhắc hệ thống và nội dung người dùng. Mô hình không chấp nhận hình ảnh, âm thanh, video hoặc các nội dung nhị phân khác. Đây là một ràng buộc quan trọng khi chọn mô hình cho một tác vụ cụ thể. Nếu quy trình xử lý của bạn cần đọc ảnh chụp màn hình, phân tích bản ghi âm hoặc phân loại video, bạn sẽ cần một mô hình đa phương thức hoặc một bước chuyển đổi văn bản/thị giác riêng trước khi gọi GLM 5.3. Mặc dù cửa sổ ngữ cảnh lớn, nội dung vẫn là văn bản; bạn không thể đính kèm trực tiếp tệp PDF trừ khi trích xuất văn bản của nó trước. Mô hình có thể xử lý JSON văn bản dài, mã nguồn, nhật ký hoặc bài viết. Đối với khối lượng công việc chỉ dùng văn bản, ngữ cảnh lớn có thể hữu ích; đối với bất kỳ phương thức nào khác, hãy tìm một mô hình khác trên OrcaRouter.
Ngữ cảnh lớn và đầu ra dài của GLM 5.3 có mức giá trên mỗi token cao hơn một số mô hình nhỏ hơn. Nếu tác vụ của bạn chỉ cần vài nghìn token ngữ cảnh và câu trả lời ngắn, một mô hình rẻ hơn có thể cho kết quả tốt với chi phí thấp hơn. OrcaRouter cung cấp nhiều mô hình với các mức giá khác nhau, nhưng mục danh mục này không liệt kê các lựa chọn thay thế. Theo nguyên tắc chung, hãy sử dụng GLM 5.3 khi bạn cần ngữ cảnh lớn hoặc đầu ra rất dài trong một lần gọi duy nhất và khi những khả năng đó xứng đáng với chi phí. Nếu bạn có thể chia tác vụ thành các phần nhỏ hơn hoặc nếu ngữ cảnh ngắn hơn là đủ, một mô hình nhỏ hơn sẽ sử dụng ít token đầu vào hơn và có thể tiết kiệm chi phí hơn. Cũng cần cân nhắc độ trễ: xử lý một prompt có 1M token sẽ lâu hơn so với xử lý một prompt ngắn, bất kể mô hình nào. Lựa chọn phụ thuộc vào yêu cầu sản xuất của bạn.
Mục danh mục OrcaRouter cho Z.ai GLM 5.3 không bao gồm bất kỳ điểm benchmark nào. Điều đó có nghĩa là không có con số chính thức nào trong danh sách này để trích dẫn cho MMLU, HumanEval hoặc các đánh giá tiêu chuẩn khác. Bạn vẫn có thể tự đánh giá mô hình bằng cách chạy các prompt thử nghiệm của riêng mình và so sánh đầu ra trên lĩnh vực của bạn. Vì không có dữ liệu benchmark được cung cấp, mọi tuyên bố về chất lượng tương đối trên các tác vụ cụ thể nên được xem xét một cách thận trọng. Các con số cụ thể duy nhất được đưa ra là cửa sổ ngữ cảnh, đầu ra tối đa và giá cả. Đối với một dòng mô hình ngôn ngữ như GLM, các ấn phẩm bên ngoài có thể cung cấp thông tin chung, nhưng việc thiếu bảng benchmark ở đây có nghĩa là cách tiếp cận an toàn nhất là đo lường trên các tác vụ đại diện. API của OrcaRouter có thể được sử dụng để chạy đánh giá song song với các mô hình khác, nhưng mọi kết quả bạn thu thập được chỉ áp dụng cho trường hợp sử dụng của bạn, không phải cho bảng xếp hạng toàn cầu.
Không có số liệu về độ trễ nào được liệt kê trong danh mục cho GLM 5.3, vì vậy không có tốc độ chính xác nào để báo cáo. Nhìn chung, thời gian phản hồi phụ thuộc vào một số yếu tố: độ dài của prompt đầu vào, số token được yêu cầu trong đầu ra, tải hiện tại của nhà cung cấp thượng nguồn và điều kiện mạng. Một yêu cầu với prompt 1.000.000 token sẽ mất nhiều thời gian xử lý hơn đáng kể so với một prompt ngắn vì mô hình phải đọc toàn bộ văn bản đó trước khi tạo nội dung. Thời gian tạo đầu ra cũng tăng theo số lượng token đầu ra; một phản hồi 128.000 token có thể rất chậm. Đối với các ứng dụng tương tác, bạn có thể muốn sử dụng tính năng streaming để bắt đầu nhận văn bản ngay khi nó được tạo. API tương thích OpenAI của OrcaRouter hỗ trợ các tham số streaming tiêu chuẩn, nhưng thông lượng thực tế được xác định bởi nhà cung cấp z-ai. Bạn nên kiểm thử một yêu cầu đại diện để hiểu độ trễ cho khối lượng công việc của mình.
Những hạn chế chính của GLM 5.3 gắn liền với thông số kỹ thuật trong danh mục của nó. Mô hình này chỉ xử lý văn bản, do đó không thể xử lý trực tiếp hình ảnh, âm thanh hoặc video; nội dung ở các định dạng đó phải được chuyển đổi thành văn bản trước. Cửa sổ ngữ cảnh là 1.000.000 token, nhưng sử dụng hết dung lượng này đồng nghĩa với việc yêu cầu của bạn rất lớn, kéo theo chi phí và độ trễ cao hơn. Độ dài đầu ra tối đa là 128.000 token, nhưng việc tạo ra một đầu ra dài như vậy rất tốn thời gian và có thể gặp phải tình trạng hết thời gian chờ của nhà cung cấp nếu bạn không sử dụng chế độ phát trực tiếp (streaming). Danh mục không liệt kê bất kỳ điểm chuẩn hiệu năng nào, vì vậy bạn không nên cho rằng mô hình này vượt trội hơn các mô hình khác trong mọi tác vụ. Cuối cùng, giống như mọi mô hình ngôn ngữ, đầu ra có thể không chính xác hoặc bị ảo giác (hallucination); bạn nên xác minh thông tin quan trọng. Số lượng token chỉ mang tính tương đối, vì vậy một lời nhắc 1M token là giới hạn thực tế ở mức trần, chứ không phải đảm bảo rằng mô hình sẽ xử lý hoàn hảo mọi lời nhắc dài.
GLM 5.3 được tính phí theo token. Giá đầu vào được niêm yết là $1,40 cho mỗi 1.000.000 token và giá đầu ra là $4,40 cho mỗi 1.000.000 token. OrcaRouter không cộng thêm phí; số tiền bạn bị tính chính xác bằng giá của nhà cung cấp. Token đầu vào bao gồm prompt, mọi hệ thống hướng dẫn và lịch sử hội thoại bạn gửi. Token đầu ra là những token mà mô hình tạo ra. Hầu hết các API đều tính cả prompt lẫn văn bản được tạo ra, và mô hình này tuân theo cách tính phí theo token tiêu chuẩn. Không có gói đăng ký hàng tháng trong danh mục này và không có đề cập đến khoản phí cố định riêng biệt nào. Tổng chi phí của một yêu cầu được tính là (token đầu vào / 1.000.000) * 1,40 cộng với (token đầu ra / 1.000.000) * 4,40. Đối với một yêu cầu có 10.000 token đầu vào và 1.000 token đầu ra, chi phí sẽ là $0,014 cộng với $0,0044, tổng cộng khoảng $0,0184.
Do giá cho token đầu vào và đầu ra của GLM 5.3 khác nhau, nên phân bổ chi phí phụ thuộc vào cách bạn sử dụng mô hình. Token đầu vào có giá $1,40 cho mỗi triệu token, còn token đầu ra có giá $4,40 cho mỗi triệu token, khiến chi phí cho đầu ra cao hơn gấp hơn ba lần so với đầu vào cho mỗi token. Đây là cấu trúc giá phổ biến của nhiều mô hình ngôn ngữ. Một tác vụ đọc một tài liệu dài và trả về một bản tóm tắt ngắn sẽ bị chi phối bởi chi phí đầu vào. Một tác vụ bắt đầu bằng một prompt ngắn và tạo ra một phản hồi rất dài sẽ bị chi phối bởi chi phí đầu ra. Với đầu ra tối đa là 128.000 token, một lần sinh văn bản dài nhất có thể tiêu tốn khoảng $0,56 cho token đầu ra. Trong một cuộc hội thoại tích lũy nhiều lượt tương tác, cả hai phía đều tăng lên; phần đầu vào lịch sử sẽ được gửi lại mỗi lần trừ khi bạn sử dụng cửa sổ ngữ cảnh ngắn hơn hoặc cắt bớt lịch sử. Bạn có thể giảm chi phí bằng cách giữ cho prompt ngắn gọn và hạn chế độ dài đầu ra khi có thể.
Mục danh mục cho GLM 5.3 không đề cập đến bộ nhớ đệm lời nhắc, chiết khấu, hay các tầng giá đặc biệt. Mức giá được liệt kê rất rõ ràng: $1,40 cho mỗi triệu token đầu vào và $4,40 cho mỗi triệu token đầu ra. Nếu OrcaRouter hoặc nhà cung cấp thượng nguồn giới thiệu tính năng lưu cache trong tương lai, chi phí thực tế cho các lời nhắc lặp lại có thể thay đổi, nhưng không có cơ chế nào như vậy được mô tả ở đây. Tương tự, không có đề cập đến xử lý hàng loạt hay chiết khấu theo khối lượng. Để kiểm soát chi phí, bạn có thể quản lý số lượng token bạn gửi. Ví dụ, thay vì gửi lại toàn bộ cuộc hội thoại, hãy chỉ giữ lại các lượt hội thoại gần đây có liên quan. Bạn cũng có thể đặt giá trị max_tokens thấp hơn để giới hạn độ dài đầu ra. Vì OrcaRouter tính phí theo mức giá của nhà cung cấp mà không cộng thêm phí, chi phí bạn thấy trong danh sách mô hình chính là mức giá cơ sở. Luôn kiểm tra tài liệu hiện tại để cập nhật về giá hoặc các tính năng mới.
Để gọi Z.ai GLM 5.3, hãy trỏ HTTP client của bạn tới API tương thích OpenAI của OrcaRouter. URL gốc là https://api.orcarouter.ai/v1. Sử dụng model ID z-ai/glm-5.3 trong phần thân yêu cầu. Nếu bạn đang sử dụng SDK OpenAI chính thức, hãy đặt base_url tới endpoint của OrcaRouter và sử dụng khóa API OrcaRouter của bạn. Định dạng yêu cầu là dạng chat completions tiêu chuẩn: một đối tượng JSON có trường model và mảng messages. Mỗi tin nhắn chứa một role và nội dung content. Mô hình sẽ tạo ra phản hồi dạng văn bản. OrcaRouter chuyển tiếp yêu cầu tới nhà cung cấp z-ai. Vì API tương thích với OpenAI, các thư viện và công cụ hỗ trợ endpoint OpenAI có thể được trỏ tới OrcaRouter mà không cần tích hợp tùy chỉnh. Để xác thực, hãy bao gồm header Authorization với khóa OrcaRouter của bạn. Endpoint chấp nhận các lời gọi chat-completion thông thường; không có tài nguyên RESTful riêng cho mô hình này.
API tương thích OpenAI của OrcaRouter dành cho GLM 5.3 chấp nhận các tham số yêu cầu giống như các tham số phổ biến trong định dạng chat completions của OpenAI. Bạn có thể đặt model thành z-ai/glm-5.3, cung cấp messages và kiểm soát quá trình sinh bằng các tham số như max_tokens, temperature, top_p và stream. Danh sách chính xác các tham số được hỗ trợ có thể khác nhau tùy theo nhà cung cấp. Danh mục không liệt kê một lược đồ tham số đầy đủ, vì vậy bạn nên tham khảo tài liệu API của OrcaRouter để biết các trường hiện được hỗ trợ. Vì đầu ra tối đa của mô hình là 128.000 token, bạn có thể đặt max_tokens vượt xa giá trị mặc định của nhiều client; nếu client của bạn giới hạn giá trị này, bạn có thể cần điều chỉnh. Cửa sổ ngữ cảnh 1.000.000 token có nghĩa là tổng số token trong messages của bạn có thể rất lớn; gửi một lượng văn bản lớn như vậy dưới dạng JSON là bình thường, nhưng hãy lưu ý đến kích thước yêu cầu và độ trễ. Streaming thường có sẵn cho các API tương thích OpenAI, nhưng định dạng phản hồi chính xác của OrcaRouter tuân theo chuẩn.
Việc di chuyển ứng dụng từ OpenAI sang GLM 5.3 thông qua OrcaRouter thường chỉ cần hai thay đổi. Đầu tiên, đổi base_url thành https://api.orcarouter.ai/v1. Thứ hai, đổi tên model thành z-ai/glm-5.3. Mảng messages, các vai trò (roles) và cấu trúc phản hồi JSON vẫn giữ nguyên như định dạng chat completions của OpenAI. Nếu bạn hiện đang sử dụng OpenAI SDK, hãy cập nhật các biến môi trường hoặc cấu hình client để trỏ tới OrcaRouter. Sử dụng khóa API của OrcaRouter thay cho khóa trước đó. Không cần thay đổi mã nguồn cho phần thân yêu cầu, mặc dù bạn có thể muốn xem lại các tham số. Vì GLM 5.3 chỉ hỗ trợ văn bản, hãy loại bỏ mọi tệp đính kèm image_url hoặc đa phương thức khỏi prompt của bạn. Ngoài ra, cửa sổ ngữ cảnh của model lớn hơn nhiều so với nhiều model của OpenAI, vì vậy bạn có thể tăng lượng lịch sử hội thoại gửi đi. Hãy thử nghiệm với một yêu cầu nhỏ trước để xác nhận rằng định dạng phản hồi khớp với những gì mã của bạn mong đợi.
Dưới đây là một yêu cầu hoàn tất hội thoại tối thiểu cho GLM 5.3 thông qua OrcaRouter. Gửi một yêu cầu POST đến https://api.orcarouter.ai/v1/chat/completions với tiêu đề Authorization chứa khóa API OrcaRouter của bạn. Phần thân phải bao gồm các trường: model được đặt thành z-ai/glm-5.3 và messages có ít nhất một tin nhắn, ví dụ {"role":"user","content":"What is the capital of France?"}. Phản hồi sẽ chứa câu trả lời của mô hình ở định dạng hoàn tất hội thoại chuẩn của OpenAI. Bạn có thể thêm các tham số tùy chọn như temperature và max_tokens. Nếu bỏ qua max_tokens, nhà cung cấp sẽ dùng giá trị mặc định; để tận dụng giới hạn đầu ra 128.000 token, hãy đặt max_tokens thành giá trị mong muốn. Đối với phát trực tuyến, đặt stream thành true và đọc các dòng dữ liệu khi chúng đến. Định dạng JSON chính xác tuân theo quy ước của OpenAI, vì vậy các hàm trợ giúp hiện có để phân tích choices và message content sẽ hoạt động.
Sự khác biệt chính giữa GLM 5.3 và các mô hình có cửa sổ ngữ cảnh nhỏ hơn là lượng văn bản có thể vừa trong một lời nhắc duy nhất. GLM 5.3 hỗ trợ 1.000.000 token, trong khi nhiều mô hình phổ biến hỗ trợ từ 4.000 đến 200.000 token. Đối với các tác vụ như phân tích toàn bộ một cuốn sách, một yêu cầu duy nhất với GLM 5.3 có thể tránh được sự phức tạp của việc chia nhỏ và truy xuất. Tuy nhiên, cửa sổ ngữ cảnh lớn hơn không tự động có nghĩa là hiệu suất tốt hơn; các mô hình có ngữ cảnh ngắn hơn đôi khi được tinh chỉnh để có độ chính xác cao trong các tác vụ tập trung. Chi phí là một yếu tố khác: giá đầu vào và đầu ra trên mỗi token cho GLM 5.3 là $1.40 và $4.40 cho mỗi triệu token, và một lời nhắc rất dài sẽ tiêu tốn nhiều token. Nếu dữ liệu của bạn phù hợp với ngữ cảnh nhỏ hơn, một mô hình rẻ hơn có thể hiệu quả hơn. OrcaRouter cho phép bạn chọn mô hình phù hợp với khối lượng công việc của mình; mục danh mục cho GLM 5.3 không bao gồm bảng so sánh, vì vậy bạn nên thử nghiệm với dữ liệu của riêng mình.
GLM 5.3 chỉ hỗ trợ văn bản, do đó nó không nhận hình ảnh, âm thanh hoặc video làm đầu vào. Các mô hình đa phương thức có thể kết hợp các phương thức này với văn bản, cho phép bạn đặt câu hỏi về một bức ảnh, một bản ghi âm hoặc một khung hình video. Nếu ứng dụng của bạn cần khả năng hiểu hình ảnh, GLM 5.3 không phù hợp. Tuy nhiên, đối với các tác vụ chỉ xử lý văn bản, ngữ cảnh 1.000.000 token và đầu ra 128.000 token của GLM 5.3 là những điểm nổi bật. Nhiều mô hình đa phương thức có cửa sổ ngữ cảnh nhỏ hơn nhiều hoặc độ dài đầu ra hạn chế. Ngoài ra, các mô hình đa phương thức thường tính phí đầu vào cao hơn vì token hình ảnh có thể đắt đỏ. Nếu bạn chỉ có văn bản, bạn có thể ưu tiên mô hình chỉ hỗ trợ văn bản để tránh chi phí phát sinh khi mã hóa hình ảnh. Sự lựa chọn giữa GLM 5.3 và mô hình đa phương thức nên dựa trên loại đầu vào mà ứng dụng của bạn cần xử lý. Đối với kho văn bản, ngữ cảnh lớn của GLM 5.3 là một lợi thế rõ ràng.
Z.ai, còn được gọi là Zhipu AI, phát triển một dòng mô hình GLM. Mục danh mục này mô tả cụ thể GLM 5.3 và không đề cập đến các phiên bản GLM cũ hơn hoặc nhỏ hơn. Ngữ cảnh 1.000.000 token được liệt kê và đầu ra tối đa 128.000 token lớn hơn các giới hạn mặc định thông thường, nhưng mục này không cung cấp thông số so sánh cho các mô hình GLM khác. Các mô hình Z.ai nhỏ hơn có thể có mức giá khác và độ trễ thấp hơn, nhưng không có con số cụ thể nào xuất hiện cùng với bản ghi danh mục này. Vì OrcaRouter phục vụ các mô hình từ nhiều nhà cung cấp, bạn có thể so sánh GLM 5.3 với các mô hình văn bản khác song song bằng API tương thích OpenAI. Cách tốt nhất để quyết định là chạy một khối lượng công việc nhỏ, đại diện qua từng mô hình và đo lường chất lượng, tốc độ cũng như chi phí. Nếu không có điểm số so sánh chính thức, bất kỳ xếp hạng hiệu suất trực tiếp nào giữa GLM 5.3 và các phiên bản khác đều chỉ mang tính suy đoán.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatstopstreamtemperaturetool_choicetoolstop_p| Đầu vào / 1M tokens | $1.40 |
| Đầu ra / 1M tokens | $4.40 |
| Đọc cache / 1M | $0.260 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
@misc{orcarouter_glm_5_3,
title = {GLM 5.3 API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5.3}
}Z.ai. (2026). GLM 5.3 API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5.3