GLM-5.3 是 Z.ai(Zhipu AI)最新的旗艦模型,專為複雜軟體工程與長時程代理型任務而設計。與 GLM-5.2 相比,它在編碼體驗上提升了約 50%,在特定資安能力上與 Mythos 5 相當,並在原始效能與 token 效率之間取得了更佳的平衡。它是一款文字輸入/文字輸出模型,專為儲存庫級編碼、自主多步驟工程,以及必須在長時程內保持連貫的代理工作流程而打造。 GLM-5.3 使用與 GLM-5 系列相同的 API 介面,但有兩項變更需要呼叫端處理:thinking 永遠開啟(thinking.type 僅接受 enabled;傳入 disabled 現在會導致請求失敗),而推理深度由 reasoning_effort 控制,可設為 low / high / max,預設為 max。它支援原生工具呼叫與結構化 JSON 輸出,並採用與 OpenAI 相容的 chat-completions 格式。
GLM 5.3 是一個大型語言模型,列在提供者 z-ai 之下,並透過 OrcaRouter 提供服務。目錄條目將其描述為純文字模型,輸入上下文最多可達 1,000,000 個 token,最大生成長度為 128,000 個 token。這表示該模型可以將整本書或大型程式碼庫作為單一提示詞輸入,同時仍保留空間來生成較長的回應。它不是多模態模型;影像、音訊和視訊都不在其列出的輸入模態之內。GLM…
憑藉100萬token的上下文,GLM 5.3可以處理那些原本需要拆分成許多塊的文件。你可以把整本小說、長篇技術手冊,或數百頁的對話歷史放進提示(prompt)中。主要的實際好處是,模型在回答時可以一次考量所有資料。這使得摘要、事實擷取和比較分析等任務,不需要自訂檢索邏輯也能完成。這也意味著你可以在後續的對話回合中,針對大量的文字內容提出問題,因為完整的對話都會保留在上下文視窗內。然而,使用100萬token的提示並非免費;輸入token的計費為每百萬個1.40美元,因此一個完整的提示大約會花費1.40美元,而且這個數字還不包括輸出。目錄中沒有描述專門的檢索功能,因此模型只是使用上下文中的內容。
GLM 5.3 的最大輸出長度為 128,000 個 token。這遠高於許多模型常見的 4,000 到 8,000 預設限制。它允許模型在一次呼叫中產生長篇報告、程式碼檔案、機器翻譯或多章節草稿。以每百萬 token 4.40 美元的輸出價格計算,一個 128,000 token 的回應在輸出 token 上的花費約為 0.56 美元(128,000 / 1,000,000 * 4.40)。每個單詞的實際 token 數會有所不同,但這提供了上限成本的參考。OrcaRouter 計費是以 token 為基礎,因此較短的輸出成本會按比例降低。沒有任何跡象顯示輸出限制可以設定得更高;128,000 是目錄中列出的上限。在設計應用程式時,您可能需要處理非常長的輸出串流,或使用串流來逐步呈現結果,因為模型可能會產生大量文字。
目錄列出 Z.ai GLM 5.3 的輸入模態為文字。這表示該模型接受純文字訊息,包括對話歷史、系統提示詞和用戶內容。它不接受圖片、音訊、視訊或其他二進位內容。在為特定任務選擇模型時,這是一個重要的限制。如果您的管道需要讀取螢幕截圖、分析錄音或分類影片,您需要多模態模型,或在呼叫 GLM 5.3 之前先進行獨立的轉錄/視覺步驟。儘管上下文視窗很大,內容仍然是文字;您不能直接附加 PDF 檔案,除非先提取其文字。該模型可以處理長篇文字 JSON、程式碼、日誌或文章。對於純文字工作負載,較大的上下文可能很有用;對於任何其他模態,請在 OrcaRouter 上尋找其他模型。
GLM 5.3 的大上下文和長輸出,其每個 token 的價格高於一些較小的模型。如果你的任務只需要幾千個 token 的上下文和簡短的回覆,較便宜的模型可能以較低成本產生良好結果。OrcaRouter 提供許多不同價格點的模型,但此目錄條目並未列出替代方案。一般來說,當你需要在單次呼叫中使用大上下文或非常長的輸出,且這些能力足以證明成本合理時,請使用 GLM 5.3。如果你可以將任務拆分成較小的部分,或較短的上下文就足夠,那麼較小的模型將使用較少的輸入 token,並且可能更具成本效益。也要考慮延遲:處理 1M-token 的提示會比處理簡短提示花更長時間,無論使用哪種模型。選擇取決於你的生產需求。
OrcaRouter 目錄中針對 Z.ai GLM 5.3 的條目並未包含任何基準測試分數。這表示此列表中沒有官方數字可供引用 MMLU、HumanEval 或其他標準評測。您仍然可以自行評估模型,方法是執行您自己的測試提示詞,並在您的領域中比較輸出結果。由於未提供基準測試資料,任何有關特定任務相對品質的宣稱都應謹慎對待。僅有的具體數字是上下文視窗、最大輸出和價格。對於像 GLM 這樣的語言模型系列,外部出版物可能提供一般資訊,但此處缺少基準測試表格,表示最安全的做法是在代表性任務上進行衡量。OrcaRouter 的 API 可用於與其他模型進行並排評估,但您收集的任何結果僅適用於您的使用案例,而非全球排名。
目錄中未列出 GLM 5.3 的延遲數據,因此無法提供確切的速度。一般而言,回應時間取決於多個因素:輸入提示的長度、要求輸出的 token 數量、上游供應商目前的負載,以及網路狀況。包含 1,000,000 個 token 的提示請求,處理時間會比簡短提示長得多,因為模型必須先讀取所有文字才能開始生成。輸出生成時間也會隨著輸出 token 數量增加而變長;128,000 個 token 的回應可能會非常慢。對於互動式應用,您可能想要使用串流(streaming)來在文字生成的同時開始接收內容。OrcaRouter 的 OpenAI 相容 API 支援標準串流參數,但實際吞吐量取決於 z-ai 供應商。建議您測試一個具代表性的請求,以了解您工作負載的延遲情況。
GLM 5.3 的主要限制與其目錄規格有關。它僅支援文字,因此無法原生處理圖像、音訊或影片;這些形式的內容必須先轉換為文字。上下文視窗為 1,000,000 個 token,但完整使用它表示你的請求非常龐大,這會帶來成本與延遲方面的影響。最大輸出為 128,000 個 token,但產生這樣的輸出相當耗時,如果不使用串流,可能會遇到提供者的逾時問題。目錄中未列出任何基準測試分數,因此你不應假設它在所有任務上都優於其他模型。最後,與所有語言模型一樣,輸出可能不準確或產生幻覺;你應該驗證重要資訊。token 計數為近似值,因此 1M-token 的提示是實際上限,而非保證模型能完美處理每個長提示。
GLM 5.3 按 token 計費。列出的輸入價格為每 1,000,000 個 token 1.40 美元,輸出價格為每 1,000,000 個 token 4.40 美元。OrcaRouter 不加價;您被收取的金額即為供應商費率。輸入 token 包括提示詞、任何系統指令,以及您發送的對話歷史。輸出 token 是模型生成的 token。大多數 API 都會計算提示詞和生成的文字,此模型遵循標準的按 token 計費方式。此方案沒有月租訂閱,也沒有提到額外的固定費用。請求的總費用計算方式為 (輸入 token / 1,000,000) * 1.40 加上 (輸出 token / 1,000,000) * 4.40。例如,一個請求包含 10,000 個輸入 token 和 1,000 個輸出 token,費用為 0.014 美元加上 0.0044 美元,總計約 0.0184 美元。
由於 GLM 5.3 的輸入和輸出 token 定價不同,成本分佈取決於您如何使用模型。輸入 token 每百萬個花費 $1.40,輸出 token 每百萬個花費 $4.40,使得每個輸出 token 的價格是輸入的三倍以上。這是許多語言模型常見的定價結構。讀取長文件並回傳簡短摘要的任務,將以輸入成本為主。從簡短提示開始並產生非常長回應的任務,則以輸出成本為主。128,000 個 token 的最大輸出量意味著單次最長生成可能需要花費約 $0.56 的輸出 token。在累積多輪的對話中,雙方都會增長;除非您使用較短的上下文視窗或截斷歷史記錄,否則每次都會重新傳送歷史輸入。您可以透過保持提示簡潔並在可能時限制輸出長度來降低成本。
GLM 5.3 的目錄條目並未提及提示詞快取、折扣或特殊定價層級。列出的價格很直接:每百萬個輸入代幣 1.40 美元,每百萬個輸出代幣 4.40 美元。如果 OrcaRouter 或上游供應商未來引入快取機制,重複提示詞的實際成本可能會有所變化,但此處並未描述任何此類機制。同樣地,這裡也沒有提及批次處理或大量使用折扣。若要控制成本,您可以管理傳送的代幣數量。例如,與其重新傳送整段對話,不如只保留相關的近幾輪內容。您也可以設定較低的 max_tokens 值來限制輸出長度。由於 OrcaRouter 以供應商費率計費且零加價,您在模型列表中看到的成本即為基本費率。請務必隨時查閱目前文件,以了解定價或新功能的任何更新。
若要呼叫 Z.ai GLM 5.3,請將您的 HTTP 用戶端指向 OrcaRouter 的 OpenAI 相容 API。基礎 URL 為 https://api.orcarouter.ai/v1。在請求主體中使用模型 ID z-ai/glm-5.3。若您使用官方 OpenAI SDK,請將 base_url 設定為 OrcaRouter 的端點,並使用您的 OrcaRouter API 金鑰。請求格式為標準的聊天完成(chat completions)結構:一個包含 model 欄位和 messages 陣列的 JSON 物件。每則訊息包含 role 和 content。模型將產生文字回應。OrcaRouter 會將請求轉發至 z-ai 供應商。由於此 API 與 OpenAI 相容,因此支援 OpenAI 端點的程式庫和工具,可將目標指向 OrcaRouter,無需自訂整合。在驗證方面,請在 Authorization 標頭中包含您的 OrcaRouter 金鑰。此端點接受一般的聊天完成呼叫;此模型沒有獨立於此的 RESTful 資源。
OrcaRouter 用於 GLM 5.3 的 OpenAI 相容 API 接受 OpenAI chat completions 格式中常見的相同請求參數。您可以將 model 設定為 z-ai/glm-5.3,提供 messages,並使用諸如 max_tokens、temperature、top_p 和 stream 等參數來控制生成。確切支援的參數清單可能因提供者而異。目錄未列出完整的參數結構描述,因此您應參閱 OrcaRouter 的 API 文件以了解目前支援的欄位。由於模型的最大輸出為 128,000 個 token,您可以將 max_tokens 設定得遠高於許多用戶端的預設值;如果您的用戶端對這個值設有上限,您可能需要調整它。1,000,000 個 token 的上下文視窗代表您的 messages 總 token 數可能非常龐大;以 JSON 形式傳送那麼多的文字是可行的,但請注意請求大小和延遲。串流通常適用於 OpenAI 相容的 API,但 OrcaRouter 的確切回應格式遵循標準。
透過 OrcaRouter 將應用程式從 OpenAI 遷移到 GLM 5.3 通常需要兩個變更。首先,將 base_url 變更為 https://api.orcarouter.ai/v1。第二,將模型名稱變更為 z-ai/glm-5.3。messages 陣列、角色和 JSON 回應結構與 OpenAI 的 chat completions 格式保持相同。如果您目前使用 OpenAI SDK,請更新環境變數或用戶端設定以指向 OrcaRouter。使用 OrcaRouter API 金鑰取代先前的金鑰。請求主體本身不需要變更程式碼,不過您可能想要檢閱參數。由於 GLM 5.3 僅支援文字,請從提示中移除任何 image_url 或多模態附件。此外,該模型的上下文視窗比許多 OpenAI 模型大得多,因此您可以增加所傳送的對話歷史記錄量。請先使用小型請求進行測試,以確認回應格式符合您的程式碼預期。
以下是透過 OrcaRouter 向 GLM 5.3 發送的最小聊天完成請求。向 https://api.orcarouter.ai/v1/chat/completions 發送 POST,Authorization 標頭需包含您的 OrcaRouter API 金鑰。請求主體應包含這些欄位:model 設為 z-ai/glm-5.3,以及至少包含一則訊息的 messages,例如 {"role":"user","content":"What is the capital of France?"}。回應將以標準的 OpenAI 聊天完成格式包含模型回覆。您可以加入選用參數,例如 temperature 和 max_tokens。如果省略 max_tokens,提供者會使用其預設值;若要利用 128,000 個 token 的輸出限制,請將 max_tokens 設為所需值。若要串流,請將 stream 設為 true,並在 data 行到達時讀取它們。確切的 JSON 格式遵循 OpenAI 的慣例,因此現有的解析 choices 和 message content 的輔助函式應該可以正常運作。
GLM 5.3 與上下文視窗較小的模型之間的主要差異,在於單一提示中能容納的文字量。GLM 5.3 支援 1,000,000 個 token,而許多常見模型則支援 4,000 到 200,000 個 token。對於分析整本書這類任務,使用 GLM 5.3 的單一請求可以避免分塊和檢索的複雜性。然而,較大的上下文視窗並不自動代表效能較佳;較短上下文的模型有時會針對特定任務進行調整,以達到高度準確性。成本是另一個因素:GLM 5.3 的每個 token 輸入和輸出價格分別為每百萬 token $1.40 和 $4.40,而非常長的提示會消耗大量 token。如果您的資料適合較小的上下文,較便宜的模型可能更有效率。OrcaRouter 可讓您選擇適合您工作負載的模型;GLM 5.3 的目錄條目未包含比較表,因此您應使用自己的資料進行測試。
GLM 5.3 僅支援文字,因此不接受圖片、音訊或影片作為輸入。多模態模型可以將這些模態與文字結合,讓你能針對照片、錄音或影片幀提出問題。如果你的應用程式需要視覺理解,GLM 5.3 不是合適的選擇。然而,對於純文字工作負載,GLM 5.3 的 1,000,000 token 上下文和 128,000 token 輸出相當獨特。許多多模態模型的上下文視窗較小,或輸出長度有限。此外,多模態模型通常收取較高的輸入費用,因為影像 token 可能很昂貴。如果你只有文字,你可能會偏好純文字模型,以避免編碼圖像的額外負擔。GLM 5.3 與多模態模型之間的選擇,應根據你的應用程式必須處理的輸入類型來決定。對於文字語料庫,GLM 5.3 的大上下文是一項明顯優勢。
Z.ai,也稱為Zhipu AI,開發一系列GLM模型。此目錄條目專門介紹GLM 5.3,不描述較舊或較小的GLM版本。所列出的1,000,000 tokens上下文視窗和128,000 tokens最大輸出,大於典型的預設限制,但此條目中未提供其他GLM模型的比較規格。較小的Z.ai模型可能具有不同的價格點和較低的延遲,但此目錄記錄旁未列出具體數字。由於OrcaRouter提供來自多家供應商的模型,您可以使用OpenAI相容API,並排比較GLM 5.3與其他文字模型。最佳的決定方式是透過每個模型執行小型、具代表性的工作負載,並衡量品質、速度和成本。在沒有官方比較分數的情況下,任何GLM 5.3與其他版本之間的直接效能排名都屬推測。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatstopstreamtemperaturetool_choicetoolstop_p| 輸入 / 1M tokens | $1.40 |
| 輸出 / 1M tokens | $4.40 |
| 快取讀取 / 1M | $0.260 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_glm_5_3,
title = {GLM 5.3 API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5.3}
}Z.ai. (2026). GLM 5.3 API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5.3