Z.ai在GLM-5系列中最強大的編碼與代理模型;支援串流工具呼叫與深度思考。200K上下文。
GLM 5.1 是 Z.ai 推出的旗艦語言模型,可透過 OrcaRouter 的 OpenAI 相容 API 存取。其設計旨在處理極大上下文窗口——最高可達 200,000 個 Token——並在單次回應中生成最多 128,000 個 Token。該模型僅支援純文字,亦即只接受與產生文字內容。計價方式簡單明瞭:每百萬輸入 Token 1.40 美元,每百萬輸出 Token 4.40…
GLM 5.1 專為受益於其大型上下文與高輸出能力的任務進行最佳化,包括從長篇文件(例如超過100頁的報告)中摘要或提取洞察、進行需要模型追蹤大量中間結果的多步驟研究,以及生成詳細的程式碼或技術說明。其 τ²-Bench 分數為 97.7,顯示該模型在工具使用場景中特別擅長,例如需要模型規劃、執行動作並在多個步驟中整合回饋的任務。它也對於需要參考嵌入在提示中的大規模知識庫的複雜問答有效。
GLM 5.1 是一款純文字模型,無法處理圖片、音訊或影片輸入。若需多模態應用,必須搭配獨立的視覺或音頻模型。此外,其大型上下文視窗與高輸出token限制會帶來相應的計算成本——無論是延遲還是價格皆然。對於短對話或基本分類等簡單任務,較小且較便宜的模型可能更有效率。開發者也應注意,雖然模型的上下文視窗為20萬個token,但在極長上下文中的實際表現可能取決於內容的特性。
若您的使用場景涉及短提示(低於10K token)、簡單生成(例如簡單翻譯或關鍵字提取),或對延遲敏感的高吞吐量需求,則較小或更便宜的模型可能更合適。GLM 5.1 的定價為每100萬輸入 token 1.40美元、每100萬輸出 token 4.40美元,其旗艦級能力具有競爭力,但若用於瑣碎任務則可能累積成本。適用較便宜模型的案例包括:簡單的聊天機器人回覆、短文章的適中長度摘要,或單輪分類。
是的,GLM 5.1 可以有效地處理多輪對話,這得益於其 200K token 的上下文視窗。這使得模型能夠在多次交流中保留對話歷史,包括先前的用戶訊息和系統指令,而不會失去上下文。然而,開發者應注意 token 的使用情況:每輪對話都會增加提示詞的長度,因此長時間的對話可能會變得昂貴。可以透過截斷或摘要舊的對話輪次來保持在上下文限制內,但模型的原生容量對於大多數實際對話應用來說已經足夠寬裕。
GLM 5.1 在 τ²-Bench 上獲得 97.7 分,該基準測試旨在評估模型執行多步驟工具使用和規劃的能力。它模擬真實任務,模型必須決定呼叫哪些工具、以何種順序,以及如何解讀結果以達成目標。這與傳統的問答基準不同,專注於代理能力。97.7 的分數表示 GLM 5.1 能成功完成評估集中幾乎所有任務,反映出強大的推理和工具使用技能。這是該基準測試報告的最高分數之一。
對於GLM 5.1,僅提供了τ²-Bench分數97.7。官方規格中沒有其他基準測試結果(例如MMLU、HumanEval或GSM8K)。缺乏額外數據的情況下,無法在其他常見評估上進行直接比較。然而,τ²-Bench結果表明該模型在工具使用和規劃方面特別強大。對於此基準測試未涵蓋的任務,開發者應使用自己的測試集對模型進行經驗評估。
目前尚未提供 GLM 5.1 的具體延遲或吞吐量數據。作為一款擁有超大上下文窗口和高輸出限制的旗艦模型,其推理時間將比小型模型更長,特別是在處理接近最大上下文長度時。吞吐量取決於 OrcaRouter 背後的硬體基礎設施以及請求的批次大小。對於即時應用,開發者應使用自身典型的輸入與輸出大小進行測試,以評估可接受的回應時間。串流模式可以透過逐步傳遞 token 來幫助減少感知上的延遲。
GLM 5.1 唯一可用的基準測試數據是其 τ²-Bench 分數 97.7。雖然這顯示出強大的工具使用規劃能力,但並未涵蓋許多其他重要面向,例如事實準確性、數學推理、程式編寫或多語言表現。因此,僅依賴此分數可能無法呈現全貌。開發者應補充自身領域的評估,特別是在應用涉及與工具使用無關的任務時。此外,基準測試可能受到提示設計與評估方法的影響,因此實際表現可能有所不同。
GLM 5.1 的價格為每 100 萬輸入代幣 $1.40,每 100 萬輸出代幣 $4.40。此費率由提供商 Z.ai 設定,並由 OrcaRouter 以零加價方式傳遞。輸入和輸出代幣均按照模型使用的標準標記化方式計算。無需額外使用費或訂閱要求。費用根據代幣消耗量計費,因此可以輕鬆估算特定工作負載的成本。
GLM 5.1 目前尚未公布任何特定的快取或折扣方案,定價模式嚴格按照列出的費率以 token 計費。OrcaRouter 可能在平台層級提供提示快取或類似功能,但這些並未在模型規格中揭露。希望降低成本的開發者應考慮優化提示長度、盡可能使用較短的輸出內容,並將請求批次處理。針對大量使用的情況,直接聯繫 OrcaRouter 或許能獲得額外的選項。
與其他旗艦模型的直接比較有限,因為僅提供了 GLM 5.1 的定價:每 100 萬輸入 1.40 美元,每 100 萬輸出 4.40 美元。其他供應商的旗艦模型定價通常相似或更高,但具體數字取決於特定模型與供應商。GLM 5.1 的定價在具備 20 萬上下文視窗與 12.8 萬輸出限制的模型中,被視為具有競爭力。對於預算有限的專案,Z.ai 或其他供應商提供的較小模型可能更經濟實惠。
GLM 5.1 透過 OrcaRouter 提供按用量計費的服務,無需預先承諾或支付訂閱費用。您只需根據實際消耗的 token 數量,按 token 單價付費。此模式非常適合使用量波動的變動工作負載。帳務由 OrcaRouter 使用所提供的 API 金鑰進行處理。
若要透過 OrcaRouter 使用 GLM 5.1,請將您的 API 基礎網址設為 https://api.orcarouter.ai/v1,並使用模型 ID "z-ai/glm-5.1"。例如,使用 OpenAI Python 函式庫:openai.base_url = "https://api.orcarouter.ai/v1"; openai.api_key = "your-key"; response = openai.ChatCompletion.create(model="z-ai/glm-5.1", messages=[...])。支援所有標準參數,例如 temperature、top_p、max_tokens 和 stop sequences。設定 stream=True 即可啟用串流。
GLM 5.1 支援與 OpenAI API 相同的聊天完成參數。這些參數包括 temperature(範圍 0 到 2,預設 0.7)、top_p(0 到 1,預設 1)、max_tokens(最高可達模型限制的 128,000)、stop sequences(字串列表)、frequency_penalty、presence_penalty 和 logit_bias。該模型也支援使用 "n" 參數來為每個請求生成多個完成結果。所有參數均透過標準 JSON 主體傳遞。系統訊息、使用者訊息和助手訊息均受支援。
遷移至OrcaRouter使用GLM 5.1非常直接。在現有程式碼中,將基礎URL從先前的提供者更改為https://api.orcarouter.ai/v1。接著將API呼叫中的模型名稱替換為"z-ai/glm-5.1"。標準聊天完成無需其他變更。如果您使用的是不同的API金鑰格式,請確保使用OrcaRouter API金鑰。回應格式與OpenAI相同,因此解析邏輯保持不變。
是的,OrcaRouter 支援 GLM 5.1 的串流回應,與 OpenAI API 完全相同。在請求中設定 stream=True 並疊代處理回應區塊。每個區塊包含內容欄位的增量更新(delta updates)。串流格式為 SSE(Server-Sent Events)。這讓您能逐步顯示令牌(tokens)給使用者,降低感知延遲。相同的串流參數(如 temperature、max_tokens 等)在串流時同樣適用。
GLM 5.1 是 Z.ai 的旗艦模型,代表其在性能與價格上位居產品線頂端。Z.ai 的低階模型通常具備較小的上下文視窗、較低的輸出上限與較低的基準測試分數,但每個 token 的價格也較低。Z.ai 其他模型的具體規格未提供,但可能的取捨包括縮減的上下文(例如 128K)、較低的輸出上限,以及可能支援多模態輸入。開發人員應在需要完整的 200K 上下文與高輸出時選擇 GLM 5.1。
與其他供應商提供的旗艦模型相比,GLM 5.1 擁有極大的上下文窗口(20萬個token)和輸出限制(12.8萬個token),屬於目前市面上最高的級別。其 τ²-Bench 得分高達 97.7,在工具使用規劃方面名列前茅。不過,它僅支援文字輸入,而許多競爭對手旗艦模型則支援視覺或音訊輸入。定價為每百萬個token 1.40美元/4.40美元,具競爭力,但視具體供應商與模型而定,可能更高或更低。開發者應根據自身對上下文、模態以及基準測試表現的具體需求進行評估。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5.1",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)do_sampleinclude_reasoningmax_tokensreasoningrequest_idresponse_formatstopstreamtemperaturethinkingtool_choicetool_streamtoolstop_puser_id| 輸入 / 1M tokens | $1.40 |
| 輸出 / 1M tokens | $4.40 |
| 快取讀取 / 1M | $0.260 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_glm_5_1,
title = {GLM 5.1 API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5.1}
}Z.ai. (2026). GLM 5.1 API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5.1