GLM 5.3 Flash

z-ai/glm-5.3-flash
視覺工具JSON推理
來自 Z.ai · 2026-08-26

GLM-5.3-Flash 是來自 Z.ai 的原生多模態模型,適合高效編碼與長時程智能體任務。其混合稀疏與線性注意力架構能維持準確的長上下文行為,同時大幅降低服務成本。320B 總參數 / 18B 活躍參數、1M token 上下文,文字 + 圖像 + 影片輸入、文字輸出。

上下文1M tokens
最大輸出128K
輸入模態text + image + video
輸出模態text
p50 首字節7.78 s
輸入$0.07/ 百萬 tokens
輸出$0.25/ 百萬 tokens
p50 首字節7.78 s7 天
p95 首字節10.00 s7 天
流量799.8Mtokens / 7 天

程式碼範例

用任意 SDK 呼叫

相容 OpenAI——沿用你現有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支援的參數

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • temperature
  • tool_choice
  • tools
  • top_p

價格

輸入 / 1M tokens$0.075
輸出 / 1M tokens$0.250
快取讀取 / 1M$0.017
貨幣USD

費用計算器

每月 token 數10MM
輸入占比70%%
預計每月 $1.28 · 啟用提示快取後 $1.07

基於標價的估算

Token 與費用估算器

輸入 Token: 6每次請求費用: $0.000125

僅為估算——實際 Token 數取決於供應商的分詞器。

效能

p50 首字節
7.78 s
輸出速度
113 tok/s
p95 首字節
10.00 s
錯誤率
7.5%

公開基準測試

71.5
AA Coding
優於所參與比較模型中的 88%
第 15 / 共 134
57.5
AA Intelligence
優於所參與比較模型中的 92%
第 11 / 共 136
Agents' Last Exam
26.3
AutomationBench v1.0.6
48.8
BabyVision
53.4
Chartography (with tools)
78.0
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
63.4
GPQA Diamond
91.2
HLE (with tools)
55.3
Humanity's Last Exam
39.9
Long-Context Recall
78.0
MMVU
80.5
MVBench
77.8
NL2Repo
56.3
OfficeQA Pro
62.4
SciCode
46.1
tau_banking
47.2
Terminal-Bench 2.1
84.3
terminalbench_v2_1
84.3
Toolathlon Verified
78.4
來源: artificialanalysis.ai, z.ai

社群熱度

本週開發者的討論

Hacker News10 次提及 · 近 7 天較上週增加 8

比較一覽

GLM 5.3 FlashGLM 5.1GLM 5.2GLM 5.3
輸入 $/百萬$0.07$1.40$1.40$1.26
輸出 $/百萬$0.25$4.40$4.40$3.96
上下文1.0M200K1.0M1.0M
品質8/109/109/109/10
並排比較並排比較並排比較並排比較

常見問題

在 OrcaRouter 上,Z.ai: GLM 5.3 Flash 的價格是多少?
Z.ai: GLM 5.3 Flash 透過 OrcaRouter 的定價為每百萬輸入代幣 $0.07,每百萬輸出代幣 $0.25。價格由路由層即時提供。
Z.ai: GLM 5.3 Flash 的上下文視窗是什麼?
Z.ai: GLM 5.3 Flash 支援 1M 個標記的上下文窗口。使用長上下文功能(RAG、摘要)直至該限制。
如何透過 OpenAI SDK 呼叫 Z.ai: GLM 5.3 Flash?
將 OpenAI 的 base_url 設定為 https://api.orcarouter.ai/v1,提供您的 OrcaRouter API 金鑰,並在 chat.completions.create 呼叫中傳入 model=\"z-ai/glm-5.3-flash\"。
OrcaRouter 是否會對 Z.ai: GLM 5.3 Flash 進行速率限制?
每個模型的速率限制會遵循您的 OrcaRouter 方案。免費方案附帶保守的上限;付費方案則會提高這些上限。請查看 /pricing 以了解目前的配額。

嵌入此徽章

Z.ai: GLM 5.3 Flash$0.07/M in7777ms p50透過 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/z-ai/glm-5.3-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg" alt="Z.ai: GLM 5.3 Flash 於 OrcaRouter" /> </a>
Markdown [![Z.ai: GLM 5.3 Flash](https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg)](https://www.orcarouter.ai/models/z-ai/glm-5.3-flash)

以資料形式取得模型卡

GET /api/public/models/z-ai/glm-5.3-flash開啟