GLM 5.3 Flash

z-ai/glm-5.3-flash
视觉工具JSON推理
来自 Z.ai · 2026-08-26

GLM-5.3-Flash 是 Z.ai 推出的原生多模态模型,适用于高效编码和长时程智能体任务。其混合稀疏与线性注意力架构在显著降低服务成本的同时,保持了精准的长上下文行为。320B 总参数 / 18B 激活参数,1M token 上下文,支持文本、图像、视频输入,文本输出。

上下文1M tokens
最大输出128K
输入模态text + image + video
输出模态text
p50 首字节7.78 s
输入$0.07/ 百万 tokens
输出$0.25/ 百万 tokens
p50 首字节7.78 s7 天
p95 首字节10.00 s7 天
流量799.8Mtokens / 7 天

代码示例

用任意 SDK 调用

兼容 OpenAI——沿用你现有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支持的参数

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • temperature
  • tool_choice
  • tools
  • top_p

价格

输入 / 1M tokens$0.075
输出 / 1M tokens$0.250
缓存读取 / 1M$0.017
货币USD

费用计算器

每月 token 数10MM
输入占比70%%
预计每月 $1.28 · 启用提示缓存后 $1.07

基于标价的估算

Token 与费用估算器

输入 Token: 6每次请求费用: $0.000125

仅为估算——实际 Token 数取决于提供商的分词器。

性能

p50 首字节
7.78 s
输出速度
113 tok/s
p95 首字节
10.00 s
错误率
7.5%

公共基准测试

71.5
AA Coding
优于所参与对比模型中的 88%
第 15 / 共 134
57.5
AA Intelligence
优于所参与对比模型中的 92%
第 11 / 共 136
Agents' Last Exam
26.3
AutomationBench v1.0.6
48.8
BabyVision
53.4
Chartography (with tools)
78.0
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
63.4
GPQA Diamond
91.2
HLE (with tools)
55.3
Humanity's Last Exam
39.9
Long-Context Recall
78.0
MMVU
80.5
MVBench
77.8
NL2Repo
56.3
OfficeQA Pro
62.4
SciCode
46.1
tau_banking
47.2
Terminal-Bench 2.1
84.3
terminalbench_v2_1
84.3
Toolathlon Verified
78.4
来源: artificialanalysis.ai, z.ai

社区热度

本周开发者的讨论

Hacker News10 次提及 · 近 7 天较上周增加 8

对比一览

GLM 5.3 FlashGLM 5.1GLM 5.2GLM 5.3
输入 $/百万$0.07$1.40$1.40$1.26
输出 $/百万$0.25$4.40$4.40$3.96
上下文1.0M200K1.0M1.0M
质量8/109/109/109/10
并排对比并排对比并排对比并排对比

常见问题

在 OrcaRouter 上,Z.ai: GLM 5.3 Flash 的价格是多少?
Z.ai: GLM 5.3 Flash 通过 OrcaRouter 的定价为每百万输入 token $0.07,每百万输出 token $0.25。定价从路由层实时获取。
Z.ai: GLM 5.3 Flash的上下文窗口是多少?
Z.ai: GLM 5.3 Flash 支持 1M 个 token 的上下文窗口。可使用长上下文功能(RAG、摘要)直至该限制。
如何通过 OpenAI SDK 调用 Z.ai: GLM 5.3 Flash?
将 OpenAI base_url 设置为 https://api.orcarouter.ai/v1,提供您的 OrcaRouter API 密钥,并在 chat.completions.create 调用中传递 model="z-ai/glm-5.3-flash"。
OrcaRouter 是否对 Z.ai: GLM 5.3 Flash 进行速率限制?
每个模型的速率限制遵循您的 OrcaRouter 计划。免费套餐设有保守的上限;付费套餐则会提升这些上限。请查看 /pricing 了解当前配额。

嵌入此徽章

Z.ai: GLM 5.3 Flash$0.07/M in7777ms p50通过 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/z-ai/glm-5.3-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg" alt="Z.ai: GLM 5.3 Flash 在 OrcaRouter" /> </a>
Markdown [![Z.ai: GLM 5.3 Flash](https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg)](https://www.orcarouter.ai/models/z-ai/glm-5.3-flash)

以数据形式获取模型卡

GET /api/public/models/z-ai/glm-5.3-flash打开