
GLM 5.5 还是 GLM 5.3-Vision?一个与 Z.ai 指纹匹配的匿名模型刚刚浮现
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
一个身份未明的模型{{1}}其服务画像——速度、首 token 时延(TTFT)、缓存命中率——与 Z.ai 的 GLM 技术栈吻合{{/1}},已开始引起容量分析师的关注,而目前的猜测是它可能被命名为 GLM 5.3-Vision 或 GLM 5.5。8 月 20 日,算力与容量分析师 teortaxesTex 发帖称,他追踪的一个匿名模型{{2}}“至少显然不是 DeepSeek”{{/2}}、{{3}}“目前没有任何证据排除 GLM”{{/3}},并且{{4}}“速度、TTFT、缓存命中率也都与 GLM 相符”{{/4}}。他的判断是:预计它会叫 GLM 5.3-Vision 或 5.5,在 Artificial Analysis Intelligence Index 上得分约为 61——{{5}}比已发布的 GLM-5.3 目前所处的位置高出 1 分{{/5}}。目前一切都未得到证实。没有模型卡,没有 Z.ai 的公告,也没有 API,本页面只是把这个目击当作它本来的样子:一个早期、尚未被复现的泄漏信号;正因为 GLM-5.5 整个月都被视为 Z.ai 理应推出的旗舰产品,却至今没有亮相,这个信号才值得追踪。在那条帖子发布五天后,出现了第二个、这一次完全可以核查的数据点:8 月 25 日,vLLM——支撑大多数大规模模型服务的推理运行时——开启了一个 Do-Not-Merge 拉取请求,{{6}}为 GLM-5 的头维度启用 masked-MHA 内核支持{{/6}}。它没有指明任何变体,也不能证明任何发布;它只是服务栈层面的基础铺垫,{{7}}属于一个新模型会在身后留下的那种幕后活动{{/7}}。
信号实际所说的内容
来源是 teortaxesTex 在 8 月 20 日发布的一条 X 帖子——正是那个在 8 月对 GLM-5.3 发布时间的“大约一周”预测精确到天的账号。其表述明确指出了证据等级:“强证据(尚未复现)”。该分析师将 DeepSeek 排除在外,没有发现任何与 GLM 相矛盾的地方,并引用三项服务级指标——吞吐量、首 token 延迟和缓存命中率——作为与 Z.ai 技术栈相符的依据。接着是两个候选名称,以及一个预测分数:“目前我预计它会叫 GLM 5.3-Vision 或 5.5,在 AA 上的得分约为 61。”
逐项来看。身份声明(不是DeepSeek,匹配GLM)是根据模型服务方式做出的指纹推断,而非模型卡。分数是预期值,不是实测结果。名称只是猜测。该信号之所以比噪音更有价值,在于它与我们已知的Z.ai本月路线图方向一致:GLM-5.3仅以文本形式发布,社区呼声最高的是视觉能力,而多家媒体(经由摩根大通、路透社、CGTN和高盛8月18日的报告)报道GLM-5.5将在“八月之内”到来——本月的收官时刻就是现在。
为什么服务指纹很重要
首令牌延迟(TTFT)和缓存命中率是基础设施层面的特征。它们由服务提供商如何构建其推理栈所决定——包括调度器、缓存布局、批处理策略——而不是由提示词所调用的模型名称决定。当分析师说某个匿名模型的 TTFT 和缓存命中率与 GLM 匹配时,他们是在说其背后的服务栈表现得像 Z.ai 的栈;在没有权重或模型卡的情况下,这几乎就是能得到的最接近指纹的东西。这并非确凿证据。其他厂商可以复刻相同的栈,Z.ai 也可能为合作伙伴托管模型。但这是一个具体且可验证的说法,而“尚未复现”这一提醒表明分析师并没有将其视为定论。
DeepSeek 被排除这一点也很重要。DeepSeek V4 Pro 已于 8 月 13 日正式发布,其 Flash 版本是本月的另一个高速度中国开放权重发布。一个排除 DeepSeek 但指向 GLM 的匿名模型将范围缩小到 Z.ai 的产品线——而 Z.ai 的产品线有两个可能的候选者,这正是该信号所指出的分叉。
第二个信号:服务栈正在为GLM-5注意力机制构建。
8月25日,第二个数据点出现了——这一次完全可核查。vLLM,这个支撑大多数大规模模型服务的推理运行时,收到了编号为 #53785 的拉取请求,标题为“[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions.”。对照仓库验证后,该 PR 为 GLM-5 的注意力几何结构启用了 masked-MHA 预填充路径:64 个头、KV 秩为 512、QK 头维度为 192+64、V 头维度为 256——即 256/256 的 QK/V 布局,正如 PR 描述所述。它依赖于 FlashAttention 的一项支持 256 头维度掩码的更改,暂时将 FlashAttention 固定到一个 fork 提交上(这正是 Do Not Merge 标记的用途),并为新路径添加了经过基准测试的路由阈值:在 TP 1/2/4/8 下,FlashMLA 的纯预填充限制分别为 8K / 20K / 48K / 112K tokens;在 TP8 下,FlashInfer 的限制取整为 64K。作者指出,没有其他未合并的 PR 涉及 GLM-5 的 masked-MHA 支持。
按它本来的样子来读:这是服务栈的底层铺垫,不是一则公告。该 PR 并未点名 GLM 5.5 或 GLM 5.3-Vision——它写的是“GLM-5”——而为 GLM-5 的注意力头维度启用一条 masked-MHA 预填充路径,是对一个模型家族的基础设施工作;vLLM 生态本就已经在通过稀疏-MLA 路径运行这一家族(GLM-5.3 自身的谱系如今就是这样被服务的)。它也不是孤立的:本月还有几个姊妹 PR,分别涉及 FlashInfer 对 GLM-5 的 MLA 维度检查、面向 GLM-5 类模型的 Triton 稀疏-MLA 回退方案,以及 FlashAttention 所报告的维度支持。有两个细节让它始终处于泄漏追踪者的视野之内。其一,它所针对的几何配置——64 个注意力头、KV 秩 512、QK/V 均为 256——与 DeepSeek 的 192/128 截然不同;这与匿名模型指纹所勾勒的“不是 DeepSeek,而是 GLM”的区分一脉相承,如今在注意力内核层面清晰可见。其二,时机:该 PR 于 8 月 25 日开启,正落在整个 8 月都在期待 GLM-5.5 的那个时间窗口之内。以上种种并不能证明那个匿名模型就是新一代 GLM——它同样可能是针对已发布模型所做的工程——但这正是服务生态系统在模型发布前夕会进行的那类幕后活动,而且它的可验证性是任何 X 帖子都无法比拟的。
两个名称,同一个分支:GLM 5.3-Vision 对比 GLM 5.5
这两个候选身份确实是不同的产品,而泄露的信息也无法确定主板上到底是哪一个。
• GLM 5.3-Vision 将是一款具备视觉能力的模型变体,该模型于8月14日发布。GLM-5.3 仅支持文本输入——Artificial Analysis 将其列为纯文本输入、纯文本输出,不支持图像——而这一缺口正是社区最强烈的抱怨。当 Z.ai 的唐杰发起全球反馈活动时,收到的评论几乎一致要求加入视觉能力,而 Z.ai 已经拥有尚未合并进旗舰产品线的构建模块(GLM-5V-Turbo 多模态模型和 CogVLM 编码器)。推出 5.3-Vision 变体将是弥合这一差距的最快方式。
• GLM 5.5 本身就是旗舰。据报道但尚未确认的规格显示,其基础参数量超过一万亿(高于 GLM-5.3 的 743B),延续了 100 万 token 的上下文窗口,开放权重,并更侧重于智能体/编码能力。本月每一份分析师报告都将 5.5 视为重磅之作——Z.ai 联合创始人唐杰曾暗示,这款产品将缩小与 Fable 级闭源模型之间的差距。该产品预计在 8 月内推出,截至本文写作时尚未发布。
相同的指纹无法告诉你这究竟是两者中的哪一个——一个视觉调优的 5.3 和一个全新旗舰可能运行在同一个服务栈上。这种模糊性正是信号的真实状态,分析师帖子中的两个名字只是反映了它,而非解决了它。
img src="2.png" alt="一份两栏对比记分牌,标题为“GLM 5.5 vs GLM-5.3 —— 记分牌”。左栏 GLM 5.5(泄露版):“AA Index ~61(预计,未经证实)”、“状态:未发布”、“规模 >1T 参数(传闻)”、“视觉能力:预期支持”、“上下文长度:1M(预期)”、“价格:待定”。右栏 GLM-5.3(已发布):“AA Index 60”、“状态:API 已于 8 月 19 日上线”、“规模 743B MoE / 40B 激活参数”、“视觉能力:仅文本”、“上下文长度:1M”、“价格:$1.40 / $4.40”。页脚写道:“GLM 5.5 的数据为未经证实的预测;GLM-5.3 数据来自 Artificial Analysis。”" />

AA Intelligence Index上约61分意味着什么
预测分数是这次泄露中最关键的部分。Artificial Analysis Intelligence Index(v4.1.1)目前将GLM-5.3列于60分——与Kimi K3并列开放权重最高分,并领先GLM-5.2的53分7分。再往上1分,即61分,便是GPT-5.6 Sol的区间;Claude Fable 5为62分,Claude Opus 5为63分。通俗地说:GLM家族的一个模型拿到61分,将是该指数上开放权重分数中最高的一个,独自凌驾于Kimi K3和GLM-5.3之上,实际上已触及封闭前沿模型的水平线。
值得强调 61 不是什么。61 是 teortaxesTex 对独立评估将会给出的结果的预期,而不是已发布的 Artificial Analysis 分数,也不是供应商的数字。预测可能在任一方向上出错——视觉变体可能会在偏重文本的指数上损失一两分,而 >1T 的旗舰模型也可能因后训练的表现而落在更高或更低的位置。这个数字的价值在于它所隐含的主张:无论这个匿名模型最终是谁,它都有望击败当前开放权重的领先者,而不仅仅是与之持平。

哪些是已确认的,哪些不是
保持账目干净,因为一份泄密材料的成败完全取决于此。
• 已确认:GLM-5.3 真实存在,8月14日发布,API 于8月18/19日开放,在 AA 智能指数上获得60分(由 Artificial Analysis 独立测量),定价为每100万 token 1.40美元/4.40美元,仅支持文本输入,开放权重确认于8月28日星期五。这些事实并不依赖于泄露信息。
• 已确认:GLM-5.5 仍未发布。截至撰写本文时,没有模型卡、没有定价、也没有可用性;8月的时间窗口和>1T参数规模均为分析师报告的内容,而非Z.ai的承诺。
• 未经证实:匿名模型作为独立产品存在,它是GLM,其名称将是GLM 5.3-Vision或5.5,且其得分为61。这四点全部基于一位分析师的未复现帖子。
• 同样未得到证实的是:这个匿名模型是否真的与 GLM-5.3 本身不同。一个未标记别名的 GLM-5.3 实时端点会产生相同的服务指纹。在名称、模型卡或权重发布解决这个问题之前,"新模型"的解读是强先验,但并非事实。
接下来看什么
• 8月28日(星期五)——GLM-5.3权重。如果匿名模型实际上是更名后的5.3或5.3-Vision,权重发布和模型卡将很快给出定论。
• 第二个佐证性观测。一位分析师认定的指纹只是一个假设;对同一匿名条目的第二次独立解读,或一份指明其身份的 Artificial Analysis 列表,会将其升级为证据。
Z.ai 的任何声明。GLM-5.5 据报道将在八月窗口期发布,而这个月已接近尾声。正式命名、定价页面或 API 更新日志条目,才是将这一泄密变成发布报道的事件。
• AA 分数是否会落实为 61。如果匿名模型真实存在且属于 GLM 系列,那么接近 61 的独立指数分数将是首个突破 60 的开放权重分数。
• vLLM注意力机制的相关工作是否会附带一个模型名称。PR #53785 瞄准了“GLM-5”的注意力头维度,但未提及5.3-Vision或5.5;一次合并、一条受支持模型条目、或一张将该几何配置与具体名称配对的模型卡,将是迄今最有力的信号。
如何应对这样的泄露
泄露是准备的理由,而不是重建平台的理由。如果下一代 GLM 系列模型登上开源权重排行榜榜首或接近榜首,实际问题就是是否将真实流量路由到它——而一个未经证实的模型,只有厂商的说法和某位分析师的预测,正是你需要安全网而不是下赌注的情况。上周发布的 GLM-5.3 已经在 OrcaRouter 上线——模型页面显示价格为每 1M tokens 1.26 美元 / 3.96 美元,这是厂商标价 1.40 美元 / 4.40 美元的基础上打九折的发布优惠,零加价直通——而 5.5 或 5.3-Vision 一旦发布,将直接继承这一路由设置。通过路由器将一部分流量指向新模型,并自动故障转移到经过验证的模型——GLM-5.3、DeepSeek V4 Pro、GPT-5.6 Sol——这样你获得的是自己工作负载上的质量信号,而不是一份幻灯片。如果泄露的预测是对的,你会最先知道;如果不对,故障转移会吸收它,不会有任何损坏的东西上线。同一个密钥,无需第二份合同,也无需在 Z.ai 做出决定之前在这两个候选名称之间做选择。
下一代 GLM 即将到来——唯一悬而未决的问题是它会以哪个名字亮相。GLM 5.3-Vision 将是 Z.ai 为其刚刚发布的模型弥补最受诟病缺憾之举;GLM 5.5 则是整个月都在指向的万亿参数旗舰。teortaxesTex 于 8 月 20 日完成指纹识别的那个匿名条目,是第一个看起来像这两者之一的具体对象;它在 AA Intelligence Index 上的预期得分 61 将使其超越当前榜单上的所有开放权重模型。指纹出现五天后,推理服务栈也有了动作:vLLM 的 GLM-5 注意力相关工作,正是新模型会留下的那种基础铺垫,尽管它没有点名任何变体。这些均未得到证实;一旦名称、模型卡或权重参数给出答案,本页面将立即更新。在那之前,低风险的做法是把路由准备好——而不是把整个技术栈押在一个指纹上。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
