主视觉标题卡:DeepSeek V4.1 Flash vs GLM-5.2 —— 两款 MIT 许可模型,一个无趣的答案
Guides & Insights

DeepSeek V4.1 Flash 对比 GLM-5.2:两个 MIT 模型,一个无聊的答案

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4.1 FlashGLM-5.2属于同一类对象,而这恰恰是大多数对比所忽略的一点。两者都是混合专家模型,都以 MIT 许可发布并提供可下载的权重,都支持一百万 token 的上下文,并且都能通过并非其训练方的厂商所提供的托管 API 使用。GLM-5.2 先一步问世,在发布时以 51 分的成绩成为 Artificial Analysis Index 上得分最高的开放权重模型。DeepSeek V4.1 Flash 于 2026 年 9 月 10 日发布,是 DeepSeek 新架构家族中更小、更新、更便宜的模型。两者之间真正重要的比较,不在于谁更聪明,而在于面对你手头实际的工作,哪一个能跑起来,以及成本是多少。

他们共有的部分,而这占了大部分

从两者的共同点说起,因为它排除了大多数常见的决策标准。如果你要在开放模型和闭源模型之间做选择,你会权衡锁定风险,权衡微调能力,权衡供应商是否会单方面更改条款。这些在这里都不适用。DeepSeek V4.1 Flash 和 GLM-5.2 都是 MIT 许可,权重可以自行拉取和部署。两者都支持 1M token 的输入。两者都是 MoE 架构,这意味着相对于总参数量,它们的运行成本很低,因为每个 token 只有一小部分权重会被激活。

所以,这个比较不是开源与闭源的对立,也不是长上下文与短上下文的对立。它是一组四五个数字,而这些数字在成本上指向一个方向,在成熟度上指向相反方向。

它们实际分歧之处

• 每 100 万 tokens 的价格——DeepSeek V4.1 Flash 非高峰时段为 $0.15 输入 / $0.60 输出,而 GLM-5.2 为 $1.40 输入 / $4.40 输出。这相当于输入价格的 9 倍多,输出价格的 7 倍多。

• 缓存输入 — V4.1 Flash 非高峰时段每 1M 为 $0.003,而 GLM-5.2 每 1M 为 $0.26。近 90 倍,而且是在主导 agent 循环账单的那个计费项上。

• 参数 — V4.1 Flash 总计 552B,输入时激活 8B,输出时激活 16B;而 GLM-5.2 总计约 745B,激活约 40B。GLM-5.2 每个 token 激活的参数约为前者的 2.5 倍。

• 最大输出 — V4.1 Flash 384K tokens,而 GLM-5.2 为 128K tokens。上限是后者的三倍。

• 上下文窗口 — 每个 1M tokens。级别。

• 独立指数得分 —— GLM-5.2 在 Artificial Analysis Index 上得分 51,是其发布时所有开放权重模型中得分最高的。DeepSeek V4.1 Flash 尚未公布该指数得分。

• 观测到的首 token 延迟——基于 OrcaRouter 自身 7 天的遥测数据,V4.1 Flash 在 p50 为 2.63 秒、p95 为 9.05 秒,而 GLM-5.2 在 p50 为 2.36 秒、p95 为 10.00 秒。中位数旗鼓相当。尾部则不然。

价格方向与成熟度方向恰好相反。GLM-5.2 是那个拥有独立评分、且使用记录更长的模型。DeepSeek V4.1 Flash 则是 token 更便宜的那个模型,输入价格只有九分之一,输出上限却是三倍。无论怎么解读这份榜单,都不存在某一个模型能够简单碾压其他模型的情况。

Two-column scoreboard: DeepSeek V4.1 Flash vs GLM-5.2 — price per 1M tokens $0.15 input and $0.60 output vs $1.40 and $4.40, cached input $0.003 vs $0.26, total parameters 552B vs about 745B, active parameters 8B input and 16B output vs about 40B, context window 1M tokens on both, max output 384K tokens vs 128K tokens, Artificial Analysis Index score not yet published vs 51, both MIT-licensed, and a p50 time to first token of 2.63 s vs 2.36 s

尾部是被低估的那条线

大多数开放权重模型的比较都以指数得分为先。相反,延迟遥测才值得关注,但原因并非你所预期:中位数持平。GLM-5.2 的 p50 首 token 时间为 2.36 秒,而 V4.1 Flash 为 2.63 秒,这并不是差距,而是共享网络上的噪声。任何引用更便宜模型在首 token 上具有优势的人,都是看错了百分位数。

p95 正是两者拉开差距的地方,而且其方向与价格差距所暗示的相反。GLM-5.2 的最坏情况等待时间为 10.00 s;V4.1 Flash 的是 9.05 s。这比中位数更重要,因为用户会注意到的请求,正是那些慢请求。一个通常即时响应、偶尔卡顿十秒的工具,会显得不可靠,而一个始终三秒的工具则不会如此;而在一个每轮扇出十个调用的智能体循环中,p95 才是决定这一轮能否在人的耐心耗尽之前完成的数字。GLM-5.2 的长尾并不是缺陷;它是一个更大的模型,每个 token 激活约 400 亿参数,成本该多少就是多少。但这正是该模型更适合异步工作——队列、批处理作业、无人看管的后台智能体——而非请求-响应式接口的原因。

在我们能看到的页面上,两个模型都没有公布吞吐量数字,这一点值得直说,而不是替它们补全。首 token 时间(time to first token)是这两个模型能基于共同数据进行比较的唯一延迟维度,而在这个维度上,诚实的解读是:它们在中位数上持平,在尾部相近。

指数得分能解决什么、不能解决什么

GLM-5.2 在 Artificial Analysis Index 上的 51 分是一个真实、独立生成的数字,也是支持该模型的最有力单一论据。它同时也是一个复合指标:一个聚合了若干评估集的单一数字,这使它既能很好地概括一般能力,又无法很好地预测任何一项具体任务上的表现。一个得 51 分的模型与一个没有公布分数的模型,同一个得 51 分的模型与一个得 40 分的模型,这两者并不相同。

对DeepSeek V4.1 Flash最诚实的判断是:它的独立评测记录还很单薄,而原因在于它太新。它全面开放仅十二天。在它唯一出现的近期第三方横评中——2026年9月21日发布的Agents on Rails智能体编程榜单——它在最大努力设置下得分为17%,处于中游,高于15%的GLM-5.3 Flash,低于23%的Gemini 3.8 Flash。那只是一个衡量单一狭窄维度的榜单,并不能替代Index评分。现在任何声称V4.1 Flash在能力上超过GLM-5.2的人,都是在根据架构和价格做外推,而不是在报告实测结果。

为每一项陈述理由,直白明了

DeepSeek V4.1 Flash 是当工作负载高吞吐、对延迟敏感或输出量大时应当选用的模型。输入价格仅为九分之一,缓存读取价格约为九十分之一,这在每一轮都会重新读取上下文的智能体循环中是一种结构性优势;而 384K 的输出上限与 128K 属于不同类别的产物。如果你的任务是分类、抽取、长结构化生成,或智能体流水线中的高吞吐执行器,那么成本差异并非微不足道——它是可行流水线与不可行流水线之间的差别。

GLM-5.2 是当你需要一项已公开发布、经独立验证的能力指标来为决策提供依据,或者当工作是异步的、最坏情况下十秒的等待根本察觉不到时该选用的模型。它是成熟之选:分数摆在那里,行为已有文档记录,模型在生产环境中运行得足够久,久到其他人已经摸清了它的边界。这具有真正的价值,而价格栏并不能体现这种价值。

在两者都不明显正确的情况下——一个处理混合流量的通用助手——有用的做法不是二选一。而是将大部分流量交给便宜的模型,把昂贵的模型留给真正需要它的请求。

将两者作为一个系统运行

由于这两个模型都是开放权重且都提供托管服务,拆分并路由的模式在这里搭建起来异常便宜,也正是 OrcaRouter 的路由层真正发挥价值的地方,而不是一个硬塞进来的推销点。两个模型都位于单个密钥之后,因此路由决策是配置问题,而不是第二次集成:一条将短小、高吞吐量的请求发送到 DeepSeek V4.1 Flash、将长时间异步任务发送到 GLM-5.2 的规则,只需几行代码,而不是应用代码中的一个分支。

该平台有两个特性对此组合尤为关键。OrcaRouter 以0%加价率传递提供商的目录定价,因此上述数字即供应商自身费率,且DeepSeek的高峰时段安排完全按其定义执行——工作日高峰为UTC 01:00–04:00和06:00–10:00,周末完全为非高峰。对于如此低成本的模型,这是一个值得明确做出的调度决策。此外,路由DSL可将多个模型组合为一次调用,这正是使用两个优势不重叠的开源权重模型的自然方式:廉价者生成,更强者审核,调用方看到单一响应。两条路径背后都设有自动故障转移,当两个模型之一仅发布十二天、其在你数据上的表现尚不可知时,这一点尤为重要。

之所以这是正确的形态,而不是一种折中,是因为这两个模型之间的差异并不落在相互竞争的维度上。一个又快又便宜;另一个有评分,但很慢。同时使用两者的流水线并不是在对冲,而是在按任务选用合适的工具。

Screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model id, 1M-token context, 128K max output, text input and text output, $1.40 input and $4.40 output per 1M tokens, and observed time to first token of 2.36 s at p50 and 10.00 s at p95

看什么

• DeepSeek V4.1 Flash 在 Artificial Analysis Index 上已公布的得分数据。在它问世之前,这两个模型之间的能力对比只是一场争论,而非一次测量——而它正是唯一能为此定论的关键证据。

• GLM-5.2 的延迟表现是否会改善。其 10.00 秒的 p95 是最有可能随着托管服务商优化而变动的数字,而它目前也是这两个模型之间单一实测差异中最大的一项——是尾部等待,而非价格。

• DeepSeek 的高峰时段安排是否会变化。对于每百万输入 token 收费 $0.15 的模型而言,高峰倍率是成本模型中最大的单一变量。

在其中的第一个落地之前,准确的总结是:DeepSeek V4.1 Flash 在输入上大约比 GLM-5.2 便宜九倍,在缓存输入上便宜近九十倍,并且其输出上限是后者的三倍;GLM-5.2 是拥有独立评分和更长历史记录的模型,其首 token 中位数与更便宜的模型持平,尽管其最坏情况并非如此。两者都是 MIT。两者都只差一个密钥。按工作负载选择,而不是按赢家选择。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id with a Featured badge, 1M-token context, 384K max output, text and image input, $0.15 input and $0.60 output per 1M tokens, a cache read rate of $0.003, and a p50 time to first token of 2.63 s

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新