
DeepSeek V4.1 Flash 对比 GLM-5.2:两个 MIT 模型,一个无聊的答案
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
DeepSeek V4.1 Flash 与 GLM-5.2属于同一类对象,而这恰恰是大多数对比所忽略的一点。两者都是混合专家模型,都以 MIT 许可发布并提供可下载的权重,都支持一百万 token 的上下文,并且都能通过并非其训练方的厂商所提供的托管 API 使用。GLM-5.2 先一步问世,在发布时以 51 分的成绩成为 Artificial Analysis Index 上得分最高的开放权重模型。DeepSeek V4.1 Flash 于 2026 年 9 月 10 日发布,是 DeepSeek 新架构家族中更小、更新、更便宜的模型。两者之间真正重要的比较,不在于谁更聪明,而在于面对你手头实际的工作,哪一个能跑起来,以及成本是多少。
他们共有的部分,而这占了大部分
从两者的共同点说起,因为它排除了大多数常见的决策标准。如果你要在开放模型和闭源模型之间做选择,你会权衡锁定风险,权衡微调能力,权衡供应商是否会单方面更改条款。这些在这里都不适用。DeepSeek V4.1 Flash 和 GLM-5.2 都是 MIT 许可,权重可以自行拉取和部署。两者都支持 1M token 的输入。两者都是 MoE 架构,这意味着相对于总参数量,它们的运行成本很低,因为每个 token 只有一小部分权重会被激活。
所以,这个比较不是开源与闭源的对立,也不是长上下文与短上下文的对立。它是一组四五个数字,而这些数字在成本上指向一个方向,在成熟度上指向相反方向。
它们实际分歧之处
• 每 100 万 tokens 的价格——DeepSeek V4.1 Flash 非高峰时段为 $0.15 输入 / $0.60 输出,而 GLM-5.2 为 $1.40 输入 / $4.40 输出。这相当于输入价格的 9 倍多,输出价格的 7 倍多。
• 缓存输入 — V4.1 Flash 非高峰时段每 1M 为 $0.003,而 GLM-5.2 每 1M 为 $0.26。近 90 倍,而且是在主导 agent 循环账单的那个计费项上。
• 参数 — V4.1 Flash 总计 552B,输入时激活 8B,输出时激活 16B;而 GLM-5.2 总计约 745B,激活约 40B。GLM-5.2 每个 token 激活的参数约为前者的 2.5 倍。
• 最大输出 — V4.1 Flash 384K tokens,而 GLM-5.2 为 128K tokens。上限是后者的三倍。
• 上下文窗口 — 每个 1M tokens。级别。
• 独立指数得分 —— GLM-5.2 在 Artificial Analysis Index 上得分 51,是其发布时所有开放权重模型中得分最高的。DeepSeek V4.1 Flash 尚未公布该指数得分。
• 观测到的首 token 延迟——基于 OrcaRouter 自身 7 天的遥测数据,V4.1 Flash 在 p50 为 2.63 秒、p95 为 9.05 秒,而 GLM-5.2 在 p50 为 2.36 秒、p95 为 10.00 秒。中位数旗鼓相当。尾部则不然。
价格方向与成熟度方向恰好相反。GLM-5.2 是那个拥有独立评分、且使用记录更长的模型。DeepSeek V4.1 Flash 则是 token 更便宜的那个模型,输入价格只有九分之一,输出上限却是三倍。无论怎么解读这份榜单,都不存在某一个模型能够简单碾压其他模型的情况。

尾部是被低估的那条线
大多数开放权重模型的比较都以指数得分为先。相反,延迟遥测才值得关注,但原因并非你所预期:中位数持平。GLM-5.2 的 p50 首 token 时间为 2.36 秒,而 V4.1 Flash 为 2.63 秒,这并不是差距,而是共享网络上的噪声。任何引用更便宜模型在首 token 上具有优势的人,都是看错了百分位数。
p95 正是两者拉开差距的地方,而且其方向与价格差距所暗示的相反。GLM-5.2 的最坏情况等待时间为 10.00 s;V4.1 Flash 的是 9.05 s。这比中位数更重要,因为用户会注意到的请求,正是那些慢请求。一个通常即时响应、偶尔卡顿十秒的工具,会显得不可靠,而一个始终三秒的工具则不会如此;而在一个每轮扇出十个调用的智能体循环中,p95 才是决定这一轮能否在人的耐心耗尽之前完成的数字。GLM-5.2 的长尾并不是缺陷;它是一个更大的模型,每个 token 激活约 400 亿参数,成本该多少就是多少。但这正是该模型更适合异步工作——队列、批处理作业、无人看管的后台智能体——而非请求-响应式接口的原因。
在我们能看到的页面上,两个模型都没有公布吞吐量数字,这一点值得直说,而不是替它们补全。首 token 时间(time to first token)是这两个模型能基于共同数据进行比较的唯一延迟维度,而在这个维度上,诚实的解读是:它们在中位数上持平,在尾部相近。
指数得分能解决什么、不能解决什么
GLM-5.2 在 Artificial Analysis Index 上的 51 分是一个真实、独立生成的数字,也是支持该模型的最有力单一论据。它同时也是一个复合指标:一个聚合了若干评估集的单一数字,这使它既能很好地概括一般能力,又无法很好地预测任何一项具体任务上的表现。一个得 51 分的模型与一个没有公布分数的模型,同一个得 51 分的模型与一个得 40 分的模型,这两者并不相同。
对DeepSeek V4.1 Flash最诚实的判断是:它的独立评测记录还很单薄,而原因在于它太新。它全面开放仅十二天。在它唯一出现的近期第三方横评中——2026年9月21日发布的Agents on Rails智能体编程榜单——它在最大努力设置下得分为17%,处于中游,高于15%的GLM-5.3 Flash,低于23%的Gemini 3.8 Flash。那只是一个衡量单一狭窄维度的榜单,并不能替代Index评分。现在任何声称V4.1 Flash在能力上超过GLM-5.2的人,都是在根据架构和价格做外推,而不是在报告实测结果。
为每一项陈述理由,直白明了
DeepSeek V4.1 Flash 是当工作负载高吞吐、对延迟敏感或输出量大时应当选用的模型。输入价格仅为九分之一,缓存读取价格约为九十分之一,这在每一轮都会重新读取上下文的智能体循环中是一种结构性优势;而 384K 的输出上限与 128K 属于不同类别的产物。如果你的任务是分类、抽取、长结构化生成,或智能体流水线中的高吞吐执行器,那么成本差异并非微不足道——它是可行流水线与不可行流水线之间的差别。
GLM-5.2 是当你需要一项已公开发布、经独立验证的能力指标来为决策提供依据,或者当工作是异步的、最坏情况下十秒的等待根本察觉不到时该选用的模型。它是成熟之选:分数摆在那里,行为已有文档记录,模型在生产环境中运行得足够久,久到其他人已经摸清了它的边界。这具有真正的价值,而价格栏并不能体现这种价值。
在两者都不明显正确的情况下——一个处理混合流量的通用助手——有用的做法不是二选一。而是将大部分流量交给便宜的模型,把昂贵的模型留给真正需要它的请求。
将两者作为一个系统运行
由于这两个模型都是开放权重且都提供托管服务,拆分并路由的模式在这里搭建起来异常便宜,也正是 OrcaRouter 的路由层真正发挥价值的地方,而不是一个硬塞进来的推销点。两个模型都位于单个密钥之后,因此路由决策是配置问题,而不是第二次集成:一条将短小、高吞吐量的请求发送到 DeepSeek V4.1 Flash、将长时间异步任务发送到 GLM-5.2 的规则,只需几行代码,而不是应用代码中的一个分支。
该平台有两个特性对此组合尤为关键。OrcaRouter 以0%加价率传递提供商的目录定价,因此上述数字即供应商自身费率,且DeepSeek的高峰时段安排完全按其定义执行——工作日高峰为UTC 01:00–04:00和06:00–10:00,周末完全为非高峰。对于如此低成本的模型,这是一个值得明确做出的调度决策。此外,路由DSL可将多个模型组合为一次调用,这正是使用两个优势不重叠的开源权重模型的自然方式:廉价者生成,更强者审核,调用方看到单一响应。两条路径背后都设有自动故障转移,当两个模型之一仅发布十二天、其在你数据上的表现尚不可知时,这一点尤为重要。
之所以这是正确的形态,而不是一种折中,是因为这两个模型之间的差异并不落在相互竞争的维度上。一个又快又便宜;另一个有评分,但很慢。同时使用两者的流水线并不是在对冲,而是在按任务选用合适的工具。

看什么
• DeepSeek V4.1 Flash 在 Artificial Analysis Index 上已公布的得分数据。在它问世之前,这两个模型之间的能力对比只是一场争论,而非一次测量——而它正是唯一能为此定论的关键证据。
• GLM-5.2 的延迟表现是否会改善。其 10.00 秒的 p95 是最有可能随着托管服务商优化而变动的数字,而它目前也是这两个模型之间单一实测差异中最大的一项——是尾部等待,而非价格。
• DeepSeek 的高峰时段安排是否会变化。对于每百万输入 token 收费 $0.15 的模型而言,高峰倍率是成本模型中最大的单一变量。
在其中的第一个落地之前,准确的总结是:DeepSeek V4.1 Flash 在输入上大约比 GLM-5.2 便宜九倍,在缓存输入上便宜近九十倍,并且其输出上限是后者的三倍;GLM-5.2 是拥有独立评分和更长历史记录的模型,其首 token 中位数与更便宜的模型持平,尽管其最坏情况并非如此。两者都是 MIT。两者都只差一个密钥。按工作负载选择,而不是按赢家选择。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
