GLM-5.3-Flash 对比 DeepSeek V4 Flash — 你应该调用哪款平价前沿模型?重新生成的插图。
Guides & Insights

GLM-5.3-Flash 对比 DeepSeek V4 Flash:该调用哪个高性价比前沿模型?

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

前沿级别的智能以往起价是每百万输入 token 五美元;如今两款模型以极低的成本就能提供这种能力,而且它们同处一个预算档位。GLM-5.3-Flash 是智谱 AI 的 18B 激活多模态模型,于 8 月 26 日开源;DeepSeek V4 FlashDeepSeek 在 7 月底投入生产的约 13B 激活智能体编码器。这两款模型共同构成了最有力的论据,证明“用零花钱接近前沿水平”如今已成为一个真实的产品类别。它们之间的差异远超价格标签所显示的那样:一款是采用 MIT 权重、原生多模态的通才模型,另一款则是经过验证、专注于编码与智能体任务、并有独立基准分数背书的专家模型。

对大多数团队来说,简短的回答是:如果你想要一个便宜、开放、多模态的模型作为开发基础,那就选 {{1}}GLM-5.3-Flash{{/1}};如果你想要一个编码模型,并且需要拥有经独立测评、能在会议上拿得出来并站得住脚的智能体(agentic)能力数据,那就选 {{2}}DeepSeek V4 Flash{{/2}}。本页其余部分是推理过程、逐维度计分板和注意事项——先从一条坦诚的说明开始:{{3}}GLM-5.3-Flash{{/3}} 有相当一部分成绩来自厂商自行报告,而 {{4}}DeepSeek V4 Flash{{/4}} 的主打分数则是独立测评得出的。

一次通过的对决

两款模型均采用混合专家(MoE)设计,总参数约3000亿,每token激活参数不足200亿;两者都支持100万token的上下文窗口,且均为开放权重。相似之处仅此而已。GLM-5.3-Flash是智谱GLM-5系列中首款原生多模态模型——支持文本、图像和视频输入——并以MIT许可证发布,意味着你现在就可以自行部署。DeepSeek V4 Flash是DeepSeek自4月以来持续迭代的模型的生产版本;其核心发布聚焦文本与代码,架构针对智能体工具调用进行了优化,视觉能力则单独以实验版形式提供,而非原生支持。在智能指数上,智谱声称Flash得分57分,而DeepSeek V4 Flash的独立测得分为50分——如果这一差距成立,将意义重大,也是值得关注第三方确认的数字。

A generated two-column scoreboard titled 'GLM-5.3-Flash vs DeepSeek V4 Flash — the scoreboard'. Left column GLM-5.3-Flash: AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, Price ~$0.14/$0.44 (discount ~$0.07/$0.22). Right column DeepSeek V4 Flash: AA Index 50 (independent), Active params ~13B, Context 1M tokens, Modality text (vision in exp build), Open weights yes, Price $0.14/$0.28. Footer: GLM figures vendor-reported; DeepSeek figures independently measured where noted.

智能与基准测试

这是来源规范至关重要的部分,因为这两个模型的证据基础差异很大。

• AA智能指数 — GLM-5.3-Flash 得分57(据智谱发布材料,未经复现),而DeepSeek V4 Flash 得分50(由Artificial Analysis独立测量)。作为参照,Claude Opus 4.8在同一指数上接近57,Kimi K3为57。

• SWE-bench Verified — GLM-5.3-Flash 尚未公布得分,而 DeepSeek V4 Flash 为 79.0%(独立评测)。

• LiveCodeBench — 尚无 GLM-5.3-Flash 的公布数据,而 DeepSeek V4 Flash 为 91.6%(独立)。

• Agents' Last Exam — GLM-5.3-Flash 尚未公布成绩,对比 DeepSeek V4 Flash 25.2(独立测试)。

• 编码能力持平声明 — 智谱称 GLM-5.3-Flash 在其内部 Z.ai Code Bench 上的编码表现与 Claude Opus 4.8 相当(厂商报告,未经复现)。

家族背景 — GLM-5.3,Flash 的大哥,独立测得 AA 指数 60;在 Terminal-Bench 2.1 上,智谱自家的 GLM-5.3 系列在社区运行中得分在 83.1–88.2 之间。DeepSeek V4 Flash 的 Terminal-Bench 2.1 得分为 82.7(独立测得)。

这种不对称性正是关键所在:DeepSeek V4 Flash 的编程与智能体(agentic)分数自七月发布以来已获第三方复现,而 GLM-5.3-Flash 的分数则是发布首日的厂商宣称。如果智谱所言属实,GLM-5.3-Flash 的 57 分比 Deep​Seek 的 50 分高出七分,但该模型在发布前已接受广泛的匿名测试,独立评分应该很快就会出炉。

编码与智能体:真正的差异化

如果你为代理式编码工作负载购买预算模型,证据基础比原始指数差值更重要。DeepSeek V4 Flash 在生产构建中专门针对代理能力进行了重新后训练,其独立测得的数字——79.0 SWE-bench Verified、91.6 LiveCodeBench、82.7 Terminal-Bench 2.1——是竞争对手目前在廉价层级中被衡量的基准。智谱对 GLM-5.3-Flash 的编程能力声称与 Claude Opus 4.8 在其内部基准上实力相当,这是一个强有力的声明,但还不是独立的声明。

还有一个值得了解的行为差异。社区对 DeepSeek V4 Flash 的报告显示,其思维相对克制——大约 25–45% 的输出 token 为思考 token,输出扩展系数约为 1.3–1.5 倍——这正是其单任务成本较低的原因。智谱尚未公布 GLM-5.3-Flash 的可比冗长度数据,而冗长度正是将廉价费率表变成昂贵任务的那个变量。在 Flash 的实际 token 扩展情况被测量之前,这两者之间的有效单任务成本差距大于单 token 差距。

多模态,还是尚未?

这是最清晰的区别点。GLM-5.3-Flash 原生支持文本之外的图像和视频——这是首款做到这一点的 GLM-5 模型——并且智谱声称其长上下文服务成本约为 GLM-5.3 的三分之一。DeepSeek V4 Flash 的正式发布版本仅包含文本和代码;Deep​Seek 的多模态能力存在于一个独立的实验性视觉构建中,这意味着在 Deep​Seek 这一侧,视觉工作负载意味着不同的模型端点和不同的评估历史。如果你的流水线今天就需要一个低成本模型来理解图像或视频,那么 GLM-5.3-Flash 是两者中唯一原生提供该功能的。

价格:实际数字

这两款模型在各自的能力区间内都胜过其他所有产品,但推出的时间不同。

• GLM-5.3-Flash — 智谱将其定价为 GLM-5.3 的每百万 tokens 1.40 美元 / 4.40 美元的十分之一,即约为 0.14 美元 / 0.44 美元,限时发布折扣期间则为 0.07 美元 / 0.22 美元。智谱还声称在 AA Intelligence Index 上每个任务约为 0.045 美元。美元数字根据智谱所述的比率推算;该比率本身即为当前事实。

• DeepSeek V4 Flash — 每百万输入 tokens 0.14 美元,每百万输出 tokens 0.28 美元,这是 DeepSeek 公布的官方定价,缓存命中的输入价格则低得多。独立估算的单次测试成本约为每次基准测试 0.03 美元——是榜单上最便宜的主流模型。

• 长上下文 — GLM-5.3-Flash 的长上下文成本约为 GLM-5.3 的三分之一(供应商声称),而 DeepSeek V4 Flash 提供 1M 上下文,价格为 $0.14 / $0.28,最大输出约 393K。

从纸面上看,两个标价几乎持平,折扣让 GLM-5.3-Flash 目前每个 token 更便宜。关键在于,DeepSeek V4 Flash 的每 token 价格稳定,且其冗长度可控;而 Flash 的价格是临时折扣,冗长度也尚未稳定——因此坦率的预测是,实际成本差距比标价差距更小,甚至可能在两者用同一任务集评测后出现逆转。

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

速度与服务成本

智谱称,在对比的预算级模型中,GLM-5.3-Flash 的注意力计算量最低——所对比的模型包括 GLM-5.3、DeepSeek V4 Flash 和 Kimi K3——其注意力计算量较 GLM-5.3 降低 3.0 倍,KV 缓存降低 4.4 倍,同时承认其 KV 缓存仍略大于 DeepSeek V4 Flash。在服务端,智谱报告称,其端到端服务性能在国产芯片上提升了 3 倍,每 token 成本据称与主流 NVIDIA GPU 相当。以上均为厂商自行报告的数据。相比之下,DeepSeek V4 Flash 的服务经济性已得到验证:自 7 月 31 日起投入生产,是每次测试中运行成本最低的模型之一,且第三方托管商已大规模提供服务一个月。就生产路径而言,经过验证的服务优于前景可期的服务。

你应该打哪个电话?

决策指导,通俗地说:

• 你现在想要开源多模态——GLM-5.3-Flash 是两者中唯一原生支持图像/视频输入的,其 MIT 权重今天已发布在 Hugging Face 上。

• 您想要一款拥有独立数据的编码/智能体模型——DeepSeek V4 Flash 的 SWE-bench Verified 79.0 和 Terminal-Bench 2.1 82.7 已通过第三方验证;GLM-5.3-Flash 的编码声明尚未得到验证。

• 你希望每 token 的成本达到绝对最低——Flash 的发布折扣目前让它略胜一筹,但请将该折扣视为暂时性的。

• 您关注稳定的产出速率——DeepSeek V4 Flash 的 $0.14 / $0.28 自七月以来一直保持稳定;Flash 的定价表是几天前发布的。

• 如果你不确定,想在不签第二份合同的情况下两者都试试——DeepSeek V4 Flash 今天已在 OrcaRouter 上线,按 DeepSeek 官方列表价提供,零加价;该系列的 GLM 一侧(GLM-5.3,Flash 的大兄弟)也已在那里上线,因此一旦 Flash 本身进入名录,这场对决的双方就都归在同一把钥匙后面。在那之前,Flash 在 Hugging Face 上的 MIT 权重是自行测试它的最便宜方式,而自动故障转移到经过验证的模型,则是你既能试用新模型、又不用把生产路径押在它上面的办法。

A screenshot of the OrcaRouter model page for DeepSeek V4 Flash showing the model id, a 1,000,000-token context window, the current per-1M input and output rates, and the tools, JSON and reasoning capability chips.

底线

GLM-5.3-Flash 是更有意思的模型——原生多模态、MIT 许可、其宣称的指数得分足以媲美价格高得多的模型——但它也是缺乏验证的那一个,截至发布日,它的最佳数据均来自厂商自报。DeepSeek V4 Flash 是编码和智能体工作的更稳妥预算之选:独立智能得分较低,但经过实测、可复现,且价格稳定在 $0.14 / $0.28。要想获得它独有的优势——在这个价位上的开放多模态——就买 Flash;而任何你需要基准测试数据背书的场景,就买 DeepSeek V4 Flash。真正悬而未决的问题——未来两周将见分晓——是 Flash 的 57 分能否经得起独立测评的检验。

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube