
GLM-5.3-Flash 对比 DeepSeek V4 Flash:该调用哪个高性价比前沿模型?
- google新Google: Gemini 3.8 Flash2026-09-0259智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
前沿级别的智能以往起价是每百万输入 token 五美元;如今两款模型以极低的成本就能提供这种能力,而且它们同处一个预算档位。GLM-5.3-Flash 是智谱 AI 的 18B 激活多模态模型,于 8 月 26 日开源;DeepSeek V4 Flash 是 DeepSeek 在 7 月底投入生产的约 13B 激活智能体编码器。这两款模型共同构成了最有力的论据,证明“用零花钱接近前沿水平”如今已成为一个真实的产品类别。它们之间的差异远超价格标签所显示的那样:一款是采用 MIT 权重、原生多模态的通才模型,另一款则是经过验证、专注于编码与智能体任务、并有独立基准分数背书的专家模型。
对大多数团队来说,简短的回答是:如果你想要一个便宜、开放、多模态的模型作为开发基础,那就选 {{1}}GLM-5.3-Flash{{/1}};如果你想要一个编码模型,并且需要拥有经独立测评、能在会议上拿得出来并站得住脚的智能体(agentic)能力数据,那就选 {{2}}DeepSeek V4 Flash{{/2}}。本页其余部分是推理过程、逐维度计分板和注意事项——先从一条坦诚的说明开始:{{3}}GLM-5.3-Flash{{/3}} 有相当一部分成绩来自厂商自行报告,而 {{4}}DeepSeek V4 Flash{{/4}} 的主打分数则是独立测评得出的。
一次通过的对决
两款模型均采用混合专家(MoE)设计,总参数约3000亿,每token激活参数不足200亿;两者都支持100万token的上下文窗口,且均为开放权重。相似之处仅此而已。GLM-5.3-Flash是智谱GLM-5系列中首款原生多模态模型——支持文本、图像和视频输入——并以MIT许可证发布,意味着你现在就可以自行部署。DeepSeek V4 Flash是DeepSeek自4月以来持续迭代的模型的生产版本;其核心发布聚焦文本与代码,架构针对智能体工具调用进行了优化,视觉能力则单独以实验版形式提供,而非原生支持。在智能指数上,智谱声称Flash得分57分,而DeepSeek V4 Flash的独立测得分为50分——如果这一差距成立,将意义重大,也是值得关注第三方确认的数字。

智能与基准测试
这是来源规范至关重要的部分,因为这两个模型的证据基础差异很大。
• AA智能指数 — GLM-5.3-Flash 得分57(据智谱发布材料,未经复现),而DeepSeek V4 Flash 得分50(由Artificial Analysis独立测量)。作为参照,Claude Opus 4.8在同一指数上接近57,Kimi K3为57。
• SWE-bench Verified — GLM-5.3-Flash 尚未公布得分,而 DeepSeek V4 Flash 为 79.0%(独立评测)。
• LiveCodeBench — 尚无 GLM-5.3-Flash 的公布数据,而 DeepSeek V4 Flash 为 91.6%(独立)。
• Agents' Last Exam — GLM-5.3-Flash 尚未公布成绩,对比 DeepSeek V4 Flash 25.2(独立测试)。
• 编码能力持平声明 — 智谱称 GLM-5.3-Flash 在其内部 Z.ai Code Bench 上的编码表现与 Claude Opus 4.8 相当(厂商报告,未经复现)。
家族背景 — GLM-5.3,Flash 的大哥,独立测得 AA 指数 60;在 Terminal-Bench 2.1 上,智谱自家的 GLM-5.3 系列在社区运行中得分在 83.1–88.2 之间。DeepSeek V4 Flash 的 Terminal-Bench 2.1 得分为 82.7(独立测得)。
这种不对称性正是关键所在:DeepSeek V4 Flash 的编程与智能体(agentic)分数自七月发布以来已获第三方复现,而 GLM-5.3-Flash 的分数则是发布首日的厂商宣称。如果智谱所言属实,GLM-5.3-Flash 的 57 分比 DeepSeek 的 50 分高出七分,但该模型在发布前已接受广泛的匿名测试,独立评分应该很快就会出炉。
编码与智能体:真正的差异化
如果你为代理式编码工作负载购买预算模型,证据基础比原始指数差值更重要。DeepSeek V4 Flash 在生产构建中专门针对代理能力进行了重新后训练,其独立测得的数字——79.0 SWE-bench Verified、91.6 LiveCodeBench、82.7 Terminal-Bench 2.1——是竞争对手目前在廉价层级中被衡量的基准。智谱对 GLM-5.3-Flash 的编程能力声称与 Claude Opus 4.8 在其内部基准上实力相当,这是一个强有力的声明,但还不是独立的声明。
还有一个值得了解的行为差异。社区对 DeepSeek V4 Flash 的报告显示,其思维相对克制——大约 25–45% 的输出 token 为思考 token,输出扩展系数约为 1.3–1.5 倍——这正是其单任务成本较低的原因。智谱尚未公布 GLM-5.3-Flash 的可比冗长度数据,而冗长度正是将廉价费率表变成昂贵任务的那个变量。在 Flash 的实际 token 扩展情况被测量之前,这两者之间的有效单任务成本差距大于单 token 差距。
多模态,还是尚未?
这是最清晰的区别点。GLM-5.3-Flash 原生支持文本之外的图像和视频——这是首款做到这一点的 GLM-5 模型——并且智谱声称其长上下文服务成本约为 GLM-5.3 的三分之一。DeepSeek V4 Flash 的正式发布版本仅包含文本和代码;DeepSeek 的多模态能力存在于一个独立的实验性视觉构建中,这意味着在 DeepSeek 这一侧,视觉工作负载意味着不同的模型端点和不同的评估历史。如果你的流水线今天就需要一个低成本模型来理解图像或视频,那么 GLM-5.3-Flash 是两者中唯一原生提供该功能的。
价格:实际数字
这两款模型在各自的能力区间内都胜过其他所有产品,但推出的时间不同。
• GLM-5.3-Flash — 智谱将其定价为 GLM-5.3 的每百万 tokens 1.40 美元 / 4.40 美元的十分之一,即约为 0.14 美元 / 0.44 美元,限时发布折扣期间则为 0.07 美元 / 0.22 美元。智谱还声称在 AA Intelligence Index 上每个任务约为 0.045 美元。美元数字根据智谱所述的比率推算;该比率本身即为当前事实。
• DeepSeek V4 Flash — 每百万输入 tokens 0.14 美元,每百万输出 tokens 0.28 美元,这是 DeepSeek 公布的官方定价,缓存命中的输入价格则低得多。独立估算的单次测试成本约为每次基准测试 0.03 美元——是榜单上最便宜的主流模型。
• 长上下文 — GLM-5.3-Flash 的长上下文成本约为 GLM-5.3 的三分之一(供应商声称),而 DeepSeek V4 Flash 提供 1M 上下文,价格为 $0.14 / $0.28,最大输出约 393K。
从纸面上看,两个标价几乎持平,折扣让 GLM-5.3-Flash 目前每个 token 更便宜。关键在于,DeepSeek V4 Flash 的每 token 价格稳定,且其冗长度可控;而 Flash 的价格是临时折扣,冗长度也尚未稳定——因此坦率的预测是,实际成本差距比标价差距更小,甚至可能在两者用同一任务集评测后出现逆转。

速度与服务成本
智谱称,在对比的预算级模型中,GLM-5.3-Flash 的注意力计算量最低——所对比的模型包括 GLM-5.3、DeepSeek V4 Flash 和 Kimi K3——其注意力计算量较 GLM-5.3 降低 3.0 倍,KV 缓存降低 4.4 倍,同时承认其 KV 缓存仍略大于 DeepSeek V4 Flash。在服务端,智谱报告称,其端到端服务性能在国产芯片上提升了 3 倍,每 token 成本据称与主流 NVIDIA GPU 相当。以上均为厂商自行报告的数据。相比之下,DeepSeek V4 Flash 的服务经济性已得到验证:自 7 月 31 日起投入生产,是每次测试中运行成本最低的模型之一,且第三方托管商已大规模提供服务一个月。就生产路径而言,经过验证的服务优于前景可期的服务。
你应该打哪个电话?
决策指导,通俗地说:
• 你现在想要开源多模态——GLM-5.3-Flash 是两者中唯一原生支持图像/视频输入的,其 MIT 权重今天已发布在 Hugging Face 上。
• 您想要一款拥有独立数据的编码/智能体模型——DeepSeek V4 Flash 的 SWE-bench Verified 79.0 和 Terminal-Bench 2.1 82.7 已通过第三方验证;GLM-5.3-Flash 的编码声明尚未得到验证。
• 你希望每 token 的成本达到绝对最低——Flash 的发布折扣目前让它略胜一筹,但请将该折扣视为暂时性的。
• 您关注稳定的产出速率——DeepSeek V4 Flash 的 $0.14 / $0.28 自七月以来一直保持稳定;Flash 的定价表是几天前发布的。
• 如果你不确定,想在不签第二份合同的情况下两者都试试——DeepSeek V4 Flash 今天已在 OrcaRouter 上线,按 DeepSeek 官方列表价提供,零加价;该系列的 GLM 一侧(GLM-5.3,Flash 的大兄弟)也已在那里上线,因此一旦 Flash 本身进入名录,这场对决的双方就都归在同一把钥匙后面。在那之前,Flash 在 Hugging Face 上的 MIT 权重是自行测试它的最便宜方式,而自动故障转移到经过验证的模型,则是你既能试用新模型、又不用把生产路径押在它上面的办法。

底线
GLM-5.3-Flash 是更有意思的模型——原生多模态、MIT 许可、其宣称的指数得分足以媲美价格高得多的模型——但它也是缺乏验证的那一个,截至发布日,它的最佳数据均来自厂商自报。DeepSeek V4 Flash 是编码和智能体工作的更稳妥预算之选:独立智能得分较低,但经过实测、可复现,且价格稳定在 $0.14 / $0.28。要想获得它独有的优势——在这个价位上的开放多模态——就买 Flash;而任何你需要基准测试数据背书的场景,就买 DeepSeek V4 Flash。真正悬而未决的问题——未来两周将见分晓——是 Flash 的 57 分能否经得起独立测评的检验。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
