一张用于 Gemini 3.7 Flash 与 DeepSeek V4 Flash 对比的标题卡,展示两道闪电:一个标有 Gemini 3.7 Flash 的封闭锁箱,带有 $0.75 / $3.75 标签;以及一个带有下载箭头的开放盒子,标有 DeepSeek V4 Flash,带有 $0.14 / $0.28 标签。
Guides & Insights

Gemini 3.7 Flash 对比 DeepSeek V4 Flash:两款"Flash"模型,对同一问题给出相反答案

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年命名最令人困惑的两款模型都叫Flash,但它们在回答同一个问题时给出的答案却大相径庭。Gemini 3.7 Flash于2026年8月13日发布,是{{1}}Go​ogle{{/1}}的封闭式主力模型:每秒约340个输出token,智能指数56,推广价格为每百万输入token 0.75美元、每百万输出token 3.75美元。{{2}}Deep​Seek{{/2}} V4 Flash是{{3}}Deep​Seek{{/3}} V4家族中开放权重的那一半,4月发布,7月底更新:采用MIT许可证,可下载,在{{4}}Deep​Seek{{/4}}自家API上,每百万输入token定价0.14美元、每百万输出token定价0.28美元——约为{{5}}Go​ogle{{/5}}推广输入价的五分之一、输出价的十三分之一。两者都是“flash”模型,旨在为高吞吐量工作负载提供快速、廉价的解决方案。而它们的相似之处,也就只剩下这个词了。

它们给出不同答案的那个问题,正是定义这一代人的问题:智能是租来的,还是归你所有?DeepSeek V4 Flash 是一个2840亿参数的混合专家模型,每个 token 约有130亿参数被激活,支持100万 token 的上下文窗口和38.4万 token 的输出上限,以 MIT 许可证发布——权重文件约160GB,7月31日的更新(V4-Flash-0731)实质性地增强了智能体能力。Gemini 3.7 Flash 是基于 Gemini 3.6 Flash 构建的专有模型,支持100万上下文、6.4万输出上限、多模态输入,且无法自行托管。这两个模型中,有一个可以离线部署、微调,并在你自己的硬件上运行;另一个则只能在 Google 运行它的地方运行。

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

两个闪电侠,并肩而立

这两款模型瞄准的是同一类买家——无法承受旗舰级每 token 成本的高吞吐量生产工作负载——但它们采用了截然相反的架构。DeepSeek V4 Flash 的混合注意力机制(压缩稀疏注意力加上高度压缩注意力)使其 1M 上下文在这样的价格下依然经济;它就是 DeepSeek 的旧版 `deepseek-chat` 和 `deepseek-reasoner` 端点所指向的模型,这两个端点已于 7 月退役。Gemini 3.7 Flash 是 Google 对其 Flash 产品线进行的算法精进,其优势在于服务吞吐量:独立测量显示其速度约为 340 tokens/s,而 DeepSeek V4 Flash 约为 113 tokens/s;并且它在接收音频和视频输入的同时仍能达到这一速度,而 DeepSeek V4 Flash 不支持这些输入。

Intelligence Index——Gemini 3.7 Flash 为 56,DeepSeek V4 Flash 为 50,数据来自 Artificial Analysis。

输出速度 — ~340 tokens/s对比~113 tokens/s,两项数据均来自Artificial Analysis。

上下文窗口 — 两者均为 1M tokens;DeepSeek V4 Flash 最多输出 384K,而 Gemini 3.7 Flash 为 64K。

输入价格 — $0.75(促销价,持续至2026年),而Deep​Seek自家API为$0.14。

输出价格 — $3.75(促销价)对比 $0.28。

权重——专有的与MIT许可且可下载的对比。

A comparison scoreboard for Gemini 3.7 Flash and DeepSeek V4 Flash: Gemini 3.7 Flash leads 56 to 50 on the AA Index and ~340 to ~113 tokens per second, while DeepSeek V4 Flash leads 384K to 64K on max output, $0.14 to $0.75 on input and $0.28 to $3.75 on output, with both at 1M context and proprietary weights against MIT open weights.

六个指数点实际上能买到什么

六分的Index差距具有意义,但并非天壤之别,而且它主要集中在DeepSeek V4 Flash未被优化的领域。Gemini 3.7 Flash报告的智能体编码成绩(DeepSWE v1.1上65.3,FrontierCode 1.1 Main上43.6,均为供应商报告)遥遥领先,其网页开发Elo(1588,同样为供应商报告)反映了真实的UI生成改进。DeepSeek V4 Flash自己报告的数据——SWE-bench Verified上79.0,LiveCodeBench上91.6,τ²-Bench得分95.0(独立追踪机构也证实)——在有界编码和工具使用方面表现稳健,其100万上下文的检索能力(MRCR上78.7,CorpusQA上60.5)在其价格级别中具有竞争力。规律是:Gemini 3.7 Flash在智能体深度和网页工作方面领先;DeepSeek V4 Flash则是用这些换来了原始token经济性和长上下文上限——这是任何闭源主力模型都无法匹敌的。

开放权重改变的是采购方式,而不仅仅是价格。

MIT 许可证是这次对比中基准测试表无法呈现的部分。DeepSeek V4 Flash 可以下载并在自有硬件上运行,使用自有数据微调,也能在禁止 API 调用的环境中使用——而且该许可证没有基于规模的限制,因此你的业务无论如何增长,条款都不会改变。实际成本在于运营层面:要以生产团队期望的速度运行一个 284B MoE 模型,需要实打实的 GPU 库存,而对大多数团队来说,诚实的选择是托管 API。这正是价格差距真正发挥作用的地方:即便是托管路线,$0.14 / $0.28 的价格也足够便宜,足以成为长尾流量的默认选择。Gemini 3.7 Flash 不提供任何所有权路径——你买到的是一个可靠托管、快速的多模态服务,附赠促销价格标签,以及一月份的价格悬崖。

用量账单

在同一天对两者运行:2000万输入token和400万输出token。在DeepSeek V4 Flash自己的API上,费用为$2.80 + $1.12,约$3.92。在Gemini 3.7 Flash的促销费率下,费用为$15 + $15,约$30——即使Google正在打折,差距也达到7.6倍。2027年1月1日之后,当Gemini 3.7 Flash恢复到$1.50 / $7.50的价格时,同一天的费用约为$58,是DeepSeek的15倍。在交互式工作负载中,速度优势部分抵消了这一差距——更快的token意味着更少的并发请求——但在批处理和后台工作中,开源模型在账单上毫无悬念地胜出。这两个模型瞄准的甚至不是同一条成本曲线,而这正是全部关键所在。

The OrcaRouter model page for DeepSeek V4 Flash, showing the ~$0.15 per million input and ~$0.29 per million output pass-through pricing, a 1M-token context window with 384K max output, and the text-only 284B-total / 13B-active mixture-of-experts description.

谁应该在哪个之上构建

当每 token 成本成为硬性约束时,当你需要高达 384K 的长输出时,当你需要自托管或物理隔离部署选项时,或者当你在构建一个利润率无法承受旗舰级定价的 token 的产品时,请选择 DeepSeek V4 Flash。当你需要在交互循环中获得速度、需要多模态输入、需要 Go​ogle 的托管可靠性,或需要 Go​ogle 所报告的更强智能体编码结果时——并且当你认可促销价只是暂时的——请选择 Gemini 3.7 Flash。它们并非像两款旗舰那样互为对手;它们是顶着同一个名字的两种不同采购策略。路由层就是两种策略的交汇之处:DeepSeek V4 Flash 已在 OrcaRouter 上线,按 Deep​Seek 的目录价提供,0% 加价;故障转移模式天然契合这种配对——一条规则让大部分流量走 V4 Flash,并将困难子集升级到更强的闭源模型,而 Gemini 3.7 Flash 则可在同一路由器的另一条支路上通过 Go​ogle 自己的 Gemini API 触达。

诚实的解读

如果你可以自托管,或者你纯粹是成本驱动型的,那么 DeepSeek V4 Flash 是更值得构建的模型,而且其许可证让你无需再重新考虑这个决定。如果你需要 Google 的推理速度、多模态输入,或者传闻中的智能体编码优势,那么 Gemini 3.7 Flash 在促销期内是更好的服务——而一月份价格翻倍已经列在日程上了。两个模型,同一个名字,市场将看到未来一年的流量会向哪种理念投票。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新