
Gemini 3.7 Flash 对比 DeepSeek V4 Flash:两款"Flash"模型,对同一问题给出相反答案
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年命名最令人困惑的两款模型都叫Flash,但它们在回答同一个问题时给出的答案却大相径庭。Gemini 3.7 Flash于2026年8月13日发布,是{{1}}Google{{/1}}的封闭式主力模型:每秒约340个输出token,智能指数56,推广价格为每百万输入token 0.75美元、每百万输出token 3.75美元。{{2}}DeepSeek{{/2}} V4 Flash是{{3}}DeepSeek{{/3}} V4家族中开放权重的那一半,4月发布,7月底更新:采用MIT许可证,可下载,在{{4}}DeepSeek{{/4}}自家API上,每百万输入token定价0.14美元、每百万输出token定价0.28美元——约为{{5}}Google{{/5}}推广输入价的五分之一、输出价的十三分之一。两者都是“flash”模型,旨在为高吞吐量工作负载提供快速、廉价的解决方案。而它们的相似之处,也就只剩下这个词了。
它们给出不同答案的那个问题,正是定义这一代人的问题:智能是租来的,还是归你所有?DeepSeek V4 Flash 是一个2840亿参数的混合专家模型,每个 token 约有130亿参数被激活,支持100万 token 的上下文窗口和38.4万 token 的输出上限,以 MIT 许可证发布——权重文件约160GB,7月31日的更新(V4-Flash-0731)实质性地增强了智能体能力。Gemini 3.7 Flash 是基于 Gemini 3.6 Flash 构建的专有模型,支持100万上下文、6.4万输出上限、多模态输入,且无法自行托管。这两个模型中,有一个可以离线部署、微调,并在你自己的硬件上运行;另一个则只能在 Google 运行它的地方运行。

两个闪电侠,并肩而立
这两款模型瞄准的是同一类买家——无法承受旗舰级每 token 成本的高吞吐量生产工作负载——但它们采用了截然相反的架构。DeepSeek V4 Flash 的混合注意力机制(压缩稀疏注意力加上高度压缩注意力)使其 1M 上下文在这样的价格下依然经济;它就是 DeepSeek 的旧版 `deepseek-chat` 和 `deepseek-reasoner` 端点所指向的模型,这两个端点已于 7 月退役。Gemini 3.7 Flash 是 Google 对其 Flash 产品线进行的算法精进,其优势在于服务吞吐量:独立测量显示其速度约为 340 tokens/s,而 DeepSeek V4 Flash 约为 113 tokens/s;并且它在接收音频和视频输入的同时仍能达到这一速度,而 DeepSeek V4 Flash 不支持这些输入。
• Intelligence Index——Gemini 3.7 Flash 为 56,DeepSeek V4 Flash 为 50,数据来自 Artificial Analysis。
• 输出速度 — ~340 tokens/s对比~113 tokens/s,两项数据均来自Artificial Analysis。
• 上下文窗口 — 两者均为 1M tokens;DeepSeek V4 Flash 最多输出 384K,而 Gemini 3.7 Flash 为 64K。
• 输入价格 — $0.75(促销价,持续至2026年),而DeepSeek自家API为$0.14。
• 输出价格 — $3.75(促销价)对比 $0.28。
• 权重——专有的与MIT许可且可下载的对比。

六个指数点实际上能买到什么
六分的Index差距具有意义,但并非天壤之别,而且它主要集中在DeepSeek V4 Flash未被优化的领域。Gemini 3.7 Flash报告的智能体编码成绩(DeepSWE v1.1上65.3,FrontierCode 1.1 Main上43.6,均为供应商报告)遥遥领先,其网页开发Elo(1588,同样为供应商报告)反映了真实的UI生成改进。DeepSeek V4 Flash自己报告的数据——SWE-bench Verified上79.0,LiveCodeBench上91.6,τ²-Bench得分95.0(独立追踪机构也证实)——在有界编码和工具使用方面表现稳健,其100万上下文的检索能力(MRCR上78.7,CorpusQA上60.5)在其价格级别中具有竞争力。规律是:Gemini 3.7 Flash在智能体深度和网页工作方面领先;DeepSeek V4 Flash则是用这些换来了原始token经济性和长上下文上限——这是任何闭源主力模型都无法匹敌的。
开放权重改变的是采购方式,而不仅仅是价格。
MIT 许可证是这次对比中基准测试表无法呈现的部分。DeepSeek V4 Flash 可以下载并在自有硬件上运行,使用自有数据微调,也能在禁止 API 调用的环境中使用——而且该许可证没有基于规模的限制,因此你的业务无论如何增长,条款都不会改变。实际成本在于运营层面:要以生产团队期望的速度运行一个 284B MoE 模型,需要实打实的 GPU 库存,而对大多数团队来说,诚实的选择是托管 API。这正是价格差距真正发挥作用的地方:即便是托管路线,$0.14 / $0.28 的价格也足够便宜,足以成为长尾流量的默认选择。Gemini 3.7 Flash 不提供任何所有权路径——你买到的是一个可靠托管、快速的多模态服务,附赠促销价格标签,以及一月份的价格悬崖。
用量账单
在同一天对两者运行:2000万输入token和400万输出token。在DeepSeek V4 Flash自己的API上,费用为$2.80 + $1.12,约$3.92。在Gemini 3.7 Flash的促销费率下,费用为$15 + $15,约$30——即使Google正在打折,差距也达到7.6倍。2027年1月1日之后,当Gemini 3.7 Flash恢复到$1.50 / $7.50的价格时,同一天的费用约为$58,是DeepSeek的15倍。在交互式工作负载中,速度优势部分抵消了这一差距——更快的token意味着更少的并发请求——但在批处理和后台工作中,开源模型在账单上毫无悬念地胜出。这两个模型瞄准的甚至不是同一条成本曲线,而这正是全部关键所在。

谁应该在哪个之上构建
当每 token 成本成为硬性约束时,当你需要高达 384K 的长输出时,当你需要自托管或物理隔离部署选项时,或者当你在构建一个利润率无法承受旗舰级定价的 token 的产品时,请选择 DeepSeek V4 Flash。当你需要在交互循环中获得速度、需要多模态输入、需要 Google 的托管可靠性,或需要 Google 所报告的更强智能体编码结果时——并且当你认可促销价只是暂时的——请选择 Gemini 3.7 Flash。它们并非像两款旗舰那样互为对手;它们是顶着同一个名字的两种不同采购策略。路由层就是两种策略的交汇之处:DeepSeek V4 Flash 已在 OrcaRouter 上线,按 DeepSeek 的目录价提供,0% 加价;故障转移模式天然契合这种配对——一条规则让大部分流量走 V4 Flash,并将困难子集升级到更强的闭源模型,而 Gemini 3.7 Flash 则可在同一路由器的另一条支路上通过 Google 自己的 Gemini API 触达。
诚实的解读
如果你可以自托管,或者你纯粹是成本驱动型的,那么 DeepSeek V4 Flash 是更值得构建的模型,而且其许可证让你无需再重新考虑这个决定。如果你需要 Google 的推理速度、多模态输入,或者传闻中的智能体编码优势,那么 Gemini 3.7 Flash 在促销期内是更好的服务——而一月份价格翻倍已经列在日程上了。两个模型,同一个名字,市场将看到未来一年的流量会向哪种理念投票。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
