
Gemini 3.7 Flash 对比 Gemini 3.1 Pro:谷歌的Flash系列是否让自己的旗舰产品变得过时?
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
谷歌2026年的产品线中藏着一个令人不安的问题,它指向每一个正在为Gemini 3.1 Pro付费的团队:为什么便宜的Flash模型能在独立指数上超过旗舰型号?Gemini 3.7 Flash于2026年8月13日发布,输入每百万token收费0.75美元、输出每百万token收费3.75美元,在高推理强度下,其在Artificial Analysis Intelligence Index上得分为56。谷歌于2026年2月19日发布的预览版Gemini 3.1 Pro,价格为2.00美元/12.00美元——超过20万上下文则为4.00美元/18.00美元——如今在同一指数上仅得40多分。发布时高居榜首的旗舰型号,已被自家主力档位反超。这篇文章要谈的,正是这对这两款模型、以及所有不得不在二者之间做出选择的团队意味着什么。
前提是:Google 的旗舰层级仍停留在预览阶段。
背景信息比数字本身更重要。Gemini 3.1 Pro 自2026年2月起一直处于预览阶段——截至本文撰写时已有七个月——其继任者 Gemini 3.5 Pro 在5月的 Google I/O 大会上宣布"下个月推出",结果6月、7月、8月接连跳票。截至9月初,旗舰层级既没有已发布的继任者,也没有发布日期,还传出可能被取消的消息。与此同时,Flash 层级在同一时间段内却推出了三代产品:Gemini 3.6 Flash于7月21日发布,Gemini 3.7 Flash 于8月13日发布,9月1日又为两者同时加入了智能体视频理解能力。这场对比并非真正的"Pro 对 Flash",而是"谷歌正在持续推出的层级"与"谷歌已经停止推出的层级"之间的对比。
规格对比
• 价格 — Gemini 3.7 Flash 每100万token $0.75 / $3.75(促销至2026年12月31日,之后为$1.50 / $7.50)对比 Gemini 3.1 Pro 在200K上下文以下为$2.00 / $12.00,超过200K则升至$4.00 / $18.00。在推理层级控制之前,标价便宜三到四倍。
• 上下文 / 最大输出 — 1M / 64K 对比 1M / 64K。上限完全相同。
• 输入 — 文本、图像、音频、视频、PDF 均可。多模态界面是相同的;区别在于模型对视频的处理方式(见下文)。
• 推理控制 — Gemini 3.7 Flash 低 / 中 / 高思考。Gemini 3.1 Pro 低 / 中 / 高,默认开启动态思考。
• 独立评分 — Gemini 3.7 Flash 在 Artificial Analysis 智能指数上得分为 56,而 Gemini 3.1 Pro 在当前指数版本上处于 40 多分的高位(它在先前版本发布时得分为 57)。
• 输出速度 — Gemini 3.7 Flash 在高推理模式下约为 285 tokens/秒,而 Gemini 3.1 Pro 约为 112–125 tokens/秒 — 速度大约快两倍半。
• 状态 — Gemini 3.7 Flash 稳定版,已正式发布(GA)。Gemini 3.1 Pro 预览版,预览版弃用窗口较短。
指数,以及其表面之下的基准乱象
头条就是指数:独立的跨供应商评估机构 Artificial Analysis 如今将 Gemini 3.7 Flash 评为 56 分,而 Gemini 3.1 Pro 则在 45 至 49 分之间——主力机型领先于旗舰机型,这与 3.1 Pro 发布时的排名正好相反,当时它以 57 分高居指数榜首。这是本次对决中最重要的一项事实,而且数据来自独立来源,并非供应商自行报告。
在索引之下,基准测试账本是一堆彼此无法比较的测试框架,如果只是不加鉴别地阅读,会得出错误的答案。Gemini 3.1 Pro 公布的成绩——SWE-bench Verified 上 80.6%、ARC-AGI-2 上 77.1%、GPQA Diamond 上 94.3%、LiveCodeBench Pro 上 Elo 2887——是谷歌在二月发布会上报告的,使用的基准版本与 Flash 的数据不同,而且从未被统一复现过。Gemini 3.7 Flash 在 FrontierCode 1.1 上的 43.6%、DeepSWE v1.1 上的 65.3%,以及 Web 开发竞技场上的 Elo 1588,同样是在较新的测试框架上由厂商自行报告的。而在两者重叠的独立综合指标——AA Index——上,获胜的是 Flash。任何告诉你"Pro 在 SWE-bench 上击败 Flash"的人,都是在比较两项不同测试的两个不同版本,却没有把这一点说出来。


视频能力差距
让这种对比显得失衡的能力是{{1}}视频{{/1}}。谷歌新推出的智能体视频理解模式——于{{2}}2026年9月1日{{/2}}发布——适用于{{3}}Gemini 3.7 Flash、Gemini 3.6 Flash和Gemini 3.5 Flash-Lite{{/3}}。{{4}}Gemini 3.1 Pro{{/4}}不在其列。Flash模型按照新模式定义的方式来读取视频:模型自行决定观看什么内容、以什么速度、通过帧、音频或转录文本进行读取,只加载相关片段,据厂商报告可节省高达{{5}}66%的成本和88%的token{{/5}}。{{6}}Gemini 3.1 Pro{{/6}}在技术上接受视频输入,但它使用的是较旧的静态采样路径,无法使用任何新工具。对于旗舰版用户来说,Gemini系列最新的视频能力首先在更便宜的型号上推出,而Pro版何时获得该功能尚未公布。
速度与预览风险问题
速度会像在所有 Gemini 3.7 Flash 对比中那样,进一步拉大价格差距:该模型的成本已经只有对手的三分之一,输出速率却大约是对方的三倍。但第二个差异才是团队在定价时容易忽略的点:状态。Gemini 3.1 Pro 是预览版,而预览版在继任者发布时,只有很短的弃用通知窗口。在预览模型上承载生产工作负载,意味着始终面临模型 ID 变更、定价调整或能力迁移几乎无预警的风险。Gemini 3.7 Flash 已正式发布(GA)——稳定、有文档支持,且不会随意被替换,即便 Google 近乎每月一次的 Flash 发布节奏意味着 3.8 Flash 可能很快到来。3.1 Pro 预览版的弃用风险并非假设,而是该层级当下的现状——其继任者已被推迟了三个月。
Gemini 3.1 Pro 仍然胜出的地方
3.1 Pro 的诚实论据有三个支柱,而它们都不是原始能力。首先,自定义工具端点:Gemini 3.1 Pro 提供了 Flash 无法匹敌的专用 bash/自定义工具 API 面,而基于它构建代理工具团队的团队今天已经拥有可用的系统。其次,调优过的工作负载:已经针对 3.1 Pro 的动态思考默认值、缓存模式和评估分数调优过的流水线是一个移动目标,即使目标更快更便宜,切换也会耗费实实在在的工程时间。第三,在 Pro 更长的生产记录仍然没有 Flash 对应物的特定任务上——比如 GPQA 和 ARC-AGI-2 等 Flash 从未被评测过的发布代基准。如果你的工作负载属于其中之一,“Flash 在指数上排名高于 Pro”并不能解决你的问题;只有在你自己的评估上测试才行。
结论:Flash级收购意味着什么
方向很明确。对于今天的新工作负载,Gemini 3.7 Flash 是更好的默认 Gemini 选择:更便宜、更快、GA 稳定、在独立指数上排名更高,并且率先获得新的视频能力。Gemini 3.1 Pro 保留了一个真实但狭窄的用户群——自定义工具用户、调优管道,以及其旧基准记录仍然适用的任务。更宏观的故事是,Google 的旗舰层级已经停滞不前,而其主力层级才是公司真正在竞争的地方——那些仍为 3.1 Pro 支付旗舰价格的团队,是在为一个公司自己已不再捍卫的地位买单。

对于希望在不创建项目的情况下进行迁移的团队,Gemini 模型之间的切换只是模型名称的变更,而非集成工作。Gemini 3.1 Pro 在 OrcaRouter 上以 2.00 美元 / 12.00 美元的标价提供服务,按 0% 加价转售,与 Gemini 3.6 Flash 及其他可路由的 Gemini 层级一起,仅需一个密钥即可访问——因此工作负载可以将部分流量发送给 Flash 模型,同时保留 3.1 Pro 作为其仍然占优的任务的回退选项,并让自动故障转移吸收任一 Google 模型变化带来的风险。Gemini 3.7 Flash 本身可通过 Google 自己的 API 及多个第三方平台获取。路由 DSL 和模型融合正是你在切换之前,在自己的评估环境中对两个 Gemini 模型进行同类比较的方式。该产品线推动你做出的选择很明确:默认使用 Flash 层级,仅在少数能明显体现 Pro 溢价价值的场景中保留 Pro。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
