文章《Gemini 3.7 Flash 对比 Gemini 3.1 Pro》的英雄标题卡片,副标题为“Google 的 Flash 级别是否让自家旗舰产品变得过时?”,药丸徽章显示“AA Index 56 vs 48”、“/bin/bash.75 / .75 vs / 2”、“稳定版 vs 预览版”,右下角为 OrcaRouter 标志。
Guides & Insights

Gemini 3.7 Flash 对比 Gemini 3.1 Pro:谷歌的Flash系列是否让自己的旗舰产品变得过时?

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

谷歌2026年的产品线中藏着一个令人不安的问题,它指向每一个正在为Gemini 3.1 Pro付费的团队:为什么便宜的Flash模型能在独立指数上超过旗舰型号?Gemini 3.7 Flash于2026年8月13日发布,输入每百万token收费0.75美元、输出每百万token收费3.75美元,在高推理强度下,其在Artificial Analysis Intelligence Index上得分为56。谷歌于2026年2月19日发布的预览版Gemini 3.1 Pro,价格为2.00美元/12.00美元——超过20万上下文则为4.00美元/18.00美元——如今在同一指数上仅得40多分。发布时高居榜首的旗舰型号,已被自家主力档位反超。这篇文章要谈的,正是这对这两款模型、以及所有不得不在二者之间做出选择的团队意味着什么。

前提是:Google 的旗舰层级仍停留在预览阶段。

背景信息比数字本身更重要。Gemini 3.1 Pro 自2026年2月起一直处于预览阶段——截至本文撰写时已有七个月——其继任者 Gemini 3.5 Pro 在5月的 Google I/O 大会上宣布"下个月推出",结果6月、7月、8月接连跳票。截至9月初,旗舰层级既没有已发布的继任者,也没有发布日期,还传出可能被取消的消息。与此同时,Flash 层级在同一时间段内却推出了三代产品:Gemini 3.6 Flash于7月21日发布,Gemini 3.7 Flash 于8月13日发布,9月1日又为两者同时加入了智能体视频理解能力。这场对比并非真正的"Pro 对 Flash",而是"谷歌正在持续推出的层级"与"谷歌已经停止推出的层级"之间的对比。

规格对比

• 价格 — Gemini 3.7 Flash 每100万token $0.75 / $3.75(促销至2026年12月31日,之后为$1.50 / $7.50)对比 Gemini 3.1 Pro 在200K上下文以下为$2.00 / $12.00,超过200K则升至$4.00 / $18.00。在推理层级控制之前,标价便宜三到四倍。

• 上下文 / 最大输出 — 1M / 64K 对比 1M / 64K。上限完全相同。

• 输入 — 文本、图像、音频、视频、PDF 均可。多模态界面是相同的;区别在于模型对视频的处理方式(见下文)。

• 推理控制 — Gemini 3.7 Flash 低 / 中 / 高思考。Gemini 3.1 Pro 低 / 中 / 高,默认开启动态思考。

• 独立评分 — Gemini 3.7 Flash 在 Artificial Analysis 智能指数上得分为 56,而 Gemini 3.1 Pro 在当前指数版本上处于 40 多分的高位(它在先前版本发布时得分为 57)。

• 输出速度 — Gemini 3.7 Flash 在高推理模式下约为 285 tokens/秒,而 Gemini 3.1 Pro 约为 112–125 tokens/秒 — 速度大约快两倍半。

• 状态 — Gemini 3.7 Flash 稳定版,已正式发布(GA)。Gemini 3.1 Pro 预览版,预览版弃用窗口较短。

指数,以及其表面之下的基准乱象

头条就是指数:独立的跨供应商评估机构 Artificial Analysis 如今将 Gemini 3.7 Flash 评为 56 分,而 Gemini 3.1 Pro 则在 45 至 49 分之间——主力机型领先于旗舰机型,这与 3.1 Pro 发布时的排名正好相反,当时它以 57 分高居指数榜首。这是本次对决中最重要的一项事实,而且数据来自独立来源,并非供应商自行报告。

在索引之下,基准测试账本是一堆彼此无法比较的测试框架,如果只是不加鉴别地阅读,会得出错误的答案。Gemini 3.1 Pro 公布的成绩——SWE-bench Verified 上 80.6%、ARC-AGI-2 上 77.1%、GPQA Diamond 上 94.3%、LiveCodeBench Pro 上 Elo 2887——是谷歌在二月发布会上报告的,使用的基准版本与 Flash 的数据不同,而且从未被统一复现过。Gemini 3.7 Flash 在 FrontierCode 1.1 上的 43.6%、DeepSWE v1.1 上的 65.3%,以及 Web 开发竞技场上的 Elo 1588,同样是在较新的测试框架上由厂商自行报告的。而在两者重叠的独立综合指标——AA Index——上,获胜的是 Flash。任何告诉你"Pro 在 SWE-bench 上击败 Flash"的人,都是在比较两项不同测试的两个不同版本,却没有把这一点说出来。

A two-column scoreboard titled 'Gemini 3.7 Flash vs Gemini 3.1 Pro — the scoreboard'. Left column 'Gemini 3.7 Flash': 'Price /bin/bash.75 / .75 (promo)', 'AA Index 56', 'Speed ~285 tok/s (high)', 'Status stable, GA', 'Agentic video understanding: yes', 'Released Aug 13, 2026'. Right column 'Gemini 3.1 Pro': 'Price .00 / 2.00 ( / 8 above 200K)', 'AA Index upper-40s (57 at launch)', 'Speed ~112-125 tok/s', 'Status preview', 'Agentic video understanding: no', 'Released Feb 19, 2026'. Footer: 'AA figures per Artificial Analysis; component benchmarks vendor-reported, unreproduced.'Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of /bin/bash.75 per 1M input and .75 per 1M output tokens.

视频能力差距

让这种对比显得失衡的能力是{{1}}视频{{/1}}。谷歌新推出的智能体视频理解模式——于{{2}}2026年9月1日{{/2}}发布——适用于{{3}}Gemini 3.7 Flash、Gemini 3.6 FlashGemini 3.5 Flash-Lite{{/3}}。{{4}}Gemini 3.1 Pro{{/4}}不在其列。Flash模型按照新模式定义的方式来读取视频:模型自行决定观看什么内容、以什么速度、通过帧、音频或转录文本进行读取,只加载相关片段,据厂商报告可节省高达{{5}}66%的成本和88%的token{{/5}}。{{6}}Gemini 3.1 Pro{{/6}}在技术上接受视频输入,但它使用的是较旧的静态采样路径,无法使用任何新工具。对于旗舰版用户来说,Gemini系列最新的视频能力首先在更便宜的型号上推出,而Pro版何时获得该功能尚未公布。

速度与预览风险问题

速度会像在所有 Gemini 3.7 Flash 对比中那样,进一步拉大价格差距:该模型的成本已经只有对手的三分之一,输出速率却大约是对方的三倍。但第二个差异才是团队在定价时容易忽略的点:状态。Gemini 3.1 Pro 是预览版,而预览版在继任者发布时,只有很短的弃用通知窗口。在预览模型上承载生产工作负载,意味着始终面临模型 ID 变更、定价调整或能力迁移几乎无预警的风险。Gemini 3.7 Flash 已正式发布(GA)——稳定、有文档支持,且不会随意被替换,即便 Google 近乎每月一次的 Flash 发布节奏意味着 3.8 Flash 可能很快到来。3.1 Pro 预览版的弃用风险并非假设,而是该层级当下的现状——其继任者已被推迟了三个月。

Gemini 3.1 Pro 仍然胜出的地方

3.1 Pro 的诚实论据有三个支柱,而它们都不是原始能力。首先,自定义工具端点:Gemini 3.1 Pro 提供了 Flash 无法匹敌的专用 bash/自定义工具 API 面,而基于它构建代理工具团队的团队今天已经拥有可用的系统。其次,调优过的工作负载:已经针对 3.1 Pro 的动态思考默认值、缓存模式和评估分数调优过的流水线是一个移动目标,即使目标更快更便宜,切换也会耗费实实在在的工程时间。第三,在 Pro 更长的生产记录仍然没有 Flash 对应物的特定任务上——比如 GPQA 和 ARC-AGI-2 等 Flash 从未被评测过的发布代基准。如果你的工作负载属于其中之一,“Flash 在指数上排名高于 Pro”并不能解决你的问题;只有在你自己的评估上测试才行。

结论:Flash级收购意味着什么

方向很明确。对于今天的新工作负载,Gemini 3.7 Flash 是更好的默认 Gemini 选择:更便宜、更快、GA 稳定、在独立指数上排名更高,并且率先获得新的视频能力。Gemini 3.1 Pro 保留了一个真实但狭窄的用户群——自定义工具用户、调优管道,以及其旧基准记录仍然适用的任务。更宏观的故事是,Google 的旗舰层级已经停滞不前,而其主力层级才是公司真正在竞争的地方——那些仍为 3.1 Pro 支付旗舰价格的团队,是在为一个公司自己已不再捍卫的地位买单。

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview showing a 1M-token context window, .00 per 1M input and 2.00 per 1M output tokens, and Vision/Audio/Tools/JSON/Reasoning capability chips.

对于希望在不创建项目的情况下进行迁移的团队,Gemini 模型之间的切换只是模型名称的变更,而非集成工作。Gemini 3.1 Pro 在 OrcaRouter 上以 2.00 美元 / 12.00 美元的标价提供服务,按 0% 加价转售,与 Gemini 3.6 Flash 及其他可路由的 Gemini 层级一起,仅需一个密钥即可访问——因此工作负载可以将部分流量发送给 Flash 模型,同时保留 3.1 Pro 作为其仍然占优的任务的回退选项,并让自动故障转移吸收任一 Google 模型变化带来的风险。Gemini 3.7 Flash 本身可通过 Google 自己的 API 及多个第三方平台获取。路由 DSL 和模型融合正是你在切换之前,在自己的评估环境中对两个 Gemini 模型进行同类比较的方式。该产品线推动你做出的选择很明确:默认使用 Flash 层级,仅在少数能明显体现 Pro 溢价价值的场景中保留 Pro。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube