用于 Gemini 3.1 Pro 讲解视频的标题卡,内容为“Gemini 3.1 Pro”,副标题为“七个月后,仍是预览版”,位于四个规格标签上方,标签分别显示:100 万 token 输入、65K 输出、每 100 万 $2 / $12,以及公布于 2026 年 2 月 19 日。
Guides & Insights

什么是 Gemini 3.1 Pro?Google 的 Pro 层级已七个月停滞不前

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.1 Pro 是其所属家族中唯一一款仍在线的 Pro 级模型。它于 2026 年 2 月 19 日发布,而七个月后,厂商自家的模型文档仍将其归在“预览版”之下,端点地址为 gemini-3.1-pro-preview——既未正式可用,也没有下线日期,更没有后继型号问世。同样在这七个月里,该厂商接连推出了五个 Flash 版本,其中最新的 Gemini 3.8 Flash 在大多数人引用的独立榜单上如今已高出十一个百分点。这一落差,正是一篇解释 Gemini 3.1 Pro 究竟是什么的页面,必须先讲清它不是什么的原因所在。

如果你只想要两句话的版本:Gemini 3.1 Pro 是由 Google DeepMind 打造的闭权重、原生多模态推理模型,可读取文本、图像、视频、音频和 PDF,并输出文本。你可以通过 Google 自家的 API,或通过承载它的路由器来调用它;它最多接受 1,048,576 个 token 的输入,并且在提示词低于 200,000 token 时,每百万输入 token 收费 2.00 美元,每百万输出 token 收费 12.00 美元。作为长上下文多模态主力,它依然靠得住。它不再是你因为它是现有最聪明的模型而选择的那款模型。

它在自身家族中的位置

这是大多数文章都会跳过的部分,而这恰恰是最重要的部分。Gemini 3 系列并不是一个顶端放着 Pro 的单一阶梯,而是两个已不再具可比性的阶梯。

Flash 这一系列是有所变动的那一个。2026 年 9 月 23 日查阅的 Google 模型文档将 Gemini 3.8 Flash、Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 列为新的稳定版本,而 Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash 和 Gemini 3.5 Flash-Lite 仍作为稳定版本列于其后。Gemini 3.8 Flash 于 2026 年 9 月 2 日发布——这是六周内的第三个 Flash 版本。

Pro 这一档则是没有后续的那一档。Google 的文档中不存在 Gemini 3.5 Pro、3.6 Pro、3.7 Pro 或 3.8 Pro。Gemini 3 Pro——Gemini 3.1 Pro 本应取代的模型——被列为已关停。Gemini 2.5 Pro 仍然存活,但访问权限仅限于此前已有权限的用户。这样一来,Gemini 3.1 Pro 就成了如今唯一可以调用的 Pro 级 Gemini 3 端点——不是因为它赢了竞赛,而是因为没有其他参赛者。

谷歌在2月公布的计划是,预览期将持续足够长的时间,以便"验证这些更新",并在该模型"即将全面开放"之前,推进诸如雄心勃勃的智能体工作流等领域。这些都是谷歌在2月公告中的原话。七个月过去了,这一切并未发生,而围绕此次延迟的报道,应当明确作为"报道"、而非"事实"来陈述:SemiAnalysis 的结论是,Gemini 3.5 Pro 项目已被悄然取消;而据二线媒体援引,《华尔街日报》报道称,内部的 3.5 Pro 候选版本之所以被放弃,是因为它无法超越 Flash 系列。谷歌自己的说法是,3.5 Pro 仍处于受限的合作伙伴测试阶段,尚未确认具体月份。我们未能找到谷歌证实或否认取消一事的声明,我们也不会替他们选边站。

实际的后果是一个命名陷阱。如果你去寻找“最新的 Gemini Pro”,你能找到的最新 Pro 级模型来自二月份,而 Flash 这边的版本号已经攀升到了 3.8。在这里,版本号并不能用来衡量不同层级之间的能力高低;它们是两条彼此独立的发布线。

关键规格

以下每个数字均取自 Google 自己的 Gemini API 文档(2026 年 9 月 23 日),除非另有标注。

• 输入上下文 — 1,048,576 个 token,与 Google 自 2.5 代以来一直提供的一百万 token 窗口相同。输出则单独限制在 65,536 个 token,这一上限约束的是回答,而非对话。

• 输入模态——文本、图像、视频、音频和 PDF。输出模态——仅文本。不支持音频生成,不支持图像生成,也没有 Live API,因此它不是用于实时语音智能体或图像流水线的模型。Google 为这些任务提供了单独的 Gemini 3.x Flash 变体。

• 推理 — 支持,并可控制思考层级。思考 token 按输出费率计费,因此输出价格才是主导你账单的那个数字。

• 工具 — 缓存、代码执行、函数调用、Search grounding、Maps grounding、结构化输出、URL 上下文、Batch API、flex inference 和 priority inference 均列为支持项。文件搜索仅在 AI Studio 中列为支持。

• 许可与权重——专有。没有开放权重,没有可下载的检查点,也没有自托管途径。访问该模型的每一条路径都是托管 API。

• 端点 — gemini-3.1-pro-preview 是模型代码。Google 还列出了 gemini-3.1-pro-preview-customtools 变体。预览端点在版本号不变的情况下也可能在你毫无察觉时被修改,这正是生产环境中应固定使用确切的模型 ID 而非别名的标准原因。

• 有记录的更新日期 —— 模型页面显示“最近更新:2026年2月”。我们在谷歌自己的模型页面上找不到所声明的知识截止日期;第三方列表显示为2025年1月,而我们将其标记为未经证实,而不是把它当作事实来重复。

费用是多少

Gemini 3.1 Pro存在一个价格断崖,而正是这种细节会让看似低廉的估算变成翻倍的账单。Google公布的开发者定价是按提示词大小而非模型版本来划分的。

• 标准层级,提示词最高 200,000 个 token — 每百万输入 token 收费 $2.00,每百万输出 token 收费 $12.00,思考 token 按输出计费。

• 标准档,提示超过 200,000 个 token——输入 $4.00,输出 $18.00。在相同阈值下,这两项费率都会翻倍。这就是陷阱:长上下文工作负载之所以要支付两倍于标称费率的费用,恰恰是因为它正在使用当初购买该模型所看重的功能。

• 上下文缓存 — 每百万个缓存 token 收费 $0.20 或 $0.40,具体取决于你处在 200,000 这个阈值之上还是之下;另加缓存存储费,按每小时每百万 token $4.50 计费。

• 批处理和灵活层级——20万token以内输入1.00美元、输出6.00美元,超过则为2.00美元和9.00美元。对于可以等待的任务,价格大约减半。

• 优先级层级 — 阈值以下输入 $3.60、输出 $21.60;阈值以上 $7.20 和 $32.40。

• 免费层级 — 此模型不提供。没有可用于原型验证的免费速率限制。

关于这些数字有多可靠,有两点值得了解。Google 自己的定价页面在这里是权威依据,而我们是直接读取它的,所以上面的数字截至 2026 年 9 月 23 日是最新的。但这款模型的第三方报价确实不一致——一个追踪器列出 $2.50 / $15.00 的费率,另一个列出 $4.50 的混合费率——而原因就在于分档。如果一个页面给你报出 Gemini 3.1 Pro 的单一数字,却没有告诉你它适用于哪个提示词规模区间,那么这个数字就无法用于实际估算。

它在哪些方面可衡量地擅长,又在哪些方面可衡量地不擅长

从谷歌宣称的内容开始,然后将其与独立评测机构实际测得的结果分开,因为自二月份以来,两者已出现明显分歧。

Google 自己的公告恰好只包含一个基准数字:在 ARC-AGI-2 上“经核实的 77.1% 得分”,Google 称其推理性能是 Gemini 3 Pro 的两倍多。这是厂商给出的数字,读取自 Google 自己的帖子,也是我们在那里唯一能确认的数字。发布报道流传了一套大得多的数据——GPQA Diamond、SWE-bench Verified、Terminal-Bench 2.0、LiveCodeBench、Humanity’s Last Exam——但这些数字并未出现在 Google 自己的公告中,而且在我们核查过的那些数据上,二手报道彼此并不一致(GPQA Diamond 视来源不同,出现了 94.1 和 94.3 两种数值)。我们不会把它们当作已确立的结果来发布。

独立图景才是故事的转折点。在 2026 年 9 月 23 日生效的 Artificial Analysis Intelligence Index 版本上,Gemini 3.1 Pro Preview 得分为 30,在该类别的 212 个模型中排名第 81 位。该类别的中位数模型得分为 25,因此它高于平均水平——而同一图表上的领先者,即处于最高推理设置的 Claude Opus 5,得分为 58。该指数本身是一把带版本标记的尺子,而非固定不变的尺子:Artificial Analysis 在 2 月发布之后对其进行了修订,其自身的修订说明记录了新的评测加入这一综合指标。Gemini 3.1 Pro 曾在其 2 月发布时被报道为该指数上的绝对领先者,得分为 57 分。那与这个 30 并非同一把尺子,我们不会把这两个数字并排放置,仿佛它们勾勒出一条下滑轨迹。

当前映射所确实显示的是一幅真实的画像,而且是一幅失衡的画像:

• 智能 — 指数 30,在 212 个中排名第 81。高于中位数,但远未达到前沿。

• 速度 — 每秒 116.5 个输出 token,在 212 个中排名第 38。对于推理模型来说,这速度相当快。

• 成本——运行一个 Intelligence Index 任务需 $0.67,在 212 个中排名第 31。按单位工作量计算这很便宜,因为该模型在思考 token 的使用上很节省。

• 冗长程度——完成该指数需输出 6700 万个 token,而同类别中位数为 8800 万。在 212 个模型中排名第 39;Artificial Analysis 称其“相当简洁”。作为对比,Gemini 3.8 Flash 在高推理强度下跑同一套测试会消耗 1.7 亿个 token,每项任务花费 1.24 美元——尽管其单 token 价格更低,成本却高于 Gemini 3.1 Pro。

所以,诚实的解读并不是“旧模型在各方面都被击败了”。Gemini 3.1 Pro 速度快、token 效率高,而且按每任务成本计算,它胜过自己更新的同门模型。它失去的是能力上限,而在任何质量构成硬约束的工作负载上,那是唯一重要的维度。

Screenshot of the Artificial Analysis model page for Gemini 3.1 Pro Preview, showing the headline tiles Intelligence 30 (rank 81 out of 212 models), Speed 116.5 output tokens per second (rank 38 out of 212), Cost $0.67 to run one Intelligence Index task (rank 31 out of 212) and Verbosity 67M output tokens (rank 39 of 212), alongside a panel comparing Gemini 3.1 Pro Preview against Claude Opus 5 at maximum reasoning.

九月的可用性问题

围绕这一模型还有一项仍在发展的动态,而且它更像是一个疑问,而不是一次发布。自 2026 年 9 月 18 日起,Google 自家 AI Studio 开发者论坛上的用户一直在报告称,Gemini 3.1 Pro 从 AI Studio 模型选择器中消失了——该帖子标题将这一变化的时间定为 2026-09-18——付费用户表示他们被迁移到了 Gemini 3.8 Flash,随后又从那里被迁移到 3.7 和 3.6 Flash。在我们读到的那条帖子中,没有 Google 员工回复,没有弃用通知,也没有说明原因。我们在 2026 年 9 月 23 日查看时,该模型仍列在 Gemini API 以及我们自己的目录中,并且仍可调用。

我们将其标记为 Google 自家论坛上尚未解决的用户报告,而不是模型退役,也不是服务中断。但如果你的生产路径特别依赖这个模型,这就是一个理由:应当配置好回退方案,而不是假定预览端点会一直固定存在。

谁应该选择它,谁又不应该呢?

如果问题很长且涉及多模态,就选 Gemini 3.1 Pro。原生支持视频、音频和 PDF 输入的一百万 token 上下文窗口,依然是选择它的理由,模型推出的时间早晚并不会改变这一点。具体来说:整仓库分析、审计数小时的会议录音或录像资料、从混合媒体文档集中提取结构化数据,或是任何单个提示词用掉超过 20 万 token、而替代方案是不得不自行搭建并评估一套检索层的流程。它的 token 效率是第二个实打实的论据——同样一套任务,它用 6700 万输出 token 就能完成,而 Gemini 3.8 Flash 要花 1.7 亿,因此尽管每 token 的单价看起来更高,单任务账单实际上可能更低。

在三种情况下,请选择别的方案。如果你想要 Google 当前针对高难度推理或长周期编程问题的最佳答案,那么在当前独立指数上,Gemini 3.8 Flash 的得分高于 Gemini 3.1 Pro,已正式可用而非预览版,截至 2026 年 12 月 31 日每百万输入 token 收费 $0.75、每百万输出 token 收费 $3.75,并且提供 Gemini 3.1 Pro 所没有的免费层级。为了达到这一水平,它会消耗更多思考 token——这就是取舍,而且是实实在在的取舍。如果你需要绝对的前沿能力,那目前并不是 Google 的模型:在同一张指数图表上,以最大推理力度运行的 Claude Opus 5 以 58 分领先于 Gemini 3.1 Pro 的 30 分。而如果你的工作负载对延迟或成本敏感且较为浅层——分类、抽取、路由、短文本摘要——那么 Flash-Lite 层级或小型开放权重模型就能完成任务,成本仅为每百万输入 token $2.00 的一小部分,为此支付 Pro 费率纯属浪费。

我们不会因为 Gemini 3.1 Pro 是 Google 最新的 Pro 就选择它。它并不新,而且截至本月,Google 还没有推出它的后继产品。

调用它,而无需把全部筹码押在一个预览端点上

七个月预览版的尴尬之处在于,它已经好到足以在其上构建,却又不够稳定,不能想当然地依赖。有两项缓解措施值得点名。

请锁定确切的模型代码,而不是别名。预览端点可能会就地修订,因此gemini-3.1-pro-preview写在配置文件里,比引用浮动的“最新 Pro”更安全,而且能让静默变更在 diff 中显现出来。

让路由层位于模型之上。在 OrcaRouter 上,Gemini 3.1 Pro 就是 google/gemini-3.1-pro-preview,与我们提供的其他所有模型一样,用同一个密钥、同一个端点即可调用,既支持面向 Gemini SDK 编写的代码所用的原生 /v1beta/models/{model}:generateContent 形式,也支持其余场景的 OpenAI 兼容 /v1/chat/completions。由于定价采用 0% 加价的成本透传,Google 价目表上的 $2.00 / $12.00 就是你在我们这里支付的数字,供应商调价当天即时生效,而不必等到下一个账单周期。这一点对预览版模型尤其重要的原因在于故障转移:配置好回退链后,当 Gemini 3.1 Pro 不可用的那一天,你的重试会在响应开始之前就落到链中的下一个模型上,而不是等到用户察觉之后。这就是“可以放心上线的预览版”与“只能用来演示的预览版”之间的区别。

我们自己为这个模型编写的目录条目中,列出了我们实际提供的规格——一百万 token 上下文、65,536 token 最大输出、音频/文件/图像/文本/视频输入、文本输出,以及过去七天内 10.00 秒的首 token 中位时间;在你以为这是一个聊天延迟级别的模型之前,这一点值得了解。它并不是。

Generated comparison scoreboard titled 'Gemini 3.1 Pro vs Gemini 3.8 Flash — the scoreboard'. Left column, Gemini 3.1 Pro: AA Index 30, cost per index task $0.67, tokens per index run 67M, output speed 116 tok/s, output price $12.00 / 1M, status Preview. Right column, Gemini 3.8 Flash: AA Index 41, cost per index task $1.24, tokens per index run 170M, output speed 287 tok/s, output price $3.75 / 1M, status Stable. Footer reads 'Index per Artificial Analysis v4.3.2; prices and status per Google docs, 23 Sep 2026.'

还有什么仍然开放

有三件事我们没能弄清楚,与其粉饰,不如直说。谷歌尚未说明 Gemini 3.1 Pro 是否终将正式全面可用,也没有公布任何一种情况下的停用日期。五天过去了,关于 AI Studio 的报道仍未得到解释,我们也找不到厂商的任何回应。至于继任者的问题,答案只能是否定的:谷歌的 Pro 页面数月来一直在预告即将发布 Pro 版本,报道称内部候选版本因未能超越 Flash 系列而被放弃,而截至 2026 年 9 月 23 日,尚无任何产品发布。如果 Gemini 3.5 Pro 或 Gemini 4 Pro 出现,Gemini 3.1 Pro 在这个家族中的定位将自 2 月以来首次发生变化——而值得关注的事件,正是这件事,而不是它最初的发布。

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview, showing the model identifier google/gemini-3.1-pro-preview, Flagship and Featured badges, the byline 'by Google · 2026-02-19', capability tags for Vision, Audio, Tools, JSON and Reasoning, a 1M-token context and 65K maximum output, input modalities listed as audio, file, image, text and video with text-only output, and pricing tiles reading $2.00 per 1M input tokens and $12.00 per 1M output tokens.

Gemini 3.1 Pro 已在 OrcaRouter 上线,采用 Google 的标价,并与我们提供的其他所有模型共用同一个密钥。查看 Gemini 3.1 Pro 模型页面,了解实时定价、上下文限制,以及一条你可以在下一个预览版本发布之前配置好的回退链。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新