
什么是 Gemini 3.1 Pro?Google 的 Pro 层级已七个月停滞不前
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Gemini 3.1 Pro 是其所属家族中唯一一款仍在线的 Pro 级模型。它于 2026 年 2 月 19 日发布,而七个月后,厂商自家的模型文档仍将其归在“预览版”之下,端点地址为 gemini-3.1-pro-preview——既未正式可用,也没有下线日期,更没有后继型号问世。同样在这七个月里,该厂商接连推出了五个 Flash 版本,其中最新的 Gemini 3.8 Flash 在大多数人引用的独立榜单上如今已高出十一个百分点。这一落差,正是一篇解释 Gemini 3.1 Pro 究竟是什么的页面,必须先讲清它不是什么的原因所在。
如果你只想要两句话的版本:Gemini 3.1 Pro 是由 Google DeepMind 打造的闭权重、原生多模态推理模型,可读取文本、图像、视频、音频和 PDF,并输出文本。你可以通过 Google 自家的 API,或通过承载它的路由器来调用它;它最多接受 1,048,576 个 token 的输入,并且在提示词低于 200,000 token 时,每百万输入 token 收费 2.00 美元,每百万输出 token 收费 12.00 美元。作为长上下文多模态主力,它依然靠得住。它不再是你因为它是现有最聪明的模型而选择的那款模型。
它在自身家族中的位置
这是大多数文章都会跳过的部分,而这恰恰是最重要的部分。Gemini 3 系列并不是一个顶端放着 Pro 的单一阶梯,而是两个已不再具可比性的阶梯。
Flash 这一系列是有所变动的那一个。2026 年 9 月 23 日查阅的 Google 模型文档将 Gemini 3.8 Flash、Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 列为新的稳定版本,而 Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash 和 Gemini 3.5 Flash-Lite 仍作为稳定版本列于其后。Gemini 3.8 Flash 于 2026 年 9 月 2 日发布——这是六周内的第三个 Flash 版本。
Pro 这一档则是没有后续的那一档。Google 的文档中不存在 Gemini 3.5 Pro、3.6 Pro、3.7 Pro 或 3.8 Pro。Gemini 3 Pro——Gemini 3.1 Pro 本应取代的模型——被列为已关停。Gemini 2.5 Pro 仍然存活,但访问权限仅限于此前已有权限的用户。这样一来,Gemini 3.1 Pro 就成了如今唯一可以调用的 Pro 级 Gemini 3 端点——不是因为它赢了竞赛,而是因为没有其他参赛者。
谷歌在2月公布的计划是,预览期将持续足够长的时间,以便"验证这些更新",并在该模型"即将全面开放"之前,推进诸如雄心勃勃的智能体工作流等领域。这些都是谷歌在2月公告中的原话。七个月过去了,这一切并未发生,而围绕此次延迟的报道,应当明确作为"报道"、而非"事实"来陈述:SemiAnalysis 的结论是,Gemini 3.5 Pro 项目已被悄然取消;而据二线媒体援引,《华尔街日报》报道称,内部的 3.5 Pro 候选版本之所以被放弃,是因为它无法超越 Flash 系列。谷歌自己的说法是,3.5 Pro 仍处于受限的合作伙伴测试阶段,尚未确认具体月份。我们未能找到谷歌证实或否认取消一事的声明,我们也不会替他们选边站。
实际的后果是一个命名陷阱。如果你去寻找“最新的 Gemini Pro”,你能找到的最新 Pro 级模型来自二月份,而 Flash 这边的版本号已经攀升到了 3.8。在这里,版本号并不能用来衡量不同层级之间的能力高低;它们是两条彼此独立的发布线。
关键规格
以下每个数字均取自 Google 自己的 Gemini API 文档(2026 年 9 月 23 日),除非另有标注。
• 输入上下文 — 1,048,576 个 token,与 Google 自 2.5 代以来一直提供的一百万 token 窗口相同。输出则单独限制在 65,536 个 token,这一上限约束的是回答,而非对话。
• 输入模态——文本、图像、视频、音频和 PDF。输出模态——仅文本。不支持音频生成,不支持图像生成,也没有 Live API,因此它不是用于实时语音智能体或图像流水线的模型。Google 为这些任务提供了单独的 Gemini 3.x Flash 变体。
• 推理 — 支持,并可控制思考层级。思考 token 按输出费率计费,因此输出价格才是主导你账单的那个数字。
• 工具 — 缓存、代码执行、函数调用、Search grounding、Maps grounding、结构化输出、URL 上下文、Batch API、flex inference 和 priority inference 均列为支持项。文件搜索仅在 AI Studio 中列为支持。
• 许可与权重——专有。没有开放权重,没有可下载的检查点,也没有自托管途径。访问该模型的每一条路径都是托管 API。
• 端点 — gemini-3.1-pro-preview 是模型代码。Google 还列出了 gemini-3.1-pro-preview-customtools 变体。预览端点在版本号不变的情况下也可能在你毫无察觉时被修改,这正是生产环境中应固定使用确切的模型 ID 而非别名的标准原因。
• 有记录的更新日期 —— 模型页面显示“最近更新:2026年2月”。我们在谷歌自己的模型页面上找不到所声明的知识截止日期;第三方列表显示为2025年1月,而我们将其标记为未经证实,而不是把它当作事实来重复。
费用是多少
Gemini 3.1 Pro存在一个价格断崖,而正是这种细节会让看似低廉的估算变成翻倍的账单。Google公布的开发者定价是按提示词大小而非模型版本来划分的。
• 标准层级,提示词最高 200,000 个 token — 每百万输入 token 收费 $2.00,每百万输出 token 收费 $12.00,思考 token 按输出计费。
• 标准档,提示超过 200,000 个 token——输入 $4.00,输出 $18.00。在相同阈值下,这两项费率都会翻倍。这就是陷阱:长上下文工作负载之所以要支付两倍于标称费率的费用,恰恰是因为它正在使用当初购买该模型所看重的功能。
• 上下文缓存 — 每百万个缓存 token 收费 $0.20 或 $0.40,具体取决于你处在 200,000 这个阈值之上还是之下;另加缓存存储费,按每小时每百万 token $4.50 计费。
• 批处理和灵活层级——20万token以内输入1.00美元、输出6.00美元,超过则为2.00美元和9.00美元。对于可以等待的任务,价格大约减半。
• 优先级层级 — 阈值以下输入 $3.60、输出 $21.60;阈值以上 $7.20 和 $32.40。
• 免费层级 — 此模型不提供。没有可用于原型验证的免费速率限制。
关于这些数字有多可靠,有两点值得了解。Google 自己的定价页面在这里是权威依据,而我们是直接读取它的,所以上面的数字截至 2026 年 9 月 23 日是最新的。但这款模型的第三方报价确实不一致——一个追踪器列出 $2.50 / $15.00 的费率,另一个列出 $4.50 的混合费率——而原因就在于分档。如果一个页面给你报出 Gemini 3.1 Pro 的单一数字,却没有告诉你它适用于哪个提示词规模区间,那么这个数字就无法用于实际估算。
它在哪些方面可衡量地擅长,又在哪些方面可衡量地不擅长
从谷歌宣称的内容开始,然后将其与独立评测机构实际测得的结果分开,因为自二月份以来,两者已出现明显分歧。
Google 自己的公告恰好只包含一个基准数字:在 ARC-AGI-2 上“经核实的 77.1% 得分”,Google 称其推理性能是 Gemini 3 Pro 的两倍多。这是厂商给出的数字,读取自 Google 自己的帖子,也是我们在那里唯一能确认的数字。发布报道流传了一套大得多的数据——GPQA Diamond、SWE-bench Verified、Terminal-Bench 2.0、LiveCodeBench、Humanity’s Last Exam——但这些数字并未出现在 Google 自己的公告中,而且在我们核查过的那些数据上,二手报道彼此并不一致(GPQA Diamond 视来源不同,出现了 94.1 和 94.3 两种数值)。我们不会把它们当作已确立的结果来发布。
独立图景才是故事的转折点。在 2026 年 9 月 23 日生效的 Artificial Analysis Intelligence Index 版本上,Gemini 3.1 Pro Preview 得分为 30,在该类别的 212 个模型中排名第 81 位。该类别的中位数模型得分为 25,因此它高于平均水平——而同一图表上的领先者,即处于最高推理设置的 Claude Opus 5,得分为 58。该指数本身是一把带版本标记的尺子,而非固定不变的尺子:Artificial Analysis 在 2 月发布之后对其进行了修订,其自身的修订说明记录了新的评测加入这一综合指标。Gemini 3.1 Pro 曾在其 2 月发布时被报道为该指数上的绝对领先者,得分为 57 分。那与这个 30 并非同一把尺子,我们不会把这两个数字并排放置,仿佛它们勾勒出一条下滑轨迹。
当前映射所确实显示的是一幅真实的画像,而且是一幅失衡的画像:
• 智能 — 指数 30,在 212 个中排名第 81。高于中位数,但远未达到前沿。
• 速度 — 每秒 116.5 个输出 token,在 212 个中排名第 38。对于推理模型来说,这速度相当快。
• 成本——运行一个 Intelligence Index 任务需 $0.67,在 212 个中排名第 31。按单位工作量计算这很便宜,因为该模型在思考 token 的使用上很节省。
• 冗长程度——完成该指数需输出 6700 万个 token,而同类别中位数为 8800 万。在 212 个模型中排名第 39;Artificial Analysis 称其“相当简洁”。作为对比,Gemini 3.8 Flash 在高推理强度下跑同一套测试会消耗 1.7 亿个 token,每项任务花费 1.24 美元——尽管其单 token 价格更低,成本却高于 Gemini 3.1 Pro。
所以,诚实的解读并不是“旧模型在各方面都被击败了”。Gemini 3.1 Pro 速度快、token 效率高,而且按每任务成本计算,它胜过自己更新的同门模型。它失去的是能力上限,而在任何质量构成硬约束的工作负载上,那是唯一重要的维度。

九月的可用性问题
围绕这一模型还有一项仍在发展的动态,而且它更像是一个疑问,而不是一次发布。自 2026 年 9 月 18 日起,Google 自家 AI Studio 开发者论坛上的用户一直在报告称,Gemini 3.1 Pro 从 AI Studio 模型选择器中消失了——该帖子标题将这一变化的时间定为 2026-09-18——付费用户表示他们被迁移到了 Gemini 3.8 Flash,随后又从那里被迁移到 3.7 和 3.6 Flash。在我们读到的那条帖子中,没有 Google 员工回复,没有弃用通知,也没有说明原因。我们在 2026 年 9 月 23 日查看时,该模型仍列在 Gemini API 以及我们自己的目录中,并且仍可调用。
我们将其标记为 Google 自家论坛上尚未解决的用户报告,而不是模型退役,也不是服务中断。但如果你的生产路径特别依赖这个模型,这就是一个理由:应当配置好回退方案,而不是假定预览端点会一直固定存在。
谁应该选择它,谁又不应该呢?
如果问题很长且涉及多模态,就选 Gemini 3.1 Pro。原生支持视频、音频和 PDF 输入的一百万 token 上下文窗口,依然是选择它的理由,模型推出的时间早晚并不会改变这一点。具体来说:整仓库分析、审计数小时的会议录音或录像资料、从混合媒体文档集中提取结构化数据,或是任何单个提示词用掉超过 20 万 token、而替代方案是不得不自行搭建并评估一套检索层的流程。它的 token 效率是第二个实打实的论据——同样一套任务,它用 6700 万输出 token 就能完成,而 Gemini 3.8 Flash 要花 1.7 亿,因此尽管每 token 的单价看起来更高,单任务账单实际上可能更低。
在三种情况下,请选择别的方案。如果你想要 Google 当前针对高难度推理或长周期编程问题的最佳答案,那么在当前独立指数上,Gemini 3.8 Flash 的得分高于 Gemini 3.1 Pro,已正式可用而非预览版,截至 2026 年 12 月 31 日每百万输入 token 收费 $0.75、每百万输出 token 收费 $3.75,并且提供 Gemini 3.1 Pro 所没有的免费层级。为了达到这一水平,它会消耗更多思考 token——这就是取舍,而且是实实在在的取舍。如果你需要绝对的前沿能力,那目前并不是 Google 的模型:在同一张指数图表上,以最大推理力度运行的 Claude Opus 5 以 58 分领先于 Gemini 3.1 Pro 的 30 分。而如果你的工作负载对延迟或成本敏感且较为浅层——分类、抽取、路由、短文本摘要——那么 Flash-Lite 层级或小型开放权重模型就能完成任务,成本仅为每百万输入 token $2.00 的一小部分,为此支付 Pro 费率纯属浪费。
我们不会因为 Gemini 3.1 Pro 是 Google 最新的 Pro 就选择它。它并不新,而且截至本月,Google 还没有推出它的后继产品。
调用它,而无需把全部筹码押在一个预览端点上
七个月预览版的尴尬之处在于,它已经好到足以在其上构建,却又不够稳定,不能想当然地依赖。有两项缓解措施值得点名。
请锁定确切的模型代码,而不是别名。预览端点可能会就地修订,因此gemini-3.1-pro-preview写在配置文件里,比引用浮动的“最新 Pro”更安全,而且能让静默变更在 diff 中显现出来。
让路由层位于模型之上。在 OrcaRouter 上,Gemini 3.1 Pro 就是 google/gemini-3.1-pro-preview,与我们提供的其他所有模型一样,用同一个密钥、同一个端点即可调用,既支持面向 Gemini SDK 编写的代码所用的原生 /v1beta/models/{model}:generateContent 形式,也支持其余场景的 OpenAI 兼容 /v1/chat/completions。由于定价采用 0% 加价的成本透传,Google 价目表上的 $2.00 / $12.00 就是你在我们这里支付的数字,供应商调价当天即时生效,而不必等到下一个账单周期。这一点对预览版模型尤其重要的原因在于故障转移:配置好回退链后,当 Gemini 3.1 Pro 不可用的那一天,你的重试会在响应开始之前就落到链中的下一个模型上,而不是等到用户察觉之后。这就是“可以放心上线的预览版”与“只能用来演示的预览版”之间的区别。
我们自己为这个模型编写的目录条目中,列出了我们实际提供的规格——一百万 token 上下文、65,536 token 最大输出、音频/文件/图像/文本/视频输入、文本输出,以及过去七天内 10.00 秒的首 token 中位时间;在你以为这是一个聊天延迟级别的模型之前,这一点值得了解。它并不是。

还有什么仍然开放
有三件事我们没能弄清楚,与其粉饰,不如直说。谷歌尚未说明 Gemini 3.1 Pro 是否终将正式全面可用,也没有公布任何一种情况下的停用日期。五天过去了,关于 AI Studio 的报道仍未得到解释,我们也找不到厂商的任何回应。至于继任者的问题,答案只能是否定的:谷歌的 Pro 页面数月来一直在预告即将发布 Pro 版本,报道称内部候选版本因未能超越 Flash 系列而被放弃,而截至 2026 年 9 月 23 日,尚无任何产品发布。如果 Gemini 3.5 Pro 或 Gemini 4 Pro 出现,Gemini 3.1 Pro 在这个家族中的定位将自 2 月以来首次发生变化——而值得关注的事件,正是这件事,而不是它最初的发布。

Gemini 3.1 Pro 已在 OrcaRouter 上线,采用 Google 的标价,并与我们提供的其他所有模型共用同一个密钥。查看 Gemini 3.1 Pro 模型页面,了解实时定价、上下文限制,以及一条你可以在下一个预览版本发布之前配置好的回退链。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
