主视觉标题卡上写着“GPT-6 对比 Gemini 3.1 Pro”,并带有一个标签,写着“Gemini 3.1 Pro:自 2026-02-19 起处于预览阶段”;两行价格文字分别写着“GPT-6 Sol $2 / $10”和“Gemini 3.1 Pro $2 / $12”;底部注脚写着“指数数据依据 Artificial Analysis v4.3.2;GPT-6 厂商报告条目已在文中标注。”OrcaRouter 标志合成在右下角。
Guides & Insights

GPT-6 与 Gemini 3.1 Pro 对比:Google 的 Pro 层级自二月以来尚未推出新模型

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.1 Pro 在 Google 的价目表上已有七个半月,却始终未脱离预览阶段。它于 2026 年 2 月 19 日发布,至今仍通过名为 Gemini 3.1 Pro Preview 的端点提供服务;截至今天,既没有全面可用的承诺,也没有停用日期——而这两个日期本可说明该模型在自家厂商的计划中处于什么位置。相比之下,GPT-6 Sol 已于 2026 年 9 月 22 日发布,并在 2026 年 10 月 7 日成为 ChatGPT 向超过 12 亿周活跃用户全球推广时付费层级背后的模型。

所以,最受关注的对比并不是在两个旗舰层级之间展开的。它是在一款已上市产品和一款开放式预览版之间展开的,而事实证明,这一差异比基准测试上的差距更有分量。把二者并排放在 Artificial Analysis 的 Intelligence Index v4.3.2 上,Google 已面世七个月的预览版得分为 29.7,而 GPT-6 Sol 为 47.6,但每完成一个索引任务的收费却是后者的 1.25 倍——1.30 美元对 1.04 美元。这两个数字都是真实的,但在你掏钱之前,两者都需要附上一个前提说明。

这个预览版值得一读、而非被无视的原因在于,它确实能赢下一些项目。它在 GPQA Diamond、τ²-Bench 智能体工具使用评测,以及一项长上下文测量上击败了 GPT-6 Sol——而且它能接受音频和视频作为输入,GPT-6 Sol 则不能。一个已问世七个月的预览版,仍能在四场较量中拿下两场,这样的模型不该被一笔勾销。它的问题出在生命周期,而非能力。

数字,以及必须与之相伴的修订注意事项

Artificial Analysis 会重新运行其测试套件,并在当前指数修订版下重新发布分数,这意味着同一个模型可能因你查看的时间不同而带有两个不同的数字。对于 Gemini 3.1 Pro 而言,这种差异异常大:对该模型的早期报道在较旧修订版上报告为 57,而如今页面显示的是 v4.3.2 上的 29.7。这两个数字都是真实的,而且都出现在同一个网站上。

这很重要,因为只有来自同一修订版的数字才可以相减。这里的 29.7 和 47.6 是要使用的一对,因为两者都来自 v4.3.2 —— 同一次运行中,Claude Opus 5.5 得分为 57.6,GPT-6 Astra 得分为 52.7。同一次运行的读数,每个维度一行:

• 智能指数,v4.3.2 — GPT-6 Sol 47.6 对比 Gemini 3.1 Pro 29.7
• 每完成一项指数任务的成本 — Gemini 3.1 Pro 1.30 美元 对比 GPT-6 Sol 1.04 美元;较旧的模型每个已完成答案贵 25%
• 输入价格 — 两者均为每 100 万 2.00 美元,标称价格持平
• 输出价格 — GPT-6 Sol 10.00 美元 对比 Gemini 3.1 Pro 12.00 美元;Sol 便宜 17%
• 长上下文条款 — GPT-6 Sol 在输入超过 272,000 个 token 时,整个请求按 4.00 美元/15.00 美元重新计价;Gemini 3.1 Pro 在超过 200,000 时跳至 4.00 美元/18.00 美元
• 上下文窗口 — GPT-6 Sol 1,050,000 个 token 对比 Gemini 3.1 Pro 1,048,576 个,实际上持平
• 最大输出 — GPT-6 Sol 128,000 个 token 对比 Gemini 3.1 Pro 65,536 个;Sol 几乎是其两倍
• 输入模态 — GPT-6 Sol 支持文本、图像、文件,对比 Gemini 3.1 Pro 支持文本、图像、音频、视频、PDF

A two-column comparison scoreboard for GPT-6 Sol and Gemini 3.1 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against Gemini 3.1 Pro at 29.7, $1.30 and 65,536 tokens, with input and output prices of $2.00/$10.00 against $2.00/$12.00 and a preview-since-2026-02-19 chip. A footer reads "Index figures per Artificial Analysis v4.3.2; Gemini 3.1 Pro is a preview product."

其中两行值得展开说明,因为它们颠覆了显而易见的解读。每任务成本那一行表明,看起来更便宜的价格表其实属于每完成一项任务更贵的模型——Gemini 3.1 Pro 的 12 美元输出费率加上其推理量,所完成的工作量比其 2 美元标称输入费率所暗示的要多。而长上下文这一档,两边都值得再读一遍:Gemini 3.1 Pro 的档位从 200,000 个 token 开始,低于 GPT-6 Sol 的 272,000,但将输出重新定价为 18.00 美元,而 Sol 重新定价为 15.00 美元。两者都不是一口价的价格表,而且交叉点也对不上。

预览仍然胜出的地方

Google 的模型并非老古董。调取两张卡牌所携带的评估:

• GPQA Diamond — Gemini 3.1 Pro 94.1% 对比 GPT-6 Sol,此修订版本未发布可比数据
• τ²-Bench 智能体工具使用 — Gemini 3.1 Pro 95.6% 对比 GPT-6 Sol,未在同一榜单上发布
• 长上下文召回 — Gemini 3.1 Pro 82.0% 对比 GPT-6 Sol 83.7%,差距为 1.7 个百分点
• SciCode — Gemini 3.1 Pro 58.7% 对比 GPT-6 Sol 57.6%,基本持平
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4.0% 对比 GPT-6 Sol 43.9%;这是该预览版唯一不具竞争力的类别

A screenshot of the Artificial Analysis leaderboard: the top of the table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings - Claude Opus 5.5 (max with fallback) at 58, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and GPT-6.1 Sol (max) at 52 and $0.72 - with the Gemini 3.1 Pro Preview row set below it, showing an index of 30 at $1.30 per index task, 67M tokens generated and 22M output tokens at 23.40 tokens per second.

94.1% 的 GPQA Diamond 和 95.6% 的智能体工具使用得分属于前沿水准,而非上一代水准,这也正是 17.9 分的指数差距夸大了实际差距的原因。该指数是十项评估的综合结果,而 Gemini 3.1 Pro 的失分集中在套件权重严重偏向软件工程之处——Terminal-Bench 4.0 的 4.0% 是一个灾难性的异常值,相比之下,其 SciCode 为 58.7%,Terminal-Bench 2.1 为 73.8%。一个模型若在一个智能体基准上得分接近榜首,却在其后继基准上接近垫底,那说明的是它的训练日期,而不是它的能力上限。

音视频输入是另一项实实在在的优势,而且它是一道门槛,而非一种渐变。如果你的流水线以会议录音或屏幕录制作为输入,Gemini 3.1 Pro 能够接入,而 GPT-6 Sol 不能。再多的指数领先也无法弥补这一点。

具体来说,“仍处于预览阶段”会让你付出什么代价

预览状态并非装饰性的标签,而这类代价只有在你已经基于某物构建之后才会显现。

预览端点不附带一般可用性承诺,这意味着供应商并未承诺该模型会按照你可以据以规划的时间表继续存在。它也不附带关停日期,这听起来像是前者的好版本——没有任何东西被退役——但反过来读也是如此:Goo​gle 尚未为一个自二月起便处于此状态的模型公布生命周期,而同期却在持续发布 Flash 层级的模型。Gemini 3.8 Flash、Gemini 3.5 Flash-Lite、3.6 和 3.8 Flash 系列:Pro 层级原地不动,而继任者则以 Gemini 4 Argon 的形式到来,Goo​gle 于 2026 年 9 月 30 日宣布,以分阶段方式面向一组指定的安全合作伙伴推出,同样没有附带一般可用性日期。

这就是这次对比真正要说明的模式。如果你在 Gemini 3.1 Pro Preview 上构建一条持久可靠的流水线,你就是在基于一个连其供应商都未说明它何时会转正、被替换或退役的模型来构建。GPT-6 Sol 的处境则相反:它是一款已普遍可用(generally available)的 API 产品,有公开的价目表,而且自 2026 年 10 月 7 日起,它也成为你大多数同事所用应用中的默认选项。由供应商报告、且尚未被复现:OpenAI 称,在 ChatGPT 中,GPT-6 通过一项名为 Intelligent UI 的能力,使用文本、图形、图表和交互控件来组织答案;需要网络搜索的答案开始生成的时间比 GPT-5.6 Instant 早 44%;Extra High 努力等级开始响应的速度与 Medium 档的 GPT-5.6 一样快。这些都不会改变 API 集成的做法。而所有这些,正是 GPT-6 如今成为无处不在的默认选择、而预览版则不是的原因。

这个论点还有一个直白版本。对于一个生命周期未声明的模型,你每完成一个任务要多付 25%,能力评分却更低。反论确实成立——你能获得 94.1% 的 GPQA Diamond 和音频输入——但这是针对特定工作负载的特定论据,而不是偏好旧模型的普遍理由。

在不投注的情况下测试预览

The mistake to avoid with a model in Gemini 3.1 Pro's position is to treat "should we use it" as a single binary decision. It is not. Both Gemini 3.1 Pro Preview and GPT-6 Sol sit on OrcaRouter's catalogue behind one Ope​nAI-compatible endpoint and one key, at 0% markup over provider list price — so the preview is something you can put in a real request path, measure against your own workloads, and keep or drop without a second vendor contract or a code change.

自动故障转移正是让处于预览生命周期的模型得以安全运行的关键。将音频和视频流量路由到 Gemini 3.1 Pro——在两者之中,只有它能接收这类输入;将软件工程和长输出流量路由到 GPT-6 Sol;并配置好回退机制,使得当预览端点被弃用、受到速率限制或被悄然调价时,请求会落到一个正式可用的模型上,而不是直接失败。这才是已存在七个月的预览版本所应得的架构——不是回避,而是一条不依赖它的路径。

如果你想更进一步,路由 DSL 可以把多个模型组合成一次逻辑调用,于是一个请求就能同时试过 Gemini 3.1 Pro 和 GPT-6 Sol,再由你自己的标准而非某一家厂商的标准来挑选答案。模型融合则是在相反方向上做同一件事——由一组模型共同回答同一个问题——这是一种合理的方式,让你在把某条生产路径押注到某个预览版之前,先弄清它的哪些具体优势值得为之付费。

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the Google vendor label, a 2026-02-19 release date, a 1M-token context window, a 65K-token maximum output, text, image, audio, video and file input, and pricing of $2.00 per million input tokens and $12.00 per million output tokens.

裁决,以及值得关注的数字

对于新工作负载,GPT-6 Sol 在决定部署的六个维度中有四个是更稳妥的选择,而且它在每个已完成任务的成本上更低,同时在相同修订版本下得分高出 17.9 个指数点。对于需要音频或视频输入的工作负载,或者你真正要买的就是那 94.1% 的 GPQA Diamond 成绩时,Gemini 3.1 Pro Preview 仍然是胜出者,而 preview 这个标签是所需管理的风险,而非转身离开的理由。

要盯住的数字不是那个指数,而是 Gemini 3.1 Pro 端点名称上的日期。当 preview 后缀被去掉时——或者当 Ar 以真正的 API 标识符正式可用时——这一比较的形态就会彻底改变,而 Pro 档位上一次发布与今天之间那七个月的间隔,就成了这篇文章真正要谈论的东西。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新