主视觉标题卡上写着"GPT-6 Sol Pro 对比 Gemini 3.1 Pro Preview",副标题为"七个月的预览期,以及为此付出的代价",右下角是真正的 OrcaRouter 标志。
Guides & Insights

GPT-6 Sol Pro 对比 Gemini 3.1 Pro Preview:长达七个月的预览期,以及这让你付出的代价

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.1 Pro Preview 已处于预览阶段七个月。供应商于 2026 年 2 月 19 日发布该模型,定价为每百万输入 token 2.00 美元、每百万输出 token 12.00 美元;而截至本周,其模型卡仍将其描述为“以预览形式提供”,警告它“与稳定版本相比,在稳定性或可用性方面可能存在局限”,并表示它“可能会在未事先通知的情况下发生变化或被弃用”。弃用表上既没有正式可用日期,也没有关停日期。GPT-6 Sol Pro——GPT-6 Sol 的一个配置,而 GPT-6 Sol 已于 2026 年 9 月 22 日正式可用,输入 2.00 美元、输出 10.00 美元——则是相反的情形:一个生产环境 API,具备公开定价、有文档说明的推理力度调节档位,以及一家已对上述价格作出承诺的供应商。

这两个模型之间真正有意思的对比,并不在基准测试表格上,而在于各家厂商对你许下的关于下个季度的承诺。

两条价格线,其中一条是预览

两者都是供应商列表。GoogleOpenAI 自己的数字,由托管它们的平台原样传递。

• 输入 — GPT-6 Sol 每百万个 token 2.00 美元 对比 Gemini 3.1 Pro Preview 每百万个 token 2.00 美元

• 输出 — GPT-6 Sol 每百万个 token 10.00 美元,而 Gemini 3.1 Pro Preview 为每百万个 token 12.00 美元

• 长上下文——Gemini 3.1 Pro Preview 在超过 200,000 token 的阈值后,将输入价格调整为每百万 token 4.00 美元、输出价格调整为每百万 token 18.00 美元;GPT-6 Sol 则在更高的输入阈值之上采用其自身的长上下文重定价

• 缓存读取 — GPT-6 Sol 每百万 token $0.20,而 Gemini 3.1 Pro Preview 每百万 token $0.20

• 上下文窗口 — GPT-6 Sol 1,050,000 个词元 对比 Gemini 3.1 Pro Preview 1,000,000 个词元

• 最大输出 — GPT-6 Sol 128,000 tokens 对比 Gemini 3.1 Pro Preview 65,000 tokens

• 输入模态 — GPT-6 Sol 文本和图像 vs Gemini 3.1 Pro Preview 文本、图像、音频、视频和文件

• 可用性状态——GPT-6 Sol 自 2026 年 9 月 22 日起正式可用(GA),而 Gemini 3.1 Pro Preview 自 2026 年 2 月 19 日起处于预览阶段,尚未公布 GA 日期

宣传价目相差不大,因此并不构成决策依据。输入完全一致。输出则相差 20%。真正的差异在于最后两行:Gemini 多支持四种输入模态,而在另一方向上输出上限翻了一倍——65,000 对 128,000——并且已以预览版形式发布近一年。

A two-column scoreboard card titled 'GPT-6 Sol vs Gemini 3.1 Pro Preview - the scoreboard'. Left column 'GPT-6 Sol': AA Index, current 48; index at Feb 2026 not scored; price in/out $2 / $10; cost per index task $1.06; max output 128K; input modalities text + image. Right column 'Gemini 3.1 Pro Preview': AA Index, current 30; index at Feb 2026 57, retired index; price in/out $2 / $12; cost per index task $0.67; max output 65K; input modalities text, image, audio, video. A footer line reads 'Vendor list prices; index figures per Artificial Analysis.', with the real OrcaRouter logo bottom-right.

预览状态是一项真实的运行属性

谷歌自家的产品目录文本就要求开发者把预览功能的弃用纳入规划。这句话分量不轻,值得将其视为一条工程约束,而非一句免责声明。

预览模型是这样一种模型:你可以基于它来构建,却无法围绕它做规划。由此产生三个后果,而它们没有一个会出现在价格表上。

• 无稳定性承诺。卡片明确说明,与稳定版相比,该模型在稳定性方面可能存在局限,并且 OrcaRouter不会为此预览模型提供具体的延迟保证。我们在模型页面上自有的遥测数据显示,过去一周内,首 token 时间的 p50 和 p95 均为 10.00 秒,这是显示范围的上限,而非实测的中位数。

• 没有弃用日期。有停用日期的模型可以从路线图中安排移除。既没有 GA 日期也没有停用日期的模型则完全无法排期,无论朝着哪个方向——你不知道它什么时候才会变得可以安全依赖,也不知道它什么时候会停止工作。

• 无路线图定位。Google 已在同一系列中发布了更新的 Flash 模型,这些模型如今在独立综合评测中得分超过 Gemini 3.1 Pro,包括 2026 年 9 月 2 日的 Gemini 3.8 Flash。3.5 Pro 这一代被推迟,据称已被搁置。并不存在 Gemini 3.8 Pro。承载 Pro 之名的模型已不再是其厂商的最高得分者,而且它仍处于预览阶段。

对于在这两者之间做选择的人来说,这才是诚实的说法。GPT-6 Sol 问世仅六天,价格固定、公开且长期不变。Gemini 3.1 Pro Preview 已经推出七个月,却没有路线图,只有一行状态说明。

独立记录所显示的内容,以及为什么版本标签就是全部论点

Artificial Analysis 在当前指数上针对这一对模型发布了直接对比页面,这使其成为本批次中少数几个中立数据真正具有同口径可比性的对决之一。GPT-6 Sol 在 max effort 下得分为 48,每项指数任务成本为 1.06 美元。Gemini 3.1 Pro Preview 得分为 30,每项指数任务成本为 0.67 美元。

18分是一个很大的差距,而这并不是该模型在2月份时的差距。发布时,Artificial Analysis将Gemini 3.1 Pro Preview以57分排在其Intelligence Index的第一位。此后该模型没有变化。变的是这个指数——它在2026年9月19日被重新评分,而同一个未变的模型现在得分为30。两个数字都来自Artificial Analysis;两者都没错;在不注明版本的情况下把它们并列,是对该模型报道中最常见的错误,也是为什么这么多对比页面会把一个2月的领先者描述成9月的同等者。

每任务成本讲述了另一个值得算一算的故事。Gemini 的每任务成本更低——$0.67 对 $1.06——但得分也更低。每指数点成本算下来,GPT-6 Sol 是 $0.022,Gemini 也是 $0.022。按这一指标衡量,两者不相上下,而这是说明这里实际发生什么的最简洁方式:Gemini 并不是以更便宜的方式买到同等智能,而是以更便宜的方式买到更少的智能。

另外两个独立数字也应列在旁边,且都带有标注。在计算机使用基准测试 OSWorld-Verified 上,谷歌自己的评估页面报告 Gemini 3.1 Pro 为 76.2%。该数字出现在谷歌的材料以及第三方对这些材料的总结中,但并未出现在独立验证的 OSWorld 排行榜上——该榜列出了其他 Gemini 模型:3.6 Flash 为 83%,3.5 Flash 为 78.4%,却完全没有 3.1 Pro 这一行。在更难的 OSWorld 2.0 排行榜上,该模型得分为 30.6%。而在 GDPval-AA 上,该模型约为 1,316 Elo,落后于 Claude Sonnet 4.6 和 Claude Opus 4.6。

这并不是在指责对方不诚信;自我报告的数值很正常,两家厂商都会公布这类数据。它说明的是一个已有七个月的预览版实际能带来什么:足够让厂商报告的数字广泛传播,却没有足够的时间进行独立复现来核验该数字。相比之下,GPT-6 Sol 的中立记录很短、明确无误,而且只有六天。

没人提及的长达十五个月的知识空白

Gemini 3.1 Pro Preview 的知识截止日期为 2025 年 1 月。GPT-6 Sol 的截止日期则是 2026 年 4 月 20 日——晚了十五个月。

这一空白在关于这场对比的每个比较页面上都不存在,而对于某一类特定工作,它比输出价格差异更重要:任何涉及近期 API、近期库版本、近期事件或近期组织事实的内容。一个知识截止到 2025 年 1 月的模型,会自信地谈论一个已经向前推进了一年零三个月的世界,而其失败模式不是错误信息——而是一个看似合理的错误答案。对于检索增强型工作,知识截止日期几乎无关紧要,因为上下文承载了事实。对于任何依赖参数化知识的事情,它是首先要检查的约束,也是所有人最后才会检查的约束。

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing an Artificial Analysis Intelligence Index of 48 at maximum reasoning effort and 43 at high effort, a cost per index task of $1.06 and $0.37, a 1.05M-token context window, a 128k-token maximum output, and blended list pricing of $2.00 per million input tokens and $10.00 per million output tokens.

模态差距是支持 Gemini 的最有力论据,而且它确实存在。

把这场较量写成新款机型的轻松取胜,会很容易。但事实并非如此,原因就在输入行。

Gemini 3.1 Pro Preview 在同一端点上原生支持文本、图像、音频、视频和文件输入。GPT-6 Sol 支持文本和图像。对于围绕视频理解、会议转录或跨格式文档处理构建的工作负载而言,这并非功能差异——而是调用一个 API 与搭建一条三步流水线之间的差别,后者中间步骤单独计费,故障模式也成倍增加。

对此附带的诚实告诫是:一个在其托管模型页面上显示错误率为 77.6% 的预览版模型,其多模态优势必须与它是否会作答放在一起权衡。这个数字正如页面上所显示的那样,而且它高得足以让任何人在基于它进行构建之前先加以核实——而这正是关键所在。七个月过去了,关于这个模型最诚实的建议仍然是“自己测一测”,而没有人会在评价一个 GA 版本时写出这样一句话。

路由层改变算术之处

Gemini 3.1 Pro Preview 已收录于 OrcaRouter 的模型目录,价格为每百万 token 输入 $2.00、输出 $12.00、缓存读取 $0.20,上下文窗口为 1,000,000 token,输出上限为 65,000 token,支持 /v1/chat/completions 和 /v1beta/models/{model}:generateContent 端点,首 token 时间 p50 为 10.00 秒(基于过去一周我们自有模型页面上的实测数据)。提供商标价直接透传,不额外加价

GPT-6 Sol 不是我们提供的渠道之一,因此这里没有任何关于通过我们获取其价格的声明。

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), captured 23 September 2026, showing Vision, Audio, Tools, JSON and Reasoning header badges, 'by Google — 2026-02-19', a 65K-token maximum output, an input price of $2.00 and an output price of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, and both the /v1/chat/completions and /v1beta/models/{model}:generateContent endpoints.

预览模型是"该用路由、而非绑定单一模型"的教科书式案例。想要试用 Gemini 3.1 Pro Preview 的理由,和不该把生产路径建立在它之上的理由,其实是同一个特性——它可能随时变更——而一个具备自动故障转移的单一端点,正是让你只接受前者、而不必接受后者的方式。当背后的模型发生变化时,请求形态并不会改变,因此回退路径只是一条配置项,而不是一次迁移。这一点在这里比在大多数组合对比中都更为重要,因为在故障转移链中最有可能接替这个模型的,是同一厂商更新的 Flash,使用同一个密钥,而输出价格只是它的一小部分。

决策规则

• 单次调用即可处理视频、音频或混合格式输入 —— Gemini 3.1 Pro Preview。GPT-6 Sol 一栏中没有任何一项能接受视频文件,而任何价格差异都无法弥补你不得不自行搭建的数据摄取管线。

• 任何附带可用性承诺的东西——GPT-6 Sol。问世六天,已正式全面可用,公布的价格被描述为永久有效,还有一个有文档记录的投入力度调节档位。这才叫可调度。

• 长篇幅生成 —— GPT-6 Sol,卡点在输出上限而非速率。128,000 个 token 对 65,000 个,这才是合成类任务中首先触及的瓶颈,而且它比 20% 的输出价格差更早成为限制。

• 评估 Gemini 3.1 Pro Preview —— 要放在故障转移路径后面来做,并且在确定工作负载规模之前,自己先测量错误率。预览了七个月,托管页面上显示的 77.6% 错误率,这还不是一件已经定型的工具。

• 如果你的计划依赖于该模型下个季度依然便宜——两者都靠不住。Gemini 的预览版可能在不另行通知的情况下调价或下架,而 GPT-6 Sol 的价格之所以“永久”,仅仅是因为 OpenAI 这周这么说了。统一费率是一种承诺,而非保证;它只是比预览版定价卡所作出的承诺更强一些罢了。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新