用于“Mercury 2.5 Preview vs Gemini 3.1 Pro”对比的主标题卡片,副标题为“两个预览版,时隔六个月”。左侧面板标注“Mercury 2.5 Preview”,显示一个闪电图标、一个“256K 上下文”胶囊标签、一个“仅文本”标签和一个“$0.04 入门价”胶囊;右侧面板标注“Gemini 3.1 Pro”,显示一组多模态字形(图像、音频、视频)、一个“1M 上下文”胶囊标签、一个“发布时 AA Index 57”徽章和一个“$2.00 / $12.00”胶囊。两者之间有一个细长的“vs”徽章。OrcaRouter 标志合成在右下角。
Guides & Insights

Mercury 2.5 预览版 vs Gemini 3.1 Pro:两次预览,相隔六个月

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这场对决中的两款模型,名字里都带着“预览”二字,而相似之处也就到此为止。Mercury 2.5 Preview 和 Gemini 3.1 Pro 都是目前可以通过 API 调用的推理模型,但它们的“预览”状态正处在生命周期中截然相反的两端。旗舰推理模型 Gemini 3.1 Pro 自 2026 年 2 月 19 日起就一直处于预览阶段——背后已有六个月的独立评测、公开榜单排名和生产环境流量,发布时 Artificial Analysis 智能指数为 57,支持文本、图像、音频和视频的多模态输入,拥有 100 万 token 的上下文窗口,定价为每百万 token 2.00 美元 / 12.00 美元。而 Inception 的扩散式 LLM Mercury 2.5 Preview 于 2026 年 8 月 31 日发布,目前才问世两天:纯文本模型,上下文 256K,宣称每秒可处理 1,107 个 token,标价每百万 token 0.20 美元 / 0.75 美元(在 9 月 8 日前的折扣价约为 0.04 美元 / 0.15 美元),并且没有任何一项独立基准测试结果。把这两者都称为“预览版”,反而掩盖了真正的问题:在一种从根本上更快的文本生成方式面前,六个多月的证据领先优势究竟值多少钱。

每个模型到底是什么

Gemini 3.1 Pro 是一款封闭的、多模态的、通用推理旗舰模型。它能读取文本、图像、音频和视频,支持 100 万 token 的上下文窗口和 64K 的输出上限,并动态调整推理深度——厂商将其描述为随任务复杂度扩展的四级推理强度。其发布数据——ARC-AGI-2 达到 77.1%,GPQA Diamond 达到 94.3%,SWE-bench Verified 达到 80.6%,Terminal-Bench 2.0 达到 68.5%——均为厂商自行报告,但这些数据建立在六个月的独立检验之上,其中包括 Artificial Analysis 在更严格的指数尺度上进行的重新测量,该模型在该尺度上得分约为 46.5。这种重新测量正是一个成熟模型应得的:它经过了足够多的测试,以至于指数在其周围变得更具挑战性。Mercury 2.5 Preview 是一种扩散模型——它并行生成和完善 token,而非逐个生成——具有可调推理、并行工具调用和符合 schema 的 JSON,专为 Inception 所说的延迟复合型工作负载而构建:搜索代理、语音流水线、编码子代理。关于它的每一条质量声明,包括比 Mercury 2 提升超过 10 个百分点的说法,都是厂商自己的,尚未有第三方对其进行过测量。

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the diffusion model Mercury 2.5 Preview builds on, showing its independently measured output speed of 684 tokens per second, its $0.25 / $0.75 per-1M pricing, its 128K context window, and its Intelligence Index score of 22.

规格对比

价格 — Mercury 2.5 Preview:每1M输入/输出 $0.20 / $0.75,9月8日前促销价约 $0.04 / $0.15。Gemini 3.1 Pro:每1M $2.00 / $12.00,超过200K输入后升至 $4.00 / $18.00。

上下文 / 输出 — Mercury 2.5 Preview:256K 上下文。Gemini 3.1 Pro:1M 上下文,64K 最大输出。

输入 — Mercury 2.5 预览版:仅文本。Gemini 3.1 Pro:文本、图像、音频、视频、文件。

架构 — Mercury 2.5 预览版:扩散式 LLM,并行令牌生成。Gemini 3.1 Pro:自回归,动态推理深度。

速度 — Mercury 2.5 预览版:声称达 1,107 tokens/秒。Gemini 3.1 Pro:没有可与之相比的高调宣称。

证据 — Mercury 2.5 Preview:仅供应商报告。Gemini 3.1 Pro:发布时AA指数为57(新标准为46.5),外加长期独立的评估记录。

A two-column scoreboard titled 'Mercury 2.5 Preview vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mercury 2.5 Preview': 'Price: $0.20 / $0.75 (intro $0.04 / $0.15)', 'Inputs: text only', 'Context: 256K', 'Speed: 1,107 tok/s (claimed)', 'Independent score: none yet', 'Preview since: Aug 31, 2026'. Right column 'Gemini 3.1 Pro': 'Price: $2.00 / $12.00', 'Inputs: text, image, audio, video', 'Context: 1M', 'Speed: autoregressive', 'Independent score: AA Index 57 at launch', 'Preview since: Feb 19, 2026'. A footer reads 'Gemini index per Artificial Analysis; Mercury figures vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

多模态差距是决定性差异

对于大多数应用来说,这种比较在定价或基准测试进入考量之前就已见分晓,因为 Mercury 2.5 Preview 看不见。Gemini 3.1 Pro 能读取截图、图表、音频和视频——当你想要针对尚非文本的内容获得答案时,它就是你可以指向 PDF、图表、会议录音或 UI 的模型。Mercury 2.5 Preview 在设计上仅支持文本;这种并行生成文本的扩散语言模型完全没有图像或音频输入通道。对于文档密集型应用、视觉代理或任何多模态产品,Gemini 3.1 Pro 是这里唯一的选择,仅此而已。Mercury 2.5 Preview 的纯文本限制并非小字号的细则条款;它决定了该模型究竟有资格承担哪些工作负载。

六个月的测试对比两天

从证据来看,这不是一场较量,而且有必要直白地说出原因。Gemini 3.1 Pro 已被独立实验室拆解了六个月;它的分数被反复标定、重新测量、反复争论,这正是模型“可信赖”应有的样子。Mercury 2.5 Preview 只有一个信息来源——它的制造者——而该来源声称其智能水平比 Mercury 2 高出 10 多个百分点,并已与前沿模型中的成本优化档位持平。这两种说法都可能属实。但除了 Inception 内部人员之外,没有任何人证实过其中任何一项,而且该模型太新了,这种状况本来就在意料之中。这种不对称不在于谁更好;而在于一个是可以被认知的,另一个则还不能。

水星的速度真正赢在哪里

对 Mercury 2.5 Preview 的诚实评价是:适用范围狭窄、仅限文本,但真实成立。并行 token 生成改变了延迟的计算逻辑,这是任何自回归模型——包括 Gemini 3.1 Pro——都无法企及的,因为自回归模型在构造上就是串行的。对于语音流水线来说,讽刺之处在于输入和输出都是音频,但两者之间的思考过程却是文本:一个快速的文本推理层恰恰是让语音智能体感觉响应灵敏的关键。对于反复调用工具的搜索智能体,以及每个任务要触发许多小型补全的编码子智能体而言,单次调用的延迟会累积成感知到的速度。按首发价格——输入 $0.04,输出 $0.15——Mercury 2.5 Preview 大约比 Gemini 3.1 Pro 的标准输出费率便宜 80 倍,这不仅使它更快,而且在高吞吐量文本推理中处于不同的成本档位。但每一句话都必须附带一个前提:速度是声称的,质量等同也是声称的,而且不存在任何独立的测量验证。

定价:Gemini 的长上下文溢价对比 Mercury 的预告价

Gemini 3.1 Pro 的费率表中有一个在对比主要数字之前值得留意的细节:输入令牌超过 200K 的请求,每百万令牌的价格从 $2.00 / $12.00 阶梯式上涨至 $4.00 / $18.00。在 1M 上下文模型上,这种长上下文溢价并非边缘情况——而是真正使用该模型赖以成名的上下文窗口所需付出的代价。Mercury 2.5 Preview 没有这样的阶梯,其 256K 上下文也不太可能频繁触及长上下文区间。但 Mercury 的低价只是到 9 月 8 日截止的促销定价,而 Gemini 的则是稳定的公开费率。比较时,应拿 Mercury 的标价 $0.20 / $0.75 去对比 Gemini 的标准档位,而不是折扣后的数字——折扣是吸引你去测试的诱因,不是规划时应该依据的价格。

路由决策

这两款模型如今都已支持路由,这也改变了你应如何对待它们各自。Gemini 3.1 Pro 已在 OrcaRouter 上线,名称为 google/gemini-3.1-pro-preview,以提供商的原价转售,即 加价 0%,因此标准版和长上下文版的价格与提供商公布的价格完全一致,并且一个 API 密钥就能访问 200 多个其他模型。预览徽章恰恰是那种应该绕开而不是押注的东西——模型页面的错误率面板存在自有其道理;自动故障转移意味着,预览响应一旦质量下降,无需改动代码就会路由到第二家提供商。Mercury 2.5 Preview 尚未上线 OrcaRouter;Inception 通过自有 API 和多个第三方平台提供该模型。一个只有两天大、还不能置于故障转移之后的模型,只能算是测试候选,而非生产依赖。一旦有提供商将其上架,同样的原价转售规则也会适用,首发折扣也会于同一天生效——届时,这场对决将不再是一个决策,而是一条路由规则。

诚实的结论是,这两款预览版回答的是不同的问题。Gemini 3.1 Pro 回答的是"今天我该基于哪个模型来构建产品"——它支持多模态、长上下文,经过独立测试且稳定可靠,价格也如实反映了所有这些特性。Mercury 2.5 预览版回答的是"文本推理在物理上能快到什么程度"——其速度架构是这款模型中最引人注目的部分,正等待独立实验室确认随之而来的质量是否真实。如果你的工作负载涉及多模态或长上下文,选择早已明确。如果只是纯文本、延迟会不断累积且对价格敏感,那么 Mercury 2.5 预览版就是值得关注的押注——9月8日就是检验它的日子。

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the model header, the Home > Models > Google breadcrumb, the February 19, 2026 preview start date, and the description of Google's frontier reasoning model.
© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube