
Mercury 2.5 预览版 vs Gemini 3.1 Pro:两次预览,相隔六个月
- google新Google: Gemini 3.8 Flash2026-09-0259智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
这场对决中的两款模型,名字里都带着“预览”二字,而相似之处也就到此为止。Mercury 2.5 Preview 和 Gemini 3.1 Pro 都是目前可以通过 API 调用的推理模型,但它们的“预览”状态正处在生命周期中截然相反的两端。旗舰推理模型 Gemini 3.1 Pro 自 2026 年 2 月 19 日起就一直处于预览阶段——背后已有六个月的独立评测、公开榜单排名和生产环境流量,发布时 Artificial Analysis 智能指数为 57,支持文本、图像、音频和视频的多模态输入,拥有 100 万 token 的上下文窗口,定价为每百万 token 2.00 美元 / 12.00 美元。而 Inception 的扩散式 LLM Mercury 2.5 Preview 于 2026 年 8 月 31 日发布,目前才问世两天:纯文本模型,上下文 256K,宣称每秒可处理 1,107 个 token,标价每百万 token 0.20 美元 / 0.75 美元(在 9 月 8 日前的折扣价约为 0.04 美元 / 0.15 美元),并且没有任何一项独立基准测试结果。把这两者都称为“预览版”,反而掩盖了真正的问题:在一种从根本上更快的文本生成方式面前,六个多月的证据领先优势究竟值多少钱。
每个模型到底是什么
Gemini 3.1 Pro 是一款封闭的、多模态的、通用推理旗舰模型。它能读取文本、图像、音频和视频,支持 100 万 token 的上下文窗口和 64K 的输出上限,并动态调整推理深度——厂商将其描述为随任务复杂度扩展的四级推理强度。其发布数据——ARC-AGI-2 达到 77.1%,GPQA Diamond 达到 94.3%,SWE-bench Verified 达到 80.6%,Terminal-Bench 2.0 达到 68.5%——均为厂商自行报告,但这些数据建立在六个月的独立检验之上,其中包括 Artificial Analysis 在更严格的指数尺度上进行的重新测量,该模型在该尺度上得分约为 46.5。这种重新测量正是一个成熟模型应得的:它经过了足够多的测试,以至于指数在其周围变得更具挑战性。Mercury 2.5 Preview 是一种扩散模型——它并行生成和完善 token,而非逐个生成——具有可调推理、并行工具调用和符合 schema 的 JSON,专为 Inception 所说的延迟复合型工作负载而构建:搜索代理、语音流水线、编码子代理。关于它的每一条质量声明,包括比 Mercury 2 提升超过 10 个百分点的说法,都是厂商自己的,尚未有第三方对其进行过测量。

规格对比
• 价格 — Mercury 2.5 Preview:每1M输入/输出 $0.20 / $0.75,9月8日前促销价约 $0.04 / $0.15。Gemini 3.1 Pro:每1M $2.00 / $12.00,超过200K输入后升至 $4.00 / $18.00。
• 上下文 / 输出 — Mercury 2.5 Preview:256K 上下文。Gemini 3.1 Pro:1M 上下文,64K 最大输出。
• 输入 — Mercury 2.5 预览版:仅文本。Gemini 3.1 Pro:文本、图像、音频、视频、文件。
• 架构 — Mercury 2.5 预览版:扩散式 LLM,并行令牌生成。Gemini 3.1 Pro:自回归,动态推理深度。
• 速度 — Mercury 2.5 预览版:声称达 1,107 tokens/秒。Gemini 3.1 Pro:没有可与之相比的高调宣称。
• 证据 — Mercury 2.5 Preview:仅供应商报告。Gemini 3.1 Pro:发布时AA指数为57(新标准为46.5),外加长期独立的评估记录。

多模态差距是决定性差异
对于大多数应用来说,这种比较在定价或基准测试进入考量之前就已见分晓,因为 Mercury 2.5 Preview 看不见。Gemini 3.1 Pro 能读取截图、图表、音频和视频——当你想要针对尚非文本的内容获得答案时,它就是你可以指向 PDF、图表、会议录音或 UI 的模型。Mercury 2.5 Preview 在设计上仅支持文本;这种并行生成文本的扩散语言模型完全没有图像或音频输入通道。对于文档密集型应用、视觉代理或任何多模态产品,Gemini 3.1 Pro 是这里唯一的选择,仅此而已。Mercury 2.5 Preview 的纯文本限制并非小字号的细则条款;它决定了该模型究竟有资格承担哪些工作负载。
六个月的测试对比两天
从证据来看,这不是一场较量,而且有必要直白地说出原因。Gemini 3.1 Pro 已被独立实验室拆解了六个月;它的分数被反复标定、重新测量、反复争论,这正是模型“可信赖”应有的样子。Mercury 2.5 Preview 只有一个信息来源——它的制造者——而该来源声称其智能水平比 Mercury 2 高出 10 多个百分点,并已与前沿模型中的成本优化档位持平。这两种说法都可能属实。但除了 Inception 内部人员之外,没有任何人证实过其中任何一项,而且该模型太新了,这种状况本来就在意料之中。这种不对称不在于谁更好;而在于一个是可以被认知的,另一个则还不能。
水星的速度真正赢在哪里
对 Mercury 2.5 Preview 的诚实评价是:适用范围狭窄、仅限文本,但真实成立。并行 token 生成改变了延迟的计算逻辑,这是任何自回归模型——包括 Gemini 3.1 Pro——都无法企及的,因为自回归模型在构造上就是串行的。对于语音流水线来说,讽刺之处在于输入和输出都是音频,但两者之间的思考过程却是文本:一个快速的文本推理层恰恰是让语音智能体感觉响应灵敏的关键。对于反复调用工具的搜索智能体,以及每个任务要触发许多小型补全的编码子智能体而言,单次调用的延迟会累积成感知到的速度。按首发价格——输入 $0.04,输出 $0.15——Mercury 2.5 Preview 大约比 Gemini 3.1 Pro 的标准输出费率便宜 80 倍,这不仅使它更快,而且在高吞吐量文本推理中处于不同的成本档位。但每一句话都必须附带一个前提:速度是声称的,质量等同也是声称的,而且不存在任何独立的测量验证。
定价:Gemini 的长上下文溢价对比 Mercury 的预告价
Gemini 3.1 Pro 的费率表中有一个在对比主要数字之前值得留意的细节:输入令牌超过 200K 的请求,每百万令牌的价格从 $2.00 / $12.00 阶梯式上涨至 $4.00 / $18.00。在 1M 上下文模型上,这种长上下文溢价并非边缘情况——而是真正使用该模型赖以成名的上下文窗口所需付出的代价。Mercury 2.5 Preview 没有这样的阶梯,其 256K 上下文也不太可能频繁触及长上下文区间。但 Mercury 的低价只是到 9 月 8 日截止的促销定价,而 Gemini 的则是稳定的公开费率。比较时,应拿 Mercury 的标价 $0.20 / $0.75 去对比 Gemini 的标准档位,而不是折扣后的数字——折扣是吸引你去测试的诱因,不是规划时应该依据的价格。
路由决策
这两款模型如今都已支持路由,这也改变了你应如何对待它们各自。Gemini 3.1 Pro 已在 OrcaRouter 上线,名称为 google/gemini-3.1-pro-preview,以提供商的原价转售,即 加价 0%,因此标准版和长上下文版的价格与提供商公布的价格完全一致,并且一个 API 密钥就能访问 200 多个其他模型。预览徽章恰恰是那种应该绕开而不是押注的东西——模型页面的错误率面板存在自有其道理;自动故障转移意味着,预览响应一旦质量下降,无需改动代码就会路由到第二家提供商。Mercury 2.5 Preview 尚未上线 OrcaRouter;Inception 通过自有 API 和多个第三方平台提供该模型。一个只有两天大、还不能置于故障转移之后的模型,只能算是测试候选,而非生产依赖。一旦有提供商将其上架,同样的原价转售规则也会适用,首发折扣也会于同一天生效——届时,这场对决将不再是一个决策,而是一条路由规则。
诚实的结论是,这两款预览版回答的是不同的问题。Gemini 3.1 Pro 回答的是"今天我该基于哪个模型来构建产品"——它支持多模态、长上下文,经过独立测试且稳定可靠,价格也如实反映了所有这些特性。Mercury 2.5 预览版回答的是"文本推理在物理上能快到什么程度"——其速度架构是这款模型中最引人注目的部分,正等待独立实验室确认随之而来的质量是否真实。如果你的工作负载涉及多模态或长上下文,选择早已明确。如果只是纯文本、延迟会不断累积且对价格敏感,那么 Mercury 2.5 预览版就是值得关注的押注——9月8日就是检验它的日子。

