
Mercury 2.5 对比 Mercury 2.5 预览版:同一个扩散模型,两个发布日期
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
在这场正面比较中,两位竞争者的模型卡片是同一张。Inception 于 2026 年 8 月 31 日发布的 Mercury 2.5 Preview,以及于 2026 年 9 月 8 日发布的 Mercury 2.5,其实是同一个扩散语言模型,只是相隔八天:一个是为开发者开放的预览通道,另一个是一周后推出的“企业就绪”生产版本。Inception 没有公布 Mercury 2.5 有不同检查点、不同速度数据或不同价格——而两次公告之间确有变动的数字,看起来像是梳理修正,而非新模型。上下文长度从预览页的 256K 在发布时修正为 260K;与 Mercury 2 相比的智能提升也从“超过 10 个百分点”(预览材料)重新表述为“40%”(发布材料)。引擎、每秒 1107 个 token 的说法以及价格表都完全相同。所以这不是通常的参数表对决,硬凑一条反而有失诚实。这两个名称之间真正重要的比较,在于包装和时机:生产版发布实际改变了什么、Preview 标签原本在告诉你什么,以及你的 API 调用现在应该使用哪个名称。
为什么一个模型会与自身进行比较?
厂商通常的做法是:先预览一个模型,然后悄悄把它并入主型号;预览列表随之消失,也没有人记录这场对决。Inception 则不同——它让两个名称并排运行了一周,预览版身份直到现在才正式退役——这正是这篇对比有实质内容的原因。Preview 是 Inception 用来将扩散模型押注快速交到开发者手中的快车道。它于 8 月 31 日上线,附带的规格表正是如今 Mercury 2.5 的规格表:一个扩散 LLM(dLLM),并行生成和优化 token 块,而非逐 token 输出;声称在标准 GPU 上每秒可处理 1,107 个 token;首 token 时间低于 300 毫秒;260K-token 上下文窗口,支持 65,536-token 输出;可调的推理等级;原生工具调用、并行工具调用和结构化输出。上述每一项数字都是 Inception 自家公布的,Preview 发布时还没有任何独立实验室实测过该模型。
9月8日,Inception 发布了 Mercury 2.5,称其为“扩散式大语言模型的下一代智能层级”,也是其生产环境中速度最快的推理模型——面向企业级应用,专为语音代理、编程子代理、企业搜索和支持工作负载而设计。规格一样,定位一样,价目表也一样。本次发布还预告了两款姊妹产品,彰显了 Inception 的未来方向:Mercury Voice——一款专为语音代理优化、首 token 延迟低于 170 毫秒的 dLLM;以及 Mercury Router——它可以根据质量、速度和成本在模型间路由提示。Mercury 2.5 是为延迟敏感、智能体化工作负载而生的产品线旗舰,而非面向顶尖质量层级。
9月8日的发布实际上改变了什么
逐行比较这两个名称,差异并非引擎本身,而是引擎周围的一切:
• 状态 — Mercury 2.5 预览版:一个封闭式预览版,可能“更改行为或可用性”。Mercury 2.5:一个生产版本,以企业级就绪承诺、销售渠道和注明日期的生产列表正式推出。
• 身份——Inception 的模型页面现在列出了 Mercury 2.5、Mercury Voice 和 Mercury Router,完全不见 Preview 的踪影;支持脚注则指出,Mercury 1、Mercury 2 和 Mercury Edit 2 是“现有客户仍受支持”的模型。Preview 在这两个列表中均未出现。就供应商而言,Preview 标签已被并入 Mercury 2.5。
• 端点——Inception 的开发者平台以 mercury-2.5 的名称提供该模型;9 月 8 日上线的正式列表就是新流量访问的入口。在 8 月下旬最初承载 Preview 的目录中,Preview 名称现在已不再解析到任何实际生效的端点,而 9 月 8 日新增的 Mercury 2.5 列表则负责应答。凡是按 Preview 名称写过代码的开发者,都应重新指向 Mercury 2.5,并确认服务商实际计费的项目——你在第一周集成的那个 id 正是要被停用的一个。
• 价格 — 相同的列表和相同的折扣。两者均为每百万输入 $0.20 和每百万输出 $0.75,缓存输入为 $0.02,而且两者上线时都约打了八折:$0.04 / $0.15,缓存 $0.004。Preview 的折扣明确限制到 9 月 8 日;Mercury 2.5 上线时同样提供八折优惠,而截至撰稿时其生产列表显示的仍是折扣价。这就是陷阱,下面详述。
• 入门引导:正式发布为新的开发者账户新增了免费Token额度——发布材料称这一额度为1亿个Token——并开通了预览版所没有的企业联系渠道。
• 证据——未变。两个名称都没有独立的基准测试,供应商的说法仍是同样的说辞,只是措辞略有不同:预览材料中称比 Mercury 2 智能水平“高出 10 分以上”,到发布材料中变成了“提升 40%”,同时还宣称与成本优化的前沿层级持平(低强度模式下的 GPT-5.6 Luna、Gemini 3.5 Flash-Lite、Claude Haiku 4.5),以及同样由供应商报告的 GPQA Diamond 79% 和 IFBench 77% 的成绩。重复陈述的说法并不等于经过验证的说法。

配对核心中的定价陷阱
因为这两个名称享有相同的标价和相同的80%促销价,人们很容易假设它们始终成本一致。事实并非必须如此。Preview的折扣在9月8日硬性截止;Mercury 2.5的上线折扣则按全新的计时器运行。曾有一整周的时间,拨打Preview完全可能按$0.20 / $0.75计费,而同一个引擎在其生产名称下应答却只收$0.04 / $0.15——或者更可能的情况是,你挂在一个Preview ID上,它早已悄悄停止服务,账单却仍在不断寄来。这种按端点过期生效的上线折扣,恰恰就是那种把“同款模型、同等价格”的故事变成实际成本差异的细则条款。
真正的价格是标价,真正稳妥的建议是围绕标价做预算:每百万 token 输入 $0.20 / 输出 $0.75,缓存输入 $0.02 —— 对于一个拥有 260K 上下文的推理模型来说很便宜,明显低于旗舰档,但也不是发布横幅上宣传的 $0.04 / $0.15。把折扣价当作有时限的试驾价格,核对你代码中使用的确切模型 ID 对应提供商的计费,而不是营销页面上的名称;如果你是在 Preview 上接入的,请在过期或被弃用的端点替你做出决定之前迁移到 Mercury 2.5。
这也是路由层所要消除的那一类问题。一个模型路由器将提供商的标价以0%加价原样直通,从而显示供应商实际收取的价格;该价格会在上线折扣生效或到期的当天更新;当底层某个端点被停用时,自动故障转移也能让调用持续不断。截至本文撰写时,Mercury 2.5 尚未上架 OrcaRouter——Inception 正通过自己的 API 以及多个第三方平台提供该模型——因此目前,关于该费率应以供应商的模型页面为准。一旦有提供商将其上架,你只需一个密钥即可获得这些直通机制;价格下调或折扣到期也会在公布当天就显示在我们这边。
两个名字共有的证据问题
这对组合的诚实记分卡很短,因为两列是同一个模型,且都同样缺乏实证。截至2026年9月9日,Mercury 2.5 和 Mercury 2.5 Preview 都没有独立的指数评分、可复现的运行记录或竞技场排名。Inception 自己的说法——相对于 Mercury 2 的智能跃升、与 Haiku 4.5 层级相当、GPQA Diamond 79% 的正确率、每秒 1107 个 token——都是公司的一面之词,而且两个名称下的说法完全相同,因为模型本身就是同一个。
在该产品系列中,唯一的一项独立证据指明了应如何解读这项目速度声明。Artificial Analysis 测量了前一代产品 Mercury 2:在生产端点上每秒处理 684 个 token,智能指数得分 22——确实很快,也证明扩散方法并非空中楼阁,但远低于 Inception 宣称该模型在 Blackwell 硬件上约每秒 1,000 个 token 的速度。预计 Mercury 2.5 声称的每秒 1,107 个 token 与共享多租户端点在真实负载下实际能达到的水平之间,也会存在类似的差距。质量方面也需同样审慎:一款全新的扩散模型在媲美 Claude Haiku 4.5 的说法上,仅出自制造商的自我测评,在第三方运行验证之前,不应轻信。

已经开始追踪该发布的平台恰恰反映了这一局面。于9月8日发布的Mercury 2.5的BenchLM记录,既未给出公开分数,也未给出公开排名;其中包含Inception的79% GPQA Diamond和77% IFBench数据,且明确标注为提供商自行报告,并注明独立运行速度尚未被实测。首个Artificial Analysis索引条目、一个LMArena排名成绩或一次复现的GPQA运行,都将使Mercury 2.5从一项声明变成一个可比较的对象——而这一点将同时适用于两个名称,因为有待测量的模型只有一个。

你应该叫哪个名字?
• 新集成,无历史包袱:调用 Mercury 2.5,忽略 Preview。生产名称带有同样的引擎、现阶段同样的折扣、企业条款,并保证它就是供应商实际在提供服务的那个 id。Preview 只会徒增不稳定风险,别无他用。
• 已集成 Preview:现在就去查一下,你的提供商在该名称下提供的是什么、它对此收多少费。将你的客户端重新指向 Mercury 2.5 的 id,并确认费率。如今仍在生产代码中保留 Preview 这个名称,无异于打赌一个明确设定了时限的预览通道能活过自己的退役之日。
• 企业级或生产关键型流量:应通过 Inception 的企业级路径使用 Mercury 2.5,而不要使用背后没有任何承诺的预览标签。语音与路由需求应分别使用 Mercury Voice 和 Mercury Router,而这两者本身目前仍为预览版。
• 任何评估扩散层级的用户:两个名称对应的是同一个评估目标,因此只需对 Mercury 2.5 运行一次评估,结果即可视为适用于该模型系列。按标价做预算;在独立评分公布前,请把厂商的说法当作假设来权衡。
看什么
未来几周,三件事将让这场双版本之争尘埃落定。首先,{{1}}首个独立基准测试——无论是拿到一个指数席位,还是复现一次 GPQA 或 AIME 跑分——将检验“与 Preview 同级”这一说法,而整盘商业赌局押注的正是它{{/1}}。其次,{{2}}Preview 这一身份是否会从模型生态中彻底消失,就像 Inception 自己的模型页面已经暗示的那样{{/2}}。第三,{{3}}80% 的发布折扣会怎么走——Preview 当初锚定的 9 月 8 日已经过去:若延长折扣,Mercury 2.5 便拥有结构性低价;若回调至 $0.20 / $0.75,则只会让它仅仅算得上有竞争力{{/3}}。在那之前,对于“Mercury 2.5 还是 Mercury 2.5 Preview?”这个问题,正确答案是:它们是同一个模型,你应该调用那个仍然以产品形态存在的版本。
