“Mercury 2.5 vs Mercury 2.5 Preview” 的主视觉标题卡片,副标题为“一个扩散模型,两个发布日期——生产版升级实际改变了什么”。下方排列着三个标签:一个分栏图标,标注为“相同引擎”;一个闪电图标,标注为“1,107 tok/s 宣称”;以及一个时钟图标,标注为“8月31日 vs 9月8日”。OrcaRouter 的标志位于右下角。
Guides & Insights

Mercury 2.5 对比 Mercury 2.5 预览版:同一个扩散模型,两个发布日期

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在这场正面比较中,两位竞争者的模型卡片是同一张。Inception 于 2026 年 8 月 31 日发布的 Mercury 2.5 Preview,以及于 2026 年 9 月 8 日发布的 Mercury 2.5,其实是同一个扩散语言模型,只是相隔八天:一个是为开发者开放的预览通道,另一个是一周后推出的“企业就绪”生产版本。Inception 没有公布 Mercury 2.5 有不同检查点、不同速度数据或不同价格——而两次公告之间确有变动的数字,看起来像是梳理修正,而非新模型。上下文长度从预览页的 256K 在发布时修正为 260K;与 Mercury 2 相比的智能提升也从“超过 10 个百分点”(预览材料)重新表述为“40%”(发布材料)。引擎、每秒 1107 个 token 的说法以及价格表都完全相同。所以这不是通常的参数表对决,硬凑一条反而有失诚实。这两个名称之间真正重要的比较,在于包装和时机:生产版发布实际改变了什么、Preview 标签原本在告诉你什么,以及你的 API 调用现在应该使用哪个名称。

为什么一个模型会与自身进行比较?

厂商通常的做法是:先预览一个模型,然后悄悄把它并入主型号;预览列表随之消失,也没有人记录这场对决。Inception 则不同——它让两个名称并排运行了一周,预览版身份直到现在才正式退役——这正是这篇对比有实质内容的原因。Preview 是 Inception 用来将扩散模型押注快速交到开发者手中的快车道。它于 8 月 31 日上线,附带的规格表正是如今 Mercury 2.5 的规格表:一个扩散 LLM(dLLM),并行生成和优化 token 块,而非逐 token 输出;声称在标准 GPU 上每秒可处理 1,107 个 token;首 token 时间低于 300 毫秒;260K-token 上下文窗口,支持 65,536-token 输出;可调的推理等级;原生工具调用、并行工具调用和结构化输出。上述每一项数字都是 Inception 自家公布的,Preview 发布时还没有任何独立实验室实测过该模型。

9月8日,Inception 发布了 Mercury 2.5,称其为“扩散式大语言模型的下一代智能层级”,也是其生产环境中速度最快的推理模型——面向企业级应用,专为语音代理、编程子代理、企业搜索和支持工作负载而设计。规格一样,定位一样,价目表也一样。本次发布还预告了两款姊妹产品,彰显了 Inception 的未来方向:Mercury Voice——一款专为语音代理优化、首 token 延迟低于 170 毫秒的 dLLM;以及 Mercury Router——它可以根据质量、速度和成本在模型间路由提示。Mercury 2.5 是为延迟敏感、智能体化工作负载而生的产品线旗舰,而非面向顶尖质量层级。

9月8日的发布实际上改变了什么

逐行比较这两个名称,差异并非引擎本身,而是引擎周围的一切:

状态 — Mercury 2.5 预览版:一个封闭式预览版,可能“更改行为或可用性”。Mercury 2.5:一个生产版本,以企业级就绪承诺、销售渠道和注明日期的生产列表正式推出。

身份——Inception 的模型页面现在列出了 Mercury 2.5、Mercury Voice 和 Mercury Router,完全不见 Preview 的踪影;支持脚注则指出,Mercury 1、Mercury 2 和 Mercury Edit 2 是“现有客户仍受支持”的模型。Preview 在这两个列表中均未出现。就供应商而言,Preview 标签已被并入 Mercury 2.5。

端点——Inception 的开发者平台以 mercury-2.5 的名称提供该模型;9 月 8 日上线的正式列表就是新流量访问的入口。在 8 月下旬最初承载 Preview 的目录中,Preview 名称现在已不再解析到任何实际生效的端点,而 9 月 8 日新增的 Mercury 2.5 列表则负责应答。凡是按 Preview 名称写过代码的开发者,都应重新指向 Mercury 2.5,并确认服务商实际计费的项目——你在第一周集成的那个 id 正是要被停用的一个。

价格 — 相同的列表和相同的折扣。两者均为每百万输入 $0.20 和每百万输出 $0.75,缓存输入为 $0.02,而且两者上线时都约打了八折:$0.04 / $0.15,缓存 $0.004。Preview 的折扣明确限制到 9 月 8 日;Mercury 2.5 上线时同样提供八折优惠,而截至撰稿时其生产列表显示的仍是折扣价。这就是陷阱,下面详述。

入门引导:正式发布为新的开发者账户新增了免费Token额度——发布材料称这一额度为1亿个Token——并开通了预览版所没有的企业联系渠道。

证据——未变。两个名称都没有独立的基准测试,供应商的说法仍是同样的说辞,只是措辞略有不同:预览材料中称比 Mercury 2 智能水平“高出 10 分以上”,到发布材料中变成了“提升 40%”,同时还宣称与成本优化的前沿层级持平(低强度模式下的 GPT-5.6 LunaGemini 3.5 Flash-LiteClaude Haiku 4.5),以及同样由供应商报告的 GPQA Diamond 79% 和 IFBench 77% 的成绩。重复陈述的说法并不等于经过验证的说法。

A two-column comparison card titled 'Mercury 2.5 Preview vs Mercury 2.5 — what actually changed'. Left column 'Mercury 2.5 Preview, released Aug 31, 2026': Release Aug 31, 2026; Status closed preview; Engine diffusion dLLM, 260K ctx; Serving preview id retired from the catalog; Price $0.20/$0.75 list, 80% off intro; Evidence none independent. Right column 'Mercury 2.5, released Sep 8, 2026': Release Sep 8, 2026; Status production, enterprise-ready; Engine same, no new checkpoint disclosed; Serving mercury-2.5 id live, serving traffic; Price $0.20/$0.75 list, 80% off launch; Evidence none independent. Footer reads 'Same engine under two labels — the delta is lifecycle, not spec. All figures vendor-reported.' The OrcaRouter logo is in the bottom-right corner.

配对核心中的定价陷阱

因为这两个名称享有相同的标价和相同的80%促销价,人们很容易假设它们始终成本一致。事实并非必须如此。Preview的折扣在9月8日硬性截止;Mercury 2.5的上线折扣则按全新的计时器运行。曾有一整周的时间,拨打Preview完全可能按$0.20 / $0.75计费,而同一个引擎在其生产名称下应答却只收$0.04 / $0.15——或者更可能的情况是,你挂在一个Preview ID上,它早已悄悄停止服务,账单却仍在不断寄来。这种按端点过期生效的上线折扣,恰恰就是那种把“同款模型、同等价格”的故事变成实际成本差异的细则条款。

真正的价格是标价,真正稳妥的建议是围绕标价做预算:每百万 token 输入 $0.20 / 输出 $0.75,缓存输入 $0.02 —— 对于一个拥有 260K 上下文的推理模型来说很便宜,明显低于旗舰档,但也不是发布横幅上宣传的 $0.04 / $0.15。把折扣价当作有时限的试驾价格,核对你代码中使用的确切模型 ID 对应提供商的计费,而不是营销页面上的名称;如果你是在 Preview 上接入的,请在过期或被弃用的端点替你做出决定之前迁移到 Mercury 2.5。

这也是路由层所要消除的那一类问题。一个模型路由器将提供商的标价以0%加价原样直通,从而显示供应商实际收取的价格;该价格会在上线折扣生效或到期的当天更新;当底层某个端点被停用时,自动故障转移也能让调用持续不断。截至本文撰写时,Mercury 2.5 尚未上架 OrcaRouter——Inception 正通过自己的 API 以及多个第三方平台提供该模型——因此目前,关于该费率应以供应商的模型页面为准。一旦有提供商将其上架,你只需一个密钥即可获得这些直通机制;价格下调或折扣到期也会在公布当天就显示在我们这边。

两个名字共有的证据问题

这对组合的诚实记分卡很短,因为两列是同一个模型,且都同样缺乏实证。截至2026年9月9日,Mercury 2.5 和 Mercury 2.5 Preview 都没有独立的指数评分、可复现的运行记录或竞技场排名。Inception 自己的说法——相对于 Mercury 2 的智能跃升、与 Haiku 4.5 层级相当、GPQA Diamond 79% 的正确率、每秒 1107 个 token——都是公司的一面之词,而且两个名称下的说法完全相同,因为模型本身就是同一个。

在该产品系列中,唯一的一项独立证据指明了应如何解读这项目速度声明。Artificial Analysis 测量了前一代产品 Mercury 2:在生产端点上每秒处理 684 个 token,智能指数得分 22——确实很快,也证明扩散方法并非空中楼阁,但远低于 Inception 宣称该模型在 Blackwell 硬件上约每秒 1,000 个 token 的速度。预计 Mercury 2.5 声称的每秒 1,107 个 token 与共享多租户端点在真实负载下实际能达到的水平之间,也会存在类似的差距。质量方面也需同样审慎:一款全新的扩散模型在媲美 Claude Haiku 4.5 的说法上,仅出自制造商的自我测评,在第三方运行验证之前,不应轻信。

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the predecessor Mercury 2.5 builds on, showing its Intelligence Index score of 22, its independently measured output speed of 684 tokens per second, its $0.25 input / $0.75 output pricing, and its 128K context window.

已经开始追踪该发布的平台恰恰反映了这一局面。于9月8日发布的Mercury 2.5的BenchLM记录,既未给出公开分数,也未给出公开排名;其中包含Inception的79% GPQA Diamond和77% IFBench数据,且明确标注为提供商自行报告,并注明独立运行速度尚未被实测。首个Artificial Analysis索引条目、一个LMArena排名成绩或一次复现的GPQA运行,都将使Mercury 2.5从一项声明变成一个可比较的对象——而这一点将同时适用于两个名称,因为有待测量的模型只有一个。

A screenshot of the BenchLM model record for Mercury 2.5 (captured September 9, 2026), showing 'No public score yet' and 'No public rank', the model noted as released September 8, 2026 with a 260K context window, and the decision note that Inception reports 79% on GPQA Diamond and 77% on IFBench as provider-reported results with independent runtime speed not yet measured.

你应该叫哪个名字?

新集成,无历史包袱:调用 Mercury 2.5,忽略 Preview。生产名称带有同样的引擎、现阶段同样的折扣、企业条款,并保证它就是供应商实际在提供服务的那个 id。Preview 只会徒增不稳定风险,别无他用。

已集成 Preview:现在就去查一下,你的提供商在该名称下提供的是什么、它对此收多少费。将你的客户端重新指向 Mercury 2.5 的 id,并确认费率。如今仍在生产代码中保留 Preview 这个名称,无异于打赌一个明确设定了时限的预览通道能活过自己的退役之日。

企业级或生产关键型流量:应通过 Inception 的企业级路径使用 Mercury 2.5,而不要使用背后没有任何承诺的预览标签。语音与路由需求应分别使用 Mercury Voice 和 Mercury Router,而这两者本身目前仍为预览版。

任何评估扩散层级的用户:两个名称对应的是同一个评估目标,因此只需对 Mercury 2.5 运行一次评估,结果即可视为适用于该模型系列。按标价做预算;在独立评分公布前,请把厂商的说法当作假设来权衡。

看什么

未来几周,三件事将让这场双版本之争尘埃落定。首先,{{1}}首个独立基准测试——无论是拿到一个指数席位,还是复现一次 GPQA 或 AIME 跑分——将检验“与 Preview 同级”这一说法,而整盘商业赌局押注的正是它{{/1}}。其次,{{2}}Preview 这一身份是否会从模型生态中彻底消失,就像 Inception 自己的模型页面已经暗示的那样{{/2}}。第三,{{3}}80% 的发布折扣会怎么走——Preview 当初锚定的 9 月 8 日已经过去:若延长折扣,Mercury 2.5 便拥有结构性低价;若回调至 $0.20 / $0.75,则只会让它仅仅算得上有竞争力{{/3}}。在那之前,对于“Mercury 2.5 还是 Mercury 2.5 Preview?”这个问题,正确答案是:它们是同一个模型,你应该调用那个仍然以产品形态存在的版本。