
Mercury 2.5 预览版 vs Grok 4.6:1,107 token/秒的预览版能否撼动性价比之王?
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
一句话概括答案:Mercury 2.5 Preview 是当今生产环境中最便宜的可信推理模型,每百万 token 定价 0.04/0.15 美元;Grok 4.6 是智能前沿最便宜的模型,每百万 token 定价 2.00/6.00 美元。因此,两者之间的实际问题在于:Inception 仅声称“堪比”GPT-5.6 Luna(Low)和 Claude Haiku 4.5 的预览版扩散模型,能否胜任那些你原本需要为前沿层级付费的工作。Mercury 2.5 Preview 于 2026 年 8 月 31 日发布,可并行生成 token,并声称在标准 GPU 上每秒可生成 1,107 个 token;Grok 4.6 是 2026 年 8 月 12 日发布的前沿旗舰,在 Artificial Analysis Intelligence Index 上得分 61,并列全球第三,而且以前沿模型前所未有的价格做到了这一点。这种碰撞——价格曲线底端的最快速度宣称与顶端的最佳性价比相遇——正是本文的主题。
关键要点
• Grok 4.6($2.00 / $6.00),AA 智能指数 61,是前沿层级中的性价比冠军;Mercury 2.5 Preview($0.04 / $0.15)则是一场豪赌——用五十分之一的价格买到足够好的质量,胜过你很少用得上的顶尖质量。
• Mercury 2.5 Preview 的速度与质量声明完全出自 Inception;上线首日尚无任何独立的基准测试分数。
• Mercury 2.5 Preview 的 80% 首发折扣将于 2026 年 9 月 8 日到期,之后其标价为 $0.20 / $0.75——在输入方面仍比 Grok 4.6 便宜 10 倍,但这就不是什么大新闻了。
• Grok 4.6 今天已在 OrcaRouter 上按标价路由;Mercury 2.5 Preview 尚未路由,目前通过 Inception 自有 API 及多个第三方平台提供服务。
记分牌

• 智能 — Mercury 2.5 预览版:无独立指数;Inception 声称与成本优化档位持平。Grok 4.6:AA Intelligence Index 61,全球并列第 3(根据 Artificial Analysis;实验室自身数字为厂商自报)。
• 价格 — Mercury 2.5 Preview:每 1M 收费 $0.04 / $0.15(较 $0.20 / $0.75 立减 80%,截至 2026 年 9 月 8 日)。Grok 4.6:每 1M 收费 $2.00 / $6.00,提示达到或超过 200K token 时,费用翻倍至 $4.00 / $12.00。
• 速度 — Mercury 2.5 Preview:供应商声称每秒 1,107 个 tokens。Grok 4.6:速度并非主打规格;该模型是为长时间代理运行而构建,而非快速流式输出。
• 上下文——Mercury 2.5 Preview:260K。Grok 4.6:500K。
• 智能体工作 — Mercury 2.5 Preview:没有公开分数,不过支持并行工具调用。Grok 4.6:APEX-Agents 57.5,DeepSWE v1.1 65.9,CursorBench v3.2 69.9(供应商报告,基本未复现)。
• 权重 —— Mercury 2.5 Preview:闭源、专有。Grok 4.6:闭源、专有。
价值冠军与价格跳过
Grok 4.6 的定位不同寻常。它在 Artificial Analysis 指数上并列第三——与 GPT-5.6 Sol Max 同分——同时比该指数中与它相差十分以内的所有模型都更便宜,而其发布报道着重强调了长时长的 agentic 运行,在某个厂商方评测中每项任务的平均成本约为 0.84 美元。这就是“价值冠军”的定义:接近前沿水准的能力,同时价格低到能让每任务成本清晰地写进电子表格。Mercury 2.5 Preview 并不打算走这条路。Inception 将其对标 GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite 和 Claude Haiku 4.5 等模型——属于成本优化层,而非前沿层。如果 Inception 是对的,那么 Mercury 2.5 Preview 在能力上比 Grok 4.6 低一个层级,在价格上低好几个层级,而这恰好是一个完全自洽的产品:对于前沿层属于浪费的工作负载,它提供了一个跨过昂贵档位的价格选择。
并行解码实际改变的是什么
架构才是值得理解的部分,因为它改变了“{{1}}快{{/1}}”的含义。自回归模型每一步只生成一个token,因此吞吐量受顺序延迟限制;而像Mercury 2.5 Preview这样的扩散LLM则并行生成一批token,并通过去噪步骤逐步细化,从而将吞吐量与生成的token数量解耦。这正是Inception可以在标准GPU上声称达到1,107 tokens/sec的原因——{{2}}无需特殊加速器,无需批处理技巧{{/2}}——也是其真实产品卖点在于交互式工作负载下不到300毫秒首token延迟的原因。对于语音代理、搜索管道或每轮都调用模型的编码子代理而言,{{3}}这种延迟差异就是产品本身{{/3}}:它决定了语音循环是感觉实时还是感觉停顿。问题在于,扩散语言模型是一个年轻的研究领域,1,107这个数字是Inception自己的,而且还没有独立实验室复现过这一速度,也没有测量过并行生成在长提示或对抗性提示上是否会产生质量漂移。
Grok 4.6 依然能打的领域
关于 Mercury 2.5 Preview 的内容,完全没有触及 Grok 4.6 真正胜出的市场部分。Grok 相对于 Grok 4.5 的进步集中在智能体与编程基准上——DeepSWE 提升 11.9 分,APEX-Agents 提升 10.4 分,Terminal-Bench 提升 10.3 分——而其 500K 上下文窗口是为那些必须将整个任务保持在上下文中的长周期智能体而设计的。Mercury 2.5 Preview 提供并行工具调用,但一个没有独立智能体评分、输出上限为 65,536 token、上下文为 260K 的模型,并不是执行 50 步软件工程任务所需的工具。这两个模型在实际使用中几乎不重叠:Grok 4.6 是驱动必须真正完成的工作的引擎;Mercury 2.5 Preview 则是让工作感觉即时且每次调用成本几乎为零的引擎。
80%折扣窗口
这里的定价有有效期,它会改变决策。Mercury 2.5 Preview 的 $0.04 / $0.15 费率是在 $0.20 / $0.75 标价基础上优惠 80%,Inception 表示该促销活动持续到 2026 年 9 月 8 日。Grok 4.6 的 $2.00 / $6.00 是稳定的标价,结构清晰——缓存输入 $0.50,优先级层级为 2×,长提示词在 200K token 处阶梯加价,整次请求按较高费率计费。如果你看今天的数字,Mercury 在输入上便宜 50 倍,在输出上便宜 40 倍;如果折扣按计划到期,真正的长期差距是输入 10 倍、输出 5 倍。这两种说法都不算不诚实——它们只是不同的时间维度;基于折扣定价却没有重新评估节点的管道,会在 9 月 9 日感到意外。Grok 4.6 的 $2.00 / $6.00 就是你在 OrcaRouter 上实际支付的费用,提供商的标价以 0% 加价透传——当提供商更改某个数字时,同一天内在同一个 key 上实时生效,如果某个提供商路径被限流,会自动故障转移。
一句话的结论
如果任务必须完成,而你希望以该层级的最优价格获得前沿能力,那就选用 Grok 4.6——它是久经考验的性价比冠军,今日已在 OrcaRouter 上线,定价 $2.00 / $6.00。如果任务属于高吞吐量、对延迟敏感的文本推理,且足够好的答案验证成本很低,那么定价 $0.04 / $0.15 的 Mercury 2.5 Preview 就是在折扣窗口期内值得一试的价格跳档之选——只需记住,榜单上它那一侧的每一项声明都出自 Inception,而证据仍然悬而未决。


OrcaRouter 以0% 加价传递提供商列表价格,并具备自动故障转移功能,因此供应商的价格变更会在当天在同一密钥上生效。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
