一张生成的主标题卡,上面写着“LongCat-2.5-Preview vs Grok 4.6”,上方小标题为“一个有基准测试卡,另一个已有后继者”,还有两个面板:“LongCat-2.5-Preview:100 万上下文,通过 OpenCode 实现零留存”和“Grok 4.6:AA Coding 76.8,Grok 4.7 已经发布”。OrcaRouter 标志位于右下角。
Guides & Insights

LongCat-2.5-Preview 对比 Grok 4.6:一个有基准测试卡,一个有继任者

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

将 LongCat-2.5-Preview与 Grok 4.6放在一起比较之所以令人别扭,原因与这两个模型本身的质量毫无关系:这个问题是有保质期的。Grok 4.6 于 2026 年 8 月 12 日发布,Grok 4.7 则于 2026 年 9 月 21 日发布——也就是本文写作的前六天——两者的费率同为每百万 token 2.00 美元 / 6.00 美元,上下文窗口也同为 500,000 token。与此同时,LongCat-2.5-Preview 于 2026 年 9 月 25 日上线美团的 LongCat API 平台,既没有任何已宣布的继任者露面,也完全没有公开的基准测试成绩。因此,真正的选择并不是"哪个模型更好",而是:你想要一个已经过实测、且背后已站着一个同样经过实测的继任者的能力,还是一个尚未经实测、但至少是当下最新版本的东西。

那种表述不如记分牌那么令人兴奋,但有用得多。

从 Grok 4.6 实际存档的内容说起

Grok 4.6 是一款有完善文档记录的模型。在我们的目录中,它具备 500,000 token 的上下文窗口,支持文本、图像和文件输入,价目表为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元、每百万缓存输入 token 0.50 美元,当输入超过 200,000 token 时,价格升至 4.00 美元和 12.00 美元。Artificial Analysis 为其提供的独立评估画像包含:编码指数 76.8——在该指数追踪的模型中位列第五;智能指数 44.3,排名第十八;GPQA Diamond 为 94.9%,Humanity's Last Exam 为 42.9%,SciCode 为 56.5%,Terminal-Bench v2.1 为 88.4,银行领域的 τ²-Bench 为 50.7。其长上下文召回率为 80.3。

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview 完全没有这些。美团 2026 年 9 月 25 日的更新日志条目是一则标注日期的可用性公告,列出三项宣称能力——图像理解、编码,以及与“Claude Code 及其他主流开发环境”(包括 Hermes、OpenClaw、OpenCode 和 Kilo Code)的兼容性——除此之外没有任何类似结果的内容。该厂商的定价页面给出每百万未缓存输入 0.30 美元、每百万缓存输入 0.006 美元和每百万输出 1.20 美元,并明确标注为限时折扣。上下文窗口为 1,000,000 个 token;最大输出为 131,072。约 1.6 万亿总参数 / 480 亿激活参数的规模来自美团的网站元数据和中文行业报道,而非官方文档。HuggingFace 上或美团的 GitHub 组织中都没有它的代码仓库,而 OpenCode 随附的目录元数据将开放权重记录为 false。

记分牌完全捕捉不到的维度

这两个模型在一个没有任何基准测试能衡量的方面存在差异,而对许多团队来说,这一点本身就足以决定问题的答案:你发送的提示词会经历什么。

OpenCode 自己的文档指出,LongCat 2.5 Preview Free 由一家遵循零留存政策、并且不会将你的数据用于训练的提供商提供服务;Zen 隐私表则用数字说明了这一点——模型训练“未使用”,数据留存“0 天”。同一份隐私表列出 Grok 4.6 和 Grok 4.7 的留存期为三十天。这两项陈述都来自 OpenCode,发布在 OpenCode 的页面上,并且它们分别具体描述了免费条目和对比条目。但如果你要把智能体指向一个私有代码仓库,那就是你无需与法务进行对话、还是必须进行对话之间的区别——而这与哪个模型在 SciCode 上得分更高毫无关系。

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

“有分寸”能给你带来什么,又不能给你带来什么

Grok 4.6 的数字比 LongCat-2.5-Preview 的数字更好,但仅限于这里唯一重要的那层意义:它们存在。这并不等于说 Grok 4.6 就是更好的模型。其 76.8 的 Coding Index 低于 Grok 4.7 那一代的水平,而它当初被拿来对标衡量的那个模型,已不再是其自身家族的前沿。其已发布的继任者 Intelligence Index 为 46.4,而 Grok 4.6 为 44.3;Long-Context Recall 为 76.67,而 Grok 4.6 为 80.33——因此继任者并非在每个维度上都更好,而这正是代际编号会掩盖的那类细节。

还有一个关于线上实际服务的注意事项值得直白说明,因为它与对这两个模型都颇为讨喜的解读相悖。在我们自己为期七天的 playground 样本中,Grok 4.6 没有记录到任何实测吞吐量,也没有 token 流量;在这一列里,这呈现的是数据缺失,而不是性能判定。LongCat-2.5-Preview 则完全没有我们的服务样本,因为我们并不对它进行路由。因此,这两者之间的任何延迟比较都是单向的,而这一点通常会被行文所掩盖:你无法对一个你并未向其发送流量的模型进行基准测试。

路由层在这里真正有帮助的地方

上述事实中有三项,正是路由器专为应对而构建的,而不仅仅是与之兼容。Grok 4.6 的费率表在输入 token 超过 200,000 时会上调,因此同一个逻辑任务可能会按两种不同费率计费,具体取决于你的应用在发送任何内容之前就已经知道的一个数字。Grok 4.6 有一个已公布的继任者,费率完全相同,这意味着从前者切换到后者应该只需改一行代码,而绝不需要重新集成。而 LongCat-2.5-Preview 最吸引人的特性——它的价格——被供应商明确标注为临时性的。

在 OrcaRouter 上我们以 xAI 的标价提供 Grok 4.6,零加价,因此供应商的价格变动当天就会反映到你的账单上,而不是等到下一次续订;并且自动故障转移会把性能下降的请求转到健康的提供商,而你的代码无需知道究竟是哪一家应答的。路由 DSL 可直接应对分层定价的场景,而模型融合则覆盖了这种情况:你想用于长文阅读的模型,未必是你想用于最终综合的模型。LongCat-2.5-Preview 不在我们的路由之列——我们不提供它,本文也没有任何地方声称提供。点出这一点的目的不是要把你引向别处;而是说,你正在评估而非实际运行的模型,应当与你实际运行的模型放在同一个密钥之后,这样评估它就只需要付出一个配置项的成本,而不是一整个项目。

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

如何决定

• 如果你需要一个经得起推敲的答案,就选择 Grok 4.6。它拥有独立的卡片、有据可查的输入配置,以及不会过期的价格。它的主要风险不在于质量,而在于相关性:Grok 4.7 以相同价格存在,而因惯性继续使用 4.6 的代价,就是 Intelligence Index 44.3 与 46.4 之间的差距——而你本不必为此付出代价。

• 如果决定因素是数据留存或覆盖范围,就选 LongCat-2.5-Preview。通过 OpenCode 获得的零留存访问、一百万 token 的上下文窗口、131,072 token 的输出上限,以及大约只有 Grok 4.6 七分之一的价格表,都是实打实的优势——其中第一项已由第三方的隐私政策证实,其余几项则仅有厂商单方面的说法。

• 不要凭一张基准测试表在它们之间做选择,因为这样的表只存在一张。Grok 4.6 的 76.8 编码得分和 80.3 长上下文召回率描述的是 Grok 4.6。目前还没有任何东西能描述 LongCat-2.5-Preview。本周任何把 LongCat-2.5-Preview 的分数与 Grok 4.6 的分数并列列出的人,要么是在引用另一个 LongCat 模型,要么是在编造这个数字。

• 在基于它构建之前,先核实输入侧。美团的更新日志以图像理解为先,但其自己的“检索模型”文档中的示例响应仍将input_modalities显示为["text"],并带有text->text模态字符串——供应商声称与已发布的契约相矛盾。Grok 4.6 接受文本、图像和文件,没有这种含糊之处。并且在你就 LongCat-2.5-Preview 的推理质量下任何结论之前,检查你的测试框架是否暴露了一个交错的reasoning_content字段;丢弃该字段的客户端会悄然失败。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新