
LongCat-2.5-Preview 对比 Grok 4.6:一个有基准测试卡,一个有继任者
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
将 LongCat-2.5-Preview与 Grok 4.6放在一起比较之所以令人别扭,原因与这两个模型本身的质量毫无关系:这个问题是有保质期的。Grok 4.6 于 2026 年 8 月 12 日发布,Grok 4.7 则于 2026 年 9 月 21 日发布——也就是本文写作的前六天——两者的费率同为每百万 token 2.00 美元 / 6.00 美元,上下文窗口也同为 500,000 token。与此同时,LongCat-2.5-Preview 于 2026 年 9 月 25 日上线美团的 LongCat API 平台,既没有任何已宣布的继任者露面,也完全没有公开的基准测试成绩。因此,真正的选择并不是"哪个模型更好",而是:你想要一个已经过实测、且背后已站着一个同样经过实测的继任者的能力,还是一个尚未经实测、但至少是当下最新版本的东西。
那种表述不如记分牌那么令人兴奋,但有用得多。
从 Grok 4.6 实际存档的内容说起
Grok 4.6 是一款有完善文档记录的模型。在我们的目录中,它具备 500,000 token 的上下文窗口,支持文本、图像和文件输入,价目表为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元、每百万缓存输入 token 0.50 美元,当输入超过 200,000 token 时,价格升至 4.00 美元和 12.00 美元。Artificial Analysis 为其提供的独立评估画像包含:编码指数 76.8——在该指数追踪的模型中位列第五;智能指数 44.3,排名第十八;GPQA Diamond 为 94.9%,Humanity's Last Exam 为 42.9%,SciCode 为 56.5%,Terminal-Bench v2.1 为 88.4,银行领域的 τ²-Bench 为 50.7。其长上下文召回率为 80.3。

LongCat-2.5-Preview 完全没有这些。美团 2026 年 9 月 25 日的更新日志条目是一则标注日期的可用性公告,列出三项宣称能力——图像理解、编码,以及与“Claude Code 及其他主流开发环境”(包括 Hermes、OpenClaw、OpenCode 和 Kilo Code)的兼容性——除此之外没有任何类似结果的内容。该厂商的定价页面给出每百万未缓存输入 0.30 美元、每百万缓存输入 0.006 美元和每百万输出 1.20 美元,并明确标注为限时折扣。上下文窗口为 1,000,000 个 token;最大输出为 131,072。约 1.6 万亿总参数 / 480 亿激活参数的规模来自美团的网站元数据和中文行业报道,而非官方文档。HuggingFace 上或美团的 GitHub 组织中都没有它的代码仓库,而 OpenCode 随附的目录元数据将开放权重记录为 false。
记分牌完全捕捉不到的维度
这两个模型在一个没有任何基准测试能衡量的方面存在差异,而对许多团队来说,这一点本身就足以决定问题的答案:你发送的提示词会经历什么。
OpenCode 自己的文档指出,LongCat 2.5 Preview Free 由一家遵循零留存政策、并且不会将你的数据用于训练的提供商提供服务;Zen 隐私表则用数字说明了这一点——模型训练“未使用”,数据留存“0 天”。同一份隐私表列出 Grok 4.6 和 Grok 4.7 的留存期为三十天。这两项陈述都来自 OpenCode,发布在 OpenCode 的页面上,并且它们分别具体描述了免费条目和对比条目。但如果你要把智能体指向一个私有代码仓库,那就是你无需与法务进行对话、还是必须进行对话之间的区别——而这与哪个模型在 SciCode 上得分更高毫无关系。

“有分寸”能给你带来什么,又不能给你带来什么
Grok 4.6 的数字比 LongCat-2.5-Preview 的数字更好,但仅限于这里唯一重要的那层意义:它们存在。这并不等于说 Grok 4.6 就是更好的模型。其 76.8 的 Coding Index 低于 Grok 4.7 那一代的水平,而它当初被拿来对标衡量的那个模型,已不再是其自身家族的前沿。其已发布的继任者 Intelligence Index 为 46.4,而 Grok 4.6 为 44.3;Long-Context Recall 为 76.67,而 Grok 4.6 为 80.33——因此继任者并非在每个维度上都更好,而这正是代际编号会掩盖的那类细节。
还有一个关于线上实际服务的注意事项值得直白说明,因为它与对这两个模型都颇为讨喜的解读相悖。在我们自己为期七天的 playground 样本中,Grok 4.6 没有记录到任何实测吞吐量,也没有 token 流量;在这一列里,这呈现的是数据缺失,而不是性能判定。LongCat-2.5-Preview 则完全没有我们的服务样本,因为我们并不对它进行路由。因此,这两者之间的任何延迟比较都是单向的,而这一点通常会被行文所掩盖:你无法对一个你并未向其发送流量的模型进行基准测试。
路由层在这里真正有帮助的地方
上述事实中有三项,正是路由器专为应对而构建的,而不仅仅是与之兼容。Grok 4.6 的费率表在输入 token 超过 200,000 时会上调,因此同一个逻辑任务可能会按两种不同费率计费,具体取决于你的应用在发送任何内容之前就已经知道的一个数字。Grok 4.6 有一个已公布的继任者,费率完全相同,这意味着从前者切换到后者应该只需改一行代码,而绝不需要重新集成。而 LongCat-2.5-Preview 最吸引人的特性——它的价格——被供应商明确标注为临时性的。
在 OrcaRouter 上我们以 xAI 的标价提供 Grok 4.6,零加价,因此供应商的价格变动当天就会反映到你的账单上,而不是等到下一次续订;并且自动故障转移会把性能下降的请求转到健康的提供商,而你的代码无需知道究竟是哪一家应答的。路由 DSL 可直接应对分层定价的场景,而模型融合则覆盖了这种情况:你想用于长文阅读的模型,未必是你想用于最终综合的模型。LongCat-2.5-Preview 不在我们的路由之列——我们不提供它,本文也没有任何地方声称提供。点出这一点的目的不是要把你引向别处;而是说,你正在评估而非实际运行的模型,应当与你实际运行的模型放在同一个密钥之后,这样评估它就只需要付出一个配置项的成本,而不是一整个项目。

如何决定
• 如果你需要一个经得起推敲的答案,就选择 Grok 4.6。它拥有独立的卡片、有据可查的输入配置,以及不会过期的价格。它的主要风险不在于质量,而在于相关性:Grok 4.7 以相同价格存在,而因惯性继续使用 4.6 的代价,就是 Intelligence Index 44.3 与 46.4 之间的差距——而你本不必为此付出代价。
• 如果决定因素是数据留存或覆盖范围,就选 LongCat-2.5-Preview。通过 OpenCode 获得的零留存访问、一百万 token 的上下文窗口、131,072 token 的输出上限,以及大约只有 Grok 4.6 七分之一的价格表,都是实打实的优势——其中第一项已由第三方的隐私政策证实,其余几项则仅有厂商单方面的说法。
• 不要凭一张基准测试表在它们之间做选择,因为这样的表只存在一张。Grok 4.6 的 76.8 编码得分和 80.3 长上下文召回率描述的是 Grok 4.6。目前还没有任何东西能描述 LongCat-2.5-Preview。本周任何把 LongCat-2.5-Preview 的分数与 Grok 4.6 的分数并列列出的人,要么是在引用另一个 LongCat 模型,要么是在编造这个数字。
• 在基于它构建之前,先核实输入侧。美团的更新日志以图像理解为先,但其自己的“检索模型”文档中的示例响应仍将input_modalities显示为["text"],并带有text->text模态字符串——供应商声称与已发布的契约相矛盾。Grok 4.6 接受文本、图像和文件,没有这种含糊之处。并且在你就 LongCat-2.5-Preview 的推理质量下任何结论之前,检查你的测试框架是否暴露了一个交错的reasoning_content字段;丢弃该字段的客户端会悄然失败。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
