一张生成的主视觉标题卡,标题为“LongCat-2.5-Preview vs GPT-5.6 Sol”,上方眉标为“100 万上下文窗口,全程同价”,并带有两块面板:“LongCat-2.5-Preview:每百万 token 0.30 美元 / 1.20 美元,最大输出 131,072”和“GPT-5.6 Sol:每百万 token 4.00 美元 / 20.00 美元,输入超过 272K 后翻倍”。OrcaRouter 标志位于右下角。
Engineering & Research

LongCat-2.5-Preview 与 GPT-5.6 Sol:100 万令牌窗口在双方各需多少成本

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

关于LongCat-2.5-Preview与GPT-5.6 Sol的对比,最有价值的一点并不是哪一个更聪明,而是两者都宣称拥有约一百万个 token 的上下文窗口,却只有其中一个在整个窗口范围内收取同样的价格。Sol 在输入 token 超过 272,000 之后价格翻倍。而就 Meituan 所公布的价目表而言,LongCat-2.5-Preview 完全没有分档。正是这一结构性的差异,在还没查任何基准测试之前,就已经决定了大多数真实的长文档工作负载的走向——而这类事情是规格参数对比永远不会告诉你的,因为两款模型都把“1M”印成同样大的字号。

以下是每一项实际记录在案的内容,按值得提出的问题来整理。

百万 token 窗口在两边是同一个产品吗?

不,区别不在于窗口——而在于你填充它时会发生什么。我们的产品目录中,Sol 提供 1,050,000 个 token 的上下文窗口,最大输出为 128,000 个 token;对于不超过 272,000 个 token 的请求,每百万输入 token 收费 $4.00,每百万输出 token 收费 $20.00;缓存输入为每百万 $0.40,缓存写入为每百万 $5.00。超过该阈值后,费率上调至每百万 $8.00 和 $30.00。因此,在 Sol 上处理一份 500,000 个 token 的文档时,整个请求都按长上下文费率计费,而不是混合费率。

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview 标示的上下文长度为 1,000,000 个 token,最大输出为 131,072 个 token。其价目表发布在美团自家平台上,并在那里标注为限时折扣:每百万未缓存输入 token 0.30 美元,每百万已缓存输入 token 0.006 美元,每百万输出 token 1.20 美元。美团没有公布第二档。这并不等于说不存在第二档——而是说供应商没有描述过这样一档,而一个未被描述的价格,并不是你能用来做预算的价格。

给它一个数字。一次读取 500,000 token 并写回 20,000 token,在 Sol 的长上下文档位下大约要花 4.60 美元,而在 LongCat-2.5-Preview 的已公布促销价下大约只要 17 美分。这两个数字都是基于已公布价目表算出来的,并非实测。这个比例大到足以改变哪些尝试在经济上还算合理:按 Sol 的长上下文费率,把一个代码库喂给模型是一个需要权衡的决定;按 LongCat 的费率,这更接近默认操作。

哪一个的数字背后有证据?

Sol,以很大优势领先,而这正是让这一比较不至于沦为纯粹价格之争的部分。Sol 是 2026 年 7 月发布的产品,在我们的目录中拥有完整的独立档案:Coding Index 为 77.4,在 Artificial Analysis 追踪的模型中排名第三;Intelligence Index 为 47,位列第十三;GPQA Diamond 94.1%;Humanity's Last Exam 49.5%;SciCode 57.1%;Terminal-Bench v2.1 为 88.0;τ²-Bench 为 85.1。所有这些数据均来自 Artificial Analysis,而非 OpenAI。

对于这一对比而言,它最相关的数字是长上下文召回率(Long-Context Recall):84。在我们收录的前沿模型中,这是最高的,而它衡量的是模型是否仍能利用长输入深处的信息——这正是大上下文窗口本应回答的问题。而且它是在 Sol 自己的上下文长度下、按 Sol 自己的标准测得的。

LongCat-2.5-Preview 没有对等产品。美团在 2026 年 9 月 25 日的更新日志条目中声称其具备图像理解、编码能力,并兼容"Claude Code 及其他主流开发环境",还点名了 Hermes、OpenClaw、OpenCode 和 Kilo Code。该条目未公布任何基准测试表、模型卡或技术报告。约 1.6 万亿总参数、每 token 约 480 亿激活参数,这些数据来自美团网站元数据和中国行业媒体报道,而非官方文档。HuggingFace 上没有 LongCat-2.5-Preview 仓库,美团的 GitHub 组织下也没有,而 OpenCode 随附的目录元数据将开放权重记录为 false。

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the openai/gpt-5.6-sol identifier, a 1.05M-token context window, 128K maximum output, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-09, a p50 first-token figure of 10.00 s, $4.00 and $20.00 rate tiles, and the OpenAI-compatible code samples.

输入侧是否匹配,还是只有输出侧?

这正是 Sol 的配置更广泛、而 LongCat 尚存争议的地方。在我们的目录中,Sol 接受文本、图像和文件作为输入,并返回文本。LongCat-2.5-Preview 的更新日志将图像理解列为其头条新增功能——"解析图像内容,以实现跨模态问答、内容摘要和复杂视觉推理"——但美团自己的"检索模型"文档中的示例响应仍显示 input_modalities 为 ["text"],并带有 text->text 模态字符串。该示例可能只是过时了。但它毕竟是厂商公开的契约,诚实的解读是:在你亲自测试之前,图像输入只是宣称支持,而非已确认支持。

一个实际后果是:来自 LongCat-2.5-Preview 的推理轨迹会以交错的形式出现在 reasoning_content 字段中,而不是作为一个采样参数。如果解析聊天补全结果的框架没有预料到这个字段,就会悄无声息地丢弃模型的思考过程——不报错,只是给出更差的答案。无论你对模型本身作何判断,都应先检查这一点。

哪一个是你真正能坚持的路线?

Sol 是我们自己的模型之一。我们按 OpenAI 的标价提供它,零加价,因此供应商一旦调价,当天就会反映到你的账单上,而不必等到下次续费;同时自动故障转移会把性能退化的请求转到健康的提供商,而你的应用对此浑然不觉。LongCat-2.5-Preview 并不在我们的路由之列——我们不提供它,本文中的任何内容都不应被解读为声称我们提供该模型。

正是这种不对称性,让路由层在这一具体对比中——而非作为泛泛之谈——有了用武之地。Sol 的分级定价意味着,同一个任务完全可能仅仅因为输入长度就多花一倍的钱,而阈值恰好落在 272,000 个 token 上——这个数字你的应用在发出请求之前就已经知道。按请求规模把工作负载拆分到不同提供商,正是路由 DSL 的用武之地,而模型融合则更进一步:可以在同一个请求上组合两个模型,这样长上下文处理和高质量综合步骤就不必是同一个模型、按同一费率运行。这两点都不是选择一款没有公开基准的模型的理由,而都是不要把模型硬性绑死在一个上的理由。

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GPT-5.6 Sol' with the subhead 'Two million-token windows, and only one of them prices the whole window the same'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, no second tier described by the vendor, $1.20 output flagged limited-time, long-context recall not published, no repo and catalogue open_weights false. Right column 'GPT-5.6 Sol' (OpenAI, released 2026-07-09, independently scored): 1,050,000-token context, 128,000 max output, text, image and file to text, $4.00 input up to 272K then $8.00, price doubles at 272,000 input tokens, $20.00 output up to 272K then $30.00, long-context recall 84, coding index 77.4 at rank 3 by Artificial Analysis. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

底线

如果你的工作负载较短,Sol 就是直接了当的选择:它在编码指数上排名第三,各项指标都独立给出,而且其输入侧有文档说明。如果你的工作负载较长,算法结果就会急剧反转——对于同样的 500,000 token 读取,Sol 的长上下文档位成本大约是 LongCat-2.5-Preview 促销费率的 26 倍,而 Sol 正是那个召回分数为 84、真正能回答长窗口是否有效的选择。你是在以前沿价格购买一个经过实测的长窗口,对比一个以折扣价提供的、尚未实测的长窗口,而后者已被供应商标记为临时性。

要避免的失败模式,是把这两者当作可比的选项。它们不是同一款产品卖不同的价格,而是一项有据可查的能力与一个承诺。弥合差距的正确做法是:趁 LongCat-2.5-Preview 通过 OpenCode 免费、或通过 Meituan 低价可用时,用你自己的长上下文任务来跑它;同时把 Sol 放在路由器之后,这样当促销价消失、或长上下文档位超出你的预算时,切换只需改一行配置,而不是做一次迁移。