
LongCat-2.5-Preview 与 GPT-5.6 Sol:100 万令牌窗口在双方各需多少成本
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
关于LongCat-2.5-Preview与GPT-5.6 Sol的对比,最有价值的一点并不是哪一个更聪明,而是两者都宣称拥有约一百万个 token 的上下文窗口,却只有其中一个在整个窗口范围内收取同样的价格。Sol 在输入 token 超过 272,000 之后价格翻倍。而就 Meituan 所公布的价目表而言,LongCat-2.5-Preview 完全没有分档。正是这一结构性的差异,在还没查任何基准测试之前,就已经决定了大多数真实的长文档工作负载的走向——而这类事情是规格参数对比永远不会告诉你的,因为两款模型都把“1M”印成同样大的字号。
以下是每一项实际记录在案的内容,按值得提出的问题来整理。
百万 token 窗口在两边是同一个产品吗?
不,区别不在于窗口——而在于你填充它时会发生什么。我们的产品目录中,Sol 提供 1,050,000 个 token 的上下文窗口,最大输出为 128,000 个 token;对于不超过 272,000 个 token 的请求,每百万输入 token 收费 $4.00,每百万输出 token 收费 $20.00;缓存输入为每百万 $0.40,缓存写入为每百万 $5.00。超过该阈值后,费率上调至每百万 $8.00 和 $30.00。因此,在 Sol 上处理一份 500,000 个 token 的文档时,整个请求都按长上下文费率计费,而不是混合费率。

LongCat-2.5-Preview 标示的上下文长度为 1,000,000 个 token,最大输出为 131,072 个 token。其价目表发布在美团自家平台上,并在那里标注为限时折扣:每百万未缓存输入 token 0.30 美元,每百万已缓存输入 token 0.006 美元,每百万输出 token 1.20 美元。美团没有公布第二档。这并不等于说不存在第二档——而是说供应商没有描述过这样一档,而一个未被描述的价格,并不是你能用来做预算的价格。
给它一个数字。一次读取 500,000 token 并写回 20,000 token,在 Sol 的长上下文档位下大约要花 4.60 美元,而在 LongCat-2.5-Preview 的已公布促销价下大约只要 17 美分。这两个数字都是基于已公布价目表算出来的,并非实测。这个比例大到足以改变哪些尝试在经济上还算合理:按 Sol 的长上下文费率,把一个代码库喂给模型是一个需要权衡的决定;按 LongCat 的费率,这更接近默认操作。
哪一个的数字背后有证据?
Sol,以很大优势领先,而这正是让这一比较不至于沦为纯粹价格之争的部分。Sol 是 2026 年 7 月发布的产品,在我们的目录中拥有完整的独立档案:Coding Index 为 77.4,在 Artificial Analysis 追踪的模型中排名第三;Intelligence Index 为 47,位列第十三;GPQA Diamond 94.1%;Humanity's Last Exam 49.5%;SciCode 57.1%;Terminal-Bench v2.1 为 88.0;τ²-Bench 为 85.1。所有这些数据均来自 Artificial Analysis,而非 OpenAI。
对于这一对比而言,它最相关的数字是长上下文召回率(Long-Context Recall):84。在我们收录的前沿模型中,这是最高的,而它衡量的是模型是否仍能利用长输入深处的信息——这正是大上下文窗口本应回答的问题。而且它是在 Sol 自己的上下文长度下、按 Sol 自己的标准测得的。
LongCat-2.5-Preview 没有对等产品。美团在 2026 年 9 月 25 日的更新日志条目中声称其具备图像理解、编码能力,并兼容"Claude Code 及其他主流开发环境",还点名了 Hermes、OpenClaw、OpenCode 和 Kilo Code。该条目未公布任何基准测试表、模型卡或技术报告。约 1.6 万亿总参数、每 token 约 480 亿激活参数,这些数据来自美团网站元数据和中国行业媒体报道,而非官方文档。HuggingFace 上没有 LongCat-2.5-Preview 仓库,美团的 GitHub 组织下也没有,而 OpenCode 随附的目录元数据将开放权重记录为 false。

输入侧是否匹配,还是只有输出侧?
这正是 Sol 的配置更广泛、而 LongCat 尚存争议的地方。在我们的目录中,Sol 接受文本、图像和文件作为输入,并返回文本。LongCat-2.5-Preview 的更新日志将图像理解列为其头条新增功能——"解析图像内容,以实现跨模态问答、内容摘要和复杂视觉推理"——但美团自己的"检索模型"文档中的示例响应仍显示 input_modalities 为 ["text"],并带有 text->text 模态字符串。该示例可能只是过时了。但它毕竟是厂商公开的契约,诚实的解读是:在你亲自测试之前,图像输入只是宣称支持,而非已确认支持。
一个实际后果是:来自 LongCat-2.5-Preview 的推理轨迹会以交错的形式出现在 reasoning_content 字段中,而不是作为一个采样参数。如果解析聊天补全结果的框架没有预料到这个字段,就会悄无声息地丢弃模型的思考过程——不报错,只是给出更差的答案。无论你对模型本身作何判断,都应先检查这一点。
哪一个是你真正能坚持的路线?
Sol 是我们自己的模型之一。我们按 OpenAI 的标价提供它,零加价,因此供应商一旦调价,当天就会反映到你的账单上,而不必等到下次续费;同时自动故障转移会把性能退化的请求转到健康的提供商,而你的应用对此浑然不觉。LongCat-2.5-Preview 并不在我们的路由之列——我们不提供它,本文中的任何内容都不应被解读为声称我们提供该模型。
正是这种不对称性,让路由层在这一具体对比中——而非作为泛泛之谈——有了用武之地。Sol 的分级定价意味着,同一个任务完全可能仅仅因为输入长度就多花一倍的钱,而阈值恰好落在 272,000 个 token 上——这个数字你的应用在发出请求之前就已经知道。按请求规模把工作负载拆分到不同提供商,正是路由 DSL 的用武之地,而模型融合则更进一步:可以在同一个请求上组合两个模型,这样长上下文处理和高质量综合步骤就不必是同一个模型、按同一费率运行。这两点都不是选择一款没有公开基准的模型的理由,而都是不要把模型硬性绑死在一个上的理由。

底线
如果你的工作负载较短,Sol 就是直接了当的选择:它在编码指数上排名第三,各项指标都独立给出,而且其输入侧有文档说明。如果你的工作负载较长,算法结果就会急剧反转——对于同样的 500,000 token 读取,Sol 的长上下文档位成本大约是 LongCat-2.5-Preview 促销费率的 26 倍,而 Sol 正是那个召回分数为 84、真正能回答长窗口是否有效的选择。你是在以前沿价格购买一个经过实测的长窗口,对比一个以折扣价提供的、尚未实测的长窗口,而后者已被供应商标记为临时性。
要避免的失败模式,是把这两者当作可比的选项。它们不是同一款产品卖不同的价格,而是一项有据可查的能力与一个承诺。弥合差距的正确做法是:趁 LongCat-2.5-Preview 通过 OpenCode 免费、或通过 Meituan 低价可用时,用你自己的长上下文任务来跑它;同时把 Sol 放在路由器之后,这样当促销价消失、或长上下文档位超出你的预算时,切换只需改一行配置,而不是做一次迁移。
