
LongCat-2.5-Preview 对决 Kimi K3:至今无人能答的长上下文召回难题
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
Kimi K3在长上下文召回测试中得分 88.67。在我们目录中的所有模型里,针对“模型是否仍能利用深埋在长输入中的信息”这一具体问题,这是最高分。LongCat-2.5-Preview完全没有任何长上下文召回分数——无论来自 Artificial Analysis、美团,还是其他任何来源,都没有。而 LongCat-2.5-Preview 恰恰是那个把一百万 token 上下文窗口作为头号卖点来宣传的模型。这种错位——一个核心卖点就是长上下文、却不存在任何长上下文测量结果的模型——正是这次对比的全部实质。其余一切都属次要。
值得准确说明这个缺失的数字意味着什么、不意味着什么,因为人们很容易从“未测量”滑向“可能很糟”,而无论朝哪个方向推断都没有依据。
两个模型各自记录在案的内容
MoonshotAI 的 Kimi K3 于 2026 年 7 月 15 日发布。我们的目录收录了它,提供 1,048,576 token 的上下文窗口,支持文本和图像输入,费率表为每百万输入 token 3.00 美元、每百万缓存输入 0.30 美元、每百万输出 15.00 美元。其来自 Artificial Analysis 的独立评测档案数据为:Coding Index 76.2,排名第九;Intelligence Index 43.6,排名第十九;GPQA Diamond 93.5%;Humanity's Last Exam 46.9%;SciCode 59.5%;Terminal-Bench v2.1 85.0;τ²-Bench banking 46.0。以及 Long-Context Recall 88.67,是我们收录中最好的。

美团的 LongCat-2.5-Preview 于 2026 年 9 月 25 日出现在 LongCat API Platform 上。其更新日志条目列出了三项宣称的能力——图像理解、编码,以及与“Claude Code 及其他主流开发环境”的兼容性,并列举了 Hermes、OpenClaw、OpenCode 和 Kilo Code。定价页面给出每百万未缓存输入 $0.30、每百万缓存输入 $0.006、每百万输出 $1.20,并标注为限时折扣。上下文窗口 1,000,000;最大输出 131,072。约 1.6T 总参数 / 约 48B 激活参数这一数字来自美团网站的元数据和中文行业报道,而非文档。没有基准测试表,没有模型卡,没有技术报告,在 HuggingFace 或美团 GitHub 组织中也没有代码仓库,且目录元数据将开放权重记录为 false。
为什么这个缺失的数字在这里比其他任何对决都更重要
对这两个模型而言,长上下文召回并非众多分数中的一个。它是检验二者共同卖点的那个分数。一百万 token 的窗口是对架构容量的一项声明;而召回衡量的是,模型是否仍能检索并使用放在第 900,000 个 token 处、而非第 900 个 token 处的事实。厂商公布前者,因为那是一项规格说明。独立评测者公布后者,因为它是一项测试,而大多数模型在这项测试上的表现,并不像其窗口大小所暗示的那样好。
所以,诚实的立场比听起来要更有限。Kimi K3 的 88.67 并不意味着 Kimi K3 是比 LongCat-2.5-Preview 更好的长上下文模型。它意味着 Kimi K3 是那个问题已被提出并得到回答的模型。LongCat-2.5-Preview 可能更好。也可能差得多。关键在于,目前美团之外无人知晓,而定价页面上印出的 1M 窗口并不能证明任何一方。

成本图景,附带同样的算术警告
按公布的费率,LongCat-2.5-Preview 在未缓存输入上比 Kimi K3 便宜 10 倍,在输出上便宜 12.5 倍。一次读取 500,000 个 token、再写回 20,000 个 token 的操作,在 Kimi K3 上约为 1.80 美元,在 LongCat-2.5-Preview 上约为 17 美分。两者都是按价目表价格进行的算术推算,而非实际测量,而且 LongCat 的这个数字还带有一项 Kimi 的数字所没有的额外限定条件:美团将自己这一费率标注为限时折扣,因此促销结束后还能保留下来的数字尚不可知。
把这一点放到覆盖率问题下来看。如果你正在处理一个 500,000 token 的输入,而你的模型在该深度上的召回率未经测量,那么成本差异就不是节省——它是未知失败率的代价。一个悄无声息地漏掉相关部分的 17 美分请求,比一个能找到它的 1.80 美元请求更昂贵,因为无论哪种情况,你都要为重新运行和调试付出代价。这就是该风险的具体形态,也正是为什么缺失的基准测试是一个成本问题,而不只是营销问题。
当号码不存在时该做什么
自己生成一个。这是免费窗口真正适合填补这一空白的罕见情况:LongCat-2.5-Preview 在一段未说明长度的时期内通过 OpenCode 调用不花任何费用,并带有 OpenCode 记录的零保留政策——模型训练“未使用”,数据保留“0 天”——这意味着你可以先不进行数据处理对话,就把它指向一个私有仓库。在你实际使用的深度上构建一个大海捞针测试,在两个模型上都运行,你就会得到两家供应商都未公布的那个数字。在信任结果之前,有两件事需要检查:你的测试框架是否能呈现交错的 reasoning_content 字段,该字段由模型返回,并且图像输入是否根本可用,因为 Meituan 的更新日志声称它可用,而它自己的“Retrieve Model”示例仍然显示 input_modalities 为 ["text"],并带有一个 text->text 字符串。

OrcaRouter在其中所扮演的角色
我们提供 Kimi K3,以 MoonshotAI 的标价,零加价。LongCat-2.5-Preview 不在我们的线路之列——我们不提供它,本文中的任何内容都不应被解读为声称我们提供它。
就这一特定比较而言,路由器真正有用的部分不在于价格,而在于你正在评估的模型和你正在依赖的模型可以共用同一个密钥。Kimi K3 的 88.67 召回率让它成为你今天会用来跑长上下文流程的模型;LongCat-2.5-Preview 则是你想拿来与之对照测试的模型,因为如果它的召回率在输出价格只有十二分之一的情况下依然站得住,长文档工作的经济账就要改写了。模型融合正是这样的机制,它让这一切变得具体而非停留在理论上:一次请求里,长上下文检索和最终的整合步骤可以由两个不同的模型来完成,因此那个便宜却尚未实测的模型与那个昂贵但已实测的模型,不必非得二选一。而自动故障转移则覆盖了其中一个模型性能下降的情形——当你两个候选模型里有一个没有任何可供查看的线上服务历史时,这一点比平常更为重要。
裁决,连同其自身的不确定性一并陈述
如果你本周需要长上下文工作可靠,Kimi K3 是经得起推敲的选择:88.67 的召回率是针对该确切能力目前可用的最佳数字,而其更全面的表现——编码 76.2、智能 43.6、GPQA Diamond 93.5%——扎实但并不惊艳,且全部来自独立来源。如果你愿意花一个下午生成自己的评估,LongCat-2.5-Preview 是更有趣的押注:一百万个 token 的窗口、131,072 token 的输出上限、零留存访问权限,以及比 Kimi K3 低一个数量级的价目表——这一切都建立在尚未有人在公开场合验证过的厂商说法之上。
不可辩护的是,仅仅因为两者都标称一百万 token 就把它们视为等同。其中一个在那个窗口上附带的是一个数字,另一个附带的则是一个价格。这是两类不同的证据,而它们之间的差距,才是这场比较真正要谈的唯一东西。
