
LongCat-2.5-Preview 对比 GLM-5.2:两个 1M Token 窗口,其中一个经过实测
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
LongCat-2.5-Preview和GLM-5.2带着同一个招牌数字:一百万个 token 的上下文窗口。这一处巧合,正在为本周写出的绝大多数对比承担全部的说服力,而仅凭它并不足以对两个模型做出比较。GLM-5.2 自 2026 年 6 月 16 日起便有公开记录,配有公开的基准测试档案、已发布的费率卡,以及来自独立评测机构的长上下文召回分数。LongCat-2.5-Preview 于 2026 年 9 月 25 日出现在美团的 LongCat API 平台上,带着一份折扣费率卡、由中国行业媒体报道的参数规模,而任何形式的公开基准测试都没有。一个窗口是测出来的,另一个则是声称出来的。下文全程将这两类东西分开对待,因为规格表与测试结果并非同一类事实。
这是对决的诚实版本,比粉饰的版本更有用。
双方实际发布了什么
美团的更新日志中有一条带日期的条目——“版本:2026-09-25,LongCat-2.5-Preview 现已可用”——列出了三项声称具备的能力:图像理解、编码,以及与“Claude Code 和其他主流开发环境”的兼容性,并点名了 Hermes、OpenClaw、OpenCode 和 Kilo Code。供应商的定价页面标明按量付费费率为每百万未缓存输入 token 0.30 美元、每百万缓存输入 token 0.006 美元和每百万输出 token 1.20 美元,并在页面上标注为限时折扣。上下文窗口为一百万 token,最大输出为 131,072。约 1.6 万亿总参数,每次 token 约 480 亿激活参数,基于混合专家架构,这一信息来自美团自家网站的元数据以及中国行业媒体对此次上架的报道——并非来自 API 文档。没有任何技术报告、模型卡或基准测试表随附其中。HuggingFace 上没有 LongCat-2.5-Preview 仓库,美团 GitHub 组织下也没有该名称的仓库;OpenCode 随附的模型目录元数据将开放权重记录为 false。

Z.ai 的 GLM-5.2 则处于相反的位置。它于 6 月发布,其价目表我们按标价提供:在我们的目录中,每百万输入 token 1.40 美元、每百万缓存输入 token 0.26 美元、每百万输出 token 4.40 美元,上下文窗口为 1,000,000 token,最大输出为 128,000 token。它公布的分数来自两个不同的地方,而这一区分很重要:Z.ai 自己针对 AIME 2026、2026 年 2 月的 HMMT、GPQA-Diamond 和 FrontierSWE 套件给出的数字属于厂商自报;而我们目录中收录的 Coding Index 和 Intelligence Index 数据则来源于 Artificial Analysis,该机构会自行开展评测。
他们真正平等的唯一维度
两个模型都声称具备恰好 1,000,000 个 token 的上下文。但其中只有一个有已公布的分数,用来检验模型是否仍能利用其中的内容。Artificial Analysis 记录 GLM-5.2 的长上下文召回率为 78.33。LongCat-2.5-Preview 则没有任何人给出可比的数字。这种不对称用一句话概括了整场对比:一个百万 token 的窗口,说明的是架构的容量,而不是模型能否在第 900,000 个 token 处正确检索。容量印在宣传里很便宜,验证起来却很昂贵,这就是为什么每家厂商都会把它印上去,却几乎没有一家公布召回测试。
所以,如果你是为了长上下文工作而在这两者之间做选择,那你就是在有已公布召回分数的选项和没有的选项之间做选择——而没有公布的那个,同时也是基准测试情况未经测量的那个。这并不是反对它的理由。这是反对仅凭一个相同的整数就把两者视为可互换的理由。

真实工作中的价格差距是什么样的
费率卡并不接近,而且这个方向也不是人们会预期从中国开源权重挑战者对阵西方前沿实验室那里看到的。LongCat-2.5-Preview 在未缓存输入上比 GLM-5.2 大约便宜 4.7 倍,在输出上便宜 3.7 倍——这个比值是对两份已公布费率卡做算术得出的,而非实测。在一次处理 500,000 token 文档并回写 20,000 token 的流程中,这大约是 17 美分对约 79 美分。两个模型都必须读同一份文档。但只有其中一个公布了评分,说明它在读到最后时是否还能保持注意力。
还有第二个需要一并说明的注意事项:Meituan 将自己的费率表标为限时折扣。$0.30 这个数字是促销价,而供应商并未说明之后会怎样。基于促销价格搭建的成本模型,其到期日你无从得知。这是让供应商之间的迁移保持低成本的理据,而不是避开这种模型的理由。
在 OrcaRouter 上,我们提供的各条路由都只需一个密钥即可按供应商标价访问,而且零加价,因此供应商的价格变动当天就会反映到你的账单上,而不必等到下次续费;同时 自动故障转移会把出现降级的请求转移到健康的供应商,而你的应用对此毫无感知。 GLM-5.2 是我们提供的路由之一。LongCat-2.5-Preview 则不是——我们不提供它,此处的任何内容都不应被理解为在暗示相反的情况。自 6 月以来,Z.ai 也已向前推进:截至 2026 年 8 月 18 日,GLM-5.3 已上线我们的目录,因此以“新模型与当前模型对比”为框架的比较,其实已经把 GLM-5.2 摆在在位者的位置,而非前沿模型。

什么能了结此事,什么不能。
• LongCat-2.5-Preview 的长上下文召回(Long-Context Recall)得分,且需来自美团或独立评估方。在它出现之前,其 1M 窗口只是一个没有测试佐证的宣称,而 GLM-5.2 的 78.33 是这场对比中唯一能回答同一问题的数字。
• 没有限时标记的供应商费率卡。折扣价告诉你的是模型在促销期间的费用,而不是它的实际费用。
• 任何类型的基准测试表。不是排行榜名次——只是一次已发布的评估运行,这样比较就不再是规格表对结果页面的对照。
• 图像输入的确认。更新日志将图像理解作为头条级新增功能来宣传,但美团自家“Retrieve Model”文档中的示例响应仍然将input_modalities显示为["text"],并带有text->text模态字符串。那个示例可能只是过时了。但它毕竟是厂商公开发布的契约,因此应把图像输入视为“声称支持”而非“实际可用”。相比之下,GLM-5.2 在我们的目录中是纯文本输入、纯文本输出,完全没有任何图像模态——所以在这一维度上,两款模型都没有给你经过验证的答案,而其中一款给你的只是一个声称。
• 你自己的数据。已发布的内容与你实际所需之间的差距,可以通过在你自己的任务上同时运行两个模型来弥合,而 LongCat-2.5-Preview 的免费窗口让这件事现在变得很划算。以交错式 reasoning_content 字段到达的推理轨迹,是首先需要检查的框架细节,因为会悄悄丢弃它的工具链会在不报错的情况下丧失该模型的大部分价值。
这让比较处于什么位置
如果你今天就需要做出决定,而且这个决定涉及长上下文,那么GLM-5.2是唯一一个你真正能评估的选项:它公布了召回率数据,在Artificial Analysis那里有68.8的独立编程得分和33.7的智能指数,还有一个你可以据此做预算的价格。这些数字所描述的,是一个称得上称职、但谈不上前沿的模型——Z.ai自己的后继者GLM-5.3得分比它更高——但它们确实说明了些什么。LongCat-2.5-Preview则是一个更便宜、上下文更大、完全未经衡量的主张,而它最吸引人的特质,也就是它的价格,明确是临时性的。对它正确的态度不是怀疑,而是在促销价消失之前,用你自己的评分框架做一次为期两周的评估。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
