
LongCat-2.5-Preview 对比 Qwen3.8-Max:价格仅为其七分之一,排行榜上却不见踪影
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
美团将LongCat-2.5-Preview于2026年9月25日上线到其API平台,只附了一则更新日志条目和一份价格表,没有任何形式的基准测试——随后将其定价为Qwen3.8-Max同一调用收费的大约七分之一。这不是一个小差距,也不是一个稳妥的差距。Qwen3.8-Max是该厂商的旗舰模型,自2026年8月3日起已全面可用,拥有独立的Artificial Analysis排名,发布带日期、可按名称锁定的快照,其输入计费是前者的6.7倍,输出计费是5倍。这项比较必须回答的问题并不是哪个模型更好——美团之外的任何人目前都还没有资格回答这个问题。它要回答的是:你为这个差价买到了什么,以及这个差价是否值得买。
双方实际发布了什么
从来源说起,因为正是这一点比任何基准都更鲜明地将这两者区分开来。
LongCat-2.5-Preview 随美团自家更新日志中一条带日期的条目登场——厂商的原话是:“版本:2026-09-25 — LongCat-2.5-Preview 现已推出”——一个定价页将其列为该平台当前的按量付费模型,一份快速入门指南则涵盖两种接口格式。美团在 X 上的自家账号将其描述为“1.6T 参数。约 48B 激活参数。100 万 token 上下文窗口。原生多模态。”除此之外,无可读内容。没有任何仓库在 meituan-longcat Hugging Face 组织中覆盖该模型——该组织最新的仓库是 7 月 31 日的 LongCat-Flash-Lite-Sparse——而为其提供服务的 OpenCode 模型目录将其记录为闭源权重。厂商未发布模型卡、技术报告、许可证或参数表,任何地方也没有独立评估:截至 9 月 27 日,Artificial Analysis 上没有 LongCat-2.5-Preview 页面。
Qwen3.8-Max 几乎在各个方面都是相反的情况。它于 2026 年 8 月 3 日正式全面可用,并公布了价目表,而阿里巴巴又在 9 月 2 日推出了一个具名更新版本 Qwen3.8-Max-0902。Artificial Analysis 对它进行了测评:Intelligence Index 为 45.4,在 145 个模型中排名第 15;Coding Index 为 76.2,在 138 个模型中排名第 9。它的成绩为:GPQA Diamond 92.8%、Humanity's Last Exam 43.1%、SciCode 52.1%、Long-Context Recall 80.3%、Terminal-Bench 2.1 为 88.8%,以及 τ-bench banking 为 47.8%。这是一个经过实测的模型,每个数字都有凭据。
所以,对证据一栏的诚实总结是失衡的,而这种失衡与能力毫无关系。这些模型中,有一个可以在你做出承诺之前接受评估。另一个则只能试用。
费率卡,逐行
两者都是百万 token 级模型,输出上限相同,所以参数表恰恰在最派不上用场的地方完全趋同:
• 未缓存输入 — LongCat-2.5-Preview 每 1M $0.30,对比 Qwen3.8-Max 每 1M $2.00,相差 6.7 倍。
• 缓存输入 — 每 100 万个 $0.006,对比每 100 万个 $0.25,相差 41.7 倍。
• 输出 — 每 1M $1.20 对比每 1M $6.00,相差 5 倍。
• 上下文窗口 — 1,048,576 个 token,对比 1,000,000 个 token。功能上几乎打平。
• 最大输出 — 两者均为 131,072 个令牌。完全相同。
• 独立评分——未公开,对比 AA Intelligence 45.4 与 AA Coding 76.2。
那里的每一个 LongCat 数字都来自美团自己的定价页面,而该页面将整列标注为"折扣价(限时)"。Qwen3.8-Max 的数字是阿里巴巴的标价,取自我们自己的模型卡,其中缓存读取为每百万 $0.25,缓存写入为每百万 $2.50。Artificial Analysis 的快照日期为 2026 年 9 月 2 日。
最值得盯着看的,是缓存输入那一行。缓存读取上 42× 的差距,是这次对比中最大的单个数字,而且它正落在智能体工作负载实际依赖的维度上。一个每一轮都重新发送 100,000 token 系统提示和工具 schema 的智能体循环,其大多数 token 支付的是缓存费率,而不是那个最显眼的输入费率。
一次 150,000 个 token 的调用,按两种方式计价
以一个典型的智能体式请求为例:150,000 个输入 token,其中 50,000 个由缓存提供,以及 4,000 个 token 的回答。按 Meituan 的折扣费率,这次调用花费 $0.0501。按 Qwen3.8-Max 的标价费率,同样的调用花费 $0.3365——高出 6.7 倍,或者说每天一千次调用是 $50 对 $337。将这一组合完全转为缓存命中(这是重复提示词的稳态),差距扩大到 12.3 倍:每次调用 $0.006 对 $0.074。
那套算术里没有任何一点取决于 LongCat-2.5-Preview 是否优秀。这正是问题所在。提供给你的倍率是真实的,而供应商自己页面上附在它旁边的词是“限时”,既没有结束日期,也没有说明后续价格。一个没有公布到期时间的 6.7× 折扣,是一笔你无法纳入计划的预算项;它是一笔你必须盯着的预算项。
还有一处路由上的不对称,值得直说。Qwen3.8-Max 是 我们提供的一条路由——qwen/qwen3.8-max以及固定版本的 qwen/qwen3.8-max-0902——按阿里云的 目录价、零加价,因此供应商一旦调价,当天就会落到我们这边,而不是几周之后。LongCat-2.5-Preview 不是我们提供的路由,我们也不会假装它是;在这个对比的低价一侧,你面对的是美团自己的 API,以及你接入它的任何平台。
美团自家 API 所反驳的那一项说法
对于任何工作负载并非纯文本的人而言,这一发现应当决定这场对比的胜负。
美团的更新日志将图像理解列为 2.5 代最主打的新增功能:“多模态理解:新增图像理解能力,能够解析图像内容,支持跨模态问答、内容摘要和复杂视觉推理。” X 帖子称其“原生多模态”。这些都是厂商的说法,单凭它们,将其纳入决策考量是合理的。
随后,同一个文档站点发布了用于获取该模型自身元数据的示例响应,而它返回的模型是纯文本的。针对 id“LongCat-2.5-Preview”,该载荷显示 context_length: 1048576、input_modalities: ["text"]、output_modalities: ["text"],以及模态字符串 text->text。没有图像条目。不是在旧快照中——而是在记录该端点的页面上的完整示例中。
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
这并不能证明模型看不见。它证明的是,厂商尚未把自己的文字表述与自家 API schema 调和一致,也意味着,在有人解决这个问题之前,买家无法依据那条变更日志句子为视觉工作负载计费。再把它和另一边并排对比:我们的目录列出 Qwen3.8-Max 接受文本、图像和视频输入,视觉是其声明能力之一,而且该模型背后还有一张独立基准测试表。如果你的任务是文档理解、截图初筛或视频帧分析,那么昂贵的那一列是输入模态已经过验证的一列,便宜的那一列是输入模态尚未确定的一列。仅那一行就能抹掉整个 6.7×。
预览无法固定到何处
阿里巴巴发布带日期的快照。qwen/qwen3.8-max-0902是一个具名且已冻结的构建版本,价格与基础模型相同,均为 $2/$6,这意味着指定它的路由规则下个月仍会返回相同的权重。行为上的变化会以新的 id 形式出现,你可以按自己的节奏采用。
LongCat-2.5-Preview 没有这样的标识。它的模型 id 就是预览版 id,没有快照后缀,平台上没有版本历史,也没有任何更新日志会告诉你权重发生了变化——只说明折扣是“限时”的。它就是通常意义上的预览版:这个名字之下的东西允许发生变化,而你要从自己的输出里发现这一点,而不是从发布说明里得知。
买到缺失证据的最便宜方式,是美团在这件事的另一面打开的窗口:OpenCode 将 LongCat-2.5-Preview 列为限时免费,提供商遵循零保留政策,不会拿你的数据做训练;它还在 9 月 26 日表示,这扇窗口持续两周。输入免费,输出免费,缓存读取也免费。这是一种正当的途径,用来构建那张没人发布过的基准表——拿你自己的评估语料去跑它,你就能得到一个数字,而厂商只给了你一句话。它不是你可以据以规划的价格:两周会到期,而窗口另一边的数字,由美团来定。
谁应该选哪个
当工作负载本身就是你购买该模型的首要理由时,就该选用 Qwen3.8-Max。如果输入是图像或视频,如果答案必须在每次构建之间都可复现,如果独立的索引是采购硬性要求,或者任务属于 Terminal-Bench 和 Coding Index 所代表的那类智能体编码,那么 6.7× 就是能够检验自己工作成果所必须付出的代价。在一项关键指标上,它还位于一条回退链之后,因此已评分的模型可以为未评分的模型承受糟糕的一天,而你无需运行两套集成。

当工作负载是高吞吐量、短上下文、纯文本且面向内部时——分类、抽取、摘要、批量改写——并且当出错代价只是一次重试而不是失去客户时,就选择 LongCat-2.5-Preview。在这种形态下,缓存输入那一行不是折扣,而是这项工作的全部经济性所在,而 42× 是一个值得花力气去测量的数字。利用免费窗口期来生成那个尚不存在的基准测试。不要把关键路径迁移到它上面。
什么会改变这一结论,按权重排序:对 LongCat-2.5-Preview 的独立评估;折扣公布的结束日期和继任价格;带有日期快照的版本历史;以及关于模态列表是否为纯文本的明确结论。上述任何一项都会让便宜的那一栏不再只是一个折扣。在至少一项落地之前,这个比较不是两个模型之间的较量——而是你能验证的价格与你无法验证的能力之间的较量。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
