
LongCat-2.5-Preview vs MiniMax M3:廉价席位已被抢占
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
大多数关于 LongCat-2.5-Preview 的报道都基于这样一个前提:Meituan 已经以低价压过了所有竞争对手。面对 MiniMax M3,这个前提一碰就烟消云散。MiniMax M3 在我们的价目表上标价为每百万输入 token 0.30 美元、每百万输出 token 1.20 美元。LongCat-2.5-Preview 公布的价格表则是每百万未缓存输入 token 0.30 美元、每百万输出 token 1.20 美元。这并非相近的数字,而是完全相同的数字。唯一出现差异的地方是缓存输入:Meituan 报价为每百万 0.006 美元,而现有厂商为 0.06 美元——在账单最便宜的一项上相差十倍。所以,有趣的问题不在于 LongCat-2.5-Preview 是否便宜,而在于当一款新模型以与现有厂商完全相同的价格出现时,你买到的是什么、又放弃了什么。
简短的回答是:输出上限大得多,证据基础薄弱得多,外加一项缓存折扣。
标价相同,公布的价格上限却大不相同
MiniMax M3 自 2026 年 5 月 31 日起便已公开亮相。我们的目录收录了它,其上下文窗口为 1,048,576 个 token,最大输出为 512,000 个 token——比大多数模型允许的都要多,是 LongCat-2.5-Preview 的 131,072 的四倍。它接受文本、图像和视频作为输入,并返回文本,同时提供工具调用、JSON 模式和推理功能。

LongCat-2.5-Preview 于 2026 年 9 月 25 日上线美团的 LongCat API 平台,上下文窗口达到 1,000,000 tokens,但在输出上只有 131,072,明显偏低。它真正的悬念在于输入能力画像:更新日志把图像理解列为其主打新增功能,可美团自家《Retrieve Model》文档中的示例响应仍然显示 input_modalities/ 为 ["text"]/,模态字符串是 text->text/。MiniMax M3 还支持视频输入,而 LongCat-2.5-Preview 根本没有声称具备这一能力。如果你的流水线要接入录屏或帧序列,这个对比到此为止。
缓存不对称性则朝相反方向运行,而且这一点值得从有利于美团的角度指出,因为这是新模型真正形成差异的唯一维度。每百万缓存输入 $0.006 对 $0.06,对于每一轮都重新发送相同长前缀的智能体工作负载——而大多数都是如此——是实实在在的优势。它也是最有可能在未通知的情况下发生变化的收费项,因为美团把整张价目卡都标为限时折扣。
证据缺口,从两个方向如实衡量
MiniMax M3 的基准测试排名并不强,而指出这一点正是妥善进行这一比较的一部分。Artificial Analysis 为其记录的 Coding Index 为 58.6——在所追踪模型中排第 46 位——Intelligence Index 为 29.2,排第 60 位。GPQA Diamond 92.9%,Humanity's Last Exam 39%,SciCode 47.1%,Long-Context Recall 83,τ²-Bench banking 15.3,Terminal-Bench v2.1 65.2。MiniMax 自己公布的数据涵盖不同范围:BrowseComp 83.5,GDPval 评分标准 76.7,MCP Atlas 74.2,BankerToolBench 76.1。这些是厂商报告的数字,应归入与独立数据不同的那一列,但它们确实存在,而“存在”才是关键所在。

LongCat-2.5-Preview 则连一列数据都没有。没有公开的基准测试表格,没有模型卡,没有技术报告,在 HuggingFace 上和美团 GitHub 组织下都没有代码仓库,而目录元数据还把开放权重记为 false。约 1.6 万亿总参数 / 480 亿激活参数的规模,来自美团网站元数据和中国行业报道,而非官方文档。所以准确的说法是:M3 的分数虽然平庸,却有独立来源可查;而 LongCat-2.5-Preview 的分数根本不存在。一个在编程指数上得分四十多分的模型是个已知量,你可以据此做规划。一个没有分数的模型则是另一种风险,而两者价格相同,也就抹掉了通常用来为选择它辩护的那份补偿。
相同价格改变应对策略的情形
当一个新模型以低价冲击整个领域时,理性的做法是去评估它——上行收益是实打实的折扣。当一个新模型以与一款自五月起就已交付的在位模型完全相同的价格出现时,上行收益就不在价格。而在于能力,而能力恰恰是 LongCat-2.5-Preview 唯一没有公布的东西。这彻底重构了评估逻辑:你要测试的不是它是否更便宜,而是它是否更好——在你的任务上,从零开始,没有任何可供锚定的证据。
还有一个二阶细节,让这项测试比看上去更便宜。LongCat-2.5-Preview 通过 OpenCode 免费且不限量,窗口期长度未予说明,而 OpenCode 明确记录了其零保留政策——模型训练为“未使用”,数据保留为“0 天”,相比之下对照列表则是三十天。因此,生成你自己评估的成本几乎为零,而这一保留政策意味着你可以拿它来跑私有代码。首先要确定的一个测试框架细节是:该模型会以交错方式返回其推理轨迹,放在 reasoning_content/ 字段中;那些在解析 chat completions 时没有预料到这一点的客户端,会悄无声息地丢掉思考内容,让模型看起来比实际更差。

这一路由论点,具体针对同价比较
我们以MiniMax 的标价提供 MiniMax M3,零加价。LongCat-2.5-Preview 不在我们的服务范围内——我们不提供该模型,本说明中的任何内容均不应被解读为相反的陈述。
同价对垒正是路由真正发挥价值、而非仅仅提供便利的场景。如果两个模型价格相同,二者之间的取舍就是逐请求、逐任务的:M3 胜在 512,000 token 的输出上限和视频输入,LongCat-2.5-Preview 则胜在长智能体循环中的缓存前缀折扣——前提是你已确认其质量。模型融合让这一点真正落地:在一次请求中,检索环节与合成步骤可以是不同的模型,因此你不必在拿到证据之前就先选定赢家。而且由于我们按供应商标价原价传递、不加任何加价,供应商的价格变动当天就会反映在你的账单上,而不是等到下次合同续约,当两张卡中有一张明确是促销价时,这一点比平时更为重要。那么,自动故障转移则覆盖了某个供应商服务降级的情况,而对于没有任何服务历史可供查考的模型来说,这一点尤为重要。
常见问题
• LongCat-2.5-Preview 比 MiniMax M3 更便宜吗?不。在公开的价目表上,输入和输出费率完全相同,分别为每百万 $0.30 和 $1.20。唯一的价格优势在缓存输入上:$0.006 对 $0.06;而 Meituan 把其整张价目表都标为限时折扣,却没有说明之后会怎样。
• 哪一个的可用输出更大?MiniMax M3 大幅领先:512,000 个 token,而后者为 131,072 个。对于长文本生成、对大型文档进行结构化提取,或任何需要写出超过一章内容的任务,这个上限就是决定性规格。
• 我能核实哪一个?MiniMax M3,而核实结果对它并不美化——来自 Artificial Analysis 的 Coding 58.6,位列第四十六,Intelligence Index 29.2,位列第六十。LongCat-2.5-Preview 则没有任何人发布过评估。如果本周出现 LongCat-2.5-Preview 的基准测试,在你能将其追溯到具名评估者之前,请把它视为不可验证。
• 我应该把哪个投入生产环境?在没有亲自测试之前,两个都别用。在两者之间,M3 是方差更低的选择,因为它的弱点有据可查,且其输入模态已得到确认;LongCat-2.5-Preview 则是方差更高的那个,它声称有更大的上下文,但输出上限小得多,还有缓存折扣,且没有任何公开证据。趁窗口期开放时免费试用它,把两者都放在一个密钥后面,并让你自己的数据来做决定。
