
Claude Sonnet 5.5 对比 MiniMax M3:便宜 15 倍的模型究竟在哪里真正持平
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 931 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 192 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- xAISpaceXAI: Grok 4.62026-08-1244智能77代码
在独立榜单上有这样一行,MiniMax M3和Claude Sonnet 5.5表现相同,而且这一项绝不是任何人会猜到的。在长上下文召回上,MiniMax M3 得分 83.0%,Claude Sonnet 5.5 得分 82.7%。MiniMax M3 的价格是每百万输入 token 0.30 美元、每百万输出 token 1.20 美元。Claude Sonnet 5.5 则是 2.00 美元和 10.00 美元。在整个 Intelligence Index 上,M3 的实测成本为每任务 0.51 美元,而 Claude Sonnet 5.5 为 7.60 美元——便宜十五倍,而在唯一一项衡量模型是否仍能在超长文档中找到内容的评测上,它一点也不落后。
然后你翻开智能体评估,局面逆转得如此彻底,以至于它根本不再构成一种比较。在 Terminal-Bench 4.0 上——这项基准要求模型驱动 shell 并真正完成一项软件任务——MiniMax M3 得分 2.0%,Claude Sonnet 5.5 得分 63.6%。在最接近生产工作的那一个基准上出现三十倍的差距,这不是价格问题,任何按 token 计算的节省都撑不过它。这场对决引出的有用问题不是“哪个更好”,而是这两种失败模式中,你的工作负载能承受哪一种:MiniMax M3 是开放权重、百万 token、原生视频的模型,它在检索上能与前沿模型匹敌,在执行上却一败涂地;而 Claude Sonnet 5.5 则是于 2026 年 9 月 28 日发布的闭源模型,为的正是做相反的事。
每个分别是什么,直白说明
MiniMax M3 是中国实验室的旗舰级开放权重基础模型,于 2026 年 6 月 1 日发布,可在 MiniMax 自有社区许可下下载。它是一个专家混合模型,总参数量约为 4280 亿,每个 token 激活约 230 亿;并且它在强意义上原生多模态:文本、图像和视频输入,文本输出,多模态流程从预训练的第一步就重建,而非事后附加。窗口为 1,048,576 个 token——在我们自己的目录条目中,保证可用最小值为 512,000——最大输出为 512,000 个 token,这是我们的数字而非供应商的数字,因为 MiniMax 并未公布。其架构是 MiniMax Sparse Attention,即 arXiv 2606.13392 的主题,供应商对其的宣称是:在百万 token 窗口下,预填充速度比上一代快 9 倍以上,解码速度快 15 倍以上。这些都是供应商的数字,我们尚未看到它们被独立复现。

Claude Sonnet 5.5 是 Anthropic 的第二款 5.5 代模型,在撰写本文时仅问世一天,并且是闭源的。Anthropic 将其描述为产品阵容中速度与智能的最佳结合,规格为 1,000,000 token 上下文、128,000 token 同步输出(Message Batches API 上为 300,000),支持文本、图像和文件输入,自适应思考且可选思考强度,知识截止到 2026 年 6 月,并且从发布起即可提供零数据留存。其价格与 Claude Sonnet 5 相比没有变化:输入 $2.00,输出 $10.00,缓存读取 $0.20,缓存写入 $2.50。Anthropic 表示,与 Claude Sonnet 5 相比,它运行速度快 30%,每项任务成本最多低 30%——这些是厂商数据,未经复现,并且应被理解为关于 token 数量而非费率的说法,因为费率完全相同。
基准的形状说明了一切。
两个模型都是在同一个索引(修订版 v4.3.2)上衡量的,而正是逐次评估的结果让这种配对显得有趣,而非一边倒。
• 长上下文召回 — MiniMax M3 83.0% 对比 Claude Sonnet 5.5 82.7%,在真正的平局中,这只是一个舍入误差级别的差异
• SciCode — MiniMax M3 47.1% vs Claude Sonnet 5.5 61.0%,一个真实但可承受的差距
• 人类最后的考试 — MiniMax M3 39.0% 对比 Claude Sonnet 5.5 55.0%
• Terminal-Bench 4.0 —— MiniMax M3 2.0% 对 Claude Sonnet 5.5 63.6%,至此这种对比已不再有意义
• 智能指数 — MiniMax M3 29 对比 Claude Sonnet 5.5 56
• 每项 Index 任务的成本 — MiniMax M3 $0.51 对比 Claude Sonnet 5.5 $7.60
• 在整个 Index 中生成的输出 token 数——MiniMax M3 120M 对比 Claude Sonnet 5.5 410M
• 输出速度 —— MiniMax M3 115.3 tokens/秒,对比 Claude Sonnet 5.5 的 138.7 tokens/秒
按顺序读取这些行,一个连贯的模型画像便浮现出来。MiniMax M3 在静态推理与检索方面表现合格,但在持续执行方面较弱。其 Terminal-Bench 结果并非小幅不足;2.0% 的得分意味着该模型基本上无法完成任务,同样的模式也体现在其 automation-benchmark 得分 0.21 对 0.71,以及 omniscience 得分 1.35 对 32.3 上。MiniMax M3 真正能站稳脚跟的地方,恰恰是其架构宣称拥有优势之处:真正长的输入,能被读取并得到回答。这正是 MSA 在做 MiniMax 当初推销它时所承诺的事。

成本这一行还带出第二个不那么显眼的点。MiniMax M3 不只是在每个 token 上更便宜——输入是 1/6.7,输出是 1/8.3——它在得出答案时消耗的 token 也更少,在同一个评测集上大约是 1.2 亿对 4.1 亿。两种效应相乘,才形成每个任务十五倍的差距。其中一部分差距是真实的效率优势,还有一部分则仅仅是因为 MiniMax M3 在那些它做不好的任务上更早放弃;一个给出了错误答案的便宜任务算不上节省,而这是本文中最廉价的一课。
价目表无法展示的维度
MiniMax M3 拥有一个 Claude Sonnet 5.5 不具备也无法获得的特性:你可以把权重拿走。这只对恰好一类买家至关重要,而对这类买家来说,它比上述一切都更重要。如果一个请求不能离开某个司法管辖区、不能跨越网络边界,或者必须在根本触及不到 API 的地方运行,那么没有可下载权重的模型无论出什么价都不是选项,而一个 4280 亿参数的开放权重模型则是。同一个特性在另一个方向上却是一种负担:以 23B 激活参数自托管 428B 参数是一项资本决策,而不是一个 API 密钥;MiniMax 自己对稀疏注意力的说法之所以存在,是因为在百万 token 规模下,替代方案是负担不起的基础设施。
对其他所有人来说,诚实的表述是:这是一道“自建还是外购”的选择题,而且还附带价格标签。Claude Sonnet 5.5 是更适合任何智能体任务的模型。MiniMax M3 则是更适合阅读海量内容并就此回答问题的模型,而且在处理视频方面它明显更胜一筹——Claude Sonnet 5.5 根本不接受视频,其输入范围仅限于文本、图像和文件。
• 权重 — MiniMax M3 依据 MiniMax 社区许可证开放,对比 Claude Sonnet 5.5 闭源
• 输入模态 — MiniMax M3:文本、图像和视频,对比 Claude Sonnet 5.5:图像和文件
• 最大输出 — 根据我们的产品目录,MiniMax M3 为 512,000 tokens,而 Claude Sonnet 5.5 同步模式下为 128,000,批处理模式下为 300,000
• 缓存定价 — MiniMax M3 每百万次读取 $0.06,对比 Claude Sonnet 5.5 读取 $0.20、写入 $2.50
• 思考力度控制 —— MiniMax M3 思考可启用、自适应或禁用,对比 Claude Sonnet 5.5 的自适应思考,后者禁用现在需要采用 between_tools 形式
• 数据留存 — 若为自托管,MiniMax M3 由你自己的部署所管控;而 Claude Sonnet 5.5 在发布时可从 Anthropic 获得零数据留存
同时运行两者,而无需运行两个合约
把开源权重的中国模型与闭源 Anthropic 模型混用在同一条流水线里,运营成本通常并不在 token 上;而在于第二份合同、第二把密钥、第二套速率限制,以及第二个可能出故障的地方。OrcaRouter 把这一切收拢为一个兼容 OpenAI 的端点,覆盖 200 多个模型:供应商标价原样透传——两端都不加价——上游供应商之间自动故障转移,还有一套路由 DSL,可把多个模型组合成单次调用。MiniMax M3 在此处可路由为 minimax/minimax-m3,价格为 MiniMax 的 $0.30 和 $1.20,缓存读取 $0.06;按流量算,它是该目录中最繁忙的模型之一,这本身就是个有用的信号:路由层能告诉你一个模型实际承载了多少真实负载,而不只是它拿了多少分。
Claude Sonnet 5.5 尚未进入我们的产品目录,本文也不会假装它已经上架。如今要使用它,只能走 Anthropic 自家的 API。Claude Sonnet 5 在这里可以路由调用,价格同样是 $2.00 和 $10.00,而且自 6 月 30 日起便是如此;在其继任者才刚上线一天之际,它正是理所当然的过渡目标和故障转移搭档。
这种组合——长上下文替换与同一凭据背后的智能体路径——正是路由器存在的意义。MiniMax M3 每周通过这一目录承载 6320 万 token 的流量,而 Claude Sonnet 5 为 790 万,所以廉价模型在这里并非理论上的替代品;它已经在承载这一体量。用一个密钥同时路由两者,意味着分流是一个你可以让流量来回迁移的配置决策,而不是在测试更便宜的那一侧之前必须先签下的第二份合同。

领带该怎么处理
如果你的工作负载是文档级问答——输入非常长、答案是很短的事实性内容、延迟可以容忍——那么长上下文的平局就是真实的,MiniMax M3 十五倍的成本优势也随之真实存在。这是一个直接的替换,值得本周就测试。
如果你的工作负载是智能体式的,那么 Terminal-Bench 这一项就能在价格进入讨论之前一锤定音。Claude Sonnet 5.5 每项 Index 任务 7.60 美元,而 MiniMax M3 为 0.51 美元;对于一个在最接近你生产流量的评估中高出六十分的模型来说,这是 15 倍溢价,而那个便宜十五倍却在任务上失败的选择,才是昂贵的那个。要在你自己的数据上运行的衡量指标是每个已完成任务的 token 数,而不是每个请求的 token 数,因为这是本文中唯一一个会让 MiniMax M3 的价格优势默认无法成立的数字。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
