生成的主视觉卡片标题为 Claude Sonnet 5.5 对比 MiniMax M3,副标题为"便宜 15 倍的模型在何处打平",包含三张数据卡片:长上下文召回率达 82.7% 对比 83.0%,Terminal-Bench 4.0 为 63.6% 对比 2.0%,每任务成本为 $7.60 对比 $0.51,页脚注明"所有数据均来自 Artificial Analysis v4.3.2;MiniMax M3 规格来自 MiniMax"。
Guides & Insights

Claude Sonnet 5.5 对比 MiniMax M3:便宜 15 倍的模型究竟在哪里真正持平

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在独立榜单上有这样一行,MiniMax M3和Claude Sonnet 5.5表现相同,而且这一项绝不是任何人会猜到的。在长上下文召回上,MiniMax M3 得分 83.0%,Claude Sonnet 5.5 得分 82.7%。MiniMax M3 的价格是每百万输入 token 0.30 美元、每百万输出 token 1.20 美元。Claude Sonnet 5.5 则是 2.00 美元和 10.00 美元。在整个 Intelligence Index 上,M3 的实测成本为每任务 0.51 美元,而 Claude Sonnet 5.5 为 7.60 美元——便宜十五倍,而在唯一一项衡量模型是否仍能在超长文档中找到内容的评测上,它一点也不落后。

然后你翻开智能体评估,局面逆转得如此彻底,以至于它根本不再构成一种比较。在 Terminal-Bench 4.0 上——这项基准要求模型驱动 shell 并真正完成一项软件任务——MiniMax M3 得分 2.0%,Claude Sonnet 5.5 得分 63.6%。在最接近生产工作的那一个基准上出现三十倍的差距,这不是价格问题,任何按 token 计算的节省都撑不过它。这场对决引出的有用问题不是“哪个更好”,而是这两种失败模式中,你的工作负载能承受哪一种:MiniMax M3 是开放权重、百万 token、原生视频的模型,它在检索上能与前沿模型匹敌,在执行上却一败涂地;而 Claude Sonnet 5.5 则是于 2026 年 9 月 28 日发布的闭源模型,为的正是做相反的事。

每个分别是什么,直白说明

MiniMax M3 是中国实验室的旗舰级开放权重基础模型,于 2026 年 6 月 1 日发布,可在 MiniMax 自有社区许可下下载。它是一个专家混合模型,总参数量约为 4280 亿,每个 token 激活约 230 亿;并且它在强意义上原生多模态:文本、图像和视频输入,文本输出,多模态流程从预训练的第一步就重建,而非事后附加。窗口为 1,048,576 个 token——在我们自己的目录条目中,保证可用最小值为 512,000——最大输出为 512,000 个 token,这是我们的数字而非供应商的数字,因为 MiniMax 并未公布。其架构是 MiniMax Sparse Attention,即 arXiv 2606.13392 的主题,供应商对其的宣称是:在百万 token 窗口下,预填充速度比上一代快 9 倍以上,解码速度快 15 倍以上。这些都是供应商的数字,我们尚未看到它们被独立复现。

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 是 Anthropic 的第二款 5.5 代模型,在撰写本文时仅问世一天,并且是闭源的。Anthropic 将其描述为产品阵容中速度与智能的最佳结合,规格为 1,000,000 token 上下文、128,000 token 同步输出(Message Batches API 上为 300,000),支持文本、图像和文件输入,自适应思考且可选思考强度,知识截止到 2026 年 6 月,并且从发布起即可提供零数据留存。其价格与 Claude Sonnet 5 相比没有变化:输入 $2.00,输出 $10.00,缓存读取 $0.20,缓存写入 $2.50。Anthropic 表示,与 Claude Sonnet 5 相比,它运行速度快 30%,每项任务成本最多低 30%——这些是厂商数据,未经复现,并且应被理解为关于 token 数量而非费率的说法,因为费率完全相同。

基准的形状说明了一切。

两个模型都是在同一个索引(修订版 v4.3.2)上衡量的,而正是逐次评估的结果让这种配对显得有趣,而非一边倒。

• 长上下文召回 — MiniMax M3 83.0% 对比 Claude Sonnet 5.5 82.7%,在真正的平局中,这只是一个舍入误差级别的差异

• SciCode — MiniMax M3 47.1% vs Claude Sonnet 5.5 61.0%,一个真实但可承受的差距

• 人类最后的考试 — MiniMax M3 39.0% 对比 Claude Sonnet 5.5 55.0%

• Terminal-Bench 4.0 —— MiniMax M3 2.0% 对 Claude Sonnet 5.5 63.6%,至此这种对比已不再有意义

• 智能指数 — MiniMax M3 29 对比 Claude Sonnet 5.5 56

• 每项 Index 任务的成本 — MiniMax M3 $0.51 对比 Claude Sonnet 5.5 $7.60

• 在整个 Index 中生成的输出 token 数——MiniMax M3 120M 对比 Claude Sonnet 5.5 410M

• 输出速度 —— MiniMax M3 115.3 tokens/秒,对比 Claude Sonnet 5.5 的 138.7 tokens/秒

按顺序读取这些行,一个连贯的模型画像便浮现出来。MiniMax M3 在静态推理与检索方面表现合格,但在持续执行方面较弱。其 Terminal-Bench 结果并非小幅不足;2.0% 的得分意味着该模型基本上无法完成任务,同样的模式也体现在其 automation-benchmark 得分 0.21 对 0.71,以及 omniscience 得分 1.35 对 32.3 上。MiniMax M3 真正能站稳脚跟的地方,恰恰是其架构宣称拥有优势之处:真正长的输入,能被读取并得到回答。这正是 MSA 在做 MiniMax 当初推销它时所承诺的事。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

成本这一行还带出第二个不那么显眼的点。MiniMax M3 不只是在每个 token 上更便宜——输入是 1/6.7,输出是 1/8.3——它在得出答案时消耗的 token 也更少,在同一个评测集上大约是 1.2 亿对 4.1 亿。两种效应相乘,才形成每个任务十五倍的差距。其中一部分差距是真实的效率优势,还有一部分则仅仅是因为 MiniMax M3 在那些它做不好的任务上更早放弃;一个给出了错误答案的便宜任务算不上节省,而这是本文中最廉价的一课。

价目表无法展示的维度

MiniMax M3 拥有一个 Claude Sonnet 5.5 不具备也无法获得的特性:你可以把权重拿走。这只对恰好一类买家至关重要,而对这类买家来说,它比上述一切都更重要。如果一个请求不能离开某个司法管辖区、不能跨越网络边界,或者必须在根本触及不到 API 的地方运行,那么没有可下载权重的模型无论出什么价都不是选项,而一个 4280 亿参数的开放权重模型则是。同一个特性在另一个方向上却是一种负担:以 23B 激活参数自托管 428B 参数是一项资本决策,而不是一个 API 密钥;MiniMax 自己对稀疏注意力的说法之所以存在,是因为在百万 token 规模下,替代方案是负担不起的基础设施。

对其他所有人来说,诚实的表述是:这是一道“自建还是外购”的选择题,而且还附带价格标签。Claude Sonnet 5.5 是更适合任何智能体任务的模型。MiniMax M3 则是更适合阅读海量内容并就此回答问题的模型,而且在处理视频方面它明显更胜一筹——Claude Sonnet 5.5 根本不接受视频,其输入范围仅限于文本、图像和文件。

• 权重 — MiniMax M3 依据 MiniMax 社区许可证开放,对比 Claude Sonnet 5.5 闭源

• 输入模态 — MiniMax M3:文本、图像和视频,对比 Claude Sonnet 5.5:图像和文件

• 最大输出 — 根据我们的产品目录,MiniMax M3 为 512,000 tokens,而 Claude Sonnet 5.5 同步模式下为 128,000,批处理模式下为 300,000

• 缓存定价 — MiniMax M3 每百万次读取 $0.06,对比 Claude Sonnet 5.5 读取 $0.20、写入 $2.50

• 思考力度控制 —— MiniMax M3 思考可启用、自适应或禁用,对比 Claude Sonnet 5.5 的自适应思考,后者禁用现在需要采用 between_tools 形式

• 数据留存 — 若为自托管,MiniMax M3 由你自己的部署所管控;而 Claude Sonnet 5.5 在发布时可从 Anthropic 获得零数据留存

同时运行两者,而无需运行两个合约

把开源权重的中国模型与闭源 A​nthropic 模型混用在同一条流水线里,运营成本通常并不在 token 上;而在于第二份合同、第二把密钥、第二套速率限制,以及第二个可能出故障的地方。OrcaRouter 把这一切收拢为一个兼容 Open​AI 的端点,覆盖 200 多个模型:供应商标价原样透传——两端都不加价——上游供应商之间自动故障转移,还有一套路由 DSL,可把多个模型组合成单次调用。MiniMax M3 在此处可路由为 minimax/minimax-m3,价格为 M​iniMax 的 $0.30 和 $1.20,缓存读取 $0.06;按流量算,它是该目录中最繁忙的模型之一,这本身就是个有用的信号:路由层能告诉你一个模型实际承载了多少真实负载,而不只是它拿了多少分。

Claude Sonnet 5.5 尚未进入我们的产品目录,本文也不会假装它已经上架。如今要使用它,只能走 Anthropic 自家的 API。Claude Sonnet 5 在这里可以路由调用,价格同样是 $2.00 和 $10.00,而且自 6 月 30 日起便是如此;在其继任者才刚上线一天之际,它正是理所当然的过渡目标和故障转移搭档。

这种组合——长上下文替换与同一凭据背后的智能体路径——正是路由器存在的意义。MiniMax M3 每周通过这一目录承载 6320 万 token 的流量,而 Claude Sonnet 5 为 790 万,所以廉价模型在这里并非理论上的替代品;它已经在承载这一体量。用一个密钥同时路由两者,意味着分流是一个你可以让流量来回迁移的配置决策,而不是在测试更便宜的那一侧之前必须先签下的第二份合同。

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

领带该怎么处理

如果你的工作负载是文档级问答——输入非常长、答案是很短的事实性内容、延迟可以容忍——那么长上下文的平局就是真实的,MiniMax M3 十五倍的成本优势也随之真实存在。这是一个直接的替换,值得本周就测试。

如果你的工作负载是智能体式的,那么 Terminal-Bench 这一项就能在价格进入讨论之前一锤定音。Claude Sonnet 5.5 每项 Index 任务 7.60 美元,而 MiniMax M3 为 0.51 美元;对于一个在最接近你生产流量的评估中高出六十分的模型来说,这是 15 倍溢价,而那个便宜十五倍却在任务上失败的选择,才是昂贵的那个。要在你自己的数据上运行的衡量指标是每个已完成任务的 token 数,而不是每个请求的 token 数,因为这是本文中唯一一个会让 MiniMax M3 的价格优势默认无法成立的数字。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新