Fugu Ultra v2 与 MiniMax M3 对决的主视觉卡片,展示编排档位与低成本开放权重多模态模型之间的巨大价格差距。
Guides & Insights

Fugu Ultra v2 对比 MiniMax M3:二十五倍的输出价格

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

把两个输出价格摆在一起,那个数字看起来简直像是打错了。MiniMax M3每百万输出 token 收费 1.20 美元。Fugu Ultra v2由 Sakana AI 于 2026 年 9 月 11 日发布,据报道定价为 30.00 美元。这是 25 倍——而在输入侧,差距为 16.7 倍,0.30 美元对据报的 5.00 美元。MiniMax M3 还更快,原生支持视频,并以可下载的开放权重形式发布。面对这样一张对比表,合理的第一反应是:这个编排层级根本不可能证明其价格合理。更有趣的问题是,需要什么条件为真,它才能站得住脚。

直白地说,这个差距

输入 — MiniMax M3 每 1M 为 $0.30,而 Fugu Ultra v2 据报道为每 1M $5.00。MiniMax 表示,M3 的价格是永久性的 50% 折扣,而非设有期限的促销活动。

输出 — MiniMax M3 每 100 万 1.20 美元,而 Fugu Ultra v2 据报道为每 100 万 30.00 美元。

缓存输入——MiniMax M3 每 100 万 token 仅需 0.06 美元,而 Fugu Ultra v2 据称每 100 万 token 需 0.50 美元。M3 的缓存读取价格仅为其自身输入价格的五分之一,这使得针对稳定提示词反复运行的智能体循环成本低得非同寻常。

输入超过 512K 时—— MiniMax M3 翻倍至 $0.60 / $2.40 / $0.12。Fugu Ultra v2 据报告的约 272K 以上档位则调整为约 $10.00 / $45.00 / $1.00。两者都对整个请求重新计价;M3 的起算门槛更晚,最终费率却只有前者的一小部分。

上下文 — MiniMax M3 为 1,048,576 个 token,厂商保证最低 512K。第三方信息显示 Fugu Ultra v2 的上下文为 1M;Sakana 的公告页面未给出具体数字。

关于 Fugu 列有一个注意事项,而且这并非小事:Sakana 并未在其自己的公告页面上公布 Fugu Ultra v2 的 token 费率。5.00 美元 / 0.50 美元 / 30.00 美元这些数字来自第三方模型列表,在你查看实时费率卡之前,应视为未经证实。相比之下,M3 列由供应商提供文档说明。这种来源上的差异本身就是比较的一部分。

Two-column comparison scoreboard for Fugu Ultra v2 and MiniMax M3 covering type, release date, input price ($5.00 vs $0.30 per million tokens), output price ($30.00 vs $1.20), cached input ($0.50 vs $0.06) and input modes (text vs text, image and video).

M3 原生就能做到、而编排器却必须路由的事

MiniMax M3 接受文本、图像和视频输入,并返回文本。视频是其中尤为引人注目的一项。该模型从第零步开始就在混合模态上训练,并且构建于 MiniMax Sparse Attention 之上——厂商声称,与上一代相比,该架构在 1M 上下文下可实现高达 9 倍的预填充加速和 15 倍的解码加速,而每 token 计算量大约只有其前代的二十分之一。

这在本次对比中很重要,因为这是 Fugu Ultra v2 自己都不敢宣称具备的能力。面对“处理这个视频”的需求,编排器的答案是先把视频路由给一个能看视频的模型,这意味着一次子调用,也就意味着更多按编排器费率计费的 token。M3 的答案则是直接读取。按每百万输入 token 0.30 美元计算,一小时的视频分析不过是舍入误差;而按 5.00 美元输入加上路由本身的开销来算,它就是一笔实打实的预算项。

架构上的对比同样呈现出另一种失衡。MiniMax M3 总参数量约为 428B,每个 token 约激活 23B——这是一种混合专家(MoE)设计,稀疏路由让服务成本保持低廉。Fugu Ultra v2 没有公开的参数量,因为它的能力并不存在于 Sakana 训练出的权重里,而是存在于对其他公司模型的调度策略之中。其中一个是模型,另一个则是一套决策流程。

令人不安的隐含意义

在为输出支付 25 倍费用之前,有件事值得仔细考虑。

MiniMax M3 是开放权重、便宜、快速、多模态且支持长上下文的模型。从纸面上看,它是一个出色的子智能体。如果你要从零开始构建一个编排层——Fugu Ultra v2 正是这样的东西——那么像 M3 这样的模型几乎是理想的组件:足够便宜,可以投机性地调用;足够有能力,能处理大部分分解后的子任务;并且无需二次跳转就能看懂图像和视频。

Sakana 不公布 Fugu Ultra v2 的模型池,所以我们无法确定 M3 是否在其中。我们能说的是,从经济账上看,只有两种可能说得通。要么 Fugu Ultra v2 没有调用像 M3 这样的模型,在这种情况下,它就把最便宜且具备能力的容量闲置不用了。要么它确实调用了这些模型,在这种情况下,向你按 $5.00 和 $30.00 计费的 token 中,有相当一部分是上游成本仅为 $0.30 和 $1.20 的 M3 token,而溢价则是编排策略加上利润。

无论哪种解读,对产品来说都不致命——一个好的调度器可能价值高出数倍,而为它付费可以让你不必自行构建和维护它。但这确实意味着,关于 Fugu Ultra v2 该问的问题不是“它是否比 M3 更好”,而是“这种调度是否比这些 token 更值钱”。而这个问题,只有你自己的任务测量结果才能回答。

没有共享的基准

与这一系列中的其他一些对比不同,没有任何一项基准测试是两家厂商都公布了数据的。

MiniMax 为 M3 公布的一组成绩覆盖面很广,且大体上在形态上可复现:SWE-bench Verified 为 80.5%,SWE-bench Pro 为 59.0%,Terminal-Bench 2.0/2.1 为 66,BrowseComp 为 83.5%,OSWorld-Verified 为 70.1%,PostTrainBench 为 37.1——第三名,落后于 Claude Opus 4.7 的 42.4 和 GPT-5.5 的 39.3。均为厂商报告的数据。独立来看,Artificial Analysis 在其 v4.3 智能指数中给 MiniMax M3 打了 30 分,在 113 个模型中排名第 16,吞吐量为每秒 95.7 个 token,首个 token 延迟为 1.95 秒——速度快,而且在其同类中属于服务较好的模型之列。如果你看到 M3 被引为 44 或 45,那是该指数重述之前的数据。

Sakana 为 Fugu Ultra v2 给出的八项基准测试——其中包括 GDP.pdf、Chartography、SWEFish、DeepSWE 和 Toolathon,在五项上取得最佳或并列最佳,在七项上进入前二——与那份清单完全没有交集。其中两项,SWEFish 和 Toolathon,是 Sakana 的内部测试。那些头条宣称,Chartography 为 48.3,对比 Opus 5 的 27.3 和 Fable 5 的 29.5,以及 DeepSWE 为 74.3,均为厂商报告,且于今天发布。关于 Fugu Ultra v2 的一切都尚未得到独立验证。

所以,未来两周每个聚合器都会生成的那份对比——一张共享评分表——目前并不可得。就能力而言,唯一诚实的说法是:MiniMax M3 有一个经过测量的、独立的位置,而 Fugu Ultra v2 只有一个说法。

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

速度与配置

MiniMax M3 的数据已然明确:每秒 95.7 个 token,首个 token 延迟 1.95 秒。这大约是 Kimi K3 吞吐量的两倍半,在所测得的准前沿模型中名列前茅,而这与其专为低成本长上下文服务而明确优化的设计相契合。

Fugu Ultra v2 未公布任何延迟或吞吐量数据。与定价一样,部分原因在于其结构性——编排器的响应时间取决于它选择哪些模型以及需要执行多少轮,因此单一数字会具有误导性。但这意味着采用它的实际耗时成本无法衡量,也无法从外部衡量。对于上一代 Fugu Ultra,测试者曾公开报告运行时间接近 30 分钟;那是 2026 年 6 月的模型,而非 v2,也不能作为关于新模型的证据——但如果你在输出上花费 25 倍,知道要等多久绝非可有可无。

许可证,以及阿拉伯语部分的内容

MiniMax M3 的权重可在 MiniMax Community License 下下载,这是一种附带商业条件的开放权重——尤其是设有收入门槛,超过该门槛就需要书面授权。它不是 MIT,任何告诉你它是 MIT 的页面都没有读过许可证标签。Fugu Ultra v2 没什么可供你许可,因为压根就没有东西可下载。

对 M3 来说,近期更有意思的进展在于其他人拿这些权重做了什么。2026 年 9 月 3 日,由沙特 PIF 支持的 AI 公司 HUMAIN 发布了一款阿拉伯语旗舰模型,该模型通过在超过一万亿阿拉伯语 token 上对 MiniMax M3 进行后训练构建而成,总参数 428B、激活参数 23B,报告在七项阿拉伯语基准测试上取得等权平均 89.37%,领先于 GPT-5.6 Sol 的 87.30 和 Claude Opus 5 的 87.34。这是一个研究预览版,而这些是 HUMAIN 自己的数据。

与 Fugu Ultra v2 的对比,作为对这两款产品各自本质的说明,再鲜明不过了。MiniMax M3 是一个基础,其他公司在其之上构建主权模型。Fugu Ultra v2 则是一道你只能调用穿过的门,你看不到它的构成,也拿不到它的权重。两者都是合理的定位。但它们远不是同一类东西。

Screenshot of the OrcaRouter model page for MiniMax M3 showing the minimax/minimax-m3 identifier, a 1M token context window, 512K maximum output, and pricing of $0.30 per million input tokens and $1.20 per million output tokens.

调用其中任意一个

MiniMax M3 已以 MiniMax 自有费率上线 OrcaRouter——每百万输入 token 0.30 美元,缓存命中时 0.06 美元,每百万输出 token 1.20 美元——零加价透传,因此如果 MiniMax 调整折扣结构,这里当天就会同步生效,而不必等到迁移周期。它与目录中其他模型使用相同的 base URL,并且兼容 OpenAI,这意味着你可以按规则将请求路由到它、把它放入故障转移链,或将其纳入模型融合面板,而无需另签合同或修改代码。对于一个完全以价格为卖点的模型来说,这种透传才是关键所在:最便宜的路由始终最便宜。

Fugu Ultra v2 不由我们负责路由。它可通过 Sakana AI 自家的 OpenAI 兼容 API 获取,该公司表示,现有的 Fugu 集成只需改一行参数就能迁移过去。两者采用相同的请求格式,因此若要把它们放在同一个标志后面进行评估,只需替换 base URL 即可。

裁决

对于绝大多数工作负载,MiniMax M3仅凭算术就能在本次比较中胜出。它的输入成本便宜 16.7 倍,输出成本便宜 25 倍,在每项实测指标上都更快,原生支持多模态(包括视频),以开放权重形式发布,其许可证上限大多数公司永远也达不到,并在当前 Artificial Analysis 指数上获得 30 的独立评分。它的弱点真实但有限:它很啰嗦,其智能体类别得分相对于编程得分而言只是中等,而其厂商基准测试集在软件工程方面很强,在长时程自主性方面则较为薄弱。

选择Fugu Ultra v2,前提是您相信 Sakana 真正在售卖的那样东西——一个峰值能力层级,它把高难度的多步骤任务分解到一个不受任何前沿厂商控制的资源池上,在不依赖前沿模型的情况下达到前沿级输出——并且您拥有任务级测量数据,表明在您的工作中这种分解优于单个廉价模型。这与 Mini​Max 所提供的任何东西都截然不同,也正是 25× 之所以存在的原因。

但要在购买之前做这项测量,而不是之后。如果一个0.30美元的模型尝试两次就完成了你的任务,而Fugu Ultra v2一次就完成,那么Fugu仍然更贵。唯一一种25倍价格算划算的工作负载,是便宜模型根本无法完成的那种——而这样的任务集合,比发布宣传文案所暗示的要小得多。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新