一张"Fugu Max vs Claude Opus 5"的主视觉标题卡,副标题为"便宜四倍,还有一个没人公布过的数字",三个胶囊徽章分别写着"$6.00 对 $25.00 输出"、"六胜,零得分"、"$2.00 对 $5.00 输入",页脚一行写着"Sakana AI vs Anthropic — 2026 年 9 月",右下角有 OrcaRouter 标志。
Guides & Insights

Fugu Max 对比 Claude Opus 5:便宜四倍,还有一个没人公布过的数字

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Fugu Max 生成一百万 token 输出的成本是 6.00 美元。Claude Opus 5 则是 25.00 美元。Sakana AI 于 2026 年 9 月 11 日发布了 Fugu Max,它充当协调者,把每项任务路由到其模型池中最精简的模型,并且定价足够激进,以至于与 Anthropic 旗舰模型之间四倍的输出成本差距成了这次发布最抢眼的事实。而这次发布中没有的,是哪怕一个描述 Fugu Max 实际表现如何的数字。Sakana 称它在六项基准测试上取得“最佳综合得分”,并在十项中的七项上拓展了性价比前沿——这些说的是它在图表上的位置,而不是坐标轴上的数值。相比之下,Claude Opus 5 几乎每一项能力都附有公开的得分。所以,这场比较诚实的版本并不是便宜对昂贵,而是有实测对有宣称,而正是价格差距让这一取舍值得一争。

差距,以及Sakana选择不做的对比

Sakana 的发布页面通过与其他模型进行比较,来证明 Fugu Max 的输出价格合理。它点名的三个模型是 Claude Sonnet 5GPT-5.6 TerraKimi K3,并声称 Fugu Max 的输出价格比它们低 40% 到 60%。注意谁没被提到。Claude Opus 5 不在那份名单上,原因是算术:以 6.00 美元对 25.00 美元来看,Fugu Max 并不比 Opus 5 便宜 40%,而是便宜 76%。如果点名 Opus 5,这个说法就会显得不可信,而不是有竞争力,所以比较对象选在了旗舰之下的那一档。

这并不是对定价的批评——定价确实很低。它是在指出周围那句话在做什么。Sakana 自己的表述——性能“以低两到六倍的成本,逼近精英模型”——是按其选择点名的那些模型来校准的。对照 Claude Opus 5,这个倍数并不是两到六倍,在输出上而是四倍以上;至于按那句话的标准,Opus 5 是否仍算“精英模型”,则没有明说——在一份整个卖点都是前沿成本性能效率的发布稿中,这是个耐人寻味的遗漏。

• 输入价格 — Fugu Max 每 100 万 token 2.00 美元,而 Claude Opus 5 每 100 万 token 5.00 美元

• 输出价格 — Fugu Max 每 100 万 tokens 6.00 美元,而 Claude Opus 5 每 100 万 tokens 25.00 美元

• 缓存输入 — Fugu Max 每 100 万 token $0.25,而 Claude Opus 5 的缓存定价为缓存输入最高可享 90% 折扣

• 基准测试得分 — Fugu Max 未公布任何数据,声称在六项基准测试中获胜却未提供数字;相比之下,Claude Opus 5 据 Anthropic 报告,SWE-bench Verified 为 96.0%,SWE-bench Pro 为 79.2%,在 ARC-AGI 3 上约为 30.2%

• 架构 — Fugu Max 是在未公开模型池之上训练而成的协调器,对比 Claude Opus 5 是可按版本锁定的单一模型

• 背景 — Fugu Max 未发布,对比 Claude Opus 5 的 1M tokens,输出上限为 128K

• 独立评估 — Fugu Max:任何 Fugu 模型均无;对比 Claude Opus:5 个月的第三方排行榜排名记录

六场胜利,未附带比分

这六项基准测试是 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish。其中五项是公认的公开评测。第六项 SWEFish 是 Sakana 自家的编程基准测试,这意味着六项胜绩中有一项是基于厂商自己编写且尚未公开发布的测试来评分的。

对于其余五项,发布稿称 Fugu Max 取得了最佳总体得分,却没有说明该得分是多少,也没有说明任何竞争对手得了多少分。对于一则模型发布公告来说,这种形态很不寻常。厂商经常夸大其词,但他们通常是用数字来夸大,因为数字才是会传播开来的东西。一份宣称六项获胜却一个数字都不印出来的发布稿,等于是要求别人仅凭这一说法就采信它。

有一种善意的解读,值得直白地说出来。Fugu Max 是一个以成本优化为目标的协调器,而非一次能力上的冲刺——Sakana 将它和 Fugu Ultra v2 在同一天发布,后者才是瞄准最强能力的版本,输入 $5.00、输出 $30.00。Max 的任务是在 $6.00 的输出价位上达到可接受的质量,而对一个编排器而言,它的头条分数远不如它的每美元得分有意义,而这恰恰是帕累托图所展示的东西。Sakana 为这次发布所做的视觉传播就是帕累托图。如果论点是“看曲线,而不是看峰值”,那么一个原始的基准测试数字就无关紧要了。

不那么善意的解读是,给出一个具体数字会招致厂商宁愿避开的比较。两种解读都与证据相符,而目前公开记录中没有任何内容能区分二者。可以说的是,没有任何独立方评估过任何 Fugu 模型,而且 Artificial Analysis 上也没有 Fugu Max 或其任何同系列模型的条目。新闻稿中的每一个数字,包括那六项胜利,都来自 Sakana。

A two-column scoreboard titled "Fugu Max vs Claude Opus 5 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Benchmarks six wins with no figures, Context not published, Evidence vendor-reported only. Right column Claude Opus 5: Output price $25.00 / 1M, Input price $5.00 / 1M, Cached input up to 90% discount, Benchmarks 96.0% SWE-bench Verified, Context 1M with a 128K output ceiling, Evidence independent evals. Footer reading "Fugu Max figures vendor-reported by Sakana AI; Opus 5 rows Anthropic-reported. No independent Fugu Max evaluation exists.", with the OrcaRouter logo bottom-right.

你实际正在进行的购买

当单一模型供应商发布一项基准测试时,你买到的是关于某个模型的一种说法。当编排器发布基准测试时,你买到的是关于一个模型池的说法——这些模型并非该供应商训练的,而是在一个其路由决策被刻意不予披露的协调器下运行。这里的模型池被描述为 Fugu 使用过的最大模型池,它通过与 NVIDIA 的合作,用开放权重模型和专用模型进行了扩充,其中包括 NVIDIA Nemotron 系列。除此之外,成员身份未披露。

实际后果是,Fugu Max 的行为可能在其版本号不变的情况下发生变化。前沿实验室的一次弃用、一次价格变动,或某个模型在某一地区被下架,都会改变协调器可以调用的内容,而 Sakana 明确表示,这种韧性正是关键所在——它卖的正是对供应商锁定和 API 撤销的保护。这是实实在在的好处,而且并非免费。这也正是为什么,Fugu Max 的基准测试若被发布,会带有一个 Claude Opus 5 基准测试所没有的有效期。

Claude Opus 5 的价值主张恰恰相反,而且更容易定价。它是单一模型、单一版本,默认运行自适应思考,并带有从 low 到 max 的显式 effort 调节档,拥有 100 万 token 的上下文窗口和 128K 的输出上限,并支持视觉、工具调用和 JSON 模式。Anth​ropic 报告称其在 SWE-bench Verified 上达到 96.0%,在 SWE-bench Pro 上达到 79.2%,而这些数字是在你调用端点时所得到的东西上测得的——而不是在一个组成随时可能在你脚下变化的集成体上测得的。对于一项在生产环境中运行并需要接受审查的工作负载来说,这种稳定性正是你花每百万输出 token 19.00 美元所买到的特性。

按已完成任务计费,而非按词元

Fugu Max 每百万输出 token 6.00 美元的费率确实很有吸引力,而检验它的方式,就是不要再比较 token 单价。编排器会派生 agent;每个 agent 都会写入推理 token 和输出 token;协调器则写入一份综合结果。Sakana 针对 Fugu 系列的价格 FAQ 承诺采用单一混合费率,以参与运行的顶级模型为基准,多 agent 运行不会叠加账单——这消除了最坏情况下的扇出倍增,而正是这种倍增让朴素的多 agent 系统变得难以负担。但它并没有消除用量。你被计费的输出 token 数量取决于运行了多少个 agent,而在每百万 6.00 美元的价位上,这个用量恰恰是定价页面无法告诉你的变量。

Claude Opus 5 的成本结构是这样的:一次调用、一个模型、一个由你掌控的投入调节档位,以及对可以等待的任务以半价进行批处理。你可以在运行之前就预估出成本。在上万次执行中,可预估性的价值远高于一个无人公布过的基准测试优势。

这正是路由问题与模型问题分道扬镳的地方。 Claude Opus 5 已上线 OrcaRouter 按 Anth​ropic 的标价、0% 加价——供应商的费率原样透传,因此 Anth​ropic 的定价一有变动,当天就能在同一个密钥上生效,并且当某条供应商路径被限流或不可用时,会自动进行故障转移。Fugu Max 不在我们的目录中;它通过 Sakana 自家的 OpenAI 兼容 API 以及若干第三方平台提供给你,从早前的 Fugu 迁移过来只需改一行参数。如果你想要 Opus 5 的证据基础和一份可预测的账单,走路由器是更短的路径。如果你想要一个在难题上自行组织扇出(fan-out)的系统,Fugu Max 正是能做到这一点的东西——而且你应当从第一次请求起就打开 token 计量来做试点。

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Fugu Max 可能是正确答案的地方

给这一设计应有的认可。如果你的工作量大、可核验,而且你在意的是完成一项任务的中位成本,而不是任何单次调用的峰值能力,那么一个按请求挑选最便宜且足够胜任的模型的编排器,就能做到固定旗舰模型做不到的事。Fugu Max 正是瞄准这类工作负载,而 $2.00 的输入价格和 $0.25 的缓存输入价格,正是为这类工作负载所产生的冗长、重复的上下文而定的。与 NVIDIA 的合作也比表面看起来更重要:Nemotron 模型是开放权重的,这意味着模型池中最便宜的那一档不会受制于另一家实验室的定价决策。

这并没有给你理由去相信:Fugu Max 会在 Claude Opus 5 已公布数据最强的那些任务上与之匹敌——也就是仓库级软件工程和困难推理。而这些恰恰是 Sakana 的六项基准测试榜单完全没有给出任何数字的行。如果你的问题属于那种"做到最好比便宜更重要"的情况,那么 $25.00 的输出价格买到的正是你真正需要的东西。

底线

Claude Opus 5 是证据更充分的购买选择,也是更安全的生产环境默认选项:有厂商公开发布的基准测试、可以固定的版本、不会变动的上下文窗口、128K 的输出上限、一个让你只在划算时才为推理付费的投入程度调节旋钮,以及背后数月的第三方结果。Fugu Max 则是更有意思的押注,也确实更便宜——输入价格大约低 60%,输出价格大约低 76%,缓存费率比 Opus 5 的基础输入价低一个数量级。

如果你从事的是可验证、重复性、大批量的工作,且身处欧盟/欧洲经济区之外,那么 Fugu Max 值得做一次范围明确的试点:在开始之前设定输出 token 上限,并衡量每个已完成任务的 token 用量,而不是每次调用的 token 用量。如果你需要在本季度做出一个能向他人交代的生产决策,Claude Opus 5 依然是答案——它已在 OrcaRouter 上线,按 Anthropic 的标价提供,供应商费率原样透传。

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the anthropic/claude-opus-5 model ID, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24, the /v1/chat/completions and /v1/messages endpoints, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the 1M token context with 128K max output and text + image + file input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.