
Sakana Fugu Max:从可用模型中挑选最便宜者的 $2/$6 编排器
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
大多数模型比拼的是自己能做多少事。Sakana Fugu Max 比的则是自己能把事情少做到什么程度还能蒙混过关。Sakana AI 发布了Sakana Fugu Max,于 2026 年 9 月 11 日与Sakana Fugu Ultra v2一同推出——同一套编排架构的两种调优,分别指向成本-性能曲线的两端。Fugu Max 本身并不回答你的请求。它会读取任务,从其模型池中挑选出最便宜且看似能处理该任务的模型,将请求路由到那里,然后返回一个答案。Sakana 将其定价为每百万输入 token 2 美元,每百万输出 token 6 美元。
有意思的地方在于,这个价格是相对什么来衡量的。Sakana 声称,Fugu Max 的输出价格比 Claude Sonnet 5、GPT-5.6 Terra 和 Kimi K3 低 40–60%。这个说法是可以核实的,而且对于发布当日的基准测试数据来说颇为罕见的是,这笔算术确实站得住脚:对照 Sakana 所点名的这三款模型当前的标价,每百万输出 6 美元几乎正好落在所述区间的中点。真正难以核实得多的是性能方面,因为 Sakana 公布 Fugu Max 的结果时用的是散点图,而不是具体数字。
Fugu Max 究竟是什么
Fugu Max 不是一个检查点。没有权重文件,没有参数数量,也没有任何东西需要下载。Sakana 将其描述为“一种架构,而非单个模型”——与 Fugu Ultra v2 相同的核心编排引擎,只是针对不同的问题进行了调优。Ultra v2 问的是可获得的能力上限是什么。Fugu Max 问的是在最低成本下最佳输出是什么。
这种区别在运营层面很重要。你无法微调 Fugu Max,无法自行托管它,也无法检查它为何选择某个模型而非另一个。你也无法看到它路由所覆盖的完整模型名单——Sakana 表示,该模型池扩展到了“迄今为止我们最大的开放与专用模型池”,并明确提到了 NVIDIA 的 Nemotron 系列,这是通过 Sakana 在 8 月宣布的 NVIDIA 合作加入的。池中其余模型未具名,且 Sakana 不发布逐请求的路由追踪。
你能看到的是这个东西的轮廓。供应商自己的图示显示,Fugu Max 位于一个扇出结构的顶端:一个编排器,其后是一排可互换的模型槽位,而 Sakana Namazu 和 Fugu Max 本身也在目标之列。这个资源池被描述为在设计上即可互换,而其所陈述的动机既是经济上的,也是政治上的——Sakana 将编排描述为一种防范供应商锁定、API 撤销和出口管制的手段,其论点是:一个能够更换供应商的系统,不会被其中任何一家切断。
Sakana Fugu 本身并非新事物。它于 2026 年 6 月 22 日实现全面可用,而厂商自己的时间线依次是 4 月(测试版)、6 月(全面可用,外加 Fugu Ultra v1)、7 月(Fugu-Cyber 和一个 Claude Code 接口)、8 月(Sakana Chat 外加 NVIDIA 合作),直到现在的 9 月。Fugu Max 是第五个月度步骤,而非首次亮相——任何已经在运行 Fugu 的人,只需针对同一个 OpenAI 兼容端点改一行参数,就能升级到它,无需迁移。
该定价主张经受住了与标价的对照检验
Sakana 的 $2 输入 / $6 输出这一数字在发布页面上有明确说明。二手报道补充了一个每百万 token $0.25 的缓存输入价格,而发布页面本身并未印出这一项——请把这一项视为报道所称,而非已确认。作为对比,Fugu Ultra v2 为 $5 输入、$30 输出,缓存输入为 $0.50。
现在说说 40–60% 这个说法。三个被点名的比较对象目前分别是:
• GPT-5.6 Terra — 输入 $2 / 输出 $12,此前 OpenAI 7 月 30 日的降价将输出价格从 $15 下调。
• Claude Sonnet 5 — 发布促销价下输出为 10 美元,标准价为 15 美元。关于原定于 9 月的涨价是被取消还是仅仅推迟,各方消息来源说法不一,因此价格区间跨度较大。
• Kimi K3 — 输入 $3 / 输出 $15,缓存输入 $0.30。
相较之下,$6 的输出价格比 Terra 低 50%,比 Sonnet 5 的促销价低 40%,比 Sonnet 5 的标准价低 60%,比 Kimi K3 低 60%。这一说法经得起核验,而且是依据公开标价、而非内部成本模型核验的——并非每个发布日的百分比宣传都能这么说。
同一节中有一个数字却经不起同样的检验。Sakana 还称,Fugu Max 以低两到六倍的成本,带来了“与顶级模型相差无几的性能”。而相对于它在 40–60% 这一数据中提到的三款模型,原始输出价格差距更接近 1.7 倍到 2.5 倍。更大的倍数想必是在整个前沿模型范围内衡量的——包括成本远高于 12 美元的模型——而不是与句中那三款相比。就帕累托曲线而言,这一说法站得住脚;但就所点名的竞争对手而言,它却站不住脚,而发布页面并未对两者加以区分。
在定价方面,路由层的价值正体现在这里。OrcaRouter 将提供商的标价原样传递,不加任何加价,因此当供应商调整标价时,你看到的数字当天就会变化——这一点在这里很关键,因为 Fugu Max 的全部前提就是:模型池中某个地方存在更便宜的模型,而你应该无需思考就能用到它。我们不托管 Fugu Max;它运行在 Sakana 自己的 API 上。但直通原则也正是那个让 6 美元的输出费率值得与 12 美元的现有服务商进行核对、而不是盲目相信任何一个数字的原则。
Sakana 声称自己击败了什么,以及它不愿向你展示什么

供应商的基准测试部分为 Fugu Max 提出了三项具体主张:在六项基准测试——Terminal Bench 2.1、GPQA-D、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish——上取得最佳总分;在十项基准测试中的七项上扩展了成本-性能帕累托前沿;以及仅用一小部分 token 开销便达到“与顶尖模型相差无几”的性能。
在引用其中任何内容之前,关于那份证据有三点值得你牢记。
第一点是 Sakana 没有公布任何数字。Fugu Max 的结果以十张散点图呈现——纵轴是得分,横轴是每百万 token 的美元输出价格——其中 Fugu Max 被画成灰色区域西北方向的一个红点。可以看到它位于左上方。你无法从中读出一个得分。Terminal Bench 2.1、GPQA-D 和 AA-LCR 都有公开排行榜,在那里数字本可以直接比较,但都没有给出。
第二点是,六个基准测试中有一个是 Sakana 自家的。SWEFish 在发布页面上被描述为“我们内部的基准测试,反映了 Sakana AI 自身的编程挑战和用例”。用它来衡量自家产品的适配性是合理的,但它不是用来与竞争对手比较的方式——在供应商设计的基准上、由供应商选择的任务上取得的分数,并不能证明其他任何人的模型如何。
第三点是,页面上最亮眼的数字属于另一款模型。Fugu Max 得到的是图表,Fugu Ultra v2 得到的则是数字:Chartography 48.3,相比之下 Opus 5 为 27.3,Fable 5 为 29.5;DeepSWE 74.3,在八项基准中的五项上最佳或并列最佳,在八项中的七项上进入前二。Ultra v2 还标明训练截止日期为 2026-08-28——比发布早了略多于两周——并且特别明确指出,Fable 5、Fable 5.1 和 GPT-6 Astra 不在其训练池中。Sakana 声称,它是在没有租用这些特定模型的情况下达到这一水平的,而这正是整个主权论点浓缩在一条脚注里的体现。
这一切都不能说明 Fugu Max 的说法是假的。这只能说明它们尚未得到验证,也意味着那个六项基准测试的头条结论只有在附上标签的情况下才可以安全地重复。对一个全新的编排端点进行独立评估本就十分罕见,而且目前还没有任何相关成果发表。
Fugu Max 对比 Fugu Ultra v2:你真正想要的究竟是哪一个

这些并非相互竞争的产品,一旦把数字并排放在一起看,它们之间的选择就毫无悬念。Fugu Max 是便宜的那款:输入 $2,输出 $6,其设计目标是只要更便宜的模型能胜任,就绕开昂贵的模型来路由。Fugu Ultra v2 是强大的那款:输入 $5,输出 $30,缓存 $0.50,其设计目标是在复杂的多步骤工作中,即使成本更高,也要将请求路由到能力更强的一方。
实际的区分标准是任务形态,而不是预算。如果你的流量主要是查询、抽取、分类、短文本生成和直接的工具调用,那么 Fugu Max 的整个设计就是为了识别这一点,并尽可能少花钱——而 Sakana 声称它在十个基准中有七个拓展了前沿,这一点至少在大方向上正是针对这种情况。如果你的流量包括长时间的智能体运行、多文件重构,或者一旦某一步出错就会付出高昂代价的研究任务,那么 Ultra v2 上 30 美元的输出费率买到的是实实在在的东西:在八个基准中有七个位列前二,这是发布页面上最像能力宣称、而非成本宣称的部分。
两者都可以通过 Sakana 的控制台在同一个 OpenAI 兼容 API 上使用,而从现有 Fugu 升级的路径只是一项参数更改。但有两个可用性方面的注意事项。据报道,在 GDPR 相关工作完成之前,Fugu 在欧盟和欧洲经济区不可用;如果该情况仍然属实,就会限制任一模型可以部署在哪里。而且两者都是封闭系统:你购买的是一个端点,供应商决定其后运行哪些模型——对 Fugu Max 而言,还包括一份它并未完全披露的名单。
问题在于:一个仍然要靠租用其前沿能力的编排器
对 Fugu 最尖锐的批评,正是 Sakana 将其框定为主权基础设施时招来的那种。一个跨第三方 API 进行路由的编排层,并不能阻止那些 API 被撤销。它把单点故障变成了分散化的故障点,这确实是实实在在的改进,但底层模型仍然属于别人,仍然可能受到同样的出口管制影响,也仍然会遭遇同样突然的服务中断。8 月的 NVIDIA 合作以及 Nemotron 的加入,是迄今为止对此最具体的回应——池中的开放权重模型是没人能关掉的模型——但 Sakana 并未说明 Fugu Max 的流量实际有多少落在这些模型上。
还有第二种更隐蔽的取舍。路由决策会增加延迟,并消除确定性。今天落在一个小模型上的请求,如果模型池或成本权重发生变化,明天可能会落到另一个模型上,这会让行为更难进行回归测试,也更难向任何审计系统的人解释。Sakana 的回答是,编排是内部的,API 表现得像单一模型。这在接口层面是真的,但在底层并非如此;有严格可复现性要求的团队应该在它成为关键依赖之前仔细测试这一点。
如果你想在不把模型池变成唯一依赖的情况下赢得成本优势,同样的模式也可以由你自己组合。我们的路由 DSL 让你在一个端点后面定义一组模型,并决定哪类请求由哪个模型处理;而模型融合会在同一提示上运行多个模型,并在一致性比价格更重要的场景下协调答案。跨供应商故障转移意味着,当某个供应商性能下降——或消失——流量会转移到你已信任的模型,而无需更改代码。这是 Sakana 要求你全面下注时更保守的版本。

有必要准确说明我们这里提供什么、不提供什么。Sakana Fugu Max 不在我们的目录中——它在我们这边不是可路由的模型,而是运行在 Sakana 自己的 API 和控制台上。我们的目录包含横跨 15 家提供商的 196 个模型,使用一个密钥和一份账单,每张卡片上都印有每 token 费率,且不会在此基础上加价。与 Fugu Max 真正相关的重叠之处在于理念,而不是产品清单:两者都主张,对于“应该由哪个模型来处理这件事”,正确的答案通常不是最大的那个。
谁该动,谁该等
Fugu Max 是本月比较有意思的发布之一,恰恰因为它不是一个模型。如果你已经在用 Sakana Fugu,升级只需改动一行,而且价格更低,完全没有理由再犹豫。如果你正在用中端模型跑高流量、低复杂度的请求,并且为此每百万输出 token 支付 10–15 美元,那么 Sakana 给出的这笔账值得你自己做一次基准测试——拿一周的真实请求,跑一遍 Fugu Max,把质量与你当前的模型对比,而不是与那些散点图对比。
如果你需要在决定采用之前看到已发布的基准测试数字,那就再等等。关于 Fugu Max,目前还没有任何独立数据,厂商自己的证据是一张图表而不是一个表格,而且六个核心基准测试中有一个是 Sakana 的。这并不是否定它的理由——而是要在你自己的流量上测试它的理由,毕竟只有这种基准测试才可能预测你的结果。如果你的工作负载是智能体式的、长周期的,而且出错代价高昂,那么这一对里应该关注的模型是 Fugu Ultra v2,而不是 Fugu Max:它才是附有数字的那一个。
我们的 routing DSL让你可以在一个端点后面定义一组模型,并决定由哪一个模型处理哪一类请求;而模型融合则会在同一个提示词上运行多个模型,并在共识比价格更重要时对答案进行协调统一。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
