
Fugu Max vs DeepSeek V4 Pro:主打成本优化的那个才是更贵的那个
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Fugu Max 的定位是廉价选项,而 DeepSeek V4 Pro 在价格上无论如何都击败了它。Sakana AI 于 2026 年 9 月 11 日发布了 Fugu Max,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,将其定位为一个协调器,通过把每项任务路由到其池中最精简的模型来拓展性价比边界。DeepSeek V4 Pro 自 2026 年 4 月起上架,在 OrcaRouter 的计量费率下为每百万输入 0.73 美元、输出 2.18 美元——约为 Fugu Max 在两个维度上收费的三分之一,来自一个单一的开放权重混合专家模型,输出上限为 384K,且完全没有编排层。这种倒转就是整个对比。关于这一对模型的其他一切,都是一个问题:当你试图削价的基线已经比你更便宜时,编排能为你带来什么。
两种降低账单的方式,而其中一种本身就已经更低
Sakana 为 Fugu Max 提出的论点是:协调器可以避免为那些不需要前沿能力的任务支付前沿价格,从而削减开支。这个论点站得住脚。问题在于它所针对的模型。DeepSeek V4 Pro 是一个 1.6 万亿参数的混合专家模型,每个 token 激活 490 亿参数,这其实是同一个降本思路下沉一层后的实现——你只为 token 实际激活的参数付费,而不是为网络的规模付费。这两款产品都在回答同一个问题:“我们如何才能不再为用不到的容量买单?”而其中一方还要为这份特权收取每百万输出 token 2.18 美元的费用。
• 输入价格 — Fugu Max 每 100 万 tokens 2.00 美元,对比 DeepSeek V4 Pro 每 100 万 tokens 0.73 美元(按量计费)
• 输出价格 — Fugu Max 每 100 万 tokens 6.00 美元,对比 DeepSeek V4 Pro 每 100 万 tokens 2.18 美元(按量计费)
• 缓存输入——Fugu Max 每 100 万 tokens 为 $0.25,而 DeepSeek V4 Pro 的缓存命中输入定价远低于其基础费率,且供应商公布的列表价低于每 100 万 $1.00
• 背景 —— Fugu Max 未公布 vs DeepSeek V4 Pro 1M tokens
• 输出上限 — Fugu Max 未公布 vs DeepSeek V4 Pro 384K tokens
• 模态 — Fugu Max 未发布,而 DeepSeek V4 Pro 为纯文本,支持工具使用、JSON 模式和推理
• 架构 —— Fugu Max 是一个在未公开模型池之上经过训练的协调器,对比 DeepSeek V4 Pro 这一单一 MoE 模型,开放权重谱系
• 基准测试数据 — Fugu Max 声称六项获胜,却未给出分数;相比之下,DeepSeek V4 Pro 厂商报告在 Terminal Bench 2.1 上为 87.9,在 GPQA Diamond 上为 92.8,在 SWE-bench Vals 上为 96.4
那份清单里有一个数字值得单独拎出来。DeepSeek 在 Terminal Bench 2.1 上报告 87.9。Fugu Max 则声称在 Terminal Bench 2.1 上取得“最佳总体得分”。同样的基准测试,同样的发布窗口,一方公布了一个数字,另一方公布的是“最佳”这个词。这是这一对中证据不对称最干净的例证,而且这不是细枝末节——它正是价格差距并非争论终点的全部原因。

当基线本就足够便宜时,编排能带来什么
为 Fugu Max 支付更高价格的理由,必须建立在单个模型处理得很糟糕的工作之上,而这类工作确实存在。长周期任务中,一次走错就会不断累积——多文件重构、仓库级变更、以及任何由验证者检查执行者输出比使用更强执行者更有价值的工作——正是 Thinker/Worker/Verifier 架构的用武之地。Sakana 自己对 Fugu 系列的表述是,在第二遍中捕获错误比第一次就做对更便宜。在这些任务上,一次尝试就能完成、输出费率为 $6.00 的方案,可以胜过需要三次尝试、费率为 $2.18 的方案。
那个论证有一种可检验的形式,而 Sakana 尚未公开跑过它。你真正想要的比较,是在两个系统都尝试的基准上,每完成一个任务的成本——Terminal Bench 2.1 就摆在那里,它从构造上就是智能体式、基于终端的,而两家厂商中只有一家公布了它的数字。在这个缺口被填补之前,诚实的立场是:Fugu Max 的成本优势只是在 token 层面被断言,在任务层面尚未得到证明;而 DeepSeek V4 Pro 的优势则直截了当:token 本身的成本只有三分之一。
关于池的构成,还有一点属于第二层要点,对这场对比而言,其重要性超过大多数情况。Fugu Max 的池在本版本中扩展,纳入了开放权重模型和专用模型,其中 NVIDIA Nemotron 系列是通过 NVIDIA 合作而被列出的。池中的开放权重意味着,Sakana 阶梯中最便宜的那一档不会受到另一家实验室定价决策的影响。DeepSeek V4 Pro 本身是开放权重,因此它不受任何人的定价决策影响,只受 DeepSeek 自己的定价决策影响——而它就是那一档。Sakana 为编排提出的韧性论证,直接适用于 DeepSeek,而对 Fugu Max 的底层供给只是间接适用。
缓存才是智能体工作负载真正变得昂贵的地方
两家厂商的基础费率都不是智能体循环实际支付的费率。长时间的智能体运行会在每一轮重新发送一段庞大且基本不变的前缀,而缓存命中率才是决定真实账单的关键。Fugu Max 将缓存输入的价格列为每百万 0.25 美元,这是一个真实且极具攻击性的数字——仅为其自身基础输入费率的八分之一。DeepSeek V4 Pro 将缓存命中的输入定价远低于其公布的基础价格,并且其输出费率大约定为其输入费率的三倍,而非大多数厂商采用的四到五倍比率,这尤其压缩了生成密集型循环的成本。
今天你无法做到的是,根据任一厂商的价目表可靠地计算出这项对比,因为 Fugu Max 的缓存费率适用于一个你无法预测的 token 数量。编排器决定运行多少个智能体;每个智能体的上下文都会计入;协调器还会加上自己的那部分。Sakana 对 Fugu 系列的定价承诺——基于最高层级参与模型的单一混合费率,且智能体不会叠加费用——消除了最坏情况,这是一项真正的让步,值得肯定。它并不能让用量提前可知。DeepSeek V4 Pro 的账单是你发送的 token 和接收的 token 的函数,除此之外别无其他。
这种可预测性既是模型属性,也是路由属性。DeepSeek V4 Pro 在 OrcaRouter 上按供应商标价提供,0% 加价,因此 DeepSeek 的费率调整当天就能作用到你现有的密钥上,而不必等到下次合同续签,并且当某条供应商通道被限流时,自动故障转移会为你兜底。最后这一点对这个模型而言分量格外重:DeepSeek 在本周期内已经调整过一次定价,其高峰与低谷分时档位的最终数字在不同来源之间还存在差异。当厂商的价目表发生变动时,路由器决定的正是:你是默默消化这一变化,还是在账单上才发现它。

我们无法验证的内容
Fugu Max 的发布中有三件事无法与 Sakana 自有材料之外的任何内容进行核对,因此在此列出,而非一笔带过。第一,六项基准测试胜出都没有给出数据——Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish 被列为胜出项,却未附任何分数,而 SWEFish 是 Sakana 的内部基准测试。第二,Fugu Max 的上下文窗口、输出上限和所支持的模态均未公布,因此上表中的模态和上限两行,是用已发布的规格去对照一片空白。第三,目前不存在对任何 Fugu 模型的独立评估,Artificial Analysis 上也没有 Fugu Max 的条目。
对于 DeepSeek V4 Pro,情况正好相反。该厂商报告了一长串数字——Terminal Bench 2.1 为 87.9,GPQA Diamond 为 92.8,SWE-bench Vals 为 96.4,HLE 在两种配置下分别为 42.7 和 60.0,MCP Atlas 为 73.6,Toolathlon-Verified 为 74.1,CyberGym 为 83.3——而这些数字同样是厂商自行报告的。差别并不在于某一方厂商更值得信赖,而在于当双方都公布数字时,分歧才有可能出现,而分歧可以被追查。没有数字支撑的说法无法被核查,只能被接受或忽略。
关于上述 DeepSeek 定价,还有一点需要说明:我们自己的模型页面载有两个数字,定价卡片中按量计费费率为每百万输入 $0.73、每百万输出 $2.18,而一份较早的说明则写着每百万输入 $0.44、每百万输出 $0.87。DeepSeek 还公布了高峰和非高峰档位,各来源对其最终费率说法不一。请将 $0.73 和 $2.18 视为你今天通过我们实际会被计费的费率,并在据此制定预算之前,对照已公布的费率卡进行确认。
底线
DeepSeek V4 Pro 在 Fugu Max 所选择的标准上赢得了这场比较。它在输入和输出上都更便宜,它有已公布的上下文窗口和 384K 输出上限,它在 Fugu Max 声称领先的基准测试上报告了真实数字,而且它的血统是开放权重,这是 Sakana 所推销的供应商独立性论证中最强的可用形式。如果你 的工作负载是 token 密集型的,而你的优先事项是来自一个你可以固定版本的模型的每 token 最低可辩护成本,那么这根本谈不上接近。
Fugu Max 在一个更窄的问题上胜出,而 DeepSeek V4 Pro 对此完全不回答:一个能自行组建智能体团队的协调器,能否以比单一模型更少的尝试次数完成艰难、长周期的工作。如果你有可核验、可容错的工作,并且你位于 EU/EEA 之外,那就值得试点。按每项已完成任务的 token 数来核算成本,先设定上限,再将其与 OrcaRouter 上按提供商标价提供的 DeepSeek V4 Pro 端点进行比较——一个密钥,0% 加价,并且费率与供应商自己的费率同步。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
