
Fugu Ultra v2 对比 DeepSeek V4 Pro:34 倍输出价格问题
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Fugu Ultra v2 对其所写文本收取的费用,大约是 DeepSeek V4 Pro 标价的三十四倍。这不是笔误,也不是四舍五入造成的假象:Sakana AI 的新编排器标价为每百万输出词元 30.00 美元,DeepSeek 报告的价格为每百万 0.87 美元,而在两家厂商都公布了数字的唯一一个基准上,性能差距完全不是三十四倍。Sakana 称,2026 年 9 月 11 日发布的 Fugu Ultra v2 在 DeepSWE 上达到 74.3;DeepSeek 报告其 8 月发布的开放权重模型 DeepSeek V4 Pro 为 62.7。厂商报告的 11.6 分优势,对应 34 倍的输出价格——这一行就是全部对比;而真正该问的问题不是 Fugu Ultra v2 是否更好,而是它是否好到每百万词元多值十九美元,以及这对谁成立。
同一个问题的两个答案,从相反的两端构建而成
DeepSeek V4 Pro 和 Fugu Ultra v2 都是对同一种焦虑的回应——对单一封闭前沿供应商的依赖——而两者在方法上再不同不过了。
DeepSeek V4 Pro 是一款模型。发布报道将正式版本的 API 上线——即 DeepSeek-V4-Pro-0813 构建——定在 2026 年 8 月 12 日至 13 日前后,取代了 4 月 24 日的预览版。据报道,它是一个混合专家(MoE)系统,总参数量为 1.5 至 1.6 万亿,每个 token 约激活 490 亿参数,拥有 100 万 token 的上下文窗口和 38.4 万 token 的最大输出。它可在思考与非思考两种模式下进行推理,各有三档投入强度,同时支持 OpenAI 和 Anthropic 两套 API 协议,并新增了原生 Responses API,直指 Codex 风格的智能体框架。关键在于,其权重以 MIT 许可证发布,这意味着"韧性"之争已由"持有"定论:没有人能收回你手中的副本。
Fugu Ultra v2 不是一个模型。它是一个经过训练的协调器,据报道约有 7B 参数,能够将一个请求分解到一组未公开的模型池中,分配 Thinker、Worker 和 Verifier 角色,并通过一个兼容 OpenAI 的端点合成出答案。它的韧性论据是架构性的,而非法律性的:由于模型池可以替换,该系统能够承受任何单一供应商更改条款。与 Fugu Max 一同发布的 2.0 版本将训练截止时间移至 2026 年 8 月 28 日,并且——值得注意的是——将 Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 完全移出了模型池,同时仍声称胜过它们。
所以,这个对比就是拥有与协调。DeepSeek 交给你一个可以下载、审计、微调并自行部署的模型,让你在自己硬件允许的任何利润空间下提供服务。Sakana 交给你的则是一个能决定如何攻克每个问题的系统,其费率足以支撑代你运行多个前沿模型。

34x实际能买到什么
先说基准测试,并把来源放在首位。下面每一个 DeepSeek 数字都来自厂商自身,且早于 DeepSeek 宣布将于8月中旬实施的高峰/非高峰定价调整;各方消息源对该调整的最终数字仍存在分歧——一份报告称高峰输出价格接近每百万 ¥27,另一份则称接近 ¥12,而基准价为 ¥6。在建立预算模型之前,请对照 DeepSeek 公布的价目表进行核实。每一个 Fugu 数字都来自 Sakana 自身,且没有任何独立方复现过其中任何一个;Artificial Analysis 也仍然没有 Fugu 模型的条目。
• DeepSWE — Fugu Ultra v2 74.3(厂商报告)对比 DeepSeek V4 Pro 62.7(厂商报告)
• Terminal Bench 2.1 — Sakana 未公布 Fugu Ultra v2 的数据,对比 DeepSeek V4 Pro 的 87.9(厂商报告)
• SWE-bench(Vals)— 无 Fugu Ultra v2 数据,对比 DeepSeek V4 Pro 96.4(厂商报告)
• Humanity's Last Exam — Fugu Ultra v2 v2.0 无数据,相比之下 DeepSeek V4 Pro 为无工具 42.7、有工具 60.0(厂商报告)
• GPQA Diamond — 无 Fugu Ultra v2 v2.0 数据,对比 DeepSeek V4 Pro 92.8(厂商报告)
• 输出价格 — Fugu Ultra v2 每 1M $30.00,在上下文超过 272K 时升至 $45.00;相比之下,DeepSeek V4 Pro 的列表价约为每 1M $0.87,且按量计费费率曾更高
关于那一行价格,有两点需要说明,因为整个对比都取决于它。第一,DeepSeek 的数字是发布报道中给出的标价,也在我们自己的模型说明中重申过,但我们列表上的计量费率一直按每百万输出 2.18 美元、每百万输入 0.73 美元运行——缓存行为和用量组合会改变实际数字,所以真实的倍数大致在 14 倍到 34 倍之间,取决于你的输入中有多少被缓存。即使按该区间的下限,输出成本也要高出十二倍以上。第二,DeepSeek 已经宣布了高峰/非高峰定价修订,但其最终数字各方来源仍有分歧——一份报道称高峰输出接近每百万 27 元,另一份称接近 12 元,而基准价为 6 元。在为预算建模之前,请对照公布的费率卡进行核实。
• 输入价格 —— Fugu Ultra v2 每 1M 为 $5.00,超过 272K 后翻倍;相比之下,DeepSeek V4 Pro 在缓存未命中时约为每 1M $0.435,在缓存命中时便宜约 120 倍
• 权重 — Fugu Ultra v2 闭源,池未披露,路由按设计不公开,对比 DeepSeek V4 Pro 以 MIT 许可开源、可自托管
• 上下文与输出 — Fugu Ultra v2 1M 上下文,输出上限未公布 对比 DeepSeek V4 Pro 1M 上下文,384K 输出上限
重叠问题很明显:这两个系统几乎不出现在同一行。Sakana 在其选定的八项基准中公布了五项胜利;DeepSeek 公布了一个更广的榜单,其中包括深度智能体覆盖——MCP Atlas 73.6、Toolathlon-Verified 74.1、CyberGym 83.3、NL2Repo 61.5、长上下文上的 CorpusQA 62.0——而 Fugu Ultra v2 在这些项目上完全没有公布数字。你唯一能对齐的一行是 DeepSWE,而它正是 Fugu 声称其软件工程优势最大的那项。比较这两次发布的读者,其实是在比较两场不同的考试。
详细程度乘数
输出价格不是对编排征收的线性税;它是对编排所增加数量的一种乘数。Fugu Ultra v2 会派生智能体,每个智能体都会生成推理 token 和输出 token,之后再由一个协调器将它们综合起来。Sakana 的定价 FAQ 做出了一项真正对消费者友好的承诺——你按一个混合费率付费,该费率基于模型池中的顶级模型,增加智能体不会让账单成倍增加——这为最坏情况设定了上限。但它并不限制用量。在每百万输出 token 30 美元的价格下,一次多智能体运行如果输出的文本量是单模型调用的四倍,成本就会是四倍,而这一乘数还会与高出 34 倍的输出费率叠加。
DeepSeek V4 Pro 的成本结构奖励的恰恰是相反的行为。输入端的一次缓存命中大约比未命中便宜两个数量级,这使得重复的长上下文工作——同一个代码仓库、同一组文档、同一个系统提示——比标价所暗示的要便宜得多。对于一个每一轮都会重新读取相同上下文的智能体循环来说,实际成本就落在那里,而这是一种任何编排器都无法绕开的结构性优势。
把两者放在一起看,决策就变得具体了。如果 Fugu Ultra v2 带来 11.6 个百分点的 DeepSWE 优势,并且输出 token 量是单次调用的三倍,那么你为在一个基准上获得十到十五个百分点的提升,每完成一项任务就要支付大约一百倍的成本。对于研究以及那些边际上的那一点就是全部关键的、本质上极其困难的工程问题,这种取舍是站得住脚的;而对于每天运行十万次的流水线来说,则完全不可接受。

每一个实际上是给谁的
如果以下任一情况属实,就选择 DeepSeek V4 Pro:你的工作负载量大且对成本敏感;你需要比编排器会给你设置的上限更长的输出;你出于数据驻留原因,需要一个可以审计、微调或在你自己的硬件上运行的系统;或者你需要的价格是一个你能计算出来的数字,而不是一个你只能观察到的数字。开放的 MIT 许可证不是营销卖点——它是这两个系统所提出的韧性论证中最强的一种形式,因为它不依赖任何供应商持续保持的善意。而且,按每百万输出约 $0.87 计算,它足够便宜,以至于做实验不花什么成本。
如果需要边际收益成倍放大、工作周期长、且正确性可核验,就选择 Fugu Ultra v2——比如带有测试套件的编码、结构化文档推理,以及多步分析,其中 Verifier 角色能捕捉到单次生成就会放过并交付的错误。Sakana 自己的案例研究正指向这一点:一次十四小时的自主研究运行;一个魔方求解器完成了全部 300 次打乱,而两个匿名化的基线则彻底崩溃。请记住,这些基线是匿名化的、且由厂商自行挑选,这削弱了它们作为证据的效力,但并不意味着它们是假的。同时也请记住那个对某些团队而言直接终结讨论的约束:Fugu Ultra v2 不在欧盟或欧洲经济区销售,Sakana 也明说了这一点。
如果你打算运行其中任何一个,这里有一个实用提示。Fugu Ultra v2 不在 OrcaRouter 上——它通过 Sakana 自有的 OpenAI 兼容 API 和几个第三方平台提供,而从较早的 Fugu 升级只需更改一行参数。DeepSeek V4 Pro 在 OrcaRouter 上以供应商标价提供,零加价,这一点在这里比平常更重要:DeepSeek 已经在本周期内宣布过一次价格调整,而在一个透传路由器上,供应商价格变动会在同一天、同一个密钥上生效,而不是等重新协商之后。如果你想在正式投入之前用你自己的工作量对两者进行基准测试,那么比较中更便宜的一方,就是你可以按标价调用、并且背后有自动故障转移的那一个。

裁决
在经济性上,这并非一场势均力敌的较量;在能力上,这也并非一场决定性的较量。DeepSeek V4 Pro 以巨大优势成为更优的默认选择:你能握在手里的开放权重、384K 的输出上限、1M 的上下文、已公开的长上下文得分,以及输出价格约为 Fugu Ultra v2 的三十四分之一。Fugu Ultra v2 则是应对一小类高成本问题的更佳工具,而 Sakana 的主张——一个排除掉三个最强模型的固定模型池,仍能在可验证的工作上胜过它们——是当下该领域最有趣的架构论点,也是背后独立证据最少的那一个。
务实的解决办法不是做选择。把 DeepSeek V4 Pro 作为默认运行,因为它便宜、开放且快速,同时把 Fugu Ultra v2 留作储备,用于那些即使成本增加一百倍,仍小于出错代价的任务。你不该做的,是把 Sakana 的八项基准测试榜单解读为:昂贵的编排器已经取代了廉价的开源模型。在它们共同出现的那一行上,它以 34 倍的输出价格领先 11.6 分。这究竟是划算还是陷阱,完全取决于你把它指向哪个问题。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
