Fugu Ultra v2 对比 DeepSeek V4 Pro 的主视觉标题卡,副标题为“34倍输出价格的问题”,胶囊形徽章分别写着“DeepSWE 74.3 对比 62.7”、“输出 $30.00 对比 $0.87”和“开放权重 对比 闭源”,页脚一行写着“Sakana AI 对比 DeepSeek — 2026年9月”,右下角是 OrcaRouter 标志。
Engineering & Research

Fugu Ultra v2 对比 DeepSeek V4 Pro:34 倍输出价格问题

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Fugu Ultra v2 对其所写文本收取的费用,大约是 DeepSeek V4 Pro 标价的三十四倍。这不是笔误,也不是四舍五入造成的假象:Sakana AI 的新编排器标价为每百万输出词元 30.00 美元,DeepSeek 报告的价格为每百万 0.87 美元,而在两家厂商都公布了数字的唯一一个基准上,性能差距完全不是三十四倍。Sakana 称,2026 年 9 月 11 日发布的 Fugu Ultra v2 在 DeepSWE 上达到 74.3;DeepSeek 报告其 8 月发布的开放权重模型 DeepSeek V4 Pro 为 62.7。厂商报告的 11.6 分优势,对应 34 倍的输出价格——这一行就是全部对比;而真正该问的问题不是 Fugu Ultra v2 是否更好,而是它是否好到每百万词元多值十九美元,以及这对谁成立。

同一个问题的两个答案,从相反的两端构建而成

DeepSeek V4 Pro 和 Fugu Ultra v2 都是对同一种焦虑的回应——对单一封闭前沿供应商的依赖——而两者在方法上再不同不过了。

DeepSeek V4 Pro 是一款模型。发布报道将正式版本的 API 上线——即 DeepSeek-V4-Pro-0813 构建——定在 2026 年 8 月 12 日至 13 日前后,取代了 4 月 24 日的预览版。据报道,它是一个混合专家(MoE)系统,总参数量为 1.5 至 1.6 万亿,每个 token 约激活 490 亿参数,拥有 100 万 token 的上下文窗口和 38.4 万 token 的最大输出。它可在思考与非思考两种模式下进行推理,各有三档投入强度,同时支持 Ope​nAI 和 Anth​ropic 两套 API 协议,并新增了原生 Responses API,直指 Codex 风格的智能体框架。关键在于,其权重以 MIT 许可证发布,这意味着"韧性"之争已由"持有"定论:没有人能收回你手中的副本。

Fugu Ultra v2 不是一个模型。它是一个经过训练的协调器,据报道约有 7B 参数,能够将一个请求分解到一组未公开的模型池中,分配 Thinker、Worker 和 Verifier 角色,并通过一个兼容 OpenAI 的端点合成出答案。它的韧性论据是架构性的,而非法律性的:由于模型池可以替换,该系统能够承受任何单一供应商更改条款。与 Fugu Max 一同发布的 2.0 版本将训练截止时间移至 2026 年 8 月 28 日,并且——值得注意的是——将 Claude Fable 5Claude Fable 5.1 和 GPT-6 Astra 完全移出了模型池,同时仍声称胜过它们。

所以,这个对比就是拥有与协调。DeepSeek 交给你一个可以下载、审计、微调并自行部署的模型,让你在自己硬件允许的任何利润空间下提供服务。Sakana 交给你的则是一个能决定如何攻克每个问题的系统,其费率足以支撑代你运行多个前沿模型。

A two-column scoreboard for Fugu Ultra v2 vs DeepSeek V4 Pro titled 'Fugu Ultra v2 vs DeepSeek V4 Pro - the scoreboard'. Left column Fugu Ultra v2: Output price $30.00 / 1M, Input price $5.00 / 1M, DeepSWE 74.3, Weights closed, Output ceiling not published, Context 1M. Right column DeepSeek V4 Pro: Output price $0.87 / 1M, Input price $0.435 / 1M, DeepSWE 62.7, Weights open, MIT, Output ceiling 384K, Context 1M. Footer 'Both columns vendor-reported; DeepSeek API rates as reported August 2026, pricing revision pending.', with the OrcaRouter logo bottom-right.

34x实际能买到什么

先说基准测试,并把来源放在首位。下面每一个 DeepSeek 数字都来自厂商自身,且早于 DeepSeek 宣布将于8月中旬实施的高峰/非高峰定价调整;各方消息源对该调整的最终数字仍存在分歧——一份报告称高峰输出价格接近每百万 ¥27,另一份则称接近 ¥12,而基准价为 ¥6。在建立预算模型之前,请对照 DeepSeek 公布的价目表进行核实。每一个 Fugu 数字都来自 Sakana 自身,且没有任何独立方复现过其中任何一个;Artificial Analysis 也仍然没有 Fugu 模型的条目。

• DeepSWE — Fugu Ultra v2 74.3(厂商报告)对比 DeepSeek V4 Pro 62.7(厂商报告)

• Terminal Bench 2.1 — Sakana 未公布 Fugu Ultra v2 的数据,对比 DeepSeek V4 Pro 的 87.9(厂商报告)

• SWE-bench(Vals)— 无 Fugu Ultra v2 数据,对比 DeepSeek V4 Pro 96.4(厂商报告)

• Humanity's Last Exam — Fugu Ultra v2 v2.0 无数据,相比之下 DeepSeek V4 Pro 为无工具 42.7、有工具 60.0(厂商报告)

• GPQA Diamond — 无 Fugu Ultra v2 v2.0 数据,对比 DeepSeek V4 Pro 92.8(厂商报告)

• 输出价格 — Fugu Ultra v2 每 1M $30.00,在上下文超过 272K 时升至 $45.00;相比之下,DeepSeek V4 Pro 的列表价约为每 1M $0.87,且按量计费费率曾更高

关于那一行价格,有两点需要说明,因为整个对比都取决于它。第一,DeepSeek 的数字是发布报道中给出的标价,也在我们自己的模型说明中重申过,但我们列表上的计量费率一直按每百万输出 2.18 美元、每百万输入 0.73 美元运行——缓存行为和用量组合会改变实际数字,所以真实的倍数大致在 14 倍到 34 倍之间,取决于你的输入中有多少被缓存。即使按该区间的下限,输出成本也要高出十二倍以上。第二,DeepSeek 已经宣布了高峰/非高峰定价修订,但其最终数字各方来源仍有分歧——一份报道称高峰输出接近每百万 27 元,另一份称接近 12 元,而基准价为 6 元。在为预算建模之前,请对照公布的费率卡进行核实。

• 输入价格 —— Fugu Ultra v2 每 1M 为 $5.00,超过 272K 后翻倍;相比之下,DeepSeek V4 Pro 在缓存未命中时约为每 1M $0.435,在缓存命中时便宜约 120 倍

• 权重 — Fugu Ultra v2 闭源,池未披露,路由按设计不公开,对比 DeepSeek V4 Pro 以 MIT 许可开源、可自托管

• 上下文与输出 — Fugu Ultra v2 1M 上下文,输出上限未公布 对比 DeepSeek V4 Pro 1M 上下文,384K 输出上限

重叠问题很明显:这两个系统几乎不出现在同一行。Sakana 在其选定的八项基准中公布了五项胜利;DeepSeek 公布了一个更广的榜单,其中包括深度智能体覆盖——MCP Atlas 73.6、Toolathlon-Verified 74.1、CyberGym 83.3、NL2Repo 61.5、长上下文上的 CorpusQA 62.0——而 Fugu Ultra v2 在这些项目上完全没有公布数字。你唯一能对齐的一行是 DeepSWE,而它正是 Fugu 声称其软件工程优势最大的那项。比较这两次发布的读者,其实是在比较两场不同的考试。

详细程度乘数

输出价格不是对编排征收的线性税;它是对编排所增加数量的一种乘数。Fugu Ultra v2 会派生智能体,每个智能体都会生成推理 token 和输出 token,之后再由一个协调器将它们综合起来。Sakana 的定价 FAQ 做出了一项真正对消费者友好的承诺——你按一个混合费率付费,该费率基于模型池中的顶级模型,增加智能体不会让账单成倍增加——这为最坏情况设定了上限。但它并不限制用量。在每百万输出 token 30 美元的价格下,一次多智能体运行如果输出的文本量是单模型调用的四倍,成本就会是四倍,而这一乘数还会与高出 34 倍的输出费率叠加。

DeepSeek V4 Pro 的成本结构奖励的恰恰是相反的行为。输入端的一次缓存命中大约比未命中便宜两个数量级,这使得重复的长上下文工作——同一个代码仓库、同一组文档、同一个系统提示——比标价所暗示的要便宜得多。对于一个每一轮都会重新读取相同上下文的智能体循环来说,实际成本就落在那里,而这是一种任何编排器都无法绕开的结构性优势。

把两者放在一起看,决策就变得具体了。如果 Fugu Ultra v2 带来 11.6 个百分点的 DeepSWE 优势,并且输出 token 量是单次调用的三倍,那么你为在一个基准上获得十到十五个百分点的提升,每完成一项任务就要支付大约一百倍的成本。对于研究以及那些边际上的那一点就是全部关键的、本质上极其困难的工程问题,这种取舍是站得住脚的;而对于每天运行十万次的流水线来说,则完全不可接受。

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

每一个实际上是给谁的

如果以下任一情况属实,就选择 DeepSeek V4 Pro:你的工作负载量大且对成本敏感;你需要比编排器会给你设置的上限更长的输出;你出于数据驻留原因,需要一个可以审计、微调或在你自己的硬件上运行的系统;或者你需要的价格是一个你能计算出来的数字,而不是一个你只能观察到的数字。开放的 MIT 许可证不是营销卖点——它是这两个系统所提出的韧性论证中最强的一种形式,因为它不依赖任何供应商持续保持的善意。而且,按每百万输出约 $0.87 计算,它足够便宜,以至于做实验不花什么成本。

如果需要边际收益成倍放大、工作周期长、且正确性可核验,就选择 Fugu Ultra v2——比如带有测试套件的编码、结构化文档推理,以及多步分析,其中 Verifier 角色能捕捉到单次生成就会放过并交付的错误。Sakana 自己的案例研究正指向这一点:一次十四小时的自主研究运行;一个魔方求解器完成了全部 300 次打乱,而两个匿名化的基线则彻底崩溃。请记住,这些基线是匿名化的、且由厂商自行挑选,这削弱了它们作为证据的效力,但并不意味着它们是假的。同时也请记住那个对某些团队而言直接终结讨论的约束:Fugu Ultra v2 不在欧盟或欧洲经济区销售,Sakana 也明说了这一点。

如果你打算运行其中任何一个,这里有一个实用提示。Fugu Ultra v2 不在 OrcaRouter 上——它通过 Sakana 自有的 OpenAI 兼容 API 和几个第三方平台提供,而从较早的 Fugu 升级只需更改一行参数。DeepSeek V4 Pro 在 OrcaRouter 上以供应商标价提供,零加价,这一点在这里比平常更重要:Deep​Seek 已经在本周期内宣布过一次价格调整,而在一个透传路由器上,供应商价格变动会在同一天、同一个密钥上生效,而不是等重新协商之后。如果你想在正式投入之前用你自己的工作量对两者进行基准测试,那么比较中更便宜的一方,就是你可以按标价调用、并且背后有自动故障转移的那一个。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the '1.6T total / 49B active params, 1M context, top-tier reasoning + agentic tool use' summary, the 1M token context and 384K max output fields, the pricing tiles reading INPUT $0.73 and OUTPUT $2.18 per 1M tokens with p50 TTFT 919ms, and the description stating transparent pricing at $0.44 per 1 million input tokens and $0.87 per 1 million output tokens.

裁决

在经济性上,这并非一场势均力敌的较量;在能力上,这也并非一场决定性的较量。DeepSeek V4 Pro 以巨大优势成为更优的默认选择:你能握在手里的开放权重、384K 的输出上限、1M 的上下文、已公开的长上下文得分,以及输出价格约为 Fugu Ultra v2 的三十四分之一。Fugu Ultra v2 则是应对一小类高成本问题的更佳工具,而 Sakana 的主张——一个排除掉三个最强模型的固定模型池,仍能在可验证的工作上胜过它们——是当下该领域最有趣的架构论点,也是背后独立证据最少的那一个。

务实的解决办法不是做选择。把 DeepSeek V4 Pro 作为默认运行,因为它便宜、开放且快速,同时把 Fugu Ultra v2 留作储备,用于那些即使成本增加一百倍,仍小于出错代价的任务。你不该做的,是把 Sakana 的八项基准测试榜单解读为:昂贵的编排器已经取代了廉价的开源模型。在它们共同出现的那一行上,它以 34 倍的输出价格领先 11.6 分。这究竟是划算还是陷阱,完全取决于你把它指向哪个问题。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新