
Sakana Fugu Ultra v2 解读:池子变小了,分数上升了
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Fugu Ultra v2 是一种奇怪的升级:Sakana AI 于 2026 年 9 月 11 日发布它时,其模型池中已不再包含 Claude Fable 5、Claude Fable 5.1 或 GPT-6 Astra——这三者都是目前最强系统中的代表——却仍声称能击败这三者。这家东京实验室新的质量层级旗舰产品,与一款名为 Fugu Max 的更便宜的同门产品同日发布,在 Sakana 自己的评估中,于八项基准中的五项上表现最佳或并列最佳,包括 Chartography 上的 48.3,而 Claude Opus 5 为 27.3,Claude Fable 5 为 29.5;DeepSWE 上则为 74.3。这些数字没有一个被独立复现,而且任何 Fugu 模型都仍然没有 Artificial Analysis 页面。这一落差正是关键所在:你被要求购买的,是一个协调层,而它的全部卖点就是:它不需要最好的模型,也能给出最好的答案。
Sakana AI 由 Transformer 论文合著者 Llion Jones 和 David Ha 于 2023 年创立。Fugu 系列于 2026 年 6 月推出,是一个以单一模型形式交付的多智能体系统:你调用一个与 OpenAI 兼容的端点,而在其背后,一个经过训练的协调器会分解请求、生成智能体并综合结果。这项研究是真实且已发表的——TRINITY(arXiv 2512.04695)演化出一个轻量级协调器,负责分配 Thinker、Worker 和 Verifier 角色;Conductor(arXiv 2512.04388)学会了智能体之间的自然语言协调;Fugu 技术报告位于 arXiv 2606.21228。Sakana 从未公布的是所有人都真正想要的东西:池中各个模型的身份,以及按任务的路由决策。
与六月的 Fugu Ultra 相比,实际有哪些变化?
版本 2.0 是在原版大约十一周后的一次点版本更新,并非新架构。厂商自己的说法是,Fugu Ultra v2 和 Fugu Max 是“同一套核心编排架构”,只是为两种不同任务而调校:Max 把成本性能前沿往下推,Ultra 把峰值能力往上推。模型 ID 是 fugu-ultra-v2.0,Sakana 表示从更早的 Fugu 迁移只需改一行参数,无需 SDK 迁移——这是此次发布中最对消费者友好的地方。
实质性变化在于首尾两处。首先,训练截止时间移至 20260828,因此协调器已针对当前一代前沿模型重新调优。其次,也是更有意思的一点,模型池的构成变化是 Sakana 主动宣传的:Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 被明确排除在外。Sakana 的论点是,这证明分数并不依赖于某一个专有前沿模型;如果你担心的是供应商锁定、API 被撤销,或某个模型因出口管制而销声匿迹,这一点就很重要。
有一个二阶后果,Sakana 并未细究。如果这个模型池排除了三个可用的最强模型,那么针对 Fable 5 和 Fable 5.1 的基准比较,就是在与编排器即便想调用也无法调用的系统进行比较。这种比较是合理的——它关乎的是架构,而非访问权限——但它并不是一场对谁的模型更好的同等条件测试。它测试的是协调能否胜过原始能力。这确实是个很有意思的问题。只不过,它不是记分牌乍一看所暗示的那个问题。

这些数字,以及它们是由谁产生的
本节中的每个数字均由厂商报告。Sakana 未发布任何评估工具、逐任务得分网格或复现方法,而且其编排设计使独立复现变得更难而非更容易:复现一个得分需要以相同版本和相同拓扑访问模型池中的每一个模型,而按设计,拓扑因请求而异。
• Chartography(对图表和结构化文档的视觉推理)——Fugu Ultra v2 48.3、Claude Opus 5 27.3、Claude Fable 5 29.5——厂商报告
• DeepSWE(真实世界软件工程)—— Fugu Ultra v2 74.3 —— 厂商报告称,据称可胜过每 token 成本高出三到五倍的模型
• 最佳或并列最佳排名——八个基准测试中的五个:GDP.pdf、Chartography、SWEFish、DeepSWE 和 Toolathon——系厂商报告
• 排名前二 — 八项基准测试中的七项 — 厂商报告
• 此前的 Fugu Ultra(2026 年 6 月,用于对比)—— LiveCodeBench 93.2、GPQA-Diamond 95.5、TerminalBench 82.1、SWE-Bench Pro 73.7 —— 厂商报告
Chartography 这一行值得受到它目前获得的重视,因为它是唯一一个与某个具名的现役旗舰模型之间的差距并非微不足道的类别。在一个视觉推理基准上比 Claude Opus 5 高出 21 分,这类数字通常不出几天就会出现在独立排行榜上。但截至本文撰写时,这样的数字尚未出现。要把这一行看作一个附带金额数字的假设,而不是一个已有定论的结果。
定价:与六月持平,输出方面则贵得毫不含糊。
Fugu Ultra v2 每百万输入 token 收费 $5,每百万输出 token 收费 $30,每百万缓存输入收费 $0.50。当上下文超过 272,000 个 token 时,这些价格分别变为 $10、$45 和 $1.00。Fugu Max 的定价结构则完全不同:输入 $2、输出 $6、缓存 $0.25,且不随上下文长度变化,另加每次网络搜索或抓取调用 $0.007。
关于那张定价表,有两点值得仔细看。第一点是输出价格是输入的六倍——这个比例相当激进,等于为模型的啰嗦程度定价,而编排本来就是一件话多的事。一个会派生代理并综合其回答的协调器会生成大量 token,而你要为所有这些 token 按每百万 30 美元付费。Sakana 关于效率的说法针对的是底层算力池,而不是系统代你产出了多少文本,这两者是不同的数字。做预算时要依据实际观测到的 token 用量,而不是那个头条费率。
第二个是 272K 悬崖。对超过某个阈值的部分将每 token 费率翻倍,是为长上下文工作定价的一种合理方式,但这意味着一次长上下文智能体运行的实际成本并不是定价页面上显示的那个数字。如果你的工作负载正好处于边界附近,那么在其两侧,计算方式会发生实质性变化。
Fugu 的订阅档位——每月 20 美元的 Standard、100 美元的 Pro、200 美元的 Max,并分别提供 10 倍和 20 倍额度——都可使用 Fugu、Fugu Ultra 和 Fugu Max。Sakana 还会针对给定请求,按资源池中存在的最高档位来为基础 Fugu 模型定价,并明确表示增加更多代理并不会使账单成倍增加。这与你自己调用多个前沿模型时会得到的扇出成本模型有本质区别。
Sakana不会告诉你的那些事
询问哪些模型回答了你的问题,而 FAQ 的回答很直接:“出于设计考虑,此路由信息不予公开。”Ultra 和 Max 池是固定的,因此你无法选择退出某个供应商;只有基础版 Fugu 模型支持在控制台设置中按模型选择退出。企业客户可以协商自定义配置。
这种不透明性正是自六月以来 Fugu 系列招致批评的核心所在,而且这是一种公允的批评,而非敌意的批评。当一个编排器通过组合其他实验室的模型取得高分时,这个分数属于该系统——这东西确实可以卖,也站得住脚——但它并不能转移给任何单个模型,也无法被审计。评审者已经直言不讳地指出了这一点:Fugu 并没有击败旗舰,而是把旗舰雇来了。在带有廉价检查器的可验证任务上,比如带测试套件的编程基准,委员会确实可以胜过其最佳成员。而在没有这类检查器的任务上,让一个评审小组对若干前沿模型采样并报告最佳结果,其实部分是在报告运气。Sakana 自己选择的类别——Chartography、DeepSWE、Toolathon——偏向可验证的一端,这既是提出这一主张的合适位置,也是这一主张无法无条件推广的原因。
独立测试人员也指出,延迟波动是编排的实际代价:在困难任务上,协调者会进行深思熟虑,而在简单任务上,这种深思纯属额外开销。据报道,一位研究人员的着色器任务耗时约三十分钟,而质量仅被评为尚可。

哪里才能真正得到它
Fugu Ultra v2 现已上线,可通过 Sakana 自家的 OpenAI 兼容 API 使用——用 API 密钥将现有客户端指向该端点,并更改一行代码——也可通过多个第三方平台使用。OrcaRouter 不提供 Fugu 模型;如果你想调用 Fugu Ultra v2,厂商自己的 API 是直接途径。
值得注意的是,Sakana 实际上正在与之竞争的,是这样一种替代方案。让 Fugu Ultra v2 得以运转的模型池,是由如今可各自单独调用的模型汇聚而成的;而用来衡量它的对手,正是各团队已经在运行的那些。Claude Opus 5、DeepSeek V4 Pro 和 Gemini 3.1 Pro 都以各自供应商的标价、0% 加价率上线 OrcaRouter,这意味着这些厂商中任何一家的降价,都会在公布当天同步在我们这边生效。如果你考虑编排器的理由是韧性——不希望生产路径依赖某一家厂商的正常运行时间,或某一家厂商的政策——那么一层具备跨供应商自动故障转移的路由层,能在模型层面解决其中一部分问题,而 Fugu Ultra v2 则在推理层面解决另一部分问题。一个 API 接入 200+ 模型并具备故障转移,并不能替代训练有素的协调器;而训练有素的协调器,也不能替代“不依赖单一供应商”这件事。有些团队两者都想要。
合规陷阱
Fugu 在欧盟和欧洲经济区不可用。供应商的措辞很明确:在努力满足 GDPR 和欧盟特定法规要求期间,尚未在 EU/EEA 提供;而在其他地区,访问可能受网络条件或当地规则限制。如果你的组织在范围内包含欧盟实体,那么无论基准测试表现如何,这都会将 Fugu 从考虑范围中排除——这一点值得在评估之前而非之后了解。

看什么
三件事会让 Fugu Ultra v2 从一个有趣的宣称,变成一项真正能承重的选择。一次独立评估——一条 Artificial Analysis 条目、一个 LMArena 排名,任何背后有评测框架支撑的东西——将在一周内解决 Chartography 问题。第三方在可验证编程基准上复现出的数字,将证实该架构所预测的系统级收益。而一个已披露的池,哪怕只是部分披露,也会让买家推想:当他们把生产流量路由经过一个无法审查的协调器时,自己究竟在接受哪些单点故障。
在那之前,诚实的立场是这样的。Fugu Ultra v2 是把编排作为产品而非研究演示来出售的迄今最严肃的一次尝试,它出自一家有已发表研究成果背书的实验室,其定价让编排溢价变得明明白白,而非藏而不露。如果你的工作负载周期长、可验证,且局限于 Sakana 能够提供服务的地区,那就值得开展一次范围明确的试点,并开启 token 计量。如若不然,那些用来对标 Fugu Ultra v2 的模型只需一次 API 调用、按标价即可获得,还有实打实的凭据证明它们的能力。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
