Fugu Ultra v2 对比 Gemini 3.1 Pro 的主视觉标题卡,副标题为“可能已经身处机器内部的对手”,胶囊徽章上写着“$30.00 对比 $12.00 输出”、“CharXiv 86.6 对比 80.2 方向性”和“未披露池”,页脚行为“Sakana AI 对比 Google DeepMind - 2026年9月”,右下角有 OrcaRouter 标志。
Guides & Insights

Fugu Ultra v2 对比 Gemini 3.1 Pro:那个可能早已置身机器内部的对手

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在 Fugu Ultra v2 与 Gem​ini 3.1 Pro 对比的某个版本中,无论基准测试结果如何,Gem​ini 都会获胜——因为它可能在做部分工作。Sakana AI 的编排系统于 2026 年 9 月 11 日发布,并未披露它协调哪些模型;6 月的 Fugu Ultra 所报告的模型池包括 Gem​ini 3.1 Pro 等,而 2.0 版本只告诉我们它移除了什么,点名 Claude Fable 5Claude Fable 5.1GPT-6 Astra 为被排除项。Goo​gle 的 Gem​ini 3.1 Pro 是一个单一的多模态前沿模型,具有 100 万 token 上下文,可处理文本、图像、PDF、音频和视频,自 2026 年 5 月起全面可用,价格为每百万输入 2.00 美元、每百万输出 12.00 美元。其中一个是你可以检查的模型。另一个则是一个系统,其基准测试的胜利可能经由第一个模型取得,而两家厂商都不会告诉你它们是否如此。

每个系统实际上是什么

Gemini 3.1 Pro 的清晰可读在前沿发布中已属罕见。它是 Google DeepMind 的稀疏混合专家(MoE)Transformer,于 2026 年 2 月 19 日首次以预览版发布,有消息源将其正式可用时间定在 2026 年 5 月——我们自己的收录列表是以预览版模型 ID 收录它的。它具有 100 万 token 的输入窗口和 65K token 的输出上限,接受文本、图像、PDF、音频、视频和代码,并提供三级推理控制——低、中、高——其中高为 API 默认值。Google 报告称其在 ARC-AGI-2 上达到 77.1%,是上一代 31.1% 的两倍多;在 GPQA Diamond 上为 94.3%;在 SWE-bench Verified 上为 80.6%;在 Terminal-Bench 2.0 上为 68.5%;在 BrowseComp 上为 85.9%;在 Humanity's Last Exam 上不使用工具时为 44.4%,配合搜索和代码执行则升至 51.4%。这些都是厂商数据。其知识截止日期为 2025 年 1 月,如果你的工作依赖近期事件,这一点值得注意。

Fugu Ultra v2 是一个协调器。它是一个经过训练的模型,据报道约有 7B 参数,会读取请求,组建一个由源自 Sakana 的 TRINITY 研究的 Thinker、Worker 和 Verifier 角色组成的智能体团队,并在一个兼容 OpenAI 的端点后面综合给出答案。它自身没有公布模态列表——它能看到的任何内容,之所以能看到,是因为其池中的某个模型能看到它。它的上下文为 1M token,并在 272K 处存在陡峭的定价断崖,费率在那里翻倍至输入 $10、输出 $45。它的输出上限未公布。它的模型池未披露,其路由决策“按设计不公开”,而对于 Ultra 层级,模型池是固定的,因此你无法排除某个提供商。

这种不对称正是整场对决的核心。Gem​ini 3.1 Pro 是一个可以直接购买并对其进行分析的组件。Fugu Ultra v2 则是一个装配体,其零件你无法看见,而且它最有力的基准测试声明可能部分来自 Gem​ini 自身的结果与其他人结果的结合。

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

两者重叠之处的比较

已发表的证据中,很少有能将这两个系统放在同一行直接对比的。下文中 Gemini 3.1 Pro 的数据是 Google 自己的;Fugu Ultra v2 的数据是 Sakana 自己的;如果第三方聚合方发布了二者共用的同一行数据,则会加以标注,并附上说明:这仅具方向性,而非决定性。

• 多模态推理(CharXiv,共享行)—— 据 BenchLM,Fugu Ultra v2 为 86.6%,Gem​ini 3.1 Pro 为 80.2%;BenchLM 将该类别标记为方向性,且拒绝指明胜出者

• TerminalBench 2.1 — 没有 Fugu Ultra v2 v2.0 对比 Gem​ini 3.1 Pro 的数值,也没有可比较的已发布数值;在第三方汇总中,6 月的 Fugu Ultra 报告为 82.1%,而 Gem​ini 3.1 Pro 为 70.3%

• SWE-Bench Pro — 没有 Fugu Ultra v2 v2.0 对比 Gem​ini 3.1 Pro 的数据,也没有可比较的已发布数据;6 月的 Fugu Ultra 报告为 73.7%,而 Gem​ini 3.1 Pro 为 54.2%

• ARC-AGI-2 — 无 Fugu Ultra v2 数据,而 Gem​ini 3.1 Pro 为 77.1%,系厂商报告

• Humanity's Last Exam — 无 Fugu Ultra v2 v2.0 数据,对比 Gemini 3.1 Pro 无工具 44.4%、有工具 51.4%,均为厂商报告数据

• 模态覆盖 — Fugu Ultra v2 继承其池所支持的任何模态,未披露;相比之下,Gemini 3.1 Pro 的文本、图像、PDF、音频、视频和代码支持情况有文档记录。

• 输入 / 输出价格 — Fugu Ultra v2 每 100 万 $5.00 / $30.00,超过 272K 后翻倍;而 Gem​ini 3.1 Pro 每 100 万最高 200K 为 $2.00 / $12.00,超出后为 $4.00 / $18.00,缓存输入 $0.20 / $0.40

• 上下文与输出 — Fugu Ultra v2 1M 上下文,输出上限未公布,对比 Gemini 3.1 Pro 1M 输入、65K 输出

• 权重与访问 — Fugu Ultra v2 闭源,欧盟/欧洲经济区除外;而 Gem​ini 3.1 Pro 为专有模型,但在 Goo​gle 各平台广泛可用

多模态那一行需要谨慎处理,因为它被引用得最多,却最不扎实。BenchLM 的 CharXiv 汇总让 Fugu Ultra v2 领先 6.4 个归一化分——而同一页面明确说明,方向性行从不评选胜者,Gemini 在智能体、编程、知识或多语言类别中没有测量结果,Fugu 在数学或多语言类别中也没有。若在大多数行中某一类别只有一方被测量,就无法得出裁决。如果你从这次比较中别的什么也没得到,至少要记住这一点:具体到多模态工作,已公布的证据不支持任何一方的结论,而唯一存在的那一行明确不是定论。

改变框架的可能性

Sakana 不会透露模型池里有什么。这是有文档记录的设计选择,而非疏忽——FAQ 中说明,路由信息按设计不予公开,也没有任何可供检查的机制。我们从 6 月那一代得知,据报道,模型池成员包括 Gemini 3.1 Pro 以及其他前沿模型。2.0 版本改变了模型池,而 Sakana 仅通过排除法来描述这一变化:Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 已不在其中。发布说明中没有任何内容表明 Gemini 仍然在里面。

如果 Gemini 3.1 Pro 也在候选池中,就会引出三个后果,而这三个后果都是实务层面的,而非理念层面的。第一,Fugu Ultra v2 多模态表现中的一部分,其实是 Gemini 的表现与其他模型的表现叠加而成的——这意味着,你除了要支付本可直接支付的每 token 单价,还要额外付一笔协调溢价。第二,Fugu Ultra v2 每百万输出 token 收费 30 美元,而 Gemini 3.1 Pro 是 12 美元,这多出来的部分是组装溢价,而不是原始能力溢价;如果你的任务只是一个多模态问题,Gemini 回答它更便宜,而且你能清楚看到究竟是哪个模型给出的答案。第三,也是最有用的:对一个编排器最诚实的基准检验,不是"它是否能胜过自己的各个组件",而是"当你单独使用它时,它是否能胜过其中最好的那个组件"。Sakana 的架构正是建立在这一主张之上:在可验证的任务上,它确实做得到。在仅凭一张读图表得出的基准成绩就接受这一主张之前,它值得用你自己的实际工作负载来检验。

有一种解读是,答案是否定的,而编排器仍然证明了自己的价值。如果 Gem​ini 在候选池中,并且 Fugu Ultra v2 对 Claude Opus 5 的 Chartography 得分 48.3 比 27.3 站得住脚,那么 Sakana 所构建的就是一个协调层,它能可靠地从同一个模型中获得比单次调用更多的产出。那是一个真正的产品,唯一悬而未决的问题是,其利润空间是否覆盖成本。还没有人发表过这项实验。

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

诚实的边缘所在之处

Gem​ini 3.1 Pro 的优势是实实在在的。在输入和输出上,它的价格约为 Fugu Ultra v2 的五分之二,而且与 Fugu 不同,它的费率不会在超过某个上下文阈值后翻倍——200K 处的阶梯比 272K 的悬崖更平缓。它记录自己的模态,而不是继承它们,这意味着音频和视频工作是受支持的功能,而不是一种希望。它有公开的输出上限。它可通过 Goo​gle 自己的界面使用,并且,与 Fugu Ultra v2 被拿来比较的其他模型一样,它 可在 OrcaRouter 上调用——作为google/gemini-3.1-pro-preview按 Goo​gle 的标价、0% 加价,因此 Goo​gle 的价格变动会在公布当天落到同一个密钥上。

Fugu Ultra v2 的优势更窄,也更真实。它会不止一次地攻克一个难题,并由 Verifier 角色检查工作,因此它最有力的主张都落在可检验正确性的基准上——Chartography、DeepSWE、Toolathon——而非知识回忆上。Sakana 公布的案例研究也指向同一方向:一个机械 CAD 光圈能正确开合,而其他模型留下了缝隙和薄弱连杆;一个纯 Python 的魔方求解器完成了全部 300 个打乱魔方,而两个匿名的前沿基线则完全崩溃。那些基线是匿名的且由厂商挑选,因此应将其视为示例而非证明。但这一模式在整个发布中是一致的,并且它描述了一种单次模型调用不具备的真实能力:在一个问题上持续坚持,直到答案通过检查。

也要权衡这些约束条件。Fugu Ultra v2 不在欧盟或欧洲经济区销售,而且 Sakana 明确表示正在努力实现 GDPR 合规。Gem​ini 3.1 Pro 没有这类限制,并且背后有悠久得多的独立评估记录。

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

裁决

对于大多数多模态工作,Gemini 3.1 Pro 都是正确选择,而且毫无悬念。它按 token 更便宜,按文档更便宜,有音频和视频方面的文档,并且设有上下文阈值上限,不会在运行中途让你的账单翻倍,还有——这里最关键的一点——你能看到是什么在回答你。如果你需要一个模型来读取 PDF、观看片段并回答问题,那就没有任何理由通过一个未公开的模型池、以两倍半的输出价格来路由这件事。

Fugu Ultra v2 只适用于一种非常具体、范围窄得多的任务形态:具有可核验答案的长周期任务,在这类任务中,用三种方式尝试一个问题并验证结果,胜过只尝试一次,而且质量上的那一点边际提升值得付出成倍的代价。如果你的用户范围涉及欧盟或欧洲经济区,那就完全不在考虑之列。

这场对决留下的那个令人不安的问题,是没有人测量过的问题。如果 Gemini 3.1 Pro 就在池子里——而今天唯一诚实的答案是,Sakana 并没有说过它不在——那么你用 Fugu Ultra v2 买到的部分东西,就是上面加了一层协调层的 Gemini 3.1 Pro,而其价格意味着这层协调层的价值大约是模型本身的两倍半。这很可能属实。Sakana 的架构就是为了让它成真而构建的。但这是一个背后有厂商记分牌撑着、却没有独立测试的假设;在有人实际运行它之前,你能看见的模型,才是你能为之辩护的模型。