
Fugu Ultra v2 对比 Gemini 3.1 Pro:那个可能早已置身机器内部的对手
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在 Fugu Ultra v2 与 Gemini 3.1 Pro 对比的某个版本中,无论基准测试结果如何,Gemini 都会获胜——因为它可能在做部分工作。Sakana AI 的编排系统于 2026 年 9 月 11 日发布,并未披露它协调哪些模型;6 月的 Fugu Ultra 所报告的模型池包括 Gemini 3.1 Pro 等,而 2.0 版本只告诉我们它移除了什么,点名 Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 为被排除项。Google 的 Gemini 3.1 Pro 是一个单一的多模态前沿模型,具有 100 万 token 上下文,可处理文本、图像、PDF、音频和视频,自 2026 年 5 月起全面可用,价格为每百万输入 2.00 美元、每百万输出 12.00 美元。其中一个是你可以检查的模型。另一个则是一个系统,其基准测试的胜利可能经由第一个模型取得,而两家厂商都不会告诉你它们是否如此。
每个系统实际上是什么
Gemini 3.1 Pro 的清晰可读在前沿发布中已属罕见。它是 Google DeepMind 的稀疏混合专家(MoE)Transformer,于 2026 年 2 月 19 日首次以预览版发布,有消息源将其正式可用时间定在 2026 年 5 月——我们自己的收录列表是以预览版模型 ID 收录它的。它具有 100 万 token 的输入窗口和 65K token 的输出上限,接受文本、图像、PDF、音频、视频和代码,并提供三级推理控制——低、中、高——其中高为 API 默认值。Google 报告称其在 ARC-AGI-2 上达到 77.1%,是上一代 31.1% 的两倍多;在 GPQA Diamond 上为 94.3%;在 SWE-bench Verified 上为 80.6%;在 Terminal-Bench 2.0 上为 68.5%;在 BrowseComp 上为 85.9%;在 Humanity's Last Exam 上不使用工具时为 44.4%,配合搜索和代码执行则升至 51.4%。这些都是厂商数据。其知识截止日期为 2025 年 1 月,如果你的工作依赖近期事件,这一点值得注意。
Fugu Ultra v2 是一个协调器。它是一个经过训练的模型,据报道约有 7B 参数,会读取请求,组建一个由源自 Sakana 的 TRINITY 研究的 Thinker、Worker 和 Verifier 角色组成的智能体团队,并在一个兼容 OpenAI 的端点后面综合给出答案。它自身没有公布模态列表——它能看到的任何内容,之所以能看到,是因为其池中的某个模型能看到它。它的上下文为 1M token,并在 272K 处存在陡峭的定价断崖,费率在那里翻倍至输入 $10、输出 $45。它的输出上限未公布。它的模型池未披露,其路由决策“按设计不公开”,而对于 Ultra 层级,模型池是固定的,因此你无法排除某个提供商。
这种不对称正是整场对决的核心。Gemini 3.1 Pro 是一个可以直接购买并对其进行分析的组件。Fugu Ultra v2 则是一个装配体,其零件你无法看见,而且它最有力的基准测试声明可能部分来自 Gemini 自身的结果与其他人结果的结合。

两者重叠之处的比较
已发表的证据中,很少有能将这两个系统放在同一行直接对比的。下文中 Gemini 3.1 Pro 的数据是 Google 自己的;Fugu Ultra v2 的数据是 Sakana 自己的;如果第三方聚合方发布了二者共用的同一行数据,则会加以标注,并附上说明:这仅具方向性,而非决定性。
• 多模态推理(CharXiv,共享行)—— 据 BenchLM,Fugu Ultra v2 为 86.6%,Gemini 3.1 Pro 为 80.2%;BenchLM 将该类别标记为方向性,且拒绝指明胜出者
• TerminalBench 2.1 — 没有 Fugu Ultra v2 v2.0 对比 Gemini 3.1 Pro 的数值,也没有可比较的已发布数值;在第三方汇总中,6 月的 Fugu Ultra 报告为 82.1%,而 Gemini 3.1 Pro 为 70.3%
• SWE-Bench Pro — 没有 Fugu Ultra v2 v2.0 对比 Gemini 3.1 Pro 的数据,也没有可比较的已发布数据;6 月的 Fugu Ultra 报告为 73.7%,而 Gemini 3.1 Pro 为 54.2%
• ARC-AGI-2 — 无 Fugu Ultra v2 数据,而 Gemini 3.1 Pro 为 77.1%,系厂商报告
• Humanity's Last Exam — 无 Fugu Ultra v2 v2.0 数据,对比 Gemini 3.1 Pro 无工具 44.4%、有工具 51.4%,均为厂商报告数据
• 模态覆盖 — Fugu Ultra v2 继承其池所支持的任何模态,未披露;相比之下,Gemini 3.1 Pro 的文本、图像、PDF、音频、视频和代码支持情况有文档记录。
• 输入 / 输出价格 — Fugu Ultra v2 每 100 万 $5.00 / $30.00,超过 272K 后翻倍;而 Gemini 3.1 Pro 每 100 万最高 200K 为 $2.00 / $12.00,超出后为 $4.00 / $18.00,缓存输入 $0.20 / $0.40
• 上下文与输出 — Fugu Ultra v2 1M 上下文,输出上限未公布,对比 Gemini 3.1 Pro 1M 输入、65K 输出
• 权重与访问 — Fugu Ultra v2 闭源,欧盟/欧洲经济区除外;而 Gemini 3.1 Pro 为专有模型,但在 Google 各平台广泛可用
多模态那一行需要谨慎处理,因为它被引用得最多,却最不扎实。BenchLM 的 CharXiv 汇总让 Fugu Ultra v2 领先 6.4 个归一化分——而同一页面明确说明,方向性行从不评选胜者,Gemini 在智能体、编程、知识或多语言类别中没有测量结果,Fugu 在数学或多语言类别中也没有。若在大多数行中某一类别只有一方被测量,就无法得出裁决。如果你从这次比较中别的什么也没得到,至少要记住这一点:具体到多模态工作,已公布的证据不支持任何一方的结论,而唯一存在的那一行明确不是定论。
改变框架的可能性
Sakana 不会透露模型池里有什么。这是有文档记录的设计选择,而非疏忽——FAQ 中说明,路由信息按设计不予公开,也没有任何可供检查的机制。我们从 6 月那一代得知,据报道,模型池成员包括 Gemini 3.1 Pro 以及其他前沿模型。2.0 版本改变了模型池,而 Sakana 仅通过排除法来描述这一变化:Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 已不在其中。发布说明中没有任何内容表明 Gemini 仍然在里面。
如果 Gemini 3.1 Pro 也在候选池中,就会引出三个后果,而这三个后果都是实务层面的,而非理念层面的。第一,Fugu Ultra v2 多模态表现中的一部分,其实是 Gemini 的表现与其他模型的表现叠加而成的——这意味着,你除了要支付本可直接支付的每 token 单价,还要额外付一笔协调溢价。第二,Fugu Ultra v2 每百万输出 token 收费 30 美元,而 Gemini 3.1 Pro 是 12 美元,这多出来的部分是组装溢价,而不是原始能力溢价;如果你的任务只是一个多模态问题,Gemini 回答它更便宜,而且你能清楚看到究竟是哪个模型给出的答案。第三,也是最有用的:对一个编排器最诚实的基准检验,不是"它是否能胜过自己的各个组件",而是"当你单独使用它时,它是否能胜过其中最好的那个组件"。Sakana 的架构正是建立在这一主张之上:在可验证的任务上,它确实做得到。在仅凭一张读图表得出的基准成绩就接受这一主张之前,它值得用你自己的实际工作负载来检验。
有一种解读是,答案是否定的,而编排器仍然证明了自己的价值。如果 Gemini 在候选池中,并且 Fugu Ultra v2 对 Claude Opus 5 的 Chartography 得分 48.3 比 27.3 站得住脚,那么 Sakana 所构建的就是一个协调层,它能可靠地从同一个模型中获得比单次调用更多的产出。那是一个真正的产品,唯一悬而未决的问题是,其利润空间是否覆盖成本。还没有人发表过这项实验。

诚实的边缘所在之处
Gemini 3.1 Pro 的优势是实实在在的。在输入和输出上,它的价格约为 Fugu Ultra v2 的五分之二,而且与 Fugu 不同,它的费率不会在超过某个上下文阈值后翻倍——200K 处的阶梯比 272K 的悬崖更平缓。它记录自己的模态,而不是继承它们,这意味着音频和视频工作是受支持的功能,而不是一种希望。它有公开的输出上限。它可通过 Google 自己的界面使用,并且,与 Fugu Ultra v2 被拿来比较的其他模型一样,它 可在 OrcaRouter 上调用——作为google/gemini-3.1-pro-preview,按 Google 的标价、0% 加价,因此 Google 的价格变动会在公布当天落到同一个密钥上。
Fugu Ultra v2 的优势更窄,也更真实。它会不止一次地攻克一个难题,并由 Verifier 角色检查工作,因此它最有力的主张都落在可检验正确性的基准上——Chartography、DeepSWE、Toolathon——而非知识回忆上。Sakana 公布的案例研究也指向同一方向:一个机械 CAD 光圈能正确开合,而其他模型留下了缝隙和薄弱连杆;一个纯 Python 的魔方求解器完成了全部 300 个打乱魔方,而两个匿名的前沿基线则完全崩溃。那些基线是匿名的且由厂商挑选,因此应将其视为示例而非证明。但这一模式在整个发布中是一致的,并且它描述了一种单次模型调用不具备的真实能力:在一个问题上持续坚持,直到答案通过检查。
也要权衡这些约束条件。Fugu Ultra v2 不在欧盟或欧洲经济区销售,而且 Sakana 明确表示正在努力实现 GDPR 合规。Gemini 3.1 Pro 没有这类限制,并且背后有悠久得多的独立评估记录。

裁决
对于大多数多模态工作,Gemini 3.1 Pro 都是正确选择,而且毫无悬念。它按 token 更便宜,按文档更便宜,有音频和视频方面的文档,并且设有上下文阈值上限,不会在运行中途让你的账单翻倍,还有——这里最关键的一点——你能看到是什么在回答你。如果你需要一个模型来读取 PDF、观看片段并回答问题,那就没有任何理由通过一个未公开的模型池、以两倍半的输出价格来路由这件事。
Fugu Ultra v2 只适用于一种非常具体、范围窄得多的任务形态:具有可核验答案的长周期任务,在这类任务中,用三种方式尝试一个问题并验证结果,胜过只尝试一次,而且质量上的那一点边际提升值得付出成倍的代价。如果你的用户范围涉及欧盟或欧洲经济区,那就完全不在考虑之列。
这场对决留下的那个令人不安的问题,是没有人测量过的问题。如果 Gemini 3.1 Pro 就在池子里——而今天唯一诚实的答案是,Sakana 并没有说过它不在——那么你用 Fugu Ultra v2 买到的部分东西,就是上面加了一层协调层的 Gemini 3.1 Pro,而其价格意味着这层协调层的价值大约是模型本身的两倍半。这很可能属实。Sakana 的架构就是为了让它成真而构建的。但这是一个背后有厂商记分牌撑着、却没有独立测试的假设;在有人实际运行它之前,你能看见的模型,才是你能为之辩护的模型。
