
Fugu Max 对比 Gemini 3.1 Pro:相同的输入价格,一半的输出价格,以及一个无人能见的池子
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Fugu Max 与 Gemini 3.1 Pro 在被提问时的收费完全相同。两者的标价都是每百万输入 token 2.00 美元。它们在输出环节上分道扬镳:Sakana AI 的 Fugu Max 每百万输出 token 收费 6.00 美元,而 Google 的 Gemini 3.1 Pro 则为 12.00 美元。Sakana 于 2026 年 9 月 11 日发布 Fugu Max,它是一个协调器,会把每项任务路由到一个未披露的模型池中成本最低且足以胜任的模型。Gemini 3.1 Pro 则是一个有名字的模型——可通过 ID 调用、有版本迭代、支持多模态——而这恰恰是编排器在设计上不会是的东西。所以,这里有意思的问题并不是哪一个在 2.00 美元的输入价位上更强,而是:考虑到 Sakana 上一代 Fugu 据称把 Gemini 3.1 Pro 也列入了它所路由的模型之列,把"协调器"和"模型"放在一起比较,这种比较的形态本身是否成立。
池问题,精确陈述
当首款 Fugu Ultra 于 2026 年 6 月发布时,有关其架构的报道描述了一个模型池,其中包含 Gemini 3.1 Pro 以及来自其他前沿实验室的模型。Sakana 尚未公布 Fugu Max 模型池的成员构成。发布公告称,该模型池已扩展,纳入数量空前的开放权重模型和专用模型,并提到通过与 NVIDIA 的合作引入了 NVIDIA Nemotron 系列,然后就再无下文。公告也没有说明 Gemini 3.1 Pro 已被移除。
这留下了两种可能性,而且没有公开的方法在二者之间做出选择。如果 Gemini 3.1 Pro 在 Fugu Max 池中,那么这种对局就部分是“对抗”,部分是“经由”——针对高难度推理任务的 Fugu Max 回答,可能是一个由协调器选择、检查并改写的 Gemini 回答;在这种情况下,$6.00 的输出费率买到的是 Gemini 的推理能力加上编排开销,比直接调用 Gemini 有所折扣。如果它不在池中,那么这两个产品就是真正不同的工具,而价格差异反映的是不同的底层能力。
本次发布中没有任何内容能解决这一点。任何告诉你是哪一个的人,都是推断出来的,而不是读出来的。可以有把握地说出的内容更有限,但仍然有用:编排器已公布的评分归属于资源池,而不归属于协调器;而一个成员身份未披露的资源池,会使这些评分无法归属。
• 输入价格 — Fugu Max 每 100 万 tokens 2.00 美元,对比 Gemini 3.1 Pro 每 100 万 tokens 2.00 美元
• 输出价格 — Fugu Max 每 100 万 tokens 6.00 美元,而 Gemini 3.1 Pro 为每 100 万 tokens 12.00 美元
• 缓存输入 — Fugu Max 每 100 万 tokens 收费 $0.25,而 Gemini 3.1 Pro 的缓存则按基础输入价格提供折扣
• 背景 — Fugu Max 未发布 vs Gemini 3.1 Pro 1M tokens
• 输出上限 — Fugu Max 未公布 vs Gemini 3.1 Pro 65K tokens
• 输入模态 — Fugu Max 未发布,对比 Gemini 3.1 Pro 的音频、文件、图像、文本和视频
输出模态——Fugu Max 未发布,对比 Gemini 3.1 Pro 文本,且 3.1 系列中另有一条独立的图像生成线
• 基准测试数据 — 声称 Fugu Max 六项胜出,却未给出分数;相比之下,Gemini 3.1 Pro 由 Google 报告的成绩为 ARC-AGI-2 77.1%、GPQA Diamond 94.3%、SWE-bench Verified 80.6%、BrowseComp 85.9%
模型能承诺而协调者不能承诺的事
那串列表里最大的实际差别不是输出价格,而是模态那一行。Gemini 3.1 Pro 接受音频、视频和图像作为输入,并且文档也如此说明,这使它可用于与文本无关的工作——读取屏幕录制、转写并对通话进行推理、解析扫描表单。Fugu Max 完全没有公布模态规范。它很可能能处理其中一些输入,取决于它的池中包含什么,以及协调器是转发多模态内容,还是先将其展平成文本。Sakana 之外没人知道,而这与“我们还没对它做基准测试”是不同类型的不确定性。这意味着你无法仅凭文档判断它是否适合多模态工作负载;你必须进行测试。
输出上限方面还存在第二处不对称。Gemini 3.1 Pro 标注的最大输出为 65K token,Fugu Max 则毫无标注。对于协调器而言,有效上限等于它所路由到的所有模型中的最小值,因此这个数字确实更难说清——但如果你的应用会生成长篇幅产物,那么一个上限未明的系统在规划时就颇为棘手。

如实解读基准测试行
Sakana 列出了六项基准测试,称 Fugu Max 在其中取得“最佳综合得分”:Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish。该说法没有附带任何数据,而 SWEFish 是 Sakana 自家的内部编码基准。与此同时,谷歌公布了 Gemini 3.1 Pro 的真实数据,包括 ARC-AGI-2 上 77.1%、GPQA Diamond 上 94.3%、SWE-bench Verified 上 80.6% 以及 BrowseComp 上 85.9%。
要当心一处差之毫厘的误判。Google 报告 Terminal-Bench 2.0 的成绩为 68.5%。Sakana 则声称在 Terminal Bench 2.1 上取得了最佳综合得分。二者是同一基准测试上相邻的版本号,而该基准在两者之间发生了变化,这意味着这两个结果即便从原则上讲也无法并列比较。扫一眼标题的读者会看到“两者都声称在 Terminal Bench 上领先”,并据此断定它们具有可比性。但它们并不具有可比性。
GPQA 则更难下定论——Sakana 将 GPQAD 列为其六项胜绩之一;Gooogle 报告 GPQA Diamond 为 94.3%。二者属于同一底层评测族系,且均为厂商自报,而其中只有一方给出了具体数字。假如 Sakana 的 GPQAD 结果已公布,这将是唯一一行能够进行真正对比的数据。但它并未公布,因此这一行读起来更像是一种断言对上一个数字。
没有任何独立第三方评估过 Fugu Max,Artificial Analysis 也没有关于它或任何 Fugu 模型的条目。相比之下,Gemini 3.1 Pro 已在公众视野中流通得足够久,足以登上第三方排行榜和评估报告——这正是“经过数月独立审视”相较于同周发布所能带来的价值。
对于这一特定对决,这件事比通常更重要,原因在于 Fugu Max 自身的架构使其分数更难解读。Gemini 3.1 Pro 在 GPQA Diamond 上的 94.3% 是关于单一模型、单一版本的事实。Fugu Max 在同一测试上的分数则会是一个关于路由策略、一个成员未公开的模型池,以及一个被训练来在其中进行挑选的协调器的事实。改变其中任何一项,数字就会变动,而产品名称却不变。Gemini 3.1 Pro 的分数有一个固定的指涉对象。Fugu Max 的则没有。
呼叫他们,以及路由更改
Gemini 3.1 Pro 已上线 OrcaRouter,模型 ID 为 google/gemini-3.1-pro-preview,按 Google 官方标价、0% 加价——即把供应商的价格原样透传,因此 Google 一旦调价,当天就会体现在你现有的密钥上,而不用等到续费。它与另外 200 多个模型共用一个 API 密钥,这一点在这里有特别的用意:如果你想弄清 Fugu Max 每百万 token 6.00 美元的输出价格对你的工作负载是否真的更划算,最干净的实验就是用同一套任务集把两者都跑一遍,而 Fugu Max 并不在我们的目录里。它通过 Sakana 自家的 OpenAI 兼容 API 以及若干第三方平台提供服务。自己做 A/B 测试意味着两套集成、两份账单和两组凭据。
自动故障转移是另一个值得点名的部分。Gemini 3.1 Pro 经由路由器运行在多个提供商路径上,如果其中一条被限流或降级,流量就会转移,而无需更改代码。这是 Sakana 作为编排的全部前提来推销的那种韧性的一个局部而实用的版本——你是在传输层而非推理层获得它,而且是在一个你可以锁定其行为的模型上获得它。

如何在它们之间做出选择
如果你的工作涉及非文本输入,如果你需要一个有文档记录的输出上限,如果你想要一个其基准测试数据可与其他人的结果相互核对的模型,或者如果你只是需要一个能够按版本固定并据此进行推演的组件,就选择 Gemini 3.1 Pro。按 2.00 美元的输入价格,尝试它没有什么成本,而 65K 的输出足以应付大多数生成任务。它公布的数据使其跻身现有较强的通用模型之列,而且它的多模态输入集不是编排层所能替代的。
如果你的工作文本量大、可验证、批量大,而且你关心的是完成一项任务的中位成本,而不是单次调用的成本上限,那就选择 Fugu Max。每百万输出 token 6.00 美元的价格是 Gemini 3.1 Pro 的一半,而 0.25 美元的缓存价格是两份价目表中最低的数字。把它用在错误答案可被检测的问题上,开始前设定好输出 token 预算,并衡量每项完成任务的 token 消耗。不要因为发布页面上的宣传就把它选来做多模态流水线,因为发布页面并没有说明它是否接受图像。
决定
Gemini 3.1 Pro 是更安全、文档更完善的选择:输入价格相同,有公开的上下文窗口,标明了 65K 输出上限,有多模态输入的文档说明,还有第三方有机会审查的厂商基准测试。它的输出速率是 Fugu Max 的两倍,而这便是支持另一方的全部理由。
Fugu Max 是更便宜的文本生成方式,也是做其他任何事情时更不透明的方式。它的六项基准测试胜绩没有附带任何数字,其上下文窗口和模态支持均未公布,而产出其结果的池子由什么构成也未披露——这意味着你无法排除这样一种可能:你花 6.00 美元买到的,是一个打了折扣的推理版本,而同样的推理你本可以在 OrcaRouter 上以 2.00 美元的输入价格直接向 Gemini 3.1 Pro 购买,且那里是按提供商标价原样转嫁、在其之上零加价。

