
Fugu Max 与 Grok 4.6:费率卡完全相同,却只有一个公开评分
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Fugu Max 和 Grok 4.6 的价格完全相同。Sakana AI 于 2026 年 9 月 11 日推出 Fugu Max,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元——而这与 SpaceXAI 自 8 月 12 日发布 Grok 4.6 以来一直收取的价目表逐项完全一致。这个巧合是这场对决中最有用的事实,因为它把价格从争论中剔除了。当两款产品计费完全相同时,剩下的唯一问题就是花这些钱能得到什么,而在这方面,两者彻底分道扬镳。Grok 4.6 是一个可以按版本固定、可查阅基准测试表、并用独立指数核对的单一模型。Fugu Max 是一个经过训练的协调器,会把每项任务分派给其池中最便宜的模型,而 Sakana 的公告声称它在六项基准测试中取得最佳总成绩,却没有公布其中任何一项的具体数字。其中一项购买在你进行购买之前就是可衡量的。另一项则不可衡量。
两款产品,一份费率表
• 输入 — Fugu Max 每 100 万 tokens $2.00,对比 Grok 4.6 每 100 万 tokens $2.00
• 输出 — Fugu Max 每 100 万 tokens 6.00 美元,对比 Grok 4.6 每 100 万 tokens 6.00 美元
• 缓存输入 — Fugu Max 每 100 万 tokens 收费 $0.25,而 Grok 4.6 每 100 万 tokens 收费 $0.50,这是两者价格唯一存在差异的一项
• 上下文窗口 — Fugu Max 未由厂商公布,而 Grok 4.6 为 500,000 tokens,与 Grok 4.5 相比保持不变
• 长提示词重新定价 — 发布中未说明 Fugu Max 的层级,而 Grok 4.6 在单次请求超过 200,000 个 token 后翻倍至 $4.00 / $12.00,按整个请求计费而非仅按超出部分
• 推理控制 — Fugu Max 未开放,而 Grok 4.6 提供四个努力等级,从 low 到 xhigh,默认 high 且无法关闭
• 架构 — Fugu Max 是一个经过训练的协调器,负责统筹一个未公开的模型池,其中包含开放权重模型和专用模型;并通过与 NVIDIA 的合作,借助 NVIDIA Nemotron 系列为 Max 进行了扩展,而 Grok 4.6 则是单一模型、单一版本
• 独立评估 —— Fugu Max 未发布任何评估结果,且任何 Fugu 模型都没有对应的 Artificial Analysis 页面;相比之下,Grok 4.6 的 Artificial Analysis 智能指数实时为 44,在 200 个模型中排名第 20
便宜的那一列就是无法预测的那一列
看看 Fugu Max 真正在价格上占优的地方:缓存读取,价格是 Grok 4.6 的一半。这确实是一项真实优势,但它恰恰是最不适合用来构建成本模型的地方,因为缓存定价的收益只与你的缓存命中率成正比——而 Sakana 并未公布 Fugu Max 的缓存命中率。发布信息中也没有说明上下文窗口,没有说明长上下文层级,也没有说明输出上限。所以,Fugu Max 唯一比 Grok 4.6 便宜的那一栏,是一个大小未知的折扣,作用在你 token 中一个未知的比例上。
Grok 4.6 的弱点至少是显而易见的。其 200,000 token 的阈值相当激进——它会对整个请求重新计价,因此一个 250,000 token 的提示词从第一个 token 起就按双倍费率计费,而不是从第 200,001 个 token 才开始。但你能看到这道断崖,拿自己的提示词去对照衡量,并决定是否要分块。这就是此处的本质区别:一个系统公布的价格表带有可供你规划的形状,另一个只公布一个醒目的费率,却未附上任何价格表。
六场胜利,却一分未得
Sakana 提到的基准测试有 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish。其中五个是公认的公开评测。第六个 SWEFish 是 Sakana 自家的编程基准测试,这意味着六项宣称的胜绩中,有一项是用厂商自己编写、且尚未公开的测试来评分的。至于另外五个,发布说明只称 Fugu Max 取得了最佳总体得分,再无下文——没有分数,没有领先幅度,也没有任何竞争对手的数据可供对照。
将其与 SpaceXAI 为 Grok 4.6 发布的表格对照一下,该表格全程由厂商提供数据,但至少是一张表:GDPVal-AA v2 为 1,753,AA-Briefcase 为 1,577,DeepSWE v1.1 为 65.9%,CursorBench v3.2 为 69.9%,GPQA Diamond 为 94.9%。发布材料还报告,在 AA-Briefcase 上解决长时程任务大约需要 53 轮和约 5 亿输入 token,而一个竞争性前沿模型大约需要 103 轮和 20 亿 token——这又是一个由厂商提供数据的论点:即便按适中的每 token 费率计算,Grok 在每完成一项任务上的成本也很低。
这些 Grok 数字中有两个在你引用之前需要先处理一下。第一个是,其备受关注的 GPQA Diamond 得分 94.9% 来自一个 Artificial Analysis 后来因饱和而停用的基准测试,因此它不再像过去那样能区分前沿模型。第二个是你在较早报道中会看到的数字:Grok 4.6 的 Artificial Analysis Intelligence Index 为 61。那是重述前的量表。Artificial Analysis 在 2026 年 9 月重新校准了该指数,目前的实时数值为 44,在 200 个中排名第 20,每个 Intelligence Index 任务的成本为 1.86 美元。任何基于 61 这个分数将 Grok 4.6 与 Claude Fable 5 或 GPT-5.6 Sol 进行排名的人,都是在比较来自两种不同仪器的读数。

编排器的代币价格不包括什么
Sakana 自己对此次发布的报道也承认了结构性问题。由于 Fugu Max 会在单个任务内于不同模型之间切换,它“可能会降低上下文缓存复用率,并额外生成编排 token”——而该公司并未披露由此产生的缓存命中率,也未披露每个任务的总 token 成本。协调器生成的每个智能体都会写入推理和输出文本,而所有这些都按每百万 6.00 美元计费。该费率与 Grok 4.6 相同。用量则不然,而用量正是定价页面无法向你展示的变量。
两家供应商都在把你推向同一个纠正方向——别再比较费率,开始比较每项已完成工作的成本——但其中只有一家给了你一个可供起步的数字。Grok 4.6 带着一份已发布的轮次与 token 用量概况到来。Fugu Max 带来的则是一条让你自行测量的指示。
对 Fugu Max 的沉默,有一种公允的解读,值得说出来。Max 是 Fugu 系列中成本优化的层级,与 Fugu Ultra v2 同日发布;后者是在输入 $5.00、输出 $30.00 下的能力冲刺。Sakana 为 Max 给出的视觉论证是一张帕累托图——能力对成本——而在帕累托图上,原始基准分数无关紧要;每美元得分才是全部主张。如果那就是其论点,那么只列出六个获胜分数而不列出其成本,才是误导性的图表,而不是缺失的那张图表。这次发布仍然欠买家一个分母,而它并未提供。
Grok 4.6 真正暴露在哪里
终端工作是 Grok 4.6 已公布评测中最薄弱的环节。它在 Terminal-Bench v3.0 上的得分仅为 26%,远远落后于该领域的前列。请留意与之相邻的那个数字:同一模型在 Terminal-Bench v2.1 上取得了 88.4% 的成绩,而这是两项不同的测试。你会在报道中看到两者被混为一谈,而这种混为一谈极大地美化了 Grok。
第二个隐患在于,推理功能无法关闭。思考令牌每次请求都会计费,因此 Grok 4.6 的实际输出成本取决于模型决定对提示词思考到何种深度。努力程度旋钮让你能在低端加以控制,但并不存在归零档位。
相比之下,Grok 4.6 拥有 Fugu Max 目前无论出价多高都无法提供的东西:一个数字。上面的每一行都可以由第三方核验,而 Artificial Analysis 的收录意味着已经有一次核验了。Fugu Max 的六项胜绩与该模型在同一天发布,发布者正是打造它的公司,而截至本文写作时,Sakana 之外还没有人运行过它。
呼叫其中一个,操控另一个
Grok 4.6 已在 OrcaRouter 上线,采用 SpaceXAI 的标价——每百万输入 token 2.00 美元,缓存命中时 0.50 美元,每百万输出 token 6.00 美元——以 0% 加价原样传递,因此供应商的价格变动当天就能到达我们的网关,而不必等到迁移排期。它与其他目录中的模型使用同一基础 URL,并兼容 OpenAI,这意味着你可以把它放进故障转移链,或置于条件路由规则之后,而不必把某个提供商硬编码进生产路径;你也可以让它与另一个模型进行 A/B 测试,而无需再签一份合同。过去七天内,它通过网关处理了 4660 万个 token。
Fugu Max 不在我们的产品目录中。它通过 Sakana 自有的 OpenAI 兼容 API 以及若干第三方平台提供给你,该公司表示,现有的 Fugu 集成只需更改一个参数即可升级到它。由于二者采用相同的请求格式,将二者置于同一开关之下的评估只是更换 base URL,而非重写——这正是解决这一具体争论的正确方式,因为这场争论的核心是每完成一个任务所消耗的 token 数,而只有你自己的工作负载才能给出这个数字。

该买哪一个
Grok 4.6 是站得住脚的默认选择。在费率卡与 Fugu Max 完全相同的情况下,它为你提供可据以规划的 500K 上下文窗口、可固定(pin)的版本、四级推理控制、独立指数中第 44 的排名及旁边的每任务成本数字,以及数月的第三方测评。它的代价具体且已知:200K 重新定价断崖、始终计费的推理,以及在终端任务方面落后于同行的表现。
Fugu Max 是更有意思的押注,而且根据现有证据,也是更难以核查的那个。其设计逻辑是成立的——如果协调器能可靠地选出能完成你任务的最便宜模型,那么即使你的价目表不变,每完成一项工作的成本中位数也会下降。但在 $2.00 / $6.00 这个价位上,token 费率并不是 Fugu Max 的优势所在;该费率正是 Grok 4.6 的费率。优势必须来自使用更少的 token,而 Sakana 尚未公布能证明这一点的测量结果。
那就按两家厂商都希望你采用的方式来做比较。把 Grok 4.6 放到你的网关上,在功能开关后面调用 Fugu Max,并针对与你业务相似的工作,统计每个已完成任务的输出 token 数。如果 Fugu Max 在相同费率下完成时所用 token 少于单个模型,那么缓存折扣和协同就是真金白银,切换也说得通。如果不是,那你就是在以相同的费率为一个系统付费,而这个系统的组成可能在你不知不觉中发生变化,版本号却纹丝不动。
对于本季度你在没有那项衡量指标的情况下能决定的所有事情,都从有记分板的模型开始。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
