
Fugu Ultra v2 vs Grok 4.6:五倍的输出价格,同一个共享基准
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
只有一个基准上,Fugu Ultra v2和Grok 4.6都公布了数字,那就是 DeepSWE:Sakana AI 在 2026 年 9 月 11 日的公告中报告 Fugu Ultra v2 为 74.3,而 xAI 为 Grok 4.6 发布的材料将其自身的 DeepSWE v1.1 得分定在 65.9%。这是 8.4 个百分点的差距,也是两家公司提供的唯一干净对比。其他你可能拿来对比的内容——Sakana 的 Chartography 和 SWEFish 对 Grok 的 GPQA Diamond 和 CursorBench——都是由不同实验室用不同工具测量的。所以,诚实的问题不是“哪个更聪明”。而是:Fugu Ultra v2 所声称的优势,是否值得为每百万输出 token 支付 30 美元,而 Grok 4.6 只收 6 美元。
对同一问题的两种不同答案
Grok 4.6是一个单一模型,也是 Grok 系列当前的旗舰——在厂商自己的开发者文档中被列为“最新”(Latest),它接替了 Grok 4.5,并拥有相同的 500,000 token 上下文窗口、相同的文本/图像/文件输入范围,以及相同的基础定价。它的知识截止日期为 2026 年 2 月 1 日,并提供 low、medium、high 和 xhigh 四档推理强度,默认档位为 high。有一个细节会让人感到意外:推理无法关闭。思考 token 会在每次请求时计费,这使得 Grok 4.6 的实际输出成本取决于它决定思考的力度。
Fugu Ultra v2严格来说根本不是一个通常意义上的模型。它是 Sakana AI 编排产品线中能力最强的一档——一个兼容 OpenAI 的单一端点,可将任务分解并分派到其他模型池中的多个模型上,其中一些是开放权重模型,一些是专用模型。Sakana 的说法是,它能达到前沿级别的输出,“无需对其所编排的前沿模型形成不可或缺的依赖”,并且明确表示 Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 被排除在该池之外。你付费购买的是调度层,以及子代理消耗的每一个 token。
这个区别并非表面文章。它正是价格差距存在的根本原因,也是使这一差距站得住脚的唯一理由。
费率卡,包括重复的那部分
• 输入——Fugu Ultra v2 每 100 万 $5.00,对比 Grok 4.6 每 100 万 $2.00。在任何子调用发生之前,Fugu 的价格已是 2.5 倍。
• 输出 — Fugu Ultra v2 每 1M $30.00,而 Grok 4.6 每 1M $6.00。5 倍的差距,而它正是决定大多数账单的那一项。
• 缓存输入 —— 两者均为每 100 万 $0.50。完全相同。两家除此之外毫无共同点的供应商,却定出了相同的缓存读取价格,这使得缓存密集型的 agent 循环成为两者唯一能真正逐行对比的工作负载。
• 长上下文重新定价——一旦提示词超过 200,000 个 token,Grok 4.6 的价格便翻倍至 $4.00 / $12.00,而且重新定价适用于整个请求,而不只是超出部分。据称,Fugu Ultra v2 在输入 token 约超过 272,000 后的档位涨至约 $10.00 / $45.00,同样按整个请求计算。两者都惩罚长提示词;Grok 的惩罚起点早了 72K 个 token。
• 上下文窗口 — 根据第三方列表,Grok 4.6 为 500K token,Fugu Ultra v2 为 1M。Sakana 的公告页面完全没有给出上下文规模数据,因此其 1M 应视为未获厂商确认。
长上下文这一项是把双刃剑,值得算一算账。30 万 token 的提示词,在 Grok 4.6 上每百万输入 token 花费 4.00 美元,而在 Fugu Ultra v2 上约为 10.00 美元。15 万 token 的提示词在 Grok 上花费 2.00 美元,在 Fugu 上为 5.00 美元。Sakana 的模型在每种提示长度下都更贵——唯一的问题是它需要被调用得有多频繁。

支持在输出上支付5倍费用的论点
编排器的优势不在于每个 token 更便宜,而在于它需要的尝试次数更少,并且它花在协调上的 token 比你花在失败上的 token 更便宜。
这是一个实实在在的论点,而 Sakana 正在明确地提出它:Fugu Ultra v2 面向的是复杂的多步骤工作——自主研究、全栈开发——在这类场景中,单一模型的失败模式是在长时间运行途中偏离正轨。如果 30 美元的输出费率能让你一次就完成任务,而不是要试到第三次,那么每 token 的溢价就无关紧要。
也有来自厂商自身一方的支持性证据,不过这些证据对厂商有利,阅读时也应如此看待。xAI 为 Grok 4.6 发布的宣传材料提到,解决长周期任务大约需要 53 轮、约 5 亿个输入 token,而某个竞争性前沿模型则大约需要 103 轮、20 亿个输入 token——这一论点是说,即使每 token 价格较低,Grok 本身按每项任务计算也仍很经济。两家公司都在做同样的动作:把人们的注意力从费率表上移开,转向每完成一项工作的成本。
这意味着决定性的数字是两家供应商都不公布的,只能由你自己测量:从头到尾、在一项类似你实际任务的工作中消耗的token。
每一项真正薄弱之处
Grok 4.6 已公开的弱项是终端任务。其 Terminal-Bench v3.0 得分为 26%,远远落后于该领域的顶尖水平,尽管同一模型在较旧的 Terminal-Bench v2.1 上取得了 88.4% 的更强成绩——这是两套不同的测试,把它们混为一谈是你在许多报道中都会看到的错误。它还在同批模型中拥有最高的 GPQA Diamond 得分,达到 94.9%,但 GPQA Diamond 此后已因饱和而被从 Artificial Analysis 指数中移除,因此在该项上取得高分已不再像一年前那样能在前沿模型之间形成区分。
在独立评测方面,Artificial Analysis 在其 v4.3 智能指数上给 Grok 4.6 打出 44 分,在 200 个模型中位列第 20,每任务成本为 1.86 美元。常被引用的 61 分来自已被取代的指数标度,引用时若不说明该分数出自哪个版本,就不应引用。
Fugu Ultra v2 的薄弱环节在于验证。截至发布时,Sakana 对其宣称的一切——五项最佳或并列最佳结果、对照 Opus 5 的 27.3 和 Fable 5 的 29.5 所取得的 48.3 Chartography 分数、74.3 的 DeepSWE——都尚未被独立复现。目前也没有公布延迟或吞吐量数据,这对编排器而言比单一模型更重要,因为它的响应时间完全取决于它决定调用什么。对于上一代 Fugu Ultra,测试者曾公开报告称运行时间可长达约 30 分钟;那是 2026 年 6 月的模型,不是 v2,但这是你在将某条路径投入生产前需要测试的故障模式。

关于供应商名称的说明
在你打开开发者控制台寻找 Grok 4.6 之前,有一个小细节值得了解:这个模型一直被叫做Grok 4.6,但它周围的厂商品牌正在变动。xAI 自家的文档现在已带上 SpaceXAI 这个名字,而大多数相关发布报道还没有跟上这一变化。模型标识符和 API 接口没有改变——Grok 4.6 是一等公民式的 OpenAI Responses 模型,无需转换层即可接入现有的工具调用循环——但如果你在寻找模型卡时发现品牌看起来不对,那不是你的错。
在实践中调用这两者中的任意一个
Grok 4.6 已上线 OrcaRouter,采用提供商自身的费率 —— 每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,以零加价原样传递,因此供应商的价格变动当天就能同步到这里,而不是按迁移计划延后。它与目录中其他所有模型使用相同的基础 URL,并兼容 OpenAI,这意味着你可以将它放在回退链或路由规则之后,而不是硬编码,还可以在不另签合同、不改代码的情况下让它与另一个模型进行 A/B 测试。
Fugu Ultra v2 不由我们路由。它可通过 Sakana AI 自己的 OpenAI 兼容 API 获取,该公司表示,现有的 Fugu 集成只需更改一个参数即可迁移到它。如果你想在自己的工作负载上比较两者,最省钱的方案是让 Grok 4.6 留在你的网关上,并在功能开关后面直接从 Sakana 调用 Fugu Ultra v2——两者使用相同的请求格式,因此同一套测试工具可以同时用于两者。

裁决
Grok 4.6 是大多数团队理性的默认选择,而且在价格上遥遥领先。以 $2.00 / $6.00、$0.50 的缓存读取费和 500K 上下文窗口来看,它处理长文档推理、编程智能体和多模态文件工作的成本仅为 Fugu Ultra v2 输出价格的五分之一,并且拥有独立评分和独立基准测试。它的短板在于提示长度——200K 断崖会让整个请求成本翻倍——以及在终端重度使用的智能体循环中,其公开评分缺乏竞争力。
Fugu Ultra v2只有当你有某种特定类型的工作负载时,它才值它的溢价:长周期、多步骤、高度依赖自主性的任务,在这类任务中,单个模型往往会跑偏,而且你还想要 Sakana 所推销的那种架构特性——一个不取决于任何前沿厂商是否持续可用或保持低价的能力层级。这确实是一种真实的需求。但这只是一个宣称,还不是实测结果,而让它显得可信的 DeepSWE 差距,不过是发布当天来自单一厂商的单项基准测试。
如果你说不出目前哪些任务会在第二次或第三次尝试时失败,那么你还没有那个足以证明价格差异合理的数字。先衡量这一点。费率卡已经告诉了你其他所有信息。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
