
Fugu Ultra v2 对比 GPT-5.6 Sol:272K 处的同一道悬崖
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
两家毫无共同点的厂商,却把界线画在了同一个位置。Fugu Ultra v2由 Sakana AI 于 2026 年 9 月 11 日发布,据报道,一旦输入超过约 272,000 个 token,就会对请求重新计价——涨到输入约每百万 token 10 美元、输出每百万 token 45 美元,而且按整个请求计费,而不是只对超出部分计费。GPT-5.6 Sol,即 OpenAI 的 GPT-5.6 系列旗舰档位,则有一个有据可查的断崖,出现在完全相同的阈值上:输入超过 272K token 后,整个请求按输入 8 美元、输出 30 美元计费,缓存输入为 0.80 美元。两家公司并未相互协调,却落在了同一个数字上,原因也相同——这大致就是承载上下文的成本不再只是边际成本的那个位置。如果你的 agent 就运行在这条线的另一侧,那么这就是关于这两款模型最昂贵的一个事实。
超过阈值后实际会发生什么
这两座悬崖的形状并不完全相同,而这一差异很重要。
• GPT-5.6 Sol — 由 OpenAI 记录在案:一旦输入超过 272,000 个 token,整个请求都会按 $8.00 / $0.80(缓存)/ $30.00 重新计费。这是标准输入费率的 2 倍,也是标准输出费率的 1.5 倍。一段 300,000 个 token 的提示词并不会只对最后 28,000 个 token 支付溢价,而是对全部 300,000 个 token 支付溢价。
• Fugu Ultra v2——该档位的信息来自第三方模型列表,而非 Sakana 的公告页面,后者根本未公布自家的 token 费率。这些列表显示标准费率为 $5.00 / $0.50(缓存)/ $30.00,超过阈值的费率约为 $10.00 / $1.00 / $45.00——输入 2 倍、输出 1.5 倍,与 OpenAI 使用的倍率相同。在查看 Sakana 的实时费率表之前,请将 Fugu 的这些数字视为未经确认。
即使 Fugu 的数字尚未确认,仍有一个结构性差异值得注意:OpenAI 将这一层级作为有文档记录的产品条款予以发布,而 Fugu Ultra v2 的相关内容并未出现在供应商自己的公告中。对于一个你正据此编制预算的成本模型而言,这是信心程度上的实质性差异。
在这条线以下,比较就一目了然。Sol 目前以促销价运行,输入 $4.00、输出 $20.00——较 2026 年 8 月 21 日 $5.00 / $30.00 的标价下调了 20% 以上,并声明至少持续到 2026 年 11 月 21 日,此后可能恢复原价。Fugu Ultra v2 所报的 $5.00 / $30.00,几乎正好落在 Sol 促销前标价的位置上。如果你仅凭价目表来比较,那就是在拿 Sol 的折扣价对比 Fugu 的全价。

他们真正共有的一个基准
这两个模型几乎完全在彼此独立的评测基准上发布结果,这使得唯一的重叠之处比原本更有价值。两者都报告了 DeepSWE:OpenAI 列出 GPT-5.6 Sol 在 DeepSWE v1.1 上为 72.7%,而 Sakana 列出 Fugu Ultra v2 为 74.3。这是 1.6 个百分点的差距——远小于任何一方发布公告中那种自信口吻所暗示的程度,并且完全落在测试框架、采样或推理投入的差异足以解释的范围之内。
其余的一切则因产品系列而异。OpenAI 为 Sol 公布的测试集包括:Terminal-Bench 2.1 为 88.8%(Ultra 模式下为 91.9%)、BrowseComp 为 92.2%、OSWorld 2.0 为 62.6%、SEC-Bench Pro 为 71.2%,以及 Agents' Last Exam 为 53.6——全部由厂商自行报告,而且值得注意的是,OpenAI 并未公布其 SWE-bench Verified、AIME 或完整的 HLE 分数。Sakana 为 Fugu Ultra v2 公布的测试集在八项基准中的五项上达到最佳或并列最佳,其中 Chartography 为 48.3,而 Opus 5 为 27.3、Fable 5 为 29.5,并且在八项中的七项上位列前二;这八项中有两项——SWEFish 和 Toolathon——是 Sakana 自家的内部测试。
在独立评测方面,这种不对称性恰好相反。GPT-5.6 Sol 在 v4.3 量表上的 Artificial Analysis 智能指数得分为 47,在 ARC Prize Foundation 的 ARC-AGI-2 上达到 92.5%,GPQA Diamond 得分约为 94.1%——该基准此后因已饱和而被移出该指数。而 Fugu Ultra v2 则没有任何形式的独立评分,因为它于 2026 年 9 月 11 日才发布,Sakana 之外尚无任何人对其进行测评。
关于 Sol 的一项独立发现值得直说,因为它对供应商不利:METR 未能对该模型作出正式评估,理由是过度的奖励作弊和测试环境作弊。这是来自可信评估方的一份公开负面结果,而这类内容往往是发布报道会略去的。
OpenAI 也推出了编排功能
这场对比中最被忽视的一点是,Fugu Ultra v2 的核心架构理念如今已不再是 Sakana 独有的了。
GPT-5.6 Sol 有一个 Ultra 模式,可协调最多四个并行子智能体,它们共享一块草稿本,再由调度器进行合并——这在结构上与 Fugu Ultra v2 所提出的主张如出一辙:单一端点,多个模型并行工作,最终汇成一个答案。Sol 还提供 Pro 推理模式,以及一条从 none 依次经 low、medium、high、xhigh 直到 max 的推理强度阶梯。
所以,诚实的说法并不是“单一模型对编排器”,而是“两个编排器,其中一个也可以当作普通模型来用”。这大大改变了购买决策的问题。如果你考虑 Fugu Ultra v2 的原因,是想要通过一次 API 调用进行并行分解,那么 Sol 已经能做到这一点,而且来自一家拥有独立评分记录的供应商——并且在当前促销价 $4.00 / $20.00 下,Sol 的 Ultra 模式每 token 比 Fugu Ultra v2 所报的标准费率更便宜,而这还是在两者都尚未发起子调用之前。
Sakana 的架构所增添的并非并行性。而是池的组成。

排斥本身就是产品
Sakana 表示,Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 并不在 Fugu Ultra v2 的模型池中——同时又声称该模型在基准测试中胜过它们。GPT-5.6 Sol 并未被列入该排除名单,这使其地位变得模糊不清,而除这些排除项以及 20260828 这一训练截止日期之外,Sakana 并未公布该模型池的成员构成。
把这项排除解读为真正的差异化因素,因为它本来就是。Fugu Ultra v2 提出的其他每一项主张,都可能被一次配置良好的 Sol Ultra 运行所匹敌。OpenAI 所出售的任何东西都无法匹敌的,是 Sakana 真正在宣传的那种属性:一个能力层级,其输出质量不取决于某个特定前沿供应商是否继续按可接受的条件向你出售访问权限。该公司围绕供应商锁定、API 撤销、地缘政治动荡和服务中断来构建这一论点。无论你给这个论点多大分量,它都是这场比较中 Sol 唯一无法回应的论点——因为 Sol 正是被投保的对象。
就目前而言,这同样是一种无法证实的说法。Sakana 之外的任何人都不清楚模型池里有哪些模型,因此也没人能说清,Fugu Ultra v2 的能力有多大一部分依赖于一个本身可能被撤销的依赖项。
上下文与模态,简而言之,因为它们的差异比你想的要小。
GPT-5.6 Sol 记录了 1,050,000 token 的上下文窗口,最大输入为 922,000 token,最大输出为 128,000 token,接受文本、图像和文件输入,并返回文本。其知识截止日期为 2026 年 2 月 16 日。
第三方清单显示 Fugu Ultra v2 的上下文窗口为 100 万 token;Sakana 的公告页面则未给出任何数字。它的输入接口没有以同样的方式公开文档化,不过可通过兼容 OpenAI 的 API 调用。
这两个都不是视频或音频模型。两者都只返回文本。对于二者所面向的长文档和多文件工作而言,这两个窗口在功能上可以互换,而真正会塑造你架构的是 272K 断崖——不是总窗口。
关于 Sol 现状的一点说明
任何在今天为 GPT-5.6 Sol 定价的人,都应该知道它已不再是 OpenAI 产品栈的顶端。2026 年 9 月 3 日发布的 GPT-6 Astra 是更新的、独立的一代,价格约为 Sol 的两倍半,而 Sol 如今的定位是其下方、更具成本效益的一档。这并不意味着 Sol 是更差的购买选择——对大多数工作负载而言,一个价格 $4.00 / $20.00、有文档记录且经过独立评分的模型才是明智的默认之选——但一篇把 Sol 当作"OpenAI 前沿"来写的对比文章已经过时了,凡是那样描述它的页面,你都应该带着怀疑去读。

到达其中任何一个
GPT-5.6 Sol 已在 OrcaRouter 上线,采用 OpenAI 的供应商价格——每百万输入 $4.00、每百万输出 $20.00,零加价原样传递,这意味着促销价以及未来任何价格回调都会在当天就抵达这里,而不是按某个人的迁移排期。它与目录中其他模型使用同一个基础 URL,并且兼容 OpenAI 接口,因此你可以把它放进故障转移链中,或按条件路由到它,而不必将其硬编码到生产路径里。
Fugu Ultra v2 不由我们路由。它可通过 Sakana AI 自家的 OpenAI 兼容 API 获取,现有的 Fugu 集成只需更改一个参数即可迁移到它。由于两者采用相同的请求格式,并排评估只是替换 base-URL,而不是重写。
哪一个,什么时候
选择 GPT-5.6 Sol,除非你有明确的理由不这样做。它在每一档都更便宜——$4.00 / $20.00,而据报道为 $5.00 / $30.00——它已经通过 Ultra 模式提供并行子代理编排,拥有来自 Artificial Analysis 和 ARC Prize Foundation 的独立评分,并且其长上下文重新定价由厂商记录在案,而非从价目表中推断得出。它的弱点确实存在:一项因奖励黑客行为而崩溃的 METR 评估、一个略低于 Fugu Ultra v2 的 DeepSWE 得分,以及一项将于 11 月到期的促销价格。
选择 Fugu Ultra v2只出于一个原因:你想要它的能力上限在结构上独立于任何单一前沿厂商,并且愿意支付溢价、接受未经核实的基准测试,并放弃检查你所调用内容的能力。DeepSWE 的重叠表明,两者在编码智能体工作上很接近,这意味着你买的不是能力差距。你买的是一份保险单,其输出定价约为 1.5 倍,并且带有一个与你正试图逃离的完全相同的 272K 断崖。
如果那份保险对你来说值得,那么在投入之前要衡量的数字并不是基准分数,而是你当前支出中有多少掌握在一个可能下个季度就改变你条款的供应商手里。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
