
Fugu Ultra v2 对比 Qwen3.8-Max:为什么价格标签上的数字是错的
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 每百万输出 token 收费 30.00 美元。Qwen3.8-Max 收费 6.00 美元。这是五比一的差距,而如果你依据这个比例在这两个智能体系统之间做选择,你就会选错——因为两者的实际计费方式都不是其价目表所暗示的那样。按照 Artificial Analysis 自己的测量,Qwen3.8-Max 为完成 Intelligence Index 生成了 1.8 亿输出 token,超过中位数模型 8900 万的两倍,每任务成本为 2.67 美元。按 token 算,它是一个节俭的模型;按答案算,它却极尽铺张。Sakana AI 的 Fugu Ultra v2 于 2026 年 9 月 11 日发布,形态恰恰相反:一个由其他实验室模型组成、未公开的模型池,它会按请求生成并协调这些模型,按一个混合费率计费,Sakana 称该费率不会随着智能体增加而成倍增长。一个是拥有 2.4 万亿参数的单一模型,会长时间出声思考。另一个是小型协调者,负责雇帮手。比较它们的 token 价格,几乎无法告诉你哪个运行起来更便宜。
两种截然相反的昂贵方式
先从机制开始,因为它解释了这一对比中的其他所有差异。
Qwen3.8-Max 是一个稀疏混合专家模型——总参数量达 2.4 万亿,每个 token 约 950 亿活跃参数——它通过运行得更久,而非规模更大,来达到接近前沿水平的结果。Artificial Analysis 测得它的输出速度为每秒 37.8 个 token,在速度上于 200 个模型中排名第 154;在 Intelligence Index 中总共输出了 1.8 亿个 token(在冗长程度上于 200 个模型中排名第 70)。其每个 Intelligence Index 任务的成本为 2.67 美元,而它的缓存折扣异常之高,达到 88%,这才是真正控制这里账单的杠杆:长时间运行的 agent 任务如果反复读取相同的上下文,成本很低;而持续生成全新文本的任务则不然。
Fugu Ultra v2 从另一端着手解决同一个问题。它是一个编排器——一个经过训练的小型协调器,据报道约有 70 亿参数,会读取请求,按照 Sakana 的 TRINITY 工作中的 Thinker、Worker 和 Verifier 角色组建一个智能体团队,然后综合出一个答案。它的 token 账单是其子智能体所生成内容加上协调器自身综合文本的总和。Sakana 在其定价 FAQ 中承诺,你只需按一个与所涉顶级模型挂钩的混合费率付费,并且增加智能体不会使账单成倍增加,这消除了经典的多智能体成本爆炸问题,即扇出会令成本成倍增长。它没有消除的是用量。按每百万输出 token 30.00 美元计算,真正重要的数字是有多少个智能体运行过、它们写了多少内容,而这个数字,无论你还是 Sakana,都无法从定价页面上预测出来。
价格差距的诚实表述是:它是一种费率,而非总额。对于产出量无法预测的工作负载,高出五倍的费率并不等于五倍的成本——它是一个没有上限的倍数,却有一个可预测的下限。

规格表,以及决定成败的那一行
• 价格 — Fugu Ultra v2 每 100 万 tokens 输入 $5.00 / 输出 $30.00,对比 Qwen3.8-Max 输入 $2.00 / 输出 $6.00
• 缓存输入 — Fugu Ultra v2 每 1M $0.50,而 Qwen3.8-Max 每 1M 读取 $0.25,且 Artificial Analysis 测得的缓存折扣为 88%
• 长上下文附加费——超过 272K 个 token 时,Fugu Ultra v2 的输入价格翻倍至 $10.00,输出价格翻倍至 $45.00;而 Qwen3.8-Max 无长提示附加费,在整个上下文窗口内保持统一价格
• 上下文窗口 — Fugu Ultra v2 100万 tokens vs Qwen3.8-Max 100万 tokens
• 输出上限 — Fugu Ultra v2 未以单一数字公布,对比 Qwen3.8-Max 约为 128K tokens
• 输入模态 — Fugu Ultra v2 支持文本,背后依托该池自身的能力,对比 Qwen3.8-Max 的文本、图像、视频和 PDF
• 权重 — Fugu Ultra v2 闭源,池成员构成有意不披露,而 Qwen3.8-Max 则以自定义许可证发布了 Max 级检查点的开放权重
• 区域可用性 — Fugu Ultra v2 未在欧盟/欧洲经济区销售,而 Qwen3.8-Max 则可不受区域限制地获取
• 独立评估 — Fugu Ultra v2 没有任何已发布的评估结果,且任何 Fugu 模型都没有 Artificial Analysis 页面;而 Qwen3.8-Max 是 Artificial Analysis 上的一个实时条目,公布了速度、冗长度和每任务成本数据
把最后两行放在一起读,对比就更清晰了。Qwen3.8-Max 是一个可以按版本锁定、查阅许可证、下载检查点,并与第三方排行榜核对的模型。Fugu Ultra v2 则是一个无法审查、无法自托管、无法在欧洲购买、也无法在 Sakana 之外任何人那里验证的系统。272K 的附加费用让情况更复杂:超过该阈值后,Fugu Ultra v2 的输入费率翻倍,输出费率上涨一半,而 Qwen3.8-Max 的费率不变。对于这两个系统所面向的长周期文档和代码库工作而言,更便宜的那个标称价格也是更稳定的那个。
大家引用的 Qwen3.8-Max 数字已经过时了
如果你在过去两周里在任何地方读到过关于这个模型的内容,你很可能已经看到过 Artificial Analysis Intelligence Index 为 58、58.1 或 58.4。那些数字是真实的,但它们已不再是最新数据。Artificial Analysis 于 2026 年 9 月 7 日将其指数重新校准至 v4.3,全面压缩了分数,而 Qwen3.8-Max 的实时页面现在显示为40,在 200 个模型中排名第 30——并带有“已更新”徽章,表明该分数已被重述。较早的文章还带有按先前量表测得的努力税:每个任务 64 轮,而上一代 Qwen 为 14 轮,以及每个 Intelligence Index 任务约 1.14 美元。当前页面显示每个任务 2.67 美元、每秒 37.8 个输出 token,以及该指数上 1.8 亿个输出 token。
由此得出两点。首先,在重新校准的标尺上,Qwen3.8-Max 与前沿第二梯队的其他模型处于同一档位,而不是与前沿本身齐平;而任何你读到的、基于 58 分将其与 Claude Opus 5 或 Kimi K3 并列比较的内容,都是在比较来自不同标尺的快照。第二,而且对这场对决更有用的是,这一修正是单向的:Qwen3.8-Max 有一个可能先出错、随后再被修正的分数。Fugu Ultra v2 没有分数。本文中每一个 Fugu 数字都来自 Sakana 自己的评估,而截至 9 月 11 日,Fugu Ultra v2 或任何其他 Fugu 模型都没有 Artificial Analysis 页面——该 URL 返回 404。当厂商发布一个排行榜,而没有任何独立方运行过该模型时,这个排行榜就是全部记录。
它们实际重叠的地方,以及不重叠的地方
Sakana 报告称,Fugu Ultra v2 在八项基准中的五项上取得最佳或并列最佳成绩——GDP.pdf、Chartography、SWEFish、DeepSWE 和 Toolathon——并在八项基准中的七项上进入前二。该发布中给出的两个具体数字是 Chartography 的 48.3,同一表格中 Claude Opus 5 为 27.3,Claude Fable 5 为 29.5;以及 DeepSWE 的 74.3。阿里巴巴自己公布的 Qwen3.8-Max 数据行包括 Terminal-Bench 2.1 的 86.6、OSWorld-Verified 的 86.1、GPQA Diamond 的 92.6 以及 SWE-bench Pro 的 67.7。
注意那两个列表有什么共同点:没有。没有一个基准测试同时出现在两个供应商的表格中。没有任何一行可以让你把 Sakana 的数字和 Alibaba 的数字并排放在一起,然后读出谁胜出,这意味着对于“哪个在编程代理方面更好”这个问题的诚实回答是:没有已发表的证据能回答它。存在的是:一个系统有八行由供应商选定的数据,且没有外部验证;另一个系统除了供应商提供的数据行外,还有一个独立条目,衡量的是成本和速度,而不是能力的正面比较。这是证据上的空白,而不是模型上的差距,它应该改变你的购买方式:你无法根据基准测试在这些之间做选择,所以要根据你实际能够验证的属性来选择。

开放权重与未公开资源池的对比
这正是通常的锁定论点发生反转之处,而这也是这对组合最有趣的地方。
Sakana 为 Fugu Ultra v2 打造的卖点是自主权。一个可替换的开放模型与专用模型池意味着,没有任何单一供应商的定价决策、弃用时间表或政策变动能让你的产品垮掉,而此次发布通过指出该模型池的组成在 v2 中发生了变化,明确地阐明了这一点。该公司还直言不讳地表示,Fugu Ultra v2 的分数是在代理池中没有 Claude Fable 5、Claude Fable 5.1 或 GPT-6 Astra 的情况下取得的——声称在三个可用的最强模型上取得胜利,同时确认它一个都没有调用。无论这个池子里装的是什么,按照 Sakana 自己的说法,它都不是市场上的顶尖水平。
但这种对冲有一个不在价目表上的代价。你看不到那个池,你无法让某个成员加入或退出 Ultra 层级,你无法自行托管其中任何部分,而且你完全无法在欧盟/欧洲经济区运行它——基于新加坡、对其他实验室的权重进行编排,与拥有这些权重是截然不同的风险状况。Qwen3.8-Max 恰好反其道而行之。它是单一供应商的模型,因而会受制于这一家供应商的决策,但阿里巴巴以自定义许可证发布了 Max 级 Qwen3.8-2.4T-A95B 检查点的开放权重,这意味着那条逃生通道是真实存在的,而不只是修辞:如果定价或条款发生变化,这个模型可以从你自己的基础设施上提供服务。对于一个真正害怕供应商突然抽走垫脚石的团队来说,一个可下载的检查点,比一句关于某个你无权查看的池的承诺,是更强的保证。
对于同时在两者上运行 agent 的人来说,还有一个次一级的要点。Qwen3.8-Max 就在我们的目录里,输入 $2.00、输出 $6.00,这正是阿里巴巴的标价,0% 加价原样透传 —— 供应商调价当天就会落到同一个 key 上,自动故障转移则能覆盖被限流或已降级的供应商路径。Fugu Ultra v2 不在 OrcaRouter 上。它通过 Sakana 自家的 OpenAI 兼容 API 以及若干第三方平台触达你,而从更早的 Fugu 迁移过来只需改一行参数。路由器不能替代协调器,协调器也不能替代故障转移能力;如果你两者都想要,那你就是在同时运行两家厂商的系统,应当为两份账单做好预算。
你应该选哪一个
如果你需要一个可以预测、验证并随时脱身的模型,就选 Qwen3.8-Max。按标价计算,它的输出速率是 Fugu Ultra v2 的三分之一,它没有长上下文断崖,它接受图像、视频和 PDF,而 Fugu 池的模态则取决于底层智能体恰好支持什么,它发布了一个你可以回退到的检查点,它在各地都有销售,并且有一个实时独立条目衡量真正影响你账单的东西——每秒 37.8 个 token,以及一个你可以在投入前建模的每任务成本数字。它的弱点同样具体,值得点名:它很慢,在速度上位列 200 个中的第 154 名,它在该指数上极其冗长,达到 1.8 亿个 token,而 Artificial Analysis 单独测得它的幻觉率相较上一代从 23% 升至 40%,对于它被营销所针对的自主多步骤工作而言,这正是一个严重问题。为验证器编列预算,并大力利用深度缓存折扣。
如果你的工作是长期且可验证的,你的预算属于探索性而非生产性,并且你身处欧盟/欧洲经济区之外,那就选择 Fugu Ultra v2。协调器的结构性理由确实成立,供应商自己的示例也一致指向这一点——在单块 H100 上历时十四小时、包含 123 次实验的自动化研究运行,一个纯 Python 魔方求解器完成了全部 300 个打乱的魔方,而两个匿名化的前沿基线则彻底崩溃。这些是供应商挑选的示例,基线也已匿名化,因此它们的证明力低于表面看上去的程度,但模式是连贯的:在正确性可检验、难点在于持续性的任务上,派生一个验证器胜过让单个模型更用力地尝试。你买到的是那种持续性,费率是 Qwen3.8-Max 的五倍,而你身处一个无法审计其质量、也无法锁定其池的系统之中。以限定范围进行试点,衡量每完成一个任务的输出 token 数,而不是每个 token 的输出,并在首次运行前设定上限。

价签上的数字之所以不对,是因为这两款产品都把“一个答案的成本”从“一个 token 的成本”上挪开了。Fugu Ultra v2 的做法是分散调用它不愿透露名称的多个模型。Qwen3.8-Max 的做法则是思考 1.8 亿个 token。如果你已经知道自己每个任务的 token 用量,那这笔账算起来很简单,你应该去算。大多数团队并不知道这个数字,对他们来说,决策就归结为一件更简单的事:Qwen3.8-Max 是你可以审计、定价和弃用的选择,而 Fugu Ultra v2 是押注协调胜过能力的选择。两者都站得住脚。但只有其中一个能拿出凭据。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
