一个主视觉标题卡,写着“Fugu Ultra v2 vs Qwen3.8-Max”,副标题为“为什么这个价签上的数字是错的”,三个胶囊徽标分别写着“输出:$30.00 vs $6.00”“超过 272K:费率翻倍”和“Fugu 独立评分:无”,页脚一行写着“Sakana AI,2026 年 9 月 11 日 vs 阿里巴巴,2026 年 8 月”,右下角是 OrcaRouter 标志。
Guides & Insights

Fugu Ultra v2 对比 Qwen3.8-Max:为什么价格标签上的数字是错的

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Fugu Ultra v2 每百万输出 token 收费 30.00 美元。Qwen3.8-Max 收费 6.00 美元。这是五比一的差距,而如果你依据这个比例在这两个智能体系统之间做选择,你就会选错——因为两者的实际计费方式都不是其价目表所暗示的那样。按照 Artificial Analysis 自己的测量,Qwen3.8-Max 为完成 Intelligence Index 生成了 1.8 亿输出 token,超过中位数模型 8900 万的两倍,每任务成本为 2.67 美元。按 token 算,它是一个节俭的模型;按答案算,它却极尽铺张。Sakana AI 的 Fugu Ultra v2 于 2026 年 9 月 11 日发布,形态恰恰相反:一个由其他实验室模型组成、未公开的模型池,它会按请求生成并协调这些模型,按一个混合费率计费,Sakana 称该费率不会随着智能体增加而成倍增长。一个是拥有 2.4 万亿参数的单一模型,会长时间出声思考。另一个是小型协调者,负责雇帮手。比较它们的 token 价格,几乎无法告诉你哪个运行起来更便宜。

两种截然相反的昂贵方式

先从机制开始,因为它解释了这一对比中的其他所有差异。

Qwen3.8-Max 是一个稀疏混合专家模型——总参数量达 2.4 万亿,每个 token 约 950 亿活跃参数——它通过运行得更久,而非规模更大,来达到接近前沿水平的结果。Artificial Analysis 测得它的输出速度为每秒 37.8 个 token,在速度上于 200 个模型中排名第 154;在 Intelligence Index 中总共输出了 1.8 亿个 token(在冗长程度上于 200 个模型中排名第 70)。其每个 Intelligence Index 任务的成本为 2.67 美元,而它的缓存折扣异常之高,达到 88%,这才是真正控制这里账单的杠杆:长时间运行的 agent 任务如果反复读取相同的上下文,成本很低;而持续生成全新文本的任务则不然。

Fugu Ultra v2 从另一端着手解决同一个问题。它是一个编排器——一个经过训练的小型协调器,据报道约有 70 亿参数,会读取请求,按照 Sakana 的 TRINITY 工作中的 Thinker、Worker 和 Verifier 角色组建一个智能体团队,然后综合出一个答案。它的 token 账单是其子智能体所生成内容加上协调器自身综合文本的总和。Sakana 在其定价 FAQ 中承诺,你只需按一个与所涉顶级模型挂钩的混合费率付费,并且增加智能体不会使账单成倍增加,这消除了经典的多智能体成本爆炸问题,即扇出会令成本成倍增长。它没有消除的是用量。按每百万输出 token 30.00 美元计算,真正重要的数字是有多少个智能体运行过、它们写了多少内容,而这个数字,无论你还是 Sakana,都无法从定价页面上预测出来。

价格差距的诚实表述是:它是一种费率,而非总额。对于产出量无法预测的工作负载,高出五倍的费率并不等于五倍的成本——它是一个没有上限的倍数,却有一个可预测的下限。

A two-column scoreboard titled 'Fugu Ultra v2 vs Qwen3.8-Max Scoreboard' contrasting six dimensions. Fugu Ultra v2: price $5.00/$30.00 per 1M, context 1M tokens, above 272K input doubles to $10, AA Index none published, speed not measured, weights closed with pool undisclosed. Qwen3.8-Max: price $2.00/$6.00 per 1M, context 1M tokens, above 272K no surcharge, AA Index 40 ranked #30 of 200, speed 37.8 tokens/sec, weights open checkpoint published. Footer reads 'Fugu Ultra v2 figures vendor-reported; no independent evaluation. Qwen3.8-Max figures per Artificial Analysis, recalibrated scale.' OrcaRouter logo bottom-right.

规格表,以及决定成败的那一行

• 价格 — Fugu Ultra v2 每 100 万 tokens 输入 $5.00 / 输出 $30.00,对比 Qwen3.8-Max 输入 $2.00 / 输出 $6.00

• 缓存输入 — Fugu Ultra v2 每 1M $0.50,而 Qwen3.8-Max 每 1M 读取 $0.25,且 Artificial Analysis 测得的缓存折扣为 88%

• 长上下文附加费——超过 272K 个 token 时,Fugu Ultra v2 的输入价格翻倍至 $10.00,输出价格翻倍至 $45.00;而 Qwen3.8-Max 无长提示附加费,在整个上下文窗口内保持统一价格

• 上下文窗口 — Fugu Ultra v2 100万 tokens vs Qwen3.8-Max 100万 tokens

• 输出上限 — Fugu Ultra v2 未以单一数字公布,对比 Qwen3.8-Max 约为 128K tokens

• 输入模态 — Fugu Ultra v2 支持文本,背后依托该池自身的能力,对比 Qwen3.8-Max 的文本、图像、视频和 PDF

• 权重 — Fugu Ultra v2 闭源,池成员构成有意不披露,而 Qwen3.8-Max 则以自定义许可证发布了 Max 级检查点的开放权重

• 区域可用性 — Fugu Ultra v2 未在欧盟/欧洲经济区销售,而 Qwen3.8-Max 则可不受区域限制地获取

• 独立评估 — Fugu Ultra v2 没有任何已发布的评估结果,且任何 Fugu 模型都没有 Artificial Analysis 页面;而 Qwen3.8-Max 是 Artificial Analysis 上的一个实时条目,公布了速度、冗长度和每任务成本数据

把最后两行放在一起读,对比就更清晰了。Qwen3.8-Max 是一个可以按版本锁定、查阅许可证、下载检查点,并与第三方排行榜核对的模型。Fugu Ultra v2 则是一个无法审查、无法自托管、无法在欧洲购买、也无法在 Sakana 之外任何人那里验证的系统。272K 的附加费用让情况更复杂:超过该阈值后,Fugu Ultra v2 的输入费率翻倍,输出费率上涨一半,而 Qwen3.8-Max 的费率不变。对于这两个系统所面向的长周期文档和代码库工作而言,更便宜的那个标称价格也是更稳定的那个。

大家引用的 Qwen3.8-Max 数字已经过时了

如果你在过去两周里在任何地方读到过关于这个模型的内容,你很可能已经看到过 Artificial Analysis Intelligence Index 为 58、58.1 或 58.4。那些数字是真实的,但它们已不再是最新数据。Artificial Analysis 于 2026 年 9 月 7 日将其指数重新校准至 v4.3,全面压缩了分数,而 Qwen3.8-Max 的实时页面现在显示为40,在 200 个模型中排名第 30——并带有“已更新”徽章,表明该分数已被重述。较早的文章还带有按先前量表测得的努力税:每个任务 64 轮,而上一代 Qwen 为 14 轮,以及每个 Intelligence Index 任务约 1.14 美元。当前页面显示每个任务 2.67 美元、每秒 37.8 个输出 token,以及该指数上 1.8 亿个输出 token。

由此得出两点。首先,在重新校准的标尺上,Qwen3.8-Max 与前沿第二梯队的其他模型处于同一档位,而不是与前沿本身齐平;而任何你读到的、基于 58 分将其与 Claude Opus 5Kimi K3 并列比较的内容,都是在比较来自不同标尺的快照。第二,而且对这场对决更有用的是,这一修正是单向的:Qwen3.8-Max 有一个可能先出错、随后再被修正的分数。Fugu Ultra v2 没有分数。本文中每一个 Fugu 数字都来自 Sakana 自己的评估,而截至 9 月 11 日,Fugu Ultra v2 或任何其他 Fugu 模型都没有 Artificial Analysis 页面——该 URL 返回 404。当厂商发布一个排行榜,而没有任何独立方运行过该模型时,这个排行榜就是全部记录。

它们实际重叠的地方,以及不重叠的地方

Sakana 报告称,Fugu Ultra v2 在八项基准中的五项上取得最佳或并列最佳成绩——GDP.pdf、Chartography、SWEFish、DeepSWE 和 Toolathon——并在八项基准中的七项上进入前二。该发布中给出的两个具体数字是 Chartography 的 48.3,同一表格中 Claude Opus 5 为 27.3,Claude Fable 5 为 29.5;以及 DeepSWE 的 74.3。阿里巴巴自己公布的 Qwen3.8-Max 数据行包括 Terminal-Bench 2.1 的 86.6、OSWorld-Verified 的 86.1、GPQA Diamond 的 92.6 以及 SWE-bench Pro 的 67.7。

注意那两个列表有什么共同点:没有。没有一个基准测试同时出现在两个供应商的表格中。没有任何一行可以让你把 Sakana 的数字和 Alibaba 的数字并排放在一起,然后读出谁胜出,这意味着对于“哪个在编程代理方面更好”这个问题的诚实回答是:没有已发表的证据能回答它。存在的是:一个系统有八行由供应商选定的数据,且没有外部验证;另一个系统除了供应商提供的数据行外,还有一个独立条目,衡量的是成本和速度,而不是能力的正面比较。这是证据上的空白,而不是模型上的差距,它应该改变你的购买方式:你无法根据基准测试在这些之间做选择,所以要根据你实际能够验证的属性来选择。

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, with the opening paragraphs arguing that the frontier which matters is two-dimensional — capability against cost — and stating that Fugu Ultra v2 pushes peak performance higher without indispensable reliance on the frontier models it orchestrates.

开放权重与未公开资源池的对比

这正是通常的锁定论点发生反转之处,而这也是这对组合最有趣的地方。

Sakana 为 Fugu Ultra v2 打造的卖点是自主权。一个可替换的开放模型与专用模型池意味着,没有任何单一供应商的定价决策、弃用时间表或政策变动能让你的产品垮掉,而此次发布通过指出该模型池的组成在 v2 中发生了变化,明确地阐明了这一点。该公司还直言不讳地表示,Fugu Ultra v2 的分数是在代理池中没有 Claude Fable 5、Claude Fable 5.1 或 GPT-6 Astra 的情况下取得的——声称在三个可用的最强模型上取得胜利,同时确认它一个都没有调用。无论这个池子里装的是什么,按照 Sakana 自己的说法,它都不是市场上的顶尖水平。

但这种对冲有一个不在价目表上的代价。你看不到那个池,你无法让某个成员加入或退出 Ultra 层级,你无法自行托管其中任何部分,而且你完全无法在欧盟/欧洲经济区运行它——基于新加坡、对其他实验室的权重进行编排,与拥有这些权重是截然不同的风险状况。Qwen3.8-Max 恰好反其道而行之。它是单一供应商的模型,因而会受制于这一家供应商的决策,但阿里巴巴以自定义许可证发布了 Max 级 Qwen3.8-2.4T-A95B 检查点的开放权重,这意味着那条逃生通道是真实存在的,而不只是修辞:如果定价或条款发生变化,这个模型可以从你自己的基础设施上提供服务。对于一个真正害怕供应商突然抽走垫脚石的团队来说,一个可下载的检查点,比一句关于某个你无权查看的池的承诺,是更强的保证。

对于同时在两者上运行 agent 的人来说,还有一个次一级的要点。Qwen3.8-Max 就在我们的目录里,输入 $2.00、输出 $6.00,这正是阿里巴巴的标价,0% 加价原样透传 —— 供应商调价当天就会落到同一个 key 上,自动故障转移则能覆盖被限流或已降级的供应商路径。Fugu Ultra v2 不在 OrcaRouter 上。它通过 Sakana 自家的 OpenAI 兼容 API 以及若干第三方平台触达你,而从更早的 Fugu 迁移过来只需改一行参数。路由器不能替代协调器,协调器也不能替代故障转移能力;如果你两者都想要,那你就是在同时运行两家厂商的系统,应当为两份账单做好预算。

你应该选哪一个

如果你需要一个可以预测、验证并随时脱身的模型,就选 Qwen3.8-Max。按标价计算,它的输出速率是 Fugu Ultra v2 的三分之一,它没有长上下文断崖,它接受图像、视频和 PDF,而 Fugu 池的模态则取决于底层智能体恰好支持什么,它发布了一个你可以回退到的检查点,它在各地都有销售,并且有一个实时独立条目衡量真正影响你账单的东西——每秒 37.8 个 token,以及一个你可以在投入前建模的每任务成本数字。它的弱点同样具体,值得点名:它很慢,在速度上位列 200 个中的第 154 名,它在该指数上极其冗长,达到 1.8 亿个 token,而 Artificial Analysis 单独测得它的幻觉率相较上一代从 23% 升至 40%,对于它被营销所针对的自主多步骤工作而言,这正是一个严重问题。为验证器编列预算,并大力利用深度缓存折扣。

如果你的工作是长期且可验证的,你的预算属于探索性而非生产性,并且你身处欧盟/欧洲经济区之外,那就选择 Fugu Ultra v2。协调器的结构性理由确实成立,供应商自己的示例也一致指向这一点——在单块 H100 上历时十四小时、包含 123 次实验的自动化研究运行,一个纯 Python 魔方求解器完成了全部 300 个打乱的魔方,而两个匿名化的前沿基线则彻底崩溃。这些是供应商挑选的示例,基线也已匿名化,因此它们的证明力低于表面看上去的程度,但模式是连贯的:在正确性可检验、难点在于持续性的任务上,派生一个验证器胜过让单个模型更用力地尝试。你买到的是那种持续性,费率是 Qwen3.8-Max 的五倍,而你身处一个无法审计其质量、也无法锁定其池的系统之中。以限定范围进行试点,衡量每完成一个任务的输出 token 数,而不是每个 token 的输出,并在首次运行前设定上限。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the model title, the 'Featured' badge, the identifier qwen/qwen3.8-max, vision, tools, JSON and reasoning capability tags, a 1M-token context window, text and image and video input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, and an OpenAI-compatible base URL with Python and cURL code samples.

价签上的数字之所以不对,是因为这两款产品都把“一个答案的成本”从“一个 token 的成本”上挪开了。Fugu Ultra v2 的做法是分散调用它不愿透露名称的多个模型。Qwen3.8-Max 的做法则是思考 1.8 亿个 token。如果你已经知道自己每个任务的 token 用量,那这笔账算起来很简单,你应该去算。大多数团队并不知道这个数字,对他们来说,决策就归结为一件更简单的事:Qwen3.8-Max 是你可以审计、定价和弃用的选择,而 Fugu Ultra v2 是押注协调胜过能力的选择。两者都站得住脚。但只有其中一个能拿出凭据。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新