一张主视觉标题卡,标题为“Fugu Max vs Qwen3.8-Max”,副标题为“同样的价格,同样的基准,只有一个数字”,三个胶囊徽章分别写着“两者均为 $2.00 / $6.00”、“Terminal Bench 2.1:86.6 vs 未公布”和“独立评分:无 vs 40”,页脚一行写着“Sakana AI,2026 年 9 月 vs Alibaba,2026 年 8 月”,右下角是 OrcaRouter 标志。
Guides & Insights

Fugu Max 对比 Qwen3.8-Max:相同价格,相同基准,一个公开数字

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Fugu Max 与 Qwen3.8-Max 的标价完全相同:每百万输入 token 2.00 美元,每百万输出 token 6.00 美元。Sakana AI 于 2026 年 9 月 11 日推出 Fugu Max,而 Alibaba 自 8 月初起就一直在提供 Qwen3.8-Max;两家供应商从相反方向得出了完全相同的费率表——一家在为路由策略定价,另一家则在为拥有 2.4 万亿参数的模型定价。费率持平让价格完全退出了决策考量,这一点异常干净利落。剩下的是证据,而双方在这一方面的分歧比在其他任何地方都大。两家供应商的表格都列出了 Terminal Bench 2.1。Alibaba 为 Qwen3.8-Max 标注 86.6。Sakana 表示,Fugu Max 在 Terminal Bench 2.1 上取得最佳综合得分,却完全没有给出任何数字——无论是针对那项测试,还是针对它声称胜出的其他五项测试。

双方都提及的唯一基准

整个对决都压缩在一行里,所以值得对它精确对待。

Sakana 的发布稿列出了六项基准测试,Fugu Max 在其中取得最佳总体得分:Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish。其中五项是公认的公开评测,第六项 SWEFish 则是 Sakana 自家的编程基准。对于这六项中的任何一项,发布稿都没有给出数值、差距,或可供并列比较的竞争对手数字。与之对应的另一项主张——即 Fugu Max 在十项基准中的七项上拓展了成本-性能帕累托前沿——同样只是关于图表上位置的陈述,而非坐标轴上的某个点。

Alibaba 为 Qwen3.8-Max 发布的成绩条目包括 Terminal-Bench 2.1 的 86.6、OSWorld-Verified 的 86.1、GPQA Diamond 的 92.6 以及 SWE-bench Pro 的 67.7。全部由厂商报告,全部是数字。因此,在两家公司都选择点名的唯一一项测试上,一家公布了数值,另一家公布了排名。由此无法断定哪个系统更好——Sakana 的“最佳整体”可能意味着 91,也可能是 87。能够断定的是,截至发布时,没有公开证据能回答这个问题,而提出更大主张的那家厂商,正是拒绝将其量化的一方。

相同的价格,相反的构造

• 输入 — Fugu Max 每 100 万 tokens 2.00 美元,对比 Qwen3.8-Max 每 100 万 tokens 2.00 美元

• 输出 — Fugu Max 每 100 万 token 6.00 美元,对比 Qwen3.8-Max 每 100 万 token 6.00 美元

• 缓存输入 — Fugu Max 每 100 万 tokens 收费 0.25 美元,而 Qwen3.8-Max 每 100 万 tokens 收费 0.25 美元,并且 Artificial Analysis 独立测得 Qwen 侧有 88% 的缓存折扣

• 长提示词附加费 —— Fugu Max 在发布稿中未标明档位,而 Qwen3.8-Max 在整个窗口期内统一计价,不收取附加费

• 上下文与输出——Fugu Max 未公布相关数据,而 Qwen3.8-Max 拥有 100 万 token 的上下文窗口,输出上限约为 128K

• 输入模态 —— Fugu Max 文本,背后有池自身的全部能力支撑,对比 Qwen3.8-Max 的文本、图像、视频和 PDF

• 架构 — Fugu Max 是一个在未公开模型池之上训练而成的协调器,为 Max 扩展后纳入开放权重和专用模型,包括通过与 NVIDIA 合作引入的 NVIDIA Nemotron 系列;相比之下,Qwen3.8-Max 是一个稀疏专家混合模型,总参数量约为 2.4 万亿,每个 token 约激活 950 亿参数

• 权重 —— Fugu Max 为闭源,且池成员资格按设计不予披露;相比之下,Qwen3.8-Max 以开放权重形式发布了 Max 级检查点,采用自定义许可证

• 独立评估 —— Fugu Max 未发布任何结果,且任何 Fugu 模型都没有 Artificial Analysis 页面;相比之下,Qwen3.8-Max 是 Artificial Analysis 上的一个实时条目,公布了速度、冗长度和每任务成本数据

其中四行在 Fugu 一侧显示为“未发布”,而在 Qwen 一侧带有数值。当费率相同时,这就是比较的全部内容:同样的钱买到的是一个你能描述的系统,和一个你无法描述的系统。

A two-column scoreboard titled 'Fugu Max vs Qwen3.8-Max - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, Terminal Bench 2.1 best with no figure, evidence vendor-reported only. Qwen3.8-Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context 1M with a 128K output ceiling, Terminal Bench 2.1 at 86.6, evidence Artificial Analysis Index 40 and $2.67 per task. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Qwen3.8-Max rows Alibaba-reported and per Artificial Analysis.' OrcaRouter logo bottom-right.

有一列背后有第三方

Artificial Analysis 给 Qwen3.8-Max 在重述的 v4.3 智能指数上打出 40 分,在 200 个模型中排名第 30,每项智能指数任务成本为 2.67 美元,输出速度为每秒 37.8 个 token——慢到在速度上仅排 200 个模型中的第 154 名。同一记录还显示,该指数上共生成 1.8 亿个输出 token,是模型输出中位数 8900 万的两倍多,并享有 88% 的缓存折扣。

在任何内容被引用之前,有两处更正需要说明。第一,关于 Qwen3.8-Max 广为流传的 58——或 58.1,或 58.4——这一数字来自 Artificial Analysis 于 2026 年 9 月重新校准该指数之前,而实时页面上带有"Updated"标记,表明该分数已被重新表述。较早的文章还引用了与上一代量表不同的努力成本,即每任务 64 轮,而前一代 Qwen 在约每项 Intelligence Index 任务 1.14 美元的成本下为 14 轮;当前页面显示为 2.67 美元。第二点则是真正的警告,而非量表造成的假象:Artificial Analysis 另行测得 Qwen3.8-Max 的幻觉率相较前一代从 23% 上升至 40%。对于一款以自主多步骤工作为卖点的模型而言,这是需要在验证器中预留预算的成本,而不是一个脚注。

Fugu Max 没有任何形式的独立条目。附在它身上的每一个数字都来自 Sakana,而且截至本文撰写时,Artificial Analysis 上没有 Fugu Max 或其任何同类模型的页面。这并非指控——一个几小时前才发布的模型不会有第三方报道——但这确实意味着这两栏并不能得到同等程度的核查,而且在 Sakana 之外的某个人实际运行它之前,情况将一直如此。

超支的两种方式

这两个系统都把答案的成本与 token 的成本脱钩,而且方向相反。Qwen3.8-Max 在 token 上节俭,在答案上慷慨:在 Intelligence Index 上消耗 1.8 亿输出 token,是中位数的两倍,每任务成本 2.67 美元。它靠的是长时间运行,而非庞大的体量,而 88% 的缓存折扣正是控制账单的杠杆——长时间运行的智能体如果不断重读同一上下文,成本依然低廉;如果不断生成新文本,则不然。

Fugu Max 按 token 计费价格高昂,且回答难以预测。其协调器会生成子代理,每个子代理都会写入推理和输出文本,并按每百万 token 6.00 美元计费,此外还有协调器自身的综合处理。Sakana 承诺,多代理运行按一个混合费率计费,该费率锚定参与的最高层级模型,并且增加代理不会使账单成倍增加,这消除了最坏情况下的扇出爆炸,而正是这种爆炸让朴素的多代理系统变得难以负担。但它并未消除用量问题。而在用量问题上,该发布信息以一种颇为关键的方式保持沉默:Sakana 自己的报道指出,在任务中途切换模型可能会降低上下文缓存复用并产生额外的编排 token,并确认该公司没有披露 Max 的缓存命中率或其每个任务的总 token 成本。

所以,同样的 $2.00 / $6.00 费率,一边是可预测的数字,另一边则是带下限的无上限倍数。Qwen3.8-Max 的冗长程度在你投入之前就可衡量;Fugu Max 的则不能。

逃生舱测试

这正是通常的锁定论点发生反转之处,而这也是这种配对中最有用的地方。

Sakana 为 Fugu Max 给出的理由是韧性。一个横跨开放权重模型与专用模型的池子——为 Max 版本又纳入了 NVIDIA Nemotron 系列而进一步扩充——意味着没有任何单一一流供应商的弃用、重新定价或区域撤出能让你的产品垮掉。这是一种真正的对冲,也是该公司明确拿来当卖点推销的对冲。但这种对冲从外部无法验证。你看不到那个池子,无法让某个成员进池或出池,无法自行托管其中任何一个,也完全无法在欧盟/欧洲经济区运行它。对于你无权检视的池子所作出的承诺,其保障力度比听起来要弱。

Qwen3.8-Max 则从相反的方向提出论点。它是一家厂商的模型,因而会受制于这一家厂商的决策——但阿里巴巴以自定义许可证发布了 Max 级 Qwen3.8-2.4T-A95B 检查点的开放权重,这意味着那条逃生通道是真实存在的,而非只是修辞:如果定价或条款发生变化,该模型可以从你自己的基础设施上提供服务。对于一个真正担心厂商突然撤走支持的团队来说,一个可下载的检查点胜过对资源池的一番描述。

调用任意一个

Qwen3.8-Max 已收录在我们的目录中,价格为每百万 token 输入 $2.00、输出 $6.00,这是阿里巴巴的标价,以 0% 加价直接透传,因此供应商调价当天就会落到同一个密钥上,而无需等待迁移排期。它与目录中其他模型使用相同的 base URL,并兼容 OpenAI,这意味着你可以将其置于条件路由规则、故障转移链或模型融合面板之后,无需第二份合同,也无需改动代码——自动故障转移可覆盖被限流或性能退化的供应商路径。过去七天里,它通过网关处理了 1.277 亿个 token。

Fugu Max 不在 OrcaRouter 上。它通过 Sakana 自己的 OpenAI 兼容 API 和若干第三方平台触达你,而该公司表示,现有的 Fugu 集成只需改一行参数即可升级。由于两者采用相同的请求格式,解决基准测试差距最便宜的办法,就是不再等 Sakana 公布它:在你自己的工作负载上用一个开关同时运行两者,并统计每个已完成任务的输出 token 数。这才是两家供应商都未提供的测量结果。

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the argument that the industry has raced along a single axis of bigger and more expensive foundation models while the frontier that matters is two-dimensional, capability on one axis and cost on the other.

哪一个,什么时候

Qwen3.8-Max 是一个你可以审计、定价并放弃的选择。在完全相同的价目表下,它为你提供 100 万 token 的窗口,且无长提示附加费,支持图像、视频和 PDF 输入,提供可下载的 Max 级检查点,有一个实时独立条目来衡量影响你账单的各项因素,并且缓存输入可享 88% 折扣。它的代价同样具体:速度很慢,每秒仅 37.8 个 token,在速度方面排名接近同类垫底;在该指数上极为冗长,高达 1.8 亿 token;而其测得的幻觉率相较上一代大约翻了一倍——对于它正是为此而售卖的自主工作而言,这是一个严重隐患。要大力利用缓存折扣,并为验证器留出预算。

Fugu Max 押注的是:协调胜过能力。如果你的工作是长周期且可验证的,而一个会生成验证器的协调器能完成单个模型两次都失败的任务,那么编排 token 就比重试更便宜,而相同的价目表根本不是平局。你买到的是持久性——在一个你无法固定其资源池、其上下文窗口未公开、其六项基准测试胜利均未附带数值的系统中——来自一个选择公布测试名称却隐瞒数字的供应商。

两款产品每个 token 的价格相同。但只有其中一款会告诉你,你花的钱换来了什么。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the Featured badge, the identifier qwen/qwen3.8-max, by Qwen dated 2026-08-03, vision, tools, JSON and reasoning capability tags, a 1M-token context window with text, image and video input, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 TTFT of 10.00 seconds, traffic of 127.7 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新