Fugu Ultra v2 与 GLM 5.2 对决的主视觉卡片,展示编排系统对阵单一混合专家模型,配文为“你为协调付费,而非参数”。
Guides & Insights

Fugu Ultra v2 对比 GLM 5.2:你付费买的是协调,而非参数

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

把两张价目表并排放在一起,这个对比看起来像是个错误。Fugu Ultra v2由 Sakana AI 于 2026 年 9 月 11 日发布,每百万输入 token 收费 5 美元,每百万输出 token 收费 30 美元。GLM 5.2是 Z.ai 于 2026 年 6 月 16 日推出的旗舰模型,收费分别为 1.40 美元和 4.40 美元。两者都声称拥有百万 token 级别的上下文窗口。两者瞄准的完全是同一类买家——那些运行长时间、多步骤、仓库级智能体工作的团队。其中一个的输入价格约为另一个的 3.6 倍,输出价格约为 6.8 倍,而更便宜的那个才是你可以下载并留存的那个。因此,整个比较归结为一个问题:多花的钱究竟买到了什么,而它买到的是单个模型无法成为的东西吗?

它们不是同一种对象

价格差距之所以存在,是因为这两者用完全不同的机制来解决长周期任务,而这种差异在你运行任何基准测试之前就已经显现出来了。

Fugu Ultra v2 —— 一个编排系统,而非基础模型。它是 Sakana AI 的 Fugu 系列中能力最大化的一档:一个兼容 OpenAI 的单一端点,可将传入任务拆解,并把各部分分派到其他模型组成的池中执行,其中一些是开放权重模型,一些是专用模型。Sakana 自己的说法是,它“将峰值性能推向比以往更高的高度,而无需对其所编排的前沿模型形成不可或缺的依赖”。你买的其实是一个调度器,而调度器思考时消耗的每一个 token——包括内部编排 token——都由你付费。

GLM 5.2——一个单一的混合专家模型。Z.ai 将其发布为一款文本输入/文本输出的模型,拥有“真正可用”的 1M token 上下文窗口和最高 128K 输出 token,通过 reasoning_effort 控制混合推理,并支持原生工具调用。所报告的架构大致为总计 753B 参数,每个 token 激活约 40B,不过 Z.ai 尚未确认 5.2 这一具体版本的激活参数数量——请将该数字视为沿用自 GLM-5.1

那就是岔路口。其中一个是你调用的东西;另一个是会调用其他东西的东西。

Fugu Ultra v2 不会告诉我们的事

Sakana的公告页面在一件事上异常坦率,在另一件事上却异常沉默,而这两点对购买决策都很重要。

坦诚的部分是:该公司直截了当地表示,Claude Fable 5Claude Fable 5.1 和 GPT-6 Astra 不在 Fugu Ultra v2 的模型池中,即便它声称在基准测试中胜过它们。所述理由是韧性——一个可替换的开放和专用模型池,无法被供应商或地缘政治变化撤销、重新定价或切断。训练截止日期列为 20260828。无论你如何看待这个论点,它都是一种真实的架构立场,也是选择 Fugu Ultra v2 而非自己组装的技术栈的最明确理由。

未明说的部分:该公告没有说明上下文窗口,也没有在页面上说明 Fugu Ultra v2 的 token 定价。第三方模型列表把窗口标为 1M tokens,费率标为 $5 / $0.50(缓存)/ $30,并设有一个重新定价档位:输入 token 大致超过 272K 后,费率会变为约 $10 / $1.00 / $45。这些就是本文其余部分采用的数字,但它们只是第三方列表,并非厂商文档——在你据此做预算之前,请对照 Sakana 的实时价格表进行确认。

没人回答的每 token 成本问题

按 token 定价是这种比较的错误单位,而当前针对它排名的每个页面都犯了同样的错误。编排器的账单并不是你的提示词大小乘以某个费率;而是你的提示词大小,加上它决定发起的每一次子调用,再加上它租用的各个模型的推理 token,全部按编排器自己的费率加价。

Sakana 直接承认了这一点:内部消耗的编排 token 会按普通输入和输出 token 计费。这意味着,要诚实地比较 Fugu Ultra v2 与 GLM 5.2,衡量的方式应是每个已完成任务的成本,而两家厂商都没有公布这一数字。

一些确实始终成立的结构性要点:

输入价格 — 在 OrcaRouter 上按 Z.ai 的提供商费率,Fugu Ultra v2 为 $5.00 / 1M,而 GLM 5.2 为 $1.40 / 1M。Fugu 在发起单次子调用之前,成本就已达到 3.6 倍。

输出价格 —— Fugu Ultra v2 $30.00 / 1M 对比 GLM 5.2 $4.40 / 1M。这是最扎心的一个数字,因为智能体会产生大量输出,而编排器还会输出你压根没要求的内容。

缓存输入 — Fugu Ultra v2 标价为 $0.50 / 1M;GLM 5.2 的缓存价格为 $0.26 / 1M,较其自身输入价格优惠 81%。在稳定的系统提示词上反复运行智能体循环,正是 GLM 5.2 优势积累最显著之处。

长上下文重新定价 — Fugu Ultra v2 所报告的、输入超过约 272K 时的档位,会把整个请求切换到大约两倍的输入费率和 1.5 倍的输出费率。GLM 5.2 则完全没有上下文分档:一律 $1.40 / $4.40,一直到 1M 都是如此。

最后一行才是值得圈出来的那一行。长程智能体运行的大部分生命周期,都发生在超过 272K token 之后。GLM 5.2 的固定费率能省下真金白银的地方,恰恰正是 Fugu Ultra v2 费率翻倍之处。

Two-column comparison scoreboard for Fugu Ultra v2 and GLM 5.2 covering type, release date, input price ($5.00 vs $1.40 per million tokens), output price ($30.00 vs $4.40), cached input ($0.50 vs $0.26) and long-context pricing (reprices above roughly 272K vs flat to 1M).

基准测试几乎没有涉及

关于这场对比,真正奇怪的一点,也是当前任何排行榜页面都不会直说的事情是:这两个模型几乎从未在同一项测试中被衡量过。

Sakana 报告称,Fugu Ultra v2 在八项基准测试中的五项上表现最佳或并列最佳——GDP.pdf、Chartography、SWEFish、DeepSWE 和 Toolathon——并在八项中的七项上进入前二。它给出的两个主要数字是:Chartography 为 48.3,对比 Opus 5 的 27.3 和 Fable 5 的 29.5;以及 DeepSWE 为 74.3。SWEFish 和 Toolathon 是 Sakana 自有的内部基准测试。所有结果均由厂商报告,截至发布时,尚无任何一项得到独立复现。

Z.ai 公布的 GLM 5.2 数据完全来自另一套体系:Terminal-Bench 2.1 为 81.0,SWE-bench Pro 为 62.1,GPQA-Diamond 为 91.2,AIME 2026 为 99.2,HLE 为 40.5 —— 同样由厂商报告。在独立评测方面,GLM 5.2 在 Artificial Analysis 重新评分的页面上,AA 编码指数为 68.8,智能指数为 39,该页面将其标注为暂定估计值,在 113 个模型中排名第 7。较早引用 GLM 5.2 为 51 或 53 的数据来自已被取代的指数标度,不应再被引用。

所以,如果你想要一个干净的直接对比数字,那并不存在。最接近共同衡量维度的点是,两者在智能体编程方面都很强,而诚实的解读是,每家公司都只公布了它自己表现好的测试。这正是你应该自己去做评估的理由,而不是去选那个更高的数字。

对于今天打算购买 GLM 5.2 的人,有一点值得提醒:它已不再是 Z.ai 最新的模型。GLM-5.3 于 2026 年 8 月 14 日前后发布,标价相同,但采用限制大型云服务提供商的定制许可证——这使得 GLM 5.2 成为最后一款完全采用 MIT 许可证的 Z.ai 旗舰模型,也是它至今仍有独特购买理由的原因。

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

许可证是最鲜明的分界线

把基准放在一边,结构性差异比任何分数都更加鲜明。

GLM 5.2 以 MIT 许可证在 Hugging Face 上以开放权重形式发布,没有地区限制。你可以下载它,在你自己的硬件上运行它,对它进行微调,并将它集成到产品中交付,无需征求任何人的许可,也完全无需按 token 付费。Z.ai 训练了它——值得注意的是,据该公司自己声称,训练完全使用华为昇腾加速器,而非 Nvidia。

Fugu Ultra v2 这些都不提供。它是一项托管服务:一层作用于模型池之上的编排策略,而 Sakana 只在外围描述过该模型池的成员构成。你无法下载它、检查它、固定它,也无法以气隙方式运行它。你换来的反而是那层抽象——一个单一端点,其行为原则上能够抵御任何一个上游模型消失所带来的影响。对于一个无法承受某项依赖消失的生产系统来说,这是实实在在的好处。它也是实实在在的代价,因为你是用控制权换来了它。

如果你的约束是“模型不能在我这里发生变化”,那么这些答案中只有一个符合。如果你的约束是“模型不能被别人移除”,那么只有另一个符合。

速度,以及测试人员对上一个的评价

GLM 5.2 实测并不快:Artificial Analysis 记录到约每秒 66.3 个 token,首 token 时间约为 4.03 秒,对于前沿级模型来说只能算一般,而且 Z.ai 自己的用户也抱怨过高峰时段的 serving congestion。

Sakana 没有公布 Fugu Ultra v2 的延迟或吞吐量数据,这本身就说明问题——一个会分派到多个模型的系统,其延迟特征完全取决于它决定调用什么,因此单一个吞吐量数字几乎毫无意义。对于上一代 Fugu Ultra,测试者公开报告称运行时间可长达约 30 分钟,成本远高于同一任务上单个模型的费率。那是 2026 年 6 月的模型,并非关于 v2 的证据——但它是需要测试的故障模式,也是为什么按 token 比较会美化编排器。

Screenshot of the OrcaRouter model page for GLM 5.2 showing the z-ai/glm-5.2 identifier, a 1M token context window, 128K maximum output, and input pricing of $1.40 per million tokens with output at $4.40.

你实际上会如何称呼其中的每一个

GLM 5.2 现已在 OrcaRouter 上线,采用 Z.ai 自家服务商的费率——每百万输入 $1.40、每百万输出 $4.40,零加价原样传递,因此 Z.ai 的任何降价都会当天同步到这里。它兼容 OpenAI,因此切换到它只需在你已有的 SDK 中更改 base-URL 和模型 ID,而且你可以将其置于故障转移链或路由规则之后,而不必把生产路径押在单一服务商上。

Fugu Ultra v2 不是由我们路由的。它可通过 Sakana AI 自有的 OpenAI 兼容 API 获取,只需更改一个参数,就能将现有的 Fugu 集成迁移到它上面。如果你正在将它与 GLM 5.2 进行对比评估,实际可行的安排是:在你做决定期间,让 GLM 5.2 继续留在你现有的网关上,同时直接从 Sakana 调用 Fugu Ultra v2——两者都兼容 OpenAI,因此可以通过一个功能标志,让它们处于同一代码路径中。

该选哪一个

选择GLM 5.2,如果你想要的是价格明确、表现可预期的方案:采用 MIT 许可证的权重,明天就能自行托管;统一 $1.40 / $4.40,没有长上下文附加费;真正可用的 1M 窗口;以及在缓存智能体循环中层层叠加的折扣。同时也要接受它仅支持文本、比 GLM-5.3 落后一代,而且其独立指数评分仍是暂定值。

选择Fugu Ultra v2的前提是:你要买的是韧性,外加在艰难的多步骤任务上的巅峰能力;而且你愿意按 token 为协调买单,并放弃检查或自行托管你所调用的东西的能力。厂商自己的说法是,它在不依赖前沿模型的情况下就能达到前沿水平的输出——这是一个真实而不同寻常的命题,而截至今天,Sakana 之外恰恰没有任何人能够验证它。

我们不会做的,是依据基准表在两者之间做选择。这些测试几乎没有重叠,两家厂商都只在自己最占优势的领域公布了结果,而决定性的数字——每完成一个长周期任务的成本——恰恰是两家公司都没有写在页面上的那个。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新