用于“Fugu Max vs GLM-5.3”的英雄标题卡,副标题为“价值模型被走量模型压价”,三个胶囊徽章分别写着“输出 $6.00 vs $3.96”“每 7 天 7,962.7M tokens”“输入 $2.00 vs $1.26”,页脚一行写着“Sakana AI vs Z.ai - 2026年9月”,右下角是 OrcaRouter 标志。
Engineering & Research

Fugu Max 对比 GLM-5.3:价值模型被走量模型削弱

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Fugu Max 的定价本是为了在成本上取胜,而 GLM-5.3 在两个维度上都更便宜。Sakana AI 的协调器于 2026 年 9 月 11 日发布,价格为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,其设计初衷是将每项任务路由到能够处理它的最便宜模型。Z.ai 的 GLM-5.3 自 2026 年 8 月 18 日起上架,在 OrcaRouter 上为每百万输入 1.26 美元、每百万输出 3.96 美元——两项均比 Fugu Max 低三分之一到五分之二,而这只是一个纯文本模型,公开的上下文窗口为 1M、输出上限为 128K。GLM-5.3 也恰好是我们目录中繁忙程度遥遥领先的模型。更低的每 token 成本,加上显而易见地在规模化承载生产流量——这种组合使这场对比成为最难为编排溢价找到合理依据的一组。

两个维度都更便宜,且规格已公开

在任何基准测试数据登场之前,这一对比就已经让 Fugu Max 感到难堪,因为这并不是一个用能力换价格的问题。GLM-5.3 本身就是一款接近前沿水准的旗舰模型——Z.ai 称其编码能力较 GLM-5.2 提升约 50%,并在部分网络安全能力上与 Mythos 5 不相上下。它并非作为廉价替代品而推出的经济型模型。它是一款旗舰模型,而它的定价却恰好低于一款以成本优化为目标的编排器。

• 输入价格 — Fugu Max 每 100 万 tokens 2.00 美元,而 GLM-5.3 为每 100 万 tokens 1.26 美元

• 输出价格 — Fugu Max 每 100 万个 tokens 6.00 美元,而 GLM-5.3 每 100 万个 tokens 3.96 美元

• 缓存输入 — Fugu Max 每 100 万 tokens $0.25,对比 GLM-5.3 的缓存定价为基础输入费率上的折扣

• 背景 — Fugu Max 未发布 对比 GLM-5.3 的 1M tokens

• 输出上限 — Fugu Max 未公布 vs GLM-5.3 128K tokens

• 模态 — Fugu Max 未发布 vs GLM-5.3 仅支持文本,已按此说明记录

• 能力标签 — Fugu Max 未公布任何 vs GLM-5.3 工具调用、JSON 模式、推理

• 基准数据——Fugu Max 宣称对 GLM-5.3 取得六项胜利,但未提供分数;GLM-5.3 厂商报告的 DeepSWE 较上一代从 46.2 升至 66.9,外加已发布的 Artificial Analysis 智能评分

• 权重——Fugu Max 为闭源,训练资源池未公开,对比来自具有开源权重传承的实验室的 GLM-5.3

• 在 OrcaRouter 上观测到的流量 — Fugu Max 无,未纳入统计,而 GLM-5.3 在过去七天内为 7,962.7M tokens

注意最后两行共同说明了什么。GLM-5.3 出自一个拥有开放权重的谱系,而这是 Sakana 作为 Fugu Max 全部卖点所推销的供应商独立性论点中,目前最强有力的形式。而且它有一个可观测的流量数字,比我们所服务的大多数模型高出一个数量级。如果问题是“对于文本密集型生产工作,我该以低成本运行什么”,那么证据指向的并不是那个编排器。

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

数量论证,以及为什么它不仅仅是一场人气竞赛

流量数字不是质量数字,也不应被当作质量数字来解读。七天 79.6 亿 token 所真正证明的是,GLM-5.3 已被众多独立团队在真实工作负载上以生产规模运行,并且并未引发大规模弃用迁移。就质量而言,这是一个微弱信号;就运营适配性而言,这是一个强烈信号:延迟稳定、吞吐量保持得住、API 在负载下行为正常,而且故障模式已被足够庞大的人群所熟知,因此会公开浮现出来。与 Fugu Max 同一周发布的模型,背后完全没有这些。

延迟那一行更凸显了这一点。GLM-5.3 在我们所服务的流量中,首 token 时间的 p50 为 4.33 秒。对于智能体工作负载——这两款产品所瞄准的正是这种工作负载——首 token 时间会在协调器所生成的每个子智能体的每一轮中不断累积。一个更便宜、会生成四个智能体的编排器,如果每个智能体在输出任何内容前都要等上几秒,那它就不便宜,而这种成本从不会出现在费率卡上。

Fugu Max 的反驳论点是,其协调器会针对每个请求路由到能力足够的最精简模型,原则上这意味着许多任务根本不会触及昂贵的后端。Sakana 本次发布的模型池扩展通过 NVIDIA 合作加入了开放权重模型和专用模型,包括 NVIDIA Nemotron 系列,因此这条阶梯上廉价的层级是真实存在的。问题在于,这些层级是否比每百万输出 token 3.96 美元更便宜。对大多数文本任务而言,并非如此——这个门槛很低,而按托管费率运行的开放权重模型通常只能以很小的幅度越过它。

做选择前值得问的问题

编排器的成本会比单个开放权重模型更低吗?默认情况下并非如此,而且直觉往往指向了错误的方向。编排会增加协调器的综合token,在多智能体运行中,还会增加团队中每个智能体的输出。Sakana的Fugu定价通过按参与的最高级别模型收取单一混合费率,而不是叠加各个智能体,消除了最坏情况,这是一种真正的让步。但你混合的基准费率是输出$6.00,而你本来会调用的单一模型是$3.96。编排在防止重试时能省钱,而不是在为其自身目的增加并行性时。

仅限文本这一限制对两者中的任何一方有影响吗?对 GLM-5.3 而言,这一点有明文记录,因此是一个你可以提前规划的约束——没有视觉、没有音频、没有视频,模型目录里就是这么写的。而对 Fugu Max 来说,模态能力根本没有公布。这比一项限制更糟,因为在你实际试过之前,根本无法判断一条会发送 PDF 的流水线能否正常工作。未言明的约束并不等同于不存在的约束。

当底层模型发生变化时,每一种会如何应对?GLM-5.3 是由 Z.ai 训练并服务的一个单一版本的模型。如果 Z.ai 调整其定价,这一变化会通过 OrcaRouter 以 0% 加价在同一天落到你的密钥上,你可以看到并作出响应。Fugu Max 的行为取决于一个 Sakana 未披露其成员的模型池,因此某家前沿实验室的停用或价格变化会在产品名称不变的情况下悄然改变你所购买的东西。Sakana 将此呈现为韧性。这对供应商来说是韧性,对买家来说则是不透明。

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

路由决策究竟在哪里做出

这两者在本质上都是路由决策——Fugu Max 是在一个不透明的协调器内部做出这些决策,而你是在 API 层做出它们。OrcaRouter 属于第二种:一个 API 覆盖 200 多个模型,并配有路由 DSL让你能够显式地表达策略,在提供商路径劣化时自动故障转移,以及在你想要有意识地组合输出、而非寄望于黑盒替你完成时进行模型融合。GLM-5.3 以 Z.ai 的标价、0% 加价出现在该目录中对于一款背后承载如此大流量的模型来说,这一点比平常更有价值:你看到的价格就是 Z.ai 公布的价格,原封不动地传递过来。

实际区别在于可审计性。当 Fugu Max 为你的请求挑选模型时,你无从得知它选了哪一个,也无从得知原因。当你自己编写路由策略时,决策就在你的代码仓库里,任何审查你代码的人都可以审查它,而且无需等待供应商就能更改。对于承担任何合规或成本核算义务的团队来说,这并非哲学意义上的区别。

裁决

GLM-5.3 在对生产团队最为关键的几项标准上赢得了这场比较:它的输入与输出价格都更低,其上下文窗口和输出上限均已公布,模态限制也有明确说明,它具备工具调用、JSON 模式和推理等有文档记载的能力,它出自开放权重谱系,并且其七日流量数据已接近八十亿 token。就这一价位而言,无论怎样解读公开证据,都得不出 Fugu Max 是证据更充分的购买选择这一结论。

Fugu Max 保留了一个论点,而且这是个实实在在的论点:对于协调者的第二遍检查能抓住第一遍本会交付的错误的那些任务,每个已完成任务的成本可以胜过每个 token 的成本。如果你的工作可核查、大批量,并且你位于欧盟/欧洲经济区之外,那么这值得进行一次范围限定的试点——前提是预先设定输出 token 上限,并测量每个已完成任务的 token 数。否则,那个成本低三分之一、且已在生产负载下运行了一个月的单一模型就是答案,它在 OrcaRouter 上按 Z.ai 的标价提供,并按提供商费率原样传导。

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新