一張「Fugu Max vs GLM-5.3」的英雄標題卡,副標題為「價值模型被規模模型壓低價格」,三個膠囊標籤分別寫著「$6.00 vs $3.96 輸出」、「每 7 天 7,962.7M tokens」、「$2.00 vs $1.26 輸入」,頁腳一行寫著「Sakana AI vs Z.ai - 2026 年 9 月」,以及右下角的 OrcaRouter 標誌。
Engineering & Research

Fugu Max 對決 GLM-5.3:價值模型遭走量模型削價壓制

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Fugu Max 的定價原本就是要以成本取勝,而 GLM-5.3 在兩個面向上都更便宜。Sakana AI 的協調器於 2026 年 9 月 11 日推出,價格為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元,設計目的是把每項任務路由到足以處理它的最便宜模型。Z.ai 的 GLM-5.3 自 2026 年 8 月 18 日起上架,在 OrcaRouter 上為每百萬輸入 1.26 美元、輸出 3.96 美元——兩項都比 Fugu Max 低三分之一到五分之二,而這只是單一純文字模型,具備公開的 1M 上下文視窗與 128K 輸出上限。GLM-5.3 也剛好是我們目錄中繁忙程度遙遙領先的模型。這樣的組合——每 token 更便宜,且實際承載著大規模的生產流量——讓這場對決成為最難為協調層溢價自圓其說的一組比較。

兩個面向都更便宜,而且規格已公開

在任何基準測試登場之前,這項比較就已讓 Fugu Max 處於不利,因為這並不是以能力換取價格的情況。GLM-5.3 本身就是一款接近前沿的旗艦——Z.ai 形容它相較 GLM-5.2 帶來約 50% 的程式設計能力提升,並在特定網路安全能力上與 Mythos 5 匹敵。它不是作為廉價替代方案而提供的入門級模型。它是一款旗艦,只是定價恰好低於一個成本最佳化的協調器。

• 輸入價格 — Fugu Max 每 100 萬個 token 為 $2.00,相較於 GLM-5.3 每 100 萬個 token 為 $1.26

輸出價格 — Fugu Max 每 100 萬個 token 6.00 美元,相較於 GLM-5.3 每 100 萬個 token 3.96 美元

• 快取輸入 — Fugu Max 每 100 萬個 token $0.25,對比 GLM-5.3 的快取以基礎輸入費率折扣計價

• 背景 — Fugu Max 未發布,對比 GLM-5.3 的 100 萬個 token

・輸出上限 — Fugu Max 未公佈 vs GLM-5.3 128K tokens

• 模態 — Fugu Max 未發布,而 GLM-5.3 僅限文字,並已如此記載

• 能力標籤 — Fugu Max 未公開任何標籤,對比 GLM-5.3 的工具使用、JSON 模式、推理

• 基準測試數據 — Fugu Max 宣稱拿下六項勝利,卻未附上分數,相較於 GLM-5.3 由廠商回報的 DeepSWE 從前一代的 46.2 提升至 66.9,再加上一項已發表的 Artificial Analysis 智慧分數

• 權重 — Fugu Max 閉源、pool 未披露,對比來自擁有開放權重血統實驗室的 GLM-5.3

• 在 OrcaRouter 上觀察到的流量 — Fugu Max 無,未承載;相較於 GLM-5.3 在過去七天內的 7,962.7M 個 token

注意最後兩行合起來說明了什麼。GLM-5.3 出自一個擁有開放權重的系譜,而這是 Sakana 當作 Fugu Max 整個前提來推銷的廠商獨立性論點中,目前可得的最強形式。而且它的可觀察流量數據,比我們所服務的大多數模型高出一個數量級。如果問題是「文字量大的生產工作,我該用什麼以低費率來執行」,證據指向的並不是那個協調器。

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

成交量論點,以及為何它不只是人氣競賽

流量數字不是品質數字,也不該被當成品質數字來解讀。七天內 79.6 億個 token 真正證明的是:GLM-5.3 已被許多獨立團隊以生產規模、在真實工作負載上運行,而且並未引發大規模的棄用遷離。這對品質來說是微弱的訊號,對營運適用性來說則是強烈的訊號:延遲穩定、吞吐量維持得住、API 在高負載下運作正常,而且失效模式已為足夠龐大的人群所知,因此會公開浮現。與 Fugu Max 同一週發布的模型,背後完全沒有這些支撐。

延遲這一列讓論點更加鮮明。在我們所服務的流量中,GLM-5.3 的首個 token 延遲(p50)為 4.33 秒。對於代理式工作——這兩款產品所瞄準的工作負載——首個 token 的延遲會在協調者所啟動的每個子代理的每一輪中不斷累加。一個更便宜的協調器若啟動四個代理,並不會因此更便宜——如果每個代理在吐出任何內容前都得等上好幾秒,而這項成本永遠不會出現在價目表上。

Fugu Max 的反駁論點是,它的協調器會依每個請求,路由到最精簡而足以勝任的模型;原則上,這意味著許多任務根本不會碰到昂貴的後端。Sakana 這次發布擴充了模型池,透過與 NVIDIA 合作,加入了開放權重與專用模型,包括 NVIDIA Nemotron 系列,因此那條階梯上便宜的層級確實存在。問題在於,這些層級是否比每百萬輸出 token 3.96 美元更便宜。對大多數文字任務而言,並非如此——那是個很低的門檻,而以託管費率運行的開放權重模型,通常僅以些微差距跨過它。

在挑選之前值得問的問題

協調器比單一開放權重模型更便宜嗎?預設情況下並不會,而且直覺往往朝錯誤的方向走。協調機制會增加協調者的綜整 token,在多代理執行時,還會加上團隊中每個代理的輸出。Sakana 的 Fugu 定價消除了最糟的情況,做法是依參與的最高階模型收取單一混合費率,而非將各代理層層疊加,這是一項實質的讓步。但你用來混合的基準費率是 $6.00 輸出,而你原本會呼叫的單一模型則是 $3.96。協調能省錢,在於它能避免重試,而不是為了平行化而平行化。

純文字限制對兩者而言有影響嗎?就 GLM-5.3 來說,這點有明確記載,因此是你可以事先納入規劃的限制——不支援視覺、不支援音訊、不支援視訊,而產品目錄也如此載明。至於 Fugu Max,其模態支援根本未公開。這比單純的限制更糟,因為在實際嘗試之前,你無從得知傳送 PDF 的流程能否順利運作。未言明的限制並不等同於不存在的限制。

當底層模型改變時,兩者各自會發生什麼事? GLM-5.3 是單一版本、由 Z.ai 訓練與提供的單一模型。如果 Z.ai 調整定價,這項變動會在同一天透過 OrcaRouter 以 0% 加價反映在你的金鑰上,你能看見並做出回應。Fugu Max 的行為取決於一個 Sakana 未揭露成員的模型池,因此前沿實驗室的下架或價格變動會悄悄改變你實際購買的東西,而產品名稱卻毫無改變。Sakana 將此包裝為韌性。這對廠商是韌性,對買家則是黑箱。

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

路由決策實際上是在哪裡做出的

這兩者實際上都是路由決策——Fugu Max 是在一個不透明的協調器內部做出這些決策,而你則是在 API 層做出決策。OrcaRouter 屬於第二種:一個 API 串接超過 200 個模型,並搭配路由 DSL,讓你能明確表達政策、在供應商路徑劣化時自動容錯切換,以及在你想刻意組合輸出、而非信任黑箱代勞時進行模型融合。GLM-5.3 以 Z.ai 的定價、0% 加價列於該目錄中,對於一個背後有如此龐大流量的模型而言,這比平常更有價值:你看到的費率就是 Z.ai 公布的費率,原封不動地傳遞過來。

實務上的差異在於可稽核性。當 Fugu Max 為你的請求挑選模型時,你不會知道它選了哪一個,也不知道為什麼。當你自己撰寫路由策略時,決策就在你的儲存庫裡,任何審查你程式碼的人都能審查,而且不必等待供應商就能更改。對於負有任何合規或成本會計義務的團隊來說,這不是哲學上的差異。

裁決

GLM-5.3 在對生產團隊而言最關鍵的幾項條件上贏得這場比較:它的輸入與輸出成本都更低,其上下文視窗與輸出上限皆已公開,其模態限制也清楚載明,並將工具使用、JSON 模式與推理列為有文件佐證的能力,且它出自開放權重的血統,七天流量數據更逼近八十億個 token。以這個價位而言,公開證據無論怎麼解讀,Fugu Max 都不會是更有憑據的購買選擇。

Fugu Max 只保留一個論點,而且這是個站得住腳的論點:對於那些協調者的第二輪檢查能攔下第一輪原本就會放行的錯誤的任務,每完成一項任務的成本可能勝過每詞元成本。如果你的工作可檢查、量大,而且你位於 EU/EEA 之外,那就值得進行一次範圍明確的試行——並事先設定輸出詞元上限,同時衡量每項完成任務的詞元用量。否則,那個成本低三分之一、且已在生產負載下運行了一個月的單一模型,就是答案;它就在 OrcaRouter 上,以 Z.ai 的定價提供,並將供應商費率如實轉嫁。

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新