
Fugu Ultra v2 vs GLM 5.2:你付費買的是協調,而非參數
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
把兩張價目表並排一看,這場對決看起來簡直像是個錯誤。Fugu Ultra v2由 Sakana AI 於 2026 年 9 月 11 日發布,每百萬輸入 token 收費 5 美元,每百萬輸出 token 收費 30 美元。GLM 5.2則是 Z.ai 於 2026 年 6 月 16 日推出的旗艦模型,收費分別為 1.40 美元與 4.40 美元。兩者都宣稱具備百萬 token 級別的上下文視窗。兩者鎖定的更是完全相同的買家——那些執行長時間、多步驟、儲存庫規模代理式工作的團隊。其中一款的輸入價格約為另一款的 3.6 倍,輸出價格則是 6.8 倍,而較便宜的那款還是你可以下載留存的那款。所以整個比較歸結為一個問題:多付的錢究竟買到了什麼,而它買到的東西,是單一模型無法提供的嗎?
它們不是同一種物件
價格差距之所以存在,是因為這兩者用截然不同的機制來解決長時程任務,而這種差異在你實際執行任何基準測試之前就會顯現出來。
• Fugu Ultra v2——一套協調調度系統,而非基礎模型。它是 Sakana AI Fugu 系列中能力最大化的層級:單一 OpenAI 相容端點,能將傳入的任務分解,並把各部分分派到其他模型構成的池中,其中有些是開放權重模型,有些則是專門化模型。Sakana 自己的說法是,它「將峰值效能推向前所未有的高度,且不必非得依賴它所調度的前沿模型」。你買的是一個排程器,而你要為該排程器思考所耗費的每一個 token 付費,包括內部的調度 token。
• GLM 5.2 — 單一的混合專家模型。Z.ai 將其發佈為文字輸入/文字輸出的模型,具備「真正可用」的 100 萬詞元上下文視窗,以及最多 128K 的輸出詞元,混合推理由 reasoning_effort 控制,並支援原生工具呼叫。據報其架構約有 753B 總參數,每個詞元約有 40B 作用中參數,不過 Z.ai 並未確認 5.2 版本具體的作用中參數數量——請將該數字視為沿用自 GLM-5.1。
那就是岔路口。其中一個是你所呼叫的東西;另一個則是會呼叫東西的東西。
Fugu Ultra v2 不會告訴我們的事
Sakana 的公告頁面在某一件事上異常坦率,在另一件事上卻異常沉默,而這兩者對購買決策都至關重要。
坦白說:該公司直接表明Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 並不在 Fugu Ultra v2 的模型池中,即使同時聲稱在基準測試上勝過它們。所述的理由是韌性——一個可替換的開放與專門模型池,無法被供應商或地緣政治變動撤銷、重新定價或切斷。訓練截止日期列為 20260828。無論你怎麼看待這個論點,這是一個真實的架構立場,也是選擇 Fugu Ultra v2 而非自己組裝的技術堆疊最明確的理由。
耐人尋味的部分是:這份公告本身並未載明上下文視窗,頁面上也沒說明 Fugu Ultra v2 的詞元定價。第三方模型列表把視窗列為 1M 個詞元,費率為 $5 / $0.50(快取)/ $30,且在輸入詞元大約超過 272K 之後會進入重新定價級距,調升至約 $10 / $1.00 / $45。本文其餘部分採用的就是這些數字,但它們屬於第三方列表,而非供應商官方文件——在據此編列預算之前,請先對照 Sakana 的最新費率表確認。
沒人回答的每 Token 成本問題
以每詞元計價來做這種比較是用錯了單位,而目前為此排名在前面的每個頁面都犯了同樣的錯誤。一個協調器的帳單,並不是你的提示大小乘以某個費率;而是你的提示大小,加上它決定要發出的每一次子呼叫,再加上它所租用模型的推理詞元,全部再按協調器自己的費率加成計算。
Sakana 直接承認了這一點:內部消耗的編排 token 會以一般輸入與輸出 token 計費。這意味著,要誠實比較 Fugu Ultra v2 與 GLM 5.2,唯一的方式就是看每項已完成任務的成本,而兩家廠商都沒有公布這個數字。
一些無論如何都確實成立的結構性要點:
• 輸入價格 — Fugu Ultra v2 為 $5.00 / 1M,而 GLM 5.2 在 OrcaRouter 上依 Z.ai 的供應商費率為 $1.40 / 1M。Fugu 在尚未發出任何一次子呼叫之前,成本就是 3.6 倍。
• 輸出價格 — Fugu Ultra v2 $30.00 / 1M,對比 GLM 5.2 $4.40 / 1M。這是最讓人痛的數字,因為 agent 會產生大量輸出,而 orchestrator 產生的輸出,根本不是你要的。
• 快取輸入 — Fugu Ultra v2 標價為 $0.50 / 1M;GLM 5.2 的快取價格為 $0.26 / 1M,相較其自身輸入費率便宜了 81%。在穩定的系統提示上反覆執行代理迴圈,正是 GLM 5.2 的優勢複利效應最為顯著之處。
• 長脈絡重新定價 —— Fugu Ultra v2 據稱在輸入超過約 272K 時會進入更高級距,使整個請求的輸入費率約變成兩倍、輸出費率變成 1.5 倍。GLM 5.2 則完全沒有脈絡分級:一律 $1.40 / $4.40 固定價,一路適用到 1M。
最後一列才是該圈起來的重點。長時程代理的一次執行,生命週期大多落在 272K 個 token 之後。GLM 5.2 的固定費率之所以能省下真金白銀,正是在 Fugu Ultra v2 費率翻倍的地方。

基準幾乎沒有觸及
這場對決真正奇怪的地方,也是目前任何排行榜頁面都沒有明說的事:這兩個模型幾乎從未在同一項測試中被衡量。
Sakana 回報 Fugu Ultra v2 在八項基準中的五項——GDP.pdf、Chartography、SWEFish、DeepSWE 與 Toolathon——為最佳或並列最佳,並在八項中的七項名列前二。它給出的兩個重點數字是 Chartography 的 48.3,對比 Opus 5 的 27.3 與 Fable 5 的 29.5,以及 DeepSWE 的 74.3。SWEFish 與 Toolathon 是 Sakana 自家的內部基準。這些全都是廠商自行回報的數據,且截至發布時,無一經過獨立重現。
Z.ai 為 GLM 5.2 公布的數字,完全是來自另一套來源:Terminal-Bench 2.1 為 81.0、SWE-bench Pro 為 62.1、GPQA-Diamond 為 91.2、AIME 2026 為 99.2、HLE 為 40.5——同樣由廠商自行回報。在獨立評測方面,GLM 5.2 在 Artificial Analysis 重新評分的頁面上,AA Coding Index 為 68.8、Intelligence Index 為 39,該頁面將其標記為暫定估計,在 113 個項目中排名第 7。較舊引用 GLM 5.2 的 51 或 53 分,來自已被取代的指數尺度,不應再被引用。
所以,如果你想要一個乾淨的正面對決數字,那並不存在。最接近共同基準的一點是:兩者在代理式編程上都表現強勁,而誠實的解讀是,每家公司都發表了自己表現優異的測試結果。這是個讓你去做自家評估的理由,而不是去挑那個更高的數字。
對今天打算選購 GLM 5.2 的人來說,有一點值得注意:它已不再是 Z.ai 最新的模型。GLM-5.3 於 2026 年 8 月 14 日左右推出,定價相同,但採用的是限制大型雲端服務供應商的客製授權條款——這使 GLM 5.2 成為最後一個完全採用 MIT 授權的 Z.ai 旗艦模型,也是它至今仍具備獨特選購理由的原因。

執照是最銳利的分界線
撇開基準不談,結構上的差異比任何分數都更為鮮明。
GLM 5.2 以 MIT 授權在 Hugging Face 上以開放權重形式發布,沒有限制地區。你可以下載它、在自己的硬體上執行它、微調它,並將它搭載於產品中推出,完全無需徵求任何人的許可,也無需支付任何按 token 計價的費用。Z.ai 訓練了它——值得注意的是,根據該公司自己的說法,完全是使用華為昇騰加速器,而非 Nvidia。
Fugu Ultra v2 完全沒有提供這些。它是一項託管服務:一套在模型池之上的編排策略,而 Sakana 對該模型池的成員組成,僅在邊緣處描述過。你無法下載它、檢視它、固定它,或是在氣隙環境中運行它。你取而代之得到的是一個抽象層——單一端點,其行為原則上能抵禦任何一個上游模型消失。對於不能承受依賴消失的生產系統而言,這是一項真實的效益。這也是一項真實的代價,因為你拿控制權換來了它。
如果你的限制條件是「模型不能在我使用時改變」,這些答案中只有一個符合。如果你的限制條件是「模型不能被其他人移除」,只有另一個符合。
速度,以及測試人員對上一個的評價
GLM 5.2 在實測上並不快:Artificial Analysis 記錄到約每秒 66.3 個 token、首字延遲約 4.03 秒,這對前沿級模型而言僅屬中等水準,而 Z.ai 自家使用者也抱怨過尖峰時段的服務壅塞問題。
Sakana 並未公布 Fugu Ultra v2 的延遲或吞吐量數據,這本身就頗具資訊性——一個會將工作分派給多個模型的系統,其延遲特性完全取決於它決定呼叫哪些模型,因此單一的吞吐量數字幾乎沒有意義。針對前一版 Fugu Ultra,測試者公開回報的執行時間長達約 30 分鐘,且成本遠高於以單一模型處理同一工作的費率。那是 2026 年 6 月的模型,並非關於 v2 的證據——但這正是該測試的失效模式,也是為什麼按 token 比較會美化協調器的原因。

你實際上會怎麼稱呼這每一個
GLM 5.2 即日起已在 OrcaRouter 上線,採用 Z.ai 自家供應商費率——每百萬輸入 $1.40、每百萬輸出 $4.40,零加成直通,因此 Z.ai 任何降價都會在同一天反映到這裡。它與 OpenAI 相容,所以切換到它只需在你既有的 SDK 中更改 base-URL 和 model-ID,而且你可以把它放在容錯移轉鏈或路由規則之後,而不是把生產路徑押在單一供應商上。
Fugu Ultra v2 不是由我們路由的。它可透過 Sakana AI 自家的 OpenAI 相容 API 取得,而只要變更一個參數,就能讓現有的 Fugu 整合轉移到它上面。如果你正在將它與 GLM 5.2 進行評估比較,實務上的做法是:在你做決定之前,讓 GLM 5.2 留在你現有的閘道上,並直接從 Sakana 呼叫 Fugu Ultra v2——兩者都與 OpenAI 相容,因此可以放在同一個程式碼路徑中,並以旗標控制。
該選哪一個
選擇GLM 5.2,若你想要以已知價格獲得已知品質:MIT 授權的權重,你明天就能自行託管;固定 $1.40 / $4.40,沒有長上下文懲罰;真正可用的 1M 視窗;以及在快取的代理迴圈上複合的折扣。接受它僅支援文字、它落後 GLM-5.3 一個世代,且其獨立指數分數是暫定的。
選擇 Fugu Ultra v2,前提是你買的是韌性,加上面對高難度多步驟工作時的巔峰能力,而且你願意按 token 為協調付費,並放棄檢視或自行託管你所呼叫之對象的能力。廠商自己的說法是,它能在不依賴前沿模型的情況下達到前沿水準的輸出——這是個真實而罕見的主張,而且截至今日,確切地說,Sakana 以外沒有人能夠驗證。
我們不會做的是,只憑基準測試表在兩者之間做選擇。這些測試幾乎沒有重疊,兩家廠商都只在自己最強的地盤上公布數據,而真正具決定性的數字——完成一項長時程任務的成本——正是兩家公司都沒有放上頁面的那一個。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
