
Fugu Max vs DeepSeek V4 Pro:主打成本優化的那一個,才是貴的那一個
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Fugu Max 從設計上就是走低價路線的選項,但 DeepSeek V4 Pro 在價格上照樣把它比了下去。Sakana AI 於 2026 年 9 月 11 日推出 Fugu Max,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元,並將其定位為協調者,透過把每項任務導向自家模型池中最精簡的模型,來拓展成本效益的疆界。DeepSeek V4 Pro 自 2026 年 4 月起上架,在 OrcaRouter 的計量費率下為每百萬輸入 0.73 美元、輸出 2.18 美元——在兩個軸向上都大約只要 Fugu Max 收費的三分之一,而且來自單一開放權重的混合專家模型,輸出上限 384K,完全沒有協調層。這個倒轉就是整場比較的全部重點。關於這對組合的其他一切,都只是在問:當你試圖壓低價格的那個基準本身就已經比你便宜時,協調究竟能為你買到什麼。
降低帳單費用的兩種方法,而其中一種已經更低了
Sakana 為 Fugu Max 提出的論點是,協調器可以藉由不為不需要前沿能力的任務支付前沿價格,來削減支出。這是個合理的論點。問題在於這個論點所針對的模型。DeepSeek V4 Pro 是一個 1.6 兆參數的混合專家模型,每個 token 啟用 490 億個參數,而這正是同一套降低成本的理念,只是往下執行了一層——你付費的是某個 token 實際啟用的參數,而不是網路的規模。這兩款產品都在回答「我們要如何不再為沒有用到的容量付費?」其中一款還為這項特權,每百萬個輸出 token 收費 2.18 美元。
• 輸入價格 — Fugu Max 每 1M 個 token 為 $2.00,相較於 DeepSeek V4 Pro 每 1M 個 token 為 $0.73(按用量計費)
• 輸出價格 — Fugu Max 每 100 萬個 token $6.00,相較於 DeepSeek V4 Pro 每 100 萬個 token $2.18(按用量計費)
• 快取輸入 — Fugu Max 每 100 萬個 token 為 $0.25,而 DeepSeek V4 Pro 的快取命中輸入定價遠低於其基礎費率,且該供應商公布的牌價低於每 100 萬個 $1.00
• 背景 — Fugu Max 尚未發布,對比 DeepSeek V4 Pro 1M tokens
• 輸出上限 — Fugu Max 未公布 對比 DeepSeek V4 Pro 384K tokens
• 模態 — Fugu Max 尚未發布,對比 DeepSeek V4 Pro 僅文字,具備工具使用、JSON 模式與推理
• 架構 —— Fugu Max 是在未公開池上訓練而成的協調器,對比 DeepSeek V4 Pro 為單一 MoE 模型,開放權重血統
• 基準測試數據 — Fugu Max 聲稱六項勝出,但未提供分數;相較之下,DeepSeek V4 Pro 由廠商報告在 Terminal Bench 2.1 獲 87.9、GPQA Diamond 獲 92.8、SWE-bench Vals 獲 96.4
那份清單裡有一個數字值得被單獨挑出來。DeepSeek 在 Terminal Bench 2.1 上回報 87.9。Fugu Max 則在 Terminal Bench 2.1 上宣稱「最佳整體分數」。同一個基準測試、同一個發布時間窗口,一方公布的是數字,另一方公布的是「最佳」這個詞。這是這一組對比中,證據不對稱最乾淨俐落的單一例證;而這不是細節——這正是價格差距並非爭論終點的全部原因。

當基準已經很便宜時,編排還能帶來什麼
願意為 Fugu Max 支付更高費用的理由,必須建立在單一模型處理得很差的工作上,而這確實是一大類真實存在的工作。長程任務一旦走錯方向就會不斷累積——多檔案重構、整座儲存庫規模的變更、任何「由驗證者檢查工作者的輸出,比直接換一個更強的工作者更有價值」的情況——正是 Thinker/Worker/Verifier 架構的用武之地。Sakana 自己對 Fugu 系列的說法是,在第二輪才抓到錯誤,比第一次就做對更便宜。在那些任務上,6.00 美元的輸出費率、一次就完成,可能勝過需要三次的 2.18 美元費率。
那個論證有一種可檢驗的形式,而 Sakana 尚未公開跑過它。你會想做的比較,是兩個系統都會嘗試的基準測試上,每完成一項任務的成本——Terminal Bench 2.1 就擺在那裡,它在本質上就是代理式且以終端機為基礎,而兩家廠商中只有一家公布了它的數字。在這項落差補齊之前,誠實的立場是:Fugu Max 的成本優勢是在 token 層級上被主張,但在任務層級上尚未證實;而 DeepSeek V4 Pro 的成本優勢則很直接:token 本身的成本只要三分之一。
關於模型池組成的二階論點,在此對決中比大多數情況更為要緊。Fugu Max 的模型池於本版本擴大,納入開放權重與專業化模型,其中 NVIDIA Nemotron 系列是透過 NVIDIA 合作而列入。池中的開放權重意味著 Sakana 階梯中最便宜的那一階,不會受另一家實驗室定價決策的影響。DeepSeek V4 Pro 本身即為開放權重,除了 DeepSeek 之外,不受任何人的定價決策影響——而它正是那一階。Sakana 為編排提出的韌性論證,直接適用於 DeepSeek,而僅間接適用於 Fugu Max 的底層供應。
快取正是代理工作負載真正變得昂貴的地方
兩家廠商的基礎費率都不是 agent 迴圈實際支付的費率。長時間的 agent 執行會在每一輪重新傳送一大段幾乎不變的前綴,而快取命中率才是決定實際帳單的關鍵。Fugu Max 將快取輸入列為每百萬 $0.25,這是個貨真價實且極具侵略性的數字——僅為其自身基礎輸入費率的八分之一。DeepSeek V4 Pro 將快取命中輸入的價格訂得遠低於其公佈的基礎價,而它的輸出費率大約訂為輸入的三倍,而非多數廠商採用的四到五倍比率,這特別壓縮了生成密集型迴圈的成本。
你現在無法可靠地從任一廠商的價目表算出比較結果,因為 Fugu Max 的快取費率適用於你無法預測的 token 數量。編排器決定有多少代理執行;每個代理的上下文也都會貢獻用量;協調者還會再加上自己的部分。Sakana 對 Fugu 系列所做的定價承諾——根據參與的最高階模型採用單一混合費率,且代理不會讓費用層層疊加——排除了最壞情況,這是真正的讓步,值得肯定。但這並不能讓用量在事前變得可預知。DeepSeek V4 Pro 的帳單只取決於你送出的 token 與你收到的 token,別無其他。
這種可預測性既是模型本身的特性,也同樣是路由的特性。 DeepSeek V4 Pro 已上架 OrcaRouter,以供應商的定價提供、零加成,因此 DeepSeek 的價格調整當天就會反映到你現有的金鑰,而不必等到下次合約續約;當某一供應商路徑受到速率限制時,自動容錯移轉也能為你接手。最後這一點對此模型而言格外重要:DeepSeek 在這一輪週期內已經調整過一次定價,其尖峰與離峰級距的最終數字因來源而異。當供應商的價目表變動時,路由器就是「吸收這項變化」與「在帳單上才發現」之間的差別。

我們無法驗證的內容
Fugu Max 版本有三件事無法與 Sakana 自家資料以外的任何來源核對,因此在此列出,而非輕描淡寫帶過。首先,這六項基準測試勝出並未附上任何數字——Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 與 SWEFish 僅被列為勝出,卻未附上分數,而 SWEFish 是 Sakana 的內部基準測試。其次,Fugu Max 的上下文視窗、輸出上限與支援的模態並未公布,因此上方模態與上限列,是以已交付的規格對比一片空白。第三,目前不存在任何 Fugu 模型的獨立評估,而且 Artificial Analysis 也沒有 Fugu Max 的條目。
對 DeepSeek V4 Pro 而言,情況正好相反。廠商公布了一長串數字——Terminal Bench 2.1 87.9、GPQA Diamond 92.8、SWE-bench Vals 96.4、HLE 在兩種配置下為 42.7 和 60.0、MCP Atlas 73.6、Toolathlon-Verified 74.1、CyberGym 83.3——而這些也全都是廠商自行回報的。差別不在於某一方廠商比較值得信賴,而在於當雙方都公布數字時,才可能出現歧見,而歧見是可以被追查的。沒有數字的主張無法查證,只能接受或忽略。
關於上方 DeepSeek 定價,還有一點要注意:我們自家的模型頁面上有兩個數字,定價區塊中列出的計量費率為每百萬輸入 $0.73、輸出 $2.18,而較舊的說明則寫的是每百萬輸入 $0.44、輸出 $0.87。DeepSeek 也宣布了尖峰與離峰級距,但其最終費率各方來源說法不一。請將 $0.73 和 $2.18 視為你目前透過我們實際會被收取的費率,並在據此編列預算前,先對照已公布的價目表確認。
底線
DeepSeek V4 Pro 在 Fugu Max 所選擇的條件下贏得這項比較。它的輸入與輸出都更便宜,具備公開的上下文視窗與 384K 輸出上限,在 Fugu Max 宣稱領先的基準測試上回報了真實數字,而且它的血統是開放權重,這是 Sakana 所推銷的供應商獨立性論述中,目前最強而有力的形式。如果你的工作負載 token 用量龐大,而你的首要考量是從一個你能鎖定版本的模型取得最低且站得住腳的每 token 成本,那麼這根本沒得比。
Fugu Max 贏得了一個 DeepSeek V4 Pro 完全無法回答的較狹隘問題:一個能自行集結代理團隊的協調者,是否能比單一模型以更少的嘗試次數完成艱鉅、長跨度的工作。如果你有可查核、容錯的工作,而且你位於歐盟/歐洲經濟區之外,那就值得先試行。以每完成一項任務的 token 數來計算成本,先設定上限,並將其與 OrcaRouter 上 DeepSeek V4 Pro 端點以供應商定價進行比較——一組金鑰,0% 加價,而且費率緊貼廠商自身的價格。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
