
Sakana Fugu Max:挑選可用最便宜模型的 $2/$6 調度器
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
多數模型比拼的是自己能做多少事。Sakana Fugu Max 比拼的,則是自己能少做多少事還照樣交差。Sakana AI 發布了Sakana Fugu Max,時間為 2026 年 9 月 11 日,並同時推出Sakana Fugu Ultra v2——同一套編排架構的兩種調校版本,分別指向性價比曲線的兩端。Fugu Max 不會親自回答你的請求。它會讀取任務,在模型池中挑出最有可能處理得來、又最便宜的那一個,將請求路由過去,然後回傳單一答案。Sakana 將其定價為每百萬個輸入 token 2 美元、每百萬個輸出 token 6 美元。
有趣的地方在於,這個價格是相對於什麼來衡量的。Sakana 聲稱 Fugu Max 的輸出費率比 Claude Sonnet 5、GPT-5.6 Terra 和 Kimi K3 低了 40–60%。這項說法是可以查證的,而且以發表當日的基準測試而言,很不尋常的是,這套算術站得住腳:對照 Sakana 點名的這三個模型目前的定價,每百萬輸出 6 美元幾乎正好落在所述區間的中間。更難查證的是效能那一面,因為 Sakana 公布 Fugu Max 的結果時,用的是散佈圖而非數字。
Fugu Max 究竟是什麼
Fugu Max 不是檢查點。沒有權重檔、沒有參數量,也沒有任何東西需要下載。Sakana 將其描述為「一種架構,而非單一模型」——與 Fugu Ultra v2 相同的核心協同調度引擎,只是為不同的問題調校。Ultra v2 問的是可用的最高能力是什麼。Fugu Max 問的是在最低成本下,最佳輸出是什麼。
這種區別在操作上很重要。你無法微調 Fugu Max、自行託管它,或檢視它為何選擇某個模型而非另一個。你也無法看到它路由經過的完整名單——Sakana 表示,該池擴展到「迄今為止我們最大的開放和專用模型池」,並明確指出 NVIDIA 的 Nemotron 系列,該系列是透過 Sakana 在八月宣布的 NVIDIA 合作夥伴關係添加的。池中其餘部分未命名,且 Sakana 不會發布每個請求的路由追蹤。
你可以看到的是這件事的輪廓。供應商自己的圖表顯示,Fugu Max 位於一個扇出架構的頂端:一個協調器,後面是一排可互換的模型槽位,而 Sakana Namazu 與 Fugu Max 本身都在目標之列。這個池子被描述為在設計上即可替換,而其所陳述的動機既屬經濟,也同樣屬政治——Sakana 將協調機制定位為對抗供應商鎖定、API 撤銷與出口管制的保護措施,其論據是:一個能替換供應商的系統,不會被其中任何一家切斷。
Sakana Fugu 本身並非新產品。它於 2026 年 6 月 22 日正式開放使用,而廠商自己的時程表依序為 4 月(beta)、6 月(GA 加上 Fugu Ultra v1)、7 月(Fugu-Cyber 與 Claude Code 介面)、8 月(Sakana Chat 加上與 NVIDIA 的合作),再到現在的 9 月。Fugu Max 是第五個每月進展,並非初次亮相——任何已經在執行 Fugu 的人,只要對同一個 OpenAI 相容端點改一行參數即可升級,無需遷移。
定價主張經得起與標價的對照考驗
Sakana 的 $2 輸入 / $6 輸出數字在發布頁面上明確載明。次級報導補充了每百萬個 token $0.25 的快取輸入費率,而發布頁面本身並未列出此項——應將該數字視為報導所述,而非已確認。相較之下,Fugu Ultra v2 為 $5 輸入、$30 輸出,快取輸入為 $0.50。
現在來看 40–60% 這個說法。三個具名比較對象目前分別是:
• GPT-5.6 Terra — 輸入 $2/輸出 $12,此前 OpenAI 於 7 月 30 日的降價將輸出價格從 $15 調降。
• Claude Sonnet 5 — 上市推廣價的輸出費用為 $10,標準價則為 $15。關於原定九月的漲價究竟是取消了還是只是延後,各方消息來源說法不一,這也是價格區間如此寬的原因。
• Kimi K3 — 輸入 $3 / 輸出 $15,快取輸入為 $0.30。
相較之下,$6 的輸出價格比 Terra 低 50%,比 Sonnet 5 的促銷價低 40%,比 Sonnet 5 的標準價低 60%,也比 Kimi K3 低 60%。這項說法經得起檢驗,而且是對照公開定價、而非內部成本模型來檢驗——這可不是每個發布日的百分比宣稱都能這麼說。
同一節裡有一個數字禁不起同樣的檢驗。Sakana 也表示,Fugu Max 能帶來「效能與頂尖模型相差不遠,成本卻低兩到六倍」的表現。相較於它為 40–60% 這個數字所點名的三款模型,原始輸出價格差距更接近 1.7 倍到 2.5 倍。較大的倍數想必是在整個前沿範圍內衡量——包括成本遠高於 12 美元的模型——而不是對照句中那三款。這是就 Pareto 曲線而言站得住腳的主張,也是就所點名對手而言站不住腳的主張,而發布頁面並沒有區分這兩者。
這正是路由層在定價方面展現價值的地方。OrcaRouter 以無加價的方式直接傳遞供應商的定價表價格,因此當供應商調整定價表價格時,你看到的數字當天就會跟著變動——這在這裡很相關,因為 Fugu Max 的整個前提就是:池中某處存在著更便宜的模型,而你應該能不加思索地使用它。我們不託管 Fugu Max;它運行在 Sakana 自家的 API 上。但這種直通原則,正是讓 $6 的輸出費率值得與 $12 的現有方案相互比對,而不是盲目相信任一個數字的同一項原則。
Sakana 聲稱它擊敗了什麼,以及它不肯讓你看見什麼

供應商的基準測試章節針對 Fugu Max 提出三項具體主張:在六項基準測試——Terminal Bench 2.1、GPQA-D、AA-LCR、GDP.pdf、AutomationBench 與 SWEFish——中取得最佳整體分數;在十項基準測試中的七項擴展了成本效益的帕雷托前緣;以及以一小部分的 token 花費,達到「與頂尖模型相差無幾」的效能。
在你引用其中任何內容之前,關於那份證據有三件事值得牢牢記住。
第一點是 Sakana 沒有公布任何數字。Fugu Max 的結果以十張散佈圖呈現——縱軸是分數,橫軸是每百萬詞元的輸出價格(以美元計)——其中 Fugu Max 以紅點標示,落在灰色區域的西北方。你可以看出它位於左上方。你無法從中讀出分數。Terminal Bench 2.1、GPQA-D 和 AA-LCR 都有公開排行榜,在那裡數字可以直接互相比較,卻一個都沒提供。
第二點是,六項基準測試中有一項是 Sakana 自家的。SWEFish 在發布頁面上被描述為「我們內部的基準測試,反映 Sakana AI 自身的程式設計挑戰與使用案例。」這是衡量自家產品適配度的一種合理方式,但並不是用來與競爭對手比較的方式——在廠商自行設計的基準測試、且由廠商自行選擇的任務上取得的分數,並不能作為關於其他人模型的證據。
第三點是,頁面上最強的數字屬於另一個模型。Fugu Ultra v2 拿到的是具體數據,而 Fugu Max 拿到的是圖表:Chartography 48.3,對照 Opus 5 的 27.3 與 Fable 5 的 29.5,DeepSWE 74.3,在八項基準測試中有五項為最佳或並列最佳,八項中有七項名列前二。Ultra v2 也載明訓練截止日為 2026-08-28——距離發布僅兩週多一點——而且還特別註明,Fable 5、Fable 5.1 與 GPT-6 Astra 並不在其訓練池中。Sakana 聲稱它是在不租用那些特定模型的情況下達到這個水準,而這正是整個主權論證,全寫在一個註腳裡。
這些都不會讓 Fugu Max 的宣稱變成假的。這只會讓它們未經證實,也讓那則六項基準測試的頭條只有在附上標籤時才可安全地重述。對一個全新編排端點進行獨立評估相當罕見,而且目前尚未有任何相關發表。
Fugu Max 對決 Fugu Ultra v2:哪一款才是你真正想要的

這些並非互相競爭的產品,而且一旦把數字並排來看,兩者之間的選擇根本毫無懸念。Fugu Max 是便宜的那一個:輸入 $2、輸出 $6,設計上會在較便宜的模型足以勝任時,避開昂貴的模型。Fugu Ultra v2 則是強大的那一個:輸入 $5、輸出 $30、快取 $0.50,設計上會在複雜的多步驟工作上偏向選擇能力,即使這麼做所費更高。
實際的分界線在於任務型態,而非預算。如果你的流量主要是查詢、擷取、分類、短篇生成和單純的工具呼叫,Fugu Max 的整體設計就是要察覺這一點,並盡可能少花費——而 Sakana 宣稱它在十項基準測試中的七項拓展了前沿,至少方向上就是在講這件事。如果你的流量包含長時間的代理式執行、多檔案重構,或是一旦某個步驟出錯就會付出高昂代價的研究任務,那麼 Ultra v2 上 30 美元的輸出費率確實買到了實質的東西:在八項基準測試中拿下七項的前二名,正是發布頁面上最像能力宣稱、而非成本宣稱的部分。
兩者都可透過 Sakana 的控制台,在同一套與 OpenAI 相容的 API 上取得,而從現有 Fugu 升級的路徑只是變更一項參數。有兩項可用性注意事項。據報導,Fugu 在歐盟與歐洲經濟區因 GDPR 相關作業尚未完成而無法提供;若此情況依然成立,就會限制任一模型可部署的地點。而且兩者都是封閉系統:你買的是一個端點,由供應商決定其背後放置哪些模型——包括就 Fugu Max 而言,一份它並未完全揭露的模型名單。
問題在於:一個仍得租用自身前沿的編排器
對 Fugu 最尖銳的批評,正是 Sakana 把它定位為主權基礎設施時所招來的批評。一個跨第三方 API 路由的協調層,並不能阻止那些 API 被撤銷。它把單點故障轉化為分散式故障,這確實是實質改善,但底層模型仍然屬於別人,仍然會被同樣的出口管制觸及,也仍然可能遭遇同樣的突然服務中斷。八月與 NVIDIA 的合作以及新增的 Nemotron,是到目前為止對此最具體的回應——池中的開放權重模型是沒有人能關掉的模型——但 Sakana 並未說明 Fugu Max 的流量實際上有多少落在它們身上。
還有第二種更隱微的取捨。路由決策會增加延遲,並移除確定性。今天落在小型模型上的請求,明天可能會落到不同的模型上,只要池子或成本權重有所變動;這使得行為更難進行回歸測試,也更難向任何稽核系統的人解釋。Sakana 的答覆是:協調編排是內部的,而 API 的行為就像單一模型。這在介面上是真的,在底層卻不是;有嚴格可重現性要求的團隊,應該在它變成關鍵依賴之前仔細測試這一點。
如果你想要成本上的優勢,又不想讓這個模型池成為你唯一的依賴,同樣的模式也可以由你自己組合出來。我們的 routing DSL 讓你能在單一端點後方定義一組模型,並決定哪個模型處理哪一類請求;而 model fusion 會在同一則提示上執行多個模型,並在共識比價格更重要的情況下調和各方答案。跨供應商的故障轉移意味著,當某個供應商服務品質下降——或消失——流量會移轉到你已經信任的模型,而且無須變更程式碼。這是 Sakana 要你全盤押注的那個賭注中,比較保守的版本。

這裡值得精確說明我們提供與不提供什麼。Sakana Fugu Max 並不在我們的目錄中——它在我們這邊不是可路由的模型,而是運行於 Sakana 自家的 API 與主控台。我們的目錄是15 家供應商、196 個模型,共用一把金鑰與一張帳單,每張卡片上都印有每詞元(per-token)費率,且不在其上額外加價。與 Fugu Max 真正相關的重疊之處在於理念,而非產品清單:兩者都主張,面對「這個任務該由哪個模型處理」這個問題,正確答案通常不是最大的那個模型。
誰應該移動,誰應該等待
Fugu Max 是本月較有趣的發布之一,正因為它並不是一個模型。如果你已經在使用 Sakana Fugu,這次升級只是改一行程式碼,價格還更低,沒有理由猶豫。如果你正在中階模型上處理高流量、低複雜度的請求,並為此每百萬輸出 token 支付 $10–$15,那麼 Sakana 提出的這筆帳值得你自己做一次基準測試——取一週的真實請求,讓它們跑過 Fugu Max,並將品質與你目前的模型比較,而不是與那些散點圖比較。
如果你在投入之前需要已公佈的基準測試數字,那就先等等。Fugu Max 目前還沒有任何獨立資料,廠商自家的證據是一張圖表而非表格,而六項重點基準測試中有一項是 Sakana 的。這不是否定它的理由——而是要在你自己的流量上測試它的理由,因為那才是唯一真正能預測你結果的基準。而如果你的工作負載是代理式、長時程且出錯代價高昂,這一對之中該看的是 Fugu Ultra v2,而不是 Fugu Max:它才是附有數字的那一個。
我們的路由 DSL可讓你定義單一端點後方的一組模型,並決定由哪個模型處理哪一類請求;而模型融合會在同一個提示上執行多個模型,並在一致性比價格更重要的情況下調和這些答案。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
