Sakana Fugu Max 的標題卡,這款編排模型於 2026 年 9 月 11 日發布,展示四張統計卡片:輸入每 1M tokens 收費 2 美元、輸出每 1M tokens 收費 6 美元、在 6 項基準測試中整體表現最佳,以及一組包含 NVIDIA Nemotron 在內的開放與專用模型,頁尾註明所有數據皆由廠商提供。
Guides & Insights

Sakana Fugu Max:挑選可用最便宜模型的 $2/$6 調度器

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

多數模型比拼的是自己能做多少事。Sakana Fugu Max 比拼的,則是自己能少做多少事還照樣交差。Sakana AI 發布了Sakana Fugu Max,時間為 2026 年 9 月 11 日,並同時推出Sakana Fugu Ultra v2——同一套編排架構的兩種調校版本,分別指向性價比曲線的兩端。Fugu Max 不會親自回答你的請求。它會讀取任務,在模型池中挑出最有可能處理得來、又最便宜的那一個,將請求路由過去,然後回傳單一答案。Sakana 將其定價為每百萬個輸入 token 2 美元、每百萬個輸出 token 6 美元。

有趣的地方在於,這個價格是相對於什麼來衡量的。Sakana 聲稱 Fugu Max 的輸出費率比 Claude Sonnet 5GPT-5.6 TerraKimi K3 低了 40–60%。這項說法是可以查證的,而且以發表當日的基準測試而言,很不尋常的是,這套算術站得住腳:對照 Sakana 點名的這三個模型目前的定價,每百萬輸出 6 美元幾乎正好落在所述區間的中間。更難查證的是效能那一面,因為 Sakana 公布 Fugu Max 的結果時,用的是散佈圖而非數字。

Fugu Max 究竟是什麼

Fugu Max 不是檢查點。沒有權重檔、沒有參數量,也沒有任何東西需要下載。Sakana 將其描述為「一種架構,而非單一模型」——與 Fugu Ultra v2 相同的核心協同調度引擎,只是為不同的問題調校。Ultra v2 問的是可用的最高能力是什麼。Fugu Max 問的是在最低成本下,最佳輸出是什麼。

這種區別在操作上很重要。你無法微調 Fugu Max、自行託管它,或檢視它為何選擇某個模型而非另一個。你也無法看到它路由經過的完整名單——Sakana 表示,該池擴展到「迄今為止我們最大的開放和專用模型池」,並明確指出 NVIDIA 的 Nemotron 系列,該系列是透過 Sakana 在八月宣布的 NVIDIA 合作夥伴關係添加的。池中其餘部分未命名,且 Sakana 不會發布每個請求的路由追蹤。

你可以看到的是這件事的輪廓。供應商自己的圖表顯示,Fugu Max 位於一個扇出架構的頂端:一個協調器,後面是一排可互換的模型槽位,而 Sakana Namazu 與 Fugu Max 本身都在目標之列。這個池子被描述為在設計上即可替換,而其所陳述的動機既屬經濟,也同樣屬政治——Sakana 將協調機制定位為對抗供應商鎖定、API 撤銷與出口管制的保護措施,其論據是:一個能替換供應商的系統,不會被其中任何一家切斷。

Sakana Fugu 本身並非新產品。它於 2026 年 6 月 22 日正式開放使用,而廠商自己的時程表依序為 4 月(beta)、6 月(GA 加上 Fugu Ultra v1)、7 月(Fugu-Cyber 與 Claude Code 介面)、8 月(Sakana Chat 加上與 NVIDIA 的合作),再到現在的 9 月。Fugu Max 是第五個每月進展,並非初次亮相——任何已經在執行 Fugu 的人,只要對同一個 OpenAI 相容端點改一行參數即可升級,無需遷移。

定價主張經得起與標價的對照考驗

Sakana 的 $2 輸入 / $6 輸出數字在發布頁面上明確載明。次級報導補充了每百萬個 token $0.25 的快取輸入費率,而發布頁面本身並未列出此項——應將該數字視為報導所述,而非已確認。相較之下,Fugu Ultra v2 為 $5 輸入、$30 輸出,快取輸入為 $0.50。

現在來看 40–60% 這個說法。三個具名比較對象目前分別是:

• GPT-5.6 Terra — 輸入 $2/輸出 $12,此前 Open​AI 於 7 月 30 日的降價將輸出價格從 $15 調降。

• Claude Sonnet 5 — 上市推廣價的輸出費用為 $10,標準價則為 $15。關於原定九月的漲價究竟是取消了還是只是延後,各方消息來源說法不一,這也是價格區間如此寬的原因。

• Kimi K3 — 輸入 $3 / 輸出 $15,快取輸入為 $0.30。

相較之下,$6 的輸出價格比 Terra 低 50%,比 Sonnet 5 的促銷價低 40%,比 Sonnet 5 的標準價低 60%,也比 Kimi K3 低 60%。這項說法經得起檢驗,而且是對照公開定價、而非內部成本模型來檢驗——這可不是每個發布日的百分比宣稱都能這麼說。

同一節裡有一個數字禁不起同樣的檢驗。Sakana 也表示,Fugu Max 能帶來「效能與頂尖模型相差不遠,成本卻低兩到六倍」的表現。相較於它為 40–60% 這個數字所點名的三款模型,原始輸出價格差距更接近 1.7 倍到 2.5 倍。較大的倍數想必是在整個前沿範圍內衡量——包括成本遠高於 12 美元的模型——而不是對照句中那三款。這是就 Pareto 曲線而言站得住腳的主張,也是就所點名對手而言站不住腳的主張,而發布頁面並沒有區分這兩者。

這正是路由層在定價方面展現價值的地方。OrcaRouter 以無加價的方式直接傳遞供應商的定價表價格,因此當供應商調整定價表價格時,你看到的數字當天就會跟著變動——這在這裡很相關,因為 Fugu Max 的整個前提就是:池中某處存在著更便宜的模型,而你應該能不加思索地使用它。我們不託管 Fugu Max;它運行在 Sakana 自家的 API 上。但這種直通原則,正是讓 $6 的輸出費率值得與 $12 的現有方案相互比對,而不是盲目相信任一個數字的同一項原則。

Sakana 聲稱它擊敗了什麼,以及它不肯讓你看見什麼

Screenshot of the Sakana AI Fugu Max launch page showing ten Pareto frontier scatter charts plotting benchmark score against output price in US dollars per million tokens, covering Terminal Bench 2.1, HLE, DeepSWE, CharXiv Reasoning, Chartography, GDP.pdf, GPQA-D, AutomationBench, AA-LCR and SWEFish, with Fugu Max marked as a red point at the top-left of each plot and no numeric scores printed.

供應商的基準測試章節針對 Fugu Max 提出三項具體主張:在六項基準測試——Terminal Bench 2.1、GPQA-D、AA-LCR、GDP.pdf、AutomationBench 與 SWEFish——中取得最佳整體分數;在十項基準測試中的七項擴展了成本效益的帕雷托前緣;以及以一小部分的 token 花費,達到「與頂尖模型相差無幾」的效能。

在你引用其中任何內容之前,關於那份證據有三件事值得牢牢記住。

第一點是 Sakana 沒有公布任何數字。Fugu Max 的結果以十張散佈圖呈現——縱軸是分數,橫軸是每百萬詞元的輸出價格(以美元計)——其中 Fugu Max 以紅點標示,落在灰色區域的西北方。你可以看出它位於左上方。你無法從中讀出分數。Terminal Bench 2.1、GPQA-D 和 AA-LCR 都有公開排行榜,在那裡數字可以直接互相比較,卻一個都沒提供。

第二點是,六項基準測試中有一項是 Sakana 自家的。SWEFish 在發布頁面上被描述為「我們內部的基準測試,反映 Sakana AI 自身的程式設計挑戰與使用案例。」這是衡量自家產品適配度的一種合理方式,但並不是用來與競爭對手比較的方式——在廠商自行設計的基準測試、且由廠商自行選擇的任務上取得的分數,並不能作為關於其他人模型的證據。

第三點是,頁面上最強的數字屬於另一個模型。Fugu Ultra v2 拿到的是具體數據,而 Fugu Max 拿到的是圖表:Chartography 48.3,對照 Opus 5 的 27.3 與 Fable 5 的 29.5,DeepSWE 74.3,在八項基準測試中有五項為最佳或並列最佳,八項中有七項名列前二。Ultra v2 也載明訓練截止日為 2026-08-28——距離發布僅兩週多一點——而且還特別註明,Fable 5、Fable 5.1 與 GPT-6 Astra 並不在其訓練池中。Sakana 聲稱它是在不租用那些特定模型的情況下達到這個水準,而這正是整個主權論證,全寫在一個註腳裡。

這些都不會讓 Fugu Max 的宣稱變成假的。這只會讓它們未經證實,也讓那則六項基準測試的頭條只有在附上標籤時才可安全地重述。對一個全新編排端點進行獨立評估相當罕見,而且目前尚未有任何相關發表。

Fugu Max 對決 Fugu Ultra v2:哪一款才是你真正想要的

A two-column scoreboard comparing Sakana Fugu Max and Sakana Fugu Ultra v2 across six shared dimensions: price ($2 in / $6 out versus $5 in / $30 out), cached input ($0.25 reported versus $0.50), objective (lowest cost per task versus highest capability), benchmark evidence (charts with no numbers versus Chartography 48.3 and DeepSWE 74.3), whether Fable 5 or GPT-6 Astra are in the pool (not stated versus explicitly excluded), and best fit (high-volume simple traffic versus agentic long-horizon work).

這些並非互相競爭的產品,而且一旦把數字並排來看,兩者之間的選擇根本毫無懸念。Fugu Max 是便宜的那一個:輸入 $2、輸出 $6,設計上會在較便宜的模型足以勝任時,避開昂貴的模型。Fugu Ultra v2 則是強大的那一個:輸入 $5、輸出 $30、快取 $0.50,設計上會在複雜的多步驟工作上偏向選擇能力,即使這麼做所費更高。

實際的分界線在於任務型態,而非預算。如果你的流量主要是查詢、擷取、分類、短篇生成和單純的工具呼叫,Fugu Max 的整體設計就是要察覺這一點,並盡可能少花費——而 Sakana 宣稱它在十項基準測試中的七項拓展了前沿,至少方向上就是在講這件事。如果你的流量包含長時間的代理式執行、多檔案重構,或是一旦某個步驟出錯就會付出高昂代價的研究任務,那麼 Ultra v2 上 30 美元的輸出費率確實買到了實質的東西:在八項基準測試中拿下七項的前二名,正是發布頁面上最像能力宣稱、而非成本宣稱的部分。

兩者都可透過 Sakana 的控制台,在同一套與 OpenAI 相容的 API 上取得,而從現有 Fugu 升級的路徑只是變更一項參數。有兩項可用性注意事項。據報導,Fugu 在歐盟與歐洲經濟區因 GDPR 相關作業尚未完成而無法提供;若此情況依然成立,就會限制任一模型可部署的地點。而且兩者都是封閉系統:你買的是一個端點,由供應商決定其背後放置哪些模型——包括就 Fugu Max 而言,一份它並未完全揭露的模型名單。

問題在於:一個仍得租用自身前沿的編排器

對 Fugu 最尖銳的批評,正是 Sakana 把它定位為主權基礎設施時所招來的批評。一個跨第三方 API 路由的協調層,並不能阻止那些 API 被撤銷。它把單點故障轉化為分散式故障,這確實是實質改善,但底層模型仍然屬於別人,仍然會被同樣的出口管制觸及,也仍然可能遭遇同樣的突然服務中斷。八月與 NVIDIA 的合作以及新增的 Nemotron,是到目前為止對此最具體的回應——池中的開放權重模型是沒有人能關掉的模型——但 Sakana 並未說明 Fugu Max 的流量實際上有多少落在它們身上。

還有第二種更隱微的取捨。路由決策會增加延遲,並移除確定性。今天落在小型模型上的請求,明天可能會落到不同的模型上,只要池子或成本權重有所變動;這使得行為更難進行回歸測試,也更難向任何稽核系統的人解釋。Sakana 的答覆是:協調編排是內部的,而 API 的行為就像單一模型。這在介面上是真的,在底層卻不是;有嚴格可重現性要求的團隊,應該在它變成關鍵依賴之前仔細測試這一點。

如果你想要成本上的優勢,又不想讓這個模型池成為你唯一的依賴,同樣的模式也可以由你自己組合出來。我們的 routing DSL 讓你能在單一端點後方定義一組模型,並決定哪個模型處理哪一類請求;而 model fusion 會在同一則提示上執行多個模型,並在共識比價格更重要的情況下調和各方答案。跨供應商的故障轉移意味著,當某個供應商服務品質下降——或消失——流量會移轉到你已經信任的模型,而且無須變更程式碼。這是 Sakana 要你全盤押注的那個賭注中,比較保守的版本。

Screenshot of the OrcaRouter models catalogue showing 196 models across 15 providers under one API key and one bill, an OpenAI-compatible chat completions endpoint, and per-model token rates including GPT-6 Astra at $10 input and $50 output, Claude Fable 5.1 at $10 and $50, Qwen3.8 Max at $2 and $6, and Gemini 3.8 Flash at $0.750 and $3.75.

這裡值得精確說明我們提供與不提供什麼。Sakana Fugu Max 並不在我們的目錄中——它在我們這邊不是可路由的模型,而是運行於 Sakana 自家的 API 與主控台。我們的目錄是15 家供應商、196 個模型,共用一把金鑰與一張帳單,每張卡片上都印有每詞元(per-token)費率,且不在其上額外加價。與 Fugu Max 真正相關的重疊之處在於理念,而非產品清單:兩者都主張,面對「這個任務該由哪個模型處理」這個問題,正確答案通常不是最大的那個模型。

誰應該移動,誰應該等待

Fugu Max 是本月較有趣的發布之一,正因為它並不是一個模型。如果你已經在使用 Sakana Fugu,這次升級只是改一行程式碼,價格還更低,沒有理由猶豫。如果你正在中階模型上處理高流量、低複雜度的請求,並為此每百萬輸出 token 支付 $10–$15,那麼 Sakana 提出的這筆帳值得你自己做一次基準測試——取一週的真實請求,讓它們跑過 Fugu Max,並將品質與你目前的模型比較,而不是與那些散點圖比較。

如果你在投入之前需要已公佈的基準測試數字,那就先等等。Fugu Max 目前還沒有任何獨立資料,廠商自家的證據是一張圖表而非表格,而六項重點基準測試中有一項是 Sakana 的。這不是否定它的理由——而是要在你自己的流量上測試它的理由,因為那才是唯一真正能預測你結果的基準。而如果你的工作負載是代理式、長時程且出錯代價高昂,這一對之中該看的是 Fugu Ultra v2,而不是 Fugu Max:它才是附有數字的那一個。

我們的路由 DSL可讓你定義單一端點後方的一組模型,並決定由哪個模型處理哪一類請求;而模型融合會在同一個提示上執行多個模型,並在一致性比價格更重要的情況下調和這些答案。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新