一張 Fugu Ultra v2 的主視覺標題卡,標題為「Fugu Ultra v2」,副標題為「池子變小了,分數卻提高了」,膠囊標籤寫著「Chartography 48.3」、「DeepSWE 74.3」和「$5 / $30 每 1M」,頁腳一行寫著「Sakana AI - 於 2026 年 9 月 11 日發布」,右下角則有 OrcaRouter 標誌。
Guides & Insights

Sakana Fugu Ultra v2 解析:池子變小了,分數卻提高了

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Fugu Ultra v2 是一種奇怪的升級:Sakana AI 於 2026 年 9 月 11 日推出它,而它的模型池已不再包含 Claude Fable 5Claude Fable 5.1GPT-6 Astra——這三款目前最強大的系統——卻仍宣稱能勝過這三者。這家東京實驗室新的高品質層級旗艦,與同日推出一款更便宜的兄弟產品 Fugu Max,在 Sakana 自家評測的八項基準中有五項拿下最佳或並列最佳,包括 Chartography 的 48.3,對比 Claude Opus 5 的 27.3 與 Claude Fable 5 的 29.5,以及 DeepSWE 的 74.3。這些數字無一經過獨立重現,而且至今沒有任何 Fugu 模型有 Artificial Analysis 頁面。那道落差正是重點所在:你被要求買下的,是一套協調層,而它全部的賣點就是——它不需要最好的模型,也能產出最好的答案。

Sakana AI 於 2023 年由《Transformer》論文共同作者 Llion Jones 與 David Ha 創立。Fugu 系列於 2026 年 6 月推出,是一套以單一模型形式交付的多代理系統:你呼叫一個 OpenAI 相容端點,而在其背後,一個受過訓練的協調器會拆解請求、生成代理,並綜合結果。這項研究真實存在且已發表——TRINITY(arXiv 2512.04695)演化出一個輕量級協調器,負責指派 Thinker、Worker 與 Verifier 角色;Conductor(arXiv 2512.04388)學會了代理之間的自然語言協調;Fugu 技術報告則位於 arXiv 2606.21228。Sakana 從未發表過的,正是所有人真正想要的東西:模型池中模型的身分,以及各項任務的路由決策。

相較於六月的 Fugu Ultra,實際上改變了什麼?

2.0 版是在原始版本約十一週後的一次小幅更新,並非全新架構。廠商自身的說法是,Fugu Ultra v2 與 Fugu Max 是「相同的核心協同編排架構」,針對兩項不同任務調校:Max 將成本效益的邊界往下推,Ultra 則將峰值能力往上推。模型 ID 是 fugu-ultra-v2.0,而 Sakana 表示從較早的 Fugu 移轉過來只需改一行參數,無須遷移 SDK——這是本次發布中最對消費者友善的一點。

實質性的變更在於首尾這兩項。首先,訓練截止點移至 20260828,因此協調器已針對當前世代的前沿模型重新調校。其次,而且有趣得多的是,候選池的組成出現了 Sakana 刻意公開宣傳的變化:Claude Fable 5、Claude Fable 5.1 與 GPT-6 Astra 都被明確排除。Sakana 的論點是,這證明了這些分數並不依賴單一的專有前沿模型;若你關心的是供應商鎖定、API 撤銷,或某個模型因出口管制而消失,這一點就很重要。

有一個 Sakana 並未多加著墨的二階後果。如果這個池子排除了三個可取得的最強模型,那麼與 Fable 5 和 Fable 5.1 的基準比較,就是在拿 orchestrator 即使想呼叫也呼叫不到的系統來比。這個比較是合理的——它是一個關於架構的主張,而不是關於取用權限的主張——但它並不是一場對等條件的測試,用來判定誰擁有更好的模型。它測試的是協調能否勝過原始能力。那是一個確實有趣的問題。它只是不是計分板乍看之下所暗示的那個問題。

A single-column scoreboard for Fugu Ultra v2 titled 'Fugu Ultra v2 - the scoreboard' listing Best or joint-best 5 of 8 benchmarks, Chartography 48.3, DeepSWE 74.3, Agent pool excludes Fable 5, Fable 5.1, GPT-6 Astra, Price $5.00 / $30.00 per 1M, and Independent evaluation none published, with a footer 'All figures vendor-reported by Sakana AI, September 2026; no independent evaluation.' and the OrcaRouter logo in the bottom-right corner.

這些數字,以及是誰產出它們的

本節中的每一項數字都是由廠商自行回報的。Sakana 並未發布任何評估框架、任何逐任務分數網格,也沒有重現方法,而這樣的協作編排設計讓獨立複製變得更加困難,而非更容易:要重現某個分數,必須以相同版本與相同拓撲存取集區中的每一個模型,而且按照設計,拓撲會隨每個請求而有所不同。

• Chartography(針對圖表與結構化文件的視覺推理)— Fugu Ultra v2 48.3、Claude Opus 5 27.3、Claude Fable 5 29.5 — 廠商回報

• DeepSWE(真實世界軟體工程)— Fugu Ultra v2 74.3 — 廠商回報,據稱能勝過每 token 成本高出三到五倍的模型

• 最佳或並列最佳名次 — 八項基準中的五項:GDP.pdf、Chartography、SWEFish、DeepSWE 與 Toolathon — 由廠商自行報告

• 排名前二 — 八項基準中的七項 — 由廠商報告

• 先前的 Fugu Ultra(2026 年 6 月,作為規模參照)— LiveCodeBench 93.2、GPQA-Diamond 95.5、TerminalBench 82.1、SWE-Bench Pro 73.7 — 廠商回報

Chartography 這一列值得受到它目前所獲得的強調,因為它是唯一一個與具名現行旗艦之間的差距並非微不足道的類別。在視覺推理基準測試上領先 Claude Opus 5 達 21 分,這種數字通常幾天內就會出現在獨立排行榜上。截至本文撰寫時,一個都還沒出現。請把這一列當成一個附有金額數字的假設,而不是已成定論的結果。

定價:與六月相比維持不變,而在輸出方面著實昂貴

Fugu Ultra v2 每百萬個輸入 token 收費 $5,每百萬個輸出 token 收費 $30,每百萬個快取輸入 token 收費 $0.50。當上下文超過 272,000 個 token 時,這些價格分別變成 $10、$45 和 $1.00。Fugu Max 則完全是另一種結構:每百萬個 token 輸入 $2、輸出 $6、快取 $0.25,無論上下文長度為何都固定不變,另外每次網路搜尋或抓取呼叫加收 $0.007。

關於那個定價表,有兩件事值得仔細閱讀。第一,輸出是輸入的六倍——這是個積極的比例,等於為模型的冗長程度定價,而協同編排本身就是件冗長的差事。一個會產生代理人並綜合其答覆的協調器會發出大量 token,而你得為全部這些 token 支付每百萬 30 美元的費用。Sakana 的效率主張是關於底層資源池,而不是關於系統代表你產出多少文字,而這兩者是不同的數字。要根據實際觀察到的 token 用量來編列預算,而不是根據那個標題費率。

第二個是 272K 斷崖。將超過某個門檻後的每 token 費率加倍,是為長上下文工作定價的合理做法,但這表示長上下文代理執行的有效成本,並不是定價頁面上的那個數字。如果你的工作負載剛好落在邊界附近,那麼在邊界的兩側,計算結果會有顯著差異。

Fugu 的訂閱方案——每月 20 美元的 Standard、100 美元的 Pro、200 美元的 Max,分別提供 10 倍與 20 倍額度——全都包含 Fugu、Fugu Ultra 與 Fugu Max 的使用權限。Sakana 也依據特定請求的資源池中最高階的方案,為基礎 Fugu 模型定價,並明確表示增加更多代理並不會讓帳單倍增。這與你自己呼叫多個前沿模型時所得到的扇出成本模式有實質差異。

Sakana 不會告訴你的事

詢問哪些模型回答了你的問題,而 FAQ 的回答很直接:「這類路由資訊依設計不予公開。」Ultra 與 Max 集區是固定的,因此你無法將特定供應商排除在外;只有基礎 Fugu 模型支援在主控台設定中逐模型選擇退出。企業客戶則可協商自訂配置。

那種不透明性,正是 Fugu 系列自六月以來招致批評的核心;而這是公允的批評,並非出於敵意。當一個編排器藉由結合其他實驗室的模型而獲得高分時,分數屬於整個系統——這確實是真實、站得住腳且可販售的東西——但它不會移轉到任何單一模型上,也無法受到稽核。評論者直言不諱:Fugu 並沒有擊敗旗艦,而是聘用了旗艦。在具備低成本檢查器的可驗證任務上,例如附有測試套件的程式設計基準測試,委員會確實能勝過其最佳成員。在沒有這類檢查器的任務上,由數個前沿模型取樣並回報最佳結果的評審小組,有一部分只是在回報運氣。Sakana 自身的類別選擇——Chartography、DeepSWE、Toolathon——偏向可驗證的那一端;這既是提出該主張的正確位置,也是該主張無法不付出代價就推而廣之的原因。

獨立測試人員也指出,延遲變異是協作編排的實際代價:在困難任務上,協調者會仔細斟酌,而在簡單任務上,這種斟酌純屬額外負擔。據稱,某位研究人員的著色器任務花了約三十分鐘,品質僅被評為可接受。

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, the 'Start Using Sakana Fugu' and 'Contact Us' buttons, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

你實際上可以在哪裡取得它

Fugu Ultra v2 現已上線,可透過 Sakana 自家與 OpenAI 相容的 API 使用——只要把現有的客戶端指向該端點、帶上 API 金鑰,再改一行設定即可——也可透過多個第三方平台存取。OrcaRouter 並未提供 Fugu 系列模型;如果你想呼叫 Fugu Ultra v2,直接使用供應商自家的 API 是最直接的途徑。

值得留意的是 Sakana 隱含與之競爭的替代方案。讓 Fugu Ultra v2 得以運作的模型池,是由今日各自可獨立呼叫的模型所組成,而用來衡量它的對手,則是各團隊已經在跑的那些。Claude Opus 5、DeepSeek V4 Pro 和 Gemini 3.1 Pro 都在 OrcaRouter 上,以各供應商的原價、0% 加成提供,這意味著這些廠商任一家降價,宣布當天我們這邊就同步生效。如果你考慮採用協調器(orchestrator)的原因是韌性——不想讓生產環境路徑依賴單一供應商的可用性或單一供應商的政策——那麼一個能跨供應商自動容錯移轉的路由層,能在模型層面解決這個問題的一部分,而 Fugu Ultra v2 則在推理層面解決另一部分。一個 API 串接 200+ 個模型並具備容錯移轉,並不能取代受過訓練的協調器,而受過訓練的協調器也不能取代「不依賴單一供應商」。有些團隊會兩者都要。

合規的陷阱

Fugu 無法在歐盟或歐洲經濟區使用。供應商的措辭很明確:在努力符合 GDPR 與歐盟特定法規之際,尚未於 EU/EEA 提供;而在其他地區,存取可能受網路狀況或當地規則限制。若你的組織在適用範圍內有歐盟實體,這會讓 Fugu 這個選項不列入考慮,無論基準測試效能如何;這一點值得在評估之前、而不是之後就知道。

A screenshot of the OrcaRouter models catalogue page (captured September 11, 2026, English UI), showing the OrcaRouter navigation with Models, Leaderboard, Offers and Developers entries, the search field, and the 'Get API key' button over the browsable model catalogue.

看什麼

有三件事能讓 Fugu Ultra v2 從一個有趣的宣稱,變成一個真正扛得起關鍵重任的選擇。一份獨立評估——一筆 Artificial Analysis 的收錄、一個 LMArena 的排名位置,任何背後有測試框架撐腰的東西——就能在一週內解決 Chartography 的疑問。由第三方在可驗證的程式設計基準上重現的數字,將能證實該架構所預測的系統級增益。而一份對外揭露的池,甚至只是部分揭露,也能讓買家推斷出:當他們把生產流量導向一個自己無法檢視的協調器時,究竟接受了哪些單點故障。

在那之前,誠實的立場是這樣。Fugu Ultra v2 是迄今最認真的一次嘗試,要把編排當成產品來賣,而不是研究展示;它來自一個有已發表研究成果撐腰的實驗室,其定價讓編排溢價變得明確而非隱藏。如果你的工作負載是長時程、可驗證,且限於 Sakana 能提供服務的地區,那就值得做一次範圍明確的試點,並開啟 token 計量。如果不是,那麼 Fugu Ultra v2 所被拿來衡量的那些模型,只差一次 API 呼叫,按定價表收費,還附有能證明它們實力的憑據。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新