
Sakana Fugu Ultra v2 解析:池子變小了,分數卻提高了
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Fugu Ultra v2 是一種奇怪的升級:Sakana AI 於 2026 年 9 月 11 日推出它,而它的模型池已不再包含 Claude Fable 5、Claude Fable 5.1 或 GPT-6 Astra——這三款目前最強大的系統——卻仍宣稱能勝過這三者。這家東京實驗室新的高品質層級旗艦,與同日推出一款更便宜的兄弟產品 Fugu Max,在 Sakana 自家評測的八項基準中有五項拿下最佳或並列最佳,包括 Chartography 的 48.3,對比 Claude Opus 5 的 27.3 與 Claude Fable 5 的 29.5,以及 DeepSWE 的 74.3。這些數字無一經過獨立重現,而且至今沒有任何 Fugu 模型有 Artificial Analysis 頁面。那道落差正是重點所在:你被要求買下的,是一套協調層,而它全部的賣點就是——它不需要最好的模型,也能產出最好的答案。
Sakana AI 於 2023 年由《Transformer》論文共同作者 Llion Jones 與 David Ha 創立。Fugu 系列於 2026 年 6 月推出,是一套以單一模型形式交付的多代理系統:你呼叫一個 OpenAI 相容端點,而在其背後,一個受過訓練的協調器會拆解請求、生成代理,並綜合結果。這項研究真實存在且已發表——TRINITY(arXiv 2512.04695)演化出一個輕量級協調器,負責指派 Thinker、Worker 與 Verifier 角色;Conductor(arXiv 2512.04388)學會了代理之間的自然語言協調;Fugu 技術報告則位於 arXiv 2606.21228。Sakana 從未發表過的,正是所有人真正想要的東西:模型池中模型的身分,以及各項任務的路由決策。
相較於六月的 Fugu Ultra,實際上改變了什麼?
2.0 版是在原始版本約十一週後的一次小幅更新,並非全新架構。廠商自身的說法是,Fugu Ultra v2 與 Fugu Max 是「相同的核心協同編排架構」,針對兩項不同任務調校:Max 將成本效益的邊界往下推,Ultra 則將峰值能力往上推。模型 ID 是 fugu-ultra-v2.0,而 Sakana 表示從較早的 Fugu 移轉過來只需改一行參數,無須遷移 SDK——這是本次發布中最對消費者友善的一點。
實質性的變更在於首尾這兩項。首先,訓練截止點移至 20260828,因此協調器已針對當前世代的前沿模型重新調校。其次,而且有趣得多的是,候選池的組成出現了 Sakana 刻意公開宣傳的變化:Claude Fable 5、Claude Fable 5.1 與 GPT-6 Astra 都被明確排除。Sakana 的論點是,這證明了這些分數並不依賴單一的專有前沿模型;若你關心的是供應商鎖定、API 撤銷,或某個模型因出口管制而消失,這一點就很重要。
有一個 Sakana 並未多加著墨的二階後果。如果這個池子排除了三個可取得的最強模型,那麼與 Fable 5 和 Fable 5.1 的基準比較,就是在拿 orchestrator 即使想呼叫也呼叫不到的系統來比。這個比較是合理的——它是一個關於架構的主張,而不是關於取用權限的主張——但它並不是一場對等條件的測試,用來判定誰擁有更好的模型。它測試的是協調能否勝過原始能力。那是一個確實有趣的問題。它只是不是計分板乍看之下所暗示的那個問題。

這些數字,以及是誰產出它們的
本節中的每一項數字都是由廠商自行回報的。Sakana 並未發布任何評估框架、任何逐任務分數網格,也沒有重現方法,而這樣的協作編排設計讓獨立複製變得更加困難,而非更容易:要重現某個分數,必須以相同版本與相同拓撲存取集區中的每一個模型,而且按照設計,拓撲會隨每個請求而有所不同。
• Chartography(針對圖表與結構化文件的視覺推理)— Fugu Ultra v2 48.3、Claude Opus 5 27.3、Claude Fable 5 29.5 — 廠商回報
• DeepSWE(真實世界軟體工程)— Fugu Ultra v2 74.3 — 廠商回報,據稱能勝過每 token 成本高出三到五倍的模型
• 最佳或並列最佳名次 — 八項基準中的五項:GDP.pdf、Chartography、SWEFish、DeepSWE 與 Toolathon — 由廠商自行報告
• 排名前二 — 八項基準中的七項 — 由廠商報告
• 先前的 Fugu Ultra(2026 年 6 月,作為規模參照)— LiveCodeBench 93.2、GPQA-Diamond 95.5、TerminalBench 82.1、SWE-Bench Pro 73.7 — 廠商回報
Chartography 這一列值得受到它目前所獲得的強調,因為它是唯一一個與具名現行旗艦之間的差距並非微不足道的類別。在視覺推理基準測試上領先 Claude Opus 5 達 21 分,這種數字通常幾天內就會出現在獨立排行榜上。截至本文撰寫時,一個都還沒出現。請把這一列當成一個附有金額數字的假設,而不是已成定論的結果。
定價:與六月相比維持不變,而在輸出方面著實昂貴
Fugu Ultra v2 每百萬個輸入 token 收費 $5,每百萬個輸出 token 收費 $30,每百萬個快取輸入 token 收費 $0.50。當上下文超過 272,000 個 token 時,這些價格分別變成 $10、$45 和 $1.00。Fugu Max 則完全是另一種結構:每百萬個 token 輸入 $2、輸出 $6、快取 $0.25,無論上下文長度為何都固定不變,另外每次網路搜尋或抓取呼叫加收 $0.007。
關於那個定價表,有兩件事值得仔細閱讀。第一,輸出是輸入的六倍——這是個積極的比例,等於為模型的冗長程度定價,而協同編排本身就是件冗長的差事。一個會產生代理人並綜合其答覆的協調器會發出大量 token,而你得為全部這些 token 支付每百萬 30 美元的費用。Sakana 的效率主張是關於底層資源池,而不是關於系統代表你產出多少文字,而這兩者是不同的數字。要根據實際觀察到的 token 用量來編列預算,而不是根據那個標題費率。
第二個是 272K 斷崖。將超過某個門檻後的每 token 費率加倍,是為長上下文工作定價的合理做法,但這表示長上下文代理執行的有效成本,並不是定價頁面上的那個數字。如果你的工作負載剛好落在邊界附近,那麼在邊界的兩側,計算結果會有顯著差異。
Fugu 的訂閱方案——每月 20 美元的 Standard、100 美元的 Pro、200 美元的 Max,分別提供 10 倍與 20 倍額度——全都包含 Fugu、Fugu Ultra 與 Fugu Max 的使用權限。Sakana 也依據特定請求的資源池中最高階的方案,為基礎 Fugu 模型定價,並明確表示增加更多代理並不會讓帳單倍增。這與你自己呼叫多個前沿模型時所得到的扇出成本模式有實質差異。
Sakana 不會告訴你的事
詢問哪些模型回答了你的問題,而 FAQ 的回答很直接:「這類路由資訊依設計不予公開。」Ultra 與 Max 集區是固定的,因此你無法將特定供應商排除在外;只有基礎 Fugu 模型支援在主控台設定中逐模型選擇退出。企業客戶則可協商自訂配置。
那種不透明性,正是 Fugu 系列自六月以來招致批評的核心;而這是公允的批評,並非出於敵意。當一個編排器藉由結合其他實驗室的模型而獲得高分時,分數屬於整個系統——這確實是真實、站得住腳且可販售的東西——但它不會移轉到任何單一模型上,也無法受到稽核。評論者直言不諱:Fugu 並沒有擊敗旗艦,而是聘用了旗艦。在具備低成本檢查器的可驗證任務上,例如附有測試套件的程式設計基準測試,委員會確實能勝過其最佳成員。在沒有這類檢查器的任務上,由數個前沿模型取樣並回報最佳結果的評審小組,有一部分只是在回報運氣。Sakana 自身的類別選擇——Chartography、DeepSWE、Toolathon——偏向可驗證的那一端;這既是提出該主張的正確位置,也是該主張無法不付出代價就推而廣之的原因。
獨立測試人員也指出,延遲變異是協作編排的實際代價:在困難任務上,協調者會仔細斟酌,而在簡單任務上,這種斟酌純屬額外負擔。據稱,某位研究人員的著色器任務花了約三十分鐘,品質僅被評為可接受。

你實際上可以在哪裡取得它
Fugu Ultra v2 現已上線,可透過 Sakana 自家與 OpenAI 相容的 API 使用——只要把現有的客戶端指向該端點、帶上 API 金鑰,再改一行設定即可——也可透過多個第三方平台存取。OrcaRouter 並未提供 Fugu 系列模型;如果你想呼叫 Fugu Ultra v2,直接使用供應商自家的 API 是最直接的途徑。
值得留意的是 Sakana 隱含與之競爭的替代方案。讓 Fugu Ultra v2 得以運作的模型池,是由今日各自可獨立呼叫的模型所組成,而用來衡量它的對手,則是各團隊已經在跑的那些。Claude Opus 5、DeepSeek V4 Pro 和 Gemini 3.1 Pro 都在 OrcaRouter 上,以各供應商的原價、0% 加成提供,這意味著這些廠商任一家降價,宣布當天我們這邊就同步生效。如果你考慮採用協調器(orchestrator)的原因是韌性——不想讓生產環境路徑依賴單一供應商的可用性或單一供應商的政策——那麼一個能跨供應商自動容錯移轉的路由層,能在模型層面解決這個問題的一部分,而 Fugu Ultra v2 則在推理層面解決另一部分。一個 API 串接 200+ 個模型並具備容錯移轉,並不能取代受過訓練的協調器,而受過訓練的協調器也不能取代「不依賴單一供應商」。有些團隊會兩者都要。
合規的陷阱
Fugu 無法在歐盟或歐洲經濟區使用。供應商的措辭很明確:在努力符合 GDPR 與歐盟特定法規之際,尚未於 EU/EEA 提供;而在其他地區,存取可能受網路狀況或當地規則限制。若你的組織在適用範圍內有歐盟實體,這會讓 Fugu 這個選項不列入考慮,無論基準測試效能如何;這一點值得在評估之前、而不是之後就知道。

看什麼
有三件事能讓 Fugu Ultra v2 從一個有趣的宣稱,變成一個真正扛得起關鍵重任的選擇。一份獨立評估——一筆 Artificial Analysis 的收錄、一個 LMArena 的排名位置,任何背後有測試框架撐腰的東西——就能在一週內解決 Chartography 的疑問。由第三方在可驗證的程式設計基準上重現的數字,將能證實該架構所預測的系統級增益。而一份對外揭露的池,甚至只是部分揭露,也能讓買家推斷出:當他們把生產流量導向一個自己無法檢視的協調器時,究竟接受了哪些單點故障。
在那之前,誠實的立場是這樣。Fugu Ultra v2 是迄今最認真的一次嘗試,要把編排當成產品來賣,而不是研究展示;它來自一個有已發表研究成果撐腰的實驗室,其定價讓編排溢價變得明確而非隱藏。如果你的工作負載是長時程、可驗證,且限於 Sakana 能提供服務的地區,那就值得做一次範圍明確的試點,並開啟 token 計量。如果不是,那麼 Fugu Ultra v2 所被拿來衡量的那些模型,只差一次 API 呼叫,按定價表收費,還附有能證明它們實力的憑據。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
