Fugu Ultra v2 對決 Gemini 3.1 Pro 的主視覺標題卡,副標題為「可能早已潛藏於機器內部的對手」,膠囊標籤寫著「$30.00 vs $12.00 輸出」、「CharXiv 86.6 vs 80.2 方向性」與「未公開集區」,頁腳一行「Sakana AI vs Google DeepMind - 2026 年 9 月」,以及右下角的 OrcaRouter 標誌。
Guides & Insights

Fugu Ultra v2 對決 Gemini 3.1 Pro:可能已經在機器內部的對手

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Fugu Ultra v2 與 Gem​ini 3.1 Pro 的比較有一版是這樣的:無論基準測試怎麼走,Gem​ini 都會贏——因為它可能正在做其中一部分工作。Sakana AI 的調度系統於 2026 年 9 月 11 日發布,並未揭露它協調哪些模型;6 月版 Fugu Ultra 據報導的模型池包含 Gem​ini 3.1 Pro 等模型,而 2.0 版只告訴我們它移除了什麼,點名 Claude Fable 5Claude Fable 5.1GPT-6 Astra 遭排除。Goo​gle 的 Gem​ini 3.1 Pro 是單一多模態前沿模型,具備 1M token 上下文,可處理文字、圖像、PDF、音訊與視訊,自 2026 年 5 月起正式推出,輸入每百萬 token 2.00 美元、輸出每百萬 token 12.00 美元。其中一個是你可以檢視的模型。另一個則是系統,其基準測試勝利可能經由第一個模型達成,而兩家廠商都不會告訴你究竟是否如此。

每個系統實際上是什麼

Gemini 3.1 Pro 的易讀性在前沿發布中已變得罕見。它是 Google DeepMind 的稀疏混合專家轉換器,於 2026 年 2 月 19 日首次以預覽版發布,有一個來源將正式發布日期定為 2026 年 5 月——我們自己的清單將其列在預覽模型 ID 下。它擁有 1M 符元的輸入視窗和 65K 符元的輸出上限,接受文字、圖像、PDF、音訊、視訊和程式碼,並提供三層推理控制——低、中或高——其中高是 API 預設值。Google 報告在 ARC-AGI-2 上達到 77.1%,是上一代 31.1% 的兩倍多;在 GPQA Diamond 上達到 94.3%;在 SWE-bench Verified 上達到 80.6%;在 Terminal-Bench 2.0 上達到 68.5%;在 BrowseComp 上達到 85.9%;在 Humanity's Last Exam 上不使用工具達到 44.4%,使用搜尋和程式碼執行則升至 51.4%。這些是廠商數據。其知識截止日期為 2025 年 1 月,如果你的工作依賴近期事件,這點值得注意。

Fugu Ultra v2 是一款協調器。它是一個受過訓練的模型,據稱約有 70 億個參數,會讀取請求、組建一支包含取自 Sakana TRINITY 研究的 Thinker、Worker 與 Verifier 角色的代理團隊,並在與 OpenAI 相容的端點後方綜合出答案。它本身沒有公開的模態清單——任何它看得見的東西,都是因為它資源池中的某個模型看得見。它的上下文為 100 萬個 token,並在 272K 處有一道陡峭的定價斷崖,費率在該處翻倍為輸入 10 美元、輸出 45 美元。它的輸出上限並未公開。它的資源池未揭露,其路由決策「依設計不予公開」,而對於 Ultra 層級,資源池是固定的,因此你無法排除任何供應商。

那種不對稱就是整場對決的關鍵。Gemini 3.1 Pro 是一個你可以直接購買、並能對其進行推理的元件。Fugu Ultra v2 則是一個組裝體,你看不見它的零件,而它最強的基準測試宣稱,可能有一部分是 Gemini 自己的結果與他人的結果結合而成。

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

兩者重疊處的比較

已發表的證據中,鮮少能將這兩個系統並列在同一列。下方 Gemini 3.1 Pro 的數字是 Google 自家的;Fugu Ultra v2 的數字則是 Sakana 自家的;若第三方彙整機構發布了共同列,該列會被標示,並附上一項但書:其僅具方向性,而非決定性。

• 多模態推理(CharXiv,同一列)—— 根據 BenchLM,Fugu Ultra v2 為 86.6%,Gemini 3.1 Pro 為 80.2%;BenchLM 將此類別標示為僅具方向性,並拒絕指名贏家

• TerminalBench 2.1 — 沒有 Fugu Ultra v2 v2.0 對比 Gemini 3.1 Pro 的數字;也沒有可比較的公開數字;6 月的 Fugu Ultra 在第三方彙整中報告 82.1%,對上 Gemini 3.1 Pro 的 70.3%

• SWE-Bench Pro — 沒有 Fugu Ultra v2 v2.0 與 Gemini 3.1 Pro 的數據,亦無可比較的已公布數字;六月的 Fugu Ultra 報告為 73.7%,而 Gemini 3.1 Pro 為 54.2%

• ARC-AGI-2 — 未提供 Fugu Ultra v2 的數據,對比 Gem​ini 3.1 Pro 的 77.1%(廠商自行公布)

• Humanity's Last Exam — 沒有 Fugu Ultra v2 v2.0 的數據,對比 Gem​ini 3.1 Pro:未使用工具時 44.4%,使用工具時 51.4%,廠商報告

• 模態涵蓋範圍 — Fugu Ultra v2 僅繼承其集區所支援的內容,未公開;反觀 Gemini 3.1 Pro 的文字、圖像、PDF、音訊、影片與程式碼則已有記錄

• 輸入/輸出價格 — Fugu Ultra v2 每 1M 為 $5.00/$30.00,超過 272K 後加倍;Gemini 3.1 Pro 則為每 1M $2.00/$12.00(200K 以內),超過後為 $4.00/$18.00,快取輸入 $0.20/$0.40

• 上下文與輸出 —— Fugu Ultra v2:1M 上下文,輸出上限未公布;對比 Gem​ini 3.1 Pro:1M 輸入、65K 輸出

• 權重與存取 — Fugu Ultra v2 封閉,EU/EEA 除外;對比 Gem​ini 3.1 Pro 為專有,但在 Goo​gle 各項服務中廣泛可用

多模態那一列是最需要謹慎處理的,因為它被引用得最多,卻也最不紮實。BenchLM 的 CharXiv 彙總結果讓 Fugu Ultra v2 以 6.4 個標準化分數領先——而同一頁也明白指出,方向性列別永遠不會產生優勝者,Gemini 在代理式、程式編寫、知識或多語言等類別中都沒有實測結果,而 Fugu 在數學或多語言方面也完全沒有。在大多數列別中只有單方被測量的類別,無法得出任何判定。如果這段比較你什麼都記不住,至少要記住這一點:單就多模態工作而言,已發表的證據並不支持任何一方的結論,而唯一存在的那一列,也明確不是已成定論的結果。

改變框架的可能性

Sakana 不會透露池中有哪些模型。這是明文記載的設計選擇,而非疏漏——常見問題說明寫得很清楚,路由資訊在設計上即不公開,也沒有任何可供檢視的機制。我們從六月世代得知的是,據報導池中成員包括 Gemini 3.1 Pro 以及其他前沿模型。2.0 版更動了池的組成,而 Sakana 僅以減法描述這項變動:Claude Fable 5、Claude Fable 5.1 與 GPT-6 Astra 已移出。發布內容中沒有任何地方表示 Gemini 仍在其中。

如果 Gem​ini 3.1 Pro 也在候選池裡,會衍生出三個後果,而這三個後果都是實務面的,不是哲學面的。第一,Fugu Ultra v2 的多模態效能中,有一部分其實是 Gem​ini 的效能,再與其他模型的效能結合而成——這意味著你除了按 token 計費的費率之外,還多付了一筆協調成本,而那個費率你原本可以直接付。第二,Fugu Ultra v2 每百萬輸出要價 30 美元,對上 Gem​ini 3.1 Pro 的 12 美元,這筆溢價買的是組裝,不是原始能力;如果你的任務只是一個單一的多模態問題,Gem​ini 回答得更便宜,而且你能清楚看到是哪個模型回答的。第三,也最有用的是,對一個協調者而言,誠實的評測標準不是「它能否勝過它的各個元件」,而是「當你單獨使用它最好的那個元件時,它能否勝過那個元件」。Sakana 的架構正是建立在一個主張之上:在可驗證的任務上,它做得到。在接受某個讀圖表基準測試的說法之前,這個主張值得你在自己的工作負載上親自驗證。

有一個版本是:答案是否定的,而協調器依然值得佔有一席之地。如果 Gem​ini 也在候選池裡,而 Fugu Ultra v2 在 Chartography 上以 48.3 對上 Claude Opus 5 的 27.3 的成績站得住腳,那麼 Sakana 打造出的就是一層協調層,能可靠地從同一個模型榨出比單次呼叫更多的成果。那是一個真實的產品,唯一懸而未決的問題只是:這樣的差距是否足以支撐這個價格。沒有人發表過那項實驗。

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

在誠實邊緣之所在

Gem​ini 3.1 Pro 的優勢很具體。在輸入與輸出上,它的價格約為 Fugu Ultra v2 的五分之二,而且與 Fugu 不同,它的費率不會在超過某個上下文門檻後翻倍——200K 時的調升比 272K 的斷崖溫和。它明確記載自身的模態支援,而非靠繼承而來,這意味著音訊與視訊處理是受支援的功能,而不是一種期望。它有公開的輸出上限。它可透過 Goo​gle 自家的介面取得,而且就像 Fugu Ultra v2 所比較的其他模型一樣,它可在 OrcaRouter 上呼叫——以google/gemini-3.1-pro-preview依 Goo​gle 的定價、0% 加價,因此 Goo​gle 的價格若有變動,宣布當天就會反映在同一把金鑰上。

Fugu Ultra v2 的優勢較為狹窄,卻貨真價實。它會對同一個難題反覆出擊,並由 Verifier 角色檢查成果,因此它最有力的宣稱落在正確性可驗證的基準上——Chartography、DeepSWE、Toolathon——而非知識回憶。Sakana 發表的案例研究也指向同一方向:一個能正確開合的機械 CAD 光圈機構,而其他模型則留下縫隙與脆弱的連桿;一個純 Python 的魔術方塊求解器完成了全部 300 顆打亂的方塊,而兩個匿名的前沿基線則徹底崩潰。那些基線是匿名的、且由廠商自行挑選,因此請把它們當作例示而非證明。但這個模式在整個發布中前後一致,而且它描述的是一項單次模型呼叫所不具備的真實能力:對一個問題堅持不懈,直到答案通過檢驗。

也要把這些限制條件納入權衡。Fugu Ultra v2 並未在歐盟或歐洲經濟區販售,而 Sakana 也明確表示正朝符合 GDPR 規範努力。Gemini 3.1 Pro 則沒有這類限制,而且背後有更長久的獨立評測紀錄。

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

判決

對多數多模態工作來說,Gemini 3.1 Pro 都是正確選擇,而且差距毫無懸念。它的每 token 成本更低、每份文件成本更低,對音訊與影片都有文件可查,並有明確的上下文上限,不會在執行到一半時讓你的帳單翻倍,而且——這裡最重要的一點——你能看見是哪個模型回答你。如果你需要單一模型閱讀 PDF、觀看一段影片並回答問題,那就完全沒理由把它繞經一個未公開的模型池,還付出 2.5 倍的輸出價格。

Fugu Ultra v2 是針對一種特定且狹窄許多的任務型態的正確選擇:具有可檢核答案的長程任務;在這類任務中,用三種方式嘗試一個問題並驗證結果,會勝過只嘗試一次,而且品質的邊際提升值得付出多倍成本。如果你的範圍內有歐盟或歐洲經濟區(EEA)使用者,則完全不予考慮。

這場對決留下的令人不安的問題,是沒有人實際測量過的那一個。如果 Gem​ini 3.1 Pro 就在這個池子裡——而今天唯一誠實的答案是,Sakana 並沒有說它不在——那麼你用 Fugu Ultra v2 買到的其中一部分,就是加上一層協調層的 Gem​ini 3.1 Pro,而這個價格暗示那層協調層的價值大約是模型本身的兩倍半。這很可能為真。Sakana 的架構就是為了讓它成真而打造。但這是一個背後只有供應商計分板、且沒有獨立測試的假設;在有人實測之前,你能看得到的模型,才是你能夠捍衛的模型。