
Fugu Ultra v2 對決 Gemini 3.1 Pro:可能已經在機器內部的對手
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 與 Gemini 3.1 Pro 的比較有一版是這樣的:無論基準測試怎麼走,Gemini 都會贏——因為它可能正在做其中一部分工作。Sakana AI 的調度系統於 2026 年 9 月 11 日發布,並未揭露它協調哪些模型;6 月版 Fugu Ultra 據報導的模型池包含 Gemini 3.1 Pro 等模型,而 2.0 版只告訴我們它移除了什麼,點名 Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 遭排除。Google 的 Gemini 3.1 Pro 是單一多模態前沿模型,具備 1M token 上下文,可處理文字、圖像、PDF、音訊與視訊,自 2026 年 5 月起正式推出,輸入每百萬 token 2.00 美元、輸出每百萬 token 12.00 美元。其中一個是你可以檢視的模型。另一個則是系統,其基準測試勝利可能經由第一個模型達成,而兩家廠商都不會告訴你究竟是否如此。
每個系統實際上是什麼
Gemini 3.1 Pro 的易讀性在前沿發布中已變得罕見。它是 Google DeepMind 的稀疏混合專家轉換器,於 2026 年 2 月 19 日首次以預覽版發布,有一個來源將正式發布日期定為 2026 年 5 月——我們自己的清單將其列在預覽模型 ID 下。它擁有 1M 符元的輸入視窗和 65K 符元的輸出上限,接受文字、圖像、PDF、音訊、視訊和程式碼,並提供三層推理控制——低、中或高——其中高是 API 預設值。Google 報告在 ARC-AGI-2 上達到 77.1%,是上一代 31.1% 的兩倍多;在 GPQA Diamond 上達到 94.3%;在 SWE-bench Verified 上達到 80.6%;在 Terminal-Bench 2.0 上達到 68.5%;在 BrowseComp 上達到 85.9%;在 Humanity's Last Exam 上不使用工具達到 44.4%,使用搜尋和程式碼執行則升至 51.4%。這些是廠商數據。其知識截止日期為 2025 年 1 月,如果你的工作依賴近期事件,這點值得注意。
Fugu Ultra v2 是一款協調器。它是一個受過訓練的模型,據稱約有 70 億個參數,會讀取請求、組建一支包含取自 Sakana TRINITY 研究的 Thinker、Worker 與 Verifier 角色的代理團隊,並在與 OpenAI 相容的端點後方綜合出答案。它本身沒有公開的模態清單——任何它看得見的東西,都是因為它資源池中的某個模型看得見。它的上下文為 100 萬個 token,並在 272K 處有一道陡峭的定價斷崖,費率在該處翻倍為輸入 10 美元、輸出 45 美元。它的輸出上限並未公開。它的資源池未揭露,其路由決策「依設計不予公開」,而對於 Ultra 層級,資源池是固定的,因此你無法排除任何供應商。
那種不對稱就是整場對決的關鍵。Gemini 3.1 Pro 是一個你可以直接購買、並能對其進行推理的元件。Fugu Ultra v2 則是一個組裝體,你看不見它的零件,而它最強的基準測試宣稱,可能有一部分是 Gemini 自己的結果與他人的結果結合而成。

兩者重疊處的比較
已發表的證據中,鮮少能將這兩個系統並列在同一列。下方 Gemini 3.1 Pro 的數字是 Google 自家的;Fugu Ultra v2 的數字則是 Sakana 自家的;若第三方彙整機構發布了共同列,該列會被標示,並附上一項但書:其僅具方向性,而非決定性。
• 多模態推理(CharXiv,同一列)—— 根據 BenchLM,Fugu Ultra v2 為 86.6%,Gemini 3.1 Pro 為 80.2%;BenchLM 將此類別標示為僅具方向性,並拒絕指名贏家
• TerminalBench 2.1 — 沒有 Fugu Ultra v2 v2.0 對比 Gemini 3.1 Pro 的數字;也沒有可比較的公開數字;6 月的 Fugu Ultra 在第三方彙整中報告 82.1%,對上 Gemini 3.1 Pro 的 70.3%
• SWE-Bench Pro — 沒有 Fugu Ultra v2 v2.0 與 Gemini 3.1 Pro 的數據,亦無可比較的已公布數字;六月的 Fugu Ultra 報告為 73.7%,而 Gemini 3.1 Pro 為 54.2%
• ARC-AGI-2 — 未提供 Fugu Ultra v2 的數據,對比 Gemini 3.1 Pro 的 77.1%(廠商自行公布)
• Humanity's Last Exam — 沒有 Fugu Ultra v2 v2.0 的數據,對比 Gemini 3.1 Pro:未使用工具時 44.4%,使用工具時 51.4%,廠商報告
• 模態涵蓋範圍 — Fugu Ultra v2 僅繼承其集區所支援的內容,未公開;反觀 Gemini 3.1 Pro 的文字、圖像、PDF、音訊、影片與程式碼則已有記錄
• 輸入/輸出價格 — Fugu Ultra v2 每 1M 為 $5.00/$30.00,超過 272K 後加倍;Gemini 3.1 Pro 則為每 1M $2.00/$12.00(200K 以內),超過後為 $4.00/$18.00,快取輸入 $0.20/$0.40
• 上下文與輸出 —— Fugu Ultra v2:1M 上下文,輸出上限未公布;對比 Gemini 3.1 Pro:1M 輸入、65K 輸出
• 權重與存取 — Fugu Ultra v2 封閉,EU/EEA 除外;對比 Gemini 3.1 Pro 為專有,但在 Google 各項服務中廣泛可用
多模態那一列是最需要謹慎處理的,因為它被引用得最多,卻也最不紮實。BenchLM 的 CharXiv 彙總結果讓 Fugu Ultra v2 以 6.4 個標準化分數領先——而同一頁也明白指出,方向性列別永遠不會產生優勝者,Gemini 在代理式、程式編寫、知識或多語言等類別中都沒有實測結果,而 Fugu 在數學或多語言方面也完全沒有。在大多數列別中只有單方被測量的類別,無法得出任何判定。如果這段比較你什麼都記不住,至少要記住這一點:單就多模態工作而言,已發表的證據並不支持任何一方的結論,而唯一存在的那一列,也明確不是已成定論的結果。
改變框架的可能性
Sakana 不會透露池中有哪些模型。這是明文記載的設計選擇,而非疏漏——常見問題說明寫得很清楚,路由資訊在設計上即不公開,也沒有任何可供檢視的機制。我們從六月世代得知的是,據報導池中成員包括 Gemini 3.1 Pro 以及其他前沿模型。2.0 版更動了池的組成,而 Sakana 僅以減法描述這項變動:Claude Fable 5、Claude Fable 5.1 與 GPT-6 Astra 已移出。發布內容中沒有任何地方表示 Gemini 仍在其中。
如果 Gemini 3.1 Pro 也在候選池裡,會衍生出三個後果,而這三個後果都是實務面的,不是哲學面的。第一,Fugu Ultra v2 的多模態效能中,有一部分其實是 Gemini 的效能,再與其他模型的效能結合而成——這意味著你除了按 token 計費的費率之外,還多付了一筆協調成本,而那個費率你原本可以直接付。第二,Fugu Ultra v2 每百萬輸出要價 30 美元,對上 Gemini 3.1 Pro 的 12 美元,這筆溢價買的是組裝,不是原始能力;如果你的任務只是一個單一的多模態問題,Gemini 回答得更便宜,而且你能清楚看到是哪個模型回答的。第三,也最有用的是,對一個協調者而言,誠實的評測標準不是「它能否勝過它的各個元件」,而是「當你單獨使用它最好的那個元件時,它能否勝過那個元件」。Sakana 的架構正是建立在一個主張之上:在可驗證的任務上,它做得到。在接受某個讀圖表基準測試的說法之前,這個主張值得你在自己的工作負載上親自驗證。
有一個版本是:答案是否定的,而協調器依然值得佔有一席之地。如果 Gemini 也在候選池裡,而 Fugu Ultra v2 在 Chartography 上以 48.3 對上 Claude Opus 5 的 27.3 的成績站得住腳,那麼 Sakana 打造出的就是一層協調層,能可靠地從同一個模型榨出比單次呼叫更多的成果。那是一個真實的產品,唯一懸而未決的問題只是:這樣的差距是否足以支撐這個價格。沒有人發表過那項實驗。

在誠實邊緣之所在
Gemini 3.1 Pro 的優勢很具體。在輸入與輸出上,它的價格約為 Fugu Ultra v2 的五分之二,而且與 Fugu 不同,它的費率不會在超過某個上下文門檻後翻倍——200K 時的調升比 272K 的斷崖溫和。它明確記載自身的模態支援,而非靠繼承而來,這意味著音訊與視訊處理是受支援的功能,而不是一種期望。它有公開的輸出上限。它可透過 Google 自家的介面取得,而且就像 Fugu Ultra v2 所比較的其他模型一樣,它可在 OrcaRouter 上呼叫——以google/gemini-3.1-pro-preview,依 Google 的定價、0% 加價,因此 Google 的價格若有變動,宣布當天就會反映在同一把金鑰上。
Fugu Ultra v2 的優勢較為狹窄,卻貨真價實。它會對同一個難題反覆出擊,並由 Verifier 角色檢查成果,因此它最有力的宣稱落在正確性可驗證的基準上——Chartography、DeepSWE、Toolathon——而非知識回憶。Sakana 發表的案例研究也指向同一方向:一個能正確開合的機械 CAD 光圈機構,而其他模型則留下縫隙與脆弱的連桿;一個純 Python 的魔術方塊求解器完成了全部 300 顆打亂的方塊,而兩個匿名的前沿基線則徹底崩潰。那些基線是匿名的、且由廠商自行挑選,因此請把它們當作例示而非證明。但這個模式在整個發布中前後一致,而且它描述的是一項單次模型呼叫所不具備的真實能力:對一個問題堅持不懈,直到答案通過檢驗。
也要把這些限制條件納入權衡。Fugu Ultra v2 並未在歐盟或歐洲經濟區販售,而 Sakana 也明確表示正朝符合 GDPR 規範努力。Gemini 3.1 Pro 則沒有這類限制,而且背後有更長久的獨立評測紀錄。

判決
對多數多模態工作來說,Gemini 3.1 Pro 都是正確選擇,而且差距毫無懸念。它的每 token 成本更低、每份文件成本更低,對音訊與影片都有文件可查,並有明確的上下文上限,不會在執行到一半時讓你的帳單翻倍,而且——這裡最重要的一點——你能看見是哪個模型回答你。如果你需要單一模型閱讀 PDF、觀看一段影片並回答問題,那就完全沒理由把它繞經一個未公開的模型池,還付出 2.5 倍的輸出價格。
Fugu Ultra v2 是針對一種特定且狹窄許多的任務型態的正確選擇:具有可檢核答案的長程任務;在這類任務中,用三種方式嘗試一個問題並驗證結果,會勝過只嘗試一次,而且品質的邊際提升值得付出多倍成本。如果你的範圍內有歐盟或歐洲經濟區(EEA)使用者,則完全不予考慮。
這場對決留下的令人不安的問題,是沒有人實際測量過的那一個。如果 Gemini 3.1 Pro 就在這個池子裡——而今天唯一誠實的答案是,Sakana 並沒有說它不在——那麼你用 Fugu Ultra v2 買到的其中一部分,就是加上一層協調層的 Gemini 3.1 Pro,而這個價格暗示那層協調層的價值大約是模型本身的兩倍半。這很可能為真。Sakana 的架構就是為了讓它成真而打造。但這是一個背後只有供應商計分板、且沒有獨立測試的假設;在有人實測之前,你能看得到的模型,才是你能夠捍衛的模型。
