「Fugu Max vs Claude Opus 5」的主視覺標題卡,副標題為「便宜四倍,還有一個沒有人公開過的數字」,三個膠囊標籤分別寫著「$6.00 vs $25.00 輸出」、「六勝,零分」、「$2.00 vs $5.00 輸入」,頁尾一行寫著「Sakana AI vs Anthropic - 2026年9月」,以及右下角的 OrcaRouter 標誌。
Guides & Insights

Fugu Max 對比 Claude Opus 5:便宜四倍,還有一個沒人發表過的數字

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Fugu Max 產出百萬個詞元的成本是 6.00 美元。Claude Opus 5 則要 25.00 美元。Sakana AI 在 2026 年 9 月 11 日推出 Fugu Max,它是一款協調器,會把每項任務導向其模型池中最精簡的模型,並以極具侵略性的價格定位,使其與 Anthrop​ic 旗艦模型之間四倍的產出成本差距,成為這次發布的頭條事實。這次發布唯一沒有的,是任何一個描述 Fugu Max 實際表現究竟有多好的數字。Sakana 表示它在六項基準測試中拿下「最佳整體分數」,並在十項中的七項拓展了成本效能前沿——這些說法講的是在圖表上的位置,而不是座標軸上的數值。相較之下,Claude Opus 5 幾乎每一項功能都有公布的分數。所以,這項比較誠實的版本並不是便宜對昂貴,而是有實測對有宣稱,而價格差距正是讓這筆取捨值得爭論的原因。

差距,以及 Sakana 選擇不做的比較

Sakana 的發布頁面透過與其他模型比較,來證明 Fugu Max 的輸出費率合理。它點名的三個模型是 Claude Sonnet 5GPT-5.6 TerraKimi K3,並聲稱 Fugu Max 的輸出定價比它們低 40% 到 60%。請注意誰沒有被提到。Claude Opus 5 不在那份清單裡,原因是算術:以 6.00 美元對上 25.00 美元,Fugu Max 不是比 Opus 5 便宜 40%,而是便宜 76%。如果點名 Opus 5,這項說法會顯得難以置信,而非具競爭力,所以比較是拿旗艦以下的層級來做。

這並非對定價的批評,其定價確實低廉。這只是對周圍那句話在做什麼的註記。Sakana 自家的說法——效能「與頂尖模型僅有咫尺之遙,成本卻低上兩到六倍」——是針對它選擇點名的那些模型所校準的。相較於 Claude Opus 5,這個倍數並非兩到六倍,在輸出方面是四倍以上;至於 Opus 5 按那句話的標準是否仍算「頂尖模型」,則未予言明,而這在一個整個賣點就是前沿領域成本效益比的發布中,是個耐人尋味的省略。

• 輸入價格 — Fugu Max 每 1M 個 token 為 $2.00,而 Claude Opus 5 每 1M 個 token 為 $5.00

• 輸出價格 — Fugu Max 每 100 萬個 token 為 $6.00,對比 Claude Opus 5 每 100 萬個 token 為 $25.00

• 快取輸入 — Fugu Max 每 100 萬個詞元 $0.25,而 Claude Opus 5 的快取則以快取輸入最高 90% 折扣的方式計價

• 基準測試分數 — Fugu Max 未公布任何數據,聲稱在六項基準測試中勝出但未提供數字,相較於 Claude Opus 5 由 Anthropic 報告的 96.0% SWE-bench Verified、79.2% SWE-bench Pro,以及在 ARC-AGI 3 上約 30.2%

• 架構 — Fugu Max 是在未公開模型池上訓練出的協調者,對比 Claude Opus 5 是可依版本鎖定的單一模型

• 背景 — Fugu Max 尚未發布,對比 Claude Opus 5 的 1M tokens,且其輸出上限為 128K

• 獨立評估——Fugu Max:任何 Fugu 模型都沒有獨立評估;相較之下,Claude Opus 已有 5 個月的第三方排行榜排名

六場勝利,未附任何比分

這六項基準測試是 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish。其中五項是可辨認的公開評測。第六項 SWEFish 是 Sakana 自家的程式設計基準測試,這意味著這六場勝利中,有一場是根據該廠商自行編寫、尚未公開的測試來評分。

對其餘五項而言,這份新聞稿聲稱 Fugu Max 取得最佳總分,卻未說明那個分數是多少,也未提及任何競爭對手拿下什麼分數。對模型發布公告來說,這是一種不尋常的形態。廠商經常誇大其詞,但他們通常會用數字來誇大,因為數字才是會廣為流傳的東西。一份宣稱拿下六項勝利、卻連一個數字都沒刊出的新聞稿,等於是要人單憑這項說法就採信。

有一種善意的解讀,值得直截了當地說清楚。Fugu Max 是一個以成本最佳化的協調者,而非能力上的推進——Sakana 將它與 Fugu Ultra v2 在同一天推出,後者是主打最大能力的版本,價格為 $5.00 輸入、$30.00 輸出。Max 的任務是在 $6.00 輸出的成本下達到可接受的品質,而對一個協調者而言,其頭條分數的意義不如每一美元所換得的分數,而這正是 Pareto 圖所呈現的。Sakana 針對這次發布的視覺溝通方式就是 Pareto 圖。如果論點是「看曲線,而非看峰值」,那麼單一的原始基準測試數字就無關緊要了。

較不寬容的解讀是,某個數字會引來該廠商寧可不要的比較。兩種解讀都與現有證據相符,而目前公開紀錄中沒有任何內容能區分兩者。可以確定的是,沒有任何獨立第三方評估過任何 Fugu 模型,而且 Artificial Analysis 也沒有 Fugu Max 或其任何同系列模型的收錄條目。該發布內容中的每一個數字,包括那六項勝利,全都源自 Sakana。

A two-column scoreboard titled "Fugu Max vs Claude Opus 5 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Benchmarks six wins with no figures, Context not published, Evidence vendor-reported only. Right column Claude Opus 5: Output price $25.00 / 1M, Input price $5.00 / 1M, Cached input up to 90% discount, Benchmarks 96.0% SWE-bench Verified, Context 1M with a 128K output ceiling, Evidence independent evals. Footer reading "Fugu Max figures vendor-reported by Sakana AI; Opus 5 rows Anthropic-reported. No independent Fugu Max evaluation exists.", with the OrcaRouter logo bottom-right.

你實際上正在進行的購買

當單一模型供應商發布基準測試結果時,你買到的是一個關於某個模型的宣稱。當協調器發布基準測試結果時,你買到的是一個關於一整個模型池的宣稱——那些模型並非該供應商所訓練,而是在一個刻意不公開其路由決策的協調者之下運行。這裡所描述的模型池,號稱是 Fugu 歷來使用過最大的,並透過與 NVIDIA 的合作,加入了開放權重與專門化模型,其中包括 NVIDIA Nemotron 系列。除此之外,其成員並未披露。

實際後果是,Fugu Max 的行為可能在版本不變的情況下改變。一家前沿實驗室的棄用決定、價格變動,或某個模型在某地區被下架,都會改變協調器所能呼叫的對象,而 Sakana 明確表示,這種韌性正是重點——它賣的是對抗供應商鎖定與 API 撤銷的保障。這是一項實實在在的好處,而且並非沒有代價。這也是為什麼 Fugu Max 的基準測試若有發布,會帶有到期日,而 Claude Opus 5 的基準測試則不會。

Claude Opus 5 的價值主張則正好相反,而且更容易定價。它是單一模型、單一版本,預設執行自適應思考,並具備從低到最高的明確努力程度旋鈕,搭載 100 萬 token 的上下文視窗與 128K 輸出上限,支援視覺、工具使用與 JSON 模式。Anthropic 回報在 SWE-bench Verified 上達到 96.0%,在 SWE-bench Pro 上達到 79.2%,而這些數字是在你呼叫端點時實際取得的模型上測得的——不是在組成可能在你腳下變動的模型集合上測得。對於在生產環境中執行並會受到審查的工作負載來說,這種穩定性是一項特色,而你支付每百萬輸出 token $19.00,正是為了擁有它。

每完成一項任務的成本,而非每詞元的成本

Fugu Max 的 $6.00 輸出費率確實很有吸引力,而測試它的方法就是別再比較詞元價格。編排器會啟動代理;每個代理都會產生推理與輸出詞元;協調者則負責撰寫綜整結果。Sakana 針對 Fugu 系列的定價常見問題承諾,將以參與其中的最高階模型為依據,採用單一混合費率,且多代理執行不會讓帳單疊加——這消除了最壞情況下會讓天真多代理系統貴到無法負擔的扇出倍增效應。但它並沒有消除用量。你需要付費的輸出詞元數量,取決於實際跑了多少個代理;而在每百萬 $6.00 的價格下,那個用量正是定價頁面無法告訴你的變數。

Claude Opus 5 的成本結構很單純:一次呼叫、一個模型、一個由你掌控的投入程度調節鈕,以及針對可以等待的工作以半價提供的批次處理。你可以在實際執行之前就預測它。在超過一萬次執行中,可預測性的價值,遠遠高於一個沒有人發表過的基準領先幅度。

這裡正是路由問題與模型問題分道揚鑣之處。Claude Opus 5 已在 OrcaRouter 上 以 Anth​ropic 的定價、0% 加價提供——供應商的費率原封不動直接傳遞,因此 Anth​ropic 的定價一有變動,同一把金鑰當天即同步生效,而當某條供應商路徑遭限流或無法使用時,會自動在各路徑間容錯切換。Fugu Max 不在我們的目錄中;它是透過 Sakana 自家的 OpenAI 相容 API 及數個第三方平台提供給你,而從較早期的 Fugu 轉換過來只需改一行參數。若你要的是 Opus 5 的證據基礎,以及一份可預測的帳單,路由器是較短的路徑。若你要的是一個能在棘手問題上自行組建分散式呼叫的系統,Fugu Max 正是做這件事的東西——而你應該在第一次請求時就開啟 token 計量來試行它。

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

在哪些情況下 Fugu Max 大概就是正確答案

給予設計應有的肯定。如果你的工作量大、可驗證,而且你在意的是完成任務的中位數成本,而非任何單次呼叫的峰值能力,那麼一個會針對每個請求挑選最便宜且足夠的模型的協調器,就能做到固定旗艦模型做不到的事。Fugu Max 正是針對這類工作負載,而 $2.00 的輸入費率與 $0.25 的快取輸入,是為這類工作負載所產生的冗長、重複上下文而定的價格。NVIDIA 的合作也比表面上看起來更重要:Nemotron 模型是開放權重的,這意味著池中最便宜的一層不會受到另一家實驗室定價決策的影響。

這並不能給你一個理由去相信 Fugu Max 會在 Claude Opus 5 已公布數據最強的那些任務上與 Claude Opus 5 匹敵——也就是儲存庫規模的軟體工程與困難推理。那些正是 Sakana 的六項基準測試看板上完全沒有提供任何數字的列。如果你的問題是「最強比便宜更重要」的那種問題,那麼 25.00 美元的輸出費率,買到的正是你真正需要的東西。

重點

Claude Opus 5 是有更充分證據支持的採購選擇,也是更安全的正式環境預設選項:已公開的廠商基準測試、可鎖定的版本、不會變動的上下文視窗、128K 的輸出上限、一個讓你只在划算時才買推理的 effort 調節旋鈕,以及背後數個月的第三方實測結果。Fugu Max 則是更有趣的押注,而且確實更便宜——輸入成本大約低 60%,輸出成本低 76%,其快取費率還比 Opus 5 的基本輸入價格低了一個數量級。

如果你執行的是可驗證、可重複、高產量的工作,而且你位於 EU/EEA 之外,那麼 Fugu Max 值得你用界定清楚的範圍試行一次——並在開始前就先設好輸出 token 上限,同時衡量「每完成一項任務的 token 數」,而不是「每次呼叫的 token 數」。如果你需要一個這季能向他人交代的正式上線決策,Claude Opus 5 依然是答案——而且在 OrcaRouter 上就找得到,以 Anth​ropic 的定價提供,供應商的費率原樣傳遞、未經任何加價。

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the anthropic/claude-opus-5 model ID, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24, the /v1/chat/completions and /v1/messages endpoints, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the 1M token context with 128K max output and text + image + file input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.