
Fugu Max 對比 GPT-5.6 Sol:這項定價主張是針對該系列的中階。
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Fugu Max 的定價理由點名了一個 GPT-5.6 模型,而那不是旗艦。Sakana AI 於 2026 年 9 月 11 日發布 Fugu Max,價格為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元,並表示其輸出定價比 Claude Sonnet 5、GPT-5.6 Terra 與 Kimi K3 低 40% 到 60%。GPT-5.6 Sol——同一 OpenAI 家族的旗艦,列價為每百萬輸入 4.00 美元、輸出 20.00 美元——並沒有出現在那句話裡。這項省略不是疏忽;而是算術。Sol 的輸出費率是 Fugu Max 的三倍以上,這個差距會讓周遭「以低兩到六倍的成本,逼近精英模型」的框架,讀起來完全是另一種主張。因此,這場對決值得按 Sol 的條件來進行,而不是按廠商所選的條件。
核對該主張與它所指向的家族
Sakana 的 40% 到 60% 數字是可驗證的,因為它點名的模型有已公開的費率。GPT-5.6 Terra 的定價為每百萬個 token 輸入 $2.00、輸出 $12.00。Fugu Max 的定價為每百萬個 token 輸入 $2.00、輸出 $6.00。進行這項比較後,會有兩件事浮現。在輸出方面,$6.00 相較於 $12.00 正好是砍了 50%——恰好落在所述 40 到 60 區間的正中央,這顯示該區間是圍繞這項比較劃出來的,而不是從中發現的。在輸入方面,兩者費率完全相同,連一分都不差。
那是一項精心建構的說法,而好好建構它,正是發布頁面的用途。但它是對準 GPT-5.6 階梯的中段來校準的。Terra 是三模型家族中均衡的一層——Sol 在其上,負責艱難複雜的工作;Luna 在其下,主打速度與成本。命名為 Terra 會把「精英模型」的基準放在中間那一階,並讓 Fugu Max 能誠實地宣稱其輸出價格只有一半。若命名為 Sol,就得用上另一種說法,因為誠實的版本是:Fugu Max 的輸出成本比 Sol 低 70%,輸入成本低 50%——這個差距大得多,會引出顯而易見的後續問題:為了它,你放棄了什麼能力。
• 輸入價格 — Fugu Max 每 100 萬個 token 為 $2.00,相較之下 GPT-5.6 Sol 每 100 萬個 token 為 $4.00
• 輸出價格 — Fugu Max 每 100 萬個 token 為 $6.00,而 GPT-5.6 Sol 每 100 萬個 token 為 $20.00
• 快取輸入 — Fugu Max 每 100 萬個 token $0.25,相較於 GPT-5.6 Sol 的快取以基本輸入費率折扣計價
• 背景 — Fugu Max 未發佈 vs GPT-5.6 Sol 1M tokens
• 輸出上限 — Fugu Max 未公佈 vs GPT-5.6 Sol 128K tokens
• 輸入模態 — Fugu Max 未公布,對比 GPT-5.6 Sol 的文字、圖像與檔案
• 能力標籤 — Fugu Max 未公布任何,對比 GPT-5.6 Sol 的視覺、工具使用、JSON 模式、推理
• 端點 — Fugu Max 單一 OpenAI 相容介面 vs GPT-5.6 Sol 對話補全與 responses API
• 基準測試數據 — Fugu Max 宣稱拿下六項勝利卻未提供任何分數,對比 GPT-5.6 Sol 所公布的廠商數據,包括 Terminal-Bench 2.0 達 91.9%、SWE-bench Pro 達 64.6%
為什麼中間那一階才是適合命名的正確一階
Sakana 的選擇有一個站得住腳的版本,而這點值得在批評之前先說清楚。一個會把每項任務路由到最精簡且足以勝任的模型的編排器,並不是在旗艦工作上與旗艦模型競爭。它是在中階工作上與中階模型競爭,並提議以更低成本完成其中一部分。如果它的說法是「你的多數流量不需要 Sol」,那麼 Terra 就是正確的比較基準,因為當大多數團隊不想支付 Sol 的價格時,實際上會選擇的就是 Terra。以顧客原本會購買的層級來衡量,比以市面上最昂貴的模型來衡量更誠實。
困難在於,同一個句子還聲稱效能「與頂尖模型相差無幾」。這段宣傳的兩個部分彼此拉扯、方向相反。如果 Fugu Max 是 Terra 的替代品,那麼「頂尖模型」的框架就在承擔它無法支撐的行銷任務,因為 Terra 明確不是被定位為頂尖——而是被定位為「夠好」的層級。如果 Fugu Max 真的與 Sol 相差無幾,那麼價格比較就應該以 Sol 為基準,因為在那裡差距最大、也最討喜。一篇發布內容若在同一段落中同時做出大膽的能力宣稱與保守的價格比較,就是兩面都想討好,而讀者無從分辨哪一半才是真正撐起論點的關鍵。

六項基準,沒有數字,還有一個應該引發疑問的名字
推銷內容中關於能力的那一半,建立在一份清單上。Fugu Max 在 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish 上「取得最佳總體分數」。這些項目全都沒有列出分數。SWEFish 是 Sakana 自家的內部程式設計基準測試,這意味著六項勝利中,有一項是根據廠商自行編寫且尚未發布的測試來計分。
GPT-5.6 Sol 公布了數據。在第三方比較資料中,Sol 在 Terminal-Bench 2.0 上被列為 91.9%,在 SWE-bench Pro 上則為 64.6%。請注意終端機測試基準上的版本不一致:Sol 公布的分數是針對 Terminal-Bench 2.0,而 Sakana 聲稱在 2.1 上取得勝利,那是不同的評測,不能拿來與之相提並論。這一點值得特別標明,因為這兩項說法在標題上看起來彼此相近,但事實上並無可比性。
這場對決的相關比較,應該是 Sol 對上 Fugu 模型在同一套評估上的表現。第三方比較頁面確實有 GPT-5.6 Sol 對上基礎版 Sakana Fugu 世代的資料 —— Sol 在 Terminal-Bench 2.0 以 91.9% 對 80.2% 領先,在 SWE-bench Pro 則以 64.6% 對 59% 領先 —— 但那些是較早世代的數字,不是 Fugu Max,而且同一批來源也明確拒絕指認整體贏家,因為共同基準的涵蓋範圍實在太單薄。目前沒有任何已發表的比較,能對 Fugu Max 與 GPT-5.6 Sol 做出任何形式的對照。任何人宣稱有,都是在做外推。
沒有任何獨立第三方評估過 Fugu Max,Artificial Analysis 也沒有為它或任何 Fugu 模型建立收錄條目。該發布內容中的每一個數字,包括那六項勝績,全都出自廠商本身。相較之下,Sol 自 2026 年 7 月 9 日起已全面開放使用,並出現在第三方排行榜上——這是 Fugu Max 尚未有機會獲得的外部檢視程度。
你實際上在每一方買到的是什麼
設定 GPT-5.6 Sol 是可預期的已知事項。它具備 100 萬個 token 的上下文視窗、128K 的輸出上限,並將文字、圖像與檔案輸入、視覺、工具使用、JSON 模式與推理列為已記載的能力,還有兩個端點——chat completions 與 responses API——因此既有的整合有明確的去處。在我們所服務的流量中,它顯示出 6.68 秒的 p50 首次回應時間(time-to-first-token),這比我們產品目錄中最快的模型來得慢,在你據此打造互動式產品之前值得先了解這點。
設定 Fugu Max 更接近於購買一項服務等級,而非購買一個模型。你會得到一個與 OpenAI 相容的端點、只要改一行參數就能從較早的 Fugu 移轉過來,以及一個負責決定要呼叫哪些模型的協調器。從發布頁面上,你得不到的是上下文視窗、輸出上限、模態清單、延遲數據或基準測試分數。協調器的路由決策依設計並未對外公開。此次發布擴充了模型池,納入開放權重與特化模型,其中 NVIDIA Nemotron 系列是透過與 NVIDIA 的合作而具名,除此之外則未對外披露。
Sakana 對這種不透明做法所提出的理由站得住腳——一個可替換、不綁定特定供應商的資源池,正是對抗下架停用、價格變動與區域退出的防護。這確實是一種實質的避險,而 $0.25 的快取輸入費率也顯示,Sakana 預期的是長上下文、高重複性的工作負載,也就是這種避險最要緊的場景。但這也意味著,你所購買的規格,是關於供應鏈的一項承諾,而非對某個產品的描述。

如何執行測試
解決這件事的正確方法,不是去讀任何一家廠商的頁面。從你自己的流量取樣——幾百個真實請求,最好包含你團隊目前會往上呈報的那些——然後在開啟 token 計量的情況下,把這些請求送到兩個端點上跑。成本要按每完成一項任務的 token 數來計算,而不是按每次呼叫的 token 數;開始前先設定輸出預算,這樣一來扇出才不會讓你措手不及;品質則以第二位人員是否也認為該答案可接受來衡量。這個實驗一週內就能回答這個問題,而且花費不多。
問題的癥結在於,Fugu Max 並不在 OrcaRouter 上。你得透過 Sakana 自家的 OpenAI 相容 API 以及幾個第三方平台才能用到它,這表示要再做一次整合、再管一組憑證,還要再多一張帳單。GPT-5.6 Sol 已收錄在我們的型錄中,採 OpenAI 的定價、0% 加成——供應商的費率是原樣轉給您,而非加價,因此 OpenAI 一調整定價,您現有的金鑰當天即同步生效;當某條供應路徑被限流或無法使用時,還會自動切換到其他路徑。它與其他 200 多個模型共用同一把金鑰,所以試用結束後,您無須更動整合,只要改一個字串即可。
底線
GPT-5.6 Sol 在 Sakana 拒絕做出的那場比較中勝出。它的輸入成本是兩倍,輸出成本則是三倍以上,換來的是公開的上下文視窗、128K 輸出上限、有文件記載的多模態輸入、具名能力標籤、兩個端點,以及第三方已有數月時間檢視的供應商基準測試。如果你的工作正是 Sol 所打造的那類——深度多步驟推理、大規模軟體工程、長時程代理任務——那麼價差就是購買你能明確規範之物的代價。
Fugu Max 贏得的是一個更狹窄但確實有意思的賭注,而且它便宜得多:輸出價格比 GPT-5.6 Terra 低 50%,比 Sol 低 70%,並在兩份價目表中都擁有最低的快取費率。如果你的流量屬於高量、純文字、可驗證,且大多不需要旗艦級推理,那麼一套能將請求路由到最精簡且足夠的模型的協調器就是合理一致的設計,而 6.00 美元的輸出費率正是價值所在。按照發佈時自身的說法照單全收,並把它當作 Terra 的替代品來試行,而非 Sol 的替代品——而如果你想要的是旗艦模型,且供應商定價原封不動地轉嫁,GPT-5.6 Sol 在 OrcaRouter 上只差一組金鑰。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
