
Fugu Max 與 Qwen3.8-Max:相同價格、相同基準測試、一個已公布的數字
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Fugu Max 與 Qwen3.8-Max 的定價相同:每百萬個輸入 token 2.00 美元,每百萬個輸出 token 6.00 美元。Sakana AI 於 2026 年 9 月 11 日推出 Fugu Max,而 Alibaba 自 8 月初以來一直提供 Qwen3.8-Max,兩家廠商從相反方向得出完全相同的價目表——一方是為路由策略定價,另一方則是為一個 2.4 兆參數的模型定價。這場平手讓價格完全退出決策考量,這種情況乾淨俐落到不尋常。剩下的是證據,而雙方在這一點上的差異,比在其他任何地方都更大。兩家廠商的表格都列出 Terminal Bench 2.1。Alibaba 為 Qwen3.8-Max 列出 86.6。Sakana 表示 Fugu Max 在 Terminal Bench 2.1 上拿下最佳總體分數,卻完全沒有列出任何數字——無論是該項測試,還是它聲稱勝出的另外五項測試。
雙方唯一共同提及的基準
這是將整場對戰組合壓縮成單一列,因此值得精確以對。
Sakana 的發布內容列出六項基準測試,Fugu Max 在其中取得最佳整體分數:Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 與 SWEFish。其中五項是公認的公開評測,第六項 SWEFish 則是 Sakana 自家的程式設計基準。對於這六項,發布內容都未提出任何數值、差距,或可與之並列的競爭對手數字。另一項平行主張——Fugu Max 在十項基準中的七項拓展了成本效益的帕雷托前緣——同樣是在陳述圖表上的位置,而非座標軸上的某個點。
阿里巴巴為 Qwen3.8-Max 公布的數據列包括 Terminal-Bench 2.1 的 86.6、OSWorld-Verified 的 86.1、GPQA Diamond 的 92.6,以及 SWE-bench Pro 的 67.7。全部由廠商自行報告,全部是數字。因此,在兩家公司都選擇點名的唯一一項測試上,一方公布了數字,另一方則公布了排名。你無法由此斷定哪個系統更好——Sakana 的「整體最佳」可能是指 91,也可能是指 87。你能斷定的是,截至發布之時,沒有任何公開證據能回答這個問題,而提出更大宣稱的那家廠商,正是拒絕將其量化的一方。
相同的價格,相反的結構
• 輸入 — Fugu Max 每 100 萬個 token $2.00,對比 Qwen3.8-Max 每 100 萬個 token $2.00
• 輸出 — Fugu Max 每 100 萬個 token $6.00 美元 vs Qwen3.8-Max 每 100 萬個 token $6.00 美元
• 快取輸入 — Fugu Max 每 100 萬個 token 為 $0.25,相較之下 Qwen3.8-Max 每 100 萬個 token 也是 $0.25,而 Artificial Analysis 獨立測得 Qwen 方面有 88% 的快取折扣
• 長提示詞附加費 — Fugu Max 在發行公告中未說明級距,而 Qwen3.8-Max 則在整個視窗內均一計價,不收附加費
• 上下文與輸出 — Fugu Max 兩項數據皆未公布,對比 Qwen3.8-Max 則有 1M token 視窗與約 128K 輸出上限
• 輸入模態 — Fugu Max 文字,背後有該池自身的能力支援,對比 Qwen3.8-Max 的文字、圖像、影片與 PDF
• 架構 — Fugu Max 是在一個未公開模型池上訓練的協調器,並為 Max 擴展,納入開放權重與專門化模型,包括透過與 NVIDIA 合作引進的 NVIDIA Nemotron 系列;相對地,Qwen3.8-Max 則是一個稀疏混合專家模型,總參數約 2.4 兆,每個 token 約有 950 億活躍參數
• 權重 — Fugu Max 為閉源,pool 成員身分依設計不予揭露;相較之下,Qwen3.8-Max 則依自訂授權條款,公開了 Max 等級檢查點的權重
• 獨立評估——Fugu Max 並無發布任何相關結果,且任何 Fugu 模型都沒有 Artificial Analysis 頁面;相對地,Qwen3.8-Max 在 Artificial Analysis 有現行條目,並公布了速度、冗長度與每任務成本數據
其中四行在 Fugu 那一側顯示為「未公開」,而在 Qwen 那一側則列有數字。當費率完全相同時,這就是全部的比較:同樣的錢,買到的是一個你能描述的系統,以及一個你無法描述的系統。

其中一欄背後有第三方
Artificial Analysis 在重新陳述的 v4.3 Intelligence Index 上給 Qwen3.8-Max 打了 40 分,於 200 個模型中排名第 30,每項 Intelligence Index 任務的成本為 $2.67,輸出速度為每秒 37.8 個 token——慢到在速度方面於 200 個模型中僅排名第 154。同一筆紀錄顯示,在該指數中共產生了 1.8 億個輸出 token,是模型中位數 8,900 萬的兩倍以上,並享有 88% 的快取折扣。
在上述任何內容被引用之前,有兩項更正必須先說明。第一項是,廣為流傳的 Qwen3.8-Max 58 分——或 58.1,或 58.4——是來自 Artificial Analysis 於 2026 年 9 月重新校準該指數之前,而現行頁面帶有「Updated」標記,代表該分數已被重新表述。較早的報導在舊量表下也帶有不同的投入成本:每項任務 64 回合,相較於前一代 Qwen 的 14 回合,且每項 Intelligence Index 任務約 $1.14;目前頁面顯示為 $2.67。第二項則是真正的警告,而非量表造成的假象:Artificial Analysis 另行測得 Qwen3.8-Max 的幻覺率相較前一代從 23% 上升至 40%。對於一款以自主多步驟工作為賣點的模型而言,這是你必須在驗證器中編列預算的成本,而不是一則註腳。
Fugu Max 沒有任何形式的獨立條目。附在它身上的每一項數據都源自 Sakana,而且截至撰稿時,Fugu Max 或其任何同系列模型都沒有 Artificial Analysis 頁面。這並非指控——幾小時前才發布的模型不會有第三方報導——但這確實意味著這兩欄的可查證程度並不對等,而且在 Sakana 以外的人實際跑過之前,情況都會維持如此。
超支的兩種方式
這兩套系統都已讓答案的成本與 token 的成本脫鉤,而且它們的方向相反。Qwen3.8-Max 在 token 上節省,在答案上卻大方:在 Intelligence Index 上輸出 1.8 億個 token,是中位數的兩倍,每項任務 $2.67。它靠的是長時間運作,而非規模龐大,而 88% 的快取折扣是控制帳單的槓桿——長時間的代理執行若不斷重讀相同上下文,成本就維持低廉;若不斷產生新文字,則不然。
Fugu Max 以 token 計價昂貴,就答案而言則難以預測。其協調器會產生子代理,每個子代理都會撰寫推理與輸出文字,並以每百萬 token 6.00 美元計費,再加上協調器本身的綜合彙整。Sakana 承諾,多代理執行會以單一混合費率計費,該費率綁定於參與的最高階模型,且增加代理不會使帳單倍增,這消除了最壞情況下的扇出暴增,而正是這種情況讓樸素的多代理系統變得無法負擔。它並沒有消除用量。而對於用量問題,這次發布的沉默事關重大:Sakana 自家的說明指出,在任務中途切換模型可能會降低上下文快取重用,並產生額外的協調 token,同時確認該公司並未揭露 Max 的快取命中率或其每項任務的總 token 成本。
所以同樣的 $2.00 / $6.00 費率,在一邊是可預測的數字,在另一邊則是有下限的無界倍數。Qwen3.8-Max 的冗長度在你投入之前就能測量;Fugu Max 的則不然。
逃生艙測試
這正是常見的鎖定論證反轉的地方,而這也是這個配對中最有用的部分。
Sakana 為 Fugu Max 提出的理由是韌性。一個橫跨開放權重與特化模型的池子,並為 Max 加入 NVIDIA Nemotron 系列而擴充,意味著沒有任何單一前沿供應商的淘汰、重新定價或區域撤出能讓你的產品停擺——這是真正的避險,而該公司也毫不諱言地在推銷這一點。但這個避險從外部無法驗證。你看不見這個池子,無法讓任何成員加入或退出,無法自行託管其中任何部分,也完全無法在 EU/EEA 運行它。對於一個你不被允許檢視的池子所作的承諾,是比聽起來更弱的保證。
Qwen3.8-Max 則反其道而行地提出論證。它是單一供應商的模型,因而暴露於單一供應商的決策之下——但阿里巴巴以自訂授權條款,公開了 Max 等級 Qwen3.8-2.4T-A95B 檢查點的開放權重,這意味著逃生出口是真實存在的,而非只是修辭:若定價或條款改變,該模型可以從你自己的基礎設施提供服務。對於真正害怕供應商抽走腳下地毯的團隊而言,可下載的檢查點勝過對資源池的描述。
呼叫任一個
Qwen3.8-Max 已收錄在我們的目錄中,每百萬 token 輸入 $2.00、輸出 $6.00,這是 Alibaba 的定價,以 0% 加成原樣傳遞,因此供應商調價當天就會落在同一個 key 上,而不是按遷移排程才更新。它與目錄中其他模型使用相同的 base URL,並相容於 OpenAI,這表示你可以將它置於條件式路由規則、容錯移轉鏈或模型融合面板之後,無須另簽合約或修改程式碼——而且自動容錯移轉能涵蓋遭限流或效能退化的供應商路徑。過去七天內,共有 1.277 億個 token 通過閘道。
Fugu Max 並未在 OrcaRouter 上。你必須透過 Sakana 自家的 OpenAI 相容 API 及數個第三方平台才能取用它,而該公司表示,現有的 Fugu 整合只需變更一行參數即可升級。由於兩者使用相同的請求格式,要解決基準測試差距,最便宜的做法就是別再等 Sakana 公布:將兩者放在同一個旗標後方,在你自己的工作負載上執行,並計算每完成一項任務的輸出 token 數。這正是兩家供應商都未提供的量測結果。

哪一個,以及何時?
Qwen3.8-Max 是你可以稽核、計價並捨棄的選擇。在相同的費率表下,它提供 100 萬 token 的視窗,且不收長提示附加費,支援圖像、影片與 PDF 輸入,可下載 Max 級檢查點,還有一份即時且獨立的評測項目,用來衡量那些驅動你帳單的要素,以及快取輸入可省下 88%。它的代價同樣明確:速度慢,每秒 37.8 個 token,在速度上排名接近同類產品的末段;在該指數上極其冗長,達到 1.8 億 token;而且測得的幻覺率相較前一代大約翻倍——這對它主打銷售的自動化工作而言,正是嚴重的隱憂。大力善用快取折扣,並為驗證器編列預算。
Fugu Max 押注的是:協調勝過能力。如果你的工作屬於長時程且可檢核,而一個會產生驗證者的協調者能完成單一模型失敗兩次的任務,那麼用於編排的 token 就比重新嘗試更便宜,而相同的價目表根本算不上平手。你買到的是持續力——在一個你無法鎖定其資源池、其上下文視窗未公開,且其六項基準測試勝利都沒有附上數值的系統裡——來自一個選擇公布測試名稱、卻隱匿數字的供應商。
這兩款產品每 token 的價格相同。只有其中一款會告訴你,你花的錢能換到什麼。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
