
Fugu Ultra v2 對比 MiniMax M3:輸出價格貴二十五倍
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
把這兩個輸出費率並排放在一起,那個數字看起來就像是打錯了。MiniMax M3每百萬輸出 token 收費 1.20 美元。Fugu Ultra v2由 Sakana AI 於 2026 年 9 月 11 日發布,據報導價格為 30.00 美元。那是 25 倍——而在輸入方面,差距是 16.7 倍,0.30 美元對上據報導的 5.00 美元。MiniMax M3 速度也更快、原生支援影片,並以可下載的開放權重形式推出。面對那張比較表,合理的第一反應是:協調層根本不可能證明它的價格合理。更有趣的問題是,要讓它站得住腳,得有哪些前提為真。
直白地說,這個差距
• 輸入 — MiniMax M3 每 1M 為 $0.30,而 Fugu Ultra v2 據報為每 1M $5.00。MiniMax 表示 M3 的費率是永久 50% 折扣,而非設有到期日的促銷活動。
• 輸出 — MiniMax M3 每 100 萬 1.20 美元,而 Fugu Ultra v2 據報導為每 100 萬 30.00 美元。
• 快取輸入 — MiniMax M3 每 1M 為 $0.06,而 Fugu Ultra v2 據報導為每 1M $0.50。M3 的快取讀取價格僅為其自身輸入價格的五分之一,這使得在穩定提示上反覆執行的代理迴圈異常便宜。
• 輸入超過 512K — MiniMax M3 的費率倍增至 $0.60 / $2.40 / $0.12。Fugu Ultra v2 所公布的級距在超過約 272K 後調整為約 $10.00 / $45.00 / $1.00。兩者都會重新計算整筆請求的價格;M3 較晚才開始計費,且最終費率僅為其一小部分。
• 上下文——MiniMax M3 為 1,048,576 個 token,且供應商保證最少 512K。第三方清單指出 Fugu Ultra v2 的上下文為 1M;Sakana 的公告頁面則未載明任何數字。
關於 Fugu 欄位有一個警告,而且這不是小事:Sakana 並未在其自家發布頁面上公布 Fugu Ultra v2 的 token 費率。$5.00 / $0.50 / $30.00 這些數字來自第三方模型列表,在你查核即時費率表之前,應視為未經確認。相較之下,M3 欄位則有廠商提供的文件佐證。這種來源上的差異本身就是比較的一部分。

M3 原生就能做到、而編排器必須路由的事項
MiniMax M3 接受文字、圖像與影片輸入,並回傳文字。其中影片是特別值得注意的一項。該模型從第零步起便以混合模態訓練,並且建構於 MiniMax Sparse Attention 之上;廠商聲稱,此架構在 1M 上下文長度下,相較於前代可帶來最高達 9 倍的預填充(prefill)加速與 15 倍解碼(decode)加速,而每 token 的運算量約僅為其二十分之一。
在這場對決中,這點很重要,因為這是 Fugu Ultra v2 本身並未宣稱具備的能力。協調器對「處理這段影片」的回應,是把影片路由到一個能看見它的模型,這意味著一次子呼叫,也意味著更多以協調器費率計費的 token。M3 的做法則是直接讀取它。在每百萬 token 輸入 $0.30 的情況下,一小時的影片分析只是個零頭;在 $5.00 輸入加上任何路由成本的情況下,這可是一筆預算項目。
架構比較也在另一個層面上顯得極不對稱。MiniMax M3 的總參數量約為 428B,每個 token 約有 23B 處於活躍狀態——這是一種專家混合(Mixture-of-Experts)設計,其稀疏路由讓服務成本維持在低檔。Fugu Ultra v2 並未公布參數量,因為它的能力在於對其他公司模型進行調度的策略,而非 Sakana 所訓練的權重之中。這兩者之中,一個是模型。另一個是決策程序。
令人不安的含意
在為產出支付 25 倍費用之前,這件事值得好好想清楚。
MiniMax M3 是開放權重、成本低廉、快速、多模態且具備長上下文。就紙面上而言,它是一款出色的子代理。如果你要從零開始打造一層編排層——也就是 Fugu Ultra v2 這類東西——像 M3 這樣的模型幾乎就是理想的元件:便宜到足以推測性地呼叫,能力足以處理大部分拆解後的子任務,而且無需第二次跳轉就能看見圖像與影片。
Sakana 並未公布 Fugu Ultra v2 的模型池,所以我們無法斷言 M3 是否在其中。我們可以確定的是,其經濟效益只在下列兩種情況之一才說得通。要麼 Fugu Ultra v2 沒有呼叫像 M3 這樣的模型,若是如此,它就是把最便宜且堪用的容量閒置不用。要麼它確實在呼叫這些模型,若是如此,你以 $5.00 和 $30.00 計費的 token 中,有相當比例其實是上游成本為 $0.30 和 $1.20 的 M3 token,而溢價來自編排策略加上利潤。
這兩種解讀對產品來說都不致命——一個好的排程器可能價值好幾倍,而付費使用現成的方案,也讓你不必自己建置與維護。但這確實意味著,關於 Fugu Ultra v2 該問的問題並不是「它比 M3 更好嗎」,而是「這套排程值不值得那些 token」。而這個問題,只有你自己對任務的實測數據才能回答。
沒有共用的基準
與本系列中其他一些對決不同,沒有任何一項基準測試是兩家廠商都有公佈數據的。
MiniMax 為 M3 公布的評測組合涵蓋範圍廣泛,且大多在形式上可重現:SWE-bench Verified 為 80.5%,SWE-bench Pro 為 59.0%,Terminal-Bench 2.0/2.1 為 66,BrowseComp 為 83.5%,OSWorld-Verified 為 70.1%,PostTrainBench 為 37.1——排名第三,落後於 Claude Opus 4.7 的 42.4 與 GPT-5.5 的 39.3。以上全為廠商自行報告。獨立來看,Artificial Analysis 在其 v4.3 Intelligence Index 上給 MiniMax M3 評分 30,在 113 個模型中排名第 16,吞吐量為每秒 95.7 個 token,首個 token 延遲為 1.95 秒——速度很快,且是同級中服務較好的模型之一。如果你曾看到 M3 被引用為 44 或 45,那是在該指數重新表述之前。
Sakana 為 Fugu Ultra v2 提供的八項基準測試——其中包括 GDP.pdf、Chartography、SWEFish、DeepSWE 與 Toolathon,在其中五項取得最佳或並列最佳,七項進入前二——與那份清單完全沒有任何交集。其中兩項,SWEFish 與 Toolathon,是 Sakana 的內部測試。主要宣稱——Chartography 得分 48.3,對比 Opus 5 的 27.3 與 Fable 5 的 29.5,以及 DeepSWE 的 74.3——是由廠商自行報告,並於今天發布。關於 Fugu Ultra v2 的任何內容都未經獨立驗證。
所以,接下來兩週每個聚合器都會做出的比較——一張共同評分的表格——目前並不存在。關於能力,唯一誠實的說法是:MiniMax M3 有一個經過實測且獨立的定位,而 Fugu Ultra v2 則只有一個宣稱。

速度對配置
MiniMax M3 的數據眾所周知:每秒 95.7 個 token,首個 token 耗時 1.95 秒。這大約是 Kimi K3 吞吐量的兩倍半,且在所測量的前沿鄰近模型中屬於最快之列,這與一個明確為低成本長上下文服務最佳化的設計相符。
Fugu Ultra v2 並未公布任何延遲或吞吐量數據。如同定價一樣,部分原因在於結構性因素——協調器的回應時間取決於它選擇哪些模型,以及需要執行幾輪,因此單一數字會造成誤導。但這意味著採用它的實際耗時成本未經測量,也無法從外部測量。就前一代 Fugu Ultra 而言,測試者公開回報的執行時間長達近 30 分鐘;那是 2026 年 6 月的模型,而非 v2,因此不能作為新版的證據——但如果你在輸出上花費 25×,知道要等多久並非可有可無的事。
許可證,以及那段阿拉伯文所寫的內容
MiniMax M3 的權重可依 MiniMax Community License 下載,該授權是附帶商業條件的開放權重——尤其是設有營收門檻,超過門檻即需書面授權。它不是 MIT,任何告訴你它是 MIT 的頁面,都沒有讀過授權標籤。Fugu Ultra v2 沒有東西可授權,因為根本沒有東西可下載。
對 M3 而言,近期更有趣的發展是其他人拿這些權重做了什麼。2026 年 9 月 3 日,由沙烏地 PIF 支持的 AI 公司 HUMAIN 發布了一款阿拉伯語旗艦模型,是以超過一兆個阿拉伯語詞元對 MiniMax M3 進行後訓練打造而成,總參數 428B、啟用參數 23B,在七項阿拉伯語基準測試上回報等權平均 89.37%,領先 GPT-5.6 Sol 的 87.30 與 Claude Opus 5 的 87.34。這只是研究預覽版,而且那些都是 HUMAIN 自家的數字。
就各自產品的定位而言,與 Fugu Ultra v2 的對比再鮮明也不過。MiniMax M3 是其他公司用來在其上打造主權模型的基礎。Fugu Ultra v2 則是一道你只能呼喚穿越的閘門,你看不見它的組成,也握不住它的權重。兩者都是合理的定位。但它們根本完全是不同類型的東西。

打電話給他們其中一個
MiniMax M3 已在 OrcaRouter 上架,採用 Min iMax 自家的費率——每百萬輸入 token 0.30 美元、快取命中時 0.06 美元、每百萬輸出 token 1.20 美元——零加成原價轉嫁,因此若 Min iMax 調整折扣結構,這裡當天就會同步跟進,而不是等到遷移週期才更新。它與目錄中其他模型使用相同的基礎 URL,並相容於 OpenAI 介面,這表示你可以依規則將請求路由至它、把它放進容錯移轉鏈,或納入模型融合面板,都不需要另簽合約或修改程式碼。對於一個全憑價格取勝的模型而言,這一點正是關鍵:最便宜的路徑始終維持最便宜。
Fugu Ultra v2 並非由我們負責路由。它可透過 Sakana AI 自家與 OpenAI 相容的 API 取得,而該公司表示,既有的 Fugu 整合只要改一行參數就能移轉過去。兩者採用相同的請求格式,因此若要以單一旗標將它們放在一起進行評估,只需置換 base-URL 即可。
裁決
對絕大多數工作負載而言,MiniMax M3僅憑成本數字便在此比較中勝出。其輸入成本便宜 16.7×,輸出成本便宜 25×,在每一項實測指標上都更快,原生支援多模態(包括影片),以開放權重釋出,其授權條款是大多數企業永遠觸及不到上限的,並在最新的 Artificial Analysis 指數中獲獨立評分 30。它的弱點真實存在但範圍狹窄:它較為冗長,相對於其程式編寫分數,其代理類別分數表現平庸,而其廠商基準測試組合在軟體工程方面表現強勁,在長期自主性方面則較為薄弱。
唯有在以下情況下才選擇Fugu Ultra v2:你真心相信 Sakana 實際在賣的那個東西——一個巔峰能力層級,能把艱難的多步驟任務拆解到一個不受任何前沿廠商掌控的資源池上,從而在不依賴前沿模型的前提下達到前沿級別的產出——而且你有任務層級的實測數據顯示,在你的工作上,這種拆解勝過單一廉價模型。這與 MiniMax 所提供的任何東西都是截然不同的主張,而這正是 25× 存在的原因。
但要在購買前做衡量,而不是購買後。如果一個 $0.30 的模型用兩次嘗試就完成你的任務,而 Fugu Ultra v2 一次就完成,Fugu 仍然更昂貴。唯一讓 25× 划算的工作負載,是便宜模型根本無法完成的那種——而這類任務的數量遠比上市文案所暗示的少得多。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
