
Fugu Max 對上 Kimi K3:Sakana 選了這把尺,那我們就來讀讀看
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Sakana AI 為 Fugu Max 發布的說明中,正好點名了三款模型來佐證其定價,而 Moonshot AI 的 Kimi K3 正是其中之一。其說法是 Fugu Max 的輸出費率比這三者低 40% 到 60%,這使得 Kimi K3——而非 Grok 4.6,也非 Qwen3.8-Max——成為 Sakana 自己挑選的價值標竿。對供應商而言,這是異常大方的做法:它遞給你一把尺,還告訴你該握住哪裡。所以本頁就做最顯而易見的事:照著握。Fugu Max 於 2026 年 9 月 11 日推出,每百萬輸入 token 為 $2.00,每百萬輸出 token 為 $6.00。Kimi K3 的定價則是 $3.00 與 $15.00。輸出低 60% 的說法在算術上正確。這句話沒提到的是:被它壓價的那款模型,公布了完整的獨立實測結果紀錄,而壓價的那款,什麼都沒公布。
檢視那句 40% 到 60% 的話
• 輸入 — Fugu Max 每 100 萬個 token 為 $2.00,相較於 Kimi K3 每 100 萬個 token 為 $3.00,節省 33%,而非該發布稿所主打的 40% 至 60%
• 輸出 — Fugu Max 每 100 萬個 token 為 $6.00,而 Kimi K3 每 100 萬個 token 為 $15.00,低了 60 個百分點,為 Sakana 所述範圍的上限
• 快取輸入 — Fugu Max 每 1M 個 token 為 $0.25,相較於 Kimi K3 每 1M 個 token 為 $0.30,這個差距小到快取密集的迴圈不會察覺。
• 上下文視窗 — Fugu Max 在發布資訊中未公布數字,對比 Kimi K3 的 1,048,576 個 token
• 長提示詞重新定價 — Fugu Max 未標示分層,對比 Kimi K3 在整個視窗內均一價,任何長度皆不收取附加費
• 部署 — Fugu Max 僅提供供應商 API,集區成員身分未披露;相對地,Kimi K3 依 Kimi K3 授權條款提供可下載權重
• 獨立評估——Fugu Max:無,且沒有任何 Fugu 模型有 Artificial Analysis 頁面;相較之下,Kimi K3 的 Artificial Analysis Intelligence Index 為 44,並在 Vals AI 的 SWE-bench Verified 上取得標準化 93.40%
注意第一列的樣貌。那個主打範圍,40 到 60%,是三位具名競爭對手之間的範圍,而產生 60 這個數字的是 Kimi K3。單看輸入部分,比較結果是 33%,這仍然是實實在在的節省,但就是另一種說法了。這不是對定價的批評——對於一個宣稱成果接近前沿水準的系統來說,$2.00 和 $6.00 確實是偏低的數字。這只是提醒:在這次發布稿中,真正發揮說服力的是哪個數字,以及那一段文字是如何圍繞著它鋪排的。
Kimi K3 已在我們的目錄中,採用 Moonshot 自家的價格——每百萬輸入 3.00 美元、快取命中 0.30 美元、每百萬輸出 15.00 美元——以 0% 加價原樣轉嫁,因此若 Moonshot 調整定價新價格當天就在同一把金鑰上生效,而不是等到遷移週期才更新。這一點在這裡比平時更為重要,因為上游降價正是侵蝕或擴大整場對決所仰賴那 60% 差距的關鍵所在。
Yardstick 發布的內容
Kimi K3 的成績紀錄恰恰相反,一點也不稀疏。Moonshot 自家的模型卡報告指出,Terminal-Bench 2.1 為 88.3、GPQA Diamond 為 93.5、HLE-Full 為 43.5,搭配工具後升至 56.0、SWE-Marathon 為 42.0、OSWorld-Verified 為 84.8、MCPMark-Verified 為 94.5,而 DeepSWE 為 67.5。這些全都是廠商自行報告的數據,而且數量還真不少。
獨立層級同樣存在,而這正是這項比較中關鍵的部分。Artificial Analysis 在 v4.3 Intelligence Index 上給 Kimi K3 打了 44 分——在開放權重模型中排名第二,僅次於 GLM-5.3 的 45 分——實測吞吐量為每秒 37.9 個輸出 token,首 token 時間為 3.80 秒。Vals AI 的標準化代理測試框架讓它在 SWE-bench Verified 上達到 93.40%,落後於 Claude Opus 5 和 DeepSeek V4 Pro,但差距不大。它也在 Frontend Code Arena 以 1679 Elo 領先,超前 Claude Fable 5 的 1631 和 GPT-5.6 Sol 的 1618。一點提醒:如果你看到 Kimi K3 在 Intelligence Index 上被引用為 57 或 60,那些是 Artificial Analysis 在 2026 年 9 月重新校準量表之前的重述前數字,不應與當前數字並列引用。
此外還有一個使用量訊號,而且它來自我們自家的閘道,而不是任何人的行銷宣傳:Kimi K3 在過去七天內透過 OrcaRouter 處理了約 32.7 億個 token,是這項比較中流量最重的模型。那不是品質衡量指標。它是一個很大的樣本,顯示當選擇的唯一成本就是 token 價格時,開發者會伸手取用什麼;而這也說明,固定 1M 視窗與開放權重,已經在真實的長時程工作中贏得相當可觀的份額。

上面沒有數字的計分板
Sakana 指出 Fugu Max 在六項基準測試中拿下最佳總分:Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 與 SWEFish。它還表示,Max 在十項基準測試中的七項擴展了成本效能帕雷托前沿。這兩者都是關於圖表上排名的陳述。兩者都沒有附上數值、領先幅度,或在一旁標出競爭對手的數字。
兩份榜單幾乎毫無重疊,這正是實務上的問題所在。Kimi K3 回報 Terminal-Bench 2.1 成績為 88.3;Sakana 則表示 Fugu Max 在 Terminal Bench 2.1 拿下最佳整體成績,卻未公布任何可供與其比較的數字。那一列最能清楚說明整場對決:兩家廠商都點名同一項測試,一家印出數字,另一家則印出「最佳」這個詞。在 Sakana 公布該數字之前,沒有任何已公布的證據能回答 Fugu Max 是否在 Sakana 選擇用來打頭陣的基準測試上擊敗 Kimi K3。
有一種對這次發布的合理解讀值得一說。Fugu Max 是成本層級——與 Fugu Ultra v2 同日推出,後者是以每百萬輸入 $5.00、輸出 $30.00 的能力推進——而它的論據繪於一張 Pareto 圖上,其中主張的是每美元得分,而非得分本身。按這種框架,單一基準數字會是較不誠實的統計量。問題在於,這次發布也省略了分母:Sakana 自家的說明承認,任務中途切換模型可能降低上下文快取重用,並產生額外的編排權杖,且確認公司未披露 Max 的快取命中率或其每項任務的總權杖成本。因此,唯一能解決成本層級論據的測量,正是未提供的那一項。
你能握在手中的重量,或一個你看不見的池子
這就是兩款產品完全無法相提並論的地方。
Kimi K3 提供可下載的權重,這是一條真正的逃生通道:若定價或條款改變,模型仍可在你自己的基礎設施上提供服務。其授權範圍比「開放權重」通常所暗示的更狹窄。它採用的是 Kimi K3 授權,而非經 OSI 認可的授權條款,且常被重複引述為「修改版 MIT」的說法仍有爭議。條款要求:若模型即服務(model-as-a-service)業務在任何連續十二個月內營收超過 2,000 萬美元,須與 Moonshot 另行簽訂協議;此外,月活躍用戶超過 1 億或月營收超過 2,000 萬美元的產品須標示出處,內部使用則可豁免。而實際規模也確實可觀:檢查點約 1.5 TB,Moonshot 建議使用 64 個以上的加速器,因此自架屬於推論叢集層級的決策,而不是筆電能處理的事。
Fugu Max 完全不提供這些——沒有權重、沒有可檢視的模型池、沒有自行架設的選項——而作為交換,它不施加任何授權條件,因為根本沒有東西需要授權。Sakana 宣稱的好處恰恰是控制的反面:一個橫跨開放權重與特化模型的模型池,並為 Max 擴充納入 NVIDIA Nemotron 系列,意味著沒有任何單一上游供應商的淘汰或重新定價能讓你的產品停擺。這是貨真價實的避險。但它同樣無法從外部驗證,因為成員名單刻意不公開,而這也意味著 Fugu Max 的結果帶有有效期限,Kimi K3 的結果則沒有。
開放權重與未公開的集區,是對同一種恐懼的兩種不同答案。前者說你可以離開,後者說沒有什麼可離開的。
在平窗決定一切的地方
Kimi K3 的 1,048,576 token 上下文是單一費率的——沒有長上下文級距,無論多長都不加收費用。Fugu Max 的發布資訊完全未載明視窗大小,因此既無從比較,也無從據以規劃。對於這兩款產品所鎖定的長時程代理式編碼而言,工作階段多半時間都深處於上下文之中,這種不對稱比費率表本身更為要緊。
速度是同一問題的鏡像。Kimi K3 的每秒 37.9 個 token、3.80 秒的首個 token 時間是實測數據,而它很慢——對一個圍繞長迴圈打造的模型而言,這確實是一項限制,且 Artificial Analysis 指出它明顯過於冗長。Sakana 並未公布 Fugu Max 的延遲或吞吐量數據,而對一個協調器來說,這可以說是誠實而非迴避:回應時間取決於它挑選哪些模型,以及它會執行多少輪。但這意味著,若不自行測量,你無法推算切換的實際耗時。至於較早的 Fugu Ultra,使用者曾公開回報執行時間拉長到接近 30 分鐘。那是 2026 年 6 月的模型,並非關於 Max 的證據,但當你進行基準測試時,那是要超越的數字。

以 Sakana 自己的話來說,這個判決
Sakana 挑選 Kimi K3 作為 Fugu Max 價格低於其定價的三個模型之一,而在輸出費率方面,這項說法站得住腳:$6.00 對上 $15.00 低了 60%,正好落在所述範圍的上限。若照發布內容所說,Fugu Max 是更便宜的產品。
現在套用那份發布說明所迴避的衡量標準。Kimi K3 的輸入費用高出 33%,輸出費用高出 150%——而花這些錢,你換來的是 1M token 的視窗、沒有重新定價的斷崖、在營收門檻授權條款下可下載的檢查點、獨立 Intelligence Index 排名 44、標準化的 SWE-bench Verified 分數 93.40%、Frontend Code Arena 第一名,以及這場比較中任何模型裡最龐大的實際流量。Fugu Max 則在 token 的兩端都給你更低的費率、六項未量化的基準測試勝利、僅有 K3 一半的快取費率且未公布命中率,以及一個你無法檢視的資源池。
誠實的結論是:Sakana 選了一個在價格上對自己有利的衡量標準,卻在能力方面沒給你任何可供檢驗的東西。如果你的工作負載量很大,而且你的任務是那種協調器能可靠拆解的類型,那麼費率差異就是實質的金錢,Fugu Max 值得進行一場範圍明確的試點,並從第一個請求開始就開啟 token 計量。如果你需要的是這一季能站得住腳的正式環境決策——一個你能據以規劃的窗口、一個你能指得出來的分數,以及一個就算供應商消失了你仍能繼續運行的模型——那麼答案就是 Kimi K3,而且它在 OrcaRouter 上是以 Moonshot 的定價提供,供應商的費率原封不動地傳遞。

