Fugu Ultra v2 對上 Kimi K3 對戰組合的主視覺卡片,展示一個將詞元路由至專家的模型,旁邊是將任務路由至模型的協調器。
Guides & Insights

Fugu Ultra v2 對決 Kimi K3:兩款路由器,兩種高度

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩個系統都是路由器,而這正是大多數報導首先忽略的一點。Kimi K3是一個擁有 2.8 兆參數的混合專家(Mixture-of-Experts)模型,每個 token 大約啟用 1,040 億個參數——這意味著它每生成一個 token,就會做一次路由決策,從 896 個專家中選出 16 個來執行工作。Fugu Ultra v2由 Sakana AI 於 2026 年 9 月 11 日發表,則是層級完全不同的另一種路由器:它接收進來的任務,將其拆解,再把各個部分分派到一群各自獨立的模型上。一個是在單次前向傳遞內部進行路由;另一個則是在整個模型艦隊之間路由。理解它們其實是同一套想法在兩種尺度上的體現,是最快看清為何兩者價格在輸入上相差 2 倍、在輸出上相差 5 倍的方法。

那兩台路由器,並排。

Kimi K3 — Moonshot AI 的旗艦模型,於 2026 年 7 月中旬發布,並在 2026 年 7 月 27 日公開權重。其架構即使以 2026 年的標準來看也相當罕見:69 層 Kimi Delta Attention 與 24 層 Gated MLA 交錯排列、Attention Residuals、一種「Stable LatentMoE」設計,以及一個 4.01 億參數的 MoonViT-V2 視覺編碼器。權重以 MXFP4 格式提供,並在量化感知訓練下搭配 MXFP8 激活值。其代管 API 所暴露的推理強度只有一個支援值——max

Fugu Ultra v2 — Sakana AI 的巔峰能力協調層級,而非通常意義上的基礎模型。它是一個單一且與 OpenAI 相容的端點,會將任務分解,並將其分派到一群開放權重與專門化模型之中。Sakana 表示 Claude Fable 5Claude Fable 5.1GPT-6 Astra 已排除在該模型池之外,並列出訓練截止日為 20260828。目前沒有已公布的參數數量,因為並不像 K3 那樣有可供計算的參數——其能力在於排程策略。

結果是,{{1}}K3{{/1}} 是一個元件,而 {{2}}Fugu Ultra v2{{/2}} 是一個組裝成品。這使得這項比較很不尋常:這兩者不只是競爭對手,還是潛在成分。像 {{1}}K3{{/1}} 這樣的模型,正是編排器很可能會租用的那種開放權重、長上下文、工具呼叫系統。Sakana 並未公布該池的成員組成,因此 {{1}}K3{{/1}} 是否在 {{2}}Fugu Ultra v2{{/2}} 之內仍不得而知——但若是如此,你按 Fugu 費率支付的部分費用,就是加價後的 {{1}}K3{{/1}} token。

價格差距實際上是什麼

輸入 — Fugu Ultra v2 據報為每 1M 收費 $5.00(第三方刊登資訊;Sakana 的公告頁面並未公布自家費率),對比 Kimi K3 的每 1M $3.00,快取命中則為 $0.30。

輸出 — Fugu Ultra v2 據報每 1M 為 $30.00,相較於 Kimi K3 每 1M $15.00。價格只要一半,而且還是能下載的模型。

快取輸入——快取命中時,Fugu Ultra v2 每 1M 為 $0.50,Kimi K3 每 1M 為 $0.30。在系統提示詞穩定的長時間代理迴圈中,這個價差會隨著每一輪不斷累積放大。

上下文分層 — Kimi K3 在其整個 1,048,576 個 token 的視窗內價格均一,沒有長上下文加價。Fugu Ultra v2 所回報的級距,在輸入超過約 272,000 個 token 時,會把整個請求的費用提高到約 $10.00 / $45.00。

最後那一列才是決定實際帳單的關鍵。長時間運行的代理任務,其生命週期大多在超過 272K token 之後,而這正是 K3 的固定費率維持不變、Fugu Ultra v2 卻翻倍的地方。如果你的工作負載屬於這種情況,那麼在輸入端的實際差距會接近 3.3 倍,而不是 1.7 倍。

Two-column comparison scoreboard for Fugu Ultra v2 and Kimi K3 covering type, release date, input price ($5.00 vs $3.00 per million tokens), output price ($30.00 vs $15.00), cached input ($0.50 vs $0.30) and long-context pricing (reprices above roughly 272K vs flat to 1M).

他們唯一共有的數字

兩家廠商都回報了 DeepSWE,而這項比較對 Fugu 來說,並不像其發布時的定調所暗示的那麼好看。Sakana 列出 Fugu Ultra v2 為 74.3。Moonshot 列出 Kimi K3 為 67.5——廠商自行報告,出自模型卡。那是在某個程式編碼代理基準上 6.8 分的差距,差距確實存在,但這只是更龐大已公布測試集中的一項測試,而且 Sakana 在同一項測試上以 1.6 分領先 GPT-5.6 Sol。一個三家不同廠商全都聚集在七分以內的基準,確實在衡量某些真實的東西,但並未決定性地把他們區分開來。

除此之外,這兩者公布的東西根本放在完全不同的貨架上。Moonshot 的 K3 數據包括 Terminal-Bench 2.1 的 88.3、GPQA Diamond 的 93.5、HLE-Full 的 43.5(搭配工具時為 56.0)、SWE-Marathon 的 42.0、OSWorld-Verified 的 84.8,以及 MCPMark-Verified 的 94.5——全是廠商自行回報,全都列在模型卡上。Sakana 為 Fugu Ultra v2 提出的八項則包含兩個內部基準測試,SWEFish 和 Toolathon,Sakana 以外的任何人都無法重現。

獨立來看,其中只有一個曾被實際測量過。Kimi K3 在 Artificial Analysis Intelligence Index v4.3 上得分 44——在開放權重模型中排名第二,僅次於得分 45 的 GLM-5.3——並在 Vals AI 標準化代理測試框架下的 SWE-bench Verified 中取得 93.40%,落後於 Claude Opus 5 和 DeepSeek V4 Pro,但差距不大。它也在 Frontend Code Arena 以 1679 Elo 領先,超前 1631 的 Fable 5 與 1618 的 GPT-5.6 Sol。如果你曾看到 K3 被引述為 57 或 60,那是已被取代的指數刻度,不應再重複引用。

Fugu Ultra v2 沒有任何形式的獨立評分。它於 2026 年 9 月 11 日發布,而 Sakana 以外的任何人都未曾運行過它。

速度:一個已測量,一個未測量

Kimi K3 很慢,而這是有實測根據的,並非空口宣稱:Artificial Analysis 記錄到每秒 37.9 個符元,首個符元時間為 3.80 秒,並標記其明顯冗長。對於一個以長時程代理式編碼為核心打造的模型而言,吞吐量是一項實實在在的限制——在長時間迴圈中,慢速模型耗費的是實際時間,而不只是金錢。

Sakana 完全沒有公布 Fugu Ultra v2 的任何延遲或吞吐量數據。對一個協調器來說,這可以說算是誠實而非迴避,因為回應時間完全取決於它決定呼叫哪些模型,以及它要跑幾輪。但這也意味著,除非自己實測,否則你無法推算改用它的實際耗時。至於前一版 Fugu Ultra,測試者曾公開回報執行時間拉長到接近 30 分鐘;那是 2026 年 6 月的模型,不能當作 v2 的證據,但它是你跑基準測試時要超越的數字。

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

開放權重,但附帶一個值得一讀的條件

Kimi K3 的權重可下載,這與 Fugu Ultra v2 僅提供託管模式有實質差異——但其授權範圍比「開放權重」一詞通常暗示的更狹窄。K3 採用 Kimi K3 授權條款發布,而非 OSI 認可的 MIT 或 Apache 授權,且廣為流傳的「修改版 MIT」說法仍有爭議。條款要求,若模型即服務(model-as-a-service)業務在任何連續十二個月內營收超過 2,000 萬美元,須與 Moonshot 另行簽訂協議;此外,若產品每月使用者超過 1 億,或月營收超過 2,000 萬美元,則須標示出處。內部使用則豁免。

所以,誠實的說法是:K3 給你的是可以實際持有、檢視、微調與自行託管的權重,但附帶一項以營收為門檻的商業條件。Fugu Ultra v2 則完全不給你這些——沒有權重、沒有可檢視的模型池、也不能自行託管——但它同樣不設任何營收條件,因為根本沒有東西可以授權。這兩者哪個比較寬鬆,完全取決於你是不是 K3 授權條款所針對的那種公司。

如果計畫自行架設,有個實際的注意事項:K3 的檢查點大約是 1.5 TB,而且供應商建議使用 64 個以上的加速器。這裡的「開放權重」代表的是推論叢集層級的決定,而不是筆電層級的決定。對大多數團隊來說,無論如何 API 都是合理的做法——這也是為什麼 day-0 的 vLLM 和 SGLang 支援比下載本身更重要。

我們自己的流量說明了什麼

有一個數據點,兩家廠商都沒有公布,而它的價值遠比表面上看起來更高:在整個 OrcaRouter 閘道中,Kimi K3 是本文所討論的所有模型裡使用量最高的,而且遙遙領先其他模型,在過去七天內傳輸了約 32.7 億個 token。

那不是一項基準測試,也無法據此斷定任何品質優劣。但它是開發者實際選擇的一大樣本——當這項決定除了 token 價格之外不耗費他們任何成本時——而這說明,K3 結合 1M 均一價視窗、開放權重與優異的 coding-arena 排名,已在真實的長上下文代理式工作中贏得可觀份額。Fugu Ultra v2 沒有可相比的訊號,因為它今天才推出。

Screenshot of the OrcaRouter model page for Kimi K3 showing the kimi/kimi-k3 identifier, a 1M token context window, and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

抵達每一個

Kimi K3 已在 OrcaRouter 上線,採用 Moonshot 自家的費率——每百萬輸入 3.00 美元、快取命中時 0.30 美元、每百萬輸出 15.00 美元——零加成原樣轉嫁,因此供應商調價當天就會反映在這裡,而不必等上遷移時程。它與型錄中其他項目共用同一個基礎 URL,並相容於 OpenAI;也因為它和所有其他模型位於同一個閘道之後,你可以將它放進容錯移轉鏈,或有條件地將流量導向它,而不必把單一供應商寫死進正式環境路徑。這點在這裡格外重要:一個以每秒 37.9 個 token 提供服務的 2.8T 參數模型,正是值得在背後準備備援的那種依賴。

Fugu Ultra v2 並非由我們負責路由。它可從 Sakana AI 自家的 OpenAI 相容 API 取得,而該公司表示,現有的 Fugu 整合只需變更一個參數即可移轉過去。兩個模型採用相同的請求格式,因此把它們放在同一個旗標後方進行評估,只是替換基礎 URL,而非改寫。

該選哪個

Kimi K3對幾乎所有工作負載而言都是更站得住腳的選擇。它在輸入與輸出上的價格都只有 Fugu Ultra v2 的一半,在 1M 視窗內價格持平,沒有長上下文斷崖,在現行 Artificial Analysis 指數中獲獨立評分 44,可在以營收為門檻的授權下自行託管,而且已是這項比較中流量最高的模型,且大幅領先。它的代價是速度與冗長:每秒 37.9 個 token 對代理式迴圈來說確實很慢,而如果你是一家大型的模型即服務企業,這份授權可是有強制力的。

Fugu Ultra v2值得入手,前提是你想要的正是 Sakana 所販售的那項特定特性——一個能力層級,能把艱難的多步驟工作拆解到一個在結構上排除前沿廠商的資源池上,如此一來,就沒有任何單一上游模型能在你腳下被撤銷、重新定價或斷供。它相較於 K3 的 DeepSWE 優勢是真實的,且由廠商自行報告;它在八項基準中七項名列前二,同樣由廠商自行報告,而且還是在部分其他任何地方都不存在的測試上。

值得注意的是,這兩者都是路由決策,而你要做的,是挑選一個高度。K3 把 token 路由到你所能下載並控制的模型內部的專家。Fugu Ultra v2 則把任務路由到你無法看見的模型。後者是更宏大、更強大的想法。它也是你只能憑信念接受的那一個——而要抱持這份信念,每 token 的成本是五倍。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新