Fugu Ultra v2 對決 Grok 4.6 的主打卡片,對比協作調度系統與單一大型上下文推理模型。
Guides & Insights

Fugu Ultra v2 對比 Grok 4.6:五倍的輸出價格,同一個共用的基準測試

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

只有一項基準測試,Fugu Ultra v2Grok 4.6兩者都有公布數字,那就是 DeepSWE:Sakana AI 在其 2026 年 9 月 11 日的公告中,報告 Fugu Ultra v2 為 74.3,而 xAI 為 Grok 4.6 發布的資料則將其自家的 DeepSWE v1.1 分數列為 65.9%。那是 8.4 分的差距,也是這兩家公司唯一提供的乾淨比較。你可能拿來對照的其他一切——Sakana 的 Chartography 與 SWEFish 對上 Grok 的 GPQA Diamond 與 CursorBench——都是由不同實驗室用不同工具測量的。所以誠實的問題不是「哪個更聰明」。而是 Fugu Ultra v2 所宣稱的優勢,是否值得為每百萬輸出 token 支付 30 美元,而 Grok 4.6 只收 6 美元。

同一個問題的兩種不同答案

Grok 4.6是一個單一模型,也是 Grok 系列目前的旗艦型號——在供應商自家的開發者文件中被列為「最新」,接替 Grok 4.5,並沿用相同的 500,000 個 token 上下文視窗、相同的文字/圖片/檔案輸入介面,以及相同的基礎定價。它的知識截止日為 2026 年 2 月 1 日,並提供 low、medium、high 與 xhigh 等推理強度選項,預設為 high。有個細節常讓人意外:推理功能無法關閉。每一次請求都會針對思考 token 計費,這使得 Grok 4.6 的實際輸出成本取決於它決定思考得多用力。

Fugu Ultra v2 就一般意義而言根本不是一個模型。它是 Sakana AI 編排產品線中能力最頂尖的層級——單一一個相容於 OpenAI 的端點,會將任務拆解,並分派到由其他模型組成的池中執行,其中有些是開放權重模型,有些則是專門化模型。Sakana 的說法是,它能達到前沿水準的輸出,「不必非得依賴它所編排的那些前沿模型」,並且明確表示 Claude Fable 5Claude Fable 5.1 和 GPT-6 Astra 都排除在那個池之外。你付費買的是排程層,以及子代理燒掉的每一個 token。

那個區別並非表面功夫。它正是價格差距存在的全部原因,也是唯一讓這個差距站得住腳的理由。

費率表,包括重複的那個部分

輸入 — Fugu Ultra v2 每 1M 為 $5.00,對比 Grok 4.6 每 1M 為 $2.00。在任何子呼叫發生之前,Fugu 就已經是 2.5 倍。

輸出 — Fugu Ultra v2 每 100 萬 $30.00,相較於 Grok 4.6 每 100 萬 $6.00。相差 5 倍,而這正是決定多數帳單的關鍵。

快取輸入 —— 兩者都是每 1M 收費 $0.50。完全相同。兩家在其他方面毫無共通點的供應商,卻落在同樣的快取讀取價格上,這使得快取密集的 agent 迴圈成為唯一能讓兩者真正逐項相較的工作負載。

長上下文重新計價——Grok 4.6 在提示超過 200,000 個 token 時倍增至 $4.00 / $12.00,而重新計價適用於整筆請求,不只是超出的部分。Fugu Ultra v2 據報在輸入超過約 272,000 個 token 的級距調升至約 $10.00 / $45.00,同樣以整筆請求計算。兩者都會懲罰長提示;Grok 早了 72K 個 token 就開始懲罰。

上下文視窗——依第三方清單所述,Grok 4.6 為 500K token,Fugu Ultra v2 為 1M。Sakana 的公告頁面完全未提及任何上下文數字,因此其 1M 應視為未經供應商確認。

長上下文之爭是雙面刃,值得把數字算一算。一個 300K token 的提示詞,在 Grok 4.6 上每百萬輸入要花你 $4.00,在 Fugu Ultra v2 上則約 $10.00。一個 150K token 的提示詞在 Grok 上要 $2.00,在 Fugu 上要 $5.00。Sakana 的模型在每一種提示詞長度上都更貴——唯一的問題是它需要被呼叫的頻率有多高。

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

支持為產出支付5倍{{1}}的{{/1}}論點

編排器的論點不在於它每個 token 更便宜,而是在於它需要更少的嘗試次數,而且它花在協調上的 token 比你花在失敗上的 token 更便宜。

這是個貨真價實的論點,而 Sakana 正明確提出這一點:Fugu Ultra v2 瞄準的是複雜的多步驟工作——自主研究、全端開發——在這些工作中,單一模型的失敗模式就是在漫長執行過程中半途偏離正軌。如果 30 美元的輸出費率能讓你一次就完成任務,而不是到第三次才完成,那麼每 token 的溢價便無關緊要。

供應商自己那一方也有支持證據,儘管這些證據對供應商有利,也應以此角度解讀。xAI 為 Grok 4.6 發布的資料指出,解決長時程任務約需 53 回合與約 5 億個輸入 token,而某個競爭對手的前沿模型則約需 103 回合與 20 億個輸入 token——這是一項論據,說明即使每 token 價格偏低,Grok 本身每項任務仍具經濟效益。兩家公司都在採取同樣的策略:把你從價目表推開,轉向以完成工作為單位的成本。

這意味著,真正關鍵的數字是兩家供應商都不會公布的,而你必須自己測量:在一項與你的任務類似的任務上,從頭到尾總共燒掉多少 token。

每一個真正薄弱的地方

Grok 4.6 已公布的弱點是終端機工作。其 Terminal-Bench v3.0 分數為 26%,遠遠落後於該領域的頂尖表現,儘管同一個模型在較舊的 Terminal-Bench v2.1 上取得了強勁得多的 88.4%——這些是不同的測試,將它們混為一談是你在許多報導中會看到的錯誤。它同時在其同群模型中擁有最高的 GPQA Diamond 分數,達到 94.9%,但 GPQA Diamond 已因飽和被從 Artificial Analysis 指數中移除,因此,該項目的高分不再像一年前那樣能區分前沿模型。

在獨立評測方面,Artificial Analysis 在其 v4.3 Intelligence Index 上給 Grok 4.6 打了 44 分,在 200 個中排名第 20,每項任務成本為 1.86 美元。經常被流傳的 61 這個數字來自已被取代的指數評分標準,不應在未說明是哪個版本產生的情況下引用。

Fugu Ultra v2 的弱點在於驗證。截至發布時,Sakana 對它宣稱的任何內容——五項最佳或並列最佳的結果、48.3 的 Chartography 分數(對比 Opus 5 的 27.3 與 Fable 5 的 29.5)、74.3 的 DeepSWE——都尚未經過獨立重現。此外也沒有公布延遲或吞吐量數字,而這對協調器來說比對單一模型更重要,因為它的回應時間完全取決於它決定要呼叫什麼。就前一版 Fugu Ultra 而言,測試者曾公開回報,執行時間拉長到約 30 分鐘;那是 2026 年 6 月的模型,不是 v2,但這正是你在將某條路徑正式投入生產前,應該測試的失敗模式。

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

關於供應商名稱的說明

在你打開開發者主控台尋找 Grok 4.6 之前,有一點值得先知道:這個模型的名稱始終是 Grok 4.6,但圍繞它的廠商品牌標示仍在變動之中。x​AI 自家的文件如今已掛上 SpaceXAI 這個名稱,而大多數的發布報導都還沒跟上這項變化。模型識別碼與 API 介面都沒有改變——Grok 4.6 是 Ope​nAI Responses 的一等公民模型,可直接放進既有的工具呼叫迴圈中,無須任何轉譯層——但如果你在找模型卡,而品牌標示看起來不太對,那並不是你的錯。

在實務上呼叫這兩個中的任一個

Grok 4.6 已登上 OrcaRouter,採用供應商自身的價格——每百萬輸入詞元 $2.00、每百萬輸出詞元 $6.00,零加成原價轉嫁,因此供應商調價當天就會反映在這裡,而不是等到遷移排程才更新。它與目錄中其他所有項目使用相同的基礎 URL,並相容於 OpenAI,這表示你可以將它放在備援鏈或路由規則之後,而不必硬編碼,也能在不需第二份合約或修改程式碼的情況下,與另一個模型進行 A/B 測試。

Fugu Ultra v2 不是由我們路由的。它可以從 Sakana AI 自家與 OpenAI 相容的 API 取得,而該公司表示既有的 Fugu 整合只需變更一個參數就能移轉過去。如果你想在你的工作負載上比較兩者,最省成本的安排是讓 Grok 4.6 留在你的閘道器上,並在功能旗標後方直接從 Sakana 呼叫 Fugu Ultra v2——兩者使用相同的請求格式,因此同一套測試框架在兩者上都能運作。

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

裁決

Grok 4.6是多數團隊理性的預設選擇,而且在價格上完全拉開差距。以 $2.00 / $6.00 的價位、$0.50 的快取讀取費用和 500K 的脈絡視窗,它能處理長文件推理、程式編寫代理與多模態檔案作業,輸出費率只有 Fugu Ultra v2 的五分之一,而且經過獨立評分與獨立基準測試。它的風險在於提示長度——200K 的斷崖會讓整個請求的費用加倍——以及終端機密集的代理迴圈,在這些方面它公布的成績並不具競爭力。

Fugu Ultra v2唯有在你擁有某種特定類型的工作負載時,才值得付出它的高價:那些冗長、多步驟、高度自主的任務,單一模型往往會偏離正軌,而且你還想要 Sakana 所推銷的那項架構特性——一個不依賴任何前沿廠商持續可供應或持續維持低價的能力層級。這確實是值得追求的東西。但這是一項宣稱,而非一項測量,而讓它看似可信的那個 DeepSWE 差距,不過是單一廠商在發布當天提出的單一基準測試。

如果你說不出你目前哪一項任務會在第二次或第三次嘗試時失敗,你就還沒有能證明價差合理的數字。先測量那個。費率表已經告訴你其他一切。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新