
Fugu Ultra v2 對比 Grok 4.6:五倍的輸出價格,同一個共用的基準測試
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
只有一項基準測試,Fugu Ultra v2與Grok 4.6兩者都有公布數字,那就是 DeepSWE:Sakana AI 在其 2026 年 9 月 11 日的公告中,報告 Fugu Ultra v2 為 74.3,而 xAI 為 Grok 4.6 發布的資料則將其自家的 DeepSWE v1.1 分數列為 65.9%。那是 8.4 分的差距,也是這兩家公司唯一提供的乾淨比較。你可能拿來對照的其他一切——Sakana 的 Chartography 與 SWEFish 對上 Grok 的 GPQA Diamond 與 CursorBench——都是由不同實驗室用不同工具測量的。所以誠實的問題不是「哪個更聰明」。而是 Fugu Ultra v2 所宣稱的優勢,是否值得為每百萬輸出 token 支付 30 美元,而 Grok 4.6 只收 6 美元。
同一個問題的兩種不同答案
Grok 4.6是一個單一模型,也是 Grok 系列目前的旗艦型號——在供應商自家的開發者文件中被列為「最新」,接替 Grok 4.5,並沿用相同的 500,000 個 token 上下文視窗、相同的文字/圖片/檔案輸入介面,以及相同的基礎定價。它的知識截止日為 2026 年 2 月 1 日,並提供 low、medium、high 與 xhigh 等推理強度選項,預設為 high。有個細節常讓人意外:推理功能無法關閉。每一次請求都會針對思考 token 計費,這使得 Grok 4.6 的實際輸出成本取決於它決定思考得多用力。
Fugu Ultra v2 就一般意義而言根本不是一個模型。它是 Sakana AI 編排產品線中能力最頂尖的層級——單一一個相容於 OpenAI 的端點,會將任務拆解,並分派到由其他模型組成的池中執行,其中有些是開放權重模型,有些則是專門化模型。Sakana 的說法是,它能達到前沿水準的輸出,「不必非得依賴它所編排的那些前沿模型」,並且明確表示 Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra 都排除在那個池之外。你付費買的是排程層,以及子代理燒掉的每一個 token。
那個區別並非表面功夫。它正是價格差距存在的全部原因,也是唯一讓這個差距站得住腳的理由。
費率表,包括重複的那個部分
• 輸入 — Fugu Ultra v2 每 1M 為 $5.00,對比 Grok 4.6 每 1M 為 $2.00。在任何子呼叫發生之前,Fugu 就已經是 2.5 倍。
• 輸出 — Fugu Ultra v2 每 100 萬 $30.00,相較於 Grok 4.6 每 100 萬 $6.00。相差 5 倍,而這正是決定多數帳單的關鍵。
• 快取輸入 —— 兩者都是每 1M 收費 $0.50。完全相同。兩家在其他方面毫無共通點的供應商,卻落在同樣的快取讀取價格上,這使得快取密集的 agent 迴圈成為唯一能讓兩者真正逐項相較的工作負載。
• 長上下文重新計價——Grok 4.6 在提示超過 200,000 個 token 時倍增至 $4.00 / $12.00,而重新計價適用於整筆請求,不只是超出的部分。Fugu Ultra v2 據報在輸入超過約 272,000 個 token 的級距調升至約 $10.00 / $45.00,同樣以整筆請求計算。兩者都會懲罰長提示;Grok 早了 72K 個 token 就開始懲罰。
• 上下文視窗——依第三方清單所述,Grok 4.6 為 500K token,Fugu Ultra v2 為 1M。Sakana 的公告頁面完全未提及任何上下文數字,因此其 1M 應視為未經供應商確認。
長上下文之爭是雙面刃,值得把數字算一算。一個 300K token 的提示詞,在 Grok 4.6 上每百萬輸入要花你 $4.00,在 Fugu Ultra v2 上則約 $10.00。一個 150K token 的提示詞在 Grok 上要 $2.00,在 Fugu 上要 $5.00。Sakana 的模型在每一種提示詞長度上都更貴——唯一的問題是它需要被呼叫的頻率有多高。

支持為產出支付5倍{{1}}的{{/1}}論點
編排器的論點不在於它每個 token 更便宜,而是在於它需要更少的嘗試次數,而且它花在協調上的 token 比你花在失敗上的 token 更便宜。
這是個貨真價實的論點,而 Sakana 正明確提出這一點:Fugu Ultra v2 瞄準的是複雜的多步驟工作——自主研究、全端開發——在這些工作中,單一模型的失敗模式就是在漫長執行過程中半途偏離正軌。如果 30 美元的輸出費率能讓你一次就完成任務,而不是到第三次才完成,那麼每 token 的溢價便無關緊要。
供應商自己那一方也有支持證據,儘管這些證據對供應商有利,也應以此角度解讀。xAI 為 Grok 4.6 發布的資料指出,解決長時程任務約需 53 回合與約 5 億個輸入 token,而某個競爭對手的前沿模型則約需 103 回合與 20 億個輸入 token——這是一項論據,說明即使每 token 價格偏低,Grok 本身每項任務仍具經濟效益。兩家公司都在採取同樣的策略:把你從價目表推開,轉向以完成工作為單位的成本。
這意味著,真正關鍵的數字是兩家供應商都不會公布的,而你必須自己測量:在一項與你的任務類似的任務上,從頭到尾總共燒掉多少 token。
每一個真正薄弱的地方
Grok 4.6 已公布的弱點是終端機工作。其 Terminal-Bench v3.0 分數為 26%,遠遠落後於該領域的頂尖表現,儘管同一個模型在較舊的 Terminal-Bench v2.1 上取得了強勁得多的 88.4%——這些是不同的測試,將它們混為一談是你在許多報導中會看到的錯誤。它同時在其同群模型中擁有最高的 GPQA Diamond 分數,達到 94.9%,但 GPQA Diamond 已因飽和被從 Artificial Analysis 指數中移除,因此,該項目的高分不再像一年前那樣能區分前沿模型。
在獨立評測方面,Artificial Analysis 在其 v4.3 Intelligence Index 上給 Grok 4.6 打了 44 分,在 200 個中排名第 20,每項任務成本為 1.86 美元。經常被流傳的 61 這個數字來自已被取代的指數評分標準,不應在未說明是哪個版本產生的情況下引用。
Fugu Ultra v2 的弱點在於驗證。截至發布時,Sakana 對它宣稱的任何內容——五項最佳或並列最佳的結果、48.3 的 Chartography 分數(對比 Opus 5 的 27.3 與 Fable 5 的 29.5)、74.3 的 DeepSWE——都尚未經過獨立重現。此外也沒有公布延遲或吞吐量數字,而這對協調器來說比對單一模型更重要,因為它的回應時間完全取決於它決定要呼叫什麼。就前一版 Fugu Ultra 而言,測試者曾公開回報,執行時間拉長到約 30 分鐘;那是 2026 年 6 月的模型,不是 v2,但這正是你在將某條路徑正式投入生產前,應該測試的失敗模式。

關於供應商名稱的說明
在你打開開發者主控台尋找 Grok 4.6 之前,有一點值得先知道:這個模型的名稱始終是 Grok 4.6,但圍繞它的廠商品牌標示仍在變動之中。xAI 自家的文件如今已掛上 SpaceXAI 這個名稱,而大多數的發布報導都還沒跟上這項變化。模型識別碼與 API 介面都沒有改變——Grok 4.6 是 OpenAI Responses 的一等公民模型,可直接放進既有的工具呼叫迴圈中,無須任何轉譯層——但如果你在找模型卡,而品牌標示看起來不太對,那並不是你的錯。
在實務上呼叫這兩個中的任一個
Grok 4.6 已登上 OrcaRouter,採用供應商自身的價格——每百萬輸入詞元 $2.00、每百萬輸出詞元 $6.00,零加成原價轉嫁,因此供應商調價當天就會反映在這裡,而不是等到遷移排程才更新。它與目錄中其他所有項目使用相同的基礎 URL,並相容於 OpenAI,這表示你可以將它放在備援鏈或路由規則之後,而不必硬編碼,也能在不需第二份合約或修改程式碼的情況下,與另一個模型進行 A/B 測試。
Fugu Ultra v2 不是由我們路由的。它可以從 Sakana AI 自家與 OpenAI 相容的 API 取得,而該公司表示既有的 Fugu 整合只需變更一個參數就能移轉過去。如果你想在你的工作負載上比較兩者,最省成本的安排是讓 Grok 4.6 留在你的閘道器上,並在功能旗標後方直接從 Sakana 呼叫 Fugu Ultra v2——兩者使用相同的請求格式,因此同一套測試框架在兩者上都能運作。

裁決
Grok 4.6是多數團隊理性的預設選擇,而且在價格上完全拉開差距。以 $2.00 / $6.00 的價位、$0.50 的快取讀取費用和 500K 的脈絡視窗,它能處理長文件推理、程式編寫代理與多模態檔案作業,輸出費率只有 Fugu Ultra v2 的五分之一,而且經過獨立評分與獨立基準測試。它的風險在於提示長度——200K 的斷崖會讓整個請求的費用加倍——以及終端機密集的代理迴圈,在這些方面它公布的成績並不具競爭力。
Fugu Ultra v2唯有在你擁有某種特定類型的工作負載時,才值得付出它的高價:那些冗長、多步驟、高度自主的任務,單一模型往往會偏離正軌,而且你還想要 Sakana 所推銷的那項架構特性——一個不依賴任何前沿廠商持續可供應或持續維持低價的能力層級。這確實是值得追求的東西。但這是一項宣稱,而非一項測量,而讓它看似可信的那個 DeepSWE 差距,不過是單一廠商在發布當天提出的單一基準測試。
如果你說不出你目前哪一項任務會在第二次或第三次嘗試時失敗,你就還沒有能證明價差合理的數字。先測量那個。費率表已經告訴你其他一切。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
