主視覺標題卡寫著「Fugu Max vs Grok 4.6」,副標題為「相同的價目表,只有一個公開分數」,三個膠囊標籤分別寫著「輸入 $2.00 對 $2.00」、「輸出 $6.00 對 $6.00」與「六項勝出,零個數字」,頁尾一行寫著「Sakana AI,2026 年 9 月 vs SpaceXAI,2026 年 8 月」,右下角則有 OrcaRouter 標誌。
Guides & Insights

Fugu Max 對決 Grok 4.6:相同的費率表,僅有一項公開評分

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Fugu Max 與 Grok 4.6 的價格完全相同。Sakana AI 於 2026 年 9 月 11 日推出 Fugu Max,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元——而這與 SpaceXAI 自 8 月 12 日 Grok 4.6 推出以來一路收取的價目表逐行一致。這項巧合是這場對決中最有用的事實,因為它把價格從爭論中剔除。當兩款產品收費完全相同時,剩下的唯一問題就是花這些錢能換來什麼,而兩者在這方面徹底分道揚鑣。Grok 4.6 是單一模型,你可以依版本鎖定、查閱基準測試表,並對照獨立指數來檢核。Fugu Max 則是一個經過訓練的協調器,會把每項任務分派給其模型池中最便宜的模型,而 Sakana 的公告聲稱它在六項基準測試中拿下最佳總體分數,卻未公布其中任何一項的數字。這兩筆購買中,有一筆在你掏錢之前就能衡量。另一筆則不然。

兩款產品,一份價目表

• 輸入 — Fugu Max 每 100 萬個詞元為 $2.00,對比 Grok 4.6 每 100 萬個詞元為 $2.00

• 輸出 — Fugu Max 每 100 萬個 token $6.00,相較於 Grok 4.6 每 100 萬個 token $6.00

• 快取輸入 — Fugu Max 每 100 萬個 token 為 $0.25,對比 Grok 4.6 每 100 萬個 token 為 $0.50,這是兩者價格唯一有差異的一項

• 上下文視窗 — Fugu Max 未由供應商公布,對比 Grok 4.6 的 500,000 個 token,與 Grok 4.5 相同

• 長提示詞重新定價——Fugu Max 在發布說明中未列出任何分級,而 Grok 4.6 一旦單次請求超過 200,000 個 token 便翻倍至 $4.00 / $12.00,且是套用於整筆請求,而非僅針對超出部分

• 推理控制 — Fugu Max 未開放對比 Grok 4.6 的四個投入等級,從 low 到 xhigh,預設為 high 且無法關閉切換

• 架構 — Fugu Max 是在一個未公開的模型池上訓練而成的協調器,該模型池包含開放權重與專業化模型;並透過與 NVIDIA 的合作,為 Max 擴展加入 NVIDIA Nemotron 系列,對比 Grok 4.6 的單一模型、單一版本

• 獨立評估——Fugu Max 未發布任何內容,且任何 Fugu 模型都沒有 Artificial Analysis 頁面;相較之下,Grok 4.6 的 Artificial Analysis Intelligence Index 即時分數為 44,在 200 個中排名第 20

便宜的那一欄是無法預測的。

看看 Fugu Max 在價格上真正勝出的地方:快取讀取,價格只有 Grok 4.6 的一半。這確實是實質優勢,卻也恰好是最不該用來建立成本模型的地方,因為快取定價的效益與你的快取命中率成正比——而 Sakana 並未公布 Fugu Max 的快取命中率。發布公告中也沒說明上下文視窗,沒有長上下文層級,也沒有輸出上限。所以,Fugu Max 唯一比 Grok 4.6 便宜的那一欄,是一筆幅度未知的折扣,套用在你 token 中占比未知的部分。

Grok 4.6 的弱點至少是看得見的。它那 200,000 個 token 的門檻相當激進——它會把整筆請求重新計價,所以一則 250,000 個 token 的提示,會從第一個 token 起就以雙倍費率計費,而不是從第 200,001 個 token 才開始。但你看得見那道斷崖,可以拿自己的提示去對照衡量,再決定要不要分段處理。這就是這裡本質上的差異:一個系統公布的是具有明確形狀、可供你事先規劃的價格表,另一個系統公布的則是一個未附任何計價表的頭條費率。

六勝,卻一分未得

Sakana 點名的基準測試有 Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench 和 SWEFish。其中五項是公認的公開評測。第六項 SWEFish 是 Sakana 自家的程式設計基準測試,這意味著六項聲稱的勝利中,有一項是依廠商自行編寫、且尚未發布的測試來計分。至於其他五項,發布說明只稱 Fugu Max 取得最佳總體分數,然後就點到為止——沒有分數、沒有差距,也沒有競爭對手的數字可以並列對照。

將這與 SpaceXAI 為 Grok 4.6 公布的表格對照來看,該表格從頭到尾都是廠商自行報告的數據,但至少還算是一份表格:GDPVal-AA v2 為 1,753,AA-Briefcase 為 1,577,DeepSWE v1.1 為 65.9%,CursorBench v3.2 為 69.9%,GPQA Diamond 為 94.9%。發表資料也指出,在 AA-Briefcase 上解決長時程任務約需 53 個回合與約五億個輸入 token,而競爭對手的前沿模型則需約 103 個回合與二十億個 token——這是一項同樣出自廠商自行報告的論點,主張即使單一 token 的價格不算高,Grok 每完成一項工作的成本依然低廉。

Grok 的這些數字中有兩項在你引用之前需要先處理。第一項是,它那亮眼的 GPQA Diamond 分數 94.9% 來自一項 Artificial Analysis 後來因已飽和而淘汰的基準測試,因此它不再像過去那樣能區分前沿模型。第二項是你會在較舊報導中看到的數字:Grok 4.6 的 Artificial Analysis Intelligence Index 為 61。那是重述前的量表。Artificial Analysis 在 2026 年 9 月重新校準了該指數,現行數字是 44,在 200 個中排名第 20,每項 Intelligence Index 任務成本為 $1.86。任何人若以 61 將 Grok 4.6 與 Claude Fable 5GPT-5.6 Sol 排名相比,就是在拿兩種不同儀器的讀數作比較。

A two-column scoreboard titled 'Fugu Max vs Grok 4.6 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Grok 4.6: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.50 per 1M, context 500K with a 200K repricing cliff, benchmarks GDPVal 1,753 and DeepSWE 65.9%, evidence Artificial Analysis Index 44 ranked #20 of 200. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Grok 4.6 rows SpaceXAI-reported and per Artificial Analysis. No independent Fugu Max evaluation exists.' OrcaRouter logo bottom-right.

協調器的代幣價格不包含什麼

Sakana 自己對這次發布的說明也坦承了這個結構性問題。由於 Fugu Max 會在單一任務內切換模型,它「可能降低上下文快取的重複使用率,並產生額外的協調權杖」——而該公司並未揭露隨之而來的快取命中率,或每項任務的總權杖成本。協調器所衍生的每一個代理都會寫入推理與輸出文字,而這一切都以每百萬 $6.00 的價格計費。這個費率與 Grok 4.6 相同。數量卻不是,而數量正是定價頁面無法向您展示的變數。

兩家廠商都在把你推向同一項修正——別再比較費率,改為比較每完成一項工作的成本——但只有其中一家給你一個可作為起點的數字。Grok 4.6 登場時附上一份已公開的回合與 token 概況。Fugu Max 登場時則附上一道指示:要你自己測量。

對 Fugu Max 的沉默,有一種合理的解讀,值得說清楚。Max 是 Fugu 系列中成本最佳化的等級,與 Fugu Ultra v2 同日推出,而後者是以 5.00 美元輸入、30.00 美元輸出所推動的能力推進版。Sakana 為 Max 提出的視覺論證是一張帕雷托圖——能力對成本——而在帕雷托圖上,原始基準測試分數並非重點;每美元得分才是整個主張。如果論證是這樣,那麼印出六個勝出分數卻不列其成本,會是那張誤導人的圖,而不是缺失的那張圖。這次發布仍欠買家一個分母,而它並未提供。

Grok 4.6 真正暴露的地方

終端機工作是 Grok 4.6 最弱的公開評測項目。它在 Terminal-Bench v3.0 的分數為 26%,遠遠落後於領先群。請留意緊鄰的那個數字:同一個模型在 Terminal-Bench v2.1 拿下 88.4%,而那是不同的測試。你會在報導中看到兩者被混為一談,而這種混淆大大美化了 Grok。

第二個風險在於,推理無法關閉。思考 token 會在每次請求時計費,因此 Grok 4.6 的實際輸出成本取決於模型決定對你的提示詞投入多少思考。effort 調節鈕讓你在低檔位仍能控制,但沒有設為零的選項。

相對之下,Grok 4.6 擁有 Fugu Max 目前無論出價多少都無法提供的東西:一個數字。上方的每一列都能由第三方查核,而 Artificial Analysis 的收錄條目意味著已經有一次被查核過了。Fugu Max 的六項勝利,是在該模型發布的同一天、由打造它的公司所公布,而且截至撰稿時,Sakana 以外沒有人運行過它。

呼叫其中一個,操控另一個

Grok 4.6 已在 OrcaRouter 上以 SpaceXAI 的定價提供 — 每百萬輸入 token 2.00 美元、快取命中時 0.50 美元、每百萬輸出 token 6.00 美元 — 以 0% 加價原樣轉送,因此供應商的價格變動當天就會反映在我們的閘道上,而不必等到遷移時程才更新。它與目錄中其他模型使用同一個基礎 URL,並相容於 OpenAI 格式,這表示你可以將它放進容錯移轉鏈,或置於條件式路由規則之後,而不必把特定供應商硬編碼進正式環境的呼叫路徑;也能在無須另簽合約的情況下,將它與另一個模型進行 A/B 測試。過去七天內,它透過閘道處理了 4,660 萬個 token。

Fugu Max 並不在我們的型錄上。它是透過 Sakana 自家的 OpenAI 相容 API 以及幾個第三方平台送到你手上的,而該公司表示,既有的 Fugu 整合只需改一個參數就能升級到它。由於兩者採用相同的請求格式,把兩者放在同一個旗標後方進行評測,只是替換 base-URL,而不是重寫——這正是解決這個特定爭論的正確方式,因為這場爭論的重點在於每完成一項任務的 token 數,而只有你自己的實際工作負載才能得出那個數字。

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the introductory argument that a system deploying a multi-trillion-parameter model for a simple lookup is wasteful, and a cost-versus-performance chart placing Fugu Max on a frontier formed by Fugu models above the frontier formed by single models.

該買哪一個

Grok 4.6 是站得住腳的預設選擇。在與 Fugu Max 相同的價目表下,它提供你可據以規劃的 500K 上下文視窗、可鎖定的版本、四級推理控制、在獨立指數中排名第 44 的位置並附有每項任務成本數字,以及數個月的第三方評測。它的代價具體且已知:200K 的重新定價斷崖、一律計費的推理,以及落後同業的終端工作表現概況。

Fugu Max 是更有趣的賭注,而且,根據現有證據,也是更難以檢視的一個。設計論證是合理的——如果協調器能可靠地挑選出能完成你任務的最便宜模型,即使你的價目表不變,你每完成一項工作的中位成本也會下降。但在 $2.00 / $6.00 的價格下,代幣費率並不是 Fugu Max 的優勢所在;那個費率正是 Grok 4.6 的。優勢必須來自花費更少的代幣,而 Sakana 尚未公佈能證明其確實如此的測量數據。

所以,就照兩家供應商要求你的方式來做比較。把 Grok 4.6 放上你的閘道,透過功能旗標呼叫 Fugu Max,並在看起來和你自身工作相似的任務上,計算每項完成任務的輸出 token 數。如果在相同費率下,Fugu Max 完成任務所用的 token 比單一模型更少,那麼快取折扣與協同作業就是實實在在的錢,切換也就合理。如果不是,你就是在為一個組成可能在你底下改變、版本號卻文風不動的系統,支付完全相同的費率。

對於本季所有不需要那項衡量指標就能決定的事,請先從有計分板的模型開始。

A screenshot of the OrcaRouter model page for Grok 4.6 (English UI, captured September 11, 2026), showing the NEW and Featured badges, the identifier grok/grok-4.6, by SpaceXAI dated 2026-08-12, vision, tools, JSON and reasoning capability tags, a 500K-token context window with text, image and file input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, traffic of 46.6 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新