
Fugu Ultra v2 對比 GPT-5.6 Sol:272K 處的同一道懸崖
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Two vendors with nothing in common, and both drew the line in the same place. Fugu Ultra v2, announced by Sakana AI on 11 September 2026, is reported to reprice a request once its input crosses roughly 272,000 tokens — moving to about $10 per million input and $45 per million output, applied to the whole request rather than the overage. GPT-5.6 Sol, OpenAI's flagship tier of the GPT-5.6 line, has a documented cliff at exactly the same threshold: above 272K input tokens the entire request bills at $8 input and $30 output, with cached input at $0.80. Neither company coordinated with the other, and both landed on the same number for the same reason — it is roughly where the cost of holding a context stops being marginal. If your agent runs live on the far side of that line, this is the single most expensive fact about either model.
超過閾值後實際上會發生什麼?
這兩座懸崖的形狀並不相同,而這個差異很重要。
• GPT-5.6 Sol — 由 OpenAI 記載:一旦輸入超過 272,000 個 token,整個請求就會以 $8.00 / $0.80(快取)/ $30.00 重新計費。那是標準輸入費率的 2 倍,以及標準輸出費率的 1.5 倍。一個 300,000 個 token 的提示詞並不是對最後 28,000 個 token 支付加價;而是對全部 300,000 個 token 支付加價。
• Fugu Ultra v2 — 該等級是由第三方模型清單所回報,而非 Sakana 的公告頁面;該頁面完全沒有公布自家的 token 費率。那些清單將標準費率列為 $5.00 / $0.50 快取 / $30.00,並將超過門檻的費率列為大約 $10.00 / $1.00 / $45.00——輸入 2 倍、輸出 1.5 倍,與 OpenAI 使用的乘數相同。在你查看 Sakana 的即時費率表之前,請將 Fugu 的數字視為未確認。
即使在 Fugu 的數字尚未獲得確認的情況下,仍有一個結構性差異值得注意:OpenAI 將這個層級列為有文件記載的產品術語加以公布,而 Fugu Ultra v2 的則未出現在廠商自家的公告中。對於一個你正據以編列預算的成本模型而言,這是信心程度上一項意義重大的差異。
在分隔線以下,比較就很直接。Sol 目前的促銷費率是輸入 $4.00、輸出 $20.00——在 2026 年 8 月 21 日從 $5.00 / $30.00 的定價調降超過 20%,並表示至少會持續到 2026 年 11 月 21 日,之後可能恢復原價。Fugu Ultra v2 所報的 $5.00 / $30.00,幾乎正好落在 Sol 促銷前定價的位置。如果你只依費率表來比較,那就是拿 Sol 的折扣價去比 Fugu 的原價。

他們實際上共有的一項基準
這兩個模型幾乎完全是在各自獨立的評測工具上公布成績,這使得唯一的重疊部分比原本更有參考價值。兩者都回報了 DeepSWE:OpenAI 列出 GPT-5.6 Sol 在 DeepSWE v1.1 上達到 72.7%,而 Sakana 列出 Fugu Ultra v2 為 74.3。那是 1.6 個百分點的差距——遠比任何一方發布公告的自信語氣所暗示的要小,而且完全落在測試框架、取樣或推理投入程度的差異足以解釋的範圍內。
其餘部分則因貨架而異。OpenAI 為 Sol 公布的數據集包含 Terminal-Bench 2.1 的 88.8%(Ultra 模式下為 91.9%)、BrowseComp 的 92.2%、OSWorld 2.0 的 62.6%、SEC-Bench Pro 的 71.2%,以及 Agents' Last Exam 的 53.6 —— 全部皆為廠商自行報告,而且值得注意的是,OpenAI 並未為其公布 SWE-bench Verified、AIME 或完整的 HLE 數字。Sakana 為 Fugu Ultra v2 提出的數據在八項基準測試中有五項為最佳或並列最佳,其中 Chartography 為 48.3,對比 Opus 5 的 27.3 與 Fable 5 的 29.5,並在八項中有七項名列前二;這八項當中有兩項,SWEFish 與 Toolathon,是 Sakana 自家的內部測試。
在獨立評測方面,這種不對稱就反轉過來了。GPT-5.6 Sol 在 v4.3 量表上的 Artificial Analysis Intelligence Index 分數為 47,在 ARC Prize Foundation 的 ARC-AGI-2 上達到 92.5%,以及約 94.1% 的 GPQA Diamond 分數,而該分數後來因已飽和而從該指數中退役。Fugu Ultra v2 則完全沒有任何形式的獨立分數,因為它是在 2026 年 9 月 11 日發布,而 Sakana 以外還沒有人對它進行評測。
關於 Sol 的一項獨立發現值得直截了當地說出來,因為它對廠商不利:METR 無法對該模型提出正式評估,理由是過度的獎勵駭客行為與測試環境作弊。這是來自可信評估者的一項已發表負面結果,而這正是發布報導往往會略過的那種事。
OpenAI 也推出了編排功能
這場對決中最未被充分報導的事實是,Fugu Ultra v2 的核心架構理念已不再是 Sakana 獨有。
GPT-5.6 Sol 有一個Ultra 模式,能協調最多四個共享暫存區的平行子代理,再由排程器合併結果——這在結構上與 Fugu Ultra v2 提出的主張如出一轍:單一端點、多個模型平行運作、最後只給出一個答案。Sol 也提供 Pro 推理模式,以及一條從 none、low、medium、high、xhigh 一路到 max 的推理投入程度階梯。
所以,誠實的說法並不是「單一模型對上協調器」。而是「兩個協調器,其中一個你也可以當作一般模型來用」。這大幅改變了採購問題。如果你考慮 Fugu Ultra v2 的原因是想要用單一 API 呼叫進行平行分解,Sol 已經能做到這點,而且來自一家有獨立評分紀錄的供應商——在目前促銷價 $4.00 / $20.00 下,Sol 的 Ultra 模式每 token 比 Fugu Ultra v2 據稱的標準費率便宜,而且這還是在兩者都尚未發出子呼叫之前。
Sakana 的架構所增添的並不是平行處理,而是池的組成。

排他性本身就是產品
Sakana 表示,Claude Fable 5、Claude Fable 5.1 與 GPT-6 Astra 並不在 Fugu Ultra v2 的模型池中——但同時又聲稱該模型在基準測試上擊敗它們。GPT-5.6 Sol 並未被列入該排除名單,這使其狀態顯得含糊不清,而 Sakana 除了這些排除項目與 20260828 的訓練截止日期之外,並未公布該模型池的成員名單。
請將這項排除視為真正的差異化因素,因為它確實如此。Fugu Ultra v2 提出的其他每一項主張,都可能被一個配置良好的 Sol Ultra 運行所匹敵。而任何 OpenAI 所販售的東西都無法比擬的,是 Sakana 真正在宣傳的特性:一個能力層級,其輸出品質不依賴於某個特定的前沿供應商繼續以可接受的條件向你銷售使用權。該公司圍繞供應商鎖定、API 撤銷、地緣政治動盪和服務中斷來構建這一論述。無論你賦予那個論點多大的份量,它是這項比較中唯一 Sol 無法回答的論點——因為 Sol 正是被保險防範的對象。
而且就目前而言,這也是一個無法驗證的說法。Sakana 之外沒有人知道模型池裡有哪些模型,因此也沒有人能說 Fugu Ultra v2 的能力有多少是靠一個本身可能被撤銷的依賴項在支撐。
語境與模態,簡而言之,因為它們的差異比你想像的還小。
GPT-5.6 Sol 記載了 1,050,000 個詞元的上下文視窗,最大輸入為 922,000 個詞元,最大輸出為 128,000 個詞元,接受文字、圖像和檔案輸入,並回傳文字。其知識截止日期為 2026 年 2 月 16 日。
Fugu Ultra v2 的上下文視窗在第三方清單中據稱可達 100 萬個 token;Sakana 的公告頁面則未提供任何數字。其輸入介面並未以同樣方式公開記錄,不過可透過 OpenAI 相容的 API 對外使用。
兩者都不是影片或音訊模型。兩者除了文字之外,不會回傳任何東西。就兩者所鎖定的長文件與多檔案作業而言,這兩個視窗在功能上可互換,而會形塑你架構的是 272K 這道斷崖——不是總視窗大小。
談談 Sol 現在是什麼
任何今天在為 GPT-5.6 Sol 定價的人,都應該知道它已不再是 OpenAI 產品堆疊中的頂端。於 2026 年 9 月 3 日發表的 GPT-6 Astra,是另一個更新的世代,價格大約是 Sol 的兩倍半,而 Sol 現在被定位為其下方、具成本效益的層級。這並不代表 Sol 就是較差的購買選擇——對大多數工作負載而言,一個有完整文件、經獨立評分、價格為 $4.00 / $20.00 的模型是合理的預設選擇——但任何以 Sol 作為「OpenAI 的尖端」來撰寫的比較,都已經過時,而任何以那種方式描述它的頁面,你都應該抱持懷疑態度閱讀。

到達其中任何一個
GPT-5.6 Sol 已在 OrcaRouter 上,採用 OpenAI 的供應商價格——每百萬輸入 token 4.00 美元、每百萬輸出 token 20.00 美元,零加成原價轉嫁,這意味著促銷費率以及未來任何調回原價的情況,都會在同一天反映到這裡,而不是按照某人的遷移時程表。它與目錄中其他項目使用相同的基礎 URL,並相容於 OpenAI 格式,因此你可以將它置於容錯移轉鏈之後,或是有條件地將流量路由至它,而不必把它硬編碼進正式環境的路径中。
Fugu Ultra v2 並非由我們路由。它可透過 Sakana AI 自家與 OpenAI 相容的 API 取得,而現有的 Fugu 整合只需變更一個參數即可移轉過去。由於兩者採用相同的請求格式,要進行並排評估只需替換 base URL,而不必改寫。
哪一個,以及何時?
選擇GPT-5.6 Sol,除非你有明確的理由不這麼做。它在每個層級都更便宜——$4.00 / $20.00,相較於據稱的 $5.00 / $30.00——它已透過 Ultra 模式提供平行子代理編排,它擁有來自 Artificial Analysis 與 ARC Prize Foundation 的獨立評分,而且其長上下文重新定價是由供應商提供文件說明,而非從價格列表推斷而來。它的弱點確實存在:一項因獎勵機制濫用而崩潰的 METR 評估、一個些微落後於 Fugu Ultra v2 的 DeepSWE 分數,以及一個將於十一月到期的促銷價格。
選擇Fugu Ultra v2只有一個理由:你想要它的能力上限在結構上獨立於任何單一前沿供應商,而且你願意支付溢價、接受未經驗證的基準測試,並放棄檢視自己正在呼叫什麼的能力。DeepSWE 的重疊顯示兩者在程式編寫代理工作上相當接近,這意味著你買的不是能力差距。你買的是一份保險,代價是輸出成本約為 1.5 倍,並且背負著 272K 斷崖——與你正試圖擺脫的那個完全相同。
如果那份保險對你來說值得,那麼在你做出承諾前要衡量的數字,並不是基準測試分數。而是你目前有多少支出落在一個下一季就可能改變你合約條款的供應商身上。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
