Claude Opus 5.5 對上 GPT-5.6 Sol 的主視覺標題卡,標題為「兩張幾乎不重疊的發布表」,並帶有標示著 $4.00 對 $5.00、66.4% 對 37.3%,以及截止 Jun 對 Feb 的徽章,右下角則有 OrcaRouter 標誌。
Guides & Insights

Claude Opus 5.5 對決 GPT-5.6 Sol:兩張幾乎不相重疊的發布時程表

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Opus 5.5GPT-5.6 Sol在本週並排比較,你首先注意到的並非贏家,而是兩家廠商發布的基準測試表格幾乎沒有任何一行相同。Claude Opus 5.5 於 2026 年 9 月 22 日發布,其發表資料顯示它在 Terminal-Bench 4.0 上領先 GPT-5.6 Sol 29 分。Sol 自 2026 年 7 月 9 日起正式全面推出,其發表資料反倒以 Terminal-Bench 2.1 和 Artificial Analysis Coding Agent Index 為主打;Sol Ultra 在 Terminal-Bench 2.1 拿下 91.9%,並在該指數中以 80 分登上榜首。這兩份表格都是真實的。兩者都是由各自勝出的廠商執行。有用的問題不是哪個模型在抽象上更好——而是哪個基準測試、在誰的測試框架下執行,能告訴你任何關於你工作負載的事。這個問題比任一篇發布文章所希望你問的還要難,而這正是這篇比較所圍繞的核心。

兩個模型並列展示

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• 供應商 — AnthropicOpenAI

• 發布日期 — 2026 年 9 月 22 日的 Claude Opus 5.5 對比 2026 年 7 月 9 日的 GPT-5.6 Sol

• 每百萬個 token 的價格 — 輸入 $4.00 / 輸出 $20.00,對比輸入 $5.00 / 輸出 $30.00

• 快取讀取 — 在 Opus 5.5 上每百萬 $0.20;Sol 的快取費率依平台設定,並未以單一可比較的數字公佈

• 上下文視窗 — 兩者皆為 1M 個 token

• 最大輸出 — 兩者皆為 128K token,而 Anthropic 的 Batch API 透過 beta 標頭可達 300K

• 知識截止 — Opus 5.5 為 2026 年 6 月,而 Sol 為 2026 年 2 月 16 日

• 推理控制 — 自適應思考一律開啟,預設為 中等 強度,等級範圍從低到最高,對比於可設定最高推理強度,外加一個能協調平行子代理的 Ultra 模式

• 產品陣容 — Opus 5.5 是 5.5 系列的首款產品,Sonnet 5.5 與 Haiku 5.5 承諾將於未來數週內推出;相較之下,Sol 則是與 Terra 和 Luna 並列的三層級系列中的旗艦款

那些列之中,有兩列的作用比其餘的更大。知識截止時間的落差達四個月,如果你的提示詞會觸及今年春天發生的任何事,這點就很重要。而 Opus 5.5 現在在輸入與輸出價格上都比 Sol 更低——這與三個月前的情況正好相反,當時 Sol 是取得前沿等級輸出更便宜的方式,而 Claude Opus 5 的價格是 $5/$25。

唯一兩個模型都實際出現的資料列

已發表的表格中,同時收錄這兩個模型的就只有一份,而且那是 Anthropic 的。其中每個數字都是廠商自行提報的,由販售這兩款模型中其中一款的公司所產生:

• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 對比 GPT-5.6 Sol 37.3%

• Terminal-Bench-Science 0.1 — 58.7% 對比 22.4%

• FrontierCode v1.1(主要)— 54.4% 對 47.5%

• CursorBench 4.0 — 57.8% 對比 41.7%

• AutomationBench — 40.0% 對比 28.8%

• GDPval-AA v2.1 — 1846 Elo 對 1588

那是一次全勝,而兩列 Terminal-Bench 的差距大到值得細究,而非照單全收。Anthropic 自家的註腳就替你做了部分這樣的工作:Opus 5.5 的 Terminal-Bench 測試採用的是 xhigh 努力等級,而非預設值;在預設的 medium 努力等級下,FrontierCode 的優勢縮小到 54.6% 對 47.5%——是七個百分點的差距,而不是那些醒目數字。Anthropic 也對整張表附加了一般性告誡,表示在這個能力水準下,基準測試的差距「較不足以可靠指引真實世界的差異」,而自家與 Claude Fable 5.1 的內部差距也比分數所顯示的更小。廠商願意貶抑自家的表格,是整張表中最可信的一句話。

也請注意那張表漏掉了什麼:任何 OpenAI 模型勝出的基準測試。一張只包含有利列項的廠商表格,並非全面勝出的證據,而是挑選資料列的證據。

OpenAI 自家數據怎麼說

Sol 的發布資料呈現出不同的情況,在不同的基準測試上、採用不同的測試框架。在其七月發布時所報告的:

• Terminal-Bench 2.1 — Sol Ultra 拿下 91.9%,標準版 Sol 為 88.8%,相較之下 Claude Mythos 5 為 88.0%,Claude Fable 5 則為 84.3%

• Artificial Analysis 程式編寫代理指數 — 80,當時被形容為領先 Claude Fable 5 達 2.8 分的最頂尖水準

• 長時間執行的專業工作流程「Agents' Last Exam」——53.6,OpenAI 表示這比 Claude Fable 5 高出 13.1 分

• BrowseComp — 92.2%;OSWorld 2.0 — 62.6%;SWE-Bench Pro — 64.6%

那些列中沒有一列包含 Claude Opus 5.5,因為它在七月時並不存在。Sol 的表格是為了擊敗 Fable 5 和 Mythos 5 而建立,而它也確實做到了。它是否能勝過 Opus 5.5,單憑兩家廠商的資料根本無法回答——這兩份表格是在相隔兩個月、針對不同對手的情況下彙整而成。

SWE-Bench Pro 那一列值得特別一提,因為這是 OpenAI 發布資料中唯一顯示其模型落敗的地方:Sol 為 64.6%,而 Claude Fable 5 為 80%。OpenAI 對此回應,質疑該基準測試的有效性,估計其中約 30% 的任務有問題。這很可能屬實。這也適時提醒我們,「這個基準測試有缺陷」是兩家實驗室都會提出的說法,而且總是針對他們落敗的那項基準測試。

馬具問題,沒有任何人的桌子能解決

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

這兩張表之所以對不上,不是因為有哪家廠商在說謊。而是因為代理式程式設計基準測試衡量的是模型再加上一套輔助框架,而這些輔助框架各不相同。Terminal-Bench 4.0 與 Terminal-Bench 2.1 是同一構想的不同修訂版,由不同團隊執行,有不同的工具預算與不同的重試規則。Anthropic 的 Opus 5.5 成績是在 Anthropic 自家的測試框架中產生的;OpenAI 的 Sol 成績則是在 Codex 風格工具環境中產生的。把其中任一模型放進另一方的測試框架,分數就會改變。

獨立數據——在存在的地方——所描述的競爭比這兩張表格中的任何一張都更為接近。一份來自 2026 年 8 月的第三方代理基準測試,在多個模型上針對真實應用工作運行,將 GPT-5.6 Sol 評為準確度、成本與速度的最佳組合——每次運行約 0.52 美元、五分鐘——而最準確的是 Claude Opus 5,而非 5.5,在 92% 的運行中勝出。另一份涵蓋企業程式碼任務的排行榜則將 Claude Opus 5 以 96.4% 列於第一,GPT-5.6 Sol 以 86.5% 位居第三,同樣是拿 Sol 與前一代 Opus 相比,而非新版。兩者都不是與 Opus 5.5 的正面對決,也都無法斷定任何事。它們確實證明了:當進行比較的不是廠商自己時,差距就會變小。

實際上的重點是:不要再把這些表格當成排名來讀,而要開始把它們當成一連串假設來讀。如果你的工作是長時程的終端機自動化,Anthropic 的 Terminal-Bench 差距就是一個值得在你自己的任務上測試的假設。如果那是多步驟的專業研究,Sol 的 Agents' Last Exam 結果也是同一類假設。未經實際執行,這兩個數字都無法移轉到你的工作負載上。

每完成一項任務的成本,這是唯一重要的成本

在價目表上,Claude Opus 5.5 現在雙向都更便宜:輸入為 $4.00 對上 $5.00,輸出為 $20.00 對上 $30.00,而 $0.20 的快取讀取費率比 Claude Opus 5 所收取的低了 60%。對於每個回合都會重新傳送冗長系統提示的代理而言,那一行快取費用是主要成本,也是長時間執行的 session 能在完全不變更提示的情況下大幅變得更便宜的原因。

但每 token 價格從來不是決定 AI 代理帳單的因素。OpenAI 在 Sol 推出時所提出的理由,是建立在 token 效率而非標價上——它宣稱程式編寫的 token 效率提升了 54%,輸出 token 與耗時不到 Claude Fable 5 的一半,成本則約低三分之一。Anthropic 則為 Opus 5.5 提出如鏡像般的論點:在典型工作負載下,執行成本比 Claude Opus 5 低約 40%,而費率表僅下降 20%,來自 Box、Kiro、Factory 與 GitHub 的客戶證言也都指出 token 或步驟大幅減少。兩項說法指向同一方向——能以更少回合完成的模型勝出——而且兩者都未經獨立稽核。

在確實有獨立每任務成本計算的地方,目前結果偏向 Sol:九月發表的一份分析顯示,GPT-5.6 Sol 在 SWE-bench Verified 上每解決一個問題的成本為 1.56 美元,成功率 96.2%,相較之下 Claude Opus 4.8 為 88.6%。這是拿 Sol 與較舊的 Anthropic 模型相比,而不是與 Opus 5.5 相比,所以這只是起點而非定論——但這提醒我們,第一次嘗試就解決問題的模型,會比需要三次來回才解決的較便宜模型更便宜。唯一能為你定論的衡量方式,就是用兩種方式跑你自己的任務,並把 token 數量擺在眼前。

與其說是採購問題,這更像是路由問題,而且值得把話說清楚:這問題的哪一邊其實已經可以解決了。GPT-5.6 Sol 今天已在 OrcaRouter 上,採用 OpenAI 自家的定價,0% 加價——供應商標價原封不動直接轉出,因此供應商調價當天我們這邊就即時生效,不必等同步之後。Claude Opus 5.5 還不在我們的路由之中;目前可經由 Anthropic 自家 API 與各大雲端平台取用。等它上線後,同一把金鑰就能同時服務兩者,這正是把這場實驗變成路由規則、而非多一份合約加多一套 SDK 的關鍵:把工作負載送給你自己數字更看好的那個模型,讓自動容錯移轉指向另一個,並由路由 DSL 那一行逐次請求決定,而不是逐季決定。任一邊降價都只是改設定,不是搬遷。

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

兩者真正不同之處

剝除基準測試後,仍有四項差異留存,而且全都可核查:

• 知識截止點。Opus 5.5 是 2026 年 6 月,Sol 則是 2026 年 2 月 16 日。對於任何牽涉到近期函式庫、近期事件或近期變更過的 API 的東西,四個月都是實實在在的差距,而且沒有任何基準測試能捕捉到這點。

• 防護路由。Opus 5.5 隨附 Fable 5.1 等級的防護機制:大多數網路安全請求會被重新導向至 Claude Opus 4.8,而生物學相關工作則會退回由 Claude Opus 5 處理,除非帳戶已驗證。若你的產品屬於這兩個領域之一,你的部分流量正由較小的模型回應。Sol 沒有同等且有明文記載的路由機制,不過 OpenAI 確實註明了自己的網路相關安全評估。

• 協同編排。Sol 推出 Ultra 模式,可協調多個平行子代理(預設為四個),並提供最高推理投入設定。Opus 5.5 兩者皆非平台功能;它的槓桿是 effort 參數,而多模型組合是你自行建構或路由的東西,而非供應商直接交到你手上的功能。

• 系列經濟效益。Sol 是三個等級之一,Terra 與 Luna 位在其下——而在 7 月 30 日的更新中,Luna 的價格調降了 80%,Terra 則調降了 20%。Anthropic 較便宜的同系列產品 Sonnet 5.5 與 Haiku 5.5 已宣布但尚未推出。如果你的工作負載是混合型的,OpenAI 目前就有提供較便宜的級別。

在它們之間做選擇

如果你的工作是長時間執行的代理式編碼或知識工作、如果每詞元的價格很重要、如果你的提示觸及最近四個月的任何內容,或者如果每百萬快取詞元 $0.20 的 1M 詞元上下文正是讓你的架構負擔得起的關鍵,就選擇 Claude Opus 5.5。請從等強度開始,而不是沿用繼承而來的高設定,並衡量是否撐得住。

若你想要廠商綁定的編排模式,若你現在就需要比旗艦款更便宜的層級、而不是再等幾週,或者你的工作負載正是 Sol 自家發布證據最能涵蓋的那一類——長程專業工作流程與電腦操作,且它在這些方面回報了最強勁的成果——那就選 GPT-5.6 Sol。

如果你已經在使用 Claude Opus 5,請注意 Opus 5.5 並非可直接替換:thinking 已無法停用、強制工具使用會傳回錯誤、thinking 區塊會綁定至模型與對話,而較舊的 computer_20251124 電腦使用工具則不再被 Claude API 或 Google Cloud 接受。前三項同樣適用於 Claude Fable 5.1。切換至 Sol 則是截然不同的整合方式。

真正能為這個比較定論的,是在相同投入程度、相同測試框架下,針對同一組任務,對這兩個模型進行一次獨立的執行。截至本週,還沒有人發表過這樣的結果。在有人做到之前,誠實的立場就是證據所支持的那個:Anthropic 的表格偏向 Opus 5.5,而那份表格是 Anthropic 製作的;OpenAI 的表格偏向 Sol,而那份表格是 OpenAI 製作的;現有的獨立結果是拿 Sol 與前一代 Opus 相比,並描述了一場接近得多的競爭;而將決定你帳單的兩列——每項完成任務的 token 數與快取讀取量——正是兩家廠商都不公布的那兩列。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新