主視覺標題卡寫著「GPT-6 Sol Pro vs Claude Opus 5」,副標題為「沒人會放進表格的努力階梯」,一組兩欄的「GPT-6 Sol Pro」/「Claude Opus 5」標籤,以及一行頁尾寫著「廠商列表未經審計;數據依 Artificial Analysis 為準。」,右下角有真正的 OrcaRouter 標誌。
Guides & Insights

GPT-6 Sol Pro 對上 Claude Opus 5:沒人會放進表格裡的努力階梯

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Sol Pro 和 Claude Opus 5 經常被拿來互相比較,而且幾乎總是在錯誤的設定下進行。流傳的那種比較,是把 Claude Opus 5 置於最高推理強度,對上同樣處於最高推理強度的 GPT-6 Sol Pro,結果在中立指數上產生三點差距,成本則相差五倍。把兩個模型都設成各自廠商出貨時的預設配置——並切記,第一個名稱中的「Pro」是推理配置,不是另一個獨立模型——三點差距就會完全消失。剩下的就只有成本差距,而這也正是整個故事中,唯一經得起實際生產帳單考驗的部分。

這不是呈現手法上的花招。這是由兩套未彼此校準的努力程度階梯所直接導致的結果;這兩套階梯由兩家廠商各自發布,而它們是以彼此的舊模型作為基準來評測的。

在任何比較之前,這兩個模型實際上是什麼

GPT-6 SolOpenAI 的中階推理模型,自 2026 年 9 月 22 日起正式提供,每百萬輸入 token 為 2.00 美元,每百萬輸出 token 為 10.00 美元。OpenAI 開發者文件中並沒有 gpt-6-sol-pro 這個模型識別碼——該頁面只列出一個 Sol 項目、1,050,000 token 的上下文視窗、922,000 token 的最大輸入、128,000 token 的輸出上限、2026 年 4 月 20 日的知識截止日期,以及一條推理投入程度階梯,依序為 none、low、medium、high、xhigh 與 max,並以 medium 為預設值。「Pro」是推理模式的一個值,與 GPT-5.6 世代所建立、並由這一代繼承的別名模式相同。確實有一個名為 GPT-5.6 Sol Pro 的第三方目錄項目存在,而且現在標價 2.00 美元與 10.00 美元——也就是 GPT-6 Sol 的數字——這是命名上的假象,不是產品。

Claude Opus 5 是 Anthropic 一款真實存在、獨立定價的模型,自 2026 年 7 月 24 日起全面開放使用,每百萬個 token 的輸入費用為 $5.00、輸出費用為 $25.00。其上下文窗口為 1,000,000 個 token,同步輸出上限為 128,000,而其自身的 effort 階梯——output_config.effort——分為 low、medium、high、xhigh 與 max,並以 high 為預設值。思考功能為自適應且預設開啟,這在 Opus 系列中尚屬首次。

還有一個塑造以下所有內容、且現有比較頁面都未提及的事實:Anthropic 自家的生命週期表將 Claude Opus 5 列為使用中(舊版),並附上遷移橫幅指向 Claude Opus 5.5,後者已於 2026 年 9 月 22 日正式推出,定價為 $4.00 與 $20.00。OpenAI 的發布圖表仍以 Opus 5 而非 5.5 作為基準進行評測。這份比較中的模型是上一代的 Opus。

兩條價格線,逐行顯示

兩者都是供應商清單——OpenAI 和 Anthropic 自行公布的數字,由代管它們的平台原樣傳遞。

• 輸入 — GPT-6 Sol 每百萬個 token 2.00 美元 vs Claude Opus 5 每百萬個 token 5.00 美元

• 輸出 — GPT-6 Sol 每百萬個 token 10.00 美元,對比 Claude Opus 5 每百萬個 token 25.00 美元

快取讀取 — GPT-6 Sol 每百萬個 token 0.20 美元,對比 Claude Opus 5 每百萬個 token 0.50 美元;兩者皆為未快取輸入費率的固定 10%

• 快取寫入——GPT-6 Sol 在單一 TTL 下為每百萬個 token $2.50,而 Claude Opus 5 在五分鐘 TTL 下為 $6.25、一小時 TTL 下為 $10.00;較長的 TTL 是 OpenAI 並未提供的選項,而它正是大多數比較表無意間引用的那個層級,因為它就是出現在代管目錄卡片上的那一個

• 長上下文處理 — GPT-6 Sol 會將超過其輸入門檻的請求,以較高費率對整筆請求計價;Claude Opus 5 則完全不收取長上下文附加費,因此一筆 900,000 個 token 的請求,與一筆 9,000 個 token 的請求,會以相同的每 token 費率計費

• 批次 — GPT-6 Sol 的批次端點採標準折扣,而 Claude Opus 5 的 Message Batches API 雙向皆為五折,且 Anthropic 的批次折扣可與提示快取疊加

• 上下文視窗 — GPT-6 Sol 1,050,000 個詞元,對比 Claude Opus 5 的 1,000,000 個詞元

• 最大輸出 — 兩者皆為 128,000 個 token,而 Claude Opus 5 在 Message Batches API 上搭配 output-300k-2026-03-24 beta 標頭時,可將此上限提升至 300,000

這份清單上最少被討論、卻最能改變算術的一條路線,就是批次處理加快取的組合。若 50% 的批次折扣能與以十分之一輸入費率計價的快取讀取併用,那就和單獨的 50% 批次折扣是截然不同的方案;而對於長時間的合成工作——Anthropic 的 300,000-token 批次輸出上限同樣適用——它能彌補以定價計算時看似無法跨越的落差中相當可觀的一部分。

A two-column scoreboard card titled 'GPT-6 Sol vs Claude Opus 5 - the scoreboard'. Left column 'GPT-6 Sol': AA Index, max effort 48; AA Index, default effort 48; cost per task, max $1.06; cost per task, default $0.37; price in/out $2 / $10; context window 1.05M. Right column 'Claude Opus 5': AA Index, max effort 51; AA Index, default effort 48; cost per task, max $5.86; cost per task, default $3.61; price in/out $5 / $25; context window 1M. A footer line reads 'Vendor list prices; index figures per Artificial Analysis.', with the real OrcaRouter logo bottom-right.

努力階梯才是實際的比較

這是應該出現在每一篇這類文章裡的數字。在 Artificial Analysis 上,其測試框架是唯一中立、且會公布這兩個模型完整努力程度階梯的框架,Claude Opus 5 在最高努力程度下得分 51,每項指數任務花費 5.86 美元。在其預設的高設定下,得分 48,花費 3.61 美元。GPT-6 Sol 在最高努力程度下得分 48,花費 1.06 美元——而在高努力程度下得分 43,花費 0.37 美元。

把這兩行放在一起讀。Claude Opus 5 以 Anthropic 出貨時的預設 effort 設定運行,所得指數分數與全力運轉的 GPT-6 Sol 完全相同。發表報導所稱的差距——三分——只有在把每個模型都調到自身刻度最高點相比時才成立,而刻度最高點並非這兩個模型預設運行的位置。Opus 5 在最大 effort 下的優勢確實存在,但若要取得這項優勢,每完成一項任務的成本大約高出五倍半。

那兩個數字理應附帶兩項誠實的但書,而引用它們的頁面兩者皆無。

• 指數版本會變動。自七月以來,在 Artificial Analysis 指數的歷次修訂中,Opus 5 的分數先後公布為 61、63、54 和 51。這些數字本身都沒有錯;但少了版本標籤,每一個都是錯的。上方的 51 是目前榜單上的數字,不能拿來與發表日文章中引用的 61 相比。

• 投入程度階梯並未在各家供應商之間進行校準。某個模型上的「高」,與另一個模型上的「高」,並不是相同程度的思考量。在名義上不同的設定下得到相符的分數,是關於成本的證據,而非能力對等的證據。

獨立紀錄比表面上看來更薄弱之處

Claude Opus 5 背後已有八週的第三方測量,以及一組清楚標示為廠商自行回報的發布數字——Frontier-Bench v0.1 為 43.3%,ARC-AGI-3 為 30.2%,GDPval-AA v2 為 1,861 Elo。上述每一項都是對照 GPT-5.6 Sol 或 Claude Fable 5 測得的,而非對照 GPT-6 Sol。在任何地方,都沒有共同測試框架的結果能讓 Opus 5 與 GPT-6 Sol 在 Anthropic 自家基準測試上一較高下,而 Anthropic 的系統卡也承認,該模型整體能力並未優於 Claude Fable 5。

這份獨立紀錄同時也帶來了另一個方向的但書。在 Artificial Analysis 的 AA-Omniscience 評估中,Opus 5 的幻覺率為 50%,比 Opus 4.8 高出十四個百分點——有紀錄可查的原因在於拒答率從約 23% 降至 7%,因此模型回答了更多問題,也就答錯了更多題。Vals AI 另行揭露,在 Terminal-Bench 執行期間,Opus 5 與 Fable 5 曾以 Opus 4.8 作為拒答的備援;將九個受影響的通過案例重新歸類為失敗後,Opus 5 的成績從 84.64% 降至 81.27%。這些發現並不構成喪失資格的問題,但一篇主張 Opus 5 是更可靠選擇的報導,必須把它們一併附上。

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing an Artificial Analysis Intelligence Index of 48 at maximum reasoning effort and 43 at high effort, a cost per index task of $1.06 and $0.37, a 1.05M-token context window, a 128k-token maximum output, and blended list pricing of $2.00 per million input tokens and $10.00 per million output tokens, above the 'Intelligence Index vs Cost to Run Intelligence' scatter chart with the reasoning-models-only filter applied.

GPT-6 Sol 的獨立紀錄,本週只有一個數字那麼寬:上方那個指數分數,是在最大投入下測得的,而它背後有十八個月的模型發表所累積的第三方測試。這種不對稱——八週的審視對上一天——才是買家可能仍願意支付五倍溢價的誠實理由,而這個理由也比那三個百分點的頭條數字更好。

路由層改變決策之處

Claude Opus 5 已在 OrcaRouter 的型錄中,每百萬個 token 的價格為輸入 $5.00、輸出 $25.00、快取讀取 $0.50、快取寫入 $10.00,並具備 1,000,000-token 的上下文視窗、128,000-token 的輸出上限,以及 /v1/chat/completions 和 /v1/messages 兩個端點——供應商的定價原樣傳遞,不額外加價,因此 Anthropic 一調價,我們這邊當天就會同步生效。模型卡上的快取寫入數字是一小時 TTL 的費率;Anthropic 的五分鐘級別則是 $6.25,而只引用其中一個卻不說明是哪一個,正是這兩個數字最後看起來互相矛盾的原因。

GPT-6 Sol 並非我們的供應路線之一,因此此處並無任何內容是關於透過我們取得其價格的聲明。

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), captured 23 September 2026, showing an input price of $5.00 per million tokens, an output price of $25.00 per million tokens, a 1,000,000-token context window, a 128,000-token output cap, reasoning and tools tags, a 'Traffic — Last 7 days' section, and both the /v1/chat/completions and /v1/messages endpoints.

在這場對決中,單一端點真正換來的,是能同時容納兩種答案。支持 Opus 5 的理由與支持 Sol 的理由都取決於 effort,而 effort 是每次請求的參數,不是合約條款。團隊若把兩個模型都放在同一把金鑰之後,並具備自動容錯移轉,就能把需要 Opus 5 最高 effort 上限的工作送給 Opus 5,並把高流量的工作以中等 effort 交給 Sol,不必再做第二次整合,也不必再應付另一組速率限制。路由 DSL把這項決策編寫進呼叫之中,而不是編進一個遷移專案——這點在這裡尤其重要,因為這對組合的正確答案取決於請求,而不是取決於季度。

決策規則

• 以明確品質標準進行大量作業——GPT-6 Sol 採中等或高強度投入。每項任務 0.25 美元、共四十個索引點,是這個看板上最便宜且可信的行情,而投入強度旋鈕是有明文記載的參數,不是憑猜測。

• 需要能力範圍頂端且能負擔得起的工作——以 xhigh 或 max 運行的 Claude Opus 5。比 Sol 的上限高三個指數點,每項任務 $4.88 至 $5.86,而且是兩者中唯一具備 300,000 token 批次輸出上限者。

• 大型語料庫批次作業 — Claude Opus 5,依據的是結構性論據,而非按 token 計價的論據。無長上下文附加費,批次折扣可與快取疊加,並針對存活超過五分鐘視窗的前綴提供一小時的快取 TTL。

• 任何錯誤答案代價高昂的情況——就目前的紀錄來看,兩者皆非。Opus 5 的幻覺率在此次發布時上升了十四個百分點,而 Sol 的第三方紀錄只有單一個數字,單薄得很。

• 如果你看到的比較是「Opus 5 max 對上 Sol max」——在做決定之前,請以預設 effort 重新跑一次。真正做出決定的關鍵就在這裡,而這正是現有涵蓋範圍從未向你展示的那一項配置。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新