
Claude Sonnet 5.5 對決 GPT-6 Sol:2 美元價位帶如今坐擁兩款旗艦
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
Claude Sonnet 5.5 與 GPT-6 Sol 的定價完全相同——每百萬輸入 token 2 美元、每百萬輸出 token 10 美元——而兩者於 2026 年 9 月下旬相隔六天推出。這個巧合並不是重點。真正有意思的是,當 Artificial Analysis 以其 v4.3.2 Intelligence Index 對兩者進行評測時,這款中階的 Anthropic 模型竟然勝過 OpenAI 一直當作旗艦產品販售的模型:Claude Sonnet 5.5 拿下 56 分,GPT-6 Sol 則是 47 分。在同一版修訂中,Claude Sonnet 5.5 所取代的 Claude Sonnet 5 則以 38 分位居其後。
所以這不再是拿廉價等級與昂貴等級相比。這是兩款同價位模型、來自兩家實驗室之間的比較,其中 Anthropic 那款與它自己的前代之間有 18 分的差距,而 Anthropic 相對於 OpenAI 最高階發布版本則有九分的領先差距。以下所有內容都是為了釐清:這些差距之中,哪些能在真實工作負載下依然成立,哪些只是基準測試的產物。
每個模型實際上是什麼
Claude Sonnet 5.5 是 Anthropic 5.5 世代的第二個模型,於 2026 年 9 月 28 日推出,距離承諾推出它的 Claude Opus 5.5 上市僅五天。claude-sonnet-5-5 這個 id,維持該層級既有的 100 萬 token 上下文窗口與 128K 輸出上限,並完全沿用 Claude Sonnet 5 的價格:輸入每百萬 token 2 美元、輸出 10 美元、快取讀取 0.20 美元、五分鐘快取寫入 2.50 美元。它從第一天起即可採用零資料保留,而 Anthropic 的退役承諾延續至 2027 年 9 月 28 日。

GPT-6 Sol 是那個名字令人困惑的 GPT-5.6 Sol 的後繼模型——OrcaRouter 仍將其列為可存取,價格為輸入 $4、輸出 $20,而 Artificial Analysis 已將其標記為已棄用,並指向 GPT-6 Sol。這款新模型於 2026 年 9 月 22 日推出,價格為 $2 / $10,具備 1,050,000 個詞元的上下文視窗、128K 的輸出上限,以及分級費率:$2 / $10 的標示價格適用於最多 272,000 個輸入詞元,超過此數的所有部分則以 $4 / $15 計費。
最後那個細節,就是「相同定價」這個說法第一個站不住腳的地方。
價格持平僅對短提示成立。
兩張費率表都標示 $2 和 $10,而幾乎所有發布日的比較都只停留在那裡。現在就決定帳單金額的條款,將兩者並列比較:
• 主要費率 — Claude Sonnet 5.5 $2 / $10 對比 GPT-6 Sol $2 / $10
• 長上下文費率 — Sonnet 5.5 對完整的 1M 視窗按標準費率計費;GPT-6 Sol 在輸入超過 272,000 個 token 時倍增至 $4 / $15
• 上下文視窗 — 1,000,000 個 token 對比 1,050,000 個 token
• 最大輸出 — 兩者在同步 API 上皆為 128K 個詞元;Sonnet 5.5 在 Message Batches API 上可達 300K,但需使用 output-300k-2026-03-24 標頭
• 批次折扣 — Sonnet 5.5 的輸入與輸出可享五折優惠;Sol 請查閱 OpenAI 現行條款,別直接假設兩者條件相同
• 快取讀取 — 兩者皆為每百萬 $0.20
一次 80 萬 token 的儲存庫掃描,在 GPT-6 Sol 上的每 token 成本是 Claude Sonnet 5.5 的兩倍,而這正是兩款模型所主打的工作負載。如果你的 prompt 很短,費率確實不相上下,價格不該決定任何事。如果你的 prompt 很長,價格早就已經決定了。
仔細看 Anthropic 自家的計分板
Anthropic 發布了一份四欄比較,對比 Claude Sonnet 5、Claude Opus 5.5 與 GPT-6 Sol。這些由廠商報告的數字,目前尚無第三方重現:

• Terminal-Bench 4.0 — Sonnet 5.5 70.6% 對比 Sonnet 5 10.3%
• FrontierCode 1.1,Main —— Sonnet 5.5 在 Max effort 下達 46.2%,Sonnet 5 為 42.4%,Opus 5.5 為 54.4%,GPT-6 Sol 為 49.3%
• CursorBench 4.0 — Sonnet 5.5 55.5% 對比 Sonnet 5 34.1% 對比 Opus 5.5 57.8%
• GDPval-AA v2.1 — Sonnet 5.5 1844 對比 Sonnet 5 1449 對比 Opus 5.5 1846 對比 GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 對 Sonnet 5 1359 對 Opus 5.5 1822 對 GPT-6 Sol 1483
• Humanity's Last Exam,使用工具 — Sonnet 5.5 64.5% vs Sonnet 5 54.9% vs Opus 5.5 67.7%
• OSWorld 2.1,部分 — Sonnet 5.5 80.1% 對比 Sonnet 5 57.0% 對比 Opus 5.5 81.8%
• Chartography,不使用工具 — Sonnet 5.5 61.6% 對比 Sonnet 5 15.6% 對比 Opus 5.5 64.4% 對比 GPT-6 Sol 53.6%
那其中有兩列帶有註腳,而兩者都很重要。GPT-6 Sol 的 GDPval-AA、AA-Briefcase 與 Chartography 數據,被 Anthropic 標註為是在 OpenAI 端修正圖像理解功能之後所測得;而 Sonnet 5.5 的 FrontierCode 數字則是其 Max-effort 結果,Anthropic 指出該結果低於它在同一項評測中的 Xhigh 結果。一家廠商在自己營運的基準測試上拿自己與對手比較,還用註腳同時對雙方加上但書,這並不是中立的證據。它是發布當日所能取得的最佳證據,但它和實測並不是同一回事。
獨立數字說明了什麼,以及它們沒有說明什麼
Artificial Analysis 已發布首份獨立測試結果:在 v4.3.2 上 Index 為 56,每項 Index 任務成本為 7.60 美元,而輸出 token 的冗長度數值為 410M,相較之下中位數為 88M。那個冗長度數字理應獲得比目前更多的關注。這意味著該模型在得出答案的過程中往往會耗費大量 token,而這正是那項並非出自 Anthropic 自家表格的效率主張背後的機制。
Anthropic 表示,Claude Sonnet 5.5 產生輸出的速度比 Claude Sonnet 5 快 30%,而且在相同的每 token 費率下,每項任務成本「最多可降低 30%」。這兩項說法合在一起,描述的是一個用更少 token 完成相同工作的模型,而不是更便宜的價目表。這種說法是否成立,正是 410M token 的冗長度讀數所要檢驗的,而單一次獨立測試並不足以定論——但已足以說明,行銷語句與實測 token 數量指向相反方向,而實測的那個數字,才是會出現在發票上的數字。
另請留意這個獨立指數尚未包含哪些內容。除了 Anthropic 之外,沒有任何其他人發表過 OSWorld、Terminal-Bench 或 CursorBench 的複現結果。而 56 這個數字是綜合分數:它完全無法說明,內部那十項評估中究竟是哪一項拉開了與 Sol 的 47 之間的差距。綜合分數領先九分,可能掩蓋了在你的工作負載所依賴的那一項評估上落後十五分的事實。
它們在價目表無法顯示的方面有何分歧
價格和指標分數是兩個簡單的軸向。真正決定是否遷移的是行為層面的因素,而在這方面,這兩個模型差距很大。

Claude Sonnet 5.5 預設會啟用自適應思考,並以 high 作為預設投入程度,且移除了前一代允許的三件事:傳送 thinking: {"type": "disabled"} 現在會傳回 400,且必須以 between_tools 取代;強制工具使用——將 tool_choice 設為 "any" 或具名工具——會直接傳回 400;而較舊的 computer_20251124 電腦使用工具在 Claude API 與 Google Cloud 上會遭到拒絕,建議改用工具集。思考區塊現在也會繫結至產生它們的模型,因此對話可以從 Claude Sonnet 5 移到 Claude Sonnet 5.5 並保留其推理,但無法再帶著它移回去。
如果你的代理迴圈設定了tool_choice: "any"來強制發出符合 schema 的呼叫,Claude Sonnet 5.5 會拒絕該請求,直到你改用auto並搭配嚴格工具使用或結構化輸出為止。這是一項貨真價實的遷移工作,也正是那種會把一行模型 ID 替換變成耗掉一整個下午的事情。
GPT-6 Sol 的切換成本性質不同,因為它所取代的模型仍在產品目錄中,且仍持續被呼叫。GPT-5.6 Sol 並未被下架;它在 Artificial Analysis 被標為已棄用,定價為新模型的兩倍,且仍持續收到流量。OrcaRouter 自己的測量顯示,它每週大約傳輸 9,500 萬個 token,這是仍有多少整合尚未遷移的合理代理指標。遷移到 GPT-6 Sol 是可以晚點再做的定價決策;你不必現在就決定。
在單一索引鍵上執行比較
雙供應商比較的實際問題在於,在你學到任何東西之前,通常得先付出兩個帳號、兩條 SDK 路徑和兩套速率限制的代價。OrcaRouter 的存在就是為了消弭這一切:一個與 OpenAI 相容的端點、200 多款模型,供應商列表價格原樣轉嫁,不收取任何加成,以及跨供應商的自動故障轉移。
這裡真正重要的兩個模型,如今都能透過它進行路由。GPT-6 Sol 已收錄於目錄中,價格為 $2 / $10,且長上下文層級維持不變,而 Claude Sonnet 5——大多數 Claude API 流量仍舊使用的模型,實測輸出速度為每秒 150 個 token,首個 token 時間的 p50 約為五秒——自 6 月 30 日起便已在該平台上線,採用 Anthropic 自家的 $2 / $10 定價。
Claude Sonnet 5.5 本身尚未列入我們的產品目錄。話雖如此,要取得它,最誠實的途徑是供應商自家的 API,以及 Anthropic 所列出的三家雲端服務;而要評估它,最誠實的方式就是讓它承接一小部分你可以承受損失的流量。這正是路由層的用途:將一定比例的流量導向它、觀察失敗率,並且把先前的模型保留為備援,而不是當成回復方案。
哪一個要上正式環境?
依工作負載的形態來挑選,而不是依綜合分數。
Claude Sonnet 5.5 在長脈絡工作上更值得入手,對於任何已經依照 Anthropic 工具使用與電腦使用介面撰寫的內容,以及提示詞經常超過二十五萬個 token 的團隊而言也是如此——在那裡,固定費率的視窗比任何指數落差都更有價值。但要接受這項遷移附帶了一份檢查清單:強制工具使用、思考切換開關、顧問工具配對,以及電腦使用工具的變更。
GPT-6 Sol 對 OpenAI 形式的技術堆疊而言是更安全的延續性選擇,而且如果你的提示簡短、整合也已建置完成,它也是更便宜的選擇。它的優勢不在於能力——在綜合表現上它落後——而在於它的前代仍在提供服務,且遷移沒有期限。
以目前可取得的數據來看,Claude Sonnet 5.5 在獨立指數的一對一較量中勝出,也在長上下文經濟效益上勝出;而且在廠商自家表格的信賴水準之外,任何已公開的量測目前都還偵測不到它有任何落敗之處。這比發布資料所宣稱的範圍更窄,而這正是值得據以行動的說法。
真正會改變答案的,是在代理式評測上再做一次獨立執行,以及兩個模型在相同任務上已公布的每任務 token 用量數字。在這兩者都出現之前,綜合指數顯示的是執行成本較低的那個模型領先九分,而綜合指數領先九分,並不等於在你的工作負載上領先九分。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
