
GPT-6 對決 Claude Opus 5:這場較量的雙方都已被取代
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
相比,最值得知道的一點GPT-6與Claude Opus 5是:這場對決的雙方都比各自的廠商落後一個世代。Claude Opus 5 於 2026 年 7 月 24 日推出,並於 9 月 22 日被 Claude Opus 5.5 取代。GPT-6 Sol 於 9 月 22 日推出,並於 9 月 29 日被 GPT-6.1 Sol 取代。如果你搜尋這篇比較,是因為你正在為新的工作從兩者中做選擇,那你其實是在兩個各自廠商都已超越的模型之間做選擇——而這篇文章誠實的版本,談的是這對較舊的組合何時仍是正確的選擇,而不是誰勝出。
這兩個模型實際上究竟是什麼
Claude Opus 5 是 Anthropic 的旗艦模型:1,000,000 個 token 的上下文視窗、128,000 個 token 的最大輸出量,支援文字、圖像與檔案輸入,定價為每百萬個輸入 token 5.00 美元、每百萬個輸出 token 25.00 美元,快取輸入費率為 0.50 美元,快取寫入費率為 10.00 美元。它是單一模型、單一 id,anthropic/claude-opus-5。
GPT-6 Sol 是三模型世代中的中階款——GPT-6 Astra在其之上,GPT-6 Luna在其之下——同樣具備 1,000,000 個 token 以上的上下文(型錄上 OpenAI 這邊列為 1,050,000,而 Opus 5 為 1,000,000)、同樣 128,000 個 token 的輸出上限,以及同樣的文字/圖片/檔案輸入。其定價為 $2.00 / $10.00,快取輸入費率 $0.20,快取寫入費率 $2.50。它的費率表帶有一項 Anthropic 費率表所沒有的級距:任何輸入超過 272,000 個 token 的要求,會將整筆要求重新計價為 $4.00 / $15.00。
那代表在短端,每個 token 的價格差距為 2.5 倍,且對 Sol 有利;這項差距在快取上也成立——Sol 的快取輸入折扣為 90%,而 Opus 5 為 98%,這會把差距縮小到每百萬 $0.20 對 $0.50,而非消除它。在長上下文工作負載下,差距會減半,而非消失。
• 輸入 — GPT-6 Sol 每百萬 $2.00 vs Claude Opus 5 $5.00
• 輸出 — GPT-6 Sol 每百萬 $10.00 vs Claude Opus 5 $25.00
• 快取輸入 — GPT-6 Sol 每百萬 $0.20 vs Claude Opus 5 $0.50
• 快取寫入 — GPT-6 Sol 每百萬 $2.50 vs Claude Opus 5 $10.00
• 超過 272K 輸入 — GPT-6 Sol 會將整個請求重新計價為 $4.00 / $15.00;Opus 5 的價目表上沒有對應的級距
• 上下文與輸出 — 1,050,000 輸入與 128,000 輸出 vs 1,000,000 輸入與 128,000 輸出
獨立板,其中差距大於價格
價格上,GPT-6 Sol 以 2.5 倍勝出。排行榜對 Claude Opus 5 的青睞,比價格差距所暗示的還要多,這與一般便宜模型的情況相反。
• AA Intelligence Index — Claude Opus 5 50.8,排名第 11;GPT-6 Sol 47.6,排名第 14
• AA Coding Index — Claude Opus 5 78.0,在該榜單排名第 2;GPT-6 Sol 60.0
• GPQA Diamond — Claude Opus 5 93.2
• Humanity's Last Exam — Claude Opus 5 54.9 對上 GPT-6 Sol 47.9
• Terminal-Bench 2.1 — Claude Opus 5 89.1
• Terminal-Bench 4.0 — Claude Opus 5 49.0 對上 GPT-6 Sol 43.9
• τ-bench 銀行 — Claude Opus 5 42.1
• SciCode — Claude Opus 5 56.4 對上 GPT-6 Sol 57.6
• 長上下文召回 — Claude Opus 5 79.3 對上 GPT-6 Sol 83.7
有兩列結果朝相反方向發展,值得特別點名,因為總體數據會把它們掩蓋過去。GPT-6 Sol 在長上下文回憶上以 4.4 分擊敗 Opus 5,並在SciCode上以 1.2 分略勝一籌。所以,誠實的樣貌並非「Opus 5 什麼都更強」——而是 Opus 5 在程式設計與代理任務榜單上明顯領先(Coding Index 領先 24 分,屬於不同等級的結果),而 Sol 則守住長視窗檢索這一列,並在兩項科學程式碼衡量指標之一打平。
在任何一方引用這兩個數字之前,先提出一項方法上的告誡:Artificial Analysis 並不保證兩個模型頁面是在同一天、依據同一版指數修訂所呈現,而且它會把同儕群組拆開——開放權重模型是與同一規模級別的其他開放權重模型一起排名,專有模型則是在專有價格帶內互相比較。這裡的兩個模型都屬於專有模型,因此這兩個數字出自那條界線的同一側,但請把未滿一分的差異視為方向性指標,而非受控的測量結果。本文中每一項廠商數據,都是廠商以自家模型對自家前代模型進行基準測試的結果,並且已如此標示。
這兩項替換改變了什麼
Claude Opus 5.5於 9 月 22 日登場,價格為 $4.00 / $20.00——在兩項計費指標上都比 Opus 5 便宜,快取輸入費率 $0.20 則與 Sol 相同——並在同一項 Intelligence Index 上拿下 57.6 分。這比 Opus 5 高出 6.8 分,費用卻少 20%。任何主張在新專案中繼續使用 Opus 5 的論點,都必須解釋為何值得為了留在較舊的檢查點上,付出 6.8 個指數分數以及每百萬 $1.00/$5.00 的代價。
GPT-6.1 Sol於 9 月 29 日推出,定價與 GPT-6 Sol 同為 $2.00 / $10.00,在該指數上拿下 51.8 分,而 Sol 為 47.6 分,其 $0.10 的快取輸入費率讓快取讀取成本減半。同樣的價格,更好的分數,更佳的快取經濟效益。唯一專為 GPT-6 Sol 辯護的理由,也正是適用於 Opus 4 的那個理由:一套以其為基準建立的回歸測試套件,一旦更換模型,你原本信賴的比較結果就會失效。
團隊仍留在較舊的那一組模型,還有第二個、較不張揚的理由,而這與基準測試無關。這兩者都是背後擁有最長生產歷史的檢查點。Opus 5 自 7 月 24 日起即可呼叫,GPT-6 Sol 則自 9 月 22 日起,而獨立評估者對兩者的量測已持續夠久,足以顯示出一個輪廓,而非單一讀數。在我們自家的路由資料中,Sol 過去七天的流量約為 210 萬個 token;Opus 5 則約為 2,300 萬個。那些是滾動視窗,而非累計總量,且每次讀取之間都會變動——但它們提醒我們,即使替代品已經推出,Opus 5 仍在生產環境中做著真正的工作。
延遲與成本的形態,正是 Sol 證明其價值之處
• 首個詞元的中位時間 — GPT-6 Sol 6,785 毫秒 vs Claude Opus 5 4,652 毫秒
• 輸出速度中位數 — GPT-6 Sol 179.6 tokens/s vs Claude Opus 5 82.2 tokens/s
• 我們這端觀察到的七日流量 — GPT-6 Sol 約 210 萬 tokens,Claude Opus 5 約 2,300 萬 tokens
Sol 大約在 2.1 秒後才給出首個 token,但隨後串流速度是 Opus 5 的兩倍以上。在長時間生成中——也就是輸出是數千個 token 而非數十個的那種執行——第二個數字才是關鍵,而較便宜、能更早完成的模型,其價值高於價目表所顯示的。在簡短且對延遲敏感的呼叫中,使用者感受到的則是首個 token 的那個數字。
這兩者都是來自我們自家路由的服務量測,取自滾動的七天窗口,而且每次讀取都會有所漂移。它們適合用來比較兩個模型的形態,不適合引用作為服務等級期望。

當移轉尚未定案時執行此配對
這個比較之所以值得回答,是因為每一次替換都不是能直接套用的決定。如果你的評估是以 Claude Opus 5 為基準建立的,那麼改用 Opus 5.5 是重新建立基準,而不是升級;GPT-6 Sol 對上 GPT-6.1 Sol 也是如此。在那個空窗期裡,有用的做法是在你自己的流量上並行運行兩個世代,而不是根據別人的排行榜來做選擇。
這四個模型都收錄在 OrcaRouter 的同一個目錄裡——Claude Opus 5、Claude Opus 5.5、GPT-6 Sol 與 GPT-6.1 Sol,透過單一 API 呼叫,前方串接 200 多個模型,並以 0% 加成原樣傳遞供應商的定價,因此廠商降價當天這裡就會同步跟進,而不是等到你下次對帳才反映——這使得比較成了路由問題,而非採購問題。路由 DSL 讓你依請求大小或流量比例來拆分:把一部分正式流量送往較新的檢查點,用你自己的評估與基準線比較,數字站得住腳時就擴大比例,而在還沒站得住腳之前,把較舊的模型留作備援。跨供應商的自動容錯移轉則涵蓋了路由在遷移途中劣化的情況,而這正是會讓人半途放棄遷移的失敗模式。


既然兩者都已被取代,誰該選哪一個?
如果你要開始新的專案:兩者都不選。Claude Opus 5.5 比 Claude Opus 5 更便宜,而且分數高出 6.8 分;GPT-6.1 Sol 與 GPT-6 Sol 價格相同,但指數更佳,快取讀取也減半。唯一該從較舊那組開始的理由,是你硬性依賴一個無法更換的檢查點。
如果你已經在跑其中一個:這個決定關乎你的迴歸測試套件,而不是那些排行榜。Claude Opus 5 仍然是兩者中較強的程式編寫與代理式模型,而且領先幅度很大,因此在它上面穩定運作的程式編寫管線,應該拿來跟 Opus 5.5 比較,而不是橫向遷移到 GPT-6 等級。在 GPT-6 Sol 上高用量、成本敏感的管線,升級起來更輕鬆——價格相同、分數更好、快取更好——而延後升級的誠實理由,只是你還沒重新跑過你的評估。
而如果你想要的答案,單純只是這兩者之中誰勝出:幾乎在每一張排行榜上,都是 Claude Opus 5,代價是要多付 2.5 倍的錢。GPT-6 Sol 的理由從來不是它更強,而是它便宜到值得這個差距——而這個理由如今屬於同價、分數卻更好的 GPT-6.1 Sol。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
