
GPT-6 對比 Claude Opus 5.5:人人剛拿到的那款模型,對上依然領先的那一款
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
2026 年 10 月 7 日,GPT-6 成為每週超過 12 億 ChatGPT 使用者與之交談的模型,而它仍然不是獨立排行榜上得分最高的模型。GPT-6 Sol——OpenAI 為 ChatGPT Plus、Pro、Business 和 Enterprise 啟用的層級——在 Artificial Analysis 的 Intelligence Index v4.3.2 上得分 47.6。Claude Opus 5.5 由 Anthropic 於 2026 年 9 月 22 日推出,定價為每百萬輸入符元 4.00 美元、每百萬輸出符元 20.00 美元,在同一版本上得分 57.6。十分之差,而且是在兩家廠商行銷團隊唯一願意被評分的那項衡量指標上。
那個落差是真的,我不會去淡化它。但它也是十月這組配對中最不有趣的事實,因為本週改變的並不是某個基準測試。GPT-6 隨著一項 OpenAI 稱之為 Intelligent UI 的能力,在 ChatGPT 中向所有人推出,而驅動該波推出付費層級的模型是 GPT-6 Sol。所以有用的比較不再是「哪個 API 更好」——而是「剛獲得 GPT-6 的 12 億人實際得到了什麼,而這是否足以讓開發者或團隊停止為 Claude Opus 5.5 付費」。這兩個答案不同,而差異不在那十分。
10月7日究竟改變了什麼?
若要精確說明日期,因為這並不是一次產品發布:GPT-6 Sol 與 GPT-6 Luna 已於 2026 年 9 月 22 日以 API 模型的形式推出。旗艦級的 GPT-6 Astra 問世時間更早——OpenAI 於 2026 年 9 月 3 日發布。10 月 7 日發生的事,是 GPT-6 在全球範圍內登上 ChatGPT 的 Chat 分頁,適用於 Plus、Pro、Business 與 Enterprise,而 Free 與 Go 方案則自 10 月 8 日起跟進;企業版存取權仍取決於職場管理員的設定。這是一次發布範圍擴大的事件,而非一次產品發布,而對於任何閱讀較舊報導的人來說,這項區別都至關重要。
附加於其上的能力才是真正全新的部分。智慧介面讓 GPT-6 能以文字、圖形、可點擊按鈕、表單和圖表組成答案,依每個問題選用合適的形式,並在模型生成時串流輸出介面。OpenAI 自己的說法是,比較可能以並排方式呈現,解釋可能以互動式圖表呈現,而當文字才是正確答案時,則以純文字回答。伴隨而來的還有兩項由廠商自行報告的內部結果:在高價值的日常代理任務上,GPT-6 在 Extra High 努力程度下開始回答的時間與 GPT-5.6 在 Medium 時相同,但整體得分優於 GPT-5.6 在 Extra High 時;而在需要網路搜尋的問題上,GPT-6 Instant 平均比 GPT-5.6 Instant 提早 44% 開始回答。這兩項都是 OpenAI 的數字,轉錄自其自家公告,且兩者都尚未有獨立重現。
兩張費率卡,以及那十點是在哪裡購買的
本週這兩個模型都沒有調整價格。Claude Opus 5.5 自 9 月 22 日起,輸入一直是 $4.00、輸出是 $20.00。GPT-6 Sol 自同日起也一直是 $2.00 和 $10.00。每個維度一行,每行都包含雙方:
• 重點輸入價格 — GPT-6 Sol 每 1M 為 $2.00,對比 Claude Opus 5.5 的 $4.00;Sol 只要一半價格
• 重點輸出價格 — GPT-6 Sol 每 1M 為 $10.00,對比 Claude Opus 5.5 的 $20.00;同樣是一半
• 長上下文條款 — 當輸入超過 272,000 個 token 時,GPT-6 Sol 會將整個請求重新計價為輸入 $4.00、輸出 $15.00;Claude Opus 5.5 在其 1M 視窗中沒有可比的級距
• 快取輸入 — GPT-6 Sol 每 1M 為 $0.20,對比 Claude Opus 5.5 的 $0.20;持平
• 執行完整 Intelligence Index 測試套件的成本 — Claude Opus 5.5 每項任務 $5.98,對比 GPT-6 Sol 的 $1.04,以 5.7× 的價差換來這十分
• 上下文視窗 — GPT-6 Sol 1,050,000 個 token,對比 Claude Opus 5.5 的 1,000,000 個,而兩者的輸出上限皆為 128,000 個 token

第四行才是決定大多數實際部署的關鍵,而它不是行銷頁面上的那一行。GPT-6 Sol 的長上下文附加費相對於它自己的宣傳數字相當激進:一旦請求超過 272,000 個輸入 token,整筆請求就會以 4.00 美元和 15.00 美元的費率計費,而不只是超出的部分。對於一個在上下文中持有大型文件、進行長時間工作階段的 agent 來說,這悄悄抹去了大部分的半價優勢。Claude Opus 5.5 沒有同等的級距設計,因此一筆 400,000 token 的請求,其每 token 費率與一筆 4,000 token 的請求相同。
這十個點所在的位置,因為它們並未均勻分佈
指數型綜合指標會掩蓋自身的組成成分,而這一個更藏著異常參差不齊的樣貌。請調出個別評估值,好讓兩家廠商的數字都能拿來對照:
• 人類的最終考試 — Claude Opus 5.5 61.4% 對 GPT-6 Sol 47.9%,在抽象推理上相差 13.5 個百分點
• SciCode — Claude Opus 5.5 66.9% 對 GPT-6 Sol 57.6%,在研究級程式碼上相差 9.3 個百分點
• Terminal-Bench 4.0 — Claude Opus 5.5 59.6% 對 GPT-6 Sol 43.9%
• 長脈絡記憶召回 — Claude Opus 5.5 84.7% 對 GPT-6 Sol 83.7%,相差 1.0 個百分點,是本頁差距最小的一項
• 多輪代理式工具使用 — 這兩個模型在 τ²-Bench 系列上僅相差幾分,兩者都很強

分佈才說明一切。在抽象推理方面——一道困難的考試題、一個沒有現成答案可抄的研究問題——Claude Opus 5.5 明顯領先,而且差距太大,不可能是雜訊。至於從極長輸入中提取一項事實,兩者實際上旗鼓相當,而 GPT-6 Sol 的上下文視窗略大一些。如果你的工作負載是長文件檢索與長時間工作階段的代理工作,那十分差距大致上是別人的問題。如果是新穎推理,那十分差距就是你的問題,而要避開它,每項任務得付出 5.7× 的成本。
ChatGPT 的推出告訴了你什麼,又沒告訴你什麼
有人會忍不住把「現在有 12 億名每週使用者都能使用 GPT-6」解讀成關於能力的證據。其實不然。這是關於散布的證據,而且 OpenAI 明確表示,ChatGPT 的推出是由付費方案的 GPT-6 Sol,以及 Free 與 Go 的 GPT-6 Luna 所驅動,兩者都「針對日常對話調校」——與 API 產品不同的最佳化目標。Work 與 Codex 背後的模型並未因這次發布而改變,這是整份公告中最清楚的一個訊號:這次是消費端介面上的事件,而非能力發布。任何人若要以「12 億人使用的 GPT-6」進行基準測試,就應該知道自己衡量的是經過聊天調校的部署,而不是 API 端點。
推出真正改變的是預設值。一個單純對所有人都唾手可得的模型,最終會出現在更多原型、內部工具和半途而廢的個人專案中,遠多於一個你必須刻意挑選的模型。如果你要為某個長期耐用的東西挑選 API,那種普遍存在的熟悉感確實有價值——但它不值得十個指數點,也不值得在推理密集型流程中付出每項任務 5.7 倍的成本。
不選擇而同時執行兩者
對「我該不該換」這個問題,誠實的答案是:這兩個模型想做的事不一樣,而該不該換的問題,基本上是個路由問題。兩者都在 OrcaRouter 的目錄中——GPT-6 Sol 為供應商的 $2.00/$10.00,$4.00/$15.00 的長上下文級距也原樣照搬,而Claude Opus 5.5 為 $4.00/$20.00——背後只需一組金鑰和一個與 OpenAI 相容的端點,且在供應商定價上零加成。在供應商調整消費端推行方案的那一週,這點比平常更重要,因為我們的價格線是供應商的,不是我們自己的。
適合這組搭配的模式是分流:把長文件與長會話流量導向兩者中在該 token 數下較便宜的那一個——而在超過 272,000 個 token 之後,那就不再是 GPT-6 Sol——並把新穎推理流量導向 Claude Opus 5.5,同時將 GPT-6 Sol 保留為自動容錯移轉,這樣一來,某一條路由遇到速率限制,就不會變成你這邊的服務中斷。你不必為了解決那十點爭論才能上線;你只需要知道自己的哪些請求落在分布中那個適用此模式的區段裡。

判決,不過如此
Claude Opus 5.5 在兩家實驗室都有公布數據的那項衡量指標上是更好的模型,而且在對高難度推理最重要的兩項評估上,差距毫不接近。GPT-6 Sol 以公告牌價而言只要一半的價格,在獨立測試套件上的每項任務成本只有五分之一,而且如今已是你多數同事早就開著的那款應用程式中的預設模型。這兩個事實本週都沒有改變;改變的是,GPT-6 不再是某個你必須去選擇的東西,而成了你已經擁有的東西。
最值得觀察的是,OpenAI 的下一步究竟是能力上的一大步,還是又一次通路布局的一步。它自家的公告已明確設下這樣的期待——該公司表示,希望 ChatGPT 能隨著時間推移,打造出更多人們所需的介面——而那是一份關於接觸介面的路線圖,不是關於評測指標的路線圖。如果你的決策取決於評測指標,Claude Opus 5.5 依然是贏家。如果取決於大量使用下的成本,以及該模型是大家早已熟悉的選擇,那麼 GPT-6 Sol 是現今較安全的預設選項,而長上下文條款則是其費率表中你必須編列預算的那一行。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
