為 GPT-6.1 Sol 與 Claude Opus 5.5 產生的主視覺卡片,標題為「真實的落差,卻分布不均」,並附有兩張資訊卡,分別寫著「GPT-6.1 Sol:智慧指數 51.8、每項指數任務 $0.72、長上下文召回率 83.0%」與「Claude Opus 5.5:智慧指數 57.6、每項指數任務 $5.98、長上下文召回率 84.7%」,頁尾寫著「數據依據 Artificial Analysis,Intelligence Index v4.3.2,兩款模型皆以其最高投入設定呈現。」,右下角則有 OrcaRouter 標誌。
Guides & Insights

GPT-6.6 Sol 對決 Claude Opus 5.5:真實的差距,分佈不均

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

5.8 分的差距Claude Opus 5.5與GPT-6.1 Sol之間;在 Artificial Analysis Intelligence Index 上,這是這組配對中最大的,而且與其中大多數不同,這個差距不會因為某個設定變更而縮小。Claude Opus 5.5 於 2026 年 9 月 22 日發布,定價為每百萬輸入 token 4.00 美元、每百萬輸出 token 20.00 美元,得分 57.6。GPT-6.1 Sol 於 2026 年 9 月 29 日發布,定價為 2.00 美元與 10.00 美元,得分 51.8。Claude Opus 5.5 是得分較高的模型,其領先幅度大於大多數前沿模型彼此之間的差距,而它為了達到這個成績,每項任務的成本高出 8.3 倍——5.98 美元對上 0.72 美元。到目前為止,昂貴的模型就是單純勝出,而這是這種比較中最不有趣的版本。真正讓它值得一讀的是,這 5.8 分並非平均分布在整個測試套件上:在決定大多數長文件與長工作階段作業的那一個軸線上,這兩個模型彼此之間的差距在兩分以內。

兩者都是同一市場定位的旗艦模型:1M 級別上下文視窗、128K 輸出上限、文字、圖像與檔案輸入,一邊具備延伸思考,另一邊則有五級努力階梯。Claude Opus 5.5 接替 Claude Opus 5,定位於高要求的推理、編程與長時程代理式工作;GPT-6.1 Sol 位於 GPT-6 Astra 之下一個層級,定位於代理式編程、電腦操作與文件繁重的專業工作。它們瞄準的是相同的工作。量測結果顯示,它們並非在所有這些工作上同等擅長。

5. 點實際上究竟在哪裡

指數綜合值會掩蓋它的組成成分。把個別評估值抽出來,那道落差就不再像一道落差,而開始像一份側寫。

• 人類最後的考試 — Claude Opus 5.5 61.4% 對 GPT-6.1 Sol 52.9%,在抽象推理上相差 8.5 個百分點

• SciCode — Claude Opus 5.5 66.9% 對上 GPT-6.1 Sol 54.2%,在研究級程式碼上相差 12.7 個百分點

• 長上下文召回 — Claude Opus 5.5 84.7% 對比 GPT-6.1 Sol 83.0%,在從長輸入中擷取事實方面相差 1.7 個百分點

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6%,相較於未在同一修訂版本中公布的 Sol 數據

• 上下文視窗 — GPT-6.1 Sol 為 1,050,000 個詞元,Claude Opus 5.5 則為 1,000,000 個詞元,兩者的輸出上限皆為 128,000 個詞元

• 每個索引任務的成本 — Claude Opus 5.5 $5.98 對比 GPT-6.1 Sol $0.72

分布本身才是重點。當任務是抽象推理——一道艱難的考題、一道沒有現成答案可抄的研究級程式設計問題——Claude Opus 5.5 明顯領先,而 SciCode 上 12.7 分的差距並不是雜訊。當任務是在極長的輸入中找到正確的段落並加以運用時,這兩個模型實際上旗鼓相當,而 GPT-6.1 Sol 以多出 50,000 個 token 的容量守住這個位置。在生產環境的 LLM 工作中,有很大一部分屬於第二類:檢索增強式問答、合約與申報文件審閱、日誌與逐字稿分析、大型儲存庫的程式碼審查。這類工作看的是第三個項目,而不是前兩項,而在那一項上,多付的溢價只換來 1.7 分。

誠實地讀取索引資料列

這兩項但書應該緊鄰那些數字,而不是放在頁面底部。

各項配置有所不同。Artificial Analysis 以「Max, Default Fallback」配置圖表呈現 Claude Opus 5.5,並以最高 effort 呈現 GPT-6.1 Sol。兩者都是各模型公開發布時最強的設定,這讓比較具備公平性,但這比較的是兩個上限,而非兩個出貨預設值。Claude Opus 5.5 在代管 API 中自身的預設值,可能與圖表所呈現的執行結果不同,而 GPT-6.1 Sol 的預設 effort 為 medium。

Terminal-Bench 那一列刻意在其中一側留空。Claude Opus 5.5 的 59.6% 來自它發布時所屬的 Artificial Analysis 修訂版本;而對應的 GPT-6.1 Sol 數字在相符的修訂版本中並不可得。引用同一基準測試不同執行回合的數字會構成不實比較,誠實的做法是讓該格留空,而不是填入近似正確的內容。

冗長度在這裡造成的影響方向,與它對上更便宜的兄弟模型時相同:Claude Opus 5.5 在索引套件上產生 2.6 億個輸出 token,而 GPT-6.1 Sol 為 6,700 萬個,差距達 3.9 倍,而且其費率本來就已經是對方的兩倍。當價目表顯示輸入 2 倍、輸出 2 倍時,每項任務 8.3 倍的比率就是這樣來的。這個溢價之所以是 8.3 倍,並不是因為模型貴了 8.3 倍——而是因為它貴了 2 倍,而思考時間多了 3.9 倍。

為它付費的理由

若您的工作內容與前兩點相符,計算方式就很直接,而且結果對 Claude Opus 5.5 有利。在研究等級的科學程式碼上相差 12.7 分,或在艱深抽象推理上相差 8.5 分,正是「能無人看管地結掉一張工單的代理」與「每三步就需要真人介入的代理」之間的差別。在大型程式碼庫上進行代理式編碼,是兩家供應商最先點名的工作負載,也是差距最懸殊的工作負載。每項任務多付 5.98 美元而非 0.72 美元,只為避免一次讓工程師耗掉二十分鐘的失敗執行,這根本不是難以取捨的抉擇。

還有第二個論點,它完全與分數無關。Claude Opus 5.5 問世十五天,已累積了大量第三方評估、審查與部署經驗,這是問世僅八天的模型所沒有的。就生產路徑而言,周邊知識的成熟度具有某種價值,而這是該指數沒有反映出來的。

反對的理由,以及決定結果的數字

反面論點在於長上下文那一列。如果你的流量主要型態是「大量輸入、簡短回答」——而且對許多團隊來說正是如此——那麼你被收費所依據的軸線,並不是你實際消耗的軸線。在長上下文召回上,這兩個模型相差 1.7 個百分點,價格比卻是 8.3 倍,而且較便宜的模型還擁有更大的視窗。這正是那種情況:溢價真實、可量測,卻花在工作負載從未發揮的能力上。

那麼,決定性的數字並不是那個指標。而是你的任務中看起來像 SciCode、而非像回憶的占比。能從自家日誌回答這個問題的團隊,就應該從自家日誌來回答;基準測試套件只是各種工作混合的代理,而那個混合比例才是變數。

兩者都在同一個按鍵上,而這正是這個問題之所以能夠被回答的原因。

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5 已在 OrcaRouter 上,價格為其專屬的 $4.00 / $20.00,快取讀取為 $0.20。GPT-6.1 Sol 在 OrcaRouter 上為 $2.00 / $10.00,當提示 token 超過 272,000 時調整為 $4.00 / $15.00,快取讀取為 $0.10。兩者皆為供應商定價,沒有任何附加費用,只需一組金鑰、一張帳單。

對這組搭配來說,這點比平常更重要,因為這兩個模型並非彼此的替代品——而是一項路由決策。把長文件與高流量工作交給 GPT-6.1 Sol,將困難推理與程式碼修改工作留在 Claude Opus 5.5,而兩者都位於同一個端點之後,並使用相同的憑證。如果某條路由降級,自動容錯移轉會將呼叫轉移,而不是讓它失敗;而且,由於路由是宣告式的,可以按任務類別來表達,而不是按應用程式來表達。測試這種分工只是設定變更,而不是移轉。

最後一件值得說的事,是這個比較的保存期限。這兩個模型都問世僅數天或數週。GPT-6.1 Sol 有一份已發表的獨立配置;Claude Opus 5.5 也有一份。每個模型只跑一次,就只是一張快照,而真正有趣的失效模式,不是這些數字中有一個錯了——而是中等投入的設定,或第二位評估者,重新描繪了整體輪廓。在那之前,站得住腳的解讀,是各組成部分所給出的那一種:在艱難推理與研究型程式碼上有決定性的差距,在長脈絡工作上有小幅差距,以及一筆 8.3 倍的帳單,而這筆帳單必須由你工作負載中類似前者的部分來證明其合理性。

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新