為 Claude Opus 5.5 對比 Grok 4.6 生成的主視覺標題卡,以垂直分隔線分隔:左側是「Claude Opus 5.5」與「$4.00 / $20.00」,右側是「Grok 4.6」與「$2.00 / $6.00」,底部橫跨標語「一個模型負責閱讀,另一個負責行動」,右下角則有 OrcaRouter 標誌。
Guides & Insights

Claude Opus 5.5 vs Grok 4.6:一個模型負責閱讀,另一個付諸行動

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Claude Opus 5.5與Grok 4.6是購買能承載五十萬個 token 上下文之前沿級模型的兩種最便宜方式——而它們並非同一款產品。在其中一項測量中,Grok 4.6 距離絕對頂峰僅差三分:GPQA Diamond 拿下 94.9 分,這是一套研究所程度的科學題庫,Anthropic 的旗艦模型也落在同一區間。但在下一項測量中,它卻落後三十八分。在 Terminal-Bench 4.0 這項要求模型在 shell 中完成實際工作的代理式終端機基準測試上,Artificial Analysis 給 Grok 4.6 的成績是 21.21%,Claude Opus 5.5 則是 59.60%。這兩個數字無論哪個方向都不是誤植,而這組搭配的全貌,正是在於解釋為何這兩個數字能夠同時成立。

兩款新品,同一價格帶,相隔四個月

SpaceXAI 於 2026 年 8 月 12 日推出 Grok 4.6,作為 Grok 系列目前的旗艦模型,每百萬個輸入詞元 2.00 美元、輸出 6.00 美元,具備 500,000 詞元的上下文視窗,以及文字、圖像與檔案輸入介面。Anthropic 於 2026 年 9 月 22 日推出 Claude Opus 5.5,時間大約晚了六週,價格為 4.00/20.00 美元,具備 1,000,000 詞元的上下文視窗與 128,000 個輸出詞元。兩者都支援可設定的推理強度、工具呼叫與結構化輸出;兩者也都能以與 OpenAI 相容的對話介面,以及各自廠商的專有格式運作。

所以,直觀的解讀是一筆單純的取捨:Grok 4.6 的輸入價格只要一半,輸出大約只要三分之一,而 Claude Opus 5.5 則以兩倍的上下文視窗來回應。這個取捨確實存在,而且在長文件工作上,這可能是唯一要緊的事。不過,這也不是值得玩味的分歧所在,因為這兩個模型是在同一套獨立評測框架上衡量,而且在對代理式工作至關重要的軸線上,並未落在相同的位置。

型錄上對於兩者都據以量測的軸是怎麼說的

OrcaRouter 的目錄每一列都帶有基準測試來源資訊——每個數字都標明其來自哪個評估者——因此下列配對在兩個模型上皆出自同一來源:Artificial Analysis,而非一邊是廠商數據、另一邊是第三方數據:

• GPQA Diamond — 我們的目錄並未在這個軸線上列出 Claude Opus 5.5;Grok 4.6 得分 94.9%

• Humanity's Last Exam — Claude Opus 5.5 拿下 61.4%,對比 Grok 4.6 的 42.9%

• SciCode — 66.9% 對比 56.5%

• 長上下文回憶 — 相較於 80.3%,達到 84.7%

• Terminal-Bench 4.0 — 59.60%,相較於 21.21%

• AA Intelligence Index — 57.6 對比 44.3

在 Anthropic 這邊,GPQA 那一列是刻意留白的,而不是從廠商簡報中補上數字。Grok 4.6 在該項的 94.9 是其成績卡上最強的數字,而且貨真價實——那是一項獨立測量,並非 SpaceXAI 的宣稱——而它確實道出了這個模型的某些實情:當任務是一道格式良好、只有一個站得住腳答案的題目時,Grok 4.6 的表現位居前沿。把它和 Terminal-Bench 4.0 的 21.21% 並列來看,整體輪廓就清晰了。產出一個關於科學的正確答案,和在 shell 中對著真實檔案系統執行五個步驟的任務,是兩種不同的能力,而 Grok 4.6 在前者上的進展遠比後者深入。

在把那組配對當作定論之前,有一點但書:這兩個模型的 Artificial Analysis 數據是在不同的評估日期記錄的,而 Grok 4.6 的是較舊的一組。這項比較是在八月受評的模型與九月受評的模型之間進行,而所用的評測框架本身在這段期間也經過修訂。差距的方向在五個各自獨立的軸向上一致,因此我們將其視為訊號,但確切的分數應解讀為八月對九月的比較,而不是同一天的比較。

一個由不販售任何一方的人所建立的指數

還有第二項獨立衡量指標,它在方向上與前者一致,卻遠不那麼願意做細微的區分。Epoch 能力指數(Epoch Capabilities Index)由 Epoch AI 建構,匯集五十多項基準測試而成一項綜合指標,並經重新縮放,使 Claude 3.5 Sonnet 落在 130、GPT-5 落在 150;在我們於 2026 年 10 月 2 日讀取的檔案中,它把 Claude Opus 5.5 放在 167.35。Grok 4.6 則為 156.61,來自 8 月 12 日的一項評估。這是在一個量表上 10.74 點的差距;在該指數推出時,觀察到大約五點相當於 METR 時間跨度衡量指標翻倍——差距相當大,且穩穩落在這兩個模型各自公布的區間 164.0 至 172.0 與 154.66 至 158.93 之外,而這兩個區間完全沒有重疊。

值得注意的是,這個指數未能斷定的是:它把 Claude Sonnet 5.5 列在 165.2,把 Claude Fable 5.1 列在 164.82,兩者都高於 Grok 4.6,而且這兩者每百萬輸出 token 的成本都比 Grok 4.6 的第二級費率更低。任何只根據性價比來選擇的人,在同一廠商家族中還有第三與第四個選項,而本文的配對比較要談的是另一回事:這兩個模型各自擅長什麼。

費率,以及只出現在其中一個上的那一列

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

Grok 4.6 的價目表中有個 Claude Opus 5.5 沒有的級距:提示詞超過 200,000 個 token 的要求,會以基礎費率的兩倍計費,因此輸入從 $2.00 漲到 $4.00,輸出從 $6.00 漲到 $12.00,快取讀取則從 $0.50 升到 $1.00。Claude Opus 5.5 收費 $4.00/$20.00,快取讀取為 $0.20,在整個 1,000,000 個 token 的視窗內均一價。這種倒轉,是向這兩個模型任一購買長脈絡的實際後果,而一旦工作負載真的成長,它就會翻轉表面的價格比較:

• 以 30,000 個輸入 token 計算的價格——Claude Opus 5.5 是較貴的那一款,30,000 輸入與 8,000 輸出約為 28 美分,相較之下 Grok 4.6 約為 11 美分

• 在 250,000 個輸入 token 時的價格——順序會反轉,因為 Grok 4.6 已跨入其雙倍計價級距,而 Claude Opus 5.5 尚未。

• 快取讀取 — Claude Opus 5.5 每百萬 $0.20,相較之下 Grok 4.6 為 $0.50,超過該級距後升至 $1.00

• 最大輸出 — Claude Opus 5.5 為 128,000 個 token;Grok 4.6 的輸出上限並未刊載於型錄紀錄中

Grok 4.6 也帶有一個值得直接說明的落差,而不是留待日後才被發現。它的紀錄完全沒有列出最大輸出數字——該欄位是未經測量,而非零——因此,對於依賴極長單次回應的工作負載,在比較的這一側就沒有已公布的數字可供規劃依據。

不應讀取的效能欄位

我們的目錄也收錄了每個模型的服務效能面板,而在 Grok 4.6 上,它是頁面上最具誤導性的內容。這張卡片顯示 p50 延遲為 10,000 毫秒,以及在為期七天的視窗中錯誤率為 97.58%,該期間內服務了 26,184 個 token。這些欄位描述的並不是一個緩慢的模型。它們描述的是幾乎沒被呼叫的模型:在那種流量水準下,樣本過於稀薄,延遲分布根本不具意義,而錯誤率反映的是寥寥幾次嘗試,而不是服務品質。把那個區塊當成 Grok 4.6 很慢的證據,無異於把量測假象當成量測本身。

相較之下,Claude Opus 5.5 的面板背後有母體支撐——在涵蓋每日取樣的七天區間內,p50 落在 4.4 秒的範圍,同一期間內更處理了 1.56 億個 token。但即便是這項數據,也該以其本來面目來解讀:那是我們自家 playground 的流量,而它只是我們使用者的一個樣本,並非模型的固有特性。

要將哪一個進行路由,以及如何在自己的工作中自行找出

數字所描繪的分野已穩定到足以據以行動。Claude Opus 5.5 是代理式與長程工作的首選——Terminal-Bench 4.0 上 59.60% 對 21.21% 的差距,是兩個模型所有受測軸線中最大的一段落差,而這正是預測一個模型能否被交付一項任務、而非一個問題的軸線。當提示確實很長時,它也是首選,因為費率表不會跳階,而視窗是兩倍大。Grok 4.6 則是大量問題型工作的首選:在前 200,000 個 token 內,以 $2.00/$6.00 拿下 94.9% 的 GPQA Diamond 分數,對於那些永遠不會長成加倍級距的檢索與回答工作負載而言,是非常划算的交易。

兩者都在 OrcaRouter 上,以供應商的定價提供,0% 加成——Claude Opus 5.5 為 $4.00/$20.00,快取讀取 $0.20,Grok 4.6 為 $2.00/$6.00,超過 200K 的分級完全依照 SpaceXAI 的設定套用——全都在同一把金鑰後面,因此上述的取捨可以在你自己的提示集上實測,而不是空口爭論。當兩者都被路由時,自動容錯移轉就在底層運作,而當扛起代理路徑的正是那個較便宜的模型時,這一點尤其值得擁有。

這一組配對所換來的評語是:Grok 4.6 是更優秀的讀者,而 Claude Opus 5.5 是更優秀的執行者。GPQA Diamond 上的 94.9 與 Terminal-Bench 上的 21.21,是同一個模型被量測了兩次,而知道你的工作負載看起來像這兩個數字中的哪一個,就是整個抉擇的全部關鍵。

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新