
Claude Opus 5.5 vs Grok 4.6:一個模型負責閱讀,另一個付諸行動
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Claude Opus 5.5與Grok 4.6是購買能承載五十萬個 token 上下文之前沿級模型的兩種最便宜方式——而它們並非同一款產品。在其中一項測量中,Grok 4.6 距離絕對頂峰僅差三分:GPQA Diamond 拿下 94.9 分,這是一套研究所程度的科學題庫,Anthropic 的旗艦模型也落在同一區間。但在下一項測量中,它卻落後三十八分。在 Terminal-Bench 4.0 這項要求模型在 shell 中完成實際工作的代理式終端機基準測試上,Artificial Analysis 給 Grok 4.6 的成績是 21.21%,Claude Opus 5.5 則是 59.60%。這兩個數字無論哪個方向都不是誤植,而這組搭配的全貌,正是在於解釋為何這兩個數字能夠同時成立。
兩款新品,同一價格帶,相隔四個月
SpaceXAI 於 2026 年 8 月 12 日推出 Grok 4.6,作為 Grok 系列目前的旗艦模型,每百萬個輸入詞元 2.00 美元、輸出 6.00 美元,具備 500,000 詞元的上下文視窗,以及文字、圖像與檔案輸入介面。Anthropic 於 2026 年 9 月 22 日推出 Claude Opus 5.5,時間大約晚了六週,價格為 4.00/20.00 美元,具備 1,000,000 詞元的上下文視窗與 128,000 個輸出詞元。兩者都支援可設定的推理強度、工具呼叫與結構化輸出;兩者也都能以與 OpenAI 相容的對話介面,以及各自廠商的專有格式運作。
所以,直觀的解讀是一筆單純的取捨:Grok 4.6 的輸入價格只要一半,輸出大約只要三分之一,而 Claude Opus 5.5 則以兩倍的上下文視窗來回應。這個取捨確實存在,而且在長文件工作上,這可能是唯一要緊的事。不過,這也不是值得玩味的分歧所在,因為這兩個模型是在同一套獨立評測框架上衡量,而且在對代理式工作至關重要的軸線上,並未落在相同的位置。
型錄上對於兩者都據以量測的軸是怎麼說的
OrcaRouter 的目錄每一列都帶有基準測試來源資訊——每個數字都標明其來自哪個評估者——因此下列配對在兩個模型上皆出自同一來源:Artificial Analysis,而非一邊是廠商數據、另一邊是第三方數據:
• GPQA Diamond — 我們的目錄並未在這個軸線上列出 Claude Opus 5.5;Grok 4.6 得分 94.9%
• Humanity's Last Exam — Claude Opus 5.5 拿下 61.4%,對比 Grok 4.6 的 42.9%
• SciCode — 66.9% 對比 56.5%
• 長上下文回憶 — 相較於 80.3%,達到 84.7%
• Terminal-Bench 4.0 — 59.60%,相較於 21.21%
• AA Intelligence Index — 57.6 對比 44.3
在 Anthropic 這邊,GPQA 那一列是刻意留白的,而不是從廠商簡報中補上數字。Grok 4.6 在該項的 94.9 是其成績卡上最強的數字,而且貨真價實——那是一項獨立測量,並非 SpaceXAI 的宣稱——而它確實道出了這個模型的某些實情:當任務是一道格式良好、只有一個站得住腳答案的題目時,Grok 4.6 的表現位居前沿。把它和 Terminal-Bench 4.0 的 21.21% 並列來看,整體輪廓就清晰了。產出一個關於科學的正確答案,和在 shell 中對著真實檔案系統執行五個步驟的任務,是兩種不同的能力,而 Grok 4.6 在前者上的進展遠比後者深入。
在把那組配對當作定論之前,有一點但書:這兩個模型的 Artificial Analysis 數據是在不同的評估日期記錄的,而 Grok 4.6 的是較舊的一組。這項比較是在八月受評的模型與九月受評的模型之間進行,而所用的評測框架本身在這段期間也經過修訂。差距的方向在五個各自獨立的軸向上一致,因此我們將其視為訊號,但確切的分數應解讀為八月對九月的比較,而不是同一天的比較。
一個由不販售任何一方的人所建立的指數
還有第二項獨立衡量指標,它在方向上與前者一致,卻遠不那麼願意做細微的區分。Epoch 能力指數(Epoch Capabilities Index)由 Epoch AI 建構,匯集五十多項基準測試而成一項綜合指標,並經重新縮放,使 Claude 3.5 Sonnet 落在 130、GPT-5 落在 150;在我們於 2026 年 10 月 2 日讀取的檔案中,它把 Claude Opus 5.5 放在 167.35。Grok 4.6 則為 156.61,來自 8 月 12 日的一項評估。這是在一個量表上 10.74 點的差距;在該指數推出時,觀察到大約五點相當於 METR 時間跨度衡量指標翻倍——差距相當大,且穩穩落在這兩個模型各自公布的區間 164.0 至 172.0 與 154.66 至 158.93 之外,而這兩個區間完全沒有重疊。
值得注意的是,這個指數未能斷定的是:它把 Claude Sonnet 5.5 列在 165.2,把 Claude Fable 5.1 列在 164.82,兩者都高於 Grok 4.6,而且這兩者每百萬輸出 token 的成本都比 Grok 4.6 的第二級費率更低。任何只根據性價比來選擇的人,在同一廠商家族中還有第三與第四個選項,而本文的配對比較要談的是另一回事:這兩個模型各自擅長什麼。
費率,以及只出現在其中一個上的那一列

Grok 4.6 的價目表中有個 Claude Opus 5.5 沒有的級距:提示詞超過 200,000 個 token 的要求,會以基礎費率的兩倍計費,因此輸入從 $2.00 漲到 $4.00,輸出從 $6.00 漲到 $12.00,快取讀取則從 $0.50 升到 $1.00。Claude Opus 5.5 收費 $4.00/$20.00,快取讀取為 $0.20,在整個 1,000,000 個 token 的視窗內均一價。這種倒轉,是向這兩個模型任一購買長脈絡的實際後果,而一旦工作負載真的成長,它就會翻轉表面的價格比較:
• 以 30,000 個輸入 token 計算的價格——Claude Opus 5.5 是較貴的那一款,30,000 輸入與 8,000 輸出約為 28 美分,相較之下 Grok 4.6 約為 11 美分
• 在 250,000 個輸入 token 時的價格——順序會反轉,因為 Grok 4.6 已跨入其雙倍計價級距,而 Claude Opus 5.5 尚未。
• 快取讀取 — Claude Opus 5.5 每百萬 $0.20,相較之下 Grok 4.6 為 $0.50,超過該級距後升至 $1.00
• 最大輸出 — Claude Opus 5.5 為 128,000 個 token;Grok 4.6 的輸出上限並未刊載於型錄紀錄中
Grok 4.6 也帶有一個值得直接說明的落差,而不是留待日後才被發現。它的紀錄完全沒有列出最大輸出數字——該欄位是未經測量,而非零——因此,對於依賴極長單次回應的工作負載,在比較的這一側就沒有已公布的數字可供規劃依據。
不應讀取的效能欄位
我們的目錄也收錄了每個模型的服務效能面板,而在 Grok 4.6 上,它是頁面上最具誤導性的內容。這張卡片顯示 p50 延遲為 10,000 毫秒,以及在為期七天的視窗中錯誤率為 97.58%,該期間內服務了 26,184 個 token。這些欄位描述的並不是一個緩慢的模型。它們描述的是幾乎沒被呼叫的模型:在那種流量水準下,樣本過於稀薄,延遲分布根本不具意義,而錯誤率反映的是寥寥幾次嘗試,而不是服務品質。把那個區塊當成 Grok 4.6 很慢的證據,無異於把量測假象當成量測本身。
相較之下,Claude Opus 5.5 的面板背後有母體支撐——在涵蓋每日取樣的七天區間內,p50 落在 4.4 秒的範圍,同一期間內更處理了 1.56 億個 token。但即便是這項數據,也該以其本來面目來解讀:那是我們自家 playground 的流量,而它只是我們使用者的一個樣本,並非模型的固有特性。
要將哪一個進行路由,以及如何在自己的工作中自行找出
數字所描繪的分野已穩定到足以據以行動。Claude Opus 5.5 是代理式與長程工作的首選——Terminal-Bench 4.0 上 59.60% 對 21.21% 的差距,是兩個模型所有受測軸線中最大的一段落差,而這正是預測一個模型能否被交付一項任務、而非一個問題的軸線。當提示確實很長時,它也是首選,因為費率表不會跳階,而視窗是兩倍大。Grok 4.6 則是大量問題型工作的首選:在前 200,000 個 token 內,以 $2.00/$6.00 拿下 94.9% 的 GPQA Diamond 分數,對於那些永遠不會長成加倍級距的檢索與回答工作負載而言,是非常划算的交易。
兩者都在 OrcaRouter 上,以供應商的定價提供,0% 加成——Claude Opus 5.5 為 $4.00/$20.00,快取讀取 $0.20,Grok 4.6 為 $2.00/$6.00,超過 200K 的分級完全依照 SpaceXAI 的設定套用——全都在同一把金鑰後面,因此上述的取捨可以在你自己的提示集上實測,而不是空口爭論。當兩者都被路由時,自動容錯移轉就在底層運作,而當扛起代理路徑的正是那個較便宜的模型時,這一點尤其值得擁有。
這一組配對所換來的評語是:Grok 4.6 是更優秀的讀者,而 Claude Opus 5.5 是更優秀的執行者。GPQA Diamond 上的 94.9 與 Terminal-Bench 上的 21.21,是同一個模型被量測了兩次,而知道你的工作負載看起來像這兩個數字中的哪一個,就是整個抉擇的全部關鍵。


本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
