
Grok 4.6 對決 Claude Opus 5:同為 61,兩種不同經濟
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
Artificial Analysis 以相同的九項評估對每一款前沿模型進行測試,並公布帳單。在其智能指數上,Grok 4.6和Claude Opus 5取得相同分數——61——這使其成為罕見的正面對決:綜合指數無法告訴你該選哪一個。真正能給出答案的是同一來源中一個較不為人知的數據:在 AA-Briefcase 知識工作套件中,Grok 4.6 以大約 53 輪、約 5 億個輸入 token 完成一項任務,而 Claude Opus 5 以最大努力模式完成相同工作則需要大約 103 輪、20 億個 token。兩者之間的 token 消耗差距達四比一,而它們的頭條分數卻完全相同——只有當你不再比較模型規格表、開始比較帳單時,這個差距才會顯現出來。
兩款型號都是目前的旗艦級發佈,因此這是一場乾淨的對比,而非跨代比較。Grok 4.6 於2026年8月12日由 SpaceXAI 推出,是 Grok 4.5 基礎的改良版本——同樣是 1.5 萬億參數的混合專家(mixture-of-experts)基礎模型,但以更長時間的監督式學習與強化學習訓練進行再訓練,目標是打造能長時間自主運作的代理。Claude Opus 5 於2026年7月24日由 Anthropic 推出,是一款固定時間戳的旗艦模型,具備自适应思考、100萬 token 的上下文視窗,以及圖像與檔案輸入功能。兩者在獨立評分板上位列相同名次,在價格表上卻各居一端:Grok 4.6 每百萬 token 售價為 $2 / $6,Claude Opus 5 則為 $5 / $25。耐人尋味的地方在於,要判斷這句話的哪一半會決定你在生產環境中的選擇。
隱藏著四比一效率差距的61
智能指數是九項評估的綜合體,這既是它的優勢,也是它的盲點。一個將推理、數學、編碼和知識工作分數平均得出的單一數字,掩蓋了模型達成此結果的方式——而這兩者達成的方式正好相反。Artificial Analysis 自家的公事包式專業知識工作套件是觀察此事最清晰的窗口:它衡量真實的長期任務,記錄到 Grok 4.6 每個任務約 53 輪和 0.5B 輸入 token,而 Claude Opus 5 Max 則約 103 輪和 2B 輸入 token。就每個任務的經濟性而言,這正是「以四分之一 token 完成研究並產出工作的模型」與「耗盡 token 的模型」之間的差異。
{{1}}原因是設計選擇,而非錯誤。{{/1}}{{2}}Grok 4.6 的訓練目標是邊進行邊驗證自身工作,並在子任務真正完成時停止。{{/2}}{{3}}xAI 將帶有自我測試的長任務軌跡描述為訓練目標。{{/3}}{{4}}Claude Opus 5 的訓練側重推理深度與知識廣度,其預設行為是比嚴格必要程度更加深入思考並查閱更多資料。{{/4}}{{5}}兩者都是「推理模型」;它們分配努力的方式不同,而這種分配方式才是對代理工作負載至關重要的規格。{{/5}}

這種差距對在迴圈中呼叫模型的代理最為重要——研究代理、執行數十輪的程式碼代理,以及徹夜批次處理文件的管道。每一輪都要計費,每個輸入 token 都是必須在下一次呼叫時重新發送的上下文。一個在 53 輪內完成、使用 0.5B 個 token 的模型,不只是每個 token 更便宜;在乘以標價之前,它每任務就比一個需 103 輪、使用 2B 個 token 的模型便宜約一個數量級。
規格表,兩面
在紙面上相異之處,每一項各以一行列出:
• Intelligence Index:Grok 4.6 得分 61,在 184 個中排名第 6;Claude Opus 5 得分 61,並列榜首。根據 Artificial Analysis,這是平手。
• 每 1M tokens 的定價 — Grok 4.6 輸入 $2 / 輸出 $6(輸入 tokens 達 200K 以上時,翻倍至 $4 / $12);Claude Opus 5 輸入 $5 / 輸出 $25,提供 50% 的批次折扣,降至 $2.50 / $12.50。
• 上下文窗口 — Grok 4.6 提供 500K tokens,而 Claude Opus 5 提供 1,000,000 tokens,這是兩款型號各自最明確的單一規格優勢。
• 最大輸出 — Claude Opus 5 最高可輸出 128K 個輸出 tokens(透過批次 API 可達 300K);Grok 4.6 的輸出上限較低,約為一般長答案的長度。
• 輸入 — 兩者皆接受文字與圖像;Claude Opus 5 也接受檔案,且 Anthropic 的多模態輸入能更直接地深入文件。
• GDPVal-AA v2(知識工作) — Grok 4.6 以 1,753 Elo 對上 Claude Opus 5 的 1,852 Elo。在公事包效率偏向 Grok 的指標上,Opus 5 奪下知識工作品質之冠。[Artificial Analysis]
• CursorBench v3.2 — Grok 4.6 得分 69.9%,Claude Opus 5 得分 70.0%,兩者在同一編寫程式代理基準測試中表現幾乎持平。[Artificial Analysis]
• 推理控制 — Claude Opus 5 提供了從低到最大的努力調整旋鈕,並預設啟用適應性思考;Grok 4.6 也提供推理努力調整,但其預設設定偏向於較長的代理軌跡。
將這兩者並列比較的重點在於,沒有任何一個模型能全面勝出。Claude Opus 5 就紙面規格而言是更出色的通才:更大的上下文、更高的輸出上限、檔案輸入、更高的知識工作品質。Grok 4.6 則更具性價比,也是更高效的智能體。唯一剩下的問題是,這些描述中哪一個符合你實際的工作。

Claude Opus 5 的溢價體現在哪裡
Anthropic 的發布數據 — {{1}}廠商自行回報,未經獨立重現{{/1}} — 讓 Claude Opus 5 在 SWE-bench Verified 拿下 96.0%、在 SWE-bench Pro 拿下 79.2%,{{2}}並在 OSWorld 電腦操作任務中獲得 70.6% 的分數{{/2}}。在綜合基準上,其 61 分與 Grok 4.6 持平;在 GDPVal-AA 上則有可測量的領先。這在實務上代表這款模型能在知識工作者一整天的各種工作中表現出色:起草、分析、長文推理、圖文整合任務與編寫程式,全部集中在一處,{{3}}並擁有百萬 token 的處理餘裕{{/3}}。
上下文視窗是選用它的真正理由。500K token 的限制很大,但它不是整個程式碼庫加上研究語料庫,再加上長時間代理工作階段的中間結果。對超大型語料庫進行深度單遍分析的團隊——完整的儲存庫、一年的財務申報、一長疊 PDF——會撞上 Grok 4.6 的天花板,卻永遠碰不到 Claude Opus 5 的天花板。對這些工作負載而言,額外的上下文不是奢侈品;它是「勝任工作」與「繞著限制調度」之間的差異。
在 Grok 4.6 更划算的情況下
將同樣的事實翻轉過來看,Grok 4.6 對 agent 管線而言是更划算的選擇,而且差距不小。其輸入端價格比 Opus 5 的定價便宜 2.5 倍,輸出端便宜 4.2 倍;而每任務的 token 效率更進一步放大了這個優勢:AA-Briefcase 的數據顯示,要達成相同的知識工作成果,所需 token 僅約為原本的 1/4,互動回合數僅約為原本的 1/2。把 4 倍乘以 2.5 倍,一個在 Opus 5 計價模式下成本 1.00 美元的任務,在 Grok 4.6 的成本約為 0.10 美元——這還是在 Opus 端的批量折扣縮小部分差距之前。
具體在代理式編碼(agentic coding)方面,Grok 4.6 的 DeepSWE 1.1 成績從 4.5 到 4.6 之間由 54% 提升至 65.9%,其 CursorBench 分數與 Opus 5 的差距在半個百分點之內,同時一路上自我驗證自身的工作成果。對於一個每天執行數千次代理式呼叫、且每次呼叫都是多輪迴合的團隊而言,每項任務的經濟效益與較短的執行軌跡,正是可行產品與燒錢速率之間的差別。這就是 xAI 提出的論點,而獨立的效率數據也支持這個方向。
路由決策
這正是路由器證明自身價值的對戰組合,因為正確答案是「兩者都用,而分割點由工作負載型態決定」。Grok 4.6 和 Claude Opus 5 都已上線於 OrcaRouter,並按照各家廠商自己的牌價計費——grok/grok-4.6 為 $2 / $6,anthropic/claude-opus-5 為 $5 / $25——加成 0%,因此你成本模型中的數字,就是實際計費的數字。讓這種分割切實可行的底層機制包括:兩個模型共用一個 API 金鑰;若某家供應商的端點在長時間的 agent 執行途中效能劣化,就會自動故障轉移;以及一個路由 DSL,能在單一呼叫中,把短小、高量的回合送往 Grok 4.6,並將長程、需要大量上下文的工作升級給 Claude Opus 5。你不需要第二份合約就能運行雙層架構,而且可以隨著真實流量數據的到來重新調整分割比例,而不是靠模型卡猜測。

誠實的解讀
綜合指數上的平手是真實的,而它是一個陷阱。得分相同的模型並非可以互換;它們的差異恰好發生在分數的盲點上。對於廣泛、上下文密集、以文件和圖像為主的知識工作,Claude Opus 5 是更安全的預設選擇——在這些場景中,100萬token的上下文窗口和深度推理比成本更重要。對於高流量的代理迴圈,Grok 4.6 是更好的預設選擇,因為每項任務的token效率和2.5倍的價格優勢會複合成數量級的帳單差異。如果你的工作負載屬於前者,就付費使用 Opus 5,別再為價格煩惱。如果是後者,紙面上61分的平手是你優先測試 Grok 4.6 的最佳理由——基準測試顯示它們勢均力敵,但帳單顯示並非如此。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
