標題卡寫著「Grok 4.7 對上 Claude Opus 5」,副標為「價格差距是真的,旗鼓相當則不然」,以及三張卡片:AA Index v4.3.2 46 對 51、每 1M 價格 $2/$6 對 $5/$25,還有 Terminal-Bench 4.0 26 對 49。
Guides & Insights

Grok 4.7 vs Claude Opus 5:價格差距是真的,旗鼓相當則不然

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

你可以用每百萬輸入符元 2.00 美元、每百萬輸出符元 6.00 美元的價格呼叫 Grok 4.7。呼叫 Claude Opus 5 則分別是 5.00 美元與 25.00 美元。輸出方面相差 4.2 倍——這種差距通常早在基準測試結果出爐前就決定了高下。但這次並不然。在兩款模型目前都據以評分的 Artificial Analysis Intelligence Index 版本——v4.3.2,即 2026 年 9 月 19 日發布的修訂版——Claude Opus 5 得分為 51,而廠商於 2026 年 9 月 21 日發布的 Grok 4.7 則為 46。五分算不上慘敗,但這五分的分布態勢才是重點:Opus 5 在該指數的十項評測中拿下八項。較便宜那款模型的賣點是價格,上下文表現則平分秋色,而 Grok 4.7 的價格優勢本應最舉足輕重的那一處,恰恰正是它消失的地方。

兩款旗艦機,兩份截然不同的價格表

Claude Opus 5 自 2026 年 7 月 24 日起已在市場上推出,是 Anthropic 的 Opus 層級旗艦模型,在該公司自家的產品陣容中位居 Claude Fable 5.1 之下。它具備 100 萬個 token 的上下文視窗,並採單一費率定價——Anthropic 明確表示,90 萬個 token 的請求與 9 千個 token 的請求按相同的每 token 費率計費,完全沒有長上下文加價——以及 128K 的最大輸出,在 Message Batches API 上可延展至 300K。思考功能為自適應且預設開啟,其努力程度階梯依序為 low、medium、high、xhigh 與 max,預設為 high。權重為封閉式。

Grok 4.7 才問世一天。它擁有 500k token 的上下文,可接受文字與圖像輸入並回傳文字,還自帶一個推理投入程度的調節鈕。其定價為:提示 token 低於 200k 時,每百萬 token 輸入 $2.00、輸出 $6.00;達到或超過該門檻時,則跳升至 $4.00 與 $12.00;快取讀取在同樣這兩個區間分別為 $0.50 與 $1.00。xAI 也列出一個更快的變體,輸出速度約為兩倍,價格也約為兩倍,不過該配置推出時並未附上已公布的速度量測數據。這裡的權重同樣是封閉的,這移除了此比較雙方「自己動手跑」的逃生門。

獨立董事會並不親近,也不奉承。

這兩個模型都是依據 Artificial Analysis 的 v4.3.2 指數評分,該指數納入十項評測,涵蓋代理、程式設計、一般知識與科學推理。把這兩欄並排來看,五分的頭條差距對較便宜的模型而言顯得寬容——綜合指標中單單五分的落差可能掩蓋許多東西,而在這裡,它掩蓋的是近乎橫掃的結果。

綜合智能 — Grok 4.7(xhigh):在 Artificial Analysis Intelligence Index v4.3.2 上得分 46。Claude Opus 5(自適應推理,最高投入):於同一版本得分 51。

高難度推理 — Grok 4.7:Humanity's Last Exam 43,CritPt 18。Claude Opus 5:HLE 55,CritPt 29。兩項差距分別為十二分與十一分,且均對 Opus 5 有利。

代理式終端機 — Grok 4.7:Terminal-Bench 4.0 26。Claude Opus 5:49。這是榜上最大的單一差距,而且就落在最接近真實自主工作的基準測試上。

職場自動化 — Grok 4.7:AutomationBench-AA 66%。Claude Opus 5:57%。這是 Grok 4.7 唯一明顯的一勝,而且是貨真價實的一勝——在評估代理能否完成工作流程而不觸發護欄的評測上領先九分。

知識與誠實 — Grok 4.7:AA-Omniscience 32。Claude Opus 5:37。兩個模型都會產生幻覺;在這項指標上,Opus 5 的情況較少。

長上下文 — Grok 4.7:AA-LCR v1.1 77%,視窗 500k tokens。Claude Opus 5:79%,視窗 1M tokens。

執行該指數的成本——Grok 4.7:整場評估共輸出 2.4 億個 token,被 Artificial Analysis 標記為異常冗長。Claude Opus 5:1.4 億。Grok 4.7 花了 1.7 倍的 token,卻換來較低的分數。

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

Grok 4.7 的價格優勢葬身之處

以下是費率表所隱藏的計算。拿一個實際的代理式請求來說:3 萬個輸入 token、8 千個輸出 token。Grok 4.7 的輸入計費為 $0.06,輸出為 $0.048——約 11 美分。Claude Opus 5 的輸入計費為 $0.15,輸出為 $0.20——約 35 美分。這是實實在在的 3 倍差距,而在這樣的規模下,單就成本而言,Grok 4.7 顯然是首選。

現在來看 Grok 4.7 自家行銷所圍繞的那種請求:長上下文代理式工作階段。把提示推過 200k 個 token,Grok 4.7 的費率就會翻倍,變成輸入 $4.00、輸出 $12.00。Claude Opus 5 則維持不變——它的 1M 視窗以 $5.00 和 $25.00 的均一價計費。在 250k 輸入與 8k 輸出時,Grok 4.7 的輸入費用為 $1.00、輸出費用為 $0.096,約 $1.10。Opus 5 的輸入費用為 $1.25、輸出費用為 $0.20,約 $1.45。差距已從 3 倍縮小到約 1.3 倍。再往上推——400k、500k,一路到 Grok 4.7 視窗的上限——Opus 5 的均一價會持續縮小差距,而它的視窗則繼續一路延伸到 100 萬個 token。Grok 4.7 在短提示時是便宜模型,在長提示時價格則幾乎與對手相當,這顛覆了定價頁面原本想營造出的直覺印象。

有兩個但書讓這個說法保持誠實。首先,長上下文層級是 xAI 自家模型文件中記載的定價列表結構,而不是實測數據——實際帳單取決於快取,而 Grok 4.7 的 $0.50 快取讀取費率確實很便宜。其次,Artificial Analysis 尚未發布 Grok 4.7 的速度測量數據,因此「它更快」這部分的便宜又快速論點目前尚未得到驗證。已測量的是 Opus 5,每秒 59 個 token,首個 token 的時間為 49 秒——緩慢、昂貴,且在幾乎每個品質維度上都領先。

你實際上會路由的內容

這是一項比較,而誠實的答案會因工作負載而異,路由器是依此採取行動最便宜的做法Claude Opus 5 已在 OrcaRouter 上提供,列於其專屬的模型頁面下,並以 0% 加成直接反映供應商的價格——因此 Opus 5 在我們目錄中的 $5.00 與 $25.00 是 Anthropic 的定價,而非加價後的版本,而且若 Anthropic 調整價格,同一個金鑰上的數字會在同一天變更。截至本文撰寫時,Grok 4.7 尚未收錄於 OrcaRouter 目錄中;若今天要呼叫它,必須透過 xAI 自家的 API 以及有提供該模型的第三方平台。在你據此規劃架構之前,這個不對稱性值得先了解。

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

從這些數字得出的路由模式很直接。把長上下文、重度推理與終端機代理工作交給 Opus 5——它以 23 分之差贏得 Terminal-Bench 4.0,並以固定價格提供兩倍的上下文視窗,而這正是艱難、長時間工作的典型樣貌。把大量自動化與工作流程任務交給 Grok 4.7:它以九分之差贏得 AutomationBench-AA,且在短提示下成本僅為三分之一。由於當兩者都在目錄中時,可透過同一個端點存取,這種分流是一條路由規則,而不是第二份供應商合約;而自動容錯移轉意味著某一條路徑上的速率限制會變成一次路由事件,而不是中斷。當某個工作負載確實需要兩者——一次便宜的第一輪處理與一次昂貴的驗證輪——路由 DSL 會將它們組合成單一呼叫,而不是兩套整合。

裁決

如果你依據證據來選擇,Claude Opus 5 在這場對決中勝出,而且差距懸殊:十項評估中拿下八項、囊括兩個差距最大的項目、在相同價格下提供兩倍上下文,並以遠低於三分之二的 token 預算換得更高分數。五點綜合評分低估了它領先的徹底程度。Grok 4.7 的優勢比其價目表所暗示的更狹窄,但並非空無一物——在多數應用實際使用的提示規模下,它確實更便宜;它是更好的自動化模型;而且它才問世一天,其供應商基準測試套件仍在被獨立重現。若要用於對成本敏感的自動化,就買它;留意 Artificial Analysis 公布其速度數據;並將長上下文價格層級視為決定這個便宜模型能否維持低價的關鍵。

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新