標題卡寫著「Grok 4.7 vs DeepSeek V4 Pro」,副標為「一個是新的;另一個則在你不知情下被替換」,以及三張卡片:AA Index v4.3.2 46 對 36、每 1M 的離峰價格 $2/$6 對 $0.66/$1.98,以及上下文 500k 對 1M。
Guides & Insights

Grok 4.7 對決 DeepSeek V4 Pro:一個是新的,另一個卻在你腳下被悄悄掉包

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026 年 9 月 10 日發布的一則公告,改變了這項比較的重點。公告寫道:「我們正在逐步淘汰 V4-Pro」,並且自 2026 年 9 月 14 日 04:00 UTC 起,所有對 deepseek-v4-pro 模型字串發出的請求都會以 V4.1-Flash 的費率路由至 DeepSeek-V4.1-Flash——該文表示這種情況會持續「直到 V4.1-Pro 推出」。模型字串仍然會回應。但它背後的模型並不是你當初做基準測試的那一個。這使得與 Grok 4.7 的正面對比——該模型由供應商在 2026 年 9 月 21 日發布,也就是本文撰寫前一天——成為一場其中一方帶有有效期限的比較。就現有數字而言,Grok 4.7 是較強的模型,而 DeepSeek V4 Pro 是較便宜的那個。但就真正決定是否進行整合的問題而言,只有其中一個仍然是它自稱的那個模型。

在分數之前,各模型是什麼

DeepSeek V4 Pro 於 2026 年 8 月 13 日以 DeepSeek-V4-Pro-0813 檢查點的形式正式全面推出,此前曾於 4 月 24 日先行預覽。它以 MIT 授權開放權重——該授權允許商業使用、修改與再散布,沒有營收門檻,也沒有地區排除條款——GA 模型卡上載明總參數量為 1.7 兆,具備 100 萬 token 的上下文視窗與 384K 的最大輸出,是本次對決中輸出上限最高者。它僅支援文字:DeepSeek 自家的定價頁面明載 v4-pro 不支援視覺功能,對任何要餵給它截圖或 PDF 的人來說,這是一項實實在在的限制。它提供推理投入程度(reasoning-effort)的調整選項,分為 low、high 與 max 三段,且每個帳戶的並行請求上限為 500 個,可依需求申請擴充。

Grok 4.7 是閉源權重模型,問世才一天。它搭載 500k 詞元的上下文——是 DeepSeek 的一半——可接受文字與圖像輸入,並內建自家的投入程度調節旋鈕。其定價為提示詞元低於 200k 時,每百萬輸入詞元 2.00 美元、每百萬輸出詞元 6.00 美元,達到或超過此門檻則倍增至 4.00 與 12.00 美元,快取讀取則為 0.50 與 1.00 美元。xAI 另外還列出一款更快的變體,輸出速度約為兩倍,價格也約為兩倍。在此處查閱的說明文件中,兩家廠商都未公布 Grok 4.7 的最大輸出量,因此這個維度應視為未知,而非相等。

在共用索引上,這個差距往一個方向傾斜

兩個模型都採用 Artificial Analysis Intelligence Index v4.3.2 進行評分,該版本於 2026 年 9 月 19 日發布。Grok 4.7 的欄位是在 xhigh effort 下測量;DeepSeek 的欄位則是 max effort 下的 0813 checkpoint。將兩者放在一起解讀,綜合分數的差距反而低估了這兩個模型的形態差異有多大。

綜合 — Grok 4.7:在 Artificial Analysis Intelligence Index v4.3.2 上獲得 46 分。DeepSeek V4 Pro 0813:在同一版本上獲得 36 分。

終端機代理 — Grok 4.7:Terminal-Bench 4.0 為 26 分。DeepSeek V4 Pro:14 分。在最貼近自主軟體工作的評測上,幾乎是兩倍。

自動化 — Grok 4.7:AutomationBench-AA 66%。DeepSeek V4 Pro:57%。兩者皆可信;Grok 領先九個百分點。

知識與幻覺 — Grok 4.7:AA-Omniscience 32。DeepSeek V4 Pro:1。這是榜上的離群值,而且並非四捨五入造成的假象——該指數既評估模型知道什麼,也評估當它不知道時有多常憑空編造答案。

長上下文 — Grok 4.7:AA-LCR v1.1 77%,視窗 500k。DeepSeek V4 Pro:80%,視窗 1M。這是 DeepSeek 唯一明顯的勝項,而這正是其 1M 視窗所為之打造的軸線。

高難度推理——Grok 4.7:HLE 43、CritPt 18。DeepSeek V4 Pro:HLE 41、CritPt 18。在物理基準測試上打成平手,而 Grok 在 HLE 上以兩分領先。

冗長程度 — Grok 4.7:執行索引需耗費 2.4 億個輸出 token,被標記為異常冗長。DeepSeek V4 Pro:1.63 億個。兩者都很多話;Grok 更是有過之而無不及。

OrcaRouter model page for DeepSeek V4 Pro showing the deepseek/deepseek-v4-pro identifier, a 1M-token context window, 384K maximum output, text-only input, off-peak list rates of $0.66 per 1M input and $1.98 per 1M output, and 3818.2M tokens of traffic over seven days.

價格不是單一數字,而是一份時程表

DeepSeek 的定價是它最激進的一點,也是最難以穩定報價的一點。deepseek-v4-pro 在快取未命中時,每百萬輸入 token 的定價為 $0.66,每百萬輸出 token 為 $1.98——在離峰時段。尖峰時段則翻倍為 $1.32 和 $3.96。根據 DeepSeek 自己的文件,尖峰時段為 UTC 週一至週五 01:00–04:00 和 06:00–10:00,不含中國國定假日;其他所有時段,包括整個週末,都是離峰時段,價格正好半價。快取輸入讀取才是真正的重點:離峰 $0.022、尖峰 $0.044,比快取未命中便宜三十倍,這讓快取良好的 DeepSeek 工作負載比其價目表所暗示的便宜得多。

相較之下,Grok 4.7 的 $2.00 和 $6.00 就顯得昂貴——大約是 DeepSeek 離峰輸入的 3 倍,也是其離峰輸出的 3 倍。這個比較在有幾個值得了解的方面差距會縮小。Grok 4.7 的價格在其區間內是固定的,而非取決於時段,因此 UTC 09:00 的產量高峰和週日晚間的批次處理成本相同;DeepSeek 則不然。而在提示超過 200k 個 token 時,Grok 4.7 的價格會翻倍,此時它是 DeepSeek 離峰費率的四到六倍,而非三倍。最清楚的說法是:DeepSeek V4 Pro 在各方面都是更便宜的模型,而折扣的幅度取決於你何時執行以及快取的效果如何

九月十四日改變了什麼

這一點讓價格論點更難站得住腳。自 2026 年 9 月 14 日起,DeepSeek 會將 deepseek-v4-pro 的請求導向 DeepSeek-V4.1-Flash,並以 Flash 的費率計費——而 Flash 的費率還更低。DeepSeek 的更新日誌與定價頁面所陳述的內容,與 9 月 10 日那篇新聞貼文略有出入:定價表上仍把 deepseek-v4-pro 列為現行項目,有其專屬費率,也沒有標註退役;而更新日誌的條目則說,V4 Pro 的 API 服務在 9 月 14 日之後仍會持續,計費不變。無可爭議的是發展方向。V4.1-Pro 已確認正在開發中,但未公布日期;而 9 月 10 日發布的 V4.1-Flash,正是 DeepSeek 自家公告所稱在「效能、成本、速度與總執行時間」上勝過 V4 Pro 的版本——這項廠商說法尚未在如此全面的範圍上獲得獨立複現。

所以實際的問題不是「Grok 4.7 還是 DeepSeek V4 Pro」,而是「Grok 4.7 還是下一季那個字串會指向的 DeepSeek 模型」。如果你在八月對 V4 Pro 做了基準測試,並以 1M 視窗、384K 輸出上限來規劃你的上下文預算,那麼你十一月呼叫的模型可能不是你當初測量的那一個——而接班者的上下文與輸出限制也不是你當初設計所依據的那些。Grok 4.7 的風險輪廓恰恰相反:一個才問世一天的模型,其數字由供應商自行回報、且大多未經重現,但它的身分毫無疑問。

Two-column scoreboard titled “Grok 4.7 vs DeepSeek V4 Pro - the scoreboard”: AA Index 46 vs 36, Terminal-Bench 4.0 26 vs 14, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $0.66/$1.98 off-peak, and open weights “no” vs “MIT”.

路由器適用與不適用的時機

OrcaRouter 提供 DeepSeek V4 Pro,而模型頁面以供應商自身的費率列出它——輸入 $0.66、輸出 $1.98,具備 1M 上下文視窗與 384k 最大輸出——因為我們以 0% 加成原樣傳遞供應商的定價表。對一個費率會依尖峰/離峰時段變動、且其 9 月 10 日公告伴隨降價的供應商而言,這件事比平常更為重要:DeepSeek 的價格變動會在同一天於同一把金鑰上生效,沒有重新定價的延遲,也不需要第二份合約。當供應商在他們那一端重新導向某個模型字串時,變更會透過同一個端點送達,而不需要你在自己這端重新整合,而自動容錯移轉則能避免速率限制或供應商端的容量事件演變成中斷——當你技術堆疊的某一側被限制在 500 個並行請求時,這尤其有用。截至本文撰稿時,Grok 4.7 尚未收錄於 OrcaRouter 的型錄中;若要呼叫它,得透過 xAI 自家的 API 以及有提供它的第三方平台。

這種分工並不光鮮,卻站得住腳:把 DeepSeek V4 Pro 留在快取命中定價與 1M 視窗真正發揮作用的工作負載上,並把你的期待鎖定在 V4.1-Flash,而非八月的檢查點。把 Grok 4.7 派到模型必須知道自己不知道什麼的任務上——AA-Omniscience 指數為 1,是個強烈的訊號,顯示模型樂於自信地給出錯誤答案,而一旦下游消費者信任了捏造的答案,任何價格優勢都無法倖存。

那通電話

Grok 4.7 在這裡是更好的模型,而且差距還不算小:綜合領先十分,Terminal-Bench 分數是對手的兩倍,在自動化方面更具優勢,而在知識誠實度上的落差大到足以構成類別上的差異。DeepSeek V4 Pro 在離峰時段便宜約 3 倍,且脈絡視窗是對手的兩倍,這確實是保留它的正當理由——但你買的不是你拿來做基準測試的那個模型,而是一個 DeepSeek 已經宣布將會重新指向的模型字串,費率每小時都在變,而且其授權條款與權重集讓自架成為真正可行的第三個選項。如果工作負載是長脈絡、高流量且可快取的,DeepSeek 的經濟效益很難被超越,而你應該針對其後繼者而非這個檢查點來設計。如果工作負載屬於任何出錯代價高昂的類型,就付那 3 倍價錢,採用那個願意承認不確定性的模型。

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新