
Grok 4.6 對決 DeepSeek V4 Pro:相隔 24 小時的前沿價格大戰
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 232 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
兩款前沿模型在 24 小時內相繼推出,它們的價目表之間的差距是這一代產品中最大的。Grok 4.6 於 2026 年 8 月 12 日推出,每百萬輸入 token 收費 2 美元,每百萬輸出 token 收費 6 美元。DeepSeek V4 Pro——DeepSeek 旗艦模型的正式生產版本,版本號 DeepSeek-V4-Pro-0813——緊隨其後於 2026 年 8 月 13 日推出,每百萬 cache-miss 輸入 token 收費 3 人民幣,每百萬輸出 token 收費 6 人民幣,約合 0.42 美元和 0.85 美元。同樣的類別,同樣的代理型(agentic)野心,價格卻相差一個數量級。這不是兩種規格的比較;而是兩種關於「代理形態的模型應該如何定價」的策略比較,而兩者都在本週發布。
這篇文章將兩份價目表並列比較,逐一對照各家供應商的基準測試宣稱並標註供應商名稱,進而計算出在真實工作負載下這些差距實際造成的成本差異——因為在紙面上,這些模型的效能相近程度遠高於其理念的接近程度,而每項任務的價格差異才是決定取捨的關鍵所在。
時機就是關鍵。
這兩個模型落在同一個 48 小時窗口內,並非日曆上的巧合。Grok 4.6 是 SpaceXAI 對其 1.5T 參數基礎模型進行的代理式重構——一場大量採用強化學習的後訓練更新,涵蓋程式開發、kernel 開發與 CAD,定價成為該公司旗下 Cursor 和 Grok Bot 產品的燃料。DeepSeek V4 Pro 是一個預覽版的正式化,該預覽版以極低的價格悄然重新定義了「agentic」的意義,如今更進一步為智能體經濟強化:DeepSeek 發行的 0813 版本說明以「顯著改善的智能體能力」為首要項目,新增對 Responses API 與 Codex 整合的支援,並保留思考(預設)與非思考模式、JSON 輸出、工具呼叫,以及 Anthropic API 格式。兩家截然不同的公司同時得出同一個結論:2026 年底真正重要的市場是智能體——並各自為產品訂出了迎合完全不同錢包的價格。
並排的兩份價目表
• Grok 4.6 — 每百萬個 token 收費 $2.00 / $6.00 / $0.50(快取輸入),500K 上下文,超過約 200K 輸入 token 後階梯費率為 $4 / $12 / $1,另有以基本費率雙倍計價的更快版本。
• DeepSeek V4 Pro — 每百萬個 token 的未命中快取輸入為 ¥3.00(約 $0.42),快取輸入為 ¥0.025(約 $0.0035),輸出為 ¥6.00(約 $0.85),並提供 100 萬個 token 的上下文視窗,以及最高 384K 的輸出 token。其較便宜的兄弟產品 V4 Flash 則為 ¥1 / ¥2。
即使對上 Grok 4.6——已經是同代中最便宜的 frontier API——DeepSeek V4 Pro 在 cache-miss 輸入上約便宜五倍,輸出上便宜七倍,而且在同一個價格帶提供 2 倍大的上下文窗口和遠更大的最大輸出。兩者並非在價格上競爭;DeepSeek 單方面設定了新低價,而 Grok 現在成了同一句話中的高階選項。這種框架很重要,因為之前的框架——「Grok 4.6 是便宜的 frontier 模型」——只成立了一天。

DeepSeek V4 Pro 實際上改進了什麼
DeepSeek 的發布數據最為驚人,因為這些數據是與其自家的預覽版相比較,而從預覽版到正式版的躍升幅度相當巨大。根據該供應商自身的評估:
• DeepSWE — 正式版得分為 62.7%,高於預覽版的 12.8% — 這是廠商在軟體工程長程任務上的評分,介於 Opus 4.8 的 58.0% 與 Claude Fable 5 的 70.0% 之間。
• Cybergym — 83.3%,高於先前的52.7%,略勝 Fable 5 的83.1%,並擊敗 Opus 4.8 的78.3%。
• Terminal Bench 2.1 — 87.9%,與 Fable 5 的 88.0% 相差不到一個百分點,並領先 Opus 4.8 的 85.0%。
• AutomationBench(公開)——從 12.8% 上升至 31.8%,領先 Fable 5(29.1%)和 Opus 4.8(27.2%)。
• Toolathlon-Verified、NL2Repo、DSBench-FullStack 和 DSBench-Hard的成績分別為 74.1%、61.5%、71.1% 和 67.2%,集中在 Opus 4.8 / Fable 5 水準附近或與其相當。
那些每一項都是 DeepSeek 在自家評測套件上的回報。方向明確無誤——預覽版尚未準備好用於生產級代理迴圈,而發行版聲稱已準備就緒——但誠實而言,尚無任何獨立實驗室對 DeepSeek V4 Pro 進行評分,且其所對比的基準模型也並非由外部單位指名。
Grok 4.6 會回答什麼
Grok 4.6 的對手在性質上不同:它是兩者中唯一擁有獨立記分牌的。Artificial Analysis 在其智慧指數上對它的評測為 61 分——與 GPT-5.6 Sol 並列,領先 Kimi K3(60 分)——甚至在 DeepSeek V4 Pro 上市之前。其供應商表格聲稱在 DeepSWE v1.1 上領先的 65.9%,以及在 CursorBench v3.2 上的 69.9%,同時坦承在 Terminal-Bench v3.0 上的弱點為 26%。這些都是 xAI 所報告的,截至 8 月 13 日尚未有任何獨立重現。
當你試圖直接比較這兩者時,版本不一致就很重要。DeepSeek 的 87.9 是在 Terminal Bench 2.1 上;Grok 的 26% 是在更難的 v3.0 上——不同考試,所以「DeepSeek 在終端機上碾壓 Grok」這種說法並不誠實,「Grok 在 DeepSWE 上領先」也不是,因為沒有指出兩家廠商跑了不同的評測版本,而且這兩個數字都不是第三方提供的。真正可以比較的是獨立面向:Grok 4.6 有一份經過驗證的成績單,DeepSeek V4 Pro 還沒有任何一份,而對生產決策來說,這種不對稱本身就是資訊。

長時間代理程式執行的總成本
以一個實際的代理型任務為例——在兩個模型的上下文視窗內,閱讀並推理超過 500K tokens 的內容,撰寫 100K tokens 的輸出,這相當於一次中型重構或一個長文檔管線:
• Grok 4.6 — 輸入0.5M,單價$2,共$1.00;加上輸出0.1M,單價$6,共$0.60。總計:$1.60。
• DeepSeek V4 Pro — 0.5M 快取未命中輸入,單價 ¥3/M,即 ¥1.50;加上 0.1M 輸出,單價 ¥6/M,即 ¥0.60。總計:¥2.10,約$0.29。
在相同的名義任務上,在計算任何快取優勢之前,這就是 5.5 倍的差距——而且 DeepSeek 的 1M 窗口加上 384K 最大輸出,也意味著任務可以一次處理完成,而 Grok 4.6 的 500K 窗口可能被迫分成兩次。讓這無法成為一句話答案的癥結,在於推理成本與風險:DeepSeek 的思考模式預設開啟,因此即使你不需要,每次請求都必須為完整的推理軌跡付出成本;而該廠商對自家基準測試的信心,從未經過任何獨立方的驗證。以這些費率而言,每個 token 便宜且推理永遠開啟,每項任務仍然划算,但「便宜」與「經過驗證」是兩種不同的宣稱,而這兩款模型中只有一款承擔得起後者。
該由誰來選擇哪一個
這項決策與其說是「哪個比較好」,不如說是「哪種風險配置符合工作負載」:
• 高流量、成本導向,且願意接受未經驗證的數據 — DeepSeek V4 Pro 是價格底線的選擇。1M 的上下文和 384K 的輸出使其成為更強的長上下文與批次處理候選,而 ¥0.025 的快取輸入費率讓檢索密集型管線幾乎免費。請自行做好評估,因為沒有任何獨立第三方做過。
• 在 OpenAI 相容生態系統中,以獨立評分卡驗證的代理深度——Grok 4.6 的 61 分已獲驗證,其編碼與代理基準方向一致,且終端弱點事先已知。42 秒的首次輸出延遲(time-to-first-token),是為獲得經驗證品質所付出的代價。

• 混合流量——這是路由而非選擇的場景。在 OrcaRouter 上,兩個模型共用同一個金鑰,按供應商清單轉嫁定價——所以 DeepSeek 的 ¥3/¥6 在發票上仍是 ¥3/¥6,Grok 4.6 仍是 $2/$6,兩者都零加成。路由規則可以把長上下文、成本受限的工作發送給 DeepSeek V4 Pro,把經驗證的代理型工作發送給 Grok 4.6,按請求拆分流量,直到你自己的評估確定拆分比例;如果任一供應商第一週的實際表現與其發布數字不符,則依賴自動故障轉移。對於一對剛發布一天、站在價格戰兩端的模型,能在自己的工作負載上比較兩者——而且不需要改程式碼就能切換拆分——並不是一種便利。這是採用其中任何一個的唯一站得住腳的方式。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
