
Grok 4.6 对决 DeepSeek V4 Pro:相隔 24 小时的前沿价格战
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 232 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
两个前沿模型在24小时内相继发布,它们定价表之间的差距是这一代产品中最大的。Grok 4.6 于2026年8月12日发布,输入token每百万2美元,输出每百万6美元。DeepSeek V4 Pro —— DeepSeek旗舰型号 DeepSeek-V4-Pro-0813 的正式生产版 —— 紧随其后于2026年8月13日发布,定价为每百万未命中缓存的输入token ¥3、每百万输出 ¥6,约合0.42美元和0.85美元。同类产品,同样的智能体雄心,价格上却相差一个数量级。这不是两个规格的对比,而是两种关于智能体形态模型应如何定价的战略对比——二者均于本周发布。
这篇文章将两份价目表并排对比,在各种基准宣称上标注厂商并进行解读,然后计算出在实际工作负载下这一差距的真实成本——因为在纸面上,这些模型在能力上的差距小于理念上的差距,而每项任务的价格差异才是决策的关键所在。
时机才是重点
两款模型同时落进同一个48小时窗口,并非日历的巧合。Grok 4.6 是 SpaceXAI 对其 1.5T 基础模型的智能体化重塑——一场以强化学习为核心、横跨编码、内核工作与 CAD 的训练后刷新,定价定位为该公司旗下 Cursor 和 Grok Bot 产品的燃料。DeepSeek V4 Pro 则是一款预览版的正式化,该预览曾以极低的价格悄然重新定义了"智能体"的含义,如今针对智能体经济做了增强:DeepSeek 的 0813 构建版本发布说明以显著改进的智能体能力打头,新增对 Responses API 和 Codex 集成的支持,并同时保留思考模式(默认)与非思考模式、JSON 输出、工具调用以及 Anthropic API 格式。两家截然不同的公司同时得出结论:2026 年末真正重要的市场是智能体——并针对截然不同的钱包需求给各自产品定了价。
这两张并排的价目表
• Grok 4.6 — 每百万 tokens 收费 $2.00 / $6.00 / $0.50(缓存输入),500K 上下文,在约 200K 输入 tokens 之上加收 $4 / $12 / $1,以及一个速度更快的变体,价格为基本费率的两倍。
• DeepSeek V4 Pro — 缓存未命中输入每百万 tokens ¥3.00(约 $0.42),缓存命中输入每百万 tokens ¥0.025(约 $0.0035),输出每百万 tokens ¥6.00(约 $0.85),支持 100 万 token 上下文窗口,最多可输出 384K tokens。其更便宜的兄弟型号 V4 Flash 售价为 ¥1 / ¥2。
即使与 Grok 4.6 相比 —— 它已经是同代中最便宜的前沿 API —— DeepSeek V4 Pro 在缓存未命中输入上大约便宜五倍,在输出上便宜七倍,并且在同样的价格档次上带来了 2 倍更大的上下文窗口和远为更大的最大输出。两者并不是在价格上竞争;DeepSeek 单方面设定了新的价格下限,而 Grok 现在成了同一句话中的高端选项。这种说法很重要,因为之前的说法 —— “Grok 4.6 是廉价的前沿模型” —— 只在一天内成立。

DeepSeek V4 Pro 实际改进了什么
DeepSeek的发布数据最为引人注目,因为它们是与其自身预览版对比的,而从预览版到正式版的飞跃非常巨大。在该厂商自身的评估中:
• DeepSWE——在发布版本上达到62.7%,相比预览版的12.8%有所提升——这是该供应商给出的软件工程长期任务得分,将其排在Opus 4.8的58.0%和Claude Fable 5的70.0%之间。
• Cybergym——83.3%,高于此前的52.7%,略胜Fable 5的83.1%,并超过Opus 4.8的78.3%。
• Terminal Bench 2.1——87.9%,与 Fable 5 的 88.0% 仅差不到一个百分点,领先于 Opus 4.8 的 85.0%。
• AutomationBench(公开)——31.8%,较12.8%有所提升,同时领先于Fable 5(29.1%)和Opus 4.8(27.2%)。
• Toolathlon-Verified、NL2Repo、DSBench-FullStack 和 DSBench-Hard——分别为 74.1%、61.5%、71.1% 和 67.2%,集中位于或接近 Opus 4.8 / Fable 5 档位。
{{1}}这些结果均由DeepSeek在其自身的评测套件上报告。{{/1}}{{2}}方向已非常明确——预览版尚未达到生产级代理循环的可用标准,而正式版声称已达标——{{/2}}{{3}}但客观地说,目前尚无独立实验室对DeepSeek V4 Pro进行评分,{{/3}}{{4}}其对比的基准模型也并非由外部机构指定。{{/4}}
Grok 4.6 用什么来回答
Grok 4.6 的对标产品在性质上有所不同:它是两者中唯一拥有独立评分板的。Artificial Analysis 在其 Intelligence Index 上测得 61 分——与 GPT-5.6 Sol 持平,领先 Kimi K3(60)——而当时 DeepSeek V4 Pro 甚至还未发布。其厂商表格声称在 DeepSWE v1.1 上取得领先的 65.9%,在 CursorBench v3.2 上取得 69.9%,并公开承认在 Terminal-Bench v3.0 上仅有 26% 的弱点。这些数据均由 xAI 报告,截至 8 月 13 日尚未有任何一项被独立复现。
当你试图直接比较两者时,版本不匹配就很重要。DeepSeek 的 87.9 分来自 Terminal Bench 2.1;Grok 的 26% 来自难度更高的 v3.0——不同的考试,所以“DeepSeek 在终端测试上碾压 Grok”并非实事求是的说法;而“Grok 在 DeepSWE 上领先”如果不注明两家厂商运行的是不同版本的评估、且两个数字都不是第三方测评结果,也同样站不住脚。真正可比较的是独立维度:Grok 4.6 有一份经过验证的成绩单,DeepSeek V4 Pro 还没有任何一份;对生产环境选型决策来说,这种不对称本身就是一条信息。

长时间智能体运行的总成本
考虑一个现实的智能体任务——阅读并推理超过 50 万 token 的上下文,生成 10 万 token 的输出,这相当于一次中型重构或一个长文档流水线,且完全位于两个模型的窗口之内:
• Grok 4.6——0.5M 输入按 $2 计 = $1.00,加上 0.1M 输出按 $6 计 = $0.60。总计:$1.60。
• DeepSeek V4 Pro — 0.5M 缓存未命中输入,按 ¥3 计为 ¥1.50,加上 0.1M 输出,按 ¥6 计为 ¥0.60。总计:¥2.10,约合 $0.29。
在同样的名义任务上,这是一个5.5倍的差距,还没算上任何缓存优势——而且DeepSeek的100万上下文窗口加上38.4万最大输出,也意味着任务可以单次处理完成,而Grok 4.6的50万窗口可能被迫分成两次。这件事之所以不能一句话说清,症结在于推理成本和风险:DeepSeek的思考模式默认开启,所以即使你不需要,每次请求也要为完整的推理轨迹付费,并且该厂商对自己基准测试的信心从未经过任何独立方验证。按这些费率,在始终开启推理的情况下,每token便宜换算成每任务依然便宜,但“便宜”和“已验证”是两种不同的说法,而这两个模型中只有一个配得上后者。
谁应该选择哪个
这个决定与其说是“哪个更好”,不如说是“哪种风险特征适合工作负载”:
• 高吞吐、受成本约束,且愿意接受未经验证的数字——DeepSeek V4 Pro 是价格地板之选。1M 上下文和 384K 输出使其成为更强的长上下文及批处理候选,而 ¥0.025 的缓存输入费率让检索密集型流水线几乎免费。只需自己做评估,因为没有独立方做过。
• 在兼容 OpenAI 的生态系统中,以独立记分卡呈现的智能体深度——Grok 4.6 的 61 分已获验证,其编码与智能体基准方向一致,终端侧短板亦事先明确。42 秒的首令牌延迟,就是为这份可靠质量付出的代价。

• 混合流量——这种情况应当做路由,而不是二选一。在 OrcaRouter 上,两个模型都位于同一个密钥之后,按提供商列表的转售价格计费——因此 DeepSeek 的 ¥3/¥6 在账单上仍是 ¥3/¥6,Grok 4.6 仍是 $2/$6,两者均无加价。路由规则可以把长上下文、成本敏感的任务发给 DeepSeek V4 Pro,把经过验证的智能体类任务发给 Grok 4.6,按请求拆分流量,直到你自己的评估确定最终比例;如果任一厂商第一周的实际表现与其发布数据不符,还可以依赖自动故障转移。对于两个刚发布一天、分别处于价格战两端的模型来说,能在自己的负载上同时比较二者——并且无需改代码就能切换分流比例——并非一种便利。这是采用其中任何一个唯一站得住脚的方式。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
