
Grok 4.7 对比 DeepSeek V4 Pro:一个是新的,另一个正在你眼皮底下被替换
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年9月10日发布的一则说明,改变了这场对比的焦点。“我们正在逐步淘汰 V4-Pro,”其中写道,自2026年9月14日04:00 UTC起,所有发往 deepseek-v4-pro 模型串的请求都会被路由到 DeepSeek-V4.1-Flash,并按 V4.1-Flash 的价格计费——该文章称,这种状态将持续“直至 V4.1-Pro 发布”。模型串依然会响应。但它背后的模型已不是你跑过基准测试的那个。这使得与 Grok 4.7 的正面较量——该模型由厂商于2026年9月21日发布,也就是本文撰写的前一天——成了一场有一方带着有效期的对比。就现有数据而言,Grok 4.7 是更强的模型,DeepSeek V4 Pro 则是更便宜的那个。而在真正决定是否集成的问题上,两者之中只有一个仍然是它所声称的那个东西。
在评分之前,每个模型是什么
DeepSeek V4 Pro 于 2026 年 8 月 13 日正式全面可用,以 DeepSeek-V4-Pro-0813 检查点的形式发布,此前在 4 月 24 日推出了预览版。它基于 MIT 许可证开放权重——该许可证允许商业使用、修改和再分发,不设收入门槛,也没有地区性限制条款——GA 模型卡显示其总参数量为 1.7 万亿,上下文窗口为 100 万 token,最大输出为 384K,是本轮对比中输出上限最高的。它仅支持文本:DeepSeek 自家的定价页面明确说明 v4-pro 不支持视觉功能,这对任何需要向其输入截图或 PDF 的用户来说都是一个实实在在的限制。它提供低、高、最高三档推理强度调节,并且每个账户最多支持 500 个并发请求,可按需申请扩容。
Grok 4.7 采用闭源权重,发布仅一天。它提供 50 万 token 的上下文——仅为 DeepSeek 的一半——支持文本和图像输入,并带有自己的投入力度调节旋钮。其标价为:在提示 token 低于 20 万时,每百万输入 token 2.00 美元、每百万输出 token 6.00 美元;达到或超过该阈值后翻倍至 4.00 美元和 12.00 美元;缓存读取则为 0.50 美元和 1.00 美元。xAI 还列出了一个更快的变体,输出速度约为两倍,价格也约为两倍。在此处查阅的文档中,两家厂商均未公布 Grok 4.7 的最大输出数值,因此应将该维度视为未知,而非等同。
在共享索引上,这一差距在一个方向上是不均衡的
两个模型均在 Artificial Analysis Intelligence Index v4.3.2 上评分,该修订版发布于 2026 年 9 月 19 日。Grok 4.7 的那一列是在 xhigh 努力设置下测得的;DeepSeek 的那一列则是 0813 检查点在 max 努力设置下的结果。将两者放在一起看,综合得分差距低估了这两个模型的能力形态究竟有多不同。
• 综合——Grok 4.7:在Artificial Analysis智能指数v4.3.2上得46分。DeepSeek V4 Pro 0813:在同一版本上得36分。
• 终端智能体 —— Grok 4.7:Terminal-Bench 4.0 得分 26。DeepSeek V4 Pro:14。在最接近自主软件工作的评测中,几乎翻了一倍。
• 自动化 —— Grok 4.7:AutomationBench-AA 66%。DeepSeek V4 Pro:57%。两者都可信;Grok 领先九个百分点。
• 知识与幻觉——Grok 4.7:AA-Omniscience 32。DeepSeek V4 Pro:1。这是榜单上的离群值,而且并非四舍五入产生的假象——该指数既评估模型知道什么,也评估它在不知道答案时杜撰答案的频率。
• 长上下文——Grok 4.7:AA-LCR v1.1 77%,窗口 500k。DeepSeek V4 Pro:80%,窗口 1M。这是 DeepSeek 唯一明确的胜绩,而这正是其 1M 窗口所为之打造的维度。
• 高难度推理——Grok 4.7:HLE 43,CritPt 18。DeepSeek V4 Pro:HLE 41,CritPt 18。在物理基准测试上打成平手,Grok 在 HLE 上领先两分。
• 冗长程度 — Grok 4.7:运行该索引消耗 2.4 亿个输出 token,被标记为异常啰嗦。DeepSeek V4 Pro:1.63 亿。两者都话多;Grok 话更多。

价格并非一个数字,而是一份时间表
DeepSeek 的定价是它最激进的地方,也是最不适合拿来报价的地方。deepseek-v4-pro 的标价是:缓存未命中时每百万输入 token 0.66 美元,每百万输出 token 1.98 美元——而这还是在非高峰时段。高峰时段这两项价格翻倍,变为 1.32 美元和 3.96 美元。根据 DeepSeek 自己的文档,高峰时段为 UTC 时间周一至周五 01:00–04:00 和 06:00–10:00,中国法定节假日除外;其余所有时间,包括整个周末,都是非高峰时段,价格正好减半。缓存输入读取才是真正的亮点:非高峰 0.022 美元,高峰 0.044 美元,比缓存未命中便宜三十倍,这使得缓存做得好的 DeepSeek 工作负载远比其价目表所暗示的要便宜。
相比之下,Grok 4.7 的 2.00 美元和 6.00 美元就显得昂贵了——大约是 DeepSeek 非高峰时段输入价格的 3 倍,也是其非高峰时段输出价格的 3 倍。不过,这一对比在某些方面会缩小,值得了解。Grok 4.7 的价格在其区间内是固定的,而非取决于时段,因此 UTC 09:00 的生产高峰与周日夜晚的批处理成本相同;DeepSeek 则不同。而当提示词超过 200k token 时,Grok 4.7 的价格会翻倍,此时它就是 DeepSeek 非高峰费率的四到六倍,而不是三倍。最简洁的说法是:DeepSeek V4 Pro 在每个维度上都是更便宜的模型,而折扣幅度取决于你何时运行以及缓存效果如何。
9月14日改变了什么
正是这一点,让价格方面的论据更难站得住脚。自2026年9月14日起,DeepSeek 会将 deepseek-v4-pro 的请求路由至 DeepSeek-V4.1-Flash,并按 Flash 费率计费——而这一费率还更低。DeepSeek 的变更日志和定价页面所呈现的说法,与9月10日的新闻稿略有出入:定价表仍将 deepseek-v4-pro 列为一个有效条目,拥有自己的费率,且没有退役标记;而变更日志条目称,V4 Pro 的 API 服务在9月14日之后继续提供,计费保持不变。无可争议的是其走向。V4.1-Pro 已确认在开发中,但尚未公布日期;而9月10日发布的 V4.1-Flash,正是 DeepSeek 自家公告所称在“性能、成本、速度和总运行时长”上优于 V4 Pro 的版本,这一厂商说法尚未在同等广度上得到独立复现。
所以,实际问题不是“Grok 4.7 还是 DeepSeek V4 Pro”,而是“Grok 4.7 还是下个季度那个字符串所解析到的任意 DeepSeek 模型”。如果你在八月对 V4 Pro 做了基准测试,并围绕 1M 窗口、384K 输出上限来规划上下文预算,那么你在十一月调用的模型可能并不是你测量过的那个——而继任者的上下文和输出限制也不是你当初据以设计的那一套。Grok 4.7 的风险特征则相反:一个刚发布一天的模型,其数据由厂商报告、且基本未被复现,但它的身份毫无疑问。

路由器适合用在哪里,又不适合用在哪里
OrcaRouter 已上线 DeepSeek V4 Pro,模型页面以提供商自身的费率列出它——输入 $0.66、输出 $1.98,配备 1M 上下文窗口和 384k 最大输出——因为我们以 0% 的加价透传提供商的标价。对于一家费率按高峰/非高峰时段浮动的厂商来说,这一点比平时更为重要,而且其 9 月 10 日的公告还伴随着一次降价:DeepSeek 的价格变动当天就在同一个密钥上生效,没有重新定价的延迟,也无需第二份合同。当厂商在他们那一端重新路由某个模型字符串时,变更会通过同一个端点抵达,而无需你在自己这一端重新集成,而自动故障转移能让速率限制或提供商侧的容量事件不至于演变成服务中断——当你技术栈的某一侧被限制在 500 个并发请求时,这尤其有用。截至本文撰写时,Grok 4.7 尚未收录进 OrcaRouter 目录;要调用它,需通过 xAI 自家的 API 以及承载它的第三方平台。
这种分工算不上光鲜,但站得住脚:把 DeepSeek V4 Pro 留在那些真正依赖缓存命中定价和 1M 上下文窗口来干活的工作负载上,并把预期锁定在 V4.1-Flash 上,而不是 8 月那个检查点。把 Grok 4.7 放在模型必须知道自己不知道什么的任务上——AA-Omniscience 指数为 1 是一个再清楚不过的信号,说明模型愿意自信地给出错误答案,而一旦下游消费者相信了编造出来的答案,任何价格优势都保不住。
呼叫
Grok 4.7 在这里是更好的模型,而且差距并非毫厘之间:综合得分领先十分,Terminal-Bench 分数翻倍,自动化方面也有优势,知识诚实度的差距大到足以构成类别上的差异。DeepSeek V4 Pro 在非高峰时段的成本大约只有三分之一,并且上下文窗口是它的两倍,这是保留它真实且站得住脚的理由——但你买的不是你做过基准测试的那个模型,你买的是一个模型字符串,而 DeepSeek 已经宣布会将其重新指向,费率每小时都在变,其许可证和权重集还让自托管成为真正可行的第三种选择。如果工作负载是长上下文、高吞吐且可缓存的,DeepSeek 的经济性很难被超越,你应该面向后继版本而非当前检查点来设计。如果是任何出错代价高昂的场景,就付那三倍的钱,选择那个会承认不确定性的模型。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
