一张为文章《Grok 4.7 vs Grok 4.6 —— 同样的价格,不同的模型》生成的主视觉标题卡,副标题为“9 月 21 日的发布究竟改变了什么”,数据标签显示 Terminal-Bench 4.0 为 38.0% 对 20.3%,AA Index 为 46 对 44,两者均为 $2/$6。
Guides & Insights

Grok 4.7 与 Grok 4.6:同为 $2/$6 定价,底层却是另一款模型

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

SpaceXAI 发布了 Grok 4.7,时间是 2026 年 9 月 21 日,而关于它首先值得注意的是没有变化的东西:价格。Grok 4.7 的价格是每百万输入 token 2 美元,每百万输出 token 6 美元,与 Grok 4.6 自 2026 年 8 月 12 日推出以来的价格完全一样。相同的费率表,相同的 500,000 token 上下文窗口,相同的文本和图像输入——然而这两个模型在对智能体工作至关重要的评估上并不接近。根据 SpaceXAI 自己公布的数据,Grok 4.7 在 Terminal-Bench 4.0 上几乎比 Grok 4.6 翻倍,38.0% 对 20.3%。这就是整个对比的形态:一次同价位的代际替换,几乎所有提升都集中在一个地方,而 Grok 4.6 中让生产团队恼火的那些部分仍然存在。

这两个模型之间究竟有什么变化?

SpaceXAI 自己对这次发布的描述很有限,值得引用其大致轮廓,而不是那些形容词。Grok 4.7 构建在比 Grok 4.6 更大的基础模型之上,并且进行了一轮更长的强化学习训练,目标是那些“可能需要数小时才能完成”的任务。公司称,这轮训练提升了三个方面:自我验证、长上下文处理,以及在 Grok Bot 环境中的行为表现。其中并未声称有新架构、新模态或不同的服务栈。

这种说法很重要,因为它能预测基准测试的提升会出现在哪里,而它们恰好就出现在那里。对困难的多小时任务进行更长时间的 RL 训练,对终端和代码仓库工作的提升,远大于对知识测验的提升。如果你原本希望 Grok 4.7 会比 Grok 4.6 是一个更广泛的模型,发布说明给出的答案是否定的——它还是同样的模型形态,只是在智能体工作的困难端被进一步训练了。

参数这件事,是整个情况里唯一不属于供应商披露的部分。马斯克在九月初表示,Grok 4.7 大约有 2.1 万亿参数,而 Grok 4.6 是 1.5 万亿,增长了 40%,此后这个数字被到处重复。它从未出现在 SpaceXAI 的规格表中。应把它视为一个关于基础模型的、被广泛转述的说法,而不是已确认的规格——并且要注意,在架构稀疏的情况下,参数数量对服务成本或能力的说明非常有限,而 Grok 系列正是如此。

附有来源标签的基准差距

本节中的每一个数字都来自SpaceXAI的发布材料。在撰写本文时,其中没有任何内容经过独立复现;诚实的读法是将其视为一组恰好异常具体的说法——这使其日后可核查,但并不意味着它现在已被验证。

• Terminal-Bench 4.0 — Grok 4.7 38.0%(厂商报告)对比 Grok 4.6 20.3%。这是本次发布中最大的单项差值,也与“在更难任务上进行更长 RL”的说法相符。

• CursorBench 4.0 —— Grok 4.7 为 46.3%(厂商报告),而 Grok 4.6 为 40.4%。这是实打实的提升,但幅度有限——不到六个百分点,而且该基准测试更贴近日常编辑器工作,而非自主终端会话。

• DeepSWE v1.1 — Grok 4.7 在高推理强度下达到 71.0%(厂商报告),而 Grok 4.6 为 65.2%。这又是一次稳健但并不惊艳的提升。

• EEBench — Grok 4.7 64.0%(厂商报告)。并未同时发布 Grok 4.6 的数据,因此这一项无法说明升级情况。

• AA-Briefcase v1.1 — 在专业知识工作评估中,Grok 4.7 获得 1,657 Elo(厂商报告)。

把这份列表作为一个整体来看,模式是一致的:Grok 4.7 在任务较长且具有代理性时有显著提升,而在任务较短时只有微幅提升。Terminal-Bench 的跃升大约翻了一倍;编辑器工作的收益则是个位数百分比。如果你的工作负载是自动补全型的,你为了一点小改进支付同样的 $2/$6。如果你的工作负载是“运行两小时再回来”,那么这个版本就是直接为你准备的。

独立测量目前说明了什么

有一个独立的数字,值得仔细说明,因为它很容易被误读。Artificial Analysis 在其 Intelligence Index(版本 v4.3.2)上给 Grok 4.7 打了 46 分,在榜单的 655 个模型中排名第 16。Grok 4.6 在同一量表上为 44 分。综合指数上两分的差距并不是 Terminal-Bench 所显示的那种翻倍,而这一差异具有信息量,而非相互矛盾:该指数融合了推理、知识、数学和编程,因此某一个智能体切片中的大幅提升,会被模型没有改变的所有其他方面稀释。

同一页面上的另外两个细节比头条得分更有用。第一,Grok 4.7 在运行该指数时生成了 2.4 亿个输出 token,而中位数为 9200 万——它是一个冗长的推理模型,按每百万输出 6 美元的费率计算,这种冗长就是一项开支。第二,该指数的综合得分使其跻身同一价格档位中最强模型之列,而这才是对买家而言真正重要的比较。Artificial Analysis 尚未在模型页面上公布 Grok 4.7 的完整价格,因此不要从那里获取其每任务成本数字;请使用供应商的 $2/$6。

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

两个模型都没能修复的定价悬崖

这就是 Grok 4.6 费率表中让生产团队深恶痛绝的那部分,而 Grok 4.7 并未改变它。输入 token 低于 200,000 时,费率为输入 $2、输出 $6。超过后,整个请求会重新计价为输入 $4、输出 $12。不是超额部分的 token——而是整个请求。一次 210,000 token 的调用,费用是一次 199,000 token 调用的两倍,而只多了 11,000 个 token。

在两个模型都具备 500,000 个 token 上下文窗口的情况下,那道悬崖很容易一脚踏空。长上下文智能体运行和整个代码仓库的提示词,正是 Grok 4.7 为之调优的工作负载,这意味着该模型的最佳用例,也恰恰是最有可能触发翻倍的那个。如果你因为 Grok 4.7 能更好地处理长时间的智能体会话而将工作迁移到它上面,那么请在迁移之前就为重新定价做好预算,而不是之后。

还有一个速度档位需要考虑。SpaceXAI 推出了 Grok 4.7 的快速版本,将输出速度提高一倍,同时标价也翻倍。对于交互式编程来说,这是合理的取舍;对于批处理工作来说则很不划算——同样的任务、同样的质量,成本却要翻倍,只为换来没人关注的墙钟时间节省。

无需重写即可从 Grok 4.6 迁移

实际的好消息是,这是一次模型替换,而不是平台迁移。两个模型都接收文本和图像并返回文本,都使用从 low 到 xhigh 的相同推理强度级别,而且请求形态与 SpaceXAI 自 Grok 4.5 以来一直在提供的完全一致。使用 effort 参数调用 Grok 4.6 的代码,无需重构即可调用 Grok 4.7。

换用新模型并非没有代价,代价在评估环节。Grok 4.7 的提升集中在长时间的智能体运行中,因此用短小的单轮提示构建的测试套件几乎什么都看不出来——你只会看到 CursorBench 量级的提升,并断定这次升级不值得投入,而升级的理由其实存在于你的测试套件从未涉及的任务里。真正能一锤定音的衡量标准是多步工作中的任务完成情况:被接受的补丁、引入的回归、每完成一个任务所需的工具调用次数,以及一次运行需要人工救场的频率。这些正是厂商自己的数据所指向的维度,也正是没有任何已发布基准能针对你的代码库覆盖的维度。

冗长程度是第二个要衡量的指标。一个在标准索引上输出 2.4 亿个 token 的模型,在你的工作负载上输出的 token 会比其前代更多,而按每百万输出 6 美元计算,这可能悄无声息地抹掉同价升级的价值。在做出决定之前,先跟踪一周内每完成一个任务的输出 token 数。

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

该给哪一个打电话

这个决定本身其实很简单,这在模型对比中并不常见。对于短轮次、对成本敏感的流量——聊天、分类、摘要以及编辑器规模的代码辅助——Grok 4.6 依然是正确的选择,在这些场景中 Grok 4.7 的提升微乎其微,而它的啰嗦反而是一种负担。Grok 4.7 则是它为之打造的那类工作负载的正确选择——长周期智能体编程和终端作业,这类任务往往要运行数小时,而自我验证决定了最终是完成任务还是陷入停滞。

在这里,两者同时运行并非妥协之举,而是正确答案,而且成本很低。Grok 4.6 已收录于 OrcaRouter 的目录中,按 SpaceXAI 的标价、0% 加价直接透传,因此你支付的就是上文所列的 $2/$6 价目表——而且由于我们透传的是供应商标价而非加价转售,任何厂商价格变动都会在落地当天同步到我们这边。一个 API 密钥即可覆盖 Grok 4.6 以及200 多个其他模型,因此按任务在它们之间调配流量只需改配置,而无需再签一份合同。如果你想在完全信任 Grok 4.7 之前先在生产路径上试用它,更稳妥的模式是把回退保留在 Grok 4.6 上——这是你今天就能路由的模型——并让跨提供商自动故障转移在新模型表现异常时把请求转回去。

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

接下来看什么

有两件事将决定这场对比的胜负,而这两件事目前都尚未发生。第一是对 Terminal-Bench 4.0 这一数据的独立复现——38% 的跃升幅度足够大,肯定会有人重新运行验证;如果结果能够站得住脚,那么在智能体流水线中采用 Grok 4.7 的理由便是基于其实力,而非营销宣传。第二是 Grok 路线图的其余部分:SpaceXAI 已公开将 Grok 4.8、Grok 4.9 和 Grok 5 排在此次发布之后,而 Grok 4.6 自身的生命周期只有约五周。把 Grok 4.7 当作长期平台假设来押注,将会重蹈各团队在 Grok 4.5 上犯下的错误。

目前,同价升级是真实存在的,前进方向也很明确。要记住的数字是,$2/$6 让你买到的模型在长周期终端任务上大致翻倍,而在其他方面几乎没有变化——这是一个具体、有用、可核实的说法,而不是一次代际跃迁。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新