
Grok 4.7 在 Artificial Analysis 智能指数上得分 46,使 SpaceXAI 跻身前四
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 217 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Grok 4.7 在 Artificial Analysis 智能指数上得分 46,使 SpaceXAI 跻身前四
Grok 4.7 已发布。SpaceXAI 于 2026 年 9 月 21 日(周一)发布了它——输入 token 每百万 2 美元、输出 token 每百万 6 美元,与 Grok 4.6 相同,同样拥有 500,000 token 的上下文窗口,知识截止时间更晚,并新增了一个最高推理等级。它已在 Cursor 和 Grok Build 中上线,也可通过厂商自有 API,以及第三方编程工具链、模型路由器和云平台使用。7 月 8 日发布的 Grok 4.5 仍作为更便宜的选项位居其下,而它仍需超越的模型没有变化:Claude Fable 5.1、Claude Opus 5 和 GPT-5.6 Sol 在 Artificial Analysis 的 v4.3.2 智能指数上均高于它,Grok 4.7 的首个独立得分——46——比 Grok 4.6 高两分,比 Claude Fable 5.1 低七分。在同一评测方的 AA-Briefcase 长周期知识工作榜单上,它位列第四,排在三个 Claude 条目之后,领先于 xhigh 努力档的 Claude Opus 5,而每任务成本约为 Claude Opus 5 的一半——这是本次发布中首个读起来像是性价比胜利而非差距的独立结果。十一天过去,格局的扩展更多出现在边缘而非中部:自 10 月 1 日起,它一直在 Grok 自家的网页和移动应用内逐步推出,那里的模式选择器如今在其两个最难的条目上列出它,并且它已以 SpaceXAI 自己的 2 美元/6 美元价格出现在 OrcaRouter 上。
那就是发布。更有用的数字在同一天到来,来自这个故事中唯一不是厂商的那家评测方:Artificial Analysis 发布了对 Grok 4.7 的首个独立评测,而这是一个由三部分构成的结果——智能指数上的 46 分,仅比 Grok 4.6 高出两分;编程代理指数上的 56 分,比它高出九分;以及 AA-Briefcase 上的 1,657 Elo,领先 111 分。这三个数字指向不同方向,而它们之间的差距正是这次发布中最有趣的地方。接下来是已发布的规格、厂商自己的基准测试表以及每一行所需的标签,然后是对独立得分的正确解读——包括它们对 SpaceXAI 从未回应的就绪性保留意见所作的说明。
SpaceXAI 在9月21日发布了什么
先从规格参数说起,因为它与其前代产品异常接近。Grok 4.7 的定价与 Grok 4.6 完全相同——输入 token 低于 200,000 时,每百万输入 token 2 美元、每百万输出 token 6 美元;一旦请求超过这一阈值,便升至输入 4 美元、输出 12 美元,与 Grok 4.6 引入的结构一致。上下文窗口为 500,000 token。知识截止日期为 2026 年 5 月,比 Grok 4.6 的 2026 年 2 月 1 日晚了三个月。推理强度分为四个级别——low、medium、high 和 xhigh——公布的数据均以 xhigh 为准。快速变体的输出速度翻倍,价格也翻倍。
在底层,xAI 描述的是三项改动,而不是一种新架构。基础模型比 Grok 4.6 的更大。强化学习训练持续得更久,并更偏重于需要耗时数小时才能完成的任务。而且,该模型经过训练,能够验证自身的工作,并更好地保持长上下文,包括对 Grok Bot 运行框架的原生理解。该公司自己的一句话总结是“速度是同类模型的两倍,价格只有其一半”——这是针对竞争对手的定位说法,而非一项测量结果,也值得按定位说法来理解。
上线首日,其可用范围就很广,此后又扩大了两次。发布时包括:Cursor 和 Grok Build、厂商自己的 API、第三方编码工具、模型路由器和云平台;SpaceXAI 自家的 Grok Build 页面现在直接写着“使用 Grok 4.7 开始构建”。9 月 28 日,Amazon Web Services 将其加入 Amazon Bedrock,提供同样的 500,000 token 上下文窗口和同样的四档推理强度级别,并通过跨区域推理配置文件提供服务,因此该模型现在可以通过超大规模云服务商自己的目录访问,而不只是通过厂商的 API。随后在 10 月 1 日,它开始在 Grok 的消费级 Web 和移动应用内逐步推出;两天后,它仍停留在此。最后这一项异常悄无声息:SpaceXAI 曾用一篇题为“将 Grok 4.5 引入 iOS、Android、Web 和 X”的博文宣布 Grok 4.5 的同等进展,却未就 Grok 4.7 发布任何内容,因此这一变化是体现在产品中,而非被正式宣布。这是服务端变更,而不是随版本发布,应用商店列表也证实了这一点:Grok 的 iOS 和 Android 列表都在 10 月 1 日有变动——App Store 版本为 1.4.47,于当天发布,其发行说明只提到“对 Chat、Voice 和 Imagine 的改进”,而 Play 商店列表也在同一天更新。这一变更由后端推送,而非内置在二进制文件中。由于这次推出是被报道出来而非有文档记录,其确切范围比 Amazon Bedrock 的列表更难确定——后者背后有一篇带日期的 AWS 博文;而且相关报道已经出现偏差:跟踪此事的账号现在将 Grok 4.7 描述为所有模式——Fast、Expert、Build 和 Heavy——下的基础模型,而这一列表与 grok.com 实际提供的内容不符。应将其理解为跟踪者自己的报道,而不是厂商的描述。部分精选网络安全合作伙伴可通过仅限邀请的方式访问该模型的红队能力。
本文一直以来的记录需要做一处更正。流传了两个月的那个参数量——大约 2.1 万亿,比 Grok 4.6 的 1.5 万亿高出约 40%——至今仍未出现在任何规格表上。xAI 尚未公布 Grok 4.7 的参数量,Artificial Analysis 将该模型的规模列为未披露。这个数字始终只是创始人的说法,而此次发布并未让它成为一项规格。
基准测试表是 xAI 自己的——而以下内容则不是
下面列表中的每一个数字都来自厂商的公告,且没有任何一项经过独立复现。请带着这个标签来读:这些是 xAI 在 xAI 自行选定的评测上给出的数字,发布于发布当天,而任何一次发布的第一周都是厂商基准测试最不可靠的时候。对比列同样是厂商自己的——Grok 4.6(high)、GPT-5.6 Sol(max)和 Claude Fable 5.1(max),每一个都以厂商选定的推理努力等级运行。
• CursorBench 4.0 — Grok 4.7 46.3%,Grok 4.6 40.4%,GPT-5.6 Sol 41.7%,Claude Fable 5.1 51.8%。厂商报告。
DeepSWE v1.1 —— Grok 4.7 在高努力程度下为 71.0%,Grok 4.6 为 65.2%,GPT-5.6 Sol 为 72.7%,Claude Fable 5.1 为 70.0%。厂商报告。
• Terminal-Bench 4.0——Grok 4.7 为 37.6%,Grok 4.6 为 20.3%,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 57.9%。数据由厂商提供,且经过了修订:Grok 4.7 这一行在发布当日的表格中为 38.0%,而如今在厂商的页面上显示为 37.6%。
• EEBench — Grok 4.7 64.0%,Grok 4.6 53.0%,GPT-5.6 Sol 39.4%,Claude Fable 5.1 56.4%。厂商报告。
• Harvey 法律智能体 — Grok 4.7 19.6%,Grok 4.6 15.8%,GPT-5.6 Sol 2.5%,Claude Fable 5.1 6.7%。数据由厂商提供。
• HealthBench Professional — Grok 4.7 56.7%,Grok 4.6 48.5%,GPT-5.6 Sol 60.5%,Claude Fable 5.1 62.1%。厂商报告。
• AA Briefcase v1.1 — Grok 4.7 1,657,Grok 4.6 1,546,GPT-5.6 Sol 1,487,Claude Fable 5.1 1,678。这是表中唯一一行不再仅由厂商提供的数据:Artificial Analysis 自家的 AA-Briefcase 榜单在 xhigh 努力程度下为 Grok 4.7 公布的同样是 1,657,在 high 努力程度下为 Grok 4.6 公布的是 1,546。对比列仍是厂商自行选择的模型和努力程度。
• GDPval Elo — Grok 4.7 1,695,Grok 4.6 1,605,GPT-6 Astra 1,542,Claude Fable 5.1 1,735。厂商报告。
对这组数据的诚实解读并不是“Grok 4.7 胜出”。它在全部八项上都击败了 Grok 4.6,而这只是一个后继型号最起码该做到的。放到整个竞争格局中,它的成绩单则是有喜有忧:在 CursorBench、Terminal-Bench 和 EEBench 上领先 GPT-5.6 Sol,在 DeepSWE 上落后于它;在 CursorBench、Terminal-Bench、HealthBench 以及两项 Elo 式指标上落后于 Claude Fable 5.1,在 EEBench 和 Harvey 法律智能体评测上领先于它。它也说明了基准测试结果在多大程度上取决于努力档位——DeepSWE 的 71.0% 是高努力档下的数字,而同一张表中的其他数据引用的都是 xhigh 档。
安全是供应商说法异常具体的一个领域。xAI 表示,Grok 4.7 构建在一套全新的防护体系之上,并称其是该公司在拒绝响应和抗越狱方面测试过的最强模型。在 LatchBio 的生物安全基准上,它报告为 62.4%;在 HackerBench v0.3 上,它报告放行了 3.3% 的高风险双重用途提示,同时极少拦截合法的安全工作。这些都是供应商在其自家发布版本上报告的评估结果,没有第三方复现过。
这篇文章中第一批并非出自厂商之手的数字,是 Artificial Analysis 于 9 月 21 日发布的三项,而它们之间的分歧颇有信息量。在 Intelligence Index 上,Grok 4.7 在 v4.3.2 量表下、xhigh effort 档位取得 46 分——在该榜单上位列第 16——而 Grok 4.6 为 44 分。这 2 分的提升,正是 Artificial Analysis 所说的足以让 SpaceXAI 跻身该指数前四大实验室的幅度。要准确地理解这一排位:它陈述的是一个实验室最好的模型,而非这个模型本身,而这个模型本身仍比 Claude Fable 5 的 50 分低 4 分,比 Claude Fable 5.1 与 GPT-6 Astra 共同占据的 53 分低 7 分。2 分的提升同样落在同一模型不同 effort 档位之间常见的差异范围内,这提醒我们:后继模型得分高于前代,并不等同于后继模型改变了可能性的边界。关于如何解读这个数字,还有一点需要注意:量表版本很关键,因为 Artificial Analysis 重新表述了其指数,而出现在大多数 7 月和 8 月报道中的 61/62/63 这些数值属于已停用的 2026 年 9 月之前的量表——它们无法与这些数字相比较。
Coding Agent Index 是第二个数字,也正是发生变化的那个。在 SpaceXAI 自家的 Grok Build 测试框架中以 xhigh 努力级别运行时,Grok 4.7 得分为 56,而 Grok 4.6 为 47——是九分,而非两分——在以其原生测试框架评估的模型中位列第四,落后于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5,领先于 GPT-5.6 Sol。该指数是 DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 在 303 项任务上的等权复合指标,三个组成部分均有提升:DeepSWE 从 65% 升至 73%,Terminal-Bench 从 18% 升至 33%,SWE-Atlas-QnA 从 58% 升至 63%。这是首个独立证据,表明 xAI 所描述的修复——更长时间、偏向多小时任务的强化学习——确实起了作用;这也是团队在选择编码智能体时最应重视的数字,因为它是用模型实际随附的测试框架测得的,而非厂商自己的表格。
问题在于这九分要付出什么代价。Artificial Analysis 自己的运行在 Intelligence Index 上生成了2.4亿个输出 token,而其追踪的模型输出中位数为9400万——超过两倍——并将评估一个 Index 任务的成本定在3.74美元。按每百万输出 token 6美元计算,冗长度就是决定一个 agentic 循环是否负担得起的关键成本项,因此,用超过中位数两倍以上的输出换来的九分提升,是一笔实实在在的取舍,而非免费的升级。同一项测量还意味着,这些头条分数不应被当作单一结论来解读:按每 token 计算,Grok 4.7 相对 Grok 4.6 的优势比指数差值所显示的更小;而在构成 Intelligence Index 的通用知识评测上,它几乎就是同一个模型,只是账单大幅更高。下一节中的 AA-Briefcase 结果是这一点的例外,而且是一个很大的例外。

第二个独立董事会:AA-Briefcase,以及每项任务一半的成本能换来什么
Artificial Analysis 同一天还为 Grok 4.7 发布了第三个数字,而这个数字关乎知识工作,而非代码。在 AA-Briefcase 上——这是它专为长时程智能体式知识工作设立的榜单,由四个为期数周的项目场景和 91 项评分交付成果构建而成——Grok 4.7 在 xhigh 推理强度下获得 1,657 Elo,位列榜单第四,仅落后于 Anthropic 的条目:最大推理强度下的 Claude Fable 5.1(1,678)、最大推理强度下的 Claude Opus 5(1,673)以及 xhigh 推理强度下的 Claude Fable 5.1(1,669)。它在最大推理强度下落后 Claude Opus 5 16 Elo,而在 xhigh 推理强度下则领先 xhigh 推理强度下的 Claude Opus 5(1,649)8 Elo。要准确解读这一位置:“仅落后于 Anthropic 模型”正是 Artificial Analysis 自己所用的说法,而且它是准确的——但第四不是第二,而且排在它上面的三行都来自同一家厂商。
相较于上一代,这一提升是本次发布中最大的一次单项进步。在与 high effort 下的 Grok 4.6(1,546)对比时,xhigh 下的 Grok 4.7 在 AA-Briefcase 上提升了 111 Elo——是 Intelligence Index 上 2 分提升的五十多倍。Artificial Analysis 几乎完全将其归因于分析质量:该项为 1,994 Elo,而 Grok 4.6 为 1,690;与此同时,呈现质量略有下滑,为 1,499,对比 1,519。这是一个清晰可辨的特征:该模型对分析内容的推理更好,但对交付成果的格式呈现略差。同样的方向也体现在 Artificial Analysis 为 AA-Briefcase-Lite 引用的数据中;这是其在 Hugging Face 上发布的公开尽职调查场景——分析质量从 1,698 升至 1,994,呈现质量从 1,531 降至 1,499。关于这一比较有两点需要注意。AA-Briefcase-Lite 明确是演示性的:Artificial Analysis 自己的方法论页面称,这个公开的第五个场景“不计入官方 AA-Briefcase 结果”。而且为其引用的质量数据与主榜上发布的 xhigh 行数据一致,因此应将 Lite 这一段视为趋势方向的示意,而不是一个独立的记分板。
成本这一项才是这个结果真正改变决策的地方。AA-Briefcase 的每任务成本指标,是用运行完整提交的总成本除以其 91 项任务;把 Artificial Analysis 公布的总数折算下来,Grok 4.7 在 xhigh 下约为每任务 9.30 美元,而 Claude Opus 5 在最高努力档位下约为 17.79 美元——大约只有一半,代价是 16 个 Elo 的差距。Artificial Analysis 自己对这一结果的总结是,Grok 4.7 的排名“仅次于 Opus 5,而每任务成本约为其 50%”。这与本文其余部分所描述的权衡是同一个,只是从另一个方向得出同一个答案:Grok 4.7 并未击败前沿,而是以更低价格切入前沿之下。有两点需要说明,两者都是实话。token 账单是真实存在的——在 AA-Briefcase-Lite 上,Artificial Analysis 估算,生成示例演示文稿的 API 成本为:Grok 4.7 在 xhigh 下约 8 美元,而 Grok 4.6 在 xhigh 下约 4.40 美元,因此这个继任者在同一工作上比它所取代的模型贵约 80%。此外,每任务数字是按标价、根据一个有代表性的缓存命中率从 token 用量计算得出的,所以它们会随你的缓存情况而变化:它们是一份账单的模型,而不是你的账单。
Grok 4.7 与 Grok 4.6 及同类产品相比处于什么位置
• 每 100 万 tokens 的价格 — Grok 4.7 在输入低于 200K 时为 $2 输入 / $6 输出,超过该值时为 $4/$12;Grok 4.6 完全相同。
• 上下文窗口 — 两者均为 500,000 个 token。
• 知识截止日期——Grok 4.7 为 2026 年 5 月,而 Grok 4.6 为 2026 年 2 月 1 日。
• 推理强度 — Grok 4.7 的 low / medium / high / xhigh,相较于 Grok 4.6 已公布的级别。
• 独立得分——在 Artificial Analysis 的 v4.3.2 Intelligence Index 上,xhigh effort 下为 46,对比 44。Artificial Analysis 表示,这足以让 SpaceXAI 跻身该指数的前四实验室之列。
• 独立编码得分——在 Artificial Analysis 编码智能体指数上为 56 对 47,各模型均在其原生框架下运行。在原生框架模型中排名第四,领先于 GPT-5.6 Sol。
• 独立知识工作评分——在极高努力水平下,Elo为1,657,而在高努力水平下,Grok 4.6为1,546,来自Artificial Analysis的AA-Briefcase排行榜。总体排名第四,落后于Anthropic的三款模型,领先于在极高努力水平下的Claude Opus 5。
• 每个 AA-Briefcase 任务的成本——约 9.30 美元,而同一榜单上 Claude Opus 5 在最大努力下约为 17.79 美元。在 16-Elo 的差距下,每任务账单大约只有一半。
• 每次Index运行的输出 token 数——2.4亿,而Artificial Analysis追踪的各模型输出 token 数中位数为9400万。这一提升并非没有代价。
• 供应商编码评估——CursorBench 4.0 46.3% 对比 40.4%。
• 服务速度 — 相较于 {{1}}Grok 4.6{{/1}} 的标准服务,快速变体以两倍价格提供两倍输出速度。
• 安全性——一套全新的防护措施栈,据报告在 LatchBio 的生物安全基准测试中达到 62.4%;Grok 4.6 发布时并未附带这一声明。
而在同一张记分牌上,该领域的情况是:Claude Fable 5.1 得 53 分,Claude Opus 5 得 51 分,GPT-5.6 Sol 得 47 分,Kimi K3 得 44 分。马斯克本人的预测——Grok 4.7"应该大致与 Opus 5.0 持平,而非 5.1"——如今其下有了一个数字,而这个数字落在了他所说的位置:在前沿之下,而非之上。与 Claude Fable 5.1 的实测差距是七分;价格差距却朝相反方向延伸,Claude Fable 5.1 标价为每百万 token 10 美元/50 美元,而 Grok 4.7 为 2 美元/6 美元——输入价格是五倍,输出价格则超过八倍。这才是团队被要求做出的实际取舍,而且这是一场性价比的取舍,而非能力上的胜出。AA-Briefcase 是本文中唯一排序发生变化的榜单:在那里,xhigh 档的 Grok 4.7 领先于 xhigh 档的 Claude Opus 5,比分 1,657 对 1,649,但仍落后于最高努力档的 Opus 5(1,673),也落后于 Claude Fable 5.1(1,678)。在划下界线之前,把这三项独立得分并排来看也很有价值,因为它们指向并不一致:在通用智能上落后七分,在编程智能体指数上领先 GPT-5.6 Sol,在知识工作上以 111 Elo 的优势甩开其前代,并以输出 token 为代价换取这些提升。这些事实中哪一项决定你的选择,取决于工作负载是编程智能体、知识交付物还是聊天提示,而这比单一排名更有用的区分。
泄密消息说对了什么,以及它们未能确定的一件事
这篇报道追踪到九月的那批物件是真实的,而此次发布将它们变成了一场检验:这类证据究竟价值几何。以下是这份账目。
• 这个目录拉取请求把价格写对了。9 月 21 日那项把 Grok 4.7 加入一个开源代理客户端的 Zen 和 Go 目录的提交——于 05:36 UTC 创建,07:46 UTC 因缺少拉取请求模板部分被合规机器人自动关闭,从未合并——按照 Grok 4.6 公布的费率列出了该模型。结果证明它完全正确:$2/$6,没有变化。但机制比结果更重要。贡献者从它上面的模型复制了价格,而复制恰好成了正确的猜测。那是运气,不是权威,而且同一个拉取请求的能力声明也没有承载任何信息。一个提案可以是对的,却仍然不能作为证据。
• 预置的痕迹是真实的,但它并不是发布。Google Cloud Console 模型配额页面上的 grok-4.7 行,由社区追踪者在 9 月 16 日至 17 日报道,以及出现在 Grok Bot 配置错误中的带日期 grok-4-7-0907 构建标识,两者都指向一个正在准备的模型。两者都没有被任何人附上日期,也都不是公告。它们所证明的是,第三方基础设施正在被准备就绪——事后看来,这准确无误,但仍然不是时间表。
• 参数数量从未得到确认。约2.1万亿,比Grok 4.6高出约40%,马斯克在9月2日重申了这一数字——而发布时的每一份规格表中依然不见其踪影。这是整起事件中最明显的案例:一个数字传播得如此广泛,以至于被当作事实,却始终没有厂商来源。

上面的卡片记录了本文上次核对时的发布前状态:没有型号 ID,没有发布日期,也没有已公布的基准测试。自那以后,上面的每一行都已被 9 月 21 日的公告所取代;它之所以保留在这里,是因为那张卡片与已发布型号之间的差距,正是过去六周的真实故事——一次前沿发布,直到正式推出当天都未产生任何已确认的规格。
• 就绪度方面的警告仍是悬而未决的问题,而如今已有了部分证据。马斯克在 9 月中旬表示,Grok 4.7 在面对高难度任务时会“过早收尾”,其答案核查“不够严格”,他将此归因于针对长回答的强化学习惩罚设置得过高,并以“可能”一词加以保留。发布公告并未涉及这一点。xAI 所宣称的修复方案是间接的:更长时间的强化学习、向耗时数小时的任务倾斜,以及更好的自我验证——这正是为解决过早终止问题所会做的改动。编码智能体指数(Coding Agent Index)的结果是首个外部迹象,表明这一改动确实起了作用——56 分,而 Grok 4.6 为 47 分,Terminal-Bench 4.0 几乎翻倍,从 18% 升至 33%,而这恰恰属于长时程、多步骤的那一端。这并非一个干净的答案,因为同样的测试框架得分,也正是那些靠多得多的输出 token 换取增益的得分。该模型是否仍会放弃长时程的高难度任务,任何拥有 API 访问权限的人都可以测试,而这仍然是首先值得测试的事项。
• SpaceX 语料库仍未得到证实。所报道的训练补充内容——Starlink 遥测、Raptor 燃烧室压力日志、Starship 再入遥测、内部 Slack 讨论串、Jira 工单、GitHub 仓库和 ERP 记录——是社区对马斯克言论的转述,而非公司披露。发布公告描述了一个更大的基础模型和一次更长的强化学习运行,却对语料库只字未提。如果它确实在其中,也不会有任何规格表来证实它;唯一的证据将是,该模型能否在真实工程工作中做到其同类模型做不到的事情。
那个四次落空的时间表,以及市场判断对了什么
Grok 4.7 曾公开许下五个不同的时间表,前四个都已过期。7月24日至25日,Musk 表示大约四周,意味着8月22日。8月12日,他改为“3到4周”,意味着9月2日至9日。9月2日,他将范围缩小到大约十天,指向9月12日。9月11日,也就是那个期限到期当天,他说“再过几天”。第五个根本不是时间窗口——而是 Google Cloud 配额页面上的一个 grok-4.7 行——却是最接近正确的那个:该模型于9月21日发布,就在所有人承诺的最后一个日期之后不久,而且先于它出现的那个产物上根本没有附上日期。
预测市场把日期押对了,却把模型押错了。Kalshi 的“SpaceXAI 会在 9 月 18 日前发布 Grok 4.7 吗?”于 9 月 18 日 03:59 UTC 停止交易,最后成交价为 65 美分,共有 1,785 份合约成交,1,211 份未平仓。两个主要市场上的每一份已结算合约——Kalshi 的 8 月 14 日、21 日、28 日和 31 日以及 9 月 4 日、8 日和 11 日窗口,以及 Polymarket 的 9 月 12 日和 9 月 14 日合约——结果均为 No。Polymarket 的“下一个 Grok 模型(4.7 或更高版本)会在 9 月 18 日前发布吗?”在十一天里于 42% 到 88.5% 之间波动后,9 月 15 日停在 64%。市场正确地淡化了推文引发的尖峰,也正确地判断 9 月 18 日这个窗口会以空无结果收场。它在模型上提前了三天,而这正是有到期日的合约无法定价的一点。
浏览量值得作为一条校准注记保留下来。马斯克9月2日的倒计时——“10天后发布”——获得了1029万次浏览,而且是错的。他9月11日的改口获得了205万次浏览,同样是错的。他9月13日至14日的路线图帖子获得了约199万次浏览,是最接近正确的一次——他把 Grok 4.8 描述为相较 Grok 4.7 的“明显改进”,而 Grok 4.8 是一个约2.5万亿参数的模型,基于从零构建的 C++ 技术栈训练。贯穿整个过程,传播范围追踪的是信心,而不是准确性。
路线图上的两个条目如今已是悬而未决的现实问题,而非预测。Grok 4.8 在任何地方都没有模型 ID、没有定价、没有上下文窗口,也没有任何基准测试记录。而关于 Grok 4.7 被悄然"换牌"成 Grok 4.8 的说法——这是某家媒体对马斯克在 4.7 迟到之际却点出 4.8 这一举动的解读——如今已朝相反方向尘埃落定:4.7 以 4.7 之名发布,在 Index 上得 46 分,而 Grok 4.6 为 44 分,这是继任者的增量提升,而非重新发布。
这对今天调用 Grok 的团队意味着什么
实际格局在9月21日发生了变化,而且是以最不戏剧化的方式发生的:一个新模型 ID,价格相同、上下文窗口相同,Index 提升两点,编码智能体提升九点,知识工作提升111点。此后有两项变化,其重要性远超表面。Grok 应用现在把该模型交给普通用户,而不再只面向开发者,而这一侧的目录现在也将其收录——两者合在一起,把本文结尾描述的路由层从一项计划变成了默认设置。如果你的成本模型是基于 Grok 4.6 的 $2/$6 构建的,那么每 token 价格对 Grok 4.7 仍然正确——但 token 数量不对。Artificial Analysis 自己的运行在 Intelligence Index 上消耗了 2.4 亿输出 token,而它所追踪模型的输出 token 中位数为 9400 万,因此同一个请求的成本可能高出两倍以上,尽管费率卡完全相同——这类变化从不会出现在定价表里。在你断定这次发布是免费之前,请按输出 token 为一个真实的智能体循环定价,而不是按每百万费率。如果你切换的理由是厂商所宣称的性价比前沿,那么最强证据现在是 AA-Briefcase,而不是厂商的表格:在该榜单上排名第四,每任务成本约为 Claude Opus 5 的一半,与之相对的是,与 Claude Fable 5.1 存在七点的 Intelligence Index 差距,而价格差距则反方向达到输入五倍、输出八倍以上。如果你的工作负载具体来说是编码智能体,那么情况比 Index 所显示的更强:在 Grok Build 测试框架中,Coding Agent Index 上得分 56,领先 GPT-5.6 Sol,这与通用智能上的 46 分完全不在一个层级。其中哪一点更重要,完全取决于你的工作负载,而 SpaceXAI 之外没有人把你的工作负载跑过 Grok 4.7。
在OrcaRouter 的模型目录中,Grok 产品线如今在 Grok 4.6、Grok 4.5 和 Grok 4.3 之外还提供 Grok 4.7,按提供商标价计费、0% 加价——每百万输入 token 2 美元、每百万输出 token 6 美元,缓存输入读取为 0.50 美元;一旦请求的输入 token 超过 200,000,便与 SpaceXAI 的收费一致,跃升至输入 4 美元、输出 12 美元。这正是原样透传价目表所带来的价值:你成本模型里的每 token 价格就是你账单上的每 token 价格,而且该系列中的每个模型都响应同一把密钥,因此把工作负载从 Grok 4.6 迁到 Grok 4.7 只是改一个字符串,而不是再签一份合同。该页面提供 500,000 token 的上下文窗口,以及与已有 Grok 4.6 集成所对接的同一套 OpenAI 兼容接口——Chat Completions 和 Responses。

那层路由也是评估某个模型的低风险方式,而该模型的独立数据与供应商的数据在同一天发布。上面的基准测试清单仍然来自供应商自己——它选定的评估、它选定的努力等级、它选定的对比列——其中没有任何一项得到复现。改变的是,Artificial Analysis 的三个分数并非来自供应商,所以问题已从“这些到底是不是真的”变为“我的工作负载更像其中哪个结果”:是那个表示中游通用智能的 46,表示在原生 harness 编码代理中排名第四的 56,还是表示以前沿一半的每任务成本在知识工作上排名第四的 1,657。而决定经济性的数字根本不是基准测试,而是一次运行消耗的输出 token,只有你自己的流量才能为它定价——在 Artificial Analysis 的测量中,每次 Index 运行 2.4 亿,对比 9,400 万的中位数;在其公开的 AA-Briefcase-Lite 场景中,每组示例演示文稿约为 8 美元对 4.40 美元。自动故障转移让你把真实流量指向新模型,并在 token 账单或过早放弃行为比宣传更糟时回退到仍能响应的提供商——这就是测试一个未经证实的模型与把流水线押在它上面的区别。
如何提前知道(那个奏效的检查)
本节曾是一份在等待期间需要观察的信号清单。等待已经结束,所以这里给出同一份清单,并根据实际发生的情况进行评分。
• 模型列表就是确认,而它发生了变化。六周以来,这篇文章的建议一直是关注厂商的模型列表,而不是推文,因为一旦 Grok 4.7 成真,列表上就会多出一个附带定价和上下文窗口的模型 ID。事情正是如此:grok-4.7 现在出现了,带有 500K 上下文窗口,输入低于 200K 时定价为 $2/$6,高于时为 $4/$12,知识截止日期为 2026 年 5 月,以及四个 effort 等级。每一个马斯克时间窗口、每一次关于节奏的争论、每一个市场日期,都未能让那份列表发生变化;发布做到了。
• 第三方目录先于公告出现,而它们是提案,而非部署。9月21日的目录拉取请求是迄今为止最清晰的例证,其关闭过程也很有启发性:一名贡献者为某个模型做好了准备,两小时后一个机器人因缺少模板部分而关闭了该变更,而该模型在那之后两天发布。应把这类制品解读为带有时间戳的意图。它确实位于公告的上游,但它并不等同于可用性。
• 关注 OrcaRouter 模型目录。它现已迁移。整个九月,本文给出的建议是:orcarouter.ai 上的 grok-4.7 模型页面会成为“你今天就能通过我们调用它”的信号,因为只有当提供商接入后,模型才会被列出。该目录现在按供应商费率、不加价提供 Grok 4.7,因此读者此前被告知要做的检查有了答案:它今天已可通过一个 API 路由。
• 就消费端可见性而言,Grok 应用如今已把 Grok 4.7 推到那些永远不会打开 API 控制台的用户面前。10 月 2 日再次查看,grok.com 向未登录访客提供的选择器数据,仍在其四个条目中的两个上标出了该模型——Expert 显示为“深入思考 · Grok 4.7”,Heavy 显示为“专家团队 · Grok 4.7”——而 Fast,也就是应用默认打开的模式,仅被描述为“快速响应”,Auto 则被描述为在 Fast 和 Expert 之间选择。这四个条目是 Auto、Fast、Expert 和 Heavy。Build 不在其中:Grok Build 是一个独立的终端产品,有自己的页面,而该模型与 Build 的关联实际上就来自那个页面——它告诉访客“立即安装,并开始用 Grok 4.7 构建”。因此,10 月 1 日流传、10 月 2 日又被重复的说法——即 Grok 4.7 现已成为“Fast、Expert、Build 和 Heavy”中的基础模型——列出了一个应用并不提供的模式,却漏掉了它默认打开的那个模式;而且这是追踪者的解读,而非厂商的说法,因为 SpaceXAI 完全没有发布任何关于这次推出的内容。相应的 Grok 4.5 举措曾有一篇属于自己的博客文章;而这一次,产品在一个并未更新的新闻页面之下悄然发生了变化。
当前形势
Grok 4.7 于 2026 年 9 月 21 日发布,每百万输入 tokens 2 美元、每百万输出 tokens 6 美元,上下文窗口为 500,000 tokens,知识截止日期为 2026 年 5 月。此后十一天里发生变化的是可用性版图,而非模型本身:Amazon Bedrock 于 9 月 28 日将其纳入;它于 10 月 1 日开始在 Grok 自家网页和移动应用中逐步推出,到 10 月 2 日仍在继续推出;如今它已按 SpaceXAI 自己的费率在 OrcaRouter 上架,且没有加价。它的独立评分与发布同日出炉,且仍然彼此不一致:在 Artificial Analysis 的 v4.3.2 Intelligence Index 上,xhigh effort 下为 46,比 Grok 4.6 高两分,足以让 SpaceXAI 跻身该指数前四实验室;在 Grok Build harness 的 Coding Agent Index 上为 56,比 Grok 4.6 高九分,在原生 harness 模型中排名第四,领先于 GPT-5.6 Sol;在 AA-Briefcase 上为 1,657 Elo,比 Grok 4.6 高 111 分,在该榜单上排名第四,落后于三个 Anthropic 条目,而每任务成本约为 Claude Opus 5 的一半。厂商发布表格中的每一项基准测试都是厂商自己的,且未被复现,只有一个例外:Artificial Analysis 自己的 AA-Briefcase 榜单公布了相同的 1,657,而厂商此后已将其自己的 Terminal-Bench 一行从 38.0% 下调至 37.6%。编码和知识工作方面的提升是真实的,而且它们要消耗输出 tokens——每次 Index 运行 2.4 亿,而中位数为 9,400 万;在 AA 公开的尽职调查场景中,每套示例演示文稿约 8 美元,而对比值为 4.40 美元——这个数字才决定这次发布是否便宜。流传了两个月的约 2.1 万亿参数这一数字仍无厂商来源,而“过早放弃”的警告从未得到直接回应,尽管在 Grok Build harness 中 Terminal-Bench 从 18% 跃升至 33% 是首个表明该修复奏效的外部证据。本文让读者关注的两个信号都已触发:厂商的模型列表新增了 grok-4.7,并附有价格和上下文窗口;而这里的目录也以相同费率列出它。因此,制胜之举比 9 月时更简单——$2/$6 的 Grok 4.6 就是答案,而 $2/$柬埔寨 6 的 Grok 4.7 是同一个答案,只是模型 ID 更新、编码和知识工作分数更高、token 账单大得多,并且消费者应用在其两个最难模式中点名使用它。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
