Grok 4.7 参考页面的主标题卡:大标题“Grok 4.7:参考页面”位于副标题“SpaceXAI 的旗舰推理模型,于 2026 年 9 月 21 日发布”之上,下方是三张圆角卡片,分别写着“上下文:500K tokens”“每 1M 价格:输入 $2.00 / 输出 $6.00”和“AA 智能指数:46”,页脚一行写着“规格与价格依据 SpaceXAI 文档;AA 指数依据 Artificial Analysis v4.3.2。”,右下角为 OrcaRouter 标识。
Guides & Insights

什么是 Grok 4.7?规格、价格、上下文窗口和基准测试

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Grok 4.7是 SpaceXAI 当前的旗舰模型:一款推理模型,输入文本和图像,输出文本,拥有 500,000 token 的上下文窗口,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,推理强度可在四个级别中选择。它接替了Grok 4.6,在价格和上下文上与后者完全一致,并面向长周期工作——数小时计的编程、智能体工具循环、专业知识工作——也就是该公司如今整条产品线所围绕销售的方向。本页是它的参考条目:模型是什么、处于什么位置、接受什么输入、成本是多少,以及刻意分开呈现的两件事——SpaceXAI 对自己模型的说法,和独立评估者所测得的结果。

为什么这是一篇参考页面,而不是一篇发布报道。Grok 4.7 于 2026 年 9 月 21 日发布,那次发布本博客已经报道过(关于它的首日解读见 grok-4-7-release-date 一文),因此下文中的日期是被当作一个为模型标注时间的事实来使用,而不是一个被再次报道的事件。这个页面所服务的读者,是把模型的裸名称输入搜索框、想要的是模型而非新闻的人:在截至 2026 年 9 月 25 日的 28 天里,我们自己的 Search Console 数据显示,精确查询“grok 4.7”获得了 31,934 次展示,而所有可归约为该名称的各种拼写合计获得 34,160 次展示,平均排名为 7.8,却没有专门的页面可供其落地。这是对人们输入内容的衡量——它并不说明该模型有多好——也正是这个页面以最直白的问题开篇的原因。本文中的每个数字都按其来源标注:厂商自报用于任何来自 SpaceXAI 自家文档、发布帖或定价页的内容,独立用于 Artificial Analysis,我们自己的用于我们目录和搜索数据所显示的内容。

Grok 4.7 在 Grok 产品线中的定位

该厂商现在在开发者文档和新闻页面上都把自己的名称写作 SpaceXAI,而 API 本身仍由 api.x.ai 提供服务,模型标识符也仍然属于 grok 系列。Grok 4.7 是文本产品线中的最高端型号,也是厂商自己的默认推荐:当被问及该选择哪个模型时,模型页面给出的答案是,除了音频、图像和视频工作之外——“包括代码”——你都应该使用 Grok 4.7,因为“它是我们构建过的最强大的模型。”其同系列模型,按厂商自己公布的每百万 token 费率计算,分别是:

• Grok 4.6 — 500K 上下文,输入 $2.00 / 缓存 $0.50 / 输出 $6.00,2026 年 8 月发布。它是直接前代模型,也是 4.7 定价所对标的对象。

• Grok 4.5 — 500K 上下文,输入 $2.00 / 缓存 $0.30 / 输出 $6.00,于 2026 年 7 月发布。与后续版本标价相同,但缓存费率更低,这如今成了仍然选择它的唯一具体理由。

• Grok 4.3 — 100 万上下文,输入 $1.25 / 缓存 $0.20 / 输出 $2.50。价格只有当前旗舰的一半,上下文窗口则是其两倍。

• Grok 4.20(推理、非推理及多智能体变体)—— 100 万上下文,输入 $1.25 / 缓存 $0.20 / 输出 $2.50。

• Grok Build 0.1 —— 256K 上下文,输入 $1.00 / 缓存 $0.20 / 输出 $2.00。它是编程专用模型,而非通用模型;Grok Build 代理的默认模型是 Grok 4.7,而不是它。

所以当前产品线的形态是一种能力与上下文窗口之间的权衡:旗舰版以 $2/$6 的价格提供 500K 上下文,而 4.3/4.20 这一档则以大约一半的输入价格和不到一半的输出价格,提供整整一百万 tokens。厂商文档中没有任何内容表明 Grok 4.7 与 Grok 4.6 属于不同的架构——该版本所描述的是:更大的基础模型、更长的强化学习训练(权重偏向于需要耗费许多小时才能完成的任务)、更好的自我验证、更好的长上下文处理,以及在 Grok Bot 训练框架上进行训练,从而使模型在对话和通用知识工作中表现更好。这是一种改进主张,而非一种新设计。SpaceXAI 在其模型页面和定价表上均未公布 Grok 4.7 的参数数量,本页面也不会去猜测。

它何时发布,以及随它一起发布了什么

发布帖文标注的日期为2026年9月21日,开发者模型页面的最后更新日期与之相同,这已是目前能获得的最精确信息——SpaceXAI不再发布精确到日的时间戳。当天上线的不仅仅是一个模型标识符。grok-4.7这一标识同时在Responses API和Chat Completions上线,拥有500,000 token的上下文窗口、2026年5月的知识截止日期、四个推理等级(包括一个新的最高档位)、仅限两个第一方平台使用的Fast变体、仅限美国区域的端点,以及与Grok 4.6完全相同的标价。它同时被设为Grok Build编码代理的默认模型,并在Cursor的所有套餐中开放使用。如果你想了解首发当天的反响而非规格参数,grok-4-7-release-date一文涵盖了这些内容;本页面将该日期作为关于模型的一个既定事实,转而介绍它实际能为你做什么。

信封:你可以发送什么,以及可以发送多少

除非另有标注,以下所有内容均来自 SpaceXAI 自己的模型页和模型页面,查阅于 2026 年 9 月 28 日。

Screenshot of SpaceXAI's developer documentation page for grok-4.7, showing the model identifier grok-4.7, the tagline describing it as SpaceXAI's frontier model built for coding, agentic tasks and knowledge work, an At a glance block with Context, Modalities, Training data and Pricing rows, an Important details section, a Fast variant note, and a Where it runs list, plus a Python code sample setting the model name to grok-4.7 in the xai_sdk client.

• 上下文窗口 — 500,000 tokens。与 Grok 4.6 相同,是 Grok 4.3 和 4.20 系列的一半。

• 知识截止日期——2026 年 5 月,比 Grok 4.6 晚三个月。任何更近期的信息都需要开启搜索工具;默认情况下,该模型不具备实时感知能力。

• 输入 — 文本和图像。图像可为 JPG/JPEG 或 PNG,每个最大 20 MiB,且供应商未说明单次请求中图像数量上限;图像和文本可以以任意顺序出现。

• 输出——仅限文本。本模型不具备图像、音频或视频生成能力;这些属于 SpaceXAI 系列中的独立模型。

• 输出上限——供应商表示没有文本输出限制。我们自己针对 grok-4.7 的 OrcaRouter 模型卡标称的最大输出为 450,000 个 token,这两个数字并不一致。我们选择将其指出,而不是悄悄从中挑一个:SpaceXAI 的文档才是关于 SpaceXAI 模型的权威依据,而诚实的解读是,供应商并未公布文本输出上限。

• 推理控制 — reasoning_effort可设为 low、medium、high(厂商默认值)或 xhigh。xhigh 是这一代新增的;Grok 4.6 同样提供了四个档位,而 4.7 公布的基准测试数据均以 xhigh 为准。

• 工具 — 函数调用、网页搜索、X 搜索和代码执行,均作为服务器端工具记录在文档中。

• 结构化输出 —— 该厂商在文本生成之外还记录了结构化输出能力;我们自己的页面将其暴露为 response_format 和 structured_outputs。

• 我们的页面接受的参数——include_reasoning、logprobs、max_tokens、reasoning、reasoning_effort、response_format、seed、structured_outputs、temperature、tool_choice、tools、top_logprobs 和 top_p。在基于 logprobs 进行构建之前,有一个值得了解的注意事项:SpaceXAI 的模型页面指出,logprobs和top_logprobs不受 grok-4.20 及更新模型的支持,并且“即使设置也会被静默忽略”,这涵盖了 Grok 4.7。我们的页面将它们列出,并不承诺上游会返回它们。

• 端点 — 兼容 OpenAI 的 Chat Completions API 和 Responses API。

• 提示缓存——供应商建议在 Responses API 上设置 prompt_cache_key(在 Chat Completions 上则是 x-grok-conv-id 请求头),以便同一对话的请求落到同一台服务器上;文档警告称,若不这样做,你往往会在缓存未命中的服务器上支付全额输入价格。在 20 万 token 阈值以下,缓存输入按每百万 token 0.50 美元计费。

• 加密推理——在 Responses API 上,Grok 4.7 始终返回 reasoning.encrypted_content,即使你并未主动请求,因此多轮调用无需额外配置即可保留模型的推理内容。Chat Completions 保持不变。

费率卡,完整版

定价按提示词大小分级,一旦超过阈值,该阈值就适用于整个请求,而不仅仅是超过该界限的 token。此处的每个数字均由供应商发布,摘自 SpaceXAI 于 2026 年 9 月 28 日的定价页面:

• 标准,提示词少于 200K token — 每百万 token 输入 $2.00 / 缓存输入 $0.50 / 输出 $6.00。

• 长上下文,提示词达到或超过 20 万 tokens —— 每百万 tokens 输入 $4.00 / 缓存输入 $1.00 / 输出 $12.00。

• Grok 4.7 Fast —— 同一模型,运行在更快的基础设施上,费率为标准价格的两倍:200K 以下为 $4.00 / $1.00 / $12.00,200K 以上为 $6.00 / $1.50 / $18.00。它仅可通过 Cursor 和 Grok Build 使用,完全不在公共 API 上提供,并且 Grok Build 的免费层级不包含它。

• US regional endpoint — https://us.api.x.ai/v1 keeps inference in the United States and bills at 1.1×, which works out to $2.20 / $0.55 / $6.60 per million below 200K and $4.40 / $1.10 / $13.20 above. Only grok-4.7 and grok-4.6 are served there today.

放到整个市场来比较,有意思的不是那个标价——输入 $2、输出 $6 正是 Grok 4.6 收取的价格,也是 Grok 4.5 至今仍在收取的价格——而是缓存折扣,厂商公布的是对重复提示前缀的输入价格减免 75%。对于一个每轮都会重新发送相同系统提示和文件上下文的长时间 agent 循环来说,这个折扣就是标价与账单之间的差别。这也是 Grok 4.7 唯一不如其前辈的一项:Grok 4.5 的缓存价格为每百万 $0.30,而 Grok 4.7 为 $0.50。

Grok 4.7 已在 OrcaRouter 上线,grok/grok-4.7定价为 SpaceXAI 自身标价,0% 加价——即直接透传供应商价格,因此供应商调价当天即在此生效,无需等待重新定价流程。这在具有两级提示阈值和缓存费率的模型上尤为重要,因为这两者都会直接影响你的实际支出。整个 Grok 系列只需一个密钥和一个 OpenAI 兼容端点,因此将工作负载从 Grok 4.7 切换到 Grok 4.5 或 4.3 以测试成本差异,只需更改一个字符串,而无需再签一份合同。

SpaceXAI 对其声称的内容

本节中的所有内容均来自厂商自报。其中没有任何一项经过独立复现,而且 effort 设置很重要——发布文章中的表格标出 Grok 4.7 为 xHigh、Grok 4.6 为 High,而两个对比模型为 Max,这并不是在同等条件下进行的比较。

• CursorBench 4.0 — Grok 4.7 在 xHigh 下为 46.3%,而 Grok 4.6 在 High 下为 40.4%。发布帖自身的说法是,这正是 Grok 4.7 “在性价比方面处于前沿”之处。

• Terminal-Bench 4.0 — 37.6%,而 Grok 4.6 为 20.3%。这是本次发布中最大的单项差距,也是与“在更难任务上进行更长强化学习”这一说法相符的那一项。

• DeepSWE v1.1 — 71.0%,在供应商自己的表格中标记为高努力分数,而 Grok 4.6 为 65.2%。

• AA Briefcase v1.1 — 1,657,而 Grok 4.6 为 1,546。注意这里的名称冲突:这是供应商引用了一项 Artificial Analysis 也在运行的基准测试,而独立结果将在下一节讨论。

• EEBench — 64.0%,而 Grok 4.6 为 53.0%。

• Harvey Legal Agent Benchmark — 19.6%,而 Grok 4.6 为 15.8%。

• HealthBench Professional — 56.7%,而 Grok 4.6 为 48.5%。

• GDPval — 在 xhigh 下达到 1,695 Elo,而 Grok 4.6 在 high 下为 1,605。

这些安全声明同样是厂商自报的,而且异常具体:SpaceXAI 称,Grok 4.7 构建在一套新的防护栈之上,在 LatchBio 的生物安全基准测试中以 62.4% 位居榜首,并且在其自家的 HackerBench v0.3 上仅放行 3.3% 的高风险两用提示,同时极少拦截合法的安全工作。该公司还表示,已开始向选定的网络安全合作伙伴提供仅限受邀访问的该模型红队能力。请把这一切都视为厂商对自家模型的自行测试——这组说法具体到足以日后核查,但这与现在已经核查过并不是一回事。发布帖中的那句一句话定位——“速度是同类模型的两倍,价格只有同类模型的一半”——是针对竞品的营销,而不是对 Grok 4.7 的测量,而且下面的独立速度数据并不支持其中“速度是同类模型的两倍”这半句。

A single-column scoreboard card for Grok 4.7 titled "Grok 4.7 - the scoreboard" with six rows: Context window 500K tokens; Knowledge cutoff May 2026; Reasoning levels low / medium / high / xhigh; Price per 1M $2.00 in / $6.00 out; AA Intelligence Index 46, #21 of 211; Output speed 82.6 tokens/sec. Footer: "Rows 1-4 vendor-reported; AA Index and speed per Artificial Analysis v4.3.2, xhigh configuration."

独立评估者测量的内容

Artificial Analysis 是这个故事中唯一与模型没有利害关系的来源,其 Grok 4.7 页面明确是 xhigh 配置。阅读于 2026 年 9 月 28 日:

• 智能 — 在 Artificial Analysis Intelligence Index 上得分为 46,指数版本 v4.3.2,在该榜单的 211 个模型中排名第 21,且远高于该指数的中位数 26。该指数由十项评估综合而成:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。

• 成本 — 运行一次 Intelligence Index 需 $3.74,同一评估方公布的缓存折扣为 75%,且输入/输出费率与供应商相同($2.00 / $6.00)。其自身的评论是,与其他价格相近的模型相比,该模型“定价合理”。

• 冗长程度 —— 在 Intelligence Index 上共生成 240M 输出 token,而中位数为 88M。Artificial Analysis 称其“非常冗长”,对于任何要做预算规划的人来说,这是这里最有用的一个数字:即使 token 单价固定,一个以更长思维链思考的模型,每项任务的成本也更高。

• 速度 —— 每秒 82.6 个输出 token,在该榜单 211 个模型中位列第 83,但评估方仍将其标注为“慢于平均水平”。在你把这个数字带到任何地方之前,有两点需要注意。Artificial Analysis 将其默认基准测试工作负载改为 10,000 token 的输入,以更好地反映生产使用情况,而且其针对该模型发布的速度读数在多次快照之间已发生实质性变化,因此应把它视为某一工作负载的快照,而非一个恒定值。在 API 提供商方面,同一评估方为该模型只列出了一家提供商——SpaceXAI 本身——因此其测得的延迟和混合价格属于第一方数据,而非市场范围的价差。

我们自己的目录还收录了 Artificial Analysis 针对 Grok 4.7 的三项进一步结果,评估日期为 2026 年 9 月 21 日:Humanity's Last Exam 上为 43.1%,长上下文召回评估上为 76.7%,SciCode 上为 57.4%。这些结果被标记为独立,因为它们来自 Artificial Analysis;它们值得与供应商的自我验证声明对照阅读,而不应被视为对这些声明的印证。

诚实的比较说明:SpaceXAI 的数字和 Artificial Analysis 的数字是在不同的评估框架、不同的投入程度设置下产生的,二者从未在匹配配置下进行过直接对比。当同一个基准名称在双方都出现时——AA Briefcase、Terminal-Bench 4.0——那只是共用的名称,而不是同一次运行。任何人把厂商数据与独立数据并列引用,仿佛它们是同一次测量,都是在做证据并不支持的算术。

你可以实际调用它的地方

Grok 4.7 自发布之日起即可通过 SpaceXAI 位于 api.x.ai 的自有 API 调用,使用 Responses API 或 Chat Completions,也可通过仅限美国的区域端点访问,溢价 10%。它是 Grok Build 编码智能体的默认模型,并在所有套餐的 Cursor 中可用;而 Fast 变体——同一模型但费率翻倍——仅限这两个入口,且未出现在公共 API 中。除第一方访问外,供应商称其还可通过第三方编码框架、模型路由器和云平台使用。

具体到我们这边:grok/grok-4.7 今天已在 OrcaRouter 目录中上线,按 xAI 自身的标价计费,0% 加价,并可使用与 Grok 系列其他模型相同的密钥在任一端点上调用。如果你正拿它与 Grok 4.6 做对比——同样的价格、同样的上下文窗口,底层却是另一个模型——那么把两者都通过一个端点接入、并配上自动故障转移链,是弄清你的工作负载究竟更偏好哪一个的省钱办法,总好过仅凭厂商的一张参数表就把生产路径押在新模型上。

Screenshot of the OrcaRouter model page for grok/grok-4.7, showing the SpaceXAI provider label, the 500K-token context window and 450K maximum output, capability tags for Vision, Tools, JSON and Reasoning, the $2.00 per million input and $6.00 per million output rates, the Public benchmarks panel dated 2026-09-21 with an AA Intelligence figure of 46.4, and the /v1/chat/completions and /v1/responses endpoints.

鉴于现有记录仍然如此单薄,值得关注的是:SpaceXAI 尚未公布参数数量,而输出上限问题也确实悬而未决——厂商宣称的“无文本输出限制”与我们自己页面显示的 450K 之间存在的差异,至今无人解决。目前还没有在匹配测试框架下,与其对标销售的模型进行一对一正面比较。而上面的速度读数是最有可能变动的数字,因为它已经变过了。随着记录逐步补齐,这三处将是本页需要修改的地方;与其假装规格已经尘埃落定,不如把这一点如实说明。

Grok 4.7 现已在 OrcaRouter 上可路由,Grok 4.6、Grok 4.5、Grok 4.3 以及 Grok 4.20 系列也同样如此。OrcaRouter按供应商的标价以零加价原样透传,因此 SpaceXAI 的两档提示词阈值及其缓存费率在他们那边变更的当天,就会同步落到我们这边,而用更早、更便宜的 Grok 模型测试某一工作负载,只需改动一个字符串,而不是再签一份合同。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新