Grok 4.5 解说视频的主视觉标题卡:主标题“什么是 Grok 4.5?”位于副标题“主打 token 经济性、而非顶尖跑分的 V9 旗舰”上方,接着是三张卡片,分别写着“上下文 - 500K tokens”、“每 1M 标价 - $2.00 / $6.00”和“AA 智能 - 39”,页脚一行写着“Grok 4.5 于 2026 年 7 月 8 日发布。价格依据 xAI 文档;AA 数值依据 Artificial Analysis Intelligence Index v4.3.2。”,右下角为 OrcaRouter 标志。
Guides & Insights

什么是 Grok 4.5?V9 旗舰:不靠顶尖评分,主打Token经济性

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Grok 4.5是来自该厂商的一款1.5万亿参数的混合专家推理模型——这家公司现在以SpaceXAI品牌进行发布和营销——于2026年7月8日发布。它接收文本和图像,返回文本,具有500,000个token的上下文窗口,定价为每百万输入token 2.00美元、每百万输出token 6.00美元。正是这款模型把“每完成一项任务所需的token数”放到了发布幻灯片的最显眼位置,而实验室此后又在它的基础上打造了两款更新的旗舰模型。

最后那句话,正是本页非写不可的全部理由。搜索“Grok 4.5”,你搜到的是七月的发布报道:与 Cursor 的合作、“Opus 级”的引语、每秒 80 tokens 的宣称。你搜不到的是对开发者在九月下旬真正会问的问题的直接回答:当 Grok 4.6 和 Grok 4.7 以相同标价存在时,Grok 4.5 是否还值得接入任何东西。所以本页是参考条目,不是新闻稿:这个模型是什么、它处在什么位置、它在哪些方面可衡量地做得好、在哪些方面可衡量地做得差,以及谁应该另选别的。这里没有任何内容被包装成一次发布,因为它并不是。

关于来源说明,因为在这类页面上,来源比通常更为重要:下文每个数字都按其来源标注。xAI 发布的关于其自家模型的数字标记为厂商报告。来自 Artificial Analysis 的数字是独立测量值,直接读取自 2026年9月23日的模型页面。如果某个数字无法在一手来源上得到确认,页面会如实说明,而不是进行估算。

Grok 4.5 在其自身家族中的位置——而且它并不是最好的那款

在关于 Grok 4.5 的报道中,最常见的一个错误就是把它当作旗舰模型。它确实曾是旗舰,大约有五周时间。自那以后,xAI 于 2026 年 8 月 12 日发布了 Grok 4.6,并在 9 月初发布了 Grok 4.7,两者的定价仍为每百万 token 2.00 美元和 6.00 美元。Grok 4.5 现在是产品梯队中的中端:能力高于廉价层级,但落后前沿两代,而且——这才是关键所在——它是当前 Grok 系列中唯一缓存输入费率比后续模型更便宜的模型。根据 xAI 自己的定价表,Grok 4.5 的缓存价格为每百万 token 0.30 美元;Grok 4.6 和 Grok 4.7 的缓存价格均为 0.50 美元。

以下是供应商定价文档目前列出的产品阵容,所有数字均按每百万 token 计,且均由供应商发布:

• Grok 4.20(三个变体:多智能体、推理、非推理)——100 万上下文,输入 $1.25 / 输出 $2.50,缓存 $0.20,2026 年 3 月 31 日发布

• Grok 4.3 — 100 万上下文,输入 $1.25 / 输出 $2.50,缓存 $0.20,另有批量折扣;这是获取一百万 token Grok 上下文的最便宜方式

• Grok 4.5 — 500K 上下文,输入 $2.00 / 输出 $6.00,缓存 $0.30,2026 年 7 月 8 日发布

• Grok 4.6 — 500K 上下文,输入 $2.00 / 输出 $6.00,缓存 $0.50,发布于 2026 年 8 月 12 日

• Grok 4.7 — 500K 上下文,输入 $2.00 / 输出 $6.00,缓存 $0.50,2026 年 9 月上旬发布

• Grok Build 0.1 — 256K 上下文,输入 $1.00 / 输出 $2.00,是编码专用模型,而非通用模型

从这份清单中可以看出两件事。首先,Grok 4.5 在不再是旗舰机型时并没有降价——它保留了旗舰价格,这意味着在同样的花费下,Grok 4.6 现在绝对更划算,除非你特别想要更低的缓存费率,或者你被锁定在 4.5 快照上。其次,Grok 4.5 的上下文长度只有 Grok 4.3 和 4.20 家族的一半,而输入价格却是后者的两倍。V9 基础模型就是原因:1.5 万亿参数,大约是 Grok 4.3 的三倍,而更大的基础模型正是以窗口为代价换来了这种能力。

如果你真正需要的是在有限预算下获得长上下文,那么在这个系列里,Grok 4.3 才是诚实的答案,而 Grok 4.5 不是。这种取舍——能力与上下文窗口之间的权衡——是 Grok 产品线中的决定性选择,值得直白说明,而不是假装更新的数字在一切方面都更好。

规格表

Screenshot of the xAI developer documentation model page for grok-4.5, showing the model identifier and aliases grok-4.5-latest and grok-build-latest, the description 'intelligent coding model for agentic software, engineering, and workflow tasks', an At a glance block giving modalities 'Text, Image to Text' and a 500,000-token context window, capability rows for function calling, structured outputs and reasoning, and the pricing rows $2.00 input, $0.30 cached input and $6.00 output per million tokens, above a collapsed 'Higher context pricing' note about requests exceeding the 200K context window.

这些是 xAI 在其自己的模型页面上发布的规格参数,而非第三方估算:

• 模型标识符 — grok-4.5,别名为 grok-4.5-latestgrok-build-latest

• 模态——文本和图像输入,文本输出。图像可作为输入被接受;模型并不生成图像

• 上下文窗口——500,000 个 token,由提示词和响应共享,而不是 500K 输入外加单独的输出额度

• 许可 — 专有。没有开放权重,也没有可下载的检查点;你需通过 API 或厂商自家产品来使用 Grok 4.5

• 标价 — 每百万输入 token 2.00 美元,每百万输出 6.00 美元,缓存输入 0.30 美元

• 长上下文定价——当提示词达到 200,000 个 token 及以上时,费率将上调至输入 $4.00 / 输出 $12.00 / 缓存 $0.60,并且更高的费率适用于请求中的每一个 token,而不只是超出阈值的那部分 token。这是本页中漏看后代价最高的一个细节

• 推理控制 — 四个级别,极高,默认为 。推理无法完全关闭,且推理 token 按输出 token 计费

• 工具与格式支持 —— 原生支持函数调用和结构化输出。服务端搜索工具在 token 用量之外另行计费;我们无法在供应商的模型页面上确认当前的每次调用费率,只能确认这类费率确实存在

• 速率限制 — 每秒 150 个请求,每分钟 5000 万个令牌

• 批量 API — Grok 4.5 不支持,与 Grok 4.3 不同

• 服务区域——推出时支持 us-east-1 和 us-west-2。欧洲地区可用性在首日明确不可用,供应商称预计于 2026 年 7 月中旬提供;我们未找到之后的一手来源声明来确认其开放的确切日期,因此在此将欧盟时间线视为未经确认。

有一处不一致值得记录在案,而不是轻轻带过:OrcaRouter 自家目录中 grok/grok-4.5 的条目显示缓存读取费率为每百万 $0.50,这与 xAI 对 Grok 4.6 和 Grok 4.7 的收费相符,而非厂商定价表中为 Grok 4.5 标出的 $0.30。厂商文档才是价格的权威依据;我们的页面似乎沿用了后继型号的缓存费率,此处已将其标记出来,而非悄然照录。

Grok 4.5 在哪些方面有可衡量的优势

发布时的头号卖点是 token 经济性,而这是发布页面上唯一一个有机制支撑、而非仅有一个分数的说法。在 SWE-bench Pro 上,xAI 报告称,Grok 4.5 每解决一个任务平均消耗 15,954 个输出 token,而 Claude Opus 4.8 以最高强度运行时为 67,020 个——完成同样的工作,token 少了约 4.2 倍。每解决一个任务的输出 token 更少,正是一个更便宜的模型与一个更便宜以实际耗时计算更快的模型之间的区别,因为输出 token 正是你要等待的东西。供应商自行报告,跑在供应商自家的测试框架上,且没有任何独立方复现——但这是一个结构性的说法,而不是一个精心挑选出来的百分比。

供应商的基准测试表随模型一同发布,因此通篇都是供应商自报的数据,在与相同模型对比时结果如下:

• DeepSWE 1.0 — Grok 4.5 为 62.0%,落后于 Claude Fable 5 的 66.1% 和 GPT-5.5 的 64.31%,领先于 Claude Opus 4.8 的 55.75%

• SWE Marathon,解决率——Grok 4.5 29.0%,领先于 Claude Opus 4.8 的 26.0% 和 Claude Fable 5 的 24.0%。这是 Grok 4.5 领先全场的唯一一项编程基准。

• Terminal-Bench 2.1 —— Grok 4.5 达 83.3%,实际上与 Claude Fable 5 的 84.3% 和 GPT-5.5 的 83.4% 持平,领先于 Claude Opus 4.8 的 78.9%

• DeepSWE 1.1 — Grok 4.5 为 53%,落后于 Claude Fable 5 的 70% 和 GPT-5.5 的 67%

• SWE-bench Pro — Grok 4.5 为 64.7%,落后于 Claude Fable 5 的 80.4% 和 Claude Opus 4.8 的 69.2%

诚实的解读是:Grok 4.5 在长时程任务解决以及完成任务的经济性上胜出,但在更难的多次单次编程基准测试上落败。它是一个适合智能体循环的好模型,却是一个在一次性难题上表现平庸的模型——而这一区别,恰恰正是 token 效率数值所预测它应呈现的样子。

A single-column scoreboard card for Grok 4.5 titled 'Grok 4.5 - the scoreboard' with six rows reading: AA Intelligence Index 39 (#52 of 212); Output speed 55.1 tok/s (#126 of 212); Time to first token 10.94 s; Context window 500K tokens; Price per 1M $2.00 / $6.00, $0.30 cached; SWE-bench Pro 64.7% (vendor). Footer: 'Price and spec rows per xAI docs; AA Index and speed per Artificial Analysis Intelligence Index v4.3.2; SWE-bench Pro vendor-reported.'

独立的图景更单薄,而这正是本页必须谨慎的地方。Artificial Analysis 目前将 Grok 4.5 (high) 列为 Intelligence Index 得分 39,在 212 个模型中排名第 52,基于指数版本 v4.3.2——高于同类模型中位数 25,但并未接近前列。如果你在 7 月的报道中看到过该模型被引用的 54 或 56 分,不要把它与 39 相比:Artificial Analysis 自该指数发布以来已对其进行修订,这两个数字来自不同的修订版本。这正是那种使基准测试表格不可信的过时数字比较,也是本页在给出分数时同时标注指数版本的原因。

Grok 4.5 在哪些方面可量化地表现糟糕

Artificial Analysis 报告的输出速度为每秒 55.1 个 token,在 212 个模型中排名第 126 位,低于 74 的中位数——距离 xAI 在发布时宣称的每秒 80 个 token 相去甚远,距离当前最快模型达到的每秒约 340 个 token 就更是遥不可及。它还报告首 token 用时为 10.94 秒,而中位数是 3.86 秒。这两个数字合在一起,描述了一个默认处于档且无法关闭的推理模型的真实代价:你得先等,然后它开口还慢。把推理级别留在默认档,Grok 4.5 会让你觉得它是你密钥上最慢的模型。

又有三个经过审慎评估的负面因素,按它们对决策应有影响的大小排序:

• Artificial Analysis 已将 Grok 4.5 标记为弃用,并表示仅继续对其默认的 10,000 token 输入工作量进行基准测试。这是第三方在告诉你,它已停止对你正在考虑的模型进行全面测评,并改为推荐 Grok 4.6。在排行榜上被弃用并不意味着在 API 上不可用——它意味着独立证据基础已被冻结

• 它输掉了两项最接近高难度、单次尝试编码的基准测试:DeepSWE 1.1 和 SWE-bench Pro;根据 xAI 自己的表格,这两项它都分别输给了 Claude Fable 5 和 GPT-5.5

• 它的上下文长度只有 Grok 4.3 的一半,输入价格却是其两倍,而且完全没有批量 API。如果你的工作负载是长文档处理或离线批量推理,那么 Grok 4.5 即便在自己家族中也是错误的选择

关于幻觉与校准,本页面无法确认当前的独立数据。7月的报道中流传着约54%的幻觉率,但我们无法在我们所阅读的 Artificial Analysis 模型页面上核实这一数字,供应商的页面上也没有出现该数字。与其重复一个我们无法溯源的数据,我们在此将其记录为未测量。

谁应该选择 Grok 4.5,谁又应该选择其他方案?

选择 Grok 4.5,如果你运行的是智能体循环,其中每个已完成任务的成本比每个 token 的成本更重要,并且你已经通过实测确认 V9 的 token 经济性行为在你的工作负载上依然成立。如果你需要一个 Grok 系列快照,在大型、稳定、被反复命中的前缀上具有 $0.30 的缓存输入费率,那么它也是正确的选择——这一缓存费率确实比 Grok 4.6 和 Grok 4.7 收取的费用更低,而在缓存密集型工作负载上,这一差异可能胜过两代能力提升。

请改选 Grok 4.6 或 Grok 4.7,几乎所有其他场景都是如此。相同的标价、相同的 500K 窗口、更新的训练、更高的独立评测分数,而且 Artificial Analysis 自己也这么推荐。今天已经不存在任何“我想要最好的 Grok”却该回答 4.5 的情况了。

选择 Grok 4.3,如果上下文是限制条件:100 万 tokens,价格分别为 $1.25 和 $2.50,并享有 Grok 4.5 不提供的批量折扣。长文档 RAG 和整个代码仓库分析仍然是它的主场。

选一个这个家族之外的东西如果你追求的是峰值分数,而非每项任务的成本——在 xAI 自己的对比表中,Claude Fable 5 在每一项编码基准测试中都遥遥领先,而 GPT-5.5 在 DeepSWE 1.0 和 1.1 上也排在 Grok 4.5 之前。如果你想要开放权重,并且可以接受更小的模型,那完全是另一笔采购,没有任何 Grok 模型能与之竞争。

无需第二份合同即可调用 Grok 4.5

Grok 4.5 已在 OrcaRouter 上线,采用 xAI 的标价,提供商费率以零加价透传——因此上面的 $2.00 和 $6.00 就是您实际支付的金额,而供应商一旦调价,我们这边会在同一天同步生效。对这款特定模型来说,这一点比平时更为重要,因为大多数读者面临的抉择并不是“用 Grok 4.5 还是不用”,而是“用 Grok 4.5,还是 Grok 4.6,还是 Grok 4.3”,而要在同一系列的三个模型之间做比较,恰恰是单个端点覆盖 200 多个模型就能以低成本做到的事。一个密钥,无需第二份合同,A/B 测试只需改动一个字符串,而无需做一次集成。

故障转移的论点在这里异常具体。Grok 4.5 仍然可路由,但已不再被独立追踪机构完整基准评测,也不再是厂商的旗舰——这是一款你可能想放进回退链、而非作为唯一路径的模型。跨提供商的自动故障转移正是这样一种机制:让你保留它擅长之处,又不必把生产路由押在一个生态系统已开始将其抛在身后的快照上。

本页不会做的,是假装这个选择显而易见。Grok 4.5 是一个有特定优势的好模型,但它所属的系列里,如今同样的钱能买到更新的型号。如果你今天从头开始,诚实的建议是选 Grok 4.6。如果你已经在智能体循环中运行 Grok 4.5,并且它正以你预算的 token 数量完成任务,那么诚实的建议是什么都别改,一个季度后重新评估。

Screenshot of the OrcaRouter model page for Grok 4.5 (grok/grok-4.5), showing the SpaceXAI provider label, the Featured badge, capability tags for Vision, Tools, JSON and Reasoning, the 500K-token context window, the $2.00 per million input and $6.00 per million output pricing rows, and the benchmark table sourced from Artificial Analysis.

Grok 4.5 现已在 OrcaRouter 上可路由,Grok 4.6、Grok 4.7 和 Grok 4.3 也是如此。OrcaRouter以零加价透传提供商的标价,因此供应商价格变动在他们那边生效的同一天就会落到我们这边,而在两个 Grok 模型之间迁移工作负载只需更改一个字符串,而不是再签一份合同。

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新