标题卡上写着“Grok 4.7 对 Claude Opus 5”,副标题为“价格差距真实存在;性能对等却并非如此”,另有三张卡片:AA Index v4.3.2 46 对 51,每百万价格 $2/$6 对 $5/$25,以及 Terminal-Bench 4.0 26 对 49。
Guides & Insights

Grok 4.7 对比 Claude Opus 5:价格差距确实存在,性能却并不对等

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

你可以以每百万输入 token 2.00 美元、每百万输出 token 6.00 美元的价格调用 Grok 4.7。而调用 Claude Opus 5 的价格则是 5.00 美元和 25.00 美元。在输出端,这是 4.2 倍的差距——这种量级的差距,通常还没等翻开基准测试结果,就足以让一场比较尘埃落定。但这一次,它没能决定胜负。在两者目前共同接受评分的那一版 Artificial Analysis Intelligence Index 上——即 2026 年 9 月 19 日发布的修订版 v4.3.2——Claude Opus 5 的得分为 51,而厂商于 2026 年 9 月 21 日发布的 Grok 4.7 得分为 46。五分算不上碾压,但这五分的分布形态却很说明问题:在该指数的十项评测中,Opus 5 赢下了八项。更便宜那款模型的立足之处在于价格,上下文方面两者不相上下,而 Grok 4.7 的价格优势本应最能发挥作用的那个场景,恰恰正是它失去优势的地方。

两款旗舰,两份截然不同的价格表

Claude Opus 5 自 2026 年 7 月 24 日起上市,是 Anthropic 的 Opus 级旗舰模型,在公司自身的产品阵容中位于 Claude Fable 5.1 之下。它提供 100 万 token 的上下文窗口,且采用统一计价——Anthropic 明确表示,90 万 token 的请求与 9 千 token 的请求按相同的每 token 费率计费,完全没有长上下文溢价——最大输出为 128K,在 Message Batches API 上可扩展至 300K。思考功能为自适应,且默认开启,提供 low、medium、high、xhigh 和 max 的力度阶梯,默认值为 high。权重为闭源。

Grok 4.7 问世仅一天。它拥有 50 万 token 的上下文,可接收文本和图像并返回文本,并自带一个可调节的推理强度旋钮。其标价为:在提示 token 低于 20 万时,输入每百万 token 2.00 美元、输出每百万 token 6.00 美元;达到或超过该阈值后,分别升至 4.00 美元和 12.00 美元;在同样的两个区间内,缓存读取分别为 0.50 美元和 1.00 美元。xAI 还列出了一个更快的变体,其输出速度约为前者两倍,价格也约为两倍,不过该配置发布时并未附带公布的速度测量数据。这里的权重同样是闭源的,这也消除了这一比较双方“自行运行”的退路。

独立董事会既不接近,也不讨好

这两款模型均在 Artificial Analysis 的 v4.3.2 指数上评分,该指数包含十项评估,涵盖智能体、编程、通用知识和科学推理。把这两列并排放在一起,会让这个五点的头条差距显得对较便宜的模型颇为宽容——综合评分中区区五点的差距可以掩盖很多东西,而在这里,它掩盖的是一场近乎一边倒的横扫。

综合智能 — Grok 4.7(xhigh):在 Artificial Analysis Intelligence Index v4.3.2 上得分为 46。Claude Opus 5(自适应推理,最大努力):在同一版本上得分为 51。

高难度推理——Grok 4.7:人类最后的考试 43 分,CritPt 18 分。Claude Opus 5:HLE 55 分,CritPt 29 分。两者分别相差十二分和十一分,且均对 Opus 5 有利。

智能体终端——Grok 4.7:Terminal-Bench 4.0 得分 26。Claude Opus 5:49。这是榜单上最大的单项差距,而且恰恰出现在最贴近真实自主工作的基准测试上。

工作场所自动化——Grok 4.7:AutomationBench-AA 66%。Claude Opus 5:57%。这是 Grok 4.7 唯一一次明确的胜出,而且是实打实的——在一项评估智能体能否在不触发护栏的情况下完成工作流的评测中领先九个百分点。

知识与诚实——Grok 4.7:AA-Omniscience 32。Claude Opus 5:37。两个模型都会产生幻觉;在这一指标上,Opus 5 的表现更好一些。

长上下文 — Grok 4.7:AA-LCR v1.1 77%,窗口 500k tokens。Claude Opus 5:79%,窗口 1M tokens。

运行该指数的成本——Grok 4.7:整个评估过程中输出 2.4 亿个 token,被 Artificial Analysis 标记为异常冗长。Claude Opus 5:1.4 亿。Grok 4.7 为达到更低的分数,消耗的 token 量是前者的 1.7 倍。

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

Grok 4.7的价格优势在此终结

这是费率表所隐藏的算术。试举一个真实的智能体请求:30k 输入 token,8k 输出。Grok 4.7 的输入计费为 $0.06,输出计费为 $0.048——约 11 美分。Claude Opus 5 的输入计费为 $0.15,输出计费为 $0.20——约 35 美分。这是实打实的 3 倍差距,而在这个规模下,单从成本来看,Grok 4.7 是显而易见的选择。

现在来看看 Grok 4.7 自身营销所围绕的那类请求:一次长上下文的智能体会话。把提示词推过 20 万 token,Grok 4.7 的费率就翻倍到输入 $4.00、输出 $12.00。Claude Opus 5 则纹丝不动——其 100 万 token 窗口一律按输入 $5.00、输出 $25.00 计费。在 25 万输入、8 千输出的情况下,Grok 4.7 的输入成本为 $1.00、输出为 $0.096,合计约 $1.10。Opus 5 的输入成本为 $1.25、输出为 $0.20,合计约 $1.45。差距已从 3 倍坍缩到约 1.3 倍。再往上推——40 万、50 万,直到 Grok 4.7 窗口的上限——Opus 5 的固定费率会持续缩小差距,而它的窗口还能一路延伸到 100 万 token。Grok 4.7 在短提示词下是那个便宜的模型,在长提示词下价格也几乎与对手持平,而这恰恰颠覆了定价页面刻意营造的直觉。

有两点说明能让这话保持诚实。首先,长上下文档位是 xAI 自家模型文档中记录的标价结构,而非实测——真实账单取决于缓存,而 Grok 4.7 的 0.50 美元缓存读取费率确实便宜。其次,Artificial Analysis 尚未发布 Grok 4.7 的速度测量数据,因此“便宜又快”论点中“它更快”的那一半目前尚未得到验证。已经被测量的是 Opus 5:每秒 59 个 token,首 token 时间为 49 秒——慢、贵,并且在几乎所有质量维度上都领先。

你实际会路由的内容

这是一场答案因工作负载而异的对比,诚实的结论也因工作负载而不同,而路由器是据此采取行动最省钱的方式Claude Opus 5 已在 OrcaRouter 上线,它拥有独立的模型页面,提供商的定价以 0% 加价原样传递——因此我们目录中 Opus 5 的 $5.00 和 $25.00 就是 Anthropic 的标价,而非加价后的版本;如果 Anthropic 调价,该数字会在同一天以同一键值更新。截至本文撰写时,Grok 4.7 尚未进入 OrcaRouter 目录;如今要调用它,需通过 xAI 自家的 API 以及提供该模型的第三方平台。在围绕这一点做架构设计之前,这种不对称性值得了解。

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

从这些数字中得出的路由模式很直接。把长上下文、重推理和终端代理类工作交给 Opus 5——它在 Terminal-Bench 4.0 上以 23 分的优势胜出,并以统一价格提供两倍的窗口,而这恰恰是艰难、漫长任务的典型特征。把高吞吐量的自动化和工作流任务交给 Grok 4.7:它在 AutomationBench-AA 上以九分的优势胜出,并且在短提示下成本只有三分之一。由于当它们都在目录中时,两者都通过同一个端点访问,这种分流是一条路由规则,而不是第二份供应商合同;自动故障转移意味着某条路径上的速率限制会变成一次路由事件,而不是一次服务中断。当某个工作负载确实需要两者——一次廉价的首轮处理和一次昂贵的验证处理——路由 DSL 会将它们组合成一次调用,而不是两次集成。

裁决

如果你依据证据来做选择,Claude Opus 5 会在这场对决中胜出,而且差距并不小:十项评测中赢了八项,拿下两个最大的差距,在价格不变的情况下上下文长度翻倍,并以远低于三分之二的 token 预算换来更高的分数。五分制的综合评分低估了它领先得有多彻底。Grok 4.7 的立足点比其价目表所暗示的更窄,但并非空无一物——在大多数应用实际使用的提示词规模下,它确实更便宜,它是更好的自动化模型,而且它才发布一天,厂商的基准测试套件仍在被独立复现。若是用于对成本敏感的自动化,可以买它;等 Artificial Analysis 公布其速度数据时留意这些数字;并把长上下文价格档位视为决定这款便宜模型能否保持便宜的关键。

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新