为 Claude Opus 5.5 与 Grok 4.6 生成的主视觉标题卡,由一条垂直分隔线分开:左侧是带有“$4.00 / $20.00”的“Claude Opus 5.5”,右侧是带有“$2.00 / $6.00”的“Grok 4.6”,底部横贯标语“一个模型阅读,另一个行动”,右下角是 OrcaRouter 标志。
Guides & Insights

Claude Opus 5.5 vs Grok 4.6:一个模型阅读,另一个行动

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Opus 5.5与Grok 4.6是购买能够承载五十万 token 上下文的前沿级模型的两条最便宜途径——而它们并非同一款产品。在一项测量中,Grok 4.6 距绝对天花板仅差三分:在 GPQA Diamond 上拿到 94.9 分,这是一个研究生水平的科学问题集,Anthropic 的旗舰模型也处于同一区间。而在下一项测量中,它却落后了三十八分。在 Terminal-Bench 4.0 这项要求模型在 shell 中完成真实工作的智能体终端基准上,Artificial Analysis 给 Grok 4.6 打出 21.21%,给 Claude Opus 5.5 打出 59.60%。这两个数字无论哪个方向都不是印错了,而这对组合的全部形态,就在于解释为什么这两个数字能同时成立。

两次发布,同一价格区间,相隔四个月

SpaceXAI 于 2026 年 8 月 12 日发布了 Grok 4.6,作为 Grok 系列当前的旗舰型号,定价为每百万输入 token 2.00 美元、输出 6.00 美元,具备 500,000 token 的上下文窗口,以及文本、图像和文件输入界面。Anthropic 于约六周后的 2026 年 9 月 22 日发布了 Claude Opus 5.5,定价为 4.00/20.00 美元,上下文窗口为 1,000,000 token,输出 token 数为 128,000。两者均支持可配置的推理强度、工具调用和结构化输出;两者既提供兼容 OpenAI 的聊天界面,也支持各自厂商的专有格式。

所以,最朴素的解读是一笔干脆的权衡:Grok 4.6 的输入价格只有一半,输出价格大约只有三分之一,而 Claude Opus 5.5 则以两倍的上下文窗口作为回应。这笔权衡是真实存在的,而且在长文档任务上,它或许就是唯一要紧的事。但有意思的分歧并不在这里,因为这两个模型是在同一套独立评测框架上测出来的,却在智能体工作最关键的几个维度上并没有落在相同的位置。

目录中关于两者共同被测量的那些轴是怎么说的

OrcaRouter 的目录中每一行都带有基准测试来源信息——每个数字都注明其出自哪个评测方——因此下面的配对在两个模型上都来自同一来源:Artificial Analysis,而不是一边是厂商数据、另一边是第三方数据:

• GPQA Diamond — 我们的目录中未在此轴上列出 Claude Opus 5.5;Grok 4.6 得分为 94.9%

• 人类最后的考试 — Claude Opus 5.5 为 61.4%,相比之下 Grok 4.6 为 42.9%

• SciCode — 66.9% 对比 56.5%

• 长上下文召回 — 84.7%,对比 80.3%

• Terminal-Bench 4.0 — 59.60%,对比 21.21%

• AA Intelligence Index — 57.6 对比 44.3

在 Anthropic 一侧,GPQA 一行被刻意留空,而不是从厂商提供的演示材料中填入数据。Grok 4.6 在该项上的 94.9 是其成绩卡上最强的数字,而且它是真实的——一项独立测量,而非 SpaceXAI 的宣称——它也揭示了这款模型的一些真实情况:当任务是一个形式规范、且只有一个站得住脚答案的问题时,Grok 4.6 的表现处于前沿水平。把它与 Terminal-Bench 4.0 的 21.21% 放在一起看,整体轮廓就变得清晰了。就科学问题给出正确答案,与在 shell 中针对真实文件系统执行一个五步任务,是两种不同的能力,而 Grok 4.6 在第一种能力上的进展远远超过第二种。

在把这组配对当作定论之前,有一个需要注意的地方:这两个模型的 Artificial Analysis 数据是在不同的评估日期记录的,而 Grok 4.6 的那组数据更早。这一比较是在一个 8 月评估的模型和一个 9 月评估的模型之间进行的,而所用的测试框架本身也在这段时间内做过修订。差距的方向在五个独立维度上是一致的,因此我们将其视为信号,但具体的分值应被理解为 8 月对 9 月的比较,而不是同一天的比较。

一个由不销售任何一方的人构建的指数

还有第二种独立的衡量指标,它在方向上一致,但远不那么愿意做细致的区分。Epoch AI 构建的 Epoch Capabilities Index 由五十多个基准测试综合而成,并经过重新标定,使 Claude 3.5 Sonnet 位于 130、GPT-5 位于 150;在我们于 2026 年 10 月 2 日读取的文件中,它将 Claude Opus 5.5 列为 167.35。Grok 4.6 为 156.61,来自 8 月 12 日的一次评估。在该指数发布时,观测到这一量表上大约 5 分对应 METR 时间跨度指标翻倍,而这是一道 10.74 分的差距——差距很大,并且稳稳落在两个模型公布的区间 164.0 至 172.0 和 154.66 至 158.93 之外,这两个区间完全不重叠。

值得注意这个指数没有解决什么。它把 Claude Sonnet 5.5 排在 165.2,把 Claude Fable 5.1 排在 164.82,两者都在 Grok 4.6 之上,而且这两款每百万输出 token 的价格都比 Grok 4.6 的第二档费率更低。任何单凭性价比做选择的人,在同一个厂商家族里就有了第三和第四个选项,而本文所做的配对讲的是另一回事:这两个模型各自擅长什么。

费率卡,以及只出现在其中一张上的那一行

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

Grok 4.6 的费率表中有一个 Claude Opus 5.5 所没有的档位:超过 200,000 个提示 token 的请求按基础费率的两倍计费,因此输入从 2.00 美元变为 4.00 美元,输出从 6.00 美元变为 12.00 美元,缓存读取则从 0.50 美元变为 1.00 美元。Claude Opus 5.5 的收费为 4.00 美元/20.00 美元,缓存读取为 0.20 美元,在整个 1,000,000 token 窗口内保持不变。这种倒挂是从任一模型购买长上下文的实际后果,并且一旦工作负载真正增长,它就会颠覆标价对比:

• 在 30,000 个输入 token 时的价格——Claude Opus 5.5 是较贵的那个,30,000 个输入和 8,000 个输出大约要 28 美分,而 Grok 4.6 约为 11 美分

• 在 250,000 输入 token 时,价格排序发生反转,因为 Grok 4.6 已进入其翻倍档位,而 Claude Opus 5.5 尚未如此

• 缓存读取 — Claude Opus 5.5 为每百万 $0.20,而 Grok 4.6 为 $0.50,超过阶梯后升至 $1.00

• 最大输出 — Claude Opus 5.5 为 128,000 个 token;Grok 4.6 的输出上限未在目录记录中公布

Grok 4.6 还存在一个差距,值得直截了当地说明,而不是留待日后才被发现。它的记录里完全没有列出最大输出数值——该字段是未测量的,而不是零——因此,对于依赖极长单次响应的工作负载,在比较的这一侧就没有可供规划参考的已公布数字。

不应读取的性能列

我们的产品目录还为每个模型附有一个服务性能面板,而在 Grok 4.6 上,它是页面上最具误导性的内容。该卡片显示,在七天窗口内 p50 延迟为 10,000 毫秒、错误率为 97.58%,该期间内共服务了 26,184 个 token。这些字段描述的并不是一个缓慢的模型,而是一个几乎没被调用过的模型:在这种流量水平下,样本量太过稀薄,延迟分布毫无意义,而错误率反映的也只是寥寥几次尝试,而非服务质量。若把这一区块当作 Grok 4.6 运行缓慢的证据,无异于把测量伪影当作测量结果来解读。

相比之下,Claude Opus 5.5 的面板背后则有一个总体——在七天窗口、每日采样的情况下,p50 落在 4.4 秒区间,同期还服务了 1.56 亿个 token。即便如此,这也应当按其本来面目来理解:那只是我们自家 playground 的流量,是我们用户的一个样本,而非模型本身的属性。

该路由哪一个,以及如何在自己的工作中自行查明

数字所描述的差异足够稳定,可以据此行动。Claude Opus 5.5 是智能体与长周期任务的首选——Terminal-Bench 4.0 上 59.60% 对 21.21% 的差距,是两个模型都经过测量的所有维度中最大的一道鸿沟,而这正是最能预示一个模型能否被交付一项任务、而非一个问题的维度。当提示词确实很长时,它同样是首选,因为费率不会跳档,而窗口是对方的两倍。Grok 4.6 则是大规模问题型工作的首选:在最初 200,000 tokens 内以 $2.00/$6.00 的价格取得 94.9% 的 GPQA Diamond 得分,对于那些永远用不到翻倍档位的检索与问答类负载来说,是一笔非常划算的交易。

两者都以服务商的标价、0% 加价在 OrcaRouter 上提供——Claude Opus 5.5 为 $4.00/$20.00,缓存读取 $0.20,Grok 4.6 为 $2.00/$6.00,超过 200K 的档位完全按 SpaceXAI 的设定执行——只需一个密钥,因此上面的分配方案可以在你自己的提示集上实测,而不是靠争论。在两者都接入路由的情况下,自动故障转移处于底层,当较便宜的那个模型正是承载智能体路径的一方时,这一点尤为可贵。

这组对比得出的结论是:Grok 4.6 是更出色的阅读者,而 Claude Opus 5.5 是更出色的执行者。GPQA Diamond 上的 94.9 分与 Terminal-Bench 上的 21.21 分,是同一个模型被测量的两次结果,而弄清你的工作负载更像这两个数字中的哪一个,就是整个决策的关键所在。

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新