
Claude Opus 5.5 vs Grok 4.6:一个模型阅读,另一个行动
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Claude Opus 5.5与Grok 4.6是购买能够承载五十万 token 上下文的前沿级模型的两条最便宜途径——而它们并非同一款产品。在一项测量中,Grok 4.6 距绝对天花板仅差三分:在 GPQA Diamond 上拿到 94.9 分,这是一个研究生水平的科学问题集,Anthropic 的旗舰模型也处于同一区间。而在下一项测量中,它却落后了三十八分。在 Terminal-Bench 4.0 这项要求模型在 shell 中完成真实工作的智能体终端基准上,Artificial Analysis 给 Grok 4.6 打出 21.21%,给 Claude Opus 5.5 打出 59.60%。这两个数字无论哪个方向都不是印错了,而这对组合的全部形态,就在于解释为什么这两个数字能同时成立。
两次发布,同一价格区间,相隔四个月
SpaceXAI 于 2026 年 8 月 12 日发布了 Grok 4.6,作为 Grok 系列当前的旗舰型号,定价为每百万输入 token 2.00 美元、输出 6.00 美元,具备 500,000 token 的上下文窗口,以及文本、图像和文件输入界面。Anthropic 于约六周后的 2026 年 9 月 22 日发布了 Claude Opus 5.5,定价为 4.00/20.00 美元,上下文窗口为 1,000,000 token,输出 token 数为 128,000。两者均支持可配置的推理强度、工具调用和结构化输出;两者既提供兼容 OpenAI 的聊天界面,也支持各自厂商的专有格式。
所以,最朴素的解读是一笔干脆的权衡:Grok 4.6 的输入价格只有一半,输出价格大约只有三分之一,而 Claude Opus 5.5 则以两倍的上下文窗口作为回应。这笔权衡是真实存在的,而且在长文档任务上,它或许就是唯一要紧的事。但有意思的分歧并不在这里,因为这两个模型是在同一套独立评测框架上测出来的,却在智能体工作最关键的几个维度上并没有落在相同的位置。
目录中关于两者共同被测量的那些轴是怎么说的
OrcaRouter 的目录中每一行都带有基准测试来源信息——每个数字都注明其出自哪个评测方——因此下面的配对在两个模型上都来自同一来源:Artificial Analysis,而不是一边是厂商数据、另一边是第三方数据:
• GPQA Diamond — 我们的目录中未在此轴上列出 Claude Opus 5.5;Grok 4.6 得分为 94.9%
• 人类最后的考试 — Claude Opus 5.5 为 61.4%,相比之下 Grok 4.6 为 42.9%
• SciCode — 66.9% 对比 56.5%
• 长上下文召回 — 84.7%,对比 80.3%
• Terminal-Bench 4.0 — 59.60%,对比 21.21%
• AA Intelligence Index — 57.6 对比 44.3
在 Anthropic 一侧,GPQA 一行被刻意留空,而不是从厂商提供的演示材料中填入数据。Grok 4.6 在该项上的 94.9 是其成绩卡上最强的数字,而且它是真实的——一项独立测量,而非 SpaceXAI 的宣称——它也揭示了这款模型的一些真实情况:当任务是一个形式规范、且只有一个站得住脚答案的问题时,Grok 4.6 的表现处于前沿水平。把它与 Terminal-Bench 4.0 的 21.21% 放在一起看,整体轮廓就变得清晰了。就科学问题给出正确答案,与在 shell 中针对真实文件系统执行一个五步任务,是两种不同的能力,而 Grok 4.6 在第一种能力上的进展远远超过第二种。
在把这组配对当作定论之前,有一个需要注意的地方:这两个模型的 Artificial Analysis 数据是在不同的评估日期记录的,而 Grok 4.6 的那组数据更早。这一比较是在一个 8 月评估的模型和一个 9 月评估的模型之间进行的,而所用的测试框架本身也在这段时间内做过修订。差距的方向在五个独立维度上是一致的,因此我们将其视为信号,但具体的分值应被理解为 8 月对 9 月的比较,而不是同一天的比较。
一个由不销售任何一方的人构建的指数
还有第二种独立的衡量指标,它在方向上一致,但远不那么愿意做细致的区分。Epoch AI 构建的 Epoch Capabilities Index 由五十多个基准测试综合而成,并经过重新标定,使 Claude 3.5 Sonnet 位于 130、GPT-5 位于 150;在我们于 2026 年 10 月 2 日读取的文件中,它将 Claude Opus 5.5 列为 167.35。Grok 4.6 为 156.61,来自 8 月 12 日的一次评估。在该指数发布时,观测到这一量表上大约 5 分对应 METR 时间跨度指标翻倍,而这是一道 10.74 分的差距——差距很大,并且稳稳落在两个模型公布的区间 164.0 至 172.0 和 154.66 至 158.93 之外,这两个区间完全不重叠。
值得注意这个指数没有解决什么。它把 Claude Sonnet 5.5 排在 165.2,把 Claude Fable 5.1 排在 164.82,两者都在 Grok 4.6 之上,而且这两款每百万输出 token 的价格都比 Grok 4.6 的第二档费率更低。任何单凭性价比做选择的人,在同一个厂商家族里就有了第三和第四个选项,而本文所做的配对讲的是另一回事:这两个模型各自擅长什么。
费率卡,以及只出现在其中一张上的那一行

Grok 4.6 的费率表中有一个 Claude Opus 5.5 所没有的档位:超过 200,000 个提示 token 的请求按基础费率的两倍计费,因此输入从 2.00 美元变为 4.00 美元,输出从 6.00 美元变为 12.00 美元,缓存读取则从 0.50 美元变为 1.00 美元。Claude Opus 5.5 的收费为 4.00 美元/20.00 美元,缓存读取为 0.20 美元,在整个 1,000,000 token 窗口内保持不变。这种倒挂是从任一模型购买长上下文的实际后果,并且一旦工作负载真正增长,它就会颠覆标价对比:
• 在 30,000 个输入 token 时的价格——Claude Opus 5.5 是较贵的那个,30,000 个输入和 8,000 个输出大约要 28 美分,而 Grok 4.6 约为 11 美分
• 在 250,000 输入 token 时,价格排序发生反转,因为 Grok 4.6 已进入其翻倍档位,而 Claude Opus 5.5 尚未如此
• 缓存读取 — Claude Opus 5.5 为每百万 $0.20,而 Grok 4.6 为 $0.50,超过阶梯后升至 $1.00
• 最大输出 — Claude Opus 5.5 为 128,000 个 token;Grok 4.6 的输出上限未在目录记录中公布
Grok 4.6 还存在一个差距,值得直截了当地说明,而不是留待日后才被发现。它的记录里完全没有列出最大输出数值——该字段是未测量的,而不是零——因此,对于依赖极长单次响应的工作负载,在比较的这一侧就没有可供规划参考的已公布数字。
不应读取的性能列
我们的产品目录还为每个模型附有一个服务性能面板,而在 Grok 4.6 上,它是页面上最具误导性的内容。该卡片显示,在七天窗口内 p50 延迟为 10,000 毫秒、错误率为 97.58%,该期间内共服务了 26,184 个 token。这些字段描述的并不是一个缓慢的模型,而是一个几乎没被调用过的模型:在这种流量水平下,样本量太过稀薄,延迟分布毫无意义,而错误率反映的也只是寥寥几次尝试,而非服务质量。若把这一区块当作 Grok 4.6 运行缓慢的证据,无异于把测量伪影当作测量结果来解读。
相比之下,Claude Opus 5.5 的面板背后则有一个总体——在七天窗口、每日采样的情况下,p50 落在 4.4 秒区间,同期还服务了 1.56 亿个 token。即便如此,这也应当按其本来面目来理解:那只是我们自家 playground 的流量,是我们用户的一个样本,而非模型本身的属性。
该路由哪一个,以及如何在自己的工作中自行查明
数字所描述的差异足够稳定,可以据此行动。Claude Opus 5.5 是智能体与长周期任务的首选——Terminal-Bench 4.0 上 59.60% 对 21.21% 的差距,是两个模型都经过测量的所有维度中最大的一道鸿沟,而这正是最能预示一个模型能否被交付一项任务、而非一个问题的维度。当提示词确实很长时,它同样是首选,因为费率不会跳档,而窗口是对方的两倍。Grok 4.6 则是大规模问题型工作的首选:在最初 200,000 tokens 内以 $2.00/$6.00 的价格取得 94.9% 的 GPQA Diamond 得分,对于那些永远用不到翻倍档位的检索与问答类负载来说,是一笔非常划算的交易。
两者都以服务商的标价、0% 加价在 OrcaRouter 上提供——Claude Opus 5.5 为 $4.00/$20.00,缓存读取 $0.20,Grok 4.6 为 $2.00/$6.00,超过 200K 的档位完全按 SpaceXAI 的设定执行——只需一个密钥,因此上面的分配方案可以在你自己的提示集上实测,而不是靠争论。在两者都接入路由的情况下,自动故障转移处于底层,当较便宜的那个模型正是承载智能体路径的一方时,这一点尤为可贵。
这组对比得出的结论是:Grok 4.6 是更出色的阅读者,而 Claude Opus 5.5 是更出色的执行者。GPQA Diamond 上的 94.9 分与 Terminal-Bench 上的 21.21 分,是同一个模型被测量的两次结果,而弄清你的工作负载更像这两个数字中的哪一个,就是整个决策的关键所在。


本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
