
Grok 4.6 对决 Claude Opus 5:同样61分,两种不同经济
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
Artificial Analysis 用相同的九项评估逐一测试每一款前沿模型,并公开账单。在其 Intelligence Index 上,Grok 4.6和Claude Opus 5落在同一个数字——61——这使得这场正面对决成为罕见案例:综合指数无法告诉你该选哪一个。真正能告诉你答案的是同一来源中一个不那么出名的数据:在 AA-Briefcase 知识工作套件中,Grok 4.6 用大约 53 轮交互和约 5 亿输入 token 完成了一项任务,而 Claude Opus 5 在最大努力模式下完成同样的工作需要大约 103 轮交互和 20 亿 token。这两款综合得分相同的模型之间,token 消耗相差四倍,而这一点只有在你不再比较模型规格表、转而比较账单时才会显现。
这两款模型均为当前的旗舰级发布产品,因此这是一场同代对比,而非代际错位。Grok 4.6 于 2026 年 8 月 12 日由 SpaceXAI 发布,是在 Grok 4.5 基础之上的精炼版本——沿用相同的 1.5 万亿参数混合专家(MoE)底座,并通过更长的监督训练和针对长时间运行智能体的强化学习运行重新训练。Claude Opus 5 于 2026 年 7 月 24 日由 Anthropic 发布,是一款带固定时间戳的旗舰产品,具备自适应思考、100 万 token 的上下文窗口,以及图像和文件输入能力。两者在独立评分榜上得分相同,在价格表上却各居一端:Grok 4.6 每百万 token 收费 $2 / $6,而 Claude Opus 5 为 $5 / $25。真正值得探究的是,这句话中的哪一半将决定你的生产选型。
那个隐藏着四比一效率差距的61
智能指数是九项评估的综合体,这既是它的优势,也是它的盲点。一个将推理、数学、编码和知识工作得分平均起来的单一数字,掩盖了模型是如何达到这一成绩的——而这两个模型恰恰是以相反的方式达到的。Artificial Analysis 自家的公文包式专业知识工作套件是窥见这一点的最清晰窗口:它测量的是真实的长周期任务,记录显示 Grok 4.6 每个任务大约需要 53 轮次和 0.5B 输入 token,而 Claude Opus 5 Max 大约需要 103 轮次和 2B 输入 token。就单任务经济性而言,这就是一个模型用四分之一 token 完成研究与产出工作、另一个模型却大量消耗 token 之间的差别。
原因在于设计选择,而非缺陷。Grok 4.6 经过专门训练,会在推进过程中自我验证,并在子任务真正完成时停下——xAI 将带有自测的长任务轨迹视为训练目标。Claude Opus 5 则针对推理深度和知识广度进行训练,其默认行为是比实际所需更深入地思考、更广泛地查阅。两者都是“推理模型”;它们分配精力的方式不同,而这种分配方式,正是智能体工作负载中真正重要的规格。

对于循环调用模型的智能体来说,这种差距最为关键——研究型智能体、运行数十轮对话的代码智能体,以及夜间批量处理文档的流水线。每一轮都要计费,每个输入token都是下一轮调用时须重新发送的上下文。一个在53轮内以0.5B token完成的模型,不仅在每token成本上更便宜;每个任务的成本也要比以2B token运行103轮的模型大约低一个数量级——这还没有乘以标价计算总成本。
规格表,双面
它们在纸面上不同之处,各占一行:
• 智能指数 — Grok 4.6 获得 61 分,在 184 个模型中排名第 6;Claude Opus 5 同样获得 61 分,并列榜首。据 Artificial Analysis 称,双方打成平局。
• 每1M tokens的标价Grok 4.6 为 $2 输入 / $6 输出(对于输入 tokens 达到或超过 200K 的提示,价格翻倍至 $4 / $12);Claude Opus 5 为 $5 输入 / $25 输出,批量折扣 50% 后为 $2.50 / $12.50。
• 上下文窗口 — Grok 4.6 支持 500K tokens,而 Claude Opus 5 支持 1,000,000 tokens,这是两者中任一模型最明显的规格优势。
• 最大输出——Claude Opus 5 最高支持 128K 输出 token(通过批处理 API 可达 300K);Grok 4.6 的输出上限较低,大致相当于典型长回答的水平。
• 输入 — 两者都接受文本和图像;Claude Opus 5 还接受文件,而且 Anthropic 的多模态输入能更直接地深入文档。
• GDPVal-AA v2(知识工作)——Grok 4.6 的 1,753 Elo 对比 Claude Opus 5 的 1,852 Elo。在这项公文包效率更青睐 Grok 的指标上,Opus 5 夺得了知识工作质量的桂冠。[Artificial Analysis]
• CursorBench v3.2——Grok 4.6 为 69.9%,Claude Opus 5 为 70.0%,在二者共同接受的编码智能体基准测试上实际持平。[Artificial Analysis]
• 推理控制— Claude Opus 5 提供从低到最高的努力程度调节旋钮,并默认启用自适应思考;Grok 4.6 也提供推理努力程度选项,但其默认调校偏向于支持较长的智能体轨迹。
将这些模型并排比较的意义在于,没有哪个模型占据绝对优势。Claude Opus 5 在纸面上是更好的通才:上下文更长、输出上限更高、支持文件输入、知识工作质量更高。Grok 4.6 更具性价比,是更高效的智能体。唯一剩下的问题是,哪一种更符合你实际的工作内容。

Claude Opus 5 的溢价价值所在
Anthropic的发布数字——由厂商自行报告、未经独立复现——显示Claude Opus 5在SWE-bench Verified上取得96.0%,在SWE-bench Pro上取得79.2%,并在OSWorld计算机使用测试中获得70.6%的分数。在综合指标上,其61分与Grok 4.6持平,而在GDPVal-AA上则显著领先。实际而言,这意味着该模型在知识工作者一天的完整工作流程中游刃有余:起草、分析、长文档推理、图文任务、编程集于一身,并拥有100万token的上下文余量。
上下文窗口才是选择它的真正理由。500K token 的限制虽然很大,但它装不下整个代码库,加上研究语料库,再加上长时间智能体会话的中间结果。对超大型语料库进行深度单遍分析的团队——比如完整代码库、一年的财务文件、一大堆长篇 PDF——会撞上 Grok 4.6 的天花板,却永远达不到 Claude Opus 5 的上限。对这些工作负载而言,额外的上下文不是奢侈品;它决定了任务是能直接装下,还是得围绕限制去编排。
Grok 4.6 在哪些方面更划算
翻转同样的事实,Grok 4.6 才是代理管道的更优之选,而且优势不小。与 Opus 5 的标价相比,它在输入上便宜 2.5 倍,在输出上便宜 4.2 倍,而其每任务 token 效率进一步放大了这一优势:AA-Briefcase 的数据显示,同样的知识工作成果所需 token 数大约少 4 倍,轮次少 2 倍。将 4 倍乘以 2.5 倍,在 Opus 5 的成本体系下花费 1.00 美元的任务,在 Grok 4.6 的成本体系下大约只需 0.10 美元——在 Opus 方面的批量折扣缩小部分差距之前。
具体到智能体编码(agentic coding),Grok 4.6 的 DeepSWE 1.1 成绩从 4.5 的 54% 提升至 4.6 的 65.9%,其 CursorBench 得分与 Opus 5 相差不到半个百分点,且全程对自己的工作进行了自我验证。对于每天运行数千次智能体调用、每次调用都是多轮循环的团队而言,单任务经济性和更短的运行轨迹决定了产品能否跑通,还是沦为持续烧钱。这正是 xAI 的主张,而独立的效率数据也印证了这一方向。
路由决策
这是一场路由器证明自身价值的对决,因为正确答案是“两者都要,按工作负载形态来划分”。Grok 4.6 和 Claude Opus 5 都已上线 OrcaRouter,以各厂商自己的目录价销售——grok/grok-4.6 为 $2 / $6,anthropic/claude-opus-5 为 $5 / $25——加价 0%,所以你成本模型中的数字就是实际计费的数字。让这种分流落到实处的底层机制是:一个 API 密钥同时用于两个模型;如果某个提供商的端点在智能体长时间运行中途降级,自动进行故障转移;以及一套路由 DSL,能在一次调用中把短小、海量的对话轮次发送给 Grok 4.6,并将长周期、需要大量上下文的任务升级给 Claude Opus 5。你不需要签订第二份合同来运行两层架构,而且可以根据真实流量数据重新调整分流比例,而不是靠模型卡上的说明去猜测。

诚实的解读
综合指数上的平局是真实存在的,而它是一个陷阱。同分模型并非可以互换;它们的差异恰恰体现在分数盲区之中。Claude Opus 5 是更稳妥的默认之选,适用于广泛的、上下文密集的文档与图像知识工作——在这些场景中,100万token的上下文窗口和深度推理比成本更重要。Grok 4.6 则是高吞吐量Agent循环中更好的默认选择,因为单任务token效率和2.5倍的价格优势会累积成数量级的账单差异。如果你的工作负载属于前者,就为 Opus 5 买单,别再去纠结价格。如果是后者,纸面上61分的平局将是你优先测试 Grok 4.6 的最好理由——基准测试说它们旗鼓相当,而账单说它们天差地别。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
