标题为 Claude Sonnet 5.5 vs Grok 4.6 的主视觉卡片,副标题为"价目表说一套,token 账单说另一套",标签显示输出 $10 vs $6、单任务成本 $7.60 vs $1.86、指数 56 vs 44,页脚引用 Artificial Analysis v4.3.2 及厂商定价。
Guides & Insights

Claude Sonnet 5.5 对比 Grok 4.6:费率表说一套,Token 账单说另一套

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

开头的算术在产品介绍开始前就已经摆明了。Grok 4.6 每百万输入 token 收费 2 美元,每百万输出 token 收费 6 美元;Claude Sonnet 5.5 则是 2 美元和 10 美元。Space​XAI 的模型在输出上便宜 40%,输入价格持平,并且自 2026 年 8 月 12 日起就已全面可用——这段时间足够长,以至于它的各种怪癖都已有据可查,而非仅止于传闻。Anthro​pic 的模型于 2026 年 9 月 28 日推出,就在本文撰写的前一天,是这一档位中最新登场者,而且领先幅度相当大。

然后你再去看独立的效率数据,排序就翻转了。Artificial Analysis 除了 Intelligence Index 之外,还按每任务成本来衡量 GPT 和 Claude 级别的模型;在 v4.3.2 版本中,这里的两个模型分别是 Grok 4.6 每个指数任务 1.86 美元,而 Claude Sonnet 5.5 为 7.60 美元。价目表更便宜的那个模型,反而是运行成本更高的那个,相差四倍。弄清其中的原因,以及这种反转在何时成立、何时不成立,就是这整场对比的核心。

两款车型,在各自家族中的两个定位

Grok 4.6 是 Grok 系列当前的旗舰——SpaceXAI 自家的开发者文档将其列为最新版本,它接替了 Grok 4.5,拥有相同的 500,000 token 上下文窗口、相同的文本、图像和文件输入能力,以及相同的基础定价。它支持可配置的推理强度、原生工具调用、结构化输出和完整的采样参数,并且作为一流的 OpenAI Responses 模型,无需转换层即可接入现有智能体框架。Artificial Analysis 给它的 Intelligence Index 为 44,在其评测的 216 款模型中排名第 31,GPQA Diamond 得分为 94.9%。

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 是 Anthropic 5.5 代中的第二款产品,也是该公司定位为其产品阵容中速度与智能最佳结合的模型。claude-sonnet-5-5/ 的形式在 Claude API 和三大主流云平台上提供,具备 100 万 token 的上下文窗口和 128K 的同步输出上限,沿用 Claude Sonnet 5 针对输入、输出和缓存的 $2 / $10 费率,并支持零数据保留。在同一索引版本中,它得分为 56,在 216 个模型中排名第三。

所以,这两者实际上并不真正处于同一个市场。一个是 50 万 token 的前沿模型,已经以较低的价格发售了七周。另一个是 100 万 token 的通用层级,每 token 成本不高于其前代,而且在综合评分上高出 12 分。这个比较还是值得做的,因为两者都是 $2 输入价格的模型,而采购决策正是从这一点开始。

没人会放在幻灯片上的四倍差距

费率卡为 token 定价。账单以任务为单位计价,而模型为得出答案所消耗的 token 数量是一种设计选择,而非固定常量。两者的分歧正在于此,而实测数字对比鲜明:

输出费率 — Claude Sonnet 5.5 每百万 $10,而 Grok 4.6 每百万 $6

• 每项智能指数任务的成本 — Claude Sonnet 5.5 为 $7.60,而 Grok 4.6 为 $1.86

• Index 上的冗长程度 — Claude Sonnet 5.5 410M 输出 token 对比 Grok 4.6 94M

• 智能指数 — Claude Sonnet 5.5 56 对比 Grok 4.6 44,两者均基于 v4.3.2

• 输出速度 — Grok 4.6 的实测速度为每秒 67.7 个词元,而中位数为 82.7;Anthropic 称 Claude Sonnet 5.5 的输出生成速度比 Claude Sonnet 5 快 30% 以上,Artificial Analysis 测得其速度为每秒 78.7 个词元

冗长性这一条才是机制所在。一个输出令牌数是四倍的模型,并不需要高出 67% 的输出速率,就能让每项任务成本达到四倍——但这会有帮助,而在这里,两种效应指向同一个方向。Anthropic 自己的表述支持而非反驳这一解释:发布材料声称,在每令牌价格相同的情况下,Claude Sonnet 5.5 相比 Claude Sonnet 5“每项任务成本最多低 30%”,这是关于令牌数量的说法,而不是关于速率的说法。面对一个精简得多的外部基线,同一特性就成了该模型最大的成本风险。

这一切都无法让指数差距消失。综合得分十二个点的差距是实实在在的能力差异,而一个更便宜却失败的任务并不便宜。它确实意味着,真正该问的问题不是“哪个费率更低”,而是“更难的那个任务要消耗多少 token”,而只有当你运行自己的工作负载时,这个数字才会出现。

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

背景、投入以及集成的形态

第二个分歧是架构层面的,它决定了这两者中哪一个能被你直接采用,而无需重写任何东西。

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

相比 Claude Sonnet 5,Claude Sonnet 5.5 更改了六项行为,其中五项属于破坏性变更。发送 thinking: {"type": "disabled"}/ 现在会返回 400,必须替换为 between_tools/。强制工具调用——即把 tool_choice/ 设为 "any"/ 或指定某个具名工具——会被直接拒绝,因此,凡是强制发起符合 schema 的调用的循环,都必须改用 auto/ 并配合严格工具调用或结构化输出。较旧的 computer_20251124/ 计算机使用工具在 Claude API 和 Google Cloud 上会被拒绝。思考块现在绑定到生成它的模型和账户,因此一段对话可以将其推理从 Claude Sonnet 5 向前延续,却无法横向带入不同的模型系列。此外,顾问工具不再接受 Claude Opus 4.8、Claude Opus 4.7 或 Claude Sonnet 5 作为 Sonnet 5.5 执行器背后的顾问。

Grok 4.6 不需要其中任何一项。它是一款 OpenAI 格式的模型,采样接口保持原样,而从 Grok 4.5 迁移过来只需更改模型字符串。不过,它自身的成本结构有个玄机,而且与 Anthropic 恰好相反:2 美元 / 6 美元的费率适用于最多 200,000 个输入 token,超出部分则按 4 美元 / 12 美元计费。Claude Sonnet 5.5 则在完整的 100 万 token 窗口内全程按标准费率收费。

把这两个结构并排放在一起,选择就不再是哪家供应商更便宜的问题了:

• 简短提示,密集输出——Grok 4.6 更精简的 token 习惯和更低的输出速率以决定性优势胜出

• 超长输入——远在上下文上限之前,Claude Sonnet 5.5 的固定 1M 费率就已开始胜过翻倍的分层定价

• 大规模单次输出——Sonnet 5.5 的 128K 上限与 Grok 4.6 持平,而在 Message Batches API 上,只要带上 output-300k-2026-03-24 请求头即可达到 300K

• 现有的 OpenAI 形式代码——Grok 4.6 无需任何改动;Sonnet 5.5 则需要上述工具使用与思考方面的工作

将两者合并到一张凭证上

在脑子里装下一场两家供应商的对比很容易。真正跑起来才是成本藏身之处:两个账号、两套限额、两个计费界面,还有一个得测上两遍才说明得了问题的 token 计数。

OrcaRouter 将这一切整合为一个兼容 OpenAI 的端点,覆盖 200 多款模型,按供应商标价原样传递、不额外加价,因此无论是 Grok 还是 Claude 一侧的供应商费率变动,当天即可在此生效,而无需等到下一次合同续签。整个 Grok 4.x 系列都以供应商自有费率列于目录之中,并且Claude Sonnet 5 自 6 月 30 日起即可路由,价格为 Anthropic 的 $2 / $10 —— 这是目前承载 Claude API 绝大部分流量的模型,实测输出速度为每秒 150 个 token,首 token 的 p50 时间约为五秒。

具体来说,Claude Sonnet 5.5 尚未进入我们的目录。在被收录之前,接入它的途径就是供应商自己的 API;而要在不把整个工作负载押在一个除了一项综合评分之外无人独立评测过的模型上的前提下对它进行测试,办法就是让它承接一定比例的流量,并置于自动故障转移之后,由 Grok 4.6 或 Claude Sonnet 5 接住它漏掉的部分。尝试一个全新的档位是一个路由决策,而不是一个迁移项目。

如何处理这些数字

Grok 4.6 是当任务简短、输出密集、且现有集成已经对接 OpenAI 时更值得选用的模型。在这个价位区间里,它每项任务的成本可测量地更低,其采样控制功能完好无损,而七周的上线时间也意味着它的失效模式早已被其他人发现过了。

当输入规模极其庞大时,当你真正要买的是综合评分时,或者当任务的智能体化程度足够高,以至于十二点的指数差距和 128K 的输出上限比每任务成本四倍的差异更重要时,Claude Sonnet 5.5 才是更优的模型。迁移清单是实打实存在的,而且它需要一整天的工作量,而不是改一下模型字符串那么简单。

真正能一锤定音的,是在你自己的流量上、对两者都跑一遍每任务 token 消耗量的测量。这篇文章里每一个决定胜负的数字——1.86 美元对 7.60 美元、94M 对 410M——都只是那一个数字的替代指标,而它也是其中唯一一个你能自己测出来的。

本文中的对比4

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新