生成的 hero 卡片标题为 Claude Sonnet 5.5 vs Grok 4.5,副标题为两个 $2 的输入费率与六分钟等待,展示三张统计卡片:首个 token 370.8s vs 6.9s、每任务成本 $7.60 vs $1.04、以及 Intelligence Index 56 vs 39,页脚写着:Intelligence Index、每任务成本和延迟数据来自 Artificial Analysis v4.3.2;价格以各厂商为准。
Guides & Insights

Claude Sonnet 5.5 对比 Grok 4.5:两个 2 美元的输入费率与六分钟的等待

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Sonnet 5.5和Grok 4.5对输入收取相同的价格:每百万 token 2.00 美元。相同之处到此为止,而一个数字比任何规格表都更能说明问题。在 Artificial Analysis 的 Intelligence Index 修订版 v4.3.2 中,Max Effort 设置下的 Claude Sonnet 5.5 首个回答 token 的中位耗时是 370.8 秒。对于 Grok 4.5,则是 6.9 秒。输入费率相同。在任何内容返回之前,等待时间是其 53 倍。Claude Sonnet 5.5 于 2026 年 9 月 28 日发布,Grok 4.5 于 2026 年 7 月 8 日发布、此后在自己的家族内被两次超越;在纸面上,它们是进入前沿的前半部分最便宜的两条途径——而纸面掩盖了真正重要的决策:你用等待究竟换来了什么。

那个数字需要立刻附上限定条件,因为脱离配置的延迟数字毫无意义:370.8 秒是 Anthropic 在最大努力下的默认推理模式,会在生成答案 token 之前花费非常大的思考预算。想要快速拿到首个 token 的调用方会配置成别的模式。但这个方向是真实的,并不是测量假象——Artificial Analysis 测得 Claude Sonnet 5.5 的输出速度为每秒 138.7 个 token,仅次于少数几个模型,而 Grok 4.5 为每秒 59.2 个。等待最久的模型也生成得最快。你要在两者之间做的选择是:长时间斟酌之后快速作答,还是短暂斟酌之后较慢作答。

9月28日有哪些变化?

Claude Sonnet 5.5 才发布一天。Anthropic 于 2026 年 9 月 28 日以 API 标识符claude-sonnet-5-5推出该模型,并同步登陆 Bedrock、Google Cloud 和 Microsoft Foundry,称其运行速度比 Claude Sonnet 5 快 30%,对大多数工作而言每项任务成本最多可降低 30%。这些均为厂商数据,尚未经过独立复现;其所对标的价格是真实的,因为价目表保持不变:每百万输入 token 2.00 美元、每百万输出 10.00 美元、缓存读取 0.20 美元、缓存写入 2.50 美元。窗口为 1,000,000 tokens,同步输出上限为 128,000 tokens,Message Batches API 上为 300,000 tokens,需置于output-300k-2026-03-24 请求头之后。知识截止日期为 2026 年 6 月。零数据保留自发布之时起即可使用,且 Anthropic 在 2027 年 9 月 28 日之前不会停用该模型。

Artificial Analysis model page for Claude Sonnet 5.5 in its Adaptive Reasoning, Max Effort, Default Fallback configuration, released September 2026, showing an Intelligence Index of 56, an output speed of 138.7 tokens per second, $2.00 per million input tokens and $10.00 per million output tokens, $7.60 per Intelligence Index task, 410M output tokens generated during the Index evaluation, and a 1M-token context window.

Anthropic 自己的文档页面也异常直白地说明了升级的代价:Claude Sonnet 5.5 与目前承载大多数 Claude 流量的模型之间隔着五个破坏性变更,这些变更将在下文介绍。

Grok 4.5 是更早推出的方案,也是更复杂的那一个。SpaceXAI——这家公司仍在其模型卡上以 xAI 品牌发布——于 2026 年 7 月 8 日发布该模型,它是一个 1.5 万亿参数的专家混合模型,与 Cursor 代码编辑器共同训练,拥有 500,000 token 的上下文窗口,支持文本、图像和文件输入,其发布宣传几乎完全建立在 token 经济性而非最高分之上。它不再是旗舰型号。Grok 4.6 和 Grok 4.7 都已存在,二者标价均为 $2.00 / $6.00,我们的产品目录中三款都列出。因此,2026 年 9 月真正有趣的问题不是 Grok 4.5 是否优秀;而是是否还有什么理由让人仍去选择三者中最早的那一个。

账单不是价目表

把两者并排放在独立板上,交易的轮廓便显现出来。

• 智能指数,修订版 v4.3.2 — Claude Sonnet 5.5 在最大努力下为 56,对比 Grok 4.5 为 39

• 每个 Index 任务的成本 — Claude Sonnet 5.5 为 $7.60,而 Grok 4.5 为 $1.04,两者均为实测值,而非估算值

• 输出费率 —— Claude Sonnet 5.5 每百万 $10.00,对比 Grok 4.5 每百万 $6.00

• 输出速度 — Claude Sonnet 5.5 138.7 词元/秒 vs Grok 4.5 59.2 词元/秒

• 首个答案词元耗时,Max Effort — Claude Sonnet 5.5 370.8 秒 vs Grok 4.5 6.9 秒

• 整个 Index 评估过程中生成的 Token 数——Claude Sonnet 5.5 410M 对比 Grok 4.5 77M

• 上下文 — Claude Sonnet 5.5 1,000,000 词元 vs Grok 4.5 500,000 词元

冗长程度这一行正是每任务成本差距背后的机制,也是本页最有用的单个数字。一个模型在一次评估中输出 4.1 亿个 token,而它的竞争对手只输出 7700 万个,那么它并不需要高出 67% 的输出费率才能在每任务成本上贵出七倍——可它偏偏就是如此,而且这两种效应还朝着同一个方向发力。Anthropic 自己的表述与这一解读相符而非相悖:“每任务最高可省 30%”说的是 token 数量,而不是费率,因为 Claude Sonnet 5 与 Claude Sonnet 5.5 之间的费率并未改变。Artificial Analysis 从另一侧得出了同样的结论,并用直白的语言将该模型描述为速度出众但极为冗长。面对一个精简型模型,这一同样的特性正是 Claude Sonnet 5.5 最大的运营风险。

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Grok 4.5, the scoreboard, with six matched rows: input price $2.00 vs $2.00, output price $10.00 vs $6.00, Intelligence Index 56 vs 39, cost per task $7.60 vs $1.04, first token 370.8 s vs 6.9 s, and context window 1,000,000 vs 500,000 tokens, with a footer reading Index, cost per task and latency per Artificial Analysis v4.3.2; prices per the vendors.

Grok 4 的廉价费率在何处不再廉价

$2.00 / $6.00 这一档是分层价格,而不是单一费率。在 SpaceXAI 自己的开发者文档中,该价格适用于最多 200,000 个输入 token,超过后则翻倍为 $4.00 输入和 $12.00 输出。Grok 4.5 的窗口是 500,000 个 token,因此它所宣传的窗口后半部分成本是前半部分的两倍。将仓库级提示词加载到 Grok 4.5 中,并不是一次 $6 输出的操作;而是一次 $12 输出的操作,而到那时,那个输出费率为“昂贵”的 $10 的模型,在任何也会输出大量 token 的请求上反而是更便宜的那个。

Claude Sonnet 5.5 没有对等的档位。每百万 token 2.00 美元 / 10.00 美元的费率在整个 1,000,000 token 的上下文窗口内保持不变,缓存读取按 0.20 美元计费——仅为输入费率的十分之一——正是这一点,让长上下文场景在实际应用中可行,而非只停留在纸面上。

窗口大小是这场论证的另一半,而它指向的方向完全相同。Grok 4.5 的窗口是 500,000 个 token,而且每一个都按公布的价格计费。Claude Sonnet 5.5 则有 1,000,000 个 token 可供使用,而真正让这一点变得关键的是工作负载的形态:一个需要推理的代码仓库、一份长长的智能体对话记录、一堆必须始终留在视野内的文档。天花板翻倍,却不在其一半处设什么档位分界;再加上缓存读取仅按输入价格的十分之一计费——正是这些,让在多次调用之间携带如此大量的上下文从一笔预算变成了一项细目支出。

实际上的分野并不微妙:

• 简短提示词搭配高密度输出——Grok 4.5 在速率上胜出,在 token 使用习惯上再次胜出

• 超过 200,000 输入令牌的提示词 — Grok 4.5 的费率翻倍,而 Claude Sonnet 5.5 的则不变

• 延迟敏感的交互式工作——在默认设置下,Grok 4.5 以大幅优势率先给出回答

• 长时程智能体运行——Claude Sonnet 5.5 的综合得分和 128K 输出上限,正是你为额外任务成本所换来的价值,而 300K Batches 上限则将其进一步扩展

迁移不是模型字符串。

任何从 Claude Sonnet 5 迁移到 Claude Sonnet 5.5 的人,都应在编写代码之前阅读 A​nthropic 的迁移说明,因为有五种行为发生了变化,而其中只有一种会在显而易见的地方大声失败。

• 非默认的 temperature、top_p 或 top_k现在会返回 400 —— 采样密集的流水线会直接停止工作,而不是降级运行

• thinking: {"type": "disabled"}返回 400,并且必须变为between_tools,且 effort 仅限为 low、medium 或 high;xhigh 和 max 会被拒绝

• 强制工具使用——tool_choice 为 "any" 或指定某个具名工具——会被直接拒绝,因此强制进行符合架构的调用的循环必须改为 auto,并配合严格工具使用或结构化输出

• 较旧的 computer_20251124计算机使用工具在 Claude API 和 Goo​gle Cloud 上被拒绝

• 思考块与生成它的模型和账户绑定,因此推理可以沿 Claude Sonnet 5 向后传递,但无法横向传递到其他模型家族——而且 advisor 工具不再接受 Claude Opus 4.8、Claude Opus 4.7 或 Claude Sonnet 5 作为 Sonnet 5.5 执行器背后的顾问。

还有第六项变更,它完全不会让任何东西失败,而这正是它危险的地方:工具调用之间的文本现在会在思考块内返回。一个把该文本流式传输给用户的应用程序,在工具调用之间会陷入沉默,直到它要么设置某个显示值,要么完全关闭前置思考。没有任何报错。输出只是不再出现。

Grok 4.5 完全不需要这些。它是一个 OpenAI 格式的模型,采样接口保持原样,而从 Grok 4.5 自己的前代模型迁移到它,只是改一下模型字符串。迁移成本完全落在 Claude 这一侧,而且这需要一整天的工作,而不是一个下午。

二者共用一份凭证,以及这一做法诚实的局限

在脑子里做两家供应商的对比很容易,真正动手跑起来,成本才藏在其中。OrcaRouter 把 200 多个模型放在一个兼容 OpenAI 的接口后面,按供应商标价透传、不加价,因此任何一方的价格变动当天就在这里生效,而不是等到下一次合同续签,同时还提供上游供应商之间的自动故障转移,以及用于编排调用的路由 DSL。整个 Grok 系列都以 SpaceXAI 自己的价格收录在目录中,Grok 4.5 可通过 grok/grok-4.5 路由调用,在其 50 万 token 的上下文窗口内,每百万 token 输入 $2.00、输出 $6.00。

Claude Sonnet 5.5 不在我们的目录中,本页面也不会暗示并非如此。如今要使用它,途径是 Anthropic 自家的 API,或者 Bedrock 和 Google Cloud——如果那就是你的基础设施所在之处。自 6 月 30 日起,Claude Sonnet 5 已可在此调用,价格为 Anthropic 的 2.00 美元和 10.00 美元,并且仍是大多数 Claude API 流量所运行的模型,这使它成为天然的故障转移目标——毕竟 Claude Sonnet 5.5 才刚问世一天,还没有任何人的生产环境证据。

所有这一切都有一个需要注意的地方,而且这个提醒并不小。上面 Grok 4.5 那一行是我们目录目前所复现的厂商宣传内容;该条目上的流量计数器显示过去七天为零,其吞吐量指标并未被实际测量,而首 token 时间则停留在仅被极少调用的模型往往会出现的 1 秒下限上。一个模型在这里近期没有流量,并不证明该模型不好——这一系列的调用量都流向了 4.6 和 4.7——但这确实意味着那一页上的运行数据很单薄,而真正值得信赖的延迟数字,是来自一条活跃路由的读数。

OrcaRouter model page for grok/grok-4.5, dated 2026-07-08, showing a 500K-token context window, text, image and file input, the pricing row of $2.00 input and $6.00 output per million tokens, a p50 time to first token of 1.00 s, a p95 of 4.0 s, and a traffic counter reading Collecting.

该选哪一个

Grok 4.5 是合适的模型:当提示词很短、答案很密集、集成已经兼容 OpenAI 时——并且当请求不会超过 200,000 个输入 token 时,因为一旦越过这条线,算账的规则就变了。当首个 token 必须在几秒而不是几分钟内到达时,它也是正确选择。它不是当前的 Grok 旗舰;Grok 4.6 和 Grok 4.7 以相同的标价位居其之上,而选择 4.5 而非这两者中的任何一个,理由必须具体。

当提示词极其庞大、任务的智能体化程度足以让十七个 Index 分和 128K 的输出上限为每任务高出七倍的成本提供充分理由,或者综合得分本身就是你所购买的东西时,Claude Sonnet 5.5 就是正确的模型。它的冗长是一项设计决策,而非缺陷;在做出承诺之前,这才是你应该用自己的流量去衡量的数字——因为每项 Index 任务 7.60 美元对 1.04 美元,只是一个只有你的工作负载才能得出的数字的代理指标。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新