一张为 Claude Opus 5.5 与 GPT-6 Astra 对决生成的标题卡,副标题为“六美元的差距,以及超过 272,000 个 token 后的附加费”,配有一个扁平风格的天平图标,页脚一行写着“指数依据 Artificial Analysis 在最大努力下的数据;价格依据各供应商。”右下角合成了真正的 OrcaRouter 标志。
Guides & Insights

Claude Opus 5.5 对比 GPT-6 Astra:$6 的差距,以及 Astra 在 272K 以上收取的第二重价格

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

本月有两家厂商为各自的旗舰模型发布了基准测试表,每张表都显示自家模型胜出,而两张表里都没有任何一行是让这两个模型互相对垒的。Claude Opus 5.5于2026年9月22日发布,每百万输入词元4美元,与GPT-6 Astra于2026年9月3日发布、每百万输入词元10美元,二者之间恰好只有两项基准测试重叠——而且它们各胜一项:在Ant​hropic的表中,Opus 5.5赢下与AutomationBench相近的工作,而在Open​AI的表中则是由Astra赢下,并且Astra在科学推理上于两张表中都明显领先。这就是厂商材料能告诉你的全部。独立视角呈现的画面则没那么含糊,而且指向相反的方向,价格上的悬殊又比这两者更甚。

各方发布了什么

Anthropic 为 Opus 5.5 提供的表格使用的是其自有的测试框架和自有的 effort 设置,而在列出 Astra 的地方,那些数字是 Anthropic 自己给出的,并非重跑所得。请将整组数据视为厂商自报数据:

• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 对 GPT-6 Astra 57.9%(Anthropic 指出,Opus 的那次运行使用了 xhigh 档投入)

• FrontierCode v1.1 — Claude Opus 5.5 54.4% 对比 GPT-6 Astra 53.3%

• GDPval-AA v2.1,知识工作 — Claude Opus 5.5 1,846 Elo 对比 GPT-6 Astra 1,542

• AutomationBench — Claude Opus 5.5 40.0% 对比 GPT-6 Astra 41.4%(Astra 领先)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58.7% 对比 GPT-6 Astra 64.6%(Astra 领先)

人类最后的考试,使用工具 — Claude Opus 5.5 67.7% 对比 GPT-6 Astra 57.2%

OpenAI 这一边更难对齐,因为 OpenAI 在发布 Astra 时,是拿它跟自己的前代模型比,而不是跟 Anthropic 的旗舰模型比;而且它选择的基准测试——计算机使用、前端工程、通用知识——大多根本没有出现在 Anthropic 的表格里。这并非不诚实,而是正常的发布行为,也正是为什么用两张厂商表格拼出来的比较,是两种选择之间的比较,而不是两个模型之间的比较。两张表格唯一都同意的一点是:Astra 在智能体科学和计算机使用方面很强,而且两个模型在编程上足够接近,以至于测试框架的选择都可能改变结果。

两家供应商均未选择的独立解读

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis 以同一个已发布的配置运行每个模型,因此其数值是这里唯一由同一评估者在相同条件下得出的:

• 智能指数 — Claude Opus 5.5 58,在 210 个模型中排名第 1;对比 GPT-6 Astra 53,排名第 6

• 配置标签 — Claude Opus 5.5“自适应推理、最大投入、默认回退”,GPT-6 Astra“max”

• 输出速度 — GPT-6 Astra 每秒 52.5 tokens,在同价位中处于较低水平;相比之下 Claude Opus 5.5 尚未发布

• 首 token 时间 —— GPT-6 Astra 为 352.15 秒,而榜单中位数为 3.83 秒;Claude Opus 5.5 尚未公布

• 价格 — Claude Opus 5.5 每百万 $4.00 输入 / $20.00 输出,对比 GPT-6 Astra $10.00 / $50.00

• 上下文与输出 — GPT-6 Astra 的 1M 上下文与 128K 最大输出,对比 Claude Opus 5.5 的 1M 和 128K

单看五点指数差距并不具有决定性,也不应被当作决定性差距来解读——两个模型落在同一能力档位,而这正是本季度“前沿”的含义。Astra 那几行数据真正确立的是:在两者共同出现的唯一榜单上,这笔溢价并没有换来能力上的领先。延迟那一行则是最不容回避的复杂之处:首个 token 耗时 352 秒,在本组中大幅最高,尽管它是在最大努力设置下测得的,而一个先思考再输出的推理模型用这个指标看总会显得很慢。52.5 tokens/秒 这个数字更具可迁移性,而对于一个定价 $10/$50 的模型来说,它偏低。

Astra 的第二档价格,高于 272,000 个 token

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

价目表正是这两者彻底失去可比性的地方,因为 Astra 的定价存在一个阶梯。标准费率为每百万 token 输入 $10.00、缓存输入 $1.00、缓存写入 $12.50、输出 $50.00。然而一旦输入 token 超过 272,000,整个请求都会重新计价——不是超出部分,而是整次调用——输入和缓存费率变为 2 倍,输出费率变为 1.5 倍。这样一来,长上下文任务的价格大约为每百万 token 输入 $20、输出 $75。

Claude Opus 5.5 并非如此。Anthropic 在标准定价下对完整的 100 万 token 窗口收取 4.00 美元和 20.00 美元,并明确表示,一个 90 万 token 的请求与一个 9K token 的请求按相同的每 token 费率计费。因此,这两者之间表面上的比率——Astra 在输入和输出两个方向上的成本都是 Opus 5.5 的 2.5 倍——并不适用于这两款模型实际销售所面向的工作负载。在一个承载大量工作上下文的长期运行智能体上,对比是 $20/$75 对 $4/$20,即输入上是五倍,输出上接近四倍。批量定价只会使其雪上加霜,而不是解决问题:Opus 5.5 降至一半,为 $2.00/$10.00,而 Astra 的 flex 层级则减半至 $5.00/$25.00,而这一基数在长上下文情况下已经是五倍之高。

这是整场对比中唯一最具决策相关性的不对称之处,而它在两家公司发布的任何一张发布表格里都看不见,因为两家厂商引用的都是主打的费率。如果你的提示词在 272K token 以下,可以忽略这一点。如果你正在构建一个需要读取代码仓库或文档集的 agent,那么在对比任何东西之前,先按 $20/$75 来算价。

无障碍访问是规范的一部分

Astra 是 OpenAI 首个在其自身的 Preparedness Framework 下跨过 Critical 网络安全能力阈值的模型,而此次发布体现的是这一分类,而非容量。访问权限首先向一组有限的组织开放,企业访问需要管理员先开启开关,用户才能看到它,并且发布的模型会直接拒绝某些类别的工作。Claude Opus 5.5 则从另一个方向带来了同一问题的某种版本:它随附了 Anthropic 此前专为 Claude Fable 5.1 保留的防护层级,这意味着大多数网络安全请求会被重新路由至 Claude Opus 4.8,而生物学工作则会回退到 Claude Opus 5,除非账户经过验证。

这两种行为都会出现在同一个地方,也就是你的评估里。Artificial Analysis 之所以把 Opus 5.5 的配置标注为“Default Fallback”,正是因为请求可能落到一个并非你所指定名称的模型上,而在安全或生命科学领域的提示词上,这种情况是家常便饭。如果你的工作负载正属于这些领域,那么请求中的模型字符串并不能保证实际作答的就是那个模型,你的质量指标会在未知比例的调用中把更小的模型也计算在内。两家厂商都没有隐瞒这一点——双方都有文档说明——但两家的宣传标题里同样都没提到它。

在两者之间选择

这场对比实际提出的问题在于:长上下文工作负载是否值得为 Astra 的阶梯定价买单;而对大多数团队而言,答案会是否定的:在低于 272K 的每一档上,Opus 5.5 都更便宜,超过该阈值后更是便宜得多;在唯一一个独立榜单上得分更高;并且无需额外收费即可达到 100 万 token 的上下文。Astra 的适用场景更窄,但确实存在——科学推理、计算机操作,以及 OpenAI 生态的工具链——如果你的评估显示它在这些方面领先,那么这笔溢价就是一项正常的费用支出,而非错误。

这一点的实际意义在于你如何让两者相互较量,因为公平的比较需要两个模型使用同一个密钥、同一份账单。两者都可以通过 OrcaRouter 按提供商标价路由,加价 0%——Claude Opus 5.5 在 Anthropic 的价格为 $4.00/$20.00,GPT-6 Astra 为 $10.00/$50.00——这意味着 272K 的决策可以在你自己的流量上测试,而不是凭两份新闻稿来争论。把 Astra 固定到它胜出的任务类别,并让自动故障转移承接其余部分,这就是一条路由规则;而跨越 272K 分界的请求可以被送往更便宜的路径,无需修改代码,因为规则存在于路由器中,而不是在你的应用程序里。

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

什么会改变答案

有一件事可以做到:在共享基准上以相同投入水平进行受控的正面对比。两家厂商都没有公布过这样的结果,也都没有动机这么做,这使得独立指数成为唯一可用的同条件对比——而该指数显示,Opus 5.5 比 Astra 高出五分、五个名次,token 价格却不到一半。值得关注的反对论点是,两个模型都是在最高投入水平下评分的,而 Opus 5.5 出厂默认是中等投入;如果 Astra 在长周期科研任务上的优势在同投入水平测试中依然成立,那么支持溢价的理由会变得更强,而不是更弱。在有人做这项测试之前,站得住脚的立场是:Astra 是一个按通才定价的专才,而 Opus 5.5 则是碰巧得分更高的通才。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新