主视觉标题卡,文字为“Claude Opus 5.5 vs GPT-6 Astra”,副标题为“一场跑赢基准的品味测试”,上方眉题为“前沿旗舰对比——2026年9月”,三个徽章分别为“品味:不在任何基准维度上”“研究型工作负载:Astra 稳守”和“价格:每 100 万 4.00 美元 / 20.00 美元 对比 10.00 美元 / 50.00 美元”,页脚一行文字为“厂商发布表格与独立运行结果在领先幅度上存在分歧。”,右下角为 OrcaRouter 标志。
Guides & Insights

Claude Opus 5.5 对决 GPT-6 Astra:一场跑赢基准测试的尝鲜测评

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

有人问 Claude Opus 5.5,能不能做一段短视频,讲某个竞争对手实验室解出了纳维-斯托克斯方程。他们发布了结果,然后写下了那句让这番比较值得一做的话:这个模型"非常讨人喜欢","品味极佳",而且它是自 Opus 4.7 以来第一个他们真正想重度使用的 Claude——但他们仍然把 GPT-6 AstraGPT-5.6 Sol 留作主力,因为他们的工作以研究为主。一条帖子里就有三个论断,而它们指向的方向各不相同。一个模型可以是与你共事时最令人愉快的那个,却依然不是你会把生产流量导向的那个。真正有意思的问题不是哪个模型更好,而是这两种判断之中,哪一个经得起数字的检验,哪一个到头来只是一种品味之谈。

这篇帖子是一位实践者的报告,而不是一次基准测试运行——把它当作一个信号,用来了解模型在创意和开放式工作中给人的感觉,而不是当作关于能力的证据。下文所有数值都标注了由谁产出。

味觉测试能告诉你什么,不能告诉你什么

这里重要的是成品。围绕一个数学结果制作视频,并不是一项带有通过/不通过关卡的编程任务。没有编译步骤,没有测试套件,也没有 Terminal-Bench 测试框架来给这个东西到底好不好打分。模型必须选择一个角度,决定要展示什么,保持内容连贯,然后停下来。当一位从业者说一个模型有“出色的品味”时,他们描述的就是这一点:对范围与侧重点的判断,而这种判断会体现在规格被刻意留得模糊的工作中。

那是一种真实的能力,而基准测试套件最不擅长衡量的正是这种能力。这也是为什么同一个人可以称赞某个模型,却不转而使用它。探索时,你想要的是品味。而当你有 200,000 行代码需要审查、还有一笔账单需要证明其合理性时,你想要的就不是它了。

Anthropic 自己的发布说辞以文字而非视频的形式,指向了同一种能力:Claude Opus 5.5 被宣传为写东西不那么“Claude 腔”——少一些清嗓子的铺垫,少一些模棱两可,更愿意先把观点亮出来。独立可读性评分支持这一说法的方向,即便在幅度上存在分歧。厂商还报告称,一项内部事实核查测试在 18 次尝试中通过了 16 次,而 Claude Fable 5.1Claude Opus 5 均为 18 次中零通过;这个数字来自 Anthropic 自己,未经复现,应被视为一种主张,而非一项结果。

两个记分牌,一个要紧的分歧

A two-column scoreboard titled "Claude Opus 5.5 vs GPT-6 Astra - the scoreboard". The Claude Opus 5.5 column reads: Released Sep 22 2026, Price per 1M $4.00 / $20.00, Terminal-Bench 4.0 66.4% vendor and 59.6% independent, Terminal-Bench-Science 0.1 58.7%, GDPval-AA v2.1 1,846 Elo, Tokens per problem about 119,000. The GPT-6 Astra column reads: Released Sep 3 2026, Price per 1M $10.00 / $50.00, Terminal-Bench 4.0 57.9%, Terminal-Bench-Science 0.1 64.6%, GDPval-AA v2.1 1,542 Elo, Tokens per problem about 27,000. A footer reads "Opus 5.5 figures per Anthropic unless noted; Astra and independent figures per Artificial Analysis."

在已发布的原始基准测试中,Claude Opus 5.5 领先 GPT-6 Astra 的情况多于落后。问题在于,被引用最多的两个来源对其领先幅度说法不一。

Anthropic 的发布表格显示,Claude Opus 5.5 在 Terminal-Bench 4.0 上达到 66.4%,GPT-6 Astra 为 57.9%,Claude Fable 5.1 为 55.8%。这是在智能体编程方面由厂商报告的 8.5 个百分点领先——这种优势幅度足以在营销演示中终结争论。Artificial Analysis 用自己的测试框架测得,Claude Opus 5.5 在同一基准上为 59.6%:与 xhigh effort 设置下的 GPT-6 Astra 持平,并比 Claude Opus 5 高出约 11 个百分点。两种读数中,领先都是真实的。幅度则不然。

两个模型互换位置之处,比它们没有互换位置之处更有用:

• Terminal-Bench 4.0(智能体编程)—— 按 Anthropic 自家表格,Claude Opus 5.5 为 66.4%,按 Artificial Analysis 为 59.6%;GPT-6 Astra 为 57.9%。

• 人类最后的考试,配备工具使用——Claude Opus 5.5 厂商报告为 67.7%,独立测得 61.4%;GPT-6 Astra 为 57.2%。

• GDPval-AA v2.1(涵盖44种职业的真实世界知识工作)——Claude Opus 5.5 1,846 Elo;GPT-6 Astra 1,542 Elo。这两个数字均来自 Artificial Analysis 的独立榜单,而非厂商。

• Terminal-Bench-Science 0.1 — GPT-6 Astra 64.6% 对 Claude Opus 5.5 58.7%。这是 Astra 的一次干净利落的胜利,而且它是一项带有科学风格的智能体基准测试。

• AutomationBench —— GPT-6 Astra 41.4% 对 Claude Opus 5.5 40.0%。差距虽小,但又是 Astra 领先。

• FrontierCode v1.1 — Claude Opus 5.5 为 54.4%,对比 GPT-6 Astra 的 53.3%。差距不到一个百分点。

按从业者的方式去读那份榜单。研究密集型的工作负载——那些带有科学或文献成分、运行长时间工具调用循环并需要模型稳住阵脚的负载——正是 GPT-6 Astra 能守住阵地的地方。而 Claude Opus 5.5 遥遥领先的知识工作与编程榜单,如果你的工作是交付软件,那才是你会指向的榜单。这场对话中的两个人都正确地解读了各自的基准。他们只是在读不同的基准。

effort 设置干的活比模型还多。

还有一个不那么光彩的原因,说明整体利润率为何疲软。供应商之间的比较并非在相同设置下进行。

Claude Opus 5.5 公布的数据来自“超高”(xhigh)推理努力程度配置,而 GPT-6 Astra 则是在“高”档下测得的。Artificial Analysis 的独立测试将两个模型都设为 xhigh,编程能力差距随之消失——厂商宣称的 8.5 分领先变成了一场平局。这并不是在指控谁有不当行为;这只是当厂商挑选最能展现自家模型实力的配置、而独立实验室挑选与竞争对手相匹配的配置时,必然会发生的事。在仅凭一张基准测试表格就迁移工作负载之前,先查清楚它是在哪一档努力程度上跑的,因为答案往往是“最讨好的那一档”。

Token 账单从另一个角度讲述了同样的故事。Anthropic 自己的发布材料显示,Claude Opus 5.5 每个问题要花费大约 119,000 个 token,其中约 84,000 个用于思考,而 GPT-6 Astra 解决同类问题大约只需 27,000 个 token。思考 token 按输出 token 计费。一个模型使用的 token 是四倍,而输出价格只有五分之一,这几乎打成平手——而这还没有计入一个事实:更便宜的那个模型,往往本来就是你会愿意以更高 effort 设置来运行的那个。

还有一个额外的注意事项专门针对 Claude Opus 5.5 这一侧:Anthropic 的防护路由可能会把一些与网络和生物相关的请求交给更严格的路径处理,这会拉低那些评测中公布的分数,相对于底层模型本身会产生的分数而言。如果你的工作涉及这些领域,基准测试与你实际体验之间的差距将是真实存在的,而且方向会是基准测试偏乐观。

一个真实任务在每个上的成本是多少

Screenshot of Anthropic's Claude Platform release notes page, with "September 22, 2026" selected in the sidebar. The entry announces the launch of Claude Opus 5.5 (claude-opus-5-5) with a 1M token context window by default, 128k max output tokens and always-on adaptive thinking, at $4 / $20 USD per MTok against Claude Opus 5 at $5 / $25, and notes that thinking cannot be disabled, that depth is controlled through the effort parameter, and that Fast mode is available as a research preview.

Claude Opus 5.5是价目表上更便宜的型号,而且差距还不小:

• Claude Opus 5.5 — 每百万输入词元 $4.00,每百万输出词元 $20.00,每百万缓存输入词元 $0.20,每百万缓存写入词元 $5.00。1M 词元上下文,最大输出 128k。

• GPT-6 Astra — 每百万输入 $10.00,每百万输出 $50.00,每百万缓存输入 $1.00,每百万缓存写入 $12.50。单个请求中超过 272,000 个输入 token 后,整个请求会重新计价为 $20.00 输入和 $100.00 输出;批量层级为 $5.00/$25.00。

Claude Opus 5.5 在输入上便宜 2.5 倍,在输出上也便宜 2.5 倍,缓存输入则便宜 5 倍。如果你的任务在 token 用量上相近,那这就是决策的全部,品味问题不过是装饰。

上文关于 token 用量的提醒,正是让它无法那么简单的原因,而 GPT-6 Astra 的长上下文重新定价则是另一个陷阱。一旦单个请求的输入 token 超过 272,000,整个请求——而不只是超出部分——都会转为长上下文费率。把大型语料塞进单次调用的研究型工作负载,正是会触发这一点的典型形态。半价批处理是合法的脱身之法,但它位于较慢的队列。

诚实的总结是:成本格局会因你所做的事而反转。对于两个模型使用量级相当的 token 的任务,Claude Opus 5.5 在价格上以很大优势胜出。而对于漫长的智能体式研究循环,token 数量会像 Anthropic 自己的发布材料所展示的那样出现分化,两者则会趋同——这远不如“成本降低 40%”那样令人兴奋,也更接近那位从业者所报告的情况。

为什么重度调研用户没有转化

把各条线索拼在一起,{{1}}“仍然更偏爱Astra”{{/1}}这句话就不再与{{2}}“味道很棒”{{/2}}相矛盾。那是从不同位置得出的同一个观察。

用户提到的那些工作负载耗时很长、开放性强、需要使用工具,而且每次运行成本高昂。在这些任务上,GPT-6 Astra 占据科学和自动化榜单,只消耗一小部分思考 token,并且——根据独立测量——当两个模型以相同的投入运行时,它在编码上不相上下。Claude Opus 5.5 的优势集中在那些你能看到输出并加以评判的工作上:散文写作、设计选择、为模糊的简报划定范围、决定一个关于 Navier-Stokes 的视频究竟应该展示什么。那就是品味,而品味恰恰是不会出现在基准测试坐标轴上的那部分。

如果你原本希望得到一个某款模型胜出的裁决,证据并不支持这一点。站得住脚的版本要更狭窄:Claude Opus 5.5 是更适合判断力成为瓶颈的那类工作的模型,GPT-6 Astra 是更适合持续的长上下文投入成为瓶颈的那类工作的模型,而在第二类工作上,两者之间的价格差距缩小到几乎可以忽略不计。这是一个路由决策,而不是一次转换。

在不进行迁移的情况下同时运行两者

Screenshot of the OrcaRouter models catalogue filtered by the query "astra", showing one result card: OpenAI GPT-6 Astra, model id openai/gpt-6-astra, described as OpenAI's flagship model for demanding long-horizon end-to-end work, with a 1M context window and a per-1M-token base rate of $10.00 input, $50.00 output, $1.00 cache read and $12.50 cache write.

这正是两个模型不再是非此即彼的地方。 GPT-6 Astra 现已在 OrcaRouter 上线,价格与 OpenAI 自己的标价一致——输入 $10.00、输出 $50.00、缓存读取 $1.00、缓存写入 $12.50——并且加价 0%,供应商标价原样传导。这意味着供应商的价格变动当天就会落到我们这边,而不是等某个经销商什么时候同步。

Claude Opus 5.5 可以通过 Anthropic 自家的 API 以及若干第三方平台访问;我们并未把它列为我们所提供的东西,在该模型完成铺开传播之前,若有人声称并非如此,你应当保持怀疑。如今你能做的是,把两个模型都置于同一个密钥、同一种端点形态之后,并按工作负载而非个人偏好来路由:把开放式、需要大量判断的请求交给 Claude Opus 5.5,把长时间的研究循环交给 GPT-6 Astra,而无需维护两份合同或两套客户端集成。

自动故障转移正是让这种测试变得安全的原因。新模型尚未成为一条生产路径,而只经由单一端点路由意味着,一旦提供商出现故障或触发速率限制,请求会被转移,而不是直接失败。如果你想弄清这种品味差距在你自己的工作中是否真实存在,这就是成本最低的验证方式——把它与你现有的方案并行运行,而不是取而代之,让你自己的测试套件来做判断,而不是依赖发布时的排行榜。

基准测试无法回答的问题

有两件事值得关注,而这两件事都不是又一个基准测试分数。

第一个问题是,投入程度的这种不对称性是否会得到解决。目前,一个在 xhigh 档位运行的厂商模型对阵 high 档位的竞争对手时,能产生 8.5 个百分点的领先优势,而在匹配设置下的独立测试则把这一优势变成了平局。随着独立实验室在 GPT-6 Astra 目前领先的科学与自动化榜单上发布匹配设置的运行结果,这一局面可能朝任一方向变化——而且它将依据证据而变化,而非依据任何人的说法。

第二点是 token 效率问题。如果 Claude Opus 5.5 的思考开销在某个小版本发布中降下来,它 2.5 倍的价目表优势就不再被抵消,价格论据就会彻底胜出。如果没有,那么一直把 GPT-6 Astra 作为主力工具的从业者并没有落后于新闻周期。他们正确解读了自己的工作负载,而发布表格根本没有衡量这一点。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新