
Claude Opus 5.5 对比 GPT-6 Astra:$6 的差距,以及 Astra 在 272K 以上收取的第二重价格
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
本月有两家厂商为各自的旗舰模型发布了基准测试表,每张表都显示自家模型胜出,而两张表里都没有任何一行是让这两个模型互相对垒的。Claude Opus 5.5于2026年9月22日发布,每百万输入词元4美元,与GPT-6 Astra于2026年9月3日发布、每百万输入词元10美元,二者之间恰好只有两项基准测试重叠——而且它们各胜一项:在Anthropic的表中,Opus 5.5赢下与AutomationBench相近的工作,而在OpenAI的表中则是由Astra赢下,并且Astra在科学推理上于两张表中都明显领先。这就是厂商材料能告诉你的全部。独立视角呈现的画面则没那么含糊,而且指向相反的方向,价格上的悬殊又比这两者更甚。
各方发布了什么
Anthropic 为 Opus 5.5 提供的表格使用的是其自有的测试框架和自有的 effort 设置,而在列出 Astra 的地方,那些数字是 Anthropic 自己给出的,并非重跑所得。请将整组数据视为厂商自报数据:
• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% 对 GPT-6 Astra 57.9%(Anthropic 指出,Opus 的那次运行使用了 xhigh 档投入)
• FrontierCode v1.1 — Claude Opus 5.5 54.4% 对比 GPT-6 Astra 53.3%
• GDPval-AA v2.1,知识工作 — Claude Opus 5.5 1,846 Elo 对比 GPT-6 Astra 1,542
• AutomationBench — Claude Opus 5.5 40.0% 对比 GPT-6 Astra 41.4%(Astra 领先)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58.7% 对比 GPT-6 Astra 64.6%(Astra 领先)
人类最后的考试,使用工具 — Claude Opus 5.5 67.7% 对比 GPT-6 Astra 57.2%
OpenAI 这一边更难对齐,因为 OpenAI 在发布 Astra 时,是拿它跟自己的前代模型比,而不是跟 Anthropic 的旗舰模型比;而且它选择的基准测试——计算机使用、前端工程、通用知识——大多根本没有出现在 Anthropic 的表格里。这并非不诚实,而是正常的发布行为,也正是为什么用两张厂商表格拼出来的比较,是两种选择之间的比较,而不是两个模型之间的比较。两张表格唯一都同意的一点是:Astra 在智能体科学和计算机使用方面很强,而且两个模型在编程上足够接近,以至于测试框架的选择都可能改变结果。
两家供应商均未选择的独立解读

Artificial Analysis 以同一个已发布的配置运行每个模型,因此其数值是这里唯一由同一评估者在相同条件下得出的:
• 智能指数 — Claude Opus 5.5 58,在 210 个模型中排名第 1;对比 GPT-6 Astra 53,排名第 6
• 配置标签 — Claude Opus 5.5“自适应推理、最大投入、默认回退”,GPT-6 Astra“max”
• 输出速度 — GPT-6 Astra 每秒 52.5 tokens,在同价位中处于较低水平;相比之下 Claude Opus 5.5 尚未发布
• 首 token 时间 —— GPT-6 Astra 为 352.15 秒,而榜单中位数为 3.83 秒;Claude Opus 5.5 尚未公布
• 价格 — Claude Opus 5.5 每百万 $4.00 输入 / $20.00 输出,对比 GPT-6 Astra $10.00 / $50.00
• 上下文与输出 — GPT-6 Astra 的 1M 上下文与 128K 最大输出,对比 Claude Opus 5.5 的 1M 和 128K
单看五点指数差距并不具有决定性,也不应被当作决定性差距来解读——两个模型落在同一能力档位,而这正是本季度“前沿”的含义。Astra 那几行数据真正确立的是:在两者共同出现的唯一榜单上,这笔溢价并没有换来能力上的领先。延迟那一行则是最不容回避的复杂之处:首个 token 耗时 352 秒,在本组中大幅最高,尽管它是在最大努力设置下测得的,而一个先思考再输出的推理模型用这个指标看总会显得很慢。52.5 tokens/秒 这个数字更具可迁移性,而对于一个定价 $10/$50 的模型来说,它偏低。
Astra 的第二档价格,高于 272,000 个 token

价目表正是这两者彻底失去可比性的地方,因为 Astra 的定价存在一个阶梯。标准费率为每百万 token 输入 $10.00、缓存输入 $1.00、缓存写入 $12.50、输出 $50.00。然而一旦输入 token 超过 272,000,整个请求都会重新计价——不是超出部分,而是整次调用——输入和缓存费率变为 2 倍,输出费率变为 1.5 倍。这样一来,长上下文任务的价格大约为每百万 token 输入 $20、输出 $75。
Claude Opus 5.5 并非如此。Anthropic 在标准定价下对完整的 100 万 token 窗口收取 4.00 美元和 20.00 美元,并明确表示,一个 90 万 token 的请求与一个 9K token 的请求按相同的每 token 费率计费。因此,这两者之间表面上的比率——Astra 在输入和输出两个方向上的成本都是 Opus 5.5 的 2.5 倍——并不适用于这两款模型实际销售所面向的工作负载。在一个承载大量工作上下文的长期运行智能体上,对比是 $20/$75 对 $4/$20,即输入上是五倍,输出上接近四倍。批量定价只会使其雪上加霜,而不是解决问题:Opus 5.5 降至一半,为 $2.00/$10.00,而 Astra 的 flex 层级则减半至 $5.00/$25.00,而这一基数在长上下文情况下已经是五倍之高。
这是整场对比中唯一最具决策相关性的不对称之处,而它在两家公司发布的任何一张发布表格里都看不见,因为两家厂商引用的都是主打的费率。如果你的提示词在 272K token 以下,可以忽略这一点。如果你正在构建一个需要读取代码仓库或文档集的 agent,那么在对比任何东西之前,先按 $20/$75 来算价。
无障碍访问是规范的一部分
Astra 是 OpenAI 首个在其自身的 Preparedness Framework 下跨过 Critical 网络安全能力阈值的模型,而此次发布体现的是这一分类,而非容量。访问权限首先向一组有限的组织开放,企业访问需要管理员先开启开关,用户才能看到它,并且发布的模型会直接拒绝某些类别的工作。Claude Opus 5.5 则从另一个方向带来了同一问题的某种版本:它随附了 Anthropic 此前专为 Claude Fable 5.1 保留的防护层级,这意味着大多数网络安全请求会被重新路由至 Claude Opus 4.8,而生物学工作则会回退到 Claude Opus 5,除非账户经过验证。
这两种行为都会出现在同一个地方,也就是你的评估里。Artificial Analysis 之所以把 Opus 5.5 的配置标注为“Default Fallback”,正是因为请求可能落到一个并非你所指定名称的模型上,而在安全或生命科学领域的提示词上,这种情况是家常便饭。如果你的工作负载正属于这些领域,那么请求中的模型字符串并不能保证实际作答的就是那个模型,你的质量指标会在未知比例的调用中把更小的模型也计算在内。两家厂商都没有隐瞒这一点——双方都有文档说明——但两家的宣传标题里同样都没提到它。
在两者之间选择
这场对比实际提出的问题在于:长上下文工作负载是否值得为 Astra 的阶梯定价买单;而对大多数团队而言,答案会是否定的:在低于 272K 的每一档上,Opus 5.5 都更便宜,超过该阈值后更是便宜得多;在唯一一个独立榜单上得分更高;并且无需额外收费即可达到 100 万 token 的上下文。Astra 的适用场景更窄,但确实存在——科学推理、计算机操作,以及 OpenAI 生态的工具链——如果你的评估显示它在这些方面领先,那么这笔溢价就是一项正常的费用支出,而非错误。
这一点的实际意义在于你如何让两者相互较量,因为公平的比较需要两个模型使用同一个密钥、同一份账单。两者都可以通过 OrcaRouter 按提供商标价路由,加价 0%——Claude Opus 5.5 在 Anthropic 的价格为 $4.00/$20.00,GPT-6 Astra 为 $10.00/$50.00——这意味着 272K 的决策可以在你自己的流量上测试,而不是凭两份新闻稿来争论。把 Astra 固定到它胜出的任务类别,并让自动故障转移承接其余部分,这就是一条路由规则;而跨越 272K 分界的请求可以被送往更便宜的路径,无需修改代码,因为规则存在于路由器中,而不是在你的应用程序里。

什么会改变答案
有一件事可以做到:在共享基准上以相同投入水平进行受控的正面对比。两家厂商都没有公布过这样的结果,也都没有动机这么做,这使得独立指数成为唯一可用的同条件对比——而该指数显示,Opus 5.5 比 Astra 高出五分、五个名次,token 价格却不到一半。值得关注的反对论点是,两个模型都是在最高投入水平下评分的,而 Opus 5.5 出厂默认是中等投入;如果 Astra 在长周期科研任务上的优势在同投入水平测试中依然成立,那么支持溢价的理由会变得更强,而不是更弱。在有人做这项测试之前,站得住脚的立场是:Astra 是一个按通才定价的专才,而 Opus 5.5 则是碰巧得分更高的通才。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
