
Claude Opus 5.5 以 0.84 分的优势登顶 Epoch Capabilities Index
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
这个数字是 0.84。Claude Opus 5.5在我们于 2026 年 10 月 2 日读取的那份文件中,以 167.35 分位列 Epoch Capabilities Index,GPT-6 Astra则为 166.51——在这个尺度上,两个模型已公布的 95% 区间几乎完全重叠,Opus 5.5 是 164.0 至 172.0,Astra 是 163.14 至 171.05,而二者的差距还不到一个点。在它们之下,Claude Sonnet 5.5拿到 165.2 分,Claude Fable 5.1拿到 164.82 分,于是在一个由五十多个基准测试构成的独立综合榜单上,排名前四的条目之间仅相差 2.53 分,而其中三个都挂着同一家厂商的名字。这个排序是真实的——从点估计值确实依次排列这个意义上说。它又是不真实的——因为 0.84 分的领先幅度扛不住它自身的误差棒,而关于这份排行榜所有值得说的话,都源自同时握住这两个事实。
指数是什么,0.84个点又是什么
Epoch Capabilities Index 并非厂商排行榜。它由独立研究机构 Epoch AI 构建,是一个复合指标,将来自五十多个不同基准测试的分数拼接成一个通用能力量表,并通过那些恰好同时出现在多个基准测试上的模型,推断每个基准测试的相对难度。该方法在一篇与 Google DeepMind 的 AGI 安全与对齐团队的研究人员共同撰写、由 DeepMind 资助的论文中阐述,但 Epoch 明确表示,该指数是其自有产品,且它对其拥有全部权利——当资助方与评分发布方并非同一方时,这一区分值得保留。代码是公开的。
这个量表的两个特性比标题数字更重要。第一点是,ECI 刻意采用锚定而非绝对值:原始分数经过重新缩放,使 Claude 3.5 Sonnet 落在 130,GPT-5 落在 150,这意味着该指数上的某个数字只有与同一份文件中的另一个数字并列时才有意义,单独来看则毫无意义。第二点是,该指数没有上限。并不存在一个趋近于 100 的天花板,因此"指数最高位"陈述的是某个日期,而非任何人已经达到的极限。
这就是为什么,对 167.35 与 166.51 的诚实解读并不是“Claude Opus 5.5 是全世界能力最强的模型”。这种解读更狭窄,也更不适合拿来引用:根据 Epoch 对 2026 年 10 月 2 日可获得证据的建模,这两个模型在最顶端难分伯仲,它们之间的排序是一种打破平局的手段,而非一次测量。公布的区间直接说明了这一点——164.0 至 172.0 与 163.14 至 171.05 的范围绝大部分相互重叠。任何把 0.84 当作定论来引用的人,引用的都是舍入造成的假象。
Anthropic 板块,以及一次发布的规模
这张表格中信息量更大的特征并不是谁排在第一位,而是第三行和第四行。9月28日发布、得分165.2的Claude Sonnet 5.5,比9月1日发布、得分164.82的Claude Fable 5.1高出0.38分——差距小到两者在实践中处于同一位置,也小到这一对仅仅比榜首低2.15分。Sonnet是Anthropic产品线中的中端产品,而Fable则是该公司历来用于指向通用推理工作的模型;如今两者都从紧贴前沿的下方将其夹住,这才是本次更新中的实质性变化,其意义超过了领先者究竟是谁。
Anthropic 自身的代际跨越也清晰可见。Claude Opus 5.5 是 Claude Opus 5 的后继者,Epoch 为后者评出 162.94 分,区间为 160.2 至 166.7。这意味着在大约两个月内提升了 4.41 分——从 7 月 24 日发布到 9 月 22 日发布——这一提升幅度比今日第一名与第二名之间相差的 0.84 分还要大。这样来看,这张表中真正有意思的量,是单一厂商曲线内部的斜率,而不是榜首两家之间的差距。
开放权重的界线在哪里
Epoch 按可及性对模型进行划分,这让开放权重边界一目了然,无需靠猜。最佳的开放权重条目是 Kimi K3,得分 157.61,日期为 7 月 16 日,并标注为非商业。紧随其后的是 DeepSeek V4 Pro 0813,得分 155.38,以及 DeepSeek V4.1 Flash,得分 155.0,两者均无限制,然后是 GLM-5.3-Flash,得分 151.94,以及 GLM-5.2,得分 151.78。因此,距离榜首最近的开放模型落后 9.74 分——这一差距比第一名与第二名之间的差距宽十八倍,且宽到两者的区间根本谈不上接近。
这种不对称是表中唯一持久的发现。封闭前沿内部只是三个点之间的混战;而从封闭前沿到最佳可下载权重之间的距离要大一个数量级。一个能让你跨基准世代进行比较的复合指数,正是用来注意到这一点的工具,因为它能在七月和九月说出同样的话,而不是报告一个饱和的基准已经沉寂下来。
附近的一些行值得固定下来作为背景,因为它们才是读者实际拿来与 Opus 5.5 比较的模型:
• Claude Sonnet 5 — 156.34,发布于6月30日,区间 153.61 至 158.81
• Grok 4.6 — 156.61,8月12日发布,区间 154.66 至 158.93
• Gemini 3.8 Flash — 156.93,9月2日发布,区间 154.64 至 160.42
• Muse Spark 1.3 — 156.86,发布于9月2日,区间为154.73至159.56
• GPT-5.6 — 161.8,7月9日发布,区间 159.26 至 165.26
指数头寸不是账单

在这里,排行榜不再能说明全部问题,因为这两个模型的花费完全不在同一水平。在我们的目录中,我们按提供商的标价提供,不加任何加价,Claude Opus 5.5 的价格为 $4.00/$20.00,缓存读取为 $0.20,而 GPT-6 Astra 为 $10.00/$50.00,缓存读取为 $1.00,两者在价目表的输入和输出两个方向上都相差 2.5 倍。Astra 在提示词超过 272,000 个 token 后还会进一步提价,输入升至 $20.00,输出升至 $75.00;而 Opus 5.5 在其完整的 1M token 窗口内始终保持 $4.00/$20.00 不变。两者的输出 token 上限均为 128,000。
算一笔长上下文工作负载实际会产生的账——一个由缓存提供的 180,000 token 前缀,生成 5,000 个 token。在 Opus 5.5 上,这是 180,000 个 token 按每百万 $0.20 计,约 3.6 美分,再加上 5,000 个 token 按每百万 $20 计,即 10 美分:大约 13.6 美分。在 GPT-6 Astra 上,则是 180,000 个按 $1.00 计,即 18 美分,加上 5,000 个按 $50 计,即 25 美分:大约 43 美分。0.84 个百分点的优势与 3.2 倍的成本差距并非同一类事实,而一个只权衡前者的采购决策,权衡的是那个更小的数字。
Fable 5.1 从同一家厂商价目卡的另一侧说明了这一点:它定价为 $10.00/$50.00,与 Astra 完全相同,却只拿到 164.82 分——同样的价钱,比 Opus 5.5 低 2.53 分。该指数把 Anthropic 的三款前沿模型放在彼此相差 2.53 分的区间内,而其价目表却把它们拉开 2.5 倍的差距;对于买家面前的选择而言,这种描述远比任何单一排名都更贴切。
如果你要争论一个数字,那就用你自己的流量来争论。

这个指数之所以还值得一读,是因为它是由厂商之外的某个人测量的——但综合指数自身的结构却设定了争论的规则。Epoch 的校准、其难度估计,以及其处理跳过基准测试的模型的方式,都处在表中数字的上游,而其中没有一项是读者能从截图中重新推导出来的。每个厂商的招牌基准测试也是如此,因此有用的做法不是在它们之间选边站,而是在你控制的流量上比较它们。
这两个模型都可以通过 OrcaRouter 上的同一个 API 密钥访问,而 OrcaRouter 按 0% 加价透传供应商的目录价:Claude Opus 5.5 为 $4.00/$20.00,缓存读取 $0.20,GPT-6 Astra 为 $10.00/$50.00,其超过 272K 的档位完全按供应商设定的方式计费。把同一组提示词同时发给两者,只是改一下配置,而不是再签一份合同;而且在两者都有路由的情况下,自动故障转移就在底层兜底,这对于一个如此贴近噪声底线的决策来说很重要。排行榜能告诉你这两个模型难以区分。只有你自己的评测才能告诉你,在你的工作上哪一个才是难以区分的。

下个月什么会推动这个数字
Epoch 的这份档案是活的,有三件事会迅速改变解读。第一是任何落进前四名的新前沿模型评估,因为当集群如此紧密时,单个额外的基准观测对综合评分的影响,要比存在明确领先者时更大。第二是置信区间的漂移——最新的条目拥有最宽的区间,因为它们是在最少的重叠基准上被评估的,因此 9 月发布的条目是最可能变动的行,7 月的最不可能。第三是某个基准达到饱和,这正是该指数被构建来挺过的特定失效情形:当某个组成部分不再具有区分度时,Epoch 会重新加权其构成,而不是让某个模型的优势随测试一同蒸发。
目前,站得住脚的总结是狭义的那一个。Claude Opus 5.5 以 167.35 分位居 Epoch Capabilities Index 榜首,靠的是其自身置信区间并不支持的 0.84 分优势;Claude Sonnet 5.5 已从同一产品线的中游攀升至距榜首 2.15 分以内;而开放权重阵营则落后它们全部超过九分。榜首归属在两家厂商之间如同掷硬币,但二者之间四点的价格差距却并非如此。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
