一张生成的标题卡,标题为“等级 165”,副标题为“Epoch Capabilities Index,2026 年 10 月 1 日的文件”,三张统计卡分别显示 165(Claude Sonnet 5.5)、165(Claude Fable 5.1)和 11 对 20(每个数字背后的基准评估),右下角是 OrcaRouter 标志。
Guides & Insights

Claude Sonnet 5.5 在 Epoch Capabilities Index 上与 Claude Fable 5.1 打成平手

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

排行榜榜首并列通常是榜上最无趣的事情。这次是例外,因为并列榜首的两个模型成本并不相同。在 2026 年 10 月 1 日更新的 Epoch Capabilities Index 文件中,Claude Sonnet 5.5和Claude Fable 5.1的得分均为 165——在 253 个被追踪模型中位列第三和第四——以两分之差落后于Claude Opus 5.5和GPT-6 Astra,而它们本身以 167 分并列,并以两分优势领先Claude Opus 5,得分为 163 分。Claude Sonnet 5.5 于 2026 年 9 月 28 日发布,价格为每百万输入 token 2 美元、每百万输出 token 10 美元。Claude Fable 5.1 于 9 月 1 日发布,价格为 10 美元和 50 美元。单个数字说明二者在通用能力上可以互换。五倍的输出价格说明并非如此。两者都成立,而它们能同时成立的原因,正是表格中无人引用的那部分。

这个指数实际上是什么,以及是谁在衡量

ECI 不是供应商的记分牌。它由独立研究机构 Epoch AI 构建,是一个综合指数,将来自五十多个不同基准的分数拼接成一个通用能力量表,并根据恰好同时出现在其中几个基准上的模型,推断每个基准的相对难度。其方法论在一篇题为“A Rosetta Stone for AI Benchmarks”的论文中阐述,该论文由 Go​ogle DeepMind 资助,并与该公司 AGI Safety & Alignment 团队的研究人员共同撰写——但 Epoch 明确表示,该指数是其自身产品,它对其拥有全部权利,而且拟合代码是公开的。当研究的资助方与分数的发布方并非同一方时,这一区别就很重要。

量表的两个属性决定了其上的数字可以如何解读。第一,ECI 是锚定的,而非绝对的:原始值会被重新缩放,使 Claude 3.5 Sonnet 落在 130、GPT-5 落在 150,这意味着一个数字只有与同一文件中的另一个数字并列时才有意义。第二,它没有上限。没有 100 可供趋近,因此“指数最高点”陈述的是某个日期,而不是任何人已经达到的极限。

第三个属性才是把平局变成故事的那一个。旁边公布的区间是90%自举区间,通过对每个模型的基准测试结果重采样五百次构建而成——两个模型均落在169,Claude Sonnet 5.5为169,Claude 5.1为169。但计数则不是。Claude Sonnet 5.5的165由11次基准评估拟合得出。Claude 5.1的则为3。

为什么相同的区间并不意味着相同的证据

ECI 要求至少完成四次基准评测才会给模型评分,因此这两个数字都轻松越过了门槛。但区间说明的是模型自身结果的离散程度,而不是结果数量的多少——这正是为什么两个模型可以在同一个点估计周围给出相同的区间,而其中一个所依据的证据大约只有另一个的一半。若把两个 165 视为同样牢靠,你就把区间误读成了一种它并不具备的样本量校正。

这种不对称对时机安排有实际影响。每当有新评估到来时,Epoch 都会基于所有数据联合重新拟合整个模型,因此即使模型本身没有任何变化,其数值也可能发生变动。拥有 11 个观测值的模型比拥有 20 个观测值的模型有更大的变动空间,这使得 Claude Sonnet 5.5 成为两者中更有可能在下一次修订中发生变化的那一个——无论朝哪个方向。

Epoch对当前排名的自我表述,比它催生的那些标题更为克制。该机构对此次更新的摘要开篇便指出,Claude Opus 5.5以167分位居榜首,微弱领先于GPT-6 Astra;第二句则提到,Claude Sonnet 5.5以165分"大致追平"了Claude Fable 5.1。"大致追平"是关键措辞,而公布出的区间正是它恰如其分的原因。

这两个配置文件真正产生分歧的地方

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

综合指标上的水平并不意味着各分项上的水平。Epoch 会在每个模型页面上发布按基准测试划分的面板,而 Claude Sonnet 5.5 页面和 Claude Fable 5.1 页面上都出现了六项基准测试——这使它们成为仅有的六项可直接依据该指数本身进行同类比较的基准测试。

• 悬疑游戏谜题 — Claude Sonnet 5.5 65% 对 Claude Fable 5.1 58%

• FrontierMath 第 1–3 层级(v2)——Claude Sonnet 5.5 89% 对比 Claude Fable 5.1 90%

• FrontierMath 第 4 级(v2)——Claude Sonnet 5.5 80% 对比 Claude Fable 5.1 88%

• OTIS 模拟 AIME 2024–2025 — Claude Sonnet 5.5 100% 对比 Claude Fable 5.1 100%

• 家具组装基准测试 — Claude Sonnet 5.5 75% 对比 Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% 对比 Claude Fable 5.1 71%

在如此拥挤的复合指标上,上下四个百分点的浮动,而底层的分化远非对称。在偏游戏化、多模态的工作上——解谜、物理装配——Claude Sonnet 5.5 领先,在竞赛数学上则与对方持平。Claude Fable 5.1 在 FrontierMath 最难的一档上领先 8 个百分点,在 SimpleQA Verified 上领先 24 个百分点;后者是世界知识数据集,其中 47% 对 71% 是共享评测面板中最大的单项差距。买家在这两个模型之间做选择,并不是在同一种能力的两种解读之间做选择;他们是在一个更便宜、在某些工作上更强的模型,与一个更贵、在另一些工作上更强的模型之间做选择,而通用能力指数却拒绝将二者区分开来。

Epoch 的指数同样明确指出,在单个基准上的领先未必会体现在综合得分中。基准并非按准确率加权,一个专精化的模型即便在单项测试中领先,也可能在得分上低于一个能力分布不同的竞争对手——其文档正是这样直接说明的。这并不是在为一个缺陷开脱;这正是由五十多项测试构成的综合指数存在的意义。

两个独立仪器指向相反的方向

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

目前还流传着第二种独立评测,而它与第一种在“这两款模型中究竟哪一个领先”的问题上意见并不一致。在 Artificial Analysis Intelligence Index 上,我们自己目录中为这两款模型收录的数值是:Claude Sonnet 5.5 为 56,Claude Fable 5.1 为 53.4,二者取自该指数的同一版本,因而所依据的受测模型样本也完全相同。两者相差三分,且优势落在更便宜的那款模型一边——而 Epoch 的读数却显示二者不相上下。

两种解读都没有错,使用它们的方法就是留意它们在哪些方面不一致。这两个指数涵盖不同的基准测试集,并以不同方式为它们加权;Epoch 综合指数旨在经受住基准测试饱和,而 Artificial Analysis 指数则是对另一个不同测试组合的直接汇总。当一对模型如此接近时,选用哪种工具比所测量的差距更重要。读者若想知道两个相邻数字中哪个更强,应查看上方共享单项基准的对照面板,而不是任一标题数字,因为那是两个模型唯一在同一测试上相互比较的地方。

综合指标没有承载、而 Epoch 承载的,还有一项背景信息:发布日期。Claude Fable 5.1 在今天追踪的 253 个模型中排名第四。而在 2026 年 9 月 1 日它自己发布之时,它在当时追踪的 247 个模型中排名第一。它的权重并未改变。只是前沿在一个月内向前越过它六个位次——这正是整张表的形态,也是一次指数读数为何是快照而非定论的原因。

差异的代价是什么,以及便宜的一方在哪里

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

通用能力上持平,输入价格相差 2.5 倍,输出价格相差 5 倍,这就是这篇解读的全部实际内容。两款模型都收录在我们自己的目录中——anthropic/claude-sonnet-5.5 每百万输入 $2.00、每百万输出 $10.00,缓存读取 $0.20;anthropic/claude-fable-5.1 为 $10.00 和 $50.00,缓存读取 $0.25 ——两者都按供应商自己的标价透传,未加任何加价,因此供应商费率一旦变动,落到我们这边和落到他们那边是同一天。

重复发生比头条数字更重要。假设一个工作负载从缓存中取用一个 120,000 token 的前缀,并生成 8,000 token 的输出,每天运行一次,持续一个月。在 Claude Sonnet 5.5 上,该前缀按每百万 token 0.20 美元计费,120,000 token 约为 2.4 美分,再加上每百万 10 美元的 8,000 token,即 8 美分——每次运行大约 10.4 美分,三十天约 3.12 美元。在 Claude Fable 5.1 上,同样的前缀是 120,000 token 按 0.25 美元计,3 美分,再加上 8,000 token 按 50 美元计,40 美分——每次运行约 43 美分,整个月为 12.90 美元。两个模型都提供相同的 100 万 token 窗口,输出最高 128K,所以差异出在价目卡上,而不是上限上。

相较之下,这六项共有基准测试说明了多花的钱究竟在哪个方向上买到了东西。一个其工作看起来像 FrontierMath Tier 4 或开放式事实回忆的团队,多付四倍的钱,就能在这些测试上换来实实在在的 8 到 24 分差距;而一个其工作看起来像解谜或跨模态组合的团队,则在付出更低价格的同时,换来相反方向的 5 到 7 分。在同一个平台上,这并不是两项采购决策。这两个模型都位于同一个可调用 200 多个模型的 API 密钥之后,因此在自家流量上比较二者只需改一下配置,而不必再签一份合同;而且当两者都被路由时,底层还有自动故障转移——当两件彼此独立的测量工具对谁更领先各执一词时,这一点就很要紧了。

什么会改变这个读数

有三件事会改变它,而其中只有一件涉及这两个模型中的任何一个。

第一点是更多的基准评测。Claude Sonnet 5.5 四天前进入该指数时,背后有 11 项评测;每增加一项评测都会收窄其区间,并可能改变其点估计值,而联合重新拟合意味着这种变动并不局限于新增的那一行。

第二点是另一个前沿模型的到来。前四行横跨四个点,且这一范围内有两处并列,因此一个经过充分评估的新来者会落在这一集群之内,而不是位于其下方——而所公布的区间在四者之间全部重叠,这意味着它们之间的排序只是一种决胜规则,而非一项测量。

第三是模型本身的价格,而没有任何指数追踪这一点。本文所聚焦的差距是价目表上的差距:2美元和10美元,对比如今的10美元和50美元。两张价目表中任何一张的变化都会改变决策,却不会改变任何一项能力评分。

站得住脚的总结是范围更窄的那个。在 Epoch AI 的综合指标上,在一份更新于 2026 年 10 月 1 日的文件中,Claude Sonnet 5.5 和 Claude Fable 5.1 是同一个数字——165,并列第三,二者公布的区间相同,但所依据的证据量不同。在 Artificial Analysis 的另一套独立工具上,同样的两个模型相差 3 分。在该指数对二者进行直接比较的六项基准测试中,它们按领域互有领先,而不是并驾齐驱。而在价目表上,它们根本谈不上接近。这种解读唯一不能支撑的,就是它最有可能被引述成的那句话:这些模型是等效的。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新