一张为 Claude Opus 5.5 与 Claude Fable 5.1 生成的标题卡,副标题为“更便宜的模型赢得了独立指数”,右下角合成有真实的 OrcaRouter 标志,页脚一行文字为“指数依据 Artificial Analysis 在最大投入下的数据;价格依据 Anthropic。”
Guides & Insights

Claude Opus 5.5 与 Claude Fable 5.1:更便宜的模型在独立指数中胜出

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Anthropic 现在在其产品线顶端销售两款模型,而价格贵出两倍半的那款,并不是榜单上位居榜首的那款。 Claude Opus 5.5于 2026 年 9 月 22 日发布,输入每百万 token 4 美元、输出每百万 token 20 美元,在 Artificial Analysis Intelligence Index 上得分为 58。 Claude Fable 5.1自 9 月 1 日起一直占据旗舰位置,输入 10 美元、输出 50 美元,得分为 53。两个数字来自同一评估方,也都是在同一配置系列下测得的,而差距却与价格标签的方向相反。这正是本次对比必须从这一事实出发的原因,因为过去一周几乎每一篇发布报道都把 Opus 5.5 描述成 Fable 5.1 的折扣版——一个在大多数工作上“比得上”昂贵模型的更便宜模型。独立数字表明,折扣模型反而领先。

这是否应该改变你部署什么,是另一个问题,而答案与其说取决于那五个百分点的差距,不如说取决于两个没人会写进标题里的设置:每个模型默认采用哪个努力级别,以及哪一个可以被调得更快。

独立的数字,以及它们唯一的共同点

A two-column scoreboard comparing Claude Opus 5.5 and Claude Fable 5.1 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #4), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), context window (1M tokens on both), default effort (medium against high), knowledge cutoff (Jun 2026 on both) and fast mode (supported at $8.00 / $40.00 against not supported). The footer reads 'Index figures per Artificial Analysis at max effort; prices, effort defaults and fast-mode support per Anthropic.'

Artificial Analysis 为每个模型只发布一组配置,而这两个模型的配置都标注为“Adaptive Reasoning, Max Effort, Default Fallback”。相同的标注、相同的评估器、相同的运行——这使其成为这两个模型各自所经历过的最干净的一次正面对决:

• 智能指数 — Claude Opus 5.5 58,在210个模型中排名第1,对比 Claude Fable 5.1 53,排名第4

• 输出速度 — Claude Fable 5.1 为 65.8 tokens/秒,低于 71.0 的榜单中位数;相比之下,Claude Opus 5.5 尚未在榜单上公布

• 首 token 时间 — Claude Fable 5.1 为 274.43 秒,而榜单中位数为 3.83 秒;Claude Opus 5.5 尚未发布

• 索引中的冗长程度 — Claude Opus 5.5 生成了 260M 个输出 token,而总体中位数为 88M

• 价格 — Claude Opus 5.5 为每百万 $4.00 / $20.00,而 Claude Fable 5.1 为 $10.00 / $50.00

这些行中有两行需要解读,而不是直接引用。第一行是“Max Effort”标签:两款模型的得分都不反映其发布时的默认设置,而且这两个默认设置并不相同——下文会进一步说明。第二行是冗长程度那一行,它与 Opus 5.5 一直以来的宣传口径相悖。Anthropic 的效率叙事是,该模型能用更少的 token 得到相同答案,发布材料还援引合作伙伴称输出 token 减少了三分之一到一半。但在 Index 上,依据实测而非引用数据,Opus 5.5 输出了 2.6 亿个 token,而榜单中位数是 8800 万个——比它所对比的典型模型大约啰嗦三倍。这两件事可以同时为真:它使用的 token 可能比 Claude Opus 5 少,但从绝对量来看仍是一个啰嗦的模型。但如果你是根据“更少 token”这一说法做预算,而不是根据你自己的账单,那么独立测量结果才是你应该核对的。

每百万多花 6 美元能换来什么

A screenshot of Anthropic's Claude Platform Docs page for Claude Opus 5.5 showing its 'How it compares' table: Claude Fable 5.1 and Claude Opus 5.5 both at 1M context and 128K max output with a Jun 2026 cutoff, Fable 5.1 at $10 / $50 with high default effort and slower latency against Opus 5.5 at $4 / $20 with medium default effort and moderate latency, with Claude Sonnet 5 at $2 / $10 and a Jan 2026 cutoff and Claude Haiku 4.5 below them. The Opus 5.5 pricing panel underneath lists $4 input, $20 output, $5 and $8 cache writes, $0.20 cache read and a 50% batch discount.

去掉基准测试,剩下的差别就是一张价目表。这里的一切都来自 Anthropic 已发布的价格页面,今天即可核实:

• 输入 — 在 Opus 5.5 上为每百万 $4.00,而在 Fable 5.1 上为 $10.00

• 输出 — 每百万 $20.00 vs $50.00

• 缓存读取 — Opus 5.5 每百万 $0.20,而 Fable 5.1 为 $0.25

• 缓存倍率——Opus 5.5 对缓存命中按基础输入价格的 0.05 倍计费;Fable 5.1 则按 0.025 倍计费,在更高的基础价格上实现了更优的倍率

• 缓存写入 — 在 Opus 5.5 上,5 分钟窗口每百万 $5,一小时 $8;相比之下,在 Fable 5.1 上分别为 $12.50 和 $20

• 批量 API — Opus 5.5 减半至 $2.00 / $10.00;Fable 5.1 减半至 $5.00 / $25.00

• 快速模式 — Opus 5.5 支持该模式,价格为 $8.00 / $40.00,输出速度最高可提升约 2.5 倍;Fable 5.1 则完全不支持快速模式

缓存那一行值得再看一遍,因为这两个模型颠倒了通常的模式。Fable 5.1 的乘数更激进——基础输入的 2.5%,而 Opus 5.5 是 5%——但由于它的基价是 10 美元而非 4 美元,按绝对美元计算,它的缓存读取仍是两者中更贵的。没有任何一种配置能让这个高价模型在缓存上下文的任何一个 token 上占优。而且这个乘数并非可以照搬的东西:一个针对 Fable 5.1 缓存行为调优的 agent 循环,在 Opus 5.5 上每次缓存命中按比例要付出更多,尽管它每个全新 token 付得更少。

快速模式是更鲜明的不对称之处。Anthropic 的文档列出了 Claude Opus 5.5、Claude Opus 5 和 Claude Opus 4.8 的快速模式——Fable 5.1 不在该列表中。因此,更便宜的模型拥有一种更昂贵的模型根本没有的延迟杠杆,其价格为 $8/$40,仍低于 Fable 5.1 标准的 $10/$50 输出费率。如果你的工作负载交互性足够强,以至于首 token 缓慢本身就是一个产品问题,请注意 Fable 5.1 实测的首 token 时间为 274 秒。这个数字是最大努力推理的产物,而非缺陷,但它是评估者记录下的数字。

默认值并不相同,而这正是陷阱。

Anthropic 自己的模型文档把这两个模型并排列出,而决定大多数实际对比结果的那一行并不是价格,而是默认的 effort 等级:medium 对应 Claude Opus 5.5,high 对应 Claude Fable 5.1。两者都运行无法关闭的自适应思考;深度只能通过 effort 参数控制,其取值刻度为 low、medium、high、xhigh、max。

这就是为什么发布宣传语“Opus 5.5 在大多数工作上与 Fable 5.1 相当”以及其下方的基准测试表看起来相互矛盾。Anthropic 为 Opus 5.5 列出的正面对比行,常常标注着高于默认值的努力程度设置——Terminal-Bench 4.0 中 66.4% 对 Fable 5.1 的 55.8% 这一数字,是在 xhigh 努力程度下运行的,而不是在中等努力程度下。与此同时,Fable 5.1 自己的数字是在其更高的默认设置下得出的。在不同努力程度设置下比较两个模型,根本算不上是在比较;Anthropic 在自己的发布材料中也表达了这一点,它提醒说,在这一能力水平上,基准测试的差距对现实世界差异的指示作用,并不像分数所暗示的那样可靠。

实际上,这使决策变成了一项调参练习,而不是一次选择。如果你从 Fable 5.1 迁移到 Opus 5.5,却原封不动地沿用你的effort设置,那你就在不知不觉中改变了模型思考的多少,此后你得出的每一个质量和成本数字都受到了混杂干扰。Anthropic 的建议是测试多个 effort 水平,而不是照搬旧模型的设置。这样做成本很低,却几乎没人这么做,因为这意味着你得把自己的评测跑上两遍。

这对组合唯一证明自己价值的地方

同时保留两者的理由在于顾问循环:Opus 5.5 干活,Fable 5.1 在棘手决策上提供咨询。Anthropic 实测过,它确实能提升准确率——代价是更高的成本和更高的延迟,而这正是把较慢的模型放进循环里所会有的取舍。变化在于背后的算术。当能力差距更大时,花 $10/$50 去监督一个 $5/$25 的干活模型显然是划算的。而如今在独立指数上,干活的模型得分已超过顾问模型,于是顾问的贡献就收窄到那些它自己的评测能胜过 Opus 5.5 的具体任务上,而这些任务得由你自己去识别。对于困难的那一小部分任务,这个循环仍然说得通;但作为一刀切的配置,它就不再合理了。

两者都只差一个键

这里真正让团队栽跟头的迁移细节并不在 API 表面——而在于这些是同一家厂商的模型,却有着不同的 effort 档位、不同的缓存倍率和不同的默认设置,而要诚实地比较它们,就得在配置匹配的前提下,用你自己的提示词把两个都跑一遍。Claude Opus 5.5 在 OrcaRouter 上的定价与 Anthropic 自家的 $4.00 / $20.00 一致,而Claude Fable 5.1 在 OrcaRouter 上是 $10.00 / $50.00——按供应商标价原样透传,加价 0%,所以这两个数字会在 Anthropic 调价当天随之变动,而且两者都不需要另签合同,也不需要另接一套 SDK。

A screenshot of OrcaRouter's own model page for anthropic/claude-fable-5.1, headed 'Claude Fable 5.1' and credited to Anthropic, showing $10.00 input and $50.00 output per 1M tokens and a PERFORMANCE panel with 65.8 output tokens per second, a 274.43s time to first token, 88M output tokens over 7 days and a 0.00% error rate.

这正是让这种拆分实际可行、而非停留在理论上的原因。把大部分流量发送给 Opus 5.5,并固定一条将真正困难的用例升级到 Fable 5.1 的路由规则,这只是在一个端点上做的配置,而不是两套集成;而组合一次调用、让一个模型负责起草、另一个模型负责验证,也只是一行 routing-DSL,而不是你必须自行搭建和维护的流水线。如果这条升级路径最终被证明不适合你的工作负载,自动故障转移会让请求落到一个你已经摸清其特性的模型上,而不是直接失败。

怎样才能了结

这次对比的诚实状况是:Anthropic 公布了一张表,其中更便宜的模型在大多数行上都胜出;Artificial Analysis 公布了另一张表,其中它则全面胜出;而这两次都是在并非你实际部署所用的推理强度设置下运行的。二者都不是在匹配默认值下进行的受控正面对比,也没有任何第三方做过这样的对比。在这一切之后依然成立的差距——Claude Opus 5.5 在价目表的每一行上都显著更便宜、支持 Fable 5.1 所不具备的快速模式,并且在两款模型共有的唯一一项独立评分上并不落后——已经大到足以让举证责任发生转移。如果你默认使用 Fable 5.1,那么问题已不再是 Opus 5.5 是否足够好,而是你的工作负载中哪些具体任务在中等推理强度下会失败,因为只有那些任务才是你为之支付溢价的。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新