为 Claude Sonnet 5.5 与 Claude Fable 5.1 生成了主视觉标题卡,副标题为“便宜的模型领先三分”,左侧显示每百万 tokens 输入 $2.00、输出 $10.00,右侧显示 $10.00 和 $50.00,其下方是 Artificial Analysis Intelligence Index v4.3 的数值 56 和 53,右下角还合成了 OrcaRouter 标志。
Guides & Insights

Claude Sonnet 5.5 对比 Claude Fable 5.1:廉价模型领先三分

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Sonnet 5.5 于 2026 年 9 月 28 日发布,价格为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元。厂商于 9 月 1 日推出的 Mythos 级模型 Claude Fable 5.1,在同样两项上的价格分别为 10.00 美元和 50.00 美元。一个很诱人的总结是:Fable 5.1 更贵,因此也更好;而在 Artificial Analysis Intelligence Index 上,排序却恰好相反:Claude Sonnet 5.5 得 56 分,Claude Fable 5.1 得 53 分。这不是四舍五入造成的假象,但也不是事情的全貌,因为同一个评测方在同一套测试上,把两者的每任务成本算到了相差三美分以内——7.60 美元对 7.63 美元。价目表上的五倍差距,等到一个任务完成时,几乎已经消失不见了。剩下的,是一组形态上的差异,而不是分数上的差异;在这两者之间做选择,主要取决于你的工作负载属于哪种形态。

两张费率卡,以及差距并非五倍的那一行

逐 token 的比较结果十分鲜明,无需解读。

• 输入 — Claude Sonnet 5.5 每百万 token 2.00 美元,对比 Claude Fable 5.1 的 10.00 美元,相差五倍

• 输出 — 每百万 $10.00 对 $50.00,再次恰好五倍

• 缓存读取 — 每百万 $0.20,对比 $0.25。这一项支撑着长时间的智能体运行,而折扣从 5 倍骤降至 20%

• 缓存写入——在标准五分钟窗口下,每百万 $2.50 对 $12.50,是两张卡上最大的单项差距

• Batch — Anthropic 的批处理模式对这两张卡的适用方式不同于对 Fable 5.1 的:Fable 5.1 推出时,批处理定价减半至输入 $5.00、输出 $25.00。在假定它适用于整个系列之前,请先从 Anthropic 自己的定价页面上读取批处理那一行

• 上下文与上限 —— 两者均为 1,000,000 tokens 的上下文,以及 128,000 tokens 的最大输出。在 Message Batches API 上,Claude Sonnet 5.5 在 output-300k-2026-03-24 测试版标头之下支持最高 300,000 个输出 tokens,这对批量生成而言是实打实的上限差异,而非营销上的差异。

有一个对 Claude Sonnet 5.5 有利的小点,是费率表所低估的。Anthropic 报告称,该模型完成同样的工作通常需要的 token 远少于其前代模型,并称这意味着每项任务的成本最多可降低 30%。这是厂商就另一组对比——Sonnet 5.5 对 Sonnet 5——所作的说法,并不能作为关于本次对比的证据。然而,它正是解释独立测量所发现结果的机制。

五倍价差去了哪里

Artificial Analysis 于 2026-09-29 在 Intelligence Index v4.3 上,用同一套测试框架、同一个配置标签“Adaptive Reasoning, Max Effort, Default Fallback”运行了这两个模型。两个核心数字分别是 Claude Sonnet 5.5 的 56 和 Claude Fable 5.1 的 53——更便宜的那个模型反而领先约三个点,而在同一位评测者那里,中位模型的得分是 26。两者在同一页面上都被标注为厂商同名模型,所以这是同一套评测工具、同一份快照,而不是两套。

然后是成本列,以及为什么这一配对有趣而非显而易见。在同一次索引运行中,Claude Sonnet 5.5 每项任务花费 $7.602633,Claude Fable 5.1 花费 $7.629706。两者相差千分之二十七美元。拆解开来,奇怪的地方就出现了:仅 Claude Fable 5.1 的输入端,每项任务就是 $3.73,而 Sonnet 5.5 的输入部分要小得多;仅其推理 token 每项任务就要花 $2.36。每 token 便宜五倍的模型,按完成的任务算根本一点也不便宜。

原因是体量,而这两个模型朝相反的方向失效。

• 整个索引套件中的输出 token 数——Claude Sonnet 5.5 生成了 410,577,501 个,而 Claude Fable 5.1 为 188,465,663 个;该套件的追踪中位数为 8800 万。两者都远高于中位数;Sonnet 5.5 是 Fable 5.1 的两倍多,且接近中位数的五倍

• 每任务输出 token 数——Sonnet 5.5 为 192,838,而 Fable 5.1 为 78,111,其中推理部分分别为 142,386 和 47,240。Sonnet 5.5 在每个任务上的思考时长约为 Fable 5.1 的三倍

• 整个索引套件的输入 token——Sonnet 5.5 为 185 亿,而 Fable 5.1 为 56 亿。Sonnet 5.5 的读取量是后者的三倍,这是两者中更不起眼的数字,也是那个消耗更便宜输入费率的数字

• 在 7:2:1 的输入:缓存读取:输出配比下的混合价格——Sonnet 5.5 为 $1.54,而 Fable 5.1 为 $7.17。这一行与费率卡相符,也正是描述输出简短、边界清晰的工作负载的那一行。

把这两者放在一起,诚实的说法就是:混合价格差距是真实存在的,而每任务差距则不然。这两个数字中哪一个能描述你的账单,完全取决于你的任务是会终止还是会没完没了,而索引套件就是为了让它们没完没了而构建的。

努力阶梯才是真正的决策

两个模型都暴露了一个 effort 参数——low、medium、high、xhigh、max——并且在 2026-09-29 对每一档都进行了测量。这是任何费率表都无法表达的那部分比较,因为在较低档位上,廉价模型以大比分优势胜过昂贵模型,而昂贵模型只有在接近顶档时才拉开差距。

• 低努力 — Claude Sonnet 5.5 得分为 35.84,每任务成本为 $0.41;Claude Fable 5.1 得分为 46.82,成本为 $2.37。在最低档位,昂贵的模型领先十一分,代价却是近六倍的花费

• 中等投入——40.74,成本$0.59,对比48.92,成本$2.98。Fable 5.1以五倍成本保持八分领先

• 高努力——成本 $1.08 时为 46.74,而成本 $3.91 时为 51.15。差距缩小到 4.5 分;成本比维持在约 3.6 倍

• Xhigh 努力程度——51.85($2.74)对比 53.20($5.98)。相差一又三分之一分,价格却只有后者的 46%

• 最大努力 — $7.60 时为 55.98,相较 $7.63 时的 53.35。排序反转,成本收敛至半个百分点以内。

把第四行和第五行放在一起读,这个对比的轮廓就浮现出来了。Claude Sonnet 5.5 在 xhigh 下交出 51.85 分——距离 Claude Fable 5.1 在任何努力程度下的最佳成绩仅差 1.5 个指数点——每任务成本 2.74 美元,而后者为 7.63 美元。如果你的工作需要接近前沿而非身处前沿,那么这一行就是完整的答案,并且每个已完成任务能节省 64%。把 Sonnet 5.5 推到 max,你用 2.8 倍的钱换来多 3 分,最终账单与 Fable 5.1 的 max 持平,分数略高一点,但推理特征截然不同。

最后那句话值得仔细确定,因为它足够反直觉,值得核对两遍。在相同的最大努力设置下,价目表便宜五倍的模型,每项任务的成本却与那个更贵的模型相同。它之所以能做到这一点,是因为它输出的 token 数量是后者的 2.5 倍,其中推理所占的比例又是后者的三倍。Anthropic 自己的文档解释了部分机制:分词器变了,同样的文本在 Claude Sonnet 5.5 上产生的 token 比在更早的模型上多 30%。这是若干促成因素之一,也有用地提醒我们:如果不加以说明,输出 token 数量就不能跨分词器版本进行比较。

延迟是两者不再相似的地方

得分趋同并不延伸到时间上。在同一份 2026-09-29 快照中,Artificial Analysis 报告称,在长提示词切片上,Claude Fable 5.1 的首 token 时间为 254.41 秒,Claude Sonnet 5.5 为 2.80 秒,两者中位输出速度分别为每秒 67.9 和 49.4 个 token。这意味着调用方在收到任何内容之前等待的时长相差两个数量级,而这是本次比较中在运营上最具决定性的单个数字。

两个数字都需要明确说明其限定条件。Fable 5.1 的 TTFT 是在长提示词类型上测得的;评估器在同一天对同一模型的中等提示词切片为 117.60 秒,因此 254 秒这一数字是尾部表现,而非恒定值。Sonnet 5.5 的 2.80 秒是其总体中位数,评估器自身的方差区间从第五百分位的 1.91 秒延伸到第九十五百分位的 4.23 秒。Anthropic 的平台文档将 Fable 5.1 的相对延迟描述为较慢,将 Sonnet 5.5 的描述为快,这在方向上一致,但并不构成一项测量。

我们自己的基础设施给出了第三种解读,因为我们会路由 Claude Fable 5.1,并测量自己实际提供的内容。在截至 9 月 28 日的七天内,基于 OrcaRouter 自身的流量,Claude Fable 5.1 的首 token 中位数为 6,973 毫秒,第 95 百分位为 10.0 秒,输出速度为 65.8 token/秒,错误率为 0.349%。这个 p50 比评估方给出的长提示词数值快一百倍以上,而这与其说是矛盾,不如说是术语定义不同:面向开发者的短提示词首 token,和基准测试中长提示词的首 token,衡量的是不同的东西。任何围绕排行榜数字做规划的人,都应该清楚自己买到的是哪一种。

Screenshot of Anthropic's product page for Claude Sonnet 5.5 via the Claude Platform overview, showing the model comparison table across context window, maximum output, input price, output price, comparative latency, thinking mode and knowledge cutoff, with Claude Sonnet 5.5 marked as the model being viewed at $2.00 input and $10.00 output per million tokens alongside Claude Fable 5.1 and Claude Opus 5.5.

采购诚信、留任,以及无人提及的迁移

厂商基准测试表与独立评估是不同的工具,绝不应互相扣减。Anthropic 自己为 Claude Sonnet 5.5 发布的启动表中,Terminal-Bench 4.0 报告为 70.6%。Artificial Analysis 运行自己的测试框架,在同一名称的评估中报告同一模型为 63.6%。对于 Claude Fable 5.1,差距方向相反:Anthropic 在发布时报告为 55.8%,而独立测试框架读数为 52.0%。这两组数据都不是对另一方的修正。应各自按其自身标准来评判,而在决定将生产流量发往何处时,优先采用独立评估。

数据保留策略也有所不同,而且这种差异只有在采购审查中才会显现出来。Anthropic 表示,Claude Sonnet 5.5 可在零数据保留的情况下使用,这与它对 Opus 5.5 和 Sonnet 5 采取的策略相同。Claude Fable 5.1 的发布材料则描述了与之并行的增量式数据使用政策,以及 Project Glasswing 下的一项单独部署,该部署带有用于安全监控的默认 30 天保留窗口,而零保留安排被描述为过渡状态。如果你的团队需要接受数据处理审查,那么这一区别就是一项实实在在的明细,而不是脚注,并且值得阅读 Anthropic 当前的政策页面,而不是任何对其的摘要——包括本摘要。

迁移成本的不对称性,很少会进入发布会报道的视野。迁移到 Claude Sonnet 5.5 并不是改一个模型字符串那么简单。Anthropic 的迁移指南指出:非默认的 temperature、top_p 和 top_k 值现在会返回 400 错误;tool_choice 设为 any 或指定某个具名工具都会被直接拒绝;而如果你此前是在关闭前置思考(up-front thinking)的情况下运行,thinking: {"type": "disabled"} 必须改为 between_tools。between_tools 类型在 low、medium 和 high 努力级别下会被接受,而在 xhigh 或 max 下会返回 400。在 Claude API 和 Google Cloud 上,computer use 仅通过 computer_toolset_20260801 工具集获得支持;较旧的 computer_20251124 会被拒绝。这些都不适用于迁移到 Claude Fable 5.1 的情况——那只是从 Fable 5 进行的同系列升级,有三处自身的破坏性变更。如果你正把这两者作为并行的迁移目标来权衡,那么更便宜的那个模型,反而是采用成本更高的那个。

A two-column scoreboard for Claude Sonnet 5.5 and Claude Fable 5.1. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56, best value rung xhigh at 51.85 and $2.74 per task, first token 2.80 seconds, 410M output tokens on the index suite. Right column Claude Fable 5.1: input $10.00, output $50.00, cache read $0.25, cache write $12.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 53, best score max at 53.35 and $7.63 per task, first token 254.41 seconds on the long prompt slice, 188M output tokens on the index suite. The card heading reads 'Claude Sonnet 5.5 against Claude Fable 5.1: five-fold on the rate card, level on the finished task', and a footer line reads 'Per-token prices per the OrcaRouter catalogue; index, per-task, effort and latency figures per Artificial Analysis, Intelligence Index v4.3, 2026-09-29 snapshot.'

哪个放到哪里

从这些数字中得出的决策,关乎你的流量中有多少是范围界定清晰的。

有界、高吞吐、工具驱动的工作——Claude Sonnet 5.5,若你需要贴近前沿表现,可用 xhigh effort。每个已完成任务的成本低 64%,而成绩仅落后 Fable 5.1 的最佳水平 1.5 个指数点;它约三秒即返回首个 token,且更低的缓存写入计费让重建上下文前缀变得可负担。

• 长时程、开放式的任务,一旦答错代价高昂——Claude Fable 5.1。它以相同的单任务成本达到 Sonnet 5.5 的最高分,而达成这一点只需三分之一的推理 token 和四分之一的输入——当任务真正开放、且评测套件的形态与你的问题相似时,这一点至关重要。

• 延迟受限的交互式界面——Claude Sonnet 5.5,而且差距毫不接近。在评估方自己的快照中,长提示词类型上的首 token 差距高达两个数量级,而中等提示词的读数也只是将其缩小到约 118 秒。若不围绕 Fable 5.1 的这个数字做批处理或流式处理,聊天界面根本无法据此构建。

• 批量生成长输出 — Claude Sonnet 5.5,因为在 output-300k-2026-03-24 标头之后的 Message Batches API 上提供 300,000 token 的输出上限,而其他所有地方的上限为 128,000 token。在提交前确认你的批量定价;两个卡片的批量费率并不相同。

• 需要在多个账户之间开展、或在系统之间传递推理的工作——在着手其中任何一项之前,请先阅读 Anthropic 关于保留思维的文档。思维块与生成它们的模型和账户绑定,而 Sonnet 5.5 是首个随附分类器的 Sonnet 版本,这些分类器可防止推理被提取。这既是合规特性,同时也是一项限制。

• 受监管或对数据保留敏感的工作负载——请查阅当前政策,而非发布报道。Claude Sonnet 5.5 发布时即提供零数据保留;Fable 5.1 的材料描述的是一项渐进式政策:在某一部署上默认采用 30 天窗口,并将零保留作为过渡状态

Screenshot of the OrcaRouter model page for Anthropic Claude Fable 5.1 (anthropic/claude-fable-5.1), showing the model header, a 1M-token context window with 128K maximum output, the capability tags, the $10.00 input and $50.00 output prices per million tokens with a $0.25 cache read and $12.50 cache write, and the seven-day performance panel with a 65.836 token-per-second output speed and a 0.349% error rate.

在 OrcaRouter 上,Claude Fable 5.1 与 Claude Sonnet 5 共用同一套凭证,价格按供应商的标价、0% 加价,所以当你在两者之间切换时,唯一会牵动你账单的就是缓存读取那一行和分词器的变化。Claude Sonnet 5.5 目前还不是我们平台上的路由——这个模型才刚发布一天——所以实话实说,今天你只能通过 Anthropic 自家的 API 来访问它。任何通过我们运行 Fable 5.1 的人,都可以在它上线当天就把这次切换的价格算清楚,而无需对集成做任何其他改动;与此同时,跨供应商的自动故障转移正是让「在一条必须始终保持可用的通路上尝试如此新的模型」变得安全的原因。

结论比价差所暗示的要更微妙。Claude Sonnet 5.5 在几乎所有有边界的事情上都是更好的默认选择——它在独立指数上高出三分,几秒钟就能给出回答,而且在 xhigh 档位下,它的表现距离 Fable 5.1 的上限仅差一点五分,而每个任务的成本却不到后者的一半。Claude Fable 5.1 仍保有一个站得住脚的理由,这也正是 Anthropic 自家对比表所给出的理由:当工作没有明确边界,且判断错误的代价超过思考更久的代价时,五倍的输入价格换来的是一个无需多花三倍推理 token 就能达到相同分数的模型。要依据任务的形态来选,而不是依据价目表的大小,因为在努力程度阶梯的顶端,这两个模型向你收取的费用是一样的。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新