
Claude Sonnet 5.5 对比 Claude Fable 5.1:廉价模型领先三分
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 983 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 196 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
Claude Sonnet 5.5 于 2026 年 9 月 28 日发布,价格为每百万输入 token 2.00 美元、每百万输出 token 10.00 美元。厂商于 9 月 1 日推出的 Mythos 级模型 Claude Fable 5.1,在同样两项上的价格分别为 10.00 美元和 50.00 美元。一个很诱人的总结是:Fable 5.1 更贵,因此也更好;而在 Artificial Analysis Intelligence Index 上,排序却恰好相反:Claude Sonnet 5.5 得 56 分,Claude Fable 5.1 得 53 分。这不是四舍五入造成的假象,但也不是事情的全貌,因为同一个评测方在同一套测试上,把两者的每任务成本算到了相差三美分以内——7.60 美元对 7.63 美元。价目表上的五倍差距,等到一个任务完成时,几乎已经消失不见了。剩下的,是一组形态上的差异,而不是分数上的差异;在这两者之间做选择,主要取决于你的工作负载属于哪种形态。
两张费率卡,以及差距并非五倍的那一行
逐 token 的比较结果十分鲜明,无需解读。
• 输入 — Claude Sonnet 5.5 每百万 token 2.00 美元,对比 Claude Fable 5.1 的 10.00 美元,相差五倍
• 输出 — 每百万 $10.00 对 $50.00,再次恰好五倍
• 缓存读取 — 每百万 $0.20,对比 $0.25。这一项支撑着长时间的智能体运行,而折扣从 5 倍骤降至 20%
• 缓存写入——在标准五分钟窗口下,每百万 $2.50 对 $12.50,是两张卡上最大的单项差距
• Batch — Anthropic 的批处理模式对这两张卡的适用方式不同于对 Fable 5.1 的:Fable 5.1 推出时,批处理定价减半至输入 $5.00、输出 $25.00。在假定它适用于整个系列之前,请先从 Anthropic 自己的定价页面上读取批处理那一行
• 上下文与上限 —— 两者均为 1,000,000 tokens 的上下文,以及 128,000 tokens 的最大输出。在 Message Batches API 上,Claude Sonnet 5.5 在 output-300k-2026-03-24 测试版标头之下支持最高 300,000 个输出 tokens,这对批量生成而言是实打实的上限差异,而非营销上的差异。
有一个对 Claude Sonnet 5.5 有利的小点,是费率表所低估的。Anthropic 报告称,该模型完成同样的工作通常需要的 token 远少于其前代模型,并称这意味着每项任务的成本最多可降低 30%。这是厂商就另一组对比——Sonnet 5.5 对 Sonnet 5——所作的说法,并不能作为关于本次对比的证据。然而,它正是解释独立测量所发现结果的机制。
五倍价差去了哪里
Artificial Analysis 于 2026-09-29 在 Intelligence Index v4.3 上,用同一套测试框架、同一个配置标签“Adaptive Reasoning, Max Effort, Default Fallback”运行了这两个模型。两个核心数字分别是 Claude Sonnet 5.5 的 56 和 Claude Fable 5.1 的 53——更便宜的那个模型反而领先约三个点,而在同一位评测者那里,中位模型的得分是 26。两者在同一页面上都被标注为厂商同名模型,所以这是同一套评测工具、同一份快照,而不是两套。
然后是成本列,以及为什么这一配对有趣而非显而易见。在同一次索引运行中,Claude Sonnet 5.5 每项任务花费 $7.602633,Claude Fable 5.1 花费 $7.629706。两者相差千分之二十七美元。拆解开来,奇怪的地方就出现了:仅 Claude Fable 5.1 的输入端,每项任务就是 $3.73,而 Sonnet 5.5 的输入部分要小得多;仅其推理 token 每项任务就要花 $2.36。每 token 便宜五倍的模型,按完成的任务算根本一点也不便宜。
原因是体量,而这两个模型朝相反的方向失效。
• 整个索引套件中的输出 token 数——Claude Sonnet 5.5 生成了 410,577,501 个,而 Claude Fable 5.1 为 188,465,663 个;该套件的追踪中位数为 8800 万。两者都远高于中位数;Sonnet 5.5 是 Fable 5.1 的两倍多,且接近中位数的五倍
• 每任务输出 token 数——Sonnet 5.5 为 192,838,而 Fable 5.1 为 78,111,其中推理部分分别为 142,386 和 47,240。Sonnet 5.5 在每个任务上的思考时长约为 Fable 5.1 的三倍
• 整个索引套件的输入 token——Sonnet 5.5 为 185 亿,而 Fable 5.1 为 56 亿。Sonnet 5.5 的读取量是后者的三倍,这是两者中更不起眼的数字,也是那个消耗更便宜输入费率的数字
• 在 7:2:1 的输入:缓存读取:输出配比下的混合价格——Sonnet 5.5 为 $1.54,而 Fable 5.1 为 $7.17。这一行与费率卡相符,也正是描述输出简短、边界清晰的工作负载的那一行。
把这两者放在一起,诚实的说法就是:混合价格差距是真实存在的,而每任务差距则不然。这两个数字中哪一个能描述你的账单,完全取决于你的任务是会终止还是会没完没了,而索引套件就是为了让它们没完没了而构建的。
努力阶梯才是真正的决策
两个模型都暴露了一个 effort 参数——low、medium、high、xhigh、max——并且在 2026-09-29 对每一档都进行了测量。这是任何费率表都无法表达的那部分比较,因为在较低档位上,廉价模型以大比分优势胜过昂贵模型,而昂贵模型只有在接近顶档时才拉开差距。
• 低努力 — Claude Sonnet 5.5 得分为 35.84,每任务成本为 $0.41;Claude Fable 5.1 得分为 46.82,成本为 $2.37。在最低档位,昂贵的模型领先十一分,代价却是近六倍的花费
• 中等投入——40.74,成本$0.59,对比48.92,成本$2.98。Fable 5.1以五倍成本保持八分领先
• 高努力——成本 $1.08 时为 46.74,而成本 $3.91 时为 51.15。差距缩小到 4.5 分;成本比维持在约 3.6 倍
• Xhigh 努力程度——51.85($2.74)对比 53.20($5.98)。相差一又三分之一分,价格却只有后者的 46%
• 最大努力 — $7.60 时为 55.98,相较 $7.63 时的 53.35。排序反转,成本收敛至半个百分点以内。
把第四行和第五行放在一起读,这个对比的轮廓就浮现出来了。Claude Sonnet 5.5 在 xhigh 下交出 51.85 分——距离 Claude Fable 5.1 在任何努力程度下的最佳成绩仅差 1.5 个指数点——每任务成本 2.74 美元,而后者为 7.63 美元。如果你的工作需要接近前沿而非身处前沿,那么这一行就是完整的答案,并且每个已完成任务能节省 64%。把 Sonnet 5.5 推到 max,你用 2.8 倍的钱换来多 3 分,最终账单与 Fable 5.1 的 max 持平,分数略高一点,但推理特征截然不同。
最后那句话值得仔细确定,因为它足够反直觉,值得核对两遍。在相同的最大努力设置下,价目表便宜五倍的模型,每项任务的成本却与那个更贵的模型相同。它之所以能做到这一点,是因为它输出的 token 数量是后者的 2.5 倍,其中推理所占的比例又是后者的三倍。Anthropic 自己的文档解释了部分机制:分词器变了,同样的文本在 Claude Sonnet 5.5 上产生的 token 比在更早的模型上多 30%。这是若干促成因素之一,也有用地提醒我们:如果不加以说明,输出 token 数量就不能跨分词器版本进行比较。
延迟是两者不再相似的地方
得分趋同并不延伸到时间上。在同一份 2026-09-29 快照中,Artificial Analysis 报告称,在长提示词切片上,Claude Fable 5.1 的首 token 时间为 254.41 秒,Claude Sonnet 5.5 为 2.80 秒,两者中位输出速度分别为每秒 67.9 和 49.4 个 token。这意味着调用方在收到任何内容之前等待的时长相差两个数量级,而这是本次比较中在运营上最具决定性的单个数字。
两个数字都需要明确说明其限定条件。Fable 5.1 的 TTFT 是在长提示词类型上测得的;评估器在同一天对同一模型的中等提示词切片为 117.60 秒,因此 254 秒这一数字是尾部表现,而非恒定值。Sonnet 5.5 的 2.80 秒是其总体中位数,评估器自身的方差区间从第五百分位的 1.91 秒延伸到第九十五百分位的 4.23 秒。Anthropic 的平台文档将 Fable 5.1 的相对延迟描述为较慢,将 Sonnet 5.5 的描述为快,这在方向上一致,但并不构成一项测量。
我们自己的基础设施给出了第三种解读,因为我们会路由 Claude Fable 5.1,并测量自己实际提供的内容。在截至 9 月 28 日的七天内,基于 OrcaRouter 自身的流量,Claude Fable 5.1 的首 token 中位数为 6,973 毫秒,第 95 百分位为 10.0 秒,输出速度为 65.8 token/秒,错误率为 0.349%。这个 p50 比评估方给出的长提示词数值快一百倍以上,而这与其说是矛盾,不如说是术语定义不同:面向开发者的短提示词首 token,和基准测试中长提示词的首 token,衡量的是不同的东西。任何围绕排行榜数字做规划的人,都应该清楚自己买到的是哪一种。

采购诚信、留任,以及无人提及的迁移
厂商基准测试表与独立评估是不同的工具,绝不应互相扣减。Anthropic 自己为 Claude Sonnet 5.5 发布的启动表中,Terminal-Bench 4.0 报告为 70.6%。Artificial Analysis 运行自己的测试框架,在同一名称的评估中报告同一模型为 63.6%。对于 Claude Fable 5.1,差距方向相反:Anthropic 在发布时报告为 55.8%,而独立测试框架读数为 52.0%。这两组数据都不是对另一方的修正。应各自按其自身标准来评判,而在决定将生产流量发往何处时,优先采用独立评估。
数据保留策略也有所不同,而且这种差异只有在采购审查中才会显现出来。Anthropic 表示,Claude Sonnet 5.5 可在零数据保留的情况下使用,这与它对 Opus 5.5 和 Sonnet 5 采取的策略相同。Claude Fable 5.1 的发布材料则描述了与之并行的增量式数据使用政策,以及 Project Glasswing 下的一项单独部署,该部署带有用于安全监控的默认 30 天保留窗口,而零保留安排被描述为过渡状态。如果你的团队需要接受数据处理审查,那么这一区别就是一项实实在在的明细,而不是脚注,并且值得阅读 Anthropic 当前的政策页面,而不是任何对其的摘要——包括本摘要。
迁移成本的不对称性,很少会进入发布会报道的视野。迁移到 Claude Sonnet 5.5 并不是改一个模型字符串那么简单。Anthropic 的迁移指南指出:非默认的 temperature、top_p 和 top_k 值现在会返回 400 错误;tool_choice 设为 any 或指定某个具名工具都会被直接拒绝;而如果你此前是在关闭前置思考(up-front thinking)的情况下运行,thinking: {"type": "disabled"} 必须改为 between_tools。between_tools 类型在 low、medium 和 high 努力级别下会被接受,而在 xhigh 或 max 下会返回 400。在 Claude API 和 Google Cloud 上,computer use 仅通过 computer_toolset_20260801 工具集获得支持;较旧的 computer_20251124 会被拒绝。这些都不适用于迁移到 Claude Fable 5.1 的情况——那只是从 Fable 5 进行的同系列升级,有三处自身的破坏性变更。如果你正把这两者作为并行的迁移目标来权衡,那么更便宜的那个模型,反而是采用成本更高的那个。

哪个放到哪里
从这些数字中得出的决策,关乎你的流量中有多少是范围界定清晰的。
有界、高吞吐、工具驱动的工作——Claude Sonnet 5.5,若你需要贴近前沿表现,可用 xhigh effort。每个已完成任务的成本低 64%,而成绩仅落后 Fable 5.1 的最佳水平 1.5 个指数点;它约三秒即返回首个 token,且更低的缓存写入计费让重建上下文前缀变得可负担。
• 长时程、开放式的任务,一旦答错代价高昂——Claude Fable 5.1。它以相同的单任务成本达到 Sonnet 5.5 的最高分,而达成这一点只需三分之一的推理 token 和四分之一的输入——当任务真正开放、且评测套件的形态与你的问题相似时,这一点至关重要。
• 延迟受限的交互式界面——Claude Sonnet 5.5,而且差距毫不接近。在评估方自己的快照中,长提示词类型上的首 token 差距高达两个数量级,而中等提示词的读数也只是将其缩小到约 118 秒。若不围绕 Fable 5.1 的这个数字做批处理或流式处理,聊天界面根本无法据此构建。
• 批量生成长输出 — Claude Sonnet 5.5,因为在 output-300k-2026-03-24 标头之后的 Message Batches API 上提供 300,000 token 的输出上限,而其他所有地方的上限为 128,000 token。在提交前确认你的批量定价;两个卡片的批量费率并不相同。
• 需要在多个账户之间开展、或在系统之间传递推理的工作——在着手其中任何一项之前,请先阅读 Anthropic 关于保留思维的文档。思维块与生成它们的模型和账户绑定,而 Sonnet 5.5 是首个随附分类器的 Sonnet 版本,这些分类器可防止推理被提取。这既是合规特性,同时也是一项限制。
• 受监管或对数据保留敏感的工作负载——请查阅当前政策,而非发布报道。Claude Sonnet 5.5 发布时即提供零数据保留;Fable 5.1 的材料描述的是一项渐进式政策:在某一部署上默认采用 30 天窗口,并将零保留作为过渡状态

在 OrcaRouter 上,Claude Fable 5.1 与 Claude Sonnet 5 共用同一套凭证,价格按供应商的标价、0% 加价,所以当你在两者之间切换时,唯一会牵动你账单的就是缓存读取那一行和分词器的变化。Claude Sonnet 5.5 目前还不是我们平台上的路由——这个模型才刚发布一天——所以实话实说,今天你只能通过 Anthropic 自家的 API 来访问它。任何通过我们运行 Fable 5.1 的人,都可以在它上线当天就把这次切换的价格算清楚,而无需对集成做任何其他改动;与此同时,跨供应商的自动故障转移正是让「在一条必须始终保持可用的通路上尝试如此新的模型」变得安全的原因。
结论比价差所暗示的要更微妙。Claude Sonnet 5.5 在几乎所有有边界的事情上都是更好的默认选择——它在独立指数上高出三分,几秒钟就能给出回答,而且在 xhigh 档位下,它的表现距离 Fable 5.1 的上限仅差一点五分,而每个任务的成本却不到后者的一半。Claude Fable 5.1 仍保有一个站得住脚的理由,这也正是 Anthropic 自家对比表所给出的理由:当工作没有明确边界,且判断错误的代价超过思考更久的代价时,五倍的输入价格换来的是一个无需多花三倍推理 token 就能达到相同分数的模型。要依据任务的形态来选,而不是依据价目表的大小,因为在努力程度阶梯的顶端,这两个模型向你收取的费用是一样的。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
