
Claude Fable 5.1 与 Claude Fable 5:Anthropic 自家旗舰更新究竟换来了什么
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Claude Fable 5.1 是 Anthropic 当前的旗舰模型,于 2026 年 9 月 1 日发布,而对大多数团队来说最重要的对比,恰恰是 Anthropic 自己安排的那一组:Claude Fable 5.1 对比它所取代的、6 月 9 日发布的旗舰 Claude Fable 5。价格完全相同——两者均为每百万输入 token 10.00 美元、每百万输出 token 50.00 美元——1M token 的上下文窗口也一样。真正发生变化的是长时间智能体工作的性质:Anthropic 自己的数据显示,在最难的科学智能体基准测试上,Fable 5.1 的成绩是 Fable 5 的两倍还多;而本周关于企业如何在数据留存问题上对待 Fable 系列的报道,则给这次更新增添了第二重、也更锋利的优势,对今天需要在这两者之间做选择的人来说尤其如此。
关于日期与信源,先作个说明:Claude Fable 5.1 于9月1日发布,因此这个模型本身已经问世两周,算不上突发新闻。真正时效性较强的是 2026年9月14日由 The Information 发布、并被标注其信源的报道:Nvidia、Palantir 和 Booz Allen 正在限制使用 Anthropic 的 Fable 系列,原因是担心敏感企业数据的留存问题;同时,Anthropic 于6月推出了用于安全监测的滚动式30天使用日志,客户可选择自行存储这些日志,且该选项“仍可被撤销”。上述报道已标明信源,但尚未获得独立证实。下文所有标注为厂商自报的内容,均出自 Anthropic 自家的基准测试表,尚未经中立第三方复现。
规格表,逐项解读
• 价格 — Claude Fable 5.1 每 100 万 token 输入 $10.00 / 输出 $50.00,与 Claude Fable 5 相同。此次刷新中,两项价格均未变动。
• 缓存输入 — Claude Fable 5.1 每 100 万 tokens 收费 $0.25,较 Claude Fable 5 的 $1.00 下降 75%。缓存写入 $12.50(5 分钟)/ $20(1 小时);批处理模式 $5 / $25。
• 上下文和输出——两者均具有 1M token 的输入窗口和高达 128K 的输出 token;两者都接受文本和图像输入;两者都依托于同一个自适应推理界面,其努力程度调节可从低到最高。
• 独立评分——在 Artificial Analysis 智能指数当前版本上,Claude Fable 5.1 测得 53 分,在追踪的 201 个模型中排名第一,输出速度为每秒 67.2 个 token,每项指数任务成本为 7.63 美元。Claude Fable 5 发布时的指数数值(62)早于 9 月的重述,不具可比性,因此我们未引用其当前量级的数值。
• 供应商基准测试——Anthropic 报告称,Claude Fable 5.1 在 Terminal-Bench-Science 0.1 上达到 52.6%,而 Claude Fable 5 为 24.7%;在 Terminal-Bench 4.0 上为 55.8%,而后者为 42.0%;在 AutomationBench 上为 31.4%,而后者为 17.1%;在 CursorBench 3.2.0 上为 73.4%,而后者为 70.5%。
• 已发布 — Claude Fable 5.1 于 2026 年 9 月 1 日;Claude Fable 5 于 2026 年 6 月 9 日。
刷新才真正是刷新
Fable 5.1 发布的最大噱头在于,价目表上没有任何变动,而基准测试表上几乎一切都变了。提升集中在长时程、工具使用、智能体式工作上——Terminal-Bench-Science 0.1 从 24.7% 增至 52.6%,翻了一倍多,Terminal-Bench 4.0 从 42.0% 攀升至 55.8%,AutomationBench 几乎翻倍,从 17.1% 升至 31.4%。在 Humanity's Last Exam 上,Anthropic 报告不用工具时为 60.9%,使用工具时为 65.0%,而 Claude Fable 5 分别为 57.8% 和 63.8%。应将这些解读为趋势方向:它们来自厂商自己的表格,而其中最大的单项数字声称所描述的是受限的姊妹模型 Claude Mythos 5.1,它在更严格的安全护栏背后共享同一套权重。

第二个杠杆是成本,它比任何单一基准测试都更重要。缓存输入的价格从每百万 token 1.00 美元降至 0.25 美元,而在长时间运行的智能体任务中,重复读取才是主导因素:工具输出、文件内容和此前的对话轮次会被一遍又一遍地重新发送。Anthropic 估计,在典型的按 token 计费的工作负载上,有效成本大约可降低 25%,在高度依赖智能体的工作负载上最高可降低 45%——这是厂商的估算,但底层价格变化在价格表上是可核实的。一个长周期智能体若在一个任务中把 100K token 的上下文重读五十次,按 Claude Fable 5 的定价需支付 5.00 美元的缓存读取费用,而按 Claude Fable 5.1 的定价则只需 1.25 美元。当这样的智能体成规模部署时,这笔开销就不再是能忽略不计的零头了。
第三项变化是上一代用户最先感受到的:安全分类器。开发者给旧行为起了个绰号叫“Fable的抑郁”——花着旗舰级的钱,拿到的输出却在分类器将良性请求标记为风险时被悄悄改道到更弱的模型。Anthropic表示,Fable 5.1的网络防护现在在每次Claude Code会话中触发的干预大约减少了60%,而生物防护在良性请求上的触发频率比Fable 5发布时降低了85%。如果你对6月那款模型的抱怨是关于任务中途的交接,那么这次升级正是直接解决这些问题的。
本周的留存情况,以及它对决策的影响
9月14日的报道才是改变企业算盘的那部分,因为 Fable 系列正是 Anthropic 能力最强的模型所在之处——也因为数据留存立场恰恰是受监管买家无法含糊带过的那类问题。据报道,Anthropic 在6月为安全监控引入了滚动30天的使用日志;客户被告知可以自行存储这些日志;而报道称该选项"仍可被撤销"。报道称,Palantir 在获得不可撤销的零数据留存保证之前暂不采用 Fable,Nvidia 将 Fable 限制在敏感度较低的工作中,而 Booz Allen 则将其排除在专有网络安全工作之外。所有这些都属于有消息来源的报道,均未得到被点名公司的证实,其实际影响也不均衡:有些客户会非常在意,有些则完全不在意。
关于它对 5.1 与 5 之间抉择的影响,值得精确说明。数据保留方面的说法适用于整个 Fable 系列——这不是两款模型之间新增的差异,因为 Fable 5 与 Fable 5.1 采用相同的保留策略。它真正改变的是风险加权后的计算:如果你的工作负载敏感度足够高,以至于可撤销的自存储选项会直接使其出局,那么如今两款模型都达不到门槛,相关讨论应转向 Anthropic 的 Enterprise Frontier Safeguards (EFS) 路线图;该路线图被描述为从 2026 年秋季起面向符合条件的客户分阶段引入零数据保留。如果你的工作负载没有那么敏感,那么数据保留报告不应劝你放弃一次真正的性能升级——但它应当被列入决策记录,而不是事后才发现。

谁应该选择哪个
当错误答案或被放弃的回答所带来的代价压过 token 成本时,就选 Claude Fable 5.1:长周期智能体式研究、重度工具调用、任何运行在 Claude Code 之中的场景,以及那些“75% 更便宜的缓存读取”会改变你单位经济性的工作负载。而当你的流量是短促、单次触发且能容忍吞吐波动的——价格完全相同,旧模型的分数仍属前沿水准——或者当你正处于合同期中、迁移开销确实存在时,就继续留在 Claude Fable 5 上。诚实的中间路线是干脆不选:两个模型都位于同一个 Anthropic API 表面之后,如果你通过单一端点调用它们,就能在某个任务需要触及推理能力上限时升级到 Claude Fable 5.1,并让这对价格相同、更便宜的模型共享故障转移,而无需再签第二份合同。
在 OrcaRouter 上,Claude Fable 5 和 Claude Fable 5.1 均按各自供应商的标价提供,零加价,因此上方的 $10 / $50 就是发票上的数字,而 Anthropic 自身的价格调整会在同一天原样传导,而不会被吸收进经销商的利润空间里。用你自己的流量来测试这次更新,不过是一次带自动故障转移的路由规则修改——这两个模型共用一把密钥,所以切换成本近乎为零;而当某项任务重要到值得听取不止一种意见时,模型融合还能让一组模型共同给出答案。

简而言之:Claude Fable 5.1 与 Claude Fable 5 价格相同,在 Anthropic 重点展示的智能体科学基准上大约强一倍,在主导长会话的缓存读取上便宜 75%,并且在中途把你的请求转交给更弱模型的可能性显著更低。9 月 14 日的保留政策报告确有其事,如果你是对数据有严格要求的企业,值得纳入考量——但它适用于整个系列,而非这次具体的升级,而且在一个已由基准测试和缓存成本计算决定了的决策中,它只应占一行。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
