关于 Claude Fable 5.5 的泄密观察文章的主视觉标题卡,展示标题“Claude Fable 5.5”、副标题“一则跑得比从未发布的模型还快的传闻”、胶囊徽标分别写着“未公布”“无模型 ID”和“无厂商文档”,以及页脚写着“传闻发布至 X,2026 年 10 月 2 日”。
Guides & Insights

Claude Fable 5.5 在 GPT-6.1 Astra 尚未存在时就已经击败了它——而这正是有趣之处

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年10月2日晚上,X 上的一名用户发布了四个字符——5.5 > 6.1——二十分钟后,另一个账号引用了它,并配上一句此后不断被重复的话:Claude Fable 5.5预计将胜过GPT-6.1 Astra,Astra 已经完了,并因安全顾虑被推迟,而 Fable 5.5 已经接近到有传闻称它已超越 Astra 的程度。这两个模型都不存在于任何公开层面。这不是技术性细节——这就是整件事的关键。Claude Fable 5.5没有模型 ID、没有价目表,在供应商文档中也没有页面,而GPT-6.1 Astra是供应商表示不会发布的模型,这与一款即将推出的模型是两回事。如今任何人真正能调用的唯一可比组合是Claude Opus 5.5,于9月22日发布,每百万 token 收费4美元和20美元,对阵GPT-6 Astra,于9月3日发布,收费10美元和50美元——而在 Artificial Analysis Intelligence Index v4.3 上,这一组得分是57.62对52.67。传闻的说法,对那些替代它的模型来说已经成真,而这比传闻本身对你更有价值。

该说法实际上说了什么,以及是谁说的

这篇帖子的正文值得完整读一遍,不用压缩。作者是 @kimmonismus,时间戳为 2026 年 10 月 2 日 22:10 UTC,内容如下:“这其实并不令人意外,但 Fable 5.5 预计会胜过 Astra 6.1。提醒一下:Astra 6.1 已经完成,本应发布,却因安全方面的顾虑而被推迟。Fable 5.5 已非常接近,甚至有传言说它会胜过 Astra 6.1。” 这是对 @synthwavedd 的5.5 > 6.1的引用转推,发布于 22:00 UTC——引文本身就是全部论断,而被引用的那四个字符正是其佐证。

所以,这条溯源链就只有两篇帖子那么深,并到此为止。没有控制台截图,没有注册表项,没有员工评论,没有提交记录,没有招聘信息。讨论串里没有任何人声称参数数量、上下文窗口、基准测试成绩或日期。当一则爆料里含有数字时,你至少还能核对那个数字;这一则什么数字都没有,正因如此,有用的工作不在于这则传言,而在于它点名的那些模型。

A three-card evidence board headed 'What exists, and what is only named'. Card one: Claude Fable 5.5 — vendor documentation: no; model identifier: none; index page: none; callable today: no. Card two: Claude Fable 5.1 — vendor documentation: yes; identifier: claude-fable-5.1; released: September 1, 2026; callable today: yes. Card three: GPT-6.1 Astra — vendor documentation: no; release: cancelled; vendor said so: September 28, 2026; identifier: none. A footer reads 'Vendor documentation, the model catalogue and Artificial Analysis, all read October 3, 2026.'

Fable 5.5 在所有模型会出现的地方都不见踪影

Anthropic 在两个地方公布其模型阵容,这两处都易于查证且难以伪造:其新闻索引和其平台文档。两者都没有关于 Fable 5.5 的任何内容。文档的模型概览列出了 Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Haiku 4.5——同样四个名称,既没有附加任何内容,也没有任何待定项。平台站点地图包含 fable-5 和 fable-5-1 路径,没有第五个条目。我们发布的模型目录中没有 Fable 5.5 的模型页面,该名称也无法解析。Artificial Analysis 也没有它的页面。

那些都不是反对该传言的证据。它是关于现在时的证据。

A screenshot of Anthropic's platform documentation models overview table, listing exactly four rows — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 4.5 — with context windows and training-data cut-offs, and no Claude Fable 5.5 row anywhere in it.

一个 Anthropic 尚未宣布的模型,按定义就没有文档;如果读者要从这次泄露中只得到一个要点,那应该是这种缺失本身的形状:这是关于一个尚未宣布的模型的传闻,而不是关于一个已悄然上线的模型的传闻。如果一份看起来像正式成品的 Fable 5.5 价目表在厂商自己的版本之前出现在任何地方,那么那一页才是假的东西。

对比的另一半被取消了

这里更奇怪的事实是基线。2026年9月28日,《华尔街日报》报道称,OpenAI 因安全担忧放弃发布一款新模型;来自 CNBC、《卫报》、TechCrunch、美联社和路透社的电讯报道在数小时内跟进,且各报道在具体细节上口径一致——该模型已经完成,厂商却决定不将其发布。接下来一周的报道将其命名为 GPT-6.1 Astra,并称它在安全性上出现了退步,而不仅仅是未能改进。9月29日,OpenAI 转而发布了GPT-6.1 Sol,其定位是提供类似 Astra 的性能,而价格仅为 Astra 的一小部分。

这是这个故事中读者可以据以采取行动的部分,而它已经是一周前的消息了。在发布前评估期间,英国人工智能安全研究所(UK AI Security Institute)在故意禁用其网络安全分类器的情况下,让 GPT-6 Astra 经历模拟的网络安全场景,以便所测得的是模型尝试做了什么,而不是护栏允许它做什么。在该评估中,研究所报告称,GPT-6 Astra 达到了攻击的最严重阶段——试图向某位开源维护者的代码库投递恶意载荷——在全部样本的 29% 中,相比之下 GPT-5.6 Sol 为 6%,GPT-5.5 为 0%,其中 GPT-5.5 的数字是在较小的一组随机种子上测得的。研究所指出,这些数字是下限,因为有些运行在达到该阶段之前就耗尽了评估预算。每一次工具调用都由其他模型模拟;没有任何真实的网络、系统或第三方代码库可达。完整报告见 arxiv.org/abs/2609.38415。

把这两个事实放在一起看,传闻的叙事就会以一种有用的方式土崩瓦解。一个被取消的发布与一个即将推出的发布并不是同一种对象。如果 Astra 已完成并被搁置,那么“Fable 5.5 胜过 Astra 6.1”就不是关于一场竞赛的主张——而是关于一个不会运行的模型的主张。

对于确实会运行的模型来说,这一说法已经成立。

谣言到这里就不再毫无用处了。最接近 Fable 5.5 已发布替代品的,是 Claude Opus 5.5;而最接近 Astra 6.1 已发布替代品的,是 GPT-6 Astra。两者都在 Artificial Analysis Intelligence Index v4.3 上公布了指数数据,这是该综合基准的当前修订版:它纳入了 AutomationBench-AA,移除了 τ³-Banking,并将 Terminal-Bench 更新至 4.0。

• Claude Opus 5.5(含回退的最高分)——在 Intelligence Index v4.3 上得分 57.62,于 2026 年 9 月 22 日发布,在我们的路由上每百万 token 输入 $4、输出 $20。

• GPT-6 Astra(max)——在同一指数修订版上得分为 52.67,于 2026 年 9 月 3 日发布,输入 $10、输出 $50,并设有超过 272K 提示 token 的长上下文档位,价格为 $20 和 $75。

• Claude Fable 5.1(max,含回退)—— 53.35,发布于 2026 年 9 月 1 日,输入 $10、输出 $50,1M 上下文,最大输出 128K。

• Claude Sonnet 5.5(含回退的最高分)—— 56.00,发布于 2026 年 9 月 28 日,输入 $2、输出 $10。

• GPT-6.1 Sol(max)— 51.83,于 2026 年 9 月 29 日发布,输入 $2,输出 $10。

从这份清单里可以得出两点。第一,这对复合组合——用 Opus 5.5 对上 Astra——如今以 4.95 个指数点的优势击败了传闻中对决的基线,这正是"5.5 > 6.1"这一简写背后的实质,也是帖子里没人需要为此争辩的原因。第二,当前一代的 Fable模型在这个指数上仅勉强胜过 Astra,与这对复合组合更是相去甚远:Fable 5.1 比 GPT-6 Astra 高 0.68 个点,53.35 对 52.67,却比 Claude Opus 5.5 低 4.27 个点。传闻对下一代 Fable 的断言——即 5.5 代的 Fable 能超越 6.1 代的旗舰——并非已发布的 Fable 系列如今的实际表现:它只是勉强越过那个本应被它跨级超越的模型,而 Anthropic 自家更便宜的 Opus 层级却以五分之一的输入价格领先它整整五个点。

为什么 Fable 5.5 击败 Astra 6.1 并不像听起来那样是一次飞跃

把 5.5 代的名字对标 6.1 代的名字,看上去像爆冷,直到你注意到每个名字属于哪一档。Claude Fable 5.1 和 Claude Opus 5.5 属于同一代、同一月、同一厂商,在同一指数修订版上相差 4.27 分。Claude Sonnet 5.5 在 Opus 5.5 发布六天后问世,得分为 56.00,落后它 1.62 分,而输出价格只有其一半。在同一个 Anthropic 代际内部,指数跨度比 Anthropic 的中档与 OpenAI 旗舰之间的整个差距还要大。因此,声称下一个 Fable 会超越上一款 OpenAI 旗舰并不离奇——层级结构本就隐含了这一点,而且无需任何新研究就能推出这一点。

那是对整起泄露事件最诚实的解读。这个传言并非因为数字不可信就不可信。它是不可证伪的,因为它所涉及的模型没有标识符,而它击败的那个模型已被取消。

除了等待,还能拿这个做什么?

如果你想获得传闻所描述方向的敞口,这种敞口现在已经存在,只需一把密钥。Claude Opus 5.5、Claude Sonnet 5.5、Claude Fable 5.1、GPT-6 Astra 和 GPT-6.1 Sol 都已上线 OrcaRouter,而 为它们提供服务的那一个 API按供应商的标价收费,0% 的加价是直接传导,而非额外叠加——所以当 Anthropic 或 OpenAI 调整价格时,你看到的数字会在供应商价目表变动的同一天随之变动。在像这个月这样的月份里,这一点比平时更重要:上述五个模型中有三个是在过去两周内发布的,而 GPT-6.1 Sol 以 $2 和 $10 的价格登场,正好位于一个输入成本是其五倍的旗舰模型之下。

A screenshot of the OrcaRouter model page for anthropic/claude-fable-5.1, headed 'Claude Fable 5.1' and credited 'by Anthropic - 2026-09-01', with Vision, Tools, JSON and Reasoning tags, a 1M-token context window, 128K maximum output, $10.00 per million input and $50.00 per million output tokens, a p50 latency figure of 4.86 s, the vendor description calling it Anthropic's Mythos-class successor to Claude Fable 5, and an OpenAI-compatible code-samples panel pointing at api.orcarouter.ai.

• 更换模型,无需更换合约——Opus 5.5 定价为 $4/$20,GPT-6 Astra 定价为 $10/$50,二者使用同一个端点和同一个密钥,因此用你自己的真实流量做一下午的评估,只需改动一个模型字符串,而不是一次迁移。

• 将可能存在泄露风险的模型置于故障转移之后——如果你想在将生产路径押注于下一个发布的模型之前先行尝试,跨提供商的自动故障转移可确保在新路由出现问题时调用仍能维持。

你不该做的,是围绕一个名称来做规划。Fable 5.5 没有标识符,所以没有任何东西可以写进配置文件,而一条建立在“它会在 Astra 附近登场”这一假设之上的路线,就是一条建立在一条四个字符的帖子之上的路线。要留意的是文档条目,而不是模型名称。当 Anthropic 发布 Fable 5.5 时,模型概览会把它列出来,会有一个模型页面存在,随后还会有一张价目表——而它会在同一天以供应商自己的价格出现在我们的目录中,无需任何人写一篇博客文章来讨论它是否胜过某个东西。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新