Claude Sonnet 5.5 的主视觉卡片,标题为“一次隐蔽测试,还是你早已拥有的价目表”,带有三个胶囊标签:“尚未发布”、“未公布模型 ID”和“已宣布:未来几周内”,页脚引用 2026 年 9 月 24 日的一则 X 帖子和 Anthropic 于 2026 年 9 月 22 日发布的 Opus 5.5 上线帖,OrcaRouter 标志位于右下角
Guides & Insights

Claude Sonnet 5.5:由四个已然存在的数字拼凑而成的隐秘测试泄露

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

9月24日,X 上贴出了四个数字,作为 Claude Sonnet 5.5“已经开始秘密测试”的证据:100万 token 的上下文窗口、12.8万 token 的最大输出、每百万输入 token 2 美元、每百万输出 token 10 美元。这四个数字目前都挂在 Anthropic 自己的价目表上,对应的是 Claude Sonnet 5——也就是 5.5 将会取代的那款模型,该模型自 2026 年 6 月 30 日起全面可用。同样的 2 美元 / 10 美元标价也属于 GPT-6 SolOpenAI 于 9 月 22 日发布了它,而正是这种重合,让这条帖子读起来像是在回应 OpenAI,而非一次常规的档位更新:“在我看来,这是对 GPT-6-Sol 的直接回应。定价相同,性能想必也相似。”

这一切都不能说明该说法是错的。它只是让该说法变得不可证伪,而这是一个不同且更值得记录下来的问题。一次隐蔽测试的目击,其价值只取决于它背后的实物证据,而这一次背后的实物证据,是一份与 Anthropic 已连续十二周对外提供的模型无法区分的规格表。

实际发布的是什么

来源是账号 @kimmonismus 于 2026 年 9 月 24 日发布的一条 X 帖子。它写明了上下文窗口、输出上限和两个价格,将定价与 GPT-6 Sol 进行对比,并得出结论:Sonnet 5.5 正在测试中。其中没有截图,没有模型字符串,没有 API 响应,没有控制台列表,没有测试人员对行为的描述,也没有任何第二观察者与其中任何内容相关联。这条帖子是一则包含数字的说法,而这些数字是该层级的公开上限。

这值得与 Anthropic 另一类发布前消息区分开来,因为 2026 年两者都出现了,而且它们看起来毫不相像。8 月的早期访问标识符 claude-marshmallow-eap 和 claude-melon-eap 是请求中存在的字符串——丑陋、不起眼,而且可核查。贯穿 9 月的 Opus 5.2 消息则是一份路由报告:开发者注意到“Opus 5”标签背后的后端给出了不同的应答,并描述了其行为。两者都是实物证据。“已经在被秘密测试”却没有附上任何实物证据,这不过是对 Sonnet 层级已经在售内容的概括。

来源本身还有一个值得注意的模式。同一账号在9月20日发布了一篇汇总,开头提到了四款据称“已经开始接受测试”的模型——Claude Sonnet 5.2、Claude Opus 5.2、Claude Fable 5.2 和 Gemini 4 Pro。在这四个名字中,Opus 和 Fable 这两个条目背后有独立且可相互印证的报道,而 Gemini 这个条目也有自己的踪迹。Sonnet 这个条目原本只是列表中的一个位置。四天后,关于 Sonnet 的说法已经长出了一份规格表,而这份规格表所描述的,正是那个已经存在的模型。

这四个数字是 Claude Sonnet 5 的数值。

这部分检查起来只需三十秒,却几乎没有人做过。今天查看 Anthropic 的模型概览页面,上面列出 Claude Sonnet 5:1M token 上下文窗口、128K 最大输出,以及每百万 token 2 美元 / 10 美元。把泄露的信息与它对照一下:

• 上下文窗口 — Claude Sonnet 5.5 声称支持 100 万 tokens;Claude Sonnet 5 公布支持 100 万 tokens

• 最大输出——声称 128K tokens;已发布 128K tokens

• 输入价格 — 每百万次调用 2 美元(已领取);每百万次调用 2 美元(已发布)

输出价格——每百万条认领 $10;每百万条发布 $10

• 模型 ID — Claude Sonnet 5.5 尚未发布任何内容;Claude Sonnet 5 对应 claude-sonnet-5

• 独立评分——所声称的模型没有任何评分;Artificial Analysis 在自适应推理、最大努力配置下,将 Claude Sonnet 5 的 Intelligence Index 定为 38,在其测量的 210 个模型中排名第 54。

Two-column scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the scoreboard'. The left column, Claude Sonnet 5.5 (leaked), reads: context window 1M tokens; max output 128K tokens; input price 2 dollars per million; output price 10 dollars per million; model ID none published; independent scores none. The right column, Claude Sonnet 5 (shipped June 30, 2026), reads: context window 1M tokens; max output 128K tokens; input price 2 dollars per million; output price 10 dollars per million; model ID claude-sonnet-5; independent scores AA Index 38. The footer reads 'Claude Sonnet 5 figures per Anthropic and Artificial Analysis; Claude Sonnet 5.5 figures unverified, single observer.'

这个定价点还有第二层,而爆料把它弄反了。Claude Sonnet 5 发布时,$2 / $10 被宣布为导入期定价,持续到 2026 年 8 月 31 日,并计划于 9 月 1 日上调至 $3 / $15。那次上调并未发生。Anthropic 的定价页面如今带有一条脚注,称 $2 / $10“现在已是标准价格”,并且“原定于 2026 年 9 月 1 日将每百万输入/输出 token 上调至 $3 / $15 的涨价将不会发生”。因此,爆料所呈现为新模型竞争武器的那个价格,其实是现有模型的永久费率——这意味着,以 $2 / $10 推出的 Sonnet 5.5 根本没有任何折扣,而是要进入一个已经对标 GPT-6 Sol 定价的档位。

唯一一件 Anthropic 真正说过的事

剥离掉所有来自匿名泄密者的内容后,只剩下一句第一方的话。当 Anthropic 于 2026 年 9 月 22 日发布 Claude Opus 5.5 时,它表示 Claude Sonnet 5.5 和 Claude Haiku 5.5 将"在未来几周内"跟进,带来在性能、效率与安全性方面相当的增长。这句话就是全部已获确认的记录。它没有型号 ID、没有上下文窗口、没有价格、没有基准测试、也没有日期——尤其是,它完全没有提到任何暗中测试、灰色渠道,或任何形式的测试。

Anthropic 其余公开信息也与这一解读相符。模型总览页仍然只列出四款模型——Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5 和 Claude Haiku 4.5——没有第五行,没有对应的定价条目,也没有为 Sonnet 的后继型号标注"即将推出"。如果某个 Sonnet 级别的检查点正在开发者能够访问的某处提供服务,那么这个标识符一定会最先浮现出来,因为一个正在对外提供服务的模型必须在请求中拥有一个名称。但什么都没有出现。

九月的公告确实澄清了一件事:它推翻了早先的爆料,该爆料称 Haiku 产品线将被淘汰,并且 5.5 代将重组产品阵容。据 Anthropic 称,Haiku 5.5 即将推出,这意味着重组传闻错在了爆料者很少会出错的方向上——低价档将继续保留。

八月的泄露消息说是200万个token。这次说的是100万个。

在9月24日那篇帖子发布六周前,也就是8月9日,另一个 X 账号发布了一份“SONNET 5.5 LEAK”规格表,其中提出了一个大胆得多的说法:200 万 token 的上下文窗口,是 Sonnet 5 的两倍;推理速度更快;浏览器和终端工具使用能力更强;性能接近 Claude Fable 5;并且将在“下个月”发布。那份泄露信息还附带了一张仿照 Anthropic 预览卡样式制作的图片。它还带有一个致命细节,批评者立刻抓住了这一点:它给出的代号“Fennec”,正是 6 月 30 日随 Claude Sonnet 5 一同发布的代号。一个代号不可能成为使用过它的模型后继者的新证据。

所以,两波爆料在唯一被引用最多的那个数字上相互矛盾。八月说的是 2M 上下文。九月说的是 1M。两者不可能是在描述同一个构建版本。最可能的解读正是那个最无趣的:九月那篇帖子描述的是 Sonnet 档位已公布的限制,因为从外部看,Sonnet 档位的模型就是这样;而八月那篇帖子则是在猜测一次刷新可能会合理地翻倍到什么程度。注意这个数字移动的方向——向下,朝着已经存在的东西。

那么 GPT-6 Sol 的对比是正确的吗?

大体如此——而它出问题的地方才是有意思的部分。GPT-6 Sol 于 2026 年 9 月 22 日发布,与 Claude Opus 5.5 在同一天,其标价起价为每百万输入 2 美元、每百万输出 10 美元——恰好是 Sonnet 5 的价格,也恰好与泄露信息中对 Sonnet 5.5 的说法一致。它提供 1,050,000 token 的上下文窗口,输出上限为 128K,两者都与 Claude Sonnet 5 的数字仅有些微差别。更便宜的兄弟型号 GPT-6 Luna 的定价为 0.10 美元 / 0.50 美元。

长上下文的计费存在断层。GPT-6 Sol 采用两档定价:在 272,000 个输入 token 以内为 $2 / $10,超出后为 $4 / $15。Anthropic 在 Sonnet 系列上并不这么做——Claude Sonnet 5 对完整的 1M 上下文窗口一律按标准费率计费,因此一个 900K token 的请求与一个 9K token 的请求单位 token 成本相同。所以,真正的 Sonnet 5.5 与真正的 GPT-6 Sol 对比:对于普通提示词,两者价格持平;而对于这两款模型都在主推的长文档和大代码库工作负载,则存在两倍的差距。“定价相同”这句话在标题层面成立,但在决定选用哪一档的工作负载上并不成立。

第二个需要提醒的地方,潜藏在整场对比之下。Claude Sonnet 5 使用的是 Anthropic 更新的分词器,同样的文本会因此比上一代多产生约 30% 的 token。标价不等于账单;账单是每项任务消耗的 token,而那个数字从未出现在任何一份泄露信息里。

什么会让 Sonnet 5.5 变得重要

先放下它是否存在这个问题,问问对于付费购买token的人来说会有什么改变。四点,而且没有一个是参数表。

第一条是低于 $2 / $10 的价格。随着 9 月 1 日的涨价被取消,现有厂商的费率如今已是永久性的——因此,继任者若维持相同费率,只是横向平移,而在 Sonnet 档,唯一能撬动资金的消息就是降价。

第二个是超过 100 万的上下文。那正是八月那次泄露的实际主张,也是那次泄露所能点名的唯一一个在位者尚未覆盖的能力缺口。

第三点是每任务 token 数。Claude Sonnet 5 的自适应思考默认开启,独立分析已测得它每任务生成的输出 token 数量显著多于前代。如果有一个版本能保持 $2 / $10 的费率并阻止这种膨胀,那么它削减实际账单的幅度将超过名义上的降价。

第四项是一个标识符。一个 API 模型字符串、一行文档记录、一条定价条目、一张模型卡——其中任何一样都能终结这场争论;而在一场如此直白的泄露之后,这四样东西竟全部缺席,这本身就是这个故事里最能说明问题的事实。

你今天可以呼叫的对象

Claude Sonnet 5 并非等待档位理清之前的临时占位。它已经是大多数 Claude API 流量实际运行的模型,具备 100 万 token 上下文窗口、128K 输出,以及 $2 / $10 的费率——如今这已是标准定价,而非促销价。

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38 at rank 54 of 210, an output speed of 79.3 tokens per second at rank 77 of 210, a cost of $2.00 per million input tokens and $10.00 per million output tokens with a 90% cache discount and $5.09 cost per Intelligence Index task, a verbosity of 370M output tokens, reasoning enabled, and a 1M token context window

它自六月起就已上线 OrcaRouter,采用 Anthropic 自家的 $2 / $10按供应商列表价原样传递,不加价,因此 Sonnet 产品线若发生厂商调价,这里当天就会生效,而不会等到下一个计费周期。同一个密钥已经可以按 $2 / $10 访问 GPT-6 Sol,这在像本文这样的内容里比平常更重要:泄漏所依赖的比较,是你用一份凭证而不是两份合同就能自行进行的比较。

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M token context window, 128K maximum output, text plus image and file inputs, an INPUT price of $2.00 per million tokens and an OUTPUT price of $10.00 per million tokens, a p50 time to first token of 5.67 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

这也是回答此次泄露所引发的问题的最廉价方式。如果 Sonnet 5.5 真的出现,它会像其他任何东西一样出现在目录中,你只需将一部分流量导向它,置于向 Claude Sonnet 5 自动故障转移的兜底之下——无需第二次集成,无需重新协商,也不会有任何生产路径依赖于一个无人独立做过基准测试的模型。试用一个未经证实的层级是一个路由决策,而不是一个迁移项目。

与其关注下一个泄密帖,不如关注什么

三种信号,按它们能告诉你的信息量从高到低排列。一个标识符是决定性的,因为一个已提供服务的模型必须在请求中有名字,而 2026 年每一个可核查的 Anthropic 发布前消息正是借此变得可核查。厂商确认——模型卡、文档中的一行、定价条目,或者该模型直接出现在 Anthropic 自己的列表中——会彻底终结此事;“未来几周”这句话意味着其中确实有一项是欠着的。测试者报告描述的是行为而非规格,是三者中最弱的,但仍比今天已有的要多。

在其中任何一个落地之前,诚实的总结是:Anthropic 已承诺在未来几周内推出 Sonnet 更新,而一位观察者用它将取代的模型的数字来描述它。如果你的技术栈已经在运行 claude-sonnet-5,那就没有什么可等待的,也没有什么可围绕它规划的。如果你正在将 Claude Sonnet 5 与 GPT-6 Sol 进行权衡,那么你能据以行动的数字是已经公布的那些——而这些数字,正是这则泄露消息试图当作新闻卖给你的同一批数字。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新