
Claude Opus 5.5 泄露:一个名为“claude-wafer-eap”的检查点,以及传闻中的周二发布
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
这个周末流传的说法,具体到足以核查,又单薄到一经核查便不攻自破:据称,下一次 Opus 更新的一个新检查点——现已被标注为 Claude Opus 5.5——已经到手,内部代号为"claude-wafer-eap",最早可能于 9 月 22 日(周二)发布。消息来源是 X 账号 @kimmonismus 转述一位名叫 Lyra 的爆料者。没有模型卡,没有 API 标识符,没有价格表,没有基准测试,也没有第二家媒体报出同一个检查点字符串。但在这一说法之下,确实有一件真实且有充分记录的事件:Claude Opus 5.2,这个未发布的 Opus 构建版在整个 9 月中旬以未更改的"Opus 5"标签向一部分流量提供服务,厂商则在 9 月 17 日夜里短暂将其切断。这一点得到了多家媒体的印证。而在此之上的所有内容,都只是一个账号的一家之言。还有第三点值得注意,那就是这则爆料对版本号本身做了什么:Claude Opus 5于 7 月 24 日发布,定价为每百万 token 5.00 美元/25.00 美元,至今仍是该厂商正式可用的最高端 Opus;Claude Fable 5.1于 9 月 1 日推出。如果下一个 Opus 真的是 5.5,那么命名已经直接跳过了 5.3 和 5.4——而在这个故事里,这个数字所起的作用,比任何基准测试都要大。
泄露内容实际声称什么
剥去包装后,有四项断言。第一,存在一个检查点——一个已经过训练、已保存,并正在某处进行分阶段部署的模型。第二,其版本号是 5.5,而不是 5.2 或 5.3。第三,它带有一个代号“claude-wafer-eap”,其中“eap”按厂商惯用简写读作 early-access program(早期访问计划)。第四,发布即将到来,可能在周二。
这些各自属于不同类型的说法,而它们得到的支持并不相同。第四个是有外部证据支持的那个,而该证据指向的是一个日期,而非一个代号。关于下一次 Claude Opus 发布的预测市场于9月16日开盘,其隐含概率的大部分集中在9月21日至24日,同时仍有相当一部分交易量押注“9月30日前不会发布”。该市场的结算规则很严格:模型必须可公开访问,并且必须明确命名为 Opus。Fable、Mythos、Sonnet 和 Haiku 的发布不算数。“Claude Opus 5.5”出现在该市场自己的合格名称列表中——该字符串最有可能就是从这里开始流传的,而这是一份可能性列表,不是目击报告。
这个代号是最薄弱的一环。“claude-wafer-eap”出现在信号文本中,而据我们所能确认,它不出现在其他任何地方:没有代码库引用,没有 API slug,没有配置泄露,也没有佐证性的说法。代号恰恰是那种会传播开来的细节,因为它听起来可验证。在第二个独立来源给出同一字符串之前,请将这一条视为未经证实。“Lyra”的归因同样如此——那是一个泄密者化名,没有任何可供我们核对的过往记录。
实际上验证了什么
经过验证的基线是 Claude Opus 5,而它的文档记录异常详尽,这正是它作为衡量标尺的价值所在。Anthropic 于 2026 年 7 月 24 日发布了它——中间没有 5.1 版本——具备 100 万 token 的上下文窗口、最高 128K 的输出 token(在 Batch API 上通过 beta 标头可达 300K)、默认开启的自适应思考,以及从 low 到 max 的五档推理努力级别。定价在所有提示长度下都保持统一:每百万输入 token 5.00 美元、每百万输出 token 25.00 美元,与之前的 Opus 4.8 相同,而 Batch API 则是这个价格的一半。Artificial Analysis 将其列在其智能指数(Intelligence Index)的首位,具体分数取决于你看的是哪个努力级别变体——这个细节值得记住,因为除非努力级别设置相匹配,否则“5.5”的记分板与“5”的记分板并不具有可比性。

在此之上,还有那起已获多方印证的九月事件。大约在 9 月 14 日至 15 日,开发者报告称,一小部分名义上发给 Opus 5 的请求,正由另一个后端模型作答,其请求元数据指向一个尚未发布的claude-opus-5.2——这个版本号直接跳过了 5.1。据报告,其行为表现包括输出更为简略,以及未经提示便自我迭代:写代码、跑测试、修复失败,如此反复直到测试通过,而不是半途停下。与之同时流传的识别技巧——在关闭搜索和记忆的情况下,就一个它本不该认识的人向模型提出某个特定问题——正是一种判断究竟由哪个后端作答的方法。9 月 17 日夜里,Anthropic 未作任何预告便切断了该通道,开发者社区将此事称为“午夜惊魂”;该通道约一天后恢复,而据这些报告,其范围已从 Claude Code 扩大到聊天与协作界面。这一切都没有任何模型卡、定价表、API 标识符或官方声明相伴。
版本号就是关键所在
这里是泄密在结构上弄对的部分,即便每一个具体细节都是错的。Anthropic今年已经两次证明,它会在没有发布会的情况下迭代Opus层级——5月下旬的4.8,7月24日的5(跳过了5.1),然后是一个存在于生产环境、却未公开存在的5.2。一个通过后端路由来发布、并控制推送比例的厂商,也可以最后一刻决定盒子上印哪个数字。如果下一款Opus被宣布为5.5而不是5.2,那是在技术工作完成之后做出的营销决定,而这类决定正是泄密者会较晚且不精确地听到的。
这对任何读到这条消息的人来说都是双刃剑。泄露的版本号作为能力证据很薄弱,作为定位证据却很有力。如果这个数字真的是5.5,那它暗示的跨度比5.2更大——也暗示Anthropic希望市场这样解读,而公司据报道已将IPO推向11月。路透社9月18日援引三名消息人士报道称,Anthropic正在权衡是否专门发布一款新模型,以应对GPT-6 Astra在企业端的势头,而该公司首席执行官却公开呼吁行业放慢脚步。在同一个检查点上用个更大的数字,成本为零,还能换来一个头条。这不是不相信泄露消息的理由;而是不把这个数字计入决策的理由。
到了星期二,必须满足什么条件?
9月22日的一次发布,大约五分钟内就能核查,值得现在就把核查项列出来,这样那则公告——如果它真的来了——就能被细读,而不是被囫囵吞下。
• 可用性——公开的模型卡、能返回补全结果的 API 模型标识符,或开放的滚动候补名单。封闭测试不符合条件,预测市场通常会据此判定为“否”。这条界线区分了“已发布”和“仅在部分账户上测试过”。
• 定价 — 新款 Opus 是维持 $5.00/$25.00 这一价位、将其上调或下调,还是以促销价登场。Opus 5 完全沿用了 Opus 4.8 的价格,这正是可预期的模式,因此也是需要核实的一点。
• 上下文与输出上限——Opus 5 的 1M 上下文和 128K 输出(Batch 模式下为 300K)是当前的下限。若新一代 Opus 发布时的规格低于此,那便是披着发布外衣的降级。
• 独立评分——在指定努力水平下的 Artificial Analysis 条目,而非供应商图表。泄露中的每一项能力声明目前均未复现,而单靠模型卡不会改变这一点。
• 路由行为——那些灰度测试报告中提到的简略、自我迭代的行为,在公开版本中是否依然存在,还是说它只是测试过程中的产物。这一行为变化是开发者实际观察到的最具体的东西,也最有可能在发布前被悄无声息地调掉。

试用一个未经验证的 Claude,而不把生产路径押在它上面
像这样的一周里,最令人尴尬的空档在于:所有人都想评估的那个模型,偏偏是没人能调用的那个。今天你能调用的是 Claude Opus 5——而如果 5.5 真的出现,实际问题就变成了:如何在不重写你的集成、也不把关键路径押注在一个没有任何独立基准测试的模型上的前提下,把一小部分真实流量导向它。
这正是路由机制为之而生的场景。OrcaRouter 将当前 Claude 全系列置于一个 API 密钥之后,按供应商标价提供,0% 加价——Claude Opus 5 采用 Anthropic 自己的 $5.00/$25.00,与厂商公布的数字完全一致,因此厂商调价当天我们这边即已生效,而无须等待同步完成。当新的 Opus 真正发布时,它只是多了一条路由,而不是又一份合同:你可以将一定比例的流量发送给它,让自动故障转移始终指向一个你已经充分了解其特性的模型,并用自己的提示词比较输出,而不是依赖泄露的基准测试。跨多个模型组合一次调用——由一个模型出草稿,另一个做校验——只需一行路由 DSL,而无须新建一个服务。

明确说明我们没有在说什么:OrcaRouter 上没有 Claude Opus 5.5,因为没有可供路由的 Claude Opus 5.5。在 Anthropic 发布之前,我们也不会有;本文不是产品页面的预览。本文中关于 5.5 的一切,都是对一份报告的报道。
该关注什么,该忽略什么
关注模型标识符。一个可用的 API slug 是正式发布与传闻之间的分界线,而它是泄密无法长久伪造的唯一产物。关注定价表,因为 Anthropic 正是在这里告诉你,它认为该模型属于哪个层级。关注灰度测试路由是否会在发布公告前恢复——重新拓宽的通道是比一条推文强得多的信号,而 9 月 17 日的先切断后恢复已经展示了那条通道从外部看起来是什么样子。
暂时先忽略这个代号。“claude-wafer-eap”是一个没有旁证的单来源字符串,其背后的“Lyra”归属也是如此。忽略版本号,不要把它当作除定位之外的任何证据。也忽略最初 48 小时内出现的任何记分牌——那些把公开的 Opus 5 与一个没人独立运行过的 5.5 作比较的记分牌,包括我们自己的(如果我们造了一个的话),直到比较的两边都有真实的东西为止。
如果周二过去了而没有发布,这并不能因此推翻该泄露;九月的 Opus 5.2 事件本身就是一个模型在生产环境中存在了数天、却无人能说出其名字的例子。在那之前,诚实的立场就是证据所支持的那一个:一周前确实有一个真实的、尚未发布的 Opus 构建版本在悄然提供服务,本周的市场中确实已经计入了一个真实的发布窗口,而有一个账号为其附上了一个数字、一个代号和一个日期,这些都没有其他任何人证实。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
