
OpenAI 的第二款循环模型:DevDay“禁忌轴”泄露究竟声称了什么
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
这篇文章所讨论的这一说法只有一个来源,那就是 X 上的一条帖子。9 月 24 日,账号 @scaling01写道,该厂商“打开了闸门,将在 DevDay 上发布其第二个循环语言模型,除 GPT-6 Astra 之外”,并将循环深度描述为“那条被禁的轴”,同时指出它“不再被禁”。全部内容就是如此:没有模型名称,没有模型 ID,没有价格,除了 9 月 29 日在旧金山举行的 DevDay 主题演讲之外没有其他日期,也没有来自该厂商的任何表态。让这一说法值得读者花时间的,不是那条推文,而是它背后已经落地的事实。GPT-6 Astra是该厂商于 9 月 3 日发布的模型,也是任何一家主要实验室推出的首个被报道与循环式递归深度架构相关联的生产模型。GPT-6 Sol和GPT-6 Luna于 9 月 22 日上线,价格分别为每百万 token 输入 $2 / 输出 $10 和输入 $0.10 / 输出 $0.50,把这面旗舰变成了一条价格阶梯。若真出现第二个循环模型,就意味着该厂商不再把循环深度当作一次性的押注,而是将其视为一种常设架构——这比任何单次发布都是更大的主张,也更难核实。
这是一篇阶段性汇总报道。所有归于发帖人或匿名爆料的内容均已如此标注,本文任何内容都不应被解读为官方发布。
为什么“禁忌轴”这个短语是这条推文里最有趣的部分
这个说法是发帖人自己的措辞,并非专业术语,但它指向了某种真实存在的东西。在 Transformer 的扩展中,有三条显而易见的轴:参数、数据和训练算力。通过循环获得的深度是第四条轴,而且它很奇特。循环模型不是堆叠 N 个不同的块,而是将同一小组块组成的堆栈重复使用 R 次,因此有效深度大致等于层数乘以循环次数,而参数量保持不变。Google DeepMind 阐述了这一理论,参见《用潜在思维进行推理:论循环 Transformer 的力量》,而被广泛引用的《用潜在推理扩展测试时计算:一种循环深度方法》则给出了实践层面的论证。
这不是免费的深度。关于循环语言模型的等深度缩放研究把循环等价指数定在约0.46——也就是说,多跑一次循环,你得到的收益大约相当于真正新增一个模块所能带来的46%。你是在以折扣价购买深度,而付出的代价是串行计算量,而不是内存。如果你受限于内存,或者想让一个小模型表现得像大模型,那就是一笔划算的交易——而这正是任何模型家族中廉价档位所追求的交换。
那么,为什么“被禁止”?因为循环内部发生的计算是在隐藏状态中进行的,而不是在输出的 token 中。自推理模型出现以来,思维链监控——读取模型在思考时写下的内容——一直是业界主要的保障工具,也正是这一工具才让调查人员得以理解七月 Hugging Face 智能体事件。一个在潜在空间中完成更多工作的模型,会给这一工具留下更少可读的内容。这就是两年来反对在前沿领域采用循环的论点,也是该技术在开放权重中扩散的原因——字节跳动 Seed 的 Ouro 有 1.4B 和 2.6B 版本,以及 Nanbeige4.2-3B,后者将 22 层堆栈运行两遍——而那些已公开安全承诺的实验室则避开了它。阿里巴巴的 MeSH 和 SpiralFormer 论文从效率侧攻克了同一问题。
OpenAI 实际说了什么,以及它没有说什么
引发这一切的报道来自The Information于9月1日和2日刊发的内容:Astra 使用了一种名为循环深度(recurrent depth)的技术,也被描述为不透明递归(opaque recurrence)。这家媒体消息来源扎实,过往记录有目共睹,但这终究仍是报道,而非官方文档。OpenAI 从未发表过架构论文来证实这种循环设计,而 Sebastian Raschka 广受关注的 Astra 解读明确指出,其循环结构是从公开声明中推断出来的——按照他的重建,Astra 会将其 22 个区块运行两遍,即实际有效应用 44 个区块,其中两轮循环为最优,更多循环则会破坏训练稳定性。
OpenAI 内部人士的说法,比媒体报道或舆论反弹所暗示的都要更有限、更审慎。首席科学家 Jakub Pachocki 于 9 月 2 日发帖称,包括 Astra 在内的前沿模型,其计算图深度与 GPT-4 相差不超过两倍——这是一种有界的循环,而非某些标题所暗示的极端递归——并反驳了他所称的混乱报道,同时承认思维链监控很脆弱,且正朝着负面方向发展。据报道,Astra 系统卡指出,推理轨迹的可监控性较GPT-5.6 Sol有所下降,这是一项实实在在的承认,并不取决于究竟是哪种架构导致了这一点。
安全方面的反应很激烈。Redwood Research 的 Buck Shlegeris 表示他极为担忧,并警告说把递归扩展下去可能会“彻底摧毁 CoT 的可监测性”;Ryan Greenblatt 和 Zvi Mowshowitz 也以不同方式提出了同样的论点。最有价值的反驳来自 Raschka:无论架构如何,OpenAI 自 o1 一代起就一直不公开原始推理轨迹,而一个更强的模型输出更短的思维链,本身并不构成存在隐藏推理通道的证据。
把这两段合在一起,你就得到了这条推文正在押注的局面。“Astra 处于循环中”是一则可靠报道,但 OpenAI 拒绝证实。“第二款循环模型将于9月29日发布”只是一条帖子。
OpenAI 九月五起泄露事件,以及这一次在其中所处的位置
九月涌现了一批密集的 OpenAI 泄密报道,而这些报道的有用之处在于,它们并非都属于同一类证据。
• 9月3日——字符串 gpt-6-astra和gpt-6-astra-aeon出现在了 Codex Desktop 内部的一个 Statsig 功能标志中,由 @notjazii 截图,并经 @kimmonismus 放大传播。Aeon 智能体的传闻由此而来。五周过去,Aeon 依然没有产品页面、没有价格、没有文档、没有基准测试,也没有任何能够解析的模型 ID。
• 9月21日 —— 一条“GPT-6 Sol medium”字符串出现在NVIDIA的合并记录中。
• 9月22日 — 三条 Azure 注册表路径,分别对应 gpt-6-sol、gpt-6-luna 和 gpt-6-astra-minor,被人从中国开发者论坛 locdd.com 以一条有效的 Microsoft URL 形式发布出来。次日我们抓取公开的 playground 配置端点时,其中并没有这三个新名称;注册表里存放的反而是 gpt-6-astra 以及更早的 GPT-5.6 世代条目。
• 9月22日 — GPT-6 Sol 和 GPT-6 Luna 发布。价格、模型 ID、SDK 发布说明、Bedrock 上架信息、GitHub Copilot 选择器条目以及 Perplexity 默认设置均在一天内相继跟进。
这个模式并不隐晦。那些在真正会交付的表面中携带某种产物的泄露类别——SDK 发布说明、云注册表、桌面功能开关——不断变成产品。那些只是一个名称的泄露类别则没有。今天的说法,即 OpenAI 在 DevDay 上推出的第二个循环语言模型,完全没有携带任何产物:没有字符串,没有开关,没有注册表路径,没有价格行,没有模型 ID。这并不使它错误。它使它无法从外部核查,而这是一种不同且更诚实的描述。
围绕它的 DevDay 日程是真实存在的,而且记录得异常详尽。
你能精确确定日期的唯一一件事就是这场活动。DevDay 2026 已确认将于 9 月 29 日星期二在旧金山 Fort Mason 举行,Sam Altman 将发表主题演讲,并提供免费直播——OpenAI 早在四月就公布了这一日期。
其中的预期内容已经被剧透得比平时更狠。Altman 在 9 月 15 日发帖称,OpenAI 这周有个“大发布,然后 DevDay 发布 x 6”,第二天晚上又收回了前半句:“我这周原本最期待发布的主要东西会改到下周,但在我看来值得等!”产品负责人 Tibo Sottiaux 曾把这周形容为 DevDay 级别,他在 9 月 19 日说发布仍会在周二到来,而 9 月 22 日果然如此——Sol 和 Luna,外加为付费账户预存的一次 Codex 使用额度重置。把“发布 x 6”理解为 DevDay 前后发布六样东西的计数,那么第二个循环模型完全符合这个短语的通常含义;把它理解为夸张说法,那就一点都不合。无论如何,这是创始人的帖子,不是路线图。
相邻爆料指向同一方向,却未点名任何模型。一个 Codex Cloud 构建版本出现在桌面版 ChatGPT build 9922 中,带有 Tailscale 和代理集成;而一个新用户引导流程展示了开发者套餐层级——Free、Prototype 和 Accelerate,最后一档为 $50——就在主题演讲前几天。两者都不是循环模型。两者都与一场更偏重平台而非研究的 DevDay 相符。
如果是真的,那是哪个型号?
没有人报告过身份,因此以下内容属于推断,应据此理解。
通往“OpenAI 的第二款循环模型”的最短路径,就是推出 Astra 的继任者。阿尔特曼曾表示,能力更强的模型将“很快”到来,而在循环深度基座上构建这样一款模型,成本最低的做法就是保留架构并提高循环预算——不是增加权重,而是提高每个 token 的循环次数。这种解读也最能解释“开闸”的说法,因为同一架构上的第二款旗舰,本身就是对第一款成功的宣告。
第二种解读是:这是现有 GPT-6 产品线内部的一个新层级。命名语法已经抛出了 gpt-6-astra-minor、gpt-6-sol 和 gpt-6-luna 这些字符串,而一个处于不同深度预算下的循环式同门模型,与一个如今每百万输出 token 价格横跨 $0.10 到 $50 的家族完全相符。一个更便宜的循环模型,将会是这件事中读者最能从钱包里感受到的版本。
第三种解读——一次循环式开放权重发布——得到的支持最少。它比任何其他解读都更能解释这个说法,而它本应与之为伍的开放循环文献,已经存在于 Ouro 和 Nanbeige4.2-3B 中;但 OpenAI 并未针对这一代朝这个方向宣布任何东西,而为了一个词去发明一个产品,正是泄密报道出错的方式。

怎样才能让这件事在9月29日之前变得可核查
按以下顺序,观察解决了最近三次泄漏的那些表面:
• 一个能在 OpenAI API 中解析的模型 ID,或其定价页面上新增的一行。
• openai-go 或 openai-node SDK 中一份列出新模型标识符的发布说明——Sol 和 Luna 正是这样泄露了自己的到来,SDK v3.65.0 在公告页面上线前数小时就发布了模型标识符。
• Bedrock 或 Azure 的上架条目,或桌面版构建中全新的 Statsig 标志字符串。
• 系统卡里的一句架构说明。这一句最关键,也最后才会出现,因为 OpenAI 从未证实过 Astra 的循环式设计。
除前三个之外的任何内容都是名称,而名称一直是整个周期中最不可靠的产物。

即使这条推文最终被证明是错的,为什么它仍然重要
如果循环深度成为常态而非例外,有两件事会发生变化。
第一点是保障。如果下一代模型把更多推理放在隐藏状态中进行,那么任何依赖阅读模型写出的思维链的评估都会失去信号——而这包括第三方安全评估,而不仅仅是 OpenAI 自身的监控。对于任何有保障要求的人来说,这是一个采购输入,而它不会在基准测试表中显现出来。
第二点是价格阶梯的形态。循环用串行计算换取参数,因此把成本从内存转移到时间:托管成本可能更低,但每个 token 的速度可能更慢。GPT-6 系列已经明确为这种权衡定价——GPT-6 Astra 每百万 token 输入 $10 / 输出 $50,是深度模型,GPT-6 Sol 为 $2 / $10,是速度快的那款,GPT-6 Luna 为 $0.10 / $0.50,是大用量那款。三者均已在 OrcaRouter 上按 OpenAI 的标价上线,无任何加价,所以如果第四款循环模型在 9 月 29 日上线,我们这边的价目表就是厂商发货当天的价目表——而厂商降价在那边上线的同一天,这里也会同步生效。
像这样的泄露,其实用价值不在于预测,而在于准备。一个可能五天后就会发布、又没有独立基准测试的模型,正是自动故障转移存在的意义所在:把某条路由指向新模型,让 GPT-6 Astra 或 GPT-6 Sol 留在它后面,那么糟糕的第一周只会让你损失一小部分流量,而不是毁掉你的生产路径。这也是测试深度密集型模型的合理方式——routing DSL 会把它和它要取代的那些模型组合进同一次调用里,而模型融合会让一组模型针对同一个提示词运行,这比任何发布文章都能更快地看清一个新架构。
今晚到底什么是真实的?
X 上有一篇帖子称,OpenAI 的第二款循环语言模型将于 9 月 29 日问世。没有模型 ID,没有价格,没有名称,没有第二个信源,也没有可核验的产物。其背后是:一款于 9 月 3 日发布的旗舰模型,报道称其采用循环架构,而 OpenAI 从未确认其采用循环架构;相对于 GPT-5.6 Sol,推理轨迹可监测性被承认出现下降;一位首席科学家称,这种循环被限制在 GPT-4 计算图深度的两倍以内;以及 9 月 22 日发布的一个廉价层级,使这一架构问题具有商业意义,而非学术意义。
那是一个靠厚实叙事支撑的单薄说法,而这正是事件发生前五天泄密消息的常见形态。如果周二在 Fort Mason 出现第二个循环模型,耐人寻味的细节不会是基准测试数字——而是系统卡是否会重复那条可监控性告诫。正是那一句话告诉你,“不再被禁止”是一句口号,还是一项政策。

本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
