
OpenAI 的第二款循環模型:DevDay「禁忌軸」外洩內容究竟在宣稱什麼
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
本文所談的這項說法只有一個來源,而且只是 X 上的一則貼文。9 月 24 日,帳號 @scaling01寫道,該廠商「打開了閘門,將在 DevDay 上發布他們除了 GPT-6 Astra 之外的第二個循環式語言模型」,並把遞迴深度形容為「禁忌的軸線」,同時指出它「不再是禁忌」。整件事就是這樣:沒有模型名稱、沒有模型 ID、沒有價格,除了 9 月 29 日在舊金山舉行的 DevDay 主題演講之外也沒有日期,更沒有來自該廠商的任何說法。這項說法之所以值得讀者花時間一讀,不在於那則推文,而在於它背後已經落實的事實。GPT-6 Astra是該廠商於 9 月 3 日發布的模型,也是任何主要實驗室中,首個被報導與循環式、遞迴深度架構連結起來的正式量產模型。GPT-6 Sol與GPT-6 Luna於 9 月 22 日推出,每百萬個 token 輸入 2 美元/輸出 10 美元,以及輸入 0.10 美元/輸出 0.50 美元,把這款旗艦模型變成了一條價格階梯。若真有第二個循環式模型,就意味著該廠商不再把遞迴深度當成一次性的賭注,而是視為常設架構——這比任何單一產品的發布都是更大的宣稱,而且查證起來困難得多。
這是一篇「目前所知」的整理文章。凡歸因於發文者或匿名報導的內容,都已如此標明,且此處任何內容都不應被解讀為正式發布。
為什麼「禁忌軸線」這個說法才是這則推文最有趣的部分
這個說法是發文者自己的措辭,並非專業術語,但它指向了某個真實存在的東西。在 transformer 的擴展中,有三個顯而易見的軸向:參數、資料與訓練算力。以循環換取深度是第四個,而且它很奇特。迴圈模型不是堆疊 N 個不同的區塊,而是將同一小組區塊重複使用 R 次,因此有效深度大致是層數乘以迴圈次數,而參數數量則維持不變。Google DeepMind 在Reasoning with Latent Thoughts: On the Power of Looped Transformers中提出了理論,而廣被引用的Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach則提出了實務上的論證。
這不是免費的深度。針對迴圈式語言模型的等深度縮放研究,把遞迴等價指數定在約 0.46——也就是說,多跑一次迴圈,大約能換得真正新增一個區塊所能換得效果的 46%。你是在用折扣價買深度,並以序列算力而非記憶體來支付代價。如果你受制於記憶體,或想讓小模型表現得像大模型,這就是一筆划算的交易,而這正是任何模型家族中低價層級所尋求的交易。
那麼,為什麼說它「被禁止」?因為迴圈內部發生的運算是在隱藏狀態中進行的,而不是在輸出的詞元裡。思維鏈監控——也就是閱讀模型思考時寫下的內容——自推理模型問世以來一直是業界主要的保證工具,而正是這項工具讓調查人員得以理解七月 Hugging Face 代理事件的全貌。一個把更多工作放在潛在空間中完成的模型,能讓這項工具讀到的東西更少。這是兩年來反對在前沿領域採用迴圈的理由,也是這項技術在開放權重中擴散開來的原因——位元組跳動 Seed 的 Ouro,規模為 1.4B 與 2.6B,以及 Nanbeige4.2-3B,後者讓一個 22 層的堆疊跑兩遍——而發表了安全承諾的實驗室則避開不用。阿里巴巴的 MeSH 與 SpiralFormer 論文則從效率面切入同一個問題。
OpenAI 實際上說了什麼,以及未說什麼
最初引發這一切的報導是The Information於9月1日和2日發布的內容:Astra 使用了一種稱為循環深度(recurrent depth)的技術,也被描述為不透明遞迴(opaque recurrence)。那是一家消息來源可靠、確實有實績的媒體,而且這仍然只是報導,而非官方文件。OpenAI 從未發表過架構論文來證實這種迴圈設計,而 Sebastian Raschka 廣為流傳的 Astra 解析明確指出,這種迴圈結構是根據公開聲明推斷而來的——他的重建顯示,Astra 將其 22 個區塊執行兩次,形成 44 次有效區塊應用,其中兩次迴圈是最佳狀態,而更多迴圈則會使訓練更不穩定。
OpenAI 自家員工所說的內容,比報導或反彈所暗示的更為限縮且審慎。首席科學家 Jakub Pachocki 於 9 月 2 日發文表示,包括 Astra 在內的前沿模型,其計算圖深度與 GPT-4 相差在兩倍以內——是有界的迴圈量,而非某些頭條所暗示的極端遞迴——並反駁他所稱的混亂報導,同時承認思維鏈監控很脆弱,且正朝負面方向發展。據報導,Astra 的系統卡指出,推理軌跡的可監控性比GPT-5.6 Sol退了一步,這是一項實質承認,且不取決於是由哪種架構造成。
安全圈的反應很強烈。Redwood Research 的 Buck Shlegeris 表示他極為擔憂,並警告把遞迴規模放大可能「徹底摧毀 CoT 可監測性」;Ryan Greenblatt 與 Zvi Mowshowitz 也以不同語調提出相同論點。最有用的反駁來自 Raschka:無論架構為何,OpenAI 自 o1 世代以來就一直不公開原始推理軌跡,而更強的模型輸出較短的思維鏈,本身並不構成存在隱藏推理通道的證據。
把這兩段放在一起,就會得出這則推文正在押注的局勢。「Astra 已迴圈化」是 OpenAI 拒絕證實的可信報導。「第二個迴圈模型將於 9 月 29 日推出」則只是一則貼文。
五起九月的 OpenAI 洩密事件,以及這一起所處的位置
九月湧現了一大批密集的OpenAI洩密報導,而這些報導有用之處在於,它們並非全都屬於同一類證據。
• 9 月 3 日——這些字串gpt-6-astra 和 gpt-6-astra-aeon 出現在 Codex Desktop 內的一個 Statsig 功能旗標中,由 @notjazii 截圖並經 @kimmonismus 放大傳播。Aeon 代理的故事就是由此衍生。五週過去,Aeon 仍沒有產品頁面、價格、說明文件或基準測試,也沒有任何可解析的模型 ID。
• 9 月 21 日 — 一組「GPT-6 Sol medium」字串出現在 NVIDIA 的合併紀錄中。
• 9 月 22 日——三個 Azure 登錄檔路徑,分別對應 gpt-6-sol、gpt-6-luna 與 gpt-6-astra-minor,從中國開發者論壇 locdd.com 以可用的 Microsoft 網址形式發布。隔天我們抓取公開的 playground 設定端點時,這三個新名稱並不在其中;登錄檔裡反而是 gpt-6-astra 以及較舊的 GPT-5.6 世代項目。
• 9 月 22 日 — GPT-6 Sol 與 GPT-6 Luna 正式推出。價格、模型 ID、SDK 發行說明、Bedrock 上架資訊、GitHub Copilot 挑選器項目,以及 Perplexity 預設選項,全都在一天內陸續跟進。
這個模式並不隱晦。那些在真正出貨的介面上帶有具體痕跡的外洩類別——SDK 發行說明、雲端登錄檔、桌面功能旗標——最終都變成了產品。那些只有名字的外洩類別則沒有。今天在 DevDay 上宣稱的、來自 OpenAI 的第二個迴圈式語言模型,完全沒有任何具體痕跡:沒有字串、沒有旗標、沒有登錄路徑、沒有價格列、沒有模型 ID。這並不代表它是錯的。這讓它無法從外部查核,而這是另一種、也更誠實的描述。
圍繞它的 DevDay 議程陣容真有其事,而且有異常詳盡的紀錄。
唯一能精確確定日期的,就是這場活動。DevDay 2026 已確認將於 9 月 29 日星期二在舊金山 Fort Mason 舉行,由 Sam Altman 發表主題演講,並提供免費直播——OpenAI 早在四月就公布了這個日期。
其中預期會有的內容,這次被預告得比往常更明顯。Altman 在 9 月 15 日發文說,OpenAI 這週會有「一場重大發布,然後在 devday 發布 x 6」,並在隔天晚上收回前半段說法:「我原本很期待這週推出的主要東西,會改成下週推出,但在我看來值得等待!」產品負責人 Tibo Sottiaux 曾把這週定調為 DevDay 規模,他在 9 月 19 日表示發布仍會在週二登場,而到了 9 月 22 日真的推出了——Sol 和 Luna,外加一次為付費帳號保留的 Codex 使用量重置。把「發布 x 6」解讀為 DevDay 前後有六樣東西發布,那麼第二個迴圈模型就完全符合這句話的一般意思;把它解讀為誇飾,則完全不合。無論哪種解讀,這都是創辦人的貼文,不是路線圖。
相鄰的外洩消息指向同一方向,卻未點名任何模型。一個 Codex Cloud 版本在桌面版 ChatGPT build 9922 中現身,帶有 Tailscale 與 proxy 整合;而一段入門流程顯示了開發者方案層級——Free、Prototype 與 Accelerate,最後一個為 50 美元——就在主題演講前幾天。兩者都不是迴圈模型。兩者都與一場更偏重平台而非研究的 DevDay 相符。
如果這是真的,那是哪個型號?
沒有人回報身分,因此以下內容屬於推論,應如此理解。
通往「OpenAI 第二款迴圈模型」的最短路徑,就是 Astra 的後繼者。Altman 曾表示,能力更強的模型「很快」就會推出,而在遞迴深度基礎上打造這類模型最便宜的方法,就是保留架構並提高迴圈預算——讓每個詞元有更多遞迴,而不是增加更多權重。這種解讀也最能解釋「閘門大開」的說法,因為在同一架構上推出第二款旗艦模型,就是在宣告第一款奏效了。
第二種解讀是現有 GPT-6 系列中的一個新層級。命名語法已經冒出 gpt-6-astra-minor、gpt-6-sol 和 gpt-6-luna 這些字串,而在不同深度預算下的一款迴圈同類模型,與這個如今橫跨每百萬輸出詞元 $0.10 到 $50 的家族完全吻合。一款更便宜的迴圈模型,會是讀者最能從錢包裡感受到的版本。
第三種解讀——迴圈式開放權重發布——是最缺乏支持的。它會比任何其他說法都更能解釋這個措辭,而它將並列其中的公開迴圈文獻,早已存在於 Ouro 和 Nanbeige4.2-3B 之中;但 OpenAI 針對這一代並未宣布任何朝此方向的計畫,而為了遷就一個詞而憑空發明產品,正是洩密報導出錯的方式。

什麼能讓這件事在 9 月 29 日之前變得可供查核?
依此順序,留意那些解決了最近三次洩漏的表面:
• 能在 OpenAI 的 API 中解析的模型 ID,或其定價頁面上新增的一列。
• openai-go 或 openai-node SDK 中的一則發行說明,命名了新的模型識別碼——這正是 Sol 和 Luna 洩露自身登場的方式,SDK v3.65.0 在公告頁面上線前數小時就發布了模型識別碼。
• Bedrock 或 Azure 清單,或桌面版建置中全新的 Statsig 旗標字串。
• 系統卡裡的一句架構描述。這句最為關鍵,卻會最後才出現,因為 OpenAI 從未證實 Astra 的迴圈式設計。
除了前三項之外,其他任何東西都是名稱;而在這整個週期中,名稱一直是最不可靠的產物。

為什麼即使這則推文最後證明是錯的,它仍然重要
如果循環深度成為標準而非例外,有兩件事會改變。
第一項是保證。如果下一代模型在隱藏狀態中進行更多推理,那麼任何依賴讀取模型書面思維鏈的評估都會失去訊號——而這包括第三方安全評估,不只是 OpenAI 自家的監控。對任何有保證需求的人來說,這是一項採購輸入,而且它不會顯示在基準測試表中。
第二點是價格階梯的形狀。迴圈架構以序列化運算換取參數,因此把成本從記憶體轉移到時間:代管起來可能更便宜,但每個 token 可能更慢。GPT-6 系列已經明確為這項取捨定價——GPT-6 Astra 每百萬 token 輸入 $10/輸出 $50,是深度模型,GPT-6 Sol 為 $2/$10,是速度快的那款,GPT-6 Luna 為 $0.10/$0.50,是主打高用量的那款。這三款全都已在 OrcaRouter 上以 OpenAI 的定價表價格上線,不加任何價差,所以如果第四款、採迴圈架構的模型在 9 月 29 日推出,我們這邊的價目表就是供應商在它上線當天的價目表——而供應商一旦降價,在他們那邊生效的同一天,這裡也會生效。
像這樣的爆料,其實際用途不在於預測,而在於準備。一個可能五天後就會推出、卻沒有獨立基準測試的模型,正是自動容錯移轉存在的理由:把某條路由指向新模型,讓 GPT-6 Astra 或 GPT-6 Sol 留在它後面,這樣即使第一週表現不佳,你損失的也只是部分流量,而不是你的正式生產路徑。這也是測試深度密集型模型的明智做法——路由 DSL 會把它與它預定要取代的模型一起組合成單一呼叫,而模型融合會讓一組模型針對同一個提示詞運行,這比任何發布文章都更快看出新架構的表現。
今晚究竟什麼才是真的?
X 上有一則貼文稱,OpenAI 的第二款循環語言模型將於 9 月 29 日推出。沒有模型 ID、沒有價格、沒有名稱、沒有第二個消息來源、沒有可供查證的產物。在這則貼文下方:一款於 9 月 3 日推出的旗艦模型,報導稱其為循環式,但 OpenAI 從未證實其為循環式;相較於 GPT-5.6 Sol,推理軌跡可監測性出現已獲承認的下滑;一位首席科學家表示,循環被限制在 GPT-4 計算圖深度的兩倍以內;以及一款於 9 月 22 日推出的低價方案,讓這個架構問題不再只是學術問題,而具有商業意義。
那是一個單薄的說法,撐在一個厚實的故事之上,而這正是活動前五天洩漏消息的常見樣態。如果週二在 Fort Mason 出現第二個迴圈模型,有趣的細節不會是基準測試數字——而是系統卡是否重複那個可監控性但書。就是那單一句話,能告訴你「不再被禁止」究竟是口號還是政策。

本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
