
Mô hình lặp thứ hai của OpenAI: Rò rỉ 'Trục cấm' tại DevDay thực sự nói điều gì
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 177 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1323 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Chỉ có đúng một nguồn cho tuyên bố mà bài viết này bàn tới, và đó là một bài đăng duy nhất trên X. Vào ngày 24 tháng 9, tài khoản @scaling01 đã viết rằng nhà cung cấp "đã mở toang cánh cổng và sẽ phát hành mô hình ngôn ngữ dạng vòng lặp thứ hai của họ bên cạnh GPT-6 Astra tại DevDay", mô tả độ sâu tái quy là "trục bị cấm" và lưu ý rằng nó "không còn bị cấm nữa". Chỉ có vậy và không hơn: không có tên mô hình, không có mã mô hình, không có giá, không có ngày nào ngoài bài phát biểu chính DevDay ngày 29 tháng 9 tại San Francisco, và không một lời nào từ phía nhà cung cấp. Điều khiến tuyên bố này đáng để người đọc bỏ thời gian không phải là dòng tweet mà là những sự thật đã được đưa ra thực tế bên dưới nó. GPT-6 Astra, mô hình mà nhà cung cấp phát hành ngày 3 tháng 9, là mô hình sản xuất đầu tiên từ bất kỳ phòng thí nghiệm lớn nào mà các bài báo đã gắn với kiến trúc độ sâu tái quy dạng vòng lặp. GPT-6 Sol và GPT-6 Luna, ra mắt ngày 22 tháng 9 với mức giá 2 đô đầu vào / 10 đô đầu ra và 0,10 đô đầu vào / 0,50 đô đầu ra mỗi triệu token, đã biến mô hình chủ lực đó thành một thang giá. Một mô hình dạng vòng lặp thứ hai sẽ có nghĩa là nhà cung cấp không còn coi độ sâu tái quy như một canh bạc đơn lẻ nữa mà như một kiến trúc thường trực — một tuyên bố lớn hơn bất kỳ lần ra mắt đơn lẻ nào, và cũng khó kiểm chứng hơn nhiều.
Đây là bài tổng hợp những gì chúng ta biết đến nay. Mọi thông tin được quy cho một người đăng bài hoặc cho nguồn tin ẩn danh đều được ghi nhãn rõ ràng như vậy, và không nội dung nào ở đây nên được hiểu là một thông cáo chính thức.
Vì sao cụm từ 'forbidden axis' lại là phần thú vị nhất của dòng tweet
Cách diễn đạt này là của chính người đăng, không phải một thuật ngữ chuyên môn, nhưng nó ám chỉ một điều có thật. Trong việc mở rộng quy mô transformer, có ba trục hiển nhiên: tham số, dữ liệu và tính toán huấn luyện. Độ sâu nhờ hồi quy là trục thứ tư, và nó là một trục kỳ lạ. Thay vì xếp chồng N khối riêng biệt, một mô hình dạng vòng lặp tái sử dụng cùng một chồng khối nhỏ R lần, nên độ sâu hiệu dụng xấp xỉ bằng số lớp nhân với số lần lặp trong khi số tham số vẫn không đổi. Google DeepMind đã trình bày lý thuyết trong Suy luận với những suy nghĩ tiềm ẩn: Về sức mạnh của Transformer dạng vòng lặp, và bài viết được trích dẫn rộng rãi Mở rộng tính toán tại thời điểm kiểm thử với suy luận tiềm ẩn: Một cách tiếp cận độ sâu hồi quy đã đưa ra luận cứ thực tiễn.
Đó không phải là độ sâu miễn phí. Công trình về scaling đẳng-độ-sâu trên các mô hình ngôn ngữ dạng vòng lặp đặt số mũ tương đương hồi quy vào khoảng 0,46 — nghĩa là một vòng lặp thêm vào mang lại cho bạn khoảng 46% những gì một khối thực sự mới sẽ mang lại. Bạn đang mua độ sâu với giá chiết khấu, và trả giá cho nó bằng tính toán tuần tự thay vì bộ nhớ. Đó là một cuộc trao đổi có lợi nếu bạn bị giới hạn bởi bộ nhớ hoặc muốn một mô hình nhỏ hành xử như một mô hình lớn, và đó chính xác là cuộc trao đổi mà các tầng rẻ nhất của bất kỳ dòng mô hình nào đang tìm kiếm.
Vậy tại sao lại "bị cấm"? Bởi vì phép tính diễn ra bên trong vòng lặp xảy ra ở trạng thái ẩn, chứ không phải ở các token được phát ra. Giám sát chuỗi suy luận — đọc những gì mô hình ghi ra trong khi nó suy nghĩ — đã là công cụ bảo đảm chính của ngành kể từ khi các mô hình suy luận xuất hiện, và chính nó là công cụ đã khiến sự cố tác nhân Hugging Face hồi tháng Bảy trở nên có thể hiểu được đối với các điều tra viên. Một mô hình làm nhiều phần việc hơn trong không gian tiềm ẩn sẽ cho công cụ đó ít thứ để đọc hơn. Đó đã là lập luận chống lại việc lặp ở tuyến đầu suốt hai năm qua, và đó là lý do kỹ thuật này lan rộng trong các trọng số mở — Ouro của ByteDance Seed với 1.4B và 2.6B, cùng Nanbeige4.2-3B, vốn cho một chồng 22 lớp chạy qua hai lần — trong khi các phòng thí nghiệm có cam kết an toàn được công bố vẫn tránh xa nó. Các bài báo MeSH và SpiralFormer của Alibaba tấn công cùng vấn đề đó từ phía hiệu quả.
OpenAI thực sự đã nói gì, và những gì họ chưa nói
Bài báo khởi đầu cho câu chuyện này là của The Information, đăng ngày 1 và 2 tháng 9: rằng Astra sử dụng một kỹ thuật gọi là độ sâu tái quy hồi (recurrent depth), còn được mô tả là tái quy hồi mờ (opaque recurrence). Đó là một tờ báo có nguồn tin vững chắc với thành tích thực sự đáng tin, và đây vẫn là thông tin báo chí chứ không phải tài liệu chính thức. OpenAI chưa từng công bố một bài báo về kiến trúc nào xác nhận thiết kế dạng vòng lặp, và bài phân tích được đọc rộng rãi của Sebastian Raschka về Astra nói thẳng rằng cấu trúc vòng lặp chỉ được suy ra từ các phát ngôn công khai — bản tái dựng của ông cho thấy Astra chạy 22 khối của nó hai lần, tương đương 44 lần áp dụng khối, với hai vòng lặp là tối ưu còn nhiều hơn thì khiến quá trình huấn luyện mất ổn định.
Điều mà chính những người trong OpenAI nói thì hẹp hơn và thận trọng hơn so với cả những gì báo chí đưa tin lẫn làn sóng phản ứng dữ dội. Nhà khoa học trưởng Jakub Pachocki đã đăng vào ngày 2 tháng 9 rằng độ sâu đồ thị tính toán của các mô hình tiên tiến, kể cả Astra, nằm trong khoảng gấp đôi so với GPT-4 — một mức vòng lặp có giới hạn, chứ không phải kiểu đệ quy cực đoan mà một số tiêu đề hàm ý — và phản bác điều mà ông gọi là đưa tin lộn xộn, đồng thời thừa nhận rằng việc giám sát chuỗi suy luận là mong manh và đang đi theo hướng tiêu cực. Thẻ hệ thống của Astra được cho là ghi nhận rằng khả năng giám sát các dấu vết suy luận đã giảm một bậc so với GPT-5.6 Sol, một sự thừa nhận thực sự và không phụ thuộc vào việc kiến trúc nào đã gây ra nó.
Phản ứng về an toàn đã rất gay gắt. Buck Shlegeris của Redwood Research nói rằng ông cực kỳ lo ngại và cảnh báo rằng việc mở rộng quy mô recurrence có thể "phá hủy hoàn toàn khả năng giám sát CoT"; Ryan Greenblatt và Zvi Mowshowitz đưa ra lập luận tương tự với những giọng điệu khác nhau. Điểm phản biện hữu ích nhất đến từ Raschka: OpenAI đã giữ kín các dấu vết suy luận thô kể từ thế hệ o1 bất kể kiến trúc nào, và việc một mô hình mạnh hơn đưa ra một chuỗi suy luận ngắn hơn không tự nó là bằng chứng về một kênh suy luận ẩn.
Ghép hai đoạn đó lại với nhau, bạn sẽ có được cục diện mà dòng tweet đang đánh cược vào. “Astra bị loop” là thông tin đáng tin cậy mà OpenAI đã từ chối xác nhận. “Một mô hình bị loop thứ hai ra mắt vào ngày 29 tháng 9” chỉ là một bài đăng.
Năm vụ rò rỉ OpenAI trong tháng Chín, và vụ này nằm ở đâu trong số đó
Tháng Chín đã sản sinh ra một cụm dày đặc những câu chuyện rò rỉ về OpenAI, và điều hữu ích ở chúng là chúng không phải tất cả đều thuộc cùng một loại bằng chứng.
• Ngày 3 tháng 9 — các chuỗi gpt-6-astra và gpt-6-astra-aeon đã xuất hiện trong một feature flag của Statsig bên trong Codex Desktop, do @notjazii chụp màn hình và được @kimmonismus lan truyền rộng rãi. Câu chuyện về agent Aeon bắt nguồn từ đó. Năm tuần đã trôi qua, vẫn không có trang sản phẩm, không có giá, không có tài liệu và không có benchmark nào cho Aeon, và không có ID model nào phân giải được.
• Ngày 21 tháng 9 — một chuỗi "GPT-6 Sol medium" xuất hiện trong hồ sơ hợp nhất của NVIDIA.
• Ngày 22 tháng 9 — ba đường dẫn registry Azure, dành cho gpt-6-sol, gpt-6-luna và gpt-6-astra-minor, đã được đăng từ diễn đàn nhà phát triển Trung Quốc locdd.com dưới dạng một URL Microsoft đang hoạt động. Khi chúng tôi truy xuất điểm cuối cấu hình playground công khai vào ngày hôm sau, ba tên mới không có trong đó; registry thay vào đó lại chứa gpt-6-astra và các mục thuộc thế hệ GPT-5.6 cũ hơn.
• 22 tháng 9 — GPT-6 Sol và GPT-6 Luna đã ra mắt. Giá, ID mô hình, ghi chú phát hành SDK, một danh mục trên Bedrock, một mục trong trình chọn GitHub Copilot và một tùy chọn mặc định trên Perplexity đều nối tiếp chỉ trong vòng một ngày.
Mô thức này không hề tinh tế. Những nhóm rò rỉ mang theo một tạo tác bên trong một bề mặt thực sự được phát hành — ghi chú phát hành SDK, registry đám mây, cờ tính năng trên desktop — liên tục biến thành sản phẩm. Những nhóm rò rỉ chỉ là một cái tên thì không. Tuyên bố hôm nay, một mô hình ngôn ngữ dạng vòng lặp thứ hai từ OpenAI tại DevDay, không mang theo tạo tác nào cả: không chuỗi, không cờ, không đường dẫn registry, không dòng giá, không ID mô hình. Điều đó không khiến nó sai. Điều đó khiến nó không thể kiểm chứng từ bên ngoài, một mô tả khác và trung thực hơn.
Đội hình DevDay xoay quanh nó là có thật, và được ghi chép đầy đủ một cách bất thường.
Điều duy nhất bạn có thể xác định ngày tháng một cách chính xác là sự kiện. DevDay 2026 đã được xác nhận diễn ra vào Thứ Ba, ngày 29 tháng 9, tại Fort Mason ở San Francisco, với Sam Altman phát biểu chính và một buổi livestream miễn phí — OpenAI đã công bố ngày này từ hồi tháng Tư.
Điều được kỳ vọng trong đó đã được báo hiệu mạnh hơn mức thường lệ. Altman đăng vào ngày 15 tháng 9 rằng OpenAI có một "đợt phát hành lớn trong tuần này, và rồi đến DevDay sẽ phát hành x 6," và đến tối hôm sau đã rút lại nửa đầu: "điều chính mà tôi háo hức ra mắt trong tuần này sẽ chuyển sang tuần sau, nhưng theo tôi thì đáng để chờ!" Trưởng sản phẩm Tibo Sottiaux, người đã mô tả tuần đó là tầm cỡ DevDay, nói vào ngày 19 tháng 9 rằng bản phát hành vẫn sẽ đến vào thứ Ba, và đến ngày 22 tháng 9 thì đúng là như vậy — Sol và Luna, cộng với một lượt đặt lại mức sử dụng Codex được để dành cho các tài khoản trả phí. Đọc "phát hành x 6" như một con số sáu thứ được phát hành quanh DevDay thì một mô hình lặp thứ hai nằm gọn trong nghĩa thông thường của cụm từ; còn đọc nó như phép cường điệu thì nó chẳng phù hợp chút nào. Dù sao đi nữa, đó là bài đăng của một nhà sáng lập, không phải một lộ trình.
Các rò rỉ gần nhau cùng chỉ về một hướng mà không nêu tên mô hình nào. Một bản dựng Codex Cloud đã xuất hiện trong bản dựng ChatGPT desktop 9922 với các tích hợp Tailscale và proxy, và một luồng onboarding cho thấy các bậc gói dành cho nhà phát triển — Free, Prototype và Accelerate, bậc cuối ở mức $50 — vài ngày trước bài phát biểu chính. Không cái nào là một mô hình bị lặp. Cả hai đều khớp với một DevDay nặng về nền tảng hơn là nghiên cứu.
Nếu nó là thật, thì đó là mẫu nào?
Chưa có ai báo cáo danh tính nào, vì vậy những nội dung sau đây là suy luận và nên được đọc như vậy.
Con đường ngắn nhất đến "mô hình lặp thứ hai của OpenAI" là một phiên bản kế nhiệm Astra. Altman đã nói rằng những mô hình có năng lực hơn đang đến "rất sớm", và cách rẻ nhất để xây dựng một mô hình như vậy trên nền tảng độ sâu hồi quy là giữ nguyên kiến trúc và tăng ngân sách vòng lặp — nhiều hồi quy hơn trên mỗi token thay vì thêm trọng số. Cách diễn giải đó cũng giải thích cụm từ "cửa van lũ" một cách thuyết phục nhất, bởi vì một sản phẩm chủ lực thứ hai trên cùng kiến trúc là một tuyên bố rằng sản phẩm đầu tiên đã thành công.
Cách lý giải thứ hai là một tầng mới bên trong dòng GPT-6 hiện có. Ngữ pháp đặt tên đã sản sinh ra các chuỗi gpt-6-astra-minor, gpt-6-sol và gpt-6-luna, và một phiên bản anh em dạng lặp ở ngân sách độ sâu khác hoàn toàn nhất quán với một họ hiện trải từ $0.10 đến $50 cho mỗi triệu token đầu ra. Một mô hình dạng lặp rẻ hơn sẽ là phiên bản của điều này mà người đọc cảm nhận rõ nhất nơi ví tiền.
Cách lý giải thứ ba — một bản phát hành trọng số mở dạng lặp — là cách ít có cơ sở nhất. Nó sẽ giải thích cụm từ này tốt hơn bất cứ thứ gì khác, và tài liệu mở về kiến trúc lặp mà nó sẽ nằm cạnh đã tồn tại ở Ouro và Nanbeige4.2-3B, nhưng OpenAI chưa công bố gì theo hướng đó cho thế hệ này, và việc bịa ra một sản phẩm để khớp với một từ là cách đưa tin về rò rỉ đi sai hướng.

Điều gì sẽ khiến việc này có thể kiểm tra được trước ngày 29 tháng 9?
Hãy theo dõi các bề mặt đã khắc phục ba vết rò rỉ gần nhất, theo thứ tự này:
• Một model ID phân giải được trong API của OpenAI, hoặc một dòng mới trên trang định giá của nó.
• Một ghi chú phát hành trong SDK openai-go hoặc openai-node ghi tên các mã định danh mô hình mới — đó chính xác là cách Sol và Luna để lộ sự xuất hiện của chính mình, với SDK v3.65.0 phát hành các mã định danh mô hình chỉ vài giờ trước khi trang thông báo được đăng lên.
• Một danh sách Bedrock hoặc Azure, hoặc một chuỗi cờ Statsig mới trong bản dựng desktop.
• Một câu về kiến trúc trong thẻ hệ thống. Đây là câu quan trọng nhất và sẽ xuất hiện muộn nhất, bởi vì OpenAI chưa bao giờ xác nhận thiết kế dạng vòng lặp cho Astra.
Bất cứ thứ gì không thuộc ba mục đầu tiên đều là một cái tên, và những cái tên là thứ ít đáng tin cậy nhất trong toàn bộ chu kỳ này.

Tại sao điều đó lại quan trọng ngay cả khi tweet hóa ra là sai
Hai điều sẽ thay đổi nếu độ sâu tái phát trở thành tiêu chuẩn thay vì ngoại lệ.
Điều đầu tiên là sự bảo đảm. Nếu thế hệ tiếp theo thực hiện nhiều hơn việc lập luận của mình trong trạng thái ẩn, thì bất kỳ đánh giá nào phụ thuộc vào việc đọc chuỗi suy nghĩ bằng văn bản của mô hình đều mất tín hiệu — và điều đó bao gồm cả đánh giá an toàn của bên thứ ba, không chỉ hoạt động giám sát của chính OpenAI. Đó là một yếu tố đầu vào cho việc mua sắm đối với bất kỳ ai có yêu cầu bảo đảm, và nó sẽ không hiển thị trong một bảng điểm chuẩn.
Thứ hai là hình dạng của thang giá. Looping đánh đổi tham số lấy tính toán tuần tự, nên nó chuyển chi phí từ bộ nhớ sang thời gian: có thể rẻ hơn khi vận hành, nhưng có thể chậm hơn trên mỗi token. Dòng GPT-6 đã định giá rõ ràng cho sự đánh đổi đó — GPT-6 Astra với $10 vào / $50 ra mỗi triệu token là mô hình chuyên sâu, GPT-6 Sol với $2 / $10 là mô hình nhanh, GPT-6 Luna với $0.10 / $0.50 là mô hình khối lượng lớn. Cả ba đều đang hoạt động trên OrcaRouter theo giá niêm yết của OpenAI không tăng giá, nên nếu một mô hình thứ tư, dạng looping, ra mắt vào ngày 29 tháng 9, thì bảng giá bên phía chúng tôi chính là bảng giá của nhà cung cấp ngay ngày nó ra mắt — và việc nhà cung cấp giảm giá sẽ có hiệu lực ở đây cùng ngày với khi nó có hiệu lực ở đó.
Công dụng thực tế của một vụ rò rỉ như thế này không phải là dự đoán, mà là chuẩn bị. Một mô hình có thể ra mắt trong năm ngày nữa và chưa có benchmark độc lập chính là trường hợp mà cơ chế tự động chuyển đổi dự phòng tồn tại vì nó: trỏ một route vào mô hình mới, giữ GPT-6 Astra hoặc GPT-6 Sol ở phía sau, và một tuần đầu tệ hại sẽ chỉ khiến bạn mất một phần nhỏ lưu lượng thay vì cả đường dẫn production. Đó cũng là cách hợp lý để kiểm thử một mô hình nặng về độ sâu — DSL định tuyến ghép nó vào một lệnh gọi duy nhất bên cạnh những mô hình mà nó được thiết kế để thay thế, và model fusion sẽ chạy một nhóm chúng với cùng một prompt, đem lại đánh giá nhanh hơn về một kiến trúc mới so với bất kỳ bài đăng ra mắt nào.
Điều gì thực sự đúng vào tối nay
Một bài đăng trên X nói rằng mô hình ngôn ngữ dạng vòng lặp thứ hai của OpenAI sẽ ra mắt vào ngày 29 tháng 9. Không có ID mô hình, không có giá, không có tên, không có nguồn thứ hai, không có tạo tác. Bên dưới nó: một mẫu chủ lực ra mắt ngày 3 tháng 9 mà các báo cáo nói rằng có vòng lặp và OpenAI chưa bao giờ xác nhận là có vòng lặp, một sự suy giảm được thừa nhận về khả năng giám sát dấu vết lập luận so với GPT-5.6 Sol, một nhà khoa học trưởng nói rằng việc lặp vòng được giới hạn trong phạm vi gấp đôi độ sâu đồ thị tính toán của GPT-4, và một gói giá rẻ ra mắt ngày 22 tháng 9 đã khiến câu hỏi về kiến trúc trở nên liên quan về mặt thương mại thay vì chỉ mang tính học thuật.
Đó là một tuyên bố mỏng manh dựa trên một câu chuyện dày, đúng hình dạng thường thấy của một vụ rò rỉ năm ngày trước sự kiện. Nếu một mô hình looped thứ hai xuất hiện tại Fort Mason vào thứ Ba, chi tiết đáng chú ý sẽ không phải là con số benchmark — mà là liệu system card có lặp lại lưu ý về khả năng giám sát hay không. Chính câu đó là thứ cho bạn biết liệu “không còn bị cấm” là khẩu hiệu hay chính sách.

So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
