
Drugi zapętlony model OpenAI: co tak naprawdę twierdzi przeciek „Forbidden Axis” z DevDay
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 177 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1323 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Istnieje dokładnie jedno źródło twierdzenia, którego dotyczy ten artykuł, i jest to pojedynczy post na X. 24 września konto @scaling01 napisało, że dostawca „otworzył śluzy i na DevDay wyda swój drugi zapętlony model językowy obok GPT-6 Astra”, opisując głębokość rekurencyjną jako „zakazaną oś” i zauważając, że „nie jest już zakazana”. To wszystko: żadnej nazwy modelu, żadnego identyfikatora modelu, żadnej ceny, żadnej daty poza keynote DevDay 29 września w San Francisco i ani słowa od dostawcy. Tym, co czyni to twierdzenie wartym czasu czytelnika, nie jest sam tweet, lecz fakty, które się za nim kryją. GPT-6 Astra, który dostawca wydał 3 września, jest pierwszym produkcyjnym modelem z dowolnego dużego laboratorium, jaki doniesienia powiązały z zapętloną architekturą o rekurencyjnej głębokości. GPT-6 Sol i GPT-6 Luna, wydane 22 września w cenie 2 USD za wejście / 10 USD za wyjście oraz 0,10 USD za wejście / 0,50 USD za wyjście za milion tokenów, zamieniły ten flagowiec w drabinę cenową. Drugi zapętlony model oznaczałby, że dostawca nie traktuje już głębokości rekurencyjnej jako jednorazowego zakładu, lecz jako stałą architekturę — twierdzenie większe niż jakiekolwiek pojedyncze wydanie i znacznie trudniejsze do sprawdzenia.
To materiał podsumowujący to, co do tej pory wiemy. Wszystko przypisywane osobie publikującej post lub anonimowym doniesieniom jest oznaczone jako takie, a niczego tutaj nie należy odczytywać jako oficjalnego komunikatu.
Dlaczego zwrot „zakazana oś” jest najciekawszą częścią tego tweeta
To sformułowanie pochodzi od autora posta, nie jest terminem fachowym, ale wskazuje na coś realnego. W skalowaniu transformerów są trzy oczywiste osie: parametry, dane i moc obliczeniowa treningu. Głębokość przez rekurencję jest czwartą i to dość osobliwą. Zamiast układać w stos N odrębnych bloków, model zapętlony wykorzystuje ten sam niewielki stos bloków R razy, więc efektywna głębokość to w przybliżeniu liczba warstw pomnożona przez liczbę pętli, podczas gdy liczba parametrów pozostaje stała. Google DeepMind przedstawiło teorię w pracy Reasoning with Latent Thoughts: On the Power of Looped Transformers, a szeroko cytowana Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach przekonała do tego w praktyce.
To nie jest darmowa głębokość. Prace nad skalowaniem izogłębokościowym w modelach językowych z pętlami ustalają wykładnik równoważności rekurencji na około 0,46 — co oznacza, że jedna dodatkowa pętla daje około 46% tego, co dałby naprawdę nowy blok. Kupujesz głębokość z rabatem i płacisz za nią obliczeniami szeregowymi, a nie pamięcią. To korzystna wymiana, jeśli ogranicza cię pamięć albo chcesz, by mały model zachowywał się jak duży — a dokładnie takiej wymiany szukają tanie warianty w każdej rodzinie.
Więc dlaczego „zakazane"? Ponieważ obliczenia zachodzące wewnątrz pętli odbywają się w stanie ukrytym, a nie w emitowanych tokenach. Monitorowanie łańcucha myśli — czytanie tego, co model zapisuje, gdy myśli — jest głównym narzędziem zapewnienia w branży, odkąd pojawiły się modele rozumujące, i to właśnie ono sprawiło, że lipcowy incydent z agentem Hugging Face stał się w ogóle czytelny dla śledczych. Model, który wykonuje więcej swojej pracy w przestrzeni utajonej, daje temu narzędziu mniej do czytania. To był przez dwa lata argument przeciwko zapętlaniu na froncie i dlatego ta technika rozprzestrzeniła się w otwartych wagach — ByteDance Seed ze swoim Ouro w wersjach 1,4B i 2,6B oraz Nanbeige4.2-3B, który dwukrotnie przepuszcza przez siebie stos 22 warstw — podczas gdy laboratoria z opublikowanymi zobowiązaniami dotyczącymi bezpieczeństwa trzymały się od tego z daleka. Prace Alibaby o MeSH i SpiralFormer podchodziły do tego samego problemu od strony wydajności.
Co OpenAI faktycznie powiedziało, a czego nie
Zaczęło się od doniesienia The Information z 1 i 2 września: że Astra stosuje technikę zwaną recurrent depth (powtarzalna głębokość), opisywaną też jako opaque recurrence (nieprzejrzysta rekurencja). To medium o solidnych źródłach i realnym dorobku, ale to wciąż doniesienie, a nie dokumentacja. OpenAI nigdy nie opublikowało artykułu o architekturze potwierdzającego zapętloną konstrukcję, a szeroko czytana analiza Astry autorstwa Sebastiana Raschki mówi wprost, że zapętloną strukturę wywnioskowano z publicznych wypowiedzi — w jego rekonstrukcji Astra uruchamia swoje 22 bloki dwukrotnie, co daje 44 efektywne zastosowania bloków, przy czym optymalne są dwie pętle, a większa ich liczba destabilizuje trening.
To, co powiedzieli sami ludzie z OpenAI, jest węższe i ostrożniejsze, niż sugerowały zarówno relacje medialne, jak i reakcja oburzenia. Główny naukowiec Jakub Pachocki napisał 2 września, że głębokość grafu obliczeniowego modeli frontier, w tym Astry, mieści się w granicach dwukrotności GPT-4 — to ograniczona liczba zapętleń, a nie ekstremalna rekursja, którą sugerowały niektóre nagłówki — i sprzeciwił się temu, co nazwał pogmatwanym dziennikarstwem, przyznając jednocześnie, że monitorowanie łańcucha myśli jest kruche i zmierza w negatywnym kierunku. Karta systemowa Astry podobno odnotowuje, że monitorowalność śladów rozumowania stanowi krok w dół w porównaniu z GPT-5.6 Sol, co jest prawdziwym przyznaniem i nie zależy od tego, która architektura to spowodowała.
Reakcja środowiska bezpieczeństwa była głośna. Buck Shlegeris z Redwood Research powiedział, że jest niezwykle zaniepokojony, i ostrzegł, że skalowanie rekurencji w górę może „całkowicie zniszczyć monitorowalność CoT”; Ryan Greenblatt i Zvi Mowshowitz przedstawili ten sam argument w różnych rejestrach. Najbardziej przydatny kontrargument przedstawił Raschka: OpenAI wstrzymuje surowe ślady rozumowania od czasów generacji o1, niezależnie od architektury, a silniejszy model emitujący krótszy łańcuch myśli sam w sobie nie jest dowodem na istnienie ukrytego kanału rozumowania.
Połącz te dwa akapity, a otrzymasz obraz sytuacji, na który obstawia tweet. „Astra jest zapętlona” to wiarygodne doniesienie, które OpenAI odmówiło potwierdzić. „Drugi zapętlony model wychodzi 29 września” to jeden post.
Pięć wrześniowych przecieków OpenAI i gdzie plasuje się ten
Wrzesień przyniósł gęsty klaster doniesień o przeciekach z OpenAI, a pożyteczne w nich jest to, że nie wszystkie należą do tej samej klasy dowodów.
• 3 września — ciągi gpt-6-astra i gpt-6-astra-aeon pojawiły się w fladze funkcji Statsig w Codex Desktop; zrzut ekranu zrobił @notjazii, a nagłośnił to @kimmonismus. Historia agenta Aeon wyrosła z tego. Po pięciu tygodniach nadal nie ma strony produktu, ceny, dokumentacji ani benchmarku dla Aeon i żadnego identyfikatora modelu, który się rozwiązuje.
• 21 września — ciąg „GPT-6 Sol medium" pojawił się w rekordach scalania NVIDIA.
• 22 września — trzy ścieżki rejestru Azure, dla gpt-6-sol, gpt-6-luna i gpt-6-astra-minor, zostały opublikowane na chińskim forum dla programistów locdd.com jako działający adres URL Microsoft. Gdy następnego dnia pobraliśmy publiczny endpoint konfiguracji playgrounda, trzech nowych nazw w nim nie było; zamiast tego w rejestrze znajdowały się gpt-6-astra oraz starsze wpisy generacji GPT-5.6.
• 22 września — GPT-6 Sol i GPT-6 Luna zostały udostępnione. Cena, identyfikatory modeli, informacje o wydaniu SDK, oferta w Bedrock, pozycja w selektorze GitHub Copilot i domyślne ustawienie w Perplexity — wszystko pojawiło się w ciągu jednego dnia.
Wzorzec nie jest subtelny. Kategorie przecieków niosące artefakt wewnątrz powierzchni, która faktycznie zostaje wydana — notatka o wydaniu SDK, rejestr w chmurze, flaga funkcji w aplikacji desktopowej — niezmiennie stawały się produktami. Kategorie przecieków, które były tylko nazwą, nie stawały się produktami. Dzisiejsze twierdzenie — drugi zapętlony model językowy od OpenAI na DevDay — nie niesie ze sobą żadnego artefaktu: żadnego ciągu znaków, żadnej flagi, żadnej ścieżki w rejestrze, żadnego wiersza z ceną, żadnego identyfikatora modelu. To nie znaczy, że jest błędne. To znaczy, że nie da się tego sprawdzić z zewnątrz, co jest innym i uczciwszym opisem.
Program DevDay z tym związany jest prawdziwy i wyjątkowo dobrze udokumentowany.
Jedyna rzecz, którą można dokładnie datować, to samo wydarzenie. DevDay 2026 potwierdzono na wtorek, 29 września, w Fort Mason w San Francisco, z Samem Altmanem wygłaszającym keynote i bezpłatną transmisją na żywo — OpenAI ogłosiło tę datę już w kwietniu.
To, czego się w nim spodziewano, zostało zasygnalizowane mocniej niż zwykle. Altman napisał 15 września, że OpenAI ma „duże wypuszczenie w tym tygodniu, a potem na devday ship x 6”, i następnego wieczoru wycofał się z pierwszej połowy: „najważniejsza rzecz, której wypuszczeniem w tym tygodniu byłem podekscytowany, będzie zamiast tego w przyszłym tygodniu, ale imo warto czekać!” Lider produktu Tibo Sottiaux, który wcześniej przedstawił ten tydzień jako wydarzenie na miarę DevDay, powiedział 19 września, że premiera wciąż ma nastąpić we wtorek, i 22 września nastąpiła — Sol i Luna, plus odłożony reset użycia Codex dla płatnych kont. Czytaj „ship x 6” jako liczbę sześciu rzeczy wypuszczanych w okolicach DevDay, a drugi zapętlony model wpisuje się wygodnie w zwykłe znaczenie tego sformułowania; czytaj to jako hiperbolę, a nie pasuje zupełnie. Tak czy inaczej, to post założyciela, a nie roadmapa.
Sąsiednie przecieki wskazują ten sam kierunek, nie wymieniając żadnego modelu. Kompilacja Codex Cloud wypłynęła w kompilacji 9922 desktopowego ChatGPT z integracjami Tailscale i proxy, a proces onboardingu pokazał poziomy planów dla deweloperów — Free, Prototype i Accelerate, ten ostatni za 50 USD — na kilka dni przed keynote. Żaden z nich nie jest modelem zapętlonym. Oba są spójne z DevDay, który stawia większy nacisk na platformę niż na badania.
Jeśli to prawda, który to model?
Nikt nie zgłosił tożsamości, więc poniższe stanowi wnioskowanie i powinno być jako takie odczytywane.
Najkrótsza droga do „drugiego zapętlonego modelu OpenAI” to następca Astry. Altman powiedział, że bardziej zdolne modele nadchodzą „bardzo szybko”, a najtańszym sposobem zbudowania takiego modelu na bazie o rekurencyjnej głębokości jest zachowanie architektury i zwiększenie budżetu pętli — więcej rekurencji na token, a nie więcej wag. Ta interpretacja najlepiej wyjaśnia również ujęcie w kategoriach „otwarcia śluz”, ponieważ drugi model flagowy na tej samej architekturze jest stwierdzeniem, że pierwszy się sprawdził.
Drugie odczytanie to nowy poziom w istniejącej linii GPT-6. Gramatyka nazewnictwa wygenerowała już ciągi gpt-6-astra-minor, gpt-6-sol i gpt-6-luna, a zapętlony model siostrzany przy innym budżecie głębokości jest całkowicie spójny z rodziną, która obejmuje obecnie od 0,10 USD do 50 USD za milion tokenów wyjściowych. Tańszy model zapętlony byłby tą wersją tego, którą czytelnik najbardziej odczuwa w portfelu.
Trzecia interpretacja — wydanie zapętlonego modelu o otwartych wagach — jest najmniej uzasadniona. Wyjaśniłaby to wyrażenie lepiej niż cokolwiek innego, a otwarta literatura o zapętlanych modelach, obok której by się znalazła, już istnieje w Ouro i Nanbeige4.2-3B, ale OpenAI nie ogłosiło niczego w tym kierunku dla tej generacji, a wymyślanie produktu pod słowo to właśnie sposób, w jaki relacjonowanie przecieków idzie na manowce.

Co sprawiłoby, że można by to sprawdzić przed 29 września?
Obserwuj powierzchnie, które rozwiązały ostatnie trzy wycieki, w tej kolejności:
• Identyfikator modelu, który jest rozpoznawany w API OpenAI, lub nowy wiersz na jej stronie z cennikiem.
• Notatka o wydaniu w SDK openai-go lub openai-node wymieniająca nowe identyfikatory modeli — dokładnie w ten sposób Sol i Luna ujawniły własne przybycie, gdy SDK v3.65.0 dostarczyło identyfikatory modeli na kilka godzin przed pojawieniem się strony z ogłoszeniem.
• Wpis dotyczący Bedrock lub Azure albo świeży ciąg flagi Statsig w kompilacji desktopowej.
• Zdanie o architekturze w karcie systemowej. To właśnie ono miałoby największe znaczenie i pojawiłoby się na końcu, ponieważ OpenAI nigdy nie potwierdziło zapętlonej konstrukcji dla Astry.
Wszystko poza pierwszymi trzema to nazwa, a nazwy były najmniej wiarygodnym artefaktem całego tego cyklu.

Dlaczego to ma znaczenie, nawet jeśli tweet okaże się nieprawdziwy
Dwie rzeczy się zmieniają, jeśli głębokość rekurencyjna stanie się standardem, a nie wyjątkiem.
Pierwsza kwestia to zapewnienie. Jeśli następna generacja będzie prowadzić więcej swojego rozumowania w stanie ukrytym, to każda ocena opierająca się na czytaniu zapisanego łańcucha myśli modelu traci sygnał — obejmuje to ocenę bezpieczeństwa przeprowadzaną przez strony trzecie, a nie tylko własny monitoring OpenAI. To informacja wejściowa do zakupów dla każdego, kto ma wymóg zapewnienia, i nie będzie widoczna w tabeli benchmarków.
Drugi to kształt drabinki cenowej. Looping wymienia parametry na obliczenia sekwencyjne, więc przenosi koszt z pamięci na czas: potencjalnie tańszy w utrzymaniu, potencjalnie wolniejszy na token. Linia GPT-6 już wycenia ten kompromis wprost — GPT-6 Astra za 10 USD za wejście / 50 USD za wyjście za milion tokenów to model głębokości, GPT-6 Sol za 2 / 10 USD to ten szybki, GPT-6 Luna za 0,10 / 0,50 USD to ten do dużego wolumenu. Wszystkie trzy są dostępne na OrcaRouter w cenie katalogowej OpenAI bez marży, więc jeśli czwarty, zapętlony model pojawi się 29 września, cennik po naszej stronie to cennik dostawcy w dniu jego premiery — a obniżka cen dostawcy obowiązuje tu tego samego dnia, w którym obowiązuje tam.
Praktyczne zastosowanie takiego wycieku nie polega na przewidywaniu, lecz na przygotowaniu. Model, który może pojawić się w ciągu pięciu dni i nie ma niezależnego benchmarku, jest dokładnie tym przypadkiem, dla którego istnieje automatyczne przełączanie awaryjne: skieruj trasę na nowy model, trzymaj GPT-6 Astra lub GPT-6 Sol za nim, a zły pierwszy tydzień kosztuje cię ułamek twojego ruchu zamiast twojej ścieżki produkcyjnej. To także rozsądny sposób testowania modelu o głębokiej architekturze — routing DSL składa go w jedno wywołanie obok modeli, które ma zastąpić, a model fusion uruchomi ich panel na tym samym promptcie, co daje szybszy odczyt nowej architektury niż jakikolwiek wpis o premierze.
Co tak naprawdę jest prawdą dziś wieczorem?
Jeden post na X mówi, że drugi zapętlony model językowy OpenAI pojawi się 29 września. Brak identyfikatora modelu, brak ceny, brak nazwy, brak drugiego źródła, brak artefaktu. Pod tym: flagowy produkt wydany 3 września, o którym doniesienia mówią, że jest zapętlony i którego OpenAI nigdy nie potwierdziło, że jest zapętlony, przyznany spadek monitorowalności śladów rozumowania względem GPT-5.6 Sol, główny naukowiec, który twierdzi, że zapętlenie jest ograniczone do nie więcej niż dwukrotności głębokości grafu obliczeniowego GPT-4, oraz tania warstwa wydana 22 września, która sprawiła, że kwestia architektury stała się istotna komercyjnie, a nie akademicka.
To wątła teza oparta na grubej historii, co jest normalnym kształtem przecieku pięć dni przed wydarzeniem. Jeśli we wtorek w Fort Mason pojawi się drugi zapętlony model, interesującym szczegółem nie będzie liczba z benchmarku — będzie nim to, czy karta systemowa powtórzy zastrzeżenie dotyczące monitorowalności. Właśnie to jedno zdanie mówi, czy „nie jest już zabronione” to slogan, czy polityka.

Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
