
OpenAIs zweites Looped-Modell: Was das DevDay-‚Forbidden Axis‘-Leak tatsächlich behauptet
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Für die Behauptung, um die es in diesem Artikel geht, gibt es genau eine Quelle, und es handelt sich um einen einzelnen Beitrag auf X. Am 24. September schrieb der Account @scaling01 schrieb, dass der Anbieter „die Schleusen geöffnet habe und neben GPT-6 Astra auf dem DevDay sein zweites gelooptes Sprachmodell veröffentlichen werde“, wobei er rekurrente Tiefe als „die verbotene Achse“ bezeichnete und anmerkte, dass sie „nicht mehr verboten“ sei. Das ist alles: kein Modellname, keine Modell-ID, kein Preis, kein Datum außer der DevDay-Keynote am 29. September in San Francisco und kein Wort vom Anbieter. Was die Behauptung zu einer lohnenden Lektüre macht, ist nicht der Tweet, sondern die dahinterstehenden ausgelieferten Fakten. GPT-6 Astra, das der Anbieter am 3. September veröffentlicht hat, ist das erste Produktionsmodell aus einem großen Labor, das die Berichterstattung mit einer geloopten Architektur mit rekurrenter Tiefe in Verbindung gebracht hat. GPT-6 Sol und GPT-6 Luna, am 22. September zu 2 $ Input / 10 $ Output bzw. 0,10 $ Input / 0,50 $ Output pro Million Tokens veröffentlicht, machten dieses Flaggschiff zu einer Preisstaffel. Ein zweites gelooptes Modell würde bedeuten, dass der Anbieter rekurrente Tiefe nicht mehr als einmalige Wette behandelt, sondern als feste Architektur – eine größere Behauptung als jeder einzelne Launch und eine viel schwerer zu überprüfende.
Dies ist ein Beitrag zum aktuellen Wissensstand. Alles, was einem Verfasser eines Beitrags oder anonymen Meldungen zugeschrieben wird, ist als solches gekennzeichnet, und nichts hier sollte als Veröffentlichung gelesen werden.
Warum der Ausdruck 'forbidden axis' der interessanteste Teil des Tweets ist
Die Formulierung stammt vom Verfasser des Beitrags, ist kein Fachbegriff, weist aber auf etwas Reales hin. Beim Skalieren von Transformern gibt es drei offensichtliche Achsen: Parameter, Daten und Trainings-Compute. Tiefe durch Rekurrenz ist eine vierte, und eine seltsame dazu. Anstatt N verschiedene Blöcke zu stapeln, verwendet ein gelooptes Modell denselben kleinen Blockstapel R-mal wieder, sodass die effektive Tiefe ungefähr der mit der Schleifenanzahl multiplizierten Schichtanzahl entspricht, während die Parameteranzahl konstant bleibt. Google DeepMind legte die Theorie in Schlussfolgern mit latenten Gedanken: Über die Leistungsfähigkeit geloopfter Transformer dar, und die viel zitierte Skalierung von Testzeit-Compute mit latentem Schlussfolgern: Ein rekurrenter Tiefenansatz lieferte den praktischen Nachweis.
Tiefe ist nicht gratis. Die Iso-Depth-Scaling-Arbeit an geloopten Sprachmodellen setzt den Rekurrenz-Äquivalenz-Exponenten auf ungefähr 0,46 – das bedeutet, eine zusätzliche Schleife kauft Ihnen etwa 46 % von dem, was ein wirklich neuer Block gekauft hätte. Sie kaufen Tiefe mit Rabatt und bezahlen dafür mit serieller Rechenleistung statt mit Speicher. Das ist ein vorteilhafter Handel, wenn Sie speichergebunden sind oder möchten, dass sich ein kleines Modell wie ein großes verhält – genau der Handel, auf den die günstigen Stufen jeder Familie aus sind.
Warum also „verboten“? Weil die Berechnung, die innerhalb der Schleife stattfindet, im verborgenen Zustand abläuft und nicht in ausgegebenen Tokens. Die Überwachung der Gedankenkette – das Lesen dessen, was das Modell während seines Denkens niederschreibt – ist seit dem Aufkommen von Reasoning-Modellen das wichtigste Absicherungsinstrument der Branche, und es ist das Instrument, das den Vorfall mit dem Hugging-Face-Agenten im Juli für die Ermittler überhaupt erst nachvollziehbar machte. Ein Modell, das mehr seiner Arbeit im latenten Raum verrichtet, gibt diesem Instrument weniger zu lesen. Das ist seit zwei Jahren das Argument gegen Looping an der Frontier, und deshalb hat sich die Technik bei offenen Gewichten verbreitet – ByteDance Seeds Ouro mit 1,4B und 2,6B sowie Nanbeige4.2-3B, das einen 22-Schichten-Stack zweimal durchläuft –, während die Labore mit veröffentlichten Sicherheitsverpflichtungen sich davon fernhielten. Alibabas MeSH- und SpiralFormer-Papers griffen dasselbe Problem von der Effizienzseite an.
Was OpenAI tatsächlich gesagt hat – und was nicht
Der Bericht, mit dem alles begann, stammt von The Informationvom 1. und 2. September: dass Astra eine Technik namens „recurrent depth" einsetzt, die auch als opake Rekurrenz beschrieben wird. Das ist ein gut vernetztes Medium mit einer echten Erfolgsbilanz – und es handelt sich weiterhin um einen Bericht, nicht um Dokumentation. OpenAI hat nie ein Architekturpaper veröffentlicht, das ein gelooptes Design bestätigt, und Sebastian Raschkas viel gelesene Analyse von Astra sagt unmissverständlich, dass die Schleifenstruktur aus öffentlichen Aussagen abgeleitet ist – in seiner Rekonstruktion durchläuft Astra seine 22 Blöcke zweimal, was 44 effektive Blockanwendungen ergibt, wobei zwei Schleifen optimal sind und mehr das Training destabilisiert.
Was OpenAIs eigene Leute gesagt haben, ist enger und vorsichtiger als das, was die Berichterstattung oder die Gegenreaktion nahelegten. Chefwissenschaftler Jakub Pachocki schrieb am 2. September, dass die Tiefe des Berechnungsgraphen von Frontier-Modellen, Astra eingeschlossen, innerhalb eines Faktors von zwei zu GPT-4 liegt – eine begrenzte Menge an Schleifen, nicht die extreme Rekursion, die manche Schlagzeilen implizierten – und widersprach dem, was er als verwirrende Berichterstattung bezeichnete, während er einräumte, dass die Chain-of-Thought-Überwachung fragil ist und sich in eine negative Richtung entwickelt. In der Systemkarte von Astra wird laut Berichten festgehalten, dass die Überwachbarkeit von Reasoning-Spuren einen Rückschritt gegenüber GPT-5.6 Sol darstellt, was ein echtes Eingeständnis ist und nicht davon abhängt, welche Architektur es verursacht hat.
Die Sicherheitsreaktion war laut. Buck Shlegeris von Redwood Research sagte, er sei extrem besorgt, und warnte, dass eine Hochskalierung von Rekurrenz die „CoT-Überwachbarkeit völlig zerstören“ könnte; Ryan Greenblatt und Zvi Mowshowitz vertraten dasselbe Argument in unterschiedlichen Tonlagen. Der nützlichste Gegenpunkt kam von Raschka: OpenAI hält seit der o1-Generation unabhängig von der Architektur rohe Reasoning-Traces zurück, und ein stärkeres Modell, das eine kürzere Gedankenkette ausgibt, ist für sich genommen kein Beweis für einen verborgenen Reasoning-Kanal.
Setzt man diese beiden Absätze zusammen, erhält man den Stand der Dinge, auf den der Tweet setzt. „Astra ist geloopt“ ist eine glaubwürdige Berichterstattung, die OpenAI nicht bestätigen wollte. „Ein zweites gelooptes Modell wird am 29. September ausgeliefert“ ist ein einzelner Post.
Fünf OpenAI-Leaks im September – und wo dieser einzuordnen ist
Der September brachte eine dichte Häufung von OpenAI-Leak-Geschichten hervor, und das Nützliche daran ist, dass sie nicht alle dieselbe Kategorie von Belegen darstellen.
• 3. September — die Zeichenfolgen gpt-6-astra und gpt-6-astra-aeon erschienen in einem Statsig-Feature-Flag in Codex Desktop, per Screenshot geteilt von @notjazii und weiterverbreitet von @kimmonismus. Daraus entstand die Geschichte um den Aeon-Agenten. Fünf Wochen später gibt es immer noch keine Produktseite, keinen Preis, keine Dokumentation und keinen Benchmark für Aeon, und keine Modell-ID, die sich auflösen lässt.
• 21. September — ein „GPT-6 Sol medium“-String tauchte in NVIDIA-Merge-Aufzeichnungen auf.
• 22. September — drei Azure-Registry-Pfade für gpt-6-sol, gpt-6-luna und gpt-6-astra-minor wurden aus dem chinesischen Entwicklerforum locdd.com als aktive Microsoft-URL gepostet. Als wir am nächsten Tag den öffentlichen Playground-Konfigurationsendpunkt abriefen, waren die drei neuen Namen nicht darin enthalten; stattdessen enthielt die Registrierung gpt-6-astra und die älteren Einträge der GPT-5.6-Generation.
• 22. September — GPT-6 Sol und GPT-6 Luna sind erschienen. Preis, Modell-IDs, SDK-Release-Notes, ein Bedrock-Listing, ein Eintrag im GitHub-Copilot-Picker und eine Perplexity-Standardeinstellung folgten allesamt binnen eines Tages.
Das Muster ist nicht subtil. Die Leak-Klassen, die ein Artefakt in einer Oberfläche trugen, die tatsächlich ausgeliefert wird – eine SDK-Release-Note, eine Cloud-Registry, ein Desktop-Feature-Flag –, wurden immer wieder zu Produkten. Die Leak-Klassen, die nur ein Name waren, nicht. Die heutige Behauptung, ein zweites gelooptes Sprachmodell von OpenAI auf dem DevDay, enthält überhaupt kein Artefakt: keinen String, kein Flag, keinen Registry-Pfad, keine Preiszeile, keine Modell-ID. Das macht sie nicht falsch. Es macht sie von außen nicht überprüfbar, was eine andere und ehrlichere Beschreibung ist.
Das DevDay-Programm darum herum ist real und ungewöhnlich gut dokumentiert.
Das Einzige, was sich präzise datieren lässt, ist die Veranstaltung. DevDay 2026 ist bestätigt für Dienstag, den 29. September, im Fort Mason in San Francisco, mit Sam Altman als Keynote-Speaker und einem kostenlosen Livestream – OpenAI hat das Datum bereits im April bekannt gegeben.
Was darin zu erwarten war, wurde nachdrücklicher als üblich vorweggenommen. Altman postete am 15. September, OpenAI habe „diese Woche ein großes Ship, und dann für DevDay ship x 6“, und nahm die erste Hälfte davon am folgenden Abend zurück: „Die Hauptsache, auf deren Start ich mich diese Woche gefreut habe, kommt stattdessen nächste Woche, aber meiner Meinung nach lohnt sich das Warten!“ Produktleiter Tibo Sottiaux, der die Woche im DevDay-Ausmaß eingeordnet hatte, sagte am 19. September, die Veröffentlichung komme weiterhin am Dienstag, und am 22. September kam sie — Sol und Luna, plus ein aufgespartes Zurücksetzen der Codex-Nutzung für kostenpflichtige Konten. Liest man „ship x 6“ als Zählung von sechs Dingen, die rund um DevDay ausgeliefert werden, passt ein zweites gelooptes Modell bequem in die übliche Bedeutung der Wendung; liest man es als Hyperbel, passt es überhaupt nicht. So oder so ist es ein Post eines Gründers, keine Roadmap.
Benachbarte Leaks weisen in dieselbe Richtung, ohne ein Modell zu nennen. Ein Codex-Cloud-Build tauchte im Desktop-ChatGPT-Build 9922 mit Tailscale- und Proxy-Integrationen auf, und ein Onboarding-Flow zeigte Entwickler-Tarifstufen – Free, Prototype und Accelerate, letztere für 50 $ – Tage vor der Keynote. Keines von beiden ist ein gelooptes Modell. Beide passen zu einem DevDay, der stärker auf Plattform als auf Forschung setzt.
Wenn es echt ist, welches Modell ist es?
Niemand hat eine Identität gemeldet, daher handelt es sich beim Folgenden um eine Schlussfolgerung, die als solche gelesen werden sollte.
Der kürzeste Weg zu „OpenAIs zweitem Schleifenmodell" ist ein Astra-Nachfolger. Altman hat gesagt, dass leistungsfähigere Modelle „sehr bald" kommen, und der günstigste Weg, eines auf einer rekurrenten Tiefenbasis zu bauen, ist, die Architektur beizubehalten und das Schleifenbudget zu erhöhen — mehr Rekurrenz pro Token statt mehr Gewichte. Diese Lesart erklärt auch die Rede von den geöffneten Schleusen am besten, denn ein zweites Flaggschiff auf derselben Architektur ist die Aussage, dass das erste funktioniert hat.
Die zweite Lesart ist eine neue Stufe innerhalb der bestehenden GPT-6-Linie. Die Namensgrammatik hat bereits die Strings gpt-6-astra-minor, gpt-6-sol und gpt-6-luna hervorgebracht, und ein gelooptes Geschwistermodell mit einem anderen Tiefenbudget ist vollkommen konsistent mit einer Familie, die inzwischen 0,10 $ bis 50 $ pro Million Ausgabe-Tokens umspannt. Ein günstigeres gelooptes Modell wäre die Version davon, die ein Leser am stärksten im Geldbeutel spürt.
Die dritte Lesart – eine geloopte Open-Weights-Veröffentlichung – ist am wenigsten gestützt. Sie würde die Formulierung besser erklären als alles andere, und die offene geloopte Literatur, neben der sie stehen würde, existiert bereits in Ouro und Nanbeige4.2-3B, aber OpenAI hat für diese Generation nichts in dieser Richtung angekündigt, und ein Produkt zu erfinden, damit es zu einem Wort passt, ist, wie Leak-Berichterstattung schiefgeht.

Was würde dies vor dem 29. September überprüfbar machen?
Beobachte die Oberflächen, die die letzten drei Lecks behoben haben, in dieser Reihenfolge:
• Eine Modell-ID, die in der OpenAI-API aufgelöst wird, oder eine neue Zeile auf deren Preisseite.
• Ein Release-Hinweis im openai-go- oder openai-node-SDK, der neue Modellbezeichner nennt – genau so haben Sol und Luna ihre eigene Ankunft verraten, als SDK v3.65.0 die Modellbezeichner Stunden vor dem Onlinegehen der Ankündigungsseite auslieferte.
• Ein Bedrock- oder Azure-Listing oder ein frischer Statsig-Flag-String in einem Desktop-Build.
• Ein Satz zur Architektur in einer Systemkarte. Dies ist derjenige, der am wichtigsten wäre und zuletzt käme, weil OpenAI das Loop-Design für Astra nie bestätigt hat.
Alles außer den ersten drei ist ein Name, und Namen waren das unzuverlässigste Artefakt dieses ganzen Zyklus.

Warum es wichtig ist, selbst wenn sich der Tweet als falsch herausstellt
Wenn rekurrente Tiefe zum Standard statt zur Ausnahme wird, ändern sich zwei Dinge.
Das erste ist Assurance. Wenn die nächste Generation einen größeren Teil ihres Schlussfolgerns im verborgenen Zustand vollzieht, dann geht bei jeder Evaluierung, die darauf angewiesen ist, die schriftliche Gedankenkette eines Modells zu lesen, Signal verloren — und das umfasst die Sicherheitsbewertung durch Dritte, nicht nur die eigene Überwachung von OpenAI. Das ist ein Beschaffungsfaktor für alle mit einer Assurance-Anforderung, und er wird in einer Benchmark-Tabelle nicht sichtbar sein.
Der zweite Punkt ist die Form der Preisstaffel. Looping tauscht Parameter gegen serielle Rechenleistung und verlagert damit Kosten vom Speicher in die Zeit: potenziell günstiger im Hosting, potenziell langsamer pro Token. Die GPT-6-Reihe bepreist diesen Kompromiss bereits explizit — GPT-6 Astra mit 10 $ Eingabe / 50 $ Ausgabe pro Million Token ist das Tiefenmodell, GPT-6 Sol mit 2 $ / 10 $ ist das schnelle Modell, GPT-6 Luna mit 0,10 $ / 0,50 $ ist das Modell für hohe Volumina. Alle drei sind live auf OrcaRouter zu OpenAIs Listenpreis ohne Aufschlag, sodass, wenn am 29. September ein viertes, gelooptes Modell erscheint, die Preisliste auf unserer Seite die des Anbieters ist, sobald es erscheint — und eine Preissenkung des Anbieters ist hier am selben Tag live, an dem sie dort live ist.
Der praktische Nutzen eines solchen Leaks ist nicht Vorhersage, sondern Vorbereitung. Ein Modell, das in fünf Tagen erscheinen könnte und keinen unabhängigen Benchmark hat, ist genau der Fall, für den automatisches Failover existiert: Richte eine Route auf das neue Modell, halte GPT-6 Astra oder GPT-6 Sol dahinter, und eine schlechte erste Woche kostet dich einen Bruchteil deines Traffics statt deines Produktionspfads. Das ist auch der sinnvolle Weg, ein tiefenlastiges Modell zu testen — die Routing-DSL fügt es in einem Aufruf neben die Modelle ein, die es ersetzen soll, und Model Fusion lässt ein Panel davon gegen denselben Prompt laufen, was ein schnellerer Eindruck von einer neuen Architektur ist als jeder Launch-Post.
Was ist heute Nacht wirklich wahr
Ein Beitrag auf X besagt, dass das zweite geloopte Sprachmodell von OpenAI am 29. September erscheint. Keine Modell-ID, kein Preis, kein Name, keine zweite Quelle, kein Artefakt. Darunter: ein Flaggschiff, das am 3. September ausgeliefert wurde, von dem Berichte sagen, es sei geloopt, und von dem OpenAI nie bestätigt hat, dass es geloopt ist; ein eingestandener Rückgang der Überwachbarkeit von Reasoning-Traces im Vergleich zu GPT-5.6 Sol; ein Chefwissenschaftler, der sagt, das Looping sei auf höchstens das Doppelte der Compute-Graph-Tiefe von GPT-4 begrenzt; und eine günstige Stufe, die am 22. September ausgeliefert wurde und die Architekturfrage kommerziell statt akademisch relevant machte.
Das ist eine dünne Behauptung, die auf einer dicken Story ruht, und das ist die normale Form eines Leaks fünf Tage vor dem Event. Wenn am Dienstag ein zweites Loop-Modell in Fort Mason auftaucht, wird das interessante Detail nicht die Benchmark-Zahl sein – sondern ob die Systemkarte den Vorbehalt zur Überwachbarkeit wiederholt. Dieser eine Satz verrät, ob „nicht länger verboten“ ein Slogan oder eine Richtlinie ist.

In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
