
OpenAI's tweede looped model: wat het DevDay-'Forbidden Axis'-lek werkelijk beweert
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 177 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1323 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Er is precies één bron voor de bewering waar dit artikel over gaat, en het is een enkele post op X. Op 24 september schreef het account @scaling01 dat de leverancier "de sluizen heeft geopend en tijdens DevDay hun tweede geluste taal model naast GPT-6 Astra zal uitbrengen", waarbij hij recurrente diepte omschreef als "de verboden as" en opmerkte dat die "niet langer verboden" is. Dat is alles: geen modelnaam, geen model-ID, geen prijs, geen datum verder dan de DevDay-keynote van 29 september in San Francisco, en geen woord van de leverancier. Wat de bewering de tijd van een lezer waard maakt, is niet de tweet, maar de feiten die eronder liggen. GPT-6 Astra, dat de leverancier op 3 september uitbracht, is het eerste productiemodel van welk groot lab dan ook dat de berichtgeving heeft gekoppeld aan een geluste architectuur met recurrente diepte. GPT-6 Sol en GPT-6 Luna, uitgebracht op 22 september tegen $2 in / $10 uit en $0,10 in / $0,50 uit per miljoen tokens, maakten van dat vlaggenschip een prijsladder. Een tweede gelust model zou betekenen dat de leverancier recurrente diepte niet langer als een eenmalige gok behandelt, maar als vaste architectuur — een grotere bewering dan welke afzonderlijke lancering dan ook, en een veel moeilijker te controleren bewering.
Dit is een stuk met wat we tot nu toe weten. Alles wat aan een poster of aan anonieme berichtgeving wordt toegeschreven, is als zodanig aangeduid, en niets hier mag als een officiële bekendmaking worden gelezen.
Waarom de uitdrukking 'forbidden axis' het meest interessante deel van de tweet is
De formulering is van de poster zelf, geen vakterm, maar ze wijst op iets reëels. Bij het opschalen van transformers zijn er drie voor de hand liggende assen: parameters, data en trainingscompute. Diepte-door-recurrentie is een vierde, en een vreemde. In plaats van N afzonderlijke blokken te stapelen, hergebruikt een model met lussen dezelfde kleine stapel blokken R keer, zodat de effectieve diepte ruwweg het aantal lagen maal het aantal lussen is, terwijl het aantal parameters gelijk blijft. Google DeepMind zette de theorie uiteen in Redeneren met latente gedachten: over de kracht van transformers met lussen, en het veelgeciteerde Testtijdcompute opschalen met latente redenering: een benadering met recurrente diepte zorgde voor de praktische onderbouwing.
Het is geen gratis diepte. Het iso-diepteschalingswerk aan geluste taalmodellen zet de recurrentie-equivalentie-exponent op ongeveer 0,46 — wat betekent dat één extra lus je ongeveer 46% oplevert van wat een werkelijk nieuw blok zou hebben opgeleverd. Je koopt diepte met korting, en betaalt ervoor in seriële rekentijd in plaats van geheugen. Dat is een gunstige ruil als je geheugengebonden bent of wilt dat een klein model zich gedraagt als een groot model, precies de ruil waar de goedkope niveaus van elke familie naar op zoek zijn.
Dus waarom "verboden"? Omdat de berekening die binnen de lus plaatsvindt, in verborgen toestand gebeurt, niet in uitgegeven tokens. Het monitoren van de gedachtegang — lezen wat het model opschrijft terwijl het denkt — is sinds de komst van redeneermodellen het belangrijkste borgingsinstrument van de sector, en het is het instrument dat het incident met de Hugging Face-agent in juli überhaupt inzichtelijk maakte voor onderzoekers. Een model dat meer van zijn werk in de latente ruimte doet, geeft dat instrument minder om te lezen. Dat is al twee jaar het argument tegen loopen aan het frontier, en het is waarom de techniek zich verspreidde in open gewichten — ByteDance Seed's Ouro met 1,4B en 2,6B, en Nanbeige4.2-3B, die een stack van 22 lagen twee keer doorloopt — terwijl de labs met gepubliceerde veiligheidsverplichtingen er wegbleven. Alibaba's MeSH- en SpiralFormer-papers pakten hetzelfde probleem vanuit de efficiëntiekant aan.
Wat OpenAI daadwerkelijk heeft gezegd, en wat niet.
Het bericht dat dit in gang zette, is The Information, op 1 en 2 september: dat Astra een techniek gebruikt die recurrent depth heet, ook wel omschreven als opaque recurrence. Dat is een medium met goede bronnen en een echte staat van dienst, en het is nog steeds berichtgeving, geen documentatie. OpenAI heeft nooit een architectuurpaper gepubliceerd die een lusvormig ontwerp bevestigt, en de veelgelezen analyse van Astra door Sebastian Raschka zegt ronduit dat de lusstructuur is afgeleid uit publieke uitspraken — zijn reconstructie laat Astra zijn 22 blokken twee keer doorlopen, wat neerkomt op 44 effectieve bloktoepassingen, waarbij twee lussen optimaal zijn en meer lussen de training destabiliseren.
Wat OpenAI's eigen mensen hebben gezegd, is beperkter en voorzichtiger dan zowel de berichtgeving als de backlash suggereerde. Hoofdwetenschapper Jakub Pachocki plaatste op 2 september dat de diepte van de computationele graaf van frontiermodellen, Astra inbegrepen, binnen een factor twee van GPT-4 ligt — een begrensde hoeveelheid looping, niet de extreme recursie die sommige koppen impliceerden — en zette zich af tegen wat hij verwarde berichtgeving noemde, terwijl hij toegaf dat chain-of-thought-monitoring fragiel is en een negatieve richting opgaat. De systeemkaart van Astra zou naar verluidt vermelden dat de monitorbaarheid van redeneersporen een stap terug is ten opzichte van GPT-5.6 Sol, wat een echte erkenning is en niet afhangt van welke architectuur dit veroorzaakte.
De reactie uit veiligheidshoek was luid. Buck Shlegeris van Redwood Research zei dat hij uiterst bezorgd was en waarschuwde dat het opschalen van recurrentie "de CoT-monitorbaarheid volledig zou kunnen vernietigen"; Ryan Greenblatt en Zvi Mowshowitz maakten hetzelfde argument in verschillende registers. Het nuttigste tegenargument kwam van Raschka: OpenAI houdt sinds de o1-generatie ruwe redeneersporen achterwege, ongeacht de architectuur, en een sterker model dat een kortere chain-of-thought produceert, is op zichzelf geen bewijs voor een verborgen redeneerkanaal.
Als je die twee alinea's samenvoegt, krijg je de stand van zaken waar de tweet op gokt. "Astra is looped" is geloofwaardige berichtgeving die OpenAI heeft geweigerd te bevestigen. "Een tweede looped model komt op 29 september uit" is één post.
Vijf OpenAI-lekken in september, en waar deze te plaatsen valt
September produceerde een dichte cluster van OpenAI-lekverhalen, en het nuttige eraan is dat ze niet allemaal tot dezelfde klasse van bewijs behoren.
• 3 september — de strings gpt-6-astra en gpt-6-astra-aeon verschenen in een Statsig-featureflag in Codex Desktop, gescreenshot door @notjazii en versterkt door @kimmonismus. Het verhaal over de Aeon-agent is daaruit voortgekomen. Vijf weken later is er nog steeds geen productpagina, geen prijs, geen documentatie en geen benchmark voor Aeon, en geen model-ID die resolveert.
• 21 september — een string "GPT-6 Sol medium" dook op in de samenvoeggegevens van NVIDIA.
• 22 september — drie Azure-registerpaden, voor gpt-6-sol, gpt-6-luna en gpt-6-astra-minor, werden vanaf het Chinese ontwikkelaarsforum locdd.com geplaatst als een live Microsoft-URL. Toen we de volgende dag het openbare playground-configuratie-endpoint ophaalden, stonden de drie nieuwe namen er niet in; het register bevatte in plaats daarvan gpt-6-astra en de oudere vermeldingen van de GPT-5.6-generatie.
• 22 september — GPT-6 Sol en GPT-6 Luna zijn uitgebracht. Prijs, model-ID's, SDK-releaseopmerkingen, een Bedrock-vermelding, een item in de GitHub Copilot-kiezer en een Perplexity-standaardoptie volgden allemaal binnen een dag.
Het patroon is niet subtiel. De lekklassen die een artefact droegen in een oppervlak dat daadwerkelijk wordt uitgeleverd — een SDK-releaseopmerking, een cloudregister, een desktopfeatureflag — bleven producten worden. De lekklassen die alleen een naam waren, deden dat niet. De bewering van vandaag, een tweede loop-taalmodel van OpenAI op DevDay, bevat helemaal geen artefact: geen string, geen flag, geen registerpad, geen prijsregel, geen model-ID. Dat maakt het niet onjuist. Het maakt het van buitenaf niet controleerbaar, wat een andere en eerlijkere beschrijving is.
Het DevDay-programma eromheen is echt en ongewoon goed gedocumenteerd.
Het enige wat je precies kunt dateren, is het evenement. DevDay 2026 is bevestigd voor dinsdag 29 september in Fort Mason in San Francisco, met Sam Altman die de keynote verzorgt en een gratis livestream — OpenAI maakte de datum al in april bekend.
Wat erin wordt verwacht, is nadrukkelijker dan gewoonlijk vooraf aangekondigd. Altman plaatste op 15 september dat OpenAI deze week een "grote uitrol" had, en dan voor devday "ship x 6", en zwakte de eerste helft de volgende avond af: "het belangrijkste waar ik deze week naar uitkeek om te lanceren, wordt in plaats daarvan volgende week, maar imo het wachten waard!" Productlead Tibo Sottiaux, die de week als van DevDay-formaat had neergezet, zei op 19 september dat de release nog steeds op dinsdag zou komen, en op 22 september gebeurde dat — Sol en Luna, plus een opgespaarde Codex-gebruiksreset voor betaalde accounts. Lees "ship x 6" als een telling van zes dingen die rond DevDay worden uitgebracht, en een tweede model in een loop past gemakkelijk binnen de gewone betekenis van de uitdrukking; lees het als hyperbool, en het past helemaal niet. Hoe dan ook, het is een post van een oprichter, geen roadmap.
Aangrenzende lekken wijzen in dezelfde richting zonder een model te noemen. Een Codex Cloud-build dook op in desktop ChatGPT-build 9922 met Tailscale- en proxy-integraties, en een onboardingflow toonde ontwikkelaarsniveaus — Free, Prototype en Accelerate, de laatste voor $50 — dagen voor de keynote. Geen van beide is een geloopt model. Beide passen bij een DevDay die zwaarder leunt op platform dan op onderzoek.
Als het echt is, welk model is het dan?
Niemand heeft een identiteit gemeld, dus het volgende is een gevolgtrekking en moet als zodanig worden gelezen.
De kortste weg naar "OpenAI's tweede loopmodel" is een Astra-opvolger. Altman heeft gezegd dat er "zeer binnenkort" capabelere modellen aankomen, en de goedkoopste manier om er een te bouwen op een recurrent-depth-basis is de architectuur te behouden en het lusbudget te verhogen — meer recurrentie per token in plaats van meer gewichten. Die lezing verklaart ook het beste de "floodgates"-framing, want een tweede vlaggenschip op dezelfde architectuur is een statement dat het eerste werkte.
De tweede interpretatie is een nieuw niveau binnen de bestaande GPT-6-lijn. De naamgevingsgrammatica heeft al de strings gpt-6-astra-minor, gpt-6-sol en gpt-6-luna voortgebracht, en een looped zustermodel met een ander dieptebudget is volledig in lijn met een familie die nu uiteenloopt van $0,10 tot $50 per miljoen outputtokens. Een goedkoper looped model zou de versie hiervan zijn die een lezer het meest in de portemonnee voelt.
De derde lezing — een open-gewichtenrelease met lussen — is de minst onderbouwde. Die zou de uitdrukking beter verklaren dan wat dan ook, en de open literatuur over modellen met lussen waar deze naast zou staan, bestaat al in Ouro en Nanbeige4.2-3B, maar OpenAI heeft voor deze generatie niets in die richting aangekondigd, en een product verzinnen om bij een woord te passen is hoe berichtgeving over lekken misgaat.

Wat zou dit vóór 29 september controleerbaar maken?
Let op de oppervlakken die de laatste drie lekken hebben opgelost, in deze volgorde:
• Een model-ID dat in de OpenAI-API werkt, of een nieuwe rij op de prijzenpagina.
• Een release note in de openai-go- of openai-node-SDK die nieuwe model-ID's noemt — precies zo lieten Sol en Luna hun eigen aankomst uitlekken, doordat SDK v3.65.0 de model-ID's al uren voordat de aankondigingspagina online ging meeleverde.
• Een Bedrock- of Azure-vermelding, of een nieuwe Statsig-flagstring in een desktopbuild.
• Een zin over de architectuur in een systeemkaart. Dit is de zin die er het meest toe zou doen en het laatst zou komen, omdat OpenAI het lusvormige ontwerp voor Astra nooit heeft bevestigd.
Alles behalve de eerste drie is een naam, en namen zijn het minst betrouwbare artefact van deze hele cyclus geweest.

Waarom het ertoe doet, zelfs als de tweet onjuist blijkt te zijn
Twee dingen veranderen als recurrente diepte standaard wordt in plaats van uitzonderlijk.
Het eerste is borging. Als de volgende generatie meer van zijn redenering in verborgen toestand uitvoert, dan verliest elke evaluatie die afhankelijk is van het lezen van de geschreven gedachteketen van een model signaal — en dat omvat veiligheidsevaluatie door derden, niet alleen de eigen monitoring van OpenAI. Dat is een inkoopinput voor iedereen met een borgingsvereiste, en het zal niet zichtbaar zijn in een benchmarktabel.
Het tweede is de vorm van de prijsladder. Looping ruilt parameters in voor seriële rekenkracht, dus het verplaatst kosten van geheugen naar tijd: mogelijk goedkoper om te hosten, mogelijk langzamer per token. De GPT-6-lijn prijst die afweging al expliciet — GPT-6 Astra tegen $10 in / $50 uit per miljoen tokens is het dieptemodel, GPT-6 Sol tegen $2 / $10 is de snelle, GPT-6 Luna tegen $0,10 / $0,50 is de optie voor grote volumes. Alle drie zijn live op OrcaRouter tegen de lijstprijs van OpenAI zonder opslag, dus als er op 29 september een vierde, geloopt model verschijnt, is de tariefkaart aan onze kant die van de leverancier op de dag dat die uitkomt — en een prijsverlaging van de leverancier is hier live op dezelfde dag dat die daar live is.
Het praktische nut van een lek als dit is niet voorspelling, het is voorbereiding. Een model dat over vijf dagen uitgebracht zou kunnen worden en geen onafhankelijke benchmark heeft, is precies het geval waarvoor automatische failover bestaat: wijs een route naar het nieuwe model, houd GPT-6 Astra of GPT-6 Sol erachter, en een slechte eerste week kost je een fractie van je verkeer in plaats van je productiepad. Dat is ook de verstandige manier om een diepte-intensief model te testen — de routing-DSL composeert het tot één aanroep naast de modellen die het hoort te vervangen, en model fusion laat een panel ervan tegen dezelfde prompt lopen, wat een sneller beeld geeft van een nieuwe architectuur dan welke lanceringspost dan ook.
Wat is vanavond eigenlijk waar?
Eén post op X zegt dat het tweede taalmodel met een lusarchitectuur van OpenAI op 29 september verschijnt. Geen model-ID, geen prijs, geen naam, geen tweede bron, geen artefact. Daaronder: een vlaggenschip dat op 3 september werd uitgebracht, waarvan de berichtgeving zegt dat het een lusarchitectuur heeft en waarvan OpenAI nooit heeft bevestigd dat het een lusarchitectuur heeft, een toegegeven achteruitgang in de monitorbaarheid van redeneertraces ten opzichte van GPT-5.6 Sol, een hoofdwetenschapper die zegt dat de luswerking beperkt blijft tot binnen tweemaal de computegraafdiepte van GPT-4, en een goedkope tier die op 22 september werd uitgebracht en de architectuurvraag commercieel relevant maakte in plaats van academisch.
Dat is een dunne bewering die op een dik verhaal rust, wat de normale vorm is van een lek vijf dagen voor het evenement. Als er dinsdag een tweede looped model in Fort Mason opduikt, zal het interessante detail niet het benchmarkcijfer zijn — het zal erom gaan of de systeemkaart het voorbehoud over monitorbaarheid herhaalt. Het is die ene zin die je vertelt of "niet langer verboden" een slogan of een beleid is.

Vergeleken in dit artikel3
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
