Card del titolo principale per un articolo di monitoraggio delle fughe di notizie intitolato «Il secondo modello ricorrente di OpenAI», con il sottotitolo «Cosa sostiene davvero la fuga di notizie sull'asse proibito del DevDay», con tre card che recitano «Prova: un post su X», «ID modello: nessuno» e «DevDay 2026: 29 settembre», un diagramma piatto a linee di tre blocchi sovrapposti con una freccia che dal blocco inferiore torna a quello superiore, etichettata «profondità ricorrente», e un piè di pagina che recita «Non verificato: nessun ID modello, nessun prezzo, nessuna conferma dal fornitore. Segnalato il 24 settembre 2026.»
Guides & Insights

Il secondo modello looped di OpenAI: cosa afferma davvero il leak del "Forbidden Axis" del DevDay

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Esiste esattamente una sola fonte per l'affermazione di cui tratta questo articolo, ed è un singolo post su X. Il 24 settembre, l'account @scaling01 ha scritto che il fornitore "ha aperto le cateratte e rilascerà il suo secondo modello linguistico a loop oltre a GPT-6 Astra al DevDay", descrivendo la profondità ricorrente come "l'asse proibito" e notando che "non è più proibito". Tutto qui: nessun nome di modello, nessun ID di modello, nessun prezzo, nessuna data oltre al keynote del DevDay del 29 settembre a San Francisco, e nessuna dichiarazione dal fornitore. Ciò che rende l'affermazione degna del tempo di un lettore non è il tweet, ma i fatti già rilasciati che vi stanno sotto. GPT-6 Astra, che il fornitore ha rilasciato il 3 settembre, è il primo modello di produzione di qualsiasi grande laboratorio che i resoconti abbiano collegato a un'architettura a loop con profondità ricorrente. GPT-6 Sol e GPT-6 Luna, distribuiti il 22 settembre a 2 $ in / 10 $ out e 0,10 $ in / 0,50 $ out per milione di token, hanno trasformato quel modello di punta in una scala di prezzi. Un secondo modello a loop significherebbe che il fornitore non considera più la profondità ricorrente come una scommessa isolata, ma come un'architettura permanente — un'affermazione più grande di qualsiasi singolo lancio, e molto più difficile da verificare.

Questo è un pezzo su ciò che sappiamo finora. Tutto ciò che è attribuito a chi ha pubblicato un post o a segnalazioni anonime è etichettato come tale, e nulla di quanto qui riportato deve essere interpretato come un comunicato.

Perché la frase 'asse proibito' è la parte più interessante del tweet

La formulazione è dell'autore del post, non un termine tecnico, ma indica qualcosa di reale. Nello scaling dei transformer ci sono tre assi ovvi: parametri, dati e compute di addestramento. La profondità tramite ricorrenza è un quarto, ed è strano. Invece di impilare N blocchi distinti, un modello con loop riutilizza lo stesso piccolo stack di blocchi R volte, quindi la profondità effettiva è all'incirca il numero di layer moltiplicato per il numero di loop, mentre il numero di parametri resta invariato. Google DeepMind ha esposto la teoria in Ragionamento con pensieri latenti: sul potere dei transformer con loop, e il molto citato Scalare il calcolo in fase di test con il ragionamento latente: un approccio a profondità ricorrente ha dimostrato la validità pratica.

Non è profondità gratis. Il lavoro sullo scaling iso-profondità sui modelli linguistici con loop colloca l'esponente di equivalenza della ricorrenza a circa 0,46 — il che significa che un loop extra ti dà circa il 46% di ciò che ti avrebbe dato un blocco genuinamente nuovo. Stai comprando profondità a sconto, e la paghi in calcolo seriale anziché in memoria. È uno scambio favorevole se sei limitato dalla memoria o vuoi che un modello piccolo si comporti come uno grande, che è esattamente lo scambio che cercano le fasce economiche di qualsiasi famiglia.

Allora perché "vietato"? Perché il calcolo che avviene dentro il loop avviene in stato nascosto, non in token emessi. Il monitoraggio della catena di pensiero — leggere ciò che il modello scrive mentre pensa — è stato il principale strumento di garanzia del settore da quando sono arrivati i modelli di ragionamento, ed è lo strumento che ha reso quantomeno leggibile agli investigatori l'incidente dell'agente Hugging Face di luglio. Un modello che svolge più del suo lavoro nello spazio latente lascia meno da leggere a quello strumento. È questo l'argomento contro il looping alla frontiera da due anni, ed è il motivo per cui la tecnica si è diffusa nei pesi aperti — di ByteDance Seed, l'Ouro a 1,4B e 2,6B, e Nanbeige4.2-3B, che fa passare due volte uno stack di 22 livelli — mentre i laboratori con impegni di sicurezza pubblicati se ne sono tenuti alla larga. I paper MeSH e SpiralFormer di Alibaba hanno affrontato lo stesso problema dal lato dell'efficienza.

Cosa ha effettivamente detto OpenAI, e cosa non ha detto

Il reportage che ha dato il via a tutto questo è quello di The Information, del 1 e 2 settembre: secondo cui Astra utilizza una tecnica chiamata profondità ricorrente, descritta anche come ricorrenza opaca. Si tratta di una testata con fonti solide e un track record concreto, e resta comunque un reportage, non una documentazione. OpenAI non ha mai pubblicato un paper sull'architettura che confermi un design a loop, e l'analisi di Astra di Sebastian Raschka, ampiamente diffusa, afferma chiaramente che la struttura a loop è dedotta da dichiarazioni pubbliche — la sua ricostruzione vede Astra eseguire i suoi 22 blocchi due volte, per 44 applicazioni effettive dei blocchi, con due loop ottimali e loop aggiuntivi che destabilizzano l'addestramento.

Ciò che gli stessi esponenti di OpenAI hanno dichiarato è più circoscritto e più prudente di quanto non suggerissero né la copertura mediatica né le reazioni indignate. Il capo scienziato Jakub Pachocki ha pubblicato il 2 settembre che la profondità del grafo computazionale dei modelli di frontiera, Astra incluso, rientra entro un fattore due rispetto a GPT-4 — una quantità limitata di cicli, non la ricorsione estrema che alcuni titoli lasciavano intendere — e ha respinto quella che ha definito una copertura giornalistica confusa, pur ammettendo che il monitoraggio della catena di pensiero è fragile e sta andando in una direzione negativa. Secondo quanto riportato, la scheda di sistema di Astra osserva che la monitorabilità delle tracce di ragionamento è un passo indietro rispetto a GPT-5.6 Sol, il che è un'ammissione concreta e non dipende da quale architettura l'abbia causata.

La reazione sulla sicurezza è stata fragorosa. Buck Shlegeris di Redwood Research ha dichiarato di essere estremamente preoccupato e ha avvertito che aumentare la scala della ricorrenza potrebbe “distruggere del tutto la monitorabilità del CoT”; Ryan Greenblatt e Zvi Mowshowitz hanno sostenuto la stessa tesi con toni diversi. Il controargomento più utile è venuto da Raschka: OpenAI non divulga le tracce di ragionamento grezze sin dalla generazione o1, indipendentemente dall’architettura, e un modello più forte che emette una catena di pensiero più breve non è di per sé prova di un canale di ragionamento nascosto.

Metti insieme quei due paragrafi e ottieni la situazione su cui il tweet sta scommettendo. «Astra è in loop» è un resoconto credibile che OpenAI ha rifiutato di confermare. «Un secondo modello in loop arriva il 29 settembre» è un singolo post.

Cinque fughe di notizie su OpenAI a settembre, e dove si colloca questa

Settembre ha prodotto un fitto grappolo di storie di fughe di notizie su OpenAI, e la cosa utile è che non appartengono tutte alla stessa categoria di prove.

• 3 settembre — le stringhe gpt-6-astra e gpt-6-astra-aeon sono comparse in un feature flag di Statsig dentro Codex Desktop, screenshottate da @notjazii e amplificate da @kimmonismus. La storia dell'agente Aeon è nata da lì. A cinque settimane di distanza non esiste ancora una pagina prodotto, un prezzo, una documentazione né un benchmark per Aeon, e nessun ID di modello che si risolva.

• 21 settembre — una stringa "GPT-6 Sol medium" è emersa nei registri di merge di NVIDIA.

• 22 settembre — tre percorsi del registro Azure, per gpt-6-sol, gpt-6-luna e gpt-6-astra-minor, sono stati pubblicati dal forum cinese per sviluppatori locdd.com come un URL Microsoft attivo. Quando il giorno successivo abbiamo recuperato l'endpoint pubblico di configurazione del playground, i tre nuovi nomi non erano presenti; il registro conteneva invece gpt-6-astra e le voci più vecchie della generazione GPT-5.6.

• 22 settembre — GPT-6 Sol e GPT-6 Luna sono stati rilasciati. Prezzo, ID dei modelli, note di rilascio dell'SDK, una scheda Bedrock, una voce nel selettore di GitHub Copilot e un valore predefinito di Perplexity sono arrivati tutti entro un giorno.

Lo schema non è sottile. Le classi di leak che portavano un artefatto dentro una superficie che viene effettivamente rilasciata — una nota di rilascio di un SDK, un registry cloud, un feature flag desktop — continuavano a trasformarsi in prodotti. Le classi di leak che erano solo un nome no. L'affermazione di oggi, un secondo modello linguistico in loop di OpenAI al DevDay, non porta alcun artefatto: nessuna stringa, nessun flag, nessun percorso di registry, nessuna riga di prezzo, nessun ID di modello. Questo non lo rende sbagliato. Lo rende non verificabile dall'esterno, che è una descrizione diversa e più onesta.

Il programma del DevDay che lo circonda è reale, e insolitamente ben documentato.

L'unica cosa che puoi datare con precisione è l'evento. DevDay 2026 è confermato per martedì 29 settembre, a Fort Mason, San Francisco, con Sam Altman come keynote speaker e una diretta streaming gratuita — OpenAI ha annunciato la data già ad aprile.

Quel che ci si aspetta da esso è stato telegrafato con più forza del solito. Altman ha pubblicato il 15 settembre che OpenAI aveva «un grosso rilascio questa settimana, e poi per il DevDay ship x 6», e la sera successiva ha fatto marcia indietro sulla prima metà: «la cosa principale che ero entusiasta di lanciare questa settimana sarà invece la prossima, ma secondo me vale l'attesa!» Il responsabile di prodotto Tibo Sottiaux, che aveva presentato quella settimana come una settimana di livello DevDay, ha detto il 19 settembre che il rilascio sarebbe comunque arrivato martedì, e il 22 settembre è arrivato — Sol e Luna, più un reset dell'utilizzo di Codex accantonato per gli account a pagamento. Leggi «ship x 6» come un conteggio di sei cose rilasciate intorno al DevDay e un secondo modello in loop si inserisce senza problemi nel senso ordinario dell'espressione; leggilo come iperbole e non si inserisce affatto. In ogni caso è il post di un fondatore, non una roadmap.

Fughe di notizie adiacenti puntano nella stessa direzione senza nominare un modello. Una build di Codex Cloud è emersa nella build 9922 di ChatGPT desktop con integrazioni Tailscale e proxy, e un flusso di onboarding ha mostrato livelli di piano per sviluppatori — Free, Prototype e Accelerate, l'ultimo a 50 $ — giorni prima del keynote. Nessuno dei due è un modello in loop. Entrambi sono coerenti con un DevDay più incentrato sulla piattaforma che sulla ricerca.

Se è reale, di quale modello si tratta?

Nessuno ha segnalato un'identità, quindi quanto segue è un'inferenza e va letto come tale.

La via più breve verso il "secondo modello looped di OpenAI" è un successore di Astra. Altman ha detto che modelli più capaci arriveranno "molto presto", e il modo più economico per costruirne uno su una base a profondità ricorrente è mantenere l'architettura e aumentare il budget di loop — più ricorrenza per token anziché più pesi. Questa lettura spiega anche al meglio l'inquadramento delle "floodgates", perché un secondo modello di punta sulla stessa architettura è una dichiarazione che il primo ha funzionato.

La seconda lettura è un nuovo livello all'interno della linea GPT-6 esistente. La grammatica dei nomi ha già prodotto le stringhe gpt-6-astra-minor, gpt-6-sol e gpt-6-luna, e un gemello con loop a un diverso budget di profondità è del tutto coerente con una famiglia che ora spazia da $0,10 a $50 per milione di token di output. Un modello con loop più economico sarebbe la versione di tutto ciò che un lettore sente maggiormente nel portafoglio.

La terza lettura — un rilascio open-weights in loop — è la meno supportata. Spiegherebbe la frase meglio di qualsiasi altra cosa, e la letteratura open looped a cui si affiancherebbe esiste già in Ouro e Nanbeige4.2-3B, ma OpenAI non ha annunciato nulla in quella direzione per questa generazione, e inventare un prodotto per far combaciare una parola è il modo in cui la copertura dei leak va storta.

A two-column scoreboard titled 'GPT-6 Astra vs the second looped model - the scoreboard'. The left column, GPT-6 Astra, reads: Status: shipped Sep 3, 2026; Model ID: gpt-6-astra; Architecture: reported looped; Price per MTok: $10 / $50; Context window: about 1.05M tokens; Evidence: vendor docs and API. The right column, Second looped model, reads: Status: not announced; Model ID: none; Architecture: reported looped; Price per MTok: not published; Context window: not published; Evidence: one X post. A footer reads 'Astra figures per OpenAI and Artificial Analysis. Second looped model: unconfirmed, single social post, no vendor documentation.'

Cosa lo renderebbe verificabile prima del 29 settembre?

Tieni d'occhio le superfici che hanno risolto le ultime tre perdite, in questo ordine:

• Un ID di modello che viene risolto nell'API di OpenAI, o una nuova riga nella sua pagina dei prezzi.

• Una nota di rilascio nell'SDK openai-go o openai-node che nomina nuovi identificatori di modello — è esattamente così che Sol e Luna hanno fatto trapelare il proprio arrivo, con l'SDK v3.65.0 che ha distribuito gli identificatori dei modelli ore prima che comparisse la pagina dell'annuncio.

• Un annuncio Bedrock o Azure, oppure una nuova stringa di flag Statsig in una build desktop.

• Una frase sull'architettura in una scheda di sistema. Questa è quella che conterebbe di più e arriverebbe per ultima, perché OpenAI non ha mai confermato il design a ciclo di Astra.

Tutto ciò che non rientra nei primi tre è un nome, e i nomi sono stati l'artefatto meno affidabile di tutto questo ciclo.

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the model title GPT-6 Astra with its OpenAI vendor badge and a 2026-09-04 date, Vision, Tools, JSON and Reasoning capability tags, a 1M-token context window with a 128K maximum output, text, image and file input, an input price of $10.00 and an output price of $50.00 per million tokens, a p50 time to first token of 10.00 seconds, and 298.3M tokens of traffic over seven days.

Perché è importante anche se il tweet si rivela sbagliato

Due cose cambiano se la profondità ricorrente diventa standard anziché eccezionale.

Il primo è la garanzia. Se la prossima generazione svolgerà gran parte del proprio ragionamento in stato nascosto, allora qualsiasi valutazione che dipende dalla lettura della catena di pensiero scritta di un modello perde segnale — e ciò include la valutazione di sicurezza di terze parti, non solo il monitoraggio interno di OpenAI. È un fattore da considerare negli approvvigionamenti per chiunque abbia un requisito di garanzia, e non sarà visibile in una tabella di benchmark.

Il secondo è la forma della scala dei prezzi. Il looping scambia parametri con calcolo seriale, quindi sposta il costo dalla memoria al tempo: potenzialmente più economico da ospitare, potenzialmente più lento per token. La linea GPT-6 prezza già esplicitamente questo compromesso — GPT-6 Astra a $10 in input / $50 in output per milione di token è il modello di profondità, GPT-6 Sol a $2 / $10 è quello veloce, GPT-6 Luna a $0.10 / $0.50 è quello per grandi volumi. Tutti e tre sono attivi su OrcaRouter al prezzo di listino di OpenAI senza ricarico, quindi se un quarto modello, con looping, arriva il 29 settembre, il listino dalla nostra parte è il listino del fornitore il giorno stesso in cui viene rilasciato — e un taglio di prezzo del fornitore è attivo qui lo stesso giorno in cui è attivo lì.

L'uso pratico di una fuga di notizie come questa non è la previsione, è la preparazione. Un modello che potrebbe essere rilasciato tra cinque giorni e non ha un benchmark indipendente è precisamente il caso per cui esiste il failover automatico: indirizza una route verso il nuovo modello, tieni GPT-6 Astra o GPT-6 Sol dietro di esso, e una brutta prima settimana ti costa una frazione del tuo traffico invece del tuo percorso di produzione. Questo è anche il modo sensato di testare un modello ad alta profondità — il routing DSL lo compone in un'unica chiamata accanto ai modelli che intende sostituire, e la fusione di modelli ne eseguirà un panel contro lo stesso prompt, che è una lettura più rapida di una nuova architettura rispetto a qualsiasi post di lancio.

Che cosa è realmente vero stasera?

Un post su X afferma che il secondo modello linguistico con loop di OpenAI arriva il 29 settembre. Nessun ID modello, nessun prezzo, nessun nome, nessuna seconda fonte, nessun artefatto. Sotto di esso: un modello di punta rilasciato il 3 settembre che, secondo quanto riportato, è dotato di loop e che OpenAI non ha mai confermato essere dotato di loop, un calo ammesso nella monitorabilità della traccia di ragionamento rispetto a GPT-5.6 Sol, un chief scientist che afferma che il looping è limitato entro il doppio della profondità del grafo computazionale di GPT-4, e una fascia economica rilasciata il 22 settembre che ha reso la questione architetturale rilevante commercialmente anziché accademica.

Questa è un'affermazione fragile che poggia su una storia corposa, la forma normale di una fuga di notizie cinque giorni prima dell'evento. Se martedì comparirà un secondo modello in loop a Fort Mason, il dettaglio interessante non sarà il numero del benchmark — sarà se la scheda di sistema ripete l'avvertenza sulla monitorabilità. È quella singola frase a dirti se "non più proibito" è uno slogan o una politica.

A screenshot of the Artificial Analysis model page for OpenAI GPT-6 Astra (max), showing the model title with a 'Proprietary model, Released September 2026' label, its position of #6 of 210 on Intelligence and #82 of 210 on Verbosity, an input price of $10.00 and an output price of $50.00 per million tokens, a 52.5 output-speed reading, a $3.26 blended cost figure, a comparison summary reading that it is among the leading models in intelligence but particularly expensive, notably slow and fairly concise, and technical specifications listing text and image input, text output, and a 1M-token context window with knowledge up to April 2026.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno