OpenAI Astra-1
Guides & Insights

OpenAI Astra: Tutto ciò che sappiamo sul modello che non è GPT-6

Autore

Jim Song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La cosa che puoi scaricare oggi non è un modello. Sono dieci file di codice Lean. Il 1° agosto 2026, OpenAI ha pubblicato un post di ricerca sulla matematica, e al suo interno era nascosta la prima conferma del nome del suo prossimo sistema di frontiera: Astra. Non c'è una scheda del modello, nessuna pagina dei prezzi, nessun endpoint API e nessuna data. L'attuale ammiraglia che puoi effettivamente chiamare è ancora GPT-5.6 Sol, a 5 dollari per milione di token di input e 30 dollari per milione di token di output, esattamente com'è dal 9 luglio.

Se hai cercato GPT-6, ecco la versione breve: OpenAI non ha mai annunciato un modello con quel nome e, ad oggi, non ha deciso se Astra verrà rilasciata come GPT-6, come una point release di GPT-5, ad esempio GPT-5.7, o come un quarto livello accanto a Sol, Terra e Luna. Questa ambiguità sul nome non è timidezza nei confronti della stampa. È una questione interna ancora aperta, riportata da The Information il 31 luglio e da allora non risolta.

Quello che segue separa tre cose che la maggior parte della copertura di questa storia mescola insieme: ciò che OpenAI stessa ha dichiarato, ciò che aggiungono resoconti credibili e ciò che circola senza alcuna fonte collegata. Le prove sono artefatti reali che puoi compilare. La cifra dei 10.000 miliardi di parametri è un numero che qualcuno ha digitato su internet. Queste cose meritano un peso molto diverso.

Cosa ha detto realmente OpenAI — e l'elenco molto più lungo di ciò che non ha detto

L'annuncio non è arrivato come lancio di un prodotto, ma come un articolo scientifico. Il post di OpenAI descriveva i risultati prodotti da "una versione interna di Astra, il nostro prossimo modello principale," su problemi che, secondo la sua impostazione, non avevano visto progressi sul risultato principale per almeno un decennio. Astra è stata presentata come un sistema progettato per lavori di lunga durata: più agenti che coordinano diverse parti di un unico grande problema per periodi prolungati, piuttosto che rispondere in un'unica passata.

Ciò è vicino all'intera descrizione tecnica ufficiale. A confronto, la lista delle assenze è sorprendente:

Confermato da OpenAI — il nome Astra; che è il "prossimo modello principale"; che una versione interna ha prodotto dieci risultati; l'intento progettuale multi-agente e a lungo orizzonte; un manoscritto di 249 pagine; certificati Lean 4 su un repository pubblico; una stima del costo dei token quotata alle tariffe di GPT-5.6 Sol.

Non dichiarato da OpenAI — data di rilascio; prezzo; finestra di contesto; numero di parametri; eventuali punteggi di benchmark; la scheda del modello; se arriva a ChatGPT o solo all'API; quanti agenti sono stati eseguiti, per quanto tempo, su quale hardware; i prompt; il tasso di successo; il nome finale del prodotto.

Un resoconto credibile aggiunge qualche dettaglio.The Information ha riportato che Sam Altman ha dimostrato Astra ai decisori politici a Washington alla fine di luglio — un briefing che, secondo quel resoconto, ha incluso i senatori Raphael Warnock, Bernie Moreno e Mark Warner, con il Segretario al Tesoro Scott Bessent e il Segretario al Commercio Howard Lutnick anch'essi presenti. La famiglia di modelli è descritta come già in fase di test, con "Astra" stesso ancora un'etichetta provvisoria.

Nessuno al di fuori di OpenAI ha eseguito questo modello su nulla. Ogni affermazione sulle sue capacità in circolazione risale o alle dieci prove pubblicate o a una demo che il pubblico non ha mai visto.

Le dieci dimostrazioni: insolitamente verificabili, e ancora non risolte

OpenAI Astra-2

È qui che l'annuncio è davvero più forte di un tipico rilascio di benchmark, e vale la pena essere precisi sul perché. OpenAI non ha pubblicato un punteggio chiedendo di essere creduta. Ha pubblicato artefatti verificabili automaticamente sotto Apache 2.0 nel repository openai/ten-proofs — un file Lean per risultato, vincolato a Lean 4.32.0 con una dipendenza da mathlib, insieme a una directory ComparatorChallenges per la verifica indipendente. Il repository è arrivato come un singolo commit il 1° agosto e da allora ha raccolto diverse centinaia di stelle e decine di fork.

I dieci risultati, come li nomina il repository, coprono una gamma insolitamente ampia di campi:

Teoria dei gruppi — la costruzione di un gruppo non-sofico, che risponde negativamente a una questione rimasta aperta dal 1999. La soficità è una proprietà che quasi tutti i gruppi con cui lavorano i matematici soddisfano; se ogni gruppo discreto numerabile debba soddisfarla era rimasto in sospeso per 27 anni.

Algebre di operatori — un controesempio relativo alla congettura di rigidità di Connes, proposta dal medagliato Fields Alain Connes nel 1980.

Geometria ad alta dimensione — un miglioramento del metodo di impacchettamento di sfere, riportato come il primo del suo genere dal 1978 — più una forma precisa della disuguaglianza di volume di Ehrhart.

Teoria dei codici — nuovi limiti per codici binari e sferici.

Complessità — un limite inferiore per circuiti aritmetici per il permanente, e un risultato esponenziale di ripetizione parallela per giochi entangled.

Crittografia a reticoli — durezza polinomiale fissa per il problema del vettore più vicino.

Combinatoria estrema — la scala di crescita dei numeri di Ramsey triangolari multicolore, e controesempi nella teoria estrema dei grafi, inclusi lavori su diversi problemi di Erdős catalogati.

Le reazioni dei matematici sono state interessate piuttosto che sprezzanti. Thomas Bloom, che gestisce il database dei problemi di Erdős, ha definito i risultati una grande notizia e li ha valutati al di sopra del controesempio della congettura della distanza unitaria di maggio. Noam Brown di OpenAI ha offerto l'utile ridimensionamento dall'interno: "Purtroppo, nessun Millennium Prize Problems (ancora)."

Ciò che un certificato Lean stabilisce, e ciò che lascia aperto

Una dimostrazione Lean che supera il type-checking è valida per costruzione. Non sei tenuto a fidarti della metodologia di valutazione di OpenAI, della sua scelta dei baseline o della sua interpretazione dei propri risultati: puoi compilare i file. Per un settore in cui "abbiamo ottenuto il 94,1%" è l'unità di evidenza standard, questo è un miglioramento significativo in termini di falsificabilità.

È anche più limitato di quanto i titoli lascino intendere, in quattro modi specifici. Lean verifica che la dimostrazione di un'affermazione formale sia valida. Non verifica che l'affermazione formale sia il teorema che la prosa sostiene. Non verifica che le definizioni codificate corrispondano a ciò che la disciplina intende con quelle parole. Non verifica le riduzioni informali che collegano gli estremi formali al risultato annunciato. E non dice nulla sulla novità — se un risultato sia nuovo o già noto con un altro nome.

Tutte e quattro sono questioni di giudizio umano e, al momento dell'annuncio, nessuna aveva superato una revisione paritaria. Il manoscritto riconosce consultazioni con specialisti; i riconoscimenti non sono approvazioni di ogni singola affermazione. Una compilazione parziale pubblicata del repository ha compilato 8.820 dei 9.007 job, che è ciò che una grande formalizzazione reale appare a metà verifica, piuttosto che un controllo completato. Lo stato onesto oggi è dieci affermazioni di ricerca serie e formalmente codificate — non dieci voci consolidate nel canone matematico.

Esiste un secondo limite, più silenzioso: il processo di scoperta non è riproducibile da nessuno al di fuori di OpenAI. Le prove sono pubbliche; il sistema di ricerca, i prompt, i checkpoint e l'ambiente di esecuzione no. Puoi verificare la destinazione. Non puoi ripetere il viaggio.

La cifra di 2.000 dollari, e perché compra meno di quanto sembri

OpenAI Astra-3

Il numero che ha viaggiato più lontano è stato il costo. OpenAI ha collocato la spesa in token dietro le dieci soluzioni a circa 2.000 dollari, ai prezzi GPT-5.6 Sol — circa 200 dollari per problema aperto vecchio di un decennio, secondo la lettura più comune della sua formulazione. Alcune testate hanno letto la stessa frase come sotto i 2.000 dollari per problema, una differenza di dieci volte; il post di OpenAI è abbastanza sintetico che entrambe le letture sono arrivate alla stampa, e non abbiamo visto l'azienda chiarire la questione.

Prendi la lettura totale e fai il calcolo. Sol addebita $5 per milione di token di input e $30 per milione di output, con i token di ragionamento fatturati come output. Se la spesa fosse interamente di output, $2.000 basterebbero al massimo per circa 67 milioni di token di output — all'incirca 6,7 milioni per problema. È molto ragionamento, e non è una quantità assurda di ragionamento. È il tipo di budget che un gruppo di ricerca ben finanziato potrebbe già spendere per una singola domanda difficile.

Tre avvertenze contano più del titolo:

È un prezzo controfattuale, non un prezzo. Astra non è ancora stata rilasciata e non ha un prezzo. I $2.000 descrivono quanto quei token costerebbero alle tariffe di un altro modello. Un sistema di frontiera progettato per esecuzioni multi-agente che durano ore non ha alcuna ragione ovvia per essere prezzato come Sol, e ogni ragione per essere prezzato al di sopra di esso.

Conta solo le vittorie. Non è stato pubblicato alcun tasso di successo. Non sappiamo quanti problemi Astra ha affrontato senza riuscire a risolverli, né quanto siano costati quei tentativi. Un costo per successo pubblicato senza un tasso di successo non è un costo per risultato, e la differenza potrebbe essere di un ordine di grandezza in entrambe le direzioni.

I token sono la parte economica. Gli esseri umani hanno inquadrato i problemi, preparato i manoscritti e guidato la formalizzazione. Quel lavoro non è nei 2.000 dollari.

L'unica parte che puoi prezzare oggi è la baseline. Poiché OrcaRouter passa direttamente il prezzo di listino del provider con un margine dello 0%, GPT-5.6 Sol costa gli stessi $5/$30 sulla nostra API come su quella di OpenAI — quindi se vuoi verificare i calcoli sul tuo carico di lavoro, la tariffa nell'annuncio è quella che pagheresti effettivamente. Ciò che nessuno può ancora prezzare è Astra stessa, e qualsiasi fornitore che ti dica il contrario sta solo tirando a indovinare.

La data di rilascio è vincolata da un timer di 30 giorni, non da una fuga di notizie.

OpenAI Astra-4

La maggior parte della copertura sul "quando arriva GPT-6" è aritmetica da voci di corridoio. C'è un vincolo più concreto che sta lì, in piena vista, e non è quasi mai stato collegato alla questione.

Un ordine esecutivo firmato il 2 giugno 2026 ha incaricato le agenzie federali di istituire un processo di revisione volontario in base al quale gli sviluppatori di frontiera sottopongono i modelli alla revisione governativa fino a 30 giorni prima della pubblicazione. Il quadro era previsto per entrare formalmente in vigore il 1° agosto — lo stesso giorno in cui è stato pubblicato il post di Astra. Secondo le notizie, Astra dovrebbe essere il primo modello a passare attraverso questo processo.

"Voluntary" sta facendo un certo lavoro in quella frase. In pratica l'amministrazione ha già esercitato pressioni sui tempi di rilascio in precedenza, e il recente comportamento della stessa OpenAI sembra una prova generale: GPT-5.6 è stato limitato a circa venti organizzazioni selezionate dal 26 giugno prima che l'accesso generalizzato arrivasse il 9 luglio — un rilascio graduale di circa due settimane.

Metti insieme questi due fatti e ottieni un minimo indicativo piuttosto che una previsione. Se Astra supera una revisione pre-release di 30 giorni e poi ripete lo schema di GPT-5.6, {{1}la disponibilità generale arriva circa sei settimane dopo la presentazione{{/1}}. E la data di presentazione è esattamente ciò che non sappiamo. {{2}Ecco perché le sicure date di agosto vanno scontate{{/2}}: la fase di gating è un processo con una durata dichiarata, e l'orologio non è visibilmente partito.

I mercati predittivi si sono mossi esattamente in quella direzione. Alla data del 5 agosto 2026, la scala "GPT-6 released by" di Polymarket si attestava all'1% per il 7 agosto, al 3% per il 14 agosto, al 13% per il 21 agosto, al 25% per il 31 agosto, al 68% per il 30 settembre e all'89% per il 31 dicembre, con un volume di quasi un milione di dollari. Trattalo come una stima aggregata della folla, non come una fonte — ma nota che la folla ha spostato il proprio peso sul Q4.

Aiuta anche ricordare i precedenti. Ogni affermazione "GPT-6 esce la prossima settimana" degli ultimi dodici mesi è stata sbagliata. Una fuga di notizie non verificata aveva indicato il 14 aprile 2026 come giorno del lancio; ciò che è uscito effettivamente, nove giorni dopo, è stato GPT-5.5.

Le voci, classificate

Ordinati in base a quanto peso ciascuno porta effettivamente:

Nome non deciso (GPT-6 / GPT-5.7 / una classe separata). Fonte: The Information. L'affermazione non-OpenAI più affidabile in questa storia, e quella che dovrebbe ridimensionare le aspettative — un sistema annunciato tramite un articolo di matematica potrebbe benissimo non essere affatto presentato come un salto generazionale.

I nomi in codice "Zinc" e "Magnesium" avvistati in Design Arena. Avvistamento dalla community, voci secondo cui le iscrizioni sarebbero disabilitate, non confermato da OpenAI. Da leggere come: un rilascio minore di GPT-5.x potrebbe benissimo arrivare prima di Astra, il che non soddisferebbe le aspettative di nessuno riguardo a GPT-6, assorbendo al contempo il ciclo delle notizie.

Circa 2× la scala di GPT-5.6 Sol; prezzo vicino alla fascia GPT-5.6. Voce circolante. Il leaker che l'ha diffusa ha ammesso di non aver testato il modello. Suona plausibile ma è del tutto infondato.

Una finestra di contesto da 1,5 milioni di token.Appare nei riepiloghi di fughe di notizie senza una fonte nominata. Vale la pena notare che Sol offre già 1.050.000 token, quindi questo sarebbe un incremento, non un balzo — il che è un motivo per sospettare che sia un 'leak' da prima pagina.

Circa 10 trilioni di parametri. Nessuna attribuzione che siamo riusciti a rintracciare. Il numero più ripetuto e meno supportato dell'intera storia.

Memoria e personalizzazione come direzione caratterizzante. Basata sulle dichiarazioni pubbliche di Altman da un'intervista dell'agosto 2025 — reali, ma vecchie di un anno e relative alla direzione post-GPT-5 in generale, non ad Astra specificamente.

Cosa fare concretamente da ora fino a quando verrà spedito.

La mossa sbagliata è riprogettare l'architettura per un modello che non ha una scheda. La mossa giusta è capire quali dei tuoi problemi un sistema multi-agente a lungo orizzonte cambierebbe, perché quelle sono le parti del tuo stack che oggi sono sottodimensionate, indipendentemente da ciò che OpenAI rilascia.

Vale la pena costruirne tre contro GPT-5.6 Sol proprio adesso:

Massimali di costo per attività, non per chiamata. Se un singolo lavoro può durare ore e consumare sei o sette milioni di token di output, i limiti per richiesta non ti proteggono più. Ti serve un budget che l'intera attività erediti e un arresto netto.

Checkpointing e ripresa. Una chiamata one-shot o restituisce un risultato o fallisce. Un'esecuzione di un agente che dura ore e muore al minuto 90 senza che nulla di persistente sia stato scritto è una categoria di errore costoso che la maggior parte dei codebase non ha mai dovuto gestire.

Valutazione di cui ti fidi su problemi senza risposta di riferimento. Le dieci dimostrazioni sono interessanti in parte perché Lean fornisce un oracolo. Quasi nulla in produzione lo fa. Se non sai distinguere una buona esecuzione di sei ore da una dall'aspetto plausibile ma cattiva, più potenza di calcolo non ti aiuterà.

Sulla questione del cambio: Astra non è disponibile su OrcaRouter, perché non è disponibile da nessuna parte. Quello che possiamo dire è che il problema del ricambio delle versioni è in gran parte risolto dalla nostra parte. Una chiave raggiunge 200+ modelli, quindi che questo venga distribuito come GPT-6, GPT-5.7 o come un quarto livello di GPT-5.6, adottarlo è un cambio di stringa del modello piuttosto che una migrazione — nessun secondo contratto, nessun nuovo SDK. E per un modello di frontiera non comprovato in particolare, il failover automatico è la differenza tra valutarlo in un carico di lavoro reale e scommettere un percorso di produzione su un sistema che nessuno al di fuori del laboratorio ha sottoposto a stress test. Instradi una parte del traffico verso di esso, tieni Sol sotto come fallback, e scopri.

Domande a cui vale la pena rispondere

Astra è la stessa cosa di GPT-6?

Non necessariamente, e questa è l'incognita più rilevante in questa storia. OpenAI ha confermato Astra come suo prossimo modello principale, ma non ha ancora deciso il nome di rilascio; i resoconti mettono sul tavolo GPT-6, GPT-5.7 e una classe separata insieme a Sol, Terra e Luna. È del tutto possibile che un modello chiamato GPT-6 non compaia mai, e che il salto di capacità che le persone aspettano arrivi sotto un nome che nessuno stava monitorando.

Posso accedere ad Astra in qualsiasi forma oggi?

No — non in ChatGPT, non tramite API, non attraverso alcun router o rivenditore. Ciò che esiste pubblicamente è l'articolo, le spiegazioni dettagliate del ragionamento e il repository Lean. Se un servizio afferma di offrire accesso ad Astra, o sta rivendendo qualcos'altro o sta mentendo. L'unica cosa davvero utile che puoi fare con la versione attuale è compilare tu stesso le dimostrazioni.

Astra ha davvero risolto problemi che i matematici umani non potevano risolvere?

Ha prodotto dimostrazioni formalmente verificate di affermazioni rimaste aperte per almeno un decennio, il che è un risultato reale e insolito — e la verifica è di un livello superiore alla norma del settore. Ma "verificato con Lean" non equivale a "sottoposto a revisione paritaria", e la questione di inquadramento se ogni enunciato formale colga il problema principale è esattamente la parte a cui Lean non può rispondere. Gli specialisti che hanno letto i manoscritti si sono espressi positivamente; nessuno di essi ha superato una revisione referata. La valutazione dovrebbe consolidarsi nel corso dei mesi, in entrambe le direzioni.

La cifra di 2.000 dollari significa che la ricerca di frontiera è ora economica?

Significa che le esecuzioni di token vincenti sono state economiche, ai prezzi di un altro modello, escludendo i fallimenti ed escludendo gli esseri umani. Ciascuna di queste tre esclusioni potrebbe essere ampia. La lettura onesta è che il costo marginale di una ricerca automatica di dimostrazioni di successo è sceso abbastanza da essere interessante, non che dieci problemi aperti ora costino quanto un laptop.

Cosa risolverebbe davvero questa questione?

Tre cose specifiche, nessuna delle quali è una voce, e tutte verificabili quando accadono.

Una scheda del modello e una pagina dei prezzi. È il momento in cui Astra smette di essere un artefatto di ricerca e diventa qualcosa su cui puoi pianificare — e il momento in cui la questione del nome si risolve da sola.

Una ricostruzione indipendente del repository Lean da parte di specialisti che verificano le definizioni e le riduzioni informali, non solo il controllo dei tipi. La directory ComparatorChallenges suggerisce che OpenAI se lo aspetti. Se le affermazioni formali reggono a quell'esame, i risultati diventano molto più difficili da smentire; se emerge una discrepanza anche in uno solo dei dieci, ogni affermazione dell'insieme viene riletta.

Prove che il cronometro della revisione federale è partito. In una finestra di pre-rilascio di 30 giorni, quella presentazione è il primo segnale affidabile di una data di uscita — considerevolmente più informativo del prossimo screenshot di una voce disabilitata in una classifica dell'arena.

Fino ad allora, l'affermazione accurata è ristretta e vale la pena tenerla a mente: la prossima ammiraglia di OpenAI ha un nome, dieci prove verificabili meccanicamente, una demo a Washington, e nient'altro. Chiunque ti offra una data sta tirando a indovinare, e chiunque ti fornisca un numero di parametri se lo sta inventando.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube