
GPT-6 Luna vs GPT-6 Astra: un prezzo cento volte più alto per sedici punti indice
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 218 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il fornitore ha rilasciato entrambi questi modelli nello stesso mese. GPT-6 Astraè uscito il 3 settembre 2026 a 10,00 $ per milione di token di input e 50,00 $ per milione di output, posizionato come il sistema più capace dell'azienda per il lavoro professionale a lungo termine. GPT-6 Lunaè seguito il 22 settembre 2026 a 0,10 $ e 0,50 $ — un centesimo del prezzo di input, un centesimo del prezzo di output — come livello di efficienza della famiglia. Sedici punti indice li separano sulla classifica indipendente che misura entrambi. Sedici punti per un prezzo cento volte superiore: l'intero confronto racchiuso in una riga, e non è la parte interessante.
La parte interessante è che il fattore cento volte si riduce a qualcosa più vicino a quarantasei volte quando si tiene conto di come ciascun modello si comporta realmente su un compito, e che il divario rimanente non è affatto intelligenza generale. È uso del computer, autonomia su orizzonti lunghi e una classificazione di sicurezza che decide se alla tua organizzazione è persino consentito chiamare il modello. Quest'ultimo elemento è quello che nessuna tabella di benchmark coglie, e per molte squadre risolve la questione prima ancora che si parli di prezzo.
Due livelli di un'unica famiglia, a diciannove giorni di distanza
Astra è il modello di punta di OpenAI e il modello che l'azienda descrive come il più intelligente e allineato al mondo. Accetta input di testo, immagini e file, è dotato di una finestra di contesto di 1.050.000 token con un limite di output di 128.000 token e dispone di un ragionamento sempre attivo con sforzo configurabile da basso a massimo. È il primo modello OpenAI a superare la soglia di capacità di cybersecurity Critical nell'ambito del Preparedness Framework dell'azienda, e il rilascio è conseguito a tale classificazione anziché alla capacità: prima le organizzazioni limitate, accesso enterprise disattivato per impostazione predefinita e amministrabile dal 9 settembre, con i livelli di salvaguardia che si ampliano in seguito.
Luna è l'altro estremo della stessa famiglia. Testo e immagini in input, testo in output, la stessa finestra di contesto da 1.050.000 token e lo stesso limite di output da 128.000 token, e una scala di ragionamento che va da none a low, medium, high, xhigh e max, con medium come impostazione predefinita. Nessun gating, nessun interruttore enterprise, nessun livello di sicurezza a cui qualificarsi. È generalmente disponibile per chiunque possieda una chiave API, e la descrizione di OpenAI stessa è ristretta e onesta: il modello più efficiente per attività mirate e ad alto volume.
I due modelli condividono una finestra di contesto, un limite di output, una famiglia di cutoff della conoscenza e una clausola di prezzo per il contesto lungo. Non condividono quasi nient'altro, e il motivo è che sono stati costruiti per due metà diverse dello stesso lavoro.
Il tariffario dice cento volte. Il costo del task dice quarantasei.
Una riga per dimensione, entrambi i lati su ciascuna:
• Input per 1M — GPT-6 Luna $0,10 vs GPT-6 Astra $10,00
• Output per 1M — GPT-6 Luna $0.50 vs GPT-6 Astra $50.00
• Input in cache — GPT-6 Luna 0,01 $ per 1M vs GPT-6 Astra 1,00 $ per 1M, entrambi con uno sconto del 90% sulla rispettiva tariffa non in cache
• Costo per attività di indicizzazione — GPT-6 Luna circa $0,07 vs GPT-6 Astra circa $3,26
• Costo per eseguire l'indice completo — GPT-6 Luna 122,39 $ vs GPT-6 Astra 5.324,10 $
• AA Intelligence Index — GPT-6 Luna 37 con sforzo massimo vs GPT-6 Astra 53 con sforzo massimo
• Token di output nell'esecuzione dell'indice — GPT-6 Luna 150M vs GPT-6 Astra 60M, rispetto a una mediana della classifica di 88M
• Velocità di output — GPT-6 Luna 153,9 token/sec vs GPT-6 Astra 51,4 token/sec con xhigh
• Tempo al primo token — GPT-6 Luna abbastanza veloce da stare dietro a una superficie interattiva, rispetto a GPT-6 Astra con 208,73 s a xhigh
• Interruttore per disattivare il ragionamento — GPT-6 Luna da none a max, con none come opzione, contro GPT-6 Astra sempre attivo, senza modalità non di ragionamento
• Uso del computer e autonomia — chiamata di strumenti e cicli agentici di GPT-6 Luna vs GPT-6 Astra, progettato per operare un computer end-to-end
• Accesso — GPT-6 Luna disponibile per chiunque vs GPT-6 Astra ad accesso limitato, enterprise disattivato per impostazione predefinita, controlli amministrativi richiesti
• Su OrcaRouter — GPT-6 Luna non presente nel nostro catalogo vs GPT-6 Astra instradabile al prezzo di listino di OpenAI

Confronta la riga del costo per attività con il rapporto del tariffario e il divario si riduce di oltre la metà. Luna consuma 150 milioni di token di output per completare l'indice; Astra ne consuma 60 milioni. Astra è due volte e mezzo più concisa, e su un modello prezzato sull'output ciò vale moltissimo: è il motivo per cui una differenza di tariffario di cento volte diventa una differenza di costo per attività di quarantasei volte, e il motivo per cui qualsiasi confronto basato solo sui prezzi di listino sovrastimerà di un fattore due l'argomento a favore della fascia economica.
Le righe relative alla velocità vanno nel senso opposto e non sono affatto vicine. Luna genera tre volte tanti token al secondo quanti Astra e restituisce il suo primo token in un tempo che consente a un utente di restare in attesa. Il tempo di 208,73 secondi di Astra per il primo token a xhigh non è un dato di latenza; è una dichiarazione su a cosa serve il modello. Nulla che una persona stia guardando può funzionare su Astra con quell'impostazione.
Che cosa comprano davvero sedici punti
Il divario dell'indice è reale, e la domanda utile è che cosa c'è dentro, perché la risposta non è «sedici per cento in più di intelligenza».
Le capacità pubblicate di Astra si concentrano in un punto specifico. OpenAI riporta il 72,6% su OSWorld 2.0 e il 69% su AutomationBench-AA — entrambe misure di un modello che utilizza il software come farebbe una persona, attraverso molti passaggi, in un lungo arco di tempo. Sul fronte della conoscenza i valori sono 96,1 su GPQA Diamond, 97,6% su FrontierMath Tier 4 e 57,2% su Humanity's Last Exam con strumenti, e il recupero a contesto lungo è un punto di forza evidenziato: 100% sul benchmark a otto aghi di OpenAI tra 256K e 512K token, 96,3% tra 512K e 1M. Questi dati sono dichiarati dal fornitore e non riprodotti, e l'harness conta — lo stesso modello ottiene il 99,9% su ARC-AGI-3 con l'adattatore provider personalizzato di OpenAI contro il 62,7% sull'harness standard, uno scarto che dice tanto sull'harness quanto sul modello.
Letti insieme, non è un vantaggio di uso generale. È un vantaggio concentrato in attività che richiedono molto tempo, l'uso di un computer e hanno un punto finale verificabile. L'inquadramento competitivo di Astra non è contro un altro chatbot; è contro una sessione di lavoro, e i modelli con cui viene misurata sulla classifica indipendente sono gli altri flagship dello stesso livello — eguaglia Claude Fable 5.1 a 53 sull'Intelligence Index a circa il 40% del costo per attività.
Il deficit di sedici punti di Luna, quindi, non è distribuito in modo uniforme. Su un compito breve, ben specificato, consumato da un programma, i due modelli produrranno spesso la stessa risposta utilizzabile e la differenza sarà invisibile. Su un compito che richiede quaranta azioni sequenziali in un browser con un checkpoint alla fine, il deficit è la differenza tra completare e non completare — e quello è il compito per cui Astra è stata costruita e Luna no.
Il gate che nessuno prezza
Astra è il primo modello OpenAI a superare la soglia critica di cybersecurity nell'ambito del Preparedness Framework dell'azienda, e la conseguenza pratica è che viene rilasciato disattivato per gli account aziendali. Un amministratore deve abilitarlo, secondo un listino prezzi e un accordo applicabili, prima che gli utenti possano vederlo. L'accesso è stato aperto a un insieme limitato di organizzazioni il 3 settembre e da lì ampliato; il sistema di amministrazione è arrivato il 9 settembre.
Luna non ha nulla di tutto ciò. È disponibile per chiunque possieda una chiave API fin dal primo giorno, senza alcuna fase di qualificazione, senza alcun interruttore amministrativo e senza alcun livello di salvaguardia che si frapponga tra uno sviluppatore e una prima chiamata.
Per un team in un settore regolamentato, un appaltatore della difesa o qualsiasi realtà in cui sia prevista una revisione di sicurezza nel percorso di approvvigionamento, questa è la decisione nella sua interezza. La differenza di prezzo di cento volte è una voce di spesa; un gate di accesso è un progetto. E per un team al di fuori di tali vincoli, il gate è irrilevante e Astra è semplicemente un modello costoso con un tempo al primo token insolitamente lungo.
Vale la pena aggiungere che l'accesso controllato è una scelta ponderata, non un inconveniente. Un modello che gestisce autonomamente un computer e individua bene le vulnerabilità è un modello che un laboratorio dovrebbe essere cauto nel distribuire, e le modalità di distribuzione seguono quanto emerso in termini di capacità. Questo non lo rende più facile da ottenere, ma significa che è improbabile che il vincolo venga allentato da un ticket di supporto.
Stessa scogliera, stessa famiglia, due volte
Entrambi i modelli presentano la stessa clausola sul contesto lungo, che è la cosa più costosa da farsi sfuggire su entrambe le tariffe. Le richieste che superano i 272.000 token di input vengono fatturate al doppio delle tariffe di input e di cache e a 1,5 volte la tariffa di output — per l'intera richiesta, non solo per la porzione che supera la soglia. Su Astra, questo trasforma una chiamata da $10.00/$50.00 in $20.00/$75.00. Su Luna, trasforma $0.10/$0.50 in $0.20/$0.75.
Poiché la clausola è proporzionale, non modifica il rapporto tra i due modelli: li raddoppia entrambi. Ciò che cambia è la dimensione assoluta dell'errore, e l'errore è più probabile su Astra, perché i carichi di lavoro per cui Astra esiste sono quelli che comportano un contesto di lavoro da un milione di token. Una singola chiamata Astra a contesto lungo costa 75 $ per milione di token di output; suddividere lo stesso lavoro in due chiamate sotto i 272K la dimezza senza alcuna modifica al prompt. Su un modello la cui intera proposta di valore è il lavoro a lungo orizzonte, vale la pena fare quel calcolo prima della prima chiamata in produzione, non dopo.
La decisione è una decisione di routing
Ciò che rende questa coppia insolita tra i confronti presenti su questo blog è che entrambi i modelli appartengono allo stesso fornitore, girano sullo stesso account e sono raggiungibili tramite lo stesso endpoint. Non c'è un secondo contratto da firmare né un secondo SDK da imparare. La scelta tra i due non è affatto una decisione di acquisto — è una decisione di instradamento, e la maggior parte dei team dovrebbe prenderla per ogni singola richiesta anziché una volta sola.
La forma della suddivisione è abbastanza chiara. Luna per le mille piccole chiamate che un agente effettua lungo il percorso verso un compito: classificazione, estrazione, selezione degli strumenti, sintesi di un risultato intermedio. Astra per il compito stesso, una volta sola, alla fine, dove la risposta è il prodotto. Questa è una pipeline a due livelli all'interno di un'unica applicazione, e la differenza di costo tra eseguire l'intero processo su Astra e eseguire il ciclo interno su Luna è la differenza tra un'economia unitaria sostenibile e una insostenibile.
GPT-6 Astra è su OrcaRouter al prezzo di listino di OpenAI: con il prezzo pass-through, questo significa che una variazione delle tariffe OpenAI è attiva dalla nostra parte lo stesso giorno. GPT-6 Luna, al momento in cui scriviamo, non è nel nostro catalogo e vi si accede tramite l'API di OpenAI stessa, quindi un team che li vuole entrambi usa una chiave per GPT-6 Astra insieme a qualunque cosa già utilizzi per OpenAI. Questo è anche l'abbinamento in cui la fusione dei modelli si ripaga da sola: un panel formato da un modello economico ad alto throughput e da uno costoso e meticoloso che rispondono insieme, con il membro economico che svolge la maggior parte del lavoro e quello costoso che arbitra, è una configurazione che il livello di routing può esprimere senza che l'applicazione sappia che nessuno dei due modelli esista.

Quale, e quando
Scegli GPT-6 Luna a meno che tu non abbia una ragione specifica per non farlo. Costa un centesimo del prezzo sul listino e un quarantaseiesimo del prezzo per attività completata, è tre volte più veloce, il suo primo token arriva in un tempo che un utente può aspettare, e gli si può dire di smettere del tutto di ragionare — ed è questo che lo rende utilizzabile come classificatore. Imposta esplicitamente il parametro effort, perché il valore predefinito è medium e il 37 in evidenza è un valore di sforzo massimo. Mantieni le chiamate lunghe sotto i 272.000 token di input. Verifica la regressione di due punti del Coding Agent Index confrontandola con la tua eval, non con un grafico del fornitore.
Prendi GPT-6 Astra quando il compito è quello lungo e la risposta è il prodotto. Uso del computer attraverso molti passaggi, analisi professionale con un endpoint verificabile, qualsiasi cosa in cui sedici punti indice siano la differenza tra il finire e il fermarsi in silenzio. Accetta il tempo al primo token — 208 secondi a xhigh non è un valore che puoi mettere dietro a un essere umano — e accetta il gate di approvvigionamento se la tua organizzazione ne ha uno. Poi esegui tutto ciò che porta a quel compito sul tier economico, perché il ciclo interno è dove vanno i soldi.
L'errore che questo confronto invita a commettere è trattarlo come una scelta tra due modelli. È una scelta su dove si colloca ciascuno all'interno di una pipeline, e la risposta è quasi sempre entrambi.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
