Una card del titolo hero generata che recita 'GPT-6 Luna vs GPT-6 Astra', con il sottotitolo 'Cento volte il prezzo sul listino. Quarantasei volte per attività completata.', con chip che mostrano Luna a $0,10/$0,50 per 1M con indice 37, Astra a $10,00/$50,00 per 1M con indice 53, e un costo per attività indice di $0,07 contro $3,26, con il logo OrcaRouter in basso a destra.
Guides & Insights

GPT-6 Luna vs GPT-6 Astra: un prezzo cento volte più alto per sedici punti indice

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il fornitore ha rilasciato entrambi questi modelli nello stesso mese. GPT-6 Astraè uscito il 3 settembre 2026 a 10,00 $ per milione di token di input e 50,00 $ per milione di output, posizionato come il sistema più capace dell'azienda per il lavoro professionale a lungo termine. GPT-6 Lunaè seguito il 22 settembre 2026 a 0,10 $ e 0,50 $ — un centesimo del prezzo di input, un centesimo del prezzo di output — come livello di efficienza della famiglia. Sedici punti indice li separano sulla classifica indipendente che misura entrambi. Sedici punti per un prezzo cento volte superiore: l'intero confronto racchiuso in una riga, e non è la parte interessante.

La parte interessante è che il fattore cento volte si riduce a qualcosa più vicino a quarantasei volte quando si tiene conto di come ciascun modello si comporta realmente su un compito, e che il divario rimanente non è affatto intelligenza generale. È uso del computer, autonomia su orizzonti lunghi e una classificazione di sicurezza che decide se alla tua organizzazione è persino consentito chiamare il modello. Quest'ultimo elemento è quello che nessuna tabella di benchmark coglie, e per molte squadre risolve la questione prima ancora che si parli di prezzo.

Due livelli di un'unica famiglia, a diciannove giorni di distanza

Astra è il modello di punta di OpenAI e il modello che l'azienda descrive come il più intelligente e allineato al mondo. Accetta input di testo, immagini e file, è dotato di una finestra di contesto di 1.050.000 token con un limite di output di 128.000 token e dispone di un ragionamento sempre attivo con sforzo configurabile da basso a massimo. È il primo modello OpenAI a superare la soglia di capacità di cybersecurity Critical nell'ambito del Preparedness Framework dell'azienda, e il rilascio è conseguito a tale classificazione anziché alla capacità: prima le organizzazioni limitate, accesso enterprise disattivato per impostazione predefinita e amministrabile dal 9 settembre, con i livelli di salvaguardia che si ampliano in seguito.

Luna è l'altro estremo della stessa famiglia. Testo e immagini in input, testo in output, la stessa finestra di contesto da 1.050.000 token e lo stesso limite di output da 128.000 token, e una scala di ragionamento che va da none a low, medium, high, xhigh e max, con medium come impostazione predefinita. Nessun gating, nessun interruttore enterprise, nessun livello di sicurezza a cui qualificarsi. È generalmente disponibile per chiunque possieda una chiave API, e la descrizione di OpenAI stessa è ristretta e onesta: il modello più efficiente per attività mirate e ad alto volume.

I due modelli condividono una finestra di contesto, un limite di output, una famiglia di cutoff della conoscenza e una clausola di prezzo per il contesto lungo. Non condividono quasi nient'altro, e il motivo è che sono stati costruiti per due metà diverse dello stesso lavoro.

Il tariffario dice cento volte. Il costo del task dice quarantasei.

Una riga per dimensione, entrambi i lati su ciascuna:

• Input per 1M — GPT-6 Luna $0,10 vs GPT-6 Astra $10,00

• Output per 1M — GPT-6 Luna $0.50 vs GPT-6 Astra $50.00

• Input in cache — GPT-6 Luna 0,01 $ per 1M vs GPT-6 Astra 1,00 $ per 1M, entrambi con uno sconto del 90% sulla rispettiva tariffa non in cache

• Costo per attività di indicizzazione — GPT-6 Luna circa $0,07 vs GPT-6 Astra circa $3,26

• Costo per eseguire l'indice completo — GPT-6 Luna 122,39 $ vs GPT-6 Astra 5.324,10 $

• AA Intelligence Index — GPT-6 Luna 37 con sforzo massimo vs GPT-6 Astra 53 con sforzo massimo

• Token di output nell'esecuzione dell'indice — GPT-6 Luna 150M vs GPT-6 Astra 60M, rispetto a una mediana della classifica di 88M

• Velocità di output — GPT-6 Luna 153,9 token/sec vs GPT-6 Astra 51,4 token/sec con xhigh

• Tempo al primo token — GPT-6 Luna abbastanza veloce da stare dietro a una superficie interattiva, rispetto a GPT-6 Astra con 208,73 s a xhigh

• Interruttore per disattivare il ragionamento — GPT-6 Luna da none a max, con none come opzione, contro GPT-6 Astra sempre attivo, senza modalità non di ragionamento

• Uso del computer e autonomia — chiamata di strumenti e cicli agentici di GPT-6 Luna vs GPT-6 Astra, progettato per operare un computer end-to-end

• Accesso — GPT-6 Luna disponibile per chiunque vs GPT-6 Astra ad accesso limitato, enterprise disattivato per impostazione predefinita, controlli amministrativi richiesti

• Su OrcaRouter — GPT-6 Luna non presente nel nostro catalogo vs GPT-6 Astra instradabile al prezzo di listino di OpenAI

A generated single-panel scoreboard card headed 'A hundred times on the rate card' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GPT-6 Astra $10.00 in / $50.00 out per 1M with index 53 at max effort; cost per completed index task about $0.07 against about $3.26; output tokens on the index run Luna 150M against Astra's 60M and a board median of 88M; output speed Luna 153.9 tokens per second against Astra's 51.4 at xhigh; and access, Luna open to anyone with an API key against Astra gated with enterprise off by default. Footer: 'Index, cost per task and speed per Artificial Analysis; prices per OpenAI.'

Confronta la riga del costo per attività con il rapporto del tariffario e il divario si riduce di oltre la metà. Luna consuma 150 milioni di token di output per completare l'indice; Astra ne consuma 60 milioni. Astra è due volte e mezzo più concisa, e su un modello prezzato sull'output ciò vale moltissimo: è il motivo per cui una differenza di tariffario di cento volte diventa una differenza di costo per attività di quarantasei volte, e il motivo per cui qualsiasi confronto basato solo sui prezzi di listino sovrastimerà di un fattore due l'argomento a favore della fascia economica.

Le righe relative alla velocità vanno nel senso opposto e non sono affatto vicine. Luna genera tre volte tanti token al secondo quanti Astra e restituisce il suo primo token in un tempo che consente a un utente di restare in attesa. Il tempo di 208,73 secondi di Astra per il primo token a xhigh non è un dato di latenza; è una dichiarazione su a cosa serve il modello. Nulla che una persona stia guardando può funzionare su Astra con quell'impostazione.

Che cosa comprano davvero sedici punti

Il divario dell'indice è reale, e la domanda utile è che cosa c'è dentro, perché la risposta non è «sedici per cento in più di intelligenza».

Le capacità pubblicate di Astra si concentrano in un punto specifico. OpenAI riporta il 72,6% su OSWorld 2.0 e il 69% su AutomationBench-AA — entrambe misure di un modello che utilizza il software come farebbe una persona, attraverso molti passaggi, in un lungo arco di tempo. Sul fronte della conoscenza i valori sono 96,1 su GPQA Diamond, 97,6% su FrontierMath Tier 4 e 57,2% su Humanity's Last Exam con strumenti, e il recupero a contesto lungo è un punto di forza evidenziato: 100% sul benchmark a otto aghi di OpenAI tra 256K e 512K token, 96,3% tra 512K e 1M. Questi dati sono dichiarati dal fornitore e non riprodotti, e l'harness conta — lo stesso modello ottiene il 99,9% su ARC-AGI-3 con l'adattatore provider personalizzato di OpenAI contro il 62,7% sull'harness standard, uno scarto che dice tanto sull'harness quanto sul modello.

Letti insieme, non è un vantaggio di uso generale. È un vantaggio concentrato in attività che richiedono molto tempo, l'uso di un computer e hanno un punto finale verificabile. L'inquadramento competitivo di Astra non è contro un altro chatbot; è contro una sessione di lavoro, e i modelli con cui viene misurata sulla classifica indipendente sono gli altri flagship dello stesso livello — eguaglia Claude Fable 5.1 a 53 sull'Intelligence Index a circa il 40% del costo per attività.

Il deficit di sedici punti di Luna, quindi, non è distribuito in modo uniforme. Su un compito breve, ben specificato, consumato da un programma, i due modelli produrranno spesso la stessa risposta utilizzabile e la differenza sarà invisibile. Su un compito che richiede quaranta azioni sequenziali in un browser con un checkpoint alla fine, il deficit è la differenza tra completare e non completare — e quello è il compito per cui Astra è stata costruita e Luna no.

Il gate che nessuno prezza

Astra è il primo modello OpenAI a superare la soglia critica di cybersecurity nell'ambito del Preparedness Framework dell'azienda, e la conseguenza pratica è che viene rilasciato disattivato per gli account aziendali. Un amministratore deve abilitarlo, secondo un listino prezzi e un accordo applicabili, prima che gli utenti possano vederlo. L'accesso è stato aperto a un insieme limitato di organizzazioni il 3 settembre e da lì ampliato; il sistema di amministrazione è arrivato il 9 settembre.

Luna non ha nulla di tutto ciò. È disponibile per chiunque possieda una chiave API fin dal primo giorno, senza alcuna fase di qualificazione, senza alcun interruttore amministrativo e senza alcun livello di salvaguardia che si frapponga tra uno sviluppatore e una prima chiamata.

Per un team in un settore regolamentato, un appaltatore della difesa o qualsiasi realtà in cui sia prevista una revisione di sicurezza nel percorso di approvvigionamento, questa è la decisione nella sua interezza. La differenza di prezzo di cento volte è una voce di spesa; un gate di accesso è un progetto. E per un team al di fuori di tali vincoli, il gate è irrilevante e Astra è semplicemente un modello costoso con un tempo al primo token insolitamente lungo.

Vale la pena aggiungere che l'accesso controllato è una scelta ponderata, non un inconveniente. Un modello che gestisce autonomamente un computer e individua bene le vulnerabilità è un modello che un laboratorio dovrebbe essere cauto nel distribuire, e le modalità di distribuzione seguono quanto emerso in termini di capacità. Questo non lo rende più facile da ottenere, ma significa che è improbabile che il vincolo venga allentato da un ticket di supporto.

Stessa scogliera, stessa famiglia, due volte

Entrambi i modelli presentano la stessa clausola sul contesto lungo, che è la cosa più costosa da farsi sfuggire su entrambe le tariffe. Le richieste che superano i 272.000 token di input vengono fatturate al doppio delle tariffe di input e di cache e a 1,5 volte la tariffa di output — per l'intera richiesta, non solo per la porzione che supera la soglia. Su Astra, questo trasforma una chiamata da $10.00/$50.00 in $20.00/$75.00. Su Luna, trasforma $0.10/$0.50 in $0.20/$0.75.

Poiché la clausola è proporzionale, non modifica il rapporto tra i due modelli: li raddoppia entrambi. Ciò che cambia è la dimensione assoluta dell'errore, e l'errore è più probabile su Astra, perché i carichi di lavoro per cui Astra esiste sono quelli che comportano un contesto di lavoro da un milione di token. Una singola chiamata Astra a contesto lungo costa 75 $ per milione di token di output; suddividere lo stesso lavoro in due chiamate sotto i 272K la dimezza senza alcuna modifica al prompt. Su un modello la cui intera proposta di valore è il lavoro a lungo orizzonte, vale la pena fare quel calcolo prima della prima chiamata in produzione, non dopo.

La decisione è una decisione di routing

Ciò che rende questa coppia insolita tra i confronti presenti su questo blog è che entrambi i modelli appartengono allo stesso fornitore, girano sullo stesso account e sono raggiungibili tramite lo stesso endpoint. Non c'è un secondo contratto da firmare né un secondo SDK da imparare. La scelta tra i due non è affatto una decisione di acquisto — è una decisione di instradamento, e la maggior parte dei team dovrebbe prenderla per ogni singola richiesta anziché una volta sola.

La forma della suddivisione è abbastanza chiara. Luna per le mille piccole chiamate che un agente effettua lungo il percorso verso un compito: classificazione, estrazione, selezione degli strumenti, sintesi di un risultato intermedio. Astra per il compito stesso, una volta sola, alla fine, dove la risposta è il prodotto. Questa è una pipeline a due livelli all'interno di un'unica applicazione, e la differenza di costo tra eseguire l'intero processo su Astra e eseguire il ciclo interno su Luna è la differenza tra un'economia unitaria sostenibile e una insostenibile.

GPT-6 Astra è su OrcaRouter al prezzo di listino di OpenAI: con il prezzo pass-through, questo significa che una variazione delle tariffe OpenAI è attiva dalla nostra parte lo stesso giorno. GPT-6 Luna, al momento in cui scriviamo, non è nel nostro catalogo e vi si accede tramite l'API di OpenAI stessa, quindi un team che li vuole entrambi usa una chiave per GPT-6 Astra insieme a qualunque cosa già utilizzi per OpenAI. Questo è anche l'abbinamento in cui la fusione dei modelli si ripaga da sola: un panel formato da un modello economico ad alto throughput e da uno costoso e meticoloso che rispondono insieme, con il membro economico che svolge la maggior parte del lavoro e quello costoso che arbitra, è una configurazione che il livello di routing può esprimere senza che l'applicazione sappia che nessuno dei due modelli esista.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

Quale, e quando

Scegli GPT-6 Luna a meno che tu non abbia una ragione specifica per non farlo. Costa un centesimo del prezzo sul listino e un quarantaseiesimo del prezzo per attività completata, è tre volte più veloce, il suo primo token arriva in un tempo che un utente può aspettare, e gli si può dire di smettere del tutto di ragionare — ed è questo che lo rende utilizzabile come classificatore. Imposta esplicitamente il parametro effort, perché il valore predefinito è medium e il 37 in evidenza è un valore di sforzo massimo. Mantieni le chiamate lunghe sotto i 272.000 token di input. Verifica la regressione di due punti del Coding Agent Index confrontandola con la tua eval, non con un grafico del fornitore.

Prendi GPT-6 Astra quando il compito è quello lungo e la risposta è il prodotto. Uso del computer attraverso molti passaggi, analisi professionale con un endpoint verificabile, qualsiasi cosa in cui sedici punti indice siano la differenza tra il finire e il fermarsi in silenzio. Accetta il tempo al primo token — 208 secondi a xhigh non è un valore che puoi mettere dietro a un essere umano — e accetta il gate di approvvigionamento se la tua organizzazione ne ha uno. Poi esegui tutto ciò che porta a quel compito sul tier economico, perché il ciclo interno è dove vanno i soldi.

L'errore che questo confronto invita a commettere è trattarlo come una scelta tra due modelli. È una scelta su dove si colloca ciascuno all'interno di una pipeline, e la risposta è quasi sempre entrambi.

A screenshot of the OrcaRouter model page for GPT-6 Astra (openai/gpt-6-astra), showing the Vision, Tools, JSON and Reasoning badges, a 2026-09-04 catalogue date, 1M-token context with 128K maximum output and text, image and file input, list pricing of $10.00 input and $50.00 output per 1M tokens, a p50 time to first token of 7.81s, and the description of GPT-6 Astra as OpenAI's flagship model for long-horizon end-to-end work with always-on reasoning from low through max.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno