Una scheda di titolo generata per il livello Ultrafast con il titolo 'GPT-6 Astra Ultrafast', il sottotitolo 'Sei volte la velocità, su ogni linea' e due badge che riportano 'a prezzo definito e disponibilità generale' e 'la corsia veloce non è un secondo modello'.
Guides & Insights

GPT-6 Astra Ultrafast a 6x: quanto ti costa davvero il listino prezzi pubblicato

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-6 Astra Ultrafast non è più in lista d'attesa dal 29 settembre 2026. Ora è un livello di servizio acquistabile con un prezzo pubblicato, e quel prezzo è esattamente sei volte lo standard su ogni singola voce. Il modello sottostante — GPT-6 Astra, il prodotto di punta dell'azienda, rilasciato il 3 settembre 2026 — è invariato; ciò che è cambiato al DevDay è che la corsia veloce su di esso è passata alla disponibilità generale, e la documentazione API dell'azienda ora afferma chiaramente che Ultrafast "è ampiamente disponibile per GPT-6 Astra, con accesso in anteprima per GPT-5.6 Sol". Per la prima volta puoi inserire questo livello in una voce di budget, e il numero da mettere lì è $60,00 per milione di token di input e $300,00 per milione di token di output, letto dalla pagina dei prezzi dell'azienda stessa il 30 settembre 2026.

Questo rende la domanda diversa da quella a cui ha risposto la copertura del lancio. Il fatto interessante di questa settimana non è che il tier esista — il preview è stato annunciato il 13 agosto 2026, e trattato fino allo sfinimento. Il fatto interessante è che un tier senza prezzo ora ne ha uno, e l'aritmetica che ne consegue è poco lusinghiera in modo specifico e quantificabile. Sei volte non è un sovrapprezzo che assorbi con un'alzata di spalle; è un sovrapprezzo che devi recuperare in meno turni, e se ci riesci dipende dal tuo carico di lavoro più che dal modello.

Le prese multiple su ogni linea, e questa è la prima cosa da capire

Leggendo la pagina dei prezzi di OpenAI il 30 settembre 2026, la colonna Ultrafast per GPT-6 Astra è un 6x uniforme rispetto alla colonna Standard, anziché un ricarico su alcune voci e non su altre. Questo è importante, perché significa che non puoi venirne fuori a colpi di ottimizzazione modificando la forma delle tue richieste.

• GPT-6 Astra, servizio Standard, richieste fino a 272.000 token di input — 10,00 $ input, 1,00 $ input in cache, 12,50 $ scrittura in cache, 50,00 $ output, per 1M di token.

• GPT-6 Astra Ultrafast, stessa soglia — $60.00 input, $6.00 input in cache, $75.00 scrittura in cache, $300.00 output, per 1M token. Esattamente 6x su tutte e quattro le voci.

• Oltre 272,000 token di input, l'intera richiesta viene riprezzata — Standard passa a $20.00 / $2.00 / $25.00 / $75.00, Ultrafast a $120.00 / $12.00 / $150.00 / $450.00. Sempre 6x. La regola per il contesto lungo che OpenAI documenta per GPT-6 Astra prevede tariffe 2x per input e cache con 1.5x sull'output sull'intera richiesta una volta superata la soglia, e si applica in modo identico a entrambi i livelli.

• Gli altri livelli sulla stessa scheda — Batch e Flex sono al 50% di Standard, mentre la modalità Fast è 2 volte Standard. Quindi la scala dei moltiplicatori per questo singolo modello va da 0,5x a 1x, 2x, 6x, senza alcun gradino intermedio tra gli ultimi due.

Non esiste un equivalente Ultrafast di Batch. Batch e Flex sono sconti che si ottengono accettando una pianificazione meno rigida sulla corsia standard; non esiste una versione lenta ed economica della corsia veloce. Se vuoi la velocità, paghi il 6x su ogni token che invii e ogni token che ricevi, e nessuna combinazione di input in cache e input nuovi migliora il rapporto.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Quanto costa davvero una chiamata

L'astrazione diventa più facile da comprendere con due richieste concrete. Entrambe utilizzano le tariffe per milione pubblicate da OpenAI; l'aritmetica è nostra.

Una chiamata single-shot con 20.000 token di input e una risposta da 2.000 token costa $0,30 su Standard — 20.000 token a $10 per milione fanno $0,20, più 2.000 a $50 per milione fanno $0,10. La stessa chiamata su Ultrafast costa $1,80. Esattamente sei volte tanto, come pubblicizzato.

Ora il caso che descrive davvero un loop di agente: una conversazione da 200.000 token in cui 190.000 token sono un prefisso in cache e solo 10.000 sono nuovi, producendo uno step da 1.000 token. Standard addebita $0,19 per la lettura dalla cache, $0,10 per l'input nuovo e $0,05 per l'output — $0,34 per step. Ultrafast addebita $1,14, $0,60 e $0,30 — $2,04 per step. Di nuovo 6x, ma guarda cosa ha fatto il mix: il caching è la leva di costo singola più efficace su questo modello ed è comunque esattamente 6 volte più economica sul canale standard, quindi un agente con molta cache non guadagna nulla in proporzione dal livello veloce e non attenua nemmeno il sovrapprezzo.

La conseguenza è la parte che vale la pena interiorizzare. Poiché il moltiplicatore è fisso, il punto di pareggio non ha nulla a che fare con il mix di token. Riguarda il numero di turni. Ultrafast si ripaga in un carico di lavoro solo quando eseguirlo riduce il numero di turni fatturati di circa un fattore sei — sia riducendo un ciclo di retry a un'unica passata, sia sostituendo una sequenza di brevi chiamate di chiarimento con una singola sessione interattiva più rapida. Se il tuo carico di lavoro genera lo stesso numero di turni di prima, solo più rapidamente, stai comprando latenza a esattamente 6x e nient'altro.

I limiti di frequenza e la geografia sono i tetti non pubblicizzati.

Due vincoli restano al di fuori del prezzo e sono facili da trascurare quando si legge un listino prezzi.

Il primo è il throughput. Ultrafast per GPT-6 Astra è disponibile per tutti gli utenti API, ma inizialmente con limiti di velocità bassi: OpenAI documenta 500.000 token al minuto per i livelli da 1 a 3, 1.000.000 per il livello 4 e 5.000.000 per il livello 5. Per un livello venduto sulla velocità, questo è un vero tetto: un contesto agente da 200.000 token a mezzo milione di token al minuto equivale a due richieste e mezza al minuto su un livello basso. Le stesse linee guida di OpenAI indicano lo stesso problema dall'altro lato, raccomandando fortemente i WebSockets proprio perché l'overhead di rete per richiesta può erodere la latenza che il livello sta pagando.

Il secondo è la residenza dei dati. Ultrafast supporta solo la residenza dei dati negli Stati Uniti e l'elaborazione globale. Non supporta endpoint di elaborazione regionali nell'UE o in altre regioni non statunitensi. Se il tuo deployment dipende da un endpoint di residenza nell'UE per GPT-6 Astra, questo livello non è disponibile per te a nessun prezzo, e questo è un limite invalicabile, non una scelta di configurazione. Nota inoltre che gli endpoint di residenza comportano un aumento del 10% per i modelli rilasciati il 5 marzo 2026 o successivamente, e GPT-6 Astra è tra questi.

Il titolo sulla velocità è sceso da 14x a 8x

Vale la pena affermarlo con attenzione, perché il numero che circola nella maggior parte dei resoconti è obsoleto. La pagina della documentazione di OpenAI su Ultrafast, come pubblicata oggi, riporta la frase "il nostro livello di servizio API più veloce, con velocità fino a 8 volte superiori rispetto alla modalità Standard". L'annuncio in anteprima del 13 agosto 2026 per GPT-5.6 Sol prometteva "fino a 14 volte più veloce dell'elaborazione Standard" e fino a 750 token di output al secondo su hardware Cerebras.

Non sono la stessa affermazione, e la differenza non è tanto una rettifica quanto un cambio di argomento. Il dato di 14x è stato misurato su GPT-5.6 Sol in un'anteprima limitata; il dato di 8x è quello che OpenAI pubblica per il livello allo stato attuale, con GPT-6 Astra come suo modello ampiamente disponibile. Chiunque pianifichi il budget basandosi su 14x per Astra sta pianificando su un numero che OpenAI non ha pubblicato per Astra. La lettura onesta è che entrambi i numeri sono tetti dichiarati dal fornitore sul throughput di output, che nessuno dei due è una garanzia di latenza per il tuo carico di lavoro, e che il tempo end-to-end include comunque l'elaborazione dell'input, le chiamate agli strumenti e la tua orchestrazione. Considera 8x come il valore di riferimento per la pianificazione e considera qualunque cosa di meglio come un bonus da verificare sul tuo traffico, non da dare per scontato.

Che fare con questo lunedì

La regola decisionale che emerge dall’aritmetica è più restrittiva di quanto lasci intendere il marketing, e vale la pena metterla per iscritto prima che qualcuno proponga di abilitare Ultrafast su tutto il parco.

Attivalo dove il carico di lavoro è vincolato dalla latenza einterattivo, e dove c'è una persona che aspetta. Il triage degli incidenti, un'escalation al supporto in tempo reale, un ciclo di ricerca in cui un analista itera all'interno di un'unica sessione: questi sono i casi in cui il valore di una risposta che arriva adesso invece che tra quattro minuti non è proporzionale ai token, e in cui una bolletta 6 volte più alta su un piccolo numero di turni è banalmente inferiore al costo della persona che aspetta. Gli esempi di OpenAI nell'annuncio di anteprima avevano esattamente questa forma: leggere i log mentre si verifica un'interruzione del servizio, trasformare un ciclo di ricerca notturno in una sessione di lavoro.

Lascialo disattivato dove il carico di lavoro è limitato dal throughput o ha una forma batch. Una reindicizzazione notturna, una classificazione in blocco, un report pianificato, un backfill: nessuno di questi si preoccupa della latenza in tempo reale, tutti sono dominati dal numero di token e tutti hanno un'opzione a 0,5x proprio lì sulla stessa scheda prezzi in Batch e Flex. Pagare 12 volte la tariffa batch per finire prima è il modo più evidente di sprecare denaro in questa tabella.

Il mezzo scomodo è il ciclo di coding agentico, ed è lì che l'aritmetica del conteggio dei turni decide la questione. Se la velocità elimina davvero i tentativi ripetuti — se il primo passaggio del modello su una modifica multi-file va a buon fine più spesso perché non sta combattendo contro un timeout — allora Ultrafast può costare meno per attività completata nonostante sia 6x per token. Questa è un'affermazione misurabile sulle vostre tracce, non una generale, e la misurazione è economica: contate i turni fatturati per attività completata su entrambi i livelli e moltiplicate per la tariffa. Se il rapporto non è vicino a sei, il livello veloce è un acquisto di latenza e dovrebbe essere giustificato come tale.

Il livello ha un prezzo; le rotte che lo circondano non sono la stessa domanda.

Una nota pratica su come inquadrare la questione. GPT-6 Astra in servizio standard è attivo su OrcaRouter come openai/gpt-6-astraalla tariffa del provider stesso — 10,00 $ di input e 50,00 $ di output per milione di token, con lo scatto di contesto lungo a 272K a 20,00 $ / 75,00 $ — erogato con markup dello 0%, il che significa che il prezzo di listino del provider viene trasferito tal quale e qualsiasi mossa del fornitore finisce nella tua fattura lo stesso giorno in cui compare nel listino di OpenAI, invece che al tuo prossimo rinnovo contrattuale. La stessa chiave dà accesso a più di 200 modelli, così il livello standard può stare dietro lo stesso client del livello economico o del modello di un concorrente senza una seconda integrazione.

Ciò che non facciamo è servire il tier Ultrafast. È un flag di service tier su un account OpenAI, non un modello instradabile separatamente: si imposta service_tier: "ultrafast" su una richiesta a gpt-6-astra — e viene fatturato da OpenAI direttamente sul tuo account alle tariffe sopra indicate. Se lo abiliti, risiede nella tua integrazione diretta con OpenAI, e OrcaRouter è il posto giusto per il traffico di tier standard che instradi insieme a esso. Dirlo chiaramente è più utile che lasciare intendere una capacità che non abbiamo.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

La regola decisionale, in un paragrafo

Il sestuplo è il prezzo di un livello, non il prezzo di un modello: i pesi, la finestra di contesto da 1.050.000 token, il tetto di output da 128.000 token e le risposte sono tutti identici a GPT-6 Astra standard. Quello che acquisti è un throughput di output fino a 8 volte superiore, secondo un listino che è 6 volte su ogni voce, soggetto a limiti di frequenza iniziali ridotti e a una restrizione di residenza negli Stati Uniti che esclude completamente l'UE. Questo trade-off è ovviamente corretto per una persona in attesa di una risposta, ovviamente sbagliato per un job batch pianificato che ha una corsia a metà prezzo disponibile, e davvero indeciso per i loop agentici in cui la risposta dipende dal fatto che la velocità elimini dei turni. Misura il numero di turni sulle tue tracce prima di impegnarti, e instrada il resto a prezzo di listino.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno