
GPT-6 Astra Ultrafast gira su Blackwell: NVIDIA rivela l'hardware dietro l'8x
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il 1° ottobre 2026, NVIDIA ha pubblicato un post di Dion Harris intitolato "Come le GPU NVIDIA aiutano ad accelerare GPT-6 Astra Ultrafast di Open AI", e la frase al centro di esso è la prima volta che una delle due aziende ha detto su cosa funziona il tier: "GPT-6 Astra Ultrafast, in esecuzione su GPU NVIDIA Blackwell, è ora disponibile nell'Open AI API e per gli utenti idonei di ChatGPT Work e Codex". Questa è la notizia, ed è più ristretta di quanto suggerisca il titolo. GPT-6 Astra, il modello, è stato rilasciato il 3 settembre 2026. Il tier di servizio Ultrafast su di esso è diventato ampiamente disponibile il 29 settembre 2026. L'affermazione sulla velocità — fino a 8 volte più veloce nella generazione di token rispetto alla modalità standard di Astra — aveva già due giorni quando NVIDIA l'ha ripetuta.
Il che solleva la domanda a cui il post sta davvero rispondendo: non «quanto è veloce» ma «di chi è il silicio».

Tre cose che il post ha davvero aggiunto
Togli la ripetizione e il post del 1° ottobre contribuisce con tre fatti.
• L'hardware — Blackwell. La documentazione Ultrafast di OpenAI, pubblicata il 30 settembre, descrive la velocità del livello, la sua configurazione e i suoi limiti di frequenza, e non nomina alcuna GPU. Quindi l'attribuzione del silicio ha un'unica fonte: il fornitore dell'hardware. Ciò non la rende falsa; la rende un'affermazione di un fornitore sulle proprie attrezzature, e merita di essere etichettata come tale.
• Due ingegneri citati per nome — Philippe Tillet, responsabile dell'inferenza di OpenAI, e Uday Ruddarraju, chief technology officer del compute di OpenAI, entrambi citati ufficialmente su ciò da cui è derivata l'accelerazione.
• Il pubblico — "utenti idonei di ChatGPT Work e Codex", una platea più ampia dell'inquadramento riservato alle sole API con cui il livello era stato lanciato. La documentazione stessa di OpenAI afferma ancora che Ultrafast per GPT-6 Astra è "disponibile a tutti gli utenti API con limiti di frequenza bassi", e quel caveat sui limiti bassi non è mai stato ritirato ufficialmente.
Le due citazioni, e perché sono la parte interessante
Il contributo di Tillet è un ciclo più che un benchmark. L'investimento di NVIDIA in strumenti e documentazione, afferma, "ci ha permesso di rendere i nostri modelli eccezionalmente bravi nella programmazione", e Astra può quindi "trasformare quella conoscenza in kernel ad alte prestazioni che rendono l'hardware NVIDIA allettante". Ruddarraju è più schietto sulla direzione del lavoro: "Abbiamo usato i nostri modelli interni per ottimizzare l'inferenza sulle GPU NVIDIA."
Letti insieme, si tratta di un'affermazione sul deployment più che sulla capacità: i modelli di frontiera di OpenAI sono ormai così bravi a scrivere kernel GPU che OpenAI li usa per ottimizzare il proprio stack di serving. È anche coerente con l'unica sezione del post di NVIDIA che non riguarda affatto la settimana di lancio — un titolo che recita «Migliorare continuamente le prestazioni», sostenendo che l'inferenza in produzione diventa via via più veloce perché OpenAI continua a indirizzare i propri modelli verso il software NVIDIA su cui viene eseguita.
Niente di tutto ciò è una misurazione. Sono due ingegneri che descrivono un processo, pubblicato dall'azienda che ha venduto le GPU. La lettura onesta è che il processo è plausibile, facile da credere e non falsificabile dall'esterno — il che vale anche per ogni numero di velocità in questa storia.
Blackwell qui, Cerebras là
La cosa più utile che questo post fa è mettere in luce una frattura che nessuno ha spiegato. Il 13 agosto 2026, OpenAI ha presentato in anteprima un livello veloce su un modello diverso — GPT-5.6 Sol che gira "fino a 14×" più velocemente — e ha indicato Cerebras come partner dietro di esso, descrivendo hardware wafer-scale che genera fino a 750 token di output al secondo. Sette settimane dopo, il livello veloce su Astra gira su Blackwell, e il numero è 8x.
Due livelli veloci, due risposte hardware, una delle quali un partner specializzato e l'altra il fornitore più grande della stessa azienda. Nessuno dei due fornitori ha pubblicato un confronto tra i due percorsi di serving, e nessun valutatore indipendente ha misurato né l'uno né l'altro. Nota anche cosa fa il post di NVIDIA con il secondo nome: "Rubin" appare una volta, all'interno della citazione di Tillet sui modelli che scrivono kernel per "GPU Blackwell e Rubin". È un'affermazione su ciò che i modelli di OpenAI possono programmare, non un'affermazione che qualcosa sia in serving su Rubin oggi.
Il numero che NVIDIA non ha stampato
C'è un dato in questa storia che nessuna delle due aziende ha messo accanto all'8x, ed è quello che decide se un team attiva il tier. La tariffa Ultrafast pubblicata da OpenAI elenca gpt-6-astra a 60,00 $ per milione di token di input, 6,00 $ di input in cache, 75,00 $ di scrittura cache e 300,00 $ di output. Lo stesso modello al tier standard costa 10,00 $ e 50,00 $, con l'input in cache a 1,00 $ e la scrittura cache a 12,50 $. Ogni colonna è esattamente sei volte la tariffa standard.
• Il moltiplicatore — 6,00x su input, output, input in cache e scrittura in cache. Non "fino a". Sei.
• Il tetto massimo — 8x, la cifra che entrambi i fornitori citano con l'aggiunta di "fino a" e senza condizioni dichiarate.
• Cosa significa — il moltiplicatore di prezzo si colloca al di sotto del miglior caso dichiarato dal livello stesso. Al tetto massimo lo scambio è favorevole; a qualsiasi valore inferiore a 6x sul tuo traffico, stai pagando più per unità di tempo risparmiato di quanto il marketing lasci intendere. Ecco perché l'unico test veramente significativo di questo livello è una misurazione sulle tue stesse richieste.
• La fascia del contesto lungo — oltre 272.000 token di input, le tariffe Ultrafast diventano 120,00 $ in input e 450,00 $ in output, sei volte le tariffe a scaglioni del livello standard stesso.
• I dettagli operativi — OpenAI documenta una scala di token al minuto per Ultrafast di 500.000 per i livelli di utilizzo da 1 a 3, 1.000.000 per il livello 4 e 5.000.000 per il livello 5; Ultrafast supporta solo la residenza dei dati negli Stati Uniti e l'elaborazione globale, senza alcun endpoint di elaborazione regionale nell'UE o in altre regioni non statunitensi; e la documentazione raccomanda WebSockets per Ultrafast "soprattutto per le applicazioni agentiche che effettuano molte chiamate agli strumenti in rapida successione", avvertendo che "senza una connessione persistente, l'overhead di rete può ridurre i vantaggi in termini di latenza".

È su quest'ultimo punto che bisogna agire. Un team che abilita il livello e lascia HTTP per richiesta al di sotto di esso ha pagato una tariffa sei volte superiore per restituire parte dell'accelerazione all'instaurazione della connessione: un modo documentato ed evitabile di sprecare il denaro.
Come appare questo da un singolo endpoint
GPT-6 Astra è disponibile su OrcaRouter come openai/gpt-6-astra: una finestra di contesto da 1.050.000 token, fino a 128.000 token di output, input di testo, immagini e file, e il prezzo di listino di OpenAI applicato direttamente, ovvero 10,00 $ per milione di token in input e 50,00 $ in output, che salgono a 20,00 $ e 75,00 $ oltre i 272.000 token di input. Il benchmark di punta nel suo catalogo è 96,1 su GPQA Diamond.
Il tier Ultrafast non è disponibile su OrcaRouter, e non può esserlo: è un attributo ad accesso controllato di un account OpenAI più che un id di modello, ed è per questo che openai/gpt-6-astra-ultrafast restituisce modello-non-trovato. Se attivi il tier, esso risiede nella tua integrazione diretta con OpenAI. Ciò che un endpoint con oltre 200 modelli con 0% di markup ti offre in questa situazione non è la corsia veloce — è il controllo. Poiché il prezzo di listino del provider viene passato così com'è invece di essere maggiorato, una variazione delle tariffe OpenAI arriva dalla nostra parte lo stesso giorno in cui arriva dalla loro, e poiché la corsia standard di Astra è già presente, l'esperimento che dirime questa decisione è una riga di configurazione: stesso prompt, tier standard e un modello più economico accanto, sulla stessa chiave. È la cosa più vicina a un benchmark di latenza che la maggior parte dei team eseguirà mai, e non costa nulla da configurare.

Cosa non è ancora stato misurato
Tre cose sono verificabili oggi. Il tier esiste, è sul rate card a esattamente sei volte la tariffa standard e, dal 1° ottobre, è pubblicamente attribuito alle GPU NVIDIA Blackwell.
Una cosa non c'è: il moltiplicatore sul tuo traffico. Nessun fornitore ha pubblicato una distribuzione della latenza per il tier a un livello di concorrenza dichiarato, e nessuna terza parte ha riprodotto l'8x. Non esiste nemmeno un benchmark che confronti Astra su Ultrafast con Astra a standard, e non dovrebbe essercene uno lusinghiero — è lo stesso checkpoint su un percorso più veloce, quindi impostazioni identiche dovrebbero produrre risposte identiche a velocità diverse. Se le tue due corsie divergono sugli stessi prompt, hai una segnalazione di bug, non una funzionalità.
Quindi il riassunto utile del 1° ottobre è più modesto di quanto lasci intendere l'annuncio. È lo stesso livello allo stesso prezzo con lo stesso tetto di velocità non verificato, ora con addosso un'etichetta hardware. Quell'etichetta conta: ti dice su quale linea di acceleratori OpenAI sta scalando questa cosa, e ti dice che la storia del livello veloce è passata da un partner specializzato al più grande fornitore di GPU del settore in meno di due mesi. Semplicemente non ti dice nulla sul tuo budget di latenza, e nessun post lo farà.
