
GPT-5.6 Sol Ultrafast: Ultrafast è stato distribuito a un prezzo 6 volte quello standard, ma questo modello è ancora disponibile solo in anteprima
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 362 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
L'attesa è finita per il tier, ma non per questo modello. Al DevDay del 29 settembre 2026, il fornitore ha trasformato Ultrafast in qualcosa che si può acquistare: il nuovo piano ChatGPT Pro 500 a $500 al mese lo include, l'API ora pubblica un listino Ultrafast a sei volte la tariffa standard — $60,00 input / $300,00 output per milione di token su GPT-6 Astra — e la documentazione Codex del fornitore conferma che i tier Pro non hanno alcun limite di utilizzo di cinque ore, una finestra che si applica a Plus. Tutto questo è dichiarato dal fornitore, pubblicato sul riepilogo DevDay, sulle pagine di aiuto e sulla documentazione per sviluppatori del fornitore stesso. Ciò che non si è mosso è il modello di cui parla questa pagina. GPT-5.6 Sol Ultrafast, annunciato il 13 agosto 2026 come tier di servizio accelerato da Cerebras per GPT-5.6 Sol, con un throughput fino a 14 volte quello standard e 750 token di output al secondo, è ancora solo ad accesso in anteprima — organizzato tramite il team account del fornitore — e non ha ancora un prezzo proprio pubblicato. Il tier è stato rilasciato. La variante Sol è ancora in attesa.
Due variazioni di prezzo si sono verificate da quando abbiamo scritto per la prima volta questo pezzo, e vanno in direzioni opposte. Il modello è diventato più economico: il GPT-5.6 Sol standard ora viene fatturato a $4,00 per milione di token di input e $4,00 per milione di output — la tariffa promozionale di OpenAI, che il fornitore dice sarà disponibile almeno fino al 21 novembre 2026 — non i $5,00 / $30,00 in vigore ad agosto. Il livello di velocità superiore ha ricevuto un prezzo per la prima volta, e non è economico: Ultrafast su GPT-5.6 Astra viene fatturato a $60,00 / $300,00 per milione. Ogni cifra in questo articolo è stata ricontrollata rispetto al listino prezzi pubblicato di OpenAI, alla sua documentazione API e ai prezzi di Codex al 30 settembre 2026.
Cosa sia realmente la modalità Ultrafast
Ultrafast è un livello di servizio, non un nuovo modello. OpenAI l'ha annunciato il 13 agosto 2026 come primo prodotto della sua partnership per il calcolo del gennaio 2026 con il produttore di chip Cerebras — un accordo riportato a circa 10 miliardi di dollari nell'arco di tre anni. Mentre l'inferenza standard di GPT-5.6 Sol viene eseguita su cluster di GPU e passa gran parte del suo tempo a spostare i pesi tra memoria e calcolo, Ultrafast carica i pesi del modello in 44 GB di SRAM on-chip sui chip wafer-scale di Cerebras; un modello delle dimensioni di Sol si distribuisce su più wafer a strati, così i pesi risiedono là dove si trova il calcolo. Il risultato è un tetto di throughput determinato dal silicio anziché dalla larghezza di banda della memoria.
La storia dell'hardware è andata avanti il 18-08-2026. Al suo evento Supernova, Cerebras ha svelato il CS-4, il sistema rack-scale di nuova generazione costruito sulla sua piattaforma Nexus: tre chip Wafer-Scale Engine per rack, velocità di generazione dei token fino a 2 volte superiore rispetto al precedente CS-3 e, secondo Cerebras, più di 1.000 token al secondo su modelli con oltre 10 trilioni di parametri. Queste sono le affermazioni di Cerebras per un sistema in accesso anticipato, non ancora generalmente disponibile. Dall'annuncio, un singolo post su X sostiene che CS-4 serve già GPT-5.6 Sol a circa 1.300 token al secondo — una direzione coerente con i numeri di Cerebras, ma finora confermata da nessuno. Trattatelo come un segnale iniziale: plausibile, non verificato, e degno di essere ricontrollato prima di pianificare la capacità intorno ad esso.
La parte che conta per il tuo codice: l'id del modello, i pesi, il comportamento di ragionamento e l'output sono identici al GPT-5.6 Sol standard. OpenAI presenta Ultrafast come "più lavoro utile al secondo" piuttosto che come un livello di qualità, e l'anteprima esegue il flagship completo — la velocità non deriva dal passare a un modello più economico. Ciò che cambia è la velocità con cui escono i token.
Non confondere Ultrafast con la modalità Fast. La modalità Fast è un livello separato e acquistabile sull'hardware standard: fino a circa 2,5× la velocità di output a un sovrapprezzo di 2× per token, senza variazioni di qualità — è stata rinominata da Priority Processing il 30 luglio 2026, e su GPT-5.6 Sol costa $8,00 di input / $40,00 di output per 1M. Ultrafast è un'altra cosa — hardware Cerebras, fino a 14× su GPT-5.6 Sol e fino a 8× su GPT-6 Astra, costa 6× la tariffa standard su Astra ed è ancora senza prezzo su Sol. I due nomi ora si trovano uno accanto all'altro nello stesso selettore di modelli, che rimane la cosa più confusa in assoluto di questa release.
Quanto veloce — i numeri che contano

Il dato principale è 14× e necessita di una definizione. OpenAI afferma che Ultrafast genera fino a 750 token di output al secondo rispetto all'elaborazione standard di GPT-5.6 Sol. Si tratta di una misura di throughput per i token di output, non di un'affermazione generica secondo cui "tutto è 14 volte più veloce" — il tempo di risposta end-to-end include anche l'elaborazione dell'input e il ragionamento del modello stesso, motivo per cui 14× è definito come un massimo.
• Portata massima in output — fino a 750 token di output al secondo, secondo l'annuncio di OpenAI (13-08-2026).
• Rispetto all'elaborazione standard — fino a 14× più veloce, secondo lo stesso annuncio; i miglioramenti effettivi variano in base alla lunghezza dell'input e al tipo di attività.
• Humanity's Last Exam, 2.500 domande — il report di OpenAI/Cerebras indica GPT-5.6 Sol Ultrafast che termina in 11 ore e 11 minuti contro 78 ore e 27 minuti per Claude Fable 5, con accuratezza comparabile. Dati dichiarati dai fornitori, e il confronto copre stack hardware di due fornitori: va letto come indicativo, non come verdetto.
• GDP-Val, end-to-end — Cerebras riporta una velocità complessiva 5,6× superiore, senza alcuna perdita di qualità misurabile. Anche in questo caso, dati dichiarati dal fornitore.
• Confronto tra modalità Fast e Ultrafast — la modalità fast arriva a una velocità di output di circa 2,5× in cambio di un sovrapprezzo di 2×, con lo stesso limite di ~272K token della tariffazione standard. Ultrafast è il salto più grande: 14× su GPT-5.6 Sol secondo l'annuncio di agosto, e fino a 8× su GPT-6 Astra in Codex secondo la documentazione attuale di OpenAI, con la copertura del lancio che lo colloca fino a 300 token di output al secondo.
• CS-4, il prossimo hardware — Cerebras afferma che il rack CS-4 eroga più di 1.000 token al secondo su modelli oltre 10 trilioni di parametri, fino a 2× la generazione di token di CS-3. Una segnalazione non verificata della community colloca GPT-5.6 Sol su CS-4 a circa 1.300 token al secondo — stessa direzione, non ancora confermato da OpenAI o da Cerebras.
Una cautela prima di citare il 14×: è un tetto di throughput in uscita sull'hardware di un singolo fornitore, e i confronti indipendenti del lancio di agosto variavano all'incirca da 7× a 11× a seconda della parte del carico di lavoro misurata. La stessa disciplina vale per il segnale di velocità del CS-4: la cifra di ~1.300 token/s per GPT-5.6 Sol su CS-4 è nata come singolo post su X, e né OpenAI né Cerebras l'hanno confermata. Considera tutti questi come dichiarazioni di fornitori e community, non come verdetti di benchmark.
Quanto costa ora Ultrafast — e perché questo ancora non prezza Sol

Ecco lo stato della questione prezzo al 2026-09-30, esposto chiaramente. Ultrafast ha una tariffa pubblicata — per GPT-6 Astra, e solo per GPT-6 Astra. La pagina dei prezzi di OpenAI ora include una colonna Ultrafast accanto a Standard, Batch, Flex e Fast: $60,00 input / $6,00 input in cache / $75,00 scritture in cache / $300,00 output per milione di token in contesto breve, che raddoppiano a $120,00 / $12,00 / $150,00 / $450,00 oltre i circa 272K token. Sono sei volte la tariffa standard di Astra, mentre la modalità fast è due volte — ed è il primo numero concreto che OpenAI ha associato al livello. La scheda sopra è il nostro snapshot del 2026-08-18, e le sue cifre in dollari sono superate due volte: dal taglio della tariffa standard e ora da questa riga Ultrafast. Ciò che manca ancora in quella tabella è una qualsiasi tariffa Ultrafast per GPT-5.6 Sol: la colonna Ultrafast elenca esattamente un modello, gpt-6-astra. Il livello ha un prezzo; questo modello no.
Cosa puoi prezzare oggi, modello per modello:
• Standard GPT-5.6 Sol — 4,00 $ input / 20,00 $ output per 1M di token, per prompt fino a circa 272K token. OpenAI lo indica come prezzo promozionale disponibile almeno fino al 21 novembre 2026. Questa è la baseline che puoi chiamare subito.
• Modalità rapida — $8,00 / $40,00 a contesto breve su GPT-5.6 Sol, che raddoppia a $16,00 / $60,00 oltre circa 272K token. Il doppio della tariffa standard per una velocità di output fino a circa 2,5×, e su Sol è comunque la cosa più veloce che si possa effettivamente acquistare.
• Prompt cache — le letture dalla cache vengono fatturate a $0.40 per 1M (90% in meno rispetto all'input fresco); le scritture nella cache vengono fatturate a $5.00 per 1M.
• Fascia long-context — gli input che superano all'incirca i 272K token vengono fatturati a 8,00 $ / 30,00 $ con l'elaborazione standard, entro la finestra di ~1,05M token del modello e l'output massimo di 128K token.
• Batch API — $2,00 / $10,00 per contesto breve e $4,00 / $15,00 per contesto lungo, uno sconto fisso del 50% con un tempo di consegna di circa 24 ore.
Per GPT-5.6 Sol, il numero di Astra è l'indizio migliore disponibile e nulla più. OpenAI prezza Ultrafast a 6× la tariffa standard del modello sottostante; applica quel moltiplicatore ai $4 / $20 di Sol e arrivi a $24 / $120 per milione. È aritmetica, non un prezzo pubblicato — OpenAI non ha detto nulla su una tariffa Sol Ultrafast, e le coorti di anteprima di agosto non sono state affatto fatturate a una tariffa di livello. Pianifica in base al Sol standard a $4 / $20 o alla modalità veloce a $8 / $40 finché il fornitore non pubblica la riga.
Come usarlo — ampiamente disponibile su Astra, per Sol ancora su richiesta
L'accesso si è diviso in due il 29 settembre, e la divisione va contro il modello che questa pagina tratta. Ultrafast è ora ampiamente disponibile su GPT-6 Astra: la documentazione API di OpenAI afferma che è aperto a tutti gli utenti API con limiti di frequenza bassi — 500.000 token al minuto sui livelli di utilizzo da 1 a 3, 1 milione sul livello 4, 5 milioni sul livello 5 — ed è incluso in ChatGPT Work e Codex sul nuovo piano Pro 500 e sui piani Enterprise ed Edu idonei, dove il proprietario di un workspace deve attivarlo, e dove non è supportato per i workspace che richiedono inferenza al di fuori degli Stati Uniti. GPT-5.6 Sol Ultrafast non si è mosso insieme a esso. La stessa documentazione lo descrive ancora come accesso in anteprima tramite un team account di OpenAI, e la descrizione del parametro stesso nello schema dell'API recita ancora «attualmente disponibile per gpt-5.6-sol» — una riga che ora è indietro rispetto al resto della documentazione invece di guidarla. Se oggi vuoi quel livello, lo vuoi su Astra.
Anche la questione dell'interfaccia è risolta. TestingCatalog ha riferito in data 2026-09-26 che un selettore di velocità che offriva Standard, Fast e Ultrafast era presente ma non pubblicato nel Responses API Playground; tre giorni dopo OpenAI ha rilasciato la versione consumer esattamente di quello, con Ultrafast ora disponibile come opzione nel selettore di modello in ChatGPT Work e Codex su Pro 500. Abbiamo segnalato quell'avvistamento come l'interpretazione di una pubblicazione di UI non rilasciata e abbiamo detto che OpenAI non aveva confermato nulla di tutto ciò. Era direzionalmente corretto, e il rollout a cui puntava è arrivato al DevDay, non dopo.
Le coorti in anteprima che OpenAI ha citato ad agosto erano coding, commercio, ricerca finanziaria, supporto e altri carichi di lavoro interattivi — team i cui agenti effettuano molte chiamate per richiesta e in cui la latenza di risposta è il collo di bottiglia. Jane Street, Rogo e Podium erano tra i primi tester citati. Se il tuo carico di lavoro è una chat a turno singolo, il livello di velocità conta molto meno di quanto conti per un ciclo di agente da 40 chiamate. La risposta pratica ora dipende dal modello di cui stai chiedendo: su GPT-6 Astra puoi impostare service_tier: "ultrafast" questo pomeriggio, mentre su GPT-5.6 Sol ancora non puoi.
Cosa puoi fare oggi — la risposta pratica

Mentre GPT-5.6 Sol Ultrafast resta dietro la porta dell'anteprima, entrambi i modelli di punta sono attivi su OrcaRouter alla tariffa del provider con $0 di markup per token — ID modello openai/gpt-5.6-sol tramite l'endpoint compatibile con OpenAI su api.orcarouter.ai/v1, e GPT-6 Astra accanto a esso alla tariffa standard di $10,00 / $50,00, che è il modello su cui OpenAI ha ora aggiunto un tier Ultrafast e che noi non instradiamo a quel tier. Lo screenshot qui sotto è di agosto 2026 e mostra ancora la linea di prezzo di $5,00 / $30,00 allora in vigore; la tariffa odierna di Sol è $4,00 / $20,00, che è quella che trasferiamo. È per questo pass-through che i movimenti di prezzo del fornitore arrivano fino a noi lo stesso giorno: $4,00 input / $20,00 output, gli stessi valori che OpenAI pubblica, senza alcun markup per token aggiunto sopra. Se hai già un client OpenAI, la migrazione consiste in un cambio di URL di base e ID del modello; nient'altro. La stessa chiave e lo stesso endpoint supportano oltre 200 modelli, così Sol si trova accanto ai suoi stessi fratelli — GPT-5.6 Terra a $2,00 / $12,00 e GPT-5.6 Luna a $0,20 / $1,20 — e ai modelli open-weight con cui lo metteresti a confronto, e puoi instradare in base alla difficoltà invece di re-integrare ciascuno.
Due particolarità di OrcaRouter meritano di essere citate in una pagina sulla velocità. BYOK: porta la tua chiave OpenAI e OpenAI ti fattura direttamente secondo le sue tariffe — OrcaRouter aggiunge $0 per token e mantiene intatti i limiti di velocità e i crediti del tuo provider. Guardrail: il PII Shield e la policy sui contenuti vengono eseguiti prima della fatturazione, quindi una richiesta bloccata restituisce un 400 pulito e non viene mai addebitata, e l'Agent Firewall valuta le chiamate a tool e MCP prima che vengano eseguite. Ultrafast stesso è ampiamente disponibile su GPT-6 Astra ma non a condizioni instradabili e non per Sol — è un tier ad accesso controllato fatturato a 6× la tariffa standard, e noi non lo serviamo. Se OpenAI dovesse mai offrirlo a condizioni standard, collegarlo allo stesso endpoint è un cambio di model-id; la configurazione che costruisci oggi rimane valida.
Il limite onesto — quando Ultrafast non è la risposta
Cinque punti in cui la storia della velocità non regge ancora, ora che metà di essa si è assestata:
Disponibile non è la stessa cosa di disponibile per te. Ultrafast è stato aperto a tutti gli utenti API su GPT-6 Astra, ma è stato aperto con limiti di velocità bassi, è ancora descritto come ad accesso controllato nello schema di OpenAI, non supporta l'elaborazione regionale UE o di altre regioni non statunitensi, e negli spazi di lavoro Enterprise è disattivato finché un proprietario non lo abilita. Su GPT-5.6 Sol non si è aperto nulla. Verifica il tuo accesso prima di progettare l'architettura su uno dei due.
14× è un massimo, non una garanzia. È un tetto di throughput in uscita sull'hardware Cerebras; la latenza end-to-end include comunque l'elaborazione dell'input, il tempo di ragionamento del modello e la tua rete. Un prompt con molto ragionamento può trascorrere gran parte del suo tempo reale a pensare, dove l'accelerazione tanto sbandierata si riduce.
Ha un prezzo su un modello e nessun prezzo sull'altro. La tariffa Astra Ultrafast è pubblicata — 6× lo standard — e non esiste da nessuna parte una riga Ultrafast per GPT-5.6 Sol. Imposta il budget facendo riferimento a Sol standard a $4 / $20 o alla modalità fast a $8 / $40, e considera qualsiasi cifra di "costo di GPT-5.6 Sol Ultrafast" che vedi, inclusa l'estrapolazione di $24 / $120 sopra, come aritmetica e non come listino tariffe.
I benchmark sono dichiarati dal fornitore. La sessione HLE di 11 ore e il dato di 5,6× su GDP-Val sono numeri OpenAI/Cerebras risalenti all'annuncio di agosto; le stime indipendenti dell'accelerazione variano da circa 7× a 11× a seconda di ciò che si misura. Aggiungi a questo elenco il segnale CS-4: il dato di ~1.300 token/s per GPT-5.6 Sol su CS-4 proviene da un singolo post su X e non ha alcuna conferma indipendente. Anche i nuovi numeri di Astra Ultrafast — 8× in Codex, 6× il prezzo — sono di OpenAI stessa.
E quello che costa denaro invece che tempo: non risolverà un collo di bottiglia che non hai. Se i tuoi agenti sono lenti a causa della tua orchestrazione, della latenza degli strumenti o di prompt con input pesanti, un percorso di output più veloce sposta la coda solo leggermente. La decisione di abbinamento del livello — GPT-5.6 Sol a $4 / $20 contro GPT-5.6 Terra a $2 / $12 contro GPT-5.6 Luna a $0.20 / $1.20 — incide comunque sulla tua fattura più di qualsiasi livello di velocità.
In sintesi. Ultrafast non è più un livello in lista d'attesa di cui puoi solo leggere. Dal 29 settembre 2026 OpenAI lo vende: incluso con il piano ChatGPT Pro 500 da $500 in Work e Codex, aperto a tutti gli utenti API su GPT-6 Astra con limiti di velocità bassi, e prezzato a sei volte la tariffa standard — $60 / $300 per milione in contesto breve. GPT-5.6 Sol Ultrafast, l'anteprima di agosto su cui era basata questa pagina, non è cambiata: ancora ad accesso controllato, ancora limitata a gpt-5.6-sol nello schema API, ancora senza prezzo, e il dato di ~1.300 token/s riportato per Sol su CS-4 di Cerebras è ancora un singolo post su X non verificato. Il GPT-5.6 Sol standard a $4 / $20 è quello che puoi chiamare oggi su OrcaRouter con $0 di ricarico; GPT-6 Astra a $10 / $50 è quello che puoi chiamare se vuoi il modello che ha ottenuto la riga Ultrafast.
Ultrafast ora costa soldi veri su GPT-6 Astra — 6× lo standard, oppure incluso nel piano Pro 500 da $500 — mentre GPT-5.6 Sol Ultrafast resta un'anteprima. Il GPT-5.6 Sol completo è disponibile su OrcaRouter a $4 / $20 per milione di token con zero markup, pronto per la tua chiave.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
