Una hero title card generata per 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol' con l'occhiello 'Stessi pesi. Livello di servizio diverso.' e due card: a sinistra 'GPT-5.6 Sol Ultrafast' che elenca Hardware: wafer Cerebras, Velocità: fino a 750 tok/s, Prezzo: non ancora pubblicato; a destra 'GPT-5.6 Sol' che elenca Hardware: cluster GPU, Velocità: standard, Prezzo: $4.00 / $20.00; piè di pagina 'Entrambi eseguono l'identico checkpoint GPT-5.6 Sol.' Logo OrcaRouter in basso a destra.
Guides & Insights

GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol: stessi pesi, livello di servizio diverso

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-5.6 Sol Ultrafast non è un nuovo modello, e questo non è un articolo di lancio. Il fornitore ha annunciato la modalità il 13 agosto 2026 e lo stesso giorno il valore ultrafast è comparso nello schema OpenAPI pubblico dell'azienda, all'interno della descrizione ServiceTierResponses della specifica — che, stando alla sua stessa formulazione, circoscrive il tier all'endpoint gpt-5.6-sol e lo contrassegna come ad accesso controllato. Ciò che ha rimesso questa pagina nella nostra coda è più piccolo e più specifico: il 25 settembre 2026, il commit fe4f7a1 ha esteso quel valore a due ulteriori enumerazioni, il parametro service-tier a livello di richiesta e il campo della policy service-tier dell'agente. Sei settimane dopo l'annuncio, il tier è ancora in lista d'attesa, non ha ancora un prezzo pubblicato ed è ora collegato a una porzione più ampia della superficie API di quanto possa effettivamente servire. GPT-5.6 Sol Ultrafast e GPT-5.6 Sol sono lo stesso modello; l'unica cosa che questo confronto può stabilire è chi controlla il puntatore e chi ti ha detto quanto costa.

Quindi l'abbinamento nel titolo è insolito. GPT-5.6 Sol Ultrafast e GPT-5.6 Sol sono lo stesso modello. Stessi pesi, stesso checkpoint, stesso comportamento di ragionamento, stessa finestra di contesto da 1,05 milioni di token, stesso output massimo di 128K, stesse risposte. La descrizione di OpenAI stessa è "più lavoro utile al secondo", non un modello più intelligente. L'unica cosa che differisce tra le due colonne di questo confronto è come vengono prodotti i token e come viene chiamato il tier nel corpo della tua richiesta — il che lo rende l'esperimento di controllo più pulito nella gamma attuale, e anche il più difficile da acquistare, perché uno dei due tier non ha alcun prezzo pubblicato.

Che cosa è cambiato davvero questa settimana

La prova del cambiamento di settembre è un commit, non un post di blog. OpenAI mantiene openai-openapi, il repository che pubblica lo schema leggibile da macchina per la sua API, e il commit fe4f7a1 — datato 2026-09-25 — aggiunge ultrafast a due enumerazioni: la policy del livello di servizio associata agli agenti, e il campo a livello di richiesta che la specifica descrive come "il livello di servizio usato per le richieste al modello". Si tratta di un'estensione, non di un debutto: prima di questo commit quelle due liste riportavano auto, default, flex, priority, fast, e il livello era già nello schema dal 13 agosto. Il commit merita attenzione per il campo che ha raggiunto — il campo policy con cui viene configurato un agente, che è una superficie diversa da un override per richiesta.

La descrizione che conta risale al commit del 13 agosto, non a questo, ed è la dichiarazione più specifica che OpenAI abbia pubblicato sul tier ovunque. Accanto al nuovo valore, la specifica recita: "Se impostato su 'ultrafast', la richiesta verrà elaborata con il tier di servizio Ultrafast Processing ad accesso controllato. Questo tier è attualmente disponibile per gpt-5.6-sol; una risposta servita tramite esso mostrerà service_tier=ultrafast."

Leggi quella frase due volte, perché risolve due questioni su cui questa pagina di confronto altrimenti dovrebbe mantenersi vaga. Il livello è limitato a un solo modello — il modello di punta GPT-5.6 Sol e nient'altro nella gamma — ed è ad accesso controllato anziché aperto, il che corrisponde a come OpenAI presenta un'anteprima con lista d'attesa. Ti dice anche come sapresti di averlo ottenuto: la risposta riporta quale livello ha effettivamente servito la richiesta, così un fallback all'elaborazione standard è visibile nel corpo della risposta anziché essere qualcosa che devi dedurre dalla latenza. La stessa descrizione compare sia negli schemi Responses standard sia in quelli Beta, ed è così dal 13 agosto.

A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."

Il giorno dopo è arrivato un secondo segnale, più debole. Un report del 26 settembre descrive un nuovo selettore Speed — Fast, Standard e Ultrafast — in arrivo nel Responses API Playground, con una disponibilità più ampia di Ultrafast prevista dopo la conferenza per sviluppatori DevDay di OpenAI. Non abbiamo visto personalmente il selettore e OpenAI non ha pubblicato una nota di rollout, quindi trattalo come un report da un'unica fonte anziché come una funzionalità già rilasciata. Le parti verificabili oggi sono le due voci nello schema pubblico e il fatto che non è comparsa alcuna tabella tariffaria per il livello.

Ciò che non è cambiato è altrettanto importante. Non esiste ancora un prezzo Ultrafast. La pagina dei prezzi di OpenAI, consultata il 27 settembre, contiene le quattro schede di prima — Standard, Batch, Flex e Fast — e la stringa "ultrafast" non vi compare da nessuna parte. L'accesso è ancora descritto come un'anteprima limitata per clienti selezionati, in espansione man mano che la capacità cresce. Il livello è nel contratto e fuori dal listino prezzi allo stesso tempo, ed è questa la sua condizione reale.

I due livelli, fianco a fianco

Poiché nessuna funzionalità separa questi due, il confronto si riduce quasi interamente a erogazione e fatturazione. Ogni riga sottostante riporta entrambe le parti su un'unica riga.

• Modello — GPT-5.6 Sol Ultrafast esegue l'identico checkpoint di GPT-5.6 Sol rispetto all'elaborazione standard di GPT-5.6 Sol, stesso checkpoint, nessuna distillazione, nessuna riduzione delle dimensioni.

• Throughput di output — fino a 750 token di output al secondo, fino a 14 volte lo standard, secondo l'annuncio di OpenAI del 13 agosto rispetto all'elaborazione standard di GPT-5.6 Sol su cluster GPU, che è il valore rispetto al quale viene misurato il 14×.

• Hardware — chip wafer-scale di Cerebras, con i pesi residenti nella SRAM on-chip, il primo prodotto della partnership di calcolo di OpenAI del gennaio 2026 con Cerebras, secondo quanto riportato del valore di circa 10 miliardi di dollari nell'arco di tre anni, rispetto all'inferenza GPU convenzionale, dove gran parte del tempo è dedicata allo spostamento dei pesi tra memoria e calcolo.

• Prezzo — non pubblicato al 27 settembre 2026 rispetto a 4,00 $ di input / 20,00 $ di output per milione di token, l'attuale tariffa promozionale di OpenAI, più 0,40 $ per milione per l'input in cache.

• Disponibilità — anteprima limitata in lista d'attesa per clienti selezionati rispetto al canale predefinito, chiamabile da chiunque abbia una chiave API.

• Risposte che ricevi — identiche, in linea di principio vs identiche, in linea di principio; se divergono sullo stesso prompt, questo è un riscontro, non una funzionalità.

A generated two-column scoreboard titled 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol — the scoreboard'. Left column 'GPT-5.6 Sol Ultrafast': Checkpoint same as Sol, Serving hardware Cerebras wafers, Output speed up to 750 tok/s, Speed vs standard up to 14x, Price not published, Access waitlisted preview. Right column 'GPT-5.6 Sol': Checkpoint same as Sol, Serving hardware GPU clusters, Output speed standard processing, Speed vs standard 1x baseline, Price $4.00 / $20.00, Access open to any API key. Footer sourcing line; OrcaRouter logo bottom-right.

La dichiarazione sulla velocità, e il tetto che vi è posto

Il numero di punta è 14× e merita la stessa attenzione che riceve il resto di questa pagina. OpenAI dichiara fino a 750 token di output al secondo rispetto all'elaborazione standard — un dato di throughput per i token di output, non un'affermazione che ogni richiesta si completi 14 volte più rapidamente. Il tempo end-to-end comprende anche l'elaborazione dell'input e il ragionamento del modello stesso, nessuno dei quali l'hardware wafer-scale comprime allo stesso rapporto. Ecco perché l'azienda etichetta 14× come un massimo anziché una misurazione.

I confronti pubblicati sono dichiarati dai fornitori su entrambi i lati della tabella, e uno di essi abbraccia gli stack di due fornitori. Un'esecuzione di Humanity's Last Exam da 2.500 domande viene riportata come conclusa in 11 ore e 11 minuti su Ultrafast contro 78 ore e 27 minuti per Claude Fable 5, con un'accuratezza comparabile — cioè OpenAI e Cerebras che ci parlano di un benchmark che include il modello di un concorrente, e la copertura indipendente del lancio ha citato un confronto più ristretto, di circa 11×, sulla velocità di generazione nella stessa esecuzione, mentre le cifre di Cerebras implicano circa 7× per il tempo totale del test. Il divario tra 14×, 11× e 7× non è una contraddizione; è ciò che accade quando tre soggetti misurano porzioni diverse di un unico carico di lavoro. Cerebras riporta separatamente 5,6× end-to-end su GDP-Val senza alcuna perdita di qualità misurabile. Nulla di tutto ciò è stato riprodotto da una terza parte.

Il listino prezzi ha un buco

È qui che i due livelli smettono di essere simmetrici. GPT-5.6 Sol ha quattro listini pubblicati e Ultrafast non è uno di essi.

• Standard GPT-5.6 Sol — 4,00 $ / 20,00 $ per milione di token, con input in cache a 0,40 $ e un livello a contesto lungo a 8,00 $ / 30,00 $ una volta che l'input supera circa 272K token.

• Fast mode — $8.00 / $40.00, esattamente il doppio della tariffa standard. Questo è il livello che è stato rinominato da Priority processing il 30 luglio 2026, e l'API accetta sia service_tier: "priority" sia service_tier: "fast". Offre fino a circa 2,5× la velocità di output.

• Batch e Flex — $2.00 / $10.00, uno sconto fisso del 50% rispetto allo standard in cambio di una pianificazione meno rigida.

• Ultrafast — nessun listino prezzi. Non un vuoto che abbiamo riempito con un'ipotesi; un vuoto che OpenAI ha lasciato.

Quella riga di Fast-mode è l'unico vero precedente su cui basarsi per prezzare Ultrafast, ed è un dato che fa riflettere per chiunque stia pianificando un budget: l'unico livello di velocità che OpenAI ha effettivamente quantificato costa esattamente il doppio della tariffa standard per due volte e mezza la velocità. Ultrafast è una promessa di velocità maggiore che poggia su hardware meno disponibile — la capacità di wafer di Cerebras non è una commodity — quindi la direzione del sovrapprezzo finale non è in dubbio. La sua entità sì. Finché non esisterà un listino prezzi, qualsiasi cifra di "GPT-5.6 Sol Ultrafast price" che vedi citata ovunque è un'inferenza di qualcuno, comprese eventuali inferenze nostre.

Come lo chiameresti davvero

La modifica dello schema ti dice la forma della chiamata finale. Se il tier segue il pattern degli altri, arriva come campo aggiuntivo su una richiesta che stai già facendo: mantieni il modello gpt-5.6-sol, mantieni il tuo prompt e aggiungi il selettore di tier — allo stesso modo in cui oggi si seleziona la modalità Fast sostituendo priority con fast. Nulla cambia nel parsing della risposta, perché nulla cambia nel modello. È tutto qui il fascino di un tier di servizio rispetto a un cambio di modello, ed è il motivo per cui una pagina di confronto come questa ha così poco da confrontare.

Quello che oggi non puoi fare è chiamarlo. Il valore di enumerazione esiste; la capacità che vi sta dietro no, per la maggior parte degli account. Quindi la domanda pratica per le prossime settimane non è quale dei due livelli scegliere — è cosa eseguire mentre la scelta non è disponibile.

Questa è una domanda a cui un gateway risponde meglio di una lista d'attesa. Il tier standard del modello è già live su OrcaRouter come openai/gpt-5.6-sol, servito alla tariffa del provider stesso con zero markup sui token, tramite l'endpoint compatibile con OpenAI su api.orcarouter.ai/v1 — così i prezzi promozionali di OpenAI da $4 / $20 e il suo scatto per il contesto lungo da $8 / $30 vengono passati direttamente, invece di essere rimodulati da noi, e una loro modifica arriva dalla nostra parte lo stesso giorno in cui arriva da OpenAI. La stessa chiave porta oltre 200 modelli, il che qui conta più del solito: dato che non puoi impostare service_tier: "ultrafast" e ottenere una risposta, il modo per comprare latenza oggi è instradare il lavoro diversamente — manda le chiamate interattive verso il modello del catalogo che supera più rapidamente la tua soglia di qualità, e tieni i batch notturni sulla corsia più economica che passa. Quando il tier aprirà, il router è il punto in cui azioneresti l'interruttore e, fino ad allora, è la differenza tra una lista d'attesa e un piano.

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the live catalogue entry with the openai/gpt-5.6-sol identifier, Vision, Tools, JSON and Reasoning capabilities, the byline 'by OpenAI - 2026-07-09', code samples, pricing, performance and public benchmark sections listed on-page.

Quale va in produzione?

Ignora per un momento la parola "versus", perché qui non c'è alcuna decisione sulla qualità da prendere. Se stai ottimizzando per il costo per token, la risposta è GPT-5.6 Sol standard, e il canale Batch con il 50% di sconto è la risposta per tutto ciò che può aspettare. Se stai ottimizzando per quanto a lungo una persona resta davanti a uno spinner, Ultrafast è la risposta nel momento in cui riesci a ottenerla — e i carichi di lavoro che OpenAI sta indicando per l'anteprima mostrano esattamente perché: risposta agli incidenti con log e diff aperti su un'interruzione live, controlli antifrode su dati in movimento, conversazioni di supporto in cui mezzo secondo di silenzio fa pensare a un prodotto guasto e cicli di ricerca che un tempo giravano per tutta la notte, compressi in una sessione di lavoro.

L'indizio è la forma del tuo grafo delle richieste, non la dimensione del tuo prompt. Una singola generazione lunga guadagna 14× sulla carta e molto meno nella pratica, perché l'elaborazione dell'input e il ragionamento non si comprimono a quel rapporto. Quaranta chiamate sequenziali a strumenti dietro una singola azione visibile all'utente guadagnano qualcosa di molto più vicino al moltiplicatore pieno, perché ognuno di quei round trip è latenza che l'utente si trova a sopportare. Se il tuo carico di lavoro assomiglia al secondo, il livello è pensato per te; se assomiglia al primo, la corsia standard sarebbe comunque andata bene.

Due cose da tenere d'occhio, e nessuna delle due è una voce che possiamo risolvere da qui. Primo, il listino prezzi: un livello premium senza un prezzo non si può preventivare, e il precedente di Fast-mode suggerisce che non sarà contenuto. Secondo, se la lista d'attesa cresce davvero intorno a DevDay come riportato — perché un valore service_tier che la maggior parte degli account non può usare è documentazione, non disponibilità, e la differenza tra le due è la differenza tra un piano e una promessa.