Illustrazione editoriale flat-vector per l'hero di un blog tecnologico sull'inferenza AI ultraveloce: un grande chip a forma arrotondata in blu scuro con un morbido bagliore ciano su sfondo chiaro, un fulmine stilizzato e un quadrante di velocità con l'ago al massimo accanto ad esso, flussi di token rapidi che corrono lungo una linea di velocità orizzontale con linee di movimento, e un piccolo cronometro. Sfondo bianco con delicati accenti sfumati blu e ciano e un sottile caldo riflesso; icone minimali flat a linea; tipografia geometrica sans-serif moderna e pulita; nessun testo leggibile, nessuna lettera, nessuna parola, nessuna filigrana, nessun logo di terze parti, composizione 16:9.
Guides & Insights

GPT-5.6 Sol Ultrafast: 14× Velocità, 750 Tok/s — CS-4: secondo quanto riportato ~1.300, nessun prezzo ancora

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-5.6 Sol Ultrafast mode è il livello di servizio con accelerazione hardware per il modello di punta — lo stesso identico modello GPT-5.6 Sol eseguito su chip Cerebras wafer-scale anziché su cluster GPU, con velocità fino a 14 volte superiore rispetto all'elaborazione standard e fino a 750 token di output al secondo sul livello annunciato da OpenAI in agosto. Il 2026-08-18, Cerebras ha svelato il sistema CS-4 di nuova generazione su cui questo livello si espanderà, e un primo report non verificato sostiene che GPT-5.6 Sol su CS-4 serva già circa 1.300 token al secondo. Non è un modello più piccolo e non è una distillazione: sono cambiati solo hardware e scheduling, e l'intelligenza è preservata. Quello che non ha ancora è un prezzo — al 2026-08-19, Ultrafast è un'anteprima API limitata senza listino prezzi pubblicato, quindi l'unico numero su cui puoi fare un budget oggi è il livello standard nella pagina del modello GPT-5.6 Sol: $5 per milione di token di input e $30 per milione di output, senza alcun ricarico. Questo articolo spiega cos'è la modalità, quanto siano veri i numeri sulla velocità — incluso il nuovo hardware CS-4 e ciò che non è ancora verificato — quanto costa (inclusa l'onesta risposta "non c'è ancora un prezzo") e cosa fare finché non raggiunge la disponibilità generale.

Cosa sia realmente la modalità Ultrafast

Ultrafast è un livello di servizio, non un nuovo modello. OpenAI lo ha annunciato il 13 agosto 2026 come primo prodotto della sua partnership di calcolo del gennaio 2026 con il produttore di chip Cerebras — un accordo stimato in circa 10 miliardi di dollari su tre anni. Mentre l'inferenza standard di GPT-5.6 Sol viene eseguita su cluster di GPU e passa gran parte del tempo a spostare i pesi tra memoria e calcolo, Ultrafast carica i pesi del modello nei 44 GB di SRAM on-chip dei chip wafer-scale di Cerebras; le dimensioni di un modello come Sol si estendono su più wafer in strati, quindi i pesi si trovano dove avviene il calcolo. Il risultato è un tetto di throughput imposto dal silicio piuttosto che dalla larghezza di banda della memoria.

La storia dell'hardware è andata avanti il 18-08-2026. Al suo evento Supernova, Cerebras ha svelato il CS-4, il sistema rack-scale di nuova generazione costruito sulla sua piattaforma Nexus: tre chip Wafer-Scale Engine per rack, velocità di generazione dei token fino a 2 volte superiore rispetto al precedente CS-3 e, secondo Cerebras, più di 1.000 token al secondo su modelli con oltre 10 trilioni di parametri. Queste sono le affermazioni di Cerebras per un sistema in accesso anticipato, non ancora generalmente disponibile. Dall'annuncio, un singolo post su X sostiene che CS-4 serve già GPT-5.6 Sol a circa 1.300 token al secondo — una direzione coerente con i numeri di Cerebras, ma finora confermata da nessuno. Trattatelo come un segnale iniziale: plausibile, non verificato, e degno di essere ricontrollato prima di pianificare la capacità intorno ad esso.

La parte che conta per il tuo codice: l'id del modello, i pesi, il comportamento di ragionamento e l'output sono identici al GPT-5.6 Sol standard. OpenAI presenta Ultrafast come "più lavoro utile al secondo" piuttosto che come un livello di qualità, e l'anteprima esegue il flagship completo — la velocità non deriva dal passare a un modello più economico. Ciò che cambia è la velocità con cui escono i token.

Non confondere Ultrafast con l'attuale modalità veloce. La modalità veloce è un livello separato e acquistabile su hardware standard: fino a circa 2,5× la velocità di output con un sovrapprezzo di 2× per token ($10 di input / $60 di output per 1M), senza modifiche alla qualità. Ultrafast è un'altra cosa: hardware Cerebras, fino a 14×, e per ora nessun prezzo.

Quanto veloce — i numeri che contano

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

Il dato principale è 14× e necessita di una definizione. OpenAI afferma che Ultrafast genera fino a 750 token di output al secondo rispetto all'elaborazione standard di GPT-5.6 Sol. Si tratta di una misura di throughput per i token di output, non di un'affermazione generica secondo cui "tutto è 14 volte più veloce" — il tempo di risposta end-to-end include anche l'elaborazione dell'input e il ragionamento del modello stesso, motivo per cui 14× è definito come un massimo.

Throughput massimo di output — fino a 750 token di output al secondo, secondo l'annuncio di OpenAI (2026-08-13).

Rispetto all'elaborazione standard — fino a 14× più veloce, come indicato nello stesso annuncio; i guadagni effettivi variano in base alla lunghezza dell'input e al tipo di attività.

Humanity's Last Exam, 2.500 domande — OpenAI/Cerebras riportano che GPT-5.6 Sol Ultrafast ha terminato in 11 ore e 11 minuti contro le 78 ore e 27 minuti di Claude Fable 5, con una precisione comparabile. Dato dichiarato dai fornitori, e il confronto copre gli stack hardware di due fornitori — da leggere come indicativo, non come verdetto.

GDP-Val, end-to-end — Cerebras riporta prestazioni complessive 5,6× superiori senza perdita di qualità misurabile. Anche questo è dichiarato dal fornitore.

Baseline della modalità veloce — il livello di velocità acquistabile esistente raggiunge al massimo circa 2,5× la velocità di output per un sovrapprezzo di 2×.

• CS-4, il prossimo hardware — Cerebras afferma che il rack CS-4 eroga più di 1.000 token al secondo su modelli oltre 10 trilioni di parametri, fino a 2× la generazione di token di CS-3. Una segnalazione non verificata della community colloca GPT-5.6 Sol su CS-4 a circa 1.300 token al secondo — stessa direzione, non ancora confermato da OpenAI o da Cerebras.

Una cautela prima di citare il 14×: la copertura indipendente del lancio cita un confronto di ~11× sulla velocità di generazione rispetto a Claude Fable 5, mentre le cifre di Cerebras implicano ~7× per il tempo totale di test sullo stesso run — la differenza sta in quale parte del carico di lavoro si misura. La stessa disciplina vale per il segnale di velocità del CS-4: la cifra di ~1.300 token/s è nata da un singolo post su X, e né OpenAI né Cerebras l'hanno confermata. Tutti questi sono numeri di vendor o community annunciati questa settimana, e nessuno è ancora stato verificato in modo indipendente. Trattateli come dichiarazioni, non come verdetti di benchmark.

Quanto costa — e l'onesto divario

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Ecco lo stato della questione prezzi al 2026-08-19, detto chiaramente: Ultrafast non ha un prezzo pubblicato. OpenAI non ne ha annunciato uno, e l'anteprima non compare in alcun listino pubblico. Le notizie secondo cui gli slot di accesso anticipato sono inclusi o gratuiti sono speculazioni, non policy — e finché OpenAI non fissa il prezzo del livello, qualsiasi numero "GPT-5.6 Sol Ultrafast cost" che trovi altrove è una congettura.

{{1}}Ciò che puoi prezzare oggi{{/1}} è {{2}}il resto della linea GPT-5.6 Sol{{/2}}, {{3}}verificato rispetto alle tariffe pubblicate da OpenAI il 2026-08-18{{/3}}:

Standard GPT-5.6 Sol — $5.00 in input / $30.00 in output per 1M token. La baseline che puoi chiamare subito.

Modalità veloce — $10,00 / $60,00, un sovrapprezzo di 2× per una velocità di output fino a circa 2,5×. La cosa più simile a un livello di velocità che puoi davvero comprare.

Lettura cache del prompt — $0,50 per 1M (90% in meno rispetto all'input fresco); le scritture in cache sono fatturate a $6,25 per 1M.

Livello long-context — gli input oltre circa 272K token vengono fatturati a $10.00 / $45.00.

Batch API — $2.50 / $15.00, uno sconto fisso del 50% con un tempo di elaborazione di circa 24 ore.

Per contesto sul premio da aspettarsi: la modalità veloce ha stabilito il precedente a 2× la tariffa standard per 2.5× la velocità. Se Ultrafast segue una curva simile, si collocherà ben al di sopra dei $5 / $30 standard — e i commenti sull'anteprima si aspettano esattamente questo, perché la capacità di wafer di Cerebras è scarsa e costosa. Ma un premio previsto non è un prezzo. Pianifica sulla base della modalità Sol standard o fast mode finché non esiste una tariffa.

Come usarlo — la realtà dell'anteprima

L'accesso è il secondo divario reale. Ultrafast è disponibile attraverso l'API OpenAI per un gruppo selezionato di clienti tramite lista d'attesa, come annunciato il 2026-08-13, con OpenAI che afferma che l'accesso verrà ampliato "man mano che la capacità cresce". Non è prevista una data di disponibilità generale. Le coorti di anteprima annunciate sono codifica, commercio, ricerca finanziaria, supporto e altri carichi di lavoro interattivi — team i cui agenti effettuano molte chiamate per richiesta e dove la latenza di risposta è il collo di bottiglia. Jane Street, Rogo e Podium figurano tra i primi tester citati.

Il pattern d'uso per cui è progettato: risposta agli incidenti (lettura di log, trace e diff mentre un'interruzione è in corso), ricerca finanziaria e rilevamento di frodi su dati in movimento, supporto clienti in tempo reale e voce (dove un silenzio di mezzo secondo viene percepito come un guasto), checkout e-commerce e compressione di batch di ricerca notturni in sessioni interattive. Se il tuo carico di lavoro è una chat a turno singolo, il 14× conta molto meno che in un loop di agenti a 40 chiamate.

Cosa puoi fare oggi — la risposta pratica

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Mentre Ultrafast è in anteprima, la versione completa di GPT-5.6 Sol è disponibile adesso — e su OrcaRouter il livello standard è servito alla tariffa del provider con un markup di $0 per token, come ID modello openai/gpt-5.6-sol tramite l'endpoint compatibile con OpenAI all'indirizzo api.orcarouter.ai/v1. Se hai già un client OpenAI, la migrazione è un cambio di URL base e di ID modello; nient'altro. La stessa chiave e lo stesso endpoint danno accesso a oltre 200 modelli, quindi Sol si affianca a GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 e ai modelli open-weight con cui lo confronteresti — e puoi instradare le richieste in base alla difficoltà invece di re-integrare ciascuno di essi.

Due particolarità di OrcaRouter meritano di essere citate in una pagina sulla velocità. BYOK: porta la tua chiave OpenAI e OpenAI ti fattura direttamente alle proprie tariffe — OrcaRouter aggiunge $0 per token e mantiene intatti i limiti di frequenza e i crediti del tuo provider. Guardrails: il PII Shield e la policy sui contenuti vengono eseguiti prima della fatturazione, quindi una richiesta bloccata restituisce un 400 pulito e non viene mai addebitata, e l'Agent Firewall valuta le chiamate agli strumenti e le chiamate MCP prima che vengano eseguite. Quando — e se — Ultrafast raggiungerà la disponibilità generale a un prezzo instradabile, collegarlo allo stesso endpoint è un semplice cambio di model-id; la configurazione che crei oggi viene mantenuta.

Il limite onesto — quando Ultrafast non è la risposta

Quattro punti in cui la storia del 14× non regge, quindi non progettare né fare budgeting su un numero che non è definito:

14× è un massimo, non una garanzia. È un tetto massimo di throughput di output sull'hardware Cerebras; la latenza end-to-end include ancora l'elaborazione dell'input, il tempo di ragionamento del modello e la tua rete. Un prompt che richiede molto ragionamento può passare la maggior parte del suo tempo reale a pensare, e in questo caso l'accelerazione di punta si riduce.

Non ha prezzo né data di GA. Al 2026-08-19 non puoi acquistare Ultrafast — puoi solo richiedere l'accesso in anteprima, e l'hardware CS-4 che ne è alla base è in accesso anticipato piuttosto che generalmente disponibile. Per il budget, fai riferimento alla Sol standard ($5 / $30) o alla modalità veloce ($10 / $60), e tratta qualsiasi prezzo di Ultrafast che vedi online come non verificato.

I benchmark sono dichiarati dai vendor. Il run HLE di 11 ore e la cifra di 5.6× GDP-Val sono numeri OpenAI/Cerebras tratti dall'annuncio; le stime indipendenti variano da circa 7× a 11× a seconda di cosa viene misurato. Aggiungi a quella lista il segnale di velocità del CS-4: il dato di ~1.300 token/s per GPT-5.6 Sol su CS-4 proviene da un singolo post su X e non ha alcuna conferma indipendente. Nessuno di questi è stato ancora verificato in modo indipendente.

Non risolverà un collo di bottiglia che non hai.Se i tuoi agenti sono lenti a causa della tua stessa orchestrazione, della latenza degli strumenti o di prompt ricchi di input, un percorso di output più veloce sposta la coda solo di poco. La scelta del livello — GPT-5.6 Sol a $5 / $30 rispetto a GPT-5.6 Terra a $2 / $12 rispetto a GPT-5.6 Luna a $0.20 / $1.20 — incide ancora sulla tua bolletta più di qualsiasi livello di velocità.

In sintesi. GPT-5.6 Sol Ultrafast è il livello di servizio più veloce che OpenAI abbia mai rilasciato per il suo modello di punta — gli stessi pesi su hardware Cerebras, fino a 14× di throughput e 750 token di output al secondo sul livello annunciato. Il nuovo CS-4 di Cerebras (presentato il 2026-08-18) spingerebbe GPT-5.6 Sol verso ~1,300 token al secondo, ma quella cifra è un singolo post su X non verificato. Al 2026-08-19, Ultrafast è un'anteprima in lista d'attesa senza prezzo pubblico. Se stai cercando un numero su cui basare il budget, la risposta onesta è che non esiste ancora. Il GPT-5.6 Sol standard a $5 / $30 è quello che puoi richiedere oggi, la modalità veloce a $10 / $60 è il livello di velocità acquistabile, e OrcaRouter li inoltra entrambi con un ricarico di $0 sulla tua chiave. Costruisci il routing ora — e quando Ultrafast avrà un prezzo e una data, sarà a un cambio di model-id di distanza.

Finché Ultrafast non avrà un prezzo, il GPT-5.6 Sol completo è disponibile su GPT-5.6 Sol su OrcaRouter a $5 / $30 per milione di token, zero ricarico, pronto per la tua chiave.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube