
GPT-5.6 Sol Ultrafast: 14× Velocità, 750 Tok/s — CS-4: secondo quanto riportato ~1.300, nessun prezzo ancora
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 232 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
GPT-5.6 Sol Ultrafast mode è il livello di servizio con accelerazione hardware per il modello di punta — lo stesso identico modello GPT-5.6 Sol eseguito su chip Cerebras wafer-scale anziché su cluster GPU, con velocità fino a 14 volte superiore rispetto all'elaborazione standard e fino a 750 token di output al secondo sul livello annunciato da OpenAI in agosto. Il 2026-08-18, Cerebras ha svelato il sistema CS-4 di nuova generazione su cui questo livello si espanderà, e un primo report non verificato sostiene che GPT-5.6 Sol su CS-4 serva già circa 1.300 token al secondo. Non è un modello più piccolo e non è una distillazione: sono cambiati solo hardware e scheduling, e l'intelligenza è preservata. Quello che non ha ancora è un prezzo — al 2026-08-19, Ultrafast è un'anteprima API limitata senza listino prezzi pubblicato, quindi l'unico numero su cui puoi fare un budget oggi è il livello standard nella pagina del modello GPT-5.6 Sol: $5 per milione di token di input e $30 per milione di output, senza alcun ricarico. Questo articolo spiega cos'è la modalità, quanto siano veri i numeri sulla velocità — incluso il nuovo hardware CS-4 e ciò che non è ancora verificato — quanto costa (inclusa l'onesta risposta "non c'è ancora un prezzo") e cosa fare finché non raggiunge la disponibilità generale.
Cosa sia realmente la modalità Ultrafast
Ultrafast è un livello di servizio, non un nuovo modello. OpenAI lo ha annunciato il 13 agosto 2026 come primo prodotto della sua partnership di calcolo del gennaio 2026 con il produttore di chip Cerebras — un accordo stimato in circa 10 miliardi di dollari su tre anni. Mentre l'inferenza standard di GPT-5.6 Sol viene eseguita su cluster di GPU e passa gran parte del tempo a spostare i pesi tra memoria e calcolo, Ultrafast carica i pesi del modello nei 44 GB di SRAM on-chip dei chip wafer-scale di Cerebras; le dimensioni di un modello come Sol si estendono su più wafer in strati, quindi i pesi si trovano dove avviene il calcolo. Il risultato è un tetto di throughput imposto dal silicio piuttosto che dalla larghezza di banda della memoria.
La storia dell'hardware è andata avanti il 18-08-2026. Al suo evento Supernova, Cerebras ha svelato il CS-4, il sistema rack-scale di nuova generazione costruito sulla sua piattaforma Nexus: tre chip Wafer-Scale Engine per rack, velocità di generazione dei token fino a 2 volte superiore rispetto al precedente CS-3 e, secondo Cerebras, più di 1.000 token al secondo su modelli con oltre 10 trilioni di parametri. Queste sono le affermazioni di Cerebras per un sistema in accesso anticipato, non ancora generalmente disponibile. Dall'annuncio, un singolo post su X sostiene che CS-4 serve già GPT-5.6 Sol a circa 1.300 token al secondo — una direzione coerente con i numeri di Cerebras, ma finora confermata da nessuno. Trattatelo come un segnale iniziale: plausibile, non verificato, e degno di essere ricontrollato prima di pianificare la capacità intorno ad esso.
La parte che conta per il tuo codice: l'id del modello, i pesi, il comportamento di ragionamento e l'output sono identici al GPT-5.6 Sol standard. OpenAI presenta Ultrafast come "più lavoro utile al secondo" piuttosto che come un livello di qualità, e l'anteprima esegue il flagship completo — la velocità non deriva dal passare a un modello più economico. Ciò che cambia è la velocità con cui escono i token.
Non confondere Ultrafast con l'attuale modalità veloce. La modalità veloce è un livello separato e acquistabile su hardware standard: fino a circa 2,5× la velocità di output con un sovrapprezzo di 2× per token ($10 di input / $60 di output per 1M), senza modifiche alla qualità. Ultrafast è un'altra cosa: hardware Cerebras, fino a 14×, e per ora nessun prezzo.
Quanto veloce — i numeri che contano

Il dato principale è 14× e necessita di una definizione. OpenAI afferma che Ultrafast genera fino a 750 token di output al secondo rispetto all'elaborazione standard di GPT-5.6 Sol. Si tratta di una misura di throughput per i token di output, non di un'affermazione generica secondo cui "tutto è 14 volte più veloce" — il tempo di risposta end-to-end include anche l'elaborazione dell'input e il ragionamento del modello stesso, motivo per cui 14× è definito come un massimo.
• Throughput massimo di output — fino a 750 token di output al secondo, secondo l'annuncio di OpenAI (2026-08-13).
• Rispetto all'elaborazione standard — fino a 14× più veloce, come indicato nello stesso annuncio; i guadagni effettivi variano in base alla lunghezza dell'input e al tipo di attività.
• Humanity's Last Exam, 2.500 domande — OpenAI/Cerebras riportano che GPT-5.6 Sol Ultrafast ha terminato in 11 ore e 11 minuti contro le 78 ore e 27 minuti di Claude Fable 5, con una precisione comparabile. Dato dichiarato dai fornitori, e il confronto copre gli stack hardware di due fornitori — da leggere come indicativo, non come verdetto.
• GDP-Val, end-to-end — Cerebras riporta prestazioni complessive 5,6× superiori senza perdita di qualità misurabile. Anche questo è dichiarato dal fornitore.
• Baseline della modalità veloce — il livello di velocità acquistabile esistente raggiunge al massimo circa 2,5× la velocità di output per un sovrapprezzo di 2×.
• CS-4, il prossimo hardware — Cerebras afferma che il rack CS-4 eroga più di 1.000 token al secondo su modelli oltre 10 trilioni di parametri, fino a 2× la generazione di token di CS-3. Una segnalazione non verificata della community colloca GPT-5.6 Sol su CS-4 a circa 1.300 token al secondo — stessa direzione, non ancora confermato da OpenAI o da Cerebras.
Una cautela prima di citare il 14×: la copertura indipendente del lancio cita un confronto di ~11× sulla velocità di generazione rispetto a Claude Fable 5, mentre le cifre di Cerebras implicano ~7× per il tempo totale di test sullo stesso run — la differenza sta in quale parte del carico di lavoro si misura. La stessa disciplina vale per il segnale di velocità del CS-4: la cifra di ~1.300 token/s è nata da un singolo post su X, e né OpenAI né Cerebras l'hanno confermata. Tutti questi sono numeri di vendor o community annunciati questa settimana, e nessuno è ancora stato verificato in modo indipendente. Trattateli come dichiarazioni, non come verdetti di benchmark.
Quanto costa — e l'onesto divario

Ecco lo stato della questione prezzi al 2026-08-19, detto chiaramente: Ultrafast non ha un prezzo pubblicato. OpenAI non ne ha annunciato uno, e l'anteprima non compare in alcun listino pubblico. Le notizie secondo cui gli slot di accesso anticipato sono inclusi o gratuiti sono speculazioni, non policy — e finché OpenAI non fissa il prezzo del livello, qualsiasi numero "GPT-5.6 Sol Ultrafast cost" che trovi altrove è una congettura.
{{1}}Ciò che puoi prezzare oggi{{/1}} è {{2}}il resto della linea GPT-5.6 Sol{{/2}}, {{3}}verificato rispetto alle tariffe pubblicate da OpenAI il 2026-08-18{{/3}}:
• Standard GPT-5.6 Sol — $5.00 in input / $30.00 in output per 1M token. La baseline che puoi chiamare subito.
• Modalità veloce — $10,00 / $60,00, un sovrapprezzo di 2× per una velocità di output fino a circa 2,5×. La cosa più simile a un livello di velocità che puoi davvero comprare.
• Lettura cache del prompt — $0,50 per 1M (90% in meno rispetto all'input fresco); le scritture in cache sono fatturate a $6,25 per 1M.
• Livello long-context — gli input oltre circa 272K token vengono fatturati a $10.00 / $45.00.
• Batch API — $2.50 / $15.00, uno sconto fisso del 50% con un tempo di elaborazione di circa 24 ore.
Per contesto sul premio da aspettarsi: la modalità veloce ha stabilito il precedente a 2× la tariffa standard per 2.5× la velocità. Se Ultrafast segue una curva simile, si collocherà ben al di sopra dei $5 / $30 standard — e i commenti sull'anteprima si aspettano esattamente questo, perché la capacità di wafer di Cerebras è scarsa e costosa. Ma un premio previsto non è un prezzo. Pianifica sulla base della modalità Sol standard o fast mode finché non esiste una tariffa.
Come usarlo — la realtà dell'anteprima
L'accesso è il secondo divario reale. Ultrafast è disponibile attraverso l'API OpenAI per un gruppo selezionato di clienti tramite lista d'attesa, come annunciato il 2026-08-13, con OpenAI che afferma che l'accesso verrà ampliato "man mano che la capacità cresce". Non è prevista una data di disponibilità generale. Le coorti di anteprima annunciate sono codifica, commercio, ricerca finanziaria, supporto e altri carichi di lavoro interattivi — team i cui agenti effettuano molte chiamate per richiesta e dove la latenza di risposta è il collo di bottiglia. Jane Street, Rogo e Podium figurano tra i primi tester citati.
Il pattern d'uso per cui è progettato: risposta agli incidenti (lettura di log, trace e diff mentre un'interruzione è in corso), ricerca finanziaria e rilevamento di frodi su dati in movimento, supporto clienti in tempo reale e voce (dove un silenzio di mezzo secondo viene percepito come un guasto), checkout e-commerce e compressione di batch di ricerca notturni in sessioni interattive. Se il tuo carico di lavoro è una chat a turno singolo, il 14× conta molto meno che in un loop di agenti a 40 chiamate.
Cosa puoi fare oggi — la risposta pratica

Mentre Ultrafast è in anteprima, la versione completa di GPT-5.6 Sol è disponibile adesso — e su OrcaRouter il livello standard è servito alla tariffa del provider con un markup di $0 per token, come ID modello openai/gpt-5.6-sol tramite l'endpoint compatibile con OpenAI all'indirizzo api.orcarouter.ai/v1. Se hai già un client OpenAI, la migrazione è un cambio di URL base e di ID modello; nient'altro. La stessa chiave e lo stesso endpoint danno accesso a oltre 200 modelli, quindi Sol si affianca a GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 e ai modelli open-weight con cui lo confronteresti — e puoi instradare le richieste in base alla difficoltà invece di re-integrare ciascuno di essi.
Due particolarità di OrcaRouter meritano di essere citate in una pagina sulla velocità. BYOK: porta la tua chiave OpenAI e OpenAI ti fattura direttamente alle proprie tariffe — OrcaRouter aggiunge $0 per token e mantiene intatti i limiti di frequenza e i crediti del tuo provider. Guardrails: il PII Shield e la policy sui contenuti vengono eseguiti prima della fatturazione, quindi una richiesta bloccata restituisce un 400 pulito e non viene mai addebitata, e l'Agent Firewall valuta le chiamate agli strumenti e le chiamate MCP prima che vengano eseguite. Quando — e se — Ultrafast raggiungerà la disponibilità generale a un prezzo instradabile, collegarlo allo stesso endpoint è un semplice cambio di model-id; la configurazione che crei oggi viene mantenuta.
Il limite onesto — quando Ultrafast non è la risposta
Quattro punti in cui la storia del 14× non regge, quindi non progettare né fare budgeting su un numero che non è definito:
14× è un massimo, non una garanzia. È un tetto massimo di throughput di output sull'hardware Cerebras; la latenza end-to-end include ancora l'elaborazione dell'input, il tempo di ragionamento del modello e la tua rete. Un prompt che richiede molto ragionamento può passare la maggior parte del suo tempo reale a pensare, e in questo caso l'accelerazione di punta si riduce.
Non ha prezzo né data di GA. Al 2026-08-19 non puoi acquistare Ultrafast — puoi solo richiedere l'accesso in anteprima, e l'hardware CS-4 che ne è alla base è in accesso anticipato piuttosto che generalmente disponibile. Per il budget, fai riferimento alla Sol standard ($5 / $30) o alla modalità veloce ($10 / $60), e tratta qualsiasi prezzo di Ultrafast che vedi online come non verificato.
I benchmark sono dichiarati dai vendor. Il run HLE di 11 ore e la cifra di 5.6× GDP-Val sono numeri OpenAI/Cerebras tratti dall'annuncio; le stime indipendenti variano da circa 7× a 11× a seconda di cosa viene misurato. Aggiungi a quella lista il segnale di velocità del CS-4: il dato di ~1.300 token/s per GPT-5.6 Sol su CS-4 proviene da un singolo post su X e non ha alcuna conferma indipendente. Nessuno di questi è stato ancora verificato in modo indipendente.
Non risolverà un collo di bottiglia che non hai.Se i tuoi agenti sono lenti a causa della tua stessa orchestrazione, della latenza degli strumenti o di prompt ricchi di input, un percorso di output più veloce sposta la coda solo di poco. La scelta del livello — GPT-5.6 Sol a $5 / $30 rispetto a GPT-5.6 Terra a $2 / $12 rispetto a GPT-5.6 Luna a $0.20 / $1.20 — incide ancora sulla tua bolletta più di qualsiasi livello di velocità.
In sintesi. GPT-5.6 Sol Ultrafast è il livello di servizio più veloce che OpenAI abbia mai rilasciato per il suo modello di punta — gli stessi pesi su hardware Cerebras, fino a 14× di throughput e 750 token di output al secondo sul livello annunciato. Il nuovo CS-4 di Cerebras (presentato il 2026-08-18) spingerebbe GPT-5.6 Sol verso ~1,300 token al secondo, ma quella cifra è un singolo post su X non verificato. Al 2026-08-19, Ultrafast è un'anteprima in lista d'attesa senza prezzo pubblico. Se stai cercando un numero su cui basare il budget, la risposta onesta è che non esiste ancora. Il GPT-5.6 Sol standard a $5 / $30 è quello che puoi richiedere oggi, la modalità veloce a $10 / $60 è il livello di velocità acquistabile, e OrcaRouter li inoltra entrambi con un ricarico di $0 sulla tua chiave. Costruisci il routing ora — e quando Ultrafast avrà un prezzo e una data, sarà a un cambio di model-id di distanza.
Finché Ultrafast non avrà un prezzo, il GPT-5.6 Sol completo è disponibile su GPT-5.6 Sol su OrcaRouter a $5 / $30 per milione di token, zero ricarico, pronto per la tua chiave.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
