
GPT-6.1 Sol Ultrafast arriva sulle API, Codex e ChatGPT Work
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
OpenAI sta introducendo la modalità Ultrafast per GPT-6.1 Sol — il livello di servizio più veloce che vende, e la prima volta che il livello Sol quasi-Astra ne ha uno. La mossa colloca GPT-6.1 Sol nella stessa fascia di GPT-6 Astra Ultrafast nell'API, in Codex e in ChatGPT Work, e arriva con un listino prezzi pubblicato anziché una lista d'attesa: 12,00 $ per milione di token di input e 60,00 $ per milione di token di output, esattamente sei volte quanto costa GPT-6.1 Sol standard. La velocità dichiarata sulla confezione è "fino a 8x". La parte interessante è che cosa misura quella frase, e la risposta non è il modello che stai per pagare.
Il changelog per gli sviluppatori riporta la voce datata 8 ottobre: "Aggiunta la modalità Ultrafast per GPT-6.1 Sol nell'API Responses. Usa gpt-6.1-sol con service_tier: "ultrafast" per ridurre il tempo tra i token di output generati. È disponibile per tutti gli utenti dell'API, in base ai limiti di frequenza, con elaborazione globale e residenza dei dati negli Stati Uniti e nell'UE." La pagina della documentazione di Ultrafast ora recita "disponibile in modo ampio per GPT-6 Astra e GPT-6.1 Sol, con accesso in anteprima per GPT-5.6 Sol", e la pagina sulla velocità lato ChatGPT conferma la parte relativa all'abbonamento: Ultrafast è disponibile in Codex e ChatGPT Work con Pro da 500 $ e sui piani Enterprise ed Edu idonei.
Ultrafast è un livello di servizio, non un secondo modello
Nulla nei pesi cambia. Stesso checkpoint, stessa finestra di contesto da 1.050.000 token, stesso input massimo da 922.000 token, stesso tetto di output di 128.000 token, stessa data di cutoff delle conoscenze del 30 aprile 2026, stesse risposte. Quello che stai acquistando è una priorità di pianificazione: il modello genera token più velocemente, e l'impostazione della stessa OpenAI è volutamente ristretta — il livello "riduce il tempo tra i token di output generati". Non rende il modello più intelligente e non accorcia la fase di pensiero.
Quella distinzione è l'intera decisione. Per un ciclo di un agente che effettua quaranta chiamate a strumenti di fila, il vantaggio si accumula perché l'output di ogni turno arriva prima. Per una singola richiesta di ragionamento complessa che passa la maggior parte del suo tempo reale a deliberare, puoi pagare sei volte tanto e guardare lo stesso spinner.
La scala dei livelli, una volta, in parole semplici:
• Batch and Flex — la metà di Standard, la corsia economica per i lavori che nessuno sta aspettando
• Standard — $2,00 input / $0,10 in cache / $2,50 scrittura cache / $10,00 output per milione di token
• Fast — il doppio di Standard, oppure $4,00 / $0,20 / $5,00 / $20,00; il 30 luglio 2026 OpenAI ha rinominato Priority processing in modalità Fast
• Ultrafast — sei volte Standard, oppure $12,00 / $0,60 / $15,00 / $60,00
• Oltre 272K token di input — l'intera richiesta viene ritariffata a 2x le tariffe di input e cache e 1,5x l'output; Ultrafast long-context è $24.00 / $1.20 / $30.00 / $90.00
L'aritmetica che nessuno mette sulla pagina di marketing
Sei volte il prezzo per otto volte la velocità non è un affare in perdita, e non è nemmeno un pranzo gratis. Ultrafast viene fatturato a token, quindi un job che costa 1,00 $ a Standard ne costa 6,00 $ a Ultrafast — e termina in circa un ottavo del tempo. Il risparmio non è nella bolletta, è nel tempo effettivo. Stai pagando cinque dollari in più per eliminare sette ottavi del tempo di coda su quel job, e se questo sia economico o assurdo dipende interamente da quanto vale al minuto la persona o la pipeline che aspetta dall'altra parte.
Ne derivano due implicazioni, e sono quelle che vengono trascurate:
• Il lavoro interattivo è il sì facile. Uno sviluppatore che guarda arrivare un diff, un agente che non può procedere finché non ha letto il risultato — questi sono i casi in cui la latenza è il prodotto. Un output otto volte più veloce su un ciclo di quaranta turni non è un miglioramento marginale per la percezione umana; è la differenza tra uno strumento che usi e uno strumento che mandi in background.
• Il lavoro pianificato e in batch è il no più facile. Se un lavoro ha comunque tempo fino al mattino, Ultrafast è una bolletta 6 volte più alta per niente, e la corsia Batch a metà prezzo è lì che aspetta.
L'input memorizzato nella cache merita un secondo sguardo, perché anche lui si muove: 0,60 $ per milione su Ultrafast contro 0,10 $ su Standard, comunque il 5% della tariffa dell'input non memorizzato nella cache. Gli agenti con prompt in cache che reinviano un grande prompt di sistema a ogni turno scopriranno che lo sconto della cache scala con il livello anziché proteggerli da esso.

Da dove deriva il numero "fino a 8x"
Questa è la parte da leggere con attenzione, perché è qui che il titolo del rollout e il rollout stesso descrivono in sordina cose diverse.
L'unica misurazione di velocità specifica per modello che OpenAI pubblica è questa frase: "GPT-6 Astra Ultrafast genera token fino a 8 volte più velocemente di GPT-6 Astra in modalità Standard in Codex." Si tratta di un dato di Astra, misurato in Codex. Non esiste un multiplo pubblicato equivalente per GPT-6.1 Sol. Il documento che tratta Ultrafast per questo modello dice che riduce il tempo tra i token di output generati e rimanda a una tabella dei prezzi; non fornisce un numero al riguardo. La pagina sulla velocità lato ChatGPT ripete la frase su Astra e si ferma.
Quindi la lettura onesta di "fino a 8 volte più veloce" è: è il titolo di punta del tier, derivato dal modello gemello che è su Ultrafast dal 29 settembre, ed è un'affermazione del fornitore che nessun soggetto indipendente ha riprodotto per nessuno dei due modelli. Può benissimo valere per GPT-6.1 Sol — i due girano sullo stesso stack di servizio e il meccanismo del tier è lo stesso — ma nessuno al di fuori di OpenAI ha pubblicato una misurazione in token al secondo per la variante Sol, e il "fino a" in quella frase fa un lavoro tutt'altro che banale.
Vale anche la pena tenere separati i livelli per modello, perché quello più vecchio è ancora una questione in sospeso. Ultrafast è stato annunciato il 13 agosto 2026 per GPT-5.6 Sol a "fino a 14 volte più veloce dell'elaborazione Standard", in anteprima limitata per clienti selezionati. Tre mesi dopo, la documentazione indica ancora che GPT-5.6 Sol ha "accesso in anteprima" e la tabella dei prezzi di Ultrafast ha esattamente due righe — GPT-6 Astra e GPT-6.1 Sol. Un numero 14x che non ha mai raggiunto la disponibilità generale e non ha una tariffa pubblicata è un'affermazione, non un prodotto.

Chi può davvero accenderlo?
Il lato API è ampio; il lato abbonamenti è ristretto, e la differenza coglie molti di sorpresa.
• API — disponibile per tutti gli utenti API su gpt-6.1-sol, soggetto a limiti di frequenza separati rispetto a Standard e Fast. Ciò significa un secondo budget da tenere d'occhio, non solo un secondo prezzo.
• Limiti di velocità ultrarapidi per GPT-6.1 Sol — 1.000.000 di token al minuto su Build, 4.000.000 su Launch, 40.000.000 su Grow. OpenAI ha semplificato i propri livelli di utilizzo da cinque a tre il 6 ottobre, quindi quei tre nomi sono la scala attuale, non una vecchia denominazione.
• Residenza dei dati — GPT-6.1 Sol supporta la residenza dei dati negli Stati Uniti e nell'UE e l'elaborazione globale, anche in modalità Fast e Ultrafast. L'Ultrafast di Astra non ottiene la residenza nell'UE, quindi se il tuo carico di lavoro è vincolato all'UE, questa è la prima configurazione Ultrafast che puoi acquistare in assoluto.
• Codex and ChatGPT Work — Ultrafast è disponibile con il piano Pro da 500 $ e sui piani Enterprise ed Edu idonei. Gli amministratori Enterprise lo trovano disattivato per impostazione predefinita e devono abilitarlo per utente o per workspace.
• Chat — non incluso. GPT-6.1 Sol stesso risiede in Work e Codex; la superficie Chat per i consumatori non ne fa parte.
• Come viene fatturato con un abbonamento — l'utilizzo incluso viene consumato a 8 volte la tariffa Standard, mentre i crediti acquistati o il pay-as-you-go Enterprise vengono fatturati a 6 volte la tariffa Standard. Vale la pena conoscere entrambi i valori prima di lasciarlo attivato.
Un dettaglio implementativo decide se otterrai anche solo un po' di quella velocità. La guida di OpenAI è schietta al riguardo: usa i WebSocket, "soprattutto per le applicazioni agentiche che effettuano molte chiamate a strumenti in rapida successione", perché "senza una connessione persistente, il sovraccarico di rete può ridurre i guadagni di latenza: se il tuo client apre una nuova connessione HTTP a ogni chiamata, il sovraccarico per richiesta può annullare l'intero vantaggio del tier che hai appena pagato 6 volte tanto". HTTP/S funziona comunque. Solo che potrebbe non valere il tier.
Cosa instradiamo e cosa non instradiamo
Il GPT-6.1 Sol di livello standard è su OrcaRouter come openai/gpt-6.1-sol ai prezzi del provider stesso: 2,00 $ in input e 10,00 $ in output per milione di token, erogato con markup dello 0% — il prezzo di listino del fornitore trasferito tal quale, così quando OpenAI modifica una tariffa la variazione arriva nella tua fattura lo stesso giorno in cui arriva sul listino, anziché al tuo prossimo rinnovo contrattuale. La stessa chiave e lo stesso endpoint servono più di 200 modelli, quindi una chiamata a GPT-6.1 Sol e una a Claude o Qwen stanno dietro un'unica integrazione con failover automatico e senza un secondo contratto, e il DSL di routing comporrà i modelli in un'unica chiamata quando un'attività richiede più di un parere.
Ultrafast non è uno di quei modelli, e sarebbe fuorviante lasciar intendere il contrario. È un flag di livello di servizio su un account OpenAI — invii service_tier: "ultrafast" a gpt-6.1-sol e OpenAI addebita sul tuo account alle tariffe indicate sopra — quindi vive all'interno della tua integrazione diretta con OpenAI. Se lo attivi, mantieni il traffico a livelli sulla chiave del tuo fornitore e instrada il traffico a volume standard attraverso di noi. Questa è la suddivisione onesta, ed è anche quella più economica per tutto ciò che non è in attesa di una persona.

Cosa farne oggi
Se hai una licenza Codex o ChatGPT Work su Pro $500, l'interruttore è già lì e la prova non ti costa nulla se non il moltiplicatore di utilizzo — esegui lo stesso compito in entrambi i modi e vedi se il loop che esegui davvero ha abbastanza turni perché il fattore otto si manifesti. Se sei sull'API, l'esperimento che vale la pena fare è più ristretto di quanto suggerisca l'annuncio: misura quanta parte della tua latenza è generazione di token e quanta è il modello che pensa, poi punta Ultrafast sulla parte che può effettivamente comprimere.
E se hai la scelta tra Fast a 2x e Ultrafast a 6x per la stessa richiesta, Fast è il livello che è arrivato prima e quello il cui comportamento puoi dedurre da un tariffario soltanto. Ultrafast è nuovo per questo modello, non prezzato da alcuna misurazione indipendente, e vale esattamente quanto dice il tuo cronometro.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
