
GPT-6.1 Ultrafast vs GPT-6.1 Sol: tre lavori, un verdetto ciascuno
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Chiediti se GPT-6.1 Ultrafast valga sei volte il prezzo di GPT-6.1 Sol e la risposta onesta è che due dei tuoi tre carichi di lavoro dovrebbero restare esattamente dove sono. L'agente di codifica interattivo dovrebbe spostarsi. Lo sweep di valutazione notturno no, e neanche il riepilogatore batch, e il motivo non è che il livello sia troppo caro — è che non hanno mai comprato quello che vende. GPT-6.1 Sol è stato rilasciato il 29 settembre 2026 e Ultrafast è arrivato come modalità su di esso l'8 ottobre 2026: stesso checkpoint, stessa finestra di contesto da 1.050.000 token, stesso tetto di output da 128.000 token, stessa data limite delle conoscenze del 30 aprile 2026, stesse risposte, a $12,00 per milione di token in input e $60,00 per milione in output contro $2,00 e $10,00. Un livello di velocità è l'acquisto di tempo effettivo, e il tempo effettivo vale denaro solo per un lavoro su cui qualcuno è in attesa.
Quella riformulazione è l'intero articolo. Il resto è l'aritmetica che ti dice quale dei tuoi è quello che aspetta, e i due costi che si accompagnano al multiplo, che tu li abbia previsti o no.
Ciò che effettivamente cambia: un campo della richiesta e una fattura
Non esiste alcun checkpoint Ultrafast, nessun limite di contesto separato, nessun knowledge cutoff alternativo e nulla da fissare. Invii lo stesso identificatore di modello con un campo service-tier impostato, e OpenAI pianifica la richiesta diversamente; invialo senza il campo e sei su Standard. Tutto ciò contro cui uno sviluppatore scrive codice è identico, e vale la pena essere meccanici riguardo all'elenco, perché la lunghezza dell'elenco è l'argomento.
• ID modello — lo stesso identificatore su entrambi, un unico snapshot predefinito, nulla di datato da fissare.
• Contesto — una finestra di 1.050.000 token, input massimo di 922.000 token e output massimo di 128.000 token su entrambi.
• Scala di ragionamento — basso, medio (predefinito), alto, xhigh e max su entrambi, con nessuno e minimo non supportati su entrambi.
• Superficie degli strumenti — ricerca web, ricerca file, generazione di immagini, interprete di codice, shell ospitata, apply patch, competenze, utilizzo del computer, MCP e ricerca strumenti, tramite l'API Responses, su entrambi.
• Prezzo — $2.00 input / $0.10 in cache / $2.50 scrittura cache / $10.00 output per milione di token su Standard, rispetto a $12.00 / $0.60 / $15.00 / $60.00 su Ultrafast.
• Oltre 272.000 token di input — l'intera richiesta viene riprezzata al doppio per le tariffe di input e cache e a 1,5x per l'output su entrambe, il che porta Ultrafast long-context a $24,00 / $1,20 / $30,00 / $90,00.
• Velocità — Standard è la base per definizione; Ultrafast è il gradino più alto, e l'unico multiplo specifico del modello che OpenAI pubblica appartiene a GPT-6 Astra, non a questo modello.
Quell'ultima riga è l'avvertenza che sta alla base di tutto il resto, e ha una sua sezione più avanti. Prima, i lavori.
Lavoro uno: l'agente interattivo. Questo è quello che si muove.
Un ciclo di agente che effettua quaranta chiamate a strumenti di fila è il cliente per cui è stato creato questo livello, perché il tempo di generazione di ogni turno condiziona il turno successivo, e l'utente sta guardando. Prendi una sessione che invia 30.000 token di input e riceve 1.500 token di output per turno su 40 turni — 1.200.000 token di input e 60.000 token di output in totale, ogni richiesta ben al di sotto della soglia di riprezzatura di 272.000 token.
• Standard — 1,2 milioni di token di input a $2,00 sono $2,40; 60.000 token di output a $10,00 sono $0,60. Tre dollari per l'esecuzione.
• Ultrafast — 1,2 milioni di token di input a $12,00 sono $14,40; 60.000 token di output a $60,00 sono $3,60. Diciotto dollari per l'esecuzione.
• Il delta — $15,00 per rimuovere gran parte della latenza di generazione da un job il cui output è per il resto identico.
Se $15,00 sia economico è una questione di minuti, non di token. Se la sessione richiede venti minuti su Standard e quattro minuti su Ultrafast, hai comprato sedici minuti per quindici dollari — circa $0,94 al minuto — e il confronto che conta è con quanto ti sono costati quei sedici minuti. Uno sviluppatore a costo aziendale pieno vale più di un dollaro al minuto, quindi per il caso human-in-the-loop non c'è partita. Un agente in attesa in una coda di revisione umana non vale nulla al minuto, e lì quegli stessi sedici minuti sono sedici minuti gratis e il piano è uno spreco.
Questo è il test da applicare, e non ha nulla a che fare con il modello. Sull’orologio di chi ricade il tempo di generazione, e quanto vale quell’orologio? Se la risposta è «quello di una persona, e tanto», Ultrafast è la voce più economica sulla tua fattura. Se la risposta è «quello di uno scheduler, e niente», è la più costosa.

Lavoro due: la scansione di valutazione notturna. Questo è un no
Uno sweep di valutazione esegue qualche migliaio di prompt attraverso il modello, scrive i risultati nell'archivio oggetti e una persona legge la tabella al mattino. Il suo budget di latenza non si misura in minuti, ma in una notte. Nulla nella pipeline attende il modello tranne la richiesta successiva in coda.
Ultrafast non elimina il costo in tempo reale dello sweep, perché il costo in tempo reale dello sweep è una decisione di pianificazione che hai preso tu, non un problema di latenza che hai. Quello che fa è sestuplicare la fattura e spostare il job su un budget con i propri limiti di frequenza per organizzazione — il che è un rischio reale in un batch non presidiato, perché un tetto di frequenza è esattamente la modalità di errore che un grande sweep incontra, e la pagina del tier non pubblica il numero.
E c'è una linea sullo stesso listino prezzi che ha un prezzo per questo lavoro e un prezzo nella direzione opposta. Batch e Flex costano la metà di Standard, e l'elaborazione Batch dell'API è progettata esattamente per questa forma: grandi volumi, nessuna scadenza interattiva, risultati restituiti in modo asincrono. Sui numeri sopra, lo stesso totale di token da 40 turni costa $1,50 su Batch contro $18,00 su Ultrafast. È un differenziale di 12 volte per un lavoro che non può distinguere la differenza.
L'errore da evitare è considerare Ultrafast l'upgrade generico. È la cima di una scala — Batch e Flex a metà, Standard a uno, Fast a due, Ultrafast a sei — e una scala non è un menu di versioni migliori. Scegliere il piolo sbagliato costa più soldi che scegliere il modello sbagliato.
Lavoro tre: il riassuntore in batch. Anche questo un no, per un motivo diverso.
Supponiamo che il carico di lavoro sia un passaggio notturno su un archivio di documenti: input lunghi, output brevi, nessun essere umano nel ciclo e un SLA misurato in ore. È qui che la composizione dei token si ritorce contro Ultrafast anziché a suo favore.
La soglia di 272.000 token è il motivo. Su entrambi i livelli, una singola richiesta che la supera riprezza l'intera richiesta — ogni token di input, ogni lettura in cache, ogni token di output — al doppio delle tariffe di input e cache e a 1,5 volte quelle di output. Long-context Ultrafast costa quindi $24,00 per milione di token di input e $90,00 per milione di token di output, e la riprezzatura è attivata dalla richiesta, non dalla porzione che supera la soglia. Un riassuntore di documenti che occasionalmente invia una richiesta a 300.000 token di input paga la tariffa long-context su tutti e 300.000.
Il comportamento della cache lo amplifica. Le letture in cache sono i token meno costosi su questo modello e la leva di costo più efficace, e scalano con il livello invece di assorbirlo — $0,10 per milione di token di input in cache su Standard, $0,60 su Ultrafast, entrambi al 5% della tariffa di input non in cache. Non esiste una combinazione di token in cache e token freschi che attenui il moltiplicatore, quindi una pipeline in cache fortemente ottimizzata non ottiene uno sconto dalla corsia veloce. Paga semplicemente sei volte un numero più piccolo.
Metti insieme le due cose e il riassuntore è il caso in cui il sovrapprezzo di Ultrafast è il più grande in termini assoluti e il suo beneficio è il più piccolo. Se i documenti sono davvero lunghi e la scadenza è davvero di ore, la configurazione corretta è Batch o Standard standard, e l'uso corretto di Ultrafast è il ciclo a metà sviluppo, in cui si itera sul prompt e una persona attende ogni revisione.
I due costi che arrivano con il multiplo
La tariffa sei volte è la parte visibile del prezzo. Due parti invisibili contano di più in produzione.
Il primo è il budget dei limiti di frequenza. Ultrafast funziona con limiti propri, separati dai budget Standard e Fast, e OpenAI li imposta per organizzazione anziché pubblicarli sulla pagina dei livelli; la raccomandazione è di controllare i limiti della propria organizzazione prima di aumentare il traffico e di contattare un team account se occorre aumentarli. Quindi passare un carico di lavoro a Ultrafast fa due cose contemporaneamente: moltiplica la fattura e sposta il carico su un tetto che potresti non riuscire a leggere. Per un agente non presidiato, il tetto vincola per primo.
Il secondo è la forma del risparmio. Ultrafast riduce il tempo inter-token, non il tempo al primo token e non la fase di deliberazione. Una richiesta che passa la maggior parte del suo tempo reale a pensare prima di emettere qualsiasi cosa può essere passata a Ultrafast e sembrare comunque lenta, perché il livello accelera la parte della richiesta che non è mai stata il collo di bottiglia. Questa è la modalità di errore che produce rapporti del tipo "abbiamo pagato sei volte e la velocità è la stessa": si sta misurando un'applicazione la cui latenza vive in un punto che il livello non raggiunge. Prima di impegnarsi, misurare dove vanno effettivamente i secondi — tempo al primo token contro tempo inter-token — perché il livello ne possiede solo uno.
Perché «più veloce» non è ancora un numero su cui puoi prendere OpenAI in parola.
Ultrafast viene venduto come "fino a 8x", ma la misurazione alla base di questa affermazione appartiene a un modello diverso. La frase pubblicata riguarda GPT-6 Astra Ultrafast che genera token fino a 8 volte più velocemente rispetto a GPT-6 Astra in modalità Standard in Codex. Non esiste un moltiplicatore pubblicato equivalente per GPT-6.1 Sol, e nessuna parte indipendente ha pubblicato una cifra di token al secondo nemmeno per la variante Sol. La documentazione per questo livello lo descrive come una riduzione del tempo tra i token di output generati e rimanda a un listino prezzi.
È un prior ragionevole che il moltiplicatore regga — entrambi i modelli poggiano sullo stesso stack di serving e il meccanismo del livello è lo stesso —, ma "fino a" in quella frase ha un peso concreto, e un tetto del fornitore misurato su un modello affine in un client diverso non è il numero che il tuo carico di lavoro vedrà. Lo stesso vale per il gradino più vecchio: Ultrafast su GPT-5.6 Sol è stato annunciato in agosto 2026 a "fino a 14 volte più veloce di Standard processing" in anteprima limitata, e la documentazione parla ancora di accesso in anteprima con la tabella delle tariffe Ultrafast che contiene esattamente due righe.
Ciò che puoi pretendere da OpenAI è il prezzo, perché il prezzo è pubblicato e si applica a ogni token. Il che significa che la decisione di cui tratta questa pagina riguarda il tuo budget di latenza, non la dichiarazione di velocità del fornitore.

Testarlo senza eseguire il commit e tornare indietro
Il livello è disponibile per tutti gli utenti API, quindi il modo economico per rispondere alla questione del tempo reale è eseguire due volte lo stesso set di prompt con il campo attivo e disattivato e confrontare i conteggi dei token e le tempistiche. Due cose da tenere d'occhio in quel test: se le tue richieste superano la soglia dei 272.000 token e se il tempo al primo token domina il tempo inter-token. Ognuna delle due può far sembrare la prova un risultato nullo quando il livello funziona esattamente come pubblicizzato.
Tornare indietro è un campo della richiesta, non una migrazione, e il canale standard viene servito alla tariffa di listino del fornitore tramite OrcaRouter come openai/gpt-6.1-sol — 2,00 $ per milione di token in input e 10,00 $ per milione di token in output, con markup dello 0% e il prezzo del provider trasferito tal quale, così un riprezzamento del fornitore è attivo dalla nostra parte lo stesso giorno. Ultrafast in sé non è qualcosa che vendiamo; è un flag di livello di servizio fatturato sul tuo account OpenAI, e dirlo è più utile che lasciar intendere il contrario. Ciò che una singola chiave acquista è il canale standard più il resto del catalogo dietro un unico endpoint compatibile con OpenAI, e failover automatico tra provider, che vale la pena avere se stai per mettere un livello costoso davanti a un agente di produzione e vuoi che il canale standard sia una decisione di routing anziché una modifica al codice.

Una nota pratica sulla corsia veloce che non si applica a quella economica: i WebSocket. OpenAI consiglia una connessione WebSocket persistente per Ultrafast, che è la forma giusta per un agente che effettua molte chiamate sequenziali e la forma sbagliata per uno script batch con una richiesta per processo. Se il tuo client è del secondo tipo, il trasporto consigliato dal tier stesso è un'altra ragione per cui il lavoro notturno appartiene altrove.
Quando il verdetto cambia
Tre sviluppi sposterebbero i lavori dalla lista dei "da tenere". Un limite di frequenza Ultrafast pubblicato per GPT-6.1 Sol eliminerebbe il rischio di tetto massimo nel caso batch. Una misurazione di velocità pubblicata o riprodotta in modo indipendente per il livello Sol permetterebbe di preventivare il risparmio di tempo effettivo invece di presumerlo. E un gradino di sconto sulla corsia rapida — un equivalente Ultrafast di Batch, in cui il livello è ancora veloce ma non costa sei volte tanto — cambierebbe l'economia di ogni lavoro nel mezzo della scala.
Nessuno di quelli esiste oggi. Ciò che esiste è un livello che è esattamente ciò che dice di essere: lo stesso GPT-6.1 Sol, pianificato diversamente, a sei volte il prezzo su ogni riga. Sposta l'agente interattivo, lascia stare gli altri due e misura dove vanno davvero i tuoi secondi prima di decidere quale sia il tuo.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
