Una scheda del titolo generata che riporta 'GPT-6.1 Sol Context Window' con il sottotitolo '1.050.000 token, la linea dei 922.000 e il precipizio dei 272.000'. Tre pannelli arrotondati si trovano sotto di essa: 1.050.000 con l'etichetta 'finestra di contesto, sulla pagina del fornitore', 922.000 con l'etichetta 'input massimo, nel modulo della documentazione', e 272.000 con l'etichetta 'la linea di input che rimodula il prezzo dell'intera richiesta'. Il logo OrcaRouter compare nell'angolo in basso a destra.
Guides & Insights

Finestra di contesto di GPT-6.1 Sol: 1,050,000 token, la linea dei 922,000 e il precipizio dei 272,000

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La pagina del modello del fornitore per GPT-6.1 Sol, consultata il 7 ottobre 2026, indica una finestra di contesto di 1.050.000 token e un output massimo di 128.000 token. La stessa pagina, nella forma leggibile dalla macchina che si ottiene aggiungendo .md al suo URL, riporta una terza cifra che la pagina renderizzata non stampa mai: un massimo di 922.000 token di input. GPT-6 Sol, il modello a cui 6.1 è stato rilasciato per succedere il 2026-09-29, pubblica la coppia identica di cifre massime sulla propria pagina, e la stessa riga 922.000 nella propria forma markdown. La nostra scheda modello per openai/gpt-6-sol riporta la finestra come 1.050.000 token e il limite di output come 128.000, visualizza il primo di questi come "1M" nella sua striscia specifiche, e stampa "1.1M" per lo stesso modello in una tabella di confronto più in basso nella stessa pagina.

Quindi le pagine sono in disaccordo, e vale la pena essere precisi su come. La striscia delle specifiche renderizzata del fornitore fornisce una finestra e un limite massimo di output e nessun limite massimo di input. La documentazione Markdown del fornitore per lo stesso modello li fornisce tutti e tre. Chi dimensiona una richiesta basandosi sulla pagina renderizzata lavora con un vincolo in meno rispetto a quelli pubblicati dal fornitore, e quello mancante è il numero che decide se una richiesta rientra.

Tre cifre, tre fonti e una sottrazione che nessuno annota

Ecco ogni numero con il documento da cui proviene, tutti letti il 7 ottobre 2026.

• Finestra di contesto di 1.050.000 — la pagina del modello del fornitore per gpt-6.1-sol, nella barra delle specifiche visualizzata e nella sua forma markdown, nonché lo stesso valore nella pagina per gpt-6-sol. È anche ciò che restituisce il nostro catalogo per openai/gpt-6-sol e openai/gpt-6-luna, dove il campo è inserito come 1.050.000 anziché arrotondato.

• 128.000 token di output massimi — la stessa pagina, gli stessi due moduli, per entrambe le generazioni. Il campo della nostra scheda dice 128.000; la sua visualizzazione arrotonda a "128K".

• 922.000 token massimi di input — la forma markdown della pagina del modello gpt-6-sol del fornitore e della sua pagina gpt-6.1-sol. Non è nella striscia renderizzata di nessuna delle due pagine, e non è nel campo del nostro catalogo per il modello, che si ferma alla finestra e al limite di output.

Le tre cifre sono aritmeticamente coerenti tra loro: 922.000 più 128.000 fa esattamente 1.050.000. La guida al ragionamento dello stesso fornitore descrive il meccanismo che rende significativa l'identità senza mai eseguire la somma nella pagina del modello — i token di ragionamento, si legge, «occupano comunque spazio nella finestra di contesto del modello», e se i token generati «raggiungono il limite della finestra di contesto o il valore max_output_tokens che hai impostato», la risposta torna contrassegnata come incompleta. Una finestra condivisa tra ciò che entra e ciò che esce è una finestra in cui il limite massimo dell'input è la finestra meno la riserva di output.

Questa lettura è corroborata, non provata, e vale la pena separare le due. Ciò che è documentato è una finestra di 1.050.000, un tetto di output di 128.000 e un input massimo di 922.000. Ciò che è inferito è quale di questi sia il vincolo che scatta per primo. L'inferenza vale per ogni richiesta che riserva la propria intera quota di output e fallisce per qualsiasi richiesta che non lo faccia — una richiesta con max_output_tokens impostato a 4.000 e 1.046.000 token di input non viene ovviamente rifiutata. Finché il fornitore non scrive la sottrazione nella pagina in cui vivono i numeri, tratta l'abbinamento come la forma del budget piuttosto che come una rigida regola di ammissione, e convalida rispetto all'endpoint di conteggio piuttosto che rispetto a un post di un blog.

Il contesto non è un prezzo: il passo da 272.000 token

Una finestra più grande è una dichiarazione di capacità. Non è una dichiarazione di costo, e in questa famiglia le due cose si separano a una linea documentata. La pagina dei prezzi del fornitore enuncia la regola in una frase: i prompt con più di 272K token di input sono prezzati a 2x le tariffe di input e cache e a 1,5x l'output per l'intera richiesta. La definizione delle sue due colonne data dalla stessa pagina è "Contesto breve: ≤272K token di input. Contesto lungo: >272K token di input."

Leggi la parola pieno con attenzione. Il livello non tassa i token oltre la linea — rimodula il prezzo di tutto, incluso il primo token. E non è una modifica della 6.1: la stessa regola, con la stessa soglia, si applica a GPT-6 Sol, motivo per cui il salto va attribuito al livello e non al rilascio.

Esegui un singolo lavoro a contesto lungo passando per entrambe le parti, secondo le tariffe pubblicate di GPT-6.1 Sol, con il prefisso già presente in cache, così che il costo di scrittura in cache non inquini il confronto:

• 240.000 token di input (200.000 in cache, 40.000 nuovi), 6.000 di output — input nuovi 40.000 a $2,00 per milione è $0,080; input in cache 200.000 a $0,10 è $0,020; output 6.000 a $10,00 è $0,060. Totale, $0,160.

• 300.000 token di input (260.000 in cache, 40.000 freschi), 6.000 di output — la richiesta ora è oltre la soglia, quindi ogni tariffa cambia: input fresco 40.000 a $4,00 è $0,160; input in cache 260.000 a $0,20 è $0,052; output 6.000 a $15,00 è $0,090. Totale, $0,302.

Il 25% in più di token di input fa lievitare la fattura dell'89%. Esegui la stessa coppia su GPT-6 Sol e la forma regge con una pendenza più ripida — $0,180 sotto la linea rispetto a $0,354 sopra di essa, perché la tariffa in cache della scheda più vecchia, pari a $0,20, si colloca nello stesso punto in cui si trova la tariffa in cache per contesto lungo della 6.1. L'attraversamento è un gradino, non una pendenza, e il modo più economico per vederlo è superarlo di un soffio. Una richiesta da 271.000 token completamente non in cache con 1.000 token di output costa $0,552; a 273.000 costa $1,107. Sette decimi di punto percentuale in più di token di input, 2,01 volte la spesa. Togli 2.000 token da quella richiesta e la fattura scende da $1,107 a $0,552 — meno dell'1% dell'input per metà del costo.

Nulla in questa sezione riguarda il fatto che la finestra di GPT-6.1 Sol sia ampia. Riguarda il fatto che la finestra sia abbastanza ampia da raggiungere un confine che costa più di quanto la dimensione della finestra possa comprare.

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol - the scoreboard'. Both columns carry the same six rows. GPT-6.1 Sol reads: context window 1,050,000 tokens; max input 922,000 tokens (docs form); max output 128,000 tokens; input price $2.00 / $4.00 per M; cached input $0.10 / $0.20 per M; output price $10.00 / $15.00 per M. GPT-6 Sol reads the same on every row except cached input, which is $0.20 / $0.20 per M. A footer line credits OpenAI's model and pricing docs read Oct 7 2026 and explains that the second figure in each price row is the long-context rate above 272,000 input tokens. The OrcaRouter logo appears in the bottom-right corner.

Che cosa riempie davvero 1.050.000 token

Un budget di contesto è composto da sei elementi, e non sono ugualmente memorizzabili nella cache. Quote approssimative di una richiesta agentica illustrativa da 240.000 token; le proporzioni sono nostre, le regole di cacheability sono del fornitore, dalla sua guida al prompt caching consultata lo stesso giorno.

• Contenuto di sistema e formattazione delle richieste iniettati dal provider — visualizzati prima dei tuoi messaggi, fatturati come input ed esplicitamente esclusi dalla lunghezza minima memorizzabile in cache. Non tocca a te controllarli, né ridurli.

• Le tue istruzioni per sviluppatori e di sistema, circa 6.000 token. Memorizzabile nella cache. Questa è la parte iniziale del prefisso, quindi una modifica qui invalida tutto ciò che segue.

• Definizioni e schemi degli strumenti, circa 14.000 token per la superficie degli strumenti ospitati più le tue funzioni. Memorizzabile in cache, e la parte più fragile del prefisso: la guida elenca nomi degli strumenti, descrizioni, schemi, ordinamento e istruzioni specifiche degli strumenti come elementi che spostano il confine del prefisso.

• Il corpus recuperato, circa 180.000 token. Memorizzabile in cache e, di gran lunga, la riga più grande. Vale la pena metterlo in cache solo se è stabile a livello di byte tra una chiamata e l'altra — un corpus riassemblato a ogni richiesta è un corpus a prezzo pieno.

• La trascrizione accumulata — turni precedenti e risultati degli strumenti — circa 30.000 token e in aumento. Memorizzabile nella cache fino alla modifica più recente; il risultato dello strumento arrivato in questo turno è input nuovo alla tariffa piena.

• Token di ragionamento — generati, mai memorizzati nella cache, fatturati come output. Consumano la finestra e sono invisibili nel corpo della risposta.

Due note operative discendono direttamente da quell’elenco. Primo, le voci di cache sono conservate su singole macchine: la guida afferma che una richiesta può riutilizzare un prefisso «solo se raggiunge una macchina che contiene una voce corrispondente non scaduta», e che l’instradamento di overflow inizia oltre circa 15 richieste al minuto. Un prefisso stabile nel tuo codice può comunque mancare in produzione. Secondo, il prefisso minimo memorizzabile in cache è di 1.024 token di input visibili, e i token di sistema nascosti non concorrono a raggiungerlo — quindi un piccolo prompt di sistema non è un prefisso memorizzabile in cache, indipendentemente da quanto sia grande la richiesta che lo circonda.

Il tetto di output è un budget separato, non una seconda porzione.

128.000 token di output massimi non significa 128.000 token di risposta. La guida al ragionamento è esplicita sul fatto che max_output_tokens limita il totale generato dal modello, «inclusi i token di ragionamento, i token di output visibili e i token di formattazione non visibili», e che i token di ragionamento vengono fatturati come output pur occupando spazio nella finestra.

Ciò rende il troncamento una decisione progettuale anziché un caso limite, per il modo in cui fallisce. Quando la generazione raggiunge il limite, la risposta viene restituita con stato incomplete e motivo max_output_tokens — e la guida avverte che ciò «potrebbe verificarsi prima che venga prodotto qualsiasi token di output visibile, il che significa che potresti incorrere in costi per token di input e di ragionamento senza ricevere una risposta visibile». Un budget che spende l'intera finestra sull'input e lascia al caso la riserva per l'output è un budget che può fatturare una richiesta completa a contesto lungo e non restituire nulla che un chiamante possa analizzare. La raccomandazione iniziale dello stesso fornitore è di riservare almeno 25.000 token per il ragionamento e gli output mentre stai ancora misurando ciò di cui un prompt ha effettivamente bisogno.

GPT-6.1 Sol affina questo, ed è una delle poche voci realmente specifiche di 6.1 nel rilascio. La sua scala di impegno di ragionamento prevede low, medium, high, xhigh e max, e le impostazioni none e minimal non sono supportate. GPT-6 Sol le accetta tutte e sei. Non esiste quindi alcuna impostazione su 6.1 che disattivi la spesa di ragionamento, l'impostazione predefinita è medium, e il lato output del budget non è mai gratuito.

Il dimezzamento dell'input in cache, letto dove la finestra è più ampia

L'unica tariffa sulla scheda GPT-6.1 Sol che è cambiata rispetto a GPT-6 Sol è quella dell'input in cache: scesa da $0,20 a $0,10 per milione di token, che la pagina del modello esprime come 5% della tariffa dell'input non in cache, e che la guida alla cache del fornitore indica esplicitamente come il caso 0,05x rispetto allo 0,1x applicato in lettura dalla maggior parte dei modelli GPT-5.6 e successivi. L'input, le scritture in cache e l'output sono identici su entrambe le schede, e anche i moltiplicatori per il contesto lungo sono identici.

Per esattamente il carico di lavoro di cui parla questa pagina, quello è il contatore che è stato giusto spostare, e il motivo è la composizione di una richiesta lunga piuttosto che la sua dimensione. Nel processo da 300.000 token sopra, 260.000 dei token di input sono un prefisso in cache — l'87 per cento di tutto ciò che la richiesta invia. La voce in cache è quindi il più grande contatore di input singolo nella fattura, che è la proprietà generale del lavoro a contesto lungo: più lunga è la finestra che usi, maggiore è la parte di essa che è un prefisso che hai già inviato. Dimezzare quel contatore vale 0,052 $ su quella richiesta.

E la discontinuità riprende più di quanto il dimezzamento conceda, sulla stessa richiesta. Prezzato alle tariffe di contesto breve che avrebbe pagato sotto la linea, lo stesso lavoro da 300.000 token su GPT-6.1 Sol costerebbe $0,166 invece di $0,302 — un costo di attraversamento di $0,136, ossia circa 2,6 volte quanto vale l'unico contatore modificato della release. Sopra la linea la tariffa in cache segna $0,20, che non è un numero nuovo per questa famiglia: è il doppio del prezzo principale sulla scheda 6.1 ed esattamente ciò che GPT-6 Sol faceva pagare per una lettura in cache sotto la linea prima di questa release. Un carico di lavoro in cache a contesto lungo incassa la variazione del prezzo principale e poi la restituisce al confine, e il confine — non il modello — è la causa.

A screenshot of the machine-readable markdown form of OpenAI's GPT-6.1 Sol model documentation, captured October 7 2026, showing the Model details block with the three figures on consecutive lines — 1,050,000 context window, Maximum input tokens: 922,000, and 128,000 max output tokens — above the Text tokens pricing table listing Input $2, Cached input $0.1, Cache writes $2.5 and Output $10 per 1M tokens, the note that cached input tokens are priced at 5% of the uncached input rate, and the sentence 'Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request.'

Come dimensionare un budget di contesto

Come procedura, nell'ordine in cui i vincoli si applicano:

• Conta la richiesta, non stimarla. Invia il payload esatto — strumenti, immagini, file e tutto il resto — all'endpoint di conteggio dei token di input della Responses API. La guida è schietta sul perché: il conteggio include token di formattazione per i ruoli dei messaggi e i confini che non compaiono mai nel testo che puoi tokenizzare localmente, e le stime locali come "caratteri diviso quattro" sono imprecise per immagini, file e schemi.

• Riserva prima la parte di output. Scegli max_output_tokens ricordando che copre insieme ragionamento, output visibile e formattazione, e parti dal buffer di 25.000 token del fornitore anziché da zero. Il tuo budget di input è la finestra meno quella prenotazione, e il valore novecentoventidue è la versione del fornitore della stessa sottrazione.

• Prezza la richiesta su entrambi i lati di 272.000 prima di inviarla. Il passo è abbastanza ampio che una richiesta pensata per cadere appena sotto la soglia e una richiesta pensata per cadere appena sopra sono prodotti diversi.

• Ordina il prefisso in base alla stabilità.Istruzioni, poi gli schemi degli strumenti, poi il corpus, poi la trascrizione. Qualsiasi cosa cambi tra una chiamata e l'altra appartiene alla fine, dove fa perdere una corrispondenza del prefisso anziché l'intera cache.

• Supera 1.024 token di input visibili prima di aspettarti una cache. Al di sotto di quella soglia minima nulla viene messo in cache, e i token nascosti del provider non contano ai fini di tale soglia.

• Verifica che il riutilizzo sia plausibile. Un prefisso deve essere riutilizzato entro la durata di 30 minuti della cache e deve arrivare sulla macchina che detiene la voce; entrambi sono descritti nella guida e nessuno dei due è una proprietà del tuo codice.

• Misura di nuovo dopo qualsiasi modifica al modello o alle impostazioni.Passare a GPT-6.1 Sol elimina la posizione con reasoning disattivato, il che modifica il conteggio dei token di reasoning e quindi il lato output del budget — e una modifica all'effort di reasoning, agli strumenti, allo schema di output strutturato o alla gestione del contesto può anche spostare un confine di prefisso e farti perdere del tutto la tariffa in cache.

• Decidi cosa succede quando il job non si riduce ulteriormente. La compaction è la via di fuga documentata: una richiesta Responses può impostare context_management con una soglia di compaction, e il server sostituisce il contenuto precedente della conversazione con un elemento di compaction opaco che porta avanti lo stato chiave in meno token. È una decisione di budget più che una semplice riduzione gratuita, perché la guida osserva che la compaction "può impedire il riutilizzo dal primo token modificato in poi" — un passaggio di compaction invalida il prefisso che lo precede.

A screenshot of the OrcaRouter model page at www.orcarouter.ai/models/openai/gpt-6-sol, captured October 7 2026, showing the OrcaRouter nav bar, the breadcrumb Home -> Models -> OpenAI, the model identifier openai/gpt-6-sol attributed to OpenAI with the date 2026-09-22, the Vision, Tools, JSON and Reasoning capability badges, the spec tiles reading Max output 128K, input text + image + file, output text and a p50 TTFT of 1.44 s, the description stating a 1.05M-token context, and the /v1/chat/completions rate row of $2.00 in and $10.00 out per 1M tokens.

L'aritmetica su questa pagina parte dalla generazione che GPT-6.1 Sol sostituisce, e quel gradino è quello che si può effettivamente chiamare oggi: la nostra scheda per openai/gpt-6-sol riporta una finestra di contesto di 1.050.000 token con 128.000 token di output massimo alle tariffe di listino di OpenAI con 0% di ricarico — il prezzo del fornitore è il prezzo sulla pagina, e un movimento del fornitore arriva lì lo stesso giorno, non al rinnovo. La nostra scheda non ha un campo proprio per l'input massimo, quindi il valore di 922.000 token per quel modello deve provenire dalla documentazione del fornitore stesso, che è quella che questa pagina ha usato in tutto il testo. Ciò per cui la scheda è utile è il dimensionamento: la finestra e il tetto di output che essa pubblica sono i due numeri che la procedura di budget di cui sopra sottrae l'uno dall'altro, e il gradino inferiore è quello su cui puoi davvero eseguire quella procedura mentre 6.1 è ancora nuovo. Si trova su https://www.orcarouter.ai/models/openai/gpt-6-sol.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno