
Finestra di contesto di GPT-6.1 Sol: 1,050,000 token, la linea dei 922,000 e il precipizio dei 272,000
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
La pagina del modello del fornitore per GPT-6.1 Sol, consultata il 7 ottobre 2026, indica una finestra di contesto di 1.050.000 token e un output massimo di 128.000 token. La stessa pagina, nella forma leggibile dalla macchina che si ottiene aggiungendo .md al suo URL, riporta una terza cifra che la pagina renderizzata non stampa mai: un massimo di 922.000 token di input. GPT-6 Sol, il modello a cui 6.1 è stato rilasciato per succedere il 2026-09-29, pubblica la coppia identica di cifre massime sulla propria pagina, e la stessa riga 922.000 nella propria forma markdown. La nostra scheda modello per openai/gpt-6-sol riporta la finestra come 1.050.000 token e il limite di output come 128.000, visualizza il primo di questi come "1M" nella sua striscia specifiche, e stampa "1.1M" per lo stesso modello in una tabella di confronto più in basso nella stessa pagina.
Quindi le pagine sono in disaccordo, e vale la pena essere precisi su come. La striscia delle specifiche renderizzata del fornitore fornisce una finestra e un limite massimo di output e nessun limite massimo di input. La documentazione Markdown del fornitore per lo stesso modello li fornisce tutti e tre. Chi dimensiona una richiesta basandosi sulla pagina renderizzata lavora con un vincolo in meno rispetto a quelli pubblicati dal fornitore, e quello mancante è il numero che decide se una richiesta rientra.
Tre cifre, tre fonti e una sottrazione che nessuno annota
Ecco ogni numero con il documento da cui proviene, tutti letti il 7 ottobre 2026.
• Finestra di contesto di 1.050.000 — la pagina del modello del fornitore per gpt-6.1-sol, nella barra delle specifiche visualizzata e nella sua forma markdown, nonché lo stesso valore nella pagina per gpt-6-sol. È anche ciò che restituisce il nostro catalogo per openai/gpt-6-sol e openai/gpt-6-luna, dove il campo è inserito come 1.050.000 anziché arrotondato.
• 128.000 token di output massimi — la stessa pagina, gli stessi due moduli, per entrambe le generazioni. Il campo della nostra scheda dice 128.000; la sua visualizzazione arrotonda a "128K".
• 922.000 token massimi di input — la forma markdown della pagina del modello gpt-6-sol del fornitore e della sua pagina gpt-6.1-sol. Non è nella striscia renderizzata di nessuna delle due pagine, e non è nel campo del nostro catalogo per il modello, che si ferma alla finestra e al limite di output.
Le tre cifre sono aritmeticamente coerenti tra loro: 922.000 più 128.000 fa esattamente 1.050.000. La guida al ragionamento dello stesso fornitore descrive il meccanismo che rende significativa l'identità senza mai eseguire la somma nella pagina del modello — i token di ragionamento, si legge, «occupano comunque spazio nella finestra di contesto del modello», e se i token generati «raggiungono il limite della finestra di contesto o il valore max_output_tokens che hai impostato», la risposta torna contrassegnata come incompleta. Una finestra condivisa tra ciò che entra e ciò che esce è una finestra in cui il limite massimo dell'input è la finestra meno la riserva di output.
Questa lettura è corroborata, non provata, e vale la pena separare le due. Ciò che è documentato è una finestra di 1.050.000, un tetto di output di 128.000 e un input massimo di 922.000. Ciò che è inferito è quale di questi sia il vincolo che scatta per primo. L'inferenza vale per ogni richiesta che riserva la propria intera quota di output e fallisce per qualsiasi richiesta che non lo faccia — una richiesta con max_output_tokens impostato a 4.000 e 1.046.000 token di input non viene ovviamente rifiutata. Finché il fornitore non scrive la sottrazione nella pagina in cui vivono i numeri, tratta l'abbinamento come la forma del budget piuttosto che come una rigida regola di ammissione, e convalida rispetto all'endpoint di conteggio piuttosto che rispetto a un post di un blog.
Il contesto non è un prezzo: il passo da 272.000 token
Una finestra più grande è una dichiarazione di capacità. Non è una dichiarazione di costo, e in questa famiglia le due cose si separano a una linea documentata. La pagina dei prezzi del fornitore enuncia la regola in una frase: i prompt con più di 272K token di input sono prezzati a 2x le tariffe di input e cache e a 1,5x l'output per l'intera richiesta. La definizione delle sue due colonne data dalla stessa pagina è "Contesto breve: ≤272K token di input. Contesto lungo: >272K token di input."
Leggi la parola pieno con attenzione. Il livello non tassa i token oltre la linea — rimodula il prezzo di tutto, incluso il primo token. E non è una modifica della 6.1: la stessa regola, con la stessa soglia, si applica a GPT-6 Sol, motivo per cui il salto va attribuito al livello e non al rilascio.
Esegui un singolo lavoro a contesto lungo passando per entrambe le parti, secondo le tariffe pubblicate di GPT-6.1 Sol, con il prefisso già presente in cache, così che il costo di scrittura in cache non inquini il confronto:
• 240.000 token di input (200.000 in cache, 40.000 nuovi), 6.000 di output — input nuovi 40.000 a $2,00 per milione è $0,080; input in cache 200.000 a $0,10 è $0,020; output 6.000 a $10,00 è $0,060. Totale, $0,160.
• 300.000 token di input (260.000 in cache, 40.000 freschi), 6.000 di output — la richiesta ora è oltre la soglia, quindi ogni tariffa cambia: input fresco 40.000 a $4,00 è $0,160; input in cache 260.000 a $0,20 è $0,052; output 6.000 a $15,00 è $0,090. Totale, $0,302.
Il 25% in più di token di input fa lievitare la fattura dell'89%. Esegui la stessa coppia su GPT-6 Sol e la forma regge con una pendenza più ripida — $0,180 sotto la linea rispetto a $0,354 sopra di essa, perché la tariffa in cache della scheda più vecchia, pari a $0,20, si colloca nello stesso punto in cui si trova la tariffa in cache per contesto lungo della 6.1. L'attraversamento è un gradino, non una pendenza, e il modo più economico per vederlo è superarlo di un soffio. Una richiesta da 271.000 token completamente non in cache con 1.000 token di output costa $0,552; a 273.000 costa $1,107. Sette decimi di punto percentuale in più di token di input, 2,01 volte la spesa. Togli 2.000 token da quella richiesta e la fattura scende da $1,107 a $0,552 — meno dell'1% dell'input per metà del costo.
Nulla in questa sezione riguarda il fatto che la finestra di GPT-6.1 Sol sia ampia. Riguarda il fatto che la finestra sia abbastanza ampia da raggiungere un confine che costa più di quanto la dimensione della finestra possa comprare.

Che cosa riempie davvero 1.050.000 token
Un budget di contesto è composto da sei elementi, e non sono ugualmente memorizzabili nella cache. Quote approssimative di una richiesta agentica illustrativa da 240.000 token; le proporzioni sono nostre, le regole di cacheability sono del fornitore, dalla sua guida al prompt caching consultata lo stesso giorno.
• Contenuto di sistema e formattazione delle richieste iniettati dal provider — visualizzati prima dei tuoi messaggi, fatturati come input ed esplicitamente esclusi dalla lunghezza minima memorizzabile in cache. Non tocca a te controllarli, né ridurli.
• Le tue istruzioni per sviluppatori e di sistema, circa 6.000 token. Memorizzabile nella cache. Questa è la parte iniziale del prefisso, quindi una modifica qui invalida tutto ciò che segue.
• Definizioni e schemi degli strumenti, circa 14.000 token per la superficie degli strumenti ospitati più le tue funzioni. Memorizzabile in cache, e la parte più fragile del prefisso: la guida elenca nomi degli strumenti, descrizioni, schemi, ordinamento e istruzioni specifiche degli strumenti come elementi che spostano il confine del prefisso.
• Il corpus recuperato, circa 180.000 token. Memorizzabile in cache e, di gran lunga, la riga più grande. Vale la pena metterlo in cache solo se è stabile a livello di byte tra una chiamata e l'altra — un corpus riassemblato a ogni richiesta è un corpus a prezzo pieno.
• La trascrizione accumulata — turni precedenti e risultati degli strumenti — circa 30.000 token e in aumento. Memorizzabile nella cache fino alla modifica più recente; il risultato dello strumento arrivato in questo turno è input nuovo alla tariffa piena.
• Token di ragionamento — generati, mai memorizzati nella cache, fatturati come output. Consumano la finestra e sono invisibili nel corpo della risposta.
Due note operative discendono direttamente da quell’elenco. Primo, le voci di cache sono conservate su singole macchine: la guida afferma che una richiesta può riutilizzare un prefisso «solo se raggiunge una macchina che contiene una voce corrispondente non scaduta», e che l’instradamento di overflow inizia oltre circa 15 richieste al minuto. Un prefisso stabile nel tuo codice può comunque mancare in produzione. Secondo, il prefisso minimo memorizzabile in cache è di 1.024 token di input visibili, e i token di sistema nascosti non concorrono a raggiungerlo — quindi un piccolo prompt di sistema non è un prefisso memorizzabile in cache, indipendentemente da quanto sia grande la richiesta che lo circonda.
Il tetto di output è un budget separato, non una seconda porzione.
128.000 token di output massimi non significa 128.000 token di risposta. La guida al ragionamento è esplicita sul fatto che max_output_tokens limita il totale generato dal modello, «inclusi i token di ragionamento, i token di output visibili e i token di formattazione non visibili», e che i token di ragionamento vengono fatturati come output pur occupando spazio nella finestra.
Ciò rende il troncamento una decisione progettuale anziché un caso limite, per il modo in cui fallisce. Quando la generazione raggiunge il limite, la risposta viene restituita con stato incomplete e motivo max_output_tokens — e la guida avverte che ciò «potrebbe verificarsi prima che venga prodotto qualsiasi token di output visibile, il che significa che potresti incorrere in costi per token di input e di ragionamento senza ricevere una risposta visibile». Un budget che spende l'intera finestra sull'input e lascia al caso la riserva per l'output è un budget che può fatturare una richiesta completa a contesto lungo e non restituire nulla che un chiamante possa analizzare. La raccomandazione iniziale dello stesso fornitore è di riservare almeno 25.000 token per il ragionamento e gli output mentre stai ancora misurando ciò di cui un prompt ha effettivamente bisogno.
GPT-6.1 Sol affina questo, ed è una delle poche voci realmente specifiche di 6.1 nel rilascio. La sua scala di impegno di ragionamento prevede low, medium, high, xhigh e max, e le impostazioni none e minimal non sono supportate. GPT-6 Sol le accetta tutte e sei. Non esiste quindi alcuna impostazione su 6.1 che disattivi la spesa di ragionamento, l'impostazione predefinita è medium, e il lato output del budget non è mai gratuito.
Il dimezzamento dell'input in cache, letto dove la finestra è più ampia
L'unica tariffa sulla scheda GPT-6.1 Sol che è cambiata rispetto a GPT-6 Sol è quella dell'input in cache: scesa da $0,20 a $0,10 per milione di token, che la pagina del modello esprime come 5% della tariffa dell'input non in cache, e che la guida alla cache del fornitore indica esplicitamente come il caso 0,05x rispetto allo 0,1x applicato in lettura dalla maggior parte dei modelli GPT-5.6 e successivi. L'input, le scritture in cache e l'output sono identici su entrambe le schede, e anche i moltiplicatori per il contesto lungo sono identici.
Per esattamente il carico di lavoro di cui parla questa pagina, quello è il contatore che è stato giusto spostare, e il motivo è la composizione di una richiesta lunga piuttosto che la sua dimensione. Nel processo da 300.000 token sopra, 260.000 dei token di input sono un prefisso in cache — l'87 per cento di tutto ciò che la richiesta invia. La voce in cache è quindi il più grande contatore di input singolo nella fattura, che è la proprietà generale del lavoro a contesto lungo: più lunga è la finestra che usi, maggiore è la parte di essa che è un prefisso che hai già inviato. Dimezzare quel contatore vale 0,052 $ su quella richiesta.
E la discontinuità riprende più di quanto il dimezzamento conceda, sulla stessa richiesta. Prezzato alle tariffe di contesto breve che avrebbe pagato sotto la linea, lo stesso lavoro da 300.000 token su GPT-6.1 Sol costerebbe $0,166 invece di $0,302 — un costo di attraversamento di $0,136, ossia circa 2,6 volte quanto vale l'unico contatore modificato della release. Sopra la linea la tariffa in cache segna $0,20, che non è un numero nuovo per questa famiglia: è il doppio del prezzo principale sulla scheda 6.1 ed esattamente ciò che GPT-6 Sol faceva pagare per una lettura in cache sotto la linea prima di questa release. Un carico di lavoro in cache a contesto lungo incassa la variazione del prezzo principale e poi la restituisce al confine, e il confine — non il modello — è la causa.

Come dimensionare un budget di contesto
Come procedura, nell'ordine in cui i vincoli si applicano:
• Conta la richiesta, non stimarla. Invia il payload esatto — strumenti, immagini, file e tutto il resto — all'endpoint di conteggio dei token di input della Responses API. La guida è schietta sul perché: il conteggio include token di formattazione per i ruoli dei messaggi e i confini che non compaiono mai nel testo che puoi tokenizzare localmente, e le stime locali come "caratteri diviso quattro" sono imprecise per immagini, file e schemi.
• Riserva prima la parte di output. Scegli max_output_tokens ricordando che copre insieme ragionamento, output visibile e formattazione, e parti dal buffer di 25.000 token del fornitore anziché da zero. Il tuo budget di input è la finestra meno quella prenotazione, e il valore novecentoventidue è la versione del fornitore della stessa sottrazione.
• Prezza la richiesta su entrambi i lati di 272.000 prima di inviarla. Il passo è abbastanza ampio che una richiesta pensata per cadere appena sotto la soglia e una richiesta pensata per cadere appena sopra sono prodotti diversi.
• Ordina il prefisso in base alla stabilità.Istruzioni, poi gli schemi degli strumenti, poi il corpus, poi la trascrizione. Qualsiasi cosa cambi tra una chiamata e l'altra appartiene alla fine, dove fa perdere una corrispondenza del prefisso anziché l'intera cache.
• Supera 1.024 token di input visibili prima di aspettarti una cache. Al di sotto di quella soglia minima nulla viene messo in cache, e i token nascosti del provider non contano ai fini di tale soglia.
• Verifica che il riutilizzo sia plausibile. Un prefisso deve essere riutilizzato entro la durata di 30 minuti della cache e deve arrivare sulla macchina che detiene la voce; entrambi sono descritti nella guida e nessuno dei due è una proprietà del tuo codice.
• Misura di nuovo dopo qualsiasi modifica al modello o alle impostazioni.Passare a GPT-6.1 Sol elimina la posizione con reasoning disattivato, il che modifica il conteggio dei token di reasoning e quindi il lato output del budget — e una modifica all'effort di reasoning, agli strumenti, allo schema di output strutturato o alla gestione del contesto può anche spostare un confine di prefisso e farti perdere del tutto la tariffa in cache.
• Decidi cosa succede quando il job non si riduce ulteriormente. La compaction è la via di fuga documentata: una richiesta Responses può impostare context_management con una soglia di compaction, e il server sostituisce il contenuto precedente della conversazione con un elemento di compaction opaco che porta avanti lo stato chiave in meno token. È una decisione di budget più che una semplice riduzione gratuita, perché la guida osserva che la compaction "può impedire il riutilizzo dal primo token modificato in poi" — un passaggio di compaction invalida il prefisso che lo precede.

L'aritmetica su questa pagina parte dalla generazione che GPT-6.1 Sol sostituisce, e quel gradino è quello che si può effettivamente chiamare oggi: la nostra scheda per openai/gpt-6-sol riporta una finestra di contesto di 1.050.000 token con 128.000 token di output massimo alle tariffe di listino di OpenAI con 0% di ricarico — il prezzo del fornitore è il prezzo sulla pagina, e un movimento del fornitore arriva lì lo stesso giorno, non al rinnovo. La nostra scheda non ha un campo proprio per l'input massimo, quindi il valore di 922.000 token per quel modello deve provenire dalla documentazione del fornitore stesso, che è quella che questa pagina ha usato in tutto il testo. Ciò per cui la scheda è utile è il dimensionamento: la finestra e il tetto di output che essa pubblica sono i due numeri che la procedura di budget di cui sopra sottrae l'uno dall'altro, e il gradino inferiore è quello su cui puoi davvero eseguire quella procedura mentre 6.1 è ancora nuovo. Si trova su https://www.orcarouter.ai/models/openai/gpt-6-sol.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
