Un tabellone di confronto a due colonne generato intitolato 'GPT-6.1 Sol vs GPT-5.6 Sol - il tabellone'. Colonna sinistra 'GPT-6.1 Sol': righe che riportano 'Indice di intelligenza: 51.8', 'Costo per attività indice: $0.72', 'Input / output: $2.00 / $10.00', 'Input memorizzato nella cache: $0.10', 'Token di output durante l'esecuzione dell'indice: 67M', 'Soglia di sforzo: bassa'. Colonna destra 'GPT-5.6 Sol': righe che riportano 'Indice di intelligenza: 47.0', 'Costo per attività indice: $1.99', 'Input / output: $4.00 / $20.00', 'Input memorizzato nella cache: $0.40', 'Token di output durante l'esecuzione dell'indice: 90M', 'Soglia di sforzo: nessuna'. Un piè di pagina riporta 'Cifre indipendenti secondo Artificial Analysis v4.3.2 al massimo sforzo; prezzi di listino dei fornitori.'
Guides & Insights

GPT-6.1 Sol vs GPT-5.6 Sol: quattro punti e mezzo sull'indice, metà del costo, due regressioni

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Open​AI ha rilasciato GPT-6.1 Sol il 29 settembre 2026, undici settimane dopo GPT-5.6 Sol, che è stato distribuito il 9 luglio 2026 come modello di punta della generazione precedente. Entrambi sono ancora in vendita, entrambi sono ancora invocabili, e la differenza tra loro sulla classifica neutrale è di 4,8 punti — 51,8 contro 47,0 sull'Intelligence Index di Artificial Analysis, entrambi misurati con il massimo sforzo di ragionamento sulla stessa suite di dieci valutazioni. La differenza di prezzo è molto più ampia della differenza di punteggio: 0,72 $ per ogni attività dell'indice completata contro 1,99 $, e 2,00 $/10,00 $ per milione di token contro 4,00 $/20,00 $. Questa è la versione breve. La versione lunga è che l'aggiornamento non è uniforme e due delle valutazioni sono regredite.

Che cos'è ciascun modello e cosa ha sostituito cosa

GPT-5.6 Sol era il modello di punta della linea 5.6 — un modello chiuso, solo API, con una finestra di contesto di 1.050.000 token, un limite di output di 128.000 token, input di testo, immagini e file, e una scala di ragionamento che andava da nessuno fino a massimo. Era descritto da Open​AI come il livello costruito per il lavoro più difficile: flussi di lavoro agentici a lungo orizzonte, ingegneria del software multi-file, ragionamento profondo, e costava di conseguenza $4,00 e $20,00 per milione di token, con input in cache a $0,40 e scritture in cache a $5,00. Oltre 272.000 token di input, il prezzo saliva a $8,00 e $30,00, e prevedeva un livello Batch a $2,50 e $15,00.

GPT-6.1 Sol è il livello intermedio della generazione successiva: sotto GPT-6 Astra, sopra GPT-6 Luna, e ora il modello verso cui Open​AI indirizza gli sviluppatori attenti ai costi. Mantiene la finestra da 1.050.000 token e il limite di output di 128.000 token, estende il knowledge cutoff dal 20 aprile al 30 aprile 2026 e riduce la scala di effort da sei livelli a cinque — low, medium (predefinito), high, xhigh, max. Il valore none che GPT-5.6 Sol accettava ora restituisce un errore, e le indicazioni di migrazione di Open​AI specificano esplicitamente che la sostituzione è low, non un aggiornamento silenzioso.

Vale la pena soffermarsi su questo punto, perché è l'unico cambiamento di questa release che costa denaro invece di farne risparmiare. Una pipeline che faceva affidamento su none per ottenere una chiamata economica, rapida e non basata su reasoning non dispone più di quella configurazione, su nessuna delle due famiglie di modelli. Il gradino più economico su GPT-6.1 Sol è un gradino di reasoning, e i token di reasoning vengono fatturati come token di output, che tu li veda o no.

La scala, piolo dopo piolo

Il consiglio indipendente pubblica un punteggio e un costo di esecuzione per ogni impostazione di effort su entrambi i modelli, il che trasforma il confronto testa a testa in qualcosa di più utile di un singolo confronto. Allineati su impostazioni equivalenti:

• Scala di effort, GPT-6.1 Sol — max 51,8 a 0,72 $ per task dell'indice; xhigh 51,0 a 0,39 $; high 50,2 a 0,32 $; medium (il valore predefinito) 47,8 a 0,21 $ • Velocità di output — 59,7 token al secondo per GPT-6.1 Sol contro 87,8 per GPT-5.6 Sol
• Tempo al primo chunk — 332 secondi per GPT-6.1 Sol contro un valore più rapido per GPT-5.6 Sol, rispetto a una mediana della board vicina ai 4 secondi
• Token di output nella run dell'indice — 67,2 milioni per GPT-6.1 Sol contro 90,0 milioni per GPT-5.6 Sol
• Prezzo input / output — 2,00 $ / 10,00 $ contro 4,00 $ / 20,00 $
• Input in cache — 0,10 $ contro 0,40 $; scritture in cache 2,50 $ contro 5,00 $
• Tariffa batch — non pubblicata per GPT-6.1 Sol contro 2,50 $ / 15,00 $ per GPT-5.6 Sol
• Scaglione long-context — oltre 272.000 token di input GPT-6.1 Sol viene riprezzato a 4,00 $ / 15,00 $ per l'intera richiesta, contro gli 8,00 $ / 30,00 $ di GPT-5.6 Sol
• Effort floor — low vs none

Due cose emergono da quell'elenco. La prima è che il taglio di prezzo è strutturale, non promozionale: la tariffa standard di GPT-6.1 Sol, pari a $2,00 e $10,00, è inferiore a quella di GPT-5.6 Sol per batch di $2,50 e $15,00, quindi anche la fascia scontata del vecchio modello costa più del prezzo di listino del nuovo modello. La seconda è che l'aggiornamento non è lineare sulla latenza. GPT-6.1 Sol genera output circa un terzo più lentamente e ha impiegato 332 secondi per il primo chunk nei test con prompt lungo della board — lo stesso ordine di grandezza dei 107 secondi di GPT-6 Sol e circa ottanta volte la mediana della board. Se hai sviluppato un prodotto interattivo basato su GPT-5.6 Sol, questa è una regressione funzionale indipendente da qualsiasi benchmark, e la soluzione è architetturale, non un parametro.

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

Due valutazioni si sono mosse nella direzione sbagliata

Il guadagno composito è di 4,8 punti. Le componenti non sono uniformemente positive, e i punteggi per valutazione del consiglio lo dicono:

• SciCode — GPT-6.1 Sol 0,542 vs GPT-5.6 Sol 0,571. Una regressione di 2,9 punti sulla programmazione scientifica.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 vs GPT-5.6 Sol Elo 1611,3. Una regressione Elo di 36 punti sul lavoro intellettuale di valore economico.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 vs GPT-5.6 Sol 0,495. Un guadagno di 3,4 punti.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 vs GPT-5.6 Sol 0,399. Un guadagno di 16 punti, il maggiore movimento singolo del confronto.
• AA-Omniscience — GPT-6.1 Sol 41,5 vs GPT-5.6 Sol 22,0, che riguarda l'affidabilità delle conoscenze e le allucinazioni più che il recall grezzo.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — i restanti cinque, che completano il composito e sono quelli in cui si ottiene il resto del guadagno di 4,8 punti.

Un modello che è sensibilmente migliore nel lavoro da terminale, sensibilmente migliore sull'affidabilità fattuale e misurabilmente peggiore nella programmazione scientifica e nell'Elo del lavoro professionale non è un modello strettamente migliore. È un punto diverso sulla frontiera, ed è stato collocato lì deliberatamente: l'inquadramento di lancio di Open​AI stesso per GPT-6.1 Sol è il costo per attività completata a una qualità quasi da flagship, non il punteggio massimo. Se il tuo carico di lavoro è di tipo SciCode o di tipo GDPval, il numero composito non è quello che si applica a te; la regressione sì.

GPT-5.6 Sol ha ancora il risultato pubblicato sul contesto lungo.

L'unico punto in cui il modello più vecchio ha un dato che il più nuovo non ha è l'accuratezza di recupero nella fascia di contesto in cui cambia il listino di GPT-6.1 Sol. GPT-5.6 Sol riporta un risultato pubblicato di 91,5% nell'MRCR v2 a otto aghi nella fascia da 256.000 a 512.000 token. GPT-6.1 Sol non ha un corrispettivo pubblicato e, oltre 272.000 token di input, l'intera richiesta viene riprezzata a 2× per input e cache e 1,5× per output.

Metti insieme questi due fatti e il segmento in cui l'economia del nuovo modello è più debole è esattamente il segmento in cui il vecchio modello ha l'unico punto di forza documentato. I risparmi non svaniscono — $4,00 e $15,00 sul livello con prezzo rivisto rispetto a $8,00 e $30,00 sul livello a contesto lungo di GPT-5.6 Sol rappresentano comunque un dimezzamento — ma la storia del prezzo dimezzato è una storia da carichi di lavoro generici, e una pipeline di retrieval a contesto lungo non lo è. Se questo è il tuo carico di lavoro, GPT-5.6 Sol a $4,00 e $20,00 con un 91,5% pubblicato è una posizione difendibile in cui restare.

Gli altri risultati pubblicati di GPT-5.6 Sol restano intatti e sono il motivo per cui alcuni team non passeranno: BrowseComp 90,4 per gli agenti di ricerca web, Terminal-Bench 2.1 a 88,8 e 88,0, SWE-Bench Pro 64,6, Agents' Last Exam 53,6, OSWorld 2.0 a 62,6. Questi sono riportati da Open​AI, sull'harness di Open​AI, e sono stati resi noti a luglio. Ciò che è cambiato da allora è che la board ora valuta entrambi i modelli su un'unica suite con un unico insieme di impostazioni, e il modello più vecchio perde sul composito e sul costo.

La migrazione in sé è un cambio di stringa, con una sola eccezione

Stesso fornitore, stessa superficie API, adiacenti nella classifica, stessa finestra e stesso limite di output — quindi per la maggior parte degli stack si tratta di un identificatore di modello e di un prezzo che si dimezza. Le eccezioni sono specifiche e vale la pena nominarle prima di premere l'interruttore.

Se il tuo reasoning.effort è impostato su none o minimal, fallirà anziché degradarsi, e low è il sostituto documentato. Se il tuo traffico supera i 272.000 token di input, controlla il livello con il prezzo aggiornato prima di calcolare il risparmio. Se il tuo prodotto dipende dal tempo al primo token, misura prima di rilasciare, perché il dato di 332 secondi della board non è un errore di arrotondamento. E se le tue valutazioni contengono una porzione a forma di SciCode o GDPval, esegui quella porzione su entrambi i modelli invece di fidarti del punteggio composito.

Entrambi i modelli sono su OrcaRouter ai prezzi di listino di Open​AI stesso — GPT-6.1 Sol a $2.00 e $10.00 con input in cache a $0.10, GPT-5.6 Sol a $4.00 e $20.00 con input in cache a $0.40 — nell'ambito di un modello pass-through che ci fa arrivare una variazione dei prezzi di Open​AI lo stesso giorno in cui viene introdotta, anziché dopo che un rivenditore ha rinegoziato. Poiché il listino prezzi viene trasferito invariato anziché maggiorato, l'aritmetica di questo articolo è l'aritmetica che ottieni: lo stesso modello da $0.72 per attività, lo stesso dimezzamento, nessun sovrapprezzo di piattaforma aggiunto da nessuna delle due parti.

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

L'utilità pratica di avere entrambi dietro un unico endpoint è che il confronto rimane attivo. Invia il nuovo traffico a GPT-6.1 Sol, mantieni GPT-5.6 Sol a portata di una modifica di configurazione come fallback e come percorso a contesto lungo, e lascia che il failover automatico copra la finestra in cui la disponibilità e l'abilitazione Enterprise di un flagship lanciato da due mesi si stanno ancora assestando. Una migrazione che dimezza il costo e fa arretrare due sotto-benchmark non è una decisione da prendere una volta e dimenticare; è una decisione da prendere per ogni rotta, e un livello di routing è ciò che rende economico farlo.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Dove ognuno appartiene

• Lavoro generale con agenti e da terminale — GPT-6.1 Sol. Sedici punti su Terminal-Bench 4.0 e metà del prezzo: non è una decisione difficile.
• Affidabilità fattuale, prodotti con risposte recuperate — GPT-6.1 Sol, su un divario AA-Omniscience di quasi venti punti.
• Programmazione scientifica — controllate prima le vostre valutazioni. La classifica mostra una regressione di 2,9 punti e il composito non la farà emergere.
• Lavoro intellettuale dal valore economico — stessa cautela. La regressione Elo di GDPval-AA è di 36 punti.
• Recupero a contesto lungo oltre 272.000 token — GPT-5.6 Sol, finché GPT-6.1 Sol non avrà un numero pubblicato in quella fascia.
• Superfici interattive e sensibili alla latenza — misurate prima di migrare. Output più veloce, primo token molto più lento.
• Chiamata più economica senza ragionamento — nessuna delle due. Quella configurazione non esiste più su questa famiglia.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno