Una scheda hero generata intitolata "GPT-6.1 Sol vs la generazione GPT-6", con l'intestazione "Una generazione, 48 volte il costo", che mostra quattro gradini impilati etichettati GPT-6 Astra (Indice 52,7, 3,26 $ per attività), GPT-6.1 Sol (Indice 51,8, 0,72 $ per attività), GPT-6 Sol (Indice 47,6, 1,05 $ per attività) e GPT-6 Luna (Indice 38,1, 0,07 $ per attività), con un piè di pagina che riporta "Dati: Artificial Analysis v4.3.2." e il logo OrcaRouter in basso a destra.
Engineering & Research

GPT-6.1 Sol vs la generazione GPT-6: Una generazione di uno

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il fornitore ha aggiunto un quarto nome alla sua linea di modelli il 29 settembre 2026 e l'ha definita una generazione, e l'aritmetica della gamma è la cosa più interessante al riguardo: GPT-6.1 Sol è l'intera generazione. GPT-6 Luna e GPT-6 Sol, entrambi rilasciati il 22 settembre 2026, sono invariati; GPT-6 Astra, disponibile dal 4 settembre 2026, è invariato; l'aggiornamento 6.1 ha toccato esattamente una fascia. Nel frattempo GPT-6.1 Sol, a $2,00 in ingresso e $10,00 in uscita per milione di token, ottiene 51,83 sull'Artificial Analysis Intelligence Index per $0,724 per attività — a meno di 0,84 punti da GPT-6 Astra, che costa $3,2575 per attività a $10,00/$50,00. Stessa generazione sull'etichetta, quattro economie diverse sotto.

Questo rende "dovrei usare la generazione GPT-6" la domanda sbagliata. La gamma copre un intervallo di 48× nel costo per attività e un intervallo di 14,6 punti nell'intelligenza misurata, e la risposta dipende interamente da quale fascia si intende. Ecco la scala, misurata.

I quattro pioli, come misurati

A chart titled 'The GPT-6 ladder - measured', subtitle 'Artificial Analysis Intelligence Index, and the measured cost of one task', with four horizontal bars whose lengths are proportional to the Intelligence Index: GPT-6 Luna Index 38.1 / $0.068 per task, GPT-6 Sol Index 47.6 / $1.05 per task, GPT-6.1 Sol Index 51.8 / $0.72 per task, GPT-6 Astra Index 52.7 / $3.26 per task; footer 'Bar length is proportional to the Intelligence Index (0-60 scale). All figures: Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

• GPT-6 Luna — Indice 38.12, $0.10 / $0.50 per 1M, $0.01 in cache, $0.0678 per attività, 50,012 token di output, 100.1 s al primo token
• GPT-6 Sol — Indice 47.63, $2.00 / $10.00, $0.20 in cache, $1.045 per attività, 31,000 token di output, 124.3 s
• GPT-6.1 Sol — Indice 51.83, $2.00 / $10.00, $0.10 in cache, $0.724 per attività, 38,128 token di output, 332.0 s
• GPT-6 Astra — Indice 52.67, $10.00 / $50.00, $1.00 in cache, $3.2575 per attività, 27,206 token di output, 400.4 s

Ognuno di essi ha la stessa finestra di contesto di 1.050.000 token e lo stesso output massimo di 128.000 token, e ognuno accetta in input testo, immagini e file. I livelli non sono differenziati da flag di capacità. Sono differenziati da quanto ragionamento sei disposto a pagare, e i due estremi di quella scala sono distanti 48 volte per attività.

Cosa ha effettivamente cambiato il refresh 6.1

Tre cose, e solo una di queste è un punteggio.

Il punteggio si è mosso: da 47,63 a 51,83, un guadagno di 4,2 punti, in una settimana. La tariffa degli input in cache si è dimezzata, da $0,20 a $0,10 per milione, ed è per questo che il costo misurato per attività è sceso da $1,045 a $0,724 nonostante i prezzi di listino fossero identici — lo stesso tariffario, una fattura diversa. E il numero di token di output è salito da 31.000 a 38.128, mentre il tempo effettivo per attività è passato da 321 secondi a 640, che è l'unico punto in cui l'aggiornamento è andato all'indietro e il meno visibile su qualsiasi scheda tecnica.

Nel confronto con Astra, è il confronto a sorprendere le persone. GPT-6.1 Sol è 0,84 punti indice dietro il flagship ed è 4,5 volte più economico per attività. Il vantaggio rimanente di Astra non è il suo punteggio indice; è l'insieme di valutazioni in cui viene misurata da sola, e l'unica capacità che OpenAI descrive come esclusiva di Astra — trovare nuove vulnerabilità di sicurezza, motivo per cui il modello è classificato "critico" nell'ambito del Preparedness Framework dello stesso fornitore e le sue impostazioni più capaci sono limitate a partner verificati.

La scheda OrcaRouter per GPT-6 Astra è l'estremità di punta della stessa scala: $10,00 / $50,00, un p50 di 1,64 secondi al primo token, 40,7 milioni di token in sette giorni e la stessa finestra di contesto di 1.050.000 token che ogni livello condivide.

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the $10.00 input and $50.00 output per-million prices, a 1.64 s p50 time to first token, 40.7M tokens over seven days, a 1,050,000-token context window and 128K max output with text/image/file input, above the OpenAI-compatible code sample.

Rispetto al 6.0 Sol, l'aggiornamento è quasi un miglioramento netto — più indice, meno soldi — con l'avvertenza che il modello 6.1 è un modello diverso e non un checkpoint, e riemette il proprio ragionamento in modo più prolisso. Rispetto a Luna non è affatto un confronto: 10,7 volte il costo per 13,7 punti indice, il che è un buon affare per il lavoro impegnativo e un pessimo affare per il lavoro ad alto volume.

Quello che i nostri stessi dati di routing dicono che il mercato ha già deciso

Una cosa che questo confronto ha e che una scheda tecnica non ha è una visione dell'utilizzo reale. Nei sette giorni terminanti il 7 ottobre 2026, sul nostro livello di routing, GPT-6.1 Sol ha trasportato 284,2 milioni di token e il GPT-6 Sol che ha sostituito ne ha trasportati 950 mila — una differenza di 300 volte per due modelli distanti una settimana di età, che è ciò che un ricambio di fascia sembra dall'interno. GPT-6 Luna, la fascia economica, ne ha trasportati 641,6 milioni, più di entrambi i modelli Sol messi insieme. GPT-6 Astra ne ha trasportati 40,7 milioni.

Leggilo come tre comportamenti distinti. Il lavoro ad alto volume è andato alla fascia economica nel volume maggiore. Il lavoro serio si è consolidato sul Sol più recente entro una settimana dal suo rilascio, abbandonando il modello che sostituiva. E il modello di punta è rimasto una nicchia: il gradino più capace, usato meno di tutti, da team il cui problema è quello che solo esso risolve. La gamma non è una scala da salire; è un insieme di strumenti tra cui scegliere, e si sceglie per fascia, non per generazione.

Ecco perché il tier appartiene alla richiesta, non all'architettura

Il problema pratico di una generazione con quattro livelli è che la risposta giusta cambia da un compito all'altro e da una settimana all'altra — come mostrano i dati sul traffico sopra, il mercato ha cambiato idea nel giro di sette giorni. Codificare in modo fisso il nome di un singolo modello in un'applicazione è ciò che trasforma una gamma di opzioni in un vincolo.

Tutti e quattro sono raggiungibili tramite un unico endpoint OrcaRouter: una sola API per oltre 200 modelli, con il prezzo di listino del provider passato così com'è, a 0% di ricarico. Quest'ultima parte è fondamentale qui, in particolare perché tre dei quattro livelli condividono un prezzo di listino o una tariffa cache che è già cambiata una volta — la tariffa cache di GPT-6.1 Sol si è dimezzata entro una settimana dal lancio, e un contatore pass-through è ciò che fa sì che arrivi automaticamente sulla tua fattura.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample.

Due caratteristiche del livello di routing meritano di essere nominate per questa particolare line-up. Il DSL di routing consente che il tier sia un parametro della richiesta anziché del deployment — tier economico per la passata di estrazione, 6.1 Sol per la passata di ragionamento, Astra solo per le chiamate che richiedono ciò che Astra fa in modo unico. E la fusione di modelli consente a un pannello di rispondere insieme a una sola domanda, che è il modo onesto di usare un flagship verso cui non ci si può permettere di instradare tutto: diventa una voce in un pannello invece dell'intero conto.

Cosa fare con una generazione di figli unici

Non comprare la generazione. Compra un gradino e ricompralo quando i gradini si spostano.

Per i carichi di lavoro ad alto volume e sensibili alla latenza, GPT-6 Luna a $0,0678 per attività e 100 secondi al primo token è il livello che già veicola il maggior traffico, e il prezzo è un ordine di grandezza inferiore a qualsiasi altra opzione sulla scala. Per il ragionamento generale e la programmazione, GPT-6.1 Sol è ormai il default che un tempo era il modello 6.0 — stesso prezzo di listino, indice migliore, metà del costo di cache, e il tempo di attività di 640 secondi è l'unica cosa da testare sul proprio carico di lavoro prima di dare per scontato che l'aggiornamento sia gratuito. Per le attività che richiedono misurazioni di frontiera o il lavoro di sicurezza che solo il modello di punta svolge, GPT-6 Astra resta l'unico gradino che le esegue, a 4,5 volte il costo del gradino sottostante.

Quello a cui prestare attenzione è se l'aggiornamento 6.1 arriva anche agli altri livelli. Se Luna o Astra ricevono lo stesso trattamento, cambia la forma della scala — e con essa l'aritmetica per attività di questo articolo. Fino ad allora, "GPT-6.1" indica un solo modello, e trattarlo come una famiglia è il modo in cui i team finiscono per pagare tariffe da flagship per l'estrazione.