Una hero card generata per GPT-6.1 Sol intitolata «Il punteggio indipendente è arrivato», con badge che recitano «Rilasciato: 29 settembre 2026», «Indice di intelligenza: 52 con sforzo massimo» e «Costo per attività dell'indice: 0,72 $», un footer che recita «Dati indipendenti secondo Artificial Analysis, indice v4.3.2, rilevati il 30 settembre 2026», e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Il primo punteggio indipendente di GPT-6.1 Sol è arrivato: 0,84 punti dietro Astra, a meno di un quarto del costo del task.

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ogni analisi di GPT-6.1 Solpubblicata nei giorni successivi al rilascio DevDay di OpenAI del 29 settembre 2026 — incluso questo blog — riportava la stessa avvertenza: i numeri sulle capacità erano quelli del fornitore e nessuna terza parte aveva valutato il modello. Ora quell'avvertenza è superata. Artificial Analysis ha una riga dedicata a GPT-6.1 Sol nel suo Intelligence Index, eseguita con il massimo sforzo di ragionamento, ed è il primo dato nella breve vita di questo modello che OpenAI non ha prodotto. Segna 51,8 contro 52,7 di GPT-6 Astrae 47,5 di GPT-6 Sol — un divario inferiore a un punto rispetto al flagship da $10/$50, e un balzo di 4,3 punti rispetto al modello che GPT-6.1 Sol sostituisce. Il numero che rende interessante la riga è quello accanto: la classifica riporta il costo della sessione di valutazione dietro ogni punteggio, e la sessione di indice di GPT-6.1 Sol è costata $0,72 per attività, mentre quella di Astra è costata $3,26. Quattro volte e mezzo il denaro per 0,84 punti: è l'intero confronto condensato in una riga, e ora è una riga misurata, non l'inquadramento che ne dà un fornitore.

La riga stessa, e ciò su cui è stata eseguita

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis pubblica il suo Intelligence Index come composito di dieci valutazioni, e la versione in esecuzione il 30 settembre 2026 era la v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1. Tutti e tre i modelli OpenAI in questo articolo poggiano su quella stessa versione, quindi il confronto riportato di seguito è omogeneo come non lo è mai una tabella di lancio dello stesso fornitore. La board registra anche la data di rilascio che ha per il modello — 2026-09-29, la data del DevDay — e lo valuta nella configurazione max-effort, ovvero l'impostazione che la pagina indica nella propria intestazione.

• Intelligence Index — 51,8 per GPT-6.1 Sol (max), 52,7 per GPT-6 Astra (max), 47,5 per GPT-6 Sol (max).
• Costo per attività dell'indice — $0,72 per GPT-6.1 Sol, $3,26 per Astra, $1,05 per GPT-6 Sol. Questa è la cifra fornita dalla classifica stessa per quanto è costato eseguire una valutazione completa dell'indice, non un listino prezzi.
• Token di output consumati per l'esecuzione — 67,2 milioni per GPT-6.1 Sol, 60,0 milioni per Astra, 76,8 milioni per GPT-6 Sol. Il commento di AA definisce 67 milioni "piuttosto concisi" rispetto a una mediana della classifica di 82 milioni, il che è una seconda, più discreta vittoria sul modello che sostituisce.
• Velocità di output — 66,8 token al secondo per GPT-6.1 Sol, 57,0 per Astra, 76,2 per GPT-6 Sol.
• Prezzi come li elenca la classifica — $2,00 input e $10,00 output per milione di token per GPT-6.1 Sol, con input in cache a $0,10 e scritture in cache a $2,50. Quei quattro numeri corrispondono esattamente alla pagina dei prezzi del fornitore, che è la cosa meno eclatante e più utile della riga: un elenco indipendente delle tariffe che avevamo già citato.

Una nota di contesto prima che i numeri vengano usati come munizioni. L'indice di AA comprende dieci valutazioni, e le valutazioni con cui OpenAI ha esordito nel proprio annuncio — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — non sono tra queste. AA gestisce una propria variante di AutomationBench, che non è lo stesso harness della versione di AutomationBench citata dal fornitore. Quindi il record indipendente non conferma né confuta le quattro affermazioni principali del post di lancio; misura un insieme di compiti in gran parte diverso, e vale la pena leggerlo come una seconda opinione sulla forma del modello piuttosto che come un verdetto su quelle specifiche frasi.

Astra vince ancora, per meno di un punto, a quattro volte e mezzo il prezzo.

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

Entrambi i modelli espongono una scala di impegno, e la classifica ha ormai pubblicato un punteggio e un costo di esecuzione per ogni gradino di entrambe. Messe a confronto, le scale dicono qualcosa che il singolo confronto in evidenza non può dire: la migliore configurazione di GPT-6.1 non compete con la migliore di Astra. Compete con la seconda migliore di Astra.

• GPT-6.1 Sol, max — 51.8, $0.72 per attività di indicizzazione. GPT-6 Astra, max — 52.7, $3.26.
• GPT-6.1 Sol, xhigh — 51.0, $0.39. GPT-6 Astra, xhigh — 52.4, $2.31.
• GPT-6.1 Sol, high — 50.2, $0.32. GPT-6 Astra, high — 50.9, $1.73.
• GPT-6.1 Sol, medium — 47.8, $0.21. GPT-6 Astra, medium — 49.6, $1.54.
• GPT-6.1 Sol, low — 42.1, $0.13. GPT-6 Astra, low — 45.8, $0.82.

Astra è in testa a ogni gradino, che è il riassunto onesto del confronto e anche la parte meno interessante. La parte interessante è il tasso di cambio. Se vuoi la configurazione Astra più economica che batte il miglior risultato di GPT-6.1 Sol, è Astra a xhigh: 52,4 contro 51,8, per 2,31 $ contro 0,72 $. Sono 0,56 di un punto indice per 1,59 $ in più per esecuzione di valutazione — all'incirca 3,2 volte il costo per meno dell'1% del punteggio. Vai nella direzione opposta e abbassa GPT-6.1 Sol a xhigh, e rinunci a 0,8 punti mentre il conto scende a 0,39 $, che è 5,9 volte più economico dell'xhigh di Astra e un nono dell'esecuzione a sforzo massimo di Astra.

C'è una seconda lettura della stessa scala che sostiene che non conviene acquistare Astra allo sforzo massimo. I quattro gradini inferiori di Astra sono tutti più economici del suo massimo, e il suo xhigh è 0,29 punti sotto il suo massimo — poco più di mezzo punto percentuale di punteggio per una riduzione del 29% del costo di esecuzione. Qualsiasi conversazione di approvvigionamento su questa coppia che inizi da "Astra al massimo" e finisca con "Astra costa 4,5 volte di più" lascia fuori dal confronto i gradini più economici di Astra stessa.

Sei valutazioni vanno ad Astra, due vanno a GPT-6.1 Sol, due sono in parità

Il composito nasconde una divisione. Valutato eval per eval al massimo sforzo, GPT-6.1 Sol non è un'Astra uniformemente leggermente peggiore — è migliore in due cose e peggiore in sei.

• GDPval-AA — Elo 1575,1 per GPT-6.1 Sol contro 1541,9 per Astra, un vantaggio di 33 punti nei compiti professionali. Questa è la più grande vittoria indipendente singola per il modello più economico.
• AA-LCR v1.1, ragionamento a lungo contesto — 0,830 contro 0,807. GPT-6.1 Sol è in testa.
• AA-Briefcase v1.1 — Elo 1564,2 contro 1568,9. Astra di 4,7.
• AutomationBench-AA — 0,649 contro 0,685. Astra di 3,6 punti.
• Terminal-Bench 4.0 — 0,561 contro 0,591. Astra di 3,0 punti.
• SciCode — 0,542 contro 0,565. Astra di 2,3 punti.
• Humanity's Last Exam — 0,529 contro 0,547. Astra di 1,8 punti.
• AA-Omniscience — 41,5 contro 43,4. Astra di 1,9 punti.
• GDP.pdf e CritPt — parità assoluta a 0,310 e 0,317 rispettivamente, su entrambi i modelli.

Due di quelle righe valgono più della loro posizione nell'elenco. Il margine GDPval-AA è l'unico caso in cui il vantaggio del modello più economico è abbastanza ampio da sopravvivere a un cambio di harness, e cade esattamente sul carico di lavoro che la linea di posizionamento del fornitore rivendica — lavoro professionale, a forte componente documentale. E i due pareggi assoluti sono nelle valutazioni con gli scarti più stretti, il che ricorda che un divario composito di 0,84 punti viene costruito a partire da righe che, singolarmente, vanno da una vittoria di 33 punti a una sconfitta di 3,6 punti.

Rispetto al modello che sostituisce, il miglioramento è reale ma non uniforme.

Il confronto che conta per chiunque stia già eseguendo GPT-6 Sol in produzione è quello che 6.1 Sol fa rispetto al proprio predecessore, e il resoconto indipendente su questo è più incisivo di quanto lo fosse il post del fornitore. Otto valutazioni su dieci migliorano. Due peggiorano.

• SciCode — GPT-6.1 Sol ottiene 0,542 mentre GPT-6 Sol aveva ottenuto 0,576. Il modello più recente è peggiore sul codice scientifico di 3,5 punti.
• AA-LCR v1.1 — 0,830 per 6.1 Sol contro 0,837 per GPT-6 Sol. Un soffio, ma nella direzione sbagliata, sulla valutazione long-context.
• AA-Omniscience — 41,5 contro 27,1. Questo è il maggiore spostamento della riga: un salto di 14,4 punti nella valutazione delle conoscenze, con l'accuratezza su quel set che sale da 0,545 a 0,621.
• Tasso di allucinazione sullo stesso set — 0,543 per GPT-6.1 Sol, in calo da 0,601 per GPT-6 Sol e ancora sopra 0,513 di GPT-6 Astra. AA-Omniscience divide il suo punteggio in "azzeccato" e "convintamente sbagliato", ed è nella divisione che l'aggiornamento 6.1 dimostra il suo valore: è un modello significativamente meno disonesto di Sol, e resta comunque il più disonesto dei tre.
• Terminal-Bench 4.0 — 0,561 contro 0,439, un guadagno di 12,2 punti. AA-Briefcase — da 1482,8 a 1564,2 Elo. GDP.pdf — da 0,248 a 0,310.

L'interpretazione è che si è trattato più di un aggiornamento di conoscenze e strumenti che di un aggiornamento del ragionamento. Le valutazioni che si sono mosse di più sono quelle che premiano il conoscere le cose e non l'inventarle; la valutazione che è calata è ristretta e tecnica. Chi è passato a 6.1 Sol per il risparmio sulla cache ottiene il guadagno di conoscenze come bonus e non dovrebbe presumere che si estenda a ogni harness che esegue.

Dove la classifica lo colloca, e cosa c'è al di sopra

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

Nell'ordinamento predefinito dell'Intelligence Index della classifica, GPT-6 Astra al massimo sforzo si colloca al 7° posto e GPT-6.1 Sol al massimo sforzo al 10° posto, mentre GPT-6 Sol al massimo sforzo è al 20° posto. Le nove righe sopra GPT-6.1 Sol sono due configurazioni Astra, tre configurazioni Claude Opus 5.5, una configurazione Claude Sonnet 5.5 e due configurazioni Claude Fable 5.1 — quindi il modello a cui GPT-6.1 Sol è più vicino è il fiore all'occhiello della sua stessa famiglia, e il modello che ha effettivamente scalzato in quell'ordinamento è il suo stesso predecessore, tredici posizioni più in basso.

Togliendo l'impostazione dell'effort, l'ordinamento si comprime in un modo che conta per la pianificazione dei costi: GPT-6.1 Sol a xhigh si classifica 13°, a high 15°, a medium 19° e a low 35°, mentre Astra si colloca 14° a high, 16° a medium e 26° a low. In altre parole, GPT-6.1 Sol a xhigh supera Astra a high nella classifica, e GPT-6.1 Sol a medium supera Astra a low. L'effort è una leva più importante, in questo caso, della scelta del modello, almeno tra questi due.

Cosa fare con il numero, sinceramente

L'affermazione del fornitore che questa riga metteva alla prova era che GPT-6.1 Sol è quasi alla pari del modello di punta a circa un quinto del prezzo. La versione indipendente di quella frase è: si avvicina al modello di punta entro 0,84 punti indice, e l'esecuzione di valutazione che sta dietro al suo punteggio è costata il 22% di quella del modello di punta. È abbastanza vicino all'affermazione da non far sentire nessuno ingannato da essa, ed è un'affermazione più forte di «non verificato» in ogni direzione che conta per un acquirente.

Ciò che la riga non fa è prezzare il tuo carico di lavoro. Un'esecuzione dell'indice è una miscela specifica di attività, e il numero che decide una bolletta reale è il listino prezzi rispetto al tuo profilo di token — ed è per questo che la riga della cache è ancora quella da modellare: l'input in cache di GPT-6.1 Sol a 0,10 $ contro l'1,00 $ di Astra è una differenza di dieci volte che nessun punteggio dell'indice tocca. Dal nostro lato si applica lo stesso pass-through: OrcaRouter serve GPT-6 Astra, GPT-6 Sol e GPT-6 Luna ai prezzi di listino di OpenAI senza alcun ricarico aggiunto, così il giorno in cui la tariffa di un fornitore cambia, la tariffa dal nostro lato cambia con essa invece di aspettare un secondo contratto. GPT-6.1 Sol non è sulle nostre rotte — il catalogo pubblico restituisce "model not found" per openai/gpt-6.1-sol oggi, e non c'è modo onesto di descrivere un modello che non possiamo servire. Quello che una singola chiave API ti compra proprio ora è la coppia su cui il benchmark discute davvero — Astra per il lavoro più difficile, Sol per il volume — con i prezzi di listino dei fornitori passati attraverso senza maggiorazioni e failover automatico tra i fornitori quando uno di essi genera errori.

Due cose affinerebbero ulteriormente questo quadro. Un secondo harness indipendente sullo stesso modello ci direbbe se il vantaggio di GDPval-AA è una proprietà del modello o di quella valutazione, ed è il singolo dato mancante più utile nella riga. E una misurazione indipendente del livello long-context da 272.000 token conterebbe più di un altro punto composito, perché è lì che il prezzo di questa famiglia smette di essere economico.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno