Scheda del titolo principale con la scritta 'GPT-6 Sol Pro vs Claude Opus 5' e il sottotitolo 'La scala dell'impegno che nessuno mette nella tabella', una coppia di etichette su due colonne 'GPT-6 Sol Pro' / 'Claude Opus 5', e una riga di piè di pagina con la scritta 'Elenchi dei fornitori non verificati; dati secondo Artificial Analysis.', con il logo reale di OrcaRouter in basso a destra.
Guides & Insights

GPT-6 Sol Pro vs Claude Opus 5: La scala dell'impegno che nessuno mette nella tabella

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

GPT-6 Sol Pro e Claude Opus 5 vengono continuamente confrontati tra loro, e quasi sempre con l'impostazione sbagliata. Il confronto che circola è Claude Opus 5 al suo massimo sforzo di ragionamento contro GPT-6 Sol Pro al suo massimo sforzo di ragionamento, il che produce un divario di tre punti sull'indice neutro e una differenza di costo di cinque volte. Imposta entrambi i modelli sulla configurazione che i rispettivi fornitori distribuiscono come predefinita — e ricorda che "Pro" nel primo nome è una configurazione di ragionamento, non un modello separato — e il divario di tre punti scompare del tutto. Ciò che rimane è la differenza di costo, ed è l'unica parte della storia che sopravvive al contatto con una fattura di produzione.

Non è un trucco di presentazione. È la diretta conseguenza di due scale di effort che non sono calibrate l'una rispetto all'altra, pubblicate da due vendor che prendono come benchmark i modelli precedenti dell'altro.

Che cosa sono realmente i due modelli, prima di qualsiasi confronto

GPT-6 Sol è il modello di ragionamento di fascia media di OpenAI, disponibile a livello generale dal 22 settembre 2026, a 2,00 $ per milione di token in input e 10,00 $ per milione di token in output. Non esiste alcun identificatore di modello gpt-6-sol-pro nella documentazione per sviluppatori di OpenAI: la pagina elenca un'unica voce Sol, una finestra di contesto di 1.050.000 token, un input massimo di 922.000 token, un limite di output di 128.000 token, una data di cutoff delle conoscenze al 20 aprile 2026 e una scala di impegno di ragionamento che va da none, low, medium, high, xhigh e max, con medium come valore predefinito. "Pro" è un valore della modalità di ragionamento, lo stesso schema di alias stabilito dalla generazione GPT-5.6 e che questa ha ereditato. Esiste una voce di catalogo di terze parti chiamata GPT-5.6 Sol Pro, che ora indica 2,00 $ e 10,00 $ — i numeri di GPT-6 Sol — il che è un artefatto di denominazione, non un prodotto.

Claude Opus 5 è un modello reale di Anthropic, con prezzo separato, disponibile a livello generale dal 24 luglio 2026 a 5,00 $ in input e 25,00 $ in output per milione di token. La sua finestra di contesto è di 1.000.000 di token, il limite di output sincrono è di 128.000 e la sua scala di effort — output_config.effort — prevede low, medium, high, xhigh e max, con high come impostazione predefinita. Il thinking è adattivo e attivo per impostazione predefinita, una novità assoluta per la famiglia Opus.

Un altro fatto che condiziona tutto quanto segue, e che nessuna pagina di confronto esistente riporta: la tabella del ciclo di vita di Anthropic elenca Claude Opus 5 come Attivo (legacy), con un banner di migrazione che rimanda a Claude Opus 5.5, che ha raggiunto la disponibilità generale il 22 settembre 2026 a $4,00 e $20,00. I grafici di lancio di OpenAI usano ancora come riferimento Opus 5, non 5.5. Il modello oggetto del confronto è l'Opus della generazione precedente.

Le due righe di prezzo, riga per riga

Entrambe sono liste di fornitori — i numeri pubblicati da OpenAI e da Anthropic stessi, riportati invariati dalle piattaforme che le ospitano.

• Input — GPT-6 Sol 2,00 $ per milione di token vs Claude Opus 5 5,00 $ per milione di token

• Output — GPT-6 Sol 10,00 $ per milione di token vs Claude Opus 5 25,00 $ per milione di token

• Lettura cache — GPT-6 Sol $0,20 per milione di token rispetto a Claude Opus 5 $0,50 per milione di token; entrambi sono un 10% fisso della tariffa di input non in cache

• Scrittura cache — GPT-6 Sol $2.50 per milione di token con un singolo TTL vs Claude Opus 5 $6.25 con un TTL di cinque minuti e $10.00 con un TTL di un'ora; il TTL più lungo è un'opzione che OpenAI non offre, ed è il livello che la maggior parte delle tabelle di confronto cita accidentalmente, perché è quello che appare sulle schede del catalogo ospitato

• Gestione del contesto lungo — GPT-6 Sol applica a una richiesta che supera la sua soglia di input una tariffa più alta per l'intera richiesta; Claude Opus 5 non applica alcun sovrapprezzo per il contesto lungo, quindi una richiesta da 900.000 token viene fatturata allo stesso costo per token di una da 9.000 token

• Batch — GPT-6 Sol ha un endpoint batch con sconto standard rispetto alla Message Batches API di Claude Opus 5 al 50% di sconto in entrambe le direzioni, e lo sconto batch di Anthropic si cumula con il prompt caching

• Finestra di contesto — 1.050.000 token per GPT-6 Sol vs 1.000.000 token per Claude Opus 5

• Output massimo — 128.000 token per entrambi, con Claude Opus 5 che lo porta a 300.000 sull'API Message Batches con l'header beta output-300k-2026-03-24

Lo stack batch più caching è la voce di cui si parla meno in questo elenco ed è quella che cambia maggiormente i calcoli. Uno sconto batch del 50% che si combina con una lettura della cache a un decimo della tariffa di input è un'offerta diversa da uno sconto batch del 50% da solo, e per i lavori di sintesi lunghi — dove si applica anche il limite di output batch di 300.000 token di Anthropic — colma una parte significativa di un divario che al prezzo di listino sembra incolmabile.

A two-column scoreboard card titled 'GPT-6 Sol vs Claude Opus 5 - the scoreboard'. Left column 'GPT-6 Sol': AA Index, max effort 48; AA Index, default effort 48; cost per task, max $1.06; cost per task, default $0.37; price in/out $2 / $10; context window 1.05M. Right column 'Claude Opus 5': AA Index, max effort 51; AA Index, default effort 48; cost per task, max $5.86; cost per task, default $3.61; price in/out $5 / $25; context window 1M. A footer line reads 'Vendor list prices; index figures per Artificial Analysis.', with the real OrcaRouter logo bottom-right.

La scala dell'impegno è il vero confronto

Ecco il numero che dovrebbe essere presente in ognuno di questi articoli. Su Artificial Analysis, il cui harness è l'unico neutrale che pubblica una scala completa di effort per entrambi i modelli, Claude Opus 5 ottiene 51 con effort massimo e costa 5,86 $ per task dell'indice. Con l'impostazione predefinita high ottiene 48 e costa 3,61 $. GPT-6 Sol ottiene 48 con effort massimo e costa 1,06 $ — e 43 con effort high per 0,37 $.

Leggi insieme quelle due righe. Claude Opus 5, eseguito con l'impostazione di effort che Anthropic fornisce come predefinita, ottiene esattamente lo stesso punteggio di indice di GPT-6 Sol spinto al massimo. Il divario riportato dalla copertura del lancio — tre punti — esiste solo se si confronta ciascun modello al massimo della propria scala, e il massimo della scala non è il punto in cui l'uno o l'altro modello viene eseguito per impostazione predefinita. Il vantaggio di Opus 5 con effort al massimo è reale e ottenerlo costa circa cinque volte e mezzo in più per attività completata.

Due avvertenze di onestà vanno unite a quelle cifre, ed entrambe mancano dalle pagine che le citano.

• La versione dell'indice cambia. Il punteggio di Opus 5 è stato pubblicato come 61, 63, 54 e 51 nel corso delle revisioni successive dell'indice Artificial Analysis da luglio. Nessuno di questi è sbagliato; ognuno di essi è sbagliato senza la sua etichetta di versione. Il 51 qui sopra è la classifica attuale, e non è confrontabile con un 61 citato in un articolo del giorno del lancio.

• Le scale di effort non sono calibrate tra fornitori. Un "high" su un modello non equivale alla stessa quantità di ragionamento di un "high" sull'altro. Punteggi coincidenti a impostazioni nominalmente diverse sono un'evidenza sul costo, non su un'equivalenza di capacità.

Dove la documentazione indipendente è più esile di quanto sembri

Claude Opus 5 ha alle spalle otto settimane di misurazioni di terze parti e una serie di numeri di lancio dichiarati dal fornitore, chiaramente etichettati come tali — Frontier-Bench v0.1 al 43,3%, ARC-AGI-3 al 30,2%, GDPval-AA v2 a 1.861 Elo. Ognuno di questi è stato misurato rispetto a GPT-5.6 Sol o Claude Fable 5, non rispetto a GPT-6 Sol. Non esiste alcun risultato da harness condiviso che metta Opus 5 e GPT-6 Sol a confronto diretto sui benchmark di Anthropic, e la scheda di sistema di Anthropic ammette che il modello non è complessivamente più capace di Claude Fable 5.

Il resoconto indipendente presenta anche un'avvertenza nella direzione opposta. Nella valutazione AA-Omniscience di Artificial Analysis, il tasso di allucinazione di Opus 5 è del 50%, quattordici punti in più rispetto a Opus 4.8 — la causa documentata è che i rifiuti sono scesi da circa il 23% al 7%, quindi il modello risponde a più domande e sbaglia più risposte. Vals AI ha inoltre reso noto separatamente che Opus 5 e Fable 5 hanno usato Opus 4.8 come fallback per i rifiuti durante le esecuzioni di Terminal-Bench; riclassificare i nove superamenti interessati come fallimenti porta Opus 5 dall'84,64% all'81,27%. Non sono risultati squalificanti, ma un articolo che sostiene che Opus 5 sia la scelta più affidabile deve includerli.

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing an Artificial Analysis Intelligence Index of 48 at maximum reasoning effort and 43 at high effort, a cost per index task of $1.06 and $0.37, a 1.05M-token context window, a 128k-token maximum output, and blended list pricing of $2.00 per million input tokens and $10.00 per million output tokens, above the 'Intelligence Index vs Cost to Run Intelligence' scatter chart with the reasoning-models-only filter applied.

Il record indipendente di GPT-6 Sol, questa settimana, è largo un solo numero: il punteggio dell'indice qui sopra, misurato al massimo sforzo, con diciotto mesi di rilasci di modelli alle spalle in termini di test di terze parti accumulati. Quell'asimmetria — otto settimane di scrutinio contro un solo giorno — è la ragione onesta per cui un acquirente potrebbe ancora pagare il premio quintuplo, ed è una ragione migliore del titolo di tre punti.

Dove un livello di routing modifica la decisione

Claude Opus 5 è nelOrcaRoutercatalogo a 5,00 $ di input, 25,00 $ di output, 0,50 $ di lettura cache e 10,00 $ di scrittura cache per milione di token, con una finestra di 1.000.000 di token, un limite di output di 128.000 token ed entrambi gli endpoint /v1/chat/completions e /v1/messages — prezzi di listino del provider passati tal quali, senza alcun ricarico aggiuntivo, quindi una variazione dei prezzi di Anthropic è attiva dalla nostra parte lo stesso giorno in cui è attiva dalla loro. Il valore di scrittura cache riportato nella model card è la tariffa con TTL di un'ora; il livello da cinque minuti di Anthropic è 6,25 $, e citare l'uno senza specificare quale sia è il modo in cui i due numeri finiscono per sembrare una contraddizione.

GPT-6 Sol non è una delle nostre tratte, quindi nulla di ciò che è qui costituisce un'affermazione sul suo prezzo tramite noi.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), captured 23 September 2026, showing an input price of $5.00 per million tokens, an output price of $25.00 per million tokens, a 1,000,000-token context window, a 128,000-token output cap, reasoning and tools tags, a 'Traffic — Last 7 days' section, and both the /v1/chat/completions and /v1/messages endpoints.

Ciò che un singolo endpoint offre davvero in questo confronto è la capacità di sostenere entrambe le risposte nello stesso momento. Le ragioni a favore di Opus 5 e quelle a favore di Sol dipendono entrambe dallo sforzo, e lo sforzo è un parametro per richiesta, non un contratto. Un team che instrada entrambi i modelli dietro un'unica chiave con failover automatico può inviare il lavoro che richiede il tetto di massimo sforzo di Opus 5 a Opus 5 e il livello di volume a Sol con sforzo medio, senza una seconda integrazione né un secondo insieme di limiti di frequenza. Il DSL di routing compone quella decisione nella chiamata anziché in un progetto di migrazione — il che qui conta in modo specifico, perché la risposta corretta per questa coppia cambia con la richiesta, non con il trimestre.

La regola di decisione

• Lavoro di volume a un livello di qualità noto — GPT-6 Sol a sforzo medio o alto. Quaranta punti indice a 0,25 $ per attività sono la voce credibile più economica su questa board, e il selettore dello sforzo è un parametro documentato, non una supposizione.

• Lavoro che richiede il massimo della gamma di capacità e può permetterselo — Claude Opus 5 a xhigh o max. Tre punti indice sopra il tetto di Sol, da 4,88 a 5,86 $ per attività, e l'unico dei due con un tetto di output batch di 300.000 token.

• Processi batch su grandi corpus — Claude Opus 5, sull'argomento strutturale anziché su quello per token. Nessun sovrapprezzo per contesto lungo, uno sconto batch che si cumula con la cache, e un TTL della cache di un'ora per prefissi che superano una finestra di cinque minuti.

• Qualsiasi cosa in cui una risposta sbagliata costa cara — stando ai dati attuali, nessuno dei due. Il tasso di allucinazione di Opus 5 è salito di quattordici punti con questa release, e il record di terze parti di Sol è largo un solo numero.

• Se il confronto che ti è stato mostrato era "Opus 5 max versus Sol max" — rieseguilo con lo sforzo predefinito prima di decidere. È lì che la decisione viene effettivamente presa, ed è l'unica configurazione che la copertura esistente non ti mostra mai.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno