
GPT-6 vs Claude Opus 5: entrambe le parti di questa sfida sono già state sostituite
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
The most useful thing to know about GPT-6 versus Claude Opus 5 is that both halves of the matchup are one generation behind their own vendors. Claude Opus 5 shipped on 24 July 2026 and was replaced by Claude Opus 5.5 on 22 September. GPT-6 Sol shipped on 22 September and was replaced by GPT-6.1 Sol on 29 September. If you searched for this comparison because you are choosing between them for new work, you are choosing between two models that each vendor has already moved past — and the honest version of this article is about when the older pair is still the right call, not about who wins.
Cosa sono davvero i due modelli
Claude Opus 5 era il modello di punta di Anthropic: una finestra di contesto di 1.000.000 di token, 128.000 token di output massimo, input di testo, immagini e file, elencato a 5,00 $ per milione di token di input e 25,00 $ per milione di token di output, con una tariffa di 0,50 $ per l'input in cache e di 10,00 $ per la scrittura in cache. Si tratta di un singolo modello con un singolo id, anthropic/claude-opus-5.
GPT-6 Sol è il livello intermedio di una generazione di tre modelli — GPT-6 Astra sopra di esso e GPT-6 Luna sotto di esso — con lo stesso contesto di oltre 1.000.000 di token (il catalogo indica 1.050.000 per il lato OpenAI contro 1.000.000 di Opus 5), lo stesso limite di output di 128.000 token e lo stesso input di testo/immagini/file. Ha un prezzo di listino di $2,00 / $10,00, con una tariffa di $0,20 per l'input in cache e di $2,50 per la scrittura della cache. La sua scheda tariffaria prevede un passaggio che quella di Anthropic non ha: qualsiasi richiesta superiore a 272.000 token di input riprezza l'intera richiesta a $4,00 / $15,00.
Si tratta di un divario di prezzo di 2,5 volte per token a favore di Sol sul fronte dei contesti brevi, e il divario si mantiene anche sulla cache: uno sconto del 90% sull'input in cache su Sol rispetto a uno sconto del 98% su Opus 5, il che riduce la differenza a 0,20 $ contro 0,50 $ per milione anziché eliminarla. Su un carico di lavoro con contesto lungo, il divario si dimezza anziché chiudersi.
• Input — GPT-6 Sol 2,00 $ per milione vs Claude Opus 5 5,00 $
• Output — GPT-6 Sol 10,00 $ per milione vs Claude Opus 5 25,00 $
• Input in cache — GPT-6 Sol 0,20 $ per milione vs Claude Opus 5 0,50 $
• Scritture in cache — GPT-6 Sol 2,50 $ per milione vs Claude Opus 5 10,00 $
• Oltre 272K di input — GPT-6 Sol riprezza l'intera richiesta a 4,00 $ / 15,00 $; nessun passaggio equivalente sulla scheda di Opus 5
• Contesto e output — 1.050.000 in input e 128.000 in output vs 1.000.000 in input e 128.000 in output
Il consiglio indipendente, il divario è maggiore del prezzo.
Il prezzo favorisce GPT-6 Sol di 2,5 volte. La classifica favorisce Claude Opus 5 più di quanto il divario di prezzo lascerebbe pensare, il che è l'opposto della solita storia del modello economico.
• AA Intelligence Index — Claude Opus 5 50,8, classificato 11°; GPT-6 Sol 47,6, classificato 14°
• AA Coding Index — Claude Opus 5 78,0, classificato 2° in quella classifica; GPT-6 Sol 60,0
• GPQA Diamond — Claude Opus 5 93,2
• Humanity's Last Exam — Claude Opus 5 54,9 vs GPT-6 Sol 47,9
• Terminal-Bench 2.1 — Claude Opus 5 89,1
• Terminal-Bench 4.0 — Claude Opus 5 49,0 vs GPT-6 Sol 43,9
• τ-bench banking — Claude Opus 5 42,1
• SciCode — Claude Opus 5 56,4 vs GPT-6 Sol 57,6
• Richiamo su contesto lungo — Claude Opus 5 79,3 vs GPT-6 Sol 83,7
Due righe vanno nel verso opposto e vale la pena menzionarle, perché l'aggregato le nasconde. GPT-6 Sol batte Opus 5 sul recall a contesto lungo di 4,4 punti e lo supera di poco su SciCode di 1,2. Quindi il quadro onesto non è "Opus 5 è migliore in tutto" — è che Opus 5 è decisamente avanti nelle classifiche di coding e agentiche (un vantaggio di 24 punti nel Coding Index è un risultato di un'altra categoria) mentre Sol detiene la riga del recupero su finestra lunga e pareggia su una delle due misure di codice scientifico.
Un'avvertenza metodologica prima che uno dei due numeri venga citato altrove: Artificial Analysis non garantisce che due pagine di modelli siano renderizzate sulla stessa revisione dell'indice nello stesso giorno, e suddivide i suoi gruppi di confronto: i modelli open-weights sono classificati rispetto ad altri modelli open-weights della stessa classe dimensionale, i modelli proprietari all'interno di una fascia di prezzo proprietaria. Entrambi i modelli qui sono proprietari, quindi le due cifre provengono dallo stesso lato di quella linea, ma considera le differenze inferiori al punto come un'indicazione di direzione anziché come una misurazione controllata. Ogni cifra di fornitore presente in questo articolo è il fornitore che sottopone a benchmark il proprio modello rispetto al proprio predecessore ed è etichettata come tale.
Che cosa hanno cambiato le due sostituzioni
Claude Opus 5.5 è arrivato il 22 settembre a $4.00 / $20.00 — più economico di Opus 5 su entrambe le tariffe, con una tariffa di input in cache di $0.20 che corrisponde a quella di Sol — e ottiene 57.6 sullo stesso Intelligence Index. Sono 6.8 punti in più di Opus 5 per il 20% in meno di costo. Qualsiasi argomento per mantenere Opus 5 in una nuova build deve spiegare perché valga la pena restare sul checkpoint più vecchio al costo di 6.8 punti di indice e $1.00/$5.00 per milione.
GPT-6.1 Sol è arrivato il 29 settembre allo stesso prezzo di $2,00 / $10,00 di GPT-6 Sol, ottenendo 51,8 sull'indice contro il 47,6 di Sol, con una tariffa di $0,10 per l'input in cache che dimezza la lettura dalla cache. È lo stesso prezzo con un punteggio migliore e un'economia della cache migliore. L'unico argomento a favore specificamente di GPT-6 Sol è lo stesso che vale per Opus 5: una suite di regressione che era stata basata su di esso, dove cambiare il modello invalida i confronti di cui ti fidi già.
C'è una seconda ragione, più silenziosa, per cui un team resta sulla coppia più vecchia, e non ha nulla a che fare con i benchmark. Entrambi questi sono i checkpoint con la storia produttiva più lunga alle spalle. Opus 5 è invocabile dal 24 luglio e GPT-6 Sol dal 22 settembre, e le misurazioni del valutatore indipendente su entrambi vanno avanti da abbastanza tempo da mostrare una forma anziché una singola lettura. Gli ultimi sette giorni di traffico di Sol sui nostri dati di routing ammontano a circa 2,1 milioni di token; quelli di Opus 5 a circa 23,0 milioni. Si tratta di una finestra mobile, non di un totale complessivo, e cambiano da una lettura all'altra — ma sono un promemoria del fatto che Opus 5 sta ancora facendo lavoro reale in produzione anche dopo che il suo sostituto è stato rilasciato.
La forma della latenza e dei costi, ed è qui che Sol si ripaga.
• Tempo mediano al primo token — GPT-6 Sol 6.785 ms vs Claude Opus 5 4.652 ms
• Velocità mediana di output — GPT-6 Sol 179,6 token/s vs Claude Opus 5 82,2 token/s
• Traffico su sette giorni osservato dalla nostra parte — GPT-6 Sol ~2,1M token, Claude Opus 5 ~23,0M token
Sol risponde con il suo primo token dopo circa 2,1 secondi, ma poi trasmette in streaming a una velocità più che doppia rispetto a Opus 5. In una generazione lunga — il tipo di esecuzione in cui l'output è di migliaia di token anziché di decine — è quel secondo numero a dominare, e un modello economico che termina prima vale più di quanto suggerisca il suo listino. In una chiamata breve e sensibile alla latenza, è il dato del primo token quello che l'utente percepisce.
Entrambe queste sono misurazioni di serving provenienti dal nostro routing, rilevate su una finestra scorrevole di sette giorni, e fluttuano tra una lettura e l'altra. Sono utili per confrontare la forma dei due modelli e non per essere citate come aspettativa a livello di servizio.

Eseguire la coppia mentre la migrazione è indecisa
Il motivo per cui vale la pena rispondere a questo confronto è che nessuna delle due sostituzioni è una decisione da prendere senza pensarci. Se le tue valutazioni sono state costruite su Claude Opus 5, passare a Opus 5.5 significa rifare la baseline, non fare un upgrade; lo stesso vale per GPT-6 Sol rispetto a GPT-6.1 Sol. La cosa utile da fare in quella finestra è far girare entrambe le generazioni fianco a fianco sul tuo traffico, invece di scegliere dalla classifica di qualcun altro.
Tutti e quattro i modelli si trovano nello stesso catalogo su OrcaRouter — Claude Opus 5, Claude Opus 5.5, GPT-6 Sol e GPT-6.1 Sol, richiamati tramite un'unica API davanti a oltre 200 modelli, con il prezzo di listino del provider passato senza alcun ricarico (0% di markup), così un taglio di prezzo del fornitore arriva qui lo stesso giorno anziché alla tua prossima riconciliazione — il che rende il confronto una questione di routing più che di acquisti. Il DSL di routing ti permette di suddividere per dimensione della richiesta o per quota: invia una fetta del traffico di produzione al checkpoint più recente, confrontala con la baseline sulle tue valutazioni, amplia la fetta quando i numeri reggono e mantieni il modello più vecchio come fallback finché non reggono. Failover automatico tra provider copre il caso in cui una route peggiora nel bel mezzo della migrazione, ovvero la modalità di guasto che spinge le persone ad abbandonare una migrazione a metà strada.


Chi dovrebbe scegliere quale, dato che entrambi sono superati?
Se stai iniziando qualcosa di nuovo: nessuno dei due. Claude Opus 5.5 costa meno di Claude Opus 5 e ottiene 6,8 punti in più, e GPT-6.1 Sol ha lo stesso prezzo di GPT-6 Sol con un indice migliore e una lettura in cache dimezzata. L'unico motivo per iniziare con la coppia più vecchia è una dipendenza rigida da un checkpoint che non puoi modificare.
Se stai già eseguendo uno di essi: la decisione riguarda la tua suite di regressione, non le classifiche. Claude Opus 5 resta il modello di coding e agentico più forte dei due, con un ampio margine, quindi una pipeline di coding stabile su di esso dovrebbe confrontarsi con Opus 5.5 invece di migrare lateralmente a un tier GPT-6. Una pipeline ad alto volume e sensibile ai costi su GPT-6 Sol ha l'upgrade più facile — stesso prezzo, punteggio migliore, cache migliore — e l'unica ragione onesta per rimandare è solo che non hai ancora rieseguito le tue valutazioni.
E se la risposta che volevi era semplicemente quale dei due vince: lo fa Claude Opus 5, su quasi tutte le classifiche, per 2,5 volte il prezzo. La tesi di GPT-6 Sol non è mai stata che fosse migliore. Era che fosse abbastanza economico da valere la differenza — e quella tesi ora appartiene a GPT-6.1 Sol allo stesso prezzo con un punteggio migliore.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
