
Claude Opus 5.5 vs GPT-5.6 Sol: due tabelle di lancio che si sovrappongono a malapena
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Metti Claude Opus 5.5 e GPT-5.6 Sol a confronto questa settimana e la prima cosa che noti non è un vincitore. È che i due fornitori hanno pubblicato tabelle di benchmark che non condividono quasi nessuna riga. Il materiale di lancio di Claude Opus 5.5, rilasciato il 22 settembre 2026, lo colloca 29 punti davanti a GPT-5.6 Sol su Terminal-Bench 4.0. Il materiale di lancio di Sol, disponibile in generale dal 9 luglio 2026, apre invece con Terminal-Bench 2.1, dove Sol Ultra ha ottenuto il 91,9%, e con l'Artificial Analysis Coding Agent Index, dove ha conquistato il primo posto con 80. Entrambe le tabelle sono reali. Entrambe sono state eseguite dal fornitore che le vince. La domanda utile non è quale modello sia migliore in astratto — ma quale benchmark, eseguito con l'harness di chi, ti dica qualcosa sul tuo carico di lavoro. È una domanda più difficile di quanto ciascuno dei post di lancio voglia farti chiedere, ed è quella su cui è costruito questo confronto.
I due modelli, fianco a fianco

• Fornitore — Anthropic vs OpenAI
• Rilasciato — Claude Opus 5.5 il 22 settembre 2026 vs GPT-5.6 Sol il 9 luglio 2026
• Prezzo per milione di token — $4.00 input / $20.00 output vs $5.00 input / $30.00 output
• Lettura cache — $0,20 per milione su Opus 5.5; la tariffa cache di Sol è impostata per piattaforma e non è pubblicata con un unico valore comparabile
• Finestra di contesto — 1M token su entrambi
• Output massimo — 128K token su entrambi, con 300K sull'API Batch di Anthropic dietro un header beta
• Data limite delle conoscenze — giugno 2026 per Opus 5.5 vs 16 febbraio 2026 per Sol
• Controllo del ragionamento — pensiero adattivo sempre attivo, sforzo medio predefinito, la scala va da basso a massimo rispetto a un'impostazione di sforzo massimo di ragionamento, oltre a una modalità Ultra che coordina sub-agenti paralleli
• Gamma — Opus 5.5 è il primo di una famiglia 5.5, con Sonnet 5.5 e Haiku 5.5 promessi nelle prossime settimane, contro Sol come modello di punta di una famiglia a tre livelli insieme a Terra e Luna
Due di quelle righe fanno più lavoro delle altre. Il divario del knowledge cutoff è largo quattro mesi, il che conta se i tuoi prompt toccano qualcosa accaduto questa primavera. E ora Opus 5.5 batte Sol sia sul prezzo di input sia su quello di output — un'inversione rispetto a tre mesi fa, quando Sol era la via più economica per raggiungere un output di livello frontier e Claude Opus 5 si attestava a $5/$25.
Le uniche righe in cui entrambi i modelli compaiono effettivamente
Esiste esattamente una tabella pubblicata che contiene entrambi i modelli, ed è quella di Anthropic. Ogni cifra al suo interno è riportata dal fornitore, prodotta dall'azienda che vende uno dei due modelli:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% contro GPT-5.6 Sol 37,3%
• Terminal-Bench-Science 0.1 — 58,7% vs 22,4%
• FrontierCode v1.1 (Principale) — 54,4% vs 47,5%
• CursorBench 4.0 — 57,8% vs 41,7%
• AutomationBench — 40,0% contro 28,8%
• GDPval-AA v2.1 — 1846 Elo vs 1588
È una vittoria netta, e i margini nelle due righe di Terminal-Bench sono abbastanza ampi da meritare un esame attento piuttosto che un'accettazione acritica. La nota a piè di pagina di Anthropic stessa fa già in parte quel lavoro per te: l'esecuzione di Opus 5.5 su Terminal-Bench ha usato l'impostazione xhigh anziché quella predefinita, e con l'impostazione medium predefinita il vantaggio di FrontierCode si riduce a 54,6% contro 47,5% — un divario di sette punti invece dei numeri da titolo. Anthropic aggiunge anche un'avvertenza generale all'intera tabella, dicendo che a questo livello di capacità i margini dei benchmark sono "una guida meno affidabile alle differenze nel mondo reale" e che il suo divario interno rispetto a Claude Fable 5.1 è più stretto di quanto suggeriscano i punteggi. Un fornitore che ridimensiona la propria tabella è la frase più affidabile al suo interno.
Nota anche ciò che manca in quella tabella: qualsiasi benchmark in cui il modello di OpenAI vince. Una tabella di un fornitore che contiene solo righe favorevoli non è prova di una vittoria totale; è prova di selezione delle righe.
Cosa dicono i numeri di OpenAI stessa
Il materiale di lancio di Sol racconta una storia diversa, su benchmark diversi, con un harness diverso. Riportato al suo lancio di luglio:
• Terminal-Bench 2.1 — 91,9% per Sol Ultra e 88,8% per Sol standard, contro Claude Mythos 5 all'88,0% e Claude Fable 5 all'84,3%
• Artificial Analysis Coding Agent Index — 80, all'epoca descritto come lo stato dell'arte, con 2,8 punti in più rispetto a Claude Fable 5
• Agents' Last Exam, flussi di lavoro professionali di lunga durata — 53,6, che OpenAI ha riportato come 13,1 punti in vantaggio su Claude Fable 5
• BrowseComp — 92,2%; OSWorld 2.0 — 62,6%; SWE-Bench Pro — 64,6%
Nessuna di quelle righe include Claude Opus 5.5, perché non esisteva a luglio. La tabella di Sol è stata costruita per battere Fable 5 e Mythos 5, e ci riesce. Se batta Opus 5.5 semplicemente non trova risposta nel materiale di nessuno dei due fornitori — le due tabelle sono state assemblate a due mesi di distanza l'una dall'altra contro avversari diversi.
La riga di SWE-Bench Pro merita una nota specifica, perché è l'unico punto in cui il materiale di lancio di OpenAI mostra il suo modello perdere: 64,6% per Sol contro l'80% per Claude Fable 5. OpenAI ha risposto mettendo in dubbio la validità del benchmark, stimando che circa il 30% dei suoi task sia difettoso. Può benissimo essere vero. È anche un utile promemoria del fatto che «questo benchmark è difettoso» è un'affermazione che entrambi i laboratori fanno, e sempre riguardo al benchmark in cui perdono.
Il problema dell'imbracatura, che nessuna tabella risolve

Il motivo per cui le due tabelle non concordano non è che un fornitore stia mentendo. È che i benchmark di coding agentico misurano un modello più uno scaffold, e gli scaffold sono diversi. Terminal-Bench 4.0 e Terminal-Bench 2.1 sono revisioni diverse della stessa idea, eseguite da persone diverse, con budget degli strumenti diversi e regole di retry diverse. I numeri di Opus 5.5 di Anthropic sono stati prodotti nell'harness di Anthropic; i numeri di Sol di OpenAI nel tooling in stile Codex. Sposta l'uno o l'altro modello nell'harness dell'altro e i punteggi cambiano.
Dati indipendenti, dove esistono, descrivono una gara più serrata di quanto faccia l'una o l'altra tabella. Un benchmark di terze parti di agosto 2026, eseguito su più modelli in lavori applicativi reali, ha indicato GPT-5.6 Sol come la migliore combinazione di accuratezza, costo e velocità — circa 0,52 $ e cinque minuti per esecuzione — mentre Claude Opus 5, non 5.5, è risultato il più accurato, nel 92% delle esecuzioni. Una classifica separata relativa ad attività di codice enterprise ha collocato Claude Opus 5 al primo posto con il 96,4% e GPT-5.6 Sol al terzo con l'86,5%, confrontando ancora Sol con il precedente Opus anziché con quello nuovo. Nessuno dei due è un confronto testa a testa con Opus 5.5, e nessuno dei due dirime la questione. Dimostrano però che quando il confronto lo esegue qualcuno che non è un fornitore, i margini si riducono.
La conclusione pratica è smettere di leggere le tabelle come una classifica e iniziare a leggerle come un elenco di ipotesi. Se il tuo lavoro è automazione da terminale a lungo orizzonte, il divario di Anthropic su Terminal-Bench è un'ipotesi che vale la pena testare sulle tue attività. Se si tratta di ricerca professionale in più fasi, il risultato di Sol su Agents' Last Exam è lo stesso tipo di ipotesi. Nessuno dei due numeri è trasferibile al tuo carico di lavoro senza un'esecuzione.
Costo per attività completata, che è l'unico costo che conta
Sulla tabella dei prezzi, Claude Opus 5.5 è ora più economico in entrambe le direzioni: 4,00 $ contro 5,00 $ in input, 20,00 $ contro 30,00 $ in output, e una tariffa di lettura della cache di 0,20 $ che è inferiore del 60% rispetto a quanto addebitava Claude Opus 5. Per un agente che rinvia un lungo prompt di sistema a ogni turno, quella voce di cache è il costo dominante e il motivo per cui una sessione di lunga durata può diventare sostanzialmente più economica senza alcuna modifica del prompt.
Ma il prezzo per token non ha mai deciso la bolletta di un agente. La tesi di OpenAI per Sol al lancio si basava sull'efficienza dei token più che sul prezzo di listino — ha riportato un miglioramento del 54% nell'efficienza dei token di codifica, con token di output e tempo trascorso inferiori alla metà di quelli di Claude Fable 5 a un costo inferiore di circa un terzo. Anthropic sostiene l'argomento speculare per Opus 5.5: costo inferiore di circa il 40% per l'esecuzione su carichi di lavoro tipici rispetto a Claude Opus 5, su una tariffa che è scesa solo del 20%, con dichiarazioni dei clienti di Box, Kiro, Factory e GitHub che citano tutte grandi riduzioni di token o passaggi. Entrambe le affermazioni puntano nella stessa direzione — vince il modello che termina in meno turni — e nessuna delle due è verificata in modo indipendente.
Dove esiste un calcolo indipendente del costo per attività, attualmente favorisce Sol: un'analisi pubblicata a settembre collocava GPT-5.6 Sol a 1,56 $ per problema risolto su SWE-bench Verified con il 96,2% di successo, contro Claude Opus 4.8 all'88,6%. Si tratta di Sol misurato rispetto a un modello Anthropic più vecchio, non rispetto a Opus 5.5, quindi è un punto di partenza più che un verdetto — ma ricorda che un modello che risolve il problema al primo tentativo è più economico di un modello meno costoso che richiede tre passaggi. L'unica misurazione che lo risolve per te è la tua stessa attività, eseguita in entrambi i modi, con i conteggi dei token davanti a te.
Questo è più un problema di routing che di approvvigionamento, e vale la pena essere precisi su quale dei due lati sia già risolvibile. GPT-5.6 Sol è già su OrcaRouter oggi al prezzo di listino di OpenAI stesso con 0% di ricarico — il prezzo di listino del provider viene trasferito direttamente, così una variazione delle tariffe del fornitore è attiva dalla nostra parte lo stesso giorno anziché dopo una sincronizzazione. Claude Opus 5.5 non è ancora una delle nostre rotte; è disponibile tramite l'API di Anthropic e i principali cloud. Una volta arrivato, la stessa chiave serve entrambi, ed è questo che trasforma l'esperimento in una regola di routing invece che in un secondo contratto e un secondo SDK: invia il carico di lavoro al modello che i tuoi numeri favoriscono, mantieni il failover automatico puntato sull'altro, e lascia che una riga di DSL di routing decida per singola richiesta anziché per trimestre. Un taglio di prezzo da una parte o dall'altra è una modifica di configurazione, non una migrazione.

Dove i due si differenziano realmente
Togli i benchmark e restano quattro differenze, tutte verificabili:
• Data limite delle conoscenze. Giugno 2026 per Opus 5.5 contro il 16 febbraio 2026 per Sol. Quattro mesi sono un divario reale per qualunque cosa tocchi librerie recenti, eventi recenti o API modificate di recente, e nessun benchmark lo rileva.
• Salvaguardie di routing. Opus 5.5 viene fornito con salvaguardie di livello Fable 5.1: la maggior parte delle richieste di cybersecurity viene reindirizzata a Claude Opus 4.8 e il lavoro di biologia ricade su Claude Opus 5, a meno che l'account non sia verificato. Se il tuo prodotto rientra in uno di questi due ambiti, parte del tuo traffico riceve risposta da un modello più piccolo. Sol non presenta alcun routing documentato equivalente, sebbene OpenAI segnali le proprie valutazioni di sicurezza legate al cyber.
• Orchestrazione. Sol offre una modalità Ultra che coordina più sub-agenti paralleli, quattro per impostazione predefinita, e un'impostazione di massimo sforzo di ragionamento. Opus 5.5 non ha nessuna delle due come funzionalità di piattaforma; la sua leva è il parametro effort, e la composizione multi-modello è qualcosa che costruisci o instradi tu, non qualcosa che il fornitore ti consegna.
• Economia della famiglia. Sol è uno dei tre livelli, con Terra e Luna al di sotto — e il prezzo di Luna è stato ridotto dell'80% e quello di Terra del 20% in un aggiornamento del 30 luglio. I fratelli più economici di Anthropic, Sonnet 5.5 e Haiku 5.5, sono stati annunciati ma non ancora rilasciati. Se il tuo carico di lavoro è misto, OpenAI al momento offre i gradini più economici oggi.
Scegliere tra loro
Scegli Claude Opus 5.5 se il tuo lavoro è programmazione agentica o lavoro intellettuale a lungo termine, se il prezzo per token conta, se i tuoi prompt riguardano qualcosa degli ultimi quattro mesi, o se un contesto da 1M di token a $0,20 per milione in cache è ciò che rende la tua architettura accessibile. Inizia con livello medio di impegno, non l'impostazione alta ereditata, e misura se quello basso regge.
Scegli GPT-5.6 Sol se desideri una modalità di orchestrazione inclusa dal fornitore, se hai bisogno oggi di un livello più economico sotto il flagship anziché tra qualche settimana, o se il tuo carico di lavoro è del tipo che le prove di lancio di Sol coprono meglio — flussi di lavoro professionali a lungo orizzonte e uso del computer, dove ha riportato i suoi risultati migliori.
Se usi già Claude Opus 5, tieni presente che Opus 5.5 non è un sostituto diretto: il thinking non può più essere disattivato, l'uso forzato degli strumenti restituisce un errore, i blocchi di thinking sono vincolati al modello e alla conversazione, e il più vecchio strumento di computer use computer_20251124 non è accettato sull'API di Claude né su Google Cloud. I primi tre punti valgono anche per Claude Fable 5.1. Passare a Sol è un'integrazione del tutto diversa.
Ciò che risolverebbe davvero questo confronto sarebbe una singola esecuzione indipendente di entrambi i modelli a parità di sforzo, in un ambiente di test identico, sullo stesso insieme di attività. A oggi nessuno ne ha pubblicato una. Finché qualcuno non lo farà, la posizione onesta è quella che le evidenze supportano: la tabella di Anthropic favorisce Opus 5.5 ed è stata prodotta da Anthropic; la tabella di OpenAI favorisce Sol ed è stata prodotta da OpenAI; i risultati indipendenti esistenti confrontano Sol con il precedente Opus e descrivono una gara molto più equilibrata; e le due righe che decideranno la tua fattura — token per attività completata e volume di lettura della cache — sono le due righe che nessuno dei due fornitori pubblica.
Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
