Scheda hero intitolata Claude Sonnet 5.5 vs GPT-6 Sol, con sottotitolo il tier da $2 ora contiene due flagship, con pill che riportano stesso prezzo: $2 / $10, Indice 56 vs 47 e contesto 1M vs 1,05M, e un piè di pagina che cita Artificial Analysis v4.3.2 e i prezzi dei fornitori.
Guides & Insights

Claude Sonnet 5.5 vs GPT-6 Sol: nel tier da $2 ora ci sono due flagship

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Claude Sonnet 5.5 e GPT-6 Sol hanno lo stesso prezzo — 2 $ per milione di token in input, 10 $ per milione di token in output — e sono arrivati a sei giorni di distanza l'uno dall'altro alla fine di settembre 2026. Quella coincidenza non è la parte interessante. La parte interessante è che, quando Artificial Analysis li ha misurati entrambi sul suo v4.3.2 Intelligence Index, il modello di fascia media di Anthro​pic è risultato in vantaggio rispetto al modello che Open​AI vende come suo modello di punta: 56 per Claude Sonnet 5.5 contro 47 per GPT-6 Sol. Sulla stessa revisione, Claude Sonnet 5 — il modello che Claude Sonnet 5.5 sostituisce — si attesta a 38.

Quindi non si tratta più di un confronto tra una fascia economica e una costosa. È un confronto tra due modelli allo stesso prezzo, provenienti da due laboratori, con una differenza di 18 punti tra quello di Anthro​pic e il suo stesso predecessore, e una differenza di nove punti a favore di Anthro​pic rispetto al rilascio di fascia alta di Open​AI. Tutto ciò che segue è un tentativo di capire quali di quei divari sopravvivono al contatto con un carico di lavoro reale, e quali sono un artefatto di benchmark.

Cosa è realmente ciascun modello

Claude Sonnet 5.5 è il secondo modello della generazione 5.5 di Anthropic, rilasciato il 28 settembre 2026, cinque giorni dopo il lancio di Claude Opus 5.5 che lo aveva promesso. Porta l'id claude-sonnet-5-5 sull'API di Claude, Amazon Bedrock, Google Cloud e Microsoft Foundry, mantiene la finestra di contesto da 1M di token e il tetto di output di 128K della fascia e conserva esattamente i prezzi di Claude Sonnet 5: 2 $ in ingresso, 10 $ in uscita, 0,20 $ per milione per le letture dalla cache, 2,50 $ per una scrittura in cache di cinque minuti. È disponibile con ritenzione zero dei dati fin dal primo giorno, e l'impegno di Anthropic al ritiro del modello arriva fino al 28 settembre 2027.

Two-column scoreboard for Claude Sonnet 5.5 and GPT-6 Sol across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column GPT-6 Sol: input $2.00 per million, output $10.00 per million up to 272K then $4 / $15, 1,050,000-token context, AA Intelligence Index 47, cost per task not published, released September 22 2026. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

GPT-6 Sol è il successore del modello chiamato in modo confuso GPT-5.6 Sol — quello che OrcaRouter elenca ancora come raggiungibile a $4 in input e $20 in output, e che Artificial Analysis ha da allora contrassegnato come deprecato con un rimando a GPT-6 Sol. Il nuovo modello è arrivato il 22 settembre 2026 a $2 / $10 con una finestra di contesto di 1.050.000 token, un tetto di output di 128K e una tariffa a scaglioni: la tariffa principale di $2 / $10 si applica fino a 272.000 token di input, e tutto ciò che supera tale soglia viene fatturato a $4 / $15.

Quell'ultimo dettaglio è il primo punto in cui l'impostazione dei "prezzi identici" crolla.

La parità di prezzo è vera solo per prompt brevi.

Entrambi i listini tariffari indicano 2 $ e 10 $, e quasi ogni confronto del giorno di lancio si è fermato lì. Mettili a confronto sulle condizioni che determinano una bolletta:

• Tariffa principale — Claude Sonnet 5.5 $2 / $10 vs GPT-6 Sol $2 / $10

• Tariffa per contesto lungo — Sonnet 5.5 fattura l'intera finestra da 1M alla tariffa standard; GPT-6 Sol raddoppia a $4 / $15 oltre 272.000 token di input

• Finestra di contesto — 1.000.000 di token vs 1.050.000 di token

• Output massimo — 128K token sull'API sincrona per entrambi; Sonnet 5.5 raggiunge 300K sulla Message Batches API dietro l'output-300k-2026-03-24intestazione

• Sconto batch — 50% di sconto su input e output per Sonnet 5.5; controlla le condizioni attuali di OpenAI per Sol invece di dare per scontata la parità

• Letture cache — $0,20 per milione su entrambi

Una scansione di repository da 800.000 token costa il doppio per token su GPT-6 Sol rispetto a Claude Sonnet 5.5, ed è esattamente il carico di lavoro per cui entrambi i modelli sono pubblicizzati. Se i tuoi prompt sono brevi, i listini tariffari sono davvero in parità e il prezzo non dovrebbe decidere nulla. Se sono lunghi, lo ha già fatto.

Il tabellone di Anthropic stesso, letto attentamente

Anthropic ha pubblicato un confronto a quattro colonne rispetto a Claude Sonnet 5, Claude Opus 5.5 e GPT-6 Sol. I dati dichiarati dal fornitore, che nessuna terza parte ha ancora riprodotto:

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

• Terminal-Bench 4.0 — Sonnet 5.5 70,6% vs Sonnet 5 10,3%

• FrontierCode 1.1, Main — Sonnet 5.5 46,2% con sforzo Max, Sonnet 5 42,4%, Opus 5.5 54,4%, GPT-6 Sol 49,3%

• CursorBench 4.0 — Sonnet 5.5 55,5% vs Sonnet 5 34,1% vs Opus 5.5 57,8%

• GDPval-AA v2.1 — Sonnet 5.5 1844 contro Sonnet 5 1449 contro Opus 5.5 1846 contro GPT-6 Sol 1487

• AA-Briefcase v1.1 — Sonnet 5.5 1811 vs Sonnet 5 1359 vs Opus 5.5 1822 vs GPT-6 Sol 1483

• Humanity's Last Exam, con strumenti — Sonnet 5.5 64,5% vs Sonnet 5 54,9% vs Opus 5.5 67,7%

• OSWorld 2.1, parziale — Sonnet 5.5 80,1% vs Sonnet 5 57,0% vs Opus 5.5 81,8%

• Chartography, senza strumenti — Sonnet 5.5 61,6% vs Sonnet 5 15,6% vs Opus 5.5 64,4% vs GPT-6 Sol 53,6%

Due di quelle righe contengono note a piè di pagina ed entrambe contano. Le cifre GDPval-AA, AA-Briefcase e Chartography per GPT-6 Sol sono segnalate da Anthropic come misurate dopo una correzione della comprensione delle immagini da parte di OpenAI, e il numero FrontierCode per Sonnet 5.5 è il suo risultato con Max-effort, che, osserva Anthropic, è risultato inferiore al suo stesso risultato Xhigh nella stessa valutazione. Un fornitore che si confronta con un rivale su un benchmark che gestisce lui stesso, con note a piè di pagina che precisano entrambe le parti, non è una prova neutrale. È la migliore prova disponibile il giorno del lancio, e non è la stessa cosa di una misurazione.

Cosa dicono i numeri indipendenti, e cosa non dicono

Artificial Analysis ha pubblicato una prima esecuzione indipendente: Index 56 su v4.3.2, un costo di 7,60 $ per attività Index e un valore di verbosità di 410 M token di output rispetto a una mediana di 88 M. Quel numero di verbosità merita più attenzione di quanta ne stia ricevendo. Significa che il modello tende a spendere moltissimi token per arrivare a una risposta, ed è il meccanismo dietro l'unica affermazione di efficienza che non proviene dalla tabella di Anthropic stessa.

Anthropic afferma che Claude Sonnet 5.5 genera output il 30% più velocemente di Claude Sonnet 5 e costa "fino al 30% in meno per attività" allo stesso prezzo per token. Insieme, queste due affermazioni descrivono un modello che svolge lo stesso lavoro con meno token, non una tariffa più economica. Se ciò regga è esattamente a questo che serve una lettura della verbosità su 410M di token, e una singola esecuzione indipendente non basta a stabilirlo — ma basta a dire che la frase di marketing e il conteggio misurato dei token puntano in direzioni opposte, e quello misurato è quello che compare in fattura.

Nota anche ciò che l'indice indipendente non contiene ancora. Non esiste alcuna replica pubblicata di OSWorld, Terminal-Bench o CursorBench da parte di soggetti diversi da Anthropic. E il 56 è un punteggio composito: non dice nulla su quale delle dieci valutazioni al suo interno abbia determinato il divario rispetto al 47 di Sol. Un vantaggio composito di nove punti può nascondere una perdita di quindici punti sull'unica valutazione da cui dipende il tuo carico di lavoro.

Dove divergono in modi che un tariffario non può mostrare

Prezzo e punteggio di indice sono i due assi facili. Quelli che decidono una migrazione sono quelli comportamentali, e qui i due modelli non sono affatto vicini.

OrcaRouter model page for openai/gpt-5.6-sol, attributed to OpenAI and dated 2026-07-09, showing a 1M-token context window, 128K maximum output, text, image and file input, an input price of $4.00 and output price of $20.00 per million tokens, a p50 time to first token of 10.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 ha il pensiero adattivo attivo per impostazione predefinita con high come sforzo predefinito, e rimuove tre cose che la generazione precedente consentiva: inviare thinking: {"type": "disabled"} ora restituisce un 400 e deve essere sostituito con between_tools; l'uso forzato degli strumenti — tool_choice impostato su "any" o su uno strumento denominato — restituisce direttamente un 400; e il vecchio computer_20251124 strumento di uso del computer viene rifiutato sull'API Claude e su Google Cloud a favore di un toolset. I blocchi di pensiero ora sono anche legati al modello che li ha prodotti, quindi una conversazione può passare da Claude Sonnet 5 a Claude Sonnet 5.5 e mantenere il suo ragionamento, ma non può più tornare indietro con esso.

Se il tuo ciclo dell'agente imposta tool_choice: "any" per forzare una chiamata conforme allo schema, Claude Sonnet 5.5 rifiuterà la richiesta finché non passi ad auto con l'uso rigoroso degli strumenti o con gli output strutturati. Si tratta di una vera attività di migrazione, ed è il tipo di cosa che trasforma una sostituzione dell'ID del modello da una riga in un pomeriggio intero.

Il costo di un passaggio a GPT-6 Sol è di natura diversa, perché il modello che sostituisce è ancora in catalogo e viene ancora chiamato. GPT-5.6 Sol non è ritirato; è deprecato presso Artificial Analysis, ha un prezzo doppio rispetto al nuovo modello e riceve ancora traffico. Le misurazioni di OrcaRouter stesso mostrano che muove circa 95 milioni di token a settimana, un proxy ragionevole di quante integrazioni non siano ancora migrate. Passare a GPT-6 Sol è una decisione di prezzo che puoi prendere più avanti; non devi prenderla ora.

Esecuzione del confronto su una chiave

Il problema pratico di un confronto tra due fornitori è che di solito costa due account, due percorsi SDK e due set di limiti di velocità prima di imparare qualcosa. OrcaRouter esiste per ridurre tutto questo: un endpoint compatibile con OpenAI, oltre 200 modelli, prezzo di listino del fornitore passato senza ricarico, e failover automatico tra fornitori.

Entrambi i modelli che contano qui sono instradabili su di essa già oggi. GPT-6 Sol è nel catalogo a $2 / $10 con il livello long-context intatto, e Claude Sonnet 5 — il modello su cui gira ancora la maggior parte del traffico dell'API Claude, con una velocità misurata di 150 token di output al secondo e un tempo p50 al primo token di circa cinque secondi — è sulla piattaforma dal 30 giugno ai $2 / $10 di Anthropic.

Claude Sonnet 5.5 di per sé non è ancora nel nostro catalogo. Se è vero, la via onesta per arrivarci è l'API del fornitore stesso e le tre cloud elencate da Anthropic, e il modo onesto di valutarlo è puntarlo su una porzione di traffico che puoi permetterti di perdere. È a questo che serve il livello di routing: promuovere una percentuale, monitorare il tasso di errore e mantenere il modello precedente come fallback anziché come piano di rollback.

Quale va in produzione?

Scegli in base alla forma del carico di lavoro anziché al punteggio composito.

Claude Sonnet 5.5 è l'acquisto migliore per il lavoro su contesti lunghi, per qualsiasi cosa già scritta sull'interfaccia tool-use e computer-use di Anthropic e per team i cui prompt superano abitualmente i 250.000 token: la finestra a tariffa fissa vale di più, lì, di qualsiasi delta di indice. Accetta che la migrazione porti con sé una checklist: l'uso forzato dei tool, il toggle del thinking, gli abbinamenti dei tool advisor e una modifica al tool computer-use.

GPT-6 Sol è la scelta di continuità più sicura per uno stack modellato su OpenAI, e anche quella più economica se i tuoi prompt sono brevi e le tue integrazioni sono già costruite. Il suo vantaggio non è la capacità — nel punteggio composito è indietro — ma il fatto che il suo predecessore sia ancora operativo e che la migrazione non abbia scadenza.

Sui numeri disponibili oggi, Claude Sonnet 5.5 vince il confronto diretto sull'indice indipendente e sull'economia del contesto lungo, e non perde su nulla che qualsiasi misurazione pubblicata sia ancora in grado di rilevare oltre alla fiducia nella tabella del fornitore stesso. Questa è un'affermazione più ristretta di quella fatta dal materiale di lancio, ed è quella su cui vale la pena agire.

Ciò che cambierebbe la risposta è una seconda esecuzione indipendente sulle valutazioni agentiche, e un dato pubblicato sui token per attività per entrambi i modelli sulle stesse attività. Finché non esistono entrambi, l’indice composito è un vantaggio di nove punti per il modello meno costoso da eseguire, e un vantaggio composito di nove punti non è la stessa cosa di un vantaggio di nove punti sul tuo carico di lavoro.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno