
Claude Sonnet 5.5 vs Claude Opus 5.5: i benchmark convergono, il conto no
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 984 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 195 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Claude Sonnet 5.5 ha raggiunto la disponibilità generale il 28 settembre 2026 a 2,00 $ per milione di token di input e 10,00 $ per milione di token di output. Claude Opus 5.5, il fiore all'occhiello di Anthropic, è stato rilasciato sei giorni prima, il 22 settembre, a 4,00 $ e 20,00 $ — esattamente il doppio su entrambe le voci. La lettura ovvia è che Opus 5.5 sia il tetto massimo e Sonnet 5.5 il compromesso che si accetta quando il budget è reale. La stessa tabella di lancio di Anthropic non supporta questa interpretazione. Sui numeri pubblicati dall'azienda, Claude Sonnet 5.5 totalizza 1844 contro 1846 di Opus 5.5 su GDPval-AA v2.1, 1811 contro 1822 su AA-Briefcase v1.1, e 70,6% contro 66,4% su Terminal-Bench 4.0 — vince l'unico benchmark che misura il lavoro effettivamente svolto all'interno di un terminale. Due righe sotto quelle cifre, la stessa didascalia di Anthropic afferma che Opus 5.5 "rimane chiaramente più forte nel lavoro complesso e aperto". Entrambe le affermazioni sono vere, e capire come tenerle insieme è gran parte dello scopo di questo confronto.
Cosa dice la tabella di lancio, e cosa si rifiuta di dire
Lo schema nel blocco di benchmark di Anthropic è quello di un modello che ha colmato gran parte del divario, piuttosto che di uno che ha preso il comando. GDPval-AA v2.1, un set di attività ponderato economicamente, è un pareggio a due punti. AA-Briefcase v1.1, una valutazione di documenti e deliverable, è un pareggio a undici punti. CursorBench 4.0 va nella direzione opposta: 55,5% per Sonnet 5.5 contro il 57,8% per Opus 5.5. OSWorld 2.1 si attesta all'80,1% contro l'81,8%, e Humanity's Last Exam al 64,5% con strumenti contro il 67,7%. Solo Terminal-Bench 4.0 rompe lo schema, e lo rompe di netto — 70,6% contro 66,4%, un vantaggio di quattro punti per Sonnet sul lavoro agentico da riga di comando.
Leggi le etichette di riga anziché i numeri e compare qualcos'altro. Diverse di quelle voci di Opus 5.5 riportano un'annotazione di effort — 66,4% a Xhigh — e una nota a piè di pagina afferma che la configurazione Max ottiene un punteggio inferiore rispetto a Xhigh su FrontierCode, non superiore. Un effort più alto non è monotono. Un team attento al budget che presume che "max effort" sia un upgrade gratuito sta comprando token per una risposta peggiore su almeno uno dei test di Anthropic. E su FrontierCode 1.1 la stessa nota a piè di pagina colloca Sonnet 5.5 al 46,2% nella configurazione Max contro il 54,4% di Opus 5.5, che è il singolo numero più chiaro su dove il flagship prende ancora il largo: lavoro su codice a lungo orizzonte secondo una definizione del task che premia la persistenza.
C’è un’ulteriore avvertenza che vale la pena affermare apertamente anziché seppellirla. Anthropic osserva che le esecuzioni di GDPval-AA e AA-Briefcase che pubblica sono state effettuate su un deployment pre-rilascio affetto da un bug degli output strutturati. Ciò riguarda entrambi i modelli nella stessa tabella, quindi il confronto non è invalidato, ma significa comunque che i valori assoluti dovrebbero essere considerati un’istantanea anziché un risultato consolidato. Le tabelle di benchmark dei fornitori sono artefatti di marketing con un’appendice metodologica, e questa include la sua appendice.
Dove arriva la misurazione indipendente
Artificial Analysis valuta entrambi i modelli con un unico harness, nella stessa configurazione che etichetta "Adaptive Reasoning, Max Effort, Default Fallback", sull'Intelligence Index v4.3. Claude Opus 5.5 si colloca a 58. Claude Sonnet 5.5 si colloca a 56. Si tratta di un divario di due punti su una scala in cui lo stesso valutatore posiziona Opus 5 a 51, Sonnet 5 a 38, DeepSeek V4 Pro a 36 e Gemini 3.1 Pro Preview a 30. Un nuovo Sonnet che arriva a due punti sotto il modello di punta e cinque punti sopra la precedente generazione di Opus è l'affermazione sostanziale di questo rilascio, e si tratta di un'affermazione di terze parti, non di un fornitore.
Poi la stessa pagina ribalta l'economia della questione. Artificial Analysis riporta che un'esecuzione di valutazione di Sonnet 5.5 costa 7,60 $ per attività contro 5,98 $ per Opus 5.5, anche se Sonnet 5.5 costa la metà per token. La causa è proprio lì nella pagina: Sonnet 5.5 ha generato 410 milioni di token sull'intera suite di indici contro una mediana di 88 milioni per i modelli che monitora — "molto verboso", secondo le parole del valutatore. Opus 5.5 ha generato 260 milioni sulla stessa suite. A 10 $ per milione di token di output contro 20 $, il fattore di verbosità di circa 1,6 lascia comunque Sonnet 5.5 a pagare circa il 27% in più per attività completata.
Questa è la parte del confronto che un listino prezzi per token non può mostrarti, ed è il motivo per cui le due cifre coesistono senza contraddizione. Per token, Sonnet 5.5 costa la metà. Per attività completata, su una suite di valutazione con prompt aperti e senza disciplina sulla lunghezza dell'output, può essere più costoso. Quale di queste descrive il tuo carico di lavoro è la decisione effettiva.
Livelli di effort, tetti di output e la forma dell'integrazione
Per un acquirente, le proprietà meccanicamente importanti sono quasi identiche tra questi due modelli.
• Contesto — 1.000.000 di token su entrambi, dallo stesso provider, quindi le assunzioni di prompt engineering si trasferiscono invariate
• Output massimo — 128.000 token su entrambi; la generazione in blocco non è un elemento distintivo in questo contesto
• Modalità — input di testo, immagini e file su entrambi; nessuno dei due accetta audio o video
• Controllo del ragionamento — pensiero adattivo su entrambi, con profondità impostata da un parametro effort anziché da un budget di token di pensiero. Su Claude Platform il valore predefinito è alto; all'interno delle app di Claude è medio.
• Scrittura in cache — $5,00 per milione per Claude Opus 5.5 rispetto a $2,50 per Claude Sonnet 5.5, l'unica voce in cui il modello più economico è anche il modello più economico da alimentare con un prefisso ricostruito
• Lettura della cache — 0,20 $ per milione su entrambi, un pareggio esatto sulla voce che domina le lunghe esecuzioni degli agenti
Poiché le superfici coincidono, la migrazione tra di esse è un cambio di stringa del modello e una nuova misurazione dello sforzo, non un progetto di integrazione. Questo è insolito tra fornitori ed è il motivo per cui questo particolare abbinamento merita di essere confrontato: i due candidati differiscono nel prezzo e nella profondità, non nell'API che devi scrivere.
Una differenza operativa merita una riga a sé. Anthropic dichiara che Claude Sonnet 5.5 è il primo Sonnet a essere lanciato con salvaguardie informatiche e meccanismi di fallback sullo stesso piano dei suoi modelli di punta, il che significa che le richieste di cybersecurity a rischio più elevato vengono visibilmente indirizzate al Sonnet precedente anziché ricevere risposta dal modello che hai indicato. Se il tuo carico di lavoro tocca quel dominio, la stringa del modello non è una garanzia di quale modello abbia risposto — su nessuno dei due livelli. Anthropic osserva inoltre che, se esegui Sonnet con il thinking disabilitato, devi passare a un comportamento between-tools, che è una modifica al codice e non un flag di configurazione. Nessuna delle due cose è un motivo per evitare il modello; entrambe sono motivi per saperlo prima di rilasciare.
Su OrcaRouter, Claude Opus 5.5 è instradabile oggi con le stesse credenziali di qualsiasi altro modello del catalogo, al prezzo di listino del fornitore con 0% di ricarico, con failover automatico disponibile al di sotto. Claude Sonnet 5.5 non è ancora una route sulla nostra piattaforma — il modello ha un giorno di vita, e finché non sarà inserito in elenco l'affermazione onesta è che ci si arriverebbe tramite l'API di Anthropic stessa. Chiunque stia attualmente usando Opus 5.5 tramite noi può valutare il costo del passaggio il giorno in cui arriverà, senza cambiare nient'altro nella propria integrazione.
Quale mettere e dove
La divisione che deriva dai numeri: Claude Sonnet 5.5 per il lavoro degli agenti vincolato al terminale, dove è il più forte dei due sul dato Terminal-Bench 4.0 di Anthropic e costa la metà; Claude Sonnet 5.5 per qualsiasi attività orientata al throughput, dato che la differenza di costo si riduce solo quando il compito impone output lunghi; Claude Opus 5.5 per il lavoro di classe FrontierCode, refactoring a lungo orizzonte su codebase di grandi dimensioni e qualsiasi carico di lavoro in cui il margine dal 54,4% al 46,2% rifletta la forma del tuo problema reale piuttosto che una riga di classifica.
Se le tue attività sono aperte e non puoi prevedere la lunghezza dell'output, considera il prezzo per token come un numero del tutto sbagliato. Misura i token per attività completata sul tuo traffico per una settimana prima di impegnarti in un senso o nell'altro; il dato di artificial-analysis di 7,60 $ contro 5,98 $ è un avvertimento che il modello economico può perdere sulla metrica che effettivamente paghi.
Il verdetto onesto: non si tratta più di un compromesso tra capacità e costo. È una questione di se il tuo lavoro è circoscritto. Per compiti circoscritti, ad alto volume e guidati da strumenti, il modello più economico è anche quello migliore, in base alle prove disponibili, e il modello di punta non vale il doppio. Per un lavoro aperto e a lungo orizzonte, la frase di Anthropic stessa — che Opus 5.5 resta chiaramente più forte — è quella a cui credere, e nessuna convergenza nei benchmark la cambia, per ora.



