
Claude Sonnet 5.5 vs Claude Opus 5: più economico su ogni voce e in vantaggio sull'indice
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 984 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 195 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Claude Opus 5 è stato rilasciato il 24 luglio 2026 a 5,00 $ per milione di token di input e 25,00 $ per milione di token di output. Claude Sonnet 5.5 ha raggiunto la disponibilità generale il 28 settembre 2026 a 2,00 $ e 10,00 $. Si tratta di un taglio del 60% sull'input e del 60% sull'output per un modello due generazioni più recente — e, sull'harness che Artificial Analysis esegue su entrambi, un modello che si colloca a 56 sull'Intelligence Index v4.3 contro il 51 di Claude Opus 5. Questo è il raro confronto in cui il modello più nuovo ed economico è anche quello con il punteggio più alto su un indice di terze parti, e in cui la motivazione residua a favore dell'incumbent non è la posizione in classifica, ma una specifica classe di lavoro. Entrambi i modelli accettano 1M di token di contesto, entrambi emettono fino a 128K token, entrambi leggono testo, immagini e file, ed entrambi configurano il ragionamento tramite un parametro di effort anziché un budget di thinking token. Poiché le superfici sono le stesse, scegliere tra i due è puramente una questione di quanto costa un'attività completata e quali attività falliscono.
Due release, un'interfaccia
Comincia da quanto poco cambia, perché è più di quanto avvenga nella maggior parte dei salti generazionali.
• Finestra di contesto — 1.000.000 di token su entrambi
• Output massimo — 128.000 token su entrambi
• Modalità di input — testo, immagini e file su entrambi; né audio né video su nessuno dei due
• Ragionamento — pensiero adattivo con effort configurabile su entrambi, così la profondità è un parametro della richiesta anziché una stringa di modello separata
• Capacità — visione, strumenti, JSON e ragionamento su entrambi, secondo le voci del catalogo OrcaRouter per anthropic/claude-opus-5 e la linea Sonnet
La conseguenza pratica è che un prompt scritto per Claude Opus 5 non deve essere riscritto per essere eseguito su Claude Sonnet 5.5, e un ciclo di agente ottimizzato attorno a un limite di output di 128K non ha bisogno di un nuovo livello. La migrazione è uno scambio di stringa del modello più un ricontrollo di quale impostazione di effort avevi fissato — niente di più. Per i team che hanno vissuto le transizioni multi-modali e multi-parametro degli ultimi due anni, questa è la notizia, non il benchmark.
L'unica cosa che cambia davvero è il prezzo, e cambia a ogni riga anziché solo nelle due sulla slide di marketing.
• Input — $2,00 per milione contro $5,00, un taglio del 60%
• Output — 10,00 $ per milione contro 25,00 $, un taglio del 60%
• Lettura cache — $0,20 per milione contro $0,50, un taglio del 60%
• Scrittura in cache — 2,50 $ per milione rispetto a 10,00 $ per la finestra di cinque minuti, una riduzione del 75%
Se esegui un agente che rilegge un lungo prefisso a ogni turno, la voce di lettura della cache è quella che ripaga la migrazione. A 0,20 $ contro 0,50 $, ogni token in cache in una sessione lunga scende al 40% del suo costo precedente, e le letture dalla cache costituiscono la maggior parte del conteggio dei token nella maggior parte dei loop agentici. Il risparmio si accumula in un modo che il numero in evidenza per token non riesce a cogliere.
Da dove vengono i cinque punti
Artificial Analysis assegna a Claude Sonnet 5.5 un punteggio di 56 e a Claude Opus 5 un punteggio di 51 sull'Intelligence Index v4.3, entrambi misurati nella configurazione "Adaptive Reasoning, Max Effort". Cinque punti non sono un errore di arrotondamento su quella scala — per contestualizzare, lo stesso valutatore colloca Sonnet 5 a 38 e Gemini 3.1 Pro Preview a 30, quindi il divario tra Claude Opus 5 e Claude Sonnet 5.5 è un terzo del divario tra Claude Opus 5 e la precedente generazione di Sonnet.
I dati di lancio di Anthropic stessa per Claude Sonnet 5.5 puntano nella stessa direzione con uno strumento diverso. L'azienda riporta il 70,6% su Terminal-Bench 4.0 — lo stesso test sul quale Claude Opus 5 è documentato all'89,1% in una precedente tabella di Anthropic, una cifra che utilizzava una revisione diversa dell'harness e non va sottratta a quella più recente. Questa è la cautela sulle fonti più importante in assoluto in questo articolo: Terminal-Bench è passato alla versione 4.0 nel corso del 2026, l'indice che lo conteneva è stato revisionato alla v4.3 per adeguarsi, e i confronti tra versioni di quel benchmark non sono aritmetici. Quando un numero ha una versione associata, citare la versione.
Ciò che può essere confrontato in modo pulito è la progressione lato Sonnet del fornitore stesso — dal 10,3% su Terminal-Bench 4.0 per Sonnet 5 al 70,6% per Sonnet 5.5 — e la lettura dell'indice di terze parti, in cui entrambe le cifre provengono dallo stesso harness nello stesso giorno. Alla luce di queste prove, il successore ha realmente superato il flagship di luglio per il ragionamento generale, il che è un'affermazione più forte di qualsiasi slide del fornitore.
La trappola della lunghezza dell'output
Ecco il punto in cui l'aritmetica smette di essere gentile con il modello più recente.
Artificial Analysis riferisce che valutare Claude Sonnet 5.5 sulla sua suite di indici costa $7,60 per attività. Claude Opus 5 costa $5,86 per attività sulla stessa suite. Il modello più recente, con uno sconto del 60% su ogni voce del listino prezzi, è circa il 30% più costoso per completare un'attività. Il motivo è nello stesso report: Sonnet 5.5 ha emesso 410 milioni di token in tutta la suite, contro una mediana di 88 milioni tra i modelli monitorati, che il valutatore etichetta come "molto prolisso". Claude Opus 5 ha emesso 140 milioni sulla stessa suite.
Facendo il calcolo, il meccanismo è semplice. Sonnet 5.5 produce all’incirca tre volte i token di output di Claude Opus 5 su un lavoro identico, al 40% del prezzo dell’output. Tre per 0,4 fa 1,2 — una penalità del 20% prima degli effetti della cache, che è più o meno il risultato di 7,60 $ contro 5,86 $. Il prezzo per token non è sbagliato; semplicemente non è il numero che determina la fattura.
Questo non rende il modello più nuovo l'acquisto peggiore. Rende la decisione dipendente da qualcosa che la maggior parte dei confronti omette: se il tuo carico di lavoro ti consente di limitare l'output. Un compito di riepilogo con un'istruzione sulla lunghezza, una pipeline di estrazione strutturata che produce JSON, un classificatore che restituisce un'etichetta — in tutti questi casi la verbosità non si manifesta mai, e il taglio del 60% sulla tariffa è denaro reale. Un agente aperto a cui viene chiesto di "sistemare il repo" senza alcuna disciplina sull'output dà a Sonnet 5.5 tre volte la corda.
Impostazioni dello sforzo e la migrazione per cui nessuno prevede un budget
Entrambi i modelli espongono la profondità di ragionamento tramite un parametro effort con più livelli, ed entrambi forniscono un valore predefinito anziché un valore fisso — alto sulla Claude Platform, medio all'interno delle app Claude. La tentazione durante una migrazione è lasciare l'impostazione dov'era sul vecchio modello e considerare il lavoro concluso.
È un errore, per una ragione misurabile. La nota a piè di pagina di Anthropic stessa relativa a Claude Sonnet 5.5 afferma che la configurazione con effort Max ottiene un punteggio inferiore a Xhigh su FrontierCode, il che significa che l'effort non è una regolazione monotona e l'impostazione più alta non è un upgrade gratuito. Imposta l'effort misurando il tuo compito, non scegliendo l'opzione più costosa disponibile.
C'è anche una netta differenza comportamentale sul versante Sonnet che vale la pena conoscere prima di un rollout. Anthropic dichiara che Claude Sonnet 5.5 è il primo Sonnet a essere rilasciato con salvaguardie informatiche e meccanismi di fallback allineati ai suoi modelli di punta, quindi le richieste di sicurezza ad alto rischio passano visibilmente al Sonnet precedente invece di essere gestite dal modello che hai indicato. Se il tuo carico di lavoro rientra in quel dominio, i tuoi log mostreranno un modello che non hai richiesto. Claude Opus 5 precede questa impostazione sulla linea Sonnet, sebbene la stessa classe di routing esista in tutto il prodotto Anthropic per attività di biologia e cybersecurity sui livelli di punta.
Su OrcaRouter entrambi gli endpoint sono già attivi oggi — anthropic/claude-opus-5 e anthropic/claude-sonnet-5 si trovano nello stesso catalogo di tutto il resto, con il prezzo di listino del provider e 0% di ricarico — e Claude Sonnet 5.5 sarà raggiungibile con quella stessa credenziale non appena sarà inserito in catalogo. Nel frattempo, la funzionalità rilevante è il failover automatico: se un livello Anthropic è soggetto a limiti di frequenza o restituisce errori, la richiesta può essere reindirizzata all'altro senza modificare il codice, che è la copertura più economica possibile contro il rischio di sbagliarsi in questo confronto.
La decisione, enunciata come regola
Se il tuo lavoro è circoscritto — controlli la forma dell’output, i prompt sono strutturati e il conteggio dei token per attività è prevedibile — passa a Claude Sonnet 5.5 e usufruisci del taglio del 60%. L’indice concorda, il listino concorda, e non resta alcun argomento sulle capacità dall’altra parte.
Se il tuo lavoro è aperto e di tipo agentico, esegui l'esperimento prima di credere all'uno o all'altro listino prezzi. Misura i token per attività completata sul tuo traffico per una settimana su ciascun modello; il risultato di terze parti di 7,60 $ contro 5,86 $ è un avvertimento specifico che la scheda tariffaria più economica può produrre la fattura più alta. Claude Opus 5 resta l'opzione predefinita più sicura per il lavoro autonomo a lungo orizzonte finché non avrai quel numero.
Il verdetto onesto: questa è la prima generazione di Sonnet in cui la tesi del modello di punta si basa sulla forma del compito più che sulla capacità grezza, e chiunque prenda ancora la decisione basandosi solo sul nome del modello ora sta lasciando sul tavolo il 60% o pagando il 30% in più per compito completato, a seconda soltanto di quale direzione indovina.



Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
