Generata card di titolo hero per Claude Sonnet 5.5 vs Claude Sonnet 5, con sottotitolo "Prezzi identici, conti diversi", che mostra $2,00 e $10,00 per milione di token su entrambi i lati, con al di sotto una cifra divergente di costo per attività, e il logo OrcaRouter compositato nell'angolo in basso a destra.
Guides & Insights

Claude Sonnet 5.5 vs Claude Sonnet 5: prezzi identici, fatture diverse

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli dello stesso fornitore, stessa fascia, stesso nome e — su ogni riga del listino prezzi pubblicato — lo stesso prezzo. Claude Sonnet 5 è stato lanciato il 30 giugno 2026 a 2,00 $ per milione di token di input e 10,00 $ per milione di token di output. Claude Sonnet 5.5 ha raggiunto la disponibilità generale il 28 settembre 2026 a 2,00 $ e 10,00 $, con letture dalla cache a 0,20 $ e scritture in cache da cinque minuti a 2,50 $ su entrambi. Del prezzo non è cambiato nulla. Ciò che è cambiato è tutto ciò che un listino prezzi non misura, e il risultato è che uno di questi due modelli è sostanzialmente più economico da usare rispetto all'altro, pur costando esattamente lo stesso per token. Il titolo dello stesso Anthro​pic per il rilascio lo dice, senza però dirlo fino in fondo: fino al 30% di costo in meno per la maggior parte del lavoro, su un listino invariato. L'unico modo perché entrambe le affermazioni siano vere è che il modello più recente porti a termine lo stesso lavoro con meno token, come mostrano i benchmark e come confermano i dati indipendenti per singola attività.

Claude Sonnet 5.5 è più costoso di Claude Sonnet 5?

No — e la domanda merita comunque di essere presa sul serio, perché moltissime migrazioni sono andate storte proprio trattando un listino a tariffa fissa come una bolletta fissa.

Per token, i due modelli sono identici: $2,00 in input, $10,00 in output, $0,20 per leggere un token in cache, $2,50 per scriverne uno. Non c'è alcuna fascia a livelli né alcun sovrapprezzo per contesto lungo. Qualunque cosa sia il modello più recente, non è un aumento di prezzo mascherato da nuova generazione.

Per attività completata, il quadro si capovolge a seconda del carico di lavoro di cui si sta parlando. Artificial Analysis riporta un costo di 5,09 $ per attività per Claude Sonnet 5 e di 7,60 $ per attività per Claude Sonnet 5.5 sulla stessa suite Intelligence Index v4.3 — il modello più recente costa il 49% in più per completare un'attività, a una tariffa identica. Lo stesso report rileva che Sonnet 5.5 ha emesso 410 milioni di token nell'intera suite, contro i 370 milioni di Sonnet 5, entrambi rispetto a una mediana di 88 milioni per il campo monitorato. Sui prompt aperti del valutatore il modello più recente semplicemente scrive di più e, a parità di prezzi, più token significano una fattura più salata.

L'affermazione di Anthropic di un costo inferiore del 30% è un'affermazione del fornitore relativa ai propri carichi di lavoro scelti. Il dato di terze parti di 7,60 $ contro 5,09 $ è una misurazione su un insieme diverso. Nessuno dei due è sbagliato; il disaccordo è tutta la storia, e il fattore decisivo è se i tuoi compiti limitano il proprio output.

Cosa è effettivamente cambiato tra le due generazioni

La rate card è statica; il modello no. Disposti in un unico elenco, i delta sono ampi e per lo più unidirezionali.

• Terminal-Bench 4.0 — 70,6% per Claude Sonnet 5.5 contro il 10,3% di Claude Sonnet 5, il più grande salto di una singola generazione che Anthropic abbia pubblicato su questo test

• CursorBench 4.0 — 55,5% contro 34,1%

• Cartografia, senza strumenti — 61,6% contro 15,6%

• GDPval-AA v2.1 — 1844 contro 1449

• AA-Briefcase v1.1 — 1811 contro 1359

• Humanity's Last Exam, con strumenti — 64,5% contro 54,9%

• OSWorld 2.1, completamento parziale — 80,1% contro 57,0%

• Artificial Analysis Intelligence Index v4.3 — 56 contro 38, un divario di diciotto punti su una scala di terze parti misurata con la stessa configurazione "Adaptive Reasoning, Max Effort"

La forma di quell'elenco non è un progresso uniforme. Chartography che passa dal 15,6% al 61,6% e Terminal-Bench dal 10,3% al 70,6% sembrano capacità che erano assenti e ora sono presenti, non capacità che sono migliorate. Humanity's Last Exam che guadagna dieci punti e OSWorld ventitré punti a un prezzo invariato è il modello di una generazione che ha colmato lacune specifiche, non di una che è diventata generalmente più intelligente. Il divario di diciotto punti dell'indice è la media aritmetica di tutto ciò: reale, ampio e concentrato nell'uso di strumenti, nell'esecuzione di codice e nel lavoro visivo.

Una nota a piè di pagina è importante per chiunque legga attentamente la tabella dei fornitori. Anthropic afferma che su FrontierCode la configurazione Max effort ottiene un punteggio inferiore rispetto a Xhigh, e segnala che le esecuzioni di GDPval-AA e AA-Briefcase sono state effettuate su una distribuzione pre-release affetta da un bug degli output strutturati. I numeri sopra riportati sono ancora i migliori disponibili, ma considerali un'istantanea di una singola distribuzione anziché una proprietà permanente del modello.

Perché il prezzo è uguale e il conto no

Tre meccanismi, in ordine decrescente di quanto riescono a spostare una fattura reale.

Il primo è la disciplina sulla lunghezza dell'output. Sonnet 5.5 è un agente più capace, il che significa che fa di più prima di rispondere, e su una suite senza vincoli di lunghezza scrive circa l'11% in più rispetto a Sonnet 5 pur costando lo stesso per token. Su un carico di lavoro che limita l'output — estrazione in uno schema fisso, classificazione, riepiloghi limitati — quel 11% non si materializza e l'affermazione del 30% diventa credibile, perché il vantaggio consiste nell'arrivare alla risposta in meno turni anziché in meno token per turno.

Il secondo è il comportamento della cache, ed è il motivo per cui un prezzo invariato di lettura dalla cache non significa un costo invariato della cache. Le letture e le scritture della cache hanno lo stesso prezzo su entrambi i modelli, quindi qualsiasi variazione nel volume di token in cache si ripercuote direttamente sulla fattura. Un modello che impiega meno turni per completare un'attività agentica legge il suo prefisso meno volte. Si tratta di un risparmio senza alcuna variazione di prezzo dietro, ed è invisibile in ogni tabella di confronto che elenca solo le righe del listino.

Il terzo è quello che la maggior parte dei team sbaglia il giorno della migrazione: il valore predefinito di effort. Claude Sonnet 5.5 configura il reasoning tramite un parametro effort con impostazioni low, medium, high, xhigh e max, con valore predefinito high sulla Claude Platform e medium all'interno di Claude apps. Se sei migrato da un deployment di Sonnet 5 in cui avevi fissato un budget di reasoning, il nuovo valore predefinito potrebbe corrispondere a una profondità diversa da quella per cui stavi pagando. Misura prima di dare per scontato un risparmio o un aumento.

C'è anche una conseguenza comportamentale che vale la pena segnalare prima del rollout anziché dopo. Anthropic afferma che Claude Sonnet 5.5 è il primo Sonnet a essere lanciato con salvaguardie e fallback cyber sullo stesso piano dei suoi modelli di punta, quindi le richieste di cybersicurezza a rischio più elevato ripiegano visibilmente sul precedente Sonnet. Nei tuoi log comparirà un modello che non hai richiesto. A questo proposito, se esegui Sonnet con il thinking disabilitato devi passare a un comportamento tra gli strumenti — una modifica al codice, non un flag.

Su OrcaRouter, anthropic/claude-sonnet-5 è instradabile oggi con una sola credenziale al prezzo di listino del provider con 0% di markup, insieme a Claude Opus 5.5, Claude Opus 5, DeepSeek V4 Pro e Gemini 3.1 Pro Preview. Claude Sonnet 5.5 stesso non è ancora una route sulla nostra piattaforma, quindi la forma pratica di questo confronto al momento è che un team che esegue già Sonnet 5 può misurare il delta il giorno in cui viene listata senza toccare una chiave API, e nel frattempo può eseguire il failover tra i tier cambiando una stringa.

Domande che le persone fanno prima di cambiare

Posso eseguirli entrambi contemporaneamente e confrontarli sul mio traffico? Non ancora tramite un'unica credenziale OrcaRouter, dato che Claude Sonnet 5.5 non è una route elencata. La soluzione alternativa è eseguire il modello più recente sull'API di Anthropic e quello più vecchio tramite noi, poi confrontare i token per attività completata anziché il costo per token, perché è il dato su cui i due modelli differiscono effettivamente.

Il prezzo invariato significa che Anthropic non fa pagare la nuova capacità? Significa che il prezzo di listino viene mantenuto fermo mentre il modello migliora, lo stesso schema delle due precedenti generazioni di Sonnet. Se ciò persisterà è una questione commerciale, non tecnica, e la finestra di dismissione pubblicata — non prima di settembre 2027 — è l'unico impegno associato.

Quale numero dovrei considerare affidabile, il 30% di Anthropic o il 49% di terze parti? Nessuno dei due come affermazione generale. Il dato di Anthropic descrive carichi di lavoro in cui il modello arriva a una risposta in meno turni; il dato di Artificial Analysis descrive una suite di indici senza vincoli in cui la verbosità è libera di crescere. Scegli quello che assomiglia al tuo set di prompt e, se non riesci a dire quale sia, quell'ambiguità è essa stessa la risposta: misurala.

Il risultato finale

Claude Sonnet 5.5 non è un aumento di prezzo, ma non è nemmeno automaticamente un risparmio. Anthropic ha mantenuto invariata ogni riga del listino e ha spostato il modello al di sotto di essa, il che significa che l'intero ragionamento economico si regge sui token per attività completata: un numero che è migliore del 30% sui carichi di lavoro scelti dal fornitore e peggiore del 49% sulla suite scelta da un valutatore indipendente. Se i tuoi task delimitano da soli il proprio output, fai il cambio e prendi il vantaggio. Se non lo fanno, il prezzo invariato non è un motivo per saltare la misurazione, perché potresti pagare una volta e mezza tanto per task per un modello che è inequivocabilmente migliore nel lavoro.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Sonnet 5 across eight rows. Both columns carry the identical rate card: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output. The rows that differ are AA Intelligence Index v4.3 score 56 for Claude Sonnet 5.5 against 38 for Claude Sonnet 5, $7.60 per task on the index run against $5.09, and Terminal-Bench 4.0 (vendor) 70.6% against 10.3%. The card heading reads "Identical rate cards, different bills: Claude Sonnet 5.5 against Claude Sonnet 5", and a footer line reads "Prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Every price line is a tie by design: the two models share one rate card and differ only in what they emit to finish the same task."Screenshot of the OrcaRouter model page for Anthropic Claude Sonnet 5 (anthropic/claude-sonnet-5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 5.24-second p50 time to first token, a "Public benchmarks by Anthropic · 2026-06-30" line, and the $2.00 input and $10.00 output prices per million tokens.Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.