
Claude Sonnet 5.5: la rivendicazione del 30% sul costo e le sei modifiche che rompono il codice di Sonnet 5
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 984 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 195 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Claude Sonnet 5.5 è stato rilasciato il 28 settembre 2026 esattamente alle stesse tariffe di Claude Sonnet 5 — 2 $ per milione di token in input, 10 $ per milione di token in output, 0,20 $ per milione di letture dalla cache — mentre l'annuncio di Anthropic esordisce con "è oltre il 30% più veloce e costa fino al 30% in meno per la maggior parte del lavoro". Entrambe le affermazioni sono vere, e la distanza tra loro è tutta la storia. Il risparmio non è nel listino, perché il listino non si è mosso. Deriva dall'esecuzione del modello a un'impostazione di effort inferiore rispetto a quella necessaria al suo predecessore, il che significa che quel 30% è un'affermazione su un punto operativo che devi scegliere, non un prezzo che erediti. Una misurazione indipendente rende la biforcazione netta: su Artificial Analysis, Claude Sonnet 5.5 con effort massimo costa 7,60 $ per attività sull'Intelligence Index, contro 5,09 $ per Claude Sonnet 5 al massimo — circa il 49% in più, non il 30% in meno. Non è una contraddizione del dato di Anthropic. È l'altro estremo della stessa curva, ed è il punto in cui approderà per impostazione predefinita la maggior parte delle migrazioni se nessuno riesegue la propria analisi dell'effort.
Due affermazioni che portano un unico numero
Il post di Anthropic formula l'affermazione per singolo task in tre punti, e ciascuno si basa sullo sforzo. La versione più forte: su Terminal-Bench 4.0, a sforzo Medio — l'impostazione predefinita nelle app Claude — Sonnet 5.5 «supera di gran lunga il miglior punteggio di Sonnet 5 con meno di un decimo del costo per task». Su AA-Briefcase v1.1, a sforzo Medio, batte il miglior risultato di Sonnet 5 a circa un nono del costo. Su CursorBench 4.0, a sforzo Basso, supera il miglior risultato di Sonnet 5 con meno di un decimo.
Leggeteli come un insieme e il meccanismo è chiaro. Il livello minimo di Sonnet 5.5 si colloca al di sopra del livello massimo di Sonnet 5 su diverse valutazioni. Non ottieni il 30% pagando meno per token; lo ottieni non avendo più bisogno dell'impostazione costosa. Anthropic lo dice nella documentazione sulla migrazione, a una pagina di distanza dal materiale di marketing: "I livelli di impegno sono stati ricalibrati. Un livello di impegno non produce la stessa quantità di ragionamento che produceva su Claude Sonnet 5. Riesegui la scansione dei livelli di impegno invece di trasferire un'impostazione."
Quella frase è la riga più importante sul piano operativo che Anthropic abbia pubblicato questa settimana, ed è quella che non è entrata nella maggior parte della copertura del lancio.
Ciò che Anthropic ha pubblicato — riportato dal fornitore, non riprodotto
Tutto in questa sezione è una misurazione di Anthropic stessa, dall'annuncio di Sonnet 5.5 e dalla system card. È un'affermazione del fornitore, non un risultato indipendente, e il percorso delle note a piè di pagina conta quanto i numeri principali.
• Terminal-Bench 4.0 (programmazione agentica) — Sonnet 5.5 70,6% vs Sonnet 5 10,3%. Si tratta di un balzo di sette volte sulla riga più citata in assoluto, ed è il numero con cui la maggior parte della copertura ha aperto.
• FrontierCode 1.1 (Main) — Sonnet 5.5 52,1% a Xhigh e 46,2% a Max; Sonnet 5 42,4%; Claude Opus 5.5 54,4%; GPT-6 Sol 49,3%. Nota l'inversione: Sonnet 5.5 ottiene un punteggio inferiore a Max rispetto a Xhigh.
• CursorBench 4.0 — 55,5% per Sonnet 5.5 contro il 34,1% per Sonnet 5 e il 57,8% per Opus 5.5. CursorBench 4.0 non riporta pubblicamente GPT-6 Sol.
• GDPval-AA v2.1 (lavoro basato sulla conoscenza) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.
• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 sugli stessi quattro modelli.
• Humanity's Last Exam (con strumenti) — 64,5% / 54,9% / 67,7%.
• OSWorld 2.1 (uso del computer, credito parziale) — 80,1% / 57,0% / 81,8%.
• Chartography (riconoscimento visivo di grafici, senza strumenti) — 61,6% / 15,6% / 64,4% / 53,6%.
Tre note a piè di pagina meritano di accompagnare quelle righe anziché di stare sotto di esse. Primo, il valore del 66,4% di Opus 5.5 su Terminal-Bench 4.0 è riportato con effort Xhigh, la configurazione di Opus 5.5 con il punteggio più alto. Secondo, si spiega l'inversione di FrontierCode Max: a Max, Sonnet 5.5 eseguiva più spesso la skill di code review di Claude Code, che suddivide la revisione tra molti subagenti, e in due casi ciò ha prodotto un timeout o modifiche oltre l'ambito del compito — FrontierCode penalizza le modifiche fuori ambito anche quando sono valide. Terzo, e il meno confortevole per il fornitore, Artificial Analysis ha eseguito GDPval-AA e AA-Briefcase su una versione pre-release di Sonnet 5.5 che, secondo Anthropic, presentava un bug che degradava le risposte alle richieste di output strutturato. Anthropic si aspetta che l'effetto sia piccolo e che sottostimi Sonnet 5.5, e afferma che il bug è stato corretto. Osserva inoltre che OpenAI ha recentemente corretto un bug di comprensione delle immagini in GPT-6 Sol, quindi i valori di GPT-6 Sol in quelle righe potrebbero non riflettere ancora il modello attuale.

Che cosa dice l'esecuzione indipendente sullo stesso modello
Artificial Analysis ha misurato Sonnet 5.5, e la sua pagina indica la configurazione esatta: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". Sulla stessa revisione dell'indice, 216 modelli nella classe:
• Claude Sonnet 5.5 — Indice di Intelligenza 56, classificato #3 su 216. Costo di $7,60 per attività dell'indice. Ha generato 410M token di output durante l'esecuzione dell'indice, rispetto a una mediana di 88M.
• Claude Sonnet 5 — Indice 38, classificato al 58° posto su 216, sulla sua pagina etichettata "(Ragionamento adattivo, impegno massimo)". Costo di 5,09 $ per attività. 370M token di output.
• Claude Opus 5.5 — Indice 58, classificato #1 su 216. $5,98 per attività. 95,3 token di output al secondo.
• GPT-6 Sol — Indice 48, classificato #20 su 216, a $2/$10 di listino. $1,06 per attività, 89,8 token di output al secondo.
Il divario dell'Intelligence Index — 56 contro 38, diciotto punti — è la conferma indipendente più forte di questo articolo, ed è il numero che un lettore dovrebbe davvero portarsi via. Il dato sui costi è quello che richiede un avvertimento, e vale la pena precisarlo esattamente: entrambi i punti sono configurazioni a sforzo massimo, e lo sforzo massimo su un modello che ragiona più a lungo è una posizione deliberatamente costosa. Sonnet 5.5 ha consumato 410M di token nell'esecuzione dell'indice in cui Sonnet 5 ne ha consumati 370M, ed entrambi sono ben al di sopra della mediana di 88M. Un modello che pensa più a lungo all'impostazione massima costa di più all'impostazione massima. Ciò che il numero falsifica non è "più economico per attività", ma qualsiasi lettura che lo interpreti come una proprietà del modello anziché dell'impostazione.
Artificial Analysis non ha ancora pubblicato un dato sulla velocità di output per Sonnet 5.5 — la sua pagina riporta N/A per i token di output al secondo, contro 78,7 per Sonnet 5 e 95,3 per Opus 5.5. Quindi la metà del "30%+ più veloce" nella dichiarazione di Anthropic, a questo punto, è solo un dato riferito dal fornitore. Considerala indicativa finché una terza parte non la misura.

Da dove deriva effettivamente il risparmio e come ottenerlo
Se accetti il meccanismo, le istruzioni di migrazione si scrivono da sole, e Anthropic le ha pubblicate:
• Inizia da high per impostazione predefinita, non da qualunque cosa dicesse la tua configurazione di Sonnet 5. La guida di Anthropic è high a meno che il tuo carico di lavoro non sia agentico o sensibile alla latenza.
• Programmazione agentica e uso di strumenti a più passaggi — inizia con medio per attività ben specificate e passa ad alto per quelle più difficili o più lunghe.
• Chat e altri lavori sensibili alla latenza — parti da medio o basso. Questa è la fascia in cui si collocano le affermazioni sul "un decimo del costo".
C'è una spiegazione coerente del perché l'impostazione più bassa funzioni, e non è marketing. I primi tester di Anthropic hanno riferito che Sonnet 5.5 raggruppa le chiamate agli strumenti insieme più di quanto facesse Sonnet 5, producendo meno passaggi per attività. La nota di CodeRabbit nell'annuncio è insolitamente specifica per una citazione di lancio: la "tendenza di Sonnet 5 a ricorrere troppo spesso alla ricerca web e il suo elevato uso di token sono entrambi scomparsi in questo nuovo modello". Sonnet 5.5 ha anche mantenuto lo stesso tokenizer di Sonnet 5, quindi un testo identico costa gli stessi token: la riduzione consiste in meno turni e meno chiamate ridondanti, non in un vocabolario più economico. Ciò significa anche che i conteggi dei token nei tuoi log restano comparabili durante l'aggiornamento, il che rende semplice la misurazione prima e dopo.
Le sei modifiche che rompono o alterano il codice di Sonnet 5
Questa è la parte del rilascio che costa tempo di ingegneria, ed è qui che la guida alla migrazione vale più del grafico dei benchmark. Cinque dei sei restituiscono errori bloccanti; il sesto fallisce in silenzio.
• thinking: {"type": "disabled"} ora restituisce un 400. La sostituzione è thinking: {"type": "between_tools"}, che disattiva il thinking iniziale ed è l'impostazione di thinking più bassa su questo modello. Funziona con effort basso, medio e alto, non richiede alcun beta header ed è disponibile su ogni piattaforma che eroga Sonnet 5.5. Con effort xhigh o max, between_tools stesso restituisce un 400 — usa il thinking adattivo (ometti il campo o invia {"type": "adaptive"}) se ti servono quei livelli. Con between_tools, inoltre, non puoi cambiare effort a metà conversazione.
• L'uso forzato degli strumenti non è supportato. tool_choice impostato su {"type": "any"} o {"type": "tool", "name": "..."} restituisce un 400 con il messaggio "tool_choice: type 'tool' and 'any' are not supported for this model." Lo stesso controllo si applica all'endpoint di conteggio dei token. La sostituzione documentata per input valido secondo lo schema è tool_choice: {"type": "auto"} più strict: true sullo strumento, oppure spostare lo schema su output strutturati.
• I blocchi di thinking sono legati al modello e alla conversazione. Sonnet 5.5 legge i blocchi di thinking da Sonnet 5, Opus 4.8, Haiku 4.5 e precedenti — non da Opus 5, Opus 5.5 o qualsiasi modello Fable o Mythos. Nessun altro modello legge i blocchi di Sonnet 5.5. Sposta una conversazione da Sonnet 5 a 5.5 e il ragionamento sopravvive; spostala da Sonnet 5.5 a qualsiasi altro modello e i turni successivi vengono eseguiti senza di esso. Separatamente, l'API ora controlla se il prompt di sistema, l'elenco degli strumenti o un messaggio precedente sono cambiati da quando è stato prodotto un blocco di thinking, e sugli account creati a partire dal 31 agosto 2026 restituisce un 400 quando ciò è avvenuto. Mantieni le conversazioni in modalità solo aggiunta, oppure invia l'header beta thinking-binding-controls-2026-08-01 con prefix_mismatch_behavior: "drop_block".
• computer_20251124 viene rifiutato su Claude API e Google Cloud. L'uso del computer lì richiede il toolset computer_toolset_20260801. Amazon Bedrock accetta ancora lo strumento precedente — una divergenza tra piattaforme che vale la pena segnalare se esegui lo stesso agente su entrambe.
• Alcune combinazioni di advisor non sono più disponibili. Un esecutore Sonnet 5.5 accetta Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 o Sonnet 5.5 stesso come advisor. Gli advisor Opus 4.8, Opus 4.7 e Sonnet 5, che funzionano con un esecutore Sonnet 5, restituiscono un 400 con un esecutore Sonnet 5.5. Ogni advisor accettato da Sonnet 5.5 restituisce consigli crittografati, quindi il tuo client non può leggere il testo dei consigli.
• Il testo tra le chiamate agli strumenti ora arriva all'interno di blocchi di pensiero — e con il valore predefinito di display, "omitted", è vuoto. Questo è quello silenzioso. Le note più lunghe di una frase o due tra le chiamate agli strumenti tornano come blocchi di pensiero di aggiornamento del progresso anziché come testo. Un'applicazione che trasmette in streaming quella narrazione ai suoi utenti resta silenziosa tra le chiamate agli strumenti, senza errori e senza nulla nei log. La soluzione è impostare thinking.display in modo che il testo venga restituito, oppure passare a between_tools, nel qual caso il testo torna come testo normale.
Altre due cose che una migrazione tocca, nessuna delle due un errore. Monitoraggio dei casi di rifiuto: Sonnet 5.5 restituisce stop_reason: "refusal" con un oggetto stop_details che indica una delle cinque aree di policy — cyber, bio, frontier_llm, reasoning_extraction, general_harms — e il fallback lato server di Anthropic ritenterà i rifiuti di cyber e frontier_llm su Sonnet 5, ma non gli altri tre. E la postura di sicurezza è cambiata davvero: Sonnet 5.5 è il primo modello Sonnet a essere rilasciato con salvaguardie cyber e fallback come la classe Opus, il che significa che le richieste di cybersecurity a rischio più elevato ricadono visibilmente su Sonnet 5, ed è il primo Sonnet con classificatori contro l'estrazione del ragionamento. Se la proposta di valore del tuo prodotto è uno strumento di sicurezza, testa quel confine prima di rilasciare la sostituzione del modello.
Prezzi, e ciò che c'è davvero sul nostro percorso oggi
Il listino prezzi è invariato rispetto a Sonnet 5 e la sua forma completa pubblicata è abbastanza breve da poter essere esposta chiaramente:
• Input — $2.00 per milione di token. Output — $10.00 per milione di token. Entrambi identici a Sonnet 5, come confermato sulla pagina del modello di Sonnet 5.5 di Anthropic.
• Lettura cache — $0,20 per milione, uno sconto del 90% sull'input; Scrittura cache da 5 minuti $2,50 per milione; Scrittura cache da 1 ora $4,00 per milione. Il prompt minimo memorizzabile in cache è di 512 token su Sonnet 5.5, in calo rispetto a 1.024 su Sonnet 5.
• Batch — 50% di sconto in entrambe le direzioni, quindi $1,00 / $5,00 per milione. Con l'API Message Batches, l'output può arrivare fino a 300K token con l'header beta output-300k-2026-03-24.
• Rispetto a Opus 5.5 — Sonnet 5.5 costa esattamente la metà: $2/$10 contro $4/$20, con le scritture in cache a metà e le letture in cache identiche a $0,20. Questa è la migrazione che conviene, e Anthropic lo dice apertamente: i due modelli si completano al meglio quando Sonnet opera a uno sforzo inferiore, e Opus «rimane chiaramente più forte nei lavori complessi e aperti che richiedono un giudizio costante».
• Contesto e output — contesto da 1M token, output massimo di 128K, pensiero adattivo attivo per impostazione predefinita, effort predefinito alto, knowledge cutoff affidabile a giugno 2026, conservazione zero dei dati disponibile, dismissione non prima del 28 settembre 2027.
Una nota di disponibilità che preferiamo dichiarare piuttosto che lasciare intendere: Claude Sonnet 5.5 non è presente nel nostro catalogo modelli al 29 settembre 2026. Il suo predecessore anthropic/claude-sonnet-5 e il suo fratello maggiore anthropic/claude-opus-5.5 lo sono entrambi, e le sue tariffe dalla nostra parte sono quelle del provider stesso — 2,00 $ in ingresso, 10,00 $ in uscita, 0,20 $ per lettura cache, 2,50 $ per scrittura cache per Sonnet 5, senza alcun ricarico aggiunto, così una variazione di prezzo del fornitore è attiva qui lo stesso giorno in cui arriva anziché al ciclo di fatturazione successivo. Quest'ultima proprietà è ciò che rende una lettura del listino prezzi utile anziché decorativa.

Cosa puoi fare con questo oggi
La sequenza onesta per un team che già esegue Claude Sonnet 5 in produzione è composta da tre passaggi, e nessuno di essi consiste nel "sostituire la stringa del modello e guardare il grafico".
Primo, riesegui lo sweep dei livelli di effort. Se hai portato avanti un'impostazione high o max da Sonnet 5 perché era quello che richiedeva il tuo standard di qualità, ora stai pagando per un ragionamento che non hai più bisogno di comprare. I dati indipendenti sul costo per attività dicono che la parte alta della scala è diventata più costosa, non meno, e le stime di costo dello stesso fornitore descrivono tutte la parte centrale. Secondo, correggi i due percorsi di errore prima del deploy — thinking disabilitato e uso forzato dei tool — perché entrambi falliscono in modo rumoroso e immediato, il che è la buona notizia. Terzo, tieni d'occhio il percorso di narrazione, perché fallisce in silenzio.
Se il modello non è ancora sulla rotta che usi, il modo a basso rischio per valutarlo è eseguirlo in parallelo, non al suo posto: mantieni Sonnet 5 fissato come fallback sulla stessa chiave, così che un rifiuto, un timeout o una valutazione negativa invii la richiesta al modello di cui ti fidi già, e il failover automatico chiude il cerchio senza una seconda integrazione. Questo è l'intero argomento a favore della valutazione di un modello non collaudato dietro un unico endpoint anziché davanti ai tuoi utenti — e qui vale doppiamente, perché le categorie di rifiuto di Sonnet 5.5 sono nuove e la sua calibrazione dell'impegno non è esplicitamente la stessa del suo predecessore. Quando sei pronto a spostare l'impostazione predefinita, il roster su una sola chiave arriva a più di 200 modelli, il che rende il confronto una modifica di configurazione anziché un secondo contratto.
Cosa guardare
Tre cose risolveranno le questioni in sospeso in questo articolo, e nessuna di esse si è ancora verificata.
Una misurazione indipendente della velocità di output è la prima. Anthropic dichiara oltre il 30% in più rispetto a Sonnet 5; Artificial Analysis non ha pubblicato alcun dato per Sonnet 5.5, e questa affermazione svolge un ruolo concreto nell'argomentazione sui costi, dato che un modello più veloce completa lo stesso compito in meno tempo effettivo e spesso con meno token. Claude Haiku 5.5 è il secondo — Anthropic afferma che arriverà "nelle prossime settimane" e si collocherà sotto Sonnet 5.5, il che cambia i calcoli per la fascia di chat ad alto volume, dove gli sforzi medio e basso rendono già Sonnet 5.5 competitivo. Il terzo è il passaggio di correzione: Artificial Analysis ha eseguito GDPval-AA e AA-Briefcase su una build pre-rilascio con un bug nell'output strutturato, Anthropic prevede che quei punteggi sottostimino il modello, e nessuno dei due numeri è stato rieseguito. Se saliranno, il divario nel lavoro intellettuale rispetto a Opus 5.5 si ridurrà ulteriormente e l'argomentazione del "metà prezzo" diventerà più forte.
Fino ad allora, il riepilogo difendibile è più ristretto dell'annuncio e più utile del grafico di benchmark. Claude Sonnet 5.5 è un guadagno di intelligenza di diciotto punti rispetto a Sonnet 5 sull'indice indipendente, alle stesse tariffe pubblicate, con un risparmio reale e misurabile disponibile per chiunque scenda nella scala dell'impegno — e una penalizzazione reale e misurabile per chiunque non lo faccia.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
