
Claude Haiku 5.5 vs Claude Sonnet 5.5: un listino prezzi 20x, una fattura misurata 36x
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Claude Haiku 5.5 e Claude Sonnet 5.5distano sei giorni e un tier l'uno dall'altro nella stessa famiglia, condividono una finestra di contesto da un milione di token e rispondono sulla stessa struttura di API. Sulla rate card pubblicata quello più economico costa un quinto di quello più caro nella fascia in cui ricade la maggior parte delle richieste. Sul board indipendente di Artificial Analysis il divario è persino più ampio: 0,21 $ per completare un'attività dell'Intelligence Index su Claude Haiku 5.5 contro 7,60 $ su Claude Sonnet 5.5, per un Intelligence Index di 43 contro 56. Il segnale da cui è nato questo pezzo lo descriveva come Claude Haiku 5.5 che è «molto meglio di GPT-6 Luna» e «(più) vicino a Sonnet 5.5». La prima metà di ciò corrisponde all'incirca a quanto mostra il set di confronto dello stesso fornitore. La seconda metà è il punto in cui le misurazioni smettono di concordare con il marketing, e vale la pena essere precisi su quale delle due.
Due modelli, sei giorni e un livello di differenza
Claude Haiku 5.5 è stato rilasciato il 7 ottobre 2026 con l'ID modello claude-haiku-5-5. È il sostituto diretto di Claude Haiku 4.5, accetta in input testo e immagini e restituisce testo, ed è il primo modello della classe Haiku a cui Anthropic ha assegnato un'impostazione di effort regolabile — Low, Medium, High, Xhigh e Max, con medium come default dell'API. Anthropic lo definisce "il modello piccolo più economico, veloce e capace che abbiamo mai rilasciato", e la sua nota a piè di pagina lo qualifica come il più veloce alla velocità standard di ciascun modello, comunque dietro ai modelli Opus quando questi funzionano in Fast Mode.
Claude Sonnet 5.5 è arrivato sei giorni prima, il 28 settembre 2026, come claude-sonnet-5-5 — il livello che Anthropic posiziona come la migliore combinazione di velocità e intelligenza, nonché quello che consiglia per il coding agentico complesso. Stessa finestra da un milione di token. A differenza di Claude Haiku 5.5, non ha fasce di prezzo legate alla lunghezza del prompt, il che si rivela contare più del vantaggio di sei giorni.
Entrambi sono ora disponibili su tutte le piattaforme, incluse Amazon Web Services, Google Cloud e Microsoft Azure, ed entrambi prevedono un impegno al ritiro non prima di un anno dal lancio — 7 ottobre 2027 per Claude Haiku 5.5, 28 settembre 2027 per Claude Sonnet 5.5. Anthropic afferma che Claude Sonnet 5.5 è disponibile con conservazione zero dei dati, come Claude Opus 5.5 e Claude Sonnet 5.
Il tariffario, entrambi i lati, in un unico posto
Per milione di token, in dollari statunitensi, alle tariffe pubblicate da Anthropic:
• Input — Claude Haiku 5.5 $0,10 per prompt fino a 100.000 token, $0,50 oltre tale soglia; Claude Sonnet 5.5 $2,00 fisso, senza scaglioni.
• Output — Claude Haiku 5.5: 0,50 $ fino a 100.000 token, 2,50 $ oltre; Claude Sonnet 5.5: 10,00 $ fissi.
• Letture della cache — Claude Haiku 5.5 $0,01 nella fascia inferiore e $0,05 al di sopra; Claude Sonnet 5.5 $0,10. Anthropic ha dimezzato le letture della cache di Claude Sonnet 5.5 da $0,20 contestualmente al lancio di Haiku, e afferma che, poiché le letture della cache rappresentano una quota consistente dell'uso di token agentici, Claude Sonnet 5.5 ora costa circa il 20% in meno sulla maggior parte del lavoro agentico.
Scritture nella cache — Claude Haiku 5.5: $0.125 per una scrittura di cinque minuti e $0.20 per una scrittura di un'ora nella fascia inferiore, $0.625 e $1.00 al di sopra di essa; Claude Sonnet 5.5: $2.50 per una scrittura di cinque minuti e $4.00 per un'ora.
• Batch — l'API Batch è scontata del 50% sia sull'input sia sull'output. Questo porta Claude Haiku 5.5 a 0,05 $ e 0,25 $ sotto la soglia dei 100.000 token e a 0,25 $ e 1,25 $ sopra di essa, rispetto a Claude Sonnet 5.5 a 1,00 $ e 5,00 $.
Leggendo trasversalmente quelle righe, la forma è coerente: nella fascia inferiore si vede un divario di input di 20x e un divario di output di 20x; sopra la linea, 4x e 4x. Il titolo di Anthropic è «circa il 75% in meno per l'esecuzione» in media rispetto a Claude Haiku 4.5, precisato in una nota a piè di pagina al 90% più economico sotto i 100.000 token e al 50% più economico al di sopra, con la modifica del tokenizer inclusa in quella media.
Il passo da 100.000 token è il punto in cui l'aritmetica cambia
Due fattori tirano in direzioni opposte, e solo uno dei due compare nel tariffario. I prezzi calano drasticamente rispetto a Claude Haiku 4.5. Allo stesso tempo, Claude Haiku 5.5 introduce un tokenizer aggiornato, simile a quelli di Claude Sonnet 5.5 e Claude Opus 5.5, che secondo Anthropic "utilizza leggermente più token per attività" — quindi un prompt identico arriva come un numero maggiore di token fatturabili rispetto a quanti ne avrebbe sulla generazione precedente. La media del 75% è il risultato netto di entrambi, ed è un dato del fornitore.
La soglia dei 100.000 token è la parte che coglie di sorpresa. Anthropic applica i prezzi di Claude Haiku 5.5 in base alla lunghezza del prompt: una richiesta il cui prompt supera i 100.000 token paga i prezzi più alti sull'intera richiesta, non solo sui token oltre la soglia. La lunghezza del prompt conta tutti i token di input, comprese le letture e le scritture della cache, e ogni richiesta viene tariffata singolarmente — una richiesta lunga paga la fascia più alta anche quando parte del suo prompt è un cache hit, e le richieste precedenti mantengono i prezzi con cui sono state fatturate. Una pipeline di retrieval che si trova comodamente a 90.000 token paga $0,10 e $0,50. Sposta la finestra di un solo gradino e l'intera richiesta viene ritarriffata a $0,50 e $2,50. Claude Sonnet 5.5 non fa questo, perché l'intera finestra da un milione di token viene fatturata al prezzo standard.
Ne derivano due conseguenze, che puntano in direzioni opposte. Primo, il punto di incrocio che ci si aspetta — un contesto lungo che rende il modello costoso quello più economico — non si verifica: Claude Haiku 5.5 sopra la soglia costa comunque un quarto di Claude Sonnet 5.5 sul listino prezzi. Secondo, il divario su cui contavi si restringe da 20x a 4x proprio quando il tuo carico di lavoro diventa pesante, che è esattamente il momento in cui i numeri assoluti iniziano a contare. Il salto è il motivo per cui una pipeline sensibile ai costi ha bisogno di una propria voce di budget anziché di una tariffa per token.
Quale punteggio ciascun fornitore dichiara di ottenere
Tutto ciò che compare in questa sezione è dichiarato dal fornitore e non è stato riprodotto da terzi. Anthropic pubblica lo stesso insieme di confronti nelle pagine di Claude Haiku 5.5 e Claude Sonnet 5.5 e, laddove le due pagine si sovrappongono, concordano:
• GDPval-AA v2.1, lavoro intellettuale — 1.620 per Claude Haiku 5.5, contro 1.840 per Claude Sonnet 5.5, 735 per Claude Haiku 4.5 e 1.437 per GPT-6 Luna.
• AA-Briefcase v1.1 — 1.578 per Claude Haiku 5.5, contro 1.824 per Claude Sonnet 5.5, 614 per Claude Haiku 4.5 e 1.336 per GPT-6 Luna.
• OSWorld 2.1, computer use, sottoinsieme offline — 72,4% per Claude Haiku 5.5, contro 83,9% per Claude Sonnet 5.5, 15,7% per Claude Haiku 4.5 e 48,9% per GPT-6 Luna.
• Terminal-Bench 4.0, codifica agentica — 39,2% per Claude Haiku 5.5, contro 70,6% per Claude Sonnet 5.5, 0,0% per Claude Haiku 4.5 e 16,4% per GPT-6 Luna.
• FrontierCode 1.1, Main — 46,4% per Claude Haiku 5.5, contro il 52,1% di Claude Sonnet 5.5 con effort Xhigh, 42,4% per GPT-6 Luna. Anthropic segnala inoltre che Claude Sonnet 5.5 ottiene un punteggio inferiore con effort Max rispetto a Xhigh in questo caso, cosa che attribuisce a un uso più frequente di una skill di revisione del codice che causa timeout o modifiche fuori ambito.
• Chartography, ragionamento visivo senza strumenti — 46,4% per Claude Haiku 5.5, contro 61,6% per Claude Sonnet 5.5, 6,4% per Claude Haiku 4.5 e 29,1% per GPT-6 Luna.
• Humanity's Last Exam — 45,9% senza strumenti e 57,4% con essi per Claude Haiku 5.5; 64,5% con strumenti per Claude Sonnet 5.5, 18,7% per Claude Haiku 4.5 e 56,9% senza strumenti per Claude Sonnet 5.5 nella stessa pagina. Anthropic osserva che i dati della famiglia GPT-6 potrebbero essere obsoleti perché OpenAI ha corretto un bug di comprensione delle immagini e non tutti i punteggi di terze parti erano stati aggiornati.
Due di quelle righe meritano di essere lette due volte. Su FrontierCode i due modelli sono tutto sommato vicini — 46,4% contro 52,1% — e su Chartography, dove non ci sono strumenti dietro cui nascondersi, il divario è di 15 punti. Terminal-Bench 4.0 non è affatto vicino: 39,2% contro 70,6% è una classe di capacità diversa, motivo per cui la pagina di Claude Sonnet 5.5 di Anthropic continua a indicare Claude Sonnet 5.5 e Claude Opus 5.5 per la codifica agentica complessa e descrive Claude Haiku 5.5 come il modello per attività mirate e ad alto volume.
Che cosa apporta il consiglio indipendente
I numeri di Anthropic confrontano i suoi modelli tra loro e con un concorrente. Un organismo indipendente li mette entrambi a confronto con l'intero settore, e il dato che riporta, che i fornitori non forniscono, è il costo per attività completata.
Artificial Analysis assegna a Claude Haiku 5.5, con Max effort, un punteggio di 43 all'Intelligence Index, ben al di sopra della mediana di 13 tra modelli comparabili, generando 440 M token di output sull'Indice rispetto a una mediana di 100 M — molto verboso — a $0,10 per milione in input e $0,50 per milione in output, e 242 token di output al secondo. Il suo costo misurato è di $0,21 per ogni task dell'Intelligence Index.
La stessa classifica assegna a Claude Sonnet 5.5 un punteggio di 56, contro una mediana di 26, generando 410 milioni di token di output rispetto a una mediana di 88 milioni, a $2,00 per l'input e $10,00 per l'output con uno sconto cache del 90%. Il suo costo misurato è di $7,60 per attività dell'Intelligence Index.


Metti quelle due righe una accanto all'altra e il rapporto racconta tutto. $0,21 contro $7,60 è poco più di 36 volte, e i due modelli sono quasi alla pari quanto a verbosità — 440M token di output contro 410M — quindi quel moltiplicatore è quasi interamente il listino prezzi che fa ciò che il listino prezzi dice che farà. Sul listino prezzi del fornitore stesso, lo stesso confronto è 20x. La parte in più deriva da ciò che un prezzo per token non può mostrare: il modello più economico raggiunge la sua risposta con meno token fatturati per task con questa impostazione di effort, e le letture dalla cache sono fatturate a un decimo della tariffa di Claude Sonnet 5.5. Stesso harness, stessi task, misurati in modo indipendente.

Dove la fascia economica finisce davvero
I numeri dei clienti che Anthropic pubblica decidono la scelta più spesso di quanto facciano i benchmark, e puntano tutti nella stessa direzione. Asana riporta una latenza inferiore di oltre il 30% sul completamento delle attività e un'inferenza fino a 2,5 volte più veloce per turno dell'agente. Box riporta un punteggio superiore di 11 punti a Claude Haiku 4.5 con circa la metà della latenza. HubSpot riporta il miglior punteggio che abbia visto sulla propria suite, 92,8% in media su tre esecuzioni, con il tasso di successo più alto e il tasso di falsi positivi più basso. AlphaSense esegue circa 8 milioni di chiamate a settimana tramite "Ask in Document" e riporta un miglioramento statisticamente significativo rispetto a Claude Haiku 4.5, 0,84 contro 0,76. Cognition riporta che, con Claude Haiku 5.5 come sidekick, il suo Fusion mantiene un punteggio FrontierCode di 66,2.
Nessuno di questi è un agente a lungo orizzonte. Sono soluzioni puntuali — un singolo passo ben definito, sempre più veloce ed economico. È la forma per cui è costruito Claude Haiku 5.5, ed è anche la forma in cui il vantaggio di costo di 36 volte è denaro reale anziché un errore di arrotondamento. Il vantaggio si accumula con il volume di chiamate e svanisce con la profondità delle chiamate: centomila chiamate di classificazione al giorno a 0,10 $ in input e 0,50 $ in output è una voce di costo che noti sparire, mentre cento turni di agente per sessione, ognuno dei quali rilegge il contesto accumulato, è una voce che cresce in modo superlineare perché ogni turno oltre la soglia paga la fascia più alta.
Il controargomento di Claude Sonnet 5.5 è il costo per tentativo, non il costo per token. Anthropic afferma che funziona oltre il 30% più velocemente di Claude Sonnet 5 e costa fino al 30% in meno per la maggior parte dei lavori, con il risparmio che deriva dal bisogno di meno token anziché da tariffe più basse. I tester di terze parti hanno quantificato la cosa: Slack segnala circa il 14% in meno di token di output, Balyasny circa 121k token per risposta contro 497k, Box 2,4 volte più veloce con 12 in meno, Lovable circa un terzo in meno di chiamate agli strumenti e circa la metà delle esecuzioni shell, Atlassian con Rovo Agents fino al 30% più veloci, e Base44 3,6 iterazioni per contro 7,7 di Claude Opus 5. Un turno che va a segno batte quattro che non ci riescono.
C'è un terzo fattore che va nella direzione opposta. Anthropic ha spostato lo sforzo su una manopola a livello di modello in questa generazione — l'impostazione dell'effort di Claude Haiku 5.5 viene definita una volta per richiesta anziché essere dimensionata come budget di ragionamento per singola richiesta, e la vecchia budget_tokens modalità è deprecata sui modelli 4.6 e non è accettata su quelli successivi. Per una flotta che chiama un unico ID modello da molti servizi, questa è una semplificazione. Per qualsiasi cosa che dimensionasse il proprio ragionamento a ogni chiamata, è una riscrittura.
Eseguire entrambi dietro un unico endpoint
Il motivo per cui vale la pena prendere la decisione giusta è che correggere la metà sbagliata è costoso: ricablare un percorso di produzione da un ID modello a un altro significa toccare ogni call site che dava per scontato il comportamento del precedente. Il modo meno costoso per scoprire a quale tier appartiene un carico di lavoro è eseguire entrambi dietro un unico endpoint e spostare il traffico tra di essi tramite configurazione anziché tramite refactoring.
È a questo che serve OrcaRouter. Claude Sonnet 5.5 è a catalogo come anthropic/claude-sonnet-5.5, insieme a Claude Sonnet 5, Claude Opus 5.5 e Claude Haiku 4.5 — il vecchio tier Haiku resta disponibile come punto di riferimento mentre migri altrove. La piattaforma applica il prezzo di listino del provider a markup zero, quindi i 2,00 $ e i 10,00 $ qui sopra sono le tariffe che paghi, e vale anche al contrario: quando un fornitore cambia i prezzi, il nuovo prezzo è attivo qui lo stesso giorno, ed è così che ci è arrivato il taglio del cache-read di Claude Sonnet 5.5. Due funzionalità fanno il lavoro che questa particolare decisione richiede. Il failover automatico tiene fuori dal tuo percorso critico un modello che stai ancora valutando da solo, e il DSL di routing ti consente di inviare le chiamate sotto i 100.000 token al tier economico e di affidare quelle a contesto lungo o a lungo orizzonte a quello più caro nello stesso flusso di richieste, senza un secondo contratto o un secondo SDK.
Per essere precisi su ciò che è e non è ospitato: Claude Sonnet 5.5 è instradabile attraverso di noi già da oggi. Claude Haiku 5.5 non è ancora presente nel catalogo. Finché non lo sarà, risiede sull'API di Anthropic e sulle tre piattaforme cloud elencate sopra.
Come decidere
Scegli Claude Haiku 5.5 quando l'attività è ristretta, ad alto volume e verificabile — classificazione, estrazione, routing, riepilogo, il lavoro per turno all'interno di un agente che hai già creato. Il divario di tariffa di 20 volte è proprio il punto, il passaggio da 100.000 token è evitabile per progettazione, e il costo di $0,21 per attività misurato in modo indipendente dice che il vantaggio sopravvive al di fuori del laboratorio del fornitore stesso. Imposta il livello di sforzo per classe di attività invece di lasciarlo sul valore predefinito; su un modello della classe Haiku la differenza tra Basso e Massimo è un moltiplicatore di costo, non una preferenza di qualità.
Scegli Claude Sonnet 5.5 quando il compito è a lungo orizzonte, agentico o non verificabile — codice che deve compilare, uso del computer che deve lasciare lo schermo in uno stato noto, qualsiasi cosa in cui una risposta sbagliata costi più della chiamata. Terminal-Bench 4.0 al 70,6% contro il 39,2% non è una sfumatura, è una classe di capacità diversa, e il listino a tariffa fissa significa che un contesto lungo non rincara silenziosamente l'intera richiesta. Se il tuo carico di lavoro è davvero a metà strada, la risposta onesta è che nessuno dei due modelli ha ancora alle spalle un ampio corpus di riproduzioni di terze parti, i punteggi dell'indice provengono da un unico harness, e i dati del fornitore citati sopra sono quelli del fornitore stesso.
Cosa cambierebbe questa risposta?
Tre cose meritano attenzione, e nessuna di esse è un rilascio di benchmark. La prima è se valutazioni indipendenti di Claude Haiku 5.5 ai livelli Low, High e Xhigh effort — non solo Max — mostrano lo stesso rapporto costo-per-attività, perché il selettore dell'effort è la leva più economica del confronto e quella meno misurata. La seconda è se il passo da 100.000 token sopravvive; una terza fascia, o nessuna fascia sulla prossima generazione, cambierebbe l'aritmetica per ogni pipeline di retrieval in linea più di qualsiasi singolo punteggio di benchmark. La terza è il tokenizer. Se un checkpoint successivo tokenizza lo stesso testo al tasso più vecchio, la media del 75% di Anthropic diventa un minimo anziché un obiettivo, e il divario rispetto a Claude Sonnet 5.5 si allarga senza che nessuno dei due prezzi si muova.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
