
Claude Haiku 5.5 vs Claude Haiku 4.5: Il taglio del prezzo del 90% non è un risparmio del 90%
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Claude Haiku 5.5 ha un prezzo di 0,10 $ per milione di token di input e 0,50 $ per milione di token di output per prompt fino a 100.000 token. Claude Haiku 4.5 costa 1 $ e 5 $, fissi, per l'intera finestra di 200.000 token che ha sempre avuto. Anthropic colloca la differenza al "90% in meno" in una nota a piè di pagina e a "circa il 75% in meno da eseguire" nella frase sopra di essa — e il divario di undici mesi tra i due modelli è esattamente la distanza tra quei due numeri.
Non è un trucco di marketing. È la forma onesta di una generazione di modello che ha cambiato tokenizer, impostazione predefinita del pensiero e finestra di contesto nello stesso momento in cui ha cambiato prezzo, e significa che chiunque sostituisca l'ID del modello e si aspetti che la bolletta cali di dieci volte resterà deluso dall'aritmetica, non dal prodotto.
Entrambi i modelli, come spediti
Tutto quanto segue è per milione di token, in dollari statunitensi, e tratto dalla documentazione di prezzi e modelli di Anthropic stessa in data 2026-10-08, salvo diversa indicazione.

• Input — Claude Haiku 5.5 $0,10 fino a 100.000 token, $0,50 oltre; Claude Haiku 4.5 $1,00 indipendentemente dalla lunghezza.
• Output — Claude Haiku 5.5 $0,50 fino a 100.000 token, $2,50 oltre; Claude Haiku 4.5 $5,00 indipendentemente dalla lunghezza.
Letture cache — Claude Haiku 5.5 $0.01 fino a 100.000 token e $0.05 oltre; Claude Haiku 4.5 $0.10. Scritture cache — $0.125 e $0.625 rispetto a $1.25.
• Contesto — 1M token rispetto a 200.000. Output massimo — 128.000 token rispetto a 64.000.
• Pensiero — Claude Haiku 5.5 è adattivo e attivo per impostazione predefinita, con un selettore dell'impegno che per impostazione predefinita è medio; Claude Haiku 4.5 adotta la vecchia forma manuale e non ha alcun parametro di impegno.
• Punteggio indipendente — Artificial Analysis Intelligence Index v4.3.2 colloca Claude Haiku 5.5 (Max) a 43,40, secondo su 182 modelli, e Claude 4.5 Haiku a 16,88, trentesimo su 61 — con il valutatore che segnala il punteggio di 4.5 come stimato.
• Velocità — la stessa fonte misura 242 token di output al secondo per Claude Haiku 5.5, contro 89,7 per la generazione 4.5: è l'unico ambito in cui il vecchio modello appare ancora a proprio agio.
Dove crolla la storia del prezzo a un decimo
Tre cose erodono il taglio, e solo la prima è un avvertimento della stessa Anthropic.
Il tokenizer è il punto più importante. Claude Haiku 5.5 utilizza il tokenizer più recente introdotto con Claude 4.7, e la documentazione di Anthropic afferma che lo stesso testo «viene conteggiato come circa il 30% di token in più rispetto a Claude Haiku 4.5». Non stai pagando un decimo della tariffa sullo stesso numero di token; stai pagando un decimo della tariffa su circa 1,3 volte i token. La guida alla migrazione dello stesso fornitore la colloca come secondo punto della propria checklist, prima di qualsiasi modifica al codice: ricontare i prompt, poi rivedere max_tokens e le stime di costo.
I token di ragionamento vengono fatturati come token di output, e Claude Haiku 5.5 ragiona per impostazione predefinita. La pagina di lancio di Anthropic dichiara esplicitamente che il modello è "molto verboso" di per sé nei grafici, e la misurazione indipendente lo conferma in modo più netto di quanto faccia il fornitore: valutando l'Intelligence Index, Artificial Analysis ha registrato 440 milioni di token di output da Claude Haiku 5.5 contro una mediana complessiva di 100 milioni, e ha segnalato il modello come molto verboso. Una tariffa di input bassa non aiuta un carico di lavoro la cui fattura è per lo più di output.
Il passo dei 100.000 token è il terzo. Al di sopra, le tariffe sono $0,50 e $2,50 — la metà di quanto addebitava Claude Haiku 4.5, sulla stessa richiesta, il che è un buon affare e non è l'affare di cui la maggior parte dei lettori avrà letto. Anthropic afferma che i prompt sotto la soglia rappresentavano circa il 90% delle richieste al precedente modello Haiku, che è il numero che rende la riduzione accettabile come titolo; è anche il mix di traffico del fornitore stesso, non il tuo.

Quanto costa lo stesso lavoro ai due modelli
Il costo per attività completata è la metrica che sopravvive a tutti e tre gli effetti sopra, perché addebita al modello tutto ciò che ha emesso, non solo ciò che gli hai inviato.
Artificial Analysis colloca Claude Haiku 5.5 (Max) a $0.21 per attività dell'Intelligence Index — la cifra che pubblica insieme a una tariffa di input di $0.10 e di output di $0.50. Non pubblica affatto alcuna cifra di costo per attività per la generazione 4.5; il riquadro riporta sconosciuto, perché il modello non è mai stato eseguito sull'Indice in una configurazione di ragionamento. Ciò che la pagina pubblica è un prezzo di listino grezzo di $1.00 e $5.00 e un punteggio misurato diverso e inferiore.
Quindi il confronto onesto per un acquirente non è 10 volte sui token, ma qualcosa di più simile a questo: un decimo della tariffa di input per il 30% in più di token, metà della tariffa di output quando si superano i 100K, e un modello che consuma più token di output per risposta rispetto al suo predecessore — a fronte di un salto di capacità da 16,88 a 43,40 sulla stessa classifica indipendente. Il dato del 75% che Anthropic cita per i carichi di lavoro medi è il numero ragionevole su cui basare la pianificazione. È anche una stima aggregata del fornitore su un mix di traffico che non controlli.
La migrazione non è uno scambio di model-id
Anthropic: la guida alla migrazione arriva a dieci punti per chiunque abbandoni Claude Haiku 4.5, e diversi sono errori bloccanti più che consigli.
• Il thinking manuale non funziona più — thinking: {"type": "enabled", "budget_tokens": N} restituisce un errore. Il thinking adattivo lo sostituisce, e thinking.display deve essere impostato su "summarized" se vuoi vedere il ragionamento.
• I parametri di campionamento si rompono — temperature, top_p e top_k devono tutti essere rimossi dalla richiesta.
• Il prefill dell'assistente non funziona — una conversazione che termina con un turno dell'assistente restituisce un errore; falla terminare con un turno dell'utente.
• Modifiche all'ordine dei blocchi — una risposta può iniziare con blocchi di pensiero, quindi il codice che legge il primo blocco di contenuto come risposta deve selezionare in base a type invece.
• I rifiuti sono una novità — il modello esegue classificatori di sicurezza, può restituire stop_reason: "refusal", e non esiste alcun fallback lato server.
• Il replay è limitato — i blocchi di pensiero funzionano solo nell'account che li ha prodotti, oppure in un account a esso collegato.
• Priority Tier non viene trasferito — le organizzazioni che detengono un impegno Priority Tier su Claude Haiku 4.5 devono pianificare la capacità separatamente, perché il tier non è supportato su Claude Haiku 5.5.
Due di questi meritano più attenzione degli altri. Il motivo di arresto per rifiuto è un cambiamento nel flusso di controllo in tutto ciò che presupponeva che ogni risposta avesse contenuto, e i blocchi di pensiero legati all'account rompono qualsiasi coda che memorizza conversazioni e le riproduce attraverso un pool di credenziali. Nessuno dei due si manifesta fino alla produzione.
Eseguire entrambi i livelli con un'unica chiave
La domanda pratica per la maggior parte dei team non è quale di questi due modelli sia migliore, perché la risposta dipende interamente da quale chiamata si sta effettuando. È se il segmento economico di una cascata possa essere aggiornato indipendentemente da tutto ciò che lo circonda.
Claude Haiku 4.5 è oggi nel catalogo OrcaRouter al prezzo di listino di Anthropic con 0% di markup, quindi la tariffa del fornitore viene passata direttamente e qualsiasi modifica che Anthropic vi apporta compare dalla nostra parte lo stesso giorno. Anche Claude Sonnet 5.5 e Claude Opus 5.5 sono presenti, il che significa che una pipeline a due livelli — modello piccolo per la maggioranza delle attività di routine, modello più grande per l'escalation — può essere costruita già ora con una chiave, un SDK e failover automatico sottostante, e il segmento piccolo può essere sostituito con Claude Haiku 5.5 in seguito come cambio di model-id anziché una riscrittura.
Claude Haiku 5.5 non è ancora nel catalogo, e vale la pena dirlo apertamente invece di lasciarlo sottinteso. Un divario nel giorno del lancio tra il rilascio di un modello e la sua instradabilità è normale e non è una promessa su quando si colmerà; i modelli chiamabili da noi questa mattina sono quelli indicati sopra.

Chi dovrebbe effettuare il passaggio e quale chiamata commutare per prima
Se il tuo traffico Haiku 4.5 consiste in classificazione, estrazione, instradamento, compattazione o riepilogo con prompt inferiori a 100.000 token, passa: la tariffa è un decimo, la finestra è cinque volte più ampia e la manopola dell'effort ti offre una leva sui costi che il vecchio modello non ha mai avuto. Prevedi un budget inferiore di circa il 75% e riconcilia con i tuoi conteggi di token dopo una settimana.
Se i tuoi prompt superano regolarmente i 100.000 token, stai ottenendo uno sconto del 50% anziché del 90%, e la seconda fascia cambia il confronto in modi che rendono vantaggioso confrontare le offerte: la tariffa di output oltre i 100K di $2.50 è superiore a quella che diversi modelli piccoli concorrenti applicano per l'intera finestra.
E se usi Haiku 4.5 perché era l'unica opzione economica in grado di gestire un documento da 200.000 token, prendi nota di cosa è cambiato. Ora la finestra è di un milione di token, il che è un prodotto diverso, e la ragione per mantenere il vecchio modello è svanita in silenzio insieme alla ragione per cui era economico.
