Una hero card generata per 'Un decimo della tariffa non è un decimo della fattura', con il badge 'DIVARIO GENERAZIONALE', l'occhiello 'DUE MODELLI HAIKU, A UNDICI MESI DI DISTANZA' e il sottotitolo 'Claude Haiku 5.5 Claude Haiku 4.5 su prezzo, token e il nuovo passo da 100.000 token.' Quattro chip riportano '$0.10 / $0.50', '$1.00 / $5.00', 'contesto 1M' e '30% di token in più'. Due card sottostanti sono etichettate 'COSA DICE LA TARIFFA' ('input e output inferiori del 90% sotto i 100.000 token') e 'COSA DICE LA FATTURA' ('circa il 75% in meno per l'esecuzione, su circa il 30% di token in più'). Un footer recita 'Documentazione sui prezzi del fornitore consultata l'8 ottobre 2026.' Il logo OrcaRouter è sovrapposto nell'angolo in basso a destra.
Guides & Insights

Claude Haiku 5.5 vs Claude Haiku 4.5: Il taglio del prezzo del 90% non è un risparmio del 90%

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Claude Haiku 5.5 ha un prezzo di 0,10 $ per milione di token di input e 0,50 $ per milione di token di output per prompt fino a 100.000 token. Claude Haiku 4.5 costa 1 $ e 5 $, fissi, per l'intera finestra di 200.000 token che ha sempre avuto. Ant​hropic colloca la differenza al "90% in meno" in una nota a piè di pagina e a "circa il 75% in meno da eseguire" nella frase sopra di essa — e il divario di undici mesi tra i due modelli è esattamente la distanza tra quei due numeri.

Non è un trucco di marketing. È la forma onesta di una generazione di modello che ha cambiato tokenizer, impostazione predefinita del pensiero e finestra di contesto nello stesso momento in cui ha cambiato prezzo, e significa che chiunque sostituisca l'ID del modello e si aspetti che la bolletta cali di dieci volte resterà deluso dall'aritmetica, non dal prodotto.

Entrambi i modelli, come spediti

Tutto quanto segue è per milione di token, in dollari statunitensi, e tratto dalla documentazione di prezzi e modelli di Ant​hropic stessa in data 2026-10-08, salvo diversa indicazione.

A generated scoreboard titled 'Claude Haiku 5.5 vs Claude Haiku 4.5 - as shipped'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cache read $0.01 and $0.05, context 1M tokens, maximum output 128,000 tokens, thinking adaptive with an effort dial. Claude Haiku 4.5 reads input $1.00 flat, output $5.00 flat, cache read $0.10, context 200,000 tokens, maximum output 64,000 tokens, thinking manual with no effort dial. A footer reads 'Vendors' published list rates and model documentation.'

• Input — Claude Haiku 5.5 $0,10 fino a 100.000 token, $0,50 oltre; Claude Haiku 4.5 $1,00 indipendentemente dalla lunghezza.

• Output — Claude Haiku 5.5 $0,50 fino a 100.000 token, $2,50 oltre; Claude Haiku 4.5 $5,00 indipendentemente dalla lunghezza.

Letture cache — Claude Haiku 5.5 $0.01 fino a 100.000 token e $0.05 oltre; Claude Haiku 4.5 $0.10. Scritture cache — $0.125 e $0.625 rispetto a $1.25.

• Contesto — 1M token rispetto a 200.000. Output massimo — 128.000 token rispetto a 64.000.

• Pensiero — Claude Haiku 5.5 è adattivo e attivo per impostazione predefinita, con un selettore dell'impegno che per impostazione predefinita è medio; Claude Haiku 4.5 adotta la vecchia forma manuale e non ha alcun parametro di impegno.

• Punteggio indipendente — Artificial Analysis Intelligence Index v4.3.2 colloca Claude Haiku 5.5 (Max) a 43,40, secondo su 182 modelli, e Claude 4.5 Haiku a 16,88, trentesimo su 61 — con il valutatore che segnala il punteggio di 4.5 come stimato.

• Velocità — la stessa fonte misura 242 token di output al secondo per Claude Haiku 5.5, contro 89,7 per la generazione 4.5: è l'unico ambito in cui il vecchio modello appare ancora a proprio agio.

Dove crolla la storia del prezzo a un decimo

Tre cose erodono il taglio, e solo la prima è un avvertimento della stessa Ant​hropic.

Il tokenizer è il punto più importante. Claude Haiku 5.5 utilizza il tokenizer più recente introdotto con Claude 4.7, e la documentazione di Ant​hropic afferma che lo stesso testo «viene conteggiato come circa il 30% di token in più rispetto a Claude Haiku 4.5». Non stai pagando un decimo della tariffa sullo stesso numero di token; stai pagando un decimo della tariffa su circa 1,3 volte i token. La guida alla migrazione dello stesso fornitore la colloca come secondo punto della propria checklist, prima di qualsiasi modifica al codice: ricontare i prompt, poi rivedere max_tokens e le stime di costo.

I token di ragionamento vengono fatturati come token di output, e Claude Haiku 5.5 ragiona per impostazione predefinita. La pagina di lancio di Anthropic dichiara esplicitamente che il modello è "molto verboso" di per sé nei grafici, e la misurazione indipendente lo conferma in modo più netto di quanto faccia il fornitore: valutando l'Intelligence Index, Artificial Analysis ha registrato 440 milioni di token di output da Claude Haiku 5.5 contro una mediana complessiva di 100 milioni, e ha segnalato il modello come molto verboso. Una tariffa di input bassa non aiuta un carico di lavoro la cui fattura è per lo più di output.

Il passo dei 100.000 token è il terzo. Al di sopra, le tariffe sono $0,50 e $2,50 — la metà di quanto addebitava Claude Haiku 4.5, sulla stessa richiesta, il che è un buon affare e non è l'affare di cui la maggior parte dei lettori avrà letto. Ant​hropic afferma che i prompt sotto la soglia rappresentavano circa il 90% delle richieste al precedente modello Haiku, che è il numero che rende la riduzione accettabile come titolo; è anche il mix di traffico del fornitore stesso, non il tuo.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 row in the models table and the published rate card beneath it, with the input, output, cache read and cache write rates and the prompt-length thresholds set out per million tokens.

Quanto costa lo stesso lavoro ai due modelli

Il costo per attività completata è la metrica che sopravvive a tutti e tre gli effetti sopra, perché addebita al modello tutto ciò che ha emesso, non solo ciò che gli hai inviato.

Artificial Analysis colloca Claude Haiku 5.5 (Max) a $0.21 per attività dell'Intelligence Index — la cifra che pubblica insieme a una tariffa di input di $0.10 e di output di $0.50. Non pubblica affatto alcuna cifra di costo per attività per la generazione 4.5; il riquadro riporta sconosciuto, perché il modello non è mai stato eseguito sull'Indice in una configurazione di ragionamento. Ciò che la pagina pubblica è un prezzo di listino grezzo di $1.00 e $5.00 e un punteggio misurato diverso e inferiore.

Quindi il confronto onesto per un acquirente non è 10 volte sui token, ma qualcosa di più simile a questo: un decimo della tariffa di input per il 30% in più di token, metà della tariffa di output quando si superano i 100K, e un modello che consuma più token di output per risposta rispetto al suo predecessore — a fronte di un salto di capacità da 16,88 a 43,40 sulla stessa classifica indipendente. Il dato del 75% che Ant​hropic cita per i carichi di lavoro medi è il numero ragionevole su cui basare la pianificazione. È anche una stima aggregata del fornitore su un mix di traffico che non controlli.

La migrazione non è uno scambio di model-id

Ant​hropic: la guida alla migrazione arriva a dieci punti per chiunque abbandoni Claude Haiku 4.5, e diversi sono errori bloccanti più che consigli.

• Il thinking manuale non funziona più — thinking: {"type": "enabled", "budget_tokens": N} restituisce un errore. Il thinking adattivo lo sostituisce, e thinking.display deve essere impostato su "summarized" se vuoi vedere il ragionamento.

• I parametri di campionamento si rompono — temperature, top_p e top_k devono tutti essere rimossi dalla richiesta.

• Il prefill dell'assistente non funziona — una conversazione che termina con un turno dell'assistente restituisce un errore; falla terminare con un turno dell'utente.

• Modifiche all'ordine dei blocchi — una risposta può iniziare con blocchi di pensiero, quindi il codice che legge il primo blocco di contenuto come risposta deve selezionare in base a type invece.

• I rifiuti sono una novità — il modello esegue classificatori di sicurezza, può restituire stop_reason: "refusal", e non esiste alcun fallback lato server.

• Il replay è limitato — i blocchi di pensiero funzionano solo nell'account che li ha prodotti, oppure in un account a esso collegato.

• Priority Tier non viene trasferito — le organizzazioni che detengono un impegno Priority Tier su Claude Haiku 4.5 devono pianificare la capacità separatamente, perché il tier non è supportato su Claude Haiku 5.5.

Due di questi meritano più attenzione degli altri. Il motivo di arresto per rifiuto è un cambiamento nel flusso di controllo in tutto ciò che presupponeva che ogni risposta avesse contenuto, e i blocchi di pensiero legati all'account rompono qualsiasi coda che memorizza conversazioni e le riproduce attraverso un pool di credenziali. Nessuno dei due si manifesta fino alla produzione.

Eseguire entrambi i livelli con un'unica chiave

La domanda pratica per la maggior parte dei team non è quale di questi due modelli sia migliore, perché la risposta dipende interamente da quale chiamata si sta effettuando. È se il segmento economico di una cascata possa essere aggiornato indipendentemente da tutto ciò che lo circonda.

Claude Haiku 4.5 è oggi nel catalogo OrcaRouter al prezzo di listino di Anthropic con 0% di markup, quindi la tariffa del fornitore viene passata direttamente e qualsiasi modifica che Anthropic vi apporta compare dalla nostra parte lo stesso giorno. Anche Claude Sonnet 5.5 e Claude Opus 5.5 sono presenti, il che significa che una pipeline a due livelli — modello piccolo per la maggioranza delle attività di routine, modello più grande per l'escalation — può essere costruita già ora con una chiave, un SDK e failover automatico sottostante, e il segmento piccolo può essere sostituito con Claude Haiku 5.5 in seguito come cambio di model-id anziché una riscrittura.

Claude Haiku 5.5 non è ancora nel catalogo, e vale la pena dirlo apertamente invece di lasciarlo sottinteso. Un divario nel giorno del lancio tra il rilascio di un modello e la sua instradabilità è normale e non è una promessa su quando si colmerà; i modelli chiamabili da noi questa mattina sono quelli indicati sopra.

A screenshot of the OrcaRouter catalogue page for Claude Haiku 4.5, showing the model identifier, the provider Anthropic, the model description and a stat strip carrying the $1.00 per million input and $5.00 per million output rates alongside the context window and maximum output.

Chi dovrebbe effettuare il passaggio e quale chiamata commutare per prima

Se il tuo traffico Haiku 4.5 consiste in classificazione, estrazione, instradamento, compattazione o riepilogo con prompt inferiori a 100.000 token, passa: la tariffa è un decimo, la finestra è cinque volte più ampia e la manopola dell'effort ti offre una leva sui costi che il vecchio modello non ha mai avuto. Prevedi un budget inferiore di circa il 75% e riconcilia con i tuoi conteggi di token dopo una settimana.

Se i tuoi prompt superano regolarmente i 100.000 token, stai ottenendo uno sconto del 50% anziché del 90%, e la seconda fascia cambia il confronto in modi che rendono vantaggioso confrontare le offerte: la tariffa di output oltre i 100K di $2.50 è superiore a quella che diversi modelli piccoli concorrenti applicano per l'intera finestra.

E se usi Haiku 4.5 perché era l'unica opzione economica in grado di gestire un documento da 200.000 token, prendi nota di cosa è cambiato. Ora la finestra è di un milione di token, il che è un prodotto diverso, e la ragione per mantenere il vecchio modello è svanita in silenzio insieme alla ragione per cui era economico.