Una scheda del titolo generata che recita 'Claude Haiku 5.5 è disponibile', con il badge di rilascio 'GA 7 ott 2026', due schede informative che recitano 'Input $0,10 / 1M fino a 100K token' e 'Output $0,50 / 1M fino a 100K token', e una riga di piè di pagina che recita 'Un titolo tagliato, due note a piè di pagina: 90 per cento sotto la soglia, 50 per cento sopra di essa, su circa il 30 per cento di token in più.' Il logo reale di OrcaRouter è inserito in composizione in basso a destra.
Guides & Insights

Claude Haiku 5.5 è disponibile a $0,10 per milione di token: la promessa del 75%, e le sue due note a piè di pagina

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Anthropic ha reso Claude Haiku 5.5 disponibile in generale il 7 ottobre 2026 a 0,10 $ per milione di token in input e 0,50 $ per milione in output — gli stessi due numeri che OpenAI fa pagare per GPT-6 Luna, e un quinto di quanto Claude Haiku 4.5 costa dal 2025, quando è stato lanciato a 1,00 $ e 5,00 $. Il titolo del post di lancio di Anthropic è che il nuovo modello costa "circa il 75% in meno da eseguire" rispetto al suo predecessore in media, e questa è la cifra che ogni riassunto successivo ha ripetuto. Viaggia con due note a piè di pagina che la maggior parte di quei riassunti ha omesso: sotto i 100.000 token il taglio è del 90%, sopra è del 50%, e Claude Haiku 5.5 usa il tokenizer più recente, condiviso con Claude 4.7 e successivi, quindi lo stesso testo conta all'incirca il 30% in più di token rispetto a Claude Haiku 4.5. Quindi il 75% è un'affermazione su una bolletta, non su un listino, e per chiunque abbia prompt lunghi sono due cose diverse. La tabella di confronto dello stesso fornitore mette inoltre GPT-6 Luna e Claude Sonnet 5.5 come colonne accanto ad essa, il che rende la documentazione di lancio insolitamente facile da contestare.

L'aritmetica dietro "il 75% in meno"

Parti dal listino prezzi, perché non è a tariffa unica. L'input costa $0,10 per milione fino a 100.000 token e $0,50 per milione oltre quella soglia — cinque volte tanto. L'output costa $0,50 e poi $2,50. La cache segue lo stesso scaglione: una scrittura in cache da cinque minuti costa $0,125 per milione sotto la soglia e $0,625 oltre, una scrittura da un'ora costa $0,20 e $1,00, e una lettura dalla cache costa $0,01 e $0,05. L'API Message Batches applica uno sconto del 50% su entrambi i contatori, e sul percorso batch il modello supporta fino a 300.000 token di output con l'output-300k-2026-03-24 header beta.

Ora aggiungi il tokenizzatore a tutto questo, perché è qui che l'affermazione principale diventa interessante. Un prompt che misurava 90.000 token con il tokenizzatore di Claude Haiku 4.5 ne misura circa 117.000 con quello nuovo. Non ha cambiato dimensione, ma ha superato la soglia dei 100.000 token, quindi viene fatturato a $0,50 per milione di input invece che a $0,10. Su Claude Haiku 4.5 lo stesso contenuto costava $0,09 di input ($1,00 per milione × 0,09 milioni). Su Claude Haiku 5.5 costa $0,0585. Si tratta di un taglio del 35% — reale, e ben lontano dal 90%. La cifra del 90% si applica alle richieste che rimangono sotto la soglia dopo che il tokenizzatore le ha espanse, ed è qui che risiede gran parte del traffico di chiamate brevi: una chiamata di classificazione da 20.000 token diventa di 26.000 token, rimane nella prima fascia, e lì il prezzo dell'input è davvero un decimo di quello che era.

Ne conseguono tre cose, e vale la pena separarle anziché farne una media:

• Le chiamate brevi ottengono lo sconto completo. Estrazione, instradamento, classificazione, riassunto di un documento che rientra sotto la soglia: questi vedono la cifra del 90% in input e output, meno l'espansione del tokenizer.

• Le chiamate lunghe ottengono uno sconto di circa un terzo, non di tre quarti. Una richiesta che supera i 100.000 token dopo la ri-tokenizzazione paga $0,50 e $2,50 per milione — comunque la metà delle tariffe di Claude Haiku 4.5, ma il livello in cui rientra è cinque volte quello pubblicizzato dall'etichetta.

• Il "75% in meno in media" è un valore ponderato sul traffico ed è di Anthropic. È la descrizione che il fornitore dà del proprio mix previsto, e Anthropic dichiara esplicitamente che un prompt sotto la soglia costituiva circa il 90% delle richieste al precedente Haiku. Se il vostro mix non assomiglia a quel mix, la vostra media non assomiglierà a quella media — e l'unico modo per sapere quale sia è contare i token sul vostro traffico, con il nuovo tokenizer, prima di stabilire un budget.

A generated one-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' with six rows reading 'Input: $0.10 / 1M up to 100K, then $0.50', 'Output: $0.50 / 1M up to 100K, then $2.50', 'Context: 1,000,000 tokens', 'Independent score: 43 at Max effort, rank 2 of 182', 'Cost per task: $0.21', and 'Throughput: 241.9 tokens per second', with a footer reading 'Independent figures per Artificial Analysis; pricing per Anthropic.' The real OrcaRouter logo is composited bottom-right.

Cos'altro è stato rilasciato insieme a esso?

Il modello non è soltanto un prezzo. Diversi dettagli del lancio cambiano il modo in cui si scrive codice per utilizzarlo, e uno di essi romperà un client esistente.

• Il pensiero adattivo è attivo per impostazione predefinita, con un selettore dello sforzo da Basso a Massimo e un valore predefinito pari a medio. Questo è il primo modello della classe Haiku con un'impostazione dello sforzo regolabile, ed è la leva principale sia sulla qualità sia sul costo per risposta.

• I parametri di campionamento vengono rifiutati.L'invio di un valore non predefinito per temperature, top_p o top_k restituisce un 400. Qualsiasi migrazione che ha portato avanti quegli argomenti fallirà in modo evidente alla prima richiesta invece di degradare silenziosamente, il che è almeno una modalità di errore onesta.

• Contesto di 1 milione di token e fino a 128.000 token di output nell'API Messages sincrona, con una data limite delle conoscenze a giugno 2026 e un impegno alla dismissione non prima del 7 ottobre 2027.

• Cinque piattaforme dal primo giorno: l'API di Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform su AWS. Si tratta di un lancio nello stesso giorno, anziché della disponibilità scaglionata che questi lanci richiedono di solito.

• Anche il tooling ha fatto passi avanti. Gli SDK Python e TypeScript di Anthropic ora supportano l'uso del computer e l'uso del browser in beta, e l'azienda ha aggiunto crediti API mensili per gli abbonati Max 5x ($100), Max 20x ($200) e Team (fino a $500 in pool).

• La postura di sicurezza è più ristretta di quanto il prezzo suggerisca. Anthropic afferma che le salvaguardie informatiche su Claude Haiku 5.5 sono più restrittive di quelle di Claude Haiku 4.5 ma meno restrittive di quelle dei recenti modelli di frontiera — un uso difensivo più ampio di quanto consenta Claude Sonnet 5.5, con i test di penetrazione ancora bloccati — e che le salvaguardie biologiche corrispondono a quelle di Claude Sonnet 5, Claude Sonnet 5.5 e Claude Opus 5. Le valutazioni di allineamento sono migliorate ampiamente rispetto al predecessore nella suite della stessa Anthropic.

Cosa dice la tabella del fornitore e cosa dice il consiglio indipendente

Anthropic ha pubblicato una tabella di benchmark con tre colonne di confronto, e vale la pena leggerla come un documento su come argomentano i fornitori. Ogni cifra riportata di seguito è dichiarata dal fornitore, prodotta sugli harness di Anthropic, e nessuna di esse è stata riprodotta in modo indipendente; dove compare GPT-6 Luna, è Anthropic che esegue le proprie valutazioni sul modello di un concorrente.

• Lavoro intellettuale — GDPval-AA v2.1 a 1620 per Claude Haiku 5.5, contro 735 per Claude Haiku 4.5, 1437 per GPT-6 Luna e 1840 per Claude Sonnet 5.5. AA-Briefcase v1.1 a 1578, 614, 1336 e 1824.

• Uso del computer — OSWorld 2.1 offline al 72,4% contro 15,7%, 48,9% e 83,9%.

• Ragionamento — Humanity's Last Exam al 45,9% senza strumenti e al 57,4% con essi, contro il 10,2% e il 18,7% di Claude Haiku 4.5 e il 56,9% e il 64,5% di Claude Sonnet 5.5.

• Programmazione agentica — Terminal-Bench 4.0 al 39,2% contro 0,0%, 16,4% e 70,6%. FrontierCode 1.1 (Main) al 46,4% contro il 42,4% di GPT-6 Luna e il 52,1% di Claude Sonnet 5.5.

• Lettura dei grafici — Chartography al 46,4% senza strumenti contro 6,4%, 29,1% e 61,6%.

In quella tabella Claude Haiku 5.5 vince su ogni riga contro sia il precedente Haiku sia GPT-6 Luna, e ne perde la maggior parte contro Claude Sonnet 5.5 — che è la forma onesta di un tier piccolo: un grande salto generazionale, e comunque un livello sotto il modello intermedio sul lavoro più difficile. Anthropic lo afferma nel post, raccomandando Claude Sonnet 5.5 e Claude Opus 5.5 per il coding agentico complesso, mentre posiziona l'Haiku per compattazione, riepilogo, classificazione e ruoli di subagente.

Il quadro indipendente è più sfumato e richiede maggiore attenzione. Artificial Analysis misura Claude Haiku 5.5, con effort impostato su Max, a 43 sul suo Intelligence Index v4.3.2, secondo su 182 modelli, e a 241,9 token di output al secondo — veloce, come promesso. Misura anche un costo di 0,21 $ per ogni task dell'Indice completato, perché il modello ha generato 440 milioni di token di output eseguendo la suite, contro una mediana di 100 milioni; il valutatore lo descrive come molto verboso. GPT-6 Luna, a 38 sullo stesso indice, costa 0,07 $ per task. Stesso prezzo di listino, bolletta tripla. Non è una contraddizione del claim di lancio — è lo stesso fenomeno di cui parla il claim di lancio, visto dall'altro capo: il listino è quello che paghi per token, e la cifra che paghi davvero è la tariffa moltiplicata per i token, e Claude Haiku 5.5 ne consuma più per risposta rispetto ai concorrenti. L'effort è la leva; l'impostazione predefinita del modello è medium, non Max, e un team che la fissa più in basso vedrà sia una bolletta più piccola sia un punteggio più basso.

Chiamandolo da un unico posto

La domanda di migrazione che questo lancio crea non è «è meglio?» ma «quanto mi costa il mio traffico su di esso?», e la risposta dipende dalla lunghezza dei tuoi prompt, dal tuo tasso di hit della cache e dall’impostazione di effort che scegli. Arrivarci significa eseguire il tuo set di prompt attraverso entrambe le generazioni — cosa economica da fare dietro un unico endpoint e tediosa da fare su due.

Claude Haiku 5.5 stesso non è ancora nel catalogo di OrcaRouter, e dirlo apertamente è più utile che lasciar intendere il contrario. Il resto della linea Anthropic è: Claude Haiku 4.5, Claude Sonnet 5.5 e Claude Opus 5.5 sono tutti richiamabili da noi già oggi al prezzo di listino del provider, con 0% di markup trasferito, così la gamba "prima" di un test di migrazione gira sulla stessa chiave che conserveresti in seguito, e una release del fornitore su quella gamba è attiva dalla nostra parte lo stesso giorno. La gamba "dopo" è l'API di Anthropic finché il nuovo modello non raggiunge un runtime che instradiamo. Ciò che l'endpoint condiviso ti offre nel frattempo è failover automatico alla base della chiamata, così un nuovo modello può sostenere il traffico di produzione senza che il percorso dipenda da esso, e il DSL di routing per il caso in cui l'escalation da Haiku a Sonnet debba stare nella route anziché nel codice della tua applicazione.

A screenshot of OrcaRouter's model page for anthropic/claude-haiku-4.5, showing the model card and its list pricing of $1.00 per million input tokens and $5.00 per million output tokens, captured in English.

Due risultati di clienti nel lancio vale la pena portarli avanti come indizi piuttosto che come prove. Asana riporta una riduzione della latenza superiore al 30% e un'inferenza fino a 2,5 volte più veloce per turno di agente; HubSpot riporta 92,8% in media su tre esecuzioni sulla sua suite CRM; AlphaSense riporta 0,84 contro 0,76 su 400 query. Questi sono numeri di clienti selezionati dal fornitore nell'annuncio dello stesso fornitore, e il loro valore sta nel dirti quali workload testare per primi, non nel dirti ciò che otterrai.

Cosa cambierebbe il quadro

La cifra del 75% si risolverà nello stesso modo in cui si risolve ogni affermazione di fornitore ponderata sul traffico: con la tua stessa fattura. Ciò che è davvero aperto sul fronte indipendente è il dato del costo per attività. Se regge man mano che si accumulano più esecuzioni, il riepilogo onesto di questo lancio è che Anthropic ha tagliato il listino dell'80% e ha costruito un modello che consuma più token per risposta, quindi il risparmio effettivo è reale, consistente, dipendente dal carico di lavoro e raramente è il numero sul poster. Se scende con le impostazioni di sforzo e la cache, il livello sembra ancora migliore. In ogni caso, il numero da controllare prima di un passaggio è il tuo numero di token per attività con il nuovo tokenizer — è l'unico dato che il post di lancio non può darti.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno