
La vera storia di Claude Haiku 5.5 è il dirupo dei 100K: quanto costa il nuovo Haiku oltre i 100.000 token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Claude Haiku 5.5 è arrivato il 7 ottobre 2026 con un prezzo annunciato di $0,10 per milione di token di input e $0,50 per milione di token di output, e il numero che è stato ripetuto ovunque era quello che Anthropic stessa ha inserito nell'annuncio: un taglio del 90 per cento rispetto alla tariffa di Haiku 4.5 per le stesse due voci. Il 90 per cento è reale. È anche circoscritto a una metà di una sola dimensione della fattura, e nel momento in cui una richiesta supera i 100.000 token, ogni tariffa al suo interno fa qualcosa che la copertura del lancio ha per lo più tralasciato. Questo articolo parla di quella linea di confine: quanto costa, quali carichi di lavoro la raggiungono davvero e perché "90 per cento più economico" è un'affermazione su una fetta della fattura piuttosto che sulla tua fattura.
I due prezzi, e dove si invertono.
Anthropic pubblica due colonne per il modello, e il passaggio tra l'una e l'altra è determinato da un'unica soglia sulla dimensione della richiesta, non da un'impostazione del modello scelta da te:
• Fascia breve, pari o inferiore a 100.000 token — 0,10 $ per milione di token di input, 0,50 $ per milione di token di output (listino Anthropic) • Fascia lunga, superiore a 100.000 token — 0,50 $ per milione di token di input, 2,50 $ per milione di token di output (listino Anthropic) • Letture dalla cache — 0,01 $ per milione (fascia breve) e 0,05 $ per milione (fascia lunga) • API Batch — sconto del 50 percento su entrambe le colonne, e una lunghezza massima dell'output di 300.000 token • Output massimo standard — 128.000 token, con una finestra di contesto di 1 milione di token in entrambe le fasce

Quelle sono le tariffe pubblicate da Anthropic stessa, non quelle misurate, e costituiscono il listino attuale: il prezzo di un modello così nuovo non ha ancora avuto il tempo di muoversi, anche se Anthropic non ha alcun obbligo di mantenerlo.
Leggi quei quattro numeri in ordine e la forma della cosa è ovvia. Ogni tariffa del livello a contesto lungo è esattamente cinque volte la tariffa a contesto breve, e la soglia è la stessa di 100.000 token per tutte quante insieme. Non c'è alcuna curva graduale, nessuna interpolazione, nessuna fascia intermedia — una richiesta da 99.000 token e una da 101.000 token differiscono di un fattore cinque su ogni token della fattura, non solo sui 2.000 token che hanno superato la linea. Questa è la parte che rende questo un precipizio anziché un pendio, ed è la parte che l'inquadramento "90 per cento più economico" non riesce a vedere.

Perché il taglio sembra più grande di quanto non sia
Nel confronto fatto da Anthropic con Haiku 4.5, la fascia breve rappresenta una riduzione reale del 90 per cento sia sull'input sia sull'output — Haiku 4.5 costava 1,00 $ e 5,00 $ per milione per le stesse due colonne. La fascia lunga è tutta un'altra storia: 0,50 $ e 2,50 $ contro gli stessi 1,00 $ e 5,00 $ è un taglio del 50 per cento, non del 90 per cento. Quindi la versione onesta dell'affermazione di lancio è che Claude Haiku 5.5 costa il 90 per cento in meno di Haiku 4.5 sotto i 100.000 token e il 50 per cento in meno al di sopra, che è esattamente la suddivisione che la documentazione di Anthropic stessa fornisce quando si leggono entrambe le colonne invece di una. La singola percentuale non è sbagliata; è la percentuale della fascia breve, presentata senza la sua condizione.
C'è una seconda cosa che tira nella direzione opposta, ed è quella più interessante perché è facile da non notare e difficile da aggirare. Claude Haiku 5.5 arriva con un nuovo tokenizer, e le linee guida della stessa Anthropic collocano il conteggio dei token per un dato testo circa il 30 per cento più in alto di quanto producesse Haiku 4.5 per lo stesso contenuto. Qualunque importo pagassi per token è diminuito e quello che paghi per token del *tuo* testo è aumentato di circa un terzo, rispetto al conteggio del vecchio modello. La cifra netta dichiarata da Anthropic, secondo cui il modello costa in media circa il 75 per cento in meno da eseguire, include già questo effetto — un taglio del 90 per cento sul prezzo di listino meno un'inflazione dei token di circa il 30 per cento si colloca in quella zona sul traffico a contesto breve — ma i due effetti sono separabili e vale la pena separarli. La mossa sul prezzo è un cambiamento del prezzo di listino che puoi leggere su una pagina; la mossa sul tokenizer cambia quante unità di quel prezzo consumano i tuoi prompt esistenti, e si manifesta nei tuoi stessi conteggi di token prima di manifestarsi in qualunque altro posto.
Per un carico di lavoro che rientrava già comodamente sotto i 100.000 token per chiamata, l'effetto pratico è una riduzione diretta del costo per chiamata, in parte compensata dal tokenizzatore. Per uno che non lo faceva, l'aritmetica va nella direzione opposta due volte sulla metà lunga.
Cosa vive davvero oltre i 100.000 token
Il riflesso è archiviare la tariffazione del contesto lungo sotto «agentic coding e RAG, non noi». È una conclusione troppo affrettata, perché la soglia dei 100.000 token è una soglia per richiesta, e la dimensione per richiesta non è la stessa cosa della dimensione del task. Alcuni pattern la superano abitualmente:
• Un agente che legge la codebase e mantiene un ampio working set nel contesto per l'intera sessione, anziché recuperarlo nuovamente a ogni passaggio
• Analisi di documenti e contratti in cui l'input è un lungo PDF più le sue stesse istruzioni ed esempi few-shot — il tipo di prompt che era di 60.000 token prima che qualcuno aggiungesse gli esempi
• Pipeline di ingestion che raggruppano molti piccoli elementi in un'unica chiamata per ammortizzare l'overhead per chiamata e, così facendo, portano l'intero batch oltre la soglia
• Prodotti di chat che mantengono una cronologia completa della conversazione inline invece di riassumerla, dove la richiesta cresce in modo monotono finché qualcosa non la tronca
• Input in stile trascrizione di audio e video lunghi, che rappresentano esattamente il tipo di traffico che una finestra di 1 milione di token è pubblicizzata come in grado di abilitare
La finestra di contesto da 1 milione di token è la parte della scheda tecnica che rende il salto di prezzo degno di discussione. Anthropic vende la capacità di affidare al modello una richiesta molto grande, e il prezzo è strutturato in modo che gli ultimi 900.000 token di quella richiesta costino cinque volte quanto i primi 100.000. Entrambi i fatti sono deliberati; sono semplicemente annunciati in punti diversi. Se la finestra a contesto lungo è il motivo per cui stai guardando questo modello, la colonna del contesto lungo è la tua colonna, e la percentuale di lancio è di qualcun altro.
La pressione che il prezzo esercita sul livello Flash
L'intento dichiarato di Anthropic dietro il modello è presidiare l'estremità economica e ad alto throughput dello stack, e il listino prezzi riflette chiaramente tale intento. Il resoconto di Bloomberg sul lancio lo ha inquadrato come una difesa, da parte di Anthropic, della propria posizione a basso costo contro concorrenti open-weight più economici, e la narrazione dal lato fornitore è andata oltre — sostenendo che il nuovo Haiku è prezzato per risultare nettamente più economico dei suoi rivali diretti.
Il confronto è pulito solo sulla fascia breve, dove $0.10 e $0.50 sono aggressivamente bassi. Al di sopra dei 100.000 token, le tariffe da $0.50 e $2.50 non battono più sul prezzo la fascia breve di nessuno; sono normali cifre di fascia media. L'affermazione del fornitore sul "margine ampio" riguarda la prima colonna del listino tariffe, e Anthropic ha il diritto di formularla lì — è una lettura accurata dei numeri che pubblica. Non è un'affermazione su quanto paga un carico di lavoro a contesto lungo, e non dovrebbe essere citata come tale.
Il resto del modello, in breve
Claude Haiku 5.5 mantiene le funzionalità introdotte sulle linee Sonnet e Opus anziché ridurle per la classe di dimensioni. È presente il thinking adattivo con un'impostazione di effort predefinita su medium, ed è il primo modello della classe Haiku con un selettore di effort regolabile da Low a Max. Il knowledge cutoff è giugno 2026 e l'ID del modello è claude-haiku-5-5. Anthropic dichiara una data di dismissione non anteriore al 7 ottobre 2027 — la stessa data del rilascio, a un anno di distanza — e il modello è elencato su Amazon Bedrock, Google Cloud e Microsoft Azure insieme all'API di Anthropic.

Sul fronte dei benchmark, tutto ciò che compare nel post di lancio reca la stessa etichetta di provenienza e la merita: si tratta di numeri dichiarati dal fornitore, misurati dall'azienda che vende il modello, senza alcuna riproduzione indipendente pubblicata al momento della stesura.
• GDPval-AA v2.1 — 1.620 dichiarati dal fornitore per Claude Haiku 5.5, contro 735 per Haiku 4.5 nello stesso harness
• AA-Briefcase v1.1 — 1.578 dichiarati dal fornitore, contro 614 della generazione precedente
• OSWorld 2.1 — 72,4 percento dichiarato dal fornitore, contro 15,7 percento
• Terminal-Bench 4.0 — riportato dal fornitore 39,2, contro 0,0
• Humanity's Last Exam — 45,9 per cento secondo quanto riportato dal fornitore, ovvero 57,4 con l'uso di strumenti
La dimensione di quei delta è il motivo per cui segnalarli anziché citarli. Un salto da 15.7 a 72.4 su un benchmark per agenti OS misurato dal fornitore stesso del modello è un numero da prendere con le molle finché una terza parte non esegue lo stesso harness. Artificial Analysis ha pubblicato il proprio indice per il modello alla data dell'inizio di ottobre 2026 — una cifra indipendente di 43.395, con 0.329 su Terminal-Bench Hard e 0.444 su HLE — e quel set è quello da citare quando l'affermazione deve resistere a una contestazione. I numeri del fornitore e quelli indipendenti non sono in conflitto; sono semplicemente harness diversi, e mescolarli in un'unica frase è il modo in cui un post di un blog finisce per affermare che una valutazione del fornitore è un fatto.
La nota sull'infrastruttura, dato che ne gestiamo una
Anthropic vende Claude Haiku 5.5 tramite la propria API e tramite Bedrock, Google Cloud e Azure. Se stai decidendo quale di questi chiamare, o lo stai aggiungendo accanto agli altri modelli già presenti nel tuo stack, tieni presente che il prezzo di listino del fornitore è lo stesso ovunque venga venduto, e OrcaRouter è progettato per trasferire quel prezzo di listino a ricarico zero — così un movimento di prezzo di Anthropic su questo modello è attivo dalla nostra parte lo stesso giorno anziché con un ritardo. Il nostro catalogo comprende anche qwen/qwen3.8-flash a $0.15 e $0.47 per milione e z-ai/glm-5.3-flash a $0.15 e $0.50, la coppia che più spesso finisce nello slot accanto a un modello di classe Haiku, sulla stessa chiave e sulla stessa fattura — la cosa che fa sì che uno stack misto costi un solo contratto invece di tre. Non serviamo Claude Haiku 5.5 stesso; per quello, chiama Anthropic direttamente.
Un corollario pratico del cliff, se instradi più di un modello: il confine dei 100.000 token è un punto in cui una richiesta che prima costava poco diventa costosa senza che nulla nella richiesta cambi in modo significativo. Se il tuo livello di routing può effettuare il failover, l'assetto sensato è mantenere il traffico a contesto lungo indirizzato verso il modello che è effettivamente economico al di sopra della soglia e lasciare che il traffico a contesto breve ricada su quello che è economico al di sotto di essa, invece di presumere che la tariffa di listino di un modello si applichi a entrambi.
Cosa imparare dal lancio
Il taglio di prezzo è reale ed è consistente, al di sotto dei 100.000 token. Il modello è il primo Haiku con un set di funzionalità completo e una manopola dell'effort, il che conta più del prezzo per l'uso agentico. I delta dei benchmark sono dichiarati dal fornitore e vanno etichettati come tali ogni volta che vengono ripetuti. E il listino prezzi presenta un salto a 100.000 token che moltiplica in un colpo solo ogni tariffa per cinque — che è l'unica cosa di questo lancio che chi legge il tuo stack, più che chi legge il comunicato stampa, ha più bisogno di sapere prima che venga fissato il budget di token dello sprint successivo.
Se vuoi verificare i calcoli rispetto al tuo traffico, i due numeri da recuperare sono il 95° percentile della dimensione delle tue richieste e la tua quota di spesa per richieste superiori a 100.000 token. Se il primo è sotto la soglia, vale per te il 90 per cento e la copertura del lancio aveva ragione riguardo alla tua situazione. Se il secondo è una fetta significativa della fattura, il numero che conta è il 50, e vale la pena rieseguire la stima dei costi per qualunque modello nello stack tu abbia scelto partendo dal presupposto del 90.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
