Una hero card generata che recita 'Daily AI Brief — 8 ottobre 2026' con un badge NEWS, il titolo 'Claude Haiku 5.5 arriva, e le letture cache di Sonnet 5.5 si dimezzano', e quattro chip che mostrano $0.10 / $0.50 per 1M, contesto di 1M token, impegno predefinito Medium e lettura cache da $0.20 a $0.10.
Engineering & Research

Briefing AI quotidiano, 8 ott: Claude Haiku 5.5 arriva a 0,10 $ e le letture della cache di Sonnet 5.5 si dimezzano

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Claude Haiku 5.5 è stato rilasciato il 7 ottobre 2026 ed è la cosa meno costosa che l'azienda abbia mai messo dietro a un'API: 0,10 $ per milione di token di input e 0,50 $ per milione di token di output su prompt fino a 100.000 token, con una finestra di contesto da 1M token e un selettore di effort che va da Low a Max. Lo stesso giorno, senza un proprio post di lancio, le letture dalla prompt-cache su Claude Sonnet 5.5 sono scese da 0,20 $ a 0,10 $ per milione di token. Uno dei due è un prodotto e l'altro è una voce di bilancio, ed è la voce di bilancio quella che muoverà più denaro questo trimestre.

Il prezzo prima, perché è la parte su cui puoi agire oggi. Poi lo sforzo, che è la cosa che decide silenziosamente il prezzo. Poi il taglio della cache, di cui metà delle persone che pagano per Sonnet 5.5 non verrà a sapere fino alla prossima fattura.

Che cos'è Claude Haiku 5.5, nell'ordine in cui conta

La descrizione fornita dall'azienda stessa è "il modello piccolo più economico, veloce e capace che abbiamo mai rilasciato", e la data di rilascio è il 7 ottobre 2026 — un giorno prima di questo brief. L'ID del modello è claude-haiku-5-5. Accetta in input testo e immagini e restituisce testo. La finestra di contesto è di 1.000.000 di token, in aumento rispetto ai 200.000 di Claude Haiku 4.5, e l'output massimo è di 128.000 token, con un header beta sulla Batch API che lo porta a 300.000. Il cutoff dei dati di addestramento è giugno 2026, e Anthropic si impegna a non ritirarlo prima del 7 ottobre 2027.

Il punto che conta di più per chiunque instradi traffico non è la finestra di contesto. È che questo è il primo modello della classe Haiku con effort regolabile. L'effort prevede i livelli Low, Medium, High, Xhigh e Max, il valore predefinito è Medium, e il pensiero adattivo è attivo per impostazione predefinita — una funzionalità di Sonnet e Opus che arriva un livello più in basso. Il post di lancio contiene anche due cose che riguardano l'acquisto più che la costruzione: crediti API mensili per i piani Claude Max e Team, 100 $ con Max 5x e 200 $ con Max 20x, con fino a 500 $ cumulabili per Team, e il supporto beta di computer-use e browser-use negli SDK. La sicurezza tiene il passo con il livello: le salvaguardie informatiche sono più severe di quelle di Claude Haiku 4.5, con le richieste di penetration testing ancora bloccate, e le salvaguardie biologiche corrispondono a quelle di Claude Sonnet 5, Claude Sonnet 5.5 e Claude Opus 5.

A capture of Anthropic's Claude Haiku 5.5 announcement page showing the October 7, 2026 date, the headline framing Claude Haiku 5.5 as a performance, pricing and safety upgrade, and the on-page sections for Performance, Pricing, Safety and Further updates.

Il prezzo, e il baratro dei 100.000 token nel mezzo

La tariffa principale è $0,10 per milione di token di input e $0,50 per milione di token di output. Leggi l'asterisco: è la tariffa per prompt pari o inferiori a 100.000 token. Oltre 100.000, entrambi i numeri si moltiplicano per cinque, arrivando a $0,50 per l'input e $2,50 per l'output. Le scritture in cache costano $0,125 per milione nel livello da cinque minuti e $0,20 nel livello da un'ora all'interno della fascia economica, mentre le letture dalla cache costano $0,01 per milione — un decimo della tariffa di input, che è lo sconto cache più profondo che Anthropic abbia pubblicato su qualsiasi modello. Batch dimezza di nuovo tutto: $0,05 e $0,25 all'interno della fascia economica, $0,25 e $1,25 al di sopra.

Confrontalo con Claude Haiku 4.5, che è ancora nel listino prezzi a un prezzo fisso di 1,00 $ per l'input e 5,00 $ per l'output, senza fasce di prezzo basate sul contesto, con una lettura della cache da 0,10 $ e una finestra di 200.000 token. Il nuovo modello costa un decimo del prezzo a parità di struttura del prompt, con cinque volte il contesto. Non c'è alcun calcolo di migrazione da fare qui; i numeri non sono neanche lontanamente vicini.

Il salto è l'elemento attorno a cui progettare. Un prompt da 99.000 token costa 99 centesimi per mille chiamate alla tariffa di input. Un prompt da 101.000 token costa 5,05 $ per mille. Una differenza di duemila token comporta una fattura 5 volte più alta, quindi qualunque cosa tu costruisca nella fascia economica dovrebbe o restare comodamente sotto i 100.000 token o essere deliberatamente e costantemente al di sopra di essa — il risultato peggiore è una pipeline che si colloca a cavallo della soglia e paga la tariffa alta su metà del suo traffico.

L'effort è ormai un parametro di prezzo, e l'impostazione predefinita non è la più economica

Poiché lo sforzo è impostato per impostazione predefinita su Medio e il thinking è attivo per impostazione predefinita, il prezzo di listino e il prezzo reale non sono lo stesso numero. I token di ragionamento vengono fatturati come token di output. In un'esecuzione pubblicata da Anthropic stessa dell'Artificial Analysis Intelligence Index — riportata dal fornitore, non riprodotta da noi — Claude Haiku 5.5 emette all'incirca 162.000 token per attività, di cui circa 129.000 sono di ragionamento. Il modello mediano dell'indice emette nell'ordine di 100 milioni di token sull'intera suite; Haiku 5.5 ne spende 440 milioni. A 0,50 $ per milione di token di output, quella verbosità è abbordabile, ed è proprio questo il punto: alla tariffa di Haiku 5.5, pensare molto è comunque più economico che pensare poco su un modello che fa pagare 5,00 $ per l'output.

Imposta lo sforzo su Low per decisioni di classificazione, estrazione e instradamento in cui desideri una risposta rapida anziché ponderata, e lascialo su Medium per qualsiasi cosa che un utente leggerà. Passare a Low è anche il modo affidabile per mantenere un agente verboso all’interno della fascia dei 100.000 token, perché riduce i token di ragionamento prima di ridurre la qualità della risposta.

La linea più silenziosa: letture della cache di Sonnet 5.5 dimezzate

Claude Sonnet 5.5 legge il prompt in cache a 0,10 $ per milione di token a partire dal 7 ottobre, in calo da 0,20 $. Il prezzo di input di Sonnet 5.5 è di 2,00 $ e quello di output è di 10,00 $, quindi un moltiplicatore di lettura della cache di 0,05x è ora lo stesso moltiplicatore che ha Haiku 5.5, applicato a una tariffa di input venti volte maggiore. La stima di Anthropic stessa è che questo riduce il costo della maggior parte del lavoro agentico di circa il 20%, il che è un'affermazione sulla forma del carico di lavoro più che un benchmark: vale solo se una grande quota del tuo input è un prefisso stabile che reinvii a ogni turno. Se i tuoi prompt sono unici a ogni chiamata, questo cambiamento non ti costa nulla e non ti fa risparmiare nulla.

Vale la pena notare cosa implica il taglio. Anthropic sta applicando prezzi aggressivi ai prefissi di lunga durata sul modello di fascia media esattamente nel momento in cui lancia un modello piccolo molto economico, il che si legge come un argomento a favore di un'architettura a due modelli: un ramo Sonnet 5.5 con una cache calda per il lavoro che richiede giudizio, e un ramo Haiku 5.5 per il volume che non lo richiede.

Cosa mostrano i numeri indipendenti, in un giorno

Artificial Analysis ha valutato Claude Haiku 5.5 il giorno dopo il lancio. Il suo Intelligence Index è pari a 43 nel complesso, con la configurazione Max-effort riportata a 43,40, secondo di 182 modelli nella classifica. Il costo per attività dell'indice è $0,21, quarantaseiesimo più economico. Il prezzo misto con un mix 7:2:1 di input, input in cache e output è $0,08 per milione, ed è il numero che fa sembrare il confronto precedente tra livelli ingiusto verso tutto il resto. La velocità di output è 243,4 token al secondo, nona più veloce nella classifica, con una latenza del primo token riportata di circa 0,3 secondi e uno sconto della cache del 90%.

Quella cifra di output di 440 milioni di token è la riserva collegata al 43. Il punteggio è reale ed eseguito in modo indipendente; lo è anche la verbosità. Un modello che pensa così tanto è economico per token e non sempre economico per compito, e il divario tra questi due numeri è dove risiede realmente una decisione di routing.

Per dare un'idea della scala, le stesse comparazioni pubblicate da Anthropic collocano Claude Haiku 5.5 a 1620 su GDPval-AA v2.1 contro 735 di Claude Haiku 4.5, 72,4% su OSWorld 2.1 contro 15,7%, 45,9% su Humanity's Last Exam senza strumenti contro 10,2%, e 39,2% su Terminal-Bench 4.0 contro 0,0%. Si tratta di cifre riportate dal fornitore su valutazioni scelte dal fornitore e vanno lette come indicative, ma la direzione non è sottile — non è un piccolo aggiornamento di un piccolo modello.

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing an Artificial Analysis Intelligence Index of 43 ranked second of 182, a cost per index task of $0.21, a blended price of $0.08 per million tokens, output speed of 243.4 tokens per second, a 1M-token context window and a $0.01-per-million cache read.

Accedere a questi modelli senza un secondo contratto

Claude Haiku 5.5 è disponibile tramite l'API di Anthropic e, da lì, ovunque i modelli Anthropic vengono rivenduti. Nel catalogo di OrcaRouter la linea Anthropic oggi comprende anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 e anthropic/claude-fable-5.1 — non ospitiamo Claude Haiku 5.5, e questo documento non fingerà il contrario. Ciò che offriamo è il livello superiore, e OrcaRouter trasferisce il prezzo di listino del fornitore con 0% di ricarico, ed è per questo che la riduzione del costo di lettura della cache di Sonnet 5.5 è comparsa nei nostri prezzi lo stesso giorno in cui Anthropic l'ha introdotta, invece che in un ciclo di riprezzamento programmato.

La versione pratica: se vuoi provare Haiku 5.5 su una gamba di classificazione mentre la tua gamba di giudizio resta su Claude Sonnet 5.5, stai tenendo due chiavi invece di una, e il livello di routing è dove si decide l'A/B. È tutto qui l'argomento a favore di un gateway rispetto a un'integrazione diretta: un solo endpoint, stringhe di modello e un percorso di failover quando un provider vacilla.

A capture of the OrcaRouter models catalogue showing the filterable model list with input-modality, context-length, input-price, status and series filters, the line counting the model list and providers on one API key and one bill, and model cards carrying per-million input and output prices.

Cosa guardare da qui

Tre cose. Se i provider di terze parti inizieranno a rivendere Haiku 5.5 a una tariffa blended inferiore a $0,10, che è il punto in cui il livello di routing si ripaga da solo anziché limitarsi a semplificare l'approvvigionamento. Se Anthropic estenderà il confine della fascia da 100.000 token, dato che un salto netto esattamente a 100.000 è un posto strano in cui un modello con una finestra da 1M di token possa averlo. E se il dato di verbosità di 440 milioni di token scenderà in una point release, perché quel singolo numero è ciò che si frappone tra Haiku 5.5 e l'essere l'ovvia scelta predefinita per tutta la metà inferiore di uno stack di produzione.