Una hero card generata per "Più economico per token, più caro per risposta", con il badge "COST PER ANSWER", l'occhiello "DUE LIVELLI ECONOMICI, UN TABELLONE CONDIVISO" e il sottotitolo "Claude Haiku 5.5 a 43.40 contro Gemini 3.5 Flash-Lite a 22.2 sull'Intelligence Index v4.3.2". Quattro chip riportano "43.40 vs 22.2", "$0.21 vs $0.12", "$0.10 vs $0.30" e "$0.50 vs $2.50". Due card sottostanti sono etichettate "IL VANTAGGIO DI ANTHROPIC" ("ventuno punti in più sul tabellone condiviso, e più economico su entrambi gli indicatori") e "IL VANTAGGIO DI GOOGLE" ("più economico per un'attività completata, e gestisce video e audio"). Un piè di pagina recita "Punteggi indipendenti e costo per attività da Artificial Analysis; prezzi di listino rilevati l'8 ottobre 2026". Il logo OrcaRouter è inserito in composito nell'angolo in basso a destra.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: più economico per token, più costoso per risposta

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Claude Haiku 5.5 costa 0,10 $ per milione di token in input e 0,50 $ per milione di token in output. Gemini 3.5 Flash-Lite costa 0,30 $ e 2,50 $ sulle stesse due voci. Il modello Anthropic costa un terzo in ingresso e un quinto in uscita, e ottiene 43,40 contro 22,2 sull'Artificial Analysis Intelligence Index v4.3.2 — un divario di oltre venti punti in un campo in cui dieci rappresentano un salto generazionale. Sul listino dei prezzi non è un confronto ravvicinato, e nemmeno sul piano delle capacità lo è.

In fattura è un confronto ravvicinato, e va nella direzione opposta. Metti entrambi i modelli sulla stessa classifica indipendente e fai pagare a ciascuno per un compito completato anziché per un token, e Gemini 3.5 Flash-Lite risulta più economico per risposta. Artificial Analysis colloca Claude Haiku 5.5 a $0,21 per compito dell'Intelligence Index e Gemini 3.5 Flash-Lite a $0,1235 — un vantaggio di 1,7 a uno per il modello che paga cinque volte di più per ogni token che emette.

Quell'inversione è tutto ciò che conta in questo confronto. Claude Haiku 5.5 sostituisce il livello più economico che Anthropic abbia mai rilasciato e batte tutto ciò che gli si avvicina nella classifica condivisa. Gemini 3.5 Flash-Lite è stato rilasciato il 21 luglio 2026 ed è l'opzione più conveniente in questa fascia dall'estate. La domanda che un acquirente si pone davvero non è quale dei due sia migliore, perché la risposta è ormai definita. È quale dei due mettere davanti a una richiesta che deve costare poco.

Tutto quanto segue è per milione di token in dollari statunitensi. I prezzi di listino sono le tariffe pubblicate dai fornitori stessi. I punteggi indipendenti, i dati sul costo per attività e le misurazioni della velocità attribuiti ad Artificial Analysis sono di quel valutatore. I dati sulla latenza per Gemini 3.5 Flash-Lite provengono dal nostro traffico misurato. Laddove un numero sia riportato nel record del modello in nostro possesso anziché essere letto dalla pagina del valutatore quel giorno, abbiamo considerato quel valutatore come fonte e non noi stessi.

L'adesivo e la fattura non coincidono

Il divario di costo per attività non è spiegato dal tariffario, e vale la pena capire il motivo per cui esiste prima che l'uno o l'altro modello si avvicini alla produzione.

Claude Haiku 5.5 è verboso, e il valutatore lo dice a chiare lettere. Eseguendo l’Intelligence Index, Artificial Analysis ha registrato 440 milioni di token di output dal modello rispetto a una mediana di 100 milioni in generale, e lo ha segnalato come molto verboso. Il thinking viene fatturato come output, il thinking è attivo per impostazione predefinita con un selettore dell’impegno che parte da medio, e una tariffa di input economica non aiuta un workload la cui bolletta è in gran parte output.

Anche Gemini 3.5 Flash-Lite non è conciso, ma è misurabilmente meno costoso per attività. La stessa classifica registra per esso 17.507 token di output per ogni attività di indicizzazione completata — 10.405 dei quali di ragionamento e 7.102 di risposta. Confronta questo dato con il volume di token del modello Anthropic e il calcolo torna: un vantaggio di cinque a uno sulla tariffa di output viene in parte consumato da un modello che genera la risposta più lunga, e ciò che sopravvive a livello di attività è un piccolo svantaggio anziché un grande vantaggio.

C'è un secondo effetto, più silenzioso, che va nella stessa direzione. La documentazione di Ant​hropic afferma che Claude Haiku 5.5 utilizza il tokenizer condiviso con Claude 4.7 e versioni successive, quindi lo stesso testo conta circa il 30% in più di token rispetto a quanto faceva sul modello che questo sostituisce. La tariffa è diminuita di un fattore tre rispetto al livello di Goo​gle. Il conteggio dei token non è diminuito e, sullo stesso testo, è aumentato.

Entrambi i modelli, sui numeri che contano

Tariffe in cache e prezzi di listino dalla documentazione di Ant​hropic e Goo​gle; cifre indipendenti attribuite ad Artificial Analysis; latenza in tempo reale dalla nostra finestra di traffico di sette giorni. Dati in cache al 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Input — Claude Haiku 5.5 $0,10 fino a 100.000 token e $0,50 oltre; Gemini 3.5 Flash-Lite $0,30 a tariffa fissa su una finestra di 1.048.576 token.

• Output — Claude Haiku 5.5 0,50 $ fino a 100.000 token e 2,50 $ oltre; Gemini 3.5 Flash-Lite 2,50 $ a tariffa fissa.

• Input in cache — Claude Haiku 5.5 $0,01 fino a 100.000 token e $0,05 oltre; Gemini 3.5 Flash-Lite $0,03. Le scritture nella cache costano $0,125 e $0,625 per milione di token per Claude Haiku 5.5.

• Contesto e output — un milione di token per ciascuno. L'output massimo è di 128.000 token per Claude Haiku 5.5 contro 65.536 per Gemini 3.5 Flash-Lite, quindi il tetto di Ant​hropic è circa il doppio.

• Modalità di input — testo e immagini per Claude Haiku 5.5; testo, immagini, video, audio e file per Gemini 3.5 Flash-Lite. Entrambi restituiscono testo.

• Punteggio indipendente — 43,40 per Claude Haiku 5.5 (Max), secondo di 182 modelli sull'Intelligence Index v4.3.2, contro 22,2 per Gemini 3.5 Flash-Lite, novantaseiesimo di 147 e nel trentaquattresimo percentile di quella classifica.

• Costo indipendente per attività — 0,21 $ contro 0,1235 $ sulla stessa bacheca.

• Throughput — 241,9 token di output al secondo misurati per Claude Haiku 5.5 da Artificial Analysis, contro 280,0 per Gemini 3.5 Flash-Lite misurati sul nostro playground negli ultimi sette giorni. Quelli sono due harness, non uno, quindi leggeteli come un ordine di grandezza e non come una gara.

Ventuno punti, e di cosa sono fatti

Un divario di ventuno punti su un indice che tocca i sessanta non è un margine. È la differenza tra un modello in grado di sostenere un ciclo agentico e un modello a cui andrebbe affidata una singola chiamata ben specificata.

I due fornitori non misurano gli harness dell'altro, quindi le rispettive suite non possono essere allineate. Anthropic pubblica i risultati di GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 e FrontierCode per Claude Haiku 5.5; Google pubblica il proprio set per il livello Flash-Lite; nessuno dei due ha eseguito quello dell'altro. L'unico confronto realmente omogeneo disponibile è la classifica indipendente, e lì il modello Anthropic è in vantaggio con un margine tutt'altro che risicato.

I punteggi parziali del valutatore per Gemini 3.5 Flash-Lite mettono nero su bianco la fisionomia di quel livello. Registra l'83,8% su GPQA Diamond e il 54,2% su SWE-Bench Pro, il 54% su Terminal-bench 2.1, il 41,3% su SciCode e il 39,2% su MLE-Bench, con il 18,8% su Humanity's Last Exam. Sono i numeri di un livello competente, economico e generalista: forte sulle domande di conoscenza, visibilmente indietro sulle valutazioni di ragionamento e di ricerca più difficili. Claude Haiku 5.5, con 43,40 sul composito, si colloca in una fascia del tutto diversa, e la lettura pratica è che il lavoro che richiede una pianificazione articolata su un orizzonte lungo non è affatto un compito per il livello di Google.

Un milione di token di finestra, e 65.536 di risposta

Le due finestre di contesto hanno la stessa dimensione e non sono lo stesso prodotto.

Il contesto lungo su 3.5 Flash-Lite degrada con la distanza in un modo che vale la pena quantificare prima di fidarsi. Su GDM-MRCR v2, la valutazione di retrieval a otto aghi, registra in media il 72,2% quando gli aghi si trovano entro 128.000 token e il 21,3% sulla variante pointwise da un milione di token. Il suo valore di Long-Context Recall è del 76%, e CharXiv Reasoning si attesta al 74,5% senza strumenti e al 76,5% con essi. Una finestra da un milione di token è una capacità reale; recuperare in modo affidabile dalla sua estremità più lontana è una capacità minore, e i due numeri sopra rappresentano la distanza tra le due. La finestra del modello Claude non è stata misurata allo stesso modo sulla stessa board, quindi non è disponibile una cifra equivalente per esso, e questo articolo non ne inventerà una.

I limiti di output sono la differenza più immediatamente utile. Claude Haiku 5.5 emette 128.000 token in una singola risposta; Gemini 3.5 Flash-Lite si ferma a 65.536. Se l'artefatto che vuoi indietro è un file lungo, una migrazione completa, una suite di test generata o una riscrittura su scala di trascrizione, uno di questi due modelli può produrlo in una singola chiamata e l'altro no — e un lavoro suddiviso su due chiamate costa più del doppio di una singola chiamata, perché il prefisso condiviso viene inviato due volte.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

Audio e video non è una questione di prezzo

Gemini 3.5 Flash-Lite accetta video, audio e file alla stessa tariffa del testo. Claude Haiku 5.5 accetta testo e immagini.

Per una pipeline che acquisisce chiamate registrate, catture dello schermo o filmati di sorveglianza, la differenza di capacità che conta non sono i ventuno punti di indice. È che uno di questi modelli prende l'input direttamente, e l'altro ha bisogno di una fase di trascrizione o di estrazione di fotogrammi davanti a sé — un secondo modello, un secondo costo, e una nuova modalità di errore che si frappone tra la fonte e la risposta. I team in quella posizione non stanno scegliendo tra due livelli economici. Stanno scegliendo tra un modello e una pipeline.

Vale il contrario per immagini e documenti. Entrambi i modelli leggono le immagini nativamente, e Claude Haiku 5.5 ottiene 43,40 sul composito, quindi un carico di lavoro di estrazione da immagini di pagina o di comprensione di diagrammi senza audio al suo interno spetta al lato Ant​hropic in base ai numeri piuttosto che a un argomento di modalità.

Eseguendo uno dei due da qui

Gemini 3.5 Flash-Lite è nel catalogo OrcaRouter al prezzo di listino di Google con markup dello 0%, il che significa che la tariffa del fornitore viene passata così com'è anziché essere combinata e una modifica al listino di Google arriva sulla tua fattura il giorno in cui arriva sulla loro. Si tratta di una sola chiave e un solo SDK per il livello di Google insieme a Claude Sonnet 5.5 e Claude Opus 5.5, presenti anch'essi nel catalogo — quindi un A/B tra un ramo Google Flash-Lite e un ramo Anthropic è già una configurazione invece che un progetto di integrazione. Il failover automatico sta alla base, così nessuno dei due rami costituisce un singolo punto di guasto, e il DSL di routing esprimerà l'escalation nella rotta se è lì che la logica deve risiedere.

Il profilo di latenza di quel tratto si basa sulla nostra misurazione, non su quella del fornitore. Negli ultimi sette giorni di traffico reale, Gemini 3.5 Flash-Lite ha mantenuto un p50 di 2.426 millisecondi e un p95 di 8.600 millisecondi a 280 token di output al secondo, con un tasso di errore dello 0,313%. Leggilo come una finestra mobile, non come una promessa: cambia al variare del traffico e delle condizioni del fornitore, e il numero di cui fidarsi per una data pipeline è quello che misuri tu stesso dopo una settimana.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 non è nel catalogo. È stato rilasciato il 7 ottobre 2026 — un giorno prima che questo fosse scritto — e oggi non è instradabile da noi, quindi il lato Anthropic di questo confronto è attualmente raggiungibile solo presso Anthropic. Dirlo chiaramente è meglio che lasciarlo implicito. Un divario tra il rilascio di un modello e la possibilità di richiamarlo tramite noi è normale, non è una promessa su quando si colmerà, e un lettore che pianifica una migrazione dovrebbe pianificare in base al calendario che può vedere piuttosto che a quello che preferirebbe.

Quale, e per chi?

Se il lavoro è testo in entrata e testo in uscita, se i prompt rientrano sotto i 100.000 token e se il compito richiede pianificazione in più passaggi o agenti a lungo orizzonte, Claude Haiku 5.5 è il modello più forte di ventuno punti e quello più economico per token di un fattore da tre a cinque. Fai il budget sul costo per compito anziché sul listino prezzi, aspettati circa $0,21 per il tipo di lavoro che il consiglio indipendente misura, e riconta i tuoi prompt prima di fare qualsiasi previsione, perché il cambiamento del tokenizer sposta il conteggio di circa il trenta percento da solo.

Se il lavoro è breve, ad alto volume e a forma di risposta — un tag, una categoria, un'estrazione, una decisione di guardrail — allora l'aritmetica favorisce Gemini 3.5 Flash-Lite e lo fa per una ragione poco glamour. Il conto per una chiamata che emette molto poco è dominato dall'input, le due tariffe di input sono $0,30 contro $0,10, e l'impronta di task molto più breve del modello Goo​gle significa che la tariffa più economica vince il lavoro finito anche se perde il prezzo di listino. Aggiungi input video, audio o file e la scelta smette del tutto di riguardare il prezzo.

Ciò che l'abbinamento effettivamente chiarisce è più ristretto di «il nuovo Haiku è economico». Chiarisce che la tariffa di facciata di una fascia economica è una scarsa guida a quanto ti costa quella fascia, e che il modello che sulla pagina dei prezzi sembra tre volte più caro può farti ricevere la fattura più bassa. Qualunque sia la tua scelta, misura i token che emetti e non quelli che invii, perché su entrambi questi modelli è il contatore su cui è davvero scritta la fattura.