Una hero card intitolata "Claude Haiku 5.5 vs Gemini 3.7 Flash" che mostra Claude Haiku 5.5, rilasciato il 7 ottobre 2026, a sinistra contro Gemini 3.7 Flash, contrassegnato come deprecato, a destra, una riga Intelligence Index v4.3.2 con 43.40 contro 39.06, e una riga Terminal Bench 4.0 con 0.3283 contro 0.1364.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.7 Flash: Uno di questi due è già stato ritirato

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

C'è un fatto scomodo che sta alla base di qualsiasi confronto Claude Haiku 5.5 rispetto a Gemini 3.7 Flash scritto oggi: Gemini 3.7 Flash è deprecato. Il fornitore l'ha rilasciato il 13 agosto 2026, l'ha sostituito con Gemini 3.8 Flash il 2 settembre, e Artificial Analysis ora riporta la pagina della 3.7 con un contrassegno di deprecazione. Claude Haiku 5.5, al contrario, è stato lanciato il 7 ottobre 2026 e prevede un impegno di dismissione non prima di ottobre 2027.

Ciò non rende inutile il confronto. Cambia la domanda. Non si tratta più di «quale dei due dovrei chiamare» — per la maggior parte dei team la risposta è nessuno dei due, perché la linea 3.7 è stata superata nella sua stessa famiglia. Ciò in cui è valido è qualcosa di più sottile e, si potrebbe dire, più utile: una lettura chiara di quanto velocemente si è mosso il tier flash di Google in tre settimane, e di quali parti della scheda tecnica di un modello flash-tier determinano effettivamente se viene usato.

Cosa puoi ancora misurare

Entrambi i modelli sono stati eseguiti sulla stessa board indipendente, che è l'unico posto in cui i due possono essere messi a confronto in assoluto. Su Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 ottiene 43,40 nella sua configurazione Max contro 39,06 di Gemini 3.7 Flash nella sua configurazione High — un divario di 4,33 punti.

Entrambi i fornitori pubblicano anche i propri set di valutazione, e non si sovrappongono in modo da consentire un confronto diretto. Le righe indipendenti condivise sono le quattro che Artificial Analysis ha eseguito su entrambi:

• Terminal Bench 4.0 — 0,3283 per Claude Haiku 5.5 contro 0,1364 per Gemini 3.7 Flash. Un divario assoluto di 19 punti, e l'asimmetria più ampia del set.

• SciCode — 0,5498 contro 0,5718. Gemini 3.7 Flash lo supera di 2,2 punti.

• Humanity's Last Exam — 0,4439 contro 0,4787. Gemini 3.7 Flash di 3,5 punti.

• AutomationBench, punteggio parziale — 0.3541 contro 0.6203. Gemini 3.7 Flash di 27 punti.

Leggi con attenzione quell'insieme di dati, perché contiene il risultato interessante. Gemini 3.7 Flash vince tre dei quattro benchmark condivisi e perde comunque l'indice composito di 4,3 punti. Un indice è una combinazione ponderata, e la ponderazione mette le righe relative a terminale e codice — dove il divario va nella direzione opposta con un margine molto più ampio — davanti all'aggregato delle altre. Non è tanto un artefatto di punteggio quanto un'affermazione su a cosa serve l'indice: cerca di prevedere se un modello è in grado di portare a termine un compito, e su questa questione la linea 3.7 era debole in un modo che i suoi rispettabili punteggi nei benchmark scientifici non nascondevano.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.7 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 39.06, Terminal Bench 4.0 0.3283 against 0.1364, SciCode 0.5498 against 0.5718, Humanity's Last Exam 0.4439 against 0.4787, cost per task $0.21 against $0.93 and input price $0.10 against $0.75, footed 'Gemini 3.7 Flash is listed as deprecated; all figures per Artificial Analysis v4.3.2.'

In cosa la linea 3.7 era davvero scarsa

Due righe raccontano la storia meglio dell'indice.

Terminal Bench 4.0 a 0.1364 è un numero basso, e si colloca accanto a un 0.8577 sulla precedente generazione di Terminal Bench dello stesso modello. Non si tratta di un modello peggiorato; è un benchmark che ha cambiato ciò che misura, e Gemini 3.7 Flash non ha fatto la transizione. Claude Haiku 5.5, sullo stesso benchmark rivisto, ottiene 0.3283 — non spettacolare in termini assoluti, ma quasi due volte e mezzo il valore di 3.7 Flash, sulla riga che predice più direttamente le prestazioni di coding agentico.

La seconda riga è Tau-Bench Banking, dove Gemini 3.7 Flash ottiene 0,3278. L'affidabilità nell'uso degli strumenti in un dominio strutturato è esattamente ciò per cui si distribuisce un modello economico, e un punteggio inferiore a 0,33 è il tipo di numero che uccide silenziosamente un progetto pilota. Claude Haiku 5.5 non ha un dato Tau-Bench pubblicato nella stessa tabella, quindi lì non è disponibile alcun confronto: la cosa onesta è dirlo, piuttosto che desumerne uno.

Dove Gemini 3.7 Flash ha tenuto è dove ha sempre tenuto: GPQA a 0,9455 e MMMU-Pro a 0,8549 sono entrambi punti di forza autentici, e il suo input multimodale non è mai stato in discussione. Il fallimento era nella parte della scheda tecnica che decide se un ciclo di agente funziona, non nella parte che fa vincere righe in classifica.

Cosa è cambiato nelle tre settimane successive

Gemini 3.8 Flash è arrivato il 2 settembre 2026, e il movimento all'interno della stessa fascia flash di Google è il confronto più utile per chiunque stia pianificando una pipeline per il 2027.

Sullo stesso indice, Gemini 3.8 Flash misura 40,93 contro 39,06 della linea 3.7 — un guadagno di 1,87 punti in tre settimane. Terminal Bench 4.0 è passato da 0,1364 a 0,1970. Tau-Bench Banking è passato da 0,3278 a 0,4495. Quelle sono esattamente le righe in cui il modello 3.7 era peggiore, il che suggerisce che il successore fosse mirato proprio a questa debolezza anziché a un miglioramento generale delle capacità.

Il prezzo non si è mosso affatto. Gemini 3.7 Flash era listato a $0,75 in input e $3,75 in output per milione di token, e Gemini 3.8 Flash è stato lanciato agli stessi $0,75 e $3,75 — la stessa scheda prezzi, associata a un modello migliore di due punti indice sulle righe che contano per gli agenti.

A capture of Google's Gemini API pricing documentation page, headed 'Gemini Developer API pricing', with the banner 'Gemini 3.8 Flash is now available. Try it out.' and the documentation's left-hand model list showing Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash and Gemini 3.5 Flash.

Il listino prezzi è il punto in cui questo confronto cambia davvero.

Rispetto a Claude Haiku 5.5, per Google il prezzo è tutto, e non c'è partita.

• Input — Claude Haiku 5.5: 0,10 $ per milione di token fino a 100.000, 0,50 $ oltre; Gemini 3.7 Flash: 0,75 $ a tariffa fissa, ovvero sette volte e mezzo la tariffa di Anthropic nel primo scaglione.

• Output — $0,50 per Claude Haiku 5.5 nel primo livello, $2,50 oltre; $3,75 per Gemini 3.7 Flash.

• Input in cache — $0,01 e $0,125 per Claude Haiku 5.5; $0,075 per la lettura e $0,75 per la scrittura per Gemini 3.7 Flash.

• Contesto — un milione di token per entrambi. Output massimo — 128.000 token per Claude Haiku 5.5 contro 65.536 per Gemini 3.7 Flash.

• Modalità di input — testo e immagini per Claude Haiku 5.5; testo, immagini, voce e video per Gemini 3.7 Flash. Questa resta l'unica riga in cui le specifiche di Google sono strettamente più lunghe, ed è rimasta invariata anche dopo il passaggio alla 3.8.

• Costo indipendente per attività Index completata — 0,21 $ per Claude Haiku 5.5 contro 0,93 $ per Gemini 3.7 Flash. Un divario di 4,4× più ampio di quanto suggerirebbe il rapporto di input di sette e mezzo a uno, perché il modello di Anthropic è quello prolisso in questo caso: 162.164 token di output per attività Index contro 58.387 per Gemini 3.7 Flash. Anthropic documenta inoltre un tokenizer condiviso con Claude 4.7 e versioni successive che conta circa il 30% in più di token per lo stesso testo, il che spinge nella stessa direzione.

• Velocità — 212,3 secondi per ogni attività Index con Gemini 3.7 Flash contro 424,6 con Claude Haiku 5.5. Il modello di Google è due volte più veloce dell'altro, ed è l'unica riga di questa sezione in cui il modello meno costoso non è anche il migliore.

Cosa significa questo se stai scegliendo oggi

L'interpretazione pratica è che nessuno dei due è la risposta corretta, per ragioni diverse.

Gemini 3.7 Flash è deprecato, ha lo stesso prezzo del suo successore ed è peggiore di quel successore proprio nelle righe di cui ha bisogno un modello di produzione economico. Consigliarlo significherebbe consigliare un listino prezzi associato a un modello superato — il successore costa lo stesso e fa di più. Nessuno che scelga tra questi due a ottobre 2026 dovrebbe finire sulla linea 3.7, e il fatto che il suo listino prezzi sia invariato è ciò che chiude la questione.

Claude Haiku 5.5 è il modello attivo, e sul lavoro da testo a testo è più economico sotto ogni aspetto, più alto nel composito e nettamente migliore nelle due righe che predicono il successo agentico. È anche il più lento e non può accettare parlato o video. Se questo conti è una questione che riguarda la tua pipeline, non i modelli.

La terza opzione, che il divario di punti indice tra 3,8 e 3,7 rende visibile, è che il livello flash di Google si muove abbastanza rapidamente che un confronto vecchio di tre settimane è già storia. Considera qualsiasi confronto diretto tra livelli flash come avente una durata di validità misurata in settimane, non in trimestri.

Eseguendo qualunque lato su cui ti trovi

Gemini 3.8 Flash — il successore, non il deprecato 3.7 — è nel catalogo OrcaRouter al prezzo di listino di Google con 0% di markup, quindi la tariffa che Google pubblica è la tariffa che arriva sulla tua fattura e una modifica dalla loro parte è attiva sulla nostra lo stesso giorno. Anche Claude Sonnet 5.5 e Claude Opus 5.5 sono nel catalogo, il che rende un test di routing a due fornitori una configurazione anziché un progetto: una sola API per oltre 200 modelli, una sola chiave, failover automatico sottostante, e il DSL di routing quando preferisci tenere l'escalation nella rotta piuttosto che nel codice.

Gemini 3.7 Flash stesso non è presente nel nostro catalogo, e neanche Claude Haiku 5.5 lo è. Entrambi restano raggiungibili tramite le API dei rispettivi fornitori e, nel caso di Google, attraverso diverse piattaforme di terze parti. Vale la pena dirlo chiaramente anziché lasciare che sia il lettore a scoprirlo.

A capture of the OrcaRouter model page for Gemini 3.8 Flash under google/gemini-3.8-flash, showing a 65K maximum output, text, image, video, file and audio input, benchmarks published by Google on 2026-09-02, a p50 time to first token of 3.838 seconds, and the rates $0.75 input and $3.75 output per million tokens.

Il numero da sottrarre

Non è il divario di 4,33 punti nell'indice. È che Gemini 3.7 Flash ha vinto tre dei quattro benchmark condivisi e ha comunque perso nel punteggio composito per quattro punti, perché il benchmark a cui l'indice attribuisce il peso maggiore era quello in cui ha ottenuto 0,1364. I punteggi scientifici di un modello di fascia flash possono sembrare buoni mentre fallisce proprio in ciò per cui si comprano i modelli economici.

Il corollario è che il successore ha corretto esattamente quelle righe nel giro di tre settimane, a un prezzo invariato. Alla luce di queste evidenze, la pressione competitiva in questa fascia non è il prezzo. È se il modello riesce a completare un compito articolato in più passaggi, e questo aspetto ora avanza più rapidamente dei listini prezzi.