Une carte héro intitulée « Claude Haiku 5.5 vs Gemini 3.7 Flash », présentant à gauche Claude Haiku 5.5, sorti le 7 octobre 2026, face à Gemini 3.7 Flash, marqué comme obsolète, à droite, une ligne Intelligence Index v4.3.2 indiquant 43,40 contre 39,06, et une ligne Terminal Bench 4.0 indiquant 0,3283 contre 0,1364.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.7 Flash : l’un des deux est déjà retiré

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il y a un fait gênant qui sous-tend toute comparaison Claude Haiku 5.5 face à Gemini 3.7 Flash rédigée aujourd'hui : Gemini 3.7 Flash est déprécié. Le fournisseur l'a publié le 13 août 2026, l'a remplacé par Gemini 3.8 Flash le 2 septembre, et Artificial Analysis affiche désormais la page 3.7 avec un indicateur de dépréciation. Claude Haiku 5.5, en revanche, a été lancé le 7 octobre 2026 et bénéficie d'un engagement de retrait pas avant octobre 2027.

Cela ne rend pas la comparaison inutile. Cela change la question. Il ne s’agit plus de « laquelle de ces deux-là dois-je appeler » — pour la plupart des équipes, la réponse est aucune des deux, car la gamme 3.7 a été supplantée au sein de sa propre famille. Ce à quoi elle est utile est quelque chose de plus subtil et sans doute plus utile : une lecture claire de la vitesse à laquelle l’offre flash de Google a évolué en trois semaines, et des éléments d’une fiche technique de modèle de la gamme flash qui déterminent réellement s’il est utilisé.

Ce que vous pouvez encore mesurer

Les deux modèles ont été exécutés sur le même tableau de bord indépendant, le seul endroit où les deux peuvent être comparés. Sur l’Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 obtient un score de 43,40 dans sa configuration Max, contre 39,06 pour Gemini 3.7 Flash dans sa configuration High — un écart de 4,33 points.

Les deux fournisseurs publient également leurs propres ensembles d’évaluation, et ils ne se recoupent pas d’une manière permettant une comparaison directe. Les lignes indépendantes communes sont les quatre qu’Artificial Analysis a exécutées sur les deux :

• Terminal Bench 4.0 — 0,3283 pour Claude Haiku 5 contre 0,1364 pour Gemini 3.7 Flash. Un écart absolu de 19 points, et l’asymétrie la plus large de l’ensemble.

• SciCode — 0,5498 contre 0,5718. Gemini 3.7 Flash le devance de justesse de 2,2 points.

• Humanity's Last Exam — 0,4439 contre 0,4787. Gemini 3.7 Flash de 3,5 points.

• AutomationBench, score partiel — 0,3541 contre 0,6203. Gemini 3.7 Flash l’emporte de 27 points.

Lisez attentivement cet ensemble, car il contient le résultat intéressant. Gemini 3.7 Flash remporte trois des quatre benchmarks communs et perd tout de même l'indice composite de 4,3 points. Un indice est un mélange pondéré, et la pondération place les lignes terminal-et-code — où l'écart s'inverse avec une marge bien plus importante — devant l'agrégat des autres. Ce n'est pas tant un artefact de notation qu'une affirmation sur la finalité de l'indice : il cherche à prédire si un modèle peut mener une tâche à son terme, et sur cette question, la ligne 3.7 était faible d'une manière que ses scores respectables aux benchmarks scientifiques ne masquaient pas.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.7 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 39.06, Terminal Bench 4.0 0.3283 against 0.1364, SciCode 0.5498 against 0.5718, Humanity's Last Exam 0.4439 against 0.4787, cost per task $0.21 against $0.93 and input price $0.10 against $0.75, footed 'Gemini 3.7 Flash is listed as deprecated; all figures per Artificial Analysis v4.3.2.'

Ce en quoi la gamme 3.7 était réellement mauvaise

Deux lignes racontent l'histoire mieux que ne le fait l'index.

Terminal Bench 4.0, à 0,1364, est un chiffre bas, et il côtoie un 0,8577 sur la génération précédente de Terminal Bench issue du même modèle. Ce n'est pas un modèle qui s'est dégradé ; c'est un benchmark qui a changé ce qu'il mesure, et Gemini 3.7 Flash n'a pas réussi la transition. Claude Haiku 5.5, sur le même benchmark révisé, obtient 0,3283 — pas spectaculaire en termes absolus, mais près de deux fois et demie le chiffre de 3.7 Flash, sur la ligne qui prédit le plus directement les performances en codage agentique.

La deuxième ligne correspond à Tau-Bench Banking, où Gemini 3.7 Flash obtient un score de 0,3278. La fiabilité de l'utilisation d'outils dans un domaine structuré est exactement ce pour quoi un modèle bon marché est déployé, et un score inférieur à 0,33 est le genre de chiffre qui tue discrètement un projet pilote. Claude Haiku 5.5 ne dispose pas d'un chiffre Tau-Bench publié dans le même tableau, aucune comparaison n'est donc possible à ce niveau — la chose honnête est de le dire plutôt que d'en inférer un.

Là où Gemini 3.7 Flash s’est montré solide, c’est là où il l’a toujours été : GPQA à 0,9455 et MMMU-Pro à 0,8549 sont deux véritables points forts, et son entrée multimodale n’a jamais été mise en doute. La défaillance se situait dans la partie de la fiche technique qui détermine si une boucle d’agent fonctionne, pas dans celle qui fait gagner des lignes de classement.

Qu’est-ce qui a changé au cours des trois semaines qui ont suivi ?

Gemini 3.8 Flash est arrivé le 2 septembre 2026, et l’évolution au sein de la gamme Flash de Google elle-même constitue la comparaison la plus utile pour toute personne planifiant un pipeline pour 2027.

Sur le même indice, Gemini 3.8 Flash mesure 40,93 contre 39,06 pour la gamme 3.7 — un gain de 1,87 point en trois semaines. Terminal Bench 4.0 est passé de 0,1364 à 0,1970. Tau-Bench Banking est passé de 0,3278 à 0,4495. Ce sont exactement les lignes où le modèle 3.7 était le plus faible, ce qui suggère que le successeur visait précisément cette faiblesse plutôt qu’une amélioration générale des capacités.

Le prix n'a pas bougé du tout. Gemini 3.7 Flash était affiché à 0,75 $ en entrée et 3,75 $ en sortie par million de tokens, et Gemini 3.8 Flash a été lancé aux mêmes 0,75 $ et 3,75 $ — la grille tarifaire identique, associée à un modèle supérieur de deux points d'indice sur les lignes qui comptent pour les agents.

A capture of Google's Gemini API pricing documentation page, headed 'Gemini Developer API pricing', with the banner 'Gemini 3.8 Flash is now available. Try it out.' and the documentation's left-hand model list showing Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash and Gemini 3.5 Flash.

C'est sur la grille tarifaire que cette comparaison bascule vraiment

Face à Claude Haiku 5.5, le prix de Google est tout ce qui compte, et il n’y a pas photo.

• Entrée — Claude Haiku 5.5 : 0,10 $ par million de tokens jusqu'à 100 000, 0,50 $ au-delà ; Gemini 3.7 Flash : 0,75 $ forfaitaire, soit sept fois et demie le tarif d'Anthropic dans le premier palier.

• Sortie — 0,50 $ pour Claude Haiku 5.5 dans le premier palier, 2,50 $ au-delà ; 3,75 $ pour Gemini 3.7 Flash.

• Entrée mise en cache — 0,01 $ et 0,125 $ pour Claude Haiku 5.5 ; 0,075 $ en lecture et 0,75 $ en écriture pour Gemini 3.7 Flash.

• Contexte — un million de tokens pour les deux. Sortie maximale — 128 000 tokens pour Claude Haiku 5.5 contre 65 536 pour Gemini 3.7 Flash.

• Modalité d'entrée — texte et images pour Claude Haiku 5.5 ; texte, images, parole et vidéo pour Gemini 3.7 Flash. Cela reste la seule ligne où les spécifications de Google sont strictement plus longues, et elle a survécu inchangée à la succession vers 3.8.

• Coût indépendant par tâche Index terminée — 0,21 $ pour Claude Haiku 5.5 contre 0,93 $ pour Gemini 3.7 Flash. Un écart de 4,4×, plus large que ne le suggérerait le rapport d’entrée de sept et demi pour un, car c’est le modèle d’Anthropic qui est verbeux ici : 162 164 jetons de sortie par tâche Index contre 58 387 pour Gemini 3.7 Flash. Anthropic documente aussi un tokeniseur partagé avec Claude 4.7 et les versions ultérieures, qui compte environ 30 % de jetons en plus pour un même texte, ce qui va dans le même sens.

• Vitesse — 212,3 secondes par tâche Index pour Gemini 3.7 Flash contre 424,6 pour Claude Haiku 5.5. Le modèle de Google est le plus rapide des deux, par un facteur deux, ce qui est la seule ligne de cette section où le modèle le moins cher n’est pas aussi le meilleur.

Ce que cela signifie si vous choisissez aujourd’hui

L’interprétation pratique est que ni l’un ni l’autre de ces deux n’est la bonne réponse, pour des raisons différentes.

Gemini 3.7 Flash est obsolète, facturé au même tarif que son successeur, et moins bon que ce successeur sur exactement les lignes dont un modèle de production bon marché a besoin. Le recommander reviendrait à recommander une grille tarifaire attachée à un modèle supplanté — le successeur coûte le même prix et en fait davantage. Personne, en choisissant entre ces deux modèles en octobre 2026, ne devrait se tourner vers la gamme 3.7, et c'est le fait que sa grille tarifaire soit inchangée qui tranche la question.

Claude Haiku 5.5 est le modèle en production, et sur les tâches en entrée texte / sortie texte, il est moins cher à tous égards, mieux classé sur le composite et nettement meilleur sur les deux lignes qui prédisent le succès agentique. C'est aussi le plus lent, et il ne peut pas accepter la parole ni la vidéo. Savoir si cela importe est une question qui concerne votre pipeline, pas les modèles.

La troisième option, que l’écart entre les points d’indice 3,8 et 3,7 rend visible, est que le niveau flash de Google évolue assez vite pour qu’une comparaison vieille de trois semaines soit déjà de l’histoire ancienne. Considérez tout duel direct dans le niveau flash comme ayant une durée de conservation mesurée en semaines, et non en trimestres.

Gérer le camp dans lequel tu atterris

Gemini 3.8 Flash — le successeur, et non le 3.7 obsolète — figure au catalogue OrcaRouter au prix catalogue de Google, avec 0 % de marge, si bien que le tarif publié par Google est celui qui arrive sur votre facture, et toute modification de leur côté est effective du nôtre le jour même. Claude Sonnet 5.5 et Claude Opus 5.5 figurent eux aussi au catalogue, ce qui fait d'un test de routage à deux fournisseurs une configuration plutôt qu'un projet : une seule API pour plus de 200 modèles, une seule clé, un basculement automatique sous le capot, et le DSL de routage lorsque vous préférez porter l'escalade dans la route plutôt que dans le code.

Gemini 3.7 Flash lui-même ne figure pas dans notre catalogue, et Claude Haiku 5.5 non plus. Tous deux restent accessibles via les API propres à leurs fournisseurs et, dans le cas de Google, via plusieurs plateformes tierces. Cela mérite d’être dit clairement plutôt que de laisser un lecteur le découvrir.

A capture of the OrcaRouter model page for Gemini 3.8 Flash under google/gemini-3.8-flash, showing a 65K maximum output, text, image, video, file and audio input, benchmarks published by Google on 2026-09-02, a p50 time to first token of 3.838 seconds, and the rates $0.75 input and $3.75 output per million tokens.

Le nombre à soustraire

Ce n’est pas l’écart de 4,33 points de l’indice. C’est que Gemini 3.7 Flash a remporté trois des quatre benchmarks communs et a pourtant perdu le score composite de quatre points, parce que le benchmark que l’indice pondère le plus fortement était celui sur lequel il a obtenu 0,1364. Les scores scientifiques d’un modèle de gamme flash peuvent sembler bons alors qu’il échoue sur ce pour quoi on achète les modèles bon marché.

Le corollaire est que le successeur a corrigé précisément ces lignes en trois semaines, à un prix inchangé. Au vu de ces éléments, la pression concurrentielle dans ce segment n’est pas le prix. Elle tient à la capacité du modèle à mener à bien une tâche à plusieurs étapes, et cela évolue désormais plus vite que les grilles tarifaires.