Une carte héro générée pour « Moins cher par token, plus cher par réponse », avec le badge « COÛT PAR RÉPONSE », l'accroche « DEUX PALIERS ÉCONOMIQUES, UN TABLEAU PARTAGÉ » et le sous-titre « Claude Haiku 5.5 à 43.40 contre Gemini 3.5 Flash-Lite à 22.2 sur l'Intelligence Index v4.3.2. » Quatre pastilles indiquent « 43.40 vs 22.2 », « $0.21 vs $0.12 », « $0.10 vs $0.30 » et « $0.50 vs $2.50 ». Deux cartes en dessous sont étiquetées « L'ATOUT D'ANTHROPIC » (« vingt-et-un points de plus sur le tableau partagé, et moins cher sur les deux compteurs ») et « L'ATOUT DE GOOGLE » (« moins cher pour une tâche terminée, et il prend en charge la vidéo et l'audio »). Un pied de page indique « Scores indépendants et coût par tâche d'Artificial Analysis ; prix catalogue relevés le 8 octobre 2026. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite : moins cher par token, plus cher par réponse

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Claude Haiku 5.5 coûte 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie. Gemini 3.5 Flash-Lite coûte 0,30 $ et 2,50 $ sur les deux mêmes compteurs. Le modèle Anthropic coûte un tiers du prix en entrée et un cinquième du prix en sortie, et il obtient 43,40 contre 22,2 sur l'Artificial Analysis Intelligence Index v4.3.2 — un écart de plus de vingt points dans un domaine où dix points représentent un saut générationnel. Sur la grille tarifaire, la comparaison n'est pas serrée, et sur le plan des capacités, elle ne l'est pas non plus.

Sur la facture, la comparaison est serrée, et c’est l’inverse. Placez les deux modèles sur le même classement indépendant et facturez à chacun une tâche terminée plutôt qu’un token, et Gemini 3.5 Flash-Lite s’avère moins cher par réponse. Artificial Analysis place Claude Haiku 5.5 à 0,21 $ par tâche de l’Intelligence Index et Gemini 3.5 Flash-Lite à 0,1235 $ — un avantage de 1,7 contre 1 pour le modèle qui paie cinq fois plus pour chaque token qu’il émet.

Cette inversion est tout l'enjeu de cette comparaison. Claude Haiku 5.5 remplace le palier le moins cher qu'Anthropic ait jamais proposé et surpasse tout ce qui s'en approche dans le classement partagé. Gemini 3.5 Flash-Lite est sorti le 21 juillet 2026 et constitue le choix le plus avantageux de ce segment depuis l'été. La question qu'un acheteur se pose réellement n'est pas de savoir lequel est meilleur, car la réponse à cette question est déjà tranchée. C'est lequel placer face à une requête qui doit revenir à moindre coût.

Tout ce qui suit est exprimé par million de jetons en dollars américains. Les prix catalogue correspondent aux tarifs publiés par les fournisseurs eux-mêmes. Les scores indépendants, les chiffres de coût par tâche et les mesures de vitesse attribués à Artificial Analysis sont ceux de cet évaluateur. Les chiffres de latence pour Gemini 3.5 Flash-Lite proviennent de notre propre trafic mesuré. Lorsqu'un chiffre est reporté sur la fiche de modèle que nous conservons plutôt que lu depuis la page de l'évaluateur le jour même, nous avons considéré cet évaluateur comme la source, et non nous-mêmes.

L'autocollant et la facture ne concordent pas.

L’écart de coût par tâche ne s’explique pas par la grille tarifaire, et il vaut la peine de connaître la raison de son existence avant que l’un ou l’autre modèle ne s’approche de la production.

Claude Haiku 5.5 est verbeux, et l'évaluateur le dit en toutes lettres. En exécutant l'Intelligence Index, Artificial Analysis a enregistré 440 millions de tokens de sortie du modèle, contre une médiane de 100 millions tous modèles confondus, et l'a signalé comme très verbeux. La réflexion est facturée en tant que sortie, la réflexion est activée par défaut avec un curseur d'effort qui démarre à moyen, et un tarif d'entrée bon marché n'aide pas une charge de travail dont la facture est majoritairement composée de sortie.

Gemini 3.5 Flash-Lite n'est pas non plus concis, mais il est mesurablement moins coûteux par tâche. Le même tableau consigne 17 507 jetons de sortie par tâche d'indexation terminée pour ce modèle — dont 10 405 de raisonnement et 7 102 de réponse. Mettez cela en regard du volume de jetons du modèle Ant​hropic et l'arithmétique tranche : un avantage de cinq pour un sur le taux de sortie est en partie absorbé par un modèle dont la réponse est plus volumineuse, et ce qui subsiste au niveau de la tâche est un léger désavantage plutôt qu'un avantage considérable.

Il existe un second effet, plus discret, qui va dans le même sens. La documentation d'Anthropic indique que Claude Haiku 5.5 utilise le tokenizer partagé avec Claude 4.7 et les versions ultérieures, de sorte que le même texte compte environ 30 % de tokens en plus qu'avec le modèle que celui-ci remplace. Le tarif a été divisé par trois par rapport à l'offre de Google. Le nombre de tokens n'a pas baissé et, sur le même texte, il a augmenté.

Les deux modèles, sur les chiffres qui comptent

Tarifs mis en cache et prix catalogue issus de la documentation propre d’Ant​hropic et de Goo​gle ; chiffres indépendants attribués à Artificial Analysis ; latence en direct issue de notre propre fenêtre de trafic de sept jours. Mis en cache le 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Entrée — Claude Haiku 5.5 : 0,10 $ jusqu'à 100 000 tokens et 0,50 $ au-delà ; Gemini 3.5 Flash-Lite : 0,30 $ à taux fixe sur une fenêtre de 1 048 576 tokens.

• Sortie — Claude Haiku 5.5 : 0,50 $ jusqu'à 100 000 tokens et 2,50 $ au-delà ; Gemini 3.5 Flash-Lite : 2,50 $ forfaitaire.

• Entrée mise en cache — Claude Haiku 5.5 : 0,01 $ jusqu'à 100 000 tokens, puis 0,05 $ au-delà ; Gemini 3.5 Flash-Lite : 0,03 $. Les écritures de cache coûtent 0,125 $ et 0,625 $ par million de tokens pour Claude Haiku 5.5.

• Contexte et sortie — un million de tokens chacun. La sortie maximale est de 128 000 tokens pour Claude Haiku 5.5 contre 65 536 pour Gemini 3.5 Flash-Lite, donc le plafond d’Anthropic est environ le double.

• Modalité d'entrée — texte et images pour Claude Haiku 5.5 ; texte, images, vidéo, audio et fichiers pour Gemini 3.5 Flash-Lite. Les deux renvoient du texte.

• Score indépendant — 43,40 pour Claude Haiku 5.5 (Max), deuxième de 182 modèles sur l'Intelligence Index v4.3.2, contre 22,2 pour Gemini 3.5 Flash-Lite, quatre-vingt-seizième de 147 et dans le trente-quatrième percentile de ce classement.

• Coût indépendant par tâche — 0,21 $ contre 0,1235 $ sur la même carte.

• Débit — 241,9 jetons de sortie par seconde mesurés pour Claude Haiku 5.5 par Artificial Analysis, contre 280,0 pour Gemini 3.5 Flash-Lite mesurés sur notre propre playground au cours des sept derniers jours. Il s'agit de deux harnais, pas d'un seul, donc à interpréter comme un ordre de grandeur et non comme une course.

Vingt et un points, et de quoi ils sont faits

Un écart de vingt et un points sur un indice qui monte dans les soixante n’est pas une marge. C’est la différence entre un modèle capable de faire tourner une boucle agentique et un modèle à qui l’on devrait confier un seul appel bien spécifié.

Les deux fournisseurs ne mesurent pas les harnais l'un de l'autre, si bien que leurs propres suites ne peuvent pas être mises en regard. Anthropic publie les résultats de GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 et FrontierCode pour Claude Haiku 5.5 ; Google publie son propre ensemble pour le palier Flash-Lite ; ni l'un ni l'autre n'a exécuté ceux de son concurrent. La seule comparaison réellement à armes égales disponible est celle du classement indépendant, et là, le modèle d'Anthropic est en tête avec une marge loin d'être serrée.

Les sous-scores attribués par l'évaluateur à Gemini 3.5 Flash-Lite consignent noir sur blanc le profil de ce tier. Il obtient 83,8 % sur GPQA Diamond et 54,2 % sur SWE-Bench Pro, 54 % sur Terminal-bench 2.1, 41,3 % sur SciCode et 39,2 % sur MLE-Bench, ainsi que 18,8 % sur Humanity's Last Exam. Voilà les chiffres d'un tier compétent, bon marché et généraliste — solide sur les questions de connaissances, visiblement en retrait sur les évaluations de raisonnement et de recherche les plus difficiles. Claude Haiku 5.5, avec 43,40 au score composite, se situe dans une catégorie de tout autre ordre, et la lecture pratique que l'on en fait est que les tâches exigeant une planification multi-étapes sur un long horizon ne relèvent pas du tout du tier de Google.

Un million de tokens de fenêtre, et 65 536 de réponse

Les deux fenêtres de contexte ont la même taille et ne sont pas le même produit.

Le contexte long sur Gemini 3.5 Flash-Lite se dégrade avec la distance d'une manière qu'il vaut la peine de chiffrer avant de lui faire confiance. Sur GDM-MRCR v2, l'évaluation de récupération à huit aiguilles, il atteint en moyenne 72,2 % lorsque les aiguilles se situent à l'intérieur de 128 000 tokens et 21,3 % sur la variante point par point à un million de tokens. Son indicateur Long-Context Recall est de 76 %, et CharXiv Reasoning s'établit à 74,5 % sans outils et à 76,5 % avec. Une fenêtre d'un million de tokens est une véritable capacité ; récupérer de manière fiable depuis son extrémité lointaine en est une plus modeste, et les deux chiffres ci-dessus sont la distance qui les sépare. La fenêtre du modèle Claude n'a pas été mesurée de la même façon sur le même tableau d'évaluation, donc aucun chiffre équivalent n'est disponible pour lui, et cet article n'en inventera pas.

Les plafonds de sortie sont la différence la plus immédiatement utile. Claude Haiku 5.5 émettra 128 000 tokens en une seule réponse ; Gemini 3.5 Flash-Lite s'arrête à 65 536. Si l'artefact que vous voulez récupérer est un long fichier, une migration complète, une suite de tests générée ou une réécriture à l'échelle d'une transcription, l'un de ces deux modèles peut le produire en un seul appel et l'autre non — et un travail scindé sur deux appels coûte plus de deux fois le prix d'un seul appel, parce que le préfixe partagé est envoyé deux fois.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

L'audio et la vidéo ne sont pas une question de prix

Gemini 3.5 Flash-Lite accepte la vidéo, l'audio et les fichiers au même tarif que le texte. Claude Haiku 5.5 accepte le texte et les images.

Pour un pipeline qui ingère des appels enregistrés, des captures d'écran ou des séquences de surveillance, la différence de capacités qui compte ne réside pas dans les vingt et un points d'indice. Elle tient au fait que l'un de ces modèles reçoit directement l'entrée, tandis que l'autre a besoin d'une étape de transcription ou d'extraction d'images en amont — un second modèle, une seconde facture et un nouveau mode de défaillance qui s'interpose entre la source et la réponse. Les équipes dans cette situation ne choisissent pas entre deux paliers peu coûteux. Elles choisissent entre un modèle et un pipeline.

L’inverse est vrai pour les images et les documents. Les deux modèles lisent nativement les images, et Claude Haiku 5.5 y obtient 43,40 sur le composite, donc une charge de travail d’extraction d’images de pages ou de compréhension de diagrammes sans audio revient au côté Ant​hropic sur les chiffres plutôt que sur un argument de modalité.

Exécuter l'un des deux à partir d'ici

Gemini 3.5 Flash-Lite figure au catalogue d'OrcaRouter au prix public de Goo​gle, avec 0 % de marge, ce qui signifie que le tarif du fournisseur est répercuté tel quel plutôt que lissé, et qu'une modification de la grille tarifaire de Goo​gle apparaît sur votre facture le jour même où elle apparaît sur la leur. Une seule clé et un seul SDK pour l'offre de Goo​gle aux côtés de Claude Sonnet 5.5 et de Claude Opus 5.5, eux aussi présents au catalogue — un A/B entre une branche Goo​gle Flash-Lite et une branche Ant​hropic relève donc déjà de la configuration plutôt que d'un projet d'intégration. Le basculement automatique se trouve en dessous, de sorte qu'aucune des deux branches ne constitue un point de défaillance unique, et le DSL de routage exprimera l'escalade dans la route si c'est là que la logique doit résider.

Le profil de latence de ce segment repose sur notre propre mesure plutôt que sur celle du fournisseur. Sur les sept derniers jours de trafic réel, Gemini 3.5 Flash-Lite a maintenu un p50 de 2 426 millisecondes et un p95 de 8 600 millisecondes à 280 jetons de sortie par seconde, avec un taux d'erreur de 0,313 %. Interprétez-le comme une fenêtre glissante et non comme une promesse : il évolue au gré du trafic et des conditions du fournisseur, et le chiffre à retenir pour un pipeline donné est celui que vous mesurez vous-même après une semaine.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 ne figure pas au catalogue. Il est sorti le 7 octobre 2026 — un jour avant la rédaction de ces lignes — et il n'est pas routable depuis notre service aujourd'hui, si bien que le volet Anthropic de cette comparaison n'est actuellement accessible que chez Anthropic. Le dire franchement vaut mieux que de le laisser sous-entendu. Un décalage entre la sortie d'un modèle et le moment où il devient appelable via notre service est normal : ce n'est pas une promesse quant à la date à laquelle il se comblera, et un lecteur qui prépare une migration doit planifier en fonction du calendrier qu'il peut voir, plutôt que de celui qu'il préférerait.

Lequel, et pour qui ?

Si le travail se résume à du texte en entrée et du texte en sortie, si les prompts tiennent sous 100 000 tokens et si la tâche exige une planification en plusieurs étapes ou des agents à long horizon, Claude Haiku 5.5 est le modèle le plus performant, de vingt et un points, et le moins cher par token, d'un facteur de trois à cinq. Établissez votre budget sur le coût par tâche plutôt que sur la grille tarifaire, prévoyez environ 0,21 $ pour le type de travail que mesure le comité indépendant, et recomptez vos prompts avant toute prévision, car le changement de tokeniseur modifie à lui seul le compte d'environ trente pour cent.

Si le travail est court, à fort volume et en forme de réponse — une étiquette, une catégorie, une extraction, une décision de garde-fou — alors l'arithmétique favorise Gemini 3.5 Flash-Lite, et ce pour une raison peu glorieuse. La facture d'un appel qui émet très peu est dominée par l'entrée, les deux tarifs d'entrée sont de 0,30 $ contre 0,10 $, et l'empreinte de tâche bien plus courte du modèle Goo​gle signifie que le tarif le moins cher remporte le travail fini même s'il perd sur le prix affiché. Ajoutez une entrée vidéo, audio ou fichier et le choix n'est plus du tout une question de prix.

Ce que ce duo permet réellement de conclure est plus restrictif que « le nouveau Haiku est bon marché ». Il établit que le tarif affiché d’un palier bon marché est un mauvais indicateur de ce que ce palier vous coûte, et que le modèle qui paraît trois fois plus cher sur la page des tarifs peut vous adresser la facture la moins élevée. Quelle que soit votre conclusion, mesurez les tokens que vous émettez, et non ceux que vous envoyez, car, pour ces deux modèles, c’est le compteur sur lequel repose réellement la facture.