Une carte hero générée intitulée « Claude Haiku 5.5 vs DeepSeek V4.1 Flash » avec le surtitre « DEUX MODÈLES, DEUX IDÉES DU BON MARCHÉ », montrant Claude Haiku 5.5 à Entrée 0,10 $, Sortie 0,50 $ et Indice 43,40 contre DeepSeek V4.1 Flash à Entrée 0,30 $, Sortie 1,20 $ et Indice 39,46, au-dessus d’une barre indiquant « Coût par tâche terminée 0,21 $ vs 0,27 $ ».
Engineering & Research

Claude Haiku 5.5 vs DeepSeek V4.1 Flash : un prix affiché plus bas ne signifie pas un modèle moins cher

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Sur la grille tarifaire, il n'y a pas photo. Claude Haiku 5.5, que le fournisseur a commercialisé le 7 octobre 2026, est affiché à 0,10 $ par million de jetons d'entrée et 0,50 $ par million de jetons de sortie. DeepSeek V4.1 Flash, sorti le 10 septembre 2026, est affiché à 0,30 $ et 1,20 $ sur le tableau indépendant, ou à 0,15 $ et 0,60 $ sur la grille heures creuses propre au fournisseur. Le fournisseur est entre deux et trois fois moins cher sur les deux compteurs, et c'est la première fois qu'un modèle de classe Haiku passe sous un tarif DeepSeek Flash.

Ensuite, vous mesurez ce que coûte une tâche terminée, et l'écart s'effondre. Lors de la même exécution d'évaluation, une tâche de l'Intelligence Index coûte 0,21 $ sur Claude Haiku 5.5 et 0,27 $ sur DeepSeek V4.1 Flash — un avantage de 20 %, pas de 200 %. La raison figure sur la même page : Claude Haiku 5.5 a généré 162 164 jetons de sortie par tâche, contre 88 574 pour DeepSeek. Vous payez moins par jeton et vous en achetez presque deux fois plus.

Cette inversion est toute la comparaison, et tout ce qui suit est un argument pour déterminer de quel côté de celle-ci se situe votre charge de travail.

Les deux grilles tarifaires, lues telles qu'écrites

Par million de tokens en dollars américains. Les chiffres d'Anthropic proviennent de la documentation tarifaire d'Anthropic ; ceux de DeepSeek proviennent de la page Model & Pricing de DeepSeek, qui constitue la référence faisant autorité pour sa structure heures pleines/heures creuses. Les mesures indépendantes sont celles de l'Artificial Analysis Intelligence Index v4.3.2, consulté le 8 octobre 2026.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs DeepSeek V4.1 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 39.46, cost per task $0.21 against $0.27, output tokens per task 162,164 against 88,574, Terminal Bench 4.0 0.3283 against 0.2677, AutomationBench 0.3541 against 0.6889 and open weights 'no' against 'yes, MIT', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; prices per vendor documentation.'

• Entrée — Claude Haiku 5.5 0,10 $ jusqu’à 100 000 tokens, puis 0,50 $ au-delà. DeepSeek V4.1 Flash 0,30 $ forfaitaire sur la carte du board, ou 0,15 $ pendant les créneaux hors pointe de DeepSeek.

• Sortie — Claude Haiku 5.5 0,50 $ jusqu’à 100 000 jetons et 2,50 $ au-delà. DeepSeek V4.1 Flash 1,20 $ forfaitaire, ou 0,60 $ en période creuse.

• Entrée en cache — Claude Haiku 5.5 : 0,01 $ en dessous de 100 000 tokens et 0,05 $ au-dessus, soit une remise de 90 %. DeepSeek V4.1 Flash : 0,006 $, soit une remise de 98 %. C'est le seul compteur où la carte DeepSeek est moins chère en termes absolus, et elle l'est bien plus que les gens ne l'imaginent.

• Tarification selon l'heure de la journée — Anthropic n'en applique aucune. DeepSeek double les deux compteurs entre 01:00 et 04:00, puis de nouveau entre 06:00 et 10:00 UTC en semaine, hors jours fériés chinois. Toutes les autres heures, y compris tout le week-end, sont en heures creuses.

• Fenêtre de contexte et plafond de sortie — 1 M de tokens chacun. Claude Haiku 5.5 limite une réponse unique à 128 000 tokens ; DeepSeek V4.1 Flash la limite à 384 000.

• Poids — Claude Haiku 5.5 est propriétaire, uniquement accessible via API, identifiant du modèle claude-haiku-5-5. DeepSeek V4.1 Flash est ouvert sous licence MIT, 552 milliards de paramètres au total dont 16 milliards actifs, sur Hugging Face.

• Modalité — les deux acceptent du texte et des images et renvoient du texte. Ni l’un ni l’autre n’est nativement vidéo.

• Score indépendant — 43,40 pour Claude Haiku 5.5 (Max) contre 39,46 pour DeepSeek V4.1 Flash (Max). Un écart de 3,94 points sur un classement de 182 modèles.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

Pourquoi le nombre par tâche bat le nombre par token

Les tarifs affichés sont indiqués par token, car c’est ce qui est comptabilisé. Ils constituent un mauvais indicateur du coût d’une charge de travail, car un modèle de raisonnement décide du nombre de tokens dont une tâche a besoin, et les deux modèles ici diffèrent d’un facteur de 1,8.

Claude Haiku 5.5 émet 162 164 tokens de sortie par tâche de l'Intelligence Index, soit 129 047 pour le raisonnement et 33 118 pour la réponse. DeepSeek V4.1 Flash en émet 88 574, soit 62 670 pour le raisonnement et 25 904 pour la réponse. Les deux facturent la réflexion comme sortie. Ainsi, le modèle dont le tarif de sortie est inférieur de 60 % consomme presque deux fois plus de ce compteur coûteux, et le calcul les place à moins de 6 cents d'écart.

Il y a un second effet qui tire dans le même sens. L'exécution de l'index est dominée par l'entrée ainsi que par la sortie parce que le harnais renvoie le contexte : les 0,2128 $ par tâche de Claude Haiku 5.5 se décomposent en 0,1317 $ d'entrée et 0,0811 $ de sortie, et dans la ligne d'entrée, 0,0954 $ correspondent à des lectures de cache et 0,0337 $ à des écritures de cache, contre seulement 0,0026 $ d'entrée fraîche. Les 0,2652 $ de DeepSeek se répartissent en 0,1589 $ d'entrée et 0,1063 $ de sortie, avec 0,0966 $ de l'entrée en écritures de cache. Les deux modèles lisent à peu près la même quantité de contexte mis en cache ; DeepSeek paie plus pour les mêmes lectures et écritures.

Le propre billet de lancement d’Anthropic commence par une mise en garde similaire, mais dans l’autre sens. Il indique que Haiku 5.5 offre « un rapport qualité-prix particulièrement intéressant lorsqu’il est utilisé pour des tâches avec des prompts allant jusqu’à 100 000 tokens, qui représentent environ 90 % des requêtes adressées à notre précédent modèle Haiku ». Ce qualificatif n’est pas anodin — voir la falaise ci-dessous.

La falaise des 100 000 tokens est la véritable bifurcation

Anthropic ne facture pas Claude Haiku 5.5 à un tarif forfaitaire. Les tarifs de 0,10 $ et de 0,50 $ s’appliquent aux prompts jusqu’à 100 000 tokens, puis passent à 0,50 $ et à 2,50 $ — soit un bond d’un facteur cinq en entrée et d’un facteur cinq en sortie, appliqué à l’ensemble de la requête plutôt qu’au seul dépassement.

La structure de DeepSeek est complètement différente. Son tarif dépend de quand vous envoyez, et non de la quantité. Un prompt de 150 000 tokens coûte le même prix par token qu'un prompt de 500 tokens, doublé à l'intérieur de deux plages horaires en semaine.

Mettez un pipeline à longs prompts sur les deux, et la comparaison s'inverse radicalement. Avec 150 000 tokens d'entrée et 20 000 de sortie, Claude Haiku 5.5 facture 0,125 $ d'entrée et 0,05 $ de sortie — 0,175 $ pour l'appel — tandis que DeepSeek en heures creuses facture 0,0225 $ et 0,012 $, soit moins de quatre cents. DeepSeek l'emporte donc d'un facteur d'environ 4,5, sur les deux mêmes modèles où le cas à prompt court voyait Anthropic l'emporter d'un facteur trois.

Aucune des deux structures n'est meilleure dans l'abstrait. L'une facture en fonction de la quantité que vous envoyez, l'autre en fonction du moment où vous l'envoyez, et une seule de ces deux variables est sous votre contrôle au moment de la requête.

L'autre levier de DeepSeek que personne n'intègre dans les prix

La ligne de cache mérite un examen à part, car c’est le compteur le moins cher de toute cette comparaison et c’est celui qui croît avec le volume de production plutôt que de diminuer.

Le tarif des hits de cache de DeepSeek est de 0,006 $ par million de tokens, avec une remise annoncée de 98 % — environ un sixième des 0,01 $ d'Anthropic et une fraction de ce que coûte une entrée fraîche des deux côtés. Tout ce qui renvoie un préfixe stable — une longue invite système, un ensemble de documents récupérés, un schéma d'outil — paie ce tarif à chaque tour après le premier. L'exécution d'index ci-dessus montre déjà l'ampleur de cette part : 0,0954 $ du coût d'entrée par tâche de Claude Haiku 5.5 correspond à des lectures de cache, pour seulement 0,0026 $ d'entrée non mise en cache.

Donc la répartition pratique est plus étroite que « Anthropic est moins cher ». Si vos requêtes sont courtes, à un seul tour et avec un cache chaud, Claude Haiku 5.5 est devant sur le prix, devant sur la capacité de 3,94 points d’indice, et devant sur les lignes composites agentiques. Si vos requêtes sont longues, ou à préfixe lourd, ou planifiables dans les fenêtres hors pointe de DeepSeek, DeepSeek V4.1 Flash domine sur le coût, et ce n’est pas particulièrement serré.

Ce que vous pouvez réellement appeler aujourd'hui

Les deux modèles sont accessibles, mais pas de manière symétrique, et cette asymétrie mérite d’être signalée plutôt que de vous laisser la découvrir.

DeepSeek V4.1 Flash figure désormais au catalogue d'OrcaRouter, répercuté au prix catalogue du fournisseur avec 0 % de marge — ce qui compte ici davantage que d'habitude, car le tarif de DeepSeek comporte une structure de pointe. Nous affichons 0,15 $ en entrée et 0,60 $ en sortie, avec une lecture de cache à 0,003 $ et les deux fenêtres de doublement en semaine consignées dans l'enregistrement tarifaire, de sorte qu'une requête routée vers le segment DeepSeek est facturée comme DeepSeek la facture, et non selon une moyenne pondérée. Le basculement automatique se trouve sous la route, de sorte qu'un 429 en fenêtre de pointe ou une panne partielle du fournisseur déplace l'appel plutôt que de le faire échouer.

Claude Haiku 5.5 ne figure pas au catalogue. Le modèle d'Anthropic est accessible directement auprès d'Anthropic et par l'intermédiaire de ses trois partenaires cloud — AWS, Google Cloud et Microsoft Azure, que l'article de lancement nomme — et c'est la seule façon honnête de le dire. Ce que le catalogue propose effectivement de la gamme Anthropic, c'est Claude Sonnet 5.5 et Claude Opus 5.5, ce qui fait d'un chemin d'escalade menant d'un appel de classification peu coûteux à un appel agentique de gamme intermédiaire une simple configuration de routage plutôt qu'une seconde intégration.

A capture of the OrcaRouter model page for DeepSeek V4.1 Flash under deepseek/deepseek-v4.1-flash, showing a 1M-token context, a 384K maximum output, text and image input, public benchmarks dated 2026-09-10, a p50 time to first token of 1.74 seconds, and the page's own description of the model as the smallest in DeepSeek's new architecture family, released September 10, 2026.

Lequel choisir

Si votre trafic relève de la classification, de l’extraction, des décisions de routage, de la synthèse et des tours de sous-agents — prompts courts, volume élevé, images dans l’équation — Claude Haiku 5.5 est le meilleur modèle et, sous 100 000 jetons, le plus économique. Il obtient 3,94 points d’indice de plus, il prend en charge les images, et Anthropic propose un réglage d’effort ajustable pour que vous puissiez arbitrer entre capacité et coût par appel sans changer de modèle.

Si votre trafic concerne de longs documents, est gourmand en recherche documentaire, ou si vous pouvez le planifier, DeepSeek V4.1 Flash l'emporte sur le plan arithmétique : trois à quatre fois moins cher par appel long, un taux de cache représentant un sixième de celui d'Anthropic, un plafond de réponse de 384 000 tokens, et des poids ouverts que vous pouvez conserver si jamais le modèle facturé au token cesse de vous convenir.

Ce que cette comparaison tranche réellement est plus étroit que « Anthropic est désormais l’option bon marché ». Elle tranche qu’un petit modèle Anthropic peut être moins cher qu’un tarif DeepSeek Flash sur l’étiquette tout en s’en approchant à moins de 20 % sur la facture — et que l’écart entre ces deux faits tient à un réglage de verbosité.

Une seule API pour plus de 200 modèles, une seule clé, basculement automatique en dessous, de sorte qu'un 429 en période de pointe ou une panne partielle d'un fournisseur redirige l'appel plutôt que de le faire échouer.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement