Titre principal généré pour Claude Sonnet 5.5 vs DeepSeek V4 Pro, sous-titré « Vingt points d’indice et une lecture de cache à 0,022 $ », affichant 2,00 $ et 10,00 $ par million de tokens contre 0,66 $ et 1,98 $, avec le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

Claude Sonnet 5.5 vs DeepSeek V4 Pro : 20 points d'indice, et une lecture de cache à 0,022 $

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez les deux grilles tarifaires côte à côte et la comparaison semble déjà pliée avant même de commencer. Claude Sonnet 5.5, en disponibilité générale depuis le 28 septembre 2026, coûte 2,00 $ par million de jetons d’entrée et 10,00 $ par million de jetons de sortie. DeepSeek V4 Pro, sorti le 24 avril 2026, coûte 0,66 $ et 1,98 $. La sortie est la ligne qui compte dans le travail des agents, et 10,00 $ contre 1,98 $, c’est un écart de cinq pour un — un dollar contre vingt cents pour cent mille jetons. Regardez ensuite le côté capacités, où Artificial Analysis place Claude Sonnet 5.5 à 56 sur l’Intelligence Index v4.3 et DeepSeek V4 Pro à 36, un écart de vingt points sur le même banc d’essai. Toute la tension est là : le modèle de DeepSeek se situe à un cinquième du prix de sortie et à environ deux tiers de la capacité mesurée, et ces deux faits ne se résolvent pas en une recommandation unique sans savoir ce que votre charge de travail fait réellement avec un jeton.

Ce qu'est chaque modèle, précisément

La dénomination est le premier point sur lequel cette comparaison dérape, alors corrigeons-le ici. Le DeepSeek V4 Pro tel que nous le répertorions est deepseek/deepseek-v4-pro, publié le 24 avril 2026, un modèle à contexte de 1 048 576 jetons, avec une sortie maximale de 384 000 jetons et une entrée texte uniquement. Artificial Analysis suit un instantané qu'il nomme DeepSeek V4 Pro 0813 — une compilation du 13 août — et les chiffres cités ci-dessous proviennent de cette ligne. Le volet Sonnet est celui d'Anthropic, anthropic/claude-sonnet-5.5, entrée texte, image et fichier, contexte de 1 M, sortie maximale de 128 K. Si vous comparez une page de fournisseur à une page d'évaluateur et que les chiffres ne concordent pas, vérifiez le suffixe de compilation avant de conclure que l'un des deux est erroné.

DeepSeek V4 Pro prend uniquement en charge les entrées textuelles. Claude Sonnet 5.5 accepte aussi les images et les fichiers. C'est la première différence structurelle, et elle n'est pas marginale : tout pipeline qui ingère des captures d'écran, des PDF ou des diagrammes ne peut pas simplement échanger l'un contre l'autre, car l'un des deux ne peut pas voir.

La grille tarifaire, ligne par ligne

• Entrée — 0,66 $ par million pour DeepSeek V4 Pro contre 2,00 $ pour Claude Sonnet 5.5 ; DeepSeek est 67 % moins cher

• Sortie — 1,98 $ par million contre 10,00 $ ; DeepSeek est 80 % moins cher, soit le plus grand écart isolé de cette comparaison

• Lecture du cache — 0,022 $ par million contre 0,20 $ ; DeepSeek est 89 % moins cher sur la ligne qui domine les longues boucles d'agents

• Écriture de cache — 2,50 $ par million pour la fenêtre de cinq minutes sur Claude Sonnet 5.5 ; la ligne de catalogue de DeepSeek V4 Pro ne comporte aucune ligne distincte d'écriture de cache

• Contexte — 1 048 576 tokens contre 1 000 000 ; DeepSeek est légèrement plus long, une distinction sans conséquence pratique

• Sortie maximale — 384 000 tokens contre 128 000 ; DeepSeek l'emporte d'un facteur trois sur le plafond qui contraint la génération en masse

• Modalité d’entrée — texte uniquement contre texte, image et fichier

• Raisonnement — les deux utilisent un effort de raisonnement configurable plutôt qu'un budget de réflexion fixe, la profondeur est donc un paramètre de requête pour chacun

Il y a un détail de planification du côté de DeepSeek qu’une comparaison de grilles tarifaires masquera. Notre ligne de catalogue comporte une fenêtre de tarification temporisée : entre 01:00 et 04:00 UTC, puis de nouveau entre 06:00 et 10:00 UTC, les tarifs indiqués sont multipliés par deux. À ces heures, V4 Pro coûte 1,32 $ en entrée et 3,96 $ en sortie — toujours moins cher que Claude Sonnet 5.5, de 34 % et 60 % respectivement, mais plus avec les écarts que suggèrent les chiffres mis en avant. Les charges de travail par lots qui peuvent être planifiées méritent de l’être, et celles qui ne le peuvent pas méritent d’être facturées au tarif de pointe plutôt qu’au tarif moyen. C’est aussi le genre de détail qui n’apparaît que si l’on lit le catalogue plutôt que la page marketing, ce qui plaide pour placer chaque modèle candidat derrière un seul point de terminaison plutôt que trois comptes fournisseurs.

Deux nombres de capacité, dont l'un n'est pas indépendant

Du côté des tiers, le classement est sans ambiguïté. Artificial Analysis attribue à Claude Sonnet 5.5 un score de 56 et à DeepSeek V4 Pro un score de 36 sur l’Intelligence Index v4.3, tous deux dans une configuration de raisonnement à effort maximal. Le même évaluateur place Claude Opus 5 à 51 et Gemini 3.1 Pro Preview à 30, de sorte que le 36 de V4 Pro le situe sous le précédent modèle phare d’Anthropic et au-dessus de la gamme Pro de Google — une position respectable pour un modèle à un cinquième du prix, et bien loin du sommet.

Le renversement du coût par tâche apparaît ici aussi, et dans cette confrontation, il va dans le sens inverse de la précédente. DeepSeek V4 Pro coûte 0,67 $ à évaluer sur la suite d’indices. Claude Sonnet 5.5 coûte 7,60 $. Ce n’est ni une faute de frappe ni un artefact d’arrondi : le nouveau modèle d’Anthropic émet 410 millions de tokens sur l’ensemble de la suite, contre une médiane de 88 millions, et la verbosité du modèle DeepSeek ne parvient pas à combler un écart de prix de cette ampleur. Sur des tâches ouvertes non contraintes, le modèle le moins cher est plus économique d’un ordre de grandeur en pratique, pas seulement sur la grille tarifaire.

Les chiffres des fournisseurs doivent être traités avec davantage de précautions. DeepSeek publie un chiffre τ²-Bench de 96,2 pour V4 Pro, ce qui est un score solide, mais il est rapporté par le fournisseur et τ²-Bench a depuis été retiré de l’indice Artificial Analysis dans sa révision v4.3 — c’est donc un chiffre qui ne peut pas être placé de manière indépendante sur la même échelle que quoi que ce soit qu’Anthropic publie. Le tableau de lancement d’Anthropic pour Claude Sonnet 5.5 comporte ses propres réserves, notamment une note de bas de page indiquant que le réglage Max effort obtient un score inférieur à Xhigh sur FrontierCode et une remarque selon laquelle deux des benchmarks ont été exécutés sur un déploiement de préversion avec un bug de sorties structurées. Mettez les tableaux des deux fournisseurs côte à côte et vous avez deux documents marketing, pas un classement. Les seuls chiffres de cet article qui appartiennent au même axe sont les deux scores d’indice et les deux coûts par tâche, car un seul évaluateur a produit les quatre.

Pourquoi le plafond de sortie compte plus que le prix

Le chiffre, dans cette comparaison, auquel on prête le moins attention est celui qui change l’architecture : 384 000 jetons de sortie contre 128 000.

Le plafond de sortie n'est pas une fonctionnalité de confort. Il détermine si une tâche se fait en un seul appel ou en une chaîne. Générer un gros fichier source, produire un document complet, produire un long rapport structuré, traduire un chapitre de livre — tout ce dont l'artefact dépasse 128 000 tokens — ne peut pas être réalisé en un seul appel à Claude Sonnet 5.5, et doit être décomposé en une séquence avec un état transporté entre les appels. La décomposition signifie plus de tokens d'entrée renvoyés à chaque étape, plus de lectures de cache, plus de code d'orchestration, et une nouvelle classe de défaillances où les jointures entre les morceaux sont là où les erreurs se logent. Un modèle à cinq fois le prix qui élimine toute une couche d'orchestration peut être moins cher en heures d'ingénierie avant de l'être en tokens, et à l'inverse, une tâche qui tient en un seul appel est une tâche où le plafond n'entre jamais dans l'arithmétique.

Ainsi, la question du plafond est préalable à la question du prix. Si votre artefact le plus long tient sous 128 000 tokens, ignorez cette section et comparez sur le coût par tâche terminée. Si ce n'est pas le cas, chiffrez le pipeline qu'il vous faudrait construire, pas seulement les tokens.

Coût de changement et problème de repli

La migration, dans un sens comme dans l'autre, consiste principalement à rédiger des prompts plutôt qu'à écrire du code, avec une exception qu'il vaut la peine d'inscrire au budget.

Les deux modèles configurent le raisonnement via un paramètre d'effort, mais ce sont des paramètres de fournisseurs différents, avec des niveaux et des valeurs par défaut différents. Un prompt optimisé pour un réglage Anthropic à effort élevé ne se transpose pas à un réglage d'effort DeepSeek comme une substitution à l'identique ; il se transpose comme une re-mesure. Prévoyez de consacrer une journée par charge de travail à rétablir la qualité avant de faire confiance à une projection de coûts, de part et d'autre du changement.

L’exception, c’est la vision. Claude Sonnet 5.5 lit les images et les fichiers ; DeepSeek V4 Pro ne lit que le texte. Toute partie de votre pipeline qui transmet à un modèle une capture d’écran, une page numérisée ou un graphique rendu n’a pas d’équivalent DeepSeek, de sorte qu’une migration complète n’est possible que pour le sous-ensemble de votre trafic qui a la forme de texte. C’est une ligne de démarcation à tracer tôt, car cela signifie généralement que la réponse n’est pas un seul modèle mais une division.

Les deux sont routables sur OrcaRouter dès aujourd'hui — deepseek/deepseek-v4-pro et anthropic/claude-sonnet-5 sont tous deux des entrées de catalogue actives, facturées au tarif catalogue du fournisseur, avec 0 % de marge, sur un seul identifiant. Cela compte surtout dans ce type précis de comparaison, où le facteur décisif n'est pas de savoir quel modèle est meilleur dans l'abstrait, mais à quel modèle une requête donnée doit être adressée. Une répartition qui envoie le travail volumineux en texte seul au modèle bon marché et le travail de vision au modèle coûteux est une règle de routage, et elle est bien plus facile à exprimer lorsque les deux points de terminaison répondent à la même clé et à la même politique de basculement. Claude Sonnet 5.5 n'est pas encore lui-même une route sur notre plateforme, donc la version actuelle de cette répartition associe le modèle Anthropic à DeepSeek V4 Pro plutôt que de le remplacer.

La décision, énoncée sous forme de règle

Envoyez-le à Claude Sonnet 5.5 lorsque la tâche nécessite de voir — des images, des PDF, des captures d’écran, des sorties rendues — lorsque l’artefact dépasse une page de prose et que vous voulez qu’un modèle de pointe l’écrive, ou lorsqu’un écart d’indice de vingt points fait la différence entre un brouillon qu’un humain doit réécrire et un qu’il peut livrer.

Envoyez-le à DeepSeek V4 Pro lorsque la charge de travail est texte en entrée, texte en sortie, à gros volume, et tolérante à un plafond plus bas en matière de qualité de raisonnement : classification, extraction, synthèse, réécriture en masse, transformation de code avec une spécification claire, et tout ce pour quoi vous paieriez autrement dix dollars par million de jetons de sortie pour déplacer des mots. La remise de 89 % sur la lecture du cache rend les boucles d’agents à contexte long sur ce modèle structurellement bon marché d’une manière que rien d’autre dans la comparaison n’égale.

Le verdict honnête : ce n'est pas une course aux capacités que DeepSeek est en train de perdre, c'est une décision d'allocation de ressources que la plupart des équipes prennent mal, en allant acheter des capacités qu'elles n'utilisent pas. Si votre trafic est du texte et que votre seuil de qualité est « assez bon pour être relu » plutôt que « assez bon pour être livré sans être lu », V4 Pro à 20 % du prix de sortie et 0,022 $ pour les lectures de cache est le choix par défaut correct, et les vingt points d'indice sont une taxe que vous choisissez actuellement de payer.

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement