Illustration éditoriale vectorielle plate pour la bannière d'un blog technologique sur la tarification des modèles : une grande puce de modèle arrondie en bleu profond avec une lueur cyan douce, une étiquette de prix en papier accrochée à son coin, trois flux de jetons s'écoulant dans une jauge de prix circulaire, et une fine feuille de calendrier glissant dans le cadre, sur un fond bleu clair doux avec un espace vide généreux dans le tiers inférieur. Aucun texte.
Guides & Insights

Tarification de l’API DeepSeek V4 Pro : 0,73 $/2,18 $ en heures creuses, et pourquoi l’arrêt du 14 septembre a été annulé

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

DeepSeek V4 Pro n'est pas en cours de retrait. Le 11 septembre 2026, Deep​Seek a déclaré qu'il continuerait à fournir le modèle via son API après le 14 septembre, avec une méthode de facturation inchangée — revenant sur un plan annoncé deux jours plus tôt selon lequel chaque requête deepseek-v4-pro aurait été redirigée vers DeepSeek V4.1 Flash et facturée aux tarifs de Flash. Pour quiconque dont les prompts, les paramètres de température et les schémas d'appel d'outils sont optimisés pour V4 Pro, c'est le fait qui compte cette semaine : le modèle sur lequel vous avez bâti reste là où il est, et la migration que vous avez peut-être prévue pour lundi n'a pas besoin d'avoir lieu.

Le prix, c'est une autre histoire, et cette page s'est trompée pendant un mois. DeepSeek V4 Pro ne coûte plus 0,44 $/0,88 $ par million de tokens. En heures creuses, il facture 0,726 $ en entrée et 2,178 $ en sortie par million de tokens sur OrcaRouter, et le double, soit 1,452 $/4,356 $, pendant les fenêtres de pointe, les lectures de cache étant à 0,024 $. Les week-ends sont désormais entièrement en heures creuses. Et la grille tarifaire du fournisseur lui-même — celle de la documentation API de DeepSeek — comporte l'avis de continuation en note de bas de page du même tableau de prix, ce qui est à peu près ce qui se rapproche le plus d'une source primaire pour une page de tarification.

Ce que DeepSeek a réellement dit, et ce qu’il défait

La chronologie compte, car deux des trois annonces étaient l’inverse l’une de l’autre, et c’est celle du milieu dont les gens se souviennent.

• 9 septembre — Deep​Seek a informé les utilisateurs que, jusqu'à ce que V4.1 Pro soit lancé, les requêtes adressées à V4 Pro seraient redirigées vers DeepSeek V4.1 Flash et facturées aux tarifs de V4.1 Flash.

• 10 septembre — V4.1 Flash est sorti, et Deep​Seek a fixé le basculement à un moment précis : 12 h 00, heure de Pékin, le 14 septembre 2026, après quoi V4 Pro serait mis hors ligne et son trafic serait pris en charge par Flash.

• 11 septembre — DeepSeek fait marche arrière. Sa formulation, désormais reprise mot pour mot en note de bas de page sur la page Models & Pricing de sa propre documentation API : « En réponse à la demande des utilisateurs, nous avons décidé de continuer à fournir les services API pour DeepSeek V4 Pro après le 14 septembre 2026, le mode de facturation restant inchangé. Nous fournirons un avis complémentaire en cas de changement. »

C'est le fournisseur qui parle de son propre produit, et c'est la source la plus solide dont on dispose ici — mais lisez ce qu'il tranche et ce qu'il ne tranche pas. Il tranche la continuité et la facturation : V4 Pro reste, aux tarifs déjà en vigueur. Il ne promet pas d'échéance. Nous fournirons un préavis supplémentaire constitue l'intégralité de l'engagement, et cette même phrase laisse la porte ouverte au retour de l'offre. Si vous prenez un engagement sur plusieurs trimestres, prévoyez le modèle que vous pourrez quitter plutôt que celui que vous pourrez conserver.

Le tollé qui a forcé le revirement mérite d’être compris, car il correspond à une décision que vous êtes peut-être sur le point de prendre vous-même. Les développeurs ne s’opposaient pas à V4.1 Flash — que DeepSeek dit surpasser V4 Pro en termes de performances, de prix, de vitesse et de temps total d’exécution des tâches — mais à la substitution automatique. Remplacer le modèle derrière un ID de modèle stable modifie le comportement sans changer le code : une invite ajustée, une température qui fonctionne, un schéma d’appel d’outil qui s’analyse correctement sont tous des propriétés d’un checkpoint spécifique. La couverture de CLS (科创板日报), 36Kr, IT之家 et ifeng, ainsi qu’en anglais chez TheBlockBeats, décrit DeepSeek comme ayant d’abord repoussé, puis abandonné le plan ; la documentation de DeepSeek montre bien le contraste, car les anciens noms deepseek-v4-flash ont été retirés et servent désormais V4.1 Flash, et ce changement est resté. Celui de Pro n’a pas tenu.

Le prix du jour, vérifié par rapport à la grille tarifaire du fournisseur lui-même

Price card titled 'DeepSeek V4 Pro — price per 1M tokens', sourced 'OrcaRouter directory, checked 2026-08-15'. Three highlight cells read Input $0.442, Output $0.884 and Cache read $0.060 USD at zero markup. A row reads DeepSeek official rate (CNY, today): ¥3 in, ¥6 out, cache hit ¥0.025. Two columns show the August 17 change: off-peak input ¥4.5, output ¥13.5, cache hit ¥0.15; peak input ¥9, output ¥27, cache hit ¥0.30. Footer: peak output is 4.5x today's ¥6, off-peak is half of peak, peak windows Beijing weekdays 09:00-12:00 and 14:00-18:00.

Deux chiffres comptent, et il s'agit du même prix catalogue dans deux devises.

• Heures creuses (chaque heure en dehors des créneaux de pointe ci-dessous) — entrée : 0,726 $ par million en cas de défaut de cache, ou 4,5 ¥ ; sortie : 2,178 $, ou 13,5 ¥ ; entrée en cas de succès du cache : 0,024 $, ou 0,15 ¥.

• Pic — exactement le double. Entrée 1,452 $ / 9 ¥, sortie 4,356 $ / 27 ¥, entrée en cas de succès du cache 0,048 $ / 0,30 ¥.

• La conversion en dollars de DeepSeek elle-même — la documentation du fournisseur affiche la même liste en yuans, soit 0,66 $ en entrée / 1,98 $ en sortie hors pointe, et 1,32 $ / 3,96 $ en pointe, avec des hits de cache à 0,022 $ et 0,044 $. L'écart avec les montants en dollars d'OrcaRouter tient au taux de change appliqué de chaque côté, et non à des frais de token ajoutés : OrcaRouter répercute le tarif du fournisseur sans marge, donc le montant affiché sur l'offre est celui que vous payez.

• Aucune offre gratuite pour V4 Pro. Une offre Flash gratuite existe dans l'annuaire, mais le produit phare est réservé aux offres payantes.

• Fiche technique, pour le contexte — V4 Pro est un modèle à poids ouverts sous licence MIT, avec 1,6 T de paramètres au total et 49 B actifs par token, une fenêtre de contexte de 1 M de tokens et jusqu’à 384 K tokens de sortie, avec une limite de concurrence de 500. Artificial Analysis indique 72,3 tokens de sortie par seconde.

La version du modèle qui sous-tend tout cela est DeepSeek-V4-Pro-0813, inchangée depuis sa sortie en disponibilité générale le 13 août — et c’est précisément là l’essentiel. Rien dans le checkpoint n’a changé le 11 septembre ; seule la décision concernant son avenir a changé.

Heures de pointe, heures creuses et la règle du week-end qui change les calculs

Le dispositif heures pleines/heures creuses que la version précédente de cette page annonçait pour le 17 août a maintenant un mois, et il a été modifié une fois depuis.

• Fenêtres de pointe — 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi. En heure de Pékin, cela correspond à 09:00–12:00 et 14:00–18:00, la journée de travail de DeepSeek elle-même. Les tarifs hors pointe sont exactement la moitié des tarifs de pointe, et non une réduction supplémentaire qui viendrait s’y ajouter.

• Les week-ends sont entièrement en heures creuses. Depuis 00:00, heure de Pékin, le 23 août 2026, Deep​Seek a cessé d’appliquer les tarifs de pointe le samedi et le dimanche. Si votre travail par lots peut être déplacé, le déplacer le week-end divise la facture par deux — et pour les équipes qui servent des utilisateurs dans les Amériques, la majeure partie de la semaine de travail se situe déjà en heures creuses, sans aucune planification.

• Ce qu’a coûté le changement, par rapport aux ¥3/¥6 avec lesquels le modèle a été lancé le 13 août — la sortie hors pointe d’aujourd’hui est de 2,25 × le tarif de lancement et la sortie en pointe est de 4,5 × ; l’entrée avec cache-hit en pointe est de 12 × l’ancien ¥0,025.

Il y a ici une asymétrie qui explique pourquoi la question de la migration ne cesse de revenir, même après l’annulation de l’arrêt. Le prix de V4 Pro a augmenté en août, tandis que celui de son successeur a baissé : Deep​Seek a réduit les prix de l’API Flash-series jusqu’à 60 %, à compter du 10 septembre. La pression au changement n’a jamais vraiment été liée à l’avis du 14 septembre ; l’avis n’a fait que la rendre urgente.

Ce que coûte réellement une requête

Trois exemples détaillés aux tarifs heures creuses du jour. Chacun d'eux double dans une plage de pointe.

• 100K entrée + 50K sortie — 0,0726 $ + 0,1089 $ ≈ 0,18 $.

• 1 M en entrée + 1 M en sortie — 0,726 $ + 2,178 $ = 2,90 $. Ce même appel coûte 5,81 $ au tarif de pointe, et il coûtait 1,32 $ à la mi-août.

• Session agentique, 500 K en entrée + 200 K en sortie — 0,363 $ + 0,4356 $ ≈ 0,80 $.

La vue mensuelle se trouve sur la page du modèle et constitue le test honnête pour savoir si l'ancien titre décrit encore votre facture : à 10 M de tokens par mois avec une part d'entrée de 70 %, le calculateur de coûts s'établit à 11,62 $, soit environ 9,16 $ avec la mise en cache des prompts activée. Si votre budget a été construit sur la base de 0,44 $, il couvre désormais environ 60 % de la facture.

Le cache est le levier que personne ne met sur la table

La mise en cache des prompts est devenue plus précieuse, et non moins, lorsque les tarifs ont augmenté — et c’est la direction des deux chiffres qui l’explique. Sur OrcaRouter, une lecture du cache est désormais facturée à 0,024 $ par million de tokens, contre 0,726 $ sans cache, soit une remise de 96,7 % sur toute entrée que vous renvoyez. Dans la version précédente de cette page, le tarif du cache était de 0,060 $ contre un prix d’entrée de 0,442 $, soit une remise de 86 %. Le prix de lecture du cache a chuté de plus de moitié, tandis que le prix d’entrée sans cache a augmenté de 64 %, de sorte que l’écart effectif entre un token mis en cache et un token non mis en cache s’est considérablement creusé.

Pour un agent qui renvoie un grand prompt système et un long contexte à chaque tour, l’entrée mise en cache fait la différence entre une facture qui évolue avec la longueur de la conversation et une qui n’évolue pas. La règle pratique reste inchangée et mérite d’être répétée : placez d’abord le prompt système stable et le contenu de référence, puis le contenu volatil en dernier, afin que le préfixe que vous renvoyez atteigne effectivement le cache. Sur ce modèle, ce seul choix structurel vaut plus que toute décision de routage ou d’ordonnancement en dessous.

Comment la tarification de V4 Pro se compare à la concurrence

Comparison table card titled 'USD per 1M tokens — the field', sourced to the OrcaRouter directory checked 2026-08-15, with an input/output column pair per model: DeepSeek V4 Flash $0.15/$0.29; DeepSeek V4 Pro $0.44/$0.88 highlighted with a 'THIS PAGE' tag; MiniMax M3 $0.30/$1.20; Gemini 3.6 Flash $1.50/$7.50; Grok 4.5 $2.00/$6.00; Qwen 3.8 Max $2.00/$6.00; GPT-5.6 Terra $2.00/$12.00; Kimi K3 $3.00/$15.00; Claude Opus 5 $5.00/$25.00; GPT-5.6 Sol $5.00/$30.00; Claude Fable 5 $10.00/$50.00. Footer: V4 Pro is the cheapest 1M-context flagship, roughly 23x cheaper on input and 57x cheaper on output than Claude Fable 5.

Prix catalogue du répertoire pour l’entrée/sortie par million de tokens, vérifiés le 2026-09-12, comparés aux tarifs hors pointe de V4 Pro de 0,726 $/2,178 $. Deux d’entre eux ont changé depuis la première publication de cette page, et l’un d’eux change la conclusion.

• Claude Fable 5 — 10 $ / 50 $. V4 Pro coûte 13,8 fois moins cher en entrée et 23 fois moins cher en sortie.

• Claude Opus 5 — 5 $ / 25 $. 6,9× / 11,5×.

• GPT-5.6 Sol — 4 $ / 20 $ jusqu’à 272 K de contexte, 8 $ / 30 $ au-delà. 5,5× / 9,2× sur le palier court, 11× / 13,8× sur le palier long.

• Kimi K3 — 3 $ / 15 $. 4,1× / 6,9×.

• Qwen3.8 Max — 2 $ / 6 $. 2,8× / 2,8×.

• Grok 4.5 — 2 $ / 6 $. 2,8× / 2,8×.

• Gemini 3.6 Flash — 0,75 $ / 3,75 $. Quasiment à parité en entrée à 1,03×, et 1,7× en sortie. Son prix a été divisé par deux depuis la rédaction de cette page.

• MiniMax M3 — 0,30 $ / 1,20 $. Moins cher que V4 Pro sur les deux lignes désormais : V4 Pro coûte 2,4× plus cher en entrée et 1,8× plus cher en sortie, avec la même fenêtre de 1 M de tokens.

• DeepSeek V4 Flash — 0,242 $ / 0,726 $ sur le répertoire. Environ 3× moins cher sur les deux lignes, même contexte de 1 M.

Donc le cadrage honnête a changé, et cette page devrait le dire plutôt que de conserver l’ancien superlatif. DeepSeek V4 Pro n’est plus le modèle à contexte de 1 M le moins cher du tableau : Gemini 3.6 Flash et MiniMax M3 sont tous les deux moins chers, et MiniMax M3 y parvient tout en offrant la même fenêtre de contexte. Ce que V4 Pro reste, de plus d’un ordre de grandeur, c’est le moins cher de la catégorie frontière — chaque modèle occidental de classe flagship de cette liste coûte plusieurs fois son prix sur les deux lignes. Si la question est « l’appel à contexte de 1 M le moins cher possible », la réponse n’est plus ce modèle. Si la question est « le modèle le moins cher qui se comporte comme un modèle de frontière », pour l’instant, c’est encore lui.

Quand V4 Pro est le mauvais choix

• Si votre trafic est le plus intense pendant la journée à Pékin. Les heures de pointe doublent le tarif, et les plages de pointe correspondent exactement à la journée de travail en Chine. Si vos utilisateurs sont dans les Amériques, la majeure partie de votre trafic tombe déjà en heures creuses, ce qui constitue un véritable avantage structurel. Si vous développez pour des utilisateurs en Chine, modélisez explicitement la facture de pointe avant de vous engager — et vérifiez si la règle du week-end vous aide à décaler quoi que ce soit.

• Si vos prompts sont courts. En dessous d’environ 10K tokens de contexte, le niveau haut de gamme est de la capacité gaspillée. DeepSeek V4 Flash à $0.242/$0.726 sur l’annuaire gère le même contexte de 1M pour environ un tiers du prix, et pour des tâches réellement courtes, un modèle moins cher l’emporte encore.

• Si vous avez besoin de vision. V4 Pro est uniquement textuel — aucune entrée d'image ou d'audio — et Artificial Analysis répertorie sa modalité d'entrée comme du texte. Gemini 3.6 Flash ou Claude Fable 5 sont plus adaptés si la modalité est l'essentiel. L'API propre à DeepSeek mérite également d'être mentionnée ici : elle sert désormais ses anciens noms de modèles flash avec V4.1 Flash, qui accepte bien les images.

• Si vous achetez un score brut au sommet des benchmarks plutôt qu’un prix par contexte. À l’échelle actuelle d’Artificial Analysis, V4 Pro obtient 36 sur l’Intelligence Index — 8e sur 113 modèles au moment de la rédaction — et 69 sur l’indice Coding tel que repris dans l’annuaire OrcaRouter. C’est compétitif, sans être leader : Claude Fable 5, Claude Opus 5 et GPT-5.6 Sol le surpassent tous en codage. L’argument de V4 Pro est une capacité proche de la frontière pour une fraction du prix par token, pas le sommet de tous les classements.

Comment l'appeler sur OrcaRouter

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (model ID deepseek/deepseek-v4-pro): FLAGSHIP FEATURED badge, '1M tokens' context and 384K max output, input and output price per 1M tokens (output shown at $0.88), /v1/chat/completions and /v1/responses endpoints, and an OpenAI SDK code sample pointing at api.orcarouter.ai/v1.

DeepSeek V4 Pro est hébergé sur OrcaRouter sous l'ID de modèle deepseek/deepseek-v4-pro, servi via le point de terminaison compatible OpenAI à l'adresse api.orcarouter.ai/v1, au tarif du fournisseur et sans aucune majoration. Migrer depuis un client OpenAI existant ne demande qu'un changement d'URL de base et d'ID de modèle, rien de plus.

Le revirement change ce que vous devez faire à ce sujet. Si vous aviez une migration au 14 septembre à votre calendrier — un rebasculement de V4 Pro vers DeepSeek V4.1 Flash parce que Pro disparaissait —, vous pouvez la retirer du calendrier, ou du moins la faire passer du statut d'échéance à celui de test. Les deux modèles se trouvent derrière une seule clé OrcaRouter, si bien les comparer revient à changer un identifiant de modèle dans une requête plutôt qu'à souscrire un second contrat et un second SDK ; et si vous voulez réellement évaluer V4.1 Flash sur du trafic réel sans miser un chemin de production dessus, le basculement automatique est la façon la moins risquée de lui confier des requêtes en direct tandis que V4 Pro reste en secours. Telle est la forme concrète de la décision du 11 septembre : le choix reste le vôtre, et il reste réversible.

La note d'honnêteté qui compte pour une page de tarification : nous acheminons vers le modèle, nous ne fixons pas son prix. Les chiffres hors pointe de 0,726 $/2,178 $ correspondent aux tarifs de DeepSeek répercutés tels quels, et ils évoluent quand DeepSeek les fait évoluer — c'est précisément pourquoi cette page est horodatée, et pourquoi la version que vous lisez a été réécrite plutôt que complétée.

Sources et date

Les prix et les spécifications figurant sur cette page ont été revérifiés le 12 septembre 2026. Les montants en dollars pour DeepSeek V4 Pro et pour chaque modèle de la comparaison sont tirés de l'annuaire des modèles OrcaRouter, vérifié le même jour ; le nombre de paramètres, la licence, la fenêtre de contexte, la modalité et les chiffres de vitesse proviennent de la page modèle d'Artificial Analysis consacrée à DeepSeek V4 Pro 0813. Les tarifs en yuan, les fenêtres de pointe et l'avis de continuation du 11 septembre proviennent de la documentation Models & Pricing de DeepSeek elle-même, qui reprend cette déclaration mot pour mot dans une note de bas de page du tableau des prix. La séquence d'annonces en trois étapes — l'avis de routage du 9 septembre, le report du 10 septembre à 12 h 00, heure de Pékin, le 14 septembre, et le revirement du 11 septembre — est rapportée par CLS (科创板日报), 36Kr, IT之家 et ifeng, et en anglais par TheBlockBeats. La règle de facturation du week-end du 23 août et la baisse de prix du Flash du 10 septembre proviennent des annonces de DeepSeek telles que relayées par IT之家, The Paper et 21st Century Business Herald.

Une dernière remarque sur la fiabilité, car ce prix précis a changé trois fois en un mois — tarifs de lancement le 13 août, peak/off-peak le 17 août, l'amendement du week-end le 23 août. Considérez toute page « V4 Pro pricing » sans date comme inutilisable. La version antérieure de celle-ci indiquait 0,44 $/0,88 $ et un indice d'intelligence Artificial Analysis de 44,3 ; les deux étaient exacts au moment de leur rédaction, et aucun n'a survécu au mois.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement