
Examen de DeepSeek V4 : les modèles sérieux à 1 million de jetons les moins chers dans l'IA ?
DeepSeek a lancé la famille V4 le 24 avril 2026 — deux modèles, V4-Pro et V4-Flash, disponibles sur l'API et open-sourcés dès le premier jour — et a discrètement redéfini le seuil de ce que coûte une capacité IA sérieuse. Les deux modèles offrent par défaut une fenêtre de contexte de 1 million de tokens, proposent des modes avec et sans réflexion, et le vaisseau amiral V4-Pro plafonne à 0,87 $ par million de tokens de sortie : un prix qui sous-cote tous les modèles comparables à contexte de 1M sur le marché, qu'ils soient ouverts ou fermés.
Et juillet est le mois des décisions. Dans un avis daté du 29 juin, DeepSeek a confirmé que la version officielle de V4 arrivera à la mi-juillet 2026, promettant des améliorations de fonctionnalités et de performances — et introduisant une tarification aux heures de pointe qui double les tarifs pendant les créneaux d'affaires de Pékin. Dix jours après, le 24 juillet, les noms de modèles hérités `deepseek-chat` et `deepseek-reasoner` disparaissent définitivement. Cette revue couvre ce qu'est réellement V4, ce qu'elle coûte aujourd'hui et après la sortie officielle, où elle gagne, où elle ne gagne clairement pas, et quoi faire avant les échéances.
Verdict rapide
Envisagez DeepSeek V4 si vous…
Exécutez des charges de travail de production à volume élevé où le coût unitaire décide de ce qui est viable — la tarification de V4 est dans une classe à part.
- Besoin d'un contexte long à faible coût : 1M de tokens standard, jusqu'à 384K tokens de sortie par réponse, avec des réductions agressives sur la mise en cache du contexte.
- Intégration plug-and-play souhaitée — l'API prend en charge à la fois les formats OpenAI ChatCompletions et Anthropic, donc les outils existants fonctionnent généralement sans problème.
- Valorisez les poids ouverts et les options d'auto-hébergement, en particulier le plus petit V4-Flash
Attendez (ou redirigez ailleurs) si vous…
- Exécutez des agents autonomes à long horizon — sur le tableau inter-modèle publié par Z.ai, V4-Pro est loin derrière à la fois GLM-5.2 et la frontière fermée sur les benchmarks de type marathon.
- Nécessite une entrée d'image : V4 est uniquement textuel
- Compter sur une tarification fixe 24h/24 — à partir de la sortie officielle à la mi-juillet 2026, les tarifs des heures de pointe doublent pendant les fenêtres d'affaires de Pékin (les heures creuses conservent les tarifs actuels)
Qu'est-ce que DeepSeek V4 ?
V4 est la quatrième génération de modèles DeepSeek, livrée sous la forme de deux modèles Mixture-of-Experts. DeepSeek-V4-Pro est le modèle phare : 1,6 billion de paramètres au total, avec 49 milliards d'actifs par jeton. DeepSeek-V4-Flash est le modèle d'efficacité : 284 milliards au total, 13 milliards d'actifs. Les deux utilisent par défaut une fenêtre de contexte de 1 million de tokens sur les services officiels de DeepSeek, et tous deux exposent des modes doubles — réflexion pour les problèmes complexes, non-réflexion pour la rapidité — sous les identifiants de modèle deepseek-v4-pro et `deepseek-v4-flash`.
Deux détails de positionnement comptent. Premièrement, V4 a été lancé en tant qu'aperçu que DeepSeek considère comme utilisable en production — et selon l'avis du 29 juin de la société, le version officielle sort à la mi-juillet 2026 avec « optimisations de fonctionnalités et améliorations de performances. » Deuxièmement, il a été lancé open source, poursuivant la pratique de DeepSeek de publier les poids publiquement — ce qui maintient l'auto-hébergement et le réglage fin sur la table, réalistiquement pour le Flash 284B plus que pour le Pro 1,6T.
Quoi de neuf dans DeepSeek V4 ?

Un contexte de 1M tokens par défaut, et non une vente additionnelle. Tous les services officiels DeepSeek utilisent désormais la fenêtre complète d'un million de tokens en standard — pas de SKU distinct pour un long-contexte, pas de tarif premium.
Énorme capacité de sortie.Les deux modèles prennent en charge jusqu'à 384K jetons de sortie par réponse — trois fois plus que ce que permettent la plupart des concurrents avec un contexte de 1M — ce qui est important pour la génération de code sur l'ensemble du fichier, les extractions structurées longues et la rédaction de rapports.
Deux modes sur un seul point de terminaison.Mode de réflexion pour les problèmes difficiles, mode sans réflexion pour les appels rapides et peu coûteux, commutable par requête plutôt que par modèle.
Deux niveaux avec une seule forme d'API. Pro pour la capacité, Flash pour le volume — même contexte, mêmes modes, même intégration.
Compatibilité double API.V4 comprend nativement à la fois les formats OpenAI ChatCompletions et Anthropic API, de sorte que la plupart des outils d'agent existants se connectent sans réécriture.
Tarifs : ce que ça coûte réellement

Voici la section qui rend V4 célèbre. V4-Pro coûte $0.435 par million de jetons d'entrée et $0.87 par million de sortie. V4-Flash coûte $0.14 et $0.28. Les hits de cache sur un contexte répété sont listés à bien moins d'un cent par million de jetons — effectivement gratuits pour les boucles d'agent qui relisent le même état de projet.
Pour donner une échelle : GLM-5.2, elle-même célébrée comme le meilleur rapport qualité-prix de l'été, est listée à 1,40 $ / 4,40 $. Claude Sonnet 5 est listé à 3 $ / 15 $, Claude Opus 4.8 à 5 $ / 25 $. Le prix de sortie de V4-Pro est un cinquième de celui de GLM-5.2 et environ 3 % de celui d'Opus 4.8. Même si V4-Pro perd quelques confrontations de qualité en tête-à-tête — et c'est le cas — l'économie change les questions qui valent la peine d'être posées à un modèle.
Un changement arrive avec la version officielle.Selon l'avis de DeepSeek du 29 juin, à partir de la mi-juillet, tous les prix des tokens doublent pendant les fenêtres de pointe — 09:00–12:00 et 14:00–18:00 heure de Pékin — tandis que les heures creuses conservent les tarifs actuels. Même doublé, le prix de sortie en pointe du V4-Pro (environ 1,74 $ par million) reste inférieur au tarif standard du GLM-5.2, mais l'ère du prix fixe prend fin avec l'aperçu : si votre trafic atteint son maximum pendant les heures de travail chinoises, modélisez la fluctuation — ou planifiez et acheminez en fonction.
Note des avis
Les scores ci-dessous constituent notre évaluation éditoriale basée sur la documentation officielle de DeepSeek et le tableau de référence inter-modèles publié par Z.ai — considérez les chiffres inter-fournisseurs comme un contexte tiers plutôt que comme des affirmations de DeepSeek lui-même.

- Codage : 8/10 — compétent dans l'ingénierie courante ; pas le leader open-weight
- Agentic / utilisation d'outils : 7/10 — orchestration solide des outils, faible sur l'autonomie de longue durée
- Raisonnement : 8/10 — de bons scores en mathématiques et en sciences pour la catégorie de prix.
- Rentabilité : 10/10 — rien de comparable ne s'en approche
- Contexte et documents longs : 9/10 — 1M en entrée, 384K en sortie, hits de cache quasi gratuits
- Vitesse : 8/10 — comptes de paramètres actifs réduits, plus un mode sans réflexion pour les chemins rapides.
Overall: ~8.3/10 — le roi du rapport qualité-prix de mi-2026, avec un astérisque à long horizon.
Avantages
- Tarification qui réinitialise la courbe : 0,14 $ à 0,87 $ par million de jetons dans la gamme
- Contexte standard de 1M avec sortie de 384K — le plus grand plafond de sortie de sa catégorie
- Modes de réflexion et de non-réflexion sur un seul point de terminaison, commutable par requête
- La compatibilité avec les API OpenAI et Anthropic signifie une friction de migration quasi nulle
- Les poids open source gardent l'auto-hébergement et le fine-tuning comme options possibles.
Inconvénients
- Le travail agentic à long horizon est la faiblesse évidente — sur le tableau publié de Z.ai, V4-Pro obtient 29.0 sur FrontierSWE où GLM-5.2 affiche 74.4 et Claude Opus 4.8 75.1
Texte uniquement : aucune entrée d'image dans l'API V4
La tarification aux heures de pointe arrive avec la sortie officielle de la mi-juillet — les tarifs doublent pendant les fenêtres d'affaires de Pékin, donc les budgets cessent d'être plats.
Encore un aperçu jusqu'à la mi-juillet, donc le comportement peut changer avec la version officielle.
La retraite du 24 juillet 2026 de deepseek-chat et deepseek-reasoner oblige les utilisateurs historiques à migrer selon le calendrier de DeepSeek.
Héberger soi-même le modèle Pro à 1,6 trillion de paramètres est irréaliste pour presque tout le monde (Flash, avec 284 milliards, est la cible réaliste).
Comment DeepSeek V4 se compare

V4-Pro vs V4-Flash.Même contexte, mêmes modes, même API — la distinction est entre qualité et débit, avec un écart de prix de 3x. Un choix sensé par défaut : Flash pour les résumés, l'extraction, la classification et le chat ; Pro pour le code, l'analyse et tout ce qu'un humain révise.
vs GLM-5.2. Le combat open-weight de l'été, et il est vraiment serré en termes de valeur. GLM-5.2 est le meilleur codeur — sur le tableau publié par Z.ai, il mène V4-Pro 81,0 contre 64,0 sur Terminal-Bench 2.1 et domine les travaux à long terme (74,4 contre 29,0 sur FrontierSWE) — tandis que V4 riposte avec des prix 3 à 5 fois inférieurs et un plafond de sortie trois fois plus élevé. Les pipelines de volume penchent vers V4 ; les agents de codage penchent vers GLM-5.2.
vs la frontière fermée.Claude Opus 4.8 et GPT-5.5 restent clairement des modèles plus performants sur les benchmarks difficiles. Mais avec un écart de prix de sortie de 30 à 60 fois par rapport à Opus 4.8, V4 n'essaye pas de gagner ce combat — il essaie de rendre 90 % de votre trafic trop bon marché pour justifier de l'envoyer ailleurs.
La date limite du 24 juillet : migrer hors des noms hérités

Si votre intégration appelle encore `deepseek-chat` ou `deepseek-reasoner`, ces noms cesseront de fonctionner après 24 juillet 2026 à 15h59 UTC. Ils pointent actuellement vers V4-Flash, ce qui signifie que votre trafic fonctionne déjà sur l'économie V4 — mais après la coupure, les requêtes échouent purement et simplement. La migration elle-même est une seule ligne (`model: "deepseek-v4-pro"` ou `"deepseek-v4-flash"`), donc le vrai travail consiste à retester les prompts avec le comportement de V4 et à décider, endpoint par endpoint, quel niveau de service mérite chaque charge de travail — ou à mettre un routeur en amont pour que la prochaine dépréciation soit un changement de configuration plutôt qu'un changement de code.
Qui devrait utiliser DeepSeek V4 ?
Produits à volume élevé — support, résumé, extraction, classification — où la tarification V4 rend les fonctionnalités marginales rentables
Les charges de travail de longs documents et intensives en RAG qui remplissent des fenêtres de 1 million de tokens quotidiennement et profitent de hits de cache presque gratuits
Équipes générant de longues sorties : bases de code, rapports, données structurées — une sortie de 384K est le plafond de la classe.
Les constructeurs soucieux des coûts qui veulent une option par défaut performante et sont heureux de répercuter les 10% difficiles ailleurs.
Qui devrait chercher ailleurs ?
Les équipes dont le volume de travail principal est constitué d'agents autonomes à longue durée d'exécution — GLM-5.2 ou un flagship fermé est la voie la plus sûre.
Flux de travail dépendants de la vision (V4 ne prend pas d'images)
Toute personne qui a besoin aujourd'hui d'un label contractuel 'stable' plutôt que d'un aperçu.
DeepSeek V4 en vaut-il la peine ?
Pour le prix, résolument oui — en tant que voie, pas une religion. V4 ne bat pas le meilleur codeur open-weight (GLM-5.2) ni les vaisseaux amiraux de pointe en termes de qualité, et ses chiffres d'agent à long horizon sont vraiment faibles. Ce qu'il fait, c'est rendre d'énormes pans du travail quotidien de l'IA — les résumés, extractions, brouillons et tours de discussion qui dominent les factures de jetons réelles — presque gratuits. Le modèle gagnant est V4 comme plancher de volume, avec des voies d'escalade au-dessus.
Verdict final
DeepSeek V4 est la référence en matière de rapport qualité-prix par rapport à laquelle tous les autres modèles sont désormais mesurés — notre note : ~8.3/10. Utilisez Flash là où le volume prime, Pro là où la qualité compte mais où les budgets sont réels, et orientez les travaux de niveau sommet vers un modèle plus puissant. Recalculez vos coûts lorsque la tarification de pointe arrivera à la mi-juillet — le bon marché reste bon marché, mais il cesse d'être plat. Et si vous êtes toujours sur deepseek-chat ou deepseek-reasoner : vous avez jusqu'au 24 juillet. Bougez.
Utilisation de DeepSeek V4 via OrcaRouter
Une stratégie à trois voies — la V4 pour le volume, un modèle ouvert ou fermé plus fort pour les tâches difficiles, un repli pour la fiabilité — est exactement la configuration qui est pénible à gérer manuellement et triviale derrière une passerelle. OrcaRouter dessert DeepSeek V4 aux côtés de GLM-5.2, Claude, GPT, Gemini et plus de 200 autres modèles via un point de terminaison compatible OpenAI, aux prix de la liste des fournisseurs avec une marge zéro sur les jetons : le routage intelligent sélectionne la voie par requête, le basculement automatique couvre les aléas de l'ère des aperçus, et l'observabilité par modèle montre ce que chaque voie coûte réellement par tâche accomplie. Il désamorce également les changements côté fournisseur comme le retrait du nom du 24 juillet ou la tarification aux heures de pointe de la mi-juillet — lorsqu'un nom de modèle disparaît ou qu'une fenêtre de prix s'ouvre, vous mettez à jour une règle de routage, pas votre base de code.


FAQ
DeepSeek V4 est-il disponible maintenant ?
Oui — V4-Pro et V4-Flash sont disponibles sur l'API DeepSeek depuis le 24 avril 2026, sous les identifiants de modèle deepseek-v4-pro et deepseek-v4-flash, avec des poids open source. Officiellement, il s'agit d'un aperçu ; l'avis du 29 juin de DeepSeek place la version officielle à la mi-juillet 2026.
Qu'est-ce que la tarification aux heures de pointe de DeepSeek ?
Annoncés pour la sortie officielle : à partir de la mi-juillet 2026, tous les prix des jetons doublent pendant les fenêtres d'activité de Pékin (09:00-12:00 et 14:00-18:00 heure de Pékin), tandis que les heures creuses conservent les tarifs actuels. Le trafic qui atteint son maximum en dehors des heures d'activité chinoises — la plupart des charges de travail occidentales — échappe largement à la surtaxe.
Qu'arrive-t-il à deepseek-chat et deepseek-reasoner ?
Ils sont actuellement acheminés automatiquement vers V4-Flash, mais après le 24 juillet 2026 (15:59 UTC), les deux noms seront complètement retirés et les requêtes échoueront. Mettez à jour le paramètre de modèle explicitement avant la date limite.
Dois-je utiliser V4-Pro ou V4-Flash ?
Flash pour les travaux de volume qu'un humain ne révise jamais ligne par ligne — résumés, extraction, classification, chat. Pro pour le code, l'analyse et la rédaction, à environ 3 fois le prix de Flash mais toujours bien en dessous de tous les modèles comparables.
DeepSeek V4 est-il meilleur que GLM-5.2 ?
Moins cher, pas meilleur. Sur le tableau publié par Z.ai, GLM-5.2 est clairement en tête en matière de codage et domine le travail d'agent à long horizon ; V4 répond avec des prix 3 à 5 fois inférieurs, un plafond de sortie de 384K, et des accès cache quasi gratuits. De nombreuses équipes utilisent les deux : V4 pour le volume, GLM-5.2 pour les agents de codage.
DeepSeek V4 peut-il traiter des images ?
Non — l'API V4 est textuelle uniquement. Acheminez les tâches visuelles (captures d'écran, PDF sous forme de pixels, graphiques) vers un modèle multimodal comme Claude ou Gemini à la place.
Puis-je auto-héberger DeepSeek V4 ?
Les poids sont open-source, mais soyez réaliste quant à l'échelle : V4-Pro est un MoE de 1,6 T de paramètres — territoire de centre de données — tandis que le V4-Flash de 284B est la cible pratique d'auto-hébergement pour les équipes bien dotées en ressources.
Est-ce que V4 fonctionne avec mes outils existants d'OpenAI ou de Claude ?
Oui, dans l'ensemble — l'API prend en charge nativement les formats OpenAI ChatCompletions et Anthropic, donc les frameworks d'agents et SDK conçus pour l'un ou l'autre se connectent généralement en changeant l'URL de base et le nom du modèle.
Puis-je utiliser DeepSeek V4 via OrcaRouter ?
Oui — les modèles DeepSeek sont disponibles sur OrcaRouter au prix catalogue du fournisseur sans marge, aux côtés de GLM, Claude, GPT et Gemini, de sorte que vous pouvez exécuter la répartition volume-plus-escalade derrière un seul point d'accès.
Prêt à rendre votre facture de tokens ennuyeuse ? Créez votre compte OrcaRouter, pointez votre client compatible OpenAI vers un point d'accès, et acheminez le volume vers DeepSeek V4 tandis que des modèles plus puissants gèrent le sommet — sans aucune majoration de tokens et avec une intégration à l'épreuve du 24 juillet.
