
Date de sortie de DeepSeek V4 Pro : déjà 14x moins cher que Kimi K3, pas encore aussi intelligent
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxNOUVEAUMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 2110 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
Le 31 juillet 2026, la société a publié une entrée de changelog annonçant que son modèle bon marché avait battu son modèle coûteux. L'entrée concernait DeepSeek V4 Flash, le palier d'efficacité 284B, et l'affirmation principale était : « capacités d'agent considérablement améliorées, avec des résultats sur les benchmarks dépassant de loin V4-Pro-Preview. » V4-Pro-Preview est DeepSeek V4 Pro — le fleuron à 1,6 billion de paramètres, celui qui coûte trois fois plus cher par jeton. La même entrée se terminait par une phrase à son sujet : « La version officielle de DeepSeek-V4-Pro suivra bientôt. » C'est le contexte de la prévision qui circule actuellement, selon laquelle quand le vrai V4 Pro arrivera, il sera au niveau de Kimi K3 mais dix fois moins cher. Une moitié de cette prévision est déjà mesurable, et elle se trompe dans la direction que presque personne n'attend.
Une note sur ce que cet article est et n'est pas. Il n'y a ici ni carte système divulguée, ni benchmark interne, ni date. La prédiction qui circule vient de @scaling01 sur X — "DeepSeek-V4 Pro will be a banger probably also Kimi-K3 level but 10x cheaper" — et c'est une prévision d'un praticien très suivi, pas une révélation de quelqu'un ayant un accès privilégié. La traiter comme une fuite, voilà comment s'écrivent de mauvais articles sur les dates de sortie. Ce que nous pouvons faire à la place, c'est prendre les deux moitiés testables de l'affirmation et les vérifier par rapport à des chiffres qui existent déjà, car la version d'aperçu est appelable depuis trois mois et que tant elle que Kimi K3 ont été exécutées par un laboratoire indépendant. Tout ce qui suit est étiqueté par source : la documentation propre de l'entreprise, les mesures d'Artificial Analysis, ou des calculs que nous avons faits nous-mêmes et que nous montrons.
Ce que DeepSeek a réellement dit, et ce qu'il n'a pas dit.
La surface confirmée est plus grande que ce que la formulation « modèle non publié » suggère. V4 Pro n'est pas du vaporware — vous pouvez l'appeler dès maintenant. Ce qui ne s'est pas produit, c'est la sortie que l'entreprise elle-même considère comme officielle.
• Architecture — un modèle de mélange d’experts avec 1.6T de paramètres au total et 49B actifs par jeton, confirmé par l’entreprise et répertorié à l’identique sur Artificial Analysis comme 1600B/49B.
• Contexte et sortie — une fenêtre d'entrée de 1M de jetons (1 048 576) avec jusqu'à 384K jetons de sortie. Texte en entrée, texte en sortie ; aucune entrée d'image, de son ou de vidéo.
• Licence et poids — MIT, avec les poids publiés sur Hugging Face. C'est un fleuron à poids ouverts, et c'est exactement pour cela que la comparaison avec Kimi K3 est intéressante.
• Prix catalogue — 0,435 $ par million de jetons d'entrée en cas d'échec de cache, 0,003625 $ en cas de succès de cache et 0,87 $ par million de jetons de sortie, d'après la page de tarification de l'entreprise elle-même.
• Interfaces — points de terminaison de type ChatCompletions d'OpenAI et au format Anthropic, ainsi que des niveaux d'effort de raisonnement, l'appel d'outils et la sortie structurée.
• Chronologie jusqu'ici — la famille V4 a été lancée en aperçu le 24 avril 2026 ; les anciens noms de modèles deepseek-chat et deepseek-reasoner ont été retirés le 24 juillet 2026 ; Flash a obtenu sa version officielle le 31 juillet 2026 ; Pro non.
• 6 août 2026 — DeepSeek a informé les développeurs qu'elle prévoit d'augmenter la tarification globale des services API DeepSeek « dans un avenir proche, avec une augmentation significative attendue », et a réaffirmé que la sortie officielle de V4 Pro suivra. Aucun nouveau tarif ni aucune date d'entrée en vigueur n'ont été publiés.
Et les parties qui restent véritablement inconnues, ce qui représente l'essentiel de ce que les gens recherchent :
• La date GA — toujours pas annoncée. « Suivra bientôt » reste l'intégralité de l'engagement formel de l'entreprise. Des rapports de presse non confirmés évoquent une fenêtre à la mi-août — un média a avancé les 10–20 août, et la page de tarification d'un revendeur a modifié les prix du cache V4 Pro le 3 août, une tendance qui précède historiquement une sortie — mais rien de tout cela ne vient de l'entreprise. Aucune date n'a été confirmée.
• Ce que la version GA changera — non précisé. L'entreprise n'a pas indiqué si la V4 Pro officielle est un nouveau post-entraînement des mêmes poids, un nouveau pré-entraînement, ou un changement de prix.
• Que le prix y survive — non traité, et il y a une raison précise de s’inquiéter à ce sujet, que nous aborderons plus bas.
Une correction qu'il vaut la peine de faire explicitement, car les résultats de recherche pour cette question sont contaminés : vous trouverez des pages affirmant que la famille V4 a atteint sa disponibilité générale le 20 juillet 2026. Le journal des modifications de l'entreprise elle-même, onze jours après cette date, indique que la version officielle de V4 Pro est toujours en attente, et ajoute que la mise à jour du 31 juillet « améliore uniquement l'API DeepSeek-V4-Flash. L'API DeepSeek-V4-Pro et les modèles APP/WEB sont inchangés. » Lorsqu'un résumé tiers et le journal de modifications principal d'un fournisseur divergent, c'est le journal de modifications qui prévaut.

L'affirmation de prix : « 10 fois moins cher » est l'interprétation prudente.
Kimi K3 est proposé à 3,00 $ par million de jetons d'entrée et 15,00 $ par million en sortie, avec des touches de cache à 0,30 $. V4 Pro est proposé à 0,435 $ et 0,87 $, avec des touches de cache à 0,003625 $. Si on les compare, « 10x » s'avère être le bas de la fourchette, et non le chiffre marquant :
• Tokens d'entrée — 3,00 $ contre 0,435 $, donc V4 Pro est 6,9 fois moins cher. C'est la seule dimension où l'affirmation exagère.
• Jetons de sortie — 15,00 $ contre 0,87 $, soit 17,2 fois moins cher. La sortie est là où les modèles de raisonnement dépensent, ce qui en fait le chiffre le plus important.
• Un mélange entrées-sorties 70/30 — 6,60 $ par million contre 0,5655 $, soit 11,7x.
• La combinaison 7:2:1 cache-hit/entrée/sortie d'Artificial Analysis — 2,31 $ contre 0,18 $, soit 12,8x.
• Entrée en cache — 0,30 $ contre 0,003625 $, environ 83 fois. Le prix de lecture du cache de l’entreprise se classe au 4e rang sur 101 modèles suivis par Artificial Analysis, avec une remise de 99 % par rapport à son propre tarif de défaut de cache.
Les mélanges hypothétiques sont discutables, voici donc une mesure concrète. Artificial Analysis publie ce qu'elle a réellement dépensé pour exécuter son Intelligence Index complet sur chaque modèle — la même suite d'évaluation, le même harnais, de vrais comptages de tokens plutôt qu'un ratio supposé. Kimi K3 a coûté 2 437,41 $ à évaluer. V4 Pro a coûté 176,34 $. Cela représente 13,8 fois plus, sur une charge de travail identique, en dollars réellement payés.
Ce qui rend ce chiffre inférieur au ratio du prix de sortie de 17,2x mérite d'être compris, car c'est le seul point où le faible coût de V4 Pro est en partie auto-infligé. V4 Pro est verbeux : il a brûlé 180 M de jetons de sortie pour parcourir l'index, contre 130 M pour Kimi K3 et une médiane de 100 M pour sa catégorie. Il dépense donc environ 38 % de jetons en plus pour dire ce qu'il a à dire, ce qui grignote un avantage par jeton. Le chiffre de 13,8x intègre déjà ce facteur ; celui de 17,2x ne l'intègre pas. Si vous établissez un budget, utilisez le chiffre mesuré.
Ceci est également la partie de l'histoire qu'il est facile de vérifier soi-même plutôt que de la croire sur parole. Comme OrcaRouter transmet les prix catalogue des fournisseurs directement avec une marge de 0 %, les chiffres par token sur nos pages de modèles deepseek/deepseek-v4-pro et kimi/kimi-k3 sont ceux des deux fournisseurs eux-mêmes — K3 affiche 3,00 $ / 15,00 $ sur notre page et 3,00 $ / 15,00 $ sur celle de Moonshot — et non un tarif revendu avec une marge cachée — ce qui signifie que le calcul ci-dessus se reproduit sur une seule facture, et que si l'un ou l'autre fournisseur modifie un prix, le changement arrive chez nous le jour même plutôt qu'après un cycle de contrat.
L'affirmation sur l'intelligence : 13 points, pas la parité.
Le niveau « Kimi K3 » est la moitié des prévisions qui ne survivent pas au contact des chiffres actuels. Sur l’indice d’intelligence d’Artificial Analysis, en date du 5 août 2026, Kimi K3 obtient 57 points et DeepSeek V4 Pro (raisonnement, effort maximal) en obtient 44 — classé n°6 sur 101 modèles, ce qui est un placement vraiment solide, et encore à 13 points d’écart. Les deux sont mesurés par le même laboratoire sur le même composite, tous deux avec un effort de raisonnement maximal, tous deux avec un contexte de 1 million de jetons.
Les benchmarks des fournisseurs racontent une histoire différente et plus flatteuse, ce qui explique exactement pourquoi il faut les étiqueter. L'entreprise rapporte que V4 Pro-Preview obtient 80,6 % sur SWE-bench Verified et 90,1 % sur GPQA Diamond. Moonshot rapporte que Kimi K3 obtient 76,8 % sur SWE-bench Verified et 93,5 % sur GPQA Diamond. Si l'on prend ces chiffres au pied de la lettre, V4 Pro remporte le benchmark de codage haut la main. Aucun de ces deux ensembles de résultats n'a été reproduit de manière indépendante ; ils ont été produits sur des harnais d'évaluation différents par des équipes ayant un intérêt dans le résultat, et sur la seule évaluation composite où un tiers a fait tourner les deux modèles lui-même, l'ordre s'inverse. C'est là tout l'argument pour se méfier des comparaisons entre fournisseurs basées sur un unique benchmark.

Le numéro de l'indice appelle deux mises en garde distinctes. Premièrement, si vous trouvez d'anciens articles faisant état d'un V4 Pro à 52 plutôt qu'à 44, ils n'ont pas tort — l'article de lancement d'avril d'Artificial Analysis a effectivement placé le V4 Pro (Max) à 52 et l'a qualifié de modèle de raisonnement open-weights n° 2. L'indice est révisé, et les révisions font évoluer le score de chaque modèle. La règle pratique est que seules les comparaisons au sein d'un même instantané ont un sens ; un 52 d'avril et un 57 d'août n'ont pas leur place dans la même phrase. Deuxièmement, la page d'Artificial Analysis porte la date « Released April 2026 » et ne distingue pas la version d'aperçu d'une future version officielle ; son 44 est donc une mesure de ce que l'endpoint a servi, quel que soit le moment où il a été testé.
Là où V4 Pro bat clairement Kimi K3, c'est sur les axes qui ne relèvent pas de l'intelligence. Il génère 66,5 tokens par seconde contre 37,6 pour K3, dans une classe dont la médiane est de 65,9 — donc V4 Pro est à peu près dans la moyenne de sa classe et Kimi K3 est exceptionnellement lent. Le temps jusqu'au premier token est de 1,61 seconde contre 2,85. Pour une boucle d'agent interactive, cette différence se fait sentir à chaque tour, et c'est l'argument le plus fort en faveur de la version d'aperçu telle qu'elle se présente aujourd'hui.
Ce que la version officielle de Flash nous dit sur Pro's.
Voici ce qui se rapproche le plus d'une véritable preuve concernant le modèle non publié, et cela provient du modèle frère qui a déjà traversé ce processus.
Le journal des modifications du 31 juillet de l'entreprise indique que « DeepSeek-V4-Flash-0731 conserve la même architecture de modèle et la même taille que DeepSeek-V4-Flash-Preview, et n'a été que re-post-entraîné ». Même nombre de poids, même architecture, même prix — post-entraînement uniquement. Artificial Analysis a évalué le résultat à 50, contre 40 pour la version Flash précédente. Dix points sur l'indice composite, grâce au seul post-entraînement, sans coût supplémentaire par jeton. Sa consommation de jetons de sortie sur l'indice a également chuté de 12 %, passant d'environ 234 M à 206 M, ce qui l'a rendu moins coûteux à exécuter au même prix catalogue.
Appliquez ce précédent à Pro et l'arithmétique est inévitable : 44 plus 10 font 54. Kimi K3 est à 57. Même si le V4 Pro officiel répète l'amélioration post-entraînement la plus réussie que l'entreprise ait publiquement démontrée, il se situe à environ trois points en dessous du « niveau Kimi K3 » — tout en coûtant environ un quatorzième du coût d'exécution. C'est un résultat remarquable, et ce n'est pas le résultat que prédit la prévision.
Les réserves honnêtes sur cette extrapolation, qui est arithmétique et non une prédiction : un gain de +10 sur un modèle de 284B en dit peu sur ce qui est disponible sur un modèle de 1,6T, et la marge pourrait être plus grande ou beaucoup plus petite. L'entreprise n'a pas dit que la version Pro serait uniquement du post-entraînement. Et l'indice est un composite, donc trois points peuvent représenter un seul benchmark. La raison de publier ce chiffre quand même est qu'il s'agit du seul précédent quantifié et confirmé par le fournisseur qui existe, et c'est bien plus que ce sur quoi repose la prévision.
Un autre détail de ce journal de modifications mérite d'être signalé plutôt que répété : les scores agentiques de Flash ont été produits en utilisant le « mode minimal Harness » de l'entreprise (à paraître prochainement) avec un effort maximal, topp=0.95, température=1.0. Le Harness qui a généré ces chiffres n'a pas été diffusé publiquement — il est entré en bêta fermée début août — de sorte que ces chiffres ne peuvent toujours pas être reproduits par quiconque en dehors de l'entreprise, même en principe, non pas parce qu'ils sont faux, mais parce que l'instrument n'est pas disponible. Attendez-vous à ce que la version Pro arrive avec le même astérisque.
Les clauses qui pourraient saper la thèse du modèle low-cost.
Enterrée dans la documentation tarifaire de l'entreprise se trouve une politique que presque aucune couverture des prix de la gamme V4 n'inclut. Selon l'entreprise, l'API « adoptera bientôt » un barème selon lequel « pendant les heures de pointe, les prix seront 2x les prix normaux, le tout applicable à tous les éléments de facturation ». Les heures de pointe sont définies comme 09h00–12h00 et 14h00–18h00, heure de Pékin, quotidiennement — sept heures par jour, tous les jours. La date d'entrée en vigueur est « sujette à l'annonce officielle », et au moment où nous écrivons, le supplément n'est pas actif.
Notez le sens. Historiquement, l'entreprise proposait des remises hors pointe sur V3 et R1 ; il s'agit ici d'une majoration de pointe du tarif standard. Si elle s'active au multiplicateur indiqué, le prix de jour du V4 Pro passe à 0,87 $ à l'entrée et 1,74 $ à la sortie, et la comparaison change de forme : l'avantage combiné de 11,7x sur Kimi K3 tombe à 5,8x, et le 13,8x mesuré tombe à 6,9x. Toujours pas cher. Ce n'est plus « 10x moins cher », et ce n'est plus bon marché aux heures où une équipe européenne ou asiatique travaille réellement.
Le 6 août, la plus grosse chaussure est tombée. DeepSeek a annoncé sur sa plateforme de développement qu'il prévoit d'augmenter la tarification globale des services API DeepSeek « dans un avenir proche, avec une augmentation significative attendue ». Aucun nouveau tarif ni date d'entrée en vigueur n'ont été publiés, et l'entreprise n'a pas précisé si cette augmentation est distincte du barème des heures de pointe ou si elle entre en vigueur en même temps que celui-ci. Les médias qui suivent l'entreprise ont interprété l'annonce comme un signe que la sortie officielle de V4 Pro est imminente — on ne tarifie pas agressivement un produit phare non encore sorti dans un régime de remises qu'on s'apprête à quitter. Quiconque construit aujourd'hui un modèle de coûts sur V4 Pro devrait modéliser les deux scénarios, et quiconque lit un titre du type « l'entreprise est 14 fois moins chère » — y compris celui-ci — devrait savoir qu'il décrit une grille tarifaire assortie d'une condition d'expiration annoncée. C'est la façon la plus probable pour la moitié « prix » de la prévision de cesser d'être vraie, et elle n'a rien à voir avec le modèle.
Comment vous saurez que la version officielle est arrivée
Il y a un détail dans la manière dont l'entreprise expédie qui importe plus que la date, et c'est un véritable risque opérationnel.
L'identifiant du modèle API est deepseek-v4-pro. Pas deepseek-v4-pro-preview, et pas une chaîne de build datée — même si le journal des modifications de l'entreprise lui-même désigne le build actuel sous le nom de V4-Pro-Preview et le build Flash publié sous le nom de V4-Flash-0731. Lorsque Flash est devenu officiel, la consigne était : « La méthode d'appel à l'API reste inchangée — il suffit de définir le nom du modèle sur deepseek-v4-flash pour utiliser la dernière version. » En d'autres termes, fixer l'identifiant du modèle ne fige pas le build. La même chaîne a silencieusement commencé à servir un ensemble de poids différent, avec un comportement sensiblement différent et dix points d'indice de plus.
Ainsi, la réponse pratique à la question « quand V4 Pro sort-il ? » est que si vous appelez deepseek-v4-pro en production, vous le découvrirez peut-être en observant vos propres sorties changer. Concrètement, voici ce qu'il faut surveiller : une nouvelle entrée datée dans le journal des modifications de l'API de l'entreprise, là où la sortie de Flash est apparue en premier ; un suffixe de build tel que V4-Pro-0731 dans le texte de cette entrée, même si l'identifiant appelable reste nu ; une réévaluation sur la page V4 Pro d'Artificial Analysis, qui est la première confirmation indépendante que vous obtiendrez ; la hausse de prix annoncée qui se concrétise dans les tarifs réels, la GA étant le moment naturel pour que cela et le calendrier des heures de pointe soient mis en place ; et l'API Responses de l'entreprise, dont la documentation indique que la prise en charge de deepseek-v4-pro est prévue pour début août — le fait que le modèle disparaisse de la liste « prévu » et apparaisse dans la liste des modèles pris en charge est à peu près le signal de sortie officiel le plus proche que l'entreprise publie. Deux signaux que nous ne pouvons pas confirmer méritent néanmoins d'être connus : la page de tarification d'un revendeur a modifié les prix du cache V4 Pro le 3 août, une évolution qui, historiquement, précède une sortie, et le harnais d'évaluation interne de l'entreprise est en bêta fermée, ce qui signifie que ses benchmarks de fournisseurs pourraient enfin devenir vérifiables lorsqu'il sera lancé. Une chaîne ressemblant à deepseek-v4-pro-202606 a également circulé comme identifiant de build divulgué ; nous n'avons pas pu la vérifier par rapport à aucune propriété de l'entreprise, et elle ne devrait avoir aucun poids tant que personne ne pourra la vérifier.
Devriez-vous construire sur l'aperçu aujourd'hui ?
Pour la plupart des personnes qui évaluent ce modèle, la date de sortie n'est pas la bonne question. L'aperçu est appelable, facturé, sous licence MIT et mesuré indépendamment à la 6e place sur 101 en intelligence. La vraie question est de savoir ce que la GA à venir fera au travail que vous construisez maintenant, et il y a deux réponses distinctes.
Si vous devez choisir entre V4 Pro et Kimi K3 en termes de capacités, les données actuelles indiquent que Kimi K3 remporte le score composite par 13 points et que V4 Pro l'emporte sur la vitesse, la latence et le coût avec des écarts considérables — et qu'une mise à niveau post-entraînement en attente pourrait réduire l'écart d'intelligence sans le combler. Si votre travail se situe à la pointe du raisonnement difficile, ces 13 points font toute la différence et le prix n'est qu'une distraction. Si votre travail est à fort volume et simplement difficile, payer 14 fois plus pour cela est difficile à justifier.
Si vous avez déjà choisi V4 Pro, le risque à gérer n'est pas la date de sortie mais le remplacement silencieux : la build derrière cet identifiant de modèle changera à votre insu, exactement comme celle de Flash, et vos évaluations devraient pouvoir le détecter. Conservez un ensemble de tests de régression que vous pouvez réexécuter à la demande, et gardez un second modèle accessible sans modification de code. C'est la raison prosaïque pour laquelle nous avons conçu le basculement de cette façon — V4 Pro, V4 Flash et Kimi K3 se trouvent tous derrière une seule clé OrcaRouter sur un endpoint compatible OpenAI, de sorte que « réexécuter l'évaluation sur les trois, puis déplacer le trafic » est une modification de configuration plutôt qu'une procédure d'approvisionnement, et qu'une mauvaise version GA est une décision de routage plutôt qu'un incident. Essayer un modèle phare non éprouvé est beaucoup plus facile lorsque revenir sur ce choix ne coûte rien.

Les questions que les gens se posent réellement
DeepSeek V4 Pro est-il sorti ou non ?
Les deux, selon ce que vous entendez, ce qui explique pourquoi les résultats de recherche sont contradictoires. Le modèle est appelable publiquement depuis l’aperçu de V4 lancé le 24 avril 2026, avec des tarifs publiés, des poids ouverts sous licence MIT et une couverture de benchmarks indépendante. Mais le journal des modifications de l’entreprise du 31 juillet 2026 indique explicitement que l’API V4 Pro est « inchangée » et que sa sortie officielle « suivra bientôt », et le 6 août, DeepSeek a de nouveau déclaré que la version officielle serait publiée dès que possible, tout en annonçant une forte augmentation du prix de l’API. Donc : disponible, pas encore officielle. Aucune date n’a été confirmée ; des rapports non confirmés évoquent la mi-août, ce qui rendrait l’attente courte.
Est-ce que la version officielle sera aussi bonne que Kimi K3 ?
D'après le seul précédent quantifié disponible, probablement pas tout à fait. Le build officiel de Flash a gagné 10 points sur l'Intelligence Index d'Artificial Analysis rien que grâce au post-entraînement ; V4 Pro est à 44 et Kimi K3 à 57, donc un gain identique aboutirait à 54. Cette extrapolation pourrait être erronée dans un sens comme dans l'autre — un modèle de 1,6T pourrait avoir une marge de progression différente de celle d'un modèle de 284B, et l'entreprise n'a pas dit que la sortie de Pro se limiterait au post-entraînement. Mais quiconque affirme la parité aujourd'hui affirme quelque chose qu'aucune mesure publiée ne soutient.
Pourquoi le modèle bon marché de DeepSeek obtient-il actuellement un score plus élevé que son modèle phare ?
En raison du séquencement des versions, et non parce que Flash est le meilleur modèle. Flash a reçu une mise à niveau post-entraînement le 31 juillet qui l'a fait passer de 40 à 50 sur l'indice ; Pro n'a pas reçu son équivalent, il est donc toujours mesuré sur le post-entraînement d'avril. L'entreprise le dit elle-même, décrivant les résultats agentiques de Flash-0731 comme « dépassant de loin V4-Pro-Preview ». L'inversion est un instantané d'un déploiement inachevé, et la sortie imminente de Pro est précisément ce qui y mettrait fin.
Le prix de 0,435 $ / 0,87 $ est-il fiable pour bâtir un modèle de coûts ?
Conditionnellement, et moins sûr qu’il ne l’était il y a une semaine. Il s’agit du prix catalogue actuellement publié par l’entreprise, et il reflète déjà une forte réduction permanente par rapport aux tarifs de lancement de V4. Mais le 6 août, DeepSeek a annoncé son intention d’augmenter globalement les prix de son API, « avec une hausse significative attendue », et aucun nouveau tarif ni aucune date n’ont encore été publiés — sans compter la politique de pointe annoncée mais inactive, qui doublerait tous les postes de facturation pendant sept heures par jour. Modélisez les deux scénarios, et notez que même dans le cas doublé, le prix reste environ 6 fois moins cher que Kimi K3.
La lecture honnête
La prévision qui a déclenché tout cela était à moitié juste, et la moitié qui était juste est celle à laquelle les gens auront le plus de mal à croire. « 10 fois moins cher » reste en deçà de la réalité : sur la même charge de travail d’évaluation mesurée, la version d’aperçu de DeepSeek V4 Pro a coûté 176,34 $ contre 2 437,41 $ pour Kimi K3, et sur l’entrée en cache, l’écart n’est pas décuple mais d’environ quatre-vingts fois. « Niveau Kimi K3 » est la partie qui n’est pas encore là — 44 contre 57 sur le seul composite qu’un laboratoire indépendant a fait tourner sur les deux, avec une extrapolation optimiste du meilleur précédent de l’entreprise aboutissant à 54.
Ce qui changerait cette lecture est précis et mérite d'être surveillé. Si la version officielle de V4 Pro arrive sous forme de mise à niveau post-entraînement et qu'Artificial Analysis lui réattribue un score supérieur à 57, la prévision se trouve pleinement justifiée et le chiffre central de cet article devient périmé. Si elle arrive en même temps que le supplément aux heures de pointe ou la hausse de prix annoncée le 6 août, l'argument du prix perd la moitié de sa force et la question intéressante devient de savoir si une remise de 6x compense un déficit de 13 points. Et si l'entreprise livre son harnais d'évaluation — déjà en bêta fermée — les benchmarks du fournisseur, qui favorisent actuellement V4 Pro en codage, deviennent vérifiables pour la première fois. Jusqu'à ce que l'un de ces événements se produise, le résumé exact de DeepSeek V4 Pro est qu'il s'agit du modèle de raisonnement sérieux au meilleur rapport qualité-prix avec des poids téléchargeables, qu'il n'est pas le plus intelligent, et que son fournisseur nous a dit qu'il n'est pas terminé.
Comparés dans cet article4
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
