Une carte-titre principale pour « DeepSeek V4.1 Flash vs DeepSeek V4 Flash » avec le sous-titre « Même grille tarifaire Flash. Un modèle réentraîné. », des badges en forme de pilule indiquant « SORTI LE 10 SEPTEMBRE 2026 » et « MISE À NIVEAU DE LA GAMME FLASH », et le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Flash : même grille tarifaire Flash, un modèle ré-entraîné

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La semaine où DeepSeek V4.1 Flash est passé de successeur présumé au modèle Flash de production a été courte et mouvementée. Le 8 septembre, le modèle est apparu sous la forme d'un test API de deux jours portant l'identifiant de modèle deepseek-v4.1-flash-expires-on-0910 — une version que DeepSeek lui-même a qualifiée de « version intermédiaire ». Le 9 septembre, sa plateforme ouverte a indiqué que la version officielle, DeepSeek V4.1 Flash, arriverait aux alentours du 10 septembre et qu'elle « surpasse globalement » DeepSeek V4 Pro en termes de capacités, de coût, de rapidité et de temps de bout en bout. Le 10 septembre, l'avis de sortie s'est accompagné d'une nouvelle grille tarifaire de la série Flash, entrée en vigueur à 12 h 00, heure de Pékin, que DeepSeek V4 Flash n'avait pas connue depuis une hausse des prix en août. Quoi qu'il en soit, DeepSeek V4 Flash, cheval de bataille du texte, n'est plus le moyen le plus récent d'exécuter une charge de travail Flash, et cet article explique ce que cela change concrètement pour l'application que vous exécutez aujourd'hui.

Les comparaisons aussi précoces sont déséquilibrées, et il convient de le préciser avant que les chiffres n'arrivent. DeepSeek V4 Flash dispose d'une fiche technique publiée, d'un mois de trafic de production depuis la mise à jour DeepSeek-V4-Flash-0731, de poids ouverts et de mesures indépendantes d'Artificial Analysis. DeepSeek V4.1 Flash dispose d'une annonce officielle, de deux jours de tests de vitesse communautaires, et n'a encore aucune fiche publiée, aucun rapport technique ni aucun score tiers. Les affirmations du fournisseur sont étiquetées comme telles ci-dessous ; les chiffres communautaires sont étiquetés comme mesurés par la communauté.

Le palier Flash vient de se réinitialiser — trois changements, une semaine

DeepSeek V4 Flash, le modèle à mélange d'experts de 284 milliards de paramètres (13 milliards actifs), est le choix par défaut économique et à haut débit pour une grande partie du trafic de texte en production depuis son actualisation du 31 juillet. Trois annonces en trois jours ont ébranlé le terrain sous lui :

• 8 septembre — DeepSeek a ouvert à tout compte API une version bêta de V4.1 Flash limitée dans le temps, plafonnée à 20 requêtes simultanées et prévue pour expirer le 10 septembre, sous un nom de modèle portant sa propre date d'expiration.

9 septembre — la plateforme ouverte a annoncé la sortie officielle de DeepSeek V4.1 Flash pour aux alentours du 10 septembre, décrivant une nouvelle structure de modèle avec prise en charge native du multimodal, et affirmant qu'il surpasse DeepSeek V4 Pro en termes de performances, de coût, de vitesse et de temps d'exécution total.

• Le 10 septembre — la sortie officielle apporte une nouvelle grille tarifaire de la série Flash, effective à 12h00, heure de Pékin, réduisant les tarifs que DeepSeek V4 Flash appliquait depuis une hausse du 17 août qui avait suscité de vives critiques de la part des développeurs.

Le dernier de ceux-ci mérite qu'on s'y attarde, car c'est la rare baisse de prix qui en est réellement une. Sur la nouvelle grille, l'entrée hors pointe avec cache hit passe de 0,05 ¥ à 0,02 ¥ par million de tokens — soit une réduction de 60 % — tandis que l'entrée avec cache miss passe de 1,5 ¥ à 1 ¥ et la sortie de 4,5 ¥ à 4 ¥. Les tarifs de pointe correspondent au double des tarifs hors pointe. En dollars américains arrondis, cela représente environ 0,003 $ par million de tokens en entrée avec cache hit, 0,14 $ en entrée avec cache miss et 0,56 $ en sortie, en heures creuses, le tout doublé en heures de pointe. L'écart de 24 jours entre la hausse d'août et cette baisse n'est pas un hasard de calendrier ; la réinitialisation des prix fait partie du lancement de V4.1 Flash.

Même catégorie, modèle différent

La lecture facile veut que V4.1 Flash soit un V4 Flash dont on a tourné le bouton de vitesse. Ce n'est pas le cas. Le rafraîchissement 0731 était une mise à jour post-entraînement de la base DeepSeek V4 Flash existante — même architecture, même disposition mixture-of-experts de 284B au total / 13B actifs. La description de V4.1 Flash par DeepSeek pointe vers quelque chose de plus grand : une nouvelle structure de modèle, que plusieurs médias ont interprétée comme une nouvelle phase de pré-entraînement plutôt qu'un fine-tuning. La distinction est importante, car un modèle ré-entraîné n'hérite pas du comportement de l'ancien modèle comme le fait un rafraîchissement — le prompting, l'appel d'outils et le style de sortie peuvent tous changer, même là où les capacités ne changent pas.

• Architecture — DeepSeek V4.1 Flash : nouvelle structure de modèle, décrite par DeepSeek comme une construction neuve avec entrée multimodale native. DeepSeek V4 Flash : le rafraîchissement post-entraînement V4-Flash-0731 d'un MoE de 284B au total / 13B actifs.

• Entrée — V4.1 Flash gère nativement les entrées texte et image dans le modèle de base ; DeepSeek V4 Flash est limité au texte, et les images nécessitent la version complémentaire distincte DeepSeek-V4-Flash-Vision-Exp.

• Contexte et sortie — DeepSeek V4 Flash annonce un contexte de 1M et une sortie maximale de 384K ; les documents de lancement de DeepSeek indiquent que V4.1 Flash conserve la fenêtre de contexte à l'échelle du million de tokens, mais aucune fiche officielle n'a été publiée.

• Concurrence — DeepSeek V4 Flash indique un plafond de 2 500 connexions simultanées ; la version bêta de V4.1 Flash était plafonnée à 20 et l'affirmation de DeepSeek concernant la « haute concurrence » de la version finale n'était pas encore appuyée par un chiffre publié au moment de la rédaction.

• Poids — DeepSeek V4 Flash est à poids ouverts sous licence MIT ; rien n'a été annoncé pour V4.1 Flash.

• Positionnement indépendant — DeepSeek V4 Flash a été mesuré par Artificial Analysis ; DeepSeek V4.1 Flash n'a pas encore de score tiers.

Le point texte-versus-multimodal mérite une phrase supplémentaire même dans une comparaison de textes, car il détermine à qui s'adresse V4.1 Flash. Si votre pipeline utilisait DeepSeek V4 Flash pour le texte et DeepSeek-V4-Flash-Vision-Exp pour les images, V4.1 Flash est la première version de DeepSeek qui couvre les deux chemins en un seul modèle — un seul endpoint à maintenir, sans encodeur greffé sur le côté.

A two-column comparison scoreboard titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — the scoreboard': left column DeepSeek V4.1 Flash — Architecture New pre-trained structure, Context window 1M expected (not published), Speed (output) ~280-500 tok/s (community), Multimodal input Native text + image, Price (off-peak, per 1M) Flash list from Sep 10, Open weights Not announced; right column DeepSeek V4 Flash — Architecture V4-Flash-0731, 284B/13B MoE, Context window 1M in / 384K out, Speed (output) ~120-140 tok/s (AA-measured), Multimodal input Text only; Vision-Exp bolt-on, Price (off-peak, per 1M) Flash list from Sep 10, Open weights MIT-licensed; footer 'V4.1 Flash figures vendor- and community-reported; DeepSeek V4 Flash per Artificial Analysis and DeepSeek API docs.'

Là où ils divergent vraiment : le débit et le coût d'une tâche terminée.

À prix égaux, les deux modèles se distinguent par la vitesse, et c'est là que les chiffres parlent le plus fort. Artificial Analysis mesure DeepSeek V4 Flash 0731 à environ 120 à 140 jetons de sortie par seconde sur l'API propre de DeepSeek, selon la configuration et la fenêtre de mesure. Les testeurs du premier jour de V4.1 Flash ont rapporté une génération soutenue entre environ 280 et 500 jetons par seconde selon la tâche, avec des pics au-dessus de 500 lors d'exécutions à faible concurrence ; les chiffres les plus élevés proviennent de mesures communautaires, non publiées par le fournisseur, et les jetons par seconde ne sont jamais une propriété intrinsèque d'un modèle. Néanmoins, la tendance est cohérente dans tous les rapports du premier jour, et l'affirmation de DeepSeek elle-même concernant une génération plus rapide et un temps d'exécution total plus court va dans le même sens.

Cet écart de vitesse change l'économie même avec les deux modèles au même tarif, car vous payez par jeton et les jetons arrivent plus vite. Une tâche de récupération en contexte long ou de génération de code qui prenait une minute sur V4 Flash peut se terminer en une fraction de ce temps sur V4.1 Flash au même prix par jeton — plusieurs testeurs du premier jour ont rapporté une exécution de bout en bout cinq à six fois plus rapide précisément sur ces types de tâches. Les premières plaintes de la version bêta selon lesquelles « ça dépense l'argent plus vite » étaient l'envers de la même médaille : à un prix par jeton inchangé, un modèle qui émet des jetons deux à trois fois plus vite vide un solde plus rapidement par minute. Quant à savoir si la facture par tâche diminue réellement, cela dépend de si le nouveau modèle termine avec moins de jetons et moins de nouvelles tentatives, ce qui est précisément ce que personne ne peut encore prouver.

Sur la carte des prix, les deux modèles se côtoient. Par million de jetons en heures creuses, sur la liste du 10 septembre : ¥0,02 pour l'entrée en cache hit, ¥1 pour l'entrée en cache miss et ¥4 pour la sortie, le double en pointe — la même grille qui s'appliquait au palier Flash avant la baisse était de ¥0,05, ¥1,5 et ¥4,5. Pour une charge de travail très gourmande en cache, la baisse est le point saillant : ¥0,02 contre ¥0,05, c'est une réduction de 60 % sur les jetons qui constituent l'essentiel d'un flux d'entrée d'autocomplétion ou de boucle d'agent. Pour une tâche d'ingestion de nouvelles données qui n'atteint pas le cache, l'économie est plus proche d'un tiers. Rien de tout cela ne rend V4.1 Flash moins cher par jeton que V4 Flash — ils figurent sur la même carte — mais le débit supérieur de l'architecture est l'élément différenciateur, et il ne coûte rien de plus.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the three public models — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak) and published concurrency limits.

Les reçus concernent la V4 Flash ; les revendications concernent la V4.1 Flash.

Le fait de référence le plus important concernant cette confrontation, à l’heure actuelle, est qu’il n’existe aucun benchmark pour le nouveau modèle. L’affirmation phare de DeepSeek V4.1 Flash — selon laquelle il surpasse globalement DeepSeek V4 Pro en capacités, en coût et en vitesse — émane du fournisseur lui-même et n’a pas été reproduite. Aucun nombre de paramètres, aucun tableau d’évaluation ni aucun rapport technique n’a été publié, et Artificial Analysis ne l’avait pas mesuré au moment de la rédaction. Face à une famille de modèles dont le dernier lancement phare a suscité un examen indépendant, « faites-nous confiance, il bat le Pro » est une affirmation qu’un lecteur devrait prendre avec des pincettes jusqu’à ce qu’un tiers la vérifie.

DeepSeek V4 Flash, en revanche, dispose d'un véritable historique vérifiable. Artificial Analysis compte la build de raisonnement 0731 parmi les modèles de tête de sa catégorie, la note bien au-dessus de la médiane des modèles open-weight comparables, et mesure son débit de sortie sur l'API propre de DeepSeek dans la fourchette d'environ 120 à 140 tokens par seconde citée ci-dessus. Ce sont ces chiffres qui serviront de critères d'évaluation pour V4.1 Flash lorsque son propre score arrivera, et ils placent la barre plus haut que ce que laisse entendre l'étiquette « Flash rapide et bon marché ». Le modèle que remplace la nouvelle build n'est pas faible ; c'est un véritable cheval de trait open-weight. C'est ce qui rend la décision de mise à niveau réelle plutôt que purement formelle.

Le routage fait le gros du travail — au cœur de DeepSeek, et pour vous.

L'aspect le moins couvert de ce lancement est que DeepSeek route le trafic entre ses propres modèles. Son annonce est explicite : dès que V4.1 Flash sera en service et jusqu'à la sortie de V4.1 Pro, toute requête API destinée à deepseek-v4-pro sera servie par DeepSeek V4.1 Flash et facturée au tarif du palier Flash. Les utilisateurs de V4 Pro bénéficient de la nouvelle architecture et d'une fraction du coût par jeton sans changer une ligne de code. À noter ce qui n'est pas routé : les appels deepseek-v4-flash. L'ancien modèle Flash continue de servir ceux qui pointent encore vers lui, ce qui explique exactement pourquoi cette comparaison existe — si vous êtes sur V4 Pro, la bascule se fait pour vous, et si vous êtes sur V4 Flash, c'est une décision que vous devez prendre vous-même.

Un fournisseur qui décide discrètement qu'un modèle moins cher doit prendre en charge les appels destinés à son modèle premium est un plaidoyer frappant en faveur de V4.1 Flash — et c'est aussi la même logique qu'une couche de routage applique entre les fournisseurs. C'est cette lacune qu'une plateforme comme OrcaRouter comble : une API pour plus de 200 modèles, avec les prix catalogue des fournisseurs répercutés sans marge (0 %), si bien que la baisse de prix de Flash du 10 septembre décidée par DeepSeek est en vigueur chez nous dès le même jour.DeepSeek V4 Flash sur OrcaRouter reste appelable avec la même clé que tous les autres modèles que vous exécutez, ce qui rend vraiment économique la méthode sûre pour adopter un modèle dès son lancement : dirigez une partie du trafic vers DeepSeek V4.1 Flash sur l'API propre de DeepSeek, conservez DeepSeek V4 Flash comme solution de repli automatique sur la même règle de routage, et laissez le basculement gérer les cas limites pendant que la nouvelle architecture fait ses preuves.

DeepSeek V4.1 Flash vs DeepSeek V4 Flash : lequel devriez-vous appeler ?

Si la réponse honnête était que l'un ou l'autre modèle convient à tout le monde, il n'y aurait pas d'article. Les deux correspondent désormais à des profils de risque différents, et la répartition est exceptionnellement nette.

A two-panel decision infographic titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — which should you call?': left panel 'Move to DeepSeek V4.1 Flash' with bullets Starting a new Flash workload today / Latency- or throughput-bound tasks / Needs native image input in one model / Comfortable with day-one risk; right panel 'Stay on DeepSeek V4 Flash' with bullets Serving production at high concurrency / Relies on open weights / self-hosting / Prompts and evals tuned to V4-Flash-0731 / Wants published limits and track record; footer 'No independent benchmark for V4.1 Flash yet — keep V4 Flash as the fallback.'

Passez à DeepSeek V4.1 Flash si vous lancez aujourd'hui une nouvelle charge de travail Flash, si la latence et le débit sont la contrainte limitante, si vous voulez une entrée image sans maintenir un second modèle, ou si vous acceptez de laisser le routage de DeepSeek atténuer le risque de la revendication Pro. Le modèle est disponible sur l'API propriétaire de DeepSeek sous le nom deepseek-v4.1-flash, facturé sur la même carte Flash que le modèle qu'il remplace, et tous les signaux du premier jour indiquent qu'il est nettement plus rapide.

Restez sur DeepSeek V4 Flash si vous servez du trafic de production au plafond publié de 2 500 connexions simultanées, si vous dépendez de ses poids ouverts pour l'auto-hébergement ou la conformité, ou si vos prompts, vos évaluations et votre logique d'appels d'outils ont été calibrés sur le comportement 0731 et ne peuvent pas encaisser les particularités d'un modèle ré-entraîné dès le premier jour. Une nouvelle session de pré-entraînement constitue un changement de comportement, pas seulement un changement de vitesse, et la build 0731 est la version qui dispose d'un mois de recul.

Pour la plupart des équipes, le défaut défendable est la voie du milieu : considérer DeepSeek V4.1 Flash comme le choix par défaut pour les nouvelles charges de travail, conserver DeepSeek V4 Flash comme solution de secours pour la charge de travail qui fait tourner la boutique, et laisser la première évaluation indépendante — complétée par une fiche technique publiée et un chiffre de simultanéité — trancher le débat qu'aucune version bêta de deux jours ne peut trancher. Le niveau Flash vient de recevoir un nouveau moteur ; l'ancien n'est pas obsolète, c'est la référence.

Curieux de savoir à quoi ressemble le trafic de classe Pro lorsque DeepSeek l’achemine vers V4.1 Flash au prix Flash ? DeepSeek V4 Pro sur OrcaRouter — les deux sur une même clé, facturés au prix catalogue de DeepSeek.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube