Une carte de titre principale indiquant « DeepSeek V4.1 Flash » avec le sous-titre « Un tout nouveau modèle de base portant un numéro de version .1 », deux badges pilule indiquant « GA - 10 SEP 2026 » et « OPEN WEIGHTS - MIT », une ligne de pied de page indiquant « Architecture déclarée par le fournisseur ; aucune évaluation indépendante à ce jour », un motif de barre de compression à gauche, et le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

DeepSeek V4.1 Flash : un tout nouveau modèle de base arborant un numéro de version mineure

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

DeepSeek V4.1 Flash est sorti le 10 septembre 2026 : poids ouverts sous licence MIT, contexte d'un million de jetons, toute nouvelle architecture Causal Encoder-Decoder, et un backbone de mélange d'experts de 552 milliards de paramètres que la propre fiche de modèle de DeepSeek classe dans ce que l'entreprise appelle sa « nouvelle famille d'architectures ». C'est aussi, si le tracker qui a signalé le nom a raison, la première fois que DeepSeek appose un numéro de version .1 sur un modèle de base entièrement nouveau — une étiquette qui signale normalement un ajustement, pas une reconstruction. DeepSeek V4.1 Pro, le modèle phare que ce numéro implique désormais, n'existe toujours pas.

Ce décalage vaut plus qu'une simple querelle de nomenclature. Quiconque compare les générations de DeepSeek par numéro de version lira « V4 Flash à V4.1 Flash » comme une étape de correctif et y accordera l'attention en conséquence. L'architecture sous-jacente dit le contraire, et la décision de l'entreprise elle-même de retirer un fleuron à 1,6 billion de paramètres au profit d'un modèle Flash le dit encore plus fort.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Released 10 Sep 2026 (web, app, API), Backbone 552B-parameter MoE, Architecture Causal Encoder-Decoder, Active per token 8B prefill / 16B decode, KV cache 890 bytes per token (FP4), and Price $0.15 in / $0.60 out per 1M, with a footer reading 'Figures per DeepSeek's model card and API docs; no independent evaluation has been published.'

Ce qui a réellement été expédié le 10 septembre

Celui-ci n'est ni une fuite ni une version bêta. Le test d'API de deux jours qui a commencé le 8 septembre sous l'identifiant de modèle deepseek-v4.1-flash-expires-on-0910 s'est terminé comme son suffixe l'indiquait, et la véritable sortie est arrivée aujourd'hui sur l'application web, l'application mobile et l'API propriétaire de DeepSeek, avec les poids et un rapport technique publiés sur Hugging Face sous deepseek-ai/DeepSeek-V4.1-Flash.

Les détails pratiques comptent plus que la cérémonie :

• Nom du modèle — appelez deepseek-flash. Les anciens noms deepseek-v4-flash et deepseek-v4-flash-vision-exp sont toujours acceptés, mais ils ne correspondent plus aux modèles qu'ils désignaient auparavant : les deux sont retirés, et les requêtes qui les nomment sont servies par DeepSeek V4.1 Flash et facturées au tarif Flash.

• Ce que contient la boîte — 552B de paramètres backbone, une fenêtre de contexte de 1M de tokens, une sortie maximale de 384K, une sortie JSON, l'appel de fonctions, et un mode de réflexion activé par défaut avec des réglages d'effort faible, élevé et maximal.

• Licence — MIT, poids inclus, avec un dossier d'inférence et un module d'encodage séparé dans le dépôt. DeepSeek invite explicitement la communauté open-source à développer le support d'inférence, ce qui est le signal standard que la disponibilité dès le premier jour dans les principaux environnements d'exécution est une question de jours plutôt que de semaines.

Le .1 qui n'est pas une version mineure

L'affirmation à l'origine de cet article venait de teortaxesTex, un observateur pseudonyme mais très suivi de DeepSeek, dans un post du 10 septembre : selon lui, c'est « la première fois que DeepSeek attribue une version .1 à un tout nouveau modèle de base », que V4.1 est « plus différent de V4 que, disons, LLaMA 3 ne l'est de LLaMA 1 », et que DeepSeek « ne pense pas que cela mérite encore V5 » — sans que l'auteur du post puisse dire pourquoi.

Considérez la partie causale comme une inférence et la partie structurelle comme vérifiable. L'inférence — pourquoi DeepSeek a choisi .1 plutôt que V5 — n'est que la lecture d'un observateur, rien de plus ; personne en dehors de l'entreprise n'a expliqué cette décision, et les documents de DeepSeek eux-mêmes n'en parlent jamais. La partie vérifiable, c'est l'architecture, et elle ne ressemble pas à une version mineure. Le journal des modifications de DeepSeek décrit V4.1 Flash comme « le plus petit modèle de notre nouvelle famille d'architectures », ce qui est une phrase étrange pour une simple mise à niveau de version : une mise à niveau de version étend une famille, elle n'en fonde pas une.

L'ambiguïté a un coût réel, et il retombe sur les acheteurs, pas sur DeepSeek. Les numéros de version sont le signal le moins coûteux dont dispose un développeur pour savoir « s'agit-il d'une nouvelle génération ou d'un simple réglage, et quelle part de mon budget d'évaluation mérite-t-elle ? » DeepSeek a désormais rendu ce signal peu fiable dans une direction : un modèle qui fonde une famille d'architectures se trouve à une décimale d'un modèle qui a modifié sa recette de post-entraînement. L'entreprise garde son marqueur V5 en réserve. Tous ceux qui effectuent une évaluation de migration paient pour cette confusion.

Ce que « nouvelle architecture » signifie dans les poids

La carte modèle est inhabituellement spécifique, ce qui rend l'affirmation générationnelle facile à tester sans aucun benchmark. Quatre points ressortent.

A screenshot of the DeepSeek-V4.1-Flash model card on Hugging Face (captured September 10, 2026) showing the MIT licence tag, Image-Text-to-Text and safetensors tags, 485B parameters in the sidebar, and model-card text describing a multimodal Mixture-of-Experts with 552B backbone parameters, a Causal Encoder-Decoder architecture of a 20-layer causal encoder followed by a 20-layer decoder, activation of 8B parameters per token during prefill and 16B during decode, SWA Bounded Replay, Compressed Sparse Attention 2, and a KV cache footprint of 890 bytes per token.

— Activation asymétrique — la séparation encodeur-décodeur causal est un transformateur de 40 couches organisé en un encodeur causal de 20 couches suivi d'un décodeur de 20 couches, où le cache KV global du décodeur est projeté depuis les états cachés finaux de l'encodeur plutôt que dérivé de chaque couche du décodeur. Le but de cette conception est que le modèle n'active que 8B paramètres par jeton pendant le préremplissage et 16B pendant le décodage. Les charges de travail agentiques à forte entrée — longs documents, longues traces d'outils — obtiennent la moitié bon marché du modèle ; la génération obtient la moitié coûteuse.

• Compression du cache KV, mesurée par token — DeepSeek-V4.1-Flash utilise un cache KV principal en FP4 à 890 octets par token, ce que la fiche situe à environ un quart de celui de DeepSeek V4 Flash. La couverture chinoise est allée plus loin et a présenté la compression par rapport à la première génération du modèle V4 comme une réduction de 437× ; ce chiffre plus important provient d’un calcul fourni par le fabricant sur une base différente, il faut donc le considérer comme une affirmation plutôt qu’une mesure.

• SWA Bounded Replay — l'attention à fenêtre glissante vous oblige normalement à conserver l'état KV sur SSD pour reconstruire le contexte. Cette méthode reconstruit les états KV SWA manquants en rejouant uniquement la fenêtre la plus récente de jetons, réduisant ainsi l'empreinte KV persistante à environ un huitième de celle de DeepSeek V4 Flash.

• Compressed Sparse Attention 2 — chaque couche d'attention fonctionne dans l'un des trois modes statiques (Full, Reindex ou Reuse), partageant l'état KV et l'état de l'indexeur entre les couches, avec un indexeur hiérarchique sparse qui borne le coût des couches plus profondes indépendamment de la longueur du contexte.

Lisez ces quatre éléments ensemble et le tableau stratégique devient lisible : il s'agit d'abord d'une architecture axée sur la sparsité et l'efficacité du cache, dimensionnée de manière à ce que la même structure puisse être étendue plus tard. La mention d'une « nouvelle famille d'architectures » n'est pas anodine — c'est l'affirmation que d'autres choses sont à venir.

Les benchmarks : rapportés par le fournisseur, et pas encore contredits.

DeepSeek a publié un ensemble de benchmarks avec la sortie. Selon les propres chiffres de l'entreprise, {{1}}V4.1 Flash{{/1}} obtient 90,9 sur GPQA Diamond, un rating Codeforces de 3471, 65,6 sur MathArena Apex, 90,6 sur Terminal-Bench 2.1, 74,2 sur DeepSWE v1.1 et 63,9 sur HLE avec outils — {{2}}ce dernier chiffre étant accompagné d'une note de bas de page qui limite le score de référence de 36,8 au sous-ensemble texte pur de ce benchmark{{/2}}.

Appelons ces chiffres par leur nom. Ils sont déclarés par le fournisseur, publiés sans évaluation indépendante, et ce sont les chiffres que DeepSeek a invoqués pour justifier la mise à la retraite de son propre modèle phare — ce qui en fait les chiffres les plus dignes d'être vérifiés. Au moment du lancement du 10 septembre, Artificial Analysis n'avait pas publié de mesure de DeepSeek V4.1 Flash, et la page du modèle sur Hugging Face portait encore la mention selon laquelle le modèle « n'est déployé par aucun fournisseur d'inférence ». L'affirmation centrale de cette version — à savoir qu'un modèle de niveau Flash surclasse globalement un modèle phare de 1,6 T de paramètres en termes de performance, de coût, de vitesse et de temps de traitement total — n'est pour l'instant qu'une déclaration du fournisseur, sans audit externe.

Il y a aussi une réserve honnête de l’autre côté. Le même rapport du fournisseur indique que V4.1 Flash remporte 13 des 16 comparaisons face à Kimi K3 et 11 des 13 face à GLM-5.3, tout en restant en retrait derrière GPT-5.6 Sol et Claude Opus 5 sur les tâches plus récentes de Terminal-Bench 3.0 et 4.0, ainsi que sur ProgramBench. C’est une forme cohérente — plus fort sur le travail de codage, de terminal et d’automatisation d’agents pour lequel cette architecture est optimisée, plus faible sur les tâches de raisonnement de pointe — et c’est la forme qu’aurait un véritable saut générationnel.

Le prix, et le commutateur de routage qui mérite d'être inscrit au calendrier.

La nouvelle tarification a pris effet avec le lancement, et il s'agit de la même grille tarifaire Flash qu'auparavant, et non d'une réduction : pour deepseek-flash, l'entrée avec cache hit coûte 0,003 $ par million de jetons hors pointe et 0,006 $ en pointe, l'entrée avec cache miss 0,15 $ et 0,30 $, et la sortie 0,60 $ et 1,20 $. Le prix de pointe est exactement le double du prix hors pointe et s'applique de 01:00 à 04:00 et de 06:00 à 10:00 UTC en semaine.

La réduction s'applique plutôt au trafic Pro. DeepSeek V4 Pro est proposé à 0,022 $ et 0,044 $ en entrée avec cache hit, 0,66 $ et 1,32 $ en entrée avec cache miss, et 1,98 $ et 3,96 $ en sortie — donc router les requêtes nommées Pro vers V4.1 Flash réduit leur coût de sortie d'environ 70 % tout en, selon DeepSeek, augmentant la capacité qui y répond.

A screenshot of DeepSeek's official API Models & Pricing page (captured September 10, 2026) showing columns for deepseek-flash and deepseek-v4-pro, with model versions DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, both at 1M context length and 384K maximum output. Vision is marked supported for deepseek-flash and 'not supported' for deepseek-v4-pro. Pricing shows 1M cache-hit input tokens at $0.003 off-peak and $0.006 at peak for deepseek-flash versus $0.022 and $0.044 for deepseek-v4-pro, and 1M cache-miss input tokens at $0.15 off-peak and $0.3 at peak for deepseek-flash versus $0.66 and $1.32 for deepseek-v4-pro.

Ce réacheminement est planifié, pas hypothétique. Après 12 h 00, heure de Pékin, le 14 septembre 2026, les requêtes nommant deepseek-v4-pro iront vers V4.1 Flash et seront facturées au tarif Flash, et y resteront jusqu'à la sortie de DeepSeek V4.1 Pro. Si votre intégration code en dur le nom du modèle Pro, rien ne casse — vous obtenez un modèle différent à environ un tiers du prix de sortie, sans changement de code et sans autre avis qu'une entrée dans le journal des modifications. Si vous acheminez par niveau de capacité plutôt que par nom de modèle, le 14 septembre est la date à laquelle retester.

Ce que cela signifie si vous appelez DeepSeek aujourd'hui

OrcaRouter ne prend pas encore en charge DeepSeek V4.1 Flash — à ce jour, la page du modèle pour deepseek-v4.1-flash renvoie « model not found », et nous préférons le dire clairement plutôt que de laisser entendre le contraire. Deux choses en découlent. Premièrement, la redirection annoncée par DeepSeek est un comportement d'API propriétaire, donc le basculement du 14 septembre se produit sur le point de terminaison de DeepSeek lui-même, quelle que soit la façon dont vous l'atteignez. Deuxièmement, si vous voulez la nouvelle architecture dès aujourd'hui, vous appelez directement le fournisseur.

Ce que nous acheminons, c'est le reste de la gamme DeepSeek sur une seule clé : DeepSeek V4 Flash et DeepSeek V4 Pro, aux côtés de plus de 200 autres modèles. Le prix y est le prix catalogue du fournisseur DeepSeek, répercuté avec une marge de 0 %, ce qui est l'élément clé pour une sortie comme celle-ci — lorsqu'un fournisseur baisse un tarif, la baisse est effective de notre côté le jour même, et non après un cycle de réévaluation. Et lorsque la V4.1 Flash arrivera dans le catalogue, le demi-tarif en heures creuses ci-dessus est le tarif, et non une remise que nous négocions.

L'argument de routage pour un modèle aussi récent ne porte pas vraiment sur le prix. Il s'agit de savoir quelle part de votre chaîne de production vous engagez sur une architecture de première semaine, sans benchmark indépendant ni service d'hébergement tiers. Garder le nouveau modèle derrière un palier que vous pouvez désactiver — ou le tester sur une clé qui n'est pas votre clé de production — fait toute la différence entre une évaluation et un incident.

Qu'est-ce qui trancherait la question du nom ?

Trois choses, par ordre croissant de ce qu'elles vous apprendraient.

Une évaluation indépendante de DeepSeek V4.1 Flash permettrait de tester l'affirmation sur l'architecture à l'aide d'un harnais appartenant à un tiers. C'est la seule mesure qui transforme un tableau du fournisseur en un fait, et c'est très probablement la prochaine nouvelle à paraître.

DeepSeek V4.1 Pro mettrait à l'épreuve l'affirmation familiale. L'avis de routage le désignait comme le point de terminaison de la fenêtre Pro-to-Flash, ce qui en fait le modèle autour duquel toute cette version est structurée — et il demeure celui sur lequel DeepSeek a confirmé le moins de choses : ni fiche technique, ni nombre de paramètres, ni date, ni poids, ni prix.

Et la question utile, quoique peu reluisante : savoir si DeepSeek recommencera. Un second label .1 sur un autre nouveau modèle de base transformerait une anomalie en convention, et une convention est un élément autour duquel un développeur peut planifier. Un seul modèle n'est qu'une curiosité. Le nom ne devient trompeur de manière utile qu'une fois qu'un schéma s'établit.

Pour l'instant, la lecture pratique se sépare clairement selon qui vous êtes. Si vous êtes sur DeepSeek V4 Pro, mettez le 14 septembre au calendrier et relancez vos évaluations avant cette date, car le modèle derrière ce nom change, que vous le demandiez ou non. Si vous êtes sur DeepSeek V4 Flash, vous êtes déjà en train d'être transféré, au même prix, vers une architecture que DeepSeek a construite pour passer à l'échelle. Et si vous attendiez V5, la réponse honnête est que DeepSeek semble avoir livré la génération et refusé de la nommer — ce qui est le genre de chose qu'on ne peut faire qu'une fois avant que les gens cessent de faire confiance au numéro.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement