Une carte-titre hero pour DeepSeek V4.1 Flash, avec le sous-titre 'Bêta API de deux jours : ce que nous savons jusqu'à présent', des pastilles libellées 'BUILD INTERMÉDIAIRE' et 'TEST API – EXPIRE LE 09-10', une ligne de pied 'Annonce officielle de sortie attendue très prochainement', et le logo OrcaRouter incrusté dans le coin inférieur droit.
Guides & Insights

DeepSeek V4.1 Flash lance une bêta API de deux jours : nouvelle architecture, multimodal natif et ambition de niveau pro.

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

DeepSeek V4.1 Flash est apparu exactement là où Deep​Seek teste les choses avant de les annoncer : dans l’API en production, sous un identifiant de modèle qui porte sa propre date d’expiration. Cet identifiant — deepseek-v4.1-flash-expires-on-0910 — a commencé à servir le 8 septembre 2026, après que l’équipe de Deep​Seek a publié un test interne en « version intermédiaire » dans ses groupes communautaires officiels, et ce suffixe 0910 résume toute l’histoire. Il s’agit d’une build placée dans l’environnement API réel pour un test limité, dont la mise hors ligne est prévue vers le 10 septembre, en amont du communiqué de lancement officiel que les informateurs signalant ce modèle attendent « très bientôt ». Ce n’est pas un lancement. Il n’y a pas de fiche de modèle, pas de rapport technique, pas d’entrée de changelog, et ce soir encore, la page publique Models & Pricing de Deep​Seek ne répertorie que DeepSeek V4 Flash, DeepSeek V4 Pro et DeepSeek-V4-Flash-Vision-Exp.

Tout ce qui suit doit être lu en gardant cet astérisque à l'esprit. Le canal officiel est ici une annonce de groupe communautaire accompagnée d'un formulaire de retour, et non une note de version. Ce qui suit est l'union de cette annonce, de la couverture des médias chinois parue dans les heures qui ont suivi, et des mesures du premier jour effectuées par des développeurs qui ont dirigé leurs propres clés vers le point d'accès — les affirmations du fournisseur et les chiffres de la communauté étant étiquetés pour ce qu'ils sont.

Ce qui s'est réellement passé aujourd'hui

Le 8 septembre vers 15 h 00 (heure de Pékin), l'équipe de Deep​Seek a informé ses groupes communautaires officiels qu'une version intermédiaire — décrite en chinois comme une 中间版本, un point de contrôle intermédiaire — était mise à disposition pour des tests limités dans l'environnement réel de l'API avant la sortie d'une version finale. Toute personne disposant d'une clé API Deep​Seek peut l'invoquer : conservez votre URL de base et votre clé existantes, et définissez le nom du modèle sur deepseek-v4.1-flash-expires-on-0910. C'est tout pour l'accès — il n'y a pas de point de terminaison distinct, pas de liste d'attente, ni de nouvelle console.

L'enveloppe pratique est étroite. Le suffixe encode le plan : la version de test « expirera automatiquement et passera hors ligne le 10 septembre », laissant environ deux jours de disponibilité. Chaque compte est plafonné à 20 requêtes simultanées — contre la limite de 2 500 requêtes simultanées que Deep​Seek publie pour deepseek-v4-flash — ce qui est un fort indice sur l'intention : cela sert aux tests fonctionnels et à l'évaluation, pas à y diriger le trafic de production.

• Ce que c'est — un point de contrôle « version intermédiaire » placé dans l'API en production pour des tests à court terme avant une version officielle.

• Où cela s’exécute — l’API propre de Deep​Seek ; URL de base et clé inchangées, nom du modèle remplacé par deepseek-v4.1-flash-expires-on-0910.

Combien de temps — le nom indique expires-on-0910 ; le test devrait être mis hors ligne vers le 10 septembre.

• Qui peut l'appeler — tout compte disposant d'une clé Deep​Seek, à raison de 20 requêtes simultanées par compte.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Model ID deepseek-v4.1-flash-expires-on-0910, Status 2-day API beta - expires 09-10, Concurrency 20 req/account (V4 Flash: 2,500), Billing same rate card as DeepSeek V4 Flash, Speed (community) ~420 tok/s peaks 500+, Native multimodal text + image (official claim), with a footer reading 'Speed is community-measured; no official benchmarks or specs published yet.'

Ce que la bêta facture : la grille tarifaire de DeepSeek V4 Flash

Deep​Seek a déclaré que le test est facturé aux mêmes tarifs que deepseek-v4-flash, et que la grille tarifaire actuelle de ce modèle est celle qui s’applique. Depuis la révision des prix du 16 août 2026, Deep​Seek applique une tarification de pointe/hors pointe ; les chiffres exacts sont ceux officiels pour le niveau Flash :

• Entrée, cache touché — 0,007 $ par million de jetons hors pointe, 0,014 $ en pointe

Entrée, échec de cache — 0,22 $ par 1M de jetons hors pointe, 0,44 $ en pointe

• Sortie — 0,66 $ par million de tokens en heures creuses, 1,32 $ en heures de pointe.

• Heures de pointe — 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi ; toutes les autres heures sont hors pointe, à la moitié du tarif de pointe.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the current public lineup — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, the off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak), and published concurrency limits of 2,500 / 500 / 2,500.

Notez ce qui n'a pas changé : le prix par jeton. L'affirmation de DeepSeek selon laquelle la V4.1 Flash est « moins chère » est donc une affirmation d'efficacité, et non une baisse de tarif — un point que plusieurs testeurs du premier jour ont appris à leurs dépens, en voyant une session de cinq minutes débiter nettement plus leur solde que le même temps réel sur DeepSeek V4 Flash, parce que le modèle consomme des jetons bien plus rapidement. Que le coût par tâche diminue réellement dépend de sa capacité à terminer le travail avec moins de jetons et moins de nouvelles tentatives, ce que personne ne peut évaluer après seulement deux jours de tests de vitesse.

Ce que « nouvelle architecture, multimodal natif » signifie — pour l'instant, non vérifié

La description officielle de Deep​Seek pour V4.1 Flash comporte quatre affirmations : {{1}}une nouvelle structure de modèle, une prise en charge multimodale native, des capacités accrues et une génération plus rapide{{/1}}. {{2}}L'affirmation concernant l'architecture est celle qui se démarque, car elle rompt un schéma établi{{/2}}. {{3}}La mise à jour précédente, DeepSeek V4 Flash 0731, était une actualisation post-entraînement qui conservait la même architecture et la même échelle que sa version d'aperçu ; la formulation de Deep​Seek ici indique un changement structurel, et plusieurs médias y ont vu un signe que le modèle avait été ré-entraîné plutôt qu'affiné{{/3}}. Au-delà de cela, tout n'est qu'inférence. {{4}}La spéculation de la communauté concernant des mécanismes d'attention modifiés, des réseaux d'experts ou un module de vision intégré est exactement cela — de la spéculation{{/4}}. {{5}}Aucun nombre de paramètres, aucune taille de fenêtre de contexte, aucun tableau de benchmarks ni aucun rapport technique n'a été publié{{/5}}.

L'expression « native multimodal » a son importance pour une raison précise. DeepSeek-V4-Flash-Vision-Exp, lancé le 21 août et dont les poids sont ouverts depuis le 31 août, a greffé un encodeur visuel sur le modèle textuel DeepSeek V4 Flash — la documentation de DeepSeek décrivait l'ensemble comme un modèle de texte accompagné d'une voie visuelle externe. V4.1 Flash est quant à lui présenté comme multimodal dès la conception, l'entrée image-texte étant traitée par le modèle de base lui-même. C'est en principe une véritable différence architecturale, mais la spécification des modalités n'a pas été publiée : ce que les testeurs ont mis à l'épreuve, c'est le texte-plus-images, et le lecteur doit considérer « multimodal » comme confirmé uniquement dans ce sens texte-image, jusqu'à la parution d'une model card. La question de savoir si un ensemble d'entrées plus large est au programme reste, à l'heure où ces lignes sont écrites, inconnue plutôt que confirmée.

La vitesse est le point principal — et c'est une mesure communautaire

Le chiffre qui circule le premier jour est d’environ 420 tokens de sortie par seconde sur des générations longues, avec des pointes rapportées au-dessus de 500 tokens/s sur des exécutions individuelles. Un test largement partagé a généré plus de 71 000 tokens en moins de trois minutes. Rien de tout cela n’est officiel : ce sont des mesures de développeurs effectuées sur l’endpoint bêta, dans des conditions non contrôlées, et Deep​Seek n’a publié aucun benchmark de vitesse qui lui soit propre. Pour donner une échelle, Artificial Analysis mesure l’endpoint public DeepSeek V4 Flash 0731 à environ 128 tokens/s, de sorte que les premiers rapports indiquent un saut de débit brut de l’ordre de trois fois ou plus — avec la réserve habituelle que le débit dépend de la longueur de l’entrée, de la concurrence et des conditions serveur.

C’est lors des comparaisons de bout en bout avec DeepSeek-V4-Flash-Vision-Exp que l’écart paraît le plus grand, car elles mesurent la même tâche l’une après l’autre. Les testeurs ont signalé une vitesse de bout en bout environ 6 fois supérieure sur une tâche de génération de code SVG, environ 5,2 fois sur une tâche de récupération en contexte long de 49 000 jetons, environ 5 fois sur une vaste tâche de génération et d’optimisation de SQL, 4,6 fois sur un problème algorithmique et 3,9 fois sur une tâche de refactorisation asynchrone. Considérez ces chiffres comme indicatifs, non précis : les mesures de bout en bout portant sur une même tâche intègrent le temps de réflexion, la latence du premier jeton et la vitesse de génération, et elles proviennent de testeurs individuels plutôt que d’une suite de tests contrôlée. La constance de la tendance à travers tous ces résultats est le signal intéressant, pas un multiplicateur pris isolément.

La question au cœur de la bêta

Le détail le plus stratégique se cache dans le formulaire de feedback que Deep​Seek a joint au test. Outre les questions sur les frameworks d’agents et les scénarios réels, il demande directement aux testeurs si la version intermédiaire DeepSeek V4.1 Flash « peut entièrement remplacer le DeepSeek V4 Pro en ligne ». C’est une question remarquable pour une entreprise à poser aux utilisateurs, car le DeepSeek V4 Pro se situe trois paliers de prix au-dessus du Flash : aux tarifs officiels actuels, le modèle Pro facture 0,66 $ pour 1 million de jetons d’entrée (en cas d’échec de cache) et 1,98 $ pour 1 million de jetons de sortie hors pointe, contre 0,22 $ et 0,66 $ pour le DeepSeek V4 Flash — soit un 3× net sur chaque ligne. Si un modèle de la gamme Flash approche réellement les capacités du niveau Pro à des prix de niveau Flash, la question apporte sa propre réponse pour une grande partie des utilisateurs, et Deep​Seek le sait.

Lu avec l’expression « nouvelle structure », le questionnaire suggère que V4.1 Flash est la première étape visible de quelque chose de plus grand qu’un simple rafraîchissement ponctuel — une gamme Flash repositionnée pour réduire l’écart avec le modèle phare, à la manière dont Deep​Seek a utilisé à plusieurs reprises un modèle moins cher et plus rapide pour réinitialiser les attentes du marché sur ce qu’un palier de prix peut offrir. Rien de tout cela n’est confirmé par un benchmark ; c’est une lecture stratégique d’une question en deux phrases. Mais c’est la chose la plus intéressante que Deep​Seek ait dite sur V4.1 Flash de toute la journée.

Où l'essayer, et quoi exécuter en production en attendant

Pendant la fenêtre de test, le seul endroit pour accéder à V4.1 Flash est l'API propre de DeepSeek — il n'existe pas d'hébergement tiers d'une version qui expire dans deux jours, et personne ne devrait connecter un chemin de production à un identifiant de modèle qui doit cesser de répondre. L'usage sensé des deux prochains jours est l'évaluation : exécutez vos charges de travail représentatives, mesurez la qualité et l'économie réelle des tokens, et considérez chaque chiffre de vitesse que vous voyez comme anecdotique jusqu'à ce qu'une version officielle apparaisse avec une fiche de modèle.

Pour un trafic qui doit rester opérationnel, la gamme publique DeepSeek est inchangée, et c’est là qu’une couche de routage justifie son existence. Sur OrcaRouter, DeepSeek V4 Flash, DeepSeek V4 Pro et DeepSeek-V4-Flash-Vision-Exp sont tous accessibles via une seule API au prix catalogue de DeepSeek, répercuté sans aucune marge — la baisse de prix d’août est donc en vigueur de notre côté depuis le jour où elle a été annoncée, et pas seulement quand une feuille de calcul de marges a bien voulu s’en charger. Quand une V4.1 Flash officielle sera finalement mise à disposition des fournisseurs, le même dispositif est le moyen de l’adopter avec un faible coût de bascule : envoyer une part du trafic vers le nouveau modèle, garder DeepSeek V4 Flash ou V4 Pro comme bascule automatique, et laisser le DSL du routeur décider quels appels méritent le modèle non éprouvé et lesquels doivent rester sur le cheval de trait. Vous n’avez pas à miser un chemin de production sur une bêta de deux jours pour savoir si elle est bonne.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash (captured September 5, 2026) showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, text input, a p50 time-to-first-token of 434 ms, and the description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context, optimized for fast everyday workloads.'

Questions ouvertes

• Quand sortira la version officielle ? Le signal qui a mis en avant ce modèle indique qu’une annonce de sortie est attendue « très bientôt » ; la durée de vie de deux jours de la bêta suggère que Deep​Seek n’a pas l’intention de faire attendre le monde longtemps.

• Est-ce que la version finale correspond à celle-ci ? Les testeurs indépendants qui suivent les cycles de test de Deep​Seek notent que l'entreprise semble exécuter plusieurs versions candidates en parallèle, et que le candidat le plus rapide lors d'un test préliminaire n'est pas toujours celui qui est publié — les chiffres de vitesse d'aujourd'hui pourraient donc ne pas décrire le modèle GA.

• Quelles sont les spécifications ? Le nombre de paramètres, les détails de l’architecture, la longueur du contexte et la liste complète des modalités d’entrée ne sont pas publiés, et ce sont les premières choses dont un vrai test a besoin.

• Le prix tient-il, et le « coût inférieur » résiste-t-il au contact avec des charges de travail réelles ? La version bêta facture aux tarifs DeepSeek V4 Flash ; un lancement pourrait apporter une nouvelle grille tarifaire, et le coût par tâche n'est pas mesuré.

• Peut-il vraiment assumer le rôle de Pro ? Le questionnaire pose la question, mais seules des évaluations indépendantes sur les suites agentiques et de raisonnement — les benchmarks qui séparent aujourd'hui le niveau Flash du niveau Pro — peuvent y répondre.

Si vous avez une clé Deep​Seek, le compte à rebours de deux jours est l'histoire à suivre : appelez deepseek-v4.1-flash-expires-on-0910 avant qu'il ne disparaisse, exécutez vos propres charges de travail, et rangez les chiffres sous « community-measured, conditions vary ». Pour tout le monde, ce qu'il faut surveiller, c'est l'article de lancement, ainsi que la question qui se cache derrière — à savoir si le niveau le moins cher de Deep​Seek vient de commencer à viser son niveau le plus onéreux.

Pendant que la bêta de deux jours se stabilise, le modèle Flash stable que vous pouvez réellement exécuter aujourd'hui n'est qu'à un appel API : DeepSeek V4 Flash sur OrcaRouter — au prix catalogue de Deep​Seek, répercuté sans aucune marge.

Et le vaisseau amiral, le questionnaire bêta, ne cesse de demander aux testeurs de comparer V4.1 Flash à : DeepSeek V4 Pro sur OrcaRouter.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement