
Le modèle 3T de DeepSeek : le passage à l'échelle qui doit attendre les clusters
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Le 14 septembre, DeepSeek retirera DeepSeek V4 Pro — le modèle phare de 1 600 milliards de paramètres qu'il a mis en disponibilité générale le 13 août — et répondra à chaque appel à deepseek-v4-pro avec DeepSeek V4.1 Flash, le modèle de 552 milliards de paramètres qu'il a publié le 10 septembre. Quatre jours avant l'annonce de ce changement, un observateur pseudonyme de DeepSeek a publié un message acéré allant dans la direction opposée : le laboratoire travaillait sur un modèle de 3 000 milliards de paramètres, « probablement un autre Engram de 1 000 milliards de paramètres », et si celui-ci n'est pas encore sorti, c'est pour des raisons économiques et non de capacités.
Rien n’est confirmé à propos de ce modèle. Il n’y a pas de nom, pas de dépôt, pas de fichier de configuration, pas de benchmark, pas de fenêtre de sortie — un seul post sur X, attribué à une « bonne source », dont le détail le plus intéressant est explicitement signalé par son propre auteur comme une spéculation. Considérez-le comme un signal, pas comme un fait. Il vaut quand même la peine d’être lu, car les deux moitiés de l’affirmation tirent dans des directions opposées et une seule d’entre elles a des chances de survivre au contact de la feuille de route propre à DeepSeek.
Ce que la fuite dit réellement, et ce qu’elle ne dit pas
La publication vient du compte teortaxesTex, un observateur de DeepSeek de longue date qui se décrit comme un fan du laboratoire depuis 2023. Il se lit intégralement : « En fait, je tiens de bonne source que DeepSeek travaillait sur un modèle 3T (backbone, probablement un autre Engram de 1T de paramètres, mais ce n'est que ma spéculation). Ils n'étaient simplement pas sûrs qu'il serait économique de le post-entraîner et de le servir. Quand leurs clusters grandiront, on en verra quelques-uns... »
Quatre éléments, dans ces deux phrases, ont du poids, et l’un d’eux n’est pas un fait du tout. « Bonne autorité » n’est pas nommée. Le nombre de paramètres arrive sous la forme d’un seul chiffre, sans distinction entre le total et les actifs. La parenthèse sur Engram est qualifiée de spéculation par la personne qui spécule. Et « quand leurs clusters grandissent » est une conditionnelle à laquelle aucune date n’est attachée.
• Ce qui est affirmé — qu’un modèle DeepSeek de 3 000 milliards de paramètres existe à un certain stade de développement.
• Quelle est explicitement la propre supposition de l’auteur — à savoir qu’environ 1T de celui-ci est de la mémoire Engram.
• Ce qui est inconnu — son nom, son architecture, son nombre de paramètres actifs, sa fenêtre de contexte, l'état de son entraînement, et s'il fera l'objet d'un produit commercial.
• Qu'est-ce qui est vérifiable à l'instant — rien. Aucun dépôt DeepSeek, fiche de modèle, ligne tarifaire ou entrée de documentation n'en fait mention.
Même l’arithmétique est ambiguë. « modèle 3T (backbone, probablement un autre 1T de paramètres Engram) » autorise deux lectures : un modèle 3T dont environ 1T est de l’Engram, ou un backbone 3T avec, à côté, un autre 1T d’Engram, pour un total d’environ 4T. Cet écart est large de mille milliards de paramètres, et il fait varier la facture de serving de plus que ce que la plupart des labos dépensent pour un entraînement.
Il convient également de rappeler que le bilan de ce compte est mitigé, plutôt que de niveau oraculaire. Il a interprété l’annonce du 9 septembre de DeepSeek concernant le réacheminement du trafic de V4 Pro comme la preuve que le laboratoire avait « résolu les problèmes architecturaux de la famille V4 » — une inférence raisonnable, et qui reste une inférence. Début septembre, il a aussi avancé l’idée qu’un modèle furtif anonyme sur une plateforme de codage tierce était le MiMo-V3-Flash de Xiaomi, ce que personne n’a confirmé. Un signal précoce utile ; pas une source de référence.
La moitié intéressante, c'est la table de mémoire, pas le nombre de paramètres
Engram est bien réel, et c'est la raison pour laquelle une revendication de 3T est plus plausible qu'elle n'y paraît de prime abord. DeepSeek a publié l'architecture de mémoire conditionnelle en janvier 2026 avec du code open source associé, et elle fait quelque chose d'inhabituel : elle sépare la récupération de connaissances statiques du raisonnement dynamique. Au lieu de dépenser du calcul GPU à se rappeler des faits, le modèle hache son contexte en tables d'embeddings conservées en DRAM et effectue la récupération en temps constant, sans aucun travail GPU dans le chemin de recherche, ainsi qu'un mécanisme de filtrage qui inhibe un souvenir récupéré lorsque celui-ci entre en conflit avec le contexte environnant.
Les chiffres que DeepSeek a rapportés pour sa propre configuration de test sont ceux à retenir : une table d'embedding de 100 milliards de paramètres déchargée vers la DRAM avec une pénalité de débit inférieure à 3 %, et une précision de 97 % au test needle-in-a-haystack à 1 M de tokens, contre 84,2 % pour l'attention standard. Ce sont les chiffres du laboratoire lui-même, non reproduits par nous. Des évaluations précoces indépendantes auraient selon les rapports atteint la fourchette de 93–96 % pour la même longueur de contexte — au-dessus de la référence, en dessous de la revendication.
Multipliez cette idée par dix, et la forme de la fuite change. Si la plupart des paramètres supplémentaires d’un modèle 3T sont de la mémoire de table de hachage résidant dans la DRAM plutôt que des experts se disputant la HBM, alors « 3T » cesse d’être un indicateur de « non servable ». Le nombre total de paramètres et le coût de service se dissocient. C’est l’idée véritablement nouvelle de cette fuite, et c’est la partie que la recherche publiée étaye réellement.
Le bémol, c'est que l'article sur Engram, selon ce qui est rapporté, n'aborde pas le surcoût au moment de l'inférence — la latence et le débit —, ce qui est précisément là où une table de correspondance résidant en DRAM se manifesterait si elle devait se manifester quelque part. La mémoire qu'il faut aller chercher n'est pas de la mémoire gratuite.

Pourquoi September, de DeepSeek même, soutient le contraire
L'argument contre la sortie prochaine d'un produit 3T, c'est que DeepSeek vient de mener l'expérience à 1,6T et a répondu à sa propre question avec quelque chose de plus petit. L'échelle V4 telle qu'elle se présente aujourd'hui :
• DeepSeek-V4-Flash-0731 — 284 B de paramètres au total, 13 B actifs par token.
• DeepSeek-V4-Pro-0813 — 1,6 T au total, 49 Md actifs, poids ouverts sous licence MIT.
• DeepSeek V4.1 Flash — backbone de 552B reposant sur une conception encodeur-décodeur causal qui active 8B de paramètres par token pendant le prefill et 16B pendant le décodage.
Le 14 septembre à midi, heure de Pékin, l'échelon intermédiaire fait son apparition. DeepSeek met V4 Pro hors ligne et redirige les requêtes pour deepseek-v4-pro vers V4.1 Flash, facturées aux tarifs de Flash, jusqu'à ce qu'un V4.1 Pro existe. La page tarifaire officielle comporte aujourd'hui deux lignes, et aucune n'est le successeur du modèle retiré en termes de taille : deepseek-flash à 0,30 $ par million de tokens d'entrée et 1,20 $ par million de tokens de sortie en période de pointe, deepseek-v4-pro à 1,32 $ et 3,96 $, avec des tarifs hors pointe à la moitié de ces montants. Les deux affichent une fenêtre de contexte de 1 M de tokens et un plafond de sortie de 384 000 tokens.
La trajectoire n’a rien de subtil. Un laboratoire qui abandonne son plus grand modèle au profit d’un autre activant dix fois moins de paramètres par token a déjà conclu que l’unité économique de la capacité de pointe n’est pas le plus gros checkpoint qu’il puisse entraîner. Un modèle 3T dont le constructeur n’est pas sûr qu’il puisse être « post-entraîné et servi de manière économique » n’est pas une rumeur sur une hésitation ; cela décrit un laboratoire qui dispose désormais de données mesurées sur l’alternative.
Le post-entraînement constitue la moitié la plus aiguë de ce problème. Le post-entraînement à paramètres complets de la gamme DeepSeek-V4-Pro sur le SuperPOD CloudMatrix384 de Huawei a été rapporté par le projet tiers SLAI T-Rex à 34,22 % de MFU, soit environ 2,93 fois la recette de référence ouverte. C'est un chiffre encourageant — un chiffre de tiers, sur un modèle de 1,6 T. Doubler le backbone revient à peu près à doubler la facture avant même qu'un seul token ne soit servi.

« Lorsque leurs clusters grandissent » est toute la phrase
La clause déterminante de la fuite est la dernière, car c’est la seule partie qui dispose d’une trace documentaire publique. DeepSeek prévoirait d’installer au moins 160 000 accélérateurs Ascend 950DT de Huawei dans un nouveau centre de données à Ulanqab, en Mongolie-Intérieure, dans le cadre d’une commande évaluée à environ 2,56 milliards de dollars — l’un des plus grands clusters de silicium d’IA de fabrication chinoise que quiconque ait jamais tentés.
Les mises en garde liées à ce plan importent davantage que le titre. Les puces sont prévues pour l’inférence, pas pour l’entraînement : DeepSeek a déjà essayé d’entraîner sur du silicium Huawei et s’entraîne toujours sur des accélérateurs Nvidia, l’étape dont un modèle 3T aurait réellement besoin. La livraison pourrait prendre plus d’un an. Une capacité partielle devrait être opérationnelle entre fin 2027 et début 2028. Et c’est l’approvisionnement en mémoire à large bande passante, et non la logique, qui devrait limiter le nombre d’unités 950DT que Huawei peut fabriquer cette année.
Ainsi, l'interprétation optimiste de « quand leurs clusters s'agrandissent » place un modèle 3T sur un horizon 2027–2028 au plus tôt, et l'interprétation pessimiste — selon laquelle il restera un artefact de recherche et ne deviendra jamais un produit — est compatible avec tout ce que DeepSeek a livré en 2026. L'environnement de calcul autour du laboratoire relève lui aussi d'une politique contestée plutôt que d'une pure question d'approvisionnement : les 8 et 9 septembre, la NSA, le FBI et la CISA ont conjointement allégué que six laboratoires chinois, dont DeepSeek, avaient distillé des modèles de frontière américains à « l'échelle industrielle », une accusation que le ministère chinois du Commerce a rejetée. Quoi qu'on pense de cette allégation, une sortie qui dépend de la croissance des clusters dépend de décisions que personne au sein de DeepSeek ne contrôle.
Qu’est-ce qui transformerait cela d’une fuite en un lancement ?
La liste de contrôle est courte et précise, et aucun de ses éléments ne s'est encore déclenché :
• Un dépôt sous l’organisation deepseek-ai sur Hugging Face, avec un nom de checkpoint versionné plutôt qu’un slug de famille.
• Une nouvelle ligne sur la page Modèles et tarifs de DeepSeek.
• Une entrée datée dans le fil d’actualités de la documentation de l’API, au format newsYYMMDD habituel du labo.
• Un identifiant de modèle, pas un nom de famille — les versions de DeepSeek sont des checkpoints, et un simple slug de famille n’a jusqu’ici désigné qu’un aperçu.
Le jalon le plus proche est V4.1 Pro, qu’un membre de l’équipe DeepSeek a cité le 9 septembre comme point final de la fenêtre de routage. Il n’a ni spécifications publiées, ni nombre de paramètres, ni prix, ni date non plus. D’une certaine manière, V4.1 Pro est le test de cette fuite : si le prochain modèle phare atteint environ les 1,6 T du V4 Pro ou moins, la revendication des 3 T aura pris au moins une génération de retard.
Ce que tout cela signifie si vous choisissez un modèle cette semaine
Un modèle 3T n'est pas une décision d'achat en 2026, et la leçon pratique du mois de septembre de DeepSeek n'a pas du tout trait à l'échelle. C'est que le modèle derrière un point de terminaison peut changer alors que le nom du point de terminaison reste exactement le même. Quiconque appelle deepseek-v4-pro via une couche d'abstraction obtient, le 14 septembre, un modèle différent, plus petit et moins cher, sans toucher à son code. Quiconque se branche directement sur l'implémentation d'un seul fournisseur pour cet identifiant obtient ce que ce fournisseur décide de faire.
DeepSeek V4.1 Flash et DeepSeek V4 Pro sont tous deux disponibles sur OrcaRouter sous une seule clé, à 0 % de marge — le prix catalogue du fournisseur est répercuté tel quel, ce qui signifie que le changement de tarification du 10 septembre de DeepSeek est en vigueur ici le jour même au prix catalogue, plutôt qu'à une version majorée de celui-ci. La page du modèle indique 0,15 $ par million de tokens d'entrée et 0,60 $ par million de tokens de sortie dans la tranche heures creuses, soit le tarif heures creuses de DeepSeek lui-même, sans rien de plus. Le basculement automatique entre fournisseurs est la fonctionnalité peu glamour qui compte le plus lors d'une semaine comme celle-ci : lorsqu'un fournisseur remplace le modèle sous un point de terminaison, c'est la couche de routage qui fait que cela devient un changement de configuration plutôt qu'une migration.
Si un modèle DeepSeek 3T finit un jour par être livré, il sera servi par quiconque dispose des clusters nécessaires pour l’héberger, à un prix dicté par la puissance de calcul. C’est dans la même couche de routage que vous le rencontreriez — sans second contrat et sans rien reconstruire.

La question qui reste ouverte n'est pas de savoir si DeepSeek peut construire un modèle à 3 000 milliards de paramètres. Trois articles d'architecture publiés, une conception de mémoire de travail et un modèle 552B dont son créateur affirme qu'il surpasse son propre prédécesseur 1,6T suggèrent tous que le laboratoire sait comment faire. La question est de savoir si quelqu'un paiera pour le servir — et, à en juger par les deux dernières semaines, DeepSeek lui-même n'en est pas sûr. Surveillez le cluster, pas le nombre de paramètres. La page de tarification vous dira ce que DeepSeek livre réellement, plus vite que ne le fera n'importe quelle fuite.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
