Carton de titre pour « DeepSeek Harness : La baleine noire refait surface » : titre « DeepSeek Harness », sous-titre « La baleine noire refait surface — Ce que nous savons jusqu'à présent sur le concurrent de Claude Code par DeepSeek », slogan « Modèle + Harness = Agent », pastilles pour « DeepSeek V4 Flash » et « DeepSeek V4 Pro », et pied de page « Fuite / ce-que-nous-savons-jusqu'à-présent — rien n'a encore été publié ». Logo OrcaRouter incrusté en bas à droite.
Guides & Insights

DeepSeek Harness : La baleine noire fait surface — Ce que nous savons jusqu'à présent sur le concurrent de Claude Code de DeepSeek

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La version v0.1 de D​eepSeek Harness est sortie, et le premier rapport de terrain qui compte est arrivé moins d’un jour plus tard. Le 14 août, le même compte X qui avait lancé le compte à rebours de la sortie — teortaxesTex — a décrit une session qui semblait morte alors qu’elle était en réalité en train de se terminer : le flux de jetons ralentissait de façon « exponentielle » jusqu’à ramper, l’interface affichait cinq des neuf tâches terminées, et un rechargement de la page a révélé que les neuf étaient terminées. L’interface affichait un état datant d’environ cinquante minutes plus tôt. « C’est… ça que vous appelez la composabilité spatiotemporelle ? » — une pique bien envoyée, car le framework sur lequel D​eepSeek a construit cet outil a littéralement une théorie du temps. Ce post a commencé comme une enquête sur une fuite ; celle-ci s’est résolue le 13 août, lorsque D​eepSeek a open-sourcé le harness. Voici ce qui a réellement été livré, et ce que la première journée d’utilisation réelle révèle de la couche d’agents en cours de construction autour de DeepSeek V4 Flash 0731 et DeepSeek V4 Pro.

Le cadrage honnête a changé depuis la première publication de cet article. Lorsqu'il a été publié, rien nommé « D​eepSeek Harness » n'avait été livré et les preuves se résumaient à une série d'indices publics — un compte WeChat certifié, des offres d'emploi, une note de bas de page de benchmark, un appel de test interne. Ce n'est plus vrai. Le soir du 13 août, heure de Pékin, D​eepSeek a publié la v0.1 du harnais sous forme de préversion développeur sous licence MIT sur github.com/deepseek-ai/deepseek-harness, exécutable avec une seule commande npm, et le dépôt a attiré plus de 30 000 étoiles GitHub en quelques heures. La fuite est devenue un produit. Ce qui n'est pas vérifié désormais, ce n'est pas si le harnais existe, mais comment il se comporte en conditions réelles — et les premiers rapports de terrain constituent les nouvelles preuves.

Modèle + Harnais = Agent : ce qu'est réellement un « harnais »

La formule que D​eepSeek utilise en interne est Modèle + Harness = Agent. Le modèle est le cerveau ; le harness est tout le reste qui permet à un agent de fonctionner en pratique — la gestion du contexte et de la mémoire, l’appel d’outils, la planification des tâches, la lecture et l’écriture de fichiers, l’exécution en terminal, la réinjection des sorties d’erreur dans la boucle, et le fait de juger si une tâche est réellement terminée.

Le terme a été popularisé par A​nthropic et est devenu le cadre de référence de l'industrie pour expliquer pourquoi les agents de codage sont plus qu'un bon LLM. Un modèle qui obtient de bons résultats aux benchmarks peut encore échouer dans une boucle agentique si la machinerie environnante — comment il invoque des outils, comment il se souvient de ce qu'il a fait il y a dix minutes, comment il récupère quand une commande échoue — est faible. D​eepSeek a transformé cette machinerie en une stratégie produit explicite, et dans l'organigramme, c'est l'équipe Harness qui s'en charge. Les modèles sous-jacents étaient déjà en cours de déploiement : DeepSeek V4 Flash 0731 et DeepSeek V4 Pro portent tous deux des scores de benchmark ajustés pour l'agentique, que D​eepSeek a générés dans son propre harness, jusqu'au nom « D​eepSeek Harness minimal mode ».

La piste de fuite qui s'est terminée le 13 août.

Ce n'a jamais été une fuite unique ; c'était une pile d'indices publics qui s'étaient accumulés depuis mars avant de se concrétiser en une date de sortie. Dans l'ordre approximatif :

• Mars 2026 — Des reportages lient Cui Tianyi (崔添翼), diplômé en informatique de l'université du Zhejiang et ancien ingénieur chez Jane Street pendant neuf ans, aux travaux de DeepSeek sur les agents ; la presse l'identifie ensuite comme responsable de l'équipe Harness. Signalé, non confirmé par DeepSeek à l'époque.

• 24 avril 2026 — DeepSeek V4 est présenté en avant-première, explicitement positionné pour les tâches d'agent et optimisé pour les outils d'agent comme Claude Code.

• Mai 2026 — DeepSeek publie deux postes Harness sur Moka — un chef de produit Agent Harness et un ingénieur de recherche, tous deux basés à Pékin. Le chercheur de DeepSeek, Chen Deli, écrit publiquement que l'objectif est, en bref, de comparer Claude Code et de construire un "DeepSeek Code Harness."

• Juin 2026 — La campagne de recrutement se poursuit ; le responsable d'équipe décrit le département comme étant en sous-effectif, avec des « objectifs ambitieux et une charge de travail importante ».

• 6–7 juillet 2026 — Le compte WeChat « D​eepSeek Harness team » est enregistré et certifié sous l'entité pékinoise de D​eepSeek, avec un logo de baleine noire. Personne à l'extérieur ne s'en aperçoit encore.

• 31 juillet 2026 — l’API officielle de DeepSeek V4 Flash entre en bêta publique, et la documentation de l’API de D​eepSeek révèle — pour la première fois — que les tâches CodeAgent de ses benchmarks publics ont été exécutées sur « mode minimal de D​eepSeek Harness », avec la mention « à venir ».

• 1er août 2026 — Le responsable de l’équipe Harness ouvre un recrutement de tests internes destiné aux développeurs de projets open-source d’agent-harness. La presse technologique chinoise rapporte 769 candidats, 712 dépôts uniques et plus de 1,2 million d’étoiles GitHub cumulées.

• 11 août 2026 — La couverture du récit s'élargit ; la baleine noire fait surface.

• 13 août 2026 — la v0.1 est en ligne : sous licence MIT, ouverte sur GitHub, exécutable avec npx @deepseek-ai/dsh web. La piste est éclaircie.

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

Ce que v0.1 a réellement livré

L'aperçu développeur est un runtime d'agent pour bureau et CLI dans l'espace de noms des paquets Node, construit sur le méta-framework Cordis avec le principe de conception déclaré « tout est un plugin ». Les modèles, les outils, les compétences, les sessions, les bacs à sable, le stockage, la boucle d'agent, la planification et l'interface utilisateur sont tous des plugins Cordis remplaçables. Quatre préréglages sont fournis : Standard (l'ensemble complet d'outils d'agent de codage), PTC (le modèle écrit des programmes TypeScript pour coordonner des appels d'outils en plusieurs étapes), Minimal (un outil shell plus un éditeur de fichiers — le mode sur lequel les benchmarks V4 ont été exécutés), et Creation (pour construire des préréglages personnalisés). Une vue Trajectory écrit tout ce que le modèle voit dans un journal de session en ajout seul, rejouable source par source — la réponse de D​eepSeek à la critique de la « boîte noire » concernant l'historique résumé de l'agent.

La mise en garde qui compte est celle de D​eepSeek lui-même : il s'agit d'un aperçu pour développeurs, le dépôt contient un avis de test interne, et des changements cassants sont à prévoir tandis que les plugins de base et les API fondamentales évoluent. Cet avertissement s'est avéré justifié en quelques heures — et il encadre les rapports de terrain ci-dessous.

Ce que montrent les rapports du premier champ.

Le rapport qui a rassemblé cette mise à jour est le récit d'un seul utilisateur et doit être lu comme tel : teortaxesTex, le 14 août, a décrit une session D​eepSeek Harness où le streaming de jetons ralentissait progressivement jusqu'à une quasi-immobilité, l'interface affichait cinq des neuf tâches terminées, et un rechargement a révélé que les neuf étaient en réalité terminées — l'interface rendait un état datant d'environ cinquante minutes plus tôt. C'est un post X, pas une reconnaissance du fournisseur, et pas encore reproduit de manière indépendante. Mais cette classe de symptômes est corroborée par les archives publiques du projet lui-même, ce qui explique pourquoi il faut la prendre au sérieux.

La discussion GitHub n°483 du dépôt officiel, ouverte le 13 août, documente exactement cette famille de pannes. Le contenu des sessions est persisté avec un lot d'écriture différée borné : les événements restent dans une file d'attente en mémoire jusqu'à ce qu'un minuteur de 200 millisecondes déclenche une écriture durable — et l'interface n'affiche que l'état validé. Sous forte charge concurrente, la fenêtre s'étire considérablement ; après un arrêt non propre, la queue en mémoire n'est jamais vidée et le backend JSONL ou SQLite ne recharge que le préfixe validé, donc la saisie de l'utilisateur apparaît en retard ou jamais, et l'historique précédemment visible disparaît. La discussion relie cela à deux problèmes ouverts : #477 (saisie de texte utilisateur retardée pendant longtemps sous forte charge concurrente) et #479 (nouvelles demandes utilisateur n'apparaissant pas du tout dans la vue de conversation). Le « 5/9 à l'écran, 9/9 effectués » du rapport de terrain illustre cet écart entre état validé et état réel observé dans une session en direct.

Les retours sur la v0.1 au sens large sont polarisés, et c'est logique. Certains testeurs saluent l'architecture à plugins comme un « PC de bureau assemblé soi-même avec des ports universels » face à des rivaux fermés ; d'autres énumèrent les angles rugueux — un chemin multimodal codé en dur, et un bug documenté dans la politique de l'agent où le harnais force le modèle à examiner chaque code de sortie non nul, alors que le code de sortie 1 de grep pour « aucune correspondance » transforme des tests réussis en échecs apparents, entraînant une boucle de sur-validation auto-renforçante (61 requêtes contre 32, et 0,17 $ contre 0,05 $, sur la même tâche dans la comparaison rapportée). Les premiers retours ressemblent à un aperçu développeur avec une vraie ambition et de vrais problèmes de couche d'état, pas à un challenger abouti de Claude Code.

"La composabilité spatio-temporelle" n'est pas qu'une simple formule.

La blague de clôture du rapport de terrain repose sur un article. DeepSeek Harness est construit sur Cordis, dont la conception découle de « A Programming Paradigm for Spatiotemporal Composability » — une étude formelle de 88 pages co-écrite par l’Université de Pékin et DeepSeek, dont le premier auteur est Yifan Shi (créateur du framework de chatbot Koishi), avec Wei Zhang et le responsable de l’équipe Harness, Cui Tianyi. L’article décompose la composition dynamique en deux axes orthogonaux : la composabilité temporelle, où le retrait d’un composant annule proprement ses effets de bord comme s’il n’avait jamais existé, et la composabilité spatiale, où les composants déclarent des dépendances et le runtime les active et désactive de manière réactive au fur et à mesure que les fournisseurs apparaissent et disparaissent.

La blague fonctionne parce qu'un état de rendu UI datant de cinquante minutes est un échec de composition temporelle au sens le plus littéral : le runtime continuait de s'exécuter pendant que l'état visible se commettait derrière lui. L'écart de persistance documenté dans Discussion #483 — un lot en écriture différée qui peut prendre un retard considérable sur la boucle d'exécution — est précisément le genre de chose que les garanties de l'article sont censées empêcher. La question de savoir si la couche d'état du harnais honore effectivement ces garanties en pratique est l'une des questions réellement ouvertes de cette version, et les rapports du premier jour constituent la première preuve dans un sens ou dans l'autre.

Les modèles en dessous

Le harnais est le produit ; les modèles sont le moteur. Les deux modèles que D​eepSeek placera probablement dessous sont déjà en ligne, et les deux sont appelables via OrcaRouter aujourd'hui :

• DeepSeek V4 Flash 0731 — la version officielle ré-entraînée du MoE efficace de D​eepSeek (284B au total / 13B actifs), contexte de 1M de tokens, sortie maximale de 384K, mode de réflexion activé par défaut, et maîtrisant nativement l’API Responses d’O​penAI — le dialecte parlé par les agents de style Codex. Les propres chiffres publiés par D​eepSeek pour les benchmarks d’agents de la révision 0731 : 82,7 sur Terminal-Bench 2.1, 76,7 sur Cybergym, 70,3 sur Toolathlon Verified, 68,7 sur DSBench-FullStack, 59,6 sur DSBench-Hard. Ces chiffres sont déclarés par le fournisseur et non reproduits de manière indépendante, mais c’est ce que D​eepSeek a choisi de mettre en avant, et ils surpassent même DeepSeek V4 Pro Preview sur le même ensemble.

• DeepSeek V4 Pro — le MoE phare à 1,6T de paramètres au total / 49B actifs, même contexte de 1M de jetons, poids ouverts (publié en avril 2026), au prix de 0,44 $ / 0,87 $ par million de jetons.

En matière de prix, tout l'intérêt est que D​eepSeek est bon marché. DeepSeek V4 Flash 0731 coûte environ 0,147 $ par million de jetons d'entrée et 0,295 $ par million de jetons de sortie — prix catalogue du fournisseur, qu'OrcaRouter répercute sans aucune marge. Lorsque le harnais arrivera à maturité, vous pourrez le pointer vers les mêmes modèles que vous pouvez déjà appeler aujourd'hui, et le fait d'ajouter ou de retirer le harnais plus tard sera un changement de configuration, pas une migration. Vous n'avez pas besoin de D​eepSeek Harness pour exécuter l'un ou l'autre modèle dès maintenant.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

La guerre des coûts dans laquelle il s'aventure

Ce n'est pas un marché marginal. Claude Code aurait atteint un rythme de revenus annualisé dépassant 2,5 milliards de dollars début 2026, et le marché du codage agentique est estimé à quelques milliards de dollars. Un nouvel entrant issu d'un laboratoire chinois qui casse les prix sur l'API — et dont les modèles fonctionnent déjà dans Claude Code lui-même — est le genre de décision qui redéfinit les prix de toute la catégorie.

En matière de coût, le choix du harnais compte autant que le modèle. Un test horizontal de Composio exécutant DeepSeek V4 Flash sur huit harnais a révélé que le moins cher (le harnais open-source « Pi ») coûtait environ 0,028 $ d'inférence par tâche réussie, contre environ 0,195 $ pour Claude Code dans le même test — soit un écart de près de 7 fois pour la même catégorie de travail. Ajoutez la remise signalée par DeepSeek sur le cache de préfixe et les taux de succès de cache de 99,93 % rapportés par les harnais tiers avec celui-ci, et le coût effectif par tâche pour un agent propulsé par DeepSeek devient très faible très rapidement.

Il convient également de rappeler ce qui est déjà vrai aujourd'hui : D​eepSeek expose un endpoint compatible A​nthropic (URL de base https://api.deepseek.com/anthropic), et sa propre documentation explique comment pointer Claude Code vers les modèles D​eepSeek V4. Le produit harnais, c'est D​eepSeek qui tente de posséder cette couche plutôt que de la louer — et D​eepSeek a annoncé qu'une augmentation substantielle des prix sur toute la gamme V4 arrive. Comme OrcaRouter répercute les prix catalogue des fournisseurs sans aucune marge, le nouveau tarif est en ligne de notre côté le jour même de sa sortie, sans renégociation.

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

Pourquoi le harnais est le nouveau champ de bataille

Le changement va de la capacité des modèles à la livraison des tâches. Un modèle de pointe n’est plus qu’un prérequis ; ce qui détermine si une équipe déploie réellement un agent, c’est la machinerie environnante — et les données qu’elle produit. Les analystes qui interprètent la démarche de D​eepSeek, dont CITIC Securities, soutiennent qu’une infrastructure mature constitue une barrière protectrice pour deux raisons qui se cumulent : elle boucle commercialement le parcours du point d’entrée à la tâche accomplie, et elle génère des données de trajectoire de tâches à long horizon qui alimentent l’entraînement des modèles. Les infrastructures communautaires comme Pi ou D​eepSeek-TUI prouvent la demande, mais elles ne réinjectent pas ces données dans le modèle. L’infrastructure propre de D​eepSeek le ferait — et la fonctionnalité Trajectory, livrée avec la v0.1, rend visible ce chemin de données.

C'est aussi pourquoi une lecture du type « se contenter de benchmarker le modèle » est incomplète. Les scores d'agent de DeepSeek V4 Flash sont solides, mais c'est sur le harnais que DeepSeek compte bâtir l'avantage durable — ce qui rend les bugs de la couche d'état dans les rapports du premier jour plus que cosmétiques. Un harnais dont l'UI peut se retrouver cinquante minutes en retard sur la boucle reste un aperçu développeur ; ce n'est pas encore la douve.

Ce que nous regardons maintenant

• Si la couche d'état suit le rythme. Le décalage d'écriture différée (write-behind) est documenté, reproductible et fait l'objet d'un signalement auprès du dépôt officiel ; surveillez si le chemin de vidage est corrigé rapidement, et si la conception « l'interface ne montre que l'état validé » change lorsqu'une session est en cours.

• Le test de reproduction natif. La raison même pour laquelle cette version comptait est que les scores de l'agent V4 de D​eepSeek ont été générés sur "D​eepSeek Harness minimal mode" — désormais, n'importe qui peut installer l'aperçu et exécuter ces tâches nativement. Si les chiffres 82,7 / 87,9 se reproduisent, les deux dernières versions se lisent comme un système cohérent ; sinon, l'écart entre les benchmarks du fournisseur devient mesurable.

• Savoir si l’écosystème de plugins prend son essor. La surface de plugins tagués #dsh est réelle, mais reste à savoir si des tiers livreront quelque chose qui vaille la peine d’être installé.

• La liste des prix. D​eepSeek n'a rien dit sur ce que coûtera le harnais lui-même, et l'augmentation annoncée du prix de l'API V4 est l'autre grande inconnue.

• Que la « composabilité spatiotemporelle » devienne une liste de correctifs ou un slogan. L'article donne à D​eepSeek un vocabulaire rigoureux pour désigner exactement l'échec que le rapport de terrain a révélé ; le test est de savoir si la couche d'état v0.1 converge vers ces garanties.

La lecture honnête : le signal de pré-lancement le plus fort qu'ait donné D​eepSeek est désormais un vrai produit, mais une version de développement avec des défauts documentés. Ce qui est solide aujourd'hui, c'est la paire de modèles qui l'accompagne — DeepSeek V4 Flash 0731 et DeepSeek V4 Pro, tous deux disponibles sur OrcaRouter au prix catalogue du fournisseur, sans marge, et tous deux utilisables dans des boucles d'agents via une seule API standard. Lorsque le harnais arrivera à maturité, la façon de l'évaluer sans engager une voie de production sur une v0.1 consiste à router : mettre le harnais au premier plan pour l'évaluation, garder les mêmes modèles derrière un point de terminaison unique, et basculer vers une combinaison éprouvée dès qu'il cale. Cette bascule n'est qu'un changement d'une seule ligne.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement