Carte héros pour l'article « DeepSeek Harness, Explained » : grand titre « DeepSeek Harness », sous-titre « Le runtime d'agent derrière Model + Harness = Agent », et trois puces indiquant « MIT open source », « 13 août 2026 », « v0.1.0-rc.6 preview ». Logo OrcaRouter incrusté en bas à droite.
Guides & Insights

DeepSeek Harness, expliqué : l'environnement d'exécution d'agent derrière « Model + Harness = Agent »

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deep​Seek Harness — dsh en abrégé — n’est pas un modèle. C’est le runtime d’agents open source que Deep​Seek a publié sous licence MIT le 13 août 2026, et c’est ce que Deep​Seek a lancé qui a été le plus rapidement adopté : la presse rapporte environ 50 000 étoiles GitHub au cours de ses 12 premières heures, et le dépôt affichait 125 922 étoiles et 12 523 forks lorsque nous avons consulté l’API GitHub aujourd’hui. Son rôle est la couche d’ingénierie entre un modèle de langage et une tâche accomplie : édition de fichiers, exécution de terminal, recherche web, gestion du contexte, planification de tâches et appel à d’autres agents. La formule utilisée par l’équipe de Deep​Seek est Modèle + Harness = Agent — le modèle raisonne, le harness fait tout le reste.

Cette distinction est le propos de cet article. Les personnes qui recherchent « deepseek harness » s'attendent généralement à une critique de modèle et atterrissent à la place sur une couverture de lancement. Voici donc la réponse d'emblée : DSH n'est pas un modèle que vous appelez via une API. C'est un programme que vous installez et exécutez — le paquet npm est @deepseek-ai/dsh, actuellement en version 0.1.0-rc.6 — et il connecte le modèle que vous lui donnez (DeepSeek V4 Flash par défaut) à votre système de fichiers, votre terminal, le web et d'autres agents. Il est sous licence MIT, construit sur un framework de plugins appelé Cordis, et c'est explicitement un aperçu pour développeurs qui prévient de changements cassants. Ci-dessous, ce qu'il fait réellement, comment l'exécuter aujourd'hui, et où il pèche.

Ce que fait réellement un harnais (et pourquoi le terme prête à confusion)

Un harnais est l'échafaudage qui permet à un modèle brut de travailler dans le monde réel. Un modèle seul ne peut que produire du texte. Donnez-lui un harnais et il peut lire et écrire des fichiers, exécuter des commandes dans votre shell, rechercher sur le web, tenir un plan, appeler des outils, réagir aux erreurs et juger quand une tâche est terminée. La formule publique de DeepSeek — répétée dans la couverture du lancement et ses propres offres d'emploi — est « Model + Harness = Agent » : le modèle fournit le raisonnement, le harnais fournit tout le reste.

C'est pourquoi cette publication compte au-delà d'un seul produit. Deep​Seek a rapporté ses propres scores de benchmark agentique pour ses deux derniers modèles à l'intérieur de ce banc d'essai : la documentation de l'API DeepSeek V4 Flash indique que son résultat Terminal-Bench 2.1 de 82.7 a été produit sur « Deep​Seek Harness minimal mode ». Le banc d'essai est l'environnement de référence d'où proviennent ces chiffres, et il est désormais public pour que quiconque puisse les reproduire — ou les contredire.

Tout est un plugin : l’architecture Cordis

La conception fondamentale de DSH, telle qu'énoncée dans son propre README, est que tout est un plugin. La boucle d'agent, les adaptateurs de modèles, les outils, les compétences, le stockage de session, le sandbox, l'ordonnancement, et même l'interface web sont tous des plugins Cordis. Il n'existe pas de noyau privilégié à corriger : vous étendez le harnais en montant un plugin à côté des autres, et chaque enregistrement est un effet qui se défait lorsque le plugin est déchargé. Le moteur de plugins est Cordis, un méta-framework dont la conception est décrite dans l'article de l'Université de Pékin–Deep​Seek « A Programming Paradigm for Spatiotemporal Composability ».

La conséquence pratique est une séparation nette des préoccupations : les plugins ajoutent des capacités ; les préréglages déterminent quelles capacités un agent donné peut voir.Le monorepo fournit 49 paquets sous packages/ — core, llm, mcp, sandbox, context, plan, goal, etc. — et le lancement recense plus de 100 plugins first-party, avec un magasin de plugins déjà réservé et 288 dépôts de plugins communautaires collectés sur GitHub dans les 24 heures suivant la sortie, découvrables sous le tag de sujet dsh-plugin.

Les quatre préréglages — et quand utiliser lequel

DSH est fourni avec quatre préréglages d'agent, chacun chargeant un ensemble de plugins différent. Depuis le menu de préréglages de l'interface Web :

Standard — un agent de codage complet : édition de fichiers, shell, recherche de fichiers et sur le web, compétences, planification, objectifs, sous-agents et flux de travail. Le choix par défaut idéal pour la plupart des travaux.

Code — appelé PTC, « programmatic tool calling », dans la presse chinoise — tout ce qui est dans Standard, plus un SDK Code Mode qui permet au modèle d'écrire des programmes TypeScript pour composer des appels d'outils multi-étapes en un seul programme. Plus puissant, et il peut multiplier les effets de bord et les appels d'outils.

Minimal — simplement un bash persistant plus str_replace_editor. Conçu pour reproduire les exécutions de benchmarks ; c'est le préréglage que Deep​Seek a utilisé pour le score de 82,7 sur V4 Flash Terminal-Bench. Minimal n'est pas inoffensif — l'accès au shell reste un accès au shell.

Creator — le quatrième répertoire de préréglages est littéralement nommé cordis — Standard plus inspection à l'exécution, expériences de plugins Cordis en mémoire et création de préréglages. L'agent peut installer, remplacer ou détruire des plugins en pleine conversation. Un environnement d'ingénierie, pas une couche d'approbation de production.

Comparison card of the four DSH agent presets: Standard (full coding agent, the default), Code/PTC (programmatic tool calling through a TypeScript Code Mode SDK), Minimal (persistent bash plus str_replace_editor, used for the V4 Flash Terminal-Bench 82.7 run), and Creator/cordis (preset and plugin authoring).

Lequel choisir ? Si vous reproduisez un benchmark, Minimal. Si vous voulez que l'agent écrive sa propre orchestration multi-étapes, Code. Si vous créez ou testez un plugin, Creator. Pour tout le reste, commencez par Standard — une large autorité implique aussi un espace de travail et une politique d'autorisations stricts.

Trajectory : la fonctionnalité que les évaluateurs appellent « DevTools pour agents ».

La fonctionnalité la plus saluée lors des prises en main est Trajectory. Chaque exécution écrit dans un journal de session en ajout seul — JSONL compressé en zstd avec une enveloppe d'événements uniforme (type, séquence, heure et données) — enregistrant tout ce que le modèle a vu : invites système, raisonnement, appels d'outils et résultats, planification des sous-agents, injections de contexte. La vue Trajectory prend en charge l'inspection par source, la reprise, le fork, la recherche et la relecture. Le fork est l'action qui se démarque : vous pouvez modifier une seule instruction et rejouer l'exécution côte à côte avec celle d'origine au lieu de jeter la trace.

Concrètement, lors d'un test pratique publié le 15 août, une seule tâche d'écriture de fichier a produit 61 événements de session, et une tâche triviale « reply PONG » a tout de même consommé environ 13 467 jetons d'entrée sur sa première requête — des frais généraux provenant des invites système par défaut, des schémas d'outils, des règles de dépôt injectées automatiquement et des résumés de compétences. C'est le coût honnête d'un harnais qui journalise tout : vous payez des jetons pour l'échafaudage, et vous pouvez voir exactement ce que vous avez payé.

Trajectory card for DeepSeek Harness: an append-only session event timeline from turn/start through tool/call to turn/end, the JSON event envelope with type, seq, time and data fields, and two statistics — 61 session events for one file-write task and about 13,467 input tokens for a trivial 'reply PONG' first request.

MCP, plugins et communication avec d'autres agents

MCP est là où l'engouement dépasse la version actuelle. Le monorepo inclut un paquet mcp et la CLI fournit une dépendance dsh-mcp-client, mais aucun serveur MCP n'est activé par défaut, et l'architecture achemine l'intégration des outils via les plugins Cordis plutôt que de traiter MCP comme un citoyen de première classe. Vous pouvez connecter des serveurs MCP comme source d'outils ; ce n'est simplement pas encore le chemin par défaut.

Ce qui est encore plus surprenant, c'est ce que montre la liste des fournisseurs de sous-agents. DSH peut engendrer d'autres agents en tant que sous-agents — y compris, selon la documentation capability-seams, un fournisseur Codex et un fournisseur Claude Code. C'est une position inhabituelle pour un concurrent : DSH est un harnais qui peut déléguer du travail aux produits mêmes par rapport auxquels il est évalué.

L'histoire du plugin est le véritable enjeu de la plateforme. Deep​Seek a réservé une boutique de plugins, les dépôts communautaires sont étiquetés pour la découvrabilité, et des boutiques tierces intégrées à l'application existent déjà. Le jeu à long terme est que le harnais, et non le modèle, devienne l'écosystème — c'est pourquoi la discussion sur la tarification autour de DSH importe plus que toute fonctionnalité individuelle.

Comment l'exécuter aujourd'hui

Vous avez besoin de Node.js 22.19 ou plus récent — le manifeste du paquet exige ^22.19.0 ou >=24 — puis une seule commande :

npx @deepseek-ai/dsh web

Ceci démarre l'interface Web, servie par défaut sur http://127.0.0.1:3080. Dans l'interface : ouvrez Paramètres → Modèles, collez une clé API DeepSeek, puis choisissez un espace de travail — le compositeur de session reste verrouillé jusqu'à ce que vous l'ayez fait. Le modèle par défaut est DeepSeek V4 Flash, et la politique d'autorisation par défaut est workspace-write avec des invites d'approbation pour tout le reste.

Il y a quatre points d'entrée au total : l'interface web, les exécutions uniques headless, un SDK Python qui pilote DSH via JSON-RPC stdio, et --dump-config, qui affiche l'arbre de plugins assemblé (le profil web assemble 129 lignes de configuration de plugins ; headless, 81). Depuis les sources, la procédure est : git clone, pnpm install, pnpm run build, puis pnpm dsh web.

La partie honnête : de niveau aperçu, et là où DSH n'est pas le bon outil

DSH est en version 0.1.0-rc.6, et le README est explicite : « IL Y AURA DES CHANGEMENTS QUI CASSENT LA COMPATIBILITÉ. » Les critiques publiées cette semaine recensent les angles rugueux — des échecs silencieux sous MSYS2 sur Windows, l’obsolescence du cache de rechargement à chaud, un délai de persistance par lots d’environ 200 ms qui retarde l’affichage de la progression dans l’interface utilisateur, et les reproches de la communauté sur le fait que GitHub Issues est désactivé sur un dépôt présenté comme une infrastructure publique. L’expérience produit par défaut reste également en retrait par rapport aux agents de codage soignés auxquels elle est comparée ; un test pratique a conclu que la version open-source est un échafaudage d’exécution d’agent, pas encore un produit fini.

Où DSH est-il le mauvais outil ? Quatre situations. Premièrement, si vous voulez un résultat clé en main — aujourd'hui, Claude Code et Codex sont plus aboutis, et DSH s'adresse à ceux qui veulent l'échafaudage et sont prêts à le terminer. Deuxièmement, si vous ne pouvez pas auditer ce que vous exécutez : la provenance des plugins, les diffs de configuration et les limites des identifiants sont tous à fournir par vos soins, et une utilisation en production exige une gouvernance que vous devez fournir. Troisièmement, si vous faites des benchmarks de modèles : vous ne pouvez pas exécuter un modèle en mode Standard et un autre en Minimal et qualifier la différence de résultat du modèle — vous avez changé le harnais, pas seulement le modèle. Quatrièmement, si le coût de la surcharge de tokens vous préoccupe : le contexte toujours actif peut consommer des milliers de tokens d'entrée avant que le modèle ne fasse un réel travail.

Ce que cela signifie pour DeepSeek V4 Flash et DeepSeek V4 Pro

Par défaut, DSH utilise DeepSeek V4 Flash, et la version phare DeepSeek V4 Pro (Deep​Seek-V4-Pro-0813) appartient à la même famille de modèles que celle pour laquelle le harnais a été conçu. Les deux sont disponibles dès aujourd'hui via des appels API classiques — aucun harnais requis — et les deux sont hébergés sur OrcaRouter au prix catalogue de Deep​Seek : environ 0,15 $ par million de jetons en entrée et 0,29 $ par million de jetons en sortie pour DeepSeek V4 Flash, et environ 0,44 $ / 0,88 $ pour DeepSeek V4 Pro, répercutés avec une marge de 0 %.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash 0731: about $0.15 input and $0.29 output per million tokens, a 1M-token context window, 384K max output, 284B total / 13B active parameters, and a Terminal-Bench 2.1 score of 82.7.

La frontière honnête : OrcaRouter est un routeur de modèles, pas un runtime d'agents, donc nous n'hébergeons pas DSH — ce n'est pas un modèle. Ce à quoi un routeur répond réellement ici, c'est le problème de basculement que DSH soulève. Le harnais est un aperçu en évolution rapide, et y diriger le trafic de production revient à parier sur les scores agentiques rapportés par les fournisseurs. Exécuter les mêmes modèles Deep​Seek via une couche de routage sur une seule clé vous permet de tester les chiffres natifs de DSH tout en conservant une bascule automatique entre les fournisseurs pour le trafic qui doit continuer à fonctionner. Le harnais est ce avec quoi il faut expérimenter ; les modèles qu'il exécute sont ce qu'il faut router avec précaution.

En résumé

{{1}}DeepSeek Harness est la chose la plus importante que DeepSeek a publiée en open source depuis les modèles eux-mêmes, car elle change ce que « DeepSeek » signifie : non seulement des modèles, mais aussi la couche d'agents qui les fait fonctionner. Pour un lecteur qui décide de la marche à suivre : si vous construisez des agents, installez-le cette semaine et exécutez le test de reproduction — les scores V4 Flash et V4 Pro publiés par DeepSeek proviennent de ce harness, et vous pouvez désormais les vérifier vous-mêmes. Mais traitez-le pour ce qu'il est : un aperçu développeur 0.1.0-rc.6 avec des changements cassants à venir, un système de plugins qui récompense ceux qui aiment contrôler leur pile technique, et un harness encore plus brut que les alternatives plus raffinées. Les modèles sous-jacents, eux, sont la partie fiable — et c'est sur ceux-là que vous pouvez vous appuyer en toute confiance dès aujourd'hui.{{/1}}

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube