{{1}}기사 'DeepSeek Harness, Explained'의 히어로 카드{{/1}}: {{2}}큰 헤드라인 'DeepSeek Harness'{{/2}}, {{3}}부제목 'Model + Harness = Agent 뒤의 에이전트 런타임'{{/3}}, {{4}}그리고 세 개의 칩은 'MIT 오픈소스'{{/4}}, {{5}}'2026년 8월 13일'{{/5}}, {{6}}'v0.1.0-rc.6 프리뷰'{{/6}}를 표시한다. {{7}}OrcaRouter 로고는 오른쪽 하단에 합성됨{{/7}}.
Guides & Insights

DeepSeek Harness 설명: 'Model + Harness = Agent' 뒤에 있는 에이전트 런타임

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Deep​Seek Harness(dsh로 줄여 부름)는 모델이 아닙니다. Deep​Seek가 MIT 라이선스로 2026년 8월 13일에 출시한 오픈소스 에이전트 런타임이며, 채택 속도로 보면 Deep​Seek가 지금까지 배포한 것 중 가장 빠른 것입니다. 언론 보도에 따르면 출시 첫 12시간 만에 약 50,000개의 GitHub 스타를 받았고, 오늘 GitHub API를 확인했을 때 저장소의 스타는 125,922개, 포크는 12,523개였습니다. 이 런타임의 역할은 언어 모델과 완성된 작업 사이의 엔지니어링 계층입니다. 즉 파일 편집, 터미널 실행, 웹 검색, 컨텍스트 관리, 작업 계획, 다른 에이전트 호출을 담당합니다. Deep​Seek 자체 팀이 사용하는 공식은 Model + Harness = Agent — 모델은 추론하고, Harness는 나머지 모든 것을 수행합니다.

이 구분이 이 글의 핵심입니다. "deepseek harness"를 검색하는 사람들은 대개 모델 리뷰를 기대하고, 대신 출시 보도를 접하게 됩니다. 그래서 먼저 답을 드리면, DSH는 API를 통해 호출하는 모델이 아닙니다. 설치하고 실행하는 프로그램입니다 — npm 패키지는 @deepseek-ai/dsh, 현재 0.1.0-rc.6 — 그리고 당신이 주는 어떤 모델이든(기본값은 DeepSeek V4 Flash) 파일 시스템, 터미널, 웹, 그리고 다른 에이전트에 연결합니다. MIT 라이선스이며, Cordis라는 플러그인 프레임워크로 구축되었고, 명시적으로 개발자 프리뷰로서 파괴적 변경이 있을 수 있음을 경고합니다. 아래는 그것이 실제로 무엇을 하는지, 오늘 어떻게 실행하는지, 그리고 어디가 부족한지입니다.

하네스가 실제로 하는 일 (그리고 그 용어가 혼란스러운 이유)

하네스는 원시 모델이 실제 세계에서 작업을 수행할 수 있게 해주는 골격이다. 모델 단독으로는 텍스트만 생성할 수 있다. 하네스를 부여하면 파일을 읽고 쓰고, 셸에서 명령을 실행하고, 웹을 검색하고, 계획을 유지하고, 도구를 호출하고, 오류에 대응하며, 작업이 완료된 시점을 판단할 수 있다. DeepSeek의 공개 공식 — 출시 보도와 자체 채용 공고에 반복 등장하는 — 은 "Model + Harness = Agent"이다: 모델은 추론을 제공하고, 하네스는 그 밖의 모든 것을 제공한다.

이것이 이번 릴리스가 단일 제품을 넘어 중요한 이유입니다. Deep​Seek는 이 하네스 내부에서 자사 최신 두 모델에 대한 자체 에이전틱 벤치마크 점수를 보고했습니다: DeepSeek V4 Flash API 문서는 Terminal-Bench 2.1 결과 82.7이 "Deep​Seek Harness minimal mode"에서 생성되었다고 명시합니다. 이 하네스는 그 수치들이 나온 참조 환경이며, 이제 누구나 재현하거나 반박할 수 있도록 공개되었습니다.

모든 것이 플러그인입니다: Cordis 아키텍처

DSH의 핵심 설계(자체 README에 명시된 바와 같이)는 모든 것이 플러그인이라는 것이다. 에이전트 루프, 모델 어댑터, 도구, 스킬, 세션 저장소, 샌드박스, 스케줄링, 그리고 웹 UI까지 모두 Cordis 플러그인이다. 패치할 특권 코어가 없다. 다른 플러그인 옆에 플러그인을 마운트하여 하네스를 확장하며, 모든 등록은 플러그인이 언로드될 때 해제되는 효과(effect)다. 플러그인 엔진은 Cordis로, 베이징대학–Deep​Seek 논문 "A Programming Paradigm for Spatiotemporal Composability"에 설계가 기술된 메타 프레임워크다.

실질적인 결과는 관심사의 뚜렷한 분리입니다: 플러그인은 기능을 추가하고, 프리셋은 특정 에이전트가 볼 수 있는 기능을 결정합니다.모노레포는 packages/ 아래에 core, llm, mcp, sandbox, context, plan, goal 등을 포함한 49개의 패키지를 제공하며, 출시 범위에는 100개 이상의 퍼스트파티 플러그인이 포함됩니다. 또한 플러그인 스토어는 이미 예약되어 있고, 출시 후 24시간 이내에 GitHub에서 288개의 커뮤니티 플러그인 저장소가 수집되어 dsh-plugin 토픽 태그로 검색할 수 있습니다.

네 가지 프리셋 — 그리고 언제 어떤 것을 사용해야 하는지

DSH는 4개의 에이전트 프리셋과 함께 제공되며, 각 프리셋은 서로 다른 플러그인 세트를 로드합니다. Web UI 자체의 프리셋 메뉴에서:

Standard — 완전한 코딩 에이전트: 파일 편집, 셸, 파일 및 웹 검색, 스킬, 계획, 목표, 하위 에이전트, 워크플로우. 대부분의 작업에 적합한 기본 선택입니다.

Code — 중국 언론에서 PTC("프로그래매틱 도구 호출")라고 부르는 — Standard의 모든 기능에 더해, 모델이 TypeScript 프로그램을 작성하여 하나의 프로그램에서 다단계 도구 호출을 구성할 수 있게 해주는 Code Mode SDK가 포함됩니다. 더 강력하며, 부작용과 도구 호출을 증폭시킬 수 있습니다.

Minimal — 지속적인 bash와 str_replace_editor만 포함합니다. 벤치마크 실행을 재현하도록 제작되었으며, Deep​Seek가 V4 Flash Terminal-Bench 82.7 수치에 사용한 사전 설정입니다. Minimal은 무해하지 않습니다 — 셸 접근은 여전히 셸 접근입니다.

크리에이터 — 네 번째 프리셋 디렉터리는 말 그대로 cordis라는 이름입니다 — Standard에 런타임 검사, 인메모리 Cordis 플러그인 실험, 프리셋 작성 기능이 더해진 환경입니다. 에이전트는 대화 중에 플러그인을 설치, 교체, 또는 제거할 수 있습니다. 프로덕션 승인 레이어가 아닌 엔지니어링 환경입니다.

Comparison card of the four DSH agent presets: Standard (full coding agent, the default), Code/PTC (programmatic tool calling through a TypeScript Code Mode SDK), Minimal (persistent bash plus str_replace_editor, used for the V4 Flash Terminal-Bench 82.7 run), and Creator/cordis (preset and plugin authoring).

어떤 것을 선택해야 할까요? 벤치마크를 재현하려면 Minimal. 에이전트가 자체적으로 다단계 오케스트레이션을 작성하게 하려면 Code. 플러그인을 구축하거나 테스트하려면 Creator. 그 외의 모든 경우에는 Standard로 시작하세요 — 광범위한 권한은 빡빡한 작업 공간과 권한 정책을 수반합니다.

궤적: 리뷰어들이 '에이전트용 DevTools'라고 부르는 기능

실사용 리뷰에서 가장 호평을 받는 기능은 Trajectory입니다. 모든 실행은 추가 전용 세션 로그에 기록됩니다. zstd로 압축된 JSONL 형식이며, 유형·순서·시간·데이터로 구성된 균일한 이벤트 봉투를 사용하여 모델이 본 모든 것(시스템 프롬프트, 추론, 도구 호출 및 결과, 서브에이전트 스케줄링, 컨텍스트 주입)을 기록합니다. Trajectory 뷰는 소스별 검사, 재개, 포크, 검색, 재생을 지원합니다. 포크가 가장 돋보입니다. 지시문 하나를 변경한 후 원본과 나란히 실행을 재생할 수 있어 추적을 버릴 필요가 없습니다.

구체적으로, 8월 15일에 발표된 실습 테스트에서 단일 파일 쓰기 작업은 61개의 세션 이벤트를 생성했고, 사소한 "PONG 응답" 작업은 첫 번째 요청에서 여전히 약 13,467개의 입력 토큰을 소비했습니다. 이는 기본 시스템 프롬프트, 도구 스키마, 자동 주입된 저장소 규칙, 스킬 요약에서 발생하는 오버헤드입니다. 그것은 모든 것을 기록하는 하네스의 정직한 비용입니다. 즉, 스캐폴딩에 대해 토큰을 지불하고, 지불한 내용을 정확히 볼 수 있습니다.

Trajectory card for DeepSeek Harness: an append-only session event timeline from turn/start through tool/call to turn/end, the JSON event envelope with type, seq, time and data fields, and two statistics — 61 session events for one file-write task and about 13,467 input tokens for a trivial 'reply PONG' first request.

MCP, 플러그인, 그리고 다른 에이전트와 대화하기

MCP는 현재 빌드보다 과대광고가 앞서는 분야입니다. 모노레포에는 mcp 패키지가 포함되어 있고 CLI에는 dsh-mcp-client 의존성이 포함되어 있지만, 기본적으로 활성화된 MCP 서버는 없으며 아키텍처는 MCP를 일급 시민으로 취급하기보다 Cordis 플러그인을 통해 도구 통합을 라우팅합니다. MCP 서버를 도구 소스로 연결할 수는 있지만, 아직 기본 경로는 아닙니다.

더욱 놀라운 점은 서브에이전트 제공자 목록이 보여주는 내용이다. DSH는 다른 에이전트를 서브에이전트로 생성할 수 있으며, capability-seams 문서에 따르면 여기에는 Codex 제공자와 Claude Code 제공자도 포함된다. 이는 경쟁자가 취하기에는 이례적인 입장이다. DSH는 자신이 평가받는 바로 그 제품들에게 작업을 위임할 수 있는 하네스다.

플러그인 스토리가 진짜 플랫폼 승부수다. Deep​Seek는 플러그인 스토어를 확보해 두었고, 커뮤니티 저장소는 발견 가능성을 위해 태그가 매겨져 있으며, 타사 인앱 스토어도 이미 존재한다. 장기적인 승부는 모델이 아니라 하네스가 생태계가 되는 것이다. 그래서 DSH에 대한 가격 논의가 어떤 단일 기능보다 더 중요하다.

오늘 실행하는 방법

Node.js 22.19 이상이 필요합니다 — 패키지 매니페스트는 ^22.19.0 또는 >=24를 요구합니다 — 그리고 나서 하나의 명령어:

npx @deepseek-ai/dsh web

그러면 Web UI가 시작되며, 기본적으로 http://127.0.0.1:3080 에서 제공됩니다. UI에서 Settings → Models를 열고 DeepSeek API 키를 붙여넣은 다음 작업 공간을 선택하세요. 그렇게 하기 전에는 세션 작성기가 잠겨 있습니다. 기본 모델은 DeepSeek V4 Flash이며, 기본 권한 정책은 workspace-write이고 그 외 모든 작업에는 승인 프롬프트가 표시됩니다.

총 4개의 진입점이 있습니다: Web UI, 헤드리스 일회성 실행, JSON-RPC stdio를 통해 DSH를 구동하는 Python SDK, 그리고 조립된 플러그인 트리를 출력하는 --dump-config입니다 (웹 프로필은 129줄의 플러그인 구성을 조립하고, 헤드리스는 81줄입니다). 소스에서 진행하는 경로는 git clone, pnpm install, pnpm run build, 그다음 pnpm dsh web입니다.

솔직한 부분: 프리뷰 수준이고, DSH가 잘못된 도구인 경우

DSH는 버전 0.1.0-rc.6이며, README에는 "호환성을 깨뜨리는 변경 사항이 있을 것입니다."라고 명시되어 있다. 이번 주에 게시된 리뷰들은 여러 거친 부분을 지적한다 — Windows의 MSYS2에서 오류 메시지 없이 조용히 실패하는 문제, 핫 리로드 캐시가 제때 갱신되지 않는 문제, UI 진행률 표시를 뒤처지게 만드는 약 200ms의 일괄 저장 지연, 그리고 공공 인프라를 표방하는 저장소에서 GitHub Issues가 비활성화되어 있다는 커뮤니티의 비판까지. 기본 제품 경험도 여전히 비교 대상이 되는 완성도 높은 코딩 에이전트들에 뒤처져 있다. 한 실사용 리뷰는 이 오픈소스 릴리스가 완성된 제품이 아니라 에이전트 런타임의 뼈대(스캐폴드)에 불과하다고 결론 내렸다.

DSH가 잘못된 도구가 되는 경우는 언제인가? 네 가지 상황이 있다. 첫째, 턴키 방식의 완성된 제품을 원한다면 — 오늘날의 Claude Code와 Codex가 더 완성도가 높으며, DSH는 스캐폴드를 원하고 그것을 스스로 마무리할 의향이 있는 사람들을 위한 것이다. 둘째, 실행하는 것을 감사할 수 없다면: 플러그인 출처, 구성(config) 차이, 자격 증명 경계는 모두 자체 제공되며, 프로덕션 사용에는 사용자가 제공하는 거버넌스가 필요하다. 셋째, 모델을 벤치마킹하고 있다면: 한 모델은 Standard 모드로 실행하고 다른 모델은 Minimal 모드로 실행한 다음 그 차이를 모델 결과라고 부를 수 없다 — 하네스(harness)를 변경한 것이지 모델만 변경한 것이 아니다. 넷째, 토큰 오버헤드에 비용 민감하다면: 항상 켜져 있는 컨텍스트는 모델이 실제 작업을 하기 전에 수천 개의 입력 토큰을 소모할 수 있다.

DeepSeek V4 Flash 및 DeepSeek V4 Pro에게 의미하는 바

DSH는 기본적으로 DeepSeek V4 Flash를 사용하며, 플래그십 DeepSeek V4 Pro 빌드(Deep​Seek-V4-Pro-0813)는 하네스가 실행하도록 만들어진 것과 동일한 모델 제품군입니다. 둘 다 오늘부터 일반 API 호출을 통해 이용할 수 있습니다 — 하네스가 필요 없습니다 — 그리고 둘 다 OrcaRouter에 Deep​Seek의 자체 정가로 호스팅됩니다: DeepSeek V4 Flash의 경우 입력 백만 토큰당 약 $0.15, 출력 백만 토큰당 약 $0.29, DeepSeek V4 Pro의 경우 약 $0.44/$0.88이며, 0% 마크업으로 전달됩니다.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash 0731: about $0.15 input and $0.29 output per million tokens, a 1M-token context window, 384K max output, 284B total / 13B active parameters, and a Terminal-Bench 2.1 score of 82.7.

정직한 경계: OrcaRouter는 모델 라우터이지 에이전트 런타임이 아니므로 DSH를 호스팅하지 않습니다 — 그것은 모델이 아니기 때문입니다. 라우터가 진정으로 답하는 것은 DSH가 제기하는 장애 조치 문제입니다. 이 하네스는 빠르게 변화하는 미리보기이며, 프로덕션 트래픽을 여기에 연결하는 것은 공급업체가 보고한 에이전트 점수에 베팅하는 것을 의미합니다. 동일한 Deep​Seek 모델을 하나의 키로 라우팅 계층을 통해 실행하면 계속 작동해야 하는 트래픽에 대해 공급업체 간 자동 장애 조치를 유지하면서 DSH의 고유 수치를 테스트할 수 있습니다. 하네스는 실험할 대상이고, 그것이 실행하는 모델은 신중하게 라우팅해야 할 대상입니다.

결론

Deep​Seek Harness는 Deep​Seek가 모델 자체를 공개한 이후 오픈소스로 내놓은 것 중 가장 중요한 결과물입니다. "Deep​Seek"의 의미를 바꾸기 때문입니다. 즉, 단지 모델만이 아니라 그 모델을 실행하는 에이전트 계층을 뜻하게 된 것입니다. 무엇을 해야 할지 결정하려는 독자에게: 에이전트를 구축하는 사람이라면 이번 주에 설치하고 재현 테스트를 실행하세요. Deep​Seek가 공개한 V4 Flash 및 V4 Pro 점수는 이 하네스에서 나온 것이며, 이제 직접 확인할 수 있습니다. 하지만 그것을 있는 그대로 받아들이세요: 이것은 향후 호환성을 깨는 변경이 예정된 0.1.0-rc.6 개발자 프리뷰이고, 자신의 스택을 직접 관리하기를 좋아하는 사람들에게 적합한 플러그인 시스템이며, 세련된 대안들보다 아직 거친 하네스입니다. 그 기반에 있는 모델들이야말로 신뢰할 수 있는 부분이며, 그 모델들은 오늘 당장 자신 있게 라우팅할 수 있습니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube