
DeepSeek Harness 설명: 'Model + Harness = Agent' 뒤에 있는 에이전트 런타임
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 84 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
DeepSeek Harness — dsh라고 줄여서 부르는 이 도구는 모델이 아니다. 이 도구는 DeepSeek가 2026년 8월 26일에 MIT 라이선스로 공개한 오픈소스 에이전트 런타임이며, 채택 속도 면에서 DeepSeek가 지금까지 내놓은 것 중 여전히 가장 빠른 제품이다: 언론 보도는 첫 12시간 동안 약 50,000개의 GitHub 스타를 기록했다고 전했고, 오늘 우리가 GitHub API를 확인했을 때 저장소는 242,211개의 스타와 29,059개의 포크를 기록하고 있었다. 이 도구가 실행하는 것은 DeepSeek V4.1 Flash, 즉 DeepSeek의 API가 deepseek-flash로 제공하는 모델이거나, 그쪽으로 지정할 경우 더 큰 DeepSeek V4 Pro다. 그 역할은 언어 모델과 완료된 작업 사이의 엔지니어링 계층이다: 파일 편집, 터미널 실행, 웹 검색, 컨텍스트 관리, 작업 계획, 다른 에이전트 호출. DeepSeek 자체 팀이 사용하는 공식은 모델 + 하네스 = 에이전트 — 모델은 추론하고, 하네스는 나머지 모든 것을 한다.
그 구분이 바로 이 글의 요점이다. "deepseek harness"를 검색하는 사람들은 보통 모델 리뷰를 기대하지만, 대신 출시 기사에 도착한다. 그래서 답을 먼저 말하자면: DSH는 API로 호출하는 모델이 아니다. 그것은 설치해서 실행하는 프로그램이다 — npm 패키지는 @deepseek-ai/dsh이며, 최신 태그는 이제 0.2.0-rc.2를 가리킨다 — 이 페이지가 처음 작성된 0.1.x 빌드보다 세 개의 릴리스 라인만큼 앞서 있고, 위 카드의 버전 칩보다도 앞서 있다 — 그리고 여러분이 주는 어떤 모델이든(기본값은 DeepSeek V4.1 Flash) 여러분의 파일 시스템, 터미널, 웹, 그리고 다른 에이전트에 연결해 준다. MIT 라이선스이고, Cordis라는 플러그인 프레임워크 위에 구축되었으며, 호환성을 깨뜨리는 변경을 경고하는 개발자 프리뷰임을 명시하고 있다. DeepSeek가 10월 2일에 발표한 패키징된 데스크톱 앱 — macOS와 Windows 빌드, Linux 사용자에게는 npm 패키지를 안내 — 이 그 위에 올라선 최신 표면이다. 아래에는 그것이 실제로 하는 일, 오늘 실행하는 방법, 그리고 부족한 점을 담았다.
하네스가 실제로 하는 일 (그리고 그 용어가 혼란스러운 이유)
하네스는 원시 모델이 실제 세계에서 작업을 수행할 수 있게 해주는 골격이다. 모델 단독으로는 텍스트만 생성할 수 있다. 하네스를 부여하면 파일을 읽고 쓰고, 셸에서 명령을 실행하고, 웹을 검색하고, 계획을 유지하고, 도구를 호출하고, 오류에 대응하며, 작업이 완료된 시점을 판단할 수 있다. DeepSeek의 공개 공식 — 출시 보도와 자체 채용 공고에 반복 등장하는 — 은 "Model + Harness = Agent"이다: 모델은 추론을 제공하고, 하네스는 그 밖의 모든 것을 제공한다.
이것이 이번 릴리스가 단일 제품을 넘어 중요한 이유입니다. DeepSeek는 이 하네스 내부에서 자사 최신 두 모델에 대한 자체 에이전틱 벤치마크 점수를 보고했습니다: DeepSeek V4 Flash API 문서는 Terminal-Bench 2.1 결과 82.7이 "DeepSeek Harness minimal mode"에서 생성되었다고 명시합니다. 이 하네스는 그 수치들이 나온 참조 환경이며, 이제 누구나 재현하거나 반박할 수 있도록 공개되었습니다.
모든 것이 플러그인입니다: Cordis 아키텍처
DSH의 핵심 설계(자체 README에 명시된 바와 같이)는 모든 것이 플러그인이라는 것이다. 에이전트 루프, 모델 어댑터, 도구, 스킬, 세션 저장소, 샌드박스, 스케줄링, 그리고 웹 UI까지 모두 Cordis 플러그인이다. 패치할 특권 코어가 없다. 다른 플러그인 옆에 플러그인을 마운트하여 하네스를 확장하며, 모든 등록은 플러그인이 언로드될 때 해제되는 효과(effect)다. 플러그인 엔진은 Cordis로, 베이징대학–DeepSeek 논문 "A Programming Paradigm for Spatiotemporal Composability"에 설계가 기술된 메타 프레임워크다.
실질적인 결과는 관심사의 뚜렷한 분리입니다: 플러그인은 기능을 추가하고, 프리셋은 특정 에이전트가 어떤 기능을 볼 수 있는지 결정합니다. 이제 모노레포는 packages/ 아래에 55개 패키지 — core, llm, mcp, sandbox, context, plan, goal, workspace 등 — 를 포함하고 있으며, 출시 시점 커버리지는 100개가 넘는 퍼스트파티 플러그인을 집계했고, 플러그인 스토어는 이미 확보된 상태였으며, 출시 후 24시간 이내에 GitHub에서 288개의 커뮤니티 플러그인 저장소가 수집되었습니다. 그건 6주 전의 일이었습니다. DeepSeek가 플러그인 검색성을 위해 사용하는 dsh-plugin 토픽은 이제 GitHub 검색에서 17,000개가 넘는 저장소를 반환하며, 이는 우리가 2026년 10월 2일에 확인한 내용입니다 — 하네스 자체는 릴리스 후보에 머물러 있었지만 생태계는 계속 성장했습니다.
네 가지 프리셋 — 그리고 언제 어떤 것을 사용해야 하는지
DSH는 4개의 에이전트 프리셋과 함께 제공되며, 각 프리셋은 서로 다른 플러그인 세트를 로드합니다. Web UI 자체의 프리셋 메뉴에서:
• Standard — 완전한 코딩 에이전트: 파일 편집, 셸, 파일 및 웹 검색, 스킬, 계획, 목표, 하위 에이전트, 워크플로우. 대부분의 작업에 적합한 기본 선택입니다.
• Code — 중국 언론에서 PTC("프로그래매틱 도구 호출")라고 부르는 — Standard의 모든 기능에 더해, 모델이 TypeScript 프로그램을 작성하여 하나의 프로그램에서 다단계 도구 호출을 구성할 수 있게 해주는 Code Mode SDK가 포함됩니다. 더 강력하며, 부작용과 도구 호출을 증폭시킬 수 있습니다.
• Minimal — 지속적인 bash와 str_replace_editor만 포함합니다. 벤치마크 실행을 재현하도록 제작되었으며, DeepSeek가 V4 Flash Terminal-Bench 82.7 수치에 사용한 사전 설정입니다. Minimal은 무해하지 않습니다 — 셸 접근은 여전히 셸 접근입니다.
• 크리에이터 — 네 번째 프리셋 디렉터리는 말 그대로 cordis라는 이름입니다 — Standard에 런타임 검사, 인메모리 Cordis 플러그인 실험, 프리셋 작성 기능이 더해진 환경입니다. 에이전트는 대화 중에 플러그인을 설치, 교체, 또는 제거할 수 있습니다. 프로덕션 승인 레이어가 아닌 엔지니어링 환경입니다.

어떤 것을 선택해야 할까요? 벤치마크를 재현하려면 Minimal. 에이전트가 자체적으로 다단계 오케스트레이션을 작성하게 하려면 Code. 플러그인을 구축하거나 테스트하려면 Creator. 그 외의 모든 경우에는 Standard로 시작하세요 — 광범위한 권한은 빡빡한 작업 공간과 권한 정책을 수반합니다.
궤적: 리뷰어들이 '에이전트용 DevTools'라고 부르는 기능
실사용 리뷰에서 가장 호평을 받는 기능은 Trajectory입니다. 모든 실행은 추가 전용 세션 로그에 기록됩니다. zstd로 압축된 JSONL 형식이며, 유형·순서·시간·데이터로 구성된 균일한 이벤트 봉투를 사용하여 모델이 본 모든 것(시스템 프롬프트, 추론, 도구 호출 및 결과, 서브에이전트 스케줄링, 컨텍스트 주입)을 기록합니다. Trajectory 뷰는 소스별 검사, 재개, 포크, 검색, 재생을 지원합니다. 포크가 가장 돋보입니다. 지시문 하나를 변경한 후 원본과 나란히 실행을 재생할 수 있어 추적을 버릴 필요가 없습니다.
구체적으로, 8월 15일에 발표된 실습 테스트에서 단일 파일 쓰기 작업은 61개의 세션 이벤트를 생성했고, 사소한 "PONG 응답" 작업은 첫 번째 요청에서 여전히 약 13,467개의 입력 토큰을 소비했습니다. 이는 기본 시스템 프롬프트, 도구 스키마, 자동 주입된 저장소 규칙, 스킬 요약에서 발생하는 오버헤드입니다. 그것은 모든 것을 기록하는 하네스의 정직한 비용입니다. 즉, 스캐폴딩에 대해 토큰을 지불하고, 지불한 내용을 정확히 볼 수 있습니다.

MCP, 플러그인, 그리고 다른 에이전트와 대화하기
MCP는 현재 빌드보다 과대광고가 앞서는 분야입니다. 모노레포에는 mcp 패키지가 포함되어 있고 CLI에는 dsh-mcp-client 의존성이 포함되어 있지만, 기본적으로 활성화된 MCP 서버는 없으며 아키텍처는 MCP를 일급 시민으로 취급하기보다 Cordis 플러그인을 통해 도구 통합을 라우팅합니다. MCP 서버를 도구 소스로 연결할 수는 있지만, 아직 기본 경로는 아닙니다.
더욱 놀라운 점은 서브에이전트 제공자 목록이 보여주는 내용이다. DSH는 다른 에이전트를 서브에이전트로 생성할 수 있으며, capability-seams 문서에 따르면 여기에는 Codex 제공자와 Claude Code 제공자도 포함된다. 이는 경쟁자가 취하기에는 이례적인 입장이다. DSH는 자신이 평가받는 바로 그 제품들에게 작업을 위임할 수 있는 하네스다.
플러그인 이야기가 진짜 플랫폼 승부수다. DeepSeek은 플러그인 스토어를 마련해 두었고, 커뮤니티 저장소에는 발견 가능성을 높이기 위한 태그가 붙어 있으며, 서드파티 인앱 스토어는 이미 존재한다. 0.2.0-rc.2 릴리스 노트는 분량 대부분을 플러그인 설치 안내에 할애한다 — 설치된 플러그인, 호환되지 않는 플러그인, 번들 플러그인을 구분하는 내용인데, 엔지니어링 노력이 여전히 향하는 지점이 바로 여기다. 장기적인 승부는 모델이 아니라 하네스가 생태계가 되는 것이며, 그래서 DSH를 둘러싼 가격 논의가 그 어떤 단일 기능보다 더 중요하다.
오늘 실행하는 방법
Node.js 22.19 이상이 필요합니다 — 패키지 매니페스트는 ^22.19.0 또는 >=24를 요구합니다 — 그리고 나서 하나의 명령어:
npx @deepseek-ai/dsh web
그러면 웹 UI가 시작되며, 기본적으로 http://127.0.0.1:3080에서 제공됩니다. UI에서 설정 → 모델을 열고 DeepSeek API 키를 붙여넣은 다음 워크스페이스를 선택하세요. 그렇게 하기 전까지 세션 작성기는 잠겨 있습니다. 기본 모델은 DeepSeek V4.1 Flash이고, 기본 권한 정책은 workspace-write이며 그 외 모든 작업에는 승인 프롬프트가 표시됩니다.
이제 다섯 개의 진입점이 있다: 웹 UI, 패키징된 데스크톱, 헤드리스 일회성 실행, JSON-RPC stdio를 통해 DSH를 구동하는 Python SDK, 그리고 상세 플러그인 트리를 출력하는 --dump-config(웹 프로필은 플러그인 구성 줄을 조립했고, 헤드리스는 81줄). 이번 주에 달라진 것은 데스크톱 앱이다. DeepSeek은 macOS와 Windows용 빌드를 공개했으며, 우리 노트에 Intel 빌드가 404를 낸다고 기록했던 Intel Mac도 포함됐다 — 그리고 모든 데스크톱 피드는 출시일이 01인 0.2.0-rc.2를 보고한다. 0.2 노트는 플러그인 관리를 위해 dsh CLI를 데스크톱 앱에 번들하므로, 그 경로는 더 이상 별도의 Node나 pnpm 설치가 필요 없다. DeepSeek의 자체 발표에서는 플러그인과 Workspaces가 0.2에서 기본 지원된다고 설명한다 — 릴리스 후보에 대한 벤더의 주장이지만, 앱이 CLI와 공유하는 플러그인 및 워크스페이스 저장소는 공개 저장소에서 볼 수 있다. Linux는 DeepSeek의 자체 발표가 명시한 예외다: 패키징 스크립트의 지원 대상 집합은 mac-arm64, mac-x64, win-x64이며, DeepSeek의 자체 호스트 아래에는 Linux 아티팩트가 존재하지 않고, Linux 사용자에게는 npx @deepseek-ai/dsh web을 실행하라고 안내한다. 소스에서 설치하는 경로는 변함없다: git clone, pnpm install, pnpm run build, 그다음 pnpm dsh web.
솔직한 부분: 프리뷰 수준이고, DSH가 잘못된 도구인 경우
DSH는 버전 0.2.0-rc.2입니다 — 1.0은 물론 안정적인 0.x도 아니며, npm의 29개 버전 모두와 GitHub 릴리스 24개 모두가 프리릴리스이고, README에는 분명히 나와 있습니다: "호환성을 깨뜨리는 변경 사항이 있을 예정입니다." 출시 시기의 리뷰들은 거친 부분들을 열거합니다 — Windows의 MSYS2에서의 조용한 실패, 핫 리로드 캐시의 오래됨, UI 진행 표시보다 뒤처지는 약 200ms의 일괄 영속화 지연, 그리고 공공 인프라로 포지셔닝된 저장소에서 GitHub Issues가 비활성화된 점에 대한 커뮤니티의 비판. 기본 제품 경험 역시 그것이 비교되는 세련된 코딩 에이전트들에 여전히 못 미칩니다; 한 직접 사용 리뷰는 오픈소스 릴리스가 에이전트 런타임 스캐폴드일 뿐 아직 완성된 제품은 아니라고 결론지었습니다.
DSH가 잘못된 도구가 되는 경우는 언제인가? 네 가지 상황이 있다. 첫째, 턴키 방식의 완성된 제품을 원한다면 — 오늘날의 Claude Code와 Codex가 더 완성도가 높으며, DSH는 스캐폴드를 원하고 그것을 스스로 마무리할 의향이 있는 사람들을 위한 것이다. 둘째, 실행하는 것을 감사할 수 없다면: 플러그인 출처, 구성(config) 차이, 자격 증명 경계는 모두 자체 제공되며, 프로덕션 사용에는 사용자가 제공하는 거버넌스가 필요하다. 셋째, 모델을 벤치마킹하고 있다면: 한 모델은 Standard 모드로 실행하고 다른 모델은 Minimal 모드로 실행한 다음 그 차이를 모델 결과라고 부를 수 없다 — 하네스(harness)를 변경한 것이지 모델만 변경한 것이 아니다. 넷째, 토큰 오버헤드에 비용 민감하다면: 항상 켜져 있는 컨텍스트는 모델이 실제 작업을 하기 전에 수천 개의 입력 토큰을 소모할 수 있다.
DeepSeek V4.1 Flash와 DeepSeek V4 Pro에 이것이 의미하는 바
DSH는 기본적으로 DeepSeek V4.1 Flash를 사용합니다. 즉 DeepSeek의 API가 deepseek-flash로 제공하는 모델이며, 플래그십인 DeepSeek V4 Pro 빌드(DeepSeek-V4-Pro-0813)는 이 하네스가 구동하도록 만들어진 동일한 모델 패밀리입니다. 둘 다 오늘날 평범한 API 호출로 이용할 수 있고 하네스가 필요 없으며, 둘 다 OrcaRouter에서 DeepSeek 자체 정가로 호스팅됩니다, 0% 마크업으로 그대로 전달: DeepSeek V4.1 Flash는 백만 토큰당 입력 $0.15, 출력 $0.60이고, DeepSeek V4 Pro는 $0.66/$1.98입니다. 이는 비피크 요금이며, DeepSeek은 평일 UTC 01:00~04:00과 06:00~10:00에 이 요금을 두 배로 적용합니다. 아래 스크린샷은 DeepSeek V4 Flash 0731 모델 페이지의 8월 스냅샷이고, 거기에 찍힌 $0.15/$0.29는 해당 릴리스의 가격입니다. DeepSeek의 가격 페이지는 이제 단일 Flash 항목, 즉 deepseek-flash = DeepSeek-V4.1-Flash를 $0.15/$0.60으로 표시합니다. 이 카드는 오늘의 요금이 아니라 날짜가 박힌 캡처로 읽으세요.

솔직한 경계: OrcaRouter는 모델 라우터이지 에이전트 런타임이 아니므로, 우리는 DSH를 호스팅하지 않습니다. DSH는 모델이 아닙니다. 여기서 라우터가 진정으로 해결하는 것은 DSH가 제기하는 페일오버 문제입니다. 이 하네스는 빠르게 변하는 프리뷰입니다. 오늘은 0.2.0-rc.2이고, 그 위에 올라간 데스크톱 앱은 그보다도 더 최근입니다. 여기에 프로덕션 트래픽을 보내는 것은 벤더가 보고한 에이전트 점수에 거는 것을 의미합니다. 동일한 DeepSeek 모델을 하나의 키로 라우팅 계층을 통해 실행하면 DSH의 기본 수치를 테스트하면서 자동 페일오버를 벤더 전반에 걸쳐, 계속 작동해야 하는 트래픽을 위해 유지할 수 있습니다. 실험해 볼 대상은 하네스이고, 신중하게 라우팅할 대상은 그것이 실행하는 모델입니다.
결론
DeepSeek Harness는 DeepSeek이 모델 자체 이후 오픈소스로 공개한 것 중 가장 중대한 것입니다. 왜냐하면 "DeepSeek"의 의미를 바꾸기 때문입니다: 모델뿐 아니라, 모델을 실행하는 에이전트 계층까지 포함하는 것으로요. 무엇을 해야 할지 결정하는 독자라면: 에이전트를 만든다면 이번 주에 데스크톱 앱이나 0.2.0-rc.2 명령줄을 설치하고 재현 테스트를 실행하세요 — DeepSeek이 Flash 모델용으로 공개한 Terminal-Bench 82.7은 이 하네스 안에서 나온 결과이며, 이제 직접 확인할 수 있습니다. 하지만 있는 그대로 받아들이세요: 앞으로 호환성을 깨는 변경이 예정된 개발자 프리뷰이고, 자신의 스택을 소유하는 것을 좋아하는 사람에게 보상을 주는 플러그인 시스템이며, 세련된 대안들보다 아직 거친 하네스입니다. Linux를 쓰고 있다면 패키징된 앱은 아직 당신의 경로가 아닙니다 — npm입니다. 그 아래의 모델들은 믿을 수 있는 부분이고, 그것들은 오늘 자신 있게 라우팅할 수 있습니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
