
DeepSeek Harness: 흑고래의 부상 — DeepSeek의 Claude Code 경쟁자에 대해 현재까지 우리가 아는 모든 것
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123지능49코딩
DeepSeek Harness v0.1이 출시되었고, 중요한 첫 현장 보고서가 하루도 채 지나지 않아 도착했습니다. 8월 14일, 출시 시계를 맞춘 바로 그 X 계정 — teortaxesTex — 은 실제로는 완료 중이었지만 죽은 것처럼 보였던 세션을 설명했습니다: 토큰 스트리밍이 "지수적으로" 느려져 거의 멈추다시피 했고, 인터페이스는 할 일 9개 중 5개가 완료된 것으로 표시했으며, 페이지를 새로고침하자 9개 모두 완료된 것이 드러났습니다. UI는 약 50분 전의 상태를 표시하고 있었습니다. "이게… 당신이 말하는 시공간 합성성인가요?" — 상당히 날카로운 지적이었습니다. DeepSeek가 이 하네스를 만든 프레임워크는 말 그대로 시간에 대한 이론을 가지고 있기 때문입니다. 이 글은 누출 경로를 추적하는 기사로 시작되었습니다. 그 경로는 8월 13일, DeepSeek가 하네스를 오픈소스로 공개하면서 해소되었습니다. 다음 내용은 실제로 출시된 것이 무엇인지, 그리고 실제 사용 첫날이 DeepSeek V4 Flash 0731과 DeepSeek V4 Pro를 중심으로 구축되는 에이전트 계층에 대해 무엇을 보여주는지입니다.
이 포스트가 처음 게재된 이후로 솔직한 프레임은 바뀌었다. 게재 당시에는 {{1}}DeepSeek Harness{{/1}}이라고 불리는 것은 출시된 적이 없었고, 증거는 공개된 단서 더미뿐이었다. 인증된 WeChat 계정, 채용 공고, 벤치마크 각주, 내부 테스트 요청이 그것이다. 이제 그 말은 더 이상 사실이 아니다. 베이징 시간 8월 13일 저녁, {{2}}DeepSeek{{/2}}은(는) 하네스 v0.1을 MIT 라이선스의 개발자 프리뷰로 {{3}}github.com/deepseek-ai/deepseek-harness{{/3}}에 공개했으며, 단일 npm 명령으로 실행할 수 있다. 저장소는 몇 시간 만에 30,000개 이상의 GitHub 스타를 받았다. 유출이 제품이 된 것이다. 이제 검증되지 않은 것은 하네스가 존재하는지가 아니라 실제 환경에서 어떻게 작동하는지이며, 초기 현장 보고가 새로운 증거가 되고 있다.
Model + Harness = Agent: '하네스'가 실제로 무엇인가
DeepSeek가 내부적으로 사용하는 공식은 Model + Harness = Agent입니다. 모델은 두뇌이고, 하니스는 에이전트가 실제로 작동하게 만드는 그 외의 모든 것 — 컨텍스트 및 메모리 관리, 도구 호출, 작업 계획, 파일 읽기 및 쓰기, 터미널 실행, 오류 출력을 루프에 다시 공급하고 작업이 실제로 완료되었는지 판단하는 것 — 입니다.
이 용어는 {{1}}Anthropic{{/1}}이 대중화시켰으며, 코딩 에이전트가 단순히 우수한 LLM을 넘어서는 이유에 대한 업계의 프레임이 되었습니다. 벤치마크에서 높은 점수를 받는 모델도 주변 메커니즘, 즉 도구를 호출하는 방식, 10분 전에 수행한 작업을 기억하는 방식, 명령이 실패했을 때 복구하는 방식이 약하면 에이전틱 루프에서 실패할 수 있습니다. {{2}}DeepSeek{{/2}}은 그 메커니즘을 명시적인 제품 전략으로 삼았으며, Harness 팀이 이를 실행하는 조직입니다. 그 기반이 되는 모델들은 이미 출시되고 있었습니다. DeepSeek V4 Flash 0731과 DeepSeek V4 Pro는 모두 {{2}}DeepSeek{{/2}}이 자체 Harness 내부에서 생성한 에이전트 튜닝 벤치마크 점수를 보유하며, 이름은 "{{2}}DeepSeek{{/2}} Harness minimal mode"에까지 이릅니다.
8월 13일에 끝난 유출 경로
이것은 결코 단 한 번의 유출이 아니었습니다. 3월부터 쌓여온 공개된 단서들의 더미였으며, 결국 출시일로 귀결된 것이었습니다. 대략적인 순서는 다음과 같습니다:
• 2026년 3월 — 보도들은 저장대학 컴퓨터과학 졸업생이자 제인 스트리트에서 9년간 근무한 전 엔지니어인 Cui Tianyi(崔添翼)를 DeepSeek의 에이전트 작업과 연결했다. 이후 언론은 그를 Harness 팀 리더로 식별했다. 보도된 내용일 뿐, 당시 DeepSeek이 확인하지 않았다.
• 2026년 4월 24일 — DeepSeek V4 프리뷰: 에이전트 작업을 위해 명시적으로 포지셔닝되었고, Claude Code와 같은 에이전트 도구에 맞게 튜닝되었습니다.
• 2026년 5월 — DeepSeek은 Moka에 두 개의 Harness 직무를 게시한다 — Agent Harness 프로덕트 매니저와 연구 엔지니어, 둘 다 베이징 기반. DeepSeek 연구원 Chen Deli는 목표가 간단히 말해 Claude Code를 벤치마킹하고 "DeepSeek Code Harness"를 구축하는 것이라고 공개적으로 밝혔다.
• 2026년 6월 — 채용 확대는 계속되고 있으며, 팀 리더는 부서가 "야심 찬 목표와 과중한 업무량"을 안고 있는 인력 부족 상태라고 설명합니다.
• 2026년 7월 6–7일 — "DeepSeek Harness team" 위챗 계정이 DeepSeek의 베이징 법인 명의로 등록 및 인증되었으며, 검은 고래 로고를 사용한다. 아직 외부에서는 아무도 눈치채지 못했다.
• 2026년 7월 31일 — DeepSeek V4 Flash의 공식 API가 공개 베타에 돌입하고, DeepSeek의 API 문서는 — 처음으로 — 공개 벤치마크의 CodeAgent 작업이 "DeepSeek Harness minimal mode"에서 실행되었으며, "coming soon"이라는 한정자가 붙었다고 공개한다.
• 2026년 8월 1일 — Harness 팀 리더가 오픈소스 에이전트 하네스(agent-harness) 프로젝트 개발자를 대상으로 내부 테스트 참가자 모집을 시작합니다. 중국 기술 언론은 지원자 769명, 고유 저장소 712개, 누적 GitHub 스타 120만 개 이상을 보도했습니다.
• 2026년 8월 11일 — 계정에 대한 보도가 널리 퍼지고, 검은 고래가 수면 위로 떠오른다.
• 2026년 8월 13일 — v0.1 출시: MIT 라이선스, GitHub 공개, 다음으로 실행 가능: npx @deepseek-ai/dsh web. 실마리가 풀렸다.

v0.1에 실제로 포함된 것
개발자 프리뷰는 Node 패키지 네임스페이스에 속한 데스크톱 및 CLI 에이전트 런타임으로, “모든 것이 플러그인”이라는 명시된 설계 원칙에 따라 Cordis 메타 프레임워크 기반으로 구축되었습니다. 모델, 도구, 스킬, 세션, 샌드박스, 스토리지, 에이전트 루프, 스케줄링, UI는 모두 교체 가능한 Cordis 플러그인입니다. 기본 제공되는 프리셋은 네 가지입니다: Standard(전체 코딩 에이전트 툴셋), PTC(모델이 TypeScript 프로그램을 작성하여 다단계 도구 호출을 조정), Minimal(셸 도구와 파일 편집기 — V4 벤치마크가 실행된 모드), Creation(사용자 지정 프리셋 구축용). Trajectory 뷰는 모델이 보는 모든 것을 소스별로 재생 가능한 append-only 세션 로그에 기록합니다 — 이는 요약된 에이전트 히스토리가 “블랙박스”라는 비판에 대한 DeepSeek의 답변입니다.
실제로 중요한 주의사항은 DeepSeek 자신이 밝힌 것이다. 이는 개발자 프리뷰이며, 저장소에는 내부 테스트 공지가 실려 있고, 핵심 플러그인과 기본 API가 진화하면서 호환성을 깨뜨리는 변경이 예상된다. 그 경고는 몇 시간 만에 타당한 것으로 드러났으며, 아래의 현장 보고서들은 바로 그 맥락에서 나온 것이다.
첫 번째 현장 보고서들이 보여주는 것
이 업데이트를 정리한 보고서는 한 사용자의 계정(기록)이며 그렇게 읽어야 한다: teortaxesTex는 8월 14일에 DeepSeek Harness 세션에 대해 설명했는데, 해당 세션에서 토큰 스트리밍이 점차 크롤링 수준으로 느려졌고, UI는 9개 할 일 중 5개가 완료된 것으로 표시했지만, 새로고침 후에는 실제로 9개 모두 완료된 것으로 드러났다 — 인터페이스는 약 50분 전의 상태를 렌더링하고 있었던 것이다. 이것은 하나의 X 게시물일 뿐, 공급업체의 확인도 아니고 아직 독립적으로 재현되지 않았다. 그러나 이 증상 유형은 프로젝트 자체의 공개 기록에서 뒷받침되며, 그것이 진지하게 받아들일 가치가 있는 이유다.
공식 저장소의 GitHub Discussion #483(8월 13일 등록)은 바로 이 실패 계열을 문서화합니다. 세션 내용은 제한된 지연 쓰기 배치(write-behind batch)로 영속화됩니다. 즉, 이벤트는 200밀리초 타이머가 내구성 있는 쓰기를 실행할 때까지 인메모리 대기 큐에 머물며, 인터페이스는 커밋된 상태만 렌더링합니다. 과부하 동시 요청 상황에서 이 창은 심하게 늘어납니다. 비정상 종료 후에는 인메모리 꼬리 부분이 결코 플러시되지 않으며, JSONL 또는 SQLite 백엔드는 커밋된 접두부만 다시 로드합니다. 따라서 사용자 입력이 늦게 나타나거나 전혀 나타나지 않고, 이전에 보이던 기록이 사라집니다. 이 논의는 이를 두 개의 열린 이슈와 연결합니다: #477(과부하 동시 요청 시 사용자 텍스트 입력이 오랫동안 지연됨) 및 #479(새 사용자 요청이 대화 보기에 전혀 나타나지 않음). 현장 보고서의 "5/9 on screen, 9/9 done"은 커밋된 상태와 실제 상태의 차이가 실시간 세션에서 드러난 것입니다.
Broader v0.1에 대한 피드백은 적절하게도 극명하게 갈린다. 일부 테스터들은 폐쇄형 경쟁 제품들과 달리 플러그인 아키텍처를 "범용 포트를 갖춘 직접 조립 데스크톱 PC"라고 칭찬하는 반면, 다른 테스터들은 거친 부분을 열거한다 — 하드코딩된 멀티모달 경로와 문서화된 에이전트 정책 버그. 이 버그는 하네스가 모델에게 모든 0이 아닌 종료 코드를 조사하도록 강제하는데, grep의 "일치 항목 없음"에 대한 종료 코드 1이 통과하는 테스트를 실패처럼 보이게 만들어 자기강화적 과잉 검증 루프를 유발한다 (보고된 비교에서 동일한 작업에 대해 요청 61회 대 32회, $0.17 대 $0.05). 출시 당일 리뷰는 진짜 야망과 진짜 상태 계층 문제를 지닌 개발자 프리뷰처럼 읽히며, 완성된 Claude Code 도전자처럼 보이지는 않는다.
"Spatiotemporal composability"은 그저 재미있는 말만은 아니다
현장 보고서의 마지막 농담 뒤에는 논문이 있다. DeepSeek Harness는 Cordis를 기반으로 구축되었으며, Cordis의 설계는 "A Programming Paradigm for Spatiotemporal Composability" — 베이징 대학과 DeepSeek이 공동 저술한 88쪽 분량의 공식 연구 — 에서 비롯되었다. 이 연구의 제1저자는 Koishi 챗봇 프레임워크의 창시자인 Yifan Shi이고, Wei Zhang과 Harness 팀 리더인 Cui Tianyi가 공동 저자로 참여했다. 이 논문은 동적 합성을 두 개의 직교 축으로 분해한다. 시간적 합성 가능성은 구성 요소를 제거하면 해당 부작용이 마치 존재한 적이 없었던 것처럼 깔끔하게 되돌려지는 것을 의미하고, 공간적 합성 가능성은 구성 요소가 의존성을 선언하면 런타임이 공급자가 나타나고 사라짐에 따라 이를 반응적으로 활성화하고 비활성화하는 것을 의미한다.
그 농담이 성립하는 이유는 50분 전의 UI 렌더링 상태가 가장 문자 그대로의 의미에서 시간적 구성 실패이기 때문이다: 런타임은 계속 실행되었지만, 눈에 보이는 상태는 그 뒤에 커밋되어 있었다. Discussion #483에 문서화된 지속성 격차 — 실행 루프에서 한참 뒤처질 수 있는 write-behind 배치 — 는 정확히 그 논문의 보증이 방지해야 하는 부류의 문제다. 하네스의 상태 계층이 실제로 그러한 보증을 지키는지는 이번 릴리스에서 진정으로 열린 질문 중 하나이며, 출시 첫날 보고서는 어느 쪽이든 첫 번째 증거가 된다.
밑에 있는 모델들
하네스가 제품이고, 모델이 엔진입니다. DeepSeek가 그것 아래에 둘 것으로 추정되는 두 모델 모두 이미 운영 중이며, 둘 다 오늘 OrcaRouter를 통해 호출할 수 있습니다:
• DeepSeek V4 Flash 0731 — DeepSeek의 효율적인 MoE(총 284B / 활성 13B)를 재포스트-트레이닝한 공식 릴리스로, 1M 토큰 컨텍스트, 384K 최대 출력, 기본적으로 활성화된 thinking 모드를 갖추고 있으며, Codex 스타일 에이전트가 구사하는 바로 그 언어인 OpenAI Responses API를 네이티브로 구사합니다. DeepSeek이 0731 리비전에 대해 자체 발표한 에이전트 벤치마크 수치: Terminal-Bench 2.1에서 82.7, Cybergym에서 76.7, Toolathlon Verified에서 70.3, DSBench-FullStack에서 68.7, DSBench-Hard에서 59.6. 이 수치는 벤더가 보고한 것으로 재현되지 않은 수치이지만, DeepSeek이 전면에 내세우기로 선택한 수치이며, 동일한 세트에서 DeepSeek V4 Pro Preview보다도 높은 점수를 기록합니다.
• DeepSeek V4 Pro — 총 1.6T / 49B 활성 MoE 플래그십, 동일한 1M 토큰 컨텍스트, 오픈 가중치(2026년 4월 출시), 백만 토큰당 $0.44 / $0.87 가격.
가격에 관해서라면, 핵심은 DeepSeek이 저렴하다는 점입니다. DeepSeek V4 Flash 0731은 입력 토큰 100만 개당 약 $0.147, 출력 토큰 100만 개당 약 $0.295입니다. 이는 벤더 공시 가격이며 OrcaRouter가 마크업 없이 그대로 전달합니다. 하네스가 성숙해지면 지금 이미 호출할 수 있는 동일한 모델을 지정할 수 있고, 나중에 하네스를 넣거나 빼는 것은 마이그레이션이 아니라 구성 변경일 뿐입니다. 지금 두 모델 중 어느 것을 실행하든 DeepSeek Harness는 필요하지 않습니다.

그것이 빠져들고 있는 비용 전쟁
이것은 결코 사소한 시장이 아닙니다. Claude Code는 2026년 초 기준 연환산 매출이 25억 달러를 넘어선 것으로 알려졌으며, 에이전틱 코딩 시장은 수십억 달러 규모로 측정되고 있습니다. API 가격을 낮추는 — 그리고 그 모델이 이미 Claude Code 자체 내에서 실행되는 — 중국 연구소의 진입은 전체 카테고리의 가격을 재편하는 움직임입니다.
비용 측면에서 하네스 선택은 모델만큼이나 중요하다. Composio의 수평 테스트에서 8개 하네스에 걸쳐 DeepSeek V4 Flash를 실행한 결과, 가장 저렴한(오픈소스 'Pi' 하네스) 성공 작업당 추론 비용이 약 $0.028이었으며, 같은 테스트에서 Claude Code는 약 $0.195였다. 같은 유형의 작업에서 거의 7배 차이다. 여기에 DeepSeek가 보고한 프리픽스 캐시 할인과 서드파티 하네스가 DeepSeek 사용 시 보고하는 99.93% 캐시 적중률을 더하면, DeepSeek 기반 에이전트의 작업당 실효 비용은 매우 빠르게 아주 작아진다.
오늘날 이미 사실인 점도 기억할 가치가 있습니다. DeepSeek는 Anthropic 호환 엔드포인트(기본 URL https://api.deepseek.com/anthropic)를 제공하며, 자체 문서에서 Claude Code를 DeepSeek V4 모델에 연결하는 방법을 안내합니다. 하네스 제품은 DeepSeek가 해당 계층을 임대하는 대신 직접 소유하려는 시도입니다. 또한 DeepSeek는 V4 제품군 전반에 걸쳐 상당한 가격 인상이 예정되어 있다고 발표했습니다. OrcaRouter는 공급업체의 공시 가격을 마크업 없이 그대로 전달하므로, 새 요금은 출시 당일 재협상 없이 바로 저희 쪽에도 적용됩니다.

하네스가 새로운 격전지가 된 이유
초점이 모델 역량에서 작업 수행으로 이동하고 있다. 이제 프런티어 모델은 기본 요건(table stakes)일 뿐이며, 팀이 실제로 에이전트를 출시하는지를 결정하는 것은 주변 장치와 그것이 생성하는 데이터다. DeepSeek의 행보를 분석하는 애널리스트들(CITIC Securities 포함)은 성숙한 하네스가 두 가지 이유가 맞물려 해자가 된다고 주장한다. 즉, 진입점에서 완료된 작업까지 이어지는 상업적 루프를 닫아주고, 모델 훈련에 투입되는 장기 작업 궤적 데이터를 생성한다는 것이다. Pi나 DeepSeek-TUI 같은 커뮤니티 하네스는 수요를 입증하지만, 그 데이터를 모델에 다시 피드백하지는 않는다. DeepSeek 자체의 하네스는 그렇게 할 것이며, v0.1에 포함된 Trajectory 기능은 바로 그 데이터 경로를 가시화한 것이다.
그것이 또한 "그냥 모델을 벤치마크"하는 독법이 불완전한 이유입니다. DeepSeek V4 Flash의 에이전트 점수는 강하지만, DeepSeek가 지속 가능한 우위를 구축할 것으로 기대하는 곳은 하네스입니다. 즉, 첫날 보고서의 상태 계층 버그는 단순한 외형적 문제 이상입니다. UI가 루프보다 50분 뒤처질 수 있는 하네스는 여전히 개발자 프리뷰일 뿐이며, 아직 해자가 아닙니다.
지금 보고 있는 것
• 상태 레이어가 따라잡는지 여부. write-behind 지연은 문서화되어 있고, 재현 가능하며, 공식 저장소에 이슈로 등록되고 있다. 플러시 경로가 빠르게 수정되는지, 그리고 세션이 진행 중일 때 "UI가 커밋된 상태만 표시" 설계가 변경되는지 지켜보라.
• 네이티브 재현 테스트. 이 릴리스가 중요했던 이유는 DeepSeek의 V4 에이전트 점수가 "DeepSeek Harness 최소 모드"에서 생성되었기 때문입니다. 이제 누구나 프리뷰를 설치하고 해당 작업을 네이티브로 실행할 수 있습니다. 82.7 / 87.9 수치가 재현된다면 지난 두 릴리스는 하나의 일관된 시스템으로 읽힙니다. 그렇지 않다면, 벤더-벤치마크 격차는 측정 가능해집니다.
• 플러그인 생태계가 힘을 얻을지 여부. #dsh 태그가 붙은 플러그인 표면은 실제하지만, 서드파티가 설치할 가치가 있는 무언가를 내놓을지는 여전히 미지수다.
• 가격표. DeepSeek는 하네스 자체의 비용에 대해 아무것도 언급하지 않았으며, 발표된 V4 API 가격 인상이 또 다른 큰 변수입니다.
• "시공간 합성성"이 실제 수정 목록이 될지, 아니면 하나의 구호에 그칠지가 관건이다. 이 논문은 현장 보고서가 드러낸 바로 그 실패에 대해 DeepSeek에 엄밀한 어휘를 제공한다. v0.1 상태 계층이 그러한 보장에 수렴하는지가 시험대다.
솔직한 평가: DeepSeek이 보낸 가장 강력한 출시 전 신호는 이제 실제 제품이 되었지만, 문서화된 미숙한 부분이 있는 개발자 프리뷰입니다. 현재 확실한 것은 그 기반이 되는 두 모델, DeepSeek V4 Flash 0731과 DeepSeek V4 Pro입니다. 둘 다 OrcaRouter에서 공급업체 공시 가격 그대로, 마크업 없이 제공되며, 하나의 표준 API를 통해 에이전트 루프에서 사용할 수 있습니다. 하네스가 성숙해지면, 프로덕션 경로를 v0.1에 걸지 않고 평가하는 방법은 라우팅입니다: 평가를 위해 하네스를 전면에 두고, 동일한 모델을 하나의 엔드포인트 뒤에 유지한 채, 하네스가 작동을 멈추는 즉시 검증된 조합으로 페일오버하는 것입니다. 그 전환은 코드 한 줄만 고치면 되는 변경입니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
