
DSH 출시일: DeepSeek의 Claude Code 경쟁자가 출시됨 — V4 Flash와 V4 Pro에 미치는 영향
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 217 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 43 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
DeepSeek V4 Flash와 DeepSeek V4 Pro가 DeepSeek의 가장 최근 출시작 두 개였을 때, X에서 가장 많은 팔로워를 보유한 DeepSeek 관찰자는 다음 버전에 시계를 맞췄다. 가명으로 활동하는 AI 개발자 teortaxesTex는 "현실적으로 DSH는 약 7~9시간 후에 출시됩니다. 이번 출시로 지난 두 릴리스가 재조명될 것으로 예측합니다. 안개는 이제 충분합니다. 네이티브 성능이 어떤지 지켜보겠습니다"라고 게시했다. 그가 맞춘 시계는 오늘 밤 결판이 났다. 내부 베타 그룹은 X 계정 op7418에게 출시가 베이징 시간 기준 "약 20:25"에 이뤄질 것이라고 알렸고, 실제로 DeepSeek Harness 개발자 프리뷰는 그날 저녁 공개됐다. IT之家는 20:52에 보도했으며, 이후 한 시간 동안 후속 보도가 이어졌다. Claude Code에 대한 DeepSeek만의 답인 Harness가 이제 공개됐다. v0.1, MIT 라이선스, GitHub 오픈, 단일 npm 명령으로 실행할 수 있다.
흥미로운 부분은 날짜가 왜 중요했는지, 그리고 이번 출시가 왜 단순한 출시 틱 이상의 가치를 지니는지다. DeepSeek V4 Pro 공식 빌드(DeepSeek-V4-Pro-0813)는 같은 시기에 DeepSeek API에 출시되었고, DeepSeek V4 Flash는 2주 먼저 정식 출시되었다. 두 모델 모두 DeepSeek가 자체 하네스 내부에서 생성한 에이전틱 벤치마크 점수를 함께 제공했다. V4 Flash API 문서에는 그 점이 이름까지 명시적으로 나와 있다: "DeepSeek Harness minimal mode." DSH는 그 하네스의 풀 버전으로 공개된다. 즉, 지난 두 번의 출시를 뒷받침한 수치를 이제 원하는 사람은 누구나 실행해 재현할 수 있다는 뜻이다. 여기까지 이어진 유출 경로 중 어느 것도 DeepSeek가 공식 기록으로 확인한 바는 없지만, 종착점은 더 이상 유출이 아니다. 개발자 프리뷰가 공개되었기 때문이다. 여전히 공개되지 않은 것은 가격표다. DeepSeek는 하네스 자체의 비용에 대해 아무것도 밝히지 않았다.
시계를 맞춘 예측
teortaxesTex는 DeepSeek 직원이 아니며, 그렇게 주장하지도 않습니다. 계정 소개에는 자칭 '2023년부터의 DeepSeek 응원자'라고 설명되어 있고, 공개 기록은 잘 맞아떨어진 추측들이 이어진 정보에 기반한 추측입니다. DeepSeek V4 아키텍처에 대한 예측 시장 베팅, DeepSeek-V4.1이 경쟁사보다 몇 배 더 많은 강화학습 컴퓨팅을 받을 것이라는 초기 전망, 그리고 커뮤니티가 예의주시하는 릴리스 해석의 흐름이 그 내용입니다. 원래 트윗은 그것이 본래 지녔던 의미 그대로 받아들이십시오. 정보에 기반한 예측이지, 확정이 아닙니다.
예측은 두 부분으로 이루어져 있었다. 첫 번째는 시점이었다. "약 7~9시간 후 출시"라는 예측은 베이징 시간 기준 8월 12~13일 밤에 해당했는데, 이는 DeepSeek-V4-Pro-0813 빌드가 DeepSeek API 문서에 나타난 것과 같은 시간대였다. 그리고 그 예측은 적중했다. 내부 베타 그룹의 "약 20:25" 추정과 실제 ~20:52 출시는 모두 그 시간대 안에 들어왔으며, 유출된 예측은 하루가 아니라 약 30분 정도 빗나갔을 뿐이다. 두 번째는 "재맥락화"라는 무거운 의미를 담은 단어였다. 이 단어는 DeepSeek이 자사의 지난 두 번의 릴리스를 어떻게 벤치마킹했는지를 알아야만 이해할 수 있다. 이제 그 두 번째 예측은 검증이 가능하며, 그것이 바로 이번 릴리스의 핵심이다.
DSH가 실제로 무엇인지
DeepSeek의 내부 공식은, 수석 연구원 천덜리(Chen Deli)가 공개적으로 확인한 바와 같이 "모델 + 하네스(Harness) = 에이전트"이다. 하네스는 모델 너머에 있는 전체 엔지니어링 계층으로, 언어 모델을 실제로 작업을 수행하는 도구로 바꿔준다: 컨텍스트 및 메모리 관리, 도구 호출, 작업 계획, 파일 읽기와 쓰기, 터미널 실행, 오류를 루프에 다시 피드백하고, 작업이 실제로 완료되었는지 판단하는 것까지 포함한다. DeepSeek의 채용 공고는 그 목표를 "프런티어 모델 역량을 선도적인 에이전트 제품으로 전환하는 것"으로 설명하며, 천덜리의 말에 따르면 명시적인 목표는 Claude Code이다.
이 제품은 또한 커뮤니티 프로젝트에 대한 응답이기도 합니다. Rust로 구축되고 농담 삼아 'DeepSeek 버전의 Claude Code'라고 불리는 팬 제작 터미널 에이전트 DeepSeek-TUI가 올해 초 GitHub에서 입소문을 탔으며, 공식 하네스는 그 터미널 진입점을 다시 차지합니다.
유출 경로가 루머로 묘사했던 내용이 이제 릴리스에 포함됐다. v0.1 개발자 프리뷰는 MIT 라이선스로 github.com/deepseek-ai/deepseek-harness에 오픈소스로 공개된, Node.js 패키지 네임스페이스의 데스크톱 및 CLI 에이전트 런타임이다. "npx @deepseek-ai/dsh web" 명령으로 127.0.0.1:3080에서 웹 GUI를 시작할 수 있으며, Cordis 메타 프레임워크 기반으로 "모든 것이 플러그인"이라는 설계 원칙을 내세운다. 모델, 도구, 스킬, 세션, 샌드박스, 스토리지, 에이전트 루프, 스케줄링, UI는 모두 교체 가능한 Cordis 플러그인이다. 네 가지 에이전트 프리셋이 기본 제공된다: Standard, PTC(모델이 TypeScript 프로그램을 작성해 도구 호출을 연결하는 방식), Minimal(셸 도구와 파일 편집기로 구성, V4 벤치마크가 실행된 모드), Creation. 팀 리드로 알려진 추이티안(Cui Tianyi) — 저장대학(Zhejiang University) 졸업생이자 제인스트리트(Jane Street)에서 9년간 근무한 엔지니어 — 이 그 역할을 맡은 것이 확인됐으며, 8월 2일 전 세계 내부 테스터 모집 공지를 발표했다. DeepSeek의 자체 경고: 이는 개발자 프리뷰이며, 빠른 반복 개발로 인해 호환성이 깨지는 변경(breaking changes)이 발생할 수 있다.
8월 13일에 끝난 유출 경로
아래의 어떤 내용도 DeepSeek에 의해 공식적으로 확인되지 않았지만, 이제 그 기록은 예상된 날짜에 마무리된 타임라인으로 읽힌다:
• 2026년 5월 26일 — 유출된 그룹 기록에 따르면, 공식 DeepSeek GitHub 조직이 생성되었습니다.
• 5월~6월 — DeepSeek가 베이징 Harness 관련 역할 두 가지(에이전트-하네스 제품 관리자 및 연구 엔지니어)를 게시합니다; Chen Deli는 소셜 미디어에서 해당 미션을 확인합니다.
• 7월 6~7일 — 검은 고래 로고를 단 "DeepSeek Harness 팀" 위챗 계정이 DeepSeek 베이징 법인 명의로 등록되어 인증을 받았다.
• 7월 31일 — DeepSeek V4 Flash의 공식 API 출시. 해당 문서에는 CodeAgent 벤치마크 결과가 "DeepSeek Harness minimal mode"에서 생성되었으며, "(곧 공개 예정)"이라는 설명이 덧붙여져 있다.
• 8월 1일 — 오픈소스 에이전트 하네스 프로젝트 개발자를 대상으로 한 내부 테스트 모집; 보고에 따르면 약 700~960명의 지원자와 700개 이상의 후보 저장소.
• 8월 11일 — 유출된 베타 그룹 스크린샷에 따르면, 플러그인 개발자가 호환성 작업을 마무리할 수 있도록 최종 내부 테스트 빌드가 푸시된다.
• 8월 13일 — teortaxesTex가 카운트다운을 설정합니다. 내부 베타 그룹은 op7418에게 "약 20:25"라고 알립니다. 개발자 프리뷰 v0.1이 그날 저녁에 공개되며, 베이징 시간 약 20:52에 보고되었고 GitHub에서 MIT 라이선스로 배포됩니다.
플러그인 생태계는 이번 유출의 주목할 만한 부분이었으며, 실제로 존재합니다. 플러그인 저장소에는 #dsh 토픽 태그가 붙어 있고(검색 가능성을 위해 GitHub 저장소에는 "dsh-plugin"으로 문서화되어 있음), npm 빠른 시작 덕분에 어떤 Node 개발자라도 첫 실행부터 플러그인 표면에 도달할 수 있습니다. 이는 모델뿐 아니라 하네스 자체가 플랫폼이 되리라는 개방형 시장의 도박입니다.

왜 '지난 두 릴리스를 재맥락화하라'가 주목해야 할 문구인가
최근 두 개의 V4 릴리스는 에이전트 우선(agent-first) 모델입니다. DeepSeek V4 Flash의 공식 빌드는 130억 개의 활성 파라미터를 가진 2840억 파라미터 규모의 MoE(전문가 혼합) 모델로, 100만 토큰 컨텍스트와 Terminal-Bench 2.1에서 82.7이라는 대표 점수를 기록했습니다. 이 점수는 DeepSeek가 "DeepSeek Harness 최소 모드"에서 보고하고 생성한 수치입니다. DeepSeek V4 Pro의 공식 빌드는 490억 개의 활성 파라미터를 가진 1조 6000억 파라미터 규모의 MoE 모델이며, 에이전트 성능 카드(DeepSWE 62.7, Terminal-Bench 2.1 87.9, CyberGym 83.3) 역시 DeepSeek 자체 보고 수치로, 작성 시점 기준으로 독립 연구소의 재현 결과는 없습니다.
DSH는 그 수치들이 생산된 하네스이며, 이제 공개되었다. 이것이 "네이티브 성능이 어떠해야 하는지 지켜보겠다"는 말의 의미였다 — Claude Code를 통해서도, 서드파티 하네스를 통해서도, 벤치마크 하네스를 통해서도 아닌, DeepSeek 자체 스택을 엔드 투 엔드로 통해서 말이다. 재현 테스트는 더 이상 가상의 시나리오가 아니다. 누구나 프리뷰를 설치하고 벤더가 실행한 것과 동일한 에이전트 작업을 실행할 수 있다. 네이티브 수치가 재현된다면, 지난 두 번의 릴리스는 일관된 이야기로 읽힌다 — 가장 저렴하면서도 진지한 에이전트 모델과 유능한 퍼스트파티 하네스가 하나의 시스템으로 판매되는 것이다. 그렇지 않다면, V4 Flash 출시 당시 회의론자들이 지적한 벤더-벤치마크 격차는 구체적이고 측정 가능한 현실이 된다. 어느 쪽이든 기록은 바뀐다.
지금까지의 독립적 평가는 같은 이야기가 아닙니다. Artificial Analysis는 이미 V4 Pro 0813 빌드를 자체 리더보드의 Intelligence Index에서 53으로 올렸습니다 — 이는 중앙값 27보다 높고 진정한 제3자 데이터 포인트이지만, "모든 면에서 최첨단"이라는 헤드라인과는 거리가 멀습니다. DeepSeek가 자체 보고한 에이전트 수치와 제3자 평가 사이의 격차는 바로 DSH가 해결 가능하게 만드는 격차입니다.

모델보다 하네스가 더 중요한 전략적 이유도 있습니다. 성숙한 하네스는 진입점부터 완료된 작업까지 루프를 닫고, 그렇게 함으로써 다음 모델 훈련에 피드백되는 작업 궤적 데이터를 생성합니다 — 이는 하네스 채용이 공개되었을 때 CITIC Securities가 발표한 분석입니다. DeepSeek의 모델은 시장에서 가장 저렴한 제대로 된 에이전트이며, 해자와 가격 결정력이 이동하는 곳은 하네스입니다. 유료 퍼스트파티 에이전트 스택은 오픈 웨이트 API와는 매우 다른 비즈니스입니다.
V4 모델을 실행하는 데 여전히 DSH가 필요하지 않습니다.
DSH가 이제 라이브로 제공되지만, 이는 자사 옵션이지 필수 사항이 아닙니다. DeepSeek는 이미 자사 모델에 대해 Anthropic 호환 및 OpenAI 호환 엔드포인트를 제공하고 있으며, 그 덕분에 DeepSeek V4 Flash와 DeepSeek V4 Pro는 이미 Claude Code 및 오늘날의 다른 에이전트 도구에서 별도의 하네스 없이 실행됩니다.
두 모델 모두 DeepSeek 자체 정가 그대로 OrcaRouter에서도 이용할 수 있습니다. deepseek/deepseek-v4-flash-0731은 입력 토큰 100만 개당 약 $0.15, 출력 토큰 100만 개당 약 $0.29이고, deepseek/deepseek-v4-pro는 약 $0.44/$0.88로, 0% 마크업으로 패스스루됩니다. 이는 두 가지 이유에서 중요합니다. 첫째, DeepSeek는 8월 초에 V4 제품군 전반에 걸친 대폭적인 가격 인상이 예정되어 있다고 발표했습니다. 정가가 곧 지불 금액이므로, 새 요금은 출시 당일 재협상 없이 저희 쪽에도 바로 적용됩니다. 둘째, DSH가 기반으로 하는 라우팅 개념, 즉 비용을 통제하기 위해 저렴한 V4 Flash와 플래그십 V4 Pro 사이에서 작업을 오가게 하는 방식은, 하나의 키로 여러 업체에 걸쳐 라우팅 계층이 수행하는 작업과 정확히 일치하며, 자동 장애 조치(failover)까지 갖추고 있습니다. 따라서 하네스와 아직 재현되지 않은 벤치마크가 검증되는 동안에도 새 V4 빌드에 실제 트래픽을 보낼 수 있습니다.

DSH가 라이브된 지금 확인할 사항
프리뷰가 공개된 지금, DSH가 여러분에게 변화를 가져올지 결정하는 다섯 가지는 다음과 같습니다:
• 재현 테스트 — 미리보기를 설치하고 V4 Flash 및 V4 Pro 에이전트 작업을 네이티브로 실행한 다음 DeepSeek가 발표한 82.7 / 87.9 수치와 비교하세요. 이것이 바로 "recontextualize" 내기의 전부이며, 이제 실행 가능합니다.
• 전환 결정 — 오늘날 DSH가 Claude Code 내부에서 동일한 모델을 실행하는 것보다 나은가? 퍼스트파티 하네스는 기존 설정을 옮길 이유가 되려면 가격 이상의 우위를 보여야 한다.
플러그인 생태계 — npm과 GitHub의 표면은 실제로 존재하지만, #dsh 태그가 붙은 플러그인이 실제로 깔끔하게 이식되는지, 그리고 서드파티가 설치할 가치가 있는 것을 제공하는지는 여전히 열린 질문입니다.
• 가격 — 하네스는 실제 토큰으로 실행되며, 내부 테스터들은 작업별 토큰 계량을 보고하고, DeepSeek는 여전히 제품 가격에 대해 아무것도 밝히지 않았다. 유료 제품이 될 것으로 예상하라; 가격표가 마지막으로 남은 큰 미지수이다.
• 변경 로그 — 이제 GitHub의 공식 README와 릴리스 노트가 기준이 되는 소스이며, 발표된 V4 가격 인상도 함께 적용됩니다.
결론
{{1}}DSH는 V4 라인 자체 이후로 DeepSeek이 단행한 가장 중대한 제품 행보이며, 이제 출시되었습니다.{{/1}} {{2}}독자들에게 실질적인 답은 변함이 없습니다:{{/2}} {{3}}DeepSeek V4 Flash와 DeepSeek V4 Pro는 오늘부터 사용할 수 있으며,{{/3}} {{4}}이미 보유한 엔드포인트를 통해,{{/4}} {{5}}여전히 시중의 본격적인 에이전트 옵션 중 가장 저렴한 가격으로{{/5}} {{6}}OrcaRouter에서 정가로, 마크업 없이 제공됩니다.{{/6}} {{7}}주목할 것은 하네스이며,{{/7}} {{8}}출시 자체가 아니라 그것이 측정 가능하게 만드는 것 때문입니다:{{/8}} {{9}}지난 두 릴리스가 마침내 공정한 네이티브 실행을 받게 되고,{{/9}} {{10}}벤더 측 벤치마크와 독립 벤치마크 간의 격차가 좁혀지거나, 그 격차가 입장료가 될 것입니다.{{/10}} {{11}}유출 시계는 날짜와 대략적인 시각이 맞았습니다;{{/11}} {{12}}여전히 입증이 필요한 것은 가격, 네이티브 점수 재현,{{/12}} {{13}}그리고 플러그인 생태계가 지속력을 가질지 여부입니다.{{/13}} {{14}}독립적인 수치가{{/14}} {{15}}카운트다운이 아니라,{{/15}} {{16}}프로덕션 에이전트 스택을 네이티브 하네스로 옮길지 여부를 결정하게 하십시오.{{/16}}
이 글에서 비교한 모델4
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
