
DeepSeek V4 리뷰: AI에서 가장 저렴한 본격적인 1M-토큰 모델?
- anthropicNEWAnthropic: Claude Opus 52026-07-2461지능78코딩
- googleNEWGoogle: Gemini 3.6 Flash2026-07-2150지능69코딩
- googleNEWGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaNEWMeta: Muse Spark 1.12026-07-1651지능71코딩
- kimiNEWMoonshotAI: Kimi K32026-07-1557지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0951지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0955지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0959지능77코딩
- grokxAI: Grok 4.52026-07-0854지능72코딩
- tencentTencent: Hy32026-07-0641지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3053지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1651지능69코딩60수학
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242지능61코딩61수학
- anthropicAnthropic: Claude Fable 52026-06-0960지능77코딩
- qwenQwen: Qwen3.7 Plus2026-06-0139지능56코딩59수학
- minimaxMiniMax: MiniMax M32026-05-3144지능59코딩59수학
- AnthropicAnthropic: Claude Opus 4.82026-05-2856지능74코딩68수학
DeepSeek은 2026년 4월 24일 V4 제품군을 출시했습니다. V4-Pro와 V4-Flash 두 모델로, 출시 당일 API에서 사용할 수 있고 오픈소스로 공개되었으며, 진지한 AI 성능에 필요한 비용 기준을 조용히 재정의했습니다. 두 모델 모두 기본적으로 100만 토큰 컨텍스트 윈도우를 제공하며, 사고 모드와 비사고 모드를 모두 지원합니다. 플래그십 모델인 V4-Pro는 출력 토큰 100만 개당 최대 0.87달러로, 시장에서 이와 비슷한 100만 컨텍스트 모델(오픈소스든 폐쇄형이든)보다 저렴한 가격을 자랑합니다.
7월은 결정의 달입니다. 6월 29일자 공지에서 DeepSeek는 V4 공식 버전이 2026년 7월 중순에 출시된다고 확인하며, 기능 및 성능 향상을 약속하고 베이징 업무 시간 동안 요금을 두 배로 인상하는 피크 시간대 가격제를 도입한다고 밝혔습니다. 그로부터 10일 후인 7월 24일에는 레거시 모델 이름인 `deepseek-chat`과 `deepseek-reasoner`가 영구히 폐지됩니다. 이 리뷰에서는 V4가 실제로 무엇인지, 현재와 공식 출시 후의 비용, 어떤 부분에서 우위를 점하고 명백히 부족한 점, 그리고 마감일 전에 무엇을 해야 하는지 다룹니다.
간략 평결
DeepSeek V4를 고려하세요 만약 당신이…
- 대량의 프로덕션 워크로드를 실행하는 데 있어 단위 비용이 생존 가능성을 결정하는 곳에서 — V4의 가격은 독보적인 수준입니다.
- 긴 컨텍스트를 저렴하게: 기본 1M 토큰, 응답당 최대 384K 출력 토큰, 적극적인 컨텍스트 캐싱 할인
- 드롭인 통합을 원하십니까? API가 OpenAI ChatCompletions와 Anthropic 형식을 모두 지원하므로 기존 도구가 대부분 그대로 작동합니다
- 오픈 웨이트 및 자체 호스팅 옵션을 중시하며, 특히 더 작은 V4-Flash를 선호합니다.
만약 당신이...라면 (다른 곳으로 보내거나) 보류하세요.
- 장기 지평의 자율 에이전트 실행 — Z.ai가 발표한 교차 모델 테이블에서 V4-Pro는 GLM-5.2와 폐쇄형 최첨단 모델 모두에 마라톤 스타일 벤치마크에서 크게 뒤처집니다.
- 이미지 입력 필요: V4는 텍스트 전용입니다.
- 24시간 내내 고정 가격을 적용합니다 — 2026년 7월 중순 공식 출시부터, 베이징 업무 시간대에는 피크 시간 요금이 두 배가 되며(비피크 시간은 현재 요금 유지)
DeepSeek V4는 무엇인가요?
V4는 DeepSeek의 4세대 모델 제품군으로, 두 개의 Mixture-of-Experts 모델로 출시되었습니다. DeepSeek-V4-Pro는 플래그십 모델로, 총 1조 6000억 개의 파라미터 중 토큰당 490억 개가 활성화됩니다. DeepSeek-V4-Flash는 효율성 계층입니다. 총 2840억 개의 파라미터 중 130억 개가 활성화됩니다. 두 모델 모두 DeepSeek 공식 서비스에서 기본적으로 100만 토큰 컨텍스트 윈도우를 실행하며, 두 모델 모두 이중 모드(복잡한 문제를 위한 사고 모드, 속도를 위한 비사고 모드)를 모델 ID로 제공합니다. deepseek-v4-pro와 `deepseek-v4-flash`.
두 가지 포지셔닝 세부 사항이 중요합니다. 첫째, V4는 프리뷰로 출시되었으며, DeepSeek은 이를 프로덕션에서 사용 가능한 것으로 간주합니다. 그리고 회사의 6월 29일 공지에 따르면, 공식 버전은 2026년 7월 중순에 출시되며, "기능 최적화 및 성능 개선"이 포함됩니다. 둘째, V4는 오픈소스로 출시되어, DeepSeek이 가중치를 공개적으로 배포하는 패턴을 이어갑니다. 이는 셀프 호스팅과 파인튜닝을 가능하게 하며, 현실적으로 1.6T Pro보다 284B Flash에 더 적합합니다.
DeepSeek V4의 새로운 점은 무엇인가요?

1M 토큰 컨텍스트를 기본으로 제공하며, 업셀이 아닙니다.모든 공식 DeepSeek 서비스는 이제 전체 백만 토큰 윈도우를 표준으로 실행합니다. 별도의 긴 컨텍스트 SKU나 프리미엄 요금이 없습니다.
엄청난 출력 헤드룸. 두 모델 모두 응답당 최대 384K 출력 토큰을 지원합니다. 이는 대부분의 1M 컨텍스트 경쟁사가 허용하는 것의 세 배이며, 전체 파일 코드 생성, 긴 구조화된 추출, 및 보고서 작성에 중요합니다.
하나의 엔드포인트에서 제공하는 듀얼 모드입니다. 어려운 문제에는 씽킹 모드를, 저렴하고 빠른 호출에는 논씽킹 모드를 사용할 수 있으며, 모델별이 아닌 요청별로 전환이 가능합니다.
두 개의 계층이 하나의 API 형태를 가집니다. Pro는 기능용, Flash는 볼륨용 — 동일한 컨텍스트, 동일한 모드, 동일한 통합.
듀얼 API 호환성.V4는 OpenAI ChatCompletions와 Anthropic API 형식을 모두 기본적으로 지원하므로, 대부분의 기존 에이전트 도구가 재작성 없이 연결됩니다.
가격: 실제 비용

V4를 유명하게 만든 부분이 바로 이 섹션입니다. V4-Pro는 입력 토큰 100만 개당 $0.435, 출력 토큰 100만 개당 $0.87입니다. V4-Flash는 $0.14와 $0.28입니다.반복된 컨텍스트에 대한 캐시 히트는 100만 토큰당 1센트 훨씬 아래로 책정되어 있으며, 동일한 프로젝트 상태를 다시 읽는 에이전트 루프에 사실상 무료입니다.
척도로 말하자면: GLM-5.2는 여름의 가치 플레이로 유명한데, $1.40 / $4.40에 제공됩니다. Claude Sonnet 5는 $3 / $15에, Claude Opus 4.8은 $5 / $25에 제공됩니다. V4-Pro의 출력 가격은 GLM-5.2의 5분의 1 수준이고 Opus 4.8의 약 3%입니다. V4-Pro가 일부 1대1 품질 비교에서 밀리더라도 — 실제로 그렇습니다 — 경제성은 모델에 어떤 질문을 던질 가치가 있는지를 바꿔놓습니다.
공식 출시와 함께 한 가지 변경 사항이 있습니다.DeepSeek의 6월 29일 공지에 따르면, 7월 중순부터 모든 토큰 가격이 피크 시간대(베이징 시간 기준 09:00–12:00 및 14:00–18:00)에 두 배로 인상되며, 비피크 시간대에는 현재 요금이 유지됩니다. 두 배가 되어도 V4-Pro의 피크 출력 가격(약 백만 개당 $1.74)은 여전히 GLM-5.2의 표준 요금보다 낮지만, 정액 요금 시대는 프리뷰와 함께 종료됩니다. 트래픽이 중국 업무 시간에 피크를 이룬다면 변동을 모델링하거나 스케줄과 경로를 조정하세요.
리뷰 점수
아래 점수는 DeepSeek의 공식 문서와 Z.ai의 게시된 교차 모델 벤치마크 테이블을 기반으로 한 편집자 평가입니다. — 교차 공급업체 수치는 DeepSeek 자체 주장이 아닌 제3자 맥락으로 간주하십시오.

코딩: 8/10 — 일상적인 엔지니어링에 능숙함; 오픈 웨이트 리더는 아님
- 에이전트 / 도구 사용: 7/10 — 견고한 도구 오케스트레이션, 장시간 자율성은 약함
- 추론: 8/10 — 가격 대비 수학 및 과학 점수가 우수함
- 비용 효율성: 10/10 — 이에 필적할 만한 것은 없습니다
- 컨텍스트 및 긴 문서: 9/10 — 입력 1M, 출력 384K, 거의 무료 캐시 히트
- 속도: 8/10 — 간결한 활성 매개변수 수와 빠른 경로를 위한 비사고 모드 포함
전체 평가: ~8.3/10 — 2026년 중반의 가성비 왕이며, 장기적 관점에서 별표(*)가 붙은 제품입니다.
장점
- 곡선을 재설정하는 가격: 제품군 전체에서 백만 토큰당 $0.14–$0.87
1M 컨텍스트 표준과 384K 출력 — 해당 클래스에서 가장 큰 출력 한계
- 하나의 엔드포인트에서 사고 모드와 비사고 모드를 요청별로 전환 가능
- OpenAI 및 Anthropic API 호환성은 거의 제로에 가까운 마이그레이션 마찰을 의미합니다.
- 오픈소스 가중치는 자체 호스팅과 미세 조정을 계속 가능하게 합니다.
단점
- 장기적인 에이전트 작업이 분명한 약점입니다 — Z.ai가 발표한 표에서 V4-Pro는 FrontierSWE에서 29.0점을 기록했으며, GLM-5.2는 74.4점, Claude Opus 4.8은 75.1점을 기록했습니다.
텍스트 전용: V4 API에서 이미지 입력 없음
- 피크 시간 요금제는 7월 중순 정식 출시와 함께 도입됩니다 — 베이징 업무 시간대에는 요금이 두 배로 인상되므로 예산이 평탄하게 유지되지 않습니다.
- 아직 7월 중순까지는 미리보기이므로 공식 버전에서는 동작이 변경될 수 있습니다.
- 2026년 7월 24일 deepseek-chat과 deepseek-reasoner의 지원 종료로 인해, 기존 사용자들은 DeepSeek의 일정에 따라 마이그레이션해야 합니다.
- 1.6T 파라미터 Pro의 자체 호스팅은 거의 모든 사람에게 비현실적입니다 (284B의 Flash가 현실적인 목표입니다)
DeepSeek V4 비교

V4-Pro 대 V4-Flash.동일한 컨텍스트, 동일한 모드, 동일한 API — 차이는 3배의 가격 차이로 품질 대 처리량입니다. 합리적인 기본값: 요약, 추출, 분류 및 채팅에는 Flash를 사용하고; 코드, 분석 및 사람이 검토하는 모든 것에는 Pro를 사용하세요.
GLM-5.2 대비.올여름의 오픈 웨이트 대결이며, 가치 면에서 정말 근소한 차이입니다. GLM-5.2는 더 강력한 코더입니다. Z.ai가 공개한 표에 따르면, Terminal-Bench 2.1에서 V4-Pro를 81.0 대 64.0으로 앞서고 장기 작업에서도 압도적입니다(FrontierSWE에서 74.4 대 29.0). 반면 V4는 3~5배 더 낮은 가격과 3배 더 높은 출력 한계로 맞서고 있습니다. 대량 파이프라인은 V4에 유리하고, 코딩 에이전트는 GLM-5.2에 유리합니다.
폐쇄적 프론티어와의 비교.Claude Opus 4.8과 GPT-5.5는 여전히 어려운 벤치마크에서 확실히 더 강력한 모델입니다. 하지만 Opus 4.8 대비 30~60배의 출력-가격 격차에서 V4는 그 싸움에서 이기려는 것이 아닙니다. 그것은 여러분 트래픽의 90%를 다른 곳으로 보낼 이유가 없을 정도로 저렴하게 만들려는 것입니다.
7월 24일 마감: 레거시 이름에서 마이그레이션

만약 귀하의 통합이 여전히 `deepseek-chat` 또는 `deepseek-reasoner`를 호출한다면, 해당 이름들은 2026년 7월 24일 15:59 UTC 이후에 작동을 멈춥니다. 그들은 현재 V4-Flash로 라우팅되므로, 귀하의 트래픽은 이미 V4 경제성으로 실행되고 있습니다. 그러나 마감 이후에는 요청이 완전히 실패합니다. 마이그레이션 자체는 한 줄(`model: "deepseek-v4-pro"` 또는 `"deepseek-v4-flash"`)이므로, 실제 작업은 V4 동작에 대해 프롬프트를 다시 테스트하고, 엔드포인트별로 각 워크로드에 적합한 티어를 결정하거나, 라우터를 앞에 두어 다음 폐기가 코드 변경 대신 구성 변경이 되도록 하는 것입니다.
누가 DeepSeek V4를 사용해야 하나요?
대량 제품 — 지원, 요약, 추출, 분류 — V4 가격 책정이 한계적 기능을 수익성 있게 만드는 경우
매일 1M-토큰 윈도우를 채우고 거의 무료에 가까운 캐시 적중으로 이익을 보는 장문 문서 및 RAG 중심 작업
긴 출력물을 생성하는 팀: 코드베이스, 보고서, 구조화된 데이터 — 384K 출력이 클래스의 상한선입니다.
비용을 의식하는 건축업자들은 기본적으로 충분한 성능을 원하며, 어려운 10%는 다른 곳에서 해결하는 데 만족합니다.
누가 다른 곳을 찾아야 할까요?
핵심 워크로드가 장기 실행 자율 에이전트인 팀에게는 — GLM-5.2 또는 폐쇄형 플래그십이 더 안전한 길입니다.
시각 의존 워크플로우 (V4는 이미지를 입력받지 않음)
미리보기 대신 계약상의 '안정적인' 라벨이 오늘 필요한 모든 사람
DeepSeek V4는 그만한 가치가 있나요?
가격 대비, 단연코 그렇다 — 하나의 종교가 아니라 하나의 레인(lane)으로서. V4는 최고의 오픈웨이트 코더(GLM-5.2)나 최전방 플래그십 모델을 품질 면에서 능가하지 못하며, 장기 에이전트 수치도 확실히 약하다. V4가 하는 일은 일상적인 AI 작업의 방대한 영역 — 실제 토큰 비용을 지배하는 요약, 추출, 초안 작성, 채팅 턴 — 을 거의 무료로 만드는 것이다. 승리 패턴은 V4를 볼륨 바닥(volume floor)으로 삼고, 그 위에 상향 레인(escalation lanes)을 배치하는 것이다.
최종 평결
딥시크 V4는 이제 모든 다른 모델이 비교되는 가격 대비 성능 벤치마크입니다. 저희 점수는 약 8.3/10입니다. 볼륨이 중요한 곳에서는 Flash를, 품질이 중요하지만 예산이 현실적인 곳에서는 Pro를 실행하고, 최고 수준의 작업은 더 강력한 모델로 라우팅하세요. 7월 중순 피크 가격이 적용되면 비용 계산을 다시 해보세요. 저렴한 것은 여전히 저렴하지만, 더 이상 고정적이지 않습니다. 아직 deepseek-chat이나 deepseek-reasoner를 사용 중이라면: 7월 24일까지입니다. 이동하세요.
OrcaRouter를 통해 DeepSeek V4 사용
세 개의 차선 전략 — 볼륨을 위한 V4, 어려운 태스크를 위한 더 강력한 오픈 또는 클로즈드 모델, 신뢰성을 위한 폴백 — 은 수동으로 운영하기에는 까다롭지만 게이트웨이 뒤에서는 간단한 설정입니다. OrcaRouter는 DeepSeek V4, GLM-5.2, Claude, GPT, Gemini 및 200개 이상의 다른 모델을 하나의 OpenAI 호환 엔드포인트를 통해 제공하며, 제공업체 목록 가격에 제로 토큰 마크업으로 스마트 라우팅이 요청별로 차선을 선택하고, 자동 장애 조치가 프리뷰 시대의 문제를 처리하며, 모델별 관찰 가능성을 통해 완료된 태스크당 각 차선의 실제 비용을 보여줍니다. 또한 7월 24일 명칭 폐지나 7월 중순의 피크 시간 가격 책정과 같은 제공업체 측 변경 사항을 무력화합니다 — 모델 이름이 사라지거나 가격 창이 열리면 코드베이스가 아닌 라우팅 규칙을 업데이트하면 됩니다.


자주 묻는 질문
DeepSeek V4가 지금 사용 가능한가요?
네 — V4-Pro와 V4-Flash는 2026년 4월 24일부터 DeepSeek API에서 라이브로 제공되었으며, 모델 ID deepseek-v4-pro 및 deepseek-v4-flash로 오픈소스 가중치와 함께 제공됩니다. 공식적으로는 프리뷰이며, DeepSeek의 6월 29일 공지에 따르면 정식 버전은 2026년 7월 중순에 출시될 예정입니다.
DeepSeek의 피크 시간 요금은 무엇인가요?
공식 출시가 발표되었습니다: 2026년 7월 중순부터 베이징 업무 시간(베이징 시간 09:00-12:00 및 14:00-18:00) 동안 모든 토큰 가격이 두 배로 인상되며, 비수기 시간에는 현재 요금이 유지됩니다. 중국 업무 시간 외에 피크를 이루는 트래픽(대부분의 서부 워크로드)은 추가 요금을 대부분 피할 수 있습니다.
deepseek-chat과 deepseek-reasoner는 어떻게 되나요?
현재 자동으로 V4-Flash로 라우팅되지만, 2026년 7월 24일 (15:59 UTC) 이후에는 두 이름이 완전히 사용 중지되어 요청이 실패합니다. 기한 전에 모델 파라미터를 명시적으로 업데이트하세요.
V4-Pro 또는 V4-Flash를 사용해야 하나요?
Flash는 인간이 한 줄씩 검토하지 않는 대량 작업(요약, 추출, 분류, 채팅)에 사용됩니다. Pro는 코드, 분석, 초안 작성에 사용되며, 가격은 Flash의 약 3배이지만 여전히 모든 유사 모델보다 훨씬 낮습니다.
DeepSeek V4가 GLM-5.2보다 더 나은가요?
더 저렴할 뿐, 더 나은 것은 아닙니다. Z.ai의 공개 표에서 GLM-5.2는 코딩에서 분명히 앞서며 장기 에이전트 작업을 지배합니다. V4는 3~5배 낮은 가격, 384K 출력 상한선, 거의 무료에 가까운 캐시 히트로 맞섭니다. 많은 팀이 두 가지를 모두 사용합니다: V4는 볼륨용, GLM-5.2는 코딩 에이전트용입니다.
DeepSeek V4가 이미지를 처리할 수 있나요?
아니요 — V4 API는 텍스트 전용입니다. 비전 작업(스크린샷, 픽셀로 된 PDF, 차트)은 대신 Claude나 Gemini 같은 멀티모달 모델로 라우팅하세요.
DeepSeek V4를 자체 호스팅할 수 있나요?
가중치는 오픈소스로 공개되어 있지만, 규모에 대해 현실적으로 접근해야 합니다: V4-Pro는 1.6T 파라미터의 MoE로 데이터센터 수준이며, 284B V4-Flash는 자원이 충분한 팀을 위한 실용적인 자체 호스팅 대상입니다.
V4가 기존 OpenAI 또는 Claude 툴링과 호환되나요?
대체로 그렇습니다 — API는 네이티브로 OpenAI ChatCompletions와 Anthropic 형식을 모두 지원하므로, 두 형식 중 하나를 위해 구축된 에이전트 프레임워크와 SDK는 일반적으로 base-URL과 model-name 변경만으로 연결됩니다.
OrcaRouter를 통해 DeepSeek V4를 사용할 수 있나요?
네 — DeepSeek 모델은 OrcaRouter에서 제공업체 목록 가격으로 마크업 없이 이용 가능하며, GLM, Claude, GPT, Gemini와 함께 제공되므로 하나의 엔드포인트 뒤에서 volume-plus-escalation split을 실행할 수 있습니다.
토큰 청구서를 지루하게 만들 준비가 되셨나요? OrcaRouter 계정을 만들고, OpenAI 호환 클라이언트를 하나의 엔드포인트로 지정한 후, 더 강력한 모델이 정점을 처리하는 동안 볼륨을 DeepSeek V4로 라우팅하세요 — 제로 토큰 마크업과 July 24-proof 통합으로.
