DeepSeek V4 Flash 공식 출시: 저렴하고, 빠르며, 에이전틱한 1M 컨텍스트 모델에 대한 설명
Guides & Insights

DeepSeek V4 Flash 공식 출시: 저렴하고, 빠르며, 에이전틱한 1M 컨텍스트 모델에 대한 설명

작성자

jinhao song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

DeepSeek의 효율성 모델인 V4 Flash는 프리뷰를 졸업하고 공식 공개 베타 릴리스로 전환되었습니다 — code>-0731/code> 빌드는 2026년 7월 31일에 출시되었습니다. 아키텍처는 변경되지 않았습니다(여전히 2,840억 개의 매개변수를 가진 혼합 전문가(MoE) 모델이며 100만 토큰 컨텍스트를 지원합니다). 그러나 한 차례의 추가 사후 훈련(post-training)을 통해 에이전트, 코딩, 도구 호출 능력이 크게 개선되었고, 이제 Codex 스타일 에이전트에 맞게 특별히 조정된 Responses API를 기본 지원합니다. 이 가이드에서는 V4 Flash가 무엇인지, 공식 릴리스에서 실제로 무엇이 업그레이드되었는지, (DeepSeek가 보고한) 벤치마크가 어떻게 나타나는지, 비용은 얼마인지, 그리고 사용 방법을 설명합니다 — 모든 수치는 출처별로 표시됩니다.

정확성 참고: 아래의 릴리스 세부 정보와 벤치마크 점수는 DeepSeek 공식 API 변경 로그(2026-07-31 기준)에서 가져온 것입니다. 아키텍처, 컨텍스트, 가격은 OrcaRouter의 모델 페이지와 교차 검증되었습니다. Artificial Analysis 종합 지표는 독립적입니다. DeepSeek가 보고한 벤치마크는 자체 하네스 설정을 사용한 것이므로, 공급업체 수치로 간주하고 직접 평가를 실행하세요. 사양과 가격은 변경될 수 있으므로, 구축 전에 확인하세요.

TL;DR. V4 Flash는 거대한 DeepSeek V4 Pro의 비용 효율적인 형제 모델입니다: 284B / 13B 활성 MoE로, 1M 토큰 컨텍스트와 최대 384K 출력을 지원하며, 대용량·저지연 에이전트 작업에 최적화되어 있습니다. 7월 31일 공식 릴리스는 사후 학습 업그레이드로, 동일한 크기에서 에이전트와 코딩 성능이 크게 개선되었으며, 네이티브 Responses-API 및 Codex 지원도 추가되었습니다. DeepSeek는 강력한 에이전트/코딩 점수를 보고했습니다(예: Terminal-Bench 2.1 82.7, Toolathlon 70.3). 가격은 입력/출력 토큰 백만 개당 약 $0.15 / $0.29로, V4 Pro 가격의 약 1/3 수준입니다. Flash API만 업그레이드되었으며, V4 Pro와 DeepSeek 앱/웹은 변경되지 않았습니다. OrcaRouter에서는 OpenAI 호환 엔드포인트 하나를 통해 0% 마크업으로 이용할 수 있습니다.

주요 시사점

• 공식 릴리스 (빌드 -0731, 2026년 7월 31일): 프리뷰의 사후 훈련 업그레이드 — 동일한 아키텍처, 훨씬 강력한 에이전트, 코딩 및 도구 사용.

- 아키텍처 변경 없음: 총 284B / 활성 13B (MoE), 1M-토큰 컨텍스트(1,048,576), 최대 384K 출력, 텍스트 전용 입력, 추론, 도구, JSON 지원.

• 새로운 기능: 네이티브 Responses API 지원 및 Codex 전용 적응; OpenAI ChatCompletions 및 Anthropic 스타일 인터페이스를 계속 지원합니다. 모델 ID: code>deepseek-v4-flash/code>.

• DeepSeek가 보고한 에이전트/코딩 성능 향상: Terminal-Bench 2.1 82.7, Toolathlon(검증됨) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• 매우 저렴: 입력/출력 토큰 1M당 약 $0.15 / $0.29, 캐시 읽기 약 $0.02 (OrcaRouter, 0% 마크업) — V4 Pro의 $0.44 / $0.88의 약 3분의 1 수준. Flash API만 변경되었으며 Pro 및 앱/웹은 동일합니다.

공식 릴리스가 실제로 업그레이드한 것

V4 Flash는 2026년 4월 24일에 프리뷰로 처음 등장했습니다. 2026년 7월 31일 공식 출시(code>-0731/code> 빌드, DeepSeek의 API 변경 로그에 따르면)는 명시적으로 결코 새로운 아키텍처가 아닙니다: 총 및 활성 매개변수(284B / 13B)와 1M 컨텍스트는 변경되지 않았습니다. 변경된 것은 사후 훈련입니다 — DeepSeek에 따르면 핵심 에이전트, 코딩, 도구 호출 능력을 크게 개선한 추가 미세 조정입니다. 실질적인 추가 사항 두 가지가 중요합니다: V4 Flash는 이제 네이티브로 Responses API를 지원하며, Codex 스타일 코딩 에이전트에 특별히 적합하지만, 여전히 OpenAI ChatCompletions 및 Anthropic 스타일 인터페이스를 사용합니다. 중요한 점은 이번 릴리스에서 Flash API만 업그레이드되었고, V4 Pro와 DeepSeek 앱/웹 경험은 변경되지 않았다는 것입니다. 팀에게 이는 마이그레이션 없이 동일한 가격으로 에이전트 워크로드를 위한 드롭인 개선을 의미합니다.

아키텍처: 처리량을 위해 설계된 소형 활성 MoE

V4 Flash는 전문가 혼합(Mixture-of-Experts) 모델로, 총 파라미터 수는 약 2,840억 개지만 토큰당 활성화되는 파라미터는 약 130억 개에 불과합니다. 이렇게 낮은 활성 파라미터 수가 핵심입니다. 대규모 전문가 풀이 품질을 유지하는 동안 추론 속도를 빠르고 비용 효율적으로 유지해 주기 때문입니다. 컨텍스트 창은 전체 1,048,576개 토큰(약 100만 개)이며, 최대 출력은 매우 큰 384K입니다. 또한 이 모델은 추론(확장 사고), 도구 호출, 구조화된 JSON을 지원합니다. 입력은 텍스트 전용입니다. 높은 처리량, 낮은 지연 시간, 에이전트릭 작업이라는 설계 목표는 서빙 수치에서 드러납니다. OrcaRouter의 측정에 따르면 p50 기준 첫 토큰까지의 시간은 약 394밀리초이고, 출력 속도는 초당 약 184토큰입니다.

벤치마크: 공식 수치가 말하는 것

공식 릴리스는 DeepSeek 자체 하네스(최소 모드/최대 노력 설정)로 실행된 에이전틱 및 코딩 평가를 중점적으로 활용합니다. 헤드라인 결과를 해석하는 방법은 다음과 같습니다(모두 DeepSeek 보고 기준).

• Terminal-Bench 2.1: 82.7 — 실제 터미널에서의 에이전트형 명령줄/소프트웨어 작업을 평가합니다. 여기서 높은 점수는 모델이 단순히 질문에 답할 뿐 아니라 실제로 도구와 셸을 구동할 수 있음을 나타냅니다.

• Toolathlon (검증됨): 70.3 및 Automation Bench (공개): 25.1 — 도구 사용의 폭과 신뢰성, 종단 간 자동화. 도구 호출 신뢰성은 에이전트에게 성패를 좌우하는 특성이다.

• Cybergym: 76.7 — 보안/CTF 스타일의 에이전트 기반 문제 해결.

• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — 소프트웨어 엔지니어링 및 풀스택 코딩, 저장소 수준 생성부터 어려운 데이터 과학 작업까지. 강력한 DSBench-FullStack(68.7) 점수는 실용적이고 다중 파일 코딩 역량을 시사합니다.

• Agent Last Exam: 25.2 — 최고의 모델들조차 낮은 점수를 받을 만큼 의도적으로 어렵게 설계된 에이전트 추론 시험장. 절대적인 신호가 아닌 상대적인 신호로 유용하다.

독립적인 맥락으로, Artificial Analysis(2026-06-25 평가, 프리뷰 빌드)는 V4 Flash를 AA Coding 약 56.2, AA Intelligence 약 40.3, AA Math 약 50.0으로 평가했습니다. 코딩에 강점이 있는 범용 모델로, 오픈 모델 중앙값 이상의 수준입니다. 공식 포스트트레이닝 개선은 정확히 에이전트/코딩 축을 겨냥하고 있으므로, 최신 빌드는 바로 그런 작업에서 더 강력하게 느껴질 것입니다. 언제나 그렇듯이, 벤더 하네스 측정값은 낙관적으로 집계되니, 자체 워크로드로 검증하세요.

가격 책정: 예산을 바꾸는 숫자

공급업체 가격을 0% 마크업으로 그대로 전달하는 OrcaRouter에서 V4 Flash는 입력 토큰 100만 개당 약 $0.15, 출력 토큰 100만 개당 약 $0.29이며, 캐시 읽기는 약 $0.02입니다. 그리고 DeepSeek는 이번 릴리스에서 가격을 낮게 유지했습니다(업그레이드에도 가격 인상 없음). 이는 DeepSeek V4 Pro의 $0.44 / $0.88의 약 3분의 1 수준입니다. 실질적으로 말하면, 월 1,000만 토큰을 입력 70% / 출력 30% 비율로 사용할 경우 V4 Flash에서는 대략 몇 달러 정도의 비용이 발생합니다. 10억 토큰 규모로 확대하면 플래그십 모델과의 차이는 재무팀이 눈여겨보는 비용 항목이 됩니다. 프롬프트 캐싱은 안정적인 시스템 프롬프트를 사용하는 에이전트와 채팅의 비용을 더 줄여줍니다. 캐시된 입력은 새로운 입력의 약 10분의 1 가격으로 청구되기 때문입니다. 동일한 저렴한 가격에 더 저렴한 에이전트 기능을 제공하는 것이 이번 릴리스의 핵심입니다.

V4 Flash가 들어맞는 위치: DeepSeek V4 사다리

DeepSeek의 V4 라인업은 사다리 구조입니다. V4 Pro는 플래그십으로, 훨씬 더 크고 최상위급 추론·코딩 모델입니다. V4 Flash는 효율성 등급으로, 활성 컴퓨팅이 훨씬 적고 가격은 극히 일부에 불과하며, 이번 포스트트레이닝 업그레이드를 거쳐 에이전트 및 코딩 능력 또한 확실히 강력해졌습니다. DeepSeek가 Flash를 더 나은 에이전트로 만들기 위해 투자했다는 사실(Responses API, Codex 적응, 도구 사용 벤치마크)은 회사가 트래픽이 어디로 몰릴 것으로 예상하는지를 보여줍니다. 즉, 일상적인 에이전트·코딩 트래픽은 Flash가 처리하고, 가장 어려운 추론은 Pro가 전담하는 구조입니다. 이는 업계 전반의 '저가 기본 모델 + 프리미엄 플래그십' 패턴을 그대로 반영하며, 난이도에 따른 라우팅이 무조건 가장 큰 모델을 기본으로 쓰는 것보다 나은 이유이기도 합니다.

세 가지 실제 시나리오

1. 코딩 에이전트 및 Codex 스타일 워크플로우

-0731 빌드의 네이티브 Responses-API 및 Codex 지원과 Terminal-Bench(82.7) 및 DSBench-FullStack(68.7) 점수는 V4 Flash를 자율 코딩 에이전트를 위한 강력하고 저렴한 엔진으로 만들어 줍니다 — 이슈 수정, 리팩토링, 테스트 생성, 다단계 도구 사용.

2. 대량의 도구 사용 에이전트

빠른 첫 토큰 생성(~394ms), 높은 처리량(~184 tok/s), 1M 컨텍스트, 그리고 강력한 Toolathlon(70.3) 신뢰성은 검색, 자동화, 오케스트레이션 등 대규모로 도구를 호출하는 프로덕션 에이전트에 적합합니다.

3. 예산 내 장문서 처리

1M 토큰 전체 컨텍스트와 384K 출력은 로그, 코드베이스, 긴 보고서와 같은 매우 큰 입력을 한 번의 패스로 저렴하게 요약, 분석 또는 변환할 수 있습니다.

V4 Flash에 액세스하는 방법

DeepSeek API에서 V4 Flash를 직접 호출할 수 있습니다(모델 ID: code>deepseek-v4-flash/code>이며, Responses API, OpenAI ChatCompletions, Anthropic 스타일 인터페이스를 지원). 또는 벤더 중립적 엔드포인트를 통해 사용할 수도 있습니다. a href="https://www.orcarouter.ai/">OrcaRouter/a>는 단일 OpenAI 호환 엔드포인트(code>deepseek/deepseek-v4-flash/code>)를 통해 V4 Flash를 마크업 0%로 제공하며, 185개 이상의 다른 모델도 함께 제공합니다. 따라서 GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8, Kimi K3와 한 곳에서 벤치마킹하고, 각 요청을 작업에 가장 저렴한 모델로 라우팅할 수 있습니다. OpenAI 호환이므로 V4 Flash를 도입하거나 다른 모델로 전환하는 것은 재통합이 아닌 구성 변경일 뿐입니다.

한계와 솔직한 주의사항

V4 Flash는 플래그십이 아닌 효율성 모델입니다. 가장 어려운 추론에서는 V4 Pro 및 최고 수준의 서양 모델보다 뒤처집니다. 입력은 텍스트 전용입니다(네이티브 이미지 입력 없음). 여기 벤치마크 점수는 DeepSeek가 자체 하네스를 사용해 보고한 수치이므로, 정확한 숫자는 방향성으로만 간주하고 독립 평가는 다소 낮게 나올 것으로 예상하세요. 그리고 추론이나 에이전트 루프를 오래 실행하면 '토큰당 저렴함'이 '작업당 저렴함'을 의미하지 않습니다. 간단한 호출에서는 추론 노력과 도구 반복 횟수를 제한하세요. 프로덕션 트래픽을 투입하기 전에 자체 워크로드로 검증하세요.

자주 묻는 질문

DeepSeek V4 Flash란 무엇인가요?

V4 라인업의 DeepSeek 효율 모델: 1M 토큰 컨텍스트와 최대 384K 출력을 갖춘 284B / 13B 활성 혼합 전문가(MoE) 모델로, 빠르고 대규모의 에이전트 및 코딩 작업에 최적화되어 있습니다. 공식 릴리스(빌드 -0731)는 2026년 7월 31일에 출시되었습니다.

공식 릴리스에서 무엇이 변경되었나요?

아키텍처는 변경되지 않았습니다. 이는 에이전트, 코딩, 도구 호출 능력을 크게 개선하고 Codex 적응형 네이티브 Responses-API 지원을 추가하는 사후 훈련 업그레이드입니다. Flash API만 업그레이드되었으며 V4 Pro와 앱/웹은 동일합니다.

V4 Flash는 얼마인가요?

OrcaRouter에서 (0% 마크업) 입력 토큰 100만 개당 약 $0.15, 출력 토큰 100만 개당 $0.29, 캐시 읽기 약 $0.02이며, 이는 V4 Pro의 $0.44 / $0.88의 약 3분의 1입니다. 이번 릴리스에서 가격은 낮게 유지되었습니다.

V4 Flash는 에이전트 작업과 코딩 작업에서 얼마나 좋은가요?

DeepSeek는 강력한 점수를 보고했습니다: Terminal-Bench 2.1 82.7, Toolathlon(검증됨) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — 모든 수치는 공급업체 하네스 기준이므로 자체 작업에서 검증하세요.

V4 Flash와 V4 Pro는 어떻게 비교되나요?

Pro는 가장 어려운 추론과 코딩을 처리하는 훨씬 더 큰 플래그십이며, Flash는 약 1/3 가격에 강력한 에이전트/코딩 능력을 갖춘 효율성 계층입니다. 어려운 작업은 Pro로, 나머지는 모두 Flash로 라우팅하세요.

컨텍스트 창이란 무엇인가요?

전체 1,048,576개 토큰(약 1M), 최대 384K 출력 토큰.

V4 Flash는 멀티모달을 지원하나요?

아니요 — 입력은 텍스트 전용입니다. 추론, 도구 호출 및 JSON 출력을 지원합니다.

V4 Flash는 Responses API 및 Codex와 작동하나요?

네 — -0731 릴리스는 OpenAI ChatCompletions 및 Anthropic 스타일 인터페이스와 함께 기본 Responses-API 지원과 특정 Codex 적응을 추가합니다.

V4 Flash는 어떻게 사용하나요?

DeepSeek API를 통해 직접, 또는 OrcaRouter의 OpenAI 호환 엔드포인트에서 0% 마크업으로 (code>deepseek/deepseek-v4-flash/code>), 여기서 경쟁 모델 간 비교 및 라우팅도 할 수 있습니다.

결론

DeepSeek V4 Flash의 공식 출시는 저렴하고 빠른 방식을 유지하면서 훨씬 더 나은 에이전트로 거듭났습니다: 동일한 284B / 13B 활성 MoE와 1M 컨텍스트를 유지하되, 더 강력한 코딩 및 도구 사용을 위해 사후 학습되었고, 네이티브 Responses-API 및 Codex 지원을 제공합니다 — 가격은 동일한 약 $0.15 / $0.29입니다. 플래그십도 아니고 멀티모달도 아니지만, 에이전트 작업, 코딩, 장문 문서 작업의 대부분에 있어 2026년 최고의 토큰당 가성비 옵션 중 하나입니다. OrcaRouter 같은 0% 마크업의 OpenAI 호환 엔드포인트를 통해 사용해 보고, 가장 까다로운 소수의 요청만 플래그십으로 라우팅하세요 — 비용 면에서 이 조합을 따라잡기는 어렵습니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube