
DeepSeek V4 Flash vs V4 Pro: 효율성 티어 vs 플래그십 비교
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 100만 토큰당 · 24 tok/s
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1328 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 2657 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
DeepSeek의 V4 라인은 두 단계 사다리입니다: V4 Flash, 저렴하고 빠른 효율성 모델 — 이제 공식 -0731 릴리스로 훨씬 강력한 에이전트를 제공하며 — 그리고 V4 Pro, 가장 어려운 추론과 코딩을 위한 대형 플래그십 모델로, 공식 GA 빌드 (0813) 2026년 8월 12일에 전환되었습니다. 흥미로운 점은 실무 작업에서 둘 사이의 차이가 얼마나 작은지, 가격에서는 얼마나 큰지입니다. 이 가이드는 두 모델을 성능, 비용, 속도, 적합성 측면에서 비교하며, 모든 수치는 출처를 명시했습니다.
정확도 참고: V4 Flash의 에이전트/코딩 점수는 DeepSeek이 보고한 것입니다(공식 변경 로그, 2026-07-31, DeepSeek 하네스). V4 Pro의 GA(0813) 점수 역시 동일한 하네스에서 DeepSeek이 보고한 것이며, 0813 빌드에 대한 독립적 평가는 아직 게시되지 않았습니다. 가격은 2026년 8월 12일 기준이며, GA 가격 인하는 OrcaRouter에서 0% 마크업으로 적용됩니다. 벤더 하네스 수치는 낙관적으로 나오므로 자체 작업에서 검증하세요.
{{1}}TL;DR.{{/1}} {{2}}V4 Flash는 토큰 100만 개당 $0.08 / $0.18인 284B / 13B 활성화 MoE입니다. V4 Pro는 훨씬 더 큰 플래그십 모델로, 현재 공식 GA 빌드(0813)에서 $0.435 / $0.87에 제공되며, Flash 가격의 약 5배 수준입니다. 이는 8월 가격 인하 이전의 약 14배에서 낮아진 것입니다.{{/2}} {{3}}실용적인 코딩에서 Flash는 Pro와 몇 포인트 차이밖에 나지 않습니다(예: SWE-bench Verified ~79% 대 ~80.6%, 애그리게이터 기준). 또한 -0731 후속 훈련 업그레이드로 Flash는 그 자체로 강력한 에이전트가 되었습니다.{{/3}} {{4}}가장 어려운 추론과 까다로운 다중 파일 코딩에는 Pro를 사용하고, 대량의 일반 작업에는 Flash를 사용하세요. 난이도에 따라 라우팅하면 Pro 품질의 대부분을 약 5분의 1 비용으로 얻을 수 있습니다.{{/4}}
주요 시사점
• 크기 및 가격: Flash는 $0.08 / $0.18에 284B / 13B-활성; Pro는 $0.435 / $0.87의 훨씬 더 큰 플래그십입니다. Flash는 가격이 대략 5분의 1이며, Pro의 GA 가격 인하로 이전의 ~14배 격차가 약 5배로 좁혀졌습니다.
• 코딩 격차는 작습니다: 집계 기준 SWE-bench Verified에서 Flash가 약 79%, Pro(프리뷰 시절)가 약 80.6%입니다(GA 빌드는 아직 독립적인 점수가 없음); DeepSeek의 하네스에서는 GA Pro가 Terminal-Bench 2.1에서 87.9, Flash가 82.7을 기록했습니다.
• 둘 다 1M-토큰 컨텍스트와 384K 출력을 공유합니다. 둘 다 텍스트 전용이며, 추론, 도구, JSON을 지원합니다.
• Flash는 서빙 속도가 더 빠르고 비용이 더 저렴합니다(p50 TTFT ~394 ms, ~184 tok/s). Pro는 속도를 희생하는 대신 최고 성능을 제공합니다.
• 모범 사례: 난이도별 라우팅 — 대량은 Flash, 어려운 소수는 Pro
각 모델이 무엇인지
V4 Flash는 효율성 등급입니다: 총 284B 파라미터 중 약 13B만 활성화되는 혼합 전문가(MoE) 모델로, 1M 토큰 컨텍스트, 최대 384K 출력을 지원하며, 대용량·저지연 에이전트 작업에 최적화되어 있습니다. 그 공식 -0731 릴리스(2026년 7월 31일)는 에이전트, 코딩, 도구 사용을 개선하고 네이티브 Responses-API 및 Codex 지원을 추가한 사후 학습 업그레이드입니다. V4 Pro는 DeepSeek의 플래그십 모델로, 비용보다 최대 성능이 중요한 가장 어려운 추론과 코딩을 위해 설계된 훨씬 더 큰 모델입니다. 4월부터 프리뷰로 운영되다가 2026년 8월 12일 훨씬 낮은 가격으로 공식 GA 빌드로 전환되었습니다. 두 모델 모두 동일한 V4 제품군에 속하며 1M 컨텍스트, 텍스트 전용 입력, 추론/도구/JSON 지원을 공유합니다.

성능: Flash는 Pro에 얼마나 가깝나요?
가격 격차가 시사하는 것보다 더 가깝다. 적어도 실용적인 코딩 측면에서는 그렇다. 애그리게이터 평가에 따르면 V4 Flash (Max)는 실제 GitHub 이슈를 해결하는 SWE-bench Verified에서 약 79.0%를 기록했으며, 이는 프리뷰 시기 테스트된 V4 Pro의 약 80.6%와 비교된다. GA 빌드(0813)는 너무 새로워 독립 점수가 아직 발표되지 않았다. 따라서 현재 가능한 최선의 Pro 비교는 DeepSeek 자체 하네스인데, GA 빌드는 Terminal-Bench 2.1 87.9와 DeepSWE 62.7을 기록했고, Flash의 -0731 수치는 82.7과 54.4였다(모두 DeepSeek 보고). Pro가 앞서는 영역은 가장 어려운 최상위 작업들이다: 가장 복잡한 다단계 추론, 가장 까다로운 다중 파일 코딩, 그리고 더 큰 활성 파라미터 예산이 실질적으로 도움이 되는 작업이 여기에 해당한다. 작업의 대부분이 "어렵지만 최첨단은 아닌" 수준이라면 Flash로 충분하다. Pro는 진정한 최첨단 소수 작업을 위해 아껴두라.
가격과 속도: Flash의 결정적 우위
이것이 두 제품이 가장 크게 갈리는 지점이자, 계산이 방금 바뀐 지점입니다. Flash는 입력/출력 토큰 100만 개당 $0.08 / $0.18입니다. V4 Pro의 공식 GA 빌드(0813)는 $0.435 / $0.87로, Flash 가격의 약 5배입니다. 여전히 실질적인 프리미엄이지만, 가격 인하 전 약 14배 격차의 일부에 불과합니다. 이전 deepseek-v4-pro 리스팅은 $1.168 / $2.336이었으므로, GA 빌드는 약 63% 저렴합니다. 입력 비중 70%로 월 1,000만 토큰을 사용할 경우, Flash는 약 $1.10, Pro는 약 $5.66이 듭니다. 수십억 토큰 규모로 확장해도 이 비율은 유지됩니다. Flash는 또한 처리량에 최적화되어 있어(p50 TTFT ~394 ms, ~184 tok/s), 지연 시간에 민감하고 대량 요청을 처리하는 에이전트에 더 적합합니다. Pro의 프리미엄은 속도나 절감이 아닌 최고 성능을 위한 것입니다. 하지만 격차가 ~14배가 아닌 ~5배로 줄어들면서, 최상위 성능 여유분의 가격은 크게 내려왔습니다.
올바른 패턴: 난이도별 라우팅
하나를 선택할 필요가 없습니다. 가장 저렴하면서도 품질이 높은 구성은 쉽거나 중간 난이도 대부분의 요청을 Flash로 보내고, 가장 어려운 요청만 Pro로 에스컬레이션합니다. 둘 다 동일한 제품군이고 동일한 컨텍스트와 인터페이스를 공유하므로 라우팅은 매끄럽습니다. 또한 -0731 업그레이드를 통해 에스컬레이션이 필요하기 전에 Flash가 중간 계층을 더 많이 처리할 수 있습니다. 잘 구현하면 난이도별 라우팅은 Pro 품질의 대부분을 Flash 비용에 가깝게 제공하며, GA 가격 인하로 인해 가끔 발생하는 Pro 에스컬레이션 비용이 미리보기 기간보다 눈에 띄게 저렴해졌습니다.

어느 것을 선택해야 할까요?
V4 Flash를 선택하세요, 만약…
비용과 속도가 중요한 대규모 에이전트형, 코딩, 또는 장문 문서 워크로드를 실행하고 있고, '플래그십에 준하는' 품질이면 충분한 경우 — -0731 업그레이드 이후에는 이 조건이 매우 광범위하게 적용됩니다.
V4 Pro를 선택하세요, 만약…
가장 어려운 추론과 가장 까다로운 다중 파일 코딩에서 최대 성능이 필요하고, 그 최상위 성능 여유를 위해 Flash 가격의 약 5배를 기꺼이 지불할 의향이 있다면 — 이는 미리보기 시절 가격 책정이 부과했던 약 14배 프리미엄보다 훨씬 수용하기 쉬운 요구입니다.
둘 다 하나의 엔드포인트를 통해 사용하세요.
두 모델 모두 OrcaRouter에서 0% 마크업으로 단일 OpenAI 호환 엔드포인트를 통해 제공됩니다 — Flash는 deepseek/deepseek-v4-flash-0731로, Pro는 공식 deepseek/deepseek-v4-pro-0813 GA 빌드로 제공됩니다. 따라서 난이도별 라우팅을 구성 옵션으로 구현하고, 자체 작업에서 두 모델을 벤치마킹하고, 재통합 없이 트래픽을 전환할 수 있습니다. 이것이 Flash의 비용 절감 효과를 누리면서 어려운 소수의 작업에는 Pro를 대기시켜 두는 가장 간단한 방법입니다.

자주 묻는 질문
V4 Flash가 V4 Pro만큼 좋은가요?
실용적인 코딩에서는 거의 비슷하다 — 집계 기준 SWE-bench Verified ~79% 대 ~80.6% (Pro는 프리뷰 시절 수치이며, GA 빌드는 아직 독립 점수가 없음). 가장 어려운 추론과 가장 복잡한 코딩에서는 Pro가 앞선다. 대부분의 워크로드에서는 -0731 업그레이드 이후 Flash로 충분하다.
V4 Flash는 얼마나 더 저렴한가요?
Flash는 Pro 가격의 약 5분의 1입니다: 토큰 100만 개당 $0.08 / $0.18 대 GA Pro의 $0.435 / $0.87. Pro의 8월 가격 인하 전에는 격차가 약 14배였으며, 지금은 약 5배입니다.
그들은 같은 컨텍스트 창을 공유하나요?
네 — 둘 다 1M 토큰 컨텍스트(1,048,576)와 최대 384K 출력을 제공합니다.
어느 것이 더 빠릅니까?
Flash는 설계상 p50 기준 첫 토큰 도달 시간이 약 394ms이고 초당 ~184토큰으로, 대용량·저지연 사용 사례에 최적화되어 있습니다.
둘 다 함께 사용할 수 있나요?
예 — OrcaRouter의 단일 엔드포인트를 통해 난이도에 따라 라우팅하세요: Flash는 대량 작업용, Pro는 가장 어려운 작업용입니다.
결론
V4 Flash 대 V4 Pro는 효율성 대 최고 성능의 문제입니다. Flash는 Pro의 실용적인 코딩 능력 대부분을 제공하며, -0731 업그레이드 이후에는 진정으로 강력한 에이전트도 갖추고 있습니다. 가격은 약 5분의 1이면서 속도는 더 빠릅니다. Pro의 공식 GA 빌드는 가장 어려운 작업을 위한 플래그십이며, 가격 인하 — $0.435 / $0.87로 낮아져 이전의 14배가 아닌 Flash의 약 5배 수준 — 덕분에 최상위 성능이 그 어느 때보다 저렴해졌습니다. 현명한 선택은 둘 중 하나를 고르는 것이 아니라, 난이도에 따라 OrcaRouter 같은 하나의 엔드포인트로 라우팅하는 것입니다. 그렇게 하면 대량 작업은 Flash에서 저렴하게 처리되고, 어려운 소수만 Pro 비용을 지불하게 됩니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
