
DeepSeek V4 Flash 공식 출시: 저렴하고, 빠르며, 에이전틱한 1M 컨텍스트 모델에 대한 설명
DeepSeek V4 Flash는 DeepSeek V4 라인업의 저가형 모델로, 독립 평가 수치가 마침내 이를 따라잡았습니다. MathArena의 AIME 2026 세트에서 95.83%를 기록해 DeepSeek V4 Pro의 96.67%와 통계적으로 구분할 수 없는 수준이며, 문제당 비용은 약 9분의 1에 불과합니다. 공식 공개 베타 빌드인 -0731은 2026년 7월 31일에 출시되었으며, 4월 프리뷰와 동일한 아키텍처(2840억 파라미터의 mixture-of-experts 모델, 활성 파라미터 130억, 100만 토큰 컨텍스트)를 사용하면서도 에이전트 기능, 코딩 및 도구 호출 능력을 크게 개선한 추가 사후 학습(post-training)을 거쳤고, 네이티브 Responses-API 지원과 Codex 스타일 에이전트를 위한 맞춤 적응 기능을 갖췄습니다. 이 가이드에서는 이번 릴리스가 실제로 변경한 사항, 벤더와 독립 평가가 각각 말하는 내용, 추론량을 고려했을 때의 비용, 그리고 호출 방법을 다룹니다.
정확성 참고: 아래의 릴리스 세부 정보와 주요 에이전트 점수는 DeepSeek 공식 API 변경 로그(2026-07-31 기준)에서 가져온 것으로, 공급업체가 보고한 수치이며 DeepSeek 자체 하네스에서 실행된 결과입니다. 이는 방향성 지표로만 간주하고 자체 평가를 직접 실행하시기 바랍니다. 독립적인 수치가 등장하는 경우 출처를 명시했습니다: Intelligence Index 및 그 구성 요소는 Artificial Analysis, AIME 2026은 MathArena, 가격은 DeepSeek 자체 가격표에서 가져왔습니다. 게시된 평가가 아닌 단일 실무자의 보고에 근거한 내용은 해당 문장에 그 사실을 명시해 두었습니다. 사양과 가격은 변경될 수 있으므로, 구축 전에 반드시 확인하시기 바랍니다.
TL;DR. V4 Flash는 대형 DeepSeek V4 Pro의 비용 효율적인 형제 모델입니다: 1M 토큰 컨텍스트와 최대 384K 출력을 갖춘 284B / 13B 활성 MoE로, 대량 처리, 저지연, 에이전트 작업에 최적화되었습니다. 7월 31일 공식 출시는 사후 훈련 업그레이드로, 같은 크기이면서 에이전트 및 코딩 성능이 대폭 개선되었고, 네이티브 Responses-API와 Codex 지원도 추가합니다. DeepSeek는 강력한 에이전트/코딩 점수를 보고했습니다(예: Terminal-Bench 2.1 82.7, Toolathlon 70.3). 이후 Artificial Analysis는 Intelligence Index에서 -0731 빌드에 50점을 부여했습니다: 4월 프리뷰보다 10점, 훨씬 더 큰 V4 Pro보다 6점 높으며, Gemini 3.6 Flash와 동급입니다. 가격은 입력/출력 토큰 100만 개당 약 $0.15 / $0.29로, V4 Pro 가격의 약 3분의 1입니다. Flash API만 업그레이드되었고, V4 Pro와 DeepSeek 앱/웹은 변경되지 않았습니다. OrcaRouter에서는 OpenAI 호환 엔드포인트 하나를 통해 {{1}}0% 마크업{{/1}}으로 이용할 수 있습니다.
주요 시사점
• 공식 릴리스 (빌드 -0731, 2026년 7월 31일): 프리뷰의 사후 훈련 업그레이드 — 동일한 아키텍처, 훨씬 강력한 에이전트, 코딩 및 도구 사용.
- 아키텍처 변경 없음: 총 284B / 활성 13B (MoE), 1M-토큰 컨텍스트(1,048,576), 최대 384K 출력, 텍스트 전용 입력, 추론, 도구, JSON 지원.
• 새 기능: 네이티브 Responses API 지원 및 특정 Codex 적응; OpenAI ChatCompletions 및 Anthropic 스타일 인터페이스를 계속 지원합니다. 모델 ID deepseek-v4-flash.
• DeepSeek가 보고한 에이전트/코딩 성능 향상: Terminal-Bench 2.1 82.7, Toolathlon(검증됨) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
매우 저렴합니다: 1M 입력/출력 토큰당 약 $0.15 / $0.29 — V4 Pro의 $0.44 / $0.88의 대략 3분의 1 수준이며, DeepSeek는 캐시 적중 가격을 1M당 $0.0028로 책정하여 신규 입력보다 약 98% 저렴합니다. Flash API만 변경되었고, Pro와 앱/웹은 동일합니다.
공식 릴리스가 실제로 업그레이드한 것
V4 Flash는 2026년 4월 24일에 프리뷰로 처음 등장했습니다. 2026년 7월 31일 공식 릴리스(그 -0731 빌드, DeepSeek의 API 변경 로그 기준)는 명시적으로 아닌 새 아키텍처입니다: 총 및 활성 파라미터(284B / 13B)와 1M 컨텍스트는 변경되지 않았습니다. 변경된 것은 포스트트레이닝입니다 — DeepSeek에 따르면 핵심 에이전트, 코딩, 도구 호출 능력을 크게 개선한 추가 미세조정입니다. 두 가지 실용적인 추가 사항이 중요합니다: V4 Flash는 이제 Responses API를 기본 지원하며 Codex 스타일 코딩 에이전트에 특별히 적응되었지만, 여전히 OpenAI ChatCompletions 및 Anthropic 스타일 인터페이스를 지원합니다. 중요하게도, 이번 릴리스에서는 Flash API만 업그레이드되었으며 V4 Pro와 DeepSeek 앱/웹 경험은 변경되지 않았습니다. 팀에게 이는 마이그레이션 없이 동일한 가격에 에이전트 워크로드에 대한 드롭인 개선을 의미합니다.

아키텍처: 처리량을 위해 설계된 소형 활성 MoE
V4 Flash는 전문가 혼합(Mixture-of-Experts) 모델로, 총 파라미터 수는 약 2,840억 개지만 토큰당 활성화되는 파라미터는 약 130억 개에 불과합니다. 이렇게 낮은 활성 파라미터 수가 핵심입니다. 대규모 전문가 풀이 품질을 유지하는 동안 추론 속도를 빠르고 비용 효율적으로 유지해 주기 때문입니다. 컨텍스트 창은 전체 1,048,576개 토큰(약 100만 개)이며, 최대 출력은 매우 큰 384K입니다. 또한 이 모델은 추론(확장 사고), 도구 호출, 구조화된 JSON을 지원합니다. 입력은 텍스트 전용입니다. 높은 처리량, 낮은 지연 시간, 에이전트릭 작업이라는 설계 목표는 서빙 수치에서 드러납니다. OrcaRouter의 측정에 따르면 p50 기준 첫 토큰까지의 시간은 약 394밀리초이고, 출력 속도는 초당 약 184토큰입니다.
벤치마크: 공식 수치가 말하는 것
공식 릴리스는 DeepSeek 자체 하네스(최소 모드/최대 노력 설정)로 실행된 에이전틱 및 코딩 평가를 중점적으로 활용합니다. 헤드라인 결과를 해석하는 방법은 다음과 같습니다(모두 DeepSeek 보고 기준).
• Terminal-Bench 2.1: 82.7 — 실제 터미널에서의 에이전트형 명령줄/소프트웨어 작업을 평가합니다. 여기서 높은 점수는 모델이 단순히 질문에 답할 뿐 아니라 실제로 도구와 셸을 구동할 수 있음을 나타냅니다.
• Toolathlon (검증됨): 70.3 및 Automation Bench (공개): 25.1 — 도구 사용의 폭과 신뢰성, 종단 간 자동화. 도구 호출 신뢰성은 에이전트에게 성패를 좌우하는 특성이다.
• Cybergym: 76.7 — 보안/CTF 스타일의 에이전트 기반 문제 해결.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — 소프트웨어 엔지니어링 및 풀스택 코딩, 저장소 수준 생성부터 어려운 데이터 과학 작업까지. 강력한 DSBench-FullStack(68.7) 점수는 실용적이고 다중 파일 코딩 역량을 시사합니다.
• Agent Last Exam: 25.2 — 최고의 모델들조차 낮은 점수를 받을 만큼 의도적으로 어렵게 설계된 에이전트 추론 시험장. 절대적인 신호가 아닌 상대적인 신호로 유용하다.
독립적인 맥락을 위해, Artificial Analysis는 이제 -0731 빌드 자체를 평가했고 Artificial Analysis Intelligence Index에서 50점을 매겼습니다. 이는 대체하는 4월 프리뷰보다 10점 높고, 훨씬 더 큰 V4 Pro보다 6점 높으며, Gemini 3.6 Flash와 동급입니다. 구성 요소 결과는 GPQA Diamond 91%, AA-LCR 66%, Humanity's Last Exam 37%, SciCode 50%, τ³-Bench Banking 31%, CritPt 17%, 그리고 GDPval-AA v2에서 Elo 1559입니다. 그중 두 가지는 다시 볼 가치가 있습니다. Artificial Analysis는 Terminal-Bench 2.1을 79%로 측정했는데, DeepSeek가 보고한 82.7과 가깝지만 더 낮습니다. 이는 벤더 하네스 수치가 일반적으로 어긋나는 방향입니다. 그리고 AA-Omniscience에서 모델은 -16에 머물며 높은 측정 환각률을 보였습니다. 그래서 저렴하고 에이전틱한 이야기는 비지도 사실 회상까지 확장되지 않습니다. 이 모델을 더 날카롭게 읽는 방법은 다음과 같습니다: 달러당 추론은 강하고 쿼리당 지식은 약하다는 것입니다.
경시 수학: Flash가 Pro와 맞먹는 유일한 분야
V4 Flash의 추론 능력에 대한 가장 유용한 독립적 평가는 MathArena에서 나옵니다. MathArena는 갓 공개된 대회의 각 문제에 대해 모든 모델을 네 번씩 실행하고 문제별 결과 그리드를 공개합니다. 2026년 AIME(두 논문, 30개 문제, 각각 4회 실행)에서 V4 Flash는 최대 추론 모드로 95.83% ±3.58%를 기록했으며, DeepSeek V4 Pro는 96.67% ±3.21%를 기록했습니다. 이 두 구간은 거의 완전히 겹칩니다. 즉, 이 벤치마크에서 작은 모델은 플래그십 모델과 측정 가능한 성능 차이를 보이지 않습니다. 둘이 갈리는 지점은 비용 항목입니다. MathArena는 V4 Flash의 문제당 1회 실행 비용을 $0.009로, V4 Pro는 $0.082로 산정합니다. 동일한 정확도에서 약 9배 저렴한 셈이며, 이는 DeepSeek 자체 발표의 어떤 내용보다 효율성 등급을 뒷받침하는 강력한 근거입니다.
두 가지 유의사항을 함께 짚고 넘어가야 한다. MathArena는 두 DeepSeek 항목 모두에 오염(contamination) 경고를 표시했는데, 이는 대회가 공개된 이후 출시된 모델에 붙이는 라벨이다. 따라서 그 정확도의 일부는 추론이 아니라 회상(recall)에서 비롯된 것일 수 있다. 또한 MathArena가 테스트한 버전은 2026-04-24자 버전, 즉 4월 프리뷰이지 -0731 빌드가 아니다. 이 글을 쓰는 시점 기준으로 공식 릴리스에 대한 독립적인 AIME 2026 점수는 없으며, DeepSeek 자체 모델 카드에도 수학 벤치마크는 전혀 게재되어 있지 않고 에이전트(agentic) 벤치마크만 있을 뿐이다.
그리드는 또한 상한선이 어디에 있는지 보여줍니다. 보드에 있는 거의 모든 모델이 AIME 2026의 대부분 문제를 통과하지만, 이들을 가르는 문제는 15번입니다. 네 번의 실행 모두에서 그 문제를 푼 항목은 단 두 개뿐입니다 — 최상위 노력 설정의 GPT-5.5와 최대 설정의 Claude Opus 4.8입니다. V4 Flash는 그 문제에서 네 번 중 0점을 기록했고, V4 Pro도 마찬가지이며, GLM-5.2, Gemini 3.6 Flash, Kimi K2.6, Claude Opus 4.7도 동일합니다.
2026년 8월 5일의 한 보고서에 주목할 만한 가치를 부여하는 것은 바로 그 마지막 세부 사항입니다. AI 평론가 @teortaxesTex는 -0731 빌드가 AIME 2026 문제 15를 실제로 풀었으며, 약 1,006초와 대략 100,000개의 출력 토큰이 걸렸다고 게시했습니다. 또한 모델이 문제를 눈에 띄게 꼼수로 풀기 시작하다가 지름길을 포기하고 정직하게 푸는 모습을 보였다고 설명했습니다. 이것은 한 실무자의 단일 실행일 뿐, 벤치마크 결과가 아닙니다. 재현되지 않았고, 공개 리더보드에서 -0731 빌드를 평가한 적도 없으며, 단일 대화 기록은 평가가 아닙니다. 확인할 수 있는 것은 내적 일관성이며, 이는 타당합니다. Artificial Analysis는 이 모델의 출력 속도를 초당 약 116토큰으로 측정하며, 그 속도로 1,006초는 약 117,000토큰으로, 보고된 수치와 비슷한 범위입니다. 100,000토큰의 답변은 또한 DeepSeek이 예상하는 범위 내에 있습니다. DeepSeek은 높거나 최대 추론 노력 시 최대 384K 출력 토큰을 허용할 것을 권장하기 때문입니다. 두 수치 모두 이 모델에 대한 MathArena의 측정 평균(답변당 33,588 출력 토큰과 6분 50초)의 약 3배입니다. 이는 세트에서 가장 어려운 단일 문제에서 기대할 수 있는 수치입니다. 즉, 형태는 그럴듯하지만 결과는 검증되지 않았으며, 재현된다면 미리보기 빌드에 비해 실질적인 도약입니다. 미리보기 빌드는 그 문제를 네 번 중 네 번 모두 실패합니다.
가격 책정: 예산을 바꾸는 숫자
OrcaRouter는 공급업체 가격을 0% 마크업으로 통과시키는데, V4 Flash는 입력 토큰 100만 개당 약 $0.15, 출력 토큰 100만 개당 $0.29이며, DeepSeek는 이번 업그레이드에서 가격을 동결했습니다. 이는 DeepSeek V4 Pro의 $0.44 / $0.88의 약 3분의 1 수준입니다. 캐시 적중은 대부분의 예상보다 저렴합니다. DeepSeek는 캐시된 입력을 100만 개당 $0.0028로 책정했는데, 이는 비캐시 입력보다 약 98% 낮은 수준입니다. 그래서 안정적인 시스템 프롬프트로 동작하는 에이전트와 채팅을 계속 실행하는 데 드는 비용이 매우 낮은 이유가 바로 이것입니다. 실질적으로 월 1,000만 토큰을 입력 70% / 출력 30% 비율로 사용한다면 비용은 대략 몇 달러 수준입니다. 규모를 10억 토큰으로 늘리면 플래그십 모델과의 비용 격차는 재무팀이 주목하는 비용 항목이 됩니다.
하지만 추론 모델에서 요금표는 청구서에서 덜 흥미로운 절반이다. 예산을 좌우하는 것은 모델이 사용하기로 선택하는 토큰 수다. Artificial Analysis는 V4 Flash에서 전체 Intelligence Index를 실행하는 데 약 2억 600만 개의 출력 토큰이 필요했다고 밝혔는데, 이는 자사가 테스트하는 모델들의 중앙값인 약 1억 개의 두 배에 가깝다. 해당 기관은 이를 빠르지만 매우 장황한 모델로 설명한다. 가격을 매겨보면 10만 토큰짜리 응답 하나는 약 3센트, 384K 출력 상한 기준 한 응답은 약 11센트에 근접한다. 절대적인 금액으로는 저렴하지만, 짧은 답변보다 수백 배 비싼 셈이다. 그래서 추론 노력은 최대로 고정해 두는 품질 다이얼이 아니라 예산 레버인 것이다. Simon Willison의 직접 사용기 역시 반대 방향에서 같은 결론을 내린다. 기본 설정에서는 그의 테스트 생성 결과가 실망스러웠지만, 추론 노력을 높음으로 올리자 상당히 개선되었다. 헤드라인 요금이 곧 비용이라고 가정하기 전에 자신의 까다로운 요청을 먼저 측정하라.
V4 Flash가 들어맞는 위치: DeepSeek V4 사다리
DeepSeek의 V4 라인업은 사다리와 같습니다. V4 Pro는 플래그십으로, 훨씬 더 크고 최고 수준의 추론 및 코딩 모델입니다. V4 Flash는 효율성 계층입니다. 훨씬 적은 활성 컴퓨팅, 극히 일부의 가격, 그리고 이번 사후 학습 업그레이드 이후 진정으로 강력한 에이전트 및 코딩 능력을 갖추고 있습니다. DeepSeek가 Flash를 더 나은 에이전트로 만들기 위해 투자했다는 사실(Responses API, Codex 적응, 도구 사용 벤치마크)은 그들이 볼륨이 어디로 흐를 것이라고 예상하는지를 말해줍니다. 그러나 AIME 2026 수치는 Flash에 유리한 그 깔끔한 서사를 복잡하게 만듭니다. 경쟁 수학에서는 두 모델이 서로의 오차 범위 안에 있기 때문에, "어려운 문제는 Pro로 보내라"는 자동으로 옳은 것은 아닙니다. 솔직한 구분은 Pro가 지식의 폭과 가장 어려운 에이전트 작업을 사는 것이지, 어려운 수학 문제에 대한 더 나은 기회를 사는 것이 아니라는 것입니다. 그래서 자신의 작업에서 측정된 난이도에 따른 라우팅이 가장 큰 모델을 기본으로 선택하는 것보다 낫습니다.

세 가지 실제 시나리오
1. 코딩 에이전트 및 Codex 스타일 워크플로우
-0731 빌드의 네이티브 Responses-API 및 Codex 지원과 Terminal-Bench(82.7) 및 DSBench-FullStack(68.7) 점수는 V4 Flash를 자율 코딩 에이전트를 위한 강력하고 저렴한 엔진으로 만들어 줍니다 — 이슈 수정, 리팩토링, 테스트 생성, 다단계 도구 사용.
2. 대량의 도구 사용 에이전트
빠른 첫 토큰 생성(~394ms), 높은 처리량(~184 tok/s), 1M 컨텍스트, 그리고 강력한 Toolathlon(70.3) 신뢰성은 검색, 자동화, 오케스트레이션 등 대규모로 도구를 호출하는 프로덕션 에이전트에 적합합니다.
3. 예산 내 장문서 처리
1M 토큰 전체 컨텍스트와 384K 출력은 로그, 코드베이스, 긴 보고서와 같은 매우 큰 입력을 한 번의 패스로 저렴하게 요약, 분석 또는 변환할 수 있습니다.
V4 Flash에 액세스하는 방법
DeepSeek API에서 V4 Flash를 직접 호출하거나(model id deepseek-v4-flash; Responses API, OpenAI ChatCompletions, Anthropic 스타일 인터페이스를 지원함) 벤더 중립 엔드포인트를 통해 호출할 수 있습니다. OrcaRouter는 V4 Flash를 0% 마크업으로 단일 OpenAI 호환 엔드포인트(deepseek/deepseek-v4-flash)를 통해 200여 개의 다른 모델과 함께 제공하므로, GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max, Kimi K3와 한곳에서 벤치마킹하고 각 요청을 작업에 가장 저렴한 모델로 라우팅할 수 있습니다. 가격이 마크업이 아닌 통과 방식이므로 DeepSeek의 가격 변경이 적용되는 날 청구서에 반영됩니다. 또한 인터페이스가 OpenAI 호환이므로 V4 Flash를 채택하거나 일주일간 측정 후 다른 모델로 전환하는 것은 재통합이 아닌 구성 변경일 뿐입니다.

한계와 솔직한 주의사항
V4 Flash는 플래그십이 아닌 효율성 모델이다. 그러나 독립적인 데이터 덕분에 그 경계는 '어려운 일에 더 약하다'는 표현보다 더 구체적으로 정의되었다. AIME 2026에서는 V4 Pro와 신뢰 구간 내에서 일치하는 성능을 보였다. 분명히 뒤처지는 부분은 지식의 폭(AA-Omniscience -16, 높게 측정된 할루시네이션 비율)과 가장 까다로운 에이전틱 작업이다. 입력은 텍스트 전용이며 기본 이미지 입력을 지원하지 않는다. 주요 에이전틱 점수는 DeepSeek가 자체 하네스에서 보고한 값이며, 독립 연구소가 재실행한 유일한 수치는 더 낮게 나왔다(Artificial Analysis는 Terminal-Bench 2.1을 보고된 82.7% 대신 79%로 측정). 따라서 공급업체 수치는 방향성 참고값으로 간주해야 한다. 그리고 '토큰당 저렴함'이 '작업당 저렴함'을 의미하지는 않는다. 이 모델은 측정 가능할 정도로 장황하므로, 간단한 호출에서는 기본적으로 최대 추론 노력을 켜두기보다 추론 노력과 도구 반복 횟수를 제한하라. 프로덕션 트래픽을 투입하기 전에 자체 워크로드에서 검증하라.
자주 묻는 질문
DeepSeek V4 Flash란 무엇인가요?
V4 라인업의 DeepSeek 효율 모델: 1M 토큰 컨텍스트와 최대 384K 출력을 갖춘 284B / 13B 활성 혼합 전문가(MoE) 모델로, 빠르고 대규모의 에이전트 및 코딩 작업에 최적화되어 있습니다. 공식 릴리스(빌드 -0731)는 2026년 7월 31일에 출시되었습니다.
공식 릴리스에서 무엇이 변경되었나요?
아키텍처는 변경되지 않았습니다. 이는 에이전트, 코딩, 도구 호출 능력을 크게 개선하고 Codex 적응형 네이티브 Responses-API 지원을 추가하는 사후 훈련 업그레이드입니다. Flash API만 업그레이드되었으며 V4 Pro와 앱/웹은 동일합니다.
V4 Flash는 얼마인가요?
OrcaRouter에서 입력 토큰 100만 개당 약 0.15달러, 출력 토큰 100만 개당 0.29달러입니다(마크업 0%). 이는 V4 Pro의 0.44달러/0.88달러의 약 1/3입니다. 캐시 적중은 100만 개당 0.0028달러로, 새 입력보다 약 98% 낮습니다. 이번 릴리스에서 가격은 그대로 유지되었습니다. 토큰 규모와 속도 모두를 예산에 반영하세요: 이는 장황한 추론 모델이며, 100,000토큰 응답의 비용은 약 3센트입니다.
V4 Flash는 에이전트 작업과 코딩 작업에서 얼마나 좋은가요?
DeepSeek는 강력한 점수를 보고했습니다: Terminal-Bench 2.1 82.7, Toolathlon(검증됨) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — 모든 수치는 공급업체 하네스 기준이므로 자체 작업에서 검증하세요.
V4 Flash는 경시대회 수학에 어떤가요?
가격이 시사하는 것보다 더 낫다. MathArena의 AIME 2026 그리드에서 4월 프리뷰 빌드는 30개 문제로 구성된 4회 실행에서 95.83%를 기록했다 — V4 Pro의 96.67% 신뢰 구간 안에 들며, 문제당 비용은 약 9분의 1에 불과하다 — 비록 MathArena는 두 모델 모두에 오염 가능성이 있다고 지적하며, 아직 -0731 빌드에 대해서는 점수를 매기지 않았다. 그것이 결코 풀지 못하는 유일한 문제는 문제 15인데, 이 문제는 오직 GPT-5.5(초고강도 설정)와 Claude Opus 4.8(최대 설정)만이 안정적으로 푼다.
V4 Flash와 V4 Pro는 어떻게 비교되나요?
Pro는 가장 어려운 추론과 코딩을 처리하는 훨씬 더 큰 플래그십이며, Flash는 약 1/3 가격에 강력한 에이전트/코딩 능력을 갖춘 효율성 계층입니다. 어려운 작업은 Pro로, 나머지는 모두 Flash로 라우팅하세요.
컨텍스트 창이란 무엇인가요?
전체 1,048,576개 토큰(약 1M), 최대 384K 출력 토큰.
V4 Flash는 멀티모달을 지원하나요?
아니요 — 입력은 텍스트 전용입니다. 추론, 도구 호출 및 JSON 출력을 지원합니다.
V4 Flash는 Responses API 및 Codex와 작동하나요?
네 — -0731 릴리스는 OpenAI ChatCompletions 및 Anthropic 스타일 인터페이스와 함께 기본 Responses-API 지원과 특정 Codex 적응을 추가합니다.
V4 Flash는 어떻게 사용하나요?
DeepSeek의 API를 통해 직접, 또는 OrcaRouter의 OpenAI 호환 엔드포인트를 통해 0% 마크업으로 (deepseek/deepseek-v4-flash), 여기서 경쟁 모델 간 비교 및 라우팅도 할 수 있습니다.
결론
DeepSeek V4 Flash의 공식 출시는 저렴하고 빠른 공식을 유지하면서 훨씬 더 나은 에이전트로 거듭납니다: 동일한 284B / 13B 활성 MoE와 1M 컨텍스트에, 더 강력한 코딩 및 도구 사용을 위한 사후 학습을 적용했고, 네이티브 Responses-API 및 Codex 지원을 갖추면서도 동일한 ~$0.15 / $0.29 가격을 유지합니다. 이제 독립적인 수치들이 대부분의 주장을 뒷받침합니다 — Artificial Analysis는 -0731 빌드를 지능 측면에서 Gemini 3.6 Flash와 동급으로 평가했으며, MathArena는 프리뷰 빌드가 AIME 2026에서 V4 Pro에 필적하는 성능을 문제당 1/9 비용으로 달성한다고 밝혔습니다. 낮은 요금이 사주지 못하는 것은 지식의 폭이나 장황함에 대한 면죄부입니다: 이 모델은 중간 수준 모델의 약 두 배에 달하는 토큰 예산으로 추론하므로, 작업별 청구액은 표면 가격보다는 허용하는 추론 노력에 더 크게 좌우됩니다. OrcaRouter와 같은 0% 마크업의 OpenAI 호환 엔드포인트로 실행하여, 자체적인 까다로운 요청이 실제로 얼마를 소비하는지 측정하고, 측정 결과 반드시 필요하다고 나올 때에만 플래그십으로 라우팅하십시오.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
