
DeepSeek V4 Flash Vision (Exp) API 출시: V4-Flash와 동일한 가격, 이제 시각 기능 탑재
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
DeepSeek V4 Flash Vision (Exp)이 오늘, 2026년 8월 21일, DeepSeek API 플랫폼에서 출시되었습니다. 이번 발표에서 가장 중요한 숫자는 벤치마크가 아니라 가격입니다. 이 실험적 비전 모델은 순수 텍스트 성능을 완전히 그대로 갖춘 텍스트 전용 워크호스인 DeepSeek V4 Flash와 정확히 동일한 토큰 요율로 청구됩니다. 이로써 DeepSeek 자체 API가 처음으로 이미지를 수용하게 되었으며, 1M 컨텍스트 에이전트를 실행하는 가장 저렴한 방법이 무료로 멀티모달이 되었음을 의미합니다.
실제로 출시된 것
DeepSeek V4 Flash Vision (Exp)는 실험적 멀티모달 모델로, 모델 ID deepseek-v4-flash-vision-exp를 사용해 접근할 수 있습니다. 텍스트와 이미지를 입력으로 받아 텍스트를 출력하며, 1M 토큰 컨텍스트 창과 384K 최대 출력을 지원하고 추론 및 비추론 모드 모두에서 작동합니다. Chat Completions 형식, Anthropic 스타일 Messages, Responses 형식을 지원하며, 이 세 가지는 에이전트 프레임워크가 맞춤 어댑터 없이 통합하는 데 필요한 조합입니다.
이미지 입력의 경우 DeepSeek은 JPEG, PNG, GIF, WebP를 지원하며, base64 인라인, 외부 URL, 또는 새로운 Files API를 통해 업로드된 파일의 세 가지 방식으로 전달할 수 있습니다. 아직 비디오나 오디오 입력은 없습니다. 여기서 "비전"은 정지 이미지만을 의미합니다.

DeepSeek의 자체 포지셔닝(릴리스 노트 기준)에 따르면, 순수 텍스트 역량(에이전트, 추론, 세계 지식)은 공식 DeepSeek V4 Flash 릴리스와 대등한 수준이며, 멀티모달 에이전트 역량은 큰 도약을 이루어 Opus-4.8에 근접했다고 한다. 이는 재현되지 않은 벤더(vendor)의 주장으로, 주의 깊게 읽어볼 가치가 있다. 그 뒤에 숨은 벤치마크 세부 내용이 헤드라인보다 더 흥미롭기 때문이다.
벤치마크 점프가 보기보다 더 큰 이유
다음의 모든 수치는 DeepSeek 자체의 수치로, 오늘 출시 노트에서 발표된 것이며 독립적으로 검증되지 않았습니다. 스크린샷과 이미지가 포함된 에이전트 벤치마크에서 텍스트 전용 DeepSeek V4 Flash는 이를 읽지 않습니다. 단순히 작업의 멀티모달 부분을 무시할 뿐입니다. DeepSeek V4 Flash Vision (Exp)는 실제로 이미지를 보기 때문에 델타가 그렇게 큰 것입니다:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)
• 에이전트 최종 시험 — Vision-Exp 27.3 대 V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 대 V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (텍스트 전용 V4-Flash는 시도할 수 없음)
• ZeroBench Pass@5 — Vision-Exp 35.0 (텍스트 전용 V4-Flash는 시도할 수 없음)

그 숫자들 중 두 개는 다시 살펴볼 가치가 있습니다. Agents' Last Exam에서 Vision-Exp(27.3)는 Opus-4.8(25.7)을 근소하게 앞섰고, DeepSWE에서도 Opus-4.8(59.3 대 58.0)을 이겼습니다. 바로 이것이 'Opus-4.8에 가깝다'는 말이 실제로 근거하는 바입니다. 하나의 대표적인 결과가 아니라, 화면을 보는 것이 최첨단 멀티모달 모델과의 격차를 대부분 좁히면서 가격은 약 한 자릿수 정도 더 저렴한 일련의 에이전트 벤치마크들 말입니다.
이미지의 가격, 소수점까지
이미지는 청구를 위해 토큰화되며(각각 최대 384토큰), 이후 DeepSeek V4 Flash와 동일한 토큰당 요율로 과금됩니다. DeepSeek는 2026년 8월 16일부터 모든 모델을 피크/오프피크 요금제로 전환했으므로, 정확한 금액은 호출 시점에 따라 달라집니다:
• 입력, 캐시 미스 — $0.22 / 1M 토큰 (오프피크), $0.44 (피크)
입력, 캐시 적중 — 오프피크 $0.007/1M 토큰, 피크 $0.014/1M 토큰
• 출력 — 1M 토큰당 $0.66 (비수기), $1.32 (피크)
• 피크 시간대 — 01:00–04:00 및 06:00–10:00 UTC (그 외 모든 시간은 비피크)
계산을 해 보면 비전의 비용은 거의 사라진다. 입력 기준으로 384토큰 상한의 이미지 하나는 비수기에 약 0.0085센트, 피크 시간대에 0.017센트이다. 단일 실행에서 스크린샷 50장을 읽는 에이전트는 모델이 첫 출력 토큰을 작성하기 전에 입력 토큰으로 약 0.5센트를 추가하는 셈이다. DeepSeek는 또한 추론 전에 해상도를 제한한다: 낮은 세부 수준은 512×512로 크기를 조정하고, 높음/원본은 이미지를 사전 확장(작은 이미지는 약 384×384까지, 큰 이미지는 약 800×800으로 축소)하므로, 고해상도 원본이 네이티브 픽셀 수로 모델에 입력되지 않는다.
조연: 무료 Files API 및 Harness 0.1.1
모델과 함께 두 가지 인프라 구성 요소가 출시되었습니다. Files API는 공개되었으며 무료로 사용할 수 있습니다. 이미지를 한 번 업로드하면 file_id로 참조하고, 바이트를 다시 전송하지 않고도 여러 요청에 걸쳐 재사용할 수 있습니다. 이는 여러 턴에 걸쳐 페이지를 컨텍스트에 유지하는 브라우징 에이전트에게 의미 있는 기능입니다. 그리고 같은 날 출시된 DeepSeek Harness 0.1.1은 새 모델을 별도 설정 없이 지원하므로, DeepSeek 에이전트 워크로드를 벤치마킹하고 구동하는 하네스가 즉시 이 모델을 대상으로 삼을 수 있습니다.
프로덕션 주의사항, 쉽게 풀어 말하면
이것은 실험적인 모델입니다. DeepSeek은 이를 명시적으로 그렇게 표시하며, GA 날짜를 발표하지 않았고, 프로덕션에서 직접 실행하는 것을 권장하지 않습니다. 명시된 계획은 피드백을 반영하여 반복하고 나중에 안정적인 버전을 출시하는 것입니다. 실질적인 결과는 텍스트 두뇌가 검증되었다는 것입니다 — V4-Flash를 구동하는 것과 동일한 가중치 계열입니다 — 그러나 비전 경로는 새로운 코드이며, DeepSeek 외부의 누구도 대규모로 스트레스 테스트를 하지 않았습니다.
바로 그런 상황에서 라우팅 계층이 제 역할을 합니다. OrcaRouter에서는 deepseek/deepseek-v4-flash-vision-exp와 deepseek/deepseek-v4-flash가 모두 하나의 API로 제공되며, DeepSeek의 공시 가격이 마크업 없이 그대로 적용됩니다. 이미지가 포함된 트래픽은 실험 모델로 보내는 동시에, 동일한 구성에서 오류나 타임아웃이 발생하는 즉시 폴백으로 자동 장애 조치(failover)되도록 설정할 수 있습니다. 이를 통해 "새 코드" 문제 전체의 위험이 크게 줄어듭니다. 또한 라우팅 DSL을 사용하면 실제로 이미지가 포함된 호출만 비전 모델로 보내고 순수 텍스트 트래픽은 DeepSeek V4 Flash에 유지할 수 있어, 벤치마크 이점이 실제로 존재하는 부분에서는 그 이점을 확보하고 그렇지 않은 부분에서는 추가 비용을 지불하지 않습니다.

다음에 볼 콘텐츠
실험적 출시에서 흔히 던져지는 질문들은 대개 정해져 있다. DeepSeek V4 Flash Vision (Exp)는 언제 GA에 도달하며, 가격은 유지될까? 비디오나 오디오 입력이 뒤따를까 — 현재 이 모델은 정지 이미지만 지원하므로, 움직이는 미디어에서는 대형 멀티모달 프런티어 모델들이 경쟁자 없이 남아 있다. 그리고 독립 평가(ApexBench 또는 Terminal-Bench에서의 첫 번째 제3자 실행)가 공개된 수치를 재현할까? 흥미로운 점은 모든 벤치마크가 하락한다 해도, 이미 비용 효율적인 주장 — 텍스트 가격의 비전 — 은 벤치마크 주장이 아니라 가격 사실이므로 재현이 필요 없다는 것이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
