히어로 타이틀 카드에는 'DeepSeek V4.1 Flash 가격'이 적혀 있고, '$0.15 입력, $0.60 출력, $0.003 캐시 적중'이라는 문구, '1M 토큰당, 오프피크. 피크 시간에는 모든 요금이 두 배.'라는 캡션, 그리고 '캐시 적중: 미스보다 50배 저렴', '1M 토큰 컨텍스트', '오픈 가중치, MIT 라이선스'가 적힌 세 장의 카드가 있습니다.
Guides & Insights

DeepSeek V4.1 Flash 요금: 전체 요금표, 그리고 청구서를 좌우하는 캐시 적중 수치

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

DeepSeek V4.1 Flash는 2026-09-10부터 일반 제공되었으며, 오늘 기준 공개 요금표는 모델 시장 최상위 계층에서 가장 저렴하다: 입력 토큰 백만 개당 $0.15, 출력 백만 개당 $0.60, 캐시 적중 시 백만 개당 $0.003이다. 이 세 수치는 비피크(off-peak) 열이다. DeepSeek의 평일 피크 시간대에는 캐시 적중을 포함해 세 수치 모두 두 배가 된다. 중요한 비교는 DeepSeek 자체의 노후화된 플래그십과의 비교가 아니라 — DeepSeek-V4-Pro-0813은 비피크 기준 백만 개당 $0.66 / $1.98로 책정되어 있어 Flash는 입력에서 자사 형제 모델보다 약 4배 저렴하다 — 구매자들이 실제로 가격을 비교하는 폐쇄형 프런티어 계층, 즉 GPT-5.6 Sol, Claude Opus 5, Gemini 3.8 Flash와의 비교다. 이들은 각각 토큰당 약 10배 더 많이 청구한다.

숫자에 앞서 한 가지 정정이 있습니다. 이번 출시에 앞서 나온 유출이 아직도 떠돌고 있기 때문입니다. GA 이전에 퍼진 수치들은 가격 인하가 “내일” 적용된다고 설명했습니다. 가격은 사실이지만, 그렇게 설명한 것은 사실이 아니었습니다. V4.1 Flash는 2026-09-10에 출시되었으며 이 요금은 이미 시행 중이었고, DeepSeek 자체 변경 로그에는 이번 인하가 나중의 인하가 아니라 릴리스의 일부로 기록되어 있습니다. 아래의 모든 내용은 오늘, 2026-09-16 기준 DeepSeek의 실시간 가격 페이지에서 그대로 읽어낸 것입니다.

전체 요금표, 2026-09-16 기준

DeepSeek는 현재 SKU를 다루는 시트 하나를 공개하며, 모든 라인 항목은 피크 열과 오프피크 열로 나뉩니다. 모델 id deepseek-flash의 경우, 이는 DeepSeek-V4.1-Flash를 제공하며, 공개된 요금은 다음과 같습니다:

입력, 캐시 미스 — 1M 토큰당 비수기 $0.15, 피크 시간대 $0.30

입력, 캐시 적중 — 비피크 시간대 100만 토큰당 $0.003; 피크 시간대 100만 토큰당 $0.006

출력 — 비피크 시간대 1M 토큰당 $0.60, 피크 시간대 1M당 $1.20

컨텍스트 윈도우 — 1M 토큰, 최대 출력 384K

동시성 제한 — Flash SKU에서 동시 요청 2,500개

레거시 모델 IDdeepseek-v4-flashdeepseek-v4-flash-vision-exp는 별도 제품으로는 종료되었지만 여전히 V4.1 Flash로 라우팅되며 Flash 가격으로 청구됩니다

첫 두 줄 사이의 격차가 이 시트의 모든 것을 말해줍니다. 오프피크 시간대에 캐시 히트는 캐시 미스보다 비용이 50배 적습니다 — 98% 할인이며, Artificial Analysis도 자사 비용 모델에서 이를 이렇게 표현합니다. 이 카드의 다른 어떤 항목도 청구서를 그만큼 크게 움직이지 못합니다.

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

Peak은 반올림 오차가 아니며, 베이징에 맞춰 시점이 잡혀 있다.

DeepSeek의 피크 시간대는 월요일부터 금요일까지 UTC 01:00–04:00와 06:00–10:00입니다. 이 시간대를 벗어나는 모든 시간, 즉 주말 전체를 포함한 시간에는 절반 요율이 청구됩니다. 배수 적용은 세 가지 항목 모두에 해당하므로, 피크 시간대의 캐시 미스는 $0.30, 피크 출력은 $1.20입니다.

그 시간대가 언제인지는 전적으로 당신이 어디에 있느냐에 달려 있습니다. 베이징에서는 09:00–12:00과 14:00–18:00입니다 — 두 개의 업무 블록이고, 바로 그게 핵심입니다. 베를린에서는 9월에 두 번째 시간대가 08:00–12:00 CEST입니다. 유럽 팀의 오전 전체가 피크인 셈입니다. 뉴욕에서는 같은 시간대가 02:00–06:00 EDT입니다. 정상 근무 시간에 일하는 미국 기반 팀은 사실상 피크 요금이 부과되는 일이 없고, EU 팀은 매일 아침 점심 전에 두 배를 냅니다. 배치 작업을 언제 실행할지 선택하고 있다면, 그 결정은 백만 토큰당 $0.15의 가치가 있으며, 내리는 데 드는 비용은 없습니다.

캐시 적중 요금이 에이전트 청구서에 실제로 미치는 영향

DeepSeek에서는 캐시 적중이 자동입니다. 문서에 따르면 디스크 캐싱은 코드 변경 없이 모든 사용자에게 기본적으로 활성화되어 있으므로, 할인을 받기 위해 별도로 설계할 필요가 없습니다. 다만 이는 보장된 것이 아니라 최선 노력 방식입니다. DeepSeek은 고정된 TTL이 없다고 명시하며, 사용되지 않은 캐시는 "보통 몇 시간에서 며칠 이내"에 삭제되고, 시스템은 100% 적중률을 약속하지 않습니다. 이에 기반해 무엇인가를 모델링하기 전에 응답의 prompt_cache_hit_tokensprompt_cache_miss_tokens 필드를 읽어볼 가치가 있습니다.

형용사보다 산술이 더 중요하다. 40,000토큰의 안정적인 프리픽스—시스템 프롬프트, 도구 스키마, 리포 컨텍스트—를 가진 코딩 에이전트를 60턴 세션 동안 실행한다고 하자. 각 턴은 약 2,000토큰의 도구 출력을 덧붙이고 모델은 약 1,200토큰을 생성한다. 세션 전체의 총 입력은 5.94M 토큰이고 총 출력은 72,000토큰이다.

캐싱을 전혀 사용하지 않고 청구한 경우, 오프피크 시간대 기준: 5.94M 입력에 $0.15는 $0.891, 여기에 72,000 출력에 $0.60은 $0.043 — 약 $0.93 (해당 세션 기준).

프리픽스가 캐시된 상태로 청구되며, 이는 실제로 기본적으로 발생하는 방식입니다: 해당 입력 토큰 중 5.782M은 $0.003($0.017)의 캐시 적중으로 도착하고, 158,000은 $0.15($0.024)의 캐시 미스로 도착하며, 동일한 72,000개의 출력 토큰은 $0.043의 비용이 듭니다. 약 $0.084 — 약 11배 더 저렴합니다. 입력은 청구서의 95%에서 49%로 떨어지고, 캐시된 부분만 21%이며, 출력 토큰이 가장 큰 단일 항목이 됩니다. 같은 모델, 같은 세션, 같은 출력 — 유일하게 바뀐 것은 프리픽스가 재사용되었는지 여부입니다.

딥시크의 시트에 없는 항목, 즉 캐시 쓰기(cache-write) 항목에 주목하세요. Anthropic은 5분 캐시를 채우기 위해 기본 입력의 1.25배를 청구하고 1시간 캐시에는 2배를 청구합니다. DeepSeek의 카드에는 hit와 miss만 나열되어 있으며, 그 캐싱 가이드에는 쓰기나 저장 요금에 대한 설명이 없습니다. 여러 공급업체의 캐싱 경제성을 헤드라인 토큰 요율이 아니라 비교하고 있다면, 그 부재는 50배 hit 할인이 시사하는 것보다 더 큰 의미가 있습니다.

이는 또한 OrcaRouter의 DeepSeek V4.1 Flash에 대한 패스스루 세부 사항이 여기서 중요한 이유이기도 합니다. 우리는 공급자의 자체 정가로 마크업 없이 청구하므로, 공급업체 가격 변경은 가격 재산정 작업을 기다리지 않고 당일 우리 쪽에 반영됩니다. 그리고 위에 표시된 캐시 적중 및 피크/오프피크 열은 실제로 청구 기준이 되는 열이며, 이들을 혼합한 근사치가 아닙니다.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

DeepSeek-V4-Pro-0813 대비: 4배 격차, 그리고 일어나지 않은 은퇴

가장 당연한 내부 비교 대상은 플래그십 SKU이며, 이는 대표 요금이 시사하는 것보다 덜 극적이다. DeepSeek-V4-Pro-0813, 모델 ID가 deepseek-v4-pro인 이 모델은 캐시 미스 시 100만 입력당 $0.66, 비피크 시간대 100만 출력당 $1.98에 책정되어 있으며, 피크 시간대에는 $1.32와 $3.96으로 두 배가 된다. 캐시 적중은 비피크 시간대 $0.022로, Flash의 7배가 넘는다.

캐시 미스 입력 — 비첨두 시간대 기준 $0.15 vs $0.66, 따라서 Flash가 4.4배 저렴

출력 — 비피크 시간대 $0.60 대 $1.98, 따라서 Flash가 3.3배 더 저렴합니다

캐시 적중 입력 — 오프피크 기준 $0.003 vs $0.022, 따라서 Flash가 7.3배 더 저렴

컨텍스트 및 출력 상한 — 두 SKU 모두에서 1M과 384K로 동일

동시성 — Flash에서는 2,500, V4 Pro에서는 500, 가격표에서는 완전히 사라져 버리는 5배의 차이

이 비교에서 잘못 짚기 쉬운 세 가지가 있습니다. 첫째, 재사용 논리는 절대적인 수치로 보면 플래그십 쪽에서 더 강력합니다. Flash가 더 큰 배수를 갖고 있긴 하지만, 100만 토큰을 캐싱하면 V4 Pro에서는 $0.638, Flash에서는 $0.147을 절약할 수 있는데, 플래그십의 미스율이 애초에 훨씬 높기 때문입니다. 둘째, 모두가 사라졌으리라 예상한 모델은 사라지지 않았습니다. DeepSeek은 2026-09-14에 V4 Pro 제공을 중단하고 해당 요청을 Flash로 라우팅하겠다고 발표했다가, 프로덕션 워크플로에서 백엔드 모델을 교체한다는 이유로 개발자들의 반발을 샀고, 2026-09-11에 그 결정을 번복했습니다. V4 Pro는 여전히 제공되며, 과금 방식도 그대로입니다. 셋째, 그리고 이것이 유출 보도가 빠져든 함정입니다 — 출시된 V4.1 Pro는 없습니다. DeepSeek-V4-Pro-0813이 여전히 플래그십 SKU이며, 벤더는 그 이름으로 후속 모델을 출시한 적이 없습니다. "V4.1 Pro"로의 마이그레이션을 견적 내는 사람은 존재하지 않는 모델에 값을 매기고 있는 것입니다.

폐쇄형 프론티어 티어 대비

구매자들이 실제로 최종 후보로 올리는 폐쇄형 모델들과 비교하면, 배수가 핵심입니다. 아래의 모든 수치는 오늘 각 공급업체가 자체 게시한 가격 페이지에서 가져온 것입니다.

GPT-5.6 Sol — OpenAI의 단문맥(short-context) 티어에서 100만 입력 토큰당 $5.00, 100만 출력 토큰당 $30.00에 정가가 책정되어 있으며, 현재 OpenAI가 최소 2026-11-21까지 제공한다고 밝힌 프로모션 요금 $4.00 / $20.00이 적용 중이고, 캐시된 입력은 $0.40입니다. 프로모션 요금과 비교하면 DeepSeek V4.1 Flash는 입력에서 26.7배, 출력에서 33.3배 더 저렴하고, 정가와 비교하면 33배와 50배입니다. Sol의 캐시 적중 비용은 Flash의 133배입니다.

Claude Opus 5 — Anthropic이 공개한 요금표 기준으로 입력 100만 개당 $5.00, 출력 100만 개당 $25.00이며, 캐시 적중은 100만 개당 $0.50입니다. 이는 Flash의 입력 요율의 33배, 출력 요율의 42배, 캐시 적중 요율의 167배입니다. Anthropic의 5분 캐시 쓰기는 여기에 1.25배를 추가로 더합니다; DeepSeek의 요금표에는 이에 상응하는 항목이 없습니다.

Gemini 3.8 Flash — 2026-12-31까지 100만 입력당 $0.75, 100만 출력당 $3.75이며, 두 요금 모두 2027-01-01에 두 배로 인상될 예정이고, 캐시된 입력은 $0.075이며 — 실제 청구서에서 반복해서 나타나는 항목이 바로 이것인데 — 캐시 storage는 100만 토큰당 시간당 $0.50입니다. Flash는 입력에서 5배, 출력에서 6.25배, 캐시 적중에서 25배 더 저렴하며, DeepSeek는 캐시를 보관하는 데 아무 비용도 받지 않습니다.

역량 맥락이 이것을 정직하게 유지한다. Artificial Analysis의 Intelligence Index v4.3에서 DeepSeek V4.1 Flash(추론, 최대 노력)는 40점을 기록하며 113개 모델 중 6위를 차지했으며, 인덱스 작업당 $0.27, 초당 출력 토큰 214.4개를 기록했다. 이는 비교 대상 등급보다 26배 낮은 가격에 진정으로 최전선에 근접한 위치다 — 하지만 동일한 측정은 이것이 AA가 테스트한 가장 장황한 모델 중 하나임을 보여준다. 인덱스 실행 전체에서 2억 5천만 개의 출력 토큰을 생성했으며, 이는 중앙값 1억 4천만 개와 대비된다. 장황함은 토큰당 가격을 바꾸지 않지만 청구서는 바꾼다. 중앙값보다 62% 더 많은 토큰을 쓰는 모델도 여기서는 훨씬 적은 비용이 들지만, "토큰당 저렴함"과 "작업당 저렴함"은 다른 주장이며, 실제로 지불하는 것은 두 번째뿐이다.

무료 요금제가 있나요?

아니요. DeepSeek의 자체 가격 페이지에는 무료 API 등급도, 무료 월간 할당량도, 무료 모델도 명시되어 있지 않습니다. 청구는 충전되었거나 부여된 잔액에 대해 종량제로 이루어지며, 부여된 잔액이 먼저 소진됩니다. 소비자용 채팅 앱은 무료이지만, deepseek-flash 뒤의 API는 무료가 아니며, DeepSeek 플랫폼에는 이에 대한 무료 엔드포인트가 없습니다. 여러 서드파티 게이트웨이가 이 모델에 대한 무료 또는 체험판 액세스를 광고하고 있으며, 우리는 그 모두를 프로토타이핑용 표면으로 취급하고 프로덕션 백엔드로는 취급하지 않을 것입니다. 왜냐하면 그러한 약관은 예고 없이 변경되고, 어느 것도 공급업체 자체의 요율표를 갖추고 있지 않기 때문입니다.

가격 뒤에 숨은 효율성 주장

가격은 보조금이 아니다. 적어도 DeepSeek의 자체 설명에 따르면 그렇다. 공급업체의 모델 카드와 기술 보고서는 V4.1 Flash를 552B 매개변수의 전문가 혼합(mixture-of-experts) 모델로 설명하며, Causal Encoder-Decoder 구조를 사용한다. 이는 prefill 중에는 토큰당 약 8B 매개변수를 활성화하고 decode 중에는 16B를 활성화한다. 설계상 비대칭적이어서 읽기에는 저렴하고 쓰기에는 더 비싸다. 메모리 측면에서 DeepSeek는 토큰당 약 890바이트의 전역 KV 캐시를 보고하는데, 이는 DeepSeek-V4-Flash의 약 4분의 1이며, 동일한 워크로드에서 지속 캐시 풋프린트는 그 약 8분의 1이다. 이는 슬라이딩 윈도 상태를 폐기하고 적중 시 마지막 128개 토큰을 재생함으로써 달성된다. 이는 공급업체가 자체 하드웨어에서 보고한 측정치이며, 기술 보고서는 재생 경로에 대해 전체 연산과의 수학적 동등성을 주장하지 않는다.

이번 릴리스에서 파라미터 수만큼 진정으로 결론이 나지 않은 수치는 없으며, 그 이유를 정확히 짚어볼 가치가 있다. DeepSeek의 설명문은 552B를 보고하는데, 이는 백본, 즉 연산을 담당하는 부분이다. 그 옆에는 Engram이 있는데, 모델 카드에서 196B 파라미터로 규모를 명시한 조건부 메모리 조회 테이블로, 연산을 통해 처리되는 것이 아니라 토큰 조회로 접근한다. 둘을 더하면 748B에 가까워지는데, 이는 가중치가 공개된 지 몇 시간 만에 r/LocalLLaMA의 널리 읽힌 커뮤니티 분석이 주장한 수치이며, Hugging Face 저장소 자체의 파일 패널은 이를 더욱 끌어올려 763B 쪽으로 밀어붙인다. 커뮤니티 배포 후기에서는 체크포인트를 48개 샤드에 걸쳐 약 510GB로 집계했으며, FP8 dense 가중치에 FP4 전문가를 적용한 형태로 네이티브 양자화되어 배포되었다.총계는 논쟁 중인 것으로, 백본 수치는 벤더가 보고한 것으로 간주하라. 활성 파라미터 수는 속도를 좌우하는 수치이고, 상주 가중치는 모델이 애초에 시작되느냐를 결정하는 수치다.

셀프 호스팅은 MIT 라이선스 하에 이 가격에 대한 실질적인 대안입니다.

가중치는 deepseek-ai/DeepSeek-V4.1-Flash에 MIT 라이선스로 공개되어 있습니다. 이 라이선스는 상업적 사용, 수정 및 재배포를 허용합니다. 따라서 API 요금표는 통행료가 아니라 선택 사항이 됩니다. MIT에서는 라이선스상 이 모델을 직접 서비스하고 토큰 대신 컴퓨팅 비용을 지불하는 것을 막는 것이 없습니다.

그것이 값싸게 해 주는 것은 아닙니다. 체크포인트는 캐시와 활성화를 제외하고도 상주 가중치가 대략 510GB이며, DeepSeek는 저장소 어디에도 GPU 요구 사항을 명시하지 않았고, 커뮤니티 배포 글들은 실질적인 최소 사양을 워크스테이션이 아니라 멀티 GPU 노드로 봅니다. 세 가지 서빙 스택이 2026-09-10에 day-0 지원을 내놓았습니다 — vLLM, Miles를 포함한 SGLang, 그리고 자사 가속기를 위한 Cambricon의 vLLM 기반 NeuWare 적응판 — 하지만 출시 당일 vLLM과 SGLang은 공식 패키지가 아니라 전용 프리뷰 이미지를 제공했고, llama.cpp는 V4.1 아키텍처 지원을 병합하지 않은 상태였습니다. 오늘날 API 가격의 대안은 소비자용 하드웨어 셀프 호스팅이 아니라 임대한 8-GPU 노드입니다. 그 비용을 상쇄할 만큼 사용량이 많다면 라이선스가 이를 허용합니다. 그렇지 않다면 백만 토큰당 $0.15가 더 저렴한 답이며, 그 차이는 근소하지 않습니다.

요금표가 실제로 당신에게 결정하라고 요구하는 것

돈을 많이 움직이는 순서대로 세 가지입니다. 안정적인 프롬프트 접두사를 유지하고 캐시가 제 역할을 하게 두세요 — 캐시는 자동으로 적용되고 50배 할인이며, 60턴 에이전트 루프에서 $0.93 세션을 $0.084 세션으로 바꿔줍니다. 주중에는 UTC 01:00–04:00과 06:00–10:00 밖에서 배치 트래픽을 실행하세요. 이는 미국 팀에게는 아무 영향이 없고 유럽 팀에게는 아침 작업을 오후로 옮기는 것을 의미합니다. 그리고 이것을 DeepSeek 자체 플래그십과 가격 비교하고 있다면, 플래그십이 아직 할인 판매 중이고 예정된 서비스 종료가 2026-09-11에 취소되었다는 점을 기억하세요. 두 SKU 모두 하나의 키 뒤에 있으며 그리고 둘 사이의 전환은 마이그레이션이 아니라 모델 ID 변경입니다.

요금표가 알려주지 않는 것은 해당 모델이 귀하의 워크로드에 충분히 좋은지 여부이며, 그에 대한 수치들은 가격표보다 더 최신이고 더 빈약합니다. Artificial Analysis 지수 순위는 최대 추론 노력에서의 단일 측정치이고, 공급업체 벤치마크 행들은 공급업체 보고치이며, 파라미터 수는 논란의 여지가 있습니다. 가격은 이번 릴리스에서 확정된 부분입니다. 마이그레이션 비용은 이를 기준으로 산정하고, 도입을 확정하기 전에 성능을 테스트하세요.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트