
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: 동일한 Flash 요금표, 재훈련된 모델
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123지능49코딩
DeepSeek V4.1 Flash가 루머에 그치던 후속 모델에서 실제 출시된 Flash 모델로 전환되는 데 걸린 일주일은 짧고 시끄러웠습니다. 9월 8일, 이 모델은 deepseek-v4.1-flash-expires-on-0910이라는 모델 ID로 이틀간의 API 테스트에 등장했는데, DeepSeek 스스로 "중간 버전"이라고 부른 빌드였습니다. 9월 9일, DeepSeek의 오픈 플랫폼은 정식 출시 버전인 DeepSeek V4.1 Flash가 9월 10일경 출시될 예정이며 성능, 비용, 속도, 엔드투엔드 시간에서 DeepSeek V4 Pro를 "종합적으로 능가한다"고 밝혔습니다. 9월 10일, 출시 공지와 함께 베이징 시간 12:00에 적용된 새로운 Flash 시리즈 요금표가 발표되었는데, 이는 8월 가격 인상 이후 DeepSeek V4 Flash에는 적용된 적이 없는 요금입니다. 다른 어떤 주장이 사실이든, 텍스트 처리의 주력 모델인 DeepSeek V4 Flash는 더 이상 Flash 워크로드를 실행하는 최신 방식이 아니며, 이 글은 그것이 오늘 실행 중인 앱에 실제로 어떤 변화를 가져오는지에 관한 것입니다.
이렇게 이른 시점의 비교는 한쪽으로 치우칠 수밖에 없으며, 수치가 나오기 전에 그 점을 미리 밝혀두는 것이 좋다. DeepSeek V4 Flash는 공개된 사양 카드가 있고, DeepSeek-V4-Flash-0731 업데이트 이후 한 달간의 프로덕션 트래픽, 오픈 가중치, 그리고 Artificial Analysis의 독립적 측정 결과가 있다. DeepSeek V4.1 Flash는 공식 발표와 이틀간의 커뮤니티 속도 테스트만 있을 뿐, 아직 공개된 카드도, 기술 보고서도, 제3자 점수도 없다. 아래에서 업체 주장은 업체 주장으로 표시했고, 커뮤니티 수치는 커뮤니티 측정치로 표시했다.
Flash 티어가 방금 리셋되었습니다 — 세 가지 변경 사항, 일주일.
DeepSeek V4 Flash는 13B 활성 상태의 284B 파라미터 전문가 혼합(MoE) 모델로, 7월 31일 리프레시 이후 상당수의 프로덕션 텍스트 트래픽에서 합리적인 저비용·고처리량 기본 선택이었습니다. 3일 동안의 세 가지 발표가 그 토대를 뒤흔들었습니다.
• 9월 8일 — DeepSeek는 V4.1 Flash의 기간 제한 베타를 모든 API 계정에 공개했으며, 동시 요청 수는 20개로 제한되고 9월 10일에 만료될 예정이었으며, 자체 만료일을 지닌 모델 이름으로 제공되었다.
• 9월 9일 — 오픈 플랫폼은 약 9월 10일경 DeepSeek V4.1 Flash의 정식 출시를 발표하며, 네이티브 멀티모달 지원이 포함된 새로운 모델 구조를 소개하고 성능, 비용, 속도 및 총 완료 시간에서 DeepSeek V4 Pro를 능가한다고 주장했다.
— 9월 10일 — 정식 출시와 함께 새로운 Flash 시리즈 가격표가 발표되며, 베이징 시간 12:00부터 적용되어, 8월 17일 인상 이후 개발자들의 큰 비판을 받아온 DeepSeek V4 Flash의 요금을 인하합니다.
그중 마지막 것은 그 자체로 다룰 만한 가치가 있는데, 실제로 가격이 인하되는 드문 사례기 때문이다. 새 목록에서 비수기 캐시 적중 입력 비용은 토큰 100만 개당 ¥0.05에서 ¥0.02로 낮아져 60% 인하되며, 캐시 미스 입력은 ¥1.5에서 ¥1로, 출력은 ¥4.5에서 ¥4로 조정된다. 피크 시간대 요금은 비수기 요금의 두 배다. 대략 미화로 환산하면 비수기 기준 캐시 적중 입력은 100만 개당 약 $0.003, 캐시 미스 입력은 $0.14, 출력은 $0.56이며, 피크 시간대는 두 배다. 8월 인상과 이번 인하 사이의 24일 간격은 단순한 일정상의 우연이 아니다. 이번 가격 재설정은 V4.1 Flash 출시의 일부다.
같은 등급, 다른 모델
쉽게 읽자면 V4.1 Flash는 V4 Flash에서 속도 조절기를 올린 버전이다. 하지만 그렇지 않다. 0731 갱신은 기존 DeepSeek V4 Flash 베이스에 대한 사후 훈련 업데이트였다 — 동일한 아키텍처, 동일한 284B 총계 / 13B 활성 전문가 혼합(mixture-of-experts) 구성을 갖추고 있다. DeepSeek의 V4.1 Flash 설명은 더 큰 무언가를 가리킨다: 새로운 모델 구조인데, 여러 매체는 이를 미세 조정이 아닌 새로운 사전 훈련 실행으로 해석했다. 이 구분이 중요한 이유는 재훈련된 모델은 갱신(refresh)과 같은 방식으로 이전 모델의 동작을 물려받지 않기 때문이다 — 프롬프트 처리, 도구 호출, 출력 스타일은 성능이 동일하더라도 모두 달라질 수 있다.
• 아키텍처 — DeepSeek V4.1 Flash: 새로운 모델 구조로, DeepSeek가 네이티브 멀티모달 입력을 갖춘 새롭게 구축한 모델이라고 설명합니다. DeepSeek V4 Flash: 총 284B / 활성 13B MoE의 V4-Flash-0731 포스트 트레이닝 리프레시 버전입니다.
• 입력 — V4.1 Flash는 기본 모델에서 텍스트와 이미지 입력을 기본적으로 처리합니다. DeepSeek V4 Flash는 텍스트 전용이며, 이미지는 별도의 볼트온 빌드인 DeepSeek-V4-Flash-Vision-Exp가 필요합니다.
• 컨텍스트 및 출력 — DeepSeek V4 Flash는 1M 컨텍스트와 384K 최대 출력을 게시합니다. DeepSeek의 출시 자료에 따르면 V4.1 Flash는 백만 토큰 규모의 컨텍스트 창을 유지하지만, 공식 카드는 게시되지 않았습니다.
• 동시성 — DeepSeek V4 Flash는 2,500 동시 연결 상한선을 제시합니다. V4.1 Flash 베타는 20으로 제한되었으며, 릴리스 빌드에 대한 DeepSeek의 "높은 동시성" 주장은 작성 시점에 공개된 수치로 뒷받침되지 않았습니다.
• 가중치 — DeepSeek V4 Flash는 MIT 라이선스 하에 오픈 가중치로 제공되며, V4.1 Flash에 대해서는 아무것도 발표되지 않았습니다.
• 독립적 평가 — DeepSeek V4 Flash는 Artificial Analysis에서 측정되었으며, DeepSeek V4.1 Flash는 아직 제3자 점수가 없습니다.
텍스트 대비 멀티모달이라는 점은 텍스트 비교에서조차 한 문장을 더 할애할 가치가 있습니다. V4.1 Flash가 누구를 위한 것인지를 결정하기 때문입니다. 파이프라인에서 텍스트용으로 DeepSeek V4 Flash를, 이미지용으로 DeepSeek-V4-Flash-Vision-Exp를 실행 중이었다면, V4.1 Flash는 두 경로를 하나의 모델에서 모두 처리하는 최초의 DeepSeek 빌드입니다. 유지 관리할 엔드포인트는 하나이고, 측면에 인코더를 덧붙일 필요도 없습니다.

그들이 정말로 갈리는 지점: 처리량과 완료된 작업의 비용
동일한 가격대에서 두 모델은 속도에서 차이가 나며, 속도는 수치가 가장 두드러지는 부분입니다. Artificial Analysis는 DeepSeek V4 Flash 0731을 DeepSeek 자체 API에서 구성과 측정 창에 따라 대략 초당 120–140 출력 토큰으로 측정합니다. V4.1 Flash의 첫날 테스터들은 작업에 따라 지속 생성 속도가 대략 초당 280~500 토큰 사이였고, 경량 동시성 실행에서는 500을 초과하는 최고치를 보고했습니다. 더 높은 수치는 커뮤니티 측정값이며 공급업체 발표가 아니고, 초당 토큰 수는 결코 모델의 고유 속성이 아닙니다. 그럼에도 불구하고 그 방향성은 모든 첫날 보고서에서 일관되며, 더 빠른 생성과 더 낮은 총 완료 시간에 대한 DeepSeek의 자체 주장도 같은 방향을 가리킵니다.
이 속도 격차는 두 모델이 동일한 요금표를 쓰더라도 경제성을 바꾼다. 토큰 단위로 비용을 지불하는데 토큰이 더 빨리 도착하기 때문이다. V4 Flash에서 1분이 걸리던 긴 컨텍스트 검색이나 코드 생성 작업은 V4.1 Flash에서 동일한 토큰당 가격으로 몇 분의 일 만에 끝날 수 있다. 첫날 테스터 여러 명이 정확히 그러한 작업 유형들에서 종단 간 속도가 5~6배 빨라졌다고 보고했다. 베타 초반의 '돈을 더 빨리 쓴다'는 불만은 같은 동전의 뒷면이었다. 토큰당 가격이 변하지 않은 상태에서 토큰을 2~3배 더 빨리 생성하는 모델은 분당 잔액을 더 빨리 소진한다. 작업당 청구액이 실제로 줄어드는지 여부는 새 모델이 더 적은 토큰과 더 적은 재시도로 작업을 완료하는지에 달려 있으며, 그것이 바로 아직 누구도 증명할 수 없는 부분이다.
가격 카드 자체에서는 두 모델이 나란히 놓여 있다. 9월 10일 목록 기준 오프피크 시간대의 백만 토큰당 가격은 캐시 적중 입력 ¥0.02, 캐시 미스 입력 ¥1, 출력 ¥4이며, 피크 시간대에는 두 배다. 인하 전 Flash 등급에 적용되던 동일 목록은 ¥0.05, ¥1.5, ¥4.5였다. 캐시 비중이 높은 워크로드에서는 이번 인하가 핵심이다. ¥0.02 대 ¥0.05는 자동 완성이나 에이전트 루프 입력 스트림의 대부분을 차지하는 토큰에서 60% 절감이다. 캐시를 놓치는 신규 수집 작업의 경우 절감 폭은 약 3분의 1에 가깝다. 그렇다고 V4.1 Flash가 토큰당 V4 Flash보다 저렴해지는 것은 아니다. 둘은 같은 카드를 공유하지만, 아키텍처의 더 높은 처리량이 차별점이며 추가 비용은 없다.

영수증은 V4 Flash에 대한 것이고, 주장은 V4.1 Flash에 대한 것이다.
현재 이번 비교 구도에서 가장 중요한 벤치마크 관련 사실은 새 모델에 대한 벤치마크가 존재하지 않는다는 점이다. DeepSeek V4.1 Flash의 핵심 주장 — 성능·비용·속도 면에서 DeepSeek V4 Pro를 종합적으로 능가한다는 것 — 은 공급업체가 보고한 것이며 재현된 바 없다. 파라미터 수, 평가표, 기술 보고서 어느 것도 공개되지 않았고, 이 글을 쓰는 시점까지 Artificial Analysis도 이를 측정하지 않았다. 지난 플래그십 출시 때 독립적인 검증을 받았던 모델 제품군을 상대로 한 "우리를 믿으세요, Pro보다 낫습니다"라는 주장은 제3자가 측정을 실행할 때까지 독자가 거리를 두고 봐야 할 주장이다.
반면 DeepSeek V4 Flash는 실제 성과 기록이 있다. Artificial Analysis는 0731 추론 빌드를 해당 클래스의 선도 모델 중 하나로 집계하고, 비교 가능한 오픈 가중치 모델들의 중앙값을 크게 웃도는 점수를 부여하며, DeepSeek 자체 API에서의 출력 처리량을 앞서 언급한 초당 약 120~140토큰 범위로 측정한다. 이는 V4.1 Flash의 자체 점수가 발표될 때 비교 기준이 될 수치이며, '빠르고 저렴한 Flash'라는 라벨이 암시하는 것보다 더 높은 기준을 설정한다. 새 빌드가 대체하는 모델은 약하지 않다. 이는 진정으로 강력한 오픈 가중치 작업용 모델이다. 그렇기 때문에 업그레이드 결정이 형식적인 것이 아니라 실질적인 것이 되는 것이다.
라우팅이 핵심 작업을 도맡고 있습니다 — DeepSeek 내부에서도, 여러분을 위해서도요.
이번 출시에서 가장 덜 보도된 부분은 DeepSeek이 자체 모델 간에 트래픽을 라우팅한다는 점입니다. 공지는 명확합니다. V4.1 Flash가 출시되는 시점부터 V4.1 Pro가 출시될 때까지 deepseek-v4-pro를 대상으로 하는 모든 API 요청은 DeepSeek V4.1 Flash가 처리하며 Flash 등급 가격으로 청구됩니다. V4 Pro 호출자는 코드를 한 줄도 변경하지 않고 새 아키텍처와 토큰당 비용의 일부만 부담하게 됩니다. 라우팅되지 않는 것을 주목하세요: deepseek-v4-flash 호출입니다. 기존 Flash 모델은 여전히 이를 가리키는 모든 사용자에게 서비스를 제공합니다. 그래서 이 비교가 존재하는 이유입니다. V4 Pro를 사용 중이라면 전환이 자동으로 이루어지지만, V4 Flash를 사용 중이라면 직접 결정을 내려야 합니다.
프리미엄 모델용으로 걸려 오는 전화를 더 저렴한 모델이 처리하도록 조용히 결정한 벤더의 행보는 V4.1 Flash에 대한 놀라운 지지입니다. 이는 또한 라우팅 계층이 여러 벤더에 걸쳐 적용하는 것과 동일한 논리이기도 합니다. OrcaRouter 같은 플랫폼이 바로 그 격차를 메웁니다: 200개 이상의 모델을 위한 하나의 API, 공급업체 목록 가격을 0% 마크업으로 전달하므로 DeepSeek의 9월 10일 Flash 인하가 같은 날 저희 쪽에도 반영됩니다.OrcaRouter의 DeepSeek V4 Flash는 현재 실행 중인 다른 모든 모델과 동일한 키로 계속 호출할 수 있어, 출시 당일 모델을 안전하게 도입하는 방법이 진정으로 저렴해집니다: 트래픽의 일부를 DeepSeek 자체 API의 DeepSeek V4.1 Flash로 보내고, 동일한 라우팅 규칙에서 DeepSeek V4 Flash를 자동 폴백으로 유지하면서, 새 아키텍처가 제 역할을 하는 동안 장애 조치가 엣지 케이스를 처리하게 하면 됩니다.
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: 어떤 것을 호출해야 할까요?
솔직한 답이 모두에게 동일한 모델 하나라면, 이 글은 존재하지 않았을 것이다. 두 모델은 이제 서로 다른 리스크 프로필에 맞으며, 그 경계는 이례적으로 뚜렷하다.

오늘 새로운 Flash 워크로드를 시작하는 경우, 지연 시간과 처리량이 제약 조건인 경우, 두 번째 모델을 유지하지 않고 이미지 입력을 원하는 경우, 또는 DeepSeek 자체 라우팅이 Pro-tier 주장의 위험을 줄여주는 것을 기꺼이 받아들이는 경우 DeepSeek V4.1 Flash로 전환하세요. 이 모델은 deepseek-v4.1-flash라는 이름으로 DeepSeek의 퍼스트파티 API에서 제공되며, 교체 대상 모델과 동일한 Flash 카드로 가격이 책정되어 있고, 출시 첫날의 모든 신호는 상당히 더 빠르다는 것을 보여줍니다.
프로덕션 트래픽을 발표된 2,500 동시성 상한선으로 서비스 중이거나, 자체 호스팅 또는 규정 준수를 위해 오픈 가중치에 의존하거나, 프롬프트·평가·툴 호출 로직이 0731 동작에 맞춰 튜닝되어 재훈련 모델의 특이점을 첫날부터 흡수할 수 없는 경우라면 DeepSeek V4 Flash에 머무르세요. 새로운 사전 훈련은 단순한 속도 변화가 아니라 동작 변화이며, 0731 빌드는 한 달치 검증 기록이 담긴 버전입니다.
대부분의 팀에게 방어 가능한 기본값은 중간 경로입니다. 새로운 워크로드의 기본값으로 DeepSeek V4.1 Flash를 사용하고, 수익을 창출하는 워크로드의 장애 조치로 DeepSeek V4 Flash를 유지하며, 첫 번째 독립 스코어카드(공개된 스펙 카드 및 동시성 수치와 함께)가 어떤 2일 베타도 해결할 수 없는 논쟁을 결정하게 하세요. Flash 등급은 방금 새 엔진을 얻었습니다. 이전 엔진은 구식이 아니라 벤치마크입니다.
DeepSeek가 트래픽을 Flash 가격으로 V4.1 Flash에 라우팅하는 동안 Pro급 트래픽이 어떤 모습인지 궁금하신가요?OrcaRouter의 DeepSeek V4 Pro — 둘 다 하나의 키로, DeepSeek 공시 가격으로 청구됩니다.
이 글에서 비교한 모델4
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
