
DeepSeek V4.1 Flash: 포인트 릴리스 번호를 단 완전히 새로운 베이스 모델
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123지능49코딩
DeepSeek V4.1 Flash는 2026년 9월 10일에 출시되었습니다: 오픈 MIT 가중치, 100만 토큰 컨텍스트, 완전히 새로운 인과적 인코더-디코더 아키텍처, 그리고 DeepSeek가 자체 모델 카드에서 자사가 "새 아키텍처 패밀리"라고 부르는 범주에 분류한 5,520억 파라미터 전문가 혼합 백본을 갖췄습니다. 또한, 명명을 지적한 트래커가 맞다면, DeepSeek가 완전히 새로운 기본 모델에 .1 버전 번호를 붙인 것은 이번이 처음입니다 — 그런 라벨은 보통 재구축이 아니라 튜닝을 의미하니까요. 이제 그 번호가 암시하는 플래그십인 DeepSeek V4.1 Pro는 여전히 존재하지 않습니다.
그 불일치는 단순한 명칭 논란 이상의 의미를 지닌다. 버전 번호로 DeepSeek 세대를 비교하는 사람이라면 "V4 Flash에서 V4.1 Flash로"를 패치 단계로 읽고 그에 맞춰 관심을 배분할 것이다. 하지만 그 이면의 아키텍처는 그렇지 않다고 말하며, 회사가 1.6조 파라미터의 플래그십을 폐기하고 Flash 모델을 선택한 결정은 더욱 큰 목소리로 그렇지 않다고 말한다.

9월 10일에 실제로 출시된 것
이번 것은 유출도 아니고 베타도 아닙니다. 9월 8일에 모델 ID deepseek-v4.1-flash-expires-on-0910로 시작된 2일간의 API 테스트는 접미사가 예고한 대로 종료됐고, 실제 릴리스는 오늘 DeepSeek의 웹 앱, 모바일 앱, 자체 API 전반에 걸쳐 공개됐습니다. 가중치와 기술 보고서는 Hugging Face에 게시됐으며, 모델 ID는 deepseek-ai/DeepSeek-V4.1-Flash.
실질적인 세부 사항이 의식보다 더 중요하다:
• 모델 이름 — deepseek-flash를 호출하세요. 레거시 이름인 deepseek-v4-flash 및 deepseek-v4-flash-vision-exp은(는) 여전히 허용되지만, 더 이상 이전에 가리키던 모델을 가리키지 않습니다. 두 모델 모두 폐지되었으며, 해당 이름을 사용하는 요청은 DeepSeek V4.1 Flash로 처리되고 Flash 요금으로 청구됩니다.
• 구성품 — 552B 백본 파라미터, 1M 토큰 컨텍스트 창, 최대 384K 출력, JSON 출력, 함수 호출, 그리고 기본적으로 켜져 있으며 낮음/높음/최대 노력 설정을 제공하는 thinking 모드.
• 라이선스 — MIT, 가중치 포함, 저장소에 추론 폴더와 별도의 인코딩 모듈이 포함되어 있다. DeepSeek는 오픈소스 커뮤니티가 추론 지원을 구축하도록 명시적으로 초대하고 있으며, 이는 주요 런타임에서 출시 당일 서빙이 몇 주가 아닌 며칠 만에 가능해질 것이라는 표준 신호다.
포인트 릴리스가 아닌 .1
이 글의 시작이 된 주장은 익명이지만 많은 이들이 주목하는 DeepSeek 관찰자인 teortaxesTex가 9월 10일 게시물에서 한 것이다: 이번이 "DeepSeek가 완전히 새로운 기본 모델에 .1 릴리스 버전을 붙인 첫 번째 사례"이며, V4.1이 "V4와의 차이가, 예를 들어 LLaMA 1과 LLaMA 3의 차이보다 더 크다"는 점, 그리고 DeepSeek는 "아직 V5로 부를 만한 가치가 있다고 느끼지 않는다"는 점이다 — 하지만 게시자는 그 이유를 설명하지 못했다.
인과적 부분은 추론으로, 구조적 부분은 검증 가능한 것으로 취급하세요. DeepSeek가 V5 대신 .1을 선택한 이유에 대한 추론은 한 관찰자의 해석일 뿐이며, 그 이상도 아닙니다. 회사 외부에서 그 결정을 설명한 사람은 없고, DeepSeek의 자체 자료에서도 그 점을 언급하지 않습니다. 검증 가능한 부분은 아키텍처이며, 이는 포인트 릴리스처럼 보이지 않습니다. DeepSeek의 변경 로그는 V4.1 Flash를 "새 아키텍처 패밀리에서 가장 작은 모델"이라고 설명하는데, 이는 버전 범프에 대해 쓰기에 이상한 문장입니다. 버전 범프는 패밀리를 확장하지, 패밀리를 새로 창설하지 않기 때문입니다.
모호함에는 실제 비용이 따르며, 그 비용은 DeepSeek가 아닌 구매자에게 돌아간다. 버전 번호는 개발자가 "이것이 새로운 세대인지, 아니면 재튜닝인지, 그리고 내 평가 예산을 얼마나 투자할 가치가 있는지"를 판단하는 가장 저렴한 신호다. DeepSeek는 이제 그 신호를 한 방향으로 신뢰할 수 없게 만들었다. 아키텍처 패밀리를 창시한 모델이 포스트 트레이닝 레시피만 변경한 모델과 소수점 한 자리 차이에 불과한 것이다. 회사는 V5 마커를 예비로 유지할 수 있다. 마이그레이션 평가를 수행하는 모든 사람이 그 혼란에 대한 비용을 치른다.
가중치에서 '새로운 아키텍처'가 의미하는 것
모델 카드는 특이할 만큼 구체적이라서, 벤치마크 하나 없이도 세대적 주장을 검증하기 쉽다. 네 가지가 눈에 띈다.

• 비대칭 활성화 — Causal Encoder-Decoder 분할은 20-레이어 인과적 인코더 뒤에 20-레이어 디코더가 오는 40-레이어 트랜스포머로 구성되며, 디코더의 전역 KV 캐시는 각 디코더 레이어 자체에서 파생되는 것이 아니라 인코더의 최종 은닉 상태에서 투영됩니다. 이 설계의 핵심은 모델이 프리필 중에는 토큰당 8B 파라미터만 활성화하고 디코드 중에는 16B를 활성화한다는 것입니다. 입력이 많은 에이전트 워크로드(긴 문서, 긴 도구 추적)는 모델의 저렴한 절반을 사용하고, 생성은 비싼 절반을 사용합니다.
• KV 캐시 압축(토큰당 측정) — DeepSeek-V4.1-Flash는 FP4 메인 KV 캐싱을 토큰당 890바이트로 실행하며, 카드에는 DeepSeek V4 Flash의 약 4분의 1로 표기되어 있습니다. 중국 측 보도는 더 나아가 1세대 V4 모델과 비교해 압축률을 437배 축소로 설명했습니다. 다만 그 더 큰 수치는 다른 기준선에 기반한 벤더 제공 계산이므로, 측정값이 아니라 주장으로 간주해야 합니다.
• SWA 제한적 리플레이 — 슬라이딩 윈도우 어텐션은 일반적으로 컨텍스트를 재구성하기 위해 KV 상태를 SSD에 유지하도록 강제합니다. 이는 대신 가장 최근 토큰 윈도우만 재생하여 누락된 SWA KV 상태를 재구축하므로, 영구 KV 공간을 DeepSeek V4 Flash의 약 1/8로 줄입니다.
• Compressed Sparse Attention 2 — 각 attention 레이어는 세 가지 정적 모드(Full, Reindex, Reuse) 중 하나로 실행되며, 레이어 간에 KV 및 인덱서 상태를 공유합니다. 계층적 희소 인덱서는 컨텍스트 길이와 무관하게 더 깊은 레이어의 비용을 제한합니다.
그 네 가지를 함께 읽으면 전략적 그림이 또렷해진다. 이는 우선 희소성과 캐시 효율성을 위한 아키텍처이며, 동일한 구조를 나중에 확장할 수 있도록 크기가 설계되어 있다. "새로운 아키텍처 패밀리"라는 언급은 실질적인 의미를 지닌다. 더 많은 것이 곧 나올 것이라는 선언이기 때문이다.
벤치마크: 공급업체가 보고한 것으로, 아직 반박되지 않음.
DeepSeek는 출시와 함께 벤치마크 세트를 공개했다. 회사 자체 수치에 따르면, V4.1 Flash는 GPQA Diamond 90.9, Codeforces 레이팅 3471, MathArena Apex 65.6, Terminal-Bench 2.1 90.6, DeepSWE v1.1 74.2, 그리고 도구 사용 시 HLE 63.9를 기록했다. 마지막 항목에는 기준 수치 36.8을 해당 벤치마크의 순수 텍스트 하위 집합으로 제한하는 각주가 붙어 있다.
그것들이 무엇인지 제대로 규정하자. 그것들은 벤더가 보고한 수치이고, 독립적인 평가 없이 공개되었으며, 딥시크가 자체 플래그십을 퇴역시키는 것을 정당화하는 데 사용한 수치다. 그래서 가장 검증해볼 가치가 있는 수치다. 9월 10일 출시 시점 기준으로 Artificial Analysis는 DeepSeek V4.1 Flash에 대한 측정 결과를 발표하지 않았고, Hugging Face의 자체 모델 페이지에는 여전히 해당 모델이 '어떤 Inference Provider에도 배포되지 않았다'는 메모가 남아 있었다. 이번 릴리스를 떠받치는 주장, 즉 Flash 등급 모델이 성능, 비용, 속도, 총 처리 시간에서 1.6T 파라미터 플래그십을 종합적으로 능가한다는 주장은 현재 외부 감사가 없는 벤더의 주장일 뿐이다.
반대편에도 솔직한 경고가 있습니다. 동일한 공급업체 보고에 따르면 V4.1 Flash는 Kimi K3와의 16개 비교 중 13개, GLM-5.3과의 13개 비교 중 11개에서 승리했지만, 최신 Terminal-Bench 3.0 및 4.0 작업과 ProgramBench에서는 여전히 GPT-5.6 Sol과 Claude Opus 5에 뒤처집니다. 이는 일관된 형태입니다 — 이 아키텍처가 최적화된 코딩, 터미널 및 에이전트 자동화 작업에서 가장 강하고, 최첨단 추론 작업에서는 약한 형태 — 그리고 이것이 실제 세대적 도약이 가질 형태입니다.
가격, 그리고 일정을 잡을 가치가 있는 라우팅 스위치
새 가격은 출시와 함께 적용되었으며, 인하가 아닌 기존과 동일한 Flash 요금제입니다: deepseek-flash, 캐시 적중 입력은 비피크 시간대에 백만 토큰당 $0.003, 피크 시간대에 $0.006이며, 캐시 미스 입력은 $0.15 및 $0.30, 출력은 $0.60 및 $1.20입니다. 피크 시간대는 비피크의 정확히 두 배이며, 평일 UTC 01:00–04:00 및 06:00–10:00에 적용됩니다.
그 인하는 대신 Pro 트래픽에 적용됩니다. DeepSeek V4 Pro의 가격은 캐시 적중 입력이 $0.022 및 $0.044, 캐시 미스 입력이 $0.66 및 $1.32, 출력이 $1.98 및 $3.96입니다. 따라서 Pro라는 이름의 요청을 V4.1 Flash로 라우팅하면 출력 비용이 약 70% 줄어드는 동시에, DeepSeek의 설명에 따르면 요청에 응답하는 성능도 향상됩니다.

그 라우팅 변경은 예정된 사항이지 가상의 시나리오가 아닙니다. 2026년 9월 14일 베이징 시간 12:00 이후에는 deepseek-v4-pro를 지정하는 요청이 V4.1 Flash로 라우팅되고 Flash 가격으로 청구되며, DeepSeek V4.1 Pro가 출시될 때까지 이 상태가 유지됩니다. 통합 코드에 Pro 모델 이름을 하드코딩해 두어도 아무것도 깨지지 않습니다. 코드 변경도, 체인지로그 항목 외의 별도 공지도 없이 출력 가격의 약 3분의 1 수준의 다른 모델을 제공받게 됩니다. 모델 이름이 아닌 성능 등급으로 라우팅한다면, 9월 14일이 재테스트를 진행할 날짜입니다.
오늘 DeepSeek를 호출한다면 이것이 의미하는 바
OrcaRouter는 아직 DeepSeek V4.1 Flash를 지원하지 않습니다. 현재 기준으로 deepseek-v4.1-flash 모델 페이지는 '모델을 찾을 수 없음'을 반환하며, 우리는 다른 의미를 암시하기보다는 그 사실을 분명히 말하고자 합니다. 이에 따라 두 가지가 뒤따릅니다. 첫째, DeepSeek가 발표한 재라우팅은 퍼스트파티 API 동작이므로, 9월 14일 전환은 어떤 방식으로 접근하든 DeepSeek 자체 엔드포인트에서 발생합니다. 둘째, 지금 새로운 아키텍처를 원한다면 벤더에 직접 호출하는 것입니다.
저희가 하는 방식은 나머지 DeepSeek 제품군을 하나의 키로 라우팅하는 것입니다: DeepSeek V4 Flash 및 DeepSeek V4 Pro, 그리고 200개 이상의 다른 모델과 함께입니다. 그곳의 가격은 DeepSeek의 제공자 목록 가격을 0% 마크업으로 그대로 전달한 것이며, 이번과 같은 릴리스에서 중요한 부분입니다 — 판매업체가 요율을 인하하면, 그 인하는 재가격 조정 주기를 기다리는 대신 당일 우리 측에서 바로 반영됩니다. 그리고 V4.1 Flash가 카탈로그에 실제로 등록되면, 위의 비수기 반값 요율은 우리가 협상하는 할인이 아니라 그 자체가 요율입니다.
이렇게 새로운 모델에 대한 라우팅 논쟁은 사실 가격에 관한 것이 아니다. 핵심은 독립적인 벤치마크도 없고 제3자 서빙도 없는 출시 첫 주 아키텍처에 프로덕션 경로를 얼마나 걸어두느냐다. 새 모델을 전환 가능한 티어 뒤에 두거나 프로덕션 키가 아닌 키로 테스트하는 것, 그것이 평가와 장애를 가르는 기준이다.
무엇이 명명 문제를 해결할까?
세 가지를, 알려주는 양이 적은 순서대로.
DeepSeek V4.1 Flash에 대한 독립 평가는 아키텍처 주장을 다른 사람의 평가 하네스에서 검증할 것이다. 그것이 공급업체의 표를 사실로 바꾸는 유일한 측정이며, 가장 유력한 다음 뉴스다.
DeepSeek V4.1 Pro는 패밀리 주장을 검증하게 될 것이다. 라우팅 공지는 이 모델을 Pro-to-Flash 창구의 종착점으로 명명했는데, 이는 이번 릴리스 전체가 이 모델을 중심으로 구성되어 있음을 의미한다. 그리고 DeepSeek가 가장 덜 확인해 둔 모델이기도 하다: 카드도, 파라미터 수도, 날짜도, 가중치도, 가격도 없다.
그리고 유용하지만 화려하지 않은 이유: DeepSeek가 이것을 다시 하는지 여부. 또 다른 새로운 기본 모델에 두 번째 .1 라벨이 붙으면 이상이 관례로 바뀌고, 관례는 개발자가 계획할 수 있는 무언가가 된다. 하나의 모델은 호기심일 뿐이다. 이름 붙이기가 유용한 방식으로 오해를 불러일으키는 것은 패턴이 생긴 뒤부터다.
현재로서는 이 상황에 대한 실용적인 해석이 사용자가 누구인지에 따라 명확히 갈라진다. DeepSeek V4 Pro를 사용 중이라면 9월 14일을 달력에 표시하고 그 전에 평가를 다시 실행하라. 그 이름 뒤에 있는 모델이 요청 여부와 관계없이 바뀌고 있기 때문이다. DeepSeek V4 Flash를 사용 중이라면, 이미 같은 가격에 DeepSeek가 확장을 위해 설계한 아키텍처로 이전되고 있다. V5를 기다리고 있었다면, 솔직한 답은 DeepSeek가 그 세대를 출시하고 이름 붙이기를 거부한 것으로 보인다는 것이다. 이는 사람들이 그 숫자를 더 이상 믿지 않게 되기 전에 딱 한 번만 할 수 있는 종류의 행동이다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
