DeepSeek V4.1 Flash용 히어로 타이틀 카드: 부제는 '2일간의 API 베타: 현재까지 알려진 내용', 필 배지에는 '중간 빌드'와 'API 테스트 – 09-10 만료'로 표시, 하단 줄에는 '공식 릴리스 포스트가 곧 게시될 예정'이라는 문구, 그리고 오른쪽 하단 모서리에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

DeepSeek V4.1 Flash, 2일간의 API 베타 돌입: 새로운 아키텍처, 네이티브 멀티모달, 프로급 포부

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

DeepSeek V4.1 Flash는 Deep​Seek가 공식 발표 전에 제품을 시험하는 바로 그 장소, 즉 라이브 API에 모습을 드러냈다. 자체 만료 날짜를 담은 모델 ID와 함께 말이다. deepseek-v4.1-flash-expires-on-0910이라는 ID는 Deep​Seek 팀이 공식 커뮤니티 그룹에 "중간 버전" 내부 테스트를 게시한 이후인 2026년 9월 8일부터 서비스를 시작했으며, 끝에 붙은 0910이 이 이야기를 축약해서 보여준다. 이 빌드는 실제 API 환경에 투입된 것으로, 공식 출시 발표에 앞서 9월 10일경 서비스가 중단될 예정인 제한된 테스트용이다. 이 모델을 포착한 제보자들은 공식 출시 발표가 "곧" 나올 것으로 기대하고 있다. 이것은 출시가 아니다. 모델 카드도, 기술 보고서도, 변경 로그 항목도 없다. 그리고 오늘 저녁 기준으로 Deep​Seek의 공개 Models & Pricing 페이지에는 여전히 DeepSeek V4 Flash, DeepSeek V4 Pro, DeepSeek-V4-Flash-Vision-Exp만 나열되어 있다.

아래의 모든 내용은 그 별표를 염두에 두고 읽어야 한다. 여기서 공식 채널은 릴리스 노트가 아니라 커뮤니티 그룹 공지와 그에 딸린 피드백 양식이다. 이어지는 내용은 해당 공지, 공지 발표 후 수시간 내에 나온 중국 언론의 보도, 그리고 자신의 키를 엔드포인트에 연결해 측정한 개발자들의 첫날 수치를 종합한 것으로, 공급업체의 주장과 커뮤니티의 수치는 각각 그 성격이 무엇인지 표시해 두었다.

오늘 실제로 무슨 일이 있었나요?

9월 8일 베이징 시간 15:00경, Deep​Seek 팀은 공식 커뮤니티 그룹에 중간 버전(중국어로는 中间版本, 즉 중간 체크포인트)이 최종 버전 출시 전에 실제 API 환경 안에서 제한적 테스트를 위해 공개되고 있다고 전했다. Deep​Seek API 키를 가진 사람이라면 누구나 호출할 수 있다. 기존 base URL과 키를 그대로 유지하고 모델 이름을 deepseek-v4.1-flash-expires-on-0910으로 설정하면 된다. 그것이 접근 방법의 전부다. 별도의 엔드포인트도, 대기자 명단도, 새 콘솔도 없다.

실질적 운용 여지는 빠듯하다. 접미사에 계획이 담겨 있다. 테스트 버전은 "9월 10일에 자동 만료되어 오프라인으로 전환될 것"이며, 가동 시간은 약 이틀 정도다. 각 계정은 동시 요청 20건으로 제한되는데, 이는 DeepSeek가 deepseek-v4-flash에 대해 공개한 2,500건 동시성 한도와 대비된다. 이는 의도를 강하게 시사한다. 프로덕션 트래픽을 연결하기 위한 것이 아니라 기능 테스트와 평가를 위한 것이라는 뜻이다.

• 무엇인가 — 공식 빌드에 앞선 단기 테스트를 위해 라이브 API에 배치된 "중간 버전" 체크포인트.

실행 위치 — DeepSeek 자체 API; 기본 URL과 키는 변경되지 않고, 모델 이름만 deepseek-v4.1-flash-expires-on-0910으로 교체됩니다.

• 얼마나 오래인가 — 이름에는 expires-on-0910이라고 명시되어 있고, 테스트는 9월 10일쯤 오프라인될 것으로 예상됩니다.

• 누가 호출할 수 있나요 — Deep​Seek 키가 있는 모든 계정, 계정당 동시 요청 20개.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Model ID deepseek-v4.1-flash-expires-on-0910, Status 2-day API beta - expires 09-10, Concurrency 20 req/account (V4 Flash: 2,500), Billing same rate card as DeepSeek V4 Flash, Speed (community) ~420 tok/s peaks 500+, Native multimodal text + image (official claim), with a footer reading 'Speed is community-measured; no official benchmarks or specs published yet.'

베타 버전 청구 내역: DeepSeek V4 Flash 요금표

Deep​Seek는 테스트가 deepseek-v4-flash와 동일한 요율로 청구되며, 해당 모델의 현재 요금표가 적용된다고 밝혔습니다. 2026년 8월 16일 요금 재조정 이후, Deep​Seek는 피크/오프피크 요금제를 운영합니다. 정확한 수치는 Flash 티어의 공식 요금입니다:

입력, 캐시 적중 — 오프피크 $0.007/1M 토큰, 피크 $0.014/1M 토큰

• 입력, 캐시 미스 — $0.22 / 1M 토큰 (오프피크), $0.44 (피크)

• 출력 — 1M 토큰당 $0.66 (비수기), $1.32 (피크)

• 피크 시간대 — 월요일~금요일 01:00–04:00 및 06:00–10:00 UTC, 그 외 모든 시간대는 비피크 시간대로 피크 요금의 절반이 적용됩니다.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the current public lineup — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, the off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak), and published concurrency limits of 2,500 / 500 / 2,500.

변하지 않은 것은 토큰당 가격이다. 따라서 V4.1 Flash가 {{1}}더 저렴하다{{/1}}는 DeepSeek의 주장은 요금 인하가 아니라 효율성에 관한 주장이다. 첫날 테스트에 나선 몇몇 사용자들은 이 점을 비싼 대가를 치르며 확인했다. 이 모델이 토큰을 훨씬 더 빨리 소모하기 때문에, 5분짜리 세션에서 DeepSeek V4 Flash로 같은 시간을 사용했을 때보다 잔액이 눈에 띄게 더 많이 줄어드는 것을 목격했기 때문이다. {{2}}작업당 비용{{/2}}이 실제로 줄어들지는 더 적은 토큰과 더 적은 재시도로 작업을 끝낼 수 있는지에 달려 있으며, 이는 이틀간의 속도 테스트만으로는 누구도 판단할 수 없다.

"새로운 아키텍처, 네이티브 멀티모달"이 의미하는 바 — 지금까지는 미검증

Deep​Seek의 V4.1 Flash 공식 설명은 네 가지 주장으로 압축된다: 새로운 모델 구조, 네이티브 멀티모달 지원, 더 강력한 성능, 더 빠른 생성. 아키텍처 주장이 가장 두드러지는데, 이는 기존 패턴을 깨는 것이기 때문이다. 직전 업데이트인 DeepSeek V4 Flash 0731은 프리뷰와 동일한 아키텍처와 규모를 유지한 사후 학습(post-training) 업데이트였다. 그러나 이번 Deep​Seek의 표현은 구조적 변화를 시사하며, 여러 매체는 이를 모델이 파인튜닝이 아닌 재사전학습(re-pretraining)된 것이라는 신호로 해석했다. 그 외의 모든 것은 추정(inference)일 뿐이다. 어텐션 메커니즘 변경, 전문가 네트워크, 통합 비전 모듈에 대한 커뮤니티의 추측은 말 그대로 추측에 불과하다. 파라미터 수, 컨텍스트 윈도우 수치, 벤치마크 표, 기술 보고서 중 어느 것도 공개되지 않았다.

"네이티브 멀티모달"이라는 표현이 중요한 이유가 있습니다. 8월 21일에 출시되고 8월 31일부터 가중치가 공개된 DeepSeek-V4-Flash-Vision-Exp는 DeepSeek V4 Flash 텍스트 베이스에 비전 인코더를 결합한 방식입니다. DeepSeek 자체 자료에서도 이 둘을 텍스트 모델에 외부 비전 경로를 더한 것으로 설명했습니다. 반면 V4.1 Flash는 처음부터 멀티모달로 설계되었으며, 이미지와 텍스트 입력을 기본 모델 자체가 처리합니다. 원칙적으로 이는 실제 아키텍처 차이입니다. 그러나 모달리티 사양은 아직 공개되지 않았습니다. 테스터들이 실제로 검증한 것은 텍스트와 이미지의 조합이며, 독자는 모델 카드가 나오기 전까지는 "멀티모달"이라는 표현이 오직 텍스트-이미지 결합이라는 의미에서만 확인된 것으로 이해해야 합니다. 더 넓은 입력 범위가 계획에 포함되어 있는지는 현재 시점에서는 확인된 사실이 아니라 미지의 상태입니다.

속도가 핵심입니다 — 그리고 그것은 커뮤니티 측정값입니다.

첫날 회자된 수치에 따르면 긴 생성에서는 초당 약 420개의 출력 토큰이 생성되며, 개별 실행에서 초당 500토큰을 넘는 최고치가 보고되기도 했다. 널리 공유된 한 테스트는 3분도 안 되어 71,000개 이상의 토큰을 생성했다. 이 수치들은 어느 것도 공식적이지 않다. 즉, 이는 통제되지 않은 조건에서 베타 엔드포인트를 대상으로 한 개발자 측정치이며, DeepSeek은 자체 속도 벤치마크를 공개한 적이 없다. 비교를 위해 말하자면, Artificial Analysis는 공개된 DeepSeek V4 Flash 0731 엔드포인트를 초당 약 128토큰으로 측정한다. 따라서 초기 보고들은 약 3배 이상의 원시 처리량(raw throughput) 도약을 시사한다. 다만 처리량은 입력 길이, 동시성, 서버 상태에 따라 달라진다는 일반적인 전제가 붙는다.

DeepSeek-V4-Flash-Vision-Exp와의 종단 간 비교에서 격차가 가장 크게 보인다. 동일한 작업을 연속으로 측정하기 때문이다. 테스터들은 SVG 코드 생성 작업에서 약 6배, 49k 토큰 장문 컨텍스트 검색에서 약 5.2배, 대규모 SQL 생성 및 최적화 작업에서 약 5배, 알고리즘 문제에서 4.6배, 비동기 리팩터링 작업에서 3.9배 더 빠른 종단 간 성능을 보고했다. 이는 정밀한 수치가 아니라 경향성을 보여주는 것으로 간주하라. 동일 작업의 종단 간 수치에는 사고 시간, 첫 토큰 지연 시간, 생성 속도가 모두 포함되며, 통제된 테스트 스위트가 아닌 개별 테스터들의 결과에서 나온 것이다. 모든 수치에서 일관된 방향성이 중요한 신호이지, 특정 배수가 중요한 것이 아니다.

베타의 핵심에 있는 질문

가장 전략적인 디테일은 Deep​Seek가 테스트에 첨부한 피드백 양식에 숨어 있다. 에이전트 프레임워크와 실제 시나리오에 관한 질문들과 함께, 이 양식은 테스터들에게 DeepSeek V4.1 Flash 중간 버전이 '현재 서비스 중인 DeepSeek V4 Pro를 완전히 대체할 수 있는가'라고 직접 묻는다. 회사가 사용자들 앞에 그런 질문을 내놓는다는 것은 주목할 만한 일이다. DeepSeek V4 Pro는 Flash보다 세 단계 높은 가격대에 있기 때문이다. 현재 공식 요율(비수기 기준)을 보면, Pro 모델은 입력 토큰 100만 개당 $0.66(캐시 미스), 출력 토큰 100만 개당 $1.98을 부과하는 반면 DeepSeek V4 Flash는 입력 토큰 100만 개당 $0.22, 출력 토큰 100만 개당 $0.66이다. 모든 항목에서 정확히 3배 차이다. 만약 Flash 등급 모델이 Flash 등급 가격으로 실제로 Pro급 성능에 근접한다면, 상당수의 사용자에게 그 질문은 저절로 답이 나온다. 그리고 Deep​Seek도 이 사실을 알고 있다.

‘새로운 구조’라는 표현과 함께 읽으면, 이 설문 조사는 V4.1 Flash가 단순한 포인트 업데이트보다 더 큰 무언가의 첫 번째 가시적 단계임을 암시한다. 즉, Deep​Seek이 더 저렴하고 빠른 모델을 반복적으로 사용하여 특정 가격대가 제공하는 것에 대한 시장의 기대치를 재설정해 온 방식처럼, Flash 라인업이 플래그십과의 격차를 좁히도록 재배치되고 있다는 뜻이다. 그 어떤 것도 벤치마크로 확인된 것은 아니며, 두 문장짜리 질문에 대한 전략적 해석일 뿐이다. 하지만 그것이 Deep​Seek이 V4.1 Flash에 대해 오늘 한 말 중 가장 흥미로운 지점이다.

어디서 시도해 볼 수 있는지, 그리고 그동안 프로덕션에서는 무엇을 실행해야 하는지

테스트 기간 동안 V4.1 Flash에 접근할 수 있는 유일한 곳은 Deep​Seek의 자체 API입니다. 이틀 후 만료되는 빌드를 타사에서 호스팅하는 곳은 없으며, 응답을 중단할 예정인 모델 ID에 프로덕션 경로를 연결해서는 안 됩니다. 다음 이틀 동안의 현명한 사용법은 평가입니다. 대표적인 워크로드를 실행하고, 품질과 실제 토큰 경제성을 측정하며, 모델 카드가 포함된 공식 릴리스가 나올 때까지 보이는 모든 속도 수치는 일화적인 것으로 취급하세요.

중단 없이 작동해야 하는 트래픽의 경우, 공개 Deep​Seek 라인업은 변함이 없으며, 바로 그럴 때 라우팅 계층이 쓸모를 증명합니다. OrcaRouter에서는 DeepSeek V4 Flash, DeepSeek V4 Pro, DeepSeek-V4-Flash-Vision-Exp가 모두 하나의 API를 통해 접근 가능하며, Deep​Seek의 공시 가격이 마크업 없이 그대로 적용됩니다. 그래서 8월 가격 인하도 발표된 날부터 저희 쪽에 바로 반영되었지, 마진 스프레드시트가 나중에야 반영했을 때 적용된 것이 아닙니다. 정식 V4.1 Flash가 언젠가 제공업체에 출시되면, 동일한 구성이 낮은 전환 비용으로 이를 도입하는 방법이 됩니다. 트래픽의 일부를 새 모델로 보내고, DeepSeek V4 Flash 또는 V4 Pro를 자동 장애 조치(failover)로 유지한 다음, 라우터 DSL이 어떤 호출이 아직 검증되지 않은 모델에 적합하고 어떤 호출이 주력 모델에 남아야 하는지 결정하게 하십시오. 그 모델이 좋은지 알아보기 위해 프로덕션 경로를 이제 막 이틀 된 베타에 걸 필요는 없습니다.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash (captured September 5, 2026) showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, text input, a p50 time-to-first-token of 434 ms, and the description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context, optimized for fast everyday workloads.'

열린 질문

• 공식 릴리스는 언제 출시되나요? 이 모델을 포착한 신호에 따르면 릴리스 포스트가 "곧" 올 것으로 예상되며, 베타 버전이 이틀밖에 지속되지 않은 점은 DeepSeek이 세상을 오래 기다리게 하지 않겠다는 뜻을 시사합니다.

• 최종 빌드가 이것과 동일한가? DeepSeek의 테스트 주기를 추적하는 독립 테스터들은 회사가 여러 후보 빌드를 병렬로 실행 중인 것으로 보인다고 지적한다. 초기 테스트에서 가장 빠른 후보가 항상 출시되는 것은 아니므로, 오늘의 속도 수치가 GA 모델을 설명하지 못할 수도 있다.

• 사양은 무엇인가? 파라미터 수, 아키텍처 세부 사항, 컨텍스트 길이, 그리고 전체 입력 모달리티 목록은 모두 미공개이며, 이 모두가 실제 리뷰가 가장 먼저 필요로 하는 요소들이다.

• 가격은 유지되나요? 그리고 "더 낮은 비용"이라는 말이 실제 워크로드를 만났을 때도 유효할까요? 베타 버전은 DeepSeek V4 Flash 요율로 청구되며, 정식 출시 시 새로운 요율표가 나올 수 있고, 작업별 비용은 측정되지 않았습니다.

• 정말 Pro 등급의 일을 해낼 수 있을까? 설문지는 그 질문을 던지지만, 오직 에이전트형 및 추론 스위트에 대한 독립적 평가 — 즉 오늘날 Flash 등급과 Pro 등급을 구분 짓는 벤치마크 — 만이 답할 수 있다.

Deep​Seek 키가 있다면, 핵심은 이틀짜리 카운트다운입니다. deepseek-v4.1-flash-expires-on-0910이 사라지기 전에 호출하고, 자체 워크로드를 실행한 다음, 그 숫자들을 “커뮤니티 측정, 조건에 따라 다름”으로 분류해 두세요. 나머지 사람들이 주목할 것은 릴리스 포스트와 그 이면의 질문, 즉 Deep​Seek의 가장 저렴한 티어가 가장 비싼 티어를 겨냥하기 시작했는지 여부입니다.

이틀간의 베타가 안정화되는 동안, 오늘 실제로 실행할 수 있는 안정적인 Flash 모델은 API 호출 한 번으로 이용할 수 있습니다:DeepSeek V4 Flash on OrcaRouter — Deep​Seek의 정가 그대로, 마크업 0%로 전달됩니다.

그리고 베타 설문지가 테스터들에게 V4.1 Flash와의 비교를 계속 요청하는 플래그십: DeepSeek V4 Pro on OrcaRouter.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트