
DeepSeek V4.1 Flash vs DeepSeek V4 Pro: 같은 공급업체, 다른 세대
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
DeepSeek V4.1 Flash와 DeepSeek V4 Pro를 맞붙여 놓을 때 흥미로운 점은, 더 새로운 모델이 더 큰 모델은 아니라는 것입니다. DeepSeek V4 Pro는 활성 파라미터가 490억 개인 1.6조 파라미터 전문가 혼합(MoE) 모델이며, 여전히 서비스되고 있습니다. DeepSeek V4.1 Flash는 입력에서 80억 개, 출력에서 160억 개가 활성화되는 5,520억 파라미터 MoE이며, DeepSeek가 이를 대체하기 위해 만든 모델입니다. 둘 다 같은 제공업체의 가격표에 올라 있고, 둘 다 100만 토큰의 컨텍스트를 받으며, 둘 다 MIT 라이선스로 배포됩니다. 이들 중 하나를 고르는 것은 크기에 관한 질문이 아닙니다. 어떤 아키텍처에 비용을 지불할 것인가에 관한 질문이며, 그 답은 2026년 9월 10일에 바뀌었습니다.
나란히 놓고 보면 실제로 무엇이 다른가
• 매개변수 — V4.1 Flash는 총 552B / 입력에서 8B 활성, 출력에서 16B 활성인 반면, V4 Pro는 총 1.6T / 49B 활성입니다. V4 Pro는 총 매개변수가 약 세 배이고, 입력 측면의 활성 수치는 여섯 배입니다.
• 아키텍처 — V4.1 Flash는 Causal Encoder-Decoder로, V4 Pro의 이전 설계와 대비되는 새로운 기본 아키텍처입니다. 이것이 이 둘 사이의 실질적인 차이이며, ".1"이 포인트 릴리스가 아닌 이유입니다.
• 100만 토큰당 가격 — V4.1 Flash는 오프피크에 입력 $0.15 / 출력 $0.60, V4 Pro는 입력 $0.66 / 출력 $1.98 (OrcaRouter 목록 기준).
• 캐시된 입력 — V4.1 Flash 1M당 $0.003 vs V4 Pro 1M당 $0.024.
• 토큰당 KV 캐시 — V4.1 Flash는 890바이트, V4 Pro는 그보다 더 큰 메모리 점유. 컨텍스트가 100만 토큰에 이르면, 긴 에이전트 트랜스크립트가 메모리에 상주할 수 있을지를 결정하는 것은 바로 이 항목이다.
• 컨텍스트 및 출력 — 양쪽 모두 1M 컨텍스트와 384K 최대 출력. 레벨.
• 첫 토큰까지 관측된 지연 시간 — OrcaRouter의 7일 텔레메트리 기준 V4.1 Flash p50 2.63초 vs V4 Pro p50 3.58초, V4 Pro의 p95는 10.00초.
• 입력 모달리티 — V4.1 Flash는 텍스트와 이미지를 입력받는 반면, V4 Pro는 동일한 리스팅에서 텍스트 입력 및 텍스트 출력만 지원합니다. 더 새로운 모델은 입력 측면에서 둘 중 더 넓은 범위를 지원할 뿐만 아니라 비용도 더 저렴합니다.
공급업체의 프레이밍 없이 목록을 읽어 보면 패턴이 이례적이다. 후속 모델은 모든 항목에서 더 저렴하고, 첫 토큰까지 더 빠르며, 입력 측면에서 더 넓고, 모든 항목에서 더 작다. 이것이 진정한 아키텍처 변화가 도착했을 때의 모습이며, 여기서 "어느 쪽이 더 나은가"에 짧은 답과 그 아래에 더 긴 답이 있는 이유다.

V4 Pro 타임라인, 아직도 이를 사용하는 모든 사람에게 중요하니까
DeepSeek V4 Pro는 서비스 종료가 예정되어 있었습니다. API는 2026년 9월 14일 베이징 시간 12:00에 중단될 예정이었고, 트래픽은 V4.1 Flash로 라우팅될 예정이었습니다. 그러나 그렇게 되지 않았습니다. 9월 11일, 공급업체는 결정을 번복하며 다음과 같이 밝혔습니다. "사용자 수요에 부응하여, 2026년 9월 14일 이후에도 DeepSeek V4 Pro의 API 서비스를 계속 제공하기로 결정했으며, 청구 방식은 변경 없이 유지됩니다."
그로부터 두 가지가 따라오는데, 상황이 과잉 해석을 부추기므로 둘 다 정확히 짚을 가치가 있다.
첫 번째는 V4 Pro가 지원 중단된 것이 아니라는 점입니다. 가격이 그대로인 지원 모델이며, DeepSeek 자체 공지에서 기존 V4 Pro 트래픽을 라우팅하는 대상이 바로 이 모델입니다. 프로덕션 경로를 이 모델에 고정해 두었다면, 아무것도 사라지지 않았습니다.
두 번째는 DeepSeek V4.1 Pro가 존재하지 않는다는 점입니다. 서비스 종료 공지에서는 V4 Pro 트래픽이 "V4.1-Pro가 출시될 때까지" V4.1 Flash에 의해 처리된다고 언급했으며, 이로 인해 더 큰 형제 모델에 관한 어느 정도의 추측이 제기되었습니다. 2026년 9월 22일 현재 V4.1 Pro API도, 모델 카드도, 가중치도, 발표도 없습니다. 2026년 9월 21일의 한 보고서는 10월 중순에서 말까지로 예상되는 2조 매개변수 모델을 시사했는데, 이는 발표되지 않은 제품에 대한 단일 출처 주장이므로 그렇게 취급해야 합니다. V4.1 Pro 출시를 기준으로 용량을 계획하는 사람은 소문을 기준으로 계획하는 것입니다.
실제로 어느 것을 호출해야 할까요?
마이그레이션 사례는 명확하며, 이는 DeepSeek이 직접 V4 Pro 트래픽을 새 모델로 라우팅해 만든 사례입니다. 위 수치를 보면 V4.1 Flash는 더 저렴하고, 첫 토큰까지 더 빠르며, 정상 상태에서도 더 빠르고, 토큰당 KV 캐시도 더 작습니다. 워크로드가 49B 활성 파라미터만 할 수 있는 일을 하고 있지 않은 V4 Pro 워크로드라면, 더 새로운 모델이 비용과 지연 시간 측면에서 더 나은 도구이며, 저울질할 트레이드오프가 없습니다.
V4 Pro를 유지하는 이유는 훨씬 더 큰 활성 매개변수 수가 어려운 추론과 장기 지평의 에이전트 작업에서 무엇을 얻을 수 있는지에 관한 것이며, 이는 스펙 시트가 아니라 자체 평가로 입증해야 하는 주장입니다. 그 이유는 두 모델이 서로를 격리하는 방식으로 공통 공개 리더보드에서 비교되지 않기 때문입니다: DeepSeek V4.1 Flash는 2026년 9월 21일부터의 Agents on Rails 스윕에서 최대 노력에서 17%로 나타나지만, V4 Pro는 그 리더보드에 없습니다. 지적할 수 있는 일대일 수치는 없습니다. 존재하는 것은 아키텍처로부터의 그럴듯한 주장입니다 — 6배의 활성 매개변수는 포기하기에는 많은 용량입니다 — 그리고 그것은 측정이 아닌 주장입니다.
두 모델 사이에서 트래픽을 옮기는 분들을 위한 실용적인 참고 사항 두 가지입니다. 첫째, 피크 시간 일정은 두 모델 모두에 적용되므로, 잘못된 시간대에 비용 비교를 실행하면 결과가 두 배나 틀어집니다. 피크는 평일 UTC 01:00–04:00 및 06:00–10:00이고, 주말은 전부 오프피크입니다. 둘째, 두 모델은 컨텍스트 윈도우와 출력 상한을 공유하므로 마이그레이션을 해도 프롬프트 예산은 바뀌지 않습니다. 따라서 애플리케이션 측면에서 전환 위험은 유난히 낮습니다.
둘 다 하나의 엔드포인트를 통해 실행하기
두 가지를 모두 진정으로 원하게 되는 상황은 전환 기간이며, 이는 생각보다 흔합니다. V4.1 Flash로 옮기고 싶지만 새 아키텍처에서의 동작이 아직 검증되지 않은 파이프라인을 하나 보유한 팀이 바로 그렇습니다. 두 가지를 각기 다른 벤더를 통해 나란히 운영한다는 것은, 모델 수준에서는 하나의 제공자인 대상을 놓고 두 개의 계약과 두 세트의 키를 관리해야 한다는 뜻입니다.
둘 다 단일 키 아래 OrcaRouter에 있으므로 이는 라우팅 결정으로 축소됩니다. OrcaRouter는 공급자 목록 가격을 0% 마크업으로 전달하므로, 위 수치는 우리 것이 아니라 DeepSeek 자체 요금이며, DeepSeek의 피크 및 오프피크 일정은 DeepSeek이 정의한 그대로 적용됩니다 — 전환 중 가격 변경을 포함하여, 이는 우리 쪽에서도 같은 날 적용됩니다. 새 모델로 트래픽의 일부를 보내고 출력을 비교하거나, 작업 유형별로 라우팅하고, 새 경로 뒤에 자동 장애 조치를 배치하여 V4.1 Flash가 귀하의 데이터에서 예상치 못한 동작을 하면 요청이 오류 페이지가 아니라 V4 Pro에 도달하도록 할 수 있습니다.
벤더가 이 모델들 중 어느 것이 사라질지에 대해 이미 한 번 마음을 바꾼 적이 있다는 점을 고려하면, 두 모델 모두를 하나의 통합 뒤에서 접근 가능하게 유지하는 것이 다음번 번복을 예측할 필요가 없는 선택입니다.

볼 만한 것
• V4 Pro의 가격이나 단종 상태가 다시 바뀌는지 여부. 9월의 번복은 청구가 변경되지 않는다는 점을 분명히 했으며, 바로 그것이 공급업체에 반드시 지켜지도록 해야 할 약속이다.
• V4.1 Pro가 실제로 등장하는지 여부. 모델 카드나 가중치 공개가 있기 전까지, 2T 파라미터 이야기는 출처가 하나뿐인 소문이다.
• 두 모델을 동일한 보드에서 실행하는 독립적인 평가. 그것이 존재하기 전까지, 이 둘 사이의 정직한 비교는 측정 가능한 비용, 지연 시간, 아키텍처, 그리고 측정 가능하지 않은 능력에 대한 이성적 추측이다.
그 세 가지 중 세 번째가 나올 때까지, 정확한 요약은 다음과 같다: DeepSeek V4.1 Flash는 DeepSeek V4 Pro의 더 저렴하고 더 빠른 후속 모델이며, V4 Pro는 변경되지 않은 가격으로 여전히 지원되고, 더 새로운 아키텍처가 성능을 포기하는지에 대한 질문은 현재 어떤 공개 벤치마크도 답하지 못하는 질문이다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
