
DeepSeek V4 Pro 출시일: 이미 Kimi K3보다 14배 저렴, 아직 그만큼 똑똑하지는 않음
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxNEWMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 2110 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
2026년 7월 31일, 회사는 자사의 저렴한 모델이 비싼 모델을 이겼다는 내용의 변경 로그 항목을 게시했다. 그 항목은 DeepSeek V4 Flash, 즉 284B 효율 등급에 관한 것이었고, 헤드라인 주장은 "에이전트 기능이 크게 향상되어 벤치마크 결과가 V4-Pro-Preview를 훨씬 능가한다"였다. V4-Pro-Preview는 DeepSeek V4 Pro — 1.6조 매개변수의 플래그십 모델로, 토큰당 비용이 3배 비싼 모델이다. 같은 항목은 이에 대해 한 문장으로 끝맺었다: "DeepSeek-V4-Pro의 공식 출시는 곧 이어질 것입니다." 이것이 현재 돌아다니는 예측의 맥락인데, 진짜 V4 Pro가 출시되면 그것은 Kimi K3 수준이지만 10배 더 저렴할 것이라는 것이다. 그 절반은 이미 측정 가능하며, 거의 아무도 예상하지 못한 방향으로 틀렸다.
이 글이 무엇이고 무엇이 아닌지에 대한 참고 사항입니다. 여기에는 유출된 시스템 카드도, 내부 벤치마크도, 날짜도 없습니다. 현재 떠도는 예측은 X의 @scaling01에서 나온 것입니다 — "DeepSeek-V4 Pro는 대박이 될 것이고, 아마도 Kimi-K3 수준이지만 10배는 더 저렴할 것" — 이는 팔로워가 많은 실무자의 전망이지, 내부 접근 권한이 있는 사람의 공개가 아닙니다. 이를 유출로 취급하는 것이 잘못된 출시일 보도가 작성되는 방식입니다. 대신 우리가 할 수 있는 일은 이 주장의 검증 가능한 두 부분을 가져와 이미 존재하는 수치와 대조하는 것입니다. 프리뷰 빌드는 3개월 동안 호출 가능했고, 그 빌드와 Kimi K3 모두 독립 연구소에서 실행되었기 때문입니다. 아래의 모든 내용은 출처별로 표시되어 있습니다: 회사 자체 문서, Artificial Analysis의 측정값, 또는 우리가 직접 수행해 보여주는 계산입니다.
딥시크가 실제로 말한 것과 말하지 않은 것
확인된 범위는 '미출시 모델'이라는 프레이밍이 시사하는 것보다 더 넓다. V4 Pro는 허상이 아니다 — 지금 바로 호출할 수 있다. 아직 일어나지 않은 것은 회사 자체가 공식이라고 간주하는 출시다.
• 아키텍처 — 총 1.6T 파라미터와 토큰당 49B 활성 파라미터를 가진 mixture-of-experts 모델로, 회사가 확인했으며 Artificial Analysis에도 1600B/49B로 동일하게 등재되어 있습니다.
• 컨텍스트 및 출력 — 최대 384K 출력 토큰을 지원하는 1M 토큰 입력 창(1,048,576). 텍스트 입력, 텍스트 출력; 이미지, 오디오 또는 비디오 입력은 지원하지 않음.
• 라이선스 및 가중치 — MIT 라이선스이며, 가중치는 Hugging Face에 공개되어 있습니다. 이 모델은 오픈 가중치 플래그십 모델로, 이것이 바로 Kimi K3와의 비교가 흥미로운 이유입니다.
• 정가 — 캐시 미스 시 입력 토큰 100만 개당 $0.435, 캐시 히트 시 $0.003625, 출력 토큰 100만 개당 $0.87(회사 자체 가격 페이지 기준).
• 인터페이스 — OpenAI 스타일 ChatCompletions 및 Anthropic 형식 엔드포인트, 그리고 추론 노력 수준, 도구 호출 및 구조화된 출력.
• 지금까지의 타임라인 — V4 제품군은 2026년 4월 24일에 프리뷰로 출시되었으며, 기존의 deepseek-chat 및 deepseek-reasoner 모델 이름은 2026년 7월 24일에 폐지되었습니다. Flash는 2026년 7월 31일에 공식 빌드를 받았고, Pro는 그렇지 않았습니다.
• 2026년 8월 6일DeepSeek는 개발자들에게 DeepSeek API 서비스의 전반적인 가격을 인상할 계획이라고 밝히며, “가까운 시일 내에 상당한 인상이 예상된다”고 말했다. 또한 공식 V4 Pro 출시가 뒤따를 것이라고 재차 강조했다. 새로운 요금이나 시행 날짜는 공개되지 않았다.
그리고 진정으로 알려지지 않은 채 남아 있는 부분들, 즉 사람들이 찾고 있는 대부분의 것들:
• GA 날짜 — 아직 발표되지 않았다. "곧 발표될 것"이라는 말이 회사의 공식 입장의 전부다. 확인되지 않은 언론 보도는 8월 중순을 유력한 시기로 지목한다 — 한 매체는 8월 10~20일을 거론했고, 한 리셀러의 가격 페이지는 8월 3일에 V4 Pro 캐시 가격을 변경했는데, 이는 역사적으로 출시 전에 나타나는 패턴이다 — 하지만 그 어느 것도 회사가 말한 것이 아니다. 확정된 날짜는 없다.
• GA 빌드가 무엇을 변경할지 — 언급되지 않았다. 회사는 공식 V4 Pro가 동일한 가중치의 재포스트 트레이닝인지, 새로운 사전훈련인지, 아니면 가격 재조정인지 밝히지 않았다.
• 그 가격이 이를 견뎌내는지 여부 — 다루어지지 않았으며, 이에 대해 우려할 특정한 이유가 있는데, 이는 아래에서 다룹니다.
명확히 짚고 넘어가야 할 수정 사항이 하나 있습니다. 이 질문에 대한 검색 결과가 오염되어 있기 때문입니다. V4 제품군이 2026년 7월 20일에 일반 공급(GA)에 도달했다고 주장하는 페이지들을 찾을 수 있습니다. 그러나 그 날짜로부터 11일 후 회사 자체 변경 로그에는 공식 V4 Pro 릴리스가 아직 보류 중이라고 밝히며, 7월 31일 업데이트는 "DeepSeek-V4-Flash API만 업그레이드한다. DeepSeek-V4-Pro API와 APP/WEB 모델은 변경되지 않았다."고 덧붙입니다. 제3자 요약과 공급업체의 공식 변경 로그가 일치하지 않을 경우, 변경 로그가 우선합니다.

가격 주장: "10배 저렴"이라는 것은 보수적인 해석이다.
Kimi K3는 입력 토큰 100만 개당 $3.00, 출력 토큰 100만 개당 $15.00이며, 캐시 적중 시 $0.30입니다. V4 Pro는 입력 토큰 100만 개당 $0.435, 출력 토큰 100만 개당 $0.87이며, 캐시 적중 시 $0.003625입니다. 이 둘을 비교해 보면 "10x"는 헤드라인이 아니라 범위의 하한선임을 알 수 있습니다:
• 입력 토큰 — $3.00 대비 $0.435이므로 V4 Pro는 6.9배 더 저렴합니다. 이것은 주장이 과장된 유일한 측면입니다.
• 출력 토큰 — $15.00 대비 $0.87, 즉 17.2배 더 저렴합니다. 출력은 추론 모델이 비용을 지출하는 부분이므로, 이것이 가장 중요한 수치입니다.
• 70/30 투입-산출 블렌드 — 백만 당 $6.60, $0.5655 대비 11.7배.
• Artificial Analysis의 7:2:1 캐시 적중/입력/출력 혼합 — $2.31 대 $0.18, 즉 12.8배.
• 캐시 입력 — $0.30은 $0.003625 대비 약 83배. 이 회사의 캐시 읽기 요금은 Artificial Analysis가 추적하는 101개 모델 중 4위를 차지하며, 자체 캐시 미스 요금 대비 99% 할인된 가격입니다.
가상의 혼합은 논쟁의 여지가 있으니, 실제 측정된 사례를 들어보겠다. Artificial Analysis는 각 모델에서 전체 Intelligence Index를 실행하는 데 실제로 지출한 비용을 공개한다 — 동일한 평가 스위트, 동일한 하네스, 가정된 비율이 아닌 실제 토큰 수를 기준으로 한다. Kimi K3를 평가하는 데는 $2,437.41가 들었다. V4 Pro는 $176.34였다. 동일한 작업 부하에서 실제로 누군가 지불한 달러 기준으로 13.8배 차이다.
그 수치가 17.2배 출력-가격 비율보다 낮은 이유를 이해할 가치가 있습니다. V4 Pro의 저렴함이 부분적으로 자초된 유일한 지점이기 때문입니다. V4 Pro는 장황합니다. 인덱스를 통과하는 데 1억 8천만 개의 출력 토큰을 소모했으며, Kimi K3는 1억 3천만 개, 해당 클래스의 중앙값은 1억 개였습니다. 따라서 말하려는 내용을 전달하는 데 약 38% 더 많은 토큰을 사용하며, 이는 토큰당 이점을 잠식합니다. 13.8배 수치에는 이미 이것이 반영되어 있고, 17.2배 수치에는 반영되어 있지 않습니다. 예산을 책정한다면 측정된 수치를 사용하세요.
이 부분은 또한 곧이곧대로 믿기보다 직접 확인하기 쉬운 이야기의 대목입니다. OrcaRouter가 공급업체의 공시 가격을 0% 마크업으로 그대로 통과시키기 때문에, 당사의 deepseek/deepseek-v4-pro 및 kimi/kimi-k3 모델 페이지에 표시된 토큰당 가격은 두 업체 자체의 가격입니다. 즉, K3는 당사 페이지에서 $3.00/$15.00로, Moonshot 페이지에서도 $3.00/$15.00로 표시되며, 숨겨진 마진이 포함된 재판매 요금이 아닙니다. 이는 위의 계산이 한 장의 청구서에서도 그대로 재현된다는 뜻이며, 어느 한쪽 업체가 가격을 변경하면 그 변경 사항은 계약 주기가 끝난 후가 아니라 같은 날 당사 측에 반영됩니다.
지능에 대한 주장: 13점, 동등이 아님
"Kimi K3 레벨"은 현재 수치와 접촉하면 살아남지 못하는 예측의 절반이다. Artificial Analysis의 인텔리전스 지수에서 2026년 8월 5일 기준으로 Kimi K3는 57점, DeepSeek V4 Pro(추론, 최대 노력)는 44점을 기록했다. — 101개 모델 중 6위로, 확실히 강력한 성적이지만 여전히 13점이 부족하다. 두 모델 모두 동일한 연구소에서 동일한 복합 지표로, 최대 추론 노력으로, 1M 토큰 컨텍스트에 대해 측정되었다.
벤더 벤치마크는 다르고 더 유리한 이야기를 전하는데, 바로 그렇기 때문에 라벨링이 필요한 것이다. 회사는 SWE-bench Verified에서 80.6%, GPQA Diamond에서 90.1%를 V4 Pro-Preview가 기록했다고 보고한다. Moonshot은 Kimi K3가 SWE-bench Verified에서 76.8%, GPQA Diamond에서 93.5%를 기록했다고 보고한다. 문자 그대로 받아들이면 V4 Pro가 코딩 벤치마크에서 완전히 승리한다. 두 결과 모두 독립적으로 재현된 적이 없으며, 결과에 이해관계가 있는 팀들이 서로 다른 하네스에서 생산했고, 제3자가 두 모델을 모두 직접 실행한 유일한 합성 지표에서는 순서가 뒤바뀐다. 이것이 벤더 간 단일 벤치마크 비교를 불신해야 하는 모든 이유이다.

인덱스 수치에는 자체적으로 주의할 점이 두 가지 있다. 첫째, V4 Pro를 {{1}}44가 아니라 52로{{/1}} 인용한 오래된 글을 발견하더라도 그 글들이 틀린 것은 아니다. Artificial Analysis 자체의 4월 출시 기사에서도 V4 Pro (Max)를 52로 평가하며 오픈 가중치 추론 모델 2위라고 불렀다. 인덱스는 수정되며, 수정은 모든 모델의 점수를 바꾼다. 실질적인 규칙은 같은 스냅샷끼리의 비교만 의미가 있다는 것이다. 4월의 52와 8월의 57은 같은 문장에 들어갈 수 없다. 둘째, {{2}}Artificial Analysis의 페이지{{/2}}는 '2026년 4월 출시'로 날짜가 표시되어 있으며 프리뷰 빌드와 추후 공식 버전을 구분하지 않으므로, 그 44는 테스트된 시점에 엔드포인트가 제공한 값을 측정한 것일 뿐이다.
V4 Pro가 Kimi K3를 분명히 이기는 부분은 지능이 아닌 축들입니다. V4 Pro는 초당 66.5토큰을 생성하는 반면 K3는 37.6토큰이며, 해당 클래스의 중앙값은 65.9입니다. 따라서 V4 Pro는 해당 클래스에서 평균 수준이고 Kimi K3는 비정상적으로 느린 것입니다. 첫 번째 토큰까지의 시간은 2.85초 대비 1.61초입니다. 인터랙티브 에이전트 루프에서는 그 차이가 매 턴마다 느껴지며, 이것이 현재 프리뷰 빌드를 지지하는 가장 강력한 근거입니다.
Flash의 공식 빌드가 Pro에 대해 알려주는 것
출시되지 않은 모델에 관한 실제 증거에 가장 가까운 것은, 이미 그 과정을 거친 자매 제품에서 나온 것입니다.
회사의 7월 31일 변경 로그에는 "{{1}}DeepSeek-V4-Flash-0731은 DeepSeek-V4-Flash-Preview와 동일한 모델 아키텍처와 크기를 유지하며, 단지 재-포스트 트레이닝만 수행되었다{{/1}}"고 명시되어 있습니다. 동일한 가중치 수, 동일한 아키텍처, 동일한 가격 — 포스트 트레이닝만 적용되었습니다. {{2}}Artificial Analysis는 이 결과를 50점으로 평가했으며, 이전 Flash 빌드는 40점이었습니다{{/2}}. 복합 지표에서 10점 상승, 전적으로 포스트 트레이닝만으로, 토큰당 추가 비용 없이 달성했습니다. {{3}}인덱스에서의 출력 토큰 소비량도 ~234M에서 ~206M으로 12% 감소하여{{/3}}, 동일한 정가로 운영 비용이 더 저렴해졌습니다.
그 선례를 Pro에 적용하면 계산은 피할 수 없다. 44 더하기 10은 54이고, Kimi K3는 57이다. 공식 V4 Pro가 회사가 공개적으로 입증한 가장 성공적인 사후 훈련 업그레이드를 반복한다고 해도, "Kimi K3 수준"에 약 3포인트 부족하며, 실행 비용은 약 14분의 1에 불과하다. 이는 놀라운 결과이며, 예측이 예상한 결과는 아니다.
그 외삽(extrapolation)에 대한 솔직한 경고는, 이는 예측이 아니라 산술(arithmetic)이라는 점입니다. 284B 모델에서의 +10 향상은 1.6T 모델에서 가능한 것에 대해 거의 말해주지 않으며, 그 여유는 더 크거나 훨씬 작을 수 있습니다. 회사는 Pro 빌드가 사후 훈련(post-training) 전용이 될 것이라고 밝히지 않았습니다. 그리고 그 지수는 복합 지표이므로 3포인트가 하나의 벤치마크일 수 있습니다. 그럼에도 숫자를 계산하는 이유는 그것이 존재하는 유일한 정량적이고 공급업체가 확인한 선례이며, 예측이 기대고 있는 것보다 훨씬 더 많은 근거를 제공하기 때문입니다.
그 변경 로그에서 반복해서 언급하기보다는 따로 지적할 만한 세부 사항이 하나 더 있습니다. Flash의 에이전트 점수는 "회사의 Harness minimal mode(곧 출시 예정)"를 사용하여 max effort, topp=0.95, temperature=1.0으로 생성되었습니다. 그 숫자를 생성한 하네스는 공개적으로 출시되지 않았습니다(8월 초에 비공개 베타에 들어갔습니다). 따라서 그 수치는 원칙적으로도 회사 외부에서는 누구도 재현할 수 없습니다. 그 수치가 틀려서가 아니라 도구를 사용할 수 없기 때문입니다. Pro 릴리스도 같은 별표(조건)와 함께 제공될 것으로 기대하세요.
저가 모델 논제를 무효화할 수 있는 조항들
회사의 가격 문서에는 V4 라인 가격에 거의 반영되지 않는 정책이 숨겨져 있다. 회사에 따르면, API는 "곧" "피크 시간대에는 모든 청구 항목에 대해 가격이 일반 가격의 2배가 된다"는 일정을 채택할 예정이다. 피크 시간대는 매일 베이징 시간 기준 09:00–12:00 및 14:00–18:00으로 정의되며, 하루 7시간, 매일 적용된다. 시행일은 "공식 발표에 따라 달라지며", 이 글을 작성하는 시점에서 추가 요금은 아직 적용되지 않았다.
방향에 주목하세요. 회사는 역사적으로 비수기 할인을 V3와 R1에 적용했습니다. 이것은 피크 할증료를 표준 요금에 부과하는 것입니다. 명시된 배율로 적용된다면 V4 Pro의 낮 시간대 가격은 인입 $0.87, 인출 $1.74가 되고, 비교 구도가 바뀝니다. Kimi K3 대비 종합 우위는 11.7배에서 5.8배로 떨어지고, 측정된 13.8배는 6.9배로 떨어집니다. 여전히 저렴합니다. 더 이상 '10배 저렴'하지 않으며, 유럽이나 아시아 팀이 실제로 일하는 시간대에도 더 이상 저렴하지 않습니다.
8월 6일, 더 큰 신발이 떨어졌다. DeepSeek은 개발자 플랫폼에서 DeepSeek API 서비스의 전반적인 가격을 "가까운 시일 내에, 상당한 인상이 예상된다"며 인상할 계획이라고 발표했다. 새 요금과 시행일은 공개되지 않았으며, 회사는 이번 인상이 피크시간대 요금제와 별개인지, 아니면 그것과 함께 적용되는지도 밝히지 않았다. 이 회사를 취재하는 언론은 이번 발표를 공식 V4 Pro 출시가 임박했다는 신호로 해석했다. 출시되지 않은 플래그십 모델을 곧 떠날 할인 체제에 공격적인 가격으로 넣을 리는 없기 때문이다. 오늘 V4 Pro를 기준으로 비용 모델을 구축하는 사람이라면 두 경우를 모두 모델링해야 하며, "이 회사는 14배 더 저렴하다"는 헤드라인(이 글 포함)을 읽는 사람이라면 그것이 만료 조건이 공지된 가격표를 설명하는 것임을 알아야 한다. 이것이 예측의 가격 부분이 더 이상 사실이 아니게 될 가장 유력한 경로이며, 모델과는 아무 관련이 없다.
공식 빌드가 출시되었는지 확인하는 방법
회사가 배송하는 방식에는 날짜보다 더 중요한 세부 사항이 있으며, 이는 실제 운영상의 위험 요소입니다.
API 모델 ID는 deepseek-v4-pro입니다. 결코 deepseek-v4-pro-preview가 아니며, 날짜가 붙은 빌드 문자열도 아닙니다 — 회사 자체 변경 로그에서 현재 빌드를 V4-Pro-Preview로, 출시된 Flash 빌드를 V4-Flash-0731로 지칭하고 있음에도 말이죠. Flash가 정식 버전이 되었을 때의 안내는 이러했습니다: "API 호출 방식은 그대로 유지됩니다. 최신 버전을 사용하려면 모델 이름을 deepseek-v4-flash로 설정하기만 하면 됩니다." 다시 말해, 모델 ID를 고정한다고 해서 빌드가 고정되는 것은 아닙니다. 동일한 문자열은 어느 순간 조용히 다른 가중치 세트를 서빙하기 시작했으며, 그 동작은 실질적으로 달랐고 지수 기준 10포인트 더 높았습니다.
따라서 "V4 Pro가 언제 출시되나"에 대한 실질적인 답은, 운영 환경에서 deepseek-v4-pro를 호출하고 있다면, 자신의 출력이 바뀌는 것을 보며 알게 될 것이라는 점입니다. 구체적으로 주목할 것들은 다음과 같습니다: 회사의 API 변경 로그에 날짜가 기재된 새 항목이 추가되는 것(Flash의 출시도 이 목록에 가장 먼저 나타났습니다); 호출 가능한 ID는 그대로인 채 해당 항목의 설명에 V4-Pro-0731 같은 빌드 접미사가 붙는 것; Artificial Analysis의 V4 Pro 페이지가 재평가되는 것(이는 여러분이 받게 될 첫 번째 독립적 확인입니다); 발표된 가격 인상이 실제 요율로 확정되는 것(GA는 가격 인상과 피크 시간대 일정이 반영되기에 자연스러운 시점입니다); 그리고 회사의 Responses API — 해당 문서에는 deepseek-v4-pro 지원이 8월 초로 계획되어 있습니다. 모델이 "계획됨" 목록에서 사라지고 "지원됨" 목록에 나타나는 것은 회사가 공개하는 것 중 공식 출시 신호에 가장 가깝습니다. 우리가 확인할 수 없는 두 가지 신호도 알아둘 가치가 있습니다: 리셀러의 가격 페이지가 8월 3일에 V4 Pro 캐시 가격을 변경했는데, 이는 역사적으로 출시 직전에 나타나는 패턴이며, 회사 내부 평가 하네스가 비공개 베타 상태여서 출시되면 그 공급업체 벤치마크를 마침내 확인할 수 있게 될 것입니다. deepseek-v4-pro-202606과 유사한 문자열이 유출된 빌드 식별자로 유포되기도 했습니다. 우리는 이를 어떤 회사 자산과 대조해 확인할 수 없었으며, 누군가 확인할 수 있을 때까지는 신뢰할 가치가 없습니다.
오늘 프리뷰를 기반으로 빌드해야 할까요?
대부분의 사람들이 이 모델을 평가할 때, 출시 날짜는 잘못된 질문입니다. 프리뷰는 호출 가능하고, 가격이 책정되어 있으며, MIT 라이선스가 적용되고, 지능 부문 101개 중 6위로 독립적으로 측정되었습니다. 진짜 질문은 예정된 GA가 지금 구축하는 작업에 어떤 영향을 미치는지이며, 여기에는 두 가지 뚜렷한 답이 있습니다.
V4 Pro와 Kimi K3 중에서 성능 기준으로 선택한다면, 현재 증거에 따르면 Kimi K3가 종합 점수에서 13포인트 앞서고 V4 Pro는 속도, 지연 시간, 비용에서 큰 폭으로 앞섭니다. 또한 예정된 사후 훈련 업그레이드가 지능 격차를 좁힐 수는 있지만 완전히 해소하지는 못할 것입니다. 업무가 고난도 추론의 최전선에 있다면 그 13포인트가 승부를 가르는 전부이며 가격은 방해 요소일 뿐입니다. 업무가 대량 처리이고 그저 어려운 정도라면 그 13포인트를 위해 14배의 비용을 지불하는 것은 정당화하기 어렵습니다.
이미 V4 Pro를 선택한 상태라면, 관리해야 할 리스크는 출시일이 아니라 무단 교체입니다. {{1}}그 모델 ID 뒤에 있는 빌드가 여러분도 모르는 사이에 바뀔 수 있고, 정확히 Flash의 경우처럼요. 여러분의 평가 시스템이 이를 감지할 수 있어야 합니다.{{/1}} {{2}}요청이 있을 때마다 다시 실행할 수 있는 회귀 테스트 세트를 유지하고, 코드 변경 없이 접근 가능한 두 번째 모델도 유지하세요.{{/2}} {{3}}이것이 우리가 장애 조치를 그 방식으로 구축한 평범한 이유입니다.{{/3}} {{4}}V4 Pro, V4 Flash, Kimi K3는 모두 OpenAI 호환 엔드포인트의 하나의 OrcaRouter 키 뒤에 위치하므로, "세 모델 모두에 대해 평가를 다시 실행한 후 트래픽을 전환"하는 것은{{/4}} {{5}}조달 작업이 아니라 설정 편집일 뿐이며, 좋지 않은 GA 빌드는 사고가 아니라 라우팅 결정입니다.{{/5}} {{6}}검증되지 않은 플래그십을 시도하는 것은, 그 선택을 되돌리는 데 비용이 들지 않을 때 훨씬 쉬워집니다.{{/6}}

사람들이 실제로 묻고 있는 질문들
DeepSeek V4 Pro가 출시되었나요, 아니면 아직인가요?
둘 다, 당신이 무엇을 의미하느냐에 따라 다릅니다. 그래서 검색 결과가 상충되는 것입니다. 이 모델은 2026년 4월 24일 V4 프리뷰 출시 이후 공개적으로 호출 가능했으며, 게시된 가격, MIT 라이선스의 공개 가중치, 독립적인 벤치마크 적용 범위를 갖추고 있습니다. 하지만 회사가 2026년 7월 31일에 게시한 변경 로그에는 V4 Pro API가 '변경 사항 없음'이며 공식 출시는 '곧 이어질 것'이라고 명시되어 있습니다. 그리고 8월 6일 DeepSeek은 대규모 API 가격 인상을 발표하면서 공식 버전을 가능한 한 빨리 출시하겠다고 다시 밝혔습니다. 즉, 사용은 가능하지만 아직 공식적이지 않습니다. 확정된 날짜는 없습니다. 확인되지 않은 보도에 따르면 8월 중순으로 예상되어 대기 시간이 짧을 수 있습니다.
공식 빌드가 Kimi K3만큼 좋아질까요?
현재 존재하는 유일한 정량적 선례에 따르면, 아마 그렇지 않을 것이다. Flash의 공식 빌드는 포스트 트레이닝만으로 Artificial Analysis의 Intelligence Index에서 10점을 얻었다. V4 Pro는 44점, Kimi K3는 57점이므로, 동일한 향상이 적용되면 54점이 된다. 그 추정은 어느 방향으로든 틀릴 수 있다. 1.6T 모델은 284B 모델과 다른 여유(headroom)를 가질 수 있고, 회사는 Pro 출시가 포스트 트레이닝만으로 이루어질 것이라고 밝히지 않았기 때문이다. 그러나 오늘날 동등성을 주장하는 사람은 어떤 공개된 측정값도 뒷받침하지 않는 것을 주장하는 것이다.
딥시크의 저가 모델이 현재 왜 플래그십 모델보다 점수가 더 높을까요?
출시 순서 때문이지, Flash가 더 나은 모델이기 때문이 아니다. Flash는 7월 31일에 포스트 트레이닝 업그레이드를 받아 지수 기준 40에서 50으로 올라갔지만, Pro는 이에 상응하는 업그레이드를 받지 못해 여전히 4월의 포스트 트레이닝 기준으로 평가되고 있다. 회사도 이를 스스로 인정하며, Flash-0731의 에이전틱 결과가 "V4-Pro-Preview를 훨씬 능가한다"고 설명한다. 이러한 역전 현상은 완료되지 않은 출시의 한 단면일 뿐이며, 곧 있을 Pro 릴리스가 바로 이를 종식시킬 것이다.
$0.435 / $0.87 가격이 비용 모델을 구축하기에 안전한가요?
조건부로, 그리고 일주일 전보다 덜 안전합니다. 이것은 회사의 현재 공개된 정가이며, V4 출시 요금에서 이미 대폭적인 영구 인하가 반영되어 있습니다. 그러나 8월 6일 DeepSeek는 API 가격을 전반적으로 인상할 계획이라고 발표했으며, "상당한 인상이 예상된다"고 밝혔지만, 새로운 요금이나 날짜는 아직 발표되지 않았습니다. 게다가 발표되었지만 아직 시행되지 않은 피크 시간대 정책은 하루 7시간 동안 모든 청구 항목을 두 배로 만들 것입니다. 두 시나리오를 모두 모델링하고, 두 배가 된 경우에도 여전히 Kimi K3보다 약 6배 저렴하다는 점에 유의하십시오.
솔직한 해석
이 모든 것을 시작한 예측은 절반만 맞았고, 맞은 절반은 사람들이 가장 믿기 어려워할 부분이다. "10배 더 저렴하다"는 표현은 오히려 과소평가다. 동일한 측정 평가 워크로드에서 DeepSeek V4 Pro의 프리뷰 빌드는 $176.34인 반면 Kimi K3는 $2,437.41였으며, 캐시된 입력의 경우 격차는 10배가 아니라 약 80배다. "Kimi K3 수준"이라는 부분은 아직 도달하지 못했다. 독립 연구소가 두 모델 모두에 대해 실행한 단일 종합 지표에서 57 대 44를 기록했으며, 회사 자체 최고 전례에서 낙관적으로 추산해도 54에 그친다.
이 평가를 바꿀 요소는 구체적이며 주목할 가치가 있다. 공식 V4 Pro 빌드가 포스트트레이닝 업그레이드로 출시되고 Artificial Analysis가 이를 57점 이상으로 재평가한다면, 이 예측은 완전히 입증되고 이 글의 핵심 수치는 더 이상 유효하지 않게 된다. 그것이 8월 6일에 발표된 피크시간 할증료나 가격 인상과 함께 출시된다면, 가격 논거의 설득력은 절반으로 줄어들고 흥미로운 질문은 6배 더 저렴한 가격이 13점 열세를 상쇄하는지가 된다. 그리고 회사가 이미 비공개 베타 상태인 평가 하네스를 출시한다면, 현재 코딩 부문에서 V4 Pro에 유리한 벤더 벤치마크를 처음으로 검증할 수 있게 된다. 그중 하나가 실현되기 전까지, DeepSeek V4 Pro에 대한 정확한 요약은 가중치를 다운로드할 수 있는 최고의 가성비를 갖춘 본격적인 추론 모델이지만, 가장 똑똑한 모델은 아니며, 공급업체가 아직 완성되지 않았다고 밝힌 모델이라는 것이다.
이 글에서 비교한 모델4
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
