히어로 타이틀 카드: DeepSeek V4.1 Flash Benchmarks — 74.2가 증명하는 것과 증명하지 않는 것, 공개일 2026-09-10, "6일간의 독립적 결과"라는 메모 포함
Guides & Insights

DeepSeek V4.1 Flash 벤치마크: 74.2가 증명하는 것과 증명하지 않는 것

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

DeepSeek V4.1 Flash는 DeepSWE v1.1에서 74.2점을 기록했는데, 이는 GPT-6 Astra보다 0.1점 높고 Gemini 3.8 Flash와 Claude Opus 5보다 0.5점 높은 점수이며, 이 수치는 한 주 내내 세대교체로 인용되어 왔다. 그것이 실제로 무엇인지 정확히 짚을 필요가 있다. 모델 자체는 새로운 것이 아니다 — DeepSeek V4.1 Flash는 6일 전인 2026-09-10에 정식 출시되었으므로 여기서 일어난 일은 출시가 아니다. 그 기간에 들어온 것은 측정 계층이다: 최초의 독립 지수 등재, 최초의 독립 아레나 결과, 세 개 스택 전반의 출시 당일 서빙 지원, 그리고 자사 플래그십을 은퇴시키고 이 모델을 택한 벤더의 결정. 이 페이지는 실제로 측정된 것을 정리한 것으로, 모든 수치마다 출처를 밝히고, 아직 아무도 입증하지 못한 것이 무엇인지 명확히 서술한다.

DeepSWE 점수, 그리고 그 점수와 0.5점 이내 차이인 네 개의 모델

DeepSWE v1.1은 Datacurve의 장기 지평 소프트웨어 엔지니어링 벤치마크로, 91개의 오픈소스 저장소와 5개 프로그래밍 언어에 걸친 113개의 독창적 과제로 구성되어 있으며, 다중 파일 변경과 동작상의 정확성을 중심으로 만들어졌습니다. DeepSeek 자체 모델 카드에서 벤더가 보고한 표는 다음과 같습니다: DeepSeek V4.1 Flash 74.2, Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Kimi K3 67.5, GLM-5.3 66.9, DeepSeek V4-Pro-0813 62.7, DeepSeek V4-Flash 54.4.

동일한 벤치마크에 대한 독립적인 리더보드는 그 순서를 재현하지 않으며, 그 차이는 헤드라인보다 더 중요하다. Datacurve의 DeepSWE v1.1 Pass@1 리더보드는 Muse Spark 1.3 (FAIR)을 75.40으로 1위에 올리고, 74.20의 DeepSeek V4.1 Flash보다 앞선다. 그 뒤로는 GPT-6 Astra가 74.12 (extra high)와 74.10 (max), Gemini 3.8 Flash가 73.83 (high), Claude Opus 5가 73.65 (max)이다.

그래서 74.2는 실제 제3자 리더보드에 실제로 등재된 항목이며, 1위가 아니라 2위입니다. 출시 당일 퍼졌던 주장, 즉 이것이 DeepSWE에서 최고 수준이라는 주장은 그 점수를 싣고 있는 리더보드와 맞닥뜨리면 성립하지 않습니다. Muse Spark 1.3이 1.2점 앞서 있습니다.

이제 건너뛰는 부분입니다. 네 개의 프런티어 모델이 이 벤치마크에서 서로 0.55점 이내에 있습니다: 74.20, 74.12, 73.83, 73.65. 이는 측정 잡음보다 더 좁은 범위입니다. DeepSWE에서 공개된 실행 간 변동은 1.4~3.2점 수준입니다 — 상위 네 개 전체 격차의 3~6배 크기입니다. GPT-6 Astra에 대한 0.2점 우위는 발견이 아닙니다; 그것은 소수점 두 자리까지 출력했을 때 동점이 보이는 모습입니다.

스캐폴드 민감도는 그 수치를 곧이곧대로 믿지 말아야 하는 두 번째 이유이며, 여기서는 공급업체 자체 문서가 증거를 제공합니다. DeepSeek은 같은 릴리스 자료에서 여덟 개 스캐폴드에 걸친 DeepSWE를 보고합니다. 74.2는 mini-SWE에서 달성되었습니다. 같은 모델은 DSH Minimal에서 72.6, DSH Standard에서 70.5, Claude Code에서 69.8, DSH PTC에서 67.6, Pi에서 66.2, Codex에서 65.6, OpenCode에서 65.5를 기록했습니다. 이는 하나의 모델과 하나의 벤치마크에서 8.7포인트 격차이며, 순전히 그 둘레에 감싼 하네스 때문에 발생합니다. mini-SWE에서 산출된 DeepSeek 수치를 다른 에이전트 루프에서 산출된 경쟁사 수치와 비교하는 사람은 모델이 아니라 스캐폴드를 비교하는 것입니다.

독립 지수가 실제로 그것을 어디에 두는지

Artificial Analysis는 공표된 에포트 설정에서 고정된 스위트를 실행하므로, 그 Intelligence Index는 이용 가능한 가장 깔끔한 외부 검증 수단이다. DeepSeek V4.1 Flash의 모델 페이지에서 추론 에포트를 최대로 설정하면 이 지수는 40을 기록하며, 해당 클래스의 113개 모델 중 #6위로, 클래스 중앙값 18과 대비된다. 폐쇄형 경쟁 모델들은 그 위에 있다: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. DeepSeek의 자체 이전 플래그십인 V4-Pro-0813은 36으로 그 아래에 있다.

두 점수판을 나란히 놓고 보면, 그 불일치는 실수가 아니라 구조적이다. DeepSeek가 선택한 벤치마크에서, 적절한 스캐폴드를 쓰면 이 모델은 최전선과 동률을 이룬다. 추론, 코딩, 수학, 에이전트 작업 전반에 걸쳐 평균을 낸 고정 외부 스위트에서는 Claude Opus 5보다 11점, Gemini 3.8 Flash보다 1점 뒤진다. 둘 다 사실일 수 있다. 벤더 표는 하나의 주장이고, 지수는 평균이다.

인덱스 페이지에는 또한 라우팅 결정에 중요하면서도 좀처럼 헤드라인에 오르지 않는 두 가지 수치가 실려 있다. DeepSeek V4.1 Flash는 최대 노력에서 초당 214.4개의 출력 토큰으로 실행된다 — 빠르다. 또한 Intelligence Index를 완료하는 데 250M개의 출력 토큰을 생성했는데, 이는 중앙값 140M과 대비되며 Artificial Analysis가 현저히 장황하다고 지적하는 부분이다. 장황함은 품질 문제가 아니다. 그것은 청구서다. 동종 모델보다 79% 더 많은 토큰으로 생각하는 모델은 모든 긴 추론 호출에서 가격 우위의 일부를 반납한다.

Single-column scoreboard for DeepSeek V4.1 Flash: DeepSWE v1.1 74.2, second behind Muse Spark 1.3; Artificial Analysis Intelligence Index 40 against Claude Opus 5 at 51; ProgramBench 20.3 single model; ProgramBench agent team 30.04% at 8 hours; output speed 214.4 tokens per second; off-peak price $0.15 in and $0.60 out per 1M.

ProgramBench: 단일 모델 점수와 멀티 에이전트 점수는 동일한 측정값이 아닙니다

이 숫자는 가장 잘못 읽힐 가능성이 높으므로 신중하게 분리할 필요가 있습니다.

• 단일 모델, 표준 구성 — DeepSeek V4.1 Flash는 DeepSeek 자체 모델 카드에 따르면 ProgramBench(Almost@1)에서 20.3점을 기록한다. 이는 낮은 편이며 GPT-5.6 Sol의 23.0보다 낮고 Claude Opus 5의 37.0보다 훨씬 낮으며, GLM-5.3의 19.0과 Kimi K3의 17.5보다는 약간 높을 뿐이다. 벤더가 보고한 수치이며, 이 모델을 미화하지 않는다.

• 멀티 에이전트 팀 구성 — DeepSeek의 기술 보고서, DeepSeek-V4.1-Flash: KV 캐시 압축의 한계에 도전에 따르면, 공유 작업 보드에서 리드 에이전트가 팀원들을 조정하는 초기 Agent Swarm RL 레시피를 설명합니다. 고신뢰도 172개 작업 ProgramBench 하위 집합 — 참조 솔루션이 95% 이상 통과하는 작업 — 에서 멀티 에이전트 구성은 1시간 마감 시 13.59%에서 8시간 시점에 30.04%로 정점을 찍는 반면, 단일 에이전트 기준선은 12.79%에서 20.39%로 증가합니다.

30.04%는 "30%"라는 주장의 근거이며, 단일 모델 점수가 아니다. 그것은 공급업체 자체의 예비 평가에서 필터링된 하위 집합을 대상으로 측정된, 8시간이 주어진 에이전트 팀의 결과다. 이것이 유도하는 비교, 즉 "단일 Sol보다 훨씬 높고, Kimi K3의 거의 2배"라는 비교는 Sol의 23.0과 K3의 17.5에 비추어 산술적으로는 공정하며, 동시에 서로 다른 작업 집합에서 멀티 에이전트 구성과 단일 모델 기준선을 비교하는 것이기도 하다. 같은 보고서는 FrontierSWE v2에서의 효과도 보여준다: 20시간에서 멀티 에이전트는 32.90%에 도달한 반면 단일 에이전트는 28.20%였다. 격차는 실재하며, 기한이 연장될수록 좁혀지고, 그 격차를 얻는 데 드는 토큰 비용은 작지 않다. 한 실사용 후기에서는 10배가 넘는 토큰과 4시간에 가까운 런타임을 보고한다.

파라미터 개수가 아직 확정되지 않았으므로, 모든 크기 비교는 잠정적인 것으로 간주하세요.

DeepSeek의 릴리스 노트는 "552B 파라미터 MoE"를 설명합니다. 이는 벤더가 제시한 수치이며, 대부분의 보도가 반복하는 내용입니다. 그것은 또한 전체 아티팩트가 아닙니다.

DeepSeek 자체의 모델 카드에는 transformer 백본과 함께 두 번째 구성 요소가 기록되어 있습니다: "Engram conditional memory(196B 파라미터, 토큰 기반 조회를 통해 희소하게 접근됨)." 두 가지를 더하면 748B가 됩니다. 이것이 출시 몇 시간 만에 r/LocalLLaMA에서 퍼진 커뮤니티 해석의 배경이 된 산술이며, 모델 카드 자체의 safetensors 인덱스는 여러 텐서 유형에 걸쳐 763B 파라미터를 나열합니다. 대략 510GB라는 FP8 수치는 동일한 분석 계보에서 나옵니다: 실제로 다운로드하고 메모리에 보유하는 양 말입니다.

이 수치들이 서로 다른 것을 세기 때문에 모순이 해소된다. 552B는 계산의 골격, 즉 토큰이 거쳐 가는 파라미터다. 196B는 특정 레이어에서 참조되어 그 위에서 계산하기보다는 저장된 정보를 반환하는 조회 테이블이다. DeepSeek이 제시한 활성화 수치인 8B와 16B는 각각 프리필과 디코드 중에 활성화되는 토큰별 조각이다. 네 수치 모두 같은 모델을 설명한다.

그 중 어느 것도 그 비교를 안전하게 만들어 주지 않는다. "이 모델은 훨씬 작은 크기로 프런티어 모델에 필적한다"라는 형태의 모든 주장은 아티팩트의 5분의 1을 제외한 벤더의 헤드라인에 기대고 있다. 누군가 재현 가능한 파라미터 산정 내역을 공개할 때까지는, 크기에 기반한 주장은 그 단서를 인라인으로 함께 제시해야 한다.

ARC-AGI: 이 모델에 대한 결과 없음

DeepSeek V4.1 Flash에 대한 ARC-AGI-2 또는 ARC-AGI-1 점수는 없습니다. ARC Prize의 검증된 결과 페이지에는 이 체크포인트에 대한 항목이 없고, DeepSeek 자체 벤치마크 표에도 ARC 행이 없습니다. ARC Prize가 검증한 유일한 DeepSeek 결과는 더 오래된 V4 Flash 0731 체크포인트에 대한 것으로, 최대 추론 강도에서 ARC-AGI-2 세미프라이빗 61.4%, ARC-AGI-1 89.0%이며, 작업당 비용은 각각 $0.04와 $0.02입니다. 이는 다른 모델에 대한 전임자의 수치이므로, 이를 V4.1 Flash의 결과로 인용하는 것은 잘못입니다. ARC-AGI가 평가에 중요하다면, 이 모델은 현재 점수가 매겨지지 않은 상태입니다.

창 안에 또 무엇이 들어왔나요?

이 모델을 시험해 볼지 결정하는 독자에게 달라진 세 가지가 있는데, 그중 어느 것도 모델 자체의 출시는 아니다.

• 독립적인 아레나 결과. OpenDesign Arena는 13개 모델에 동일한 디자인 과제 — 웹 앱, 대시보드, 모바일 화면, 랜딩 페이지 — 를 수행하게 했다. DeepSeek V4.1 Flash는 100점 만점에 81.2점을 기록해 GPT-6 Astra의 82.7점과 맞섰고, 완성된 디자인당 비용은 $0.023 대 $1.61, 완료 시간은 5.3분 대 11.1분이었다. 전달률 — 수정 없이 사용 가능한 결과물 — 은 57.7%로 Astra의 60%와 맞섰다. 이는 이 모델에 대한 최초의 진정으로 독립적인 측정 중 하나이며, 일반적인 추론이나 코딩이 아니라 디자인 결과물을 특정해 측정한 것이다.

• 세 가지 스택에 대한 Day-0 서빙 지원. vLLM은 NVIDIA 및 AMD 하드웨어에서 검증된 Day-0 이미지(2026-09-09)를 공개했습니다. SGLang과 Miles는 2026-09-10에 Day-0 추론 및 RL 지원을 공개했으며, 여기에는 4x GB300에서 KV 캐시 용량을 36% 끌어올린 Engram 호스트 오프로드 경로와 8x H200에서 프리필 처리량을 1.56배 높인 바운디드 리플레이 최적화가 포함됩니다. Cambricon은 같은 날 vLLM 스택에 대한 Day-0 적용을 발표했습니다. 공격적인 KV 캐시 압축 — 이전 세대 HBM 풋프린트의 4분의 1, SSD의 8분의 1 — 을 판매 포인트로 내세우는 모델에게 첫날부터 표준 스택에서 실행 가능하다는 것은 실험실 결과와 실제로 배포할 수 있는 것 사이의 차이입니다.

• 공급업체는 자사의 플래그십을 단종시켰습니다. DeepSeek는 V4-Pro를 단계적으로 중단하고 있습니다. 2026-09-14 04:00 UTC부터 “deepseek-v4-pro”를 지정하는 모든 요청은 V4.1 Flash로 라우팅되며 Flash 요금으로 청구됩니다. 이는 V4.1 Pro가 출시될 때까지 계속됩니다. DeepSeek V4.1 Pro는 출시되지 않았습니다 — 이는 미래의 모델이며, 이 리디렉션은 고정된 통합이 중단되지 않도록 하는 임시방편입니다. 또한 “deepseek-v4-flash”와 “deepseek-v4-flash-vision-exp”도 단종됩니다. 둘 다 호환성을 위해 일시적으로 V4.1 Flash로 라우팅됩니다. 프로덕션에서 고정된 모델 ID를 사용하고 있다면, 이 리디렉션은 이 페이지에서 무시할 수 없는 단 하나의 운영상 사실입니다.

가격이 결정에 미치는 영향

가격 책정은 이 모델이 더 이상 벤치마크 이야기로만 남지 않게 되는 지점이다. DeepSeek이 자체 공개한 요금에 따르면, 2026-09-10 04:00 UTC부터 적용되며, 피크 시간은 평일 01:00–04:00 및 06:00–10:00 UTC로 정의되고 그 외는 모두 비피크 시간이다.

• 비수기, 백만 토큰당 — 캐시 적중 $0.003, 캐시 미스 $0.15, 출력 $0.60.

• 최대, 백만 토큰당 — 캐시 적중 $0.006, 캐시 미스 $0.30, 출력 $1.20.

• 프런티어 폐쇄형 모델과 비교한 캐시 입력 — 백만 토큰당 0.3센트 대 약 50센트입니다. 동일한 저장소를 반복 순회하는 에이전트의 경우, 그 계층이 토큰의 대부분을 차지합니다.

• 당사 자체 카탈로그에서 측정 — 백만 토큰당 입력 $0.15, 출력 $0.60, 첫 토큰까지 걸리는 중앙값 784ms, 지난 7일간 초당 211토큰.

Artificial Analysis는 동일한 모델을 입력 $0.30, 출력 $1.20, 98% 캐시 할인, 백만 토큰당 혼합 $0.18로 표시합니다 — 이는 피크 요금제이며, 두 수치는 하루 중 다른 시간대에는 같은 가격입니다. 공급업체를 비교하기 전에 이 차이를 내면화할 가치가 있습니다: 2단계 시간대 요금제를 가진 모델은 단일 대표 요율로 비교할 수 없습니다.

이것이 바로 여기서 패스스루 가격 책정이 평소보다 더 중요한 이유이기도 합니다. OrcaRouter는 DeepSeek V4.1 Flash를 나머지 카탈로그와 함께 라우팅합니다 — 적용 요율은 0% 마크업 — 공급자 정가 그대로, 변동 없이, 따라서 DeepSeek의 피크 및 오프피크 등급은 DeepSeek이 공개한 그대로 우리 쪽에 도착하며, 공급업체 가격 변경은 같은 날 바로 반영됩니다. 평일 아침마다 네 시간 동안 요율이 두 배로 오르는 모델에서, 등급을 평탄화하는 플랫폼은 여러분에게 필요했던 단 하나의 숫자를 숨기고 있는 것입니다.

Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Reasoning, Max Effort), showing an Artificial Analysis Intelligence Index score of 40 at rank 6 of 113, output speed 214.4 tokens per second at rank 4 of 113, $0.30 per million input and $1.20 per million output tokens with a 98% cache discount and $0.27 cost per Intelligence Index task, verbosity of 250M output tokens at rank 37 of 113, a 1M token context window, 552B total and 16B active parameters, and an MIT license.Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model identifier, NEW and FEATURED badges, Vision, Tools, JSON and Reasoning capability tags, a release date of 2026-09-10, a 1M token context window, 384K maximum output, text and image input, $0.15 input and $0.60 output per million tokens, and a p50 time to first token of 784 ms.

아무도 확립하지 못한 것

이 이야기의 공백은 빠진 벤치마크가 아니다. 그것은 DeepSeek V4.1 Flash와 이름이 명시된 경쟁 모델들 사이에, 결과에 아무런 이해관계가 없는 사람이 공통 하네스에서 수행한 신뢰할 만한 정면 대결이 존재하지 않는다는 점이다. 이 페이지의 모든 수치는 세 가지 중 하나다. 벤더가 보고한 수치, 다른 구성에서 제3자가 산출한 수치, 또는 이 맞대결을 분리해 평가하도록 설계되지 않은 고정 스위트 전체의 평균이다. DeepSeek V4.1 Flash와 GPT-6 Astra가 동일한 과제, 동일한 스캐폴드, 동일한 노력 설정에서 평가되고 분산과 함께 공개된 실행은 없다.

세 가지 구체적인 요소가 상황을 바꿀 텐데, 그중 어느 것도 현재는 존재하지 않는다.

• 스캐폴드로 통제한 DeepSWE 비교. DeepSeek 자체 스캐폴드 간의 8.7점 격차는 리더보드 상위 네 모델 사이의 어떤 차이보다도 큽니다. 최전선이 하나의 하네스에서 측정되기 전까지는, 그 표 최상단의 순위는 의미가 없습니다.

• ProgramBench 에이전트 팀 결과의 독립적 재현. 30.04%라는 수치는 필터링된 172개 태스크 하위 집합을 대상으로 한 벤더의 기술 보고서에서 나온 값으로, 예비 구성으로 측정된 것이며, 그 토큰 비용은 프로덕션 예산 기준으로 아직 규명되지 않았습니다.

• ARC-AGI. 이 체크포인트에는 점수가 전혀 존재하지 않습니다.

실질적 귀결은 헤드라인이 뒷받침하는 것보다 더 좁은 주장이다. DeepSeek V4.1 Flash는 하나의 장기 호라이즌 코딩 벤치마크에서는 최전선과의 차이가 잡음 수준 안에 있을 정도로 측정되고, 약 1.4%의 비용으로 독립적인 설계 과제에서 진정으로 경쟁력이 있으며, 종합 지수에서는 대략 10점 뒤처진다. 그 정도면 자체 워크로드에 대해 돌려 보고 여러분의 평가가 문제를 판가름하게 할 명분은 충분하다. 0.2점만을 근거로 프로덕션 라우팅 테이블을 다시 작성하는 것을 정당화하기에는 충분하지 않다 — 그리고 그 두 진술이 모두 사실이라는 점이 바로 이번 발견의 전부다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트