DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
신규추천
비전도구JSON추론
제공 DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash는 2026년 9월 10일에 출시된 DeepSeek 신규 아키텍처 제품군 중 가장 작은 모델로, 네이티브 멀티모달 시각 이해 기능을 갖추고 있으며 V4 Flash 및 V4 Flash Vision 실험 버전의 프로덕션 후속 모델입니다. 신규 아키텍처는 더 높은 성능 상한, 더 빠른 추론 속도와 더 높은 처리량을 목표로 하며, DeepSeek는 V4.1 Flash가 성능, 비용, 속도, 총 작업 시간 모든 면에서 V4 Pro를 종합적으로 능가한다고 밝혔습니다. 이 모델은 텍스트와 이미지를 입력받아 텍스트를 출력하며, 최대 384K 출력 토큰을 지원하는 1M 토큰 컨텍스트 윈도우를 제공합니다. 또한 Chat Completions, Responses, Anthropic 호환 API에서 thinking(기본값, 노력 수준 low / high / max 선택 가능) 및 non-thinking 모드를 지원하고, JSON 출력, 도구 호출, 채팅 접두사 완성도 지원합니다. FIM은 non-thinking 모드에서만 작동합니다. 모델 가중치는 Hugging Face(deepseek-ai/DeepSeek-V4.1-Flash)에 공개되어 있습니다. 출시 시점 공식 벤치마크: Terminal-Bench 2.1에서 90.6, DeepSWE v1.1에서 74.2, NL2Repo-Bench에서 65.4, GPQA Diamond에서 90.9, 도구 사용 시 HLE에서 63.9, 그리고 강력한 네이티브 비전 에이전트 결과(도구 사용 시 BabyVision 89.6, Chartography 78.9)를 기록했습니다. 가격도 이번 출시와 함께 인하되어, 비수요 시간대 요금은 입력(캐시 미스) $0.15/M, 출력 $0.60/M, 캐시 히트 시 $0.003/M이며, 주중 피크 시간대(01:00-04:00 및 06:00-10:00 UTC)에는 두 배로 인상됩니다. 주말을 포함한 그 외 모든 시간대는 비수요 시간대로 간주됩니다.

컨텍스트1M 토큰
최대 출력384K
입력text + image
출력text
p50 TTFT412 ms
입력$0.15/ 100만 토큰
출력$0.60/ 100만 토큰
p50 TTFT412 ms7일
p95 TTFT1.60 s7일
트래픽299.5M토큰 / 7일

DeepSeek V4.1 Flash는 OpenAI 호환 API 게이트웨이인 OrcaRouter를 통해 사용할 수 있는 DeepSeek 모델입니다. 텍스트와 이미지 입력을 받아들이며, 1,048,576 토큰의 컨텍스트 창을 갖추고 단일 응답에서 최대 384,000 토큰을 생성할 수 있습니다. OrcaRouter는 공급자 요율로 100만 입력 토큰당…

DeepSeek V4.1 Flash란 무엇인가요?

DeepSeek V4.1 Flash는 누구를 위해 만들어졌나요?

1,048,576 토큰 컨텍스트 윈도는 왜 중요한가요?

코드 샘플

어떤 SDK에서도 호출

OpenAI 호환 — 쓰던 SDK 그대로

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

지원되는 매개변수

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

가격

가격
입력 / 1M tokens · 오프피크$0.150
출력 / 1M tokens · 오프피크$0.600
캐시 읽기 / 1M · 오프피크$0.0030
피크 시간대01:00–04:00, 06:00–10:00 ×2 (UTC)
입력 / 1M tokens · ×2$0.300
출력 / 1M tokens · ×2$1.20
캐시 읽기 / 1M · ×2$0.0060
통화USD

비용 계산기

월 토큰 수10MM
입력 비율70%%
월 예상 $2.85 · 프롬프트 캐싱 사용 시 $2.34

정가 기준 추정치

토큰 및 비용 추정기

입력 토큰: 9요청당 비용: $0.000301

추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.

성능

p50 TTFT
412 ms
출력 속도
215 tok/s
p95 TTFT
1.60 s
오류율
0.07%

공개 벤치마크

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
소스: api-docs.deepseek.com

커뮤니티 화제

이번 주 개발자들의 이야기

Hacker News13 회 언급 · 7일지난주 대비 13 증가

비교

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
입력 $/100만$0.15$0.73$0.24$0.24
출력 $/100만$0.60$2.18$0.73$0.73
컨텍스트1.0M1.0M1.0M1.0M
품질8/108/107/107/10
나란히 비교나란히 비교나란히 비교나란히 비교

DeepSeek의 다른 모델

FAQ

OrcaRouter에서 DeepSeek V4.1 Flash의 비용은 얼마인가요?
OrcaRouter는 DeepSeek V4.1 Flash의 요금을 100만 입력 토큰당 $0.15, 100만 출력 토큰당 $0.60으로 청구하며, 제공업체 요율로 마크업 없이 그대로 전달합니다. 컨텍스트 창 자체에 대해 설명된 별도 요금은 없습니다. 1,048,576 토큰은 한도일 뿐 요금이 아닙니다. 입력 토큰에는 보내는 텍스트, 이미지, 대화 기록이 포함되고, 출력 토큰에는 생성된 모든 내용이 포함되며 최대 384,000 토큰입니다.
컨텍스트 윈도우와 최대 출력 크기는 얼마나 되나요?
DeepSeek V4.1 Flash는 1,048,576 토큰의 컨텍스트 윈도우와 최대 384,000 토큰의 출력을 제공합니다. 입력 윈도우를 사용하면 전체 문서, 녹취록 또는 리포지토리 스냅샷을 한 번의 호출로 제출할 수 있으며, 출력 상한은 사양서, 마이그레이션 계획 또는 확장된 diff와 같은 긴 단일 패스 산출물을 지원합니다.
DeepSeek V4.1 Flash는 무엇을 가장 잘하나요?
긴 입력과 긴 출력 작업, 즉 전체 문서 분석, 대규모 저장소 코드 이해, 텍스트와 이미지를 함께 다루는 멀티모달 검토, 그리고 짧은 답변이 아니라 상당한 분량의 생성 답변이 필요한 워크플로를 위해 만들어졌습니다. GPQA Diamond에서의 90.9점은 탄탄한 대학원 수준의 과학 및 기술 추론 능력도 보여줍니다. 입력은 텍스트와 이미지를 모두 지원하며, 출력은 텍스트만 지원합니다.
더 큰 프런티어 모델과 비교하면 어떻습니까?
프런티어 모델은 가장 어려운 추론 벤치마크에서 앞설 수 있으며 일반적으로 토큰당 더 많은 비용을 청구하는 반면, DeepSeek V4.1 Flash는 1,048,576토큰 컨텍스트 윈도우와 384,000토큰 출력 상한을 1M 입력당 $0.15, 1M 출력 토큰당 $0.60에 제공합니다. 긴 컨텍스트와 대용량 작업에는 흔히 실용적인 선택이며, 가장 어려운 개별 추론 단계의 경우 그러한 호출을 OrcaRouter에서 더 비싼 모델로 라우팅하는 것은 합리적인 패턴입니다.
이 모델을 호출할 때 데이터는 어떻게 처리되나요?
OrcaRouter는 요청을 DeepSeek의 API로 라우팅하며 공급자 요율로 마크업 없이 청구합니다. 보존, 학습 사용 및 관련 약관은 여기에 설명된 별도 약정이 아니라 공급자의 정책을 따르므로, 민감한 자료를 보내기 전에 공급자의 현재 약관을 확인하세요. 필요하지 않은 식별자는 삭제하고 프롬프트는 작업에 필요한 최소한으로 유지하세요. 컨텍스트가 작을수록 입력 비용도 낮아집니다(100만 토큰당 $0.15).
OpenAI 호환 API를 통해 어떻게 호출하나요?
클라이언트의 기본 URL을 https://api.orcarouter.ai/v1로 설정하고 OrcaRouter API 키와 함께 모델 ID deepseek/deepseek-v4.1-flash를 사용하세요. 요청과 응답은 OpenAI 채팅 완성 스키마를 따르므로 기존 SDK, 스트리밍 핸들러, 도구 호출 파싱이 변경 없이 작동합니다. 마이그레이션은 일반적으로 기본 URL과 모델 문자열을 변경하고 평가 세트를 다시 실행하는 것으로 끝납니다.
DeepSeek V4.1 Flash는 이미지를 입력할 수 있나요?
예. 이미지 입력은 표준 멀티모달 콘텐츠 배열을 통해 지원되며, 텍스트와 이미지 부분이 동일한 사용자 메시지에 포함됩니다. 이미지 토큰은 입력으로 계산되며 OrcaRouter에서 100만 입력 토큰당 $0.15로 청구됩니다. 출력은 텍스트로만 유지되므로, 모델은 이미지를 생성하기보다는 이미지를 설명하거나 이미지에서 추출합니다.
GPQA Diamond에서 90.9점이면 내 작업에 신뢰하기에 충분한가요?
그것은 유용한 신호이지 보장은 아닙니다. GPQA Diamond는 고정된 프롬프트 형식에서 대학원 수준의 과학 추론을 측정하며, 이는 기술적 질문 답변에는 관련이 있지만 긴 컨텍스트 회상, 어조, 또는 귀하의 데이터에서의 추출 정확도에 대해서는 거의 말해주지 않습니다. 실제 입력으로 작은 평가 세트를 구축하고, DeepSeek V4.1 Flash와 OrcaRouter의 다른 모든 대체 모델 ID에 대해 실행한 뒤, 프로덕션 트래픽을 라우팅하기 전에 비용과 품질을 비교하세요.

이 배지 임베드

DeepSeek: DeepSeek V4.1 Flash$0.15/M in412ms p50OrcaRouter를 통해
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="OrcaRouter 의 DeepSeek: DeepSeek V4.1 Flash" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

모델 카드를 데이터로

GET /api/public/models/deepseek/deepseek-v4.1-flash열기
기계 판독 가능:/llms.txt/llms-full.txt