DeepSeek V4 Flash 0731은 DeepSeek의 효율적인 V4 Flash mixture-of-experts 모델의 재포스트트레이닝 공식 릴리스입니다 — 총 284B / 활성 파라미터 13B, 4월 V4 Flash 릴리스와 아키텍처 및 크기가 동일하며, 포스트트레이닝이 처음부터 다시 수행되었습니다. 1M 토큰 컨텍스트 창과 최대 384K 출력 토큰을 제공하며, thinking 및 non-thinking 모드(기본적으로 thinking 활성화)와 JSON 출력 및 도구 호출을 지원하고, Responses API를 기본 지원하며 Codex 스타일 코딩 에이전트에 맞춘 타겟 적응을 제공합니다. 0731 리비전은 에이전트 역량에서 큰 도약으로, DeepSeek가 발표한 에이전트 벤치마크에서 DeepSeek V4 Pro Preview조차 능가합니다 — Terminal Bench 2.1에서 82.7, Cybergym에서 76.7, Toolathlon Verified에서 70.3, DeepSWE에서 54.4, NL2Repo에서 54.2입니다. DeepSeek 자사 API에서 이 리비전은 현재 deepseek-v4-flash 모델 ID가 서비스하는 버전이며, 날짜 기반 식별자는 날짜로 참조하는 호출자에게 동일한 리비전을 제공합니다. 코딩 에이전트, 터미널 및 도구 사용 워크로드, 그리고 flash 등급 비용의 대규모 에이전틱 파이프라인에 강력한 선택입니다.
DeepSeek V4 Flash 0731은 deepseek 프로바이더의 텍스트 전용 언어 모델로, OrcaRouter를 통해 모델 ID deepseek/deepseek-v4-flash-0731로 제공됩니다. 주요 사양은 1,048,576토큰 컨텍스트 창, 384,000토큰 최대 출력, 그리고 Terminal Bench 2.1에서 82.7점입니다. 가격은…
입력은 텍스트로 제한됩니다. 컨텍스트 창은 1,048,576토큰이며, 응답당 최대 출력은 384,000토큰입니다. 이는 큰 작업 공간입니다. 생성 전에 약 100만 토큰의 콘텐츠를 읽을 수 있으며, 단일 호출에서 최대 384,000토큰의 출력을 요청할 수 있습니다. 모델 카드에는 이 두 가지가 별도의 상한으로 나열되어 있으며, 두 상한에 모두 근접하게 사용하는 요청에 대한 통합 제한은 명시되어 있지 않습니다. 실제로 제한 내에서 유지하려면 전송 전에 토큰 수를 계산하고 max_tokens를 출력 상한보다 낮게 설정하세요. 텍스트 전용 제약 조건은 또한 PDF, 스프레드시트 및 기타 문서를 먼저 일반 텍스트로 변환해야 함을 의미합니다. 토큰화 방식은 제공된 정보에 명시되어 있지 않으므로, 대표 콘텐츠를 테스트하여 프롬프트가 얼마나 커지는지 확인하세요. 요청이 1,048,576입력 토큰을 초과하면 API 호출이 실패합니다. 384,000토큰을 초과하는 출력에도 동일하게 적용됩니다.
나열된 사양을 고려할 때, 이 모델은 긴 텍스트 입력, 긴 텍스트 출력, 그리고 터미널 중심의 에이전트 추론을 결합하는 작업에 가장 적합합니다. 82.7 Terminal Bench 2.1 점수는 모델이 셸 출력을 읽고 다음 명령을 결정하는 명령줄 작업 완료에서의 강점을 보여줍니다. 1,048,576 토큰 컨텍스트는 전체 저장소 분석, 다중 파일 코드 리뷰, 긴 법률 또는 기술 문서, 그리고 방대한 채팅 기록을 지원합니다. 384,000 토큰 출력은 단일 패스로 긴 구조화 문서, 합성 데이터셋, 또는 단계별 분석을 생성하는 것을 지원합니다. 백만 토큰당 입력 $0.15, 출력 $0.29의 토큰별 가격 책정은 대용량 텍스트 처리를 재정적으로 예측 가능하게 만듭니다. 이미지 이해, 오디오 전사, 또는 매우 낮은 지연 시간이 필요할 때에는 모델이 덜 적합합니다. 이러한 기능은 제공된 사실에 포함되어 있지 않습니다. 작업이 텍스트 전용, 대형 컨텍스트, 대형 출력 프로필에 해당한다면 OrcaRouter를 통해 평가할 합리적인 후보입니다.
이 모델은 비텍스트 입력을 받을 수 없으며, 카탈로그 항목에 비전, 오디오, 비디오 모달리티가 없습니다. 또한 제공된 정보에는 공개된 지연 시간 또는 스트리밍 보장도 없습니다. 워크로드에 큰 컨텍스트나 출력 제한이 필요하지 않다면 더 저렴한 모델을 선택해야 합니다. 예를 들어, 수천 개의 토큰을 사용하는 짧은 챗봇 대화는 여전히 동일한 토큰당 요율로 청구되지만, 더 작은 컨텍스트와 백만 토큰당 더 낮은 가격을 가진 모델이 더 적합할 수 있습니다. 제공된 정보에는 대안 모델의 가격이 나와 있지 않으므로, OrcaRouter 카탈로그에서 100만 토큰당 요율을 비교하세요. 작업이 짧은 구절의 단순한 분류 또는 요약이라면 더 저렴한 모델로 충분할 수 있습니다. 작업에 전체 1M 컨텍스트 또는 384K 출력이 필요하거나, 명령줄 작업에서 Terminal Bench 2.1의 강점이 도움이 된다면, 이 모델의 가격이 평가의 관련 기준이 됩니다.
모든 입력은 텍스트여야 합니다. PDF, 이미지, 스프레드시트, 오디오 파일은 전송 전에 일반 텍스트로 변환되거나 전사되어야 합니다. 이는 필수적인 전처리 단계이지만 요청 형식도 단순화합니다. 문자열을 포함하는 표준 OpenAI 스타일 콘텐츠 필드만 있으면 됩니다. 1,048,576 토큰 컨텍스트는 변환된 긴 텍스트 본문을 한 번의 요청으로 전달할 수 있음을 의미하며, 384,000 토큰 출력은 매우 긴 텍스트를 다시 받을 수 있음을 의미합니다. 토큰 수는 총 비용이 입력 및 출력 토큰에 따라 달라지므로 운영상 주요 고려 사항입니다. OrcaRouter는 OpenAI 호환 응답에서 사용량을 보고하므로 두 숫자를 모두 모니터링할 수 있습니다. 비효율적으로 토큰화되는 언어나 코드로 작업하는 경우, 문자 수가 아니라 토큰 수가 제한 한도이므로 유효 컨텍스트가 줄어듭니다. 토크나이저 세부 정보는 제공되지 않으므로 자체 콘텐츠로 빠른 테스트를 실행하여 일반적인 토큰 길이를 확인하세요.
Terminal Bench 2.1은 터미널 환경에서 작업하는 모델의 능력, 즉 명령 출력 이해, 디렉터리 탐색, 명령 실행, 셸을 통한 현실적인 시스템 관리 또는 소프트웨어 엔지니어링 작업 완료를 평가합니다. DeepSeek V4 Flash 0731의 주요 점수는 82.7점이며, 점수가 높을수록 우수함을 의미합니다. 이는 제공된 사실에서 확인할 수 있는 유일한 벤치마크 결과입니다. 이 점수는 셸 명령을 실행하는 에이전트 루프를 구축하려는 경우 유용한 지표입니다. 벤치마크가 정확히 그러한 역량을 테스트하도록 설계되었기 때문입니다. 이는 일반 지식, 창의적 글쓰기, 수학 또는 다국어 능력을 측정하는 것이 아닙니다. 비교 기준선이나 다른 벤치마크 수치는 제공되지 않으므로, 82.7은 맥락에 맞게 해석해야 합니다: 터미널 관련 작업에 대한 강력한 증거이며, 다른 영역에 대해서는 어떤 증거도 제공하지 않습니다. 벤치마크 점수는 정확한 작업 분포에 따라 달라지므로, 자체 터미널 작업의 점수는 다를 수 있습니다. 프로덕션 사용 전에 자체 평가로 검증하십시오.
DeepSeek V4 Flash 0731에 대해 제공된 사실에는 초당 토큰 수, 첫 토큰까지의 시간, p95 지연 시간 또는 처리량이 포함되어 있지 않습니다. Flash라는 이름은 더 가벼운 변형을 암시하지만, 제공된 사실은 속도를 정량화하지 않습니다. 사실에 포함된 내용은 1,048,576토큰의 큰 컨텍스트 창과 384,000토큰의 큰 출력 상한입니다. 더 긴 입력과 출력은 본질적으로 더 많은 컴퓨팅을 소비하므로, 전체 컨텍스트 요청의 지연 시간은 빠른 모델이라도 짧은 프롬프트보다 높을 가능성이 높습니다. $0.15/$0.29 백만 토큰당 가격은 비용을 설명하는 것이지 속도를 설명하는 것이 아닙니다. 정보에 입각한 결정을 내리려면 사용하려는 크기의 대표적인 프롬프트를 사용하여 OrcaRouter의 API에 대해 자체 부하 테스트를 실행하고, 카탈로그의 다른 모델과 첫 토큰까지의 시간 및 총 지속 시간을 비교하십시오. 응답 시간을 측정하지 않는 벤치마크 점수에서 지연 시간을 추정하지 마십시오.
주요 제한 사항은 나열된 사실에서 확인할 수 있습니다. 텍스트 전용이므로 모든 멀티모달 입력은 범위를 벗어납니다. 벤치마크 증거는 Terminal Bench 2.1의 82.7이라는 단일 점수로 제한되며, 이는 터미널 기반 작업 완료를 다루는 것으로 일반 추론이나 지식은 다루지 않습니다. 지연 시간, 가용성 또는 오류율 지표는 공개되지 않았으므로 부하 상태에서의 성능은 알 수 없습니다. 컨텍스트 및 출력 상한은 크지만 유한합니다: 요청당 입력 1,048,576개 토큰과 출력 384,000개 토큰입니다. 이를 초과하는 요청은 성공하지 않습니다. 제공된 사실에는 문서화된 프롬프트 캐싱 할인이 없으므로 반복되는 접두사는 일반 입력 토큰으로 청구됩니다. 가격은 토큰당 기준으로는 낮지만 절대 비용은 컨텍스트 크기에 따라 선형적으로 증가합니다. 애플리케이션에 비전, 낮은 지연 시간 또는 매우 높은 처리량이 필요하다면 이 모델은 적합하지 않을 수 있습니다. 도입 전에 이러한 요구 사항을 별도로 검증하십시오.
비용은 토큰 단위로 계산되며, 입력(input)과 출력(output)에 대해 각각 다른 요율이 적용됩니다. 입력 토큰은 1,000,000개당 $0.15, 출력 토큰은 1,000,000개당 $0.29입니다. OrcaRouter는 이 비용을 제공업체 요율로 청구하며 마크업이 없습니다. 즉, deepseek의 요율 위에 추가 플랫폼 수수료가 부과되지 않습니다. 단일 요청의 비용은 대략 입력 토큰 수 × $0.15 / 1,000,000 + 출력 토큰 수 × $0.29 / 1,000,000입니다. 예를 들어, 전체 1,048,576 토큰 입력 비용은 약 $0.1573이고, 최대 길이 384,000 토큰 출력 비용은 약 $0.1114입니다 (각각 별도의 트랜잭션에서 한도가 모두 사용된 경우). 제공된 정보에는 캐시된 입력에 대한 할인 가격이 언급되어 있지 않으므로, 각 입력 토큰은 표준 요율로 청구된다고 가정합니다. 가격이 선형이므로 평균 프롬프트 크기와 출력 길이를 알면 배치 비용 추정은 간단합니다.
주요 트레이드오프는 컨텍스트 크기와 가격 사이입니다. 100만 개 입력 토큰당 $0.15의 요율로, 전체 1,048,576개 토큰 컨텍스트를 사용하는 프롬프트는 입력 수수료만으로 약 $0.157이 듭니다. 작업에 수천 개의 토큰 컨텍스트만 필요한 경우, 사용하지 않는 용량에 대해 비용을 지불하는 셈이며, 토큰당 가격이 더 낮은 소형 컨텍스트 모델이 요율에 따라 더 저렴할 수 있습니다. 출력 100만 토큰당 $0.29의 요율은 긴 출력이 개별적으로는 특히 비싸지 않다는 것을 의미하지만, 수 기가바이트의 텍스트를 생성하는 워크로드는 비용이 누적됩니다. 제공된 정보에는 배치 할인, 예약 할인 또는 캐싱 할인이 명시되어 있지 않습니다. OrcaRouter의 제로 마크업 청구 방식은 표시된 가격이 곧 제공업체의 가격임을 의미하며, 최종 청구 금액은 단순히 송수신된 토큰에 따라 결정됩니다. 대규모 배치 작업의 경우 총 입력 및 출력 토큰을 추정하고 두 요율을 곱한 다음 카탈로그의 대안과 비교하세요.
OrcaRouter는 DeepSeek V4 Flash 0731을 공급업체 요금으로 명시적으로 청구하며 마크업이 전혀 없습니다. 입력 토큰 100만 개당 $0.15와 출력 토큰 100만 개당 $0.29는 공급업체의 요금이며, 마크업된 버전이 아닙니다. 제공된 정보에는 이 모델에 대한 프롬프트 캐싱이 설명되어 있지 않습니다. 캐시된 입력 가격 등급이 나열되어 있지 않으며, OrcaRouter가 사용자를 대신하여 프롬프트를 자동으로 캐시한다는 내용도 없습니다. 기본 공급업체가 캐싱을 제공하는 경우에도 해당 조건은 이 카탈로그 항목에 제공된 정보의 일부가 아니므로, 할인을 가정하기 전에 OrcaRouter의 최신 문서를 확인해야 합니다. API 응답은 OpenAI의 chat completions 형식을 따르므로 청구된 입력 및 출력 토큰을 검증할 수 있는 usage 정보를 포함합니다. 감사 목적으로 각 응답의 usage 객체를 기록하고 예상 토큰 수와 비교하십시오. 비용 관리는 전적으로 사용자 자신의 프롬프트 및 매개변수 선택에 달려 있습니다.
OrcaRouter의 OpenAI 호환 API에 표준 채팅 완료 요청을 보내세요. 기본 URL은 https://api.orcarouter.ai/v1이고, 모델 ID는 deepseek/deepseek-v4-flash-0731입니다. model 필드를 해당 정확한 문자열로 설정하고, OrcaRouter API 키를 Authorization 헤더에 bearer 토큰으로 넣으세요. 텍스트 콘텐츠로 messages 배열을 구성하세요. 모델은 이미지나 오디오 콘텐츠를 허용하지 않습니다. 응답은 OpenAI 채팅 완료 형식으로 지정되며, 생성된 메시지와 usage 객체가 포함됩니다. 모델 ID에는 공급자 접두사가 포함되어 있으므로 표시된 그대로 유지하세요. 사용 가능한 사실에 비표준 헤더나 특수 전송 설정은 필요하지 않습니다. OpenAI SDK, curl, 또는 JSON을 지원하는 모든 HTTP 클라이언트를 사용할 수 있습니다. 작은 요청으로 시작하여 반환된 usage가 예상 입력 및 출력 토큰 수와 일치하는지 확인한 다음, 규모를 확장하세요.
엔드포인트가 OpenAI와 호환되므로 일반적인 채팅 완성 매개변수를 사용할 수 있습니다: model, messages, temperature, top_p, max_tokens 또는 max_completion_tokens, stop, stream 및 사용 중인 SDK가 지원하는 유사한 옵션. 제공된 정보에는 OrcaRouter가 이 특정 모델에 대해 어떤 매개변수를 지원하는지 명시되어 있지 않으므로, model과 messages 외의 항목은 직접 테스트해야 합니다. 가장 중요한 제한은 모델 자체의 제한입니다: 입력 토큰 1,048,576개와 출력 토큰 384,000개. 요청 실패를 방지하려면 max_tokens를 출력 상한 미만으로 유지하세요. 도구 또는 함수 호출의 경우, 정보에 지원 여부가 명시되어 있지 않으므로 에이전트를 구축하기 전에 최소한의 도구 정의를 먼저 테스트하세요. 출력 형식 제어의 경우, JSON 모드 또는 구조화된 출력 보장에 대한 언급이 없으므로, 안정적인 구조가 필요하다면 생성된 텍스트를 직접 검증해야 합니다. 스트리밍은 일반적으로 OpenAI 호환 엔드포인트에서 지원되지만, 이 모델에 대해서는 정보로 확인되지 않으므로 OrcaRouter의 API 참조 문서를 확인하세요.
마이그레이션은 대부분 설정 변경입니다. 기본 URL을 https://api.orcarouter.ai/v1로 바꾸고, API 키를 본인의 OrcaRouter 키로 교체한 다음, 모델 이름을 deepseek/deepseek-v4-flash-0731로 변경하면 됩니다. 이미 메시지를 구성하고 채팅 완료 응답을 처리하며 사용량 데이터를 읽는 코드는 OpenAI 규약을 따르는 한 계속 작동합니다. 주의해야 할 차이점이 두 가지 있습니다. 첫째, 이 모델은 텍스트 전용이므로 요청에서 image_url 또는 audio 필드를 제거하세요. 둘째, 컨텍스트 및 출력 상한이 매우 크므로 max_tokens 설정을 조정하여 384,000토큰 출력 상한을 준수하고 때때로 긴 응답이 발생할 수 있음을 대비하세요. 코드에 429 또는 5xx 오류에 대한 재시도가 포함되어 있다면 유지하세요. 사실이 오류 처리 기대치를 바꾸지는 않습니다. 작은 프롬프트로 스모크 테스트를 실행하고, 청구가 토큰 100만 개당 $0.15/$0.29로 표시되는지 확인한 다음, 트래픽을 점진적으로 전환하세요.
OrcaRouter API의 기본 URL은 https://api.orcarouter.ai/v1 입니다. 이 엔드포인트에 대한 모든 요청은 HTTPS를 사용해야 합니다. 인증은 API 키를 사용하며, Authorization 헤더에 표준 Bearer 토큰으로 전송됩니다. 제공된 정보에는 대체 인증 방법이 명시되어 있지 않습니다. 모델 ID는 deepseek/deepseek-v4-flash-0731 이며, 여기에는 공급자 이름과 0731 스냅샷 접미사가 포함됩니다. 반드시 표기된 그대로 정확히 전달하세요. 대부분의 OpenAI 호환 SDK에서는 base_url과 api_key로 클라이언트를 구성한 다음, 각 호출 시 모델 이름을 설정합니다. 응답에는 usage 객체에 billing과 관련된 토큰 수가 포함됩니다. 제공된 정보에는 요청 한도, 재시도 동작 또는 타임아웃 지침이 명시되어 있지 않으므로, 이러한 운영 세부 사항은 OrcaRouter의 문서를 확인하세요. API 키는 안전하게 보관하세요. 이 키는 OrcaRouter 프로젝트에 있는 모든 모델 계정에 대한 액세스를 결정합니다. 프록시나 게이트웨이를 사용하는 경우 OrcaRouter 기본 URL을 가리키도록 설정하고 전체 모델 ID를 유지하세요.
제공된 사실은 이 특정 스냅샷만을 다루므로, 다른 DeepSeek 항목과의 항목별 수치 비교는 주어진 정보만으로는 불가능합니다. DeepSeek V4 Flash 0731에 대해 우리가 아는 것은 1,048,576토큰 컨텍스트, 384,000토큰 출력 상한, 텍스트 전용 입력, 토큰 100만 개당 $0.15/$0.29 가격, 그리고 82.7 Terminal Bench 2.1 점수입니다. OrcaRouter 카탈로그에 있는 다른 DeepSeek 모델은 이러한 기준 중 어느 것에서든 다를 수 있습니다. 결정할 때는 중요한 사양을 비교하세요: 프롬프트가 실제로 사용하는 토큰 수, 출력에 필요한 토큰 수, 멀티모달 입력이 필요한지 여부, 그리고 후보 모델의 토큰 100만 개당 가격입니다. Flash라는 명칭은 다른 DeepSeek 출시 모델에 비해 더 경량화된 변형을 의미하지만, 제공된 사실에서 유일한 객관적 성능 지표는 Terminal Bench 점수입니다. 선택 전에 OrcaRouter의 카탈로그 목록 페이지에서 사양과 현재 가격을 나란히 비교하세요.
1,048,576 토큰의 컨텍스트에서 이 모델은 롱컨텍스트 계층에 속합니다. 더 작은 컨텍스트 모델은 수십만 토큰 또는 그 이하로 제한되어 문서를 분할하거나, 청크를 임베딩하거나, 검색을 사용해야 할 수 있습니다. 이 모델의 장점은 매우 큰 말뭉치를 단일 프롬프트에 넣고 모델이 한 번에 전체를 처리하도록 할 수 있다는 점입니다. 단점은 요청당 비용입니다. 모든 입력 토큰이 과금되므로, 거대한 컨텍스트는 입력 비용을 몇 배로 증가시킵니다. 사실 목록에는 더 큰 컨텍스트 창을 가진 모델이 없으므로, 안전한 설명은 이 모델 자체의 한계에 관한 것뿐입니다. 선택할 때는 실제 프롬프트 크기를 추정하세요. 작업이 일반적으로 100K 토큰 미만을 사용한다면, 전체 컨텍스트는 무관할 수 있으며 더 저렴하고 작은 모델이 더 나을 수 있습니다. 일반적인 컨텍스트 한계를 자주 초과한다면, 이 모델의 1M 토큰 창이 결정적인 기능입니다.
DeepSeek V4 Flash 0731을 선택하세요. 작업이 텍스트 전용이고 그 사양을 활용할 수 있을 때입니다. 1,048,576-토큰 컨텍스트는 전체 저장소, 문서 세트 또는 긴 대화록을 한 번에 읽어야 할 때 선택을 정당화합니다. 384,000-토큰 출력 상한은 여러 번의 왕복 없이 매우 긴 생성 답변이 필요할 때 선택을 정당화합니다. 82.7 Terminal Bench 2.1 점수는 터미널 자동화 및 에이전트형 CLI 워크플로우에 선택을 정당화합니다. $0.15/$0.29(100만 토큰당) 가격은 토큰당 비용이 지배적인 대용량 배치 텍스트 처리에 선택을 정당화합니다. 이미지나 오디오가 필요할 때, 컨텍스트 요구 사항이 아주 작고 더 저렴한 모델이 존재할 때, 또는 알 수 없는 지연 시간 특성을 수용할 수 없을 때는 선택하지 마세요. 사용 가능한 사실은 지연 시간을 보장하지 않으므로, 성능에 민감한 팀은 먼저 실제 프롬프트로 벤치마킹해야 합니다. 모든 경우에 확장 전에 OrcaRouter에서 모델 ID와 결제를 확인하세요.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| 입력 / 1M tokens | $0.147 |
| 출력 / 1M tokens | $0.295 |
| 캐시 읽기 / 1M | $0.020 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
이번 주 개발자들의 이야기
GET /api/public/models/deepseek/deepseek-v4-flash-0731열기 @misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731