DeepSeek-V4.1-Flash는 2026년 9월 10일에 출시된 DeepSeek 신규 아키텍처 제품군 중 가장 작은 모델로, 네이티브 멀티모달 시각 이해 기능을 갖추고 있으며 V4 Flash 및 V4 Flash Vision 실험 버전의 프로덕션 후속 모델입니다. 신규 아키텍처는 더 높은 성능 상한, 더 빠른 추론 속도와 더 높은 처리량을 목표로 하며, DeepSeek는 V4.1 Flash가 성능, 비용, 속도, 총 작업 시간 모든 면에서 V4 Pro를 종합적으로 능가한다고 밝혔습니다. 이 모델은 텍스트와 이미지를 입력받아 텍스트를 출력하며, 최대 384K 출력 토큰을 지원하는 1M 토큰 컨텍스트 윈도우를 제공합니다. 또한 Chat Completions, Responses, Anthropic 호환 API에서 thinking(기본값, 노력 수준 low / high / max 선택 가능) 및 non-thinking 모드를 지원하고, JSON 출력, 도구 호출, 채팅 접두사 완성도 지원합니다. FIM은 non-thinking 모드에서만 작동합니다. 모델 가중치는 Hugging Face(deepseek-ai/DeepSeek-V4.1-Flash)에 공개되어 있습니다. 출시 시점 공식 벤치마크: Terminal-Bench 2.1에서 90.6, DeepSWE v1.1에서 74.2, NL2Repo-Bench에서 65.4, GPQA Diamond에서 90.9, 도구 사용 시 HLE에서 63.9, 그리고 강력한 네이티브 비전 에이전트 결과(도구 사용 시 BabyVision 89.6, Chartography 78.9)를 기록했습니다. 가격도 이번 출시와 함께 인하되어, 비수요 시간대 요금은 입력(캐시 미스) $0.15/M, 출력 $0.60/M, 캐시 히트 시 $0.003/M이며, 주중 피크 시간대(01:00-04:00 및 06:00-10:00 UTC)에는 두 배로 인상됩니다. 주말을 포함한 그 외 모든 시간대는 비수요 시간대로 간주됩니다.
DeepSeek V4.1 Flash는 OpenAI 호환 API 게이트웨이인 OrcaRouter를 통해 사용할 수 있는 DeepSeek 모델입니다. 텍스트와 이미지 입력을 받아들이며, 1,048,576 토큰의 컨텍스트 창을 갖추고 단일 응답에서 최대 384,000 토큰을 생성할 수 있습니다. OrcaRouter는 공급자 요율로 100만 입력 토큰당…
DeepSeek V4.1 Flash는 텍스트와 이미지를 입력으로 받아 텍스트를 반환합니다. 실제로 이는 세 가지 큰 패턴을 포괄합니다. 첫째는 문서 이해로, 표, 스캔한 페이지 또는 다이어그램의 스크린샷을 서면 지침과 함께 넣는 것입니다. 둘째는 시각적 그라운딩으로, 인터페이스, 차트 또는 오류 상태의 스크린샷을 더 긴 대화나 명세의 맥락에서 분석하는 것입니다. 셋째는 혼합 모달리티 추론으로, 긴 텍스트 코퍼스에 질문의 기준점이 되는 이미지 몇 장을 결합하는 것입니다. 출력은 텍스트뿐이므로, 모델은 이미지를 생성하기보다는 자신이 보는 것을 묘사, 추출 또는 해설합니다. 이미지 토큰은 입력으로 집계되며 OrcaRouter에서 텍스트 입력과 동일한 요율인 100만 입력 토큰당 $0.15로 청구됩니다. 텍스트만으로 충분한 워크로드에서는 텍스트 전용 모델이 더 저렴할 수 있지만, V4.1 Flash는 가벼운 시각 작업을 위해 별도의 비전 파이프라인을 실행하는 일을 피합니다.
긴 컨텍스트 분석과 긴 답변, 대규모 저장소 전반의 코드 이해, 멀티모달 문서 검토, 그리고 막대한 상태를 유지해야 하는 에이전트형 루프에 잘 맞습니다. 최대 출력이 384,000토큰에 달하므로, 모델은 짧은 요약 대신 전체 보고서나 마이그레이션 노트, 확장된 코드를 반환할 수 있습니다. 녹취록을 구조화된 노트로 바꾸는 파이프라인, 계약서 비교, 전체 이력을 컨텍스트에 유지하는 지원 워크플로에도 적합합니다. 90.9 GPQA Diamond 점수는 대학원 수준 과학 질문에서의 강점을 시사하며, 이는 산문만이 아니라 기술 및 연구 지향 질의응답에 강하다는 뜻입니다. 반면 짧은 분류 호출에 백만 토큰 창이 필요하지 않은 고빈도·초소형 요청 트래픽에는 덜 적합하고, 출력이 텍스트 전용이므로 이미지 생성이 필요한 작업에도 덜 적합합니다.
많은 모델이 출력을 수천 토큰으로 제한하므로, 긴 작업은 여러 턴에 걸쳐 이어 붙여야 합니다. 384,000토큰 상한은 DeepSeek V4.1 Flash가 한 번에 전체 산출물을 생성할 수 있게 해줍니다: 완전한 기술 명세서, 긴 마이그레이션 계획, 확장된 주석 diff, 또는 전체 대화록 재작성 등이죠. 단일 패스 생성은 일반적으로 여러 짧은 호출로 답변을 조립하는 것보다 내적 일관성을 더 잘 유지합니다. 모델이 턴 사이에 맥락을 잃지 않기 때문입니다. 대가는 비용입니다. OrcaRouter에서는 출력 토큰 100만 개당 $0.60로 청구되며, 이는 입력 요금의 네 배이므로, 아주 긴 생성은 요청에서 비싼 부분입니다. 일관된 긴 답변이 실제로 가치 있는 경우에만 이 상한을 사용하고, 작업에 맞게 max_tokens를 설정하며, 두 문단짜리 답변으로 충분할 때 모델이 장황하게 늘어놓도록 두지 마세요.
큰 컨텍스트와 높은 출력 상한은 비용을 지불해야 하는 역량입니다. 작업에 짧은 프롬프트와 짧은 답변만 필요하다면, 예를 들어 의도 분류, 엔터티 추출, 라우팅 또는 단순 재작성이라면, 추가 윈도우는 아무것도 더해 주지 않으며, OrcaRouter 내 다른 곳에 있는 더 작은 모델이 보통 호출당 비용이 더 적습니다. 입력이 설계상 이미 청크로 나뉘어 있는 대용량 배치 작업에도 마찬가지입니다. 작업이 정말로 이 윈도우를 필요로 할 때는 DeepSeek V4.1 Flash를 선택하세요: 전체 문서, 긴 코드 컨텍스트, 다중 이미지 검토 또는 긴 단일 패스 답변. 유용한 규칙은 먼저 프롬프트 크기와 예상 출력을 추정하는 것입니다. 둘 다 크지 않다면, 총 토큰 비용을 더 작은 옵션과 비교하세요. 프롬프트가 수십만 토큰에 달한다면, 대안은 보통 검색 파이프라인이며, 이는 그 자체의 엔지니어링 비용과 정보 손실을 수반합니다.
GPQA Diamond는 단순 조회로는 답을 찾기 어렵도록 작성된 대학원 수준 과학 질문 모음이므로, 점수는 일반적인 사실을 기억하는 능력이 아니라 어려운 기술 자료를 추론하는 능력을 반영합니다. DeepSeek V4.1 Flash는 이 벤치마크에서 90.9점을 기록합니다. 여기서 높은 결과는 해당 모델이 다단계 과학적 추론과 정밀한 도메인 질문을 능숙하게 처리한다는 것을 나타냅니다. 그렇다고 해서 그 모델이 모든 작업에서 똑같이 강하다는 뜻은 아닙니다. GPQA Diamond는 범위가 좁습니다. 긴 컨텍스트 검색, 어조, 정돈되지 않은 프롬프트에서의 지시 따르기, 대규모에서의 코드 품질에 대해서는 거의 알려주지 않습니다. 90.9를 기술적 추론 능력을 확인해 주는 하나의 데이터 포인트로 취급하고, 자신의 워크로드에서 검증하세요. 실제 입력에서 가져온 작은 평가 세트를 구축하고 — 긴 문서와 이미지+텍스트 프롬프트를 포함하여 — OrcaRouter에서 프로덕션 경로를 확정하기 전에 그 세트에서 출력을 비교하세요.
DeepSeek V4.1 Flash의 지연 시간은 대부분 이 모델에 얼마나 많은 생성을 요청하느냐에 달려 있습니다. 첫 토큰까지 걸리는 시간은 프롬프트 크기와 제공자 부하의 영향을 받고, 총 응답 시간은 출력 길이에 따라 늘어납니다. 384,000토큰 상한이 있는 상황에서 최대 길이 생성은 본질적으로 오래 걸리는 요청입니다. OrcaRouter에서 이 모델에 대해 공개된 지연 시간 수치는 없으므로, 숫자를 가정하기보다 자체 프롬프트로 측정하세요. 실용적인 단계: 대화형 경로에서는 max_tokens를 제한하여 응답이 일정 범위를 유지하도록 하고, 토큰을 스트리밍하여 사용자가 진행 상황을 볼 수 있게 하며, 매우 긴 생성은 백그라운드 작업용으로 남겨 두세요. 동시성이 높은 경우 제공자 처리량 한도가 실효 속도를 좌우할 수 있으므로 그에 맞게 대기열에 넣거나 재시도하세요. 동일한 프롬프트를 사용해 현재 모델과 비교하고, 첫 토큰까지 걸리는 시간을 총 소요 시간과 별도로 추적하세요.
벤치마크는 후보군을 좁히는 데 유용하지, 프로덕션에서 모델 순위를 매기는 데 유용한 것은 아닙니다. 각 테스트는 고정된 프롬프트 형식 아래에서 특정하고 제한된 기술을 측정합니다. GPQA Diamond는 대학원 수준의 과학적 추론을 보상하는 반면, 코딩 벤치마크는 전혀 다른 행동을 보상합니다. 한 영역에서의 높은 점수가 자동으로 다른 영역으로 전이되지는 않으며, 모델 간의 작은 격차는 종종 실행 간 변동 범위 안에 있습니다. 두 가지 실천이 도움이 됩니다. 첫째, 벤치마크의 과제가 여러분의 과제와 유사한지 확인하십시오. GPQA Diamond에서의 90.9는 연구 및 기술 질의응답에는 의미가 있지만, 채팅 어조나 추출에는 덜 그렇습니다. 둘째, 자체 데이터로 테스트하십시오: 대표성 있는 샘플을 구성하고, 채점 규칙을 정의한 뒤, 측정하십시오. OrcaRouter에서는 하나의 OpenAI 호환 API를 통해 동일한 요청을 서로 다른 model id로 라우팅하고 출력을 직접 비교할 수 있으며, 이는 리더보드 순위만 보는 것보다 더 많은 정보를 제공합니다.
세 가지 한계는 미리 계획해 둘 가치가 있습니다. 첫째, 출력은 텍스트뿐입니다. 모델은 이미지 입력을 받지만 이미지를 생성하지는 않습니다. 둘째, 긴 출력은 비용이 더 많이 들고, 출력 토큰 1M당 $0.60으로 입력 요금의 네 배이므로 장황한 생성이 주요 비용 위험입니다. 셋째, 큰 컨텍스트 창이 모든 세부 정보가 사용된다는 것을 보장하지는 않습니다. 백만 토큰에 걸친 어텐션은 가정하기보다 자체 문서에서 검증해야 하는 기능입니다. 운영상의 제약도 있습니다. 매우 큰 프롬프트는 처리 시간이 더 오래 걸리고 속도 예산을 더 빨리 소모합니다. 이 모델은 OrcaRouter를 통해 DeepSeek가 제공하므로 가용성은 제공자의 인프라와 그들이 적용하는 모든 제한을 따릅니다. 밀집된 차트, 필기 또는 저해상도 스캔에서의 멀티모달 정확도는 달라질 수 있으므로, 중요한 추출 작업을 이 모델로 라우팅하기 전에 대표 샘플에서 검증하십시오.
DeepSeek V4.1 Flash는 1M 입력 토큰당 $0.15, 1M 출력 토큰당 $0.60으로 청구됩니다. OrcaRouter는 이를 제공업체 요율로 마크업 없이 그대로 전달하므로, 보이는 금액은 재판매 가격이 아니라 제공업체의 가격입니다. 입력에는 사용자가 보내는 모든 것이 포함됩니다: 텍스트 토큰, 이미지 토큰, 대화의 누적 기록. 출력은 모델이 생성하는 모든 것을 포함하며, 도구 호출 인수와 모델이 내보내는 모든 추론 텍스트를 포함합니다. 요금은 토큰 기반이므로, 더 저렴한 요청은 단순히 더 적은 토큰을 사용합니다. 컨텍스트 윈도 자체에 대해서는 별도 요금이 명시되어 있지 않습니다: 1,048,576 토큰 윈도는 한도일 뿐 요금이 아닙니다. 큰 프롬프트는 더 많은 입력 토큰을 포함하므로 자연스럽게 더 많은 비용이 듭니다. 지출을 실제로 발생시키는 기능에 비용을 귀속시킬 수 있도록 경로별 사용량을 추적하세요.
지출을 결정하는 두 가지 승수가 있습니다: 얼마나 많은 토큰이 들어가고 얼마나 나오는지입니다. 출력은 100만 토큰당 $0.60로 입력 100만 토큰당 $0.15보다 더 비싼 쪽이며, 4배 차이입니다. 200,000 토큰을 읽고 500 토큰을 쓰는 요청은 입력이 지배적입니다. 2,000 토큰을 읽고 20,000을 쓰는 요청은 출력이 지배적입니다. 제품이 어떤 패턴을 가지는지 알면 어디를 최적화해야 하는지 알 수 있습니다. 세 가지 레버가 따릅니다. 컨텍스트 다듬기: 1,048,576 토큰을 사용할 수 있더라도 작업에 필요한 문서와 기록만 포함하세요. 출력 제한: max_tokens를 상한 대신 실제 요구 사항으로 설정하세요. 그리고 배치: 더 적고 더 큰 호출은 동일한 컨텍스트를 반복적으로 다시 보내는 것을 피하게 해주며, 이는 종종 긴 컨텍스트 애플리케이션에서 가장 조용한 낭비 원인입니다.
DeepSeek V4.1 Flash는 OrcaRouter가 제공자 요율로 마크업 없이 청구하므로, 제공자 측 할인이나 캐시된 입력 요율이 흡수되거나 마크업되지 않고 그대로 전달됩니다. 이 모델에 할인된 캐시 입력이 제공되는지, 그리고 어떤 조건에서 제공되는지는 DeepSeek가 정하므로, 예산에 절감액을 반영하기 전에 제공자의 최신 문서에서 확인하세요. 직접 제어할 수 있는 것은 프롬프트 설계입니다. 시스템 지침, 스키마, 검색된 컨텍스트와 같은 안정적인 접두사를 유지하고, 가변 콘텐츠는 끝에 추가하여 제공자가 지원하는 접두사 재사용이 적용될 수 있게 하세요. 배치 내 호출에서 동일한 컨텍스트를 항목별로 다시 보내지 말고 재사용하세요. 더 이상 필요하지 않게 되면 이전 턴을 요약하여 기록을 적극적으로 줄이세요. 이러한 습관은 긴 컨텍스트 워크로드에서 주로 소비되는 입력 토큰을 줄여 줍니다.
OpenAI 호환 클라이언트를 https://api.orcarouter.ai/v1로 지정하고 모델을 deepseek/deepseek-v4.1-flash로 설정하세요. OrcaRouter는 OpenAI 채팅 완료 인터페이스를 노출하므로, Python, JavaScript 및 기타 언어용 기존 SDK는 기본 URL과 모델 ID 변경 및 OrcaRouter API 키만으로 작동합니다. 최소 요청은 시스템 및 사용자 턴이 포함된 messages 배열과 max_tokens, temperature, stream 같은 선택적 매개변수를 전송합니다. 이미지 입력은 표준 멀티모달 콘텐츠 형식을 따르며, 동일한 사용자 메시지에서 텍스트 파트와 함께 이미지 파트가 들어갑니다. 응답은 일반적인 형태로 반환되므로 파싱, 스트리밍, 도구 호출 처리 코드가 변경 없이 그대로 이어집니다. 모델별 매개변수 참고 사항이 있는지 OrcaRouter 모델 페이지를 확인하고, 프롬프트 크기와 출력 제한을 조정하는 동안 처음 몇 번의 호출에서는 원시 응답을 기록하세요.
대부분의 DeepSeek V4.1 Flash 요청은 네 가지 매개변수에 의해 좌우됩니다. max_tokens는 출력 상한을 설정하며 최대 384,000토큰이라는 점을 고려할 때 주요 비용 제어 수단입니다. 작업에 필요한 값으로 설정하고 최댓값으로 설정하지 마세요. temperature는 변동성을 제어하므로 추출, 구조화된 출력, 코드에는 낮게 유지하고 초안 작성에는 더 높게 설정하세요. stream을 사용하면 긴 생성에서 진행 상황을 표시할 수 있으며, 이는 응답이 수만 토큰에 달할 수 있을 때 중요합니다. 시스템 지침에는 형식 및 안전 요구 사항이 포함되어야 합니다. 이미지의 경우 표준 멀티모달 콘텐츠 배열이 사용해야 하는 메커니즘입니다. 긴 프롬프트의 경우 입력 토큰이 1M당 $0.15로 청구되므로 포함된 모든 문서가 필요한지 고려하세요. 모델이 OpenAI 호환 스키마를 통해 도구 호출을 지원한다면, 광범위한 도구보다는 좁고 문서화가 잘 된 도구를 정의하세요. 예상되는 가장 긴 생성에 맞는 클라이언트 측 타임아웃을 설정하세요.
마이그레이션은 의도적으로 작습니다. base URL을 https://api.orcarouter.ai/v1로 변경하고, 모델 문자열을 deepseek/deepseek-v4.1-flash로 교체하며, OrcaRouter API 키를 제공하세요. 요청 및 응답 스키마는 OpenAI 호환을 유지하므로 메시지 배열, 스트리밍 이벤트, 도구 호출 페이로드를 구조적으로 다시 작성할 필요가 없습니다. 작업은 배관이 아니라 동작에 있습니다. 1,048,576 토큰 창과 384,000 토큰 출력 상한을 가진 모델은 이전 모델이 받아들일 수 없었던 프롬프트를 허용합니다. 입력 토큰이 1M당 $0.15이므로, 프롬프트 크기를 무작정 부풀리기보다 이 기회에 컨텍스트 품질을 높이세요. max_tokens, temperature, 재시도 로직을 다시 튜닝한 다음 평가 세트를 다시 실행하세요. 토크나이저와 프롬프트 분할 가정도 검토하세요. 작은 창을 위해 만들어진 청킹 로직은 이제 불필요할 수 있으며, 이를 그대로 두면 컨텍스트가 조각날 수 있습니다.
이미지는 사용자 메시지에서 콘텐츠 파트로 제공되며, OpenAI 멀티모달 형식과 일치합니다: 메시지 콘텐츠는 텍스트 파트와 이미지 파트를 포함하는 배열이 되고, 각 이미지에는 URL 또는 base64 데이터가 주어집니다. 일반적인 호출은 명세서, 대화 기록 또는 이전 대화와 같은 긴 텍스트 본문을 하나 이상의 스크린샷이나 스캔한 페이지와 혼합하고, 둘 모두에 의존하는 질문을 합니다. 업로드 전에 크기를 조정하세요. 매우 큰 이미지는 입력 토큰을 추가하며, 입력은 1M 토큰당 $0.15로 청구되므로, 단순한 다이어그램의 전체 해상도 캡처를 보내는 것은 정확도를 개선하지 않으면서 예산을 낭비합니다. 중요한 영역으로 자르고 텍스트가 많은 자료에는 읽을 수 있는 해상도를 사용하세요. 작업에 많은 이미지가 필요한 경우, 각 이미지에 대해 별도의 호출을 발행하는 대신 하나의 요청에 논리적으로 그룹화하세요. 별도 호출은 매번 텍스트 컨텍스트를 다시 보냅니다.
프론티어급 모델은 가장 어려운 추론 및 코딩 벤치마크에서 종종 앞서지만, 일반적으로 토큰당 훨씬 더 많은 비용을 청구하며 출력을 DeepSeek V4.1 Flash가 허용하는 것보다 훨씬 낮게 제한할 수 있습니다. 이 모델의 GPQA Diamond 90.9점은 대학원 수준 과학 추론에서 신뢰할 만한 영역에 올려놓으며, 100만 입력 토큰당 $0.15, 100만 출력 토큰당 $0.60의 가격은 긴 컨텍스트 작업을 저렴하게 유지합니다. 선택은 보통 세 가지 질문으로 귀결됩니다. 추론 작업이 얼마나 어려우며, 정확도 격차가 그 작업에 중요한가? 입력이 얼마나 길며, 1,048,576토큰 창이 파이프라인 복잡성을 얼마나 줄여 주는가? 384,000토큰 상한을 고려할 때 출력이 얼마나 긴가? 문서가 많은 분석, 긴 단일 패스 생성, 대량의 멀티모달 검토에는 V4.1 Flash가 종종 실용적인 선택입니다. 가장 어려운 추론 단계의 경우, 해당 호출을 OrcaRouter에서 더 비싼 모델로 라우팅하는 것을 고려하세요.
OrcaRouter는 하나의 OpenAI 호환 API 뒤에 많은 모델을 제공하므로, 비교는 두 번째 공급업체를 통합하는 것이 아니라 모델 id를 전환하는 문제입니다. DeepSeek 제품군 내에서 의미 있는 축은 가격, 컨텍스트 윈도, 출력 상한입니다. V4.1 Flash는 1,048,576토큰 윈도와 384,000토큰 출력 제한을 결합하며, 100만 입력 토큰당 $0.15, 100만 출력 토큰당 $0.60입니다. 프롬프트와 답변이 짧고 추가 윈도가 가치를 더하지 않을 때는 더 작거나 더 저렴한 모델이 합리적입니다. 이미지 입력이 아니라 이미지 출력이 필요할 때는 비전 지원 대안이 중요합니다. 특화된 코드 또는 추론 모델이 좁은 작업에서는 더 나을 수 있습니다. OrcaRouter는 마크업 없이 제공업체 요율로 가격을 책정하므로, 토큰 기준 비교는 동일 조건에서 이루어집니다: 두 id 모두에 동일한 프롬프트를 실행하고 비용과 품질을 측정한 뒤 작업별로 라우팅하세요.
과제 형태가 모델의 강점과 맞지 않으면 다른 것을 선택하세요. 짧고 고빈도의 분류, 라우팅 또는 추출 작업은 1,048,576 토큰 창에서 아무런 이점을 얻지 못하며 더 작은 모델에서 더 저렴합니다. 이미지 생성이 필요한 작업에는 완전히 다른 부류의 모델이 필요합니다. 정리 스타일 수학이나 미묘한 알고리즘 설계처럼 단 하나의 어려운 추론 단계가 품질을 좌우한다면, 그 단계에만 사용하는 프런티어 모델은 더 높은 요율을 지불할 가치가 있을 수 있습니다. 모델을 조합하는 것도 합리적입니다. DeepSeek V4.1 Flash를 사용해 긴 입력을 읽고, 근거를 수집하고, 장문 출력 초안을 작성하세요. 비용은 1M 입력 토큰당 $0.15, 1M 출력 토큰당 $0.60입니다. 그런 다음 특정 결정을 더 비싼 모델로 에스컬레이션해 검증하세요. OrcaRouter의 OpenAI 호환 API는 그 라우팅을 새로운 통합이 아니라 구성 변경으로 만들어 줍니다.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoninglogprobsmax_tokensreasoningreasoning_effortresponse_formatstopstreamstream_optionstemperaturethinkingtool_choicetoolstop_logprobstop_puser_id| 입력 / 1M tokens · 오프피크 | $0.150 |
|---|---|
| 출력 / 1M tokens · 오프피크 | $0.600 |
| 캐시 읽기 / 1M · 오프피크 | $0.0030 |
| 피크 시간대 | 01:00–04:00, 06:00–10:00 ×2 (UTC) |
| 입력 / 1M tokens · ×2 | $0.300 |
| 출력 / 1M tokens · ×2 | $1.20 |
| 캐시 읽기 / 1M · ×2 | $0.0060 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
이번 주 개발자들의 이야기
@misc{orcarouter_deepseek_v4_1_flash,
title = {DeepSeek V4.1 Flash API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash}
}DeepSeek. (2026). DeepSeek V4.1 Flash API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash