히어로 타이틀 카드: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — 이 중 하나는 여전히 프리뷰입니다
Guides & Insights

DeepSeek V4.1 Flash vs Gemini 3.1 Pro: 이 중 하나는 아직 프리뷰입니다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

가장 유용하게 알아두어야 할 점은 DeepSeek V4.1 FlashGemini 3.1 Pro에 대해서는 어느 스펙 시트에도 적혀 있지 않습니다. DeepSeek V4.1 Flash는 2026년 9월 10일에 출시된 정식 제공 모델이며, 다운로드할 수 있는 MIT 라이선스가 적용된 가중치를 제공합니다. Gemini 3.1 Pro는 2026년 2월 19일부터 프리뷰 상태이며, 약 7개월이 지난 뒤에도 여전히 프리뷰 빌드 이름으로 제공됩니다. 이러한 비대칭은 어느 모델이 더 나은지를 결정하지는 않지만, 둘 중 하나를 기반으로 구축할 때 어떤 종류의 약속을 하는 것인지를 결정하며, 아래 모든 내용의 틀이 됩니다.

둘 다 100만 토큰의 컨텍스트를 갖습니다. 둘 다 이미지를 입력받습니다. 이 둘을 실제로 구분 짓는 차이는 200,000 입력 토큰을 초과할 때의 가격 곡선, 입력 모달리티, 출력 상한, 그리고 이 둘 중 하나는 직접 소유할 수 있는 파일이고 다른 하나는 API라는 사실입니다.

두 사람의 실제 입장

• 100만 토큰당 가격, 최대 20만 컨텍스트 — DeepSeek V4.1 Flash $0.15 입력 / $0.60 출력 vs Gemini 3.1 Pro $2.00 입력 / $12.00 출력. 이는 입력 가격의 13배, 출력 가격의 20배입니다.

• 1M 토큰당 가격, 200K 컨텍스트 초과 시 — V4.1 Flash는 $0.15 / $0.60으로 변동 없음, Gemini 3.1 Pro는 입력 $4.00 / 출력 $18.00. 입력 배수는 장문 컨텍스트 작업이 이루어지는 바로 그 지점에서 27×로 확대됩니다.

• 캐시된 입력 — V4.1 Flash는 오프피크 기준 1M당 $0.003, Gemini 3.1 Pro는 1M당 $0.40. 재독 컨텍스트를 감당할 수 있는지를 좌우하는 바로 그 항목에서 100배 차이다.

• 컨텍스트 윈도우 — 1M 토큰 대 1M 토큰. 수준.

• 최대 출력 — V4.1 Flash 384K 토큰 vs Gemini 3.1 Pro 65K 토큰. 상한의 6배.

• 입력 모달리티 — V4.1 Flash는 텍스트와 이미지를 처리하는 반면, Gemini 3.1 Pro는 텍스트, 이미지, 오디오, 비디오 및 파일 업로드를 처리합니다.

• 가중치 — V4.1 Flash MIT, 다운로드 가능 vs Gemini 3.1 Pro 폐쇄형, API 전용.

• 출시 상태 — V4.1 Flash는 2026년 9월 10일부터 정식 출시(GA)된 반면, Gemini 3.1 Pro는 2026년 2월 19일부터 프리뷰 상태입니다.

• 관측된 첫 토큰까지의 지연 시간 — OrcaRouter 자체의 7일 텔레메트리에서 V4.1 Flash는 p50 2.63초, p95 9.05초인 반면, Gemini 3.1 Pro는 p50 10.00초, p95 10.00초입니다. 고가 모델의 중앙값 대기 시간은 텔레메트리 상한에 머물러 있고, 그 꼬리 지연도 상한에서 벗어나지 않습니다.

가격을 빼고 목록을 읽어 보면, 그 형태는 모든 오픈 웨이트 대 프런티어 비교에서 익숙하다: 다운로드 가능한 모델은 출력 상한에서 이기고, 컨텍스트에서는 동점이며, 관측된 지연 시간에서는 앞선다. 폐쇄형 모델은 모달리티에서 이기고, 그 부분에서는 완전히 이긴다. 여기서 13배 입력 배수를 그 자체로 설명하는 것은 없다.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

200K 절벽이 가격 책정의 핵심이다

Gemini 3.1 Pro의 대표 요금은 단일 요금이 아닙니다. 최대 200,000 입력 토큰까지의 프롬프트는 백만 개당 입력 $2.00, 출력 $12.00로 청구되며, 이 임계값을 넘는 프롬프트는 $4.00와 $18.00로 청구됩니다. DeepSeek V4.1 Flash에는 구간이 없습니다 — 요청이 2,000 토큰이든 900,000 토큰이든 $0.15와 $0.60를 청구하며, 한 가지 주의할 점은 DeepSeek가 피크 시간에는 요금을 두 배로 올리고 주말에는 전적으로 오프피크로 운영한다는 것입니다.

그 티어 경계는 긴 컨텍스트 작업에 가장 안 좋은 위치에 놓인다. 긴 컨텍스트 작업은 정의상 그 경계를 넘는 작업이기 때문이다. 실제 계산 예시를 들면 분명해진다. 한 달에 20,000건의 호출을 수행하고, 각 호출이 평균 250,000개의 입력 토큰과 4,000개의 출력 토큰을 사용하는 파이프라인을 생각해 보자. 대용량 파일을 대상으로 하는 문서 분석 작업이다.

• DeepSeek V4.1 Flash, 오프피크 요금 기준: 20,000 × 250,000은 5,000M 입력 토큰으로, 백만 토큰당 $0.15, 즉 $750.00입니다. 출력은 20,000 × 4,000으로 80M 토큰이며, 백만 토큰당 $0.60, 즉 $48.00입니다. 합계 $798.00입니다.

• Gemini 3.1 Pro의 200K 초과 구간 기준: 동일한 5,000M 입력 토큰을 백만 개당 $4.00로 계산하면 $20,000.00이고, 80M 출력 토큰을 백만 개당 $18.00로 계산하면 $1,440.00입니다. 합계 $21,440.00.

그것은 동일한 트래픽에 대한 월간 지출에서 27배 차이이며, 헤드라인 숫자에서 짐작했을 배수가 아닙니다. 헤드라인 배수는 13배입니다. 긴 컨텍스트 작업에 실제로 지불하는 배수는 27배인데, 티어 경계가 바로 여러분의 프롬프트가 놓여 있는 지점이기 때문입니다.

미리보기 라벨이 실제로 당신에게 치르게 하는 비용

업계 전반에서 프리뷰 빌드는 프리뷰 빌드일 뿐입니다. 공개된 안정성 보장은 제공되지 않습니다. 공급업체는 해당 엔드포인트를 그 동작, 그 가격, 그 이름으로 유지하겠다고 약속하지 않았습니다. 이것은 Gemini 3.1 Pro에 대한 비판이 아닙니다. 그것이 이 라벨이 의미하는 바이며, 프리뷰 접미사가 2주짜리 형식적 절차가 아니라 7개월 동안 살아남은 이유입니다.

프로토타입이라면 이건 아무것도 아니다. 프로덕션 경로라면 이것은 구체적이고 정량화 가능한 위험이다. 당신이 튜닝한 대상 빌드가 그대로 유지된다고 거는 것이다. 이 비교의 반대편과의 대비는 수사적이라기보다 구조적이다. DeepSeek V4.1 Flash는 GA이고, 가중치는 MIT 라이선스로 공개되어 다운로드할 수 있다. 즉, 호스팅 API가 내일 약관을 바꾸더라도 모델 자체는 여전히 당신 손에 남는다. 폐쇄형 프리뷰 모델은 GA 약속도, 탈출구도 주지 않는다. 당신의 워크로드가 둘 중 어느 쪽에서든 돌아간다면, 그 차이는 벤치마크 점수 하나보다 더 가치가 있다.

Gemini 3.1 Pro가 더 나은 도구인 경우

모달리티 격차는 반올림 오차가 아니며, 이 목록에서 저렴한 모델이 어떤 가격으로도 대체될 수 없는 유일한 차원이다. Gemini 3.1 Pro는 오디오와 비디오를 일급 입력으로 받고, 파일 업로드도 지원한다. DeepSeek V4.1 Flash는 텍스트와 이미지를 받는다. 파이프라인이 통화 녹음, 화면 캡처, 또는 영상 리뷰를 입력받는다면, DeepSeek V4.1 Flash는 더 저렴한 선택지가 아니다 — 선택지 자체가 아니다. 13×라는 배수는 한 모델은 할 수 있고 다른 모델은 할 수 없는 작업에는 무관하다.

더 조용한 두 번째 사례가 있습니다. Gemini 3.1 Pro는 2월부터 어떤 형태로든 공개적으로 사용 가능했으며, 더 긴 프로덕션 이력을 가진 모델입니다. 더 많은 사람이 그 한계에 부딪혀 봤고, 실제 트래픽에서의 동작은 출시된 지 12일 된 릴리스보다 더 잘 문서화되어 있습니다. 작업이 백그라운드에서 실행되므로 중앙값 10초 대기가 허용되는, 출력이 많은 대화형 작업에서는 그 실적이 논거이며, 이는 실질적인 논거입니다. 그것은 지연 시간에 관한 논거가 아닙니다. 위의 텔레메트리에서 더 저렴한 모델이 중앙값과 꼬리 모두에서 둘 중 더 빠릅니다.

그리고 그 이력에서 프리뷰 라벨이 무엇을 의미하는지에 대한 문제도 있습니다. 프리뷰 빌드 이름으로 7개월간 제공된다는 것은 대부분의 모델이 누리는 기간보다 길고, 또한 GA 약속 없이 7개월이 흐른 것이기도 합니다. DeepSeek V4.1 Flash는 이 글을 쓰는 시점에 출시 12일째이며 독립적인 기록이 빈약합니다. 최근 서드파티 평가 중 그것이 등장하는 단 하나의 스윕인, 2026년 9월 21일 발표된 Agents on Rails 에이전틱 코딩 보드에서 최대 노력 기준 17%로 중위권에 올랐습니다. 12일은 모델의 평판이 어느 방향으로든 의미를 갖기에는 충분한 시간이 아닙니다. 이는 구매자가 여기서 더 오래된 모델을 선호할 수 있는 솔직한 이유이며, 속도와는 아무 관련이 없습니다.

컨텍스트 길이를 기준으로 라우팅한다. 그것이 진짜 결정이기 때문이다.

이 비교가 암시하는 결정은 “하나를 고르는 것”이 아니다. 그것은 두 개의 조항을 가진 규칙이다. 긴 컨텍스트의 대용량 작업은 DeepSeek V4.1 Flash로 가고, 오디오나 비디오가 포함된 것은 무엇이든 Gemini 3.1 Pro로 간다. 골치 아픈 부분은 이 규칙이 말하기는 쉽지만 구현하기는 번거롭다는 점인데, 두 조항이 보통 서로 다른 키, 서로 다른 SDK, 서로 다른 속도 제한을 가진 서로 다른 벤더에 존재하기 때문이다.

두 모델 모두 단일 OrcaRouter 키로 접근할 수 있으므로, 이 규칙은 애플리케이션의 분기 코드가 아니라 라우팅 규칙이 됩니다. 즉, 여기서 비용 차이를 실제로 좌우하는 차원인 요청 컨텍스트 길이를 기준으로 바로 결정을 내릴 수 있습니다. OrcaRouter 공급자 정가를 0% 마크업으로 그대로 전달합니다, 따라서 위의 계층별 요금은 Google 자체 요금이고 DeepSeek 피크 스케줄은 DeepSeek 자체 스케줄이며, 공급업체 가격 변경은 같은 날 우리 쪽에 바로 반영됩니다. 그리고 이 조합의 한쪽은 프리뷰 빌드이므로, 자동 장애 조치를 그 뒤에 두는 것이 좋습니다. 빌드가 사용자 모르게 개정되면 요청은 오류 페이지가 아니라 다른 모델로 전달됩니다.

그 마지막 요점은 위의 모든 내용을 실무적으로 옮긴 것입니다. 긴 컨텍스트 작업에서의 27배 차이는 선택하기보다 라우팅해야 하는 이유이며, 두 모델 중 하나에 붙은 프리뷰 레이블은 빌드가 바뀔 때 요청이 갈 곳이 있어야 하는 이유입니다.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

볼 만한 것

• Gemini 3.1 Pro가 프리뷰 단계를 벗어날지 여부. GA 출시는 안정성 관련 유의사항을 제거하고, 어떤 가격 변동보다도 이 비교의 양상을 더 크게 바꿀 것이다.

• 200K 초과 구간이 변경되는지 여부. 비용 산정에서는 대표 요율보다 구간 경계가 더 큰 역할을 하고 있다.

• DeepSeek V4.1 Flash가 독자적인 기록을 쌓을지 여부. MIT 라이선스 가중치, 384K 출력 상한, 1M 컨텍스트, 백만 입력당 0.15달러라는 구성은 이례적인 패키지다. 그 능력이 실제로 갖춰져 있는지는 아직 어떤 공개 벤치마크도 답하지 못한 질문이다.

그중 첫 번째가 실현되기 전까지, 정확한 요약은 다음과 같습니다: DeepSeek V4.1 Flash는 입력 비용이 Gemini 3.1 Pro보다 약 13배 저렴하고, 장문 컨텍스트 입력에서는 27배 저렴합니다. 또한 둘 중 다운로드할 수 있는 유일한 모델이며, GA 약정이 뒷받침된 유일한 모델입니다. Gemini 3.1 Pro는 프로덕션 이력이 더 긴 모델이며, 둘 중 오디오와 비디오를 읽을 수 있는 유일한 모델입니다. 이에 맞게 라우팅하십시오.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart