Gemini 3.7 Flash와 DeepSeek V4 Flash 비교를 위한 타이틀 카드로, 두 개의 번개를 보여준다: $0.75 / $3.75 태그가 붙은 Gemini 3.7 Flash라고 표시된 잠긴 금고와 $0.14 / $0.28 태그가 붙은 DeepSeek V4 Flash라고 표시된 다운로드 화살표가 있는 열린 상자.
Guides & Insights

Gemini 3.7 Flash 대 DeepSeek V4 Flash: 두 "Flash" 모델, 같은 질문에 대한 정반대의 답변

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 가장 혼란스러운 이름을 가진 두 모델은 둘 다 Flash로 불리지만, 같은 질문에 이보다 더 다르게 답할 수는 없다. 2026년 8월 13일에 출시된 Gemini 3.7 Flash는 Go{{1}}ogle{{/1}}의 폐쇄형 주력 모델로, 초당 약 340개의 출력 토큰, Intelligence Index 56, 프로모션 가격은 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75다. DeepSeek V4 Flash는 Deep{{2}}Seek{{/2}} V4 제품군의 오픈 웨이트 모델로, 4월에 출시되어 7월 말에 업데이트되었다. MIT 라이선스로 배포되어 다운로드할 수 있으며, Deep{{3}}Seek{{/3}} 자체 API 기준 입력 100만 토큰당 $0.14, 출력 100만 토큰당 $0.28에 이용할 수 있다. 이는 Go{{4}}ogle{{/4}}의 프로모션 입력 가격의 약 5분의 1, 출력 가격의 13분의 1에 해당한다. 두 모델 모두 대량 작업을 위해 빠르고 저렴하게 설계된 'flash' 모델이다. 유사점은 바로 그 이름뿐이다.

그들이 서로 다르게 답하는 질문은 바로 이번 세대를 규정하는 질문이다: 지능을 임대할 것인가, 아니면 소유할 것인가? DeepSeek V4 Flash는 2,840억 개의 파라미터를 가진 mixture-of-experts(MoE) 모델로, 토큰당 약 130억 개의 활성 파라미터, 100만 토큰 컨텍스트 창, 384K 출력 상한을 갖추고 있으며 MIT 라이선스로 배포되었다. 가중치는 약 160GB를 다운로드해야 하며, 7월 31일 업데이트(V4-Flash-0731)는 실질적으로 더욱 강력한 에이전트 능력을 추가했다. Gemini 3.7 Flash는 Gemini 3.6 Flash를 기반으로 한 독점 모델로, 100만 토큰 컨텍스트, 64K 출력 상한, 멀티모달 입력을 지원하며 자체 호스팅 경로가 없다. 이 두 모델 중 하나는 에어갭 환경에서 사용할 수 있고, 파인튜닝하여 자체 하드웨어에서 실행할 수 있다. 다른 하나는 Google이 운영하는 곳에서만 실행된다.

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

나란히 선 두 플래시

두 모델은 모두 같은 구매자를 겨냥한다 — 토큰당 플래그십 가격을 감당할 수 없는 대규모 프로덕션 워크로드 — 그러나 정반대의 아키텍처로 그 목표에 도달한다. DeepSeek V4 Flash의 하이브리드 어텐션(압축 희소 어텐션 + 고도로 압축된 어텐션)이 1M 컨텍스트를 이 가격에 판매할 수 있을 만큼 경제적으로 만들어 주며, 이것은 Deep​Seek의 레거시 `deepseek-chat` 및 `deepseek-reasoner` 엔드포인트가 가리키던 모델로 7월에 퇴역했다. Gemini 3.7 Flash는 Go​ogle이 자체 Flash 라인을 알고리즘적으로 개선한 모델이며, 그 강점은 서빙 처리량에 있다. 독립적 측정 결과 약 340 tokens/s로 DeepSeek V4 Flash의 약 113 tokens/s를 앞서며, DeepSeek V4 Flash가 지원하지 않는 오디오 및 비디오 입력을 받으면서도 그 속도를 달성한다.

지능 지수 — Artificial Analysis 기준 Gemini 3.7 Flash는 56, DeepSeek V4 Flash는 50.

출력 속도 — ~340 tokens/s 대비 ~113 tokens/s, 둘 다 Artificial Analysis 기준.

컨텍스트 창 — 두 모델 모두 1M 토큰; DeepSeek V4 Flash는 최대 384K를 출력하는 반면, Gemini 3.7 Flash는 64K입니다.

입력 가격 — $0.75 (프로모션, 2026년까지) 대비 Deep​Seek 자체 API의 $0.14.

출력 가격 — $3.75 (프로모션) 대비 $0.28.

가중치 — 독점 라이선스 대 MIT 라이선스 및 다운로드 가능.

A comparison scoreboard for Gemini 3.7 Flash and DeepSeek V4 Flash: Gemini 3.7 Flash leads 56 to 50 on the AA Index and ~340 to ~113 tokens per second, while DeepSeek V4 Flash leads 384K to 64K on max output, $0.14 to $0.75 on input and $0.28 to $3.75 on output, with both at 1M context and proprietary weights against MIT open weights.

지수 6포인트로 실제로 무엇을 살 수 있을까

Index 6점 차이는 의미가 있지만 단절적이지는 않으며, 그 격차는 대부분 DeepSeek V4 Flash가 최적화되지 않은 영역에 집중되어 있다. Gemini 3.7 Flash의 보고된 에이전틱 코딩 수치(DeepSWE v1.1에서 65.3, FrontierCode 1.1 Main에서 43.6, 벤더 보고 기준)는 훨씬 앞서 있으며, 웹 개발 Elo(1588, 역시 벤더 보고 기준)는 실제 UI 생성 개선을 반영한다. DeepSeek V4 Flash의 자체 보고 수치(SWE-bench Verified 79.0, LiveCodeBench 91.6, 독립 트래커들이 뒷받침하는 τ²-Bench 95.0)는 제한된 코딩과 도구 사용에서 충분히 경쟁력이 있으며, 1M 컨텍스트 검색(MRCR 78.7, CorpusQA 60.5)도 같은 가격대의 어떤 제품과도 맞먹는다. 패턴은 이렇다: Gemini 3.7 Flash는 에이전틱 깊이와 웹 작업에서 앞서고, DeepSeek V4 Flash는 이를 희생하는 대신 원시 토큰 경제성과 어떤 폐쇄형 워크호스도 따라잡지 못하는 긴 컨텍스트 상한을 제공한다.

오픈 웨이트는 가격만이 아니라 조달 방식도 바꾼다.

MIT 라이선스는 이 비교에서 어떤 벤치마크 표도 담아내지 못하는 부분입니다. DeepSeek V4 Flash는 자체 하드웨어에 다운로드하여 실행하고, 자체 데이터로 미세 조정할 수 있으며, API 호출이 허용되지 않는 환경에서도 사용할 수 있습니다. 또한 이 라이선스에는 규모 기반 제한이 없어서 성장하더라도 조건이 바뀌지 않습니다. 실질적인 비용은 운영에서 발생합니다. 프로덕션 팀이 원하는 속도로 284B MoE 모델을 서빙하려면 상당한 GPU 인프라가 필요하며, 대부분의 팀에게 정직한 선택은 호스팅 API입니다. 바로 여기서 가격 격차가 실제로 작용합니다. 호스팅 경로조차 $0.14 / $0.28로, 롱테일 트래픽의 기본 선택지가 되기에 충분히 저렴합니다. Gemini 3.7 Flash는 소유권 경로를 전혀 제공하지 않습니다. 구매하는 것은 안정적으로 관리되는 빠르고 멀티모달인 서비스이며, 프로모션 가격표와 1월에 종료되는 조건이 붙어 있습니다.

사용량 청구서

같은 날(day)에 둘 다 실행: 입력 토큰 2천만 개와 출력 토큰 4백만 개. DeepSeek V4 Flash의 자체 API에서는 $2.80 + $1.12로 약 $3.92입니다. Gemini 3.7 Flash를 프로모션 요금으로 사용하면 $15 + $15로 약 $30이며, Google이 할인을 적용하는 중에도 7.6배 차이가 납니다. 2027년 1월 1일 이후 Gemini 3.7 Flash가 $1.50 / $7.50으로 되돌아가면, 같은 날 비용은 약 $58로 DeepSeek 수치의 15배가 됩니다. 속도 이점은 대화형 워크로드에서 이를 부분적으로 상쇄합니다. 더 빠른 토큰은 동시 요청 수를 줄이기 때문입니다. 그러나 배치(batch) 및 백그라운드 작업에서는 오픈 모델이 논란의 여지 없이 청구서에서 승리합니다. 두 모델은 애초에 동일한 비용 곡선을 겨냥하지 않으며, 이것이 핵심입니다.

The OrcaRouter model page for DeepSeek V4 Flash, showing the ~$0.15 per million input and ~$0.29 per million output pass-through pricing, a 1M-token context window with 384K max output, and the text-only 284B-total / 13B-active mixture-of-experts description.

누가 무엇 위에 구축해야 할까

토큰당 비용이 결정적 제약 조건일 때, 384K까지의 긴 출력이 필요할 때, 자체 호스팅이나 에어갭 배포 옵션이 필요할 때, 또는 플래그십 가격의 토큰으로는 마진을 유지할 수 없는 무언가를 구축 중일 때는 DeepSeek V4 Flash를 선택하세요. 인터랙티브 루프에서 속도가 필요할 때, 멀티모달 입력이 필요할 때, Go​ogle의 관리형 안정성이나 Go​ogle이 보고하는 더 강력한 에이전틱 코딩 결과가 필요할 때 — 그리고 프로모션 가격이 일시적이라는 점을 감수할 수 있을 때는 Gemini 3.7 Flash를 선택하세요. 이 둘은 두 플래그십이 서로 라이벌인 것과 같은 방식의 라이벌이 아닙니다. 같은 이름을 쓰는 서로 다른 두 조달 전략입니다. 두 전략이 만나는 지점은 바로 라우팅 계층입니다. DeepSeek V4 Flash는 OrcaRouter에서 Deep​Seek의 공시 가격에 0% 마크업으로 라이브로 운영되며, 장애 조치(failover) 패턴은 이 조합에 자연스럽게 맞아떨어집니다. 즉, 트래픽의 대부분을 V4 Flash로 처리하고 어려운 하위 집합은 더 강력한 폐쇄형 모델로 에스컬레이션하는 규칙이며, 같은 라우터의 다른 레그에서는 Go​ogle 자체 Gemini API를 통해 Gemini 3.7 Flash에 도달할 수 있습니다.

솔직한 해석

셀프 호스팅이 가능하거나 순전히 비용 중심의 선택을 한다면, DeepSeek V4 Flash가 구축하기에 더 나은 모델이며, 라이선스 덕분에 이 결정을 다시 검토할 필요가 없습니다. Go​ogle의 서빙 속도, 멀티모달 입력, 또는 보고된 에이전틱 코딩 우위가 필요하다면, Gemini 3.7 Flash는 프로모션이 지속되는 동안 더 나은 서비스입니다 — 1월 가격 인상이 이미 달력에 예정되어 있죠. 두 모델, 하나의 이름, 그리고 시장은 앞으로 1년간 트래픽이 어떤 철학에 투표하는지 지켜보게 됩니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트