히어로 타이틀 카드에는 'Gemini Agentic Video Understanding'이라고 표시되어 있고, '새로운 기능' 배지와 '동영상 분석 비용을 3분의 2 절감해 주는 API 모드'라는 부제가 있다. 또 'Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite에 적용', '2026년 9월 1일 발표', '처리: agentic'이라고 적힌 칩 3개와 오른쪽 하단의 OrcaRouter 로고가 있다.
Guides & Insights

Gemini 에이전틱 비디오 이해 기능이 드디어 출시되었습니다: 비디오 분석 비용을 3분의 2나 절감하는 API 모드

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

On September 1, 2026, Google introduced agentic video understanding for Gemini 3.7 Flash, Gemini 3.6 Flash, and Gemini 3.5 Flash-Lite — a new mode in the Gemini API that stops treating a video as a pile of frames and starts treating it as a searchable document. Google DeepMind's announcement, written by senior product manager Rohan Doshi and research director Mario Lučić, is the first major change to how Gemini reads video since the models gained the input at all: instead of a model silently chewing through a fixed sample of frames, the model now decides, mid-answer, what to look at, at what speed, and through which of three channels — visual frames, audio, or transcripts. The headline effect, all of it vendor-reported and none of it yet independently reproduced, is that video analysis gets up to 66% cheaper, burns up to 88% fewer tokens, and answers up to 7% more accurately than the frame-by-frame baseline it replaces.

에이전틱(agentic)이 실제로 내부적으로 바꾸는 것

구글이 이제 '정적(static)' 처리라고 부르는 기존 방식은 이렇습니다. Gemini에 비디오를 입력하면 고정된 속도(기본값은 초당 1프레임)로 프레임을 샘플링하고, 그 전체 샘플을 모델에 통과시킨 다음, 고정된 격자에서 포착된 내용을 바탕으로 답변합니다. 여기에는 두 가지 구조적 맹점이 있습니다. 샘플링된 두 프레임 사이에서 발생하는 상태 변화는 모델에게 존재하지 않는 것과 같습니다. 또한 1FPS로 샘플링된 2시간 분량의 비디오는 토큰 비용이 어마어마하며, 대부분 질문과 무관한 장면에 사용됩니다.

에이전트형 비디오 이해는 고정된 그리드를 루프로 대체합니다. 모델은 핵심 추론을 기본 비디오 도구와 결합하여 무엇을 볼지, 어떤 속도로 볼지, 그리고 어떤 양식(시각적 프레임, 오디오 트랙, 또는 대본)으로 검사할지 동적으로 결정할 수 있게 합니다. 파일에서 관련 세그먼트만 로드하고 질문이 실제로 필요로 하는 순간과 신호를 가져오기 위해 내부 도구를 호출한 다음, 가져온 내용에 대해 추론합니다. Google은 이를 이전에 출시한 에이전트형 비전 기능과 동일한 아키텍처 패턴이라고 설명합니다. 모델은 더 이상 미디어의 수동적 소비자가 아니라, 미디어를 도구처럼 질의하는 에이전트입니다.

실질적인 결과는 "모델이 무엇을 보았는가?"라는 질문이 더 이상 샘플링의 운에 좌우되지 않게 된다는 것이다. 찰나의 컷, 거의 보이지 않는 결함, 또는 배경 소음 속에서 말한 단어에 대한 질문은 모델이 답이 존재하는 모달리티에서 더 높은 해상도와 속도로 정확한 윈도우를 다시 스캔할 수 있기 때문에 답할 수 있다.

Generated infographic titled 'Agentic vs static video processing — what changes'. Left column 'Static (before)': 'Fixed 1 FPS frame grid', 'Every frame billable', 'Misses between-frame moments', '2-hour video = millions of tokens'. Right column 'Agentic (now)': 'Model decides what to watch', 'Loads only relevant segments', 'Searches frames + audio + transcript', 'Up to 88% fewer tokens'. Footer: 'All deltas vendor-reported by Google, unreproduced.'

있는 그대로 표시된 숫자들

구글 자체의 에이전트 기반 처리와 정적 처리에 대한 벤치마크 비교가 이번 발표의 핵심이며, 외부 기관이 이를 재현하기 전까지는 공급업체의 주장으로 읽어야 합니다. 자체 내부 테스트 세트에서는:

• 비용 — 모델이 전체 고정 샘플 대신 필요한 세그먼트만 로드하므로 분석 비용이 최대 66%까지 절감됩니다.

• 토큰 — 토큰 소비를 최대 88%까지 줄일 수 있으며, 특히 긴 형식의 비디오에서 절감 효과가 가장 큽니다. 발표에서는 10분 가이드부터 수 시간 분량의 녹화물까지를 구체적으로 언급했습니다.

• 정확성 — 동일한 작업에서 최대 7% 더 우수함, 그 이유는 1초 미만 및 프레임 사이 이벤트가 샘플링 간격에 빠지지 않고 표시되기 때문입니다.

Google은 Gemini 3.7 Flash가 테스트된 모델들 중 "정확도-비용 파레토 프론티어(accuracy-to-cost Pareto frontier)"에 위치한다고 설명한다 — 쉽게 말해, 세 모델 중 달러당 최상의 답변을 제공한다는 뜻이다. 또한 얼리 액세스 파트너 4곳 — Ponder, Revyl, Mosaic, Resemble.AI — 을 언급했는데, 이들은 정식 공개 전부터 이 모드를 기반으로 구축해 왔다. 이는 슬라이드 덱이 아닌 실제 프로덕션 사용을 시사하는 디테일이다. 이 파트너들의 결과 중 어느 것도 공개되지 않았으므로, 신뢰할 수 있는 입장은 다음과 같다: 메커니즘은 실제이며, 방향은 명백히 옳고, 구체적인 수치는 독립적으로 측정되기 전까지는 Google의 주장일 뿐이다.

이 기능이 만들어진 사용 사례

이 발표는 이 기능을 네 가지 범주로 분류하며, 각 범주는 개발자가 출시할 수 있는 구체적인 워크로드에 해당합니다.

• 서브세컨드 순간 검색 — 1 FPS 그리드가 완전히 놓치는 찰나의 상태 변화와 정밀한 컷 경계를 정확히 찾아냅니다. 이는 자동화된 비디오 편집 사용 사례로, 장면 전환이 발생하는 정확한 프레임을 찾는 것입니다.

• 장시간 영상에서 바늘 찾기 검색 — 수백만 개의 토큰을 소모하지 않고 수 시간 분량의 영상에 대한 특정 질문에 답변합니다. 이것은 "이 3시간 통화를 시청하세요"와 "이 3시간 통화에서 고객이 갱신에 동의했나요?"의 차이입니다.

• 이상 탐지 — 모델은 관심 있는 시간 구간을 더 높은 프레임 레이트로 리샘플링하여 빠른 움직임과 미세한 시각적 아티팩트를 검사합니다. 제조 QC, 스포츠 분석, 보안 영상이 가장 명확한 적용 대상입니다.

• 동작 및 객체 세기 — 시간에 따른 반복적 신체 움직임과 개별 객체를 추적하는 방식. 정적 샘플링은 측정 대상이 샘플 속도보다 빠르게 움직일 때 이를 과소 집계한다.

어떤 모델들이 있으며, 가격은 얼마인가요?

이 기능은 Flash 등급에서 제공되며, 세 모델 간의 가격 차이는 이 기능을 어디에 적용할지 선택하는 데 중요합니다:

• Gemini 3.7 Flash — 프로모션 요금 기준 토큰 100만 개당 입력 $0.75, 출력 $3.75이며, 2026년 12월 31일까지 확정되었습니다. 이후에는 $1.50 / $7.50로 두 배가 됩니다. 세 모델 중 정확도 대비 비용 효율성이 가장 뛰어납니다.

Gemini 3.6 Flash — 백만 토큰당 $1.50 / $7.50. 세 가지 중 안정적이고 프로모션이 아닌 옵션입니다.

Gemini 3.5 Flash-Lite — 백만 토큰당 $0.30 / $2.50. 가장 저렴한 토큰이 핵심인 대용량 비디오 선별을 위한 예산형 옵션입니다.

이 기능은 추가 수수료가 없는 표준 Gemini API 토큰 가격을 사용하므로 88%의 토큰 절감이 바로 이 요금에 반영됩니다. 동일한 모델에서 정적으로 분석하는 데 100달러가 들던 워크로드는 에이전트 기반 처리 시 정확성 개선을 고려하기 전에도 대략 12~34달러면 처리될 것입니다. 이것이 현재 긴 비디오를 다시 업로드하거나 프레임 샘플링하며 토큰을 낭비하는 파이프라인을 가진 모든 이에게 진짜 중요한 이야기입니다.

켜는 방법

이 모드는 단일 구성 플래그로 활성화됩니다. 요청에서 processing "agentic"을 전달하면 되며, 표준 API와 동일한 입력 및 가격으로 작동합니다. 별도의 엔드포인트, 새로운 과금 차원, 특별한 할당량이 없습니다. Python 경로는 google-genai SDK의 interactions API를 사용합니다. 예를 들어 모델 "gemini-3.7-flash"와 비디오 및 텍스트 프롬프트를 입력으로 사용할 수 있습니다. 비디오는 호출하는 표면에 따라 직접 업로드, Cloud Storage URI, 공개 HTTP URL, 또는 YouTube URL이 될 수 있습니다.

{{1}}빌드 전에 알아두면 유용한 두 가지 실용적인 제약 사항:{{/1}} {{2}}비디오 파일은 플랫폼의 크기 제한을 받습니다{{/2}} {{3}}(Enterprise Agent Platform 경로에서는 파일당 약 15MB){{/3}} {{4}}그리고 Gemini Enterprise Agent Platform은 일반적인 컨테이너 형식(MP4, MOV, AVI, WebM, WMV, MPEG)을 지원하므로{{/4}} {{5}}형식 변환은 API 호출 전에 이루어지며{{/6}} {{5}}호출 내부에서가 아닙니다.{{/6}}

현재 실행되는 위치와 향후 계획

출시 시점에, {{1}}에이전트형 비디오 이해 기능은 Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform을 통해 비디오 업로드 및 YouTube 비디오에 사용할 수 있습니다{{/1}} — {{2}}즉, 개발자 및 엔터프라이즈를 위한 접점입니다{{/2}}. {{3}}두 가지 소비자 대상 출시가 발표되었지만 아직 제공되지 않았습니다{{/3}}: {{4}}곧 Flash 및 Flash-Lite 모델의 모든 사용자에게 이 기능이 제공될 Gemini 앱{{/4}}, 그리고 {{5}}Google이 향후 몇 달 내에 출시될 것이라고 밝힌 비디오 시청 페이지의 YouTube "Ask YouTube" 기능{{/5}}. {{6}}이 기능을 평가하려는 개발자라면, 오늘 제대로 테스트할 수 있는 곳은 API입니다{{/6}}; {{7}}소비자용 접점은 이 용어를 보편화할 유통 전략입니다{{/7}}.

주목할 만한 생태계 신호도 있습니다. 이 기능이 표준 API 모드로 제공되기 때문에, Gemini 비디오 이해를 래핑하는 MCP 서버 및 에이전트 프레임워크 프로젝트들 — 회의 분석용 GenV 프레임워크, 비디오 연구 MCP 패키지, 지난 몇 달간 등장한 Gemini 비디오 스킬들 — 은 아키텍처를 변경하지 않고도 이를 채택할 수 있습니다. 비용 하락을 가능하게 하는 것은 새 SDK가 아니라 모드 업그레이드입니다.

퍼센트를 믿기 전에 확인해야 할 것

발표의 모든 수치 — 66%, 88%, 7%, 파레토 프론티어 주장 — 는 Google 자체의 것이며, Google 자체 테스트 세트에서 측정되었고, 그 어느 것도 회사 외부에서 재현되지 않았습니다. 방향성은 의심의 여지가 없습니다: 관련 세그먼트만 로드하는 에이전틱 루프는 모든 것을 로드하는 고정 그리드를 이길 수밖에 없습니다. 규모는 미해결 질문이며, 작업 부하에 따라 달라질 것입니다. 단일 질문이 있는 2분 클립은 건너뛸 것이 많지 않으므로 88%의 토큰 절감을 보지 못할 것입니다; 목표 질문이 하나 있는 3시간 통화는 그럴 것입니다. 올바른 테스트는 자신의 롱폼 비디오를 동일한 모델에서 정적 처리로 한 번, 에이전틱 처리로 한 번 실행하여 실제 토큰과 실제 비용을 계산하는 것입니다.

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

그 테스트의 경제성은 바로 라우팅 레이어가 제 역할을 하는 지점입니다. {{1}}Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite — 이 기능이 적용되는 세 가지 모델 중 두 가지 — {{/1}}{{2}}는 OrcaRouter에서 Google 정가에 0% 마크업으로 제공되므로, 동영상 분석 가격 인하는 Google에 적용되는 당일에 우리 쪽에서도 동일하게 적용됩니다. 세 번째이자 가장 최신 모델인 Gemini 3.7 Flash는 Google 자체 API와 여러 타사 플랫폼을 통해 사용할 수 있습니다.{{/2}} 그리고 에이전틱 동영상 이해는 실제 환경에서의 차이가 검증되지 않은 막 출시된 기능이므로, 이는 {{3}}자동 장애 조치의 전형적인 사례입니다: 동영상 트래픽의 일부를 에이전틱 모드로 보내고, 오류, 속도 제한, 또는 명백한 품질 저하가 발생하면 라우터가 검증된 모델로 폴백하도록 하며, 새 모드가 트래픽을 받을 만한 성과를 낼 때까지 기본 경로를 계속 유지하는 것입니다.{{/3}}

Screenshot of the OrcaRouter model page for google/gemini-3.6-flash showing a 1M-token context window, $1.50 per 1M input and $7.50 per 1M output tokens, and Vision/Audio/Video/Tools/Reasoning capability chips.

이번 변화는 단순한 기능 추가 그 이상이다. 비디오는 지난 {{1}}2년{{/1}} 동안 어색한 멀티모달 입력이었다 — 표현력은 엄청나지만 분석 비용도 엄청나게 비싸고, 사실상 샘플링 손실을 감수한 채 읽혀 왔다. 에이전틱 비디오 이해는 {{2}}Google의 첫 번째 진지한 답{{/2}}으로, 세 가지 문제를 한 번에 해결하며 플래그십이 아닌 모델 라인의 최저 등급에 탑재된다. {{3}}토큰 비용{{/3}} 때문에 비디오 워크로드를 피해 왔던 팀이라면, 오늘 이 모드로 계산을 다시 해볼 만하다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube