
Gemini Agentic Video Understanding Telah Hadir: Mode API yang Memangkas Biaya Analisis Video sebesar Dua Pertiga
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0259Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0258Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0166Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
Pada tanggal 1 September 2026, Google memperkenalkan pemahaman video yang bersifat agen untuk Gemini 3.7 Flash, Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite — sebuah mode baru dalam API Gemini yang berhenti memperlakukan video sebagai tumpukan bingkai dan mulai memperlakukannya sebagai dokumen yang dapat dicari. Pengumuman Google DeepMind, yang ditulis oleh manajer produk senior Rohan Doshi dan direktur riset Mario Lučić, adalah perubahan besar pertama dalam cara Gemini membaca video sejak model-model tersebut pertama kali menerima masukan video: alih-alih model diam-diam memproses sampel bingkai tetap, model kini memutuskan, saat menjawab, apa yang harus dilihat, dengan kecepatan berapa, dan melalui saluran mana di antara tiga saluran — bingkai visual, audio, atau transkrip. Efek utamanya, yang semuanya dilaporkan oleh vendor dan belum ada satu pun yang direproduksi secara independen, adalah bahwa analisis video menjadi hingga 66% lebih murah, menghabiskan hingga 88% lebih sedikit token, dan memberikan jawaban hingga 7% lebih akurat dibandingkan dengan garis dasar bingkai-per-bingkai yang digantikannya.
Apa yang sebenarnya diubah oleh "agentic" di balik layar?
Perilaku lama inilah yang sekarang disebut Google sebagai pemrosesan "statis": Anda memasukkan video ke Gemini, lalu sistem mengambil sampel frame pada kecepatan tetap — nilai awalnya satu frame per detik — menjalankan seluruh sampel tersebut melalui model, dan menjawab berdasarkan apa pun yang terekam oleh kisi tetap itu. Hal ini memiliki dua titik buta struktural. Perubahan status yang terjadi di antara dua frame sampel benar-benar tidak ada bagi model. Dan video berdurasi dua jam yang diambil sampelnya pada 1 FPS menghabiskan token yang sangat banyak, sebagian besar terpakai untuk rekaman yang sama sekali tidak berkaitan dengan pertanyaan.
Pemahaman video agenfik menggantikan kisi tetap dengan sebuah putaran. Model tersebut memasangkan penalaran intinya dengan alat video asli yang memungkinkannya secara dinamis memutuskan apa yang akan ditonton, pada kecepatan berapa untuk menontonnya, dan melalui modalitas apa untuk memeriksanya — bingkai visual, trek audio, atau transkrip. Model itu memanggil alat internal untuk memuat hanya segmen yang relevan dari file, mengambil momen dan sinyal yang benar-benar dibutuhkan pertanyaan, lalu menalar atas apa yang ditariknya. Google menggambarkannya sebagai pola arsitektural yang sama dengan fitur visi agenfik yang dirilisnya sebelumnya: model tersebut bukan lagi konsumen pasif media; ia adalah agen yang menanyai media seperti sebuah alat.
Konsekuensi praktisnya adalah bahwa "apa yang dilihat model?" bukan lagi sekadar masalah keberuntungan pengambilan sampel. Pertanyaan tentang potongan sesaat, cacat yang hampir tidak terlihat, atau kata yang diucapkan di tengah kebisingan latar dapat dijawab karena model dapat memindai ulang jendela yang sama pada resolusi dan kecepatan yang lebih tinggi, dalam modalitas tempat jawaban itu berada.

Angka-angka, diberi label sebagaimana adanya.
Perbandingan tolok ukur Google sendiri antara pemrosesan agenik versus statis adalah inti dari pengumuman tersebut, dan hal itu harus dibaca sebagai klaim vendor sampai ada pihak luar yang mereplikasinya. Pada set pengujian internalnya:
• Biaya — biaya analisis hingga 66% lebih rendah, karena model hanya memuat segmen yang dibutuhkannya, bukan seluruh sampel tetap.
• Token — konsumsi token hingga 88% lebih rendah, dengan penghematan terbesar pada video berdurasi panjang: pengumuman tersebut secara khusus menyoroti panduan 10 menit hingga rekaman berjam-jam.
• Akurasi — hingga 7% lebih baik pada tugas yang sama, karena peristiwa sub-detik dan antar-frame menjadi terlihat alih-alih jatuh di celah pengambilan sampel.
Google memposisikan Gemini 3.7 Flash sebagai model yang berada pada 'frontier Pareto akurasi-ke-biaya' dari model-model yang diuji — secara sederhana, jawaban terbaik per dolar di antara ketiganya. Google juga menyebut empat mitra akses awal — Ponder, Revyl, Mosaic, dan Resemble.AI — yang telah membangun mode ini sebelum ketersediaan umum, detail yang mengindikasikan penggunaan produksi nyata, bukan sekadar slide presentasi. Hasil para mitra tersebut belum dipublikasikan, sehingga sikap yang kredibel adalah: mekanismenya nyata, arahnya jelas benar, dan persentase spesifiknya adalah klaim Google sampai diukur secara independen.
Kasus penggunaan yang menjadi tujuan dibuatnya fitur ini.
Pengumuman tersebut mengelompokkan kapabilitas ke dalam empat kategori, yang masing-masingnya terkait dengan beban kerja konkret yang dapat dikirim oleh pengembang:
• Pengambilan momen sub-detik — menemukan perubahan kondisi sepersekian detik dan batas potongan yang rapat yang sepenuhnya terlewatkan oleh grid 1 FPS. Ini adalah kasus penggunaan penyuntingan video otomatis: menemukan bingkai yang tepat saat perubahan adegan terjadi.
• Pencarian jarum dalam tumpukan jerami untuk konten berdurasi panjang — menjawab pertanyaan spesifik tentang video berjam-jam tanpa menghabiskan jutaan token. Ini adalah perbedaan antara "tonton panggilan 3 jam ini" dan "apakah klien menyetujui perpanjangan dalam panggilan 3 jam ini."
• Deteksi anomali — model menyampel ulang jendela waktu yang menarik pada laju bingkai yang lebih tinggi untuk memeriksa gerakan cepat dan artefak visual yang halus. Kontrol kualitas manufaktur, analisis olahraga, dan rekaman keamanan adalah target yang jelas.
Menghitung tindakan dan objek — melacak gerakan fisik yang berulang dan objek-objek yang berbeda dari waktu ke waktu, yang pengambilan sampel statis kurang menghitung ketika hal yang dihitung bergerak lebih cepat daripada tingkat pengambilan sampel.
Model mana saja, dan berapa biayanya?
Fitur tersebut berjalan pada tingkatan Flash, dan selisih harga di antara ketiga model berperan penting dalam menentukan ke mana fitur itu harus diarahkan:
• Gemini 3.7 Flash — $0.75 masuk / $3.75 keluar per juta token dengan tarif promosi, dikonfirmasi berlaku hingga 31 Desember 2026, setelah itu menjadi dua kali lipat menjadi $1.50 / $7.50. Pemimpin dalam hal akurasi terhadap biaya di antara ketiganya.
• Gemini 3.6 Flash — $1.50 / $7.50 per juta token. Opsi yang stabil dan non-promosi di antara ketiganya.
• Gemini 3.5 Flash-Lite — $0,30 / $2,50 per juta token. Jalur hemat, untuk triase video bervolume tinggi yang mengutamakan token termurah.
Karena fitur ini menggunakan harga token API Gemini standar tanpa biaya tambahan, pengurangan token 88% langsung berlaku pada tarif tersebut. Beban kerja yang membutuhkan biaya $100 untuk dianalisis secara statis seharusnya menghabiskan sekitar $12 hingga $34 di bawah pemrosesan agentik pada model yang sama, sebelum mempertimbangkan peningkatan akurasi — itulah cerita sebenarnya bagi siapa pun yang pipeline-nya saat ini membakar token untuk mengunggah ulang atau melakukan frame-sampling pada video panjang.
Cara menyalakannya
Mode ini diaktifkan dengan satu flag konfigurasi — kirimkan pemrosesan "agentic" dalam permintaan — dan mode ini berfungsi dengan input dan harga yang sama seperti API standar. Tidak ada endpoint terpisah, tidak ada dimensi penagihan baru, tidak ada kuota khusus. Jalur Python menggunakan API interactions dari SDK google-genai, misalnya dengan model "gemini-3.7-flash" serta video dan prompt teks sebagai input; video dapat berupa unggahan langsung, URI Cloud Storage, URL HTTP publik, atau URL YouTube, tergantung pada antarmuka yang Anda panggil.
Dua batasan praktis yang perlu diketahui sebelum Anda membangun: file video tunduk pada batas ukuran platform (pada jalur Enterprise Agent Platform, kira-kira 15 MB per file), dan Gemini Enterprise Agent Platform mendukung format kontainer umum — MP4, MOV, AVI, WebM, WMV, MPEG — sehingga pengelolaan format terjadi sebelum panggilan API, bukan di dalamnya.
Di mana ia berjalan sekarang, dan ke mana ia akan pergi.
Pada peluncurannya, pemahaman video agen tersedia untuk unggahan video dan video YouTube melalui API Gemini di Google AI Studio dan melalui Platform Agen Enterprise Gemini — yaitu area pengembang dan enterprise. Dua peluncuran konsumen telah diumumkan tetapi belum aktif: aplikasi Gemini, yang akan segera digulirkan ke semua pengguna pada model Flash dan Flash-Lite, serta fitur "Ask YouTube" YouTube di halaman tontonan video, yang menurut Google akan hadir dalam beberapa bulan mendatang. Bagi pengembang yang mengevaluasi fitur ini, API adalah tempat yang sebenarnya untuk mengujinya hari ini; permukaan konsumen hanyalah langkah distribusi yang akan menjadikan frasa tersebut lazim.
Ada juga sinyal ekosistem yang perlu diperhatikan: karena kapabilitas ini hadir sebagai mode API standar, proyek MCP-server dan framework agen yang membungkus pemahaman video Gemini — framework GenV untuk analitik rapat, paket MCP riset video, dan skill video Gemini yang muncul selama beberapa bulan terakhir — dapat mengadopsinya tanpa mengubah arsitektur mereka. Upgrade mode, bukan SDK baru, yang membuka penurunan biaya.
Apa yang perlu diverifikasi sebelum Anda memercayai persentase tersebut?
Setiap angka dalam pengumuman tersebut — 66%, 88%, 7%, klaim batas Pareto — adalah angka milik Google sendiri, diukur pada set pengujian Google sendiri, dan tidak satu pun yang telah direproduksi di luar perusahaan. Arahnya tidak diragukan lagi: loop agentik yang hanya memuat segmen yang relevan pasti akan mengungguli grid tetap yang memuat semuanya. Besarannya adalah pertanyaan yang terbuka, dan akan bervariasi tergantung beban kerja — klip 2 menit dengan satu pertanyaan tidak akan melihat penghematan token 88%, karena tidak banyak yang bisa dilewati; panggilan 3 jam dengan satu pertanyaan terarah akan mengalaminya. Tes yang tepat adalah video long-form Anda sendiri, dijalankan sekali dengan pemrosesan statis dan sekali dengan pemrosesan agentik, pada model yang sama, dengan menghitung token nyata dan biaya nyata.

Ekonomi dari pengujian tersebut adalah tempat yang tepat di mana lapisan routing membuktikan nilai gunanya. Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite — dua dari tiga model yang menerapkan fitur ini — disajikan di OrcaRouter pada harga resmi Google yang diteruskan dengan markup 0%, sehingga penurunan harga analisis video langsung berlaku di pihak kami pada hari yang sama saat berlaku di Google; Gemini 3.7 Flash, model ketiga dan terbaru, tersedia melalui API Google sendiri dan beberapa platform pihak ketiga. Dan karena pemahaman video agentic adalah kemampuan yang baru saja dirilis dengan perbedaan dunia nyata yang belum terverifikasi, ini adalah contoh yang tepat untuk failover otomatis: arahkan sebagian lalu lintas video ke mode agentic, biarkan router kembali ke model yang sudah terbukti saat terjadi error, rate limit, atau regresi kualitas yang jelas, dan pertahankan jalur baseline tetap berjalan hingga mode baru tersebut layak mendapatkan lalu lintas.

Perubahan ini lebih dari sekadar penambahan fitur. Video telah menjadi input multimodal yang canggung selama dua tahun — sangat ekspresif, sangat mahal untuk dianalisis, dan secara efektif dibaca dengan kehilangan sampel. Pemahaman video agenik adalah jawaban serius pertama Google untuk ketiga masalah tersebut sekaligus, dan ia hadir di tingkatan termurah dari lini modelnya, bukan di model unggulan. Bagi tim yang selama ini menghindari beban kerja video karena biaya token, mode ini layak untuk menghitung ulang aritmetikanya hari ini.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
