Kartu hero yang dihasilkan untuk 'Gemini 3.8 Live with Live Avatar' di atas latar belakang putih dengan aksen gradien biru dan cyan yang lembut. Tiga kartu bertumpuk bertuliskan '15 Sep 2026 — Gemini 3.8 Live dan 3.8 Live Extended Thinking dirilis di Live API', '24 Sep 2026 — Live Avatar diumumkan, Gemini Enterprise', dan 'Hari ini — avatar adalah kapabilitas enterprise, bukan ID model'. Baris footer berbunyi 'Tanggal menurut Google DeepMind.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Gemini 3.8 Live dengan Live Avatar: Google Memberi Wajah pada Model Suaranya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking dirilis pada 15 September 2026 — dua endpoint dialog langsung native yang dibuka Goog​le pada API vendor, satu dioptimalkan untuk latensi dan satu untuk deliberasi. Pada 24 September, perusahaan mengumumkan Gemini 3.8 Live dengan Live Avatar, yang memasangkan generasi video hampir real-time dengan loop ucapan yang sama sehingga model memiliki wajah saat berbicara. Tidak ada yang berubah pada kedua ID model tersebut. Yang berubah adalah seperti apa percakapan yang diizinkan, dan — yang lebih konsekuensial — apa yang diizinkan dilakukan model terhadap percakapan itu selagi masih berjalan.

Apa yang sebenarnya dikirim pada 24 September

Postingan DeepMind singkat dan spesifik, dan ada baiknya memisahkan apa yang diklaimnya dari apa maknanya. Live Avatar, dalam kata-kata Google sendiri, "menghadirkan kehadiran visual hampir real-time ke AI percakapan Gemini" dengan memadukan pembuatan video real-time dengan stack suara yang ada. Perusahaan ini menjelaskan sinkronisasi bibir yang presisi, ekspresi alami, dan pergantian giliran yang lancar, serta memberikan dua contoh penerapan: layanan pelanggan dan panduan interaktif. Lalu ia menyebutkan kalimat yang paling penting bagi siapa pun yang merencanakan pembangunan — "Mulai hari ini, Gemini 3.8 Live dengan Live Avatar tersedia di Gemini Enterprise."

Itulah keseluruhan cerita ketersediaannya. Live Avatar bukan ID model Gemini API. Daftar model audio API masih memuat gemini-3.8-live dan gemini-3.8-live-extended-thinking dan tidak ada baris avatar, dan kartu tarif tidak memuat item baris avatar. Fitur ini hadir di dalam Gemini Enterprise, yang berarti audiens untuk pengumuman ini adalah pembeli enterprise dan pengembang yang melakukan integrasi atas nama mereka, bukan pengembang individu yang memanggil Live API dengan kunci hari ini.

Dua klaim dalam postingan itu layak dikutip secara persis, karena keduanya lebih kuat daripada bahasa peluncuran yang biasa. Yang pertama: Live Avatar "memiliki sinkronisasi ucapan-ke-ucapan multibahasa native" dan "dapat bertransisi secara mulus di 97 bahasa tanpa menurunkan fidelitas video atau menimbulkan pergeseran visual." Angka 97 adalah jumlah bahasa yang sama dengan yang diklaim peluncuran 15 September untuk model dialog langsung yang mendasarinya, jadi ini adalah klaim multibahasa yang sudah ada yang dinyatakan ulang dengan batasan baru yang dilekatkan — sinkronisasi bibir dan animasi wajah harus tetap mengikuti saat bahasa berubah di tengah kalimat. Yang kedua: semua output diberi tanda air dengan SynthID, "ditenun langsung ke dalam output audio dan video." Kedua trek, bukan hanya suaranya.

Kemampuan yang benar-benar baru adalah yang ada di tengah.

Jika Anda membaca lebih jauh dari visualnya, paragraf yang paling menarik adalah tentang pemanggilan alat. Google mengatakan Live Avatar didukung oleh "pemanggilan alat asinkron" yang dapat "memicu pemanggilan alat dan mengambil data di latar belakang sambil melanjutkan dialog aktif, menangani tugas-tugas kompleks sekaligus memastikan alur percakapan yang tidak terputus." Contoh yang diuraikan adalah check-in tamu hotel, di mana model memanggil alat di latar belakang dan terus berbicara.

Itu adalah perbedaan arsitektural yang nyata dari bentuk permintaan-respons yang menjadi landasan sebagian besar integrasi suara, dan itulah bagian yang memiliki biaya yang menyertainya. Eksekusi asinkron berarti model melakukan pekerjaan yang tidak ditunjukkan oleh transkrip. Dalam pipeline teks, Anda akan melihat pemanggilan alat sebagai satu giliran. Di sini, hal itu terjadi di balik percakapan yang masih berlangsung, yang memunculkan pertanyaan yang sama seperti yang ditimbulkan oleh eksekusi bersamaan mana pun: apa yang terjadi jika pemanggilan alat gagal secara senyap di tengah kalimat, dan bagaimana pemanggilnya mengetahuinya? Postingan Google tidak menyebutkannya, dan kartu model adalah tempat untuk mencarinya. Anggap klaim "alur percakapan tanpa gangguan" sebagai dilaporkan vendor dan belum diuji oleh pihak ketiga mana pun yang dapat kami temukan.

Avatar preset, dan daftar izin yang membatasi separuh yang menarik

Soal kustomisasi ini memiliki dua tingkatan dan hanya satu di antaranya yang tersedia secara umum. Setiap penerapan perusahaan mendapatkan "pustaka avatar prasetel yang beragam." Avatar kustom — yang dihasilkan "dari gambar referensi berkualitas tinggi" sekaligus "mempertahankan kemiripan referensi, gaya merek, atau identitas karakter" — berada di balik pembatasan, dan Google menyatakannya secara gamblang: "Pembuatan avatar kustom saat ini hanya tersedia melalui allowlisting perusahaan."

Jadi, kemampuan yang sebenarnya paling diinginkan sebagian besar tim, kemampuan yang memungkinkan avatar cocok dengan merek atau karakter bernama, adalah kemampuan yang tidak bisa Anda layani sendiri. Jika rencana Anda bergantung pada presenter sintetis yang tampak seperti maskot Anda, Anda sedang menunggu keputusan allowlist, bukan perilisan model. Itu fakta pengadaan, bukan fakta teknis, dan hal semacam itu adalah hal yang diam-diam membuat jadwal mundur satu kuartal.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

Di mana posisinya relatif terhadap bagian lain dari baris tersebut

Live Avatar tidak hadir ke dalam keluarga produk yang kosong, dan posisi yang ditempatinya paling mudah dilihat jika dibandingkan dengan saudara-saudaranya yang dirilis pada dua minggu yang sama.

• Dirilis sebagai — Gemini 3.8 Live dengan Live Avatar adalah kemampuan perusahaan di dalam Gemini Enterprise vs Gemini 3.8 Live dan Gemini 3.8 Live Extended Thinking adalah endpoint API Gemini dengan ID model dan tarif per menit yang dipublikasikan
• Dapat dipanggil oleh developer — Live Avatar tidak, tidak ada ID model dan tidak ada baris kartu tarif vs dua endpoint Live ya, gemini-3.8-live dan gemini-3.8-live-extended-thinking
• Output — Live Avatar audio plus video tersinkronisasi vs endpoint Live hanya audio
• Klaim bahasa — Live Avatar 97 bahasa dengan lip-sync dan kontinuitas ekspresi vs endpoint Live 97 bahasa dengan peralihan otomatis di tengah percakapan
• Watermark — Live Avatar SynthID pada trek audio dan video vs endpoint Live SynthID pada audio yang dihasilkan

Dua endpoint Live itu sendiri adalah pasangan yang terdokumentasi dengan baik. Pengukuran independen menunjukkan keduanya berjauhan pada beberapa dimensi dan berdekatan pada dimensi lain: pada Artificial Analysis Speech to Speech Index, Gemini 3.8 Live Extended Thinking (High) berada di 82,6 versus Gemini 3.8 Live di 76,0, sebuah celah yang sebagian besar dibangun dari kualitas penalaran alih-alih dinamika percakapan, di mana urutannya justru terbalik. Angka Google sendiri menempatkan keduanya pada 68,6% dan 30,1% untuk penyelesaian tugas τ-Voice serta 98% dan 92% pada Big Bench Audio. Live Avatar mewarisi mana pun dari keduanya yang Anda panggil di bawahnya, dan juga mewarisi harganya, karena avatar adalah lapisan presentasi di atas alur percakapan yang sama.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

Apa yang tidak diubah oleh ini

Ini tidak membuat model menjadi lebih baik. Live Avatar adalah lapisan presentasi dan orkestrasi: angka kualitas untuk Gemini 3.8 Live sama seperti pada 15 September, dan siapa pun yang membutuhkan varian yang lebih kuat di antara kedua varian tersebut masih harus memilih Extended Thinking dan menerima latensinya. Ini tidak menempatkan video di API. Dan ini tidak mengubah harga untuk berbicara dengan model, yang masih ditagih berdasarkan tarif audio per menit Live API — $0,005 per menit audio masuk dan $0,018 per menit audio keluar — dengan pembuatan video avatar tidak dipublikasikan harganya karena tidak dijual secara terpisah.

Yang berubah adalah kumpulan produk yang dapat dibangun tanpa lapisan rendering terpisah. Agen dukungan yang sebelumnya berbicara lalu meninggalkan panel kosong di layar kini dapat menampilkan wajah selama bekerja, dan pekerjaan yang dilakukannya di latar belakang tidak lagi terlihat sebagai waktu kosong. Itu adalah perubahan yang berarti pada bentuk antarmuka dan perubahan yang sederhana pada model yang mendasarinya. Keduanya bisa benar pada saat yang bersamaan.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

Yang perlu diperhatikan, dan satu catatan routing

Tiga hal akan mengubah ini dari sebuah pengumuman menjadi keputusan untuk membangun. Allowlisting avatar kustom harus dibuka, karena avatar preset hanyalah demo dan avatar kustom adalah produk. Track video harus diberi harga, karena tidak ada yang bisa memodelkan ekonomi unit pada output yang belum diberi harga. Dan endpoint avatar harus muncul di daftar model API, karena itulah perbedaan antara fitur enterprise dan sesuatu yang bisa dipanggil pengembang malam ini.

Di sisi kami, ada satu hal yang perlu dinyatakan secara tepat, karena mudah untuk berasumsi sebaliknya: OrcaRouter tidak merutekan endpoint Gemini 3.8 Live atau Live Avatar, dan tidak ada apa pun di sini yang boleh dibaca sebagai klaim bahwa ia melakukannya. Yang kami bawa adalah sisa lini 3.8 Goog​le — google/gemini-3.8-flash di antaranya — bersama katalog lebih dari 200 model dari satu kunci dengan harga daftar penyedia tanpa markup. Jika Live Avatar mengarahkan arsitektur Anda ke agen yang harus menalar tentang apa yang dikatakan pelanggan, bagian penalaran dari tumpukan itu adalah bagian yang dapat Anda konsolidasikan hari ini.