Kartu hero yang dihasilkan untuk 'Gemini 3.8 Live vs Gemini 3.8 TTS' di atas latar belakang putih dengan aksen gradien biru dan sian yang lembut. Kolom kiri berjudul 'Dirilis pada Live API' mencantumkan 'gemini-3.8-live', 'mendengar dan berbicara', 'audio masuk, audio keluar'; kolom kanan berjudul 'Dirilis pada endpoint TTS' mencantumkan 'gemini-3.8-flash-tts', 'membaca teks tertulis', 'teks masuk, audio keluar'. Baris footer berbunyi 'Tidak satu pun disebut Gemini 3.8 TTS.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS: Lingkaran Percakapan dan Suara Pembaca Berbagi Nama Generasi

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Gemini 3.8 Live adalah model speech-to-speech yang dirilis pada 15 September 2026 sebagai gemini-3.8-live dan gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" bukan model sama sekali — istilah payung yang dipakai liputan peluncuran, termasuk judul postingan Google sendiri, untuk sepasang endpoint text-to-speech yang hadir pada 23 September 2026 sebagai gemini-3.8-flash-tts dan gemini-3.8-flash-lite-tts. Jadi ini bukan halaman versus biasa, tempat dua produk memperebutkan satu pekerjaan. Ini adalah halaman tentang dua pekerjaan yang berbagi nomor generasi, dan tentang kesalahan spesifik yang dilakukan orang ketika menganggap kata "Live" dan "TTS" sebagai dua varian dari hal yang sama.

Fork yang disembunyikan oleh nomor generasi bersama

Dokumentasi pembuatan ucapan Google menetapkan garis pemisahnya sendiri, dan kalimat itu mudah terlewat saat dibaca sekilas: "Kemampuan TTS berbeda dari pembuatan ucapan yang disediakan melalui Live API." Bagian yang sama menjelaskan alasannya, dan alasannya bersifat struktural, bukan soal kualitas. Live API dibangun untuk "audio interaktif dan tidak terstruktur, serta input dan output multimodal." TTS melalui API Gemini "dirancang untuk skenario yang memerlukan pembacaan teks secara persis dengan kontrol yang terperinci." Catatan selanjutnya menegaskan bentuk inputnya secara eksplisit: model TTS hanya menerima teks dan hanya mengembalikan audio.

Batasan tunggal itu — teks masuk, audio keluar, tanpa input audio — adalah inti dari seluruh perbandingan ini. Model Gemini 3.8 Live mendengar orang yang berbicara kepadanya. Model Gemini 3.8 Flash TTS atau Flash-Lite TTS tidak pernah mendengar siapa pun; ia membaca sebuah string dan menyuarakannya. Semua hal lainnya mengikuti dari sana: tolok ukur yang ada untuk yang satu menjadi tidak berarti bagi yang lain, penetapan harganya diukur dengan unit yang berbeda, dan mode kegagalannya sama sekali tidak dapat dibandingkan.

Ini penting karena kedua kasus penggunaan tersebut terlihat identik dari luar. Agen suara dan alur narasi sama-sama berakhir menghasilkan ucapan yang terdengar seperti manusia. Hanya salah satunya yang dapat diinterupsi.

Ke mana "Gemini 3.8 TTS" sebenarnya mengarah

Buka tabel model yang didukung untuk pembuatan ucapan Gemini API dan Anda akan menemukan empat entri TTS dan tidak ada entri bernama Gemini 3.8 TTS. Dua di antaranya adalah generasi ini: Gemini 3.8 Flash TTS, ID model gemini-3.8-flash-tts, dengan 130 bahasa, dan Gemini 3.8 Flash-Lite TTS, ID model gemini-3.8-flash-lite-tts, dengan 101 bahasa. Dua lainnya — Gemini 3.1 Flash TTS Preview dan Gemini 2.5 Pro Preview TTS — adalah generasi pratinjau yang digantikan oleh Flash-Lite.

Jadi ketika seseorang menyebut "Gemini 3.8 TTS", mereka biasanya mengacu pada Flash, karena itulah yang diunggulkan dalam postingan peluncuran dan yang menempati peringkat tertinggi di papan AI. Ketika mereka mengatakannya tentang agen suara langsung, mereka tidak menunjuk pada apa pun, karena hal yang mereka inginkan ada di endpoint yang berbeda dengan nama yang berbeda dan kontrak yang berbeda.

Ada benturan ketiga yang layak disebut, karena menghasilkan saran terburuk. Gemini 3.8 Live bukan model text-to-speech dengan fitur tambahan. Ini adalah model speech-to-speech, dan alasan biayanya lebih mahal per unit adalah karena ia melakukan lebih banyak pekerjaan per unit: mendengarkan, bernalar di tengah ucapan, menangani interupsi, dan dalam varian Extended Thinking, menimbang-nimbang sebelum menjawab.

Satu-satunya angka yang benar-benar bisa dibandingkan

Skor kualitas tidak dapat dialihkan antara kedua keluarga ini; tidak ada satu papan skor pun yang menilai narator dan pembicara percakapan pada sumbu yang sama. Uang memang bisa dialihkan, begitu Anda memilih satuannya secara jujur, dan satuan yang jujur untuk apa pun yang berkaitan dengan suara adalah jam audio.

• Dihitung masuk — Gemini 3.8 Live menagih per menit audio, $0.005 per menit masuk dan $0.018 per menit keluar vs Gemini 3.8 Flash TTS menagih per juta token audio, $9.00 hingga 31 Desember 2026 dan $18.00 setelahnya
• Dihitung keluar — audio dua arah Gemini 3.8 Live berjalan sekitar $1.38 untuk satu jam input dan output simultan pada harga list, sebelum caching prompt apa pun vs Gemini 3.8 Flash TTS adalah aliran satu arah, dan satu juta karakter narasi yang telah selesai mencapai $16.5 menurut normalisasi Artificial Analysis
• Input teks — Gemini 3.8 Live menagih teks dan audio pada baris terpisah, $0.75 per juta token teks masuk dan $4.50 keluar vs endpoint TTS menagih input teks sebesar $0.50 per juta token
• Tingkat Flash-Lite — Gemini 3.8 Live tidak memiliki varian yang lebih murah; pilihannya adalah Live atau Extended Thinking vs Gemini 3.8 Flash-Lite TTS mencantumkan harga $6.00 lalu $12.00 per juta token audio, dengan Artificial Analysis pada $11.0 per juta karakter
• Bentuk input — Gemini 3.8 Live audio, video, dan teks masuk, audio keluar vs endpoint TTS teks masuk, audio keluar

Angka Live adalah perhitungan aritmetika kami dari tarif per menit yang dipublikasikan Google, bukan angka per jam yang dipublikasikan Google. Angka karakter tersebut merupakan normalisasi Artificial Analysis dan itulah yang harus dikutip ketika Anda membandingkan tier sintesis. Perhatikan bahwa papan Speech to Speech milik Artificial Analysis sendiri memuat kolom biaya per jam input audio yang terpisah untuk model Live — sekitar $3,50 untuk Gemini 3.8 Live dan $0,84 untuk varian Extended Thinking — yang merupakan normalisasi berbeda lagi dan tidak boleh disejajarkan dengan kartu tarif per menit seolah-olah keduanya adalah pengukuran yang sama.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Apa yang rusak saat Anda memilih yang salah

Mode-mode kegagalannya bersifat mendidik karena begitu berbeda satu sama lain.

Memanggil endpoint TTS ketika Anda membutuhkan loop percakapan dan tidak ada yang error. Permintaan itu mengembalikan audio yang valid. Anda mendapatkan respons yang fasih dan terbaca baik untuk string tetap, lalu keheningan — karena memang tidak pernah ada apa pun yang mendengarkan. Tim menemukan ini saat mereka membuat uji barge-in pertama dan mendapati bahwa "pengguna" harus menunggu klip penuh selesai sebelum giliran berikutnya dapat dimulai. Menambahkan percakapan secara retroaktif ke endpoint sintesis berarti menambahkan pengenalan ucapan, kebijakan pengambilan giliran, dan mekanisme interupsi di sekitarnya; pada titik itu Anda telah membangun ulang sebuah cascade dan Anda membayar dua model alih-alih satu.

Panggil endpoint Live saat Anda hanya membutuhkan narasi, dan Anda membayar untuk kemampuan yang tidak Anda gunakan. Model Live diukur pemakaiannya di kedua arah, karena ia mengharapkan kedua arah. Untuk buku audio atau sulih suara video pelatihan, sisi masukannya adalah naskah yang tidak pernah berubah dan model tidak perlu mendengar apa pun. Anda membeli loop percakapan untuk membacakan dokumen dengan suara keras.

Satu-satunya kasus ketika pilihan itu benar-benar sulit adalah kaskade: pengenalan, lalu penalaran, lalu sintesis. Arsitektur itu belum usang, dan bagi banyak sistem produksi arsitektur itu masih yang tepat, karena memungkinkan Anda menukar setiap tahap secara independen dan memilih vendor yang berbeda untuk masing-masing. Ini mengorbankan latensi dan mengorbankan prosodi yang dipertahankan model end-to-end tunggal di seluruh batas giliran. Trade-off itu nyata di kedua arah.

Jika rute sudah ada

OrcaRouter tidak menyediakan endpoint Gemini 3.8 Live atau endpoint TTS 3.8, dan itu patut dikatakan sebelum hal lain tentang perutean, karena kebalikannya mudah diasumsikan dari katalog seluas ini. Yang ada di katalog ini adalah sisanya dari keluarga — google/gemini-3.8-flash di antara 28 model Goog​le dan lebih dari 200 model secara keseluruhan, dari satu kunci dengan harga daftar penyedia tanpa markup.

Hal itu khususnya penting untuk kaskade. Jika arsitektur Anda adalah pengenalan, lalu penalaran, lalu sintesis, tahap penalaran adalah tahap di mana satu kunci di banyak vendor membuahkan hasil, karena itulah tahap yang paling sering Anda ganti dan tahap di mana pemotongan harga vendor harus sampai ke tagihan Anda pada hari yang sama, bukan pada perpanjangan kontrak berikutnya. Ini juga tahap di mana failover otomatis terbukti bermanfaat: sebuah kaskade memiliki tiga titik yang bisa gagal, dan titik tengahnya adalah yang paling murah untuk dibuat redundan.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Aturan keputusan singkat

Jika model harus merespons sesuatu yang belum tersedia sebagai teks, Anda memerlukan Gemini 3.8 Live, dan Anda harus menganggarkan berdasarkan tarif audio per menit Goog​le serta bersiap mempertimbangkan varian mana dari kedua varian tersebut yang Anda butuhkan. Jika teksnya sudah tertulis dan tugasnya adalah membawakannya, Anda memerlukan Gemini 3.8 Flash TTS atau Flash-Lite TTS, dan Anda harus menganggarkan per juta karakter serta memilih tier berdasarkan cakupan bahasa dan apakah selisih kualitas sebanding dengan selisih harganya.

Dan jika Anda diminta membandingkan "Gemini 3.8 Live dan Gemini 3.8 TTS" seolah-olah keduanya adalah dua produk, hal pertama yang berguna untuk Anda lakukan adalah menanyakan endpoint yang mana. Nama dalam brief itu tidak merujuk ke satu endpoint tertentu, dan jawabannya mengubah arsitektur, bukan sekadar tagihan.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.