
Gemini 3.8 Live vs Gemini 3.8 TTS: Lingkaran Percakapan dan Suara Pembaca Berbagi Nama Generasi
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 181 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Gemini 3.8 Live adalah model speech-to-speech yang dirilis pada 15 September 2026 sebagai gemini-3.8-live dan gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" bukan model sama sekali — istilah payung yang dipakai liputan peluncuran, termasuk judul postingan Google sendiri, untuk sepasang endpoint text-to-speech yang hadir pada 23 September 2026 sebagai gemini-3.8-flash-tts dan gemini-3.8-flash-lite-tts. Jadi ini bukan halaman versus biasa, tempat dua produk memperebutkan satu pekerjaan. Ini adalah halaman tentang dua pekerjaan yang berbagi nomor generasi, dan tentang kesalahan spesifik yang dilakukan orang ketika menganggap kata "Live" dan "TTS" sebagai dua varian dari hal yang sama.
Fork yang disembunyikan oleh nomor generasi bersama
Dokumentasi pembuatan ucapan Google menetapkan garis pemisahnya sendiri, dan kalimat itu mudah terlewat saat dibaca sekilas: "Kemampuan TTS berbeda dari pembuatan ucapan yang disediakan melalui Live API." Bagian yang sama menjelaskan alasannya, dan alasannya bersifat struktural, bukan soal kualitas. Live API dibangun untuk "audio interaktif dan tidak terstruktur, serta input dan output multimodal." TTS melalui API Gemini "dirancang untuk skenario yang memerlukan pembacaan teks secara persis dengan kontrol yang terperinci." Catatan selanjutnya menegaskan bentuk inputnya secara eksplisit: model TTS hanya menerima teks dan hanya mengembalikan audio.
Batasan tunggal itu — teks masuk, audio keluar, tanpa input audio — adalah inti dari seluruh perbandingan ini. Model Gemini 3.8 Live mendengar orang yang berbicara kepadanya. Model Gemini 3.8 Flash TTS atau Flash-Lite TTS tidak pernah mendengar siapa pun; ia membaca sebuah string dan menyuarakannya. Semua hal lainnya mengikuti dari sana: tolok ukur yang ada untuk yang satu menjadi tidak berarti bagi yang lain, penetapan harganya diukur dengan unit yang berbeda, dan mode kegagalannya sama sekali tidak dapat dibandingkan.
Ini penting karena kedua kasus penggunaan tersebut terlihat identik dari luar. Agen suara dan alur narasi sama-sama berakhir menghasilkan ucapan yang terdengar seperti manusia. Hanya salah satunya yang dapat diinterupsi.
Ke mana "Gemini 3.8 TTS" sebenarnya mengarah
Buka tabel model yang didukung untuk pembuatan ucapan Gemini API dan Anda akan menemukan empat entri TTS dan tidak ada entri bernama Gemini 3.8 TTS. Dua di antaranya adalah generasi ini: Gemini 3.8 Flash TTS, ID model gemini-3.8-flash-tts, dengan 130 bahasa, dan Gemini 3.8 Flash-Lite TTS, ID model gemini-3.8-flash-lite-tts, dengan 101 bahasa. Dua lainnya — Gemini 3.1 Flash TTS Preview dan Gemini 2.5 Pro Preview TTS — adalah generasi pratinjau yang digantikan oleh Flash-Lite.
Jadi ketika seseorang menyebut "Gemini 3.8 TTS", mereka biasanya mengacu pada Flash, karena itulah yang diunggulkan dalam postingan peluncuran dan yang menempati peringkat tertinggi di papan AI. Ketika mereka mengatakannya tentang agen suara langsung, mereka tidak menunjuk pada apa pun, karena hal yang mereka inginkan ada di endpoint yang berbeda dengan nama yang berbeda dan kontrak yang berbeda.
Ada benturan ketiga yang layak disebut, karena menghasilkan saran terburuk. Gemini 3.8 Live bukan model text-to-speech dengan fitur tambahan. Ini adalah model speech-to-speech, dan alasan biayanya lebih mahal per unit adalah karena ia melakukan lebih banyak pekerjaan per unit: mendengarkan, bernalar di tengah ucapan, menangani interupsi, dan dalam varian Extended Thinking, menimbang-nimbang sebelum menjawab.
Satu-satunya angka yang benar-benar bisa dibandingkan
Skor kualitas tidak dapat dialihkan antara kedua keluarga ini; tidak ada satu papan skor pun yang menilai narator dan pembicara percakapan pada sumbu yang sama. Uang memang bisa dialihkan, begitu Anda memilih satuannya secara jujur, dan satuan yang jujur untuk apa pun yang berkaitan dengan suara adalah jam audio.
• Dihitung masuk — Gemini 3.8 Live menagih per menit audio, $0.005 per menit masuk dan $0.018 per menit keluar vs Gemini 3.8 Flash TTS menagih per juta token audio, $9.00 hingga 31 Desember 2026 dan $18.00 setelahnya
• Dihitung keluar — audio dua arah Gemini 3.8 Live berjalan sekitar $1.38 untuk satu jam input dan output simultan pada harga list, sebelum caching prompt apa pun vs Gemini 3.8 Flash TTS adalah aliran satu arah, dan satu juta karakter narasi yang telah selesai mencapai $16.5 menurut normalisasi Artificial Analysis
• Input teks — Gemini 3.8 Live menagih teks dan audio pada baris terpisah, $0.75 per juta token teks masuk dan $4.50 keluar vs endpoint TTS menagih input teks sebesar $0.50 per juta token
• Tingkat Flash-Lite — Gemini 3.8 Live tidak memiliki varian yang lebih murah; pilihannya adalah Live atau Extended Thinking vs Gemini 3.8 Flash-Lite TTS mencantumkan harga $6.00 lalu $12.00 per juta token audio, dengan Artificial Analysis pada $11.0 per juta karakter
• Bentuk input — Gemini 3.8 Live audio, video, dan teks masuk, audio keluar vs endpoint TTS teks masuk, audio keluar
Angka Live adalah perhitungan aritmetika kami dari tarif per menit yang dipublikasikan Google, bukan angka per jam yang dipublikasikan Google. Angka karakter tersebut merupakan normalisasi Artificial Analysis dan itulah yang harus dikutip ketika Anda membandingkan tier sintesis. Perhatikan bahwa papan Speech to Speech milik Artificial Analysis sendiri memuat kolom biaya per jam input audio yang terpisah untuk model Live — sekitar $3,50 untuk Gemini 3.8 Live dan $0,84 untuk varian Extended Thinking — yang merupakan normalisasi berbeda lagi dan tidak boleh disejajarkan dengan kartu tarif per menit seolah-olah keduanya adalah pengukuran yang sama.

Apa yang rusak saat Anda memilih yang salah
Mode-mode kegagalannya bersifat mendidik karena begitu berbeda satu sama lain.
Memanggil endpoint TTS ketika Anda membutuhkan loop percakapan dan tidak ada yang error. Permintaan itu mengembalikan audio yang valid. Anda mendapatkan respons yang fasih dan terbaca baik untuk string tetap, lalu keheningan — karena memang tidak pernah ada apa pun yang mendengarkan. Tim menemukan ini saat mereka membuat uji barge-in pertama dan mendapati bahwa "pengguna" harus menunggu klip penuh selesai sebelum giliran berikutnya dapat dimulai. Menambahkan percakapan secara retroaktif ke endpoint sintesis berarti menambahkan pengenalan ucapan, kebijakan pengambilan giliran, dan mekanisme interupsi di sekitarnya; pada titik itu Anda telah membangun ulang sebuah cascade dan Anda membayar dua model alih-alih satu.
Panggil endpoint Live saat Anda hanya membutuhkan narasi, dan Anda membayar untuk kemampuan yang tidak Anda gunakan. Model Live diukur pemakaiannya di kedua arah, karena ia mengharapkan kedua arah. Untuk buku audio atau sulih suara video pelatihan, sisi masukannya adalah naskah yang tidak pernah berubah dan model tidak perlu mendengar apa pun. Anda membeli loop percakapan untuk membacakan dokumen dengan suara keras.
Satu-satunya kasus ketika pilihan itu benar-benar sulit adalah kaskade: pengenalan, lalu penalaran, lalu sintesis. Arsitektur itu belum usang, dan bagi banyak sistem produksi arsitektur itu masih yang tepat, karena memungkinkan Anda menukar setiap tahap secara independen dan memilih vendor yang berbeda untuk masing-masing. Ini mengorbankan latensi dan mengorbankan prosodi yang dipertahankan model end-to-end tunggal di seluruh batas giliran. Trade-off itu nyata di kedua arah.
Jika rute sudah ada
OrcaRouter tidak menyediakan endpoint Gemini 3.8 Live atau endpoint TTS 3.8, dan itu patut dikatakan sebelum hal lain tentang perutean, karena kebalikannya mudah diasumsikan dari katalog seluas ini. Yang ada di katalog ini adalah sisanya dari keluarga — google/gemini-3.8-flash di antara 28 model Google dan lebih dari 200 model secara keseluruhan, dari satu kunci dengan harga daftar penyedia tanpa markup.
Hal itu khususnya penting untuk kaskade. Jika arsitektur Anda adalah pengenalan, lalu penalaran, lalu sintesis, tahap penalaran adalah tahap di mana satu kunci di banyak vendor membuahkan hasil, karena itulah tahap yang paling sering Anda ganti dan tahap di mana pemotongan harga vendor harus sampai ke tagihan Anda pada hari yang sama, bukan pada perpanjangan kontrak berikutnya. Ini juga tahap di mana failover otomatis terbukti bermanfaat: sebuah kaskade memiliki tiga titik yang bisa gagal, dan titik tengahnya adalah yang paling murah untuk dibuat redundan.

Aturan keputusan singkat
Jika model harus merespons sesuatu yang belum tersedia sebagai teks, Anda memerlukan Gemini 3.8 Live, dan Anda harus menganggarkan berdasarkan tarif audio per menit Google serta bersiap mempertimbangkan varian mana dari kedua varian tersebut yang Anda butuhkan. Jika teksnya sudah tertulis dan tugasnya adalah membawakannya, Anda memerlukan Gemini 3.8 Flash TTS atau Flash-Lite TTS, dan Anda harus menganggarkan per juta karakter serta memilih tier berdasarkan cakupan bahasa dan apakah selisih kualitas sebanding dengan selisih harganya.
Dan jika Anda diminta membandingkan "Gemini 3.8 Live dan Gemini 3.8 TTS" seolah-olah keduanya adalah dua produk, hal pertama yang berguna untuk Anda lakukan adalah menanyakan endpoint yang mana. Nama dalam brief itu tidak merujuk ke satu endpoint tertentu, dan jawabannya mengubah arsitektur, bukan sekadar tagihan.

