
Gemini 3.8 Flash TTS Menyapa: Google Membagi Lini Ucapannya Menjadi Dua dan Memangkas Harga
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Vendor mengirimkan dua model suara pada 23 September 2026, dan pengumumannya ditulis seolah-olah berita utamanya adalah kualitas suara. Tidak.Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS adalah model text-to-speech pertama yang ditempatkan vendor di Gemini Developer API dengan harga di bawah model pratinjau yang mereka gantikan — dan bagi siapa pun yang selama ini membayar per karakter di tempat lain, itulah bagian yang mengubah pos anggaran. Tarif output audio pada Gemini 3.8 Flash TTS adalah $9,00 per juta token hingga akhir 2026. Audio ditagih dengan 25 token per detik, yang berarti sekitar 0,02 sen per detik ucapan yang dihasilkan. Model yang digantikannya, Gemini 3.1 Flash TTS Preview, dibanderol dengan harga $20,00 per juta token audio.
Paruh kedua cerita ini adalah sekarang ada dua model, bukan satu. Google membagi lini: Flash TTS membawa set bahasa lengkap dan tingkat audio yang lebih tinggi, Flash-Lite TTS membawa daftar bahasa yang lebih pendek dan tarif yang lebih murah. Ini bentuk yang berbeda dari susunan model pratinjau tunggal yang telah ada di API sejak April, dan ini memberi tahu Anda bagaimana Google memandang pasar — sejumlah kecil aplikasi yang membutuhkan 130 bahasa dan kloning suara, serta jumlah yang jauh lebih besar yang membutuhkan suara bahasa Inggris yang memadai untuk bot dukungan dan tidak memerlukan hal lain.
Apa yang sebenarnya dirilis pada 23 September
Kedua model tersebut secara umum tersedia di Gemini API dan di AI Studio sejak pengumuman, tidak dibatasi di balik daftar tunggu. Nama di API adalah gemini-3.8-flash-tts dan gemini-3.8-flash-lite-tts.
• Flash TTS — 130 bahasa, bahasa terdeteksi otomatis dari teks, 30 suara studio bawaan termasuk Kore dan Puck.
• Flash-Lite TTS — 101 bahasa, antarmuka desain suara yang sama, diposisikan sebagai tier volume tinggi.
• Keduanya — desain suara dari deskripsi bahasa alami, arahan penyampaian baris demi baris, penataan adegan dua pembicara, dan isyarat non-verbal yang ditulis langsung ke dalam naskah.
• Output — WAV 24 kHz mono PCM bertanda 16-bit pada endpoint unary; PCM tanpa header (audio/l16) pada endpoint streaming; audio/mulaw dan audio/alaw juga diterima, dengan laju sampel yang dapat dikonfigurasi.
Daftar tarif, per juta token, layak dibaca secara lengkap karena tingkatannya berbeda lebih dari sekadar angka utamanya:
• Flash TTS Standard — $0.50 teks masuk / $9.00 audio keluar, naik menjadi $1.00 / $18.00 setelah 31 Desember 2026.
• Flash TTS Batch dan Flex — $0,25 / $4,50.
• Flash TTS Prioritas — $0.90 / $16.20.
• Flash-Lite TTS Standard — $0.50 / $6.00, naik menjadi $1.00 / $12.00 setelah 31 Desember 2026.
• Flash-Lite TTS Batch dan Flex — $0,25 / $3,00.
• Prioritas TTS Flash-Lite — $0.90 / $10.80.
• Gemini 3.1 Flash TTS Preview, untuk perbandingan — $1,00 / $20,00, batch $0,50 / $10,00.
Jendela promosi adalah hal yang perlu dicatat. Google menetapkan harga kedua model baru itu dengan tarif separuh hingga akhir tahun dan menerbitkan angka pasca-promosi dalam tabel yang sama. Siapa pun yang memodelkan biaya per seribu menit harus menggunakan angka Januari, bukan angka September.

Desain suara adalah kemampuan yang benar-benar baru
Suara siap pakai adalah syarat dasar. Yang ditambahkan Google di 3.8 adalah cara untuk mendeskripsikan suara dengan kata-kata dan mendapatkannya, serta cara untuk mengkloning suara dari sampel pendek dengan pemeriksaan persetujuan yang menyertainya.
Desain suara menerima prompt bahasa alami — tempo, timbre, aksen, hal-hal yang biasanya Anda habiskan satu sore untuk mengikuti audisi — dan menghasilkan suara yang dapat digunakan tanpa rekaman referensi. Replikasi suara berjalan sebaliknya: Anda menyediakan sampel 30 detik, sistem memverifikasi persetujuan, dan suara yang dihasilkan ditandai dengan watermark SynthID dan kredensial C2PA pada audio yang dihasilkan. Remixing suara, yang memungkinkan Anda mencampur atau memodifikasi suara kustom yang ada, tercantum sebagai segera hadir, bukan sudah dirilis.
Suara kustom hadir dalam dua ragam dan perilakunya cukup berbeda sehingga perbedaan itu penting dalam produksi. Suara kustom stateful disimpan pada proyek, dibatasi 200 per proyek, dengan masa berlaku satu tahun. Suara stateless dialamatkan oleh sebuah voicekey_... handle dan kedaluwarsa setelah tujuh hari. Jika aplikasi Anda menyediakan satu suara per pelanggan, batas dan TTL adalah dua angka yang menentukan apakah Anda memerlukan lapisan penyimpanan sendiri.
Kontrol penyampaian adalah separuh lainnya dari "baru". Anda dapat mengarahkan sebuah baris seperti Anda mengarahkan seorang aktor — tempo, penekanan, register emosional — alih-alih hanya memilih suara dan berharap. Adegan dua pembicara dapat dipentaskan dalam satu panggilan. Dan vokalisasi non-verbal adalah elemen skrip kelas utama: <laughs>, <sigh> dan <gasp> sebagai isyarat inline, plus |mhm| dan |yeah| untuk suara back-channel kecil yang membuat percakapan sintetis terdengar seperti percakapan. Pembacaan bentuk panjang diklaim dapat mempertahankan identitas pembicara dengan penyimpangan minimal, yang merupakan mode kegagalan yang muncul pertama kali saat Anda menghasilkan bab buku audio berdurasi 40 menit.
Tolok ukur, dan siapa yang menjalankannya
Materi peluncuran Google bersandar pada dua evaluasi dari pihak luar dan serangkaian peringkat arena. Semua ini dilaporkan oleh vendor — Google mengutipnya, dan proses yang mendasarinya tidak dipublikasikan — jadi perlakukan itu sebagai klaim, bukan hasil pengukuran.

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTS menempati peringkat pertama dengan 71,4, dan peringkat pertama dalam pemodelan aksen dengan 60,8.
• Indeks Kualitas Keseluruhan Hume — Flash TTS pertama, Flash-Lite TTS kedua.
• Preferensi buta di Speech Arena — posisi teratas diklaim dalam bahasa Jepang, Portugis Brasil, Vietnam, Arab Standar Modern, Spanyol Meksiko, dan Hindi.
Dibandingkan dengan Gemini 3.1 Flash TTS — Google mengklaim adanya peningkatan dalam konsistensi bentuk panjang dan kontrol skenario dua pembicara, yang justru merupakan dua hal yang menjadi tujuan fitur arahan penyampaian.
Satu ketidaksesuaian yang terdokumentasi perlu ditandai karena akan membingungkan siapa pun yang membandingkan sumber. Postingan blog menggambarkan pustaka berisi 2.000+ suara siap produksi. Dokumentasi pengembang menggambarkan "ratusan" suara di Extended Voice Library bersama 30 suara studio yang sudah dibuat sebelumnya. Liputan pihak ketiga mengutip angka yang lagi-lagi satu orde besaran lebih tinggi. Ini tidak dapat direkonsiliasi dari luar — penafsiran yang jujur adalah bahwa kumpulan bawaan yang Anda dapatkan secara default adalah 30, Extended Voice Library lebih besar dan dideskripsikan secara samar, dan angka-angka besar merujuk pada katalog yang mencakup suara buatan pengguna. Jika jumlah suara menjadi penentu keputusan Anda, ujilah suara spesifik yang Anda butuhkan daripada memercayai salah satu dari ketiga angka itu.
Apa artinya jika Anda membangun di atasnya
Perubahan praktisnya adalah text-to-speech telah bergeser dari pos anggaran khusus menjadi sesuatu yang dapat Anda masukkan ke dalam model biaya yang sama dengan token bahasa Anda. Pada 25 token per detik, satu jam audio yang dihasilkan adalah 90.000 token audio, yang pada tarif promosi Flash-Lite sekitar 54 sen. Itu cukup murah sehingga pertanyaan yang menarik bukan lagi "dapatkah kita membiayai suara sintetis" melainkan "dari dua tier, mana yang dibutuhkan surface ini".
Perubahan praktis kedua adalah bahwa model TTS yang benar-benar baru justru merupakan hal yang ingin Anda coba tanpa mempertaruhkan jalur produksi padanya. Itulah alasan menempatkan model baru di belakang router alih-alih menghubungkannya langsung: OrcaRouter mengekspos 200+ model di balik satu kunci dengan harga daftar penyedia tanpa markup, dan failover otomatisnya berarti endpoint suara baru yang goyah di bawah beban akan terdegradasi ke model yang sudah Anda percaya alih-alih memutus panggilan. Kami tidak menghosting endpoint TTS Gemini 3.8 — itu berasal dari API Google sendiri — tetapi lapisan teks di bawah suara, dan jalur cadangan saat panggilan sintesis gagal, adalah bagian yang sebenarnya menjadi fungsi router.
Apa yang masih kurang?
Ada tiga hal yang tidak ada dalam peluncuran ini dan masing-masing merupakan kendala nyata, bukan sekadar hal sepele.
Tidak ada evaluasi independen yang dipublikasikan. Angka Hume dari Google adalah kutipan vendor atas tolok ukur pihak ketiga, yang lebih baik daripada tidak ada dan lebih buruk daripada audit. Sampai Artificial Analysis atau yang setara menerbitkan hasil pengujiannya sendiri pada model yang sama, setiap klaim kualitas dalam artikel ini harus dibaca sebagai klaim.
Tidak ada opsi bobot terbuka. Kedua model tersebut tertutup dan hanya API, yang menempatkannya dalam kategori berbeda dari model ucapan terbuka yang telah hadir di arena yang sama. Jika penerapan Anda mengharuskan menjalankan model sendiri, peluncuran ini tidak ditujukan untuk Anda.
Dan harga promosi berakhir. Tarif Januari 2027 untuk Flash TTS dua kali lipat tarif September, dan setiap perhitungan bisnis yang dibuat berdasarkan angka peluncuran perlu diulang pada kuartal pertama. Itu bukanlah sebuah kritik — menerbitkan kedua angka sejak awal lebih jujur daripada kebanyakan — tetapi itulah angka yang seharusnya ada di dalam spreadsheet.
Google belum mengatakan apakah Gemini 3.1 Flash TTS Preview akan dinyatakan usang, hanya bahwa Flash-Lite TTS diposisikan sebagai pengganti andalannya. Siapa pun yang masih menggunakan model pratinjau itu sebaiknya merencanakan migrasi daripada menunggu pemberitahuan penghentian.

