
Membuat dan Men-deploy Audio Kustom dengan Gemini 3.8 Flash TTS: Desain Suara, Kloning, dan Dua Jam yang Menentukan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 506 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 184 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS sama-sama memungkinkan Anda menciptakan suara dari deskripsi tertulis alih-alih memilih satu dari daftar, dan keduanya tersedia secara umum di Gemini API pada 23 September 2026. Sorotan yang orang-orang ulangi adalah desain suaranya. Bagian yang layak direncanakan adalah apa yang terjadi pada suara yang dirancang setelahnya, karena penyedia memberi Anda dua cara untuk menyimpannya dan menyematkan masa aktif yang berbeda pada masing-masing. Pilih yang salah dan suara yang menjadi andalan produk Anda akan kedaluwarsa dalam seminggu.
Itulah celah dalam liputan peluncuran sejauh ini. Postingan pengumuman menjelaskan bahwa Anda dapat memunculkan suara hanya dengan prompt, dan beberapa di antaranya menyebut kloning dari sampel 30 detik. Tidak ada yang membahas secara rinci model penyimpanannya, padahal itulah yang menentukan apakah pipeline ucapan dapat direproduksi dari file konfigurasi atau harus disediakan ulang sesuai jadwal. Tulisan ini membahas seluruh alurnya — desain, penyimpanan, pemanggilan, dan pembayaran — dengan harga dan kuota sebagaimana dipublikasikan oleh Google.
Apa yang dirilis pada 23 September
Dua model, satu skema API. Pengenalnya adalah gemini-3.8-flash-tts dan gemini-3.8-flash-lite-tts, dan dokumentasi Google secara eksplisit menyatakan bahwa keduanya menggunakan "skema API dan format prompt yang persis sama" — berpindah di antara keduanya hanyalah perubahan pada satu parameter, bukan penulisan ulang.
• Input — hanya teks. Kedua model menerima teks dan mengembalikan audio; keduanya tidak multimodal dan tidak menghasilkan teks kembali.
• Keluaran — WAV, PCM bertanda 16-bit mono 24 kHz pada endpoint unary; PCM tanpa header (audio/l16) pada endpoint streaming; audio/mulaw dan audio/alaw diterima dengan laju sampel yang dapat dikonfigurasi.
• Bahasa — 130 di Flash TTS, 101 di Flash-Lite TTS, terdeteksi otomatis dari teks, bukan dideklarasikan dalam permintaan.
• Voices — 30 suara studio terkurasi yang tercantum dalam dokumentasi (Kore dan Puck termasuk di antaranya), Extended Voice Library dengan "ratusan" suara lain yang dapat dikueri melalui endpoint voices, plus dua jalur pembuatan di bawah ini.
• Arahan — kontrol penyampaian baris demi baris, adegan dua pembicara yang dipentaskan dari satu naskah, dan isyarat nonverbal seperti <laughs>, <sigh> dan |mhm| yang ditulis langsung ke dalam transkrip.
Dua tier ini ada karena beban kerjanya berbeda. Flash TTS diposisikan untuk kesetiaan akustik maksimum dan akting yang kompleks; Flash-Lite TTS digambarkan dengan kata-kata Google sendiri sebagai "pengganti pekerja keras" untuk gemini-3.1-flash-tts-preview, yang ditujukan untuk dubbing massal, fitur baca nyaring, dan kaskade agen suara. Keduanya menggantikan satu model pratinjau yang telah ada di API sejak April 2026, jadi jika Anda menggunakan versi pratinjau tersebut, migrasinya adalah keputusan tingkat tier, bukan sekadar kenaikan versi.

Merancang sebuah suara adalah sebuah prompt, dan itu mengubah langkah peninjauan
Permukaan pembuatan adalah hal yang benar-benar baru di generasi ini. Suara yang diprompt dibangun dari deskripsi bahasa alami — peran, aksen, karakter vokal — dan mengembalikan pengenal yang Anda gunakan kembali. Dalam API ini adalah panggilan pembuatan suara dengan store: true dan input yang diprompt; dalam contoh Google sendiri, deskripsinya berkisar dari DJ Melbourne berenergi tinggi hingga naga Jepang. Setelah dibuat, suara dirujuk dalam permintaan ucapan berdasarkan pengenalnya, dan instruksi gaya per permintaan kemudian dapat minimal atau kosong, karena karakter sudah tertanam dalam suara.
Konsekuensi praktisnya adalah perubahan alur kerja, bukan sekadar fitur. Pemilihan suara dulu adalah negosiasi lisensi atau pemesanan studio, yang berarti pemilihan suara terjadi sekali, di awal, dan bertahan melewati peninjauan karena mengubahnya mahal. Ketika suara adalah satu paragraf teks, casting menjadi token desain — sesuatu yang bisa diminta product manager untuk di-roll ulang pada hari Selasa. Tim yang memasukkan string deskripsi ke kontrol sumber dan memperlakukan ID suara yang dihasilkan sebagai artefak build akan mendapatkan output yang konsisten di seluruh lingkungan. Tim yang membuat suara secara manual di AI Studio tidak akan mendapatkannya, dan kegagalannya akan tampak seperti perbedaan yang tidak dapat dijelaskan antara audio staging dan produksi.
Kedua jam
Inilah bagian yang dilewatkan oleh postingan peluncuran. Google memungkinkan Anda mempertahankan voice yang dirancang atau direplikasi dalam salah satu dari dua status, dan keduanya kedaluwarsa dengan laju yang sangat berbeda.
• Suara tersimpan — dibuat dengan penyimpanan diaktifkan, suara tersebut berada di proyek Anda dan diatur oleh kuota 200 suara per proyek dengan masa berlaku satu tahun.
• Kunci tanpa status — replikasi suara dapat mengembalikan kunci yang dikelola klien (bentuk voicekey_…) alih-alih pengenal yang disimpan, dan kunci tersebut memiliki masa berlaku tujuh hari.
Jika dibaca bersama, pasangan itu adalah instruksi desain. Suara yang disimpan adalah komitmen sepanjang tahun dan batas maksimum yang keras sebesar 200 per proyek, yang cukup longgar untuk produk dengan pemeran tetap dan tidak berguna untuk apa pun yang menghasilkan suara baru per pelanggan. Kunci stateless adalah kebalikannya: tidak ada tekanan kuota, tetapi kunci yang harus Anda buat ulang setiap minggu, yang berarti aplikasi Anda memerlukan jalur penyegaran dan infrastruktur Anda perlu menyimpan kredensial yang berotasi. Keduanya tidak salah. Memilih tanpa menyadari mana yang Anda pilih adalah cara agen suara menjadi bisu pada hari kedelapan.
Dua properti lain melekat pada replikasi dan perlu diketahui sebelum Anda menjanjikan apa pun kepada tim hukum. Membuat suara yang direplikasi memerlukan rekaman persetujuan lisan dari pemilik suara yang harus cocok dengan pembicara referensi — pemeriksaan lisan, bukan sekadar centang kotak. Dan outputnya membawa provenans: setiap klip diberi watermark dengan SynthID, dan suara yang direplikasi juga membawa kredensial konten C2PA. Jalur desainnya sengaja dibuat lebih sulit untuk disalahgunakan, dan kedua hambatan tersebut bersifat struktural, bukan pernyataan kebijakan.
Satu ketidaksesuaian yang layak ditandai daripada diselesaikan. Tabel model yang didukung Google mencantumkan desain suara dan replikasi suara sebagai tersedia pada kedua model 3.8 TTS. Sebagian besar liputan peluncuran menggambarkan replikasi sebagai bagian dari kisah Flash TTS secara khusus. Jika replikasi penting bagi keputusan Anda di antara tier, verifikasikan dengan dokumentasi untuk tier yang ingin Anda rilis, bukan memercayai salah satu ringkasan.
Berapa biaya satu jam audio
Google menagih ucapan dalam token, bukan karakter atau detik, dan konversinya dipublikasikan: audio diukur pada 25 token per detik keluaran, yaitu 90.000 token per jam. Itu membuat perhitungannya luar biasa rapi, dan angka itulah yang harus dimasukkan ke dalam anggaran, bukan tarif per juta.
• Flash TTS standar — $0.50 per juta token teks masuk, $9.00 per juta token audio keluar hingga 31 Desember 2026, lalu $1.00 dan $18.00. Batch dan Flex adalah $0.25 dan $4.50; Priority adalah $0.90 dan $16.20.
• Flash-Lite TTS standar — $0,50 dan $6,00 hingga tanggal yang sama, lalu $1,00 dan $12,00. Batch dan Flex $0,25 dan $3,00; Priority $0,90 dan $10,80.
• Dalam hitungan detik — Flash TTS sekitar $0,81 per jam audio yang dihasilkan selama periode promosi dan sekitar $1,62 setelahnya; Flash-Lite TTS sekitar $0,54 lalu $1,08.
• Dibandingkan dengan model yang digantikannya — gemini-3.1-flash-tts-preview dibanderol dengan harga $1,00 dan $20,00 per juta, sehingga lini keluaran audio turun 55 persen pada Flash TTS dan 70 persen pada Flash-Lite TTS.
Jangan merencanakan berdasarkan angka promosi. Google menerbitkan kedua kolom dalam tabel yang sama, yang berarti tarif Januari bukan rumor yang baru akan ditemukan nanti — tarif itu sudah tercantum dalam daftar tarif hari ini, dan setiap estimasi per seribu menit yang dihitung pada $0.81 harus mampu bertahan saat digandakan.
Satu angka independen, dan beberapa yang tidak.
Pengumuman Google dibuka dengan hasil benchmark, dan hasil itu harus dibaca apa adanya. Perusahaan mengatakan Flash TTS meraih tempat pertama pada Voice Design Benchmark dari Hume AI dengan skor 71,4, memimpin pemodelan aksen di 60,8, dan bahwa Flash TTS serta Flash-Lite TTS menempati peringkat pertama dan kedua pada Indeks Kualitas Keseluruhan Hume, dengan posisi kuat dalam preferensi buta di Voice Arena untuk bahasa Jepang, Portugis Brasil, Vietnam, Arab Standar Modern, Spanyol Meksiko, dan Hindi. Semua dilaporkan vendor, tidak ada satu pun uji coba yang dipublikasikan.
Ada detail dalam daftar itu yang patut diperhatikan. Alan Cowen, yang dikreditkan sebagai salah satu penulis pengumuman Google, adalah pendiri Hume AI — laboratorium yang Voice Design Benchmark-nya menyediakan angka utama tersebut. Itu tidak membuat angka tersebut salah, dan benchmark Hume memang nyata, tetapi keduanya tidak independen satu sama lain, dan pembaca yang mempertimbangkan 71,4 sebaiknya mengetahui hal itu sebelum mengulanginya sebagai validasi pihak ketiga.
Angka yang dikumpulkan secara independen ada di Provider Voice Arena milik Artificial Analysis, yang diambil untuk artikel ini pada 24 September 2026: Gemini 3.8 Flash TTS berada di peringkat kedua dengan Elo 1,260 dengan interval 17 poin dari 1,999 sampel, di belakang Cartesia Sonic 3.6 pada 1,273. Gemini 3.8 Flash-Lite TTS berada di peringkat keenam pada 1,235. Model yang digantikan, Gemini 3.1 Flash TTS, berada di peringkat kesepuluh pada 1,199 dari 3,430 sampel. Preferensi pendengar buta, bukan evaluasi milik lab sendiri — dan satu-satunya angka kualitas di sini yang tidak dipesan oleh Google.

Di mana menjalankannya, dan di mana belum
Kedua model tersedia hari ini di Gemini API dan Google AI Studio, tanpa daftar tunggu. Antarmuka konsumen dan perusahaan masih dalam tahap persiapan, bukan sudah diluncurkan: Flash TTS akan hadir di Gemini Notebook dan Flash-Lite TTS di Google Vids, akses Gemini Enterprise disebutkan akan segera hadir, dan remixing suara — menyesuaikan timbre, pitch, tempo, dan aksen pada suara yang ada — terdaftar sebagai fitur masa depan, bukan fitur yang ada saat ini. Jika rencana Anda bergantung pada remixing, itu belum ada.
Dari sisi kami sendiri, jujur saja: endpoint Gemini 3.8 TTS tidak ada di tabel routing OrcaRouter. Generasi yang mereka gantikan adalah — google/gemini-3.1-flash-tts-preview ada di katalog dengan harga yang sama, $1.00 dan $20.00 per juta token yang dipublikasikan Google, karena harga daftar penyedia diteruskan tanpa markup, dan ia merespons di endpoint yang sama /v1/audio/speech yang sudah menjadi target SDK kompatibel OpenAI Anda. Itu lebih penting daripada kedengarannya untuk beban kerja suara, karena hal yang sebenarnya Anda beli adalah endpoint stabil yang dapat dipanggil aplikasi Anda saat model di baliknya berubah. Kode Anda menyimpan string model; katalog menyimpan routing. Ketika jendela promosi Google ditutup pada 31 Desember dan Flash TTS menjadi dua kali lipat, harga model yang dirutekan berubah pada hari yang sama, bukan pada perpanjangan kontrak berikutnya — dan model yang mengalami gangguan akan failover alih-alih ikut menjatuhkan antrean narasi Anda.

Jika Anda mengevaluasi generasi ini sebelum berkomitmen, eksperimen murahnya adalah eksperimen dua tingkat. Jalankan naskah yang sama melalui Flash TTS dan Flash-Lite TTS, karena skemanya identik dan perbedaannya hanyalah sebuah parameter — lalu putuskan dengan audio Anda sendiri, bukan dengan bagan benchmark, dan periksa di Artificial Analysis apakah selisih kualitasnya bertahan terhadap error bar-nya sebelum Anda membayar biaya premium. Untuk proyek narasi format besar, biaya premium itu uang sungguhan; untuk bot dukungan yang membacakan nomor telepon dengan lantang, tidak jelas bahwa itu memberi Anda sesuatu yang bisa didengar oleh pendengar.
