Kartu hero yang dihasilkan untuk 'Gemini 3.8 TTS: dua pelikan, dua model' di latar belakang putih dengan aksen gradien biru dan sian yang lembut. Tiga kartu bertuliskan 'Gemini 3.8 Flash TTS — Elo 1.260, peringkat 2, 8 suara arena, $9,00 per 1 juta token audio', 'Gemini 3.8 Flash-Lite TTS — Elo 1.235, peringkat 6, $6,00 per 1 juta token audio' dan 'Dialog dua pembicara — didukung, desain suara, replikasi 30 detik'. Baris footer bertuliskan 'Elo per Artificial Analysis Provider Voice Arena, Sept 2026; harga daftar per Google.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Gemini 3.8 TTS: Dua Pelikan, Dua Model, dan Harga yang Menjadi Dua Kali Lipat pada Januari

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cara tercepat untuk memahami apa yang dirilis vendor pada 23 September 2026 adalah dengan melihat demo yang beredar bersamanya: dua pelikan yang berdebat tentang apakah akan pindah ke Pacifica Pier, satu suara per burung, dengan skrip giliran demi giliran. Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS adalah dua model di balik demo itu, keduanya tersedia secara umum di Gemini API, dan pelikan-pelikan itu bukan gimik. Mereka adalah hal pertama dalam generasi ini yang sama sekali tidak dapat dilakukan oleh model ucapan Gemini sebelumnya: dua pembicara, satu generasi, sebuah skrip yang mengontrol siapa mengatakan apa.

Harga adalah separuh cerita lainnya, dan di sinilah kedua model berbeda. Flash TTS menagih $0,50 per juta token teks masuk dan $9,00 per juta token audio keluar hingga 31 Desember 2026, lalu $18,00; Flash-Lite TTS menagih $0,50 dan $6,00 dengan jadwal yang sama, lalu $12,00. Itu adalah tarif Google sendiri. Setelah dikonversi oleh Artificial Analysis ke basis per juta karakter agar dapat berada di papan yang sama dengan yang lain, angkanya menjadi $16,50 dan $11,00 — sekitar sepertiga lebih murah untuk model Lite, dan keduanya jauh di bawah apa yang dikenakan oleh peringkat teratas di papan tersebut.

Jadi, pertanyaan yang menarik bukanlah apakah model-model itu bagus. Melainkan mana dari keduanya yang harus Anda bangun di atasnya, karena kesenjangan di antara keduanya bukanlah kesenjangan yang akan Anda duga dari namanya.

Apa isi sebenarnya dari pengumuman 23 September

Dua model, bukan satu, dan Google secara eksplisit menyatakan bahwa keduanya adalah sebuah pemisahan, bukan versi kecil dan besar dari hal yang sama. Pengumuman tersebut menyebutkan lima tempat mereka hadir — Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook dan Google Vids — dan pengenal API-nya sederhana: gemini-3.8-flash-tts dan gemini-3.8-flash-lite-tts.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

Daftar kemampuannya lebih panjang daripada yang disiratkan oleh judulnya. Dari pengumuman Google dan dokumentasi pembuatan ucapan Gemini API:

• Desain suara — Anda mendeskripsikan suara dengan kata-kata dan mendapatkan ID suara khusus, bukan memilih dari daftar tetap.

• Replikasi suara — sampel 30 detik menghasilkan ID suara, yang merupakan jalur yang paling banyak akan benar-benar digunakan tim untuk suara merek atau narator.

• Dialog dua penutur — kasus pelikan. Skrip ini memuat giliran pembicara, bukan satu blok prosa.

• Gaya tingkat giliran — dokumentasi menjelaskan anotasi speech_metadata yang melampirkan arahan ke giliran tertentu, bukan ke seluruh permintaan.

• Suara siap pakai, plus Pustaka Suara Diperluas yang dapat diakses di GET /v1beta/voices.

• Tiga encoding audio — WAV secara default, dengan mulaw dan alaw tersedia untuk pipeline yang disesuaikan untuk teleponi.

• Hanya teks sebagai masukan, hanya audio sebagai keluaran. Dokumentasinya tegas soal ini: model TTS tidak menerima modalitas masukan lain dan tidak menghasilkan keluaran lain, dan ada bagian Keterbatasan terpisah yang mencantumkan batasan-batasannya.

Yang tidak ada dalam pengumuman adalah angka-angka yang dibutuhkan oleh perencana kapasitas. Batas laju, kuota, dan masa penyimpanan suara yang dirancang semuanya tercantum di dokumentasi dan halaman harga, bukan di postingan peluncuran, yang biasanya menyebabkan minggu peluncuran berjalan lancar untuk demo dan buruk untuk produksi.

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

Pelikan-pelikan itulah berita sebenarnya.

TTS satu pembicara sudah menjadi masalah yang cukup terpecahkan selama dua tahun. Yang hilang adalah model yang dapat menjaga dua identitas tetap terpisah di sepanjang naskah panjang tanpa pergeseran, dan itulah yang sebenarnya diuji oleh demo ini — bukan apakah suaranya terdengar manusiawi, melainkan apakah pembicara A masih tetap pembicara A pada menit keempat.

Dua hal mengikuti dari itu, dan itulah alasan ini penting melampaui sekadar mainan podcast.

Yang pertama adalah unit kerjanya berubah. Dengan model penutur tunggal, dialog dua puluh menit adalah dua puluh menit audio yang Anda sambungkan dari dua eksekusi independen, dan setiap sambungan adalah tempat prosodi tereset. Dengan model dua penutur, semuanya menjadi satu panggilan, satu konteks, dan model dapat bereaksi terhadap baris sebelumnya. Itu adalah perbedaan kualitas yang tidak dapat Anda tebus kembali dengan pascapemrosesan.

Yang kedua adalah bahwa format skrip menjadi antarmuka. Jika pipeline Anda sudah menghasilkan sesuatu yang berbentuk SSML — anotasi per frasa — generasi ini hampir bisa langsung dipakai. Jika pipeline Anda menyerahkan dinding teks kepada model dan berharap, kini Anda punya alasan untuk merestrukturisasinya, karena gaya yang dulu implisit sekarang menjadi sesuatu yang harus Anda nyatakan secara eksplisit. Itu adalah trade-off yang sama yang dibuat oleh bagian lain dari bidang ini dengan cara berbeda-beda, dan itulah sumbu tempat kedua model Google ini bersaing dengan semua yang lain di papan.

Berapa biaya audio dua pelikan selama satu jam

Perhitungan token layak dilakukan sekali, karena angka per juta token audio bukanlah angka per jam dan perbedaannya telah mengejutkan banyak orang.

Token audio diproduksi pada laju tetap per detik keluaran, jadi biaya menyesuaikan dengan panjang audio jadi, bukan panjang naskah. Ambil tarif Google sendiri untuk Flash TTS — $9,00 per juta token audio keluaran — dan perhitungan untuk satu jam hasil jadi berada di kisaran satu digit dolar pada tier standar, dengan model Lite sebesar dua pertiga dari itu. Harga Batch dan Flex, pada $0,25 untuk input dan $4,50 untuk output untuk Flash TTS dibandingkan $0,25 dan $3,00 untuk Flash-Lite TTS, memangkasnya lebih jauh untuk apa pun yang tidak perlu dihasilkan sesuai permintaan. Prioritas, pada $0,90 dan $16,00, diperuntukkan bagi pekerjaan yang memang membutuhkannya.

Tiga konsekuensi praktis:

• Membuat ulang satu paragraf itu murah; membuat ulang satu seri adalah keputusan. Dengan tarif seperti ini, bagian mahal dari alur pemrosesan pidato bukan lagi inferensi, melainkan kembali menjadi manusia yang menyetujui rekamannya.

• Tarif input teks tidak signifikan. $0,50 per juta token teks untuk naskah beberapa ribu kata hanyalah kesalahan pembulatan dibandingkan dengan sisi audio. Jangan mengoptimalkan naskah untuk panjangnya.

• Batas waktu 31 Desember itu nyata dan menggandakan tarif audio. Jika Anda merencanakan peluncuran pada 2027, anggarkan angka pasca-promosi, bukan angka peluncuran, atau Anda akan merencanakan ulang pada Januari.

Bilangan yang independen, dan yang tidak

Satu angka dalam peluncuran ini berasal dari sumber lain selain Google. Pada Artificial Analysis Provider Voice Arena, yang diambil pada 24 September 2026, Gemini 3.8 Flash TTS berada di peringkat 2 dengan Elo 1.260 dari 1.999 sampel dan 8 suara arena, sedangkan Gemini 3.8 Flash-Lite TTS berada di peringkat 6 dengan 1.235 dari 2.000 sampel. Keduanya berada di dalam interval kepercayaan satu sama lain, yaitu ±16 dan ±17, jadi papan peringkat memberi tahu Anda bahwa keduanya secara statistik tidak dapat dibedakan dalam hal preferensi — ini hasil yang benar-benar berguna, karena berarti versi yang lebih murah tidak lebih buruk secara terukur bagi pendengar.

Semua hal lainnya adalah klaim Google sendiri dan harus dibaca seperti itu: ekspresivitas bahasa, jumlah bahasa, kualitas replikasi. Arena hanya memberi Anda peringkat preferensi dan tidak lebih. Arena tidak memberi tahu Anda bagaimana masing-masing model menangani skrip berdurasi 40 menit tanpa penyimpangan, bagaimana perilakunya terhadap nama diri yang belum pernah dilihatnya, atau apa yang terjadi pada suara yang dirancang setelah sepekan.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Model Lite juga merupakan argumen yang lebih kuat bahwa pasangan ini benar-benar terpisah, bukan sekadar tingkatan pemasaran. Selisih Elo 25 poin yang berada di dalam batas galat, dibandingkan dengan selisih harga 33%, adalah bentuk keputusan yang seharusnya diambil oleh pipeline yang sensitif terhadap harga demi Lite hampir setiap saat — dan bentuk keputusan yang seharusnya diambil oleh pipeline yang sensitif terhadap latensi ke arah sebaliknya, karena keduanya berbeda dalam hal waktu maupun biaya.

Di mana menjalankannya, dan versi jujur dari jawaban itu

OrcaRouter tidak menghosting endpoint Gemini 3.8 TTS. Hal itu layak dinyatakan secara terang-terangan alih-alih menyiratkan sebaliknya, karena hal berguna yang dapat kami katakan tentang kedua model ini bukanlah bahwa kami melayaninya — kami tidak melakukannya — melainkan bahwa pemotongan harga dari vendor seperti perubahan pada 31 Desember adalah persis jenis peristiwa yang membuat routing layak dimiliki.

OrcaRouter menempatkan lebih dari 200 model di balik satu kunci API pada harga daftar penyedia tanpa markup, jadi tarif vendor adalah yang Anda bayar, dan perubahannya langsung berlaku di sisi kami pada hari yang sama, bukan pada siklus penagihan berikutnya. Untuk pipeline suara yang sedang dalam masa migrasi, lapisan failover lebih penting daripada katalognya: Anda dapat menempatkan jalur permintaan pada model yang masih dievaluasi tanpa mempertaruhkan rute produksi padanya, karena panggilan yang gagal dapat jatuh ke sesuatu yang sudah terbukti. DSL perutean menyusun beberapa model menjadi satu panggilan untuk kasus-kasus di mana tidak ada satu suara pun yang cukup baik, dan fusi model menjawab prompt dengan panel ketika jawaban lebih penting daripada latensi.

Untuk model Gemini 3.8 TTS sendiri, tempat untuk memanggilnya adalah API milik Google sendiri, dan surface yang disebut Google pada 23 September. Apa yang dilakukan pasangan ini terhadap arsitektur Anda — satu panggilan untuk dua pembicara, styling sebagai anotasi, suara yang dapat dideskripsikan alih-alih dipilih — adalah bagian yang bertahan lebih lama daripada diskon peluncuran.

Tontonan Berikutnya

Tiga hal akan menentukan apakah generasi ini merupakan perubahan besar atau sekadar sebuah fitur.

Yang pertama adalah drift. Belum ada yang menerbitkan evaluasi panjang tentang apakah jalur dua pembicara mempertahankan identitas selama satu jam penuh, dan sampai ada yang melakukannya, pelican demo hanyalah demo. Yang kedua adalah masa hidup suara. Suara yang dirancang, yang kedaluwarsa dalam seminggu, adalah prototipe; suara yang dapat diturunkan ulang dari konfigurasi tersimpan adalah produk, dan jawabannya bergantung pada pengenal mana dari kedua pengenal tersebut yang Anda simpan. Yang ketiga adalah apa yang terjadi setelah 31 Desember, ketika tarif promosi berakhir dan biaya per jam dari pipeline ucapan berlipat ganda dalam semalam.

Tidak satu pun dari hal-hal itu terlihat dari pos peluncuran. Ketiganya terlihat dari dokumentasi, dan di situlah liputan peluncuran berhenti membaca.