Kartu hero yang dihasilkan untuk 'Gemini 3.8 TTS vs Gemini 3.1 Flash TTS' di atas latar belakang putih dengan aksen gradien biru dan cyan yang lembut. Kartu kiri 'Gemini 3.1 Flash TTS' mencantumkan Elo 1.199, 3.430 sampel, 7 suara arena dan April 2026; kartu kanan 'Gemini 3.8 Flash TTS' mencantumkan Elo 1.260, 1.999 sampel, 8 suara arena dan September 2026. Baris footer berbunyi 'Elo per Artificial Analysis Provider Voice Arena, Sept 2026.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

Gemini 3.8 TTS vs Gemini 3.1 Flash TTS: Satu-satunya Celah di Keluarga Ini yang Nyata

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Meningkatkan versi di dalam satu keluarga model biasanya menjadi keputusan yang mudah, dan yang satu ini punya kerumitan yang membuatnya tidak semudah kelihatannya. Gemini 3.1 Flash TTS — yang masih terdaftar di API vendor sebagai pratinjau — berada di peringkat 10 pada Artificial Analysis Provider Voice Arena dengan Elo 1.199 dan interval 12 poin. Gemini 3.8 Flash TTS, yang dirilis pada 23 September 2026, berada di peringkat 2 dengan Elo 1.260 dan interval 17 poin. Itu berarti kenaikan 61 poin, dan tidak seperti sebagian besar selisih di papan tersebut, selisih ini bertahan terhadap batas kesalahan: rentang 3.1 membentang dari 1.187 hingga 1.211, rentang 3.8 membentang dari 1.243 hingga 1.277, dan ada zona kosong sepanjang tiga puluh dua poin di antara keduanya. Peningkatan kualitasnya nyata. Kisah harganya justru yang membuat semuanya jadi aneh.

A generated two-column scoreboard for Gemini 3.1 Flash TTS and Gemini 3.8 Flash TTS — 3.1 at Arena Elo 1,199, $20.00 per 1M audio tokens, 7 arena voices, 3,430 samples and an April 2026 release; 3.8 at Elo 1,260, $9.00 per 1M audio tokens, 8 arena voices, 1,999 samples and a September 2026 release — over the footer 'Prices per Google; Elo per Artificial Analysis, Sept 2026.'

Daftar tarif Google sendiri menyatakan bahwa tarif keluaran audio turun dari $20,00 per juta token pada 3.1 menjadi $9,00 pada 3.8 — pemotongan sebesar 55 persen. Artificial Analysis menormalkan kedua model yang sama menjadi $18,30 dan $33,00 per juta karakter, masing-masing, yang justru menyatakan sebaliknya. Kedua angka itu dipublikasikan; tidak satu pun yang salah; keduanya mengukur hal yang berbeda, dan rekonsiliasi adalah bagian paling berguna dari perbandingan ini bagi siapa pun yang merencanakan migrasi.

Apa yang sebenarnya diubah oleh upgrade ini

Generasi 3.8 bukan sekadar penyetelan ulang. Tiga permukaan berubah secara signifikan.

• Jumlah suara dan pembuatan suara — 3.1 Flash TTS merilis set suara bawaan. 3.8 Flash TTS menyertakan 30 suara studio bawaan termasuk Kore dan Puck, plus desain suara dari deskripsi bahasa alami dan replikasi suara dari sampel 30 detik dengan verifikasi persetujuan, tanda air SynthID dan kredensial C2PA pada output. Remixing suara tercantum akan segera hadir, bukan sudah dirilis.

• Kontrol penyampaian — arahan baris demi baris, penataan adegan dua pembicara dalam satu panggilan, dan isyarat non-verbal yang ditulis langsung ke dalam naskah sebagai <laughs>, <sigh>, <gasp>, |mhm| dan |yeah|. Materi peluncuran Google mengklaim peningkatan konsistensi konten panjang dan kontrol skenario dua pembicara dibandingkan 3.1 secara spesifik. Itu adalah klaim vendor tanpa uji publik yang mendasarinya.

• Cakupan bahasa — 130 bahasa di Flash TTS dan 101 di Flash-Lite TTS, terdeteksi otomatis dari teks. Cakupan yang dipublikasikan untuk 3.1 Flash TTS lebih rendah.

Perubahan strukturalnya adalah pemisahan. Tidak ada penerus tunggal untuk 3.1 Flash TTS; ada dua, dan dokumentasi Google memposisikan Flash-Lite TTS sebagai "pengganti andalan". Itu penting karena berarti migrasi adalah keputusan tier, bukan peningkatan versi. Tier yang lebih murah bukanlah versi yang lebih baru dari yang Anda miliki — itu adalah titik yang berbeda pada kurva.

Mengapa harga turun sementara papan peringkat menunjukkan harga naik

Mulailah dari apa yang dipublikasikan Google, karena itulah yang sebenarnya akan ditagihkan kepada Anda.

Gemini 3.1 Flash TTS Preview — $1.00 per juta token teks masuk, $20.00 per juta token audio keluar. Batch adalah $0.50 dan $10.00.

• Gemini 3.8 Flash TTS Standard — $0.50 dan $9.00 hingga 31 Desember 2026, lalu $1.00 dan $18.00. Batch dan Flex $0.25 dan $4.50. Priority $0.90 dan $16.20.

• Gemini 3.8 Flash-Lite TTS Standard — $0,50 dan $6,00 hingga 31 Desember 2026, lalu $1,00 dan $12,00. Batch dan Flex $0,25 dan $3,00. Priority $0,90 dan $10,80.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Hanya pada lini output audio, 3.8 Flash TTS seharga $9.00 dibandingkan 3.1 seharga $20.00 adalah pemotongan 55 persen, dan 3.8 Flash-Lite TTS seharga $6.00 adalah pemotongan 70 persen. Bahkan pada harga $18.00 setelah promosi, Flash TTS masih lebih rendah daripada model yang digantikannya. Itulah angka yang muncul di faktur, dan itu tidak ambigu.

Sekarang papan peringkatnya. Artificial Analysis menerbitkan angka per juta karakter agar model yang menagih dalam unit berbeda dapat diperingkatkan secara berdampingan, dan untuk pasangan ini nilainya $18,30 untuk 3.1 Flash TTS dan $33,00 untuk 3.8 Flash TTS. Jika dibaca sendiri, itu berarti peningkatan versi ini hampir dua kali lipat harganya.

Rekonsiliasinya adalah bahwa tarif per karakter merupakan konversi, bukan harga, dan faktor konversinya tidak sama untuk kedua model. Mengonversi token audio menjadi karakter mengharuskan kita mengasumsikan laju bicara sekaligus rasio token audio — Google mengukur audio pada 25 token per detik keluaran — dan mengharuskan pemilihan tingkat layanan yang akan dijadikan acuan normalisasi. Jika dewan menormalisasi 3,8 pada tarif $18,00 pascapromosi sementara menormalisasi 3,1 pada $20,00 miliknya sendiri, keduanya cukup berdekatan sehingga perbedaan apa pun dalam asumsi detik per karakter akan mendominasi hasilnya. Tarif per karakter yang dibangun di atas asumsi laju bicara yang longgar membuat model tempat tarif itu diterapkan tampak lebih baik.

Petunjuk praktisnya karena itu adalah: gunakan tarif token Google untuk penyusunan anggaran, dan gunakan tarif karakter papan peringkat hanya untuk rasio antara model yang diukur dengan cara yang sama oleh papan tersebut. Jangan mencampuradukkan keduanya, dan jangan mengutip pergeseran $18,30 hingga $33,00 sebagai kenaikan harga — itu adalah artefak dari normalisasi yang tidak sama pada kedua model.

Biaya migrasi yang sesungguhnya adalah hal yang berbeda, dan itu adalah jendela promosi. Kedua tingkat baru dikenakan tarif setengah hingga 31 Desember 2026 dan menjadi dua kali lipat pada 1 Januari. Migrasi yang direncanakan berdasarkan angka September dan dijalankan pada November akan ditetapkan ulang harganya pada kuartal pertama. Tarif Januari 2027 untuk Flash TTS, $18,00 per juta token audio, masih di bawah $20,00 milik 3.1 — jadi pemotongan itu nyata setelah promo, hanya saja jauh lebih kecil daripada yang terlihat saat ini.

Peningkatan kualitas, dan apa yang tidak ada di baliknya

Elo arena adalah satu-satunya angka di sini yang dikumpulkan oleh pihak selain vendor, dan itulah yang melampaui batas kesalahannya. Enam puluh satu poin dari 1.199 ke 1.260, dengan 3.430 sampel pada 3.1 dan 1.999 pada 3.8, serta 7 suara arena berbanding 8. Jumlah sampel pada model yang lebih baru lebih rendah, yang melebarkan intervalnya, dan meskipun begitu rentangnya tidak saling bersentuhan.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing the top rows with Cartesia Sonic 3.6 first at Elo 1,273, Google's Gemini 3.8 Flash TTS second at 1,260, Alibaba's Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google's Gemini 3.1 Flash TTS tenth at 1,199 across 3,430 samples.

Yang tidak mendukungnya: tolok ukur independen apa pun selain arena. Angka peluncuran Google — peringkat pertama pada Hume AI Voice Design Benchmark dengan 71,4, peringkat pertama pada pemodelan aksen dengan 60,8, peringkat pertama dan kedua pada Hume Overall Quality Index untuk Flash dan Flash-Lite, serta posisi teratas dalam preferensi buta yang diklaim dalam bahasa Jepang, Portugis Brasil, Vietnam, Arab Standar Modern, Spanyol Meksiko, dan Hindi — merupakan kutipan vendor atas tolok ukur pihak ketiga. Sesi pengujian yang mendasarinya tidak dipublikasikan. Bacalah semuanya sebagai klaim, yang searah dengan hasil arena tetapi tidak menambah bobot independen padanya.

Pertanyaan seputar deprekasi, dan daftar periksa migrasi

Google belum mengumumkan tanggal penghentian untuk Gemini 3.1 Flash TTS Preview. Perusahaan telah mengatakan bahwa Flash-Lite TTS diposisikan sebagai pengganti andalannya, yaitu jenis bahasa yang mendahului pemberitahuan penghentian penggunaan, bukan mengikutinya. Jika Anda masih menggunakan model pratinjau, penafsiran yang tepat adalah Anda perlu merencanakan migrasi, bukan mengejar tenggat waktu — dan menunggu tenggat waktu adalah strategi yang salah untuk model yang penggantinya sudah unggul 61 poin Elo.

• Periksa tier mana yang dibutuhkan beban kerja Anda. Flash TTS untuk 130 bahasa dan cakupan pengiriman lengkap; Flash-Lite TTS untuk 101 bahasa dengan $6.00 per juta token audio. Daftar bahasanya adalah garis pemisah, bukan kualitasnya.

• Tetapkan ulang harga berdasarkan tarif Januari 2027, bukan tarif promosi. $18,00 per juta token audio pada Flash TTS, $12,00 pada Flash-Lite.

• Tentukan apakah pekerjaan tersebut dapat diproses secara batch. Batch dan Flex memotong setengah tarif audio pada kedua tier — $4,50 dan $3,00 per juta token. Apa pun yang tidak bersifat interaktif tidak boleh berada di tier Standard.

• Periksa kembali apa pun yang bergantung pada kumpulan suara. Katalog bawaan berisi 30 suara siap pakai; suara yang Anda gunakan pada 3.1 mungkin perlu dibuat ulang, baik melalui desain suara maupun melalui sampel replikasi 30 detik.

• Periksa ulang pembentukan permintaan. Tidak ada batas karakter per permintaan yang dipublikasikan pada model 3.8, dan audio dihitung per detik, bukan per karakter, jadi ucapan yang panjang memakan biaya lebih besar daripada yang disiratkan oleh penawaran per karakter.

• Rencanakan siklus hidup suara kustom. 200 suara stateful per proyek dengan masa aktif satu tahun, atau stateless voicekey_... handle yang kedaluwarsa dalam tujuh hari.

Menjalankan keduanya selagi Anda memutuskan

Peningkatan dalam keluarga dengan kedaluwarsa promosi dan ketidaksepakatan normalisasi adalah tepat untuk tidak beralih dalam satu langkah. OrcaRouter merutekan model lama hari ini — models/google/gemini-3.1-flash-tts-preview ada di daftar model kami — sehingga Anda dapat menyiapkan model baru di sampingnya dan membandingkan pada trafik Anda sendiri sebelum Anda memindahkan jalur produksi. Kami tidak menghosting endpoint Gemini 3.8 TTS; itu berasal dari API Google sendiri. Yang kami sediakan adalah kunci tunggal untuk 200+ model dengan harga daftar penyedia tanpa markup, sehingga perubahan tarif vendor mencapai tagihan Anda pada hari yang sama, bukan saat perpanjangan, dan failover otomatis sehingga model yang baru adalah sesuatu yang dapat Anda coba tanpa mempertaruhkan jalur yang menghadap pelanggan pada model itu.

Hal yang perlu dicermati adalah apakah Google mencantumkan tanggal pada pratinjau 3.1 Flash TTS. Satu baris dokumentasi itu lebih berharga untuk rencana migrasi daripada benchmark apa pun di artikel ini, dan baris itu belum ditulis.