Kartu hero yang dihasilkan untuk 'Gemini 3.8 TTS vs ElevenLabs' dengan latar belakang putih dan aksen gradien biru dan cyan yang lembut. Kartu kiri 'ElevenLabs Eleven v3' mencantumkan $100 per 1 juta karakter, 70+ bahasa, Elo 1.167 dan peringkat 17; kartu kanan 'Gemini 3.8 Flash TTS' mencantumkan $33 per 1 juta karakter, 130 bahasa, Elo 1.260 dan peringkat 2. Baris footer berbunyi 'Elo per Artificial Analysis Provider Voice Arena, Sept 2026.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs: Apa yang Anda Dapatkan dari Harga Tiga Kali Lipat

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada volume yang sama, model sintesis unggulan ElevenLabs berbiaya sekitar tiga kali lipat dibandingkan model baru vendor tersebut. ElevenLabs Eleven v3 mengenakan biaya $0,10 per seribu karakter — $100 per juta — dan Gemini 3.8 Flash TTS mengenakan biaya $9,00 per juta token audio, yang dinormalisasi oleh Artificial Analysis menjadi $33,00 per juta karakter. Itu adalah selisih 3,0x pada pengukuran, dan itu adalah fakta tunggal terbesar dalam perbandingan ini. Pertanyaan yang menarik bukanlah apakah selisih itu nyata; melainkan apa yang sebenarnya dibeli dengan tambahan enam puluh tujuh dolar per juta karakter, karena jawabannya bukan "ucapan yang lebih baik".

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Tiga meter, bukan satu

Hal pertama yang perlu diluruskan adalah bahwa kedua produk ini tidak mengukur hal yang sama, dan kartu tarif yang dipublikasikan menyembunyikan hal itu.

• ElevenLabs menagih berdasarkan karakter. Eleven v3 adalah $0,10 per 1.000 karakter, dibatasi hingga 5.000 karakter per permintaan. Eleven v3 Conversational adalah $0,05 per 1.000, dan model Flash serta Turbo juga $0,05 per 1.000 tetapi dengan batas permintaan 40.000 karakter dan latensi yang diklaim sekitar ~75 ms dibandingkan dengan ~280 ms pada v3 Conversational.

Google menagih berdasarkan token, dan token audio bukanlah token teks. Gemini 3.8 Flash TTS mengenakan biaya $0.50 per juta token teks masuk dan $9.00 per juta token audio keluar, diukur pada 25 token audio per detik ucapan yang dihasilkan. Tidak ada batas karakter per permintaan yang dipublikasikan.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis tidak menagih salah satu pun; ia menormalkan. Angka $100.00 dan $33.00 per juta karakter di papan peringkat Provider Voice Arena miliknya adalah penyebut umum turunan agar papan tersebut setidaknya dapat memberi peringkat berdasarkan harga. Berguna untuk rasio, bukan untuk kuotasi harga.

Jadi, versi jujurnya dari angka 3,0x itu adalah: pada satu-satunya dasar setara yang tersedia, harga Google sekitar sepertiga. Apa artinya itu dalam spreadsheet Anda sendiri bergantung pada apakah beban kerja Anda didominasi string pendek atau string panjang — meteran audio per detik dan meteran teks per karakter berbeda tajam saat ujaran menjadi semakin panjang, karena keheningan, jeda, dan padding prosodik semuanya memakan token audio dan tidak memakan karakter.

Sebuah bulan yang dikerjakan

Ambil sejuta karakter teks, kira-kira sepanjang novel berukuran sedang, lalu konversikan menjadi ucapan sekali.

• ElevenLabs Eleven v3 — $100.00 untuk sintesis, plus tingkat paket apa pun yang Anda perlukan untuk menjalankannya pada konkurensi Anda. Paket yang dipublikasikan menjalankan Starter seharga $6, Creator seharga $22, Pro seharga $99, Scale seharga $299, dan Business seharga $990, dan jatah karakter sudah termasuk ke dalam paket-paket tersebut alih-alih ditagih secara terpisah.

• Gemini 3.8 Flash TTS — setara $33,00, atau kira-kira $16,50 jika pekerjaan tersebut dapat diproses secara batch, karena tier Batch dan Flex memangkas tarif audio hingga setengahnya menjadi $4,50 per juta token. Layanan Prioritas menaikkannya menjadi $16,20 per juta, atau sekitar setara $59,40, yang masih jauh di bawah ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — $6,00 per juta token audio, setara sekitar $22,10 pada normalisasi yang sama, dengan konsekuensi hanya 101 bahasa, bukan 130.

Jalankan satu juta karakter yang sama melalui harga promosi Google dan selisihnya semakin melebar, karena kedua model Gemini TTS baru dikenakan tarif setengah hingga 31 Desember 2026 lalu menjadi dua kali lipat. Siapa pun yang menyusun studi kelayakan bisnis berdasarkan angka September sedang membangunnya di atas diskon yang memiliki tanggal kedaluwarsa yang dipublikasikan.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

Satu-satunya tempat perbandingan ini berbalik adalah pada ucapan yang sangat pendek. Meteran per karakter hampir tidak menagih apa pun untuk konfirmasi tiga kata; meteran audio per detik menagih untuk detik yang dibutuhkan guna mengucapkan konfirmasi tersebut, termasuk keheningan di sekitarnya. Jika produk Anda adalah antarmuka suara yang dibangun dari respons satu kalimat, perhitungannya bergerak ke arah ElevenLabs. Jika itu adalah narasi, buku audio, pelokalan bentuk panjang, atau apa pun yang teksnya panjang dan audionya lebih panjang, perhitungannya bergerak kuat ke arah Google.

Pertanyaan soal kualitas, sejujurnya

Di Artificial Analysis Provider Voice Arena — voting berpasangan secara buta di antara suara asli masing-masing penyedia — kedua model tersebut tidak berdekatan, dan Google unggul.

• Gemini 3.8 Flash TTS — peringkat 2, Elo 1.260, interval 17 poin, 1.999 sampel, 8 suara arena, dirilis September 2026.

• ElevenLabs Eleven v3 — peringkat 17, Elo 1.167, interval 11 poin, 4.345 sampel, 8 suara arena, tercantum sebagai Februari 2026 di papan peringkat.

Sembilan puluh tiga poin Elo memisahkan keduanya, dan tidak seperti selisih antara tiga teratas di papan itu, selisih ini nyata: interval Eleven v3 adalah 1.156 hingga 1.178 dan interval Gemini adalah 1.243 hingga 1.277, tanpa tumpang tindih. Jumlah sampel Eleven v3 lebih dari dua kali lipat Gemini, jadi estimasinya juga tidak lemah.

Itu adalah hasil yang benar-benar janggal untuk argumen harga, dan hal itu berlawanan dengan kesimpulan yang jelas. ElevenLabs mematok harga tiga kali lebih mahal dan berada tujuh belas peringkat lebih rendah dalam preferensi buta. Apa pun yang dibeli oleh tambahan enam puluh tujuh dolar itu, itu bukanlah suara yang terdengar lebih baik dalam adu langsung.

Apa yang sebenarnya dijual ElevenLabs

ElevenLabs tidak terutama menjual endpoint sintesis, dan menetapkan harga seolah-olah demikianlah yang membuat sebagian besar perbandingan menjadi keliru. Yang dibeli dengan uang itu:

• Pustaka suara. Pustaka suara bersama ElevenLabs berisi ratusan suara dan merupakan permukaan produk yang sesungguhnya — hal yang membuat orang datang ke ElevenLabs sering kali adalah suara tertentu yang mereka dengar di suatu tempat, bukan model di baliknya. Gemini 3.8 Flash TTS hadir dengan 30 suara studio siap pakai, jalur desain suara yang menghasilkan suara dari deskripsi bahasa alami, dan jalur replikasi yang mengkloning dari sampel 30 detik dengan verifikasi persetujuan, tanda air SynthID, dan kredensial C2PA yang terlampir. Katalog bawaannya lebih kecil; kemampuan untuk membuat suara tertentu sebanding.

• Tingkatan latensi sebagai produk terpisah. Flash dan Turbo pada ~75 ms dan batas 40.000 karakter adalah produk yang berbeda dari v3 pada ~280 ms dan 5.000 karakter, dan keduanya lebih murah daripada v3. Jika aplikasi Anda membutuhkan di bawah 100 ms, ElevenLabs menjualnya secara eksplisit dan materi peluncuran Google tidak membuat klaim latensi yang sebanding untuk kedua model TTS baru tersebut.

• Sebuah ekosistem. Dubbing, agen suara, endpoint percakapan, struktur paket dengan konkurensi yang melekat — alasan yang sama Cartesia menjual teleponi: ini adalah stack, bukan model.

Jika Anda membeli stack, 3.0x adalah harga karena tidak merakitnya sendiri. Jika Anda membeli panggilan sintesis, Anda membayarnya untuk pustaka suara dan tier latensi.

Apa yang sebenarnya dijual Google

Kasus tandingannya lebih sempit dan lebih kuat daripada "lebih murah".

• Cakupan bahasa — 130 bahasa di Flash TTS dan 101 di Flash-Lite TTS, terdeteksi otomatis dari teks, dibandingkan dengan 70-an bahasa yang didokumentasikan ElevenLabs untuk Eleven v3. Untuk proses lokalisasi, perbedaan itu bukanlah perbandingan fitur, melainkan kesenjangan cakupan.

• Arahan — kontrol penyampaian baris demi baris, penataan adegan dua pembicara dalam satu panggilan, dan isyarat non-verbal yang ditulis ke dalam naskah sebagai <laughs>, <sigh>, <gasp>, |mhm| dan |yeah|. Google mengklaim generasi 3.8 meningkatkan konsistensi konten panjang dan kontrol dua pembicara dibandingkan Gemini 3.1 Flash TTS, yang memang menjadi tujuan fitur-fitur tersebut. Klaim vendor, belum direproduksi.

• Model state suara — 200 suara kustom stateful per proyek dengan TTL satu tahun, atau suara stateless yang dialamatkan oleh handle voicekey_... yang kedaluwarsa dalam tujuh hari. Itu adalah keputusan infrastruktur yang dapat Anda rencanakan.

• Kontrol keluaran — WAV 24 kHz mono PCM bertanda 16-bit pada endpoint unary, PCM tanpa header (audio/l16) pada endpoint streaming, dan audio/mulaw serta audio/alaw dengan laju sampel yang dapat dikonfigurasi.

Benchmark peluncuran Google dilaporkan oleh vendor dan harus dibaca seperti itu: peringkat pertama pada Hume AI Voice Design Benchmark dengan 71,4 dan peringkat pertama pada pemodelan aksen dengan 60,8, peringkat pertama dan kedua pada Hume Overall Quality Index untuk Flash dan Flash-Lite secara berurutan, serta posisi teratas dalam preferensi buta yang diklaim untuk bahasa Jepang, Portugis Brasil, Vietnam, Arab Standar Modern, Spanyol Meksiko, dan Hindi. Tidak ada satu pun dari pengujian tersebut yang bersifat publik. Elo arena di atas adalah satu-satunya angka yang dikumpulkan secara independen dalam artikel ini, dan kebetulan sejalan dengan arah klaim vendor.

Kalkulus switch

Beralihlah jika beban kerja Anda berdurasi panjang, multibahasa, atau cukup bervolume tinggi sehingga 3.0x muncul sebagai pos biaya, dan jika Anda dapat menerima katalog suara bawaan yang lebih kecil serta tidak adanya tier sub-100 ms yang dipublikasikan. Ini mencakup narasi, dubbing, aksesibilitas, dan sebagian besar ucapan yang tertanam dalam produk.

Tetap di sini jika Anda membeli stack — pustaka suara, tingkatan latensi, produk dubbing dan agen — atau jika beban kerja Anda didominasi oleh ucapan yang sangat singkat di mana pengukur audio per detik menghukum Anda. Tetap di sini juga jika Anda sudah melakukan fine-tuning identitas suara di ElevenLabs yang dikenali oleh pengguna Anda, karena kesinambungan suara adalah fitur produk dan membuatnya kembali pada model baru merupakan sebuah proyek.

Apa pun pilihannya, langkah yang bijak adalah menjalankan keduanya selama sebulan pada lalu lintas nyata sebelum memutuskan, dan itulah alasan untuk tidak menghubungkan salah satunya secara langsung ke basis kode Anda. OrcaRouter menempatkan 200+ model di balik satu kunci dengan harga daftar penyedia tanpa markup, sehingga perubahan harga dari salah satu lab sampai ke tagihan Anda pada hari yang sama, bukan saat perpanjangan, dan failover otomatis menjaga jalur suara produksi tetap hidup ketika endpoint yang baru saja dirilis bermasalah. Kami tidak menghosting ElevenLabs — lapisan sintesis dan agent-nya adalah produk mereka sendiri — dan kami tidak menghosting endpoint TTS Gemini 3.8, yang berasal dari API Google. Yang kami sediakan adalah lapisan teks di bawahnya dan perutean di atasnya.

Angka yang layak diperhatikan adalah Elo Eleven v3 pada revisi papan peringkat berikutnya. Sembilan puluh tiga poin adalah defisit besar bagi model yang mematok harga tiga kali lipat, dan jika intervalnya menyempit tanpa selisihnya menutup, argumen harga berhenti menjadi pertukaran dan menjadi vonis.