Kartu hero yang dihasilkan untuk 'Gemini 3.8 TTS vs Qwen Audio 3.0 TTS' dengan latar belakang putih dan aksen gradien biru-cyan yang lembut. Kartu kiri 'Qwen-Audio-3.0-TTS-Plus' mencantumkan Elo 1.259, 15 suara arena, 16 bahasa + 20 dialek, dan $27,6 per 1 juta karakter; kartu kanan 'Gemini 3.8 Flash TTS' mencantumkan Elo 1.260, 8 suara arena, 130 bahasa, dan $33,0 per 1 juta karakter. Baris footer berbunyi 'Elo per Artificial Analysis Provider Voice Arena, Sept 2026.' Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Engineering & Research

Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: Dua Jawaban Berbeda untuk "Buat Suaranya Terdengar Tepat"

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Satu poin Elo memisahkan kedua model ini di Artificial Analysis Provider Voice Arena, dan mereka mencapainya dengan menyelesaikan masalah yang sepenuhnya berbeda. Qwen-Audio-3.0-TTS-Plus berada di peringkat 3 dengan Elo 1.259 dari 1.447 sampel dan 15 suara arena, dirilis September 2026 dan terdaftar pada $27,60 per juta karakter. Gemini 3.8 Flash TTS berada di peringkat 2 dengan 1.260 dari 1.999 sampel dan 8 suara arena, dirilis 23 September 2026 dan terdaftar pada $33,00 per juta karakter. Secara statistik tidak dapat dibedakan, selisih dua puluh persen dalam harga, dan dibangun di atas teori yang berlawanan tentang apa yang membuat ucapan sintetis bagus.

Teori adalah bagian yang menarik. Jawaban Qwen adalah kontrol inline: 86 tag penyampaian yang Anda taburkan di sepanjang teks sehingga model tahu di mana harus bernapas, memberi penekanan, dan mengubah register. Jawaban Google adalah lapisan pengarahan: instruksi baris demi baris, penataan dua pembicara, dan sekumpulan kecil isyarat nonverbal. Jika Anda sudah membangun pipeline yang menghasilkan anotasi mirip SSML, salah satu dari ini akan cocok dan yang lain tidak, dan kompatibilitas itu lebih penting daripada satu poin Elo.

Di mana keduanya sebenarnya berada di papan

Membaca Provider Voice Arena secara jujur memerlukan pemeriksaan interval, bukan peringkat.

• Qwen-Audio-3.0-TTS-Plus — peringkat 3, Elo 1.259, 1.447 sampel, 15 suara arena, September 2026, $27,6 per 1 juta karakter.

• Gemini 3.8 Flash TTS — peringkat 2, Elo 1.260, 1.999 sampel, 8 suara arena, September 2026, $33,0 per 1 juta karakter.

• Cartesia Sonic 3.6 — peringkat 1, Elo 1.273, 1.757 sampel, 8 suara arena, Agustus 2026, $49,0 per 1 juta karakter.

Tiga teratas adalah satu kelompok. Interval yang dipublikasikan pada dua teratas membentang tujuh belas poin di kedua sisi, yang lebih lebar daripada seluruh rentang antara peringkat pertama dan ketiga, sehingga urutan di antara mereka bukanlah bukti yang stabil. Yang memang ditetapkan oleh papan peringkat adalah bahwa ketiganya berada dalam kelompok terdepan dan bahwa tidak ada yang di bawah mereka yang dekat — peringkat 10, Gemini 3.1 Flash TTS, berada di 1.199.

Satu-satunya asimetri yang perlu diperhatikan adalah jumlah suara di arena. Qwen menurunkan 15 suara, sedangkan Gemini 8, sehingga skor Qwen adalah rata-rata dari sampel yang lebih luas atas produk milik vendor itu sendiri. Hal ini bisa dibaca dua arah: ini adalah perkiraan yang lebih adil tentang bagaimana katalog Qwen terdengar secara keseluruhan, dan ini memberi Qwen lebih banyak peluang untuk menampilkan suara lemah yang menyeret rata-rata ke bawah. Tidak ada dari kedua pembacaan itu yang mengubah kesimpulan bahwa keduanya imbang.

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 tag pengiriman terhadap lapisan arah

Inilah perbedaan substantifnya, dan inilah yang menentukan sebagian besar integrasi.

Qwen-Audio-3.0-TTS menyertakan 86 tag penyampaian inline — anotasi yang tertanam dalam teks yang mengontrol bagaimana suatu rentang diucapkan. Ini adalah pendekatan markup: skrip Anda yang membawa performanya. Itu sudah tidak asing bagi siapa pun yang pernah bekerja dengan SSML, dan ini berpadu baik dengan perkakas yang menghasilkan teks secara terprogram, karena permukaan kontrolnya adalah transformasi string, bukan panggilan API.

Gemini 3.8 Flash TTS mengambil jalur lain. Anda mengarahkan sebuah baris seperti Anda mengarahkan seorang aktor — tempo, penekanan, register emosional — sebagai instruksi terpisah, bukan sebagai markup inline. Adegan dua pembicara dapat dipentaskan dalam satu panggilan. Dan seperangkat kecil isyarat non-verbal dituliskan ke dalam skrip: <laughs>, <sigh>, <gasp> sebagai isyarat inline, ditambah |mhm| dan |yeah| untuk suara back-channel.

Jadi kedua model menerima anotasi dalam teks; perbedaannya terletak pada ukuran kosakata dan di mana kendali lainnya berada. Qwen lebih luas dan lebih datar — 86 tag, semuanya di dalam teks. Google lebih sempit di dalam teks dan lebih luas di luarnya, dengan arah penyampaian dan penataan pembicara sebagai parameter tingkat panggilan. Jika Anda mem-port sistem yang sudah menghasilkan markup inline yang kaya, Qwen adalah port yang lebih singkat. Jika Anda tetap membangun logika arahan di kode aplikasi, pemisahan Google lebih rapi.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Cakupan bahasa versus cakupan dialek

Angka cakupan tersebut tidak sebanding, dan membandingkannya secara naif adalah suatu kesalahan.

Gemini 3.8 Flash TTS mencakup 130 bahasa, yang terdeteksi otomatis dari teks; Flash-Lite TTS mencakup 101. Itulah keluasan lintas rumpun bahasa, yang Anda inginkan untuk proses lokalisasi yang harus menjangkau ekor panjang pasar.

Qwen-Audio-3.0-TTS mencakup 16 bahasa plus 20 wilayah dialek Tiongkok. Itu adalah kedalaman di dalam satu rumpun bahasa. Dua puluh wilayah dialek bukanlah angka yang lebih kecil daripada 130 bahasa seperti yang terlihat — itu adalah jenis klaim yang berbeda, dan bagi produk yang melayani pengguna penutur bahasa Tiongkok di berbagai wilayah daratan, klaim itu justru lebih berguna. Model dengan 130 bahasa dan satu suara Mandarin tidak melayani pengguna di Sichuan seperti halnya model dengan 20 wilayah dialek.

Yang mana yang penting sepenuhnya bergantung pada audiens Anda. Jika kebutuhan Anda adalah "setidaknya cukup dapat diterima di dua puluh pasar", Gemini. Jika "benar-benar tepat di pasar Tiongkok", Qwen.

Harga, dan apa yang disembunyikan oleh angka per karakter

• Qwen-Audio-3.0-TTS-Plus — $27,60 per 1 juta karakter berdasarkan basis normalisasi papan peringkat; varian Flash sekitar $15 per 1 juta karakter dengan klaim latensi paket pertama sekitar 300 ms.

• Gemini 3.8 Flash TTS — $33,00 per 1 juta karakter yang dinormalisasi; ditagih oleh Google sebesar $0,50 per juta token teks masuk dan $9,00 per juta token audio keluar hingga 31 Desember 2026, lalu $1,00 dan $18,00.

• Gemini 3.8 Flash-Lite TTS — $22,10 per 1 juta karakter yang dinormalisasi pada peringkat 6 dengan Elo 1.235; ditagih $6,00 per juta token audio hingga 31 Desember 2026.

Kedua angka per karakter tersebut adalah normalisasi Artificial Analysis, bukan harga daftar vendor — Qwen menagih melalui Alibaba Cloud Model Studio dan Google menagih dalam token, dan tidak satu pun menerbitkan tarif per karakter untuk model-model ini. Gunakan angka-angka itu untuk rasionya, yang kira-kira 1,2 kali lebih menguntungkan Qwen, dan bukan sebagai penawaran harga.

Tingkatan-tingkatan ini berbeda bentuknya. Qwen terbagi menjadi Plus dan Flash, dengan tier Flash menukar kualitas demi klaim paket pertama ~300 ms. Google terbagi menjadi Flash dan Flash-Lite, lalu lebih jauh lagi menjadi Standard, Batch dan Flex, serta Priority — $4,50, $9,00, dan $16,20 per juta token audio pada Flash TTS. Model Google memberi imbalan atas pengklasifikasian beban kerja Anda; model Qwen memberi imbalan atas pemilihan tier kualitas di muka.

Ketersediaan adalah perbedaan nyata lainnya. Gemini 3.8 Flash TTS tersedia secara umum di Gemini Developer API. Qwen-Audio-3.0-TTS bersifat tertutup dan hanya dihosting, dilayani melalui Alibaba Cloud Model Studio tanpa bobot terbuka. Jika Anda perlu menjalankan modelnya sendiri, keduanya bukan untuk Anda — tetapi jika infrastruktur Anda sudah berada di Alibaba Cloud, model Qwen-lah yang tidak menyisakan persoalan egress untuk dipikirkan.

Klaim vendor di kedua belah pihak

Tak satu pun model memiliki tolok ukur independen di luar arena, dan kedua vendor telah menerbitkan klaim yang sepatutnya diberi label demikian.

Milik Google, untuk Gemini 3.8 Flash TTS: peringkat pertama pada Hume AI Voice Design Benchmark dengan 71,4, peringkat pertama pada pemodelan aksen dengan 60,8, peringkat pertama dan kedua pada Hume Overall Quality Index untuk Flash dan Flash-Lite, serta posisi teratas dalam preferensi buta yang diklaim pada bahasa Jepang, Portugis Brasil, Vietnam, Arab Standar Modern, Spanyol Meksiko, dan Hindi. Uji coba tersebut tidak dipublikasikan.

Milik Alibaba, untuk Qwen-Audio-3.0-TTS: sistem penyampaian 86 tag, 20 wilayah dialek, dan angka paket pertama ~300 ms pada varian Flash. Juga tidak tereproduksi.

Elo arena adalah satu-satunya angka kualitas yang dikumpulkan secara independen dalam artikel ini, dan angka itu menunjukkan keduanya berada di posisi teratas papan peringkat.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Apa yang ditambahkan Gemini yang tidak ditambahkan Qwen?

Pembuatan suara adalah celah yang paling jelas. Gemini 3.8 Flash TTS mendukung desain suara dari deskripsi bahasa alami dan replikasi suara dari sampel 30 detik, dengan verifikasi persetujuan serta tanda air SynthID plus kredensial C2PA pada outputnya. Suara kustom hadir dalam dua bentuk: 200 suara stateful per proyek dengan masa berlaku satu tahun, atau suara stateless yang dialamatkan dengan voicekey_... handle yang kedaluwarsa setelah tujuh hari. Remixing suara tercantum akan segera hadir.

Kontrol format output adalah yang kedua. WAV 24 kHz mono PCM bertanda 16-bit di endpoint unary, PCM tanpa header (audio/l16) di endpoint streaming, plus audio/mulaw dan audio/alaw serta sample rate yang dapat dikonfigurasi. Untuk pekerjaan yang terkait teleponi, dukungan mulaw menghilangkan satu langkah transcoding.

Yang mana yang harus dihubungi

Pilih Qwen-Audio-3.0-TTS jika pengguna Anda berbahasa Tionghoa dan cakupan dialek menjadi persyaratannya, jika Anda menginginkan kosakata markup inline yang kaya yang dapat langsung dihasilkan oleh generator Anda, atau jika Anda sudah menggunakan Alibaba Cloud dan menginginkan jalur tercepat menuju endpoint yang berfungsi. Ini juga yang lebih murah di antara keduanya pada basis ternormalisasi, dan varian Flash bahkan lebih murah lagi jika paket pertama ~300 ms dapat diterima.

Pilih Gemini 3.8 Flash TTS jika Anda membutuhkan cakupan luas di banyak bahasa alih-alih kedalaman pada satu bahasa, jika Anda perlu membuat atau mereplikasi suara tertentu, jika Anda memerlukan keluaran mulaw atau alaw, atau jika "tersedia secara umum alih-alih hanya di-hosting" merupakan persyaratan pengadaan.

Keduanya bukan pilihan buruk dan tidak ada yang jelas lebih baik — itulah inti dari selisih satu poin Elo. Keputusannya adalah kompatibilitas, bukan kualitas.

Itu juga argumen untuk belum berkomitmen penuh pada salah satunya untuk saat ini. OrcaRouter memberi Anda 200+ model di balik satu kunci dengan harga daftar penyedia tanpa markup, sehingga perubahan tarif dari salah satu lab sampai ke tagihan Anda pada hari yang sama, bukan saat perpanjangan, dan failover otomatis berarti endpoint sintesis yang tersendat di bawah beban akan dialihkan ke yang lain alih-alih membuang permintaan. Kami tidak menghosting Qwen-Audio-3.0-TTS — itu dilayani melalui Alibaba Cloud Model Studio — dan kami tidak menghosting endpoint TTS Gemini 3.8, yang berasal dari API Google. Yang kami sediakan adalah lapisan teks dan perutean di atasnya, yang memungkinkan Anda menjalankan keduanya pada lalu lintas nyata selama sebulan sebelum Anda memilih.

Angka yang perlu dicermati adalah revisi arena berikutnya. Dengan 1.447 sampel pada Qwen dan 1.999 pada Gemini, kedua interval masih cukup lebar sehingga suara dalam satu bulan bisa memisahkan keduanya — atau mengonfirmasi bahwa hasil seri adalah jawabannya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari