Kartu hero yang dihasilkan untuk 'Gemini 3.8 Live vs Qwen-Audio-3.1-TTS' di atas latar belakang putih dengan aksen gradien biru dan sian yang lembut. Dua panel berada di bawah judul yang berbunyi 'Dua bagian, diperbarui dengan selisih delapan hari'. Panel kiri mencakup '15 Sept 2026 — Gemini 3.8 Live dan Extended Thinking pada Live API'. Panel kanan mencakup '23 Sept 2026 — Qwen-Audio-3.1-TTS di Apsara, sintesis dipangkas ~70%'. Baris footer berbunyi 'Keduanya bertemu di tengah-tengah pipeline, bukan pada pekerjaan yang sama.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: Dua Bagian dari Tumpukan Suara, Dihargai Ulang Berselang Delapan Hari

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Gemini 3.8 Live adalah model ucapan-ke-ucapan milik Goog​le, yang dirilis pada 15 September 2026 sebagai gemini-3.8-live dan gemini-3.8-live-extended-thinking di Live API. Qwen-Audio-3.1-TTS adalah model text-to-speech milik Aliba​ba, yang diumumkan pada Apsara Conference di Hangzhou pada 23 September 2026, delapan hari kemudian, dengan pemotongan harga sekitar 70% untuk sintesis ucapan yang menyertainya. Jeda delapan hari itulah alasan perbandingan ini layak dibaca sekarang alih-alih pada Juli. Tidak ada yang berubah dari peran kedua produk — yang satu mendengarkan dan berbicara, yang lain membacakan teks dengan lantang — tetapi kedua bagian dari pipeline suara produksi dibangun ulang atau diberi harga baru dalam satu periode dua minggu, dan aritmetika yang dulu menentukan pertarungan ini diam-diam bergeser.

Dua bagian, diperbarui dengan jeda delapan hari

Mulai dari hal yang membuat pasangan ini tidak biasa: kedua model tidak bersaing. Produk suara punya mulut dan punya telinga, dan keduanya masing-masing satu. Gemini 3.8 Live menutup siklus — audio dan video masuk, audio keluar, interupsi ditangani, panggilan alat berjalan di balik percakapan. Qwen-Audio-3.1-TTS menerima string dan suara referensi lalu mengembalikan sebuah performa. Ia lebih baik sebagai mulut daripada sebagai apa pun, dan ia tidak berusaha menjadi telinga.

Yang membuat penentuan waktu September menarik adalah bahwa kedua pengumuman itu menyasar ujung-ujung yang berlawanan dari lini anggaran yang sama. Peluncuran Google pada 15 September adalah kisah kemampuan tanpa disertai perubahan harga; pengumuman Alibaba pada 23 September sebagian besar adalah kisah margin, dengan kemampuan baru yang ikut menyertainya. Tim yang membangun pipeline hibrida pada Agustus, dalam rentang delapan hari, telah diberi alasan untuk meninjau kembali kedua bagiannya — dan hanya satu dari bagian itu yang menjadi lebih murah.

Apa yang sebenarnya diubah oleh rilis 3.1 di sisi Qwen

Aliba​ba tidak merilis satu model saja pada 23 September. Generasi 3.1 mencakup lima endpoint — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next, dan Qwen-Audio-3.1-Realtime — dan hanya satu di antaranya, yakni tier TTS biasa, yang bisa langsung dipakai sebagai pengganti oleh siapa pun yang sudah memanggil model TTS 3.0.

Pada tier itu, tiga hal berubah dan salah satunya adalah biaya migrasi yang sesungguhnya. Kontrol penyampaian berpindah dari kosakata tetap berisi 86 tag inline ke instruksi bahasa alami: Anda mendeskripsikan emosi, tempo, dan gaya yang diinginkan alih-alih menyisipkan braket yang tepat pada posisi yang tepat. Transfer timbre lintas bahasa hadir, memungkinkan satu suara referensi membawa identitasnya melintasi bahasa Mandarin, Kanton, Inggris, dan Jepang. Dan model kini mentoleransi audio referensi yang berderau atau bergema secara langsung, tanpa langkah penghilangan derau terpisah. Cakupan bahasa tidak berubah, yakni 16 bahasa menurut laporan vendor plus 20 wilayah dialek Tionghoa, dan — ini layak ditandai karena di tempat lain hal ini sering dikesampingkan — materi Aliba​ba sendiri menyebut bahwa tier 3.1 menambahkan tujuh bahasa, yang tidak selaras dengan 16 bahasa yang dicantumkan dalam cakupan yang dipublikasikan untuk generasi Juli. Perlakukan kedua angka itu sebagai laporan vendor sampai Anda memeriksa bahasa spesifik yang Anda butuhkan di Model Studio.

Produk yang benar-benar baru dalam rilis ini adalah Qwen-Audio-3.1-TTS-Next, yang oleh Alibaba disebut model "Audiogen": satu proses yang menghasilkan suara, efek suara, dan ambiens latar belakang secara bersamaan, untuk dialog multi-pembicara, perakitan podcast, dan pengerjaan adegan. Harganya $0,848 per juta token input dan $1,696 per juta token output di node Beijing, dibatasi maksimum 3.000 karakter input, 240 detik audio yang dihasilkan untuk podcast dan 120 detik untuk lainnya, tiga permintaan per detik, menerima hingga tiga klip referensi yang masing-masing berdurasi 30 detik. Model ini hanya menangani bahasa Mandarin dan Inggris. Jika pipeline Anda adalah narator tunggal yang membacakan skrip, produk itu tidak relevan bagi Anda; jika pipeline Anda adalah dua pembawa acara dan musik latar, itulah alasan untuk benar-benar melihat rilis ini.

Jahitan itulah yang sebenarnya Anda pilih.

Karena kedua model tidak melakukan pekerjaan yang sama, keputusan ini bukanlah sebuah adu uji coba. Ini adalah pertanyaan tentang di mana Anda meletakkan titik serah terima, dan seberapa besar Anda bersedia membayar agar sambungannya tidak terlihat.

Ada dua arsitektur yang jujur. Yang pertama adalah satu jaringan: Gemini 3.8 Live menangani seluruh giliran, mendengar pemanggil, memutuskan apa yang akan dikatakan dan mengatakannya, dan Anda menerima suara yang diberikannya — yang tidak dapat Anda kloning dan tidak dapat Anda jadikan merek. Yang kedua adalah kaskade: pengenalan, lalu penalaran, lalu Qwen-Audio-3.1-TTS sebagai mulut, memberi Anda seribu suara—termasuk salah satu yang direkam oleh pengisi suara Anda sendiri—dengan mengorbankan latensi di dua atau tiga batas vendor dan prosodi yang hilang saat sebuah kalimat dipecah oleh panggilan API.

Sebagian besar tim akhirnya memilih pendekatan hibrida, dan itu bukanlah kegagalan nyali. Gunakan model real-time di mana latensi terasa — interupsi, pengakuan, "mm-hm" yang memberi tahu penelepon bahwa Anda masih ada — dan model sintesis di mana kualitas terdengar: pembacaan ulang kebijakan yang panjang, nomor konfirmasi yang dibacakan dengan tempo yang terukur, suara bermerek yang harus identik pada setiap panggilan. Pendekatan hibrida adalah jawaban yang tepat untuk banyak kelas produk. Ini juga titik di mana model biaya menjadi sulit, karena Anda sekarang mengukur dua unit yang berbeda.

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

Dihargai per jam audio, satu-satunya satuan yang cocok untuk keduanya.

Google menagih Live API per menit; Alibaba menagih tingkatan Qwen TTS per karakter dan per token. Untuk membandingkannya, Anda harus memilih normalizer, dan satu-satunya yang dapat dipertahankan untuk suara adalah jam audio yang sudah selesai.

• Dihitung masuk — Gemini 3.8 Live per menit audio, $0,005 masuk dan $0,018 keluar vs Qwen-Audio-3.1-TTS per juta karakter, dengan tier 3.0 Plus berada di sekitar $27,60 dan tier Flash sekitar $15 sebelum pemotongan, dan tier TTS Flash terdaftar pada 1,5 yuan per juta token input dan 12 yuan per juta token output setelahnya
• Dihitung keluar — Gemini 3.8 Live percakapan dua arah sekitar $1,38 untuk satu jam waktu bicara aktual pada harga daftar, sebelum caching apa pun vs Qwen-Audio-3.1-TTS aliran satu arah, dengan tier 3.1-Next pada $0,848 per juta token input dan $1,696 per juta token output di node Beijing
• Mendengar penelepon — Gemini 3.8 Live ya, input audio dan video native vs Qwen-Audio-3.1-TTS tidak, teks masuk dan audio keluar
• Suara — Gemini 3.8 Live satu suara, tidak dapat dikloning, tidak dapat dijadikan merek vs Qwen-Audio-3.1-TTS lebih dari seribu dengan kloning zero-shot dari audio referensi berisik
• Bahasa — Gemini 3.8 Live 97 menurut laporan vendor, beralih di tengah percakapan vs Qwen-Audio-3.1-TTS 16 menurut laporan vendor plus 20 wilayah dialek Tionghoa, dengan transfer timbre lintas Mandarin, Kanton, Inggris, dan Jepang
• Kontrol penyampaian — Gemini 3.8 Live prompt dan konteks percakapan vs Qwen-Audio-3.1-TTS instruksi bahasa alami, menggantikan 86 tag inline generasi 3.0
• Skor independen — Gemini 3.8 Live 82,6 pada Artificial Analysis Speech to Speech Index untuk varian Extended Thinking dan 76,0 untuk varian standar vs Qwen-Audio-3.1-TTS tidak ada; angka Qwen terdekat adalah 1.259 Elo untuk tier 3.0 Plus generasi sebelumnya pada Provider Voice Arena, yang merupakan skor pendahulunya dan bukan model ini

Potongan persentase itu dihitung berdasarkan tarif yang bervariasi menurut wilayah dan tier, jadi angka utama 70% bukan janji tentang trafik Anda, dan Alibaba Cloud juga memindahkan transkripsi real-time di node Singapura dari pengukuran berbasis durasi ke berbasis token — yang merupakan dasar yang lebih sulit diprediksi, karena keheningan dan konteks multi-turn sama-sama meningkatkan konsumsi token. Bandingkan kartu tarif baru dengan audio Anda sendiri.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

Apa yang tidak diselesaikan oleh upgrade 3.1

Inilah bagian yang mudah salah di kedua arah. Peningkatan 3.1 tidak menjadikan Qwen-Audio-3.1-TTS kandidat untuk pekerjaan yang dilakukan Gemini 3.8 Live — kontrol berbasis instruksi, transfer timbre, dan toleransi terhadap masukan berisik semuanya membuatnya menjadi mulut yang lebih baik, dan tak satu pun darinya memberinya telinga. Sama halnya, posisi benchmark Gemini 3.8 Live tidak memberi tahu Anda apa pun tentang apakah suara bermerek Anda bertahan dalam satu kalimat dalam bahasa Kanton.

Ada juga celah dalam bukti yang membuat pemotongan harga semakin menggoda untuk diabaikan. Qwen-Audio-3.1-TTS tidak memiliki skor independen. Elo 1.259 yang muncul di samping nama Qwen di Provider Voice Arena adalah milik Qwen-Audio-3.0-TTS-Plus, model yang sedang digantikan, diukur pada 1.447 sampel. Baris Arena milik penerusnya sendiri belum ada. Jika proses persetujuan akhir Anda memerlukan angka pihak ketiga — dan untuk suara merek, seharusnya begitu — model yang lebih baru adalah model yang belum memilikinya, dan tier yang lebih murah adalah yang belum dapat Anda pertahankan. Satu-satunya peristiwa yang akan menyelesaikan ini adalah munculnya Qwen-Audio-3.1-TTS di papan uji dengar buta.

Di mana satu kunci membantu dan tidak membantu

Salah satu konsekuensi dari rilis 3.1 mudah terlewat karena tampak seperti detail rekayasa prompt, bukan detail infrastruktur. Mengganti 86 tag hardcoded dengan instruksi bebas bentuk mengubah arahan penyampaian Anda menjadi artefak teks. Anda kini menghasilkannya, memberi versi padanya, dan memvalidasi ulang setiap satunya terhadap interpretasi model baru — dan mode kegagalannya adalah drift, bukan error, karena dua frasa dari "hangat tetapi tidak sentimentil" tidak akan tersampaikan secara identik.

Itu adalah masalah inferensi teks yang melingkupi pipeline ucapan, dan di situlah kami berguna. OrcaRouter tidak merutekan Qwen-Audio-3.1-TTS atau model Qwen-Audio mana pun, dan kami juga tidak merutekan endpoint Gemini 3.8 Live — tidak satu pun dari dua bagian tumpukan ini dapat dipanggil melalui kami, dan tidak ada yang di sini boleh dibaca sebagai klaim bahwa hal itu bisa. Yang kami sediakan adalah lapisan yang menulis dan memeriksa teks arahan: qwen/qwen3.8-flash dan google/gemini-3.8-flash di antara lebih dari 200 model dari satu kunci dengan harga daftar penyedia tanpa markup, dengan DSL perutean yang menggabungkan beberapa model menjadi satu panggilan dan failover otomatis saat upstream menurun. Ketika Anda akan memvalidasi ulang sepuluh ribu prompt pengiriman terhadap model yang baru saja mengubah cara model itu membacanya, menghasilkan varian dan memberi skor pada varian tersebut untuk konsistensi adalah bagian yang seharusnya menjadi satu kontrak, bukan empat.

Apa yang harus diukur sebelum Anda memilih

Tiga eksperimen menjawab lebih banyak daripada rapat dewan mana pun. Uji satu suara referensi dan satu paragraf naskah Anda sendiri dengan Qwen-Audio-3.1-TTS dan dengarkan apakah kontrol berbasis instruksi memberi Anda penyampaian yang sama dua kali — itulah risiko migrasi, dan mengukurnya lebih murah daripada merencanakannya. Uji rekaman panggilan nyata dengan kebisingan latar Anda sendiri melalui Gemini 3.8 Live dan periksa apakah pergantian giliran tetap terjaga ketika penelepon menyela di tengah kata — itulah yang coba dikuantifikasi oleh indeks speech-to-speech, dan itu tidak cukup andal bertahan saat bersentuhan dengan saluran telepon nyata untuk bisa diterima begitu saja. Dan hitunglah aritmetika volume Anda sendiri dalam jam audio, bukan dalam satuan yang dipakai kedua vendor untuk menagih, karena pada pasangan khusus ini perbedaan harga yang diharapkan antara "TTS Tiongkok murah" dan "andalan Goog​le" tidak pernah sebesar yang terlihat, dan setelah 23 September bahkan lebih kecil lagi.

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari