Kartu hero yang membandingkan Qwen-Audio-3.1-TTS dengan ElevenLabs Eleven v3, mencantumkan 16 bahasa plus 20 dialek milik Qwen, potongan harga 70%, dan ketiadaan skor arena versus 74 bahasa ElevenLabs, sekitar $100 per juta karakter, dan Elo 1.168, di atas pita bertuliskan 'Diumumkan di Apsara, 23 September 2026'.
Guides & Insights

Qwen-Audio-3.1 vs ElevenLabs: Pemotongan Harga 70% Menantang Pemain yang Sudah Mapan

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Vendor tersebut memangkas harga API Qwen-Audio-3.1-TTS miliknya sekitar 70% pada 23 September 2026, yang diumumkan di atas panggung pada Apsara Conference di Hangzhou bersama empat model suara lainnya. Angka tunggal itulah alasan perbandingan ini layak ditulis: ElevenLabs Eleven v3 telah menjadi suara produksi default bagi sebagian besar tim Barat dengan tarif efektif mendekati $100 per juta karakter, dan penantang yang kredibel baru saja menetapkan harga ulang untuk pekerjaan yang sama dengan sebagian kecil dari itu sekaligus memperluas cakupan bahasa pada saat yang bersamaan. Kedua sistem ini tidak setara — Qwen-Audio-3.1-TTS adalah API yang hanya tersedia sebagai layanan hosted dari Tongyi Lab milik vendor tersebut dengan ekosistem suara yang lebih kecil, sedangkan ElevenLabs adalah platform konten lengkap dengan pustaka suara terdalam di industri. Namun jika keputusan Anda pernah ditentukan oleh tagihan, aritmatikanya berubah minggu ini.

Apa yang sebenarnya dirilis pada 23 September

Qwen-Audio-3.1 bukan satu model. Ini adalah penyegaran lima model untuk seluruh stack ucapan Alibaba, dan tingkatannya penting karena harga dan tugasnya berbeda:

Qwen-Audio-3.1-TTS — penerus langsung dari model sintesis yang paling banyak digunakan tim. Menambahkan tujuh bahasa sehingga totalnya menjadi 16, mempertahankan 20 wilayah dialek Tionghoa, menambahkan transfer timbre lintas bahasa yang alami (satu suara yang terbawa melintasi Mandarin, Kanton, Inggris, Jepang), kontrol berbasis instruksi untuk emosi, tempo, dan gaya penyampaian, serta menangani audio referensi yang berisik, bergema, atau buruk lainnya tanpa mode penghilangan derau terpisah.

Qwen-Audio-3.1-TTS-Next — tier baru, dan produk yang berbeda. Alibaba menyebutnya model "Audiogen": model ini menghasilkan suara, efek suara, dan ambiens latar dalam satu kali proses dari teks, stempel waktu, dan audio referensi. Dialog multi-pembicara, podcast, lanskap suara film dan TV, output 48 kHz. Menurut dokumentasi Model Studio Alibaba Cloud, model ini menerima input hingga 3.000 karakter, membatasi audio yang dihasilkan pada 240 detik untuk podcast dan 120 detik untuk selainnya, berjalan pada 3 permintaan per detik, dan mengembalikan WAV, MP3, atau PCM.

Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next dan Qwen-Audio-3.1-Realtime — masing-masing untuk pengenalan, pemahaman audio (emosi, musik, suara lingkungan, pelokalan peristiwa) dan percakapan dupleks penuh. Realtime adalah yang didorong Alibaba ke perangkat keras: Qwen Office, Qoder, QwenNote A2, robot desktop QwenNote Eva dan kacamata Qwen AI.

Pemotongan harga berlaku di seluruh lini, bukan hanya TTS: sintesis turun sekitar 70%, realtime turun sekitar 85%, pengenalan turun hingga 95%. Alibaba juga merilis Qwen-Audio-Agent sebagai open source, sebuah kerangka kerja untuk membangun agen suara realtime, dan memperkenalkan Qwen3.8-LiveTranslate dengan latensi ditekan hingga di bawah 2,5 detik.

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

Papan skor

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

Harga — Qwen-Audio-3.1-TTS: sekitar 70% lebih rendah daripada generasi Qwen-Audio sebelumnya, yang menempatkan tier 3.0 Plus di kisaran $27,60 per 1 juta karakter dan tier Flash di kisaran $15. ElevenLabs Eleven v3: sekitar $100 per 1 juta karakter berdasarkan pelacakan Artificial Analysis, dengan Flash sekitar $50.

Bahasa — Qwen-Audio-3.1-TTS: 16 bahasa ditambah 20 wilayah dialek Tiongkok. ElevenLabs Eleven v3: 74 bahasa.

Bobot — Qwen-Audio-3.1-TTS: tertutup, hanya dihosting di Alibaba Cloud Model Studio. ElevenLabs Eleven v3: tertutup, hanya dihosting.

Pustaka suara — Qwen-Audio-3.1-TTS: kloning native plus transfer timbre lintas bahasa; tidak ada marketplace publik yang sebanding. ElevenLabs: pustaka suara bersama terbesar di industri, plus kloning instan dari sekitar 30 detik audio.

Kontrol penyampaian — Qwen-Audio-3.1-TTS: emosi, tempo, dan gaya berbasis instruksi, mewarisi 86 tag penyampaian inline yang diperkenalkan pada 3.0. ElevenLabs Eleven v3: tag audio plus platform di sekitarnya (dubbing, agen, studio).

Tolok ukur independen — Qwen-Audio-3.1-TTS: belum ada. ElevenLabs Eleven v3: 1.168 Elo di papan peringkat Provider Voice Arena milik Artificial Analysis per Agustus 2026.

Di mana penantang benar-benar menang

Tiga hal, dan hanya satu di antaranya soal harga.

Harga, tentu saja. Pemotongan 70% dibandingkan penyedia mapan bertarif $100 per juta karakter bukanlah selisih pembulatan. Ini adalah perbedaan antara produk yang Anda gunakan untuk prototipe dan produk yang Anda rilis kepada setiap pengguna. Jika Anda menghasilkan narasi dalam jumlah besar, penghematan tahunannya bukanlah pos anggaran yang harus Anda perjuangkan secara internal — penghematan itu berbicara sendiri.

Bahasa Tionghoa, tanpa keraguan. Dua puluh wilayah dialek Tionghoa adalah parit pertahanan yang tidak bisa didekati oleh apa pun yang ditawarkan ElevenLabs. Jika produk Anda melayani pengguna Tionghoa daratan, atau penutur bahasa Kanton, atau audiens diaspora yang beralih kode di tengah kalimat, perbandingannya sudah selesai sebelum dimulai.

Transfer timbre lintas bahasa. Qwen-Audio-3.1-TTS mengambil satu suara dan membawanya secara alami melintasi bahasa Mandarin, Kanton, Inggris, dan Jepang. Itu adalah kemampuan spesifik dengan kasus penggunaan yang spesifik — satu suara bermerek yang tetap bertahan saat berganti bahasa — dan ini merupakan pembeda nyata bagi siapa pun yang melokalkan satu penyiar alih-alih mencari yang baru untuk setiap pasar.

Di mana ElevenLabs masih unggul, dan tidak ada yang mendekati.

Cakupan bahasa adalah hal pertama, dan itu yang terbesar. Tujuh puluh empat bahasa berbanding enam belas bukanlah kesenjangan yang bisa ditutup dengan pengumuman harga. Jika Anda merilis dalam bahasa Polandia, Turki, Vietnam, dan Portugis, ElevenLabs sudah mendukung Anda saat ini dan Qwen-Audio-3.1-TTS tidak.

Yang kedua adalah ekosistem. ElevenLabs bukanlah endpoint sintesis; ia adalah platform konten. Pustaka suara bersama yang dapat Anda lisensikan alih-alih kloning, alur kerja dubbing, infrastruktur agen, produk studio, permukaan API yang terdokumentasi dengan pustaka klien bertahun-tahun di belakangnya. Bermigrasi darinya adalah sebuah proyek, bukan perubahan konfigurasi, dan tim yang telah membangun di atasnya tahu persis apa yang akan mereka lepaskan.

Yang ketiga adalah sesuatu yang lebih sulit disebutkan namanya dan tetap layak disebutkan: persepsi kealamian pada satu suara bahasa Inggris. Sintesis Qwen secara historis sangat baik untuk bahasa Mandarin dan hanya sangat baik untuk bahasa Inggris, dan meskipun rilis 3.1 mengklaim meningkatkan penyampaian multibahasa, belum ada uji mendengarkan independen pada model baru tersebut. Siapa pun yang mengatakan bahwa mereka tahu bagaimana suara Qwen baru terdengar dalam bahasa Inggris sedang menduga-duga.

Angka yang belum boleh dikutip siapa pun

Inilah bagian cerita yang akan dipelintir dalam pemberitaan, jadi ini disampaikan secara gamblang. Qwen-Audio-3.1-TTS tidak memiliki skor benchmark independen. Pendahulunya, Qwen-Audio-3.0-TTS-Plus, berada di angka 1.234 Elo pada papan peringkat Provider Voice Arena milik Artificial Analysis per pertengahan Agustus 2026, menempati peringkat antara kedua dan kelima di papan tersebut. Qwen-Audio-3.1-TTS belum ditambahkan ke arena mana pun. Setiap klaim kualitas dalam materi peluncuran Alibaba dilaporkan oleh vendor dan tidak direproduksi.

Itu tidak membuat klaim-klaim tersebut menjadi palsu. Itu membuatnya belum terverifikasi, dan itu berarti penyampaian yang jujur untuk perbandingan ini saat ini adalah: satu model dengan harga dan tanpa skor, melawan satu model dengan skor dan harga yang jauh lebih tinggi. Apa pun yang lebih kuat dari itu adalah spekulasi yang berkedok benchmark.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

Disiplin yang sama berlaku untuk latensi. Angka token pertama yang menjadi sorotan Alibaba untuk sisi ASR dari keluarga ini — 92 milidetik — berasal dari tolok ukur konkurensi tinggi milik perusahaan sendiri pada spesifikasi 0,6B, bukan dari pengujian pihak ketiga, dan analisis yang diterbitkan sejak peluncuran mencatat bahwa ASR dan TTS adalah produk terpisah dalam suatu pipeline, bukan satu model end-to-end, serta laporan komunitas menggambarkan latensi yang terakumulasi dalam dialog panjang dengan pola pseudo-streaming. Perlakukan angka latensi vendor di seluruh keluarga ini sebagai batas atas, bukan sebagai pengalaman yang terukur.

Apa nilai pemotongan harga dalam praktik

Ambil beban kerja yang realistis: sebuah produk yang menyintesis 20 juta karakter narasi per bulan dalam bahasa Inggris dan Mandarin. Dengan tarif ElevenLabs Eleven v3 sekitar $100 per juta karakter, itu sekitar $2.000 per bulan, atau $24.000 per tahun. Dengan tarif Qwen-Audio-3.0-TTS-Plus sekitar $27,60 per juta, volume yang sama sudah sekitar $552 per bulan. Terapkan pemotongan ~70% yang diumumkan Alibaba pada 23 September, dan beban kerja yang sama berada di kisaran ratusan dolar bagian bawah per bulan.

Tidak ada dari angka-angka itu yang merupakan harga daftar yang bisa Anda jadikan dasar kontrak — ElevenLabs menagih dalam kredit melalui tingkatan langganan, dan potongan Alibaba adalah pengurangan persentase terhadap tarif yang berbeda menurut wilayah dan tingkatan. Namun bentuk perbandingannya tidak ambigu, dan bentuk itulah yang menjadi dasar penyusunan anggaran Anda.

Satu peringatan yang perlu diperhatikan bagi siapa pun yang memodelkan ini dengan cermat: Alibaba Cloud memindahkan penagihan transkripsi real-time di node Singapura dari pengukuran berbasis durasi ke pengukuran berbasis token, sebesar $0,93 per juta token input dan $0,70 per juta token output. Penagihan token lebih sulit diprediksi daripada penagihan durasi ketika Anda tidak mengontrol berapa banyak token yang dihasilkan oleh potongan audio tertentu, dan kebisingan, keheningan, serta konteks multi-turn semuanya menggelembungkan konsumsi token. Pemangkasan headline sebesar 70% tidak secara otomatis berarti penghematan 70% pada lalu lintas spesifik Anda.

Cara benar-benar menjalankan switch

Jika Anda sedang mengevaluasi ini, hal yang berguna untuk diketahui adalah berapa biaya migrasi dalam hal waktu rekayasa. Kedua model adalah API hosted tertutup, jadi Anda tetap mengintegrasikan ke endpoint HTTP, dan pekerjaannya adalah klien, kebijakan retry, dan inventaris suara — bukan arsitektur ulang.

Di sinilah bentuk OrcaRouter membantu, dengan satu catatan jujur di awal: kami tidak merutekan Qwen-Audio-3.1-TTS atau model Qwen-Audio apa pun. Endpoint suara Alibaba di luar cakupan kami, dan hal yang sama berlaku untuk ElevenLabs. Yang kami cakup adalah lapisan inferensi di sekitarnya — satu kunci API untuk lebih dari 200 model teks dengan markup 0%, yang berarti harga daftar penyedia diteruskan apa adanya, sehingga pemotongan harga vendor langsung berlaku di sisi kami pada hari yang sama, bukan setelah siklus penetapan harga ulang. Bagi tim yang membangun aplikasi yang menggerakkan pipeline suara — peringkas, pembuat skrip, perencana konten — itu berarti satu kontrak alih-alih beberapa, failover otomatis saat upstream menurun, dan DSL routing untuk menyusun model menjadi satu panggilan. Ini tidak berarti Anda memanggil suara Qwen melalui kami. Siapa pun yang mengatakan sebaliknya belum membaca katalognya.

Siapa yang harus bergerak, dan siapa yang harus menunggu.

Segera beralih jika beban kerja Anda mengutamakan bahasa Mandarin, jika cakupan dialek ada dalam daftar persyaratan Anda, jika biaya volume adalah kendala yang membuat Anda bertahan pada suara yang lebih murah tetapi lebih buruk, atau jika Anda memerlukan satu suara bermerek yang tetap bertahan saat berganti bahasa. Harga 23 September membuat hitungan ekonominya sulit dibantah, dan kualitas bahasa Mandarinnya sudah kompetitif sebelum itu.

Tunggu jika Anda merilis dalam lebih dari sekitar enam belas bahasa, jika produk Anda bergantung pada pustaka suara yang dapat dilisensikan alih-alih kloning, jika Anda sudah sangat terlibat dalam perkakas dubbing atau agen suatu platform, atau jika proses pengadaan Anda memerlukan skor kualitas independen sebelum persetujuan. Tidak satu pun dari hal itu merupakan penghalang permanen, tetapi tidak satu pun juga diatasi oleh pemotongan harga.

Dan perhatikan satu hal secara khusus: apakah Qwen-Audio-3.1-TTS muncul di arena uji dengar buta. Begitu ia muncul, perbandingan ini tidak lagi tentang harga dan jumlah bahasa, melainkan mulai tentang apakah suara yang lebih murah benar-benar sebaik itu. Itulah pertanyaan yang tidak dijawab oleh peluncuran ini.