Kartu hero untuk 'ElevenLabs Eleven v4 vs Qwen-Audio-3.1-TTS-Plus' dengan dua kartu skor: Qwen-Audio-3.1-TTS-Plus pada Elo 1.178, peringkat 1 dan $19,30 per 1 juta karakter; ElevenLabs Eleven v4 pada Elo 1.157, peringkat 2 dan $80,00 per 1 juta karakter; dengan keterangan '21 poin Elo di tengah selisih harga empat kali lipat'. Catatan kaki: 'Controlled Voice Arena, menurut Artificial Analysis, September 2026.' Logo OrcaRouter berada di sudut kanan bawah.
Engineering & Research

Eleven v4 vs Qwen Audio 3.1: Suara Termurah di Papan Menang

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Di papan tempat setiap peserta diberi delapan suara kloning yang sama, Alibaba Qwen-Audio-3.1-TTS-Plus menempati posisi pertama dengan Elo 1.178 dan ElevenLabs Eleven v4 menempati posisi kedua dengan Elo 1.157. Model yang menang biayanya $19,30 per juta karakter di papan itu. Model yang menempati posisi kedua biayanya $80,00. Itu adalah selisih kualitas 21 poin dan selisih harga empat kali lipat yang mengarah ke arah berlawanan, dan itu adalah hasil paling menarik sepanjang minggu peluncuran — lebih menarik daripada posisi nomor satu yang diraih ElevenLabs di arena lain, karena di arena itu urutannya konvensional dan pemenangnya adalah suara termahal di sepuluh besar.

Dua papan peringkat ini tidak dapat dipertukarkan, dan alasan perbandingan ini terbaca seperti ini sepenuhnya terletak pada papan mana yang Anda lihat. Provider Voice meminta pendengar menilai suara milik masing-masing vendor. Controlled Voice mengkloning delapan suara yang sama — empat AS, empat Inggris — untuk setiap model, jadi tidak ada yang bisa menang hanya bermodal susunan suara bawaan mereka. ElevenLabs memenangkan papan pertama dengan 61 poin. Alibaba memenangkan papan kedua dengan 21 poin. Tidak ada papan yang salah, dan papan kedua itulah yang memprediksi produk yang menghadirkan suara merek hasil kloning.

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

Papan skor suara terkendali, selengkapnya

• Preferensi buta, klon yang dipasangkan — Qwen-Audio-3.1-TTS-Plus peringkat 1, Elo 1.178, $19,30 per juta karakter vs Eleven v4 peringkat 2, Elo 1.157, $80,00.

• Preferensi buta, suara masing-masing vendor — Eleven v4 peringkat 1, Elo 1.319 vs Qwen-Audio-3.0-TTS-Plus peringkat 4, Elo 1.258. Selisih 61 poin ke arah sebaliknya.

• Harga, normalisasi arena — Qwen $19.30 vs Eleven v4 $80.00. Qwen 76% lebih murah.

• Harga, kartu tarif vendor — Eleven v4 $0.022 per seribu karakter promo dan $0.08 setelah 12 Oktober. Kartu tarif Qwen Audio 3.1 sendiri bukan sesuatu yang bisa kami baca, jadi normalisasi arena adalah satu-satunya harga yang bisa kami bandingkan.

• Versi pada setiap board — 3.1 pada Controlled Voice, 3.0 pada Provider Voice. Keduanya adalah model yang berbeda dan board-nya tidak dapat dipertukarkan.

• Entri 3.0 pada Controlled Voice — peringkat 5, Elo 1.124, harga $19,30 yang sama. Rilis 3.1 bernilai 54 Elo lebih tinggi daripada pendahulunya sendiri pada harga yang identik.

• Generasi Qwen sebelumnya pada Provider Voice — Qwen3 TTS Flash peringkat 79, Elo 944; Qwen3 TTS peringkat 82, Elo 930.

• Produk andalan ElevenLabs sendiri sebelumnya pada Controlled Voice — Eleven v3 peringkat 7, Elo 1.073.

• Pemeriksaan kewajaran diagram batang berkelompok — rentang delapan arah dari peringkat 1 hingga peringkat 10 pada Controlled Voice adalah 121 Elo. Keunggulan 21 poin Qwen atas Eleven v4 berada di bawah seperlima dari rentang keseluruhan bidang, yang merupakan skala tepat untuk mempertahankannya.

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

Dua baris di sana paling berperan. Baris pertama adalah perbandingan 3.0 versus 3.1: Alibaba bergerak 54 Elo dalam satu kenaikan versi tanpa mengubah harga sama sekali. Itu irama yang lebih cepat daripada pergerakan v3-ke-v4 ElevenLabs yang sebesar 84 poin, dan itu berarti urutan peringkat spesifik dalam artikel ini adalah snapshot yang sedang aktif diubah oleh kedua vendor.

Yang kedua adalah total sebaran 121 poin. Selisih 21 poin pada papan yang rentang bergunanya sekitar 120 poin adalah perbedaan yang nyata tetapi moderat — kira-kira sebesar selisih antara 3.1 milik Qwen sendiri dan 3.0-nya. Jika kasus penggunaan Anda berada dalam bahasa yang tidak menjadi sasaran penyetelan kedua model, margin itu masih berada dalam jangkauan yang dapat dibalikkan oleh beberapa skrip uji yang sulit.

Masalah versi yang tidak disoroti siapa pun

Hasil yang beredar sebagai "Eleven v4 berada di posisi kedua di Controlled Voice" bersifat akurat tetapi tidak lengkap, dan penghilangan itu penting bagi siapa pun yang merencanakan berdasarkan hal tersebut. Model yang berada di atas Eleven v4 di papan itu adalah rilis 3.1 milik Alibaba. Sementara itu, entri Qwen di papan Provider Voice adalah rilis 3.0 — model 3.1 tidak muncul di baris teratas papan tersebut sebagaimana kami membacanya. Jadi, dua judul utama itu — "Eleven v4 nomor satu" dan "Eleven v4 nomor dua" — adalah pernyataan tentang dua model Qwen yang berbeda pada dua tugas yang berbeda, dan versi Qwen yang mengalahkannya di satu papan bukanlah versi Qwen yang dikalahkannya di papan lain.

Ini bukan jebakan tentang vendor mana pun; ini alasan untuk tidak memercayai ringkasan satu kalimat apa pun tentang sepekan seperti ini. Jika Anda memilih di antara kedua sistem ini, perbandingan yang Anda inginkan adalah 3.1 versus v4 pada suara kloningan Anda sendiri, dalam bahasa Anda sendiri, dan tak satu pun dari kedua vendor tersebut yang telah menerbitkannya.

Apa yang dapat dan tidak dapat kami katakan tentang Qwen Audio 3.1

Kejujuran tentang bukti lebih bernilai di sini daripada tabel spesifikasi lengkap, jadi inilah batas dari apa yang menjadi landasan artikel ini. Dari papan arena yang kami miliki, untuk Qwen-Audio-3.1-TTS-Plus: Elo suara terkontrol sebesar 1.178, normalisasi harga $19,30 per juta karakter, dan fakta bahwa ini adalah rilis saat ini dalam satu lini yang versi sebelumnya mencetak skor 54 poin lebih rendah pada harga yang sama.

Kami tidak memiliki, dan tidak akan menebak-nebak: cakupan bahasanya, latensinya, batas input per permintaan, apakah ia mendukung arahan penyampaian inline, apakah ia menawarkan kloning suara di luar delapan suara arena, atau apa yang ditagihkannya berdasarkan kartu tarifnya sendiri. Semua itu didokumentasikan untuk Eleven v4 — lebih dari 90 bahasa, batas 10.000 karakter, tag audio, klon instan sepuluh detik, dukungan fonem IPA — dan ketiadaan semua itu di sisi Qwen adalah celah dalam hal yang dapat dibaca publik, bukan pukulan terhadap model tersebut. Keputusan pembelian yang dibuat hanya berdasarkan artikel ini akan menjadi keputusan yang dibuat berdasarkan dua angka.

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

Satu kontras tetap bertahan dari keterbatasan itu, karena kedua sisinya dinyatakan oleh vendor atau keduanya dinyatakan oleh papan peringkat. Dalam hal harga, normalisasi papan peringkat adalah penyebut bersama dan itu menguntungkan Qwen sebesar 76%. Dalam hal kualitas dengan pembicara yang disamakan, papan peringkat yang sama menguntungkan Qwen sebesar 21 Elo. Kedua baris itu dapat dibandingkan. Semua hal lain di sini tidak demikian, dan artikel ini tidak akan berpura-pura sebaliknya.

Mengapa dewan yang dikendalikan seharusnya lebih diperhitungkan daripada biasanya

Sebagian besar perbandingan suara secara default mengikuti papan peringkat apa pun yang menempatkan model yang sudah Anda sukai di posisi teratas. Dalam pertandingan ini, ada alasan berprinsip untuk lebih memilih Controlled Voice, dan alasannya spesifik, bukan umum.

Alibaba dan ElevenLabs bersaing dengan aset yang sangat berbeda. Keunggulan ElevenLabs adalah pustaka suara yang dibangun selama bertahun-tahun melalui kurasi casting; keunggulan Alibaba adalah organisasi riset yang merilis versi model dengan irama cepat. Papan uji yang membiarkan setiap peserta membawa suaranya sendiri mengukur pustaka sama besarnya dengan mengukur sintesiser, dan di papan itu ElevenLabs menang dengan 61 poin. Hilangkan pustakanya — delapan pembicara hasil kloning yang sama untuk semua orang — dan keunggulannya berpindah tangan. Jika suara yang didengar pengguna Anda adalah klon dari orang tertentu, Anda tidak membeli pustaka ElevenLabs, jadi papan terkontrol itulah yang menggambarkan pembelian Anda. Jika Anda memilih dari menu suara stok, yang berlaku justru sebaliknya dan margin 61 poin Eleven v4 adalah angka yang menentukan.

Ada alasan kedua yang kurang nyaman untuk memberi bobot pada hasil yang terkontrol. Panel suara vendor memberi imbalan pada susunan pemeran default yang khas, dan susunan pemeran yang khas dapat bersifat memecah belah dengan cara yang disembunyikan oleh Elo rata-rata — yang berkarakter bagi satu pendengar adalah yang dibuat-buat bagi pendengar lain. Panel suara hasil kloning dengan pembicara yang dipadankan menghilangkan variabel itu sepenuhnya, sehingga menjadikannya pengukuran yang lebih dapat direproduksi di antara keduanya.

Menjalankan salah satunya, dan apa yang sebenarnya kami rutekan

OrcaRouter tidak meng-host model suara ElevenLabs maupun Alibaba. Tidak ada satu pun vendor itu dalam katalog kami, jadi tidak ada cara untuk memanggil salah satunya melalui kami dan artikel ini tidak akan menyarankan sebaliknya — Anda mendatangi API milik vendor itu sendiri dan beberapa platform pihak ketiga untuk keduanya.

Yang kami cakup adalah lapisan di atasnya. Jika stack suara Anda adalah satu node dalam pipeline yang lebih besar, kami menyediakan lebih dari 200 model di balik satu kunci API dengan harga daftar penyedia diteruskan pada markup 0%, sehingga penetapan harga ulang di hulu mana pun — termasuk jendela promosi ElevenLabs dan harga daftar yang jauh lebih besar yang menyusul pada 12 Oktober — tercermin di sisi kami pada hari itu terjadi, bukan pada siklus penagihan berikutnya. Untuk keputusan yang bergantung pada rasio harga 4x, waktu tersebut adalah pembeda antara perbandingan yang tetap relevan dan perbandingan yang terbaca salah dalam tiga minggu.

Dan bila jalur suara tidak boleh mati, failover otomatis memindahkan trafik ke upstream yang sehat alih-alih menggagalkan permintaan. Dalam pertarungan yang begitu dekat dalam hal kualitas dan begitu timpang dalam hal harga, arsitektur yang masuk akal adalah menempatkan kedua model di belakang satu endpoint dengan routing yang menentukan pembagiannya — bukan pilihan permanen yang dibuat dari snapshot papan peringkat yang akan dibatalkan oleh kedua vendor dalam satu kuartal.

Putusan, dan tanggal kedaluwarsanya

Pilih Qwen-Audio-3.1-TTS-Plus jika Anda mengkloning suara dan memperhatikan biaya. Ia berada di peringkat pertama pada papan peringkat yang menjaga speaker tetap konstan, harganya kira-kira seperempat dari harga biasanya, dan trennya bergerak lebih cepat — 54 Elo dalam satu langkah versi pada tarif yang tidak berubah menunjukkan bahwa versi berikutnya adalah pilihan yang lebih baik daripada versi saat ini secara hitungan di atas kertas.

Pilih Eleven v4 jika pengguna Anda mendengar suara stok, jika Anda memerlukan cakupan dalam bahasa yang dapat Anda verifikasi sebelum merilis, atau jika set fitur yang terdokumentasi — tag audio, kontrol fonem, permintaan 10.000 karakter, klon sepuluh detik — melakukan pekerjaan di produk Anda yang tidak diukur oleh papan arena. Keunggulan 61 poinnya di papan suara vendor bukanlah hal sepele, dan dua fitur yang dapat Anda tuliskan ke dalam skrip adalah kemampuan, bukan skor.

Tetapkan tanggal peninjauan. Alibaba bergerak 54 Elo dalam pembaruan versi pada siklus ini dan ElevenLabs bergerak 84 sepanjang satu generasi penuh, dan tarif promosi Eleven v4 berakhir pada 12 Oktober. Apa pun yang dikatakan perbandingan ini hari ini, dua fakta yang paling mungkin membalikkannya — rilis 3.2 dan harga yang dikembalikan — keduanya terjadi sebelum akhir kuartal.