Kartu hero yang dihasilkan berjudul 'HeyGen Voice vs Qwen-Audio-3.0-TTS' menampilkan selisih Elo suara terkendali 79 poin terhadap dua harga per sejuta karakter, dengan catatan bahwa satu harga diterbitkan vendor dan yang lainnya adalah konversi turunan arena dari harga kredit, menurut Artificial Analysis, 9 Oktober 2026. Logo OrcaRouter muncul di sudut kanan bawah.
Engineering & Research

HeyGen Voice vs Qwen-Audio-3.0-TTS: Apa yang Anda Bayar untuk Elo, dan Tier Qwen Mana yang Sebenarnya Anda Benchmark?

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hitung dulu angkanya, karena hasilnya tidak sesenjang yang tampak dari papan skor. Qwen-Audio-3.0-TTS-Plus berbiaya $19,30 per juta karakter di platform Model Studio — tarif yang dipublikasikan vendor. HeyGen Voice berada di $30,00 per juta karakter pada bagan harga milik Artificial Analysis sendiri, angka yang situs itu turunkan dari harga kredit HeyGen, karena halaman harga publik HeyGen menjual kredit tanpa menyatakan berapa kredit yang dihabiskan untuk satu pembuatan suara. Sementara itu, selisih suara terkontrol di antara keduanya adalah 79 Elo: HeyGen Voice mencetak skor 1.202 di arena yang menjaga kedelapan suara referensi tetap konstan, Qwen-Audio-3.0-TTS-Plus 1.123. Jadi model yang lebih murah berada jauh di belakang model yang lebih baik dalam peringkat, rasio di antara keduanya kira-kira 1,55×, dan hanya satu dari kedua harga itu yang merupakan angka yang secara terbuka disahkan oleh vendor yang menjualnya.

Jebakan dalam nama

Sebelum semua itu, pastikan tier-nya benar, karena ini adalah keluarga yang akan dengan senang hati membiarkan Anda melakukan benchmark pada model yang salah. Dua entri Alibaba penting di sini dan keduanya tidak dapat dipertukarkan.

Qwen-Audio-3.0-TTS-Plus adalah model yang dibandingkan dalam artikel ini. Model ini mencetak skor 1.123 pada papan terkendali — ketujuh dari empat puluh dua — dan 1.264 pada papan Provider Voices, tempat ia berada di peringkat keenam dari sembilan puluh enam. Ini adalah produk TTS streaming yang nyata dan terkini, dengan tarif yang dipublikasikan sebesar $19,30 per juta karakter.

Qwen-Audio-3.1-TTS-Plus adalah tier penerusnya, dan model itulah yang berada di posisi kedua pada papan peringkat terkontrol dengan nilai 1.186 — model yang paling mendekati mengalahkan HeyGen Voice saat debut. Tarifnya tercatat sama, yakni $19.30, meskipun dokumentasi Alibaba memperingatkan bahwa versi model yang berbeda memerlukan suara yang cocok, jadi "harga sama, tier lebih baru" tidak berarti "drop-in".

Siapa pun yang membaca "#1 di atas Qwen" lalu melakukan benchmark terhadap Qwen-Audio-3.0-TTS akan menguji model yang 63 Elo lebih lemah daripada model yang menjadi topik judul berita itu. Perdebatan sepele soal tier bernilai 63 poin, lebih besar daripada selisih antara HeyGen Voice dan peringkat ketiga.

Papan skor

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• Elo Suara Terkontrol (8 suara kloning yang sama) — HeyGen Voice: 1.202, #1 dari 42. Qwen-Audio-3.0-TTS-Plus: 1.123, #7.

• Elo Suara Penyedia (suara native) — Qwen-Audio-3.0-TTS-Plus: 1.264, #6 dari 96. HeyGen Voice: tidak masuk peringkat.

• Harga per 1 juta karakter — Qwen-Audio-3.0-TTS-Plus: $19,30, diterbitkan vendor di Alibaba Cloud. HeyGen Voice: $30,00 berdasarkan konversi harga kredit versi arena sendiri; HeyGen tidak menerbitkan tarif suara.

• Biaya 100 jam narasi — Qwen-Audio-3.0-TTS-Plus: sekitar $926 pada ~480.000 karakter per jam yang diucapkan. HeyGen Voice: sekitar $1.440 berdasarkan konversi $30,00 milik arena — diturunkan, bukan dikutip.

• Kontrol suara — Qwen-Audio-3.0-TTS-Plus: parameter instruction, tag emosi dan bahasa, kloning suara, serta desain suara. HeyGen Voice: desain text-to-voice dari deskripsi ≤1.000 karakter, kloning instan, kloning profesional yang dilatih dengan 20+ menit.

• Keluaran — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3, dan Opus hingga 48kHz, dengan laju, nada, volume, dan bitrate yang dapat disesuaikan. HeyGen Voice: kecepatan 0,5–1,5 dan nada ±50 semiton per permintaan.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

Apa yang sebenarnya diberikan oleh engineering Alibaba kepada Anda

Keluarga Qwen-Audio-3.0-TTS adalah produk streaming dan dokumentasinya memang seperti itu. Permintaan berjalan melalui protokol WebSocket yang dibagikan dengan CosyVoice, dengan run-task, continue-task dan finish-task sebagai alur peristiwa dan task-started, result-generated, task-finished dan task-failed respons yang menyertainya. Pembatalan didukung untuk setiap model Qwen-Audio-TTS baik di wilayah Beijing maupun Singapura melalui streaming_cancel(). Output mencapai 48kHz, dan formatnya mencakup Opus, yang penting jika Anda memindahkan audio ke browser atau panggilan telepon alih-alih file WAV.

Dua detail dalam dokumentasi itu mudah terlewat dan mahal jika baru diketahui terlambat. Tag emosi dan bahasa kaya hanya berlaku untuk tier Plus dan Flash — bukan seluruh keluarga — dan hanya berfungsi dalam mode streaming searah. Dan kunci API berbeda antara region Singapura dan Beijing, dengan workspace yang dialamatkan pada URL dengan bentuk wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Kunci regional hanyalah detail penyediaan sampai pada hari kunci tersebut menyebabkan gangguan.

Sisi HeyGen adalah bentuk produk yang berbeda: API v3 bergaya REST di mana POST /v3/voices/speech menghasilkan ucapan, GET /v3/voices menampilkan katalog di balik engine filter, dan desain suara mengembalikan hingga tiga opsi berperingkat dari prompt teks dengan seed untuk reproduktibilitas. Dokumentasi juga mengungkapkan bahwa engine filter menerima nilai di luar milik HeyGen sendiri — jadi HeyGen akan dengan senang hati mengarahkan Anda ke mesin suara pihak ketiga melalui API-nya. Vendor yang menyertakan model pesaing sebagai opsi yang dapat dipilih memberi tahu Anda sesuatu tentang di mana ia menganggap kekuatannya sendiri berada.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

Ke mana 79 Elo pergi

Selisih 79 poin pada papan terkontrol itu besar — lebih besar daripada selisih 16 poin yang memisahkan HeyGen Voice dari posisi kedua, dan kira-kira sejauh jarak antara peringkat ketiga dan kedelapan di bidang tersebut. Angka itu juga diukur pada satu sumbu.

Arena terkendali mengkloning delapan suara dan mempertahankannya tetap. Arena itu tidak mengatakan apa pun tentang permukaan kendali berbasis instruksi yang diekspos Qwen, tidak tentang keluaran Opus 48kHz melalui WebSocket yang dapat dibatalkan, dan tidak tentang penerapan regional. Itu semua adalah properti rekayasa, dan itulah alasan tim yang membangun pusat kontak berbahasa Mandarin tidak akan beralih ke model yang mencetak skor 79 poin lebih tinggi pada delapan suara referensi berbahasa Inggris.

Yang dikatakan hasil terkontrol justru lebih sempit dan tetap berguna: ketika kedua mesin diberi suara klon yang sama, pendengar lebih menyukai rendering HeyGen Voice. Jika produk Anda mengkloning suara, itulah sumbu Anda. Jika produk Anda memilih suara dari katalog dan mengalirkannya ke dalam panggilan, papan peringkat penyedia lebih dekat dengan realitas Anda — dan di sana HeyGen Voice tidak memiliki peringkat sama sekali, sedangkan Qwen-Audio-3.0-TTS-Plus berada di posisi keenam dari 96.

Argumen harga, dianggap serius

Pada $19.30 per juta karakter, Qwen-Audio-3.0-TTS-Plus kira-kira setengah biaya tier $40 ElevenLabs dan sekitar 40% dari $49 Cartesia Sonic 3.6. Untuk beban kerja 100 jam narasi — sekitar 48 juta karakter pada laju bicara tipikal — biayanya sekitar $926. Volume yang sama pada Eleven v4 Turbo sekitar $1,920 dan pada Sonic 3.6 sekitar $2,352. HeyGen Voice, pada harga $30.00 di arena, berada di sekitar $1,440: di antara tier murah dan dua pemain mapan, lebih dekat ke tengah daripada ke atas.

Aritmetika itu memiliki kaveat yang tidak diperlukan oleh perhitungan lain. $19 adalah tarif resmi yang diterbitkan Alibaba sendiri. $30.00 adalah konversi Artificial atas sistem kredit yang telah diterjemahkan HeyGen menjadi karakter, jadi ini perkiraan yang cukup baik, bukan penawaran harga. Jika rasio karakter per kredit yang sebenarnya lebih buruk daripada asumsi bagan, keunggulan 79-Elo membutuhkan biaya lebih dari 1,55× yang tersirat; jika lebih baik, lebih sedikit. Model yang harganya harus Anda simpulkan adalah model yang Anda uji coba pada sebagian lalu lintas yang terukur, bukan model yang Anda jadikan standar. Itu bukan kritik terhadap mesin ini — melainkan deskripsi atas informasi yang tersedia pada 10 Oktober 2026.

Memutuskan

Ambil Qwen-Audio-3.0-TTS-Plus ketika biaya dan infrastruktur streaming menjadi penentu keputusan. Di bawah $20 per juta karakter, WebSocket yang dapat dibatalkan dengan output Opus 48kHz, parameter instruksi dan tag emosi, serta peringkat keenam di papan penyedia menjadikannya suara berskor baik paling ekonomis dalam perbandingan ini. Ambil tier 3.1 sebagai gantinya jika Anda menginginkan model yang sebenarnya berada di posisi kedua di papan terkontrol, dan verifikasi daftar suara sebelum menganggap penggantian itu gratis.

Uji HeyGen Voice ketika fidelitas klon adalah produknya. Satu pembicara, banyak baris, suara yang harus menjadi *suara itu* setiap kali — itulah sumbu yang diukur oleh papan terkendali dan sumbu yang membuatnya memimpin seluruh bidang. Sediakan anggaran untuk periode pengukuran, karena model kredit berarti Anda akan mengetahui biaya sebenarnya dengan menjalankan teks Anda sendiri, bukan dengan membaca kartu tarif.

Dan abaikan perbandingan itu sepenuhnya jika beban kerjanya berbahasa Mandarin dan bersifat real-time. Tidak ada angka Elo yang diukur pada suara Anda, dalam bahasa Anda, pada anggaran latensi Anda.

Menjaga keduanya tetap dapat dijangkau

Ini adalah salah satu pasangan ketika lapisan routing benar-benar layak ada, bukan sekadar tambahan tempelan. Satu kunci API untuk kedua vendor — harga daftar penyedia diteruskan tanpa markup, jadi harga terpublikasi Alibaba sebesar $19,30 adalah yang Anda bayar dan perubahan harga Qwen langsung berlaku pada hari yang sama — menghilangkan kebutuhan untuk memilih pemenang sebelum Anda punya bukti. Failover otomatis menutupi risiko yang jelas dalam pipeline suara, tempat aliran yang macet terdengar oleh pendengar, dan DSL routing memungkinkan Anda mengirim narasi massal ke mesin murah serta baris yang krusial untuk kloning ke mesin yang skornya 79 poin lebih tinggi, tanpa dua pustaka klien dan dua hubungan penagihan. Nilai OrcaRouter di sini bukanlah karena ia menghosting model suara; melainkan karena ia membuat biaya untuk mengetahui mana yang Anda inginkan menjadi nyaris nol.

Pertanyaan yang masih terbuka

Tiga hal akan menyelesaikan ini. Tarif suara di halaman harga HeyGen sendiri akan mengubah $30.00 yang dihitung arena menjadi angka yang dapat Anda audit. Entri HeyGen di papan Provider Voices akan memberi tahu kami apakah keunggulan suara hasil kloning bertahan terhadap suara native — uji yang dilalui Qwen-Audio-3.0-TTS-Plus di posisi keenam dari sembilan puluh enam. Dan hasil suara terkontrol untuk Qwen-Audio-3.1-TTS-Plus melawan HeyGen Voice setelah lebih banyak vote akan memberi tahu kami apakah 16 Elo merupakan urutan yang stabil. Sampai saat itu: Qwen adalah opsi yang diberi harga, dapat di-streaming, dan berperingkat baik; HeyGen Voice adalah opsi dengan skor lebih tinggi tetapi tidak dapat diberi harga; dan tier yang Anda benchmark lebih penting daripada headline yang Anda baca.