Kartu judul hero untuk 'Realtime-Venus vs Qwen-Audio-3.0-TTS', dengan subjudul 'Perender dan pendengar bukanlah pembelian yang sama', dengan tiga kartu yang berbunyi 'Qwen-Audio-3.0-TTS-Plus: Elo 1,259, peringkat kedua di Artificial Analysis Provider Voice Arena', 'Realtime-Venus: tidak ada skor kualitas suara sama sekali', dan 'Input adalah seluruh perbedaannya: hanya teks, versus audio, video, dan teks', di atas strip footer yang berbunyi 'Angka Qwen menurut Artificial Analysis; angka Realtime-Venus dari laporan teknisnya, tidak direproduksi.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Realtime-Venus vs Qwen-Audio-3.0-TTS: Yang Satu Membaca Skrip Anda, yang Lain Harus Mendengar Anda

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Perbandingan yang menggoda antara Realtime-Venus dan Qwen-Audio-3.0-TTS adalah harga per jam audio, dan itu menghasilkan jawaban yang rapi yang sepenuhnya salah. Qwen-Audio-3.0-TTS-Plus menghasilkan ucapan sekitar $27,6 per juta karakter, yang setara dengan hampir $1,66 untuk satu jam audio jadi. Realtime-Venus, sistem full-duplex 9B yang dibangun Tim Venus milik Ant Group bersama Tsinghua University, sama sekali tidak punya harga karena tidak memiliki layanan terkelola — tetapi jika dihosting sendiri, Anda memerlukan node GPU yang berjalan terus-menerus, yang setidaknya satu orde magnitudo lebih mahal per jam. Renderer menang dalam aritmetika. Aritmetika itu mengukur dua produk yang berbeda: Qwen-Audio-3.0-TTS menerima teks dan mengembalikan audio, sedangkan Realtime-Venus menerima audio dan video dan mengembalikan percakapan. Pertanyaan yang benar-benar membedakan keduanya bukanlah apa yang mereka keluarkan. Melainkan apakah ada sesuatu yang harus berbicara balik.

Input adalah seluruh perbedaannya.

Qwen-Audio-3.0-TTS, yang dirilis oleh Tongyi Lab milik Alibaba Cloud pada 20 Juli 2026, adalah model text-to-speech yang disediakan sebagai API terkelola tanpa bobot terbuka. Teks masuk melalui endpoint HTTP dan audio keluar. Tidak ada jalur input audio, tidak ada giliran percakapan yang harus diambil, tidak ada transkrip untuk dikembalikan, dan tidak ada konsep terinterupsi — model ini tidak pernah mendengar apa pun. Seluruh model biayanya adalah mesin cetak: karakter masuk, audio keluar.

Realtime-Venus, sebaliknya, terus-menerus mendengarkan. Checkpoint audio-visual ini membawa encoder visual SigLIP2 untuk frame streaming dan encoder audio Whisper-Medium yang memasok backbone Qwen3-8B, dan kedua checkpoint menjalankan loop interaksi satu detik yang terus memperbarui state percakapan dan memutuskan apakah akan berbicara atau tetap diam. Ia menghasilkan ucapan melalui token S3 diskret dan decoder flow-matching streaming, bukan melalui tahap sintesis terpisah, dan ia dapat mengembalikan teks bersama waveform.

Itu bukan perbedaan fitur. Itu adalah perbedaan antara komponen dan sistem. Letakkan keduanya berdampingan dan salah satunya dapat dimasukkan ke dalam pipeline yang sudah memiliki pengenal ucapan dan model bahasa di depannya. Yang lainnya menggantikan ketiganya.

Sebuah kasus yang dikerjakan membuatnya menjadi konkret.

Ambil saluran dukungan. Seorang pelanggan menelepon, menjelaskan masalah dengan buruk, berhenti di tengah kalimat untuk mencari nomor akun, terganggu oleh pengumuman latar belakang, lalu mengajukan pertanyaan lanjutan sebelum agen selesai menjawab.

Sistem yang dibangun di atas Qwen-Audio-3.0-TTS menangani ini sebagai tiga vendor dan tiga tagihan: pengenal mengubah ucapan penelepon menjadi teks, model bahasa memutuskan apa yang akan dikatakan, dan Qwen-Audio-3.0-TTS mengucapkannya. Setiap lompatan menambah latensi, dan setiap batas adalah tempat prosodi mati. Kegagalan kritisnya bersifat struktural — bagian TTS tidak dapat mendengar jeda di tengah kalimat yang sedang diucapkannya, sehingga barge-in harus ditangani oleh sesuatu di depannya.

Realtime-Venus menangani panggilan yang sama sebagai satu model, tanpa detektor aktivitas suara eksternal, tanpa pengalihan. Angka Full-Duplex-Bench v1.5-nya — 75% respons terhadap interupsi dan tingkat kelanjutan 97% pada backchannel, 88% pada ujaran yang ditujukan kepada orang lain, dan 86% pada ujaran latar belakang — persis merupakan metrik yang menggambarkan skenario ini. Angka-angka itu juga dilaporkan sendiri, dari laporan teknis model itu sendiri, tanpa reproduksi eksternal. Bacalah sebagai klaim desain, bukan hasil pengukuran.

Kualitas suara: yang satu punya Elo, yang lain tidak punya apa-apa.

Ini adalah bagian yang paling tidak seimbang dari perbandingan ini, dan ini menguntungkan Alibaba dengan selisih yang besar.

• Skor independen — Qwen-Audio-3.0-TTS-Plus berada di posisi kedua di Provider Voice Arena milik Artificial Analysis dengan Elo 1.259 atas 1.544 sampel per 18 September 2026, di belakang Cartesia Sonic 3.6 pada 1.277 dan di depan Inworld Realtime TTS-2 pada 1.247 serta Speechify Simba 3.2 pada 1.241.

• Dari mana asalnya — kolom rilis arena sendiri mencantumkan model ini sebagai entri September 2026, yaitu tier sebagaimana yang dinilai saat ini, bukan tanggal peluncuran 20 Juli 2026. Setiap kali ia bergeser, ia selalu bertahan di dua posisi teratas sepanjang waktu.

• Realtime-Venus — tidak ada entri arena, tidak ada evaluasi suara pihak ketiga, tidak ada apa-apa. Satu-satunya angka terkait suara adalah skor VoiceBench AlpacaEval yang dilaporkan sendiri sebesar 4.81 yang menurut laporan tersebut cocok dengan angka pembanding terbaik.

• Artinya — tak ada orang di luar para penulis yang menilai apakah Realtime-Venus terdengar bagus. Itu bukanlah penilaian negatif terhadapnya; itu hanya belum diketahui, dan belum diketahui berbeda dari buruk. Namun, jika kualitas suara adalah hasil yang dijanjikan, membeli model yang memiliki peringkat Elo lebih baik daripada mengambil model tanpa peringkat dengan keyakinan buta.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

Bahasa, suara, dan kontrol ekspresif

Model Alibaba dibangun untuk keluasan penyampaian. Model ini menghadirkan lebih dari seribu suara, mencakup enam belas bahasa termasuk dua puluh wilayah dialek Tionghoa, dan mengekspos 86 tag inline untuk emosi dan penyampaian — permukaan kontrol yang Anda tuliskan ke dalam teks itu sendiri, plus instruksi penyampaian dalam bahasa alami. Output berjalan hingga 48 kHz, naik dari 24 kHz pada generasi sebelumnya, dan satu sintesis dapat berjalan hingga tiga menit. Tingkat Flash menargetkan sekitar 300 milidetik hingga paket pertama untuk pemutaran waktu nyata; tingkat Plus adalah tingkat kualitas dan menghasilkan sekitar enam belas karakter per detik, yang cukup lambat untuk berpengaruh dalam produk langsung dan tidak terlihat dalam perenderan batch.

Realtime-Venus mendokumentasikan bahasa Inggris dan Tionghoa, menyertakan satu suara referensi bersama bobotnya, dan memberi Anda dekoder token-ke-gelombang, bukan pustaka suara. Ekspresivitas dalam pengertian Qwen — tag, instruksi, seribu preset — tidak memiliki padanan di sini. Yang dimilikinya sebagai gantinya adalah kemampuan mengubah gaya penyampaiannya sebagai respons terhadap apa yang didengarnya, yang merupakan jenis kontrol ekspresif yang berbeda dan jauh lebih sulit dituangkan ke lembar spesifikasi.

Biaya setiap jalur, sejujurnya

Ada catatan penting yang nyata pada angka Alibaba sebelum siapa pun menyusun anggaran dengan angka itu. Harga $27,6 per juta karakter yang banyak dikutip tidak selalu cocok dengan halaman harga Alibaba sendiri di setiap snapshot, dan tiernya diberi harga secara terpisah. Periksa angkanya di tingkat akun, bukan dengan memercayai tabel perbandingan, termasuk tabel ini.

Realtime-Venus tidak memiliki harga daftar karena tidak ada yang bisa dibeli. Biayanya adalah dua checkpoint 9B dalam BF16 — masing-masing sekitar delapan belas gigabita bobot sebelum memori aktivasi — ditambah loop streaming berkelanjutan, yang berarti node GPU yang ditagih per bulan apakah ada yang memanggil atau tidak. Pada volume yang stabil, itu lebih murah per percakapan daripada API suara berbasis meteran. Pada volume yang terputus-putus, itu jauh lebih buruk, dan titik persilangannya adalah satu-satunya pertanyaan finansial yang penting.

Ada jalur ketiga yang akan banyak diambil tim, dan layak disebutkan karena mengubah bentuk keputusannya. Jika Anda mempertahankan kaskade, satu-satunya lapisan yang perlu berupa model terkelola adalah lapisan tengah — penalaran. OrcaRouter tidak menyediakan Qwen-Audio-3.0-TTS maupun Realtime-Venus; kedua lapisan suara itu berada di luar cakupan layanan kami, dan kami lebih memilih mengatakannya daripada menyiratkan sebaliknya. Lapisan penalaranlah yang kami tangani: hampir 200 model teks di balik satu kunci dengan harga daftar penyedia tanpa markup, failover otomatis antar-hulu sehingga gangguan sesaat di satu penyedia tidak memutus panggilan yang sedang berlangsung, DSL perutean yang menggabungkan beberapa model menjadi satu panggilan, serta fusi model ketika sebuah keputusan layak mendapat lebih dari satu pendapat. Dalam kaskade, itulah lapisan yang paling ingin bisa Anda tukar tanpa negosiasi kontrak, dan lapisan tempat pemotongan harga vendor berlaku di hari yang sama alih-alih saat perpanjangan.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Kloning bisa berdampak dua arah

Qwen-Audio-3.0-TTS dapat mengkloning suara dari sampel referensi singkat, secara lintas bahasa, dan didokumentasikan sebagai tahan terhadap masukan bising atau bergaung. Itu adalah kemampuan yang paling berguna secara komersial dalam perbandingan ini dan area kepatuhan terbesar. Produk yang dapat mereproduksi penutur mana pun dari sepuluh detik audio memiliki jawaban yang jauh lebih panjang untuk "suara siapa itu, dan siapa yang menyetujuinya" daripada produk yang hanya berbicara dengan preset vendor.

Realtime-Venus menyertakan suara referensi bersama bobotnya. Anda dapat melakukan kloning dengannya jika Anda memiliki audio dan proses pelatihannya, tetapi tidak ada apa pun dalam rilis ini yang dirancang untuk mempermudah hal itu — yang, untuk penerapan yang dihosting sendiri di dalam batas kepatuhan, bisa dibilang merupakan default yang lebih aman.

Yang mana yang sebenarnya sedang Anda beli?

Beli Qwen-Audio-3.0-TTS ketika audio adalah outputnya. Narasi, lokalisasi, aksesibilitas, dubbing, alur kerja apa pun di mana teks sudah ada sebelum suaranya ada dan kualitas per jam yang dirender menjadi metriknya. Mulai dengan Flash jika pemutarannya live, beralih ke Plus ketika suara itu sendiri adalah produknya, dan tetapkan harga untuk alur kerja kloning secara terpisah dari pustaka preset.

Pilih Realtime-Venus saat masukannya adalah seseorang dan sistem harus berperilaku seperti pendengar. Bantuan yang sadar kamera, interaksi bebas genggam, apa pun saat manusia akan menyela di tengah kalimat dan mengharapkan sistem menanganinya. Pertukarannya jelas: Anda melepaskan suara dengan peringkat Elo, seribu preset, dan opsi hosted apa pun, dan sebagai gantinya Anda mendapatkan satu-satunya di antara keduanya yang dapat mendengar Anda.

Sebagian besar produk menginginkan keduanya, di tempat yang berbeda. Yang tidak boleh mereka samakan adalah model biaya — harga per jam audio adalah metrik yang tepat untuk tepat satu dari dua model ini, dan itu bukan model yang memegang percakapan.