
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: Salah Satunya Memiliki Skor Arena, dan Itu Bukan yang Baru
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Berikut seluruh perbandingannya dalam satu baris. Qwen-Audio-3.0-TTS berada di Text-to-Speech Arena dengan Elo 1.234 untuk tier Plus-nya — skor yang diperoleh dari 2.502 suara uji dengar buta. StepAudio 3 TTS, yang dirilis oleh StepFun pada 15 September 2026, sama sekali tidak ada di papan itu. Pendahulunya adalah: StepAudio 2.5 TTS memegang Elo 1.209 dari 1.306 suara.
Jadi, pertanyaan jujurnya bukanlah "mana yang terdengar lebih baik". Pertanyaannya adalah apakah selisih Elo 25 poin, yang diukur pada generasi sebelumnya, tetap bertahan pada rilis yang menurut StepFun meningkatkan prosodi dan memangkas harga lebih dari setengah. Belum ada yang menjalankan voting itu, dan semua yang di bawah ini disusun di sekitar celah bukti tersebut, bukan berpura-pura seolah celah itu tidak ada.
Papan itu, sebagaimana bunyinya saat ini
Patut melihat klasemen sebenarnya, karena beberapa tulisan yang beredar mengutip versi yang sudah usang. Arena pendengaran buta memeringkat model sintesis berdasarkan sampel mana yang lebih disukai para pemilih. Bacalah sepanjang bagian atas papan suara penyedia:
• Cartesia Sonic 3.6 — Elo 1.277, Agustus 2026, $49,0 per juta karakter
• Inworld Realtime TTS-2 — Elo 1.243, Agustus 2026, $20,8 per juta karakter
• SpeechifyAI Simba 3.2 — Elo 1.238, Juli 2026, $6,6 per juta karakter
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1.234, Juli 2026, $27,6 per juta karakter, 8 suara arena
• VUI Labs Luna TTS — Elo 1.229, Juni 2026, $80,0 per juta karakter
• Inworld Realtime TTS-2 Flash — Elo 1.213, Agustus 2026, $10,4 per juta karakter
• StepFun StepAudio 2.5 TTS — Elo 1.209, Agustus 2026, $85,0 per juta karakter, 8 suara arena
• Google Gemini 3.1 Flash TTS — Elo 1.204, April 2026, $18,3 per juta karakter

Dua hal langsung muncul dari daftar itu. Yang pertama adalah bahwa tier Plus milik Qwen bukanlah yang terdepan — ia berada di urutan keempat, di belakang Cartesia, Inworld, dan Speechify, dan angka 1.234 yang dikutip sebagai mahkota adalah skor papan tengah pada papan peringkat yang telah bergeser sejak saat itu. Yang kedua adalah bahwa StepAudio 2.5 TTS diuji ulang pada Agustus 2026 dan berada di peringkat ketujuh, tertinggal 25 Elo dari Qwen, dengan harga lebih dari tiga kali lipat.
Dan hal ketiga yang lebih penting dari semuanya: lihat interval kepercayaannya. Tier Plus Qwen tercatat pada −14/+14 di 2.502 sampel. StepAudio 2.5 TTS tercatat pada −16/+16 di 1.306. Interval-interval itu tumpang tindih. Jarak 25 poin antara dua model yang batang galatnya membentang 14 dan 16 poin ke arah mana pun bukanlah perbedaan kualitas yang terbukti — ini adalah dua model yang saat ini tidak dapat dipisahkan oleh arena, diperingkat dalam urutan yang bisa dibalik oleh beberapa ratus suara lagi.

Berapa kerugian yang ditimbulkan titik data yang hilang bagi Anda
StepAudio 3 TTS adalah model yang digunakan StepFun untuk menggantikan StepAudio 2.5 TTS, dan peluncurannya mengklaim adanya kontrol atas timbre, intonasi, ritme, dan jeda bernapas, plus perilaku paralinguistik — tawa, keraguan, gagap, pengulangan, koreksi diri — yang disalurkan melalui arsitektur streaming tempat proses generasi dan pemutaran saling tumpang tindih.
Itulah tepatnya kumpulan kualitas yang diukur arena. Itu juga tepatnya alasan mengapa tidak adanya skor menjengkelkan alih-alih fatal: tolok ukur yang akan menjawab pertanyaan itu sudah ada, dijalankan secara publik, dan sekadar belum dijalankan ulang sejak model baru dirilis. Siapa pun yang memberi tahu Anda bahwa StepAudio 3 TTS terdengar lebih baik daripada Qwen-Audio-3.0-TTS sedang melakukan ekstrapolasi dari pendahulunya yang kalah dengan margin yang berada di dalam rentang kesalahannya sendiri.
Harga adalah bagian yang terdokumentasi dengan lengkap, dan harganya bergerak cukup banyak
StepAudio 3 TTS menagih 2,5 yuan per 10.000 karakter di platform milik StepFun sendiri. StepAudio 2.5 TTS menagih 5,8. Pada kolom harga berbasis karakter milik arena itu sendiri, model lama seharga $85,00 per juta karakter; 2,5 yuan per 10.000 karakter setara dengan sekitar $35 per juta pada nilai tukar terkini — konversi yang merupakan hitungan kami, bukan angka yang dipublikasikan, dan layak dihitung ulang berdasarkan wilayah dan FX Anda sendiri. Itu berarti pemangkasan hampir 60% pada pos biaya yang sama.
Harganya masih di atas Qwen. Qwen-Audio-3.0-TTS-Plus tercatat pada $27,6 per juta karakter, dan tier Flash bahkan lebih murah, dengan Alibaba Cloud Model Studio menagih sintesis berdasarkan karakter masukan, bukan berdasarkan audio yang dihasilkan — keluaran tidak dikenakan biaya terpisah. Platform pihak ketiga yang mencantumkan tier Flash menawarkan tarif di kisaran belasan tinggi per juta, meskipun variasi regional membuat angka utama tunggal apa pun tidak dapat diandalkan.
Jadi bentuknya seperti ini: StepFun kurang lebih memangkas separuh biaya sintesis, menutup sebagian besar jarak ke Qwen, dan tidak melampauinya. Jika harga per karakter adalah kendala mengikat Anda, argumennya menyempit tetapi jawabannya tidak berubah. Jika bukan, harga tidak lagi menjadi alasan untuk memilih salah satu model.
Inventaris suara dan cakupan bahasa tidak sebanding.
Di sinilah perbandingan berhenti menjadi soal penilaian dan menjadi pertanyaan spesifikasi.
• Inventaris suara — Qwen-Audio-3.0-TTS lebih dari 1.000 suara di seluruh tingkatannya vs StepAudio 3 TTS tidak ada angka yang dipublikasikan yang sebanding
• Bahasa — Qwen-Audio-3.0-TTS 16 bahasa ditambah 20 dialek Tionghoa, dengan tier Flash yang disetel untuk bahasa sumber daya rendah dan keaslian dialek vs StepAudio 3 TTS yang mengutamakan bahasa Tionghoa, tanpa klaim cakupan yang setara
• Ukuran permintaan — Qwen-Audio-3.0-TTS 20.000 karakter per permintaan vs StepAudio 3 TTS tidak dipublikasikan
• Latensi — Qwen-Audio-3.0-TTS Flash menargetkan latensi paket pertama dalam 200 ms menurut dokumentasi Alibaba sendiri vs streaming StepAudio 3 TTS, tidak ada angka yang dipublikasikan
• Penjenjangan — Qwen-Audio-3.0-TTS Plus untuk ekspresivitas dan Flash untuk real-time, enam suara unggulan terkunci ke salah satu tier vs StepAudio 3 TTS dengan satu tier
• Permukaan kontrol — arahan penyampaian bahasa alami Qwen-Audio-3.0-TTS serta tag ekspresi sebaris seperti [excited], [laughing], [whispers] yang disematkan dalam teks masukan vs prosodi yang diinferensi oleh model StepAudio 3 TTS dari konteks
• Kloning suara — StepAudio 3 TTS tarif tetap 9,9 yuan per suara yang dikloning di semua tier TTS-nya vs kloning Qwen-Audio-3.0-TTS melalui Alibaba Cloud Model Studio
• Keluaran — laju sampel default 24 kHz untuk Qwen-Audio-3.0-TTS vs StepAudio 3 TTS yang tidak dipublikasikan
Baris permukaan kontrol itu adalah perbedaan desain yang sesungguhnya, dan ini bukan soal kualitas. Tag ekspresi Qwen bersifat eksplisit dan sinkron: Anda menuliskan emosi ke dalam teks dan model merendernya, yang membuatnya dapat diuji dan cocok untuk pengujian regresi. Deskripsi StepFun adalah tentang model yang menyimpulkan keraguan atau tawa yang sesuai dari konteks, yang terdengar lebih baik saat benar dan jauh lebih sulit dipastikan saat salah. Pilih sesuai dengan apakah Anda lebih suka merancang sendiri performanya atau mendelegasikannya.

Bagaimana memutuskan tanpa pengukuran
Anda tidak dapat menalar jalan menuju jawaban dari angka-angka yang dipublikasikan, karena angka yang menentukan itu tidak ada. Yang tersisa adalah pengujian, dan menguji keduanya memiliki bentuk khusus yang perlu direncanakan.
Keduanya adalah API komersial yang hanya tersedia sebagai layanan hosted — Qwen-Audio-3.0-TTS melalui Alibaba Cloud Model Studio, StepAudio 3 TTS melalui platform terbuka StepFun. Tidak satu pun bersifat open weights, jadi tidak ada jalur self-hosted untuk dievaluasi. Untuk lebih tepatnya tentang apa yang dicakup OrcaRouter di sini: model text-to-speech di katalog kami saat ini adalah keluarga OpenAI tts-1, gpt-4o-mini-tts, dan preview Gemini TTS dari Google. Tidak ada satu pun model dalam artikel ini yang ada di dalamnya, dan Qwen-Audio-3.0-TTS juga tidak — tidak ada apa pun di sini yang boleh ditafsirkan sebagai klaim bahwa kami melayani model-model tersebut.
Bagian yang memang berjalan di OrcaRouter adalah separuh teks dari pipeline. Skrip yang dibaca oleh lapisan sintesis Anda dihasilkan oleh model bahasa, dan itulah komponen yang paling sering berubah, paling mahal untuk dikontrak ulang, dan paling mudah dibiarkan tanpa pin — hampir 200 model teks di balik satu API, failover otomatis, DSL perutean yang menggabungkan beberapa menjadi satu panggilan, dan fusi model ketika penilaian satu model tidak cukup, dengan harga daftar penyedia diteruskan tanpa markup. Jika Anda menjalankan evaluasi buta antara dua model sintesis ini, hasilkan korpus melalui satu endpoint agar kedua kandidat membaca input yang identik, dan pertahankan lapisan sintesis di balik antarmuka yang dapat Anda tukar.
Apa implikasinya bagi keputusan tersebut
Ambil Qwen-Audio-3.0-TTS hari ini jika Anda membutuhkan keluasan — lebih dari seribu suara, 16 bahasa dan 20 dialek, batas permintaan 20.000 karakter yang terdokumentasi, tingkat latensi dan tingkat ekspresivitas, target paket pertama 200 ms, dan tarif di bawah StepFun. Ini adalah model yang didukung pengukuran dan memiliki jangkauan lebih luas, dan Elo peringkat keempatnya adalah hasil nyata meskipun bukan mahkota seperti yang sering dikutip untuknya.
Ambil StepAudio 3 TTS jika Anda membangun dengan prioritas bahasa Mandarin, menginginkan satu tier alih-alih keputusan pemilihan tier, menginginkan kloning dengan biaya tetap yang dipublikasikan, dan bersedia menjadi pengguna awal pada model yang belum diuji secara buta. Anda membayar sekitar 27% lebih banyak per karakter daripada tier Plus Qwen sebagai imbalan atas peningkatan prosodi yang diklaim satu generasi dibandingkan model yang tertinggal 25 Elo dengan error bar yang tumpang tindih.
Yang bisa menyelesaikannya adalah satu kali menjalankan ulang arena dengan StepAudio 3 TTS di dalam pool. Sampai pemungutan suara itu terjadi, ini adalah model yang terukur melawan model yang belum terukur, dan 25 poin yang memisahkan pendahulu mereka berada di dalam noise — yang bukan merupakan peringkat, dan tidak boleh dijual sebagai peringkat.
