
Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS: Apa Hasil Dua Bulan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 495 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 186 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Qwen-Audio-3.0-TTS dirilis pada 20 Juli 2026 dan langsung menduduki puncak papan peringkat suara independen — tier Plus mencapai 1.238 Elo pada papan peringkat Provider Voice Arena milik Artificial Analysis, peringkat kedua di papan tersebut. Sembilan minggu kemudian, pada 23 September 2026, vendor mengumumkan Qwen-Audio-3.1-TTS di Apsara Conference di Hangzhou dengan pemotongan harga sekitar 70%. Waktu itu membuat perbandingan ini tidak biasa: model yang digantikan tidak usang, melainkan telah diuji tolok ukur, terbukti, dan masih berada di dekat puncak. Jadi pertanyaan sebenarnya bukanlah mana yang lebih baik. Melainkan apa yang secara spesifik berubah, apakah ada di antaranya yang penting bagi beban kerja Anda, dan apa yang terjadi pada skor yang sudah Anda percayai ketika penerusnya belum diberi skor sama sekali.
Dua bulan, lima endpoint, satu keluarga
Alibaba tidak merilis satu model pun. Rilis 3.1 mencakup lima: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next, dan Qwen-Audio-3.1-Realtime. Bagi siapa pun yang saat ini memanggil Qwen-Audio-3.0-TTS, hanya satu di antaranya yang dapat langsung menggantikannya — tier TTS biasa — dan satu merupakan produk baru yang sesungguhnya, bukan sekadar peningkatan.
Yang kedua itu layak dipahami bahkan jika Anda tidak pernah memanggilnya. Qwen-Audio-3.1-TTS-Next adalah yang oleh Alibaba disebut model "Audiogen": satu kali proses yang menghasilkan suara, efek suara, dan ambiens latar belakang secara bersamaan dari teks, stempel waktu, dan audio referensi. Dialog multi-pembicara, perakitan podcast, lanskap suara adegan, output 48 kHz. Dokumentasi Model Studio Alibaba Cloud mencantumkan batasannya secara gamblang — 3.000 karakter input, 240 detik audio yang dihasilkan untuk podcast dan 120 detik untuk lainnya, 3 permintaan per detik, output WAV, MP3, atau PCM, dan menerima hingga tiga klip referensi masing-masing 30 detik dalam WAV, MP3, atau OGG Opus. Input referensi PCM mentah tidak didukung. Harganya $0.848 per juta token input dan $1.696 per juta token output di node Beijing, tidak termasuk tarif promosi, dan hanya menangani bahasa Mandarin dan Inggris.
Jika Anda memakai 3.0-TTS dan tugas Anda adalah "mengubah skrip ini menjadi suara," tidak ada dari semua itu yang mengubah integrasi Anda. Jika tugas Anda adalah "menyusun podcast dua pembawa acara dengan musik latar," 3.1-TTS-Next adalah kategori produk yang berbeda dan mungkin alasan untuk melihat rilis ini sama sekali.
Peningkatan itu, baris demi baris

• Bahasa — Qwen-Audio-3.1-TTS: 16 bahasa menurut laporan vendor, dengan tujuh tambahan dibandingkan generasi sebelumnya. Qwen-Audio-3.0-TTS: 16 bahasa sebagaimana tercantum dalam liputan yang dipublikasikan tentang rilis Juli.
• Dialek Tionghoa — Qwen-Audio-3.1-TTS: 20 wilayah dialek, dipertahankan. Qwen-Audio-3.0-TTS: 20 wilayah dialek.
• Transfer timbre lintas bahasa — Qwen-Audio-3.1-TTS: ya, satu suara dibawa melintasi bahasa Mandarin, Kanton, Inggris, dan Jepang. Qwen-Audio-3.0-TTS: tidak ditawarkan.
• Kontrol penyampaian — Qwen-Audio-3.1-TTS: kontrol berbasis instruksi atas emosi, tempo, dan gaya. Qwen-Audio-3.0-TTS: 86 tag penyampaian inline.
• Input referensi berisik — Qwen-Audio-3.1-TTS: menangani audio referensi yang berisik atau bergema secara langsung, tanpa mode penghilangan derau terpisah. Qwen-Audio-3.0-TTS: mengharapkan audio referensi yang bersih.
• Skor independen — Qwen-Audio-3.1-TTS: belum ada. Qwen-Audio-3.0-TTS-Plus: 1.238 Elo di papan peringkat Provider Voice Arena milik Artificial Analysis per Agustus 2026.
Jumlah bahasa tidak cocok, dan itu penting
Ini hal kecil yang akan ditutupi begitu saja di tempat lain, jadi layak disebutkan. Materi peluncuran Alibaba menyebutkan tier TTS 3.1 menambahkan tujuh bahasa. Liputan yang diterbitkan tentang generasi 3.0 Juli — termasuk artikel perbandingan kami sendiri dari bulan itu — mencantumkan 16 bahasa untuk tier 3.0. Tujuh ditambah enam belas adalah dua puluh tiga, bukan enam belas, dan Alibaba belum menerbitkan rekonsiliasi atas kedua angka tersebut.
Penjelasan yang mungkin tidak glamor: angka 3.1 mungkin menghitung kumpulan yang berbeda, angka 3.0 mungkin telah dibesar-besarkan saat peluncuran, atau "menambahkan tujuh" mungkin menggambarkan tier ASR dan bukan TTS. Kita tidak tahu yang mana. Yang kita tahu adalah bahwa jumlah bahasa di kedua sisi perbandingan ini adalah angka yang dilaporkan vendor yang belum pernah diaudit secara independen, dan siapa pun yang mengutip "16 bahasa" sebagai fakta pasti tentang salah satu model sedang mengutip slide pemasaran. Periksa bahasa spesifik yang Anda butuhkan terhadap dokumentasi Model Studio sebelum Anda merencanakan berdasarkan suatu jumlah.

Kontrol instruksi adalah perubahan yang benar-benar terlihat di dalam kode
Dari semua hal dalam rilis TTS 3.1, inilah yang mengubah cara Anda menulis prompt. Generasi 3.0 mengendalikan penyampaian melalui 86 tag inline — kosakata tetap yang harus Anda pelajari, sisipkan di posisi yang tepat, dan yang melakukan persis seperti yang tertulis dan tidak lebih. Tingkat 3.1 menggantinya dengan instruksi bahasa alami: Anda mendeskripsikan emosi, tempo, gaya yang Anda inginkan, dan model menafsirkannya.
Perbedaan praktisnya adalah ekspresivitas versus prediktabilitas. Kosakata tag adalah kontrak — tag yang sama menghasilkan penyampaian yang sama setiap kali, yang memang Anda inginkan dalam alur produksi ketika sebuah suara harus konsisten di sepuluh ribu klip. Instruksi bebas lebih luas tetapi lebih longgar, dan ia mewarisi masalah sensitivitas prompt yang biasa: dua formulasi dari "hangat tetapi tidak sentimental" tidak akan menghasilkan efek yang identik, dan begitu pula dua pemanggilan frasa yang sama pada hari yang berbeda.
Jika pipeline Anda saat ini dibangun di atas 86 tag tersebut, peningkatan ini tidak gratis. Anda menukar permukaan kendali yang deterministik dengan yang probabilistik, dan pekerjaan porting bukanlah panggilan API — melainkan memvalidasi ulang setiap templat prompt yang Anda miliki terhadap interpretasi model baru. Anggarkan untuk itu sebelum Anda menganggarkan penghematannya.
Transfer timbre lintas bahasa, dan untuk apa sebenarnya hal itu
Satu suara referensi, yang dibawa melintasi bahasa Mandarin, Kanton, Inggris, dan Jepang, mempertahankan identitasnya saat bahasanya berubah. Di atas kertas, ini terbaca seperti butir fitur. Dalam praktiknya, ini menyelesaikan masalah spesifik yang mahal: seorang presenter tunggal yang harus hadir dalam lebih dari satu bahasa tanpa terdengar seperti orang yang berbeda di setiap bahasa.
Solusi sementara tradisionalnya adalah memilih pengisi suara terpisah untuk setiap bahasa dan menerima bahwa identitas suara merek Anda kini menjadi empat suara yang berbagi satu naskah. Alternatifnya adalah mengkloning satu pembicara ke setiap bahasa, yang justru merupakan alur kerja tempat suara hasil kloning cenderung melenceng — aksennya terbawa, warna suaranya menipis, dan pendengar menyadarinya dalam satu kalimat. Transfer timbre lintas bahasa adalah klaim bahwa tidak satu pun dari kompromi tersebut perlu dilakukan.
Saat ini, hal itu juga sepenuhnya belum terverifikasi. Tidak ada uji mendengarkan pihak ketiga pada Qwen-Audio-3.1-TTS dalam bahasa apa pun, dan demo milik Alibaba sendiri adalah satu-satunya bukti bahwa transfer tersebut tetap berlaku. Jika kemampuan ini adalah alasan Anda mempertimbangkan peningkatan versi, ujilah pada audio referensi Anda sendiri sebelum Anda berkomitmen — itu adalah eksperimen lima menit dan hanya itu yang menjawab pertanyaan tersebut.
Apa dampak pemotongan harga terhadap tagihan 3.0
Alibaba memangkas harga layanan bicara di semua lini: sintesis sekitar 70%, realtime sekitar 85%, pengenalan hingga 95%. Penyesuaian ini berlaku di Alibaba Cloud Model Studio pada 22 September 2026 pukul 00.00 waktu Beijing, mencakup wilayah Beijing dan Singapura, serta berlaku untuk endpoint TTS 3.1 dan realtime 3.0. Setelah penyesuaian, tier TTS Flash dipatok pada 1,5 yuan per juta token input dan 12 yuan per juta token output; tier realtime Flash dipatok pada 1,5 untuk input teks, 6 untuk input audio, 4,5 untuk output teks, dan 12 untuk output gabungan teks-dan-audio, per juta token.
Inilah bagian yang penting jika Anda sudah menjalankan 3.0-TTS. Tier 3.0 Plus berada mendekati $27,60 per juta karakter di Artificial Analysis sepanjang Agustus, dengan tier Flash mendekati $15. Jika pengurangan ~70% berlaku untuk tier yang Anda gunakan, tagihan Anda untuk beban kerja yang sama turun menjadi sekitar sepertiga dari sebelumnya — tanpa Anda mengubah satu baris kode pun. Itulah hal yang tidak biasa dari rilis ini: bagi pelanggan 3.0, penurunan harga lebih bernilai daripada peningkatan model, dan hal itu hadir baik Anda bermigrasi maupun tidak.
Dua catatan penting yang perlu diingat. Potongan persentase dikutip terhadap tarif yang berbeda menurut wilayah dan tier, jadi angka utama 70% bukanlah janji tentang lalu lintas spesifik Anda. Dan Alibaba Cloud memindahkan penagihan transkripsi realtime di node Singapura dari pengukuran berbasis durasi ke pengukuran berbasis token — $0,93 per juta token input dan $0,70 per juta token output — yang menjadi dasar yang kurang dapat diprediksi ketika keheningan, derau, dan konteks multi-turn semuanya mengembungkan konsumsi token. Bacalah kartu tarif baru dengan mengacu pada audio Anda sendiri, bukan pada siaran pers.
Kapan Qwen-Audio-3.0-TTS masih menjadi pilihan yang tepat
Tiga kasus, dan ketiganya bukan kasus tepi.
Ketika Anda membutuhkan angka yang dapat Anda pertahankan. Qwen-Audio-3.0-TTS-Plus memiliki Elo independen sebesar 1.238 — papan yang sama menunjukkan 1.259 untuk model tersebut pada September, masih peringkat kedua, sehingga skornya justru bergerak naik, bukan menurun — dari arena uji dengar buta dengan ribuan suara di belakangnya. Qwen-Audio-3.1-TTS tidak memiliki skor arena sama sekali. Jika proses persetujuan Anda memerlukan bukti pihak ketiga, model yang lebih lama itulah yang memilikinya, dan potongan harga tidak mengubah hal itu.

Ketika determinisme mengalahkan ekspresivitas. Jika pipeline produksi Anda dibangun di atas permukaan kontrol 86-tag, Anda memiliki sistem yang outputnya dapat Anda nalar. Kontrol berbasis instruksi lebih mumpuni tetapi kurang dapat diprediksi, dan biaya migrasinya nyata.
Ketika tidak ada apa pun dalam peningkatan versi ini yang menyentuh beban kerja Anda. Jika Anda menyintesis bahasa Mandarin dan Inggris pada volume sedang dengan suara referensi yang bersih dan kumpulan tag penyampaian yang tetap, maka transfer timbre lintas bahasa, ketahanan terhadap input berisik, dan tujuh bahasa tambahan semuanya memecahkan masalah yang tidak Anda miliki. Ambil potongan harganya, pertahankan modelnya.
Menjalankan keduanya tanpa menjalankan dua integrasi
Bagian yang merepotkan dari peralihan antargenerasi adalah bahwa Anda sering menginginkan kedua model aktif secara bersamaan — 3.0 untuk jalur produksi dengan skor di belakangnya, 3.1 untuk bahasa-bahasa baru dan fitur transfer, dan cara untuk memindahkan lalu lintas di antara keduanya tanpa penerapan ulang. Keduanya adalah API hosted tertutup di Alibaba Cloud Model Studio, jadi itu berarti dua endpoint, dua batas laju, dan dua mode kegagalan di balik satu fitur.
Catatan jujur tentang posisi kami: OrcaRouter tidak merutekan Qwen-Audio-3.1-TTS atau model Qwen-Audio apa pun, dan kami sama sekali tidak merutekan endpoint suara milik Alibaba. Yang kami sediakan adalah lapisan inferensi teks di sekitar pipeline seperti ini — satu kunci API untuk lebih dari 200 model tanpa markup, harga daftar penyedia diteruskan apa adanya, sehingga pemotongan harga dari vendor langsung terasa di sisi kami pada hari yang sama, bukan setelah satu siklus penetapan harga ulang. Jika layanan yang menggerakkan pipeline suara Anda adalah generator skrip, peringkas, atau perencana konten, itu berarti satu kontrak alih-alih beberapa, failover otomatis saat layanan hulu menurun, dan DSL perutean untuk menggabungkan model ke dalam satu panggilan. Itu tidak berarti Anda memanggil suara Qwen melalui kami, dan halaman apa pun yang menyiratkan sebaliknya salah mengenai katalog kami sendiri.
Ringkasan yang jujur
Qwen-Audio-3.1-TTS adalah peningkatan nyata dengan tiga tambahan yang penting — kontrol penyampaian berbasis instruksi, transfer timbre lintas bahasa, dan ketahanan terhadap audio referensi yang buruk — plus penurunan harga yang bernilai lebih besar daripada masing-masing tambahan itu. Qwen-Audio-3.0-TTS tidak digantikan dengan cara yang biasanya terjadi pada model berusia dua bulan: model ini masih memegang skor tolok ukur independen yang belum diraih penerusnya, dan masih mencakup rentang dialek Tionghoa yang menjadi tumpuan sebagian besar diferensiasi keluarga ini.
Jadi keputusannya lebih sempit daripada yang disiratkan oleh pemasaran. Jika Anda menghasilkan dalam volume besar, perubahan harga itu sudah berlaku bagi Anda. Jika Anda membutuhkan bahasa-bahasa baru atau transfer timbre, bermigrasilah dan validasi fitur tersebut pada audio Anda sendiri terlebih dahulu. Jika Anda membutuhkan angka kualitas yang dapat dipertahankan, tunggulah sampai Qwen-Audio-3.1-TTS muncul di arena uji dengar buta — itulah satu-satunya peristiwa yang akan menyelesaikan ini, dan sampai itu terjadi, posisi yang jujur adalah bahwa model yang lebih baru adalah yang lebih murah dan model yang lebih lama adalah yang sudah terbukti.
