Breeze TTS 2 — Pemimpin TTS Open Weights baru dengan Elo 1.215. Ilustrasi yang dibuat ulang.
Guides & Insights

Breeze TTS 2: Pemimpin TTS Open Weights Baru dengan Elo 1,215

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Breeze TTS 2 kini menjadi model text-to-speech open-weights peringkat teratas di Provider Voices Speech Arena milik Artificial Analysis, dengan 1.215 Elo — unggul 90 poin dari pemimpin open-weights sebelumnya, Fish Audio S2 Pro, dan berada di peringkat #6 secara keseluruhan dari lebih dari 100 sistem yang dinilai. Pencatatan ini merupakan konfirmasi independen pertama atas apa yang telah diklaim BreezeBlue sejak meluncurkan model tersebut pada pertengahan Agustus 2026: bahwa model suara berusia dua minggu dari startup dengan sekitar 15 orang dapat sejajar dengan lini terdepan text-to-speech komersial. Bobot terbuka tersebut tayang di Hugging Face pada 25 Agustus 2026; hasil arena menyusul dalam sehari. Apa pun yang ternyata Breeze TTS 2 nantinya, ia bukan lagi sekadar janji vendor — ia memiliki Elo yang membuktikannya.

Apa yang sebenarnya terjadi, secara berurutan

Linimasa penting dalam hal ini, karena menjelaskan mengapa unggahan "open weights leaderboard" datang dari perusahaan yang tiga minggu lalu belum pernah didengar banyak orang. BreezeBlue didirikan oleh Yang Bin, mantan salah satu pendiri teknis dari salah satu laboratorium AI terkemuka di Tiongkok, dengan pendanaan awal senilai $6 juta yang dipimpin oleh Yuanjing Capital dan Redpoint China. Model tersebut melewati tiga tonggak yang terlihat:

• 7 Agustus 2026 — BreezeBlue menerbitkan rangkaian tolok ukur text-to-speech miliknya sendiri untuk desain suara, arahan suara, dan evaluasi latensi di Hugging Face.

• 16–17 Agustus 2026 — perusahaan secara resmi mengumumkan Breeze TTS 2 sebagai model suara unggulan real-time untuk media interaktif, dan membuka API yang dihosting dengan harga $34 per 1 juta karakter.

• 25 Agustus 2026 — bobot dan kode inferensi PyTorch dirilis sebagai sumber terbuka di Hugging Face dengan nama BreezeBlue/Breeze-TTS-2, sebuah model berparameter 3B di bawah lisensi riset dan non-komersial.

Peringkat Artificial Analysis Provider Voices sudah tayang dalam hitungan hari setelah perilisan open-weights. Karena arena tersebut menilai model melalui pendengaran berdampingan secara buta, Elo 1.215 bukanlah tolok ukur yang dijalankan BreezeBlue pada dirinya sendiri — itu adalah akumulasi penilaian pendengar yang membandingkan sampel nyata, yang justru paling kurang dimiliki oleh model semuda ini.

Papan skor

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Peringkat arena — #6 secara keseluruhan di Provider Voices; #1 di antara semua model open-weights, mengungguli Fish Audio S2 Pro (1.125 Elo).

• Elo — 1.215, dengan CI 95% sekitar ±17 (Artificial Analysis, per akhir Agustus 2026).

• Bahasa — 50, menurut BreezeBlue; kartu model diberi tag bahasa Inggris dan Tionghoa.

• Harga — $34 per 1 juta karakter di endpoint yang dihosting BreezeBlue; bobot terbuka gratis untuk diunduh tetapi memiliki lisensi non-komersial.

• Kecepatan — sekitar 45 karakter per detik berdasarkan pengukuran Artificial Analysis — lebih lambat daripada beberapa pesaing, yang penting untuk pekerjaan berdurasi panjang.

• Latensi — latensi streaming di bawah 40ms, menurut BreezeBlue (pernyataan vendor, tidak diukur secara independen).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Apa yang sebenarnya dilakukan Breeze TTS 2 secara berbeda

Elo menjadi sorotan utama, tetapi klaim produknya lebih menarik daripada skornya. Breeze TTS 2 dibangun di sekitar dua gagasan yang dianggap sekadar pelengkap oleh sebagian besar model text-to-speech: desain suara dan arah suara. Desain suara bersifat zero-shot dan tanpa referensi — Anda mendeskripsikan sebuah suara dalam bahasa alami ("seorang narator yang hangat, berusia pertengahan 40-an, dengan logat selatan yang sedikit kental dan humor kering") dan modelnya menghasilkan suara tersebut tanpa rekaman studio atau klip referensi. Arah suara memisahkan timbre pembicara dari maksud penyampaian, sehingga Anda dapat membuat sebuah kalimat terdengar sarkastis, berbisik, atau terburu-buru tanpa modelnya bergeser menjadi karakter yang berbeda. BreezeBlue mengatakan identitas pembicara yang sama tetap bertahan melalui pergeseran tersebut, dan tolok ukur arah suaranya sendiri melaporkan kemiripan pembicara sebesar 0,67 SPK_SIM (dilaporkan vendor).

Kedua kemampuan tersebut menunjukkan pasar yang dituju Breeze TTS 2. Materi persnya jelas: karakter video game, pendamping digital, penceritaan naratif, drama siaran, dan streamer virtual — audio jangka panjang, berbasis peran, dan multi-karakter, bukan sekadar API narasi lain. Perusahaan menyediakan pustaka suara pendamping bernama Voice Galaxy dengan lebih dari 15.000 suara karakter buatan komunitas dan studio, dan demo reel BreezeBlue adalah drama radio penggemar multi-karakter yang berdurasi lebih dari sepuluh menit. Pada tolok ukur yang dirilis sendiri (dilaporkan vendor, belum direproduksi), Breeze TTS 2 mengklaim posisi #1 pada tolok ukur Voice Design text-to-speech dengan skor Role Fit 78.02 dibandingkan 72.78 untuk MiMo-V2.5-TTS, dan komposit Voice Direction 4.25.

Tanda bintang lisensi

Sebelum frasa "open weights" terlalu banyak melakukan pekerjaan pemasaran, bacalah kartu model. Breeze TTS 2 adalah 3B parameter, safetensors, F32/BF16, dan kode sumber adalah Apache 2.0 — tetapi bobot, model turunan, dan keluaran yang di-host sendiri dilisensikan hanya untuk penelitian dan penggunaan non-komersial, di bawah lisensi breezeblue-research-and-non-commercial-license. Artinya, "open weights" di sini bukan berarti "gratis untuk produk Anda." Self-hosting komersial tidak diizinkan oleh lisensi sebagaimana tertulis; jalur komersialnya adalah API yang di-host dengan harga $34 per 1 juta karakter. Ini bentuk yang sama dengan beberapa rilis terbuka lain pada 2026 — dapat diperiksa dan dapat di-host sendiri untuk penelitian, tetapi penggunaan yang menghasilkan pendapatan dicadangkan untuk endpoint milik vendor sendiri.

Mengapa router penting untuk model yang semuda ini

Risiko yang sesungguhnya dengan Breeze TTS 2 saat ini bukanlah kualitas — melainkan usianya. Model ini telah rilis selama sepuluh hari, dan bobotnya selama dua hari. Tidak ada tim produksi yang boleh mempertaruhkan pipeline suara pada model semuda itu tanpa cara untuk berpindah darinya, dan justru itulah mode kegagalan yang dirancang untuk diserap oleh lapisan routing. Jika Anda mengevaluasi Breeze TTS 2 melalui gateway yang memperlakukan endpoint vendor sebagai salah satu dari banyak rute, Anda mendapatkan pemimpin Elo hari ini, failover otomatis ke penyedia cadangan saat API menurun, dan perubahan satu baris jika model yang berusia seminggu menunjukkan regresi. Itulah disiplin yang sama yang diterapkan DSL routing pada model apa pun: padukan dengan alternatif, pertahankan antarmuka yang stabil, dan biarkan modelnya membuktikan diri sebelum Anda menjadikannya tulang punggung. Belum ada model dalam seri ini yang dirutekan pada OrcaRouter itu sendiri, jadi saran yang jujur adalah menyambungkan Breeze TTS 2 ke gateway apa pun yang sudah Anda jalankan — dan pertahankan penyedia Anda saat ini tetap aktif di sampingnya selama Elo semakin matang dan semakin dapat dipercaya.

Tontonan Berikutnya

{{1}}Slot Provider Voices #1-open-weights adalah cerita hari ini{{/1}}, tetapi ini adalah arena yang lebih lemah dari dua arena bagi model ini. {{2}}Di arena Controlled Voice milik Artificial Analysis, tempat semua model dibandingkan pada suara referensi tetap yang sama, Breeze TTS 2 menempati peringkat #3 di antara model open-weights dengan 1.002 Elo, di belakang Voxtral milik Mistral yang mencapai 1.010 — dan #16 secara keseluruhan dari 39 model.{{/2}} {{3}}Kesenjangan antara skor provider-voice-nya (1.215, #1 open) dan skor controlled-voice-nya (1.002, #3 open) layak diperhatikan: hal ini menunjukkan bahwa keunggulan Breeze TTS 2 terkonsentrasi pada suara yang ia rancang sendiri, yang persis merupakan klaim produk, dan juga persis klaim yang harus terus mendapat tekanan dari benchmark independen.{{/3}} Perhatikan apakah Elo controlled-voice menutup ke arah angka provider-voice, apakah lisensi komersial mengencang atau melonggar, dan — yang terpenting — apakah ada pihak yang mereproduksi benchmark desain suara dan arahan suara di luar milik BreezeBlue sendiri.

Untuk model yang sebulan lalu belum ada, Breeze TTS 2 telah memperoleh hal paling berguna yang bisa didapatkan model text-to-speech: skor independen yang sejalan dengan pemasaran. Apakah ia menjadi suara default untuk produk interaktif bergantung lebih kecil pada pembaruan Elo berikutnya daripada pada bagaimana lisensi dan cerita self-hosting berkembang — tetapi sejak minggu ini, text-to-speech open-weights memiliki pemimpin baru, dan usianya baru dua minggu.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.