Kartu judul utama yang membandingkan 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe', dengan overline 'Streaming ASR - Sept 2026', subjudul yang menyebutkan dua penantang streaming berjarak satu hari - API Meta seharga $0,18 per jam dan checkpoint MIT Microsoft tanpa rumah hosting, chip 'MIT weights - Sep 2', 'Meta API - Sep 1', dan 'Both unverified', serta catatan kaki 'Same headline promise'. Logo OrcaRouter ditempatkan di pojok kanan bawah.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: Dua Penantang Streaming, Berjarak Satu Hari

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dalam kurun waktu sekitar tiga puluh enam jam pada awal September 2026, dua laboratorium besar merilis model streaming ucapan-ke-teks yang mengusung janji utama yang sama — transkrip langsung yang juga memberi tahu siapa yang mengatakan apa, tepat saat kata-kata itu diucapkan. Pada 1 September, Meta Superintelligence Labs meluncurkan Muse Voice Transcribe sebagai API yang dihosting dengan harga $3,00 per 1.000 menit audio, sekitar $0,18 per jam, dengan pengenalan streaming, diarisasi pembicara 20+, dan endpointing yang dipadukan dalam satu proses. Pada 2 September, Microsoft Research mengunggah VibeVoice-ASR-Streaming-7B ke Hugging Face: bobot terbuka berlisensi MIT, tanpa pengumuman, kartu model yang mengklaim transkripsi streaming dengan atribusi pembicara, hotwords, dan sepuluh bahasa, serta tanpa layanan yang dihosting di mana pun. Pitch yang sama, model bisnis yang berlawanan, dan bukti di kedua sisi yang lebih tipis daripada yang ingin diakui oleh kedua lab tersebut.

Halaman ini ditulis berdasarkan apa yang kita ketahui sejauh ini, karena tidak ada satu pun model yang memiliki angka akurasi terverifikasi secara independen. Angka Muse Voice Transcribe adalah klaim hari peluncuran Meta, dilaporkan vendor dan belum direproduksi; VibeVoice-ASR-Streaming-7B belum memublikasikan angka akurasi streaming apa pun dalam bentuk teks sama sekali. Oleh karena itu, perbandingan di bawah ini bertumpu pada hal-hal yang bersifat struktural dan dapat diketahui — arsitektur, harga, lisensi, perilaku terdokumentasi — dan memberi label pada sedikit angka vendor yang muncul.

Dua penantang untuk pipeline batch, dengan selisih satu hari

Kedua model ini menyerang asumsi yang sama: bahwa speech-to-text adalah sesuatu yang Anda jalankan pada rekaman yang sudah selesai. Muse Voice Transcribe adalah produk pertama yang Meta sebut sebagai "model persepsi audio real-time" — satu lintasan streaming yang melakukan pengenalan, diarisasi pembicara untuk lebih dari dua puluh suara, dan deteksi titik akhir, yakni tugas menentukan kapan seorang pembicara benar-benar selesai, bukan sekadar berhenti sejenak. Model ini hadir di tiga platform sekaligus: Meta Model API dengan tarif $0.18 per jam audio, Meta AI untuk Mac yang memungkinkan pengguna menahan tombol Fn untuk mendiktekan ucapan ke aplikasi mana pun, dan Muse Code. VibeVoice-ASR-Streaming-7B milik Microsoft adalah anggota streaming dari keluarga VibeVoice sumber terbuka, dan jejak perilisannya jauh lebih senyap: repositori Hugging Face yang dibuat pada 2 September (stempel waktu menunjukkan 15:46 UTC, terakhir diubah tiga menit kemudian), delapan shard safetensors dengan lisensi MIT, serta baris log berita bertanggal 3 September di repositori GitHub microsoft/VibeVoice yang menyebutnya "model ASR streaming terpadu yang terus-menerus mentranskripsikan siapa yang mengatakan apa saat ucapan tiba, dengan dukungan untuk hotword yang dapat disesuaikan dan 10 bahasa." Sehari setelah diunggah, model itu masih menampilkan nol unduhan.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Tabrakan fitur

Mekanisme streaming — Muse Voice Transcribe mengonsumsi audio dalam potongan 80 milidetik dan mengunci kata-kata saat kata-kata tersebut stabil, dibandingkan dengan VibeVoice-ASR-Streaming-7B yang memproses potongan sekitar 2,9 detik dengan jangkauan ke depan sekitar 0,5 detik, serta mengeluarkan teks satu kali per potongan yang diselesaikan.

• Atribusi pembicara — 20+ pembicara dalam satu proses, rata-rata kesalahan diarisasi 17,5% yang dilaporkan vendor vs keluaran streaming siapa-mengatakan-apa yang diklaim pada kartu model, belum terverifikasi.

• Endpointing — bawaan: aliran membawa batas ucapan yang selesai vs tidak didokumentasikan sebagai sinyal keluaran.

• Kontrol konteks — bias bahasa, kata kunci, dan konteks vs hotword khusus melalui prompt konteks (--context_info).

• Bahasa — dilatih pada 70+ bahasa, 25 terverifikasi secara ekstensif saat peluncuran, code-switching native vs 10 bahasa yang dideklarasikan (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Bukti — klaim vendor saat peluncuran: 3,1% WER pada hasil akhir dalam 0,16 detik setelah ucapan, 3,6% pada hasil parsial pertama, mengutip papan peringkat streaming Artificial Analysis vs tidak ada angka WER streaming atau latensi yang dipublikasikan sebagai teks.

• Biaya dan lisensi — $0,18 per jam audio, dihosting, bobot tertutup vs $0 untuk bobot (MIT), sekitar 18 GB bf16, dihosting sendiri.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

Dua gagasan yang sangat berbeda tentang "streaming"

Istilah "streaming" mencakup rentang irama yang lebar, dan jarak di antara keduanya cukup lebar untuk mengubah apa yang dapat Anda bangun di atas masing-masingnya. Muse Voice Transcribe melakukan streaming pada granularitas kata. Arsitektur Meta mengonsumsi audio dalam potongan 80 milidetik dan menerapkan apa yang disebutnya "adaptive delay" — kebijakan penundaan hasil pembelajaran penguatan yang memfinalisasi setiap kata begitu model cukup yakin, tetapi menahan lebih banyak konteks untuk kata-kata yang kurang diyakininya, alih-alih menerapkan satu anggaran latensi tetap. Vendor mengklaim transkrip final keluar 0,16 detik setelah pembicara berhenti dan hasil parsial pertama muncul 0,13 detik setelah mulai berbicara. Irama semacam itu dirancang untuk alur interaktif: transkripsi langsung, dikte, dan agen suara yang perlu merespons hampir seketika setelah sebuah ucapan selesai.

VibeVoice-ASR-Streaming-7B melakukan streaming pada granularitas yang lebih kasar. Konfigurasi preprocessornya menunjukkan audio masuk pada 24 kHz, dikompresi 3.200× menjadi token pada sekitar 7,5 frame per detik, lalu diproses dalam potongan 22 frame dengan lookahead 4 frame — kira-kira 2,9 detik audio per potongan, sekitar setengah detik lookahead, angka-angka yang diturunkan dari konfigurasi, bukan dari latensi terukur. Teks dikeluarkan setiap potongan selesai diproses, dengan konteks dari potongan-potongan sebelumnya dipertahankan melalui cache KV sehingga sesi yang panjang tidak menghitung ulang dari awal. Transkrip yang bertambah dalam kenaikan sekitar tiga detik sudah memadai untuk notulen rapat dan analitik panggilan; ini merupakan produk yang berbeda dari streaming kata sub-detik untuk percakapan langsung. Belum ada laboratorium yang memublikasikan pengukuran latensi ujung-ke-ujung untuk checkpoint streaming tersebut, jadi anggap irama tersebut sebagai desain dan nuansa dunia nyata sebagai sesuatu yang belum teruji.

Label pembicara dan endpointing: bawaan pada satu, hanya diklaim pada yang lain.

Atribusi pembicara adalah bidang di mana produk streaming paling sering melebih-lebihkan, dan kedua hal ini membuat klaim tersebut. Versi Muse Voice Transcribe bersifat konkret dan struktural: diarisasi berjalan dalam aliran streaming yang sama dengan pengenalan, sehingga rekaman panggilan dua puluh orang dapat membawa label per-pembicara tanpa langkah terpisah "unggah, tunggu, dapatkan pembicara kembali", dan Meta melaporkan tingkat kesalahan diarisasi rata-rata 17,5% — angka vendor, tidak direproduksi, tetapi angka yang melekat pada mekanisme nyata. Ia juga mengeluarkan batas titik akhir, kemampuan yang lebih tenang: aplikasi mendapatkan sinyal bersih "giliran pembicara ini selesai" tanpa membangun detektor aktivitas suara, itulah sebabnya agen suara yang dibangun di atas ASR mentah sering kali memotong pembicaraan orang.

VibeVoice-ASR-Streaming-7B mengklaim output streaming yang menyebut siapa mengatakan apa pada kartu modelnya, sejalan dengan output Who/When/What terstruktur milik VibeVoice-ASR batch — tetapi untuk checkpoint streaming, klaim tersebut belum terverifikasi, tidak ada uji independen yang mereproduksinya, dan tidak ada sinyal endpointing terdokumentasi seperti yang disertakan Muse. Jika beban kerja Anda benar-benar audio langsung dengan banyak pembicara, Muse menawarkan mekanisme yang lebih lengkap saat ini; jika Anda sedang mengevaluasi apakah model open-weights dapat melakukan tugas yang sama pada perangkat keras yang Anda kendalikan, klaim VibeVoice adalah hal yang tepat untuk diuji dengan rekaman rapat Anda sendiri sebelum mempercayainya.

Bukti: klaim hari peluncuran terhadap kartu kosong.

Perlu bersikap presisi tentang apa yang dimiliki masing-masing pihak, karena tidak ada satu pun yang memiliki apa yang sebenarnya diinginkan pembeli. Muse Voice Transcribe memiliki serangkaian angka vendor yang padat — tingkat kesalahan kata 3,1% pada transkrip akhir, 3,6% pada transkrip parsial pertama, latensi akhir 0,16 detik, dan rata-rata kesalahan diarisasi 17,5% — semuanya dipublikasikan oleh Meta pada hari peluncuran dan menunjuk ke papan peringkat streaming speech-to-text Artificial Analysis, tempat Meta mengklaim posisi teratas. Itu adalah klaim, yang tidak direproduksi oleh siapa pun di luar lab, tetapi cukup spesifik untuk difalsifikasi, yang merupakan semacam kemajuan.

VibeVoice-ASR-Streaming-7B tidak memiliki semua itu. Kartu modelnya menyertakan figur evaluasi sebagai gambar dan laporan teknis streamingnya berupa PDF, tetapi tidak ada angka WER streaming atau latensi yang dapat dikutip dalam prosa. Satu-satunya jangkar numerik dalam keluarga VibeVoice adalah tabel yang dilaporkan vendor pada kartu VibeVoice-ASR batch — rata-rata WER 7,77% pada delapan set tes bahasa Inggris, 2,20% pada LibriSpeech clean — yang secara eksplisit bukan angka checkpoint ini. Ketika klaim hari peluncuran bertemu dengan kartu kosong, penentu yang jujur adalah segala sesuatu kecuali WER utama: harga, lisensi, irama streaming, dan fitur yang benar-benar didokumentasikan oleh masing-masing pihak.

Bahasa: 25 terverifikasi terhadap 10 yang dideklarasikan

Cakupan bahasa lebih membedakan keduanya dibandingkan klaim akurasi utamanya. Muse Voice Transcribe dilatih pada 70+ bahasa, tetapi Meta memvalidasi 25 bahasa saat peluncuran — dan daftar yang tervalidasi, bukan daftar pelatihan, adalah cakupan produksinya, dengan alih kode asli sebagai pembedanya: model ini dirancang untuk berpindah bahasa di tengah kalimat tanpa diberi tahu. VibeVoice-ASR-Streaming-7B menyatakan 10 bahasa dalam kartu modelnya — Inggris, Mandarin, Spanyol, Portugis, Jerman, Jepang, Korea, Prancis, Rusia, Italia — dibandingkan dengan 50+ bahasa pada VibeVoice-ASR versi batch. Jika lalu lintas Anda mencakup percakapan dengan alih kode, Muse memiliki tawaran yang lebih spesifik; jika lalu lintas tersebut berada dalam sepuluh bahasa itu, cakupan model Microsoft setidaknya eksplisit, yang mana itu lebih dari sekadar yang ditawarkan kebanyakan materi peluncuran.

Biaya dan apa yang Anda simpan

Perbedaan model bisnis adalah cara paling jelas untuk menentukan pilihan. Muse Voice Transcribe dengan harga US$0,18 per jam audio mengalahkan harga tercantum semua API transkripsi streaming besar — tanpa GPU, tanpa operasional, bobot tertutup, dan harganya ditetapkan oleh Meta. VibeVoice-ASR-Streaming-7B tidak memerlukan biaya unduh, tetapi membutuhkan sekitar 18 GB bobot bf16 sebelum cache KV untuk dihosting sendiri di GPU kelas 24 GB, dengan skrip demo microsoft/VibeVoice atau plugin vLLM sebagai jalur penyajian yang terdokumentasi, dan belum ada penyedia inferensi yang menghostingnya. Lisensi MIT adalah aset berkelanjutan: bobot tersebut milik Anda untuk disimpan dan di-fine-tune, sesuatu yang tidak bisa ditawarkan oleh langganan API mana pun. Di situlah gambaran harga dapat menjadi menarik — begitu ada penyedia yang menghosting checkpoint terbuka tersebut, pertanyaan US$0,18 per jam berubah menjadi harga pasar, bukan harga tercantum satu vendor, dan justru di situ router pass-through membuktikan nilainya. OrcaRouter tidak merutekan ucapan-ke-teks saat ini, dan kedua model ini tidak ada dalam katalognya; yang dilakukannya adalah meneruskan harga tercantum penyedia dengan markup 0% pada 200+ model bahasa yang mengonsumsi transkrip langsung, sehingga pemotongan harga vendor di mana pun di tumpukan tersebut langsung dirasakan pembeli pada hari yang sama saat diumumkan.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Pertanyaan yang Sering Diajukan

Apakah WER 3,1% dari Muse Voice Transcribe berarti ia lebih akurat daripada VibeVoice-ASR-Streaming-7B?

Tidak, dan perbandingan tersebut belum bermakna. Angka 3,1% dari Meta adalah klaim hari peluncuran untuk jalur streaming, yang dilaporkan oleh vendor dan belum direproduksi. VibeVoice-ASR-Streaming-7B belum menerbitkan angka akurasi streaming dalam bentuk teks sama sekali. Sampai kedua model dijalankan melalui kerangka uji publik yang sama pada audio yang sama, satu-satunya pernyataan jujur adalah bahwa Muse memiliki klaim spesifik yang dapat diuji dan VibeVoice belum memilikinya.

Dapatkah saya menggunakan salah satu model pada audio yang sudah direkam?

Ya untuk keduanya, dengan bentuk yang berbeda. Muse Voice Transcribe menangani rekaman yang lebih lama dari satu jam melalui API streaming yang sama. Plugin vLLM milik VibeVoice-ASR-Streaming-7B mengekspos endpoint transkripsi seluruh file di samping endpoint streaming WebSocket-nya. Tetapi keduanya dirancang dan dihargai untuk kasus live — Muse dengan model bisnis streaming-only-nya, VibeVoice dengan arsitektur terpotong yang mengeluarkan hasil saat audio tiba — jadi jika beban kerja Anda murni file batch, API transkripsi file khusus biasanya akan lebih murah dan lebih terukur daripada keduanya.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube