
VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe: Dua Penantang Streaming, Berjarak Satu Hari
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Dalam kurun waktu sekitar tiga puluh enam jam pada awal September 2026, dua laboratorium besar merilis model streaming ucapan-ke-teks yang mengusung janji utama yang sama — transkrip langsung yang juga memberi tahu siapa yang mengatakan apa, tepat saat kata-kata itu diucapkan. Pada 1 September, Meta Superintelligence Labs meluncurkan Muse Voice Transcribe sebagai API yang dihosting dengan harga $3,00 per 1.000 menit audio, sekitar $0,18 per jam, dengan pengenalan streaming, diarisasi pembicara 20+, dan endpointing yang dipadukan dalam satu proses. Pada 2 September, Microsoft Research mengunggah VibeVoice-ASR-Streaming-7B ke Hugging Face: bobot terbuka berlisensi MIT, tanpa pengumuman, kartu model yang mengklaim transkripsi streaming dengan atribusi pembicara, hotwords, dan sepuluh bahasa, serta tanpa layanan yang dihosting di mana pun. Pitch yang sama, model bisnis yang berlawanan, dan bukti di kedua sisi yang lebih tipis daripada yang ingin diakui oleh kedua lab tersebut.
Halaman ini ditulis berdasarkan apa yang kita ketahui sejauh ini, karena tidak ada satu pun model yang memiliki angka akurasi terverifikasi secara independen. Angka Muse Voice Transcribe adalah klaim hari peluncuran Meta, dilaporkan vendor dan belum direproduksi; VibeVoice-ASR-Streaming-7B belum memublikasikan angka akurasi streaming apa pun dalam bentuk teks sama sekali. Oleh karena itu, perbandingan di bawah ini bertumpu pada hal-hal yang bersifat struktural dan dapat diketahui — arsitektur, harga, lisensi, perilaku terdokumentasi — dan memberi label pada sedikit angka vendor yang muncul.
Dua penantang untuk pipeline batch, dengan selisih satu hari
Kedua model ini menyerang asumsi yang sama: bahwa speech-to-text adalah sesuatu yang Anda jalankan pada rekaman yang sudah selesai. Muse Voice Transcribe adalah produk pertama yang Meta sebut sebagai "model persepsi audio real-time" — satu lintasan streaming yang melakukan pengenalan, diarisasi pembicara untuk lebih dari dua puluh suara, dan deteksi titik akhir, yakni tugas menentukan kapan seorang pembicara benar-benar selesai, bukan sekadar berhenti sejenak. Model ini hadir di tiga platform sekaligus: Meta Model API dengan tarif $0.18 per jam audio, Meta AI untuk Mac yang memungkinkan pengguna menahan tombol Fn untuk mendiktekan ucapan ke aplikasi mana pun, dan Muse Code. VibeVoice-ASR-Streaming-7B milik Microsoft adalah anggota streaming dari keluarga VibeVoice sumber terbuka, dan jejak perilisannya jauh lebih senyap: repositori Hugging Face yang dibuat pada 2 September (stempel waktu menunjukkan 15:46 UTC, terakhir diubah tiga menit kemudian), delapan shard safetensors dengan lisensi MIT, serta baris log berita bertanggal 3 September di repositori GitHub microsoft/VibeVoice yang menyebutnya "model ASR streaming terpadu yang terus-menerus mentranskripsikan siapa yang mengatakan apa saat ucapan tiba, dengan dukungan untuk hotword yang dapat disesuaikan dan 10 bahasa." Sehari setelah diunggah, model itu masih menampilkan nol unduhan.

Tabrakan fitur
Mekanisme streaming — Muse Voice Transcribe mengonsumsi audio dalam potongan 80 milidetik dan mengunci kata-kata saat kata-kata tersebut stabil, dibandingkan dengan VibeVoice-ASR-Streaming-7B yang memproses potongan sekitar 2,9 detik dengan jangkauan ke depan sekitar 0,5 detik, serta mengeluarkan teks satu kali per potongan yang diselesaikan.
• Atribusi pembicara — 20+ pembicara dalam satu proses, rata-rata kesalahan diarisasi 17,5% yang dilaporkan vendor vs keluaran streaming siapa-mengatakan-apa yang diklaim pada kartu model, belum terverifikasi.
• Endpointing — bawaan: aliran membawa batas ucapan yang selesai vs tidak didokumentasikan sebagai sinyal keluaran.
• Kontrol konteks — bias bahasa, kata kunci, dan konteks vs hotword khusus melalui prompt konteks (--context_info).
• Bahasa — dilatih pada 70+ bahasa, 25 terverifikasi secara ekstensif saat peluncuran, code-switching native vs 10 bahasa yang dideklarasikan (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Bukti — klaim vendor saat peluncuran: 3,1% WER pada hasil akhir dalam 0,16 detik setelah ucapan, 3,6% pada hasil parsial pertama, mengutip papan peringkat streaming Artificial Analysis vs tidak ada angka WER streaming atau latensi yang dipublikasikan sebagai teks.
• Biaya dan lisensi — $0,18 per jam audio, dihosting, bobot tertutup vs $0 untuk bobot (MIT), sekitar 18 GB bf16, dihosting sendiri.

Dua gagasan yang sangat berbeda tentang "streaming"
Istilah "streaming" mencakup rentang irama yang lebar, dan jarak di antara keduanya cukup lebar untuk mengubah apa yang dapat Anda bangun di atas masing-masingnya. Muse Voice Transcribe melakukan streaming pada granularitas kata. Arsitektur Meta mengonsumsi audio dalam potongan 80 milidetik dan menerapkan apa yang disebutnya "adaptive delay" — kebijakan penundaan hasil pembelajaran penguatan yang memfinalisasi setiap kata begitu model cukup yakin, tetapi menahan lebih banyak konteks untuk kata-kata yang kurang diyakininya, alih-alih menerapkan satu anggaran latensi tetap. Vendor mengklaim transkrip final keluar 0,16 detik setelah pembicara berhenti dan hasil parsial pertama muncul 0,13 detik setelah mulai berbicara. Irama semacam itu dirancang untuk alur interaktif: transkripsi langsung, dikte, dan agen suara yang perlu merespons hampir seketika setelah sebuah ucapan selesai.
VibeVoice-ASR-Streaming-7B melakukan streaming pada granularitas yang lebih kasar. Konfigurasi preprocessornya menunjukkan audio masuk pada 24 kHz, dikompresi 3.200× menjadi token pada sekitar 7,5 frame per detik, lalu diproses dalam potongan 22 frame dengan lookahead 4 frame — kira-kira 2,9 detik audio per potongan, sekitar setengah detik lookahead, angka-angka yang diturunkan dari konfigurasi, bukan dari latensi terukur. Teks dikeluarkan setiap potongan selesai diproses, dengan konteks dari potongan-potongan sebelumnya dipertahankan melalui cache KV sehingga sesi yang panjang tidak menghitung ulang dari awal. Transkrip yang bertambah dalam kenaikan sekitar tiga detik sudah memadai untuk notulen rapat dan analitik panggilan; ini merupakan produk yang berbeda dari streaming kata sub-detik untuk percakapan langsung. Belum ada laboratorium yang memublikasikan pengukuran latensi ujung-ke-ujung untuk checkpoint streaming tersebut, jadi anggap irama tersebut sebagai desain dan nuansa dunia nyata sebagai sesuatu yang belum teruji.
Label pembicara dan endpointing: bawaan pada satu, hanya diklaim pada yang lain.
Atribusi pembicara adalah bidang di mana produk streaming paling sering melebih-lebihkan, dan kedua hal ini membuat klaim tersebut. Versi Muse Voice Transcribe bersifat konkret dan struktural: diarisasi berjalan dalam aliran streaming yang sama dengan pengenalan, sehingga rekaman panggilan dua puluh orang dapat membawa label per-pembicara tanpa langkah terpisah "unggah, tunggu, dapatkan pembicara kembali", dan Meta melaporkan tingkat kesalahan diarisasi rata-rata 17,5% — angka vendor, tidak direproduksi, tetapi angka yang melekat pada mekanisme nyata. Ia juga mengeluarkan batas titik akhir, kemampuan yang lebih tenang: aplikasi mendapatkan sinyal bersih "giliran pembicara ini selesai" tanpa membangun detektor aktivitas suara, itulah sebabnya agen suara yang dibangun di atas ASR mentah sering kali memotong pembicaraan orang.
VibeVoice-ASR-Streaming-7B mengklaim output streaming yang menyebut siapa mengatakan apa pada kartu modelnya, sejalan dengan output Who/When/What terstruktur milik VibeVoice-ASR batch — tetapi untuk checkpoint streaming, klaim tersebut belum terverifikasi, tidak ada uji independen yang mereproduksinya, dan tidak ada sinyal endpointing terdokumentasi seperti yang disertakan Muse. Jika beban kerja Anda benar-benar audio langsung dengan banyak pembicara, Muse menawarkan mekanisme yang lebih lengkap saat ini; jika Anda sedang mengevaluasi apakah model open-weights dapat melakukan tugas yang sama pada perangkat keras yang Anda kendalikan, klaim VibeVoice adalah hal yang tepat untuk diuji dengan rekaman rapat Anda sendiri sebelum mempercayainya.
Bukti: klaim hari peluncuran terhadap kartu kosong.
Perlu bersikap presisi tentang apa yang dimiliki masing-masing pihak, karena tidak ada satu pun yang memiliki apa yang sebenarnya diinginkan pembeli. Muse Voice Transcribe memiliki serangkaian angka vendor yang padat — tingkat kesalahan kata 3,1% pada transkrip akhir, 3,6% pada transkrip parsial pertama, latensi akhir 0,16 detik, dan rata-rata kesalahan diarisasi 17,5% — semuanya dipublikasikan oleh Meta pada hari peluncuran dan menunjuk ke papan peringkat streaming speech-to-text Artificial Analysis, tempat Meta mengklaim posisi teratas. Itu adalah klaim, yang tidak direproduksi oleh siapa pun di luar lab, tetapi cukup spesifik untuk difalsifikasi, yang merupakan semacam kemajuan.
VibeVoice-ASR-Streaming-7B tidak memiliki semua itu. Kartu modelnya menyertakan figur evaluasi sebagai gambar dan laporan teknis streamingnya berupa PDF, tetapi tidak ada angka WER streaming atau latensi yang dapat dikutip dalam prosa. Satu-satunya jangkar numerik dalam keluarga VibeVoice adalah tabel yang dilaporkan vendor pada kartu VibeVoice-ASR batch — rata-rata WER 7,77% pada delapan set tes bahasa Inggris, 2,20% pada LibriSpeech clean — yang secara eksplisit bukan angka checkpoint ini. Ketika klaim hari peluncuran bertemu dengan kartu kosong, penentu yang jujur adalah segala sesuatu kecuali WER utama: harga, lisensi, irama streaming, dan fitur yang benar-benar didokumentasikan oleh masing-masing pihak.
Bahasa: 25 terverifikasi terhadap 10 yang dideklarasikan
Cakupan bahasa lebih membedakan keduanya dibandingkan klaim akurasi utamanya. Muse Voice Transcribe dilatih pada 70+ bahasa, tetapi Meta memvalidasi 25 bahasa saat peluncuran — dan daftar yang tervalidasi, bukan daftar pelatihan, adalah cakupan produksinya, dengan alih kode asli sebagai pembedanya: model ini dirancang untuk berpindah bahasa di tengah kalimat tanpa diberi tahu. VibeVoice-ASR-Streaming-7B menyatakan 10 bahasa dalam kartu modelnya — Inggris, Mandarin, Spanyol, Portugis, Jerman, Jepang, Korea, Prancis, Rusia, Italia — dibandingkan dengan 50+ bahasa pada VibeVoice-ASR versi batch. Jika lalu lintas Anda mencakup percakapan dengan alih kode, Muse memiliki tawaran yang lebih spesifik; jika lalu lintas tersebut berada dalam sepuluh bahasa itu, cakupan model Microsoft setidaknya eksplisit, yang mana itu lebih dari sekadar yang ditawarkan kebanyakan materi peluncuran.
Biaya dan apa yang Anda simpan
Perbedaan model bisnis adalah cara paling jelas untuk menentukan pilihan. Muse Voice Transcribe dengan harga US$0,18 per jam audio mengalahkan harga tercantum semua API transkripsi streaming besar — tanpa GPU, tanpa operasional, bobot tertutup, dan harganya ditetapkan oleh Meta. VibeVoice-ASR-Streaming-7B tidak memerlukan biaya unduh, tetapi membutuhkan sekitar 18 GB bobot bf16 sebelum cache KV untuk dihosting sendiri di GPU kelas 24 GB, dengan skrip demo microsoft/VibeVoice atau plugin vLLM sebagai jalur penyajian yang terdokumentasi, dan belum ada penyedia inferensi yang menghostingnya. Lisensi MIT adalah aset berkelanjutan: bobot tersebut milik Anda untuk disimpan dan di-fine-tune, sesuatu yang tidak bisa ditawarkan oleh langganan API mana pun. Di situlah gambaran harga dapat menjadi menarik — begitu ada penyedia yang menghosting checkpoint terbuka tersebut, pertanyaan US$0,18 per jam berubah menjadi harga pasar, bukan harga tercantum satu vendor, dan justru di situ router pass-through membuktikan nilainya. OrcaRouter tidak merutekan ucapan-ke-teks saat ini, dan kedua model ini tidak ada dalam katalognya; yang dilakukannya adalah meneruskan harga tercantum penyedia dengan markup 0% pada 200+ model bahasa yang mengonsumsi transkrip langsung, sehingga pemotongan harga vendor di mana pun di tumpukan tersebut langsung dirasakan pembeli pada hari yang sama saat diumumkan.

Pertanyaan yang Sering Diajukan
Apakah WER 3,1% dari Muse Voice Transcribe berarti ia lebih akurat daripada VibeVoice-ASR-Streaming-7B?
Tidak, dan perbandingan tersebut belum bermakna. Angka 3,1% dari Meta adalah klaim hari peluncuran untuk jalur streaming, yang dilaporkan oleh vendor dan belum direproduksi. VibeVoice-ASR-Streaming-7B belum menerbitkan angka akurasi streaming dalam bentuk teks sama sekali. Sampai kedua model dijalankan melalui kerangka uji publik yang sama pada audio yang sama, satu-satunya pernyataan jujur adalah bahwa Muse memiliki klaim spesifik yang dapat diuji dan VibeVoice belum memilikinya.
Dapatkah saya menggunakan salah satu model pada audio yang sudah direkam?
Ya untuk keduanya, dengan bentuk yang berbeda. Muse Voice Transcribe menangani rekaman yang lebih lama dari satu jam melalui API streaming yang sama. Plugin vLLM milik VibeVoice-ASR-Streaming-7B mengekspos endpoint transkripsi seluruh file di samping endpoint streaming WebSocket-nya. Tetapi keduanya dirancang dan dihargai untuk kasus live — Muse dengan model bisnis streaming-only-nya, VibeVoice dengan arsitektur terpotong yang mengeluarkan hasil saat audio tiba — jadi jika beban kerja Anda murni file batch, API transkripsi file khusus biasanya akan lebih murah dan lebih terukur daripada keduanya.
