
VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo: Apa yang Ditambahkan Checkpoint Streaming Microsoft pada Default Open-Weight
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Untuk sebagian besar dari dua tahun terakhir, jawaban atas "mentranskripsi sendiri dengan murah" adalah Whisper Large v3 Turbo — model open-weights 809 juta parameter dari OpenAI, berlisensi MIT, mendukung 99 bahasa, cukup kecil untuk dijalankan di workstation, dan gratis setelah Anda memiliki perangkat kerasnya. Pada 2 September 2026, Microsoft Research mengunggah penantang atas pilihan bawaan tersebut: VibeVoice-ASR-Streaming-7B, sebuah checkpoint streaming berlisensi MIT di Hugging Face yang mentranskripsi saat audio datang, mengklaim keluaran yang diatribusikan ke pembicara, dan — tidak seperti model yang sudah dijalankan sebagian besar tim — tidak pernah dirancang sebagai pekerjaan batch. Kedua model adalah open-weights dari laboratorium besar. Hampir semua hal lain tentang keduanya adalah sebuah pertukaran, dan halaman ini membahas pertukaran mana yang sebenarnya Anda lakukan.
Satu asimetri membentuk seluruh perbandingan ini, jadi hal itu disebutkan pertama. Whisper Large v3 Turbo adalah model ucapan yang paling banyak direproduksi secara independen di dunia: angka word-error-nya telah dijalankan ulang oleh ribuan tim pada tolok ukur publik dan audio mereka sendiri selama bertahun-tahun, dan kelemahannya terdokumentasi sama baiknya dengan keunggulannya. VibeVoice-ASR-Streaming-7B baru berumur satu hari, tidak memiliki tolok ukur independen di mana pun, dan Microsoft belum memublikasikan tingkat word-error streaming dalam teks yang dapat dibaca. Semua yang ada di sisi Microsoft di bawah ini dibaca dari repositori — konfigurasi, kartu model, dan dokumen streaming Microsoft — dan diberi label demikian.
Default bobot terbuka, dan mengapa ia bertahan
Whisper Large v3 Turbo adalah saudara hasil distilasi dari Whisper Large v3: ia mempertahankan encoder 32 lapis dan memangkas dekoder dari 32 lapis menjadi empat lapis, sehingga jumlah parameter turun menjadi 809M dan throughput kira-kira meningkat empat kali lipat di GPU sambil tetap mendekati akurasi yang sama. Karena bobotnya berlisensi MIT dan modelnya kecil, model ini menjadi mesin transkripsi tertanam default untuk bot rapat, alat subtitle, dan pipeline pencatatan panggilan. Keterbatasannya juga sama dikenal luas. Ini adalah model batch — ia menerima file audio dan mengembalikan transkrip, bukan menghasilkan kata-kata saat diucapkan. Ia tidak dilatih untuk penerjemahan, dan tugas tersebut menurun drastis. Akurasinya pada ucapan yang bising, beraksen, atau tumpang tindih tidak merata, dan ia mengembalikan teks polos: tanpa tanda baca atau kapitalisasi secara default, tanpa diarisasi pembicara, tanpa stempel waktu pada varian ini, tanpa pembobotan kata kunci. Tumpukan produksi yang dibangun di atas Whisper merakit bagian-bagian tersebut secara terpisah, masing-masing menambah latensi dan mode kegagalannya sendiri.

Kesenjangan Spesifikasi
Parameter — 809M (decoder terdistilasi) vs sekitar 9B total (backbone bahasa Qwen2-7B ditambah encoder ucapan; "7B" mengacu pada LLM, sementara halaman Hugging Face mencantumkan 9B).
• Lisensi — MIT, bobot terbuka, keduanya.
• Streaming — batch secara desain: implementasi streaming yang di-host sendiri biasanya menghasilkan latensi 1–5 detik, dibandingkan dengan streaming-native: chunk ~2,9 detik dengan lookahead ~0,5 detik, teks dipancarkan per chunk, konteks dipertahankan dalam cache KV.
• Bahasa — 99 dengan reproduksi komunitas bertahun-tahun vs 10 yang dinyatakan (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Di luar transkrip — tidak ada secara default vs klaim output streaming siapa-mengatakan-apa dan hotword yang disesuaikan (belum terverifikasi).
• Akurasi dalam publikasi — 2.1% WER pada LibriSpeech test-clean, 4.2% pada test-other, ~7.7% pada komposit Open ASR, 8–12% pada audio bising dalam pengujian komunitas, semuanya direproduksi secara independen, sementara tidak ada angka WER streaming yang dipublikasikan sebagai teks.
• Jejak — berjalan di laptop atau satu GPU sederhana, dibandingkan dengan sekitar 18 GB bobot bf16 sebelum cache KV; siapkan GPU kelas 24 GB.

Apa yang sebenarnya ditambahkan oleh streaming
Satu-satunya alasan untuk mempertimbangkan model selain Whisper Large v3 Turbo adalah jalur live, dan di sinilah kedua model itu tidak lagi dapat dibandingkan. Whisper berorientasi batch: untuk mendapatkan kata-kata selagi pembicara masih berbicara, tim harus menambahkan chunking, deteksi aktivitas suara, dan glue code, dan implementasi streaming yang dihosting sendiri biasanya berujung pada latensi satu hingga lima detik — meleset dari standar sub-detik untuk agen telepon dan teks langsung, tanpa rekayasa yang serius. VibeVoice-ASR-Streaming-7B memang dibuat untuk jalur itu. Konfigurasinya menunjukkan bahwa audio dikompresi 3.200× menjadi aliran token 7,5 frame per detik, lalu diproses dalam potongan-potongan 22 frame dengan empat frame lookahead — sekitar 2,9 detik audio per potongan. Teks dihasilkan setiap kali satu potongan selesai diproses, dan konteks sebelumnya tetap dipertahankan dalam cache KV, sehingga satu sesi tidak perlu menghitung ulang dari awal. Ritme tersebut merupakan desain yang diturunkan dari konfigurasi, bukan latensi terukur, dan belum ada yang memublikasikan angka end-to-end untuk itu; tetapi arsitekturnya jelas-jelas merupakan arsitektur transkripsi langsung — sesuatu yang tidak bisa dikatakan tentang Whisper.
Rekam jejak Whisper panjang dan publik; rekam jejak checkpoint yang baru masih kosong.
Dalam hal akurasi, usia Whisper Large v3 Turbo justru menjadi aset. Angka WER 2,1% pada LibriSpeech test-clean dan 4,2% pada test-other adalah angka open-weights yang telah direproduksi oleh banyak tim; angka sekitar 7,7% pada gabungan papan peringkat Open ASR berada sekitar satu poin di belakang Large v3 versi penuh; dan angka 8–12% yang terdokumentasi pada audio bising dalam pengujian komunitas membuat tidak ada yang terkejut karenanya. Kelemahan-kelemahan itu adalah bagian dari rekam jejak — semuanya memberi tahu Anda dengan tepat bagian mana dari model ini yang membutuhkan bantuan sebelum Anda membangun di atasnya.
VibeVoice-ASR-Streaming-7B tidak memiliki rekam jejak seperti itu. Kartu modelnya menyertakan figur evaluasi sebagai gambar, dan laporan teknis streaming Microsoft berupa PDF, tetapi tidak ada tingkat kesalahan kata (WER) streaming yang dapat dikutip dalam bentuk prosa. Satu-satunya jangkar numerik dalam keluarga ini adalah tabel yang dilaporkan vendor pada kartu VibeVoice-ASR batch — rata-rata WER 7,77% pada delapan set pengujian bahasa Inggris dan 2,20% pada LibriSpeech clean — yang bukan merupakan angka checkpoint ini, dan penerimaan komunitas terhadap model batch itu sendiri juga beragam: dipuji karena diarisasi yang siap pakai, dikritik karena berat dan kadang rawan halusinasi. Tidak ada satu pun dari itu yang berlaku untuk model streaming, dan justru itulah intinya: dengan Whisper, Anda sudah mengetahui mode kegagalannya sejak awal; dengan VibeVoice-ASR-Streaming-7B, Andalah penguji pertamanya.
Bahasa dan jejak: 99 berbanding 10, 0.8B berbanding 9B
Dua biaya paling konkret dari peralihan adalah bahasa dan ukuran. Whisper Large v3 Turbo mentranskripsikan 99 bahasa; bahasa dengan sumber daya rendah dan bahasa bernada mengalami penurunan kualitas — Thai, Kanton, dan Welsh adalah titik lemah yang paling sering disebut — tetapi daftar tersebut telah didukung oleh reproduksi komunitas selama bertahun-tahun. VibeVoice-ASR-Streaming-7B mendukung sepuluh bahasa: Inggris, Mandarin, Spanyol, Portugis, Jerman, Jepang, Korea, Prancis, Rusia, dan Italia. Jika lalu lintas Anda berada dalam sepuluh bahasa tersebut, cakupan bukanlah masalah; jika tidak, perbandingan berakhir di sini. Ukuran adalah biaya kedua: 809M parameter dapat berjalan di laptop, sementara total sekitar 9B parameter dalam bf16 berarti sekitar 18 GB bobot sebelum cache KV dan GPU kelas 24 GB untuk melayaninya dengan nyaman. Bagi tim yang sudah menjalankan Whisper di perangkat keras sederhana, ini adalah lompatan infrastruktur yang nyata, yang hanya dapat dibenarkan oleh kebutuhan transkripsi langsung yang sesungguhnya.
Saat gratis bukan intinya.
Whisper Large v3 Turbo gratis untuk dijalankan; biayanya adalah perangkat keras dan rekayasa di sekitarnya. Penerapan faster-whisper pada satu T4 berjalan sekitar $0,05–$0,10 per jam audio dengan tarif GPU yang berlaku, dan beban kerja yang berkelanjutan menambah tumpukan diarization dan tanda baca yang harus Anda bangun karena Whisper mengembalikan teks polos. VibeVoice-ASR-Streaming-7B juga gratis untuk dijalankan, pada perangkat keras yang lebih mahal, sebagai gantinya untuk arsitektur streaming yang mengklaim atribusi pembicara dan kontrol konteks yang tidak dimiliki Whisper — klaim yang harus Anda verifikasi sendiri, karena tidak ada tolok ukur independen yang ada. Untuk transkripsi batch dalam volume besar, throughput Whisper dan jejak kecilnya masih menang. Untuk audio langsung multi-pembicara yang transkripnya harus tiba selama percakapan berlangsung, Whisper bekerja melawan desainnya dan checkpoint streaming bekerja seiring dengannya — jika berfungsi sama sekali, yang justru menjadi pertanyaan yang harus dijawab dengan audio Anda sendiri di GPU Anda sendiri.

Tumpukan pragmatis
Jawaban yang paling umum di dunia nyata bukanlah "salah satu" melainkan "keduanya," dan itulah rekomendasi di sini: pertahankan Whisper Large v3 Turbo sebagai jalur batch bervolume tinggi yang rekam jejak dan tapak komputasinya membuatnya tak terkalahkan, dan evaluasi VibeVoice-ASR-Streaming-7B pada jalur langsung yang tidak dapat dilayani Whisper pada latensi yang dibutuhkan — dengan gerbang evaluasi yang eksplisit, karena tidak ada tolok ukur yang bisa diandalkan. Keduanya dapat berbagi satu anggaran GPU dan satu basis kode. Di mana lapisan perutean benar-benar berperan dalam tumpukan tersebut adalah lapisan di atas transkrip, bukan transkripsi itu sendiri: OrcaRouter saat ini tidak merutekan ucapan-ke-teks dan kedua model tersebut tidak ada dalam katalognya, tetapi perangkum, aturan peringatan, dan perencana agen yang mengonsumsi transkrip langsung justru merupakan 200+ model bahasa yang ia perantarai dengan satu API pada harga daftar penyedia yang diteruskan tanpa markup, dan dengan failover otomatis antar penyedia. Checkpoint streaming yang dirilis tanpa satu pun tolok ukur layak mendapat perlakuan yang sama seperti model yang belum terbukti lainnya — sebagian lalu lintas nyata di belakang fallback, yang memenangkan atau kehilangan kepercayaan Anda berdasarkan bukti dari rapat-rapat Anda sendiri, bukan dari kartu model.
