
VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: streaming native melawan andalan 99 bahasa
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Ada kemungkinan besar model speech-to-text yang Anda jalankan hari ini adalah Whisper Large v3 Turbo, dan kini ada model baru yang mempertanyakan apakah memang seharusnya begitu. Whisper Large v3 Turbo milik OpenAI — checkpoint dengan 809M parameter hasil distilasi yang dirilis pada Oktober 2024 — adalah kuda kerja open-weights: 99 bahasa, kira-kira empat hingga delapan kali lebih cepat daripada large-v3 asli, cukup ringkas untuk laptop, berlisensi MIT, dan didukung oleh ekosistem transkripsi terbesar yang ada. VibeVoice-ASR-Streaming-1.5B, yang diunggah oleh Microsoft Research pada 2 September 2026, adalah sang penantang yang dibangun untuk satu hal yang tidak dilakukan Whisper secara native: streaming. Model ini mentranskripsikan audio dalam potongan-potongan saat audio tiba, alih-alih menelan jendela tetap; ia mengklaim keluaran dengan atribusi pembicara, serta memiliki sepuluh bahasa dan tidak memiliki satu pun tolok ukur yang dipublikasikan.
Klausa terakhir itulah sebabnya halaman ini disusun seputar pertanyaan migrasi, bukan adu performa. Angka-angka Whisper Large v3 Turbo terukur dan publik — LibriSpeech, komposit Open ASR, Common Voice — sementara kartu model VibeVoice-ASR-Streaming-1.5B tidak memublikasikan angka WER atau latensi dalam teksnya, dan belum ada tolok ukur independen hingga tulisan ini dibuat. Segala hal tentang sisi Microsoft di bawah ini adalah apa yang dapat diketahui dari repositorinya: berkas konfigurasi, kartu model, dan dokumentasi streaming Microsoft. Segala hal tentang sisi Whisper merupakan catatan publik yang sudah tuntas. Keduanya tidak diadu secara langsung; perbandingan ini adalah antara apa yang sudah terbukti dan apa yang baru dijanjikan.
Model yang mungkin sudah Anda jalankan
Whisper Large v3 Turbo mendapatkan tempatnya dengan cara yang tidak glamor: model ini cepat, kecil, multibahasa, dan membosankan dalam hal-hal yang disukai tim produksi. Disuling dari Whisper large-v3 berparameter 1,55 miliar menjadi 809 juta parameter, model ini mempertahankan cakupan 99 bahasa dan sekitar 95% akurasi large-v3 — sekitar 2,1% WER pada LibriSpeech clean, sekitar 7,7–7,8% pada komposit Open ASR, dengan degradasi terbesar pada bahasa bersumber daya rendah dan bahasa bernada — sambil berjalan beberapa kali lebih cepat dan hanya memakan sekitar 1,6 GB VRAM dalam FP16. Model ini berlisensi MIT, berjalan melalui faster-whisper, whisper.cpp, dan tiga tahun integrasi, serta halaman Hugging Face-nya menunjukkan lebih dari tujuh juta unduhan dalam satu bulan. Jika Anda melakukan hosting sendiri untuk transkripsi, kemungkinan besar inilah model yang menjalankannya.
Whisper Large v3 Turbo bukanlah model streaming, dan tidak pernah mengklaim demikian. Ia memproses audio dalam jendela tetap 30 detik dan mengembalikan transkrip per jendela; ia tidak memiliki deteksi aktivitas suara asli, tidak ada endpointing, tidak ada diarisasi pembicara, dan tidak ada mekanisme hotword. Transkripsi langsung pada Whisper selalu merupakan retrofit yang Anda bangun — dan di retrofit itulah latensi dan biaya rekayasa berada.
Apa yang sebenarnya berubah jika Anda beralih?
• Model latensi — VibeVoice-ASR-Streaming-1.5B mengeluarkan teks sekali per blok yang terselesaikan sekitar 2,9 detik dengan pandangan ke depan ~0,5 detik, secara desain dibandingkan dengan Whisper Large v3 Turbo: model batch berjendela 30 detik yang membutuhkan lapisan pemotongan dan penyambungan untuk mendekati keluaran langsung.
• Bentuk sesi — sesi langsung tanpa batas, konteks yang dibawa melintasi potongan-potongan dalam cache prefiks vs jendela diskrit 30 detik tanpa status percakapan lintas jendela.
• Bahasa — sepuluh (Tionghoa, Inggris, Prancis, Jerman, Italia, Jepang, Korea, Portugis, Rusia, Spanyol) vs 99.
• Akurasi dalam publikasi — tidak ada yang dipublikasikan vs ~2,1% LibriSpeech clean, ~7,7–7,8% komposit Open ASR, semuanya terukur dan publik.
• Keluaran tambahan — mengklaim atribusi siapa-mengatakan-apa secara streaming dan hotwords vs timestamp kata tersedia, tetapi tanpa diarisasi dan tanpa hotwords secara native.
• Perangkat keras — ~5,6 GB bobot bf16 pada GPU NVIDIA, instalasi dari sumber dibandingkan ~1,6 GB FP16, berjalan di laptop dan CPU melalui whisper.cpp dan faster-whisper.
• Lisensi — MIT, keduanya.

Masalah retrofit streaming
Cara jujur untuk melihat perbandingan ini adalah bahwa Whisper Large v3 Turbo memiliki masalah streaming yang sudah Anda bayar atau masih Anda bayar. Pipeline live di Whisper berarti adanya detektor aktivitas suara untuk menemukan ucapan, chunker untuk memotong audio menjadi jendela-jendela seukuran Whisper, jendela yang saling tumpang tindih agar kata-kata tidak hilang di perbatasan, dan stitcher untuk menyelaraskan transkrip parsial. Implementasi komunitas dari tumpukan ini mencapai sekitar satu hingga lima detik latensi end-to-end — dapat digunakan untuk catatan rapat, tetapi masih kurang untuk standar agen telepon dan teks langsung.
VibeVoice-ASR-Streaming-1.5B menghilangkan kebutuhan retrofit sejak rancangannya. Konfigurasi preprocessornya menetapkan potongan 22 frame dan lookahead 4 frame pada aliran token ucapan sekitar 7,5 Hz — sekitar 2,9 detik audio per segmen yang dihasilkan, setengah detik konteks masa depan — dan dokumentasi Microsoft menjelaskan bahwa konteks dari potongan-potongan sebelumnya dipertahankan melalui KV cache, sehingga sesi langsung tidak menghitung ulang dari awal. Tetapi bacalah kata "streaming" dengan saksama pada kedua sisi perbandingan ini: tidak satu pun model merupakan mesin parsial per kata seperti yang dijual oleh API komersial berlatensi terendah. Transkrip VibeVoice bertambah dalam kenaikan kira-kira tiga detik secara desain, yang merupakan irama yang berbeda dan biasanya dapat diterima untuk rapat, tetapi itu tidak di bawah satu detik, dan jika kebutuhan Anda adalah kata-kata muncul di layar dalam satu detik, Anda harus mengukur geometri potongan ini terhadap anggaran tersebut sebelum membangun di atasnya.
Akurasi: yang Anda korbankan untuk beralih ke streaming native
Inilah kesenjangan yang seharusnya menjadi dasar pengambilan keputusan. Whisper Large v3 Turbo memiliki rekam jejak akurasi publik yang dapat Anda audit — dan ketika rekaman berada dalam 99 bahasa yang didukungnya, rekam jejak tersebut kuat. VibeVoice-ASR-Streaming-1.5B tidak memiliki rekam jejak semacam itu: evaluasi pada model card-nya berupa gambar, Microsoft tidak memublikasikan WER streaming dalam bentuk teks, dan satu-satunya jangkar numerik dalam keluarga ini adalah WER rata-rata 7,77% yang dilaporkan vendor pada kartu model batch VibeVoice-ASR di delapan set pengujian bahasa Inggris, yang menggambarkan model yang berbeda, yaitu model non-streaming. Kalimat yang jujur adalah bahwa memindahkan transkripsi Anda ke VibeVoice-ASR-Streaming-1.5B saat ini berarti menerima tingkat akurasi yang tidak diketahui pada audio Anda sendiri — dan justru karena itulah evaluasi apa pun terhadapnya harus dijalankan oleh Anda, pada rekaman nyata yang paling sulit, sebelum layanan ini layak mendapat trafik produksi.

Bahasa dan atribusi penutur: kesenjangan fitur berdampak dua arah.
Perbandingan fitur tidaklah berat sebelah, dan itulah yang membuat pilihannya benar-benar menarik. Jika audio Anda multibahasa, keputusannya berakhir seketika: 99 bahasa Whisper Large v3 Turbo mencakup apa yang tidak dimiliki oleh sepuluh bahasa VibeVoice-ASR-Streaming-1.5B, dan batas sepuluh bahasa itu mendiskualifikasi untuk setiap pipeline yang menangani campuran tutur yang luas. Namun jika beban kerja Anda berada di dalam sepuluh bahasa tersebut dan yang sebenarnya Anda butuhkan adalah mengetahui siapa berbicara apa dalam rapat langsung, arahnya berkata lain: Whisper tidak menawarkan diarisasi asli dan tidak ada hotwords, sementara VibeVoice-ASR-Streaming-1.5B mengklaim keduanya — keluaran atribusi pembicara secara streaming dan hotwords istilah domain yang diteruskan sebagai prompt konteks. Klaim itu belum terverifikasi, dan diarisasi streaming melintasi batas chunk cukup sulit sehingga patut disangsikan, tetapi itu adalah fitur konkret yang tidak bisa diberikan oleh rekayasa Whisper sebanyak apa pun secara langsung.
Matematika migrasi
Dari segi biaya dan usaha, solusi yang sudah ada lebih diuntungkan. Whisper Large v3 Turbo sudah berjalan di stack Anda pada perangkat keras yang Anda miliki — laptop, CPU, atau GPU sederhana — dan beralih ke VibeVoice-ASR-Streaming-1.5B berarti menyiapkan instalasi riset dari sumber pada GPU NVIDIA dengan bobot sekitar 5.6 GB, memverifikasi load path yang kelas arsitekturnya belum ada di dokumentasi publik Transformers, dan membangun dari nol benchmark yang menjadi dasar keputusan Anda. Itu adalah proyek nyata, dan hasilnya bergantung pada apakah fitur-fitur yang belum terverifikasi itu memang penting bagi Anda.

Cara murah untuk menjalankan proyek itu adalah dengan tidak memperlakukannya sebagai pertukaran. Pertahankan Whisper Large v3 Turbo sebagai default dan arahkan sebagian audio langsung ke VibeVoice-ASR-Streaming-1.5B melalui satu API — pola yang memang menjadi alasan lapisan perutean ada: 200+ model di belakang satu endpoint dengan harga daftar penyedia tanpa markup, failover otomatis saat model baru tersendat, dan DSL perutean yang memungkinkan workload berbeda memilih transcriber berbeda dari satu panggilan. Itulah model OrcaRouter, dan itulah perbedaan antara mempertaruhkan pipeline produksi Anda pada checkpoint berumur dua hari dan membiarkan checkpoint itu membuktikan tempatnya melawan mesin utama pada transkrip Anda sendiri.
Pertanyaan yang Sering Diajukan
Bisakah Whisper Large v3 Turbo melakukan live streaming sama sekali?
Hanya sebagai retrofit. Whisper Large v3 Turbo adalah model batch yang memproses jendela waktu tetap 30 detik, jadi transkripsi langsung mengharuskan Anda membangun detektor aktivitas suara, chunker, strategi tumpang tindih, dan penyambung (stitcher) di atasnya. Implementasi yang berfungsi memang ada dan menghasilkan latensi sekitar satu hingga lima detik, yang cocok untuk notulen rapat tetapi tidak memenuhi ambang sub-detik untuk agen telepon dan teks langsung (live captioning). VibeVoice-ASR-Streaming-1.5B bersifat streaming-native — ia mengeluarkan teks per chunk sekitar 2,9 detik dengan lookahead sekitar 0,5 detik — tetapi streaming-nya berbasis chunk, bukan hasil parsial per kata, jadi periksa juga irama tersebut dengan anggaran latensi Anda sendiri.
Apakah VibeVoice-ASR-Streaming-1.5B lebih akurat daripada Whisper Large v3 Turbo?
Belum ada yang bisa menjawab itu, termasuk Microsoft. Akurasi Whisper Large v3 Turbo sudah terukur dan publik — sekitar 2,1% WER pada LibriSpeech clean dan 7,7–7,8% pada komposit Open ASR. VibeVoice-ASR-Streaming-1.5B belum memiliki angka WER streaming yang dipublikasikan dalam bentuk teks dan belum memiliki tolok ukur independen hingga tulisan ini dibuat. Satu-satunya cara untuk menjawab pertanyaan itu adalah dengan menjalankan checkpoint pada audio Anda sendiri dan membandingkan transkrip dengan sistem yang ada — yang justru merupakan pengujian yang direkomendasikan halaman ini sebelum melakukan migrasi apa pun.
Bahasa apa saja yang didukung oleh keduanya?
Whisper Large v3 Turbo mendukung 99 bahasa dengan satu set bobot. VibeVoice-ASR-Streaming-1.5B mencantumkan sepuluh bahasa: Cina, Inggris, Prancis, Jerman, Italia, Jepang, Korea, Portugis, Rusia, dan Spanyol. Untuk audio apa pun di luar sepuluh bahasa tersebut, Whisper adalah satu-satunya pilihan dalam pasangan ini, dan kesenjangan multibahasa adalah alasan paling jelas mengapa sebagian besar tim akan tetap bertahan.
Whisper Large v3 Turbo adalah model yang tepat untuk sebagian besar tim pada sebagian besar waktu, dan checkpoint yang baru berusia dua hari tanpa tolok ukur bukanlah alasan untuk berpindah platform. Itu adalah alasan untuk menjalankan eksperimen. Jika audio Anda berada dalam sepuluh bahasa tersebut dan atribusi pembicara langsung akan mengubah produk Anda, dirikan VibeVoice-ASR-Streaming-1.5B di belakang router, arahkan sebagian lalu lintas nyata ke sana, dan biarkan transkrip — bukan ketiadaan tolok ukur di kedua sisi — yang mengambil keputusan.
