
VibeVoice-ASR-Streaming-1.5B, Dijelaskan: ASR Streaming Microsoft Muncul Tanpa Peluncuran
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0259Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0258Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0166Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
Pada tanggal 2 September 2026, Microsoft Research mengunggah dua checkpoint speech-to-text baru ke Hugging Face tanpa siaran pers, tanpa posting blog, dan tanpa gembar-gembor: microsoft/VibeVoice-ASR-Streaming-1.5B dan saudaranya yang lebih besar microsoft/VibeVoice-ASR-Streaming-7B. Satu-satunya pengumuman sejauh ini adalah entri berita tertanggal 3 September 2026 di bagian Berita repositori GitHub VibeVoice sumber terbuka milik Microsoft, yang menggambarkan rilis tersebut sebagai model ASR streaming terpadu yang mentranskripsikan siapa yang mengatakan apa selagi audio masih masuk, dengan hotword yang disesuaikan dan sepuluh bahasa. Kedua checkpoint berlisensi MIT, keduanya dibuat dengan selisih sekitar lima menit satu sama lain di akun Hugging Face resmi microsoft, dan keduanya menunjukkan nol unduhan saat kami memeriksanya sehari kemudian. Kami tidak dapat menemukan liputan pihak ketiga atas keduanya.
Hal ini menjadikan tulisan ini tidak biasa: sebuah perilisan nyata yang dapat diberi tanggal — bobot di Hugging Face bertanggal 2 September, pengumuman di dalam repositori bertanggal 3 September — yang belum diketahui dunia luas. Semua hal yang dapat diketahui di bawah ini berasal dari pembacaan repositori: file konfigurasi, kartu model, dan dokumen streaming milik Microsoft sendiri. Segala hal yang belum dikonfirmasi — akurasi, latensi nyata, apakah atribusi pembicara streaming bertahan pada panggilan dua pembicara sungguhan — diberi label demikian. Tidak ada tolok ukur yang dapat dikutip karena Microsoft belum menerbitkannya dalam bentuk teks.
Satu-satunya pengumuman adalah baris berita
VibeVoice adalah keluarga model wicara sumber terbuka berlisensi MIT dari Microsoft Research. Anggota ASR yang paling terkenal, microsoft/VibeVoice-ASR, dirilis pada 21 Januari 2026: model batch yang menerima hingga enam puluh menit audio dalam satu kali lintasan dan mengembalikan transkrip terstruktur berisi pembicara, waktu, dan konten — sekitar 700.000 unduhan Hugging Face telah menyusul. Pada 2 September, organisasi yang sama merilis model streaming saudaranya, microsoft/VibeVoice-ASR-Streaming-7B dan microsoft/VibeVoice-ASR-Streaming-1.5B; API Hugging Face mencatat stempel waktu 7B pada 2026-09-02T15:46 UTC, dan 1.5B lima menit kemudian pada 15:51 UTC. Tabel model repositori GitHub kini mencantumkan VibeVoice-ASR-Streaming sebagai entri tersendiri, serta bagian News memuat baris tanggal 3 September yang mengumumkannya.
Yang benar-benar baru dibandingkan model Januari adalah model interaksinya: checkpoint streaming melakukan transkripsi saat audio masuk, bukan menunggu file lengkap. Segala hal lainnya — arsitektur token ucapan yang mendasarinya, keluaran dengan atribusi pembicara, mekanisme hotword — merupakan kelanjutan dari desain batch, yang diskalakan dan diarahkan ulang untuk penggunaan waktu nyata. Perhatikan perbedaan bahasa di awal: model batch mengiklankan 50+ bahasa, sedangkan kartu streaming mencantumkan sepuluh.

Apa arti "streaming" dalam checkpoint ini
Dokumen streaming Microsoft menjelaskan maksudnya dengan jelas: model melakukan transkripsi selagi audio masih tiba, dan mengeluarkan teks satu kali per potongan audio, sehingga transkrip muncul saat pembicara berbicara. preprocessor_config.json dari repo 1.5B membuat irama tersebut menjadi konkret:
• Laju sampel dan laju token — audio masuk 24 kHz, dikompresi 3.200×, yang menghasilkan aliran token ucapan sekitar 7,5 Hz (sekitar satu token setiap 133 md).
• Chunk — 22 frame, yang pada 7,5 Hz kira-kira 2,9 detik audio per segmen yang dikeluarkan.
• Lookahead — 4 bingkai, sekitar 0,5 detik audio masa depan yang digunakan untuk memperkuat segmen saat ini.
(Perhitungannya sederhana dari repo: 22 × 3,200 = 70,400 sampel ≈ 2.93 detik pada 24 kHz; 4 × 3,200 = 12,800 sampel ≈ 0.53 detik. Dokumen Microsoft sendiri mencatat bahwa sebuah checkpoint selalu berjalan pada chunk tempat ia dilatih, jadi ini tidak dapat disetel pada waktu inferensi.)
Hal ini menempatkannya dalam keluarga streaming berbasis potongan (chunked-streaming), bukan yang berbasis kata demi kata: transkrip langsung tumbuh dalam kenaikan sekitar tiga detik dengan lookahead sekitar setengah detik, bukan dalam parsial per token. Ini adalah desain yang sah dan umum untuk transkripsi rapat dan panggilan, tetapi profil latensinya berbeda dari sistem yang mengeluarkan parsial sub-detik — jadi perlakukan "streaming" sebagai spektrum dan ukurlah terhadap anggaran latensi Anda sendiri sebelum membangun produk teks langsung (live captioning) di atasnya.
Di balik layar: LLM wicara skala Qwen
Membaca config.json dari checkpoint 1.5B memberikan resep VibeVoice yang sekarang sudah familiar dalam skala yang lebih kecil:
Decoder adalah model bahasa keluarga Qwen2 yang dimensinya persis sama dengan kelas Qwen2.5 1.5B — 28 lapisan, 1.536 unit tersembunyi, 12 kepala perhatian dengan 2 kepala key-value, dan jendela 65.536 token. LLM inilah yang memungkinkan model membawa pemahaman pembicara dan konten di seluruh transkrip.
• Tokenizer akustik dan semantik — encoder konvolusional dalam dengan stride 8/5/5/4/2/2 — mengubah audio 24 kHz menjadi aliran token ucapan ~7,5 Hz yang dibaca decoder.
• Sebuah diffusion head (DDPM, 20 langkah denoising, v-prediction) berada pada sisi generasi, konsisten dengan lini VibeVoice lainnya.
• Kejujuran ukuran: metadata safetensors milik checkpoint itu sendiri mencantumkan sekitar 3 miliar parameter, kira-kira 5,6 GB bobot. "1.5B" pada namanya adalah skala tulang punggung bahasa — pembacaan alami dari konfigurasi yang dekodernya adalah model Qwen kelas 1.5B — dengan tokenizer audio dan kepala difusi menambahkan sisanya. String arsitektur dalam konfigurasi, VibeVoiceForASRStreamingTraining, menandakan bahwa ini adalah checkpoint dari keluarga riset.

Siapa bilang apa, dalam sepuluh bahasa.
Kemampuan utama yang disebutkan dalam kartu model adalah transkripsi streaming dengan atribusi pembicara: transkripsi tersebut “terus-menerus mentranskripsikan siapa berbicara apa saat ucapan tiba,” sebagaimana tertulis pada poin kartu itu sendiri. Kartu ini juga mengiklankan hotword yang disesuaikan untuk istilah domain, serta mencantumkan sepuluh bahasa yang didukung — Cina, Inggris, Prancis, Jerman, Italia, Jepang, Korea, Portugis, Rusia, dan Spanyol.

Hotwords diimplementasikan melalui mekanisme context-biasing yang sama yang digunakan model batch. Dalam demo command-line Microsoft, Anda meneruskannya sebagai informasi konteks — misalnya --context_info "Microsoft,VibeVoice" — untuk mengarahkan pengenalan terhadap nama dan istilah teknis tanpa fine-tuning. Kartu tersebut tidak menyebutkan apa pun tentang deteksi bahasa otomatis atau alih kode (code-switching) untuk model streaming, yang merupakan celah lain dibandingkan dengan klaim model batch.
Satu peringatan perlu ditekankan. Halaman dokumentasi streaming berfokus pada emisi per potongan (chunked) dan hotwords; halaman tersebut tidak merinci bagaimana atribusi penutur dipertahankan di antara batas-batas potongan. Diarisasi streaming memang sulit — penutur dapat tumpang tindih, dan batas potongan adalah titik tepat di mana atribusi menyimpang. Pembingkaian “siapa mengatakan apa” pada kartu tersebut merupakan klaim vendor sampai seseorang menjalankan panggilan langsung dua penutur yang sesungguhnya melaluinya dan memeriksanya.
Di mana posisinya: keluarga VibeVoice dan bidang streaming-ASR 2026
Di dalam keluarga tersebut, rilis ini menempati posisi sebagai berikut:
• microsoft/VibeVoice-ASR (21 Januari 2026) — model unggulan batch: hingga 60 menit dalam satu kali proses, 50+ bahasa, output Siapa/Kapan/Apa, hotwords, sekitar 700 ribu unduhan.
• microsoft/VibeVoice-ASR-Streaming-7B dan microsoft/VibeVoice-ASR-Streaming-1.5B (2 September 2026) — varian streaming baru; subjek tulisan ini adalah 1.5B.
• microsoft/VibeVoice-ASR-BitNet (23 Juli 2026) — mesin edge terkuantisasi berorientasi CPU untuk model batch.
• Model VibeVoice-1.5B TTS dan VibeVoice-Realtime-0.5B streaming-TTS adalah anggota terpisah dari keluarga yang sama, bukan bagian dari lini ASR.
Bidang ASR open-weights yang lebih luas telah bergerak menuju real-time sepanjang tahun, sehingga entri streaming baru memiliki titik perbandingan langsung. Qwen3-ASR (Alibaba, ~1.7B) adalah model streaming-dan-offline terpadu yang mencakup 50+ bahasa dan dialek. NVIDIA Nemotron 3.5 ASR adalah model streaming 0.6B yang mencakup 40 bahasa, di bawah lisensi OpenMDW, bukan MIT. IBM Granite Speech 5.0 470M TurboCTC berlisensi Apache-2.0 dengan angka throughput yang dilaporkan vendor dan luar biasa tinggi. Dibandingkan dengan itu, model streaming Microsoft berbeda dalam tiga hal: lisensi MIT, backbone LLM yang membawa pemahaman pembicara-dan-konten, bukan model akustik murni, serta kerangka transkripsi langsung beratribusi pembicara. Pertanyaan terbukanya adalah akurasi dan latensi dunia nyata — keduanya belum memiliki angka independen.
Apa yang belum diverifikasi?
Membaca repo memberi tahu Anda desainnya; tidak memberi tahu seberapa baik ia bekerja. Secara spesifik:
• Tidak ada angka akurasi atau latensi dalam teks. Kartu model menyertakan figur hasil sebagai gambar, tetapi tidak ada tabel numerik WER, RTF, atau latensi dalam prosa — tidak ada yang dapat dikutip secara independen.
• Tidak ada evaluasi pihak ketiga. Unduhan berada di nol sehari setelah diunggah; tidak ada tolok ukur komunitas, tidak ada entri papan peringkat, dan tidak ada tes independen yang dapat kami temukan.
• Jalur penyajiannya adalah pengaturan penelitian dari sumber. Dokumentasi streaming Microsoft dijalankan dari klon repositori GitHub VibeVoice di dalam kontainer NVIDIA PyTorch (nvcr.io/nvidia/pytorch, dengan flash-attention yang disarankan). Kartu model juga menampilkan cuplikan pipeline Transformers dan menyerahkan detail instalasi ke GitHub; apakah versi Transformers yang dirilis saat ini dapat menjalankan inferensi streaming pada checkpoint ini secara langsung, kami belum memverifikasi.
• Framing-nya mengedepankan riset. Repositori Microsoft menggambarkan model VibeVoice sebagai model yang ditujukan untuk keperluan riset dan pengembangan. Bobotnya berlisensi MIT; sikapnya adalah "ini sainsnya," bukan "ini produk yang didukung." Siapkan anggaran untuk tahap evaluasi Anda sendiri.
Haruskah Anda membangun di atasnya?
Untuk tim yang sudah menghosting ASR sendiri, ini layak dievaluasi selama akhir pekan jika audio Anda termasuk dalam set sepuluh bahasa tersebut dan Anda secara khusus membutuhkan transkripsi langsung dengan atribusi pembicara dari model berlisensi MIT. Anggarkan sekitar 5,6 GB untuk bobot model 1.5B pada GPU NVIDIA serta instalasi dari sumber, dan rencanakan untuk mengukur sendiri akurasi pada audio Anda sebelum memercayainya.
Untuk tim yang saat ini menggelar pipeline transkripsi produksi, jawaban yang bijaksana adalah menunggu salah satu dari tiga hal: Microsoft memublikasikan angka akurasi dan latensi yang saat ini hanya ada sebagai gambar; benchmark independen; atau jalur serving yang terpelihara dengan runtime yang didukung. Irama chunk ~3 detik juga merupakan spesifikasi yang perlu Anda periksa terhadap kebutuhan latensi, bukan sekadar mengasumsikannya dari kata "streaming."
Cara yang hemat biaya untuk menjaga opsi tetap terbuka adalah dengan menghindari pengikatan aplikasi Anda secara permanen pada satu mesin transkripsi. Lapisan perutean yang membuat banyak model dapat diakses melalui satu API berarti bahwa ketika VibeVoice-ASR-Streaming — atau ASR terbuka berikutnya — tersedia di sebuah penyedia inferensi, menguji A/B-nya terhadap model yang sudah ada pada traffic yang sama hanyalah perubahan konfigurasi, bukan re-platforming. Karena router pass-through mengenakan biaya sesuai harga daftar penyedia tanpa markup, biaya perbandingan tersebut tetap murah, dan failover otomatis mencegah model muda yang belum terbukti menjadi titik kegagalan tunggal dalam pipeline Anda. Itulah pola umum untuk mengadopsi model yang baru berumur beberapa hari: biarkan ia mendapatkan tempat pada traffic nyata sebelum Anda mempertaruhkan produksi padanya.
FAQ
Apakah VibeVoice-ASR-Streaming-1.5B merupakan rilis Microsoft yang sebenarnya?
Ya. Checkpoint tersebut berada di akun resmi Hugging Face milik Microsoft dengan stempel waktu pembuatan 2 September 2026, dan repositori GitHub microsoft/VibeVoice mencantumkan VibeVoice-ASR-Streaming dalam tabel modelnya dengan entri berita bertanggal 3 September 2026. Yang tidak biasa bukanlah asal-usulnya, melainkan keheningannya: tidak ada siaran pers, tidak ada posting blog, dan tidak ada liputan pihak ketiga hingga tulisan ini dibuat.
Mengapa dua ukuran, 7B dan 1.5B?
Microsoft mengunggah kedua checkpoint pada menit yang sama tetapi belum menerbitkan perbandingan. Dari konfigurasi, 1.5B adalah ujung kecil — backbone bahasa Qwen kelas 1.5B ditambah tumpukan audio, sekitar 3B parameter dan ~5.6 GB bobot. Pembacaan yang wajar adalah 7B yang lebih akurat dan 1.5B yang lebih murah serta lebih cepat, tetapi Microsoft belum menyatakan demikian, dan tidak ada tolok ukur untuk mengonfirmasi trade-off tersebut.
Apa bedanya dengan VibeVoice-ASR sebelumnya?
Model batch bulan Januari mencerna hingga 60 menit audio dalam sekali proses dan mengiklankan dukungan 50+ bahasa. Checkpoint streaming mentranskripsikan audio saat audio tersebut tiba, menghasilkan transkrip dalam potongan {{1}}...{{/1}} sekitar 3 detik dengan {{2}}...{{/2}} pandangan ke depan sekitar 0,5 detik, dan kartu model mencantumkan sepuluh bahasa. Keduanya berbagi arsitektur token ucapan yang sama, gagasan keluaran yang diatribusikan ke pembicara, dan mekanisme hotword.
Untuk saat ini, VibeVoice-ASR-Streaming-1.5B hanyalah sebuah checkpoint plus sebaris berita. Baca repo-nya jika Anda melakukan self-host dan membutuhkan ASR streaming berlisensi permisif untuk dievaluasi; tunggu angka-angkanya jika Anda memilih mesin produksi. Sinyal yang menarik adalah Microsoft mendorong lini suaranya menuju real-time dalam dua ukuran sekaligus — dan melakukannya dengan begitu tenang sehingga sehari kemudian, penghitung unduhan masih menunjukkan nol.
