
VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: dua taruhan streaming open-weights yang tenang
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Dua rilis speech-to-text streaming dengan bobot terbuka paling menarik pada akhir Agustus 2026 sama-sama dirilis tanpa acara peluncuran. Pada 25 Agustus, IBM menempatkan Granite Speech 5.0 470M TurboCTC di Hugging Face — bobot, kartu model, dan sebuah posting blog, tidak lebih — dan pada 2 September, Microsoft Research mengunggah VibeVoice-ASR-Streaming-1.5B di bawah namespace microsoft tanpa pengumuman sama sekali selain satu baris berita di repositori GitHub VibeVoice mereka. Keduanya adalah hal yang serupa bentuknya dan taruhan rekayasa yang berlawanan: model IBM adalah encoder pure-CTC berkekuatan 470 juta parameter yang dirancang untuk berjalan dengan kecepatan edge di laptop, sedangkan model Microsoft adalah model bahasa ucapan kelas 1.5B yang dibungkus tokenizer audio dan kepala difusi — total sekitar tiga miliar parameter — dibuat untuk memahami ucapan sebagai bahasa sambil melakukan transkripsi.
Sebelum membahas angka-angkanya, perlu dijelaskan label sumber yang menjaga kejujuran perbandingan ini. Semua data yang berlabel "dilaporkan IBM" berasal dari kartu model Granite Speech 5.0 470M TurboCTC dan entri papan peringkat Open ASR-nya, yang dijalankan oleh IBM melalui harness resmi pada hari rilis dan belum direproduksi secara independen. Sementara itu, semua informasi tentang VibeVoice-ASR-Streaming-1.5B berasal dari pembacaan repositori — file konfigurasi, kartu model, dan dokumen streaming Microsoft — karena Microsoft tidak memublikasikan angka akurasi atau latensi secara tertulis, dan tidak ada pihak di luar Microsoft yang melakukan benchmark pada checkpoint tersebut. Keduanya tidak dijalankan dalam harness yang sama; perbandingan ini menilai keduanya berdasarkan bukti publik yang sama, dan itulah semua yang telah disediakan masing-masing perusahaan sejauh ini.
Dua rilis tenang, berjarak delapan hari
Kedua model tersebut hadir dengan cara yang sama-sama tanpa seremoni — hal ini perlu dinyatakan secara gamblang karena tidak satu pun dari kedua perusahaan itu yang banyak berbicara sejak saat itu. Granite Speech 5.0 470M TurboCTC milik IBM adalah bagian dari peluncuran dua varian yang berlisensi Apache-2.0; IBM juga menerbitkan varian nonkomersial -NC dengan angka-angka utama yang sedikit lebih baik — dan kartu modelnya mencantumkan tanggal rilis 25 Agustus 2026, dengan dukungan Transformers secara native serta submisi papan peringkat Open ASR bertanggal sama. Pasangan streaming Microsoft, VibeVoice-ASR-Streaming-7B dan VibeVoice-ASR-Streaming-1.5B, dibuat di Hugging Face pada menit yang sama tanggal 2 September; pengumuman GitHub yang menyebut "model ASR streaming terpadu yang secara terus-menerus mentranskripsikan siapa yang mengatakan apa begitu ucapan tiba" bertanggal 3 September dan menamai 7B, sehingga 1.5B yang diliput di sini menjadi saudara yang lebih kecil yang diluncurkan dengan tenang di sampingnya.
Bagian yang menarik adalah bahwa dua tim menggunakan kata "streaming" dan membangun hal yang berlawanan. Granite Speech 5.0 470M TurboCTC adalah encoder konformer yang dilatih dengan CTC dan didekode dalam satu lintasan non-autoregresif — tidak ada dekoder yang menghasilkan teks token demi token, sehingga model ini murah secara struktural dan cepat secara struktural. VibeVoice-ASR-Streaming-1.5B adalah LLM ucapan: dua tokenizer konvolusional mengubah audio 24 kHz menjadi aliran token ucapan ~7,5 Hz, dekoder keluarga Qwen2 (28 lapisan, 1.536 unit tersembunyi — kelas 1,5B) membacanya, dan kepala difusi menghasilkan transkrip dalam potongan sekitar 2,9 detik dengan lookahead kira-kira setengah detik. Yang satu adalah mobil balap; yang lainnya adalah model bahasa kecil yang kebetulan mendengarkan.
Pemeriksaan spesifikasi
• Parameter — Granite Speech 5.0 470M TurboCTC: 470M, hanya encoder vs VibeVoice-ASR-Streaming-1.5B: ~3B total (backbone LM kelas 1.5B plus tokenizer dan head difusi).
• Arsitektur — encoder conformer dengan self-attention blok dan self-conditioning, dilatih dengan CTC, dekode non-autoregresif greedy vs tokenizer akustik/semantik ganda yang memberi masukan ke decoder kausal keluarga Qwen2 dengan kepala difusi DDPM.
• Irama keluaran — sekitar 12.5 frame keluaran per detik, dialirkan per potongan, dibandingkan dengan token ucapan sekitar 7.5 Hz, menghasilkan teks per potongan sekitar 2.9 detik dengan lookahead sekitar 0.5 detik.
• Bahasa — hanya Inggris vs sepuluh: Cina, Inggris, Prancis, Jerman, Italia, Jepang, Korea, Portugis, Rusia, dan Spanyol.
Bobot — sekitar 0,5 miliar parameter / sebagian kecil dari satu GB, kelas edge, dibandingkan dengan ~5,6 GB bf16, kelas NVIDIA-GPU.
• Akurasi dalam cetakan — rata-rata WER ~5,00% yang dilaporkan IBM pada set short-form Open ASR vs tidak ada angka WER yang dipublikasikan dalam teks.
• Lisensi — Apache-2.0 vs MIT.
• Dirilis — 25 Agustus 2026 vs 2 September 2026.

Kecepatan: yang satu dibuat untuk berukuran kecil, yang lainnya untuk menjadi model bahasa.
Pembagian arsitektur ini terlihat pertama kali pada kecepatan dan perangkat keras. Granite Speech 5.0 470M TurboCTC ditujukan untuk laptop, ponsel pintar, dan perangkat edge lainnya. Karena encoder CTC murni tidak mengambil sampel apa pun — keluarannya adalah satu lintasan serakah di atas head BPE dengan 16.384 unit — model ini sangat murah untuk dijalankan, dan kartu model IBM melaporkan angka throughput Open ASR yang diukur pada satu H200 yang berada dalam puluhan ribu RTFx untuk lini TurboCTC, serta demo WebGPU yang mentranskripsi langsung di tab browser. Angka-angka tersebut diukur oleh IBM dan tidak direproduksi, tetapi poin strukturalnya tetap berlaku dengan sendirinya: encoder 470M tanpa decoder autoregresif adalah model yang dapat dijalankan di perangkat keras yang disertakan dengan ponsel.
VibeVoice-ASR-Streaming-1.5B membuat trade-off yang berlawanan. Dekodernya adalah model bahasa kausal, yang berarti teks dihasilkan dalam loop yang lebih berat daripada argmax CTC, dan cara-cara yang terdokumentasi untuk menjalankannya adalah self-hosted di GPU NVIDIA — demo Python dari repositori microsoft/VibeVoice atau plugin vLLM-nya — dengan bobot bf16 sekitar 5,6 GB sebelum cache KV. Microsoft tidak memublikasikan klaim tentang throughput atau real-time factor, jadi tidak ada angka vendor yang dapat dibandingkan dengan milik IBM. Sebagai gantinya, arsitektur LLM menawarkan konteks: model ini membawa pemahaman tentang pembicara dan isi percakapan di sepanjang transkrip sebagaimana model bahasa melakukannya, yang merupakan perbedaan antara mentranskripsikan suara dan mengikuti percakapan.
Akurasi: satu vendor mencetak angka, vendor lainnya mencetak gambar
Berdasarkan bukti yang ada, Granite Speech 5.0 470M TurboCTC lebih unggul dari VibeVoice-ASR-Streaming-1.5B dengan satu benchmark utuh yang layak dipublikasikan. IBM menjalankan modelnya melalui harness leaderboard Open ASR resmi pada hari rilis dan melaporkan rata-rata word error rate sekitar 5.00% pada set publik bahasa Inggris bentuk pendek — angka yang diukur vendor, belum diverifikasi pihak ketiga mana pun, dan sama sekali tidak ada di sisi Microsoft dalam perbandingan ini. Kartu model VibeVoice-ASR-Streaming-1.5B hanya menyertakan gambar hasil evaluasi tanpa nilai WER, RTF, atau latensi dalam bentuk teks; satu-satunya angka acuan dalam keluarga VibeVoice adalah rata-rata WER 7.77% yang dilaporkan vendor pada kartu batch VibeVoice-ASR di delapan set pengujian bahasa Inggris, yang menggambarkan model non-streaming dan tidak dapat dialihkan. Apa pun hasil uji independen nantinya, ringkasan yang jujur saat ini adalah IBM menerbitkan angka, sedangkan Microsoft menerbitkan gambar.

Bahasa dan keluaran: hanya bahasa Inggris versus siapa-mengatakan-apa dalam sepuluh.
Granite Speech 5.0 470M TurboCTC hanya mendukung bahasa Inggris dan mengembalikan teks transkripsi mentah. Itu bukanlah kekurangan untuk beban kerja yang dibidik IBM — transkripsi bahasa Inggris tingkat enterprise pada perangkat edge — tetapi perbandingan itu berakhir begitu audio Anda bukan dalam bahasa Inggris. VibeVoice-ASR-Streaming-1.5B mencantumkan sepuluh bahasa dan mengklaim keluaran streaming dengan atribusi pembicara: kartu modelnya menyatakan bahwa model tersebut "terus-menerus mentranskripsikan siapa mengatakan apa saat ucapan tiba," dengan hotword untuk istilah domain yang diteruskan sebagai prompt konteks. Kedua fitur tambahan itu layak disikapi secara skeptis — diarisasi streaming melintasi batas antar-chunk memang sulit, dan klaim tersebut belum terverifikasi — tetapi itulah alasan tim dengan rapat multibahasa langsung mau melirik model Microsoft.
Lisensi dan ekosistem: Apache-2.0 versus MIT, Transformers versus repositori riset
Kedua lisensi mengizinkan penggunaan komersial, yang sudah membedakan pasangan ini dari varian -NC milik IBM pada arsitektur yang sama. Granite Speech 5.0 470M TurboCTC berlisensi Apache-2.0 dengan hibah paten yang lazim, dan terintegrasi secara native di Hugging Face Transformers (AutoModelForCTC dari transformers >= 5.16) plus mlx-audio untuk Apple Silicon — artinya model ini dapat dijalankan di mana pun komunitas deployment terbesar di ekosistem tersebut berjalan, pada perangkat keras vendor mana pun. VibeVoice-ASR-Streaming-1.5B berlisensi MIT, yang lebih sederhana lagi, tetapi jalur serving-nya merupakan pengaturan riset dari sumber: kelas arsitektur checkpoint-nya, VibeVoiceForASRStreamingTraining, tidak ada dalam dokumentasi publik Transformers, dan dokumentasi streaming milik Microsoft sendiri mengarahkan ke kode demo repositori serta plugin vLLM, bukan ke pemuatan pustaka siap pakai. Bagi tim produksi, perbedaannya nyata: model yang satu bisa langsung masuk ke pipeline Transformers yang sudah ada saat ini, sedangkan model yang lain mengharuskan Anda menyiapkan repositori riset dan memverifikasi sendiri jalur pemuatannya.

Rilis senyap mana yang harus Anda evaluasi?
Evaluasi Granite Speech 5.0 470M TurboCTC terlebih dahulu jika beban kerja Anda berbahasa Inggris, perangkat keras Anda kelas edge atau CPU-bound, dan Anda menginginkan model yang mudah dipasang ke Transformers dengan angka pada kartu model untuk pemeriksaan kewajaran. Model ini adalah pilihan berisiko lebih rendah di semua dimensi kecuali satu — model ini tidak akan membantu Anda dengan bahasa kedua atau transkrip rapat langsung yang perlu mengetahui siapa yang berbicara.
Evaluasi VibeVoice-ASR-Streaming-1.5B jika Anda memerlukan streaming multibahasa, jika output siapa-mengatakan-apa atau hotwords adalah fitur yang ingin Anda uji, atau jika Anda lebih suka bertaruh pada pendekatan model bahasa untuk ucapan daripada encoder murni. Siapkan anggaran untuk GPU NVIDIA, instalasi dari kode sumber, bobot ~5.6 GB, dan evaluasi yang Anda rancang sendiri, karena belum ada siapa pun — termasuk Microsoft — yang memublikasikan angka yang dapat Anda andalkan.
Yang tidak diubah oleh kedua perilisan senyap itu adalah nilai menjaga lapisan ASR tetap dapat ditukar sambil Anda mencari tahu taruhan mana yang membuahkan hasil. Kedua model masih muda dan, hingga tulisan ini dibuat, belum ada satu pun yang dilayani melalui OrcaRouter; ketika sebuah penyedia meng-host salah satunya, cara berisiko rendah untuk mencobanya adalah di balik lapisan perutean yang memayungi 200+ model dengan harga sesuai daftar penyedia — markup 0%, jadi perubahan harga berlaku di hari yang sama — dengan failover otomatis ke apa pun yang selama ini Anda percayai. Rutekan sebagian audio asli ke model baru, baca transkripnya, dan biarkan lalu lintas Anda sendiri — bukan lembar benchmark hari rilis — yang memutuskan taruhan senyap mana yang tepat.
