Kartu judul hero yang dibuat untuk 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: penantang MIT yang belum terbukti melawan juara Open ASR', dengan subjudul 'Pilihan default yang terbukti versus penantang yang baru lahir', beserta dua kartu model — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 Sep 2026 · MIT · Belum ada benchmark yang dipublikasikan) dan NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 Mei 2025 · CC-BY-4.0 · Open ASR #1 sejak Mei 2025) — serta tag yang bertuliskan '6.05% rata-rata WER (Parakeet)', 'Terpaut 16 bulan', dan 'Siapa-mengatakan-apa + hotwords (Microsoft, belum terverifikasi)'. Logo OrcaRouter ditempatkan di pojok kanan bawah.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: penantang MIT yang belum terbukti melawan juara Open ASR

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jika Anda membutuhkan speech-to-text dengan open-weights untuk produksi saat ini, ada satu pilihan standar, yaitu NVIDIA Parakeet TDT 0.6B. Sejak Mei 2025, Parakeet TDT 0.6B v2 yang berparameter 600 juta ini telah menempati posisi teratas papan peringkat Open ASR Hugging Face dengan rata-rata tingkat kesalahan kata 6,05%, sebuah posisi yang berhasil direproduksi oleh pihak ketiga selama lebih dari setahun. Calon penantang terbaru adalah VibeVoice-ASR-Streaming-1.5B, yang diunggah Microsoft Research pada 2 September 2026 — enam belas bulan setelah Parakeet — dengan lisensi MIT, menawarkan fitur atribusi pembicara secara streaming, tetapi sejauh ini belum memiliki angka akurasi yang dipublikasikan sama sekali. Halaman ini membandingkan sang juara dan sang penantang berdasarkan bukti, arsitektur, dan apa yang masing-masing benar-benar tawarkan secara bawaan.

Dua label penting sebelum spesifikasi dibahas, karena keduanya adalah bentuk keseluruhan dari perbandingan ini. {{1}}Angka-angka Parakeet sudah pasti: rata-rata WER 6.05% dan angka throughput ~3,386 RTFx di balik klaim "satu jam audio dalam sekitar satu detik" telah terpajang di papan peringkat publik dan materi NVIDIA selama lebih dari setahun.{{/1}} {{2}}Sisi VibeVoice-ASR-Streaming-1.5B adalah apa yang dapat diketahui dari repositorinya — kartu model, berkas konfigurasi, dan dokumen streaming Microsoft — karena Microsoft tidak memublikasikan WER, latensi, maupun throughput dalam bentuk teks, dan belum ada tolok ukur independen untuk checkpoint tersebut pada saat tulisan ini dibuat.{{/2}} Satu kolom dari setiap perbandingan di bawah ini sudah teruji di lapangan; kolom yang satunya lagi masih sekadar lembar spesifikasi.

Terpisah enam belas bulan dan satu masa berkuasa di papan peringkat.

Parakeet TDT 0.6B v2 hadir pada 5 Mei 2025 sebagai jawaban NVIDIA atas masalah ASR streaming: encoder FastConformer yang dipadukan dengan decoder transduser token-dan-durasi (TDT) yang memprediksi setiap token beserta durasinya dalam satu langkah — sebuah trik efisiensi yang menghilangkan overhead token kosong pada transduser konvensional. Model ini berlisensi CC-BY-4.0, ramah untuk penggunaan komersial, serta menempati puncak papan peringkat Open ASR berkat tingkat kesalahan kata rata-rata sebesar 6,05%. Model ini juga menyertakan fitur-fitur siap produksi yang tidak diukur oleh papan peringkat tersebut — tanda baca, kapitalisasi, stempel waktu tingkat kata — serta encoder full-attention yang dapat menerima audio hingga 24 menit dalam satu kali lintasan, sehingga berguna untuk rapat panjang dan podcast tanpa perlu chunking yang agresif.

VibeVoice-ASR-Streaming-1.5B adalah penantang dalam arti yang paling murni: ia ada, ia terdokumentasi, dan belum ada yang diketahui tentang seberapa baik cara kerjanya. Baris berita GitHub Microsoft, tertanggal 3 September, mengumumkan model ASR streaming terpadu yang "secara terus-menerus mentranskripsikan siapa mengatakan apa saat ucapan tiba," dengan hotwords dan sepuluh bahasa, dan konfigurasi checkpoint tersebut menggambarkan tradisi rekayasa yang sama sekali berbeda — decoder model bahasa keluarga Qwen2 yang diberi masukan oleh tokenizer audio konvolusional, dengan kepala difusi yang menghasilkan keluaran dalam potongan sekitar 2,9 detik dan sekitar 0,5 detik lookahead. Sementara Parakeet adalah model ucapan yang dirancang khusus dan disempurnakan selama satu tahun penempatan nyata, VibeVoice-ASR-Streaming-1.5B adalah checkpoint keluarga riset yang baru berusia dua hari.

Ketimpangan bukti adalah ceritanya.

Baca sisa halaman ini dengan satu fakta di depan Anda: perbandingan ini hanya memiliki angka di satu sisi. Di sisi Parakeet TDT 0.6B, ada satu tahun mempertahankan posisi di papan peringkat — rata-rata WER 6,05% pada set data short-form bahasa Inggris publik Open ASR, sekitar 3.386 RTFx pada batch 128 di perangkat keras NVIDIA, serta ekosistem perangkat deployment NeMo, akselerasi TensorRT, dan kuantisasi FP8 yang telah teruji di produksi. Di sisi VibeVoice-ASR-Streaming-1.5B, ada angka evaluasi pada kartu model yang berupa gambar, bukan teks, dan rata-rata WER 7,77% yang dilaporkan vendor pada kartu VibeVoice-ASR batch di delapan set tes bahasa Inggris — angka yang menggambarkan model non-streaming dan tidak dapat dipindahkan ke checkpoint ini. Penantangnya mungkin saja sangat baik; intinya, “mungkin saja” itulah seluruh basis buktinya.

Pemeriksaan spesifikasi

• Parameter — NVIDIA Parakeet TDT 0.6B: 600M, encoder FastConformer + decoder TDT vs VibeVoice-ASR-Streaming-1.5B: total ~3B (backbone Qwen kelas 1.5B ditambah tokenizer dan diffusion head).

• Dirilis — 5 Mei 2025 vs 2 September 2026.

• Akurasi — WER rata-rata 6,05%, Open ASR #1 sejak Mei 2025, direproduksi pihak ketiga vs tidak ada yang dipublikasikan.

• Kecepatan — ~3.386 RTFx pada batch 128 di perangkat keras NVIDIA, ~1 jam audio per detik vs tidak ada angka throughput yang dipublikasikan.

• Streaming — mendukung streaming dengan konteks perhatian penuh hingga 24 menit per lintasan, sedangkan streaming terpotong-potong menggunakan potongan sekitar 2,9 detik dengan jangkauan ke depan sekitar 0,5 detik.

Keluaran tambahan — tanda baca, kapitalisasi, stempel waktu tingkat kata vs. atribusi siapa-berbicara-apa secara streaming (belum terverifikasi) dan kata-kata panas; sepuluh bahasa.

• Lisensi — CC-BY-4.0 vs MIT.

• Ekosistem — NVIDIA NeMo dengan TensorRT dan FP8 vs demo repositori microsoft/VibeVoice dan plugin vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Di balik layar: dua gagasan tentang fungsi model bicara

Arsitektur-arsitektur tersebut mewujudkan dua keyakinan berbeda tentang tugas ini. Parakeet TDT 0.6B memperlakukan transkripsi sebagai masalah pemrosesan sinyal yang diselesaikan secara efisien: encoder FastConformer mengekstrak akustik dan decoder TDT mengeluarkan token teks dan durasi secara bersamaan, itulah sebabnya ia berjalan ribuan kali lebih cepat dari waktu nyata dan mengapa ia nyaman berada di atas tumpukan deployment NVIDIA. VibeVoice-ASR-Streaming-1.5B memperlakukan transkripsi sebagai masalah bahasa: kompres audio menjadi aliran token, serahkan ke model bahasa yang telah membaca konteks selengkap transkrip, dan biarkan pemahaman LM tentang siapa mengatakan apa dan bagaimana percakapan saling terhubung yang melakukan pekerjaan tersebut. Tulang punggung LLM juga menjadi alasan checkpoint itu memiliki ~3 miliar parameter, bukan 600 juta, dan mengapa Microsoft tidak mengklaim jejak edge—ini adalah model yang menginginkan GPU dan menggunakan memori untuk membawa konteks.

Untuk transkripsi langsung, konsekuensi praktisnya adalah bentuk latensi. Enkoder perhatian penuh Parakeet dapat memproses jendela panjang dalam satu lintasan, yang merupakan filosofi streaming yang berbeda dari kontrak potongan-dan-lookahead tetap VibeVoice-ASR-Streaming-1.5B yang sekitar 2,9 detik audio per segmen yang dikeluarkan. Keduanya bukan streamer parsial per kata seperti API komersial berlatensi terendah; keduanya adalah sistem berbasis potongan, dan pilihan yang tepat bergantung pada apakah audio Anda datang sebagai file berbatas atau sebagai sesi langsung tanpa batas waktu.

Cerita fitur dan lingkungan-lingkungan penyebaran

Secara langsung, Parakeet TDT 0.6B adalah produk transkripsi yang lebih lengkap: tanda baca dan kapitalisasi sudah menyertai transkrip, stempel waktu tingkat kata tersedia untuk penyelarasan, dan jendela sekali proses 24 menit berarti lebih sedikit kesalahan pemotongan pada rekaman panjang. VibeVoice-ASR-Streaming-1.5B menandingi dengan fitur-fitur yang tidak dicantumkan Parakeet: output yang diatribusikan ke pembicara dan hotwords, dalam sepuluh bahasa. Klaim diarisasi streaming adalah hal yang justru membutuhkan verifikasi independen — batas-batas segmen adalah tempat atribusi dapat melenceng — tetapi itulah alasan untuk melihat model Microsoft daripada model NVIDIA jika kebutuhan Anda adalah mengetahui siapa mengatakan apa dalam rapat langsung.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

Lingkungan sekitar sama berbedanya dengan model-modelnya. Parakeet TDT 0.6B adalah warga NVIDIA NeMo: TensorRT, FP8, dan perangkat penerapan yang disetel untuk GPU NVIDIA, yang sangat baik jika Anda sudah berada di infrastruktur NVIDIA. VibeVoice-ASR-Streaming-1.5B hidup di repositori riset: jalur yang terdokumentasi adalah demo Python milik Microsoft dan plugin vLLM, kelas arsitekturnya belum ada di dokumentasi Transformers publik, dan untuk menjalankannya berarti instalasi dari sumber dan verifikasi Anda sendiri bahwa jalur pemuatan berfungsi. Bagi tim yang menghargai penerapan yang membosankan dan terdokumentasi, perbedaan itu saja dapat mengalahkan kesenjangan tolok ukur.

Argumen untuk petahana, argumen untuk penantang

Kasus untuk NVIDIA Parakeet TDT 0.6B adalah kasus untuk kuantitas yang sudah dikenal: satu tahun pertahanan papan peringkat, reproduksi pihak ketiga, lisensi komersial, fitur produksi, dan ekosistem deployment yang telah menyerap lalu lintas nyata. Jika Anda meluncurkan fitur transkripsi bahasa Inggris pada kuartal ini dan Anda menginginkan bobot terbuka, ini adalah pilihan bawaan yang dapat dipertahankan, dan beban pembuktian ada pada apa pun yang mengklaim dapat menggantikannya.

Alasan untuk VibeVoice-ASR-Streaming-1.5B lebih sempit dan spesifik: Anda memerlukan atribusi pembicara streaming atau hotword, Anda memerlukan lebih dari sekadar bahasa Inggris, atau Anda percaya bahwa pendekatan model bahasa untuk ucapan akan menang dan Anda ingin menjadi pengadopsi awal. Ini adalah taruhan, bukan keputusan — belum ada angka yang membenarkan pemindahan lalu lintas produksi ke sana, dan sikap Microsoft sendiri adalah memprioritaskan riset. Tidak satu pun dari kedua model tersebut dilayani melalui OrcaRouter saat ini, jadi cara berbiaya rendah untuk menguji taruhan ini adalah pola yang berlaku untuk model terbuka baru mana pun: pertahankan lapisan ASR di belakang satu API perutean yang menjadi pintu masuk bagi 200+ model, dengan harga daftar penyedia tanpa markup dan failover otomatis, arahkan sebagian audio nyata ke VibeVoice-ASR-Streaming-1.5B begitu ada penyedia yang menghostingnya, dan biarkan transkrip dari lalu lintas Anda sendiri memutuskan apakah penantang layak mendapatkan mahkota yang telah disandang Parakeet selama enam belas bulan.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube