
Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B: Angka yang Tidak Dipublikasikan Microsoft
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
VibeVoice ASR Streaming 7B adalah pengenal ucapan streaming terpadu milik Microsoft, diunggah ke Hugging Face pada 2 September 2026 dan diumumkan di repositori microsoft/VibeVoice sehari kemudian di bawah lisensi MIT, dan ia melakukan sesuatu yang tidak dilakukan Grok Voice Transcribe 2.0 maupun sebagian besar pesaingnya: ia mengeluarkan teks dengan atribusi pembicara saat audio tiba, tanpa tahap diarisasi terpisah. Laporan teknis Microsoft menyatakan checkpoint 7B mencapai rata-rata WER dan CER terendah di lima set evaluasi dan atribusi pembicara terbaik atau terbaik-setara dalam 12 dari 13 pengaturan evaluasi. Yang tidak dilakukan kartu model adalah menerbitkan satu pun angka dalam teks — tidak ada WER, tidak ada RTF, tidak ada angka latensi; hasilnya hanya ada sebagai gambar di laporan. Grok Voice Transcribe 2.0, dirilis enam belas hari kemudian pada 18 September 2026 dengan harga $0,10 per jam audio untuk batch dan $0,20 per jam untuk streaming, mempublikasikan semuanya: WER transkrip akhir 2,7% dan WER parsial pertama 3,4% di papan peringkat streaming Artificial Analysis, 0,49 detik untuk masing-masingnya. Jadi titik awal yang jujur untuk perbandingan ini adalah bahwa salah satu dari dua model tersebut terdokumentasi secara terukur lebih baik daripada yang lain, dan asimetri itu sendiri adalah fakta paling relevan untuk keputusan dalam perbandingan ini.
Apa yang diterbitkan Microsoft, dan apa yang dapat dilakukan pembaca dengannya
Laporan VibeVoice adalah penelitian nyata dan klaim-klaim di dalamnya spesifik dalam bentuknya, meskipun tidak dalam nilainya. Laporan itu mengevaluasi empat tolok ukur rapat — AliMeeting, AISHELL-4, AMI-SDM dan AMI-IHM — plus MLC-Challenge, di sembilan bahasa, dan melaporkan dua hasil utama: model 7B memiliki rata-rata WER/CER terendah di kelima set tersebut, dan atribusi pembicara terbaik atau sama-sama terbaik dalam 12 dari 13 pengaturan evaluasi. Keduanya adalah klaim relatif, yang merupakan jenis klaim yang bermakna: "terendah di kelima set ini" adalah pernyataan tentang pengurutan, dan pengurutan itulah yang dibutuhkan pembeli.
Yang tidak ada adalah setiap angka absolut. Tidak ada persentase WER untuk dibandingkan dengan apa pun, tidak ada angka throughput, tidak ada pengukuran latensi, dan tidak ada rincian per-set dalam teks. Tabel perbandingan yang menempatkan VibeVoice di samping Grok Voice Transcribe 2.0 dan memberikan angka kepada model Microsoft itu berarti mengarang angka tersebut. Yang dapat dikatakan adalah bahwa VibeVoice memenangi evaluasi lima set-nya sendiri dan bahwa tidak ada seorang pun di luar Microsoft yang menjalankannya ulang — tidak ada benchmark independen, tidak ada evaluasi pihak ketiga, dan pada saat penulisan ini tidak ada penyedia inferensi terkelola yang mencantumkan model itu sama sekali. Karena itu, perbandingannya adalah antara angka yang terdokumentasi dan peringkat yang tidak terdokumentasi, dan peringkat yang tidak terdokumentasi bukanlah yang lebih lemah di antara keduanya hanya karena tidak memiliki titik desimal.
Dokumentasi Grok Voice Transcribe 2.0 memiliki masalah sebaliknya. Angka 2,7% dan 3,4%-nya berasal dari papan AA-WER Streaming milik Artificial Analysis, sebuah komposit berbobot dari AA-AgentTalk sebesar 50% dengan VoxPopuli dan Earnings22 masing-masing 25% — sekitar delapan jam audio percakapan berbahasa Inggris yang berbentuk agen, dijalankan secara independen, yang merupakan asal-usul yang jauh lebih kuat daripada evaluasi milik vendor sendiri. Namun itu hanyalah satu irisan sempit bahasa Inggris, dan halaman papan itu sendiri memplot 27 dari 33 model yang dihitung SpaceXAI ketika ia mengklaim tempat pertama dari 32. Angka yang presisi pada uji yang sempit dan klaim yang tidak presisi pada uji yang lebih luas tidak dapat dibandingkan secara langsung, dan artikel ini tidak akan berpura-pura sebaliknya.
Dua setengah detik berbanding setengah detik
Perbandingan latensi adalah satu-satunya tempat di mana kedua model dapat disandingkan tanpa catatan apa pun tentang kumpulan data, karena keduanya mempublikasikan konfigurasi streaming mereka — dan perbedaannya bersifat arsitektural, bukan sekadar pilihan penyetelan.
VibeVoice ASR Streaming 7B bekerja dalam potongan. Checkpoint yang dirilisnya menggunakan 22 frame laten per potongan, yang pada 7,5 frame laten per detik milik model berarti sekitar 2,9 detik audio per potongan, dengan lookahead empat frame laten — kira-kira 0,5 detik audio mendatang — dan latensi atribusi pembicara yang diharapkan sekitar 2,00 detik. Model ini mengeluarkan teks sekali per potongan. Itu adalah sistem streaming sungguhan, tetapi iramanya diukur dalam detik, bukan milidetik.
Grok Voice Transcribe 2.0 mengembalikan transkrip parsial pertamanya 0,49 detik setelah pembicara berhenti, dan menyelesaikannya 0,49 detik setelah akhir ucapan. Kecepatan itu diperolehnya dengan akurasi — tingkat kesalahan parsial pertama turun dari 18,3% di versi 1.0 menjadi 3,4% di 2.0, dengan konsekuensi waktu pada ukuran yang sama naik dari 0,25 detik menjadi 0,49 detik.
Letakkan berdampingan:
• Irama streaming — Grok Voice Transcribe 2.0 mengeluarkan parsial secara terus-menerus dengan latensi parsial pertama 0,49 detik vs VibeVoice ASR Streaming 7B yang mengeluarkan satu potongan teks kira-kira setiap 2,9 detik
• Latensi atribusi pembicara — termasuk dalam jalur 0,49 detik yang sama vs sekitar 2,00 detik secara desain
• Lookahead — tidak dipublikasikan vs empat frame laten, sekitar 0,5 detik audio ke depan
• Dampak praktis — agen suara dapat bertindak atas kalimat yang sedang berlangsung vs sistem yang menerima paragraf berlabel pembicara setiap tiga detik
Tidak satu pun dari kedua hal ini yang salah. Potongan 2,9 detik adalah desain yang sepenuhnya wajar untuk transkripsi rapat, di mana keluarannya adalah dokumen dan nilainya terletak pada dokumen yang tiba selama rapat, bukan setelahnya. Itu adalah desain yang salah untuk agen percakapan, di mana keheningan tiga detik bukanlah jeda, melainkan kegagalan. Jarak antara kedua irama tersebut kira-kira enam kali lipat, dan itu hampir persis sejajar dengan perbedaan antara mentranskripsikan percakapan dan berpartisipasi di dalamnya.

Atribusi penutur sebagai output, bukan tahap pipeline.
Di sinilah model Microsoft benar-benar unggul, dan desainnya layak dipahami karena itulah alasan chunking-nya kasar.
VibeVoice menggunakan dua tokenizer yang telah dilatih sebelumnya — encoder akustik dan encoder semantik — yang berjalan pada 24 kHz dengan downsampling 3.200× untuk menghasilkan 7,5 frame laten per detik, satu setiap 133 milidetik. Frame-frametersebut diproyeksikan ke dalam tulang punggung model bahasa Qwen2.5, dan ucapan yang masuk serta teks yang dihasilkan disisipkan secara berselang-seling sebagai satu urutan tunggal, dengan ucapan dan teks yang sebelumnya diamati tetap dipertahankan dalam konteks model. Konsekuensinya, identitas pembicara tidak pernah menjadi masalah terpisah: model tidak mentranskripsikan lalu memutuskan siapa yang berbicara, melainkan menghasilkan teks yang dikondisikan pada riwayat audio yang masih memuat suara-suara tersebut. Itulah sebabnya tidak ada tahap diarisasi yang perlu diselaraskan, dan mengapa klaim Microsoft tentang atribusi pembicara pada 12 dari 13 pengaturan dapat dipercaya secara arsitektural, bukan hasil tambahan yang sekadar ditempelkan.
Biaya dari desain itu adalah retensi riwayat yang tumbuh secara linear seiring panjang rekaman, itulah sebabnya checkpoint yang dirilis menargetkan rekaman hingga delapan menit. Itu adalah batas nyata dan dinyatakan secara gamblang. Hal ini membuat model tidak layak untuk pekerjaan berdurasi panjang — panggilan pendapatan dua jam, audio pusat kontak sepanjang hari — kecuali Anda membangun segmentasi dan inisialisasi ulang sendiri, yang memperkenalkan kembali persis kompleksitas yang dirancang untuk dihilangkan oleh arsitektur tersebut.
Grok Voice Transcribe 2.0 memecahkan masalah yang sama dengan cara berbeda dan dengan serangkaian batasan yang berbeda. Ini menyertakan diarisasi tanpa biaya tambahan dan mendukung hingga delapan kanal audio independen dalam satu permintaan. Untuk telefoni pusat kontak, ketika setiap peserta sering masuk melalui kanalnya sendiri, pemisahan kanal lebih andal daripada diarisasi dan tidak memiliki tingkat kesalahan yang melekat. Untuk audio campuran, hal itu bergantung pada kualitas diarisasinya, dan tidak seperti Muse Voice Transcribe milik Meta — yang mempublikasikan rata-rata tingkat kesalahan diarisasi sebesar 17,5% — SpaceXAI sama sekali belum mempublikasikan angka diarisasi. Jadi kedua model meninggalkan celah dalam bukti diarisasi: yang satu mempublikasikan peringkat tanpa nilai, yang lain mempublikasikan daftar fitur tanpa pengukuran.
Delapan belas gigabita, sepuluh bahasa, MIT
Fakta penerapannya berbeda begitu jauh sehingga hampir tidak bisa disebut perbandingan. VibeVoice ASR Streaming 7B memiliki bobot bf16 sekitar 18 GB — kartu Hugging Face mencantumkan total 9B parameter untuk checkpoint yang diberi nama 7B, dengan varian 1.5B sekitar 5,6 GB — berlisensi MIT, dengan demo Python dan plugin vLLM untuk serving. Sepuluh bahasa: Tionghoa, Inggris, Prancis, Jerman, Italia, Jepang, Korea, Portugis, Rusia, dan Spanyol. Microsoft memposisikannya untuk riset dan pengembangan.
Grok Voice Transcribe 2.0 adalah endpoint terkelola tanpa bobot yang perlu diunduh, 12 format masukan dari audio telepon 8 kHz hingga 48 kHz, hingga delapan kanal, 100 istilah kunci per permintaan, deteksi bahasa otomatis dengan peralihan di tengah perekaman, normalisasi teks invers untuk 25 bahasa, file hingga 500 MB, dan batas layanan 10 permintaan per detik serta 100 sesi streaming bersamaan per tim. Layanan ini berjalan di us-east-1 dan hanya us-east-1.
• Bobot — MIT, 18 GB, dapat Anda jalankan di mana pun vs tidak ada, hanya dihosting vendor
• Bahasa — 10 bahasa bernama vs deteksi otomatis dengan dukungan pemformatan di 25
• Bias istilah kunci — didukung melalui hotwords vs hingga 100 istilah kunci per permintaan
• Durasi rekaman — sekitar delapan menit per checkpoint sebelum retensi riwayat menjadi kendala vs tanpa batas maksimum yang dipublikasikan, file hingga 500 MB
• Kontrol region — apa pun yang Anda gunakan untuk deployment vs us-east-1
• Biaya — tanpa biaya lisensi, plus 18 GB memori GPU dan stack penyajian vs $0,10 per jam batch dan $0,20 per jam streaming
Model 18 GB bukan sesuatu yang Anda jalankan di laptop, dan plugin vLLM berarti GPU dengan memori nyata. Di sisi lain, lisensi MIT pada model sebesar itu tidak biasa dan bernilai: ini satu-satunya dari kedua opsi yang dapat Anda jalankan di dalam jaringan Anda sendiri tanpa hubungan vendor sama sekali, yang bagi audio teregulasi bukan preferensi melainkan persyaratan. Alternatif terkelola itu murah per jam dan mustahil diterapkan secara on-premises.

Di mana keputusan perutean seharusnya berada
Biaya adalah titik ketika kedua model akhirnya menjadi sebanding dengan cara yang menghasilkan angka. Jalur batch Grok Voice Transcribe 2.0 berbiaya $0,10 per jam audio, sekitar $1,67 per 1.000 menit, dan jalur streaming-nya $0,20, sekitar $3,33. VibeVoice ASR Streaming 7B tidak memiliki biaya lisensi sama sekali; yang dimilikinya sebagai gantinya adalah sekitar 18 GB memori GPU residen dan tumpukan penyajian vLLM yang Anda operasikan. Model kelas 7B pada ukuran itu tidak akan murah per jam audio di perangkat keras sewaan, dan kurva pemanfaatannya tidak kenal ampun — GPU yang dibiarkan tetap hangat untuk lalu lintas puncak berbiaya sama baik saat sedang mentranskripsi maupun saat menganggur.
Itulah bentuk lazim dari argumen bangun-sendiri versus beli, dan penyelesaiannya berbeda-beda bergantung pada volume dan pada apakah audio diizinkan meninggalkan jaringan Anda. Yang berubah dalam sebulan terakhir adalah betapa cepatnya jawaban itu bergerak: pemimpin akurasi streaming berganti tangan dua kali dalam tiga minggu, dan model yang dirilis pada awal September sudah tergeser pada pertengahan September. Arsitektur apa pun yang membuat pilihan model mahal untuk dibalik kini adalah arsitektur yang salah untuk kategori ini.
OrcaRouter adalah tempat pembalikan itu menjadi murah. Satu kunci yang kompatibel dengan OpenAI mencakup 200+ model dengan failover otomatis antar penyedia, sehingga kegagalan endpoint terkelola satu wilayah adalah peristiwa routing, bukan gangguan, dan harga daftar penyedia diteruskan dengan markup 0% — artinya perubahan harga vendor atau checkpoint baru langsung aktif di sisi kami pada hari yang sama. Bagi tim yang ingin menguji VibeVoice terhadap Grok Voice Transcribe 2.0 pada audio mereka sendiri, atau mempertahankan fallback yang dihosting sendiri di balik antarmuka yang sama dengan primary terkelola, lokasi panggilan tidak lagi menjadi hal yang harus diubah.

Putusan jujurnya: VibeVoice ASR Streaming 7B adalah model yang lebih menarik dan Grok Voice Transcribe 2.0 adalah produk yang lebih bisa dipakai, dan jarak antara kedua pernyataan itu sepenuhnya dijelaskan oleh satu vendor yang menerbitkan bagan dan vendor lain yang menerbitkan angka. Jika kebutuhan Anda adalah transkripsi rapat dengan atribusi pembicara secara on-premises untuk rapat yang berdurasi kurang dari delapan menit, checkpoint Microsoft adalah satu-satunya di antara keduanya yang memenuhi syarat. Jika kebutuhan Anda adalah agen suara yang menjawab dalam jeda percakapan, irama potongan 2,9 detik sudah menggugurkannya sebelum akurasi dibahas. Dan jika Anda menunggu perbandingan yang akan menyelesaikannya — audio yang sama melalui kedua model, dinilai oleh seseorang yang tidak bekerja untuk salah satu perusahaan — pengukuran itu belum ada, dan itu layak diingat saat berikutnya sebuah tabel menempatkan angka di samping nama VibeVoice.
