Kartu judul hero yang dibuat untuk 'VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe: ASR streaming yang senyap dari Microsoft melawan API baru Google', dengan subjudul 'ASR streaming sumber terbuka yang senyap dari Microsoft melawan API baru Google yang dihosting', dengan dua kartu model — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · bobot berlisensi MIT, 2 September 2026 · checkpoint terbuka · 10 bahasa) dan Gemini 3.5 Transcribe (Google · pratinjau publik, 26 Agustus 2026 · API yang dihosting · 2 endpoint) — serta tag yang berbunyi 'Belum ada pengumuman', 'Belum ada benchmark yang dipublikasikan', dan '~$0.30–0.54 per jam audio (Google)'. Logo OrcaRouter dikompositkan di pojok kanan bawah.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe: ASR streaming yang tenang dari Microsoft melawan API baru Google

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tujuh hari dan satu jurang filosofis memisahkan dua sistem ucapan-ke-teks streaming terbaru. Pada 26 Agustus 2026, Google merilis Gemini 3.5 Transcribe ke pratinjau publik: API ucapan-ke-teks tertutup yang di-hosting, dihargai per token audio, dengan endpoint Live terpisah untuk sesi real-time. Pada 2 September 2026, Microsoft Research mengunggah VibeVoice-ASR-Streaming-1.5B ke Hugging Face di bawah namespace microsoft — bobot berlisensi MIT, tanpa siaran pers, tanpa postingan peluncuran, dan hingga tulisan ini dibuat, tanpa liputan pihak ketiga di mana pun. Keduanya mentranskripsikan ucapan saat ucapan tersebut masih tiba. Hampir semua hal lain tentang keduanya — siapa yang diizinkan menjalankannya, berapa biayanya, bukti apa yang ada bahwa keduanya berfungsi — berbeda.

Halaman ini membandingkan keduanya sebagaimana adanya saat ini, yang berarti kedua sisi bukti tidaklah simetris. Gemini 3.5 Transcribe adalah produk Google yang aktif dengan harga token yang dipublikasikan dan angka akurasi pihak ketiga dari Artificial Analysis; angka-angka tersebut diberi label AA di bawah. VibeVoice-ASR-Streaming-1.5B adalah sebuah checkpoint yang kartu modelnya tidak memublikasikan word-error-rate maupun angka latensi sama sekali dalam teks — evaluasi pada kartu tersebut berupa gambar, dan satu-satunya pengumuman dari keluarga streaming sejauh ini hanyalah sebuah baris berita bertanggal 3 September di repositori GitHub VibeVoice milik Microsoft. Segala hal dari sisi Microsoft di bawah ini adalah apa yang dapat diketahui dari repositori: berkas konfigurasi, kartu model, dan dokumentasi streaming milik Microsoft sendiri. Belum ada satu pun yang diuji secara independen.

Kedua model secara sekilas

• Apa itu — VibeVoice-ASR-Streaming-1.5B: checkpoint terbuka, lisensi MIT, di-host sendiri vs Gemini 3.5 Transcribe: API yang di-host, bobot tertutup.

• Rilis — bobot 2 September 2026, baris berita repo 3 September vs pratinjau publik 26 Agustus 2026 dengan materi peluncuran lengkap.

• Bentuk streaming — menghasilkan teks dalam potongan berdurasi ~2,9 detik dengan lookahead ~0,5 detik, status sesi disimpan dalam cache prefiks vs sesi WebSocket Live yang ditagih per token audio, dibatasi maksimal 10 menit audio per sesi.

• Akurasi dalam cetakan — tidak ada angka WER atau latensi yang dipublikasikan sebagai teks dibandingkan dengan yang diukur AA: 2,6% WER pada endpoint pra-rekaman dan 4,0% pada endpoint Live.

• Output pembicara — mengklaim atribusi siapa-mengatakan-apa secara streaming (belum terverifikasi) vs tanpa diarisasi pembicara dan tanpa stempel waktu tingkat kata pada endpoint Live.

• Hotwords — didukung, melalui prompt konteks yang sama dengan batch VibeVoice-ASR vs bukan fitur yang tercantum pada endpoint Live.

• Biaya — $0 untuk bobot, ~5,6 GB untuk self-host vs sekitar $0,30 per jam audio gabungan pada endpoint pra-rekaman dan ~$0,54 pada Live, sesuai harga token yang tercantum di Google.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, License MIT open weights, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, Speaker output who-said-what claimed, Cost $0 weights / ~5.6 GB self-host. Right column Gemini 3.5 Transcribe: Released Aug 26 2026, License closed API, Streaming WebSocket Live, 10-min cap, WER 2.6% batch / 4.0% Live (AA), Speaker output none on Live, Cost ~$0.30–0.54 per audio-hour. Footer reads 'Gemini figures per Google pricing and Artificial Analysis; VibeVoice specs read from the HF repo; no VibeVoice benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Sebuah API yang di-host dan sebuah unggahan senyap, berjarak tujuh hari

Gemini 3.5 Transcribe adalah model transkripsi kelas pengganti milik Google, dan dirilis dalam dua produk. Endpoint pra-rekaman, yang dilayani melalui Interactions API, menerima file audio lengkap dan mengembalikan transkrip dengan tambahan yang diharapkan. Endpoint Live, gemini-3.5-transcribe-live, berjalan melalui WebSocket dua arah dan merupakan yang bersaing dengan VibeVoice-ASR-Streaming-1.5B dalam hal bentuk tugas: mentranskripsi sesi saat berlangsung. Google mengumumkannya dengan mekanisme yang biasa — peluncuran pratinjau publik pada 26 Agustus, harga di halaman model, papan peringkat pihak ketiga yang mengangkatnya dalam hitungan hari.

Rilis streaming Microsoft tidak memiliki semua itu. Pada 2 September, akun Hugging Face microsoft membuat dua checkpoint dalam menit yang sama: VibeVoice-ASR-Streaming-7B dan VibeVoice-ASR-Streaming-1.5B. Tabel model di repositori GitHub kini mencantumkan VibeVoice-ASR-Streaming sebagai anggota keluarga, dan bagian News-nya memuat baris 3 September yang mengumumkan "model ASR streaming terpadu yang terus-menerus mentranskripsikan siapa yang mengatakan apa saat ucapan tiba, dengan dukungan untuk hotword kustom dan 10 bahasa" — tetapi pengumuman itu hanya menyebutkan 7B, sedangkan 1.5B adalah saudara yang lebih kecil yang dirilis bersamaan dengannya tanpa disebut-sebut. Saat kami memeriksa sehari setelah diunggah, kedua checkpoint tersebut masih menunjukkan nol unduhan.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Apa arti "streaming" di setiap sisi

Kata "streaming" menyembunyikan perbedaan desain yang nyata. Konfigurasi preprocessor Microsoft membuat irama VibeVoice menjadi konkret: audio tiba pada 24 kHz dan dikompresi 3.200× menjadi aliran token ucapan sekitar 7,5 Hz (satu token setiap ~133 ms). Konfigurasi tersebut kemudian mendeklarasikan chunk sebanyak 22 frame dan lookahead 4 frame — sekitar 2,9 detik audio per chunk, dengan sekitar setengah detik audio masa depan digunakan untuk memantapkan segmen saat ini. Model mengeluarkan teks satu kali per chunk yang terselesaikan, dan dokumentasi Microsoft mencatat bahwa konteks dari chunk-chunk sebelumnya dipertahankan melalui cache KV, sehingga sesi yang panjang tidak menghitung ulang dari awal. Aritmetika ada di dalam konfigurasi; konsekuensi praktisnya adalah transkrip yang bertambah dalam kenaikan sekitar tiga detik, bukan dalam parsial per kata.

Endpoint Live Google memiliki bentuk streaming yang berbeda: sesi WebSocket dua arah yang audionya dikenai biaya 25 token audio per detik, dirancang untuk penggunaan interaktif, tetapi dibatasi maksimal 10 menit audio per sesi — dan, khususnya pada endpoint Live — tanpa diarisasi pembicara atau stempel waktu tingkat kata. Bagi siapa pun yang membandingkan keduanya sebagai mesin transkripsi langsung, perbedaan yang penting adalah batas sesi (10 menit di sisi Live Google, sedangkan di sisi Microsoft hanya dibatasi oleh GPU dan memori Anda sendiri), irama emisi (sekitar 3 detik per potongan dibandingkan apa pun yang dikirim sesi WebSocket), serta tambahan keluaran (atribusi pembicara dan hotwords yang diklaim di kartu Microsoft, tetapi tidak ada dalam daftar fitur Live Google).

Akurasi: satu sisi memiliki angka, sisi lainnya memiliki gambar.

Ini adalah kesenjangan terlebar dalam perbandingan ini, dan ini adalah kesenjangan dalam bukti, belum tentu dalam kualitas. Artificial Analysis mengukur Gemini 3.5 Transcribe dengan tingkat kesalahan kata 2,6% pada endpoint pra-rekaman dan 4,0% pada endpoint Live — premium yang Anda bayar untuk pengiriman real-time tercermin dalam tingkat kesalahan, yang merupakan trade-off yang umum dan jujur untuk sistem streaming. Itu adalah angka pihak ketiga di papan peringkat yang netral, diterbitkan beberapa hari setelah peluncuran.

VibeVoice-ASR-Streaming-1.5B tidak memiliki figur pembanding di mana pun. Kartu model menyertakan figur hasil evaluasi sebagai gambar, tetapi tanpa angka WER, RTF, atau latensi dalam bentuk prosa — tidak ada yang dapat dikutip dan tidak ada yang dapat diverifikasi secara independen. Microsoft belum mencantumkan angka akurasi streaming dalam teks, baik untuk 7B maupun 1.5B. Satu-satunya jangkar numerik di seluruh keluarga adalah kartu model batch VibeVoice-ASR, yang melaporkan rata-rata WER 7,77% yang dijalankan vendor di delapan set tes bahasa Inggris dan 2,20% pada LibriSpeech clean — tetapi itu menggambarkan model non-streaming, dan model streaming biasanya menukar sedikit akurasi demi keunggulan latensi. Sampai seseorang menjalankan checkpoint streaming melalui kerangka pengujian publik, posisi yang jujur adalah bahwa model Google sudah terukur dan model Microsoft belum.

Biaya: per jam audio versus per jam GPU

Google menjual Gemini 3.5 Transcribe per token, dan penetapan harganya terbagi rapi di kedua endpoint. Endpoint pra-rekaman mencantumkan $2 per 1M token audio input dan $12 per 1M token teks output, yang berarti sekitar $0.30 per jam audio secara gabungan. Endpoint Live mencantumkan $3.50 per 1M token audio dan $21 per 1M token teks — sekitar $0.54 per jam audio secara gabungan, atau kira-kira 80% lebih mahal daripada pra-rekaman, yang merupakan harga untuk pengiriman real-time. Google menagih audio sebesar 25 token per detik, jadi keheningan hanya gratis jika klien Anda tidak mengalirkannya; sambungan ulang, audio duplikat, dan pencatatan log semuanya dapat menambah tagihan sebenarnya. Ada paket gratis, dengan catatan bahwa konten pada paket gratis dapat digunakan untuk meningkatkan produk Google.

A generated comparison card titled 'Gemini 3.5 Transcribe — the two endpoints'. Left column 'Pre-recorded': $2 / $12 per 1M audio / text tokens, ~$0.30 per audio-hour, AA WER 2.6%, diarization and word-level timestamps. Right column 'Live': $3.50 / $21 per 1M tokens, ~$0.54 per audio-hour, AA WER 4.0%, no diarization, 10-minute session cap. Footer reads 'Token prices per Google's model page; WER per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Sebagai gantinya, model Microsoft dihargai dalam jam GPU. Checkpoint 1.5B kira-kira sebesar 5.6 GB bobot bf16 (backbone bahasa Qwen kelas 1.5B ditambah tokenizer audio dan diffusion head — metadata safetensors-nya berjumlah sekitar 3B parameter), dan jalur yang terdokumentasi untuk menjalankannya bersifat self-hosted: demo Python di repositori microsoft/VibeVoice, atau plugin vLLM yang dijelaskan Microsoft untuk melayani endpoint yang kompatibel dengan OpenAI dan WebSocket. Belum ada harga terhosting karena belum ada penyedia inferensi yang mencantumkan model ini. Persoalan biaya sepenuhnya adalah apakah waktu GPU Anda sendiri lebih murah daripada tarif per jam Google — yang untuk volume transkripsi berkelanjutan hampir pasti memang lebih murah — dan persoalan lisensi terpisah dari persoalan biaya, karena bobot MIT menjadi milik Anda dengan cara yang tidak dimiliki oleh langganan API mana pun.

Keduanya tidak saling eksklusif dalam tumpukan produksi. Pola pragmatis bagi tim yang membutuhkan transkripsi langsung hari ini adalah menjaga lapisan ASR di belakang satu endpoint sehingga pilihan tersebut tetap reversibel: API perutean yang menangani 200+ model dengan harga daftar penyedia — tanpa markup, sehingga perubahan harga vendor langsung berlaku pada hari yang sama — dengan failover otomatis, adalah lapisan yang memungkinkan Anda menjalankan API terukur Google sebagai default sementara sebagian lalu lintas nyata menguji VibeVoice-ASR-Streaming-1.5B begitu penyedia menghostingnya. Itulah model OrcaRouter, dan ini adalah cara berisiko rendah untuk mengadopsi checkpoint yang akurasinya belum diverifikasi siapa pun.

Siapa yang harus memilih yang mana

Pilih Gemini 3.5 Transcribe jika Anda menginginkan API transkripsi yang berfungsi saat ini, dengan akurasi yang dipublikasikan, harga per jam yang dapat diprediksi, dan tanpa GPU yang harus diawasi — terutama jika audio Anda tidak termasuk dalam sepuluh bahasa yang didaftarkan Microsoft, atau jika Anda memerlukan diarisasi dan stempel waktu tingkat kata dari endpoint pra-rekaman untuk transkripsi file. Batas sesi Live 10 menit adalah kendala nyata yang perlu diuji terhadap kasus penggunaan Anda sebelum Anda berkomitmen untuk sesi langsung.

Pilih VibeVoice-ASR-Streaming-1.5B jika Anda melakukan self-hosting, jika Anda menginginkan kontrol atas bobot dan data yang disediakan MIT, jika Anda membutuhkan panjang sesi tanpa batas, atau jika output streaming yang menunjukkan pembicara dan hotwords adalah fitur yang secara khusus ingin Anda evaluasi. Perhitungkan instalasi dari sumber, bobot sekitar 5,6 GB pada GPU NVIDIA, dan proses evaluasi sendiri — tidak ada tolok ukur yang bisa diandalkan, jadi pertanyaan akurasi harus dijawab sendiri dengan audio Anda.

Kesimpulan satu minggu: Google merilis produk yang terukur, sedangkan Microsoft merilis taruhan yang menarik. Gemini 3.5 Transcribe adalah opsi default yang lebih aman dan yang didukung oleh angka pihak ketiga; VibeVoice-ASR-Streaming-1.5B adalah alternatif terbuka yang dapat di-host sendiri dan sepenuhnya belum terverifikasi. Yang membuat pilihan ini murah adalah karena tidak harus permanen — jaga agar endpoint ASR tetap dapat diganti, dan checkpoint yang dirilis tanpa satu pun benchmark dapat memperoleh atau kehilangan trafik Anda berdasarkan bukti dari transkrip Anda sendiri.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube