Kartu judul hero yang membandingkan 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live', overline 'Transkripsi ucapan streaming - Sep 2026', subjudul yang mencatat checkpoint sumber terbuka Microsoft yang dirilis tanpa gegap gempita berhadapan dengan Live API Google yang terukur, chip 'Bobot MIT - 2 Sep', 'API Google - 26 Agu', dan 'Tidak ada publikasi WER VibeVoice', serta catatan kaki 'Yang kita ketahui sejauh ini'. Logo OrcaRouter ditempatkan di pojok kanan bawah.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live: Satu Minggu, Dua Jenis Speech-to-Text Streaming

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Minggu terakhir bulan Agustus dan hari-hari pertama September 2026 menghasilkan dua sistem ucapan-ke-teks streaming yang tampak seperti pesaing dan sebenarnya merupakan jawaban yang berbeda untuk pertanyaan yang sama. Pada 26 Agustus, Google menempatkan Gemini 3.5 Transcribe Live ke dalam pratinjau publik: sebuah endpoint ucapan-ke-teks tertutup yang dihosting yang mengembalikan transkrip selesai 0,40 detik setelah pembicara berhenti berbicara, didukung oleh tingkat kesalahan kata streaming 4,0% yang diukur dari Artificial Analysis dan materi peluncuran lengkap. Pada 2 September, Microsoft Research mengunggah VibeVoice-ASR-Streaming-7B ke Hugging Face di bawah namespace microsoft: bobot terbuka berlisensi MIT, tanpa siaran pers, tanpa halaman peluncuran, dan kartu model yang sama sekali tidak mempublikasikan tingkat kesalahan kata maupun angka latensi dalam teks yang dapat dibaca. Keduanya menerima audio saat audio tersebut masih tiba. Hampir itulah satu-satunya kesamaan yang mereka miliki.

Bukti di kedua sisi tidak simetris, sehingga perbandingan ini ditulis sebagai apa yang kita ketahui sejauh ini. Gemini 3.5 Transcribe Live adalah produk Google dengan harga token yang dipublikasikan dan pengukuran pihak ketiga, dan semua itu diberi label di bawah. VibeVoice-ASR-Streaming-7B adalah sebuah checkpoint yang setiap klaimnya dibaca langsung dari repositori itu sendiri: file konfigurasi, kartu model, dan dokumentasi streaming Microsoft di repositori GitHub VibeVoice. Tidak ada satu pun dari sisi Microsoft yang telah di-benchmark secara independen, dan kami menyatakannya di mana pun angka seolah-olah sedang bekerja.

Jejak rilis: peluncuran API dan unggahan senyap

Google meluncurkan Gemini 3.5 Transcribe Live dengan cara yang normal. Model ini berada di bawah payung Gemini Audio bersama saudaranya, Gemini 3.5 Transcribe (jalur Interactions API untuk audio yang direkam sebelumnya). Harga tertera di halaman model, dan papan peringkat independen mulai memasukkan endpoint Live dalam hitungan hari — dari situlah WER streaming 4,0% dan latensi akhir 0,40 detik berasal. Ada tier gratis, dengan catatan umum bahwa konten tier gratis dapat digunakan untuk meningkatkan produk Google.

Rilis streaming Microsoft tidak memiliki mekanisme semacam itu. Repositori Hugging Face microsoft/VibeVoice-ASR-Streaming-7B dibuat pada 2 September 2026 pukul 15:46 UTC dan terakhir diubah tiga menit kemudian; repositori itu berisi delapan shard safetensors, sebuah tokenizer, dan konfigurasi preprocessor dengan lisensi MIT. Catatan resminya adalah sebaris news-log tertanggal 3 September di repositori microsoft/VibeVoice yang mengumumkan "model ASR streaming terpadu yang secara berkelanjutan mentranskripsikan siapa yang mengatakan apa saat ucapan tiba, dengan dukungan hotword khusus dan 10 bahasa," dengan tautan ke demo di aka.ms/vibeasr dan laporan teknis streaming. Saat kami memeriksa sehari setelah unggahan, checkpoint tersebut masih menunjukkan nol unduhan, dan tidak ada penyedia inferensi terhosting yang mencantumkannya. Kartu model memuat lebih banyak keterangan daripada pengumuman tersebut, dan repositori tersebut adalah sumber hampir semua hal di bawah ini.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Spesifikasi secara berdampingan

• Apa itu — VibeVoice-ASR-Streaming-7B: ASR streaming dengan bobot terbuka, dihosting sendiri vs Gemini 3.5 Transcribe Live: API streaming yang dihosting, dengan bobot tertutup.

• Bentuk streaming — mengeluarkan teks dalam potongan sekitar 2,9 detik dengan pandangan ke depan sekitar 0,5 detik (diturunkan dari konfigurasi checkpoint) dibandingkan dengan sesi WebSocket dua arah yang menyediakan transkrip parsial berkelanjutan dan hasil akhir 0,40 detik setelah pembicara berhenti.

• Akurasi dalam publikasi — tidak ada angka WER atau latensi yang dipublikasikan sebagai teks dibandingkan dengan WER streaming 4,0% dan 2,6% pada model pra-rekam, menurut Artificial Analysis.

• Pembicara — mengklaim atribusi siapa-mengatakan-apa secara streaming, tidak terverifikasi vs tanpa diarisasi pembicara pada endpoint Live (tersedia pada model pra-rekaman, hingga tiga pembicara).

• Bahasa — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) vs deteksi otomatis pada 85+ dengan peralihan di tengah aliran.

• Durasi sesi — hanya dibatasi oleh GPU dan memori Anda dibandingkan batas keras 10 menit per sesi Live.

• Biaya — $0 untuk bobot, sekitar 18 GB bf16 untuk self-host vs sekitar $0,54 per jam audio di Live setelah token keluaran teks dihitung.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Apa arti "streaming" di setiap sisi

Kata tersebut menyembunyikan perbedaan desain yang sesungguhnya, dan presisi di sini penting karena kedua sistem itu bahkan tidak berusaha menghasilkan irama yang sama. Konfigurasi preprosesor Microsoft membuat irama VibeVoice menjadi konkret: audio masuk pada 24 kHz dan dikompres 3.200× menjadi aliran token dengan kecepatan sekitar 7,5 frame per detik; lalu konfigurasi tersebut menetapkan satu chunk berisi 22 frame dan lookahead 4 frame — sekitar 2,9 detik audio per chunk dengan kira-kira setengah detik audio masa depan untuk memantapkannya. Model mengeluarkan teks satu kali per chunk yang terselesaikan, dan konteks dari chunk-chunk sebelumnya dipertahankan melalui cache KV, sehingga sesi yang panjang tidak menghitung ulang dari awal. Transkrip yang dihasilkan bertambah dalam pertambahan kira-kira tiga detik.

Endpoint Live Google dirancang untuk loop yang lebih cepat dan lebih interaktif: audio mengalir melalui WebSocket dalam segmen-segmen PCM 16 atau 24 kHz, transkrip parsial dikirimkan kembali secara terus-menerus selama pembicara berbicara, dan transkrip final yang telah diformat tiba 0,40 detik setelah ucapan berakhir — angka tersebut adalah hasil pengukuran Artificial Analysis, yang dikutip oleh Google. Trade-off-nya adalah batas sesi (sepuluh menit audio, setelah itu aplikasi Anda harus menyambung ulang dan menggabungkan transkripnya), serta fitur tambahan yang hilang: tidak ada diarisasi pembicara maupun stempel waktu tingkat kata di jalur Live, padahal keduanya tersedia pada Gemini 3.5 Transcribe untuk audio yang telah direkam sebelumnya. Jadi, ringkasan yang jujur adalah bahwa model streaming Google lebih cepat per ucapan, sedangkan checkpoint streaming Microsoft lebih lambat per segmen, tetapi mengklaim atribusi pembicara yang tidak disediakan jalur live Google, pada durasi sesi yang tidak ditawarkan Google.

Akurasi: diukur, dibandingkan dengan spasi kosong

Kesenjangan terbesar dalam perbandingan ini adalah kesenjangan dalam bukti, bukan selalu dalam hal kualitas. Artificial Analysis mengukur Gemini 3.5 Transcribe Live pada tingkat kesalahan kata rata-rata 4,0% untuk streaming dan 2,6% untuk model non-streaming; yang terakhir menempati peringkat kelima di papan peringkat WER-nya saat peluncuran. Google secara terpisah menyebutkan 5,50% untuk streaming dan 5,04% untuk non-streaming pada set multibahasa FLEURS. Bacalah angka-angka itu sesuai labelnya: Artificial Analysis independen dari Google, tetapi angka dari API yang baru berumur satu hari masih terlalu dini, dan premi streaming di atas model batch — 4,0% vs 2,6% — adalah harga yang biasa untuk pengiriman real-time.

VibeVoice-ASR-Streaming-7B tidak memiliki angka yang sebanding di mana pun. Kartu model menyertakan angka evaluasi sebagai gambar, dan laporan teknis Microsoft berupa PDF, tetapi keduanya tidak menyediakan angka WER streaming atau latensi dalam teks biasa yang dapat dikutip atau diperiksa secara independen. Satu-satunya jangkar numerik di seluruh keluarga adalah kartu model batch VibeVoice-ASR, yang melaporkan rata-rata WER 7.77% yang dijalankan vendor di delapan set tes bahasa Inggris dan 2.20% pada LibriSpeech clean — angka untuk model non-streaming, bukan model ini, dan model streaming biasanya menukar sedikit akurasi demi keunggulan latensi. Sampai seseorang menjalankan checkpoint streaming melalui kerangka pengujian publik, pernyataan yang adil adalah bahwa satu sisi perbandingan ini terukur dan sisi lainnya tidak.

Biaya: API berbayar sesuai pemakaian versus GPU yang sudah Anda anggarkan

Google mematok harga Gemini 3.5 Transcribe Live per token dan menagih audio sebesar 25 token per detik. Pada tarif Live yang dipublikasikan — $3,50 per 1 juta token audio dan $21 per 1 juta token keluaran teks — satu jam audio gabungan mencapai sekitar $0,54, atau sekitar $9 per 1.000 menit audio, dan model pra-rekaman bahkan lebih murah lagi, sekitar $0,30 per jam. Keheningan hanya gratis jika klien Anda tidak mengalirkannya: koneksi ulang, audio duplikat, dan pencatatan log semuanya menambah token yang terukur pada tagihan sebenarnya.

Checkpoint Microsoft dihargai dalam jam GPU sebagai gantinya. Bobot bf16 saja menghabiskan sekitar 18 GB sebelum adanya cache KV, jalur yang terdokumentasi adalah demo Python di repositori microsoft/VibeVoice dan plugin vLLM yang melayani endpoint yang kompatibel dengan WebSocket dan OpenAI, dan belum ada harga hosted karena belum ada penyedia yang meng-host model tersebut — model ini tidak ada di Azure AI Foundry seperti halnya batch VibeVoice-ASR yang sudah ada sejak Maret. Menghosting sendiri speech-LLM kelas 7B berarti perlu menyiapkan GPU kelas 24 GB dan waktu operasional Anda sendiri; sebagai gantinya, Anda mendapatkan durasi sesi tanpa batas dan bobot yang sepenuhnya menjadi milik Anda. Kedua model tersebut tidak saling eksklusif, dan itulah inti dari bagian terakhir.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Menjaga pilihan tetap murah.

Mana yang Anda pilih bergantung pada apakah Anda memerlukan angka atau kode. Pilih Gemini 3.5 Transcribe Live bila Anda menginginkan transkripsi yang berfungsi saat ini dengan akurasi yang sudah dipublikasikan dan tanpa perlu GPU untuk menjalankannya — dan bila audio Anda tidak terbatas pada sepuluh bahasa, atau Anda siap menyusun pelabelan pembicara sendiri karena endpoint Live tidak menyediakannya. Pilih VibeVoice-ASR-Streaming-7B bila Anda melakukan self-hosting, bila durasi sesi tanpa batas atau output streaming dengan atribusi pembicara yang diklaim tersebut penting, dan bila Anda bersedia menjalankan evaluasi sendiri karena tidak ada tolok ukur yang bisa diandalkan.

Tidak ada pilihan yang perlu bersifat permanen, dan di situlah lapisan perutean menunjukkan tujuannya — untuk model-model di sekitar transkrip, bukan transkripsi itu sendiri. OrcaRouter tidak merutekan speech-to-text saat ini, dan tidak ada satu pun model di halaman ini yang masuk dalam katalognya; yang dilakukannya adalah menyediakan satu API untuk 200+ model bahasa yang mengonsumsi transkrip langsung — perangkum, pengekstrak action-item, perencana agen suara — dengan harga daftar penyedia yang diteruskan tanpa markup, serta failover otomatis antarpenyedia. Pemangkasan harga vendor untuk model apa pun di tumpukan itu berlaku di hari yang sama karena harga daftar diteruskan, bukan dimarkup. Langkah transkripsi tetap berada di tempat Anda menaruhnya; tumpukan yang bekerja pada transkrip justru menjadi lapisan tempat satu kunci dan rute fallback mengubah checkpoint seminggu yang belum di-benchmark dari taruhan menjadi opsi yang bisa diuji.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube