
VibeVoice-ASR-Streaming-1.5B versus Gemini 3.5 Transcribe: Microsofts stille streaming-ASR tegenover Googles nieuwe API
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Zeven dagen en één filosofische kloof scheiden de twee nieuwste streaming-spraak-naar-tekstsystemen. Op 26 augustus 2026 bracht Google Gemini 3.5 Transcribe in publieke preview uit: een gehoste, gesloten spraak-naar-tekst-API met een prijs per audiotoken en een apart Live-eindpunt voor realtimesessies. Op 2 september 2026 uploadde Microsoft Research VibeVoice-ASR-Streaming-1.5B naar Hugging Face onder de microsoft-naamruimte — MIT-gelicenseerde gewichten, geen persbericht, geen lanceringspost en op dit moment nergens berichtgeving door derden. Beide transcriberen spraak terwijl die nog binnenkomt. Vrijwel al het andere eraan — wie ze mag draaien, wat ze kosten, welk bewijs er bestaat dat ze werken — is anders.
Deze pagina vergelijkt de twee zoals ze vandaag de dag daadwerkelijk bestaan, wat betekent dat de twee kanten van het bewijs niet symmetrisch zijn. Gemini 3.5 Transcribe is een live Google-product met gepubliceerde tokenprijzen en nauwkeurigheidscijfers van derden van Artificial Analysis; dat zijn de cijfers die hieronder met AA worden aangeduid. VibeVoice-ASR-Streaming-1.5B is een checkpoint waarvan de modelkaart noch een word-error-rate noch een latentiecijfer in tekstvorm vermeldt — de evaluatie in de kaart is een afbeelding, en tot dusver is de enige aankondiging van de streamingfamilie een nieuwsregel gedateerd 3 september in de VibeVoice GitHub-repository van Microsoft. Alles aan de Microsoft-kant hieronder is wat er uit de repository te weten valt: de configuratiebestanden, de modelkaart en de eigen streamingdocumentatie van Microsoft. Nog niets daarvan is onafhankelijk gebenchmarkt.
De twee modellen in één oogopslag
• Wat het is — VibeVoice-ASR-Streaming-1.5B: open checkpoint, MIT-licentie, zelf gehost versus Gemini 3.5 Transcribe: gehoste API, gesloten gewichten.
• Release — gewichten op 2 september 2026, nieuwsregel in de repo op 3 september vs openbare preview op 26 augustus 2026 met volledig lanceringsmateriaal.
• Streamingvorm — produceert tekst in brokken van ongeveer 2,9 seconden met een vooruitblik van ~0,5 s; de sessiestatus wordt bijgehouden in een prefix-cache vs. WebSocket Live-sessie die per audiotoken wordt gefactureerd, met een maximum van 10 minuten audio per sessie.
• Nauwkeurigheid in drukwerk — geen WER- of latentiecijfer als tekst gepubliceerd versus AA-gemeten 2,6% WER op het vooraf opgenomen eindpunt en 4,0% op het Live-eindpunt.
• Sprekeruitvoer — claimt streaming-attributie van wie wat zei (niet geverifieerd) versus geen sprekerdiarisatie en geen tijdstempels op woordniveau op het Live-eindpunt.
• Hotwords — ondersteund, via dezelfde contextprompt als de batch VibeVoice-ASR, maar geen vermelde functie van het Live-endpoint.
• Kosten — $0 voor de gewichten, ~5,6 GB om zelf te hosten, vergeleken met ongeveer $0,30 per audiouur (blended) op het vooraf opgenomen endpoint en ~$0,54 op Live, volgens de door Google vermelde tokenprijzen.

Een gehoste API en een stille upload, zeven dagen uit elkaar
Gemini 3.5 Transcribe is Google's transcriptiemodel dat als vervanging kan dienen, en het wordt geleverd als twee producten. Het vooraf opgenomen eindpunt, dat via de Interactions API wordt aangeboden, neemt een volledig audiobestand en retourneert een transcript met de verwachte extra's. Het Live-eindpunt, gemini-3.5-transcribe-live, draait over een bidirectionele WebSocket en is degene die met VibeVoice-ASR-Streaming-1.5B concurreert wat betreft de vorm van de taak: een sessie transcriberen terwijl deze plaatsvindt. Google kondigde het aan met de gebruikelijke opzet — een public-preview-lancering op 26 augustus, prijzen op de modelpagina, en third-party leaderboards die het binnen enkele dagen oppakten.
De streaming-release van Microsoft had daar niets van. Op 2 september maakte het microsoft Hugging Face-account twee checkpoints aan in dezelfde minuut: VibeVoice-ASR-Streaming-7B en VibeVoice-ASR-Streaming-1.5B. De modeltabel van de GitHub-repository vermeldt VibeVoice-ASR-Streaming nu als onderdeel van de familie, en de News-sectie bevat de regel van 3 september waarin "een uniform streaming-ASR-model dat continu transcribeert wie er wat zegt terwijl spraak binnenkomt, met ondersteuning voor gepersonaliseerde hotwords en 10 talen" wordt aangekondigd — maar die aankondiging noemt de 7B, en de 1.5B is het kleinere broertje dat zonder vermelding mee uitkwam. Toen we een dag na de upload controleerden, vertoonden beide checkpoints nog steeds nul downloads.

Wat "streaming" aan elke kant betekent
Het woord streaming verbergt een wezenlijk ontwerpverschil. De preprocessorconfiguratie van Microsoft maakt het VibeVoice-tempo concreet: audio arriveert op 24 kHz en wordt 3200× gecomprimeerd tot een stroom van spraaktokens van circa 7,5 Hz (één token per ~133 ms). De configuratie declareert vervolgens een chunk van 22 frames en een lookahead van 4 frames — ongeveer 2,9 seconden audio per chunk, met ruwweg een halve seconde toekomstige audio om het huidige segment te bevestigen. Het model genereert tekst één keer per opgeloste chunk, en de Microsoft-documentatie merkt op dat context uit eerdere chunks behouden blijft via de KV-cache, zodat een lange sessie niet vanaf nul opnieuw berekent. De rekenkunde staat in de configuratie; het praktische gevolg is een transcript dat groeit in stappen van ongeveer drie seconden, niet in losse woordfragmenten.
De Live-endpoint van Google is een andere streamingvorm: een bidirectionele WebSocket-sessie waarin audio wordt gefactureerd tegen 25 audiotokens per seconde, ontworpen voor interactief gebruik, maar met een maximum van 10 minuten audio per sessie en — specifiek op de Live-endpoint — zonder sprekerdiarisatie of tijdstempels op woordniveau. Voor wie de twee als live-transcriptiemotoren vergelijkt, zijn de verschillen die ertoe doen: de sessielimiet (10 minuten aan de kant van Google Live, aan de kant van Microsoft alleen begrensd door je eigen GPU en geheugen), de uitvoercadans (chunks van ~3 seconden versus wat de WebSocket-sessie dan ook levert) en de extra uitvoeropties (sprekerattributie en hotwords die op de Microsoft-kaart worden geclaimd, maar ontbreken in de functielijst van Google Live).
Nauwkeurigheid: de ene kant heeft cijfers, de andere kant heeft een afbeelding.
Dit is het grootste verschil in de vergelijking, en het is een verschil in bewijs, niet noodzakelijkerwijs in kwaliteit. Artificial Analysis meet Gemini 3.5 Transcribe met een woordfoutpercentage van 2,6% op het vooraf opgenomen eindpunt en 4,0% op het Live-eindpunt — de meerprijs die u betaalt voor realtime levering komt tot uiting in het foutpercentage, wat een veelvoorkomende en eerlijke afweging is voor streamingsystemen. Dat zijn cijfers van derden op een neutraal leaderboard, gepubliceerd enkele dagen na de lancering.
VibeVoice-ASR-Streaming-1.5B heeft nergens een vergelijkbaar cijfer. De modelkaart bevat een evaluatieresultaat als afbeelding, maar geen numerieke WER, RTF of latentie in proza — niets om te citeren en niets dat onafhankelijk controleerbaar is. Microsoft heeft voor zowel de 7B als de 1.5B geen streaming-nauwkeurigheidscijfers in tekst opgenomen. Het enige numerieke anker in de hele familie is de batch-VibeVoice-ASR-modelkaart, die een door de leverancier uitgevoerd gemiddelde van 7,77% WER over acht Engelse testsets en 2,20% op LibriSpeech clean rapporteert — maar dat beschrijft het niet-streamingmodel, en streamingmodellen ruilen doorgaans wat nauwkeurigheid in voor de winst in latentie. Totdat iemand de streaming-checkpoint door een openbare testomgeving laat draaien, is de eerlijke conclusie dat Google's model gemeten is en dat van Microsoft niet.
Kosten: per audio-uur versus per GPU-uur
Google verkoopt Gemini 3.5 Transcribe per token, en de prijzen zijn helder verdeeld over de twee endpoints. Het endpoint voor vooraf opgenomen audio vermeldt $2 per 1M audio-inputtokens en $12 per 1M tekst-outputtokens, wat neerkomt op een gemiddelde van ruwweg $0,30 per audio-uur. Het Live-endpoint vermeldt $3,50 per 1M audiotokens en $21 per 1M teksttokens — ongeveer $0,54 per audio-uur gemiddeld, oftewel circa 80% meer dan vooraf opgenomen, wat de prijs is voor realtime levering. Google factureert audio met 25 tokens per seconde, dus stilte is alleen gratis als je client het niet streamt; herverbindingen, gedupliceerde audio en logging kunnen de uiteindelijke rekening allemaal verhogen. Er is een gratis laag, met de kanttekening dat content uit de gratis laag gebruikt mag worden om Google-producten te verbeteren.

Microsofts model wordt in plaats daarvan geprijsd op basis van GPU-uren. De 1.5B-checkpoint beslaat ongeveer 5,6 GB aan bf16-gewichten (een Qwen-taal-backbone van de 1.5B-klasse plus de audio-tokenizers en de diffusion-head — volgens de safetensors-metadata gaat het in totaal om ongeveer 3 miljard parameters), en de gedocumenteerde paden om het uit te voeren zijn zelf gehost: de Python-demo's in de repository microsoft/VibeVoice, of de vLLM-plugin die Microsoft beschrijft voor het bedienen van OpenAI-compatibele en WebSocket-endpoints. Er is nog geen gehoste prijs, omdat nog geen enkele inferentieprovider het model in zijn catalogus heeft opgenomen. De kostenkwestie is volledig de vraag of je eigen GPU-tijd goedkoper is dan het uurtarief van Google, wat bij elk aanhoudend transcriptievolume vrijwel zeker het geval is — en de licentie-kwestie staat los van de kostenkwestie, omdat MIT-gewichten blijvend van jou zijn, op een manier waarop geen enkel API-abonnement dat is.
De twee sluiten elkaar niet uit in een productiestack. Het pragmatische patroon voor een team dat vandaag live transcriptie nodig heeft, is om de ASR-laag achter één endpoint te houden, zodat de keuze omkeerbaar blijft: een routing-API die 200+ modellen ontsluit tegen de lijstprijzen van de providers — zonder opslag, dus een prijswijziging van een provider is dezelfde dag live — met automatische failover, is precies de laag waarmee je de measured API van Google als standaard kunt draaien terwijl een deel van het echte verkeer VibeVoice-ASR-Streaming-1.5B test zodra een provider het host. Dat is het model van OrcaRouter, en het is de manier met een laag risico om een checkpoint te adopteren waarvan de nauwkeurigheid nog door niemand is geverifieerd.
Wie moet welke kiezen
Kies Gemini 3.5 Transcribe als je een transcriptie-API wilt die vandaag werkt, met gepubliceerde nauwkeurigheid, voorspelbare prijzen per uur en geen GPU om in de gaten te houden — en vooral als je audio niet binnen de tien talen valt die Microsoft noemt, of als je de diarisatie en woordniveau-tijdstempels van het vooraf opgenomen eindpunt nodig hebt voor bestandstranscriptie. De limiet van 10 minuten voor Live-sessies is een echte beperking om tegen je use case te testen voordat je je eraan committeert voor live sessies.
Kies VibeVoice-ASR-Streaming-1.5B als je zelf host, als je de gewichten en de gegevenscontrole wilt die MIT biedt, als je een onbeperkte sessielengte nodig hebt, of als je specifiek de wie-zegt-wat-streaminguitvoer en hotwords wilt evalueren. Reken op een installatie vanuit de broncode, op ~5,6 GB aan gewichten voor een NVIDIA-GPU en op je eigen evaluatiemoment — er is geen benchmark om op te leunen, dus de vraag over nauwkeurigheid moet je met je eigen audio beantwoorden.
Het oordeel na één week: Google leverde het afgewogen product en Microsoft de interessante gok. Gemini 3.5 Transcribe is de veiligere standaardkeuze, met cijfers van derden ter onderbouwing; VibeVoice-ASR-Streaming-1.5B is het open, zelf-hostbare en volledig ongeverifieerde alternatief. Wat de keuze goedkoop maakt, is dat ze niet permanent hoeft te zijn — houd het ASR-eindpunt verwisselbaar, en een checkpoint dat zonder één enkele benchmark wordt uitgebracht, kan je verkeer verdienen of verliezen op basis van je eigen transcripten.
