Een hero-titelkaart ter vergelijking van 'VibeVoice-ASR-Streaming-7B versus Gemini 3.5 Transcribe Live', met overline 'Streaming spraak-naar-tekst - september 2026', een ondertitel die aangeeft dat het stille open checkpoint van Microsoft de afgemeten Live API van Google ontmoet, chips 'MIT-gewichten - 2 sep', 'Google API - 26 aug' en 'Geen VibeVoice-WER gepubliceerd', en een voetnoot 'Wat we tot nu toe weten'. Het OrcaRouter-logo is rechtsonder geplaatst.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live: Eén week, twee soorten streaming spraak-naar-tekst

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De laatste week van augustus en de eerste dagen van september 2026 leverden twee streaming spraak-naar-tekstsystemen op die eruitzien als rivalen maar in werkelijkheid verschillende antwoorden zijn op dezelfde vraag. Op 26 augustus bracht Google Gemini 3.5 Transcribe Live in openbare preview uit: een gehost, gesloten spraak-naar-tekst-endpoint dat 0,40 seconde nadat een spreker stopt met praten een afgerond transcript retourneert, ondersteund door een streaming-woordfoutpercentage van 4,0%, gemeten door Artificial Analysis, en compleet lanceermateriaal. Op 2 september uploadde Microsoft Research VibeVoice-ASR-Streaming-7B naar Hugging Face onder de naamruimte microsoft: open gewichten onder MIT-licentie, geen persbericht, geen lanceerpagina en een modelkaart die in leesbare tekst helemaal geen woordfoutpercentage en geen latentiecijfer publiceert. Beide accepteren audio terwijl die nog binnenkomt. Dat is ongeveer het enige wat ze delen.

Het bewijs aan beide kanten is niet symmetrisch, dus deze vergelijking is geschreven als 'wat-we-tot-dusver-weten'. Gemini 3.5 Transcribe Live is een Google-product met gepubliceerde tokenprijzen en metingen van derden; deze zijn hieronder vermeld. VibeVoice-ASR-Streaming-7B is een checkpoint waarvan elke bewering rechtstreeks uit de repository zelf komt: de configbestanden, de modelkaart en Microsofts streamingdocumentatie in de VibeVoice GitHub-repository. Over de Microsoft-kant is nog niets onafhankelijk gebenchmarkt, en dat zeggen we er telkens bij wanneer een cijfer anders de indruk zou wekken dat het bewijs levert.

Het release-spoor: een API-lancering en een stille upload.

Google heeft Gemini 3.5 Transcribe Live op de normale manier uitgebracht. Het model valt onder de Gemini Audio-vlag samen met zijn zustermodel Gemini 3.5 Transcribe (het pad van de vooraf opgenomen Interactions API), de prijzen staan op de modelpagina, en onafhankelijke leaderboards namen de Live-endpoint binnen enkele dagen op — dat is waar de 4,0% streaming-WER en de 0,40 seconde eindvertraging vandaan komen. Er bestaat een gratis laag, met de gebruikelijke kanttekening dat inhoud uit de gratis laag gebruikt kan worden om Google-producten te verbeteren.

Microsofts streamingrelease had geen van die mechanismen. De Hugging Face-repository microsoft/VibeVoice-ASR-Streaming-7B is op 2026-09-02 om 15:46 UTC aangemaakt en werd drie minuten later voor het laatst gewijzigd; deze bevat acht safetensors-shards, een tokenizer en een preprocessorconfiguratie onder een MIT-licentie. De formele vastlegging is een nieuwslogregel van 3 september in de microsoft/VibeVoice-repository, waarin "een uniform streaming-ASR-model dat continu transcribeert wie wat zei terwijl spraak binnenkomt, met ondersteuning voor aangepaste hotwords en 10 talen" wordt aangekondigd, met links naar een demo op aka.ms/vibeasr en een technisch streamingrapport. Toen we een dag na de upload controleerden, vertoonde de checkpoint nog steeds nul downloads en bij geen enkele gehoste inferentieprovider stond hij vermeld. De modelkaart zegt meer dan de aankondiging, en de repository is de bron van bijna alles hieronder.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

De specs, naast elkaar

• Wat het is — VibeVoice-ASR-Streaming-7B: streaming-ASR met open gewichten, zelf gehost vs Gemini 3.5 Transcribe Live: gehoste streaming-API, gesloten gewichten.

Streamingvorm — produceert tekst in blokken van ongeveer 2,9 seconden met ongeveer 0,5 seconden vooruitblik (afgeleid van de checkpointconfiguratie) versus een bidirectionele WebSocket-sessie met continue gedeeltelijke transcripten en een eindresultaat 0,40 seconden nadat de spreker stopt.

Nauwkeurigheid in tekst — geen enkele gepubliceerde WER- of latentiecijfer als tekst versus 4,0% streaming-WER en 2,6% op het vooraf opgenomen model, volgens Artificial Analysis.

• Sprekers — claimt streaming wie-zegt-wat-attributie; niet-geverifieerd of zonder sprekerdiarisatie op het Live-eindpunt (beschikbaar op het vooraf opgenomen model, maximaal drie sprekers).

• Talen — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) versus automatische detectie van 85+ talen met omschakeling midden in een gesprek.

• Sessieduur — alleen beperkt door je GPU en geheugen, versus een harde limiet van 10 minuten per Live-sessie.

• Kosten — $0 voor de gewichten, ongeveer 18 GB aan bf16 om zelf te hosten, vergeleken met ruwweg $0,54 per audio-uur op Live zodra tekstuitvoertokens worden meegeteld.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Wat "streaming" aan elke kant betekent

Het woord verbergt een echt ontwerpverschil, en het is de moeite waard om precies te zijn, omdat de twee systemen niet eens proberen dezelfde cadans te produceren. De preprocessorconfiguratie van Microsoft maakt het VibeVoice-ritme concreet: audio arriveert op 24 kHz en wordt 3.200× gecomprimeerd tot een tokenstroom van ongeveer 7,5 frames per seconde. Vervolgens declareert de configuratie een chunk van 22 frames en een lookahead van 4 frames — ongeveer 2,9 seconden audio per chunk, met ruwweg een halve seconde toekomstige audio om het te verstevigen. Het model produceert tekst één keer per opgeloste chunk, en context van eerdere chunks blijft behouden via de KV-cache, zodat een lange sessie niet vanaf nul hoeft te herberekenen. Het praktische transcript groeit in stappen van ongeveer drie seconden.

Google's Live-endpoint is ontworpen voor een snellere, interactievere cyclus: audio wordt in stukken van 16 of 24 kHz PCM via een WebSocket gestreamd, gedeeltelijke transcripties komen continu terug terwijl de spreker bezig is, en een definitief opgemaakt transcript verschijnt 0,40 seconden na het einde van de spraak — dat getal is de meting van Artificial Analysis, aangehaald door Google. De compromissen zijn de sessielimiet (tien minuten audio, waarna je applicatie opnieuw moet verbinden en samenvoegen), en de ontbrekende extra's: geen sprekerdiarisatie en geen timestamps op woordniveau op het Live-pad, die beide wel bestaan bij de vooraf opgenomen Gemini 3.5 Transcribe. Dus de eerlijke samenvatting is dat Google's streamingmodel sneller is per uiting, terwijl Microsoft's streamingcontrolepunt langzamer is per stuk, maar wel de sprekerattributie claimt die Google's live-route laat vallen, bij een sessielengte die Google niet aanbiedt.

Nauwkeurigheid: gemeten ten opzichte van een lege ruimte.

Het grootste verschil in deze vergelijking is een verschil in bewijs, niet noodzakelijkerwijs in kwaliteit. Artificial Analysis mat voor Gemini 3.5 Transcribe Live een gemiddeld woordfoutpercentage van 4,0% bij streaming en 2,6% bij het niet-streaming model; dat laatste stond bij de lancering op de vijfde plaats van hun WER-ranglijst. Google noemt afzonderlijk 5,50% streaming en 5,04% niet-streaming op de meertalige FLEURS-set. Lees die cijfers zoals ze gelabeld zijn: Artificial Analysis is onafhankelijk van Google, maar het zijn voorlopige cijfers van een API die pas één dag oud is, en de streamingpremie ten opzichte van het batchmodel — 4,0% versus 2,6% — is de gebruikelijke prijs van realtime levering.

VibeVoice-ASR-Streaming-7B heeft nergens een vergelijkbaar cijfer. De modelkaart levert een evaluatiefiguur als afbeelding, en het technische rapport van Microsoft is een pdf, maar geen van beide biedt een streaming-WER- of latentiewaarde in platte tekst die geciteerd of onafhankelijk gecontroleerd kan worden. Het enige numerieke anker in de hele familie is de modelkaart van de batch-VibeVoice-ASR, die een door de leverancier uitgevoerd gemiddelde van 7,77% WER over acht Engelse testsets en 2,20% op LibriSpeech clean rapporteert — cijfers voor het niet-streamingmodel, niet voor dit model, en streamingmodellen ruilen doorgaans wat nauwkeurigheid in voor de lagere latentie. Totdat iemand de streaming-checkpoint door een publieke testomgeving laat draaien, is de eerlijke stelling dat de ene kant van deze vergelijking gemeten is en de andere niet.

Kosten: een API op basis van verbruik versus een GPU die je al in je budget had opgenomen

Google rekent Gemini 3.5 Transcribe Live af per token en factureert audio tegen 25 tokens per seconde. Op basis van de gepubliceerde Live-tarieven — $3,50 per 1M audio-tokens en $21 per 1M tekstuitvoer-tokens — kost een gemengd audio-uur ongeveer $0,54, oftewel zo'n $9 per 1.000 audio-minuten. Het vooraf opgenomen model is nog goedkoper, met ongeveer $0,30 per uur. Stilte is alleen gratis als uw client deze niet streamt: herverbindingen, gedupliceerde audio en logging voegen allemaal gemeten tokens toe aan de werkelijke factuur.

Microsofts checkpoint wordt in plaats daarvan in GPU-uren geprijsd. De bf16-gewichten alleen al nemen ongeveer 18 GB in beslag, nog vóór enige KV-cache; de gedocumenteerde paden zijn de Python-demo's in de microsoft/VibeVoice-repository en een vLLM-plugin die WebSocket- en OpenAI-compatibele endpoints bedient, en er is geen gehoste prijs omdat nog geen enkele provider het model host — het staat niet op Azure AI Foundry zoals de batch-VibeVoice-ASR daar sinds maart al beschikbaar is. Zelf hosten van een spraak-LLM van de 7B-klasse betekent dat je een GPU van de 24 GB-klasse en je eigen beheertijd moet begroten; in ruil daarvoor krijg je onbeperkte sessieduur en gewichten die je zelf houdt. De twee modellen sluiten elkaar niet uit — dat is precies het punt van het laatste deel.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

De keuze goedkoop houden

Welke je kiest hangt af van of je een nummer of code nodig hebt. Kies Gemini 3.5 Transcribe Live wanneer je transcriptie wilt die vandaag werkt met gepubliceerde nauwkeurigheid en geen GPU nodig heeft om te draaien — en wanneer je audio niet beperkt is tot tien talen, of je bereid bent om zelf sprekerlabeling te bouwen, omdat de Live-endpoint dit niet biedt. Kies VibeVoice-ASR-Streaming-7B wanneer je zelf host, wanneer een onbeperkte sessielengte of de geclaimde streaminguitvoer met sprekerattributie belangrijk is, en wanneer je bereid bent om je eigen evaluatiegate te draaien, omdat er geen benchmark is om op te leunen.

Geen van beide keuzes hoeft permanent te zijn, en dat is waar een routeringslaag zijn nut bewijst — voor de modellen rondom het transcript, niet voor de transcriptie zelf. OrcaRouter routeert vandaag de dag geen spraak-naar-tekst en geen van de modellen op deze pagina staat in zijn catalogus; wat het doet, is één API bieden aan de 200+ taalmodellen die een live transcript verbruiken — de samenvatter, de actiepuntenextractor, de planner van de voice-agent — tegen doorgegeven lijstprijzen van providers, zonder opslag, met automatische failover tussen providers. Een prijsverlaging van een leverancier op welk model in die stack dan ook gaat dezelfde dag in, omdat lijstprijzen worden doorgegeven in plaats van verhoogd met opslag. De transcriptiestap blijft waar je hem plaatst; de stack die op het transcript werkt, is precies de laag waar één sleutel en een fallback-route een een week oud, niet-gebenchmarkt checkpoint van een gok in een testbare optie veranderen.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube