Een heldentitelkaart die 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo' vergelijkt, bovenregel 'Open-weights ASR - sept 2026', een ondertitel die leest: Microsofts streaming-checkpoint ontmoet de open-weights-standaard - wat streaming toevoegt, en wat 0,8B vs 9B parameters kost, chips 'MIT-weights - 2 sep', 'MIT-weights - 2024' en 'Whisper: 99 talen', en een voetnoot 'Whisper's record is openbaar'. Het OrcaRouter-logo is rechtsonder gecomponeerd.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs. Whisper Large v3 Turbo: wat het streaming-checkpoint van Microsoft toevoegt aan de open-weight-standaard

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Gedurende het grootste deel van de afgelopen twee jaar was het antwoord op "zelf transcriberen, goedkoop" Whisper Large v3 Turbo — OpenAI's model met open gewichten van 809 miljoen parameters, MIT-gelicentieerd, 99 talen, klein genoeg om op een werkstation te draaien, en gratis zodra je de hardware bezit. Op 2 september 2026 plaatste Microsoft Research een uitdager tegen die standaardkeuze: VibeVoice-ASR-Streaming-7B, een MIT-gelicentieerde streaming-checkpoint op Hugging Face die transcribeert terwijl audio binnenkomt, output met sprekerattributie claimt, en — anders dan het model dat de meeste teams al draaien — nooit is ontworpen als batchtaak. Beide modellen zijn open-weights van grote labs. Vrijwel al het andere eraan is een afweging, en deze pagina gaat over welke afweging jij werkelijk maakt.

Eén asymmetrie bepaalt de hele vergelijking, dus die komt eerst. Whisper Large v3 Turbo is het meest onafhankelijk gereproduceerde spraakmodel ter wereld: de woordfoutcijfers zijn jarenlang door duizenden teams opnieuw gedraaid op openbare benchmarks en hun eigen audio, en de zwakke punten zijn even goed gedocumenteerd als de sterke. VibeVoice-ASR-Streaming-7B is één dag oud, heeft nergens een onafhankelijke benchmark, en Microsoft heeft geen streaming-woordfoutpercentage in leesbare tekst gepubliceerd. Alles aan de Microsoft-kant hieronder is afkomstig uit de repository — config, modelkaart en Microsofts streamingdocumentatie — en wordt ook als zodanig gelabeld.

De open-weights standaard, en waarom deze standhoudt

Whisper Large v3 Turbo is het gedistilleerde zustermodel van Whisper Large v3: het behoudt de encoder met 32 lagen en reduceert de decoder van 32 naar vier lagen, waardoor het aantal parameters zakt naar 809M en de doorvoer op een GPU ruwweg verviervoudigt, terwijl de nauwkeurigheid dicht bij het origineel blijft. Omdat de gewichten onder de MIT-licentie vallen en het model klein is, is het de standaard ingebedde transcriptiemotor geworden voor meetingbots, ondertiteltools en pijplijnen voor call-logging. De beperkingen ervan zijn eveneens algemeen bekend. Het is een batchmodel — het neemt een audiobestand als invoer en retourneert een transcript, in plaats van woorden te produceren terwijl ze worden uitgesproken. Het is niet getraind voor vertaling, en op die taak presteert het aanzienlijk slechter. Bij spraak met ruis, een accent of overlappende sprekers is de nauwkeurigheid wisselend, en het levert platte tekst op: standaard geen interpunctie of hoofdletters, geen sprekersdiarisatie, geen tijdstempels in deze variant en geen trefwoordbias. Productiestacks die op Whisper zijn gebouwd, voegen die onderdelen afzonderlijk toe; elk onderdeel brengt zijn eigen latentie en faalmodi met zich mee.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

De spec-kloof

• Parameters — 809M (gedistilleerde decoder) versus ongeveer 9B totaal (een Qwen2-7B-taalmodel als backbone plus spraak-encoders; de "7B" heeft betrekking op het LLM, de Hugging Face-pagina vermeldt 9B).

• Licentie — MIT, open weights, beide.

• Streaming — batchgewijs ontworpen: zelfgehoste streamingimplementaties hebben doorgaans 1–5 seconden latentie versus streaming-native: chunks van ~2,9 seconden met ~0,5 seconde lookahead, tekst die per chunk wordt aangeleverd en context die in een KV-cache behouden blijft.

• Talen — 99 met jarenlange community-reproductie tegenover een aangegeven 10 (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Naast het transcript — standaard geen, versus geclaimde streaming 'wie-zegt-wat'-uitvoer en aangepaste hotwords (niet geverifieerd).

• Nauwkeurigheid op papier — 2,1% WER op LibriSpeech test-clean, 4,2% op test-other, ~7,7% op de Open ASR-composite, 8–12% op audio met ruis in communitytests; allemaal onafhankelijk gereproduceerd, versus geen enkel streaming-WER-cijfer dat als tekst is gepubliceerd.

• Voetafdruk — draait op een laptop of één bescheiden GPU, tegenover ruwweg 18 GB aan bf16-gewichten vóór de KV-cache; begroot een GPU uit de 24 GB-klasse.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): parameters - about 9B (Qwen2-7B + encoders); streaming - native, ~2.9 s chunks; WER in print - none in text; output extras - claimed speaker IDs + hotwords; languages - 10 declared; hardware - ~18 GB bf16, 24 GB-class GPU. Right column Whisper Large v3 Turbo (open weights, released 2024): 809M distilled; batch, 1-5 s self-host streaming; 2.1% / 4.2% LibriSpeech, ~7.7% Open ASR; none by default; 99; laptop to small GPU. Footer: 'Whisper WER independently reproduced. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Wat streaming daadwerkelijk toevoegt

De reden om überhaupt verder te kijken dan Whisper Large v3 Turbo is de live-baan, en dit is waar de twee modellen niet meer vergelijkbaar zijn. Whisper is batchgeoriënteerd: om woorden te krijgen terwijl een spreker nog aan het woord is, knopen teams chunking, spraakactiviteitsdetectie en lijmcode aan elkaar, en zelfgehoste streamingimplementaties komen doorgaans uit op één tot vijf seconden latentie — waarmee de sub-secondedrempel voor telefoonagents en live-ondertiteling buiten bereik blijft zonder serieuze engineering. VibeVoice-ASR-Streaming-7B is voor die baan gebouwd. De config laat zien dat audio 3.200× wordt gecomprimeerd tot een tokenstroom van 7,5 frames per seconde, verwerkt in chunks van 22 frames met een vooruitblik van vier frames — ongeveer 2,9 seconden audio per chunk — waarbij tekst wordt afgegeven zodra elke chunk gereed is en eerdere context wordt meegedragen in de KV-cache, zodat een sessie niet vanaf nul opnieuw hoeft te rekenen. Dat ritme is een ontwerp dat uit de config is afgeleid, geen gemeten latentie, en niemand heeft er nog een end-to-endcijfer voor gepubliceerd; maar de architectuur is onmiskenbaar een live-transcriptiearchitectuur op een manier waarop Whisper dat niet is.

Whisper's trackrecord is lang en openbaar; dat van het nieuwe checkpoint is leeg.

Nauwkeurigheid is waar de leeftijd van Whisper Large v3 Turbo een voordeel is. De 2,1% WER op LibriSpeech test-clean en 4,2% op test-other zijn open-weights cijfers die door talloze teams zijn gereproduceerd; de ruwweg 7,7% op de Open ASR leaderboard-samenstelling ligt ongeveer een punt achter de volledige Large v3; en de gedocumenteerde 8–12% op ruisende audio in communitytests betekent dat niemand erdoor verrast wordt. Die zwakheden maken deel uit van het trackrecord — ze vertellen je precies waar het model hulp nodig heeft voordat je erop voortbouwt.

VibeVoice-ASR-Streaming-7B heeft geen dergelijke staat van dienst. Zijn modelkaart bevat een evaluatiefiguur als afbeelding en Microsofts technische rapport over streaming is een pdf, maar in proza is geen citeerbaar woordfoutpercentage voor streaming te vinden. Het enige cijfermatige ankerpunt in de familie is de door de leverancier gerapporteerde tabel van de batch-VibeVoice-ASR-kaart — 7,77% gemiddelde WER over acht Engelse testsets en 2,20% op LibriSpeech clean — wat niet het getal van dit checkpoint is, en de ontvangst van het batchmodel zelf in de community is gemengd: geprezen om de out-of-the-box-diarisatie, bekritiseerd als zwaar en af en toe hallucinatiegevoelig. Niets daarvan is overdraagbaar op het streamingmodel, en dat is precies het punt: met Whisper ken je de faalmodi van tevoren; met VibeVoice-ASR-Streaming-7B ben jij de eerste tester.

Talen en voetafdruk: 99 tegen 10, 0,8B tegen 9B

De twee meest concrete kosten van de overstap zijn talen en grootte. Whisper Large v3 Turbo transcribeert 99 talen; low-resource- en tonale talen presteren minder goed — Thai, Kantonees en Welsh worden vaak genoemd als zwakke punten — maar die lijst heeft jarenlange reproductie door de community achter zich. VibeVoice-ASR-Streaming-7B noemt er tien: Engels, Chinees, Spaans, Portugees, Duits, Japans, Koreaans, Frans, Russisch en Italiaans. Als je verkeer binnen die tien valt, is dekking geen probleem; zo niet, dan eindigt de vergelijking hier. Grootte is de tweede kostenpost: een model met 809M parameters draait op een laptop, terwijl zo'n 9B totale parameters in bf16 ruwweg 18 GB aan gewichten betekent vóór de KV-cache en een GPU uit de 24GB-klasse vereist om het comfortabel te kunnen draaien. Voor teams die Whisper al op bescheiden hardware draaien, is dat een flinke stap omhoog in infrastructuur, alleen te rechtvaardigen door een daadwerkelijke vereiste voor live-transcriptie.

Wanneer gratis niet het punt is

Whisper Large v3 Turbo is free to run; the cost is the hardware and the engineering around it. A faster-whisper deployment on a single T4 runs on the order of $0.05–$0.10 per hour of audio at the GPU's going rate, and a sustained workload adds the diarization and punctuation stack you have to build because Whisper returns plain text. VibeVoice-ASR-Streaming-7B is also free to run, on more expensive hardware, in exchange for a streaming architecture that claims the speaker attribution and context controls Whisper lacks — claims you would be verifying yourself, since no independent benchmark exists. For batch transcription at volume, Whisper's throughput and tiny footprint still win. For live, multi-speaker audio where the transcript must arrive during the conversation, Whisper is working against its design and the streaming checkpoint is working with it — if it works at all, which is exactly the question to answer with your own audio on your own GPU.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

De pragmatische stack

Het meest voorkomende antwoord in de praktijk is niet "of/of" maar "en/en", en dat is hier de aanbeveling: houd Whisper Large v3 Turbo als het hogevolume-batchkanaal, waar zijn staat van dienst en voetafdruk hem onverslaanbaar maken, en evalueer VibeVoice-ASR-Streaming-7B op het livekanaal dat Whisper niet kan bedienen met de vereiste latentie — met een expliciete evaluatie-gate, want er is geen benchmark om op terug te vallen. Beide kunnen één GPU-budget en één codebase delen. Waar een routeringslaag in die stack zijn geld waard is, is de laag boven de transcripten, niet de transcriptie zelf: OrcaRouter routeert vandaag geen spraak-naar-tekst en geen van beide modellen staat in zijn catalogus, maar de samenvatters, alarmregels en agentplanners die een live transcript verbruiken, zijn precies de 200+ taalmodellen die het met één API ontsluit, tegen de lijstprijzen van providers, doorgegeven zonder opslag, en met automatische failover tussen providers. Een streaming-checkpoint dat zonder één enkele benchmark wordt uitgebracht, verdient dezelfde behandeling als elk onbewezen model — een deel van het echte verkeer achter een fallback, dat uw vertrouwen wint of verliest op basis van het bewijs uit uw eigen vergaderingen in plaats van op een modelkaart.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube