Een gegenereerde hero-titelkaart voor 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: native streaming tegen het werkpaard voor 99 talen', met als ondertitel 'Native streaming tegen het werkpaard voor 99 talen', met twee modelkaarten — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 september 2026 · MIT · streaming-native · 10 talen) en Whisper Large v3 Turbo (OpenAI · oktober 2024 · MIT · batchgewijs · 99 talen) — en met de tags '~2,9 s chunks + ~0,5 s lookahead', '7M+ downloads per maand (Whisper)' en 'Nog geen benchmark gepubliceerd'. Het OrcaRouter-logo is rechtsonder in de hoek gecomponeerd.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: native streaming tegen het werkpaard voor 99 talen

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

There is a good chance the speech-to-text model you run today is Whisper Large v3 Turbo, and there is a new model asking whether it should be. OpenAI's Whisper Large v3 Turbo — the distilled 809M-parameter checkpoint released in October 2024 — is the open-weights workhorse: 99 languages, roughly four to eight times faster than the original large-v3, small enough for a laptop, MIT-licensed, and backed by the largest transcription ecosystem in existence. VibeVoice-ASR-Streaming-1.5B, uploaded by Microsoft Research on September 2, 2026, is the challenger built for the one thing Whisper does not do natively: stream. It transcribes in chunks as audio arrives rather than swallowing fixed windows, it claims speaker-attributed output, and it has ten languages and no published benchmark to its name.

Die laatste clausule is de reden waarom deze pagina is opgebouwd rond een migratievraag in plaats van een onderlinge vergelijking. De cijfers van Whisper Large v3 Turbo zijn gemeten en openbaar — LibriSpeech, de samengestelde Open ASR-score, Common Voice — terwijl de modelkaart van VibeVoice-ASR-Streaming-1.5B geen WER- of latentiecijfer in de tekst vermeldt en er op het moment van schrijven geen onafhankelijke benchmark bestaat. Alles hieronder over de Microsoft-kant is wat er uit de repository te weten valt: de configbestanden, de modelkaart en Microsofts streamingdocumentatie. Alles over de Whisper-kant is een vaststaand publiek gegeven. De twee zijn niet rechtstreeks tegen elkaar getest; de vergelijking is er een tussen wat bewezen is en wat beloofd wordt.

Het model dat je waarschijnlijk al draait

Whisper Large v3 Turbo heeft zijn plek op weinig glamoureuze wijze verdiend: het is snel, compact, meertalig en saai op de manieren waar productieteams van houden. Door destillatie is het teruggebracht van de Whisper large-v3 met 1,55B parameters naar 809M parameters, en het behoudt daarbij de ondersteuning voor 99 talen en ruwweg 95% van de nauwkeurigheid van large-v3 — ongeveer 2,1% WER op LibriSpeech clean, rond 7,7–7,8% op de samengestelde Open ASR-score, met de grootste kwaliteitsvermindering bij laag-resource talen en tonale talen — terwijl het meerdere malen sneller draait en met FP16 in ongeveer 1,6 GB VRAM past. Het is onder de MIT-licentie uitgebracht en draait via faster-whisper, whisper.cpp en drie jaar aan integraties; de Hugging Face-pagina toont meer dan zeven miljoen downloads in één maand. Als je zelf transcriptie host, is dit zeer waarschijnlijk het model dat dat doet.

Wat Whisper Large v3 Turbo niet is — en nooit heeft beweerd te zijn — is een streamingmodel. Het verwerkt audio in vaste vensters van 30 seconden en levert per venster een transcript op; het heeft geen ingebouwde voice-activitydetectie, geen endpointing, geen sprekersdiarisatie en geen hotword-mechanisme. Live-transcriptie met Whisper is altijd een retrofit die je zelf bouwt — en de retrofit is precies waar de latentie en de engineeringkosten liggen.

Wat verandert er eigenlijk als je overstapt

• Latentiemodel — VibeVoice-ASR-Streaming-1.5B produceert tekst één keer per definitief chunk van ongeveer 2,9 seconden, met ~0,5 s vooruitblik, bewust in contrast met Whisper Large v3 Turbo: een batchmodel met een venster van 30 seconden dat een chunking- en stitchinglaag nodig heeft om live-uitvoer te benaderen.

• Sessievorm — onbegrensde livesessies, waarbij context via een prefix-cache over chunks wordt meegenomen, versus discrete vensters van 30 seconden zonder conversatiestatus tussen de vensters.

• Talen — tien (Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch, Spaans) vs 99.

• Nauwkeurigheid in print — niet gepubliceerd vs ~2,1% LibriSpeech clean, ~7,7–7,8% Open ASR composite, allemaal gemeten en openbaar.

Uitvoer-extra's — beweert streaming sprekerattributie en hotwords te leveren, maar er zijn alleen woordtijdstempels beschikbaar: geen diarisatie en geen native hotwords.

• Hardware — ~5,6 GB aan bf16-gewichten op een NVIDIA-GPU, installatie vanaf de bron versus ~1,6 GB FP16, draait op laptops en CPU's via whisper.cpp en faster-whisper.

• Licentie — MIT, beide.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Het streaming-retrofitprobleem

De eerlijke manier om naar deze vergelijking te kijken is dat Whisper Large v3 Turbo een streamingprobleem heeft waarvoor je al hebt betaald of nog steeds betaalt. Een livepijplijn voor Whisper betekent een spraakactiviteitsdetector om spraak te vinden, een chunker om audio in vensters van Whisper-formaat te snijden, overlappende vensters zodat woorden niet verloren gaan bij de grenzen, en een stitcher om de gedeeltelijke transcripties samen te voegen. Community-implementaties van die stack komen uit op ruwweg één tot vijf seconden end-to-endlatentie — werkbaar voor vergadernotities, maar onvoldoende voor de norm voor telefoonagenten en live ondertiteling.

VibeVoice-ASR-Streaming-1.5B maakt de retrofit overbodig door zijn constructie. Zijn preprocessorconfiguratie legt een chunk van 22 frames en een lookahead van 4 frames vast op een spraak-tokenstroom van ~7,5 Hz — ongeveer 2,9 seconden audio per gegenereerd segment, een halve seconde aan toekomstcontext — en de documentatie van Microsoft beschrijft dat context van eerdere chunks via de KV-cache behouden blijft, dus een livesessie hoeft niet vanaf nul te herberekenen. Maar lees het woord "streaming" goed aan beide kanten van deze vergelijking: geen van beide modellen is een engine voor per-woord-partials van het soort dat de commerciële API's met de laagste latentie verkopen. Het transcript van VibeVoice groeit door zijn ontwerp in stappen van ruwweg drie seconden; dat is voor vergaderingen een ander en doorgaans aanvaardbaar ritme, maar subseconde is dat niet. En als je vereiste is dat woorden binnen een seconde op het scherm verschijnen, moet je deze chunkgeometrie tegen dat budget afmeten voordat je erop bouwt.

Nauwkeurigheid: wat je opgeeft om over te schakelen naar native streaming

Hier is het hiaat dat de beslissing zou moeten sturen. Whisper Large v3 Turbo heeft een openbaar nauwkeurigheidsdossier dat u kunt controleren — en wanneer de opname binnen de 99 talen valt, is dat dossier sterk. VibeVoice-ASR-Streaming-1.5B beschikt niet over een dergelijk dossier: de evaluatie op de modelkaart is een afbeelding, Microsoft heeft geen streaming-WER in tekstvorm gepubliceerd, en het enige numerieke anker binnen de familie is de door de leverancier gerapporteerde gemiddelde WER van 7,77% op de batch-VibeVoice-ASR-modelkaart, gemeten over acht Engelse testsets — een cijfer dat betrekking heeft op een ander, niet-streaming model. Het eerlijke verhaal is dat het vandaag overzetten van uw transcriptie naar VibeVoice-ASR-Streaming-1.5B betekent dat u een onbekend nauwkeurigheidsniveau accepteert voor uw eigen audio — en dat is precies de reden waarom elke evaluatie ervan door u moet worden uitgevoerd, op uw moeilijkste echte opnames, voordat het productieverkeer mag verwerken.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Talen en sprekerstoeschrijving: de functiekloof snijdt aan twee kanten

De functievergelijking is niet eenzijdig, en dat is wat de keuze echt interessant maakt. Als je audio meertalig is, staat de beslissing direct vast: de 99 talen van Whisper Large v3 Turbo dekken wat de tien van VibeVoice-ASR-Streaming-1.5B niet dekken, en een plafond van tien talen is diskwalificerend voor elke pipeline die een brede mix van spraak moet verwerken. Maar als je werklast binnen die tien talen valt en wat je daadwerkelijk nodig hebt is te weten wie wat zei in een live vergadering, wijst de pijl de andere kant op: Whisper biedt geen native diarisatie en geen hotwords, terwijl VibeVoice-ASR-Streaming-1.5B beide claimt — streaming output met sprekerstoewijzing en domeinterm-hotwords die als contextprompt worden meegegeven. Die claim is niet geverifieerd, en streaming diarisatie over chunkgrenzen heen is moeilijk genoeg om scepsis te rechtvaardigen, maar het is wel de concrete functie die geen enkele hoeveelheid Whisper-engineering je out of the box oplevert.

De migratieberekeningen

Kosten en inspanning pleiten voor de huidige oplossing. Whisper Large v3 Turbo draait al in je stack op hardware die je zelf hebt — een laptop, een CPU, een bescheiden GPU — en overstappen naar VibeVoice-ASR-Streaming-1.5B betekent dat je een onderzoeksinstallatie vanuit de broncode op een NVIDIA-GPU moet opzetten (het model heeft ~5.6 GB aan gewichten), een laadpad moet verifiëren waarvan de architectuurklasse nog niet in de openbare Transformers-documentatie is opgenomen, en de benchmark waar je beslissing van afhangt vanaf nul moet bouwen. Dat is een echt project, en het rendement hangt af van de vraag of de niet-geverifieerde functies voor jou van belang zijn.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

De goedkope manier om dat project te draaien, is om het niet als een vervanging te behandelen. Houd Whisper Large v3 Turbo als standaard aan en routeer een deel van de live audio via één API naar VibeVoice-ASR-Streaming-1.5B — het patroon waarvoor een routinglaag dient: 200+ modellen achter één endpoint tegen de lijstprijs van de provider zonder opslag, automatische failover wanneer het nieuwe model hapert, en een routing-DSL waarmee verschillende workloads vanuit één aanroep verschillende transcribers kunnen kiezen. Dat is het model van OrcaRouter, en dat is het verschil tussen je productiepijplijn inzetten op een checkpoint van twee dagen oud en dat checkpoint zijn plaats laten verdienen ten opzichte van het werkpaard op je eigen transcripten.

Veelgestelde vragen

Kan Whisper Large v3 Turbo überhaupt live-streaming aan?

Alleen als retrofit. Whisper Large v3 Turbo is een batchmodel dat vaste vensters van 30 seconden verwerkt, dus voor live transcriptie moet je er een spraakactiviteitsdetector, een chunker, een overlapstrategie en een stitcher omheen bouwen. Er bestaan werkende implementaties die uitkomen op ruwweg één tot vijf seconden latentie; dat past bij vergadernotulen, maar haalt de lat van minder dan een seconde voor telefoonagenten en live-ondertiteling niet. VibeVoice-ASR-Streaming-1.5B is streaming-native: het produceert tekst per chunk van ~2,9 seconden met ~0,5 seconden vooruitblik — maar het is streaming in chunks, geen tussentijdse resultaten per woord, dus toets dat ritme ook aan je eigen latentiebudget.

Is VibeVoice-ASR-Streaming-1.5B nauwkeuriger dan Whisper Large v3 Turbo?

Niemand kan dat nog beantwoorden, ook Microsoft niet. De nauwkeurigheid van Whisper Large v3 Turbo is gemeten en openbaar — ongeveer 2,1% WER op LibriSpeech clean en 7,7–7,8% op de Open ASR-composiet. VibeVoice-ASR-Streaming-1.5B heeft geen gepubliceerd streaming-WER-cijfer in tekst en geen onafhankelijke benchmark op het moment van schrijven. De enige manier om de vraag te beantwoorden is door de checkpoint op je eigen audio te draaien en transcripten te vergelijken met je huidige systeem — wat precies de test is die deze pagina aanbeveelt vóór enige migratie.

Welke talen ondersteunen de twee?

Whisper Large v3 Turbo ondersteunt 99 talen met één set gewichten. VibeVoice-ASR-Streaming-1.5B noemt er tien: Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans. Voor audio buiten die tien talen is Whisper de enige optie in deze combinatie, en de meertalige kloof is verreweg de duidelijkste reden waarom de meeste teams bij hun huidige oplossing blijven.

Whisper Large v3 Turbo is voor de meeste teams meestal het juiste model, en een twee dagen oud checkpoint zonder benchmarks is geen reden om van platform te veranderen. Het is een reden om een experiment te draaien. Als jouw audio binnen zijn tien talen valt en live sprekersattributie een verschil zou maken voor je product, zet VibeVoice-ASR-Streaming-1.5B dan op achter een router, stuur er een deel van het echte verkeer naartoe, en laat de transcripten — niet de afwezigheid van een benchmark aan weerszijden — de beslissing maken.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube