
VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: native streaming tegen het werkpaard voor 99 talen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
There is a good chance the speech-to-text model you run today is Whisper Large v3 Turbo, and there is a new model asking whether it should be. OpenAI's Whisper Large v3 Turbo — the distilled 809M-parameter checkpoint released in October 2024 — is the open-weights workhorse: 99 languages, roughly four to eight times faster than the original large-v3, small enough for a laptop, MIT-licensed, and backed by the largest transcription ecosystem in existence. VibeVoice-ASR-Streaming-1.5B, uploaded by Microsoft Research on September 2, 2026, is the challenger built for the one thing Whisper does not do natively: stream. It transcribes in chunks as audio arrives rather than swallowing fixed windows, it claims speaker-attributed output, and it has ten languages and no published benchmark to its name.
Die laatste clausule is de reden waarom deze pagina is opgebouwd rond een migratievraag in plaats van een onderlinge vergelijking. De cijfers van Whisper Large v3 Turbo zijn gemeten en openbaar — LibriSpeech, de samengestelde Open ASR-score, Common Voice — terwijl de modelkaart van VibeVoice-ASR-Streaming-1.5B geen WER- of latentiecijfer in de tekst vermeldt en er op het moment van schrijven geen onafhankelijke benchmark bestaat. Alles hieronder over de Microsoft-kant is wat er uit de repository te weten valt: de configbestanden, de modelkaart en Microsofts streamingdocumentatie. Alles over de Whisper-kant is een vaststaand publiek gegeven. De twee zijn niet rechtstreeks tegen elkaar getest; de vergelijking is er een tussen wat bewezen is en wat beloofd wordt.
Het model dat je waarschijnlijk al draait
Whisper Large v3 Turbo heeft zijn plek op weinig glamoureuze wijze verdiend: het is snel, compact, meertalig en saai op de manieren waar productieteams van houden. Door destillatie is het teruggebracht van de Whisper large-v3 met 1,55B parameters naar 809M parameters, en het behoudt daarbij de ondersteuning voor 99 talen en ruwweg 95% van de nauwkeurigheid van large-v3 — ongeveer 2,1% WER op LibriSpeech clean, rond 7,7–7,8% op de samengestelde Open ASR-score, met de grootste kwaliteitsvermindering bij laag-resource talen en tonale talen — terwijl het meerdere malen sneller draait en met FP16 in ongeveer 1,6 GB VRAM past. Het is onder de MIT-licentie uitgebracht en draait via faster-whisper, whisper.cpp en drie jaar aan integraties; de Hugging Face-pagina toont meer dan zeven miljoen downloads in één maand. Als je zelf transcriptie host, is dit zeer waarschijnlijk het model dat dat doet.
Wat Whisper Large v3 Turbo niet is — en nooit heeft beweerd te zijn — is een streamingmodel. Het verwerkt audio in vaste vensters van 30 seconden en levert per venster een transcript op; het heeft geen ingebouwde voice-activitydetectie, geen endpointing, geen sprekersdiarisatie en geen hotword-mechanisme. Live-transcriptie met Whisper is altijd een retrofit die je zelf bouwt — en de retrofit is precies waar de latentie en de engineeringkosten liggen.
Wat verandert er eigenlijk als je overstapt
• Latentiemodel — VibeVoice-ASR-Streaming-1.5B produceert tekst één keer per definitief chunk van ongeveer 2,9 seconden, met ~0,5 s vooruitblik, bewust in contrast met Whisper Large v3 Turbo: een batchmodel met een venster van 30 seconden dat een chunking- en stitchinglaag nodig heeft om live-uitvoer te benaderen.
• Sessievorm — onbegrensde livesessies, waarbij context via een prefix-cache over chunks wordt meegenomen, versus discrete vensters van 30 seconden zonder conversatiestatus tussen de vensters.
• Talen — tien (Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch, Spaans) vs 99.
• Nauwkeurigheid in print — niet gepubliceerd vs ~2,1% LibriSpeech clean, ~7,7–7,8% Open ASR composite, allemaal gemeten en openbaar.
Uitvoer-extra's — beweert streaming sprekerattributie en hotwords te leveren, maar er zijn alleen woordtijdstempels beschikbaar: geen diarisatie en geen native hotwords.
• Hardware — ~5,6 GB aan bf16-gewichten op een NVIDIA-GPU, installatie vanaf de bron versus ~1,6 GB FP16, draait op laptops en CPU's via whisper.cpp en faster-whisper.
• Licentie — MIT, beide.

Het streaming-retrofitprobleem
De eerlijke manier om naar deze vergelijking te kijken is dat Whisper Large v3 Turbo een streamingprobleem heeft waarvoor je al hebt betaald of nog steeds betaalt. Een livepijplijn voor Whisper betekent een spraakactiviteitsdetector om spraak te vinden, een chunker om audio in vensters van Whisper-formaat te snijden, overlappende vensters zodat woorden niet verloren gaan bij de grenzen, en een stitcher om de gedeeltelijke transcripties samen te voegen. Community-implementaties van die stack komen uit op ruwweg één tot vijf seconden end-to-endlatentie — werkbaar voor vergadernotities, maar onvoldoende voor de norm voor telefoonagenten en live ondertiteling.
VibeVoice-ASR-Streaming-1.5B maakt de retrofit overbodig door zijn constructie. Zijn preprocessorconfiguratie legt een chunk van 22 frames en een lookahead van 4 frames vast op een spraak-tokenstroom van ~7,5 Hz — ongeveer 2,9 seconden audio per gegenereerd segment, een halve seconde aan toekomstcontext — en de documentatie van Microsoft beschrijft dat context van eerdere chunks via de KV-cache behouden blijft, dus een livesessie hoeft niet vanaf nul te herberekenen. Maar lees het woord "streaming" goed aan beide kanten van deze vergelijking: geen van beide modellen is een engine voor per-woord-partials van het soort dat de commerciële API's met de laagste latentie verkopen. Het transcript van VibeVoice groeit door zijn ontwerp in stappen van ruwweg drie seconden; dat is voor vergaderingen een ander en doorgaans aanvaardbaar ritme, maar subseconde is dat niet. En als je vereiste is dat woorden binnen een seconde op het scherm verschijnen, moet je deze chunkgeometrie tegen dat budget afmeten voordat je erop bouwt.
Nauwkeurigheid: wat je opgeeft om over te schakelen naar native streaming
Hier is het hiaat dat de beslissing zou moeten sturen. Whisper Large v3 Turbo heeft een openbaar nauwkeurigheidsdossier dat u kunt controleren — en wanneer de opname binnen de 99 talen valt, is dat dossier sterk. VibeVoice-ASR-Streaming-1.5B beschikt niet over een dergelijk dossier: de evaluatie op de modelkaart is een afbeelding, Microsoft heeft geen streaming-WER in tekstvorm gepubliceerd, en het enige numerieke anker binnen de familie is de door de leverancier gerapporteerde gemiddelde WER van 7,77% op de batch-VibeVoice-ASR-modelkaart, gemeten over acht Engelse testsets — een cijfer dat betrekking heeft op een ander, niet-streaming model. Het eerlijke verhaal is dat het vandaag overzetten van uw transcriptie naar VibeVoice-ASR-Streaming-1.5B betekent dat u een onbekend nauwkeurigheidsniveau accepteert voor uw eigen audio — en dat is precies de reden waarom elke evaluatie ervan door u moet worden uitgevoerd, op uw moeilijkste echte opnames, voordat het productieverkeer mag verwerken.

Talen en sprekerstoeschrijving: de functiekloof snijdt aan twee kanten
De functievergelijking is niet eenzijdig, en dat is wat de keuze echt interessant maakt. Als je audio meertalig is, staat de beslissing direct vast: de 99 talen van Whisper Large v3 Turbo dekken wat de tien van VibeVoice-ASR-Streaming-1.5B niet dekken, en een plafond van tien talen is diskwalificerend voor elke pipeline die een brede mix van spraak moet verwerken. Maar als je werklast binnen die tien talen valt en wat je daadwerkelijk nodig hebt is te weten wie wat zei in een live vergadering, wijst de pijl de andere kant op: Whisper biedt geen native diarisatie en geen hotwords, terwijl VibeVoice-ASR-Streaming-1.5B beide claimt — streaming output met sprekerstoewijzing en domeinterm-hotwords die als contextprompt worden meegegeven. Die claim is niet geverifieerd, en streaming diarisatie over chunkgrenzen heen is moeilijk genoeg om scepsis te rechtvaardigen, maar het is wel de concrete functie die geen enkele hoeveelheid Whisper-engineering je out of the box oplevert.
De migratieberekeningen
Kosten en inspanning pleiten voor de huidige oplossing. Whisper Large v3 Turbo draait al in je stack op hardware die je zelf hebt — een laptop, een CPU, een bescheiden GPU — en overstappen naar VibeVoice-ASR-Streaming-1.5B betekent dat je een onderzoeksinstallatie vanuit de broncode op een NVIDIA-GPU moet opzetten (het model heeft ~5.6 GB aan gewichten), een laadpad moet verifiëren waarvan de architectuurklasse nog niet in de openbare Transformers-documentatie is opgenomen, en de benchmark waar je beslissing van afhangt vanaf nul moet bouwen. Dat is een echt project, en het rendement hangt af van de vraag of de niet-geverifieerde functies voor jou van belang zijn.

De goedkope manier om dat project te draaien, is om het niet als een vervanging te behandelen. Houd Whisper Large v3 Turbo als standaard aan en routeer een deel van de live audio via één API naar VibeVoice-ASR-Streaming-1.5B — het patroon waarvoor een routinglaag dient: 200+ modellen achter één endpoint tegen de lijstprijs van de provider zonder opslag, automatische failover wanneer het nieuwe model hapert, en een routing-DSL waarmee verschillende workloads vanuit één aanroep verschillende transcribers kunnen kiezen. Dat is het model van OrcaRouter, en dat is het verschil tussen je productiepijplijn inzetten op een checkpoint van twee dagen oud en dat checkpoint zijn plaats laten verdienen ten opzichte van het werkpaard op je eigen transcripten.
Veelgestelde vragen
Kan Whisper Large v3 Turbo überhaupt live-streaming aan?
Alleen als retrofit. Whisper Large v3 Turbo is een batchmodel dat vaste vensters van 30 seconden verwerkt, dus voor live transcriptie moet je er een spraakactiviteitsdetector, een chunker, een overlapstrategie en een stitcher omheen bouwen. Er bestaan werkende implementaties die uitkomen op ruwweg één tot vijf seconden latentie; dat past bij vergadernotulen, maar haalt de lat van minder dan een seconde voor telefoonagenten en live-ondertiteling niet. VibeVoice-ASR-Streaming-1.5B is streaming-native: het produceert tekst per chunk van ~2,9 seconden met ~0,5 seconden vooruitblik — maar het is streaming in chunks, geen tussentijdse resultaten per woord, dus toets dat ritme ook aan je eigen latentiebudget.
Is VibeVoice-ASR-Streaming-1.5B nauwkeuriger dan Whisper Large v3 Turbo?
Niemand kan dat nog beantwoorden, ook Microsoft niet. De nauwkeurigheid van Whisper Large v3 Turbo is gemeten en openbaar — ongeveer 2,1% WER op LibriSpeech clean en 7,7–7,8% op de Open ASR-composiet. VibeVoice-ASR-Streaming-1.5B heeft geen gepubliceerd streaming-WER-cijfer in tekst en geen onafhankelijke benchmark op het moment van schrijven. De enige manier om de vraag te beantwoorden is door de checkpoint op je eigen audio te draaien en transcripten te vergelijken met je huidige systeem — wat precies de test is die deze pagina aanbeveelt vóór enige migratie.
Welke talen ondersteunen de twee?
Whisper Large v3 Turbo ondersteunt 99 talen met één set gewichten. VibeVoice-ASR-Streaming-1.5B noemt er tien: Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans. Voor audio buiten die tien talen is Whisper de enige optie in deze combinatie, en de meertalige kloof is verreweg de duidelijkste reden waarom de meeste teams bij hun huidige oplossing blijven.
Whisper Large v3 Turbo is voor de meeste teams meestal het juiste model, en een twee dagen oud checkpoint zonder benchmarks is geen reden om van platform te veranderen. Het is een reden om een experiment te draaien. Als jouw audio binnen zijn tien talen valt en live sprekersattributie een verschil zou maken voor je product, zet VibeVoice-ASR-Streaming-1.5B dan op achter een router, stuur er een deel van het echte verkeer naartoe, en laat de transcripten — niet de afwezigheid van een benchmark aan weerszijden — de beslissing maken.
