
VibeVoice-ASR-Streaming-1.5B versus NVIDIA Parakeet TDT 0.6B: een onbewezen MIT-uitdager tegen de Open ASR-kampioen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Als je vandaag open-gewichten spraak-naar-tekst in productie nodig hebt, is er één standaardoptie, en die heet NVIDIA Parakeet TDT 0.6B. Sinds mei 2025 bezet de Parakeet TDT 0.6B v2 met 600 miljoen parameters de eerste plaats op de Hugging Face Open ASR-leaderboard met een gemiddeld woordfoutpercentage van 6,05%, een positie die derde partijen inmiddels ruim een jaar hebben gereproduceerd. De nieuwste mogelijke uitdager is VibeVoice-ASR-Streaming-1.5B, dat Microsoft Research op 2 september 2026 uploadde — zestien maanden na Parakeet, onder een MIT-licentie, met een verhaal over streaming sprekerattributie en, tot dusver, helemaal geen gepubliceerd nauwkeurigheidscijfer. Deze pagina vergelijkt de kampioen en de uitdager op bewijs, architectuur en wat elk model daadwerkelijk uit de doos levert.
Twee labels doen ertoe vóór de specificaties, want ze vormen de hele aard van deze matchup. De cijfers van Parakeet liggen vast: het gemiddelde WER van 6,05% en het doorvoergetal van circa 3.386 RTFx achter diens claim van "een uur audio in ongeveer een seconde" staan al meer dan een jaar op openbare leaderboards en in NVIDIA-materiaal. De kant van VibeVoice-ASR-Streaming-1.5B is wat er te weten valt uit de repository — modelkaart, configbestanden en Microsofts streaming-documentatie — want Microsoft heeft geen WER, latentie of doorvoer in tekst gepubliceerd, en er bestaat op dit moment geen onafhankelijke benchmark van het checkpoint. In elke vergelijking hieronder is de ene kolom in de praktijk getest; de andere is een specblad.
Zestien maanden en één regeerperiode aan de top van het klassement uit elkaar.
Parakeet TDT 0.6B v2 kwam op 5 mei 2025 uit als NVIDIA's antwoord op het streaming-ASR-probleem: een FastConformer-encoder in combinatie met een TDT-decoder (token-en-duurtransducer) die in één stap elk token en de duur ervan voorspelt — een efficiëntietruc die de overhead van blank tokens van een conventionele transducer wegneemt. Het valt onder CC-BY-4.0, is commercieel inzetbaar en veroverde de eerste plaats op de Open ASR-ranglijst met een gemiddeld woordfoutpercentage van 6,05%. Het bracht ook productiegerichte functies die de ranglijst niet meet — interpunctie, hoofdlettergebruik, tijdstempels op woordniveau — en een full-attention-encoder die tot 24 minuten audio in één keer kan verwerken, wat het model nuttig maakt voor lange vergaderingen en podcasts zonder agressieve chunking.
VibeVoice-ASR-Streaming-1.5B is de uitdager in de puurste zin van het woord: het bestaat, het is gedocumenteerd, en er is niets vastgesteld over hoe goed het werkt. Microsofts GitHub-nieuwsbericht van 3 september kondigt een geünificeerd streaming-ASR-model aan dat "continu transcribeert wie wat zegt terwijl de spraak binnenkomt", met hotwords en tien talen, en de configuratie van het checkpoint beschrijft een totaal andere technische traditie: een decoder van een taalmodel uit de Qwen2-familie, gevoed door convolutionele audio-tokenizers, met een diffusiekop die de output in segmenten van ongeveer 2,9 seconden produceert, met een lookahead van ruwweg 0,5 seconde. Waar Parakeet een speciaal ontwikkeld spraakmodel is dat een jaar lang in echte implementaties is verfijnd, is VibeVoice-ASR-Streaming-1.5B een checkpoint uit de researchfamilie dat twee dagen oud is.
De bewijsasymmetrie is het verhaal.
Lees de rest van deze pagina met één feit voor ogen: deze vergelijking bevat cijfers aan precies één kant. Aan de kant van Parakeet TDT 0.6B staat een jaar aan leaderboard-verdediging — 6,05% gemiddelde WER op de Open ASR openbare Engelse korte-uitspraken-sets, ~3.386 RTFx bij batch 128 op NVIDIA-hardware, en een ecosysteem van NeMo-implementatietools, TensorRT-versnelling en FP8-kwantificatie die in productie is toegepast. Aan de kant van VibeVoice-ASR-Streaming-1.5B staat het evaluatiecijfer uit de modelkaart, dat een afbeelding is in plaats van tekst, en de door de leverancier gerapporteerde 7,77% gemiddelde WER van de batch-VibeVoice-ASR-kaart over acht Engelse testsets — een cijfer dat het niet-streamingmodel beschrijft en niet kan worden overgedragen naar deze checkpoint. De uitdager kan best uitstekend zijn; het punt is dat "kan best" de volledige bewijsbasis is.
De spec-check
• Parameters — NVIDIA Parakeet TDT 0.6B: 600M, FastConformer-encoder + TDT-decoder vs VibeVoice-ASR-Streaming-1.5B: ~3B in totaal (Qwen-backbone uit de 1.5B-klasse plus tokenizers en diffusiekop).
• Uitgebracht — 5 mei 2025 versus 2 september 2026.
• Nauwkeurigheid — 6,05% gemiddelde WER, Open ASR #1 sinds mei 2025, door derden gereproduceerd tegenover geen gepubliceerde resultaten.
• Snelheid — ~3,386 RTFx bij batch 128 op NVIDIA-hardware, ~1 uur audio per seconde versus geen gepubliceerd doorvoercijfer.
• Streaming — streaming-capable met full-attention-context tot 24 minuten per doorgang vs chunked streaming: ~2,9 s chunks met ~0,5 s vooruitblik.
• Extra uitvoeropties — interpunctie, hoofdlettergebruik, tijdstempels op woordniveau vs streamingtoewijzing van wie wat zegt (ongeverifieerd) en hotwords; tien talen.
• Licentie — CC-BY-4.0 vs MIT.
• Ecosysteem — NVIDIA NeMo met TensorRT en FP8 versus microsoft/VibeVoice repo-demo's en een vLLM-plugin.


Onder de motorkap: twee ideeën over waar spraakmodellen voor dienen
De architecturen belichamen twee verschillende opvattingen over de taak. Parakeet TDT 0.6B benadert transcriptie als een efficiënt op te lossen signaalverwerkingsprobleem: een FastConformer-encoder extraheert de akoestiek en de TDT-decoder genereert tegelijkertijd teksttokens en tijdsduren. Daarom draait het duizenden keren sneller dan realtime en daarom voelt het zich thuis op NVIDIA's implementatiestack. VibeVoice-ASR-Streaming-1.5B benadert transcriptie als een taalprobleem: comprimeer audio tot een tokenstroom, geef die door aan een taalmodel met evenveel context als een heel transcript, en laat het begrip van dat taalmodel over wie wat zegt en hoe gesprekken samenhangen het werk doen. De LLM-backbone is ook de reden waarom de checkpoint ~3B parameters telt in plaats van 600M, en waarom Microsoft geen edge-footprint heeft opgeëist — dit is een model dat een GPU wil en het geheugen gebruikt om context met zich mee te dragen.
Voor livetranscriptie is de praktische consequentie de vorm van de latentie. De full-attention-encoder van Parakeet kan lange vensters in één enkele doorgang verwerken, wat een andere streamingfilosofie is dan het vaste chunk-en-lookahead-contract van VibeVoice-ASR-Streaming-1.5B, met ruwweg 2,9 seconden audio per uitgestuurd segment. Geen van beide is een per-woord-partials-streamer in de stijl van de commerciële API's met de laagste latentie; beide zijn chunksystemen, en welke de juiste is, hangt af van of je audio binnenkomt als begrensde bestanden of als een doorlopende live-sessie.
Het featureverhaal en de deploymentbuurten
Uit de doos is Parakeet TDT 0.6B het completere transcriptieproduct: interpunctie en hoofdletters worden meegeleverd met het transcript, woordniveau-tijdstempels zijn er voor uitlijning, en vensters van 24 minuten in één doorgang betekenen minder chunking-fouten bij lange opnamen. VibeVoice-ASR-Streaming-1.5B zet daar functies tegenover die Parakeet niet noemt: spreker-toegeschreven uitvoer en hotwords, in tien talen. De bewering over streaming-diarisatie is precies het soort zaak dat onafhankelijke verificatie nodig heeft — chunkgrenzen zijn waar de attributie verschuift — maar het is de reden om naar Microsofts model te kijken in plaats van dat van NVIDIA als uw vereiste is om te weten wie wat zei in een live vergadering.

De buurten zijn net zo verschillend als de modellen. Parakeet TDT 0.6B is een volwaardig lid van NVIDIA NeMo: TensorRT, FP8 en implementatietools, afgestemd op NVIDIA-GPU's, wat uitstekend is als je al op NVIDIA-infrastructuur draait. VibeVoice-ASR-Streaming-1.5B woont in een onderzoeksrepository: de gedocumenteerde paden zijn Microsofts Python-demo's en een vLLM-plugin, de architectuurklasse staat nog niet in de openbare Transformers-documentatie, en het opzetten ervan betekent een installatie vanuit de bron en je eigen verificatie dat het laadpad werkt. Voor een team dat waarde hecht aan saaie, gedocumenteerde implementatie, kan dat verschil alleen al opwegen tegen de benchmarkkloof.
Het pleidooi voor de zittende, het pleidooi voor de uitdager
De zaak voor NVIDIA Parakeet TDT 0.6B is de zaak voor een bekende grootheid: een jaar aan leaderboard-verdediging, reproductie door derden, een commerciële licentie, productiefuncties en een deployment-ecosysteem dat daadwerkelijk verkeer heeft verwerkt. Als u dit kwartaal een Engelse transcriptiefunctie uitrolt en open weights wilt, is dit de verdedigbare standaardkeuze, en ligt de bewijslast bij alles dat beweert het te vervangen.
De argumenten voor VibeVoice-ASR-Streaming-1.5B zijn beperkter en specifieker: je hebt streaming-sprekerattributie of hotwords nodig, je hebt meer nodig dan alleen Engels, of je gelooft dat de taalmodellenbenadering van spraak gaat winnen, en je wilt er vroeg bij zijn. Het is een gok, geen beslissing — er is nog geen cijfer dat het verplaatsen van productieverkeer ernaartoe rechtvaardigt, en Microsofts eigen opstelling is onderzoeksgericht. Geen van beide modellen is vandaag beschikbaar via OrcaRouter, dus de goedkope manier om de gok te testen is het patroon dat voor elk jong open model geldt: houd de ASR-laag achter één routing-API die 200+ modellen ontsluit tegen de lijstprijs van de provider zonder opslag en met automatische failover, leid een deel van de echte audio naar VibeVoice-ASR-Streaming-1.5B op het moment dat een provider het host, en laat transcripten van je eigen verkeer beslissen of de uitdager de kroon verdient die Parakeet zestien maanden heeft gedragen.
