Een gegenereerde hero-titelkaart voor 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: een onbewezen MIT-uitdager tegen de Open ASR-kampioen', ondertiteld 'De bewezen standaard versus de eendagsuitdager', met twee modelkaarten — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 sep. 2026 · MIT · Nog geen benchmark gepubliceerd) en NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 mei 2025 · CC-BY-4.0 · Open ASR #1 sinds mei 2025) — en tags met de tekst '6,05% gemiddelde WER (Parakeet)', '16 maanden verschil' en 'Wie-zegt-wat + hotwords (Microsoft, ongeverifieerd)'. Het OrcaRouter-logo is rechtsonder in de hoek verwerkt.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B versus NVIDIA Parakeet TDT 0.6B: een onbewezen MIT-uitdager tegen de Open ASR-kampioen

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Als je vandaag open-gewichten spraak-naar-tekst in productie nodig hebt, is er één standaardoptie, en die heet NVIDIA Parakeet TDT 0.6B. Sinds mei 2025 bezet de Parakeet TDT 0.6B v2 met 600 miljoen parameters de eerste plaats op de Hugging Face Open ASR-leaderboard met een gemiddeld woordfoutpercentage van 6,05%, een positie die derde partijen inmiddels ruim een jaar hebben gereproduceerd. De nieuwste mogelijke uitdager is VibeVoice-ASR-Streaming-1.5B, dat Microsoft Research op 2 september 2026 uploadde — zestien maanden na Parakeet, onder een MIT-licentie, met een verhaal over streaming sprekerattributie en, tot dusver, helemaal geen gepubliceerd nauwkeurigheidscijfer. Deze pagina vergelijkt de kampioen en de uitdager op bewijs, architectuur en wat elk model daadwerkelijk uit de doos levert.

Twee labels doen ertoe vóór de specificaties, want ze vormen de hele aard van deze matchup. De cijfers van Parakeet liggen vast: het gemiddelde WER van 6,05% en het doorvoergetal van circa 3.386 RTFx achter diens claim van "een uur audio in ongeveer een seconde" staan al meer dan een jaar op openbare leaderboards en in NVIDIA-materiaal. De kant van VibeVoice-ASR-Streaming-1.5B is wat er te weten valt uit de repository — modelkaart, configbestanden en Microsofts streaming-documentatie — want Microsoft heeft geen WER, latentie of doorvoer in tekst gepubliceerd, en er bestaat op dit moment geen onafhankelijke benchmark van het checkpoint. In elke vergelijking hieronder is de ene kolom in de praktijk getest; de andere is een specblad.

Zestien maanden en één regeerperiode aan de top van het klassement uit elkaar.

Parakeet TDT 0.6B v2 kwam op 5 mei 2025 uit als NVIDIA's antwoord op het streaming-ASR-probleem: een FastConformer-encoder in combinatie met een TDT-decoder (token-en-duurtransducer) die in één stap elk token en de duur ervan voorspelt — een efficiëntietruc die de overhead van blank tokens van een conventionele transducer wegneemt. Het valt onder CC-BY-4.0, is commercieel inzetbaar en veroverde de eerste plaats op de Open ASR-ranglijst met een gemiddeld woordfoutpercentage van 6,05%. Het bracht ook productiegerichte functies die de ranglijst niet meet — interpunctie, hoofdlettergebruik, tijdstempels op woordniveau — en een full-attention-encoder die tot 24 minuten audio in één keer kan verwerken, wat het model nuttig maakt voor lange vergaderingen en podcasts zonder agressieve chunking.

VibeVoice-ASR-Streaming-1.5B is de uitdager in de puurste zin van het woord: het bestaat, het is gedocumenteerd, en er is niets vastgesteld over hoe goed het werkt. Microsofts GitHub-nieuwsbericht van 3 september kondigt een geünificeerd streaming-ASR-model aan dat "continu transcribeert wie wat zegt terwijl de spraak binnenkomt", met hotwords en tien talen, en de configuratie van het checkpoint beschrijft een totaal andere technische traditie: een decoder van een taalmodel uit de Qwen2-familie, gevoed door convolutionele audio-tokenizers, met een diffusiekop die de output in segmenten van ongeveer 2,9 seconden produceert, met een lookahead van ruwweg 0,5 seconde. Waar Parakeet een speciaal ontwikkeld spraakmodel is dat een jaar lang in echte implementaties is verfijnd, is VibeVoice-ASR-Streaming-1.5B een checkpoint uit de researchfamilie dat twee dagen oud is.

De bewijsasymmetrie is het verhaal.

Lees de rest van deze pagina met één feit voor ogen: deze vergelijking bevat cijfers aan precies één kant. Aan de kant van Parakeet TDT 0.6B staat een jaar aan leaderboard-verdediging — 6,05% gemiddelde WER op de Open ASR openbare Engelse korte-uitspraken-sets, ~3.386 RTFx bij batch 128 op NVIDIA-hardware, en een ecosysteem van NeMo-implementatietools, TensorRT-versnelling en FP8-kwantificatie die in productie is toegepast. Aan de kant van VibeVoice-ASR-Streaming-1.5B staat het evaluatiecijfer uit de modelkaart, dat een afbeelding is in plaats van tekst, en de door de leverancier gerapporteerde 7,77% gemiddelde WER van de batch-VibeVoice-ASR-kaart over acht Engelse testsets — een cijfer dat het niet-streamingmodel beschrijft en niet kan worden overgedragen naar deze checkpoint. De uitdager kan best uitstekend zijn; het punt is dat "kan best" de volledige bewijsbasis is.

De spec-check

• Parameters — NVIDIA Parakeet TDT 0.6B: 600M, FastConformer-encoder + TDT-decoder vs VibeVoice-ASR-Streaming-1.5B: ~3B in totaal (Qwen-backbone uit de 1.5B-klasse plus tokenizers en diffusiekop).

• Uitgebracht — 5 mei 2025 versus 2 september 2026.

• Nauwkeurigheid — 6,05% gemiddelde WER, Open ASR #1 sinds mei 2025, door derden gereproduceerd tegenover geen gepubliceerde resultaten.

• Snelheid — ~3,386 RTFx bij batch 128 op NVIDIA-hardware, ~1 uur audio per seconde versus geen gepubliceerd doorvoercijfer.

• Streaming — streaming-capable met full-attention-context tot 24 minuten per doorgang vs chunked streaming: ~2,9 s chunks met ~0,5 s vooruitblik.

• Extra uitvoeropties — interpunctie, hoofdlettergebruik, tijdstempels op woordniveau vs streamingtoewijzing van wie wat zegt (ongeverifieerd) en hotwords; tien talen.

• Licentie — CC-BY-4.0 vs MIT.

• Ecosysteem — NVIDIA NeMo met TensorRT en FP8 versus microsoft/VibeVoice repo-demo's en een vLLM-plugin.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Onder de motorkap: twee ideeën over waar spraakmodellen voor dienen

De architecturen belichamen twee verschillende opvattingen over de taak. Parakeet TDT 0.6B benadert transcriptie als een efficiënt op te lossen signaalverwerkingsprobleem: een FastConformer-encoder extraheert de akoestiek en de TDT-decoder genereert tegelijkertijd teksttokens en tijdsduren. Daarom draait het duizenden keren sneller dan realtime en daarom voelt het zich thuis op NVIDIA's implementatiestack. VibeVoice-ASR-Streaming-1.5B benadert transcriptie als een taalprobleem: comprimeer audio tot een tokenstroom, geef die door aan een taalmodel met evenveel context als een heel transcript, en laat het begrip van dat taalmodel over wie wat zegt en hoe gesprekken samenhangen het werk doen. De LLM-backbone is ook de reden waarom de checkpoint ~3B parameters telt in plaats van 600M, en waarom Microsoft geen edge-footprint heeft opgeëist — dit is een model dat een GPU wil en het geheugen gebruikt om context met zich mee te dragen.

Voor livetranscriptie is de praktische consequentie de vorm van de latentie. De full-attention-encoder van Parakeet kan lange vensters in één enkele doorgang verwerken, wat een andere streamingfilosofie is dan het vaste chunk-en-lookahead-contract van VibeVoice-ASR-Streaming-1.5B, met ruwweg 2,9 seconden audio per uitgestuurd segment. Geen van beide is een per-woord-partials-streamer in de stijl van de commerciële API's met de laagste latentie; beide zijn chunksystemen, en welke de juiste is, hangt af van of je audio binnenkomt als begrensde bestanden of als een doorlopende live-sessie.

Het featureverhaal en de deploymentbuurten

Uit de doos is Parakeet TDT 0.6B het completere transcriptieproduct: interpunctie en hoofdletters worden meegeleverd met het transcript, woordniveau-tijdstempels zijn er voor uitlijning, en vensters van 24 minuten in één doorgang betekenen minder chunking-fouten bij lange opnamen. VibeVoice-ASR-Streaming-1.5B zet daar functies tegenover die Parakeet niet noemt: spreker-toegeschreven uitvoer en hotwords, in tien talen. De bewering over streaming-diarisatie is precies het soort zaak dat onafhankelijke verificatie nodig heeft — chunkgrenzen zijn waar de attributie verschuift — maar het is de reden om naar Microsofts model te kijken in plaats van dat van NVIDIA als uw vereiste is om te weten wie wat zei in een live vergadering.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

De buurten zijn net zo verschillend als de modellen. Parakeet TDT 0.6B is een volwaardig lid van NVIDIA NeMo: TensorRT, FP8 en implementatietools, afgestemd op NVIDIA-GPU's, wat uitstekend is als je al op NVIDIA-infrastructuur draait. VibeVoice-ASR-Streaming-1.5B woont in een onderzoeksrepository: de gedocumenteerde paden zijn Microsofts Python-demo's en een vLLM-plugin, de architectuurklasse staat nog niet in de openbare Transformers-documentatie, en het opzetten ervan betekent een installatie vanuit de bron en je eigen verificatie dat het laadpad werkt. Voor een team dat waarde hecht aan saaie, gedocumenteerde implementatie, kan dat verschil alleen al opwegen tegen de benchmarkkloof.

Het pleidooi voor de zittende, het pleidooi voor de uitdager

De zaak voor NVIDIA Parakeet TDT 0.6B is de zaak voor een bekende grootheid: een jaar aan leaderboard-verdediging, reproductie door derden, een commerciële licentie, productiefuncties en een deployment-ecosysteem dat daadwerkelijk verkeer heeft verwerkt. Als u dit kwartaal een Engelse transcriptiefunctie uitrolt en open weights wilt, is dit de verdedigbare standaardkeuze, en ligt de bewijslast bij alles dat beweert het te vervangen.

De argumenten voor VibeVoice-ASR-Streaming-1.5B zijn beperkter en specifieker: je hebt streaming-sprekerattributie of hotwords nodig, je hebt meer nodig dan alleen Engels, of je gelooft dat de taalmodellenbenadering van spraak gaat winnen, en je wilt er vroeg bij zijn. Het is een gok, geen beslissing — er is nog geen cijfer dat het verplaatsen van productieverkeer ernaartoe rechtvaardigt, en Microsofts eigen opstelling is onderzoeksgericht. Geen van beide modellen is vandaag beschikbaar via OrcaRouter, dus de goedkope manier om de gok te testen is het patroon dat voor elk jong open model geldt: houd de ASR-laag achter één routing-API die 200+ modellen ontsluit tegen de lijstprijs van de provider zonder opslag en met automatische failover, leid een deel van de echte audio naar VibeVoice-ASR-Streaming-1.5B op het moment dat een provider het host, en laat transcripten van je eigen verkeer beslissen of de uitdager de kroon verdient die Parakeet zestien maanden heeft gedragen.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube