Ett genererat hero-titelkort för 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: en oprövad MIT-utmanare mot Open ASR-mästaren', med undertexten 'Den beprövade standarden mot den dagsfärska utmanaren', med två modellkort — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 sept 2026 · MIT · Ingen benchmark publicerad ännu) och NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 maj 2025 · CC-BY-4.0 · Open ASR #1 sedan maj 2025) — och taggar som lyder '6,05 % snitt-WER (Parakeet)', '16 månaders mellanrum' och 'Vem-sa-vad + hotwords (Microsoft, overifierat)'. OrcaRouter-logotypen är kompositerad i nedre högra hörnet.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: en oprövad MIT-utmanare mot Open ASR-mästaren

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Om du behöver en tal-till-text-modell med öppna vikter i produktion idag, finns det ett standardval, och dess namn är NVIDIA Parakeet TDT 0.6B. Sedan maj 2025 har Parakeet TDT 0.6B v2 med 600 miljoner parametrar innehaft förstaplatsen på Hugging Face Open ASR-ledartavlan med en genomsnittlig ordfelsfrekvens på 6,05 % – en position som oberoende tredjeparter har reproducerat i gott och väl över ett år. Den senaste presumtiva utmanaren är VibeVoice-ASR-Streaming-1.5B, som Microsoft Research laddade upp den 2 september 2026 – sexton månader efter Parakeet – under MIT-licens, med strömmande talarattribuering som säljargument och, hittills, ingen publicerad träffsäkerhetssiffra alls. Den här sidan jämför mästaren och utmanaren utifrån belägg, arkitektur och vad var och en faktiskt levererar direkt ur lådan.

Två etiketter spelar roll innan vi ens kommer till specifikationerna, eftersom de formar hela den här uppgörelsen. Parakeets siffror är väletablerade: det genomsnittliga WER-värdet på 6,05 % och genomströmningssiffran på cirka 3 386 RTFx, som ligger bakom påståendet ”en timme ljud på ungefär en sekund”, har legat på offentliga topplistor och i NVIDIA:s material i över ett år. VibeVoice-ASR-Streaming-1.5B:s del av jämförelsen utgörs av det som går att utläsa från dess repository — modellkort, konfigurationsfiler och Microsofts streamingdokumentation — eftersom Microsoft inte har publicerat varken WER, latens eller genomströmning i skriftlig form och ingen oberoende benchmark av checkpointern finns i skrivande stund. En kolumn i varje jämförelse nedan är stridsprovad; den andra är ett specifikationsblad.

Sexton månader och en period som etta på topplistan emellan.

Parakeet TDT 0.6B v2 släpptes den 5 maj 2025 som NVIDIAs svar på problemet med strömmande ASR: en FastConformer-kodare ihop med en token-och-duration-transducer (TDT)-avkodare som förutsäger varje token och hur länge den varar i ett enda steg – en effektivitetsteknik som eliminerar blank-token-overheaden hos en konventionell transducer. Den är CC-BY-4.0, kommersiellt vänlig, och den tog toppen av Open ASR-ledartavlan tack vare sin genomsnittliga ordavvikelse på 6,05 %. Den förde också med sig produktionsfunktioner som ledartavlan inte mäter – skiljetecken, versalisering, tidsstämplar på ordnivå – samt en full-attention-kodare som tar emot upp till 24 minuter ljud i ett enda pass, vilket gör den användbar för långa möten och poddar utan aggressiv uppdelning.

VibeVoice-ASR-Streaming-1.5B är utmanaren i ordets renaste bemärkelse: den finns, den är dokumenterad, och ingenting om hur väl den fungerar har fastställts. Microsofts GitHub-nyhetsrad, daterad den 3 september, tillkännager en enhetlig strömmande ASR-modell som "kontinuerligt transkriberar vem som sade vad när tal anländer", med hotwords och tio språk, och checkpointens konfiguration beskriver en helt annan ingenjörstradition – en språkmodellsavkodare i Qwen2-familjen matad av konvolutionella ljudtokeniserare, med ett diffusionshuvud som producerar utdata i block på cirka 2,9 sekunder och ungefär 0,5 sekunders lookahead. Där Parakeet är en specialbyggd talmodell som förfinats under ett år av verkliga driftsättningar, är VibeVoice-ASR-Streaming-1.5B en checkpoint från forskningsfamiljen som är två dagar gammal.

Bevisasymmetrin är historien.

Läs resten av den här sidan med ett faktum framför dig: den här jämförelsen har siffror på exakt en sida. På Parakeet TDT 0.6B:s sida finns ett års försvar av leaderboarden — 6,05 % genomsnittlig WER på Open ASR:s offentliga engelska kortformsset, cirka 3 386 RTFx med batchstorlek 128 på NVIDIA-hårdvara och ett ekosystem av NeMo-verktyg för driftsättning, TensorRT-acceleration och FP8-kvantisering som har prövats i produktion. På VibeVoice-ASR-Streaming-1.5B:s sida finns modellkortets utvärderingssiffra, som är en bild snarare än text, och batch-VibeVoice-ASR-kortets leverantörsrapporterade 7,77 % genomsnittlig WER över åtta engelska testset — en siffra som beskriver den icke-strömmande modellen och inte kan överföras till den här checkpointen. Utmanaren kan mycket väl vara utmärkt; poängen är att ”kan mycket väl vara” är hela bevisunderlaget.

Spec-kontrollen

• Parametrar — NVIDIA Parakeet TDT 0.6B: 600M, FastConformer-encoder + TDT-decoder jämfört med VibeVoice-ASR-Streaming-1.5B: ~3B totalt (Qwen-backbone i 1,5B-klass plus tokenizers och diffusionshuvud).

• Släppt — 5 maj 2025 vs 2 september 2026.

• Noggrannhet — 6,05 % genomsnittlig WER, Open ASR #1 sedan maj 2025, tredjepartsreproducerad vs ingen publicerad.

• Hastighet — ~3,386 RTFx vid batchstorlek 128 på NVIDIA-hårdvara, ~1 timme ljud per sekund jämfört med att ingen genomströmningssiffra har publicerats.

• Streaming — stödjer streaming med full-attention-kontext upp till 24 minuter per pass jämfört med chunkad streaming, ~2,9 s chunkar med ~0,5 s framförhållning.

• Extra utdata — interpunktion, versalisering, tidsstämplar på ordnivå jämfört med strömmande vem-sa-vad-attribuering (overifierad) och hotwords; tio språk.

• Licens — CC-BY-4.0 vs MIT.

• Ekosystem — NVIDIA NeMo med TensorRT och FP8 jämfört med microsoft/VibeVoice repo-demos och en vLLM-plugin.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Under huven: två idéer om vad talmodeller är till för

Arkitekturerna kodar två olika föreställningar om uppgiften. Parakeet TDT 0.6B behandlar transkribering som ett signalbehandlingsproblem som löses effektivt: en FastConformer-kodare extraherar akustik och TDT-avkodaren genererar texttoken och varaktigheter tillsammans, vilket är varför den körs tusentals gånger snabbare än realtid och varför den trivs på NVIDIAs distributionsstack. VibeVoice-ASR-Streaming-1.5B behandlar transkribering som ett språkproblem: komprimera ljud till en tokenström, överlämna den till en språkmodell som har läst kontext motsvarande en transkription, och låt språkmodellens förståelse av vem som säger vad och hur samtal hänger ihop göra jobbet. LLM-stommen är också anledningen till att checkpointen har ~3B parametrar snarare än 600M, och varför Microsoft inte har gjort anspråk på ett edge-avtryck – detta är en modell som vill ha en GPU och använder minnet för att bära kontext.

För live-transkribering är den praktiska konsekvensen latensprofilen. Parakeets full-attention-encoder kan bearbeta långa fönster i ett enda pass, vilket är en annan streamingfilosofi än VibeVoice-ASR-Streaming-1.5B:s fasta chunk- och lookahead-kontrakt på cirka 2,9 sekunders ljud per genererat segment. Ingen av dem är en strömmare som levererar delresultat per ord i stil med de kommersiella API:erna med lägst latens; båda är chunkbaserade system, och det rätta valet beror på om ditt ljud kommer som avgränsade filer eller som en pågående live-session.

Reportaget och utplaceringsområdena

Direkt ur kartongen är Parakeet TDT 0.6B den mer kompletta transkriberingsprodukten: skiljetecken och versaler följer med transkriptet, tidsstämplar på ordnivå finns för alignering, och 24-minuters fönster med enkel passning innebär färre segmenteringsfel på långa inspelningar. VibeVoice-ASR-Streaming-1.5B kontrar med funktioner som Parakeet inte listar: talarattribuerad utdata och hotwords, på tio språk. Påståendet om strömmande diarisering är precis den typ av sak som behöver oberoende verifiering – segmentgränser är där attribueringen börjar avvika – men det är anledningen att titta på Microsofts modell snarare än NVIDIAs om ditt krav är att veta vem som sa vad i ett live-möte.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

Miljöerna är lika olika som modellerna. Parakeet TDT 0.6B är en NVIDIA NeMo-medborgare: TensorRT, FP8 och driftsättningsverktyg optimerade för NVIDIA GPU:er, vilket är utmärkt om du redan använder NVIDIA-infrastruktur. VibeVoice-ASR-Streaming-1.5B lever i ett forskningsarkiv: de dokumenterade vägarna är Microsofts Python-demos och ett vLLM-plugin, dess arkitekturklass finns ännu inte i den offentliga Transformers-dokumentationen, och att få igång det innebär installation från källkod och egen verifiering att inläsningsvägen fungerar. För ett team som värdesätter tråkig, dokumenterad driftsättning kan den skillnaden ensam väga tyngre än prestandagapet.

Argumenten för den sittande, argumenten för utmanaren.

Argumentet för NVIDIA Parakeet TDT 0.6B är argumentet för en känd kvantitet: ett års försvar av leaderboard-positionen, tredjepartsreproduktion, en kommersiell licens, produktionsfunktioner och ett distributions-ekosystem som har hanterat verklig trafik. Om du lanserar en engelsk transkriptionsfunktion det här kvartalet och vill ha öppna vikter, är detta det försvarbara standardvalet, och bevisbördan ligger på allt som hävdar att det kan ersättas.

Argumenten för VibeVoice-ASR-Streaming-1.5B är snävare och mer specifika: du behöver attribuering av talare i strömmen eller hotwords, du behöver stöd för fler språk än engelska, eller så tror du att språkmodellsansatsen för tal kommer att vinna och vill vara tidigt ute. Det är en satsning, inte ett beslut – det finns ännu inga siffror som motiverar att flytta produktionstrafik till den, och Microsofts egen hållning är forskning i första hand. Ingen av modellerna erbjuds via OrcaRouter i dag, så det kostnadseffektiva sättet att testa satsningen är det mönster som gäller för alla unga öppna modeller: håll ASR-lagret bakom ett enda routnings-API som ger åtkomst till 200+ modeller till leverantörens listpris utan påslag och med automatisk failover, dirigera en del av den verkliga ljudtrafiken till VibeVoice-ASR-Streaming-1.5B så snart en leverantör har den tillgänglig, och låt transkripten från din egen trafik avgöra om utmanaren förtjänar kronan som Parakeet har burit i sexton månader.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube