Wygenerowana karta hero zatytułowana „VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: niezweryfikowany pretendent na licencji MIT kontra mistrz Open ASR”, z podtytułem „Sprawdzony standard kontra świeżo upieczony pretendent”, dwiema kartami modeli — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 września 2026 · MIT · brak opublikowanych wyników benchmarków) oraz NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 maja 2025 · CC-BY-4.0 · Open ASR #1 od maja 2025) — oraz tagami: „6,05% śr. WER (Parakeet)”, „16 miesięcy różnicy” i „Kto co powiedział + hotwords (Microsoft, niezweryfikowane)”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B kontra NVIDIA Parakeet TDT 0.6B: niezweryfikowany pretendent MIT przeciwko mistrzowi Open ASR

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeśli dziś potrzebujesz w produkcji modelu zamiany mowy na tekst z otwartymi wagami, istnieje domyślny wybór, a nazywa się NVIDIA Parakeet TDT 0.6B. Od maja 2025 r. model Parakeet TDT 0.6B v2 o 600 milionach parametrów zajmuje pierwsze miejsce na liście liderów Open ASR serwisu Hugging Face ze średnim współczynnikiem błędów słów wynoszącym 6,05% — pozycję, którą strony trzecie niezależnie potwierdzają od ponad roku. Najnowszym potencjalnym pretendentem jest VibeVoice-ASR-Streaming-1.5B, który Microsoft Research opublikował 2 września 2026 r. — szesnaście miesięcy po Parakeet — na licencji MIT, z możliwością strumieniowego przypisywania wypowiedzi mówcom i, jak dotąd, bez żadnej opublikowanej wartości dokładności. Ta strona porównuje mistrza i pretendenta pod kątem dowodów, architektury oraz tego, co każdy z nich faktycznie oferuje od razu po wyjęciu z pudełka.

Zanim przejdziemy do specyfikacji, liczą się dwie etykiety, ponieważ wyznaczają one cały kształt tego porównania. Liczby Parakeeta są ugruntowane: średni WER na poziomie 6,05% i przepustowość ~3 386 RTFx, stojące za twierdzeniem o „godzinie audio w około sekundę”, od ponad roku widnieją na publicznych tablicach liderów i w materiałach NVIDIA. To, co wiadomo o VibeVoice-ASR-Streaming-1.5B, pochodzi z jego repozytorium — karty modelu, plików konfiguracyjnych i dokumentacji strumieniowej Microsoftu — ponieważ Microsoft nie opublikował w tekście żadnych wartości WER, opóźnień ani przepustowości, a w chwili pisania tego tekstu nie istnieje żaden niezależny benchmark tego checkpointu. Jedna kolumna każdego poniższego porównania jest sprawdzona w boju; druga to arkusz specyfikacji.

Dzieli ich szesnaście miesięcy i jedno panowanie na liście rankingowej

Parakeet TDT 0.6B v2 pojawił się 5 maja 2025 roku jako odpowiedź NVIDIA na problem strumieniowego ASR: enkoder FastConformer połączony z dekoderem transducer tokenów i czasu trwania (TDT), który w jednym kroku przewiduje każdy token oraz czas jego trwania — to sprytna technika eliminująca narzut związany z tokenami pustymi w konwencjonalnym transducerze. Model jest na licencji CC-BY-4.0, przyjaznej dla zastosowań komercyjnych, i zajął pierwsze miejsce na Open ASR leaderboard dzięki średniemu współczynnikowi błędów słownych wynoszącemu 6,05%. Do tego oferuje funkcje produkcyjne, których leaderboard nie mierzy — interpunkcję, wielkie litery, znaczniki czasowe na poziomie poszczególnych słów — oraz enkoder z pełną uwagą, który przyjmuje do 24 minut dźwięku w jednym przejściu, dzięki czemu sprawdza się przy długich spotkaniach i podcastach bez agresywnego dzielenia na fragmenty.

VibeVoice-ASR-Streaming-1.5B jest pretendentem w najczystszym sensie: istnieje, jest udokumentowany, a nic na temat tego, jak dobrze działa, nie zostało ustalone. Wpis informacyjny Microsoftu na GitHubie z 3 września ogłasza ujednolicony model strumieniowego ASR, który „w sposób ciągły transkrybuje, kto co powiedział, gdy dociera mowa”, z hotwordami i dziesięcioma językami, a konfiguracja punktu kontrolnego opisuje zupełnie inną tradycję inżynieryjną — dekoder modelu językowego z rodziny Qwen2 zasilany przez konwolucyjne tokenizatory audio, z głowicą dyfuzyjną generującą wyjście we fragmentach trwających około 2,9 sekundy i z wyprzedzeniem około 0,5 sekundy. O ile Parakeet jest stworzonym specjalnie do tego celu modelem mowy, dopracowywanym przez rok rzeczywistych wdrożeń, o tyle VibeVoice-ASR-Streaming-1.5B to punkt kontrolny z rodziny badawczej sprzed dwóch dni.

Asymetria dowodów jest sednem sprawy.

Przeczytaj resztę tej strony, mając przed oczami jeden fakt: liczby w tym porównaniu są tylko po jednej stronie. Po stronie Parakeet TDT 0.6B mamy rok obrony pozycji na liście liderów — średni WER 6,05% w publicznych angielskich zestawach krótkich wypowiedzi Open ASR, około 3386 RTFx przy batchu 128 na sprzęcie NVIDIA oraz ekosystem narzędzi wdrożeniowych NeMo, akceleracji TensorRT i kwantyzacji FP8, który został sprawdzony w produkcji. Po stronie VibeVoice-ASR-Streaming-1.5B mamy wartość ewaluacyjną z karty modelu, która jest obrazem, a nie tekstem, oraz raportowaną przez dostawcę średnią WER 7,77% z karty modelu wsadowego VibeVoice-ASR dla ośmiu angielskich zestawów testowych — liczbę opisującą model niestrumieniowy, której nie można przenieść na ten punkt kontrolny. Pretendent może być znakomity; chodzi o to, że „może być” to cała baza dowodowa.

Sprawdzenie specyfikacji

• Parametry — NVIDIA Parakeet TDT 0.6B: 600M, enkoder FastConformer + dekoder TDT vs VibeVoice-ASR-Streaming-1.5B: ~3B łącznie (backbone Qwen klasy 1.5B plus tokenizery i głowa dyfuzyjna).

• Wydano — 5 maja 2025 vs 2 września 2026.

Dokładność — 6,05% średniego WER, Open ASR #1 od maja 2025, wyniki odtworzone przez stronę trzecią vs. brak publikacji.

• Szybkość — ~3 386 RTFx przy batchu 128 na sprzęcie NVIDIA, ~1 godzina dźwięku na sekundę wobec braku opublikowanej wartości przepustowości.

• Streaming — obsługa strumieniowania z kontekstem pełnej uwagi do 24 minut na przebieg w porównaniu ze strumieniowaniem fragmentarycznym, fragmenty ~2.9 s z wyprzedzeniem ~0.5 s.

Dodatkowe elementy wyjściowe — interpunkcja, kapitalizacja, znaczniki czasu na poziomie słów vs strumieniowe przypisywanie wypowiedzi do mówców (niezweryfikowane) i słowa kluczowe; dziesięć języków.

• Licencja — CC-BY-4.0 vs MIT.

Ekosystem — NVIDIA NeMo z TensorRT i FP8 vs dema z repozytorium microsoft/VibeVoice oraz wtyczka vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Pod maską: dwie idee o tym, do czego służą modele mowy

Architektury kodują dwa różne przekonania na temat zadania. Parakeet TDT 0.6B traktuje transkrypcję jako problem przetwarzania sygnału rozwiązywany wydajnie: enkoder FastConformer wyodrębnia cechy akustyczne, a dekoder TDT emituje jednocześnie tokeny tekstowe i czasy trwania, dlatego działa tysiące razy szybciej niż w czasie rzeczywistym i dlatego dobrze radzi sobie na stosie wdrożeniowym NVIDIA. VibeVoice-ASR-Streaming-1.5B traktuje transkrypcję jako problem językowy: kompresuje dźwięk do strumienia tokenów, przekazuje go modelowi językowemu, który zapoznał się z kontekstem o objętości transkryptu, i pozwala, aby zrozumienie przez LM tego, kto co mówi i jak rozmowy się ze sobą wiążą, wykonało całą pracę. Baza LLM to także powód, dla którego checkpoint ma ~3 miliardy parametrów, a nie 600 milionów, oraz dlaczego Microsoft nie zadeklarował obecności na brzegu sieci — to model, który chce GPU i wykorzystuje pamięć do przenoszenia kontekstu.

W przypadku transkrypcji na żywo praktyczną konsekwencją jest kształt opóźnienia. Enkoder Parakeet z pełną uwagą może w jednym przebiegu obsłużyć długie okna, co jest odmienną filozofią strumieniowania niż w VibeVoice-ASR-Streaming-1.5B, którego sztywny kontrakt przewiduje podział na fragmenty z wyprzedzeniem (chunk-and-lookahead) obejmujący około 2,9 sekundy audio na emitowany segment. Żaden z nich nie jest systemem strumieniującym częściowe transkrypcje słowo po słowie w stylu komercyjnych interfejsów API o najniższym opóźnieniu; oba to systemy oparte na fragmentach, a właściwy wybór zależy od tego, czy dźwięk dociera jako pliki o skończonej długości, czy jako otwarta sesja na żywo.

Historia funkcji i sąsiedztwa wdrożeń

Od razu po rozpakowaniu Parakeet TDT 0.6B jest pełniejszym produktem do transkrypcji: interpunkcja i wielkie litery są już w transkrypcie, znaczniki czasowe na poziomie słów służą do synchronizacji, a 24-minutowe okna jednoprzebiegowe oznaczają mniej błędów podziału na fragmenty przy długich nagraniach. VibeVoice-ASR-Streaming-1.5B kontruje, oferując funkcje, których Parakeet nie wymienia: przypisywanie wypowiedzi do mówcy i hotwords, w dziesięciu językach. Twierdzenie o strumieniowej diaryzacji to dokładnie taka kwestia, która wymaga niezależnej weryfikacji — to właśnie na granicach fragmentów przypisanie do mówcy się rozjeżdża — ale to właśnie powód, dla którego warto zwrócić uwagę na model Microsoftu, a nie na model firmy NVIDIA, jeśli potrzebujesz wiedzieć, kto co mówi podczas spotkania na żywo.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

Środowiska są równie różne, jak same modele. Parakeet TDT 0.6B to obywatel ekosystemu NVIDIA NeMo: TensorRT, FP8 i narzędzia wdrożeniowe dostrojone pod karty GPU NVIDIA, co jest świetnym rozwiązaniem, jeśli już działasz na infrastrukturze NVIDIA. VibeVoice-ASR-Streaming-1.5B mieszka w repozytorium badawczym: udokumentowane ścieżki to dema Pythona od Microsoftu i wtyczka do vLLM, jego klasa architektury nie jest jeszcze uwzględniona w publicznej dokumentacji Transformers, a uruchomienie go wymaga instalacji ze źródeł i samodzielnej weryfikacji, że ścieżka ładowania działa. Dla zespołu, który ceni sobie nudne, udokumentowane wdrożenia, już sama ta różnica może przeważyć nad różnicą w wynikach benchmarków.

Argumenty za obecnym kandydatem, argumenty za pretendentem

Przypadek NVIDIA Parakeet TDT 0.6B to przypadek znanej wielkości: rok obrony pozycji w rankingach, reprodukcja przez strony trzecie, licencja komercyjna, funkcje produkcyjne i ekosystem wdrożeniowy, który wchłonął realny ruch. Jeśli w tym kwartale wdrażasz funkcję transkrypcji angielskiej i chcesz mieć otwarte wagi, to jest to obronny wybór domyślny, a ciężar dowodu spoczywa na wszystkim, co twierdzi, że go zastąpi.

Model VibeVoice-ASR-Streaming-1.5B ma węższe i bardziej konkretne zastosowanie: potrzebujesz strumieniowego przypisywania wypowiedzi do mówców albo hotwordów, potrzebujesz więcej języków niż tylko angielski, albo wierzysz, że podejście do mowy oparte na modelach językowych zwycięży i chcesz wcześnie w to wejść. To zakład, a nie decyzja – nie ma jeszcze żadnych danych liczbowych, które uzasadniałyby skierowanie na niego ruchu produkcyjnego, a sam Microsoft zajmuje tu w pierwszej kolejności postawę badawczą. Żaden z tych modeli nie jest dziś serwowany przez OrcaRouter, więc najtańszym sposobem przetestowania tego zakładu jest schemat, który stosuje się do każdego młodego otwartego modelu: utrzymuj warstwę ASR za jednym API routingu obsługującym 200+ modeli po cenach z cennika dostawcy, bez marży i z automatycznym przełączaniem awaryjnym; kieruj fragment rzeczywistego audio do VibeVoice-ASR-Streaming-1.5B, gdy tylko któryś z dostawców zacznie go hostować; i pozwól, by transkrypcje z twojego własnego ruchu zdecydowały, czy pretendent zasługuje na koronę, którą Parakeet dzierży od szesnastu miesięcy.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube