
VibeVoice-ASR-Streaming-1.5B kontra NVIDIA Parakeet TDT 0.6B: niezweryfikowany pretendent MIT przeciwko mistrzowi Open ASR
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Jeśli dziś potrzebujesz w produkcji modelu zamiany mowy na tekst z otwartymi wagami, istnieje domyślny wybór, a nazywa się NVIDIA Parakeet TDT 0.6B. Od maja 2025 r. model Parakeet TDT 0.6B v2 o 600 milionach parametrów zajmuje pierwsze miejsce na liście liderów Open ASR serwisu Hugging Face ze średnim współczynnikiem błędów słów wynoszącym 6,05% — pozycję, którą strony trzecie niezależnie potwierdzają od ponad roku. Najnowszym potencjalnym pretendentem jest VibeVoice-ASR-Streaming-1.5B, który Microsoft Research opublikował 2 września 2026 r. — szesnaście miesięcy po Parakeet — na licencji MIT, z możliwością strumieniowego przypisywania wypowiedzi mówcom i, jak dotąd, bez żadnej opublikowanej wartości dokładności. Ta strona porównuje mistrza i pretendenta pod kątem dowodów, architektury oraz tego, co każdy z nich faktycznie oferuje od razu po wyjęciu z pudełka.
Zanim przejdziemy do specyfikacji, liczą się dwie etykiety, ponieważ wyznaczają one cały kształt tego porównania. Liczby Parakeeta są ugruntowane: średni WER na poziomie 6,05% i przepustowość ~3 386 RTFx, stojące za twierdzeniem o „godzinie audio w około sekundę”, od ponad roku widnieją na publicznych tablicach liderów i w materiałach NVIDIA. To, co wiadomo o VibeVoice-ASR-Streaming-1.5B, pochodzi z jego repozytorium — karty modelu, plików konfiguracyjnych i dokumentacji strumieniowej Microsoftu — ponieważ Microsoft nie opublikował w tekście żadnych wartości WER, opóźnień ani przepustowości, a w chwili pisania tego tekstu nie istnieje żaden niezależny benchmark tego checkpointu. Jedna kolumna każdego poniższego porównania jest sprawdzona w boju; druga to arkusz specyfikacji.
Dzieli ich szesnaście miesięcy i jedno panowanie na liście rankingowej
Parakeet TDT 0.6B v2 pojawił się 5 maja 2025 roku jako odpowiedź NVIDIA na problem strumieniowego ASR: enkoder FastConformer połączony z dekoderem transducer tokenów i czasu trwania (TDT), który w jednym kroku przewiduje każdy token oraz czas jego trwania — to sprytna technika eliminująca narzut związany z tokenami pustymi w konwencjonalnym transducerze. Model jest na licencji CC-BY-4.0, przyjaznej dla zastosowań komercyjnych, i zajął pierwsze miejsce na Open ASR leaderboard dzięki średniemu współczynnikowi błędów słownych wynoszącemu 6,05%. Do tego oferuje funkcje produkcyjne, których leaderboard nie mierzy — interpunkcję, wielkie litery, znaczniki czasowe na poziomie poszczególnych słów — oraz enkoder z pełną uwagą, który przyjmuje do 24 minut dźwięku w jednym przejściu, dzięki czemu sprawdza się przy długich spotkaniach i podcastach bez agresywnego dzielenia na fragmenty.
VibeVoice-ASR-Streaming-1.5B jest pretendentem w najczystszym sensie: istnieje, jest udokumentowany, a nic na temat tego, jak dobrze działa, nie zostało ustalone. Wpis informacyjny Microsoftu na GitHubie z 3 września ogłasza ujednolicony model strumieniowego ASR, który „w sposób ciągły transkrybuje, kto co powiedział, gdy dociera mowa”, z hotwordami i dziesięcioma językami, a konfiguracja punktu kontrolnego opisuje zupełnie inną tradycję inżynieryjną — dekoder modelu językowego z rodziny Qwen2 zasilany przez konwolucyjne tokenizatory audio, z głowicą dyfuzyjną generującą wyjście we fragmentach trwających około 2,9 sekundy i z wyprzedzeniem około 0,5 sekundy. O ile Parakeet jest stworzonym specjalnie do tego celu modelem mowy, dopracowywanym przez rok rzeczywistych wdrożeń, o tyle VibeVoice-ASR-Streaming-1.5B to punkt kontrolny z rodziny badawczej sprzed dwóch dni.
Asymetria dowodów jest sednem sprawy.
Przeczytaj resztę tej strony, mając przed oczami jeden fakt: liczby w tym porównaniu są tylko po jednej stronie. Po stronie Parakeet TDT 0.6B mamy rok obrony pozycji na liście liderów — średni WER 6,05% w publicznych angielskich zestawach krótkich wypowiedzi Open ASR, około 3386 RTFx przy batchu 128 na sprzęcie NVIDIA oraz ekosystem narzędzi wdrożeniowych NeMo, akceleracji TensorRT i kwantyzacji FP8, który został sprawdzony w produkcji. Po stronie VibeVoice-ASR-Streaming-1.5B mamy wartość ewaluacyjną z karty modelu, która jest obrazem, a nie tekstem, oraz raportowaną przez dostawcę średnią WER 7,77% z karty modelu wsadowego VibeVoice-ASR dla ośmiu angielskich zestawów testowych — liczbę opisującą model niestrumieniowy, której nie można przenieść na ten punkt kontrolny. Pretendent może być znakomity; chodzi o to, że „może być” to cała baza dowodowa.
Sprawdzenie specyfikacji
• Parametry — NVIDIA Parakeet TDT 0.6B: 600M, enkoder FastConformer + dekoder TDT vs VibeVoice-ASR-Streaming-1.5B: ~3B łącznie (backbone Qwen klasy 1.5B plus tokenizery i głowa dyfuzyjna).
• Wydano — 5 maja 2025 vs 2 września 2026.
Dokładność — 6,05% średniego WER, Open ASR #1 od maja 2025, wyniki odtworzone przez stronę trzecią vs. brak publikacji.
• Szybkość — ~3 386 RTFx przy batchu 128 na sprzęcie NVIDIA, ~1 godzina dźwięku na sekundę wobec braku opublikowanej wartości przepustowości.
• Streaming — obsługa strumieniowania z kontekstem pełnej uwagi do 24 minut na przebieg w porównaniu ze strumieniowaniem fragmentarycznym, fragmenty ~2.9 s z wyprzedzeniem ~0.5 s.
Dodatkowe elementy wyjściowe — interpunkcja, kapitalizacja, znaczniki czasu na poziomie słów vs strumieniowe przypisywanie wypowiedzi do mówców (niezweryfikowane) i słowa kluczowe; dziesięć języków.
• Licencja — CC-BY-4.0 vs MIT.
Ekosystem — NVIDIA NeMo z TensorRT i FP8 vs dema z repozytorium microsoft/VibeVoice oraz wtyczka vLLM.


Pod maską: dwie idee o tym, do czego służą modele mowy
Architektury kodują dwa różne przekonania na temat zadania. Parakeet TDT 0.6B traktuje transkrypcję jako problem przetwarzania sygnału rozwiązywany wydajnie: enkoder FastConformer wyodrębnia cechy akustyczne, a dekoder TDT emituje jednocześnie tokeny tekstowe i czasy trwania, dlatego działa tysiące razy szybciej niż w czasie rzeczywistym i dlatego dobrze radzi sobie na stosie wdrożeniowym NVIDIA. VibeVoice-ASR-Streaming-1.5B traktuje transkrypcję jako problem językowy: kompresuje dźwięk do strumienia tokenów, przekazuje go modelowi językowemu, który zapoznał się z kontekstem o objętości transkryptu, i pozwala, aby zrozumienie przez LM tego, kto co mówi i jak rozmowy się ze sobą wiążą, wykonało całą pracę. Baza LLM to także powód, dla którego checkpoint ma ~3 miliardy parametrów, a nie 600 milionów, oraz dlaczego Microsoft nie zadeklarował obecności na brzegu sieci — to model, który chce GPU i wykorzystuje pamięć do przenoszenia kontekstu.
W przypadku transkrypcji na żywo praktyczną konsekwencją jest kształt opóźnienia. Enkoder Parakeet z pełną uwagą może w jednym przebiegu obsłużyć długie okna, co jest odmienną filozofią strumieniowania niż w VibeVoice-ASR-Streaming-1.5B, którego sztywny kontrakt przewiduje podział na fragmenty z wyprzedzeniem (chunk-and-lookahead) obejmujący około 2,9 sekundy audio na emitowany segment. Żaden z nich nie jest systemem strumieniującym częściowe transkrypcje słowo po słowie w stylu komercyjnych interfejsów API o najniższym opóźnieniu; oba to systemy oparte na fragmentach, a właściwy wybór zależy od tego, czy dźwięk dociera jako pliki o skończonej długości, czy jako otwarta sesja na żywo.
Historia funkcji i sąsiedztwa wdrożeń
Od razu po rozpakowaniu Parakeet TDT 0.6B jest pełniejszym produktem do transkrypcji: interpunkcja i wielkie litery są już w transkrypcie, znaczniki czasowe na poziomie słów służą do synchronizacji, a 24-minutowe okna jednoprzebiegowe oznaczają mniej błędów podziału na fragmenty przy długich nagraniach. VibeVoice-ASR-Streaming-1.5B kontruje, oferując funkcje, których Parakeet nie wymienia: przypisywanie wypowiedzi do mówcy i hotwords, w dziesięciu językach. Twierdzenie o strumieniowej diaryzacji to dokładnie taka kwestia, która wymaga niezależnej weryfikacji — to właśnie na granicach fragmentów przypisanie do mówcy się rozjeżdża — ale to właśnie powód, dla którego warto zwrócić uwagę na model Microsoftu, a nie na model firmy NVIDIA, jeśli potrzebujesz wiedzieć, kto co mówi podczas spotkania na żywo.

Środowiska są równie różne, jak same modele. Parakeet TDT 0.6B to obywatel ekosystemu NVIDIA NeMo: TensorRT, FP8 i narzędzia wdrożeniowe dostrojone pod karty GPU NVIDIA, co jest świetnym rozwiązaniem, jeśli już działasz na infrastrukturze NVIDIA. VibeVoice-ASR-Streaming-1.5B mieszka w repozytorium badawczym: udokumentowane ścieżki to dema Pythona od Microsoftu i wtyczka do vLLM, jego klasa architektury nie jest jeszcze uwzględniona w publicznej dokumentacji Transformers, a uruchomienie go wymaga instalacji ze źródeł i samodzielnej weryfikacji, że ścieżka ładowania działa. Dla zespołu, który ceni sobie nudne, udokumentowane wdrożenia, już sama ta różnica może przeważyć nad różnicą w wynikach benchmarków.
Argumenty za obecnym kandydatem, argumenty za pretendentem
Przypadek NVIDIA Parakeet TDT 0.6B to przypadek znanej wielkości: rok obrony pozycji w rankingach, reprodukcja przez strony trzecie, licencja komercyjna, funkcje produkcyjne i ekosystem wdrożeniowy, który wchłonął realny ruch. Jeśli w tym kwartale wdrażasz funkcję transkrypcji angielskiej i chcesz mieć otwarte wagi, to jest to obronny wybór domyślny, a ciężar dowodu spoczywa na wszystkim, co twierdzi, że go zastąpi.
Model VibeVoice-ASR-Streaming-1.5B ma węższe i bardziej konkretne zastosowanie: potrzebujesz strumieniowego przypisywania wypowiedzi do mówców albo hotwordów, potrzebujesz więcej języków niż tylko angielski, albo wierzysz, że podejście do mowy oparte na modelach językowych zwycięży i chcesz wcześnie w to wejść. To zakład, a nie decyzja – nie ma jeszcze żadnych danych liczbowych, które uzasadniałyby skierowanie na niego ruchu produkcyjnego, a sam Microsoft zajmuje tu w pierwszej kolejności postawę badawczą. Żaden z tych modeli nie jest dziś serwowany przez OrcaRouter, więc najtańszym sposobem przetestowania tego zakładu jest schemat, który stosuje się do każdego młodego otwartego modelu: utrzymuj warstwę ASR za jednym API routingu obsługującym 200+ modeli po cenach z cennika dostawcy, bez marży i z automatycznym przełączaniem awaryjnym; kieruj fragment rzeczywistego audio do VibeVoice-ASR-Streaming-1.5B, gdy tylko któryś z dostawców zacznie go hostować; i pozwól, by transkrypcje z twojego własnego ruchu zdecydowały, czy pretendent zasługuje na koronę, którą Parakeet dzierży od szesnastu miesięcy.
