
Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B: dwie tabele wyników, jedno mylące porównanie
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B to transduktor FastConformer-TDT z 600 milionami parametrów, udostępniony 14 sierpnia 2025 r. na licencji CC-BY-4.0, i od ponad roku pozostaje domyślną rekomendacją dla każdego, kto chce samodzielnie prowadzić transkrypcję. Grok Voice Transcribe 2.0 to zarządzany model zamiany mowy na tekst firmy SpaceXAI, wydany 18 września 2026 r., w cenie 0,10 USD za godzinę audio w trybie wsadowym i 0,20 USD za godzinę w trybie strumieniowym, z końcowym współczynnikiem błędów słów na poziomie 2,7% na tablicy wyników Artificial Analysis dla strumieniowania. Jeśli poszukasz porównania między nimi, znajdziesz Parakeet z podanym wynikiem 13,7% WER, a Grok Voice Transcribe 2.0 z 2,7%, co sprawia, że model zarządzany wygląda na pięciokrotnie dokładniejszy, i jest to naprawdę myląca lektura. Te dwie liczby pochodzą z różnych indeksów Artificial Analysis, opartych na różnych zbiorach danych, opublikowanych w odstępie lat, a jedna z nich została zastąpiona nowszymi pomiarami samego dostawcy. Prawdziwe porównanie jest ciekawsze i dotyczy tego, co daje ci 600 megabajtów wag, czego nie może dać API.
Liczba 13,7% i dlaczego nie powinieneś jej używać
Raport Artificial Analysis „State of AI” za III kwartał 2025 r. umieścił NVIDIA Parakeet TDT na trzecim miejscu w swoim indeksie AA-WER z wynikiem 13,7%, za Chirp 2 od Google z 11,6% i własnym Canary Qwen firmy NVIDIA z 13,2%. Indeks ten był średnią ważoną czasem trwania audio obejmującą po około dwie godziny z każdego z zestawów VoxPopuli, Earnings-22 i AMI-SDM — mowy w warunkach rzeczywistych, z różnorodnymi akcentami, słownictwem dziedzinowym i trudnymi warunkami kanału, dlatego każda liczba w nim jest wysoka. Wynik WER 13,7% na AMI-SDM — czyli na audio spotkaniowym z pola dalekiego, nagranym w pogłosowych pomieszczeniach — nie jest złym wynikiem; to trudny test.
Ten indeks nie istnieje już w tej formie. Artificial Analysis przebudowało go jako AA-WER v2, nadając AA-AgentTalk wagę 50%, a VoxPopuli-Cleaned-AA i Earnings22-Cleaned-AA po 25% każdemu, około ośmiu godzin audio, a czyszczenie i ponowne ważenie znacząco zmieniły wyniki każdego modelu. Na obecnej tablicy dla trybu non-streaming Parakeet TDT 0.6B V3 plasuje się w niskich jednocyfrowych wartościach — w tym samym przedziale co inni liderzy wśród modeli z otwartymi wagami — a nie gdziekolwiek blisko 13,7%, a czołówka tablicy spadła do około 2%. Kto nadal podaje 13,7% dla Parakeet, ten cytuje wycofany pomiar, a jeśli porównuje go z wynikiem strumieniowania z 2026 roku, to porównuje także dwa różne rankingi.
To, co można uczciwie zestawić obok siebie, jest węższe. Własna ewaluacja NVIDIA na Open ASR Leaderboard — standardowe, publiczne angielskie zestawy krótkich wypowiedzi, przetworzone przy użyciu narzędzi tego rankingu — podaje średni WER na poziomie 6,32% dla Parakeet TDT 0.6B V3 przy RTFx wynoszącym 3 332,74 oraz średnią 6,05% dla wersji v2 tylko angielskiej. Wynik 2,7% Grok Voice Transcribe 2.0 to wartość dla końcowego transkryptu w rankingu streamingowym, mierzona po zakończeniu wypowiedzi, na angielskim audio konwersacyjnym ważonym pod kątem agenta. Inne zbiory, inny ranking, inny tryb. Model zarządzany jest z dużym prawdopodobieństwem dokładniejszy na audio wspólnym dla obu rankingów; skala tej przewagi nie wynosi 5× i nikt nie opublikował pomiaru, który pozwoliłby to rozstrzygnąć.
Jaki kształt faktycznie mają te dwa modele
Różnica architektoniczna wyjaśnia większość różnicy praktycznej. Parakeet TDT 0.6B to enkoder FastConformer z dekoderem transducera tokenów i czasu trwania — przewiduje zarówno token, jak i liczbę klatek, o które należy się przesunąć, co pozwala mu pomijać, zamiast emitować puste symbole, i to jest główne źródło jego wydajności. Jest dostarczany z automatycznym wykrywaniem języka w 25 językach europejskich, znacznikami czasu na poziomie słów i segmentów, interpunkcją i wielkością liter, a także obsługuje długie audio — do 24 minut przy pełnej uwadze lub około trzech godzin przy uwadze lokalnej. Jest udostępniany przez NeMo 2.2, ma ścieżkę MLX dla Apple Silicon, a także istnieją kompilacje ONNX INT8, które działają na zwykłych procesorach CPU.
Grok Voice Transcribe 2.0 to usługa zarządzana, więc porównanie dotyczy modelu i produktu. Co produkt obejmuje w swojej cenie katalogowej:
• Strumieniowanie — Grok Voice Transcribe 2.0 natywnie przez WebSocket, pierwszy wynik częściowy po 0,49 sekundy w porównaniu z podejściami porcjowanymi lub buforowanymi Parakeet TDT 0.6B, bez pełnoprawnego interfejsu transkrypcji częściowych
• Faworyzowanie kluczowych terminów — do 100 kluczowych terminów na żądanie w przeciwieństwie do braku tej funkcji w Parakeet
• Diaryzacja — wliczona w cenę żądania vs osobny system, który dodajesz samodzielnie
• Kanały — do ośmiu kanałów audio w jednym żądaniu w porównaniu z jednym strumieniem na przebieg
• Odwrotna normalizacja tekstu — uwzględniona w 25 językach, a nie tylko interpunkcja i wielkość liter
• Wdrożenie — zarządzany endpoint w us-east-1 vs wagi, które pobierasz, uruchamiasz i obsługujesz gdziekolwiek
• Licencja — warunki komercyjnego API a CC-BY-4.0 z wymogiem podania autorstwa
• Rozmiar modelu — nieujawniony w porównaniu z około 600 milionami parametrów, około 2,4 GB w fp32 lub 1,2 GB w fp16
Ostatni wiersz decyduje o wielu wdrożeniach. Parakeet TDT 0.6B mieści się w kilku gigabajtach, działa akceptowalnie na CPU laptopa przez ścieżkę INT8 ONNX i bez problemu mieści się na dowolnym GPU klasy konsumenckiej. To nie jest mniejsza wersja tego, co robi API — to inna możliwość, ponieważ stanowi różnicę między funkcją transkrypcji, która działa offline, na urządzeniu, bez sieci i bez kosztu za godzinę, a taką, która tego nie potrafi.

Arytmetyka kosztów, której nikt nie prowadzi poprawnie
Publikowane porównanie brzmi: „0,10 USD za godzinę kontra za darmo”, i jest błędne w obie strony — API to nie jedyne, za co płacisz, a wagi to nie jedyne, na czym oszczędzasz.
• Transkrypcja wsadowa — Grok Voice Transcribe 2.0 po 0,10 USD za godzinę audio, około 1,67 USD za 1000 minut w porównaniu z Parakeet TDT 0.6B bez opłaty licencyjnej plus czas GPU lub CPU
• Streaming — 0,20 USD za godzinę audio, około 3,33 USD za 1000 minut w porównaniu z własnym hostingiem, gdzie ograniczeniem jest własny pułap współbieżności, a nie publikowana stawka
• Limity usługi — 10 żądań na sekundę i 100 równoczesnych sesji strumieniowania na zespół w porównaniu z tym, na co pozwala Twój sprzęt, bez limitu szybkości i bez limitu współbieżności
• Koszt, którego nie ma na żadnym z arkuszy — ani inżynierii, ani stosu do serwowania, ani autoskalowania w kontrze do rotacji dyżurów, ani logiki ponowień, ani aktualizacji modeli, ani GPU, które trzymasz rozgrzane na szczyt.
Przy małych wolumenach strona zarządzana jest prawie zawsze tańsza, ponieważ stałym kosztem ścieżki self-hosted jest jedna osoba. Przy dużych, stałych wolumenach strona self-hosted wygrywa zdecydowanie, a punkt przecięcia jest funkcją wykorzystania, a nie wolumenu audio: GPU, które utrzymujesz zajęte, jest bardzo tanie w przeliczeniu na godzinę audio, a GPU utrzymywane w gotowości na szczytowy ruch już nie. Zespół przetwarzający 20 000 godzin miesięcznie płaci 2000 USD za zarządzaną ścieżkę wsadową, a za self-hosted około jednego GPU-miesiąca średniej klasy plus czas inżynierski — i nie są to nawet zbliżone kwoty.
Powód, dla którego te obliczenia wypadają źle, jest taki, że stronę samodzielnie hostowaną zwykle porównuje się przy zerze, a stronę zarządzaną zwykle przy cenie katalogowej. Żadna z tych wartości nie jest prawdziwą liczbą. Prawdziwe jest to, że 3,332 RTFx modelu Parakeet TDT 0.6B — wynik podany przez NVIDIA, uzyskany wsadowo, na sprzęcie centrów danych, i wartość, którą należy traktować jako górną granicę, a nie obietnicę — oznacza, że pojedyncza, skromna karta GPU może przetworzyć więcej audio, niż generuje większość organizacji.
Gdzie Parakeet przestaje być właściwą odpowiedzią
Trzy rzeczy skłaniają zespół do odejścia od otwartego modelu na rzecz zarządzanego, a dokładność nie jest żadną z nich.
Pierwszym jest biasowanie terminów kluczowych. Jeśli Twoje transkrypcje są pełne nazw produktów, nazwisk, symboli giełdowych lub żargonu branżowego, model bez mechanizmu biasowania będzie je błędnie rozpoznawać, a nie da się temu zaradzić inaczej niż przez dostrajanie. Grok Voice Transcribe 2.0 przyjmuje do 100 terminów kluczowych na żądanie. Parakeet TDT 0.6B nie ma tej funkcji. W przypadku centrów kontaktowych, ochrony zdrowia i pracy prawniczej ta pojedyncza luka jest dyskwalifikująca, niezależnie od tego, co mówi jakikolwiek ranking.
Druga to diaryzacja. Parakeet daje słowa ze znacznikami czasu; nie mówi, kto je wypowiedział. Transkrypcja wielu mówców wymaga uruchomienia osobnego modelu diaryzacji i wyrównania wyników, co jest projektem, a nie opcją konfiguracyjną. Model zarządzany zwraca tekst z przypisaniem mówcy w tym samym żądaniu.
Trzeci to sam interfejs strumieniowy. Parakeet jest wystarczająco szybki, że ludzie budują na nim systemy czasu rzeczywistego — dzielenie audio na fragmenty, uruchamianie modelu na każdym fragmencie, sklejanie wyników — ale zachowanie transkrypcji częściowych, wykrywanie końca tury i semantyka zatwierdzania to wszystko rzeczy, które sam piszesz i utrzymujesz. Grok Voice Transcribe 2.0 zwraca pierwszy wynik częściowy 0,49 sekundy po tym, jak przestaniesz mówić, jako funkcję produktu.
Jest jeszcze szczegół licencyjny, który czasami zaskakuje zespoły: Parakeet TDT 0.6B V3 jest objęty licencją CC-BY-4.0, która zezwala na użycie komercyjne, ale wymaga podania autorstwa, a niektóre modele mowy NVIDIA przeszły od tego czasu na własną licencję Open Model License dostawcy. Jeśli wymóg podania autorstwa stanowi problem dla Twojego produktu, przeczytaj kartę konkretnego checkpointu, zamiast zakładać, że obowiązują warunki dla całej rodziny.

Dlaczego API zwykle i tak wygrywa, a kiedy nie powinno
Wzorzec z ostatniego roku jest spójny: zespoły zaczynają od otwartego modelu, takiego jak Parakeet TDT 0.6B, ponieważ jest darmowy i kontrolowalny, wdrażają funkcję, a potem odkrywają, że bieżącym kosztem nie jest GPU, lecz utrzymanie, i przechodzą na zarządzany endpoint. Odwrotna migracja też się zdarza, zwykle gdy wolumen przekracza próg, przy którym opłata za godzinę zaczyna wyglądać jak czynsz za coś, co mógłbyś posiadać.
Oba kierunki są kosztowne w wykonaniu, jeśli model jest wpięty bezpośrednio w Twoją aplikację, co przemawia za tym, aby miejsce wywołania pozostawało nudne. OrcaRouter udostępnia ponad 200 modeli za jednym kluczem zgodnym z OpenAI, z automatycznym przełączaniem awaryjnym między dostawcami i 0% marży względem ceny katalogowej dostawcy, dzięki czemu wdrożenie samodzielnie hostowane i wdrożenie zarządzane mogą działać za tym samym interfejsem i być podmieniane za pomocą ciągu modelu. Ma to większe znaczenie niż zwykle w przypadku mowy, gdzie pozycja lidera zmienia się co kilka tygodni, a usługa zarządzana w jednym regionie to awaria w jednym regionie — ścieżka przełączania awaryjnego sprawia, że funkcja transkrypcji nie staje się awarią transkrypcji.
Dla zespołów, które chcą przepustowości otwartego modelu bez stosu serwującego, taki jest też kształt tej decyzji: przetestuj Parakeet TDT 0.6B na własnym audio, przetestuj Grok Voice Transcribe 2.0 na tym samym audio i pozwól temu, który wygra, przejąć ruch, a ty przestaniesz się przejmować, którego dostawcy logo na nim widnieje.

Wersja w jednym zdaniu: Parakeet TDT 0.6B wciąż jest najlepszą odpowiedzią na „transkrybuj cokolwiek, gdziekolwiek, bez kosztu za godzinę, na sprzęcie, który już mam”, a Grok Voice Transcribe 2.0 to odpowiedź na „transkrybuj dokładnie, z etykietami mówców i własnym słownictwem, bez uruchamiania czegokolwiek”. Liczba 13,7%, przez którą przepaść wygląda na ogromną, to nieaktualny pomiar, a rzeczywista różnica — gdzieś między jednym a trzema punktami WER w przypadku nakładającego się dźwięku — jest wystarczająco mała, że powinna rozstrzygnąć kwestia operacyjna.
