Artikelhjältekort med texten ”Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B”, med märket ”MODJÄMFÖRELSE” och underrubriken ”två topplistor, en missvisande jämförelse”, med chips som visar 2,7 % strömnings-WER, 6,32 % Open ASR-medelvärde, 600M parametrar under CC-BY-4.0 och 0,10 USD per batchtimme, över en vit-till-blå gradient med OrcaRouter-logotypen nere till höger.
Guides & Insights

Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B: Två ledartavlor, en vilseledande jämförelse

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

NVIDIA Parakeet TDT 0.6B är en FastConformer-TDT-transducer med 600 miljoner parametrar som släpptes den 14 augusti 2025 under CC-BY-4.0, och den har i över ett år varit standardrekommendationen för alla som vill köra transkribering själva. Grok Voice Transcribe 2.0 är SpaceXAI:s hanterade tal-till-text-modell, släppt den 18 september 2026, med ett pris på 0,10 USD per ljudtimme för batch och 0,20 USD per timme för streaming, med en slutlig ordfelsfrekvens på 2,7 % på streamingtavlan från Artificial Analysis. Om du söker efter en jämförelse mellan dem hittar du Parakeet angiven med 13,7 % WER och Grok Voice Transcribe 2.0 med 2,7 %, vilket får den hanterade modellen att framstå som fem gånger mer träffsäker och är en verkligt vilseledande sak att läsa. De två siffrorna kommer från olika Artificial Analysis-index, byggda på olika datamängder, publicerade med flera års mellanrum, och ett av dem har ersatts av leverantörens egna nyare mätningar. Den verkliga jämförelsen är mer intressant, och den handlar om vad 600 megabyte vikter ger dig som ett API inte kan ge.

Siffran 13,7 % och varför du inte bör använda den

Artificial Analysis Q3 2025 State of AI-rapport placerade NVIDIA Parakeet TDT på tredje plats i sitt AA-WER-index med 13,7 %, efter Googles Chirp 2 på 11,6 % och NVIDIAs eget Canary Qwen på 13,2 %. Indexet var ett ljudlängdsviktat medelvärde över ungefär två timmar vardera av VoxPopuli, Earnings-22 och AMI-SDM – verkligt tal med varierande accenter, domänvokabulär och svåra kanalförhållanden, vilket förklarar varför varje värde i det är högt. En WER på 13,7 % på AMI-SDM, som är mötesljud i fjärrfält inspelat i efterklangsrika rum, är inte ett dåligt resultat; det är ett svårt test.

Det indexet finns inte längre i den formen. Artificial Analysis byggde om det som AA-WER v2, viktade AA-AgentTalk till 50 %, med VoxPopuli-Cleaned-AA och Earnings22-Cleaned-AA till 25 % vardera, cirka åtta timmars ljud, och rensningen och omviktningen förändrade varje modells siffra avsevärt. På den aktuella icke-strömmande topplistan ligger Parakeet TDT 0.6B V3 på låga ensiffriga procent — samma intervall som andra ledande modeller med öppna vikter — snarare än någonstans i närheten av 13,7 %, och toppen av listan ligger runt 2 %. Den som fortfarande citerar 13,7 % för Parakeet citerar ett utgånget mått, och om de jämför det med ett strömningsresultat från 2026 jämför de också mellan två olika topplistor.

Det som med ärlighet kan ställas sida vid sida är mer begränsat. NVIDIAs egen utvärdering på Open ASR Leaderboard – de vanliga offentliga engelska kortformatuppsättningarna, körda genom den tavlans verktyg – rapporterar en genomsnittlig WER på 6,32 % för Parakeet TDT 0.6B V3 med en RTFx på 3 332,74, och ett genomsnitt på 6,05 % för den engelskspråkiga v2. Grok Voice Transcribe 2.0:s 2,7 % är en siffra för slutlig transkription på streamingtavlan, mätt efter talets slut, på agentviktat engelskt samtalsljud. Olika uppsättningar, olika tavla, olika läge. Den hanterade modellen är med stor sannolikhet mer träffsäker på det ljud som de två tavlorna delar; storleken på den fördelen är inte 5×, och ingen har publicerat mätningen som skulle avgöra saken.

Hur de två modellerna faktiskt är formade

Den arkitektoniska skillnaden förklarar större delen av den praktiska skillnaden. Parakeet TDT 0.6B är en FastConformer-kodare med en token-och-varaktighets-transduceravkodare – den förutsäger både en token och hur många ramar den ska avancera, vilket gör att den kan hoppa över i stället för att skicka ut tomma symboler, och det är den främsta källan till dess effektivitet. Den levereras med automatisk språkidentifiering för 25 europeiska språk, tidsstämplar på ord- och segmentnivå, interpunktion och versalisering, och den hanterar långt ljud – upp till 24 minuter med full attention, eller runt tre timmar med lokal attention. Den tillhandahålls via NeMo 2.2, har en MLX-väg för Apple Silicon, och det finns ONNX INT8-byggen som körs på vanliga processorer.

Grok Voice Transcribe 2.0 är en hanterad tjänst, så jämförelsen är mellan en modell och en produkt. Vad som ingår i produkten till dess listpris:

• Strömning – Grok Voice Transcribe 2.0 native över WebSocket, första partiella resultatet vid 0,49 sekunder jämfört med Parakeet TDT 0.6B:s chunkade eller buffrade metoder, utan ett förstklassigt gränssnitt för partiella transkript

• Biasering av nyckeltermer – upp till 100 nyckeltermer per begäran jämfört med att Parakeet inte har funktionen

• Diarisering – ingår i priset för förfrågan jämfört med ett separat system som du själv lägger till

• Kanaler – upp till åtta ljudkanaler i en begäran jämfört med en ström per pass

• Invers textnormalisering — ingår för 25 språk jämfört med enbart interpunktion och versalisering

• Driftsättning — en hanterad slutpunkt i us-east-1 jämfört med vikter du laddar ner, kör och driftar var som helst

• Licens — kommersiella API-villkor kontra CC-BY-4.0 med attribution

• Modellstorlek — ej angiven vs cirka 600 miljoner parametrar, ungefär 2,4 GB i fp32 eller 1,2 GB i fp16

Den sista raden är den som avgör många driftsättningar. Parakeet TDT 0.6B ryms i ett par gigabyte, körs acceptabelt på en bärbar dators CPU via INT8 ONNX-vägen och ryms med god marginal på alla konsument-GPU:er. Det är inte en mindre version av vad API:et gör – det är en annan förmåga, eftersom det är skillnaden mellan en transkriberingsfunktion som fungerar offline, på en enhet, utan nätverk och utan kostnad per timme, och en som inte gör det.

Screenshot of the Hugging Face model page for nvidia/parakeet-tdt-0.6b-v2, showing the CC-BY-4.0 licence tag, the English language tag, the FastConformer-TDT architecture and 0.6B parameter fields, a callout reading 'NEW: Multilingual Parakeet TDT 0.6B V3 is now available! 25 European Languages', a description stating an RTFx of 3380 on the HF-Open-ASR leaderboard at batch size 128 with transcription of segments up to 24 minutes in a single pass, and a notice that no inference provider deploys it.

Kostnadsaritmetiken som ingen utför ordentligt

Jämförelsen som publiceras är "$0,10 i timmen mot gratis", och den är fel i båda riktningarna – API:t är inte det enda du betalar för, och vikterna är inte det enda du sparar på.

• Batchtranskribering — Grok Voice Transcribe 2.0 för 0,10 USD per ljudtimme, cirka 1,67 USD per 1 000 minuter jämfört med Parakeet TDT 0.6B utan licensavgift plus GPU- eller CPU-tid

• Streaming – 0,20 USD per ljudtimme, cirka 3,33 USD per 1 000 minuter jämfört med självhostad lösning, där begränsningen är ditt eget samtidighetstak snarare än en publicerad taxa

• Tjänstegränser — 10 förfrågningar per sekund och 100 samtidiga strömningssessioner per team, jämfört med vad din hårdvara tillåter, utan hastighetsbegränsning och utan samtidighetstak

• Kostnaden som inte står på något av de båda bladen – ingen ingenjörskonst, ingen serving-stack, ingen autoskalning kontra jourrotationen, retry-logiken, modelluppdateringarna och GPU:n du håller varm för toppbelastning

Vid små volymer är den hanterade sidan nästan alltid billigare, eftersom den egenhostade vägens fasta kostnad är en person. Vid stora stabila volymer vinner den egenhostade sidan avgjort, och brytpunkten är en funktion av utnyttjandegrad snarare än ljudvolym: en GPU som du håller upptagen är mycket billig per ljudtimme, medan en som du håller varm för topptrafik inte är det. Ett team som bearbetar 20 000 timmar i månaden betalar 2 000 USD för den hanterade batchvägen och ungefär en mellanklass-GPU-månad plus ingenjörstid för den egenhostade, vilket inte är i närheten.

Anledningen till att kalkylen blir fel är att den självhostade sidan vanligtvis jämförs vid noll, och den hanterade sidan vanligtvis jämförs till listpris. Ingendera är en verklig siffra. Vad som är verkligt är att Parakeet TDT 0.6B:s 3 332 RTFx — NVIDIA:s siffra, batchad, på datacenterhårdvara, och den man bör behandla som en övre gräns snarare än ett löfte — innebär att en enda blygsam GPU kan bearbeta mer ljud än de flesta organisationer genererar.

Där Parakeet slutar vara rätt svar

Tre saker driver ett team bort från den öppna modellen och över till en hanterad, och ingen av dem är noggrannhet.

Det första är biasering av nyckeltermer. Om dina transkriptioner är fulla av produktnamn, efternamn, tickersymboler eller domänjargong kommer en modell utan biaseringsmekanism att återge dem fel, utan annan åtgärd än finjustering. Grok Voice Transcribe 2.0 tar upp till 100 nyckeltermer per begäran. Parakeet TDT 0.6B har inte funktionen. För kontaktcenter, hälso- och sjukvård samt juridiskt arbete är den där enda luckan diskvalificerande, oavsett vad någon resultattavla säger.

Det andra är diarisering. Parakeet ger dig ord med tidsstämplar; den berättar inte vem som sa dem. Transkribering med flera talare innebär att köra en separat diariseringsmodell och matcha utdata, vilket är ett projekt snarare än ett konfigurationsalternativ. Den hanterade modellen returnerar text med angiven talare i samma anrop.

Den tredje är själva streaminggränssnittet. Parakeet är tillräckligt snabbt för att folk bygger realtidssystem på det – dela upp ljudet i chunkar, köra modellen på varje chunk, foga samman utdata – men beteendet för partiella transkriptioner, detekteringen av turslut och åtagandesemantiken är allt sådant du skriver och underhåller. Grok Voice Transcribe 2.0 returnerar en första partiell transkription 0,49 sekunder efter att du slutar tala, som en produktfunktion.

Det finns också en licensdetalj som ibland överraskar team: Parakeet TDT 0.6B V3 är CC-BY-4.0, vilket tillåter kommersiell användning men kräver attribution, och några av Nvidias talmodeller har sedan dess i stället övergått till leverantörens egen Open Model License. Om attribution är ett problem för din produkt bör du läsa modellkortet för den specifika checkpointen i stället för att anta att familjens villkor gäller.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, diarization included, 100 key terms included, $0.10 per batch hour, managed in us-east-1. The right column gives NVIDIA Parakeet TDT 0.6B the rows: mean WER 6.32% Open ASR, speed 3,332 RTFx batched, diarization not included, no key-term biasing, CC-BY-4.0 weights where you pay compute, 600M params self-hosted anywhere. A footer reads 'Parakeet figures NVIDIA-reported on the Open ASR Leaderboard; Grok figures per Artificial Analysis.'

Varför API:et ändå oftast vinner, och när det inte borde

Mönstret det senaste året har varit konsekvent: team börjar med en öppen modell som Parakeet TDT 0.6B eftersom den är gratis och kontrollerbar, levererar funktionen och upptäcker sedan att den löpande kostnaden inte är GPU:n utan underhållet, och migrerar till en hanterad slutpunkt. Den omvända migreringen sker också, vanligtvis när volymen passerar en tröskel där timavgiften börjar likna hyra för något man skulle kunna äga.

Båda riktningarna är dyra att genomföra om modellen kopplas direkt in i din applikation, vilket är argumentet för att hålla anropsplatsen tråkig. OrcaRouter exponerar 200+ modeller bakom en enda OpenAI-kompatibel nyckel med automatisk failover mellan leverantörer och 0 % påslag på leverantörernas listpris, så en egenhostad driftsättning och en hanterad kan ligga bakom samma gränssnitt och bytas ut med en modellsträng. Det spelar större roll än vanligt inom tal, där topplistan byter ägare med några veckors mellanrum och en hanterad tjänst i en enda region är ett avbrott i en enda region — failover-vägen är det som hindrar en transkriberingsfunktion från att bli ett transkriberingsavbrott.

För team som vill ha genomströmningen hos den öppna modellen utan serveringsstacken är det också formen på beslutet: benchmarka Parakeet TDT 0.6B på ditt eget ljud, benchmarka Grok Voice Transcribe 2.0 på samma ljud, och låt den som vinner behålla trafiken medan du slutar bry dig om vilken leverantörs logotyp som sitter på den.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Non-streaming filter selected, showing the WER Index (Non-streaming), Speed Factor and Price highlight cards, the 'See Streaming Benchmarks' toggle, and the Artificial Analysis Word Error Rate Index (Non-streaming) chart with Parakeet TDT 0.6B V3 appearing among the ranked model bars.

Om du vill ha enradsversionen: Parakeet TDT 0.6B är fortfarande det bästa svaret på "transkribera vad som helst, var som helst, utan kostnad per timme, på hårdvara jag redan äger", och Grok Voice Transcribe 2.0 är svaret på "transkribera korrekt med talaretiketter och min egen vokabulär, utan att köra något." Siffran 13,7 % som får gapet att verka enormt är ett pensionerat mått, och det ärliga gapet – någonstans mellan en och tre punkter i WER på överlappande ljud – är tillräckligt litet för att den operativa frågan bör avgöra saken.