Artikel-Hero-Karte mit der Aufschrift „Grok Voice Transcribe 2.0 vs. NVIDIA Parakeet TDT 0.6B“, dem Badge „MODELLVERGLEICH“ und dem Untertitel „zwei Bestenlisten, ein irreführender Vergleich“, mit Chips, die 2,7 % Streaming-WER, 6,32 % Open-ASR-Mittelwert, 600 Mio. Parameter unter CC-BY-4.0 und 0,10 $ pro Batch-Stunde anzeigen, über einem Weiß-zu-Blau-Verlauf mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

Grok Voice Transcribe 2.0 vs. NVIDIA Parakeet TDT 0.6B: Zwei Bestenlisten, ein irreführender Vergleich

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

NVIDIA Parakeet TDT 0.6B ist ein FastConformer-TDT-Transducer mit 600 Millionen Parametern, der am 14. August 2025 unter CC-BY-4.0 veröffentlicht wurde und seit über einem Jahr die Standardempfehlung für alle ist, die Transkription selbst ausführen möchten. Grok Voice Transcribe 2.0 ist das managed Speech-to-Text-Modell von SpaceXAI, ausgeliefert am 18. September 2026, mit einem Preis von 0,10 $ pro Audio-Stunde für Batch und 0,20 $ pro Stunde für Streaming, und einer finalen Wortfehlerrate von 2,7 % auf dem Streaming-Board von Artificial Analysis. Wenn Sie nach einem Vergleich zwischen ihnen suchen, finden Sie Parakeet mit 13,7 % WER und Grok Voice Transcribe 2.0 mit 2,7 % angegeben, was das managed Modell fünfmal genauer erscheinen lässt und beim Lesen wirklich irreführend ist. Diese beiden Zahlen stammen aus verschiedenen Indizes von Artificial Analysis, basieren auf unterschiedlichen Datensätzen, wurden Jahre auseinander veröffentlicht, und eine von ihnen wurde durch neuere Messungen des Anbieters selbst überholt. Der eigentliche Vergleich ist interessanter, und es geht darum, was Ihnen 600 Megabyte an Gewichten bieten, was eine API nicht kann.

Die Zahl 13,7 % – und warum Sie sie nicht verwenden sollten.

Der Bericht „State of AI“ von Artificial Analysis für Q3 2025 setzte NVIDIA Parakeet TDT mit 13,7 % in seinem AA-WER-Index auf den dritten Platz, hinter Google Chirp 2 mit 11,6 % und NVIDIAs eigenem Canary Qwen mit 13,2 %. Dieser Index war ein nach Audiodauer gewichteter Durchschnitt über jeweils etwa zwei Stunden aus VoxPopuli, Earnings-22 und AMI-SDM – reale Sprache mit unterschiedlichen Akzenten, domänenspezifischem Vokabular und schwierigen Kanalbedingungen, weshalb jeder Wert darin hoch ist. Ein WER von 13,7 % bei AMI-SDM, bei dem es sich um Fernfeld-Meeting-Audio handelt, das in halligen Räumen aufgenommen wurde, ist kein schlechtes Ergebnis; es ist ein harter Test.

Dieser Index existiert in dieser Form nicht mehr. Artificial Analysis hat ihn als AA-WER v2 neu aufgebaut, mit AA-AgentTalk zu 50 % gewichtet sowie VoxPopuli-Cleaned-AA und Earnings22-Cleaned-AA zu jeweils 25 %, etwa acht Stunden Audio, und die Bereinigung und Neugewichtung haben den Wert jedes Modells erheblich verändert. Im aktuellen Nicht-Streaming-Board liegt Parakeet TDT 0.6B V3 im niedrigen einstelligen Prozentbereich – im selben Bereich wie andere führende Open-Weights-Modelle – statt auch nur annähernd bei 13,7 %, und die Spitze des Boards ist auf etwa 2 % gesunken. Wer für Parakeet noch immer 13,7 % zitiert, zitiert eine ausgemusterte Messung, und wenn man sie mit einer Streaming-Zahl aus 2026 vergleicht, vergleicht man außerdem zwei verschiedene Boards miteinander.

Was man ehrlich nebeneinanderstellen kann, ist enger gefasst. NVIDIAs eigene Auswertung auf dem Open ASR Leaderboard – den standardmäßigen öffentlichen englischen Kurzform-Datensätzen, ausgeführt mit den Tools dieses Leaderboards – weist eine mittlere WER von 6,32 % für Parakeet TDT 0.6B V3 bei einem RTFx von 3.332,74 sowie einen Mittelwert von 6,05 % für die English-only v2 aus. Die 2,7 % von Grok Voice Transcribe 2.0 sind ein Endtranskript-Wert auf dem Streaming-Board, gemessen nach dem Ende der Sprachäußerung, bei agentengewichtetem englischem Konversationsaudio. Andere Datensätze, anderes Board, anderer Modus. Das Managed-Modell ist bei dem Audio, das sich die beiden Boards teilen, sehr wahrscheinlich genauer; die Größe dieses Vorteils beträgt nicht das 5-Fache, und niemand hat die Messung veröffentlicht, die das entscheiden würde.

Wie die beiden Modelle tatsächlich geformt sind

Der architektonische Unterschied erklärt den größten Teil des praktischen Unterschieds. Parakeet TDT 0.6B ist ein FastConformer-Encoder mit einem Token-and-Duration-Transducer-Decoder – er sagt sowohl ein Token als auch die Anzahl der Frames voraus, um die weitergerückt werden soll, wodurch er Blanks überspringen kann, statt sie auszugeben, und das ist die Hauptquelle seiner Effizienz. Er wird mit automatischer Sprachenerkennung für 25 europäische Sprachen, Zeitstempeln auf Wort- und Segmentebene sowie Interpunktion und Groß-/Kleinschreibung ausgeliefert und verarbeitet lange Audiodaten – bis zu 24 Minuten mit voller Attention oder etwa drei Stunden mit lokaler Attention. Er wird über NeMo 2.2 bereitgestellt, verfügt über einen MLX-Pfad für Apple Silicon, und es gibt ONNX-INT8-Builds, die auf einfachen CPUs laufen.

Grok Voice Transcribe 2.0 ist ein Managed Service, daher handelt es sich um einen Vergleich zwischen einem Modell und einem Produkt. Was das Produkt zum Listenpreis beinhaltet:

• Streaming — Grok Voice Transcribe 2.0 nativ über WebSocket, erstes Teiltranskript nach 0,49 Sekunden gegenüber den gechunkten oder gepufferten Ansätzen von Parakeet TDT 0.6B, ohne erstklassige Schnittstelle für Teiltranskripte

• Bevorzugung von Schlüsselbegriffen — bis zu 100 Schlüsselbegriffe pro Anfrage vs. keine Parakeet-Funktion

• Diarisierung — im Angebotspreis enthalten vs. ein separates System, das Sie selbst hinzufügen

• Kanäle — bis zu acht Audiokanäle in einer Anfrage im Vergleich zu einem Stream pro Durchlauf

• Inverse Textnormalisierung — in 25 Sprachen enthalten, im Vergleich zu nur Interpunktion und Groß-/Kleinschreibung

• Bereitstellung — ein verwalteter Endpunkt in us-east-1 im Vergleich zu Gewichten, die Sie herunterladen, ausführen und überall betreiben

• Lizenz — kommerzielle API-Bedingungen vs. CC-BY-4.0 mit Namensnennung

• Modellgröße — nicht offengelegt vs. etwa 600 Millionen Parameter, ungefähr 2,4 GB in fp32 oder 1,2 GB in fp16

Die letzte Zeile ist diejenige, die über viele Bereitstellungen entscheidet. Parakeet TDT 0.6B passt in ein paar Gigabyte, läuft über den INT8-ONNX-Pfad akzeptabel auf einer Laptop-CPU und passt bequem auf jede Consumer-GPU. Das ist keine kleinere Version dessen, was die API tut – es ist eine andere Fähigkeit, denn es ist der Unterschied zwischen einer Transkriptionsfunktion, die offline auf einem Gerät funktioniert, ohne Netzwerk und ohne Kosten pro Stunde, und einer, die das nicht tut.

Screenshot of the Hugging Face model page for nvidia/parakeet-tdt-0.6b-v2, showing the CC-BY-4.0 licence tag, the English language tag, the FastConformer-TDT architecture and 0.6B parameter fields, a callout reading 'NEW: Multilingual Parakeet TDT 0.6B V3 is now available! 25 European Languages', a description stating an RTFx of 3380 on the HF-Open-ASR leaderboard at batch size 128 with transcription of segments up to 24 minutes in a single pass, and a notice that no inference provider deploys it.

Die Kostenrechnung, die niemand richtig durchführt

Der Vergleich, der dann veröffentlicht wird, lautet „0,10 Dollar pro Stunde gegenüber kostenlos“, und er ist in beide Richtungen falsch – die API ist nicht das Einzige, wofür man bezahlt, und die Gewichte sind nicht das Einzige, woran man spart.

• Batch-Transkription — Grok Voice Transcribe 2.0 zu $0.10 pro Audio-Stunde, etwa $1.67 pro 1.000 Minuten gegenüber Parakeet TDT 0.6B ohne Lizenzgebühr plus GPU- oder CPU-Zeit

• Streaming — 0,20 $ pro Audio-Stunde, etwa 3,33 $ pro 1.000 Minuten, im Vergleich zu selbst gehostet, wo nicht ein veröffentlichter Tarif, sondern Ihr eigenes Parallelitätslimit die Grenze darstellt

• Service-Limits — 10 Anfragen pro Sekunde und 100 gleichzeitige Streaming-Sitzungen pro Team gegenüber dem, was Ihre Hardware zulässt, ohne Rate-Limit und ohne Parallelitätsbegrenzung

• Die Kosten, die auf keinem der beiden Blätter auftauchen – kein Engineering, kein Serving-Stack, kein Autoscaling gegenüber der On-Call-Rotation, die Retry-Logik, die Modell-Updates und die GPU, die du für Spitzenlast warm hältst

Bei kleinen Mengen ist die Managed-Seite fast immer günstiger, weil der feste Kostenfaktor beim Selbsthosting eine Person ist. Bei großen, gleichmäßigen Mengen gewinnt die selbst gehostete Seite eindeutig, und der Umschlagpunkt ist eine Funktion der Auslastung und nicht der Audiomenge: Eine GPU, die man beschäftigt hält, ist sehr günstig pro Stunde Audio, eine, die man für Spitzenlast warmhält, nicht. Ein Team, das 20.000 Stunden pro Monat verarbeitet, zahlt 2.000 $ für den Managed-Batch-Pfad und ungefähr einen Mittelklasse-GPU-Monat plus Engineering-Zeit für den selbst gehosteten Weg, was nicht annähernd gleichauf liegt.

Der Grund, warum die Rechnung schlecht ausfällt, ist, dass die selbst gehostete Seite üblicherweise mit null angesetzt wird und die Managed-Seite üblicherweise mit Listenpreis. Keines von beidem ist eine reale Zahl. Real ist, dass die 3.332 RTFx von Parakeet TDT 0.6B – NVIDIAs Angabe, gebatcht, auf Rechenzentrums-Hardware, und die als Obergrenze statt als Versprechen zu behandeln ist – bedeuten, dass eine einzelne bescheidene GPU mehr Audio verarbeiten kann, als die meisten Organisationen erzeugen.

Wo Parakeet nicht mehr die richtige Antwort ist

Drei Dinge bringen ein Team dazu, vom offenen Modell abzulassen und zu einem verwalteten zu wechseln, und keines davon ist Genauigkeit.

Das erste ist Key-Term-Biasing. Wenn Ihre Transkripte voller Produktnamen, Nachnamen, Tickersymbole oder Fachjargon sind, wird ein Modell ohne Biasing-Mechanismus sie falsch wiedergeben, und es gibt keine Abhilfe außer Fine-Tuning. Grok Voice Transcribe 2.0 akzeptiert bis zu 100 Schlüsselbegriffe pro Anfrage. Parakeet TDT 0.6B bietet diese Funktion nicht. Für Contact-Center, das Gesundheitswesen und juristische Arbeit ist diese einzige Lücke ein Ausschlusskriterium, egal, was irgendein Leaderboard sagt.

Das zweite ist die Diarisierung. Parakeet liefert Ihnen Wörter mit Zeitstempeln; es sagt Ihnen nicht, wer sie gesagt hat. Transkription mit mehreren Sprechern bedeutet, ein separates Diarisierungsmodell auszuführen und die Ausgabe abzugleichen, was eher ein Projekt als eine Konfigurationsoption ist. Das verwaltete Modell liefert Text mit Sprecherzuordnung in derselben Anfrage.

Der dritte Punkt ist die Streaming-Schnittstelle selbst. Parakeet ist schnell genug, dass Leute Echtzeitsysteme darauf aufbauen – Audio in Chunks zerlegen, das Modell auf jeden Chunk anwenden, die Ausgabe zusammensetzen –, aber das Verhalten bei Teiltranskripten, die Erkennung des Turn-Endes und die Commitment-Semantik sind alles Dinge, die man selbst schreibt und pflegt. Grok Voice Transcribe 2.0 liefert 0,49 Sekunden, nachdem Sie aufhören zu sprechen, ein erstes Teiltranskript zurück – als Produktfunktion.

Es gibt außerdem ein Lizenzdetail, das Teams gelegentlich überrascht: Parakeet TDT 0.6B V3 steht unter CC-BY-4.0, was kommerzielle Nutzung erlaubt, aber eine Namensnennung verlangt, und einige NVIDIA-Sprachmodelle sind inzwischen stattdessen zur eigenen Open Model License des Anbieters gewechselt. Wenn die Namensnennung für Ihr Produkt ein Problem darstellt, lesen Sie die Modellkarte für den konkreten Checkpoint, statt anzunehmen, dass die Bedingungen der Modellfamilie gelten.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, diarization included, 100 key terms included, $0.10 per batch hour, managed in us-east-1. The right column gives NVIDIA Parakeet TDT 0.6B the rows: mean WER 6.32% Open ASR, speed 3,332 RTFx batched, diarization not included, no key-term biasing, CC-BY-4.0 weights where you pay compute, 600M params self-hosted anywhere. A footer reads 'Parakeet figures NVIDIA-reported on the Open ASR Leaderboard; Grok figures per Artificial Analysis.'

Warum die API meist trotzdem gewinnt und wann sie es nicht sollte

Das Muster war im letzten Jahr beständig: Teams beginnen mit einem offenen Modell wie Parakeet TDT 0.6B, weil es kostenlos und kontrollierbar ist, liefern die Funktion aus und stellen dann fest, dass die laufenden Kosten nicht die GPU, sondern die Wartung sind, und wechseln zu einem Managed Endpoint. Auch die umgekehrte Migration kommt vor, meist wenn das Volumen eine Schwelle überschreitet, ab der die stündliche Gebühr beginnt, wie Miete für etwas zu wirken, das man besitzen könnte.

Beide Richtungen sind teuer auszuführen, wenn das Modell direkt in Ihre Anwendung verdrahtet ist, was das Argument dafür ist, die Aufrufstelle langweilig zu halten. OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel bereit, mit automatischem Failover über Anbieter hinweg und 0 % Aufschlag auf den Listenpreis des Anbieters, sodass eine selbst gehostete Bereitstellung und eine verwaltete hinter derselben Schnittstelle sitzen und mit einem Modell-String ausgetauscht werden können. Das ist in der Sprachverarbeitung wichtiger als üblich, wo die Bestenliste alle paar Wochen einen neuen Spitzenreiter bekommt und ein auf eine einzige Region beschränkter Managed Service ein Ausfall in einer einzigen Region ist – der Failover-Pfad sorgt dafür, dass aus einem Transkriptionsfeature kein Transkriptionsausfall wird.

Für Teams, die den Durchsatz des offenen Modells ohne den Serving-Stack wollen, hat auch die Entscheidung diese Form: Benchmarken Sie Parakeet TDT 0.6B mit Ihrem eigenen Audio, benchmarken Sie Grok Voice Transcribe 2.0 mit demselben Audio, und lassen Sie den Gewinner den Traffic behalten, während Sie aufhören, sich darum zu kümmern, welches Anbieterlogo darauf prangt.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Non-streaming filter selected, showing the WER Index (Non-streaming), Speed Factor and Price highlight cards, the 'See Streaming Benchmarks' toggle, and the Artificial Analysis Word Error Rate Index (Non-streaming) chart with Parakeet TDT 0.6B V3 appearing among the ranked model bars.

Wenn Sie die Ein-Zeilen-Version möchten: Parakeet TDT 0.6B ist nach wie vor die beste Antwort auf „alles überall transkribieren, ohne Kosten pro Stunde, auf Hardware, die ich bereits besitze“, und Grok Voice Transcribe 2.0 ist die Antwort auf „präzise transkribieren mit Sprecherlabels und meinem eigenen Vokabular, ohne irgendetwas laufen zu lassen“. Die Zahl von 13,7 %, die die Kluft riesig erscheinen lässt, ist eine nicht mehr verwendete Messung, und die ehrliche Kluft – irgendwo zwischen einem und drei Punkten WER bei sich überlappendem Audio – ist klein genug, dass die operative Frage den Ausschlag geben sollte.