
Grok Voice Transcribe 2.0 vs. NVIDIA Parakeet TDT 0.6B: Zwei Bestenlisten, ein irreführender Vergleich
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B ist ein FastConformer-TDT-Transducer mit 600 Millionen Parametern, der am 14. August 2025 unter CC-BY-4.0 veröffentlicht wurde und seit über einem Jahr die Standardempfehlung für alle ist, die Transkription selbst ausführen möchten. Grok Voice Transcribe 2.0 ist das managed Speech-to-Text-Modell von SpaceXAI, ausgeliefert am 18. September 2026, mit einem Preis von 0,10 $ pro Audio-Stunde für Batch und 0,20 $ pro Stunde für Streaming, und einer finalen Wortfehlerrate von 2,7 % auf dem Streaming-Board von Artificial Analysis. Wenn Sie nach einem Vergleich zwischen ihnen suchen, finden Sie Parakeet mit 13,7 % WER und Grok Voice Transcribe 2.0 mit 2,7 % angegeben, was das managed Modell fünfmal genauer erscheinen lässt und beim Lesen wirklich irreführend ist. Diese beiden Zahlen stammen aus verschiedenen Indizes von Artificial Analysis, basieren auf unterschiedlichen Datensätzen, wurden Jahre auseinander veröffentlicht, und eine von ihnen wurde durch neuere Messungen des Anbieters selbst überholt. Der eigentliche Vergleich ist interessanter, und es geht darum, was Ihnen 600 Megabyte an Gewichten bieten, was eine API nicht kann.
Die Zahl 13,7 % – und warum Sie sie nicht verwenden sollten.
Der Bericht „State of AI“ von Artificial Analysis für Q3 2025 setzte NVIDIA Parakeet TDT mit 13,7 % in seinem AA-WER-Index auf den dritten Platz, hinter Google Chirp 2 mit 11,6 % und NVIDIAs eigenem Canary Qwen mit 13,2 %. Dieser Index war ein nach Audiodauer gewichteter Durchschnitt über jeweils etwa zwei Stunden aus VoxPopuli, Earnings-22 und AMI-SDM – reale Sprache mit unterschiedlichen Akzenten, domänenspezifischem Vokabular und schwierigen Kanalbedingungen, weshalb jeder Wert darin hoch ist. Ein WER von 13,7 % bei AMI-SDM, bei dem es sich um Fernfeld-Meeting-Audio handelt, das in halligen Räumen aufgenommen wurde, ist kein schlechtes Ergebnis; es ist ein harter Test.
Dieser Index existiert in dieser Form nicht mehr. Artificial Analysis hat ihn als AA-WER v2 neu aufgebaut, mit AA-AgentTalk zu 50 % gewichtet sowie VoxPopuli-Cleaned-AA und Earnings22-Cleaned-AA zu jeweils 25 %, etwa acht Stunden Audio, und die Bereinigung und Neugewichtung haben den Wert jedes Modells erheblich verändert. Im aktuellen Nicht-Streaming-Board liegt Parakeet TDT 0.6B V3 im niedrigen einstelligen Prozentbereich – im selben Bereich wie andere führende Open-Weights-Modelle – statt auch nur annähernd bei 13,7 %, und die Spitze des Boards ist auf etwa 2 % gesunken. Wer für Parakeet noch immer 13,7 % zitiert, zitiert eine ausgemusterte Messung, und wenn man sie mit einer Streaming-Zahl aus 2026 vergleicht, vergleicht man außerdem zwei verschiedene Boards miteinander.
Was man ehrlich nebeneinanderstellen kann, ist enger gefasst. NVIDIAs eigene Auswertung auf dem Open ASR Leaderboard – den standardmäßigen öffentlichen englischen Kurzform-Datensätzen, ausgeführt mit den Tools dieses Leaderboards – weist eine mittlere WER von 6,32 % für Parakeet TDT 0.6B V3 bei einem RTFx von 3.332,74 sowie einen Mittelwert von 6,05 % für die English-only v2 aus. Die 2,7 % von Grok Voice Transcribe 2.0 sind ein Endtranskript-Wert auf dem Streaming-Board, gemessen nach dem Ende der Sprachäußerung, bei agentengewichtetem englischem Konversationsaudio. Andere Datensätze, anderes Board, anderer Modus. Das Managed-Modell ist bei dem Audio, das sich die beiden Boards teilen, sehr wahrscheinlich genauer; die Größe dieses Vorteils beträgt nicht das 5-Fache, und niemand hat die Messung veröffentlicht, die das entscheiden würde.
Wie die beiden Modelle tatsächlich geformt sind
Der architektonische Unterschied erklärt den größten Teil des praktischen Unterschieds. Parakeet TDT 0.6B ist ein FastConformer-Encoder mit einem Token-and-Duration-Transducer-Decoder – er sagt sowohl ein Token als auch die Anzahl der Frames voraus, um die weitergerückt werden soll, wodurch er Blanks überspringen kann, statt sie auszugeben, und das ist die Hauptquelle seiner Effizienz. Er wird mit automatischer Sprachenerkennung für 25 europäische Sprachen, Zeitstempeln auf Wort- und Segmentebene sowie Interpunktion und Groß-/Kleinschreibung ausgeliefert und verarbeitet lange Audiodaten – bis zu 24 Minuten mit voller Attention oder etwa drei Stunden mit lokaler Attention. Er wird über NeMo 2.2 bereitgestellt, verfügt über einen MLX-Pfad für Apple Silicon, und es gibt ONNX-INT8-Builds, die auf einfachen CPUs laufen.
Grok Voice Transcribe 2.0 ist ein Managed Service, daher handelt es sich um einen Vergleich zwischen einem Modell und einem Produkt. Was das Produkt zum Listenpreis beinhaltet:
• Streaming — Grok Voice Transcribe 2.0 nativ über WebSocket, erstes Teiltranskript nach 0,49 Sekunden gegenüber den gechunkten oder gepufferten Ansätzen von Parakeet TDT 0.6B, ohne erstklassige Schnittstelle für Teiltranskripte
• Bevorzugung von Schlüsselbegriffen — bis zu 100 Schlüsselbegriffe pro Anfrage vs. keine Parakeet-Funktion
• Diarisierung — im Angebotspreis enthalten vs. ein separates System, das Sie selbst hinzufügen
• Kanäle — bis zu acht Audiokanäle in einer Anfrage im Vergleich zu einem Stream pro Durchlauf
• Inverse Textnormalisierung — in 25 Sprachen enthalten, im Vergleich zu nur Interpunktion und Groß-/Kleinschreibung
• Bereitstellung — ein verwalteter Endpunkt in us-east-1 im Vergleich zu Gewichten, die Sie herunterladen, ausführen und überall betreiben
• Lizenz — kommerzielle API-Bedingungen vs. CC-BY-4.0 mit Namensnennung
• Modellgröße — nicht offengelegt vs. etwa 600 Millionen Parameter, ungefähr 2,4 GB in fp32 oder 1,2 GB in fp16
Die letzte Zeile ist diejenige, die über viele Bereitstellungen entscheidet. Parakeet TDT 0.6B passt in ein paar Gigabyte, läuft über den INT8-ONNX-Pfad akzeptabel auf einer Laptop-CPU und passt bequem auf jede Consumer-GPU. Das ist keine kleinere Version dessen, was die API tut – es ist eine andere Fähigkeit, denn es ist der Unterschied zwischen einer Transkriptionsfunktion, die offline auf einem Gerät funktioniert, ohne Netzwerk und ohne Kosten pro Stunde, und einer, die das nicht tut.

Die Kostenrechnung, die niemand richtig durchführt
Der Vergleich, der dann veröffentlicht wird, lautet „0,10 Dollar pro Stunde gegenüber kostenlos“, und er ist in beide Richtungen falsch – die API ist nicht das Einzige, wofür man bezahlt, und die Gewichte sind nicht das Einzige, woran man spart.
• Batch-Transkription — Grok Voice Transcribe 2.0 zu $0.10 pro Audio-Stunde, etwa $1.67 pro 1.000 Minuten gegenüber Parakeet TDT 0.6B ohne Lizenzgebühr plus GPU- oder CPU-Zeit
• Streaming — 0,20 $ pro Audio-Stunde, etwa 3,33 $ pro 1.000 Minuten, im Vergleich zu selbst gehostet, wo nicht ein veröffentlichter Tarif, sondern Ihr eigenes Parallelitätslimit die Grenze darstellt
• Service-Limits — 10 Anfragen pro Sekunde und 100 gleichzeitige Streaming-Sitzungen pro Team gegenüber dem, was Ihre Hardware zulässt, ohne Rate-Limit und ohne Parallelitätsbegrenzung
• Die Kosten, die auf keinem der beiden Blätter auftauchen – kein Engineering, kein Serving-Stack, kein Autoscaling gegenüber der On-Call-Rotation, die Retry-Logik, die Modell-Updates und die GPU, die du für Spitzenlast warm hältst
Bei kleinen Mengen ist die Managed-Seite fast immer günstiger, weil der feste Kostenfaktor beim Selbsthosting eine Person ist. Bei großen, gleichmäßigen Mengen gewinnt die selbst gehostete Seite eindeutig, und der Umschlagpunkt ist eine Funktion der Auslastung und nicht der Audiomenge: Eine GPU, die man beschäftigt hält, ist sehr günstig pro Stunde Audio, eine, die man für Spitzenlast warmhält, nicht. Ein Team, das 20.000 Stunden pro Monat verarbeitet, zahlt 2.000 $ für den Managed-Batch-Pfad und ungefähr einen Mittelklasse-GPU-Monat plus Engineering-Zeit für den selbst gehosteten Weg, was nicht annähernd gleichauf liegt.
Der Grund, warum die Rechnung schlecht ausfällt, ist, dass die selbst gehostete Seite üblicherweise mit null angesetzt wird und die Managed-Seite üblicherweise mit Listenpreis. Keines von beidem ist eine reale Zahl. Real ist, dass die 3.332 RTFx von Parakeet TDT 0.6B – NVIDIAs Angabe, gebatcht, auf Rechenzentrums-Hardware, und die als Obergrenze statt als Versprechen zu behandeln ist – bedeuten, dass eine einzelne bescheidene GPU mehr Audio verarbeiten kann, als die meisten Organisationen erzeugen.
Wo Parakeet nicht mehr die richtige Antwort ist
Drei Dinge bringen ein Team dazu, vom offenen Modell abzulassen und zu einem verwalteten zu wechseln, und keines davon ist Genauigkeit.
Das erste ist Key-Term-Biasing. Wenn Ihre Transkripte voller Produktnamen, Nachnamen, Tickersymbole oder Fachjargon sind, wird ein Modell ohne Biasing-Mechanismus sie falsch wiedergeben, und es gibt keine Abhilfe außer Fine-Tuning. Grok Voice Transcribe 2.0 akzeptiert bis zu 100 Schlüsselbegriffe pro Anfrage. Parakeet TDT 0.6B bietet diese Funktion nicht. Für Contact-Center, das Gesundheitswesen und juristische Arbeit ist diese einzige Lücke ein Ausschlusskriterium, egal, was irgendein Leaderboard sagt.
Das zweite ist die Diarisierung. Parakeet liefert Ihnen Wörter mit Zeitstempeln; es sagt Ihnen nicht, wer sie gesagt hat. Transkription mit mehreren Sprechern bedeutet, ein separates Diarisierungsmodell auszuführen und die Ausgabe abzugleichen, was eher ein Projekt als eine Konfigurationsoption ist. Das verwaltete Modell liefert Text mit Sprecherzuordnung in derselben Anfrage.
Der dritte Punkt ist die Streaming-Schnittstelle selbst. Parakeet ist schnell genug, dass Leute Echtzeitsysteme darauf aufbauen – Audio in Chunks zerlegen, das Modell auf jeden Chunk anwenden, die Ausgabe zusammensetzen –, aber das Verhalten bei Teiltranskripten, die Erkennung des Turn-Endes und die Commitment-Semantik sind alles Dinge, die man selbst schreibt und pflegt. Grok Voice Transcribe 2.0 liefert 0,49 Sekunden, nachdem Sie aufhören zu sprechen, ein erstes Teiltranskript zurück – als Produktfunktion.
Es gibt außerdem ein Lizenzdetail, das Teams gelegentlich überrascht: Parakeet TDT 0.6B V3 steht unter CC-BY-4.0, was kommerzielle Nutzung erlaubt, aber eine Namensnennung verlangt, und einige NVIDIA-Sprachmodelle sind inzwischen stattdessen zur eigenen Open Model License des Anbieters gewechselt. Wenn die Namensnennung für Ihr Produkt ein Problem darstellt, lesen Sie die Modellkarte für den konkreten Checkpoint, statt anzunehmen, dass die Bedingungen der Modellfamilie gelten.

Warum die API meist trotzdem gewinnt und wann sie es nicht sollte
Das Muster war im letzten Jahr beständig: Teams beginnen mit einem offenen Modell wie Parakeet TDT 0.6B, weil es kostenlos und kontrollierbar ist, liefern die Funktion aus und stellen dann fest, dass die laufenden Kosten nicht die GPU, sondern die Wartung sind, und wechseln zu einem Managed Endpoint. Auch die umgekehrte Migration kommt vor, meist wenn das Volumen eine Schwelle überschreitet, ab der die stündliche Gebühr beginnt, wie Miete für etwas zu wirken, das man besitzen könnte.
Beide Richtungen sind teuer auszuführen, wenn das Modell direkt in Ihre Anwendung verdrahtet ist, was das Argument dafür ist, die Aufrufstelle langweilig zu halten. OrcaRouter stellt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel bereit, mit automatischem Failover über Anbieter hinweg und 0 % Aufschlag auf den Listenpreis des Anbieters, sodass eine selbst gehostete Bereitstellung und eine verwaltete hinter derselben Schnittstelle sitzen und mit einem Modell-String ausgetauscht werden können. Das ist in der Sprachverarbeitung wichtiger als üblich, wo die Bestenliste alle paar Wochen einen neuen Spitzenreiter bekommt und ein auf eine einzige Region beschränkter Managed Service ein Ausfall in einer einzigen Region ist – der Failover-Pfad sorgt dafür, dass aus einem Transkriptionsfeature kein Transkriptionsausfall wird.
Für Teams, die den Durchsatz des offenen Modells ohne den Serving-Stack wollen, hat auch die Entscheidung diese Form: Benchmarken Sie Parakeet TDT 0.6B mit Ihrem eigenen Audio, benchmarken Sie Grok Voice Transcribe 2.0 mit demselben Audio, und lassen Sie den Gewinner den Traffic behalten, während Sie aufhören, sich darum zu kümmern, welches Anbieterlogo darauf prangt.

Wenn Sie die Ein-Zeilen-Version möchten: Parakeet TDT 0.6B ist nach wie vor die beste Antwort auf „alles überall transkribieren, ohne Kosten pro Stunde, auf Hardware, die ich bereits besitze“, und Grok Voice Transcribe 2.0 ist die Antwort auf „präzise transkribieren mit Sprecherlabels und meinem eigenen Vokabular, ohne irgendetwas laufen zu lassen“. Die Zahl von 13,7 %, die die Kluft riesig erscheinen lässt, ist eine nicht mehr verwendete Messung, und die ehrliche Kluft – irgendwo zwischen einem und drei Punkten WER bei sich überlappendem Audio – ist klein genug, dass die operative Frage den Ausschlag geben sollte.
