Eine generierte Hero-Titelkarte für „VibeVoice-ASR-Streaming-1.5B vs. NVIDIA Parakeet TDT 0.6B: ein unbewährter MIT-Herausforderer gegen den Open-ASR-Champion“, mit dem Untertitel „Der bewährte Standard gegen den einen Tag alten Herausforderer“, mit zwei Modellkarten – VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2. September 2026 · MIT · Noch kein Benchmark veröffentlicht) und NVIDIA Parakeet TDT 0.6B (NVIDIA · 5. Mai 2025 · CC-BY-4.0 · Open ASR #1 seit Mai 2025) – und Tags, die „6,05 % durchschnittliche WER (Parakeet)“, „16 Monate auseinander“ und „Wer-sagte-was + Hotwords (Microsoft, unbestätigt)“ lesen. Das OrcaRouter-Logo ist in der unteren rechten Ecke eingebettet.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs. NVIDIA Parakeet TDT 0.6B: ein unbewiesener MIT-Herausforderer gegen den Open-ASR-Champion

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Wenn Sie heute für die Produktion eine Open-Weights-Spracherkennung benötigen, gibt es einen klaren Standard – und der heißt NVIDIA Parakeet TDT 0.6B. Seit Mai 2025 hält das Modell Parakeet TDT 0.6B v2 mit 600 Millionen Parametern den Spitzenplatz auf dem Hugging Face Open ASR Leaderboard, mit einer durchschnittlichen Wortfehlerrate von 6,05 % – eine Position, die Dritte seit weit über einem Jahr reproduziert haben. Der neueste Herausforderer ist VibeVoice-ASR-Streaming-1.5B, das Microsoft Research am 2. September 2026 hochgeladen hat – sechzehn Monate nach Parakeet, unter einer MIT-Lizenz, mit einer Story zur Streaming-Sprecherzuordnung und bisher ohne jede veröffentlichte Genauigkeitszahl. Diese Seite vergleicht den Champion und den Herausforderer hinsichtlich der Beleglage, der Architektur und dessen, was beide tatsächlich von Haus aus mitbringen.

Bevor wir uns den technischen Daten widmen, sind zwei Bezeichnungen entscheidend, denn sie prägen das ganze Bild dieses Vergleichs. {{1}}Die Werte von Parakeet stehen fest: Die durchschnittliche Wortfehlerrate (WER) von 6,05 % und der Durchsatzwert von ~3.386 RTFx hinter der Aussage „eine Stunde Audio in etwa einer Sekunde“ sind seit über einem Jahr auf öffentlichen Bestenlisten und in NVIDIA-Materialien zu finden.{{/1}} {{2}}Von VibeVoice-ASR-Streaming-1.5B ist nur das bekannt, was sich dem Repository entnehmen lässt – Modellkarte, Konfigurationsdateien und Microsofts Streaming-Dokumentation –, da Microsoft weder WER noch Latenz noch Durchsatz in Textform veröffentlicht hat und keine unabhängige Benchmark-Messung des Checkpoints vorliegt.{{/2}} Bei jedem der folgenden Vergleiche ist eine Spalte kampferprobt, die andere ein Datenblatt.

Sechzehn Monate und eine Leaderboard-Herrschaft liegen dazwischen

Parakeet TDT 0.6B v2 erschien am 5. Mai 2025 als NVIDIAs Antwort auf das Streaming-ASR-Problem: ein FastConformer-Encoder, gepaart mit einem Token-und-Dauer-Transducer-Decoder (TDT), der jedes Token und dessen Dauer in einem einzigen Schritt vorhersagt – ein Effizienztrick, der den durch Blank-Tokens verursachten Overhead eines herkömmlichen Transducers eliminiert. Das unter CC-BY-4.0 lizenzierte, kommerziell nutzbare Modell sicherte sich dank seiner durchschnittlichen Wortfehlerrate von 6,05 % den Spitzenplatz im Open-ASR-Leaderboard. Es brachte außerdem Produktionsfeatures mit, die das Leaderboard nicht misst – Interpunktion, Groß-/Kleinschreibung, Zeitstempel auf Wortebene – sowie einen Full-Attention-Encoder, der bis zu 24 Minuten Audio in einem einzigen Durchlauf verarbeiten kann, was es ohne aggressives Chunking für lange Meetings und Podcasts nützlich macht.

VibeVoice-ASR-Streaming-1.5B ist der Herausforderer in Reinform: Es existiert, es ist dokumentiert, und nichts ist darüber belegt, wie gut es funktioniert. Die GitHub-News-Meldung von Microsoft vom 3. September kündigt ein einheitliches Streaming-ASR-Modell an, das „kontinuierlich transkribiert, wer was sagt, während Sprache eintrifft“, mit Hotwords und zehn Sprachen, und die Config des Checkpoints beschreibt eine völlig andere Ingenieurstradition – einen Sprachmodell-Decoder der Qwen2-Familie, der von faltenden Audio-Tokenizern gespeist wird, mit einem Diffusionskopf, der Ausgabe in Blöcken von etwa 2,9 Sekunden erzeugt, bei einem Lookahead von ungefähr 0,5 Sekunden. Während Parakeet ein eigens entwickeltes Speech-Modell ist, das über ein Jahr realer Bereitstellungen verfeinert wurde, ist VibeVoice-ASR-Streaming-1.5B ein zwei Tage alter Checkpoint aus der Forschungsfamilie.

Die Evidenzasymmetrie ist die Geschichte.

Lesen Sie den Rest dieser Seite mit einer Tatsache im Hinterkopf: Bei diesem Vergleich gibt es nur auf einer Seite Zahlen. Auf der Seite von Parakeet TDT 0.6B steht eine einjährige Verteidigung der Leaderboard-Spitze – eine durchschnittliche Wortfehlerrate (WER) von 6,05 % auf den öffentlichen englischen Kurzform-Testmengen von Open ASR, rund 3.386 RTFx bei Batch 128 auf NVIDIA-Hardware sowie ein Ökosystem aus NeMo-Bereitstellungswerkzeugen, TensorRT-Beschleunigung und FP8-Quantisierung, das in der Produktion erprobt wurde. Auf der Seite von VibeVoice-ASR-Streaming-1.5B hingegen gibt es die Evaluationsangabe der Modellkarte, die eher ein Bild als Text ist, und die vom Anbieter gemeldete durchschnittliche Wortfehlerrate von 7,77 % der Batch-VibeVoice-ASR-Karte über acht englische Testmengen – eine Zahl, die das Nicht-Streaming-Modell beschreibt und nicht auf diesen Checkpoint übertragen werden kann. Es mag durchaus sein, dass der Herausforderer exzellent ist; der Punkt ist, dass „mag durchaus sein“ die gesamte Evidenzbasis darstellt.

Spec-Prüfung

• Parameter — NVIDIA Parakeet TDT 0.6B: 600M, FastConformer-Encoder + TDT-Decoder vs. VibeVoice-ASR-Streaming-1.5B: ~3B gesamt (Qwen-Backbone der 1.5B-Klasse plus Tokenizer und Diffusionskopf).

Veröffentlicht — 5. Mai 2025 vs. 2. September 2026.

• Genauigkeit — 6,05 % durchschnittliche WER, Open ASR #1 seit Mai 2025, von Dritten reproduziert vs. keine veröffentlicht.

• Geschwindigkeit — ~3.386 RTFx bei Batch 128 auf NVIDIA-Hardware, ~1 Stunde Audio pro Sekunde, im Vergleich zu keinem veröffentlichten Durchsatzwert.

• Streaming — streamingfähig mit einem Full-Attention-Kontext von bis zu 24 Minuten pro Durchlauf, im Vergleich zu Chunked Streaming mit Blöcken von ~2,9 s und einem Lookahead von ~0,5 s.

Zusätzliche Ausgaben — Interpunktion, Großschreibung, Wort-Zeitstempel im Vergleich zu Streaming-Zuordnung „Wer sagte was" (unbestätigt) und Hotwords; zehn Sprachen.

• Lizenz — CC-BY-4.0 vs. MIT.

• Ökosystem — NVIDIA NeMo mit TensorRT und FP8 im Vergleich zu Demos aus dem microsoft/VibeVoice-Repository und einem vLLM-Plugin.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Unter der Haube: zwei Ideen, wofür Sprachmodelle gedacht sind

Die Architekturen verkörpern zwei unterschiedliche Grundüberzeugungen über die Aufgabe. Parakeet TDT 0.6B behandelt Transkription als ein Signalverarbeitungsproblem, das effizient gelöst wird: Ein FastConformer-Encoder extrahiert die Akustik, und der TDT-Decoder erzeugt Text-Tokens und Dauern gemeinsam – daher läuft es tausendfach schneller als Echtzeit und fühlt sich auf NVIDIAs Deployment-Stack wohl. VibeVoice-ASR-Streaming-1.5B behandelt Transkription als Sprachproblem: Audio in einen Token-Stream komprimieren, ihn einem Sprachmodell übergeben, das bereits Kontext im Umfang eines Transkripts gelesen hat, und das Verständnis des LM dafür, wer was sagt und wie Gespräche zusammenpassen, die Arbeit erledigen lassen. Das LLM-Rückgrat ist auch der Grund, warum der Checkpoint ~3B Parameter statt 600M umfasst und warum Microsoft keinen Edge-Fußabdruck beansprucht hat – dies ist ein Modell, das eine GPU will und den Speicher nutzt, um Kontext mitzuführen.

Für die Live-Transkription liegt die praktische Konsequenz im Latenzprofil. Der Full-Attention-Encoder von Parakeet kann lange Fenster in einem einzigen Durchgang verarbeiten – eine andere Streaming-Philosophie als die feste Chunk-und-Lookahead-Vorgabe von VibeVoice-ASR-Streaming-1.5B mit rund 2,9 Sekunden Audio pro ausgegebenem Segment. Weder das eine noch das andere ist ein wortweiser Teilergebnis-Streamer nach Art der kommerziellen APIs mit der geringsten Latenz; beide sind chunkbasierte Systeme, und welches das richtige ist, hängt davon ab, ob Ihre Audiodaten als begrenzte Dateien oder als offene Live-Sitzung ankommen.

Die Feature-Story und die Deployment-Nachbarschaften

Out of the box ist Parakeet TDT 0.6B das vollständigere Transkriptionsprodukt: Interpunktion und Großschreibung sind im Transkript enthalten, Wort-Zeitstempel stehen für die Ausrichtung bereit, und 24 Minuten lange Single-Pass-Fenster bedeuten weniger Chunking-Fehler bei langen Aufnahmen. VibeVoice-ASR-Streaming-1.5B kontert mit Funktionen, die Parakeet nicht auflistet: sprecherattribuierte Ausgabe und Hotwords in zehn Sprachen. Die Behauptung des Streaming-Diarisierung ist genau die Art von Sache, die einer unabhängigen Verifikation bedarf – Chunk-Grenzen sind der Punkt, an dem die Attribution abweicht – aber sie ist der Grund, sich das Modell von Microsoft statt dem von NVIDIA anzusehen, wenn Ihre Anforderung darin besteht, zu wissen, wer in einem Live-Meeting was gesagt hat.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

Die Umgebungen sind genauso unterschiedlich wie die Modelle. Parakeet TDT 0.6B ist ein NVIDIA-NeMo-Bürger: TensorRT, FP8 und auf NVIDIA-GPUs abgestimmte Deployment-Werkzeuge, was ausgezeichnet ist, wenn Sie bereits auf NVIDIA-Infrastruktur setzen. VibeVoice-ASR-Streaming-1.5B lebt in einem Forschungs-Repository: Die dokumentierten Wege sind Microsofts Python-Demos und ein vLLM-Plugin, seine Architekturklasse ist noch nicht in der öffentlichen Transformers-Dokumentation enthalten, und das Aufsetzen bedeutet eine Installation aus dem Quellcode und Ihre eigene Verifizierung, dass der Ladepfad funktioniert. Für ein Team, dem ein unspektakuläres, dokumentiertes Deployment wichtig ist, kann dieser Unterschied allein die Benchmark-Lücke aufwiegen.

Die Argumente für den Amtsinhaber, die Argumente für den Herausforderer

Das Argument für NVIDIA Parakeet TDT 0.6B ist das Argument für eine bekannte Größe: ein Jahr lang die Leaderboard-Spitze verteidigt, Reproduktion durch Dritte, eine kommerzielle Lizenz, Produktionsfeatures und ein Deployment-Ökosystem, das echten Datenverkehr verkraftet hat. Wenn Sie in diesem Quartal eine englische Transkriptionsfunktion ausliefern und offene Gewichte wollen, ist dies die vertretbare Standardwahl – und die Beweislast liegt bei allem, was behauptet, es zu ersetzen.

Was für VibeVoice-ASR-Streaming-1.5B spricht, ist enger und spezifischer: Sie benötigen Streaming-Sprecherzuordnung oder Hotwords, Sie benötigen mehr als nur Englisch, oder Sie glauben, dass sich der Sprachmodell-Ansatz für Sprache durchsetzen wird, und Sie möchten früh dabeisein. Es ist eine Wette, keine Entscheidung — es gibt noch keine Kennzahl, die es rechtfertigt, Produktionsverkehr darauf umzustellen, und Microsofts eigene Haltung ist Research-first. Keines der Modelle wird heute über OrcaRouter bereitgestellt. Der kostengünstige Weg, die Wette zu testen, ist daher das Muster, das für jedes junge offene Modell gilt: die ASR-Schicht hinter einer einzigen Routing-API zu belassen, die Zugang zu über 200 Modellen zum Listenpreis des Anbieters ohne Aufschlag und mit automatischem Failover bietet, einen Teil des realen Audios an VibeVoice-ASR-Streaming-1.5B weiterzuleiten, sobald ein Anbieter es hostet, und die Transkripte aus Ihrem eigenen Datenverkehr entscheiden zu lassen, ob der Herausforderer die Krone verdient, die Parakeet seit sechzehn Monaten trägt.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube