Une carte titre héro générée pour « VibeVoice-ASR-Streaming-1.5B contre NVIDIA Parakeet TDT 0.6B : un challenger MIT non éprouvé face au champion Open ASR », sous-titrée « Le choix par défaut éprouvé face au challenger d'un jour », avec deux cartes de modèles — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 sept. 2026 · MIT · Aucun benchmark publié à ce jour) et NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 mai 2025 · CC-BY-4.0 · Open ASR n°1 depuis mai 2025) — et des étiquettes indiquant « 6,05 % de WER moyen (Parakeet) », « 16 mois d'écart » et « Qui-a-dit-quoi + hotwords (Microsoft, non vérifié) ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B contre NVIDIA Parakeet TDT 0.6B : un challenger MIT non éprouvé face au champion de l'Open ASR

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Si vous avez besoin d'une reconnaissance vocale à poids ouverts en production aujourd'hui, il existe une valeur par défaut : NVIDIA Parakeet TDT 0.6B. Depuis mai 2025, le Parakeet TDT 0.6B v2, fort de ses 600 millions de paramètres, occupe la première place du classement Hugging Face Open ASR avec un taux d'erreur de mots moyen de 6,05 % — un résultat que des tiers reproduisent depuis plus d'un an. Le dernier prétendant en date est VibeVoice-ASR-Streaming-1.5B, mis en ligne par Microsoft Research le 2 septembre 2026 — seize mois après Parakeet — sous licence MIT, avec un argument autour de l'attribution du locuteur en streaming et, à ce jour, pas le moindre chiffre de précision publié. Cette page compare le champion et le challenger sur les preuves, l'architecture et ce que chacun offre réellement en sortie de boîte.

Avant même d’en venir aux spécifications, deux étiquettes comptent : ce sont elles qui donnent toute sa forme à ce duel. Les chiffres de Parakeet sont bien arrêtés : le WER moyen de 6,05 % et le débit d’environ 3 386 RTFx qui appuient son affirmation « une heure d’audio en environ une seconde » figurent sur des classements publics et dans des publications NVIDIA depuis plus d’un an. Côté VibeVoice-ASR-Streaming-1.5B, la page ne contient que ce que son dépôt permet de savoir — fiche du modèle, fichiers de configuration et documentation de streaming de Microsoft — car Microsoft n’a publié par écrit ni WER, ni latence, ni débit, et aucun benchmark indépendant du checkpoint n’existe à l’heure où nous écrivons. Dans chaque comparatif ci-dessous, une colonne est éprouvée au combat ; l’autre est une fiche technique.

Seize mois et un règne en tête du classement les séparent

Parakeet TDT 0.6B v2 est arrivé le 5 mai 2025 comme la réponse de NVIDIA au problème de la reconnaissance vocale en streaming : un encodeur FastConformer associé à un décodeur transducteur à jetons et durée (TDT) qui prédit chaque jeton et sa durée en une seule étape — une astuce d'efficacité qui supprime le surcoût des jetons vides d'un transducteur classique. Il est sous licence CC-BY-4.0, adapté à un usage commercial, et il a pris la première place du classement Open ASR grâce à son taux d'erreur moyen de 6,05 %. Il a également apporté des fonctionnalités de production que le classement ne mesure pas — ponctuation, majuscules, horodatage au niveau du mot — et un encodeur à attention complète qui accepte jusqu'à 24 minutes d'audio en une seule passe, ce qui le rend utile pour les longues réunions et les podcasts sans découpage agressif.

VibeVoice-ASR-Streaming-1.5B est le challenger au sens le plus pur : il existe, il est documenté, et rien n’a été établi quant à son efficacité réelle. Le fil d’actualités GitHub de Microsoft, daté du 3 septembre, annonce un modèle ASR streaming unifié qui « transcrit en continu qui a dit quoi à mesure que la parole arrive », avec des hotwords et dix langues ; et la config du checkpoint décrit une tradition d’ingénierie entièrement différente — un décodeur de modèle de langage de la famille Qwen2 alimenté par des tokenizers audio convolutifs, avec une tête de diffusion produisant une sortie par segments d’environ 2,9 secondes et environ 0,5 seconde de lookahead. Là où Parakeet est un modèle de parole conçu sur mesure, affiné pendant plus d’un an de déploiements réels, VibeVoice-ASR-Streaming-1.5B est un checkpoint de recherche vieux de deux jours.

L'asymétrie des preuves, c'est toute l'histoire.

Lisez le reste de cette page avec un fait sous les yeux : cette comparaison ne présente des chiffres que d'un seul côté. Du côté de Parakeet TDT 0.6B, on trouve une année de défense de sa place en tête du classement — 6,05 % de WER moyen sur les ensembles anglais publics de format court d'Open ASR, ~3 386 RTFx à une taille de lot de 128 sur matériel NVIDIA, et un écosystème d'outils de déploiement NeMo, d'accélération TensorRT et de quantification FP8 qui a été exercé en production. Du côté de VibeVoice-ASR-Streaming-1.5B, on trouve le chiffre d'évaluation de la fiche modèle, qui est une image plutôt que du texte, ainsi que le WER moyen de 7,77 % rapporté par le fournisseur sur la fiche du modèle batch VibeVoice-ASR, sur huit ensembles de test anglais — un chiffre qui décrit le modèle non-streaming et qui ne peut pas être transposé à ce checkpoint. Le challenger est peut-être excellent ; le fait est que ce « peut-être » constitue l'intégralité de la base de preuves.

La vérification des spécifications.

• Paramètres — NVIDIA Parakeet TDT 0.6B : 600M, encodeur FastConformer + décodeur TDT par rapport à VibeVoice-ASR-Streaming-1.5B : ~3B au total (backbone Qwen de classe 1.5B plus tokenizers et tête de diffusion).

• Sortie — 5 mai 2025 vs 2 septembre 2026.

• Précision — 6,05 % de WER moyen, Open ASR n°1 depuis mai 2025, reproduit par des tiers vs aucun publié.

• Vitesse — ~3 386 RTFx avec un lot de 128 sur matériel NVIDIA, ~1 heure d’audio par seconde contre aucune mesure de débit publiée.

• Streaming — capable de streaming avec contexte d’attention complet jusqu’à 24 minutes par passage, comparé au streaming par segments, avec des segments d’environ 2,9 s et une anticipation d’environ 0,5 s.

• Extras de sortie — ponctuation, capitalisation, horodatages au niveau du mot par rapport à l’attribution en streaming de qui-a-dit-quoi (non vérifiée) et mots déclencheurs ; dix langues.

• Licence — CC-BY-4.0 vs MIT.

• Écosystème — NVIDIA NeMo avec TensorRT et FP8 vs démos du dépôt microsoft/VibeVoice et un plugin vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Sous le capot : deux idées sur ce à quoi servent les modèles vocaux.

Les architectures traduisent deux croyances différentes sur le métier. Parakeet TDT 0.6B traite la transcription comme un problème de traitement du signal résolu efficacement : un encodeur FastConformer extrait l'acoustique, et le décodeur TDT émet conjointement les jetons de texte et les durées — c'est pourquoi il fonctionne des milliers de fois plus vite que le temps réel et se sent à l'aise sur la stack de déploiement de NVIDIA. VibeVoice-ASR-Streaming-1.5B traite la transcription comme un problème de langage : compresser l'audio en un flux de jetons, le confier à un modèle de langue qui a lu l'équivalent d'une transcription comme contexte, puis laisser la compréhension du LM — qui dit quoi et comment les conversations s'articulent — faire le travail. Le backbone LLM explique aussi pourquoi le checkpoint a ~3 milliards de paramètres plutôt que 600 millions, et pourquoi Microsoft n'a pas revendiqué d'empreinte edge : c'est un modèle qui veut un GPU et qui utilise la mémoire pour porter le contexte.

Pour la transcription en direct, la conséquence pratique réside dans la forme de la latence. L'encodeur à attention complète de Parakeet peut traiter de longues fenêtres en une seule passe, ce qui constitue une philosophie de streaming différente de celle de VibeVoice-ASR-Streaming-1.5B, dont le fonctionnement fixe par blocs avec anticipation (chunk-and-lookahead) émet des segments d'environ 2,9 secondes d'audio. Ni l'un ni l'autre ne fournit de résultats partiels mot par mot, contrairement aux API commerciales à la latence la plus faible ; tous deux sont des systèmes à segments, et le bon choix dépend de la nature de votre entrée audio : fichiers à durée bornée ou session en direct sans fin.

L’article de fond et les zones de déploiement.

D'emblée, Parakeet TDT 0.6B est le produit de transcription le plus complet : ponctuation et majuscules accompagnent la transcription, les horodatages au niveau du mot servent à l'alignement, et les fenêtres de 24 minutes en un seul passage réduisent les erreurs de découpage sur les enregistrements longs. VibeVoice-ASR-Streaming-1.5B contre-attaque avec des fonctionnalités que Parakeet ne répertorie pas : sortie avec attribution des locuteurs et hotwords, dans dix langues. L'affirmation sur la diarisation en streaming est exactement le genre de chose qui exige une vérification indépendante — les frontières des segments sont là où l'attribution dérive — mais c'est la raison pour laquelle il faut examiner le modèle de Microsoft plutôt que celui de NVIDIA si votre exigence est de savoir qui a dit quoi dans une réunion en direct.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

Les quartiers sont tout aussi différents que les modèles. Parakeet TDT 0.6B appartient à l’écosystème NVIDIA NeMo : TensorRT, FP8 et des outils de déploiement optimisés pour les GPU NVIDIA, ce qui est excellent si vous êtes déjà sur une infrastructure NVIDIA. VibeVoice-ASR-Streaming-1.5B vit dans un dépôt de recherche : les chemins documentés sont les démos Python de Microsoft et un plugin vLLM, sa classe d’architecture ne figure pas encore dans la documentation publique de Transformers, et le mettre en place implique une installation depuis les sources et votre propre vérification que le chemin de chargement fonctionne. Pour une équipe qui valorise un déploiement éprouvé et bien documenté, cette différence à elle seule peut l’emporter sur l’écart au niveau des benchmarks.

Les arguments en faveur du sortant, les arguments en faveur du challenger

Le cas de NVIDIA Parakeet TDT 0.6B est celui d'une valeur connue : une année de défense en tête de classement, une reproduction par des tiers, une licence commerciale, des fonctionnalités de production et un écosystème de déploiement qui a absorbé du trafic réel. Si vous livrez une fonctionnalité de transcription en anglais ce trimestre et que vous voulez des poids ouverts, c'est le choix par défaut défendable, et la charge de la preuve incombe à tout ce qui prétend le remplacer.

Les arguments en faveur de VibeVoice-ASR-Streaming-1.5B sont plus restreints et spécifiques : vous avez besoin d'une attribution de locuteur en continu ou de mots-clés, vous avez besoin de plus que l'anglais, ou vous pensez que l'approche du modèle de langage appliquée à la parole va s'imposer et que vous voulez être un précurseur. C'est un pari, pas une décision — il n'existe pas encore de chiffre pour justifier le transfert du trafic de production vers ce modèle, et la posture de Microsoft est elle-même résolument orientée vers la recherche. Aucun des deux modèles n'est servi via OrcaRouter aujourd'hui, de sorte que le moyen peu coûteux de tester ce pari est le schéma qui s'applique à tout jeune modèle ouvert : conservez la couche ASR derrière une API de routage unique qui prend en charge plus de 200 modèles au prix catalogue du fournisseur, sans majoration et avec basculement automatique, acheminez une partie de l'audio réel vers VibeVoice-ASR-Streaming-1.5B dès qu'un fournisseur l'héberge, et laissez les transcriptions issues de votre propre trafic décider si le challenger mérite la couronne que Parakeet porte depuis seize mois.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube