Une carte de titre vedette comparant « VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe », surmontée du surtitre « ASR en streaming – sept. 2026 », d'un sous-titre présentant deux challengers du streaming ASR séparés d'un jour — l'API de Meta à 0,18 $ de l'heure et le checkpoint MIT de Microsoft sans plateforme d'hébergement dédiée —, puis des pastilles « Poids MIT – 2 sept. », « API Meta – 1er sept. » et « Les deux non vérifiés », ainsi que d'une note de bas de page « Même promesse mise en avant ». Le logo OrcaRouter est incrusté en bas à droite.
Guides & Insights

VibeVoice-ASR-Streaming-7B contre Muse Voice Transcribe : deux challengers du streaming, à un jour d'écart

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

En l’espace d’environ trente-six heures au début de septembre 2026, deux grands laboratoires ont publié des modèles de transcription parole-texte en streaming qui font la même promesse phare — un transcript en direct qui vous dit aussi qui a dit quoi, pendant que les mots sont prononcés. Le 1er septembre, Meta Superintelligence Labs a lancé Muse Voice Transcribe sous forme d’API hébergée au prix de 3,00 $ pour 1 000 minutes audio, soit environ 0,18 $ de l’heure, avec reconnaissance en streaming, diarisation de 20+ locuteurs et détection de fin de parole intégrées en une seule passe. Le 2 septembre, Microsoft Research a téléversé VibeVoice-ASR-Streaming-7B sur Hugging Face : poids ouverts sous licence MIT, aucune annonce, une fiche de modèle qui revendique une transcription en streaming avec attribution des locuteurs, avec mots-clés et dix langues, et aucun environnement hébergé où que ce soit. Même discours, modèles économiques opposés, et des preuves des deux côtés plus minces que ce que l’un ou l’autre laboratoire aimerait que vous remarquiez.

Cette page est rédigée comme un état des connaissances actuelles, car aucun des deux modèles ne dispose d'un chiffre de précision vérifié de manière indépendante. Les chiffres de Muse Voice Transcribe sont des annonces de Meta au jour du lancement, rapportées par le fournisseur et non reproduites ; VibeVoice-ASR-Streaming-7B n'a publié aucun chiffre de précision en streaming dans un texte quelconque. La comparaison ci-dessous s'appuie donc sur ce qui est structurel et connaissable — architecture, prix, licence, comportement documenté — et étiquette les rares chiffres du fournisseur là où ils apparaissent.

Deux challengers au pipeline par lots, à un jour d'intervalle

Les deux modèles s'attaquent au même postulat : que la transcription de la parole en texte est une opération que l'on exécute sur un enregistrement terminé. Muse Voice Transcribe est le premier produit que Meta qualifie de « modèle de perception audio en temps réel » — une seule passe en streaming qui effectue la reconnaissance, la diarisation des locuteurs sur plus de vingt voix, et la détection de fin d'énoncé, la tâche qui consiste à décider quand un locuteur a réellement terminé plutôt que marqué une pause. Il est lancé simultanément sur trois surfaces : l'API Meta Model à 0,18 $ l'heure audio, Meta AI pour Mac où maintenir la touche Fn permet de dicter dans n'importe quelle application, et Muse Code. Le VibeVoice-ASR-Streaming-7B de Microsoft est le membre streaming de la famille ouverte VibeVoice, et sa sortie est bien plus discrète : un dépôt Hugging Face créé le 2 septembre (les horodatages affichent 15:46 UTC, dernière modification trois minutes plus tard), huit fragments safetensors sous licence MIT, et une entrée du journal des nouvelles datée du 3 septembre dans le dépôt GitHub microsoft/VibeVoice, qui le décrit comme « un modèle ASR streaming unifié qui transcrit en continu qui a dit quoi à mesure que la parole arrive, avec prise en charge de mots d'activation personnalisés et de 10 langues ». Un jour après sa mise en ligne, il affichait toujours zéro téléchargement.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

La collision de fonctionnalités

• Mécanisme de streaming — Muse Voice Transcribe consomme l'audio par segments de 80 millisecondes et valide les mots dès qu'ils se stabilisent, tandis que VibeVoice-ASR-Streaming-7B traite des segments d'environ 2,9 secondes avec environ 0,5 seconde d'anticipation, produisant le texte une fois par segment résolu.

• Attribution des locuteurs — 20+ locuteurs en une seule passe, taux d’erreur de diarisation moyen de 17,5 % rapporté par le fournisseur par rapport à la sortie en streaming « qui a dit quoi » revendiquée sur la fiche du modèle, non vérifié.

• Endpointing — intégré : le flux transporte une frontière de fin d’énoncé, alors que cela n’est pas documenté comme signal de sortie.

Contrôles de contexte — biais de langue, de mots-clés et de contexte vs mots déclencheurs personnalisés via un prompt de contexte (--context_info).

• Langues — entraînement sur 70+ langues, 25 largement vérifiées au lancement, alternance codique native contre 10 annoncées (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Preuves — allégations du fournisseur au lancement : 3,1 % de WER sur les résultats finaux à 0,16 s après la parole, 3,6 % sur les premières hypothèses partielles, en citant le classement streaming d’Artificial Analysis, contre aucune valeur de WER en streaming ni de latence publiée sous forme de texte.

• Coût et licence — 0,18 $ par heure audio, hébergé, poids fermés contre 0 $ pour les poids (licence MIT), environ 18 Go de bf16, auto-hébergé.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

Deux conceptions très différentes du « streaming »

Le terme « streaming » couvre une large gamme de cadences, et l'écart entre ces deux extrêmes est suffisamment grand pour changer ce que l'on peut construire sur chacun. Muse Voice Transcribe diffuse en continu à la granularité du mot. L'architecture de Meta consomme l'audio par segments de 80 millisecondes et utilise ce qu'elle appelle le « délai adaptatif » — une politique de délai apprise par apprentissage par renforcement, qui valide chaque mot dès que le modèle est confiant, en conservant davantage de contexte pour les mots dont il est moins sûr plutôt que d'appliquer un budget de latence fixe. Le fournisseur annonce des transcriptions finales 0,16 seconde après que le locuteur s'arrête et des premières transcriptions partielles dès 0,13 seconde. Cette cadence est conçue pour les boucles interactives : sous-titrage en direct, dictée, agent vocal qui doit répondre à un énoncé terminé presque immédiatement.

VibeVoice-ASR-Streaming-7B diffuse à un grain plus grossier. Sa configuration de prétraitement indique un audio arrivant à 24 kHz, compressé 3 200× en jetons à environ 7,5 trames par seconde, puis traité par blocs de 22 trames avec une anticipation de 4 trames — soit environ 2,9 secondes d’audio par bloc, et près d’une demi-seconde d’anticipation, chiffres dérivés de la configuration plutôt que d’une latence mesurée. Le texte est émis à mesure que chaque bloc est résolu, le contexte des blocs antérieurs étant conservé via le cache KV, de sorte qu’une longue session ne se recalcule pas de zéro. Une transcription qui s’allonge par incréments d’environ trois secondes convient aux notes de réunion et à l’analyse d’appels ; c’est un produit différent du streaming de mots en moins d’une seconde pour la conversation en direct. Aucun des deux laboratoires n’a publié de mesure de latence de bout en bout pour le point de contrôle de streaming ; considérez donc la cadence comme la conception prévue et le ressenti réel comme non testé.

Étiquetage des locuteurs et endpointing : intégrés sur l'un, seulement annoncés sur l'autre.

L'attribution des locuteurs est le domaine où les produits de streaming exagèrent le plus souvent, et les deux font cette affirmation. La version de Muse Voice Transcribe est concrète et structurelle : la diarisation s'exécute dans le même flux streaming que la reconnaissance, de sorte qu'un enregistrement d'une conversation à vingt personnes peut porter des étiquettes par locuteur sans étape séparée de « téléversement, attente, récupération des locuteurs », et Meta rapporte un taux d'erreur de diarisation moyen de 17,5 % — un chiffre de fournisseur, non reproduit, mais un chiffre rattaché à un mécanisme réel. Il émet également les limites de tour de parole, la capacité plus discrète : une application reçoit un signal clair « le tour de ce locuteur est terminé » sans avoir à construire un détecteur d'activité vocale, c'est pourquoi les agents vocaux construits sur une ASR brute coupent si souvent la parole aux gens.

VibeVoice-ASR-Streaming-7B revendique sur sa fiche modèle une sortie streaming de type « qui a dit quoi », cohérente avec la sortie structurée Qui/Quand/Quoi du VibeVoice-ASR par lots — mais pour le checkpoint streaming, cette affirmation n'est pas vérifiée, aucun test indépendant ne l'a reproduite, et il n'existe aucun signal de fin de parole documenté du genre de celui que propose Muse. Si votre charge de travail est réellement de l'audio en direct multi-locuteurs, Muse offre aujourd'hui un mécanisme plus complet ; si vous évaluez si un modèle à poids ouverts peut faire le même travail sur du matériel que vous contrôlez, l'affirmation de VibeVoice est exactement le genre de chose à tester avec vos propres enregistrements de réunions avant d'y croire.

Les preuves : les allégations du jour de lancement contre une carte vierge.

Il vaut la peine d'être précis sur ce que chaque camp propose, car aucun n'offre ce qu'un acheteur recherche réellement. Muse Voice Transcribe présente un ensemble dense de chiffres du fournisseur — 3,1 % de taux d'erreur de mots sur les transcriptions finales, 3,6 % sur les premières transcriptions partielles, une latence finale de 0,16 seconde, 17,5 % d'erreur moyenne de diarisation — tous publiés par Meta le jour du lancement et renvoyant au classement de transcription vocale en streaming d'Artificial Analysis, où Meta revendique la première place. Ce sont des affirmations que personne en dehors du laboratoire n'a reproduites, mais elles sont suffisamment précises pour être falsifiables, ce qui constitue une forme de progrès.

VibeVoice-ASR-Streaming-7B n’a rien de tout cela. Sa fiche modèle fournit une figure d’évaluation sous forme d’image et le rapport technique du streaming est un PDF, mais aucun chiffre de WER ou de latence en streaming n’est citable en prose. Le seul ancrage numérique de la famille VibeVoice est le tableau déclaré par le fournisseur sur la fiche du modèle batch VibeVoice-ASR — 7,77 % de WER moyen sur huit ensembles de test anglais, 2,20 % sur LibriSpeech clean — qui n’est explicitement pas le chiffre de ce checkpoint. Lorsqu’une affirmation du jour du lancement rencontre une fiche vide, le critère de départage honnête est tout sauf le WER principal : le prix, la licence, la cadence de streaming et les fonctionnalités que chaque camp documente réellement.

Languages: 25 vérifiées contre 10 déclarées

La couverture linguistique sépare les deux plus que ne le font les affirmations de précision en titre. Muse Voice Transcribe a été entraîné sur plus de 70 langues, mais Meta en valide 25 au lancement — et la liste vérifiée, pas la liste d’entraînement, constitue la couverture de production, avec l’alternance codique native comme différenciateur : il est conçu pour changer de langue en milieu de phrase sans qu’on le lui demande. VibeVoice-ASR-Streaming-7B déclare 10 langues dans sa fiche modèle — anglais, chinois, espagnol, portugais, allemand, japonais, coréen, français, russe, italien — contre les plus de 50 de la version batch VibeVoice-ASR. Si votre trafic inclut des conversations avec alternance codique, Muse a l’argument le plus spécifique ; s’il se situe dans ces dix langues, la couverture du modèle Microsoft est au moins explicite, ce qui est plus que ce que proposent la plupart des supports de lancement.

Coût et ce que vous conservez

La différence de modèle économique est le critère le plus simple pour trancher. Muse Voice Transcribe, à 0,18 $ par heure audio, sous-cote toutes les grandes API de transcription en streaming sur le prix catalogue — pas de GPU, pas d'exploitation, poids fermés, et le prix est fixé par Meta. VibeVoice-ASR-Streaming-7B ne coûte rien à télécharger, mais il faut compter environ 18 Go de poids bf16 avant le cache KV pour l'héberger soi-même sur un GPU de classe 24 Go, avec les scripts de démonstration microsoft/VibeVoice ou le plugin vLLM comme chemins de déploiement documentés, et aucun fournisseur d'inférence ne l'héberge encore. La licence MIT est l'atout durable : les poids vous appartiennent et peuvent être affinés d'une manière qu'aucun abonnement API ne permet. C'est aussi là que le tableau des prix pourrait devenir intéressant — dès qu'un fournisseur hébergera le checkpoint ouvert, la question des 0,18 $ de l'heure deviendra un prix de marché plutôt qu'un prix catalogue d'un seul fournisseur, ce qui est exactement la situation où un routeur en transparence justifie sa place. OrcaRouter ne route pas la transcription vocale aujourd'hui, et aucun de ces modèles n'est dans son catalogue ; ce qu'il fait, c'est transmettre les prix catalogue des fournisseurs sans marge sur les 200+ modèles de langage qui consomment une transcription en direct, de sorte qu'une baisse de prix d'un fournisseur, où qu'elle se produise dans cette pile, est répercutée côté acheteur le jour même de son annonce.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Foire aux questions

Est-ce que le WER de 3,1 % de Muse Voice Transcribe signifie qu'il est plus précis que VibeVoice-ASR-Streaming-7B ?

Non, et la comparaison n'est pas encore pertinente. Le 3,1 % de Meta est une affirmation du jour du lancement concernant le mode streaming, rapportée par le fournisseur et non reproduite. VibeVoice-ASR-Streaming-7B n'a publié aucun chiffre de précision en streaming, que ce soit par écrit. Tant que les deux modèles n'auront pas été soumis au même banc d'essai public avec le même audio, la seule déclaration honnête est que Muse présente une affirmation précise qui peut être testée, et que VibeVoice n'en a pas encore.

Puis-je utiliser l'un ou l'autre modèle sur un audio déjà enregistré ?

Oui aux deux, avec des formes différentes. Muse Voice Transcribe gère les enregistrements de plus d'une heure via la même API de streaming. Le plugin vLLM de VibeVoice-ASR-Streaming-7B expose un endpoint de transcription de fichier complet aux côtés de son endpoint de flux WebSocket. Mais les deux sont conçus et tarifés pour l'utilisation en direct — Muse par son modèle économique reposant uniquement sur le streaming, VibeVoice par son architecture par morceaux qui émet dès que l'audio arrive — donc si votre charge de travail est purement constituée de fichiers par lots, une API de transcription de fichiers dédiée sera généralement moins chère et plus facile à mesurer que l'un ou l'autre.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube