Carte hero d'article indiquant « Grok Voice Transcribe 2.0 vs Muse Voice Transcribe » avec le badge « COMPARAISON DE MODÈLES » et le sous-titre « un règne de 17 jours et un quart de seconde », avec des puces indiquant 2,7 % vs 3,1 % de WER final, 0,49 s vs 0,16 s après la parole, 0,20 $ vs 0,18 $ par heure de streaming et batch à moitié prix, sur un dégradé du blanc au bleu avec le logo OrcaRouter en bas à droite.
Guides & Insights

Grok Voice Transcribe 2.0 vs Muse Voice Transcribe : un règne de 17 jours et un quart de seconde

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 1er septembre 2026, Meta a déclaré que Muse Voice Transcribe avait pris la première place dans l’évaluation de reconnaissance vocale en flux d’Artificial Analysis, avec un taux d’erreur sur les mots final de 3,1 %, et cette affirmation est restée incontestée pendant dix-sept jours. Le 18 septembre, SpaceXAI a livré Grok Voice Transcribe 2.0 avec 2,7 % dans le même classement et s’est emparé de la première place. Deux modèles, un classement, à dix-sept jours d’intervalle — et la comparaison la plus intéressante n’est pas l’écart de 0,4 point en précision, car le modèle de Meta est encore environ trois fois plus rapide pour finaliser une phrase : 0,16 seconde après la fin de la parole, contre 0,49 seconde pour Grok Voice Transcribe 2.0. Muse Voice Transcribe est un modèle de perception audio en temps réel conçu par Meta Superintelligence Labs pour fonctionner au sein même des produits de Meta, où un quart de seconde fait la différence entre un assistant qui semble présent et un autre qui semble lent. Grok Voice Transcribe 2.0 est une API de transcription conçue pour être appelée par n’importe qui, à un prix qui rend le traitement par lots viable. Les deux chiffres sont déclarés par le fournisseur le jour du lancement, et un seul des deux a depuis été placé de manière indépendante dans un classement public.

Ce que le classement dit réellement maintenant

Le tableau AA-WER Streaming est un composite pondéré — AA-AgentTalk à 50 %, VoxPopuli à 25 %, Earnings22 à 25 %, soit environ huit heures d’audio anglais majoritairement de type agent — et les deux modèles y sont évalués, ce qui en fait l’un de ces rares duels où les chiffres sont au moins comparables. Côte à côte, avec les chiffres rapportés par les fournisseurs inclus :

• Précision finale de la transcription — Grok Voice Transcribe 2.0 à 2,7 % de WER contre Muse Voice Transcribe à 3,1 %

• Précision de la première transcription partielle — 3,4 % contre 3,6 %

• Délai avant le premier partiel — 0,49 seconde vs 0,13 seconde

• Délai entre la fin de la parole et la transcription finale — 0,49 seconde contre 0,16 seconde

• Taux d'erreur de diarisation des locuteurs — inclus, aucun chiffre publié, contre une moyenne de 17,5 % dans l'évaluation de Meta

Lisez les lignes de précision et les lignes de latence séparément, car elles pointent dans des directions opposées et les deux sont vraies. En matière de précision, les deux modèles se situent à quatre dixièmes de point l’un de l’autre pour les transcriptions finales et à deux dixièmes pour les premiers partiels — un écart suffisamment faible pour qu’il s’inverse lors de la prochaine version de l’une ou l’autre entreprise, et suffisamment faible pour qu’aucune personne raisonnable ne devrait choisir entre eux sur cette base. En matière de latence, ils ne sont pas proches. Le modèle de Meta renvoie un partiel en environ un huitième de seconde et finalise en environ un sixième de seconde, contre environ une demi-seconde dans les deux sens pour celui de SpaceXAI.

Voilà toute la comparaison en une ligne : Grok Voice Transcribe 2.0 a investi de la latence pour acheter de la précision, et Muse Voice Transcribe a fait l'inverse. SpaceXAI a fait passer son taux d'erreur sur les premiers résultats partiels de 18,3 % dans la version 1.0 à 3,4 % dans la version 2.0, et le prix à payer était de passer de 0,25 seconde à 0,49 seconde sur la même mesure. Le modèle de Meta a été conçu dans l'autre sens, avec des segments audio de 80 millisecondes et un délai adaptatif appris par renforcement qui décide combien de temps attendre avant de valider le texte — un mécanisme dont tout l'objectif est de préserver la précision tout en gardant la validation rapide. Aucun de ces choix n'est une erreur. Ce sont des réponses à des questions différentes.

Quelle question posez-vous ?

Si la transcription alimente un agent vocal qui doit répondre pendant une pause conversationnelle, 0,16 seconde et 0,49 seconde sont des produits différents. L'alternance des tours de parole humaine tolère un intervalle de quelques centaines de millisecondes avant que l'interaction commence à paraître anormale, et le budget de latence est partagé — transcription, puis raisonnement, puis synthèse vocale. Un modèle qui renvoie une transcription finale en un sixième de seconde laisse de la place pour le reste du pipeline ; un modèle qui prend une demi-seconde consomme la majeure partie du budget avant d'avoir réfléchi à quoi que ce soit. C'est pour cela que Meta l'a conçu, et c'est pourquoi le modèle s'exécute dans Meta AI sur le Mac et dans Muse Code plutôt que d'être principalement proposé comme point de terminaison pour les pipelines d'autres personnes.

Si la transcription est un document — un enregistrement d’appel, une réunion, une vidéothèque, une archive de conformité —, alors une demi-seconde n’est rien, l’écart de précision n’est toujours rien, et le seul chiffre qui compte est ce que coûte une heure d’audio. C’est là que ces deux approches divergent fortement, et dans une direction qui surprend ceux qui ne regardent que le tarif de streaming.

Moitié prix en batch, un dixième de plus en streaming

Meta affiche Muse Voice Transcribe à 0,18 $ par heure d’audio, soit 3,00 $ les 1 000 minutes. Grok Voice Transcribe 2.0 est affiché à 0,10 $ par heure pour le traitement par lots et à 0,20 $ par heure pour le streaming. Donc :

• Streaming — Grok Voice Transcribe 2.0 à 0,20 $ de l’heure contre Muse Voice Transcribe à 0,18 $, donc Meta est environ 10 % moins cher

• Par lots ou enregistré — 0,10 $ l’heure contre 0,18 $, donc SpaceXAI est 44 % moins cher

• Inclus au prix catalogue — diarisation, horodatages de mots avec confiance, biais de termes clés et normalisation de texte inverse du côté SpaceXAI vs transcription en continu, diarisation et détection de point de terminaison en tant que modèle unique du côté de Meta

• Formule gratuite ou auto-hébergement — ni l’un ni l’autre, sur les deux plans

Une équipe qui ne fait que du streaming devrait être indifférente entre les deux sur le prix et devrait choisir en fonction de la latence, ce qui signifie Meta. Une équipe avec un volume significatif d’audio enregistré devrait regarder la ligne batch, car 0,08 $ l’heure, ça s’accumule : 5 000 heures par mois coûtent 500 $ pour l’un et 900 $ pour l’autre, et l’écart de précision entre les deux est plus petit que l’arrondi de l’un ou l’autre de ces nombres.

La position en matière de licence est identique de la manière qui compte et différente de la manière qui ne compte pas. Tous deux sont à poids fermés — Muse Voice Transcribe est propriétaire et disponible uniquement via l’API hébergée de Meta, et Grok Voice Transcribe 2.0 est une API commerciale sans téléchargement. Aucun des deux n’est une option si votre exigence est que l’audio ne quitte jamais une infrastructure que vous contrôlez, et tous deux vous exposent au risque qu’un fournisseur modifie son prix, la version de son modèle ou son calendrier d’obsolescence sans que vous puissiez y faire quoi que ce soit. C’est une considération bien réelle et non hypothétique : Grok Voice Transcribe 1.0 est déjà sur la voie de l’obsolescence moins de deux semaines après le lancement de son successeur.

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

La diarisation, qui est la fonctionnalité qu'aucun des deux ne met en avant

Les deux modèles effectuent l’attribution des locuteurs en une seule passe, ce qui, il y a deux ans, était un système distinct ajouté après coup, et la comparaison ici est inhabituellement concrète, car Meta a publié un chiffre et SpaceXAI non.

Meta rapporte un taux d’erreur moyen de diarisation de 17,5 % sur l’ensemble de son évaluation, gère 20 locuteurs ou plus sans post-traitement, et les gère dans le cadre du modèle de streaming plutôt que comme une étape en aval — le « qui a dit quoi » arrive avec le texte plutôt qu’après lui. C’est vraiment difficile à faire dans un contexte de streaming, où un tour de parole n’est identifiable qu’une fois qu’on en a entendu suffisamment, et 17,5 % est un chiffre bien réel avec une réserve bien réelle : il est propre à Meta, moyenné sur un ensemble d’évaluation que Meta a choisi.

Le modèle de SpaceXAI inclut la diarisation sans coût supplémentaire et prend également en charge jusqu’à huit canaux audio indépendants dans une seule requête, ce qui constitue une façon différente de résoudre le même problème — si votre audio arrive sous forme de canaux séparés par participant, ce que fait souvent la téléphonie de centre de contact, la séparation des canaux est plus fiable que la diarisation et ne nécessite aucun taux d’erreur. Si votre audio arrive sous forme d’un seul flux mixte, vous dépendez de la qualité de la diarisation, et un seul de ces deux fournisseurs vous a dit ce qu’elle est.

Il existe une différence de second ordre qu’il vaut la peine de noter : Muse Voice Transcribe traite la diarisation, la transcription et la détection des points de terminaison comme un seul modèle produisant une seule sortie, ce qui signifie que les composants ne peuvent pas échouer indépendamment. Grok Voice Transcribe 2.0 vous permet de considérer les canaux, les termes clés et la diarisation comme des leviers distincts. Un modèle unique est plus simple à exécuter et plus difficile à déboguer.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

Langues, et où les deux fiches de modèle cessent d'être comparables

Meta a entraîné Muse Voice Transcribe sur plus de 70 langues et en a vérifié 25 de manière approfondie lors du lancement, avec une alternance codique native à l'intérieur et entre les phrases et la prise en charge d'audio de plus d'une heure. Grok Voice Transcribe 2.0 gère la détection automatique de la langue avec changement en cours d'enregistrement et applique la normalisation inverse du texte — dates, devises, numéros de téléphone et adresses e-mail parlés rendus sous forme écrite — dans 25 langues.

Le chevauchement correspond aux 25 langues extensivement vérifiées d'un côté et aux 25 langues de normalisation de l'autre, et ces deux ensembles ne sont pas les mêmes 25, et aucun des deux fournisseurs n'a publié la liste. « 70+ langues entraînées » et « 25 langues avec prise en charge du formatage » ne sont pas des affirmations comparables et ne devraient pas être soustraites l'une de l'autre. Ce que l'on peut dire, c'est que Meta avance une affirmation multilingue plus large et SpaceXAI une affirmation plus étroite mais plus opérationnelle : détecter la langue est un minimum indispensable, et formater ce que le modèle a entendu en quelque chose qu'un système en aval peut analyser est la partie qui casse les intégrations lorsqu'elle fait défaut.

Le choix, et la raison pour laquelle ce n'est peut-être pas à vous de le faire

Enlevez le marketing et la décision se réduit à trois phrases. Choisissez Muse Voice Transcribe si la transcription est consommée en direct au sein d'une conversation, car 0,16 seconde n'est pas un détail. Choisissez Grok Voice Transcribe 2.0 si vous avez de l'audio enregistré en grande quantité, car la moitié du tarif par lot n'est pas un détail non plus. Si vous n'avez besoin d'aucun de ces deux extrêmes, choisissez en fonction de toute autre contrainte — région, contrat, intégration existante — car l'écart de précision ne tranchera pas.

La complication, c’est que l’un de ces deux modèles n’est pas vraiment à vendre au sens habituel. Muse Voice Transcribe existe pour faire en sorte que l’assistant de Meta paraisse rapide, et il est disponible via le Meta Model API en grande partie parce que Meta a jugé que la valeur écosystémique de l’exposition l’emportait sur celle de l’exclusivité. Cela pourrait changer, et vite : Meta a consacré la même semaine à ouvrir la plateforme de connecteurs de Muse aux développeurs tiers, ce qui est le fait d’une entreprise qui investit dans son propre canal de distribution plutôt que dans le fait d’être un fournisseur neutre pour tout le monde. Bâtir une dépendance de production sur le modèle interne d’un concurrent est un pari que les conditions ne changeront pas, et ce pari a un mauvais bilan historique.

Cette asymétrie est l'argument pour ne coder en dur ni l'un ni l'autre. OrcaRouter expose plus de 200 modèles derrière une seule clé compatible OpenAI, avec bascule automatique entre fournisseurs et 0 % de marge sur le prix catalogue du fournisseur — ainsi, lorsque SpaceXAI fait passer la valeur par défaut à 2.0 et déprécie 1.0, ou lorsque Meta repositionne son API vocale, le changement est une chaîne de modèle plutôt qu'un projet de migration. Pour une catégorie où le leader a changé de mains deux fois en trois semaines, la couche de routage est la partie de la pile qui devrait être stable, et le modèle est la partie qui ne devrait pas l'être.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Une chose à surveiller au cours du mois à venir : savoir si Artificial Analysis remesure Muse Voice Transcribe sur le tableau de streaming, maintenant que Grok Voice Transcribe 2.0 l’a délogé. Les 3,1 % de Meta et les 2,7 % de SpaceXAI ont tous deux été rapportés au lancement, mais seul celui de SpaceXAI a été positionné de manière indépendante. Si le chiffre de Meta se maintient lorsqu’on le réexécute, l’écart de précision est aussi petit qu’il en a l’air et l’écart de latence décide de tout. Si ce n’est pas le cas, le règne de dix-sept jours était toute l’histoire.