
Muse Voice Transcribe est en ligne : le premier modèle de perception audio en temps réel de Meta
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Muse Voice Transcribe, le premier modèle de perception audio en temps réel de Meta Superintelligence Labs, est sorti le 1ᵉʳ septembre 2026, et son prix est un vrai teaser : 3,00 $ pour 1 000 minutes d’audio — soit environ 0,18 $ de l’heure — sur la Meta Model API. En un seul passage en streaming, il fait ce que la plupart des pipelines de transcription répartissent sur trois systèmes : la reconnaissance automatique de la parole, la diarisation des locuteurs pour plus de 20 voix, et l’endpointing, la tâche qui consiste à décider quand un locuteur a réellement fini de parler plutôt que de faire une pause au milieu d’une pensée. Meta affirme que le modèle domine le classement streaming speech-to-text d’Artificial Analysis avec un taux d’erreur sur les mots de 3,1 % sur les transcriptions finales, livrées 0,16 seconde après que le locuteur a cessé de parler.
Ce dernier chiffre mérite son étiquette honnête avant de servir à quoi que ce soit : il s'agit de la déclaration de Meta au jour du lancement, pointant vers un classement indépendant, pour un modèle qui pouvait être appelé depuis moins d'une journée au moment de l'annonce. Personne en dehors du laboratoire n'a encore reproduit les 3.1 %, et la revendication de précision est une chose, tandis que le reste de l'argumentaire — plus de 70 langues entraînées, alternance codique native, « délai adaptatif » appris par renforcement — est un ensemble distinct de déclarations du fournisseur qui se trouvent dans le même bateau. Tout dans cet article est l'état du modèle au premier jour, avec les chiffres du fournisseur étiquetés comme chiffres du fournisseur.
Les chiffres qui comptent dès le premier jour
• Prix — 3,00 $ US par tranche de 1 000 minutes audio (soit environ 0,18 $ US par heure audio) sur l’API Meta Model, un tarif inférieur à celui de toutes les principales API de transcription en streaming que nous suivons.
• Allégation de précision — 3,1 % de WER sur les transcriptions finales à 0,16 seconde après la fin de la parole ; 3,6 % de WER sur les premières transcriptions partielles à 0,13 seconde. Rapporté par le fournisseur, citant le classement de streaming d'Artificial Analysis.
• Diarisation — 20+ locuteurs, émise en streaming sans étape de post-traitement distincte (Meta fait état d'un taux d'erreur de diarisation moyen de 17,5 %).
• Langues — entraîné sur plus de 70 ; 25 « vérifiées en profondeur » au lancement ; alternance codique fluide à l'intérieur des phrases et entre les phrases.
• Contexte — gère l'audio de plus d'une heure ; biais de langue, de mots-clés et de contexte pour les domaines riches en jargon.

Que signifie "modèle de perception audio" ici ?
L'architecture, c'est l'histoire. {{1}}Muse Voice Transcribe ingère l'audio par tranches de 80 millisecondes et diffuse les mots à mesure qu'ils se stabilisent — c'est ce que signifie « temps réel » en pratique.{{/1}} Le plus intéressant, c'est la façon dont elle décide de valider un mot. {{2}}Plutôt qu'un budget de latence fixe — le compromis standard où un reconnaisseur soit s'engage tôt et devine, soit attend plus longtemps et tergiverse — le modèle utilise ce que Meta appelle « délai adaptatif » : il avance rapidement dans la parole facile et conserve davantage de contexte audio pour les mots dont il est moins sûr.{{/2}} {{3}}La politique de délai elle-même a été apprise par apprentissage par renforcement, si bien que le modèle équilibre concrètement vitesse et précision mot par mot, plutôt que d'appliquer un réglage global unique.{{/3}}
Cette distinction explique pourquoi Meta appelle Muse Voice Transcribe un « modèle de perception audio » plutôt qu'un modèle ASR. Le flux de sortie est une transcription en direct unique qui comporte également qui parle et quand l'énoncé est terminé — trois étiquettes que les systèmes de streaming assemblent généralement en collant un reconnaisseur à un détecteur d'activité vocale et à un modèle de diarisation, chacun ajoutant sa propre latence et ses propres modes de défaillance.

Diarisation et détection de fin de parole, intégrées.
La diarisation des locuteurs est la partie qui mérite le plus d’être examinée, car c’est la fonctionnalité pour laquelle les produits de streaming exagèrent le plus souvent. Meta affirme que le modèle sépare plus de 20 locuteurs dans un seul enregistrement et fait état d’un taux d’erreur de diarisation moyen de 17,5 %, qu’il compare à une fourchette de 21,1 à 28,6 % attribuée aux systèmes concurrents. Ces deux chiffres sont publiés par le fournisseur le jour du lancement, et aucune évaluation indépendante n’a encore confirmé les 17,5 %. Ce qui est structurellement réel, c’est que la diarisation s’exécute dans la même passe de streaming que la reconnaissance — il n’y a pas de seconde étape du type « télécharger l’audio, attendre, récupérer les locuteurs », ce qui est le choix de conception qui rend le suivi de plus de 20 locuteurs plausible dans un contexte en direct.
L'endpointing est la capacité la plus discrète et sans doute la plus utile. Les API de transcription qui exposent la reconnaissance vocale en streaming brut forcent l'appelant à implémenter lui-même la détection de fin d'énoncé, c'est pourquoi les agents vocaux coupent si souvent la parole aux gens ou laissent des silences morts. Muse Voice Transcribe détermine quand un tour est terminé et émet cette limite dans le flux, de sorte qu'une application reçoit un signal clair « ce locuteur a fini » sans avoir à construire une couche VAD.
La revendication multilingue, lisez attentivement.
Meta a entraîné le modèle sur plus de 70 langues mais n'en valide que 25 au lancement. Ce sont deux choses différentes : « entraîné sur » signifie que les données incluaient ces langues ; « vérifié de manière approfondie » désigne le sous-ensemble que Meta soutient réellement avec des tests internes. Pour une utilisation en production, la liste des 25 langues vérifiées constitue la couverture réelle, et l'écart entre 70 et 25 mérite d'être connu avant d'y acheminer 40 langues. Ce qui est véritablement inhabituel, c'est l'histoire du code-switching — le modèle est conçu pour changer de langue en milieu de phrase et en milieu d'énoncé sans qu'on le lui demande, ce qui est un véritable point sensible dans les régions multilingues et quelque chose que la plupart des produits ASR monolingues ne peuvent tout simplement pas faire. Le biais de langue, de mot-clé et de contexte complète l'histoire de la personnalisation : vous pouvez orienter la reconnaissance vers un vocabulaire de domaine, ce qui est la fonctionnalité qui rend l'ASR en streaming utilisable dans les files d'attente médicales, juridiques et de support.
Trois surfaces, un modèle
Muse Voice Transcribe est disponible sur trois surfaces à la fois. La version payante est l'API Meta Model à 3,00 $ pour 1 000 minutes audio. La version grand public est Meta AI pour Mac, où maintenir la touche Fn permet de dicter dans n'importe quelle application — la réponse de Meta à la dictée intégrée d'Apple, et le déploiement réel le plus visible du modèle dès le premier jour. La version développeur est Muse Code, l'agent de codage de Meta, où les commandes vocales pilotent des sessions multi-agents et des flux de refactorisation. Un seul modèle alimentant une fonction de dictée et un agent de codage est la version industrialisée de l'argument « un modèle de streaming, de nombreuses surfaces ».
Ce que le prix sous-cote
À 0,18 $ par heure audio, Muse Voice Transcribe casse les prix sur le marché de la transcription en streaming en termes de prix catalogue. L'ensemble de comparaison tel que nous le suivons : le Transcribe Live de Google Gemini 3.5 est d'environ 9 $ pour 1 000 minutes, le Scribe v2 Realtime d'ElevenLabs est listé à 6,50 $ pour 1 000 minutes, l'Ink-2 de Cartesia à 4,00 $, et le GPT Live Transcribe d'OpenAI à 17,00 $. Ce sont les chiffres publiés par les fournisseurs, et plusieurs de ces modèles disposent de preuves d'exactitude indépendantes que Muse n'a pas encore — être leader sur le prix dès le premier jour n'est pas la même chose qu'un classement établi. Mais un modèle de streaming avec diarisation et détection de fin d'énoncé intégrées, qui arrive à environ un cinquième à un dixième du prix des API de streaming établies, est le genre de chiffre qui redéfinit les attentes, quoi qu'il en soit.

Les honnêtes mises en garde
Muse Voice Transcribe est propriétaire, et les poids ne sont pas publiés — l’option « run it yourself » n’existe pas, et il n’y a pas de chemin de poids ouverts pour l’audit ou le fine-tuning. L’affirmation de précision date du jour du lancement et n’a pas été reproduite. Les 25 langues vérifiées peuvent ne pas correspondre au chiffre de « 70+ langues entraînées » pour la couverture des langues à faibles ressources. Et le benchmark de diarisation, bien que prometteur, n’est qu’une mesure du fournisseur tant qu’une exécution indépendante ne l’a pas confirmé. Pour les équipes dont la seule exigence est une transcription par lots précise d’audio pré-enregistré, des options moins coûteuses et mieux auditées existent encore — l’argumentaire sur le streaming concerne l’interaction en temps réel, pas la performance sur le coût par heure audio dans le monde de la transcription par lots.
Que regarder ensuite
Quatre éléments décideront si ce lancement est un simple moment ou une tendance. {{1}}Premièrement, le classement streaming d'Artificial Analysis doit réellement placer Muse Voice Transcribe en première position après vérification indépendante — la revendication du jour du lancement nécessite une entrée confirmée au classement.{{/1}} {{2}}Deuxièmement, la diarisation de 20+ locuteurs doit survivre au contact de réunions réelles et bruyantes.{{/2}} {{3}}Troisièmement, la surface de dictée Mac de Meta doit se convertir en adoption de l'API par les développeurs.{{/3}} {{4}}Quatrièmement, la réponse des acteurs établis sur le prix sera déterminante, car un modèle de streaming avec diarisation et endpointing à 0,18 $ l'heure exerce une pression visible sur tous ceux au-dessus.{{/4}} Lorsque Meta ouvrira le modèle à des partenaires d'hébergement supplémentaires, une passerelle en transparence telle qu'OrcaRouter — qui transmet les prix catalogue des fournisseurs avec 0 % de marge — ferait apparaître le même chiffre de 3,00 $ pour 1 000 minutes, sans majoration de revendeur, dès son arrivée. En attendant, le seul endroit où appeler Muse Voice Transcribe est l'API de Meta elle-même.
