
Muse Voice Transcribe vs Whisper Large v3 Turbo : l'option gratuite par défaut rencontre un challenger en streaming
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Pendant la majeure partie des deux dernières années, Whisper Large v3 Turbo a été la réponse par défaut à « transcrire nous-mêmes gratuitement », et le nouveau Muse Voice Transcribe de Meta est le défi de streaming le plus crédible que ce défaut ait rencontré. Whisper Large v3 Turbo est le modèle de transcription à poids ouverts d'OpenAI — 809 millions de paramètres sous licence MIT, 99 langues, auto-hébergeable sur tout appareil, d'un ordinateur portable à une ferme de GPU, et gratuit à exécuter une fois que l'on possède le matériel. Muse Voice Transcribe, de Meta Superintelligence Labs, lancé le 1er septembre 2026, est un modèle fermé, hébergé et streaming, au prix de 3,00 $ pour 1 000 minutes audio. Ce ne sont pas des rivaux sur la précision — ils sont rivaux sur un axe bien plus fondamental : votre pipeline de transcription doit-il fonctionner sur votre propre matériel comme un traitement par lots, ou diffuser via l'API de quelqu'un d'autre comme une fonctionnalité en direct ?
La ligne de base gratuite, et pourquoi elle perdure.
Whisper Large v3 Turbo est le petit frère distillé de Whisper Large v3 : même encodeur à 32 couches, mais le décodeur passe de 32 couches à 4, ce qui explique pourquoi le nombre de paramètres tombe à 809M et que la vitesse est environ multipliée par quatre sur GPU, tout en restant proche en précision. Comme les poids sont sous licence MIT et que le modèle est suffisamment léger pour tourner sur une station de travail, il est devenu le moteur de transcription embarqué par défaut pour tout, des robots de réunion aux outils de sous-titrage. Ses faiblesses sont tout aussi connues. Il n'a explicitement pas été entraîné pour la traduction, donc la tâche de traduction se dégrade fortement. Sa précision sur un audio difficile est inégale — environ 8 à 12 % de WER sur de la parole bruitée lors des tests communautaires. Et c'est un modèle par lots : conçu pour prendre un fichier audio et renvoyer une transcription, pas pour produire les mots au fur et à mesure qu'ils sont prononcés.

Le streaming est la vraie différence.
C'est l'axe qui décide de la confrontation, et il n'y a pas photo. Whisper Large v3 Turbo est orienté traitement par lots ; les implémentations de streaming auto-hébergées atteignent généralement une latence de 1 à 5 secondes, ce qui manque la barre des moins de 800 millisecondes requise pour les agents téléphoniques et le sous-titrage en direct, sauf à déployer une ingénierie substantielle. Muse Voice Transcribe est natif pour le streaming : il consomme l'audio par blocs de 80 millisecondes, utilise un « délai adaptatif » appris par renforcement pour valider chaque mot dès que le modèle est confiant, et annonce des transcriptions finales 0,16 seconde après que le locuteur s'arrête de parler. Si votre produit a besoin des mots pendant que la personne parle encore — un sous-titre en direct, un agent vocal, un résumé de réunion en temps réel — Muse offre une capacité que Whisper Turbo ne fait qu'approcher avec un tas de code de liaison personnalisé.
Ce que 0,18 $ par heure audio permet d'obtenir et que le gratuit n'offre pas
Le deuxième écart structurel concerne les fonctionnalités. Whisper Large v3 Turbo vous donne du texte, et rien d’autre : pas de diarisation des locuteurs, pas de ponctuation ni de majuscules par défaut, pas de détection de fin d’énoncé, pas de biais de mots-clés. Une pile de production construite sur Whisper assemble ces éléments séparément — un diariseur, un modèle de ponctuation, un détecteur d’activité vocale — chacun ajoutant ses propres modes de défaillance et sa latence. Muse Voice Transcribe est livré avec ces fonctions intégrées : diarisation de 20+ locuteurs dans le cadre du passage en streaming, détection de fin d’énoncé qui indique à votre application quand un tour de parole est réellement terminé, ainsi qu’un biais de langue, de mots-clés et de contexte. Pour l’audio en direct avec plusieurs locuteurs, le Whisper « gratuit » n’est pas gratuit dès que l’on compte les systèmes de diarisation et de détection d’activité vocale (VAD) que vous devez construire et exécuter autour de lui.

Précision, avec des sources directes.
• Whisper Large v3 Turbo — 2,1 % de WER sur LibriSpeech test-clean et 4,2 % sur test-other ; environ 7,7 % sur le composite du classement Open ASR, soit environ un point derrière le Large v3 complet ; 8 à 12 % sur l’audio bruité lors de tests communautaires. Ce sont des poids ouverts, ces chiffres sont donc les plus indépendamment reproduits dans le monde de la parole.
• Muse Voice Transcribe — 3,1 % de WER sur les transcriptions finales à 0,16 seconde après la fin de la parole, une affirmation du jour du lancement de Meta citant le classement de streaming d'Artificial Analysis ; 3,6 % sur les premiers résultats partiels. Chiffres rapportés par le fournisseur, non reproduits, et mesurés sur un chemin de streaming dont Whisper Turbo n'a pas d'équivalent direct.
Les deux ne sont pas comparables en l'état : les chiffres de Whisper sont obtenus en traitement par lots et sa faiblesse face à l'audio bruité est documentée ; le chiffre de Muse est obtenu en streaming et n'a été vérifié par personne d'autre que le fournisseur. Ce que l'on peut dire honnêtement, c'est que l'affirmation de Muse est plausible pour de la parole non bruitée en streaming, que l'avantage de Whisper tient à son bilan audité et ouvert — y compris ses faiblesses documentées — et qu'aucun des deux ne vous donne de raison de lui faire confiance sur un audio comme le vôtre tant que vous ne l'avez pas testé sur un audio comme le vôtre.
Langues : 99 contre 25 vérifiées
Whisper Large v3 Turbo transcrit 99 langues, et même si les performances se dégradent pour les langues à faibles ressources et les langues tonales — le thaï, le cantonais et le gallois étant les points faibles les plus souvent cités — cette liste repose sur des années de reproduction communautaire. Muse Voice Transcribe a été entraîné sur plus de 70 langues, mais n’en valide que 25 au lancement, avec comme différenciateur le code-switching natif : il change de langue au milieu d’une phrase sans qu’on le lui demande. Si vous avez besoin d’une large couverture multilingue dès aujourd’hui, les 99 langues de Whisper sont l’option la plus sûre. Si vos conversations mélangent réellement les langues — une file d’attente de support à Hong Kong, un étage commercial espagnol-anglais — le code-switching de Muse est la fonctionnalité que Whisper ne possède tout simplement pas.

Coût : quasi gratuit vs à l'usage
Whisper Large v3 Turbo est gratuit à exécuter ; le coût réside dans le matériel. Un déploiement faster-whisper Turbo sur un seul T4 coûte de l'ordre de 0,05 à 0,10 $ par heure d'audio au tarif actuel du GPU, et une charge de 100 000 minutes par mois peut représenter environ 400 à 1 200 $ par mois d'infrastructure GPU — avant même d'ajouter la pile de diarisation et de ponctuation. Muse Voice Transcribe est facturé 0,18 $ par heure d'audio, toutes fonctionnalités incluses, sans matériel à provisionner : 180 $ pour 1 000 heures. Le seuil de rentabilité ne tient pas seulement au volume. Il dépend de la valeur que vous accordez au temps d'ingénierie nécessaire pour exécuter et maintenir une pile open-weights, et de la nature de votre charge de travail : en temps réel (où la latence de streaming d'une solution auto-hébergée peut disqualifier Whisper d'emblée) ou par lots (où le débit de Whisper et le coût marginal d'API nul l'emportent).
Configurations hybrides, et ce que le routage signifie pour elles.
La configuration réelle la plus courante n'est pas « l'un ou l'autre », mais « les deux » : une instance Whisper Large v3 Turbo auto-hébergée pour le canal de traitement par lots à haut volume, et une API de streaming gérée pour le trafic temps réel multi-locuteurs que Whisper ne peut pas prendre en charge à la latence requise. C'est exactement là qu'une couche de routage démontre son intérêt : une seule API pour l'ensemble des modèles hébergés de la pile, les prix catalogue des fournisseurs répercutés à 0 % de marge, et un basculement automatique pour que le canal temps réel continue de diffuser si un point de terminaison d'un fournisseur se dégrade. L'instance Whisper auto-hébergée reste sur votre matériel ; la passerelle évite simplement que la moitié de la pile facturée à l'usage ne devienne un second projet d'intégration.
Lequel devriez-vous choisir ?
Choisissez Whisper Large v3 Turbo lorsque l’audio est pré-enregistré, volumineux et majoritairement en anglais ou dans des langues bien couvertes — le rapport coût-efficacité, la licence MIT et la piste d’audit ouverte sont imbattables, et l’absence de fonctions de streaming ne pose aucun problème pour un traitement par lots. Choisissez Muse Voice Transcribe lorsque l’audio est en direct et multi-locuteur, lorsque vous avez besoin des mots au moment où ils sont prononcés, ou lorsque vos conversations alternent les langues — 0,18 $ de l’heure pour le streaming, la diarisation de plus de 20 locuteurs et la détection de fin de parole expliquent pourquoi le choix gratuit par défaut a désormais un concurrent. Et si vous êtes honnête quant à votre charge de travail, vous découvrirez souvent que c’est les deux — ce qui est exactement la configuration que les mondes ouvert et hébergé permettent désormais de faire tourner côte à côte aisément.
