Une carte de titre « hero » générée pour « VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo : le streaming natif face au cheval de trait des 99 langues », sous-titrée « Le streaming natif face au cheval de trait des 99 langues », avec deux cartes de modèles — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 septembre 2026 · MIT · Streaming natif · 10 langues) et Whisper Large v3 Turbo (OpenAI · octobre 2024 · MIT · Par lots · 99 langues) — et des étiquettes indiquant « segments de ~2,9 s + ~0,5 s de lookahead », « 7 M+ de téléchargements / mois (Whisper) » et « Aucun benchmark publié à ce jour ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo : le streaming natif contre le cheval de trait des 99 langues

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il y a de fortes chances que le modèle de transcription vocale que vous utilisez aujourd’hui soit Whisper Large v3 Turbo, et un nouveau modèle se demande s’il devrait en être ainsi. Whisper Large v3 Turbo — le checkpoint distillé de 809 millions de paramètres publié en octobre 2024 — est le cheval de bataille des modèles open-weights : 99 langues, environ quatre à huit fois plus rapide que le large-v3 original, assez léger pour un ordinateur portable, sous licence MIT, et adossé au plus vaste écosystème de transcription qui existe. VibeVoice-ASR-Streaming-1.5B, mis en ligne par Microsoft Research le 2 septembre 2026, est le challenger conçu pour ce que Whisper ne fait pas nativement : la transcription en continu. Il transcrit par segments à mesure que l’audio arrive plutôt que d’avaler des fenêtres fixes, il annonce une sortie avec attribution aux locuteurs, et il affiche dix langues, sans aucun benchmark publié à son actif.

Cette dernière clause est la raison pour laquelle cette page est structurée autour d'une question de migration plutôt que d'une confrontation. Les chiffres de Whisper Large v3 Turbo sont mesurés et publics — LibriSpeech, le composite Open ASR, Common Voice — tandis que la fiche du modèle VibeVoice-ASR-Streaming-1.5B ne publie aucun chiffre de WER ou de latence dans le texte, et aucun benchmark indépendant n'existe au moment où nous écrivons ces lignes. Tout ce qui concerne le côté Microsoft ci-dessous est ce qui est connaissable à partir de son dépôt : les fichiers de configuration, la fiche du modèle et les documents de streaming de Microsoft. Tout ce qui concerne le côté Whisper est un dossier public établi. Les deux n'ont pas été opposés directement ; la comparaison se fait entre ce qui est prouvé et ce qui est promis.

Le modèle que vous exécutez probablement déjà

Whisper Large v3 Turbo a mérité sa place sans éclat : il est rapide, compact, multilingue et ennuyeux de la façon que les équipes de production apprécient. Distillé à partir du Whisper large-v3 à 1,55 milliard de paramètres pour descendre à 809 millions de paramètres, il conserve la couverture de 99 langues et environ 95 % de la précision du large-v3 — environ 2,1 % de WER sur LibriSpeech clean, et autour de 7,7 à 7,8 % sur le composite Open ASR, avec la plus forte dégradation sur les langues à faibles ressources et les langues tonales — tout en étant plusieurs fois plus rapide et en tenant dans environ 1,6 Go de VRAM en FP16. Il est sous licence MIT, fonctionne via faster-whisper, whisper.cpp et trois ans d’intégrations, et sa page Hugging Face affiche plus de sept millions de téléchargements en un seul mois. Si vous auto-hébergez la transcription, il y a fort à parier que c’est ce modèle qui s’en charge.

Ce que Whisper Large v3 Turbo n'est pas, et n'a jamais prétendu être, c'est un modèle de streaming. Il ingère l'audio par fenêtres fixes de 30 secondes et renvoie une transcription par fenêtre ; il ne dispose ni de détection native d'activité vocale, ni de détection de fin d'énoncé, ni de diarisation des locuteurs, ni de mécanisme de mot déclencheur. La transcription en direct sur Whisper est toujours un rétrofit que vous construisez — et c'est dans ce rétrofit que résident la latence et le coût d'ingénierie.

Qu'est-ce qui change réellement si vous changez ?

• Modèle de latence — VibeVoice-ASR-Streaming-1.5B émet du texte une fois par segment résolu d’environ 2,9 secondes avec ~0,5 s d’anticipation, par conception, par rapport à Whisper Large v3 Turbo : un modèle par lots à fenêtre de 30 secondes qui nécessite une couche de découpage et de raccordement pour s’approcher d’une sortie en direct.

• Forme de session — sessions live sans limite, contexte conservé d'un chunk à l'autre dans un cache de préfixes, vs fenêtres distinctes de 30 secondes sans état conversationnel entre elles.

• Langues — dix (chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe, espagnol) contre 99.

• Précision dans les publications — aucune publiée vs ~2,1 % LibriSpeech clean, ~7,7–7,8 % Open ASR composite, toutes mesurées et publiques.

Extras de sortie — revendique l’attribution en streaming « qui a dit quoi » et les hotwords vs horodatages de mots disponibles, mais pas de diarisation ni de hotwords nativement.

• Matériel — ~5,6 Go de poids bf16 sur un GPU NVIDIA, installation à partir des sources vs ~1,6 Go FP16, fonctionne sur ordinateurs portables et CPU via whisper.cpp et faster-whisper.

• Licence — MIT, les deux.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Le problème de la modernisation du streaming

La façon honnête d'envisager cette comparaison est que Whisper Large v3 Turbo a un problème de streaming que vous avez déjà payé ou que vous payez encore. Un pipeline en direct sur Whisper implique un détecteur d'activité vocale pour trouver la parole, un découpeur pour découper l'audio en fenêtres de la taille de Whisper, des fenêtres qui se chevauchent pour que les mots ne soient pas perdus aux frontières, et un assembleur pour réconcilier les transcriptions partielles. Les implémentations communautaires de cette pile aboutissent à une latence de bout en bout d'environ une à cinq secondes — acceptable pour des notes de réunion, mais en deçà du niveau requis pour les agents téléphoniques et le sous-titrage en direct.

VibeVoice-ASR-Streaming-1.5B élimine le retrofit par construction. Sa configuration de préprocesseur fixe un lot de 22 trames et une anticipation de 4 trames sur un flux de jetons vocaux d'environ 7,5 Hz — soit environ 2,9 secondes d'audio par segment émis, et une demi-seconde de contexte futur — et la documentation de Microsoft décrit le contexte des lots précédents comme étant préservé via le cache KV, de sorte qu'une session en direct ne recalcule pas tout depuis zéro. Mais il faut lire le mot « streaming » attentivement des deux côtés de cette comparaison : aucun des deux modèles n'est un moteur de résultats partiels mot à mot du type de ceux que vendent les API commerciales à plus faible latence. La transcription de VibeVoice progresse par incréments d'environ trois secondes par conception, ce qui est un rythme différent et généralement acceptable pour des réunions, mais ce n'est pas sous la seconde, et si votre exigence est d'avoir les mots à l'écran en moins d'une seconde, vous devriez mesurer cette géométrie de lots par rapport à ce budget avant de construire dessus.

Précision : ce à quoi vous renoncez pour passer au streaming natif

Voici l'écart qui devrait guider la décision. Whisper Large v3 Turbo dispose d'un historique de précision public que vous pouvez auditer — et lorsque l'enregistrement se trouve parmi ses 99 langues, cet historique est solide. VibeVoice-ASR-Streaming-1.5B ne dispose d'aucun historique de ce type : l'évaluation de la fiche du modèle est une image, Microsoft n'a publié aucun WER en streaming sous forme de texte, et le seul repère numérique de la famille est le WER moyen de 7,77 % déclaré par le fournisseur sur la fiche du modèle batch VibeVoice-ASR, obtenu sur huit ensembles de test en anglais, qui décrit un modèle différent et non streamé. La phrase honnête est que transférer votre transcription vers VibeVoice-ASR-Streaming-1.5B aujourd'hui signifie accepter un niveau de précision inconnu sur votre propre audio — ce qui explique précisément pourquoi toute évaluation de ce modèle doit être menée par vous, sur vos enregistrements réels les plus difficiles, avant qu'il ne mérite le trafic de production.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Langues et attribution des locuteurs : l'écart fonctionnel joue dans les deux sens

La comparaison des fonctionnalités n'est pas à sens unique, et c'est précisément ce qui rend le choix réellement intéressant. Si votre audio est multilingue, la décision s'arrête immédiatement : les 99 langues de Whisper Large v3 Turbo couvrent ce que les dix de VibeVoice-ASR-Streaming-1.5B ne couvrent pas, et un plafond de dix langues disqualifie tout pipeline confronté à un large mélange de parole. Mais si votre charge de travail se situe dans ces dix langues et que ce dont vous avez réellement besoin est de savoir qui a dit quoi lors d'une réunion en direct, la balance penche de l'autre côté : Whisper n'offre ni diarisation native ni hotwords, tandis que VibeVoice-ASR-Streaming-1.5B revendique les deux — une sortie en streaming attribuée au locuteur et des hotwords du domaine passés comme prompt contextuel. Cette affirmation n'est pas vérifiée, et la diarisation en streaming à travers les frontières de segments est assez ardue pour mériter du scepticisme, mais c'est la fonctionnalité concrète qu'aucune ingénierie Whisper ne vous procure prête à l'emploi.

Les calculs de migration

Le coût et l'effort jouent en faveur du modèle en place. Whisper Large v3 Turbo tourne déjà dans votre pile logicielle sur du matériel que vous possédez — un ordinateur portable, un CPU, un GPU modeste — et passer à VibeVoice-ASR-Streaming-1.5B signifie installer une solution de recherche à partir des sources sur un GPU NVIDIA avec ~5,6 Go de poids, valider un chemin de chargement dont la classe d'architecture n'est pas encore couverte par la documentation publique de Transformers, et construire de toutes pièces le benchmark sur lequel reposera votre décision. C'est un vrai projet, et le retour dépend de l'importance que ces fonctionnalités non vérifiées ont pour vous.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

La façon économique de mener ce projet est de ne pas le traiter comme un remplacement. Gardez Whisper Large v3 Turbo comme modèle par défaut et acheminez une partie de l’audio en direct vers VibeVoice-ASR-Streaming-1.5B via une seule API — le schéma même pour lequel une couche de routage existe : plus de 200 modèles derrière un point de terminaison unique, au prix catalogue du fournisseur sans marge, bascule automatique lorsque le nouveau modèle trébuche, et un DSL de routage qui permet à différentes charges de travail de choisir différents transcripteurs à partir d’un seul appel. C’est le modèle d’OrcaRouter, et c’est la différence entre parier votre pipeline de production sur un point de contrôle vieux de deux jours et laisser ce point de contrôle gagner sa place face au cheval de trait sur vos propres transcriptions.

Foire aux questions

Est-ce que Whisper Large v3 Turbo peut réellement faire de la diffusion en direct ?

Uniquement en tant que rétrofit. Whisper Large v3 Turbo est un modèle par lots qui traite des fenêtres fixes de 30 secondes ; la transcription en direct exige donc de construire par-dessus un détecteur d'activité vocale, un découpeur, une stratégie de chevauchement et un assembleur. Des implémentations fonctionnelles existent et se situent à environ une à cinq secondes de latence, ce qui convient aux notes de réunion, mais manque le seuil sous la seconde pour les agents téléphoniques et le sous-titrage en direct. VibeVoice-ASR-Streaming-1.5B est nativement conçu pour le streaming : il émet du texte par segment d'environ 2,9 secondes avec environ 0,5 seconde d'anticipation — mais il s'agit d'un streaming par segments, pas de partiels mot à mot, alors vérifiez aussi cette cadence par rapport à votre propre budget de latence.

VibeVoice-ASR-Streaming-1.5B est-il plus précis que Whisper Large v3 Turbo ?

Personne ne peut répondre à cela pour l’instant, y compris Microsoft. La précision de Whisper Large v3 Turbo est mesurée et publique — environ 2,1 % de WER sur LibriSpeech clean et 7,7–7,8 % sur le composite Open ASR. VibeVoice-ASR-Streaming-1.5B n’a pas de chiffre de WER en streaming publié dans un texte ni de benchmark indépendant à ce jour. La seule façon de répondre à la question est d’exécuter le checkpoint sur votre propre audio et de comparer les transcriptions avec votre système actuel — c’est précisément le test que cette page recommande avant toute migration.

Quelles langues les deux prennent-ils en charge ?

Whisper Large v3 Turbo prend en charge 99 langues avec un seul ensemble de poids. VibeVoice-ASR-Streaming-1.5B en répertorie dix : le chinois, l'anglais, le français, l'allemand, l'italien, le japonais, le coréen, le portugais, le russe et l'espagnol. Pour tout audio hors de cet ensemble de dix langues, Whisper est la seule option dans ce duo, et l'écart multilingue est de loin la raison la plus claire pour laquelle la plupart des équipes resteront là où elles sont.

Whisper Large v3 Turbo est le modèle approprié pour la plupart des équipes la plupart du temps, et un checkpoint vieux de deux jours sans benchmarks ne justifie pas de changer de plateforme. C'est une raison pour mener une expérience. Si votre audio se trouve dans ses dix langues et que l'attribution de locuteur en direct changerait votre produit, mettez VibeVoice-ASR-Streaming-1.5B en place derrière un routeur, dirigez une partie du trafic réel vers lui, et laissez les transcriptions — et non l'absence de benchmark d'un côté ou de l'autre — décider.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube