
VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo : ce que le checkpoint de streaming de Microsoft ajoute au modèle open-weight par défaut
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Pendant la majeure partie des deux dernières années, la réponse à « transcrivons-le nous-mêmes, à bas coût » a été Whisper Large v3 Turbo — le modèle open-weights d'OpenAI à 809 millions de paramètres, sous licence MIT, prenant en charge 99 langues, assez léger pour fonctionner sur une station de travail, et gratuit une fois que l'on possède le matériel. Le 2 septembre 2026, Microsoft Research a publié un concurrent à ce choix par défaut : VibeVoice-ASR-Streaming-7B, un checkpoint de streaming sous licence MIT sur Hugging Face, qui transcrit au fur et à mesure que l'audio arrive, revendique une sortie attribuée aux locuteurs et — contrairement au modèle que la plupart des équipes font déjà tourner — n'a jamais été conçu comme un traitement par lots. Les deux modèles sont des poids ouverts provenant de grands laboratoires. Presque tout le reste entre eux relève d'un compromis, et cette page explique quel compromis vous faites réellement.
Une asymétrie façonne toute la comparaison, c'est pourquoi elle vient en premier. Whisper Large v3 Turbo est le modèle de reconnaissance vocale le plus indépendamment reproduit au monde : ses taux d'erreur de mots ont été re-exécutés par des milliers d'équipes sur des benchmarks publics et leurs propres audios pendant des années, et ses faiblesses sont aussi bien documentées que ses forces. VibeVoice-ASR-Streaming-7B a un jour d'existence, ne possède aucun benchmark indépendant où que ce soit, et Microsoft n'a pas publié de taux d'erreur de mots en streaming dans un texte lisible. Tout ce qui concerne Microsoft ci-dessous est lu depuis le dépôt — configuration, fiche de modèle et documentation streaming de Microsoft — et est étiqueté comme tel.
La norme des poids ouverts, et pourquoi elle perdure
Whisper Large v3 Turbo est la version distillée de Whisper Large v3 : il garde l'encodeur à 32 couches et réduit le décodeur de 32 à quatre couches. C'est ainsi que le nombre de paramètres tombe à 809 millions et que le débit est environ quadruplé sur GPU, tout en restant proche en précision. Comme les poids sont sous licence MIT et que le modèle est petit, il est devenu le moteur de transcription embarqué par défaut pour les bots de réunion, les outils de sous-titrage et les pipelines de journalisation d'appels. Ses limites sont tout aussi connues. C'est un modèle par lots — il prend un fichier audio et renvoie une transcription, plutôt que de produire les mots à mesure qu'ils sont prononcés. Il n'a pas été entraîné pour la traduction, et cette tâche se dégrade fortement. Sa précision sur la parole bruitée, avec accent ou en chevauchement est inégale, et il renvoie du texte brut : pas de ponctuation ni de majuscules par défaut, pas de diarisation des locuteurs, pas d'horodatage sur cette variante, pas de biais de mots-clés. Les piles logicielles de production bâties sur Whisper assemblent ces éléments séparément, chacun ajoutant sa propre latence et ses propres modes de défaillance.

L'écart de spécification
• Paramètres — 809M (décodeur distillé) contre environ 9B au total (un socle linguistique Qwen2-7B plus des encodeurs vocaux ; le « 7B » correspond au LLM, la page Hugging Face indique 9B).
• Licence — MIT, open weights, les deux.
• Streaming — batch par conception : les implémentations de streaming auto-hébergées atteignent généralement une latence de 1 à 5 secondes, contre un streaming natif : segments d’environ 2,9 secondes avec une avance d’environ 0,5 seconde, texte émis par segment, contexte conservé dans un cache KV.
• Langues — 99 avec des années de reproduction communautaire contre 10 déclarées (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Au-delà de la transcription — rien par défaut, contrairement aux prétendues sorties en streaming indiquant qui a dit quoi et aux hotwords personnalisés (non vérifié).
• Précision affichée — 2,1 % WER sur LibriSpeech test-clean, 4,2 % sur test-other, ~7,7 % sur le composite Open ASR, 8–12 % sur l'audio bruité lors de tests communautaires, le tout indépendamment reproduit, contre aucun chiffre de WER en streaming publié sous forme de texte.
• Empreinte mémoire — fonctionne sur un ordinateur portable ou un seul GPU modeste, contre environ 18 Go de poids bf16 avant le cache KV ; prévoyez un GPU de classe 24 Go.

Ce que le streaming ajoute réellement
S'il y a une raison de regarder au-delà de Whisper Large v3 Turbo, c'est le créneau du temps réel : c'est là que les deux modèles cessent d'être comparables. Whisper est conçu pour le traitement par lots. Pour obtenir les mots pendant que le locuteur parle encore, les équipes greffent du découpage en segments, de la détection d'activité vocale et du code de collage, et les implémentations de streaming auto-hébergées affichent généralement une latence d'une à cinq secondes — manquant l'exigence de latence sous la seconde pour les agents téléphoniques et le sous-titrage en direct, à moins d'une ingénierie sérieuse. VibeVoice-ASR-Streaming-7B est précisément conçu pour ce créneau. Sa configuration présente un audio compressé 3 200 fois en un flux de jetons à 7,5 trames par seconde, traité par blocs de 22 trames avec une anticipation de quatre trames — soit environ 2,9 secondes d'audio par bloc —, le texte étant émis à mesure que chaque bloc est traité et le contexte antérieur étant conservé dans le cache KV, si bien qu'une session ne recalcule pas tout à partir de zéro. Cette cadence est une valeur de conception dérivée de la configuration, et non une latence mesurée, et personne n'a encore publié de chiffre de bout en bout pour ce modèle ; mais l'architecture est sans équivoque une architecture de transcription en direct, ce que Whisper n'est pas.
Le bilan de Whisper est long et public ; celui du nouveau checkpoint est vierge.
La précision est le domaine où l'âge de Whisper Large v3 Turbo s'avère un atout. Ses 2,1 % de WER sur LibriSpeech test-clean et 4,2 % sur test-other sont des chiffres en open-weights reproduits par d'innombrables équipes ; ses environ 7,7 % sur le composite du leaderboard Open ASR se situent à environ un point derrière le Large v3 complet ; et ses 8 à 12 % documentés sur l'audio bruité dans les tests communautaires ne surprennent personne. Ces faiblesses font partie du bilan ; elles vous indiquent exactement où le modèle a besoin d'aide avant que vous ne construisiez dessus.
VibeVoice-ASR-Streaming-7B n'a aucun de ces antécédents. Sa fiche modèle présente une figure d'évaluation sous forme d'image, et le rapport technique de streaming de Microsoft est un PDF, mais il n'y a aucun taux d'erreur de mots (WER) streaming citable en prose. Le seul ancrage numérique de la famille est le tableau fourni par le vendeur sur la fiche du modèle batch VibeVoice-ASR — 7,77 % de WER moyen sur huit ensembles de test anglais et 2,20 % sur LibriSpeech clean — ce qui n'est pas le chiffre de ce checkpoint, et la réception communautaire du modèle batch a été mitigée : loué pour la diarisation prête à l'emploi, critiqué comme lourd et parfois sujet aux hallucinations. Rien de tout cela ne se transpose au modèle streaming, et c'est précisément le problème : avec Whisper, on connaît les modes de défaillance à l'avance ; avec VibeVoice-ASR-Streaming-7B, vous êtes le premier testeur.
Langues et empreinte : 99 contre 10, 0.8B contre 9B
Les deux coûts les plus concrets du changement sont les langues et la taille. Whisper Large v3 Turbo transcrit 99 langues ; les langues à faibles ressources et les langues tonales voient leur qualité se dégrader — le thaï, le cantonais et le gallois sont les points faibles les plus souvent cités — mais cette liste s'appuie sur des années de reproduction par la communauté. VibeVoice-ASR-Streaming-7B en déclare dix : anglais, chinois, espagnol, portugais, allemand, japonais, coréen, français, russe et italien. Si votre trafic se situe dans ces dix langues, la couverture ne pose aucun problème ; dans le cas contraire, la comparaison s'arrête ici. La taille est le deuxième coût : 809M paramètres fonctionne sur un ordinateur portable, tandis qu'environ 9B paramètres au total en bf16 signifie environ 18 Go de poids avant le cache KV et un GPU de classe 24 Go pour le faire tourner confortablement. Pour les équipes qui exécutent déjà Whisper sur du matériel modeste, cela représente un vrai pas en avant en matière d'infrastructure, justifié uniquement par un besoin réel de transcription en direct.
Quand la gratuité n'est pas le but
Whisper Large v3 Turbo est gratuit à exécuter ; le coût réside dans le matériel et l'ingénierie qui l'entourent. Un déploiement faster-whisper sur une seule T4 revient à environ 0,05 à 0,10 dollar par heure d'audio au tarif en vigueur du GPU, et une charge de travail soutenue ajoute la pile de diarisation et de ponctuation qu'il faut construire, car Whisper renvoie du texte brut. VibeVoice-ASR-Streaming-7B est lui aussi gratuit à exécuter, sur du matériel plus coûteux, en échange d'une architecture de streaming qui revendique l'attribution des locuteurs et les contrôles de contexte dont Whisper est dépourvu — des affirmations que vous devrez vérifier par vous-même, puisqu'aucun benchmark indépendant n'existe. Pour la transcription par lots à grande échelle, le débit de Whisper et son empreinte réduite l'emportent encore. Pour l'audio en direct à plusieurs locuteurs, lorsque la transcription doit arriver pendant la conversation, Whisper va à l'encontre de sa propre conception, et le checkpoint streaming va dans son sens — à supposer qu'il fonctionne, ce qui est précisément la question à laquelle il faut répondre avec votre propre audio, sur votre propre GPU.

La pile pragmatique.
La réponse la plus courante dans la pratique n’est pas « l’un ou l’autre » mais « les deux », et c’est la recommandation ici : conservez Whisper Large v3 Turbo comme voie de traitement par lots à haut volume, où son bilan et son empreinte le rendent imbattable, et évaluez VibeVoice-ASR-Streaming-7B sur la voie temps réel que Whisper ne peut pas assurer à la latence requise — avec un sas d’évaluation explicite, car il n’existe aucun benchmark sur lequel s’appuyer. Les deux peuvent partager un même budget GPU et une même base de code. Là où une couche de routage mérite sa place dans cette pile, c’est au-dessus des transcriptions, pas au niveau de la transcription elle-même : OrcaRouter ne route pas la reconnaissance vocale aujourd’hui et aucun des deux modèles n’est dans son catalogue, mais les générateurs de résumés, les règles d’alerte et les planificateurs d’agents qui consomment une transcription en direct sont exactement les plus de 200 modèles de langage qu’il expose via une API unique, aux prix catalogue des fournisseurs répercutés sans aucune majoration, avec une bascule automatique entre les fournisseurs. Un checkpoint de streaming publié sans le moindre benchmark mérite le même traitement que tout modèle non éprouvé — une part du trafic réel derrière un système de repli, gagnant ou perdant votre confiance sur la base de vos propres réunions plutôt que sur une fiche modèle.
