
VibeVoice-ASR-Streaming-1.5B, expliqué : la technologie ASR en streaming de Microsoft est arrivée sans lancement officiel
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0259Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0258Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0166Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
Le 2 septembre 2026, Microsoft Research a mis en ligne deux nouveaux checkpoints de reconnaissance vocale sur Hugging Face, sans communiqué de presse, sans article de blog et sans fanfare : microsoft/VibeVoice-ASR-Streaming-1.5B et sa version plus grande microsoft/VibeVoice-ASR-Streaming-7B. La seule annonce à ce jour est une entrée datée du 3 septembre 2026 dans la section News du dépôt GitHub open-source VibeVoice de Microsoft, décrivant la sortie comme un modèle ASR unifié en streaming qui transcrit qui a dit quoi pendant que l'audio est encore en train d'arriver, avec des hotwords personnalisés et dix langues. Les deux checkpoints sont sous licence MIT, ils ont tous deux été créés à environ cinq minutes d'intervalle sur le compte Hugging Face officiel de Microsoft, et tous deux affichaient zéro téléchargement lorsque nous avons vérifié un jour plus tard. Nous n'avons trouvé aucune couverture de l'un ou de l'autre par un tiers.
Cela en fait un compte rendu inhabituel : une version réelle et datable — des poids sur Hugging Face datés du 2 septembre, une annonce dans le dépôt datée du 3 septembre — que le grand public n'a pas encore rattrapée. Tout ce qui suit et qui est connaissable provient de la lecture du dépôt : les fichiers de configuration, la fiche du modèle et la documentation streaming de Microsoft. Tout ce qui n'est pas encore confirmé — la précision, la latence réelle, la question de savoir si l'attribution de l'orateur en streaming survit à un véritable appel à deux intervenants — est étiqueté comme tel. Il n'y a pas de benchmark à citer car Microsoft n'en a pas encore publié sous forme texte.
La seule annonce est une ligne d'actualités.
VibeVoice est la famille de modèles de parole open source sous licence MIT de Microsoft Research. Son membre ASR le plus connu, microsoft/VibeVoice-ASR, a été publié le 21 janvier 2026 : un modèle batch qui ingère jusqu'à soixante minutes d'audio en une seule passe et renvoie des transcriptions structurées avec locuteur, minutage et contenu — environ 700 000 téléchargements sur Hugging Face ont suivi. Le 2 septembre, la même organisation a publié les modèles frères en streaming, microsoft/VibeVoice-ASR-Streaming-7B et microsoft/VibeVoice-ASR-Streaming-1.5B ; l'API de Hugging Face horodate le 7B à 2026-09-02T15:46 UTC et le 1.5B cinq minutes plus tard à 15:51 UTC. Le tableau des modèles du dépôt GitHub répertorie désormais VibeVoice-ASR-Streaming comme entrée à part entière, et sa section News comporte l'entrée du 3 septembre qui l'annonce.
Ce qui est vraiment nouveau par rapport au modèle de janvier, c'est le modèle d'interaction : les checkpoints en streaming retranscrivent au fur et à mesure que l'audio arrive, au lieu d'attendre un fichier complet. Tout le reste — l'architecture sous-jacente des tokens de parole, la sortie attribuée au locuteur, le mécanisme de hotword — est une continuation de la conception par lots, mise à l'échelle et réorientée vers un usage en temps réel. Notez d'emblée la différence de langues : le modèle par lots revendique plus de 50 langues, tandis que la fiche du modèle en streaming en liste dix.

Ce que « streaming » signifie dans ce checkpoint
La documentation de streaming de Microsoft décrit clairement l'intention : le modèle transcrit pendant que l'audio arrive encore, et il émet du texte à chaque segment audio, si bien qu'une transcription apparaît pendant que le locuteur parle. Le preprocessor_config.json du dépôt 1.5B rend cette cadence concrète :
• Taux d’échantillonnage et débit de jetons — audio d’entrée 24 kHz, compressé 3 200 fois, ce qui donne environ un flux de jetons vocaux à 7,5 Hz (soit un jeton toutes les 133 ms environ).
• Morceau — 22 trames, ce qui, à 7,5 Hz, représente environ 2,9 secondes d’audio par segment émis.
• Anticipation — 4 trames, soit environ 0,5 seconde d'audio futur, utilisées pour consolider le segment actuel.
(Le calcul est simple à partir du dépôt : 22 × 3 200 = 70 400 échantillons ≈ 2,93 s à 24 kHz ; 4 × 3 200 = 12 800 échantillons ≈ 0,53 s. La propre documentation de Microsoft note qu’un checkpoint s’exécute toujours sur le segment sur lequel il a été entraîné, ces paramètres ne sont donc pas réglables au moment de l’inférence.)
Cela place cette approche dans la famille du streaming par blocs plutôt que dans celle du mot à mot : une transcription en direct s’allonge par incréments d’environ trois secondes, avec environ une demi-seconde d’anticipation, et non par des partiels à chaque token. C’est une conception légitime et courante pour la transcription de réunions et d’appels, mais elle présente un profil de latence différent de celui des systèmes qui émettent des partiels en moins d’une seconde — considérez donc le « streaming » comme un spectre et évaluez-le par rapport à votre propre budget de latence avant de construire un produit de sous-titrage en direct sur cette base.
Sous le capot : un LLM de parole à l'échelle de Qwen.
La lecture du config.json du checkpoint 1.5B donne la recette désormais familière de VibeVoice à plus petite échelle :
Le décodeur est un modèle de langage de la famille Qwen2 dont les dimensions correspondent exactement à celles de la classe Qwen2.5 1,5B — 28 couches, 1 536 unités cachées, 12 têtes d'attention avec 2 têtes clé-valeur, et une fenêtre de 65 536 jetons. Le LLM est ce qui permet au modèle de conserver la compréhension de l'interlocuteur et du contenu à travers la transcription.
• Tokeniseurs acoustiques et sémantiques — des encodeurs convolutifs profonds avec un stride de 8/5/5/4/2/2 — transforment l’audio 24 kHz en le flux de jetons de parole à ~7.5 Hz que lit le décodeur.
Une tête de diffusion (DDPM, 20 étapes de débruitage, prédiction v) se trouve du côté de la génération, en cohérence avec le reste de la gamme VibeVoice.
• Honnêteté sur la taille : les métadonnées safetensors du checkpoint indiquent environ 3 milliards de paramètres, soit environ 5,6 Go de poids. Le « 1.5B » dans le nom correspond à l’échelle du backbone linguistique — la lecture naturelle d’une configuration dont le décodeur est un modèle Qwen de classe 1,5B — les tokenizers audio et la tête de diffusion ajoutant le reste. La chaîne d’architecture dans la configuration, VibeVoiceForASRStreamingTraining, signale qu’il s’agit d’un checkpoint de la famille recherche.

Qui a dit quoi, en dix langues.
La capacité phare de la fiche du modèle est la transcription en streaming avec attribution des locuteurs : elle « transcrit en continu qui a dit quoi au fur et à mesure que la parole arrive », selon le point de la fiche lui-même. Elle met également en avant des hotwords personnalisés pour les termes de domaine, et répertorie dix langues prises en charge — chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol.

Les hotwords sont implémentés via le même mécanisme de biais contextuel que celui utilisé par le modèle batch. Dans la démo en ligne de commande de Microsoft, vous les passez comme informations contextuelles — par exemple `--context_info "Microsoft,VibeVoice"` — pour biaiser la reconnaissance vers des noms et termes techniques sans ajustement fin. La fiche ne dit rien sur la détection automatique de la langue ni sur l'alternance codique pour le modèle streaming, ce qui constitue une autre lacune par rapport aux affirmations du modèle batch.
Une réserve mérite d'être soulignée. La page de documentation sur le streaming se concentre sur l'émission par segments et les mots-clés ; elle ne précise pas comment l'attribution des locuteurs est maintenue entre les limites de segments. La diarisation en streaming est réellement difficile — les locuteurs se chevauchent, et une limite de segment est précisément là où l'attribution dérive. Le cadrage « qui a dit quoi » sur la carte est une affirmation du fournisseur jusqu'à ce que quelqu'un fasse passer un véritable appel en direct à deux locuteurs dans le système et vérifie le résultat.
Où il se situe : la famille VibeVoice et le domaine de l’ASR en streaming en 2026.
Au sein de la famille, la sortie s'insère comme suit :
• microsoft/VibeVoice-ASR (21 janvier 2026) — le fleuron du traitement par lots : jusqu’à 60 minutes en une seule passe, plus de 50 langues, sortie Qui/Quand/Quoi, hotwords, environ 700 000 téléchargements.
• microsoft/VibeVoice-ASR-Streaming-7B et microsoft/VibeVoice-ASR-Streaming-1.5B (2 septembre 2026) — les nouvelles variantes de streaming ; le sujet de cet article est la 1.5B.
• microsoft/VibeVoice-ASR-BitNet (23 juillet 2026) — un moteur de périphérie quantifié, orienté CPU, pour le modèle par lots.
Les modèles VibeVoice-1.5B TTS et VibeVoice-Realtime-0.5B streaming-TTS sont des membres distincts de la même famille, et ne font pas partie de la gamme ASR.
Le domaine plus large de l'ASR à poids ouverts n'a cessé d'évoluer vers le temps réel depuis le début de l'année, si bien qu'une nouvelle entrée en streaming dispose de points de comparaison directs. Qwen3-ASR (Alibaba, ~1,7 milliard de paramètres) est un modèle unifié streaming et hors ligne couvrant plus de 50 langues et dialectes. Le Nemotron 3.5 ASR de NVIDIA est un modèle streaming de 0,6 milliard de paramètres couvrant 40 langues, sous licence OpenMDW plutôt que MIT. Le Granite Speech 5.0 470M TurboCTC d'IBM est sous licence Apache-2.0 et affiche des débits annoncés par le fournisseur exceptionnellement élevés. Face à eux, le modèle streaming de Microsoft se distingue par trois éléments : la licence MIT, un backbone LLM qui intègre la compréhension du locuteur et du contenu plutôt qu'un pur modèle acoustique, et le cadrage en transcription en direct attribuée aux locuteurs. Ses questions ouvertes sont la précision et la latence en conditions réelles — aucune ne dispose encore d'un chiffre indépendant.
Qu'est-ce qui n'est pas encore vérifié ?
La lecture du dépôt renseigne sur la conception ; elle ne dit pas à quel point cela fonctionne bien. Plus précisément :
• Aucun chiffre de précision ni de latence dans le texte. La fiche du modèle fournit une figure des résultats sous forme d’image, mais aucun tableau numérique de WER, de RTF ou de latence dans le texte — rien à citer de manière indépendante.
• Aucune évaluation par un tiers. Les téléchargements étaient à zéro un jour après la mise en ligne ; il n'existe aucun benchmark communautaire, aucune entrée dans un classement, et aucun test indépendant que nous ayons pu trouver.
• Le chemin de service est une configuration de recherche à partir des sources. La documentation de streaming de Microsoft s'exécute à partir d'un clone du dépôt GitHub VibeVoice dans un conteneur NVIDIA PyTorch (nvcr.io/nvidia/pytorch, avec flash-attention recommandé). La fiche du modèle montre également un extrait de pipeline Transformers et renvoie les détails d'installation à GitHub ; nous n'avons pas vérifié si la version actuellement publiée de Transformers exécute l'inférence en streaming sur ce checkpoint sans configuration supplémentaire.
• Le cadrage est avant tout axé sur la recherche. Le dépôt de Microsoft décrit les modèles VibeVoice comme destinés à des fins de recherche et de développement. Les poids sont sous licence MIT ; la posture est « voici la science », et non « voici un produit pris en charge ». Prévoyez un budget pour votre propre étape d'évaluation.
Devriez-vous construire dessus ?
Pour les équipes qui auto-hébergent déjà la reconnaissance vocale (ASR), cela mérite une évaluation d'un week-end si votre audio fait partie de l'ensemble des dix langues et que vous avez spécifiquement besoin d'une transcription en direct avec attribution au locuteur à partir d'un modèle sous licence MIT. Prévoyez environ 5,6 Go de poids pour le modèle 1,5B sur un GPU NVIDIA et une installation depuis les sources, et prévoyez de mesurer vous-même la précision sur votre propre audio avant de lui faire confiance.
Pour les équipes qui déploient aujourd'hui un pipeline de transcription en production, la réponse prudente est d'attendre l'une de trois choses : que Microsoft publie les chiffres de précision et de latence qui n'existent actuellement que sous forme d'image ; un benchmark indépendant ; ou un chemin de service maintenu avec un runtime pris en charge. La cadence par segments d'environ 3 secondes est également une spécification à valider par rapport à votre exigence de latence, plutôt qu'à supposer à partir du mot « streaming ».
Le moyen le moins coûteux de préserver cette option est d'éviter de câbler votre application en dur à un seul moteur de transcription. Une couche de routage qui expose plusieurs modèles derrière une API unique fait que, lorsque VibeVoice-ASR-Streaming — ou le prochain ASR ouvert — devient disponible chez un fournisseur d'inférence, le tester en A/B contre votre moteur actuel sur le même trafic relève d'un changement de configuration plutôt que d'une migration de plateforme. Comme un routeur pass-through facture le prix catalogue du fournisseur sans marge, cette comparaison reste peu coûteuse, et le basculement automatique évite qu'un modèle jeune et non éprouvé ne devienne un point unique de défaillance dans votre pipeline. C'est le schéma général pour adopter un modèle qui vient de sortir : laissez-le gagner sa place sur du trafic réel avant de miser votre production sur lui.
FAQ
VibeVoice-ASR-Streaming-1.5B est-il une véritable version de Microsoft ?
Oui. Le checkpoint se trouve sur le compte Hugging Face officiel de microsoft, avec un horodatage de création du 2 septembre 2026, et le dépôt GitHub microsoft/VibeVoice référence VibeVoice-ASR-Streaming dans son tableau de modèles, avec une actualité datée du 3 septembre 2026. Ce qui est inhabituel n'est pas la provenance mais le silence : ni communiqué de presse, ni article de blog, ni couverture par des tiers à ce jour.
Pourquoi deux tailles, 7B et 1,5B ?
Microsoft a téléversé les deux checkpoints dans la même minute mais n’a pas publié de comparaison. D’après les configurations, le 1.5B représente le petit bout — un backbone linguistique Qwen de classe 1.5B plus la pile audio, environ 3B de paramètres et ~5,6 Go de poids. La lecture naturelle est un 7B plus précis et un 1.5B moins cher et plus rapide, mais Microsoft ne l’a pas dit, et aucun benchmark ne permet de confirmer ce compromis.
En quoi cela diffère-t-il du VibeVoice-ASR précédent ?
Le modèle par lots de janvier ingère jusqu'à 60 minutes d'audio en une seule passe et annonce plus de 50 langues. Les points de contrôle de streaming transcrivent pendant que l'audio arrive, produisant une transcription par segments d'environ 3 secondes avec environ 0,5 seconde d'avance, et la fiche du modèle répertorie dix langues. Les deux partagent la même architecture de jetons de parole, l'idée de sortie attribuée au locuteur et le mécanisme de mot d'activation.
Pour l’instant, VibeVoice-ASR-Streaming-1.5B est un checkpoint plus une ligne d’actualité. Lisez le repo si vous auto-hébergez et avez besoin d’un ASR de streaming sous licence permissive à évaluer ; attendez les chiffres si vous choisissez un moteur de production. Le signal intéressant est que Microsoft pousse sa gamme vocale vers le temps réel à deux tailles à la fois — et l’a fait si discrètement qu’un jour plus tard, le compteur de téléchargements affichait encore zéro.
