Une carte titre en vedette comparant 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live', surtitrée 'Transcription vocale en streaming - Sept. 2026', avec un sous-titre précisant que le checkpoint open source discret de Microsoft rencontre la Live API mesurée de Google, des chips 'Poids MIT - 2 sept.', 'API Google - 26 août' et 'Aucun WER VibeVoice publié', ainsi qu'une note de bas de page 'Ce que l'on sait pour l'instant'. Le logo OrcaRouter est composé en bas à droite.
Guides & Insights

VibeVoice-ASR-Streaming-7B face à Gemini 3.5 Transcribe Live : une semaine, deux types de reconnaissance vocale en streaming

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La dernière semaine d'août et les premiers jours de septembre 2026 ont donné naissance à deux systèmes de transcription vocale en streaming qui semblent rivaux et constituent en réalité des réponses différentes à une même question. Le 26 août, Google a mis Gemini 3.5 Transcribe Live en aperçu public : un point de terminaison de transcription vocale hébergé et fermé qui renvoie une transcription achevée 0,40 seconde après qu'un locuteur a cessé de parler, adossé à un taux d'erreur lexicale en streaming de 4,0 % mesuré par Artificial Analysis et à des supports de lancement complets. Le 2 septembre, Microsoft Research a téléversé VibeVoice-ASR-Streaming-7B sur Hugging Face sous l'espace de noms microsoft : des poids ouverts sous licence MIT, pas de communiqué de presse, pas de page de lancement, et une fiche de modèle qui ne publie aucun taux d'erreur lexicale ni aucune donnée de latence dans un texte lisible. Tous deux acceptent l'audio pendant qu'il arrive encore. C'est à peu près la seule chose qu'ils partagent.

Les preuves des deux côtés ne sont pas symétriques, cette comparaison est donc rédigée comme un état des connaissances actuelles. Gemini 3.5 Transcribe Live est un produit Google dont les prix par token et les mesures tierces sont publiés, et ces éléments sont indiqués ci-dessous. VibeVoice-ASR-Streaming-7B est un point de contrôle dont chaque affirmation provient directement du dépôt lui-même : les fichiers de configuration, la fiche du modèle et la documentation de streaming de Microsoft dans le dépôt GitHub VibeVoice. Rien du côté Microsoft n'a encore été évalué de manière indépendante, et nous le précisons partout où un nombre pourrait autrement sembler faire autorité.

Le parcours de publication : un lancement d'API et une mise en ligne discrète

Google a publié Gemini 3.5 Transcribe Live de manière classique. Le modèle se trouve sous la bannière Gemini Audio avec son jumeau Gemini 3.5 Transcribe (la variante pré-enregistrée de l’API Interactions), les tarifs figurent sur la page du modèle et les classements indépendants ont intégré l’endpoint Live en quelques jours — c’est de là que proviennent le WER de 4,0 % en streaming et la latence finale de 0,40 seconde. Un niveau gratuit est disponible, avec la réserve habituelle selon laquelle le contenu du niveau gratuit peut être utilisé pour améliorer les produits Google.

La version streaming de Microsoft ne disposait d'aucun de ces mécanismes. Le dépôt Hugging Face microsoft/VibeVoice-ASR-Streaming-7B a été créé le 2026-09-02 à 15:46 UTC et modifié pour la dernière fois trois minutes plus tard ; il contient huit fragments safetensors, un tokenizer et une configuration de préprocesseur sous licence MIT. La trace officielle est une entrée du journal datée du 3 septembre dans le dépôt microsoft/VibeVoice annonçant « un modèle ASR streaming unifié qui transcrit en continu qui a dit quoi au fur et à mesure que la parole arrive, avec prise en charge de hotwords personnalisés et de 10 langues », avec des liens vers une démo sur aka.ms/vibeasr et un rapport technique sur le streaming. Lorsque nous avons vérifié un jour après le téléversement, le point de contrôle affichait toujours zéro téléchargement, et aucun fournisseur d'inférence hébergée ne le répertorie. La fiche du modèle en dit plus que l'annonce, et le dépôt est la source de presque tout ce qui suit.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Les spécifications, côte à côte

• Ce que c'est — VibeVoice-ASR-Streaming-7B : ASR en streaming à poids ouverts, auto-hébergé, vs Gemini 3.5 Transcribe Live : API de streaming hébergée, à poids fermés.

• Forme de streaming — émet du texte par segments d’environ 2,9 secondes avec environ 0,5 seconde d’anticipation (dérivé de la configuration du point de contrôle) par rapport à une session WebSocket bidirectionnelle avec des transcriptions partielles continues et un résultat final 0,40 seconde après que le locuteur s’arrête.

• Précision dans la documentation — aucun chiffre de WER ou de latence publié en texte, contre 4,0 % de WER en streaming et 2,6 % sur le modèle pré-enregistré, selon Artificial Analysis.

• Intervenants — revendications concernant l’attribution « qui a dit quoi » en streaming, non vérifiée vs absence de diarisation des intervenants sur l’endpoint Live (disponible sur le modèle pré-enregistré, jusqu’à trois intervenants).

• Langues — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) vs détection automatique sur 85+ langues avec bascule en cours de flux.

• Durée de session — limitée uniquement par votre GPU et votre mémoire, par opposition à un plafond strict de 10 minutes par session Live.

• Coût — 0 $ pour les poids, environ 18 Go de bf16 à héberger soi-même contre environ 0,54 $ par heure audio sur Live une fois que les jetons de sortie de texte sont comptés.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

Ce que « streaming » signifie de chaque côté

Le mot cache une réelle différence de conception, et il importe d'être précis, car les deux systèmes ne cherchent pas du tout à produire la même cadence. La configuration du préprocesseur de Microsoft concrétise le rythme de VibeVoice : l'audio arrive à 24 kHz et est compressé 3 200× en un flux de jetons à environ 7,5 trames par seconde ; la configuration prévoit ensuite un bloc de 22 trames avec une anticipation de 4 trames — soit environ 2,9 secondes d'audio par bloc, avec environ une demi-seconde d'audio futur pour consolider l'ensemble. Le modèle émet le texte une fois par bloc résolu, et le contexte des blocs précédents est conservé via le cache KV ; une longue session n'a donc pas à tout recalculer depuis le début. En pratique, la transcription s'allonge par incréments d'environ trois secondes.

Le endpoint Live de Google est conçu pour une boucle plus rapide et plus interactive : des flux audio montent via un WebSocket en morceaux PCM de 16 ou 24 kHz, des transcriptions partielles reviennent en continu pendant que le locuteur parle, et une transcription finale formatée arrive 0,40 seconde après la fin de la parole — ce chiffre est une mesure d'Artificial Analysis, citée par Google. Les compromis sont le plafond de session (dix minutes d'audio, après quoi votre application doit se reconnecter et recoller les morceaux), et les fonctionnalités manquantes : pas de diarisation des locuteurs ni d'horodatage au niveau du mot sur le chemin Live, deux fonctions qui existent sur la Transcribe Gemini 3.5 pré-enregistrée. En résumé, le modèle de streaming de Google est plus rapide par énoncé, tandis que le point de contrôle de streaming de Microsoft est plus lent par morceau mais revendique l'attribution des locuteurs que la voie Live de Google abandonne, pour une durée de session que Google ne propose pas.

Précision : mesurée, par rapport à un espace vide

Le plus grand écart dans cette confrontation est un écart dans les preuves, pas nécessairement dans la qualité. Artificial Analysis a mesuré Gemini 3.5 Transcribe Live à un taux d’erreur moyen de 4,0 % en streaming et de 2,6 % sur le modèle non-streaming, ce dernier se classant cinquième sur son classement WER au lancement ; Google cite séparément 5,50 % en streaming et 5,04 % en non-streaming sur l’ensemble multilingue FLEURS. Il faut lire ces chiffres selon leur étiquette : Artificial Analysis est indépendant de Google, mais les chiffres d’une API vieille d’un jour restent préliminaires, et le supplément d’erreur du streaming par rapport au modèle par lots — 4,0 % contre 2,6 % — est le prix habituel de la livraison en temps réel.

VibeVoice-ASR-Streaming-7B n'a aucune mesure comparable nulle part. La fiche du modèle fournit un chiffre d'évaluation sous forme d'image, et le rapport technique de Microsoft est un PDF, mais ni l'un ni l'autre n'offre un WER de streaming en texte brut ou un nombre de latence qui puisse être cité ou vérifié indépendamment. Le seul point d'ancrage numérique de toute la famille est la fiche du modèle par lots VibeVoice-ASR, qui rapporte une moyenne de 7,77 % de WER sur huit ensembles de test anglais et 2,20 % sur LibriSpeech clean, calculée par le fournisseur — des chiffres pour le modèle non-streaming, pas celui-ci, et les modèles de streaming sacrifient généralement un peu de précision pour gagner en latence. Jusqu'à ce que quelqu'un fasse passer le point de contrôle de streaming dans un banc d'essai public, la déclaration honnête est qu'un côté de cette comparaison est mesuré et l'autre ne l'est pas.

Coût : une API facturée à l’usage par rapport à un GPU déjà budgété.

Google facture Gemini 3.5 Transcribe Live au token et comptabilise l'audio à 25 tokens par seconde. Aux tarifs Live publiés — 3,50 $ pour 1 M de tokens audio et 21 $ pour 1 M de tokens de sortie texte — une heure d'audio mixte revient à environ 0,54 $, soit environ 9 $ pour 1 000 minutes d'audio, et le modèle pré-enregistré est encore moins cher, à environ 0,30 $ de l'heure. Le silence n'est gratuit que si votre client ne le diffuse pas en streaming : les reconnexions, l'audio dupliqué et la journalisation ajoutent tous des tokens comptabilisés à la facture réelle.

Le checkpoint de Microsoft est quant à lui facturé en heures de GPU. Les poids bf16 seuls représentent environ 18 Go avant tout cache KV, les chemins documentés sont les démos Python du dépôt microsoft/VibeVoice et un plugin vLLM qui dessert des endpoints compatibles WebSocket et OpenAI, et il n'existe pas de tarif hébergé car aucun fournisseur n'héberge encore le modèle — il n'est pas sur Azure AI Foundry contrairement au VibeVoice-ASR par lots, qui y est depuis mars. L'auto-hébergement d'un speech-LLM de classe 7B implique de budgéter un GPU de classe 24 Go ainsi que votre propre temps d'exploitation ; en échange, vous obtenez une durée de session illimitée et des poids qui vous restent acquis. Les deux modèles ne sont pas mutuellement exclusifs, ce qui est le propos de la dernière section.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Garder le choix abordable

Ce que vous choisissez dépend de si vous avez besoin d'un numéro ou d'un code. Choisissez Gemini 3.5 Transcribe Live lorsque vous voulez une transcription qui fonctionne dès aujourd'hui avec une précision publiée et sans GPU à exécuter — et lorsque votre audio ne se limite pas à dix langues, ou que vous êtes prêt à construire vous-même l'étiquetage des locuteurs, car l'endpoint Live ne le fournit pas. Choisissez VibeVoice-ASR-Streaming-7B lorsque vous auto-hébergez, lorsque la durée de session illimitée ou la sortie de streaming avec attribution des locuteurs revendiquée est importante, et lorsque vous êtes prêt à mettre en place votre propre porte d'évaluation, car il n'existe aucun benchmark sur lequel vous appuyer.

Aucun des deux choix n'a besoin d'être permanent, et c'est là qu'une couche de routage justifie sa place — pour les modèles qui gravitent autour de la transcription, pas pour la transcription elle-même. OrcaRouter ne route pas la reconnaissance vocale à ce jour, et aucun des modèles de cette page ne figure dans son catalogue ; ce qu'il fait, c'est offrir une API unique aux 200+ modèles de langage qui consomment une transcription en direct — le résumeur, l'extracteur de points d'action, le planificateur de l'agent vocal — aux prix catalogue des fournisseurs, répercutés sans marge, avec bascule automatique entre fournisseurs. Une baisse de prix d'un fournisseur sur n'importe quel modèle de cette pile est effective le jour même, car les prix catalogue sont répercutés sans majoration. L'étape de transcription reste là où vous l'avez placée ; la pile qui agit sur la transcription est exactement la couche où une clé unique et une route de secours transforment un checkpoint d'une semaine, non benchmarké, d'un pari en une option testable.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube