{{1}}Une carte de titre hero générée pour « VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe : l'ASR streaming discret de Microsoft face à la nouvelle API de Google »{{/1}}, {{2}}sous-titrée « l'ASR streaming open source discret de Microsoft face à la nouvelle API hébergée de Google »{{/2}}, {{3}}avec deux cartes de modèles — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · licence MIT, 2 septembre 2026 · checkpoint ouvert · 10 langues) et Gemini 3.5 Transcribe (Google · aperçu public, 26 août 2026 · API hébergée · 2 endpoints){{/3}} — {{4}}et des tags indiquant « Aucune annonce pour l'instant », « Aucun benchmark publié » et « ~0,30–0,54 $ par heure audio (Google) »{{/4}}. {{5}}Le logo OrcaRouter est incrusté dans le coin inférieur droit.{{/5}}
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe : l'ASR streaming discret de Microsoft face à la nouvelle API de Google

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

{{1}}Sept jours et un fossé philosophique séparent les deux derniers systèmes de transcription vocale en streaming.{{/1}} {{2}}Le 26 août 2026, Google a mis Gemini 3.5 Transcribe en aperçu public : une API de transcription vocale hébergée et fermée, facturée par token audio, avec un endpoint Live séparé pour les sessions en temps réel.{{/2}} {{3}}Le 2 septembre 2026, Microsoft Research a téléversé VibeVoice-ASR-Streaming-1.5B sur Hugging Face sous le namespace microsoft — des poids sous licence MIT, pas de communiqué de presse, pas de billet de lancement et, à l'heure où nous écrivons, aucune couverture par des tiers où que ce soit.{{/3}} {{4}}Les deux transcrivent la parole au fur et à mesure qu'elle arrive.{{/4}} {{5}}Presque tout le reste à leur sujet — qui est autorisé à les exécuter, combien ils coûtent, quelles preuves existent de leur bon fonctionnement — est différent.{{/5}}

Cette page compare les deux tels qu'ils existent réellement aujourd'hui, ce qui signifie que les deux côtés de la preuve ne sont pas symétriques. Gemini 3.5 Transcribe est un produit Google opérationnel, avec des prix de tokens publiés et des chiffres de précision tiers issus d'Artificial Analysis ; ce sont les chiffres étiquetés AA ci-dessous. VibeVoice-ASR-Streaming-1.5B est un checkpoint dont la fiche de modèle ne publie aucun taux d'erreur de mots ni aucune mesure de latence en texte — l'évaluation de la fiche est une image, et la seule annonce de la famille streaming à ce jour est une note datée du 3 septembre dans le dépôt GitHub de VibeVoice de Microsoft. Tout ce qui figure ci-dessous du côté Microsoft est ce que l'on peut savoir à partir du dépôt : les fichiers de configuration, la fiche de modèle et la documentation streaming de Microsoft elle-même. Rien à son sujet n'a encore été évalué de manière indépendante.

Les deux modèles en un coup d'œil

• Ce que c'est — VibeVoice-ASR-Streaming-1.5B : checkpoint ouvert, licence MIT, auto-hébergé vs Gemini 3.5 Transcribe : API hébergée, poids fermés.

• Sortie — poids le 2 septembre 2026, actualités du dépôt le 3 septembre, par rapport à l’aperçu public du 26 août 2026 avec tous les supports de lancement.

• Mode streaming — émet le texte par segments d'environ 2,9 secondes avec ~0,5 s d'anticipation, l'état de session étant stocké dans un cache de préfixe, contre une session Live WebSocket facturée par jeton audio et plafonnée à 10 minutes d'audio par session.

• Précision dans la documentation — aucune valeur de WER ni de latence publiée dans le texte, alors que les mesures AA affichent 2,6 % de WER sur l’endpoint pré-enregistré et 4,0 % sur l’endpoint Live.

• Sortie locuteur — attribution en streaming de « qui a dit quoi » revendiquée (non vérifiée) vs absence de diarisation des locuteurs et d’horodatage au niveau du mot sur l’endpoint Live.

• Hotwords — pris en charge via la même invite de contexte que le batch VibeVoice-ASR, contrairement à l’endpoint Live, où ce n’est pas une fonctionnalité répertoriée.

• Coût — 0 $ pour les poids, ~5,6 Go à auto-héberger contre environ 0,30 $ par heure audio en moyenne sur l'endpoint pré-enregistré et ~0,54 $ sur Live, selon les prix des tokens indiqués par Google.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, License MIT open weights, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, Speaker output who-said-what claimed, Cost $0 weights / ~5.6 GB self-host. Right column Gemini 3.5 Transcribe: Released Aug 26 2026, License closed API, Streaming WebSocket Live, 10-min cap, WER 2.6% batch / 4.0% Live (AA), Speaker output none on Live, Cost ~$0.30–0.54 per audio-hour. Footer reads 'Gemini figures per Google pricing and Artificial Analysis; VibeVoice specs read from the HF repo; no VibeVoice benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Une API hébergée et un téléversement discret, à sept jours d'intervalle.

Gemini 3.5 Transcribe est le modèle de transcription de remplacement de Google, et il est proposé sous la forme de deux produits. L'endpoint pré-enregistré, servi via l'Interactions API, prend un fichier audio complet et renvoie une transcription avec les extras attendus. L'endpoint Live, gemini-3.5-transcribe-live, fonctionne via un WebSocket bidirectionnel et c'est celui qui concurrence VibeVoice-ASR-Streaming-1.5B sur la forme de la tâche : transcrire une session en direct. Google l'a annoncé avec le mécanisme habituel — un lancement en aperçu public le 26 août, des prix sur la page du modèle, des classements tiers l'intégrant en quelques jours.

La sortie en streaming de Microsoft n'avait rien de tout cela. Le 2 septembre, le compte Hugging Face de Microsoft a créé deux checkpoints dans la même minute : VibeVoice-ASR-Streaming-7B et VibeVoice-ASR-Streaming-1.5B. Le tableau des modèles du dépôt GitHub répertorie désormais VibeVoice-ASR-Streaming comme membre de la famille, et sa section Actualités porte la ligne du 3 septembre annonçant « un modèle ASR streaming unifié qui transcrit en continu qui a dit quoi au fur et à mesure que la parole arrive, avec prise en charge de mots clés personnalisés et de 10 langues » — mais cette annonce ne cite que le 7B, et le 1.5B est le petit frère livré en parallèle sans être mentionné. Lorsque nous avons vérifié un jour après le téléversement, les deux checkpoints affichaient toujours zéro téléchargement.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Ce que « streaming » signifie de chaque côté

Le mot « streaming » masque une véritable différence de conception. La configuration du préprocesseur de Microsoft rend la cadence de VibeVoice concrète : l’audio arrive à 24 kHz et est compressé 3 200 fois en un flux de jetons de parole à environ 7,5 Hz (un jeton toutes les ~133 ms). La configuration déclare ensuite un bloc de 22 trames et un regard en avant de 4 trames — environ 2,9 secondes d’audio par bloc, avec environ une demi-seconde d’audio futur servant à consolider le segment en cours. Le modèle émet du texte une fois par bloc résolu, et la documentation de Microsoft note que le contexte des blocs précédents est préservé via le cache KV, de sorte qu’une longue session ne recalcule pas tout depuis zéro. L’arithmétique figure dans la configuration ; la conséquence pratique est un transcript qui s’allonge par incréments d’environ trois secondes, et non par fragments mot à mot.

{{1}}Le point de terminaison Live de Google offre une autre forme de streaming : une session WebSocket bidirectionnelle dans laquelle l'audio est facturé à raison de 25 jetons audio par seconde, conçue pour un usage interactif, mais plafonnée à 10 minutes d'audio par session et — spécifiquement sur le point de terminaison Live — sans diarisation des locuteurs ni horodatage au niveau du mot.{{/1}} {{2}}Pour quiconque compare les deux comme moteurs de transcription en direct, les différences qui comptent sont le plafond de session (10 minutes côté Live de Google, limité uniquement par votre propre GPU et votre mémoire côté Microsoft), la cadence d'émission (tronçons d'environ 3 secondes par rapport à ce que la session WebSocket fournit), et les extras de sortie (attribution des locuteurs et mots clés revendiqués sur la carte Microsoft, absents de la liste des fonctionnalités Live de Google).{{/2}}

Précision : un côté a des chiffres, l'autre une image.

C'est l'écart le plus important de cette comparaison, et il s'agit d'un écart dans les données, pas nécessairement dans la qualité. Artificial Analysis mesure Gemini 3.5 Transcribe avec un taux d'erreur de mots de 2,6 % sur l'endpoint pré-enregistré et de 4,0 % sur l'endpoint Live — le supplément que vous payez pour la livraison en temps réel se manifeste dans le taux d'erreur, ce qui est un compromis courant et honnête pour les systèmes de streaming. Ce sont des chiffres tiers sur un classement neutre, publiés quelques jours après le lancement.

VibeVoice-ASR-Streaming-1.5B n'a aucune mesure comparable nulle part ailleurs. La fiche modèle fournit une figure d'évaluation sous forme d'image, mais aucun WER, RTF ou latence numérique en texte — rien de citable ni de vérifiable de manière indépendante. Microsoft n'a pas publié de chiffres de précision en streaming en texte, ni pour le 7B ni pour le 1.5B. Le seul ancrage numérique de toute la famille est la fiche modèle du VibeVoice-ASR par lots, qui rapporte une moyenne de WER de 7,77 % mesurée par le fournisseur sur huit ensembles de test anglais et de 2,20 % sur LibriSpeech clean — mais cela décrit le modèle non-streaming, et les modèles streaming sacrifient généralement un peu de précision pour gagner en latence. Tant que quelqu'un n'aura pas exécuté le point de contrôle streaming sur un banc d'essai public, la position honnête est que le modèle de Google est mesuré et que celui de Microsoft ne l'est pas.

Coût : par heure audio versus par heure GPU

Google vend Gemini 3.5 Transcribe au token, et la tarification se répartit clairement entre les deux endpoints. L’endpoint pré-enregistré affiche 2 $ par 1M de tokens d’entrée audio et 12 $ par 1M de tokens de sortie texte, ce qui revient à environ 0,30 $ par heure audio en coût mixte. L’endpoint Live affiche 3,50 $ par 1M de tokens audio et 21 $ par 1M de tokens texte — environ 0,54 $ par heure audio en coût mixte, soit environ 80 % de plus que le pré-enregistré, ce qui est le prix de la livraison en temps réel. Google facture l’audio à 25 tokens par seconde, donc le silence n’est gratuit que si votre client ne le diffuse pas en streaming ; les reconnexions, l’audio dupliqué et la journalisation peuvent tous s’ajouter à la facture réelle. Un niveau gratuit existe, avec l’avertissement que le contenu du niveau gratuit peut être utilisé pour améliorer les produits Google.

A generated comparison card titled 'Gemini 3.5 Transcribe — the two endpoints'. Left column 'Pre-recorded': $2 / $12 per 1M audio / text tokens, ~$0.30 per audio-hour, AA WER 2.6%, diarization and word-level timestamps. Right column 'Live': $3.50 / $21 per 1M tokens, ~$0.54 per audio-hour, AA WER 4.0%, no diarization, 10-minute session cap. Footer reads 'Token prices per Google's model page; WER per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Le modèle de Microsoft, lui, est facturé en heures GPU. Le checkpoint 1,5B représente environ 5,6 Go de poids bf16 (un backbone linguistique Qwen de classe 1,5B, plus les tokenizers audio et la tête de diffusion — les métadonnées safetensors totalisent environ 3 milliards de paramètres), et les voies documentées pour l'exécuter sont auto-hébergées : les démos Python du dépôt microsoft/VibeVoice, ou le plugin vLLM que Microsoft décrit pour servir des endpoints compatibles OpenAI et WebSocket. Il n'existe pas encore de tarif hébergé, car aucun fournisseur d'inférence ne référence encore le modèle. La question du coût revient entièrement à déterminer si votre propre temps GPU est moins cher que le tarif horaire de Google, ce qui est presque certainement le cas pour tout volume de transcription soutenu — et la question de la licence est distincte de la question du coût, car les poids sous licence MIT restent vôtres d'une manière qu'aucun abonnement API ne saurait offrir.

Les deux ne sont pas mutuellement exclusifs dans une stack de production. Le schéma pragmatique pour une équipe qui a besoin aujourd'hui de transcription en direct est de maintenir la couche ASR derrière un seul endpoint afin que le choix reste réversible : une API de routage positionnée en façade de plus de 200 modèles aux prix catalogue des fournisseurs — sans marge, de sorte qu'un changement de prix fournisseur soit répercuté le jour même — et dotée d'une bascule automatique, est exactement la couche qui permet de faire tourner l'API mesurée de Google par défaut tandis qu'une fraction du trafic réel teste VibeVoice-ASR-Streaming-1.5B dès qu'un fournisseur l'héberge. C'est le modèle d'OrcaRouter, et c'est la manière à faible risque d'adopter un checkpoint dont personne n'a encore vérifié la précision.

Qui devrait choisir quoi

Choisissez Gemini 3.5 Transcribe si vous voulez une API de transcription qui fonctionne dès aujourd'hui, avec une précision publiée, une tarification prévisible à l'heure et aucun GPU à surveiller — et surtout si votre audio ne fait pas partie des dix langues listées par Microsoft, ou si vous avez besoin de la diarisation et des horodatages au niveau du mot de l'endpoint pré-enregistré pour la transcription de fichiers. La limite de session Live de 10 minutes est une vraie contrainte à tester par rapport à votre cas d'utilisation avant de vous y engager pour les sessions en direct.

Choisissez VibeVoice-ASR-Streaming-1.5B si vous auto-hébergez, si vous voulez les poids et le contrôle des données que la licence MIT offre, si vous avez besoin d’une durée de session illimitée, ou si la sortie en streaming « qui-a-dit-quoi » et les hotwords sont des fonctionnalités que vous souhaitez précisément évaluer. Prévoyez une installation à partir des sources, environ 5,6 Go de poids sur un GPU NVIDIA, et votre propre porte d’évaluation — il n’y a pas de benchmark de référence, la question de la précision vous appartient donc d’y répondre avec votre propre audio.

Le verdict après une semaine : Google a livré le produit mesuré, et Microsoft a lancé le pari intéressant. Gemini 3.5 Transcribe est le choix par défaut le plus sûr, et celui qui s'appuie sur des chiffres issus de tiers ; VibeVoice-ASR-Streaming-1.5B est l'alternative ouverte, auto-hébergeable et entièrement non vérifiée. Ce qui rend ce choix peu coûteux, c'est qu'il n'a pas à être permanent — gardez le point de terminaison ASR interchangeable, et un checkpoint livré sans le moindre benchmark peut gagner ou perdre votre trafic sur la foi de vos propres transcriptions.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube