Un grand carton-titre comparant « VibeVoice-ASR-Streaming-7B vs GPT-Transcribe », avec un surtitre « Transcription vocale - sept. 2026 » ; un sous-titre évoquant la rencontre entre un point de contrôle de session en direct et le point de terminaison de fichiers audité d'OpenAI — deux moments différents de la vie de l'audio ; des pastilles « Poids MIT - 2 sept. », « API OpenAI - 28 juil. » et « GPT : 3,31 % AA-WER » ; et une note de bas de page « Les preuves sont à sens unique ». Le logo OrcaRouter est incrusté en bas à droite.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs GPT-Transcribe : Un point de contrôle en session en direct face à l'endpoint fichier d'OpenAI

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Les deux modèles de cette page ne sont pas des rivaux comme leurs noms le suggèrent — ils sont conçus pour des moments différents de la vie d'un enregistrement audio, et la comparaison honnête porte sur le moment dans lequel votre produit se situe. GPT Transcribe est le point de terminaison de transcription asynchrone d'OpenAI : vous téléversez un fichier terminé, il le traite environ 34× plus vite que le temps réel, puis il renvoie une transcription, au prix de 0,0045 $ par minute d'audio, avec un taux d'erreur de mots de 3,31 % mesuré indépendamment sur le benchmark AA-WER d'Artificial Analysis. VibeVoice-ASR-Streaming-7B est la forme opposée : le checkpoint de streaming de Microsoft Research, téléversé discrètement sur Hugging Face le 2 septembre 2026 sous licence MIT, est conçu pour transcrire l'audio pendant qu'il arrive encore — une session WebSocket qui émet du texte par segments au fur et à mesure que l'enregistrement s'allonge. Les comparer uniquement sur la précision n'aurait aucun sens, car un côté dispose d'un chiffre audité tandis que l'autre n'a publié aucun chiffre par écrit.

Tout ce qui suit est étiqueté en conséquence. Les chiffres de GPT Transcribe correspondent au prix publié par OpenAI et à la mesure indépendante d'Artificial Analysis, tous deux dans le domaine public depuis le lancement du modèle le 28 juillet 2026. Côté VibeVoice-ASR-Streaming-7B, ce qui est connaissable provient du référentiel — la configuration du point de contrôle, la fiche du modèle et la documentation de streaming de Microsoft — car aucun tiers ne l'a évalué et Microsoft n'a pas publié de taux d'erreur de mots en streaming dans un texte lisible.

Deux moments différents dans la vie de l'audio

GPT Transcribe est conçu pour des enregistrements qui ont déjà eu lieu. L'endpoint d'OpenAI accepte des fichiers audio jusqu'à 25 Mo dans les formats habituels — mp3, mp4, mpeg, mpga, m4a, wav, webm — et renvoie la transcription complète après traitement, à environ 34 fois le temps réel, de sorte qu'un enregistrement d'une heure aboutit en quelques minutes. C'est le canal batch, et OpenAI le tarife en conséquence : 0,0045 $ par minute audio, soit environ 0,27 $ par heure audio. Si votre besoin est réellement en direct, OpenAI vend un modèle distinct pour cela — GPT Live Transcribe à 0,017 $ par minute, près de quatre fois le prix du batch — ce qui est, côté OpenAI, ce qui se rapproche le plus de ce que fait VibeVoice-ASR-Streaming-7B.

VibeVoice-ASR-Streaming-7B abolit cette distinction dans l’autre sens : c’est un checkpoint de streaming qui gère également des fichiers entiers. Sa configuration de préprocesseur illustre le contrat temps réel — audio en entrée à 24 kHz, compressé 3 200 fois en un flux de jetons à 7,5 Hz, puis traité par blocs de 22 trames avec une anticipation de 4 trames, soit environ 2,9 secondes d’audio par bloc avec à peu près une demi-seconde de contexte futur, le texte étant émis à mesure que chaque bloc est résolu. Le contexte de session est transmis via le cache KV, si bien qu’une longue session ne recalcule pas tout depuis zéro. Le chemin de service documenté (un plugin vLLM) expose un endpoint de flux WebSocket pour les sessions en direct et un endpoint de transcription de fichiers entiers — les mêmes poids servent donc les deux formes — mais la raison d’être du modèle est le direct, et il n’y a pas de compteur à la minute car il n’y a pas d’API hébergée. Vous fournissez le GPU.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

Le registre des preuves est unilatéral.

GPT Transcribe est l'une des API de transcription les plus rigoureusement évaluées en production. Artificial Analysis lui mesure un taux d'erreur de mots de 3,31 % sur AA-WER — neuvième parmi une cinquantaine de systèmes suivis — avec un point faible connu dissimulé dans les sous-scores : sur le jeu de données Earnings22, volontairement difficile sur le plan acoustique, il chute à 6,10 %. Ces chiffres, audités et reproductibles, proviennent d'un classement neutre et s'accompagnent de limites qui sont elles-mêmes documentées. Le modèle a été lancé 25 % moins cher que son prédécesseur GPT-4o Transcribe, avec environ 0,7 point de mieux sur le même benchmark.

VibeVoice-ASR-Streaming-7B ne présente aucun chiffre comparable où que ce soit. Sa fiche de modèle contient un résultat d’évaluation sous forme d’image, et le rapport technique de Microsoft est un PDF ; on n’y trouve cependant aucun WER de streaming ni aucune valeur de latence sous forme de texte, et rien n’est vérifiable indépendamment. La seule donnée chiffrée de la famille VibeVoice est le tableau déclaré par le fournisseur dans la fiche du modèle VibeVoice-ASR batch — un WER moyen de 7,77 % sur huit jeux de test en anglais et de 2,20 % sur LibriSpeech clean — qui décrit le modèle non-streaming et ne doit pas être interprété comme la précision de ce checkpoint. Si votre décision d’achat exige un chiffre que vous puissiez défendre devant un collègue, un seul côté de cette comparaison en possède un.

Ce que chacun renvoie au-delà de la simple transcription.

Les deux modèles ne font pas le même pari sur le contexte, et c'est là que la comparaison des fonctionnalités devient intéressante. GPT Transcribe mise sur les indications contextuelles : vous pouvez fournir une description libre de l'enregistrement, une liste de mots-clés et de noms propres, ainsi qu'une liste de langues attendues, et OpenAI indique que sur son benchmark Context-Aware ASR, la précision sémantique est passée de 41,6 % sans contexte à 45,2 % avec. Il renvoie également la langue détectée. Ce qu'il ne fait pas, en revanche, c'est la diarisation des locuteurs ni l'horodatage au niveau du mot — OpenAI renvoie vers des modèles distincts pour cela — si bien qu'une transcription de réunion ressort comme un bloc de texte unique et indifférencié, à moins de construire soi-même la couche des locuteurs.

VibeVoice-ASR-Streaming-7B fait le pari inverse. Sa fiche modèle revendique une sortie en streaming avec attribution des locuteurs — qui a dit quoi, émise à mesure que le segment est résolu — ainsi que des mots-clés personnalisés via un prompt contextuel (l'option CLI est --context_info). C'est la fonctionnalité que GPT Transcribe exclut explicitement, et c'est pourquoi les deux modèles ne sont pas interchangeables pour l'audio en direct multi-locuteurs. Le contrepoids est la vérification : les fonctionnalités manquantes de GPT Transcribe relèvent d'une décision produit documentée, tandis que l'attribution des locuteurs revendiquée par VibeVoice est une déclaration sur sa fiche modèle qu'aucun test indépendant n'a confirmée. Les deux approches diffèrent aussi sur les horodatages — ni l'une ni l'autre n'offre d'horodatage au niveau du mot sur le chemin faisant l'objet de la comparaison, bien que le modèle batch de la famille VibeVoice en propose.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): job shape - streaming session, live audio; throughput - emits per ~2.9 s chunk; WER published - none in text; speaker output - claimed who-said-what, unverified; context controls - hotwords via --context_info; cost - /bin/bash weights, ~18 GB bf16. Right column GPT-Transcribe (released Jul 28, 2026 - hosted API): async file endpoint, files up to 25 MB; ~34x faster than real time; 3.31% AA-WER (6.10% Earnings22); no speaker output; prompt + keywords + language hints; /bin/bash.27 per audio-hour hosted. Footer: 'GPT-Transcribe price per OpenAI; WER per Artificial Analysis. VibeVoice specs read from the HF repo.'

Les formes de prix et la question de la propriété

Les structures de coûts ne pourraient guère être plus différentes, et aucune n'est strictement supérieure à l'autre. GPT Transcribe est une API facturée à l'usage : 0,27 $ par heure audio, aucune infrastructure, aucun GPU, 25 Mo par requête, et les garanties opérationnelles d'OpenAI — c'est le prix à payer pour ne pas faire tourner soi-même un modèle de reconnaissance vocale. VibeVoice-ASR-Streaming-7B est gratuit pour les poids, mais représente environ 18 Go de bf16 avant le cache KV, ce qui implique un GPU de classe 24 Go, le code de démonstration microsoft/VibeVoice ou le plugin vLLM, ainsi que votre propre surveillance et mise à l'échelle. La licence MIT est la différence qu'aucun tarif à la minute ne peut saisir : les poids vous appartiennent, vous pouvez les conserver, les affiner et les exécuter sur du matériel que vous contrôlez, sans compteur par utilisateur ni plafond de 25 Mo.

La couverture linguistique est le point sur lequel les deux camps sont plus vagues que ce que les acheteurs souhaiteraient. VibeVoice-ASR-Streaming-7B répertorie 10 langues dans sa fiche modèle — anglais, chinois, espagnol, portugais, allemand, japonais, coréen, français, russe, italien — contre les 50+ de la série VibeVoice-ASR. OpenAI ne publie pas de liste comparable de langues vérifiées pour GPT Transcribe ; il fait état de solides résultats dans 22 langues Common Voice dans ses supports de lancement, et son point faible acoustique audité sur Earnings22 rappelle que « pris en charge » et « gère l'audio bruité dans cette langue » sont des affirmations différentes. Si vos besoins en matière de couverture sont larges, aucune des deux listes ne tranche la question — testez vos dialectes réels.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

L'essentiel : choisissez par voie, pas par score.

Choisissez GPT Transcribe lorsque l'audio est un fichier finalisé, lorsque vous voulez un chiffre de précision documenté avec des limites connues, ou lorsque ne pas faire tourner votre propre infrastructure de reconnaissance vocale vaut 0,27 $ de l'heure — et associez-le à GPT Live Transcribe uniquement si la livraison en temps réel justifie le prix près de 4 fois plus élevé. Choisissez VibeVoice-ASR-Streaming-7B lorsque la tâche est en direct et multi-locuteur, lorsque vous voulez que la transcription arrive pendant que la conversation est encore en cours, lorsque la sortie en streaming avec attribution des locuteurs est une fonctionnalité que vous souhaitez évaluer, ou lorsque les poids ouverts et le contrôle des données comptent plus qu'un benchmark mesuré.

Une note structurelle pour les équipes qui construisent sur l'un ou l'autre : la couche de transcription n'est pas quelque chose qu'OrcaRouter route aujourd'hui — aucun des modèles de reconnaissance vocale de cette page n'est dans son catalogue, le choix de l'ASR reste donc entièrement le vôtre. Ce que le routage vous apporte, c'est la couche au-dessus de la transcription. Un flux de transcription en direct n'est utile que lorsque quelque chose agit dessus — le module de résumé, la règle d'alerte, le planificateur de l'agent vocal — et c'est cette pile qu'OrcaRouter couvre avec une seule API sur plus de 200 modèles, aux prix catalogue des fournisseurs répercutés sans marge, avec en plus un basculement automatique. Le schéma qui rend un checkpoint non éprouvé comme VibeVoice-ASR-Streaming-7B abordable à essayer est précisément celui-ci : garder interchangeable l'endpoint qui consomme vos transcriptions, et un modèle sans benchmark encore peut gagner ou perdre votre trafic sur la base de vos propres données audio plutôt que sur une promesse du jour du lancement.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube