Une carte-titre hero générée pour « VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC : les deux paris discrets du streaming open-weights », sous-titrée « Deux modèles ASR de streaming open-weights, à huit jours d’intervalle », avec deux fiches de modèles — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 septembre 2026 · MIT · ~3B au total · LLM vocal) et Granite Speech 5.0 470M TurboCTC (IBM · 25 août 2026 · Apache-2.0 · 470M · encodeur CTC pur) — et des tags indiquant « Vitesse de classe edge (IBM) », « Anglais uniquement (IBM) » et « Qui a dit quoi en 10 langues (Microsoft, non vérifié) ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC : les deux paris discrets du streaming à poids ouverts.

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Les deux sorties les plus intéressantes de modèles de reconnaissance vocale en streaming à poids ouverts de fin août 2026 ont toutes deux été publiées sans événement de lancement. Le 25 août, IBM a mis Granite Speech 5.0 470M TurboCTC sur Hugging Face — poids, fiche modèle et article de blog, rien de plus — et le 2 septembre, Microsoft Research a téléversé VibeVoice-ASR-Streaming-1.5B sous l'espace de noms microsoft, sans aucune annonce au-delà d'une ligne dans le dépôt GitHub de VibeVoice. Ce sont deux modèles de même nature, mais deux paris techniques opposés : celui d'IBM est un encodeur purement CTC de 470 millions de paramètres, conçu pour fonctionner à des vitesses de périphérie sur un ordinateur portable, tandis que celui de Microsoft est un modèle de langage vocal de classe 1,5 milliard, enveloppé dans des tokeniseurs audio et une tête de diffusion — environ trois milliards de paramètres au total — conçu pour comprendre la parole comme un langage tout en la transcrivant.

Avant les chiffres, les mentions de provenance qui rendent cette comparaison honnête. Tout ce qui est marqué « rapporté par IBM » provient de la fiche du modèle Granite Speech 5.0 470M TurboCTC et de ses entrées au classement Open ASR, exécutées par IBM sur le banc d'essai officiel le jour de la sortie et pas encore reproduites de manière indépendante. Tout ce qui concerne VibeVoice-ASR-Streaming-1.5B provient de la lecture du dépôt — fichiers de configuration, fiche du modèle et documentation de streaming de Microsoft — car Microsoft n'a publié aucun chiffre de précision ni de latence par écrit et personne en dehors de Microsoft n'a évalué le checkpoint. Les deux modèles n'ont pas été exécutés sur un banc d'essai commun ; cette comparaison mesure chacun à l'aune des mêmes preuves publiques, qui constituent tout ce que l'une ou l'autre entreprise a offert jusqu'à présent.

Deux versions discrètes, à huit jours d'intervalle

Les deux modèles sont arrivés de la même manière, sans cérémonie, ce qui mérite d'être dit sans détour, car aucune des deux entreprises ne s'est beaucoup exprimée depuis. Le Granite Speech 5.0 470M TurboCTC d'IBM est le membre sous licence Apache-2.0 d'un lancement à deux variantes — IBM a également publié une version sœur -NC non commerciale, aux chiffres phares légèrement supérieurs — et sa fiche porte une date de sortie au 25 août 2026, avec un support natif de Transformers et une soumission au classement Open ASR datée du même jour. La paire de streaming de Microsoft, VibeVoice-ASR-Streaming-7B et VibeVoice-ASR-Streaming-1.5B, a été créée sur Hugging Face à la même minute, le 2 septembre ; le fil d'actualité GitHub annonçant « un modèle ASR de streaming unifié qui transcrit en continu qui a dit quoi au fur et à mesure que la parole arrive » est daté du 3 septembre et cite le 7B, laissant le 1.5B — couvert ici — dans le rôle de la version sœur plus petite, lancée discrètement à ses côtés.

Ce qui est intéressant, c'est que deux équipes ont choisi le mot « streaming » et ont construit des choses opposées. Granite Speech 5.0 470M TurboCTC est un encodeur conformer entraîné avec CTC et décodé en une seule passe non autorégressive — il n'y a pas de décodeur générant le texte jeton par jeton, le modèle est donc structurellement économique et structurellement rapide. VibeVoice-ASR-Streaming-1.5B est un LLM vocal : deux tokeniseurs convolutifs transforment l'audio 24 kHz en un flux de jetons de parole d'environ 7,5 Hz, un décodeur de la famille Qwen2 (28 couches, 1 536 unités cachées — la classe 1,5B) le lit, et une tête de diffusion produit la transcription par segments d'environ 2,9 secondes avec environ une demi-seconde d'avance. L'un est une voiture de course ; l'autre est un petit modèle de langage qui, par hasard, écoute.

La vérification des spécifications.

• Paramètres — Granite Speech 5.0 470M TurboCTC : 470M, encodeur seul, contre VibeVoice-ASR-Streaming-1.5B : ~3B au total (backbone LM de classe 1.5B plus tokenizers et tête de diffusion).

• Architecture — encodeur conformer avec auto-attention par blocs et auto-conditionnement, entraîné par CTC, décodage glouton non autorégressif, par rapport à deux tokeniseurs acoustique/sémantique alimentant un décodeur causal de la famille Qwen2 avec une tête de diffusion DDPM.

• Cadence de sortie — ~12,5 images de sortie par seconde, streaming par segments contre ~7,5 Hz de jetons de parole, émettant du texte par segment d’environ 2,9 s avec ~0,5 s d’anticipation.

• Langues — anglais uniquement vs dix : chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol.

• Poids — environ 0,5 milliard de paramètres / une fraction de Go, classe edge, vs ~5,6 Go bf16, classe GPU NVIDIA.

• Précision à l’impression — moyenne d’environ 5,00 % de WER rapportée par IBM sur les ensembles Open ASR à forme courte, contre aucun chiffre de WER publié dans le texte.

• Licence — Apache-2.0 vs MIT.

• Sortie — 25 août 2026 vs 2 septembre 2026.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Vitesse : l'un est conçu pour être petit, l'autre pour être un modèle de langage.

Le fossé architectural se manifeste d'abord en termes de vitesse et de matériel. {{1}}Granite Speech 5.0 470M TurboCTC cible les ordinateurs portables, les smartphones et autres appareils de périphérie. {{2}}Parce qu'un encodeur CTC pur n'échantillonne rien — la sortie est un simple passage glouton sur une tête BPE de 16 384 unités — il est extrêmement peu coûteux à exécuter, et la fiche technique d'IBM rapporte un chiffre de débit Open ASR mesuré sur un seul H200, de l'ordre de dizaines de milliers de RTFx pour la gamme TurboCTC, ainsi qu'une démo WebGPU qui transcrit en direct dans un onglet de navigateur. {{/2}}Ces chiffres sont mesurés par IBM et non reproduits, mais le point structurel se suffit à lui-même : un encodeur de 470M sans décodeur autorégressif est un modèle que l'on peut exécuter sur le matériel dont est équipé un téléphone. {{/1}}

VibeVoice-ASR-Streaming-1.5B fait le compromis inverse. Son décodeur est un modèle de langage causal, ce qui signifie que le texte est généré dans une boucle plus lourde qu'un argmax CTC, et les manières documentées de l'exécuter consistent en un auto-hébergement sur GPU NVIDIA — les démos Python du dépôt microsoft/VibeVoice ou son plugin vLLM — avec environ 5,6 Go de poids bf16 avant tout cache KV. Microsoft n'a publié aucune mesure de débit ni de facteur temps réel, il n'y a donc aucun chiffre de fournisseur à opposer à celui d'IBM. Ce que l'architecture LLM apporte à la place, c'est du contexte : le modèle porte la compréhension du locuteur et du contenu à travers la transcription comme le fait un modèle de langage, ce qui fait la différence entre transcrire un son et suivre une conversation.

Précision : un fournisseur a imprimé des chiffres, l'autre a imprimé une image.

Sur la base des preuves, Granite Speech 5.0 470M TurboCTC devance VibeVoice-ASR-Streaming-1.5B avec un écart équivalant à un benchmark entièrement publiable. IBM a fait passer son modèle dans le banc d'essai officiel du leaderboard Open ASR le jour de sa sortie et rapporte un taux d'erreur moyen d'environ 5,00 % sur les jeux de données publics anglais de forme courte — un chiffre mesuré par le fournisseur, non vérifié par un tiers et totalement absent du côté de Microsoft dans cette comparaison. La fiche modèle de VibeVoice-ASR-Streaming-1.5B est accompagnée d'une figure des résultats d'évaluation sous forme d'image, mais aucun WER, RTF ou latence numérique en texte ; la seule référence chiffrée de la famille VibeVoice est la moyenne de WER de 7,77 % rapportée par le fournisseur sur la fiche du modèle batch VibeVoice-ASR, sur huit ensembles de test anglais, qui décrit le modèle non-streaming et ne s'applique donc pas au modèle streaming. Quelle que soit l'issue des évaluations indépendantes à venir, le bilan honnête aujourd'hui est qu'IBM a publié un chiffre et Microsoft a publié une image.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Langues et sortie : anglais uniquement versus qui-a-dit-quoi en dix

Granite Speech 5.0 470M TurboCTC est exclusivement anglophone et renvoie le texte transcrit brut. Ce n'est pas une lacune pour les charges de travail qu'IBM vise — la transcription de l'anglais professionnel sur du matériel de périphérie — mais cela met fin à la comparaison dès lors que votre audio n'est pas en anglais. VibeVoice-ASR-Streaming-1.5B répertorie dix langues et revendique une sortie en continu avec attribution au locuteur : la fiche du modèle indique qu'il « transcrit en continu qui a dit quoi au fur et à mesure que la parole arrive », avec des hotwords pour les termes de domaine transmis comme invite contextuelle. Ces deux atouts méritent d'être accueillis avec scepticisme — la diarisation en continu par-delà les limites de segments est réellement difficile, et l'affirmation n'est pas vérifiée — mais ce sont les raisons pour lesquelles une équipe confrontée à des réunions multilingues en direct pourrait s'intéresser au modèle de Microsoft.

Licences et écosystème : Apache-2.0 contre MIT, Transformers contre un dépôt de recherche

Les deux licences autorisent une utilisation commerciale, ce qui distingue d'emblée cette paire de la variante -NC d'IBM pour la même architecture. Granite Speech 5.0 470M TurboCTC est sous licence Apache-2.0 avec l'octroi de brevet habituel, et il est natif dans Hugging Face Transformers (AutoModelForCTC à partir de transformers >= 5.16) ainsi que mlx-audio pour Apple Silicon — ce qui signifie qu'il fonctionne partout où s'exécute la plus grande communauté de déploiement de l'écosystème, sur le matériel de n'importe quel fournisseur. VibeVoice-ASR-Streaming-1.5B est sous licence MIT, ce qui est encore plus simple, mais son chemin de service est une configuration de recherche à partir des sources : la classe d'architecture du point de contrôle, VibeVoiceForASRStreamingTraining, n'est pas dans la documentation publique de Transformers, et la documentation de streaming de Microsoft renvoie au code de démonstration du dépôt et à un plugin vLLM plutôt qu'à un chargement de bibliothèque standard. Pour une équipe de production, la différence est réelle : un modèle s'intègre dès aujourd'hui dans un pipeline Transformers existant, et l'autre vous demande de monter un dépôt de recherche et de vérifier vous-même le chemin de chargement.

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

Quelle version calme devriez-vous évaluer ?

Évaluez d’abord Granite Speech 5.0 470M TurboCTC si votre charge de travail est en anglais, votre matériel est de classe edge ou limité par le CPU, et si vous voulez un modèle qui s’intègre dans Transformers avec un numéro sur la fiche pour faire un test de cohérence. C’est le pari le moins risqué sur tous les plans sauf un : il ne vous aidera pas pour une deuxième langue ou pour une transcription de réunion en direct qui doit savoir qui parle.

Évaluez VibeVoice-ASR-Streaming-1.5B si vous avez besoin de streaming multilingue, si la sortie « qui a dit quoi » ou les hotwords sont des fonctionnalités que vous souhaitez tester, ou si vous préférez miser sur une approche par modèle de langage pour la parole plutôt que sur un encodeur pur. Prévoyez un budget pour un GPU NVIDIA, une installation depuis les sources, environ 5,6 Go de poids, et une évaluation que vous concevez vous-même, car personne — Microsoft inclus — n’a encore publié de chiffre sur lequel vous puissiez vous appuyer.

Ce que ni l'une ni l'autre de ces sorties discrètes ne change, c'est la valeur de garder la couche ASR interchangeable pendant que vous découvrez quel pari se révèle payant. Les deux modèles sont jeunes et aucun n'est encore servi via OrcaRouter à ce jour ; lorsqu'un fournisseur hébergera l'un ou l'autre, la façon la moins risquée de l'essayer est derrière une couche de routage qui donne accès à plus de 200 modèles au prix catalogue du fournisseur — marge de 0 %, donc changements de prix répercutés le jour même — avec bascule automatique vers ce à quoi vous faites déjà confiance. Acheminez une partie de votre audio réel vers le nouveau modèle, lisez les transcriptions, et laissez votre propre trafic — et non une fiche de benchmarks datée du jour de la sortie — décider quel pari discret était le bon.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube