
Granite Speech 5.0 470M TurboCTC : l'ASR Apache-2.0 d'IBM revendique 12 600 RTFx
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Granite Speech 5.0 470M TurboCTC est le modèle de la nouvelle offre vocale d'IBM que vous êtes effectivement autorisé à expédier, et c'est la première chose à savoir à son sujet. IBM a publié deux points de contrôle de reconnaissance vocale anglaise sur Hugging Face le 25 août 2026 : Granite Speech 5.0 470M TurboCTC sous Apache 2.0 et Granite Speech 5.0 470M TurboCTC-NC sous licence non commerciale CC-BY-NC-SA-4.0. Même architecture de 470 millions de paramètres, données différentes, licences opposées. Le modèle Apache est celui qu'IBM destine aux « autres cas d'utilisation » — ce qui, dans le jargon des fournisseurs, signifie production commerciale — et c'est aussi celui qui affiche le chiffre emblématique : IBM rapporte un débit agrégé de plus de 12 600 RTFx sur un seul NVIDIA H200, soit, selon ses calculs, plus de trois heures et demie d'audio anglais transcrit par seconde avec inférence par lots.
Ce chiffre de vitesse est une affirmation du fournisseur vieille d'un jour, qu'aucun tiers n'a reproduite — à prendre donc comme un chiffre solide sur le papier plutôt que comme un fait vérifié. La raison pour laquelle il mérite quand même votre attention, c'est la conception qui se cache derrière : Granite Speech 5.0 TurboCTC abandonne le décodeur à modèle de langage utilisé par tous les modèles Granite Speech précédents, ne laissant qu'un encodeur Conformer pur, entraîné à l'aide de la classification temporelle connexionniste (CTC) et décodé de manière non autorégressive. L'absence de boucle de génération token par token est ce qui permet à un modèle de 470 millions de paramètres de revendiquer un débit supérieur à celui de modèles plusieurs fois plus gros — et c'est pourquoi cette version compte pour quiconque développe des systèmes de reconnaissance vocale, et pas seulement pour le tableau des benchmarks.
Ce qui a réellement été livré
Deux points de contrôle, tous deux publiés le 25 août 2026 sur l'organisation ibm-granite Hugging Face, tous deux ASR anglais uniquement avec la même architecture à encodeur seul :
• Granite Speech 5.0 470M TurboCTC — Apache 2.0, utilisation commerciale autorisée, entraîné sur environ 60 000 heures d'audio en anglais.
• Granite Speech 5.0 470M TurboCTC-NC — CC-BY-NC-SA-4.0, usage uniquement pour la recherche et à des fins non commerciales, entraîné sur environ 75 000 heures d'audio en anglais.
Cet article concerne le modèle Apache — celui sur lequel un produit peut légalement s'appuyer — avec le jumeau -NC mentionné là où l'histoire des licences l'exige. Les deux points de contrôle sont fournis en safetensors en F32 et BF16, et tous deux disposent d'un support natif dans Hugging Face Transformers via AutoModelForCTC et AutoProcessor. La fonctionnalité arrive dans la prochaine version de Transformers ; d'ici là, vous installez Transformers depuis les sources, chargez le processeur et le modèle, et exécutez un décodage glouton. IBM propose également une démo de streaming WebGPU basée sur navigateur, qui est le moyen le plus rapide d'entendre à quel point la latence est réellement faible.
Le pari architectural : un encodeur, pas de décodeur, 12,5 tokens par seconde
Le changement de conception est l'histoire derrière l'affirmation de rapidité. Les premières versions de Granite Speech associaient un encodeur acoustique à un projecteur et à un décodeur de modèle de langage, et c'est ce décodeur qui a été abandonné. Granite Speech 5.0 470M TurboCTC est un encodeur Conformer à 16 couches entraîné avec CTC, et l'inférence est un passage glouton non autorégressif unique. Il n'y a rien à échantillonner, donc il n'y a pas de latence de génération à attendre.
Trois détails de configuration le rendent rapide plutôt que simplement petit :
• Sous-échantillonnage temporel par un facteur de 8. Le front-end tourne à 100 images par seconde ; le modèle produit 12,5 jetons par seconde. L'empilement et le saut de trames log-mel, puis des convolutions stridées et des résidus poolés dans les deux premiers blocs Conformer, réduisent le débit de sortie en trois étapes de 2x.
• Un vocabulaire de sous-mots au lieu de caractères. Les encodeurs Granite Speech précédents émettaient 50 caractères par seconde ; 5.0 émet 12,5 tokens de sous-mots par seconde à partir d’un vocabulaire BPE de 16 384 unités (SentencePiece dans la variante -NC). Moins d’unités de sortie par seconde d’audio signifie que le décodeur CTC a moins de décisions à prendre.
CTC auto-conditionné. La couche Conformer intermédiaire affine les représentations intermédiaires du modèle lui-même, ce qui est l'astuce qui permet à un petit encodeur de maintenir sa précision lorsque le décodeur est absent.
Tout cela figure dans la fiche du modèle et dans le document technique d'IBM. Ce à quoi cela revient, c'est un checkpoint conçu pour les ordinateurs portables, les téléphones et les pipelines de streaming, là où un décodeur autorégressif lourd ne trouverait pas sa place — le positionnement edge est explicite dans la propre description d'IBM.
Les chiffres qu'IBM avance
Tout ce qui figure dans cette section est rapporté par IBM, passé dans le harnais public du classement Open ASR sur l'infrastructure Hugging Face en date du 25 août 2026, et non reproduit de manière indépendante. Considérez-les comme des chiffres de fournisseur qui semblent crédibles, et non comme une vérité établie :
• Débit — plus de 12 600 RTFx sur un seul NVIDIA H200 avec inférence par lots, ce qu'IBM traduit par plus de 3,5 heures d'audio par seconde. IBM ajoute que cela représente plus de 20 fois le débit des modèles Granite Speech précédents. Il s'agit d'une mesure d'inférence par lots sur GPU de centre de données, et non de ce qu'un ordinateur portable vous donnera.
• Précision — un taux d'erreur de mots agrégé de 5,00 % pour le modèle Apache sur les ensembles de test publics anglais en format court du leaderboard Open ASR (la variante -NC obtient 4,85 % sur les mêmes ensembles). L'inférence a été exécutée via l'infrastructure de jobs de Hugging Face et évaluée avec les outils du leaderboard ; IBM s'attend donc à ce que ces résultats correspondent au tableau officiel une fois que les nouveaux modèles y seront intégrés.
• Champ lointain — sur le classement FFASR pour environnements bruités et réverbérants, le modèle Apache se classe neuvième en précision et le modèle -NC cinquième ; les deux sont les entrées les plus rapides de ce classement (débit mesuré sur un seul NVIDIA L4).
• Entraînement — environ 60 000 heures d'audio public en anglais pour le modèle Apache, réalisé en dix jours sur huit GPU NVIDIA H100 dans le cluster Blue Vela d'IBM.

Ce que Apache 2.0 vous apporte réellement
Cette version est inhabituelle par sa licence. Les modèles vocaux à poids ouverts ont tendance à sortir sous des licences de recherche ou avec des obligations qui font grincer des dents le service juridique d'une équipe de production ; ici, le jumeau commercialement utilisable est celui pour lequel IBM a obtenu un score légèrement inférieur en précision. Vous échangez 0,15 point de WER agrégé (5,00 % contre 4,85 %) contre le droit de déployer le modèle dans un produit, de monétiser les sorties, de l'affiner et de conserver vos poids dérivés pour vous, et de l'utiliser dans une infrastructure cloud sans qu'une clause de recherche exclusive ne fasse obstacle.
Ce compromis est facile à faire dans la mauvaise direction si vous courez après le classement. Les 4,85 % du modèle -NC proviennent d'environ 15 000 heures de données d'entraînement supplémentaires (GigaSpeech et SPGI Speech), et c'est la version qu'IBM qualifie littéralement de « destinée à la recherche et à des fins non commerciales uniquement ». C'est un excellent modèle de référence et une mauvaise dépendance produit. Le modèle Apache perd un peu de précision et gagne la capacité de servir de base à un pipeline de transcription commercial, à un système d'assurance qualité pour centre d'appels ou à un appareil de périphérie. Si vous évaluez cette famille, la décision de licence vient avant la décision de référence.

Ce à quoi vous renoncez
Abandonner le modèle de langage n'est pas sans coût, et la carte du modèle est honnête quant aux coupes :
• Pas de traduction de la parole. Les générations précédentes de Granite Speech pouvaient passer par un modèle de langage pour traduire tout en transcrivant ; la version 5.0 ne fait que transcrire.
• Aucun biais de mots-clés. Le LM gérait également le biais vers les termes et noms du domaine ; sans lui, vous obtenez ce que le vocabulaire de sous-mots produit naturellement.
• Anglais uniquement. Aucun point de contrôle multilingue n'est inclus dans cette version, et rien n'indique qu'une telle fonctionnalité soit prévue prochainement.
Le WER de 5,00 % est un chiffre pour les audios courts et propres. Le résultat FFASR (neuvième, sur de la parole bruitée en champ lointain) est l'indicateur le plus réaliste pour une utilisation en salle de réunion et en mains libres, et il s'agit d'un classement, pas d'un chiffre principal.
Pour une tâche de transcription ciblée — appels audio, réunions, mémos vocaux, sous-titres, dictée — aucun de ces éléments n'est un obstacle. Ils comptent si vous espériez qu'un petit modèle puisse également traduire, ou transcrire de manière fiable un vocabulaire personnalisé prêt à l'emploi.
Comment l'exécuter aujourd'hui
Vous n'avez pas besoin d'une API cloud qui n'existe pas encore. Le modèle s'exécute localement :
• Installez Transformers depuis les sources (le jeu de fonctionnalités CTC n'est pas encore dans la dernière version), puis AutoModelForCTC plus AutoProcessor et le décodage glouton — le pipeline standard. Le processeur peut calculer les caractéristiques log-mel sur le périphérique du modèle, ce qui évite une copie hôte vers périphérique.
L'exemple de la fiche modèle est un code en deux lignes via le pipeline : automatic-speech-recognition avec le modèle « ibm-granite/granite-speech-5.0-470m-turboctc ».
• Une démo de streaming WebGPU s'exécute dans un onglet de navigateur et constitue le moyen le plus rapide d'évaluer la latence avant de consacrer un après-midi à un harnais de benchmark.
• Pour la production, la question pratique est le serving. Les modèles ASR ouverts de cette classe sont généralement exécutés sur CPU ou sur un petit GPU avec quelque chose comme une inférence en streaming par lots — le chiffre de 12 600 RTFx est un nombre de lots pour H200 ; un nombre réaliste pour un ordinateur portable en flux unique sera bien inférieur, et IBM n'a pas publié de chiffres sur le temps jusqu'au premier jeton.
Cette couche de service est là où se trouvent le coût et la complexité réels de l'ASR open source, et c'est aussi là qu'une plateforme de routage prouve sa valeur. Le modèle d'OrcaRouter est une API unique couvrant plus de 200 modèles, avec le prix de liste du fournisseur répercuté sans marge (0 %) — donc quand un fournisseur baisse un prix, la baisse est effective le jour même — plus un basculement automatique entre fournisseurs et un DSL de routage pour composer plusieurs modèles en un seul appel. Rien de tout cela ne s'applique spécifiquement à Granite Speech 5.0 470M TurboCTC, car aucune des deux variantes n'est encore sur OrcaRouter : les poids datent d'un jour et aucun fournisseur commercial ne les sert. Quand un modèle de reconnaissance vocale ouvert comme celui-ci obtient une voie hébergée — ou quand on le compare aux API ASR hébergées déjà disponibles — une couche de routage permet de l'essayer et de revenir en arrière sans réécrire l'intégration, et la tarification en transparence est ce qui rend la comparaison honnête.
Qu'est-ce qui reste non confirmé ?
Un modèle âgé d’un jour a un historique documentaire limité, et il vaut la peine d’énumérer exactement ce qui n’est pas encore connu :
• Aucun benchmark tiers. Les 12 600 RTFx, le WER de 5,00 % et les classements FFASR proviennent tous des exécutions propres d'IBM via le harnais du classement public. Aucun indépendant n'a publié de chiffres.
• Pas d'API hébergée par IBM. Il n'y a pas de page de modèle watsonx, ni de point de terminaison géré, ni de tarification, ni de date de disponibilité.
• Aucune mesure de latence de streaming. La prise en charge du streaming et une démo WebGPU existent ; en revanche, les chiffres du délai avant le premier jeton et de la latence des segments ne sont pas disponibles.
• Aucune comparaison dans le même cadre (same-harness) avec les autres modèles ASR rapides open source. Les confrontations qui comptent — contre Whisper large-v3, NVIDIA Parakeet TDT 0.6B et les API de transcription hébergées — n'ont encore été réalisées sur des données identiques par personne.
Que regarder ensuite
Les signaux à court terme sont les reproductions indépendantes. Le classement Open ASR est public, le banc de test est standard et les poids sont sur Hugging Face, donc une exécution par un tiers devrait arriver sous quelques jours — surveillez si le 5,00 % se maintient et si les 12 600 RTFx survivent sur un seul H200 en dehors de la configuration batch d'IBM. L'autre point à surveiller est de savoir si IBM transforme le jumeau Apache en service géré, car un point de terminaison watsonx ferait instantanément de ce modèle l'ASR ouvert ayant la voie commerciale la plus crédible. Granite Speech 5.0 470M TurboCTC est, dès le premier jour, un ASR anglais véritablement rapide, véritablement permissif, avec une piste de vérification véritablement mince. Les deux premiers sont réels ; le troisième n'est qu'une question de temps.

