
Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC : 12 600× le temps réel rencontre une demi-seconde
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Granite Speech 5.0 470M TurboCTC transcrit environ 3,5 heures d’audio par seconde sur un seul H200, et Grok Voice Transcribe 2.0 renvoie un premier transcript partiel 0,49 seconde après que vous avez cessé de parler. Ces deux chiffres sont placés côte à côte dans des publications comparatives comme s’il s’agissait du même type de mesure, alors que ce n’est pas du tout le même type de mesure : l’un est un chiffre de débit par lots en centre de données, sans latence associée, l’autre est une valeur de latence pour un modèle dont personne n’a publié le débit. IBM a publié Granite Speech 5.0 470M TurboCTC le 25 août 2026 sous licence Apache 2.0, en abandonnant complètement le décodeur de modèle de langage et en décodant avec une seule passe CTC non autorégressive. SpaceXAI a lancé Grok Voice Transcribe 2.0 le 18 septembre 2026 sous la forme d’une API managée à 0,10 $ par heure d’audio pour le traitement par lots et à 0,20 $ par heure pour le streaming. Ce sont deux excellents modèles de transcription qui résolvent les deux moitiés opposées du même problème, et il est plus facile de choisir entre eux dès que l’on arrête de comparer directement les chiffres.
12 600× le temps réel, et les mots qui le qualifient
Le chiffre de Granite est de 12 600 RTFx, mesuré sur un seul NVIDIA H200 avec inférence par lots — le chiffre d’IBM, annoncé au lancement et jamais reproduit indépendamment depuis. Le RTFx est un rapport entre la durée audio et le temps de traitement, donc 12 600 signifie environ 3,5 heures d’audio par seconde de temps réel. La présentation d’IBM est qu’il s’agit de plus de 20× le débit des versions antérieures de Granite Speech, et c’est l’affirmation qui compte vraiment ici : l’accélération vient de la suppression de travail, pas de l’ajout de matériel.
Ce que ce n’est pas, c’est un chiffre de latence. Une tâche par lots qui traite 3,5 heures d’audio par seconde peut malgré tout mettre longtemps à renvoyer le premier token de n’importe quel fichier individuel, selon la façon dont le lot est assemblé et la quantité d’audio que vous lui fournissez avant qu’il ne démarre. IBM ne publie aucun chiffre de latence pour TurboCTC. Dans le classement en champ lointain, les deux checkpoints sont les deux entrées les plus rapides, mais le débit y a été mesuré sur un seul NVIDIA L4, un accélérateur proche du centre de données et non un téléphone.
La raison pour laquelle cela compte, c'est que le modèle est explicitement positionné pour les ordinateurs portables, les téléphones et les appareils en périphérie — la propre formulation d'IBM — et personne n'a publié de performances en mono-flux sur aucun de ces appareils. Tant que personne ne l'aura fait, considérez « 12 600× » comme une affirmation sur le peu qu'il en coûte pour venir à bout d'un remplissage rétroactif sur des GPU loués, affirmation réellement précieuse et bien étayée, et non comme une affirmation sur la vitesse à laquelle un utilisateur obtient une phrase en retour.
Ce qu'IBM a supprimé, et ce que cela vous coûte
TurboCTC est une conception à encodeur seul : un encodeur acoustique Conformer de 16 couches entraîné avec CTC, décodé de manière gloutonne en une seule passe non autorégressive, avec une couche de sortie de sous-mots de 16 384 unités. Aucun modèle de langue n’intervient dans la boucle. C’est de là que vient la vitesse, et c’est aussi de là que viennent les réductions de capacités, et elles ne sont pas mineures. Par rapport aux modèles Granite Speech antérieurs, TurboCTC abandonne la traduction vocale, abandonne le biais par mots-clés et ne fournit ni horodatages ni outils de ponctuation.
Mettez cela en regard de ce que le modèle géré inclut à son prix catalogue, et la configuration de l’opération devient concrète :
• Biais de termes clés — Granite Speech 5.0 470M TurboCTC n’en propose aucun, contre jusqu’à 100 termes clés par requête avec Grok Voice Transcribe 2.0.
• Horodatages au niveau des mots — non fournis avec TurboCTC vs inclus avec des scores de confiance
• Traduction vocale — présente dans les modèles Granite Speech antérieurs, supprimée ici vs non proposée dans un sens ou dans l'autre
• Couverture linguistique — anglais uniquement vs détection automatique sur un ensemble d'entrées largement multilingue avec prise en charge du formatage dans 25 langues
• Diarisation — un problème distinct que vous résolvez vous-même ou inclus dans le prix de la demande
• Canaux — un flux par passe vs jusqu’à huit canaux audio dans une seule requête
• Normalisation de texte — aucune vs normalisation inverse du texte, convertissant les dates, devises et numéros de téléphone prononcés en forme écrite
• Déploiement — des poids que vous téléchargez et exécutez, par rapport à un point de terminaison géré dans us-east-1
Interprétez cette liste comme la description de deux produits différents plutôt que comme une grille d’évaluation. C’est en retirant la diarisation, le biais et la normalisation que l’on a gagné en débit. Un remplissage rétroactif par lots de 40 000 enregistrements d’appels dans un index de recherche n’a pas besoin d’horodatages ni de tours de parole — il doit être peu coûteux et il doit se terminer — et pour cette tâche, les fonctionnalités manquantes ne manquent pas, elles sont du poids supprimé.
C’est l’inverse pour tout ce qui est en direct. Si vous développez un agent vocal, une liste de termes clés est le moyen d’obtenir l’orthographe correcte de « Kubernetes », de « Granola » et des noms de clients, et un transcripteur dépourvu de mécanisme de biais les transcrira mal à chaque fois, sans autre moyen de corriger que le fine-tuning, qui est un autre projet avec un autre budget. Cette seule fonctionnalité manquante disqualifie TurboCTC pour certaines charges de travail et est sans importance pour d’autres, c’est pourquoi la comparaison des modèles est moins utile qu’une comparaison des charges de travail.

La comparaison d'exactitude qui ne peut pas être effectuée proprement
IBM rapporte un taux d’erreur de mots agrégé de 5,00 % pour le checkpoint Apache 2.0 et de 4,85 % pour son pendant non commercial sur l’Open ASR Leaderboard, sur des ensembles publics en anglais de format court. Ce sont des chiffres en mode batch sur un classement dont les évaluations incluent AMI et Earnings22 ainsi que des ensembles conversationnels de format long, et ils sont déclarés par le fournisseur — passés par l’outillage du classement mais pas encore intégrés au tableau officiel, qui comprend aussi des ensembles de test privés. La ventilation par ensemble publiée sur la fiche du modèle mérite d’être lue, car la moyenne cache beaucoup de choses : LS Clean 1,42 %, LS Other 2,66 %, SPGISpeech 3,18 %, Voxpopuli-Cleaned-AA 4,88 %, Earnings22-Cleaned-AA-chunked 6,69 %, AMI-Cleaned 7,52 % et Gigaspeech-Cleaned 8,67 %, pour une moyenne d’exactement 5,00 %. La même fiche indique un RTFx moyen de 13 042,98 mesuré sur un seul H200 — supérieur au chiffre de 12 600 utilisé dans la publication de lancement d’IBM, et les deux chiffres proviennent tous deux de l’entreprise, de la même semaine, sur le même matériel.
Le chiffre de 2,7 % pour la transcription finale de Grok Voice Transcribe 2.0 n’est pas une mesure comparable. Il provient du classement AA-WER Streaming d’Artificial Analysis, un composite pondéré d’AA-AgentTalk à 50 %, de VoxPopuli à 25 % et d’Earnings22 à 25 % — environ huit heures d’audio conversationnel en anglais pondéré par agent, mesuré via une interface de streaming. Ensembles différents, pondération différente, mode de fonctionnement différent. Mettre 2,7 % à côté de 5,00 % et conclure que le modèle managé est environ deux fois plus précis est l’erreur la plus courante que l’on puisse commettre dans cette comparaison.
Ce qui peut être dit honnêtement est plus limité et reste utile. Les deux modèles sont solides sur l’audio sur lequel chacun a été mesuré. Grok Voice Transcribe 2.0 mène un tableau de classement en streaming exploité indépendamment, sur lequel d’autres modèles sont aussi mesurés, ce qui rend son rang vérifiable même si sa valeur exacte n’est pas transposable. Granite Speech 5.0 470M TurboCTC présente un WER agrégé sur les ensembles ASR ouverts standard et, séparément, un résultat en champ lointain où le checkpoint non commercial se classe cinquième en précision et celui Apache neuvième — mesuré sur de la parole bruitée et réverbérante, qui est la condition la plus difficile de l’ensemble et sans doute l’élément le plus honnête dans les chiffres de l’un ou l’autre modèle.
Si votre audio est de la parole anglaise lue et propre, l'écart de précision entre ces deux-là est probablement plus faible que ne le suggèrent les positions au classement. S'il est bruité, accentué, téléphonique ou non anglophone, aucun des deux classements ne vous apprend grand-chose et votre propre jeu de test est le seul instrument qui le fasse.
Poids libres contre 1,67 $ l'heure
La comparaison des coûts est le seul point sur lequel il est vraiment facile de distinguer ces deux modèles, et le chiffre que les gens citent habituellement est faux dans les deux sens.
• Transcription par lots — Grok Voice Transcribe 2.0 à 0,10 $ par heure d’audio, soit environ 1,67 $ pour 1 000 minutes, contre Granite Speech 5.0 470M TurboCTC sans coût de licence, plus le temps GPU
• Streaming — 0,20 $ par heure d’audio, environ 3,33 $ par 1 000 minutes, contre l’absence de service de streaming hébergé publié par IBM
• Licence — une API commerciale sans poids, contre Apache 2.0 pour le checkpoint principal et CC-BY-NC-SA-4.0 pour la version non commerciale plus précise
« Gratuit » fait beaucoup de travail dans cette première ligne. Un modèle à encodeur seul de 470 M est assez petit pour tourner sur du matériel modeste — c'est là tout l'intérêt de la conception, et la raison pour laquelle IBM l'a entraîné en dix jours sur huit H100 et l'a livré avec la contrainte `transformers>=5.16.0`, accompagné d'une démo WebGPU — mais quelqu'un paie quand même le GPU, la pile de service, l'autoscaling, les réessais et la rotation d'astreinte. À faible volume, le coût d'une offre managée est généralement inférieur au coût du temps d'ingénierie. À volume important et stable, la voie du matériel loué l'emporte, et le point de bascule dépend de votre taux d'utilisation plutôt que de votre volume audio : un GPU que vous gardez occupé coûte peu cher à l'heure, tandis qu'un GPU maintenu chaud pour le trafic de pointe ne l'est pas.
Un détail de licence mérite d'être signalé avant que quiconque conçoive son architecture en fonction de cela. Le plus précis des deux points de contrôle, celui à 4,85 % de WER, est le non commercial, sous CC-BY-NC-SA-4.0. Le point de contrôle Apache 2.0 est celui à 5,00 %, et c'est celui que vous pouvez intégrer dans un produit. C'est un écart de précision de 0,15 point échangé contre le droit d'utiliser le modèle tout court, et cela signifie aussi que toute comparaison qui cite 4,85 % pour « Granite Speech 5.0 » puis aborde un déploiement commercial cite le mauvais point de contrôle.

La règle de décision
Trois questions séparent ces deux modèles plus rapidement que n'importe quel tableau de référence.
La transcription est-elle consommée en direct, pendant que l’orateur est encore en train de parler ? Si oui, TurboCTC n’est pas le candidat — non pas parce qu’il est lent, mais parce qu’il n’a pas d’interface de streaming ni de sortie partielle, et une transcription partielle représente un engagement architectural différent d’un décodage par lots rapide. Si non, l’avantage de débit devient toute l’histoire et le modèle d’IBM est très difficile à battre sur le coût par heure d’audio traité.
Le travail nécessite-t-il un vocabulaire de domaine ? Si oui, un modèle avec biaisage l'emporte par défaut, et l'absence de biaisage par termes clés dans TurboCTC est rédhibitoire plutôt que simplement gênante. Si non, vous payez pour une fonctionnalité que vous n'utiliserez pas du côté managé.
L’audio est-il de la parole anglaise lue sur du matériel décent ? Si oui, les deux sont solides et le choix porte sur les opérations. Si non, les deux cartes ne sont pas informatives et seule votre propre évaluation compte.
Quelle que soit l'issue, c'est au niveau de la couche opérationnelle que cette décision devient peu coûteuse. OrcaRouter place plus de 200 modèles derrière une seule clé compatible OpenAI avec basculement automatique entre fournisseurs, de sorte qu'un point de terminaison vocal géré mono-région qui passe un mauvais moment cesse d'être votre panne, et le prix catalogue du fournisseur est répercuté à 0 % de marge — ce qui signifie qu'un changement de prix fournisseur ou un nouveau checkpoint est en production de notre côté le jour même. Pour une charge de travail où la bonne réponse est réellement incertaine, cela élimine le coût de se tromper : comparez les performances des deux sur vos propres données audio derrière un seul point de terminaison, gardez celui qui gagne, et changez la chaîne de modèle quand le prochain sera disponible.

La version courte : Granite Speech 5.0 470M TurboCTC est la meilleure réponse à « transcrire tout ce que nous avons jamais enregistré, à moindre coût, sur du matériel que nous maîtrisons », et Grok Voice Transcribe 2.0 est la meilleure réponse à « transcrire ceci en temps réel, avec précision, sans que nous ayons à exploiter la pile de service. » Le chiffre phare de 12 600× et celui de 0,49 seconde sont tous deux vrais, et aucun des deux ne constitue une preuve concernant l’autre.
