
Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B : deux classements, une comparaison trompeuse
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B est un transducteur FastConformer-TDT de 600 millions de paramètres publié le 14 août 2025 sous licence CC-BY-4.0, et il constitue depuis plus d’un an la recommandation par défaut pour toute personne souhaitant faire tourner la transcription elle-même. Grok Voice Transcribe 2.0 est le modèle de transcription vocale géré de SpaceXAI, lancé le 18 septembre 2026, au prix de 0,10 $ par heure d’audio en traitement par lots et de 0,20 $ par heure en streaming, avec un taux d’erreur sur les mots final de 2,7 % dans le classement streaming d’Artificial Analysis. Si vous cherchez une comparaison entre les deux, vous trouverez Parakeet annoncé à 13,7 % de WER et Grok Voice Transcribe 2.0 à 2,7 %, ce qui donne au modèle géré l’air cinq fois plus précis et constitue une lecture vraiment trompeuse. Ces deux chiffres proviennent d’indices Artificial Analysis différents, construits sur des jeux de données différents, publiés à des années d’intervalle, et l’un d’eux a été supplanté par les mesures plus récentes du fournisseur lui-même. La vraie comparaison est plus intéressante, et elle porte sur ce que 600 mégaoctets de poids vous offrent qu’une API ne peut pas.
Le chiffre de 13,7 % et pourquoi vous ne devriez pas l’utiliser
Le rapport State of AI du troisième trimestre 2025 d’Artificial Analysis a classé NVIDIA Parakeet TDT troisième sur son indice AA-WER avec 13,7 %, derrière Chirp 2 de Google à 11,6 % et le Canary Qwen de NVIDIA à 13,2 %. Cet indice était une moyenne pondérée par la durée audio sur environ deux heures chacune de VoxPopuli, Earnings-22 et AMI-SDM — de la parole en conditions réelles avec des accents variés, un vocabulaire de domaine et des conditions de canal difficiles, ce qui explique pourquoi chaque chiffre y est élevé. Un WER de 13,7 % sur AMI-SDM, qui est de l’audio de réunion en champ lointain enregistré dans des salles réverbérantes, n’est pas un mauvais résultat ; c’est un test difficile.
Cet indice n’existe plus sous cette forme. Artificial Analysis l’a reconstruit sous le nom d’AA-WER v2, en pondérant AA-AgentTalk à 50 % et VoxPopuli-Cleaned-AA et Earnings22-Cleaned-AA à 25 % chacun, soit environ huit heures d’audio, et le nettoyage et la repondération ont fait sensiblement évoluer le score de chaque modèle. Sur le classement non-streaming actuel, Parakeet TDT 0.6B V3 se situe dans la zone basse des pourcentages à un chiffre — la même plage que les autres leaders open-weights — et non près de 13,7 %, et le sommet du classement se situe désormais aux alentours de 2 %. Toute personne qui cite encore 13,7 % pour Parakeet cite une mesure abandonnée, et si elle le compare à un chiffre de streaming de 2026, elle compare aussi deux classements différents.
Ce qui peut honnêtement être mis côte à côte est plus restreint. L'évaluation propre à NVIDIA sur l'Open ASR Leaderboard — les ensembles standard publics de courts extraits en anglais, exécutés via l'outillage de ce tableau — rapporte un WER moyen de 6,32 % pour Parakeet TDT 0.6B V3 avec un RTFx de 3 332,74, et une moyenne de 6,05 % pour la v2 uniquement anglaise. Le 2,7 % de Grok Voice Transcribe 2.0 est un chiffre de transcription finale sur le tableau de streaming, mesuré après la fin de la parole, sur de l'audio conversationnel anglais pondéré par agent. Des ensembles différents, un tableau différent, un mode différent. Le modèle managé est très probablement plus précis sur l'audio que les deux tableaux partagent ; l'ampleur de cet avantage n'est pas de 5×, et personne n'a publié la mesure qui permettrait de trancher.
Quelle est la forme réelle des deux modèles
La différence architecturale explique l'essentiel de la différence pratique. Parakeet TDT 0.6B est un encodeur FastConformer avec un décodeur transducteur à token et durée — il prédit à la fois un token et le nombre de trames à avancer, ce qui lui permet de sauter plutôt que d'émettre des blancs, et c'est la principale source de son efficacité. Il est livré avec la détection automatique de la langue sur 25 langues européennes, des horodatages au niveau des mots et des segments, la ponctuation et les majuscules, et il gère l'audio long — jusqu'à 24 minutes avec attention complète, ou environ trois heures avec attention locale. Il est servi via NeMo 2.2, dispose d'un chemin MLX pour Apple Silicon, et il existe des builds ONNX INT8 qui tournent sur des CPU simples.
Grok Voice Transcribe 2.0 est un service managé, donc la comparaison se fait entre un modèle et un produit. Ce que le produit inclut à son prix catalogue :
• Streaming — Grok Voice Transcribe 2.0 natif via WebSocket, premier partiel à 0,49 seconde contre les approches par blocs ou par tampon de Parakeet TDT 0.6B, sans interface de transcription partielle de premier ordre
• Biais de termes clés — jusqu'à 100 termes clés par requête, contre une fonctionnalité absente de Parakeet
• Diarisation — incluse dans le prix de la demande vs un système séparé que vous ajoutez vous-même
• Canaux — jusqu’à huit canaux audio dans une seule requête contre un flux par passe
• Normalisation inverse du texte — incluse pour 25 langues, contre ponctuation et majuscules uniquement
• Déploiement — un point de terminaison géré dans us-east-1 vs des poids que vous téléchargez, exécutez et exploitez où vous voulez
• Licence — conditions de l'API commerciale vs CC-BY-4.0 avec attribution
• Taille du modèle — non divulguée vs environ 600 millions de paramètres, environ 2,4 Go en fp32 ou 1,2 Go en fp16
C’est la dernière ligne qui est décisive pour beaucoup de déploiements. Parakeet TDT 0.6B tient dans quelques gigaoctets, tourne de façon acceptable sur le CPU d’un ordinateur portable via le chemin INT8 ONNX, et tient aisément sur n’importe quel GPU grand public. Ce n’est pas une version plus petite de ce que fait l’API — c’est une capacité différente, car c’est la différence entre une fonctionnalité de transcription qui fonctionne hors ligne, sur un appareil, sans réseau et sans coût horaire, et une qui ne fonctionne pas.

L’arithmétique des coûts que personne ne calcule correctement
La comparaison qui est publiée est « 0,10 $ l'heure contre gratuit », et elle est erronée dans les deux sens — l'API n'est pas la seule chose que vous payez, et les poids ne sont pas la seule chose sur laquelle vous faites des économies.
• Transcription par lots — Grok Voice Transcribe 2.0 à 0,10 $ par heure d’audio, soit environ 1,67 $ pour 1 000 minutes, contre Parakeet TDT 0.6B sans frais de licence, plus le temps de GPU ou de CPU
• Streaming — 0,20 $ par heure d’audio, environ 3,33 $ par 1 000 minutes, par rapport à l’auto-hébergement, où la contrainte est votre propre plafond de simultanéité plutôt qu’un tarif publié
• Limites de service — 10 requêtes par seconde et 100 sessions de streaming simultanées par équipe, contre tout ce que votre matériel permet, sans limite de débit ni plafond de concurrence
• Le coût qui ne figure sur aucune des deux feuilles — pas d’ingénierie, pas de pile de service, pas d’autoscaling face à la rotation d’astreinte, la logique de réessai, les mises à jour du modèle et le GPU que vous gardez au chaud pour les pics
À faible volume, le côté géré est presque toujours moins cher, car le coût fixe de l’approche auto-hébergée est une personne. Pour de gros volumes réguliers, le côté auto-hébergé l’emporte nettement, et le point de bascule dépend de l’utilisation plutôt que du volume audio : un GPU que vous gardez occupé coûte très peu par heure d’audio, tandis qu’un GPU que vous maintenez en chauffe pour les pics de trafic ne l’est pas. Une équipe qui traite 20 000 heures par mois paie 2 000 $ pour la voie par lots gérée et environ un mois de GPU de milieu de gamme plus du temps d’ingénierie pour la voie auto-hébergée, ce qui n’est pas comparable.
La raison pour laquelle ce calcul est si mal fait, c'est que le côté auto-hébergé est généralement comparé à zéro, et le côté géré est généralement comparé au tarif catalogue. Ni l'un ni l'autre n'est un chiffre réel. Ce qui est réel, c'est que les 3 332 RTFx de Parakeet TDT 0.6B — chiffre de NVIDIA, par lots, sur du matériel de centre de données, et à considérer comme une limite supérieure plutôt qu'une promesse — signifient qu'un seul GPU modeste peut traiter plus d'audio que la plupart des organisations n'en produisent.
Là où Parakeet cesse d’être la bonne réponse
Trois choses poussent une équipe à délaisser le modèle ouvert au profit d’un modèle géré, et aucune d’entre elles n’est la précision.
Le premier point est la pondération par termes clés. Si vos transcriptions sont pleines de noms de produits, de noms de famille, de symboles boursiers ou de jargon métier, un modèle dépourvu de mécanisme de pondération les transcrira mal, sans autre remède qu’un affinage. Grok Voice Transcribe 2.0 accepte jusqu’à 100 termes clés par requête. Parakeet TDT 0.6B ne dispose pas de cette fonctionnalité. Pour les centres de contact, la santé et le domaine juridique, cet unique écart est rédhibitoire, quel que soit ce que raconte n’importe quel classement.
La seconde est la diarisation. Parakeet vous donne des mots avec des horodatages ; il ne vous dit pas qui les a prononcés. La transcription multi-locuteurs implique d’exécuter un modèle de diarisation distinct et d’aligner la sortie, ce qui représente un projet plutôt qu’une option de configuration. Le modèle géré renvoie un texte attribué à un locuteur dans la même requête.
Le troisième est l’interface de streaming elle-même. Parakeet est suffisamment rapide pour que des gens construisent des systèmes temps réel dessus — découpage de l’audio en segments, exécution du modèle sur chaque segment, recollage de la sortie —, mais le comportement de transcription partielle, la détection de fin de tour et la sémantique d’engagement sont toutes des choses que vous écrivez et maintenez. Grok Voice Transcribe 2.0 renvoie un premier résultat partiel 0,49 seconde après que vous avez arrêté de parler, en tant que fonctionnalité produit.
Il y a aussi un détail de licence qui surprend parfois les équipes : Parakeet TDT 0.6B V3 est sous CC-BY-4.0, ce qui autorise l’usage commercial mais exige l’attribution, et certains modèles vocaux NVIDIA sont depuis passés à la propre Open Model License du fournisseur. Si l’attribution pose problème pour votre produit, consultez la fiche du checkpoint spécifique plutôt que de supposer que les conditions de la famille s’appliquent.

Pourquoi l'API l'emporte généralement de toute façon, et quand elle ne devrait pas
La tendance de l’année écoulée est constante : les équipes commencent avec un modèle ouvert comme Parakeet TDT 0.6B parce qu’il est gratuit et contrôlable, livrent la fonctionnalité, puis découvrent que le coût récurrent n’est pas le GPU mais la maintenance, et migrent vers un endpoint géré. La migration inverse se produit aussi, généralement lorsque le volume franchit un seuil où les frais par heure commencent à ressembler à un loyer pour quelque chose que l’on pourrait posséder.
Les deux directions sont coûteuses à exécuter si le modèle est connecté directement à votre application, ce qui plaide pour garder le site d’appel banal. OrcaRouter expose plus de 200 modèles derrière une seule clé compatible OpenAI, avec bascule automatique entre fournisseurs et 0 % de marge sur le prix catalogue des fournisseurs, de sorte qu’un déploiement auto-hébergé et un déploiement managé peuvent se trouver derrière la même interface et être échangés au moyen d’une chaîne de modèle. Cela compte plus que d’habitude dans le domaine de la parole, où le classement change de main toutes les quelques semaines et où un service managé mono-région est une panne mono-région — c’est le chemin de bascule qui évite qu’une fonctionnalité de transcription devienne une panne de transcription.
Pour les équipes qui veulent le débit du modèle ouvert sans la pile de service, c'est aussi la forme que prend la décision : évaluez les performances de Parakeet TDT 0.6B sur votre propre audio, évaluez les performances de Grok Voice Transcribe 2.0 sur le même audio, et laissez celui qui gagne garder le trafic pendant que vous cessez de vous soucier du fournisseur dont le logo y figure.

Si vous voulez la version en une ligne : Parakeet TDT 0.6B reste la meilleure réponse à « transcrire n'importe quoi, n'importe où, sans coût horaire, sur du matériel que je possède déjà », et Grok Voice Transcribe 2.0 est la réponse à « transcrire avec précision, avec des étiquettes de locuteur et mon propre vocabulaire, sans rien exécuter ». Le chiffre de 13,7 % qui fait paraître l'écart énorme est une mesure obsolète, et l'écart honnête — quelque part entre un et trois points de WER sur de l'audio qui se chevauche — est assez petit pour que la question opérationnelle doive trancher.
