Carte hero d’article affichant « Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo », avec le badge « COMPARAISON DE MODÈLES » et le sous-titre « Ce que le modèle de référence gratuit fait encore mieux », avec des puces indiquant 2,7 % vs 4,07 % WER, 0,20 $ par heure vs poids MIT, 0,49 s vs 1-5 s auto-hébergé, et géré vs en propre, sur un dégradé du blanc au bleu avec le logo OrcaRouter en bas à droite.
Guides & Insights

Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo : ce que la référence gratuite fait encore mieux

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Whisper Large v3 Turbo a été la réponse par défaut à « nous avons besoin de transcription » depuis sa publication sous licence MIT le 1er octobre 2024, et rien dans Grok Voice Transcribe 2.0 ne change la raison pour laquelle il en est ainsi. Le nouveau modèle de SpaceXAI, livré le 18 septembre 2026, est un transcripteur véritablement meilleur, et de loin — taux d'erreur sur les mots de 2,7 % pour les transcriptions finales et de 3,4 % pour les premières transcriptions partielles sur le tableau AA-WER Streaming d'Artificial Analysis, contre 4,07 % pour la famille Whisper sur le tableau non-streaming, Turbo se situant lui-même généralement à quelques dixièmes de point derrière le Large v3 complet dont il a été distillé. Il est également facturé à 0,10 $ par heure d'audio pour le batch et à 0,20 $ par heure pour le streaming. Whisper Large v3 Turbo est un fichier de 1,6 Go contenant 809 millions de paramètres qui s'exécute sur votre propre matériel, ne comptabilise rien, n'envoie aucun audio nulle part, et n'a ni limite de débit, ni plafond de concurrence, ni calendrier d'obsolescence. La comparaison n'oppose pas un meilleur modèle à un moins bon. Elle oppose la location de la précision à la possession d'un composant.

La fenêtre de trente-deux secondes, c'est toute l'architecture

Whisper Large v3 Turbo hérite de la structure de chaque modèle Whisper : l’audio est traité par fenêtres fixes de 30 secondes, l’encodeur s’exécute une fois par fenêtre, et le décodeur produit le texte pour ce segment. Turbo a rendu cela moins coûteux — quatre couches de décodeur au lieu de trente-deux, environ 8× plus rapide que Large v3, environ 6 Go de VRAM au lieu de 10 — mais il n’en a pas changé la forme. Il n’existe aucune notion de « la phrase jusqu’ici » à l’intérieur du modèle, car il n’y a pas d’état persistant d’une fenêtre à l’autre.

Ce seul fait de conception explique tout ce qui en découle. Il n’y a pas de streaming natif, car le streaming exige de s’engager sur une sortie partielle au milieu de l’énoncé et le modèle n’a aucun mécanisme pour cela. Des déploiements Whisper en temps réel existent, mais ils consistent en un découpage en segments, plus une détection d’activité vocale, plus une couche d’assemblage que quelqu’un a écrite et maintient désormais, et la latence qui résulte de ce pipeline se mesure en secondes plutôt qu’en la demi-seconde qu’atteint Grok Voice Transcribe 2.0. Il n’y a pas de diarisation des locuteurs, car la diarisation est un problème distinct qui concerne qui parle plutôt que ce qui a été dit. Et la variante Turbo, en particulier, renvoie du texte brut — aucun horodatage, aucun score de confiance, aucune normalisation inverse du texte transformant les nombres et les adresses e-mail prononcés en forme écrite.

Grok Voice Transcribe 2.0 a été conçu dans l’autre sens. Le streaming est le transport principal, le traitement par lots utilise les mêmes poids derrière un point de terminaison REST, et la liste des fonctionnalités ressemble à une liste de ce que Whisper laissait à l’application : horodatages au niveau des mots avec un score de confiance par mot, diarisation des locuteurs incluse sans surcoût, transcription multicanal sur jusqu’à 8 canaux indépendants, biais de termes clés jusqu’à 100 termes de domaine par requête, normalisation inverse du texte dans 25 langues, suppression des mots de remplissage, et détection de fin de tour Smart Turn pour les agents vocaux. Si vous avez maintenu un pipeline de découpage et de recollage autour de Whisper, cette liste décrit le code que vous avez écrit.

L'écart de précision, et pourquoi il est plus petit qu'il n'y paraît

• Précision finale de la transcription (en streaming) — Grok Voice Transcribe 2.0 à 2,7 % de WER sur AA-WER Streaming, contre aucune entrée Whisper Large v3 Turbo, car le modèle ne peut pas diffuser en streaming nativement

• Précision par lots — Grok Voice Transcribe 2.0 à 2,29 % de AA-WER contre Whisper Large v3 à 4,07 % sur le tableau non-streaming d'Artificial Analysis, Turbo accusant généralement un retard de 0,4 à 0,6 point sur le Large v3 complet lors de tests indépendants

• Audio anglais propre — Whisper Large v3 Turbo atteint environ 2,1 % de WER sur LibriSpeech test-clean et environ 4,2 % sur test-other, donc sur de la parole de qualité studio, l’écart avec l’API de pointe se réduit à presque rien

• Audio du monde réel — les mêmes benchmarks indépendants situent Turbo à environ 4,6 % sur les appels professionnels à deux interlocuteurs et à 8–12 % sur l’audio bruité, et c’est là que l’avantage du modèle de pointe se creuse

• Débit par lots — Grok Voice Transcribe 2.0 à environ 162× le temps réel, contre Whisper Large v3 Turbo à environ 80×, sur une seule GPU grand public modeste, avec un matériel de service plus rapide atteignant des multiples de ce chiffre

• Latence de streaming — 0,49 seconde jusqu'au premier résultat partiel sur Grok Voice Transcribe 2.0, contre 1 à 5 secondes pour les pipelines de streaming Whisper auto-hébergés, qui relèvent de code de liaison et de VAD plutôt que d'une capacité du modèle

La lecture honnête de cette liste est que l’argument de la précision en faveur du paiement est réel mais conditionnel. Sur de l’anglais propre, à un seul locuteur et bien enregistré, Whisper Large v3 Turbo est suffisamment proche pour que la différence modifie rarement un résultat. Sur la téléphonie à 8 kHz, l’audio bruité des centres d’appels, la parole avec accent et les courtes phrases spécifiques à un domaine — les ensembles exacts sur lesquels SpaceXAI a optimisé 2.0, où ses propres chiffres rapportés sont passés de 10,6 % à 7,1 % en téléphonie et de 20,6 % à 6,8 % sur de courtes commandes multilingues — l’écart devient la différence entre une transcription qui permet de router et une qu’il faut lire. Ce sont des chiffres rapportés par l’entreprise sur de l’audio de l’entreprise, non reproduits par quiconque en dehors de SpaceXAI, et la direction qu’ils indiquent est cohérente avec chaque test indépendant de Whisper sur de l’audio dégradé.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

La comparaison des coûts n'est pas de 0,10 $ contre 0 $.

La licence de Whisper ne coûte rien ; son exécution, si. Une instance GPU qui héberge un modèle de 1,6 Go dans 6 Go de VRAM et transcrit à environ 80× le temps réel constitue le véritable poste de dépense, et aux tarifs habituels des GPU cloud, cela se situe dans le même ordre de grandeur que les API hébergées pour des charges de travail continues — à cette différence importante près que vous payez pour de la capacité, que de l'audio circule ou non. Il existe des points de terminaison Whisper hébergés à des prix très variés, de moins de 1,20 $ pour 1 000 minutes dans le bas de la fourchette à quelques dollars, et cet écart rappelle utilement que « Whisper » est un modèle, pas un niveau de service. Le tableau de prix normalisés d'Artificial Analysis situe les points de terminaison Whisper Large v3 hébergés les moins chers à 0,50 $ et 1,15 $ pour 1 000 minutes, tous deux inférieurs au tarif par lot de 1,67 $ de Grok Voice Transcribe 2.0 — mais aucun de ces points de terminaison ne vous appartient, et tous deux s'accompagnent des limites de débit et de la politique de rétention de quelqu'un d'autre.

Là où l'auto-hébergement l'emporte sans conteste, c'est sur le volume à profil irrégulier, fait de pics. Une archive multimédia de dix mille heures coûte le même prix sur votre propre GPU, que vous la traitiez en une semaine ou en un an, et aucun compteur horaire ne tourne pendant que vous décidez. Un pipeline de conformité qui ne doit jamais envoyer d'audio hors du réseau n'a aucune alternative hébergée, à aucun prix, car l'exigence est architecturale plutôt que financière. Et le fine-tuning ne vous est accessible que si vous détenez les poids : la licence MIT de Whisper vous permet de prendre le modèle à 809 M de paramètres et de l'adapter à un seul locuteur, un seul accent ou un vocabulaire de domaine restreint, une capacité qu'aucune API n'expose, quel que soit le prix.

L’image miroir, c’est que le prix d’un modèle hébergé peut bouger sous vos pieds. SpaceXAI a laissé son tarif inchangé lors du passage de 1.0 à 2.0 — une amélioration du modèle à prix constant — et le MAI-Transcribe-2 de Microsoft est arrivé au même tarif de 0,10 $ par heure d’audio, ce qui vous indique où se situe le plancher de la frontière. Si vous passez par OrcaRouter, ces prix catalogue sont répercutés avec 0 % de marge, de sorte qu’une baisse d’un fournisseur atteint votre facture le jour même où elle survient, plutôt qu’après un cycle de révision tarifaire. C’est un avantage réel du côté loué de cette comparaison, et il vaut la peine d’être mis en balance avec le fait que le côté gratuit ne vous envoie jamais de facture, tout simplement.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

À quoi chacun sert réellement

Conservez Whisper Large v3 Turbo lorsque l’audio est déjà un fichier, que le volume est élevé ou irrégulier, que les enregistrements sont raisonnablement propres, et que, soit les données ne peuvent pas quitter votre réseau, soit le budget ne peut pas absorber une facturation à l’heure. Il reste le bon choix pour les archives hors ligne, la transcription en périphérie et sur appareil où un modèle de 1,6 Go est quantifié pour tenir, les pipelines par lots où le débit est la contrainte plutôt que la latence, et tout projet où le fine-tuning sur votre propre audio est la voie vers la précision dont vous avez besoin. L’outillage qui l’entoure — whisper.cpp pour la périphérie, faster-whisper pour la production, les builds GGUF pour la mémoire limitée — bénéficie de deux ans de durcissement communautaire, ce qui constitue une forme de fiabilité qu’aucune API vieille de deux jours ne peut offrir.

Passez à Grok Voice Transcribe 2.0 lorsque l’audio est encore en cours d’arrivée, lorsque les enregistrements sont dégradés, lorsque vous devez savoir qui a parlé et à quel moment, lorsque le vocabulaire métier doit être biaisé plutôt qu’affiné, ou lorsque l’application agit sur une transcription partielle avant que le locuteur ait fini. Le chemin de mise à niveau tient à un paramètre sur une intégration existante et à un épinglage de retour à la 1.0 si cela tourne mal, ce qui rend l’essai peu coûteux. Il convient de noter que la migration inverse n’est pas bon marché : du code écrit pour une API de streaming avec diarisation et détection des tours de parole ne se dégrade pas élégamment en un modèle par lots qui renvoie du texte brut, ce qui plaide pour prouver le chemin hébergé sur un extrait de votre audio réel avant d’y engager un pipeline.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Là où la décision se prend vraiment

La plupart des équipes qui exploitent Whisper à quelque échelle que ce soit ne choisissent pas entre ces deux modèles : elles fonctionnent en hybride — Whisper pour l’archivage, car il est gratuit et suffisamment bon sur de l’audio propre, une API de pointe pour le flux en direct, car aucune autre ne diffuse avec un WER partiel de 3,4 %, et un troisième modèle en aval qui résume, classe ou agit sur le texte produit. C’est à cette troisième étape que l’éparpillement se produit généralement : un second contrat fournisseur pour le modèle de raisonnement, un second jeu d’identifiants, une seconde limite de débit à surveiller. OrcaRouter fait disparaître cette couche : une seule clé pour plus de 200 modèles, un basculement automatique en cas de dégradation d’un fournisseur, et un DSL de routage si vous voulez faire passer la même transcription par plusieurs modèles et comparer avant d’en choisir un. Les appels de transcription eux-mêmes continuent d’aller vers le fournisseur que vous avez choisi ; ce qui cesse de se multiplier, c’est tout ce qui vient après.

Ce qu'il faut surveiller du côté de Whisper, ce n'est pas un nouveau checkpoint — la famille n'a pas bougé depuis Turbo, et l'attention d'OpenAI s'est tournée vers la gamme GPT Transcribe. C'est la couche de service. Chaque année, l'outillage auto-hébergé devient plus rapide et le matériel qu'il exige devient plus modeste, et chaque progrès en la matière réduit d'autant l'intérêt de payer à l'heure. Ce qu'il faut surveiller du côté de SpaceXAI, c'est le basculement du modèle par défaut : quand 2.0 deviendra la valeur par défaut et que 1.0 sera déprécié, toutes les intégrations qui n'ont jamais nommé de modèle basculeront d'un coup, latence comprise. Aucune de ces deux évolutions ne change la répartition fondamentale. Un modèle que vous possédez et que vous ajustez, un modèle que vous louez et que vous appelez, et la réponse honnête : la plupart des stacks de production finissent par faire tourner les deux.