Carte hero d'article affichant « Grok Voice Transcribe 2.0 vs GPT Transcribe » avec le badge « COMPARAISON DE MODÈLES » et le sous-titre « Même prix en streaming, précision différente », avec des puces indiquant 2,7 % vs 3,9 % de WER en streaming, 3,4 % vs 6,3 % pour le premier partiel, 1,67 $ vs 4,50 $ par 1 000 minutes et 162x vs 41x en temps réel, sur un dégradé du blanc au bleu avec le logo OrcaRouter en bas à droite.
Guides & Insights

Grok Voice Transcribe 2.0 vs GPT Transcribe : même prix de streaming, précision différente

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La coïncidence est presque trop belle. Sur le classement AA-WER Streaming d’Artificial Analysis, Grok Voice Transcribe 2.0 et GPT Live Transcribe — le point de terminaison de transcription en flux — affichent tous deux exactement 3,33 $ pour 1 000 minutes d’audio. Grok Voice Transcribe 2.0 de SpaceXAI, publié le 18 septembre 2026, renvoie une transcription finale avec un taux d’erreur de mots de 2,7 %, 0,49 seconde après la fin de la parole, et une première transcription partielle à 3,4 %. GPT Live Transcribe, sorti aux côtés de GPT Transcribe le 28 juillet 2026, renvoie sa transcription finale à 3,9 % et sa première transcription partielle à 6,3 %. Même prix, avec environ 1,2 point de précision de transcription finale et 2,9 points de précision de transcription partielle en faveur de SpaceXAI. Le volet par lots de la même confrontation n’a rien d’une coïncidence : GPT Transcribe coûte 4,50 $ pour 1 000 minutes contre 1,67 $ pour Grok Voice Transcribe 2.0, soit un écart de 63 % pour les fichiers enregistrés.

Deux paris différents sur la façon dont la transcription s’améliore

La réponse d'OpenAI à l'exactitude, c'est le contexte. GPT Transcribe et GPT Live Transcribe acceptent tous deux des prompts libres, des listes de mots-clés et des listes de langues attendues, et dans les sessions Realtime, les tours transcrits précédents sont réinjectés comme contexte pour les suivants. Sur le benchmark Context Aware ASR d'OpenAI, ce conditionnement a fait passer l'exactitude sémantique de GPT Live Transcribe de 38,5 % à 44,6 % — un chiffre rapporté par le fournisseur, qui mesure si le sens a survécu plutôt que si les mots étaient corrects. Le compromis qu'OpenAI propose est explicite : donnez au modèle des informations sur ce qu'il s'apprête à entendre, et il transcrira votre domaine mieux qu'un modèle général de même exactitude brute.

La réponse de SpaceXAI est le modèle lui-même. Grok Voice Transcribe 2.0 dispose bien d’un mécanisme de biais — jusqu’à 100 termes clés par requête, chacun jusqu’à 50 caractères — mais il s’agit d’une liste de vocabulaire, pas d’un prompt. Vous pouvez lui dire que « OrcaRouter » et « Kubernetes » sont de vrais mots ; vous ne pouvez pas lui remettre un paragraphe expliquant qu’il s’agit d’un appel au support à propos d’un remboursement. L’amélioration de la précision dans la version 2.0 vient plutôt du réentraînement : sur les propres ensembles d’évaluation issus de la production de SpaceXAI, le taux d’erreur sur les mots est passé de 8,7 % à 3,3 % sur l’audio conversationnel, de 10,6 % à 7,1 % sur la téléphonie à 8 kHz, de 7,2 % à 3,2 % sur les identifiants prononcés, et de 20,6 % à 6,8 % sur les commandes courtes dans 19 langues. Ce sont les chiffres de l’entreprise sur l’audio de l’entreprise, que personne à l’extérieur de celle-ci n’a reproduits, et ils décrivent un modèle qui s’est amélioré face au problème acoustique, et non un modèle qui s’est amélioré parce qu’on lui indique à quoi s’attendre.

La différence pratique apparaît dès la deuxième heure de travail. Un modèle conditionné par le contexte peut être nettement meilleur que ne le suggère son benchmark brut, parce que vous avez fourni le vocabulaire et le domaine. Il peut aussi halluciner les mots-clés que vous avez fournis : mettez « OrcaRouter » dans l'invite et un modèle qui ne parvient pas à entendre clairement le mot peut le produire quand même. Un modèle biaisé par termes clés se dégrade plus gracieusement, car le biais décale la probabilité d'un terme plutôt que d'affirmer qu'il est présent. Aucun de ces modes de défaillance n'apparaît sur un classement, et les deux apparaîtront dans vos journaux.

Les chiffres, côte à côte

• Précision de la transcription finale (streaming) — Grok Voice Transcribe 2.0 à 2,7 % de WER contre GPT Live Transcribe à 3,9 % sur AA-WER Streaming, les deux selon Artificial Analysis

• Précision du premier partiel (streaming) — 3,4 % contre 6,3 %, l’écart le plus large de la comparaison et celui qui détermine le comportement de l’agent vocal

• Délai jusqu’à la transcription finale — 0,49 s contre 0,81 s après la fin de la parole, donc le modèle le plus précis est aussi le plus rapide à valider.

• Temps jusqu’au premier partiel — 0,49 s contre 0,26 s, la seule colonne de latence qu’OpenAI remporte haut la main

• Tarif de streaming — 3,33 $ par 1 000 minutes pour les deux, normalisé par Artificial Analysis à partir de 0,20 $/heure pour Grok et de 0,017 $/minute pour OpenAI

• Précision par lots (hors streaming) — Grok Voice Transcribe 2.0 à 2,3 % d'AA-WER contre GPT Transcribe à 3,31 %

• Prix par lot — 1,67 $ pour 1 000 minutes contre 4,50 $ pour 1 000 minutes, à partir de 0,10 $/heure contre 0,0045 $/minute

• Débit par lots — environ 162× le temps réel contre environ 41× sur la même carte

Lisez cette liste comme deux colonnes plutôt que comme un seul verdict. OpenAI remporte la latence du premier résultat partiel avec une marge nette et propose un mécanisme de contexte que Grok n’a pas. SpaceXAI remporte l’exactitude finale dans les deux modes, l’exactitude des partiels en streaming, le débit et le prix en mode batch avec une large marge. Il n’existe aucune colonne où GPT Live Transcribe est à la fois plus rapide et plus précis que Grok Voice Transcribe 2.0 ; il y en a une où il est plus rapide, et c’est la première.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

Sur quel parcours de lot vous vous trouvez réellement

L’écart entre 1,67 $ et 4,50 $ est le chiffre le moins ambigu ici, et il vaut la peine de préciser pourquoi il existe. OpenAI a baissé le prix de cette gamme de 25 % lors du lancement de GPT Transcribe, par rapport à l’ère de GPT-4o Transcribe, ce qui a donné 0,0045 $ la minute. SpaceXAI a laissé son tarif par lot inchangé à 0,10 $ de l’heure lorsqu’elle est passée de la version 1.0 à la version 2.0 — elle a amélioré le modèle et facturé le même tarif, ce qui est plus difficile à faire et constitue un meilleur signal de la direction que prend le marché. Le MAI-Transcribe-2 de Microsoft est arrivé au même tarif de 0,10 $ de l’heure dans le cadre d’une offre à durée limitée, si bien que le point de 1,67 $ pour 1 000 minutes est devenu le plancher des laboratoires de pointe pour la transcription par lots, plutôt qu’un tarif promotionnel propre à un seul fournisseur.

À dix mille heures d’audio par mois, cet écart est d’environ 2 830 $ contre 450 $. Pour une archive de podcasts, un arriéré d’enregistrements d’appels ou une médiathèque en cours de retranscription rétroactive, la différence de prix éclipse toute différence de précision entre 2,3 % et 3,31 % de WER. Pour un agent de streaming, où les deux produits coûtent le même prix, la précision et la latence sont les seules choses qui restent à débattre.

Il existe une différence structurelle derrière ces tarifs, et elle mérite d’être nommée : Grok Voice Transcribe 2.0 facture un tarif forfaitaire par heure audio, et GPT Live Transcribe facture à la minute, mais Gemini 3.5 Transcribe Live facture au token sur l’entrée audio comme sur la sortie texte. Un seul de ces trois fait dépendre votre facture de ce que le modèle choisit de dire. Si votre volume est suffisamment important pour que la prévision compte, les tarifs forfaitaires sont plus faciles à justifier auprès de la personne qui signe la facture — et comme OrcaRouter répercute les prix catalogue des fournisseurs avec 0 % de marge, une baisse côté fournisseur comme celle de 25 % d’OpenAI serait active de notre côté le jour même de son annonce, et non au prochain renouvellement.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

Ce qu’aucun des deux modèles n’est

GPT Transcribe et GPT Live Transcribe sont deux produits, et non un seul produit doté d’un commutateur. Le modèle par lots traite les fichiers terminés, les transcriptions de fichiers diffusés en continu et les tours validés dans les sessions Realtime, et traite l’audio environ 34 fois plus vite que le temps réel selon les propres chiffres d’OpenAI — Artificial Analysis mesure 41× sur son banc d’essai. Le modèle de streaming est le plus cher, à 0,017 $ par minute, et celui dont le taux d’erreur sur les partiels est 10 fois plus élevé. Choisir OpenAI revient à choisir lequel de ces deux problèmes vous avez, car le point de terminaison le moins cher ne peut pas faire le travail de l’autre.

Grok Voice Transcribe 2.0 est un modèle avec deux transports : les mêmes poids servent /v1/stt via REST pour des fichiers jusqu'à 500 Mo et wss://api.x.ai/v1/stt via WebSocket pour l'audio en direct, avec des résultats intermédiaires émis environ toutes les 500 ms. Le débit de streaming est exactement le double du débit par lots plutôt qu'un produit conçu séparément, ce qui signifie que la précision que vous mesurez sur votre audio archivé est celle à laquelle vous devez vous attendre en direct. Cela signifie aussi qu'il n'y a pas de second modèle à évaluer — un seul ensemble de prompts, un seul ensemble de termes clés, un seul ensemble d'attentes.

La parité fonctionnelle est proche, mais pas identique. Les deux renvoient des horodatages au niveau des mots ; Grok Voice Transcribe 2.0 associe un score de confiance à chaque mot, ce qui vous permet d'appliquer un seuil aux segments à faible confiance plutôt que d'accorder la même confiance à toute la transcription. Les deux effectuent la diarisation des locuteurs, et celle de Grok est incluse sans coût supplémentaire. Les deux gèrent la normalisation inverse du texte pour les nombres, les dates, les devises et les coordonnées. Grok Voice Transcribe 2.0 ajoute la transcription multicanal sur jusqu'à 8 canaux indépendants, la suppression des mots de remplissage et la détection de fin de tour Smart Turn ; les ajouts distinctifs de GPT Transcribe sont le conditionnement contextuel au niveau du prompt et, côté Realtime, la reprise automatique des tours précédents. OpenAI n'a publié de nombre de langues prises en charge pour aucun des deux modèles ; Grok Voice Transcribe 2.0 documente des dizaines de langues avec commutation en cours d'enregistrement et formatage de la forme écrite sur 25.

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

Comment décider, et comment le tester

Si vous développez un agent vocal qui doit répondre avant que l'appelant ait fini de parler, la colonne des transcriptions partielles est votre variable de décision, et elle départage nettement les deux modèles : Grok Voice Transcribe 2.0 est 2,9 points plus précis sur les transcriptions partielles, mais met 0,23 seconde de plus à les produire. Choisissez SpaceXAI si une transcription partielle erronée est pire qu'une transcription partielle tardive — routage, escalade, réponses déclenchées par des obligations de conformité. Choisissez OpenAI si une transcription partielle tardive est pire qu'une transcription partielle erronée, et si vous disposez du vocabulaire métier à fournir au mécanisme de contexte pour que l'écart de précision se réduise. Ensuite, mesurez les deux, car le comportement en matière de transcriptions partielles de l'un comme de l'autre fournisseur sur huit heures de conversations d'agents en anglais ne permet pas de prédire ce que l'un ou l'autre fera avec votre accent, votre codec et votre jargon.

Si vous transcrivez des fichiers, la décision est bien plus facile : 1,67 $ contre 4,50 $ pour 1 000 minutes et 2,3 % contre 3,31 % de WER, les deux allant dans le même sens. La seule raison de rester sur GPT Transcribe pour le travail par lots est que le mécanisme de conditionnement par le contexte fasse quelque chose pour votre audio que l’écart de précision brut ne peut compenser — ce qui est une possibilité réelle sur des enregistrements hautement spécifiques à un domaine, et une possibilité testable.

Aucun des deux modèles de transcription ne figure aujourd'hui au catalogue d'OrcaRouter, donc les appels eux-mêmes passent par l'API propre du fournisseur. Ce qui se trouve derrière une seule clé OrcaRouter, en revanche, c'est tout ce que la transcription alimente : le modèle d'agent, le résumeur, le classifieur, le code qui décide quoi faire du texte. C'est là qu'apparaît généralement le second contrat — un fournisseur pour la parole, un autre pour le modèle qui raisonne dessus — et ce n'est pas une fatalité. Une seule clé pour plus de 200 modèles, un basculement automatique en cas de dégradation d'un fournisseur, et le DSL de routage si vous voulez envoyer une requête à travers plusieurs modèles et comparer avant de vous engager. C'est une affirmation plus modeste que « nous routons votre transcription », et c'est la vraie.

Ce qu'il faut surveiller, c'est de savoir si OpenAI répond sur la précision plutôt que sur le contexte. L'entreprise a désormais livré deux générations de transcription en un an et baissé ses prix une fois ; le mécanisme de contexte est véritablement différenciant, mais sur le tableau qui mesure la transcription brute, il se situe actuellement derrière SpaceXAI et Microsoft. Si un GPT Transcribe 2 arrive avec le mécanisme de contexte intact et un taux d'erreur ramené autour de 2 %, cette comparaison s'inverse du jour au lendemain côté batch — et le prix du streaming, déjà identique, fait de cette course un duel à suivre.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement