
Grok Voice Transcribe 2.0 s’empare de la 1re place en précision de transcription en streaming, à un prix inchangé
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 est le modèle de transcription parole-texte que SpaceXAI a livré le 18 septembre 2026, et le seul chiffre qui compte à son sujet n'est pas celui que la publication de lancement met en avant. C'est celui-ci : la première transcription partielle — le texte sur lequel un agent vocal peut réellement agir pendant qu'on parle encore par-dessus l'appelant — est passée d'un taux d'erreur de mots de 18,3 % dans Grok Voice Transcribe 1.0 à 3,4 %. C'est la mesure du tableau AA-WER Streaming d'Artificial Analysis, où le nouveau modèle occupe désormais la première place à la fois dans le classement Final Transcript (2,7 % de WER, 0,49 seconde après la fin de la parole) et dans le classement First Partial Transcript (3,4 %, 0,49 seconde). La précision de la transcription finale s'est elle aussi améliorée, de 3,9 % à 2,7 %, ce qui est réel mais modeste. C'est le bond de la transcription partielle qui change ce que vous pouvez construire.
Qu'est-ce qui a réellement changé entre la 1.0 et la 2.0
Les deux versions sont le même produit dans la même API, et SpaceXAI n'a apporté aucune modification à l'interface : Grok Voice Transcribe 2.0 est sélectionné en passant grok-voice-transcribe-2.0 à /v1/stt au lieu de grok-voice-transcribe-1.0, ou en le choisissant lors de la création de la connexion WebSocket pour le streaming. Les intégrations existantes qui omettent le paramètre model continuent de recevoir la 1.0 jusqu'à ce que SpaceXAI bascule la valeur par défaut, ce que l'entreprise dit vouloir faire dans les semaines à venir, en parallèle de la dépréciation de l'ancienne version. D'ici là, la 2.0 est en opt-in et la 1.0 peut être épinglée délibérément, ce qui est la bonne approche pour un changement de ce type : vous pouvez la tester en A/B sur votre propre audio avant qu'elle ne devienne votre valeur par défaut de production, que vous l'ayez demandé ou non.
Les chiffres d’Artificial Analysis, lus côte à côte, racontent une histoire plus précise que « deux fois plus précis » :
• Précision de la transcription finale — Grok Voice Transcribe 2.0 à 2,7 % de WER contre Grok Voice Transcribe 1.0 à 3,9 % sur AA-WER Streaming, tous deux mesurés après la fin de la parole
• Précision de la première transcription partielle — 3,4 % de WER contre 18,3 %, le plus grand écart individuel entre les deux versions
• Délai jusqu'à la transcription finale — 0,49 s vs 0,37 s, donc le nouveau modèle est plus lent à finaliser que celui qu'il remplace
• Temps jusqu'au premier partiel — 0,49 s contre 0,25 s, également plus lent
• Précision par lots (non-streaming) — 2,3 % de AA-WER sur le tableau non-streaming d'Artificial Analysis, contre 4,07 % pour Whisper Large v3 et 3,31 % pour GPT Transcribe
• Débit de traitement par lots — environ 162× le temps réel sur la même carte, derrière les 333× de MAI-Transcribe-2 et devant les 88× de Gemini 3.5 Transcribe
Cette quatrième et cette cinquième ligne sont la réserve honnête de cette version. SpaceXAI a acheté la précision au prix de la latence. Le nouveau modèle met environ un tiers de seconde de plus à renvoyer son premier partiel et sa transcription finale que la version 1.0. Sur un classement où Deepgram Flux renvoie un partiel en 0,02 seconde et Soniox v5 en 0,05, Grok Voice Transcribe 2.0 ne rivalise pas du tout sur la vitesse — il rivalise sur la justesse, et il remporte ce compromis avec une large marge. Savoir si ce compromis est le bon dépend entièrement de si votre application est un agent vocal en direct qui doit commencer à répondre, ou un pipeline de transcription où une demi-seconde est invisible.

L’affirmation « deux fois plus précis », vérifiée
Le titre phare de SpaceXAI est que la version 2.0 est deux fois plus précise que la 1.0 au même prix, et son propre tableau d’évaluation le confirme sur les ensembles qu’elle a choisis. Sur des appels en anglais au service client à 8 kHz, le taux d’erreur de mot est passé de 10,6 % à 7,1 %. Sur des conversations avec Grok, de 8,7 % à 3,3 %. Sur des identifiants vocaux — codes de compte, numéros de téléphone, adresses e-mail — de 7,2 % à 3,2 %. Sur des commandes courtes dans 19 langues, de 20,6 % à 6,8 %, soit une réduction des erreurs d’environ deux tiers. Ces quatre ensembles sont issus du trafic de production de SpaceXAI et les comparaisons sont celles de SpaceXAI elle-même ; personne en dehors de l’entreprise ne les a reproduites. Considérez ce tableau comme une carte des zones où le modèle a été ajusté, et non comme une garantie générale de précision.
Le résultat d'Artificial Analysis est la partie qui n'est pas déclarée par le fournisseur : un banc d'essai indépendant exécuté sur environ huit heures d'audio, pondéré à 50 % vers l'ensemble privé AA-AgentTalk et à 25 % chacun vers VoxPopuli et Earnings22. Il étaye une affirmation plus étroite et plus utile que « deux fois plus précis » — à savoir que, sur ce mélange précis, ce modèle est le transcripteur en flux le plus précis jamais mesuré. Un détail mérite d'être signalé : la publication de SpaceXAI décrit une première place « parmi 32 modèles en flux », alors que la page du classement elle-même n'en répertorie que 27 sur 33. Le rang est réel ; la taille du panel dans l'argumentaire marketing correspond au décompte de l'entreprise, pas à celui du classement.
Il vaut également la peine d’être précis sur ce qu’une première place sur AA-WER Streaming couvre et ne couvre pas. Le classement est à dominante anglaise et très orienté conversations d’agents. Il ne mesure pas votre accent, votre codec, votre vocabulaire de domaine, ni votre audio de centre d’appels à huit canaux. Un modèle qui y arrive en tête peut encore très mal se comporter sur vos enregistrements, et c’est précisément pourquoi la fenêtre d’opt-in compte.

La tarification reste inchangée, et c'est le deuxième fait le plus important ici.
Grok Voice Transcribe 2.0 coûte ce que coûtait la version 1.0 : 0,10 $ par heure d’audio pour le traitement par lots et les fichiers enregistrés via le point de terminaison REST, 0,20 $ par heure d’audio pour le streaming via le WebSocket. Sur le tableau des prix d’Artificial Analysis, le SKU de streaming s’établit à 3,33 $ pour 1 000 minutes et le SKU par lots à 1,67 $ — le même tarif par lots que celui facturé par Microsoft pour MAI-Transcribe-2, et environ un tiers de ce que coûte ElevenLabs Scribe v2 Realtime par minute de streaming.
La diarisation, les horodatages au niveau des mots avec scores de confiance et la pondération par termes clés sont tous inclus à ce tarif plutôt que facturés séparément, ce qui n’est pas universel sur ce marché. Gemini 3.5 Transcribe Live facture par token en entrée audio comme en sortie texte, si bien que votre coût varie selon ce que dit le modèle, et pas seulement selon la durée de l’audio. Un tarif forfaitaire à l’heure est plus facile à prévoir et à comparer d’un fournisseur à l’autre — et comme OrcaRouter répercute les prix catalogue des fournisseurs avec 0 % de marge, une modification de ce tarif côté fournisseur apparaîtrait de notre côté le jour même plutôt qu’après un cycle de réajustement tarifaire.
Ce que l'API vous donne réellement
La liste des capacités est vaste et en grande partie héritée plutôt que nouvelle, ce qu’il est bon de savoir si vous évaluez la mise à niveau sur les seules fonctionnalités :
• Traitement par lots et en flux dans un seul modèle — REST pour les fichiers enregistrés jusqu'à 500 Mo, WebSocket à wss://api.x.ai/v1/stt avec des résultats intermédiaires émis environ toutes les 500 ms
• Diarisation des locuteurs incluse, ainsi que la transcription multicanal jusqu’à 8 canaux indépendants
• Horodatages au niveau des mots accompagnés de scores de confiance, afin que vous puissiez appliquer un seuil aux segments à faible confiance plutôt que de faire également confiance à toute la transcription
• Biais de termes clés portant sur jusqu'à 100 termes de domaine par requête, chacun comportant jusqu'à 50 caractères
• Normalisation inverse du texte pour les nombres, les dates, les devises, les numéros de téléphone et les adresses e-mail, avec prise en charge du formatage sous forme écrite dans 25 langues
• Suppression des mots de remplissage et détection de fin de tour Smart Turn, destinées spécifiquement aux agents vocaux
• Détection automatique de la langue avec changement de langue en cours d’enregistrement en une seule passe, sur 12 formats audio et fréquences d’échantillonnage de 8 kHz à 48 kHz
• Limites de service de 10 requêtes par seconde en REST comme en streaming, et 100 sessions de streaming simultanées par équipe, hébergées dans us-east-1
La seule note de production qui ne figure pas sur la liste des fonctionnalités : le service fonctionne dans une seule région. Si votre audio provient de l'extérieur des États-Unis, le segment réseau fait désormais partie de votre budget de latence, et AA-WER Streaming intègre explicitement le délai réseau dans sa mesure de temps. SpaceXAI propose des conditions de rétention nulle des données et cite SOC 2 Type II, les BAA et des options de résidence des données dans l'UE, si bien que le volet conformité est plus développé que le volet géographique.

Qui doit bouger, et ce qu’il faut surveiller
Si vous utilisez déjà Grok Voice Transcribe 1.0 et que votre application agit sur des transcriptions partielles — détection de tour de parole, interruption (barge-in), réponses d'agent en direct —, l'écart de précision des transcriptions partielles, de 18,3 % à 3,4 %, est suffisamment important pour que tester la version 2.0 ne soit pas facultatif. Le fait que ce chiffre passe de « généralement faux » à « généralement correct » fait la différence entre une transcription partielle sur laquelle vous pouvez baser un routage et une que vous pouvez seulement afficher. Si votre application attend les transcriptions finales de fichiers enregistrés, l'amélioration est réelle mais moindre, et les 0,12 seconde de latence de commit supplémentaires en sont le prix.
Si vous êtes chez un tout autre fournisseur, la raison d’examiner cette version n’est pas le rang au classement — c’est qu’un laboratoire de pointe vient d’améliorer nettement son modèle de transcription sans augmenter le prix, ce à quoi ressemble un marché quand l’exactitude cesse d’être ce que l’on facture. Le chemin de mise à niveau est aussi le moins coûteux qui soit : un paramètre, aucune modification de code, aucun nouveau contrat, et une version épinglée disponible en cas de problème.
Le prochain point à surveiller est le basculement du modèle par défaut. Lorsque SpaceXAI fera de 2.0 le modèle par défaut et commencera à déprécier 1.0, toutes les intégrations qui n’ont jamais transmis de paramètre de modèle basculeront d’un coup vers le nouveau modèle, y compris le changement de latence. Les équipes qui dépendent de l’ancien timing partiel de 0,25 seconde devraient épingler la version dès maintenant plutôt que de découvrir le changement en production. Le deuxième point à surveiller est la reproduction indépendante : l’entrée d’Artificial Analysis est une mesure réelle, mais il s’agit d’un seul tableau sur un seul mixage audio, et aucun tiers n’a encore publié de test comparable 1.0 contre 2.0 sur de l’audio de production.
