
Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe : la voie du streaming appartient à l'un des deux
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 et Gemini 3.5 Transcribe sont les deux modèles de reconnaissance vocale de pointe les plus récents issus de laboratoires rivaux, et la manière honnête de les comparer est d'admettre d'emblée qu'ils ne sont pas conçus pour le même usage. Le Grok Voice Transcribe 2.0 de SpaceXAI, sorti le 18 septembre 2026, est un modèle axé streaming avec un mode batch associé : il domine le classement AA-WER Streaming avec un taux d'erreur de mot de 2,7 % pour les transcriptions finales et de 3,4 % pour les premières transcriptions partielles, les deux arrivant 0,49 seconde après la fin de la parole. Gemini 3.5 Transcribe, sorti le 26 août 2026, est un modèle axé batch avec une déclinaison streaming associée, et ses deux volets se comportent très différemment — le chemin préenregistré affiche un AA-WER de 2,6 % sur le classement non-streaming d'Artificial Analysis, tandis que le point de terminaison distinct gemini-3.5-transcribe-live mesure 4,0 % sur le classement streaming à 0,40 seconde. Mettez ces quatre chiffres côte à côte et la physionomie de cette confrontation est évidente : ils sont proches en précision là où Gemini 3.5 Transcribe est fort, et ils ne sont pas proches là où Grok Voice Transcribe 2.0 l'est.
La seule voie dans laquelle ils se battent tous les deux
Les deux modèles peuvent transcrire de l’audio en direct, donc le streaming est le seul domaine où une comparaison directe a du sens. Là, Grok Voice Transcribe 2.0 devance Gemini 3.5 Transcribe Live de 1,3 point sur la précision de la transcription finale — 2,7 % contre 4,0 % de WER sur le même banc d’essai, les mêmes environ huit heures d’audio et la même pondération 50/25/25 entre AA-AgentTalk, VoxPopuli et Earnings22. Ce n’est pas une différence d’arrondi ; à ces taux d’erreur, cela correspond à environ un mot erroné supplémentaire sur soixante-quinze mots transcrits par le modèle de Google. Sur les premières transcriptions partielles, l’écart est encore plus large, 3,4 % contre 5,8 %, et les transcriptions partielles sont celles sur lesquelles un agent vocal en direct doit agir avant que le locuteur ait fini.
La latence joue en sens inverse, et c'est la partie de la comparaison qui passe inaperçue. Gemini 3.5 Transcribe Live renvoie sa transcription finale 0,40 seconde après la fin de la parole, contre 0,49 pour Grok, et sa première transcription partielle en 0,25 seconde, contre 0,49 pour Grok — soit environ deux fois plus rapide jusqu'au premier mot exploitable. Aucun des deux modèles ne joue dans la catégorie vraiment rapide de ce classement, où Deepgram Flux affiche 0,02 seconde et Soniox v5 0,05, mais entre ces deux-là, le compromis est explicite : Google parle plus vite, SpaceXAI a plus de chances d'avoir raison quand il parle. Pour un agent à gestion de tour de parole qui ne doit pas parler par-dessus un appelant, 0,24 seconde de latence partielle supplémentaire est un coût bien réel, que le gain de précision doit justifier.

Où Gemini 3.5 Transcribe l'emporte vraiment
La couverture linguistique est le critère le plus net, et l'écart n'est pas mince. Le modèle de Google gère plus de 85 langues ; Grok Voice Transcribe 2.0 en prend en charge des dizaines, avec un formatage sous forme écrite — la normalisation de texte inverse, qui transforme les nombres, les dates, les devises et les adresses e-mail prononcés en leur forme écrite — documenté pour 25 langues. Si votre audio est en portugais, en vietnamien, ou un mélange alternant deux langues au sein d'une même phrase, la question de savoir quel modèle est le plus précis sur le tableau d'Artificial Analysis relève largement de l'académique, car ce tableau est pondéré en faveur de l'anglais et saturé de conversations d'agents. Google rapporte un WER de 5,50 % en streaming et de 5,04 % hors streaming sur FLEURS pour sa propre suite multilingue, des chiffres rapportés par le fournisseur et non reproduits indépendamment, mais qui, au moins, décrivent le cas multilingue.
Le deuxième avantage est le niveau gratuit. Gemini 3.5 Transcribe inclut des jetons d’entrée et de sortie gratuits sur l’API de Google, avec la réserve que le contenu du niveau gratuit est utilisé pour améliorer les produits Google, tandis que celui du niveau payant ne l’est pas. Pour un prototype, un projet parallèle ou un outil interne traitant de l’audio que vous ne paieriez pas autrement pour transcrire, c’est une option réelle qu’aucun fournisseur facturant à l’heure ne peut égaler. Grok Voice Transcribe 2.0 est payant dès la première heure d’audio.
Et le troisième point est que Gemini 3.5 Transcribe est un modèle multimodal général avec un mode de transcription, et non un service ASR spécialisé. Il peut recevoir des prompts, il peut prendre du texte comme contexte, et il fait partie de la même API que tout ce que Google propose. Si la transcription est une étape dans un pipeline qui nécessite également un raisonnement sur la transcription, garder les deux dans un seul appel de modèle a une valeur que le taux d'erreur par mot ne capture pas.
Le calcul du prix, par millier de minutes
Artificial Analysis normalise les deux modèles en coût pour 1 000 minutes d’audio, ce qui est la seule façon de comparer un tarif horaire forfaitaire à une facturation par token :
• Par lots, préenregistré — Grok Voice Transcribe 2.0 à 1,67 $ par 1 000 minutes (0,10 $/heure) contre Gemini 3.5 Transcribe à 5,00 $ par 1 000 minutes (0,30 $/heure, à partir de 2,00 $ par 1 M de jetons en entrée et 12,00 $ par 1 M de jetons en sortie)
• Streaming — Grok Voice Transcribe 2.0 à 3,33 $ par 1 000 minutes (0,20 $/heure) contre Gemini 3.5 Transcribe Live à environ 5,40 $ par 1 000 minutes, calculé à partir de 3,50 $ par 1 M de tokens d'entrée audio et de 21,00 $ par 1 M de tokens de sortie texte
• Débit par lots — Grok Voice Transcribe 2.0 à environ 162× le temps réel contre Gemini 3.5 Transcribe à environ 88× sur la même carte, donc le modèle le moins cher est aussi le plus rapide pour le travail sur fichiers
• Plafond des sessions en direct — Grok Voice Transcribe 2.0 diffuse via WebSocket sans plafond de session publié au-delà de 100 sessions simultanées par équipe, contre Gemini 3.5 Transcribe Live plafonné à 10 minutes par session
Cette dernière ligne est le détail opérationnel qui détermine davantage d’architectures que ne le font les chiffres de précision. Un plafond de 10 minutes sur une session en direct signifie que les longs appels, les longues réunions et les longs flux doivent être découpés et rétablis, et chaque rétablissement est une couture où le contexte est perdu. Le point de terminaison de streaming de Grok comporte un plafond de taille de fichier de 500 Mo sur le chemin par lots et une limite de simultanéité de 100 sessions par équipe sur le chemin de streaming, ce qui constitue un autre type de contrainte — le débit plutôt que la durée.
La facturation au token mérite d'être comprise avant de vous engager du côté de Google, car elle fait de votre facture une fonction de deux variables au lieu d'une seule. Gemini facture séparément l'entrée audio et la sortie texte ; ainsi, un modèle qui produit une mise en forme verbeuse ou qui se répète coûte plus cher qu'un modèle qui ne le fait pas, et une langue dont les mots sont plus longs coûte plus cher qu'une langue dont les mots sont plus courts. Le tarif forfaitaire horaire de Grok ne varie en fonction d'aucun de ces éléments. Pour les charges de travail à fort volume, le forfait est plus facile à prévoir, et comme OrcaRouter répercute les prix catalogue des fournisseurs avec 0 % de marge, un changement de la part de l'un ou l'autre fournisseur se répercute sur votre facture le jour même où il survient, plutôt qu'au prochain renouvellement de contrat.

Formes des fonctionnalités : ce que chacune refuse de faire
Les listes de capacités divergent davantage que ne le suggèrent les chiffres de précision, et les écarts se situent à des endroits qui comptent pour des applications spécifiques :
• Diarisation des locuteurs — incluse sans frais supplémentaires sur Grok Voice Transcribe 2.0 ; non prise en charge sur Gemini 3.5 Transcribe Live, de sorte que les transcriptions en direct avec attribution des locuteurs ne sont pas disponibles du tout sur ce point de terminaison
• Horodatages au niveau du mot — Grok Voice Transcribe 2.0 les renvoie avec des scores de confiance par mot ; Gemini 3.5 Transcribe Live n’en renvoie aucun, ce qui exclut le seuillage par confiance et l’alignement précis des sous-titres
• Audio multicanaux — Grok Voice Transcribe 2.0 transcrit jusqu’à 8 canaux indépendants en une seule passe ; Gemini 3.5 Transcribe Live n’a pas d’équivalent, donc les enregistrements d’appels multicanaux nécessitent des sessions par canal
• Pondération des termes clés — Grok Voice Transcribe 2.0 accepte jusqu'à 100 termes de domaine par requête ; Gemini 3.5 Transcribe accepte un vocabulaire personnalisé et des indications de langue facultatives
• Plomberie des agents vocaux — Grok Voice Transcribe 2.0 intègre la suppression des mots parasites et la détection de fin de tour Smart Turn ; Gemini 3.5 Transcribe Live couvre le cas du streaming mais laisse la logique de tour à l'application
• Traitement des entrées — Grok Voice Transcribe 2.0 accepte le téléversement direct de fichiers jusqu'à 500 Mo dans 12 formats audio ; le parcours préenregistré de Gemini 3.5 Transcribe nécessite une URL HTTPS publique avec un plafond de 15 minutes et de 300 Mo, et ne peut pas combiner son mode de formatage Smart avec les horodatages de mots ni les étiquettes d'intervenants
Ce qui ressort de cette liste, c'est que SpaceXAI a construit un produit de transcription et que Google a construit une capacité de transcription. La diarisation, les horodatages, la séparation des canaux et la détection des tours de parole sont les fonctionnalités dont on a besoin lorsque la transcription constitue toute l'application ; la promptabilité, l'étendue linguistique et une API unique pour tout sont ce que l'on veut lorsque la transcription est une étape au sein d'une application plus vaste. Aucune des deux listes n'est meilleure dans l'abstrait, et une équipe qui ne choisit que sur l'exactitude finira par se retrouver sans l'ensemble dont elle n'avait pas besoin.

Choisir entre eux, et ce qui change la réponse
Optez pour Grok Voice Transcribe 2.0 lorsque la transcription doit être juste alors que l’audio est encore en cours de lecture : l’alternance de parole des agents en direct, le sous-titrage en temps réel qui n’a pas droit à l’erreur, les flux de centre de contact où l’attribution des locuteurs et la séparation des canaux font partie des exigences, ou tout pipeline par lots où 1,67 $ pour 1 000 minutes et un débit 162× comptent tous les deux. Optez pour Gemini 3.5 Transcribe lorsque l’audio est multilingue dans une langue qui ne fait pas partie de l’ensemble documenté de Grok, lorsque la transcription alimente un modèle qui doit aussi raisonner à son sujet, lorsque vous voulez une offre gratuite pour prototyper, ou lorsque le taux d’AA-WER de 2,6 % du traitement par lots suffit simplement pour ce que vous faites et que la couverture linguistique supplémentaire vaut plus que la différence de prix.
Ce que font réellement la plupart des équipes ici, ce n'est pas de choisir. Les deux modèles sont accessibles via une seule clé API OrcaRouter, aux côtés de plus de 200 autres modèles, ce qui signifie que vous pouvez router le trafic d'agents en direct vers Grok Voice Transcribe 2.0 et les longues archives multilingues vers Gemini 3.5 Transcribe sans avoir à gérer deux contrats fournisseurs, deux relations de facturation et deux jeux d'identifiants. C'est aussi ainsi que vous tranchez la question de la précision pour vos propres audios : faites tourner les deux sur les mêmes enregistrements, comparez les transcriptions que vous avez réellement obtenues, et laissez le DSL de routage envoyer le trafic là où il doit aller. Le classement vous dit quel modèle gagne sur huit heures de conversations d'agents anglophones appartenant à quelqu'un d'autre ; seul votre propre audio vous dit lequel gagne sur le vôtre.
La question ouverte est ce qu'il adviendra de cet écart de streaming la prochaine fois que Google révisera le point de terminaison Live. Gemini 3.5 Transcribe Live a été lancé en aperçu public et son chiffre de 4,0 % a été mesuré environ un jour après qu'il est devenu appelable — un signal précoce fort, mais qui a eu moins de temps pour se stabiliser que le chiffre de Grok derrière lequel il se trouve désormais. Si Google comble l'écart de streaming de 1,3 point tout en conservant la latence des résultats partiels de 0,25 seconde, le compromis cesse d'en être un et l'avantage de Grok se réduit au prix et aux fonctionnalités. D'ici là, la répartition est nette : les résultats partiels les plus rapides sont ceux de Google, les plus précis sont ceux de SpaceXAI, et aucun modèle du classement ne réunit les deux.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
