
Grok Voice Think Fast 2.0 : l'agent vocal le plus rapide et le plus cher de xAI, expliqué
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 par million de tokens · 56 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 201 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOUVEAUAnthropic: Claude Opus 52026-07-2461Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1651Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1557Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligence77Code
- grokxAI: Grok 4.52026-07-0854Intelligence72Code
- tencentTencent: Hy32026-07-0641Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1651Intelligence69Code60Maths
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligence61Code61Maths
xAI a lancé Grok Voice Think Fast 2.0 le 29 juillet 2026 — « le modèle vocal de parole à parole le plus performant », selon ses propres termes, et le nouveau fleuron de sa gamme d'agents vocaux. Il répond plus vite que n'importe quel concurrent du top 5 (0,70 s jusqu'au premier audio), arrive en tête du benchmark vocal agentique et transcrit plus précisément que la génération précédente. Il est également 60 % plus cher par minute que le modèle qu'il remplace, est assorti d'un compteur à la minute qui gonfle discrètement votre facture, et inclut un basculement d'alias de version qui se produit automatiquement dans une semaine. Ce guide explique ce qu'est réellement Think Fast 2.0, ce que xAI a modifié sous le capot, comment les résultats du benchmark se répartissent entre scores indépendants et affirmations rapportées par le fournisseur, ce qu'il coûte vraiment une fois les calculs faits, et comment l'invoquer — ainsi que les mises en garde qu'il serait prudent de lire avant d'y router un flux d'appels de production.
Note de précision : les détails du lancement, la tarification et l'exactitude des titres ainsi que les affirmations commerciales proviennent de l'annonce et de la documentation de xAI (2026-07-29). Les scores composites d'Artificial Analysis sont des mesures indépendantes réalisées par des tiers. Les affirmations rapportées par xAI — les résultats A/B Starlink, les multiplicateurs de transcription, les « 60 % de jetons de raisonnement en moins » et la formulation « près de 5 fois plus rapide » — ne s'appuient pas sur des données sous-jacentes publiées ; traitez-les comme des chiffres indicatifs du fournisseur et menez vos propres évaluations. Les spécifications, les prix et le comportement des alias peuvent changer ; vérifiez avant de construire.
TL;DR. Grok Voice Think Fast 2.0 est le modèle de bout en bout de xAI pour les agents vocaux : audio en entrée, audio en sortie via un WebSocket, sans pipeline séparé ASR→LLM→TTS. Il est vraiment rapide (0,70 s pour le premier audio, le seul modèle du top cinq sous la seconde) et vraiment performant pour les travaux d'agents vocaux, se classant premier sur le benchmark τ-Voice d'Artificial Analysis (56,5 %), tout en étant deuxième au classement général de l'indice de qualité parole-à-parole (82,9 %), derrière Qwen Audio 3.0 Realtime Plus (84,1 %). Il réfléchit tout en parlant — réduisant l'utilisation médiane de jetons de raisonnement à environ 40 % de celle de l'ancien modèle — et coûte 0,08 $ par minute, contre 0,05 $ auparavant. Le hic, c'est le compteur : la voix est facturée à la minute d'audio en temps réel, donc une hausse de prix de 60 % sur un modèle moins coûteux à servir se répercute directement sur votre facture. Et le 5 août, l'alias grok-voice-latest commencera à router automatiquement vers la version 2.0, donc les équipes sur l'ancienne version doivent la figer délibérément avant cette date.
Points clés
• Reconnaissance vocale native : un seul modèle du micro au haut-parleur, sans chaîne ASR→LLM→TTS — c'est pourquoi le premier audio arrive en 0,70 s.
• Leader agentique : n°1 au benchmark agent τ-Voice d'Artificial Analysis (56,5 %), bien devant GPT-Realtime-2.1 (45,7 %) et Gemini 3.1 Flash (37,7 %).
• Pas le leader global : n°2 sur l’indice de qualité parole-à-parole (82,9 %), derrière Qwen Audio 3.0 Realtime Plus (84,1 %) ; OpenAI remporte toujours la dynamique conversationnelle (95,7 % contre 95,1 %).
• 60 % plus cher : $0.08/min (~$4.80/heure) contre $0.05/min pour Think Fast 1.0 — bien que le modèle utilise prétendument ~60 % de jetons de raisonnement en moins.
• Changement d'alias le 5 août : grok-voice-latest pointe automatiquement vers 2.0 ; épinglez grok-voice-think-fast-1.0 avant cette date pour rester sur la version la moins chère.
• Étiquetez chaque affirmation : les scores Artificial Analysis sont indépendants ; les tests A/B Starlink, les multiplicateurs de transcription et le cadrage de la vitesse sont rapportés par xAI et non publiés.
Ce qu'est Grok Voice Think Fast 2.0
Grok Voice est la famille de modèles temps réel, de parole à parole, de xAI. « Think Fast » est la gamme à réponse rapide, lancée à l'origine avec Voice Agent Builder en avril 2026 ; Think Fast 2.0 est la deuxième génération de cette gamme, publiée le 29 juillet 2026. Le modèle est de bout en bout : il consomme l'audio brut, raisonne et émet directement de l'audio, plutôt que d'exécuter un pipeline composé d'un modèle de reconnaissance vocale alimentant un LLM de texte alimentant un modèle de synthèse vocale. Ce choix d'architecture est à l'origine de son avantage en matière de latence — il n'y a pas d'étapes en série ni de texte intermédiaire, de sorte que le modèle peut commencer une réponse tout en continuant à écouter.
xAI la positionne explicitement pour les agents vocaux d’IA : lignes de support client, vente par téléphone, accueil, téléphonie, et autres applications où un système parle à une personne en temps réel et doit réellement accomplir des tâches — planifier un appel, qualifier un prospect, mettre à jour un enregistrement, rechercher sur le web — plutôt que de simplement discuter. L’accent mis sur les agents, et non sur la transcription ou la synthèse brute, est le champ de bataille visé par ce lancement.
Quoi de neuf par rapport à Think Fast 1.0
La mise à niveau depuis la 1.0 est plus qu'un simple changement de numéro ; xAI décrit trois changements structurels :
• Raisonnement parallèle à la parole. Le modèle raisonne sur une requête tout en parlant, plutôt que de réfléchir d'abord puis de parler ensuite. Concrètement, les appels d'outils peuvent être déclenchés avant que l'agent ait fini sa première phrase — un point crucial pour les flux vocaux sensibles à la latence.
• Beaucoup moins de jetons de raisonnement. xAI indique que l'utilisation médiane de jetons de raisonnement a chuté à environ 0,4 fois celle de son prédécesseur (soit environ 60 % de moins), ce qui explique en partie pourquoi elle affirme que le modèle est moins coûteux à servir, même si le prix a augmenté.
• Style de conversation appris par renforcement. Le RL a remodelé sa façon de parler : phrases plus courtes, une question à la fois, pas de remplissage — un style d'appel plus sec, plus « humain », adapté au travail téléphonique où divaguer brûle des minutes (et, avec un compteur à la minute, de l'argent).
En termes de vitesse mesurable, le délai jusqu'au premier audio est passé de 1,25 s dans la version 1.0 à 0,70 s dans la version 2.0. Côté transcription, xAI rapporte une amélioration d'environ 1,4x sur 24 langues (chiffres fournisseur, ci-dessous).

Les benchmarks, benchmark par benchmark
Le lancement s’appuie sur Artificial Analysis, un organisme de référencement indépendant. C’est un point important : contrairement à la plupart des autres chiffres de l’annonce, ceux-ci sont mesurés par un tiers neutre, et ce sont ceux qu’il vaut la peine de comparer à l’identique. Le tableau d’ensemble est plus parlant qu’un seul chiffre en titre.
Indice de qualité de la parole à la parole : 82.9% (deuxième place). Il s'agit du score composite global de la parole à la parole, en hausse par rapport à 75.7% pour Think Fast 1.0. Il bat GPT-Realtime-2.1 (79.1%) et Gemini 3.1 Flash (69.5%) — mais il n'est pas premier. Qwen Audio 3.0 Realtime Plus mène avec 84.1%. Donc, « le meilleur modèle vocal global » est une exagération que les données ne soutiennent pas ; « le modèle vocal agentique le plus rapide de la catégorie supérieure » est exact.
Benchmark d'agent τ-Voice : 56,5 % (première place). C'est la métrique qui compte le plus pour xAI, et le classement est réel : 56,5 % bat Think Fast 1.0 (52,1 %), GPT-Realtime-2.1 (45,7 %) et Gemini 3.1 Flash (37,7 %). τ-Voice mesure la performance vocale agentique — dans quelle mesure un modèle accomplit des tâches via un canal vocal, y compris l'utilisation d'outils en cours de conversation. Sur l'axe étroit « peut-il faire le travail ? », Grok est en tête. Musk a mis en avant exactement ce classement.
Big Bench Audio : 97,2 %. Un benchmark de raisonnement vocal ; solide, bien que Qwen ait affiché un record de 99,2 %.
Full Duplex Bench : 95,1 %. Dynamique conversationnelle — gestion des interruptions, prise de parole, barge-in. C'est un grand bond par rapport aux 77,8 % de la version 1.0, mais OpenAI le devance encore avec 95,7 %, et Qwen mène avec 98,4 %.
Délai avant le premier audio : 0,70 s. Le chiffre le plus important pour les produits vocaux réels. Il est en baisse par rapport à 1,25 s et c'est la seule valeur inférieure à la seconde parmi les cinq modèles les mieux classés ; des tests indépendants confirment largement une réponse en moins d'une seconde. La latence du premier jeton en TTS streaming est d'environ 285 ms. Pour une utilisation téléphonique et en temps réel, la latence est la métrique que les utilisateurs ressentent à chaque tour de parole, et c'est là que 2.0 est nettement le meilleur.
En parcourant les lignes, le profil est précis : le plus rapide à parler, le meilleur pour accomplir les tâches, deuxième au classement général, troisième en finesse de conversation. C'est un excellent modèle d'agent vocal, et une revendication médiocre de « meilleure voix de chatbot ». Choisissez-le pour les tâches qui correspondent à la ligne supérieure.
Précision de la transcription
Au-delà de la conversation, xAI affirme une transcription nettement meilleure. Son évaluation interne portant sur 24 langues et des milliers de phrases montrerait environ 1,4 fois la précision de Think Fast 1.0, et 1,5 à 2 fois la précision de modèles de transcription spécialisés comme Deepgram Nova 3 et ElevenLabs Scribe v2. Dans des conditions réelles bruyantes — bruit de fond, compression téléphonique, appels à faible bande passante — l'écart de précision rapporté par rapport aux modèles STT spécialisés se creuse jusqu'à environ 10 fois.
Ce sont précisément les affirmations qu'il faut traiter avec prudence. Elles sont rapportées par xAI ; le harnais d'évaluation, les ensembles de phrases et les profils de bruit ne sont pas publiés. Un test indépendant de la transcription de conversations téléphoniques bruitées de 2.0 par rapport à Deepgram ou ElevenLabs serait précieux et, à l'heure où j'écris, n'a pas été publié. En tendance, les modèles de bout en bout qui absorbent davantage de téléphonie dans leur entraînement constituent une amélioration réelle plausible — mais le « 10x » doit être vérifié, pas répété comme un fait.
Tarification : $0.08 la minute et la question des 60 %.
Voici où le lancement devient controversé. Think Fast 2.0 coûte 0,08 $ par minute d’audio — soit environ 4,80 $ par heure — plus 0,004 $ par message texte d’entrée. Think Fast 1.0 coûtait 0,05 $ par minute (3,00 $/heure). Cela représente une augmentation de 60 %, et elle est arrivée le même mois où OpenAI a réduit les prix de GPT-5.6 Luna de 80 % et de Terra de 20 %, invoquant la même baisse des coûts de service que xAI revendique pour ce modèle.
Le compteur est toute l'histoire. Les modèles de texte facturent au jeton, donc lorsqu'un modèle devient plus efficace, la facture du client diminue automatiquement. Les modèles vocaux facturent à la minute d'audio en temps réel, et la durée d'une conversation est fixée par la personne qui parle, pas par le modèle. Les gains d'efficacité dans un produit facturé à la minute profitent au fournisseur, pas à l'acheteur. C'est pourquoi un modèle qui utilise apparemment ~60 % de jetons de raisonnement en moins — et qui est donc moins cher à servir pour xAI — coûte 60 % plus cher à louer.
Faites le calcul sur un flux d'appels réel. Un appel de 4 minutes à 1.0 coûte 0,20 $ ; le même appel sur 2.0 coûte 0,32 $. Dix mille appels de ce type par mois représentent 40 000 minutes : 2 000 $/mois sur 1.0 contre 3 200 $/mois sur 2.0 — une différence de 1 200 $/mois, soit environ 14 400 $/an, qui provient uniquement d'un changement de routage, et non du volume d'appels. Même un gain de vitesse généreux ne l'entame guère : réduire chaque appel de 10 secondes pleines économise environ 0,013 $, alors que la hausse de prix ajoute 0,12 $ — vous récupérez à peu près un neuvième de l'augmentation. Tout argument commercial qui présente 2.0 comme le modèle le moins cher a confondu « plus rapide » avec « moins cher ».
Pour contexte, la 2.0 est encore environ 2,2 fois moins chère que GPT-Realtime-2.1 High, à environ 10,75 $/heure. Elle n'est donc pas chère en termes absolus — elle est chère par rapport à son propre prédécesseur et à la direction que suivaient tous les autres fournisseurs de modèles ce mois-là.
Le piège de la migration du 5 août
Il y a une échéance à respecter. Le 5 août 2026, l'alias grok-voice-latest commencera automatiquement à router vers Think Fast 2.0. Si vous êtes en production sur Think Fast 1.0 via cet alias, « ne rien faire » vous fera passer — ainsi que votre facture — à la nouvelle version à cette date. Pour rester sur 1.0, vous devez explicitement épingler l'identifiant de modèle grok-voice-think-fast-1.0 avant le 5 août.
Les deux positions défendables exigent toutes deux une action avant l'échéance : soit verrouiller délibérément la version 1.0 parce que vos flux scriptés fonctionnaient bien à 3,00 $/heure, soit passer délibérément à la 2.0 et réviser les prévisions à 4,80 $/heure, en justifiant par la qualité plutôt que par les économies. Ce qui est indéfendable, c'est de découvrir le changement dans une facture de septembre. Une bonne règle : considérer tout alias se terminant par « latest » comme une instruction permanente d'accepter ce que le fournisseur livre ensuite — y compris son prix.
Comment y accéder et l'utiliser
Think Fast 2.0 est disponible via l'API Speech-to-Speech de xAI sous l'identifiant de modèle grok-voice-think-fast-2.0, avec grok-voice-latest comme alias évolutif. Il s'agit d'un modèle temps réel, full-duplex, sur WebSocket : wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, authentifié avec un en-tête Authorization: Bearer lors de la poignée de main. Pour les applications navigateur, générez des jetons éphémères côté serveur via le point de terminaison des sessions temps réel afin que la clé API parente n'atteigne jamais le client.
L'API est compatible avec OpenAI Realtime, donc le code vocal temps réel existant ne nécessite généralement que le changement d'URL de base et de clé. La configuration de session se fait via un événement session.update : choisissez une voix prédéfinie (eve, ara, rex, sal, leo), définissez le format audio d'entrée et de sortie (PCM16 à 24 kHz par défaut ; loi μ pour la téléphonie), activez la détection d'activité vocale côté serveur, et enregistrez des outils — y compris un outil de recherche web intégré — afin que l'agent puisse agir en cours de conversation. Le flux d'événements suit le schéma standard : le client ajoute des trames de buffer audio, le serveur diffuse les deltas audio de réponse, et les événements d'arguments d'appel d'outil se déclenchent lorsque le modèle décide d'agir, les résultats étant renvoyés comme sorties d'appels de fonction. Le modèle prend en charge plus de 25 langues et le clonage vocal personnalisé à partir d'environ une minute de parole.
Notez ce que ce n’est pas : il s’agit d’un modèle d’agent de parole à parole, et non d’un service général de transcription ou de traduction. Si la fonction principale de votre produit est de convertir l’audio en texte à moindre coût, un modèle STT dédié est un outil différent — et avec une facturation à la minute, vous payez pour l’intégralité de la conversation, donc les tâches de transcription seule deviennent rapidement coûteuses.

Comment cela s'intègre dans un stack d'agents vocaux
Think Fast 2.0 est un modèle vocal temps réel spécialisé accessible via l'API dédiée de xAI, et non un LLM généraliste hébergé par un routeur de modèles. Le canal vocal fonctionne directement sur le WebSocket de xAI — c'est là que se situe la latence inférieure à la seconde, et elle ne survit pas à un saut intermédiaire.
Tout le reste autour d'un produit vocal — la logique en langage naturel qui n'est pas critique en temps réel, le raisonnement de repli lorsqu'une conversation sort du script, la synthèse, l'analyse, le courriel de suivi que l'agent déclenche après un appel — est un travail de texte et multimodal à usage général. Pour cette partie, un point de terminaison indépendant du fournisseur comme OrcaRouter vous donne une API compatible OpenAI fonctionnant avec de nombreux LLM, afin que vous ne soyez pas verrouillé chez un seul fournisseur pour les parties de la pile qui n'ont pas besoin du canal vocal en temps réel. La séparation nette : l'API dédiée de xAI pour la voix en streaming elle-même, OrcaRouter (ou similaire) pour le raisonnement textuel et multimodal autour de celle-ci.
La compétition : vitesse agentique vs intelligence brute
Think Fast 2.0 débarque au milieu du marché le plus concurrentiel de l'IA en ce moment — les agents vocaux en temps réel — et le tableau de benchmarks rend les compromis inhabituellement visibles.
Qwen Audio 3.0 Realtime Plusest le leader en intelligence : 84,1 % sur l’indice de qualité parole-à-parole (première place), un record de 99,2 % sur Big Bench Audio, et 98,4 % en full duplex. Mais son temps moyen jusqu’à la première audio est d’environ 4,02 secondes — soit environ 5,7 fois plus lent que les 0,70 s de Grok. Pour les conversations en voiture, sur les objets connectés et au téléphone, cette différence n’est pas une question de « rapide ou lent », mais d’utilisable ou inutilisable. Qwen se divise également en un niveau Plus (qualité) et un niveau Flash (premier paquet en environ 300 ms) pour différents scénarios, ce qui est une réponse réfléchie à la même tension.
GPT-Realtime-2.1se situe au milieu sur la plupart des lignes (79,1 % de qualité, 45,7 % d’agentic) et remporte la palme sur la dynamique conversationnelle (95,7 %). Son niveau High coûte environ 2,2 fois le prix horaire de Grok. Pour les équipes déjà bien ancrées dans l’écosystème OpenAI, il reste le choix par défaut le plus simple.
Gemini 3.1 Flash est en retrait sur les composites de qualité et agentiques (69,5 %, 37,7 %), mais fait partie d'un stack vocal Gemini plus large et de l'écosystème Google que de nombreuses équipes préfèrent pour d'autres raisons.
En pratique : choisissez selon la charge de travail. Si votre agent vocal doit sembler instantané et doit exécuter de manière fiable des tâches adossées à des outils (support, qualification, réservation), Think Fast 2.0 est l'option la plus solide mesurée à ce jour. Si votre priorité est le raisonnement le plus approfondi et que vous pouvez absorber une latence de plusieurs secondes, Qwen Plus l'emporte. Si le raffinement conversationnel et l'adéquation à l'écosystème comptent le plus, GPT-Realtime-2.1 reste le champion en titre à battre.

Trois scénarios où cela s'applique
1. Support téléphonique et téléphonie
La combinaison qui compte le plus : un premier audio en moins d’une seconde, une transcription robuste sur téléphone bruyant (signalée par les fournisseurs) et une gestion des interruptions en full-duplex. Une ligne d’assistance où l’agent commence à parler presque immédiatement et peut retrouver des informations de compte en cours d’échange est exactement ce pour quoi 2.0 a été optimisé. Son style de parole RL, plus court, une question à la fois, convient également bien à la téléphonie, où les minutes sont l’unité facturable — au compteur de l’un ou l’autre fournisseur.
2. Qualification des leads et suivi post-appel
La voix agentique est là où la 2.0 est véritablement en première ligne, et la qualification des leads est la tâche canonique de la voix agentique : qualifier, router et déclencher le suivi pendant que l'intention est encore fraîche. Son appel d'outils peut se déclencher avant la fin de la première phrase, si bien qu'un agent peut créer un enregistrement CRM tout en continuant à parler au prospect. Prévoyez une attribution au niveau de la session et des permissions d'outils strictes — un agent vocal peut commettre une erreur en temps réel, et le nettoyage vous incombe.
3. Produits d'agents vocaux en développement actif
Pour les développeurs qui déploient leurs propres agents vocaux — les intégrations Tradecraft et GrokTerm que cite xAI sont exactement de cette nature — la rapidité de la 2.0 et son API compatible OpenAI en font un remplacement direct et sans friction pour le code GPT-Realtime. Épinglez la version, menez un pilote restreint avec une condition de succès claire (par exemple, « qualifier et router les visiteurs de la page de tarification »), et mesurez le coût par résultat accompli, et non le coût par minute.
Limitations et mises en garde
Think Fast 2.0 a cinq jours au moment où ceci est écrit, et cela se voit dans les réserves. Les résultats A/B de Starlink (meilleur taux de conversion et confinement du support) sont rapportés par xAI sans chiffres publiés ; les multiplicateurs de transcription et le cadrage « presque 5 fois plus rapide » sont également des affirmations du fournisseur, et non des benchmarks indépendants. L'unique article que vous verrez alléguant une « régression de performance et des rapports de test fabriqués » fait référence à cette même impossibilité de vérification — les chiffres publiés par xAI n'ont pas été reproduits de manière indépendante, et la communauté vocale sensible à la fiabilité se méfie à juste titre des métriques non publiées du fournisseur. Les benchmarks ne peuvent pas non plus mesurer votre pire appel : une réponse en 0,70 s ne vaut rien si l'agent achemine avec assurance un prospect vers la mauvaise équipe. La facturation vocale est à la minute, avec une augmentation de prix déjà intégrée, donc l'exposition aux coûts est réelle. Et comme pour tout modèle temps réel flambant neuf, attendez-vous à des changements d'API fréquents. Vérifiez les affirmations de précision sur votre propre audio, figez les versions en production, et mettez en place l'escalade et l'enregistrement avant le premier appel en direct.
FAQ
Qu'est-ce que Grok Voice Think Fast 2.0 ?
Le modèle phare de parole-à-parole de xAI pour agents vocaux, publié le 29 juillet 2026 : audio-à-audio natif de bout en bout via WebSocket, avec un délai de 0,70 s jusqu'au premier audio et la première place au benchmark agentique τ-Voice.
Combien coûte Grok Voice Think Fast 2.0 ?
0,08 $ par minute d'audio (environ 4,80 $/heure) plus 0,004 $ par message de texte saisi — une augmentation de 60 % par rapport aux 0,05 $/minute de Think Fast 1.0.
Est-ce que Think Fast 2.0 est le meilleur modèle vocal ?
C'est le plus rapide et le meilleur pour les tâches agentiques (56,5 % τ-Voice, première place) et deuxième au classement général sur l'indice de qualité parole-à-parole (82,9 %), derrière Qwen Audio 3.0 Realtime Plus (84,1 %). « Le meilleur » dépend de la charge de travail.
Qu'est-ce qui a changé depuis Think Fast 1.0 ?
Raisonnement vocal parallèle (il réfléchit tout en parlant), environ 60 % de jetons de raisonnement en moins, style de conversation plus court ajusté par RL, une amélioration de la transcription de 1,4x (rapportée par le fournisseur), et un délai avant le premier audio réduit de 1,25 s à 0,70 s.
Mon commutateur de trafic Think Fast 1.0 basculera-t-il automatiquement ?
Oui, le 5 août 2026, si vous utilisez l'alias grok-voice-latest. Épinglez grok-voice-think-fast-1.0 avant cette date pour rester sur la 1.0, ou adoptez délibérément la 2.0 et réévaluez le coût.
Comment puis-je appeler Grok Voice Think Fast 2.0 ?
Grâce à l'API Speech-to-Speech de xAI — un WebSocket en temps réel (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) compatible avec l'API Realtime d'OpenAI, avec des voix prédéfinies, la VAD côté serveur et l'appel d'outils.
Avec quels modèles vocaux est-il en concurrence ?
Qwen Audio 3.0 Realtime Plus (plus intelligent, nettement plus lent avec un premier audio à 4,02 s), GPT-Realtime-2.1 (meilleure dynamique conversationnelle, environ 2,2× plus cher au niveau High), et Gemini 3.1 Flash.
Les affirmations relatives aux benchmarks sont-elles fiables ?
Les scores Artificial Analysis sont indépendants et fiables. Les résultats A/B Starlink, les multiplicateurs de transcription et le cadrage de la vitesse sont rapportés par xAI sans données publiées — considérez-les comme indicatifs et vérifiez-les sur votre propre audio.
Est-ce que Grok Voice est bon pour la transcription ?
Il transcrit au sein d'une conversation, et xAI revendique des gains importants par rapport aux modèles STT dédiés en environnement bruyant — mais c'est facturé à la minute de conversation, donc les charges de travail de transcription dédiées sont mieux prises en charge par un modèle STT dédié.
En résumé
Grok Voice Think Fast 2.0 est le modèle vocal agentique le plus fort mesuré à ce jour, et le plus rapide du haut de gamme, et de loin — 0,70 s pour la première audio est une vraie victoire, indépendante et tournée vers l'utilisateur, et la première place sur τ-Voice est un véritable classement. Le résumé honnête est précis : c'est le meilleur outil de sa catégorie pour les agents vocaux en temps réel qui s'appuient sur des outils, mais pas le meilleur modèle vocal sur tous les plans — Qwen est en tête sur l'intelligence et OpenAI sur le raffinement conversationnel. Les controverses ne portent pas sur la vitesse. Elles portent sur le compteur : une augmentation de prix de 60 % sur un modèle qu'xAI affirme être moins coûteux à servir, une migration automatique d'alias avec une échéance stricte, et des affirmations à la une qui reposent sur des chiffres du fournisseur non publiés. Utilisez-le pour la vitesse agentique, figez votre version, étiquetez les affirmations du fournisseur et vérifiez l'exactitude sur vos propres appels — et conservez le texte à usage général et le raisonnement autour de votre produit vocal sur un endpoint neutre comme OrcaRouter.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
