Une carte de titre principale affichant « GPT-Live-1 vs Grok Voice Think Fast 2.0 », avec le sous-titre « Deux API vocales qui évoluent dans des directions tarifaires opposées » et la ligne « 0,05 $ par minute contre 0,08 $ par minute », au-dessus de deux panneaux : à gauche, une étiquette de prix avec une flèche vers le bas portant la mention « 0,05 $ » ; à droite, une étiquette de prix avec une flèche vers le haut portant la mention « 0,08 $ » et la légende « +60 % », chacun avec une bande de forme d’onde audio en duplex intégral, et le logo OrcaRouter incrusté dans le coin.
Guides & Insights

GPT-Live-1 vs Grok Voice Think Fast 2.0 : Deux API vocales évoluant dans des directions tarifaires opposées

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le fait le plus utile au sujet de cette confrontation est une direction, pas un nombre. Lorsque x​AI a publié Gr​ok Voice Think Fast 2.0 fin juillet 2026, il a augmenté de 60 % le tarif audio à la minute, le faisant passer des 0,05 $ facturés par Think Fast 1.0 à 0,08 $. Six semaines plus tard, le 10 septembre 2026, Ope​nAI a intégré GPT-Live-1 à l’API pour développeurs exactement au prix que x​AI venait d’abandonner. Cela donne la rare situation où les deux principales API vocales full-duplex peuvent être comparées directement sur le prix, et où le nouvel entrant est le moins cher — tandis que le modèle plus ancien et plus cher est celui qui dispose de scores de benchmarks tiers à son actif.

Le registre, avant tout benchmark

Tous deux sont des modèles parole-à-parole conçus pour des charges de travail de type téléphonique : une conversation en direct avec un client, une interruption, un appel d’outil et une facture mesurée en minutes. Au-delà, ils divergent rapidement.

• Prix par minute d'audio — GPT-Live-1 0,05 $ vs Gr​ok Voice Think Fast 2.0 0,08 $

• Unité de facturation — GPT-Live-1 facture à la seconde, sans arrondir à la minute entière supérieure ; Gr​ok Voice Think Fast 2.0 est facturé à la minute d’audio, ce qui revient à environ 4,80 $ de l’heure

• Sortie — GPT-Live-1 a été déployé dans ChatGPT le 8 juillet 2026 et est arrivé sur l’API le 10 septembre 2026 ; Gr​ok Voice Think Fast 2.0 a été annoncé autour du 29–30 juillet 2026, environ trois mois après Think Fast 1.0

• Points de terminaison — GPT-Live-1 correspond uniquement aux Live Sessions, à l'adresse v1/live/sessions, via WebRTC ; Grok Voice Think Fast 2.0 s'exécute sur l'API Speech-to-Speech de xAI, à la fois via WebSocket et WebRTC

• Surface d'outils — GPT-Live-1 délègue à un modèle de raisonnement backend via l'API Responses ; Grok Voice Think Fast 2.0 a accès, au sein de la session, à la recherche web, la recherche X, la recherche de fichiers, des serveurs MCP et des fonctions côté client

• Portabilité vocale — GPT-Live-1 utilise l’ensemble remasterisé de douze voix d’Ope​nAI ; Gr​ok Voice Think Fast 2.0 prend en charge les voix intégrées et personnalisées.

La ligne WebSocket est plus petite qu'elle n'en a l'air et compte plus qu'elle ne le devrait. Une grande part de l'infrastructure de téléphonie — la plomberie de flux médias au sein de la plupart des produits CPaaS — parle WebSocket, pas WebRTC. Gr​ok Voice Think Fast 2.0 rencontre cette infrastructure là où elle se trouve ; GPT-Live-1 ne le fait pas, et passer à WebRTC depuis un chemin d'appel uniquement WebSocket relève d'un véritable travail d'ingénierie plutôt que d'un simple indicateur de configuration.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Grok Voice Think Fast 2.0 - the scoreboard'. The GPT-Live-1 column lists Price $0.05 / minute; Price direction new entrant at $0.05; Transport WebRTC only; Quality evidence vendor-run, unreproduced; Tool calling delegated to backend model; Model ID single fixed ID. The Grok Voice Think Fast 2.0 column lists Price $0.08 / minute; Price direction raised 60% from $0.05; Transport WebSocket + WebRTC; Quality evidence 82.9 third-party speech index; Tool calling in-session search, MCP, functions; Model ID versioned ID plus floating alias. A footer reads 'Grok quality figure is a third-party index; GPT-Live-1 benchmarks are OpenAI's own and unreproduced.'

L'asymétrie des benchmarks est le vrai sujet

C'est ici que la comparaison cesse d'être un match nul, et que la plupart des analyses prennent le problème à l'envers en traitant les deux séries de chiffres comme le même type de preuve.

Les scores phares de Gr​ok Voice Think Fast 2.0 proviennent du Speech-to-Speech Quality Index d’Artificial Analysis, une mesure tierce qui situe le modèle à 82,9 %, en hausse par rapport à 75,7 % dans la version 1.0, devant GPT-Realtime-2.1 à 79,1 % et Gemini 3.1 Flash à 69,5 %. x​AI annonce également la première place sur le τ-voice Bench pour le comportement agentique, avec 56,5 %, devant GPT-Realtime-2.1 à 45,7 %. Il s’agit de mesures réalisées en externe sur le modèle de x​AI.

Les scores phares de GPT-Live-1 sont ceux d'Ope​nAI lui-même. L'entreprise annonce une interactivité full-duplex de 80,1 % contre 45,4 % pour GPT-Realtime-2.1, une latence d'alternance de parole réduite de 1,4 seconde à 0,8, et une précision d'appel d'outils passée de 60 % à 87 %. Chacun de ces chiffres est déclaré par le fournisseur, n'a pas été reproduit par un laboratoire indépendant, et compare le nouveau modèle d'Ope​nAI à son propre modèle précédent plutôt qu'à celui d'un concurrent.

Ce n'est pas une raison pour rejeter les chiffres — la direction prise est cohérente avec ce que rapportent les premiers déployeurs — mais cela signifie bien que la seule comparaison entre fournisseurs actuellement disponible favorise le modèle de x​AI dans des tests menés indépendamment, tandis que le seul chiffre disponible pour l'avantage de latence d'Ope​nAI est celui d'Ope​nAI. Ne considérez pas 0,8 seconde et 0,70 seconde comme une véritable compétition ; un seul de ces deux chiffres a été mesuré par quelqu'un qui n'a aucun intérêt dans le résultat.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Le piège de l’alias, et pourquoi la hausse des prix a pris les gens au dépourvu

L'augmentation de 60 % aurait été une erreur d'arrondi dans la plupart des notes de version si xAI ne l'avait pas aussi répercutée via un alias. Les applications pointant vers l'alias grok-voice-latest ont hérité automatiquement, le 5 août 2026, à la fois du nouveau modèle et du tarif plus élevé, à moins qu'elles n'aient explicitement épinglé grok-voice-think-fast-1.0. C'est une décision de conception qui mérite d'être comprise plutôt qu'une critique : les alias flottants vous offrent des mises à niveau gratuites et modifient aussi votre économie unitaire sans vous demander votre avis.

Le remède évident est plus faible qu’il n’y paraît. Gr​ok Voice Think Fast 1.0 — le modèle à 0,05 $ par minute, sorti le 23 avril 2026 — est désormais marqué comme obsolète sur la propre liste de modèles de x​AI. L’épingler vous protège de la mise à niveau automatique, et cela vous fait gagner du temps plutôt que d’offrir une voie moins chère permanente, car un modèle obsolète a une date de retrait quelque part devant lui. Planifiez la migration selon votre propre calendrier plutôt que selon celui de l’alias.

La page de tarification elle-même mérite d’être lue attentivement avant de vous engager sur un chiffre. La page des modèles de x​AI répertorie explicitement les tarifs versionnés — grok-voice-think-fast-2.0 à 0,08 $ par minute d’audio, 4,80 $ l’heure, plus 0,004 $ par entrée de texte — tandis que la carte Voice API distincte sur la même page annonce un prix d’agent « à partir de 0,05 $ la minute », qui est le point d’entrée plutôt que le tarif auquel le modèle 2.0 facture. Si votre planification des capacités a été faite à partir du chiffre marketing, elle est inférieure d’environ 60 %.

Le modèle d’OpenAI n’a pas ce problème sous la même forme, car il n’y a rien vers quoi flotter. GPT-Live-1 n’a exactement qu’un seul ID de modèle, gpt-live-1, qui est aussi son propre snapshot par défaut — il n’y a pas de variantes datées à épingler, et donc pas d’alias qui puisse changer silencieusement le modèle ou le prix. Le compromis, c’est que vous ne pouvez pas non plus figer un comportement éprouvé et le conserver pendant qu’une nouveauté se met en place.

Les deux modèles facturent la couche de raisonnement séparément de la couche vocale, et c'est ici que le tarif affiché cesse de représenter l'intégralité du coût. Les appels Responses délégués de GPT-Live-1 sont facturés aux tarifs par token normaux du modèle backend configuré. xAI ajoute 0,004 $ par entrée de texte sur la session vocale, plus les appels d'outils, un numéro de téléphone provisionné à environ 0,01 $ la minute là où vous en avez besoin, la téléphonie et le stockage, en sus du tarif audio à la minute. Un agent vocal qui écoute surtout et effectue occasionnellement une recherche restera proche de son tarif affiché ; un agent qui sollicite des outils à chaque tour n'en fera pas autant, et les deux ne divergeront pas dans la même direction, car la conception à backend délégué et la conception à outils en session consomment des tokens à des endroits différents.

De notre côté, si les changements de tarif à la minute méritent d'être suivis de près, c'est parce qu'OrcaRouter répercute le prix catalogue du fournisseur sans aucune marge. Lorsqu'un fournisseur modifie un tarif publié, le chiffre de notre côté évolue le jour même, et non au cycle contractuel suivant.

A screenshot of xAI's developer Models documentation page, showing a Voice API card with an agent price of 'Starting at $0.05 / min' alongside Text to Speech at $15.00 / 1M chars and Speech to Text at $0.10 / hour batch and $0.20 / hour streaming, plus a Grok 4.6 card listing a 500k-token context with $2.00 / 1M input and $6.00 / 1M output tokens, and an Imagine API card for image and video generation.

Ce que le fractionnement de la délégation vous coûte en ingénierie

Si vous choisissez entre ces deux-là sur l’architecture plutôt que sur le prix, la question décisive est de savoir où se situe la couture.

Le modèle de x​AI garde les outils à l’intérieur de la session. C’est plus simple à appréhender — une seule connexion, une seule conversation, un seul endroit où un appel de fonction se produit — et cela signifie que le modèle peut décider en pleine phrase qu’il doit effectuer une recherche et continuer à parler pendant qu’il attend.

Le modèle d'OpenAI externalise ce travail. La couche vocale maintient la conversation active et transmet la tâche à un modèle de raisonnement distinct via l'API Responses, ce qui signifie que vos définitions d'outils, votre récupération et votre logique métier résident dans une intégration classique de modèle textuel plutôt que dans un flux d'événements de session. Cela implique plus de pièces mobiles, et c'est aussi plus portable : la moitié déléguée est un appel API ordinaire que vous pouvez remplacer, tarifer et basculer en cas de défaillance indépendamment de la couche vocale.

Cela compte pour exactement une raison. Ni GPT-Live-1 ni Gr​ok Voice Think Fast 2.0 ne sont servis par personne d'autre que leur propre fournisseur — tous deux sont à source unique, et un routeur ne peut pas vous aider pour la partie audio. Ce qu'un routeur peut faire, c'est consolider la partie que vous pouvez réellement choisir. GPT-5.6 Terra, le backend dans l'exemple de délégation d'Ope​nAI lui-même, est disponible via OrcaRouter à 2,00 $ par million de jetons d'entrée et 12,00 $ par million de jetons de sortie avec à la fois /v1/chat/completions et /v1/responses exposés, aux côtés de environ 190 autres modèles sur une seule clé. Si votre agent vocal appelle un modèle de raisonnement à chaque tour, c'est le poste de dépense qui comporte un levier de routage.

Le verdict, réparti par charge de travail

• Choisissez GPT-Live-1 si le prix à la minute est la contrainte, si votre chemin d’appel parle déjà WebRTC, ou si vous voulez que le cerveau de raisonnement derrière la voix soit un modèle texte interchangeable plutôt qu’une partie fixe de la session.

• Choisissez Gr​ok Voice Think Fast 2.0 si vous avez besoin d’une qualité vérifiée de manière indépendante à votre disposition avant de vous engager, si votre pile téléphonique est native WebSocket, ou si les outils en session — en particulier la recherche X — sont au cœur du produit plutôt qu’accessoires.

• Surveillez l'alias si vous êtes déjà sur x​AI. Épingler un ID de modèle versionné est la seule chose qui vous sépare de la prochaine modification automatique de tarif, et la même discipline mérite d'être appliquée partout où un alias flottant apparaît.

Le résumé inconfortable, c’est que le modèle le moins cher est celui qui n’a pas de preuve tierce derrière lui, et que le modèle le mieux documenté est celui dont le prix vient d’augmenter de 60 %. Si vous êtes assez tôt dans le développement pour qu’aucune des deux intégrations ne soit figée, la décision la moins risquée est de prototyper avec les deux — le chemin audio représente quelques centaines de lignes dans un cas comme dans l’autre — et de laisser la qualité de vos propres transcriptions trancher, car les preuves publiques ne permettent actuellement pas de le faire.