
GPT-Live-1 vs Grok Voice Think Fast 2.0 : Deux API vocales évoluant dans des directions tarifaires opposées
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Le fait le plus utile au sujet de cette confrontation est une direction, pas un nombre. Lorsque xAI a publié Grok Voice Think Fast 2.0 fin juillet 2026, il a augmenté de 60 % le tarif audio à la minute, le faisant passer des 0,05 $ facturés par Think Fast 1.0 à 0,08 $. Six semaines plus tard, le 10 septembre 2026, OpenAI a intégré GPT-Live-1 à l’API pour développeurs exactement au prix que xAI venait d’abandonner. Cela donne la rare situation où les deux principales API vocales full-duplex peuvent être comparées directement sur le prix, et où le nouvel entrant est le moins cher — tandis que le modèle plus ancien et plus cher est celui qui dispose de scores de benchmarks tiers à son actif.
Le registre, avant tout benchmark
Tous deux sont des modèles parole-à-parole conçus pour des charges de travail de type téléphonique : une conversation en direct avec un client, une interruption, un appel d’outil et une facture mesurée en minutes. Au-delà, ils divergent rapidement.
• Prix par minute d'audio — GPT-Live-1 0,05 $ vs Grok Voice Think Fast 2.0 0,08 $
• Unité de facturation — GPT-Live-1 facture à la seconde, sans arrondir à la minute entière supérieure ; Grok Voice Think Fast 2.0 est facturé à la minute d’audio, ce qui revient à environ 4,80 $ de l’heure
• Sortie — GPT-Live-1 a été déployé dans ChatGPT le 8 juillet 2026 et est arrivé sur l’API le 10 septembre 2026 ; Grok Voice Think Fast 2.0 a été annoncé autour du 29–30 juillet 2026, environ trois mois après Think Fast 1.0
• Points de terminaison — GPT-Live-1 correspond uniquement aux Live Sessions, à l'adresse v1/live/sessions, via WebRTC ; Grok Voice Think Fast 2.0 s'exécute sur l'API Speech-to-Speech de xAI, à la fois via WebSocket et WebRTC
• Surface d'outils — GPT-Live-1 délègue à un modèle de raisonnement backend via l'API Responses ; Grok Voice Think Fast 2.0 a accès, au sein de la session, à la recherche web, la recherche X, la recherche de fichiers, des serveurs MCP et des fonctions côté client
• Portabilité vocale — GPT-Live-1 utilise l’ensemble remasterisé de douze voix d’OpenAI ; Grok Voice Think Fast 2.0 prend en charge les voix intégrées et personnalisées.
La ligne WebSocket est plus petite qu'elle n'en a l'air et compte plus qu'elle ne le devrait. Une grande part de l'infrastructure de téléphonie — la plomberie de flux médias au sein de la plupart des produits CPaaS — parle WebSocket, pas WebRTC. Grok Voice Think Fast 2.0 rencontre cette infrastructure là où elle se trouve ; GPT-Live-1 ne le fait pas, et passer à WebRTC depuis un chemin d'appel uniquement WebSocket relève d'un véritable travail d'ingénierie plutôt que d'un simple indicateur de configuration.

L'asymétrie des benchmarks est le vrai sujet
C'est ici que la comparaison cesse d'être un match nul, et que la plupart des analyses prennent le problème à l'envers en traitant les deux séries de chiffres comme le même type de preuve.
Les scores phares de Grok Voice Think Fast 2.0 proviennent du Speech-to-Speech Quality Index d’Artificial Analysis, une mesure tierce qui situe le modèle à 82,9 %, en hausse par rapport à 75,7 % dans la version 1.0, devant GPT-Realtime-2.1 à 79,1 % et Gemini 3.1 Flash à 69,5 %. xAI annonce également la première place sur le τ-voice Bench pour le comportement agentique, avec 56,5 %, devant GPT-Realtime-2.1 à 45,7 %. Il s’agit de mesures réalisées en externe sur le modèle de xAI.
Les scores phares de GPT-Live-1 sont ceux d'OpenAI lui-même. L'entreprise annonce une interactivité full-duplex de 80,1 % contre 45,4 % pour GPT-Realtime-2.1, une latence d'alternance de parole réduite de 1,4 seconde à 0,8, et une précision d'appel d'outils passée de 60 % à 87 %. Chacun de ces chiffres est déclaré par le fournisseur, n'a pas été reproduit par un laboratoire indépendant, et compare le nouveau modèle d'OpenAI à son propre modèle précédent plutôt qu'à celui d'un concurrent.
Ce n'est pas une raison pour rejeter les chiffres — la direction prise est cohérente avec ce que rapportent les premiers déployeurs — mais cela signifie bien que la seule comparaison entre fournisseurs actuellement disponible favorise le modèle de xAI dans des tests menés indépendamment, tandis que le seul chiffre disponible pour l'avantage de latence d'OpenAI est celui d'OpenAI. Ne considérez pas 0,8 seconde et 0,70 seconde comme une véritable compétition ; un seul de ces deux chiffres a été mesuré par quelqu'un qui n'a aucun intérêt dans le résultat.

Le piège de l’alias, et pourquoi la hausse des prix a pris les gens au dépourvu
L'augmentation de 60 % aurait été une erreur d'arrondi dans la plupart des notes de version si xAI ne l'avait pas aussi répercutée via un alias. Les applications pointant vers l'alias grok-voice-latest ont hérité automatiquement, le 5 août 2026, à la fois du nouveau modèle et du tarif plus élevé, à moins qu'elles n'aient explicitement épinglé grok-voice-think-fast-1.0. C'est une décision de conception qui mérite d'être comprise plutôt qu'une critique : les alias flottants vous offrent des mises à niveau gratuites et modifient aussi votre économie unitaire sans vous demander votre avis.
Le remède évident est plus faible qu’il n’y paraît. Grok Voice Think Fast 1.0 — le modèle à 0,05 $ par minute, sorti le 23 avril 2026 — est désormais marqué comme obsolète sur la propre liste de modèles de xAI. L’épingler vous protège de la mise à niveau automatique, et cela vous fait gagner du temps plutôt que d’offrir une voie moins chère permanente, car un modèle obsolète a une date de retrait quelque part devant lui. Planifiez la migration selon votre propre calendrier plutôt que selon celui de l’alias.
La page de tarification elle-même mérite d’être lue attentivement avant de vous engager sur un chiffre. La page des modèles de xAI répertorie explicitement les tarifs versionnés — grok-voice-think-fast-2.0 à 0,08 $ par minute d’audio, 4,80 $ l’heure, plus 0,004 $ par entrée de texte — tandis que la carte Voice API distincte sur la même page annonce un prix d’agent « à partir de 0,05 $ la minute », qui est le point d’entrée plutôt que le tarif auquel le modèle 2.0 facture. Si votre planification des capacités a été faite à partir du chiffre marketing, elle est inférieure d’environ 60 %.
Le modèle d’OpenAI n’a pas ce problème sous la même forme, car il n’y a rien vers quoi flotter. GPT-Live-1 n’a exactement qu’un seul ID de modèle, gpt-live-1, qui est aussi son propre snapshot par défaut — il n’y a pas de variantes datées à épingler, et donc pas d’alias qui puisse changer silencieusement le modèle ou le prix. Le compromis, c’est que vous ne pouvez pas non plus figer un comportement éprouvé et le conserver pendant qu’une nouveauté se met en place.
Les deux modèles facturent la couche de raisonnement séparément de la couche vocale, et c'est ici que le tarif affiché cesse de représenter l'intégralité du coût. Les appels Responses délégués de GPT-Live-1 sont facturés aux tarifs par token normaux du modèle backend configuré. xAI ajoute 0,004 $ par entrée de texte sur la session vocale, plus les appels d'outils, un numéro de téléphone provisionné à environ 0,01 $ la minute là où vous en avez besoin, la téléphonie et le stockage, en sus du tarif audio à la minute. Un agent vocal qui écoute surtout et effectue occasionnellement une recherche restera proche de son tarif affiché ; un agent qui sollicite des outils à chaque tour n'en fera pas autant, et les deux ne divergeront pas dans la même direction, car la conception à backend délégué et la conception à outils en session consomment des tokens à des endroits différents.
De notre côté, si les changements de tarif à la minute méritent d'être suivis de près, c'est parce qu'OrcaRouter répercute le prix catalogue du fournisseur sans aucune marge. Lorsqu'un fournisseur modifie un tarif publié, le chiffre de notre côté évolue le jour même, et non au cycle contractuel suivant.

Ce que le fractionnement de la délégation vous coûte en ingénierie
Si vous choisissez entre ces deux-là sur l’architecture plutôt que sur le prix, la question décisive est de savoir où se situe la couture.
Le modèle de xAI garde les outils à l’intérieur de la session. C’est plus simple à appréhender — une seule connexion, une seule conversation, un seul endroit où un appel de fonction se produit — et cela signifie que le modèle peut décider en pleine phrase qu’il doit effectuer une recherche et continuer à parler pendant qu’il attend.
Le modèle d'OpenAI externalise ce travail. La couche vocale maintient la conversation active et transmet la tâche à un modèle de raisonnement distinct via l'API Responses, ce qui signifie que vos définitions d'outils, votre récupération et votre logique métier résident dans une intégration classique de modèle textuel plutôt que dans un flux d'événements de session. Cela implique plus de pièces mobiles, et c'est aussi plus portable : la moitié déléguée est un appel API ordinaire que vous pouvez remplacer, tarifer et basculer en cas de défaillance indépendamment de la couche vocale.
Cela compte pour exactement une raison. Ni GPT-Live-1 ni Grok Voice Think Fast 2.0 ne sont servis par personne d'autre que leur propre fournisseur — tous deux sont à source unique, et un routeur ne peut pas vous aider pour la partie audio. Ce qu'un routeur peut faire, c'est consolider la partie que vous pouvez réellement choisir. GPT-5.6 Terra, le backend dans l'exemple de délégation d'OpenAI lui-même, est disponible via OrcaRouter à 2,00 $ par million de jetons d'entrée et 12,00 $ par million de jetons de sortie avec à la fois /v1/chat/completions et /v1/responses exposés, aux côtés de environ 190 autres modèles sur une seule clé. Si votre agent vocal appelle un modèle de raisonnement à chaque tour, c'est le poste de dépense qui comporte un levier de routage.
Le verdict, réparti par charge de travail
• Choisissez GPT-Live-1 si le prix à la minute est la contrainte, si votre chemin d’appel parle déjà WebRTC, ou si vous voulez que le cerveau de raisonnement derrière la voix soit un modèle texte interchangeable plutôt qu’une partie fixe de la session.
• Choisissez Grok Voice Think Fast 2.0 si vous avez besoin d’une qualité vérifiée de manière indépendante à votre disposition avant de vous engager, si votre pile téléphonique est native WebSocket, ou si les outils en session — en particulier la recherche X — sont au cœur du produit plutôt qu’accessoires.
• Surveillez l'alias si vous êtes déjà sur xAI. Épingler un ID de modèle versionné est la seule chose qui vous sépare de la prochaine modification automatique de tarif, et la même discipline mérite d'être appliquée partout où un alias flottant apparaît.
Le résumé inconfortable, c’est que le modèle le moins cher est celui qui n’a pas de preuve tierce derrière lui, et que le modèle le mieux documenté est celui dont le prix vient d’augmenter de 60 %. Si vous êtes assez tôt dans le développement pour qu’aucune des deux intégrations ne soit figée, la décision la moins risquée est de prototyper avec les deux — le chemin audio représente quelques centaines de lignes dans un cas comme dans l’autre — et de laisser la qualité de vos propres transcriptions trancher, car les preuves publiques ne permettent actuellement pas de le faire.
