
Yelp a placé GPT-Live-1 derrière un million d'appels vers des restaurants — et refuse de dire ce qu'il a acheté
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Yelp affirme avoir traité plus d'un million d'appels de restaurants via Yelp Host depuis octobre 2025, et qu'au 10 septembre 2026, ces appels fonctionnent sur GPT-Live-1, le modèle vocal full-duplex d'OpenAI. La même annonce intègre GPT-Live-1 à Hatch, la plateforme de communications IA de Yelp destinée aux entreprises de services, que la société présente comme gérant des dizaines de millions de prospects sur la voix, le texte, l'e-mail et le web. Il s'agit du plus important déploiement en production d'un modèle vocal full-duplex jamais annoncé — et il est arrivé enveloppé dans le communiqué de presse le moins chiffré que Yelp ait pu écrire. Yelp indique que le traitement des appels s'est amélioré et que les transferts d'appels ont diminué. Elle ne précise pas dans quelles proportions, sur combien d'appels, ni combien tout cela a coûté.
Les deux faits comptent. Le déploiement est une preuve concrète qu’un modèle qui écoute tout en parlant survit au contact du trafic téléphonique réel, ce qui dépasse ce que n’importe quel benchmark peut établir. Le silence est une preuve concrète que les propres chiffres du fournisseur n’étaient pas assez flatteurs pour être publiés — ou que les obligations de Yelp en matière de communication aux investisseurs sont plus étroites que son appétit marketing.
Ce que Yelp a réellement livré
L’architecture est la partie qui vaut la peine d’être comprise, car ce n’est pas un modèle vocal Yelp. GPT-Live-1 est la couche vocale frontale : c’est à elle que l’appelant parle, et c’est elle qui décide quand continuer à écouter, quand prendre la parole et quand céder la place. En dessous se trouvent les propres données métier de Yelp et ce que l’entreprise appelle une intelligence conçue sur mesure — les horaires du restaurant, ses disponibilités de réservation, son menu, ses plats du jour, ses espaces de salle, et l’état actuel du système de réservation.
Cette répartition, c'est tout le produit. GPT-Live-1 ne sait pas si une table pour quatre est disponible à 7 h 30 un vendredi. Il sait mener la conversation qui permet de le découvrir. Le rôle du modèle est de faire en sorte que l'échange ressemble à un appel téléphonique plutôt qu'à une arborescence de menus ; le rôle de Yelp est de faire en sorte que la réponse soit correcte.
Les affirmations comportementales formulées par Yelp sont précises sur la nature et vagues sur le degré. Les appelants peuvent interrompre, changer de sujet en pleine phrase ou parler alors qu’il y a du bruit de fond, et le modèle s’adapte. Le système détecte le ton de l’appelant — enthousiasme, frustration, impatience — et réagit en conséquence. Superposer les améliorations linguistiques de Yelp à GPT-Live-1 lui permet de détecter et de répondre aux appelants dans presque n’importe quelle langue, ce qui répond à un véritable problème pour les restaurants : un appel manqué parce que personne en poste ne parle la langue de l’appelant est une réservation perdue, pas une mauvaise expérience.
Les deux affirmations opérationnelles sont celles pour lesquelles un exploitant de restaurant paierait réellement. Yelp affirme que les appelants parlent désormais en phrases complètes et naturelles plutôt qu'en courtes commandes vocales, et que l'exactitude de la transcription après appel s'est améliorée, ce qui donne aux exploitants des comptes rendus plus propres. La première est un indicateur précurseur du fait que les gens ont cessé de traiter l'agent comme une machine que l'on contourne. La seconde est celle dont la valeur se cumule, car ce que produit une ligne de réservation n'est pas seulement une réservation — c'est un compte rendu, et un compte rendu que personne ne peut lire est un compte rendu que personne ne peut exploiter.

Akhil Kuduvalli Ramesh a dit la chose utile
Le directeur produit de Yelp a livré la déclaration d’usage — chaque appel plus conversationnel et plus réactif, des expériences clients exceptionnelles, le personnel libéré pour servir les clients au lieu de répondre au téléphone — puis une phrase qui vaut plus que tout le reste du communiqué. Yelp Host, a-t-il dit, capture « des opportunités de revenus qu’ils auraient autrement manquées ».
C’est là la présentation honnête des agents vocaux dans l’hôtellerie-restauration, et c’est une affirmation différente de l’argumentaire habituel de substitution de la main-d’œuvre. Un restaurant n’achète pas un hôte IA pour licencier un hôte d’accueil. Il en achète un parce que le téléphone sonne pendant le service, que personne ne peut répondre et que l’appelant réserve ailleurs. Le million d’appels que Yelp Host a traités depuis octobre 2025 constitue le dénominateur de cet argument — et Yelp s’est bien gardé de fournir le numérateur, à savoir combien de ces appels se sont transformés en réservations ou en commandes.
Teri Yu, responsable produit multimodal d'OpenAI, a présenté le même déploiement sous l'angle inverse, décrivant des clients qui utilisent GPT-Live-1 pour tout, des appels de réservation à la planification de réparations. Les deux lectures sont vraies. Yelp vend le vertical ; OpenAI vend l'horizontal.
L’économie que personne n’a mise dans le communiqué
GPT-Live-1 coûte 0,05 $ par minute de voix, facturé à la seconde, et le modèle a été ouvert aux développeurs le 10 septembre 2026 — le jour même où l'annonce de Yelp est tombée. La couche vocale est la seule chose que ce tarif couvre. La documentation d'OpenAI précise explicitement que les appels backend effectués pour le compte du modèle, y compris le raisonnement et l'utilisation d'outils qu'il délègue à un autre modèle, sont facturés aux tarifs normaux de ce modèle.
Comparez cela au chiffre de Yelp. Un appel de réservation de restaurant est court — quelques minutes, parfois moins. Un million d'appels de deux minutes chacun équivaut à environ deux millions de minutes vocales, soit environ 100 000 $ de dépenses pour la couche vocale sur toute l'histoire du produit. C'est une erreur d'arrondi pour Yelp, et c'est là tout l'enjeu : à 0,05 $ la minute, la couche vocale n'est pas la partie coûteuse du système. Les parties coûteuses sont le raisonnement derrière chaque tour de parole, la téléphonie, l'intégration dans le carnet de réservations de chaque restaurant, et les humains qui prennent en charge ce que l'agent ne peut pas faire.
Cela signifie aussi que le tarif à la minute est le mauvais chiffre sur lequel négocier. Un agent vocal qui répond en un seul tour parce qu’il a délégué correctement coûte moins cher qu’un agent qui patauge pendant quatre-vingt-dix secondes, même si les deux sont facturés à la seconde. L’affirmation de Yelp selon laquelle les transferts ont diminué est, derrière le flou, une affirmation sur les coûts.
Le raisonnement qui sous-tend la voix est un appel de modèle standard, et c'est cette couche qui rend un déploiement comme celui-ci réellement paramétrable. Environ 190 modèles de onze fournisseurs en amont se trouvent derrière une seule clé OrcaRouter au prix catalogue du fournisseur, sans marge, avec basculement automatique lorsqu'un backend renvoie une erreur ou dépasse le délai d'attente — le modèle qui effectue le raisonnement de réservation à la manière de Yelp peut donc être remplacé ou testé en A/B sur le trafic d'appels en direct en modifiant une seule valeur de configuration plutôt qu'en reconstruisant l'intégration. C'est là que se jouent à la fois l'argent et la qualité ; les minutes facturées de la couche vocale sont relativement fixes.

Les données sont la douve, pas le modèle
N'importe quel concurrent peut acheter GPT-Live-1 dès demain. Toast, Square, Clover, ServiceTitan et Housecall Pro s'adressent tous à des clients suffisamment proches, et Google et Alexa+ d'Amazon s'attaquent au même problème du côté des consommateurs. Rien dans la position de Yelp ne dépend d'un accès exclusif au modèle, et la formulation de Yelp elle-même — des données commerciales propriétaires plus une intelligence conçue sur mesure, avec GPT-Live-1 comme couche qui parle — l'admet.
Ce que Yelp possède, c'est le graphe des réservations : quels restaurants ont des tables, quand, pour combien de personnes, et l'intention consommateur accumulée derrière un million d'appels. Un modèle que l'on peut interrompre est un prérequis pour collecter ces données à grande échelle, car un agent en tour par tour produit des appels plus courts, plus de raccrochages et des transcriptions plus sales. C'est pourquoi le déploiement compte, même si les chiffres ne sont pas divulgués. Le full duplex n'est pas une expérience utilisateur plus agréable dans ce contexte ; c'est le mécanisme de collecte des données.

Que regarder
Trois choses feraient passer cette histoire d'un déploiement crédible à un déploiement mesurable. Le prochain appel de résultats de Yelp, si la direction met un chiffre sur la déflection des appels ou la conversion des réservations. Un deuxième secteur vertical annonçant la même intégration, ce qui montrerait si la voix full-duplex est une amélioration polyvalente ou propre au secteur de l'hôtellerie-restauration. Et la première évaluation indépendante de GPT-Live-1 sur un classement qui note le raisonnement plutôt que la mécanique conversationnelle — l'Artificial Analysis Speech to Speech Index le place actuellement à 70,3 %, à égalité avec GPT-Live-1 mini et à la sixième place ex æquo sur un classement de quatorze modèles, derrière Grok Voice Think Fast 2.0 High à 79,0 % et GPT-Realtime-2.1 High à 73,9 %. L'architecture de Yelp elle-même est un pari implicite : la couche vocale et la couche de raisonnement devraient être évaluées séparément. Jusqu'à présent, l'évaluation indépendante confirme la seconde moitié de ce pari, et non la première.
Tant que Yelp ne publie pas ce qui a changé, nous autres lisons une annonce de déploiement portant sur son architecture plutôt que sur ses résultats. Cela vaut encore la peine, car c’est l’architecture que les autres équipes peuvent copier ce trimestre.
