
Yelp puso GPT-Live-1 detrás de un millón de llamadas a restaurantes — y no dirá qué compró
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Yelp afirma que ha atendido más de un millón de llamadas de restaurantes a través de Yelp Host desde octubre de 2025, y que a partir del 10 de septiembre de 2026 esas llamadas funcionan con GPT-Live-1, el modelo de voz full-duplex de OpenAI. El mismo anuncio sitúa a GPT-Live-1 dentro de Hatch, la plataforma de comunicaciones con IA de Yelp para empresas de servicios, que la compañía describe como gestora de decenas de millones de leads a través de voz, texto, correo electrónico y web. Esa es la mayor implementación en producción de un modelo de voz full-duplex que se haya anunciado — y llegó envuelta en el comunicado de prensa menos cuantificado que Yelp podría haber escrito. Yelp informa de que la gestión de llamadas mejoró y que las transferencias de llamadas disminuyeron. No dice cuánto, en cuántas llamadas ni cuánto costó todo ello.
Ambos hechos importan. El despliegue es evidencia real de que un modelo que escucha mientras habla sobrevive al contacto con tráfico telefónico real, algo que ningún benchmark puede establecer. El silencio es evidencia real de que las cifras del propio proveedor no eran lo suficientemente favorecedoras para publicarlas — o de que las obligaciones de divulgación de Yelp ante los inversores son más limitadas que su apetito de marketing.
Lo que Yelp realmente lanzó
La arquitectura es la parte que vale la pena entender, porque no es un modelo de voz de Yelp. GPT-Live-1 es la capa de voz frontal: es aquello con lo que habla quien llama, y es lo que decide cuándo seguir escuchando, cuándo tomar el turno y cuándo ceder. Por debajo se encuentran los propios datos de negocio de Yelp y lo que la empresa llama inteligencia diseñada a propósito — el horario del restaurante, su disponibilidad de reservas, su menú, sus especiales, sus zonas de asientos y el estado actual del sistema de reservas.
Esa división es todo el producto. GPT-Live-1 no sabe si existe una mesa para cuatro a las 7:30 de un viernes. Sabe cómo entablar la conversación que lo averigua. El trabajo del modelo es hacer que el intercambio se sienta como una llamada telefónica en lugar de un árbol de menús; el trabajo de Yelp es hacer que la respuesta sea correcta.
Las afirmaciones de comportamiento declaradas por Yelp son específicas en tipo y vagas en grado. Las personas que llaman pueden interrumpir, cambiar de tema a mitad de frase o hablar por encima del ruido de fondo, y el modelo se adapta. El sistema detecta el tono de quien llama —entusiasmo, frustración, impaciencia— y responde en consecuencia. Superponer las mejoras lingüísticas de Yelp sobre GPT-Live-1 le permite detectar y responder a las personas que llaman en casi cualquier idioma, lo que aborda un problema real de los restaurantes: una llamada perdida porque nadie en el turno habla el idioma de quien llama es una reserva perdida, no una mala experiencia.
Las dos afirmaciones operativas son las que un operador de restaurante realmente pagaría por tener. Yelp afirma que quienes llaman ahora hablan con frases completas y naturales en lugar de comandos de voz cortos, y que la precisión de la transcripción posterior a la llamada ha mejorado, lo que da a los operadores registros más limpios. La primera es un indicador adelantado de que la gente dejó de tratar al agente como una máquina a la que hay que hablar con rodeos. La segunda es la que tiene un valor acumulativo, porque el resultado de una línea de reservas no es solo una reserva — es un registro, y un registro que nadie puede leer es un registro que nadie puede usar para actuar.

Akhil Kuduvalli Ramesh dijo la cosa útil
El director de producto de Yelp dio la cita habitual —cada llamada más conversacional y ágil, experiencias excepcionales para los clientes, personal liberado para atender a los clientes en lugar de contestar el teléfono— y luego una frase que vale más que el resto del comunicado. Yelp Host, dijo, captura “oportunidades de ingresos que de otro modo podrían haber dejado pasar”.
Ese es el planteamiento honesto para los agentes de voz en el sector de la hospitalidad, y es una afirmación distinta del habitual discurso de sustitución de mano de obra. Un restaurante no compra un anfitrión de IA para despedir a un anfitrión. Lo compra porque el teléfono suena durante el servicio, nadie puede contestar y quien llama reserva en otro sitio. El millón de llamadas que Yelp Host ha gestionado desde octubre de 2025 es el denominador de ese argumento —y Yelp, deliberadamente, no dio el numerador, que sería cuántas de esas llamadas se convirtieron en reservas o pedidos.
Teri Yu, la líder de producto multimodal de OpenAI, enmarcó el mismo despliegue de la manera opuesta, describiendo a clientes que usan GPT-Live-1 para todo, desde llamadas de reserva hasta programar reparaciones. Ambas lecturas son ciertas. Yelp vende lo vertical; OpenAI vende lo horizontal.
La economía que nadie incluyó en el comunicado
GPT-Live-1 cuesta $0.05 por minuto de voz, facturado por segundo, y el modelo se abrió a los desarrolladores el 10 de septiembre de 2026 — el mismo día en que llegó el anuncio de Yelp. La capa de voz es lo único que cubre esa tarifa. La documentación de OpenAI deja claro que las llamadas al backend realizadas en nombre del modelo, incluidos el razonamiento y el uso de herramientas que delega a otro modelo, se facturan según las tarifas normales de ese modelo.
Contrasta eso con la cifra de Yelp. Una llamada de reserva en un restaurante es corta: un par de minutos, a veces menos. Un millón de llamadas de dos minutos cada una son aproximadamente dos millones de minutos de voz, o alrededor de $100,000 de gasto en la capa de voz a lo largo de toda la historia del producto. Eso es un error de redondeo para Yelp, y esa es precisamente la cuestión: a $0.05 por minuto, la capa de voz no es la parte cara del sistema. Las partes caras son el razonamiento detrás de cada turno, la telefonía, la integración con el libro de reservas de cada restaurante y los humanos que se encargan de lo que el agente no puede.
También significa que la tarifa por minuto es la cifra equivocada sobre la que negociar. Un agente de voz que responde en un turno porque delegó correctamente cuesta menos que uno que se atasca durante noventa segundos, aunque a ambos se les cobre por segundo. La afirmación de Yelp de que las transferencias disminuyeron es, bajo la vaguedad, una afirmación sobre costos.
El razonamiento detrás de la voz es una llamada normal al modelo, y esa capa es donde una implementación como esta es realmente ajustable. Alrededor de 190 modelos de once proveedores upstream se encuentran detrás de una única clave de OrcaRouter al precio de lista del proveedor y sin margen, con conmutación automática por error cuando un backend falla o se agota el tiempo de espera — por lo que el modelo que realiza el razonamiento de reservas al estilo Yelp se puede cambiar o someter a pruebas A/B contra tráfico de llamadas en vivo cambiando un solo valor de configuración en lugar de reconstruir la integración. Ahí es donde están tanto el dinero como la calidad; los minutos medidos de la capa de voz son comparativamente fijos.

Los datos son el foso, no el modelo
Cualquier competidor puede comprar GPT-Live-1 mañana. Toast, Square, Clover, ServiceTitan y Housecall Pro están todos lo bastante cerca de los mismos clientes, y Google y Alexa+ de Amazon abordan el mismo problema desde el lado del consumidor. Nada en la posición de Yelp depende de un acceso exclusivo al modelo, y el propio planteamiento de Yelp —datos comerciales propietarios más inteligencia hecha a medida, con GPT-Live-1 como la capa que habla— lo admite.
Lo que Yelp posee es el grafo de reservas: qué restaurantes tienen mesas, cuándo, para cuántos, y la intención acumulada del consumidor detrás de un millón de llamadas. Un modelo que puede ser interrumpido es un requisito previo para recopilar esos datos a escala, porque un agente basado en turnos produce llamadas más cortas, más cuelgues y transcripciones más sucias. Por eso el despliegue importa incluso sin revelar las cifras. El dúplex completo no es una experiencia de usuario más agradable en este contexto; es el mecanismo de recopilación de datos.

Qué ver
Tres cosas convertirían esto de una historia de implementación creíble en una medible. La próxima llamada de resultados de Yelp, si la dirección da una cifra sobre el desvío de llamadas o la conversión de reservas. Un segundo vertical que anuncie la misma integración, lo que mostraría si la voz full-duplex es una mejora de propósito general o una específica del sector hotelero. Y la primera evaluación independiente de GPT-Live-1 en un tablero que puntúa el razonamiento en lugar de la mecánica conversacional — el Artificial Analysis Speech to Speech Index actualmente lo sitúa en el 70.3%, a la par de GPT-Live-1 mini y empatado en el sexto puesto en un tablero de catorce modelos, por detrás de Grok Voice Think Fast 2.0 High con el 79.0% y de GPT-Realtime-2.1 High con el 73.9%. La propia arquitectura de Yelp es una apuesta implícita de que la capa de voz y la capa de razonamiento deberían juzgarse por separado. La puntuación independiente, hasta ahora, respalda la segunda mitad de esa apuesta y no la primera.
Hasta que Yelp publique qué cambió, los demás estamos leyendo un anuncio de despliegue por su arquitectura y no por sus resultados. Aun así vale la pena hacerlo, porque la arquitectura es la parte que otros equipos pueden copiar este trimestre.
