Cartão de título principal de 'O Yelp coloca o GPT-Live-1 por trás de um milhão de chamadas de restaurantes', com o subtítulo 'A primeira implantação em larga escala de voz full-duplex, sem números divulgados', trazendo três cartões com os textos 'Yelp Host: mais de 1.000.000 de chamadas de restaurantes desde outubro de 2025', 'GPT-Live-1: US$ 0,05 por minuto de voz, com o raciocínio de backend cobrado separadamente', 'Impacto divulgado: apenas direcional — sem dados sobre processamento de chamadas ou transferências', acima de uma faixa de rodapé com os dizeres 'Os números do Yelp Host e do Hatch são reportados pelo Yelp; o preço do GPT-Live-1 conforme a documentação da OpenAI.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Yelp colocou o GPT-Live-1 por trás de um milhão de ligações para restaurantes — e não diz o que comprou

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Yelp diz que processou mais de um milhão de chamadas de restaurantes pelo Yelp Host desde outubro de 2025, e que, em 10 de setembro de 2026, essas chamadas rodam no GPT-Live-1, o modelo de voz full-duplex da OpenAI. O mesmo anúncio coloca o GPT-Live-1 dentro do Hatch, a plataforma de comunicações com IA da Yelp para empresas de serviços, que a empresa descreve como gerenciando dezenas de milhões de leads por voz, texto, e-mail e web. Essa é a maior implantação em produção de um modelo de fala full-duplex que alguém já anunciou — e chegou envolta no comunicado à imprensa menos quantificado que a Yelp poderia ter escrito. A Yelp relata que o atendimento de chamadas melhorou e que as transferências de chamadas caíram. Não diz em quanto, em quantas chamadas, nem quanto tudo isso custou.

Ambos os fatos importam. A implantação é evidência real de que um modelo que escuta enquanto fala sobrevive ao contato com tráfego telefônico de verdade, o que é mais do que qualquer benchmark consegue estabelecer. O silêncio é evidência real de que os próprios números do fornecedor não eram lisonjeiros o bastante para serem publicados — ou de que as obrigações de divulgação da Yelp perante investidores são mais estreitas do que seu apetite de marketing.

O que a Yelp realmente lançou

A arquitetura é a parte que vale a pena entender, porque não é um modelo de voz da Yelp. O GPT-Live-1 é a camada de voz de front-end: é com ele que quem liga fala, e é ele que decide quando continuar ouvindo, quando assumir a vez e quando ceder. Por baixo, ficam os dados de negócios da própria Yelp e o que a empresa chama de inteligência criada para fins específicos — o horário do restaurante, a disponibilidade de reservas, o menu, os pratos especiais, as áreas de assentos e o estado atual do sistema de reservas.

Essa divisão é o produto inteiro. O GPT-Live-1 não sabe se existe uma mesa para quatro às 7h30 de uma sexta-feira. Ele sabe como conduzir a conversa que descobre isso. O trabalho do modelo é fazer a interação parecer uma ligação telefônica, e não uma árvore de menus; o trabalho do Yelp é fazer com que a resposta esteja correta.

As alegações comportamentais declaradas da Yelp são específicas em tipo e vagas em grau. Os clientes que ligam podem interromper, mudar de assunto no meio da frase ou falar por cima de ruído de fundo, e o modelo se adapta. O sistema detecta o tom de quem liga — empolgação, frustração, impaciência — e responde de acordo. Ao colocar os aprimoramentos de linguagem da Yelp por cima do GPT-Live-1, o sistema consegue detectar e atender quem liga em praticamente qualquer idioma, o que resolve um problema real dos restaurantes: uma chamada perdida porque ninguém no turno fala o idioma de quem liga é uma reserva perdida, não uma experiência ruim.

As duas alegações operacionais são aquelas pelas quais um operador de restaurante realmente pagaria. A Yelp afirma que quem liga agora fala em frases completas e naturais, em vez de comandos de voz curtos, e que a precisão da transcrição após a chamada melhorou, dando aos operadores registros mais limpos. A primeira é um indicador antecedente de que as pessoas deixaram de tratar o agente como uma máquina que precisavam contornar. A segunda é a que tem valor cumulativo, porque o que uma linha de reservas produz não é apenas uma reserva — é um registro, e um registro que ninguém consegue ler é um registro sobre o qual ninguém consegue agir.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh disse a coisa útil

O diretor de produto da Yelp deu a declaração padrão — cada ligação mais conversacional e responsiva, experiências excepcionais para os clientes, equipe liberada para atender os clientes em vez de responder ao telefone — e então uma frase que vale mais do que o resto do comunicado. O Yelp Host, disse ele, captura "oportunidades de receita que, de outra forma, poderiam ter deixado passar".

Essa é a formulação honesta para agentes de voz na hospitalidade, e é uma alegação diferente do habitual discurso de substituição de mão de obra. Um restaurante não compra um anfitrião de IA para demitir um anfitrião. Ele compra um porque o telefone toca durante o serviço, ninguém consegue atender, e quem liga reserva em outro lugar. O milhão de ligações que o Yelp Host atendeu desde outubro de 2025 é o denominador desse argumento — e a Yelp, de forma deliberada, não divulgou o numerador, que seria quantas dessas ligações se tornaram reservas ou pedidos.

Teri Yu, líder de produto multimodal da Open​AI, apresentou a mesma implantação sob a outra perspectiva, descrevendo clientes que usam o GPT-Live-1 para tudo, de chamadas de reserva a agendamento de reparos. Ambas as leituras são verdadeiras. O Yelp está vendendo a vertical; a Open​AI está vendendo a horizontal.

A economia que ninguém colocou no comunicado

O GPT-Live-1 custa US$ 0,05 por minuto de voz, cobrado por segundo, e o modelo foi aberto a desenvolvedores em 10 de setembro de 2026 — no mesmo dia em que o anúncio da Yelp foi publicado. A camada de voz é a única coisa que essa tarifa cobre. A documentação da OpenAI deixa explícito que chamadas de backend feitas em nome do modelo, incluindo o raciocínio e o uso de ferramentas que ele delega a outro modelo, são cobradas pelas tarifas normais desse modelo.

Compare isso com o número da Yelp. Uma chamada de reserva em restaurante é curta — alguns minutos, às vezes menos. Um milhão de chamadas de dois minutos cada dá aproximadamente dois milhões de minutos de voz, ou cerca de US$ 100.000 gastos com a camada de voz ao longo de toda a história do produto. Isso é um erro de arredondamento para a Yelp, e é justamente esse o ponto: a US$ 0,05 por minuto, a camada de voz não é a parte cara do sistema. As partes caras são o raciocínio por trás de cada turno, a telefonia, a integração com a agenda de reservas de cada restaurante e as pessoas que cuidam do que o agente não consegue.

Isso também significa que a tarifa por minuto é o número errado a ser negociado. Um agente de voz que responde em um único turno porque delegou corretamente custa menos do que um que se atrapalha por noventa segundos, embora ambos sejam cobrados por segundo. A alegação da Yelp de que as transferências caíram é, por trás da vagueza, uma alegação de custo.

O raciocínio por trás da voz é uma chamada de modelo normal, e essa camada é onde uma implantação como esta é de fato ajustável. Cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave OrcaRouter pelo preço de tabela dos provedores, sem nenhum markup, com failover automático quando um backend apresenta erro ou excede o tempo limite — assim, o modelo que faz o raciocínio de reservas no estilo Yelp pode ser trocado ou testado em A/B contra o tráfego de chamadas ao vivo alterando um único valor de configuração, em vez de reconstruir a integração. É aí que o dinheiro e a qualidade estão; os minutos tarifados da camada de voz são comparativamente fixos.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

Os dados são o fosso, não o modelo.

Qualquer concorrente pode comprar o GPT-Live-1 amanhã. Toast, Square, Clover, ServiceTitan e Housecall Pro estão todos perto o suficiente dos mesmos clientes, e o Google e o Alexa+ da Amazon estão trabalhando no mesmo problema pelo lado do consumidor. Nada na posição do Yelp depende de acesso exclusivo ao modelo, e a própria forma como o Yelp enquadra a questão — dados comerciais proprietários mais inteligência sob medida, com o GPT-Live-1 como a camada que conversa — admite isso.

O que a Yelp possui é o grafo de reservas: quais restaurantes têm mesas, quando, para quantas pessoas e a intenção acumulada dos consumidores por trás de um milhão de ligações. Um modelo que pode ser interrompido é um pré-requisito para coletar esses dados em escala, porque um agente baseado em turnos produz chamadas mais curtas, mais desligamentos e transcrições mais sujas. É por isso que a implantação importa mesmo com os números omitidos. Full duplex não é uma experiência de usuário mais agradável neste contexto; é o mecanismo de coleta de dados.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

O que assistir

Três coisas transformariam isto de uma história de implantação crível numa história mensurável. A próxima teleconferência de resultados do Yelp, se a administração atribuir um número ao desvio de chamadas ou à conversão de reservas. Uma segunda vertical a anunciar a mesma integração, o que mostraria se a voz full-duplex é uma melhoria de propósito geral ou específica do setor de hotelaria. E a primeira avaliação independente do GPT-Live-1 num ranking que pontua o raciocínio em vez da mecânica conversacional — o Artificial Analysis Speech to Speech Index coloca-o atualmente em 70,3%, a par do GPT-Live-1 mini e empatado na sexta posição num ranking de catorze modelos, atrás do Gr​ok Voice Think Fast 2.0 High, com 79,0%, e do GPT-Realtime-2.1 High, com 73,9%. A própria arquitetura do Yelp é uma aposta implícita de que a camada de voz e a camada de raciocínio devem ser avaliadas separadamente. A pontuação independente, até agora, concorda com a segunda metade dessa aposta e não com a primeira.

Até que a Yelp publique o que mudou, o resto de nós está lendo um anúncio de implantação mais por sua arquitetura do que por seus resultados. Ainda assim, vale a pena, porque a arquitetura é a parte que outras equipes podem copiar neste trimestre.