Главная титульная карточка для «Yelp задействовала GPT-Live-1 для обработки миллиона ресторанных звонков» с подзаголовком «Первое крупномасштабное развёртывание полнодуплексной голосовой связи — без каких-либо цифр», с тремя карточками с надписями: «Yelp Host: 1 000 000+ звонков в рестораны с октября 2025 года», «GPT-Live-1: $0,05 за минуту голоса, рассуждения на бэкенде тарифицируются отдельно», «Раскрытое влияние: только ориентировочное — без показателей обработки звонков или переадресации», над нижней полосой с надписью: «Показатели Yelp Host и Hatch — по данным Yelp; цены на GPT-Live-1 — согласно документации OpenAI». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Yelp перевела миллион ресторанных звонков на GPT-Live-1 — и не говорит, что купила

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Yelp заявляет, что с октября 2025 года обработала более миллиона звонков в рестораны через Yelp Host, и что по состоянию на 10 сентября 2026 года эти звонки работают на GPT-Live-1, полнодуплексной голосовой модели OpenAI. В том же объявлении GPT-Live-1 помещается внутрь Hatch, ИИ-платформы Yelp для коммуникаций сервисных компаний, которая, как описывает компания, управляет десятками миллионов лидов по голосовым, текстовым, email- и веб-каналам. Это крупнейшее промышленное внедрение полнодуплексной речевой модели, о котором кто-либо объявлял, — и оно появилось в обёртке самого неконкретного пресс-релиза, какой Yelp только мог написать. Yelp сообщает, что обработка звонков улучшилась, а количество переводов звонков снизилось. В нём не говорится, насколько, на скольких звонках и во сколько обошлось всё это.

Оба факта важны. Развёртывание — это реальное доказательство того, что модель, которая слушает, пока говорит, выдерживает контакт с реальным телефонным трафиком, а это больше, чем способен доказать любой бенчмарк. Молчание — это реальное доказательство того, что собственные показатели вендора были недостаточно лестными, чтобы их публиковать, — или что обязательства Yelp по раскрытию информации перед инвесторами более узки, чем его аппетит к маркетингу.

Что Yelp на самом деле выпустил

Архитектура — это то, что стоит понять, потому что это не голосовая модель Yelp. GPT-Live-1 — это внешний голосовой слой: именно с ним разговаривает звонящий, и именно он решает, когда продолжать слушать, когда вступать в диалог, а когда уступать. Под ним находятся собственные бизнес-данные Yelp и то, что компания называет интеллектом, созданным под конкретные задачи, — часы работы ресторана, доступность бронирований, меню, специальные предложения, зоны посадки и текущее состояние системы бронирования.

Это разделение — и есть весь продукт. GPT-Live-1 не знает, есть ли столик на четверых в 19:30 в пятницу. Он умеет вести разговор, который это выясняет. Задача модели — сделать общение похожим на телефонный звонок, а не на дерево меню; задача Yelp — сделать ответ правильным.

Заявленные поведенческие возможности Yelp конкретны по характеру, но расплывчаты по степени. Звонящие могут перебивать, менять тему на полуслове или говорить поверх фонового шума — и модель адаптируется. Система распознаёт тон звонящего — воодушевление, раздражение, нетерпение — и отвечает соответственно. Наложение языковых усовершенствований Yelp поверх GPT-Live-1 позволяет системе распознавать звонящих и отвечать им почти на любом языке, что решает реальную проблему ресторанов: пропущенный звонок из-за того, что никто в смене не говорит на языке звонящего, — это потерянная бронь, а не просто неудачный опыт.

Два операционных заявления — это именно то, за что оператор ресторана действительно готов платить. Yelp утверждает, что звонящие теперь говорят полными, естественными предложениями, а не короткими голосовыми командами, и что точность расшифровки после звонка повысилась, давая операторам более чистые записи. Первое — опережающий индикатор того, что люди перестали воспринимать агента как машину, с которой нужно говорить в обход. Второе — то, что обладает накопительной ценностью, потому что результат работы линии бронирования — это не только бронирование; это запись, а запись, которую никто не может прочитать, — это запись, по которой никто не может действовать.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Ахил Кудувалли Рамеш сказал полезную вещь

Директор по продукту Yelp привёл стандартную цитату — каждый звонок становится более разговорным и отзывчивым, исключительный опыт гостей, сотрудники освобождены, чтобы обслуживать гостей, а не отвечать на телефон, — а затем одно предложение, которое стоит больше, чем всё остальное в пресс-релизе. Yelp Host, по его словам, улавливает «возможности для получения дохода, которые иначе могли быть упущены».

Это честная формулировка для голосовых агентов в сфере гостеприимства, и она отличается от обычной риторики о замене рабочей силы. Ресторан покупает ИИ-хостес не для того, чтобы уволить хостес. Он покупает его потому, что во время обслуживания звонит телефон, никто не может ответить, и звонящий бронирует столик в другом месте. Миллион звонков, которые Yelp Host обработал с октября 2025 года, — это знаменатель для этого аргумента; и Yelp намеренно не раскрыла числитель, а именно сколько из этих звонков превратились в бронирования или заказы.

Тери Ю, руководитель мультимодального продукта Open​AI, представила то же внедрение с другой стороны, описав клиентов, использующих GPT-Live-1 для всего — от звонков для бронирования до планирования ремонта. Обе трактовки верны. Yelp продаёт вертикальное решение; Open​AI продаёт горизонтальное.

Экономика, которую никто не включил в релиз

GPT-Live-1 стоит $0.05 за минуту голоса, оплата по секундам, и модель была открыта для разработчиков 10 сентября 2026 года — в тот же день, когда появилось объявление Yelp. Этот тариф покрывает только голосовой слой. В документации OpenAI прямо указано, что серверные вызовы, совершаемые от имени модели, включая рассуждения и использование инструментов, которые она делегирует другой модели, оплачиваются по обычным тарифам этой модели.

Сопоставьте это с цифрами Yelp. Звонок для бронирования столика в ресторане короткий — пара минут, иногда меньше. Миллион звонков по две минуты каждый — это примерно два миллиона голосовых минут, или около $100 000 расходов на голосовой слой за всю историю продукта. Для Yelp это погрешность округления, и в этом суть: при $0,05 за минуту голосовой слой — не самая дорогая часть системы. Дорогостоящие части — это рассуждения, стоящие за каждым ходом диалога, телефония, интеграция с книгой бронирований каждого ресторана и люди, которые обрабатывают то, с чем агент не справляется.

Это также означает, что ставка за минуту — не тот показатель, о котором стоит вести переговоры. Голосовой агент, который отвечает за один ход, потому что правильно делегировал задачу, обходится дешевле, чем тот, который барахтается девяносто секунд, хотя оба тарифицируются посекундно. Утверждение Yelp о том, что число переводов снизилось, при всей своей расплывчатости является утверждением о затратах.

Рассуждение за голосом — это обычный вызов модели, и именно этот слой в подобном развёртывании действительно поддаётся настройке.190 моделей от одиннадцати вышестоящих провайдеров доступны через один ключ OrcaRouter по прайс-листовой цене провайдеров без наценки, с автоматическим переключением при ошибке или тайм-ауте бэкенда — поэтому модель, выполняющую рассуждения для бронирования в стиле Yelp, можно заменить или протестировать A/B на живом трафике звонков, изменив одно значение конфигурации, а не перестраивая интеграцию. Именно здесь сосредоточены и деньги, и качество; тарифицируемые минуты голосового слоя относительно фиксированы.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

Данные — это ров, а не модель

Любой конкурент может завтра купить GPT-Live-1. Toast, Square, Clover, ServiceTitan и Housecall Pro находятся достаточно близко к одним и тем же клиентам, а Google и Amazon Alexa+ работают над той же проблемой со стороны потребителя. Ничто в позиции Yelp не зависит от эксклюзивного доступа к модели, и собственная формулировка Yelp — проприетарные бизнес-данные плюс интеллект, созданный для конкретных задач, с GPT-Live-1 в качестве слоя, который говорит — признаёт это.

То, чем владеет Yelp, — это граф бронирований: в каких ресторанах есть столики, когда, на сколько человек, и накопленное потребительское намерение, стоящее за миллионом звонков. Модель, которую можно прервать, — обязательное условие для сбора этих данных в масштабе, потому что агент с поочерёдными репликами порождает более короткие звонки, больше сбросов и более грязные транскрипты. Вот почему развёртывание имеет значение, даже если цифры не раскрываются. Полный дуплекс в этом контексте — не более приятный пользовательский опыт; это механизм сбора данных.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

Что посмотреть

Три вещи превратили бы эту историю внедрения из правдоподобной в измеримую. Следующий отчётный звонок Yelp — если руководство назовёт цифру по сокращению числа звонков или конверсии бронирований. Вторая вертикаль, объявившая о такой же интеграции, — это показало бы, является ли полнодуплексный голос универсальным улучшением или специфичным для сферы гостеприимства. И первая независимая оценка GPT-Live-1 в рейтинге, который оценивает рассуждения, а не механику разговора, — индекс Artificial Analysis Speech to Speech сейчас ставит его на 70,3%, наравне с GPT-Live-1 mini и на разделённое шестое место в рейтинге из четырнадцати моделей, позади Gr​ok Voice Think Fast 2.0 High с 79,0% и GPT-Realtime-2.1 High с 73,9%. Собственная архитектура Yelp — это неявная ставка на то, что голосовой слой и слой рассуждений следует оценивать отдельно. Независимое оценивание пока что согласуется со второй половиной этой ставки, но не с первой.

Пока Yelp не опубликует, что именно изменилось, остальные из нас читают анонс развёртывания, посвящённый её архитектуре, а не результатам. Это всё равно стоит делать, потому что архитектура — это та часть, которую другие команды могут скопировать в этом квартале.