Główna karta tytułowa do „Yelp umieszcza GPT-Live-1 za milionem połączeń do restauracji”, z podtytułem „Pierwsze wdrożenie pełnodupleksowego głosu na dużą skalę, bez dołączonych liczb”, zawierająca trzy karty o treści „Yelp Host: ponad 1 000 000 połączeń do restauracji od października 2025 r.”, „GPT-Live-1: 0,05 USD za minutę głosu, rozumowanie po stronie backendu rozliczane osobno”, „Ujawniony wpływ: wyłącznie orientacyjny — brak danych o obsłudze połączeń lub przekierowaniach”, nad paskiem stopki o treści „Dane dotyczące Yelp Host i Hatch pochodzą od Yelp; ceny GPT-Live-1 zgodnie z dokumentacją OpenAI”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

Yelp postawił GPT-Live-1 za milionem rozmów z restauracjami — i nie chce powiedzieć, co kupił

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Yelp twierdzi, że od października 2025 r. obsłużył ponad milion połączeń restauracyjnych przez Yelp Host i że od 10 września 2026 r. połączenia te działają na GPT-Live-1, pełnodupleksowym modelu głosowym Open​AI. W tym samym ogłoszeniu GPT-Live-1 trafia do Hatch, należącej do Yelp platformy komunikacyjnej AI dla firm usługowych, którą spółka opisuje jako zarządzającą dziesiątkami milionów leadów w kanałach głosowych, tekstowych, e-mailowych i internetowych. To największe wdrożenie produkcyjne pełnodupleksowego modelu mowy, jakie ktokolwiek ogłosił — a przyszło opakowane w najmniej skwantyfikowany komunikat prasowy, jaki Yelp mógł napisać. Yelp podaje, że obsługa połączeń się poprawiła, a liczba przekierowań połączeń spadła. Nie mówi jednak, o ile, na ilu połączeniach ani ile to wszystko kosztowało.

Oba fakty mają znaczenie. Wdrożenie jest realnym dowodem, że model, który słucha, gdy mówi, wychodzi cało z kontaktu z rzeczywistym ruchem telefonicznym — czego nie może ustalić żaden benchmark. Milczenie jest realnym dowodem, że własne liczby dostawcy nie były wystarczająco pochlebne, by je opublikować — albo że zakres obowiązków informacyjnych Yelp wobec inwestorów jest węższy niż jej apetyt marketingowy.

Co Yelp faktycznie wypuścił

Architektura jest tym, co warto zrozumieć, ponieważ nie jest to model głosowy Yelp. GPT-Live-1 to warstwa głosowa front-endu: to z nią rozmawia dzwoniący i to ona decyduje, kiedy dalej słuchać, kiedy zabrać głos, a kiedy ustąpić. Pod spodem znajdują się własne dane biznesowe Yelp oraz to, co firma nazywa inteligencją zbudowaną specjalnie do tego celu — godziny otwarcia restauracji, dostępność rezerwacji, menu, dania specjalne, strefy miejsc siedzących i aktualny stan systemu rezerwacji.

Ten podział to cały produkt. GPT-Live-1 nie wie, czy w piątek o 7:30 jest dostępny stolik dla czterech osób. Wie natomiast, jak przeprowadzić rozmowę, która to ustali. Zadaniem modelu jest sprawić, by wymiana zdań przypominała telefoniczną rozmowę, a nie drzewo menu; zadaniem Yelp jest sprawić, by odpowiedź była prawidłowa.

Deklarowane przez Yelp twierdzenia dotyczące zachowania są konkretne co do rodzaju i niejasne co do stopnia. Dzwoniący mogą przerywać, zmieniać temat w połowie zdania lub mówić mimo hałasu w tle, a model się do tego dostosowuje. System wykrywa ton dzwoniącego — ekscytację, frustrację, zniecierpliwienie — i reaguje odpowiednio. Nakładanie ulepszeń językowych Yelp na GPT-Live-1 pozwala mu wykrywać i obsługiwać dzwoniących w niemal każdym języku, co rozwiązuje realny problem restauracji: nieodebrane połączenie, ponieważ nikt na zmianie nie mówi językiem dzwoniącego, to utracona rezerwacja, a nie złe doświadczenie.

Te dwa operacyjne twierdzenia to te, za które operator restauracji faktycznie by zapłacił. Yelp twierdzi, że dzwoniący mówią teraz pełnymi, naturalnymi zdaniami, a nie krótkimi poleceniami głosowymi, oraz że dokładność transkrypcji po zakończeniu rozmowy poprawiła się, dając operatorom czystsze zapisy. Pierwsze jest wskaźnikiem wyprzedzającym, że ludzie przestali traktować agenta jako maszynę, którą trzeba omijać. Drugie ma wartość narastającą, ponieważ rezultat linii rezerwacyjnej to nie tylko rezerwacja — to zapis, a zapis, którego nikt nie może odczytać, to zapis, na podstawie którego nikt nie może działać.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh powiedział pożyteczną rzecz

Dyrektor ds. produktu w Yelp wygłosił standardową formułkę — każda rozmowa bardziej konwersacyjna i responsywna, wyjątkowe doświadczenia gości, personel uwolniony od odbierania telefonów, by mógł obsługiwać gości — a potem jedno zdanie, które jest warte więcej niż reszta komunikatu prasowego. Yelp Host, jak powiedział, wychwytuje „możliwości generowania przychodów, które w innym wypadku mogłyby umknąć”.

To uczciwe ujęcie tematu agentów głosowych w branży hotelarsko-gastronomicznej i odmienna teza niż typowa argumentacja o zastępowaniu pracy ludzkiej. Restauracja nie kupuje hosta AI po to, by zwolnić hosta. Kupuje go, bo telefon dzwoni w trakcie obsługi, nikt nie może odebrać, a dzwoniący rezerwuje gdzie indziej. Milion połączeń obsłużonych przez Yelp Host od października 2025 r. to mianownik tego argumentu — a Yelp celowo nie podał licznika, którym byłoby to, ile z tych połączeń zamieniło się w rezerwacje lub zamówienia.

Teri Yu, liderka produktu multimodalnego w OpenAI, przedstawiła to samo wdrożenie z przeciwnej perspektywy, opisując klientów wykorzystujących GPT-Live-1 do wszystkiego, od połączeń rezerwacyjnych po planowanie napraw. Obie interpretacje są prawdziwe. Yelp sprzedaje rozwiązanie wertykalne; OpenAI sprzedaje horyzontalne.

Ekonomia, której nikt nie umieścił w komunikacie

GPT-Live-1 kosztuje 0,05 USD za minutę głosu, z rozliczeniem co sekundę, a model został udostępniony deweloperom 10 września 2026 r. — tego samego dnia, w którym pojawiło się ogłoszenie Yelp. Ta stawka obejmuje wyłącznie warstwę głosową. Dokumentacja Open​AI wyraźnie stwierdza, że wywołania backendu wykonywane w imieniu modelu, w tym rozumowanie i korzystanie z narzędzi, które deleguje on do innego modelu, są rozliczane według zwykłych stawek tego modelu.

Skonfrontuj to z liczbą Yelp. Połączenie w sprawie rezerwacji restauracji jest krótkie — kilka minut, czasem mniej. Milion połączeń po dwie minuty każde to około dwóch milionów minut głosowych, czyli około 100 000 USD wydatków na warstwę głosową w całej historii produktu. To błąd zaokrąglenia dla Yelp i właśnie o to chodzi: przy 0,05 USD za minutę warstwa głosowa nie jest kosztownym elementem systemu. Drogie elementy to rozumowanie stojące za każdą turą rozmowy, telefonia, integracja z księgą rezerwacji każdej restauracji oraz ludzie, którzy obsługują to, czego agent nie potrafi.

Oznacza to również, że stawka za minutę to niewłaściwa liczba, wokół której należy negocjować. Agent głosowy, który odpowiada w jednej turze, bo właściwie delegował zadanie, kosztuje mniej niż ten, który miota się przez dziewięćdziesiąt sekund, mimo że oba są rozliczane za sekundę. Twierdzenie Yelp, że liczba transferów spadła, jest pod warstwą niejasności twierdzeniem o kosztach.

Rozumowanie stojące za głosem to zwykłe wywołanie modelu, a ta warstwa jest tym, co w takim wdrożeniu faktycznie można dostrajać. Około 190 modeli od jedenastu dostawców źródłowych znajduje się za jednym kluczem OrcaRouter w cenie katalogowej dostawcy, bez marży, z automatycznym przełączaniem awaryjnym, gdy backend zwróci błąd lub przekroczy limit czasu — dzięki czemu model wykonujący rozumowanie rezerwacyjne w stylu Yelp można podmienić lub przetestować metodą A/B na ruchu z rzeczywistych rozmów, zmieniając jedną wartość konfiguracji zamiast przebudowywać integrację. To tam są i pieniądze, i jakość; rozliczane minutowo użycie warstwy głosowej jest względnie stałe.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

Fosą są dane, a nie model

Każdy konkurent może jutro kupić GPT-Live-1. Toast, Square, Clover, ServiceTitan i Housecall Pro są wystarczająco blisko tych samych klientów, a Google i Alexa+ od Amazona rozwiązują ten sam problem od strony konsumenta. Nic w pozycji Yelp nie zależy od wyłącznego dostępu do modelu, a sama narracja Yelp — zastrzeżone dane biznesowe plus inteligencja zbudowana do konkretnego celu, z GPT-Live-1 jako warstwą, która mówi — przyznaje to.

Tym, co posiada Yelp, jest graf rezerwacji: które restauracje mają stoliki, kiedy i dla ilu osób, oraz skumulowane intencje konsumenckie stojące za milionem połączeń. Model, który można przerwać, jest warunkiem wstępnym zbierania tych danych na dużą skalę, ponieważ agent oparty na turach generuje krótsze rozmowy, więcej rozłączeń i bardziej zaszumione transkrypcje. Dlatego wdrożenie ma znaczenie nawet przy nieujawnionych liczbach. Pełny dupleks nie jest w tym kontekście przyjemniejszym doświadczeniem użytkownika; to mechanizm zbierania danych.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

Co obejrzeć

Trzy rzeczy zmieniłyby to z wiarygodnej historii wdrożenia w mierzalną. Najbliższa konferencja wynikowa Yelp, jeśli zarząd poda konkretną liczbę dotyczącą przekierowań połączeń lub konwersji rezerwacji. Druga branża ogłaszająca tę samą integrację, co pokazałoby, czy głos full-duplex to ulepszenie ogólnego przeznaczenia, czy rozwiązanie specyficzne dla sektora hotelarskiego. I pierwsza niezależna ocena GPT-Live-1 na liście rankingowej, która ocenia rozumowanie, a nie mechanikę konwersacyjną — Artificial Analysis Speech to Speech Index obecnie umieszcza go na poziomie 70,3%, ex aequo z GPT-Live-1 mini, wspólnie na szóstym miejscu na liście czternastu modeli, za Grok Voice Think Fast 2.0 High z 79,0% i GPT-Realtime-2.1 High z 73,9%. Własna architektura Yelp jest dorozumianym zakładem, że warstwę głosową i warstwę rozumowania należy oceniać oddzielnie. Niezależne oceny, jak dotąd, potwierdzają drugą część tego zakładu, a nie pierwszą.

Dopóki Yelp nie opublikuje, co się zmieniło, reszta z nas czyta ogłoszenie o wdrożeniu pod kątem architektury, a nie wyników. Wciąż warto to robić, bo architektura jest tym, co inne zespoły mogą skopiować w tym kwartale.