Hero-Titelkarte für „Yelp setzt GPT-Live-1 hinter eine Million Restaurantanrufe", mit dem Untertitel „Der erste groß angelegte Einsatz von Vollduplex-Sprachtechnologie – ohne Angabe von Zahlen", mit drei Karten und der Aufschrift „Yelp Host: 1.000.000+ Restaurantanrufe seit Oktober 2025", „GPT-Live-1: 0,05 $ pro Sprachminute, Backend-Reasoning separat abgerechnet", „Offengelegte Auswirkungen: nur richtungsweisend – keine Zahlen zur Anrufbearbeitung oder Weiterleitung", über einer Fußleiste mit dem Text „Die Zahlen zu Yelp Host und Hatch stammen von Yelp; die GPT-Live-1-Preise entsprechen der OpenAI-Dokumentation." Das OrcaRouter-Logo ist in der unteren rechten Ecke einkomponiert.
Guides & Insights

Yelp hat GPT-Live-1 hinter eine Million Restaurantanrufe gesetzt – und will nicht sagen, was es gekauft hat.

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Yelp sagt, dass seit Oktober 2025 mehr als eine Million Restaurantanrufe über Yelp Host abgewickelt wurden und dass diese Anrufe mit Stand vom 10. September 2026 auf GPT-Live-1 laufen, dem Vollduplex-Sprachmodell von OpenAI. Dieselbe Ankündigung platziert GPT-Live-1 in Hatch, Yelps KI-Kommunikationsplattform für Dienstleistungsunternehmen, die laut dem Unternehmen zig Millionen Leads über Sprache, Text, E-Mail und Web verwaltet. Das ist der größte Produktiveinsatz eines Vollduplex-Sprachmodells, den jemals jemand angekündigt hat – und er kam verpackt in die am wenigsten mit Zahlen unterlegte Pressemitteilung, die Yelp hätte schreiben können. Yelp berichtet, dass sich die Anrufabwicklung verbesserte und die Anrufweiterleitungen zurückgingen. Es wird nicht gesagt, um wie viel, bei wie vielen Anrufen oder was all das gekostet hat.

Beide Fakten sind wichtig. Der Einsatz ist ein echter Beleg dafür, dass ein Modell, das zuhört, während es spricht, den Kontakt mit echtem Telefonverkehr übersteht – was mehr ist, als ein Benchmark belegen kann. Das Schweigen ist ein echter Beleg dafür, dass die eigenen Zahlen des Anbieters nicht schmeichelhaft genug waren, um veröffentlicht zu werden – oder dass Yelps Offenlegungspflichten gegenüber Investoren enger gefasst sind als sein Marketing-Appetit.

Was Yelp tatsächlich ausgeliefert hat

Die Architektur ist der Teil, der es wert ist, verstanden zu werden, denn sie ist kein Yelp-Sprachmodell. GPT-Live-1 ist die Voice-Schicht im Frontend: Sie ist das, womit der Anrufer spricht, und sie ist es, die entscheidet, wann sie weiter zuhört, wann sie das Wort ergreift und wann sie abgibt. Darunter liegen Yelps eigene Geschäftsdaten und das, was das Unternehmen zweckgebundene Intelligenz nennt – die Öffnungszeiten des Restaurants, seine Reservierungsverfügbarkeit, seine Speisekarte, seine Sonderangebote, seine Sitzbereiche und der aktuelle Zustand des Reservierungssystems.

Diese Aufteilung ist das ganze Produkt. GPT-Live-1 weiß nicht, ob es freitags um 19:30 Uhr einen Tisch für vier gibt. Es weiß, wie man das Gespräch führt, das es herausfindet. Die Aufgabe des Modells ist es, den Austausch wie einen Telefonanruf und nicht wie einen Menübaum wirken zu lassen; die Aufgabe von Yelp ist es, dafür zu sorgen, dass die Antwort korrekt ist.

Yelps erklärte Verhaltensansprüche sind in ihrer Art konkret und in ihrem Grad vage. Anrufer können unterbrechen, mitten im Satz das Thema wechseln oder über Hintergrundgeräusche hinweg sprechen, und das Modell passt sich an. Das System erkennt den Tonfall des Anrufers – Begeisterung, Frustration, Ungeduld – und reagiert entsprechend. Indem Yelps Spracherweiterungen auf GPT-Live-1 aufgesetzt werden, kann das System Anrufer in nahezu jeder Sprache erkennen und beantworten, was ein echtes Problem in Restaurants adressiert: Ein verpasster Anruf, weil niemand in der Schicht die Sprache des Anrufers spricht, ist eine verlorene Buchung, keine schlechte Erfahrung.

Die beiden operativen Behauptungen sind diejenigen, für die ein Restaurantbetreiber tatsächlich bezahlen würde. Yelp sagt, Anrufer würden jetzt in vollständigen, natürlichen Sätzen statt in kurzen Sprachbefehlen sprechen, und die Genauigkeit der Transkription nach dem Anruf habe sich verbessert, was Betreibern sauberere Datensätze liefere. Die erste ist ein Frühindikator dafür, dass Menschen aufgehört haben, den Agenten als eine Maschine zu behandeln, um die man herumreden muss. Die zweite ist diejenige, deren Wert sich mit der Zeit vervielfacht, denn das Ergebnis einer Reservierungshotline ist nicht nur eine Buchung – es ist ein Datensatz, und ein Datensatz, den niemand lesen kann, ist ein Datensatz, auf dessen Grundlage niemand handeln kann.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh sagte die nützliche Sache

Yelps Chief Product Officer lieferte das übliche Zitat — jeder Anruf gesprächsorientierter und reaktionsschneller, außergewöhnliche Gasterlebnisse, Mitarbeiter, die Gäste bedienen können, statt ans Telefon zu gehen — und dann einen Satz, der mehr wert ist als der Rest der Pressemitteilung. Yelp Host, sagte er, erschließe „Umsatzchancen, die sie sonst möglicherweise verpasst hätten“.

Das ist die ehrliche Einordnung für Sprachagenten im Gastgewerbe, und sie unterscheidet sich von der üblichen Argumentation der Arbeitskräfteersetzung. Ein Restaurant kauft keine KI-Empfangskraft, um eine Empfangskraft zu entlassen. Es kauft eine, weil während des Service das Telefon klingelt, niemand rangehen kann und der Anrufer woanders reserviert. Die eine Million Anrufe, die Yelp Host seit Oktober 2025 bearbeitet hat, sind der Nenner für dieses Argument – und Yelp hat bewusst den Zähler nicht genannt, also wie viele dieser Anrufe zu Reservierungen oder Bestellungen wurden.

Teri Yu, multimodale Produktleiterin bei OpenAI, fasste denselben Einsatz aus der anderen Perspektive auf und beschrieb, wie Kundinnen und Kunden GPT-Live-1 für alles von Reservierungsanrufen bis zur Terminplanung von Reparaturen einsetzen. Beide Lesarten sind zutreffend. Yelp verkauft die Vertikale; OpenAI verkauft die Horizontale.

Die Wirtschaftlichkeit, die niemand in die Ankündigung geschrieben hat

GPT-Live-1 kostet 0,05 $ pro Minute Sprache, sekundengenau abgerechnet, und das Modell wurde am 10. September 2026 für Entwickler freigegeben — am selben Tag, an dem auch Yelps Ankündigung kam. Die Sprachschicht ist das Einzige, was dieser Tarif abdeckt. Die Dokumentation von OpenAI stellt ausdrücklich klar, dass Backend-Aufrufe, die im Namen des Modells erfolgen, einschließlich der Reasoning- und Tool-Nutzung, die es an ein anderes Modell delegiert, zu den normalen Tarifen dieses Modells abgerechnet werden.

Rechnen Sie das gegen Yelps Zahl. Ein Anruf für eine Restaurantreservierung ist kurz – ein paar Minuten, manchmal weniger. Eine Million Anrufe zu je zwei Minuten sind grob zwei Millionen Sprachminuten oder rund 100.000 US-Dollar an Ausgaben für die Sprachschicht über die gesamte Produkthistorie. Das ist für Yelp ein Rundungsfehler – und das ist der Punkt: Bei 0,05 US-Dollar pro Minute ist die Sprachschicht nicht der teure Teil des Systems. Die teuren Teile sind die Denkprozesse hinter jedem Gesprächsschritt, die Telefonie, die Integration in das Reservierungsbuch jedes Restaurants und die Menschen, die übernehmen, was der Agent nicht kann.

Außerdem bedeutet es, dass der Minutenpreis die falsche Zahl ist, über die verhandelt werden sollte. Ein Sprachagent, der in einem einzigen Zug antwortet, weil er korrekt delegiert hat, kostet weniger als einer, der neunzig Sekunden lang herumstolpert, obwohl beide sekundengenau abgerechnet werden. Yelps Behauptung, dass Transfers zurückgegangen seien, ist hinter der Unbestimmtheit eine Kostenaussage.

Das Reasoning hinter der Stimme ist ein normaler Modellaufruf, und diese Ebene ist der Punkt, an dem sich ein Deployment wie dieses tatsächlich abstimmen lässt. Rund 190 Modelle von elf vorgelagerten Anbietern stehen hinter einem einzigen OrcaRouter-Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, mit automatischem Failover bei Fehlern oder Timeouts eines Backends — sodass das Modell, das Yelp-artige Reservierungslogik ausführt, durch Ändern eines einzigen Konfigurationswerts ausgetauscht oder gegen Live-Anrufverkehr A/B-getestet werden kann, statt die Integration neu aufzubauen. Dort liegen sowohl das Geld als auch die Qualität; die abgerechneten Minuten des Voice-Layers sind vergleichsweise fix.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

Die Daten sind der Burggraben, nicht das Modell.

Jeder Wettbewerber kann GPT-Live-1 morgen kaufen. Toast, Square, Clover, ServiceTitan und Housecall Pro sind alle nah genug an denselben Kunden dran, und Goog​le und Amazons Alexa+ arbeiten von der Verbraucherseite aus an demselben Problem. Nichts an Yelps Position hängt von exklusivem Zugang zum Modell ab, und Yelps eigene Darstellung – proprietäre Geschäftsdaten plus speziell entwickelte Intelligenz, mit GPT-Live-1 als der Schicht, die spricht – räumt das ein.

Was Yelp besitzt, ist der Reservierungsgraph: welche Restaurants Tische haben, wann, für wie viele Personen, und die akkumulierte Verbraucherintention hinter einer Million Anrufe. Ein Modell, das unterbrochen werden kann, ist eine Voraussetzung dafür, diese Daten im großen Maßstab zu sammeln, weil ein turn-basierter Agent kürzere Anrufe, mehr aufgelegte Hörer und unsauberere Transkripte erzeugt. Deshalb ist das Deployment wichtig, selbst wenn die Zahlen vorenthalten werden. Vollduplex ist in diesem Kontext keine schönere Nutzererfahrung; es ist der Datenerfassungsmechanismus.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

Was zu sehen

Drei Dinge würden daraus statt einer glaubwürdigen eine messbare Deployment-Story machen. Yelps nächste Telefonkonferenz zu den Quartalszahlen, falls das Management Anrufvermeidung oder Reservierungskonversion beziffert. Eine zweite Vertikale, die dieselbe Integration ankündigt, würde zeigen, ob Vollduplex-Voice ein allgemein einsetzbares Upgrade oder ein gastgewerbespezifisches ist. Und die erste unabhängige Bewertung von GPT-Live-1 auf einem Leaderboard, das Reasoning statt Konversationsmechanik bewertet – der Artificial Analysis Speech to Speech Index weist es derzeit mit 70,3 % aus, gleichauf mit GPT-Live-1 mini und gemeinsam auf Platz sechs in einem Leaderboard mit vierzehn Modellen, hinter Grok Voice Think Fast 2.0 High mit 79,0 % und GPT-Realtime-2.1 High mit 73,9 %. Yelps eigene Architektur ist eine implizite Wette darauf, dass die Voice-Schicht und die Reasoning-Schicht getrennt bewertet werden sollten. Die unabhängige Bewertung stimmt bislang mit der zweiten Hälfte dieser Wette überein und nicht mit der ersten.

Bis Yelp veröffentlicht, was sich geändert hat, liest der Rest von uns eine Deployment-Ankündigung für seine Architektur statt für seine Ergebnisse. Das ist trotzdem sinnvoll, denn die Architektur ist der Teil, den andere Teams in diesem Quartal kopieren können.