Hero-titelkaart voor 'Yelp Put GPT-Live-1 Behind a Million Restaurant Calls', met als ondertitel 'De eerste grootschalige implementatie van full-duplex spraak, zonder cijfers erbij', met drie kaarten die luiden: 'Yelp Host: 1.000.000+ restaurantgesprekken sinds oktober 2025', 'GPT-Live-1: $0,05 per spraakminuut, backend-redenering apart gefactureerd', 'Bekendgemaakte impact: alleen indicatief — geen cijfers over gespreksafhandeling of doorverwijzing', boven een voettekststrook met de tekst 'Yelp Host- en Hatch-cijfers zijn door Yelp gerapporteerd; GPT-Live-1-prijzen volgens OpenAI-documentatie.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Yelp zette GPT-Live-1 achter een miljoen restaurantoproepen — en wil niet zeggen wat het heeft gekocht

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Yelp zegt dat het sinds oktober 2025 meer dan een miljoen restaurantgesprekken via Yelp Host heeft afgehandeld, en dat die gesprekken sinds 10 september 2026 draaien op GPT-Live-1, OpenAI's full-duplex spraakmodel. In dezelfde aankondiging wordt GPT-Live-1 in Hatch geplaatst, het AI-communicatieplatform van Yelp voor dienstverlenende bedrijven, dat volgens het bedrijf tientallen miljoenen leads beheert via spraak, tekst, e-mail en web. Dat is de grootste productie-implementatie van een full-duplex spraakmodel die ooit iemand heeft aangekondigd — en die kwam verpakt in het minst gekwantificeerde persbericht dat Yelp had kunnen schrijven. Yelp meldt dat de gespreksafhandeling verbeterde en dat gespreksoverdrachten daalden. Het zegt niet met hoeveel, bij hoeveel gesprekken, of wat het allemaal kostte.

Beide feiten doen ertoe. De uitrol is concreet bewijs dat een model dat luistert terwijl het praat, contact met echt telefoonverkeer overleeft, wat meer is dan welke benchmark dan ook kan aantonen. Het stilzwijgen is concreet bewijs dat de eigen cijfers van de leverancier niet flatteus genoeg waren om te publiceren — of dat Yelps openbaarmakingsverplichtingen jegens investeerders beperkter zijn dan zijn marketinghonger.

Wat Yelp eigenlijk uitbracht

De architectuur is het deel dat het begrijpen waard is, want het is geen Yelp-spraakmodel. GPT-Live-1 is de front-end spraaklaag: het is waar de beller mee praat, en het is wat bepaalt wanneer het moet blijven luisteren, wanneer het de beurt moet nemen en wanneer het die moet afstaan. Daaronder bevinden zich Yelps eigen bedrijfsgegevens en wat het bedrijf purpose-built intelligence noemt — de openingstijden van het restaurant, de beschikbaarheid voor reserveringen, het menu, de specials, de zitgedeelten en de huidige status van het reserveringssysteem.

Die splitsing is het hele product. GPT-Live-1 weet niet of er op een vrijdag om 7:30 een tafel voor vier beschikbaar is. Het weet hoe het een gesprek moet voeren waarmee het daarachter komt. De taak van het model is om de uitwisseling als een telefoongesprek te laten aanvoelen in plaats van als een menuboom; de taak van Yelp is om het antwoord correct te maken.

Yelps geformuleerde gedragsclaims zijn specifiek van aard en vaag in mate. Bellers kunnen onderbreken, midden in een zin van onderwerp veranderen of door achtergrondgeluid heen praten, en het model past zich aan. Het systeem detecteert de toon van de beller — opwinding, frustratie, ongeduld — en reageert daarop. Door de taalverbeteringen van Yelp boven op GPT-Live-1 te stapelen, kan het bellers in vrijwel elke taal detecteren en beantwoorden, wat een echt restaurantprobleem aanpakt: een gemiste oproep omdat niemand die op dat moment werkt de taal van de beller spreekt, is een verloren reservering, niet een slechte ervaring.

De twee operationele claims zijn de claims waarvoor een restauranteigenaar daadwerkelijk zou betalen. Yelp zegt dat bellers nu in volledige, natuurlijke zinnen spreken in plaats van in korte spraakopdrachten, en dat de nauwkeurigheid van de transcriptie na het gesprek is verbeterd, wat exploitanten schonere registraties oplevert. De eerste is een voorlopende indicator dat mensen de agent niet langer behandelen als een machine waar je omheen moet praten. De tweede is degene met de zich opstapelende waarde, want de output van een reserveringslijn is niet alleen een boeking — het is een registratie, en een registratie die niemand kan lezen is een registratie waarop niemand kan handelen.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh zei het nuttige ding

De chief product officer van Yelp gaf het standaardcitaat — elk telefoongesprek conversationeler en responsiever, uitzonderlijke gastervaringen, personeel vrijgespeeld om gasten te bedienen in plaats van de telefoon op te nemen — en dan één zin die meer waard is dan de rest van het persbericht. Yelp Host, zei hij, benut "omzetkansen die ze anders wellicht hadden gemist."

Dat is de eerlijke framing voor voice-agents in de horeca, en het is een andere claim dan de gebruikelijke pitch van arbeidsvervanging. Een restaurant koopt geen AI-host om een host te ontslaan. Het koopt er een omdat de telefoon rinkelt tijdens de service, niemand kan opnemen, en de beller ergens anders reserveert. De miljoen oproepen die Yelp Host sinds oktober 2025 heeft afgehandeld, zijn de noemer voor dat argument — en Yelp gaf veelbetekenend niet de teller, namelijk hoeveel van die oproepen reserveringen of bestellingen werden.

Teri Yu, productleider voor multimodale producten bij OpenAI, presenteerde dezelfde uitrol vanuit een ander perspectief: ze beschreef klanten die GPT-Live-1 gebruiken voor alles van reserveringsgesprekken tot het inplannen van reparaties. Beide interpretaties kloppen. Yelp verkoopt de verticale markt; OpenAI verkoopt de horizontale markt.

De economische kant die niemand in de release heeft gestopt

GPT-Live-1 kost $0,05 per minuut spraak, per seconde gefactureerd, en het model werd op 10 september 2026 opengesteld voor ontwikkelaars — dezelfde dag dat de aankondiging van Yelp verscheen. De spraaklaag is het enige dat dat tarief dekt. In de documentatie van OpenAI staat expliciet dat backend-aanroepen die namens het model worden gedaan, inclusief het redeneren en het toolgebruik dat het aan een ander model delegeert, tegen de normale tarieven van dat model worden gefactureerd.

Zet dat eens af tegen het cijfer van Yelp. Een reserveringsoproep voor een restaurant is kort — een paar minuten, soms minder. Een miljoen oproepen van elk twee minuten is ongeveer twee miljoen spraakminuten, of ongeveer $100.000 aan uitgaven voor de spraaklaag over de volledige geschiedenis van het product. Dat is een afrondingsfout voor Yelp, en dat is precies het punt: bij $0,05 per minuut is de spraaklaag niet het dure deel van het systeem. De dure onderdelen zijn de redenering achter elke gespreksbeurt, de telefonie, de integratie met het reserveringsboek van elk restaurant, en de mensen die afhandelen wat de agent niet kan.

Het betekent ook dat het tarief per minuut het verkeerde getal is om over te onderhandelen. Een spraakagent die in één beurt antwoordt omdat hij correct heeft gedelegeerd, kost minder dan een die negentig seconden blijft worstelen, ook al worden beide per seconde gefactureerd. Yelps bewering dat het aantal doorschakelingen daalde is, onder alle vaagheid, een kostenclaim.

De redenering achter de stem is een normale modelaanroep, en die laag is waar een deployment zoals deze daadwerkelijk afstelbaar is. Ongeveer 190 modellen van elf upstream-aanbieders zitten achter één OrcaRouter-sleutel tegen de lijstprijs van de aanbieder zonder markup, met automatische failover wanneer een backend een fout geeft of een timeout krijgt — dus het model dat Yelp-achtige reserveringsredeneringen uitvoert, kan worden verwisseld of A/B-getest tegen live gespreksverkeer door één configuratiewaarde te wijzigen in plaats van de integratie opnieuw op te bouwen. Daar zitten zowel het geld als de kwaliteit; de gefactureerde minuten van de stemlaag zijn relatief vast.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

De data is de slotgracht, niet het model

Elke concurrent kan GPT-Live-1 morgen kopen. Toast, Square, Clover, ServiceTitan en Housecall Pro bedienen allemaal nagenoeg dezelfde klanten, en Google en Alexa+ van Amazon werken aan hetzelfde probleem vanaf de consumentenkant. Niets aan de positie van Yelp hangt af van exclusieve toegang tot het model, en de eigen framing van Yelp — eigen bedrijfsdata plus speciaal ontwikkelde intelligentie, met GPT-Live-1 als de laag die praat — geeft dat toe.

Wat Yelp bezit, is de reserveringsgraaf: welke restaurants tafels hebben, wanneer, voor hoeveel personen, en de opgebouwde consumentenintentie achter een miljoen oproepen. Een model dat onderbroken kan worden is een voorwaarde om die data op schaal te verzamelen, want een beurtgebaseerde agent levert kortere oproepen, meer hangups en vuilere transcripten op. Daarom is de deployment belangrijk, zelfs als de cijfers achtergehouden worden. Full duplex is in deze context geen fijnere gebruikerservaring; het is het mechanisme voor dataverzameling.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

Wat te kijken

Drie dingen zouden dit van een geloofwaardig uitrolverhaal in een meetbaar verhaal veranderen. Yelps volgende winstcall, als het management een cijfer plakt op call deflection of reserveringsconversie. Een tweede vertical die dezelfde integratie aankondigt, wat zou laten zien of full-duplex spraak een breed inzetbare upgrade is of een horeca-specifieke. En de eerste onafhankelijke evaluatie van GPT-Live-1 op een ranglijst die redeneervermogen beoordeelt in plaats van gespreksmechanica — de Artificial Analysis Speech to Speech Index plaatst het momenteel op 70,3%, gelijk met GPT-Live-1 mini en gedeeld zesde op een bord van veertien modellen, achter Gr​ok Voice Think Fast 2.0 High op 79,0% en GPT-Realtime-2.1 High op 73,9%. Yelps eigen architectuur is een impliciete weddenschap dat de spraaklaag en de redeneerlaag apart beoordeeld moeten worden. Onafhankelijke beoordeling is tot nu toe eens met de tweede helft van die weddenschap en niet met de eerste.

Totdat Yelp publiceert wat er is veranderd, leest de rest van ons een uitrolaankondiging over de architectuur ervan in plaats van over de resultaten. Dat is nog steeds de moeite waard, want de architectuur is het onderdeel dat andere teams dit kwartaal kunnen kopiëren.