
Yelp zette GPT-Live-1 achter een miljoen restaurantoproepen — en wil niet zeggen wat het heeft gekocht
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Yelp zegt dat het sinds oktober 2025 meer dan een miljoen restaurantgesprekken via Yelp Host heeft afgehandeld, en dat die gesprekken sinds 10 september 2026 draaien op GPT-Live-1, OpenAI's full-duplex spraakmodel. In dezelfde aankondiging wordt GPT-Live-1 in Hatch geplaatst, het AI-communicatieplatform van Yelp voor dienstverlenende bedrijven, dat volgens het bedrijf tientallen miljoenen leads beheert via spraak, tekst, e-mail en web. Dat is de grootste productie-implementatie van een full-duplex spraakmodel die ooit iemand heeft aangekondigd — en die kwam verpakt in het minst gekwantificeerde persbericht dat Yelp had kunnen schrijven. Yelp meldt dat de gespreksafhandeling verbeterde en dat gespreksoverdrachten daalden. Het zegt niet met hoeveel, bij hoeveel gesprekken, of wat het allemaal kostte.
Beide feiten doen ertoe. De uitrol is concreet bewijs dat een model dat luistert terwijl het praat, contact met echt telefoonverkeer overleeft, wat meer is dan welke benchmark dan ook kan aantonen. Het stilzwijgen is concreet bewijs dat de eigen cijfers van de leverancier niet flatteus genoeg waren om te publiceren — of dat Yelps openbaarmakingsverplichtingen jegens investeerders beperkter zijn dan zijn marketinghonger.
Wat Yelp eigenlijk uitbracht
De architectuur is het deel dat het begrijpen waard is, want het is geen Yelp-spraakmodel. GPT-Live-1 is de front-end spraaklaag: het is waar de beller mee praat, en het is wat bepaalt wanneer het moet blijven luisteren, wanneer het de beurt moet nemen en wanneer het die moet afstaan. Daaronder bevinden zich Yelps eigen bedrijfsgegevens en wat het bedrijf purpose-built intelligence noemt — de openingstijden van het restaurant, de beschikbaarheid voor reserveringen, het menu, de specials, de zitgedeelten en de huidige status van het reserveringssysteem.
Die splitsing is het hele product. GPT-Live-1 weet niet of er op een vrijdag om 7:30 een tafel voor vier beschikbaar is. Het weet hoe het een gesprek moet voeren waarmee het daarachter komt. De taak van het model is om de uitwisseling als een telefoongesprek te laten aanvoelen in plaats van als een menuboom; de taak van Yelp is om het antwoord correct te maken.
Yelps geformuleerde gedragsclaims zijn specifiek van aard en vaag in mate. Bellers kunnen onderbreken, midden in een zin van onderwerp veranderen of door achtergrondgeluid heen praten, en het model past zich aan. Het systeem detecteert de toon van de beller — opwinding, frustratie, ongeduld — en reageert daarop. Door de taalverbeteringen van Yelp boven op GPT-Live-1 te stapelen, kan het bellers in vrijwel elke taal detecteren en beantwoorden, wat een echt restaurantprobleem aanpakt: een gemiste oproep omdat niemand die op dat moment werkt de taal van de beller spreekt, is een verloren reservering, niet een slechte ervaring.
De twee operationele claims zijn de claims waarvoor een restauranteigenaar daadwerkelijk zou betalen. Yelp zegt dat bellers nu in volledige, natuurlijke zinnen spreken in plaats van in korte spraakopdrachten, en dat de nauwkeurigheid van de transcriptie na het gesprek is verbeterd, wat exploitanten schonere registraties oplevert. De eerste is een voorlopende indicator dat mensen de agent niet langer behandelen als een machine waar je omheen moet praten. De tweede is degene met de zich opstapelende waarde, want de output van een reserveringslijn is niet alleen een boeking — het is een registratie, en een registratie die niemand kan lezen is een registratie waarop niemand kan handelen.

Akhil Kuduvalli Ramesh zei het nuttige ding
De chief product officer van Yelp gaf het standaardcitaat — elk telefoongesprek conversationeler en responsiever, uitzonderlijke gastervaringen, personeel vrijgespeeld om gasten te bedienen in plaats van de telefoon op te nemen — en dan één zin die meer waard is dan de rest van het persbericht. Yelp Host, zei hij, benut "omzetkansen die ze anders wellicht hadden gemist."
Dat is de eerlijke framing voor voice-agents in de horeca, en het is een andere claim dan de gebruikelijke pitch van arbeidsvervanging. Een restaurant koopt geen AI-host om een host te ontslaan. Het koopt er een omdat de telefoon rinkelt tijdens de service, niemand kan opnemen, en de beller ergens anders reserveert. De miljoen oproepen die Yelp Host sinds oktober 2025 heeft afgehandeld, zijn de noemer voor dat argument — en Yelp gaf veelbetekenend niet de teller, namelijk hoeveel van die oproepen reserveringen of bestellingen werden.
Teri Yu, productleider voor multimodale producten bij OpenAI, presenteerde dezelfde uitrol vanuit een ander perspectief: ze beschreef klanten die GPT-Live-1 gebruiken voor alles van reserveringsgesprekken tot het inplannen van reparaties. Beide interpretaties kloppen. Yelp verkoopt de verticale markt; OpenAI verkoopt de horizontale markt.
De economische kant die niemand in de release heeft gestopt
GPT-Live-1 kost $0,05 per minuut spraak, per seconde gefactureerd, en het model werd op 10 september 2026 opengesteld voor ontwikkelaars — dezelfde dag dat de aankondiging van Yelp verscheen. De spraaklaag is het enige dat dat tarief dekt. In de documentatie van OpenAI staat expliciet dat backend-aanroepen die namens het model worden gedaan, inclusief het redeneren en het toolgebruik dat het aan een ander model delegeert, tegen de normale tarieven van dat model worden gefactureerd.
Zet dat eens af tegen het cijfer van Yelp. Een reserveringsoproep voor een restaurant is kort — een paar minuten, soms minder. Een miljoen oproepen van elk twee minuten is ongeveer twee miljoen spraakminuten, of ongeveer $100.000 aan uitgaven voor de spraaklaag over de volledige geschiedenis van het product. Dat is een afrondingsfout voor Yelp, en dat is precies het punt: bij $0,05 per minuut is de spraaklaag niet het dure deel van het systeem. De dure onderdelen zijn de redenering achter elke gespreksbeurt, de telefonie, de integratie met het reserveringsboek van elk restaurant, en de mensen die afhandelen wat de agent niet kan.
Het betekent ook dat het tarief per minuut het verkeerde getal is om over te onderhandelen. Een spraakagent die in één beurt antwoordt omdat hij correct heeft gedelegeerd, kost minder dan een die negentig seconden blijft worstelen, ook al worden beide per seconde gefactureerd. Yelps bewering dat het aantal doorschakelingen daalde is, onder alle vaagheid, een kostenclaim.
De redenering achter de stem is een normale modelaanroep, en die laag is waar een deployment zoals deze daadwerkelijk afstelbaar is. Ongeveer 190 modellen van elf upstream-aanbieders zitten achter één OrcaRouter-sleutel tegen de lijstprijs van de aanbieder zonder markup, met automatische failover wanneer een backend een fout geeft of een timeout krijgt — dus het model dat Yelp-achtige reserveringsredeneringen uitvoert, kan worden verwisseld of A/B-getest tegen live gespreksverkeer door één configuratiewaarde te wijzigen in plaats van de integratie opnieuw op te bouwen. Daar zitten zowel het geld als de kwaliteit; de gefactureerde minuten van de stemlaag zijn relatief vast.

De data is de slotgracht, niet het model
Elke concurrent kan GPT-Live-1 morgen kopen. Toast, Square, Clover, ServiceTitan en Housecall Pro bedienen allemaal nagenoeg dezelfde klanten, en Google en Alexa+ van Amazon werken aan hetzelfde probleem vanaf de consumentenkant. Niets aan de positie van Yelp hangt af van exclusieve toegang tot het model, en de eigen framing van Yelp — eigen bedrijfsdata plus speciaal ontwikkelde intelligentie, met GPT-Live-1 als de laag die praat — geeft dat toe.
Wat Yelp bezit, is de reserveringsgraaf: welke restaurants tafels hebben, wanneer, voor hoeveel personen, en de opgebouwde consumentenintentie achter een miljoen oproepen. Een model dat onderbroken kan worden is een voorwaarde om die data op schaal te verzamelen, want een beurtgebaseerde agent levert kortere oproepen, meer hangups en vuilere transcripten op. Daarom is de deployment belangrijk, zelfs als de cijfers achtergehouden worden. Full duplex is in deze context geen fijnere gebruikerservaring; het is het mechanisme voor dataverzameling.

Wat te kijken
Drie dingen zouden dit van een geloofwaardig uitrolverhaal in een meetbaar verhaal veranderen. Yelps volgende winstcall, als het management een cijfer plakt op call deflection of reserveringsconversie. Een tweede vertical die dezelfde integratie aankondigt, wat zou laten zien of full-duplex spraak een breed inzetbare upgrade is of een horeca-specifieke. En de eerste onafhankelijke evaluatie van GPT-Live-1 op een ranglijst die redeneervermogen beoordeelt in plaats van gespreksmechanica — de Artificial Analysis Speech to Speech Index plaatst het momenteel op 70,3%, gelijk met GPT-Live-1 mini en gedeeld zesde op een bord van veertien modellen, achter Grok Voice Think Fast 2.0 High op 79,0% en GPT-Realtime-2.1 High op 73,9%. Yelps eigen architectuur is een impliciete weddenschap dat de spraaklaag en de redeneerlaag apart beoordeeld moeten worden. Onafhankelijke beoordeling is tot nu toe eens met de tweede helft van die weddenschap en niet met de eerste.
Totdat Yelp publiceert wat er is veranderd, leest de rest van ons een uitrolaankondiging over de architectuur ervan in plaats van over de resultaten. Dat is nog steeds de moeite waard, want de architectuur is het onderdeel dat andere teams dit kwartaal kunnen kopiëren.
