Hero-titelkort för 'Yelp placerade GPT-Live-1 bakom en miljon restaurangsamtal', med undertexten 'Den första storskaliga driftsättningen av full-duplex-röst, utan några siffror angivna', med tre kort som lyder 'Yelp Host: 1 000 000+ restaurangsamtal sedan oktober 2025', 'GPT-Live-1: 0,05 USD per röstminut, backend-resonemang faktureras separat', 'Redovisad påverkan: endast vägledande – inga siffror för samtalshantering eller överföringar', ovanför en sidfotsremsa med texten 'Siffror för Yelp Host och Hatch är Yelp-rapporterade; prissättning för GPT-Live-1 enligt OpenAI:s dokumentation.' OrcaRouter-logotypen är inkomponerad i nedre högra hörnet.
Guides & Insights

Yelp satte GPT-Live-1 bakom en miljon restaurangsamtal – och vill inte säga vad man köpte

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Yelp säger att man har hanterat över en miljon restaurangsamtal via Yelp Host sedan oktober 2025, och att dessa samtal från och med den 10 september 2026 körs på GPT-Live-1, OpenAIs full-duplex-röstmodell. Samma tillkännagivande placerar GPT-Live-1 i Hatch, Yelps AI-kommunikationsplattform för serviceföretag, som enligt företaget hanterar tiotals miljoner leads över röst, text, e-post och webb. Det är den största produktionsdriftsättningen av en full-duplex-talmodell som någon har tillkännagivit – och den kom inlindad i det minst kvantifierade pressmeddelande Yelp hade kunnat skriva. Yelp rapporterar att samtalshanteringen förbättrades och att samtalsöverföringarna minskade. Det står inte med hur mycket, på hur många samtal, eller vad något av det kostade.

Båda fakta spelar roll. Driftsättningen är ett verkligt bevis på att en modell som lyssnar medan den talar överlever kontakt med verklig telefontrafik, vilket är mer än vad någon benchmark kan fastställa. Tystnaden är ett verkligt bevis på att leverantörens egna siffror inte var tillräckligt smickrande för att publicera — eller att Yelps upplysningsskyldigheter gentemot investerare är snävare än dess marknadsföringsaptit.

Vad Yelp faktiskt lanserade

Arkitekturen är den del som är värd att förstå, eftersom den inte är en Yelp-röstmodell. GPT-Live-1 är det främre röstlagret: det är vad den som ringer pratar med, och det är det som avgör när den ska fortsätta lyssna, när den ska ta sin tur och när den ska lämna över. Under det ligger Yelps egna affärsdata och vad företaget kallar specialbyggd intelligens – restaurangens öppettider, dess bokningstillgänglighet, dess meny, dess specialerbjudanden, dess sittområden och bokningssystemets aktuella status.

Den uppdelningen är hela produkten. GPT-Live-1 vet inte om det finns ett bord för fyra klockan 19.30 en fredag. Den vet hur man har samtalet som tar reda på det. Modellens uppgift är att få utbytet att kännas som ett telefonsamtal snarare än ett menyträd; Yelps uppgift är att göra svaret korrekt.

Yelps uttalade beteendepåståenden är specifika till sin art och vaga till sin grad. Uppringare kan avbryta, byta samtalsämne mitt i en mening eller tala över bakgrundsbrus, och modellen anpassar sig. Systemet uppfattar uppringarens ton – upprymdhet, frustration, otålighet – och svarar därefter. Att lägga Yelps språkförbättringar ovanpå GPT-Live-1 gör att den kan upptäcka och svara uppringare på nästan vilket språk som helst, vilket löser ett verkligt restaurangproblem: ett missat samtal för att ingen i tjänst talar uppringarens språk är en förlorad bokning, inte en dålig upplevelse.

De två operativa påståendena är de som en restaurangoperatör faktiskt skulle betala för. Yelp säger att uppringare nu talar i fullständiga, naturliga meningar snarare än korta röstkommandon, och att transkriberingsnoggrannheten efter samtal har förbättrats, vilket ger operatörer renare register. Det första är en ledande indikator på att människor slutade behandla agenten som en maskin man måste tala runt. Det andra är det med kumulativt värde, eftersom en reservationslinjes utdata inte bara är en bokning — det är ett register, och ett register som ingen kan läsa är ett register som ingen kan agera utifrån.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh sa den användbara saken.

Yelps produktchef levererade det sedvanliga citatet – varje samtal mer samtalsvänligt och lyhört, enastående gästupplevelser, personal som frigörs för att betjäna gäster i stället för att svara i telefon – och sedan en mening som är värd mer än resten av pressmeddelandet. Yelp Host, sade han, fångar "intäktsmöjligheter som de annars kanske hade gått miste om".

Det är den ärliga inramningen för röstagenter inom besöksnäringen, och det är ett annat påstående än den vanliga pitchen om att ersätta arbetskraft. En restaurang köper inte en AI-värd för att sparka en värd. Den köper en därför att telefonen ringer under servicen, ingen kan svara, och den som ringer bokar någon annanstans. Den miljon samtal som Yelp Host har hanterat sedan oktober 2025 är nämnaren i det argumentet – och Yelp lämnade medvetet inte täljaren, som skulle vara hur många av de samtalen som blev bokningar eller beställningar.

Teri Yu, produktchef för multimodala produkter på Open​AI, beskrev samma utrullning på motsatt sätt och berättade om kunder som använder GPT-Live-1 till allt från bokningssamtal till att schemalägga reparationer. Båda tolkningarna är sanna. Yelp säljer vertikalen; Open​AI säljer horisontalen.

Ekonomin som ingen tog med i releasen

GPT-Live-1 kostar $0.05 per minut för röst, fakturerat per sekund, och modellen öppnades för utvecklare den 10 september 2026 — samma dag som Yelps tillkännagivande kom. Röstlagret är det enda som den taxan täcker. Open​AI:s dokumentation är tydlig med att backend-anrop som görs på modellens vägnar, inklusive det resonemang och den verktygsanvändning som den delegerar till en annan modell, faktureras enligt den modellens normala taxor.

Jämför det med Yelps siffra. Ett restaurangbokningssamtal är kort – ett par minuter, ibland mindre. En miljon samtal på två minuter vardera är ungefär två miljoner röstminuter, eller omkring 100 000 dollar i utgifter för röstlagret under produktens hela historia. Det är ett avrundningsfel för Yelp, och det är själva poängen: vid 0,05 dollar per minut är röstlagret inte den dyra delen av systemet. De dyra delarna är resonemanget bakom varje tur, telefonin, integrationen i varje restaurangs reservationsbok och människorna som hanterar det agenten inte klarar.

Det innebär också att minuttaxan är fel siffra att förhandla om. En röstagent som svarar i en enda taltur eftersom den delegerade korrekt kostar mindre än en som famlar i nittio sekunder, trots att båda debiteras per sekund. Yelps påstående att vidarekopplingarna minskade är, bakom otydligheten, ett påstående om kostnader.

Resonemanget bakom rösten är ett vanligt modellanrop, och det lagret är där en distribution som denna faktiskt är justerbar. Runt 190 modeller från elva uppströmsleverantörer ligger bakom en enda OrcaRouter-nyckel till leverantörens listpris utan påslag, med automatisk failover när en backend ger fel eller tar timeout – så modellen som utför Yelp-liknande bokningsresonemang kan bytas ut eller A/B-testas mot livedriven samtaltrafik genom att ändra ett enda konfigurationsvärde i stället för att bygga om integrationen. Det är där både pengarna och kvaliteten finns; röstlagrets uppmätta minuter är jämförelsevis fasta.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

Datan är vallgraven, inte modellen

Vilken konkurrent som helst kan köpa GPT-Live-1 i morgon. Toast, Square, Clover, ServiceTitan och Housecall Pro ligger alla tillräckligt nära samma kunder, och Goog​le och Amazons Alexa+ arbetar med samma problem från konsumentsidan. Inget i Yelps position beror på exklusiv tillgång till modellen, och Yelps egen inramning – proprietära affärsdata plus specialbyggd intelligens, med GPT-Live-1 som lagret som kommunicerar – medger det.

Det Yelp äger är reservationsgrafen: vilka restauranger som har bord, när, för hur många, och den ackumulerade konsumentavsikten bakom en miljon samtal. En modell som kan avbrytas är en förutsättning för att samla in dessa data i stor skala, eftersom en turbaserad agent producerar kortare samtal, fler avbrott och stökigare transkript. Det är därför driftsättningen spelar roll även när siffrorna undanhålls. Full duplex är inte en trevligare användarupplevelse i detta sammanhang; det är mekanismen för datainsamling.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

Vad du ska titta på

Tre saker skulle förvandla detta från en trovärdig driftsättningshistoria till en mätbar sådan. Yelps nästa resultatkonferens, om ledningen sätter en siffra på samtalsavledning eller konvertering av reservationer. En andra branschvertikal som tillkännager samma integration, vilket skulle visa om full-duplex-röst är en generell uppgradering eller en besöksnäringsspecifik sådan. Och den första oberoende utvärderingen av GPT-Live-1 på en resultattavla som poängsätter resonemang snarare än samtalsmekanik — Artificial Analysis Speech to Speech Index placerar för närvarande den på 70,3 %, i nivå med GPT-Live-1 mini och delad sjätteplats på en resultattavla med fjorton modeller, efter Gr​ok Voice Think Fast 2.0 High på 79,0 % och GPT-Realtime-2.1 High på 73,9 %. Yelps egen arkitektur är en implicit satsning på att röstlagret och resonemangslagret bör bedömas separat. Oberoende poängsättning instämmer hittills med den andra halvan av den satsningen och inte den första.

Tills Yelp publicerar vad som har ändrats läser vi andra ett utrullningsmeddelande som handlar om arkitekturen snarare än resultaten. Det är fortfarande värt att göra, eftersom arkitekturen är den del som andra team kan kopiera det här kvartalet.