Scheda del titolo principale per 'Yelp ha messo GPT-Live-1 dietro un milione di chiamate ai ristoranti', con sottotitolo 'La prima implementazione su larga scala di voce full-duplex, senza dati numerici a corredo', con tre schede che recitano 'Yelp Host: oltre 1.000.000 di chiamate ai ristoranti da ottobre 2025', 'GPT-Live-1: 0,05 $ al minuto di voce, ragionamento backend fatturato separatamente', 'Impatto divulgato: solo indicativo — nessun dato sulla gestione delle chiamate o sui trasferimenti', sopra una striscia di piè di pagina che recita 'I dati di Yelp Host e Hatch sono riportati da Yelp; il prezzo di GPT-Live-1 secondo la documentazione OpenAI.' Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Yelp ha messo GPT-Live-1 dietro a un milione di chiamate ai ristoranti — e non vuole dire cosa ha comprato

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Yelp afferma di aver gestito più di un milione di chiamate ai ristoranti tramite Yelp Host da ottobre 2025 e che, a partire dal 10 settembre 2026, tali chiamate funzionano su GPT-Live-1, il modello vocale full-duplex di OpenAI. Lo stesso annuncio colloca GPT-Live-1 all'interno di Hatch, la piattaforma di comunicazione con AI di Yelp per le aziende di servizi, che l'azienda descrive come in grado di gestire decine di milioni di lead tramite voce, testo, email e web. Si tratta della più grande implementazione in produzione di un modello vocale full-duplex mai annunciata da alcuno — ed è arrivata avvolta nel comunicato stampa meno quantificato che Yelp avrebbe potuto scrivere. Yelp riferisce che la gestione delle chiamate è migliorata e che i trasferimenti di chiamata sono diminuiti. Non dice di quanto, su quante chiamate, né quanto sia costato tutto ciò.

Entrambi i fatti contano. La messa in produzione è una prova concreta che un modello che ascolta mentre parla sopravvive al contatto con il traffico telefonico reale, cosa che nessun benchmark può stabilire. Il silenzio è una prova concreta che i numeri dello stesso fornitore non erano abbastanza lusinghieri da essere pubblicati — o che gli obblighi di informativa di Yelp verso gli investitori sono più ristretti della sua propensione al marketing.

Cosa ha effettivamente rilasciato Yelp

L'architettura è la parte che vale la pena capire, perché non è un modello vocale di Yelp. GPT-Live-1 è lo strato vocale front-end: è ciò con cui parla chi chiama, ed è ciò che decide quando continuare ad ascoltare, quando prendere il turno e quando cedere. Sotto si trovano i dati aziendali di Yelp e quella che l'azienda chiama intelligenza creata appositamente — gli orari del ristorante, la disponibilità delle prenotazioni, il menù, le specialità, le aree di ristorazione e lo stato attuale del sistema di prenotazioni.

Questa separazione è l'intero prodotto. GPT-Live-1 non sa se esiste un tavolo per quattro alle 7:30 di un venerdì. Sa come intavolare la conversazione che lo scopre. Il compito del modello è far sembrare lo scambio una telefonata anziché un albero di menu; il compito di Yelp è rendere corretta la risposta.

Le affermazioni comportamentali dichiarate da Yelp sono specifiche nel tipo e vaghe nel grado. Chi chiama può interrompere, cambiare argomento a metà frase o parlare sopra il rumore di fondo, e il modello si adatta. Il sistema rileva il tono di chi chiama — entusiasmo, frustrazione, impazienza — e risponde di conseguenza. Sovrapporre i potenziamenti linguistici di Yelp a GPT-Live-1 consente di rilevare e rispondere a chi chiama in quasi qualsiasi lingua, il che affronta un vero problema dei ristoranti: una chiamata persa perché nessuno in turno parla la lingua di chi chiama è una prenotazione persa, non una cattiva esperienza.

Le due affermazioni operative sono quelle per cui un gestore di ristorante sarebbe disposto a pagare davvero. Yelp afferma che ora chi chiama si esprime con frasi complete e naturali invece che con brevi comandi vocali, e che la precisione della trascrizione post-chiamata è migliorata, offrendo ai gestori registri più puliti. La prima è un indicatore anticipatore del fatto che le persone hanno smesso di trattare l’agente come una macchina da aggirare con le parole. La seconda è quella dal valore cumulativo, perché ciò che produce una linea prenotazioni non è solo una prenotazione — è un registro, e un registro che nessuno può leggere è un registro su cui nessuno può agire.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh ha detto la cosa utile

Il chief product officer di Yelp ha rilasciato la dichiarazione di rito — ogni chiamata più conversazionale e reattiva, esperienze eccezionali per gli ospiti, personale libero di servire gli ospiti invece di rispondere al telefono — e poi una frase che vale più del resto del comunicato. Yelp Host, ha detto, cattura "opportunità di ricavo che altrimenti avrebbero potuto perdere".

Questa è la presentazione onesta degli agenti vocali nel settore dell'ospitalità, e si tratta di un'affermazione diversa dal solito discorso di sostituzione del lavoro. Un ristorante non acquista un host AI per licenziare un host. Lo acquista perché il telefono squilla durante il servizio, nessuno può rispondere e chi chiama prenota altrove. Il milione di chiamate gestite da Yelp Host da ottobre 2025 è il denominatore di questo ragionamento — e Yelp, con una certa intenzione, non ha fornito il numeratore, cioè quante di quelle chiamate si sono trasformate in prenotazioni o ordini.

Teri Yu, responsabile dei prodotti multimodali di Open​AI, ha inquadrato lo stesso impiego nell'altro modo, descrivendo clienti che usano GPT-Live-1 per tutto, dalle chiamate per prenotazioni alla programmazione di riparazioni. Entrambe le letture sono vere. Yelp vende il verticale; Open​AI vende l'orizzontale.

L'economia che nessuno ha messo nel comunicato

GPT-Live-1 costa $0,05 al minuto di voce, con fatturazione al secondo, e il modello è stato reso disponibile agli sviluppatori il 10 settembre 2026 — lo stesso giorno in cui è arrivato l'annuncio di Yelp. Il livello vocale è l'unica cosa coperta da quella tariffa. La documentazione di OpenAI specifica esplicitamente che le chiamate backend effettuate per conto del modello, incluse le attività di ragionamento e uso degli strumenti che delega a un altro modello, vengono fatturate alle tariffe normali di quel modello.

Rapportalo al numero di Yelp. Una chiamata per la prenotazione di un ristorante è breve: un paio di minuti, a volte meno. Un milione di chiamate da due minuti ciascuna equivale a circa due milioni di minuti vocali, ossia a circa 100.000 dollari di spesa per il livello vocale lungo l'intera storia del prodotto. Per Yelp è un errore di arrotondamento, e questo è il punto: a 0,05 dollari al minuto il livello vocale non è la parte costosa del sistema. Le parti costose sono il ragionamento dietro ogni turno, la telefonia, l'integrazione nel registro delle prenotazioni di ogni ristorante e le persone che gestiscono ciò che l'agente non riesce a fare.

Significa anche che la tariffa al minuto è il numero sbagliato su cui negoziare. Un agente vocale che risponde in un solo turno perché ha delegato correttamente costa meno di uno che annaspa per novanta secondi, anche se entrambi vengono fatturati al secondo. L'affermazione di Yelp secondo cui i trasferimenti sono calati è, dietro la vaghezza, un'affermazione sui costi.

Il ragionamento dietro la voce è una normale chiamata al modello, e quello strato è dove un deployment come questo è effettivamente regolabile. Circa 190 modelli da undici provider upstream si trovano dietro un'unica chiave OrcaRouter al prezzo di listino del provider con zero markup, con failover automatico quando un backend genera un errore o va in timeout — quindi il modello che esegue il ragionamento per prenotazioni in stile Yelp può essere scambiato o testato A/B rispetto al traffico delle chiamate in tempo reale modificando un singolo valore di configurazione invece di ricostruire l'integrazione. È lì che risiedono sia il denaro che la qualità; i minuti misurati del livello vocale sono relativamente fissi.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

I dati sono il fossato, non il modello

Qualsiasi concorrente può acquistare GPT-Live-1 domani. Toast, Square, Clover, ServiceTitan e Housecall Pro si rivolgono tutti a clienti sufficientemente simili, e Google e Alexa+ di Amazon stanno affrontando lo stesso problema dal lato consumatore. Nulla nella posizione di Yelp dipende dall'accesso esclusivo al modello, e la stessa impostazione di Yelp — dati aziendali proprietari più intelligenza creata ad hoc, con GPT-Live-1 come livello che comunica — lo ammette.

Ciò che Yelp possiede è il grafo delle prenotazioni: quali ristoranti hanno tavoli, quando, per quanti, e l’intento accumulato dei consumatori dietro un milione di chiamate. Un modello che può essere interrotto è un prerequisito per raccogliere quei dati su larga scala, perché un agente a turni produce chiamate più brevi, più riagganci e trascrizioni più sporche. Ecco perché il deployment conta anche quando i numeri non vengono resi noti. Il full duplex non è un’esperienza utente più piacevole in questo contesto; è il meccanismo di raccolta dei dati.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

Cosa guardare

Tre cose trasformerebbero questa da una storia di distribuzione credibile in una misurabile. La prossima chiamata sugli utili di Yelp, se il management attribuisce un numero alla deviazione delle chiamate o alla conversione delle prenotazioni. Un secondo settore verticale che annuncia la stessa integrazione, il che mostrerebbe se la voce full-duplex è un aggiornamento general-purpose o specifico per l'ospitalità. E la prima valutazione indipendente di GPT-Live-1 su una classifica che valuta il ragionamento piuttosto che la meccanica conversazionale — l'Artificial Analysis Speech to Speech Index attualmente lo colloca al 70,3%, allo stesso livello di GPT-Live-1 mini e sesto a pari merito su una classifica di quattordici modelli, dietro a Gr​ok Voice Think Fast 2.0 High al 79,0% e GPT-Realtime-2.1 High al 73,9%. L'architettura stessa di Yelp è una scommessa implicita che lo strato vocale e lo strato di ragionamento dovrebbero essere valutati separatamente. Il punteggio indipendente, finora, concorda con la seconda metà di quella scommessa e non con la prima.

Finché Yelp non pubblica cosa è cambiato, noi altri stiamo leggendo un annuncio di deployment per la sua architettura anziché per i suoi risultati. Vale comunque la pena farlo, perché l'architettura è la parte che altre squadre possono copiare questo trimestre.