
Yelp ha messo GPT-Live-1 dietro a un milione di chiamate ai ristoranti — e non vuole dire cosa ha comprato
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Yelp afferma di aver gestito più di un milione di chiamate ai ristoranti tramite Yelp Host da ottobre 2025 e che, a partire dal 10 settembre 2026, tali chiamate funzionano su GPT-Live-1, il modello vocale full-duplex di OpenAI. Lo stesso annuncio colloca GPT-Live-1 all'interno di Hatch, la piattaforma di comunicazione con AI di Yelp per le aziende di servizi, che l'azienda descrive come in grado di gestire decine di milioni di lead tramite voce, testo, email e web. Si tratta della più grande implementazione in produzione di un modello vocale full-duplex mai annunciata da alcuno — ed è arrivata avvolta nel comunicato stampa meno quantificato che Yelp avrebbe potuto scrivere. Yelp riferisce che la gestione delle chiamate è migliorata e che i trasferimenti di chiamata sono diminuiti. Non dice di quanto, su quante chiamate, né quanto sia costato tutto ciò.
Entrambi i fatti contano. La messa in produzione è una prova concreta che un modello che ascolta mentre parla sopravvive al contatto con il traffico telefonico reale, cosa che nessun benchmark può stabilire. Il silenzio è una prova concreta che i numeri dello stesso fornitore non erano abbastanza lusinghieri da essere pubblicati — o che gli obblighi di informativa di Yelp verso gli investitori sono più ristretti della sua propensione al marketing.
Cosa ha effettivamente rilasciato Yelp
L'architettura è la parte che vale la pena capire, perché non è un modello vocale di Yelp. GPT-Live-1 è lo strato vocale front-end: è ciò con cui parla chi chiama, ed è ciò che decide quando continuare ad ascoltare, quando prendere il turno e quando cedere. Sotto si trovano i dati aziendali di Yelp e quella che l'azienda chiama intelligenza creata appositamente — gli orari del ristorante, la disponibilità delle prenotazioni, il menù, le specialità, le aree di ristorazione e lo stato attuale del sistema di prenotazioni.
Questa separazione è l'intero prodotto. GPT-Live-1 non sa se esiste un tavolo per quattro alle 7:30 di un venerdì. Sa come intavolare la conversazione che lo scopre. Il compito del modello è far sembrare lo scambio una telefonata anziché un albero di menu; il compito di Yelp è rendere corretta la risposta.
Le affermazioni comportamentali dichiarate da Yelp sono specifiche nel tipo e vaghe nel grado. Chi chiama può interrompere, cambiare argomento a metà frase o parlare sopra il rumore di fondo, e il modello si adatta. Il sistema rileva il tono di chi chiama — entusiasmo, frustrazione, impazienza — e risponde di conseguenza. Sovrapporre i potenziamenti linguistici di Yelp a GPT-Live-1 consente di rilevare e rispondere a chi chiama in quasi qualsiasi lingua, il che affronta un vero problema dei ristoranti: una chiamata persa perché nessuno in turno parla la lingua di chi chiama è una prenotazione persa, non una cattiva esperienza.
Le due affermazioni operative sono quelle per cui un gestore di ristorante sarebbe disposto a pagare davvero. Yelp afferma che ora chi chiama si esprime con frasi complete e naturali invece che con brevi comandi vocali, e che la precisione della trascrizione post-chiamata è migliorata, offrendo ai gestori registri più puliti. La prima è un indicatore anticipatore del fatto che le persone hanno smesso di trattare l’agente come una macchina da aggirare con le parole. La seconda è quella dal valore cumulativo, perché ciò che produce una linea prenotazioni non è solo una prenotazione — è un registro, e un registro che nessuno può leggere è un registro su cui nessuno può agire.

Akhil Kuduvalli Ramesh ha detto la cosa utile
Il chief product officer di Yelp ha rilasciato la dichiarazione di rito — ogni chiamata più conversazionale e reattiva, esperienze eccezionali per gli ospiti, personale libero di servire gli ospiti invece di rispondere al telefono — e poi una frase che vale più del resto del comunicato. Yelp Host, ha detto, cattura "opportunità di ricavo che altrimenti avrebbero potuto perdere".
Questa è la presentazione onesta degli agenti vocali nel settore dell'ospitalità, e si tratta di un'affermazione diversa dal solito discorso di sostituzione del lavoro. Un ristorante non acquista un host AI per licenziare un host. Lo acquista perché il telefono squilla durante il servizio, nessuno può rispondere e chi chiama prenota altrove. Il milione di chiamate gestite da Yelp Host da ottobre 2025 è il denominatore di questo ragionamento — e Yelp, con una certa intenzione, non ha fornito il numeratore, cioè quante di quelle chiamate si sono trasformate in prenotazioni o ordini.
Teri Yu, responsabile dei prodotti multimodali di OpenAI, ha inquadrato lo stesso impiego nell'altro modo, descrivendo clienti che usano GPT-Live-1 per tutto, dalle chiamate per prenotazioni alla programmazione di riparazioni. Entrambe le letture sono vere. Yelp vende il verticale; OpenAI vende l'orizzontale.
L'economia che nessuno ha messo nel comunicato
GPT-Live-1 costa $0,05 al minuto di voce, con fatturazione al secondo, e il modello è stato reso disponibile agli sviluppatori il 10 settembre 2026 — lo stesso giorno in cui è arrivato l'annuncio di Yelp. Il livello vocale è l'unica cosa coperta da quella tariffa. La documentazione di OpenAI specifica esplicitamente che le chiamate backend effettuate per conto del modello, incluse le attività di ragionamento e uso degli strumenti che delega a un altro modello, vengono fatturate alle tariffe normali di quel modello.
Rapportalo al numero di Yelp. Una chiamata per la prenotazione di un ristorante è breve: un paio di minuti, a volte meno. Un milione di chiamate da due minuti ciascuna equivale a circa due milioni di minuti vocali, ossia a circa 100.000 dollari di spesa per il livello vocale lungo l'intera storia del prodotto. Per Yelp è un errore di arrotondamento, e questo è il punto: a 0,05 dollari al minuto il livello vocale non è la parte costosa del sistema. Le parti costose sono il ragionamento dietro ogni turno, la telefonia, l'integrazione nel registro delle prenotazioni di ogni ristorante e le persone che gestiscono ciò che l'agente non riesce a fare.
Significa anche che la tariffa al minuto è il numero sbagliato su cui negoziare. Un agente vocale che risponde in un solo turno perché ha delegato correttamente costa meno di uno che annaspa per novanta secondi, anche se entrambi vengono fatturati al secondo. L'affermazione di Yelp secondo cui i trasferimenti sono calati è, dietro la vaghezza, un'affermazione sui costi.
Il ragionamento dietro la voce è una normale chiamata al modello, e quello strato è dove un deployment come questo è effettivamente regolabile. Circa 190 modelli da undici provider upstream si trovano dietro un'unica chiave OrcaRouter al prezzo di listino del provider con zero markup, con failover automatico quando un backend genera un errore o va in timeout — quindi il modello che esegue il ragionamento per prenotazioni in stile Yelp può essere scambiato o testato A/B rispetto al traffico delle chiamate in tempo reale modificando un singolo valore di configurazione invece di ricostruire l'integrazione. È lì che risiedono sia il denaro che la qualità; i minuti misurati del livello vocale sono relativamente fissi.

I dati sono il fossato, non il modello
Qualsiasi concorrente può acquistare GPT-Live-1 domani. Toast, Square, Clover, ServiceTitan e Housecall Pro si rivolgono tutti a clienti sufficientemente simili, e Google e Alexa+ di Amazon stanno affrontando lo stesso problema dal lato consumatore. Nulla nella posizione di Yelp dipende dall'accesso esclusivo al modello, e la stessa impostazione di Yelp — dati aziendali proprietari più intelligenza creata ad hoc, con GPT-Live-1 come livello che comunica — lo ammette.
Ciò che Yelp possiede è il grafo delle prenotazioni: quali ristoranti hanno tavoli, quando, per quanti, e l’intento accumulato dei consumatori dietro un milione di chiamate. Un modello che può essere interrotto è un prerequisito per raccogliere quei dati su larga scala, perché un agente a turni produce chiamate più brevi, più riagganci e trascrizioni più sporche. Ecco perché il deployment conta anche quando i numeri non vengono resi noti. Il full duplex non è un’esperienza utente più piacevole in questo contesto; è il meccanismo di raccolta dei dati.

Cosa guardare
Tre cose trasformerebbero questa da una storia di distribuzione credibile in una misurabile. La prossima chiamata sugli utili di Yelp, se il management attribuisce un numero alla deviazione delle chiamate o alla conversione delle prenotazioni. Un secondo settore verticale che annuncia la stessa integrazione, il che mostrerebbe se la voce full-duplex è un aggiornamento general-purpose o specifico per l'ospitalità. E la prima valutazione indipendente di GPT-Live-1 su una classifica che valuta il ragionamento piuttosto che la meccanica conversazionale — l'Artificial Analysis Speech to Speech Index attualmente lo colloca al 70,3%, allo stesso livello di GPT-Live-1 mini e sesto a pari merito su una classifica di quattordici modelli, dietro a Grok Voice Think Fast 2.0 High al 79,0% e GPT-Realtime-2.1 High al 73,9%. L'architettura stessa di Yelp è una scommessa implicita che lo strato vocale e lo strato di ragionamento dovrebbero essere valutati separatamente. Il punteggio indipendente, finora, concorda con la seconda metà di quella scommessa e non con la prima.
Finché Yelp non pubblica cosa è cambiato, noi altri stiamo leggendo un annuncio di deployment per la sua architettura anziché per i suoi risultati. Vale comunque la pena farlo, perché l'architettura è la parte che altre squadre possono copiare questo trimestre.
