
Yelp Menempatkan GPT-Live-1 di Balik Sejuta Panggilan Restoran — dan Tidak Mau Mengatakan Apa yang Dibeli
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Yelp mengatakan telah menangani lebih dari satu juta panggilan restoran melalui Yelp Host sejak Oktober 2025, dan bahwa per 10 September 2026 panggilan-panggilan tersebut berjalan di atas GPT-Live-1, model suara dupleks penuh milik OpenAI. Pengumuman yang sama menempatkan GPT-Live-1 di dalam Hatch, platform komunikasi AI Yelp untuk bisnis jasa, yang oleh perusahaan tersebut digambarkan mengelola puluhan juta prospek di seluruh kanal suara, teks, email, dan web. Itu adalah penerapan produksi terbesar dari model ucapan dupleks penuh yang pernah diumumkan siapa pun — dan kedatangannya dibungkus dalam siaran pers paling minim kuantifikasi yang bisa ditulis Yelp. Yelp melaporkan bahwa penanganan panggilan membaik dan pengalihan panggilan menurun. Tidak disebutkan seberapa besar peningkatannya, pada berapa banyak panggilan, atau berapa biaya semuanya.
Kedua fakta itu penting. Penerapan itu adalah bukti nyata bahwa model yang mendengarkan sambil berbicara mampu bertahan saat bersentuhan dengan lalu lintas telepon yang sesungguhnya, sesuatu yang lebih dari yang mampu ditetapkan oleh tolok ukur mana pun. Diamnya adalah bukti nyata bahwa angka-angka vendor sendiri tidak cukup menyanjung untuk dipublikasikan — atau bahwa kewajiban pengungkapan Yelp kepada investor lebih sempit daripada selera pemasarannya.
Apa yang sebenarnya dirilis Yelp
Arsitekturnya adalah bagian yang layak dipahami, karena ini bukan model suara Yelp. GPT-Live-1 adalah lapisan suara front-end: inilah yang diajak bicara oleh penelepon, dan inilah yang menentukan kapan harus terus mendengarkan, kapan harus mengambil giliran, dan kapan harus menyerahkan giliran. Di bawahnya terdapat data bisnis milik Yelp sendiri dan apa yang oleh perusahaan disebut kecerdasan yang dibangun khusus — jam operasional restoran, ketersediaan reservasinya, menunya, menu spesialnya, area tempat duduknya, dan status terkini sistem reservasi.
Pembagian itulah keseluruhan produknya. GPT-Live-1 tidak tahu apakah ada meja untuk empat orang pada pukul 7:30 di hari Jumat. Ia tahu cara melakukan percakapan yang menemukannya. Tugas model adalah membuat pertukaran itu terasa seperti panggilan telepon, bukan pohon menu; tugas Yelp adalah membuat jawabannya benar.
Klaim perilaku yang dinyatakan Yelp spesifik dalam jenis dan kabur dalam tingkat. Penelepon dapat menyela, mengganti topik di tengah kalimat, atau berbicara di atas kebisingan latar, dan model menyesuaikan diri. Sistem mendeteksi nada penelepon — kegembiraan, frustrasi, ketidaksabaran — dan merespons dengan sesuai. Melapisi peningkatan bahasa Yelp di atas GPT-Live-1 memungkinkannya mendeteksi dan menjawab penelepon dalam hampir semua bahasa, yang mengatasi masalah nyata restoran: panggilan tak terjawab karena tidak ada petugas shift yang berbicara bahasa penelepon adalah pemesanan yang hilang, bukan pengalaman buruk.
Dua klaim operasional itulah yang sebenarnya mau dibayar oleh operator restoran. Yelp mengatakan penelepon kini berbicara dengan kalimat lengkap dan natural, bukan perintah suara yang singkat, dan akurasi transkripsi pascapanggilan meningkat, sehingga memberi operator catatan yang lebih bersih. Yang pertama adalah indikator awal bahwa orang berhenti memperlakukan agen sebagai mesin yang harus diakali dalam percakapan. Yang kedua adalah yang nilai manfaatnya berlipat, karena keluaran dari saluran reservasi bukan hanya pemesanan — melainkan sebuah catatan, dan catatan yang tidak bisa dibaca siapa pun adalah catatan yang tidak bisa ditindaklanjuti oleh siapa pun.

Akhil Kuduvalli Ramesh mengatakan hal yang berguna
Chief Product Officer Yelp memberikan kutipan standar — setiap panggilan lebih bersifat percakapan dan responsif, pengalaman tamu yang luar biasa, staf dibebaskan untuk melayani tamu alih-alih menjawab telepon — lalu satu kalimat yang nilainya lebih besar daripada seluruh sisa siaran pers tersebut. Yelp Host, ujarnya, menangkap "peluang pendapatan yang mungkin akan terlewatkan."
Itu adalah cara membingkai yang jujur untuk agen suara di industri perhotelan, dan itu klaim yang berbeda dari pitch substitusi tenaga kerja yang biasa. Restoran tidak membeli host AI untuk memecat host. Restoran membelinya karena telepon berdering selama jam layanan, tidak ada yang bisa menjawabnya, dan penelepon memesan di tempat lain. Satu juta panggilan yang ditangani Yelp Host sejak Oktober 2025 adalah penyebut untuk argumen itu — dan Yelp dengan sengaja tidak memberikan pembilangnya, yaitu berapa banyak dari panggilan tersebut yang menjadi reservasi atau pesanan.
Teri Yu, lead produk multimodal OpenAI, membingkai penerapan yang sama dari sudut pandang sebaliknya, menggambarkan pelanggan yang menggunakan GPT-Live-1 untuk segala hal mulai dari panggilan reservasi hingga penjadwalan perbaikan. Kedua pembacaan itu benar. Yelp menjual vertikal; OpenAI menjual horizontal.
Ekonomi yang tidak dimasukkan siapa pun ke dalam rilis
GPT-Live-1 berbiaya $0.05 per menit untuk suara, ditagih per detik, dan model ini dibuka untuk pengembang pada 10 September 2026 — hari yang sama dengan kemunculan pengumuman Yelp. Lapisan suara adalah satu-satunya hal yang dicakup tarif tersebut. Dokumentasi OpenAI secara eksplisit menyatakan bahwa panggilan backend yang dilakukan atas nama model, termasuk penalaran dan penggunaan alat yang didelegasikannya ke model lain, ditagih dengan tarif normal model tersebut.
Bandingkan itu dengan angka Yelp. Panggilan reservasi restoran itu singkat — beberapa menit, kadang lebih singkat. Satu juta panggilan dengan durasi dua menit masing-masing kira-kira dua juta menit suara, atau sekitar $100.000 untuk pengeluaran lapisan suara sepanjang seluruh riwayat produk. Itu hanyalah galat pembulatan bagi Yelp, dan itulah intinya: pada tarif $0,05 per menit, lapisan suara bukanlah bagian yang mahal dari sistem. Bagian yang mahal adalah penalaran di balik setiap giliran, teleponi, integrasi ke dalam buku reservasi tiap restoran, dan manusia yang menangani apa yang tidak bisa ditangani agen.
Ini juga berarti tarif per menit adalah angka yang salah untuk dinegosiasikan. Agen suara yang menjawab dalam satu giliran karena mendelegasikan dengan benar biayanya lebih murah daripada agen yang tersendat selama sembilan puluh detik, meskipun keduanya ditagih per detik. Klaim Yelp bahwa transfer menurun, di balik kesamarannya, adalah klaim biaya.
Penalaran di balik suara adalah panggilan model biasa, dan lapisan itulah yang sebenarnya dapat disetel dalam penerapan seperti ini. Sekitar 190 model dari sebelas penyedia hulu berada di balik satu kunci OrcaRouter dengan harga daftar penyedia tanpa markup, dengan failover otomatis saat backend mengalami error atau timeout — sehingga model yang melakukan penalaran reservasi bergaya Yelp dapat ditukar atau diuji A/B terhadap lalu lintas panggilan langsung dengan mengubah satu nilai konfigurasi alih-alih membangun ulang integrasi. Di situlah uang dan kualitas keduanya berada; menit terukur pada lapisan suara relatif tetap.

Datanya adalah parit pertahanannya, bukan modelnya
Pesaing mana pun bisa membeli GPT-Live-1 besok. Toast, Square, Clover, ServiceTitan, dan Housecall Pro semuanya berada cukup dekat dengan pelanggan yang sama, dan Google serta Alexa+ milik Amazon sedang menggarap masalah yang sama dari sisi konsumen. Tidak ada apa pun dalam posisi Yelp yang bergantung pada akses eksklusif ke model tersebut, dan cara Yelp sendiri membingkainya — data bisnis proprietary ditambah kecerdasan yang dirancang khusus, dengan GPT-Live-1 sebagai lapisan yang berbicara — mengakui hal itu.
Yang dimiliki Yelp adalah graf reservasi: restoran mana yang memiliki meja, kapan, untuk berapa orang, dan akumulasi niat konsumen di balik satu juta panggilan. Model yang dapat disela adalah prasyarat untuk mengumpulkan data tersebut dalam skala besar, karena agen berbasis giliran menghasilkan panggilan yang lebih singkat, lebih banyak panggilan yang ditutup sepihak, dan transkrip yang lebih kotor. Itulah sebabnya penerapan ini penting meskipun angka-angkanya tidak diungkapkan. Full duplex bukanlah pengalaman pengguna yang lebih nyaman dalam konteks ini; full duplex adalah mekanisme pengumpulan datanya.

Apa yang harus ditonton
Tiga hal akan mengubah ini dari cerita penerapan yang kredibel menjadi cerita yang terukur. Panggilan pendapatan Yelp berikutnya, jika manajemen mencantumkan angka untuk pengalihan panggilan atau konversi reservasi. Vertikal kedua yang mengumumkan integrasi yang sama, yang akan menunjukkan apakah suara dupleks penuh merupakan peningkatan serbaguna atau peningkatan yang khusus untuk perhotelan. Dan evaluasi independen pertama atas GPT-Live-1 pada papan yang menilai penalaran alih-alih mekanika percakapan — Artificial Analysis Speech to Speech Index saat ini menempatkannya pada 70,3%, setara dengan GPT-Live-1 mini dan bersama-sama di peringkat keenam pada papan berisi empat belas model, di belakang Grok Voice Think Fast 2.0 High pada 79,0% dan GPT-Realtime-2.1 High pada 73,9%. Arsitektur Yelp sendiri merupakan taruhan implisit bahwa lapisan suara dan lapisan penalaran harus dinilai secara terpisah. Penilaian independen, sejauh ini, sejalan dengan bagian kedua dari taruhan itu dan bukan bagian pertama.
Sampai Yelp menerbitkan apa yang berubah, kita yang lain hanya membaca pengumuman penerapan tentang arsitekturnya, bukan hasilnya. Hal itu tetap layak dilakukan, karena arsitektur adalah bagian yang bisa ditiru tim lain kuartal ini.
