「Yelp 讓 GPT-Live-1 撐起百萬通餐廳來電」的主視覺標題卡,副標為「全雙工語音的首度大規模部署,未附任何數字」,並搭載三張卡片,上頭寫著「Yelp Host:自 2025 年 10 月起已超過 1,000,000 通餐廳來電」、「GPT-Live-1:每語音分鐘 $0.05,後端推理另行計費」、「已揭露影響:僅供方向參考——無來電處理或轉接數據」,三張卡片位於寫著「Yelp Host 與 Hatch 的數據由 Yelp 提供;GPT-Live-1 定價依 OpenAI 文件」的頁尾橫幅上方。OrcaRouter 標誌合成於右下角。
Guides & Insights

Yelp 把 GPT-Live-1 部署在百萬通餐廳來電背後——卻不肯說明它買了什麼

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Yelp 表示,自 2025 年 10 月以來,Yelp Host 已處理超過 100 萬通餐廳來電,並指出截至 2026 年 9 月 10 日,這些通話都由 GPT-Live-1 運行,那是 OpenAI 的全雙工語音模型。同一份公告也將 GPT-Live-1 放進 Hatch,也就是 Yelp 為服務型企業打造的 AI 溝通平台;該公司形容這個平台透過語音、文字、電子郵件和網路管理數千萬筆潛在客戶。這是目前任何人宣布過最大規模的全雙工語音模型生產部署——而它問世時,卻包在 Yelp 所能寫出的最缺乏量化數據的新聞稿裡。Yelp 聲稱通話處理獲得改善、來電轉接次數下降,但沒有說明改善了多少、涵蓋多少通電話,或這一切花了多少成本。

這兩個事實都重要。這次部署是實質證據,證明一個能邊說邊聽的模型經得起實際電話流量的考驗,而這是任何基準測試都無法確立的事。這片沉默則是實質證據,證明該供應商自家的數字不夠好看,不足以拿出來公布——或者證明 Yelp 對投資人的揭露義務範圍,比它的行銷野心還要窄。

Yelp 實際上發布了什麼

架構才是值得理解的部分,因為它並不是 Yelp 的語音模型。GPT-Live-1 是前端的語音層:來電者交談的對象就是它,而決定何時繼續聆聽、何時接話、何時讓出的也是它。在它底下,則是 Yelp 自家的商業資料,以及該公司所謂的 purpose-built intelligence——餐廳的營業時間、訂位可用狀況、菜單、特餐、座位區,以及訂位系統的當前狀態。

那個分工就是整個產品。GPT-Live-1 不知道星期五晚上七點半有沒有四人桌。它知道的是如何進行對話來找出答案。模型的工作是讓這番交流感覺像一通電話,而不是選單樹;Yelp 的工作則是讓答案正確無誤。

Yelp 所陳述的行為主張在性質上具體,在程度上則模糊。來電者可以打斷、在一句話中途變換話題,或在背景噪音中插話,而模型都能隨機應變。系統會偵測來電者的語氣——興奮、沮喪、不耐煩——並據此回應。將 Yelp 的語言增強功能疊加在 GPT-Live-1 之上,使其能偵測並以幾乎任何語言應答來電者,這解決了餐廳的一個實際問題:因值班人員沒人會說來電者的語言而漏接電話,是丟掉一筆訂位,而不是一次糟糕的體驗。

這兩項營運面上的說法,才是餐廳經營者真正願意掏錢買單的。Yelp 表示,來電者現在會用完整、自然的句子說話,而不是簡短的語音指令,而且通話後的轉錄準確度也提升了,讓經營者能取得更乾淨的紀錄。第一項是領先指標,顯示人們已不再把這個代理當成一台得繞著它說話的機器。第二項則具有會複利累積的價值,因為訂位專線的產出不只是一筆訂位——它是一份紀錄,而一份沒人讀得懂的紀錄,就是一份沒人能據以行動的紀錄。

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh 說了那件有用的事

Yelp 的首席產品長給了標準說法——每一通電話都更有對話感、更即時回應,帶來卓越的顧客體驗,讓員工得以服務顧客,而不是忙著接電話——接著又說了一句比整篇新聞稿其餘內容都更有價值的話。他說,Yelp Host 能掌握「他們原本可能錯過的營收機會」。

這才是餐旅業語音代理的誠實框架,而它與常見的勞力替代推銷說法是不同的主張。餐廳購買 AI 接待員,不是為了開除接待員;而是因為服務時段電話響起,沒有人能接,來電者就訂去別家了。Yelp Host 自 2025 年 10 月以來處理的一百萬通電話,是這個論點的分母——而 Yelp 刻意不提供分子,也就是這些來電中有多少變成了訂位或訂單。

Teri Yu,OpenAI 的多模態產品負責人,則從另一個角度詮釋了同一項部署,描述客戶使用 GPT-Live-1 處理從訂位電話到安排維修等各式任務。兩種解讀都成立。Yelp 賣的是垂直領域;OpenAI 賣的是水平領域。

沒人寫進新聞稿裡的經濟學

GPT-Live-1 的語音費用為每分鐘 0.05 美元,以秒計費;該模型於 2026 年 9 月 10 日開放給開發者使用——正好與 Yelp 發布公告是同一天。這個費率只涵蓋語音層。Open​AI 的文件明確指出,代表該模型進行的後端呼叫,包括它委派給另一個模型執行的推理與工具使用,都依該模型的正常費率計費。

拿這個去對照 Yelp 的數字。餐廳訂位電話很短——幾分鐘,有時更短。一百萬通電話、每通兩分鐘,大約是兩百萬語音分鐘數,也就是這項產品整個歷史中約 10 萬美元的語音層支出。對 Yelp 來說,那只是個四捨五入的誤差,而這正是重點:以每分鐘 0.05 美元計算,語音層並不是系統中昂貴的部分。昂貴的部分在於每一輪對話背後的推理、電信通話、與各餐廳訂位簿的整合,以及處理代理無法處理之事的人員。

這也意味著,每分鐘費率是個不該拿來談判的數字。一個因為正確委派而一輪就答覆的語音代理,成本低於一個掙扎九十秒的語音代理,即使兩者都按秒計費。Yelp 聲稱轉接次數下降,在這模糊說法背後,其實是一種成本主張。

語音功能背後的推理是一般正常的模型呼叫,而這一層正是像這樣的部署真正可調校的地方。來自十一家上游供應商的 190 個模型位於單一 OrcaRouter 金鑰之後,以供應商定價、零加成提供,並在後端發生錯誤或逾時時自動容錯移轉——因此,負責 Yelp 風格訂位推理的模型,只要變更一個設定值,就能在實際通話流量中替換或進行 A/B 測試,而不必重建整合。金錢與品質都體現在這裡;相較之下,語音層的計量分鐘數則大致固定。

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

數據才是護城河,而非模型

任何競爭對手明天都能買到 GPT-Live-1。Toast、Square、Clover、ServiceTitan 和 Housecall Pro 全都同樣貼近同一群客戶,而 Google 與 Amazon 的 Alexa+ 也正從消費者端處理同一個問題。Yelp 的地位絲毫不取決於獨家取用該模型,而 Yelp 自己的論述——專有商業資料加上專為特定目的打造的智慧,並以 GPT-Live-1 作為負責對話的層——也承認了這點。

Yelp 真正擁有的,是那張訂位圖譜:哪些餐廳有空桌、什麼時段、可供多少人,以及藏在百萬通電話背後的累積消費者意圖。一個能被插話打斷的模型,是大規模蒐集這類資料的先決條件,因為回合制代理會導致通話更短、掛斷更多、逐字稿更凌亂。這就是為什麼即使數字未對外公布,這次部署依然舉足輕重。在此脈絡下,全雙工並非更優質的使用者體驗,它本身就是資料蒐集機制。

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

看什麼

有三件事能讓這件事從一個可信的部署故事,變成一個可衡量的故事。Yelp 下一場財報電話會議,如果管理層能為來電分流或訂位轉換給出一個數字。第二個垂直領域宣布採用相同的整合,這將顯示全雙工語音是通用型的升級,還是餐旅業專屬的升級。以及 GPT-Live-1 首次在一個評分重點為推理、而非對話機制的排行榜上接受獨立評估——Artificial Analysis 的 Speech to Speech Index 目前把它放在 70.3%,與 GPT-Live-1 mini 同分,在十四個模型的排行榜上並列第六,落後 Gr​ok Voice Think Fast 2.0 High 的 79.0% 與 GPT-Realtime-2.1 High 的 73.9%。Yelp 自家的架構是一種隱含的押注:語音層與推理層應該分開評判。到目前為止,獨立評分認同這個押注的後半部分,而不認同前半部分。

在 Yelp 公布究竟改了什麼之前,我們其他人讀到的,是一份著重其架構、而非其成果的部署公告。這仍然值得做,因為架構正是其他團隊本季可以複製的部分。