
Yelp 把 GPT-Live-1 部署在百萬通餐廳來電背後——卻不肯說明它買了什麼
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Yelp 表示,自 2025 年 10 月以來,Yelp Host 已處理超過 100 萬通餐廳來電,並指出截至 2026 年 9 月 10 日,這些通話都由 GPT-Live-1 運行,那是 OpenAI 的全雙工語音模型。同一份公告也將 GPT-Live-1 放進 Hatch,也就是 Yelp 為服務型企業打造的 AI 溝通平台;該公司形容這個平台透過語音、文字、電子郵件和網路管理數千萬筆潛在客戶。這是目前任何人宣布過最大規模的全雙工語音模型生產部署——而它問世時,卻包在 Yelp 所能寫出的最缺乏量化數據的新聞稿裡。Yelp 聲稱通話處理獲得改善、來電轉接次數下降,但沒有說明改善了多少、涵蓋多少通電話,或這一切花了多少成本。
這兩個事實都重要。這次部署是實質證據,證明一個能邊說邊聽的模型經得起實際電話流量的考驗,而這是任何基準測試都無法確立的事。這片沉默則是實質證據,證明該供應商自家的數字不夠好看,不足以拿出來公布——或者證明 Yelp 對投資人的揭露義務範圍,比它的行銷野心還要窄。
Yelp 實際上發布了什麼
架構才是值得理解的部分,因為它並不是 Yelp 的語音模型。GPT-Live-1 是前端的語音層:來電者交談的對象就是它,而決定何時繼續聆聽、何時接話、何時讓出的也是它。在它底下,則是 Yelp 自家的商業資料,以及該公司所謂的 purpose-built intelligence——餐廳的營業時間、訂位可用狀況、菜單、特餐、座位區,以及訂位系統的當前狀態。
那個分工就是整個產品。GPT-Live-1 不知道星期五晚上七點半有沒有四人桌。它知道的是如何進行對話來找出答案。模型的工作是讓這番交流感覺像一通電話,而不是選單樹;Yelp 的工作則是讓答案正確無誤。
Yelp 所陳述的行為主張在性質上具體,在程度上則模糊。來電者可以打斷、在一句話中途變換話題,或在背景噪音中插話,而模型都能隨機應變。系統會偵測來電者的語氣——興奮、沮喪、不耐煩——並據此回應。將 Yelp 的語言增強功能疊加在 GPT-Live-1 之上,使其能偵測並以幾乎任何語言應答來電者,這解決了餐廳的一個實際問題:因值班人員沒人會說來電者的語言而漏接電話,是丟掉一筆訂位,而不是一次糟糕的體驗。
這兩項營運面上的說法,才是餐廳經營者真正願意掏錢買單的。Yelp 表示,來電者現在會用完整、自然的句子說話,而不是簡短的語音指令,而且通話後的轉錄準確度也提升了,讓經營者能取得更乾淨的紀錄。第一項是領先指標,顯示人們已不再把這個代理當成一台得繞著它說話的機器。第二項則具有會複利累積的價值,因為訂位專線的產出不只是一筆訂位——它是一份紀錄,而一份沒人讀得懂的紀錄,就是一份沒人能據以行動的紀錄。

Akhil Kuduvalli Ramesh 說了那件有用的事
Yelp 的首席產品長給了標準說法——每一通電話都更有對話感、更即時回應,帶來卓越的顧客體驗,讓員工得以服務顧客,而不是忙著接電話——接著又說了一句比整篇新聞稿其餘內容都更有價值的話。他說,Yelp Host 能掌握「他們原本可能錯過的營收機會」。
這才是餐旅業語音代理的誠實框架,而它與常見的勞力替代推銷說法是不同的主張。餐廳購買 AI 接待員,不是為了開除接待員;而是因為服務時段電話響起,沒有人能接,來電者就訂去別家了。Yelp Host 自 2025 年 10 月以來處理的一百萬通電話,是這個論點的分母——而 Yelp 刻意不提供分子,也就是這些來電中有多少變成了訂位或訂單。
Teri Yu,OpenAI 的多模態產品負責人,則從另一個角度詮釋了同一項部署,描述客戶使用 GPT-Live-1 處理從訂位電話到安排維修等各式任務。兩種解讀都成立。Yelp 賣的是垂直領域;OpenAI 賣的是水平領域。
沒人寫進新聞稿裡的經濟學
GPT-Live-1 的語音費用為每分鐘 0.05 美元,以秒計費;該模型於 2026 年 9 月 10 日開放給開發者使用——正好與 Yelp 發布公告是同一天。這個費率只涵蓋語音層。OpenAI 的文件明確指出,代表該模型進行的後端呼叫,包括它委派給另一個模型執行的推理與工具使用,都依該模型的正常費率計費。
拿這個去對照 Yelp 的數字。餐廳訂位電話很短——幾分鐘,有時更短。一百萬通電話、每通兩分鐘,大約是兩百萬語音分鐘數,也就是這項產品整個歷史中約 10 萬美元的語音層支出。對 Yelp 來說,那只是個四捨五入的誤差,而這正是重點:以每分鐘 0.05 美元計算,語音層並不是系統中昂貴的部分。昂貴的部分在於每一輪對話背後的推理、電信通話、與各餐廳訂位簿的整合,以及處理代理無法處理之事的人員。
這也意味著,每分鐘費率是個不該拿來談判的數字。一個因為正確委派而一輪就答覆的語音代理,成本低於一個掙扎九十秒的語音代理,即使兩者都按秒計費。Yelp 聲稱轉接次數下降,在這模糊說法背後,其實是一種成本主張。
語音功能背後的推理是一般正常的模型呼叫,而這一層正是像這樣的部署真正可調校的地方。來自十一家上游供應商的 190 個模型位於單一 OrcaRouter 金鑰之後,以供應商定價、零加成提供,並在後端發生錯誤或逾時時自動容錯移轉——因此,負責 Yelp 風格訂位推理的模型,只要變更一個設定值,就能在實際通話流量中替換或進行 A/B 測試,而不必重建整合。金錢與品質都體現在這裡;相較之下,語音層的計量分鐘數則大致固定。

數據才是護城河,而非模型
任何競爭對手明天都能買到 GPT-Live-1。Toast、Square、Clover、ServiceTitan 和 Housecall Pro 全都同樣貼近同一群客戶,而 Google 與 Amazon 的 Alexa+ 也正從消費者端處理同一個問題。Yelp 的地位絲毫不取決於獨家取用該模型,而 Yelp 自己的論述——專有商業資料加上專為特定目的打造的智慧,並以 GPT-Live-1 作為負責對話的層——也承認了這點。
Yelp 真正擁有的,是那張訂位圖譜:哪些餐廳有空桌、什麼時段、可供多少人,以及藏在百萬通電話背後的累積消費者意圖。一個能被插話打斷的模型,是大規模蒐集這類資料的先決條件,因為回合制代理會導致通話更短、掛斷更多、逐字稿更凌亂。這就是為什麼即使數字未對外公布,這次部署依然舉足輕重。在此脈絡下,全雙工並非更優質的使用者體驗,它本身就是資料蒐集機制。

看什麼
有三件事能讓這件事從一個可信的部署故事,變成一個可衡量的故事。Yelp 下一場財報電話會議,如果管理層能為來電分流或訂位轉換給出一個數字。第二個垂直領域宣布採用相同的整合,這將顯示全雙工語音是通用型的升級,還是餐旅業專屬的升級。以及 GPT-Live-1 首次在一個評分重點為推理、而非對話機制的排行榜上接受獨立評估——Artificial Analysis 的 Speech to Speech Index 目前把它放在 70.3%,與 GPT-Live-1 mini 同分,在十四個模型的排行榜上並列第六,落後 Grok Voice Think Fast 2.0 High 的 79.0% 與 GPT-Realtime-2.1 High 的 73.9%。Yelp 自家的架構是一種隱含的押注:語音層與推理層應該分開評判。到目前為止,獨立評分認同這個押注的後半部分,而不認同前半部分。
在 Yelp 公布究竟改了什麼之前,我們其他人讀到的,是一份著重其架構、而非其成果的部署公告。這仍然值得做,因為架構正是其他團隊本季可以複製的部分。
