
Yelp 让 GPT-Live-1 支撑起百万次餐厅通话——却不愿透露它买到了什么
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Yelp 表示,自 2025 年 10 月以来,它已通过 Yelp Host 处理了超过一百万通餐厅来电,并且截至 2026 年 9 月 10 日,这些通话都运行在 GPT-Live-1 上——即 OpenAI 的全双工语音模型。同一份公告还把 GPT-Live-1 放进了 Hatch,也就是 Yelp 面向服务型企业的 AI 通信平台,公司称该平台在语音、短信、电子邮件和网页渠道中管理着数千万条潜在客户线索。这是迄今为止所有已公布的部署中,全双工语音模型规模最大的一次生产环境落地——而它却是裹在 Yelp 所能写出的最缺乏量化数据的新闻稿里登场的。Yelp 称通话处理有所改善,电话转接有所减少。但它没有说明改善了多少、涉及多少通电话,也没有说明这一切花了多少钱。
{{1}}两个事实都很重要。{{/1}}部署是真实证据,证明一个边说话边聆听的模型能够在实际电话流量中存活下来,这比任何基准测试所能证明的都更有说服力。沉默则是真实证据,证明供应商自己的数字并不好看,不足以公之于众——或者Yelp对投资者的披露义务比其营销胃口要窄得多。
Yelp 实际上发布了什么
架构是值得理解的部分,因为它不是 Yelp 的语音模型。GPT-Live-1 是前端语音层:它是来电者与之对话的对象,也是它决定何时继续聆听、何时接过话轮、何时让出话轮。其下是 Yelp 自身的业务数据,以及公司所谓的专用智能——餐厅的营业时间、预订可用性、菜单、特色菜、座位区域,以及预订系统的当前状态。
这种分工就是整个产品。GPT-Live-1 并不知道周五晚上7:30有没有四人桌。它知道的是如何通过对话去查明这一点。模型的任务是让这次交流感觉像一通电话,而不是一棵菜单树;Yelp 的任务是让答案准确无误。
Yelp 所宣称的行为能力,在类型上具体明确,在程度上却含糊其辞。来电者可以打断、在句子中间转换话题,或在背景噪音中说话,而模型都能适应。系统能识别来电者的语气——兴奋、沮丧、不耐烦——并据此作出回应。在 GPT-Live-1 之上叠加 Yelp 的语言增强功能,使其能够识别并接听几乎任何语言的来电,这解决了餐馆面临的一个现实问题:因为当班员工没人会说来电者的语言而错过的电话,是一次订单流失,而不只是一次糟糕的体验。
这两项运营层面的主张,才是餐厅经营者真正愿意为之掏钱的。Yelp 表示,来电者如今会说完整、自然的句子,而不是简短的语音指令;同时,通话后的转录准确率有所提升,让经营者得到更清晰的记录。第一项是一个先行指标,说明人们已不再把这个代理当作一台需要绕着它说话的机器。第二项则具有不断累积的复利式价值,因为预订专线的产出不只是一笔订单——它更是一份记录,而一份没人读得懂的记录,就是一份没人能据以行动的死记录。

Akhil Kuduvalli Ramesh 说了有用的话
Yelp 的首席产品官给出了标准的套话——每一通电话都更具对话性、响应更迅速,带来卓越的宾客体验,员工得以服务客人,而不用接电话——然后说了一句比整篇新闻稿其余部分都更有价值的话。他说,Yelp Host 捕捉到了“他们原本可能错过的收入机会”。
这才是酒店餐饮业语音代理的诚实表述,它不同于常见的“替代人力”那一套说辞。餐厅购买 AI 接待员,不是为了解雇接待员。它购买是因为在营业时段电话响起,没人能接,来电者就订到别家去了。Yelp Host 自 2025 年 10 月以来处理的一百万通电话,就是这一论点的分母——而 Yelp 刻意没有给出分子,也就是这些电话中有多少转化成了预订或订单。
Teri Yu,OpenAI 的多模态产品负责人,从另一个角度阐释了同一项部署,描述客户使用 GPT-Live-1 处理从预订电话到安排维修的各种事务。两种解读都成立。Yelp 卖的是垂直领域;OpenAI 卖的是横向领域。
没人写进新闻稿的经济学
GPT-Live-1 的语音费用为每分钟 0.05 美元,按秒计费,该模型于 2026 年 9 月 10 日向开发者开放——同一天,Yelp 的公告也发布了。该费率只覆盖语音层。OpenAI 的文档明确指出,代表该模型发起的后端调用,包括它委托给另一模型执行的推理和工具使用,都按该模型的正常费率计费。
拿这个和 Yelp 的数据对比一下。餐厅预订电话很短——几分钟,有时更短。一百万通电话,每通两分钟,大约就是两百万语音分钟,或者说,在产品整个历史中,语音层支出约为 10 万美元。对 Yelp 来说,这只是一个舍入误差,而这正是关键:按每分钟 0.05 美元计算,语音层并不是系统中昂贵的部分。昂贵的部分是每一轮对话背后的推理、电话通信、与每家餐厅预订簿的集成,以及处理智能体无法处理之事的真人。
这也意味着,按分钟计费的价格并不是值得谈判的正确数字。一个因为正确委派任务而只需一轮就完成应答的语音代理,成本低于一个挣扎了九十秒的代理,尽管两者都按秒计费。Yelp 关于转接量下降的说法,在含糊其辞的表象之下,其实是一种成本主张。
语音背后的推理是一次普通的模型调用,而这一层正是此类部署真正可调的地方。大约190 个来自十一家上游提供商的模型位于单个 OrcaRouter 密钥之后,按提供商标价、零加价提供,并在后端出错或超时时自动故障转移——因此,负责 Yelp 风格预订推理的模型可以通过更改一个配置值来替换,或针对实时通话流量进行 A/B 测试,而无需重建集成。资金和质量都体现在这里;语音层的按分钟计费相对固定。

数据才是护城河,而不是模型
任何竞争对手明天都能买到 GPT-Live-1。Toast、Square、Clover、ServiceTitan 和 Housecall Pro 都服务于足够相近的同一批客户,而 Google 和 Amazon 的 Alexa+ 正从消费者一侧解决同一个问题。Yelp 的处境完全不依赖于对这款模型的独家使用权,而 Yelp 自己的表述——专有商业数据加上专门打造的智能,GPT-Live-1 只是负责对话的那一层——也承认了这一点。
Yelp 真正拥有的是预订图谱:哪些餐厅有桌位、何时有、有多少桌,以及一百万通电话背后累积的消费者意图。一个可以被中断的模型,是在大规模收集这类数据的前提条件,因为基于轮次的智能体会产生更短的通话、更多的挂断和更脏的转写文本。这就是为什么即便具体数字没有披露,部署本身仍然重要。在这一语境下,全双工并不是一种更友好的用户体验,它就是数据收集机制。

看什么
三件事将把这件事从可信的部署叙事变成可量化的叙事。Yelp 的下一次财报电话会议,如果管理层对呼叫分流或预订转化给出具体数字。第二个垂直领域宣布同样的集成,这将表明全双工语音是通用型升级还是酒店餐饮业专用升级。以及对 GPT-Live-1 的首次独立评估,该评估基于一个评分推理而非对话机制的榜单——Artificial Analysis Speech to Speech Index 目前将其评为 70.3%,与 GPT-Live-1 mini 持平,在十四款模型的榜单上并列第六,落后于 Grok Voice Think Fast 2.0 High 的 79.0% 和 GPT-Realtime-2.1 High 的 73.9%。Yelp 自身的架构隐含着一个押注:语音层和推理层应当分开评判。迄今为止,独立评分认同这一押注的后半部分,而非前半部分。
在 Yelp 公布具体改动之前,我们其他人看到的是一份关于其架构、而非成果的部署公告。这仍然值得做,因为架构正是其他团队本季度可以照搬的部分。
