Thẻ tiêu đề hero cho 'Yelp Put GPT-Live-1 Behind a Million Restaurant Calls', với phụ đề 'The first large-scale deployment of full-duplex voice, with no numbers attached', mang ba thẻ có nội dung 'Yelp Host: hơn 1.000.000 cuộc gọi nhà hàng kể từ tháng 10 năm 2025', 'GPT-Live-1: 0,05 USD mỗi phút thoại, phần suy luận backend được tính phí riêng', 'Tác động được công bố: chỉ mang tính định hướng — không có số liệu về xử lý cuộc gọi hay chuyển tiếp', phía trên một dải chân trang ghi 'Số liệu của Yelp Host và Hatch do Yelp báo cáo; giá của GPT-Live-1 theo tài liệu của OpenAI.' Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Yelp đưa GPT-Live-1 vào phục vụ một triệu cuộc gọi nhà hàng — và không tiết lộ đã mua gì

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Yelp cho biết họ đã xử lý hơn một triệu cuộc gọi đến nhà hàng thông qua Yelp Host kể từ tháng 10 năm 2025, và rằng tính đến ngày 10 tháng 9 năm 2026, những cuộc gọi đó chạy trên GPT-Live-1, mô hình giọng nói song công toàn phần của OpenAI. Cùng thông báo đó đưa GPT-Live-1 vào Hatch, nền tảng truyền thông AI của Yelp dành cho các doanh nghiệp dịch vụ, mà công ty mô tả là đang quản lý hàng chục triệu khách hàng tiềm năng trên thoại, văn bản, email và web. Đó là triển khai sản xuất lớn nhất của một mô hình giọng nói song công toàn phần mà bất kỳ ai đã công bố — và nó xuất hiện trong một thông cáo báo chí ít định lượng nhất mà Yelp có thể viết. Yelp báo cáo rằng việc xử lý cuộc gọi đã được cải thiện và các cuộc chuyển cuộc gọi đã giảm. Họ không nói giảm bao nhiêu, trên bao nhiêu cuộc gọi, hay bất kỳ phần nào của việc đó tốn bao nhiêu.

Cả hai sự thật đều quan trọng. Việc triển khai là bằng chứng thực tế cho thấy một mô hình vừa lắng nghe vừa nói vẫn trụ được khi tiếp xúc với lưu lượng điện thoại thực tế — điều mà bất kỳ benchmark nào cũng không thể chứng minh được. Sự im lặng là bằng chứng thực tế rằng những con số của chính nhà cung cấp chưa đủ đẹp để công bố — hoặc rằng nghĩa vụ công bố thông tin cho nhà đầu tư của Yelp hẹp hơn tham vọng tiếp thị của mình.

Những gì Yelp thực sự đã tung ra

Kiến trúc là phần đáng để hiểu, vì nó không phải là một mô hình giọng nói của Yelp. GPT-Live-1 là lớp giọng nói giao diện phía trước: nó là thứ mà người gọi trò chuyện cùng, và nó là thứ quyết định khi nào tiếp tục lắng nghe, khi nào giành lượt nói, và khi nào nhường lượt. Bên dưới là dữ liệu kinh doanh của chính Yelp và thứ mà công ty gọi là trí tuệ được xây dựng chuyên biệt — giờ mở cửa của nhà hàng, tình trạng còn bàn đặt trước, thực đơn, các món đặc biệt, các khu vực chỗ ngồi và trạng thái hiện tại của hệ thống đặt bàn.

Sự phân chia đó chính là toàn bộ sản phẩm. GPT-Live-1 không biết liệu có bàn cho bốn người vào 7:30 tối thứ Sáu hay không. Nó biết cách dẫn dắt cuộc trò chuyện để tìm ra điều đó. Nhiệm vụ của mô hình là làm cho cuộc trao đổi cảm giác như một cuộc gọi điện thoại thay vì một cây menu; nhiệm vụ của Yelp là làm cho câu trả lời chính xác.

Những tuyên bố về hành vi mà Yelp đưa ra thì cụ thể về loại nhưng mơ hồ về mức độ. Người gọi có thể ngắt lời, thay đổi chủ đề giữa câu, hoặc nói át tiếng ồn xung quanh, và mô hình vẫn thích ứng. Hệ thống phát hiện giọng điệu của người gọi — hào hứng, bực bội, sốt ruột — và phản hồi tương ứng. Việc xếp lớp các cải tiến ngôn ngữ của Yelp lên trên GPT-Live-1 cho phép nó phát hiện và trả lời người gọi bằng gần như bất kỳ ngôn ngữ nào, qua đó giải quyết một vấn đề thực tế của nhà hàng: một cuộc gọi bị nhỡ vì không ai trong ca nói được ngôn ngữ của người gọi là một lượt đặt bàn bị mất, chứ không phải một trải nghiệm tồi.

Hai tuyên bố vận hành đó là những điều mà một người điều hành nhà hàng thực sự sẵn sàng trả tiền. Yelp nói rằng người gọi giờ nói bằng những câu đầy đủ, tự nhiên thay vì các lệnh thoại ngắn, và rằng độ chính xác của việc phiên âm sau cuộc gọi đã được cải thiện, giúp người điều hành có hồ sơ sạch sẽ hơn. Điều thứ nhất là một chỉ báo sớm cho thấy mọi người đã ngừng coi trợ lý đó như một cỗ máy để nói vòng vo. Điều thứ hai là điều có giá trị tích lũy, bởi vì đầu ra của một đường dây đặt chỗ không chỉ là một lượt đặt bàn — đó là một hồ sơ, và một hồ sơ không ai đọc được là một hồ sơ không ai có thể hành động dựa trên đó.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh đã nói điều hữu ích.

Giám đốc sản phẩm của Yelp đưa ra câu trích dẫn mẫu mực — mọi cuộc gọi trò chuyện hơn và phản hồi tốt hơn, trải nghiệm khách hàng đặc biệt, nhân viên được giải phóng để phục vụ khách thay vì trả lời điện thoại — và rồi một câu đáng giá hơn cả phần còn lại của thông cáo. Yelp Host, ông nói, nắm bắt "các cơ hội doanh thu mà lẽ ra họ có thể đã bỏ lỡ."

Đó là cách diễn đạt trung thực cho các tác nhân giọng nói trong ngành dịch vụ nhà hàng – khách sạn, và đó là một tuyên bố khác với lối chào hàng thay thế lao động thông thường. Một nhà hàng không mua một lễ tân AI để sa thải một lễ tân. Họ mua nó vì điện thoại đổ chuông trong giờ phục vụ, không ai có thể nghe máy, và người gọi đặt chỗ ở nơi khác. Một triệu cuộc gọi mà Yelp Host đã xử lý kể từ tháng 10 năm 2025 là mẫu số cho lập luận đó — và Yelp đã cố ý không đưa ra tử số, tức là bao nhiêu trong số những cuộc gọi đó đã trở thành đặt chỗ hoặc đơn hàng.

Teri Yu, trưởng bộ phận sản phẩm đa phương thức của Open​AI, lại diễn giải cùng một thương vụ triển khai theo hướng ngược lại, mô tả việc khách hàng dùng GPT-Live-1 cho mọi thứ, từ các cuộc gọi đặt chỗ đến lên lịch sửa chữa. Cả hai cách lý giải đều đúng. Yelp đang bán chiều dọc; Open​AI đang bán chiều ngang.

Những khía cạnh kinh tế không ai đưa vào bản công bố

GPT-Live-1 có giá $0.05 mỗi phút thoại, tính phí theo từng giây, và mô hình này đã được mở cho các nhà phát triển vào ngày 10 tháng 9 năm 2026 — cùng ngày thông báo của Yelp được đưa ra. Lớp thoại là thứ duy nhất mà mức giá đó bao gồm. Tài liệu của OpenAI nói rõ rằng các lệnh gọi backend được thực hiện thay mặt mô hình, bao gồm cả phần suy luận và sử dụng công cụ mà nó chuyển giao cho một mô hình khác, được tính phí theo mức giá thông thường của mô hình đó.

Hãy đối chiếu điều đó với con số của Yelp. Một cuộc gọi đặt bàn nhà hàng thì ngắn — vài phút, đôi khi ít hơn. Một triệu cuộc gọi, mỗi cuộc hai phút, tương đương khoảng hai triệu phút thoại, hay khoảng $100,000 chi tiêu cho lớp thoại trong toàn bộ lịch sử sản phẩm. Đó là một sai số làm tròn đối với Yelp, và đó chính là điểm mấu chốt: ở mức $0.05 một phút, lớp thoại không phải là phần tốn kém của hệ thống. Những phần tốn kém là phần suy luận đằng sau mỗi lượt, hệ thống điện thoại, việc tích hợp vào sổ đặt bàn của từng nhà hàng, và những con người xử lý những gì tác nhân không thể.

Điều đó cũng có nghĩa mức giá theo phút là con số sai để đàm phán. Một tác nhân thoại trả lời chỉ trong một lượt nhờ chuyển giao đúng cách sẽ tốn ít chi phí hơn một tác nhân loay hoay suốt chín mươi giây, dù cả hai đều được tính phí theo từng giây. Tuyên bố của Yelp rằng số ca chuyển tiếp đã giảm, ẩn dưới sự mơ hồ, thực chất là một tuyên bố về chi phí.

Phần suy luận đằng sau giọng nói là một lệnh gọi mô hình thông thường, và lớp đó chính là nơi một triển khai như thế này thực sự có thể tinh chỉnh. Khoảng 190 mô hình từ mười một nhà cung cấp thượng nguồn nằm sau một khóa OrcaRouter duy nhất với giá niêm yết của nhà cung cấp và không có phụ phí, cùng khả năng chuyển đổi dự phòng tự động khi backend gặp lỗi hoặc hết thời gian chờ — vì vậy mô hình đảm nhiệm suy luận đặt chỗ kiểu Yelp có thể được hoán đổi hoặc kiểm thử A/B với lưu lượng cuộc gọi trực tiếp bằng cách thay đổi một giá trị cấu hình thay vì xây dựng lại tích hợp. Đó là nơi cả tiền bạc lẫn chất lượng đều nằm; số phút tính phí của lớp giọng nói thì tương đối cố định.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

Dữ liệu mới là hào bảo vệ, không phải mô hình

Bất kỳ đối thủ cạnh tranh nào cũng có thể mua GPT-Live-1 ngay ngày mai. Toast, Square, Clover, ServiceTitan và Housecall Pro đều phục vụ gần như cùng một nhóm khách hàng, còn Google và Alexa+ của Amazon đang giải quyết cùng bài toán đó từ phía người tiêu dùng. Không có gì trong vị thế của Yelp phụ thuộc vào quyền truy cập độc quyền vào mô hình, và cách Yelp tự định vị — dữ liệu kinh doanh độc quyền cộng với trí tuệ được thiết kế riêng, với GPT-Live-1 là lớp giao tiếp — cũng thừa nhận điều đó.

Thứ Yelp sở hữu là đồ thị đặt bàn: nhà hàng nào có bàn, vào lúc nào, cho bao nhiêu người, và ý định tích lũy của người tiêu dùng đằng sau một triệu cuộc gọi. Một mô hình có thể bị ngắt lời là điều kiện tiên quyết để thu thập dữ liệu đó ở quy mô lớn, bởi vì một tác nhân theo lượt tạo ra các cuộc gọi ngắn hơn, nhiều cúp máy hơn, và bản ghi lộn xộn hơn. Đó là lý do việc triển khai vẫn quan trọng ngay cả khi các con số được giữ kín. Song công toàn phần không phải là trải nghiệm người dùng dễ chịu hơn trong bối cảnh này; nó chính là cơ chế thu thập dữ liệu.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

Xem gì

Ba điều sẽ biến đây từ một câu chuyện triển khai đáng tin cậy thành một câu chuyện có thể đo lường được. Cuộc gọi công bố thu nhập tiếp theo của Yelp, nếu ban lãnh đạo đưa ra một con số về tỷ lệ chuyển hướng cuộc gọi hoặc tỷ lệ chuyển đổi đặt chỗ. Một lĩnh vực dọc thứ hai công bố cùng tích hợp đó, điều này sẽ cho thấy liệu giọng nói song công toàn phần là một nâng cấp đa dụng hay chỉ dành riêng cho ngành khách sạn. Và đánh giá độc lập đầu tiên về GPT-Live-1 trên một bảng xếp hạng chấm điểm khả năng suy luận thay vì cơ chế hội thoại — Artificial Analysis Speech to Speech Index hiện xếp nó ở mức 70,3%, ngang bằng với GPT-Live-1 mini và đồng hạng sáu trên bảng gồm mười bốn mô hình, sau Grok Voice Think Fast 2.0 High ở mức 79,0% và GPT-Realtime-2.1 High ở mức 73,9%. Kiến trúc của chính Yelp là một đặt cược ngầm rằng lớp giọng nói và lớp suy luận nên được đánh giá tách biệt. Việc chấm điểm độc lập, cho đến nay, đồng tình với nửa sau của đặt cược đó chứ không phải nửa đầu.

Cho đến khi Yelp công bố điều gì đã thay đổi, phần còn lại trong chúng ta vẫn đang đọc một thông báo triển khai về kiến trúc của nó chứ không phải về kết quả. Điều đó vẫn đáng làm, vì kiến trúc là phần mà các nhóm khác có thể sao chép trong quý này.