'Yelp, 백만 건의 레스토랑 통화 뒤에 GPT-Live-1을 두다'의 히어로 타이틀 카드, 부제는 '완전이중(full-duplex) 음성의 최초 대규모 배포, 수치는 일절 붙지 않음', 세 장의 카드를 담고 있으며 각각 'Yelp Host: 2025년 10월 이후 1,000,000건 이상의 레스토랑 통화', 'GPT-Live-1: 음성 분당 $0.05, 백엔드 추론은 별도 청구', '공개된 영향: 방향성에 그침 — 통화 처리나 전환 수치 없음'을 읽으며, 그 아래 푸터 스트립은 'Yelp Host 및 Hatch 수치는 Yelp가 보고한 것이며, GPT-Live-1 가격은 OpenAI 문서에 따른 것임.'을 읽는다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

Yelp, 100만 건의 레스토랑 통화에 GPT-Live-1 투입 — 무엇을 샀는지는 밝히지 않아

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Yelp는 2025년 10월 이후 Yelp Host를 통해 100만 건이 넘는 레스토랑 통화를 처리했다고 밝혔으며, 2026년 9월 10일 기준으로 해당 통화가 OpenAI의 전이중 음성 모델인 GPT-Live-1에서 실행된다고 말했다. 같은 발표에서는 GPT-Live-1을 서비스 업체를 위한 Yelp의 AI 커뮤니케이션 플랫폼인 Hatch 안에 넣었는데, 회사는 이 플랫폼이 음성, 텍스트, 이메일, 웹 전반에서 수천만 건의 리드를 관리한다고 설명한다. 이는 누구든 발표한 전이중 음성 모델의 가장 큰 프로덕션 배포이며 — Yelp가 쓸 수 있었던 가장 정량화되지 않은 보도자료에 싸여 등장했다. Yelp는 통화 처리가 개선되고 통화 전환이 줄었다고 보고한다. 하지만 얼마나 개선됐는지, 몇 건의 통화에서였는지, 그 비용이 얼마였는지는 말하지 않는다.

두 가지 사실 모두 중요하다. 해당 배포는 말하면서 동시에 듣는 모델이 실제 전화 트래픽과 접촉해도 살아남는다는 실질적 증거이며, 이는 어떤 벤치마크도 입증할 수 있는 것 이상이다. 그 침묵은 벤더 자체의 수치가 공개할 만큼 좋지 않았다는 실질적 증거이거나, Yelp의 투자자에 대한 공시 의무가 마케팅 욕구보다 좁다는 실질적 증거다.

Yelp가 실제로 출시한 것

아키텍처는 이해할 가치가 있는 부분입니다. 왜냐하면 그것은 Yelp 음성 모델이 아니기 때문입니다. GPT-Live-1은 프런트엔드 음성 계층입니다. 즉, 발신자가 대화하는 대상이며, 언제 계속 들을지, 언제 발화 차례를 가져갈지, 언제 양보할지를 결정하는 것입니다. 그 아래에는 Yelp 자체의 비즈니스 데이터와 회사가 목적에 맞게 구축한 인텔리전스라고 부르는 것이 자리 잡고 있습니다. 레스토랑의 영업시간, 예약 가능 여부, 메뉴, 스페셜, 좌석 구역, 그리고 예약 시스템의 현재 상태입니다.

그 분업이 바로 제품의 전부다. GPT-Live-1은 금요일 오후 7시 30분에 4인용 테이블이 있는지 알지 못한다. 그것은 그걸 알아내는 대화를 나눌 줄 안다. 모델의 역할은 그 주고받음이 메뉴 트리가 아니라 전화 통화처럼 느껴지게 하는 것이고, Yelp의 역할은 답을 정확하게 만드는 것이다.

Yelp가 제시한 행동 관련 주장은 종류는 구체적이지만 정도는 모호하다. 발신자는 말을 끊거나, 문장 중간에 화제를 바꾸거나, 배경 소음 속에서도 말할 수 있으며, 모델은 이에 적응한다. 시스템은 발신자의 어조—흥분, 좌절, 조바심—을 감지하고 그에 맞게 응답한다. Yelp의 언어 향상 기능을 GPT-Live-1 위에 얹으면 거의 모든 언어로 발신자를 감지하고 응답할 수 있으며, 이는 실제 레스토랑의 문제를 해결한다: 근무 중인 직원 중 누구도 발신자의 언어를 하지 못해 놓친 전화는 나쁜 경험이 아니라 놓친 예약이다.

운영상의 두 가지 주장은 레스토랑 운영자가 실제로 돈을 낼 만한 것들이다. Yelp에 따르면 이제 발신자들은 짧은 음성 명령이 아니라 완전하고 자연스러운 문장으로 말하며, 통화 후 전사 정확도가 향상되어 운영자에게 더 깔끔한 기록을 제공한다. 첫 번째는 사람들이 더 이상 에이전트를 빙 둘러 말해야 하는 기계로 취급하지 않는다는 선행 지표다. 두 번째는 복리 효과가 있는 항목인데, 예약 전화선의 산출물은 예약만이 아니라 기록이기도 하고, 아무도 읽을 수 없는 기록은 아무도 실행에 옮길 수 없는 기록이기 때문이다.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh가 유용한 말을 했다.

Yelp의 최고 제품 책임자는 전형적인 발언을 남겼다 — 모든 통화가 더 대화하듯, 더 반응적으로 이루어지고, 뛰어난 고객 경험이 제공되며, 직원들은 전화를 받는 대신 고객을 응대할 수 있게 자유로워진다 — 그러고는 이 보도자료의 나머지보다 더 값진 한 문장을 덧붙였다. Yelp Host는 "그들이 그렇지 않았다면 놓쳤을 수도 있는 매출 기회"를 포착한다고 그는 말했다.

그것이 호스피탈리티 분야의 음성 에이전트에 대한 정직한 프레이밍이며, 흔한 노동력 대체 제안과는 다른 주장이다. 레스토랑은 호스트를 해고하려고 AI 호스트를 사는 것이 아니다. 서비스 중에 전화가 울리는데 아무도 받을 수 없고, 전화를 건 사람이 다른 곳을 예약해버리기 때문에 사는 것이다. 2025년 10월 이후 Yelp Host가 처리한 100만 건의 통화는 그 주장의 분모다. 그리고 Yelp는 그 통화 중 몇 건이 예약이나 주문으로 이어졌는지를 보여주는 분자는 의도적으로 제시하지 않았다.

테리 유(Teri Yu), OpenAI의 멀티모달 제품 책임자는 같은 도입 사례를 다른 관점에서 해석하며, 고객들이 예약 전화부터 수리 일정 예약까지 모든 용도로 GPT-Live-1을 사용한다고 설명했습니다. 두 해석 모두 사실입니다. Yelp는 버티컬을 팔고 있고, OpenAI는 호리즌털을 팔고 있습니다.

아무도 발표 자료에 넣지 않은 경제적 논리

GPT-Live-1은 음성 1분당 $0.05, 초 단위로 청구되며, 이 모델은 2026년 9월 10일 — Yelp의 발표가 나온 바로 그날 — 개발자들에게 공개되었습니다. 이 요율이 적용되는 것은 음성 계층뿐입니다. Open​AI의 문서는 해당 모델을 대신해 이루어지는 백엔드 호출, 즉 다른 모델에 위임하는 추론과 도구 사용을 포함한 호출은 그 모델의 일반 요율로 청구된다고 명시하고 있습니다.

그걸 Yelp의 수치에 대입해 보세요. 레스토랑 예약 통화는 짧습니다 — 몇 분, 때로는 그보다 더 짧습니다. 2분씩 100만 건의 통화는 대략 200만 음성 분, 즉 제품의 전체 이력에 걸쳐 약 $100,000의 음성 계층 지출입니다. 이는 Yelp에는 반올림 오차 수준이며, 바로 그 점이 핵심입니다: 분당 $0.05라면 음성 계층은 시스템에서 비싼 부분이 아닙니다. 비싼 부분은 각 턴을 뒷받침하는 추론, 전화 통신, 각 레스토랑의 예약 장부로의 통합, 그리고 에이전트가 처리할 수 없는 일을 처리하는 사람들입니다.

이는 분당 요율이 협상할 숫자로는 잘못되었다는 뜻이기도 하다. 올바르게 위임했기 때문에 한 턴 만에 답하는 음성 에이전트는 90초 동안 헤매는 에이전트보다 비용이 덜 든다. 둘 다 초 단위로 과금되더라도 마찬가지다. Yelp가 전환 건수가 줄었다고 주장하는 것은, 그 모호함 아래에 깔린 비용 주장이다.

음성 뒤에 있는 추론은 평범한 모델 호출이며, 이런 배포가 실제로 조정 가능한 지점은 바로 그 계층입니다. 약 11개 업스트림 제공업체의 190개 모델이 단일 OrcaRouter 키 뒤에서 제공업체 정가에 마크업 없이 자리 잡고 있으며, 백엔드에서 오류가 나거나 시간 초과가 발생하면 자동 페일오버가 작동합니다 — 따라서 Yelp 스타일 예약 추론을 수행하는 모델을 통합을 다시 구축할 필요 없이 구성 값 하나만 바꿔서 교체하거나 실제 통화 트래픽을 대상으로 A/B 테스트할 수 있습니다. 비용과 품질이 모두 여기에 달려 있고, 음성 계층의 종량제 분(分)은 상대적으로 고정되어 있습니다.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

데이터가 해자이지, 모델이 아니다

어떤 경쟁사든 내일이면 GPT-Live-1을 살 수 있다. Toast, Square, Clover, ServiceTitan, Housecall Pro는 모두 같은 고객과 충분히 가까운 위치에 있고, Google과 Amazon의 Alexa+는 소비자 쪽에서 같은 문제를 풀고 있다. Yelp의 입지는 모델에 대한 독점적 접근에 전혀 달려 있지 않으며, Yelp 자신의 프레이밍 — 독점적 비즈니스 데이터에 목적에 맞게 구축된 인텔리전스를 더하고 GPT-Live-1을 대화를 담당하는 레이어로 두는 — 도 이를 인정한다.

Yelp가 보유한 것은 예약 그래프다. 어떤 레스토랑에 테이블이 있는지, 언제, 몇 명을 위한 것인지, 그리고 백만 건의 통화 뒤에 축적된 소비자 의도까지 담고 있다. 중간에 끼어들 수 있는 모델은 그러한 데이터를 대규모로 수집하기 위한 전제 조건이다. 턴 기반 에이전트는 통화를 더 짧게 만들고, 끊김을 더 많게 만들며, 통화 기록을 더 지저분하게 만들기 때문이다. 그래서 수치가 공개되지 않았더라도 이 배포는 중요한 것이다. 이 맥락에서 풀 듀플렉스는 더 나은 사용자 경험이 아니다. 그것은 데이터 수집 메커니즘이다.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

볼 것

세 가지가 이것을 신뢰할 만한 배포 사례에서 측정 가능한 사례로 바꿔 놓을 것이다. Yelp의 다음 실적 발표에서 경영진이 콜 디플렉션이나 예약 전환에 숫자를 제시한다면. 동일한 통합을 발표하는 두 번째 버티컬이라면, 풀듀플렉스 음성이 범용 업그레이드인지 호스피탤리티 특화 업그레이드인지 보여 줄 것이다. 그리고 대화 메커니즘보다 추론을 채점하는 보드에서 GPT-Live-1에 대한 첫 독립 평가 — Artificial Analysis Speech to Speech Index는 현재 이를 70.3%로 두며, GPT-Live-1 mini와 동률이자 14개 모델 보드에서 공동 6위로, 79.0%의 Gr​ok Voice Think Fast 2.0 High와 73.9%의 GPT-Realtime-2.1 High 뒤에 있다. Yelp 자체 아키텍처는 음성 계층과 추론 계층을 별도로 평가해야 한다는 암묵적 베팅이다. 지금까지 독립적인 채점은 그 베팅의 후반부에는 동의하고 전반부에는 동의하지 않는다.

Yelp가 무엇이 바뀌었는지 공개할 때까지, 나머지 우리는 그 결과가 아니라 아키텍처에 관한 배포 발표를 읽고 있는 셈이다. 그래도 여전히 해 볼 가치가 있다. 다른 팀들이 이번 분기에 따라 할 수 있는 부분은 바로 그 아키텍처니까.