「Yelp Put GPT-Live-1 Behind a Million Restaurant Calls」のヒーロータイトルカード。副題は「全二重音声の初の大規模展開、数値は一切添えられていない」。3枚のカードを伴い、それぞれに「Yelp Host: 2025年10月以来、1,000,000件以上のレストラン通話」「GPT-Live-1: 音声1分あたり$0.05、バックエンド推論は別途請求」「開示された影響: 方向性のみ — 通話対応や転送の数値はなし」と記されている。その下にフッターストリップがあり、「Yelp HostとHatchの数値はYelpによる報告; GPT-Live-1の価格はOpenAIのドキュメントによる」と書かれている。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

YelpはGPT-Live-1を100万件のレストラン通話の背後に導入——だが何を買ったのかは明かさない

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Yelpは、2025年10月以降、Yelp Hostを通じて100万件を超えるレストランへの電話に対応しており、2026年9月10日時点でそれらの通話はOpenAIの全二重音声モデルであるGPT-Live-1上で実行されていると述べている。同じ発表では、GPT-Live-1が、サービス事業者向けのYelpのAIコミュニケーションプラットフォームであるHatchにも組み込まれており、同社によればこれは音声、テキスト、メール、ウェブにわたる数千万件のリードを管理しているという。これは、これまでに発表された全二重音声モデルの最大規模の本番導入である――そしてそれは、Yelpが書き得た中で最も数値の少ないプレスリリースに包まれて登場した。Yelpは通話対応が改善し、通話転送が減少したと報告している。しかし、どれだけ改善したのか、何件の通話でなのか、費用がいくらだったのかは述べていない。

どちらの事実も重要だ。この導入は、話しながら聞くモデルが実際の電話トラフィックとの接触に耐えるという確かな証拠であり、それはどんなベンチマークにも示せないことだ。沈黙もまた、ベンダー自身の数値が公表するに足るほど好都合ではなかったという確かな証拠である——あるいは、Yelpの投資家に対する開示義務が、そのマーケティング意欲よりも狭いという証拠でもある。

Yelpが実際に出荷したもの

このアーキテクチャは理解する価値のある部分だ。なぜなら、それはYelpの音声モデルではないからだ。GPT-Live-1はフロントエンドの音声レイヤーであり、発信者が話しかける相手であり、いつ聞き続けるか、いつターンを取るか、いつ譲るかを決めるものである。その下には、Yelp自身のビジネスデータと、同社が目的特化型インテリジェンスと呼ぶもの——レストランの営業時間、予約空き状況、メニュー、スペシャル、座席エリア、予約システムの現在の状態——が存在する。

その役割分担こそが製品のすべてだ。GPT-Live-1は、金曜日の7時30分に4人用のテーブルがあるかどうかは知らない。それを突き止める会話の進め方を知っている。モデルの仕事は、やり取りをメニューツリーではなく電話のように感じさせることだ。Yelpの仕事は、答えを正確にすることだ。

Yelpが掲げる行動に関する主張は、種類においては具体的だが、程度においては曖昧だ。発信者は話を遮ったり、文の途中で話題を変えたり、周囲の雑音を越えて話したりできるが、モデルはそれに適応する。システムは発信者の口調——興奮、いら立ち、せっかちさ——を検知し、それに応じて対応する。Yelpの言語拡張機能をGPT-Live-1の上に重ねることで、ほぼあらゆる言語で発信者を検知して応答できる。これはレストランの現実的な問題に対処する。シフトに発信者の言語を話す人がいないために電話を逃すことは、悪い体験ではなく、失われた予約なのだ。

その2つの運用上の主張は、レストランの運営者が実際にお金を払うであろうものだ。Yelpによると、発信者は今や短い音声コマンドではなく、完全で自然な文章で話すようになり、通話後の文字起こし精度も向上したため、運営者はよりクリーンな記録を得られるという。1つ目は、人々がエージェントを、話し方を工夫してかわさなければならない機械として扱うのをやめたことを示す先行指標である。2つ目は複利的な価値を持つものである。なぜなら、予約回線のアウトプットは予約だけではなく、記録でもあり、誰にも読めない記録は誰も行動に移せない記録だからだ。

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Rameshは役に立つことを言った

Yelpの最高製品責任者は、お決まりのコメントを述べた——あらゆる通話がより会話的で応答性の高いものになり、卓越したゲスト体験が実現し、スタッフは電話対応ではなくゲストをもてなすために解放される——そしてその後、プレスリリースの残り全部よりも価値のある一文を続けた。同氏によれば、Yelp Hostは「本来なら逃していたかもしれない収益機会」を捉えるという。

それがホスピタリティ業界における音声エージェントについての正直な捉え方であり、よくある労働代替の売り込みとは異なる主張だ。レストランは、ホストを解雇するためにAIホストを買うのではない。サービス中に電話が鳴っても誰も出られず、発信者が別の店を予約してしまうから買うのだ。Yelp Hostが2025年10月以来対応した100万件の電話は、その議論の分母である——そしてYelpは、そのうち何件が予約や注文になったかという分子を、あえて示さなかった。

Teri Yu(OpenAIのマルチモーダル製品責任者)は、同じ導入を逆の視点から捉え、顧客が予約の電話から修理の日程調整まで、あらゆる用途にGPT-Live-1を使っていると説明した。どちらの解釈も正しい。Yelpは業界特化型(バーティカル)を売り、OpenAIは業界横断型(ホリゾンタル)を売っている。

誰もリリースに書かなかった経済学

GPT-Live-1は音声1分あたり0.05ドルで、秒単位で課金され、このモデルは2026年9月10日に開発者向けに公開された——Yelpの発表が届いたのと同じ日である。その料金が対象とするのは音声レイヤーのみだ。Open​AIのドキュメントは明確に、モデルに代わって行われるバックエンド呼び出しは、別のモデルに委任する推論やツール使用を含め、そのモデルの通常料金で課金されると述べている。

それをYelpの数字に当てはめてみよう。レストラン予約の通話は短い——数分、時にはそれ未満だ。100万件の通話が各2分なら、およそ200万音声分、つまり製品の全歴史を通じた音声レイヤーの支出は約10万ドルだ。それはYelpにとっては端数誤差であり、まさにそこが要点だ。1分0.05ドルでは、音声レイヤーはシステムの高コスト部分ではない。高コストな部分は、各ターンの背後にある推論、電話網、各レストランの予約台帳への統合、そしてエージェントが対応できないことを処理する人間だ。

それはまた、分単位の料金は交渉すべき数字としては間違っているということも意味する。正しく委譲したことで1ターンで応答する音声エージェントは、90秒間もたつくエージェントよりもコストが低い。両方とも秒単位で課金されるとしても。転送が減ったというYelpの主張は、その曖昧さの裏では、コストに関する主張である。

音声の背後にある推論は通常のモデル呼び出しであり、このようなデプロイが実際に調整可能なのはその層です。約190モデル(11社の上流プロバイダーから)が、単一のOrcaRouterキーの背後に、プロバイダーの定価でマークアップなしで存在し、バックエンドでエラーが起きたりタイムアウトしたりすると自動フェイルオーバーが働きます——そのため、Yelp風の予約推論を行うモデルは、統合を再構築するのではなく、1つの設定値を変えるだけで、ライブ通話トラフィックに対して差し替えたりA/Bテストしたりできます。お金と品質の両方が宿るのはそこです。音声層の従量課金分数は比較的固定されています。

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

データこそが堀であり、モデルではない

どんな競合他社でも、明日にはGPT-Live-1を買うことができる。Toast、Square、Clover、ServiceTitan、Housecall Proはいずれも同じ顧客層に十分近い位置にあり、GoogleとAmazonのAlexa+は消費者側から同じ問題に取り組んでいる。Yelpの立場はモデルへの排他的アクセスに依存しているわけではなく、Yelp自身の枠組み——独自のビジネスデータと目的に特化したインテリジェンス、そしてGPT-Live-1を対話を担う層とする——も、そのことを認めている。

Yelpが所有しているのは予約グラフだ。どのレストランに席があり、いつ、何人分か、そして100万件の通話の背後に蓄積された消費者の意図。遮り可能なモデルは、そのデータを大規模に収集するための前提条件である。なぜなら、ターン制エージェントはより短い通話、より多くの途中切断、より汚い文字起こしを生むからだ。だから数字が伏せられていても、この導入は重要なのである。この文脈において、全二重はより快適なユーザー体験ではない。それはデータ収集の仕組みなのだ。

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

何を見るべきか

3つのことがあれば、これは信頼できる導入事例から測定可能な事例へと変わる。Yelpの次回決算説明会で、経営陣がコールデフレクションまたは予約転換率について数字を示せば。同じ統合を発表する2つ目の業種・分野が現れれば、全二重音声が汎用のアップグレードなのか、ホスピタリティ特化のものなのかが示される。そして、会話の仕組みではなく推論を評価するボード上でのGPT-Live-1の最初の独立評価。Artificial Analysis Speech to Speech Indexは現在、GPT-Live-1を70.3%とし、GPT-Live-1 miniと同率で、14モデル中同率6位につけている。79.0%のGr​ok Voice Think Fast 2.0 Highと73.9%のGPT-Realtime-2.1 Highの後塵を拝している。Yelp自身のアーキテクチャは、音声レイヤーと推論レイヤーを別々に評価すべきだという暗黙の賭けである。独立したスコアリングは、これまでのところ、その賭けの後半部分には同意しているが、前半部分には同意していない。

Yelpが何を変えたのかを公表するまでは、われわれ残りの者にとってこれは、成果ではなくアーキテクチャに関するデプロイ告知を読んでいるにすぎない。それでもやる価値はある。他のチームが今四半期にコピーできるのは、アーキテクチャの部分だからだ。