כרטיס כותרת ראשי עבור 'Yelp הציבה את GPT-Live-1 מאחורי מיליון שיחות למסעדות', עם כותרת משנה 'הפריסה הראשונה בהיקף גדול של קול דופלקס מלא, ללא מספרים מצורפים', הכולל שלושה כרטיסים עם הכיתוב 'Yelp Host: 1,000,000+ שיחות למסעדות מאז אוקטובר 2025', 'GPT-Live-1: $0.05 לדקת קול, הסקה בצד השרת מחויבת בנפרד', 'השפעה שנחשפה: כיוונית בלבד — אין נתוני טיפול בשיחות או העברה', מעל פס תחתון עם הכיתוב 'הנתונים של Yelp Host ו-Hatch הם לפי דיווח Yelp; התמחור של GPT-Live-1 לפי התיעוד של OpenAI.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Yelp הציבה את GPT-Live-1 מאחורי מיליון שיחות למסעדות — ומסרבת לומר מה רכשה

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Yelp אומרת שהיא טיפלה ביותר ממיליון שיחות למסעדות דרך Yelp Host מאז אוקטובר 2025, ושנכון ל-10 בספטמבר 2026 השיחות הללו פועלות על GPT-Live-1, מודל הקול הדופלקסי המלא של OpenAI. אותה הודעה מציבה את GPT-Live-1 בתוך Hatch, פלטפורמת התקשורת מבוססת הבינה המלאכותית של Yelp לעסקי שירות, שאותה החברה מתארת כמנהלת עשרות מיליוני לידים בקול, טקסט, דואר אלקטרוני ובווב. זוהי הפריסה הייצורית הגדולה ביותר של מודל דיבור דופלקסי מלא שמישהו הכריז עליה — והיא הגיעה עטופה בהודעה לעיתונות הפחות מכומתת ש-Yelp הייתה יכולה לכתוב. Yelp מדווחת שטיפול בשיחות השתפר ושהעברות שיחות ירדו. היא לא אומרת בכמה, על כמה שיחות, או מה עלותו של כל זה.

שתי העובדות חשובות. הפריסה היא ראיה אמיתית לכך שמודל שמקשיב בזמן שהוא מדבר שורד מפגש עם תעבורת טלפוניה אמיתית, וזה יותר ממה שכל בנצ'מרק יכול לקבוע. השתיקה היא ראיה אמיתית לכך שהמספרים של הספק עצמו לא היו מחמיאים מספיק כדי לפרסם — או שחובות הגילוי של Yelp למשקיעים צרות יותר מתיאבון השיווקי שלה.

מה Yelp בעצם השיקה

הארכיטקטורה היא החלק שכדאי להבין, כי הוא לא מודל קולי של Yelp. GPT-Live-1 הוא שכבת הקול הקדמית: הוא זה שאליו המתקשר מדבר, והוא זה שמחליט מתי להמשיך להקשיב, מתי לקחת תור, ומתי לוותר. מתחת יושבים נתוני העסקים של Yelp עצמה ומה שהחברה מכנה אינטליגנציה ייעודית — שעות הפעילות של המסעדה, זמינות ההזמנות שלה, התפריט שלה, המנות המיוחדות שלה, אזורי הישיבה שלה, והמצב הנוכחי של מערכת ההזמנות.

החלוקה הזו היא כל המוצר. GPT-Live-1 לא יודע אם קיים שולחן לארבעה בשעה 7:30 ביום שישי. הוא יודע לנהל את השיחה שמגלה את זה. תפקיד המודל הוא לגרום לחילופי הדברים להרגיש כמו שיחת טלפון ולא כמו עץ תפריטים; התפקיד של Yelp הוא להפוך את התשובה לנכונה.

הטענות ההתנהגותיות שמציגה Yelp ספציפיות בסוגן ומעורפלות במידתן. מתקשרים יכולים להפריע, להחליף נושא באמצע משפט או לדבר מעל רעש רקע, והמודל מסתגל. המערכת מזהה את טון המתקשר — התרגשות, תסכול, חוסר סבלנות — ומגיבה בהתאם. הרכבת שיפורי השפה של Yelp על גבי GPT-Live-1 מאפשרת לה לזהות ולענות למתקשרים כמעט בכל שפה, מה שמטפל בבעיה אמיתית של מסעדות: שיחה שלא נענתה משום שאיש במשמרת אינו מדבר את שפת המתקשר היא הזמנה שאבדה, ולא חוויה רעה.

שתי הטענות התפעוליות הן אלו שבעל מסעדה באמת היה משלם עליהן. Yelp אומרת שהמתקשרים מדברים כעת במשפטים מלאים וטבעיים ולא בפקודות קוליות קצרות, ושבהירות התמלול לאחר השיחה השתפרה, מה שמעניק למפעילים רשומות נקיות יותר. הראשונה היא אינדיקטור מוביל לכך שאנשים הפסיקו להתייחס לסוכן כמכונה שיש לדבר סביבה. השנייה היא זו עם הערך המצטבר, משום שהתפוקה של קו הזמנות אינה רק הזמנה — היא רשומה, ורשומה שאיש אינו יכול לקרוא היא רשומה שאיש אינו יכול לפעול לפיה.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Akhil Kuduvalli Ramesh אמר את הדבר השימושי

סמנכ״ל המוצרים של Yelp מסר את הציטוט הסטנדרטי — כל שיחה תהיה שיחתית ומגיבה יותר, חוויות אורח יוצאות דופן, צוות שמשוחרר לשרת את האורחים במקום לענות לטלפון — ואז משפט אחד ששווה יותר מכל שאר ההודעה לעיתונות. Yelp Host, לדבריו, לוכד "הזדמנויות הכנסה שאולי אחרת היו מחמיצים".

זו ההצגה הכנה עבור סוכני קול בתחום האירוח, והיא טענה שונה מהמסר הרגיל של החלפת כוח אדם. מסעדה לא קונה מארח AI כדי לפטר מארח. היא קונה אחד כי הטלפון מצלצל במהלך השירות, אף אחד לא יכול לענות לו, והמתקשר מזמין במקום אחר. מיליון השיחות ש-Yelp Host טיפל בהן מאז אוקטובר 2025 הן המכנה של הטיעון הזה — ו-Yelp במכוון לא סיפקה את המונה, שהוא כמה מהשיחות הללו הפכו להזמנות מקום או להזמנות.

טרי יו, מובילת המוצר הרב-מודאלי של OpenAI, הציגה את אותה פריסה מהכיוון ההפוך, ותיארה לקוחות שמשתמשים ב-GPT-Live-1 לכל דבר, משיחות הזמנות ועד תיאום תיקונים. שתי הקריאות נכונות. Yelp מוכרת את הוורטיקל; OpenAI מוכרת את ההוריזונטל.

הכלכלה שאיש לא הכניס להודעה לעיתונות

GPT-Live-1 עולה $0.05 לכל דקת קול, בחיוב לפי שנייה, והמודל נפתח למפתחים ב-10 בספטמבר 2026 — באותו יום שבו פורסמה ההודעה של Yelp. שכבת הקול היא הדבר היחיד שתעריף זה מכסה. התיעוד של OpenAI מבהיר במפורש שקריאות backend שנעשות מטעם המודל, כולל ההיסק והשימוש בכלים שהוא מאציל למודל אחר, מחויבות בתעריפים הרגילים של אותו מודל.

השווה את זה לנתון של Yelp. שיחת הזמנת מסעדה קצרה — כמה דקות, לפעמים פחות. מיליון שיחות באורך שתי דקות כל אחת הן בערך שני מיליון דקות קול, או כ-$100,000 של הוצאות על שכבת הקול לאורך כל ההיסטוריה של המוצר. זו שגיאת עיגול עבור Yelp, וזו בדיוק הנקודה: בתעריף של $0.05 לדקה, שכבת הקול אינה החלק היקר במערכת. החלקים היקרים הם ההיסק מאחורי כל סבב שיחה, הטלפוניה, האינטגרציה אל ספר ההזמנות של כל מסעדה, והאנשים שמטפלים במה שהסוכן לא יכול.

זה גם אומר שתעריף לפי דקה הוא המספר הלא נכון לנהל עליו משא ומתן. סוכן קולי שעונה בתור אחד משום שהאציל נכון עולה פחות מסוכן שמתקשה במשך תשעים שניות, אף ששניהם מחויבים לפי שנייה. הטענה של Yelp שההעברות ירדו היא, מתחת לעמימות, טענת עלות.

ההיגיון שמאחורי הקול הוא קריאת מודל רגילה, והשכבה הזו היא המקום שבו פריסה כמו זו ניתנת למעשה לכוונון. בסביבות 190 מודלים מאחד עשר ספקי upstream יושבים מאחורי מפתח OrcaRouter יחיד במחיר המחירון של הספק ללא מרווח, עם מעבר אוטומטי לגיבוי כאשר ה-backend מחזיר שגיאה או חורג מהזמן המוקצב — כך שמודל שמבצע הסקת הזמנות בסגנון Yelp יכול להיות מוחלף או להיבדק ב-A/B מול תעבורת שיחות חיה על ידי שינוי ערך תצורה אחד במקום לבנות מחדש את האינטגרציה. שם נמצאים גם הכסף וגם האיכות; הדקות הנמדדות של שכבת הקול קבועות יחסית.

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

הנתונים הם החפיר, לא המודל.

כל מתחרה יכול לקנות את GPT-Live-1 מחר. Toast, Square, Clover, ServiceTitan ו-Housecall Pro כולם יושבים קרוב מספיק לאותם לקוחות, ו-Goog​le ו-Alexa+ של אמזון עובדים על אותה בעיה מהצד הצרכני. שום דבר במיצוב של Yelp לא תלוי בגישה בלעדית למודל, והמסגור של Yelp עצמו — נתונים עסקיים קנייניים בתוספת בינה ייעודית, כאשר GPT-Live-1 משמש כשכבת הדיבור — מודה בכך.

מה ש-Yelp מחזיקה הוא גרף ההזמנות: אילו מסעדות יש להן שולחנות, מתי, לכמה, והכוונה המצטברת של הצרכנים שמאחורי מיליון שיחות. מודל שניתן לקטוע הוא תנאי הכרחי לאיסוף הנתונים האלה בקנה מידה גדול, משום שסוכן מבוסס-תורות מייצר שיחות קצרות יותר, יותר ניתוקים ותמלולים מלוכלכים יותר. זו הסיבה שהפריסה משנה גם כשהמספרים אינם נמסרים. דופלקס מלא אינו חוויית משתמש נעימה יותר בהקשר הזה; זהו מנגנון איסוף הנתונים.

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

מה לצפות

שלושה דברים יהפכו את זה מסיפור פריסה אמין לסיפור מדיד. שיחת הרווחים הבאה של Yelp, אם ההנהלה תיתן מספר לסטיית שיחות או להמרת הזמנות. סקטור אנכי שני שיכריז על אותה אינטגרציה, מה שיראה אם קול דופלקס מלא הוא שדרוג לשימוש כללי או שדרוג ייעודי לאירוח. וההערכה הבלתי תלויה הראשונה של GPT-Live-1 בלוח שמדרג חשיבה ולא מכניקה שיחתית — ה-Artificial Analysis Speech to Speech Index מציב אותו כיום ב-70.3%, בשווה ל-GPT-Live-1 mini ובמקום השישי במשותף בלוח של ארבעה-עשר מודלים, אחרי Grok Voice Think Fast 2.0 High עם 79.0% ו-GPT-Realtime-2.1 High עם 73.9%. הארכיטקטורה של Yelp עצמה היא הימור מרומז ששכבת הקול ושכבת החשיבה צריכות להישפט בנפרד. ניקוד בלתי תלוי, עד כה, מסכים עם המחצית השנייה של ההימור הזה ולא עם הראשונה.

עד ש-Yelp תפרסם מה השתנה, כולנו האחרים קוראים הכרזת פריסה על הארכיטקטורה שלה ולא על התוצאות שלה. עדיין שווה לעשות זאת, מפני שהארכיטקטורה היא החלק שצוותים אחרים יכולים להעתיק ברבעון הזה.