การ์ดชื่อเรื่องหลักสำหรับ 'Yelp นำ GPT-Live-1 ไปใช้เบื้องหลังการโทรจากร้านอาหารหนึ่งล้านครั้ง' มีคำบรรยายใต้ชื่อว่า 'การใช้งานจริงครั้งแรกในวงกว้างของเสียงแบบฟูลดูเพล็กซ์ โดยไม่มีตัวเลขแนบมาด้วย' พร้อมการ์ดสามใบที่ระบุว่า 'Yelp Host: การโทรจากร้านอาหาร 1,000,000+ ครั้งตั้งแต่ตุลาคม 2025', 'GPT-Live-1: $0.05 ต่อนาทีเสียง โดยคิดค่าการประมวลผลเหตุผลฝั่งแบ็กเอนด์แยกต่างหาก', 'ผลกระทบที่เปิดเผย: เป็นเพียงทิศทางเท่านั้น — ไม่มีตัวเลขการจัดการสายหรือการโอนสาย' เหนือแถบส่วนท้ายที่ระบุว่า 'ตัวเลขของ Yelp Host และ Hatch เป็นข้อมูลที่ Yelp รายงาน; ราคาของ GPT-Live-1 ตามเอกสารของ OpenAI' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมล่างขวา
Guides & Insights

Yelp ใช้ GPT-Live-1 รองรับการโทรหาร้านอาหารกว่าล้านสาย — และไม่ยอมบอกว่าซื้ออะไรมา

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Yelp กล่าวว่าได้จัดการสายโทรหาร้านอาหารมากกว่าหนึ่งล้านสายผ่าน Yelp Host ตั้งแต่เดือนตุลาคม 2025 และณ วันที่ 10 กันยายน 2026 สายเหล่านั้นทำงานบน GPT-Live-1 ซึ่งเป็นโมเดลเสียงแบบฟูลดูเพล็กซ์ของ OpenAI คำประกาศเดียวกันนี้ระบุว่า GPT-Live-1 อยู่ภายใน Hatch แพลตฟอร์มการสื่อสารด้วย AI ของ Yelp สำหรับธุรกิจบริการ ซึ่งบริษัทอธิบายว่าจัดการลีดหลายสิบล้านรายการผ่านเสียง ข้อความ อีเมล และเว็บ นี่คือการใช้งานโมเดลเสียงแบบฟูลดูเพล็กซ์ในงานจริงที่ใหญ่ที่สุดเท่าที่เคยมีใครประกาศ — และมันมาพร้อมกับข่าวประชาสัมพันธ์ที่ให้ข้อมูลเชิงปริมาณน้อยที่สุดเท่าที่ Yelp จะเขียนได้ Yelp รายงานว่าการจัดการสายดีขึ้นและจำนวนการโอนสายลดลง แต่ไม่ได้บอกว่าดีขึ้นแค่ไหน จากจำนวนสายเท่าใด หรือค่าใช้จ่ายใด ๆ เป็นเท่าไร

ข้อเท็จจริงทั้งสองข้อนี้สำคัญ การนำไปใช้งานจริงเป็นหลักฐานจริงว่าโมเดลที่ฟังในขณะที่พูดนั้นอยู่รอดเมื่อเผชิญกับทราฟฟิกโทรศัพท์จริง ซึ่งเป็นสิ่งที่เกินกว่าที่ benchmark ใดจะยืนยันได้ ความเงียบเป็นหลักฐานจริงว่าตัวเลขของผู้ขายเองไม่น่าประทับใจพอที่จะพิมพ์ — หรือไม่ก็ ภาระผูกพันในการเปิดเผยข้อมูลต่อนักลงทุนของ Yelp นั้นแคบกว่าความอยากทำการตลาดของบริษัท

สิ่งที่ Yelp ปล่อยออกมา�าจริงๆ

สถาปัตยกรรมเป็นส่วนที่ควรค่าแก่การทำความเข้าใจ เพราะมันไม่ใช่โมเดลเสียงของ Yelp GPT-Live-1 คือชั้นเสียงส่วนหน้าสุด เป็นสิ่งที่ผู้โทรพูดคุยด้วย และเป็นตัวตัดสินใจว่าเมื่อใดควรฟังต่อ เมื่อใดควรได้คิวพูด และเมื่อใดควรปล่อยให้อีกฝ่ายพูด ภายใต้ชั้นนั้นเป็นข้อมูลธุรกิจของ Yelp เอง และสิ่งที่บริษัทเรียกว่าปัญญาที่สร้างขึ้นมาเพื่อจุดประสงค์เฉพาะ — เวลาทำการของร้าน ข้อมูลห้องว่างสำหรับการจอง เมนู ข้อเสนอพิเศษ โซนที่นั่ง และสถานะปัจจุบันของระบบจอง

การแยกบทบาทแบบนั้นคือผลิตภัณฑ์ทั้งหมด GPT-Live-1 ไม่รู้ว่ามีโต๊ะสำหรับสี่คนตอน 7:30 ในวันศุกร์หรือไม่ มันรู้วิธีสนทนาเพื่อหาคำตอบนั้น หน้าที่ของโมเดลคือทำให้การสนทนารู้สึกเหมือนการโทรศัพท์มากกว่าลำดับเมนูแบบต้นไม้ ส่วนหน้าที่ของ Yelp คือทำให้คำตอบถูกต้อง

ข้ออ้างเชิงพฤติกรรมที่ Yelp ระบุนั้นเจาะจงในด้านประเภท แต่คลุมเครือในด้านระดับ ผู้โทรสามารถพูดขัด เปลี่ยนหัวข้อกลางประโยค หรือพูดกลบเสียงรบกวนรอบข้าง และโมเดลก็ปรับตัวได้ ระบบตรวจจับโทนเสียงของผู้โทร — ความตื่นเต้น ความหงุดหงิด ความไม่อดทน — และตอบสนองอย่างเหมาะสม การนำการปรับปรุงด้านภาษาของ Yelp มาซ้อนทับบน GPT-Live-1 ทำให้สามารถตรวจจับและตอบผู้โทรได้ในเกือบทุกภาษา ซึ่งแก้ปัญหาจริงของร้านอาหาร: สายที่พลาดไปเพราะไม่มีใครในกะที่พูดภาษาของผู้โทรได้ คือการจองที่หลุดไป ไม่ใช่ประสบการณ์แย่ ๆ

ข้อกล่าวอ้างด้านการดำเนินงานสองข้อนี้คือสิ่งที่ผู้ประกอบการร้านอาหารยอมจ่ายเงินซื้อจริง ๆ Yelp ระบุว่าตอนนี้ผู้โทรพูดเป็นประโยคที่สมบูรณ์และเป็นธรรมชาติ แทนที่จะเป็นคำสั่งเสียงสั้น ๆ และความแม่นยำในการถอดเสียงหลังจบสายก็ดีขึ้น ทำให้ผู้ประกอบการได้บันทึกที่สะอาดขึ้น ข้อแรกเป็นตัวชี้วัดล่วงหน้าว่าผู้คนเลิกปฏิบัติต่อเอเจนต์เสมือนเป็นเครื่องจักรที่ต้องพูดอ้อม ๆ เลี่ยง ๆ ส่วนข้อที่สองคือข้อที่มีคุณค่าแบบทบต้น เพราะผลลัพธ์ของสายจองไม่ได้มีแค่การจองเท่านั้น — มันคือบันทึก และบันทึกที่ไม่มีใครอ่านได้ก็คือบันทึกที่ไม่มีใครลงมือทำอะไรกับมันได้

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

อคิล คูดูวัลลี ราเมช กล่าวสิ่งที่เป็นประโยชน์

ประธานเจ้าหน้าที่ฝ่ายผลิตภัณฑ์ของ Yelp กล่าวคำกล่าวแบบมาตรฐาน — ทุกสายสนทนามีความเป็นธรรมชาติและตอบสนองดีขึ้น ประสบการณ์ของแขกยอดเยี่ยม พนักงานเป็นอิสระที่จะให้บริการแขกแทนการรับโทรศัพท์ — แล้วก็มีอีกหนึ่งประโยคที่มีค่ามากกว่าส่วนที่เหลือของข่าวประชาสัมพันธ์ทั้งหมด เขากล่าวว่า Yelp Host คว้า “โอกาสสร้างรายได้ที่พวกเขาอาจพลาดไป”

นั่นคือการวางกรอบอย่างตรงไปตรงมาสำหรับเอเจนต์เสียงในธุรกิจบริการ และเป็นข้อกล่าวอ้างที่แตกต่างจากคำนำเสนอขายเรื่องการแทนที่แรงงานแบบปกติ ร้านอาหารไม่ได้ซื้อโฮสต์ AI เพื่อไล่พนักงานต้อนรับออก ร้านซื้อมันเพราะระหว่างให้บริการมีโทรศัพท์ดังขึ้น ไม่มีใครรับสายได้ และคนที่โทรมาจองร้านอื่นแทน หนึ่งล้านสายที่ Yelp Host รับมือตั้งแต่เดือนตุลาคม 2025 คือตัวส่วนของข้อโต้แย้งนั้น — และ Yelp ก็ไม่ได้ให้ตัวเศษอย่างจงใจ ซึ่งก็คือจำนวนของสายเหล่านั้นที่กลายเป็นการจองหรือคำสั่งซื้อ

เทรี ยู หัวหน้าฝ่ายผลิตภัณฑ์มัลติโมดัลของ OpenAI ตีความการนำไปใช้เดียวกันในอีกมุมหนึ่ง โดยอธิบายว่าลูกค้าใช้ GPT-Live-1 ตั้งแต่การโทรจองไปจนถึงการนัดซ่อม ทั้งสองมุมมองนี้เป็นจริง Yelp กำลังขายแนวตั้ง ส่วน OpenAI กำลังขายแนวนอน

เศรษฐศาสตร์ที่ไม่มีใครใส่ไว้ในข่าวประชาสัมพันธ์

GPT-Live-1 มีค่าใช้จ่าย $0.05 ต่อนาทีสำหรับเสียง โดยคิดค่าบริการเป็นรายวินาที และโมเดลนี้เปิดให้นักพัฒนาใช้งานเมื่อวันที่ 10 กันยายน 2026 — วันเดียวกับที่ประกาศของ Yelp เผยแพร่ อัตราค่าบริการดังกล่าวครอบคลุมเฉพาะเลเยอร์เสียงเท่านั้น เอกสารของ Open​AI ระบุไว้อย่างชัดเจนว่า การเรียกไปยังแบ็กเอนด์ที่ทำในนามของโมเดล ซึ่งรวมถึงการให้เหตุผลและการใช้เครื่องมือที่โมเดลส่งต่อไปยังโมเดลอื่น จะคิดค่าบริการตามอัตราปกติของโมเดลนั้น

ลองเอาไปเทียบกับตัวเลขของ Yelp ดู การโทรจองร้านอาหารใช้เวลาสั้น — แค่สองสามนาที บางครั้งก็น้อยกว่านั้น การโทรหนึ่งล้านครั้ง ครั้งละสองนาที คิดเป็นประมาณสองล้านนาทีเสียง หรือประมาณ $100,000 ของค่าใช้จ่ายในเลเยอร์เสียงตลอดประวัติทั้งหมดของผลิตภัณฑ์ นั่นเป็นเพียงความคลาดเคลื่อนจากการปัดเศษสำหรับ Yelp และนั่นแหละคือประเด็น: ที่ราคา $0.05 ต่อนาที เลเยอร์เสียงไม่ใช่ส่วนที่แพงของระบบ ส่วนที่แพงคือการให้เหตุผลเบื้องหลังแต่ละเทิร์น ระบบโทรศัพท์ การเชื่อมต่อเข้ากับสมุดจองของร้านอาหารแต่ละแห่ง และมนุษย์ที่จัดการกับสิ่งที่เอเจนต์ทำไม่ได้

นี่ยังหมายความว่าอัตราค่าบริการต่อนาทีเป็นตัวเลขที่ไม่ควรนำมาเจรจาต่อรอง วอยซ์เอเจนต์ที่ตอบได้ในเทิร์นเดียวเพราะมอบหมายงานได้อย่างถูกต้องมีต้นทุนต่ำกว่าวอยซ์เอเจนต์ที่ดิ้นรนอย่างไร้ทิศทางอยู่ถึงเก้าสิบวินาที แม้ว่าทั้งคู่จะคิดค่าบริการเป็นรายวินาทีก็ตาม คำกล่าวอ้างของ Yelp ที่ว่าจำนวนการโอนสายลดลงนั้น เมื่อมองผ่านความคลุมเครือออกไป แท้จริงแล้วก็เป็นคำกล่าวอ้างเรื่องต้นทุน

เหตุผลเบื้องหลังเสียงคือการเรียกโมเดลแบบปกติ และเลเยอร์นั้นคือจุดที่การติดตั้งใช้งานแบบนี้สามารถปรับแต่งได้จริง โมเดล 190 รายการจากผู้ให้บริการต้นทาง 11 รายอยู่เบื้องหลังคีย์ OrcaRouter เพียงคีย์เดียว ในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มใด ๆ พร้อมระบบสลับอัตโนมัติเมื่อแบ็กเอนด์เกิดข้อผิดพลาดหรือหมดเวลา — ดังนั้นโมเดลที่ทำการให้เหตุผลการจองแบบสไตล์ Yelp จึงสามารถสลับหรือทดสอบแบบ A/B กับทราฟฟิกสายจริงได้โดยเปลี่ยนค่าคอนฟิกูเรชันเพียงค่าเดียว แทนที่จะต้องสร้างการเชื่อมต่อใหม่ขึ้นมา นั่นคือจุดที่ทั้งเงินและคุณภาพอยู่ร่วมกัน ส่วนนาทีที่คิดตามปริมาณการใช้งานของเลเยอร์เสียงนั้นค่อนข้างตายตัว

A generated infographic card titled 'Yelp Host and Hatch on GPT-Live-1 — what was announced'. Two columns. The left column, labelled 'What Yelp shipped', reads 'GPT-Live-1 as the front-end voice layer', 'Yelp business data and reservation availability underneath', 'Live in Yelp Host and Hatch', 'Tone detection: excitement, frustration, impatience', 'Near-universal language detection'. The right column, labelled 'What Yelp disclosed', reads 'More than 1,000,000 calls since October 2025', 'Improved call handling — no figure given', 'Fewer call transfers — no figure given', 'Callers speaking in full sentences', 'Better post-call transcription accuracy'. A footer reads 'Yelp-reported deployment claims, September 10, 2026; no independent verification.' The OrcaRouter logo is composited in the bottom-right corner.

ข้อมูลต่างหากที่เป็นคูเมือง ไม่ใช่โมเดล

คู่แข่งรายใดก็สามารถซื้อ GPT-Live-1 ได้ในวันพรุ่งนี้ Toast, Square, Clover, ServiceTitan และ Housecall Pro ต่างก็เข้าใกล้กลุ่มลูกค้ากลุ่มเดียวกันมากพอ ๆ กัน และ Alexa+ ของ Google และ Amazon ก็กำลังแก้ปัญหาเดียวกันนี้จากฝั่งผู้บริโภค ไม่มีส่วนใดในจุดยืนของ Yelp ที่ต้องพึ่งพาการเข้าถึงโมเดลนี้แต่เพียงผู้เดียว และกรอบคำอธิบายของ Yelp เอง — ข้อมูลธุรกิจอันเป็นกรรมสิทธิ์บวกกับระบบอัจฉริยะที่สร้างขึ้นเพื่อการใช้งานโดยเฉพาะ โดยมี GPT-Live-1 เป็นชั้นที่ทำหน้าที่สื่อสาร — ก็ยอมรับข้อนั้น

สิ่งที่ Yelp ครอบครองคือกราฟการจอง: ร้านอาหารร้านใดมีโต๊ะ เมื่อใด สำหรับจำนวนเท่าใด และเจตนาของผู้บริโภคที่สั่งสมอยู่เบื้องหลังการโทรนับล้านครั้ง โมเดลที่สามารถถูกขัดจังหวะได้เป็นเงื่อนไขจำเป็นสำหรับการเก็บข้อมูลนั้นในระดับสเกล เพราะเอเจนต์แบบผลัดกันพูดทำให้การโทรสั้นลง มีการวางสายมากขึ้น และได้บทถอดเสียงที่ยุ่งเหยิงกว่า นั่นคือเหตุผลว่าทำไมการนำไปใช้งานจึงสำคัญ แม้ว่าตัวเลขจะไม่ถูกเปิดเผยก็ตาม ฟูลดูเพล็กซ์ไม่ใช่ประสบการณ์ผู้ใช้ที่ดีกว่าในบริบทนี้ แต่เป็นกลไกการเก็บข้อมูลต่างหาก

A screenshot of the Artificial Analysis Speech to Speech Index, marked Updated, ranking fourteen native speech-to-speech models on a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7%, GPT-Realtime Mini at 56.8% and Gemini 2.5 Flash at 52.8%. A companion panel headed 'Cost per Hour of Input Audio' charts a similar field.

ดูอะไรดี

สามสิ่งจะเปลี่ยนเรื่องนี้จากเรื่องราวการใช้งานจริงที่น่าเชื่อถือให้กลายเป็นเรื่องที่วัดผลได้ การประชุมนักวิเคราะห์ครั้งถัดไปของ Yelp หากฝ่ายบริหารระบุตัวเลขสำหรับอัตราการ deflect สาย หรืออัตราการแปลงเป็นจอง อุตสาหกรรมแนวตั้งรายที่สองที่ประกาศการผสานรวมแบบเดียวกัน ซึ่งจะแสดงให้เห็นว่าเสียงแบบ full-duplex เป็นการยกระดับที่ใช้ได้ทั่วไป หรือใช้ได้เฉพาะกับธุรกิจบริการต้อนรับเท่านั้น และการประเมินอิสระครั้งแรกของ GPT-Live-1 บนลีดเดอร์บอร์ดที่ให้คะแนนด้านการใช้เหตุผลมากกว่ากลไกการสนทนา โดยปัจจุบัน Artificial Analysis Speech to Speech Index จัดให้อยู่ที่ 70.3% เท่ากับ GPT-Live-1 mini และอยู่อันดับที่หกร่วมบนลีดเดอร์บอร์ด 14 โมเดล ตามหลัง Grok Voice Think Fast 2.0 High ที่ 79.0% และ GPT-Realtime-2.1 High ที่ 73.9% สถาปัตยกรรมของ Yelp เองคือการเดิมพันโดยปริยายว่าเลเยอร์เสียงกับเลเยอร์การใช้เหตุผลควรถูกตัดสินแยกจากกัน การให้คะแนนโดยอิสระจนถึงตอนนี้เห็นด้วยกับครึ่งหลังของการเดิมพันนั้น ไม่ใช่ครึ่งแรก

จนกว่า Yelp จะเปิดเผยว่ามีอะไรเปลี่ยนแปลงไปบ้าง พวกเราที่เหลือก็ได้แต่อ่านประกาศการดีพลอยฉบับนี้ในแง่ของสถาปัตยกรรมมากกว่าผลลัพธ์ ซึ่งก็ยังคุ้มค่าที่จะทำอยู่ดี เพราะสถาปัตยกรรมคือส่วนที่ทีมอื่น ๆ สามารถลอกเลียนไปใช้ได้ในไตรมาสนี้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube