การ์ดฮีโร่ที่สร้างขึ้นสำหรับบทความ 'Muse Realtime Avatar vs GPT-Live-1' แสดงการ์ดมุมโค้งสองใบขนาบทั้งสองข้างของพาดหัว การ์ดด้านซ้ายเขียนว่า 'Muse Realtime Avatar' เหนือไอคอนอวตารรูปคน และมีบรรทัดว่า 'วิดีโอ + เสียง, สตรีมเดียว' และ 'ไม่มี API, ไม่มีราคา, ไม่มีวันที่'; การ์ดด้านขวาเขียนว่า 'GPT-Live-1' เหนือไอคอนฟองคำพูด และมีบรรทัดว่า '$0.05 ต่อนาที, คิดค่าบริการเป็นรายวินาที' และ 'เซสชันพร้อมกัน, WebRTC' คำโปรยย่อยเขียนว่า 'อันหนึ่งขายเป็นนาที อีกอันขายการมีอยู่' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Muse Realtime Avatar กับ GPT-Live-1: การมีตัวตนปะทะการสนทนา

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หน่วยเรียกเก็บเงินบอกคุณว่าแต่ละบริษัทคิดว่าตนกำลังขายอะไร GPT-Live-1 โมเดลเสียงแบบ full-duplex ของ Open​AI คิดค่าบริการเหมาจ่าย $0.05 ต่อนาทีของเสียง โดยคิดเป็นรายวินาที และขีดจำกัดอัตราของมันนับเป็นเซสชันพร้อมกัน — 25 ใน Tier 1 เพิ่มขึ้นเป็น 500 ที่ Tier 5 นั่นคือหน่วยของสายโทรศัพท์ Muse Realtime Avatar ที่ Meta ประกาศเมื่อวันที่ 23 กันยายน 2026 ไม่มีหน่วยเรียกเก็บเงิน เพราะไม่มีอะไรให้เรียกเก็บ: ไม่มี API ไม่มี endpoint ไม่มีราคา ไม่มีวันที่ หน่วยที่เปิดเผยของมันเป็นตัวเลขฮาร์ดแวร์แทน — 12 เซสชันเรียลไทม์พร้อมกันบน NVIDIA GB200 หนึ่งตัว บริษัทหนึ่งกำลังขายบทสนทนาเป็นรายนาที อีกบริษัทกำลังแสดงให้คุณเห็นว่าการเรนเดอร์ใบหน้าหนึ่งหน้ามีต้นทุนเท่าไร และยังไม่ได้ตัดสินใจจะขายมัน

โมเดลทั้งสองค่อนข้างใหม่ และไม่มีอันใดเป็นการเปิดตัวในความหมายที่คำนี้มักจะสื่อ GPT-Live-1 เปิดตัวภายใน ChatGPT เมื่อวันที่ 8 กรกฎาคม 2026 และเพิ่งเข้าถึง developer API เมื่อวันที่ 10 กันยายน — สองเดือนที่มันเป็นเสียงเริ่มต้นของผลิตภัณฑ์สำหรับผู้บริโภค และไม่พร้อมให้บริการสำหรับผู้ที่ต้องการพัฒนา Muse Realtime Avatar ถูกประกาศเมื่อวันที่ 23 กันยายน 2026 ที่ Meta Connect ถูกสาธิตในโพสต์วิจัยของ Meta เอง และยังคงเป็นความสามารถของ Muse agent มากกว่าที่จะเป็นผลิตภัณฑ์ การเปรียบเทียบทั้งสองคือการเปรียบเทียบสองขั้นตอนที่แตกต่างกันของแนวคิดเดียวกัน: เกิดอะไรขึ้นเมื่อโมเดลสนทนาดีพอจนคำถามถัดไปคือสิ่งที่ผู้ใช้กำลังมองดูอยู่ในขณะที่มันพูด

สิ่งที่ OpenAI สร้างขึ้น: บทสนทนาที่ไม่เคยหยุดชะงัก

GPT-Live-1 เป็นฟูลดูเพล็กซ์ในความหมายที่สำคัญในเชิงการใช้งานจริง — มันไม่ได้รอให้คุณพูดจบก่อนจึงจะเริ่มทำงาน มันเข้าถึง developer API ผ่าน endpoint เพียงหนึ่งเดียวเท่านั้น คือ Live Sessions endpoint ภายใต้ model ID เพียงหนึ่งเดียว gpt-live-1 โดยไม่มี dated snapshot ให้ปักหมุด และไม่มี endpoint แบบพี่น้องที่เปิดใช้งานอยู่ ไม่มี Chat Completions ไม่มี Responses ไม่มี Realtime ไม่มี fine-tuning ไม่มี endpoint สำหรับการถอดเสียงหรือเสียงพูด อินพุตรูปภาพและวิดีโอไม่ได้รับการสนับสนุนอย่างชัดเจน

การตัดสินใจออกแบบที่กำหนดทุกอย่างที่ตามมาคือการมอบหมายงานให้ตัวอื่นทำงานแทน GPT-Live-1 ไม่ได้คิดงานหนักด้วยตัวเอง เอกสารของ Open​AI จับคู่เลเยอร์เสียงกับแบ็กเอนด์การให้เหตุผลแยกต่างหาก และในตัวอย่าง WebRTC ที่เผยแพร่ แบ็กเอนด์นั้นคือ GPT-5.6 Terra ดังนั้นเซสชัน GPT-Live-1 จึงมีมิเตอร์สองตัวทำงานพร้อมกัน: นาทีละ $0.05 สำหรับเสียง บวกกับอัตราคิดค่าตามโทเคนปกติของโมเดลแบ็กเอนด์สำหรับทุกการเรียกใช้เครื่องมือ การค้นหา และขั้นตอนการให้เหตุผลที่มันส่งต่อไป ใน Speech to Speech Index บุคลิกที่แยกออกมานั้นปรากฏเป็นการที่โมเดลเดียวกันได้คะแนนสองครั้ง — 81.5 โดยมี GPT-6 Astra เป็นตัวคิดที่ความพยายามระดับปานกลาง, 80.1 โดยมี GPT-5.6 Sol ที่ความพยายามต่ำ ช่องว่าง 1.4 จุดระหว่างสองการกำหนดค่านี้กว้างกว่าส่วนต่าง 0.2 จุดที่ทำให้การกำหนดค่าที่ดีที่สุดของ GPT-Live-1 อยู่ในอันดับหนึ่ง

นั่นคือภาพที่แท้จริงของโมเดล ฟรอนต์เอนด์ด้านเสียงนั้นคงที่ ส่วนความฉลาดเป็นพารามิเตอร์ที่คุณตั้งค่า และมันขยับคะแนนได้มากกว่าโมเดลคู่แข่งใด ๆ

สิ่งที่ Meta สร้าง: ใบหน้าที่เคลื่อนไหวตามเสียง

Muse Realtime Avatar จัดการกับปัญหาที่ GPT-Live-1 ไม่มี — การทำให้วิดีโอที่สร้างขึ้นเดินคู่พร้อมกับเสียงพูดที่สร้างขึ้นอย่างแม่นยำแบบล็อกสเต็ป คำตอบของ Meta คือทำให้ทั้งสองกลายเป็นสตรีมเดียวกัน: Muse Realtime Voice ปล่อยโทเคนเสียงพูดที่บรรจุทั้งเนื้อหาและจังหวะเสียง และอวตารเป็น Diffusion Transformer ที่ขับเคลื่อนด้วยเสียงซึ่งใช้โทเคนชุดเดียวกันนั้น โดยมีเงื่อนไขจากภาพอ้างอิงและหน้าต่างเลื่อนของเลเทนต์วิดีโอล่าสุด ไม่มีการซิงค์ริมฝีปากในภายหลัง เพราะไม่มี "ภายหลัง" ให้ทำ — เสียง ปาก และสีหน้า ล้วนออกมาจากกระบวนการเดียว

ตัวเลขที่เผยแพร่เป็นของ Meta เอง วัดเทียบกับค่าพื้นฐานที่ Meta เลือก และไม่มีตัวเลขใดถูกทำซ้ำนอกบริษัท 870 มิลลิวินาทีจากจุดสิ้นสุดเทิร์นของคุณถึงไบต์แรกของการตอบกลับด้วยเสียงและวิดีโอที่ซิงโครไนซ์กัน วิดีโอแนวตั้ง 448×768 ที่ 25 เฟรมต่อวินาที มีลายน้ำแบบโอเวอร์เลย์โปร่งใสเพื่อให้ผู้ชมทราบว่ามันไม่ใช่กล้อง สิบสองเซสชันพร้อมกันบน GB200 หนึ่งตัว เพิ่มความจุ 8 เท่าเหนือค่าพื้นฐาน BF16 แบบสองขั้นตอนของ Meta เอง จากการฝึกที่คำนึงถึงการควอนไทซ์สี่บิต แคช KV แบบถาวร และการแบตช์แบบไดนามิกที่คำนึงถึงความหน่วง และผลลัพธ์ด้านความชอบที่ Meta รายงานว่าเพิ่มจาก 45% เป็น 55% เหนือค่าพื้นฐานนั้น โดยมีชัยชนะที่เปิดเผยสองครั้งต่อระบบอวตารเชิงพาณิชย์ — บวกกับการเปิดเผยว่าในด้านกิริยาท่าทาง ผลลัพธ์กับหนึ่งในนั้นไม่สามารถแยกความแตกต่างทางสถิติจากความเท่าเทียมได้

ไม่มีอะไรในรายการนั้นที่เป็นอัตรา, เอ็นด์พอยต์ หรือวันที่

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

บิลสองเมตร และจุดที่การจัดเส้นทางพิสูจน์คุณค่าของตัวเอง

โครงสร้างต้นทุนของ GPT-Live-1 ไม่ใช่ตัวเลขเดียว และการมองมันเป็นตัวเลขเดียวคือวิธีที่โมเดลเสียงที่ฟังดูถูกทำให้เกิดค่าใช้จ่ายระดับแพงทั้งเดือน เสียงคิดราคา $0.05 ต่อนาที คิดตามวินาทีโดยไม่ปัดขึ้น และ 15 วินาทีแรกของเซสชันจะถูกเรียกเก็บล่วงหน้า แต่จะถูกหักลบกับระยะเวลาที่ตามมา แทนที่จะบวกซ้อนเพิ่มเข้าไป ทุกสิ่งที่เซสชันมอบหมายงานให้ทำ — การให้เหตุผล การเรียกใช้เครื่องมือ การค้นหาใด ๆ — จะถูกคิดราคาแยกต่างหากในอัตราของโมเดลเบ็กเอนด์เอง ชี้การมอบหมายงานไปที่ตัวให้เหตุผลระดับแนวหน้าและปล่อยให้มันค้นหาในทุกเทิร์น แล้วคุณก็จะได้สายเปิดที่ราคา $3 ต่อชั่วโมงโดยมีโมเดลระดับพรีเมียมอยู่เบื้องหลัง

มิเตอร์ตัวที่สองคือครึ่งที่กำหนดเส้นทางได้ บน OrcaRouter แบ็กเอนด์ของเซสชัน GPT-Live-1 ก็เป็นเพียงการเรียกโมเดลอีกครั้ง: 196 โมเดลจาก 15 ผู้ให้บริการภายใต้คีย์เดียว ในราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่มีมาร์กอัปใด ๆ พร้อมการสลับไปใช้ตัวสำรองอัตโนมัติเมื่อโมเดลที่คุณเลือกเกิดข้อผิดพลาดหรือหมดเวลา คุณไม่สามารถกำหนดเส้นทางเลเยอร์เสียงได้ — Live Sessions เป็นเพียงเอนด์พอยต์ของ Open​AI เท่านั้น — แต่ทุกสิ่งที่เลเยอร์เสียงส่งต่อไปนั้นอยู่บนคีย์เดียว ซึ่งหมายความว่าส่วนของบิลที่ขยายตามความหนักหน่วงที่ผู้โทรของคุณใช้คิด ก็เป็นส่วนที่คุณเปลี่ยนได้โดยไม่ต้องมีสัญญา

ในทางตรงกันข้าม Muse Realtime Avatar ไม่มีมิเตอร์ให้จัดเส้นทาง มันเป็นฟีเจอร์หนึ่งของแอป

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

สองเดิมพันว่าจุดประสงค์ของ voice agent คืออะไร

ถ้าตัดสเปกออก สองบริษัทนี้ก็เห็นไม่ตรงกันว่าอะไรคือตัวผลิตภัณฑ์ เดิมพันของ Open​AI คือบทสนทนาคือตัวผลิตภัณฑ์ — ว่าวอยซ์เอเจนต์ก็คือสายโทรศัพท์สายหนึ่ง และงานที่ต้องทำคือทำให้มันรู้สึกอย่างนั้น: ไม่ปล่อยให้เงียบค้าง มอบการคิดหนัก ๆ ให้โมเดลที่อยู่เบื้องหลัง คิดค่าบริการเป็นนาที สเกลตามจำนวนสายที่เรียกพร้อมกัน ทุกทางเลือกบนพื้นผิว API ของ GPT-Live-1 ล้วนตามมาจากแนวคิดนี้ ลิมิตเรตแบบอิงคอนเคอร์เรนซี ขนส่งผ่าน WebRTC เท่านั้น ปลายทางเดียวที่จงใจจำกัดให้แคบ ไม่มีวิดีโอทั้งขาเข้าและขาออก

การเดิมพันของ Meta คือการมีตัวตนคือตัวผลิตภัณฑ์ — ผู้ใช้ที่มองเห็นเอเจนต์ได้คือผู้ใช้ที่ยังคงอยู่ในบทสนทนา และงานวิศวกรรมที่น่าสนใจนั้นไม่ใช่การผลัดกันพูด แต่คือการทำให้ตัวละครที่เรนเดอร์ออกมามีความสอดคล้อง连贯ตลอดความยาวของการสนทนา ทางเลือกเหล่านั้นก่อให้เกิดระบบที่ปรับให้เหมาะกับอัตราเฟรมและความหนาแน่นของเซสชันบน GPU โดยไม่มีพื้นผิวเชิงพาณิชย์ใด ๆ เลย

มีความเป็นไปได้จริงที่ทั้งสองจะถูกต้อง และทั้งสองจะถูกนำมาประกอบเข้าด้วยกัน ผลิตภัณฑ์หนึ่งอาจรันบทสนทนาของตนบนโมเดลเสียงแบบฟูลดูเพล็กซ์ และรันชั้นภาพบนตัวเรนเดอร์อวตาร์ และสิ่งเดียวที่ขัดขวางไม่ให้เกิดสิ่งนั้นในวันนี้คือ ตัวเรนเดอร์อวตาร์ยังไม่มีเอนด์พอยต์ สิ่งที่ไม่สมเหตุสมผลคือการมองว่าทั้งสองเป็นสองเวอร์ชันของการซื้อเดียวกัน

ใครควรลงมือ และใครควรรอ

ถ้าคุณกำลังสร้างผลิตภัณฑ์เสียงตอนนี้ GPT-Live-1 เรียกใช้งานได้ แต่ Muse Realtime Avatar ยังเรียกใช้ไม่ได้ และนั่นก็จบการตัดสินใจ ทางเลือกที่น่าสนใจภายใน GPT-Live-1 คือแบ็กเอนด์ที่คุณมอบหมายงานให้ เพราะนั่นคือจุดที่ทั้งคะแนนและบิลขยับจริง ๆ — และมันเป็นส่วนเดียวของสแตกที่คุณสามารถจัดเส้นทาง สลับ และสลับไปใช้ระบบสำรองได้โดยไม่ต้องแตะการผสานรวมเสียง

ถ้าสิ่งที่คุณต้องการคืออวตาร การรอไม่ใช่การอยู่เฉย สิ่งที่ควรจับตาดูนั้นเจาะจงชัดเจน: ว่า Meta จะเผยแพร่ตารางราคาและเอนด์พอยต์หรือไม่ ว่าจะมีวันที่ระบุไว้ปรากฏขึ้นหรือไม่ และว่า 870 ms จะยังรอดเมื่อต้องเจอกับโทรศัพท์ที่เชื่อมต่อผ่านเครือข่ายเซลลูลาร์ แทนที่จะเป็นเดโมในงาน Connect หรือไม่ โพสต์ของ Meta เองระบุว่าเดโมของตนไม่ได้สะท้อนอวตารทั้งหมดที่มีในแอป Muse ซึ่งเป็นประโยคที่ควรยึดไว้

จนกว่าหนึ่งในสิ่งเหล่านั้นจะเปลี่ยนไป การเปรียบเทียบนี้มีคำตอบสั้นเพียงบรรทัดเดียว GPT-Live-1 คือสายโทรศัพท์ที่มีสมองซึ่งคุณเลือกเอง ส่วน Muse Realtime Avatar คือใบหน้าที่ไม่มีหมายเลขโทรศัพท์

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube