การ์ด hero ที่สร้างขึ้นสำหรับ 'Muse Realtime Avatar: Meta มอบใบหน้าให้ Muse Agent ของตน ใน 870 มิลลิวินาทีต่อเทิร์น' โดยแสดงข้อความกำกับเหนือพาดหัวว่า 'Meta Superintelligence Labs — 23 กันยายน 2026' พร้อมพาดหัวข่าวและข้อเท็จจริงสามประการจากโพสต์งานวิจัยของ Meta ได้แก่ วิดีโอแนวตั้งขนาด 448×768 ที่ 25 fps ใช้เวลาราว 870 ms จากจุดสิ้นสุดของเทิร์นถึงไบต์แรก และรองรับเซสชันเรียลไทม์พร้อมกัน 12 เซสชันบน NVIDIA GB200 หนึ่งตัว มีคำบรรยายย่อยว่า 'มันไม่ใช่หัวที่พูดได้ หากแต่เป็นชั้นการเรนเดอร์ที่วางทับอยู่บนโมเดลเสียง' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

Muse Realtime Avatar: Meta มอบใบหน้าให้ Muse Agent ของตน ด้วยเวลา 870 มิลลิวินาทีต่อเทิร์น

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ตัวเลขที่ Meta เลือกนำเสนอเป็นอันดับแรกคือ 870 มิลลิวินาที นั่นคือระยะเวลาที่ Muse Realtime Avatarใช้เวลา ตามการวัดของ Meta เอง ตั้งแต่ช่วงเวลาที่คุณหยุดพูดจนถึงช่วงเวลาที่ไบต์แรกของการตอบกลับด้วยเสียงและวิดีโอที่ซิงโครไนซ์กันมาถึง ถือเป็นตัวเลขที่ดุดันอย่างแท้จริงสำหรับระบบที่ต้องสร้างวิดีโอ และควรค่าแก่การอ่านอย่างแม่นยำ — เพราะเกือบทุกสิ่งที่น่าสนใจเกี่ยวกับโมเดลการมีตัวตนรูปแบบใหม่ของ Meta อยู่ในช่องว่างระหว่างสิ่งที่ตัวเลขนั้นวัด กับสิ่งที่ผู้คนจะสันนิษฐานว่ามันวัด

Muse Realtime Avatar เปิดตัวเมื่อวันที่ 23 กันยายน 2026 ที่ Meta Connect และมีบทความเขียนถึงในวันเดียวกันโดย Meta Superintelligence Labs ในโพสต์วิจัยชื่อ "Bringing Your Muse to Life" โดยมันต่อยอด Muse Realtime Voice ซึ่งเป็นชั้นการสนทนาภายในเอเจนต์ Muse ของ Meta ด้วยการมอบร่างกายให้มัน ไม่ใช่แชตบอตที่มีอวาตาร์สำเร็จรูป: คุณส่งภาพอ้างอิงให้มัน — ภาพถ่าย ภาพประกอบเต็มตัว สัตว์ สิ่งของในบ้าน — แล้วมันจะเรนเดอร์สิ่งนั้นกำลังพูด ทำท่าทาง และเปลี่ยนอิริยาบถในวิดีโอต่อเนื่องตลอดระยะเวลาของการสนทนา Zuckerberg กล่าวบนเวทีว่าอวาตาร์ที่ผูกกับ Muse ของเขาชื่อ Jolly

สตรีมโทเคนที่ใช้ร่วมกัน ไม่ใช่การทำลิปซิงก์

สถาปัตยกรรมคือส่วนที่ควรค่าแก่การทำความเข้าใจ เพราะมันอธิบายว่าทำไม Meta ยังคงใช้คำว่า “embodiment” แทนคำว่า “avatar” Muse Realtime Voice สร้างสตรีมของโทเคนเสียงพูด — โพสต์เรียกสิ่งเหล่านั้นว่า VQs — ซึ่งนำพาทั้งเนื้อหาของสิ่งที่กำลังพูดและจังหวะทำนองเสียงของมัน ได้แก่ จังหวะการพูด การเน้น และการขึ้นลงของเสียง Muse Realtime Avatar รับสตรีมเดียวกันนั้น มันเป็น Diffusion Transformer ที่ขับเคลื่อนด้วยเสียง ซึ่งมีเงื่อนไขจากโทเคนเสียงเหล่านั้น จากสื่ออ้างอิงที่คุณจัดหาให้ และจากหน้าต่างแบบเลื่อนของ latent วิดีโอช่วงล่าสุด และมันสร้างวิดีโอเป็นชังก์เชิงสาเหตุสั้น ๆ โดยป้อน latent ใหม่แต่ละตัวไปข้างหน้าเป็นบริบทการเคลื่อนไหวสำหรับตัวถัดไป

การแชร์สตรีมโทเคนเพียงสตรีมเดียวคือสิ่งที่ทำให้เสียง การเคลื่อนไหวริมฝีปาก และสีหน้ายังคงถูกล็อกไว้ด้วยกัน ทางเลือกอื่น — สร้างเสียงขึ้นมาก่อน แล้วรันโมเดลซิงก์ริมฝีปากแยกต่างหากกับเสียงนั้น — คือวิธีที่อุตสาหกรรมอวตารส่วนใหญ่ทำ และเป็นเหตุผลว่าทำไมอวตารเหล่านั้นจำนวนมากจึงดูเหมือนถูกพากย์เสียงทับ การออกแบบของ Meta ขจัดรอยต่อนั้นโดยโครงสร้าง หน้าต่างเลเทนต์แบบเลื่อนคือครึ่งหลังของแนวคิดนี้: หากไม่มีมัน เครื่องสร้างแบบแบ่งเป็นชังก์จะค่อย ๆ คลาดเคลื่อน และพอถึงนาทีที่สาม ตัวละครของคุณก็จะกลายเป็นคนอื่นไปอย่างเงียบ ๆ

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

ตัวเลขที่เผยแพร่ไว้สี่ตัว และแต่ละตัววัดอะไรจริง ๆ

Meta เผยแพร่ตัวเลขมากกว่าที่ปกติสำหรับโพสต์งานวิจัยที่แนบมากับฟีเจอร์สำหรับผู้บริโภค ทั้งสี่รายการด้านล่างเป็นข้อมูลที่บริษัทรายงานเอง วัดโดย Meta เทียบกับฐานอ้างอิงที่ Meta เลือกเอง ไม่มีรายการใดถูกทำซ้ำจากภายนอกบริษัท

870 ms จากจุดสิ้นสุดของรอบถึงไบต์แรก นี่เป็นตัวเลขของการเริ่มต้นตอบกลับ ไม่ใช่เวลาจนได้คำตอบที่สมบูรณ์ และไม่ใช่ความหน่วงในการส่งอย่างต่อเนื่องตลอดช่วงที่เหลือของการสนทนา ระบบหนึ่งอาจทำได้ 870 ms ถึงไบต์แรกแต่ยังรู้สึกอืดช้าตอนวินาทีที่สิบสอง โพสต์ของ Meta ระบุชัดเจนว่านี่คือการวัดไบต์แรก การรายงานที่ละเว้นคำขยายความนี้กำลังตีความว่าเป็นความตอบสนองแบบต้นทางถึงปลายทาง ซึ่งไม่ใช่

วิดีโอแนวตั้ง 448×768 ที่ 25 เฟรมต่อวินาที นั่นคือเฟรมทรงสูงแบบโทรศัพท์ ไม่ใช่แนวนอน และ 25 fps ให้ความรู้สึกเหมือนภาพยนตร์มากกว่าความลื่นไหล — อัตราเฟรมมาตรฐานสำหรับภาพยนตร์ ซึ่งต่ำกว่า 30 หรือ 60 fps ที่ฟีดกล้องปกติจะให้คุณ Meta กล่าวว่าตัวอย่างสาธิตมีลายน้ำด้วยโอเวอร์เลย์โปร่งใส เพื่อให้ผู้รับรู้ได้ว่าพวกเขากำลังไม่ได้ดูฟีดกล้องปกติ

ประเมินโมเดลน้อยลง 60 เท่าอธิบายไว้อย่างเหมาะสมด้านล่างนี้ เพราะตัวเลขนี้น่าจะถูกตีความผิดมากที่สุด

12 เซสชันเรียลไทม์พร้อมกันบน NVIDIA GB200 เครื่องเดียว Meta รายงานว่างานด้านการให้บริการของบริษัท — แคช KV แบบคงอยู่, การกำหนดเส้นทางที่คำนึงถึงแคช, การจัดแบตช์แบบไดนามิกที่คำนึงถึงเวลาหน่วง, การฝึกที่คำนึงถึงการควอนไทซ์แบบสี่บิต, เคอร์เนลแบบฟิวส์ และการบันทึก CUDA Graph ซึ่งพัฒนาร่วมกับ NVIDIA — เพิ่มความจุได้ 8 เท่าเมื่อเทียบกับเบสไลน์ BF16 แบบสองขั้นตอนของบริษัทเอง คณิตศาสตร์เบื้องหลังเรื่องนี้ชัดเจน: แต่ละขั้นตอนการสร้างให้ผลลัพธ์แปดเฟรม ซึ่งคิดเป็นการเล่น 320 มิลลิวินาที ภายในเวลาโมเดล 20 มิลลิวินาที หรือ 2.5 มิลลิวินาทีต่อเฟรม ทั้งตัวเลข 12 และ 8 เท่านี้ต่างก็เทียบกับเบสไลน์ที่ Meta ระบุไว้ ไม่ได้เทียบกับฮาร์ดแวร์ของผู้ผลิตรายอื่น

ทำไม 60× จึงไม่เร็วขึ้น 60×

ข้อกล่าวอ้างเรื่องการบีบอัดเป็นสิ่งที่ถูกพูดซ้ำมากที่สุดและเข้าใจน้อยที่สุด โมเดลครูของ Meta เป็นโมเดลการแพร่ 40 ขั้นตอนที่มีการชี้นำแบบไม่มีตัวจำแนกสามทาง — สามรอบต่อขั้นตอน ดังนั้นจึงต้องประเมินโมเดล 120 ครั้งเพื่อสร้างวิดีโอหนึ่งช่วง โมเดลนักเรียนเป็นโมเดลเชิงเหตุสองขั้นตอนที่ไม่มีการชี้นำ มี KV cache ความยาวคงที่ ฝึกโดยการกลั่นและการบังคับตัวเอง และต้องใช้การประเมินสองครั้งสำหรับช่วงเดียวกัน นั่นคือการลดลง 60 เท่าในการประเมินต่อช่วง ที่คุณภาพใกล้เคียงครู ตามคำกล่าวของ Meta

มันคือการลดปริมาณการคำนวณต่อ chunk การประเมินที่น้อยลงหกสิบเท่าไม่ได้หมายความว่าผู้ใช้จะรอสั้นลงหนึ่งในหกสิบ เพราะความหน่วงมีปัจจัยอื่นที่ส่งผลอยู่ก่อนการกลั่น และยังคงมีปัจจัยเหล่านั้นอยู่หลังจากนั้น แผนภูมิในโพสต์ของ Meta เองแสดงให้เห็นว่าการลดนั้นได้อะไรมาในแง่คุณภาพ: ความชื่นชอบของมนุษย์เพิ่มขึ้นจาก 45% เป็น 55% นั่นคือเรื่องเล่าฉบับที่ซื่อสัตย์ — จุดประสงค์ของการกลั่นคือการทำให้ระบบสามารถทำงานแบบเรียลไทม์ได้จริง ๆ และต้นทุนด้านคุณภาพถูกจำกัดไว้ที่ประมาณสิบจุดของความชื่นชอบ แทนที่จะถูกกำจัดให้หมดไป

การประเมิน รวมถึงผลลัพธ์ที่ออกมาในทางตรงกันข้าม

Meta ทดสอบเทียบกับระบบอวตารเชิงพาณิชย์สองระบบ ได้แก่ Runway Characters และ HeyGen LiveAvatar โดยใช้อัตลักษณ์อวตารที่จับคู่กัน เพื่อให้ผู้ประเมินเปรียบเทียบแอนิเมชันแทนที่จะเปรียบเทียบการออกแบบตัวละคร ผู้ประเมินได้สนทนาแบบสดเป็นเวลา 2–3 นาทีกับแต่ละระบบ จากนั้นจึงเปรียบเทียบคุณภาพของภาพ ความสอดประสาน ความคงเส้นคงวาของตัวละคร และเอกลักษณ์ท่าทาง

Meta รายงานว่าได้รับความนิยมเหนือกว่า Runway Characters ที่ 78% ต่อ 22% และเหนือกว่า HeyGen LiveAvatar ที่ 88% ต่อ 12% รวมถึงได้รับความนิยมในทุกมิติที่ประเมิน จากนั้นโพสต์นี้ก็ทำในสิ่งที่การประเมินจากผู้ขายส่วนใหญ่ไม่ได้ทำ นั่นคือเปิดเผยว่าการเปรียบเทียบลักษณะท่าทางเฉพาะตัวกับ Runway Characters นั้นไม่มีความแตกต่างทางสถิติจากภาวะเสมอกัน การเสมอกันหนึ่งรายการภายในชัยชนะแบบกวาดเรียบเป็นเรื่องเล็กน้อย แต่เป็นรายละเอียดที่บอกคุณว่าการกวาดชัยครั้งนั้นถูกรายงานอย่างซื่อสัตย์ ไม่ใช่การเลือกหยิบเฉพาะผลที่เข้าข้างตัวเอง

ข้อจำกัดของการทดสอบสำคัญกว่าการที่ผลออกมาเสมอกันเสียอีก สองถึงสามนาทีเป็นบทสนทนาที่สั้น ผู้ให้คะแนนมาจาก Meta และโพสต์เองก็เตือนว่า การสาธิตของโพสต์ "แสดงถึงความสามารถของโมเดล และไม่ได้สะท้อนอวตารทั้งหมดที่มีในแอป Muse" — ซึ่งเป็นทีมวิจัยที่พูดตรงๆ ว่า วิดีโอที่คุณดูไม่จำเป็นต้องเป็นผลิตภัณฑ์ที่คุณจะได้รับ

สิ่งที่คุณไม่สามารถทำได้กับมัน

ยังไม่มี API สำหรับ Muse Realtime Avatar ไม่มีราคา ไม่มีตารางอัตราค่าบริการ ไม่มีรายชื่อรอ และไม่มีวันที่เปิดเผย Meta ไม่ได้ระบุว่าผู้ใช้หรือนักพัฒนาจะสามารถใช้งานได้เมื่อใด แอป Muse สำหรับผู้มีอายุ 18 ปีขึ้นไปเป็นช่องทางเดียวที่มันมุ่งไป และอวตารนี้กำลังจะมาพร้อมกับฟีเจอร์อื่น ๆ ของ Muse — การปรับแต่งเสียง ที่อยู่อีเมล Muse การควบคุมคอมพิวเตอร์ Mac การผสานรวมกับแว่นตา — ซึ่งมีไทม์ไลน์ของตัวเอง บางส่วนระบุว่า “จะมาในอีกไม่กี่เดือนข้างหน้า”

การเปรียบเทียบที่สำคัญตรงนี้ไม่ใช่การเทียบกับ Runway หรือ HeyGen แต่เป็นการเทียบกับส่วนอื่น ๆ ของสแต็ก Muse ต่างหาก Muse Spark โมเดลการให้เหตุผลที่เอเจนต์นี้ทำงานอยู่บนนั้น มีให้บริการนักพัฒนาตั้งแต่ Meta เปิดให้เข้าถึงผ่าน Meta Model API และ Muse Spark 1.2 ให้บริการผ่าน OrcaRouter ในชื่อ meta/muse-spark-1.2 ในราคา 1.25 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 4.25 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน ซึ่งเป็นราคาตามประกาศของผู้ให้บริการโดยไม่บวกเพิ่มภายในหน้าต่างบริบทขนาดหนึ่งล้านโทเคนที่รองรับข้อความ รูปภาพ วิดีโอ เสียง และไฟล์อยู่แล้ว นั่นคือส่วนของ Muse ที่คุณเรียกใช้ได้ตั้งแต่วันนี้ ส่วน face คือส่วนที่คุณยังเรียกใช้ไม่ได้

ความไม่สมดุลนี้ควรค่าแก่การนั่งคิดทบทวน หากคุณกำลังวางแผนอะไรบางอย่าง เอเจนต์ที่ใช้เหตุผลระหว่างการประชุมวิดีโอกับเอเจนต์ที่ปรากฏตัวในสายนั้นเป็นผลิตภัณฑ์ที่แตกต่างกันและมีข้อจำกัดต่างกัน และมีเพียงตัวเดียวเท่านั้นที่อยู่ในเรตการ์ด

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

สิ่งที่ควรดูต่อไป

สามสิ่งจะเปลี่ยนเรื่องนี้จากการประกาศให้กลายเป็นการตัดสินใจ สิ่งแรกคือวันวางจำหน่ายของอวตารภายใน Muse เพราะทุกสิ่งที่ Meta เผยแพร่ล้วนเกี่ยวกับโมเดล และไม่มีสิ่งที่เผยแพร่เลยที่เกี่ยวกับผลิตภัณฑ์ที่คุณใช้ได้ในวันพฤหัสบดี สิ่งที่สองคือการวัดค่า latency จากการสนทนายาว ๆ แทนที่จะวัดที่ไบต์แรก — 870 มิลลิวินาทีเป็นเพียงเสียงปืนสตาร์ท และคำถามที่การโทรจริงถามคือเกิดอะไรขึ้นที่ นาทีที่สิบ สิ่งที่สามคือระบบรักษาบุคลิกได้หรือไม่ภายใต้สภาวะที่เป็นปฏิปักษ์ ผู้ใช้ที่จงใจเปลี่ยนเรื่อง พูดเร็ว หรือป้อนภาพอ้างอิงที่ออกแบบมาให้ดูเหมือนคนจริง

จนถึงตอนนั้น สรุปที่ซื่อสัตย์ก็คือสิ่งที่โพสต์งานวิจัยสื่อเป็นนัยโดยไม่ได้พูดออกมาตรง ๆ Muse Realtime Avatar เป็นงานวิศวกรรมของจริงที่มีผลลัพธ์การบีบอัดของจริงรองรับอยู่เบื้องหลัง สาธิตในสภาพแวดล้อมที่มีการควบคุม ประเมินโดยบริษัทที่สร้างมันขึ้นมา ในการสนทนาที่ใช้เวลาพอ ๆ กับการสั่งกาแฟหนึ่งครั้ง มันไม่ใช่ผลิตภัณฑ์ลม ๆ แล้ง ๆ และมันก็ไม่ใช่สิ่งที่คุณจะซื้อ จัดเส้นทาง หรือวัดประสิทธิภาพได้เช่นกัน — และนั่นเป็นข้อกล่าวอ้างที่แตกต่างกัน

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube