
Muse Realtime Avatar: Meta มอบใบหน้าให้ Muse Agent ของตน ด้วยเวลา 870 มิลลิวินาทีต่อเทิร์น
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 180 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ตัวเลขที่ Meta เลือกนำเสนอเป็นอันดับแรกคือ 870 มิลลิวินาที นั่นคือระยะเวลาที่ Muse Realtime Avatarใช้เวลา ตามการวัดของ Meta เอง ตั้งแต่ช่วงเวลาที่คุณหยุดพูดจนถึงช่วงเวลาที่ไบต์แรกของการตอบกลับด้วยเสียงและวิดีโอที่ซิงโครไนซ์กันมาถึง ถือเป็นตัวเลขที่ดุดันอย่างแท้จริงสำหรับระบบที่ต้องสร้างวิดีโอ และควรค่าแก่การอ่านอย่างแม่นยำ — เพราะเกือบทุกสิ่งที่น่าสนใจเกี่ยวกับโมเดลการมีตัวตนรูปแบบใหม่ของ Meta อยู่ในช่องว่างระหว่างสิ่งที่ตัวเลขนั้นวัด กับสิ่งที่ผู้คนจะสันนิษฐานว่ามันวัด
Muse Realtime Avatar เปิดตัวเมื่อวันที่ 23 กันยายน 2026 ที่ Meta Connect และมีบทความเขียนถึงในวันเดียวกันโดย Meta Superintelligence Labs ในโพสต์วิจัยชื่อ "Bringing Your Muse to Life" โดยมันต่อยอด Muse Realtime Voice ซึ่งเป็นชั้นการสนทนาภายในเอเจนต์ Muse ของ Meta ด้วยการมอบร่างกายให้มัน ไม่ใช่แชตบอตที่มีอวาตาร์สำเร็จรูป: คุณส่งภาพอ้างอิงให้มัน — ภาพถ่าย ภาพประกอบเต็มตัว สัตว์ สิ่งของในบ้าน — แล้วมันจะเรนเดอร์สิ่งนั้นกำลังพูด ทำท่าทาง และเปลี่ยนอิริยาบถในวิดีโอต่อเนื่องตลอดระยะเวลาของการสนทนา Zuckerberg กล่าวบนเวทีว่าอวาตาร์ที่ผูกกับ Muse ของเขาชื่อ Jolly
สตรีมโทเคนที่ใช้ร่วมกัน ไม่ใช่การทำลิปซิงก์
สถาปัตยกรรมคือส่วนที่ควรค่าแก่การทำความเข้าใจ เพราะมันอธิบายว่าทำไม Meta ยังคงใช้คำว่า “embodiment” แทนคำว่า “avatar” Muse Realtime Voice สร้างสตรีมของโทเคนเสียงพูด — โพสต์เรียกสิ่งเหล่านั้นว่า VQs — ซึ่งนำพาทั้งเนื้อหาของสิ่งที่กำลังพูดและจังหวะทำนองเสียงของมัน ได้แก่ จังหวะการพูด การเน้น และการขึ้นลงของเสียง Muse Realtime Avatar รับสตรีมเดียวกันนั้น มันเป็น Diffusion Transformer ที่ขับเคลื่อนด้วยเสียง ซึ่งมีเงื่อนไขจากโทเคนเสียงเหล่านั้น จากสื่ออ้างอิงที่คุณจัดหาให้ และจากหน้าต่างแบบเลื่อนของ latent วิดีโอช่วงล่าสุด และมันสร้างวิดีโอเป็นชังก์เชิงสาเหตุสั้น ๆ โดยป้อน latent ใหม่แต่ละตัวไปข้างหน้าเป็นบริบทการเคลื่อนไหวสำหรับตัวถัดไป
การแชร์สตรีมโทเคนเพียงสตรีมเดียวคือสิ่งที่ทำให้เสียง การเคลื่อนไหวริมฝีปาก และสีหน้ายังคงถูกล็อกไว้ด้วยกัน ทางเลือกอื่น — สร้างเสียงขึ้นมาก่อน แล้วรันโมเดลซิงก์ริมฝีปากแยกต่างหากกับเสียงนั้น — คือวิธีที่อุตสาหกรรมอวตารส่วนใหญ่ทำ และเป็นเหตุผลว่าทำไมอวตารเหล่านั้นจำนวนมากจึงดูเหมือนถูกพากย์เสียงทับ การออกแบบของ Meta ขจัดรอยต่อนั้นโดยโครงสร้าง หน้าต่างเลเทนต์แบบเลื่อนคือครึ่งหลังของแนวคิดนี้: หากไม่มีมัน เครื่องสร้างแบบแบ่งเป็นชังก์จะค่อย ๆ คลาดเคลื่อน และพอถึงนาทีที่สาม ตัวละครของคุณก็จะกลายเป็นคนอื่นไปอย่างเงียบ ๆ

ตัวเลขที่เผยแพร่ไว้สี่ตัว และแต่ละตัววัดอะไรจริง ๆ
Meta เผยแพร่ตัวเลขมากกว่าที่ปกติสำหรับโพสต์งานวิจัยที่แนบมากับฟีเจอร์สำหรับผู้บริโภค ทั้งสี่รายการด้านล่างเป็นข้อมูลที่บริษัทรายงานเอง วัดโดย Meta เทียบกับฐานอ้างอิงที่ Meta เลือกเอง ไม่มีรายการใดถูกทำซ้ำจากภายนอกบริษัท
• 870 ms จากจุดสิ้นสุดของรอบถึงไบต์แรก นี่เป็นตัวเลขของการเริ่มต้นตอบกลับ ไม่ใช่เวลาจนได้คำตอบที่สมบูรณ์ และไม่ใช่ความหน่วงในการส่งอย่างต่อเนื่องตลอดช่วงที่เหลือของการสนทนา ระบบหนึ่งอาจทำได้ 870 ms ถึงไบต์แรกแต่ยังรู้สึกอืดช้าตอนวินาทีที่สิบสอง โพสต์ของ Meta ระบุชัดเจนว่านี่คือการวัดไบต์แรก การรายงานที่ละเว้นคำขยายความนี้กำลังตีความว่าเป็นความตอบสนองแบบต้นทางถึงปลายทาง ซึ่งไม่ใช่
• วิดีโอแนวตั้ง 448×768 ที่ 25 เฟรมต่อวินาที นั่นคือเฟรมทรงสูงแบบโทรศัพท์ ไม่ใช่แนวนอน และ 25 fps ให้ความรู้สึกเหมือนภาพยนตร์มากกว่าความลื่นไหล — อัตราเฟรมมาตรฐานสำหรับภาพยนตร์ ซึ่งต่ำกว่า 30 หรือ 60 fps ที่ฟีดกล้องปกติจะให้คุณ Meta กล่าวว่าตัวอย่างสาธิตมีลายน้ำด้วยโอเวอร์เลย์โปร่งใส เพื่อให้ผู้รับรู้ได้ว่าพวกเขากำลังไม่ได้ดูฟีดกล้องปกติ
• ประเมินโมเดลน้อยลง 60 เท่าอธิบายไว้อย่างเหมาะสมด้านล่างนี้ เพราะตัวเลขนี้น่าจะถูกตีความผิดมากที่สุด
• 12 เซสชันเรียลไทม์พร้อมกันบน NVIDIA GB200 เครื่องเดียว Meta รายงานว่างานด้านการให้บริการของบริษัท — แคช KV แบบคงอยู่, การกำหนดเส้นทางที่คำนึงถึงแคช, การจัดแบตช์แบบไดนามิกที่คำนึงถึงเวลาหน่วง, การฝึกที่คำนึงถึงการควอนไทซ์แบบสี่บิต, เคอร์เนลแบบฟิวส์ และการบันทึก CUDA Graph ซึ่งพัฒนาร่วมกับ NVIDIA — เพิ่มความจุได้ 8 เท่าเมื่อเทียบกับเบสไลน์ BF16 แบบสองขั้นตอนของบริษัทเอง คณิตศาสตร์เบื้องหลังเรื่องนี้ชัดเจน: แต่ละขั้นตอนการสร้างให้ผลลัพธ์แปดเฟรม ซึ่งคิดเป็นการเล่น 320 มิลลิวินาที ภายในเวลาโมเดล 20 มิลลิวินาที หรือ 2.5 มิลลิวินาทีต่อเฟรม ทั้งตัวเลข 12 และ 8 เท่านี้ต่างก็เทียบกับเบสไลน์ที่ Meta ระบุไว้ ไม่ได้เทียบกับฮาร์ดแวร์ของผู้ผลิตรายอื่น
ทำไม 60× จึงไม่เร็วขึ้น 60×
ข้อกล่าวอ้างเรื่องการบีบอัดเป็นสิ่งที่ถูกพูดซ้ำมากที่สุดและเข้าใจน้อยที่สุด โมเดลครูของ Meta เป็นโมเดลการแพร่ 40 ขั้นตอนที่มีการชี้นำแบบไม่มีตัวจำแนกสามทาง — สามรอบต่อขั้นตอน ดังนั้นจึงต้องประเมินโมเดล 120 ครั้งเพื่อสร้างวิดีโอหนึ่งช่วง โมเดลนักเรียนเป็นโมเดลเชิงเหตุสองขั้นตอนที่ไม่มีการชี้นำ มี KV cache ความยาวคงที่ ฝึกโดยการกลั่นและการบังคับตัวเอง และต้องใช้การประเมินสองครั้งสำหรับช่วงเดียวกัน นั่นคือการลดลง 60 เท่าในการประเมินต่อช่วง ที่คุณภาพใกล้เคียงครู ตามคำกล่าวของ Meta
มันคือการลดปริมาณการคำนวณต่อ chunk การประเมินที่น้อยลงหกสิบเท่าไม่ได้หมายความว่าผู้ใช้จะรอสั้นลงหนึ่งในหกสิบ เพราะความหน่วงมีปัจจัยอื่นที่ส่งผลอยู่ก่อนการกลั่น และยังคงมีปัจจัยเหล่านั้นอยู่หลังจากนั้น แผนภูมิในโพสต์ของ Meta เองแสดงให้เห็นว่าการลดนั้นได้อะไรมาในแง่คุณภาพ: ความชื่นชอบของมนุษย์เพิ่มขึ้นจาก 45% เป็น 55% นั่นคือเรื่องเล่าฉบับที่ซื่อสัตย์ — จุดประสงค์ของการกลั่นคือการทำให้ระบบสามารถทำงานแบบเรียลไทม์ได้จริง ๆ และต้นทุนด้านคุณภาพถูกจำกัดไว้ที่ประมาณสิบจุดของความชื่นชอบ แทนที่จะถูกกำจัดให้หมดไป
การประเมิน รวมถึงผลลัพธ์ที่ออกมาในทางตรงกันข้าม
Meta ทดสอบเทียบกับระบบอวตารเชิงพาณิชย์สองระบบ ได้แก่ Runway Characters และ HeyGen LiveAvatar โดยใช้อัตลักษณ์อวตารที่จับคู่กัน เพื่อให้ผู้ประเมินเปรียบเทียบแอนิเมชันแทนที่จะเปรียบเทียบการออกแบบตัวละคร ผู้ประเมินได้สนทนาแบบสดเป็นเวลา 2–3 นาทีกับแต่ละระบบ จากนั้นจึงเปรียบเทียบคุณภาพของภาพ ความสอดประสาน ความคงเส้นคงวาของตัวละคร และเอกลักษณ์ท่าทาง
Meta รายงานว่าได้รับความนิยมเหนือกว่า Runway Characters ที่ 78% ต่อ 22% และเหนือกว่า HeyGen LiveAvatar ที่ 88% ต่อ 12% รวมถึงได้รับความนิยมในทุกมิติที่ประเมิน จากนั้นโพสต์นี้ก็ทำในสิ่งที่การประเมินจากผู้ขายส่วนใหญ่ไม่ได้ทำ นั่นคือเปิดเผยว่าการเปรียบเทียบลักษณะท่าทางเฉพาะตัวกับ Runway Characters นั้นไม่มีความแตกต่างทางสถิติจากภาวะเสมอกัน การเสมอกันหนึ่งรายการภายในชัยชนะแบบกวาดเรียบเป็นเรื่องเล็กน้อย แต่เป็นรายละเอียดที่บอกคุณว่าการกวาดชัยครั้งนั้นถูกรายงานอย่างซื่อสัตย์ ไม่ใช่การเลือกหยิบเฉพาะผลที่เข้าข้างตัวเอง
ข้อจำกัดของการทดสอบสำคัญกว่าการที่ผลออกมาเสมอกันเสียอีก สองถึงสามนาทีเป็นบทสนทนาที่สั้น ผู้ให้คะแนนมาจาก Meta และโพสต์เองก็เตือนว่า การสาธิตของโพสต์ "แสดงถึงความสามารถของโมเดล และไม่ได้สะท้อนอวตารทั้งหมดที่มีในแอป Muse" — ซึ่งเป็นทีมวิจัยที่พูดตรงๆ ว่า วิดีโอที่คุณดูไม่จำเป็นต้องเป็นผลิตภัณฑ์ที่คุณจะได้รับ
สิ่งที่คุณไม่สามารถทำได้กับมัน
ยังไม่มี API สำหรับ Muse Realtime Avatar ไม่มีราคา ไม่มีตารางอัตราค่าบริการ ไม่มีรายชื่อรอ และไม่มีวันที่เปิดเผย Meta ไม่ได้ระบุว่าผู้ใช้หรือนักพัฒนาจะสามารถใช้งานได้เมื่อใด แอป Muse สำหรับผู้มีอายุ 18 ปีขึ้นไปเป็นช่องทางเดียวที่มันมุ่งไป และอวตารนี้กำลังจะมาพร้อมกับฟีเจอร์อื่น ๆ ของ Muse — การปรับแต่งเสียง ที่อยู่อีเมล Muse การควบคุมคอมพิวเตอร์ Mac การผสานรวมกับแว่นตา — ซึ่งมีไทม์ไลน์ของตัวเอง บางส่วนระบุว่า “จะมาในอีกไม่กี่เดือนข้างหน้า”
การเปรียบเทียบที่สำคัญตรงนี้ไม่ใช่การเทียบกับ Runway หรือ HeyGen แต่เป็นการเทียบกับส่วนอื่น ๆ ของสแต็ก Muse ต่างหาก Muse Spark โมเดลการให้เหตุผลที่เอเจนต์นี้ทำงานอยู่บนนั้น มีให้บริการนักพัฒนาตั้งแต่ Meta เปิดให้เข้าถึงผ่าน Meta Model API และ Muse Spark 1.2 ให้บริการผ่าน OrcaRouter ในชื่อ meta/muse-spark-1.2 ในราคา 1.25 ดอลลาร์ต่ออินพุตหนึ่งล้านโทเคน และ 4.25 ดอลลาร์ต่อเอาต์พุตหนึ่งล้านโทเคน ซึ่งเป็นราคาตามประกาศของผู้ให้บริการโดยไม่บวกเพิ่มภายในหน้าต่างบริบทขนาดหนึ่งล้านโทเคนที่รองรับข้อความ รูปภาพ วิดีโอ เสียง และไฟล์อยู่แล้ว นั่นคือส่วนของ Muse ที่คุณเรียกใช้ได้ตั้งแต่วันนี้ ส่วน face คือส่วนที่คุณยังเรียกใช้ไม่ได้
ความไม่สมดุลนี้ควรค่าแก่การนั่งคิดทบทวน หากคุณกำลังวางแผนอะไรบางอย่าง เอเจนต์ที่ใช้เหตุผลระหว่างการประชุมวิดีโอกับเอเจนต์ที่ปรากฏตัวในสายนั้นเป็นผลิตภัณฑ์ที่แตกต่างกันและมีข้อจำกัดต่างกัน และมีเพียงตัวเดียวเท่านั้นที่อยู่ในเรตการ์ด

สิ่งที่ควรดูต่อไป
สามสิ่งจะเปลี่ยนเรื่องนี้จากการประกาศให้กลายเป็นการตัดสินใจ สิ่งแรกคือวันวางจำหน่ายของอวตารภายใน Muse เพราะทุกสิ่งที่ Meta เผยแพร่ล้วนเกี่ยวกับโมเดล และไม่มีสิ่งที่เผยแพร่เลยที่เกี่ยวกับผลิตภัณฑ์ที่คุณใช้ได้ในวันพฤหัสบดี สิ่งที่สองคือการวัดค่า latency จากการสนทนายาว ๆ แทนที่จะวัดที่ไบต์แรก — 870 มิลลิวินาทีเป็นเพียงเสียงปืนสตาร์ท และคำถามที่การโทรจริงถามคือเกิดอะไรขึ้นที่ นาทีที่สิบ สิ่งที่สามคือระบบรักษาบุคลิกได้หรือไม่ภายใต้สภาวะที่เป็นปฏิปักษ์ ผู้ใช้ที่จงใจเปลี่ยนเรื่อง พูดเร็ว หรือป้อนภาพอ้างอิงที่ออกแบบมาให้ดูเหมือนคนจริง
จนถึงตอนนั้น สรุปที่ซื่อสัตย์ก็คือสิ่งที่โพสต์งานวิจัยสื่อเป็นนัยโดยไม่ได้พูดออกมาตรง ๆ Muse Realtime Avatar เป็นงานวิศวกรรมของจริงที่มีผลลัพธ์การบีบอัดของจริงรองรับอยู่เบื้องหลัง สาธิตในสภาพแวดล้อมที่มีการควบคุม ประเมินโดยบริษัทที่สร้างมันขึ้นมา ในการสนทนาที่ใช้เวลาพอ ๆ กับการสั่งกาแฟหนึ่งครั้ง มันไม่ใช่ผลิตภัณฑ์ลม ๆ แล้ง ๆ และมันก็ไม่ใช่สิ่งที่คุณจะซื้อ จัดเส้นทาง หรือวัดประสิทธิภาพได้เช่นกัน — และนั่นเป็นข้อกล่าวอ้างที่แตกต่างกัน

