การ์ดฮีโร่ที่สร้างขึ้นสำหรับ 'Muse Realtime Avatar' พร้อมโอเวอร์ไลน์ 'Meta AI Research - 23 กันยายน 2026' ชื่อเรื่อง และการ์ดที่มีป้ายกำกับสามใบซึ่งมีข้อความว่า 'Muse Realtime Voice - เลเยอร์การสนทนา สตรีมมิงโทเค็นเสียง' 'Muse Realtime Avatar - เลเยอร์การเป็นตัวตนที่สร้างขึ้นบนชั้นนั้น เพื่อการวิจัยเท่านั้น' และ 'Muse Spark 1.2 - โมเดล Muse ที่สามารถกำหนดเส้นทางบน OrcaRouter ได้แล้ววันนี้' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

Muse Realtime Avatar: Meta สร้างอะไรขึ้นมา มันทำงานบนอะไร และทำไมคุณยังคงโทรหามันไม่ได้

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Muse Realtime Avatarเป็นเทคโนโลยีการทำให้มีตัวตน (embodiment) ของ Meta โดยนำสตรีมเสียงพูดที่Muse Realtime Voiceสร้างขึ้นมา แล้วเรนเดอร์การแสดงที่สอดคล้องกันออกมา: เมื่อชี้ไปที่ภาพถ่ายบุคคล ใบหน้าก็จะตอบสนองด้วยการเปลี่ยนสีหน้าเล็ก ๆ เมื่อชี้ไปที่ภาพวาดเต็มตัว ร่างนั้นก็จะทำท่าทางและปรับเปลี่ยนอิริยาบถขณะพูด Meta AI Research เปิดตัวเทคโนโลยีนี้เมื่อวันที่ 23 กันยายน 2026 ในโพสต์ชื่อ "Bringing Your Muse to Life" มันเป็นผลงานวิจัยมากกว่าจะเป็นผลิตภัณฑ์ — หน้าเว็บของ Meta เองไม่มีทั้ง API ไม่มีราคา ไม่มีรายการรอ และไม่มีวันเปิดให้ใช้งาน — ดังนั้นคำตอบที่ตรงไปตรงมาสำหรับคำถามที่ว่า "วันนี้ฉันใช้มันได้ไหม" ก็คือ ยังใช้ไม่ได้ โมเดล Muse ที่คุณเรียกใช้ได้ในวันนี้เป็นอีกตัวหนึ่ง คือ Meta Muse Spark 1.2

คำตอบนั้นควรกล่าวไว้ในย่อหน้าแรกมากกว่าย่อหน้าสุดท้าย เพราะผู้อ่านที่ค้นหาชื่อนี้มักกำลังตัดสินใจว่าจะวางแผนโดยยึดมันเป็นหลักหรือไม่ จงวางแผนโดยยึดงานวิจัย ไม่ใช่ยึดจุดสิ้นสุด

มีเรื่องหนึ่งที่ต้องพูดให้ตรงไปตรงมาก่อนสิ่งอื่นใด เพราะหน้านี้ฝ่าฝืนกฎข้อหนึ่งที่มันควรยอมรับ บล็อกนี้ปกติเขียนเกี่ยวกับโมเดลในสัปดาห์ที่เปิดตัว Muse Realtime Avatar ถูกประกาศเมื่อหนึ่งสัปดาห์ก่อนที่หน้านี้จะเผยแพร่ ดังนั้นหากตีความช่วงเวลาความสดใหม่อย่างเคร่งครัด รายการนี้ก็จะถูกข้ามไป นี่ไม่ใช่บทความข่าวเกี่ยวกับเหตุการณ์ที่ระบุวันที่ แต่เป็นหน้าอ้างอิงสำหรับโมเดลที่ยังมีบทบาทอยู่ในบทสนทนาเรื่องแค็ตตาล็อกในวันนี้ หน้าที่ผู้อ่านไปถึงหลังจากพิมพ์ชื่อของโมเดลเอง ซึ่งเหตุผลรองรับของหน้านี้คือความต้องการค้นหาที่ต่อเนื่องซึ่งเราวัดด้วยตัวเอง ไม่ใช่ความสดใหม่ของการเปิดตัว การประกาศในเดือนกันยายนถูกกล่าวถึงที่นี่ในฐานะข้อเท็จจริงที่ใช้ระบุวันที่ของโมเดล ไม่ใช่ในฐานะเหตุการณ์ที่ต้องรายงาน และไม่มีสิ่งใดด้านล่างนี้เป็นการประกาศครั้งที่สอง การรายงานของเราเกี่ยวกับวันนั้นเป็นชิ้นงานแยกต่างหาก และมันยังคงแยกจากกัน

ตำแหน่งของมันในตระกูล Muse

Meta ระบุอย่างชัดเจนว่าสิ่งเหล่านี้คือสองเลเยอร์ของระบบเดียว ไม่ใช่สองผลิตภัณฑ์ ในถ้อยคำของ Meta ที่ว่า “Muse Realtime Voice และ Muse Realtime Avatar รวมกันเป็นระบบสตรีมมิ่งเดียวที่เชื่อมโยงสติปัญญา เสียง และการมีกาย” ชั้นเสียงทำหน้าที่จัดหาสติปัญญาเชิงสนทนาและปล่อยสตรีมของโทเค็นเสียงพูด — Meta เรียกสิ่งเหล่านี้ว่า VQs — ซึ่งบรรจุทั้งสิ่งที่พูดและวิธีที่พูดออกมา ตัวถอดรหัสเสียงจะเปลี่ยนโทเค็นเหล่านั้นให้เป็นเสียง และชั้นอวตารจะใช้สตรีมเดียวกันเพื่อสร้างภาพ การแชร์สตรีมโทเค็นชุดเดียวกันคือสิ่งที่ทำให้เสียง การเคลื่อนไหวริมฝีปาก และสีหน้าสอดคล้องกัน; ไม่มีขั้นตอนซิงก์ริมฝีปากแยกต่างหากที่ถูกเติมเข้ามาทีหลัง

ดังนั้น: Muse Realtime Voice คือเลเยอร์การสนทนา Muse Realtime Avatar คือเลเยอร์การมีตัวตนที่สร้างต่อยอดขึ้นมาจากมัน ทั้งสองไม่ใช่สิ่งที่คุณเรียกใช้ได้

ระมัดระวังชื่อที่ใกล้เคียงให้พอ ๆ กัน เพราะมันเป็นชื่อที่มีแนวโน้มจะถูกเข้าใจผิดว่าเป็นชื่อใดชื่อหนึ่งมากที่สุด Muse Voice Transcribe เป็นปลายทางการถอดเสียง และเป็นผลิตภัณฑ์ที่แตกต่างกันจริง ๆ เอกสารสำหรับนักพัฒนาของ Meta ระบุไว้อย่างชัดเจนว่า "เป็นเพียงการแปลงเสียงเป็นข้อความเท่านั้น ไม่ได้สังเคราะห์เสียงหรือให้ API สำหรับการสนทนาแบบเสียงต่อเสียง" มันส่งคืนการประทับเวลาระดับรอบการพูด ไม่ใช่ระดับคำ และ Meta ระบุราคาไว้ที่ $0.18 ต่อชั่วโมงในหน้านั้น มันเป็นปลายทางที่มีอยู่จริงและมีราคา มันไม่ใช่เสียง และแน่นอนว่าไม่ใช่อวตาร

โมเดล Muse ที่เรียกใช้ได้จริงตอนนี้คือ Meta Muse Spark 1.2 ซึ่งเป็นโมเดล reasoning ที่ Meta เปิดให้ใช้พร้อมคอนเท็กซ์หนึ่งล้านโทเคน และรองรับอินพุตทั้งข้อความ รูปภาพ วิดีโอ ไฟล์ และเสียง ตัวนี้สามารถ route ได้ที่นี่แล้ววันนี้ ในราคาตามที่ผู้ให้บริการประกาศไว้โดยไม่บวกเพิ่ม ด้วยคีย์เดียวกับทุกอย่างในแค็ตตาล็อก และการ์ดสดของมันมีสเปกฉบับเต็มครบถ้วน เราไม่มี Muse Realtime Avatar เราตรวจสอบรายการโมเดลสดอีกครั้งขณะเขียนข้อความนี้ และรายการ Muse เพียงอย่างเดียวที่อยู่ในนั้นคือเช็กพอยต์ Spark สองตัว ได้แก่ 1.2 และรุ่นก่อนหน้าอย่าง 1.1 การพูดอะไรที่อ่อนกว่านั้น — ว่าตระกูลนี้ "พร้อมให้บริการบางส่วน" — จะสื่อว่าเรา route บางอย่างที่เราไม่ได้ให้บริการจริง

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

เทคโนโลยีนี้ ตามที่ระบุไว้ในถ้อยคำของ Meta เอง

คำอธิบายสถาปัตยกรรมของ Meta กระชับพอที่จะยกมาอ้างโดยไม่ต้องถอดความ Muse Realtime Avatar คือ "Diffusion Transformer ที่ขับเคลื่อนด้วยเสียง ซึ่งมีเงื่อนไขจากสตรีมโทเคนเสียง สื่ออ้างอิง และหน้าต่างเลื่อนของเวกเตอร์แฝงวิดีโอล่าสุด" และมัน "สร้างวิดีโอเป็นชังก์เชิงสาเหตุสั้น ๆ" ครึ่งหลังของประโยคนั้นคือส่วนที่รับน้ำหนัก: เมื่อแต่ละชังก์เสร็จสมบูรณ์ เวกเตอร์แฝงที่สร้างใหม่ล่าสุดของมันจะกลายเป็นบริบทการเคลื่อนไหวสำหรับชังก์ถัดไป เหตุผลที่ Meta ระบุคือความต่อเนื่อง — รูปร่างหน้าตาและลักษณะท่าทางของอวตารส่งต่อไปยังเทิร์นถัดไปในขณะที่การคำนวณยังคงมีขอบเขต ซึ่งเป็นสิ่งที่ทำให้การสร้างดำเนินต่อไปได้นานเท่ากับการสนทนา แทนที่จะเบี่ยงเบนหรืองบประมาณหมด

กลไกการยืนยันแหล่งที่มา (provenance) ควรอยู่ในย่อหน้าเดียวกัน เพราะ Meta นำเสนอสิ่งนี้เป็นส่วนหนึ่งของระบบ ไม่ใช่เป็นสิ่งที่คิดขึ้นภายหลัง: วิดีโอที่สร้างขึ้นจะมีลายน้ำแบบมองไม่เห็นที่คงทน ซึ่งใส่ผ่าน Meta Video Seal โดย Meta กล่าวว่าวิธีนี้ไม่เพิ่มความหน่วง (latency) ให้กับเส้นทางการทำงานแบบเรียลไทม์

Meta วัดสิ่งนี้และเผยแพร่ตัวเลขสี่ตัวสำหรับมัน ตัวเลขเหล่านั้น — พร้อมข้อควรระวังเฉพาะที่แต่ละตัวต้องมี รวมถึงตัวที่อ่านดูเหมือนเป็นการเร่งความเร็วแต่ไม่ใช่ — อยู่ในบทความตอนเปิดตัว ซึ่งนำเสนอตัวเลขเหล่านั้นโดยบริบทยังคงอยู่ครบถ้วน เราจะไม่กล่าวซ้ำตัวเลขเปล่า ๆ ตรงนี้ เพราะตัวเลขเปล่า ๆ คือสิ่งที่เวอร์ชันที่มีข้อควรระวังถูกสร้างขึ้นมาเพื่อป้องกันไว้พอดี

เราได้รายงานข่าวการประกาศดังกล่าวในวันนั้นไว้ในบทความเปิดตัว Muse Realtime Avatar ของเรา และบทความนั้นยังคงเป็นที่ที่คุณจะได้อ่านข้อความที่อ้างอย่างรอบคอบได้อย่างครบถ้วน

สิ่งที่ชื่อไม่ใช่

ควรตัดเพื่อนบ้านเท็จสามรายนี้ออกทีละราย เพราะแต่ละรายล้วนเป็นการเดาที่สมเหตุสมผลจากชื่อเพียงอย่างเดียว

• นี่ไม่ใช่ Muse Voice Transcribe เอนด์พอยต์นั้นแปลงเสียงเป็นข้อความ และตามคำอธิบายของ Meta เอง มันไม่ได้ทำอะไรในทิศทางตรงกันข้าม ถ้าสิ่งที่คุณต้องการคือข้อความถอดเสียง Meta มีขายอยู่ และมันเป็นคนละสิ่งกับราคาที่ต่างกัน

• ไม่ใช่บริการโคลนเสียง ไม่มีสิ่งใดในหน้าของ Meta ที่อธิบายถึงการสังเคราะห์เสียงของบุคคลใดบุคคลหนึ่ง การขายโมเดลเสียง หรือการรับตัวอย่างเสียงจากผู้ใช้ เลเยอร์เสียงถูกอธิบายว่าผลิตสตรีมโทเคน ส่วนเลเยอร์อวตารถูกอธิบายว่าเป็นฝ่ายนำสตรีมนั้นไปใช้ รูปแบบผลิตภัณฑ์ที่วลีนี้มักสื่อโดยนัย — อัปโหลดตัวอย่าง แล้วได้โคลน — ไม่ใช่สิ่งที่อธิบายไว้ที่นี่ และเนื้อหาสาธิตที่ Meta เผยแพร่จริงนั้นถูกนำเสนอเป็นภาพประกอบของความสามารถของโมเดล

• มันไม่ใช่อวตารสำหรับผู้บริโภคในแอปของ Meta เอง Meta แนบคำเตือนไว้กับตัวอย่างของตน ซึ่งเป็นคำเตือนที่มองข้ามได้ง่ายและควรค่าแก่การจดจำ: การสาธิตเหล่านี้ "แสดงให้เห็นความสามารถของโมเดล และไม่ได้สะท้อนอวตารทั้งหมดที่มีให้ใช้ในแอป Muse" และ Muse มีไว้สำหรับผู้ใช้อายุ 18 ปีขึ้นไป อ่านข้อความนั้นตามตัวอักษร บางสิ่งที่โพสต์นี้แสดงเป็นความสามารถ ไม่ใช่สินค้าคงคลัง

ชื่อที่สี่สมควรแยกออกมาด้วยเหตุผลที่แตกต่างออกไป Muse Realtime Avatar ไม่ใช่ Muse Video ซึ่งเป็นโมเดลสร้างวิดีโอที่อยู่ในกระดานผู้นำสาธารณะมาเกือบทั้งปีนี้โดยไม่มีการเปิดตัว หน้าของเราเองเกี่ยวกับสถานการณ์นั้น — Muse Video: วันวางจำหน่าย การเข้าถึง API และสิ่งที่ Meta Connect อาจเปลี่ยนแปลง — มีข้อจำกัดที่เราจะกล่าวซ้ำที่นี่แบบคำต่อคำแทนที่จะปรับปรุงให้ดีขึ้น: หน้าใดก็ตามที่อ้างวันเปิดตัวที่เจาะจงหรือราคาสำหรับ Muse Video โดยไม่มีการประกาศใหม่จาก Meta ถือเป็นการคาดเดา หลักการเดียวกันนี้ใช้กับหัวข้อของหน้านี้ ดังนั้นหน้านี้จึงไม่กล่าวถึงทั้งสองอย่าง บทความนั้นยังให้วันที่ที่เราไม่ควรนำมาสับสน: Muse Video ถูกพรีวิวเมื่อวันที่ 7 กรกฎาคม 2026 และยังไม่เปิดตัว ซึ่งเป็นเหตุผลว่าทำไมการค้นหาสำหรับตระกูลนี้จึงแสดงวันที่ที่เป็นของโมเดลอื่น

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

หน้านี้มีไว้เพื่ออะไร และอะไรจะทำให้มันเปลี่ยนแปลง

เหตุผลที่หน้าอ้างอิงเป็นรูปแบบที่เหมาะสมในที่นี้สามารถวัดได้ ในช่วง 28 วันจนถึงวันที่ 25 กันยายน 2026 คำค้นแบบตรงตัวนี้สร้างการแสดงผล 164 ครั้งบนพร็อพเพอร์ตี้การค้นหาของเรา และไม่มีคลิก โดยมีตำแหน่งดีที่สุดที่ 9.3 มากกว่าห้าสิบหน้าของเรากล่าวถึงชิ้นส่วนข้อความนี้อยู่ที่ใดที่หนึ่ง และเกือบทั้งหมดของการเข้าชมนั้นไปลงที่โพสต์ประกาศเพียงโพสต์เดียว คำที่มีดีมานด์จริงและต่อเนื่อง จัดอันดับอยู่นอกหน้าแรกเพียงเล็กน้อย และไม่ทำให้เกิดคอนเวอร์ชันใด ๆ ไม่ใช่ปัญหาด้านดีมานด์หรือปัญหาด้านคุณภาพ — มันเป็นปัญหาที่ตัวหน้าเพจ ไม่มีหน้าใดที่มีหัวข้อเป็นตัวโมเดลเอง นี่คือหน้านั้น

จุดยืนนี้ยังเป็นเหตุผลว่าทำไมจึงไม่มีอะไรตรงนี้ที่ถูกแต่งให้ดูเป็นข่าว ผู้อ่านที่มาจากการค้นหาชื่อต้องการสามสิ่งตามลำดับ: สิ่งนี้คืออะไร มีให้ใช้หรือไม่ และมันสร้างขึ้นบนอะไร สิ่งเหล่านี้มีคำตอบอยู่ข้างต้น ตามลำดับนั้น โดยไม่มีการกุวันที่ขึ้นมาและไม่มีการเอ่ยชื่อคู่แข่ง

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

สิ่งที่ทำให้หน้านี้เปลี่ยนไปคือประกาศเพียงฉบับเดียว หาก Meta ประกาศเอนด์พอยต์ ราคา รายชื่อรอ หรือวันที่สำหรับ Muse Realtime Avatar ส่วนความพร้อมใช้งานจะไม่ใช่คำตอบว่า "ไม่" อีกต่อไป แต่จะกลายเป็นข้อกำหนดจำเพาะ และหน้านี้จะถูกเขียนใหม่ทั้งหน้า ไม่ใช่แค่ต่อท้าย หาก Meta เปิดตัว Muse Video ย่อหน้าด้านบนก็จะเปลี่ยนไปด้วย จนกว่าอย่างใดอย่างหนึ่งจะเกิดขึ้น สิ่งที่มีประโยชน์สำหรับนักพัฒนาคือวิธีที่ดูไม่หวือหวา: เก็บอินเทอร์เฟซที่คุณมีอยู่แล้วให้ชี้ไปที่โมเดลที่คุณเข้าถึงได้จริง ทุกโมเดลในแค็ตตาล็อก รวมถึง Meta Muse Spark 1.2 ต่างอยู่เบื้องหลังเอนด์พอยต์แบบ OpenAI-compatible เพียงหนึ่งแห่งและคีย์เพียงหนึ่งตัว ซึ่งหมายความว่าการลองใช้ส่วนของตระกูลนี้ที่มีอยู่จริงมีค่าใช้จ่ายเป็นเพียงการเปลี่ยนสตริงชื่อโมเดล ไม่ใช่การทำสัญญาใหม่ เมื่อเลเยอร์ embodiment เรียกใช้งานได้ ค่าใช้จ่ายในการสลับก็ควรเป็นเพียงสตริงเช่นกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube