כרטיס הירו מחולל עבור 'Muse Realtime Avatar: Meta Gives Its Muse Agent a Face, at 870 Milliseconds a Turn', המציג את שורת הכותרת העליונה 'Meta Superintelligence Labs — 23 בספטמבר 2026', את הכותרת הראשית, ושלוש עובדות מתוך פוסט המחקר של Meta: וידאו פורטרט 448×768 ב-25 פריימים לשנייה, כ-870 מ״ש מסוף התור לבית הראשון, ו-12 הפעלות בזמן אמת במקביל על NVIDIA GB200 אחד. כתובית משנה אומרת 'זה לא ראש מדבר. זו שכבת רינדור מעל מודל קולי.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Engineering & Research

Muse Realtime Avatar: Meta מעניקה לסוכן ה-Muse שלה פנים, ב-870 אלפיות שנייה בכל תור

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המספר שמטא בחרה להוביל בו הוא 870 אלפיות השנייה. זה הזמן שנדרש ל-Muse Realtime Avatar, לפי המדידה של מטא עצמה, מרגע שאתה מפסיק לדבר ועד לרגע שבו מגיע הבייט הראשון של תגובה מסונכרנת של קול וווידאו. זה מספר אגרסיבי באמת למערכת שצריכה לייצר וידאו, וכדאי לקרוא אותו בדיוק — כי כמעט כל מה שמעניין במודל ההתגלמות החדש של מטא נמצא בפער שבין מה שהמספר הזה מודד לבין מה שאנשים יניחו שהוא מודד.

Muse Realtime Avatar הוכרז ב-23 בספטמבר 2026 בכנס Meta Connect ופורסם באותו יום על ידי Meta Superintelligence Labs בפוסט מחקר שכותרתו "להביא את ה-Muse שלך לחיים". הוא מרחיב את Muse Realtime Voice, השכבה השיחתית בתוך סוכן ה-Muse של Meta, בכך שהוא מעניק לו גוף. זה לא צ'אטבוט עם אווטאר גנרי: אתה מוסר לו תמונת ייחוס — צילום, איור בגוף מלא, בעל חיים, חפץ ביתי — והוא מרנדר את הדבר הזה כשהוא מדבר, מחווה ומשנה תנוחה בווידאו רציף לאורך השיחה. צוקרברג אמר על הבמה שהאווטאר שמחובר ל-Muse שלו נקרא Jolly.

זרם טוקנים משותף, לא מעבר סנכרון שפתיים

הארכיטקטורה היא החלק שכדאי להבין, כי היא מסבירה מדוע Meta ממשיכה לומר "התגלמות" במקום "אווטאר". Muse Realtime Voice מפיקה זרם של אסימוני דיבור — בפוסט קוראים להם VQs — הנושאים גם את התוכן של מה שנאמר וגם את הפרוזודיה שלו: הקצב, ההדגשה, העלייה והירידה. Muse Realtime Avatar צורך את אותו זרם. זהו Diffusion Transformer מונע-אודיו המותנה באסימוני הדיבור האלה, במדיה הייחוסית שסיפקת, ובחלון מתגלגל של לטנטים של וידאו אחרונים, והוא מייצר וידאו במקטעים סיבתיים קצרים, ומזרים כל לטנט חדש קדימה כהקשר תנועה עבור הבא.

שיתוף של זרם טוקנים אחד הוא מה שמשאיר קול, תנועת שפתיים והבעה נעולים יחד. החלופה — ליצור את האודיו, ואז להריץ עליו מודל סינכרון שפתיים נפרד — היא הדרך שבה פועלת רוב תעשיית האווטארים, וזו הסיבה שרבים כל כך מהאווטארים האלה נראים כאילו מדבבים אותם. העיצוב של Meta מסיר את התפר הזה מעצם הבנייה. חלון הלטנט המתגלגל הוא המחצית השנייה של הרעיון: בלעדיו, מחולל מבוסס־מקטעים סוטה, וכעבור שלוש דקות הדמות שלך הופכת בשקט למישהו אחר.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

ארבעה מספרים שפורסמו, ומה כל אחד מהם באמת מודד

מטא פרסמה יותר מספרים מהמקובל בפוסט מחקרי המצורף לתכונה צרכנית. כל ארבעת אלה שלהלן מדווחים על ידי החברה, נמדדו על ידי מטא מול קווי בסיס שמטא בחרה; אף אחד מהם לא שוחזר מחוץ לחברה.

870 מ״ש מסוף התור לבייט הראשון. זהו נתון של תחילת תגובה. הוא אינו הזמן עד לתגובה מלאה, והוא אינו השהיית מסירה מתמשכת להמשך השיחה. מערכת יכולה להגיע ל־870 מ״ש לבייט הראשון ועדיין להרגיש איטית בשנייה השתים־עשרה. הפוסט של מטא מפורש בכך שזהו מדד הבייט הראשון; סיקור שמשמיט את ההסתייגות מפרש אותו כהיענות מקצה לקצה, וזה אינו כך.

וידאו אנכי 448×768 בקצב של 25 פריימים לשנייה. זהו פריים גבוה בצורת טלפון, ולא פריים לרוחב, ו-25 פריימים לשנייה הוא קינמטי ולא חלק — קצב הפריימים הסטנדרטי לקולנוע, נמוך מ-30 או 60 פריימים לשנייה שזרם מצלמה מקורי ייתן לך. Meta אומרת שהדגמות מסומנות בסימן מים עם שכבת-על שקופה, כדי שנמען יוכל לדעת שהוא אינו צופה בזרם מצלמה רגיל.

פי 60 פחות הערכות מודל.מוסבר כראוי בהמשך, כי זה המספר שסביר ביותר שייקרא בטעות.

12 סשנים בזמן אמת במקביל על NVIDIA GB200 אחד. Meta מדווחת שעבודת ההגשה שלה — מטמוני KV מתמשכים, ניתוב מודע למטמון, באצ'ינג דינמי מודע לשהיה, אימון מודע לכימות בארבעה סיביות, קרנלים מאוחדים ולכידת CUDA Graph, שפותחו עם NVIDIA — העלתה את הקיבולת פי 8 לעומת קו הבסיס הדו-שלבי BF16 שלה עצמה. החשבון שמאחורי זה נקי: כל שלב יצירה מפיק שמונה פריימים, שהם 320 מ"ש של השמעה, בזמן מודל של 20 מ"ש, או 2.5 מ"ש לפריים. גם ה-12 וגם ה-8× הם מול קו הבסיס שצוין על ידי Meta, ולא מול החומרה של ספק אחר.

למה 60× זה לא מהיר פי 60

טענת הדחיסה היא זו שתוחזר על עצמה הכי הרבה ותובן הכי פחות. מודל המורה של Meta היה מודל דיפוזיה בן 40 צעדים עם הנחיה ללא מסווג תלת-כיוונית — שלושה מעברים בכל צעד, כלומר 120 הערכות מודל כדי להפיק מקטע וידאו אחד. התלמיד הוא מודל סיבתי דו-שלבי ללא הנחיה עם מטמון KV באורך קבוע, שאומן על ידי זיקוק וכפייה עצמית, והוא זקוק לשתי הערכות עבור אותו מקטע. זהו צמצום של פי 60 בהערכות לכל מקטע, באיכות כמעט כמו של המורה, במילותיה של Meta.

זו הפחתת חישוב לכל מקטע. פי שישים פחות הערכות לא אומר שהמשתמש ממתין שישים פעם פחות זמן, כי ללטֶנטיות היו גורמים תורמים אחרים לפני הדיסטילציה וגם אחריה. התרשים בפוסט של Meta עצמה מראה מה ההפחתה קנתה במונחי איכות: העדפת בני אדם עולה מ־45% ל־55%. זו הגרסה הכנה של הסיפור — מטרת הדיסטילציה הייתה ליצור מערכת שיכולה בכלל לפעול בזמן אמת, ועלות האיכות הוגבלה לכעשרה נקודות העדפה ולא חוסלה.

ההערכה, כולל התוצאה שהלכה לכיוון השני

Meta נבחנה מול שתי מערכות אווטאר מסחריות, Runway Characters וHeyGen LiveAvatar, תוך שימוש בזהויות אווטאר מותאמות כך שהמדרגים השוו את האנימציה ולא את עיצוב הדמות. המדרגים קיימו שיחות חיות בנות שתיים עד שלוש דקות עם כל מערכת, ולאחר מכן השוו איכות חזותית, סנכרון, עקביות דמות וגינונים.

Meta מדווחת שמעדיפים אותה ביחס של 78% מול 22% על פני Runway Characters וביחס של 88% מול 12% על פני HeyGen LiveAvatar, ושהיא מועדפת בכל ממד שנבחן. ואז הפוסט עושה משהו שרוב הערכות הספקים אינן עושות: הוא חושף שההשוואה של מאפיינים התנהגותיים מול Runway Characters לא הייתה ניתנת להבחנה סטטיסטית משוויון. תיקו בתוך ניצחון מוחלט הוא דבר קטן, אבל זה הפרט שאומר לך שהניצחון המוחלט מדווח ביושר ולא נבחר באופן סלקטיבי.

מגבלות המבחן חשובות יותר מהתיקו. שתיים עד שלוש דקות הן שיחה קצרה. המעריכים היו של מטא. והפוסט עצמו מזהיר שההדגמות שלו "ממחישות את יכולת המודל ולא כולן משקפות אווטארים הזמינים באפליקציית Muse" — מה שצוות מחקר אומר, בפשטות, שהסרטון שצפית בו אינו בהכרח המוצר שתקבל.

מה לא ניתן לעשות עם זה

אין API עבור Muse Realtime Avatar. אין מחיר, אין כרטיס תעריפים, אין רשימת המתנה ואין תאריך פרסום. Meta לא מסרה מתי משתמשים או מפתחים יוכלו להשתמש בו. אפליקציית Muse לגילאי 18 ומעלה היא המשטח היחיד שאליו הוא מיועד, והאווטאר מגיע לצד קבוצה של תכונות Muse נוספות — התאמה אישית של קול, כתובת דוא"ל של Muse, שליטה במחשב Mac, אינטגרציה עם משקפיים — שיש להן לוחות זמנים משלהן, חלקן מוצהרות כ"בחודשים הקרובים".

ההשוואה שחשובה כאן היא לא מול Runway או HeyGen. היא מול שאר מחסנית Muse. Muse Spark, מודל ההיסק שעליו רץ הסוכן, זמין למפתחים מאז Meta חשפה אותו דרך Meta Model API, ו-Muse Spark 1.2 מוגש דרך OrcaRouter כ-meta/muse-spark-1.2 במחיר של $1.25 למיליון אסימוני קלט ו-$4.25 למיליון אסימוני פלט, במחיר המחירון של הספק עם אפס תוספת, בתוך חלון הקשר של מיליון אסימונים שכבר מקבל טקסט, תמונות, וידאו, אודיו וקבצים. זה החלק של Muse שאפשר לקרוא לו היום. הפנים הם החלק שאי אפשר.

האסימטריה הזו שווה התבוננות אם אתה מתכנן משהו. סוכן שמבצע הסקה בתוך שיחת וידאו וסוכן שמופיע בשיחה כזו הם מוצרים שונים עם אילוצים שונים, ורק אחד מהם מופיע במחירון.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

מה לצפות בהמשך

שלושה דברים יהפכו את זה מהכרזה להחלטה. הראשון הוא תאריך יציאה לאווטאר שבתוך Muse, מפני שכל מה ש-Meta פרסמה עוסק במודל, ושום דבר ממה שפרסמה אינו עוסק במוצר שאפשר להשתמש בו ביום חמישי. השני הוא מדידת השהיה שנעשית לאורך שיחה ארוכה ולא בבייט הראשון — 870 ms הוא יריית פתיחה, והשאלה ששיחה אמיתית שואלת היא מה קורה בדקה העשירית. השלישי הוא האם המערכת שומרת על הדמות בתנאים עוינים: משתמש שמחליף בכוונה את הנושא, נע מהר, או מזין לה תמונת ייחוס שתוכננה להיראות כמו אדם אמיתי.

עד אז, הסיכום הישר הוא זה שפוסט המחקר מרמז עליו מבלי לומר אותו. Muse Realtime Avatar הוא יצירה הנדסית אמיתית עם תוצאת דחיסה אמיתית מאחוריה, שהודגמה בסביבה מבוקרת, הוערכה על ידי החברה שבנתה אותה, בשיחות שנמשכו בערך כמו הזמנת קפה. הוא לא בגדר תוכנת רפאים. הוא גם לא משהו שאפשר לקנות, לנתב או למדוד בביצועים — ואלה טענות שונות.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.