
Muse Realtime Avatar: Meta מעניקה לסוכן ה-Muse שלה פנים, ב-870 אלפיות שנייה בכל תור
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 180 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
המספר שמטא בחרה להוביל בו הוא 870 אלפיות השנייה. זה הזמן שנדרש ל-Muse Realtime Avatar, לפי המדידה של מטא עצמה, מרגע שאתה מפסיק לדבר ועד לרגע שבו מגיע הבייט הראשון של תגובה מסונכרנת של קול וווידאו. זה מספר אגרסיבי באמת למערכת שצריכה לייצר וידאו, וכדאי לקרוא אותו בדיוק — כי כמעט כל מה שמעניין במודל ההתגלמות החדש של מטא נמצא בפער שבין מה שהמספר הזה מודד לבין מה שאנשים יניחו שהוא מודד.
Muse Realtime Avatar הוכרז ב-23 בספטמבר 2026 בכנס Meta Connect ופורסם באותו יום על ידי Meta Superintelligence Labs בפוסט מחקר שכותרתו "להביא את ה-Muse שלך לחיים". הוא מרחיב את Muse Realtime Voice, השכבה השיחתית בתוך סוכן ה-Muse של Meta, בכך שהוא מעניק לו גוף. זה לא צ'אטבוט עם אווטאר גנרי: אתה מוסר לו תמונת ייחוס — צילום, איור בגוף מלא, בעל חיים, חפץ ביתי — והוא מרנדר את הדבר הזה כשהוא מדבר, מחווה ומשנה תנוחה בווידאו רציף לאורך השיחה. צוקרברג אמר על הבמה שהאווטאר שמחובר ל-Muse שלו נקרא Jolly.
זרם טוקנים משותף, לא מעבר סנכרון שפתיים
הארכיטקטורה היא החלק שכדאי להבין, כי היא מסבירה מדוע Meta ממשיכה לומר "התגלמות" במקום "אווטאר". Muse Realtime Voice מפיקה זרם של אסימוני דיבור — בפוסט קוראים להם VQs — הנושאים גם את התוכן של מה שנאמר וגם את הפרוזודיה שלו: הקצב, ההדגשה, העלייה והירידה. Muse Realtime Avatar צורך את אותו זרם. זהו Diffusion Transformer מונע-אודיו המותנה באסימוני הדיבור האלה, במדיה הייחוסית שסיפקת, ובחלון מתגלגל של לטנטים של וידאו אחרונים, והוא מייצר וידאו במקטעים סיבתיים קצרים, ומזרים כל לטנט חדש קדימה כהקשר תנועה עבור הבא.
שיתוף של זרם טוקנים אחד הוא מה שמשאיר קול, תנועת שפתיים והבעה נעולים יחד. החלופה — ליצור את האודיו, ואז להריץ עליו מודל סינכרון שפתיים נפרד — היא הדרך שבה פועלת רוב תעשיית האווטארים, וזו הסיבה שרבים כל כך מהאווטארים האלה נראים כאילו מדבבים אותם. העיצוב של Meta מסיר את התפר הזה מעצם הבנייה. חלון הלטנט המתגלגל הוא המחצית השנייה של הרעיון: בלעדיו, מחולל מבוסס־מקטעים סוטה, וכעבור שלוש דקות הדמות שלך הופכת בשקט למישהו אחר.

ארבעה מספרים שפורסמו, ומה כל אחד מהם באמת מודד
מטא פרסמה יותר מספרים מהמקובל בפוסט מחקרי המצורף לתכונה צרכנית. כל ארבעת אלה שלהלן מדווחים על ידי החברה, נמדדו על ידי מטא מול קווי בסיס שמטא בחרה; אף אחד מהם לא שוחזר מחוץ לחברה.
• 870 מ״ש מסוף התור לבייט הראשון. זהו נתון של תחילת תגובה. הוא אינו הזמן עד לתגובה מלאה, והוא אינו השהיית מסירה מתמשכת להמשך השיחה. מערכת יכולה להגיע ל־870 מ״ש לבייט הראשון ועדיין להרגיש איטית בשנייה השתים־עשרה. הפוסט של מטא מפורש בכך שזהו מדד הבייט הראשון; סיקור שמשמיט את ההסתייגות מפרש אותו כהיענות מקצה לקצה, וזה אינו כך.
• וידאו אנכי 448×768 בקצב של 25 פריימים לשנייה. זהו פריים גבוה בצורת טלפון, ולא פריים לרוחב, ו-25 פריימים לשנייה הוא קינמטי ולא חלק — קצב הפריימים הסטנדרטי לקולנוע, נמוך מ-30 או 60 פריימים לשנייה שזרם מצלמה מקורי ייתן לך. Meta אומרת שהדגמות מסומנות בסימן מים עם שכבת-על שקופה, כדי שנמען יוכל לדעת שהוא אינו צופה בזרם מצלמה רגיל.
• פי 60 פחות הערכות מודל.מוסבר כראוי בהמשך, כי זה המספר שסביר ביותר שייקרא בטעות.
• 12 סשנים בזמן אמת במקביל על NVIDIA GB200 אחד. Meta מדווחת שעבודת ההגשה שלה — מטמוני KV מתמשכים, ניתוב מודע למטמון, באצ'ינג דינמי מודע לשהיה, אימון מודע לכימות בארבעה סיביות, קרנלים מאוחדים ולכידת CUDA Graph, שפותחו עם NVIDIA — העלתה את הקיבולת פי 8 לעומת קו הבסיס הדו-שלבי BF16 שלה עצמה. החשבון שמאחורי זה נקי: כל שלב יצירה מפיק שמונה פריימים, שהם 320 מ"ש של השמעה, בזמן מודל של 20 מ"ש, או 2.5 מ"ש לפריים. גם ה-12 וגם ה-8× הם מול קו הבסיס שצוין על ידי Meta, ולא מול החומרה של ספק אחר.
למה 60× זה לא מהיר פי 60
טענת הדחיסה היא זו שתוחזר על עצמה הכי הרבה ותובן הכי פחות. מודל המורה של Meta היה מודל דיפוזיה בן 40 צעדים עם הנחיה ללא מסווג תלת-כיוונית — שלושה מעברים בכל צעד, כלומר 120 הערכות מודל כדי להפיק מקטע וידאו אחד. התלמיד הוא מודל סיבתי דו-שלבי ללא הנחיה עם מטמון KV באורך קבוע, שאומן על ידי זיקוק וכפייה עצמית, והוא זקוק לשתי הערכות עבור אותו מקטע. זהו צמצום של פי 60 בהערכות לכל מקטע, באיכות כמעט כמו של המורה, במילותיה של Meta.
זו הפחתת חישוב לכל מקטע. פי שישים פחות הערכות לא אומר שהמשתמש ממתין שישים פעם פחות זמן, כי ללטֶנטיות היו גורמים תורמים אחרים לפני הדיסטילציה וגם אחריה. התרשים בפוסט של Meta עצמה מראה מה ההפחתה קנתה במונחי איכות: העדפת בני אדם עולה מ־45% ל־55%. זו הגרסה הכנה של הסיפור — מטרת הדיסטילציה הייתה ליצור מערכת שיכולה בכלל לפעול בזמן אמת, ועלות האיכות הוגבלה לכעשרה נקודות העדפה ולא חוסלה.
ההערכה, כולל התוצאה שהלכה לכיוון השני
Meta נבחנה מול שתי מערכות אווטאר מסחריות, Runway Characters וHeyGen LiveAvatar, תוך שימוש בזהויות אווטאר מותאמות כך שהמדרגים השוו את האנימציה ולא את עיצוב הדמות. המדרגים קיימו שיחות חיות בנות שתיים עד שלוש דקות עם כל מערכת, ולאחר מכן השוו איכות חזותית, סנכרון, עקביות דמות וגינונים.
Meta מדווחת שמעדיפים אותה ביחס של 78% מול 22% על פני Runway Characters וביחס של 88% מול 12% על פני HeyGen LiveAvatar, ושהיא מועדפת בכל ממד שנבחן. ואז הפוסט עושה משהו שרוב הערכות הספקים אינן עושות: הוא חושף שההשוואה של מאפיינים התנהגותיים מול Runway Characters לא הייתה ניתנת להבחנה סטטיסטית משוויון. תיקו בתוך ניצחון מוחלט הוא דבר קטן, אבל זה הפרט שאומר לך שהניצחון המוחלט מדווח ביושר ולא נבחר באופן סלקטיבי.
מגבלות המבחן חשובות יותר מהתיקו. שתיים עד שלוש דקות הן שיחה קצרה. המעריכים היו של מטא. והפוסט עצמו מזהיר שההדגמות שלו "ממחישות את יכולת המודל ולא כולן משקפות אווטארים הזמינים באפליקציית Muse" — מה שצוות מחקר אומר, בפשטות, שהסרטון שצפית בו אינו בהכרח המוצר שתקבל.
מה לא ניתן לעשות עם זה
אין API עבור Muse Realtime Avatar. אין מחיר, אין כרטיס תעריפים, אין רשימת המתנה ואין תאריך פרסום. Meta לא מסרה מתי משתמשים או מפתחים יוכלו להשתמש בו. אפליקציית Muse לגילאי 18 ומעלה היא המשטח היחיד שאליו הוא מיועד, והאווטאר מגיע לצד קבוצה של תכונות Muse נוספות — התאמה אישית של קול, כתובת דוא"ל של Muse, שליטה במחשב Mac, אינטגרציה עם משקפיים — שיש להן לוחות זמנים משלהן, חלקן מוצהרות כ"בחודשים הקרובים".
ההשוואה שחשובה כאן היא לא מול Runway או HeyGen. היא מול שאר מחסנית Muse. Muse Spark, מודל ההיסק שעליו רץ הסוכן, זמין למפתחים מאז Meta חשפה אותו דרך Meta Model API, ו-Muse Spark 1.2 מוגש דרך OrcaRouter כ-meta/muse-spark-1.2 במחיר של $1.25 למיליון אסימוני קלט ו-$4.25 למיליון אסימוני פלט, במחיר המחירון של הספק עם אפס תוספת, בתוך חלון הקשר של מיליון אסימונים שכבר מקבל טקסט, תמונות, וידאו, אודיו וקבצים. זה החלק של Muse שאפשר לקרוא לו היום. הפנים הם החלק שאי אפשר.
האסימטריה הזו שווה התבוננות אם אתה מתכנן משהו. סוכן שמבצע הסקה בתוך שיחת וידאו וסוכן שמופיע בשיחה כזו הם מוצרים שונים עם אילוצים שונים, ורק אחד מהם מופיע במחירון.

מה לצפות בהמשך
שלושה דברים יהפכו את זה מהכרזה להחלטה. הראשון הוא תאריך יציאה לאווטאר שבתוך Muse, מפני שכל מה ש-Meta פרסמה עוסק במודל, ושום דבר ממה שפרסמה אינו עוסק במוצר שאפשר להשתמש בו ביום חמישי. השני הוא מדידת השהיה שנעשית לאורך שיחה ארוכה ולא בבייט הראשון — 870 ms הוא יריית פתיחה, והשאלה ששיחה אמיתית שואלת היא מה קורה בדקה העשירית. השלישי הוא האם המערכת שומרת על הדמות בתנאים עוינים: משתמש שמחליף בכוונה את הנושא, נע מהר, או מזין לה תמונת ייחוס שתוכננה להיראות כמו אדם אמיתי.
עד אז, הסיכום הישר הוא זה שפוסט המחקר מרמז עליו מבלי לומר אותו. Muse Realtime Avatar הוא יצירה הנדסית אמיתית עם תוצאת דחיסה אמיתית מאחוריה, שהודגמה בסביבה מבוקרת, הוערכה על ידי החברה שבנתה אותה, בשיחות שנמשכו בערך כמו הזמנת קפה. הוא לא בגדר תוכנת רפאים. הוא גם לא משהו שאפשר לקנות, לנתב או למדוד בביצועים — ואלה טענות שונות.

