כרטיס הירו שנוצר עבור המאמר 'Muse Realtime Avatar vs SeedRealtime', המציג שני כרטיסים מעוגלים משני צדי הכותרת. הכרטיס השמאלי מציג את 'Muse Realtime Avatar' מעל סמל של מסגרת וידאו יוצאת והשורות 'מייצר את הווידאו' ו-'Meta, הוכרז ב-23 בספטמבר'; הכרטיס הימני מציג את 'SeedRealtime' מעל סמל של מסך ועין והשורות 'צופה בווידאו' ו-'ByteDance, הושק ב-5 באוגוסט'. כתובית משנית מציינת 'לאף אחד מהשניים אין מחירון.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Muse Realtime Avatar לעומת SeedRealtime: שני מודלים שאפשר רק לצפות בהם

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

לאף אחד משני אלה אין מחירון. Muse Realtime Avatar, שהוכרז על ידי Meta ב-23 בספטמבר 2026 ב-Meta Connect, אין לו API, אין נקודת קצה, אין מחיר ואין תאריך — מדובר ביכולת של סוכן ה-Muse של Meta, שהודגמה בפוסט מחקרי שכותרתו "להביא את ה-Muse שלך לחיים." SeedRealtime, שיצא על ידי ByteDance Seed ב-5 באוגוסט 2026, אין לו API, אין משקולות, אין דוח טכני ואין מספר פרמטרים — הוא קיים בתוך אפליקציית Doubao של ByteDance עצמה, והפוסט של ByteDance אומר רק שהוא "הושק במלואו". שתיים מחברות ה-AI הצרכניות הגדולות בעולם שחררו מערכות אודיו-ויזואליות בזמן אמת בתוך שבעה שבועות זו מזו, ואף אחת מהן אינה ניתנת לרכישה. זו ההשוואה, והיא מעניינת יותר מטבלת הבנצ'מרקים שאף אחד לא יכול לבנות.

מה שמפריד ביניהם הוא הכיוון שבו הווידאו זורם. SeedRealtime צופה ומקשיב ומדבר על מה שהוא רואה — אודיו, וידאו וטקסט לתוך רשת אחת מקצה לקצה, כאשר חלוקת התורות עברה מגלאי פעילות קולית חיצוני אל תוך המודל עצמו. Muse Realtime Avatar מייצר: אתה מוסר לו תמונת ייחוס, צילום או איור או חפץ, והוא מרנדר את הדבר הזה מדבר ומחווה בווידאו רציף לאורך השיחה. הווידאו של SeedRealtime הוא קלט. הווידאו של Muse Realtime Avatar הוא פלט. שניהם מתוארים כדופלקס מלא, שניהם אודיו-ויזואליים, והם עושים עבודות הפוכות עם אותה תווית.

מה כל אחד מהם, והיכן הוא נמצא

שש שורות, והשתיים האחרונות הן אלו שמכריעות משהו.

וידאו — Muse Realtime Avatar מייצר אותו, ברזולוציית פורטרט של 448×768 ובקצב של 25 פריימים לשנייה, עם סימן מים כשכבת שקיפות כך שצופה יכול להבחין שזה אינו הזנה ממצלמה; SeedRealtime קולט אותו, ומזרים פריימים אל אותה רשת שמטפלת באודיו.

ההימור הארכיטקטוני — Muse Realtime Avatar משתף זרם טוקנים אחד בין קול לווידאו, כך ש-Diffusion Transformer המונע באודיו צורך ישירות את טוקני הדיבור של Muse Realtime Voice, ולאחר מכן שום דבר אינו מסונכרן לשפתיים; SeedRealtime מקפל את חילופי התורות אל תוך המודל, כך שמי מדבר ומתי מפסיק להיות החלטה של גלאי פעילות קולית חיצוני.

היכן זה פועל — Muse Realtime Avatar הוא יכולת בתוך סוכן Muse של Meta; SeedRealtime נמצא בתוך אפליקציית Doubao של ByteDance.

גישת מפתחים — לאף אחד מהם אין API. אף אחד מהם אינו מפרסם משקלים. אין אפשרות ללא שרת, אין נקודת קצה מתארחת, ואין פלטפורמת צד שלישי שמציעה אף אחד מהם.

מחיר — לא מפורסם עבור שניהם, מכיוון שאין הצעה מסחרית באף אחד מהצדדים.

הערכה בלתי תלויה — אין כזו לאף אחת מהמערכות. כל נתון שכל אחת מהחברות פרסמה על המודל שלה הוא ממקור ראשון, ואף מעריך חיצוני לא הריץ אף אחת מהן.

שני בסיסי ראיות, שניהם ממקור ראשון, ואחד מהם דל בהרבה

כאן ההשוואה מפסיקה להיות סימטרית. Meta פרסמה ארבעה נתונים עבור Muse Realtime Avatar, כולם מדווחים על ידי החברה, שנמדדו מול קווי בסיס ש-Meta בחרה, ואף אחד מהם לא שוחזר מחוץ לחברה: 870 ms מסוף התור שלך ועד הבייט הראשון של תגובת קול וווידאו מסונכרנת; וידאו פורטרט ברזולוציית 448×768 בקצב של 25 פריימים לשנייה; פי 60 פחות הערכות מודל מאשר קו הבסיס שלה עצמה; ו-12 הפעלות בזמן אמת במקביל על NVIDIA GB200 אחד, שיפור קיבולת של פי 8 לעומת קו הבסיס הדו-שלבי BF16 של Meta, שמקורו באימון מודע לכימות של ארבעה ביטים ובאצוות דינמית מודעת השהיה. Meta גם פרסמה השוואת העדפות מול שתי מערכות אווטאר מסחריות — 78/22 מול אחת, 88/12 מול האחרת — וחשפה שבכל הנוגע למנייריזמים, התוצאה מול אחת מהן אינה ניתנת להבחנה סטטיסטית משוויון. החשיפה הזו שווה יותר מהניצחונות; זה מסוג התוצאות שרוב פרסומי ההשקה משמיטים.

הראיות המפורסמות של SeedRealtime הן הערכה אנושית אחת מקצה לקצה. ByteDance אומרת כי לעומת מערכות משורשרות — מודל ראייה המחובר למודל ASR המחובר ל-LLM המחובר לקול של טקסט לדיבור — SeedRealtime מפחיתה בחצי את בעיות הקצב בשיחה אודיו-ויזואלית, עם פחות קטיעות, פחות הפעלות שווא ותשובות איטיות וטבעיות יותר. מה ש-ByteDance לא פרסמה הוא גודל מדגם, מתודולוגיה, מספר מתייגים, נתון השהיה במילישניות, שם מבחן מידה או ציון. דוח משני אחד מציין שיפור של 12% בשטף השיחה לעומת המודלים הקודמים של הצוות. זהו כל בסיס הראיות הפומבי.

אז הדירוג הכנה של יכולת האימות הולך כך: לאף אחד מהם אין הרצה עצמאית; של Meta הוא אוסף מדידות עם קווי בסיס מוצהרים ותוצאה שלילית שנחשפה; של ByteDance היא טענת העדפה בודדת שהעיצוב שלה אינו מתואר. אף אחד מהם אינו ניתן לשחזור, אבל רק אחד מהם ספציפי מספיק כדי להתווכח איתו.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

המהלך שכל אחד עשה

שתי המערכות הן תשובות לאותה בעיה, וכדאי לראות ששתי התשובות שונות.

עבור מערכת שצופה, החלק הקשה הוא לדעת מתי לדבר. מודל שמקבל באופן רציף פריימים ממצלמה ושמע צריך להחליט, בלי טריגר חיצוני, אם האדם שלפניו סיים, אם פנו אליו, ואם העצם שנכנס זה עתה לפריים רלוונטי. זו הבעיה ש-SeedRealtime העבירה לתוך המודל, ו-ByteDance ביצעה את המהלך על פני שלוש מודאליות ולא שתיים — גרסה קשה יותר של מה ש-Google, OpenAI ו-NVIDIA כל אחת עשתה עבור שמע בלבד. ההתנהגויות בהדגמה נובעות מכך: לקשור קול לפנים בשיחה קבוצתית, לדבר ללא הנחיה כשמשהו נכנס לפריים, להדריך מישהו במוזיאון או בתיקון.

עבור מערכת שמרנדרת, החלק הקשה הוא להישאר קוהרנטי. יצירת וידאו במקטעים סיבתיים קצרים פירושה שכל מקטע מותנה בקודמו, ואופן הכשל הוא סחיפה — עד הדקה השלישית, הדמות כבר הפכה בשקט למישהו אחר. חלון הזמן המתגלגל של Meta של לטנטים של וידאו אחרונים הוא התשובה לכך, וזרם הטוקנים המשותף הוא התשובה לכשל אחר, המראה המדובב שמתקבל כאשר אודיו נוצר קודם ולאחר מכן מופעל עליו מודל סינכרון שפתיים.

אף אחד משני המהלכים אינו זמין במערכת האחרת. ל-SeedRealtime אין תמונת ייחוס שעליו להישאר נאמן לה, מפני שהוא אינו מרנדר איש. ל-Muse Realtime Avatar אין עולם חיצוני לעקוב אחריו, מפני שכל תפקידו הוא להפיק פנים שמתאימות לקול.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

למה מודל שאי אפשר לקרוא לו הוא עדיין שאלת ניתוב

שתי המערכות הללו מאצילות. Muse Realtime Avatar יושב על גבי Muse Realtime Voice, שמהווה את שכבת השיחה של סוכן שההסקה שלו פועלת על Muse Spark — המודל עושה את הרינדור, לא את החשיבה. העיצוב של SeedRealtime מאפשר לשיחה להימשך בזמן שעבודת רקע מתרחשת, מה שאומר שהעבודה שחורגת ממה שהוא יכול לעשות באופן מוטבע הולכת למקום אחר וחוזרת. בשתי הארכיטקטורות, הדבר שאיתו המשתמש מקיים אינטראקציה הוא חזית, והאינטליגנציה היא מודל טקסט נפרד מאחוריו.

מודל הטקסט הנפרד הזה הוא הסקה רגילה, והוא החלק בסטאק שאפשר למעשה לקנות. ב-OrcaRouter זהו נקודת קצה אחת המכסה 196 מודלים מ-15 ספקים, במחיר המחירון של הספקים כפי שהוא, ללא תוספת רווח, עם מעבר אוטומטי לגיבוי כאשר המודל שבחרתם מחזיר שגיאה או מגיע לפסק זמן. אנחנו לא מארחים את SeedRealtime — הוא של ByteDance, בתוך Doubao, ואין שום דבר לנתב. אנחנו גם לא מארחים את Muse Realtime Avatar, וגם אף אחד אחר לא. מה שאנחנו כן מספקים הוא השכבה ששתי המערכות מעבירות אליה את העבודה הקשה שלהן, וזו השכבה שמשתנה כשאתם רוצים שמודל אחר יעשה את החשיבה.

מה ישנה את התשובה

עבור SeedRealtime, החלק החסר אינו תכונה — הוא הראיות. דוח טכני עם ספירת פרמטרים, סוללת בנצ'מרקים והערכה אנושית מתוארת היה מעביר אותו מ"הדגמה בתוך אפליקציה" למשהו שצוות יוכל להפעיל לגביו שיקול דעת. הפוסט של ByteDance גם מקשר ליעדים גנריים של "נסו את Dola" ו"נסו ב-Playground" בלי להצהיר על משקלים או API מתועד, וזו התבנית של תכונת מוצר ולא של שחרור מודל.

עבור Muse Realtime Avatar, החלק החסר הוא מסחרי: מחירון, נקודת קצה, תאריך, ותנאי האזור והגיל שמטא לא פירטה במלואם. הפוסט של מטא מציין שההדגמות שלה לא כולן משקפות אווטארים הזמינים באפליקציית Muse, וזה המשפט שאמור להנחות כל תוכנית שנבנית סביב זה.

עד שאחד מהדברים האלה ישתנה, להשוואה יש צורה קצרה באופן חריג. שני המודלים הם אודיו-ויזואליים, שניהם דופלקס מלא, שניהם הנדסה מרשימה באמת, ואף אחד מהם לא יכול להיות מופעל מהמסוף על ידי מי שקורא את זה. ההבדל הוא מה הייתם עושים איתם אילו יכולתם: אחד נותן לכם דמות שמדברת, ואחד נותן לכם מערכת ששמה לב.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.