
Muse Realtime Avatar מול Realtime-Venus: יציאת וידאו מול כניסת וידאו
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 180 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
שתי מערכות שהוכרזו בהפרש של תשעה ימים מכנות את עצמן בזמן אמת ושתיהן טוענות לתווית האורקולית, והן מצביעות בכיוונים מנוגדים לאורך אותו ציר.Muse Realtime Avatar, שהוכרזה על ידי Meta ב-23 בספטמבר 2026, לוקחת תצלום ומייצרתוידאו שלו מדבר — הווידאו שלה הוא פלט, פריימים בפורמט דיוקן בגודל 448×768 בקצב של 25 לשנייה, שנוצרים על ידי Diffusion Transformer מונחה אודיו שחולק זרם טוקנים עם Muse Realtime Voice.Realtime-Venus, שהועלתה ל-arXiv ב-12 בספטמבר 2026 על ידי צוות Venus ב-Ant Group עם אוניברסיטת צינגהואה,צורכתווידאו: נקודת הבדיקה Realtime-Venus-Omni מזרימה פריימים מהמצלמה דרך מקודד SigLIP2 ומדברת על מה שהיא רואה, בעוד שנקודת הבדיקה Realtime-Venus-Audio היא אותו עמוד שדרה עם ראייה מכובת בזמן הטעינה. האחת מרנדרת פנים. האחרת צופה באחת. אף אחת מהן אינה ניתנת לקריאה, ורק אחת מהן ניתנת להורדה — וזה מתברר כהבדל המשמעותי יותר.
ראוי לומר את היפוך הזמינות הזה בפשטות לפני כל דבר אחר, משום שהוא מנוגד לכל ציפייה לגבי מוצר של Meta ופרסום של מעבדת מחקר. המערכת של Meta סגורה: הוכרזה ב-Connect, הודגמה בפוסט מחקר, שולבה בסוכן Muse, ללא API, ללא משקלים, ללא מחיר וללא תאריך. המערכת של Ant Group פתוחה: שני צ'קפוינטים בגודל 9B כ-BF16 safetensors תחת Apache-2.0 בכתובת inclusionAI/Realtime-Venus ב-Hugging Face, עם קוד Transformers מותאם אישית, קובץ דרישות, קול ייחוס, דף פרויקט ומאגר GitHub נלווה. החברה שמאחורי המוצר הצרכני לא סיפקה דבר שאפשר להחזיק ביד. צוות המחקר סיפק את הכול.
מה כל אחד עושה עם פריים
כיוון הווידאו הוא ההבדל הארכיטקטוני כולו, וזה לא עניין של הדגשה.
• וידאו — Muse Realtime Avatar מייצר אותו, בהתניה על אסימוני דיבור, תמונת ייחוס וחלון מתגלגל של לטנטים של וידאו אחרונים; Realtime-Venus-Omni קולט אותו, עם מקודד חזותי SigLIP2 שמזרים פריימים אל המודל לצד אודיו.
• אודיו — Muse Realtime Avatar מניע יצירה מאסימוני הדיבור של Muse Realtime Voice, הנושאים יחד תוכן ופרוזודיה; Realtime-Venus מייצר דיבור כאסימוני S3 בדידים שמפוענחים על ידי מפענח flow-matching זורם, במקום להלחים מודל טקסט-לדיבור נפרד בסוף.
• עמוד שדרה — הארכיטקטורה של Meta היא טרנספורמר דיפוזיה מונחה אודיו בגודל לא ידוע; Realtime-Venus בנויה על עמוד שדרה לשוני Qwen3-8B עם מקודד אודיו Whisper-Medium, וכרטיס המודל שלה מציין שצ'קפוינט Omni הותאם מ-MiniCPM-o 4.5.
• משקלים — האווטארים של Muse Realtime אינם מפורסמים ואין אינדיקציה שהם יהיו; Realtime-Venus מספקת שני צ'קפוינטים של 9B, BF16, חלון הקשר של 40,960 טוקנים בשניהם, תחת Apache-2.0.
• גישה — ל-Muse Realtime Avatar אין API ואין תאריך; גם ל-Realtime-Venus אין API, והכרטיס של Realtime-Venus מציין בפשטות שהוא לא נפרס על ידי שום ספק הסקה.
• היכן זה פועל — Muse Realtime Avatar פועל בתוך אפליקציית Muse עבור משתמשים ש-Meta לא מנתה, בתנאי 18+; Realtime-Venus פועל על כרטיסי ה-GPU שלך, היום, אם יש לך את החומרה והתיאבון.
קרא את שתי השורות האחרונות יחד וההבדל המעשי מופיע. לא ניתן לקרוא לאף אחת מהמערכות. את אחת מהן ניתן להריץ.
ההורדה של 9B אמיתית, וכך גם מה שהיא עולה לך
Realtime-Venus אינו שלד מאגר. המשקלים נמצאים שם, קוד הטעינה המותאם אישית נמצא שם, והרישיון ברמה העליונה הוא Apache-2.0. שני דברים לגביו כדאי לדעת לפני שאתם מתכננים סביבו.
הדבר הראשון הוא מה שלא נמצא במשקולות. זמן הריצה הדו-לולאי שהופך את הארכיטקטורה למיוחדת — לולאת האינטראקציה של שנייה אחת בתוספת מתזמן רקע שהמאמר מכנה Realtime-Venus-Harness, אשר מבצע משימות שהואצלו כנגד תמונת מצב מבודדת של מצב השיחה, כך שמשימה ארוכת טווח לא תוכל להיפגע מכך שהשיחה ממשיכה הלאה — נמצא במאגר GitHub כרכיב נפרד. עיצוב ההאצלה, שהוא הרעיון החדש באמת בדוח, הוא החלק שאתם מרכיבים ובוטחים בו בעצמכם.
השני הוא הייחוס. הכרטיס מציין שה-checkpoint של Omni מותאם מ-MiniCPM-o 4.5, המודל האומני-מודאלי 9B ש-OpenBMB פרסמה בקוד פתוח מוקדם יותר ב-2026. זו לא הערת שוליים. המשמעות היא שהתרומה של Ant Group היא ה-post-training, ה-runtime ותכנון ההאצלה שנבנו בשכבות על גבי עמוד שדרה זורם של מישהו אחר — טענה צרה וספציפית יותר מ"מודל אומני חדש של 9B", וגם שימושית יותר, כי היא אומרת לך היכן להסתכל אם משהו במקודד החזותי מתנהג שלא כשורה.
המספרים, ובדיוק של מי הם
כאן שתי המערכות מתכנסות באופן לא מועיל: לאף אחת מהן אין ולו הערכה עצמאית אחת. ארבעת הנתונים של Meta מדווחים על ידי החברה ביחס לקווי בסיס ש-Meta בחרה. הנתונים של Realtime-Venus מדווחים על ידי המחברים בדוח טכני, בלי שצד שלישי פרסם הרצה ובלי רשומת לוח מובילים שכנגדה אפשר לבדוק. אין מדידה ציבורית של אף אחת מהמערכות על ידי מי שלא בנה אותה.
ארבעת הנתונים של Meta, כפי שפורסמו: 870 מ"ש מסוף התור שלך עד הבייט הראשון של תגובת קול ווידאו מסונכרנת; וידאו פורטרט 448×768 ב-25 פריימים לשנייה; פי 60 פחות הערכות מודל מאשר קו הבסיס שלה; ו-12 סשנים בזמן אמת במקביל על NVIDIA GB200 אחד, שיפור קיבולת של פי 8 לעומת קו הבסיס הדו-שלבי BF16 של Meta. Meta גם חושפת תוצאות העדפה מול שתי מערכות אווטאר מסחריות, שאחת מהן היא מדווחת כלא ניתנת להבחנה סטטיסטית משוויון בכל הנוגע למנייריזם — חשיפה הראויה לקרדיט, שכן זהו סוג התוצאה שרוב פוסטי ההשקה משמיטים.
של Ant Group, כפי שפורסם: הציון הטוב ביותר בשישה מתוך שמונת מדדי הווידאו שבהם משתמש הדוח, כולל StreamingBench 70.2, OVO-Bench 64.7 ו-Daily-Omni 81.3 עבור הצ'קפוינט Omni; ועבור הצ'קפוינט Audio, MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 וציון VoiceBench AlpacaEval של 4.81 שהדוח מתאר כמתאים לנתון ההשוואה הטוב ביותר.
כדאי לציין אי-סימטריה אחת בראיות. הנתונים של Ant Group הם ציוני בנצ'מרק עם מערכי בדיקה בעלי שמות — ניתנים לשחזור באופן עקרוני, בידי כל מי שמוכן להוריד את המשקלים ולהריץ את חבילת הבדיקות. הנתון המרכזי של Meta הוא מדידת השהיה במחסנית ההגשה של Meta עצמה, שאיש מחוץ ל-Meta לא יכול לשחזר, משום שלאף אחד מחוץ ל-Meta אין את המערכת. השחרור הפתוח, במילים אחרות, הוא גם זה שקל יותר לבדוק.


למה שני אלה הם בעצם בעיית ניתוב
אף אחת מהמערכות אינה סוכן שלם, וזה נכון באותו אופן לשתיהן. Muse Realtime Avatar היא שכבת רינדור המוברגת על Muse Realtime Voice, שהיא השכבה השיחתית של סוכן שהחשיבה שלו פועלת על Muse Spark. Realtime-Venus מאצילה כל דבר שמעבר למה שהיא יכולה לעשות באופן מוטבע — אחזור, קריאות לכלים, חשיבה מורכבת — אל רתמה שמבצעת את העבודה ברקע כנגד תמונת מצב של השיחה. בשתי התצורות, הדבר שאליו המשתמש מדבר הוא ממשק קדמי, והחשיבה מתרחשת במודל טקסט נפרד.
מודל הטקסט הנפרד הזה הוא החלק שאפשר לנתב. ב-OrcaRouter זו נקודת קצה אחת עבור 196 מודלים מ-15 ספקים, במחיר המחירון של הספק כפי שהוא, עם אפס תוספת, עם מעבר אוטומטי לגיבוי כאשר מודל נכשל או מגיע לפסק זמן — מה שחשוב יותר מהרגיל כשהדבר שבצד השני הוא צ'ק-פוינט בהתארחות עצמית שאיש לא העריך אותו באופן בלתי תלוי. איננו מארחים את Realtime-Venus: זהו קובץ להורדה, ואיננו מגישים אותו. איננו מארחים גם את Muse Realtime Avatar, כי אף אחד לא עושה זאת. מה שאנחנו מספקים הוא השכבה ששתי הארכיטקטורות מפקידות בידיה את העבודה הקשה שלהן, כך שרכיב לא מוכח באחד משני צידי השיחה הוא שורת קונפיגורציה אחת ולא הימור פרודקשן.
איזה מאלה למעשה נמצא בשלב מתקדם יותר?
האינסטינקט הוא לומר שזה של מטא, מפני שלמטא יש את המוצר ואת סרטון ההדגמה. הראיות אומרות משהו מעניין יותר. למערכת של מטא יש הנדסת ייצור טובה יותר — 12 סשנים במקביל על GB200 הוא הישג של שירות (serving), ומבחני ההעדפה שנחשפו מול מוצרי אווטאר שנמצאים בשוק הם המספרים היחידים של השוואה ראש בראש שיש לאחת משתי המערכות. למערכת של Ant Group יש יכולת אימות טובה יותר: בנצ'מרקים בשמות מפורשים, משקולות (weights) מפורסמות, רישיון Apache-2.0, ודוח שכל אחד יכול לנסות לשחזר.
מה שאין לשניהם הוא דרך לשלם על זה. וזה שקרוב יותר להיות שמיש אינו זה עם אפליקציית הצרכן — זה זה שאפשר להוריד הלילה ולגלות בעצמך, על החומרה שלך, עם הנתונים שלך, ובלי צורך בהכרזה.
אם אתה בוחר, השאלה היא לא איזה דגם טוב יותר. היא אם אתה רוצה פרצוף שאינך יכול להתקשר אליו או מצלמה שאתה יכול להפעיל.

