
Tavus Griffin מול Muse Realtime Avatar: שני פרצופים של 2026, שתי בעיות שונות
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 223 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
גם Tavus Griffin וגם Muse Realtime Avatar קיימים כדי לפתור את אותה בעיה מביכה — מודל שפה שיכול לדבר אבל אין לו פנים — והם תוקפים אותה משני קצוות מנוגדים. Griffin הוא מודל אינטראקציה אנושית (Human Interaction Model) מסוג וידאו-לווידאו שצופה במשתתף דרך מצלמה ומייצר את הצד השני של השיחה בזמן אמת, והוא הוכרז על ידי Tavus באוקטובר 2026 כתצוגה מקדימה למחקר עבור בודקים נבחרים. Muse Realtime Avatar הוא שכבת ההתגלמות של Meta עבור סוכן ה-Muse שלה, שהוכרז ב-Meta Connect ב-23 בספטמבר 2026, והוא לוקח אודיו והופך אותו לפורטרט מדבר מסונכרן. את אף אחד מהם לא ניתן לקנות. ההבדל הוא במה שכל אחד מהם מנסה לעשות נכון, והוא מתגלה ברגע שאתה שואל מה כל מודל באמת מקבל כקלט.
הגרסה הקצרה
• הקלט של Griffin הוא האדם בצד השני — וידאו ואודיו של משתתף חי, שעליו לקרוא אותם, להגיב להם ולהיות מופרע על ידם.
• הקלט של Muse Realtime Avatar הוא הדיבור של הסוכן עצמו — זרם של טוקנים מ-Muse Realtime Voice שהוא ממיר לפרצוף תואם.
• Tavus מודדת את Griffin לפי האם אנשים מאמינים בו, ומפרסמת נתון של 48% משיחת וידאו בת דקה.
• מטא מודדת את Muse Realtime Avatar לפי יכולתו לעמוד בקצב, ומפרסמת 870 מילישניות מסיום התור ועד הבייט הראשון.
• לאף אחד מהם אין API ציבורי, מחיר מפורסם, או תאריך זמינות כללי.
קראו את ארבע השורות האלה יחד, וצורת המחלוקת ברורה. Tavus עושה אופטימיזציה עבור האמונה של האדם האחר. Meta עושה אופטימיזציה עבור השעון.

Griffin: המודל שחייבים להאמין בו
התפיסה של Tavus היא ש-Griffin הוא ה-Human Interaction Model הראשון, והארכיטקטורה שמאחורי הטענה היא מערכת דו-חלקית המשלבת Continuous Conversational Modeling עם Audio-Visual Generation. החלק הראשון הוא התנהגותי: הוא מחליט מה הפרסונה צריכה לעשות מרגע לרגע, בהתבסס על מה שהיא יכולה לראות ולשמוע. החלק השני הוא רינדור, ו-Tavus מפצלת אותו שוב ליצירת דיבור בזרימה וליצירת וידאו בזרימה.
המספרים ש-Tavus מציגה בראש אינם מספרי תפוקה. במחקר שהחברה ערכה עם Queen Mary University of London, 26 מתוך 54 משתתפים — 48% — האמינו ש-Griffin הוא אדם אמיתי לאחר שיחת וידאו בת דקה, לעומת 1 מתוך 41 (2.4%) עבור המערך הקודם שלה: Phoenix-4.5 ליצירת פנים, Sparrow-2 לניהול תורות ו-Raven-1 לראייה. משתתפים שלא הוטעו בדרך כלל פקפקו כבר ב-20 השניות הראשונות. במדד VideoFDB של NVIDIA, שנמדד בספטמבר 2026, Tavus מדווחת כי Griffin ראשון ב-AI פנים אל פנים, עם ציון יצירה של 3.83 לעומת 2.80, קו הבסיס החזק ביותר שדווח, ו-3.92, ייחוס אנושי, וציון תפיסה של 3.73 לעומת 3.44 עבור קו הבסיס הטוב ביותר שדווח ו-4.20, ייחוס אנושי. הנתונים הללו מדווחים על ידי הספק וספציפיים למדד, אבל נקודות ההשוואה האנושיות הן המעניינות.
ההנדסה שמאחורי הנתונים האלה היא קודק שנקרא Tavec וטרנספורמר דיפוזיה אוטורגרסיבי. Tavec פועל בתדר 48 קילו-הרץ עם 40 ערכים לפריים בקצב של 100 פריימים לשנייה, ללא ספרי קוד, מפענח סיבתי לחלוטין וחבילות קטנות עד 10 אלפיות השנייה — מתוכנן כך שפנים יוכלו להתחיל לזוז לפני שמשפט מסתיים. מסלול הווידאו דוחף 720p בקטעים של 320 אלפיות השנייה, כאשר לטנט אחד שווה לשמונה פריימים ב-25 fps, שלושה צעדי דיפוזיה לכל לטנט ודחיסה זמנית של פי 8 ב-VAE. תהליך זיקוק תלת-שלבי (התאמת התפלגות, לאחר מכן אוטורגרסיבי עם כפיית מורה, ולאחר מכן כפייה עצמית) הוא מה שמאפשר לו להריץ את שלושת הצעדים האלה בזמן אמת בכלל. טענת השיהוי העיקרית היא ממוצע של 0.43 שניות משמע לווידאו על H100s, שלדברי Tavus הוא כמחצית מהשיטה המהירה הבאה שהוא מדד. שכפול קול לוקח בערך דגימה של 10 שניות.
המחיר של כל זה הוא ש-Tavus לא יכולה להשיק אותו. Griffin-Lite, תצוגת המחקר, זמין רק לקבוצה נבחרת של בודקים מוקדמים; בכתיבה על ההשקה, החברה מציינת בבירור ש-Griffin-Lite לא יהיה זמין לשימוש לקוחות בשלב זה, ושהיא מצפה להשיק את Griffin בקרוב מאוד לאחר שיטופלו חששות בטיחותיים מסוימים. Griffin אינו נמצא בפלטפורמה של Tavus, והוא יגיע לשם "ברגע שנבין איך לשחרר אותו בבטחה". מודל שמשכנע 48% מהזמן בשיחה של דקה הוא, מנקודת מבט של פריסה, מודל שמשכנע 48% מהזמן בשיחה של דקה.

Muse Realtime Avatar: המודל שצריך לעמוד בקצב
Muse Realtime Avatar הוכרז ב-23 בספטמבר 2026 ב-Meta Connect ונכתב עליו באותו יום על ידי Meta Superintelligence Labs תחת הכותרת "להביא את ה-Muse שלך לחיים". המסגור של Meta צר יותר ויותר מכני מזה של Tavus: לסוכן Muse כבר היה קול, באדיבות Muse Realtime Voice, והאווטאר הוא השכבה שמעניקה לקול הזה גוף.
הנתון המפורסם הוא 870 מילישניות מסוף התור ועד לבייט הראשון — כלומר, מהרגע שבו המשתמש מפסיק לדבר ועד לרגע שבו הבייט הראשון של הווידאו של האווטאר מוכן. האווטאר מרנדר דיוקן בגודל 448×768 בקצב של 25 פריימים לשנייה. Meta אומרת שהמערכת מבצעת בערך פי 60 פחות הערכות לכל מקטע מאשר קו הבסיס שלה, ושה-NVIDIA GB200 בודד יכול לשאת 12 הפעלות בזמן אמת במקביל, עם שיפור קיבולת של פי 8 לעומת מימוש BF16 דו-שלבי.
ההבדל הארכיטקטוני מ-Griffin טמון במקור המידע. Muse Realtime Avatar מרחיב את Muse Realtime Voice ומשתף את זרם טוקני הדיבור שלו — אותו ייצוג VQ שמודל הקול מפיק הוא זה שמניע את הפנים, במקום הבנה חזותית נפרדת של המשתתף. זה הופך אותו לרובד התגלמות DiT מונע-אודיו: יעיל, מצומד היטב למודל הקול שלו עצמו, ואינו מנסה כלל לקרוא את האדם בצד השני של השיחה. מדובר בפה ופנים עבור סוכן, ולא בשותף שיחה שצופה בך.
Meta לא פרסמה API, לא מחיר ולא תאריך יציאה עבור Muse Realtime Avatar. פוסט המחקר הוא כל הרשומה הציבורית.
היכן ששני העיצובים באמת נבדלים
הדרך הברורה ביותר לראות את הפיצול היא לשאול מה קורה כשהמשתמש מפריע.
גריפין הוא דופלקס מלא ותוכנן לכך שמפריעים לו באמצע אמירה — הוא יכול לצפות ולהקשיב בזמן שהוא מדבר, וזו הסיבה שהשיווק של Tavus נשען על הרעיון שגריפין לומד התנהגות שיחתית ולא וידאו. זו גם הסיבה שמערך הבנצ'מרקים שלו בנוי סביב תפיסה ותגובה, וזו הסיבה שהפער של 37% מול המערכת השנייה בטיבה בתגובה ברגע נתון הוא טענה שהחברה טורחת להציג.
המספר של Muse Realtime Avatar לסוף תור — 870 מילישניות — מספר לך את הסיפור ההפוך: זהו פייפליין שבו התור מסתיים, טוקני האודיו נפתרים, ואז הפנים מדביקות פער. זה מהיר — 870 מ״ש הוא נתון טוב לרנדרר פורטרטים — אבל המדידה עצמה מניחה שקיים גבול תור, וזו בדיוק ההנחה שמודל דופלקס נבנה כדי להשליך.
זו אינה ביקורת על אף אחד מהעיצובים. מטא בונה פרצוף לסוכן שחי בתוך משטחי העוזר של מטא עצמה, שבהם גבול תור נקי הוא מודל סביר של האינטראקציה. Tavus בונה משהו שצריך לשרוד את הרגע שבו זר מחליט, בתוך עשרים שניות, אם האדם שעל המסך אמיתי.
אף אחד מהשניים לא נמצא במחירון — ורק חלק אחד מ-Muse ניתן לקריאה
נכון להיום, לא ניתן להעלות לפרודקשן לא את Tavus Griffin ולא את Muse Realtime Avatar. Griffin מוגבל לבודקים נבחרים; ל-Muse Realtime Avatar אין API, אין מחיר ואין תאריך. אם אתם מתכננים בילד, שתי העובדות האלה צריכות להיכלל בתוכנית.
מה שראוי לציון הוא החלק של מחסנית Muse שהוא נגיש. משפחת Muse של מטא כוללת את Muse Spark, ואחד הצ'קפוינטים שלה — meta/muse-spark-1.2 — זמין בקטלוג שלנו במחיר 1.25 דולר למיליון טוקני קלט ו-4.25 דולר למיליון טוקני פלט עם אפס תוספת מחיר על מחיר המחירון של מטא. הוא אינו האווטאר: הוא מקבל קלט של טקסט, תמונה, וידאו, אודיו ו-PDF ומחזיר טקסט, עם חלון הקשר של מיליון טוקנים ורמת חשיבה ניתנת להגדרה. אבל זה החלק של קו Muse שאפשר למעשה לפנות אליו, ואם אתם בונים את הסוכן שיום אחד יעמוד מאחורי אווטאר, חצי השפה הוא החצי שאפשר להתחיל ממנו. OrcaRouter מעביר את מחירי המחירון של הספקים הלאה ב-0% תוספת, כך ששינוי מחיר של מטא משתקף בכרטיס שלנו באותו יום ולא במחזור החיוב הבא, ובקשה שנכשלת אצל ספק אחד נשלחת שוב לספק בריא במקום להופיע כפסק זמן.

אותו היגיון חל על צד הווידאו של העולם. אנחנו לא מנתבים את Muse Realtime Avatar ואנחנו לא מנתבים את Tavus Griffin, ולא נטען אחרת. מה שכן אנחנו מנתבים הוא קטלוג של למעלה ממאתיים מודליםעל פני אותן מודאליות, כך שאב-טיפוס שמחליף בין סוכן טקסט, מודל קולי ומחולל וידאו נשאר על מפתח אחד בעוד שני המודלים במאמר זה עדיין לא שוחררו.
איזה אחד רחוק יותר ממשלוח?
לפי המידע הפומבי, Muse Realtime Avatar רחוק יותר. יש לו פוסט מחקרי ואין API, אין מחיר ואין תאריך. ל-Griffin גם אין API ואין מחיר, אבל יש לו כוונת שחרור מפורשת — "מהר מאוד לאחר שהחששות הבטיחותיות האלה יטופלו" — מסלול תצוגה מקדימה בעל שם שקיים היום עבור בודקים נבחרים, ומקבץ תוצאות בנצ'מרק מפורסמות מרתמת בדיקות עצמאית. זהו מצב מתקדם יותר, אף על פי שהוא מגיע עם הודאה שהמודל אינו בטוח מספיק כדי למסור אותו ללקוחות.
המלכודת בהשוואה ביניהם היא להתייחס לנתון של 870 מילישניות כאל בר־השוואה ישירות לנתון של 0.43 שניות. הם מודדים דברים שונים: מטא מודדת מסוף תור ועד לבית הראשון של פורטרט, וטאווס מודדת השהיה מאודיו לווידאו בתוך זרם דופלקס רציף שבו תורים אינם אירועים נקיים. שני המספרים אמיתיים, אך הם אינם אותה מדידה, וכל מי שמציג אותם בעמודה אחת עושה לקורא עוול.
שורה תחתונה
Muse Realtime Avatar היא שכבת התגלמות: אודיו נכנס, פורטרט יוצא, 870 אלפיות שנייה מסוף התור ועד הבית הראשון, 448×768 ב-25 fps, בלי API ובלי תאריך. Tavus Griffin הוא מודל אינטראקציה אנושית דופלקס: המשתתף נכנס, פנים מגיבות יוצאות, 0.43 שניות השהיית אודיו-לווידאו ממוצעת על H100s, וספק שמוכן לפרסם ש-48% מהאנשים חשבו שזה אנושי, בעוד שהוא גם מצהיר שלקוחות לא יכולים להשתמש בזה. Meta בונה משהו שמדביק את הקצב. Tavus בונה משהו שעובר. אף אחד מהם לא ניתן לקנייה, מה שאומר שההחלטה היחידה הזמינה היום היא באיזה חצי של הבעיה להתחיל — ועבור רוב הצוותים, החצי הזה הוא מודל השפה שמתחת.
