כרטיס כותרת הירו עבור Tavus Griffin, עם כתובית משנה "מודל האינטראקציה האנושית הראשון — הוכרז ב-1 באוקטובר 2026", מעל שלושה צ'יפים שעליהם כתוב "48% חשבו שזה אדם אמיתי", "יצירת VideoFDB: 3.83 לעומת 3.92 של אמת מידה אנושית" ו"השהיית שמע-לווידאו של 0.43 שנ'". בתחתית: "כל הנתונים מדווחים על ידי הספק ועל ידי NVIDIA; Griffin-Lite הוא תצוגה מקדימה מחקרית, ואינו זמין באופן כללי." הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Tavus Griffin: מודל האינטראקציה האנושית הראשון וה-48% שעברו את מבחן טיורינג הווידאו

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

עשרים ושישה מתוך חמישים וארבעה אנשים סיימו שיחת וידאו של דקה ואמרו שהצד השני היה אדם אמיתי. זה המספר ש-Tavus מובילה איתו עבור Tavus Griffinשהוכרז ב-1 באוקטובר 2026, וזו תוצאה מרשימה באמת: באותו פרוטוקול, המערך הקודם של החברה — Phoenix-4.5 שרינדר את הפנים, Raven-1 שביצע את התפיסה, Sparrow-2 שניהל את דינמיקת התורות — הניב אדם אחד שהאמין, מתוך ארבעים ואחד, או 2.4%. שתי הפרשנויות המתבקשות של הזינוק הזה שגויות שתיהן, וההבחנה ביניהן היא עיקר מה שיבוא בהמשך. Griffin אינו מנוע אווטארים טוב יותר, והוא גם לא מוצר שאפשר לקנות. מדובר בתצוגה מקדימה מחקרית בשם Griffin-Lite, הפתוחה בפני קבוצה נבחרת של בודקים מהימנים, ללא תמחור, ללא API ציבורי, וללא רשומה באף לוח דירוג וידאו עצמאי. העובדה ששני הדברים נכונים בו-זמנית היא הסיפור האמיתי.

מה מודד ה-48%, ומה הוא לא מודד

המחקר הוא מבחן טיורינג פנים אל פנים ולא סקר העדפות, וכדאי להציג את הפרוטוקול במדויק כיון שזו הטענה המרכזית. חמישים וארבעה משתתפים גויסו דרך פלטפורמת מחקר עצמאית ונאמר להם שיותאמו עם משתתף אחר לשיחת וידאו בת דקה על מה שהם ציפו לו השנה. השותף שלהם היה PAL שהריץ Griffin-Lite וייצר פנים, קול ותגובות בזמן אמת. רק בסוף הסקר נשאלו אם עלה בדעתם שהשותף אולי אינו אדם אמיתי, ואז נאמר לכל משתתף שזה בינה מלאכותית. הרצת ההשוואה השתמשה באותו פרוטוקול על המערכת הישנה יותר, עם ארבעים ואחד משתתפים.

לנתונים התומכים יש חשיבות לא פחותה מזו של הכותרת. המאמינים היו בטוחים — 79% בממוצע — וכך גם המפקפקים, עם 81%, וזה בדיוק מה שמחקר רוצה: אף אחד לא ניחש. יותר ממחצית המשתתפים אמרו שהאפשרות כלל לא עלתה בדעתם במהלך השיחה, וכמעט כולם בקבוצה הזו המשיכו לומר שהפרטנר היה אמיתי. המשתתפים שכן חשדו נטו לחשוד בתוך עשרים השניות הראשונות. זו השורה הפחות נוחה בדוח, וזו שאמורה לעצב את האופן שבו תקראו את פרק הבטיחות בהמשך.

בסולם של שבע נקודות, המודל קיבל בממוצע 5.4 על היראות טבעי, 5.6 על היראות מהימן, 5.8 על השאלה אם המשתתפים היו נהנים לשוחח איתו שוב — ציון שנשמר על 5.4 אפילו בקרב משתתפים שזיהו אותו נכון כ-AI — ו-5.5 על השאלה אם הם חשו שבן השיח שלהם באמת מקשיב. הציון הנמוך ביותר היה 4.9, על השאלה אם השיחה זרמה באופן טבעי. כשקוראים את הציונים כמכלול, זהו פרופיל ספציפי: Griffin-Lite משכנע מרגע לרגע, אך מעט פחות משכנע כקשת סיפורית.

הבנצ'מרק העצמאי, וכיצד לקרוא את שני המסלולים שלו

מספרי האיכות מגיעים מ-VideoFDB של NVIDIA, בנצ'מרק לשיחה אודיו-ויזואלית בדופלקס מלא, שמנקד מודל בשני מסלולים נפרדים — יצירה, כלומר אם המודל מפיק את ההתנהגות הנכונה, ותפיסה, כלומר אם הוא מבין את הרגע — שלכל אחד מהם מחוון משלו ולוח מובילים משלו. NVIDIA בנתה את הבנצ'מרק, מבצעת את ההערכה עם שופט משלה לפי המדדים המפורסמים, ומנקדת את התגובה בסולם של אפס עד חמש. Tavus לא הריצה אותו, וזו הסיבה לצטט אותו.

• יצירה — Griffin-Lite קיבל ציון 3.83, המערכת הבאה בגובהה מבין המערכות שפורסמו קיבלה 2.80 (Gemini 2.5 עם Anam), והתייחסות אמת־הבסיס האנושית היא 3.92. זה גבוה ב־1.03 מהמערכת הדומה הטובה ביותר ונמוך ב־0.09 מהאנושי.

• תפיסה — 3.73 לעומת רפרנס אנושי של 4.20, עם 3.44 לקו הבסיס החזק ביותר שדווח, MiniCPM-o 4.5 בתצורת אודיו בלבד. Gemini 2.5 Flash Native קיבל ציון 3.17 ו-gpt-realtime של OpenAI קיבל ציון 2.97.

• התאמת שיעור ההשתלטות — 62.8% ביצירה ו-73.8% בתפיסה. זה מודד עד כמה החלטות המודל לגבי מתי לדבר תואמות את התזמון בשיחות הייחוס, ו-Tavus מתארת את שניהם כגבוהים מכל מערכת אחרת בלוח.

שתי הסתייגויות צריכות להיאמר על המספרים האלה לפני שמישהו חוזר עליהם. הפער ביצירה לעומת אדם הוא 0.09 בסולם של חמש נקודות שנשפט על ידי מודל שפה, שעדיף לפרש אותו כ'קרוב לאדם במדד הזה' מאשר כ'ברמה אנושית'. והשוואת התפיסה אינה השוואה שקולה: MiniCPM-o 4.5 ו-gpt-realtime מדורגים בתצורות אודיו בלבד, בעוד Griffin קורא גם וידאו. היתרון של 0.29 נקודות על פני בסיס אודיו בלבד הוא אמיתי, אבל חלק ממה שהוא מודד הוא הערך של היכולת לראות.

שורת הסיכום של הספק עצמו — ראשונה במבחן הבלתי תלוי של NVIDIA לבינה מלאכותית פנים אל פנים, ומקדימה ב-37% את הבינה המלאכותית הטובה הבאה בתגובה ברגע — היא אפיון של אותם נתונים ולא ממצא נפרד. השאר את ציוני המסלולים הבסיסיים, לא את המסגור.

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

שני מנועים, פועלים בו-זמנית

הטענה הארכיטקטונית קלה יותר להערכה מאשר השיווק שסביבה, מפני שהיא טענה בנוגע למה שפועל בו-זמנית. Griffin מתואר כשתי מערכות שפועלות במקביל, ולא כתהליך צינורי עם מסירה בין שלבים.

הראשון הוא מנוע מידול שיח מתמשך. הוא קולט את האודיו והווידאו של האדם ומעריך מחדש את השיחה במרווחים קבועים של שברירי שנייה — Tavus מכנה אותם מיני-תורות — ומחליט בכל אחד מהם אם לשתוק, לאותת, לתת תגובת רקע, או לקחת את התור. הפלט אינו רק המילים אלא סט של בקרות הבעה הנושאות תזמון, עמדה, הבעת פנים ומחווה. מטרת התכנון היא שהחלטה שמתקבלת באמצע משפט באה לידי ביטוי בקול ובפנים באותו מיני-תור במקום לאחר העברת תור, וזה מה שמאפשר למודל לעצור כשקוטעים אותו, להנהן בזמן שהוא מקשיב, ולהתייחס להפסקה למחשבה כמשהו שאינו סוף התור.

השני הוא מנוע יצירה אורקולית שהופך את אותם אמצעי בקרה לקול ולפיקסלים יחד: מחולל דיבור בזרימה ומחולל וידאו בזרימה המונעים על ידי אותם אותות, כך ששינוי בטון ושינוי בהבעה נוחתים באותה פעמה.

הערת כנות אחת לגבי החומר ש-Tavus פרסמה עם זה, משום שקל לטעות ולחשוב שזו מדידה. התרשים האינטראקטיבי של חילופי דברים בני תשע שניות מסומן בטקסט של העמוד עצמו כממחיש, ובאופן מפורש לא נמדד מסשן אמיתי. אותה הסתייגות חלה גם על תרשים התזמון של מבוסס-תורות לעומת דופלקס מלא. מה שכן נמדד הוא נתון ההשהיה בהמשך.

בתוך סטאק הסטרימינג

צד השמע בנוי סביב קודק בשם Tavec, אוטואנקודר קונבולוציוני הממפה אודיו ב-48 kHz לייצוג חבוי רציף של 40 ערכים לכל פריים בקצב של 100 פריימים לשנייה, ללא ספרי קוד. המפענח שלו הוא סיבתי לחלוטין, ולכן הוא נושא מצב בין מקטעים ופולט מנות אודיו קטנות עד 10 מ״ש ללא הצצה קדימה. דקה של דיבור היא 6,000 פריימים חבויים ולא 2.88 מיליון דגימות גולמיות, וזה מה שהופך את הרצף לזול מספיק כדי שטרנספורמר הדיבור יחזה אותו מהר יותר מאשר בזמן אמת. מחולל הדיבור עצמו הוא טרנספורמר דיפוזיה אוטורגרסיבי המותנה בתחילית דובר מקודדת — ניתן לשכפל קול מכ-עשר שניות של אודיו — ומייצר מקטע חבוי אחד בכל פעם עם הגעתם של פקדים, כך שההשמעה מתחילה לפני שהאמירה מסתיימת.

צד הווידאו מתחיל מאותה הנחה: דחיסה טמפורלית חזקה היא מה שהופך מודל דיפוזיה למהיר מספיק כדי לקיים שיחה. מחולל אוטורגרסיבי עם מספר צעדים מועט מקבל תמונת ייחוס, את האודיו הזורם ואת הבקרות הזורמות, ומייצר לטנט אחד בכל צעד בשלושה צעדי דיפוזיה לכל לטנט. VAE דוחס את הזמן פי שמונה, כך שב-25 פריימים לשנייה לטנט אחד הוא שמונה פריימים, או 320 מ"ש של וידאו 720p. לטנטים ישנים יותר נשמרים ברזולוציה הולכת ופוחתת כדי שרולאאוטים ארוכים יישארו ברי השגה. התוצאה היא מחולל שפולט 720p בקטעים של 320 מ"ש בזמן אמת.

ההגעה לשם חייבה זיקוק תלת-שלבי ממורה דיפוזיה דו-כיווני רב-שלבי גדול: זיקוק התאמת התפלגות לתלמיד של מספר צעדים, כפיית מורה כדי להמיר את התלמיד למודל אוטורגרסיבי שמייצר לטנט אחד בכל פעם, ולבסוף אימון עם כפייה עצמית על ההיסטוריה שהמודל עצמו יצר בתוספת מנגנון נוסף שפועל על פריימי ההיסטוריה כך שרולאאוטים ארוכים לא ייסחפו. השלב השלישי הוא זה שמטפל במצב הכשל שסוג זה של מודל נוטה לחוות — פנים שמתדרדרות, או רקע שנודד לאט, לאורך שיחה שנמשכת דקות.

מספר השיהוי, שהוא הטענה האמיתית לגבי המוצר

לעומת ארבעה מודלי דיפוזיה סטרימינג שפורסמו בהגדרת אודיו-לווידאו, שבה כל מודל מקבל דיבור ותמונת ייחוס ועליו להפיק את הפנים המדברות, המחולל של Griffin-Lite השיג בממוצע 0.43 שניות של השהיית אודיו-לווידאו אמיתית על H100s — הזמן מרגע הגעת קטע אודיו ועד שהסרטון מציג את השפעתו. Tavus מתארת זאת כמחצית מהשיטה הבאה המהירה ביותר. היא גם מדווחת על מקום ראשון באיכות תפיסתית של DOVER ו-FID ועל THEval, מסגרת הערכה לראש מדבר, ומקום שני בביטחון סנכרון שפתיים LSE-C עם 7.27, מאחורי קו בסיס אחד — כשהספק מציין ש-LSE-C מתגמל תנועת פה מובהקת, כולל תנועה מעבר לנקודה שבה זה נראה טבעי.

כל אלה הם מדידות של Tavus עצמה כנגד basit it. הן שימושיות משום שהן שימושיות משום שנתון ה-0.0? הן לא, והציונים העצמאיים היחידים למעלה הם מסלולי ה-VideoFDB.

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

למה אין מחיר להשוואה

Griffin-Lite זמין היום לקבוצה נבחרת של בודקים מוקדמים כתצוגה מקדימה מחקרית, כאשר שחרור רחב יותר של מודל בעל יכולות גבוהות יותר יבוא בהמשך. הוא לא יהיה זמין לשימוש לקוחות בשלב זה. הגישה היא באמצעות טופס בקשה. הוא אינו נמצא בפלטפורמה של Tavus, והשורה המסכמת של החברה עצמה בהודעה אומרת זאת בפשטות: Griffin אינו נמצא בפלטפורמה של Tavus עדיין, והוא יגיע לאחר ש-Tavus תמצא דרך לשחרר אותו בבטחה. כל מה שקונה היה משווה בדרך כלל — תמחור לפי שנייה או לפי בקשה, מזהה מודל, מגבלות קצב, SLA, רשימת אזורים — אינו קיים עדיין. Tavus מפנה כל מי שרוצה לבנות היום אל המודלים שבהם כבר משתמשים 150,000 מפתחים ועסקים, שהם שלושת קודמיו, ולא Griffin.

זה אינו פרט טכני שראוי להזכיר רק בהערת שוליים. זה משנה למה מיועד המודל הזה כרגע. זהו יעד הערכה עבור צוותים שהמוצר שלהם תלוי בשאלה אם אדם מסוגל להבחין, ואות לגבי לאן מועדת מפת הדרכים של הספק. זה לא משהו שעליו בונים מסלול מול לקוחות ברבעון הזה.

שער הבטיחות הוא תוכנית השחרור

הדבר המעניין ביותר ש-Tavus כתבה על Griffin אינו נוגע למודל. זוהי ההודאה שאותן תכונות שהופכות מודל לאינטראקציה אנושית לממשק טוב יותר הופכות אותו גם לטוב יותר בהטעיית מישהו ובגרימתו להאמין שהוא אינו בינה מלאכותית, שנדרשת עבודת יישור ובטיחות נוספת לפני שחרור בטוח, ושהחברה עובדת על תכונות גילוי ועם ארגונים על הערכות בטיחות בינה מלאכותית. בהתחשב בכך שכמעט מחצית ממדגם חי לא הצליחו להבחין, ושאלה שכן הצליחו, רובם הבינו זאת בתוך עשרים שניות, מנגנון גילוי שעומד בשיחה אגבית אינו בגדר מותרות.

שני דברים ישנו את המאמר הזה מהותית. כרטיס מודל מפורסם עם נקודת קצה ומחיר יזיז את Griffin מתוצאת מחקר לשאלת רכש. ורשומה בלוח דירוג וידאו עצמאי — עם הסתייגות שלוחות כאלה מדרגים קליפים קצרים לפי העדפה בזוגות ואינם בנויים לדרג שיחה חיה, כך שאי-ההתאמה עשויה להיות קבועה ולא זמנית — תעניק לטענות ההשהיה והאיכות בדיקה חיצונית. עד שאחד מאלה ינחת, מסלולי VideoFDB הם הראיות החזקות ביותר הזמינות והם מגיעים עם פער אנושי של 0.09 ו-0.47 נקודות בהתאמה.

הטיעון הנגדי שראוי לשקול הוא שהרצת בנצ'מרק אינה פריסה. הפרוטוקול של NVIDIA נותן לכל מערכת את אותה משימת חילופי תורות ואותו שופט; הוא לא אומר דבר על איך מתנהגת השעה התשיעית של שיחה, מה קורה כששני אנשים מדברים זה על זה במשך דקה שלמה, או אם הפקדים האקספרסיביים מתדרדרים על פנים שתמונת הייחוס רנדרה בצורה גרועה. Tavus מדווחת על האימון הספציפי לדריפט — שלב הכפייה העצמית ומנגנון ההיסטוריה — כתיקון בדיוק לכך, ודיווחים הם כל מה שיש לקורא עד שמישהו מחוץ ל-Tavus יריץ סשן ארוך ויפרסם אותו. התייחס לבנצ'מרק כראיה הזמינה הטובה ביותר ולא כתוצאת פריסה.

מה לבנות סביבו בינתיים

השאלה המעשית עבור צוות שרוצה משהו כזה היום היא אילו חלקים מהמחסנית כבר ניתנים לרכישה. ממשק וידאו שיחתי הוא שרשרת — זיהוי דיבור, מודל שפה, סינתזת דיבור, ובמקרה של Tavus גם מודל רינדור — ושלושת הראשונים הם מצרך. הם יושבים מאחורי נקודת קצה אחת תואמת OpenAI ב-OrcaRouter עם יותר מ-200 מודלים באותו מפתח, וכן מחיר המחירון של הספק מועבר הלאה בתוספת מחיר של 0%, כך שהורדת מחיר של ספק נכנסת לתוקף כאן באותו יום ולא אחרי מחזור חוזה. אם אתם מרכיבים צינור אינטראקציה ורוצים להשאיר את שכבת היצירה פתוחה עד ש-Griffin או משהו דומה לו יהפוך למוצר ממשי, שם ההחלפה דורשת שינוי קונפיגורציה במקום מיגרציה. Tavus Griffin עצמו אינו מודל מנותב כאן, והוא גם לא יהיה כל עוד הוא תצוגה מקדימה מאחורי טופס בקשה.

הדבר ששווה לצפות בו הוא לא עוד סרטון הדגמה. אלא האם כלי הגילוי ש-Tavus מפתח יפורסם, והאם קבוצת מחקר שנייה משחזרת את פרוטוקול הפנים-אל-פנים. מעבר כה גדול במבחן טיורינג הוא בדיוק סוג התוצאה שדורש מעבדה שנייה כדי להריץ אותו.

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.