
Tavus Griffin נגד Alibaba Wan 2.7: מודל שיחתי מול מודל גנרטיבי
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 223 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הדרך המפתה להשוות Tavus Griffin ו-Alibaba Wan 2.7 היא לפי שנייה של וידאו, והשוואה כזו אינה אפשרית. ל-Wan 2.7 יש מחירון מפורסם — $9.00 לדקה ב-1080p בנקודות הקצה הבין-לאומיות של Alibaba Cloud בסינגפור, עם מדרגה זולה יותר בבייג'ינג ובטוקיו — ול-Tavus Griffin אין מחירון כלל, כי Griffin-Lite שוחרר ב-1 באוקטובר 2026 כתצוגת מחקר עבור בודקים נבחרים ומהימנים מאחורי טופס בקשה. מה ששניהם כן חולקים הוא מילה: וידאו. מעבר לכך, הם תשובות לשאלות שונות. אחד נשאל מה צריך לקרות לאחר מכן בשיחה; האחר נשאל איך נראית סצנה מתוארת. ההשוואה המעניינת היא לא איכות, אלא מה כל אחד מהם צריך ממך לפני שהוא יפיק משהו, ומה אתה מקבל בחזרה.
ההבדל הוא בלולאה, לא ברזולוציה
Wan 2.7 מייצר קליפ אחר קליפ מתוך פרומפט. אתה כותב תיאור, מקבל קטע וידאו, מסתכל עליו, וכותב עוד אחד. Wan 2.7 היא חבילה של ארבעה מודלים — טקסט לווידאו, תמונה לווידאו, רפרנס לווידאו ועריכת וידאו — והאינטראקציה היא ביסודה טרנזקציונלית: קלט, פלט מרונדר, והחלטה אם לשמור אותו. שום דבר בה לא פועל בזמן שאתה עדיין מחליט מה לבקש.
גריפין בנוי בדיוק ההפך. זוהי מערכת דופלקס מלא: מנוע למידול שיחתי רציף שצורך אודיו וווידאו ומעריך מחדש את השיחה במרווחים של פחות משנייה, ומחליט אם לשתוק, לאותת, להשמיע תגובת לוואי או לקחת את התור, ומפיק פקודות אקספרסיביות שמניעות מחולל דיבור זורם ומחולל וידאו זורם במקביל. הוא מייצר 720p במקטעים של 320 מילי-שניות מתצלום ייחוס בודד, והטענה החשובה היא שהחלטה שמתקבלת באמצע משפט מופיעה בקול ובפנים בתוך אותו מיני-תור. אמת המידה לכך אינה לוח דירוג של קליפים. היא האם אתה יכול לקטוע אותו.
במילים פשוטות: Wan 2.7 עונה על השאלה "איך הסצנה הזו נראית בתנועה?" Griffin עונה על "מה הפנים והקול האלה צריכים לעשות במאתיים המילי־שניות הבאות, בהתחשב בכך שהאדם בדיוק הפסיק."
מחיר, בצד האחד שבו יש אחד
התעריפים המפורסמים של Wan 2.7 הם לפי שנייה של וידאו מיוצר, והמדרגות אינן אחידות ברחבי החבילה, וזה הפרט שרוב דפי ההשוואה מפספסים.
• wan2.7-t2v ו-wan2.7-i2v — החיוב מתבצע לפי משך הפלט בלבד. סינגפור הבינלאומית: $0.10/s ב-720p ו-$0.15/s ב-1080p, שהם הנתון של $9.00/דקה שמופיע בלוחות הדירוג. בייג'ינג וטוקיו מפרטות $0.086/s ו-$0.143/s עבור אותה עבודה.
• wan2.7-r2v (רפרנס לווידאו) — מחויב לפי משך סרטון הקלט, עם תקרה של חמש שניות, בתוספת הפלט. הזינו רפרנס של חמש שניות לתוך יצירה של חמש עשרה שניות ותחויבו בעשרים שניות.
• wan2.7-videoedit — החיוב הוא על הפלט בלבד, כאשר חומרי הצילום הנכנסים בחינם.
שתי עובדות מחזור חיים צריכות לבוא לצד המספרים האלה. Alibaba הציעה הנחת השקה של 30% לזמן מוגבל על משטחי Bailian ו-Qwen Cloud שלה, בתוקף עד 23 בספטמבר 2026, שכעת חלף. והודעת הפסקת השירות של Model Studio של Alibaba Cloud (מזהה 118434) מוציאה כמה מודלים ישנים משירות ב-10 באוקטובר 2026, כולל wan2.7-r2v ו-wan2.7-image. מדובר ברמת הווריאנט ולא בפרישה של הדור — wan2.7-t2v ו-wan2.7-i2v עדיין מופיעים ברשימה עם תעריפים פעילים ודפים שעודכנו לאחרונה ב-11 בספטמבר — אבל אם reference-to-video הוא הסיבה שבגללה הסתכלת על 2.7, למסלול הזה יש תאריך.
להשוואה מול Griffin יש שורה כנה אחת: אין מחיר שאפשר להציב לצד זה של Wan 2.7's, מפני ש-Tavus לא פרסמה כזה. Griffin-Lite אינו נמצא בפלטפורמה של Tavus, ההודעה אומרת שהוא לא יהיה זמין לשימוש לקוחות בשלב זה, והשורה החותמת של החברה עצמה היא ש-Griffin יגיע לאחר שהיא תמצא דרך לשחררו בבטחה. אין תעריף לפי שנייה, אין תעריף לפי בקשה, אין מסלול חינמי, אין מסלול ארגוני. כל מי שמצטט מחיר עבור Griffin ממציא אותו.
ציוני איכות: שני לוחות שאינם עומדים
שני המודלים נוקדו בכלים שונים לחלוטין, וזו הסיבה שלא קיימת השוואת Elo ביניהם.
ל-Wan 2.7 יש שתי רשומות בזירת הווידאו של Artificial Analysis, והן לא נמצאות באותו מקום — וזו המלכודת שבציטוט מספר אחד עבורו. Elo שם נגזר מהצבעות העדפה אנושיות עיוורות בזוגות, מתודולוגיה שנבנתה עבור קליפים גנרטיביים קצרים, ושתי הקריאות שלהלן הן מלוחות שנקראו ב-2 באוקטובר 2026.
• Wan2.7-260612 (הבילד של יוני) בטקסט-לווידאו (עם אודיו) — במקום ה-13–14, Elo 1,032 (±10) בהתבסס על 4,645 הצבעות, 9.00$ לדקה.
• Wan 2.7 (גרסת אפריל) בהמרת תמונה לווידאו (עם אודיו) — מקום 12 מתוך 34, Elo 1,077 על פני 4,571 הצבעות, $9.00 לדקה, לוח שנושא בערך את אותה כמות ההצבעות אך ממקם אותו גבוה יותר באופן מהותי.
• Wan 3.0, האח החדש יותר — מקום ראשון עם Elo 1,157 ב-text-to-video ומקום שישי עם 1,164 ב-image-to-video, שניהם במחיר $12.00 לדקה. זה הנתון שכדאי להכיר לפני שמשווים את Wan 2.7 למשהו: הדור הבא של Alibaba עצמה מוביל את הטבלה, ו-2.7 הוא דגם מאמצע הטבלה.

Griffin מתבסס על VideoFDB של NVIDIA, מדד לשיחה אודיו-ויזואלית בדופלקס מלא ש-NVIDIA בנתה ודירגה באופן בלתי תלוי בספטמבר 2026, תוך שימוש בשופט מבוסס מודל שפה לפי רובריקה של אפס עד חמש. Griffin-Lite קיבלה 3.83 במסלול היצירה לעומת ייחוס אנושי של 3.92 ו-2.80 עבור המערכת המפורסמת הבאה בדירוג, ו-3.73 במסלול התפיסה לעומת ייחוס אנושי של 4.20. Tavus מדווחת גם על השהיה אמיתית של 0.43 שניות מאודיו לווידאו עבור המחולל, לעומת ארבעה קווי בסיס מפורסמים של דיפוזיית זרימה על H100s.
שתי קבוצות המספרים הן לגיטימיות, ואף אחת מהן אינה ניתנת להעברה. Elo בזירה הוא ספירת קולות על העדפת קליפים; VideoFDB הוא ציון מחוון של שופט על התנהגות שיחתית. אין גשר ביניהם, ומלכודת המדגם הקטן פועלת גם בכיוון ההפוך: טווח ה-±10 של הזירה על Wan 2.7 רחב מספיק כך שמיקומו ביחס לשכנים אינו נקבע בחדות, ופער היצירה של NVIDIA מול האדם, בגובה 0.09 נקודות, קטן מספיק במחוון של חמש נקודות ש"קרוב להתייחסות האנושית" הוא הקריאה הכנה, ולא "ברמה האנושית". גם השוואת התפיסה אינה של דומה לדומה — כמה מהמערכות ש-Griffin ממוקם לפניהן, כולל gpt-realtime של OpenAI ו-MiniCPM-o 4.5, מקבלות ציון בתצורות אודיו בלבד בעוד Griffin קולט גם וידאו. חלק מהיתרון של 0.29 נקודות מודד את העובדה שיש לו עיניים.
מה כל אחד צריך ממך
כאן ההשוואה הופכת לשימושית, כי הקלטים הם המוצרים.
• קלט — Wan 2.7 מקבל טקסט, תמונה, וידאו ואודיו. Griffin מקבל אדם חי דרך המצלמה והמיקרופון, ואינו מייצר קליפ לפי בקשה כלל.
• פלט — Wan 2.7 מפיק קובץ וידאו, 2 עד 15 שניות לכל יצירה, עד 1080p, עם אודיו מקורי. Griffin מפיק שיחה מתמשכת: וידאו 720p בקצב 25 fps בקטעים של 320 ms, שנוצר בזמן אמת ומושמע תוך כדי פענוח.
• מה מכוון אותו — Wan 2.7 מונחה על ידי הפרומפט ועל ידי עד חמש תמונות נושא וחמישה סרטוני ייחוס, בתקרה של עשרה נכסי ייחוס לבקשה. Griffin מונחה על ידי מה שהאדם עושה: השהיה, מבט הצידה, מחווה, הפרעה.
• אופק זמן — יחידת העבודה של Wan 2.7 היא קליפ של לכל היותר חמש עשרה שניות, שאותו אתה מרכיב לאחר מכן. יחידת העבודה של Griffin היא שיחה, ולכן הארכיטקטורה הייתה חייבת לפתור את הסחיפה — הזיקוק התלת-שלבי לגנרטור אוטורגרסיבי, שאומן על ההיסטוריה שנוצרה על ידו כך שרולאאוטים ארוכים נשארים יציבים — במקום להיאבק על יצירה בודדת ארוכה יותר.
מכל פלט — Wan 2.7 מחזיר קובץ שבבעלותך, שאותו אתה יכול לערוך, לבצע גריידינג ולהפיץ. Griffin מחזיר סשן מרונדר. אין קובץ לערוך, מפני שהפיקסלים נוצרים לכל מקטע מתמונת ייחוס ומההיסטוריה של המודל עצמו, והרקע, הצללים והכיסא שהאדם יושב בו הם חלק מהג'נרציה.
הבדל מבני אחד שראוי לציין: העלויות של Wan 2.7 משתנות בהתאם למשך הפלט, והאיכות שלו משתנה בהתאם למידת הספציפיות של הפרומפט שלך. העלויות של Griffin אינן מדודות, והאיכות שלו משתנה בהתאם למידת הטבעיות של האדם בצד השני. אפשר לשפר את האחד על ידי כתיבת בריפים טובים יותר, ואת האחר רק על ידי שימוש בו עם אנשים אמיתיים.

הפניה ועקביות, במקום שבו שני העיצובים מתנגשים
Wan 2.7 שולט בעקביות הסובייקט באמצעות רפרנסים שסופקו: חמש תמונות סובייקט, חמישה קליפי רפרנס, עשרה נכסים בסך הכול. זוהי גישה צילומית — אתה מראה לו איך הסובייקט נראה והוא שומר על המראה הזה לאורך כל היצירה.
Griffin שולט באותו דבר בדרך ההפוכה. הוא מייצר כל פיקסל בכל פריים מתמונת ייחוס אחת בזמן אמת, וההכרזה מבהירה במפורש שהוא שולט בכל הסצנה ולא רק בפנים: הזרועות והאצבעות, תנועת הכיסא, הצללים המוטלים והרקע שמאחור. העקביות שם מושגת בכך שהסביבה משמשת כיעד יצירה ולא כפלייט מורכב.
אף אחת מהגישות אינה טובה באופן מוחלט והן נכשלות בדרכים שונות. יצירה מותנית בהתייחסות נכשלת בכך שהיא סוטה מהנושא שסופק לאורך קליפ ארוך. יצירה לפי מקטעים עם היסטוריה אוטורגרסיבית נכשלת בכך שהיא נודדת לאורך סשן ארוך אם הטיפול בסחיפה שגוי, וזה בדיוק הכשל ששלב הזיקוק השלישי נועד למנוע. Wan 2.7 הוא הבחירה הבטוחה יותר כאשר התוצר הוא אדם ספציפי במראה ספציפי. Griffin לא מתחרה על הבריף הזה.
בטיחות, מקור ועמדת השחרור
ל-Wan 2.7 אין מערכת מקור מתועדת כלשהי שניתן להשוות לסימן מים ששורד דחיסה — ההודעה מציינת את איכות השמע ואת דיוק הטקסט על המסך כתחומים שעדיין דורשים עבודה, וזו הסתייגות הנוגעת לנאמנות ולא לבטיחות.
סיפור הבטיחות של Griffin הפוך: הסיבה המוצהרת של Tavus להשאיר אותו בתצוגה מקדימה היא שאותן תכונות שהופכות אותו לממשק טוב יותר הופכות אותו גם לטוב יותר בשכנוע מישהו שהוא מדבר עם אדם, והמספרים תומכים בחשש. במחקר החי של החברה עצמה, 26 מתוך 54 משתתפים האמינו שהצד השני הוא אדם אמיתי, לעומת 1 מתוך 41 בסטאק הקודם Phoenix-4.5 / Raven-1 / Sparrow-2. משתתפים שכן חשדו נטו לחשוד בתוך עשרים השניות הראשונות. Tavus אומרת שנדרשת עבודת יישור וגילוי נוספת לפני השחרור, שהיא בונה תכונות גילוי, ושהיא עובדת עם ארגונים על הערכות בטיחות. זה הדבר המהותי ביותר שמישהו פרסם על המודל הזה, וזו גם הסיבה שאין מוצר לקנות.
לכל מי שמשווה בין השניים ככלים, ההשלכה המעשית פשוטה: האחד ניתן ליצירה לפי דרישה וניתן להפצה כבר היום, והאחר הוא יעד להערכה ששחרורו מותנה בבעיה שהספק טרם פתר.
איזה אחד, בשביל מה
• בחרו ב-Wan 2.7 אם התוצר הוא חומרי צילום. עריכה מבוססת הנחיות של חומר קיים היא סוג העומס שבו הוא חזק במיוחד וזול במיוחד, מפני שגרסת העריכה מחייבת על הפלט בלבד ומתייחסת לחומרי הקלט כחינמיים. כדאי לבדוק את גרסת ה-reference-to-video שלו מול הפסקת השירות ב-10 באוקטובר לפני שאתם מתחייבים אליה.
• אל תבחרו ב-Griffin לשום דבר ברבעון הזה, כי אתם לא יכולים. בקשו גישה אם אתם צריכים לדעת אם אדם יכול להבחין, או אם מפת הדרכים שלכם תלויה בשכבת האינטראקציה ולא בשכבת הצילום.
• שימו לב לפער, ולא לאף אחד מהמודלים. הגעתו של Griffin הופכת את ההשוואה המעניינת יותר להשוואה עתידית: מערכת שמייצרת את כל השיחה לעומת סוויטה שמייצרת את כל הסצנה. המוצר הראשון שיעשה את שניהם יהיה המוצר שמולו יהיה שווה לקרוא את זה מחדש.
היכן נתב מתאים, והיכן לא
אף אחד מהמודלים האלה אינו נמצא בקטלוג של OrcaRouter, וראוי לציין זאת לפני כל דבר אחר בסעיף הזה. אל Wan 2.7 ניתן להגיע דרך הפלטפורמות של Alibaba עצמה — Model Studio ב-Alibaba Cloud ו-Qwen Cloud — ודרך כלי יצירה של צד שלישי ששילבו אותו לאחר ההשקה; אל Tavus Griffin ניתן להגיע רק באמצעות טופס בקשה. אם מי מהם יהיה ניתן לניתוב, הם יופיעו במחיר המחירון של הספק.
החלק בצינור עיבוד וידאו שהוא בעיית ניתוב הוא הטקסט שסביבו. רשימות שוטים, הרחבת פרומפטים, יצירת כיתובים, סיכומי ביקורת איכות, ועבודת התמלול או הדיאלוג שמזינה מעבר reference-to-video הם כולם קריאות טקסט, והם פועלים באותו endpoint תואם OpenAI ב-OrcaRouter כמו 200+ מודלים אחרים במחיר המחירון של הספק עם תוספת של 0%, כך שהורדת מחיר של ספק נכנסת לתוקף באותו יום ולא אחרי מחזור חוזה. פיצול מודל זול על פני מעבר גורפ ומודל frontier על פני המעבר האחרון הוא שינוי קונפיגורציה שם ולא קשר עם ספק שני — וזו אותה טענה שחלה על שכבת היצירה, ברגע ששכבת היצירה היא משהו שאפשר לקרוא לו.
מה כדאי לעקוב אחריו: האם וריאנטי הייחוס והעריכה של חבילת Wan 2.7 ישרדו ללא שינוי את הפסקת הפעילות של Model Studio ב-10 באוקטובר, והאם שער הבטיחות של Griffin יפיק כרטיס מודל מפורסם שכולל נקודת קצה. שני האירועים האלה הם שיהפכו את ההשוואה הזו ממאמר עיצובי להחלטת רכש.

