כרטיס כותרת עבור מאמר המשווה בין Kandinsky 6.0 Video ליריבו הנקוב בשמו, עם כתובית משנה: "הגרסה שבמאמר אינה הגרסה שאתם קונים", ועם שלוש תוויות תומכות שנלקחו מהראיות של המאמר עצמו.
Engineering & Research

Kandinsky 6.0 Video מול Seedance 2.5: הגרסה שבמאמר אינה הגרסה שאתם קונים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המשפט המצוטט ביותר בהתמודדות הזו הוא השוואה מול הדגם הלא נכון. הדוח הטכני של Kandinsky 6.0 Video, שפורסם ב-6 באוקטובר 2026 עם שחרור המשקולות תחת רישיון MIT, מציג בנצ'מרק מול Dreamina Seedance 2.0 — הדור הקודם. Seedance 2.5, דגם הווידאו והאודיו הנוכחי של ByteDance, משוחרר מאז 31 ביולי 2026 והוא זה שנמצא במכירה. לכן כשהדוח מסיק ש-Seedance "מועדף על פי הקריטריונים הוויזואליים, עם פערים מובהקים סטטיסטית באיכות ויזואלית כללית, בארטיפקטים, בריאליזם תנועה ובעקיבה אחר פרומפט ויזואלי", הוא מתאר גרסה שאי אפשר לקבל עליה רישיון היום, כפי שהוערכה על ידי המעבדה שכתבה את Kandinsky 6.0 Video. שני חצאי המשפט הזה חשובים, ואף אחד מהם אינו סיבה להתעלם מההשוואה — פער הגרסאות קובע רצפה למידת מה שהיא יכולה לספר לך, והמסגור אומר לך למי לסמוך על מה.

מה השתנה בין שתי גרסאות ה-Seedance

הצעד מ-2.0 ל-2.5 אינו צביעה מחדש, וזו בדיוק הסיבה לכך שההחלפה אינה קוסמטית. Seedance 2.5 מייצר עד שלושים שניות במעבר אחד — פי שישה מהמעטפת של המודל בדוח, ופי שישה מהחמש הקבועות של Kandinsky 6.0 Video. הוא מוסיף מיקוד ברמת חותמת זמן ועריכות ברמת אזור לאחר היצירה, כלומר ניתן להחיל שינוי על חלון של הקליפ או על חלק מהפריים במקום לייצר מחדש את כולו. הוא קורא טקסט לצד כ-30 תמונות, עשרה סרטונים ועשרה קטעי אודיו כחומרי ייחוס בבקשה אחת, לעומת פריים זנב ממוסך יחיד של Kandinsky 6.0 Video. והוא מפיק אודיו מסונכרן עם דיאלוג, וזו הסיבה היחידה שהצמד הזה שייך בכלל לאותו מאמר.

כל אחד מאלה הוא יכולת שההערכה של הדוח לא בחנה. תוצאת הקריטריונים החזותיים אומרת לך אפוא ש-Kandinsky 6.0 Video פיגרה אחרי הדור הקודם של Seedance באיכות חזותית כוללת, בארטיפקטים, במציאותיות התנועה ובמעקב אחר פרומפטים. היא אינה אומרת לך מה הייתה עושה הגרסה הנוכחית, וההנחה הכנה היא שדור חדש יותר אינו נעשה גרוע יותר בצירים שהערות השחרור של עצמו מדגישות.

מה שההערכה של הדוח עצמו קובעת ומה שהיא אינה קובעת

השיטה נחשפת בפירוט מספיק כדי שתוכל להישקל. זוגות זה לצד זה שנוצרו מאותה הנחיה על ידי שני מודלים, שני הקליפים אנונימיים, מיקומי שמאל/ימין מוקצים באקראי בכל משימה, סדר המשימות מוערבב, האודיו מושבת תחילה עבור השאלות החזותיות ואחר כך מופעל עבור שאלות האודיו, אפשרות תיקו סימטרית ואפשרות N/A מפורשת כאשר לא ניתן לשפוט קריטריון, צבירה לפי הצבעת רוב בקרב המתייגים, וכ-200 השוואות זוגיות או יותר עבור כל קריטריון שנבחן.

לפי אותה שיטה, התוצאה של Seedance 2.0 מתפצלת באופן שייראה מוכר לכל מי שקרא את ההשוואה ל-Kling באותו דוח. המדדים החזותיים הולכים ל-Seedance עם מרווחים שחוצים את סף המובהקות. תחום השמע צמוד בהרבה: סנכרון אודיו-וידאו מגיע כמעט לשוויון, ואיכות הדיבור נוטה לטובת Kandinsky 6.0 Video Pro. בין שתי הקביעות האלה יושבת כל ההחלטה, מפני שזה אומר שהצ'קפוינט הפתוח החדש ביותר לאודיו-וידאו מפגר באופן מדיד במראה של קליפ ומוביל באופן מדיד באופן שבו הדיבור בו נשמע.

המגבלות על אותה תוצאה הן המגבלות הרגילות, ואף אחת מהן אינה אנושה לה. הוא הורץ בידי מחברי Kandinsky על פרומפטים שהם בחרו, עם אנוטטורים שהם גייסו. שום זירה עיוורת ציבורית אינה מדרגת את Kandinsky 6.0 Video כלל, כך ששום גורם חיצוני לא בחן אם פרומפטים של זר משחזרים את הפיצול. הדוח גם חושף את התקרה שמולה הוא נמדד: קליפים של עד חמש שניות, יצירה בסיסית ברזולוציית SD כשאת Full HD משיגים דרך שלב של סופר-רזולוציה, ופער שנותר לעומת המערכות הקנייניות החזקות ביותר באיכות חזותית ובאיכות אודיו כוללת.

שלושה פערים מבניים שאף בנצ'מרק לא יתפוס

משך הזמן הוא הדבר הראשון והבוטה ביותר. Kandinsky 6.0 Video מאומן ומוערך ב-121 פריימים, מריץ אינפרנס ב-121 פריימים, 5 שניות ב-24 fps, ומגיע ללא מצב הארכה — קטע של שלושים שניות הוא שש יצירות, חמישה חיבורים, וסיכון לרציפות שבאחריותך. Seedance 2.5 עושה שלושים שניות במעבר אחד. עבור סבב דיאלוג בודד, הדגמת מוצר, או כל דבר שבו החיבור יהיה גלוי, זה לא הבדל בבנצ'מרק; זה הבדל בשאלה אם המשימה היא רנדור אחד או שלב הרכבה.

השני הוא התניה בהפניות, והאסימטריה בולטת. Kandinsky 6.0 Video לוקח תמונת הפניה אחת ומחיל אותה כפריים סיום ממוסך — פריים מפתח שאליו מבצעים אינטרפולציה. Seedance 2.5 לוקח סט עבודה של כשלושים תמונות, עשרה קליפי וידאו ועשרה קליפי אודיו כהקשר אחד. עקביות דמות לאורך רצף, העברת סגנון מלוח מצב רוח, ביצוע שמועבר מקליפ קיים: אלה עומסי עבודה שמספר ההפניות מאפשר, ושאופן הפריים הבודד אינו מנסה לבצע.

השלישי הוא יכולת העריכה, והוא זה שמשנה תהליך עבודה ולא שוט בודד. עריכה ברמת האזור וברמת חותמת הזמן משמעה שחלון פגום בן שלוש שניות מתוקן במקום. ל-Kandinsky 6.0 Video אין משטח עריכה — חמש שניות גרועות נוצרות מחדש, ואם הן חוברו לארבע אחרות, גם החיבורים נבחנים מחדש. צוותים המתמחרים הרגל של רינדור מחדש צריכים לתמחר את ההבדל הזה בבחירת המודל, במקום לגלות אותו.

• משך — Kandinsky 6.0 Video: 5 שניות קבוע, 121 פריימים ב-24 fps, ללא מצב הארכה. Seedance 2.5: עד 30 שניות במעבר אחד.

• התניית ייחוס — Kandinsky 6.0 Video: תמונה אחת, המיושמת כמסגרת סיום עם מסכה. Seedance 2.5: בערך שלושים תמונות, עשרה סרטונים ועשרה קטעי אודיו לכל בקשה.

• עריכה — Kandinsky 6.0 Video: אין; צרו מחדש וחברו מחדש. Seedance 2.5: מיקוד ברמת חותמת זמן ועריכות ברמת אזור לאחר היצירה.

• רזולוציה — Kandinsky 6.0 Video: SD ב-512×768, Full HD 1920×1080 דרך שלב סופר-רזולוציה מובנה. Seedance 2.5: תלוי במצב, כאשר המחיר לכל קליפ נקבע לפי הרזולוציה שתבחרו.

• אודיו — Kandinsky 6.0 Video: ‏44 kHz עם סנכרון שפתיים, נוצר יחד עם התמונה. Seedance 2.5: אודיו מסונכרן הכולל דיאלוג, נוצר יחד עם הווידאו.

• משקלים — Kandinsky 6.0 Video: MIT, Lite 3B ו-Pro 29B, עם קוד ואינטגרציה עם diffusers. Seedance 2.5: לא.

שני מטרים שאינם ממירים זה לזה

Seedance 2.5 נמדד בטוקנים, מה שמסתכם בבערך $0.51 עבור קליפ של חמש שניות באיכות 480p ובערך $1.16 באיכות 720p. הסיבה לנסח זאת כך ולא כתעריף לפי שנייה היא שמספר הטוקנים משתנה בהתאם לכמות הצילום, כך שיצירה של שלושים שניות אינה שלושים שניות בתעריף קבוע — היא פי שישה מהטוקנים של יצירה של חמש שניות באותן הגדרות, ופעולות העריכה מתומחרות לפי מה שהן נוגעות בו. תהליך שמייצר מחדש באופן קבוע יגלה שהמונה מגיב להרגל הזה.

ל-Kandinsky 6.0 Video אין מונה מפני שאין מה לקנות. העלות שלו היא מכונה ושעון, והדוח מספק את השעון: בערך 402 שניות של זמן עבודה על H100 עבור קליפ Pro Full HD בן חמש שניות, 854 על RTX 5090, 1,247 על RTX 4090, פריקת בלוקים נדרשת מתחת להקצאת שיא של 72.8 GiB, ופריסט של 16 GB VRAM שמכמת את מקוד הטקסט ל-NF4 — שינוי הפריסט היחיד שהדוח אומר שמשנה את הקליפ עצמו. הצ'קפוינט המזוקק, שנמדד בשוויון עם המודל המלא בהעדפה ממוצעת של 51% מול 49%, כאשר אף קריטריון לא הגיע למובהקות סטטיסטית, הוא זה שמאפשר למספרים האלה להיות ישימים.

• עלות לחמש שניות — Kandinsky 6.0 Video: אין מחיר מחירון; שש עד עשרים ואחת דקות של GPU אחד בהתאם לכרטיס. Seedance 2.5: בערך $0.51 ב-480p ו-$1.16 ב-720p בטוקנים.

שום דבר בשתי השורות האלה אינו ניתן להשוואה, והניסיון המקובל לצמצם אותן לנתון יחיד — חלוקת תעריף של שעת GPU בקליפים בני חמש שניות — מניח בשקט ניצול מלא, אפס זמן סרק וכרטיס שכבר נמצא בבעלותך. ההשוואה השימושית יותר היא איכותנית: העלות של Seedance 2.5 משתנה בהתאם לכמה שאתה מייצר ונעלמת כשאתה מפסיק; העלות של Kandinsky 6.0 Video נוצרת בין אם אתה מייצר ובין אם לא.

Two-column scoreboard comparing Kandinsky 6.0 Video and Seedance 2.5 across six shared dimensions, with the vendor-vs-third-party sourcing line printed along the bottom.

היכן ניתן להשיג כל אחד מהם

אף אחד מהמודלים אינו נמצא ב-OrcaRouter, ואף אחת מהטענות האלה אינה נטענת. אל Seedance 2.5 מגיעים דרך הפלטפורמות של הספק עצמו וכמה שירותי צד שלישי; Kandinsky 6.0 Video הוא צ׳קפוינט שמורידים תחת רישיון MIT ומריצים על החומרה שלכם. כל עמוד שאומר לכם ששניהם במרחק קריאת API אחת בפלטפורמה רב-מודלית מתאר מודלים אחרים.

הסיבה ששכבת ניתוב עדיין שווה אזכור בצינור עיבוד של Kandinsky או Seedance היא שהמערכות האלה הן בעיקר טקסט לפי מספר הקריאות ווידאו לפי העלות. הרחבת פרומפט הופכת הערת שוט לכיתוב המובנה הארוך שמודל T2AV מצפה לו. דיאלוג מנוסח בטיוטה לפני שמעבר סינכרון שפתיים מנסה אותו, ונכתב מחדש כשהמעבר משבש אותו. שש יצירות מועמדות של אותו ביט נסקרות ואחת נבחרת — שיפוט טקסטואלי על תוצר וידאו, וזו הדרך הזולה ביותר לקבל נכון את ההחלטה היקרה. על נקודת קצה אחת תואמת OpenAI על פני יותר מ-200 מודלים במחירי המחירון של הספקים, המועברים הלאה עם 0% תוספת, הקריאות האלה עולות כמו שהספק גובה ולא יותר, כולל ביום שאחרי שספק משנה את תעריפיו. ה-DSL של הניתוב מצדיק את מקומו כשהסוקר הזול והסוקר הקפדני אמורים להיות מודלים שונים באותה נקודת קריאה, ומעבר אוטומטי לגיבוי מצדיק אותו כי כיתוב שמת בזמן שקליפ ארבע מתוך שש מרנדר צריך להיות מנותב מחדש ולא לסיים את הסשן.

מה יזיז את ההתמודדות הזו?

פער הגרסאות הוא כל הסיפור וגם הדרך הקצרה ביותר לפתור אותו. הרצה של Seedance 2.5 מול Kandinsky 6.0 Video תכריע אם הפסדי הקריטריונים החזותיים שהדוח מתעד מול 2.0 התרחבו, הצטמצמו או התהפכו — הדוח אינו יכול לענות על כך, ולמחבריו לא הייתה דרך לעשות זאת. לעת עתה, העמדה הניתנת להגנה צרה יותר ממה שהשיווק של מי מהצדדים רוצה: על פי הראיות שפרסמה המעבדה של המודל עצמו, Seedance מוביל באופן שבו הקליפ נראה, ו-Kandinsky 6.0 Video מוביל באופן שבו הדיבור שבו נשמע, והגרסה של Seedance שהטענה הזו נשענת עליה היא דור אחד מאחורי זו שהייתם קונים.

בחרו בהתאם. אם העבודה ארוכה, עתירת רפרנסים או מונעת עריכה, הפערים המבניים הם שמכריעים עוד לפני שהאיכות נכנסת לתמונה. אם העבודה היא שוט דיבור של חמש שניות שבו הדיאלוג חייב להישמע נכון בפעם הראשונה, היתרון הנמדד של Kandinsky 6.0 Video הוא בדיוק בקריטריון הזה — ורישיון MIT אומר שהתשובה לא תלויה במפת הדרכים של אף אחד. הדבר שצריך לעקוב אחריו הוא לא לוח דירוג. זהו הרצה חוזרת של השוואה שהדוח מעולם לא היה מסוגל להריץ.

Screenshot of the arXiv abstract page for paper 2610.05608, "Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation", showing the 4 October 2026 submission date and the abstract, including the listed limitations that the models generate clips of up to 5 seconds and that base generation runs at SD resolution with Full HD obtained through super-resolution.Screenshot of the Hugging Face model card for kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers, showing the MIT licence and the family description - Kandinsky 6.0 Video Lite at 3B parameters and Pro at 29B, generating 5-second clips with synchronized 44 kHz audio in T2AV and I2AV modes.

הדרך הזולה ביותר לבצע את הקריאה היקרה כראוי: DSL לניתוב שמחליף את הסוקר בכל שלב, עם מעבר אוטומטי לגיבוי כך שכיתוב מת לא יעלה לקליפ.