כרטיס כותרת שנוצר עם הכיתוב 'Kandinsky 6.0 Video נגד Grok Imagine Video' וכותרת המשנה 'טבלת המובילים התהפכה', מעל שורת סמלים המסומנת 'יצירת וידאו', 'שמע מסונכרן' ו'פריסה במשקלים פתוחים'. הלוגו של OrcaRouter ממוקם בפינה הימנית התחתונה.
Guides & Insights

Kandinsky 6.0 Video נגד Grok Imagine Video: טבלת המובילים התהפכה

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

בינואר 2026, כאשר Grok Imagine Video הושק, הוא עמד בראש זירת הווידאו של Artificial Analysis בשני המצבים. היום אותו לוח מציב את הגרסה הנוכחית שלו במקום האחד-עשר או השנים-עשר בטקסט-לווידאו. זו אינה שערורייה וזה אינו כישלון — זה מה שקורה לקטגוריה שנעה במהירות בתוך תשעה חודשים, וזו הסיבה הכנה להשוות את מודל היצירה של xAI עם Kandinsky 6.0 Video ממש עכשיו. אחד מהם הוא שירות שממוטב למהירות שבה אפשר לייצר עוד קליפ; האחר הוא צ'ק-פוינט ברישיון MIT, עם 29 מיליארד פרמטרים בגרסת Pro ו-3 מיליארד ב-Lite, שהושק על ידי מעבדת Kandinsky של Sber בשבוע הראשון של אוקטובר 2026, ומייצר חמש שניות של וידאו עם אודיו מסונכרן ב-44 קילו-הרץ וסנכרון שפתיים. השאלה המעניינת אינה מי מהם מוביל בלוח — אלא מה כל אחד מהם מסוגל לעשות מבחינה מבנית בשלב הבא.

הלוח שזז מתחתיו

Grok Imagine Video הוא מודל היצירה של xAI, שיצא לראשונה ב-29 בינואר 2026 ויציב בגרסה 1.5 מאז 16 ביוני. בלוח המובילים של טקסט-לווידאו של Artificial Analysis, גרסת ה-1.5 שלו ניצבת במקומות 11–12 עם Elo 1,045 (±9) מתוך 4,056 הצבעות, ומחירה רשום כ-$15.00 לדקה. הגרסה המקורית אינה מופיעה בלוח זה.

מתמונה לווידאו הוא התחום שבו המשפחה חזקה יותר, ושבו שני הבילדים נבדלים באופן ששווה לקרוא בעיון:

• grok-imagine-video-1.5 — מקומות 7–9, Elo 1,098 (±8), 5,267 הצבעות, $8.40 לדקה.

• grok-imagine-video (מהדורת ינואר) — 12–17 בינואר, Elo 1,072 (±7), 14,371 הצבעות, $4.20 לדקה.

• לשם קנה מידה, המקום הראשון בטבלת ה-I2V הזו — MiniMax H3 Max — נמצא ב-Elo 1,195 (±9) מתוך 5,894 הצבעות, ו-Wan 3.0 הוא השישי עם 1,164.

להלן שתי קריאות, ושתיהן נכונות. הגרסה החדשה יותר של xAI אכן מקדימה את קודמתה שלה במשימת תמונה לווידאו, ב-26 Elo, והיא עולה פי שניים לדקה כדי להיות כך. וסיפור שבוע ההשקה — מודל שהגיע לפסגה — לא החזיק מעמד: התחום זז, הזירה צברה עשרות אלפי הצבעות על פני תריסר מערכות חדשות יותר, ומיקום באמצע הטבלה הוא היכן שתשעה חודשי תחרות מציבים מחולל מהיר ורב-תכליתי.

אין ל-Kandinsky 6.0 Video שום Elo באף לוח. הראיות שלו הן ריצת VABench והערכה אנושית שבוצעה במעבדה, שתיהן פורסמו על ידי Sber, ואף אחת מהן לא שוחזרה מחוץ ל-Sber. הצבת מודל פתוח שלא עבר ביקורת לצד מודל מסחרי עם ציון היא בדיוק ההשוואה שיש להתייחס אליה בזהירות: מיקומו של המודל עם הציון הוא אמיתי ולא מחמיא, ומיקומו של המודל ללא ציון אינו ידוע. "לא ידוע" אינו "טוב יותר".

שני סוגים של "fast", ורק אחד מהם נמדד בשניות

מטרת העיצוב של Grok Imagine Video היא תפוקה לכל יוצר. הוא מחובר ישירות ל-X, הוא מחזיר קליפ מוגמר עם סאונד, ומערך התכונות שלו נקרא כמו רשימה של דברים שאנשים באמת עושים בפיד: יחסי גובה-רוחב מרובים, תנועת מצלמה, הוספה, הסרה והחלפה של אובייקטים, העברת סגנון, יצירה מותנית בהפניות מכמה תמונות לשם עקביות דמות, אודיו מקורי עם דיאלוג, אפקטים ומוזיקה. אורך הקליפ מגיע עד חמש עשרה שניות, והרזולוציה מגיעה עד 1080p. המוצר כולו בנוי כך שניסיון שני עולה לך כמה דקות וכמה סנטים.

Kandinsky 6.0 Video מהיר במובן אחר — לא לפי ניסיון, אלא לפי יחידת בעלות. שום דבר בו אינו מיידי. זמני העבודה של המאגר עצמו עבור המודל שאינו מזוקק, לאחר חימום ולא כולל טעינת משקלים וקידוד MP4, מציבים קליפ Pro Full HD באורך חמש שניות על כ-402 שניות ב-H100, 854 ב-RTX 5090, 1,247 ב-RTX 4090 ו-3,530 ב-RTX 5060 Ti. Lite Full HD עומד על 284 שניות ב-H100. הכלי שהופך זאת לנסבל הוא הצ'קפוינט המזוקק, שאותו מדד המאמר בשוויון עם המודל המלא — מועדף או בשוויון ברוב הקריטריונים, העדפה ממוצעת של 51% מול 49%, כאשר אף הבדל בודד לא הגיע למובהקות. מה שמקבלים בתמורה לרינדור האיטי הוא מודל על הדיסק שלך בלי שום מונה לכל קליפ שפועל בכלל.

זו הצורה האמיתית של ההתמודדות הזו. Grok Imagine Video מבצע אופטימיזציה של העלות של הניסיון העשירי. Kandinsky 6.0 Video מבצע אופטימיזציה של העלות של הניסיון העשרת־אלפים, וגובה ממך מחיר בחומרה ובסבלנות עבור הראשון.

שניהם מייצרים אודיו — והם לא אותה טענה

זהו הציר שבו השוואה עצלה הייתה אומרת "תיקו" וטועה.

Grok Imagine Video מייצר אודיו מקורי עם דיאלוג, אפקטים ומוזיקה כאחד מהמאפיינים הרבים שלו. זהו מחולל למטרות כלליות שבמקרה כולל גם סאונד.

Kandinsky 6.0 Video בנוי סביב סאונד. הארכיטקטורה היא CrossDiT דו-זרמי, המזווגת זרם וידאו שאותחל מ-Kandinsky 5.0 Video עם זרם אודיו שאומן מאפס על קורפוסי אודיו גדולים, המחוברים בקשב צולב דו-כיווני ומאומנים יחד. הפלט הוא 44 kHz עם סינכרון שפתיים מפורש, ומדווח ששלב למידת החיזוק של המאמר מפחית את שיעור שגיאות המילים של הדיבור הנוצר ב-47% — נמדד באמצעות Whisper-large-v3, שהוא אחד ממודלי התגמול של RL, פרט שחשוב משום שהמאמר מדווח על WER שני, שאינו בר-השוואה, לצד VABench תוך שימוש ב-Qwen3-ASR-1.7B. דיבור הוא הדבר שעליו עבר המודל אימון-המשך.

לעומת זאת, המחקר של Sber עצמה גלוי לב לגבי היכן היא מפסידה. בהערכה המשווה של המעבדה, MiniMax H3 ו-Dreamina Seedance 2.0 מועדפים לפי קריטריונים חזותיים בפערים משמעותיים, והמודל מתואר כתחרותי ולא כמוביל. הטענה שראויה להתייחסות רצינית היא צרה יותר ושימושית יותר: מול Kling 2.6 ו-Veo 3.1 Fast התוצאות נוטות לכאן ולכאן, קריטריון אחר קריטריון, ו-Kandinsky 6.0 Video נשאר תחרותי באיכות דיבור ובסנכרון אודיו-וידאו, כאשר חלק גדול מההשוואות מסתיימות בתיקו.

חמש-עשרה שניות מול חמש, ומה עולה להגיע לכל אחת מהן

• אורך קליפ מקסימלי — Grok Imagine Video: עד 15 שניות. Kandinsky 6.0 Video: 5 שניות קבוע, 121 פריימים ב-24 fps, אין מצב הארכה במהדורה.

• רזולוציה — Grok Imagine Video: עד 1080p. Kandinsky 6.0 Video: SD, HD ו-Full HD באמצעות מודל סופר-רזולוציה ייעודי, הגדלות x2, x4 או x2.25 של קליפים באורך חמש שניות.

קלט ייחוס — Grok Imagine Video: יצירה מותנית-ייחוס ממספר תמונות לשם עקביות דמות, בתוספת הוספה/הסרה/החלפה של אובייקטים. Kandinsky 6.0 Video: תמונה אחת, המיושמת כפריים זנב עם מסכה.

• תמחור — Grok Imagine Video: לפי שנייה של פלט, מהקצה התחתון של הטווח ועד $0.30/שנייה ב-1080p, עם חיוב נוסף לכל קלט תמונה; גישה חינמית מצויה מאחורי שכבות מנוי של X. Kandinsky 6.0 Video: אין — אין שירות, אין תעריף, רק זמן ה-GPU שאתה מספק.

• משקלים — Grok Imagine Video: לא. Kandinsky 6.0 Video: MIT, Pro ו-Lite, עם אינטגרציה של diffusers.

הפרמיה עבור הגרסה החדשה יותר של Grok היא המספר שכדאי להקיף בעיגול. המעבר מגרסת ינואר ל-1.5 עולה פי שניים לדקה בלוח של תמונה לווידאו ומקנה 26 Elo. זה שיפור אמיתי במחיר אמיתי, וזו אותה עסקה שכל ספק וידאו מבקש מהקונים לעשות כרגע.

היכן נתב מתאים, והיכן לא

OrcaRouter אינו מספק את Grok Imagine Video או את Kandinsky 6.0 Video, ואין כאן שום טענה אחרת: את Kandinsky תורידו ותריצו בעצמכם, ואת Grok Imagine Video משיגים דרך המשטחים של xAI עצמה. מה שצינור עיבוד הבנוי על אחד מהמודלים האלה צריך מהנתב הוא הטקסט שמקיף את הרינדור — רשימת השוטים, הרחבת הפרומפט שהופכת רעיון לכיתוב הארוך או הקצר שהמודלים האלה אומנו עליו, עבודת הכיתוב והתמלול, וסיכומי הסקירה שקובעים איזו יצירה נשמרת. אלה רצים על נקודת קצה אחת תואמת OpenAI על פני יותר מ-200 מודלים טקסטואליים במחיר המחירון של הספק עם 0% תוספת, כך שהפחתת מחיר מצד ספק פעילה על אותו מפתח ביום שהיא יוצאת, עם מעבר אוטומטי לגיבוי בעת כשל כך שקריאה שנכשלה באמצע תור רינדור מנותבת מחדש במקום לתקוע את האצווה. התזמור סביב מודל וידאו הוא בעיית ניתוב גם כשמודל הווידאו עצמו אינו ניתן לניתוב, וזה המצב בשניהם היום.

איזה מהם, ולשם מה?

היעזרו ב-Grok Imagine Video כשהעבודה היא בכמויות: קליפים לרשתות חברתיות, איטרציות מהירות, שוט שתייצרו מחדש שש פעמים עד שיהיה נכון, ודדליין שלא נמתח. המחיר לכל ניסיון הוא המוצר, והעובדה שהוא ממוקם כעת באמצע הטבלה ולא בצמרת היא המחיר הרגיל של קטגוריה שמתקדמת בכזו מהירות.

פנו ל-Kandinsky 6.0 Video כשהעבודה היא צינור ייצור: יחידה קבועה של חמש שניות שאפשר לעבד באצווה, מעבר מתמונה לווידאו שבו הנאמנות לתמונת מקור שסופקה היא מה שחשוב, דיבור שאתם מתכוונים שיהיה מובן, ותוצר שהייתם מעדיפים שלא לשכור. תקצבו את הרינדור, צפו לרינדור איטי בכל דבר ברמת צרכן, והתייחסו לכל נתון איכות במאמר הזה כאל נתון של Sber עצמה עד שמישהו מחוץ למעבדה ייתן לו ציון.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

מה שהופך את הזיווג לשווה לצפייה הוא מי מהשניים יכול לספוג רבעון רע. אם Grok Imagine Video יידרדר עוד יותר בזירה, התשובה היא מודל טוב יותר ומחיר חדש — כך עובדת הקטגוריה, ו-xAI כבר הראתה שהיא תשיק אחד כזה. אם Kandinsky 6.0 Video יתגלה כאמצע הטבלה לאחר שיוצמד לו ציון, ה-checkpoint עדיין קיים, עדיין רץ ועדיין ניתן לכוונן; שום דבר ברישיון לא משתנה עם המספר. אלה סוגים שונים של עמידות, ורק אחד מהם נמדד על ידי Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.