
Kandinsky 6.0 Video נגד Grok Imagine Video: טבלת המובילים התהפכה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 150 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
בינואר 2026, כאשר Grok Imagine Video הושק, הוא עמד בראש זירת הווידאו של Artificial Analysis בשני המצבים. היום אותו לוח מציב את הגרסה הנוכחית שלו במקום האחד-עשר או השנים-עשר בטקסט-לווידאו. זו אינה שערורייה וזה אינו כישלון — זה מה שקורה לקטגוריה שנעה במהירות בתוך תשעה חודשים, וזו הסיבה הכנה להשוות את מודל היצירה של xAI עם Kandinsky 6.0 Video ממש עכשיו. אחד מהם הוא שירות שממוטב למהירות שבה אפשר לייצר עוד קליפ; האחר הוא צ'ק-פוינט ברישיון MIT, עם 29 מיליארד פרמטרים בגרסת Pro ו-3 מיליארד ב-Lite, שהושק על ידי מעבדת Kandinsky של Sber בשבוע הראשון של אוקטובר 2026, ומייצר חמש שניות של וידאו עם אודיו מסונכרן ב-44 קילו-הרץ וסנכרון שפתיים. השאלה המעניינת אינה מי מהם מוביל בלוח — אלא מה כל אחד מהם מסוגל לעשות מבחינה מבנית בשלב הבא.
הלוח שזז מתחתיו
Grok Imagine Video הוא מודל היצירה של xAI, שיצא לראשונה ב-29 בינואר 2026 ויציב בגרסה 1.5 מאז 16 ביוני. בלוח המובילים של טקסט-לווידאו של Artificial Analysis, גרסת ה-1.5 שלו ניצבת במקומות 11–12 עם Elo 1,045 (±9) מתוך 4,056 הצבעות, ומחירה רשום כ-$15.00 לדקה. הגרסה המקורית אינה מופיעה בלוח זה.
מתמונה לווידאו הוא התחום שבו המשפחה חזקה יותר, ושבו שני הבילדים נבדלים באופן ששווה לקרוא בעיון:
• grok-imagine-video-1.5 — מקומות 7–9, Elo 1,098 (±8), 5,267 הצבעות, $8.40 לדקה.
• grok-imagine-video (מהדורת ינואר) — 12–17 בינואר, Elo 1,072 (±7), 14,371 הצבעות, $4.20 לדקה.
• לשם קנה מידה, המקום הראשון בטבלת ה-I2V הזו — MiniMax H3 Max — נמצא ב-Elo 1,195 (±9) מתוך 5,894 הצבעות, ו-Wan 3.0 הוא השישי עם 1,164.
להלן שתי קריאות, ושתיהן נכונות. הגרסה החדשה יותר של xAI אכן מקדימה את קודמתה שלה במשימת תמונה לווידאו, ב-26 Elo, והיא עולה פי שניים לדקה כדי להיות כך. וסיפור שבוע ההשקה — מודל שהגיע לפסגה — לא החזיק מעמד: התחום זז, הזירה צברה עשרות אלפי הצבעות על פני תריסר מערכות חדשות יותר, ומיקום באמצע הטבלה הוא היכן שתשעה חודשי תחרות מציבים מחולל מהיר ורב-תכליתי.
אין ל-Kandinsky 6.0 Video שום Elo באף לוח. הראיות שלו הן ריצת VABench והערכה אנושית שבוצעה במעבדה, שתיהן פורסמו על ידי Sber, ואף אחת מהן לא שוחזרה מחוץ ל-Sber. הצבת מודל פתוח שלא עבר ביקורת לצד מודל מסחרי עם ציון היא בדיוק ההשוואה שיש להתייחס אליה בזהירות: מיקומו של המודל עם הציון הוא אמיתי ולא מחמיא, ומיקומו של המודל ללא ציון אינו ידוע. "לא ידוע" אינו "טוב יותר".
שני סוגים של "fast", ורק אחד מהם נמדד בשניות
מטרת העיצוב של Grok Imagine Video היא תפוקה לכל יוצר. הוא מחובר ישירות ל-X, הוא מחזיר קליפ מוגמר עם סאונד, ומערך התכונות שלו נקרא כמו רשימה של דברים שאנשים באמת עושים בפיד: יחסי גובה-רוחב מרובים, תנועת מצלמה, הוספה, הסרה והחלפה של אובייקטים, העברת סגנון, יצירה מותנית בהפניות מכמה תמונות לשם עקביות דמות, אודיו מקורי עם דיאלוג, אפקטים ומוזיקה. אורך הקליפ מגיע עד חמש עשרה שניות, והרזולוציה מגיעה עד 1080p. המוצר כולו בנוי כך שניסיון שני עולה לך כמה דקות וכמה סנטים.
Kandinsky 6.0 Video מהיר במובן אחר — לא לפי ניסיון, אלא לפי יחידת בעלות. שום דבר בו אינו מיידי. זמני העבודה של המאגר עצמו עבור המודל שאינו מזוקק, לאחר חימום ולא כולל טעינת משקלים וקידוד MP4, מציבים קליפ Pro Full HD באורך חמש שניות על כ-402 שניות ב-H100, 854 ב-RTX 5090, 1,247 ב-RTX 4090 ו-3,530 ב-RTX 5060 Ti. Lite Full HD עומד על 284 שניות ב-H100. הכלי שהופך זאת לנסבל הוא הצ'קפוינט המזוקק, שאותו מדד המאמר בשוויון עם המודל המלא — מועדף או בשוויון ברוב הקריטריונים, העדפה ממוצעת של 51% מול 49%, כאשר אף הבדל בודד לא הגיע למובהקות. מה שמקבלים בתמורה לרינדור האיטי הוא מודל על הדיסק שלך בלי שום מונה לכל קליפ שפועל בכלל.
זו הצורה האמיתית של ההתמודדות הזו. Grok Imagine Video מבצע אופטימיזציה של העלות של הניסיון העשירי. Kandinsky 6.0 Video מבצע אופטימיזציה של העלות של הניסיון העשרת־אלפים, וגובה ממך מחיר בחומרה ובסבלנות עבור הראשון.
שניהם מייצרים אודיו — והם לא אותה טענה
זהו הציר שבו השוואה עצלה הייתה אומרת "תיקו" וטועה.
Grok Imagine Video מייצר אודיו מקורי עם דיאלוג, אפקטים ומוזיקה כאחד מהמאפיינים הרבים שלו. זהו מחולל למטרות כלליות שבמקרה כולל גם סאונד.
Kandinsky 6.0 Video בנוי סביב סאונד. הארכיטקטורה היא CrossDiT דו-זרמי, המזווגת זרם וידאו שאותחל מ-Kandinsky 5.0 Video עם זרם אודיו שאומן מאפס על קורפוסי אודיו גדולים, המחוברים בקשב צולב דו-כיווני ומאומנים יחד. הפלט הוא 44 kHz עם סינכרון שפתיים מפורש, ומדווח ששלב למידת החיזוק של המאמר מפחית את שיעור שגיאות המילים של הדיבור הנוצר ב-47% — נמדד באמצעות Whisper-large-v3, שהוא אחד ממודלי התגמול של RL, פרט שחשוב משום שהמאמר מדווח על WER שני, שאינו בר-השוואה, לצד VABench תוך שימוש ב-Qwen3-ASR-1.7B. דיבור הוא הדבר שעליו עבר המודל אימון-המשך.
לעומת זאת, המחקר של Sber עצמה גלוי לב לגבי היכן היא מפסידה. בהערכה המשווה של המעבדה, MiniMax H3 ו-Dreamina Seedance 2.0 מועדפים לפי קריטריונים חזותיים בפערים משמעותיים, והמודל מתואר כתחרותי ולא כמוביל. הטענה שראויה להתייחסות רצינית היא צרה יותר ושימושית יותר: מול Kling 2.6 ו-Veo 3.1 Fast התוצאות נוטות לכאן ולכאן, קריטריון אחר קריטריון, ו-Kandinsky 6.0 Video נשאר תחרותי באיכות דיבור ובסנכרון אודיו-וידאו, כאשר חלק גדול מההשוואות מסתיימות בתיקו.
חמש-עשרה שניות מול חמש, ומה עולה להגיע לכל אחת מהן
• אורך קליפ מקסימלי — Grok Imagine Video: עד 15 שניות. Kandinsky 6.0 Video: 5 שניות קבוע, 121 פריימים ב-24 fps, אין מצב הארכה במהדורה.
• רזולוציה — Grok Imagine Video: עד 1080p. Kandinsky 6.0 Video: SD, HD ו-Full HD באמצעות מודל סופר-רזולוציה ייעודי, הגדלות x2, x4 או x2.25 של קליפים באורך חמש שניות.
קלט ייחוס — Grok Imagine Video: יצירה מותנית-ייחוס ממספר תמונות לשם עקביות דמות, בתוספת הוספה/הסרה/החלפה של אובייקטים. Kandinsky 6.0 Video: תמונה אחת, המיושמת כפריים זנב עם מסכה.
• תמחור — Grok Imagine Video: לפי שנייה של פלט, מהקצה התחתון של הטווח ועד $0.30/שנייה ב-1080p, עם חיוב נוסף לכל קלט תמונה; גישה חינמית מצויה מאחורי שכבות מנוי של X. Kandinsky 6.0 Video: אין — אין שירות, אין תעריף, רק זמן ה-GPU שאתה מספק.
• משקלים — Grok Imagine Video: לא. Kandinsky 6.0 Video: MIT, Pro ו-Lite, עם אינטגרציה של diffusers.
הפרמיה עבור הגרסה החדשה יותר של Grok היא המספר שכדאי להקיף בעיגול. המעבר מגרסת ינואר ל-1.5 עולה פי שניים לדקה בלוח של תמונה לווידאו ומקנה 26 Elo. זה שיפור אמיתי במחיר אמיתי, וזו אותה עסקה שכל ספק וידאו מבקש מהקונים לעשות כרגע.
היכן נתב מתאים, והיכן לא
OrcaRouter אינו מספק את Grok Imagine Video או את Kandinsky 6.0 Video, ואין כאן שום טענה אחרת: את Kandinsky תורידו ותריצו בעצמכם, ואת Grok Imagine Video משיגים דרך המשטחים של xAI עצמה. מה שצינור עיבוד הבנוי על אחד מהמודלים האלה צריך מהנתב הוא הטקסט שמקיף את הרינדור — רשימת השוטים, הרחבת הפרומפט שהופכת רעיון לכיתוב הארוך או הקצר שהמודלים האלה אומנו עליו, עבודת הכיתוב והתמלול, וסיכומי הסקירה שקובעים איזו יצירה נשמרת. אלה רצים על נקודת קצה אחת תואמת OpenAI על פני יותר מ-200 מודלים טקסטואליים במחיר המחירון של הספק עם 0% תוספת, כך שהפחתת מחיר מצד ספק פעילה על אותו מפתח ביום שהיא יוצאת, עם מעבר אוטומטי לגיבוי בעת כשל כך שקריאה שנכשלה באמצע תור רינדור מנותבת מחדש במקום לתקוע את האצווה. התזמור סביב מודל וידאו הוא בעיית ניתוב גם כשמודל הווידאו עצמו אינו ניתן לניתוב, וזה המצב בשניהם היום.
איזה מהם, ולשם מה?
היעזרו ב-Grok Imagine Video כשהעבודה היא בכמויות: קליפים לרשתות חברתיות, איטרציות מהירות, שוט שתייצרו מחדש שש פעמים עד שיהיה נכון, ודדליין שלא נמתח. המחיר לכל ניסיון הוא המוצר, והעובדה שהוא ממוקם כעת באמצע הטבלה ולא בצמרת היא המחיר הרגיל של קטגוריה שמתקדמת בכזו מהירות.
פנו ל-Kandinsky 6.0 Video כשהעבודה היא צינור ייצור: יחידה קבועה של חמש שניות שאפשר לעבד באצווה, מעבר מתמונה לווידאו שבו הנאמנות לתמונת מקור שסופקה היא מה שחשוב, דיבור שאתם מתכוונים שיהיה מובן, ותוצר שהייתם מעדיפים שלא לשכור. תקצבו את הרינדור, צפו לרינדור איטי בכל דבר ברמת צרכן, והתייחסו לכל נתון איכות במאמר הזה כאל נתון של Sber עצמה עד שמישהו מחוץ למעבדה ייתן לו ציון.


מה שהופך את הזיווג לשווה לצפייה הוא מי מהשניים יכול לספוג רבעון רע. אם Grok Imagine Video יידרדר עוד יותר בזירה, התשובה היא מודל טוב יותר ומחיר חדש — כך עובדת הקטגוריה, ו-xAI כבר הראתה שהיא תשיק אחד כזה. אם Kandinsky 6.0 Video יתגלה כאמצע הטבלה לאחר שיוצמד לו ציון, ה-checkpoint עדיין קיים, עדיין רץ ועדיין ניתן לכוונן; שום דבר ברישיון לא משתנה עם המספר. אלה סוגים שונים של עמידות, ורק אחד מהם נמדד על ידי Elo.

