Eine generierte Titelkarte mit der Aufschrift „Kandinsky 6.0 Video vs Grok Imagine Video“ und dem Untertitel „Die Rangliste wurde umgedreht“, über einer Symbolreihe mit den Bezeichnungen „Videogenerierung“, „Synchronisiertes Audio“ und „Open-Weight-Bereitstellung“. Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Guides & Insights

Kandinsky 6.0 Video vs. Grok Imagine Video: Das Leaderboard wurde umgedreht

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Im Januar 2026, als Grok Imagine Videoauf den Markt kam, führte es die Video-Arena von Artificial Analysis in beiden Modi an. Heute platziert dieselbe Rangliste seine aktuelle Version auf Platz elf oder zwölf bei Text-zu-Video. Das ist kein Skandal und es ist kein Versagen – es ist das, was mit einer sich schnell bewegenden Kategorie in neun Monaten passiert, und es ist der ehrliche Grund für einen Vergleich des Generierungsmodells von xAI mit Kandinsky 6.0 Video jetzt. Eines davon ist ein Dienst, der darauf optimiert ist, wie schnell man einen weiteren Clip produzieren kann; das andere ist ein MIT-lizenzierter Checkpoint, 29B Parameter in der Pro-Größe und 3B in der Lite-Version, veröffentlicht vom Kandinsky Lab von Sber in der ersten Oktoberwoche 2026, der fünf Sekunden Video mit synchronisiertem 44-kHz-Audio und Lip-Sync erzeugt. Die interessante Frage ist nicht, welches auf einer Rangliste vorne liegt – sondern, wozu jedes strukturell als Nächstes fähig ist.

Das Brett, das sich darunter bewegte

Grok Imagine Video ist das Generierungsmodell von xAI, erstmals veröffentlicht am 29. Januar 2026 und seit dem 16. Juni stabil in Version 1.5. In der Text-to-Video-Rangliste von Artificial Analysis liegt sein 1.5-Build mit Elo 1.045 (±9) bei 4.056 Stimmen auf Platz 11–12 und ist mit 15,00 $ pro Minute gelistet. Der ursprüngliche Build ist nicht in dieser Rangliste enthalten.

Bild-zu-Video ist der Bereich, in dem die Familie stärker ist, und in dem die beiden Builds auf eine Weise auseinandergehen, die eine sorgfältige Lektüre verdient:

• grok-imagine-video-1.5 — 7.–9., Elo 1.098 (±8), 5.267 Stimmen, 8,40 $/Min.

• grok-imagine-video (der Januar-Build) — 12.–17., Elo 1.072 (±7), 14.371 Stimmen, 4,20 $/Min.

• Zum Vergleich: Die Spitze dieses I2V-Boards – MiniMax H3 Max – liegt bei 5.894 Stimmen auf Elo 1.195 (±9), und Wan 3.0 steht mit 1.164 auf Platz sechs.

Es folgen zwei Lesarten, und beide sind wahr. Der neuere Build von xAI liegt bei Bild-zu-Video tatsächlich um 26 Elo vor seinem eigenen Vorgänger – und kostet pro Minute doppelt so viel dafür. Und die Geschichte der Startwoche – ein Modell, das an der Spitze ankam – hat sich nicht gehalten: Das Feld bewegte sich, die Arena hat über ein Dutzend neuere Systeme hinweg Zehntausende Stimmen angesammelt, und eine Mittelfeldposition ist das, wohin neun Monate Wettbewerb einen schnellen Allzweck-Generator bringen.

Kandinsky 6.0 Video hat auf keiner Rangliste einen Elo-Wert. Seine Belege sind ein VABench-Durchlauf und eine von einem Labor durchgeführte menschliche Bewertung, beide von Sber veröffentlicht, keine von beiden außerhalb davon reproduziert. Ein ungeprüftes offenes Modell neben ein bewertetes kommerzielles zu stellen, ist genau der Vergleich, den man mit Vorsicht behandeln sollte: Die Position des bewerteten Modells ist real und wenig schmeichelhaft, und die Position des unbewerteten Modells ist unbekannt. „Unbekannt“ ist nicht „besser“.

Zwei Arten von schnell, und nur eine davon wird in Sekunden gemessen

Das Designziel von Grok Imagine Video ist der Durchsatz pro Creator. Es ist fest in X integriert, liefert einen fertigen Clip mit Ton zurück, und seine Funktionspalette liest sich wie eine Liste der Dinge, die Menschen in einem Feed tatsächlich tun: mehrere Seitenverhältnisse, Kamerabewegung, Objekte hinzufügen, entfernen und austauschen, Style Transfer, referenzkonditionierte Generierung aus mehreren Bildern für Charakterkonsistenz, natives Audio mit Dialogen, Effekten und Musik. Die Cliplänge reicht bis zu fünfzehn Sekunden, die Auflösung liegt bei maximal 1080p. Das gesamte Produkt ist so gebaut, dass ein zweiter Versuch nur ein paar Minuten und ein paar Cent kostet.

Kandinsky 6.0 Video ist auf eine andere Weise schnell – nicht pro Versuch, sondern pro Besitzeinheit. Nichts daran ist augenblicklich. Die eigenen Laufzeiten des Repositorys für das nicht-destillierte Modell – nach dem Warmup und ohne das Laden der Gewichte und die MP4-Kodierung – veranschlagen einen fünfsekündigen Pro-Full-HD-Clip auf ungefähr 402 Sekunden auf einer H100, 854 auf einer RTX 5090, 1.247 auf einer RTX 4090 und 3.530 auf einer RTX 5060 Ti. Lite Full HD liegt bei 284 Sekunden auf einer H100. Das Werkzeug, das das erträglich macht, ist der destillierte Checkpoint, den das Paper auf Augenhöhe mit dem vollständigen Modell maß – bevorzugt oder gleichauf bei der Mehrheit der Kriterien, mittlere Präferenz 51 % zu 49 %, wobei kein Einzelunterschied Signifikanz erreichte. Was du im Austausch für das langsame Rendern bekommst, ist ein Modell auf deiner eigenen Festplatte, bei dem überhaupt kein Zähler pro Clip läuft.

Das ist die wahre Gestalt dieses Duells. Grok Imagine Video optimiert die Kosten des zehnten Versuchs. Kandinsky 6.0 Video optimiert die Kosten des zehntausendsten und verlangt für den ersten Hardware und Geduld.

Beide erzeugen Audio — und das ist nicht dieselbe Aussage.

Dies ist die Achse, bei der ein oberflächlicher Vergleich "Unentschieden" sagen würde – und damit falsch läge.

Grok Imagine Video erzeugt natives Audio mit Dialogen, Effekten und Musik als eine Funktion unter vielen. Es ist ein Allzweckgenerator, der zufällig auch Ton enthält.

Kandinsky 6.0 Video ist um Klang herum aufgebaut. Die Architektur ist ein Dual-Stream-CrossDiT, das einen aus Kandinsky 5.0 Video initialisierten Videostream mit einem von Grund auf auf großen Audiokorpora trainierten Audiostream paart, verbunden durch bidirektionale Cross-Attention und gemeinsam trainiert. Die Ausgabe erfolgt mit 44 kHz und explizitem Lip-Sync, und die Reinforcement-Learning-Phase des Papers soll die Wortfehlerrate von generierter Sprache um 47 % senken — gemessen mit Whisper-large-v3, einem der RL-Reward-Modelle, ein Detail, das wichtig ist, weil das Paper eine zweite, nicht vergleichbare WER neben VABench unter Verwendung von Qwen3-ASR-1.7B berichtet. Sprache ist das, worauf das Modell nachtrainiert wurde.

Dagegen ist Sbers eigene Studie offen darüber, wo sie verliert. In der Side-by-Side-Bewertung des Labors werden MiniMax H3 und Dreamina Seedance 2.0 bei visuellen Kriterien mit beträchtlichen Vorsprüngen bevorzugt, und das Modell wird eher als wettbewerbsfähig denn als führend beschrieben. Die Behauptung, die es wert ist, ernst genommen zu werden, ist enger gefasst und nützlicher: Gegenüber Kling 2.6 und Veo 3.1 Fast wechseln sich die Ergebnisse Kriterium für Kriterium ab, und Kandinsky 6.0 Video bleibt bei Sprachqualität und Audio-Video-Synchronisation wettbewerbsfähig, bei denen ein großer Teil der Vergleiche unentschieden ausgeht.

Fünfzehn Sekunden gegen fünf, und was jedes kostet, um dorthin zu gelangen.

• Maximale Cliplänge — Grok Imagine Video: bis zu 15 s. Kandinsky 6.0 Video: fest 5 s, 121 Frames bei 24 fps, kein Erweiterungsmodus im Release.

• Auflösung — Grok Imagine Video: bis zu 1080p. Kandinsky 6.0 Video: SD, HD und Full HD durch ein dediziertes Super-Resolution-Modell, x2-, x4- oder x2,25-fache Hochskalierung von fünfsekündigen Clips.

• Referenzeingabe — Grok Imagine Video: referenzkonditionierte Generierung aus mehreren Bildern für Charakterkonsistenz, plus Hinzufügen/Entfernen/Austauschen von Objekten. Kandinsky 6.0 Video: ein Bild, angewendet als maskiertes Endframe.

• Preisgestaltung — Grok Imagine Video: pro Sekunde Ausgabe, vom unteren Ende der Spanne bis zu 0,30 $/s bei 1080p, mit einer zusätzlichen Gebühr pro Bildeingabe; kostenloser Zugang ist an X-Abonnementstufen gebunden. Kandinsky 6.0 Video: keine — kein Dienst, kein Tarif, nur die GPU-Zeit, die Sie bereitstellen.

• Gewichte — Grok Imagine Video: nein. Kandinsky 6.0 Video: MIT, Pro und Lite, mit diffusers-Integration.

Der Aufpreis für den neueren Grok-Build ist die Zahl, die man einkreisen sollte. Der Wechsel vom Januar-Build zu 1.5 kostet auf dem Image-to-Video-Board doppelt so viel pro Minute und bringt 26 Elo. Das ist eine echte Verbesserung zu einem echten Preis, und es ist derselbe Kompromiss, den jeder Videoanbieter Käufer gerade jetzt eingehen lässt.

Wo ein Router passt – und wo nicht

OrcaRouter bietet weder Grok Imagine Video noch Kandinsky 6.0 Video an, und nichts hier behauptet das Gegenteil: Kandinsky kannst du selbst herunterladen und ausführen, Grok Imagine Video erreichst du über xAIs eigene Oberflächen. Was eine Pipeline, die auf einem der beiden Modelle aufbaut, von einem Router braucht, ist der Text, der das Rendering umgibt – die Shot-Liste, die Prompt-Erweiterung, die eine Idee in die lange oder kurze Bildbeschreibung verwandelt, auf die diese Modelle trainiert wurden, die Captioning- und Transkriptionsarbeit und die Review-Zusammenfassungen, die entscheiden, welche Generierung behalten wird. Diese laufen auf einem OpenAI-kompatiblen Endpunkt über mehr als 200 Textmodelle zu Listenpreisen des Anbieters mit 0 % Aufschlag, sodass eine Preissenkung eines Anbieters am Tag ihres Inkrafttretens auf demselben Schlüssel live ist, mit automatischem Failover, sodass ein fehlgeschlagener Aufruf mitten in einer Render-Warteschlange umgeleitet wird, anstatt den Batch zu blockieren. Die Orchestrierung rund um ein Videomodell ist ein Routing-Problem, selbst wenn das Videomodell selbst nicht routbar ist, was heute auf beide zutrifft.

Welcher, und wofür?

Greif zu Grok Imagine Video, wenn die Arbeit auf Volumen ausgelegt ist: Social-Clips, schnelle Iterationen, eine Einstellung, die du sechsmal neu generierst, bevor sie stimmt, und eine Deadline, die sich nicht dehnen lässt. Sein Preis pro Versuch ist das Produkt, und die Tatsache, dass es jetzt im Mittelfeld statt an der Spitze steht, sind die normalen Kosten einer Kategorie, die sich so schnell bewegt.

Greifen Sie zu Kandinsky 6.0 Video, wenn die Arbeit eine Pipeline ist: eine feste Fünf-Sekunden-Einheit, die Sie batchen können, ein Image-to-Video-Durchlauf, bei dem die Treue zu einem bereitgestellten Standbild entscheidend ist, Sprache, die verständlich sein soll, und ein Ergebnis, das Sie lieber nicht mieten würden. Planen Sie das Rendern ein, rechnen Sie bei allem auf Consumer-Niveau mit einem langsamen, und behandeln Sie jeden Qualitätswert in diesem Beitrag als Sbers eigenen, bis jemand außerhalb des Labors ihn bewertet.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

Was diese Paarung sehenswert macht, ist die Frage, welche von beiden ein schlechtes Quartal verkraften kann. Wenn Grok Imagine Video in der Arena weiter abrutscht, lautet die Antwort: ein besseres Modell und ein neuer Preis – so funktioniert diese Kategorie, und xAI hat bereits gezeigt, dass es eines ausliefern wird. Wenn sich Kandinsky 6.0 Video als Mittelfeld erweist, sobald es bewertet wird, existiert der Checkpoint weiterhin, läuft weiterhin und lässt sich weiterhin fine-tunen; an der Lizenz ändert sich durch die Zahl nichts. Das sind unterschiedliche Arten von Beständigkeit, und nur eine davon wird durch Elo gemessen.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.