Een gegenereerde titelkaart met de tekst 'Kandinsky 6.0 Video vs Grok Imagine Video' en de ondertitel 'De ranglijst is omgegooid', boven een rij pictogrammen met de labels 'Videogeneratie', 'Gesynchroniseerde audio' en 'Open-weight-implementatie'. Het OrcaRouter-logo staat in de rechteronderhoek.
Guides & Insights

Kandinsky 6.0 Video vs Grok Imagine Video: De ranglijst is omgeslagen

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

In januari 2026, toen Grok Imagine Video werd gelanceerd, voerde het de video-arena van Artificial Analysis aan in beide modi. Vandaag plaatst dezelfde ranglijst zijn huidige build op de elfde of twaalfde plek in text-to-video. Dat is geen schandaal en het is geen mislukking — het is wat er gebeurt met een zich snel ontwikkelende categorie in negen maanden, en het is de eerlijke reden om het generatiemodel van xAI te vergelijken met Kandinsky 6.0 Video op dit moment. Een van hen is een dienst die is geoptimaliseerd voor hoe snel je nog een clip kunt produceren; de andere is een MIT-gelicentieerd checkpoint, 29B parameters in de Pro-grootte en 3B in de Lite, uitgebracht door Sber's Kandinsky Lab in de eerste week van oktober 2026, dat vijf seconden video genereert met gesynchroniseerde 44 kHz-audio en lip-sync. De interessante vraag is niet welke van de twee voorloopt op een ranglijst — het is wat elk van hen structureel gezien hierna kan doen.

Het bord dat eronder bewoog

Grok Imagine Video is xAI's generatiemodel, voor het eerst uitgebracht op 29 januari 2026 en sinds 16 juni stabiel op versie 1.5. Op de tekst-naar-video-ranglijst van Artificial Analysis staat de 1.5-build op de 11e–12e plaats met een Elo van 1.045 (±9) over 4.056 stemmen, vermeld voor $15,00 per minuut. De oorspronkelijke build staat niet op die ranglijst.

Image-to-video is waar de familie sterker is, en waar de twee builds zich scheiden op een manier die het waard is zorgvuldig te lezen:

• grok-imagine-video-1.5 — 7e–9e, Elo 1.098 (±8), 5.267 stemmen, $8,40/min.

• grok-imagine-video (de januari-build) — 12e–17e, Elo 1.072 (±7), 14.371 stemmen, $4,20/min.

• Ter vergelijking: de top van die I2V-ranglijst — MiniMax H3 Max — staat op Elo 1.195 (±9) met 5.894 stemmen, en Wan 3.0 staat zesde met 1.164.

Hier volgen twee lezingen, en beide zijn waar. De nieuwere build van xAI ligt op beeld-naar-video echt 26 Elo voor op zijn eigen voorganger, en het kost per minuut twee keer zoveel om dat te zijn. En het verhaal van de lanceringsweek – een model dat bovenaan binnenkwam – heeft geen stand gehouden: het veld bewoog, de arena verzamelde tienduizenden stemmen verdeeld over een dozijn nieuwere systemen, en een positie in de middenmoot is waar negen maanden competitie een snelle, algemeen inzetbare generator neerzet.

Kandinsky 6.0 Video heeft op geen enkele ranglijst een Elo. Het bewijs ervoor bestaat uit een VABench-run en een door het lab uitgevoerde menselijke evaluatie, beide gepubliceerd door Sber, en geen van beide buiten Sber gereproduceerd. Een ongeauditeerd open model naast een gescoord commercieel model plaatsen is precies de vergelijking die je met zorg moet behandelen: de positie van het gescoorde model is reëel en onflatteus, en de positie van het niet-gescoorde model is onbekend. "Onbekend" is niet "beter".

Twee soorten snelheid, en slechts één ervan wordt in seconden gemeten

Het ontwerpdoel van Grok Imagine Video is doorvoer per creator. Het is geïntegreerd in X, het levert een afgewerkte clip met geluid terug, en de functieset leest als een lijst van dingen die mensen daadwerkelijk in een feed doen: meerdere beeldverhoudingen, camerabeweging, objecten toevoegen, verwijderen en verwisselen, stijloverdracht, referentiegeconditioneerde generatie op basis van meerdere afbeeldingen voor personageconsistentie, native audio met dialoog, effecten en muziek. De clipduur loopt op tot vijftien seconden, de resolutie gaat tot maximaal 1080p. Het hele product is zo gebouwd dat een tweede poging je een paar minuten en een paar cent kost.

Kandinsky 6.0 Video is snel in een andere zin — niet per poging, maar per eenheid eigendom. Niets eraan is onmiddellijk. De eigen werktijden van de repository voor het niet-gedistilleerde model, na opwarming en exclusief het laden van gewichten en MP4-codering, brengen een Pro Full HD-clip van vijf seconden op ongeveer 402 seconden op een H100, 854 op een RTX 5090, 1.247 op een RTX 4090 en 3.530 op een RTX 5060 Ti. Lite Full HD is 284 seconden op een H100. Het hulpmiddel dat dat draaglijk maakt, is het gedistilleerde checkpoint, dat de paper op gelijke hoogte met het volledige model mat — verkozen of gelijk op de meerderheid van de criteria, gemiddelde voorkeur 51% tegen 49%, geen enkel individueel verschil dat significantie bereikte. Wat je in ruil voor de trage render krijgt, is een model op je eigen schijf zonder dat er überhaupt een teller per clip meeloopt.

Dat is de werkelijke vorm van deze confrontatie. Grok Imagine Video optimaliseert de kosten van de tiende poging. Kandinsky 6.0 Video optimaliseert de kosten van de tienduizendste, en laat je voor de eerste betalen in hardware en geduld.

Beide genereren audio — en het is niet dezelfde bewering.

Dit is de as waarop een luie vergelijking "gelijkspel" zou zeggen en ernaast zou zitten.

Grok Imagine Video produceert native audio met dialoog, effecten en muziek als één functie onder vele. Het is een generator voor algemene doeleinden die toevallig ook geluid bevat.

Kandinsky 6.0 Video is gebouwd rond geluid. De architectuur is een dual-stream CrossDiT die een videostream, geïnitialiseerd vanuit Kandinsky 5.0 Video, koppelt aan een audiostream die vanaf nul is getraind op grote audiocorpora, verbonden door bidirectionele cross-attentie en gezamenlijk getraind. De output is 44 kHz met expliciete lip-sync, en naar verluidt verlaagt de reinforcement-learningfase van het artikel het woordfoutpercentage van gegenereerde spraak met 47% — gemeten met Whisper-large-v3, dat een van de RL-beloningsmodellen is, een detail dat van belang is omdat het artikel een tweede, niet-vergelijkbare WER rapporteert naast VABench met behulp van Qwen3-ASR-1.7B. Spraak is waarop het model is nagetraind.

Daar staat tegenover dat Sber's eigen onderzoek openhartig is over waar het verliest. In de side-by-side-evaluatie van het lab krijgen MiniMax H3 en Dreamina Seedance 2.0 de voorkeur op visuele criteria, met aanzienlijke marges, en het model wordt omschreven als concurrerend in plaats van als koploper. De bewering die serieus moet worden genomen is nauwer en nuttiger: tegenover Kling 2.6 en Veo 3.1 Fast wisselen de resultaten per criterium, en Kandinsky 6.0 Video blijft concurrerend op spraakkwaliteit en audio-videosynchronisatie, waar een groot deel van de vergelijkingen gelijk eindigt.

Vijftien seconden tegen vijf, en wat elk kost om te bereiken.

• Max. clip — Grok Imagine Video: tot 15s. Kandinsky 6.0 Video: 5s vast, 121 frames bij 24 fps, geen extensiemodus in deze release.

• Resolutie — Grok Imagine Video: tot 1080p. Kandinsky 6.0 Video: SD, HD en Full HD via een speciaal superresolutiemodel, x2-, x4- of x2,25-upscalingen van clips van vijf seconden.

• Referentie-invoer — Grok Imagine Video: referentiegeconditioneerde generatie op basis van meerdere afbeeldingen voor consistentie van personages, plus objecten toevoegen/verwijderen/omwisselen. Kandinsky 6.0 Video: één afbeelding, toegepast als een gemaskeerd staartframe.

• Prijzen — Grok Imagine Video: per seconde output, van de onderkant van het bereik tot $0,30/s bij 1080p, met een extra toeslag per afbeeldingsinvoer; gratis toegang zit achter X-abonnementsniveaus. Kandinsky 6.0 Video: geen — geen dienst, geen tarief, alleen de GPU-tijd die je zelf levert.

• Gewichten — Grok Imagine Video: nee. Kandinsky 6.0 Video: MIT, Pro en Lite, met diffusers-integratie.

De meerprijs voor de nieuwere Grok-build is het getal om te omcirkelen. De overstap van de januari-build naar 1.5 kost twee keer zoveel per minuut op de image-to-video-ranglijst en levert 26 Elo op. Dat is een echte verbetering tegen een echte prijs, en het is dezelfde afweging die elke videoaanbieder kopers nu vraagt te maken.

Waar een router past, en waar niet

OrcaRouter serveert Grok Imagine Video of Kandinsky 6.0 Video niet, en niets hier beweert het tegendeel: Kandinsky kun je zelf downloaden en draaien, Grok Imagine Video bereik je via de eigen interfaces van xAI. Wat een pipeline die op een van beide modellen is gebouwd van een router nodig heeft, is de tekst eromheen — de shotlist, de promptuitbreiding die een idee omzet in het lange of korte bijschrift waarmee deze modellen zijn getraind, het bijschrift- en transcriptiewerk, en de beoordelingssamenvattingen die bepalen welke generatie wordt behouden. Die draaien op één OpenAI-compatibel endpoint voor meer dan 200 tekstmodellen tegen providerlijstprijs met 0% markup, zodat een vendor-release dezelfde dag nog live staat op dezelfde key, met automatische failover, zodat een mislukte aanroep midden in een renderwachtrij wordt omgeleid in plaats van de batch te laten vastlopen. De orchestratie rond een videomodel is een routeringsprobleem, zelfs wanneer het videomodel zelf niet routeerbaar is, wat vandaag voor beide het geval is.

Welke, en waarvoor?

Kies Grok Imagine Video wanneer het werk volume is: socialclips, snelle iteraties, een shot dat je zes keer opnieuw genereert voordat het goed is, en een deadline die niet opschuift. De prijs per poging is het product, en het feit dat het nu in de middenmoot staat in plaats van bovenaan is de normale prijs van een categorie die zo snel beweegt.

Kies Kandinsky 6.0 Video wanneer het werk een pipeline is: een vaste eenheid van vijf seconden die je kunt batchen, een image-to-video-pass waarbij trouw aan een aangeleverde still het belangrijkste is, spraak die je verstaanbaar wilt laten zijn, en een deliverable die je liever niet huurt. Begroot de render, verwacht een langzame render op alles van consumentenniveau, en beschouw elk kwaliteitscijfer in dit stuk als dat van Sber zelf totdat iemand buiten het lab het beoordeelt.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

Wat het tweetal de moeite waard maakt om te volgen, is welke van de twee een slecht kwartaal kan opvangen. Als Grok Imagine Video verder wegzakt in de arena, is het antwoord een beter model en een nieuwe prijs — zo werkt deze categorie en xAI heeft al laten zien dat het er een zal uitbrengen. Als Kandinsky 6.0 Video een middenmoter blijkt te zijn zodra het wordt beoordeeld, bestaat de checkpoint nog steeds, draait hij nog steeds en is hij nog steeds te fine-tunen; niets aan de licentie verandert door het nummer. Dat zijn verschillende soorten duurzaamheid, en slechts één ervan wordt gemeten door Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.