Ett genererat titelkort med texten ”Kandinsky 6.0 Video vs Grok Imagine Video” och undertexten ”Ledartavlan har skiftat”, ovanför en ikonrad märkt ”Videogenerering”, ”Synkroniserat ljud” och ”Driftsättning med öppna vikter”. OrcaRouter-logotypen finns i nedre högra hörnet.
Guides & Insights

Kandinsky 6.0 Video vs Grok Imagine Video: Topplistan vände

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

I januari 2026, när Grok Imagine Video lanserades, toppade den Artificial Analysis videoarena i båda lägena. I dag placerar samma resultattavla dess nuvarande version på elfte eller tolfte plats i text-till-video. Det är inte en skandal och det är inte ett misslyckande – det är vad som händer med en snabbrörlig kategori på nio månader, och det är det ärliga skälet att jämföra xAI:s generationsmodell mot Kandinsky 6.0 Video just nu. En av dem är en tjänst optimerad för hur snabbt du kan producera ännu ett klipp; den andra är en MIT-licensierad checkpoint, 29B parametrar i Pro-storleken och 3B i Lite, släppt av Sbers Kandinsky Lab under den första veckan i oktober 2026, som genererar fem sekunders video med synkroniserat 44 kHz-ljud och läppsynk. Den intressanta frågan är inte vilken av dem som ligger före på en resultattavla – det är vad var och en strukturellt kan göra härnäst.

Brädan som rörde sig under den

Grok Imagine Video är xAI:s generationsmodell, som först släpptes den 29 januari 2026 och har varit stabil i version 1.5 sedan 16 juni. På text-till-video-topplistan hos Artificial Analysis ligger dess 1.5-version på 11:e–12:e plats med Elo 1 045 (±9) över 4 056 röster, listad till $15,00 per minut. Den ursprungliga versionen finns inte med på den listan.

Bild-till-video är där familjen är starkare, och där de två byggena skiljer sig åt på ett sätt som är värt att läsa noggrant:

• grok-imagine-video-1.5 — 7:e–9:e, Elo 1 098 (±8), 5 267 röster, 8,40 $/min.

• grok-imagine-video (januaribuilden) — 12:e–17:e, Elo 1 072 (±7), 14 371 röster, 4,20 $/min.

• Som jämförelse ligger toppen av den där I2V-tavlan — MiniMax H3 Max — på Elo 1 195 (±9) efter 5 894 röster, och Wan 3.0 är sexa på 1 164.

Två tolkningar följer, och båda är sanna. xAI:s nyare version ligger verkligen före sin egen föregångare inom bild-till-video, med 26 Elo, och för att vara det kostar den dubbelt så mycket per minut. Och lanseringsveckans berättelse – en modell som landade i toppen – har inte hållit: fältet förändrades, arenan har samlat tiotusentals röster över ett dussin nyare system, och en placering i mitten av tabellen är där nio månaders konkurrens placerar en snabb, universell generator.

Kandinsky 6.0 Video har inget Elo på någon resultattavla. Dess underlag är en VABench-körning och en laboratorieutförd mänsklig utvärdering, båda publicerade av Sber, och ingen av dem har reproducerats utanför företaget. Att placera en ogranskad öppen modell bredvid en poängsatt kommersiell modell är precis den jämförelse som bör hanteras med försiktighet: den poängsatta modellens position är verklig och ofördelaktig, och den opoängsatta modellens position är okänd. "Okänd" är inte "bättre".

Två slags snabbhet, och bara en av dem mäts i sekunder

Grok Imagine Videos designmål är genomströmning per skapare. Det är inbyggt i X, det levererar tillbaka ett färdigt klipp med ljud, och dess funktionsuppsättning läser som en lista över saker folk faktiskt gör i ett flöde: flera bildförhållanden, kamerarörelse, lägg till, ta bort och byt ut objekt, stilöverföring, referensbetingad generering från flera bilder för karaktärskonsistens, inbyggt ljud med dialog, effekter och musik. Klipplängden är upp till femton sekunder, upplösningen maxar på 1080p. Hela produkten är byggd så att ett andra försök kostar dig ett par minuter och några cent.

Kandinsky 6.0 Video är snabb i en annan bemärkelse – inte per försök, utan per ägandeenhet. Inget med den är omedelbart. Repots egna körtider för den icke-destillerade modellen, efter uppvärmning och exklusive viktladdning och MP4-kodning, hamnar ett fem sekunder långt Pro Full HD-klipp på ungefär 402 sekunder på en H100, 854 på en RTX 5090, 1 247 på en RTX 4090 och 3 530 på en RTX 5060 Ti. Lite Full HD är 284 sekunder på en H100. Verktyget som gör det uthärdligt är den destillerade checkpunkten, som artikeln uppmätte till paritet med den fullständiga modellen – föredragen eller lika på majoriteten av kriterierna, genomsnittlig preferens 51 % mot 49 %, ingen enskild skillnad nådde signifikans. Det du får i utbyte mot den långsamma renderingen är en modell på din egen disk utan någon mätare per klipp som alls är igång.

Det är den verkliga formen av den här duellen. Grok Imagine Video optimerar kostnaden för det tionde försöket. Kandinsky 6.0 Video optimerar kostnaden för det tiotusende, och tar betalt i hårdvara och tålamod för det första.

Båda genererar ljud — och de är inte samma påstående

Det här är axeln där en lat jämförelse skulle säga "oavgjort" och ha fel.

Grok Imagine Video producerar inbyggt ljud med dialog, effekter och musik som en funktion bland många. Det är en generell generator som råkar inkludera ljud.

Kandinsky 6.0 Video bygger på ljud. Arkitekturen är en dubbelströms-CrossDiT som parar en videoström initierad från Kandinsky 5.0 Video med en ljudström tränad från grunden på stora ljudkorpusar, förenade genom dubbelriktad cross-attention och tränade gemensamt. Utdata är 44 kHz med explicit läppsynk, och artikelns förstärkningsinlärningssteg rapporteras minska ordfelsfrekvensen för genererat tal med 47 % — mätt med Whisper-large-v3, som är en av RL-belöningsmodellerna, en detalj som spelar roll eftersom artikeln rapporterar en andra, icke jämförbar WER vid sidan av VABench med Qwen3-ASR-1.7B. Tal är det som modellen eftertränades på.

I kontrast till det är Sbers egen studie öppen med var den förlorar. I labbets utvärdering sida vid sida föredras MiniMax H3 och Dreamina Seedance 2.0 på visuella kriterier med betydande marginaler, och modellen beskrivs som konkurrenskraftig snarare än ledande. Det påstående som är värt att ta på allvar är snävare och mer användbart: mot Kling 2.6 och Veo 3.1 Fast växlar resultaten kriterium för kriterium, och Kandinsky 6.0 Video förblir konkurrenskraftig vad gäller talkvalitet och synkronisering av ljud och bild, där en stor andel av jämförelserna är oavgjorda.

Femton sekunder mot fem, och vad vardera kostar att nå

• Maximalt klipp — Grok Imagine Video: upp till 15 s. Kandinsky 6.0 Video: 5 s fast, 121 bildrutor vid 24 fps, inget förlängningsläge i utgåvan.

• Upplösning — Grok Imagine Video: upp till 1080p. Kandinsky 6.0 Video: SD, HD och Full HD genom en dedikerad superupplösningsmodell, x2, x4 eller x2,25 uppskalningar av femsekundersklipp.

• Referensindata — Grok Imagine Video: referensbetingad generering från flera bilder för karaktärskonsistens, plus tillägg/borttagning/utbyte av objekt. Kandinsky 6.0 Video: en bild, tillämpad som en maskerad sista bildruta.

• Prissättning — Grok Imagine Video: per sekund utdata, från den nedre änden av intervallet upp till 0,30 USD/s vid 1080p, med en extra avgift per bildinmatning; gratisåtkomst ligger bakom X:s prenumerationsnivåer. Kandinsky 6.0 Video: ingen — ingen tjänst, ingen taxa, bara den GPU-tid du själv tillhandahåller.

• Vikter — Grok Imagine Video: nej. Kandinsky 6.0 Video: MIT, Pro och Lite, med diffusers-integration.

Merkostnaden för den nyare Grok-versionen är siffran att ringa in. Att gå från januariversionen till 1.5 kostar dubbelt så mycket per minut på bild-till-video-tavlan och ger 26 Elo. Det är en verklig förbättring till ett verkligt pris, och det är samma avvägning som varje videoleverantör ber köpare att göra just nu.

Var en router passar in, och var den inte gör det

OrcaRouter tillhandahåller inte Grok Imagine Video eller Kandinsky 6.0 Video, och inget här påstår något annat: Kandinsky kan du ladda ner och köra själv, Grok Imagine Video nås via xAI:s egna gränssnitt. Vad en pipeline byggd på endera modellen behöver från en router är texten som omger renderingen — tagninglistan, promptutvidgningen som förvandlar en idé till den långa eller korta bildtext som dessa modeller tränades på, arbetet med bildtextning och transkribering, och de granskningssammanfattningar som avgör vilken generering som behålls. De körs på en OpenAI-kompatibel slutpunkt över 200+ textmodeller till leverantörens listpris med 0 % påslag, så en leverantörsprissänkning är live på samma nyckel samma dag som den lanseras, med automatisk failover så att ett misslyckat anrop mitt i en renderingskö omdirigeras istället för att stoppa hela batchen. Orkestreringen kring en videomodell är ett routingproblem även när videomodellen själv inte är routbar, vilket är fallet för båda dessa idag.

Vilken, och för vad?

Ta till Grok Imagine Video när arbetet handlar om volym: sociala klipp, snabba iterationer, en tagning som du kommer att generera om sex gånger innan den sitter, och en deadline som inte töjs. Dess pris per försök är produkten, och att det nu ligger i mitten av tabellen i stället för i toppen är den normala kostnaden för en kategori som rör sig så här snabbt.

Välj Kandinsky 6.0 Video när arbetet är en pipeline: en fast femsekundersenhet som du kan batcha, en image-to-video-körning där trohet mot en tillhandahållen stillbild är det som avgör, tal som du avser ska vara begripligt, och en leverabel som du helst inte vill hyra. Budgetera för renderingen, förvänta dig en långsam sådan på allt i konsumentklass, och behandla varje kvalitetssiffra i den här artikeln som Sbers egen tills någon utanför labbet betygsätter den.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

Det som gör att paret är värt att titta på är vilken av dem som kan absorbera ett dåligt kvartal. Om Grok Imagine Video halkar längre ned på arenan är svaret en bättre modell och ett nytt pris — så fungerar kategorin, och xAI har redan visat att de kommer att släppa en. Om Kandinsky 6.0 Video visar sig ligga i mitten av tabellen när den har poängsatts, finns checkpointen fortfarande kvar, körs fortfarande och finjusteras fortfarande; inget med licensen förändras med siffran. Det är olika typer av hållbarhet, och bara en av dem mäts av Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.