
Kandinsky 6.0 Video vs Grok Imagine Video: Topplistan vände
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 150 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
I januari 2026, när Grok Imagine Video lanserades, toppade den Artificial Analysis videoarena i båda lägena. I dag placerar samma resultattavla dess nuvarande version på elfte eller tolfte plats i text-till-video. Det är inte en skandal och det är inte ett misslyckande – det är vad som händer med en snabbrörlig kategori på nio månader, och det är det ärliga skälet att jämföra xAI:s generationsmodell mot Kandinsky 6.0 Video just nu. En av dem är en tjänst optimerad för hur snabbt du kan producera ännu ett klipp; den andra är en MIT-licensierad checkpoint, 29B parametrar i Pro-storleken och 3B i Lite, släppt av Sbers Kandinsky Lab under den första veckan i oktober 2026, som genererar fem sekunders video med synkroniserat 44 kHz-ljud och läppsynk. Den intressanta frågan är inte vilken av dem som ligger före på en resultattavla – det är vad var och en strukturellt kan göra härnäst.
Brädan som rörde sig under den
Grok Imagine Video är xAI:s generationsmodell, som först släpptes den 29 januari 2026 och har varit stabil i version 1.5 sedan 16 juni. På text-till-video-topplistan hos Artificial Analysis ligger dess 1.5-version på 11:e–12:e plats med Elo 1 045 (±9) över 4 056 röster, listad till $15,00 per minut. Den ursprungliga versionen finns inte med på den listan.
Bild-till-video är där familjen är starkare, och där de två byggena skiljer sig åt på ett sätt som är värt att läsa noggrant:
• grok-imagine-video-1.5 — 7:e–9:e, Elo 1 098 (±8), 5 267 röster, 8,40 $/min.
• grok-imagine-video (januaribuilden) — 12:e–17:e, Elo 1 072 (±7), 14 371 röster, 4,20 $/min.
• Som jämförelse ligger toppen av den där I2V-tavlan — MiniMax H3 Max — på Elo 1 195 (±9) efter 5 894 röster, och Wan 3.0 är sexa på 1 164.
Två tolkningar följer, och båda är sanna. xAI:s nyare version ligger verkligen före sin egen föregångare inom bild-till-video, med 26 Elo, och för att vara det kostar den dubbelt så mycket per minut. Och lanseringsveckans berättelse – en modell som landade i toppen – har inte hållit: fältet förändrades, arenan har samlat tiotusentals röster över ett dussin nyare system, och en placering i mitten av tabellen är där nio månaders konkurrens placerar en snabb, universell generator.
Kandinsky 6.0 Video har inget Elo på någon resultattavla. Dess underlag är en VABench-körning och en laboratorieutförd mänsklig utvärdering, båda publicerade av Sber, och ingen av dem har reproducerats utanför företaget. Att placera en ogranskad öppen modell bredvid en poängsatt kommersiell modell är precis den jämförelse som bör hanteras med försiktighet: den poängsatta modellens position är verklig och ofördelaktig, och den opoängsatta modellens position är okänd. "Okänd" är inte "bättre".
Två slags snabbhet, och bara en av dem mäts i sekunder
Grok Imagine Videos designmål är genomströmning per skapare. Det är inbyggt i X, det levererar tillbaka ett färdigt klipp med ljud, och dess funktionsuppsättning läser som en lista över saker folk faktiskt gör i ett flöde: flera bildförhållanden, kamerarörelse, lägg till, ta bort och byt ut objekt, stilöverföring, referensbetingad generering från flera bilder för karaktärskonsistens, inbyggt ljud med dialog, effekter och musik. Klipplängden är upp till femton sekunder, upplösningen maxar på 1080p. Hela produkten är byggd så att ett andra försök kostar dig ett par minuter och några cent.
Kandinsky 6.0 Video är snabb i en annan bemärkelse – inte per försök, utan per ägandeenhet. Inget med den är omedelbart. Repots egna körtider för den icke-destillerade modellen, efter uppvärmning och exklusive viktladdning och MP4-kodning, hamnar ett fem sekunder långt Pro Full HD-klipp på ungefär 402 sekunder på en H100, 854 på en RTX 5090, 1 247 på en RTX 4090 och 3 530 på en RTX 5060 Ti. Lite Full HD är 284 sekunder på en H100. Verktyget som gör det uthärdligt är den destillerade checkpunkten, som artikeln uppmätte till paritet med den fullständiga modellen – föredragen eller lika på majoriteten av kriterierna, genomsnittlig preferens 51 % mot 49 %, ingen enskild skillnad nådde signifikans. Det du får i utbyte mot den långsamma renderingen är en modell på din egen disk utan någon mätare per klipp som alls är igång.
Det är den verkliga formen av den här duellen. Grok Imagine Video optimerar kostnaden för det tionde försöket. Kandinsky 6.0 Video optimerar kostnaden för det tiotusende, och tar betalt i hårdvara och tålamod för det första.
Båda genererar ljud — och de är inte samma påstående
Det här är axeln där en lat jämförelse skulle säga "oavgjort" och ha fel.
Grok Imagine Video producerar inbyggt ljud med dialog, effekter och musik som en funktion bland många. Det är en generell generator som råkar inkludera ljud.
Kandinsky 6.0 Video bygger på ljud. Arkitekturen är en dubbelströms-CrossDiT som parar en videoström initierad från Kandinsky 5.0 Video med en ljudström tränad från grunden på stora ljudkorpusar, förenade genom dubbelriktad cross-attention och tränade gemensamt. Utdata är 44 kHz med explicit läppsynk, och artikelns förstärkningsinlärningssteg rapporteras minska ordfelsfrekvensen för genererat tal med 47 % — mätt med Whisper-large-v3, som är en av RL-belöningsmodellerna, en detalj som spelar roll eftersom artikeln rapporterar en andra, icke jämförbar WER vid sidan av VABench med Qwen3-ASR-1.7B. Tal är det som modellen eftertränades på.
I kontrast till det är Sbers egen studie öppen med var den förlorar. I labbets utvärdering sida vid sida föredras MiniMax H3 och Dreamina Seedance 2.0 på visuella kriterier med betydande marginaler, och modellen beskrivs som konkurrenskraftig snarare än ledande. Det påstående som är värt att ta på allvar är snävare och mer användbart: mot Kling 2.6 och Veo 3.1 Fast växlar resultaten kriterium för kriterium, och Kandinsky 6.0 Video förblir konkurrenskraftig vad gäller talkvalitet och synkronisering av ljud och bild, där en stor andel av jämförelserna är oavgjorda.
Femton sekunder mot fem, och vad vardera kostar att nå
• Maximalt klipp — Grok Imagine Video: upp till 15 s. Kandinsky 6.0 Video: 5 s fast, 121 bildrutor vid 24 fps, inget förlängningsläge i utgåvan.
• Upplösning — Grok Imagine Video: upp till 1080p. Kandinsky 6.0 Video: SD, HD och Full HD genom en dedikerad superupplösningsmodell, x2, x4 eller x2,25 uppskalningar av femsekundersklipp.
• Referensindata — Grok Imagine Video: referensbetingad generering från flera bilder för karaktärskonsistens, plus tillägg/borttagning/utbyte av objekt. Kandinsky 6.0 Video: en bild, tillämpad som en maskerad sista bildruta.
• Prissättning — Grok Imagine Video: per sekund utdata, från den nedre änden av intervallet upp till 0,30 USD/s vid 1080p, med en extra avgift per bildinmatning; gratisåtkomst ligger bakom X:s prenumerationsnivåer. Kandinsky 6.0 Video: ingen — ingen tjänst, ingen taxa, bara den GPU-tid du själv tillhandahåller.
• Vikter — Grok Imagine Video: nej. Kandinsky 6.0 Video: MIT, Pro och Lite, med diffusers-integration.
Merkostnaden för den nyare Grok-versionen är siffran att ringa in. Att gå från januariversionen till 1.5 kostar dubbelt så mycket per minut på bild-till-video-tavlan och ger 26 Elo. Det är en verklig förbättring till ett verkligt pris, och det är samma avvägning som varje videoleverantör ber köpare att göra just nu.
Var en router passar in, och var den inte gör det
OrcaRouter tillhandahåller inte Grok Imagine Video eller Kandinsky 6.0 Video, och inget här påstår något annat: Kandinsky kan du ladda ner och köra själv, Grok Imagine Video nås via xAI:s egna gränssnitt. Vad en pipeline byggd på endera modellen behöver från en router är texten som omger renderingen — tagninglistan, promptutvidgningen som förvandlar en idé till den långa eller korta bildtext som dessa modeller tränades på, arbetet med bildtextning och transkribering, och de granskningssammanfattningar som avgör vilken generering som behålls. De körs på en OpenAI-kompatibel slutpunkt över 200+ textmodeller till leverantörens listpris med 0 % påslag, så en leverantörsprissänkning är live på samma nyckel samma dag som den lanseras, med automatisk failover så att ett misslyckat anrop mitt i en renderingskö omdirigeras istället för att stoppa hela batchen. Orkestreringen kring en videomodell är ett routingproblem även när videomodellen själv inte är routbar, vilket är fallet för båda dessa idag.
Vilken, och för vad?
Ta till Grok Imagine Video när arbetet handlar om volym: sociala klipp, snabba iterationer, en tagning som du kommer att generera om sex gånger innan den sitter, och en deadline som inte töjs. Dess pris per försök är produkten, och att det nu ligger i mitten av tabellen i stället för i toppen är den normala kostnaden för en kategori som rör sig så här snabbt.
Välj Kandinsky 6.0 Video när arbetet är en pipeline: en fast femsekundersenhet som du kan batcha, en image-to-video-körning där trohet mot en tillhandahållen stillbild är det som avgör, tal som du avser ska vara begripligt, och en leverabel som du helst inte vill hyra. Budgetera för renderingen, förvänta dig en långsam sådan på allt i konsumentklass, och behandla varje kvalitetssiffra i den här artikeln som Sbers egen tills någon utanför labbet betygsätter den.


Det som gör att paret är värt att titta på är vilken av dem som kan absorbera ett dåligt kvartal. Om Grok Imagine Video halkar längre ned på arenan är svaret en bättre modell och ett nytt pris — så fungerar kategorin, och xAI har redan visat att de kommer att släppa en. Om Kandinsky 6.0 Video visar sig ligga i mitten av tabellen när den har poängsatts, finns checkpointen fortfarande kvar, körs fortfarande och finjusteras fortfarande; inget med licensen förändras med siffran. Det är olika typer av hållbarhet, och bara en av dem mäts av Elo.

