Ett genererat titelkort med texten 'Kandinsky 6.0 Video vs Google Veo 3.1' och undertexten 'Tre nivåer mot två storlekar'. OrcaRouter-logotypen sitter i nedre högra hörnet.
Guides & Insights

Kandinsky 6.0 Video vs Google Veo 3.1: Tre nivåer mot två storlekar

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Öppna Sbers tekniska rapport för Kandinsky 6.0 Video och hitta avsnittet med direktjämförelsen, så kommer du att märka något som jämförelsesidorna missar: motståndaren är inte Veo 3.1. Det är Veo 3.1 Fast. Sber körde sin mänskliga utvärdering mot den mellersta av Veos tre nivåer, och det valet säger dig mer om den här matchen än något kvalitetspåstående i den. Veo 3.1 har varit allmänt tillgängligt sedan den 17 november 2025 i tre servicenivåer; Kandinsky 6.0 Video kom i första veckan av oktober 2026 i två nedladdningsbara storlekar, Pro på 29B och Lite på 3B, under MIT. En av dessa är en tjänst du köper per sekund, den andra är en checkpoint du kör — och det är nivåfrågan, inte kvalitetsfrågan, som avgörandet faktiskt handlar om.

Veo 3.1 är tre produkter som bär ett och samma namn

Googles modell är allmänt tillgänglig i Standard, Fast och Lite, och alla tre producerar samma formatfamilj: 720p, 1080p och nativ 4K vid 24 fps, nativa varaktigheter på 4, 6 eller 8 sekunder, med längre utdata rapporterade vid 1080p och kedjning av scenförlängning utöver det, upp till tre referensbilder för konsekvens hos karaktärer och scener, plus kontroller för seed och negativ prompt. Utdata innehåller SynthID- och C2PA-metadata om härkomst.

Det som skiljer nivåerna åt är pris och hastighet, och den oberoende topplistan säger något obehagligt om spridningen. På Artificial Analysis text-till-video-topplista ligger de tre inom 14 Elo från varandra — Veo 3.1 på 962 (±10) över 2 998 röster, Veo 3.1 Fast på 961 (±10) över 4 325, Veo 3.1 Lite på 948 (±10) över 2 903 — medan deras listade priser ligger på $24.00, $7.20 och $4.80 per minut. Läser man dem tillsammans säger arenan att den inte på ett tillförlitligt sätt kan skilja nivåerna åt utifrån preferens. Det betyder inte att nivåerna är identiska; det betyder att en köpares verkliga fråga är vilken nivå som klarar deras ribba, eftersom preferenslistan inte kommer att svara på det åt dem.

Kandinsky 6.0 Video tar motsatt angreppssätt till variation. Det finns två storlekar – Pro på 29B och Lite på 3B – som delar en arkitektur och ett fast utdataformat: 5 sekunder, 121 bildrutor i 24 fps, synkroniserat 44 kHz-ljud med läppsynk, från text eller en referensbild, med en separat superupplösningsmodell som höjer resultatet till Full HD. Det finns ingen Fast-variant och inget förlängningsläge. Du väljer en storlek och en GPU.

Vad labbets egen utvärdering faktiskt hävdar

Detta är den enda direkta jämförelsedatan som finns mellan dessa två system, och den är leverantörsrapporterad på båda sidor om snedstrecket – Sber genomförde den, Sber publicerade den, och ingen utanför Sber har reproducerat den. Att ange den korrekt är viktigare än att ange den fördelaktigt.

I läget text-till-ljudvideo föredras Kandinsky 6.0 Video Pro i rapporten när det gäller artefakter och kamerarörelse, med statistiskt signifikanta marginaler, och ligger något före när det gäller rörelserealism i ett fält dominerat av oavgjorda resultat. Veo 3.1 Fast leder när det gäller visuell promptföljning, talkvalitet, synkronisering mellan ljud och bild, övergripande ljudkvalitet, ljudpromptföljning och lösning av användaruppgifter, där alla utom tal når signifikans. Den övergripande visuella kvaliteten ligger nära paritet, med en liten fördel för Veo.

Vid bild-till-video vänder mönstret på den visuella halvan. Kandinsky 6.0 Video Pro föredras för övergripande visuell kvalitet, anpassning till referensbild, artefakter och kamerarörelse, samtliga signifikanta. Veo 3.1 Fast leder fortfarande inom följning av visuella prompter, ljud- och videosynkronisering, övergripande ljudkvalitet, följning av ljudprompter och lösning av användaruppgifter, också signifikanta. Rörelserealism och talkvalitet hamnar nära jämbördighet.

Två saker följer. Bild-till-video-resultatet är det verkliga fyndet: att en öppen modell föredras vad gäller överensstämmelse med referensbilden och övergripande visuell kvalitet mot en Google-nivå, i labbets egen studie, är ett verkligt påstående värt att väga. Och ljudresultatet är där Veo behåller sin ledning oavsett läge — vilket för oss till flaggan som ingen nämner.

Ljudflaggan som avgör huruvida den utvärderingen är rättvis

Veo 3.1 genererar inbyggt 48 kHz stereoljud – dialog, omgivningsljud, foley – tillsammans med bilden. Det är en av modellens starkaste funktioner. I API:et är dock ljudparametern som standard avstängd, och tyst generering har lägre pris än generering med ljud: ungefär $0,20 per sekund i tyst läge jämfört med ungefär $0,40 per sekund med ljud på Googles publicerade Standard-nivå.

Kandinsky 6.0 Video har ingen sådan växel. Ljudet är en del av utdata, och serveringspipelinen som infogats i vLLM-Omni avger 44,1 kHz AAC som standard. De två modellerna har alltså inte samma standardläge: den ena är ljud-först, den andra är tyst-först med ljud som en uppgradering.

Den asymmetrin har en specifik kostnad i jämförelser. Varje direktsammandrabbning som ställer en tyst Veo 3.1 mot en konkurrent vars ljud alltid är med, och sedan poängsätter paret på en ljudmedveten resultattavla, har gett Veo ett handikapp genom en tillfällighet i en standardinställning. När du läser Sber-siffrorna ovan – eller någon annans – är den första frågan att ställa om Veo-sidan hade ljudet på. Den andra är vad prisskillnaden var, eftersom att slå på ljudet på Standard-nivå fördubblar den.

Fem sekunder mot åtta, och 1080p mot native 4K

Formatgapet är där de två modellernas designbriefar blir synliga.

• Klipplängd — Kandinsky 6.0 Video: 5 s fast, 121 bildrutor vid 24 fps, ingen förlängning. Veo 3.1: 4, 6 eller 8 s inbyggt, längre vid 1080p, kedjning av scenförlängning utöver det.

• Upplösning — Kandinsky 6.0 Video: SD, HD och Full HD (1920×1080) via en superupplösningskörning. Veo 3.1: 720p, 1080p och native 4K.

• Härkomst — Kandinsky 6.0 Video: ingen anges i utgåvan. Veo 3.1: SynthID- och C2PA-metadata på utdata.

• Referensindata — Kandinsky 6.0 Video: en bild, använd som en maskerad sista bildruta. Veo 3.1: upp till tre referensbilder plus seed och negativ prompt.

• Format – Kandinsky 6.0 Video: 44,1 kHz AAC med bilden, alltid på. Veo 3.1: 48 kHz stereo, valfritt, prissatt på två sätt.

Härkomstraden är den som får inköpsmässiga konsekvenser. Om din leverans måste vara spårbar – varumärkesarbete, sändningar, allt som ett juridikteam kommer att granska – bifogar Veo 3.1 metadata som anger att filmmaterialet är genererat, och Kandinsky 6.0 Video gör det inte. Det är ingen kvalitetsskillnad och ingen benchmark kommer att visa det, men det är den typ av krav som ensamt avgör valet av leverantör, och en öppen modell utan det är inte en drop-in-ersättning för ett team som behöver det.

4K-linjen spelar roll på samma sätt, och av samma anledning. Kandinsky 6.0 Videos Full HD är äkta — det finns en dedikerad SR-modell, och repots SR-paket hanterar x2, x4 och x2.25 uppskalningar av femsekundersklipp — men den når sitt tak där Veo 3.1:s inbyggda bana börjar vid sin övre gräns. För arbete med stor skärm är det taket inte förhandlingsbart.

Vad ett klipp kostar på varje sida

Veo 3.1 faktureras per sekund. På Standard-nivå kostar ett fem sekunder långt 1080p-klipp med ljud cirka 2,00 USD, och samma klipp utan ljud cirka 1,00 USD; Fast och Lite ligger under det, och eftersom deras arena-poäng hamnar inom Standardns konfidensintervall är de billigare nivåerna svåra att argumentera emot utifrån bevisningen.

Kandinsky 6.0 Video har ingen faktura. Det har GPU-tid. Repositoriets siffror för den icke-destillerade modellen, uppmätta efter uppvärmning med inläsning av vikter och MP4-kodning exkluderade, anger ett fem sekunder långt Pro Full HD-klipp till cirka 402 sekunder på en H100, 854 sekunder på en RTX 5090, 1 247 sekunder på en RTX 4090 och 3 530 sekunder på en RTX 5060 Ti. Lite Full HD är 284 sekunder på en H100. Toppallokeringen vid en Pro SD-körning når 72,8 GiB, så allt under det behöver block-offloading – och 16 GB-förinställningen kvantiserar textkodaren till NF4, den enda förinställningsändringen som artikeln bekräftar förändrar själva klippet snarare än att introducera brus på avrundningsnivå.

De två kostnadsstrukturerna går inte att jämföra. Den ena är en räkning du prognostiserar per färdig sekund; den andra är en maskin du köper, en rendering mätt i minuter, och möjligheten att finjustera — vilket Veo 3.1 inte erbjuder på någon nivå.

Tierfrågan är en routingfråga

OrcaRouter erbjuder varken Google Veo 3.1 eller Kandinsky 6.0 Video, och ingen av dem finns här — Veo 3.1 nås via Googles egna gränssnitt och Kandinsky får du ladda ner själv. Men strukturen i Veo-beslutet är värd att namnge, eftersom det är det problem som vårt routinglager finns för att lösa på textsidan: tre nivåer vars oberoende poäng är omöjliga att skilja åt och vars priser skiljer sig femfaldigt är just det fall där "routa den billiga och eskalera bara när ribban inte nås" slår "standardisera på flaggskeppet". OrcaRouters adaptiva routing och routing-DSL uttrycker det som en konfigurerad policy över 200 textmodeller på en enda OpenAI-kompatibel endpoint, till leverantörslistpris med 0 % påslag, med automatisk failover när en rutt går ner. Samma struktur tillämpad på videokostnader — Fast som standard, Standard för de tagningar som spelar roll — är ett inköpsbeslut du kan fatta redan idag helt utan router.

Vilken, för vem

Välj Veo 3.1 om leveransen kräver att ljudet tas på allvar, om den behöver 4K eller ett klipp längre än fem sekunder, eller om någon nedströms kräver proveniensmetadata. Välj nivån medvetet i stället för att förvalta till Standard, och budgetera för ljudet i stället för att upptäcka det på fakturan.

Välj Kandinsky 6.0 Video om du vill ha vikter, om fem sekunder passar din arbetsenhet, och om bild-till-video-trohet mot en medföljande stillbild är uppgiften – den enda dimension där labbets egen studie placerar den före en Veo-nivå med betydande marginaler. Gå in med vetskapen att ljudet alltid är på, att härkomsten saknas och att kvalitetsanspråket helt och hållet vilar på en rapport som dess författare har skrivit.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Google Veo 3.1 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Audio: 44.1 kHz, always on', 'Provenance: none stated', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Google Veo 3.1 column reads 'Max clip: 4, 6 or 8s', 'Resolution: up to native 4K', 'Audio: 48 kHz, optional', 'Provenance: SynthID and C2PA', 'Weights: none', 'Price: $4.80 to $24.00/min'. A footer reads 'Veo rates and Elo per Artificial Analysis; Kandinsky vendor-reported. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.

Den asymmetri som är värd att hålla fast vid är att Veo 3.1 har varit i produktion i elva månader och därför har samlat på sig det som en öppen modell som släpptes den här månaden inte kan: en kartlagd uppsättning felmoder som dess användare redan har publicerat, och en priskurva som ett ekonomiteam kan modellera. Mot detta står att Kandinskys MIT-licens innebär att modellen på din disk inte är beroende av någons färdplan. Vilket av dessa som är värt mer är inte en benchmarkfråga.

A screenshot of OrcaRouter's own model page for kling/kling-3-turbo, titled 'Kling 3.0 Turbo', credited to Kling and dated 2026-06-17, showing the route endpoint /v1/video/generations and a price of $0.11 per request, with a description explaining that Kling 3.0 Turbo is Kuaishou's speed-optimized model in the Kling 3.0 generation with native audio bundled in, handling text-to-video and image-to-video, and multi-shot storyboarding of up to six shots in a single generation.