
Kandinsky 6.0 Video vs Google Veo 3.1: Tre nivåer mot två storlekar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 150 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Öppna Sbers tekniska rapport för Kandinsky 6.0 Video och hitta avsnittet med direktjämförelsen, så kommer du att märka något som jämförelsesidorna missar: motståndaren är inte Veo 3.1. Det är Veo 3.1 Fast. Sber körde sin mänskliga utvärdering mot den mellersta av Veos tre nivåer, och det valet säger dig mer om den här matchen än något kvalitetspåstående i den. Veo 3.1 har varit allmänt tillgängligt sedan den 17 november 2025 i tre servicenivåer; Kandinsky 6.0 Video kom i första veckan av oktober 2026 i två nedladdningsbara storlekar, Pro på 29B och Lite på 3B, under MIT. En av dessa är en tjänst du köper per sekund, den andra är en checkpoint du kör — och det är nivåfrågan, inte kvalitetsfrågan, som avgörandet faktiskt handlar om.
Veo 3.1 är tre produkter som bär ett och samma namn
Googles modell är allmänt tillgänglig i Standard, Fast och Lite, och alla tre producerar samma formatfamilj: 720p, 1080p och nativ 4K vid 24 fps, nativa varaktigheter på 4, 6 eller 8 sekunder, med längre utdata rapporterade vid 1080p och kedjning av scenförlängning utöver det, upp till tre referensbilder för konsekvens hos karaktärer och scener, plus kontroller för seed och negativ prompt. Utdata innehåller SynthID- och C2PA-metadata om härkomst.
Det som skiljer nivåerna åt är pris och hastighet, och den oberoende topplistan säger något obehagligt om spridningen. På Artificial Analysis text-till-video-topplista ligger de tre inom 14 Elo från varandra — Veo 3.1 på 962 (±10) över 2 998 röster, Veo 3.1 Fast på 961 (±10) över 4 325, Veo 3.1 Lite på 948 (±10) över 2 903 — medan deras listade priser ligger på $24.00, $7.20 och $4.80 per minut. Läser man dem tillsammans säger arenan att den inte på ett tillförlitligt sätt kan skilja nivåerna åt utifrån preferens. Det betyder inte att nivåerna är identiska; det betyder att en köpares verkliga fråga är vilken nivå som klarar deras ribba, eftersom preferenslistan inte kommer att svara på det åt dem.
Kandinsky 6.0 Video tar motsatt angreppssätt till variation. Det finns två storlekar – Pro på 29B och Lite på 3B – som delar en arkitektur och ett fast utdataformat: 5 sekunder, 121 bildrutor i 24 fps, synkroniserat 44 kHz-ljud med läppsynk, från text eller en referensbild, med en separat superupplösningsmodell som höjer resultatet till Full HD. Det finns ingen Fast-variant och inget förlängningsläge. Du väljer en storlek och en GPU.
Vad labbets egen utvärdering faktiskt hävdar
Detta är den enda direkta jämförelsedatan som finns mellan dessa två system, och den är leverantörsrapporterad på båda sidor om snedstrecket – Sber genomförde den, Sber publicerade den, och ingen utanför Sber har reproducerat den. Att ange den korrekt är viktigare än att ange den fördelaktigt.
I läget text-till-ljudvideo föredras Kandinsky 6.0 Video Pro i rapporten när det gäller artefakter och kamerarörelse, med statistiskt signifikanta marginaler, och ligger något före när det gäller rörelserealism i ett fält dominerat av oavgjorda resultat. Veo 3.1 Fast leder när det gäller visuell promptföljning, talkvalitet, synkronisering mellan ljud och bild, övergripande ljudkvalitet, ljudpromptföljning och lösning av användaruppgifter, där alla utom tal når signifikans. Den övergripande visuella kvaliteten ligger nära paritet, med en liten fördel för Veo.
Vid bild-till-video vänder mönstret på den visuella halvan. Kandinsky 6.0 Video Pro föredras för övergripande visuell kvalitet, anpassning till referensbild, artefakter och kamerarörelse, samtliga signifikanta. Veo 3.1 Fast leder fortfarande inom följning av visuella prompter, ljud- och videosynkronisering, övergripande ljudkvalitet, följning av ljudprompter och lösning av användaruppgifter, också signifikanta. Rörelserealism och talkvalitet hamnar nära jämbördighet.
Två saker följer. Bild-till-video-resultatet är det verkliga fyndet: att en öppen modell föredras vad gäller överensstämmelse med referensbilden och övergripande visuell kvalitet mot en Google-nivå, i labbets egen studie, är ett verkligt påstående värt att väga. Och ljudresultatet är där Veo behåller sin ledning oavsett läge — vilket för oss till flaggan som ingen nämner.
Ljudflaggan som avgör huruvida den utvärderingen är rättvis
Veo 3.1 genererar inbyggt 48 kHz stereoljud – dialog, omgivningsljud, foley – tillsammans med bilden. Det är en av modellens starkaste funktioner. I API:et är dock ljudparametern som standard avstängd, och tyst generering har lägre pris än generering med ljud: ungefär $0,20 per sekund i tyst läge jämfört med ungefär $0,40 per sekund med ljud på Googles publicerade Standard-nivå.
Kandinsky 6.0 Video har ingen sådan växel. Ljudet är en del av utdata, och serveringspipelinen som infogats i vLLM-Omni avger 44,1 kHz AAC som standard. De två modellerna har alltså inte samma standardläge: den ena är ljud-först, den andra är tyst-först med ljud som en uppgradering.
Den asymmetrin har en specifik kostnad i jämförelser. Varje direktsammandrabbning som ställer en tyst Veo 3.1 mot en konkurrent vars ljud alltid är med, och sedan poängsätter paret på en ljudmedveten resultattavla, har gett Veo ett handikapp genom en tillfällighet i en standardinställning. När du läser Sber-siffrorna ovan – eller någon annans – är den första frågan att ställa om Veo-sidan hade ljudet på. Den andra är vad prisskillnaden var, eftersom att slå på ljudet på Standard-nivå fördubblar den.
Fem sekunder mot åtta, och 1080p mot native 4K
Formatgapet är där de två modellernas designbriefar blir synliga.
• Klipplängd — Kandinsky 6.0 Video: 5 s fast, 121 bildrutor vid 24 fps, ingen förlängning. Veo 3.1: 4, 6 eller 8 s inbyggt, längre vid 1080p, kedjning av scenförlängning utöver det.
• Upplösning — Kandinsky 6.0 Video: SD, HD och Full HD (1920×1080) via en superupplösningskörning. Veo 3.1: 720p, 1080p och native 4K.
• Härkomst — Kandinsky 6.0 Video: ingen anges i utgåvan. Veo 3.1: SynthID- och C2PA-metadata på utdata.
• Referensindata — Kandinsky 6.0 Video: en bild, använd som en maskerad sista bildruta. Veo 3.1: upp till tre referensbilder plus seed och negativ prompt.
• Format – Kandinsky 6.0 Video: 44,1 kHz AAC med bilden, alltid på. Veo 3.1: 48 kHz stereo, valfritt, prissatt på två sätt.
Härkomstraden är den som får inköpsmässiga konsekvenser. Om din leverans måste vara spårbar – varumärkesarbete, sändningar, allt som ett juridikteam kommer att granska – bifogar Veo 3.1 metadata som anger att filmmaterialet är genererat, och Kandinsky 6.0 Video gör det inte. Det är ingen kvalitetsskillnad och ingen benchmark kommer att visa det, men det är den typ av krav som ensamt avgör valet av leverantör, och en öppen modell utan det är inte en drop-in-ersättning för ett team som behöver det.
4K-linjen spelar roll på samma sätt, och av samma anledning. Kandinsky 6.0 Videos Full HD är äkta — det finns en dedikerad SR-modell, och repots SR-paket hanterar x2, x4 och x2.25 uppskalningar av femsekundersklipp — men den når sitt tak där Veo 3.1:s inbyggda bana börjar vid sin övre gräns. För arbete med stor skärm är det taket inte förhandlingsbart.
Vad ett klipp kostar på varje sida
Veo 3.1 faktureras per sekund. På Standard-nivå kostar ett fem sekunder långt 1080p-klipp med ljud cirka 2,00 USD, och samma klipp utan ljud cirka 1,00 USD; Fast och Lite ligger under det, och eftersom deras arena-poäng hamnar inom Standardns konfidensintervall är de billigare nivåerna svåra att argumentera emot utifrån bevisningen.
Kandinsky 6.0 Video har ingen faktura. Det har GPU-tid. Repositoriets siffror för den icke-destillerade modellen, uppmätta efter uppvärmning med inläsning av vikter och MP4-kodning exkluderade, anger ett fem sekunder långt Pro Full HD-klipp till cirka 402 sekunder på en H100, 854 sekunder på en RTX 5090, 1 247 sekunder på en RTX 4090 och 3 530 sekunder på en RTX 5060 Ti. Lite Full HD är 284 sekunder på en H100. Toppallokeringen vid en Pro SD-körning når 72,8 GiB, så allt under det behöver block-offloading – och 16 GB-förinställningen kvantiserar textkodaren till NF4, den enda förinställningsändringen som artikeln bekräftar förändrar själva klippet snarare än att introducera brus på avrundningsnivå.
De två kostnadsstrukturerna går inte att jämföra. Den ena är en räkning du prognostiserar per färdig sekund; den andra är en maskin du köper, en rendering mätt i minuter, och möjligheten att finjustera — vilket Veo 3.1 inte erbjuder på någon nivå.
Tierfrågan är en routingfråga
OrcaRouter erbjuder varken Google Veo 3.1 eller Kandinsky 6.0 Video, och ingen av dem finns här — Veo 3.1 nås via Googles egna gränssnitt och Kandinsky får du ladda ner själv. Men strukturen i Veo-beslutet är värd att namnge, eftersom det är det problem som vårt routinglager finns för att lösa på textsidan: tre nivåer vars oberoende poäng är omöjliga att skilja åt och vars priser skiljer sig femfaldigt är just det fall där "routa den billiga och eskalera bara när ribban inte nås" slår "standardisera på flaggskeppet". OrcaRouters adaptiva routing och routing-DSL uttrycker det som en konfigurerad policy över 200 textmodeller på en enda OpenAI-kompatibel endpoint, till leverantörslistpris med 0 % påslag, med automatisk failover när en rutt går ner. Samma struktur tillämpad på videokostnader — Fast som standard, Standard för de tagningar som spelar roll — är ett inköpsbeslut du kan fatta redan idag helt utan router.
Vilken, för vem
Välj Veo 3.1 om leveransen kräver att ljudet tas på allvar, om den behöver 4K eller ett klipp längre än fem sekunder, eller om någon nedströms kräver proveniensmetadata. Välj nivån medvetet i stället för att förvalta till Standard, och budgetera för ljudet i stället för att upptäcka det på fakturan.
Välj Kandinsky 6.0 Video om du vill ha vikter, om fem sekunder passar din arbetsenhet, och om bild-till-video-trohet mot en medföljande stillbild är uppgiften – den enda dimension där labbets egen studie placerar den före en Veo-nivå med betydande marginaler. Gå in med vetskapen att ljudet alltid är på, att härkomsten saknas och att kvalitetsanspråket helt och hållet vilar på en rapport som dess författare har skrivit.


Den asymmetri som är värd att hålla fast vid är att Veo 3.1 har varit i produktion i elva månader och därför har samlat på sig det som en öppen modell som släpptes den här månaden inte kan: en kartlagd uppsättning felmoder som dess användare redan har publicerat, och en priskurva som ett ekonomiteam kan modellera. Mot detta står att Kandinskys MIT-licens innebär att modellen på din disk inte är beroende av någons färdplan. Vilket av dessa som är värt mer är inte en benchmarkfråga.

