
Kandinsky 6.0 Video vs Google Veo 3.1: Drie niveaus tegen twee formaten
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 150 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Open het technische rapport van Sber voor Kandinsky 6.0 Video en zoek de head-to-headsectie, en je zult iets opmerken dat de vergelijkingspagina's missen: de tegenstander is niet Veo 3.1. Het is Veo 3.1 Fast. Sber voerde zijn menselijke evaluatie uit tegen het middelste van Veo's drie niveaus, en die ene keuze zegt je meer over deze confrontatie dan welke kwaliteitsclaim daarin dan ook. Veo 3.1 is algemeen beschikbaar sinds 17 november 2025 in drie serviceniveaus; Kandinsky 6.0 Video verscheen in de eerste week van oktober 2026 in twee downloadbare varianten, Pro met 29B en Lite met 3B, onder MIT. Een van deze is een dienst die je per seconde koopt, de andere is een checkpoint die je zelf draait — en de niveauvraag, niet de kwaliteitsvraag, is waar de beslissing daadwerkelijk ligt.
Veo 3.1 is drie producten die één naam dragen
Googles model is algemeen beschikbaar in Standard, Fast en Lite, die alle drie dezelfde formatfamilie produceren: 720p, 1080p en native 4K bij 24 fps, native duur van 4, 6 of 8 seconden, met langere uitvoer naar verluidt op 1080p en scène-extensieketens daarbuiten, tot drie referentieafbeeldingen voor consistentie van personages en scènes, plus seed- en negative-promptbesturing. De uitvoer bevat SynthID- en C2PA-herkomstmetadata.
Wat de tiers van elkaar onderscheidt, zijn prijs en snelheid, en de onafhankelijke ranglijst zegt iets ongemakkelijks over de spreiding. Op de tekst-naar-video-leaderboard van Artificial Analysis liggen de drie binnen 14 Elo van elkaar — Veo 3.1 op 962 (±10) met 2.998 stemmen, Veo 3.1 Fast op 961 (±10) met 4.325, Veo 3.1 Lite op 948 (±10) met 2.903 — terwijl hun vermelde tarieven $24,00, $7,20 en $4,80 per minuut bedragen. Lees je dat samen, dan zegt de arena tegen je dat ze de tiers niet betrouwbaar op voorkeur kan onderscheiden. Dat betekent niet dat de tiers identiek zijn; het betekent dat de echte vraag van een koper is welke tier aan hun eisen voldoet, want de voorkeursranglijst zal dat niet voor hen beantwoorden.
Kandinsky 6.0 Video hanteert de tegenovergestelde aanpak als het om variatie gaat. Er zijn twee groottes — Pro met 29B en Lite met 3B — die één architectuur en één vast uitvoerformaat delen: 5 seconden, 121 frames bij 24 fps, gesynchroniseerde 44 kHz-audio met lip-sync, op basis van tekst of een referentieafbeelding, met een apart superresolutiemodel dat het resultaat opschaalt naar Full HD. Er is geen Fast-variant en geen verlengingsmodus. Je kiest een grootte en een GPU.
Wat de eigen evaluatie van het lab eigenlijk beweert
Dit zijn de enige rechtstreekse vergelijkingsgegevens die er tussen deze twee systemen bestaan, en ze zijn aan beide zijden van de schuine streep door de leverancier gerapporteerd — Sber heeft het uitgevoerd, Sber heeft het gepubliceerd, en niemand buiten Sber heeft het gereproduceerd. Het nauwkeurig formuleren ervan is belangrijker dan het gunstig formuleren ervan.
In de tekst-naar-audio-video-modus krijgt Kandinsky 6.0 Video Pro volgens het rapport de voorkeur op artefacten en camerabeweging, met statistisch significante marges, en ligt het iets voor op bewegingsrealisme in een veld dat wordt gedomineerd door gelijke scores. Veo 3.1 Fast leidt op het volgen van visuele prompts, spraakkwaliteit, audio-videosynchronisatie, algehele audiokwaliteit, het volgen van geluidsprompts en het oplossen van gebruikerstaken, waarbij alle behalve spraak significantie bereiken. De algehele visuele kwaliteit is bijna gelijk, met een lichte voorsprong voor Veo.
Bij image-to-video keert het patroon om op het visuele vlak. Kandinsky 6.0 Video Pro geniet de voorkeur op het gebied van algehele visuele kwaliteit, uitlijning met referentiebeelden, artefacten en camerabeweging, allemaal significant. Veo 3.1 Fast leidt nog steeds op het gebied van het volgen van visuele prompts, audio-videosynchronisatie, algehele audiokwaliteit, het volgen van geluidsprompts en het oplossen van gebruikerstaken, ook significant. Bewegingsrealisme en spraakkwaliteit komen naar voren
Twee dingen volgen. Het image-to-videoresultaat is de echte bevinding: dat een open model de voorkeur krijgt op overeenkomst met de referentieafbeelding en algehele visuele kwaliteit tegen een Google-niveau, in de eigen studie van het lab, is een echte bewering die het overwegen waard is. En het audioresultaat is waar Veo zijn voorsprong behoudt, ongeacht de modus — wat ons brengt bij het signaal dat niemand noemt.
De audio-vlag die bepaalt of die evaluatie eerlijk is
Veo 3.1 genereert native 48 kHz stereo-audio — dialoog, sfeergeluid, foley — samen met het beeld. Het is een van de sterkste functies van het model. Op de API staat de audiokenmerk echter standaard uit, en stille generatie is goedkoper dan generatie met audio: ongeveer $0,20 per seconde stil tegen ongeveer $0,40 per seconde met audio aan in de door Google gepubliceerde Standard-tier.
Kandinsky 6.0 Video heeft geen dergelijke schakelaar. Audio maakt deel uit van de uitvoer, en de serveerpijplijn die in vLLM-Omni is opgenomen, stuurt standaard 44,1 kHz AAC uit. Dus de twee modellen hebben niet dezelfde standaard: het ene is audio-eerst, het andere is stilte-eerst met geluid als upgrade.
Die asymmetrie heeft een specifieke kostenpost bij vergelijkingen. Elke rechtstreekse vergelijking waarin een stille Veo 3.1 tegenover een concurrent wordt gezet wiens audio altijd wordt meegeleverd, en het tweetal vervolgens op een audio-bewust scorebord wordt beoordeeld, heeft Veo benadeeld door een toevalligheid van een standaardinstelling. Wanneer je de Sber-cijfers hierboven leest — of die van wie dan ook — is de eerste vraag of de Veo-kant audio aan had. De tweede is wat het prijsverschil was, want op Standard-tier verdubbelt het aanzetten van geluid dat.
Vijf seconden tegen acht, en 1080p tegen native 4K
De formaatkloof is waar de ontwerpopdrachten van de twee modellen zichtbaar zijn.
Cliplengte — Kandinsky 6.0 Video: 5s vast, 121 frames bij 24 fps, geen verlenging. Veo 3.1: 4, 6 of 8s native, langer bij 1080p, en daarbovenop het aan elkaar koppelen van scène-uitbreidingen.
• Resolutie — Kandinsky 6.0 Video: SD, HD en Full HD (1920×1080) via een superresolutie-pass. Veo 3.1: 720p, 1080p en native 4K.
• Herkomst — Kandinsky 6.0 Video: geen vermeld in de release. Veo 3.1: SynthID- en C2PA-metadata op de uitvoer.
• Referentie-invoer — Kandinsky 6.0 Video: één afbeelding, toegepast als een gemaskeerd staartframe. Veo 3.1: tot drie referentieafbeeldingen plus seed en negatieve prompt.
• Formaat — Kandinsky 6.0 Video: 44,1 kHz AAC met beeld, altijd ingeschakeld. Veo 3.1: 48 kHz stereo, optioneel, op twee manieren geprijsd.
De herkomstlijn is degene met inkoopconsequenties. Als je deliverable traceerbaar moet zijn — merkwerk, uitzendingen, alles waar een juridisch team naar zal kijken — dan voegt Veo 3.1 metadata toe die aangeeft dat het beeldmateriaal is gegenereerd, en Kandinsky 6.0 Video doet dat niet. Dat is geen kwaliteitsverschil en geen enkele benchmark zal het laten zien, maar het is het soort vereiste dat op zichzelf al de leverancierskeuze bepaalt, en een open model zonder die functie is geen drop-invervanging voor een team dat die nodig heeft.
De 4K-lijn is op dezelfde manier van belang, en om dezelfde reden. De Full HD van Kandinsky 6.0 Video is echt — er is een speciaal SR-model, en het SR-pakket van de repository verwerkt x2-, x4- en x2,25-upscales van clips van vijf seconden — maar het plafond ligt waar het native pad van Veo 3.1 aan de bovenkant begint. Voor werk op grote schermen staat dat plafond niet ter discussie.
Wat een clip aan elke kant kost
Veo 3.1 factureert per seconde. Op het Standard-niveau kost een 1080p-clip van vijf seconden met audio ongeveer $2,00, en dezelfde clip zonder audio ongeveer $1,00; Fast en Lite liggen daaronder, en omdat hun arena-scores binnen het betrouwbaarheidsinterval van die van Standard vallen, zijn de goedkopere niveaus op basis van het bewijs moeilijk tegen te spreken.
Kandinsky 6.0 Video heeft geen factuur. Het heeft GPU-tijd. De cijfers van de repository voor het niet-gedistilleerde model, gemeten na warmup waarbij het laden van gewichten en MP4-codering zijn uitgesloten, stellen een vijf seconden durende Pro Full HD-clip op ongeveer 402 seconden op een H100, 854 seconden op een RTX 5090, 1.247 seconden op een RTX 4090 en 3.530 seconden op een RTX 5060 Ti. Lite Full HD is 284 seconden op een H100. De piekallocatie bij een Pro SD-run bereikt 72,8 GiB, dus alles daaronder heeft block-offloading nodig — en de 16GB-preset quantiseert de tekstencoder naar NF4, de enige presetwijziging waarvan het paper bevestigt dat die de clip zelf verandert in plaats van ruis op afrondingsniveau te introduceren.
Die twee kostenstructuren zijn niet met elkaar te vergelijken. De ene is een rekening die je per afgewerkte seconde vooruitberekent; de andere is een machine die je koopt, een render die in minuten wordt gemeten, en de optie om te fine-tunen — wat Veo 3.1 in geen enkele tier biedt.
De tier-vraag is een routeringsvraag
OrcaRouter levert noch Google Veo 3.1 noch Kandinsky 6.0 Video, en geen van beide wordt hier gesuggereerd — Veo 3.1 bereik je via Google's eigen kanalen en Kandinsky moet je zelf downloaden. Maar de structuur van de Veo-beslissing is het benoemen waard, want het is precies het probleem dat onze routeringslaag aan de tekstkant bestaat om op te lossen: drie tiers waarvan de onafhankelijke scores niet van elkaar te onderscheiden zijn en waarvan de prijzen vijfvoudig verschillen, is exact het geval waarin "de goedkope routeren en alleen escaleren wanneer de lat niet wordt gehaald" beter is dan "standaardiseren op het vlaggenschip". OrcaRouter's adaptieve routering en routerings-DSL drukken dat uit als een geconfigureerd beleid voor meer dan 200 tekstmodellen op één OpenAI-compatibel endpoint, tegen de lijstprijs van de provider met 0% markup, met automatische failover wanneer een route uitvalt. Hetzelfde instinct toegepast op video-uitgaven — standaard Fast, Standard voor de shots die er echt toe doen — is een inkoopbeslissing die je vandaag al kunt nemen zonder überhaupt een router.
Welke, voor wie
Kies Veo 3.1 als het eindproduct vereist dat geluid serieus wordt genomen, als het 4K nodig heeft of een clip van langer dan vijf seconden, of als iemand verderop in de keten herkomstmetadata vereist. Kies het niveau bewust in plaats van standaard naar Standard te grijpen, en begroot de audioflag in plaats van die pas op de factuur te ontdekken.
Kies Kandinsky 6.0 Video als je gewichten wilt, als vijf seconden bij je werkeenheid past, en als beeld-naar-video-getrouwheid ten opzichte van een aangeleverd stilstaand beeld de taak is — de enige dimensie waarin de eigen studie van het lab het voorloopt op een Veo-tier met aanzienlijke marges. Ga er met de wetenschap in dat de audio altijd aan staat, de herkomst ontbreekt, en de kwaliteitsclaim volledig berust op een rapport dat de auteur ervan heeft geschreven.


De asymmetrie die je moet vasthouden, is dat Veo 3.1 al elf maanden in productie is en daardoor iets heeft opgebouwd wat een open model dat deze maand is uitgebracht niet kan: een in kaart gebrachte set faalmodi die zijn gebruikers al hebben gepubliceerd, en een prijscurve die een finance-team kan modelleren. Daar staat tegenover dat de MIT-licentie van Kandinsky betekent dat het model op je schijf niet afhankelijk is van de roadmap van wie dan ook. Welke daarvan meer waard is, is geen benchmarkvraag.

