Een gegenereerde titelkaart met de tekst 'Kandinsky 6.0 Video vs Alibaba Wan 2.7' en de ondertitel 'Open gewichten tegen een suite van vier modellen'. Het OrcaRouter-logo staat in de rechteronderhoek.
Guides & Insights

Kandinsky 6.0 Video vs Alibaba Wan 2.7: Open gewichten tegen een suite van vier modellen

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Kandinsky 6.0 Video levert je een checkpoint met 29B parameters om te downloaden en in ruil daarvoor een clip van vijf seconden. Wan 2.7 geeft je vier taakspecifieke varianten, clips tot vijftien seconden en een factuur per seconde. Die twee zinnen zijn de vergelijking, en de reden dat het de moeite loont om die op te schrijven, is dat de meeste head-to-headpagina's ze op beeldkwaliteit vergelijken, waar geen van beide een onafhankelijke score heeft die de knoop zou doorhakken — en dan de as overslaan waarop ze echt uiteenlopen: wat elk van hen verwacht dat jij meebrengt.

Sber's Kandinsky Lab heeft Kandinsky 6.0 Video in de eerste week van oktober 2026 open-source gemaakt onder MIT, in twee varianten — Pro met 29B en Lite met 3B — met code, checkpoints en diffusers-integratie. Alibaba's Wan 2.7 werd op 3 april 2026 uitgebracht als een suite: tekst-naar-video, afbeelding-naar-video, referentie-naar-video en videobewerking, gefactureerd per seconde gegenereerde video. Een van die twee is een model dat je zelf draait; de andere is een dienst die je koopt. De interessante vraag is niet welke beter is, maar welke de juiste vorm heeft voor het werk.

De enige as waarop ze direct vergelijkbaar zijn

Beide modellen genereren video met geluid, niet video die je daarna nog van muziek voorziet. Dat is zeldzamer dan het klinkt, en het is de reden dat deze twee überhaupt samen genoemd worden — het grootste deel van het veld produceert nog steeds een stille MP4 en laat de audio aan een aparte stap over.

Kandinsky 6.0 Video doet dit met een dual-stream CrossDiT: een videostream die is geïnitialiseerd vanuit het Kandinsky 5.0 Video-checkpoint, een audiostream die vanaf nul is getraind op grote audiocorpora, en bidirectionele cross-attentie die beide verbindt, gezamenlijk getraind na een continue voorafgaande trainingsfase. De uitvoer is 44 kHz-audio met lip-sync, op basis van een tekstprompt (T2AV) of een referentieafbeelding (I2AV).

Wan 2.7 produceert ook native audio, zonder het mechanisme in hetzelfde detail te publiceren. De eigen documentatie noemt audiokwaliteit en nauwkeurigheid van tekst op het scherm als de twee gebieden die nog werk behoeven — een kanttekening bij de getrouwheid die het waard is om vast te houden, omdat het de leverancier is die het zegt, niet een recensent die gokt.

Daar houdt de gelijkenis op. Alles onder deze lijn is een afwijking, geen rangschikking.

Vijf seconden tegen vijftien, en wat dat met een shotlist doet

Kandinsky 6.0 Video is getraind op 121 frames, 24 fps — vijf seconden — en de release bevat geen extensiemodus. De paper, het servingrecept dat in vLLM-Omni is opgenomen, en de prestatietabel van de repository zijn allemaal opgebouwd rond die ene cliplengte. Een stuk van dertig seconden bestaat uit zes generaties en vijf aaneenvoegingen, en het is aan jou om de naden te verbergen.

Wan 2.7 dekt twee tot vijftien seconden in één generatie, per aanvraag bepaald. Voor een talking-headclip, een productinsert of een enkele camerabeweging is dat verschil geen gemak — het is het verschil tussen één render en een montagestap. Voor alles wat shot voor shot wordt opgebouwd, is vijf seconden een normale werkeenheid en verdwijnt de kloof grotendeels.

• Max. clip — Kandinsky 6.0 Video: 5 s, vast, 121 frames bij 24 fps. Wan 2.7: 2–15 s, per verzoek ingesteld.

• Resolutie — Kandinsky 6.0 Video: SD, HD en Full HD (1920×1080) via een apart superresolutiemodel. Wan 2.7: tot 1080p.

• Referentieconditionering — Kandinsky 6.0 Video: één afbeelding, toegepast als een gemaskeerd eindframe. Wan 2.7: maximaal vijf onderwerpafbeeldingen en vijf referentieclips, tien assets per aanvraag.

• Taken — Kandinsky 6.0 Video: T2AV en I2AV. Wan 2.7: tekst-naar-video, afbeelding-naar-video, referentie-naar-video en videobewerking als afzonderlijke varianten met aparte facturering.

• Gewichten — Kandinsky 6.0 Video: MIT, downloadbaar, Pro en Lite. Wan 2.7: nee.

Vier taken tegenover twee modi

Het aantal taken is het deel van Wan 2.7 dat in vergelijkingstabellen wordt ondergewaardeerd, omdat het geen kwaliteitsclaim is — het is een claim over de reikwijdte. Op instructies gebaseerde bewerking van bestaand beeldmateriaal, waarbij je een wijziging beschrijft en dezelfde opname terugkrijgt met die wijziging toegepast, is een werklast die Kandinsky 6.0 Video helemaal niet probeert. Referentie-naar-video, waarbij een aangeleverde performance een gegenereerd subject aanstuurt, valt eveneens buiten zijn twee modi.

De facturering weerspiegelt de reikwijdte. De tekst-naar-video- en afbeeldings-naar-video-varianten van Wan 2.7 factureren alleen op basis van de uitvoerduur — $0,10/s bij 720p en $0,15/s bij 1080p op de internationale eindpunten in Singapore, terwijl Peking en Tokio $0,086/s en $0,143/s voor hetzelfde werk vermelden. De referentie-naar-video-variant factureert ook de invoervideo, met een maximum van vijf seconden, dus een referentie van vijf seconden die een generatie van vijftien seconden aanstuurt, wordt gefactureerd voor twintig seconden werk. De variant voor videobewerking factureert alleen de uitvoer en beschouwt het invoermateriaal als gratis — wat het allergunstigste tarief in de familie is, en de reden waarom bewerken de plek is waar 2.7 echt goedkoop is.

Bij die cijfers horen twee feiten over de levenscyclus. Alibaba voegde een tijdelijke introductiekorting van 30% toe aan zijn eigen Bailian- en Qwen Cloud-omgevingen, en die verliep op 23 september 2026. Afzonderlijk haalt de kennisgeving over uitfasering (ID 118434) van Alibaba Cloud's Model Studio op 10 oktober 2026 verschillende oudere modellen offline, en wan2.7-r2v en wan2.7-image staan op die lijst. Dat is op variantniveau en niet een stopzetting van de generatie — wan2.7-t2v en wan2.7-i2v blijven vermeld staan met geldende tarieven — maar als reference-to-video de reden was dat je naar 2.7 keek, dan heeft die route nog vier dagen.

Wat de onafhankelijke besturen wel en niet laten zien

Dit is het gedeelte waar de meeste vergelijkingen tussen deze twee modellen stilletjes vals spelen, dus het is de moeite waard precies te zijn over wat er bestaat.

Wan 2.7 heeft onafhankelijke scores op drie afzonderlijke Artificial Analysis-videoboards, en die komen niet met elkaar overeen omdat ze verschillende dingen meten:

• Tekst-naar-video — Wan2.7-260612 (de juni-build) staat op de 13e–14e plaats met een Elo van 1.030 (±9) over 5.571 stemmen, voor $9,00/min.

• Afbeelding-naar-video — Wan 2.7 (de aprilversie) staat op de 12e plaats met Elo 1.077 (±8) bij 4.571 stemmen, voor $9,00/min.

• Videobewerking — Wan 2.7 staat 5e met Elo 1.077 (±5) over 17.988 stemmen, tegen $16,90/min.

Lees die drie samen, en de nuttige conclusie is niet "Wan 2.7 staat twaalfde bij video". Die is dat het model opvallend sterker is in bewerken dan in genereren, op ranglijsten die voor elk afzonderlijk zijn opgesteld, en dat het citeren van één enkel getal ervoor in beide richtingen een vergissing is.

Kandinsky 6.0 Video heeft op geen enkele daarvan een score. Het gepubliceerde bewijs ervan is van de leverancier en het is de moeite waard om precies te vermelden wat het is: een VABench-run waarin het laboratorium meldt dat Pro leidt op het gebied van spraakkwaliteit, audio-esthetiek, tekst-video- en audio-video-uitlijning, lip-sync-nauwkeurigheid, desynchronisatie en visueel realisme onder de drie geëvalueerde systemen — waarbij de andere twee zijn eigen Lite-model en LTX 2.5 zijn — en een door het lab uitgevoerde menselijke evaluatie naast elkaar met ongeveer 200 of meer paarsgewijze vergelijkingen per criterium, waarin Pro concurrerend is met Kling 2.6 en Veo 3.1 Fast, achterblijft bij MiniMax H3 en Dreamina Seedance 2.0 op visuele criteria, en concurrerend blijft op het gebied van spraakkwaliteit en audio-video-synchronisatie. Niets ervan is buiten Sber gereproduceerd, en niets ervan is een Elo op een blinde openbare ranglijst. De juiste interpretatie is "veelbelovend en niet-geauditeerd", niet "evenaart Veo".

Wat elk kost, uitgedrukt in de termen die elke partij gebruikt.

De twee prijsmodellen kunnen niet tot één getal worden teruggebracht, en doen alsof dat wel kan, is precies hoe teams een verkeerde beslissing nemen.

Wan 2.7 is een tarief per seconde. Een clip van vijftien seconden in 1080p kost ongeveer $2,25. Een stuk van dertig seconden bestaat uit twee generaties plus een bewerking — $4,50 aan ruwe generatie plus je montagetijd, of minder als de bewerkingsvariant het werk doet, omdat die de input niet in rekening brengt.

Kandinsky 6.0 Video heeft helemaal geen tarief, want er is geen dienst om te kopen. Wat het wel heeft, is een GPU-uurprijs die je zelf aanlevert. De cijfers van de repository zelf bepalen de ondergrens: een Pro Full HD-clip van vijf seconden kost ongeveer 402 seconden werktijd op een H100 na opwarming, 854 op een RTX 5090 en 1.247 op een RTX 4090. De gedistilleerde checkpoint — die volgens de pagina gelijkwaardig was aan het volledige model, met een gemiddelde voorkeur van 51% tegen 49% en geen enkel criterium dat significantie bereikte — is degene die je zou serveren. Alles onder 72,8 GiB piekallocatie heeft block off nodig, en de 16 GB-preset kwantiseert de tekstencoder naar NF4, wat volgens de paper de enige presetwijziging is die de clip zelf verandert.

Simpel gezegd: de kosten van Wan 2.7 zijn een regel op een factuur die je kunt voorspellen. De kosten van Kandinsky 6.0 Video zijn een machine die je bezit, een render die minuten per vijf seconden duurt, en de optie — niet de verplichting — om te fine-tunen.

Waar een router in dit zit

OrcaRouter biedt noch Kandinsky 6.0 Video noch Alibaba Wan 2.7 aan, en geen van beide beweringen wordt hier gedaan. Kandinsky kun je zelf downloaden en draaien; Wan 2.7 is bereikbaar via de eigen platforms van Alibaba. Wat een pipeline die op een van beide modellen is gebouwd van een router nodig heeft, is de tekstlaag rond de render: de promptuitbreiding die een shotbeschrijving omzet in de lange of korte caption waarmee deze modellen zijn getraind, het caption- en dialoogwerk dat een image-to-video-pass voedt, en de beoordelingssamenvattingen die bepalen welke van meerdere generaties je wilt houden. Dat zijn gewone tekstaanroepen, en ze draaien op één OpenAI-compatibel eindpunt over meer dan 200 modellen met lijstprijzen van providers doorgegeven tegen 0% opslag, zodat een prijsverlaging van een leverancier dezelfde dag live is in plaats van na een contractcyclus. Automatische failover is hier meer waard dan in een chatworkload, omdat een caption-aanroep die in minuut vier van een Q&A-sessie mislukt, moet worden omgeleid in plaats van de render te verliezen.

De beslissing, elk in één regel

Als het eindproduct een clip met geluid is en je liever geen GPU wilt hebben, is Wan 2.7 de enige van de twee die je dat biedt, en de bewerkingsvariant ervan is op basis van het beschikbare bewijs het sterkste in de familie. Controleer de uitfasering van 10 oktober voordat je je vastlegt op reference-to-video.

Als het op te leveren product een pipeline is die je zelf beheert, als eenheden van vijf seconden bij je shotlist passen, en als je wilt fine-tunen of offline wilt draaien, is Kandinsky 6.0 Video de enige van de twee die dit toestaat — ten koste van een render die traag is op consumentenhardware en een kwaliteitsclaim die nog volledig afkomstig is van het lab zelf. De gebeurtenis om aan die kant in de gaten te houden is simpel: een Elo.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

Eén asymmetrie is het waard om te benoemen voordat we afsluiten, want die zal beide modellen overleven. Het plafond van Wan 2.7 ligt contractueel en technisch bij Alibaba — wanneer de varianten van de suite worden uitgefaseerd of opnieuw geprijsd, erft je pipeline die beslissing. Het plafond van Kandinsky 6.0 Video is je eigen hardware, en de MIT-licentie betekent dat een fork de roadmap van het lab kan overleven. Teams die zich hebben gebrand aan een model dat uit een catalogus verdween, laten dat verschil een jaar later doorgaans zwaarder wegen dan op de dag dat ze hun keuze maakten.

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.