Una scheda del titolo generata che recita "Kandinsky 6.0 Video vs Alibaba Wan 2.7" con il sottotitolo "Pesi aperti contro una suite di quattro modelli". Il logo di OrcaRouter si trova nell'angolo in basso a destra.
Guides & Insights

Kandinsky 6.0 Video vs Alibaba Wan 2.7: Pesi aperti contro una suite di quattro modelli

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Kandinsky 6.0 Video ti offre un checkpoint da 29 miliardi di parametri che puoi scaricare e, in cambio, una clip di cinque secondi. Wan 2.7 ti offre quattro varianti specifiche per attività, clip fino a quindici secondi e una fattura al secondo. Queste due frasi sono il confronto, e la ragione per cui vale la pena metterlo per iscritto è che la maggior parte delle pagine testa a testa li confronta sulla qualità visiva, dove nessuno dei due ha un punteggio indipendente che possa risolvere la questione — e salta l'asse su cui divergono davvero, cioè quello che ciascuno si aspetta che tu porti.

Il Kandinsky Lab di Sber ha reso open source Kandinsky 6.0 Video nella prima settimana di ottobre 2026 con licenza MIT, in due dimensioni — Pro da 29B e Lite da 3B — con codice, checkpoint e integrazione con diffusers. Il Wan 2.7 di Alibaba è stato rilasciato il 3 aprile 2026 come suite: text-to-video, image-to-video, reference-to-video e video-edit, con fatturazione al secondo di video generato. Uno dei due è un modello che esegui; l'altro è un servizio che acquisti. La domanda interessante non è quale sia migliore, ma quale sia la forma giusta per il lavoro.

L'unico asse su cui sono direttamente comparabili

Entrambi i modelli generano video con audio, non video che poi vengono sonorizzati. È più raro di quanto sembri ed è per questo che questi due vengono menzionati insieme — la maggior parte del settore produce ancora un MP4 muto e lascia l’audio a una fase separata.

Kandinsky 6.0 Video lo fa con un CrossDiT a doppio flusso: un flusso video inizializzato dal checkpoint di Kandinsky 5.0 Video, un flusso audio addestrato da zero su grandi corpora audio, e un'attenzione incrociata bidirezionale che li unisce, addestrati congiuntamente dopo una fase di pre-addestramento continuo. L'output è audio a 44 kHz con sincronizzazione labiale, da un prompt testuale (T2AV) o da un'immagine di riferimento (I2AV).

Anche Wan 2.7 produce audio nativo, senza però pubblicare il meccanismo con lo stesso livello di dettaglio. La sua stessa documentazione indica la qualità audio e l'accuratezza del testo a schermo come le due aree che necessitano ancora di lavoro — un avvertimento sulla fedeltà da tenere presente, perché è il fornitore a dirlo, non un recensore che tira a indovinare.

È qui che finisce la somiglianza. Tutto ciò che segue questa riga è una divergenza, non una classifica.

Cinque secondi contro quindici, e cosa questo comporta per una shot list

Kandinsky 6.0 Video è addestrato a 121 frame, 24 fps — cinque secondi — e la release non contiene alcuna modalità di estensione. Il paper, la ricetta di serving integrata in vLLM-Omni e la tabella delle prestazioni del repository sono tutte incentrate su quella singola durata del clip. Un pezzo da trenta secondi è sei generazioni e cinque giunzioni, e le giunzioni tocca a te nasconderle.

Wan 2.7 copre da due a quindici secondi in una sola generazione, deciso in base alla richiesta. Per un clip talking-head, un inserto di prodotto o un singolo movimento di camera, quella differenza non è una comodità — è la differenza tra un singolo render e una fase di assemblaggio. Per qualsiasi cosa costruita inquadratura per inquadratura, cinque secondi sono una normale unità di lavoro e il divario in gran parte scompare.

• Clip massima — Kandinsky 6.0 Video: 5s, durata fissa, 121 fotogrammi a 24 fps. Wan 2.7: 2–15s, impostato in base alla richiesta.

• Risoluzione — Kandinsky 6.0 Video: SD, HD e Full HD (1920×1080) tramite un modello separato di super-risoluzione. Wan 2.7: fino a 1080p.

• Condizionamento di riferimento — Kandinsky 6.0 Video: un'immagine, applicata come fotogramma finale mascherato. Wan 2.7: fino a cinque immagini soggetto e cinque clip di riferimento, dieci risorse per richiesta.

• Attività — Kandinsky 6.0 Video: T2AV e I2AV. Wan 2.7: da testo a video, da immagine a video, da riferimento a video e video-edit come varianti separate con fatturazione separata.

• Pesi — Kandinsky 6.0 Video: MIT, scaricabili, Pro e Lite. Wan 2.7: no.

Quattro attività contro due modalità

Il numero di attività è la parte di Wan 2.7 che viene sminuita nelle tabelle comparative, perché non è un'affermazione sulla qualità — è un'affermazione sulla portata. La modifica basata su istruzioni di filmati esistenti, in cui descrivi una modifica e ottieni la stessa ripresa con quella modifica applicata, è un carico di lavoro che Kandinsky 6.0 Video non affronta affatto. Il riferimento-a-video, in cui una performance fornita guida un soggetto generato, è parimenti al di fuori delle sue due modalità.

La sua fatturazione riflette la portata. Le varianti text-to-video e image-to-video di Wan 2.7 fatturano solo la durata dell'output — 0,10 $/s a 720p e 0,15 $/s a 1080p sugli endpoint internazionali di Singapore, mentre Pechino e Tokyo riportano 0,086 $/s e 0,143 $/s per lo stesso lavoro. La variante reference-to-video fattura anche il video di input, con un limite massimo di cinque secondi, quindi un riferimento di cinque secondi che guida una generazione di quindici secondi viene fatturato per venti secondi di lavoro. La variante video-edit fattura solo l'output e considera gratuito il filmato di input — che è la tariffa più favorevole in assoluto della gamma, nonché il motivo per cui l'editing è l'ambito in cui 2.7 è davvero economico.

Due fatti del ciclo di vita vanno affiancati a quei numeri. Alibaba ha abbinato uno sconto di lancio a tempo limitato del 30% alle proprie superfici Bailian e Qwen Cloud, ed è scaduto il 23 settembre 2026. Separatamente, l'avviso di dismissione di Model Studio di Alibaba Cloud (ID 118434) mette offline diversi modelli più vecchi il 10 ottobre 2026, e wan2.7-r2v e wan2.7-image sono in quell'elenco. Si tratta di una questione a livello di variante, non di uno spegnimento della generazione — wan2.7-t2v e wan2.7-i2v restano elencati con tariffe attive — ma se il riferimento-a-video era il motivo per cui stavi considerando la 2.7, a quella strada restano quattro giorni.

Cosa mostrano e cosa non mostrano i consigli indipendenti

Questa è la sezione in cui la maggior parte dei confronti tra questi due modelli bara silenziosamente, quindi vale la pena essere precisi su ciò che esiste.

Wan 2.7 ha punteggi indipendenti su tre classifiche video separate di Artificial Analysis, e non concordano tra loro perché misurano cose diverse:

Da testo a video — Wan2.7-260612 (la build di giugno) si colloca al 13º–14º posto con Elo 1.030 (±9) su 5.571 voti, a 9,00 $/min.

• Da immagine a video — Wan 2.7 (la build di aprile) si trova al 12º posto con Elo 1.077 (±8) su 4.571 voti, a 9,00 $/min.

• Montaggio video — Wan 2.7 occupa il 5º posto con Elo 1.077 (±5) su 17.988 voti, a 16,90 $/min.

Leggendoli tutti e tre insieme, la conclusione utile non è «Wan 2.7 è dodicesimo nel video». È che il modello è nettamente più forte nell'editing che nella generazione, su classifiche costruite per ciascuno, e che citare un singolo numero per esso è un errore in entrambe le direzioni.

Kandinsky 6.0 Video non ha punteggio su nessuno di essi. Le sue prove pubblicate sono fornite dal venditore ed è bene precisare esattamente di cosa si tratta: un'esecuzione di VABench in cui il laboratorio riporta che Pro è in testa per qualità del parlato, estetica audio, allineamento testo-video e audio-video, precisione del lip-sync, desincronizzazione e realismo visivo tra i tre sistemi valutati — gli altri due sono il suo stesso modello Lite e LTX 2.5 — e una valutazione umana comparativa eseguita in laboratorio con circa 200 o più confronti a coppie per criterio, in cui Pro è competitivo con Kling 2.6 e Veo 3.1 Fast, è indietro rispetto a MiniMax H3 e Dreamina Seedance 2.0 sui criteri visivi, e rimane competitivo sulla qualità del parlato e sulla sincronizzazione audio-video. Nessuna di queste prove è stata riprodotta al di fuori di Sber, e nessuna di esse è un Elo su una classifica pubblica cieca. L'interpretazione corretta è "promettente e non verificato", non "eguaglia Veo".

Quanto costa ciascuno, espresso nei termini che ciascuna parte utilizza

I due modelli di prezzo non possono essere ridotti a un solo numero, e fingere il contrario è il modo in cui i team prendono una decisione sbagliata.

Wan 2.7 è una tariffa al secondo. Una clip di quindici secondi in 1080p costa circa $2,25. Un pezzo da trenta secondi richiede due generazioni più un montaggio — $4,50 di generazione grezza più il tuo tempo di assemblaggio, o meno se è la variante di editing a fare il lavoro, perché non fattura l'input.

Kandinsky 6.0 Video non ha alcuna tariffa, perché non c'è alcun servizio da acquistare. Quello che ha è un costo per GPU-ora che fornisci tu. I numeri del repository stesso stabiliscono il minimo: una clip Pro Full HD di cinque secondi richiede circa 402 secondi di tempo di lavoro su una H100 dopo il riscaldamento, 854 su una RTX 5090 e 1.247 su una RTX 4090. Il checkpoint distillato — che il paper ha misurato alla pari con il modello completo, con una preferenza media del 51% contro il 49%, senza che alcun criterio raggiungesse la significatività — è quello che serviresti effettivamente. Qualsiasi valore inferiore a 72,8 GiB di allocazione di picco richiede l'offloading dei blocchi, e il preset da 16 GB quantizza il text encoder a NF4, che il paper conferma essere l'unica modifica di preset che altera la clip stessa.

Detto chiaramente: il costo di Wan 2.7 è una voce su una fattura che puoi prevedere. Il costo di Kandinsky 6.0 Video è una macchina che possiedi, un rendering che richiede minuti per ogni cinque secondi, e la possibilità — non l'obbligo — di fare fine-tuning.

Dove si trova un router in questo

OrcaRouter non serve né Kandinsky 6.0 Video né Alibaba Wan 2.7, e qui non si sta sostenendo nessuna delle due affermazioni. Kandinsky puoi scaricarlo ed eseguirlo per conto tuo; a Wan 2.7 si accede tramite le piattaforme di Alibaba. Ciò di cui ha bisogno una pipeline costruita su uno dei due modelli da un router è lo strato di testo che circonda il render: l'espansione del prompt che trasforma la descrizione di un'inquadratura nella didascalia lunga o breve su cui questi modelli sono stati addestrati, il lavoro su didascalie e dialoghi che alimenta un passaggio image-to-video, e i riepiloghi di revisione che decidono quale, tra diverse generazioni, è quella da tenere. Quelle sono normali chiamate di testo, e girano su un unico endpoint compatibile con OpenAI, su oltre 200 modelli, con i prezzi di listino dei provider applicati con markup dello 0%, così un taglio di prezzo di un fornitore diventa effettivo lo stesso giorno invece che dopo un ciclo contrattuale. Il failover automatico vale di più qui che in un carico di lavoro di chat, perché una chiamata di didascalia che fallisce al quarto minuto di una sessione di Q&A dovrebbe essere reindirizzata anziché perdere il render.

La decisione, in una riga ciascuna

Se il risultato finale è una clip finita con audio e preferisci non possedere una GPU, Wan 2.7 è l'unico dei due che te lo offre, e la sua variante di editing è la cosa più forte della famiglia sulla base delle prove disponibili. Verifica la dismissione del 10 ottobre prima di impegnarti con reference-to-video.

Se il deliverable è una pipeline che controlli tu, se unità da cinque secondi si adattano alla tua shot list e se vuoi fare fine-tuning o eseguire offline, Kandinsky 6.0 Video è l'unico dei due che lo consente — al costo di un rendering lento su hardware consumer e di un'affermazione sulla qualità che è ancora interamente del laboratorio. L'evento da tenere d'occhio su quel fronte è semplice: un Elo.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

Un'asimmetria merita di essere menzionata prima di concludere, perché sopravvivrà a entrambi i modelli. Il tetto di Wan 2.7 spetta contrattualmente e tecnicamente ad Alibaba, che può fissarlo; quando le varianti della suite vengono ritirate o riprezzate, la tua pipeline eredita la decisione. Il tetto di Kandinsky 6.0 Video è il tuo hardware, e la licenza MIT significa che un fork può sopravvivere alla roadmap del laboratorio. I team che sono rimasti scottati dalla scomparsa di un modello da un catalogo tendono a dare a quella differenza un peso maggiore un anno dopo di quanto facessero il giorno in cui hanno scelto.

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.