
Kandinsky 6.0 Video vs Seedance 2.5: la versione nel paper non è quella che acquisti
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
La frase più citata di questo confronto è un paragone con il modello sbagliato. Il rapporto tecnico di Kandinsky 6.0 Video, pubblicato il 6 ottobre 2026 con il rilascio dei pesi sotto licenza MIT, si confronta con Dreamina Seedance 2.0 — la generazione precedente. Seedance 2.5, l'attuale modello video e audio di ByteDance, è disponibile dal 31 luglio 2026 ed è quello in vendita. Quindi, quando il rapporto conclude che Seedance «è preferito sui criteri visivi, con margini statisticamente significativi sulla qualità visiva complessiva, sugli artefatti, sul realismo del movimento e sul rispetto del prompt visivo», sta descrivendo una build che oggi non puoi licenziare, valutata dal laboratorio che ha scritto Kandinsky 6.0 Video. Entrambe le metà di quella frase contano, e nessuna delle due è un motivo per ignorare il confronto — il divario di versione fissa un limite inferiore a quanto può dirti, e l'impostazione ti dice di chi fidarti per cosa.
Cosa è cambiato tra le due versioni di Seedance
Il passaggio da 2.0 a 2.5 non è una ridipintura, ed è esattamente per questo che la sostituzione non è cosmetica. Seedance 2.5 genera fino a trenta secondi in un'unica passata — sei volte l'inviluppo del modello nel report, e sei volte i cinque fissi di Kandinsky 6.0 Video. Aggiunge targeting a livello di timestamp e modifiche post-generazione a livello di regione, il che significa che una modifica può essere applicata a una finestra della clip o a una porzione del fotogramma anziché rigenerare l'intero contenuto. Legge testo insieme a circa trenta immagini, dieci video e dieci clip audio come materiale di riferimento in una singola richiesta, contro il singolo fotogramma di coda mascherato di Kandinsky 6.0 Video. E produce audio sincronizzato con dialogo, che è l'unica ragione per cui questa coppia appartiene allo stesso articolo.
Ognuna di queste è una capacità che la valutazione del rapporto non ha testato. Il risultato dei criteri visivi ti dice quindi che Kandinsky 6.0 Video era indietro rispetto alla generazione precedente di Seedance in quanto a qualità visiva complessiva, artefatti, realismo del movimento e aderenza al prompt. Non ti dice cosa farebbe la build attuale, e l'ipotesi onesta è che una generazione più recente non peggiori sugli assi che le sue stesse note di rilascio enfatizzano.
Che cosa stabilisce e che cosa non stabilisce la valutazione del rapporto stesso
Il metodo è divulgato in modo sufficientemente dettagliato da poter essere valutato. Coppie affiancate generate dallo stesso prompt da due modelli, entrambe le clip anonimizzate, posizioni sinistra/destra randomizzate per ciascun task, ordine dei task mescolato, audio prima disattivato per le domande visive e poi attivato per quelle audio, un'opzione simmetrica di parità e un'opzione esplicita N/D laddove un criterio non possa essere giudicato, aggregazione tramite voto di maggioranza tra gli annotatori, e circa 200 o più confronti a coppie per ciascun criterio valutato.
Con quel metodo, il risultato di Seedance 2.0 si divide in un modo che risulterà familiare a chiunque abbia letto il confronto con Kling dello stesso report. I criteri visivi vanno a Seedance con margini che superano la soglia di significatività. Il dominio audio è molto più vicino: la sincronizzazione audio-video si attesta quasi sulla parità, e la qualità del parlato favorisce Kandinsky 6.0 Video Pro. Tra queste due affermazioni sta l'intera decisione, perché significa che il più recente checkpoint open audio-video è misurabilmente indietro su come appare una clip e misurabilmente avanti su come suona il parlato al suo interno.
I limiti di quel risultato sono quelli ordinari e nessuno di essi è fatale. È stato condotto dagli autori di Kandinsky su prompt di loro scelta con annotatori che hanno reclutato. Nessuna arena cieca pubblica valuta affatto Kandinsky 6.0 Video, quindi nulla di esterno ha verificato se i prompt di un estraneo riproducono la separazione. Il rapporto divulga anche il tetto rispetto al quale si sta misurando: clip fino a cinque secondi, generazione di base a risoluzione SD con il Full HD raggiunto attraverso una fase di super-risoluzione, e un divario che resta rispetto ai sistemi proprietari più forti in termini di qualità visiva e qualità audio complessiva.
Tre lacune strutturali che nessun benchmark riuscirebbe a cogliere
La durata è la prima e la più cruda. Kandinsky 6.0 Video è addestrato e valutato a 121 fotogrammi, esegue l'inferenza a 121 fotogrammi, 5 secondi a 24 fps, e viene distribuito senza modalità di estensione — un lavoro da trenta secondi è sei generazioni, cinque giunzioni e un rischio di continuità che ti assumi. Seedance 2.5 fa trenta secondi in un'unica passata. Per un singolo scambio di battute, una dimostrazione di prodotto o qualsiasi cosa in cui la giunzione sarebbe visibile, non è una differenza di benchmark; è una differenza nel fatto che il lavoro sia un singolo render o una fase di assemblaggio.
Il secondo è il condizionamento tramite riferimenti, e l'asimmetria è netta. Kandinsky 6.0 Video prende un'immagine di riferimento e la applica come frame finale mascherato — un keyframe verso cui interpolare. Seedance 2.5 prende un set di lavoro di circa trenta immagini, dieci clip video e dieci clip audio come un unico contesto. Coerenza dei personaggi lungo una sequenza, trasferimento di stile da una mood board, una performance portata da una clip esistente: sono carichi di lavoro che il numero di riferimenti abilita e che la modalità a frame singolo non tenta di affrontare.
Il terzo è la modificabilità, ed è quello che cambia un flusso di lavoro anziché una singola ripresa. La modifica a livello di regione e di timestamp significa che una finestra di tre secondi difettosa viene riparata sul posto. Kandinsky 6.0 Video non ha una superficie di modifica — cinque secondi sbagliati vengono rigenerati e, se sono stati uniti ad altri quattro, anche le giunzioni vengono riconsiderate. I team che valutano un'abitudine alla ri-renderizzazione dovrebbero includere quella differenza nella scelta del modello anziché scoprirla.
• Durata — Kandinsky 6.0 Video: 5 s fissi, 121 fotogrammi a 24 fps, nessuna modalità di estensione. Seedance 2.5: fino a 30 s in un'unica passata.
• Condizionamento di riferimento — Kandinsky 6.0 Video: un'immagine, applicata come fotogramma di coda mascherato. Seedance 2.5: circa trenta immagini, dieci video e dieci clip audio per richiesta.
• Montaggio — Kandinsky 6.0 Video: nessuno; rigenera e ricomponi. Seedance 2.5: targeting a livello di timestamp e modifiche post-generazione a livello di regione.
• Risoluzione — Kandinsky 6.0 Video: SD a 512×768, Full HD 1920×1080 tramite uno stadio di super-risoluzione integrato. Seedance 2.5: dipende dalla modalità, con il prezzo per clip stabilito dalla risoluzione che scegli.
• Audio — Kandinsky 6.0 Video: 44 kHz con sincronizzazione labiale, generato insieme all'immagine. Seedance 2.5: audio sincronizzato, incluso il dialogo, generato con il video.
• Pesi — Kandinsky 6.0 Video: MIT, Lite 3B e Pro 29B, con codice e integrazione diffusers. Seedance 2.5: no.
Due metri che non si convertono l'uno nell'altro
Seedance 2.5 viene conteggiato in token, il che si attesta su circa 0,51 $ per una clip di cinque secondi a 480p e circa 1,16 $ a 720p. Il motivo per esprimerlo così anziché come tariffa al secondo è che il numero di token scala con il metraggio, quindi una generazione di trenta secondi non equivale a trenta secondi a una tariffa fissa — è sei volte i token di una da cinque secondi con le stesse impostazioni, e le operazioni di editing vengono prezzate in base a ciò che toccano. Una pipeline che rigenera abitualmente scoprirà che il contatore risponde a quell'abitudine.
Kandinsky 6.0 Video non ha un contatore perché non c'è nulla da comprare. Il suo costo è una macchina e un orologio, e il report fornisce il cronometro: circa 402 secondi di tempo di lavoro su un H100 per una clip Pro Full HD di cinque secondi, 854 su una RTX 5090, 1.247 su una RTX 4090, offloading dei blocchi richiesto al di sotto di un'allocazione di picco di 72,8 GiB, e un preset da 16 GB di VRAM che quantizza il text encoder a NF4 — l'unica modifica di preset che, secondo il report, altera la clip stessa. Il checkpoint distillato, misurato alla pari con il modello completo a una preferenza media del 51% contro il 49%, senza che alcun criterio raggiunga la significatività statistica, è quello che rende quei numeri gestibili.
• Costo per cinque secondi — Kandinsky 6.0 Video: nessun prezzo di listino; da sei a ventuno minuti di una GPU a seconda della scheda. Seedance 2.5: circa $0,51 a 480p e $1,16 a 720p in token.
Nulla in quelle due righe è commensurabile, e il solito tentativo di ridurle a un'unica cifra — dividendo una tariffa oraria di GPU per clip di cinque secondi — presuppone silenziosamente pieno utilizzo, zero tempo di inattività e una scheda che già possiedi. Il confronto più utile è qualitativo: il costo di Seedance 2.5 è proporzionale a quanto generi e svanisce quando ti fermi; il costo di Kandinsky 6.0 Video si sostiene indipendentemente dal fatto che tu generi o meno.

Dove ciascuno è raggiungibile
Nessuno dei due modelli è su OrcaRouter, e nessuna delle due affermazioni viene fatta. Seedance 2.5 si raggiunge tramite le piattaforme dello stesso fornitore e diversi servizi di terze parti; Kandinsky 6.0 Video è un checkpoint che scarichi con licenza MIT ed esegui sul tuo hardware. Qualsiasi pagina che ti dica che entrambi sono a una sola chiamata API di distanza su una piattaforma multi-modello sta descrivendo modelli diversi.
Il motivo per cui vale ancora la pena menzionare un livello di routing in una pipeline Kandinsky o Seedance è che questi sistemi sono per lo più testo in termini di numero di chiamate e video in termini di costo. L'espansione del prompt trasforma una nota di scena nella lunga didascalia strutturata che un modello T2AV si aspetta. Il dialogo viene abbozzato prima che un passaggio di lip-sync tenti di elaborarlo, e viene riscritto quando il passaggio lo stravolge. Sei generazioni candidate dello stesso beat vengono esaminate e una viene selezionata — un giudizio testuale su un artefatto video, che è il modo più economico per prendere correttamente la decisione costosa. Su un singolo endpoint compatibile con OpenAI che copre oltre 200 modelli ai prezzi di listino dei provider, passati con markup dello 0%, quelle chiamate costano quanto addebita il provider e non di più, anche il giorno dopo che un fornitore cambia le sue tariffe. Il DSL di routing si guadagna il suo posto quando il revisore economico e il revisore attento dovrebbero essere modelli diversi nello stesso punto di chiamata, e il failover automatico se lo guadagna perché una didascalia che muore mentre il clip quattro di sei è in fase di rendering dovrebbe essere reindirizzata anziché terminare la sessione.
Cosa potrebbe spostare questo confronto?
Il divario tra versioni è tutta la storia e anche il percorso più breve per risolverlo. Un test di Seedance 2.5 contro Kandinsky 6.0 Video chiarirebbe se le perdite sui criteri visivi che il rapporto registra rispetto alla 2.0 si sono ampliate, ridotte o invertite — il rapporto non può rispondere a questo, e i suoi autori non avevano modo di farlo. Per ora, la posizione difendibile è più ristretta di quanto voglia il marketing di entrambe le parti: secondo le prove pubblicate dal laboratorio stesso del modello, Seedance è avanti su come appare il clip e Kandinsky 6.0 Video è avanti su come suona il parlato al suo interno, e la versione di Seedance su cui si basa questa affermazione è una generazione indietro rispetto a quella che compreresti.
Scegli di conseguenza. Se il lavoro è lungo, pieno di riferimenti o guidato dal montaggio, sono i gap strutturali a deciderlo prima che la qualità entri in scena. Se il lavoro è un'inquadratura parlata di cinque secondi in cui il dialogo deve suonare giusto al primo tentativo, il vantaggio misurato di Kandinsky 6.0 Video sta esattamente su quel criterio — e la licenza MIT significa che la risposta non dipende dalla roadmap di nessuno. La cosa da tenere d'occhio non è una classifica. È la ripetizione di un confronto che il report non è mai riuscito a eseguire.


Il modo più economico per effettuare correttamente la chiamata costosa: un DSL di routing che sostituisce il revisore per fase, con failover automatico, così una didascalia morta non fa perdere la clip.
