Um cartão de título gerado com os dizeres 'Kandinsky 6.0 Video vs Alibaba Wan 2.7' e o subtítulo 'Pesos abertos contra uma suíte de quatro modelos'. O logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

Kandinsky 6.0 Video vs Alibaba Wan 2.7: Pesos Abertos Contra uma Suíte de Quatro Modelos

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Kandinsky 6.0 Video oferece um checkpoint de 29B parâmetros que você pode baixar e um clipe de cinco segundos em troca. Wan 2.7 oferece quatro variantes específicas para tarefas, clipes de até quinze segundos e uma fatura por segundo. Essas duas frases são a comparação, e a razão pela qual vale a pena registrá-la é que a maioria das páginas de comparação direta os compara quanto à qualidade visual, em que nenhum dos dois tem uma pontuação independente que resolveria a questão — e ignora o eixo em que eles realmente divergem, que é aquilo que cada um espera que você traga.

O Kandinsky Lab da Sber disponibilizou o Kandinsky 6.0 Video em código aberto na primeira semana de outubro de 2026, sob a licença MIT, em dois tamanhos — Pro com 29B e Lite com 3B — com código, checkpoints e integração com o diffusers. O Wan 2.7 da Alibaba foi lançado em 3 de abril de 2026 como uma suíte: texto para vídeo, imagem para vídeo, referência para vídeo e edição de vídeo, com cobrança por segundo de vídeo gerado. Um deles é um modelo que você executa; o outro é um serviço que você compra. A pergunta interessante não é qual é melhor, mas qual deles tem o formato certo para o trabalho.

O único eixo em que são diretamente comparáveis

Ambos os modelos geram vídeo com som, não um vídeo que você depois sonoriza. Isso é mais raro do que parece, e é por isso que esses dois chegam a ser mencionados juntos — a maior parte da área ainda produz um MP4 silencioso e deixa o áudio para uma etapa separada.

Kandinsky 6.0 Video faz isso com um CrossDiT de fluxo duplo: um fluxo de vídeo inicializado a partir do checkpoint do Kandinsky 5.0 Video, um fluxo de áudio treinado do zero em grandes corpora de áudio e atenção cruzada bidirecional que os une, treinada em conjunto após uma etapa de pré-treinamento contínuo. A saída é áudio de 44 kHz com sincronia labial, a partir de um prompt de texto (T2AV) ou de uma imagem de referência (I2AV).

O Wan 2.7 também produz áudio nativo, sem divulgar o mecanismo com o mesmo nível de detalhe. A própria documentação dele aponta a qualidade do áudio e a precisão do texto na tela como as duas áreas que ainda precisam de trabalho — uma ressalva de fidelidade que vale a pena manter, porque é o fornecedor quem o diz, e não um avaliador especulando.

É aí que a semelhança termina. Tudo abaixo desta linha é uma divergência, não um ranking.

Cinco segundos contra quinze, e o que isso faz com um arremesso

O Kandinsky 6.0 Video é treinado em 121 quadros, 24 fps — cinco segundos — e o lançamento não contém modo de extensão. O artigo, a receita de serving incorporada ao vLLM-Omni e a tabela de desempenho do repositório são todos construídos em torno dessa única duração de clipe. Um trecho de trinta segundos é seis gerações e cinco emendas, e esconder as emendas é com você.

Wan 2.7 cobre de dois a quinze segundos em uma única geração, definido por solicitação. Para um clipe de talking head, uma inserção de produto ou um único movimento de câmera, essa diferença não é uma conveniência — é a diferença entre uma renderização e uma etapa de montagem. Para qualquer coisa construída plano a plano, cinco segundos é uma unidade normal de trabalho e a lacuna praticamente desaparece.

• Clipe máx. — Kandinsky 6.0 Vídeo: 5s, fixo, 121 quadros a 24 fps. Wan 2.7: 2–15s, definido por solicitação.

• Resolução — Kandinsky 6.0 Video: SD, HD e Full HD (1920×1080) por meio de um modelo separado de super-resolução. Wan 2.7: até 1080p.

• Condicionamento por referência — Kandinsky 6.0 Video: uma imagem, aplicada como quadro final mascarado. Wan 2.7: até cinco imagens de sujeito e cinco clipes de referência, dez ativos por solicitação.

• Tarefas — Kandinsky 6.0 Video: T2AV e I2AV. Wan 2.7: texto para vídeo, imagem para vídeo, referência para vídeo e edição de vídeo como variantes separadas com cobrança separada.

• Pesos — Kandinsky 6.0 Video: MIT, disponíveis para download, Pro e Lite. Wan 2.7: não.

Quatro tarefas contra dois modos

A contagem de tarefas é a parte do Wan 2.7 que é subestimada nas tabelas de comparação, porque não é uma alegação de qualidade — é uma alegação de escopo. A edição baseada em instruções de filmagens existentes, na qual você descreve uma alteração e recebe a mesma tomada de volta com essa alteração aplicada, é uma carga de trabalho que o Kandinsky 6.0 Video não tenta de modo algum. Referência para vídeo, em que uma atuação fornecida orienta um sujeito gerado, também está fora de seus dois modos.

A cobrança dele reflete o escopo. As variantes de texto para vídeo e de imagem para vídeo do Wan 2.7 cobram apenas pela duração da saída — US$ 0,10/s em 720p e US$ 0,15/s em 1080p nos endpoints internacionais de Singapura, com Pequim e Tóquio listando US$ 0,086/s e US$ 0,143/s pelo mesmo trabalho. A variante de referência para vídeo também cobra pelo vídeo de entrada, com teto de cinco segundos, então uma referência de cinco segundos que gera uma saída de quinze segundos é cobrada por vinte segundos de trabalho. A variante de edição de vídeo cobra apenas pela saída e trata o material de entrada como gratuito — o que é a tarifa mais favorável de toda a família e o motivo pelo qual a edição é onde o 2.7 é genuinamente barato.

Dois fatos de ciclo de vida devem acompanhar esses números. A Alibaba vinculou um desconto de lançamento de 30% por tempo limitado às suas próprias plataformas Bailian e Qwen Cloud, e ele expirou em 23 de setembro de 2026. Separadamente, o aviso de descontinuação do Model Studio da Alibaba Cloud (ID 118434) tira vários modelos mais antigos do ar em 10 de outubro de 2026, e wan2.7-r2v e wan2.7-image estão nessa lista. Trata-se de algo no nível da variante, e não de um encerramento da geração — wan2.7-t2v e wan2.7-i2v continuam listados com preços ativos — mas, se era o reference-to-video o motivo pelo qual você estava considerando o 2.7, essa rota tem quatro dias restantes.

O que os conselhos independentes mostram e não mostram

Esta é a seção em que a maioria das comparações entre esses dois modelos trapaceia discretamente, por isso vale a pena ser preciso sobre o que existe.

O Wan 2.7 tem pontuações independentes em três quadros de vídeo separados do Artificial Analysis, e eles não coincidem entre si porque medem coisas diferentes:

• Texto para vídeo — Wan2.7-260612 (a build de junho) ocupa o 13º–14º lugar no Elo 1.030 (±9) com 5.571 votos, a US$ 9,00/min.

• Imagem para vídeo — Wan 2.7 (a versão de abril) ocupa a 12ª posição com Elo 1.077 (±8) em 4.571 votos, a $9,00/min.

• Edição de vídeo — Wan 2.7 ocupa o 5º lugar no Elo 1.077 (±5) com 17.988 votos, a US$ 16,90/min.

Leia esses três em conjunto e a conclusão útil não é "Wan 2.7 é o décimo segundo em vídeo". É que o modelo é nitidamente mais forte em edição do que em geração, em rankings construídos para cada uma, e que citar um único número para ele é um erro em qualquer direção.

Kandinsky 6.0 Video não tem pontuação em nenhum deles. A evidência publicada é do lado do fornecedor, e vale dizer exatamente o que ela é: uma execução do VABench na qual o laboratório relata que o Pro lidera em qualidade de fala, estética de áudio, alinhamento texto-vídeo e áudio-vídeo, precisão de sincronização labial, dessincronização e realismo visual entre os três sistemas avaliados — sendo os outros dois o seu próprio modelo Lite e o LTX 2.5 — e uma avaliação humana lado a lado conduzida pelo laboratório, com cerca de 200 ou mais comparações pareadas por critério, na qual o Pro é competitivo com o Kling 2.6 e o Veo 3.1 Fast, fica atrás do MiniMax H3 e do Dreamina Seedance 2.0 em critérios visuais, e permanece competitivo em qualidade de fala e sincronização áudio-vídeo. Nada disso foi reproduzido fora da Sber, e nada disso é um Elo em um ranking público cego. A leitura correta é "promissor e não auditado", não "empata com o Veo".

Quanto custa cada um, expresso nos termos que cada lado usa

Os dois modelos de precificação não podem ser reduzidos a um único número, e fingir o contrário é como as equipes tomam uma decisão errada.

Wan 2.7 é uma tarifa por segundo. Um clipe de quinze segundos em 1080p custa cerca de $2,25. Uma peça de trinta segundos são duas gerações mais uma edição — $4,50 de geração bruta mais seu tempo de montagem, ou menos se a variante de edição estiver fazendo o trabalho, porque ela não cobra a entrada.

O Kandinsky 6.0 Video não tem tarifa alguma, porque não existe serviço para comprar. O que ele tem é um custo por hora de GPU que você fornece. Os próprios números do repositório definem o piso: um clipe Pro Full HD de cinco segundos custa cerca de 402 segundos de tempo de trabalho numa H100 após o aquecimento, 854 numa RTX 5090 e 1.247 numa RTX 4090. O checkpoint destilado — que o artigo mediu em paridade com o modelo completo, com preferência média de 51% contra 49% e sem que nenhum critério alcançasse significância — é, na prática, o que você colocaria em produção. Qualquer valor abaixo de 72,8 GiB de alocação de pico exige offloading de blocos, e o preset de 16 GB quantiza o codificador de texto em NF4, o que o artigo confirma ser a única alteração de preset que modifica o próprio clipe.

Dito de forma simples: o custo do Wan 2.7 é uma linha numa fatura que você pode prever. O custo do Kandinsky 6.0 Video é uma máquina que você possui, uma renderização que leva minutos a cada cinco segundos, e a opção — não a obrigação — de fazer ajuste fino.

Onde um roteador se posiciona nisto

O OrcaRouter não disponibiliza nem o Kandinsky 6.0 Video nem o Alibaba Wan 2.7, e nenhuma dessas alegações está sendo feita aqui. O Kandinsky é seu para baixar e executar; o Wan 2.7 é acessado por meio das próprias plataformas da Alibaba. O que um pipeline construído sobre qualquer um dos modelos precisa de um roteador é a camada de texto que cerca a renderização: a expansão de prompt que transforma a descrição de uma cena na legenda longa ou curta com que esses modelos foram treinados, o trabalho de legendagem e diálogo que alimenta uma passagem de imagem para vídeo, e os resumos de revisão que decidem qual de várias gerações deve ser mantida. Essas são chamadas de texto comuns, e são executadas em um único endpoint compatível com OpenAI em mais de 200 modelos com preços de lista dos provedores repassados com 0% de margem, então um corte de preço de fornecedor entra em vigor no mesmo dia, em vez de depois de um ciclo de contrato. O failover automático vale mais aqui do que em uma carga de trabalho de chat, porque uma chamada de legenda que falha no quarto minuto de uma sessão de perguntas e respostas deve ser redirecionada em vez de perder a renderização.

A decisão, em uma linha cada

Se o entregável for um clipe finalizado com som e você preferir não possuir uma GPU, o Wan 2.7 é o único dos dois que vende isso para você, e sua variante de edição é a coisa mais forte da família com base nas evidências disponíveis. Confira a descontinuação de 10 de outubro antes de se comprometer com referência para vídeo.

Se o entregável for um pipeline que você controla, se unidades de cinco segundos servem para a sua lista de planos, e se você quer fazer fine-tuning ou rodar offline, o Kandinsky 6.0 Video é o único dos dois que permite isso — ao custo de uma renderização lenta em hardware de consumidor e de uma alegação de qualidade que ainda é inteiramente do próprio laboratório. O evento a observar desse lado é simples: um Elo.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

Vale a pena nomear uma assimetria antes de encerrar, porque ela sobreviverá aos dois modelos. O teto do Wan 2.7 cabe, contratual e tecnicamente, à Alibaba definir — quando as variantes da suíte forem descontinuadas ou tiverem os preços alterados, seu pipeline herda a decisão. O teto do Kandinsky 6.0 Video é o seu próprio hardware, e a licença MIT significa que um fork pode sobreviver ao roadmap do laboratório. Equipes que já se queimaram com um modelo desaparecendo de um catálogo tendem a dar mais peso a essa diferença um ano depois do que deram no dia em que escolheram.

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.