
Kandinsky 6.0 Video vs Seedance 2.5: A Versão no Artigo Não É a Versão que Você Compra
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A frase mais citada neste confronto é uma comparação com o modelo errado. O relatório técnico do Kandinsky 6.0 Video, publicado em 6 de outubro de 2026 com o lançamento dos pesos sob licença MIT, avalia em comparação com Dreamina Seedance 2.0 — a geração anterior. Seedance 2.5, o modelo atual de vídeo e áudio da ByteDance, está disponível desde 31 de julho de 2026 e é o que está à venda. Então, quando o relatório conclui que o Seedance "é preferido nos critérios visuais, com margens estatisticamente significativas em qualidade visual geral, artefatos, realismo de movimento e seguimento de prompts visuais", ele está descrevendo uma versão que não é possível licenciar hoje, avaliada pelo laboratório que escreveu Kandinsky 6.0 Video. As duas metades dessa frase importam, e nenhuma delas é motivo para ignorar a comparação — a diferença de versão estabelece um limite mínimo para o quanto ela pode lhe dizer, e o enquadramento diz a você em quem confiar para quê.
O que mudou entre as duas versões do Seedance
O passo de 2.0 para 2.5 não é uma repintura, e é exatamente por isso que a substituição não é cosmética. O Seedance 2.5 gera até trinta segundos em uma única passagem — seis vezes o envelope do modelo no relatório, e seis vezes os cinco fixos do Kandinsky 6.0 Video. Ele adiciona segmentação em nível de timestamp e edições pós-geração em nível de região, o que significa que uma alteração pode ser aplicada a uma janela do clipe ou a uma parte do quadro em vez de regenerar a coisa toda. Ele lê texto junto com cerca de trinta imagens, dez vídeos e dez clipes de áudio como material de referência em uma única solicitação, contra o único quadro final mascarado do Kandinsky 6.0 Video. E ele produz áudio sincronizado com diálogo, que é a única razão pela qual este par pertence ao mesmo artigo.
Cada um desses itens é uma capacidade que a avaliação do relatório não testou. O resultado dos critérios visuais, portanto, indica que o Kandinsky 6.0 Video ficou atrás da geração anterior do Seedance em qualidade visual geral, artefatos, realismo de movimento e aderência ao prompt. Ele não indica o que a versão atual faria, e a suposição honesta é que uma geração mais nova não piora nos eixos que suas próprias notas de lançamento enfatizam.
O que a avaliação do próprio relatório estabelece e o que não estabelece
O método é divulgado de forma suficientemente minuciosa para ser ponderado. Pares lado a lado gerados a partir do mesmo prompt por dois modelos, ambos os clipes anonimizados, posições esquerda/direita randomizadas por tarefa, ordem das tarefas embaralhada, áudio primeiro desativado para as perguntas visuais e depois ativado para as de áudio, uma opção simétrica de empate e uma opção explícita de N/A quando um critério não pode ser julgado, agregação por voto majoritário entre anotadores, e aproximadamente 200 ou mais comparações pareadas para cada critério avaliado.
Com esse método, o resultado do Seedance 2.0 divide-se de uma forma que será familiar para qualquer pessoa que tenha lido a comparação com o Kling do mesmo relatório. Os critérios visuais vão para o Seedance com margens que superam a significância. O domínio do áudio está muito mais próximo: a sincronização áudio-vídeo fica perto da paridade, e a qualidade da fala favorece o Kandinsky 6.0 Video Pro. Entre essas duas afirmações reside toda a decisão, porque isso significa que o checkpoint aberto de áudio-vídeo mais recente está mensuravelmente atrás em como um clipe se parece e mensuravelmente à frente em como a fala nele soa.
Os limites desse resultado são os habituais e nenhum deles é fatal para ele. Foi executado pelos autores do Kandinsky em prompts de sua escolha com anotadores que eles recrutaram. Nenhuma arena cega pública avalia o Kandinsky 6.0 Video, então nada externo testou se os prompts de um estranho reproduzem a divisão. O relatório também divulga o teto em relação ao qual está medindo: clipes de até cinco segundos, geração base em resolução SD com Full HD alcançado por meio de um estágio de super-resolução, e uma lacuna remanescente para os sistemas proprietários mais fortes em qualidade visual e qualidade de áudio geral.
Três lacunas estruturais que nenhum benchmark capturaria
A duração é o primeiro e o mais contundente. Kandinsky 6.0 Video é treinado e avaliado em 121 quadros, executa inferência em 121 quadros, 5 segundos a 24 fps, e é distribuído sem modo de extensão — uma peça de trinta segundos são seis gerações, cinco emendas e risco de continuidade por sua conta. Seedance 2.5 faz trinta segundos em uma única passada. Para uma única troca de diálogo, uma demonstração de produto, ou qualquer coisa em que a emenda ficaria visível, isso não é uma diferença de benchmark; é uma diferença entre o trabalho ser uma renderização única ou uma etapa de montagem.
A segunda é condicionamento por referência, e a assimetria é gritante. O Kandinsky 6.0 Video pega uma imagem de referência e a aplica como um quadro final mascarado — um keyframe para o qual interpolar. O Seedance 2 pega um conjunto de trabalho de cerca de trinta imagens, dez clipes de vídeo e dez clipes de áudio como um único contexto. Consistência de personagem ao longo de uma sequência, transferência de estilo a partir de um mood board, uma atuação trazida de um clipe existente: essas são cargas de trabalho que a contagem de referências possibilita e a abordagem de quadro único não tenta.
O terceiro é a editabilidade, e é ela que muda um fluxo de trabalho, e não uma única tomada. A edição no nível da região e do timestamp significa que uma janela defeituosa de três segundos é reparada no local. O Kandinsky 6.0 Video não tem superfície de edição — um trecho ruim de cinco segundos é regenerado e, se ele foi unido a outros quatro, as junções também são reconsideradas. Equipes que precificam um hábito de re-renderização devem embutir essa diferença na escolha do modelo, em vez de descobri-la depois.
• Duração — Kandinsky 6.0 Video: 5 s fixos, 121 frames a 24 fps, sem modo de extensão. Seedance 2.5: até 30 s em uma única passagem.
• Condicionamento de referência — Kandinsky 6.0 Video: uma imagem, aplicada como quadro final mascarado. Seedance 2.5: cerca de trinta imagens, dez vídeos e dez clipes de áudio por solicitação.
• Edição — Kandinsky 6.0 Video: nenhuma; regenerar e recombinar. Seedance 2.5: direcionamento em nível de carimbo de data/hora e edições pós-geração em nível de região.
• Resolução — Kandinsky 6.0 Video: SD em 512×768, Full HD 1920×1080 por meio de uma etapa integrada de super-resolução. Seedance 2.5: depende do modo, com o preço por clipe definido pela resolução que você escolher.
• Áudio — Kandinsky 6.0 Video: 44 kHz com sincronização labial, gerado em conjunto com a imagem. Seedance 2.5: áudio sincronizado, incluindo diálogo, gerado com o vídeo.
• Pesos — Kandinsky 6.0 Video: MIT, Lite 3B e Pro 29B, com código e integração com diffusers. Seedance 2.5: não.
Dois metros que não se convertem entre si.
Seedance 2.5 é medido em tokens, o que dá aproximadamente US$ 0,51 por um clipe de cinco segundos em 480p e aproximadamente US$ 1,16 em 720p. A razão de dizermos isso dessa forma, em vez de como uma tarifa por segundo, é que a contagem de tokens escala com a filmagem, então uma geração de trinta segundos não são trinta segundos de uma tarifa fixa — são seis vezes os tokens de uma de cinco segundos com as mesmas configurações, e as operações de edição são precificadas pelo que tocam. Um pipeline que regenera habitualmente vai descobrir que o medidor responde a esse hábito.
O Kandinsky 6.0 Video não tem medidor porque não há nada para comprar. Seu custo é uma máquina e um relógio, e o relatório fornece o relógio: cerca de 402 segundos de tempo de trabalho em uma H100 para um clipe Pro Full HD de cinco segundos, 854 em uma RTX 5090, 1.247 em uma RTX 4090, offloading de blocos necessário abaixo de uma alocação de pico de 72,8 GiB, e um preset de 16 GB de VRAM que quantiza o codificador de texto para NF4 — a única alteração de preset que, segundo o relatório, altera o próprio clipe. O checkpoint destilado, medido em paridade com o modelo completo em uma preferência média de 51% a 49%, sem que nenhum critério atinja significância estatística, é o que torna esses números viáveis.
• Custo por cinco segundos — Kandinsky 6.0 Video: sem preço de tabela; de seis a vinte e um minutos de uma GPU, dependendo da placa. Seedance 2.5: cerca de US$ 0,51 em 480p e US$ 1,16 em 720p em tokens.
Nada nessas duas linhas é comensurável, e a tentativa habitual de reduzi-las a um único valor — dividir uma tarifa de GPU por hora por clipes de cinco segundos — pressupõe silenciosamente utilização total, zero tempo ocioso e uma placa que você já possui. A comparação mais útil é qualitativa: o custo do Seedance 2.5 escala com o quanto você gera e desaparece quando você para; o custo do Kandinsky 6.0 Video é incorrido quer você gere quer não.

Onde cada um pode ser alcançado
Nenhum dos modelos está no OrcaRouter, e nenhuma das duas alegações está sendo feita. O Seedance 2.5 é acessado por meio das próprias plataformas do fornecedor e de vários serviços de terceiros; o Kandinsky 6.0 Video é um checkpoint que você baixa sob a licença MIT e executa no seu próprio hardware. Qualquer página que diga que ambos estão a uma chamada de API de distância em uma plataforma multimodelo está descrevendo modelos diferentes.
A razão pela qual uma camada de roteamento ainda vale a pena ser mencionada em um pipeline de Kandinsky ou Seedance é que esses sistemas são, em sua maioria, texto pela contagem de chamadas e vídeo pelo custo. A expansão de prompt transforma uma nota de plano na longa legenda estruturada que um modelo T2AV espera. O diálogo é redigido antes que uma passagem de sincronia labial tente executá-lo, e é reescrito quando a passagem o estraga. Seis gerações candidatas do mesmo trecho são revisadas e uma é selecionada — um julgamento textual sobre um artefato de vídeo, que é a maneira mais barata de tomar a decisão cara corretamente. Em um endpoint único compatível com OpenAI para mais de 200 modelos aos preços de tabela dos provedores repassados com 0% de margem, essas chamadas custam o que o provedor cobra e nada mais, inclusive no dia seguinte a uma alteração de tarifas por um fornecedor. A DSL de roteamento justifica seu lugar quando o revisor barato e o revisor cuidadoso deveriam ser modelos diferentes no mesmo ponto de chamada, e o failover automático justifica sua presença porque uma legenda que morre enquanto o clipe quatro de seis está sendo renderizado deveria acionar um redirecionamento em vez de encerrar a sessão.
O que moveria este confronto?
A disparidade entre versões é toda a história e também o caminho mais curto para resolvê-la. Uma execução do Seedance 2.5 contra o Kandinsky 6.0 Video resolveria a questão de saber se as perdas nos critérios visuais que o relatório registra em relação ao 2.0 aumentaram, diminuíram ou se inverteram — o relatório não consegue responder a isso, e os seus autores não tinham como fazê-lo. Por agora, a posição defensável é mais restrita do que o marketing de qualquer dos lados deseja: com base nas evidências publicadas pelo próprio laboratório do modelo, o Seedance está à frente no que diz respeito à aparência do clipe e o Kandinsky 6.0 Video está à frente no que diz respeito a como a fala nele soa, e a versão do Seedance em que essa afirmação se baseia está uma geração atrás da que você compraria.
Escolha de acordo. Se o trabalho for longo, repleto de referências ou orientado a edição, as lacunas estruturais decidem isso antes que a qualidade entre em cena. Se o trabalho for um plano falado de cinco segundos em que o diálogo tem de soar certo à primeira, a vantagem medida do Kandinsky 6.0 Video está exatamente nesse critério — e a licença MIT significa que a resposta não depende do roteiro de ninguém. O que se deve observar não é um ranking. É uma repetição de uma comparação que o relatório nunca conseguiu executar.


Maneira mais barata de fazer a chamada cara corretamente: uma DSL de roteamento que troca o revisor por etapa, com failover automático para que uma legenda morta não custe o clipe.
