
Kandinsky 6.0 Video vs Google Veo 3.1: Três Níveis Contra Dois Tamanhos
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Abra o relatório técnico da Sber sobre o Kandinsky 6.0 e encontre a seção de confronto direto, e você vai notar algo que as páginas de comparação deixam passar: o oponente não é o Veo 3.1. É o Veo 3.1 Fast. A Sber fez sua avaliação humana contra o nível intermediário dos três níveis do Veo, e essa única escolha diz mais sobre esse confronto do que qualquer alegação de qualidade nele. O Veo 3.1 está disponível de forma geral desde 17 de novembro de 2025 em três níveis de serviço; o Kandinsky 6.0 Video chegou na primeira semana de outubro de 2026 em dois tamanhos para download, o Pro com 29B e o Lite com 3B, sob licença MIT. Um deles é um serviço que você compra por segundo, o outro é um checkpoint que você executa — e a questão do nível, não a da qualidade, é onde a decisão realmente está.
O Veo 3.1 são três produtos vestindo um único slogan.
O modelo do Google está em disponibilidade geral nas versões Standard, Fast e Lite, e todas as três produzem a mesma família de formatos: 720p, 1080p e 4K nativo a 24 fps, durações nativas de 4, 6 ou 8 segundos, com saídas mais longas relatadas em 1080p e encadeamento de extensão de cena além disso, até três imagens de referência para consistência de personagem e de cena, além de controles de seed e de prompt negativo. A saída traz metadados de proveniência SynthID e C2PA.
O que separa os níveis é o preço e a velocidade, e o painel independente diz algo desconfortável sobre a diferença. No ranking de texto para vídeo da Artificial Analysis, os três estão a menos de 14 Elo de diferença entre si — Veo 3.1 com 962 (±10) em 2.998 votos, Veo 3.1 Fast com 961 (±10) em 4.325, Veo 3.1 Lite com 948 (±10) em 2.903 — enquanto suas tarifas listadas são de $24,00, $7,20 e $4,80 por minuto. Leia isso em conjunto e a arena está lhe dizendo que não consegue distinguir os níveis de forma confiável com base na preferência. Isso não significa que os níveis são idênticos; significa que a verdadeira pergunta de um comprador é qual nível atende ao seu critério, porque o painel de preferência não responderá isso por ele.
O Kandinsky 6.0 Video adota a abordagem oposta à variação. Há dois tamanhos — Pro, com 29B, e Lite, com 3B — que compartilham uma única arquitetura e um único formato de saída fixo: 5 segundos, 121 quadros a 24 fps, áudio sincronizado de 44 kHz com sincronia labial, a partir de texto ou de uma imagem de referência, com um modelo separado de super-resolução que eleva o resultado para Full HD. Não há variante Fast nem modo de extensão. Você escolhe um tamanho e uma GPU.
O que a avaliação do próprio laboratório realmente afirma
Este é o único conjunto de dados comparativos diretos que existe entre estes dois sistemas, e é relatado pelo fornecedor em ambos os lados da barra — a Sber o realizou, a Sber o publicou, e ninguém fora da Sber o reproduziu. Declará-lo com precisão importa mais do que declará-lo favoravelmente.
No modo texto-para-áudio-vídeo, o relatório indica que o Kandinsky 6.0 Video Pro é preferido em artefatos e movimento de câmera, com margens estatisticamente significativas, e ligeiramente à frente em realismo de movimento num campo dominado por empates. O Veo 3.1 Fast lidera em seguimento de prompt visual, qualidade de fala, sincronização áudio-vídeo, qualidade geral do áudio, seguimento de prompt de som e resolução de tarefas do usuário, com todos, exceto fala, atingindo significância. A qualidade visual geral está quase em paridade, com uma ligeira vantagem para o Veo.
Na conversão de imagem para vídeo, o padrão se inverte na metade visual. O Kandinsky 6.0 Video Pro é preferido em qualidade visual geral, alinhamento com a imagem de referência, artefatos e movimento de câmera, todos significativos. O Veo 3.1 Fast ainda lidera em seguimento de prompt visual, sincronização de áudio e vídeo, qualidade geral do áudio, seguimento de prompt sonoro e resolução de tarefas do usuário, também significativos. Realismo de movimento e qualidade da fala ficam quase em paridade.
Duas coisas decorrem disso. O resultado de imagem para vídeo é a descoberta genuína: um modelo aberto ser preferido em correspondência com a imagem de referência e em qualidade visual geral contra um tier do Google, no próprio estudo do laboratório, é uma afirmação real que vale a pena ponderar. E o resultado de áudio é onde o Veo mantém a sua liderança independentemente do modo — o que nos leva ao alerta que ninguém menciona.
O flag de áudio que decide se essa avaliação é justa
O Veo 3.1 gera áudio estéreo nativo de 48 kHz — diálogo, ambiência, foley — em conjunto com a imagem. É uma das características mais fortes do modelo. Na API, porém, o parâmetro de áudio é definido por padrão como desativado, e a geração silenciosa custa menos que a geração com áudio: cerca de US$ 0,20 por segundo no modo silencioso, contra cerca de US$ 0,40 por segundo com áudio ativado no nível Standard publicado do Google.
O Kandinsky 6.0 Video não tem essa opção. O áudio faz parte da saída, e o pipeline de serving integrado ao vLLM-Omni emite AAC de 44,1 kHz por padrão. Portanto, os dois modelos não partem do mesmo padrão: um prioriza o áudio, o outro prioriza o silêncio, com o som como upgrade.
Essa assimetria tem um custo específico nas comparações. Qualquer confronto direto que coloque um Veo 3.1 sem áudio contra um concorrente cujo áudio vem sempre de série e depois pontue o par num ranking que leva o áudio em conta colocou o Veo em desvantagem por um acaso da configuração predefinida. Quando você lê os números da Sber acima — ou os de qualquer outra pessoa —, a primeira pergunta a fazer é se o lado do Veo estava com o áudio ativado. A segunda é qual era a diferença de preço, porque, no nível Standard, ativar o som duplica o preço.
Cinco segundos contra oito, e 1080p contra 4K nativo
A lacuna de formato é onde os briefings de design dos dois modelos são visíveis.
• Duração do clipe — Kandinsky 6.0 Video: 5s fixos, 121 quadros a 24 fps, sem extensão. Veo 3.1: 4, 6 ou 8s nativos, mais longos em 1080p, encadeamento de extensão de cena além disso.
• Resolução — Kandinsky 6.0 Video: SD, HD e Full HD (1920×1080) por meio de uma passagem de super-resolução. Veo 3.1: 720p, 1080p e 4K nativo.
• Proveniência — Kandinsky 6.0 Video: nenhuma declarada no lançamento. Veo 3.1: metadados SynthID e C2PA na saída.
• Entrada de referência — Kandinsky 6.0 Video: uma imagem, aplicada como um quadro final mascarado. Veo 3.1: até três imagens de referência, além de seed e prompt negativo.
• Formato — Kandinsky 6.0 Video: AAC de 44,1 kHz com a imagem, sempre ativado. Veo 3.1: estéreo de 48 kHz, opcional, com duas opções de preço.
A linha de proveniência é a que traz consequências para a contratação. Se o seu entregável precisa ser rastreável — trabalho de marca, transmissão, qualquer coisa que uma equipe jurídica vá analisar —, o Veo 3.1 anexa metadados que dizem que o material foi gerado, e o Kandinsky 6.0 Video não. Isso não é uma diferença de qualidade, e nenhum benchmark vai mostrar isso, mas é o tipo de requisito que, por si só, decide a escolha de um fornecedor, e um modelo aberto sem isso não é um substituto direto para uma equipe que precisa disso.
A linha 4K importa da mesma forma, e pelo mesmo motivo. O Full HD do Kandinsky 6.0 Video é real — há um modelo SR dedicado, e o pacote SR do repositório dá conta de upscales x2, x4 e x2.25 de clipes de cinco segundos —, mas ele atinge seu teto onde o caminho nativo do Veo 3.1 começa, no limite superior. Para trabalhos em telas grandes, esse teto não é negociável.
Quanto custa um clipe de cada lado
O Veo 3.1 é cobrado por segundo. No nível Standard, um clipe de cinco segundos em 1080p com áudio custa cerca de US$ 2,00, e o mesmo clipe sem áudio custa cerca de US$ 1,00; o Fast e o Lite ficam abaixo disso e, como as pontuações de arena deles ficam dentro do intervalo de confiança do Standard, é difícil argumentar contra os níveis mais baratos com base nas evidências.
O Kandinsky 6.0 Video não tem fatura. Tem tempo de GPU. Os números do repositório para o modelo não destilado, medidos após o aquecimento, com carregamento de pesos e codificação MP4 excluídos, estimam um clipe Pro Full HD de cinco segundos em cerca de 402 segundos numa H100, 854 segundos numa RTX 5090, 1.247 segundos numa RTX 4090 e 3.530 segundos numa RTX 5060 Ti. O Lite Full HD leva 284 segundos numa H100. A alocação de pico numa execução Pro SD chega a 72,8 GiB, então qualquer valor abaixo disso precisa de offloading de blocos — e o preset de 16 GB quantiza o codificador de texto para NF4, a única mudança de preset que o artigo confirma alterar o próprio clipe, em vez de introduzir ruído no nível de arredondamento.
Essas duas estruturas de custo não se comparam. Uma é uma fatura que você projeta por segundo finalizado; a outra é uma máquina que você compra, um render medido em minutos e a opção de ajuste fino — que o Veo 3.1 não oferece em nenhum nível.
A questão do tier é uma questão de roteamento
O OrcaRouter não disponibiliza nem o Google Veo 3.1 nem o Kandinsky 6.0 Video, e nenhum dos dois está implícito aqui — o Veo 3.1 é acessado pelas próprias interfaces do Google, e o Kandinsky é você mesmo que baixa. Mas vale a pena nomear a estrutura da decisão do Veo, porque é exatamente o problema que a nossa camada de roteamento existe para resolver no lado do texto: três níveis cujas pontuações independentes são indistinguíveis e cujos preços diferem em cinco vezes é precisamente o caso em que "encaminhar o mais barato e escalar apenas quando o critério não for atingido" supera "padronizar no carro-chefe". O roteamento adaptativo e a DSL de roteamento do OrcaRouter expressam isso como uma política configurada em mais de 200 modelos de texto num único endpoint compatível com OpenAI, ao preço de tabela do fornecedor com 0% de margem, com failover automático quando uma rota fica indisponível. O mesmo instinto aplicado aos gastos com vídeo — Fast por padrão, Standard para os planos que importam — é uma decisão de compra que você pode tomar hoje mesmo sem nenhum roteador.
Qual deles, para quem
Escolha o Veo 3.1 se o entregável exigir que o som seja levado a sério, se precisar de 4K ou de um clipe com mais de cinco segundos, ou se alguém a jusante exigir metadados de proveniência. Escolha o nível de forma deliberada em vez de usar o Standard por padrão, e reserve orçamento para a flag de áudio em vez de descobri-la na fatura.
Escolha o Kandinsky 6.0 Video se quiser os pesos, se cinco segundos se adequarem à sua unidade de trabalho, e se a fidelidade de imagem para vídeo em relação a uma imagem fixa fornecida for a tarefa — a única dimensão em que o próprio estudo do laboratório o coloca à frente de um nível do Veo por margens significativas. Entre sabendo que o áudio está sempre ativado, que a proveniência está ausente, e que a alegação de qualidade se baseia inteiramente num relatório que o seu autor escreveu.


A assimetria a preservar é que o Veo 3.1 está em produção há onze meses e, portanto, acumulou aquilo que um modelo aberto lançado este mês não pode: um conjunto mapeado de modos de falha que seus usuários já publicaram, e uma curva de preços que uma equipe financeira pode modelar. Em contrapartida, a licença MIT do Kandinsky significa que o modelo no seu disco não depende do roteiro de ninguém. Qual dessas coisas vale mais não é uma questão de benchmark.

