
Kandinsky 6.0 Video chega ao vLLM-Omni: o que uma camada de serviço acrescenta a um modelo aberto
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O pull request #8537 foi mesclado no vLLM-Omni às 07:55 UTC desta manhã, e ele faz exatamente uma coisa: torna o Kandinsky 6.0 Video servível. O próprio modelo chegou do Kandinsky Lab da Sber no mesmo dia como um par — Kandinsky 6.0 Video Pro com 29B de parâmetros e Kandinsky 6.0 Video Lite com 3B de parâmetros — gerando clipes de cinco segundos com áudio sincronizado de 44 kHz, com sincronização labial incluída, a partir de um prompt de texto ou de uma imagem de referência, com código, pesos e integração com o diffusers, tudo sob a licença MIT. O que ele não tinha até esta manhã era uma forma de executá-lo dentro de um servidor de inferência em vez de uma linha de comando de execução única.
Essa distinção vale mais do que parece, e é a razão pela qual esta é uma história separada do lançamento. Um checkpoint aberto que você pode executar na sua própria placa é um artefato de pesquisa; um checkpoint aberto com um pipeline do lado do servidor, pontos de entrada compartilhados e uma receita de serving é algo que você pode colocar atrás de uma fila. O lançamento desta semana lhe deu o primeiro. O merge de hoje é o começo do segundo.
O que realmente foi mesclado
O PR adiciona texto para vídeo e áudio e imagem para vídeo e áudio ao vLLM-Omni a partir do checkpoint kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. As escolhas de engenharia são a parte interessante, porque mostram como a arquitetura realmente se parece quando alguém além dos autores precisa servi-la.
• Um único DiT remove o ruído de ambas as modalidades. O pipeline é registrado como Kandinsky6TI2VAPipeline, e os latentes de vídeo e de áudio são desruidificados conjuntamente por um único transformer, em vez de por dois modelos executados em sequência. Isso espelha o CrossDiT de fluxo duplo do artigo, em que um fluxo de vídeo pré-treinado e um fluxo de áudio criado do zero são conectados por atenção cruzada bidirecional.
• Os pesos carregam pasta a pasta. O checkpoint do Hub é lido como transformer/, vae/, text_encoder/, text_encoder_2/ e audio_vae/. Os nomes internos do checkpoint publicado — videoT e audioT — são mapeados para video_dec_block e audio_dec_block no momento do carregamento, que é o tipo de detalhe que consome um dia inteiro se você descobrir sozinho.
• O áudio está ativado por padrão. O pipeline emite AAC de 44,1 kHz em vez de tratar o som como um sinalizador opcional, então uma solicitação sem parâmetros de áudio ainda retorna com fala, música ou ambiência sincronizadas.
• Uma entrada de imagem é um quadro final mascarado, não um modo separado. O condicionamento por imagem de referência é aplicado por mascaramento, que é como o mesmo pipeline atende tanto T2AV quanto I2AV sem ramificação.
O smoke test do autor da submissão é um piso útil: uma única NVIDIA H100 80GB com FlashAttention-3, offload de CPU ativado, 864×480, 125 quadros, 50 etapas, CFG 5.0, seed 42. Trata-se de um clipe de 5 segundos em resolução pouco abaixo de HD, não uma renderização em Full HD, e o PR não afirma o contrário.
Um checkpoint não é um serviço
A razão para se importar com um merge como este é o que ele remove da sua lista. Executar a implementação de referência significa clonar o repositório, executar o just setup, deixar que ele compile o SageAttention em qualquer coisa abaixo de Hopper, baixar o checkpoint em um diretório de cache e invocar um comando de geração cuja saída cai em uma pasta com timestamp. Isso é aceitável para uma primeira olhada e pouco prático para um produto.
O vLLM-Omni oferece o modelo dentro de um processo de serving, com os mesmos pontos de entrada de inferência offline que o projeto usa para seus outros modelos de difusão (examples/offline_inference/text_to_video/text_to_video.py e seu equivalente de imagem para vídeo) e uma receita de serving em recipes/Kandinsky/Kandinsky6-TI2VA.md. Seguem-se duas consequências práticas. Seu cenário de implantação se torna um contêiner que fala uma interface HTTP, em vez de um script que você administra, e o modelo deixa de ser um caso especial na sua stack — ele fica ao lado de tudo o mais que você executa nesse servidor.
Observe o que isto não é. Não é um endpoint hospedado, não é um preço e não é uma medição independente de qualidade. É mais um lugar onde o modelo pode rodar, contribuído por alguém de fora do laboratório, três dias depois que os pesos apareceram.
Quanto custa, em tempo real, um clipe de cinco segundos em placas de verdade
A própria tabela do repositório é o ponto de partida honesto. Estes são os tempos de execução do modelo base não destilado para um único clipe de 5 segundos após o aquecimento, excluindo o carregamento de pesos e a codificação MP4. Full HD aqui significa que a etapa de super-resolução também está sendo executada.
• Full HD (Pro) — 402 s em um H100, 765 s em uma RTX PRO 6000, 854 s em uma RTX 5090, 1.106 s em uma A100 80GB, 1.247 s em uma RTX 4090, e 3.530 s em uma RTX 5060 Ti.
• Full HD (Lite) — 284 s em um H100, 387 s em uma RTX PRO 6000, 406 s em uma RTX 5090, 664 s em uma A100 80GB, 578 s em uma RTX 4090 e 1.774 s em uma RTX 5060 Ti.
• SD (Pro) — 356 s num H100 contra 936 s numa RTX 4090, que é onde a penalização das placas de consumidor é menor e a economia é menos ruim.
A forma dessa tabela importa mais do que qualquer célula individual. Uma H100 é aproximadamente três vezes mais rápida que uma 4090 em Pro Full HD, e aproximadamente seis vezes mais rápida que uma 5060 Ti no mesmo trabalho — mas a etapa SR tem o mesmo custo em ambos os tamanhos de modelo, cerca de 64 segundos em HD e cerca de 96 segundos em Full HD em uma 5090. O Lite não oferece uma passagem de super-resolução mais curta, porque o modelo SR é treinado separadamente e não se importa com qual modelo base o alimentou.
O caminho de 16 GB e a única configuração que muda a sua imagem
O pico de memória alocada em uma execução do Pro SD atinge 72,8 GiB, o que ultrapassa todas as placas gráficas de consumidor. O repositório responde com offloading de blocos — apenas dois blocos transformer residentes na GPU por vez, com o restante sendo transmitido da memória do host — além de três presets para placas de 32 GB, 24 GB e 16 GB. Os presets de 32 GB e 24 GB são idênticos, porque acima de 24 GB a folga extra não se traduz em velocidade.
A ressalva está enterrada e vale repetir: na predefinição de 16 GB, o codificador de texto é quantizado para NF4, e o artigo é explícito ao afirmar que essa é a única alteração de predefinição que modifica o próprio clip. Uma representação textual diferente produz um vídeo diferente. Todo o resto — comprimento de segmento, faixas espaciais, offloading — altera a saída no nível de ruído de arredondamento, com cerca de 12% dos pixels diferindo em um nível de brilho a aproximadamente 57 dB de PSNR. Se você estiver reproduzindo o resultado de outra pessoa em uma placa de 16 GB e ele não corresponder, essa é a primeira coisa a verificar.
Três coisas que as notas de lançamento não resolvem
• Cinco segundos é o teto, não um valor padrão. O modelo foi treinado com 121 quadros e 24 fps, e tanto o artigo quanto a receita de serving foram concebidos em torno disso. Não há modo de extensão na versão. Qualquer coisa mais longa é um problema de emenda que é sua responsabilidade.
• O checkpoint destilado é o que você efetivamente servirá, e foi medido em paridade. A ablação do artigo coloca o modelo destilado como preferido ou empatado na maioria dos critérios, sem que nenhuma diferença individual atinja significância, com uma preferência média de 51% a 49%. Esse é o trade-off que você assume em troca da velocidade.
• Há dois números de taxa de erro de palavra (WER) no artigo e eles não são comparáveis. A redução de 47% no WER de fala gerada que acompanha a etapa de aprendizado por reforço é avaliada com o Whisper-large-v3, um dos modelos de recompensa de RL; o WER relatado junto ao VABench usa o Qwen3-ASR-1.7B no subconjunto de fala. Os próprios autores dizem isso. Citar um como se fosse o outro é o erro mais fácil de cometer neste lançamento.
Onde um roteador fica em uma pilha como esta
O OrcaRouter não serve o Kandinsky 6.0 Video, e nada aqui deve ser lido como uma afirmação de que o faz — o modelo é seu para executar a partir do Hub, ou acessível através das próprias interfaces do laboratório. O que um pipeline como este precisa de um router é do texto à sua volta. A etapa de expansão de prompt que transforma a descrição de um plano na legenda longa, média ou curta com que o modelo foi treinado, o trabalho de legendagem e transcrição que alimenta uma etapa de imagem para vídeo, os resumos de revisão que decidem qual das quatro gerações manter: essas são chamadas de texto comuns, e são executadas num único endpoint compatível com a OpenAI em mais de 200 modelos com preços de tabela dos fornecedores repassados com 0% de margem, pelo que uma alteração de preço de um fornecedor fica ativa no próprio dia. O failover automático importa mais do que o habitual aqui, porque um render de cinco minutos que morre na fase de legendagem deve ser reencaminhado em vez de reiniciar a tarefa.
A próxima coisa a observar não é outro merge, mas um número. O Kandinsky 6.0 Video Pro tem resultados relatados pelo fornecedor no VABench e uma avaliação humana conduzida em laboratório contra Kling 2.6, Veo 3.1 Fast, MiniMax H3 e Seedance 2.0 — e ainda não tem uma pontuação independente na arena. Quando ela aparecer, a alegação de pesos abertos deixa de ser um argumento sobre acesso e passa a ser um argumento sobre qualidade, que é a comparação que decide se este é um modelo que as equipes baixam ou um modelo que elas admiram.


O repositório também disponibiliza dois nós do ComfyUI — kandinsky6 e kandinsky6-sr — instaláveis pelo ComfyUI Manager, e dois Spaces do Hugging Face: um para o checkpoint destilado Pro e um para a demonstração de super-resolução de vídeo. Entre a CLI, os nós do ComfyUI, o pacote diffusers e agora um pipeline vLLM-Omni, a superfície de implantação é mais ampla no terceiro dia do que a maioria dos modelos de vídeo abertos consegue em um trimestre. Essa amplitude é a verdadeira história da semana: a Sber lançou uma família, não um artigo com uma demonstração anexada.

