Cartela de título para Odyssey-3 vs Kandinsky 6.0 Video, com um painel esquerdo intitulado Odyssey-3 indicando um ambiente interativo, uma prévia de pesquisa aberta em 8 de outubro de 2026, 832x480 ou 1280x720 Pro, sem pesos e sem preço; e um painel direito intitulado Kandinsky 6.0 Video indicando pesos abertos em 6 de outubro de 2026 sob uma licença MIT, clipes de 5 s com áudio de 44 kHz, Full HD 1920x1080, Physics-IQ não submetido.
Guides & Insights

Odyssey-3 vs Kandinsky 6.0 Video: Pesos Abertos e Áudio Contra uma Prévia Interativa Fechada

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Kandinsky 6.0 Video chegou em 6 de outubro de 2026 com aquilo que lançamentos de modelos abertos raramente conseguem no primeiro dia: suporte em Diffusers, ComfyUI, vLLM-Omni, SGLang e FastVideo, tudo documentado no próprio registro de atualizações do repositório, ao lado de um relatório arXiv enviado em 4 de outubro e checkpoints licenciados sob MIT no Hugging Face. Odyssey-3 chegou dois dias depois, em 8 de outubro, como uma prévia pública de pesquisa de um transformer de difusão autorregressivo que constrói um ambiente a partir de um prompt e prevê mudanças em tempo real conforme você se move por ele. Um é um modelo de 29 bilhões de parâmetros que você pode baixar e executar na sua própria GPU hoje à noite. O outro é um sistema interativo que você só pode acessar por meio da prévia no navegador da Odyssey e de um formulário de contato. Eles são os dois polos do que "modelo de vídeo" significou na mesma semana de outubro de 2026, e a escolha entre eles é menos sobre benchmarks do que sobre quem detém os pesos.

Eles também esperam coisas diferentes de você. O Kandinsky 6.0 Video é um modelo de geração: entra um prompt, sai um clipe de cinco segundos com áudio sincronizado. O Odyssey-3 é um modelo de previsão: aja e veja o mundo responder. Nenhum substitui o outro, e o fato de terem sido lançados com 48 horas de diferença é o contexto mais útil que qualquer um dos dois tem.

As duas arquiteturas, nos termos dos próprios fornecedores

Kandinsky 6.0 Video é uma família de modelos de difusão de base para geração sincronizada de áudio e vídeo, composta pelo Kandinsky 6.0 Video Lite, com 3B parâmetros, e pelo Kandinsky 6.0 Video Pro, com 29B. Ambos geram clipes de cinco segundos com áudio sincronizado de 44 kHz, incluindo lip-sync, nos modos texto-para-áudio-vídeo e imagem-para-áudio-vídeo, e um modelo de super-resolução plug-in eleva a saída para Full HD 1920×1080. A técnica é um CrossDiT de fluxo duplo que conecta um fluxo de vídeo pré-treinado a um fluxo de áudio recém-treinado por meio de atenção cruzada bidirecional, de modo que as duas modalidades se alinham em tempo e semântica, em vez de serem geradas separadamente e multiplexadas. A receita de treinamento é contínua: o fluxo de áudio é treinado do zero em grandes corpora de áudio, depois ambos os fluxos são treinados em conjunto com dados pareados de áudio e vídeo, preservando a fidelidade unimodal, seguido de ajuste fino supervisionado, pós-treinamento por aprendizado por reforço e destilação.

Odyssey-3 é um transformer de difusão autorregressivo descrito pela Odyssey como um modelo de difusão de vídeo em múltiplas etapas, estendido por meio de teacher forcing e mascaramento causal, treinado para continuar a partir de observações precedentes e prever estados futuros condicionados a entradas de ação, e então destilado com correspondência de distribuição e destilação adversarial em uma variante de poucos passos, rápida o suficiente para interagir. Ele roda em 832×480, com o Odyssey-3 Pro em 1280×720, não produz áudio, e todo o seu propósito é que sua saída dependa do que você fez um momento antes.

O suporte desde o primeiro dia é a diferença que ninguém avalia.

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Leia novamente o log de atualização do Kandinsky 6.0, porque é o fato mais concreto nesta comparação. Em 6 de outubro, o projeto registrou disponibilidade no Diffusers, no registro de nós do ComfyUI, no vLLM-Omni, no SGLang e no FastVideo, e um Space no Hugging Face para o modelo Pro destilado. Isso são cinco pilhas de inferência independentes em um único dia. Para quem esperou meses por um checkpoint chegar a um framework de serving, esse é o número que decide se o modelo é utilizável.

Agora coloque isso ao lado da história de acesso do Odyssey-3. A prévia roda em experience.odyssey.systems com navegação em primeira pessoa, navegação em terceira pessoa e movimento de câmera independente. O acesso à API é um formulário de contato. Não há página de preços, documentação de limite de taxa nem chave de autoatendimento. Os termos de API do site foram atualizados pela última vez em 2026-01-22 e ainda regem “o protótipo da API Odyssey-2” — a interface comercial não foi reescrita para o modelo lançado neste mês.

• Onde roda — suas próprias GPUs, com pesos e código sob licença MIT, e apenas contra os servidores da Odyssey.

• Como você integra isso — pipeline do Diffusers, nós do ComfyUI, vLLM-Omni, SGLang, FastVideo, em comparação com uma pré-visualização no navegador e um formulário de contato.

• O que você pode inspecionar — arquitetura, receita de treinamento e tamanhos de checkpoint em um relatório público, contra uma descrição do fornecedor do pipeline de treinamento sem pesos e sem artigo.

• O que você pode modificar — fine-tunes, LoRAs, quantização e destilação, tudo o que a comunidade já estava publicando no Hugging Face no dia seguinte ao lançamento, contra absolutamente nada.

Dimensão por dimensão

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• Saída — clipes de cinco segundos com áudio sincronizado de 44 kHz para ambos os níveis do Kandinsky, em comparação com um ambiente interativo sem áudio para o Odyssey-3.

• Resolução — Full HD 1920×1080 por meio do modelo de super-resolução de plug-in para Kandinsky 6.0 Video, contra 832×480 para Odyssey-3 e 1280×720 para Odyssey-3 Pro.

• Modalidades de entrada — texto e imagem para Kandinsky, nos modos texto-para-áudio-vídeo e imagem-para-áudio-vídeo; um prompt mais entrada de controle ao vivo para Odyssey-3.

• Parâmetros — 3B e 29B publicados para os níveis Lite e Pro, em contraste com não divulgados para ambos os níveis do Odyssey-3.

• Hardware — uma GPU NVIDIA e Python 3.13 ou 3.14, com presets fornecidos para placas da classe H100/H200 até RTX 5090 para o Kandinsky; um navegador para o Odyssey-3.

• Preço — $0 por clipe para Kandinsky 6.0 Video se você tiver a GPU, contra nenhum preço publicado de qualquer tipo para o Odyssey-3. As estimativas de custo normalizadas do ranking para Odyssey-3 e Odyssey-3 Pro são $0,139 e $0,267 por vídeo gerado, excluindo o processamento do prompt.

• Pontuação por terceiros — a geração de nenhum dos próprios modelos participa de uma comparação direta independente. O relatório do Kandinsky baseia-se em avaliação humana lado a lado contra seu antecessor; os números do Odyssey-3 vêm de uma submissão a benchmark mais uma avaliação conduzida pelo fornecedor.

• Licença — MIT para o Kandinsky 6.0 Video, em contraste com nenhuma licença publicada, porque não há pesos para licenciar.

O que os benchmarks dizem e não dizem

O Kandinsky 6.0 Video não aparece no Physics-IQ Verified, o painel da Anates Labs e do DeepMind que avalia continuações de experimentos físicos reais em 41 modelos. Também não aparece aqui o parceiro de confronto direto do Odyssey-3, porque o painel avalia modelos que geram clipes, e ambos fazem isso. O que o painel de fato contém é a linha anterior de modelos de mundo do Kandinsky, Kandinsky-WM 1.0, na posição 20 e −8,02 pp em relação à média da trilha — uma família diferente, um propósito diferente, e a única entrada do Kandinsky no painel.

As linhas do Odyssey-3, para contraste: 8.º lugar com +2,15 pp nos próprios prompts do benchmark e US$ 0,129 por vídeo, e 3.º lugar com +9,99 pp em prompts personalizados, com o Odyssey-3 Pro em segundo lugar geral com +11,15 pp. Esses são números melhores do que qualquer coisa que a linha Kandinsky tem nesse teste específico, e também estão medindo uma capacidade diferente — o Odyssey-3 é avaliado pelo que prevê após uma perturbação, que é exatamente o que sua prévia vende.

A evidência da própria Kandinsky é a avaliação humana no relatório técnico: o Kandinsky 6.0 Video Pro supera claramente seu antecessor, o Kandinsky 5.0 Video Pro, e permanece competitivo com os principais modelos de geração de áudio e vídeo, particularmente na qualidade da fala. Trata-se de uma comparação lado a lado conduzida pelo fornecedor, e é o tipo de alegação que pode ser conferida por qualquer pessoa com uma 5090 e uma tarde usando um checkpoint divulgado. A alegação equivalente do Odyssey-3 não pode ser conferida por ninguém sem uma chave de API.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Alcançando-os

O OrcaRouter não aloja nenhum dos dois modelos e nunca dará a entender o contrário: o Odyssey-3 não tem nenhum preço publicado para que alguém o possa encaminhar, e o Kandinsky 6.0 Video tem pesos abertos, o que significa que a forma correta de o executar é a configuração própria do repositório na sua própria GPU, e não um endpoint alojado.

Onde uma única chave OrcaRouter se encaixa é na camada ao redor do experimento. O repositório do Kandinsky pressupõe que você forneça a GPU, o ambiente e a comparação; o que ele não fornece é uma forma de chamar os modelos com os quais você quer compará-lo. Mais de 200 modelos ficam atrás de uma única chave OrcaRouter ao preço de lista do provedor, com 0% de markup — incluindo minimax/minimax-h3, o modelo de vídeo de pesos abertos que a MiniMax lançou em 31 de julho de 2026, a US$ 0,08 por segundo de saída em 768P — então uma mudança de preço do fornecedor chega à sua fatura no mesmo dia, o failover automático impede que uma rodada de avaliação morra por causa de uma hora ruim de um único provedor upstream, e a DSL de roteamento permite colocar um modelo de vídeo hospedado e um modelo de visão atrás de uma única interface quando a tarefa é gerar e depois pontuar. Você ainda clona o repositório e executa a configuração por conta própria. Você só não precisa construir a outra metade da estrutura.

Qual deles você realmente quer

Se você precisa de resultados que possa ter como seus — termos comerciais que possa ler, pesos que possa ajustar, um pipeline que roda sem depender da API de outra pessoa estar no ar — Kandinsky 6.0 Video é a resposta, e o suporte ao framework desde o primeiro dia significa que você não está apostando em um artefato de pesquisa. Se você precisa de som no vídeo, ele é o único dos dois que gera algum.

Se o problema é previsão em vez de produção — uma política que tem de reagir, um ambiente de treino, qualquer coisa em que o próximo estado depende da última ação —, o Odyssey-3 é o único dos dois que faz isso, e também é o que você não pode comprar. Essa é a forma honesta deste confronto na semana em que ambos chegaram: um modelo aberto que você pode baixar e um modelo interativo que você só pode experimentar, com as evidências de benchmark favorecendo o fechado e as evidências práticas favorecendo o aberto.