
Odyssey-3 vs Kandinsky 6.0 Video: Pesos Abertos e Áudio Contra uma Prévia Interativa Fechada
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Kandinsky 6.0 Video chegou em 6 de outubro de 2026 com aquilo que lançamentos de modelos abertos raramente conseguem no primeiro dia: suporte em Diffusers, ComfyUI, vLLM-Omni, SGLang e FastVideo, tudo documentado no próprio registro de atualizações do repositório, ao lado de um relatório arXiv enviado em 4 de outubro e checkpoints licenciados sob MIT no Hugging Face. Odyssey-3 chegou dois dias depois, em 8 de outubro, como uma prévia pública de pesquisa de um transformer de difusão autorregressivo que constrói um ambiente a partir de um prompt e prevê mudanças em tempo real conforme você se move por ele. Um é um modelo de 29 bilhões de parâmetros que você pode baixar e executar na sua própria GPU hoje à noite. O outro é um sistema interativo que você só pode acessar por meio da prévia no navegador da Odyssey e de um formulário de contato. Eles são os dois polos do que "modelo de vídeo" significou na mesma semana de outubro de 2026, e a escolha entre eles é menos sobre benchmarks do que sobre quem detém os pesos.
Eles também esperam coisas diferentes de você. O Kandinsky 6.0 Video é um modelo de geração: entra um prompt, sai um clipe de cinco segundos com áudio sincronizado. O Odyssey-3 é um modelo de previsão: aja e veja o mundo responder. Nenhum substitui o outro, e o fato de terem sido lançados com 48 horas de diferença é o contexto mais útil que qualquer um dos dois tem.
As duas arquiteturas, nos termos dos próprios fornecedores
Kandinsky 6.0 Video é uma família de modelos de difusão de base para geração sincronizada de áudio e vídeo, composta pelo Kandinsky 6.0 Video Lite, com 3B parâmetros, e pelo Kandinsky 6.0 Video Pro, com 29B. Ambos geram clipes de cinco segundos com áudio sincronizado de 44 kHz, incluindo lip-sync, nos modos texto-para-áudio-vídeo e imagem-para-áudio-vídeo, e um modelo de super-resolução plug-in eleva a saída para Full HD 1920×1080. A técnica é um CrossDiT de fluxo duplo que conecta um fluxo de vídeo pré-treinado a um fluxo de áudio recém-treinado por meio de atenção cruzada bidirecional, de modo que as duas modalidades se alinham em tempo e semântica, em vez de serem geradas separadamente e multiplexadas. A receita de treinamento é contínua: o fluxo de áudio é treinado do zero em grandes corpora de áudio, depois ambos os fluxos são treinados em conjunto com dados pareados de áudio e vídeo, preservando a fidelidade unimodal, seguido de ajuste fino supervisionado, pós-treinamento por aprendizado por reforço e destilação.
Odyssey-3 é um transformer de difusão autorregressivo descrito pela Odyssey como um modelo de difusão de vídeo em múltiplas etapas, estendido por meio de teacher forcing e mascaramento causal, treinado para continuar a partir de observações precedentes e prever estados futuros condicionados a entradas de ação, e então destilado com correspondência de distribuição e destilação adversarial em uma variante de poucos passos, rápida o suficiente para interagir. Ele roda em 832×480, com o Odyssey-3 Pro em 1280×720, não produz áudio, e todo o seu propósito é que sua saída dependa do que você fez um momento antes.
O suporte desde o primeiro dia é a diferença que ninguém avalia.

Leia novamente o log de atualização do Kandinsky 6.0, porque é o fato mais concreto nesta comparação. Em 6 de outubro, o projeto registrou disponibilidade no Diffusers, no registro de nós do ComfyUI, no vLLM-Omni, no SGLang e no FastVideo, e um Space no Hugging Face para o modelo Pro destilado. Isso são cinco pilhas de inferência independentes em um único dia. Para quem esperou meses por um checkpoint chegar a um framework de serving, esse é o número que decide se o modelo é utilizável.
Agora coloque isso ao lado da história de acesso do Odyssey-3. A prévia roda em experience.odyssey.systems com navegação em primeira pessoa, navegação em terceira pessoa e movimento de câmera independente. O acesso à API é um formulário de contato. Não há página de preços, documentação de limite de taxa nem chave de autoatendimento. Os termos de API do site foram atualizados pela última vez em 2026-01-22 e ainda regem “o protótipo da API Odyssey-2” — a interface comercial não foi reescrita para o modelo lançado neste mês.
• Onde roda — suas próprias GPUs, com pesos e código sob licença MIT, e apenas contra os servidores da Odyssey.
• Como você integra isso — pipeline do Diffusers, nós do ComfyUI, vLLM-Omni, SGLang, FastVideo, em comparação com uma pré-visualização no navegador e um formulário de contato.
• O que você pode inspecionar — arquitetura, receita de treinamento e tamanhos de checkpoint em um relatório público, contra uma descrição do fornecedor do pipeline de treinamento sem pesos e sem artigo.
• O que você pode modificar — fine-tunes, LoRAs, quantização e destilação, tudo o que a comunidade já estava publicando no Hugging Face no dia seguinte ao lançamento, contra absolutamente nada.
Dimensão por dimensão

• Saída — clipes de cinco segundos com áudio sincronizado de 44 kHz para ambos os níveis do Kandinsky, em comparação com um ambiente interativo sem áudio para o Odyssey-3.
• Resolução — Full HD 1920×1080 por meio do modelo de super-resolução de plug-in para Kandinsky 6.0 Video, contra 832×480 para Odyssey-3 e 1280×720 para Odyssey-3 Pro.
• Modalidades de entrada — texto e imagem para Kandinsky, nos modos texto-para-áudio-vídeo e imagem-para-áudio-vídeo; um prompt mais entrada de controle ao vivo para Odyssey-3.
• Parâmetros — 3B e 29B publicados para os níveis Lite e Pro, em contraste com não divulgados para ambos os níveis do Odyssey-3.
• Hardware — uma GPU NVIDIA e Python 3.13 ou 3.14, com presets fornecidos para placas da classe H100/H200 até RTX 5090 para o Kandinsky; um navegador para o Odyssey-3.
• Preço — $0 por clipe para Kandinsky 6.0 Video se você tiver a GPU, contra nenhum preço publicado de qualquer tipo para o Odyssey-3. As estimativas de custo normalizadas do ranking para Odyssey-3 e Odyssey-3 Pro são $0,139 e $0,267 por vídeo gerado, excluindo o processamento do prompt.
• Pontuação por terceiros — a geração de nenhum dos próprios modelos participa de uma comparação direta independente. O relatório do Kandinsky baseia-se em avaliação humana lado a lado contra seu antecessor; os números do Odyssey-3 vêm de uma submissão a benchmark mais uma avaliação conduzida pelo fornecedor.
• Licença — MIT para o Kandinsky 6.0 Video, em contraste com nenhuma licença publicada, porque não há pesos para licenciar.
O que os benchmarks dizem e não dizem
O Kandinsky 6.0 Video não aparece no Physics-IQ Verified, o painel da Anates Labs e do DeepMind que avalia continuações de experimentos físicos reais em 41 modelos. Também não aparece aqui o parceiro de confronto direto do Odyssey-3, porque o painel avalia modelos que geram clipes, e ambos fazem isso. O que o painel de fato contém é a linha anterior de modelos de mundo do Kandinsky, Kandinsky-WM 1.0, na posição 20 e −8,02 pp em relação à média da trilha — uma família diferente, um propósito diferente, e a única entrada do Kandinsky no painel.
As linhas do Odyssey-3, para contraste: 8.º lugar com +2,15 pp nos próprios prompts do benchmark e US$ 0,129 por vídeo, e 3.º lugar com +9,99 pp em prompts personalizados, com o Odyssey-3 Pro em segundo lugar geral com +11,15 pp. Esses são números melhores do que qualquer coisa que a linha Kandinsky tem nesse teste específico, e também estão medindo uma capacidade diferente — o Odyssey-3 é avaliado pelo que prevê após uma perturbação, que é exatamente o que sua prévia vende.
A evidência da própria Kandinsky é a avaliação humana no relatório técnico: o Kandinsky 6.0 Video Pro supera claramente seu antecessor, o Kandinsky 5.0 Video Pro, e permanece competitivo com os principais modelos de geração de áudio e vídeo, particularmente na qualidade da fala. Trata-se de uma comparação lado a lado conduzida pelo fornecedor, e é o tipo de alegação que pode ser conferida por qualquer pessoa com uma 5090 e uma tarde usando um checkpoint divulgado. A alegação equivalente do Odyssey-3 não pode ser conferida por ninguém sem uma chave de API.

Alcançando-os
O OrcaRouter não aloja nenhum dos dois modelos e nunca dará a entender o contrário: o Odyssey-3 não tem nenhum preço publicado para que alguém o possa encaminhar, e o Kandinsky 6.0 Video tem pesos abertos, o que significa que a forma correta de o executar é a configuração própria do repositório na sua própria GPU, e não um endpoint alojado.
Onde uma única chave OrcaRouter se encaixa é na camada ao redor do experimento. O repositório do Kandinsky pressupõe que você forneça a GPU, o ambiente e a comparação; o que ele não fornece é uma forma de chamar os modelos com os quais você quer compará-lo. Mais de 200 modelos ficam atrás de uma única chave OrcaRouter ao preço de lista do provedor, com 0% de markup — incluindo minimax/minimax-h3, o modelo de vídeo de pesos abertos que a MiniMax lançou em 31 de julho de 2026, a US$ 0,08 por segundo de saída em 768P — então uma mudança de preço do fornecedor chega à sua fatura no mesmo dia, o failover automático impede que uma rodada de avaliação morra por causa de uma hora ruim de um único provedor upstream, e a DSL de roteamento permite colocar um modelo de vídeo hospedado e um modelo de visão atrás de uma única interface quando a tarefa é gerar e depois pontuar. Você ainda clona o repositório e executa a configuração por conta própria. Você só não precisa construir a outra metade da estrutura.
Qual deles você realmente quer
Se você precisa de resultados que possa ter como seus — termos comerciais que possa ler, pesos que possa ajustar, um pipeline que roda sem depender da API de outra pessoa estar no ar — Kandinsky 6.0 Video é a resposta, e o suporte ao framework desde o primeiro dia significa que você não está apostando em um artefato de pesquisa. Se você precisa de som no vídeo, ele é o único dos dois que gera algum.
Se o problema é previsão em vez de produção — uma política que tem de reagir, um ambiente de treino, qualquer coisa em que o próximo estado depende da última ação —, o Odyssey-3 é o único dos dois que faz isso, e também é o que você não pode comprar. Essa é a forma honesta deste confronto na semana em que ambos chegaram: um modelo aberto que você pode baixar e um modelo interativo que você só pode experimentar, com as evidências de benchmark favorecendo o fechado e as evidências práticas favorecendo o aberto.
