Cartela de título para Odyssey-3 vs. ByteDance Seedance 2, com um painel à esquerda encabeçado por Odyssey-3, com a inscrição “um mundo que você conduz ao vivo”, 832x480 ou 1280x720 Pro, Physics-IQ +9,99 p.p., classificação 03; e um painel à direita encabeçado por ByteDance Seedance 2, com a inscrição GA desde 12 de fevereiro de 2026, plataforma com medição de uso, um clipe finalizado de até 15 s, resolução não publicada, Physics-IQ não submetido.
Guides & Insights

Odyssey-3 vs ByteDance Seedance 2: Um Ambiente no Qual Você Age contra um Clipe que Você Assiste

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Odyssey-3 e B​yteDance Seedance 2 lado a lado e a primeira coisa que se percebe é que eles não estão competindo pela mesma solicitação. Odyssey-3, lançado pela Odyssey em 8 de outubro de 2026, gera um ambiente a partir de um prompt e então continua prevendo-o em tempo real enquanto você se move por ele ou aciona um evento — é um simulador com uma câmera que você dirige. B​yteDance Seedance 2 é um gerador de clipes com uma cadeira de diretor: entram referências de texto, imagem, áudio e vídeo, sai um vídeo finalizado, de até quinze segundos, gerado em uma única passagem e entregue como um objeto fixo. Um deles tem uma entrada de controle; o outro tem uma linha do tempo. A comparação vale a pena mesmo assim, porque os dois estão convergindo para o mesmo comprador e porque fazem apostas opostas sobre onde reside o valor de um modelo generativo de vídeo.

Há um único placar compartilhado, e ele é mais frágil do que parece. O próprio Seedance 2 não aparece no Physics-IQ Verified, o quadro da Anates Labs e da DeepMind que avalia quão bem um modelo prevê experimentos físicos reais. Já o Seedance 2.5, o sucessor de 31 de julho de 2026, aparece. Portanto, o único número de terceiros que coloca algo desta família ao lado do Odyssey-3 é uma comparação entre duas gerações de modelos de um dos lados, o que vale a pena declarar antes que alguém o cite como uma disputa justa.

Os dois mecanismos

Odyssey-3 é um transformer de difusão autorregressivo. A descrição do próprio Odyssey: um modelo de difusão de vídeo em várias etapas, estendido de forma autorregressiva com teacher forcing e mascaramento causal, de modo que continua a partir de observações anteriores e prevê estados futuros condicionados a entradas de ação; em seguida, uma etapa de pós-treinamento de correspondência de distribuição e destilação adversarial produz uma variante de poucos passos, rápida o suficiente para permitir interação. A saída não é uma cena que se desenrola; é uma cena que responde. A pré-visualização expõe navegação em primeira pessoa, navegação em terceira pessoa e movimento de câmera independente — três formas diferentes de pressionar a mesma previsão e observar o que ela faz.

B​yteDance Seedance 2 é um modelo unificado de geração conjunta de áudio e vídeo multimodal. Ele aceita texto, imagem, áudio e vídeo como referências e gera o clipe em uma única passagem, de até quinze segundos, com áudio gerado conjuntamente em vez de dublado depois. A página da B​yteDance descreve referências de imagem, áudio e vídeo como controle sobre atuação, iluminação, sombra e movimento de câmera, o que é a linguagem da produção, e não da simulação: você está especificando um plano, não conduzindo um mundo. Lançado em 12 de fevereiro de 2026, tornou-se viral em poucos dias com clipes de atores reais e filmes existentes — e foi isso também que provocou a tempestade de direitos autorais, com notificações de cessação e desistência da Disney e da Netflix, condenação da Motion Picture Association e do SAG-AFTRA, e uma carta de março de 2026 de dois senadores dos EUA pedindo que a B​yteDance o encerrasse. A B​yteDance disse em fevereiro de 2026 que estava fortalecendo as salvaguardas. Esse histórico faz parte da especificação do modelo se você estiver lançando algo comercial.

Dimensão por dimensão

ByteDance's BytePlus ModelArk developer documentation in English, showing the Ark SDK quick-start with a Python client using model seed-2-0-lite-260228 against base_url https://ark.ap-southeast.bytepluses.com/api/v3, a sidebar covering Models, video generation, image generation and the Model list, and three endpoint cards for Dola Seed 2.0, Dreamina Seedance 2.5 (described as the mainline video generation model with 30s extended storytelling, multimodal references and improved generation quality) and Dola Seedream 5.0.

• O que ela gera — um ambiente interativo no qual você age, sobre um clipe fixo de até quinze segundos. Tudo o que está a jusante desta linha muda.

• Superfície de controle — navegação ao vivo e eventos durante a geração, em contraste com prompt e referências de imagem, áudio e vídeo especificadas desde o início. Um deles é guiado durante a geração; o outro é direcionado antes dela.

• Áudio — o Seedance 2 o gera em conjunto com o vídeo, no mesmo modelo. O material de lançamento do Odyssey-3 não diz absolutamente nada sobre áudio.

• Resolução — O Odyssey-3 roda a 832×480, com o Odyssey-3 Pro a 1280×720. A página da B​yteDance para o Seedance 2 não publica uma resolução de saída, e o valor de 1080p que circula pertence à linha anterior do Seedance 1.0.

• Custo — o Odyssey-3 está listado a $0,139 por vídeo gerado na coluna de custo normalizado do Physics-IQ, e o Odyssey-3 Pro a $0,267, ambos excluindo o tratamento do prompt. O Seedance 2 não publica nenhum preço de tabela por segundo ou por clipe que pudéssemos verificar; o seu sucessor, Seedance 2.5, está listado no mesmo quadro a $2,838 por vídeo.

• Pontuação independente — nenhum dos modelos teve sua própria geração submetida a uma comparação direta por terceiros. Os resultados publicados do Seedance 2.0 são do SeedVideoBench-2.0 interno da ByteDance; os do Odyssey-3 são uma submissão a benchmark mais uma avaliação conduzida pelo fornecedor em um conjunto de dados de terceiros.

• Pesos — fechados dos dois lados. A Odyssey não lançou nenhum checkpoint, e a Seedance nunca foi aberta.

• Postura comercial — Odyssey-3 é uma prévia de pesquisa com um formulário de contato para acesso à API e sem lista de preços. Seedance 2 é vendido pelas próprias plataformas da ByteDance e, fora da China, pelo CapCut como Dreamina Seedance 2.0.

O único número que realmente os compara

O Physics-IQ Verified pontua os modelos pela melhoria líquida em plausibilidade física em relação à média do track, em pontos percentuais, e registra qual conjunto de prompts foi usado. Nos próprios prompts do benchmark, o Seedance 2.5 está em sétimo lugar, com +3,59 pp, e um custo normalizado de US$ 2,838 por vídeo. O Odyssey-3, no mesmo conjunto de prompts, está em oitavo lugar, com +2,15 pp, a US$ 0,129 por vídeo. Leia com atenção: isso é uma diferença de 1,44 ponto a favor do Seedance e uma diferença de custo de aproximadamente vinte e duas vezes em desfavor dele.

As linhas em destaque do Odyssey-3 usam uma coluna diferente. Quando enviado com prompts personalizados, o Odyssey-3 marca +9,99 p.p. e o Odyssey-3 Pro, +11,15 p.p. — terceiro e segundo lugares no ranking, atrás do FLUX 3 [large], com +12,27 p.p. A mesma família de modelos aparece duas vezes no mesmo ranking, sob dois regimes de prompt diferentes, com pontuações muito diferentes, o que é a coisa mais útil para se entender sobre como ler este ranking: o número é em parte uma característica do modelo e em parte uma característica de quem escreveu o prompt.

A Odyssey também reporta 66,1 na categoria de vídeo para vídeo para o Odyssey-3 Pro, a maior pontuação que reivindica, e 54,7 para o Odyssey-3 Pro em imagem para vídeo. Ambos são a leitura do próprio fornecedor de um ranking ao qual se submeteu, não uma execução independente.

Two-column scoreboard headed “Odyssey-3 vs ByteDance Seedance 2 — the scoreboard” with six shared dimension labels. Odyssey-3: an environment you act inside; live navigation and mid-run events; no audio; 832x480, 1280x720 Pro; /bin/bash.139 a video, Pro /bin/bash.267; no independent scoring yet. ByteDance Seedance 2: a fixed clip up to 15 seconds; text, image, audio and video references upfront; audio generated jointly with the video; resolution not published; no per-second list price published; not on Physics-IQ. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Seedance 2 has no third-party score; Seedance 2.5, a later model, is on Physics-IQ at +3.59 pp”.

Onde cada um realmente se destaca

Se o seu problema é "preciso de um plano", o design do Seedance 2 responde exatamente a isso: referências multimodais significam que você pode entregar a aparência do ator, a base de áudio e o movimento de câmera, e obter um clipe finalizado com som. Nada na prévia do Odyssey-3 faz isso, e nada em seu material de lançamento sugere que fará. O teto de quinze segundos é uma restrição real, mas um rollout de modelo de mundo de cinco segundos sem áudio também é.

Se o seu problema é "preciso de saber o que acontece a seguir", a troca funciona ao contrário. Não se pode pedir um contrafactual ao Seedance 2 — você recebe um clipe, e para ver outro desfecho é preciso fazer o prompt de novo e obter um clipe sem qualquer relação. Toda a premissa do Odyssey-3 é que o estado seguinte depende da ação que você acabou de tomar, e é isso que o torna utilizável para uma política de condução, um braço robótico ou um ambiente de treino em que a sequência importa mais do que o plano.

As evidências de precisão física favorecem o Odyssey-3 no mecanismo, mesmo onde a coluna de pontuação não o faz: o modelo está sendo avaliado em continuações após uma perturbação, que é a mesma capacidade que a prévia interativa está vendendo. O +3,59 pp do Seedance 2.5 no mesmo ranking é um resultado forte para um gerador de clipes e, notavelmente, melhor que o do Odyssey-3 no conjunto de prompts correspondente — por isso, o resumo honesto é que o modelo de vídeo da ByteDance é mais fisicamente plausível do que um modelo de vídeo teria qualquer direito de ser, e não que o Odyssey-3 tenha sido superado no seu próprio jogo.

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

Chegando a qualquer um dos dois

Nenhum dos dois modelos pode ser chamado daqui hoje. O OrcaRouter não hospeda o Odyssey-3 nem o B​yteDance Seedance 2 — o Odyssey-3 não tem preço publicado para que alguém possa roteá-lo, e o Seedance é vendido através das próprias plataformas da B​yteDance.

O que uma única chave OrcaRouter alcança é o resto da pilha de vídeo: MiniMax-H3 a US$ 0,08 por segundo de saída em 768P, a linha de vídeo K​ling a US$ 0,084 a US$ 0,28 por requisição, e mais de 200 modelos no total, todos pelo preço de tabela do fornecedor com 0% de markup, de modo que uma mudança de preço de um fornecedor fica visível na sua fatura no mesmo dia, e não apenas na renovação. O failover automático mantém uma varredura de avaliação ativa quando um upstream se degrada, e a DSL de roteamento coloca vários modelos de vídeo por trás de uma única interface, de modo que testar um novo gerador é uma mudança de configuração em vez de uma integração. Quando um desses dois abrir um endpoint self-serve, é nesse formato que você deve encaixá-lo.

O que assistir

Duas coisas mudariam esta comparação mais do que qualquer atualização de benchmark. A primeira é o áudio: se a próxima geração do Odyssey-3 gerar som conjuntamente da forma como o Seedance faz, o "ambiente em que você age" deixa de ser uma categoria mais restrita. A segunda é um harness independente — um terceiro executando Seedance 2.0 e Odyssey-3 lado a lado nos mesmos clipes, em vez de um aparecer num placar ao qual o outro nunca foi submetido. Até então, a leitura correta do Odyssey-3 em relação ao ByteDance Seedance 2 é que eles não são dois candidatos para o mesmo trabalho. Eles são duas respostas para perguntas diferentes, e a pergunta que você está fazendo escolhe o modelo para você.