Cartela de título para um artigo que compara o Odyssey-3 e o Seedance 2.5, com o subtítulo “Segundos de filmagem vs horas de simulação”, com três chips de estatísticas que dizem “geração de 30s em passagem única”, “~$1,16 por clipe de 5s em 720p” e “Odyssey-3: sem unidade de venda”.
Guides & Insights

Odyssey-3 vs Seedance 2.5: Segundos de Filmagem vs Horas de Simulação

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pergunte quanto custa o Seedance 2.5 e obtém uma resposta em dólares por segundo. Pergunte quanto custa o Odyssey-3 e não obtém absolutamente nada — nem tabela de preços, nem endpoint, nem licença, porque o modelo anunciado a 15 de setembro de 2026 ainda não foi lançado e o seu criador apenas o prometeu publicamente "nas próximas semanas". Essa lacuna parece uma diferença de maturidade e é, sobretudo, uma diferença de categoria. O Seedance 2.5, lançado pela equipa Seed da ByteDance a 31 de julho de 2026, é um motor de produção vendido ao segundo de filmagens finais a quem precisa de filmagens. O Odyssey-3 é um modelo de mundo com uma interface de ação, e o comprador a quem se destina não quer filmagens nenhumas — quer um ambiente que responda corretamente quando algo age dentro dele. Ambos estão a ser apontados a alguns dos mesmos problemas, incluindo dados de robôs e de condução, e é precisamente por isso que vale a pena traçar cuidadosamente a distinção.

O Seedance 2.5 é um motor de produção, e os parceiros de lançamento comprovam isso

A principal capacidade é a duração. O Seedance 2.5 gera trinta segundos em uma única passagem, o dobro dos quinze do seu antecessor, com extensão em múltiplas rodadas para sequências mais longas e um modo beta ultralongo, segundo relatos, que chega ainda mais longe. Só isso já muda para que serve o modelo: trinta segundos são uma cena, e não um plano, e o marketing da ByteDance se apoia na expressão "one-take" exatamente por esse motivo.

Ao redor da duração estão os recursos que tornam uma geração utilizável em uma edição real. O modelo aceita referenciamento multimodal pesado — relatos indicam até trinta imagens, dez clipes de vídeo e dez clipes de áudio por geração, com vídeo e áudio de referência limitados a cerca de trinta segundos cada, e referências somente de áudio são novidades nesta versão. Há novos modos de referência para renders de modelo branco ou de argila, placas de tela verde, referenciamento de movimento e criativo. O controle é em nível de timestamp, permitindo que um prompt direcione narrativa, câmera ou movimento dentro de um intervalo de tempo específico, e a edição em nível de região após a geração preserva a continuidade em vez de forçar uma regeneração. Áudio e vídeo são gerados em conjunto em uma única passada, então a sincronia labial acompanha o diálogo citado, e mais de dez idiomas têm suporte nativo.

A lista de adoção é o que revela. No dia do lançamento, XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei e Qiongche Intelligence confirmaram parcerias, e os casos de uso declarados vão de dados de treinamento de IA incorporada e casos extremos de direção autônoma a vídeos de treinamento de SOP industrial, educação e publicidade em e-commerce. Parte disso é trabalho criativo. Parte disso é geração de dados para sistemas que posteriormente agirão no mundo — que é a parte que se sobrepõe ao Odyssey-3.

Quanto custa um segundo de Seedance 2.5

Os preços são publicados e medidos em tokens, e não em segundos, o que gera uma etapa de conversão que vale a pena fazer antes de se comprometer. Os valores informados para o endpoint ModelArk são US$ 10,70 por milhão de tokens sem entrada de vídeo e US$ 6,40 por milhão de tokens quando a entrada de vídeo está incluída. Na prática, isso equivale a cerca de US$ 0,51 para um clipe de cinco segundos em 16:9 a 480p e cerca de US$ 1,16 para o mesmo clipe a 720p. Essas são as tarifas publicadas pelo fornecedor conforme informadas no lançamento; trate-as como tabela atual, e não como custo medido por entrega, porque tanto a resolução quanto a duração fazem esse valor variar.

A disponibilidade tem limites reais. O acesso do consumidor passa pelos próprios aplicativos da ByteDance, enquanto o acesso via API se divide entre o Volcano Engine Ark na China e o BytePlus ModelArk internacionalmente. Pelo menos um distribuidor afirma que o modelo não está disponível nos Estados Unidos, e as fontes divergem sobre se as resoluções compatíveis param em 720p ou chegam a 1080p — uma discrepância que vale a pena resolver com base na documentação do próprio fornecedor antes de basear seu projeto em uma resolução.

Este é o tipo de modelo em que uma camada de roteamento ganha seu lugar por um motivo específico: as tarifas mudam. Um preço de vídeo por token que mudou uma vez no lançamento mudará novamente, e a diferença entre um modelo de custo baseado no número de hoje e um baseado no do trimestre passado é a diferença entre uma margem e uma surpresa. OrcaRouter repassa o preço de tabela do provedor com 0% de markup, então um corte do fornecedor entra em vigor do nosso lado no mesmo dia, em vez de na próxima renovação de contrato, e o failover automático mantém uma fila de geração em andamento quando um endpoint de provedor se degrada — uma preocupação de agendamento, e não teórica, em cargas de trabalho de vídeo. O próprio Seedance 2.5 não é roteado pela OrcaRouter; ele é servido pelas próprias plataformas da ByteDance e seus endpoints ModelArk.

Two-column scoreboard for Odyssey-3 and Seedance 2.5 across six shared dimensions — unit of sale, what you get, inputs, editing control, availability and partners. Seedance 2.5 reads tokens at roughly $0.51 per 5s at 480p, finished footage up to 30s, shipping since 31 Jul 2026; Odyssey-3 reads not published, next world state plus actions, announced 15 Sep 2026, Flexion on humanoids.

O Odyssey-3 não é vendido por segundo.

O Odyssey-3 ainda não tem uma unidade de venda, e é esse o ponto. É descrito como um modelo de mundo fundacional capaz de alimentar robôs, conduzir carros, treinar IAs, pilotar drones e jogar videojogos — um transformador de difusão autorregressivo treinado numa grande coleção de observações visuais que, segundo o seu criador, produz uma compreensão aprendida de física, dinâmica, causa e efeito e comportamento humano. A adaptação a uma nova tarefa é feita treinando um decodificador de ações com pares observação-ação e mantendo o modelo de mundo pré-treinado congelado, de modo que uma pequena política lê a representação congelada e emite comandos motores.

As demonstrações, todas relatadas pelos fornecedores e nenhuma reproduzida de forma independente, abrangem seis incorporações: braços robóticos a partir de dezenas de horas de demonstrações, incluindo comportamentos de recuperação que não estavam nos dados; políticas humanoides criadas com o Flexion a partir de dezenas de horas de teleoperação, que a Odyssey afirma generalizarem melhor do que as linhas de base VLA contra as quais testou, sem publicar um número; condução em malha fechada na Índia a partir de vinte horas de dados simulados; voo de drones em ambientes fechados a partir de dados simulados; políticas de Grand Theft Auto V que foram transferidas para Red Dead Redemption 2 e Sleeping Dogs sem treino adicional, com cerca de duas horas de imagens de GTA a produzir movimento a cavalo no RDR2; e geração de ambientes para treinar outras IAs através do trabalho PROWL.

O único dado concreto é 77% — políticas de condução treinadas em simulação percorreram, entre intervenções do motorista de segurança, cerca dessa fração da distância alcançada por políticas treinadas com filmagens reais. Trata-se de um número de fornecedor, sem relatório técnico nem verificação externa por trás dele.

Screenshot of Odyssey's “Introducing Odyssey-3: A General-Purpose Physical Intelligence” page, dated September 15th, 2026, showing the model subtitle “Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games” and the authors Oliver Cameron and Jeff Hawke.

A unidade de venda decide o que é otimizado.

Assim que você vê os dois modelos como medidores, e não como capacidades, as diferenças entre eles deixam de parecer que um está à frente do outro.

Um modelo cobrado por segundo de saída é otimizado para resultados que satisfazem um espectador. Isso não é uma ambição menor; é um alvo diferente, com seus próprios problemas difíceis. Seedance 2.5 produzir trinta segundos coerentes com diálogo sincronizado e controle em nível de timestamp é um resultado genuinamente difícil, e os modos de falha pelos quais ele é julgado — o rosto de um personagem se desviando, um corte que não funciona, uma linha de diálogo fora de sincronia — são os que uma pessoa numa ilha de edição notaria.

Um modelo ao qual se pede para prever o que acontece a seguir quando um controlador atua é otimizado para algo que um espectador nunca vai verificar: se a dinâmica se sustenta sob uma sequência de decisões, incluindo decisões que ninguém demonstrou. É por isso que a Odyssey relata comportamento de recuperação que emerge de dezenas de horas de dados em vez de relatar fidelidade, e por que sua única afirmação quantitativa é medida em intervenções de motoristas de segurança em vez de em qualidade visual. Um renderizador pode estar errado de maneiras que o público perdoa. Um simulador pode estar errado de maneiras sobre as quais um controlador baseia suas ações, e o segundo tipo de erro se acumula ao longo de um rollout.

A sobreposição nos casos de uso declarados — dados de treinamento de robôs, casos extremos de condução autônoma — é onde esses dois se encontram, e é uma verdadeira competição por orçamento, e não por posição em benchmarks. A questão que uma equipe de robótica realmente enfrenta é se deve comprar segundos renderizados de um mundo plausível ou comprar um modelo de dinâmica com uma interface de ação, e a resposta depende de se o consumidor a jusante é um revisor humano ou um loop de treinamento.

Lado a lado

Unidade de venda — Seedance 2.5: tokens, convertendo em aproximadamente $0,51 por clipe de 5s em 480p e $1,16 em 720p. Odyssey-3: nenhum publicado.

O que você recebe por unidade — Seedance 2.5: filmagem finalizada, de até 30 s em uma única passagem, com áudio e diálogo sincronizados. Odyssey-3: um estado futuro previsto do mundo, além de ações motoras para o hardware conectado.

Entradas — Seedance 2.5: texto mais até ~30 imagens, 10 vídeos e 10 clipes de áudio. Odyssey-3: um decodificador de ações treinado em pares observação-ação, sobre um backbone congelado.

Controle de edição — Seedance 2.5: direcionamento em nível de timestamp e edições pós-geração em nível de região. Odyssey-3: não aplicável; não há superfície de edição.

Parceiros declarados — Seedance 2.5: XCMG, XPeng e três outros no lançamento. Odyssey-3: Flexion em políticas para humanoides; nenhum cliente comercial anunciado.

Disponibilidade — Seedance 2.5: disponível desde 31 de julho de 2026, sujeito a limites regionais. Odyssey-3: anunciado em 15 de setembro de 2026, lançamento público "nas próximas semanas", sem data e sem preço.

Qual deles se encaixa na sua stack

Se o entregável for um vídeo que uma pessoa vai assistir, o Seedance 2.5 é um produto disponível no mercado, com preço publicado e um amplo conjunto de recursos, e a decisão é a típica de construir versus comprar — com duas ressalvas que vale a pena verificar primeiro: se as resoluções de que você precisa estão realmente disponíveis no endpoint que você consegue acessar, e se a sua região é atendida. Sua duração maior em passagem única e o controle de timestamp são os recursos que mais mudam o fluxo de trabalho, porque eliminam etapas de emenda em vez de melhorar um quadro.

Se o entregável for uma política treinada ou um controlador, o Seedance 2.5 não é um substituto, por melhor que a filmagem pareça, e o Odyssey-3 está voltado para o seu problema sem nada para comprar. A alegação que vale acompanhar é a do backbone congelado: um único modelo pré-treinado alcançando braços, humanoides, um carro, um drone e três jogos por meio de um pequeno decodificador é uma declaração sobre quanto entendimento físico se transfere entre encarnações e, se isso se sustentar, muda o que uma equipe de robótica precisa coletar. Ele não foi testado por ninguém fora da Odyssey, e não há relatório técnico, nem licença, nem preço.

O que observar é pouco glamouroso: para o Seedance 2.5, um preço estabilizado e uma declaração clara de disponibilidade regional; para o Odyssey-3, um repositório, uma licença e uma terceira parte reproduzindo os 77%. Enquanto a segunda lista não existir, a diferença entre esses dois modelos não é qualidade. É que um deles é um produto, e o outro é um argumento.

Infographic titled “What One Unit Buys” contrasting Seedance 2.5, billed per token, with a 5s clip costing about $0.51 at 480p and about $1.16 at 720p and up to 30s in a single pass, against Odyssey-3, which has no published price and reaches robot arms, humanoids, a car and a drone through a frozen backbone plus action decoder across six embodiments with no third-party runs.

O OrcaRouter mantém mais de 200 modelos por trás de uma única chave de API, então o modelo de vídeo que você escolher não é o único que você pode chamar.