
Odyssey-3 vs Wan 3.0: Um Modelo de Mundo Encontra uma Fábrica de Vídeos
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Odyssey-3 e Wan 3.0 são ambos classificados como "modelo de vídeo", e esse rótulo compartilhado carrega mais peso do que pode suportar. Odyssey-3 é um sistema dinâmico aprendido — um simulador que constrói um ambiente a partir de um prompt e prevê como esse ambiente muda à medida que alguém se move por ele ou aciona um evento — lançado pela Odyssey em 8 de outubro de 2026 como uma prévia de pesquisa. Wan 3.0 é um gerador de vídeo de produção da Alibaba Cloud, disponível em geral desde seu lançamento em 24 de agosto de 2026, cobrado por segundo, e já pontuado em duas tabelas de classificação independentes. Um deles quer ser um lugar onde você coloca uma câmera. O outro quer ser a coisa que renderiza as filmagens que você publica.
Coloque as duas páginas de lançamento lado a lado e a divisão é imediata. Odyssey lidera com precisão física — o quão bem seu modelo entende o que os objetos fazem quando se encontram. Alibaba lidera com throughput, duração e controle de referência: tomadas de 30 segundos, áudio nativo, até dez imagens e cinco vídeos fornecidos por geração. Nenhum é uma versão pior do outro. São respostas a perguntas, e as respostas dizem a uma equipe o que fazer esta semana.
Uma nota de contexto antes dos números. A maioria dos números deste artigo vem do próprio material de lançamento dos fornecedores e não foi reproduzida por ninguém fora desses laboratórios. Quando um número vem de um painel independente, e não de uma página de imprensa, o texto informa isso. Essa distinção importa aqui mais do que o habitual, porque os dois modelos publicam quantidades radicalmente diferentes de informações verificáveis — um é vendido por segundo em uma API aberta, o outro não publicou preço algum.
O que cada um realmente é
A própria descrição que a Odyssey faz do Odyssey-3 é excepcionalmente específica para um post de lançamento, e vale a pena citá-la em vez de arredondar: é "um sistema dinâmico aprendido, implementado como um transformer de difusão autorregressivo, que prevê como os objetos se movem e interagem pelo espaço e como as situações evoluem ao longo do tempo." O que ele retorna não é um clipe no sentido comum. É um estado que continua evoluindo enquanto é acionado. O modelo vem em dois tamanhos — Odyssey-3 a 832×480 e Odyssey-3 Pro a 1280×720 — e a Odyssey diz que sua prévia oferece suporte à navegação em primeira e terceira pessoa, além de movimento independente de câmera. A build também inclui uma variante destilada de poucos passos, produzida por meio de uma combinação de correspondência de distribuição e destilação adversarial, que o fornecedor descreve como interativa em tempo real.
Wan 3.0 é um gerador no modelo consagrado: entra um prompt e uma ou mais referências, e sai um vídeo finalizado. As principais capacidades da Alibaba são a geração de 30 segundos em uma única execução, áudio nativo e entradas de referência que abrangem texto, imagem, vídeo e áudio — além de documentos nos formatos doc, xls, ppt, pdf, md, txt, key, pages e numbers, com até 100 MB e 50 páginas. A edição é baseada em instruções, ou seja, uma geração pode ser modificada em termos de visuais, enredo ou diálogo sem ser regenerada do zero. A Alibaba também afirma claramente que a qualidade do áudio e a precisão do texto na tela ainda precisam melhorar, o que é uma admissão mais rara em um post de lançamento do que deveria ser e uma útil para se ter registrada.
• O que é a saída — um ambiente simulado em que você atua (Odyssey-3) versus um clipe renderizado que você publica (Wan 3.0) • Tamanhos anunciados — 832×480, ou 1280×720 no Odyssey-3 Pro, versus 480p, 720p e 1080p • Duração de uma única execução — enquanto o ambiente continuar a ser acionado, versus 30 segundos por geração • Áudio — não é uma capacidade de destaque em nenhum dos tamanhos, versus áudio nativo com limites de qualidade sinalizados pelo fornecedor • Entradas — um prompt que define o ambiente, versus texto, imagem, vídeo, áudio e documentos de até 100 MB e 50 páginas • Modelo de edição — alterar o estado e simular novamente, versus edições baseadas em instruções em uma geração finalizada • API documentada — nenhuma publicada, versus aberta e com medição desde 24 de agosto de 2026 • Preço publicado — nenhum, versus 0,3 / 0,6 / 1,2 yuan por segundo em 480p / 720p / 1080p
Quanto custa um segundo de saída, e por que as unidades não se alinham
O Wan 3.0 tem seu preço definido na unidade mais legível disponível para o comprador: o tempo. As tarifas da Alibaba são de 0,3 yuan (cerca de US$ 0,05) por segundo de vídeo gerado em 480p, 0,6 yuan (cerca de US$ 0,10) em 720p e 1,2 yuan (cerca de US$ 0,20) em 1080p. Uma execução completa de 30 segundos, portanto, fica em torno de 9 yuan (US$ 1,50) em 480p, 18 yuan (US$ 3,00) em 720p ou 36 yuan (US$ 6,00) em 1080p. Esses são os preços de lançamento de agosto; a promoção de lançamento que os reduziu em 30% vigorou apenas até 23 de setembro, então os números acima são os que o comprador encontra hoje. Os provedores que revendem o Wan 3.0 normalmente apresentam valores por minuto, o que vale a pena conferir com a aritmética por segundo antes de aprovar qualquer orçamento.
O Odyssey-3 não tem um número comparável, porque a Odyssey não publicou um preço, uma tabela de tarifas, uma licença ou documentação da API. O que existe, em vez disso, é um valor de custo dentro de um benchmark de terceiros, calculado com base numa premissa que o fornecedor declara abertamente: $1 por hora de GPU MI355X. Com base nisso, o Physics-IQ Verified lista o Odyssey-3 Pro a $0.267 por vídeo gerado e o Odyssey-3 a $0.139, ambos normalizados para 24 FPS e saída com 1280 de largura. O mesmo painel assinala separadamente que a reescrita de prompts através da API da Odyssey é estimada em $0.01 por vídeo submetido. Leia isso com atenção — é uma base de modelagem, não um preço. Isso mostra quanto custaria uma simulação à taxa de hardware assumida pelo fornecedor, não quanto a Odyssey irá cobrar.
Esses dois fatos apontam em direções opostas para um comprador. Wan 3.0 é um item de linha cobrado por medição cujo pior cenário pode ser calculado antes que qualquer coisa seja renderizada. Odyssey-3 tem um custo modelado por vídeo mais baixo e nenhuma fatura à qual associá-lo — que é exatamente o ponto em que uma conversa de compras para. Para que a comparação seja justa, o leitor precisa considerar as duas metades: uma tarifa real com uma fatura real, e uma tarifa estimada sem nada por trás dela ainda.

O único placar que eles compartilham, e o nome que está faltando nele
Physics-IQ Verified, um ranking dinâmico da Anates Labs e do DeepMind sobre o quão bem modelos de vídeo lidam com princípios físicos, é o único leaderboard independente que esta dupla tem em comum — e é aí que a comparação fica verdadeiramente interessante, porque também é aí que ela se desfaz.
O post de lançamento da Odyssey afirma que o Odyssey-3 Pro "estabelece um novo estado da arte no benchmark do Physics-IQ Verified, e fica em 1º lugar em 3 das 4 categorias do WorldMark." A parte do WorldMark nisso confere com os números que a Odyssey publica: primeiro lugar em First-Person Stylized (77.2), Third-Person Real (79.0) e Third-Person Stylized (76.3), com First-Person Real em segundo a 80.6, atrás do AlayaWorld com 83.0 e do Lyra 2.0 com 84.4. Todos esses são números reportados pelo fornecedor a partir da própria rodada de avaliação da Odyssey.
A parte sobre o estado da arte é onde o leitor deve desacelerar. Na versão do ranking Physics-IQ Verified disponível agora, classificado pela melhoria líquida em pontos percentuais acima da média da trilha, o FLUX 3 [large] da Black Forest Labs ocupa a posição 01, com +12.27 pp. O Odyssey-3 Pro está na posição 02, com +11.15 pp, e o Odyssey-3 está na posição 03, com +9.99 pp. Portanto, o "novo estado da arte" do fornecedor é, no ranking que o próprio fornecedor cita, o segundo lugar — seja porque a alegação é anterior a uma atualização do ranking, seja porque seu escopo é mais restrito do que a frase sugere. De qualquer forma, a leitura honesta é que o Odyssey-3 Pro é um modelo de física entre os três melhores, não um líder absoluto. O FLUX 3 [large] também tem um custo por vídeo muito mais alto, de $0.868, contra os $0.267 do Odyssey-3 Pro, que é o trade-off que a visão de custos do ranking existe para expor.
Odyssey detém, de fato, um primeiro lugar absoluto no detalhamento das submétricas: Espaçotemporal, com 44,70, à frente de Odyssey-3 Pro, com 42,97, e de Physis-Lang (Cosmos3 Super), com 41,57. Em Espacial, está em quarto (59,17), atrás de FLUX 3 (64,36), Odyssey-3 Pro (61,78) e Physis-Lang (59,87); em Espacial Ponderada e MSE, está em quarto e terceiro, respectivamente. Esse padrão — liderança absoluta em quão bem o movimento se mantém coeso ao longo do tempo, segundo escalão na fidelidade espacial de quadro único — é uma assinatura coerente de um modelo construído para simular evolução em vez de renderizar uma imagem estática bonita.
Agora, o nome que falta. O Wan 3.0 não aparece de forma alguma no Physics-IQ Verified. As únicas entradas do Wan são o Wan 2.2 14B na posição 17, −6,64 pp, e o Wan 2.2 5B na posição 22, −11,13 pp — ambos abaixo da média do track, ambos de código aberto, ambos uma geração atrás. A própria nota de escopo do leaderboard diz que a classificação "inclui modelos avaliados por benchmark e modelos conhecidos a partir de preprints ou anúncios, mesmo que o acesso público esteja indisponível ou que nenhuma data de lançamento seja confirmada", portanto a ausência do Wan 3.0 não é evidência de que ele tenha uma pontuação ruim. É evidência de que ninguém o mediu nesse eixo. A consequência prática é direta: qualquer alegação de que o Odyssey-3 supera o Wan 3.0 em plausibilidade física não é verificada em nenhuma das direções, e qualquer alegação de que ele não supera é igualmente não verificada. O histórico independente do Wan 3.0 está em outro lugar — ele ficou em #2 no geral na OpenArt Arena e em #1 em Video Editing with Audio na Artificial Analysis — em rankings que medem qualidade percebida e qualidade de edição, não física.
O que você pode chamar hoje, e o que você só pode perguntar a respeito
O Wan 3.0 pode ser chamado desde 24 de agosto de 2026, quando o lançamento da Alibaba Cloud transformou a beta com medição e acesso mediante candidatura numa API totalmente aberta. O modelo está acessível através da própria API do fornecedor e de várias plataformas de terceiros, todas com medição, com as tarifas por segundo acima. Se uma equipa precisar de vídeo gerado esta tarde, essa é uma opção real e vem com uma fatura.
O Odyssey-3 não oferece isso. A página da Odyssey diz que a pré-visualização de pesquisa está "disponível agora" e convida os desenvolvedores de IA física a entrar em contato — o que descreve uma demo e uma conversa, não um endpoint por trás de uma chave. Não há preço publicado, nem licença, nem documentação de API e, como mostra a seção acima, nenhuma avaliação independente. Um desenvolvedor que leia o post de lançamento não consegue, hoje, calcular quanto custaria uma build de produção no Odyssey-3, nem verificar se as alegações sobre física se sustentam fora do ambiente de testes do próprio fornecedor. Isso é normal para um modelo de mundo no dia do lançamento, e também é o fato mais importante desta comparação.
Como nenhum dos dois modelos está no nosso catálogo — a lista de modelos do OrcaRouter não inclui o Odyssey-3 nem o Wan 3.0 —, o ponto de roteamento útil é a camada que fica acima deles. Provavelmente, uma solução de vídeo não chama um único modelo. Ela chama um modelo de reescrita de prompt, um modelo de vídeo, às vezes um modelo de áudio, e volta a chamar todos eles sempre que um fornecedor altera um preço ou um limite de taxa. No OrcaRouter, esses ficam atrás de uma única API que cobre mais de 200 modelos pelo preço de lista do provedor, com 0% de markup, então uma redução de preço por segundo de um fornecedor de vídeo entra em vigor aqui no mesmo dia, em vez de esperar por uma alteração de configuração, e failover automático significa que a indisponibilidade de um modelo não trava uma fila de renderização. Os modelos de vídeo que nós disponibilizamos — MiniMax H3, Kling 3.0, Kling Video O1 e outros — estão nessa mesma chave, e é isso que torna a substituição barata quando um preview do Wan 3.0 ou um teste do Odyssey-3 finalmente for disponibilizado.

Qual deles se encaixa na sua stack
A escolha não é apertada, porque não há sobreposição no que os dois produzem. A regra de decisão honesta diz respeito ao artefato de que você precisa no final.
Escolha o Wan 3.0 se o entregável for filmagens que uma pessoa assiste: um anúncio, uma inserção de plano, um corte para redes sociais, um segmento didático. Trinta segundos por execução com áudio nativo, controle de referência entre imagens, vídeo e áudio, edição baseada em instruções e documentos como entrada é uma lista de recursos de produção, e a API com medição significa que o custo de um teste pode ser conhecido de antemão. É uma geração, não uma simulação — o trabalho do modelo termina quando o clipe termina. Faça o orçamento com base nas tarifas por segundo do fornecedor e trate as próprias ressalvas do fornecedor sobre áudio e texto na tela como restrições de projeto, e não como notas de rodapé.
Escolha o Odyssey-3, quando puder obtê-lo, se o entregável for um comportamento e não um arquivo: um ambiente no qual uma política aprende, uma cena cuja resposta a uma ação tem de se manter consistente ao longo de um rollout longo, uma tarefa de navegação ou manipulação em que a câmera faz parte do problema. É aí que o primeiro lugar absoluto em Plausibilidade Espaçotemporal e o custo modelado de $0,139–$0,267 por vídeo realmente importam. O que falta é tudo o que uma equipe de produção precisa para poder se comprometer — um preço, uma licença, um endpoint e uma medição externa — e nada disso é algo que uma demonstração possa substituir.
O que é preciso observar é específico e está bem próximo. Se o Wan 3.0 aparecer no Physics-IQ Verified, a questão da física passa a ter resposta em uma direção. Se a Odyssey publicar uma tabela de preços ou uma API, a questão do custo se resolve na outra. Até que uma dessas coisas aconteça, esta comparação tem uma forma estranha: um sistema de produção com preço publicado e nenhuma pontuação de física, ao lado de um simulador com pontuações de física publicadas e nenhum preço. Qualquer um que lhe diga qual é melhor hoje está adivinhando em relação a pelo menos um desses dois números.
![Capture of the Physics-IQ Verified leaderboard from Anates Labs and DeepMind, ranked by net improvement in percentage points above the track mean, showing FLUX 3 [large] first at +12.27 pp, Odyssey-3 Pro second at +11.15 pp and Odyssey-3 third at +9.99 pp, with Wan 2.2 14B at rank 17 and Wan 2.2 5B at rank 22 and no entry for Wan 3.0.](https://cms.orcarouter.ai/api/media/file/4-1741.png)
