
Odyssey-3: O novo modelo de mundo da Odyssey conquista a coroa do Physics-IQ e abre uma prévia pública
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Odyssey-3 Pro obteve 66,1 na trilha de vídeo para vídeo do Physics-IQ Verified, e a Odyssey publicou esse número em 8 de outubro de 2026 ao lado daquilo que realmente importa para um desenvolvedor: uma prévia pública de pesquisa do Odyssey-3, um transformer de difusão autorregressivo criado para gerar um ambiente a partir de um prompt e então continuar prevendo-o em tempo real enquanto alguém caminha por ele, move uma câmera ou dispara um evento. Odyssey-3 é o modelo; Odyssey-3 Pro é a variante 720p dele, rodando em 1280×720 contra 832×480 do modelo base. Ambos entram no ar no mesmo dia, em uma prévia que você mesmo pode conduzir em experience.odyssey.systems, com um canal de contato separado para acesso à API.
É essa combinação que torna isto mais do que um post de benchmark. Modelos de mundo interativos são demo-ware há dois anos; os que geram alguns quadros de movimento plausível em uma trajetória fixa não são o mesmo artefato que um modelo que mantém suas previsões coerentes depois que você cutuca os controles. A Odyssey está reivindicando a segunda coisa, e está deixando qualquer pessoa testar a alegação.
O que foi lançado, precisamente
Dois checkpoints, uma arquitetura, sem pesos.
• Odyssey-3 — o nível 480p, saída de 832×480, 16 fps no harness de benchmark, listado a US$ 0,139 por vídeo gerado na coluna de custo normalizado do ranking.
• Odyssey-3 Pro — o nível 720p, 1280×720, listado a $0.267 por vídeo na mesma base.
• Acesso — uma prévia de pesquisa no navegador com navegação em primeira pessoa, navegação em terceira pessoa e movimento independente de câmera. O acesso à API é via formulário de contato, não uma chave de autoatendimento.
• Abertura — nenhuma. Nenhum peso, nenhuma licença, nenhum preço por token publicado. A página de termos da API no mesmo site foi atualizada pela última vez em 2026-01-22 e ainda rege "o protótipo da Odyssey-2 API", o que mostra quão nova é a superfície comercial.
A arquitetura é descrita no próprio texto da Odyssey como um transformer de difusão de vídeo em várias etapas, estendido de forma autorregressiva por meio de teacher forcing e mascaramento causal, com um pipeline de pós-treinamento que combina correspondência de distribuição e destilação adversarial em um modelo destilado de poucos passos — a parte que torna a interação em tempo real possível. A difusão dá a você difusão; a autorregressão dá a você um modelo que sobrevive a uma sequência de ações; a destilação dá a você a velocidade de clock. Todas as três são essenciais, e todas as três são o relato do fornecedor sobre o próprio sistema, não um relato independente.
O benchmark, lido da maneira como o conselho realmente o lê.
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
O Physics-IQ Verified é executado pela Anates Labs com a DeepMind e é um benchmark genuinamente difícil de manipular: ele mostra a modelos vídeos de experimentos físicos reais — dinâmica de fluidos, óptica, mecânica dos sólidos, magnetismo, termodinâmica — e pontua a continuação em relação ao que realmente aconteceu. Atualmente, ele classifica 41 modelos de 16 laboratórios. O 66,1 do Odyssey-3 Pro é a pontuação bruta mais alta na trilha de vídeo para vídeo que a Odyssey reporta, e a coluna de melhoria líquida do mesmo placar, que mede o ganho sobre a média da trilha em pontos percentuais, conta uma história sutilmente diferente:
Melhoria líquida em relação à média da categoria — FLUX 3 [large] lidera com +12,27 pp; Odyssey-3 Pro está em segundo com +11,15 pp; Odyssey-3 está em terceiro com +9,99 pp.
• Custo por vídeo gerado — Odyssey-3 Pro US$ 0,267, Odyssey-3 US$ 0,139, em comparação com FLUX 3 [large] a US$ 0,868 e Seedance 2.5 a US$ 2,838. (Os custos são normalizados para 24 fps e saída de 1280 de largura quando a tabela de classificação permite, de modo que sejam comparáveis entre modelos que não compartilham a mesma taxa de quadros.)
• Liderança em submétricas — Odyssey-3 assume o primeiro lugar na submétrica espaçotemporal com 44,70, à frente do Odyssey-3 Pro com 42,97; FLUX 3 [large] assume a espacial com 64,36 e a espacial ponderada com 53,25, com as duas entradas Odyssey em segundo e quarto lugar na espacial.
Então, a leitura honesta não é "o Odyssey-3 é o melhor modelo de vídeo do mundo". É: um modelo de mundo construído para interação chegou perto do topo de um ranking de plausibilidade física que antes era propriedade de geradores cinematográficos, e o fez a aproximadamente um terço do custo normalizado do FLUX 3. A alegação separada da Odyssey — 54,7 para o Odyssey-3 Pro na categoria de imagem para vídeo, melhor de 8 — está no mesmo ranking, e a mesma ressalva se aplica: são configurações autoenviadas, e o leaderboard mistura entradas enviadas com prompts personalizados e entradas executadas com os prompts do próprio benchmark. A Odyssey aparece em ambas as colunas, o que é incomumente transparente e também significa que suas duas linhas não estão medindo a mesma coisa.

Por que "modelo de mundo" não é sinônimo de "modelo de vídeo"
A distinção é todo o argumento do produto, por isso vale a pena declará-la claramente. Um gerador de clipes recebe um prompt e devolve um objeto fixo; o resultado é o mesmo para todos que o solicitam. O Odyssey-3 recebe um prompt e devolve um sistema dentro do qual você atua — os modos de câmera em primeira e terceira pessoa da prévia e sua capacidade de aceitar um evento no meio da geração são o mecanismo pelo qual ele prevê o que acontece a seguir com base no que você acabou de fazer, e não com base no que o prompt dizia.
É essa propriedade que faz com que os resultados de sistemas físicos no material de lançamento da Odyssey tenham o aspecto que têm. A empresa relata que um decodificador de ações acoplado ao modelo de mundo congelado, treinado em dezenas de horas de demonstrações de robôs, produziu comportamentos de recuperação que nunca estavam nas demonstrações — reorientar uma garra após uma preensão malsucedida, recuperar um objeto derrubado em uma orientação incomum. Ela relata uma política humanoide construída pela Flexion sobre o Odyssey-3 com dezenas de horas de dados de teleoperação que continuou executando sob mudanças de iluminação que fizeram falhar as linhas de base VLA com as quais foi comparada. Ela relata uma política de condução treinada com 20 horas de dados simulados que dirigiu em circuito fechado em estradas reais, percorrendo cerca de 77% da distância entre intervenções do motorista de segurança em comparação com uma política treinada com filmagens reais. Ela relata navegação de drone a partir de dados simulados de voo e jogabilidade em GTA V que transferiu movimento para Red Dead Redemption 2 e condução de motocicleta para Sleeping Dogs sem treinamento adicional.
Cada um desses é um resultado relatado pelo fornecedor, sem replicação independente, e dois deles são explicitamente enquadrados pela Odyssey como observações qualitativas, e não como medições. Mas são o tipo certo de evidência para a afirmação: a parte interessante não é que o modelo consiga realizar uma tarefa para a qual foi treinado. É que um backbone congelado mais um pequeno adaptador consegue extrair comportamento significativo de algumas dezenas de horas de dados e, ocasionalmente, generaliza além disso.
O que ainda não foi comprovado

Três coisas, e elas não são pequenas.
Primeiro, nenhum avaliador independente executou o Odyssey-3. A entrada no Physics-IQ é uma submissão, e a segunda fonte de pontuação no próprio relatório da Odyssey — WorldMark, no qual o Odyssey-3 fica em primeiro lugar em três das quatro divisões — é uma avaliação feita pelo fornecedor usando as próprias legendas do benchmark e, nos termos da Odyssey, "a média de suas 13 pontuações de métricas relatadas". Isso é a empresa pontuando a si mesma em um conjunto de dados de terceiros. É mais do que a maioria dos lançamentos oferece. Não é um terceiro.
Segundo, a única divisão que o Odyssey-3 não vence naquela avaliação é a que está mais próxima da alegação de marketing. Em ambientes reais em primeira pessoa, ele fica em terceiro lugar com 80,6, atrás do Lyra 2.0 com 84,4 e do AlayaWorld com 83,0. A vantagem do modelo na mesma avaliação está concentrada em ambientes estilizados e em terceira pessoa — 77,2 em primeira pessoa estilizado, 79,0 em terceira pessoa real, 76,3 em terceira pessoa estilizado. Se você está construindo para corporificação fotorrealista em primeira pessoa, o ranking com o qual você deve se preocupar é aquele em que o Odyssey-3 não está no topo.
Terceiro: disponibilidade. "Research preview" carrega um peso real nessa frase. Não há página de preços, nem documentação de limite de requisições, nem chave de autoatendimento. Se você quiser isso em um produto, está na fila.
Comparando-o sem um segundo contrato
Aqui está o problema prático de um lançamento como este: o Odyssey-3 é a coisa mais interessante em geração de vídeo desta semana, e você ainda não consegue chamá-lo. Os modelos com os quais você realmente o compararia são outra história.
A OrcaRouter não hospeda o Odyssey-3, e não há preço publicado para repassar mesmo se hospedasse. O que uma única chave alcança é o restante do conjunto de comparação — minimax/minimax-h3 a US$ 0,08 por segundo de vídeo gerado em 768P, a linha de vídeo Kling, e mais de 200 modelos por trás de um único endpoint — ao preço de tabela do provedor com 0% de margem, de modo que uma mudança de preço de um fornecedor aparece na sua fatura no mesmo dia, e não na próxima renovação. Failover automático entre provedores significa que uma varredura de avaliação não morre porque um upstream está tendo um dia ruim, e a DSL de roteamento permite colocar vários modelos atrás de uma única interface, de modo que um confronto direto seja uma mudança de configuração em vez de uma segunda integração. Se a Odyssey abrir uma API de autoatendimento, é nesse formato que você vai querer encaixá-la.
O que resolveria isso
Uma execução independente do Odyssey-3 em um harness que ele não escolheu. Uma dúzia de profissionais com acesso de pré-visualização descrevendo onde o ambiente se sustenta após um minuto de movimentação agressiva de câmera e onde não se sustenta. Um preço. Qualquer um desses transforma isto de um lançamento forte em um ponto de referência.
O que já é verdade é mais restrito e ainda assim notável: no único painel público que mede se um modelo generativo entende física em vez de se ele fotografa bem, um modelo cujo propósito é a interação está em segundo e terceiro lugares, a um custo normalizado abaixo do modelo em primeiro.
