
Odyssey-3 vs Google Veo 3.1: Física de Fronteira Contra Dez Meses de Produção
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
A comparação entre Odyssey-3 e Veo 3.1 é, na verdade, uma comparação entre duas datas. O Veo 3.1 está disponível de forma geral desde 17 de novembro de 2025 — dez meses de uso em produção, preços por segundo publicados, 4K nativo e uma pilha de serviço que já passou por uma revisão corporativa pelo menos uma vez. O Odyssey-3 foi pré-visualizado pela Odyssey em 15 de setembro de 2026, não tem preço publicado, nem documentação de API, nem benchmark independente, e tem uma janela de lançamento de "as próximas semanas". Ainda vale a pena colocá-los lado a lado, porque o motivo pelo qual são mencionados juntos é real: o Veo 3.1 renderiza vídeos bonitos, e o Odyssey-3 está tentando simular um mundo que se comporta corretamente sob controle. Esses são os dois produtos diferentes que as equipes continuam confundindo sob a palavra "vídeo", e a lacuna entre eles é exatamente onde vive a decisão de compra.
O que dez meses de entregas te rendem
A vantagem do Veo 3.1 não é um recurso: é o tempo decorrido. O modelo está nas mãos de clientes pagantes desde outubro de 2025 como prévia e, desde 17 de novembro, como produto GA, com um nível Lite adicionado em 31 de março de 2026 e um nível gratuito em 2 de abril. Esse histórico gera coisas que uma prévia não consegue: uma superfície de API documentada, um conjunto estabelecido de modos de falha que os profissionais já mapearam e uma curva de custos que uma equipe financeira consegue modelar.
A ficha técnica reflete a mesma maturidade. O Veo 3.1 gera em 720p, 1080p e 4K nativo, a 24 quadros por segundo, em durações nativas de 4, 6 ou 8 segundos, com saídas mais longas relatadas em 1080p e encadeamento de extensão de cena além disso. Ele aceita até três imagens de referência para consistência de personagem e cena, além de controles de seed e prompt negativo. A saída carrega metadados de proveniência SynthID e C2PA. Para trabalhos de marca, transmissão ou telas grandes, o caminho em 4K nativo é a única capacidade que a maior parte do campo concorrente simplesmente não possui — e é a razão pela qual o Veo 3.1 continua vencendo projetos que não vence por preço.

A configuração padrão de áudio que silenciosamente distorce todas as comparações
O Veo 3.1 gera áudio estéreo nativo de 48 kHz — diálogo, som ambiente, foley — em conjunto com a imagem, o que é genuinamente um dos seus recursos mais fortes. Na API, porém, o parâmetro de áudio vem desativado por padrão, e a geração silenciosa custa menos que a geração com áudio. No nível Standard publicado pelo Google, isso equivale a cerca de US$ 0,20 por segundo sem áudio contra cerca de US$ 0,40 por segundo com áudio. Seguem-se duas consequências. Primeiro, o preço efetivo de um clipe do Veo depende inteiramente de uma flag que a maioria das pessoas nunca altera, então tanto um valor de “US$ 0,20 por segundo” quanto um de “US$ 0,40 por segundo” podem estar corretos para o mesmo modelo. Segundo, e de forma mais sutil, isso significa que muitíssimos testes frente a frente que você leu colocaram um Veo 3.1 silencioso contra concorrentes cujo áudio está sempre ativado e depois os avaliaram em um ranking que leva o áudio em conta. Se o seu resultado precisa de som, o número honesto para se planejar é o com áudio ativado.
O que o Odyssey-3 está realmente alegando
Odyssey-3 não é um gerador de vídeo melhor e não afirma ser. É um transformer de difusão autorregressivo treinado na observação visual do mundo, e a capacidade no centro do anúncio é um decodificador de ações — "um componente de saída aprendido acoplado ao modelo de mundo" que converte a representação interna de cena do modelo em comandos motores para hardware específico. A Odyssey relata que ele controla braços robóticos a partir de dezenas de horas de demonstrações, comanda políticas humanoides construídas com Flexion em tempo real, produz waypoints de condução em malha fechada a partir de um backbone congelado treinado com 20 horas de dados simulados, pilota drones em ambientes fechados contornando obstáculos e joga Grand Theft Auto V com transferência para Red Dead Redemption 2 e Sleeping Dogs sem treinamento adicional de política nesses jogos. O único número comparativo divulgado é que políticas de condução treinadas em simulação percorreram, entre intervenções do motorista de segurança, cerca de 77% da distância das políticas treinadas em filmagens reais.
Observe que tipo de afirmações são essas. Nenhuma delas é sobre como a saída se parece. Todas são sobre o que um programa a jusante do modelo pode fazer com ela.
As dimensões que não se sobrepõem
• Saída — Google Veo 3.1: um clipe renderizado, em até 4K nativo, com áudio estéreo de 48 kHz opcional. Odyssey-3: um estado de mundo simulado, além de ações motoras via o decodificador de ações.
• Consumidor — Google Veo 3.1: um visualizador ou um editor. Odyssey-3: um controlador de robô, uma política de condução ou um ciclo de treino.
• Duração do clipe — Google Veo 3.1: 4/6/8s nativos, mais longo em 1080p, com cadeias de extensão além disso. Odyssey-3: execução contínua, sem conceito de clipe.
• Preço — Google Veo 3.1: ~$0,20/s sem áudio, ~$0,40/s com áudio no Standard; os níveis Fast e Lite abaixo disso. Odyssey-3: nenhum publicado.
• Disponibilidade — Google Veo 3.1: GA desde 2025-11-17. Odyssey-3: prévia em 2026-09-15, público "nas próximas semanas."
• Evidência — Google Veo 3.1: dez meses de uso em produção e colocação independente em rankings. Odyssey-3: demonstrações do fornecedor, sem tabela de benchmarks, sem relatório técnico.
Onde a afirmação da física realmente compensa — e onde não compensa
É tentador presumir que um modelo com física melhor produz vídeos melhores, e não é isso que a Odyssey está vendendo. O problema de uma equipe de vídeo quase nunca é que o mundo no clipe seja fisicamente inconsistente — é que a tomada precisa ser em 4K, ou que o personagem precise parecer o mesmo em três configurações diferentes, ou que o entregável precise de metadados de proveniência anexados antes que o jurídico aprove. O Veo 3.1 responde a essas perguntas hoje. Um simulador fisicamente preciso responde a uma pergunta diferente: posso treinar algo aqui dentro que funcionará lá fora. Se você não está treinando nada, a precisão física do Odyssey-3 é um recurso sem comprador no seu fluxo de trabalho.
O ponto em que os dois realmente convergem é a pré-visualização. Um diretor que quer explorar um espaço de forma interativa — percorrer um cenário com uma câmera, mudar uma escolha de marcação, ver a consequência — quer exatamente o que um modelo de mundo oferece e o que um clipe renderizado não consegue oferecer, porque o clipe fica fixo no momento em que é gerado. Esse é um caso de uso real, e também é um em que uma prévia não lançada ainda não é uma opção.
Executando isso em produção sem apostar em um único endpoint
O motivo pelo qual as equipes de produção se importam com a arquitetura ao redor do modelo é que um pipeline de vídeo raramente é uma única chamada. Um modelo de prompt elabora a lista de planos, um modelo de imagem produz o quadro inicial, um modelo de visão confere o resultado em relação ao briefing, um modelo de transcrição cuida da narração. Cada um deles é uma dependência que pode falhar às 2 da manhã, e cada um é uma integração separada se você comprá-los separadamente. Colocar essa camada sobre uma única API em mais de 200 modelos ao preço de tabela do provedor com 0% de markup consolida as integrações, e o failover automático significa que uma indisponibilidade do modelo de prompt faz o tráfego ser redirecionado em vez de travar a fila de renderização. A DSL de roteamento importa mais aqui do que em um fluxo de trabalho com um único modelo, porque compor vários modelos em uma única chamada é o que permite que um pipeline de vários estágios falhe de forma controlada etapa por etapa, em vez de como um todo. Para deixar claro o escopo: o OrcaRouter não atende o Google Veo 3.1 nem o Odyssey-3, e nenhum dos dois modelos é acessível por meio dele.

Quem deve agir agora, e quem deve esperar
Se o seu prazo é este trimestre e o seu entregável é um arquivo, o Google Veo 3.1 é a escolha defensável, e o preço — cerca de US$ 0,40 por segundo em 1080p com áudio, menos nos níveis Fast e Lite — é o custo de um modelo que está em produção há tempo suficiente para ser entediante. Inclua no orçamento o flag de áudio de forma deliberada, em vez de descobri-lo depois.
Se o seu problema é uma política que precisa funcionar em hardware, o Odyssey-3 é voltado para você e ainda não há nada para comprar. Espere por três coisas: um preço publicado, uma data de lançamento que seja uma data e não uma janela, e um número independente. O valor de 77% de sim-to-real é do próprio Odyssey, e até que alguém de fora da empresa o reproduza, a postura correta é de interesse, não de planejamento. Enquanto isso, o stack ao redor é a parte que você pode construir, e construí-lo de modo que um novo modelo possa ser encaixado depois é a posição mais barata de manter.

