Um cartão de destaque gerado para HiDream-O1-Video-1.0 com a chamada 'OrcaRouter · radar de modelos — vídeo' acima do título 'Sexto no ranking, uma entrada na API', um cartão à esquerda 'O ranking' listando AA image-to-video 6º de 80+, Elo 1.175 ±10, 3.231 amostras e 0,80 por minuto, um cartão à direita 'A API documentada' listando uma imagem de referência, um prompt opcional, apenas force_10s, e vídeo, resolução e áudio não expostos, e quatro chips com os dizeres Lançado em ago. de 2026, Anunciado em 17 de set. de 2026, Pesos: nenhum publicado, e nenhuma entrada nos quadros T2V ou de edição.
Engineering & Research

HiDream-O1-Video-1.0 estreia em sexto lugar no Artificial Analysis — e sua API pública é muito menor que seu lançamento

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

HiDream-O1-Video-1.0 está em sexto lugar no ranking Image-to-Video da Artificial Analysis, com um Elo de 1.175 em 3.231 votos, a US$ 5,80 por minuto de vídeo gerado. Essa é a posição que seu criador anunciou — exceto que o comunicado de lançamento da HiDream.ai, datado de 17 de setembro de 2026, dizia número quatro. Os dois números são verdadeiros e descrevem coisas diferentes: o comunicado cita a posição que o modelo ocupava no dia em que foi anunciado, e o ranking mudou desde então. Lido em 10 de outubro de 2026 com o filtro de áudio ativado, o HiDream V1 fica atrás de MiniMax H3 Max, MiniMax H3, Vidu Q4 Preview, Omni Flash e Dreamina Seedance 2.0 720p, nessa ordem.

A história mais interessante não é a posição no ranking. É que o HiDream-O1-Video-1.0 foi anunciado como um modelo que recebe texto, imagens e vídeo e retorna filmagens 1080p de cinco a vinte segundos com áudio nativamente sincronizado — e que o que você pode de fato chamar hoje aceita exatamente uma imagem de referência e um prompt de texto opcional, e nada mais. Ambas as afirmações estão documentadas. A lacuna entre elas é o que vale a pena saber antes de você construir em cima deste modelo.

O conselho, lido corretamente

Artificial Analysis administra seus rankings de vídeo em níveis, cada um com sua própria escala Elo e seu próprio conjunto de votos, de modo que uma pontuação não é transferível entre eles. No AA-Video-I2V v1.0 com o áudio mantido, os seis primeiros estão separados por vinte pontos Elo, e os intervalos de confiança têm entre sete e dez pontos de largura. Esses seis primeiros, em 10 de outubro de 2026:

• MiniMax H3 Max — 1.195 ±9 em 5.894 amostras, agosto de 2026, US$ 4,80/min

• MiniMax H3 — 1.181 ±8 em 7.284 amostras, julho de 2026, $7,80/min

• Vidu Q4 Preview — 1.179 ±10 em 5.543 amostras, outubro de 2026, $5,04/min

• Gemini Omni Flash — 1.178 ±7 em 12.327 amostras, maio de 2026, $6,00/min

• Dreamina Seedance 2.0 720p — 1.176 ±7 em 15.721 amostras, março de 2026, $9,07/min

• HiDream-O1-Video-1.0 — 1,175 ±10 em 3.231 amostras, agosto de 2026, $5,80/min

Leia esses intervalos como um grupo e o resumo honesto é que as posições de um a seis são, estatisticamente, uma única disputa com uma cauda muito longa de empates. A lacuna que não está dentro do ruído é a que existe entre o HiDream V1 e o restante do pelotão: o sétimo lugar, o Wan 3.0 da Alibaba, está em 1.164 — onze pontos e um intervalo inteiro abaixo do sexto, e quase trezentos votos à frente dele. A própria contagem de amostras do HiDream é a menor entre os seis primeiros, o que significa que seu intervalo está entre os mais amplos e sua posição é a menos definida.

A generated scoreboard titled 'HiDream-O1-Video-1.0 — announced versus served', contrasting the vendor's launch claims (inputs: text, image and video; output: 1080p, 5 to 20 seconds; audio: natively synchronised; duration planned from narrative; generation as one joint multimodal process; physics of gravity, collision and inertia) against the HiHarness request surface (one reference image; aspect ratio preserved; no audio parameter; force_10s boolean only; no resolution selector documented; physics not exposed as a control), with a footer stating the launch claims are vendor-reported.

Vale a pena levar adiante duas coisas que a Artificial Analysis afirma sobre o próprio ranking. Ele registra um único modelo como adicionado nos últimos 30 dias, e diz que o AA-Video-I2V v2.0 está chegando, alinhado à taxonomia do AA-Video-T2V v2.0, com 1080p de ponta a ponta. Isso importa para um modelo cujas promessas de lançamento são sobre 1080p e sobre condicionamento de texto e vídeo: o ranking em que ele estreia é explicitamente transitório, e o substituto altera o que é medido.

Onde o modelo não está

HiDream-O1-Video-1.0 aparece em exatamente um ranking de vídeo da Artificial Analysis. Está ausente do AA-Video-T2V v2.0, o ranking de texto para vídeo, e do ranking de edição de vídeo. Verifiquei ambos em 10 de outubro de 2026 — Wan 3.0 lidera texto para vídeo com 1.156 e edição de vídeo com 1.157, FLUX 3 é o sexto em texto para vídeo com 1.128, e HiDream não aparece em nenhum dos dois rankings.

Essa ausência é um sinal, e não uma desqualificação. Um modelo que apenas consome uma imagem de referência não pode ser inscrito em uma votação de texto para vídeo, e um que apenas anima não pode entrar em uma comparação de edição. A consequência prática é que não há medição independente do HiDream V1 fazendo texto para vídeo ou edição de vídeo, que são precisamente dois dos três modos de entrada anunciados em seu lançamento.

Duas datas, e os noventa dias entre elas

Há um senão na datação que qualquer pessoa que cite estes números deve tratar com cuidado. A Artificial Analysis regista a data de lançamento do HiDream-O1-Video-1.0 como 28 de agosto de 2026 e a data em que foi apresentado ao conselho como 10 de setembro de 2026. O próprio anúncio de lançamento da HiDream está datado de 17 de setembro. As referências de terceiros ao modelo que surgiram desde então descrevem-no como publicado em 15 de setembro e verificado em 17 de setembro.

O que esse padrão descreve é um modelo que chegou ao pipeline de avaliação antes de chegar ao comunicado de imprensa — o que é bastante normal, e significa que a data de lançamento no ranking é a mais antiga das duas, não um erro. Não descreve um modelo de março sendo reanunciado em agosto, que é o modo de falha com que este blog já se queimou antes. O HiDream-O1-Video-1.0 é genuinamente novo: a própria infraestrutura do ranking data a sua chegada dentro dos últimos dois meses.

O que o lançamento alega, e quem o afirma

A história da arquitetura vem da HiDream e não foi reproduzida de forma independente. Segundo o fornecedor: o HiDream-O1-Video-1.0 — HiDream V1, ou HD-V1 — modela conjuntamente texto, vídeo e áudio dentro de um único processo de geração, em vez de gerar imagem e adicionar som depois, de modo que movimento labial, som ambiente e ação física compartilhem uma linha do tempo. A duração é planejada, e não fixada, com o modelo escolhendo uma duração entre cinco e vinte segundos a partir do evento descrito. O comportamento físico — gravidade, colisão, inércia, deformação, decaimento da luz — é treinado como uma restrição de geração. O pós-treinamento usa aprendizado por reforço de difusão contra um modelo de recompensa multimodal alinhado à percepção humana. A geração ocorre em três etapas que a empresa descreve como planejamento primeiro, geração conjunta segundo, alinhamento terceiro.

A HiDream posiciona o modelo dentro de um portfólio de quatro famílias construído sobre uma base compartilhada de transformer unificado — HiDream-O1-Image, HiDream-O1-Video, HiDream-O1-World e HiDream-O1-Embodied — e cita colocações anteriores em benchmarks dos irmãos, incluindo o HiDream-O1-Image 1.5 em segundo lugar globalmente no ranking de texto para imagem da Artificial Analysis e o HiDream-O1-World em primeiro no WBench. Esses são os números do fornecedor para outros modelos da família, apresentados aqui sem confirmação independente. O material corporativo da empresa também descreve uma pilha tecnológica de modelo de fundação com "mais de 200 bilhões" de parâmetros; essa é uma declaração em nível de plataforma, não uma especificação do HiDream-O1-Video-1.0, e nenhuma fonte publica uma contagem de parâmetros para esse checkpoint. Nenhum peso aberto foi disponibilizado para ele.

A screenshot of the Artificial Analysis AA-Video-I2V v1.0 image-to-video leaderboard with the audio filter applied, captured 10 October 2026, headed by MiniMax H3 Max at Elo 1,195 and .80 per minute, with HiDream-O1-Video-1.0 sixth at Elo 1,175 over 3,231 samples, released August 2026 at .80 per minute, and a banner noting that AA-Video-I2V v2.0 is coming soon with 1080p videos throughout.

O que você pode realmente chamar

Aqui a documentação é excecionalmente clara, e é mais restrita do que o anúncio. A HiDream disponibiliza o modelo através do HiHarness, a sua plataforma MaaS. O endpoint de vídeo é um POST para /api/maas/gw/v1/videos/generations com o identificador de modelo HiDream-O1-Video-1.0. A entrada necessária é exatamente uma imagem de referência — um URL público, ou Base64 sem o prefixo data-URL, entre 40 KB e 20 MB. O prompt de texto é opcional e o padrão é vazio. A geração é assíncrona: você envia, recebe um task_id, e faz polling em /api/maas/gw/v1/videos/generations/results até que result.status seja 1.

Três omissões nesse esquema merecem ser nomeadas explicitamente, porque cada uma delas é uma capacidade que a versão de lançamento anuncia.

• Vídeo de referência — o anúncio lista o vídeo entre as entradas do modelo; a requisição documentada não tem campo para ele.

• Resolução explícita — o anúncio afirma 1080p; a requisição documentada não tem seletor de resolução, e o resultado preserva a proporção da imagem de referência.

• Controle de áudio — o anúncio afirma contar com áudio nativo sincronizado; a requisição documentada não expõe nenhum parâmetro de entrada de áudio nem de geração de áudio.

O que o schema expõe é force_10s, um booleano que tem false como valor padrão. Se deixado como false, o modelo escolhe a duração. Se definido como true, você obtém dez segundos. Não há campo numérico de duração, portanto o intervalo anunciado de cinco a vinte segundos é uma afirmação em nível de modelo que a superfície de requisição pública não permite controlar, a não ser escolhendo um dos dois modos.

A screenshot of the HiHarness documentation page for the HiDream-O Series video models, captured 10 October 2026, describing HiDream-O1-Video-1.0 as a single-image-to-video model that generates a video from one reference image and a text prompt, with Model ID HiDream-O1-Video-1.0, input as one reference image by public URL or Base64, output of one video, resolution that preserves the input aspect ratio, a dynamic or fixed ten-second duration, and an asynchronous workflow of submitting a task and polling the result endpoint until result.status is 1.

Há um detalhe de implementação nesse contrato de resposta que vai prejudicar uma integração escrita com base na correspondência de padrões de outras APIs de vídeo. result.status = 1 significa que todas as subtarefas alcançaram um estado terminal — não que a geração tenha sido bem-sucedida. Você ainda precisa ler sub_task_results[].task_status, em que 1 é sucesso, 3 é falha de geração e 4 é falha de revisão de segurança. Um cliente que trata o estado terminal como bem-sucedido vai entregar a você uma URL de vídeo que não existe.

O preço, em contexto

Nos registros da Artificial Analysis, a $5,80 por minuto, o HiDream V1 tem preço intermediário para sua faixa, em vez de ser barato. Dentro do top seis do ranking, ele é mais barato que o MiniMax H3 ($7,80) e o Dreamina Seedance 2.0 ($9,07) e mais caro que o MiniMax H3 Max e o Vidu Q4 Preview. Em comparação com os modelos com os quais será comparado com mais frequência, a diferença é maior: o Google Veo 3.1 custa $24,00 por minuto, o Kling 3.0 1080p Pro $20,16, o Alibaba Wan 2.7 $9,00 e o Wan 3.0 $12,00, enquanto o Grok Imagine Video 1.5 fica em $8,40.

Essas tarifas por minuto não são diretamente comparáveis, porque a resolução e o áudio de um minuto de saída são exatamente aquilo que a documentação da API deixa em aberto para este modelo. Trate o número como um ponto de partida para os seus próprios cálculos, e não como uma tabela de tarifas.

Experimentar uma via não comprovada sem apostar um pipeline nela

O argumento a favor da cautela aqui não é que o modelo seja ruim. É que uma superfície de serviço da era de pré-visualização — um tipo de entrada, um seletor de duração, uma flag terminal de dois estados — é o lugar errado para fixar em código um caminho de produção. O HiDream-O1-Video-1.0 não é um modelo que servimos na OrcaRouter hoje, então nada abaixo é uma afirmação sobre hospedá-lo: o lugar onde nosso produto realmente ajuda é do outro lado da decisão, onde você quer testar uma nova rota de vídeo contra uma já consolidada e poder abandoná-la a qualquer momento. Um endpoint compatível com OpenAI para mais de 200 modelos, failover automático para que uma rota que começa a falhar silenciosamente não seja a rota que você coloca em produção, preços de tabela dos provedores repassados sem acréscimo de margem, e uma DSL de roteamento que permite comparar dois modelos dentro de uma única requisição em vez de duas integrações. Nada disso exige especificamente o modelo da HiDream.

O que mudaria esta peça

Três desenvolvimentos mudariam o cenário, em ordem decrescente de probabilidade.

Primeiro, um contrato de serviço mais amplo. Se o HiHarness adicionar um campo de vídeo de referência, um seletor de resolução ou controles de áudio documentados, a lacuna entre o anúncio e a API diminui, e as alegações de 1080p e de texto para vídeo se tornam testáveis. Isso é uma mudança de documentação, não uma mudança de modelo, e pode chegar a qualquer semana.

Segundo, o painel AA-Video-I2V v2.0. A Artificial Analysis disse que ele está por vir, alinhado à taxonomia do T2V v2.0, com 1080p do começo ao fim. Um painel exclusivo em 1080p seria o primeiro ambiente independente no qual a alegação de resolução do HiDream V1 significa alguma coisa — e, se o modelo ainda não puder ser inscrito no painel de texto para vídeo sob a nova taxonomia, sua ausência ali se torna um achado substantivo em vez de um artefato das antigas categorias.

Terceiro, o tamanho da amostra. 3.231 votos são uma medição real e recente, a mais frágil entre os seis primeiros. O intervalo agora é de ±10 e vai se estreitar na direção para a qual os eleitores o empurrarem. Quem citar “sexto” como um fato consolidado deveria informar a data em que leu isso, porque o sexto lugar é um empate dentro de um empate entre seis.

A questão que vale a pena manter não é se o HiDream-O1-Video-1.0 é competitivo — no único ranking em que pode ser medido, ele claramente é, e a um preço por minuto defensável. É se o modelo que eventualmente chega a uma API ampla é aquele que foi anunciado. De acordo com a documentação atual, esses ainda são dois produtos diferentes.

O HiDream-O1-Video-1.0 não é uma das rotas que servimos hoje, mas o mesmo tipo de superfície está por trás de mais de 200 modelos, com os preços de tabela dos provedores repassados e sem nenhum acréscimo adicionado.