
HiDream-O1-Video-1.0 estreia em sexto lugar no Artificial Analysis — e sua API pública é muito menor que seu lançamento
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 73 tok/s
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 359 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
HiDream-O1-Video-1.0 está em sexto lugar no ranking Image-to-Video da Artificial Analysis, com um Elo de 1.175 em 3.231 votos, a US$ 5,80 por minuto de vídeo gerado. Essa é a posição que seu criador anunciou — exceto que o comunicado de lançamento da HiDream.ai, datado de 17 de setembro de 2026, dizia número quatro. Os dois números são verdadeiros e descrevem coisas diferentes: o comunicado cita a posição que o modelo ocupava no dia em que foi anunciado, e o ranking mudou desde então. Lido em 10 de outubro de 2026 com o filtro de áudio ativado, o HiDream V1 fica atrás de MiniMax H3 Max, MiniMax H3, Vidu Q4 Preview, Omni Flash e Dreamina Seedance 2.0 720p, nessa ordem.
A história mais interessante não é a posição no ranking. É que o HiDream-O1-Video-1.0 foi anunciado como um modelo que recebe texto, imagens e vídeo e retorna filmagens 1080p de cinco a vinte segundos com áudio nativamente sincronizado — e que o que você pode de fato chamar hoje aceita exatamente uma imagem de referência e um prompt de texto opcional, e nada mais. Ambas as afirmações estão documentadas. A lacuna entre elas é o que vale a pena saber antes de você construir em cima deste modelo.
O conselho, lido corretamente
Artificial Analysis administra seus rankings de vídeo em níveis, cada um com sua própria escala Elo e seu próprio conjunto de votos, de modo que uma pontuação não é transferível entre eles. No AA-Video-I2V v1.0 com o áudio mantido, os seis primeiros estão separados por vinte pontos Elo, e os intervalos de confiança têm entre sete e dez pontos de largura. Esses seis primeiros, em 10 de outubro de 2026:
• MiniMax H3 Max — 1.195 ±9 em 5.894 amostras, agosto de 2026, US$ 4,80/min
• MiniMax H3 — 1.181 ±8 em 7.284 amostras, julho de 2026, $7,80/min
• Vidu Q4 Preview — 1.179 ±10 em 5.543 amostras, outubro de 2026, $5,04/min
• Gemini Omni Flash — 1.178 ±7 em 12.327 amostras, maio de 2026, $6,00/min
• Dreamina Seedance 2.0 720p — 1.176 ±7 em 15.721 amostras, março de 2026, $9,07/min
• HiDream-O1-Video-1.0 — 1,175 ±10 em 3.231 amostras, agosto de 2026, $5,80/min
Leia esses intervalos como um grupo e o resumo honesto é que as posições de um a seis são, estatisticamente, uma única disputa com uma cauda muito longa de empates. A lacuna que não está dentro do ruído é a que existe entre o HiDream V1 e o restante do pelotão: o sétimo lugar, o Wan 3.0 da Alibaba, está em 1.164 — onze pontos e um intervalo inteiro abaixo do sexto, e quase trezentos votos à frente dele. A própria contagem de amostras do HiDream é a menor entre os seis primeiros, o que significa que seu intervalo está entre os mais amplos e sua posição é a menos definida.

Vale a pena levar adiante duas coisas que a Artificial Analysis afirma sobre o próprio ranking. Ele registra um único modelo como adicionado nos últimos 30 dias, e diz que o AA-Video-I2V v2.0 está chegando, alinhado à taxonomia do AA-Video-T2V v2.0, com 1080p de ponta a ponta. Isso importa para um modelo cujas promessas de lançamento são sobre 1080p e sobre condicionamento de texto e vídeo: o ranking em que ele estreia é explicitamente transitório, e o substituto altera o que é medido.
Onde o modelo não está
HiDream-O1-Video-1.0 aparece em exatamente um ranking de vídeo da Artificial Analysis. Está ausente do AA-Video-T2V v2.0, o ranking de texto para vídeo, e do ranking de edição de vídeo. Verifiquei ambos em 10 de outubro de 2026 — Wan 3.0 lidera texto para vídeo com 1.156 e edição de vídeo com 1.157, FLUX 3 é o sexto em texto para vídeo com 1.128, e HiDream não aparece em nenhum dos dois rankings.
Essa ausência é um sinal, e não uma desqualificação. Um modelo que apenas consome uma imagem de referência não pode ser inscrito em uma votação de texto para vídeo, e um que apenas anima não pode entrar em uma comparação de edição. A consequência prática é que não há medição independente do HiDream V1 fazendo texto para vídeo ou edição de vídeo, que são precisamente dois dos três modos de entrada anunciados em seu lançamento.
Duas datas, e os noventa dias entre elas
Há um senão na datação que qualquer pessoa que cite estes números deve tratar com cuidado. A Artificial Analysis regista a data de lançamento do HiDream-O1-Video-1.0 como 28 de agosto de 2026 e a data em que foi apresentado ao conselho como 10 de setembro de 2026. O próprio anúncio de lançamento da HiDream está datado de 17 de setembro. As referências de terceiros ao modelo que surgiram desde então descrevem-no como publicado em 15 de setembro e verificado em 17 de setembro.
O que esse padrão descreve é um modelo que chegou ao pipeline de avaliação antes de chegar ao comunicado de imprensa — o que é bastante normal, e significa que a data de lançamento no ranking é a mais antiga das duas, não um erro. Não descreve um modelo de março sendo reanunciado em agosto, que é o modo de falha com que este blog já se queimou antes. O HiDream-O1-Video-1.0 é genuinamente novo: a própria infraestrutura do ranking data a sua chegada dentro dos últimos dois meses.
O que o lançamento alega, e quem o afirma
A história da arquitetura vem da HiDream e não foi reproduzida de forma independente. Segundo o fornecedor: o HiDream-O1-Video-1.0 — HiDream V1, ou HD-V1 — modela conjuntamente texto, vídeo e áudio dentro de um único processo de geração, em vez de gerar imagem e adicionar som depois, de modo que movimento labial, som ambiente e ação física compartilhem uma linha do tempo. A duração é planejada, e não fixada, com o modelo escolhendo uma duração entre cinco e vinte segundos a partir do evento descrito. O comportamento físico — gravidade, colisão, inércia, deformação, decaimento da luz — é treinado como uma restrição de geração. O pós-treinamento usa aprendizado por reforço de difusão contra um modelo de recompensa multimodal alinhado à percepção humana. A geração ocorre em três etapas que a empresa descreve como planejamento primeiro, geração conjunta segundo, alinhamento terceiro.
A HiDream posiciona o modelo dentro de um portfólio de quatro famílias construído sobre uma base compartilhada de transformer unificado — HiDream-O1-Image, HiDream-O1-Video, HiDream-O1-World e HiDream-O1-Embodied — e cita colocações anteriores em benchmarks dos irmãos, incluindo o HiDream-O1-Image 1.5 em segundo lugar globalmente no ranking de texto para imagem da Artificial Analysis e o HiDream-O1-World em primeiro no WBench. Esses são os números do fornecedor para outros modelos da família, apresentados aqui sem confirmação independente. O material corporativo da empresa também descreve uma pilha tecnológica de modelo de fundação com "mais de 200 bilhões" de parâmetros; essa é uma declaração em nível de plataforma, não uma especificação do HiDream-O1-Video-1.0, e nenhuma fonte publica uma contagem de parâmetros para esse checkpoint. Nenhum peso aberto foi disponibilizado para ele.

O que você pode realmente chamar
Aqui a documentação é excecionalmente clara, e é mais restrita do que o anúncio. A HiDream disponibiliza o modelo através do HiHarness, a sua plataforma MaaS. O endpoint de vídeo é um POST para /api/maas/gw/v1/videos/generations com o identificador de modelo HiDream-O1-Video-1.0. A entrada necessária é exatamente uma imagem de referência — um URL público, ou Base64 sem o prefixo data-URL, entre 40 KB e 20 MB. O prompt de texto é opcional e o padrão é vazio. A geração é assíncrona: você envia, recebe um task_id, e faz polling em /api/maas/gw/v1/videos/generations/results até que result.status seja 1.
Três omissões nesse esquema merecem ser nomeadas explicitamente, porque cada uma delas é uma capacidade que a versão de lançamento anuncia.
• Vídeo de referência — o anúncio lista o vídeo entre as entradas do modelo; a requisição documentada não tem campo para ele.
• Resolução explícita — o anúncio afirma 1080p; a requisição documentada não tem seletor de resolução, e o resultado preserva a proporção da imagem de referência.
• Controle de áudio — o anúncio afirma contar com áudio nativo sincronizado; a requisição documentada não expõe nenhum parâmetro de entrada de áudio nem de geração de áudio.
O que o schema expõe é force_10s, um booleano que tem false como valor padrão. Se deixado como false, o modelo escolhe a duração. Se definido como true, você obtém dez segundos. Não há campo numérico de duração, portanto o intervalo anunciado de cinco a vinte segundos é uma afirmação em nível de modelo que a superfície de requisição pública não permite controlar, a não ser escolhendo um dos dois modos.

Há um detalhe de implementação nesse contrato de resposta que vai prejudicar uma integração escrita com base na correspondência de padrões de outras APIs de vídeo. result.status = 1 significa que todas as subtarefas alcançaram um estado terminal — não que a geração tenha sido bem-sucedida. Você ainda precisa ler sub_task_results[].task_status, em que 1 é sucesso, 3 é falha de geração e 4 é falha de revisão de segurança. Um cliente que trata o estado terminal como bem-sucedido vai entregar a você uma URL de vídeo que não existe.
O preço, em contexto
Nos registros da Artificial Analysis, a $5,80 por minuto, o HiDream V1 tem preço intermediário para sua faixa, em vez de ser barato. Dentro do top seis do ranking, ele é mais barato que o MiniMax H3 ($7,80) e o Dreamina Seedance 2.0 ($9,07) e mais caro que o MiniMax H3 Max e o Vidu Q4 Preview. Em comparação com os modelos com os quais será comparado com mais frequência, a diferença é maior: o Google Veo 3.1 custa $24,00 por minuto, o Kling 3.0 1080p Pro $20,16, o Alibaba Wan 2.7 $9,00 e o Wan 3.0 $12,00, enquanto o Grok Imagine Video 1.5 fica em $8,40.
Essas tarifas por minuto não são diretamente comparáveis, porque a resolução e o áudio de um minuto de saída são exatamente aquilo que a documentação da API deixa em aberto para este modelo. Trate o número como um ponto de partida para os seus próprios cálculos, e não como uma tabela de tarifas.
Experimentar uma via não comprovada sem apostar um pipeline nela
O argumento a favor da cautela aqui não é que o modelo seja ruim. É que uma superfície de serviço da era de pré-visualização — um tipo de entrada, um seletor de duração, uma flag terminal de dois estados — é o lugar errado para fixar em código um caminho de produção. O HiDream-O1-Video-1.0 não é um modelo que servimos na OrcaRouter hoje, então nada abaixo é uma afirmação sobre hospedá-lo: o lugar onde nosso produto realmente ajuda é do outro lado da decisão, onde você quer testar uma nova rota de vídeo contra uma já consolidada e poder abandoná-la a qualquer momento. Um endpoint compatível com OpenAI para mais de 200 modelos, failover automático para que uma rota que começa a falhar silenciosamente não seja a rota que você coloca em produção, preços de tabela dos provedores repassados sem acréscimo de margem, e uma DSL de roteamento que permite comparar dois modelos dentro de uma única requisição em vez de duas integrações. Nada disso exige especificamente o modelo da HiDream.
O que mudaria esta peça
Três desenvolvimentos mudariam o cenário, em ordem decrescente de probabilidade.
Primeiro, um contrato de serviço mais amplo. Se o HiHarness adicionar um campo de vídeo de referência, um seletor de resolução ou controles de áudio documentados, a lacuna entre o anúncio e a API diminui, e as alegações de 1080p e de texto para vídeo se tornam testáveis. Isso é uma mudança de documentação, não uma mudança de modelo, e pode chegar a qualquer semana.
Segundo, o painel AA-Video-I2V v2.0. A Artificial Analysis disse que ele está por vir, alinhado à taxonomia do T2V v2.0, com 1080p do começo ao fim. Um painel exclusivo em 1080p seria o primeiro ambiente independente no qual a alegação de resolução do HiDream V1 significa alguma coisa — e, se o modelo ainda não puder ser inscrito no painel de texto para vídeo sob a nova taxonomia, sua ausência ali se torna um achado substantivo em vez de um artefato das antigas categorias.
Terceiro, o tamanho da amostra. 3.231 votos são uma medição real e recente, a mais frágil entre os seis primeiros. O intervalo agora é de ±10 e vai se estreitar na direção para a qual os eleitores o empurrarem. Quem citar “sexto” como um fato consolidado deveria informar a data em que leu isso, porque o sexto lugar é um empate dentro de um empate entre seis.
A questão que vale a pena manter não é se o HiDream-O1-Video-1.0 é competitivo — no único ranking em que pode ser medido, ele claramente é, e a um preço por minuto defensável. É se o modelo que eventualmente chega a uma API ampla é aquele que foi anunciado. De acordo com a documentação atual, esses ainda são dois produtos diferentes.
O HiDream-O1-Video-1.0 não é uma das rotas que servimos hoje, mas o mesmo tipo de superfície está por trás de mais de 200 modelos, com os preços de tabela dos provedores repassados e sem nenhum acréscimo adicionado.
