Um cartão de título com o texto 'Utopai X estreia em #2 em Text-to-Video', com o subtítulo 'O pós-treino do MiniMax H3 feito por um estúdio de cinema - Elo 1.150, atrás apenas do Wan 3.0', com rótulos em formato de pílula que dizem 'Elo 1.150', '5.455 votos' e 'Sem API'.
Guides & Insights

Utopai X estreia em #2 em Texto para Vídeo: Por dentro do pós-treino do MiniMax H3 de um estúdio de cinema

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Utopai X é um modelo de vídeo que não existia na semana passada, não foi treinado do zero por um laboratório de fronteira e não é vendido por meio de uma API — e atualmente ocupa o segundo lugar no mundo em texto para vídeo. O modelo vem do Utopai Studios, um estúdio de cinema e televisão nativo de IA com sede em Mountain View, e é um pós-treino do MiniMax H3, o modelo de vídeo omni-modal da MiniMax. Na tabela de classificação de texto para vídeo com áudio da Artificial Analysis (a tabela que a Artificial Analysis agora chama de AA-Video-T2V v2.0, resultados de 29 de setembro de 2026), o Utopai X está em Elo 1.150 — atrás apenas do Wan 3.0 da Alibaba, com 1.157, e à frente do Dreamina Seedance 2.5 da ByteDance, com 1.143, e do modelo base MiniMax H3 (768p) do qual foi ajustado, com 1.138. Ele chegou em 30/09/2026, no mesmo dia em que a tabela de classificação foi atualizada, e está disponível em exatamente um lugar: dentro do PAI, a própria plataforma de produção da Utopai. Não há API pública, e a própria coluna de preços da Artificial Analysis para a linha diz "Nenhuma API disponível."

Essa combinação — em segundo lugar no mundo, um único canal de distribuição, nenhuma tabela de preços por segundo no sentido habitual — é a história completa. Um estúdio que faz filmes pegou o modelo de base de outra pessoa, ajustou-o com base no seu próprio critério de produção e furou a fila. Se isso é um resultado duradouro ou um instantâneo de uma arena totalmente nova é a pergunta que vale a pena fazer, e a resposta depende de ler o ranking, e não o comunicado de imprensa.

O que o quadro realmente mostra

Artificial Analysis classifica modelos de vídeo usando Elo derivado de votação cega de preferência humana em pares. Os votantes veem dois clipes gerados a partir do mesmo prompt e escolhem o que preferem, sem saber qual modelo produziu cada um. O ranking muda à medida que os votos se acumulam, e cada linha traz um intervalo de confiança que indica o quanto a posição pode se mover. Registrado em 2026-10-01, o ranking de texto para vídeo com áudio diz o seguinte:

A scoreboard card reading 'Utopai X (based on MiniMax H3) - the scoreboard', with rows for text-to-video rank #2 (board range #1-3), Elo 1,150 (+/-11), votes 5,455, parent model MiniMax H3 (768p), parent model Elo 1,138 (+/-10), and availability PAI subscribers only with no API.

• #1 Wan 3.0 — Elo 1.157 (±10), 6.391 amostras, lançado em ago. de 2026, $12,00/min.

• #2 Utopai X (baseado no MiniMax H3) — Elo 1,150 (±11), 5,455 amostras, lançado em setembro de 2026, sem API disponível.

• #3 Dreamina Seedance 2.5 — Elo 1.143 (±10), 6.375 amostras, lançado em jul. de 2026, US$ 34,12/min.

• Nº 4 MiniMax H3 (768p) — Elo 1.138 (±10), 6.343 amostras, lançado em julho de 2026, US$ 4,80/min.

• #5 FLUX 3 — Elo 1.129 (±10), 5.628 amostras, lançado em julho de 2026, $17,40/min.

Dois detalhes importam mais do que a ordem. Primeiro, a diferença entre o primeiro e o segundo é de sete pontos de Elo, e os dois intervalos se sobrepõem explicitamente — a Artificial Analysis apresenta o intervalo da Utopai X como 1.139 a 1.161, que contém a estimativa pontual de 1.157 do Wan 3.0. O placar rotula a classificação da Utopai X como um intervalo, #1–3, não como uma posição fixa. Segundo, a diferença entre a Utopai X e o modelo do qual ela foi pós-treinada é de doze pontos, com o mesmo problema de sobreposição, então "o pós-treino supera seu modelo pai" é verdadeiro em termos de direção e estatisticamente frágil. O próprio texto da Utopai é mais cuidadoso do que a maioria dos posts de lançamento sobre isso: nele, ela diz que o resultado de Elo "fornece uma avaliação independente de como as pessoas respondem ao material gerado por ele", o que é uma leitura justa do que uma arena de preferência humana mede, e não uma afirmação sobre produção cinematográfica.

A camada relatada pelo fornecedor, em contrapartida, é confiante. A Utopai descreve pontos fortes em reflexos e cáusticas — os padrões concentrados formados quando a luz reflete ou refrata — e em consistência espacial dentro de um clipe, ambos os quais são metas de desenvolvimento, e não resultados de benchmark. Essas são as palavras do fornecedor, não as medições da Artificial Analysis.

Um estúdio em vez de um laboratório

Utopai Studios desenvolve, financia e produz seus próprios projetos de cinema e televisão, e constrói seus modelos dentro desse negócio, em vez de ao lado dele. O mecanismo declarado é o feedback: as produções geram roteiros, designs de personagens e locações aprovados, planos de filmagem e takes sucessivos, e os diretores, diretores de fotografia e artistas do estúdio registram não apenas quais takes foram mantidos, mas por que os outros foram rejeitados. Esse registro torna-se sinal de treinamento e avaliação. A equipe de pesquisa também opera um sistema Elo interno que combina avaliação de preferência humana com votação automatizada por modelos de visão-linguagem, com artistas participando do lado humano.

É uma vantagem plausível e impossível de verificar de fora. O pós-treinamento pode deslocar um modelo de vídeo geral na direção das preferências de usuários de cinema e publicidade sem substituir o modelo de base — isso é consistente com a tabela de classificação. Quanto dos doze pontos de avanço em relação ao MiniMax H3 vem dos dados de treinamento, da otimização de preferências, do tratamento de prompts, das configurações de inferência ou de mudanças no momento de disponibilização não é algo que os materiais de lançamento digam. A Utopai não publicou nenhuma divulgação de dados de pós-treinamento, nenhum método de otimização, nenhum orçamento de computação e nenhuma avaliação de segurança. Pesquisadores independentes não conseguem reproduzir o ganho, e não há relatório técnico com o qual discutir.

A camada de distribuição é onde a tese do estúdio se torna concreta. O PAI — Production Assistive Intelligence — é a plataforma que a Utopai lançou junto com o modelo, e ele mantém o contexto do projeto: a decomposição do roteiro em cenas e planos, uma biblioteca de produção de personagens, locações e objetos, histórico de versões, aprovações compartilhadas para equipes corporativas e uma linha do tempo que exporta para o Premiere Pro ou o DaVinci Resolve. O argumento é que gerar um clipe é a parte barata, e manter um plano consistente com o restante do filme é a parte cara. O Utopai X gera imagens dentro desse espaço de trabalho "quando selecionado pelo cineasta", na formulação da própria empresa — o modelo é uma opção entre vários modelos de imagem, vídeo e áudio disponíveis no PAI, não a única.

Quanto custa o Utopai X e como lê-lo

The Artificial Analysis Video Arena text-to-video leaderboard, last updated September 29, 2026, listing Wan 3.0 at Elo 1,157, Utopai X at 1,150, Dreamina Seedance 2.5 at 1,143, MiniMax H3 (768p) at 1,138 and FLUX 3 at 1,129, each with sample counts, release months and price per minute.

O PAI é vendido como uma assinatura com créditos, não como uma API por segundo. Os planos publicados são US$ 15/mês por 1.000 créditos, US$ 49/mês por 3.500 créditos, US$ 129/mês por 10.000 créditos e US$ 379/mês por 35.000 créditos, com cobrança anual gerando desconto de cerca de 8 a 10 por cento, além de recargas de US$ 15 por 1.000 créditos. O Utopai X tem sua própria linha na tabela de créditos do PAI: 93 créditos por segundo de vídeo em 1080p. Os outros modelos de vídeo da plataforma ficam mais abaixo — 50 créditos por segundo em 1080p no plano padrão e 76 no plano pro.

Converter isso para um valor por minuto é uma conta que qualquer pessoa consegue fazer e que quase ninguém deveria citar como preço. A 93 créditos por segundo, um minuto de resultado do Utopai X custa 5.580 créditos. O plano de entrada de US$ 15 compra 1.000 créditos por mês, o que equivale a cerca de 10,8 segundos de filmagem se todos os créditos fossem destinados a este modelo. Escalando linearmente a tarifa de créditos do plano de entrada, o custo implícito é da ordem de mais de US$ 80 por minuto de vídeo gerado. Esse número só vale a pena ser declarado com as ressalvas anexadas: ele pressupõe uma conversão estritamente linear de créditos em dólares, ignora que os créditos são agrupados entre todos os modelos do PAI e expiram ou ficam sem uso, ignora descontos anuais e pacotes de recarga, e não diz nada sobre limites de resolução ou duração, que a Utopai não especificou separadamente para o Utopai X. É uma ordem de grandeza útil, não uma tabela de preços.

Para efeito de comparação, no mesmo painel do Artificial Analysis, o MiniMax H3 (768p) está listado a US$ 4,80 por minuto e o Wan 3.0 a US$ 12,00, enquanto o Dreamina Seedance 2.5 está listado a US$ 34,12. Esses são feeds automatizados de preços das próprias APIs dos fornecedores, não estimativas derivadas de assinatura, então a comparação é, no máximo, direcional — mas a direção é clara: no nível de entrada, a geração dentro de uma plataforma de estúdio baseada em créditos não compete com o preço por segundo da API. O que um comprador está pagando é pelo ambiente de trabalho em torno do modelo, não pelo segundo marginal do modelo.

A parte que não é pública

Vale a pena nomear três lacunas, porque cada uma delas bloqueia uma decisão diferente.

• Sem API e sem caminho de integração.A Utopai X atualmente não tem uma rota de integração direta. Uma equipe de produto que queira chamá-lo em um pipeline não consegue. A Artificial Analysis o lista como "Nenhuma API disponível", e os materiais de lançamento não descrevem nenhum acesso para desenvolvedores.

• Sem especificação separada. O MiniMax H3 gera clipes de 4 a 15 segundos em até 2K com áudio estéreo nativo. A Utopai não publicou sua própria duração máxima ou resolução para o Utopai X, o que significa que o valor de 1080p na tabela de créditos é a única declaração de resolução disponível e a duração do clipe é desconhecida.

• Nenhuma avaliação além da arena. O resultado Elo é uma medição independente da preferência humana em clipes curtos. Não é uma medida de se o material atende a uma tomada pretendida, entra numa edição ou sobrevive a uma revisão. A própria publicação da Utopai reconhece isso diretamente — “a avaliação também continua depois que um clipe é gerado” — o que é um enquadramento incomumente honesto para um lançamento e também um alerta sobre até onde o ranking chega.

Do lado do estúdio, há mais histórico a destacar. A Utopai lançou o PAI 2.0 em 2 de junho de 2026 e disse na época que a plataforma havia alcançado US$ 11 milhões em receita recorrente anual menos de dois meses após sua estreia em abril, impulsionada por licenças comerciais vendidas a produtoras. A empresa afirma que tem três filmes para cinema e duas séries programadas para 2027 e está aplicando o PAI e o Utopai X às suas próprias produções, incluindo The Most Serious Fart, uma longa-metragem de animação escrita e dirigida por Mike Bender. Esses são os números do estúdio e o cronograma do estúdio, e são a razão pela qual vale a pena escrever sobre um pós-treino sem API: o modelo está sendo usado para fazer filmes que a empresa pretende lançar, o que é um teste mais difícil do que um ranking.

Onde o modelo base ainda é a escolha prática

The OrcaRouter model page for MiniMax H3, showing the 0% markup badge, a description of omni-modal 4-to-15-second video generation at up to 2K with native stereo audio, a $0.08 per second price panel, a performance panel with p50 latency, and a release date of 7/31/2026.

Para quem realmente precisa gerar vídeo esta semana, a metade roteável desta família é o modelo base. MiniMax H3 está disponível no OrcaRouter pelo preço de tabela do provedor — US$ 0,08 por segundo em 768p, o que equivale a US$ 4,80 por minuto, o mesmo valor que a Artificial Analysis lista — com 0% de margem, então qualquer redução de preço do fornecedor chega no mesmo dia, e não depois de um ciclo de reprecificação, e failover automático entre provedores, para que uma indisponibilidade de um único endpoint não derrube seu pipeline. Ele aceita referências de texto, imagem, vídeo e áudio como um único contexto unificado e retorna clipes de 4 a 15 segundos em 768P ou 2K com áudio estéreo nativo, cobrado por segundo de saída gerada.

O Utopai X não está roteado, e nada neste artigo deve ser lido como uma alegação de que está. O que o modelo base oferece é uma forma de testar as características estéticas e de movimento da família H3 — a mesma base da qual a Utopai partiu, antes de qualquer pós-treinamento que tenha aplicado — por meio de uma única chave de API, ao lado de mais de 200 outros modelos, sem uma assinatura do PAI. Se o Utopai X algum dia chegar a um provedor roteável, ele apareceria pelo preço de tabela no mesmo dia, com a tarifa do fornecedor repassada em vez de majorada. Até então, a divisão honesta é: Utopai X para estúdios dentro do PAI, MiniMax H3 para todos que estão montando um pipeline.

O que decide se isto foi uma estreia ou um momento

Três coisas merecem atenção no próximo trimestre. Primeira: se a diferença de sete pontos no topo resiste a mais alguns milhares de votos — os intervalos se sobrepõem hoje, e um ranking que se reordena quando chega um novo lote de comparações não decidiu nada. Segunda: se a Utopai abre sequer algum acesso para desenvolvedores; um modelo classificado como segundo do mundo que só um assinante da PAI pode invocar é uma decisão de produto, e é reversível. Terceira: se a concorrência se move na direção oposta. O Wan 3.0 já gera até 30 segundos em 1080p com áudio nativo e aceita texto, imagens, vídeo, áudio, documentos e páginas da web como referências, e lidera o ranking em iluminação, materiais e controle de câmera no recorte por caso de uso. Um ganho de doze pontos no pós-treinamento em relação a um modelo base é indicativo; manter o segundo lugar contra um modelo fundacional com um escopo de entradas mais amplo é um trabalho diferente.

O que é genuinamente novo aqui não é o Elo. É a forma da alegação: um estúdio com um pipeline de produção argumenta que ser dono das decisões por trás das filmagens — qual take, qual referência, qual revisão — vale mais do que ser dono da execução de pré-treinamento. Essa alegação é testável, e a bilheteria da safra de 2027 é um dos testes.