Una tarjeta de título que dice «Utopai X debuta en el nº 2 en texto a vídeo», con el subtítulo «El post-entrenamiento de MiniMax H3 de un estudio de cine - Elo 1.150, solo por detrás de Wan 3.0», con etiquetas tipo píldora que dicen «Elo 1.150», «5.455 votos» y «Sin API».
Guides & Insights

Utopai X debuta en el n.º 2 en texto a video: Dentro del post-entrenamiento de MiniMax H3 por parte de un estudio de cine

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Utopai X es un modelo de vídeo que no existía la semana pasada, que no fue entrenado desde cero por ningún laboratorio de frontera y que no se vende a través de una API, y actualmente ocupa el segundo puesto mundial en texto a vídeo. El modelo procede de Utopai Studios, un estudio de cine y televisión nativo de IA con sede en Mountain View, y es un post-entrenamiento de MiniMax H3, el modelo de vídeo omni-modal de MiniMax. En la tabla de clasificación de texto a vídeo con audio de Artificial Analysis (la tabla que Artificial Analysis ahora denomina AA-Video-T2V v2.0, resultados del 29 de septiembre de 2026), Utopai X se sitúa en 1.150 de Elo, solo por detrás de la de Aliba​sba, Wan 3.0, con 1.157, y por delante del Dreamina Seedance 2.5 de ByteDance, con 1.143, y del MiniMax H3 (768p) modelo base a partir del cual se ajustó, con 1.138. Llegó el 30/09/2026, el mismo día en que se actualizó la clasificación, y está disponible en exactamente un lugar: dentro de PAI, la propia plataforma de producción de Utopai. No hay ninguna API pública, y la propia columna de precios de Artificial Analysis para esa fila dice “No hay API disponible”.

Esa combinación —segundo en el mundo, un solo canal de distribución, sin una tarifa por segundo en el sentido habitual— lo dice todo. Un estudio que hace películas tomó el modelo fundacional de otro, lo ajustó con su propio criterio de producción y se saltó la cola. Si eso es un resultado duradero o una instantánea de un ámbito completamente nuevo es la pregunta que vale la pena hacerse, y la respuesta depende de leer la tabla de clasificación en lugar del comunicado de prensa.

Lo que el panel muestra realmente

Artificial Analysis clasifica los modelos de vídeo mediante Elo derivado de votaciones ciegas de preferencia por pares realizadas por personas. Los votantes ven dos clips generados a partir del mismo prompt y eligen el que prefieren, sin saber qué modelo produjo cada uno. La tabla cambia a medida que se acumulan los votos, y cada fila incluye un intervalo de confianza que indica cuánto se permite que se mueva la posición. Capturada el 2026-10-01, la tabla de texto a vídeo con audio dice:

A scoreboard card reading 'Utopai X (based on MiniMax H3) - the scoreboard', with rows for text-to-video rank #2 (board range #1-3), Elo 1,150 (+/-11), votes 5,455, parent model MiniMax H3 (768p), parent model Elo 1,138 (+/-10), and availability PAI subscribers only with no API.

• #1 Wan 3.0 — Elo 1.157 (±10), 6.391 muestras, lanzado en agosto de 2026, 12,00 $/min.

• #2 Utopai X (basado en MiniMax H3) — Elo 1.150 (±11), 5.455 muestras, publicado en sep 2026, sin API disponible.

• #3 Dreamina Seedance 2.5 — Elo 1.143 (±10), 6.375 muestras, lanzado en jul. 2026, $34,12/min.

• #4 MiniMax H3 (768p) — Elo 1.138 (±10), 6.343 muestras, publicado en jul 2026, 4,80 $/min.

• #5 FLUX 3 — Elo 1.129 (±10), 5.628 muestras, lanzado en jul 2026, 17,40 $/min.

Dos detalles importan más que el orden. Primero, la diferencia entre el primero y el segundo es de siete puntos Elo, y los dos intervalos se solapan explícitamente: Artificial Analysis muestra el rango de Utopai X como 1.139 a 1.161, que contiene la estimación puntual de Wan 3.0 de 1.157. El tablero etiqueta el puesto de Utopai X como un rango, #1–3, no como una posición fija. Segundo, la diferencia entre Utopai X y el modelo del que se obtuvo mediante postentrenamiento es de doce puntos, con el mismo problema de solapamiento, así que «el postentrenamiento supera a su modelo padre» es cierto en cuanto a la dirección y poco sólido estadísticamente. El propio artículo de Utopai es más cuidadoso que la mayoría de las publicaciones de lanzamiento al respecto: dice que el resultado Elo «proporciona una evaluación independiente de cómo responde la gente a su metraje generado», lo cual es una lectura justa de lo que mide una arena de preferencia humana y no una afirmación sobre la realización cinematográfica.

La capa reportada por el proveedor, en cambio, se muestra confiada. Utopai describe fortalezas en reflejos y cáusticas —los patrones concentrados que se forman cuando la luz se refleja o se refracta— y en la consistencia espacial dentro de un clip, ambas cosas son objetivos de desarrollo más que resultados de benchmark. Esas son palabras del proveedor, no mediciones de Artificial Analysis.

Un estudio en lugar de un laboratorio

Utopai Studios desarrolla, financia y produce sus propios proyectos de cine y televisión, y construye sus modelos dentro de ese negocio en lugar de al lado de él. El mecanismo declarado es la retroalimentación: las producciones generan guiones, diseños de personajes y localizaciones aprobados, planes de rodaje y tomas sucesivas, y los directores, directores de fotografía y artistas del estudio registran no solo qué tomas se conservaron, sino por qué se rechazaron las demás. Ese registro se convierte en señal de entrenamiento y evaluación. El equipo de investigación también gestiona un sistema Elo interno que combina la evaluación de preferencias humanas con la votación automatizada de modelos de visión-lenguaje, con artistas participando en el lado humano.

Es una ventaja plausible y no verificable desde fuera. El post-entrenamiento puede orientar un modelo de video general hacia las preferencias de los usuarios de cine y publicidad sin sustituir el modelo fundacional —eso es coherente con la tabla de clasificación. Cuánto de la mejora de doce puntos sobre MiniMax H3 procede de los datos de entrenamiento, la optimización de preferencias, el manejo de prompts, los ajustes de inferencia o los cambios en la fase de servicio no es algo que digan los materiales de lanzamiento. Utopai no ha publicado ninguna divulgación de datos de post-entrenamiento, ningún método de optimización, ningún presupuesto de cómputo ni ninguna evaluación de seguridad. Los investigadores independientes no pueden reproducir la mejora, y no hay ningún informe técnico con el que discutir.

La capa de distribución es donde la tesis del estudio se vuelve concreta. PAI —Production Assistive Intelligence— es la plataforma que Utopai lanzó junto con el modelo, y contiene el contexto del proyecto: desglose del guion en escenas y planos, una biblioteca de producción de personajes, localizaciones y objetos, historial de versiones, aprobaciones compartidas para equipos empresariales y una línea de tiempo que se exporta a Premiere Pro o DaVinci Resolve. El argumento de venta es que generar un clip es la parte barata y mantener la coherencia de un plano con el resto de la película es la parte cara. Utopai X genera metraje dentro de ese espacio de trabajo "cuando el cineasta lo selecciona", según la propia formulación de la empresa: el modelo es una opción entre varios modelos de imagen, vídeo y audio disponibles en PAI, no la única.

Cuánto cuesta Utopai X y cómo interpretarlo

The Artificial Analysis Video Arena text-to-video leaderboard, last updated September 29, 2026, listing Wan 3.0 at Elo 1,157, Utopai X at 1,150, Dreamina Seedance 2.5 at 1,143, MiniMax H3 (768p) at 1,138 and FLUX 3 at 1,129, each with sample counts, release months and price per minute.

PAI se vende como una suscripción con créditos, no como una API por segundo. Los niveles publicados son 15 USD/mes por 1.000 créditos, 49 USD/mes por 3.500 créditos, 129 USD/mes por 10.000 créditos y 379 USD/mes por 35.000 créditos, con la facturación anual aplicando un descuento de aproximadamente entre el 8 y el 10 por ciento, más recargas de 15 USD por 1.000 créditos. Utopai X tiene su propia línea en la tabla de créditos de PAI: 93 créditos por segundo de video a 1080p. Los otros modelos de video de la plataforma están más bajos: 50 créditos por segundo a 1080p en el nivel estándar y 76 en el nivel pro.

Convertir eso a una cifra por minuto es una aritmética que cualquiera puede hacer y que casi nadie debería citar como precio. A 93 créditos por segundo, un minuto de salida de Utopai X cuesta 5.580 créditos. El plan de entrada de $15 compra 1.000 créditos al mes, lo que equivale aproximadamente a 10,8 segundos de metraje si todos los créditos se destinaran a este modelo. Si se escala linealmente la tarifa de créditos del plan de entrada, el costo implícito es del orden de más de $80 por minuto de video generado. Ese número solo vale la pena mencionarlo con sus salvedades: supone una conversión estrictamente lineal de créditos a dólares, ignora que los créditos se agrupan entre todos los modelos de PAI y que caducan o se quedan sin usar, ignora los descuentos anuales y los paquetes de recarga, y no dice nada sobre los límites de resolución o duración, que Utopai no ha especificado por separado para Utopai X. Es un orden de magnitud útil, no un tarifario.

A modo de comparación, en el mismo tablero de Artificial Analysis, MiniMax H3 (768p) figura a $4.80 por minuto y Wan 3.0 a $12.00, mientras que Dreamina Seedance 2.5 figura a $34.12. Esos son feeds de precios automatizados procedentes de las propias API de los proveedores, no estimaciones derivadas de suscripciones, así que la comparación es, en el mejor de los casos, orientativa — pero la dirección es clara: en el nivel de entrada, la generación dentro de una plataforma de estudio basada en créditos no compite con los precios de API por segundo. Lo que un comprador paga es el espacio de trabajo en torno al modelo, no el segundo marginal del modelo.

La parte que no es pública

Merece la pena nombrar tres brechas, porque cada una bloquea una decisión diferente.

• Sin API y sin vía de integración. Actualmente, Utopai X no tiene ninguna ruta de integración directa. Un equipo de producto que quiera invocarlo dentro de un pipeline no puede hacerlo. Artificial Analysis lo clasifica como "No API available", y los materiales de lanzamiento no describen ningún acceso para desarrolladores.

• Sin especificación independiente. MiniMax H3 genera clips de 4 a 15 segundos a hasta 2K con audio estéreo nativo. Utopai no ha publicado su propia duración máxima ni resolución para Utopai X, lo que significa que la cifra de 1080p en la tabla de créditos es la única declaración de resolución disponible y la duración del clip es desconocida.

• Ninguna evaluación más allá de la arena. El resultado Elo es una medición independiente de la preferencia humana sobre clips cortos. No es una medida de si el metraje sirve para una toma prevista, encaja en un montaje o sobrevive a una revisión. El propio post de Utopai lo reconoce directamente —«la evaluación también continúa después de que se genera un clip»—, lo que supone un planteamiento inusualmente honesto para un lanzamiento y también una advertencia sobre hasta dónde llega el ranking.

Del lado del estudio hay más historia que señalar. Utopai lanzó PAI 2.0 el 2 de junio de 2026 y dijo en ese momento que la plataforma había alcanzado los 11 millones de dólares en ingresos anuales recurrentes menos de dos meses después de su debut en abril, impulsada por licencias comerciales vendidas a productoras. La compañía afirma que tiene tres películas para cines y dos series programadas para 2027 y que está aplicando PAI y Utopai X a sus propias producciones, incluyendo El pedo más serio, un largometraje animado escrito y dirigido por Mike Bender. Esas son las cifras del estudio y el calendario del estudio, y son la razón por la que vale la pena escribir siquiera sobre un modelo post-entrenado sin API: el modelo se está usando para hacer películas que la compañía pretende estrenar, lo que es una prueba más difícil que una tabla de clasificación.

Donde el modelo base sigue siendo la opción práctica

The OrcaRouter model page for MiniMax H3, showing the 0% markup badge, a description of omni-modal 4-to-15-second video generation at up to 2K with native stereo audio, a $0.08 per second price panel, a performance panel with p50 latency, and a release date of 7/31/2026.

Para cualquiera que realmente necesite generar video esta semana, la mitad enrutable de esta familia es el modelo base. MiniMax H3 está disponible en OrcaRouter al precio de lista del proveedor — 0,08 $ por segundo a 768p, lo que equivale a 4,80 $ por minuto, la misma cifra que figura en Artificial Analysis — con un 0 % de recargo, de modo que cualquier rebaja de precio de un proveedor se aplica el mismo día en lugar de después de un ciclo de reajuste de precios, y con conmutación por error automática entre proveedores, de modo que la caída de un solo endpoint no tumbe tu pipeline. Acepta referencias de texto, imagen, video y audio como un único contexto unificado y devuelve clips de 4 a 15 segundos en 768P o 2K con audio estéreo nativo, facturados por segundo de salida generada.

Utopai X no está enrutado, y nada en este artículo debe interpretarse como una afirmación de que lo esté. Lo que el modelo base te ofrece es una forma de probar las características estéticas y de movimiento de la familia H3 —la misma base desde la que partió Utopai, antes de cualquier post-entrenamiento que haya aplicado— a través de una única clave de API junto con más de otros 200 modelos, sin una suscripción a PAI. Si Utopai X llegara alguna vez a un proveedor enrutable, aparecería a precio de lista ese mismo día, con la tarifa del proveedor repercutida en lugar de aumentada. Hasta entonces, la división honesta es: Utopai X para los estudios dentro de PAI, MiniMax H3 para todos los que estén armando un pipeline.

¿Qué determina si esto fue un debut o un momento?

Hay tres cosas que vale la pena observar durante el próximo trimestre. Primero, si la diferencia de siete puntos en la cima sobrevive a otros cuantos miles de votos —hoy los intervalos se superponen, y una clasificación que se reorganiza cuando llega una nueva tanda de comparaciones no ha resuelto nada. Segundo, si Utopai abre siquiera algún tipo de acceso para desarrolladores; un modelo clasificado segundo en el mundo al que solo puede invocar un suscriptor de PAI es una decisión de producto, y es reversible. Tercero, si la competencia se mueve en la dirección opuesta. Wan 3.0 ya genera hasta 30 segundos en 1080p con audio nativo y acepta texto, imágenes, video, audio, documentos y páginas web como referencias, y lidera la clasificación en iluminación, materiales y control de cámara en el desglose por casos de uso. Una ganancia de doce puntos tras el postentrenamiento sobre un modelo base resulta sugerente; mantener el segundo puesto frente a un modelo fundacional con un espectro de entradas más amplio es otra tarea.

Lo que es genuinamente nuevo aquí no es el Elo. Es la forma de la afirmación: un estudio con una cadena de producción sostiene que poseer las decisiones que hay detrás del material — qué toma, qué referencia, qué revisión — vale más que poseer la ejecución de preentrenamiento. Ese argumento es verificable, y la taquilla de la cartelera de 2027 es una de las pruebas.