Tarjeta de título principal para 'Tavus Griffin vs MiniMax H3' con el subtítulo 'Un modelo conversacional dúplex se encuentra con un generador de video ya lanzado', sobre cuatro chips: Tavus Griffin vista previa de investigación, solo para probadores; MiniMax H3 pesos abiertos, lanzado; MiniMax H3 $0.08/s a 768P; Griffin: sin API, sin precio.
Guides & Insights

Tavus Griffin vs MiniMax H3: un modelo conversacional dúplex se encuentra con un generador de video ya lanzado

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tavus Griffin y MiniMax H3 ponen a un humano en movimiento y hablando en pantalla, y más allá de esa primera impresión, apenas si pertenecen a la misma categoría de producto.Human Interaction Model — un sistema de video a video creado para mantener una conversación bidireccional en tiempo real, anunciado por Tavus en octubre de 2026 y actualmente limitado a un grupo selecto de primeros probadores. MiniMax H3 es un generador de video omnimodal: le entregas un prompt junto con referencias opcionales de imagen, video y audio, y te devuelve un clip terminado. Uno se está evaluando a puertas cerradas; el otro lleva meses disponible para descargar, licenciar y facturar. Esa diferencia —no la resolución ni la tasa de fotogramas— es lo que decide cuál de los dos pertenece a tu stack.

Lo que realmente es cada uno

Griffin es el intento de Tavus de construir un modelo que se comporte como un participante en lugar de un renderizador. La empresa lo describe como el primer Human Interaction Model, y la arquitectura que publicó divide la tarea en dos: Continuous Conversational Modeling, que decide qué debería estar haciendo la persona en cada momento, y Audio-Visual Generation, que transmite en streaming el habla y el rostro correspondientes. Lo crucial es que es dúplex completo: observa y escucha mientras habla, así que puede recibir interrupciones, reaccionar en medio de una intervención y no espera una señal limpia de fin de turno antes de responder. El propio enfoque de Tavus es que los sistemas anteriores aprendieron a generar rostros; Griffin se construyó para aprender comportamiento conversacional de las personas.

MiniMax H3 es la generación Hailuo 3, lanzada el 31 de julio de 2026 y publicada como código abierto el 3 de agosto de 2026 bajo la Licencia Comunitaria de MiniMax H3, con las variantes H3-Base-FL2VA y H3-Base-Ref2VA publicadas en abierto. Lee referencias de texto, imagen, vídeo y audio como un único contexto unificado y devuelve un clip de 4 a 15 segundos en 768P o 2K con audio estéreo nativo, generado mediante una canalización de tres etapas (H3-Context-IR, luego H3-Base a 768p y después H3-Regenerate-2K). Es un generador con una superficie de entrada inusualmente amplia y una licencia genuinamente permisiva: todo lo que Griffin actualmente no es.

Las especificaciones, lado a lado

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

¿Por qué "dúplex" es la palabra interesante?

Todos los generadores de vídeo, H3 incluido, se juzgan por cómo se ve un clip una vez terminado. A Griffin se le juzga por algo que un clip no puede mostrar: lo que ocurre en los 200 milisegundos posteriores a que lo interrumpas. Ese es el problema al que apunta el planteamiento del Human Interaction Model, y es la razón por la que las cifras destacadas de Tavus son conductuales y no visuales.

La cifra más citada es que el 48 % de las personas creyó que Griffin era una persona real después de una videollamada de un minuto —26 de 54 participantes—, frente al 2,4 % del stack anterior de Tavus, formado por Phoenix-4.5, Sparrow-2 y Raven-1, que logró 1 de 41. Tavus también informa de que las personas que no quedaron convencidas tendían a sospechar en los primeros 20 segundos, lo cual es un detalle más útil que el titular: significa que la ilusión o se sostiene al principio o se desmorona al principio.

El segundo conjunto de cifras proviene del benchmark VideoFDB de NVIDIA, puntuado en septiembre de 2026, donde Tavus afirma que Griffin quedó en primer lugar en una prueba independiente de IA cara a cara. En el lado de la generación, Griffin obtuvo 3.83 frente a 2.80 de la línea base más fuerte reportada (una configuración de Gemini 2.5 más Anam), con una referencia humana de 3.92 y una tasa de objetivos de tarea del 62.8 %. En percepción, obtuvo 3.73 frente a 3.44 de MiniCPM-o 4.5, 3.17 de Gemini 2.5 Flash Native y 2.97 de una configuración de OpenAI gpt-realtime solo de audio, frente a una referencia humana de 4.20 y una tasa de objetivos de tarea del 73.8 %, en quince modelos evaluados. Tavus también afirma que Griffin lidera por un 37 % sobre el siguiente mejor sistema a la hora de reaccionar en el momento. Estas son cifras reportadas por el proveedor que se basan en un benchmark creado por NVIDIA, y deben leerse como tales, pero los puntos de comparación humana son los que vale la pena conservar, porque un 3.83 frente a una puntuación humana de 3.92 es una brecha mucho menor que la que históricamente ha mostrado la generación de video.

Lo que puedes comprar hoy

Aquí los dos modelos dejan de ser comparables en absoluto.

MiniMax H3 es un producto. Está alojado, tiene un precio por segundo de salida generada, y sus variantes abiertas están en un hub de modelos esperando a que las descarguen. Si quieres un clip de quince segundos, 2K y con audio estéreo de algo que no existe, puedes tenerlo esta tarde, y puedes ejecutar los pesos tú mismo si prefieres no alquilarlos.

Tavus Griffin no es un producto. Tavus es explícito en el artículo sobre Griffin: Griffin-Lite, la vista previa de investigación, está disponible hoy para un grupo selecto de probadores tempranos; le seguirá un lanzamiento más amplio de un modelo más potente; y Griffin aún no está en la plataforma de Tavus y solo llegará cuando la empresa haya resuelto cómo lanzarlo de manera segura. Eso es una cantidad inusual de franqueza por parte de un proveedor sobre su propio resultado más llamativo, y es importante para la planificación: no se puede incluir a Griffin en una hoja de ruta de producto como dependencia, ni se le puede poner un precio, porque no existe.

Así que la pregunta honesta de planificación no es «cuál es mejor», sino «cuál existe en la capa que necesito».

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

Dónde encaja OrcaRouter

MiniMax H3 está en nuestro catálogo. La página del modelo se encuentra en minimax/minimax-h3, y se factura tal como lo factura el proveedor: $0.08 por segundo de salida generada en 768P y $0.13 por segundo en 2K. OrcaRouter transfiere los precios de lista del proveedor con un 0 % de margen, así que un cambio de precio de MiniMax aparece en nuestra tarjeta el mismo día en que se anuncia, y no en el siguiente ciclo de facturación. Griffin no está en el catálogo y no lo estará hasta que Tavus lo lance a los clientes; no alojamos un modelo que no podamos servir, y una vista previa de investigación limitada a probadores seleccionados no es algo que un enrutador pueda enrutar.

La consecuencia práctica es que uno de estos dos modelos está a una sola línea de código de tu aplicación y el otro es un artículo de investigación con un número de teléfono. Si ya enrutas varios modelos de video y de lenguaje, la facturación por segundo de H3 también hace que sea el tipo de ruta que vale la pena poner detrás de conmutación por error automática: una solicitud que llega a un proveedor saturado se reintenta contra uno que funciona correctamente en lugar de mostrar un tiempo de espera agotado, y un DSL de enrutamiento te permite fijar trabajos en 2K a un proveedor específico mientras dejas que los borradores en 768P caigan donde la capacidad sea más barata. La fusión de modelos es la otra palanca que vale la pena mencionar aquí — el precio por segundo de H3 es lo suficientemente bajo como para que gastar un modelo de texto en reescribir y recortar un prompt antes de la generación suela ser más barato que los segundos desperdiciados por un primer intento fallido.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Donde la comparación podría invertirse

Tres cosas cambiarían esta comparación, y solo tres.

Primero, si Tavus pone Griffin en una API comercial con una tarifa publicada, todo el planteamiento de «conversación versus clip» se convierte en una auténtica decisión de compra y no en una decisión de planificación, y la cifra del 48 % de cara a cara empieza a competir directamente con la calidad del resultado generativo. Segundo, si la propuesta en tiempo real de H3 mejora —y MiniMax ha estado lanzando versiones de forma agresiva—, un generador por segundo capaz de transmitir en streaming restaría fuerza a la ventaja principal de Griffin. Tercero, si NVIDIA u otro actor neutral vuelve a ejecutar VideoFDB incluyendo a H3 o a su sucesor, la afirmación de que Griffin es el primero en IA cara a cara deja de ser infalsable. Tavus dice que prevé lanzar Griffin muy pronto, una vez resueltas sus preocupaciones de seguridad; esa frase es toda la cronología.

En resumen

MiniMax H3 y Tavus Griffin no son rivales ahora mismo, porque solo uno de ellos se puede comprar. H3 es un generador omnimodal ya lanzado, de pesos abiertos, que se cobra por segundo, con un precio publicado y una ventana de salida de 4 a 15 segundos; Griffin es un modelo conversacional dúplex con las mejores cifras cara a cara que se hayan publicado, sin API, sin precio y con una declaración explícita de su propio proveedor de que los clientes todavía no pueden usarlo. Si hoy necesitas generación de video, H3 es la respuesta y se puede medir en centavos por segundo. Si necesitas una cara en tiempo real que se pueda interrumpir, presta atención a Tavus, pero construye primero el resto del producto, porque la fecha de lanzamiento es una frase, no una fecha.