
Tavus Griffin vs HeyGen Video 1: separados por treinta y seis horas, y solo uno se puede comprar
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos lanzamientos llegaron con menos de treinta y seis horas de diferencia entre sí en el mismo rincón del mercado, y el calendario es lo más interesante del emparejamiento. HeyGen Video se puso en marcha el 30 de septiembre de 2026 a 0,01 $ por segundo durante octubre, ajustado a partir de MiniMax H3 y distribuido bajo el identificador heygen-video-1. Tavus Griffin se anunció el 1 de octubre de 2026 con un estudio en vivo cara a cara en el que 26 de 54 participantes creyeron que su interlocutor era una persona real, y está disponible solo para probadores de confianza seleccionados mediante un formulario de solicitud, sin identificador, sin endpoint y sin precio. Ambos tienen que ver con generar un ser humano convincente. La razón honesta para comparar Tavus Griffin y HeyGen Video 1 no es que un comprador fuera a elegir entre ellos —hoy solo uno de ellos se puede comprar—, sino que la diferencia explica para qué se construyó cada uno y cuánto vale realmente un segundo de humano generado.
Uno vende un clip, el otro vende una conversación
HeyGen Video es un modelo de vídeo de propósito general que resulta ser excepcionalmente bueno con las personas. Recibe un prompt, o un prompt más una imagen, o un prompt más hasta nueve imágenes de referencia, tres vídeos de referencia y tres clips de audio de referencia, y devuelve un clip de entre 5 y 15 segundos de duración a 480p o 768p, 24 fps, con audio AAC a 32 kHz estéreo que incluye diálogo, ambiente y efectos generados. Tres modos cubren el condicionamiento — text_to_video, image_to_video y reference_to_video, que es el predeterminado — y el orden de la lista se convierte en la etiqueta a la que te diriges en el prompt, por lo que la primera entrada de reference_images es <Picture 1>. Los campos desconocidos de la solicitud se rechazan en lugar de ignorarse, y una semilla es un entero sin signo de 32 bits que hace que una toma sea repetible cuando la mantienes y cambias una cláusula a la vez. Es una herramienta de producción con una envolvente determinista.
Griffin invierte casi todas esas propiedades. Genera 720p en fragmentos de 320 ms a 25 fps a partir de una única fotografía de referencia y reproduce cada fragmento a medida que se decodifica, por lo que no hay una longitud de clip que especificar ni un archivo que devolver. Un motor de modelado conversacional continuo ingiere audio y vídeo y reevalúa el intercambio a intervalos inferiores al segundo, eligiendo si permanecer en silencio, hacer una señal, retroalimentar o tomar el turno, y sus controles expresivos impulsan un generador de voz en streaming y un generador de vídeo en streaming en paralelo. Una decisión tomada a mitad de frase se refleja en la voz y el rostro dentro del mismo mini-turno. No escribes un prompt; hablas con él, y responde a una pausa, a una mirada hacia otro lado o a una interrupción.
Por eso los dos no son sustitutos aunque ambos generen un humano. A HeyGen Video se le pregunta cómo se ve un momento descrito. A Griffin se le pregunta qué debería suceder después.
Cuánto cuesta cada segundo, en el que puedes comprar segundos
El precio de lanzamiento de HeyGen Video es de $0.01 por segundo hasta octubre, y el propio texto de HeyGen lo describe como un 50 % de descuento sobre un precio estándar de $0.02. La tabla de costos de la misma página, con una nota al pie que indica el precio de lista por segundo a 768p con audio antes de las promociones de lanzamiento, lo sitúa en $0.03. Eso es una diferencia del 50 % entre el texto y la tabla en el propio material de lanzamiento de un proveedor, y hasta que HeyGen publique una página de precios de API, la lectura segura es que $0.01 está confirmado porque está vigente, y la cifra posterior a octubre está en algún punto entre $0.02 y $0.03.
Haz los cálculos para mil segundos —cien clips de diez segundos—, que es la unidad en la que realmente piensa un equipo que produce en masa:
• HeyGen Video en octubre — $10 a $0.01 por segundo.
• HeyGen Video después de octubre — $20 a $0.02, o $30 al $0.03 de la tabla.
• MiniMax H3, el modelo base a partir del cual se ajustó — $80 al precio de lista de MiniMax de $0.08 por segundo.
• Kling 3.0 Pro — $168 a $0,168 por segundo.
• Veo 3.1 — $400 a $0.40 por segundo.
La razón por la que la aritmética es el titular del lanzamiento de HeyGen es la tasa de descarte. Los equipos que crean recortes para redes sociales, variantes de anuncios y bucles de producto generan mucho más de lo que publican, y a diez centavos por intento de diez segundos, la economía de desechar candidatos cambia de forma por completo. La trampa está en el techo: 768p a 24 fps no es un formato de entrega 2K, y MiniMax H3 alcanza 2K mediante un módulo de regeneración independiente en la propia API alojada de MiniMax a $0.13 por segundo, sin equivalente en HeyGen Video. Si tu objetivo de entrega está por encima de 768p, el segundo barato no es el segundo que necesitas.
La columna de Griffin en esa lista está vacía, y no de una manera prometedora. Tavus no ha publicado una tarifa, porque Griffin-Lite es una vista previa de investigación que, según su propio anuncio, no estará disponible para uso de clientes en este momento y no está en la plataforma de Tavus. Bajo un modelo de mil segundos no hay nada que poner. Cualquiera que cite una cifra para Griffin se la está inventando.
Los números de calidad, y quién está evaluando
Ninguno de estos modelos cuenta con una puntuación independiente, lo cual vale la pena aclarar desde el principio porque ambos proveedores tienen gráficos.
La de HeyGen es una tabla Elo con HeyGen Video normalizado a 1000, luego Dreamina Seedance 2.0 con 955, la familia H3 Max distribuida desde 952 hasta 860, Kling 3.0 Pro con 857 y Veo 3.1 con 744. La nota al pie hace la mayor parte del trabajo: las puntuaciones provienen de un conjunto de evaluación interno de consultas de Artificial Analysis Arena con 4,800 votos, y la propia puntuación de HeyGen está normalizada a 1000 para una comparación más sencilla. Que un proveedor se normalice a sí mismo en la cima de su propia tabla es una decisión de presentación, no evidencia de que lidere. El espaciado relativo por debajo es la parte informativa.
Más útil es la comparación cara a cara, que es el único lugar donde HeyGen se prueba contra algo que no construyó. HeyGen afirma que los probadores ciegos prefirieron su modelo al H3 Max post-train que aparece en el gráfico en el 55,8 % de las comparaciones, con 650 votos, con un rango del 49 al 62 %. Ese rango es el detalle honesto: en el extremo inferior queda a caballo del 50 %, así que, según los propios números del proveedor, la preferencia sobre ese rival no se separa claramente del ruido. El desglose por eje es mixto de una manera que se lee como un perfil de fallo específico: 65 % en mantenerse fiel a la imagen de origen y 66 % en sincronización, frente a 43 % en consistencia y 45 % en música.
Las cifras de Griffin proceden de un instrumento construido por otra persona, que es la diferencia que importa. El VideoFDB de NVIDIA es un benchmark para conversación audiovisual full-duplex puntuado en dos pistas, y NVIDIA lo construyó y realiza la evaluación con su propio juez conforme a una rúbrica publicada. Griffin-Lite obtuvo 3,83 de 5 en generación frente a una referencia humana de 3,92 y 2,80 para el siguiente sistema publicado con mayor puntuación, y 3,73 en percepción frente a una referencia humana de 4,20. Tavus también reporta 0,43 segundos de latencia real de audio a vídeo para el generador frente a cuatro baselines publicados de difusión en streaming sobre H100s. Las salvedades siguen aplicando: una diferencia de 0,09 puntos con respecto a humano en una rúbrica de cinco puntos juzgada por un modelo de lenguaje es "cerca", no "igual", y parte de la ventaja en percepción se mide frente a sistemas que funcionan sin entrada de vídeo, pero el evaluador no es el proveedor.
• Puntuaciones de calidad independientes: ninguna de las dos tiene una. HeyGen Video no aparece en ninguna de las tres clasificaciones de video de Artificial Analysis a fecha de 2 de octubre de 2026, y Griffin tampoco. Puede que Griffin nunca lo haga: la votación de preferencia por pares sobre clips cortos no puede puntuar una conversación en vivo.
Los mismos rankings sí incluyen el modelo base. MiniMax H3 ocupa el 4.º puesto en texto a vídeo (con audio) con un Elo de 1.139 y el 2.º en imagen a vídeo con 1.181, ambos a $4,80/min — así que el post-entrenamiento de HeyGen está compitiendo en un sustrato que una arena independiente ya clasifica cerca de lo más alto, lo cual es el argumento más fuerte a su favor: que HeyGen no lo publicó por sí misma.

Ambos son baratos o no se les puede poner precio por la misma razón
El hecho estructural que subyace a ambos lanzamientos es que fabricar un ser humano convincente se volvió barato, y la ventaja de costos de ninguna de las dos empresas proviene de lo que vende.
HeyGen Video es un post-entrenamiento de MiniMax H3, que MiniMax publicó con pesos disponibles bajo su propia licencia comunitaria. Eso convirtió a H3 en un sustrato que otras empresas pueden especializar y revender, y HeyGen es el segundo producto en hacerlo en cinco semanas para un vertical diferente: video empresarial, demostraciones de producto, capacitación, recorridos de propiedades. El patrón es la razón por la que HeyGen puede fijar un precio inferior al de la base: no está asumiendo el costo del modelo base, y la base es el lanzamiento de pesos abiertos de alguien más.
Griffin es la apuesta contraria. Tavus construyó todo el sistema —el códec, el generador de voz en streaming, el generador de vídeo en streaming, el modelo conversacional— en torno a la propia interacción, destilando un gran modelo maestro de difusión bidireccional en un generador autorregresivo de pocos pasos en tres etapas para que los rollouts largos no se desvíen. Eso es investigación costosa sin una base abierta sobre la que apoyarse, y es una parte plausible de por qué el lanzamiento tiene acceso restringido: no hay un sustrato barato por debajo que amortizar.
Ambas empresas también llegan al mismo lugar incómodo desde direcciones distintas. La propia documentación de HeyGen enumera aquello en lo que el modelo es peor, algo poco común y que vale la pena leer: texto largo en pantalla, movimiento orgánico y suave como pétalos, papel y cabello, y trabajo de cerca con las manos, como ensamblar o manejar equipo. Es mejor en tomas cortas y contenidas: un sujeto, un lugar, una acción, una cámara fija o que apenas se mueve. La limitación de Griffin no es una lista de modos de fallo, sino un problema de seguridad no resuelto: Tavus afirma sin rodeos que las propiedades que hacen que un modelo de interacción humana sea una mejor interfaz también lo hacen mejor para persuadir a alguien de que está hablando con un humano, y que está reteniendo la vista previa mientras desarrolla mecanismos de divulgación.
Qué puede hacer realmente un comprador hoy
HeyGen Video ya se puede invocar. Funciona con POST /v3/models/videos y una cabecera x-api-key, solo con claves de API de pago, con enlaces de descarga firmados y que caducan —así que el sondeo (polling) los renueva— y callbacks que se intentan una sola vez por trabajo, algo que la propia HeyGen te indica que trates como una optimización de latencia y no como una garantía. Si lo estás probando este mes, el segundo promocional de $0.01 está activo, el límite de salida es 768p y el modo de mejora de prompt es una auténtica palanca de costes: turbo por defecto, quality para una pasada más larga, y disabled para enviar tu texto sin modificarlo.
Griffin no es invocable. El acceso es un formulario de solicitud y una vista previa de investigación. No hay clave, ni identificador, ni endpoint y no hay SLA, y la única declaración publicada sobre la disponibilidad es que llegará una vez que Tavus haya resuelto cómo lanzarlo de forma segura.
Algo que ambos tienen en común es que ninguno es un modelo al que un router pueda ayudarte a llegar y, en el caso de Griffin, eso es un problema de categoría, no algo temporal: una sesión full-duplex en tiempo real no es una llamada de petición-respuesta. Aquello con lo que sí ayuda un router en cualquiera de los dos pipelines es con la capa que rodea al vídeo. La expansión de prompts, el inventario de imágenes de referencia, las descripciones de planos, la generación de subtítulos y el resumen de revisiones son todas llamadas de texto, y las de OpenAI, Google y el resto están en el catálogo de OrcaRouter, detrás de un único endpoint compatible con OpenAI, con más de 200 modelos con la misma clave, al precio de lista del proveedor con un 0% de margen añadido, así que un cambio de precio de un proveedor se refleja el mismo día. En lo que respecta al modelo de vídeo en sí, hay un dato útil: MiniMax H3 —el modelo base a partir del cual se afinó HeyGen Video, y aquel cuyo precio por segundo está siendo socavado por los $0,01 de HeyGen— se enruta aquí como minimax/minimax-h3 a $0,08 por segundo, con 2K a $0,13. HeyGen Video en sí no está en nuestro catálogo, y Griffin tampoco; ambos se sirven a través de las API de sus propios proveedores y de varias plataformas de terceros.

¿Cuál, y para quién?
• Usa HeyGen Video si el entregable es metraje breve, autocontenido y centrado en personas, con sonido integrado, y puedes conformarte con 768p a 24 fps. Presupuesta la tarifa posterior a octubre entre $0.02 y $0.03 por segundo, en lugar de la tarifa promocional de diez centavos, y sondea a fondo el texto largo en pantalla y el trabajo de manos en primer plano antes de comprometer un flujo de trabajo con ello, porque HeyGen ya te ha dicho que ahí es donde falla.
• No planifiques en torno a Griffin. Solicita acceso si tu pregunta es si una persona puede distinguir a un humano generado de uno real en una llamada de un minuto, o si necesitas ver hacia dónde se dirige una capa de interacción en tiempo real antes de comprometer una hoja de ruta a clips renderizados.
• Presta atención a la cuestión de la divulgación, porque es lo único que hará que ambas se muevan. Los clientes de HeyGen Video tienen una respuesta sencilla disponible —el modelo es un post-entrenamiento de una base de pesos abiertos y la salida es un archivo con procedencia conocida—, mientras que Tavus está reteniendo un modelo específicamente porque aún no tiene una. La compañía que publique el mejor mecanismo de divulgación habrá resuelto el problema más valioso.

