Tarjeta de título principal para Tavus Griffin, con el subtítulo «El primer Modelo de Interacción Humana — anunciado el 1 de octubre de 2026», sobre tres chips que dicen «el 48 % pensó que era una persona real», «generación de VideoFDB: 3,83 frente a una referencia humana de 3,92» y «latencia de audio a vídeo de 0,43 s». Pie de página: «Todas las cifras son reportadas por el proveedor y por NVIDIA; Griffin-Lite es una versión preliminar de investigación, no está disponible de forma general». El logotipo de OrcaRouter se compone en la esquina inferior derecha.
Guides & Insights

Tavus Griffin: El primer modelo de interacción humana y el 48% que superó el test de Turing visual

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Veintiséis de cincuenta y cuatro personas terminaron una videollamada de un minuto y dijeron que su pareja había sido una persona real. Ese es el número con el que Tavus está encabezando para Tavus Griffin, anunciado el 1 de octubre de 2026, y es un resultado genuinamente llamativo: con el mismo protocolo, el stack anterior de la empresa —Phoenix-4.5 renderizando el rostro, Raven-1 encargándose de la percepción, Sparrow-2 gestionando la dinámica de turnos— produjo un creyente de cada cuarenta y uno, o el 2,4%. Las dos lecturas obvias de ese salto son ambas incorrectas, y separarlas es la mayor parte de lo que sigue. Griffin no es un motor de avatar mejor, y no es un producto que puedas comprar. Es una vista previa de investigación llamada Griffin-Lite, abierta a selectos probadores de confianza, sin precios, sin API pública y sin entrada en ninguna clasificación independiente de video. Que ambas cosas sean ciertas a la vez es la historia real.

Qué mide el 48 % y qué no

El estudio es un test de Turing cara a cara en lugar de una encuesta de preferencias, y vale la pena enunciar el protocolo con precisión porque es la afirmación fundamental. Se reclutó a cincuenta y cuatro participantes a través de una plataforma de investigación independiente y se les dijo que se les emparejaría con otro participante para una videollamada de un minuto sobre lo que esperaban con ilusión este año. Su pareja era un PAL ejecutando Griffin-Lite, que generaba rostro, voz y respuestas en tiempo real. Solo al final de la encuesta se les preguntó si se les había pasado por la cabeza que su pareja pudiera no ser una persona real, y a cada participante se le dijo entonces que era una IA. La ejecución de comparación utilizó el mismo protocolo en la pila más antigua, con cuarenta y un participantes.

Las cifras de apoyo importan tanto como el titular. Los creyentes estaban seguros —79 % en promedio— y los escépticos también, con un 81 %, que es lo que un estudio quiere: nadie estaba adivinando. Más de la mitad de los participantes dijeron que la posibilidad no se les había pasado por la mente en absoluto durante la llamada, y casi todos los de ese grupo pasaron a decir que la pareja era real. Los participantes que sí sospecharon tendieron a hacerlo dentro de los primeros veinte segundos. Esa es la línea menos cómoda del informe y la que debería determinar cómo se lee la sección de seguridad más adelante.

En una escala de siete puntos, el modelo promedió 5,4 por parecer natural, 5,6 por parecer fiable, 5,8 por si los participantes disfrutarían volver a hablar con él —una puntuación que se mantuvo en 5,4 incluso entre los participantes que identificaron correctamente que era una IA— y 5,5 por si sentían que su interlocutor realmente los estaba escuchando. La puntuación más baja fue 4,9, por si la conversación fluía con naturalidad. Leído en conjunto, eso es un perfil específico: Griffin-Lite es convincente momento a momento y un poco menos convincente como arco.

El benchmark independiente y cómo interpretar sus dos pistas

Los números de calidad provienen de VideoFDB, de NVIDIA, un benchmark para la conversación audiovisual full-duplex que puntúa a un modelo en dos pistas separadas —generación, es decir, si el modelo produce el comportamiento correcto, y percepción, es decir, si comprende el momento—, cada una con su propia rúbrica y su propia tabla de clasificación. NVIDIA creó el benchmark, realiza la evaluación con su propio juez según las métricas publicadas y puntúa la respuesta en una escala de cero a cinco. Tavus no lo ejecutó, y esa es la razón para citarlo.

• Generación — Griffin-Lite obtuvo 3.83, el siguiente sistema publicado con mayor puntuación obtuvo 2.80 (Gemini 2.5 con Anam), y la referencia humana de ground-truth es 3.92. Eso es 1.03 por delante del mejor sistema comparable y 0.09 por debajo de lo humano.

• Percepción — 3,73 frente a una referencia humana de 4,20, con 3,44 para el baseline más fuerte reportado, MiniCPM-o 4.5 en su configuración de solo audio. Gemini 2.5 Flash Native obtuvo 3,17 y gpt-realtime de OpenAI obtuvo 2,97.

• Alineación de la tasa de toma de palabra — 62.8% en generación y 73.8% en percepción. Esto mide cuán estrechamente coinciden las decisiones del modelo sobre cuándo hablar con el momento de las conversaciones de referencia, y Tavus describe ambas como las más altas de cualquier sistema en la tabla.

Dos salvedades corresponden a esas cifras antes de que alguien las repita. La brecha de generación frente a lo humano es de 0,09 en una escala de cinco puntos evaluada por un modelo de lenguaje, lo cual se lee mejor como «cercano a lo humano en esta rúbrica» que como «a nivel humano». Y la comparación de percepción no es en igualdad de condiciones: MiniCPM-o 4.5 y gpt-realtime se puntúan en configuraciones únicamente de audio, mientras que Griffin también procesa video. La ventaja de 0,29 puntos sobre una línea base únicamente de audio es real, pero parte de lo que mide es el valor de tener ojos.

La propia línea de resumen del proveedor —primera en la prueba independiente de NVIDIA sobre IA cara a cara, 37 % por delante de la siguiente mejor IA a la hora de reaccionar en el momento— es una caracterización de los mismos datos, no un hallazgo aparte. Conserva las puntuaciones subyacentes de las pistas, no el encuadre.

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

Dos motores, funcionando al mismo tiempo

La afirmación arquitectónica es más fácil de evaluar que el marketing que la rodea, porque es una afirmación sobre lo que se ejecuta de forma concurrente. Griffin se describe como dos sistemas que trabajan en paralelo en lugar de un pipeline que se pasa el testigo entre etapas.

El primero es un motor de modelado conversacional continuo. Ingiere el audio y el video de la persona y reevalúa el intercambio a intervalos regulares de menos de un segundo —Tavus los llama mini-turnos—, decidiendo en cada uno si permanecer en silencio, hacer una señal, responder con una señal de acompañamiento o tomar el turno. La salida no son solo las palabras, sino un conjunto de controles expresivos que conllevan sincronización temporal, postura, expresión facial y gestos. El objetivo del diseño es que una decisión tomada a mitad de frase se refleje en la voz y el rostro dentro del mismo mini-turno en lugar de después de un traspaso, lo que permite que el modelo se detenga cuando lo interrumpen, asienta mientras escucha y trate una pausa para pensar como algo distinto del final de un turno.

El segundo es un motor de generación audiovisual que convierte esos controles en sonido y píxeles a la vez: un generador de voz en streaming y un generador de vídeo en streaming impulsados por las mismas señales, de modo que un cambio de tono y un cambio de expresión sucedan al mismo compás.

Una nota de honestidad sobre el material que Tavus publicó junto con esto, porque sería fácil confundirlo con una medición. El diagrama interactivo de un intercambio de nueve segundos está anotado en el propio texto de la página como ilustrativo y explícitamente no medido de una sesión real. La misma salvedad se aplica a la figura de tiempos por turnos frente a dúplex completo. Lo que sí se mide es el número de latencia que aparece más abajo.

Dentro del stack de streaming

El lado de audio está construido en torno a un códec llamado Tavec, un autocodificador convolucional que transforma audio de 48 kHz en una representación latente continua de 40 valores por trama a 100 tramas por segundo, sin libros de códigos. Su decodificador es totalmente causal, por lo que mantiene estado entre fragmentos y emite paquetes de audio de tan solo 10 ms sin anticipación. Un minuto de habla son 6.000 tramas latentes en lugar de 2,88 millones de muestras sin procesar, lo que hace que la secuencia sea lo bastante económica para que el transformador de voz prediga más rápido que en tiempo real. El propio generador de voz es un transformador de difusión autorregresivo que se condiciona con un prefijo codificado del hablante —una voz se puede clonar a partir de unos diez segundos de audio— y genera un fragmento latente a la vez a medida que llegan los controles, por lo que la reproducción comienza antes de que termine el enunciado.

El lado del video parte de la misma premisa: una fuerte compresión temporal es lo que hace que un modelo de difusión sea lo bastante rápido como para mantener una conversación. Un generador autorregresivo de pocos pasos toma una foto de referencia, el audio en streaming y los controles en streaming, y produce un latente por paso con tres pasos de difusión por latente. Un VAE comprime el tiempo ocho veces, así que a 25 fps un latente son ocho fotogramas, o 320 ms de video en 720p. Los latentes más antiguos se conservan a una resolución cada vez menor para que las generaciones largas sigan siendo asequibles. El resultado es un generador que emite 720p en fragmentos de 320 ms en tiempo real.

Llegar hasta ahí requirió una destilación en tres etapas a partir de un gran profesor de difusión bidireccional de muchos pasos: Destilación por Coincidencia de Distribuciones a un estudiante de pocos pasos, forzado del profesor para convertir a ese estudiante en un modelo autorregresivo que genera un latente a la vez y, por último, entrenamiento con auto-forzado sobre el historial generado por el propio modelo más un mecanismo añadido que actúa sobre los fotogramas del historial para que las ejecuciones largas no se desvíen. Esa tercera etapa es la que aborda el modo de fallo que suele tener esta clase de modelo: una cara que se degrada, o un fondo que se desvía lentamente, a lo largo de una conversación que dura minutos.

El número de latencia, que es la verdadera afirmación del producto

Frente a cuatro modelos publicados de difusión en streaming en un entorno de audio a video, donde cada modelo recibe voz y una imagen de referencia y debe producir la cara parlante, el generador de Griffin-Lite promedió 0,43 segundos de latencia real de audio a video en H100s — el tiempo desde que llega un fragmento de audio hasta que el video muestra su efecto. Tavus describe eso como la mitad del siguiente método más rápido. También reporta el primer lugar en calidad perceptual de DOVER y FID y en THEval, un marco de evaluación de cabezas parlantes, y el segundo en confianza de sincronización labial LSE-C con 7,27, por detrás de una línea base — y el proveedor señala que LSE-C recompensa el movimiento pronunciado de la boca, incluido el movimiento más allá del punto en que parece natural.

Todas esas son mediciones de Tavus contra líneas base que ella misma seleccionó. Son útiles porque son específicas y porque la cifra de 0,43 segundos es el tipo de número que o se sostiene en una prueba en vivo o no. No son independientes, y las únicas puntuaciones independientes en este artículo son las dos pistas de VideoFDB anteriores.

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

¿Por qué no hay un precio con el que comparar?

Griffin-Lite está disponible hoy para un grupo selecto de primeros probadores como vista previa de investigación, y más adelante seguirá un lanzamiento más amplio de un modelo más capaz. No estará disponible para uso de clientes en este momento. El acceso es mediante formulario de solicitud. No está en la plataforma Tavus, y la propia frase de cierre de la empresa en el anuncio lo dice claramente: Griffin aún no está en la plataforma Tavus, y llegará una vez que Tavus haya resuelto cómo lanzarlo de forma segura. Todo lo que un comprador normalmente compararía —precios por segundo o por solicitud, un identificador de modelo, límites de velocidad, un SLA, una lista de regiones— aún no existe. Tavus dirige a cualquiera que quiera desarrollar hoy hacia los modelos que ya usan 150.000 desarrolladores y empresas, que son los tres predecesores, no Griffin.

Eso no es un tecnicismo para poner en una nota al pie. Cambia para qué sirve este modelo ahora mismo. Es un objetivo de evaluación para equipos cuyo producto depende de si una persona puede notarlo, y una señal de hacia dónde se dirige la hoja de ruta del proveedor. No es algo sobre lo que construir un camino de cara al cliente este trimestre.

La puerta de seguridad es el plan de lanzamiento

Lo más interesante que Tavus escribió sobre Griffin no tiene que ver con el modelo. Es la admisión de que las mismas propiedades que hacen que un modelo de interacción humana sea una mejor interfaz también lo vuelven mejor para engañar a alguien y hacerle creer que no es una IA, que se requiere más trabajo de alineación y seguridad antes de un lanzamiento seguro, y que la empresa está trabajando en funciones de divulgación y con organizaciones en evaluaciones de seguridad de IA. Dado que casi la mitad de una muestra en vivo no pudo distinguirlo, y que quienes sí pudieron en su mayoría lo dedujeron en menos de veinte segundos, un mecanismo de divulgación que sobreviva a una conversación casual no es un simple extra.

Dos cosas cambiarían este artículo de forma sustancial. Una tarjeta de modelo publicada con un endpoint y un precio trasladaría a Griffin de resultado de investigación a pregunta de adquisición. Y una entrada en una tabla de clasificación de vídeo independiente —con la advertencia de que esas tablas puntúan clips cortos mediante preferencia por pares y no están diseñadas para puntuar una conversación en vivo, por lo que el desajuste podría ser permanente en lugar de temporal— daría a las afirmaciones sobre latencia y calidad una verificación externa. Hasta que una de esas cosas se materialice, los tracks de VideoFDB son la evidencia más sólida disponible y conllevan una brecha humana de 0,09 y 0,47 puntos, respectivamente.

El contraargumento que vale la pena sopesar es que una ejecución de benchmark no es un despliegue. El protocolo de NVIDIA da a todos los sistemas la misma tarea de toma de turnos y el mismo juez; no dice nada sobre cómo se comporta la novena hora de una llamada, qué sucede cuando dos personas se pisan al hablar durante un minuto entero, o si los controles expresivos se degradan en una cara que la fotografía de referencia reprodujo mal. Tavus presenta el entrenamiento específico contra la deriva —la etapa de auto-forzado y el mecanismo de historial— como la solución para exactamente eso, y los informes son lo único que tiene un lector hasta que alguien ajeno a Tavus ejecute una sesión larga y la publique. Trata el benchmark como la mejor evidencia disponible, en lugar de como un resultado de despliegue.

Qué construir a su alrededor mientras tanto

La pregunta práctica para un equipo que quiera algo como esto hoy es qué partes del stack ya se pueden comprar. Una interfaz de video conversacional es una cadena —reconocimiento de voz, un modelo de lenguaje, síntesis de voz y, en el caso de Tavus, un modelo de renderizado—, y las tres primeras son productos básicos. Estas se encuentran detrás de un único endpoint compatible con OpenAI en OrcaRouter, con más de 200 modelos en la misma clave y el precio de lista del proveedor trasladado con un margen del 0 %, así que una bajada de precio de un proveedor está activa aquí el mismo día en lugar de después de un ciclo de contrato. Si estás montando un pipeline de interacción y quieres mantener abierta la capa de generación hasta que Griffin o algo similar se convierta en un producto real, ahí es donde la sustitución cuesta un cambio de configuración en lugar de una migración. Tavus Griffin en sí no es un modelo enrutado aquí, y no lo será mientras sea una vista previa detrás de un formulario de solicitud.

Lo que vale la pena observar no es otro video de demostración. Es si se publican las herramientas de divulgación que Tavus está construyendo, y si un segundo grupo de investigación reproduce el protocolo cara a cara. Una superación de la prueba de Turing de esta magnitud es exactamente el tipo de resultado que necesita que un segundo laboratorio lo ejecute.

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.