
Tavus Griffin vs Muse Realtime Avatar: dos rostros de 2026, dos problemas distintos
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Tanto Tavus Griffin como Muse Realtime Avatar existen para resolver el mismo problema vergonzoso —un modelo de lenguaje que puede hablar pero no tiene cara— y lo atacan desde extremos opuestos. Griffin es un Human Interaction Model de vídeo a vídeo que observa a un participante a través de una cámara y genera el otro lado de la conversación en tiempo real, y Tavus lo anunció en octubre de 2026 como una vista previa de investigación para determinados evaluadores. Muse Realtime Avatar es la capa de encarnación de Meta para su agente Muse, anunciada en Meta Connect el 23 de septiembre de 2026, y toma audio y lo convierte en un retrato parlante sincronizado. Ninguno de los dos se puede comprar. La diferencia está en qué intenta acertar cada uno, y se hace evidente en el momento en que preguntas qué recibe realmente cada modelo como entrada.
La versión corta
La entrada de Griffin es la persona al otro lado — vídeo y audio de un participante en directo, que debe leer, al que debe responder y por el que debe dejarse interrumpir.
• La entrada de Muse Realtime Avatar es el habla del propio agente — un flujo de tokens de Muse Realtime Voice que convierte en una cara coincidente.
• Tavus mide Griffin según si la gente se lo cree, y publica una cifra del 48 % a partir de una videollamada de un minuto.
• Meta mide Muse Realtime Avatar por si logra seguir el ritmo, y publica 870 milisegundos desde el final del turno hasta el primer byte.
• Ninguno tiene una API pública, un precio publicado ni una fecha de disponibilidad general.
Lee esas cuatro filas en conjunto y la forma del desacuerdo es obvia. Tavus está optimizando para la creencia de la otra persona. Meta está optimizando para el reloj.

Griffin: el modelo que tiene que ser creído
El planteamiento de Tavus es que Griffin es el primer Human Interaction Model, y la arquitectura que respalda esa afirmación es un sistema de dos partes que combina Continuous Conversational Modeling con Audio-Visual Generation. La primera parte es conductual: decide qué debería estar haciendo la persona de un momento a otro, usando lo que puede ver y oír. La segunda parte es la renderización, y Tavus la divide a su vez en generación de habla en streaming y generación de vídeo en streaming.
Las cifras con las que Tavus abre no son cifras de throughput. En un estudio que la empresa realizó con la Queen Mary University of London, 26 de 54 participantes —el 48 %— creyeron que Griffin era una persona real después de una videollamada de un minuto, frente a 1 de 41 (el 2,4 %) con su combinación anterior de generación de rostros Phoenix-4.5, toma de turnos Sparrow-2 y visión Raven-1. Los participantes que no se dejaron engañar normalmente dudaron en los primeros 20 segundos. En el benchmark VideoFDB de NVIDIA, evaluado en septiembre de 2026, Tavus informa que Griffin ocupa el primer lugar en IA cara a cara con una puntuación de generación de 3,83 frente a 2,80 de la línea base más fuerte reportada y 3,92 de referencia humana, y una puntuación de percepción de 3,73 frente a 3,44 de la mejor línea base reportada y 4,20 de referencia humana. Esas cifras las reporta el proveedor y son específicas del benchmark, pero los puntos de comparación con humanos son los interesantes.
La ingeniería que hay detrás de esas cifras es un códec llamado Tavec y un transformer de difusión autorregresivo. Tavec funciona a 48 kHz con 40 valores por fotograma a 100 fotogramas por segundo, sin libros de códigos, un decodificador totalmente causal y paquetes de tan solo 10 milisegundos —diseñado para que una cara pueda empezar a moverse antes de que una frase haya terminado. La ruta de vídeo envía 720p en fragmentos de 320 milisegundos, donde un latente equivale a ocho fotogramas a 25 fps, tres pasos de difusión por latente y una compresión temporal de 8× en el VAE. Un proceso de destilación en tres etapas (coincidencia de distribución, luego autorregresivo con forzado del profesor y luego auto-forzado) es lo que le permite ejecutar esos tres pasos en tiempo real. La latencia que se destaca es de 0,43 segundos en promedio de audio a vídeo en H100s, lo que, según Tavus, es aproximadamente la mitad del siguiente método más rápido que midió. La clonación de voz requiere aproximadamente una muestra de 10 segundos.
El precio de todo esto es que Tavus no puede lanzarlo. Griffin-Lite, la vista previa de investigación, solo está disponible para un grupo selecto de primeros probadores; al escribir sobre el lanzamiento, la empresa declara claramente que Griffin-Lite no estará disponible para uso por parte de clientes en este momento y que prevé lanzar Griffin muy pronto, una vez que se aborden ciertas preocupaciones de seguridad. Griffin no está en la plataforma de Tavus, y llegará allí "una vez que hayamos encontrado la manera de lanzarlo de forma segura". Un modelo que convence el 48 % de las veces en una llamada de un minuto es, desde el punto de vista del despliegue, un modelo que convence el 48 % de las veces en una llamada de un minuto.

Muse Realtime Avatar: el modelo que tiene que seguir el ritmo
Muse Realtime Avatar fue anunciado el 23 de septiembre de 2026 en Meta Connect y fue descrito el mismo día por Meta Superintelligence Labs bajo el título "Dando vida a tu Muse". El enfoque de Meta es más estrecho y más mecánico que el de Tavus: el agente Muse ya tenía una voz, gracias a Muse Realtime Voice, y el avatar es la capa que da cuerpo a esa voz.
La cifra publicada es de 870 milisegundos desde el final del turno hasta el primer byte, es decir, desde el momento en que el usuario deja de hablar hasta el momento en que el primer byte de vídeo del avatar está listo. El avatar renderiza un retrato de 448×768 a 25 fotogramas por segundo. Meta afirma que el sistema realiza aproximadamente 60× menos evaluaciones por fragmento que su línea base, y que una sola NVIDIA GB200 puede soportar 12 sesiones en tiempo real simultáneas con una ganancia de capacidad de 8× sobre una implementación BF16 de dos pasos.
La diferencia arquitectónica con Griffin está en de dónde proviene la información. Muse Realtime Avatar extiende Muse Realtime Voice y comparte su flujo de tokens de habla; la misma representación VQ que produce el modelo de voz es la que impulsa el rostro, en lugar de una comprensión visual separada de un participante. Eso lo convierte en una capa de encarnación DiT impulsada por audio: eficiente, estrechamente acoplada a su propio modelo de voz y que no intenta interpretar en absoluto a la persona al otro lado de la llamada. Es una boca y un rostro para un agente, no un interlocutor conversacional que te observa.
Meta no ha publicado ninguna API, ningún precio ni ninguna fecha de lanzamiento para Muse Realtime Avatar. El artículo de investigación constituye la totalidad del registro público.
Donde los dos diseños realmente divergen
La forma más clara de ver la división es preguntar qué ocurre cuando el usuario interrumpe.
Griffin es dúplex completo y está diseñado para ser interrumpido a mitad de una intervención: puede observar y escuchar mientras habla, y por eso el marketing de Tavus se apoya en la idea de que Griffin aprende comportamiento conversacional en lugar de video. Ese es también el motivo por el que su conjunto de benchmarks se construye en torno a la percepción y la reacción, y por el que la ventaja del 37 % sobre el siguiente mejor sistema a la hora de reaccionar en el momento es una afirmación que la empresa se toma la molestia de hacer.
El dato de 870 milisegundos de fin de turno del Muse Realtime Avatar cuenta la historia opuesta: es un pipeline en el que el turno termina, los tokens de audio se resuelven y luego la cara se pone al día. Es rápido —870 ms es una buena cifra para un renderizador de retratos—, pero la medición en sí presupone que existe un límite de turno, que es precisamente el supuesto que un modelo dúplex está diseñado para descartar.
Eso no es una crítica a ninguno de los dos diseños. Meta está construyendo una cara para un agente que vive dentro de las propias superficies de asistente de Meta, donde un límite de turno limpio es un modelo razonable de la interacción. Tavus está construyendo algo que tiene que sobrevivir a que un desconocido decida, en veinte segundos, si la persona en la pantalla es real.
Ninguno de los dos figura en una lista de precios — y solo una parte de Muse es invocable.
Ni Tavus Griffin ni Muse Realtime Avatar pueden ponerse en producción hoy. Griffin está limitado a probadores seleccionados; Muse Realtime Avatar no tiene API, ni precio ni fecha. Si estás planeando un desarrollo, ambos hechos deben formar parte del plan.
Lo que vale la pena señalar es la pieza del stack de Muse que es accesible. La familia Muse de Meta incluye Muse Spark, y uno de sus checkpoints — meta/muse-spark-1.2 — está disponible en nuestro catálogo a $1.25 por millón de tokens de entrada y $4.25 por millón de tokens de salida con margen cero sobre el precio de lista de Meta. No es el avatar: acepta entrada de texto, imagen, video, audio y PDF y devuelve texto, con una ventana de contexto de 1M de tokens y esfuerzo de razonamiento configurable. Pero es la parte de la línea Muse que realmente puedes llamar, y si estás construyendo el agente que algún día estará detrás de un avatar, la mitad del lenguaje es la mitad con la que puedes empezar. OrcaRouter transfiere los precios de lista de los proveedores con un 0% de margen, por lo que un cambio de precio de Meta se refleja en nuestra tarjeta el mismo día en lugar del siguiente ciclo de facturación, y una solicitud que falla en un proveedor se reintenta con uno saludable en lugar de mostrarse como un timeout.

La misma lógica se aplica al lado de vídeo del mundo. No enrutamos Muse Realtime Avatar ni enrutamos Tavus Griffin, y no afirmaremos lo contrario. Lo que sí enrutamos es un catálogo de más de doscientos modelos en las mismas modalidades, de modo que un prototipo que alterna entre un agente de texto, un modelo de voz y un generador de vídeo se mantiene en una sola clave mientras los dos modelos de este artículo siguen sin lanzarse.
¿Cuál está más lejos de enviarse?
Según la información pública, Muse Realtime Avatar está más lejos. Tiene una publicación de investigación y no tiene API, ni precio, ni fecha. Griffin tampoco tiene API ni precio, pero tiene una intención de lanzamiento explícita —"muy pronto después de que se aborden estas preocupaciones de seguridad"—, un nivel de vista previa con nombre que existe hoy para probadores seleccionados, y un conjunto de resultados de benchmark publicados de un arnés de pruebas independiente. Esa es una posición más avanzada, aunque conlleva la admisión de que el modelo no es lo suficientemente seguro como para entregárselo a los clientes.
La trampa al compararlos es tratar la cifra de 870 milisegundos como directamente comparable con la de 0,43 segundos. Miden cosas distintas: Meta mide desde el final de un turno hasta el primer byte de un retrato, y Tavus mide la latencia de audio a video dentro de un flujo dúplex continuo en el que los turnos no son eventos bien definidos. Ambas cifras son reales y no son la misma medición, y quien las presente en una sola columna le está haciendo un flaco favor al lector.
En resumen
Muse Realtime Avatar es una capa de encarnación: audio de entrada, retrato de salida, 870 milisegundos desde el final del turno hasta el primer byte, 448×768 a 25 fps, sin API y sin fecha. Tavus Griffin es un Modelo de Interacción Humana dúplex: el participante entra, una cara que reacciona sale, 0,43 segundos de latencia promedio de audio a video en H100s, y un proveedor dispuesto a publicar que el 48% de las personas pensó que era humano mientras también afirma que los clientes no pueden usarlo. Meta está construyendo algo que sigue el ritmo. Tavus está construyendo algo que pasa por humano. Ninguno de los dos se puede comprar, lo que significa que la única decisión disponible hoy es por cuál mitad del problema empezar — y para la mayoría de los equipos, esa mitad es el modelo de lenguaje que hay debajo.
