
Avatar en tiempo real de Muse: Meta le da un rostro a su agente Muse, a 870 milisegundos por turno
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 180 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
El número con el que Meta eligió abrir es 870 milisegundos. Eso es lo que tarda Muse Realtime Avatar, según la propia medición de Meta, desde el momento en que dejas de hablar hasta el momento en que llega el primer byte de una respuesta sincronizada de voz y video. Es una cifra verdaderamente agresiva para un sistema que tiene que generar video, y vale la pena leerla con precisión —porque casi todo lo interesante del nuevo modelo de encarnación de Meta está en la brecha entre lo que ese número mide y lo que la gente supondrá que mide.
Muse Realtime Avatar se anunció el 23 de septiembre de 2026 en Meta Connect y Meta Superintelligence Labs lo describió ese mismo día en una publicación de investigación titulada "Dando vida a tu Muse". Extiende Muse Realtime Voice, la capa conversacional dentro del agente Muse de Meta, al darle un cuerpo. No es un chatbot con un avatar genérico: le entregas una imagen de referencia —una fotografía, una ilustración de cuerpo completo, un animal, un objeto doméstico— y renderiza esa cosa hablando, gesticulando y cambiando de postura en video continuo durante toda la conversación. Zuckerberg dijo en el escenario que el avatar asociado a su propio Muse se llama Jolly.
Un flujo de tokens compartido, no una pasada de sincronización labial
La arquitectura es la parte que merece la pena entender, porque explica por qué Meta sigue diciendo «embodiment» en lugar de «avatar». Muse Realtime Voice produce un flujo de tokens de habla —la publicación los llama VQs— que llevan tanto el contenido de lo que se dice como su prosodia: el ritmo, el énfasis, las subidas y bajadas. Muse Realtime Avatar consume ese mismo flujo. Es un Diffusion Transformer impulsado por audio, condicionado por esos tokens de habla, por los medios de referencia que proporcionaste y por una ventana móvil de latentes de vídeo recientes, y genera vídeo en pequeños fragmentos causales, pasando cada nuevo latente hacia delante como contexto de movimiento para el siguiente.
Compartir un único flujo de tokens es lo que mantiene la voz, el movimiento de los labios y la expresión sincronizados entre sí. La alternativa —generar el audio y luego aplicar sobre él un modelo de sincronización labial independiente— es como funciona la mayor parte de la industria de avatares, y es la razón por la que tantos de esos avatares parecen estar doblados. El diseño de Meta elimina esa costura por construcción. La ventana latente deslizante es la segunda mitad de la idea: sin ella, un generador basado en fragmentos deriva y, al minuto tres, tu personaje se ha convertido silenciosamente en otra persona.

Cuatro cifras publicadas, y qué mide realmente cada una
Meta publicó más cifras de lo habitual para una publicación de investigación vinculada a una función para consumidores. Las cuatro siguientes están reportadas por la propia empresa y fueron medidas por Meta con respecto a líneas base que Meta eligió; ninguna de ellas se ha reproducido fuera de la compañía.
• 870 ms desde el final del turno hasta el primer byte. Esta es una cifra de inicio de respuesta. No es el tiempo hasta una respuesta completa, y no es la latencia de entrega continua durante el resto de la llamada. Un sistema puede alcanzar 870 ms hasta el primer byte y aun así sentirse lento en el segundo doce. La publicación de Meta deja claro que esta es la medida del primer byte; la cobertura que omite el matiz lo interpreta como capacidad de respuesta de extremo a extremo, lo cual no es.
• Vídeo vertical de 448×768 a 25 fotogramas por segundo. Ese es un marco alto con forma de teléfono, no uno apaisado, y 25 fps es cinematográfico en lugar de fluido: la tasa de fotogramas estándar del cine, por debajo de los 30 o 60 fps que le daría una señal de cámara nativa. Meta dice que las demos llevan una marca de agua con una superposición transparente para que el destinatario pueda notar que no está viendo una señal de cámara normal.
• 60× menos evaluaciones del modelo.Se explica adecuadamente a continuación, porque es la cifra que más probablemente se malinterprete.
• 12 sesiones simultáneas en tiempo real en una NVIDIA GB200. Meta informa que su trabajo de serving —cachés KV persistentes, enrutamiento consciente de la caché, batching dinámico consciente de la latencia, entrenamiento consciente de cuantización de cuatro bits, kernels fusionados y captura de CUDA Graph, desarrollados con NVIDIA— elevó la capacidad 8× respecto a su propia línea base BF16 de dos pasos. La aritmética que lo sustenta es clara: cada paso de generación produce ocho fotogramas, que equivalen a 320 ms de reproducción, en 20 ms de tiempo de modelo, o 2,5 ms por fotograma. Tanto el 12 como el 8× son respecto a la línea base especificada por Meta, no respecto al hardware de otro proveedor.
Por qué 60× no es 60× más rápido
La afirmación sobre la compresión es la que más se repetirá y menos se comprenderá. El modelo profesor de Meta era un modelo de difusión de 40 pasos con guía sin clasificador de tres vías —tres pasadas por paso, es decir, 120 evaluaciones del modelo para producir un fragmento de vídeo—. El estudiante es un modelo causal de dos pasos sin guía con una caché KV de longitud fija, entrenado mediante destilación y auto-forzado, y necesita dos evaluaciones para el mismo fragmento. Eso supone una reducción de 60× en las evaluaciones por fragmento con, en palabras de Meta, una calidad cercana a la del profesor.
Es una reducción de cómputo por fragmento. Sesenta veces menos evaluaciones no significa que un usuario espere la sexagésima parte del tiempo, porque la latencia tenía otros contribuyentes antes de la destilación y sigue teniéndolos después. El gráfico en la propia publicación de Meta muestra lo que la reducción compró en términos de calidad: la preferencia humana sube del 45 % al 55 %. Esa es la versión honesta de la historia: el objetivo de la destilación era conseguir un sistema que pudiera funcionar en tiempo real, sin más, y el costo en calidad se mantuvo en unos diez puntos de preferencia en lugar de eliminarse.
La evaluación, incluido el resultado que fue en sentido contrario
Meta se comparó con dos sistemas de avatares comerciales, Runway Characters y HeyGen LiveAvatar, utilizando identidades de avatar emparejadas para que los evaluadores compararan la animación y no el diseño del personaje. Los evaluadores mantuvieron conversaciones en vivo de dos a tres minutos con cada sistema y luego compararon la calidad visual, la sincronización, la consistencia del personaje y los gestos característicos.
Meta informa que se le prefiere 78% a 22% sobre Runway Characters y 88% a 12% sobre HeyGen LiveAvatar, y que es preferido en todas las dimensiones evaluadas. Luego, la publicación hace algo que la mayoría de las evaluaciones de proveedores no hacen: revela que la comparación de gestos y ademanes frente a Runway Characters no era estadísticamente distinguible de la paridad. Un empate dentro de una barrida es algo pequeño, pero es el detalle que te dice que la barrida se está reportando honestamente en lugar de haber sido seleccionada a conveniencia.
Los límites de la prueba importan más que el empate. Dos o tres minutos son una conversación corta. Los evaluadores eran de Meta. Y la propia publicación advierte que sus demostraciones «ilustran la capacidad del modelo y no todas reflejan los avatares disponibles en la aplicación Muse» —lo que equivale a que un equipo de investigación diga, sin rodeos, que el video que viste no es necesariamente el producto que obtendrás.
Lo que no puedes hacer con él
No hay API para Muse Realtime Avatar. No hay precio, ni tarifario, ni lista de espera, ni fecha de publicación. Meta no dijo cuándo podrán usarlo los usuarios ni los desarrolladores. La app Muse para mayores de 18 años es la única superficie a la que está destinada, y el avatar llega junto con un conjunto de otras funciones de Muse —personalización de voz, una dirección de correo electrónico de Muse, control de computadoras Mac, integración con gafas— que tienen sus propios cronogramas, algunas de ellas indicadas como "próximos meses".
La comparación que importa aquí no es con Runway ni HeyGen. Es con el resto del stack de Muse. Muse Spark, el modelo de razonamiento sobre el que corre el agente, está disponible para los desarrolladores desde que Meta lo abrió a través de la Meta Model API, y Muse Spark 1.2 se sirve a través de OrcaRouter como meta/muse-spark-1.2 a 1,25 $ por millón de tokens de entrada y 4,25 $ por millón de tokens de salida, precio de lista del proveedor sin ningún margen, dentro de una ventana de contexto de un millón de tokens que ya acepta texto, imágenes, vídeo, audio y archivos. Esa es la parte de Muse que puedes llamar hoy. La cara es la parte que no puedes.
Esa asimetría merece un momento de reflexión si estás planeando algo. Un agente que razona durante una videollamada y un agente que aparece en ella son productos distintos con restricciones distintas, y solo uno de ellos figura en una lista de tarifas.

Qué ver a continuación
Tres cosas convertirían esto de un anuncio en una decisión. La primera es una fecha de lanzamiento para el avatar dentro de Muse, porque todo lo que Meta publicó es sobre un modelo, y nada de lo que publicó es sobre un producto que puedas usar un jueves. La segunda es una medición de latencia tomada a lo largo de una conversación larga en lugar de en el primer byte —870 ms es un pistoletazo de salida, y la pregunta que plantea una llamada real es qué ocurre en el minuto diez. La tercera es si el sistema mantiene el personaje bajo condiciones adversariales: un usuario que cambia de tema deliberadamente, va rápido o le proporciona una imagen de referencia diseñada para parecer una persona real.
Hasta entonces, el resumen honesto es el que la publicación de investigación insinúa sin decirlo. Muse Realtime Avatar es una pieza real de ingeniería con un resultado de compresión real detrás, demostrado en un entorno controlado, evaluado por la empresa que lo construyó, en conversaciones que duraron lo mismo que pedir un café. No es vaporware. Tampoco es algo que puedas comprar, enrutar o medir con benchmarks — y esas son afirmaciones distintas.

