Una tarjeta destacada generada para «Muse Realtime Avatar: Meta Gives Its Muse Agent a Face, at 870 Milliseconds a Turn», que muestra el antetítulo «Meta Superintelligence Labs — September 23, 2026», el titular y tres datos del artículo de investigación de Meta: vídeo vertical de 448×768 a 25 fps, unos 870 ms desde el final del turno hasta el primer byte, y 12 sesiones simultáneas en tiempo real en una NVIDIA GB200. Un subtítulo dice: «It is not a talking head. It is a render layer on top of a voice model.» El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.

Hmm — should the headline and subtitle be translated? The instruction: translate the user's message into Spanish, preserve brand/product names. The quoted headline is a title of an article. Quoted strings... The subtitle quote is arguably content that would be displayed. Hmm. Mixed. The instruction says preserve URLs and brand/product names. Titles aren't brand names. I think translating them is more appropriate for a full translation. But there's risk. Let me translate the headline too since it's descriptive text.

Actually the headline quote: 'Muse Realtime Avatar: Meta Gives Its Muse Agent a Face, at 870 Milliseconds a Turn'. Translating: «Muse Realtime Avatar: Meta le da una cara a su agente Muse, a 870 milisegundos por turno». That seems right for a localization.

But wait — it's a hero card for an article; the headline might be displayed as-is in Spanish? Typically localization would translate. I'll translate and note... no notes allowed. I'll translate.

Hmm, but "Meta Gives Its Muse Agent a Face" — "Meta le pone cara a su agente Muse".

Let me produce final translation.

Also "overline" = antetítulo / volanta. Fine.

Date "September 23, 2026" → "23 de septiembre de 2026". Hmm, is that part of a label? It's a date, translate it.

Final answer.Se ha generado una tarjeta destacada para «Muse Realtime Avatar: Meta le pone cara a su agente Muse, a 870 milisegundos por turno», que muestra la volanta «Meta Superintelligence Labs — 23 de septiembre de 2026», el titular y tres datos del artículo de investigación de Meta: vídeo vertical de 448×768 a 25 fps, unos 870 ms desde el final del turno hasta el primer byte, y 12 sesiones simultáneas en tiempo real en una NVIDIA GB200. Un subtítulo dice: «No es una cabeza parlante. Es una capa de renderizado sobre un modelo de voz». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Engineering & Research

Avatar en tiempo real de Muse: Meta le da un rostro a su agente Muse, a 870 milisegundos por turno

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El número con el que Meta eligió abrir es 870 milisegundos. Eso es lo que tarda Muse Realtime Avatar, según la propia medición de Meta, desde el momento en que dejas de hablar hasta el momento en que llega el primer byte de una respuesta sincronizada de voz y video. Es una cifra verdaderamente agresiva para un sistema que tiene que generar video, y vale la pena leerla con precisión —porque casi todo lo interesante del nuevo modelo de encarnación de Meta está en la brecha entre lo que ese número mide y lo que la gente supondrá que mide.

Muse Realtime Avatar se anunció el 23 de septiembre de 2026 en Meta Connect y Meta Superintelligence Labs lo describió ese mismo día en una publicación de investigación titulada "Dando vida a tu Muse". Extiende Muse Realtime Voice, la capa conversacional dentro del agente Muse de Meta, al darle un cuerpo. No es un chatbot con un avatar genérico: le entregas una imagen de referencia —una fotografía, una ilustración de cuerpo completo, un animal, un objeto doméstico— y renderiza esa cosa hablando, gesticulando y cambiando de postura en video continuo durante toda la conversación. Zuckerberg dijo en el escenario que el avatar asociado a su propio Muse se llama Jolly.

Un flujo de tokens compartido, no una pasada de sincronización labial

La arquitectura es la parte que merece la pena entender, porque explica por qué Meta sigue diciendo «embodiment» en lugar de «avatar». Muse Realtime Voice produce un flujo de tokens de habla —la publicación los llama VQs— que llevan tanto el contenido de lo que se dice como su prosodia: el ritmo, el énfasis, las subidas y bajadas. Muse Realtime Avatar consume ese mismo flujo. Es un Diffusion Transformer impulsado por audio, condicionado por esos tokens de habla, por los medios de referencia que proporcionaste y por una ventana móvil de latentes de vídeo recientes, y genera vídeo en pequeños fragmentos causales, pasando cada nuevo latente hacia delante como contexto de movimiento para el siguiente.

Compartir un único flujo de tokens es lo que mantiene la voz, el movimiento de los labios y la expresión sincronizados entre sí. La alternativa —generar el audio y luego aplicar sobre él un modelo de sincronización labial independiente— es como funciona la mayor parte de la industria de avatares, y es la razón por la que tantos de esos avatares parecen estar doblados. El diseño de Meta elimina esa costura por construcción. La ventana latente deslizante es la segunda mitad de la idea: sin ella, un generador basado en fragmentos deriva y, al minuto tres, tu personaje se ha convertido silenciosamente en otra persona.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Cuatro cifras publicadas, y qué mide realmente cada una

Meta publicó más cifras de lo habitual para una publicación de investigación vinculada a una función para consumidores. Las cuatro siguientes están reportadas por la propia empresa y fueron medidas por Meta con respecto a líneas base que Meta eligió; ninguna de ellas se ha reproducido fuera de la compañía.

870 ms desde el final del turno hasta el primer byte. Esta es una cifra de inicio de respuesta. No es el tiempo hasta una respuesta completa, y no es la latencia de entrega continua durante el resto de la llamada. Un sistema puede alcanzar 870 ms hasta el primer byte y aun así sentirse lento en el segundo doce. La publicación de Meta deja claro que esta es la medida del primer byte; la cobertura que omite el matiz lo interpreta como capacidad de respuesta de extremo a extremo, lo cual no es.

Vídeo vertical de 448×768 a 25 fotogramas por segundo. Ese es un marco alto con forma de teléfono, no uno apaisado, y 25 fps es cinematográfico en lugar de fluido: la tasa de fotogramas estándar del cine, por debajo de los 30 o 60 fps que le daría una señal de cámara nativa. Meta dice que las demos llevan una marca de agua con una superposición transparente para que el destinatario pueda notar que no está viendo una señal de cámara normal.

60× menos evaluaciones del modelo.Se explica adecuadamente a continuación, porque es la cifra que más probablemente se malinterprete.

12 sesiones simultáneas en tiempo real en una NVIDIA GB200. Meta informa que su trabajo de serving —cachés KV persistentes, enrutamiento consciente de la caché, batching dinámico consciente de la latencia, entrenamiento consciente de cuantización de cuatro bits, kernels fusionados y captura de CUDA Graph, desarrollados con NVIDIA— elevó la capacidad 8× respecto a su propia línea base BF16 de dos pasos. La aritmética que lo sustenta es clara: cada paso de generación produce ocho fotogramas, que equivalen a 320 ms de reproducción, en 20 ms de tiempo de modelo, o 2,5 ms por fotograma. Tanto el 12 como el 8× son respecto a la línea base especificada por Meta, no respecto al hardware de otro proveedor.

Por qué 60× no es 60× más rápido

La afirmación sobre la compresión es la que más se repetirá y menos se comprenderá. El modelo profesor de Meta era un modelo de difusión de 40 pasos con guía sin clasificador de tres vías —tres pasadas por paso, es decir, 120 evaluaciones del modelo para producir un fragmento de vídeo—. El estudiante es un modelo causal de dos pasos sin guía con una caché KV de longitud fija, entrenado mediante destilación y auto-forzado, y necesita dos evaluaciones para el mismo fragmento. Eso supone una reducción de 60× en las evaluaciones por fragmento con, en palabras de Meta, una calidad cercana a la del profesor.

Es una reducción de cómputo por fragmento. Sesenta veces menos evaluaciones no significa que un usuario espere la sexagésima parte del tiempo, porque la latencia tenía otros contribuyentes antes de la destilación y sigue teniéndolos después. El gráfico en la propia publicación de Meta muestra lo que la reducción compró en términos de calidad: la preferencia humana sube del 45 % al 55 %. Esa es la versión honesta de la historia: el objetivo de la destilación era conseguir un sistema que pudiera funcionar en tiempo real, sin más, y el costo en calidad se mantuvo en unos diez puntos de preferencia en lugar de eliminarse.

La evaluación, incluido el resultado que fue en sentido contrario

Meta se comparó con dos sistemas de avatares comerciales, Runway Characters y HeyGen LiveAvatar, utilizando identidades de avatar emparejadas para que los evaluadores compararan la animación y no el diseño del personaje. Los evaluadores mantuvieron conversaciones en vivo de dos a tres minutos con cada sistema y luego compararon la calidad visual, la sincronización, la consistencia del personaje y los gestos característicos.

Meta informa que se le prefiere 78% a 22% sobre Runway Characters y 88% a 12% sobre HeyGen LiveAvatar, y que es preferido en todas las dimensiones evaluadas. Luego, la publicación hace algo que la mayoría de las evaluaciones de proveedores no hacen: revela que la comparación de gestos y ademanes frente a Runway Characters no era estadísticamente distinguible de la paridad. Un empate dentro de una barrida es algo pequeño, pero es el detalle que te dice que la barrida se está reportando honestamente en lugar de haber sido seleccionada a conveniencia.

Los límites de la prueba importan más que el empate. Dos o tres minutos son una conversación corta. Los evaluadores eran de Meta. Y la propia publicación advierte que sus demostraciones «ilustran la capacidad del modelo y no todas reflejan los avatares disponibles en la aplicación Muse» —lo que equivale a que un equipo de investigación diga, sin rodeos, que el video que viste no es necesariamente el producto que obtendrás.

Lo que no puedes hacer con él

No hay API para Muse Realtime Avatar. No hay precio, ni tarifario, ni lista de espera, ni fecha de publicación. Meta no dijo cuándo podrán usarlo los usuarios ni los desarrolladores. La app Muse para mayores de 18 años es la única superficie a la que está destinada, y el avatar llega junto con un conjunto de otras funciones de Muse —personalización de voz, una dirección de correo electrónico de Muse, control de computadoras Mac, integración con gafas— que tienen sus propios cronogramas, algunas de ellas indicadas como "próximos meses".

La comparación que importa aquí no es con Runway ni HeyGen. Es con el resto del stack de Muse. Muse Spark, el modelo de razonamiento sobre el que corre el agente, está disponible para los desarrolladores desde que Meta lo abrió a través de la Meta Model API, y Muse Spark 1.2 se sirve a través de OrcaRouter como meta/muse-spark-1.2 a 1,25 $ por millón de tokens de entrada y 4,25 $ por millón de tokens de salida, precio de lista del proveedor sin ningún margen, dentro de una ventana de contexto de un millón de tokens que ya acepta texto, imágenes, vídeo, audio y archivos. Esa es la parte de Muse que puedes llamar hoy. La cara es la parte que no puedes.

Esa asimetría merece un momento de reflexión si estás planeando algo. Un agente que razona durante una videollamada y un agente que aparece en ella son productos distintos con restricciones distintas, y solo uno de ellos figura en una lista de tarifas.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

Qué ver a continuación

Tres cosas convertirían esto de un anuncio en una decisión. La primera es una fecha de lanzamiento para el avatar dentro de Muse, porque todo lo que Meta publicó es sobre un modelo, y nada de lo que publicó es sobre un producto que puedas usar un jueves. La segunda es una medición de latencia tomada a lo largo de una conversación larga en lugar de en el primer byte —870 ms es un pistoletazo de salida, y la pregunta que plantea una llamada real es qué ocurre en el minuto diez. La tercera es si el sistema mantiene el personaje bajo condiciones adversariales: un usuario que cambia de tema deliberadamente, va rápido o le proporciona una imagen de referencia diseñada para parecer una persona real.

Hasta entonces, el resumen honesto es el que la publicación de investigación insinúa sin decirlo. Muse Realtime Avatar es una pieza real de ingeniería con un resultado de compresión real detrás, demostrado en un entorno controlado, evaluado por la empresa que lo construyó, en conversaciones que duraron lo mismo que pedir un café. No es vaporware. Tampoco es algo que puedas comprar, enrutar o medir con benchmarks — y esas son afirmaciones distintas.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.