
Muse Realtime Avatar: qué construyó Meta, sobre qué funciona y por qué sigues sin poder llamarlo
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 1009 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- OrcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Muse Realtime Avatar es la tecnología de encarnación de Meta. Toma el flujo de voz que Muse Realtime Voice produce y renderiza la actuación correspondiente: apúntalo a un retrato fotográfico y la cara responde con pequeños cambios de expresión; apúntalo a una ilustración de cuerpo entero y la figura gesticula y cambia de postura mientras habla. Meta AI Research lo presentó el 23 de septiembre de 2026 en una publicación titulada «Bringing Your Muse to Life». Es un resultado de investigación más que un producto —la propia página de Meta no ofrece API, ni precio, ni lista de espera, ni fecha de publicación—, así que la respuesta honesta a «¿puedo usarlo hoy?» es no. El modelo Muse que puedes invocar hoy es otro, Meta Muse Spark 1.2.
Esa respuesta merece exponerse en el primer párrafo y no en el último, porque quien busca este nombre suele estar decidiendo si planificar en torno a ello. Planifica en torno a la investigación, no en torno a un criterio de valoración.
Una cosa que decir con claridad antes que nada, porque esta página rompe una regla que debería admitir. Este blog normalmente escribe sobre modelos en la semana en que se lanzan. Muse Realtime Avatar se anunció una semana antes de que se publicara esta página, así que, en una lectura estricta de la ventana de actualidad, se omitiría el elemento. Este no es un artículo de noticias sobre un evento con fecha. Es la página de referencia de un modelo que está vivo en la conversación del catálogo hoy: la página a la que llega un lector después de escribir el propio nombre del modelo, cuyo aval es la demanda de búsqueda constante que medimos nosotros mismos, en lugar de la actualidad de un lanzamiento. El anuncio de septiembre se nombra aquí como un hecho que fecha el modelo, no como un evento que deba reportarse, y nada de lo que sigue es un segundo anuncio. Nuestra cobertura de ese día es una pieza aparte y permanece aparte.
Dónde se sitúa en la familia Muse
Meta es explícito en que estas son dos capas de un mismo sistema, no dos productos. En palabras de Meta, «Muse Realtime Voice y Muse Realtime Avatar forman un único sistema de streaming que conecta inteligencia, voz y corporeidad». La capa de voz proporciona la inteligencia conversacional y emite un flujo de tokens de habla —Meta los llama VQs— que transportan tanto lo que se dice como cómo se dice. Un decodificador de audio convierte esos tokens en sonido, y la capa de avatar consume el mismo flujo para generar la imagen. Compartir un único flujo de tokens es lo que mantiene sincronizados la voz, el movimiento de los labios y la expresión; no hay una pasada de sincronización labial independiente añadida a posteriori.
Entonces: Muse Realtime Voice es la capa conversacional. Muse Realtime Avatar es la capa de encarnación construida sobre ella. Ninguna de las dos es aquello a lo que puedes llamar.
Ten el mismo cuidado con un nombre vecino, porque es el que más probabilidades tiene de confundirse con cualquiera de los dos. Muse Voice Transcribe es un endpoint de transcripción, y es un producto genuinamente distinto. La documentación para desarrolladores de Meta es inequívoca: «Es únicamente de voz a texto; no sintetiza voz ni proporciona una API de conversación de voz a voz». Devuelve marcas de tiempo a nivel de turno y no a nivel de palabra, y Meta lo lista a $0.18 por hora en esa página. Es un endpoint real y con precio. No es una voz, y desde luego no es un avatar.
El modelo Muse que realmente se puede invocar es Meta Muse Spark 1.2, el modelo de razonamiento que Meta ofrece con un contexto de un millón de tokens y entrada de texto, imagen, video, archivo y audio. Ese sí es enrutable aquí hoy, al precio de lista del proveedor y sin ningún margen, con la misma clave que todo lo demás del catálogo, y su ficha en vivo incluye la especificación completa. No ofrecemos Muse Realtime Avatar. Volvimos a consultar la lista de modelos en vivo mientras escribíamos esto y las únicas entradas de Muse que figuran en ella son los dos checkpoints de Spark, 1.2 y su predecesor 1.1. Decir algo más suave que eso —que la familia está "parcialmente disponible"— implicaría que enrutamos algo que no enrutamos.

La tecnología, expresada en los propios términos de Meta
La descripción de Meta de la arquitectura es lo suficientemente compacta como para citarla en lugar de parafrasearla. Muse Realtime Avatar es "un Transformer de difusión impulsado por audio, condicionado por un flujo de tokens de habla, medios de referencia y una ventana móvil de latentes de video recientes", y "genera video en fragmentos causales cortos". La segunda mitad de esa frase es la parte fundamental: a medida que se completa cada fragmento, sus latentes generados más recientes se convierten en el contexto de movimiento para el siguiente. La razón que da Meta es la continuidad: la apariencia y los gestos del avatar se mantienen a lo largo de los turnos mientras el cómputo permanece acotado, lo que permite que la generación continúe durante tanto tiempo como dure la conversación en lugar de desviarse o quedarse sin presupuesto.
El mecanismo de procedencia pertenece al mismo párrafo porque Meta lo presenta como parte del sistema y no como algo añadido a posteriori: el vídeo generado lleva una marca de agua duradera e invisible aplicada mediante Meta Video Seal, que, según Meta, no añade latencia a la ruta en tiempo real.
Meta midió esto y publicó cuatro cifras al respecto. Esas cifras —y las salvedades específicas que cada una necesita, incluida la que se lee como una aceleración y no lo es— pertenecen al artículo de lanzamiento, que las presenta con su contexto intacto. No vamos a repetir aquí las cifras desnudas, porque una cifra desnuda es exactamente lo que la versión con salvedades existe para evitar.
Cubrimos el anuncio ese mismo día en nuestro artículo sobre el lanzamiento de Muse Realtime Avatar, y sigue siendo el lugar donde leer las afirmaciones mesuradas en su totalidad.
Lo que el nombre no es
Vale la pena descartar tres falsos vecinos uno a uno, porque cada uno de ellos es una conjetura razonable solo a partir del nombre.
No es Muse Voice Transcribe. Ese endpoint convierte voz en texto y, según la propia descripción de Meta, no hace nada en sentido contrario. Si lo que necesitas es una transcripción, Meta vende una, y es una cosa distinta con un precio distinto.
• No es un servicio de clonación de voz. Nada en las páginas de Meta describe sintetizar la voz de una persona concreta, vender un modelo de voz o aceptar una muestra de voz de un usuario. La capa de voz se describe como aquella que produce un flujo de tokens; la capa de avatar se describe como aquella que consume uno. La forma de producto que esa frase suele implicar —subir una muestra, obtener un clon— no es lo que se describe aquí, y el material de demostración que Meta sí publica se enmarca como ilustración de la capacidad del modelo.
• No es un avatar de consumidor en la propia app de Meta. Meta acompaña sus ejemplos con una advertencia que es fácil pasar por alto y que vale la pena conservar: las demostraciones "ilustran la capacidad del modelo y no todas reflejan los avatares disponibles en la app Muse", y Muse es para usuarios de 18 años o más. Léelo al pie de la letra. Parte de lo que muestra la publicación es capacidad, no inventario.
Un cuarto nombre merece separarse por una razón diferente. Muse Realtime Avatar no es Muse Video, el modelo de generación de video que ha estado en una tabla de clasificación pública durante la mayor parte de este año sin lanzarse. Nuestra propia página sobre esa situación —Muse Video: fecha de lanzamiento, acceso a la API y qué podría cambiar Meta Connect— incluye una restricción que repetiremos aquí textualmente en lugar de mejorarla: cualquier página que cite un día de lanzamiento específico o un precio para Muse Video sin un anuncio más reciente de Meta está especulando. La misma disciplina se aplica al tema de esta página, así que esta página no cita ninguno de los dos. Ese artículo también proporciona la fecha que no nos corresponde confundir: Muse Video se presenta en avance el 7 de julio de 2026 y no se ha lanzado, por lo que una búsqueda de esta familia arroja fechas que pertenecen a un modelo diferente.

Para qué sirve esta página y qué la cambiaría
La razón por la que una página de referencia es la forma correcta aquí es medible. En los 28 días hasta el 25 de septiembre de 2026, el término exacto generó 164 impresiones en nuestra propiedad de búsqueda y ningún clic, con su mejor posición en 9,3. Más de cincuenta de nuestras páginas mencionan el fragmento en algún lugar, y casi todo ese tráfico aterriza en una única publicación de anuncio. Un término con demanda real y sostenida, que se posiciona justo fuera de la primera página y no convierte a nadie, no es un problema de demanda ni un problema de calidad: es un problema de página. No había ninguna página cuyo tema fuera el propio modelo. Esta es esa página.
La posición también es la razón por la que nada aquí se disfraza de noticia. Un lector que llega desde una búsqueda por nombre quiere tres cosas en orden: qué es esto, si está disponible y sobre qué está construido. Se responden arriba, en ese orden, sin inventar fechas y sin nombrar a ningún competidor.

Lo que cambiaría la página es un solo anuncio. Si Meta publica un endpoint, un precio, una lista de espera o una fecha para Muse Realtime Avatar, la sección de disponibilidad deja de ser un «no» y se convierte en una especificación, y esta página se reescribe en lugar de ampliarse. Si Meta lanza Muse Video, el párrafo anterior cambia con él. Hasta que ocurra cualquiera de las dos cosas, el movimiento útil para un desarrollador es el poco glamuroso: mantener la interfaz que ya tiene apuntando al modelo al que realmente puede acceder. Todos los modelos del catálogo, incluido Meta Muse Spark 1.2, están detrás de un endpoint compatible con OpenAI y una clave, lo que significa que probar la parte de esta familia que existe te cuesta un cambio en la cadena del modelo en lugar de un contrato nuevo. Cuando la capa de encarnación sea invocable, el costo de cambio también debería ser una cadena.
