Una tarjeta destacada generada para el artículo 'Muse Realtime Avatar vs SeedRealtime', que muestra dos tarjetas redondeadas a cada lado del titular. La tarjeta izquierda dice 'Muse Realtime Avatar' sobre un icono de fotograma de vídeo saliente y las líneas 'genera el vídeo' y 'Meta, anunciado el 23 de septiembre'; la tarjeta derecha dice 'SeedRealtime' sobre un icono de pantalla y ojo y las líneas 've el vídeo' y 'ByteDance, lanzado el 5 de agosto'. Un subtítulo dice 'Ninguno de los dos tiene una tarjeta de tarifas'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Muse Realtime Avatar vs SeedRealtime: dos modelos que solo puedes ver

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ninguno de los dos tiene una lista de precios. Muse Realtime Avatar, anunciado por Meta el 23 de septiembre de 2026 en Meta Connect, no tiene API, ni endpoint, ni precio ni fecha: es una capacidad del agente Muse de Meta, mostrada en una publicación de investigación titulada «Bringing Your Muse to Life». SeedRealtime, lanzado por ByteDance Seed el 5 de agosto de 2026, no tiene API, ni pesos, ni informe técnico ni número de parámetros: existe dentro de la propia aplicación Doubao de ByteDance, y la publicación de ByteDance solo dice que se ha "desplegado por completo". Dos de las mayores empresas de IA de consumo del mundo lanzaron sistemas audiovisuales en tiempo real con siete semanas de diferencia entre sí, y ninguno de los dos se puede comprar. Esa es la comparación, y es más interesante que la tabla comparativa que nadie puede reproducir.

Lo que los separa es la dirección en la que fluye el video. SeedRealtime observa, escucha y habla sobre lo que ve —audio, video y texto en una única red de extremo a extremo, con la alternancia de turnos trasladada desde un detector externo de actividad de voz hacia el propio modelo. Muse Realtime Avatar genera: le entregas una imagen de referencia, una fotografía o una ilustración o un objeto, y renderiza a ese elemento hablando y gesticulando en video continuo durante toda la conversación. El video de SeedRealtime es entrada. El video de Muse Realtime Avatar es salida. A ambos se los describe como dúplex completo, ambos son audiovisuales, y están haciendo trabajos opuestos con la etiqueta.

Qué es cada uno y dónde vive

Seis líneas, y las dos últimas son las que deciden algo.

Vídeo — El avatar en tiempo real de Muse lo genera, con una resolución vertical de 448×768 y 25 fotogramas por segundo, con una marca de agua superpuesta transparente para que quien lo vea pueda notar que no es una señal de cámara; SeedRealtime lo percibe, transmitiendo los fotogramas a la misma red que gestiona el audio.

La apuesta arquitectónica — Muse Realtime Avatar comparte un único flujo de tokens entre voz y vídeo, de modo que un Diffusion Transformer impulsado por audio consume directamente los tokens de habla de Muse Realtime Voice y nada se sincroniza labialmente después; SeedRealtime integra la alternancia de turnos en el modelo, de modo que quién habla y cuándo deja de ser decisión de un detector externo de actividad de voz.

Dónde se ejecuta — Muse Realtime Avatar es una capacidad dentro del agente Muse de Meta; SeedRealtime está dentro de la app Doubao de ByteDance.

Acceso para desarrolladores — ninguna tiene API. Ninguna publica sus pesos. No existe una opción sin servidor, ni un endpoint alojado, ni una plataforma de terceros que ofrezca ninguna de las dos.

Precio — no publicado para ninguno de los dos, porque no existe oferta comercial por ninguna de las partes.

Evaluación independiente — ninguna para ninguno de los dos sistemas. Todas las cifras que cada empresa ha publicado sobre su propio modelo son de origen propio, y ningún evaluador externo ha probado ninguno de los dos.

Dos bases de evidencia, ambas de primera parte, y una de ellas es mucho más endeble.

Aquí la comparación deja de ser simétrica. Meta publicó cuatro cifras para Muse Realtime Avatar, todas reportadas por la empresa, medidas frente a líneas base que Meta eligió, ninguna reproducida fuera de la compañía: 870 ms desde el final de tu turno hasta el primer byte de una respuesta sincronizada de voz y video; video vertical de 448×768 a 25 fotogramas por segundo; 60× menos evaluaciones del modelo que su propia línea base; y 12 sesiones simultáneas en tiempo real en una NVIDIA GB200, una ganancia de capacidad de 8× sobre la línea base BF16 de dos pasos de Meta gracias al entrenamiento consciente de la cuantización de cuatro bits y al batching dinámico consciente de la latencia. Meta también publicó una comparación de preferencias frente a dos sistemas de avatares comerciales —78/22 frente a uno, 88/12 frente al otro— y reveló que, en manierismos, el resultado frente a uno de ellos no es estadísticamente distinguible de la paridad. Esa revelación vale más que las victorias; es el tipo de resultado que la mayoría de las publicaciones de lanzamiento omite.

La evidencia publicada por SeedRealtime es una evaluación humana de extremo a extremo. ByteDance afirma que, frente a sistemas en cascada —un modelo de visión conectado a un modelo ASR conectado a un LLM conectado a una voz de texto a voz—, SeedRealtime reduce a la mitad los problemas de ritmo conversacional audiovisual, con menos cortes, menos activaciones falsas y respuestas más lentas y naturales. Lo que ByteDance no ha publicado es un tamaño de muestra, una metodología, un número de anotadores, una cifra de latencia en milisegundos, un nombre de benchmark o una puntuación. Un informe secundario cita una mejora del 12 % en fluidez conversacional respecto a los modelos anteriores del equipo. Esa es toda la base de evidencia pública.

Así que la clasificación honesta de las ejecuciones de verificabilidad es esta: ninguna tiene una ejecución independiente; la de Meta es un conjunto de mediciones con líneas base declaradas y un resultado negativo divulgado; la de ByteDance es una única afirmación de preferencia cuyo diseño no se describe. Ninguna es reproducible, pero solo una de ellas es lo suficientemente específica como para discutirla.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

El movimiento que hizo cada uno

Ambos sistemas son respuestas al mismo problema, y vale la pena ver que las dos respuestas son diferentes.

Para un sistema que observa, lo difícil es saber cuándo hablar. Un modelo que recibe continuamente fotogramas de cámara y audio tiene que decidir, sin un desencadenante externo, si la persona que tiene delante ha terminado, si se le ha dirigido la palabra y si el objeto que acaba de entrar en el encuadre es relevante. Ese es el problema que SeedRealtime trasladó al interior del modelo, y ByteDance hizo el movimiento a través de tres modalidades en lugar de dos, una versión más difícil de lo que Google, OpenAI y NVIDIA hicieron cada uno solo con audio. Los comportamientos de la demo se derivan de esto: vincular una voz a una cara en una conversación grupal, tomar la palabra sin que se le pida cuando algo entra en el encuadre, guiar a alguien por un museo o durante una reparación.

Para un sistema que renderiza, la parte difícil es mantenerse coherente. Generar video en fragmentos causales cortos significa que cada fragmento está condicionado al anterior, y el modo de fallo es la deriva: al minuto tres, el personaje se ha convertido silenciosamente en otra persona. La ventana móvil de Meta de latentes de video recientes es la respuesta a eso, y el flujo de tokens compartido es la respuesta a un fallo diferente: el aspecto de doblaje que se obtiene cuando se genera primero el audio y después se le aplica un modelo de sincronización labial.

Ninguno de los dos movimientos está disponible en el otro sistema. SeedRealtime no tiene una imagen de referencia a la que mantenerse fiel, porque no está renderizando a nadie. Muse Realtime Avatar no tiene un mundo externo que rastrear, porque su única tarea es producir una cara que coincida con una voz.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

Por qué un modelo que no se puede invocar sigue siendo una cuestión de enrutamiento

Ambos sistemas delegan. Muse Realtime Avatar se asienta sobre Muse Realtime Voice, que es la capa conversacional de un agente cuyo razonamiento se ejecuta en Muse Spark: el modelo se encarga del renderizado, no del razonamiento. El diseño de SeedRealtime mantiene la conversación en marcha mientras ocurre el trabajo en segundo plano, lo que significa que el trabajo que supera lo que puede hacer de forma inmediata va a otro lugar y regresa. En ambas arquitecturas, aquello con lo que interactúa el usuario es una interfaz, y la inteligencia es un modelo de texto separado detrás de ella.

Ese modelo de texto aparte es inferencia ordinaria, y es la parte del stack que realmente puedes comprar. En OrcaRouter es un único endpoint que abarca 196 modelos de 15 proveedores, al precio de lista del proveedor, traspasado sin ningún margen, con conmutación automática cuando el modelo que elegiste da error o se agota el tiempo de espera. Nosotros no alojamos SeedRealtime — es de ByteDance, dentro de Doubao, y no hay nada que enrutar. Tampoco alojamos Muse Realtime Avatar, y nadie más lo hace. Lo que ofrecemos es la capa a la que ambos sistemas entregan su trabajo pesado, que es la capa que cambia cuando quieres que sea otro modelo el que piense.

¿Qué cambiaría la respuesta?

Para SeedRealtime, la pieza que falta no es una característica — es la evidencia. Un informe técnico con un recuento de parámetros, una suite de benchmarks y una evaluación humana descrita lo movería de "una demostración dentro de una aplicación" a algo sobre lo que un equipo podría razonar. La publicación de ByteDance también enlaza destinos genéricos "Prueba Dola" y "Probar en Playground" sin reclamar pesos ni una API documentada, que es el patrón de una característica de producto en lugar de un lanzamiento de modelo.

Para Muse Realtime Avatar, la pieza que falta es comercial: una lista de tarifas, un endpoint, una fecha y los términos de región y edad que Meta no ha explicitado por completo. La publicación de Meta señala que no todas sus demos reflejan los avatares disponibles en la app Muse, que es la frase que debería regir cualquier plan construido en torno a esto.

Hasta que una de esas cosas cambie, la comparación tiene una forma inusualmente breve. Ambos modelos son audiovisuales, ambos son full-duplex, ambos son ingeniería genuinamente impresionante, y ninguno puede ser invocado desde una terminal por cualquiera que esté leyendo esto. La diferencia es lo que harías con ellos si pudieras: uno te da un personaje que habla, y el otro te da un sistema que se da cuenta.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.