Una tarjeta principal generada para el artículo «Muse Realtime Avatar vs Realtime-Venus», que muestra dos tarjetas redondeadas a cada lado del titular. La tarjeta izquierda dice «Muse Realtime Avatar» sobre un icono de fotograma de vídeo saliente y las líneas «generates the video» y «448x768 at 25 fps, closed»; la tarjeta derecha dice «Realtime-Venus» sobre un icono de cámara entrante y las líneas «reads the video» y «2 x 9B, Apache-2.0, downloadable». Un subtítulo dice «One renders a face. The other watches one.». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.

Hmm — should the quoted strings inside be translated? They are literal UI text of the card, quoted. Localization engine would typically translate the descriptions but quoted on-screen text... The instruction says translate the user's message into Spanish. Quoted UI labels are part of the content. I think translating them makes sense since they're descriptive text, but they are literal readings. Hmm. "The left card reads 'generates the video'" — I'd translate as «genera el vídeo». Given it's a localization of a descriptive caption, translating quoted UI strings is generally appropriate... but risky if they're actual UI text. I'd lean to translate them, since the whole sentence is prose describing the card, and a Spanish reader wants to understand. Actually, careful: the quoted strings like 'Muse Realtime Avatar' and 'Realtime-Venus' are brand/product names — keep. 'Apache-2.0' keep. '448x768 at 25 fps, closed' — technical specs, could translate "closed" → "cerrado". 'generates the video' → 'genera el vídeo'. 'reads the video' → 'lee el vídeo'. '2 x 9B, Apache-2.0, downloadable' → '2 x 9B, Apache-2.0, descargable'.

The subtitle 'One renders a face. The other watches one.' → 'Uno renderiza una cara. El otro observa una.' That's the natural translation.

I'll translate them, keeping brand names. Use Spanish quotes. I'll go with translated quoted strings.

Hmm, but which is safer? The task is localization, so translating the UI strings is right.

Final output.Una tarjeta principal generada para el artículo «Muse Realtime Avatar vs Realtime-Venus», que muestra dos tarjetas redondeadas a ambos lados del titular. La tarjeta izquierda dice «Muse Realtime Avatar» sobre un icono de fotograma de vídeo saliente y las líneas «genera el vídeo» y «448x768 a 25 fps, cerrado»; la tarjeta derecha dice «Realtime-Venus» sobre un icono de cámara entrante y las líneas «lee el vídeo» y «2 x 9B, Apache-2.0, descargable». Un subtítulo dice «Uno renderiza una cara. El otro observa una». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Muse Realtime Avatar vs Realtime-Venus: Salida de vídeo frente a entrada de vídeo

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos sistemas anunciados con nueve días de diferencia se autodenominan en tiempo real y ambos reivindican la etiqueta audiovisual, y apuntan en direcciones opuestas a lo largo del mismo eje. Muse Realtime Avatar, anunciado por Meta el 23 de septiembre de 2026, toma una fotografía y genera un vídeo de ella hablando —su vídeo es la salida, fotogramas verticales de 448×768 a 25 por segundo, producidos por un Transformer de difusión impulsado por audio que comparte un flujo de tokens con Muse Realtime Voice. Realtime-Venus, subido a arXiv el 12 de septiembre de 2026 por el Venus Team de Ant Group junto con la Universidad de Tsinghua, consume vídeo: el checkpoint Realtime-Venus-Omni transmite fotogramas de cámara a través de un codificador SigLIP2 y habla sobre lo que ve, mientras que el checkpoint Realtime-Venus-Audio es el mismo backbone con la visión desactivada en el momento de la carga. Uno renderiza una cara. El otro observa una. Ninguno es invocable, y solo uno de ellos es descargable, lo que resulta ser la diferencia más determinante.

Vale la pena exponer sin rodeos la inversión de disponibilidad antes que nada, porque va en contra de todas las expectativas sobre un producto de Meta y un lanzamiento de un laboratorio de investigación. El sistema de Meta está cerrado: anunciado en Connect, demostrado en una publicación de investigación, integrado en el agente Muse, sin API, sin pesos, sin precio y sin fecha. El sistema de Ant Group es abierto: dos checkpoints de 9B como safetensors BF16 bajo Apache-2.0 en inclusionAI/Realtime-Venus en Hugging Face, con código personalizado de Transformers, un archivo de requisitos, una voz de referencia, una página de proyecto y un repositorio complementario en GitHub. La empresa con el producto de consumo no lanzó nada que puedas tener en tus manos. El equipo de investigación lanzó todo.

Qué hace cada uno con un marco

La dirección del video es toda la diferencia arquitectónica, y no es una cuestión de énfasis.

Vídeo — Muse Realtime Avatar lo genera, condicionado por tokens de voz, una imagen de referencia y una ventana móvil de latentes de vídeo recientes; Realtime-Venus-Omni lo percibe, con un codificador visual SigLIP2 que transmite fotogramas al modelo junto con el audio.

Audio — Muse Realtime Avatar impulsa la generación a partir de los tokens de habla de Muse Realtime Voice, que transportan el contenido y la prosodia juntos; Realtime-Venus genera el habla como tokens S3 discretos decodificados por un decodificador de flow-matching en streaming, en lugar de añadir al final un modelo independiente de texto a voz.

Backbone — la arquitectura de Meta es un Diffusion Transformer guiado por audio de tamaño no revelado; Realtime-Venus se construye sobre un backbone de lenguaje Qwen3-8B con un codificador de audio Whisper-Medium, y su model card indica que el checkpoint Omni está adaptado de MiniCPM-o 4.5.

Pesos — Los Muse Realtime Avatar no están publicados y no hay indicios de que vayan a estarlo; Realtime-Venus incluye dos checkpoints de 9B, BF16, con un contexto de 40.960 tokens en ambos, bajo Apache-2.0.

Acceso — Muse Realtime Avatar no tiene API ni fecha; Realtime-Venus tampoco tiene API, y su ficha indica claramente que no está desplegado por ningún proveedor de inferencia.

Dónde se ejecuta — Muse Realtime Avatar se ejecuta dentro de la aplicación Muse para los usuarios que Meta no ha enumerado, bajo términos 18+; Realtime-Venus se ejecuta en tus propias GPU, hoy mismo, si tienes el hardware y las ganas.

Lee juntas las dos últimas líneas y la diferencia práctica se hace evidente. A ninguno de los dos sistemas se puede llamar. Uno de ellos se puede ejecutar.

La descarga de 9B es real, y también lo es lo que te cuesta.

Realtime-Venus no es un stub de repositorio. Los pesos están ahí, el código de carga personalizado está ahí, y la licencia en el nivel superior es Apache-2.0. Hay dos cosas al respecto que conviene saber antes de hacer planes en torno a él.

Lo primero es lo que no está en los pesos. El runtime de doble bucle que hace que la arquitectura sea singular —el bucle de interacción de un segundo más un planificador en segundo plano que el artículo denomina Realtime-Venus-Harness, el cual ejecuta tareas delegadas contra una instantánea aislada del estado de la conversación, de modo que un trabajo de larga duración no pueda verse corrompido porque la conversación siga avanzando— reside en el repositorio de GitHub como un componente aparte. El diseño de delegación, que es la idea verdaderamente nueva del informe, es la parte que ensamblas y de la que te fías tú mismo.

Lo segundo es el linaje. La ficha indica que el checkpoint Omni está adaptado de MiniCPM-o 4.5, el modelo omnimodal de 9B que OpenBMB publicó como código abierto a principios de 2026. Eso no es una nota al pie. Significa que la contribución de Ant Group es el postentrenamiento, el runtime y el diseño de delegación superpuestos sobre el backbone de streaming de otro, lo que es una afirmación más acotada y específica que «un nuevo modelo omni de 9B» —y más útil, porque te dice dónde mirar si algo en el codificador visual se comporta mal.

Los números, y exactamente de quién son

Aquí es donde los dos sistemas convergen de una manera poco útil: ninguno cuenta con una sola evaluación independiente. Las cuatro cifras de Meta son reportadas por la empresa frente a líneas base seleccionadas por Meta. Las de Realtime-Venus son reportadas por sus autores en un informe técnico, sin que ningún tercero haya publicado una ejecución y sin ninguna entrada de tabla de clasificación contra la que verificar. No existe ninguna medición pública de ninguno de los dos sistemas hecha por alguien que no lo haya construido.

Los cuatro de Meta, tal como se publicaron: 870 ms desde el final de tu turno hasta el primer byte de una respuesta sincronizada de voz y video; video vertical de 448×768 a 25 fotogramas por segundo; 60 veces menos evaluaciones de modelo que su propia línea base; y 12 sesiones simultáneas en tiempo real en una NVIDIA GB200, una ganancia de capacidad de 8× sobre la línea base BF16 de dos pasos de Meta. Meta también divulga resultados de preferencia frente a dos sistemas de avatar comerciales, uno de los cuales informa como no estadísticamente distinguible de la paridad en manierismos — una divulgación que merece crédito, ya que es el tipo de resultado que la mayoría de las publicaciones de lanzamiento omiten.

De Ant Group, según lo publicado: la mejor puntuación en seis de los ocho benchmarks de vídeo que utiliza el informe, incluidos StreamingBench 70,2, OVO-Bench 64,7 y Daily-Omni 81,3 para el checkpoint Omni; y para el checkpoint Audio, MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8 y una puntuación de 4,81 en VoiceBench AlpacaEval que el informe describe como equiparable a la mejor cifra de comparación.

Una asimetría en la evidencia merece ser mencionada. Las cifras de Ant Group son puntuaciones de referencia con conjuntos de pruebas con nombre — reproducibles en principio, por cualquiera dispuesto a descargar los pesos y ejecutar la suite. La cifra principal de Meta es una medición de latencia en la propia pila de servicio de Meta, que nadie fuera de Meta puede reproducir porque nadie fuera de Meta tiene el sistema. La publicación abierta, en otras palabras, es también la más verificable.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

Por qué ambos son en realidad un problema de enrutamiento disfrazado

Ninguno de los dos sistemas es un agente completo, y eso es cierto de la misma manera para ambos. Muse Realtime Avatar es una capa de renderizado acoplada a Muse Realtime Voice, que es la capa conversacional de un agente cuyo razonamiento se ejecuta en Muse Spark. Realtime-Venus delega todo lo que excede lo que puede hacer de forma inmediata —recuperación, llamadas a herramientas, razonamiento complejo— a un entorno de ejecución que realiza el trabajo en segundo plano a partir de una instantánea de la conversación. En ambos diseños, aquello con lo que habla el usuario es una interfaz, y el pensamiento ocurre en un modelo de texto aparte.

Ese modelo de texto separado es la parte que puedes enrutar. En OrcaRouter es un único endpoint para 196 modelos de 15 proveedores, a precio de lista del proveedor transferido sin ningún recargo, con conmutación por error automática cuando un modelo falla o se agota el tiempo de espera — lo cual importa más de lo habitual cuando lo que está al otro lado es un checkpoint autoalojado que nadie ha evaluado de forma independiente. Nosotros no alojamos Realtime-Venus: es una descarga, y no lo servimos. Tampoco alojamos Muse Realtime Avatar, porque nadie lo hace. Lo que ofrecemos es la capa a la que ambas arquitecturas confían su trabajo pesado, de modo que un componente no probado en cualquiera de los dos lados de la conversación es una línea de configuración en lugar de una apuesta de producción.

¿Cuál de estos está realmente más avanzado?

El instinto es decir que el de Meta, porque Meta tiene el producto y el video de demostración. La evidencia dice algo más interesante. El sistema de Meta tiene mejor ingeniería de producción —12 sesiones simultáneas en un GB200 es un resultado de servicio, y las pruebas de preferencia divulgadas frente a productos de avatares ya comercializados son las únicas cifras comparativas directas que tiene cualquiera de los dos sistemas. El sistema de Ant Group tiene mejor verificabilidad: benchmarks con nombre, pesos publicados, una licencia Apache-2.0 y un informe que cualquiera puede intentar reproducir.

Lo que ninguno de los dos tiene es una forma de pagarlo. Y el que está más cerca de ser utilizable no es el que tiene la app de consumo: es el que puedes descargar esta noche y descubrirlo por ti mismo, en tu propio hardware, con tus propios datos y sin necesidad de ningún anuncio.

Si estás eligiendo, la pregunta no es qué modelo es mejor. Es si quieres una cara a la que no puedes llamar o una cámara que puedes ejecutar.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.