
Muse Realtime Avatar vs Realtime-Venus: Salida de vídeo frente a entrada de vídeo
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 180 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Dos sistemas anunciados con nueve días de diferencia se autodenominan en tiempo real y ambos reivindican la etiqueta audiovisual, y apuntan en direcciones opuestas a lo largo del mismo eje. Muse Realtime Avatar, anunciado por Meta el 23 de septiembre de 2026, toma una fotografía y genera un vídeo de ella hablando —su vídeo es la salida, fotogramas verticales de 448×768 a 25 por segundo, producidos por un Transformer de difusión impulsado por audio que comparte un flujo de tokens con Muse Realtime Voice. Realtime-Venus, subido a arXiv el 12 de septiembre de 2026 por el Venus Team de Ant Group junto con la Universidad de Tsinghua, consume vídeo: el checkpoint Realtime-Venus-Omni transmite fotogramas de cámara a través de un codificador SigLIP2 y habla sobre lo que ve, mientras que el checkpoint Realtime-Venus-Audio es el mismo backbone con la visión desactivada en el momento de la carga. Uno renderiza una cara. El otro observa una. Ninguno es invocable, y solo uno de ellos es descargable, lo que resulta ser la diferencia más determinante.
Vale la pena exponer sin rodeos la inversión de disponibilidad antes que nada, porque va en contra de todas las expectativas sobre un producto de Meta y un lanzamiento de un laboratorio de investigación. El sistema de Meta está cerrado: anunciado en Connect, demostrado en una publicación de investigación, integrado en el agente Muse, sin API, sin pesos, sin precio y sin fecha. El sistema de Ant Group es abierto: dos checkpoints de 9B como safetensors BF16 bajo Apache-2.0 en inclusionAI/Realtime-Venus en Hugging Face, con código personalizado de Transformers, un archivo de requisitos, una voz de referencia, una página de proyecto y un repositorio complementario en GitHub. La empresa con el producto de consumo no lanzó nada que puedas tener en tus manos. El equipo de investigación lanzó todo.
Qué hace cada uno con un marco
La dirección del video es toda la diferencia arquitectónica, y no es una cuestión de énfasis.
• Vídeo — Muse Realtime Avatar lo genera, condicionado por tokens de voz, una imagen de referencia y una ventana móvil de latentes de vídeo recientes; Realtime-Venus-Omni lo percibe, con un codificador visual SigLIP2 que transmite fotogramas al modelo junto con el audio.
• Audio — Muse Realtime Avatar impulsa la generación a partir de los tokens de habla de Muse Realtime Voice, que transportan el contenido y la prosodia juntos; Realtime-Venus genera el habla como tokens S3 discretos decodificados por un decodificador de flow-matching en streaming, en lugar de añadir al final un modelo independiente de texto a voz.
• Backbone — la arquitectura de Meta es un Diffusion Transformer guiado por audio de tamaño no revelado; Realtime-Venus se construye sobre un backbone de lenguaje Qwen3-8B con un codificador de audio Whisper-Medium, y su model card indica que el checkpoint Omni está adaptado de MiniCPM-o 4.5.
• Pesos — Los Muse Realtime Avatar no están publicados y no hay indicios de que vayan a estarlo; Realtime-Venus incluye dos checkpoints de 9B, BF16, con un contexto de 40.960 tokens en ambos, bajo Apache-2.0.
• Acceso — Muse Realtime Avatar no tiene API ni fecha; Realtime-Venus tampoco tiene API, y su ficha indica claramente que no está desplegado por ningún proveedor de inferencia.
• Dónde se ejecuta — Muse Realtime Avatar se ejecuta dentro de la aplicación Muse para los usuarios que Meta no ha enumerado, bajo términos 18+; Realtime-Venus se ejecuta en tus propias GPU, hoy mismo, si tienes el hardware y las ganas.
Lee juntas las dos últimas líneas y la diferencia práctica se hace evidente. A ninguno de los dos sistemas se puede llamar. Uno de ellos se puede ejecutar.
La descarga de 9B es real, y también lo es lo que te cuesta.
Realtime-Venus no es un stub de repositorio. Los pesos están ahí, el código de carga personalizado está ahí, y la licencia en el nivel superior es Apache-2.0. Hay dos cosas al respecto que conviene saber antes de hacer planes en torno a él.
Lo primero es lo que no está en los pesos. El runtime de doble bucle que hace que la arquitectura sea singular —el bucle de interacción de un segundo más un planificador en segundo plano que el artículo denomina Realtime-Venus-Harness, el cual ejecuta tareas delegadas contra una instantánea aislada del estado de la conversación, de modo que un trabajo de larga duración no pueda verse corrompido porque la conversación siga avanzando— reside en el repositorio de GitHub como un componente aparte. El diseño de delegación, que es la idea verdaderamente nueva del informe, es la parte que ensamblas y de la que te fías tú mismo.
Lo segundo es el linaje. La ficha indica que el checkpoint Omni está adaptado de MiniCPM-o 4.5, el modelo omnimodal de 9B que OpenBMB publicó como código abierto a principios de 2026. Eso no es una nota al pie. Significa que la contribución de Ant Group es el postentrenamiento, el runtime y el diseño de delegación superpuestos sobre el backbone de streaming de otro, lo que es una afirmación más acotada y específica que «un nuevo modelo omni de 9B» —y más útil, porque te dice dónde mirar si algo en el codificador visual se comporta mal.
Los números, y exactamente de quién son
Aquí es donde los dos sistemas convergen de una manera poco útil: ninguno cuenta con una sola evaluación independiente. Las cuatro cifras de Meta son reportadas por la empresa frente a líneas base seleccionadas por Meta. Las de Realtime-Venus son reportadas por sus autores en un informe técnico, sin que ningún tercero haya publicado una ejecución y sin ninguna entrada de tabla de clasificación contra la que verificar. No existe ninguna medición pública de ninguno de los dos sistemas hecha por alguien que no lo haya construido.
Los cuatro de Meta, tal como se publicaron: 870 ms desde el final de tu turno hasta el primer byte de una respuesta sincronizada de voz y video; video vertical de 448×768 a 25 fotogramas por segundo; 60 veces menos evaluaciones de modelo que su propia línea base; y 12 sesiones simultáneas en tiempo real en una NVIDIA GB200, una ganancia de capacidad de 8× sobre la línea base BF16 de dos pasos de Meta. Meta también divulga resultados de preferencia frente a dos sistemas de avatar comerciales, uno de los cuales informa como no estadísticamente distinguible de la paridad en manierismos — una divulgación que merece crédito, ya que es el tipo de resultado que la mayoría de las publicaciones de lanzamiento omiten.
De Ant Group, según lo publicado: la mejor puntuación en seis de los ocho benchmarks de vídeo que utiliza el informe, incluidos StreamingBench 70,2, OVO-Bench 64,7 y Daily-Omni 81,3 para el checkpoint Omni; y para el checkpoint Audio, MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8 y una puntuación de 4,81 en VoiceBench AlpacaEval que el informe describe como equiparable a la mejor cifra de comparación.
Una asimetría en la evidencia merece ser mencionada. Las cifras de Ant Group son puntuaciones de referencia con conjuntos de pruebas con nombre — reproducibles en principio, por cualquiera dispuesto a descargar los pesos y ejecutar la suite. La cifra principal de Meta es una medición de latencia en la propia pila de servicio de Meta, que nadie fuera de Meta puede reproducir porque nadie fuera de Meta tiene el sistema. La publicación abierta, en otras palabras, es también la más verificable.


Por qué ambos son en realidad un problema de enrutamiento disfrazado
Ninguno de los dos sistemas es un agente completo, y eso es cierto de la misma manera para ambos. Muse Realtime Avatar es una capa de renderizado acoplada a Muse Realtime Voice, que es la capa conversacional de un agente cuyo razonamiento se ejecuta en Muse Spark. Realtime-Venus delega todo lo que excede lo que puede hacer de forma inmediata —recuperación, llamadas a herramientas, razonamiento complejo— a un entorno de ejecución que realiza el trabajo en segundo plano a partir de una instantánea de la conversación. En ambos diseños, aquello con lo que habla el usuario es una interfaz, y el pensamiento ocurre en un modelo de texto aparte.
Ese modelo de texto separado es la parte que puedes enrutar. En OrcaRouter es un único endpoint para 196 modelos de 15 proveedores, a precio de lista del proveedor transferido sin ningún recargo, con conmutación por error automática cuando un modelo falla o se agota el tiempo de espera — lo cual importa más de lo habitual cuando lo que está al otro lado es un checkpoint autoalojado que nadie ha evaluado de forma independiente. Nosotros no alojamos Realtime-Venus: es una descarga, y no lo servimos. Tampoco alojamos Muse Realtime Avatar, porque nadie lo hace. Lo que ofrecemos es la capa a la que ambas arquitecturas confían su trabajo pesado, de modo que un componente no probado en cualquiera de los dos lados de la conversación es una línea de configuración en lugar de una apuesta de producción.
¿Cuál de estos está realmente más avanzado?
El instinto es decir que el de Meta, porque Meta tiene el producto y el video de demostración. La evidencia dice algo más interesante. El sistema de Meta tiene mejor ingeniería de producción —12 sesiones simultáneas en un GB200 es un resultado de servicio, y las pruebas de preferencia divulgadas frente a productos de avatares ya comercializados son las únicas cifras comparativas directas que tiene cualquiera de los dos sistemas. El sistema de Ant Group tiene mejor verificabilidad: benchmarks con nombre, pesos publicados, una licencia Apache-2.0 y un informe que cualquiera puede intentar reproducir.
Lo que ninguno de los dos tiene es una forma de pagarlo. Y el que está más cerca de ser utilizable no es el que tiene la app de consumo: es el que puedes descargar esta noche y descubrirlo por ti mismo, en tu propio hardware, con tus propios datos y sin necesidad de ningún anuncio.
Si estás eligiendo, la pregunta no es qué modelo es mejor. Es si quieres una cara a la que no puedes llamar o una cámara que puedes ejecutar.

