Tarjeta principal generada para el artículo «Muse Realtime Avatar vs Gemini 3.8 Live», que muestra dos tarjetas redondeadas a cada lado del titular. La tarjeta izquierda muestra «Muse Realtime Avatar» sobre un icono de fotograma de vídeo y las líneas «salida de vídeo + voz», «448x768 vertical, 25 fps» y «anunciado el 23 de sept, sin API»; la tarjeta derecha muestra «Gemini 3.8 Live» sobre un icono de micrófono con burbuja de diálogo y las líneas «salida de audio + texto», «entrada de audio a 0,005 $/min» y «GA el 15 de sept, Live API». Un subtítulo dice: «Uno renderiza una cara. El otro gestiona una línea telefónica». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Muse Realtime Avatar vs Gemini 3.8 Live: Un rostro contra una línea de voz

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Estos dos no son sustitutos, y la forma más rápida de comprobarlo es preguntar qué sale de cada uno. Muse Realtime Avatar, anunciado por Meta el 23 de septiembre de 2026, devuelve vídeo sincronizado de un personaje hablando: tú aportas una imagen de referencia y este renderiza a ese ser hablando y gesticulando en fotogramas verticales de 448×768. Gemini 3.8 Live, anunciado por Google el 15 de septiembre de 2026 y disponible de forma general para desarrolladores ese mismo día, devuelve audio y texto. No tiene salida de vídeo en absoluto. Ponerlos en la misma comparación no es un error —los dos compiten por la misma superficie conversacional, y los compradores ya se preguntan sobre cuál construir—, pero la decisión no es «cuál es mejor». Es «cuál de estos dos productos diferentes necesito», y casi todas las comparaciones publicadas de la pareja se equivocan al alinear benchmarks que miden cosas distintas.

Esta es la asimetría que debería enmarcar todo lo que sigue. Puedes llamar a Gemini 3.8 Live hoy, desde una terminal, con una clave. No puedes llamar a Muse Realtime Avatar en absoluto —sin API, sin precio, sin fecha. Meta lo demostró en Connect y publicó un artículo de investigación; Goog​le lanzó una lista de precios y un ID de modelo. Eso es una comparación entre un producto y un anuncio, y significa que la pregunta útil no es cuál gana, sino a qué te compromete cada uno.

Lo que cada uno produce en realidad

Esta es toda la comparación en seis líneas, y ninguna de las seis se acerca.

Salida — Muse Realtime Avatar devuelve voz y vídeo de retrato sincronizados, generados conjuntamente a partir de un único flujo de tokens de habla; Gemini 3.8 Live devuelve audio y texto, sin generación de vídeo en ninguna parte del modelo.

Acceso para desarrolladores — Muse Realtime Avatar no tiene ninguno: se anunció el 23 de septiembre de 2026 como una capacidad del agente Muse de Meta, sin API, sin endpoint y sin fecha declarada. Gemini 3.8 Live está en la API de Gemini y en Google AI Studio desde el 15 de septiembre de 2026, bajo dos IDs de modelo, gemini-3.8-live y gemini-3.8-live-extended-thinking.

Precio — Muse Realtime Avatar no tiene un precio publicado porque no hay nada que comprar. Gemini 3.8 Live publica 0,005 $ por minuto de entrada de audio y 0,018 $ por minuto de salida de audio a través de la Live API.

Puntuación independiente — Muse Realtime Avatar no tiene ninguna; sus cifras son de Meta, medidas contra líneas base que Meta eligió. Gemini 3.8 Live obtiene 76,0 en el Artificial Analysis Speech to Speech Index, con la variante de pensamiento extendido en 82,6 — un número de terceros, lo que constituye una clase de evidencia diferente.

Latencia — las dos cifras publicadas no son la misma medición, y aquí es donde fallan la mayoría de los análisis. Meta informa 870 ms desde el final de tu turno hasta el primer byte de una respuesta sincronizada de voz y vídeo. La cifra de Google, medida por Artificial Analysis, es de 1,18 segundos hasta el primer audio para el modelo estándar y de 1,35 segundos para la variante de razonamiento.

Fotograma e idioma — Muse Realtime Avatar renderiza video vertical de 448×768 a 25 fotogramas por segundo. Gemini 3.8 Live incorpora el cambio automático a mitad de conversación entre 97 idiomas admitidos y procesa entrada visual en tiempo casi real.

Esa última fila contiene la distinción que la gente no deja de confundir. Gemini 3.8 Live puede ver. No puede mostrar. Muse Realtime Avatar puede mostrar. Que pueda ver no es de lo que trata la publicación de Meta: es un generador impulsado por audio, condicionado por tokens de voz y una imagen de referencia, y su trabajo es producir una cara en lugar de leerla.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

Los números de latencia no son comparables, y la brecha es más pequeña de lo que parece.

870 ms frente a 1,18 segundos se lee como que Meta es un 26 % más rápida. Al leer las mediciones, la comparación se desvanece. La cifra de Meta es el tiempo desde el final del turno del usuario hasta el primer byte de una respuesta que incluye vídeo — y la publicación de Meta es explícita en que es una medida del primer byte, no el tiempo hasta una respuesta completa ni la latencia de entrega continua durante el resto de la llamada. Un sistema puede alcanzar 870 ms hasta el primer byte y aún así sentirse lento en el segundo doce. La cifra de Google es el tiempo hasta el primer audio, algo estrictamente más pequeño de producir, y lo mide un evaluador externo en lugar del proveedor.

Ambas son el tipo de cifra que te dice que un sistema es conversacional en lugar de basado en turnos, y ninguna de las dos te dice cómo se siente la llamada en el minuto cinco. Si estás eligiendo entre ellas por su capacidad de respuesta, la postura honesta es que nadie ha publicado una medición comparable, y la única forma de obtener una es ejecutar la que se puede llamar.

Lo que puedes construir hoy y lo que estarías esperando

Gemini 3.8 Live incluye lo que una decisión de producción necesita: dos IDs de modelo que puedes fijar, tarifas por minuto publicadas, una puntuación de índice de terceros y una fecha de disponibilidad general declarada. También incluye las limitaciones que suele tener un producto de voz: entrada de audio, salida de audio y texto, y sin generación de video.

Muse Realtime Avatar viene con lo que suele tener una publicación de investigación: una arquitectura, cuatro cifras reportadas por la empresa y un conjunto de pruebas de preferencia divulgadas que Meta realizó frente a dos sistemas de avatares comerciales, uno de los cuales la propia Meta reporta como estadísticamente indistinguible de la paridad en cuanto a gestos. Lo que no tiene es una forma de comprarlo. La publicación de Meta también señala que las demos mostradas no reflejan todos los avatares disponibles en la app Muse, que es la frase que debería regir cualquier plan que construyas en torno a esto.

Hay una tercera opción que merece ser nombrada, porque es la que la mayoría de los equipos realmente elige. Ninguno de estos modelos es un agente completo. Gemini 3.8 Live pasa el trabajo en segundo plano a herramientas y API mientras sigue hablando; GPT-Live-1 delega su razonamiento por completo a un modelo de backend separado. La capa conversacional es el front end, y el pensamiento es una llamada diferente a otro modelo. Esa segunda llamada es inferencia de texto ordinaria y se puede enrutar.

En OrcaRouter esa capa es un solo endpoint: 196 modelos de 15 proveedores tras una única clave, a precio de lista del proveedor y sin margen alguno, con conmutación por error automática si el modelo que elegiste da error o se agota el tiempo de espera. No alojamos Gemini 3.8 Live —la Live API es solo de Google— y no alojamos Muse Realtime Avatar, que nadie aloja. Lo que ofrecemos es la mitad de un agente de voz que escala con la intensidad con que razonan tus interlocutores, y la mitad que puedes cambiar sin renegociar nada.

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

Donde los dos podrían encontrarse realmente

El argumento para ponerlos uno al lado del otro no son los benchmarks. Es que ambos intentan ocupar el mismo lugar en un producto: aquello con lo que habla el usuario. La apuesta de Goog​le es que ese lugar es una conversación y que lo que se entrega es una buena: 97 idiomas, ejecución de herramientas en segundo plano, una variante de razonamiento que resuelve el 68,6% de los escenarios de atención al cliente de τ-Voice frente al 30,1% del modelo estándar. La apuesta de Meta es que ese lugar es una presencia, y que un usuario que puede ver al agente es un usuario que se queda en la conversación.

Esas apuestas no son excluyentes. Es plausible que un producto use Gemini 3.8 Live para el bucle de voz y algo como Muse Realtime Avatar para la capa visual, si alguna vez la capa de avatar llega a ser invocable. Lo que no puede hacer es tratarlas como intercambiables, porque una de ellas nunca te dará una cara y es posible que la otra nunca te dé un endpoint.

Cómo decidir

Si vas a lanzar un producto de voz este trimestre, la decisión ya está tomada por ti: Gemini 3.8 Live se puede invocar y Muse Realtime Avatar no. Elige tu variante según el eje que realmente discute el lanzamiento: el modelo de pensamiento extendido aporta 38 puntos de finalización de tareas agénticas por poco más de cuatro veces el coste horario del audio, y el modelo estándar es el modelo de voz competente más barato del tablero público. Luego enruta el razonamiento delegado por separado, porque ahí es donde viven tanto la factura como la latencia.

Si estás evaluando una capa de avatares, la respuesta honesta es que todavía no hay nada que evaluar. Lo que existe es una publicación de investigación con cuatro cifras reportadas por la empresa y una demostración. Lo que hay que observar no es el índice —Muse Realtime Avatar no aparecerá en uno—, sino si Meta publica una lista de precios, un endpoint y una fecha, y si sus 870 ms se sostienen cuando el avatar se ejecuta en un teléfono con conexión celular en lugar de en una demo de Connect.

Hasta entonces, la comparación tiene una forma más breve que la que le dan la mayoría de los artículos. Uno de estos es un producto con un precio, un ID de modelo y una puntuación externa. El otro es una muy buena demostración de algo que todavía no tiene nada de eso.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.