Una tarjeta hero generada para el artículo «Muse Realtime Avatar vs GPT-Live-1», que muestra dos tarjetas redondeadas a cada lado del titular. La tarjeta izquierda dice “Muse Realtime Avatar” sobre un icono de avatar de retrato y las líneas “video + voz, una sola transmisión” y “sin API, sin precio, sin fecha”; la tarjeta derecha dice “GPT-Live-1” sobre un icono de burbuja de diálogo y las líneas “$0.05 por minuto, facturado por segundo” y “sesiones concurrentes, WebRTC”. Un subtítulo dice “Uno vende minutos. El otro vende presencia.” El logotipo de OrcaRouter está integrado en la esquina inferior derecha.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1: presencia contra conversación

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La unidad de facturación te dice qué cree estar vendiendo cada empresa. GPT-Live-1, el modelo de voz full-duplex de Open​AI, factura a una tarifa plana de $0.05 por minuto de voz, cobrado por segundo, y sus límites de velocidad se expresan en sesiones concurrentes: 25 en el nivel 1, y hasta 500 en el nivel 5. Esa es la unidad de una línea telefónica. Muse Realtime Avatar, anunciado por Meta el 23 de septiembre de 2026, no tiene unidad de facturación, porque no hay nada que facturar: ni API, ni endpoint, ni precio, ni fecha. Su unidad publicada es, en cambio, una cifra de hardware: 12 sesiones concurrentes en tiempo real en una NVIDIA GB200. Una empresa vende conversación por minuto. La otra te muestra cuánto cuesta renderizar una cara, y todavía no ha decidido venderla.

Ambos modelos son relativamente nuevos y ninguno es un lanzamiento en el sentido en que la palabra suele usarse. GPT-Live-1 se lanzó dentro de ChatGPT el 8 de julio de 2026 y solo llegó a la API para desarrolladores el 10 de septiembre —dos meses durante los cuales fue la voz predeterminada de un producto de consumo y no estuvo disponible para quienes estuvieran desarrollando. Muse Realtime Avatar se anunció el 23 de septiembre de 2026 en Meta Connect, se muestra en la propia publicación de investigación de Meta y sigue siendo una capacidad del agente Muse en lugar de un producto. Compararlos es comparar dos etapas distintas de la misma idea: qué ocurre cuando un modelo conversacional es lo bastante bueno como para que la siguiente pregunta sea qué está mirando el usuario mientras habla.

Lo que OpenAI construyó: una conversación que nunca se estanca

GPT-Live-1 es full-duplex en el sentido que importa operativamente: no espera a que termines antes de empezar a trabajar. Llega a la API para desarrolladores a través de exactamente un endpoint, el endpoint Live Sessions, bajo exactamente un ID de modelo, gpt-live-1, sin snapshots con fecha que fijar y sin endpoints hermanos habilitados. Ni Chat Completions, ni Responses, ni Realtime, ni fine-tuning, ni endpoints de transcripción de audio o de voz. La entrada de imágenes y video no es compatible de manera explícita.

La decisión de diseño que condiciona todo lo demás es la delegación. GPT-Live-1 no se encarga de su propio razonamiento complejo. La documentación de Open​AI empareja la capa de voz con un backend de razonamiento independiente, y en el ejemplo de WebRTC publicado ese backend es GPT-5.6 Terra. Así que una sesión de GPT-Live-1 son dos contadores funcionando a la vez: 0,05 $ por minuto por la voz, más las tarifas normales por tokens del modelo de backend por cada llamada a herramienta, búsqueda y paso de razonamiento que delega. En el Speech to Speech Index, esa personalidad dividida se traduce en que el mismo modelo puntúa dos veces: 81,5 con GPT-6 Astra haciendo el razonamiento con esfuerzo medio, 80,1 con GPT-5.6 Sol con esfuerzo bajo. La diferencia de 1,4 puntos entre esas dos configuraciones es mayor que el margen de 0,2 puntos que sitúa la mejor configuración de GPT-Live-1 en el primer puesto.

Esa es la forma honesta del modelo. El front end de voz es fijo; la inteligencia es un parámetro que tú configuras, y mueve la puntuación más que ningún modelo de la competencia.

Lo que Meta construyó: una cara que se mueve con la voz

Muse Realtime Avatar ataca un problema que GPT-Live-1 no tiene: mantener el vídeo generado en perfecta sincronía con el habla generada. La respuesta de Meta es hacer que sean el mismo flujo: Muse Realtime Voice emite tokens de habla que llevan tanto contenido como prosodia, y el avatar es un Diffusion Transformer impulsado por audio que consume esos mismos tokens, condicionado por una imagen de referencia y una ventana deslizante de latentes de vídeo recientes. Nada se sincroniza labialmente a posteriori, porque no hay un "a posteriori": voz, boca y expresión salen de un mismo proceso.

Las cifras publicadas son de la propia Meta, medidas frente a líneas base que Meta eligió, y ninguna se ha reproducido fuera de la compañía. 870 ms desde el final de tu turno hasta el primer byte de una respuesta sincronizada de voz y vídeo. Vídeo vertical de 448×768 a 25 fotogramas por segundo, con marca de agua mediante una superposición transparente para que el espectador pueda saber que no es una cámara. Doce sesiones concurrentes en una sola GB200, una ganancia de capacidad de 8× frente a la línea base BF16 de dos pasos de la propia Meta, gracias al entrenamiento consciente de cuantización de cuatro bits, cachés KV persistentes y procesamiento por lotes dinámico consciente de la latencia. Y un resultado de preferencia que Meta reporta pasando del 45 % al 55 % sobre esa línea base, con dos victorias divulgadas frente a sistemas de avatares comerciales — además de la divulgación de que, en cuanto a los gestos característicos, el resultado frente a uno de ellos no es estadísticamente distinguible de la paridad.

Nada en esa lista es una tasa, un endpoint ni una fecha.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

La factura de los dos metros, y dónde el enrutamiento se gana su lugar.

La estructura de costos de GPT-Live-1 no es un solo número, y tratarla como si lo fuera es la forma en que un modelo de voz que suena barato produce un mes caro. La voz cuesta $0.05 por minuto, se cobra por segundo y sin redondeo, y los primeros 15 segundos de una sesión se facturan por adelantado, pero se acreditan contra la duración posterior en lugar de sumarse por encima. Todo lo que la sesión delega —el razonamiento, las llamadas a herramientas, cualquier búsqueda— se factura por separado, a las tarifas propias del modelo de backend. Apunta la delegación a un modelo de razonamiento de vanguardia y deja que busque en cada turno, y habrás construido una línea abierta de $3 la hora con un modelo premium detrás.

Ese segundo medidor es la mitad enrutable. En OrcaRouter, el backend de una sesión de GPT-Live-1 no es más que otra llamada a un modelo: 196 modelos de 15 proveedores tras una única clave, al precio de lista del proveedor transferido sin margen alguno, con conmutación por error automática cuando el modelo que elegiste da error o se agota el tiempo de espera. No puedes enrutar la capa de voz —Live Sessions es exclusivamente el endpoint de Open​AI—, pero todo aquello a lo que la capa de voz delega se apoya en una sola clave, lo que significa que la parte de la factura que escala según cuánto piensan tus interlocutores es también la parte que puedes cambiar sin un contrato.

Muse Realtime Avatar, en cambio, no tiene medidores que enrutar. Es una función de una aplicación.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Dos apuestas sobre para qué sirve un agente de voz

Deja de lado las especificaciones y las dos empresas no coinciden en cuanto al producto. La apuesta de OpenAI es que la conversación es el producto — que un agente de voz es una línea telefónica, y el trabajo consiste en hacer que se sienta como tal: no quedarse nunca bloqueado, delegar el pensamiento difícil a un modelo detrás de él, facturar por minuto, escalar según las llamadas simultáneas. Cada decisión en la superficie de la API de GPT-Live-1 se deriva de eso. Límites de velocidad basados en concurrencia, transporte exclusivamente WebRTC, un único endpoint deliberadamente limitado, sin video de entrada ni de salida.

La apuesta de Meta es que la presencia es el producto: que un usuario que puede ver al agente es un usuario que se queda en la conversación, y que la ingeniería interesante no es la toma de turnos, sino mantener coherente a un personaje renderizado durante toda una llamada. Esas decisiones producen un sistema optimizado para la tasa de fotogramas y la densidad de sesión en una GPU, sin ninguna superficie comercial en absoluto.

Existe una posibilidad real de que ambos tengan razón y de que los dos se compongan. Un producto podría ejecutar su conversación en un modelo de voz full-duplex y su capa visual en un renderizador de avatar, y lo único que lo impide hoy es que el renderizador de avatar no tiene endpoint. Lo que no es plausible es tratarlos como dos versiones de la misma compra.

Quién debería actuar, y quién debería esperar

Si estás construyendo un producto de voz ahora, GPT-Live-1 es invocable y Muse Realtime Avatar no, y eso termina la decisión. La elección interesante dentro de GPT-Live-1 es el backend al que delegas, porque ahí es donde realmente se mueven tanto la puntuación como la factura — y es la única parte del stack que puedes enrutar, intercambiar y conmutar por error sin tocar la integración de voz.

Si lo que quieres es un avatar, esperar no es pasivo. Las cosas que vale la pena vigilar son concretas: si Meta publica una tabla de tarifas y un endpoint, si aparece una fecha anunciada y si 870 ms sobrevive al contacto con un teléfono en una conexión celular en lugar de en una demo de Connect. La propia publicación de Meta señala que sus demos no reflejan todos los avatares disponibles en la aplicación Muse, que es la frase a la que hay que aferrarse.

Hasta que cambie uno de esos aspectos, la comparación se responde en una línea. GPT-Live-1 es una línea telefónica con un cerebro que tú eliges. Muse Realtime Avatar es una cara sin número de teléfono.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.