Tarjeta de título principal para «GPT-Live-1 vs ElevenLabs», con el subtítulo «Un único modelo de extremo a extremo frente a una pila en cascada, medidos donde realmente se encuentran», con tres tarjetas que dicen «GPT-Live-1: $0,05 por minuto de voz, dúplex completo, sin clonación», «ElevenLabs Agents: Elo 937 en la Speech Agent Arena, 90,5 % de éxito en tareas», «ElevenLabs Eleven v3: más de 70 idiomas, más de 10.000 voces de la biblioteca», sobre una franja inferior que dice «Cifras de Arena según Artificial Analysis; precios según la documentación del proveedor, septiembre de 2026». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

GPT-Live-1 vs ElevenLabs: Un modelo que escucha, una compañía que vende todo lo demás

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El número más útil de esta comparación es 90,5 %. Esa es la tasa de éxito de tareas que Artificial Analysis midió para ElevenLabs Agents en su Speech Agent Arena — la más alta entre los seis primeros de esa tabla, lograda por un sistema que no es un único modelo en absoluto, sino una cascada de reconocimiento de voz, un modelo de lenguaje y un sintetizador unidos por la propia lógica de turnos de conversación de ElevenLabs. GPT-Live-1, el modelo full-duplex de extremo a extremo de OpenAI, no aparece en esa tabla, porque compite en otra distinta: el Speech to Speech Index, donde ocupa la sexta posición compartida de catorce con un 70,3 %. Entretanto, ElevenLabs Eleven v3 sigue siendo la voz de producción más ampliamente desplegada del sector, con más de 10.000 voces en su biblioteca y más de 70 idiomas.

La forma abreviada es que un lado te vende una conversación y el otro te vende una empresa. Esa forma abreviada es en gran medida correcta, y esconde el hallazgo más interesante que hay debajo: una cascada bien diseñada sigue superando a un modelo nativo de dúplex completo a la hora de completar la tarea.

Dos arquitecturas, y la diferencia está en dónde están las costuras

GPT-Live-1 es un único modelo que recibe audio y texto y produce audio y texto. Gestiona las interrupciones de forma nativa: las pruebas propias de OpenAI, publicadas con el lanzamiento de la API de septiembre y no reproducidas fuera de la empresa, reportan un 80,1 % de interactividad en Full Duplex Bench v1.5 frente al 45,4 % de GPT-Realtime-2.1, y una latencia de toma de turno de 0,798 segundos frente a 1,41. No hay costuras, porque no hay nada que unir.

ElevenLabs Agents es la apuesta contraria, deliberadamente. La documentación de ElevenLabs describe una canalización: reconocimiento de voz ajustado, un modelo de lenguaje que usted elige o aporta por su cuenta, un sintetizador de baja latencia —normalmente algo de la línea Flash— y un modelo propietario de toma de turnos añadido. La interrupción (barge-in) es una configuración por agente que expone la disposición a tomar turnos y los tiempos de espera, en lugar de ser una propiedad del modelo. En la configuración predeterminada evaluada por Artificial Analysis, la pila se compone de Scribe v2 Realtime para el reconocimiento de voz, un modelo Gemini para el razonamiento y Eleven Flash v2 para la síntesis.

Ese diseño tiene una ventaja enorme y un costo estructural. La ventaja es que cada etapa es reemplazable: un modelo barato para turnos simples, un modelo de frontera para los difíciles, un sintetizador distinto para otra localización. El costo es que la latencia se acumula en cada juntura, y la decisión de toma de turnos tiene que tomarse desde fuera.

Dimensión a dimensión

• Arquitectura — GPT-Live-1: un modelo de extremo a extremo, audio de entrada y audio de salida frente a ElevenLabs Agents: reconocimiento de voz, modelo de lenguaje y síntesis en cascada con una capa propietaria de toma de turnos

• Evidencia independiente — GPT-Live-1: 70,3 % en el Artificial Analysis Speech to Speech Index, sexto empatado de catorce frente a ElevenLabs Agents: Elo 937 en el Speech Agent Arena con una tasa de éxito de tareas del 90,5 % en 676 muestras, la mejor tasa de éxito entre los seis primeros de esa tabla

• Tablas de calidad — GPT-Live-1: no está clasificado en las arenas de texto a voz, al ser un tipo de modelo diferente frente a ElevenLabs: Eleven v3 Conversational con 1.194 Elo y Eleven v3 con 1.166 en la tabla Provider Voice, con un precio de $50 y $100 por millón de caracteres, respectivamente

• Precio — GPT-Live-1: $0.05 por minuto de voz, facturado por segundo, el razonamiento del backend se mide por separado frente a ElevenLabs: alrededor de $50 por millón de caracteres para Eleven v3 Conversational y alrededor de $100 para Eleven v3, con agentes reportados a aproximadamente $0.08 por minuto, aumentando más allá del límite de concurrencia, y los costos del modelo de lenguaje y de telefonía se facturan por separado

• Latencia — GPT-Live-1: no se ha publicado el tiempo hasta el primer audio a nivel de modelo; 0,798 segundos de latencia en la toma de turnos en las pruebas del proveedor frente a ElevenLabs: aproximadamente 75 milisegundos para Flash v2.5 y aproximadamente 280 milisegundos para Eleven v3 Conversational, con la indicación del proveedor de menos de 800 milisegundos hasta el primer audio a nivel de agente

• Voces y clonación — GPT-Live-1: doce preajustes de API, sin clonación por diseño frente a ElevenLabs: más de 10.000 voces en la biblioteca, clonación instantánea a partir de una muestra corta, clonación profesional desde 30 hasta 180 minutos de audio con autoverificación

• Idiomas — GPT-Live-1: los idiomas mayoritarios están bien cubiertos, con fluidez desigual más allá de ellos en la cobertura de lanzamiento, frente a ElevenLabs Eleven v3: más de 70 idiomas, frente a 32 de la línea Flash y más de 90 para su reconocimiento de voz

• Amplitud — GPT-Live-1: un endpoint, un ID de modelo, niveles de concurrencia de 25 a 500 sesiones y sin nivel gratuito frente a ElevenLabs: síntesis, reconocimiento de voz, doblaje, efectos de sonido, música, un mercado de voces y una plataforma de agentes bajo un solo contrato, con un nivel gratuito que no conlleva licencia comercial

A two-column comparison scoreboard titled 'GPT-Live-1 vs ElevenLabs — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Architecture: one end-to-end full-duplex model', 'Price: $0.05 per voice minute plus backend', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning', 'Best at: interruption handling'. The right column, labelled ElevenLabs, reads 'Architecture: cascaded STT + LLM + TTS', 'Price: ~$50 to $100 per 1M characters; agents ~$0.08 per minute', 'Independent score: Elo 937 on the AA Speech Agent Arena, 90.5% task success', 'Latency: ~75 ms Flash v2.5, ~280 ms v3 Conversational (vendor)', 'Voices: 10,000+ library voices, cloning with verification', 'Best at: platform breadth and voice quality'. The footer reads 'ElevenLabs agent pricing is third-party reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Artificial Analysis Speech Agent Arena leaderboard, ranking cascaded voice-agent systems by Elo and task success rate. The top rows read Gemini 3.1 Flash Live Minimal at 1,046 Elo over 768 samples with a 74.6% task success rate, Gemini 3.1 Flash Live High at 1,014 with 71.8%, GPT-Realtime-1.5 at 1,000 with 85.1%, GPT Realtime (Aug '25) at 944 with 89.4%, and ElevenLabs Agents, labelled 'Default Cascaded System', at Elo 937 over 676 samples with a task success rate of 90.5% — the highest in the top six. The board continues with Amazon Bedrock Nova 2.0 Sonic at 917 and Grok Voice Think Fast 2.0 High at 908 with a 94.7% success rate.

Donde ElevenLabs no solo está por delante, sino sin rival

Tres de las brechas de esa lista no están cerca, y cualquier comparación que les dedique una frase es injusta con el titular.

La clonación es lo primero. GPT-Live-1 incluye doce preajustes y, por diseño, ninguna clonación en absoluto: una postura de seguridad deliberada, no una función ausente. ElevenLabs ofrece clonación instantánea a partir de una breve muestra de referencia y clonación profesional entrenada con entre 30 y 180 minutos de audio, condicionadas por niveles de plan y un paso de autoverificación. Si la voz de tu producto forma parte de su identidad, esta no es una dimensión en la que GPT-Live-1 compita.

La biblioteca de voces es la segunda. Más de 10.000 voces, además de un mercado con licencia de voces icónicas de herederos e intérpretes, constituyen un activo que ningún lanzamiento de modelo replica. Es también lo que los compradores suelen subestimar más a menudo: elegir una voz es la última milla de un producto de voz, y tener diez mil entre las que elegir comprime un ejercicio de branding en una tarde.

La tercera es la amplitud. Reconocimiento de voz, doblaje, efectos de sonido, música, una plataforma de agentes: un equipo que necesita cuatro de esas cosas compra un solo contrato en lugar de cuatro. Eso es una ventaja estratégica, no una de calidad, y sobrevive a que el otro lado gane un benchmark.

Ambas empresas conllevan cuestiones de gobernanza que deberían formar parte de una revisión de adquisiciones y no de una nota al pie. La clonación profesional de ElevenLabs requiere autoverificación, y sus términos prohíben clonar la voz de otra persona incluso con consentimiento; la empresa también enfrenta una serie de demandas colectivas presentadas en mayo de 2026 por el consentimiento sobre los datos de entrenamiento, en las que las alegaciones no están probadas. La posición de Open​AI es más sencilla porque eliminó la función que genera el riesgo.

A screenshot of ElevenLabs' official models documentation page, describing Eleven v3 under a 'Flagship models' heading as 'Our most emotionally rich, expressive speech synthesis model', with the supporting lines 'Dramatic delivery and performance', '70+ languages supported', '5,000 character limit' and 'Support for natural multi-speaker dialogue'. The surrounding navigation lists ElevenLabs' wider product set, including text to speech, speech to text, music, text to dialogue, dubbing, sound effects, voices and voice agents.

El impuesto en cascada, y cuándo vale la pena pagarlo

Los costes de una cascada se manifiestan como latencia y como orquestación. Las directrices del proveedor para ElevenLabs sitúan el tiempo hasta el primer audio de un agente por debajo de 800 milisegundos en la mediana y por debajo de 1,5 segundos en el percentil 95 — cifras que describen todo el pipeline, no los 75 milisegundos del sintetizador. A eso se suman el tiempo de generación del modelo de lenguaje y el tránsito por la red. Parte de eso se puede recuperar eligiendo bien las etapas; nada de ello es gratis.

La factura de la orquestación es más leve, pero real. Cada etapa adicional es otro punto en el que una llamada puede fallar, otro tiempo de espera que ajustar, otro proveedor con el que conciliar facturas. Esa es la parte que un modelo nativo de extremo a extremo elimina por completo: solo hay una cosa que puede fallar, y o responde o no responde.

Donde la cascada se amortiza es en la etapa intermedia. El modelo de lenguaje detrás de un agente de voz es el componente cuya calidad mejora más rápido y cuyo costo varía más, y poder cambiarlo sin tocar la capa de voz vale dinero real a lo largo de la vida de un producto. Aproximadamente 190 modelos de once proveedores upstream se encuentran detrás de una única clave de OrcaRouter al precio de lista del proveedor sin ningún margen, por lo que un cambio de precio del proveedor llega a esa capa el mismo día, y la conmutación por error automática evita que un tiempo de espera del backend termine con una llamada en vivo. Ni la pila de agentes de ElevenLabs ni el endpoint Live Sessions de GPT-Live-1 son accesibles de esa manera — las capas de voz pertenecen a sus proveedores, y esta es la capa que hay debajo de ellas.

¿Cuál elegir?

Elige GPT-Live-1 si la mecánica de la conversación es el producto y quieres un único contrato con un único modo de fallo. Líneas telefónicas en las que quienes llaman hablan por encima del agente, donde una cesión de turno natural importa más que una voz perfecta y donde doce buenas voces son suficientes. Aceptas un modelo alojado cerrado, sin clonación, una calidad independiente de mitad de tabla y ningún plan gratuito para prototipar.

Elige ElevenLabs si la calidad de voz, la clonación o la amplitud son la restricción. Narración, doblaje, productos multilingües, cualquier cosa donde la voz sea la marca, cualquier cosa que necesite reconocimiento de voz en el mismo contrato. Aceptas una cascada que operar, precios aproximadamente de diez a veinte veces los de GPT-Live-1 por unidad de habla, y el hecho de que la lógica de interrupción es tuya para configurar y tuya para equivocarte.

El 90,5 % es la parte que vale la pena llevarse. Dice que una empresa que ensambló tres modelos y una capa de turnos de palabra superó a una empresa que entrenó un solo modelo para hacerlo todo, en la métrica más cercana a si la llamada funcionó. El full duplex es un avance arquitectónico genuino y, según la evidencia actual, no es lo que decide si quien llama consigue lo que quería.