Una tarjeta principal generada para el artículo 'Gemini 3.8 Live vs ElevenLabs', que muestra dos tarjetas redondeadas a cada lado del titular. La tarjeta izquierda muestra 'Gemini 3.8 Live' sobre un icono de nube y forma de onda y la línea 'de voz a voz, una sola pasada, por minuto'; la tarjeta derecha muestra 'ElevenLabs Agents' sobre un icono de canalización de tres bloques etiquetado 'STT - LLM - TTS' y la línea 'ensamblado, por minuto de agente'. Un subtítulo dice 'Un componente que alquilas frente a un sistema que alquila componentes'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Gemini 3.8 Live vs ElevenLabs: Un modelo contra un pipeline

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Abre la documentación de ElevenLabs sobre su plataforma de agentes y hay un modelo Gemini en medio de ella. ElevenLabs Agents es una cascada —un front end de reconocimiento de voz, un modelo de lenguaje y un back end de texto a voz—, y el modelo de lenguaje de la pila publicada es uno de Gemini. Ese es el lugar correcto para empezar una comparación entre Gemini 3.8 Live y ElevenLabs, porque las dos cosas que se comparan no son el mismo tipo de objeto. Gemini 3.8 Live es el modelo de voz a voz, lanzado en la Live API el 15 de septiembre de 2026, con un precio por minuto de audio. ElevenLabs Eleven v3 es el modelo de síntesis insignia de una plataforma de voz que también vende ElevenLabs Agents, y su precio es por carácter, no por conversación. Uno es un componente que se puede alquilar. El otro es un sistema que alquila componentes, incluidos, en al menos una configuración publicada, los de un modelo de Gemini.

Esa asimetría resuelve la mayoría de las preguntas que la gente realmente trae a esta comparación. Si te preguntas a cuál llamar, la respuesta honesta es que no son sustitutos: uno es un modelo con una lista de tarifas y sin telefonía; el otro es un producto con telefonía, límites de concurrencia y tres medidores funcionando a la vez. Cuál es más barato, mejor o más rápido depende por completo de cuál de esas dos formas ya es tu aplicación.

Un modelo, o tres modelos en secuencia

Gemini 3.8 Live es un sistema nativo de voz a voz. Entra audio, sale audio, y el razonamiento ocurre en la misma pasada hacia adelante que produce el habla: un modelo, un presupuesto de latencia, una factura. Google lo lanzó en dos variantes el 15 de septiembre de 2026: gemini-3.8-live para trabajo conversacional a escala, y gemini-3.8-live-extended-thinking para la misma interfaz con razonamiento de varios pasos detrás. Ambos manejan 97 idiomas con cambio de idioma a mitad de conversación, ambos procesan entrada visual en tiempo casi real, ambos ejecutan llamadas a herramientas y API en segundo plano mientras la conversación continúa, y ambos aplican una marca de agua con SynthID a cada segundo de audio generado. La tarifa publicada es de $0.005 por minuto de entrada de audio y $0.018 por minuto de salida de audio.

ElevenLabs Agents no es eso. Es un pipeline, y el pipeline es el producto. Un modelo de reconocimiento de voz en tiempo real transcribe al interlocutor, un modelo de lenguaje decide qué decir y un modelo de síntesis —Eleven Flash v2 en la configuración que documenta ElevenLabs— pronuncia la respuesta. Cada etapa se tarifica por separado, cada etapa se puede intercambiar y todo el conjunto se encuentra detrás de una capa gestionada que se encarga de la telefonía, la detección de turnos y la concurrencia. ElevenLabs Eleven v3, el modelo de síntesis estrella de la compañía, es aún otro producto distinto: un modelo de texto a voz con un precio de 100 USD por millón de caracteres, vendido para narración, doblaje y diseño de voz en lugar de para mantener una conversación.

Así que lo primero que hay que tener claro es que "Gemini 3.8 Live vs ElevenLabs Eleven v3" no es un enfrentamiento directo entre dos modelos de voz. Eleven v3 no acepta entrada de audio y no mantiene una conversación. La comparación que sí tiene sentido es Gemini 3.8 Live frente a ElevenLabs Agents, con Eleven v3 presente solo como el techo de calidad de síntesis en torno al cual está construida la plataforma.

Dónde se sitúa realmente cada uno en un tablero

No hay ninguna tabla de clasificación que mida a estos dos entre sí, y la razón es aleccionadora: no dejan de aparecer en tablas distintas que miden cosas distintas.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

En el Speech to Speech Index de Artificial Analysis —que combina razonamiento de voz, finalización de tareas agénticas, preferencia en arena y éxito en tareas en un solo número— Gemini 3.8 Live obtiene 76,0, con la variante Extended Thinking en 82,6 en primer lugar. Esas son mediciones que Artificial Analysis ejecuta bajo su propio marco de pruebas, no cifras publicadas por Google, aunque el propio anuncio de Google cita números de los mismos componentes.

ElevenLabs no aparece en absoluto en esa tabla, porque no lanza un modelo de voz a voz que medir. Donde sí aparece es en la Speech Agent Arena, que evalúa agentes ensamblados en lugar de modelos, y el panorama allí es genuinamente mixto: ElevenLabs Agents se ha medido en 937 Elo con una tasa de éxito en las tareas del 90,5%, frente a 1.046 Elo y un 74,6% de tasa de éxito en tareas de un agente construido sobre la generación anterior de Gemini Live, con el agente de Gemini alcanzando el primer audio en 0,96 segundos. Lee ese par con atención. El agente respaldado por Gemini gana en preferencia y velocidad; el agente de ElevenLabs gana en sacar la tarea adelante. Es una cascada superando a un modelo nativo en fiabilidad, lo que no es el resultado que predecirían los diagramas de arquitectura.

Dos advertencias sobre esas cifras, y ambas importan. El lado de Gemini en esa comparación usaba la generación Gemini Live de principios de 2026, no 3.8 Live, así que no es una lectura del modelo del que trata este artículo. Y el tercer tablero en juego —la arena de voz Provider Voices de Artificial Analysis, que clasifica modelos de síntesis— coloca ElevenLabs Eleven v3 con 1.177 Elo y a la variante conversacional, ElevenLabs v3 Conversational, con 1.219 Elo, frente a 1.283 del líder, Cartesia Sonic 3.6. Ese tablero mide qué tan bien suena la voz, no qué tan bien se desempeña el agente, y mezclar ambas cosas es como la gente acaba citando una puntuación de síntesis como evidencia sobre un sistema conversacional.

Espec. contraste

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• Arquitectura — Gemini 3.8 Live es un único modelo nativo de voz a voz, mientras que ElevenLabs Agents es una cascada de reconocimiento de voz, un modelo de lenguaje y síntesis

• Entrada y salida — Gemini 3.8 Live recibe audio y devuelve audio en una sola pasada, mientras que ElevenLabs recibe el audio a través de Scribe v2 Realtime y lo devuelve a través de Eleven Flash v2, con una transcripción de texto en medio

• Qué puedes intercambiar — Gemini 3.8 Live: nada, el modelo es el modelo, frente a ElevenLabs: cada etapa de forma independiente, incluido el modelo de lenguaje, que en la pila documentada es uno de Google

• Idiomas — Gemini 3.8 Live 97 con cambio de idioma a mitad de conversación vs ElevenLabs Eleven v3 74

• Precios de audio — Gemini 3.8 Live $0.005 por minuto de entrada y $0.018 por minuto de salida frente a ElevenLabs, que cobra por minutos de agente con los tokens del modelo de lenguaje medidos por separado como cargo adicional

• Telefonía — Gemini 3.8 Live ninguna de primera parte, tú aportas tu propio operador y la gestión de sesiones frente a ElevenLabs gestionado, de primera parte

• Concurrencia — Gemini 3.8 Live, hasta donde lo permita tu cuota de Live API, frente a ElevenLabs, que se vende en niveles de concurrencia

• Herramientas de agente — Gemini 3.8 Live: herramienta en segundo plano y ejecución de API dentro del modelo frente a ElevenLabs, una capa de agente gestionada con detección de turnos, flujos de trabajo y una biblioteca de voces

• Artefacto abierto — ninguno de los dos. Ambos son cerrados, solo en la nube y propietarios

• Latencia — Gemini 3.8 Live: 1,18 segundos hasta el primer audio para el modelo estándar y 1,35 para Extended Thinking, según Artificial Analysis; mientras que ElevenLabs no se publica como un único número, porque la latencia de una cascada es la suma de tres etapas

La última fila es la que explica la elección de arquitectura mejor que ninguna de las otras. Un modelo nativo tiene un solo presupuesto de latencia. Una cascada tiene tres, y la razón por la que los equipos siguen eligiendo la cascada es todo lo que está por encima: la transcripción que puedes registrar, la etapa que puedes sustituir y el número de teléfono que simplemente funciona.

Lo que cuesta un minuto, en ambos sentidos

La aritmética de Gemini 3.8 Live es inusualmente sencilla porque solo hay un medidor. Un minuto de conversación equivale aproximadamente a un minuto de audio del interlocutor más un minuto de audio del modelo: $0.005 más $0.018, es decir, unos 2.3 centavos por minuto según la tarifa publicada. La columna de coste por hora de Artificial Analysis, que normaliza el coste de completar un conjunto fijo de razonamiento de audio a una cifra por hora, sitúa el modelo estándar en $0.84 por hora de audio de entrada —la tarifa de pago más barata de ese cuadro— y la variante Extended Thinking en $3.50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

La aritmética de ElevenLabs es más difícil, y esa es la cuestión, más que una crítica. Un minuto de agente no tiene un único precio: está el cargo de la plataforma por el minuto de agente en sí, los tokens del modelo de lenguaje consumidos en el tramo intermedio y los minutos de operadora que hay por debajo —tres medidores, tres proveedores en el peor de los casos, y una factura que cambia cuando cambia cualquiera de ellos. El lado de la síntesis es más legible: ElevenLabs Eleven v3 a $100 por millón de caracteres cuesta aproximadamente $8 por hora de narración continua a velocidades de habla normales, frente a unos $2.70 del competidor de pesos abiertos más barato en la misma arena. ElevenLabs cobra un sobreprecio por la voz, y en esa clasificación el sobreprecio es real: se sitúa en cuarto lugar en general.

Lo que las dos estructuras de costos significan en la práctica es que Gemini 3.8 Live es más barato por minuto de conversación y mucho más barato por hora de audio, mientras que ElevenLabs es más caro y mucho más predecible de operar. Un equipo sin ingenieros de ML y con un número de teléfono que poner en marcha gastará menos en ElevenLabs el primer mes, porque la alternativa es construir lo que ElevenLabs ya construyó. Un equipo que ya gestiona sus propias sesiones y su propio operador gastará menos en el modelo en bruto, porque no está pagando por un pipeline que ya tiene.

En qué es realmente mejor ElevenLabs

Sería fácil interpretar la diferencia de precios como un veredicto. No lo es, y las razones son las que nunca muestra una lista de tarifas.

• Telefonía. ElevenLabs vende números de teléfono, troncalización SIP y la concurrencia para contestar llamadas. Google vende un modelo que habla. Si tu producto es una línea telefónica, la brecha entre esas dos frases representa meses de ingeniería.

• Identidad de voz. La Voice Library, el pipeline de clonación y el estudio de doblaje son una superficie de producto madura. Gemini 3.8 Live te da un modelo; no te da un catálogo de voces con licencia ni un flujo de trabajo para localizar una grabación existente a nueve idiomas.

• Una transcripción por defecto. Dado que una cascada transcribe antes de razonar, obtienes registros de texto de cada llamada gratis — útiles para el cumplimiento normativo, para la evaluación y para el poco glamuroso trabajo de averiguar por qué el agente se equivocó en algo. Un modelo nativo de voz a voz no tiene ese tipo de artefacto, a menos que lo construyas tú mismo.

• Piezas intercambiables. Cuando se lanza un modelo de lenguaje mejor, una cascada de ElevenLabs puede adoptarlo sin reentrenar nada. Es exactamente por eso que la pila documentada tiene un modelo de Google en el medio — y es el argumento más fuerte a favor de la arquitectura en cascada.

Qué te aporta el modelo sin procesar

El contraargumento no tiene que ver con el precio. Tiene que ver con lo que una sola pasada hacia adelante puede hacer y que tres etapas no pueden.

Gemini 3.8 Live oye la prosodia, el tono y la vacilación directamente, en lugar de a través de una transcripción que ya los ha descartado, y por eso puede cambiar de idioma a mitad de frase y por eso su puntuación en dinámica conversacional —96,1 % para el modelo estándar, según Artificial Analysis— es el único componente en el que supera a su propio modelo hermano centrado en el razonamiento. También ejecuta llamadas a herramientas y API en segundo plano mientras sigue hablando, así que una consulta no provoca silencio. Y la variante Extended Thinking es una capacidad genuinamente distinta, no una versión más grande de la misma: resuelve el 68,6 % de los escenarios de atención al cliente de τ-Voice frente al 30,1 % del modelo estándar, una brecha de 38 puntos que es la cifra individual más grande del lanzamiento y la razón por la que Google dividió la línea en dos.

Si el trabajo de tu agente es completar una tarea de varios pasos en lugar de mantener una conversación agradable, esa diferencia de 38 puntos lo decide todo, y cuesta 3,50 $ la hora en vez de 0,84 $ —y aun así está por debajo de todos los modelos a los que supera en esa tabla.

La pata del medio es la que realmente puedes mover

Aquí está la costura que merece nombrarse, porque es donde la cuestión de arquitectura se convierte en una cuestión de adquisición. En una cascada, el tramo intermedio —la parte que decide qué decir, llama a las herramientas y hace el razonamiento— es inferencia de texto ordinaria. También es el tramo con mayor variación de costos, mayor dependencia del proveedor y menos razones para estar atado a un solo proveedor. El stack que documenta ElevenLabs usa, casualmente, un modelo Gemini ahí. No tiene por qué.

OrcaRouter cubre ese tramo y no los dos externos. No alojamos los endpoints de voz de Gemini 3.8 Live — esos provienen de la propia Live API de Google — y tampoco alojamos ElevenLabs, cuyas capas de síntesis y de agentes son producto suyo. Lo que sí ofrecemos es la capa de texto que hay debajo: más de 200 modelos tras una sola clave al precio de lista del proveedor y sin margen añadido, de modo que una rebaja de precio de un laboratorio upstream llega a tu factura el mismo día en lugar de en la siguiente renovación. En concreto, para un stack de voz, tres de esas propiedades se ganan su sitio. La conmutación automática por error mantiene viva una llamada cuando un backend falla o agota el tiempo de espera a mitad de frase, un fallo que quien llama nota de inmediato. El DSL de enrutamiento compone varios modelos en una sola llamada, de modo que un modelo barato puede encargarse de los turnos de acuse de recibo y uno más potente puede asumir la transacción. Y la fusión de modelos permite que un panel responda en conjunto en los turnos en los que el criterio de un solo modelo no basta para confiar en él por sí solo. Cambiar qué modelo ocupa el centro de una cascada es un cambio de configuración, no una reconstrucción — y esa es precisamente la razón de ser de la arquitectura en cascada.

¿Cuál elegir?

Elige ElevenLabs si vas a lanzar una línea telefónica y no quieres construir una pila de voz. Estás comprando telefonía, un catálogo de voces, transcripciones, concurrencia y un contrato de soporte, y el sobrecoste por minuto es lo que cuestan esas cosas. También estás comprando la capacidad de cambiar el modelo sobre la marcha sin cambiar nada más, lo cual vale más de lo que parece.

Elige Gemini 3.8 Live si la voz es una función de algo que ya operas. Obtienes la tarifa competente de voz a voz más barata que se publique actualmente, 97 idiomas con cambio a mitad de conversación, ejecución de herramientas que corre mientras el modelo sigue hablando y —si tu agente tiene que completar tareas en lugar de solo conversar— la brecha agéntica de 38 puntos que compra la variante Extended Thinking por aproximadamente cuatro veces el costo horario de audio. Tú proporcionas el operador de telefonía, el ciclo de vida de la sesión y los registros.

Qué observar: si ElevenLabs publica una única cifra de latencia para un minuto de agente gestionado, porque esa es la cifra que haría que esta comparación fuera cuantitativa en lugar de estructural; y si el resultado de Speech Agent Arena se sostiene cuando se mide en él un agente construido sobre 3.8 Live, porque que una cascada actualmente supere a un modelo nativo en éxito de tareas es lo más interesante de este enfrentamiento y lo menos explicado.