
Gemini 3.8 TTS vs ElevenLabs: qué te ofrece el triple de precio
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Con el mismo volumen, el modelo de síntesis insignia de ElevenLabs cuesta aproximadamente tres veces lo que cuesta el nuevo modelo del proveedor. ElevenLabs Eleven v3 cobra $0.10 por mil caracteres — $100 por millón — y Gemini 3.8 Flash TTS cobra $9.00 por millón de tokens de audio, lo que Artificial Analysis normaliza a $33.00 por millón de caracteres. Esa es una diferencia de 3,0x en el medidor, y es el dato más importante de esta comparación. La pregunta interesante no es si la diferencia es real; es lo que realmente compran los sesenta y siete dólares extra por millón de caracteres, porque la respuesta no es «mejor habla».

Tres metros, no uno
Lo primero que hay que tener claro es que estos dos productos no miden lo mismo, y las tarifas publicadas ocultan eso.
• ElevenLabs cobra por carácter. Eleven v3 cuesta $0.10 por cada 1000 caracteres, con un límite de 5000 caracteres por solicitud. Eleven v3 Conversational cuesta $0.05 por cada 1000, y los modelos Flash y Turbo también cuestan $0.05 por cada 1000, pero con un límite de 40 000 caracteres por solicitud y una latencia declarada de ~75 ms frente a los ~280 ms de v3 Conversational.
• Google factura por token, y los tokens de audio no son tokens de texto. Gemini 3.8 Flash TTS cobra $0.50 por millón de tokens de texto de entrada y $9.00 por millón de tokens de audio de salida, medidos a 25 tokens de audio por segundo de voz generada. No se ha publicado ningún límite de caracteres por solicitud.

• Artificial Analysis no factura ninguna de las dos; normaliza. Los $100.00 y $33.00 por millón de caracteres en su tabla de clasificación Provider Voice Arena son un denominador común derivado para que la tabla pueda, aunque sea, clasificar por precio. Útil para una proporción, no para una cotización.
Así que la versión honesta de la cifra de 3,0x es: en la única base comparable disponible, el precio de Google es aproximadamente un tercio. Lo que eso significa en tu propia hoja de cálculo depende de si tu carga de trabajo está dominada por cadenas cortas o largas — un medidor de audio por segundo y un medidor de texto por carácter divergen marcadamente a medida que los enunciados se hacen más largos, porque el silencio, las pausas y el relleno prosódico cuestan tokens de audio y no caracteres.
Un mes trabajado
Toma un millón de caracteres de texto, aproximadamente la longitud de una novela de tamaño medio, convertidos a voz una vez.
• ElevenLabs Eleven v3 — $100.00 por la síntesis, más el nivel de plan que necesites para ejecutarlo a tu concurrencia. Los planes publicados incluyen Starter a $6, Creator a $22, Pro a $99, Scale a $299 y Business a $990, y las cuotas de caracteres están incluidas en esos planes en lugar de facturarse por separado.
• Gemini 3.8 Flash TTS — $33.00 equivalentes, o aproximadamente $16.50 si el trabajo se puede procesar por lotes, porque el nivel Batch y Flex reduce a la mitad la tarifa de audio a $4.50 por millón de tokens. El servicio Priority lo eleva a $16.20 por millón, o alrededor de $59.40 equivalentes, lo que sigue estando muy por debajo de ElevenLabs.
• Gemini 3.8 Flash-Lite TTS — 6,00 $ por millón de tokens de audio, unos 22,10 $ equivalentes con la misma normalización, a costa de 101 idiomas en lugar de 130.
Si aplicas los precios promocionales de Google al mismo millón de caracteres, la brecha se amplía aún más, porque ambos nuevos modelos Gemini TTS están a mitad de precio hasta el 31 de diciembre de 2026 y luego se duplican. Cualquiera que elabore un caso de negocio con las cifras de septiembre lo está construyendo sobre un descuento que tiene una fecha de vencimiento publicada.

El único punto en el que la comparación se invierte son los enunciados muy cortos. Una tarifa por carácter apenas cobra nada por una confirmación de tres palabras; una tarifa de audio por segundo cobra el segundo que tarda en decirse la confirmación, incluido el silencio que la rodea. Si tu producto es una interfaz de voz construida a base de respuestas de una sola frase, la aritmética se inclina hacia ElevenLabs. Si es narración, audiolibros, localización de formato largo o cualquier cosa en la que el texto sea largo y el audio más largo, se inclina claramente hacia Google.
La cuestión de la calidad, honestamente
En el Artificial Analysis Provider Voice Arena —votos por pares a ciegas entre las voces nativas de cada proveedor— los dos modelos no están nada igualados, y Google va por delante.
• Gemini 3.8 Flash TTS — puesto 2, Elo 1.260, un intervalo de 17 puntos, 1.999 muestras, 8 voces de arena, lanzado en septiembre de 2026.
• ElevenLabs Eleven v3 — puesto 17, Elo 1.167, un intervalo de 11 puntos, 4.345 muestras, 8 voces de arena, figura como febrero de 2026 en la tabla.
Los separan noventa y tres puntos Elo y, a diferencia de la brecha entre los tres primeros de esa tabla, esta sí es real: el intervalo de Eleven v3 es de 1.156 a 1.178 y el de Gemini es de 1.243 a 1.277, sin superposición. El número de muestras de Eleven v3 es más del doble que el de Gemini, así que la estimación tampoco es endeble.
Ese es un resultado genuinamente incómodo para el argumento del precio, y va en contra de la conclusión obvia. ElevenLabs cobra tres veces más y queda diecisiete puestos más abajo en preferencia a ciegas. Sea lo que sea que compren los sesenta y siete dólares extra, no es una voz que suene mejor en una comparación directa.
Lo que ElevenLabs vende en realidad
ElevenLabs no vende principalmente un endpoint de síntesis, y ponerle precio como si lo fuera es donde fallan la mayoría de las comparaciones. Lo que compra el dinero:
• Una biblioteca de voces. La biblioteca de voces compartida de ElevenLabs tiene cientos de voces y es una superficie de producto genuina: aquello por lo que la gente viene a ElevenLabs suele ser una voz específica que escuchó en algún lugar, no el modelo que hay detrás. Gemini 3.8 Flash TTS incluye 30 voces de estudio predefinidas, una ruta de diseño de voz que genera una a partir de una descripción en lenguaje natural, y una ruta de replicación que clona a partir de una muestra de 30 segundos con verificación de consentimiento, una marca de agua SynthID y credenciales C2PA adjuntas. El catálogo predeterminado es más pequeño; la capacidad de crear una voz específica es comparable.
• Niveles de latencia como productos independientes. Flash y Turbo a ~75 ms y un límite de 40.000 caracteres son un producto distinto de v3 a ~280 ms y 5.000 caracteres, y ambos son más baratos que v3. Si tu aplicación necesita menos de 100 ms, ElevenLabs lo vende explícitamente y el material de lanzamiento de Google no hace una afirmación de latencia comparable para ninguno de los dos nuevos modelos TTS.
Un ecosistema. Doblaje, agentes de voz, endpoints conversacionales, una estructura de planes con concurrencia asociada — la misma razón por la que Cartesia vende telefonía: es un stack, no un modelo.
Si compras un stack, el 3.0x es el precio de no ensamblarlo. Si compras una llamada de síntesis, lo pagas por una biblioteca de voces y un nivel de latencia.
Lo que Google está vendiendo en realidad
El contraargumento es más acotado y más sólido que «más barato».
• Cobertura de idiomas — 130 idiomas en Flash TTS y 101 en Flash-Lite TTS, detectados automáticamente a partir del texto, frente a los más de 70 idiomas que ElevenLabs documenta para Eleven v3. Para una pasada de localización, esa diferencia no es una comparación de funciones, es una brecha de cobertura.
• Dirección — control de la locución línea por línea, escenificación de escenas con dos hablantes dentro de una sola llamada, y señales no verbales escritas en el guion como <laughs>, <sigh>, <gasp>, |mhm| y |yeah|. Google afirma que la generación 3.8 mejoró la consistencia en formatos largos y el control de dos hablantes respecto a Gemini 3.1 Flash TTS, que es exactamente para lo que existen esas funciones. Afirmación del proveedor, no reproducida.
• Modelo de estado de las voces: 200 voces personalizadas con estado por proyecto con un TTL de un año, o voces sin estado direccionadas mediante un identificador voicekey_... que caducan en siete días. Es una decisión de infraestructura que puedes planificar.
• Control de salida — WAV PCM mono de 16 bits con signo a 24 kHz en el endpoint unario, PCM sin encabezado (audio/l16) en el endpoint de streaming, y audio/mulaw y audio/alaw con una frecuencia de muestreo configurable.
Los benchmarks de lanzamiento de Google están reportados por el proveedor y deben leerse así: primero en el Hume AI Voice Design Benchmark con 71,4 y primero en modelado de acentos con 60,8; primero y segundo en el Hume Overall Quality Index para Flash y Flash-Lite, respectivamente; y los mejores puestos en preferencia a ciegas que se atribuye en japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi. Ninguna de esas ejecuciones es pública. El Elo de la arena anterior es el único número recopilado de forma independiente en este artículo, y da la casualidad de que coincide con la dirección de las afirmaciones del proveedor.
El cálculo del switch
Cambie si su carga de trabajo es de formato largo, multilingüe o de volumen lo suficientemente alto como para que 3.0x aparezca como una partida, y si puede vivir con un catálogo de voces predeterminado más pequeño y sin un nivel publicado de menos de 100 ms. Eso cubre narración, doblaje, accesibilidad y la mayoría del habla integrada en productos.
Quédate si estás comprando el stack —la biblioteca de voces, los niveles de latencia, los productos de doblaje y de agentes— o si tu carga de trabajo está dominada por enunciados muy cortos en los que un medidor de audio por segundo te penaliza. También quédate si ya has ajustado una identidad de voz en ElevenLabs que tus usuarios reconocen, porque la continuidad de la voz es una característica del producto y recrearla en un nuevo modelo es todo un proyecto.
En cualquier caso, lo sensato es probar ambos durante un mes con tráfico real antes de comprometerse, y ese es el argumento para no conectar ninguno de los dos directamente en tu base de código. OrcaRouter pone más de 200 modelos detrás de una sola clave al precio de lista del proveedor, sin recargo, así que un cambio de precio de cualquiera de los dos laboratorios llega a tu factura el mismo día en lugar de en la renovación, y la conmutación automática por fallo mantiene activa una ruta de voz en producción cuando un endpoint recién lanzado falla. Nosotros no alojamos ElevenLabs —sus capas de síntesis y de agentes son su propio producto— y tampoco alojamos los endpoints de TTS de Gemini 3.8, que provienen de la API de Google. Lo que ofrecemos es la capa de texto que hay debajo y el enrutamiento que hay por encima.
La cifra que vale la pena seguir es el Elo de Eleven v3 en la próxima revisión de la tabla de clasificación. Noventa y tres puntos son un déficit enorme para un modelo que cobra tres veces más, y si el intervalo se estrecha sin que la brecha se cierre, el argumento del precio deja de ser un intercambio y se convierte en un veredicto.
