Una tarjeta destacada generada para ElevenLabs Eleven v4 vs. Google Gemini 3.1 Flash TTS con dos tarjetas de puntuación: Eleven v4 con Elo 1.319 y $80,00 por 1M de caracteres, y Gemini 3.1 Flash TTS con Elo 1.203 y $18,31 por 1M de caracteres, con el texto «116 puntos Elo, 4,4 veces el precio del ranking». Pie de página: «Provider Voice Arena, según Artificial Analysis, septiembre de 2026.» El logotipo de OrcaRouter se encuentra en la esquina inferior derecha.
Guides & Insights

Eleven v4 vs Gemini 3.1 Flash TTS: una brecha de 116 puntos, y el modelo de Google más económico

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Si hoy buscas la voz de Goog​le, darás con la equivocada. Goog​le Gemini 3.1 Flash TTS figura en el puesto 11 del Provider Voice Arena de Artificial Analysis, con un Elo de 1.203 en 3.512 apariciones, a 18,31 $ por millón de caracteres. ElevenLabs Eleven v4, lanzado el 28 de septiembre de 2026, ocupa el puesto 1 con un Elo de 1.319 en 1.674 apariciones, a 80,00 $ por millón. Parece una brecha de 116 puntos frente a un retador más barato... hasta que uno se da cuenta de que el propio Gemini 3.8 Flash TTS de Goog​le ocupa el tercer lugar en la misma tabla, con 1.267 y un precio normalizado más bajo de 16,49 $. La verdadera contienda no es la que sugiere el enfrentamiento del titular, y el motivo es una fecha de lanzamiento.

Uno de estos es dieciocho meses más nuevo de lo que parece.

Gemini 3.1 Flash TTS figura con una fecha de lanzamiento del 15 de abril de 2026 en la clasificación. Eleven v4 figura con el 28 de septiembre de 2026. Eso son cinco meses y medio, lo que no es una generación en síntesis de voz, pero es tiempo suficiente para que Google ya haya lanzado un sucesor: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS alcanzaron la disponibilidad general el 23 de septiembre de 2026, cinco días antes de Eleven v4, y ambos están clasificados por encima de 3.1 en la misma clasificación. Gemini 3.8 Flash-Lite TTS ocupa el sexto puesto con 1.241 y 11,03 $ por millón.

A generated scoreboard comparing ElevenLabs Eleven v4 and Google Gemini 3.1 Flash TTS across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 11 / 1,203), samples (1,674 with an interval of plus or minus 19 against 3,512 with plus or minus 12), board price ($80.00 against $18.31 per 1M characters), rate card ($0.022 per 1K characters until October 12 against billed per token), script direction (inline audio tags against a voice set and prompting) and release date (September 28, 2026 against April 15, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis; rate meters and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

Así que la comparación honesta tiene tres puntos, no dos, y el orden por precio es la parte interesante:

• Puesto 1, ElevenLabs Eleven v4 — Elo 1.319, $80.00 por millón de caracteres, 1.674 apariciones, intervalo ±19

• Puesto 3, Google Gemini 3.8 Flash TTS — Elo 1.267, 16,49 $ por millón de caracteres, lanzado el 23 de septiembre de 2026

• Puesto 6, Google Gemini 3.8 Flash-Lite TTS — Elo 1.241, $11,03 por millón de caracteres, lanzado el 23 de septiembre de 2026

• Puesto 11, Google Gemini 3.1 Flash TTS — Elo 1,203, $18.31 por millón de caracteres, publicado el 15 de abril de 2026, 3,512 apariciones, intervalo de ±12

Observa lo que los intervalos hacen con ese orden. Gemini 3.1 Flash TTS estima 1.203 con un intervalo de ±12, así que su valor real se sitúa en algún punto entre 1.191 y 1.215. Eleven v4 estima 1.319 con un intervalo de ±19 — aproximadamente de 1.300 a 1.338. Los dos rangos no se tocan, y la brecha entre ellos supera los cien puntos de ancho. Eso es lo más limpio que puede llegar a ser una tabla de preferencias.

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard, top of the table. ElevenLabs Eleven v4 is rank 1 at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices, released Sept 2026 at $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276. Google Gemini 3.8 Flash TTS is third at 1,267 with $16.5 per 1M characters. Google Gemini 3.8 Flash-Lite TTS is sixth at 1,241 with $11.0. SpeechifyAI Simba 3.2 is seventh at 1,240 with $6.6. Google Gemini 3.1 Flash TTS is eleventh at 1,203 with an interval of plus or minus 12, 3,512 samples, seven arena voices, released Apr 2026 at $18.3 per 1M characters.

Por qué los recuentos de muestras importan más que los rangos

Gemini 3.1 Flash TTS tiene 3.512 apariciones por detrás de su estimación; Eleven v4 tiene 1.674, porque lleva un día en esta tabla. La estimación de un modelo más nuevo conlleva más incertidumbre por muestra, y el intervalo de ±19 lo refleja. Si usted es el tipo de comprador que espera a que un número se estabilice, la regla general es que el ordenamiento por encima de la amplitud del intervalo es la parte sobre la que puede actuar. Aquí la clasificación sobrevive cómodamente a sus barras de error en ambas direcciones —por delante de 3.8 Flash TTS y por detrás de nadie en esta comparación.

La arena también cuenta las voces de la arena: ocho para Eleven v4, siete para Gemini 3.1 Flash TTS. Ese es el número de voces distintas de proveedores usadas en las pruebas a ciegas, y es una aproximación tosca de cuánto elenco predeterminado aporta un proveedor. El puesto 1 de Eleven v4 se ganó con ocho voces, lo que significa que la victoria no es la de un único narrador afortunado.

Las diferencias de capacidad que el Elo no valora

Los rankings miden preferencias, no cobertura de funcionalidades. Cuatro diferencias deciden los proyectos reales, y ninguna de ellas aparece en un Elo.

• Dirección de guion — Eleven v4 documenta etiquetas de audio en línea ([risas], [susurros], [dicho con enojo con acento francés]) e indicaciones de entrega en lenguaje natural; la generación 3.1 de Google documenta la elección de voz y las indicaciones, pero no una sintaxis de etiquetas equivalente para la dirección de interpretación.

• Creación de voz — la generación Gemini 3.8 añadió el diseño de voz a partir de una descripción escrita y la replicación de voz a partir de una muestra de 30 segundos con marca de agua y metadatos de procedencia en la salida. Gemini 3.1 Flash TTS es anterior a eso e incluye un conjunto de voces preconstruidas.

• Clonación a partir de audio real: la Clonación Instantánea de Voz de Eleven v4 funciona con diez segundos de audio, con un nivel profesional por encima. La ruta de replicación de Google en la generación 3.8 pide 30 segundos y añade verificación de consentimiento. Distintos umbrales, distintos mecanismos de consentimiento.

• Límite de entrada por solicitud — Eleven v4 documenta 10.000 caracteres. Google factura sus modelos de TTS en tokens en lugar de caracteres, por lo que no existe un límite de caracteres por solicitud directamente comparable con el que contrastarlo, y los dos medidores no deberían colocarse uno junto al otro como si lo fueran.

Ese último punto es el que hace tropezar a las hojas de cálculo de compras. ElevenLabs cotiza un precio por cada 1000 caracteres. Google cotiza un precio por millón de tokens, de entrada y de salida. Artificial Analysis normaliza ambos en un eje por millón de caracteres —de ahí vienen los $80.00 y los $18.31—, pero la normalización es la conversión del consejo, no la factura de ninguno de los proveedores. Úsala para clasificar, no para pronosticar.

A screenshot of Google's Gemini API documentation page for text-to-speech generation, headed by a banner reading 'Gemini 3.8 Flash is now available'. The page covers single-speaker and multi-speaker TTS, states that the TTS capability differs from the Live API in being designed for exact text recitation with fine-grained control, names the gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts models, notes that TTS models accept text-only input and produce audio-only output, and shows a Python example that attaches a speech_metadata annotation with the style 'cheerful and friendly' and a voice of 'Kore' in generation_config.speech_config.

Lo que la tarjeta de tarifas de Eleven v4 le hace a esta comparación

Durante dos semanas, la comparación de precios anterior es incorrecta a favor de ElevenLabs, y luego es incorrecta en su contra. En la página de precios de la API de ElevenLabs, Eleven v4 aparece a $0.022 por 1000 caracteres frente a un precio de lista declarado de $0.08, etiquetado con un 72 % de descuento hasta el 12 de octubre. Eleven v4 Turbo aparece a $0.011 frente a $0.04. Después del 12 de octubre, el número promocional desaparece y el precio de $80.00 por millón se convierte en la tarifa que realmente pagas.

Haz el cálculo para un mes de cinco millones de caracteres. Eleven v4 cuesta 110 $ durante la ventana y 400 $ después de ella. Gemini 3.1 Flash TTS, con la normalización de 18,31 $ de la junta, equivale a unos 92 $ para el mismo mes — más barato que la promoción y aproximadamente cuatro veces más barato que la tarifa de lista. Un equipo que haga pruebas comparativas en septiembre y lance en noviembre habrá tomado la decisión basándose en una cifra que ya no existe.

Dónde encaja el enrutamiento y dónde no

Ninguno de estos modelos está en el catálogo de OrcaRouter. Aquí no hay ningún endpoint de ElevenLabs ni ningún endpoint de Google TTS al que llamar, y la respuesta honesta a «cómo llego a ellos a través de ti» es que no llegas: se accede a Eleven v4 mediante la propia API de ElevenLabs, y a Gemini 3.1 Flash TTS mediante la de Google. Decir cualquier otra cosa sería inventar una integración.

Para lo que sirve una única clave en una comparación como esta es para la propia decisión. Si estás sopesando un endpoint de 400 $ al mes frente a uno de 92 $ al mes, la respuesta depende de tus propios scripts, tus propios idiomas y tus propios oyentes — y obtener esa respuesta implica llamar a ambos desde la misma ruta de código con la misma forma de solicitud, en lugar de montar dos integraciones de proveedores para ejecutar una sola prueba. OrcaRouter cubre esa capa: más de 200 modelos detrás de una única clave, con los precios de lista de los proveedores trasladados con un 0% de margen, de modo que el cambio de precio de un proveedor se refleja el mismo día en que entra en vigor, además de conmutación por error automática si un proveedor upstream se degrada a mitad de la evaluación.

¿Quién debería elegir cuál?

Elige Eleven v4 cuando la voz es el producto. Lidera la tabla por 116 puntos con un intervalo más limpio que el modelo que tiene debajo, es el único de los dos con una sintaxis de etiquetas en línea documentada para dirigir el rendimiento, y su umbral de clonación es de diez segundos en lugar de treinta. La prima es real —cuatro veces el precio normalizado de lista— y compra la cima de la tabla.

Elige Gemini 3.1 Flash TTS solo si ya estás comprometido con él. Es un modelo de generación en versión preliminar con cinco meses de antigüedad, con una puntuación más baja y un precio normalizado más alto que el lanzamiento de septiembre de la propia Google, y la única razón para mantenerlo es la inercia de una integración existente. Si tienes esa inercia, migrar dentro del stack de Google a 3.8 Flash TTS te aporta 64 puntos Elo y un precio normalizado más bajo sin cambiar de proveedor, lo cual es un caso raro en el que la actualización también es la opción más barata.

Para todos los demás, la pregunta del momento es Eleven v4 frente a Gemini 3.8 Flash TTS, y la respuesta es un verdadero intercambio en lugar de una clasificación: 52 puntos Elo y la sintaxis de etiquetas a cambio de aproximadamente una quinta parte del costo por carácter. Ejecuta ambos con los mismos guiones después del 12 de octubre, cuando la promoción de ElevenLabs ya no esté y la diferencia de precio sea la que realmente vayas a pagar.