
Gemini 3.8 TTS vs Gemini 3.1 Flash TTS: La única brecha en esta familia que es real
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Actualizar dentro de una misma familia de modelos suele ser la decisión fácil, y en este caso hay un matiz que la hace menos fácil de lo que parece. Gemini 3.1 Flash TTS —todavía figura en la API del proveedor como preview— ocupa el puesto 10 en el Artificial Analysis Provider Voice Arena, con un Elo de 1,199 y un intervalo de 12 puntos. Gemini 3.8 Flash TTS, lanzado el 23 de septiembre de 2026, ocupa el puesto 2 con un Elo de 1,260 y un intervalo de 17 puntos. Eso supone una ganancia de 61 puntos y, a diferencia de la mayoría de las diferencias de esa tabla, sobrevive a los márgenes de error: el rango de 3.1 va de 1,187 a 1,211, el de 3.8 va de 1,243 a 1,277, y hay una zona muerta de treinta y dos puntos entre ambos. La mejora de calidad es real. La historia del precio es donde se vuelve extraña.

La propia tabla de tarifas de Google dice que la tarifa de salida de audio cayó de $20.00 por millón de tokens en 3.1 a $9.00 en 3.8, un recorte del 55 %. Artificial Analysis normaliza los mismos dos modelos a $18.30 y $33.00 por millón de caracteres, respectivamente, lo que dice lo contrario. Ambas cifras están publicadas; ninguna es incorrecta; miden cosas diferentes, y la conciliación es la parte más útil de esta comparación para cualquiera que planifique una migración.
Lo que la actualización realmente cambió
La generación 3.8 no es un reajuste. Tres superficies cambiaron de forma sustancial.
• Cantidad de voces y creación de voces — 3.1 Flash TTS se lanzó con un conjunto de voces predefinidas. 3.8 Flash TTS incluye 30 voces de estudio predefinidas, entre ellas Kore y Puck, además de diseño de voz a partir de una descripción en lenguaje natural y replicación de voz a partir de una muestra de 30 segundos con verificación del consentimiento, una marca de agua SynthID y credenciales C2PA en la salida. La remezcla de voces se indica como próximamente en lugar de estar ya disponible.
• Control de la interpretación — dirección línea por línea, puesta en escena de escenas con dos hablantes dentro de una sola llamada, y señales no verbales escritas directamente en el guion como <risas>, <suspiro>, <jadeo>, |mhm| y |sí|. El material de lanzamiento de Google afirma una mejora en la consistencia de formato largo y el control de guiones con dos hablantes frente a 3.1 en concreto. Esa es una afirmación del proveedor sin ninguna prueba pública que la respalde.
• Cobertura de idiomas: 130 idiomas en Flash TTS y 101 en Flash-Lite TTS, detectados automáticamente a partir del texto. La cobertura publicada de 3.1 Flash TTS es menor.
El cambio estructural es la división. No hay un único sucesor de 3.1 Flash TTS; hay dos, y la documentación de Google posiciona a Flash-Lite TTS como el «sustituto que hace el trabajo pesado». Eso importa porque significa que una migración es una decisión de nivel, no un salto de versión. El nivel más barato no es la versión más nueva de lo que tienes — es un punto diferente en la curva.
Por qué el precio bajó y la tabla de clasificación dice que subió
Comienza con lo que publica Google, porque eso es lo que realmente se te facturará.
• Gemini 3.1 Flash TTS Preview — $1.00 por cada millón de tokens de texto de entrada, $20.00 por cada millón de tokens de audio de salida. El procesamiento por lotes es de $0.50 y $10.00.
• Gemini 3.8 Flash TTS Standard — $0.50 y $9.00 hasta el 31 de diciembre de 2026; después, $1.00 y $18.00. Batch y Flex $0.25 y $4.50. Priority $0.90 y $16.20.
• Gemini 3.8 Flash-Lite TTS Standard: $0.50 y $6.00 hasta el 31 de diciembre de 2026, y luego $1.00 y $12.00. Batch y Flex: $0.25 y $3.00. Priority: $0.90 y $10.80.

Solo en la línea de salida de audio, 3.8 Flash TTS a $9.00 frente a 3.1 a $20.00 es una reducción del 55 por ciento, y 3.8 Flash-Lite TTS a $6.00 es una reducción del 70 por ciento. Incluso con el precio posterior a la promoción de $18.00, Flash TTS sigue estando por debajo del modelo al que reemplaza. Ese es el número que aparece en una factura, y es inequívoco.
Ahora, la tabla de clasificación. Artificial Analysis publica una cifra por millón de caracteres para que los modelos que facturan en distintas unidades puedan clasificarse en pie de igualdad, y para este par da $18.30 para 3.1 Flash TTS y $33.00 para 3.8 Flash TTS. Leído por sí solo, eso indica que la actualización casi duplicó el precio.
La conciliación es que una tarifa por carácter es una conversión, no un precio, y el factor de conversión no es el mismo para los dos modelos. Convertir tokens de audio a caracteres requiere suponer tanto una velocidad de habla como una proporción de tokens de audio —Google mide el audio a 25 tokens por segundo de salida— y requiere elegir contra qué nivel de servicio normalizar. Si la junta normaliza 3.8 a la tarifa de $18.00 posterior a la promoción mientras normaliza 3.1 a sus propios $20.00, las dos están lo suficientemente cerca como para que cualquier diferencia en los segundos por carácter supuestos domine el resultado. Una tarifa por carácter basada en una suposición generosa de velocidad de habla favorece al modelo al que se aplica.
La instrucción práctica es, por tanto: usa las tarifas por token de Google para presupuestar, y usa las tarifas por carácter del ranking solo para la proporción entre modelos que el ranking midió de la misma manera. No las mezcles, y no cites el movimiento de $18.30 a $33.00 como un aumento de precio —es un artefacto de una normalización que los dos modelos no comparten.
El verdadero costo de migración es otro, y es la ventana promocional. Ambos nuevos niveles están a mitad de tarifa hasta el 31 de diciembre de 2026 y se duplican el 1 de enero. Una migración planificada con las cifras de septiembre y ejecutada en noviembre recalculará su precio en el primer trimestre. La tarifa de enero de 2027 para Flash TTS, $18.00 por millón de tokens de audio, sigue estando por debajo de los $20.00 de 3.1, así que la rebaja es real una vez pasada la promoción, solo que mucho menor de lo que parece hoy.
La ganancia de calidad, y lo que no está detrás de ella
El Elo de la arena es el único número aquí recopilado por alguien distinto al proveedor, y es el único que supera sus barras de error. Sesenta y un puntos, de 1.199 a 1.260, con 3.430 muestras en 3.1 y 1.999 en 3.8, y 7 voces de la arena frente a 8. El número de muestras del modelo más nuevo es menor, lo que amplía su intervalo y, aun así, los rangos no se tocan.

Lo que no lo respalda: ningún benchmark independiente aparte de la arena. Las cifras de lanzamiento de Google —primero en el Hume AI Voice Design Benchmark con 71,4, primero en modelado de acentos con 60,8, primero y segundo en el Hume Overall Quality Index para Flash y Flash-Lite, y los primeros puestos en preferencia ciega reclamados en japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi— son el proveedor citando el benchmark de un tercero. Las ejecuciones subyacentes no son públicas. Léelas como afirmaciones, en la misma dirección que el resultado de la arena, pero sin añadirles peso independiente.
La cuestión de la deprecación y una lista de comprobación para la migración
Google no ha anunciado una fecha de apagado para Gemini 3.1 Flash TTS Preview. Ha dicho que Flash-Lite TTS se posiciona como su reemplazo principal, que es el tipo de lenguaje que precede a un aviso de obsolescencia en lugar de seguirlo. Si todavía usas el modelo de vista previa, la interpretación correcta es que tienes una migración que planificar, no una fecha límite que cumplir, y que esperar a la fecha límite es la estrategia equivocada para un modelo cuyo reemplazo ya está 61 puntos Elo por delante.
• Comprueba qué nivel necesita tu carga de trabajo. Flash TTS para 130 idiomas y toda la superficie de entrega; Flash-Lite TTS para 101 idiomas a $6.00 por millón de tokens de audio. La lista de idiomas es la línea divisoria, no la calidad.
Vuelve a calcular el precio según la tarifa de enero de 2027, no la promocional. $18.00 por millón de tokens de audio en Flash TTS, $12.00 en Flash-Lite.
• Decide si el trabajo se puede procesar por lotes. Batch y Flex reducen a la mitad la tarifa de audio en ambos niveles — $4.50 y $3.00 por millón de tokens. Todo lo que no sea interactivo no debería estar en el nivel Standard.
• Vuelve a comprobar todo lo que dependía del conjunto de voces. El catálogo predeterminado tiene 30 voces predefinidas; es posible que la voz que usabas en 3.1 tenga que volver a crearse, ya sea mediante diseño de voz o mediante una muestra de replicación de 30 segundos.
• Vuelve a revisar el modelado de solicitudes. No hay un límite publicado de caracteres por solicitud en los modelos 3.8, y el audio se tarifa por segundo en lugar de por carácter, así que una expresión larga cuesta más de lo que sugeriría una cotización por carácter.
• Planifique el ciclo de vida de las voces personalizadas. 200 voces con estado por proyecto con un tiempo de vida de un año, o sin estado voicekey_... identificadores que caducan en siete días.
Ejecutando ambos mientras decides
Una actualización dentro de la misma familia con una caducidad promocional y un desacuerdo de normalización es exactamente el caso para no migrar de una sola vez. OrcaRouter enruta el modelo anterior hoy — models/google/gemini-3.1-flash-tts-preview está en nuestra lista de modelos —, así que puedes poner en marcha el nuevo modelo junto a él y comparar con tu propio tráfico antes de mover la ruta de producción. No alojamos los endpoints de Gemini 3.8 TTS; esos provienen de la propia API de Google. Lo que ofrecemos es la clave única para más de 200 modelos al precio de lista del proveedor sin recargo, de modo que un cambio de tarifa del proveedor llega a tu factura el mismo día en lugar de en la renovación, y failover automático para que un modelo recién lanzado sea algo que puedas probar sin apostar una ruta de cara al cliente a él.
Lo que hay que observar es si Google pone una fecha a la vista previa de 3.1 Flash TTS. Esa única línea de documentación vale más para un plan de migración que cualquiera de los benchmarks de este artículo, y todavía no se ha escrito.
