
Gemini 3.8 Flash TTS dice hola: Google divide en dos su línea de voz y recorta el precio
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
El proveedor lanzó dos modelos de voz el 23 de septiembre de 2026, y el anuncio está redactado como si el titular fuera la calidad de voz. No lo es. Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS son los primeros modelos de texto a voz que el proveedor ha puesto en la Gemini Developer API a un precio inferior al del modelo de vista previa al que reemplazan — y para cualquiera que haya estado pagando por carácter en otro lugar, esa es la parte que cambia una línea de presupuesto. La tarifa de salida de audio en Gemini 3.8 Flash TTS es de $9.00 por millón de tokens hasta finales de 2026. El audio se factura a 25 tokens por segundo, lo que equivale a aproximadamente 0,02 centavos por segundo de voz generada. El modelo al que reemplaza, Gemini 3.1 Flash TTS Preview, tenía un precio de $20.00 por millón de tokens de audio.
La segunda mitad de la historia es que ahora hay dos modelos, no uno. Google dividió la línea: Flash TTS incluye el conjunto completo de idiomas y la tasa de audio más alta; Flash-Lite TTS incluye una lista de idiomas más corta y una opción más económica. Eso es una forma distinta de la configuración de un único modelo de vista previa que ha estado en la API desde abril, y te dice cómo ve Google el mercado: un pequeño número de aplicaciones que necesitan 130 idiomas y clonación de voz, y un número mucho mayor que necesita una voz competente en inglés para un bot de soporte y nada más.
Qué se lanzó realmente el 23 de septiembre
Ambos modelos están disponibles de forma general en la API de Gemini y en AI Studio desde el anuncio, sin estar restringidos por una lista de espera. Los nombres en la API son gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts.
• Flash TTS: 130 idiomas, detección automática del idioma a partir del texto, 30 voces de estudio predefinidas, incluidas Kore y Puck.
• Flash-Lite TTS — 101 idiomas, la misma superficie de diseño de voz, posicionado como el nivel de alto volumen.
• Ambos — diseño de voz a partir de una descripción en lenguaje natural, dirección de interpretación línea por línea, puesta en escena de escenas con dos hablantes y señales no verbales escritas directamente en el guion.
• Salida — WAV PCM firmado de 16 bits mono a 24 kHz en el endpoint unario; PCM sin encabezado (audio/l16) en el endpoint de streaming; también se aceptan audio/mulaw y audio/alaw, con una tasa de muestreo configurable.
La tabla de tarifas, por millón de tokens, vale la pena leerla completa, porque los niveles difieren en más que la cifra destacada:
• Flash TTS Standard — $0.50 texto de entrada / $9.00 audio de salida, aumentando a $1.00 / $18.00 después del 31 de diciembre de 2026.
• Flash TTS Batch and Flex — $0.25 / $4.50.
• Prioridad de Flash TTS — $0.90 / $16.20.
• Flash-Lite TTS Standard — $0.50 / $6.00, aumentará a $1.00 / $12.00 después del 31 de diciembre de 2026.
• Flash-Lite TTS Batch y Flex: $0,25 / $3,00.
• Prioridad de Flash-Lite TTS — $0.90 / $10.80.
• Gemini 3.1 Flash TTS Preview, para comparación — $1.00 / $20.00, por lotes $0.50 / $10.00.
La ventana promocional es lo que hay que tener en cuenta. Google ha fijado el precio de ambos modelos nuevos a mitad de tarifa hasta fin de año y ha publicado las cifras posteriores a la promoción en la misma tabla. Cualquiera que modele el coste por mil minutos debería usar la cifra de enero, no la de septiembre.

El diseño de voz es la capacidad genuinamente nueva
Las voces predefinidas son el mínimo indispensable. Lo que Google añadió en 3.8 es una forma de describir una voz con palabras y obtenerla, y una forma de clonarla a partir de una muestra corta con una verificación de consentimiento adjunta.
El diseño de voz toma un prompt en lenguaje natural —ritmo, timbre, acento, ese tipo de cosas para las que, de otro modo, pasarías una tarde haciendo audiciones— y devuelve una voz utilizable sin una grabación de referencia. La replicación de voz funciona al revés: proporcionas una muestra de 30 segundos, el sistema verifica el consentimiento y la voz resultante se marca con una marca de agua SynthID y credenciales C2PA en el audio generado. La remezcla de voz, que te permite combinar o modificar una voz personalizada existente, figura como próximamente en lugar de estar ya disponible.
Las voces personalizadas vienen en dos variantes y se comportan de forma lo bastante distinta como para que la distinción importe en producción. Las voces personalizadas con estado se almacenan asociadas al proyecto, con un límite de 200 por proyecto y un tiempo de vida de un año. Las voces sin estado se direccionan mediante un identificador voicekey_... y caducan a los siete días. Si tu aplicación aprovisiona una voz por cliente, el límite y el TTL son los dos números que deciden si necesitas tu propia capa de almacenamiento.
Los controles de interpretación son la otra mitad de lo «nuevo». Puedes dirigir una línea como dirigirías a un actor —ritmo, énfasis, registro emocional— en lugar de limitarte a elegir una voz y confiar en que salga bien. Las escenas con dos hablantes pueden montarse dentro de una única llamada. Y las vocalizaciones no verbales son elementos de guion de primera clase: <risas>, <suspiro> y <jadeo> como indicaciones en línea, además de |mhm| y |sí| para los pequeños sonidos de retroalimentación que hacen que una conversación sintética suene como una conversación. Se afirma que la lectura de formato largo mantiene la identidad del hablante con una deriva mínima, que es el modo de fallo que aparece primero cuando se genera un capítulo de audiolibro de 40 minutos.
Los benchmarks, y quién los ejecutó
El material de lanzamiento de Google se apoya en dos evaluaciones externas y una serie de posiciones en arenas. Todos estos son reportados por el proveedor —Google los cita, y las ejecuciones subyacentes no son públicas—, así que trátalos como afirmaciones en lugar de mediciones.

• Benchmark de Diseño de Voz de Hume AI — Gemini 3.8 Flash TTS ocupó el primer lugar con 71,4, y el primer lugar en modelado de acentos con 60,8.
• Índice de Calidad General de Hume — Flash TTS primero, Flash-Lite TTS segundo.
• Preferencia a ciegas en la Speech Arena — primeros puestos obtenidos en japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi.
• Frente a Gemini 3.1 Flash TTS — Google afirma haber conseguido mejoras en la coherencia en formatos largos y en el control de guiones con dos hablantes, que son exactamente las dos cosas para las que están diseñadas las funciones de dirección de la locución.
Una discrepancia documentada merece señalarse porque confundirá a cualquiera que compare fuentes. La entrada del blog describe una biblioteca de más de 2000 voces listas para producción. La documentación para desarrolladores describe "cientos" de voces en la Extended Voice Library, junto con las 30 voces de estudio precompiladas. La cobertura de terceros ha citado cifras aún un orden de magnitud más altas. No se pueden reconciliar desde fuera — la lectura honesta es que el conjunto precompilado que obtienes de forma predeterminada es de 30, la Extended Voice Library es más grande y está descrita de forma vaga, y las cifras grandes se refieren a un catálogo que incluye voces creadas por usuarios. Si el número de voces es determinante para tu decisión, prueba la voz específica que necesitas en lugar de confiar en cualquiera de las tres cifras.
Qué significa si estás construyendo sobre eso
El cambio práctico es que la conversión de texto a voz ha pasado de ser una partida de costos para especialistas a algo que puedes incluir en el mismo modelo de costos que tus tokens de lenguaje. A 25 tokens por segundo, una hora de audio generado son 90.000 tokens de audio, que a la tarifa promocional de Flash-Lite son unos 54 centavos. Eso es lo bastante barato como para que la pregunta interesante deje de ser “¿podemos permitirnos una voz sintética?” y pase a ser “¿cuál de los dos niveles necesita esta superficie?”.
El segundo cambio práctico es que un modelo TTS completamente nuevo es justo el tipo de cosa que quieres probar sin poner en riesgo una ruta de producción con él. Ese es el motivo por el que conviene poner un modelo nuevo detrás de un router en lugar de conectarlo directamente: OrcaRouter expone más de 200 modelos detrás de una sola clave al precio de lista del proveedor y sin recargo, y su conmutación automática por error hace que un nuevo endpoint de voz que se vuelve inestable bajo carga recurra a un modelo en el que ya confías en lugar de que se corte la llamada. No alojamos los endpoints TTS de Gemini 3.8 —esos provienen de la propia API de Google—, pero la capa de texto que subyace a la voz, y la ruta de respaldo cuando falla una llamada de síntesis, son las partes para las que realmente sirve un router.
¿Qué falta todavía?
Tres cosas están ausentes del lanzamiento y cada una de ellas es una limitación real, no una minucia.
No existe ninguna evaluación independiente publicada. Los números de Hume de Google son el proveedor citando el benchmark de un tercero, lo cual es mejor que nada y peor que una auditoría. Hasta que Artificial Analysis o un equivalente publique su propia ejecución en los mismos modelos, toda afirmación de calidad en este artículo debería leerse como una afirmación.
No hay opción de pesos abiertos. Ambos modelos son cerrados y solo funcionan mediante API, lo que los sitúa en una categoría distinta de los modelos de voz abiertos que han ido llegando a la misma arena. Si tu despliegue requiere ejecutar el modelo por tu cuenta, este lanzamiento no va dirigido a ti.
Y la tarifa promocional se acaba. La tarifa de enero de 2027 para Flash TTS es el doble de la de septiembre, y cualquier caso de negocio elaborado a partir de las cifras de lanzamiento tendrá que rehacerse en el primer trimestre. Eso no es una crítica —publicar ambas cifras por adelantado es más honesto que la mayoría—, pero es la cifra que corresponde poner en la hoja de cálculo.
Google no ha dicho si Gemini 3.1 Flash TTS Preview quedará obsoleto, solo que Flash-Lite TTS se posiciona como su reemplazo principal. Quienes sigan usando el modelo de vista previa deberían planificar una migración en lugar de esperar un aviso de cierre.

