
Crea e implementa audio personalizado con Gemini 3.8 Flash TTS: diseño de voz, clonación y los dos relojes que deciden
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 506 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 184 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS te permiten inventar una voz a partir de una descripción escrita en lugar de elegir una de una lista, y ambos pasaron a estar disponibles de forma general en la Gemini API el 23 de septiembre de 2026. El titular que la gente repite es el diseño de voz. La parte que merece la pena planificar es qué ocurre con una voz diseñada después, porque el proveedor te da dos formas de conservarla y asigna una vida útil diferente a cada una. Si eliges la incorrecta, la voz de la que depende tu producto caducará en una semana.
Ese es el vacío en la cobertura del lanzamiento hasta ahora. Las publicaciones del anuncio explican que puedes hacer que una voz exista mediante un prompt, y algunas mencionan la clonación a partir de una muestra de 30 segundos. Ninguna de ellas recorre el modelo de almacenamiento, que es lo que decide si una canalización de voz es reproducible desde un archivo de configuración o tiene que volver a aprovisionarse según un calendario. Este artículo cubre toda la ruta —diseño, almacenamiento, llamada y pago— con los precios y las cuotas tal como los publica Google.
Qué se lanzó el 23 de septiembre
Dos modelos, un mismo esquema de API. Los identificadores son gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts, y la documentación de Google es explícita al afirmar que ambos aceptan «exactamente el mismo esquema de API y el mismo formato de prompts»: pasar de uno a otro supone cambiar un solo parámetro, no reescribir nada.
• Entrada — solo texto. Ambos modelos aceptan texto y devuelven audio; no son multimodales y no generan texto de vuelta.
• Salida: WAV, PCM con signo de 16 bits, mono, a 24 kHz en el endpoint unario; PCM sin encabezado (audio/l16) en el endpoint de streaming; audio/mulaw y audio/alaw se aceptan con una frecuencia de muestreo configurable.
• Idiomas — 130 en Flash TTS, 101 en Flash-Lite TTS, detectados automáticamente a partir del texto en lugar de declararse en la solicitud.
• Voces: 30 voces de estudio seleccionadas que aparecen en la documentación (Kore y Puck entre ellas), una Biblioteca de Voces Ampliada con "cientos" más consultables a través del endpoint voices, además de las dos rutas de creación que se indican a continuación.
• Dirección — control de la locución línea por línea, escenas de dos hablantes montadas a partir de un único guion, y señales no verbales como <laughs>, <sigh> y |mhm| escritas directamente en la transcripción.
Los dos niveles existen porque las cargas de trabajo divergieron. Flash TTS está posicionado para la máxima fidelidad acústica y actuación compleja; Flash-Lite TTS se describe, en palabras de Google, como el "reemplazo de caballo de batalla" para gemini-3.1-flash-tts-preview, dirigido a doblaje masivo, funciones de lectura en voz alta y cascadas de agentes de voz. Ambos reemplazan a un único modelo en vista previa que había estado en la API desde abril de 2026, así que si estabas en la vista previa, la migración es una decisión de nivel en lugar de una actualización de versión.

Diseñar una voz es un prompt, y eso cambia el paso de revisión.
La superficie de creación es lo genuinamente nuevo en esta generación. Una voz con prompt se construye a partir de una descripción en lenguaje natural —rol, acento, carácter vocal— y devuelve un identificador que reutilizas. En la API, esta es una llamada de creación de voz con store: true y una entrada con prompt; en los propios ejemplos de Google, las descripciones van desde un DJ de Melbourne de alta energía hasta un dragón japonés. Una vez creada, la voz se referencia en una solicitud de voz por su identificador, y las instrucciones de estilo por solicitud pueden entonces ser mínimas o estar vacías, porque el carácter ya está integrado en la voz.
La consecuencia práctica es un cambio en el flujo de trabajo, no solo una función. La selección de voces solía ser una negociación de licencia o una reserva de estudio, lo que significaba que la elección de la voz ocurría una sola vez, al principio, y superaba la revisión porque cambiarla era costoso. Cuando una voz es un párrafo de texto, la selección se convierte en un token de diseño: algo que un gerente de producto puede pedir que se vuelva a generar un martes. Los equipos que ponen la cadena de descripción en el control de código fuente y tratan el ID de voz generado como un artefacto de compilación obtendrán resultados consistentes en todos los entornos. Los equipos que crean voces a mano en AI Studio no lo harán, y el fallo se verá como una diferencia inexplicable entre el audio de staging y el de producción.
Los dos relojes
Esta es la sección que omiten las publicaciones de lanzamiento. Google te permite conservar una voz diseñada o replicada en uno de dos estados, y expiran a ritmos muy distintos.
• Voces almacenadas — se crean con el almacenamiento habilitado, residen en tu proyecto y se rigen por una cuota de 200 voces por proyecto con un tiempo de vida de un año.
• Claves sin estado: la replicación de voz puede devolver una clave gestionada por el cliente (la forma voicekey_…) en lugar de un identificador almacenado, y esa clave tiene una vigencia de siete días.
Si se leen en conjunto, ese par es una instrucción de diseño. Una voz almacenada es un compromiso de un año y un tope estricto de 200 por proyecto, lo cual es generoso para un producto con un reparto fijo e inútil para cualquier cosa que genere una voz nueva por cliente. La clave sin estado es lo contrario: sin presión de cuota, pero una clave que hay que regenerar cada semana, lo que significa que tu aplicación necesita una ruta de renovación y tu infraestructura necesita almacenar credenciales que rotan. Ninguna de las dos es incorrecta. Elegir sin darte cuenta de cuál elegiste es la forma en que un agente de voz se queda en silencio al octavo día.
Dos propiedades más vienen asociadas a la replicación y vale la pena conocerlas antes de prometerle algo a un equipo legal. Crear una voz replicada requiere una grabación de consentimiento verbal del propietario de la voz que debe coincidir con el hablante de referencia: una comprobación hablada, no una casilla de verificación. Y la salida conlleva procedencia: cada clip está marcado con SynthID, y las voces replicadas además llevan credenciales de contenido C2PA. La ruta de diseño es deliberadamente la más difícil de abusar, y ambas barreras son estructurales en lugar de declaraciones de políticas.
Una discrepancia que vale la pena señalar en lugar de resolver. La tabla de modelos compatibles de Google incluye el diseño de voz y la replicación de voz como disponibles en ambos modelos TTS 3.8. La mayor parte de la cobertura del lanzamiento describe la replicación como parte específicamente de la historia de Flash TTS. Si la replicación importa para tu decisión entre los niveles, verifícala en la documentación del nivel que piensas implementar en lugar de confiar en cualquiera de los dos resúmenes.
Cuánto cuesta una hora de audio
Google factura el habla en tokens, no en caracteres ni segundos, y la conversión está publicada: el audio se mide a 25 tokens por segundo de salida, lo que equivale a 90.000 tokens por hora. Eso hace que la aritmética sea inusualmente limpia, y es el número que hay que poner en un presupuesto en lugar de la tarifa por millón.
• Flash TTS estándar — $0.50 por millón de tokens de texto de entrada, $9.00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026, y después $1.00 y $18.00. Batch y Flex cuestan $0.25 y $4.50; Priority cuesta $0.90 y $16.20.
• Flash-Lite TTS estándar — $0.50 y $6.00 hasta la misma fecha, luego $1.00 y $12.00. Batch y Flex $0.25 y $3.00; Priority $0.90 y $10.80.
• En segundos — Flash TTS sale a aproximadamente $0.81 por hora de audio generado durante la ventana promocional y alrededor de $1.62 después; Flash-Lite TTS cuesta aproximadamente $0.54 y luego $1.08.
• En comparación con el modelo al que reemplaza — gemini-3.1-flash-tts-preview tiene un precio de $1.00 y $20.00 por millón, por lo que la línea de salida de audio bajó un 55 por ciento en Flash TTS y un 70 por ciento en Flash-Lite TTS.
No haga planes basándose en el número promocional. Google publica ambas columnas en la misma tabla, lo que significa que la tarifa de enero no es un rumor que se descubrirá más tarde: ya está en la tarjeta hoy, y cualquier estimación por cada mil minutos calculada a $0.81 tiene que sobrevivir a que la dupliquen.
Un número independiente, y varios que no lo son.
El anuncio de Google abre con resultados de benchmark, y deberían leerse exactamente por lo que son. La compañía afirma que Flash TTS obtuvo el primer puesto en el Voice Design Benchmark de Hume AI con 71,4, que lideró el modelado de acentos con 60,8, y que Flash TTS y Flash-Lite TTS ocuparon el primer y el segundo puesto en el Overall Quality Index de Hume, con sólidas posiciones en preferencia a ciegas en Voice Arena para japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi. Todos son datos reportados por el proveedor; ninguna de las ejecuciones es pública.
Hay un detalle en esa lista que merece atención. Alan Cowen, acreditado como autor del anuncio de Google, es el fundador de Hume AI — el laboratorio cuyo Voice Design Benchmark aporta la cifra principal. Eso no hace que la cifra sea incorrecta, y el benchmark de Hume es real, pero ambos no son independientes entre sí, y un lector que evalúe el 71.4 debería saberlo antes de repetirlo como validación de terceros.
La cifra recopilada de forma independiente está en Provider Voice Arena de Artificial Analysis, registrada para este artículo el 24 de septiembre de 2026: Gemini 3.8 Flash TTS ocupa el segundo lugar con un Elo de 1,260, con un intervalo de 17 puntos en 1,999 muestras, por detrás de Cartesia Sonic 3.6, con 1,273. Gemini 3.8 Flash-Lite TTS ocupa el sexto lugar con 1,235. El modelo al que reemplaza, Gemini 3.1 Flash TTS, ocupa el décimo lugar con 1,199 en 3,430 muestras. Preferencia de oyentes a ciegas, no la evaluación propia de un laboratorio — y la única cifra de calidad aquí que Google no encargó.

Dónde ejecutarlo, y dónde todavía no
Ambos modelos están disponibles hoy en la Gemini API y Google AI Studio, sin lista de espera. Las interfaces de consumidor y empresariales están escalonadas en lugar de lanzadas: Flash TTS llegará a Gemini Notebook y Flash-Lite TTS a Google Vids, el acceso a Gemini Enterprise se describe como próximamente, y la remezcla de voz —ajustar timbre, tono, ritmo y acento en una voz existente— se enumera como una función futura en lugar de una actual. Si tu plan depende de la remezcla, todavía no existe.
Por nuestra parte, honestidad ante todo: los endpoints TTS de Gemini 3.8 no están en la tabla de enrutamiento de OrcaRouter. La generación a la que reemplazan sí lo está — google/gemini-3.1-flash-tts-preview está en el catálogo al mismo precio de $1.00 y $20.00 por millón de tokens que publica Google, porque el precio de lista del proveedor se pasa sin margen añadido, y responde en el mismo /v1/audio/speech endpoint que tu SDK compatible con OpenAI ya usa. Eso importa más de lo que parece para una carga de trabajo de voz, porque lo que realmente compras es un endpoint estable al que tu aplicación puede llamar mientras los modelos que hay detrás cambian. Tu código contiene una cadena de modelo; el catálogo contiene el enrutamiento. Cuando la ventana promocional de Google se cierre el 31 de diciembre y Flash TTS se duplique, el precio de un modelo enrutado cambia ese mismo día en lugar de en la siguiente renovación de contrato — y un modelo que se cae hace failover en vez de llevarse por delante tu cola de narración.

Si vas a evaluar esta generación antes de comprometerte, el experimento barato es de dos niveles. Pasa el mismo guion por Flash TTS y Flash-Lite TTS, porque el esquema es idéntico y la diferencia es un parámetro; luego decide con tu propio audio en lugar de con un gráfico de referencia, y comprueba en Artificial Analysis si la brecha de calidad sobrevive a sus barras de error antes de pagar el sobrecoste. Para un proyecto de narración de gran formato, el sobrecoste es dinero real; para un bot de soporte que lee un número de teléfono en voz alta, no está claro que te compre nada que un oyente pueda oír.
