
Gemini 3.8 TTS: Dos pelícanos, dos modelos y un precio que se duplica en enero
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
La forma más rápida de entender lo que el proveedor lanzó el 23 de septiembre de 2026 es mirar la demo que circuló con el lanzamiento: dos pelícanos discutiendo si mudarse a Pacifica Pier, una voz por ave, con los turnos guionizados uno a uno. Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS son los dos modelos que hay detrás de esa demo, ambos disponibles de forma general en la API de Gemini, y los pelícanos no son un truco. Son lo primero de esta generación que los anteriores modelos de voz de Gemini no podían hacer en absoluto: dos hablantes, una sola generación, un guion que controla quién dice qué.
El precio es la otra mitad de la historia, y es donde los dos modelos se separan. Flash TTS cobra $0.50 por millón de tokens de texto de entrada y $9.00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026, y luego $18.00; Flash-Lite TTS cobra $0.50 y $6.00 según el mismo calendario, y luego $12.00. Esas son las tarifas propias de Google. Convertidas por Artificial Analysis a una base por millón de caracteres para que puedan situarse en la misma tabla que todos los demás, quedan en $16.50 y $11.00 — aproximadamente un tercio más baratas para el modelo Lite, y ambas muy por debajo de lo que cobra lo más alto de esa tabla.
Así que la pregunta interesante no es si los modelos son buenos. Es cuál de los dos deberías tomar como base, porque la diferencia entre ellos no es la que uno supondría por los nombres.
Lo que realmente contiene el anuncio del 23 de septiembre
Dos modelos, no uno, y Google es explícito en que se trata de una división, y no de una versión pequeña y otra grande de lo mismo. El anuncio nombra cinco lugares donde llegan —Google AI Studio, la API de Gemini, Gemini Enterprise, Gemini Notebook y Google Vids—, y los identificadores de la API son simples: gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts.

La lista de capacidades es más larga de lo que sugiere el titular. Según el anuncio de Google y la documentación de generación de voz de la API de Gemini:
• Diseño de voz: describes una voz con palabras y recibes un ID de voz personalizado, en lugar de elegir de una lista fija.
• Replicación de voz — una muestra de 30 segundos produce un ID de voz, que es la vía que la mayoría de los equipos usará en la práctica para una voz de marca o un narrador.
• Diálogo entre dos hablantes — el caso del pelícano. El guion contiene turnos de intervención en lugar de un solo bloque de prosa.
• Estilo a nivel de turno — la documentación describe una anotación speech_metadata que adjunta la dirección a un turno específico en lugar de a toda la solicitud.
• Voces preconstruidas, además de una Biblioteca de Voces Ampliada accesible en GET /v1beta/voices.
• Tres codificaciones de audio — WAV de forma predeterminada, con mulaw y alaw disponibles para canalizaciones de tipo telefonía.
• Solo texto de entrada, solo audio de salida. La documentación es clara al respecto: los modelos TTS no aceptan ninguna otra modalidad de entrada ni producen ninguna otra salida, y hay una sección de Limitaciones aparte que enumera las restricciones.
Lo que no está en el anuncio es ninguno de los números que necesita un planificador de capacidad. Los límites de tasa, las cuotas y la vida útil de almacenamiento de una voz diseñada se encuentran todos en la documentación y en la página de precios, no en la publicación de lanzamiento, que es la razón habitual por la que una semana de lanzamiento transcurre sin problemas para las demostraciones y mal para producción.

Los pelicanos son la verdadera noticia.
La TTS de un solo locutor ha sido un problema suficientemente resuelto desde hace dos años. Lo que faltaba era un modelo que mantuviera dos identidades separadas a lo largo de un guion extenso sin derivar, y eso es lo que la demo realmente pone a prueba: no si la voz suena humana, sino si el locutor A sigue siendo el locutor A a los cuatro minutos.
De eso se desprenden dos cosas, y son la razón por la que esto importa más allá de los juguetes para pódcast.
Lo primero es que la unidad de trabajo cambia. Con un modelo de un solo hablante, un diálogo de veinte minutos son veinte minutos de audio que se unen a partir de dos ejecuciones independientes, y cada unión es un punto donde la prosodia se reinicia. Con un modelo de dos hablantes, es una sola llamada, un solo contexto, y el modelo puede reaccionar a la línea anterior. Esa es una diferencia de calidad que no se puede recuperar con posprocesamiento.
La segunda es que el formato del script se convierte en la interfaz. Si tu pipeline ya emite algo con forma de SSML —una anotación por frase—, esta generación es casi una sustitución directa. Si tu pipeline le entrega a un modelo un muro de texto y espera que funcione, ahora tienes una razón para reestructurarlo, porque el estilo que antes era implícito ahora es algo que tienes que decir en voz alta. Esa es la misma disyuntiva que el resto del campo está asumiendo de distintas maneras, y es el eje en el que estos dos modelos de Google compiten con todo lo demás en el tablero.
Cuánto cuesta una hora de audio de dos pelícanos
Vale la pena hacer el cálculo de tokens una vez, porque la cifra por millón de tokens de audio no es una cifra por hora y la diferencia ha sorprendido a la gente.
Los tokens de audio se producen a una tasa fija por segundo de salida, por lo que el costo escala con la duración del audio final, no con la longitud del guion. Tomemos la propia tarifa de Google para Flash TTS —9,00 USD por millón de tokens de audio de salida— y la aritmética para una pieza terminada de una hora queda en cifras de un solo dígito de dólares en el nivel estándar, con el modelo Lite a dos tercios de eso. Los precios de Batch y Flex, a 0,25 USD de entrada y 4,50 USD de salida para Flash TTS frente a 0,25 USD y 3,00 USD para Flash-Lite TTS, reducen aún más el costo para todo lo que no necesita generarse bajo demanda. Priority, a 0,90 USD y 16,00 USD, es para el trabajo que sí necesita generarse bajo demanda.
Tres consecuencias prácticas:
• Regenerar un párrafo sale barato; regenerar una serie es una decisión. A estas tarifas, la parte costosa de un pipeline de voz deja de ser la inferencia y vuelve a ser el humano que aprueba la toma.
• La tarifa de entrada de texto es ruido. $0,50 por millón de tokens de texto en un guion de unos pocos miles de palabras es un error de redondeo en comparación con el apartado de audio. No optimices el guion en función de la longitud.
• El precipicio del 31 de diciembre es real y duplica la tarifa de audio. Si estás planeando un despliegue para 2027, presupuesta la cifra posterior a la promoción, no la de lanzamiento, o tendrás que replanificar en enero.
El número que es independiente, y los que no lo son.
Una cifra en este lanzamiento proviene de un lugar distinto de Google. En el Artificial Analysis Provider Voice Arena, capturado el 24 de septiembre de 2026, Gemini 3.8 Flash TTS se sitúa en el puesto 2 con un Elo de 1,260 en 1,999 muestras y 8 voces de arena, y Gemini 3.8 Flash-Lite TTS se sitúa en el puesto 6 con 1,235 en 2,000 muestras. Ambos están dentro de los intervalos de confianza del otro con ±16 y ±17, por lo que la tabla te está diciendo que son estadísticamente indistinguibles en preferencia — lo cual es un resultado genuinamente útil, porque significa que el más barato no es mediblemente peor para los oyentes.
Todo lo demás es una afirmación de Google y debe interpretarse como tal: el lenguaje de expresividad, los recuentos de idiomas, la calidad de replicación. La Arena te da una clasificación de preferencias y nada más. No te dice cómo maneja cualquiera de los dos modelos un guion de 40 minutos sin desviarse, cómo se comporta con un nombre propio que nunca ha visto, o qué le sucede a una voz diseñada después de una semana.

El modelo Lite también es el mejor argumento de que el par sea una verdadera división y no un nivel de marketing. Una brecha de 25 puntos de Elo que queda dentro de las barras de error, frente a una brecha de precio del 33 %, es la forma de una decisión que los pipelines sensibles al precio deberían tomar a favor de Lite casi siempre — y la forma de una decisión que los pipelines sensibles a la latencia deberían tomar en la dirección opuesta, ya que los dos difieren tanto en el reloj como en la factura.
Dónde ejecutarlo, y la versión honesta de esa respuesta
OrcaRouter no aloja los endpoints de Gemini 3.8 TTS. Vale la pena afirmarlo con claridad en lugar de dar a entender lo contrario, porque lo útil que podemos decir sobre estos dos modelos no es que los sirvamos —no lo hacemos—, sino que un recorte de precios de un proveedor como el cambio del 31 de diciembre es exactamente el tipo de acontecimiento que hace que valga la pena contar con el enrutamiento.
OrcaRouter pone más de 200 modelos detrás de una única clave de API al precio de lista del proveedor sin margen de beneficio, por lo que la tarifa de un proveedor es lo que pagas, y un cambio en ella se refleja en nuestro lado el mismo día en lugar de en el siguiente ciclo de facturación. Para una canalización de voz que está en plena migración, la capa de conmutación por error importa más que el catálogo: puedes poner una ruta de solicitud en un modelo que aún se está evaluando sin apostar una ruta de producción por él, porque una llamada fallida puede pasar a algo que ya está probado. El DSL de enrutamiento combina varios modelos en una sola llamada para los casos en que ninguna voz individual es lo suficientemente buena, y la fusión de modelos responde a una indicación con un panel cuando la respuesta importa más que la latencia.
En el caso de los propios modelos Gemini 3.8 TTS, el lugar desde el que llamarlos es la API de Google, y las superficies que Google dio a conocer el 23 de septiembre. Lo que el par hace por tu arquitectura —una sola llamada para dos hablantes, el estilo como una anotación, una voz que puede describirse en lugar de elegirse— es la parte que perdura más allá del descuento de lanzamiento.
Qué ver a continuación
Tres cosas decidirán si esta generación supone un salto cualitativo o una simple función.
La primera es la deriva. Nadie ha publicado una evaluación extensa de si la ruta de dos hablantes mantiene la identidad durante una hora completa, y hasta que alguien lo haga, la demo pelican es una demo. La segunda es la vida útil de la voz. Una voz diseñada que caduca en una semana es un prototipo; una voz que puede volver a derivarse de una configuración almacenada es un producto, y la respuesta depende de cuál de los dos identificadores conservas. La tercera es lo que sucede después del 31 de diciembre, cuando termina la tarifa promocional y el coste por hora de un pipeline de voz se duplica de la noche a la mañana.
Nada de eso es visible desde la publicación de lanzamiento. Los tres son visibles desde la documentación, que es donde la cobertura del lanzamiento deja de leer.
