Una tarjeta hero generada para 'Gemini 3.8 Live vs Gemini 3.8 TTS' sobre un fondo blanco con suaves acentos de degradado azul y cian. Una columna izquierda con el encabezado 'Se distribuye en la Live API' enumera 'gemini-3.8-live', 'oye y habla', 'audio de entrada, audio de salida'; una columna derecha con el encabezado 'Se distribuye en los endpoints de TTS' enumera 'gemini-3.8-flash-tts', 'lee texto escrito', 'texto de entrada, audio de salida'. Una línea al pie dice 'Ninguno se llama Gemini 3.8 TTS.' El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Gemini 3.8 Live vs. Gemini 3.8 TTS: un bucle de conversación y una voz de lectura comparten un nombre de generación

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Gemini 3.8 Live es un modelo de voz a voz que se lanzó el 15 de septiembre de 2026 como gemini-3.8-live y gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" no es un modelo en absoluto — es el término paraguas que la cobertura del lanzamiento, incluido el propio título de la publicación de Google, usa para el par de endpoints de texto a voz que llegaron el 23 de septiembre de 2026 como gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts. Así que esta no es la típica página de comparación, donde dos productos compiten por una misma tarea. Es una página sobre dos tareas que comparten un número de generación, y sobre el error específico que comete la gente cuando trata las palabras "Live" y "TTS" como dos variantes de lo mismo.

La bifurcación que oculta el número de generación compartido

Goog​le documenta la generación de voz y traza la línea por sí mismo, y la frase es fácil de pasar por alto: «La capacidad de TTS difiere de la generación de voz que se ofrece a través de la Live API». El mismo pasaje explica por qué, y la razón es estructural, no una cuestión de calidad. La Live API está diseñada para «audio interactivo y no estructurado, y entradas y salidas multimodales». El TTS a través de la API de Gemini «está adaptado a escenarios que requieren una recitación exacta del texto con un control preciso». Una nota posterior explicita la forma de la entrada: los modelos de TTS solo aceptan texto y solo devuelven audio.

Esa única restricción —texto como entrada, audio como salida, sin entrada de audio— es toda la comparación. Un modelo Gemini 3.8 Live escucha a la persona que le habla. Un modelo Gemini 3.8 Flash TTS o Flash-Lite TTS nunca escucha a nadie; lee una cadena y la interpreta. Todo lo demás se deriva de ahí: los benchmarks que existen para uno no tienen sentido para el otro, el precio se mide en unidades diferentes y los modos de fallo no son comparables en absoluto.

Esto importa porque los dos casos de uso se ven idénticos desde fuera. Un agente de voz y un pipeline de narración terminan ambos emitiendo habla que suena humana. Solo uno de ellos puede interrumpirse.

Dónde se resuelve realmente "Gemini 3.8 TTS"

Abre la tabla de modelos compatibles para la generación de voz de la API de Gemini y verás cuatro entradas de TTS y ninguna entrada llamada Gemini 3.8 TTS. Dos de ellas son de esta generación: Gemini 3.8 Flash TTS, con ID de modelo gemini-3.8-flash-tts, con 130 idiomas, y Gemini 3.8 Flash-Lite TTS, con ID de modelo gemini-3.8-flash-lite-tts, con 101 idiomas. Las otras dos —Gemini 3.1 Flash TTS Preview y Gemini 2.5 Pro Preview TTS— son la generación de vista previa que Flash-Lite reemplaza.

Así que cuando alguien dice «Gemini 3.8 TTS», por lo general se refiere al nivel Flash, porque es el que encabeza la publicación de lanzamiento y el que la tabla de Arena clasifica más alto. Cuando lo dicen acerca de un agente de voz en vivo, no están apuntando a nada, porque lo que quieren está en un endpoint distinto con un nombre distinto y un contrato de entrada distinto.

Hay una tercera colisión que merece mencionarse, porque produce el peor consejo. Gemini 3.8 Live no es un modelo de texto a voz con funciones adicionales. Es un modelo de voz a voz, y la razón por la que cuesta más por unidad es que hace más trabajo por unidad: escuchar, razonar a mitad del enunciado, gestionar interrupciones y, en la variante Extended Thinking, deliberar antes de responder.

El único número que realmente compara

Las puntuaciones de calidad no se transfieren entre estas dos familias; no hay un único panel que puntúe a un narrador y a un conversador en el mismo eje. El dinero sí se transfiere, una vez que eliges la unidad con honestidad, y la unidad honesta para todo lo relacionado con voz es la hora de audio.

• Facturación por entrada — Gemini 3.8 Live factura por minuto de audio, $0.005 por minuto de entrada y $0.018 por minuto de salida, frente a Gemini 3.8 Flash TTS, que factura por millón de tokens de audio, $9.00 hasta el 31 de diciembre de 2026 y $18.00 después
• Facturación por salida — El audio bidireccional de Gemini 3.8 Live cuesta alrededor de $1.38 por una hora de entrada y salida simultáneas a precio de lista, antes de cualquier caché de prompts, frente a Gemini 3.8 Flash TTS, que es un flujo unidireccional, y un millón de caracteres de narración terminada asciende a $16.5 según la normalización de Artificial Analysis
• Entrada de texto — Gemini 3.8 Live factura texto y audio en líneas separadas, $0.75 por millón de tokens de texto de entrada y $4.50 de salida, frente a los endpoints de TTS, que facturan la entrada de texto a $0.50 por millón de tokens
• Nivel Flash-Lite — Gemini 3.8 Live no tiene una alternativa más barata; la opción es Live o Extended Thinking, frente a Gemini 3.8 Flash-Lite TTS, que figura a $6.00 y luego $12.00 por millón de tokens de audio, con Artificial Analysis a $11.0 por millón de caracteres
• Forma de entrada — Gemini 3.8 Live: audio, video y texto de entrada, audio de salida, frente a los endpoints de TTS: texto de entrada, audio de salida

La cifra de Live es nuestro propio cálculo a partir de las tarifas por minuto publicadas por Google, no una cifra por hora publicada por Google. Las cifras de caracteres son la normalización de Artificial Analysis y son las que hay que citar cuando se comparan niveles de síntesis. Ten en cuenta que el propio panel Speech to Speech de Artificial Analysis incluye una columna independiente de coste por hora de audio de entrada para los modelos Live —unos $3.50 para Gemini 3.8 Live y $0.84 para la variante Extended Thinking—, que es a su vez otra normalización distinta y que no debería compararse con la tarifa por minuto como si ambas fueran la misma medición.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Qué se rompe cuando eliges el equivocado

Los modos de fallo resultan instructivos porque son tan distintos entre sí.

Llamas a un endpoint de TTS cuando lo que necesitabas era un bucle de conversación, y nada da error. La solicitud devuelve audio válido. Obtienes una respuesta fluida y bien leída ante una cadena fija, y luego silencio, porque nunca hubo nada escuchando. Los equipos lo descubren cuando construyen su primera prueba de interrupción (barge-in) y comprueban que el «usuario» tiene que esperar a que termine el clip completo antes de que pueda empezar el siguiente turno. Adaptar una conversación a un endpoint de síntesis implica añadir reconocimiento de voz, una política de turnos y un mecanismo de interrupción a su alrededor, y en ese punto ya has reconstruido una cascada y estás pagando por dos modelos en lugar de uno.

Llama a un endpoint Live cuando necesitabas narración y pagas por una capacidad que no usas. Un modelo Live se factura en ambas direcciones, porque espera ambas direcciones. Para un audiolibro o una locución para un vídeo de formación, el lado de entrada es un guion que nunca cambia y el modelo nunca necesita oír nada. Estás comprando un bucle de conversación para leer un documento en voz alta.

El único caso en el que la elección es realmente difícil es la cascada: reconocimiento, luego razonamiento, luego síntesis. Esa arquitectura no está obsoleta, y para muchos sistemas de producción sigue siendo la correcta, porque te permite intercambiar cada etapa de forma independiente y elegir un proveedor diferente para cada una. Te cuesta latencia y te cuesta la prosodia que un modelo único de extremo a extremo mantiene a través de un límite de turno. La compensación es real en ambas direcciones.

Cuando la ruta ya existe

OrcaRouter no incluye los endpoints Gemini 3.8 Live ni los endpoints TTS 3.8, y conviene decirlo antes que nada sobre el enrutamiento, porque es fácil suponer lo contrario con un catálogo tan amplio. Lo que sí incluye el catálogo es el resto de la familia — google/gemini-3.8-flash entre 28 modelos de Goog​le y más de 200 modelos en total, con una sola clave al precio de lista del proveedor y sin recargo.

Eso importa específicamente para la cascada. Si tu arquitectura es reconocimiento, luego razonamiento y luego síntesis, la etapa de razonamiento es aquella en la que una sola clave en muchos proveedores da sus frutos, porque es la etapa que cambias con más frecuencia y la etapa en la que un recorte de precios de un proveedor debería llegar a tu factura el mismo día en lugar de en la próxima renovación del contrato. También es la etapa en la que la conmutación automática por error se justifica: una cascada tiene tres puntos en los que fallar, y el del medio es el más barato de hacer redundante.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Una breve regla de decisión

Si el modelo tiene que responder a algo que aún no tenía en formato de texto, necesitas Gemini 3.8 Live, y deberías presupuestar según las tarifas de audio por minuto de Google y prepárate para pensar cuál de las dos variantes necesitas. Si el texto ya está escrito y la tarea es interpretarlo, necesitas Gemini 3.8 Flash TTS o Flash-Lite TTS, y deberías presupuestar por millón de caracteres y elegir el nivel según la cobertura de idiomas y según si la diferencia de calidad compensa la diferencia de precio.

Y si te piden comparar «Gemini 3.8 Live y Gemini 3.8 TTS» como si fueran dos productos, lo primero útil que puedes hacer es preguntar a qué endpoint se refiere. El nombre en el brief no remite a uno solo, y la respuesta cambia la arquitectura, no solo la factura.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.