Um cartão hero gerado para 'Gemini 3.8 Live vs Gemini 3.8 TTS' em um fundo branco com detalhes em gradiente suave de azul e ciano. Uma coluna à esquerda intitulada 'Disponível na Live API' lista 'gemini-3.8-live', 'ouve e fala', 'entrada de áudio, saída de áudio'; uma coluna à direita intitulada 'Disponível nos endpoints TTS' lista 'gemini-3.8-flash-tts', 'lê texto escrito', 'entrada de texto, saída de áudio'. Uma linha de rodapé diz 'Nenhum deles se chama Gemini 3.8 TTS.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS: um loop de conversa e uma voz de leitura compartilham um nome de geração

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Gemini 3.8 Live é um modelo de fala para fala que foi lançado em 15 de setembro de 2026 como gemini-3.8-live e gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" não é um modelo de forma alguma — é o termo guarda-chuva que a cobertura do lançamento, incluindo o próprio título do post do Google, usa para o par de endpoints de texto para fala que chegaram em 23 de setembro de 2026 como gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts. Portanto, esta não é a habitual página de comparativo, em que dois produtos disputam uma única tarefa. É uma página sobre duas tarefas que compartilham um número de geração, e sobre o erro específico que as pessoas cometem quando tratam as palavras "Live" e "TTS" como duas variantes da mesma coisa.

O fork que o número de geração compartilhado esconde

A documentação de geração de fala do Google traça a linha ela mesma, e a frase é fácil de passar batido: "O recurso TTS difere da geração de fala fornecida por meio da Live API." O mesmo trecho explica por quê, e a razão é estrutural, não uma questão de qualidade. A Live API foi criada para "áudio interativo e não estruturado, e entradas e saídas multimodais". O TTS por meio da Gemini API "é adaptado para cenários que exigem recitação exata de texto com controle refinado". Uma nota posterior deixa o formato da entrada explícito: os modelos TTS aceitam apenas texto e retornam apenas áudio.

Essa única restrição — texto de entrada, áudio de saída, nenhuma entrada de áudio — é toda a comparação. Um modelo Gemini 3.8 Live ouve a pessoa que fala com ele. Um modelo Gemini 3.8 Flash TTS ou Flash-Lite TTS nunca ouve ninguém; ele lê uma string e a interpreta. Todo o resto decorre daí: os benchmarks que existem para um são sem sentido para o outro, a precificação é medida em unidades diferentes, e os modos de falha não são comparáveis de forma alguma.

Isso importa porque os dois casos de uso parecem idênticos vistos de fora. Um agente de voz e um pipeline de narração acabam ambos emitindo fala que soa humana. Só um deles pode ser interrompido.

Onde "Gemini 3.8 TTS" é realmente resolvido

Abra a tabela de modelos compatíveis com a geração de fala da API Gemini e você encontrará quatro entradas de TTS e nenhuma entrada chamada Gemini 3.8 TTS. Duas delas são desta geração: Gemini 3.8 Flash TTS, ID do modelo gemini-3.8-flash-tts, com 130 idiomas, e Gemini 3.8 Flash-Lite TTS, ID do modelo gemini-3.8-flash-lite-tts, com 101 idiomas. As outras duas — Gemini 3.1 Flash TTS Preview e Gemini 2.5 Pro Preview TTS — são a geração de prévia que o Flash-Lite substitui.

Então, quando alguém diz "Gemini 3.8 TTS", geralmente está se referindo ao nível Flash, porque é o que o post de lançamento apresenta primeiro e o que o ranking da Arena coloca mais alto. Quando dizem isso a respeito de um agente de voz ao vivo, não estão apontando para nada, porque o que querem está em um endpoint diferente, com um nome diferente e um contrato de entrada diferente.

Há uma terceira colisão que vale a pena nomear, porque ela produz o pior conselho. O Gemini 3.8 Live não é um modelo de conversão de texto em fala com recursos extras. É um modelo de fala para fala, e a razão pela qual custa mais por unidade é que ele realiza mais trabalho por unidade: escuta, raciocina no meio da fala, lida com interrupções e, na variante Extended Thinking, delibera antes de responder.

O único número que realmente se compara

As pontuações de qualidade não se transferem entre essas duas famílias; não existe um único painel que pontue um narrador e um conversador no mesmo eixo. Já o dinheiro se transfere, desde que se escolha a unidade com honestidade, e a unidade honesta para voz é a hora de áudio.

• Tarifação na entrada — O Gemini 3.8 Live cobra por minuto de áudio, US$ 0,005 por minuto de entrada e US$ 0,018 por minuto de saída, enquanto o Gemini 3.8 Flash TTS cobra por milhão de tokens de áudio, US$ 9,00 até 31 de dezembro de 2026 e US$ 18,00 depois disso
• Tarifação na saída — O áudio bidirecional do Gemini 3.8 Live custa cerca de US$ 1,38 por uma hora de entrada e saída simultâneas na tabela, antes de qualquer cache de prompt, enquanto o Gemini 3.8 Flash TTS é um fluxo unidirecional, e um milhão de caracteres de narração finalizada chega a US$ 16,5 segundo a normalização da Artificial Analysis
• Entrada de texto — O Gemini 3.8 Live cobra texto e áudio em linhas separadas, US$ 0,75 por milhão de tokens de texto na entrada e US$ 4,50 na saída, enquanto os endpoints de TTS cobram a entrada de texto a US$ 0,50 por milhão de tokens
• Nível Flash-Lite — O Gemini 3.8 Live não tem um irmão mais barato; a escolha é Live ou Extended Thinking, enquanto o Gemini 3.8 Flash-Lite TTS tem tabela de US$ 6,00 e depois US$ 12,00 por milhão de tokens de áudio, com a Artificial Analysis a US$ 11,0 por milhão de caracteres
• Formato de entrada — Gemini 3.8 Live aceita áudio, vídeo e texto na entrada e áudio na saída, enquanto os endpoints de TTS aceitam texto na entrada e áudio na saída

O valor de Live é o nosso cálculo a partir das tarifas por minuto publicadas pelo Google, e não um número por hora publicado pelo Google. Os números por caractere são a normalização da Artificial Analysis e são os que devem ser citados quando você compara níveis de síntese. Observe que o próprio painel Speech to Speech da Artificial Analysis traz uma coluna separada de custo por hora de áudio de entrada para os modelos Live — cerca de US$ 3,50 para o Gemini 3.8 Live e US$ 0,84 para a variante Extended Thinking —, que é, por sua vez, uma normalização diferente e não deve ser comparada à tabela de tarifas por minuto como se as duas fossem a mesma medida.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

O que quebra quando você escolhe o errado

Os modos de falha são instrutivos porque são tão dessemelhantes.

Chamar um endpoint TTS quando você precisava de um loop de conversa e nada dá erro. A requisição retorna áudio válido. Você obtém uma resposta fluente, bem lida, para uma string fixa, e depois silêncio — porque nunca havia nada escutando. Equipes descobrem isso quando constroem seu primeiro teste de barge-in e descobrem que o "usuário" tem que esperar o clipe completo terminar antes que o próximo turno possa começar. Adaptar uma conversa a um endpoint de síntese significa adicionar reconhecimento de fala, uma política de tomada de turno e um mecanismo de interrupção em torno dele, e nesse ponto você reconstruiu uma cascata e está pagando por dois modelos em vez de um.

Chame um endpoint Live quando precisar de narração e você paga por capacidade que não usa. Um modelo Live é cobrado nos dois sentidos, porque espera os dois sentidos. Para um audiolivro ou uma narração de vídeo de treinamento, o lado da entrada é um roteiro que nunca muda e o modelo nunca precisa ouvir nada. Você está comprando um ciclo de conversação para ler um documento em voz alta.

O único caso em que a escolha é genuinamente difícil é a cascata: reconhecimento, depois raciocínio, depois síntese. Essa arquitetura não está obsoleta e, para muitos sistemas de produção, ainda é a correta, porque permite trocar cada etapa de forma independente e escolher um fornecedor diferente para cada uma. Ela custa latência e custa a prosódia que um único modelo ponta a ponta mantém ao longo de um limite de turno. A troca é real nos dois sentidos.

Onde a rota já existe

O OrcaRouter não disponibiliza os endpoints Live do Gemini 3.8 nem os endpoints TTS 3.8, e vale a pena dizer isso antes de qualquer outra coisa sobre roteamento, porque o contrário é fácil de presumir a partir de um catálogo tão amplo. O que o catálogo de fato contém é o resto da família — google/gemini-3.8-flash entre 28 modelos Google e mais de 200 modelos no total, a partir de uma única chave, pelo preço de tabela do provedor, sem markup.

Isso importa especificamente para a cascata. Se sua arquitetura é reconhecimento, depois raciocínio, depois síntese, a etapa de raciocínio é aquela em que uma única chave para muitos fornecedores compensa, porque é a etapa que você troca com mais frequência e a etapa em que um corte de preço de fornecedor deve chegar à sua fatura no mesmo dia, e não na próxima renovação de contrato. É também a etapa em que failover automático se justifica: uma cascata tem três pontos de falha, e o do meio é o mais barato de tornar redundante.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Uma breve regra de decisão

Se o modelo tiver que responder a algo que ele ainda não tenha como texto, você quer o Gemini 3.8 Live, e deve calcular o orçamento com base nas tarifas de áudio por minuto do Goog​le, esperando ter que pensar sobre qual das duas variantes você precisa. Se o texto já estiver escrito e a tarefa for executá-lo, você quer o Gemini 3.8 Flash TTS ou o Flash-Lite TTS, e deve calcular o orçamento por milhão de caracteres e escolher o nível com base na cobertura de idiomas e em se a diferença de qualidade vale a diferença de preço.

E se pedirem para você comparar "Gemini 3.8 Live e Gemini 3.8 TTS" como se fossem dois produtos, a primeira coisa útil que você pode fazer é perguntar de qual endpoint se trata. O nome no briefing não corresponde a um único endpoint, e a resposta muda a arquitetura, não apenas a fatura.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.