
Gemini 3.8 Live vs Gemini 3.8 TTS: um loop de conversa e uma voz de leitura compartilham um nome de geração
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Gemini 3.8 Live é um modelo de fala para fala que foi lançado em 15 de setembro de 2026 como gemini-3.8-live e gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" não é um modelo de forma alguma — é o termo guarda-chuva que a cobertura do lançamento, incluindo o próprio título do post do Google, usa para o par de endpoints de texto para fala que chegaram em 23 de setembro de 2026 como gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts. Portanto, esta não é a habitual página de comparativo, em que dois produtos disputam uma única tarefa. É uma página sobre duas tarefas que compartilham um número de geração, e sobre o erro específico que as pessoas cometem quando tratam as palavras "Live" e "TTS" como duas variantes da mesma coisa.
O fork que o número de geração compartilhado esconde
A documentação de geração de fala do Google traça a linha ela mesma, e a frase é fácil de passar batido: "O recurso TTS difere da geração de fala fornecida por meio da Live API." O mesmo trecho explica por quê, e a razão é estrutural, não uma questão de qualidade. A Live API foi criada para "áudio interativo e não estruturado, e entradas e saídas multimodais". O TTS por meio da Gemini API "é adaptado para cenários que exigem recitação exata de texto com controle refinado". Uma nota posterior deixa o formato da entrada explícito: os modelos TTS aceitam apenas texto e retornam apenas áudio.
Essa única restrição — texto de entrada, áudio de saída, nenhuma entrada de áudio — é toda a comparação. Um modelo Gemini 3.8 Live ouve a pessoa que fala com ele. Um modelo Gemini 3.8 Flash TTS ou Flash-Lite TTS nunca ouve ninguém; ele lê uma string e a interpreta. Todo o resto decorre daí: os benchmarks que existem para um são sem sentido para o outro, a precificação é medida em unidades diferentes, e os modos de falha não são comparáveis de forma alguma.
Isso importa porque os dois casos de uso parecem idênticos vistos de fora. Um agente de voz e um pipeline de narração acabam ambos emitindo fala que soa humana. Só um deles pode ser interrompido.
Onde "Gemini 3.8 TTS" é realmente resolvido
Abra a tabela de modelos compatíveis com a geração de fala da API Gemini e você encontrará quatro entradas de TTS e nenhuma entrada chamada Gemini 3.8 TTS. Duas delas são desta geração: Gemini 3.8 Flash TTS, ID do modelo gemini-3.8-flash-tts, com 130 idiomas, e Gemini 3.8 Flash-Lite TTS, ID do modelo gemini-3.8-flash-lite-tts, com 101 idiomas. As outras duas — Gemini 3.1 Flash TTS Preview e Gemini 2.5 Pro Preview TTS — são a geração de prévia que o Flash-Lite substitui.
Então, quando alguém diz "Gemini 3.8 TTS", geralmente está se referindo ao nível Flash, porque é o que o post de lançamento apresenta primeiro e o que o ranking da Arena coloca mais alto. Quando dizem isso a respeito de um agente de voz ao vivo, não estão apontando para nada, porque o que querem está em um endpoint diferente, com um nome diferente e um contrato de entrada diferente.
Há uma terceira colisão que vale a pena nomear, porque ela produz o pior conselho. O Gemini 3.8 Live não é um modelo de conversão de texto em fala com recursos extras. É um modelo de fala para fala, e a razão pela qual custa mais por unidade é que ele realiza mais trabalho por unidade: escuta, raciocina no meio da fala, lida com interrupções e, na variante Extended Thinking, delibera antes de responder.
O único número que realmente se compara
As pontuações de qualidade não se transferem entre essas duas famílias; não existe um único painel que pontue um narrador e um conversador no mesmo eixo. Já o dinheiro se transfere, desde que se escolha a unidade com honestidade, e a unidade honesta para voz é a hora de áudio.
• Tarifação na entrada — O Gemini 3.8 Live cobra por minuto de áudio, US$ 0,005 por minuto de entrada e US$ 0,018 por minuto de saída, enquanto o Gemini 3.8 Flash TTS cobra por milhão de tokens de áudio, US$ 9,00 até 31 de dezembro de 2026 e US$ 18,00 depois disso
• Tarifação na saída — O áudio bidirecional do Gemini 3.8 Live custa cerca de US$ 1,38 por uma hora de entrada e saída simultâneas na tabela, antes de qualquer cache de prompt, enquanto o Gemini 3.8 Flash TTS é um fluxo unidirecional, e um milhão de caracteres de narração finalizada chega a US$ 16,5 segundo a normalização da Artificial Analysis
• Entrada de texto — O Gemini 3.8 Live cobra texto e áudio em linhas separadas, US$ 0,75 por milhão de tokens de texto na entrada e US$ 4,50 na saída, enquanto os endpoints de TTS cobram a entrada de texto a US$ 0,50 por milhão de tokens
• Nível Flash-Lite — O Gemini 3.8 Live não tem um irmão mais barato; a escolha é Live ou Extended Thinking, enquanto o Gemini 3.8 Flash-Lite TTS tem tabela de US$ 6,00 e depois US$ 12,00 por milhão de tokens de áudio, com a Artificial Analysis a US$ 11,0 por milhão de caracteres
• Formato de entrada — Gemini 3.8 Live aceita áudio, vídeo e texto na entrada e áudio na saída, enquanto os endpoints de TTS aceitam texto na entrada e áudio na saída
O valor de Live é o nosso cálculo a partir das tarifas por minuto publicadas pelo Google, e não um número por hora publicado pelo Google. Os números por caractere são a normalização da Artificial Analysis e são os que devem ser citados quando você compara níveis de síntese. Observe que o próprio painel Speech to Speech da Artificial Analysis traz uma coluna separada de custo por hora de áudio de entrada para os modelos Live — cerca de US$ 3,50 para o Gemini 3.8 Live e US$ 0,84 para a variante Extended Thinking —, que é, por sua vez, uma normalização diferente e não deve ser comparada à tabela de tarifas por minuto como se as duas fossem a mesma medida.

O que quebra quando você escolhe o errado
Os modos de falha são instrutivos porque são tão dessemelhantes.
Chamar um endpoint TTS quando você precisava de um loop de conversa e nada dá erro. A requisição retorna áudio válido. Você obtém uma resposta fluente, bem lida, para uma string fixa, e depois silêncio — porque nunca havia nada escutando. Equipes descobrem isso quando constroem seu primeiro teste de barge-in e descobrem que o "usuário" tem que esperar o clipe completo terminar antes que o próximo turno possa começar. Adaptar uma conversa a um endpoint de síntese significa adicionar reconhecimento de fala, uma política de tomada de turno e um mecanismo de interrupção em torno dele, e nesse ponto você reconstruiu uma cascata e está pagando por dois modelos em vez de um.
Chame um endpoint Live quando precisar de narração e você paga por capacidade que não usa. Um modelo Live é cobrado nos dois sentidos, porque espera os dois sentidos. Para um audiolivro ou uma narração de vídeo de treinamento, o lado da entrada é um roteiro que nunca muda e o modelo nunca precisa ouvir nada. Você está comprando um ciclo de conversação para ler um documento em voz alta.
O único caso em que a escolha é genuinamente difícil é a cascata: reconhecimento, depois raciocínio, depois síntese. Essa arquitetura não está obsoleta e, para muitos sistemas de produção, ainda é a correta, porque permite trocar cada etapa de forma independente e escolher um fornecedor diferente para cada uma. Ela custa latência e custa a prosódia que um único modelo ponta a ponta mantém ao longo de um limite de turno. A troca é real nos dois sentidos.
Onde a rota já existe
O OrcaRouter não disponibiliza os endpoints Live do Gemini 3.8 nem os endpoints TTS 3.8, e vale a pena dizer isso antes de qualquer outra coisa sobre roteamento, porque o contrário é fácil de presumir a partir de um catálogo tão amplo. O que o catálogo de fato contém é o resto da família — google/gemini-3.8-flash entre 28 modelos Google e mais de 200 modelos no total, a partir de uma única chave, pelo preço de tabela do provedor, sem markup.
Isso importa especificamente para a cascata. Se sua arquitetura é reconhecimento, depois raciocínio, depois síntese, a etapa de raciocínio é aquela em que uma única chave para muitos fornecedores compensa, porque é a etapa que você troca com mais frequência e a etapa em que um corte de preço de fornecedor deve chegar à sua fatura no mesmo dia, e não na próxima renovação de contrato. É também a etapa em que failover automático se justifica: uma cascata tem três pontos de falha, e o do meio é o mais barato de tornar redundante.

Uma breve regra de decisão
Se o modelo tiver que responder a algo que ele ainda não tenha como texto, você quer o Gemini 3.8 Live, e deve calcular o orçamento com base nas tarifas de áudio por minuto do Google, esperando ter que pensar sobre qual das duas variantes você precisa. Se o texto já estiver escrito e a tarefa for executá-lo, você quer o Gemini 3.8 Flash TTS ou o Flash-Lite TTS, e deve calcular o orçamento por milhão de caracteres e escolher o nível com base na cobertura de idiomas e em se a diferença de qualidade vale a diferença de preço.
E se pedirem para você comparar "Gemini 3.8 Live e Gemini 3.8 TTS" como se fossem dois produtos, a primeira coisa útil que você pode fazer é perguntar de qual endpoint se trata. O nome no briefing não corresponde a um único endpoint, e a resposta muda a arquitetura, não apenas a fatura.

