
Gemini 3.8 TTS: Dois Pelicanos, Dois Modelos e um Preço Que Dobra em Janeiro
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
A maneira mais rápida de entender o que o fornecedor lançou em 23 de setembro de 2026 é olhar para a demonstração que circulou junto com ele: dois pelicanos discutindo se deveriam se mudar para o Pacifica Pier, uma voz por ave, com falas roteirizadas turno a turno. Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTSsão os dois modelos por trás dessa demonstração, ambos disponíveis de forma geral na Gemini API, e os pelicanos não são um truque. Eles são a primeira coisa nesta geração que os modelos de fala Gemini anteriores não conseguiam fazer de forma alguma: dois falantes, uma única geração, um roteiro que controla quem diz o quê.
O preço é a outra metade da história, e é aí que os dois modelos se separam. O Flash TTS cobra $0,50 por milhão de tokens de texto de entrada e $9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois $18,00; o Flash-Lite TTS cobra $0,50 e $6,00 no mesmo cronograma, depois $12,00. Essas são as tarifas do próprio Google. Convertidos pela Artificial Analysis para uma base por milhão de caracteres, para que possam ficar no mesmo ranking que todos os outros, eles ficam em $16,50 e $11,00 — cerca de um terço mais baratos para o modelo Lite, e ambos bem abaixo do que o topo desse ranking cobra.
Então, a questão interessante não é se os modelos são bons. É em qual dos dois você deve se basear, porque a diferença entre eles não é a diferença que você imaginaria pelos nomes.
O que o anúncio de 23 de setembro realmente contém
Dois modelos, não um, e o Google deixa explícito que se trata de uma divisão, e não de uma versão pequena e uma versão grande da mesma coisa. O anúncio nomeia cinco lugares onde eles chegam — Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook e Google Vids — e os identificadores da API são simples: gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts.

A lista de recursos é mais longa do que a manchete sugere. Com base no anúncio do Google e na documentação de geração de fala da API Gemini:
• Design de voz — você descreve uma voz em palavras e recebe um ID de voz personalizado, em vez de escolher de uma lista fixa.
Replicação de voz — uma amostra de 30 segundos produz um ID de voz, que é o caminho que a maioria das equipes realmente usará para uma voz de marca ou um narrador.
• Diálogo com dois falantes — o caso do pelicano. O roteiro traz turnos de fala em vez de um único bloco de prosa.
• Estilização em nível de turno — a documentação descreve uma anotação speech_metadata que vincula a direção a um turno específico, em vez de à requisição inteira.
• Vozes predefinidas, além de uma Biblioteca de Vozes Estendida acessível em GET /v1beta/voices.
• Três codificações de áudio — WAV por padrão, com mulaw e alaw disponíveis para pipelines no formato de telefonia.
• Apenas texto como entrada, apenas áudio como saída. A documentação é categórica quanto a isso: os modelos TTS não aceitam nenhuma outra modalidade de entrada e não produzem nenhuma outra saída, e há uma seção separada de Limitações que lista as restrições.
O que não está no anúncio é qualquer um dos números de que um planejador de capacidade precisa. Limites de taxa, quotas e o tempo de armazenamento de uma voz projetada estão todos na documentação e na página de preços, não no post de lançamento, que é a razão habitual pela qual uma semana de lançamento corre bem para demonstrações e mal para produção.

Os pelicanos são a verdadeira notícia
O TTS de um único locutor é um problema suficientemente resolvido há dois anos. O que faltava era um modelo capaz de manter duas identidades separadas ao longo de um roteiro longo sem desvio, e é isso que a demo está realmente testando — não se a voz soa humana, mas se o locutor A ainda é o locutor A depois de quatro minutos.
Duas coisas decorrem disso, e são a razão pela qual isto importa para além de brinquedos de podcast.
O primeiro é que a unidade de trabalho muda. Com um modelo de locutor único, um diálogo de vinte minutos é vinte minutos de áudio que você costura a partir de duas execuções independentes, e cada emenda é um ponto onde a prosódia se reinicia. Com um modelo de dois locutores, é uma única chamada, um único contexto, e o modelo pode reagir à fala anterior. Essa é uma diferença de qualidade que você não consegue recuperar com pós-processamento.
A segunda é que o formato do script se torna a interface. Se o seu pipeline já emite algo em formato SSML — uma anotação por frase —, esta geração está próxima de ser uma substituição direta. Se o seu pipeline entrega ao modelo uma parede de texto e torce para dar certo, agora você tem um motivo para reestruturá-lo, porque o estilo que antes era implícito agora é algo que você precisa dizer em voz alta. Esse é o mesmo trade-off que o restante do setor está fazendo de maneiras diferentes, e é o eixo no qual esses dois modelos do Google competem com todo o resto do tabuleiro.
Quanto custa uma hora de áudio de dois pelicanos
Vale a pena fazer as contas de tokens uma vez, porque o valor por milhão de tokens de áudio não é um valor por hora, e essa diferença tem surpreendido as pessoas.
Os tokens de áudio são produzidos a uma taxa fixa por segundo de saída, portanto o custo varia conforme a duração do áudio finalizado, não a duração do roteiro. Pegue a própria tarifa do Google para o Flash TTS — US$ 9,00 por milhão de tokens de áudio de saída — e a aritmética para uma peça finalizada de uma hora fica na casa dos dólares de um dígito no nível padrão, com o modelo Lite a dois terços disso. A precificação Batch e Flex, a US$ 0,25 de entrada e US$ 4,50 de saída para o Flash TTS, contra US$ 0,25 e US$ 3,00 para o Flash-Lite TTS, reduz isso ainda mais para qualquer coisa que não precise ser gerada sob demanda. O Priority, a US$ 0,90 e US$ 16,00, é para o trabalho que precisa ser gerado sob demanda.
Três consequências práticas:
• Regenerar um parágrafo é barato; regenerar uma série é uma decisão. A esses preços, a parte cara de um pipeline de fala deixa de ser a inferência e volta a ser o humano que aprova a tomada.
• A taxa de entrada de texto é ruído. $0,50 por milhão de tokens de texto em um roteiro de alguns milhares de palavras é um erro de arredondamento em comparação com o lado do áudio. Não otimize o roteiro em função do comprimento.
• O abismo de 31 de dezembro é real e dobra a taxa de áudio. Se você está planejando uma implantação em 2027, orçe o valor pós-promocional, não o valor de lançamento, ou vai acabar refazendo o planejamento em janeiro.
O número que é independente, e os que não são
Uma das métricas desta apresentação vem de outra fonte que não o Google. Na Artificial Analysis Provider Voice Arena, registada a 24 de setembro de 2026, o Gemini 3.8 Flash TTS ocupa o 2.º lugar, com um Elo de 1 260 em 1 999 amostras e 8 vozes da arena, e o Gemini 3.8 Flash-Lite TTS ocupa o 6.º lugar, com 1 235 em 2 000 amostras. Ambos estão dentro dos intervalos de confiança um do outro, a ±16 e ±17, pelo que a tabela indica que são estatisticamente indistinguíveis em termos de preferência — o que é um resultado genuinamente útil, porque significa que a versão mais barata não é mensuravelmente pior para os ouvintes.
Todo o resto é uma afirmação da própria Google e deve ser lida como tal: a linguagem de expressividade, a contagem de idiomas, a qualidade de replicação. A arena dá-lhe um ranking de preferência e nada mais. Não lhe diz como cada modelo lida com um roteiro de 40 minutos sem desvio, como se comporta com um nome próprio que nunca viu, ou o que acontece a uma voz projetada depois de uma semana.

O modelo Lite é também o melhor argumento para que o par seja uma divisão real, e não um nível de marketing. Uma diferença de 25 pontos de Elo que fica dentro das barras de erro, contra uma diferença de preço de 33%, é o tipo de decisão que pipelines sensíveis a preço devem tomar em favor do Lite quase sempre — e o tipo de decisão que pipelines sensíveis à latência devem tomar na direção oposta, já que os dois diferem tanto no tempo quanto no custo.
Onde executá-lo, e a versão honesta dessa resposta
O OrcaRouter não hospeda os endpoints do Gemini 3.8 TTS. Vale a pena dizer isso claramente, em vez de sugerir o contrário, porque a coisa útil que podemos dizer sobre esses dois modelos não é que nós os servimos — não servimos —, mas que uma redução de preço do fornecedor como a mudança de 31 de dezembro é exatamente o tipo de evento que faz valer a pena ter roteamento.
O OrcaRouter coloca mais de 200 modelos atrás de uma única chave de API a preço de tabela do provedor, sem margem de lucro, de modo que a tabela de preços do fornecedor é o que você paga, e uma alteração nela entra no ar do nosso lado no mesmo dia, em vez de no próximo ciclo de faturamento. Para um pipeline de fala em plena migração, a camada de failover importa mais do que o catálogo: você pode direcionar um caminho de requisição para um modelo que ainda está em avaliação sem apostar uma rota de produção nele, porque uma chamada que falha pode recair sobre algo já comprovado. A DSL de roteamento compõe vários modelos em uma única chamada para os casos em que nenhuma voz isolada é boa o suficiente, e a fusão de modelos responde a um prompt com um painel quando a resposta importa mais do que a latência.
Para os próprios modelos Gemini 3.8 TTS, o lugar para chamá-los é a própria API do Google, e as superfícies que o Google nomeou em 23 de setembro. O que o par faz com sua arquitetura — uma chamada para dois locutores, o estilo como anotação, uma voz que pode ser descrita em vez de escolhida — é a parte que sobrevive ao desconto de lançamento.
O que assistir em seguida
Três coisas vão decidir se esta geração é uma mudança radical ou apenas um recurso.
O primeiro é a deriva. Ninguém publicou uma avaliação de formato longo sobre se o caminho de dois falantes mantém a identidade ao longo de uma hora inteira, e até que alguém o faça, a demo do pelican é uma demo. O segundo é o tempo de vida da voz. Uma voz projetada que expira em uma semana é um protótipo; uma voz que pode ser rederivada de uma configuração armazenada é um produto, e a resposta depende de qual dos dois identificadores você mantém. O terceiro é o que acontece depois de 31 de dezembro, quando a tarifa promocional termina e o custo por hora de um pipeline de fala dobra da noite para o dia.
Nenhum deles é visível no post de lançamento. Todos os três são visíveis na documentação, que é onde a cobertura do lançamento para de ler.
