
Gemini 3.8 Flash TTS diz olá: Google divide sua linha de fala em duas e corta o preço
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
O fornecedor lançou dois modelos de fala em 23 de setembro de 2026, e o anúncio está redigido como se a manchete fosse a qualidade da voz. Não é. Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS são os primeiros modelos de conversão de texto em fala que o fornecedor disponibilizou na Gemini Developer API a um preço abaixo do modelo de pré-visualização que eles substituem — e, para quem vem pagando por caractere em outro lugar, é essa a parte que altera uma linha do orçamento. A tarifa de saída de áudio do Gemini 3.8 Flash TTS é de US$ 9,00 por milhão de tokens até o fim de 2026. O áudio é cobrado a 25 tokens por segundo, o que dá aproximadamente 0,02 centavos por segundo de fala gerada. O modelo que ele substitui, Gemini 3.1 Flash TTS Preview, tinha o preço de US$ 20,00 por milhão de tokens de áudio.
A segunda metade da história é que agora há dois modelos, não um. O Google dividiu a linha: o Flash TTS traz o conjunto completo de idiomas e a taxa de áudio mais alta; o Flash-Lite TTS traz uma lista de idiomas mais curta e um preço mais baixo. Esse é um formato diferente do arranjo de modelo único em pré-visualização que está na API desde abril, e mostra como o Google enxerga o mercado — um pequeno número de aplicações que precisam de 130 idiomas e clonagem de voz, e um número muito maior que precisa de uma voz competente em inglês para um bot de suporte e nada mais.
O que realmente foi lançado em 23 de setembro?
Ambos os modelos estão geralmente disponíveis na API Gemini e no AI Studio desde o anúncio, sem estarem restritos a uma lista de espera. Os nomes na API são gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts.
• Flash TTS — 130 idiomas, idioma detectado automaticamente a partir do texto, 30 vozes de estúdio predefinidas, incluindo Kore e Puck.
• TTS Flash-Lite — 101 idiomas, a mesma interface de design de voz, posicionado como o nível de alto volume.
• Ambos — design de voz a partir de uma descrição em linguagem natural, direção de interpretação linha por linha, encenação de cena com dois falantes e sinais não verbais escritos diretamente no roteiro.
• Saída — WAV 24 kHz mono PCM assinado de 16 bits no endpoint unário; PCM sem cabeçalho (audio/l16) no endpoint de streaming; audio/mulaw e audio/alaw também são aceitos, com uma taxa de amostragem configurável.
A tabela de preços, por milhão de tokens, vale a pena ser lida na íntegra, porque os níveis diferem por mais do que o número em destaque:
• Flash TTS Standard — $0,50 de entrada de texto / $9,00 de saída de áudio, subindo para $1,00 / $18,00 após 31 de dezembro de 2026.
• Flash TTS Batch e Flex — $0,25 / $4,50.
• Flash TTS Priority — $0,90 / $16,20.
• Flash-Lite TTS Standard — $0.50 / $6.00, subindo para $1.00 / $12.00 após 31 de dezembro de 2026.
• Flash-Lite TTS Batch e Flex — US$ 0,25 / US$ 3,00.
• Flash-Lite TTS Priority — $0,90 / $10,80.
• Gemini 3.1 Flash TTS Preview, para comparação — $1.00 / $20.00, lote $0.50 / $10.00.
A janela promocional é o ponto a observar. O Google definiu o preço de ambos os novos modelos pela metade até o final do ano e publicou os números pós-promoção na mesma tabela. Quem estiver modelando o custo por mil minutos deve usar o valor de janeiro, não o de setembro.

O design de voz é a capacidade genuinamente nova
Vozes pré-construídas são o básico. O que o Google adicionou na 3.8 é uma forma de descrever uma voz em palavras e obtê-la, e uma forma de cloná-la a partir de uma amostra curta com uma verificação de consentimento anexada.
O design de voz recebe um prompt em linguagem natural — ritmo, timbre, sotaque, o tipo de coisa pela qual você de outra forma passaria uma tarde fazendo audições — e retorna uma voz utilizável sem uma gravação de referência. A replicação de voz funciona ao contrário: você fornece uma amostra de 30 segundos, o sistema verifica o consentimento, e a voz resultante é marcada com uma marca d'água SynthID e credenciais C2PA no áudio gerado. A remixagem de voz, que permite combinar ou modificar uma voz personalizada existente, está listada como "em breve", em vez de já lançada.
Vozes personalizadas vêm em duas variantes e se comportam de forma suficientemente diferente para que a distinção importe em produção. Vozes personalizadas com estado são armazenadas no projeto, limitadas a 200 por projeto, com tempo de vida de um ano. Vozes sem estado são endereçadas por um voicekey_... identificador e expiram após sete dias. Se seu aplicativo provisiona uma voz por cliente, o limite e o TTL são os dois números que decidem se você precisa de uma camada de armazenamento própria.
Os controles de interpretação são a outra metade de "novo". Você pode dirigir uma fala como dirigiria um ator — ritmo, ênfase, registro emocional — em vez de apenas escolher uma voz e torcer. Cenas com dois falantes podem ser encenadas dentro de uma única chamada. E as vocalizações não verbais são elementos de roteiro de primeira classe: <risos>, <suspiro> e <arfada> como indicações em linha, além de |hum| e |sim| para os pequenos ruídos de retorno que fazem uma conversa sintética soar como uma conversa. Diz-se que a leitura em formato longo mantém a identidade do falante com deriva mínima, que é o modo de falha que aparece primeiro quando você gera um capítulo de audiolivro de 40 minutos.
Os benchmarks, e quem os executou
O material de lançamento do Google baseia-se em duas avaliações externas e num conjunto de colocações em arenas. Todos esses itens são relatados pelo fornecedor — o Google está citando-os, e as execuções subjacentes não são públicas —, portanto, trate-os como alegações, e não como medições.

• Benchmark de Design de Voz da Hume AI — Gemini 3.8 Flash TTS ficou em primeiro lugar com 71,4, e em primeiro em modelagem de sotaque com 60,8.
• Índice de Qualidade Geral Hume — Flash TTS em primeiro, Flash-Lite TTS em segundo.
• Preferência cega na Speech Arena — primeiras colocações alcançadas em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e híndi.
• Em comparação com o Gemini 3.1 Flash TTS — o Google afirma ganhos em consistência de formato longo e controle de roteiro com dois falantes, que são exatamente as duas coisas para as quais os recursos de direção de entrega foram criados.
Vale a pena assinalar uma discrepância documentada, porque irá confundir qualquer pessoa que compare fontes. A publicação no blog descreve uma biblioteca de mais de 2.000 vozes prontas para produção. A documentação para programadores descreve "centenas" de vozes na Extended Voice Library, a par das 30 vozes de estúdio predefinidas. Cobertura de terceiros citou valores uma ordem de magnitude ainda mais altos. Não é possível conciliá-los a partir de fora — a leitura honesta é que o conjunto predefinido que obtém por predefinição é de 30, a Extended Voice Library é maior e descrita de forma vaga, e os números grandes referem-se a um catálogo que inclui vozes criadas pelos utilizadores. Se a contagem de vozes for determinante para a sua decisão, teste a voz específica de que precisa em vez de confiar em qualquer um dos três números.
O que significa se você estiver construindo sobre isso
A mudança prática é que o text-to-speech deixou de ser um item de linha especializado e passou a ser algo que você pode colocar no mesmo modelo de custos dos seus tokens de linguagem. A 25 tokens por segundo, uma hora de áudio gerado corresponde a 90.000 tokens de áudio, o que, na tarifa promocional do Flash-Lite, fica em cerca de 54 centavos. Isso é barato o suficiente para que a pergunta interessante deixe de ser "podemos pagar por uma voz sintética" e passe a ser "de qual dos dois níveis essa superfície precisa".
A segunda mudança prática é que um modelo de TTS totalmente novo é exatamente o tipo de coisa que você quer experimentar sem apostar um caminho de produção nele. É esse o caso de colocar um novo modelo atrás de um roteador em vez de conectá-lo diretamente: OrcaRouter expõe mais de 200 modelos atrás de uma única chave pelo preço de tabela do provedor, sem markup, e seu failover automático significa que um novo endpoint de fala que oscila sob carga degrada para um modelo em que você já confia, em vez de derrubar a chamada. Não hospedamos os endpoints do Gemini 3.8 TTS — eles vêm da própria API do Google —, mas a camada de texto por trás da voz, e o caminho de fallback quando uma chamada de síntese falha, são as partes para as quais um roteador realmente serve.
O que ainda falta
Três coisas estão ausentes do lançamento e cada uma delas é uma restrição real, não uma implicância.
Não há nenhuma avaliação independente publicada. Os números Hume do Google são o fornecedor citando o benchmark de um terceiro, o que é melhor que nada e pior que uma auditoria. Até que a Artificial Analysis ou um equivalente publique sua própria execução nos mesmos modelos, toda alegação de qualidade neste artigo deve ser lida como uma alegação.
Não há opção de pesos abertos. Ambos os modelos são fechados e disponíveis apenas via API, o que os coloca em uma categoria diferente dos modelos de fala abertos que vêm surgindo no mesmo cenário. Se a sua implantação exige executar o modelo por conta própria, este lançamento não é para você.
E o preço promocional acaba. A tarifa de janeiro de 2027 do Flash TTS é o dobro da tarifa de setembro, e qualquer business case construído com os números de lançamento precisará ser refeito no primeiro trimestre. Isso não é uma crítica — publicar os dois números desde o início é mais honesto do que a maioria faz — mas é o número que pertence à planilha.
O Google não disse se o Gemini 3.1 Flash TTS Preview será descontinuado, apenas que o Flash-Lite TTS está posicionado como seu substituto de confiança. Quem ainda usa o modelo de pré-visualização deve planejar uma migração em vez de esperar por um aviso de encerramento.

