
Crie e implante áudio personalizado com Gemini 3.8 Flash TTS: design de voz, clonagem e os dois relógios que decidem
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 506 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 184 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
O Gemini 3.8 Flash TTS e o Gemini 3.8 Flash-Lite TTS permitem que você invente uma voz a partir de uma descrição escrita em vez de escolher uma de uma lista, e ambos ficaram disponíveis para o público em geral na API Gemini em 23 de setembro de 2026. A manchete que as pessoas estão repetindo é o design de voz. A parte que vale a pena planejar é o que acontece com uma voz projetada depois, porque o fornecedor oferece duas maneiras de manter uma e atribui um tempo de vida diferente a cada uma. Escolha a errada e a voz da qual seu produto depende expira em uma semana.
Essa é a lacuna na cobertura do lançamento até agora. Os posts de anúncio explicam que você pode fazer uma voz surgir a partir de um prompt, e alguns deles mencionam a clonagem a partir de uma amostra de 30 segundos. Nenhum deles detalha o modelo de armazenamento, que é o que determina se um pipeline de fala é reproduzível a partir de um arquivo de configuração ou precisa ser reprovisionado periodicamente. Este artigo cobre todo o caminho — projetar, armazenar, chamar e pagar — com os preços e as cotas conforme o Google as publica.
O que foi lançado em 23 de setembro?
Dois modelos, um único esquema de API. Os identificadores são gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts, e a documentação do Google é explícita ao afirmar que ambos usam "exatamente o mesmo esquema de API e formato de prompt" — alternar entre eles é uma mudança a um parâmetro, não uma reescrita.
• Entrada — apenas texto. Ambos os modelos aceitam texto e retornam áudio; não são multimodais e não geram texto de volta.
• Saída — WAV, PCM com sinal de 16 bits, mono, 24 kHz no endpoint unário; PCM sem cabeçalho (audio/l16) no endpoint de streaming; audio/mulaw e audio/alaw aceitos com uma taxa de amostragem configurável.
• Idiomas — 130 no Flash TTS, 101 no Flash-Lite TTS, detetados automaticamente a partir do texto em vez de declarados na solicitação.
• Vozes — 30 vozes de estúdio curadas listadas na documentação (Kore e Puck entre elas), uma Extended Voice Library com "centenas" adicionais consultáveis por meio do endpoint voices, além dos dois caminhos de criação abaixo.
Direção — controle de entrega linha a linha, cenas com dois locutores encenadas a partir de um único roteiro, e sinais não verbais como <laughs>, <sigh> e |mhm| escritos diretamente na transcrição.
Os dois níveis existem porque as cargas de trabalho divergiram. O Flash TTS está posicionado para máxima fidelidade acústica e atuação complexa; o Flash-Lite TTS é descrito, nas próprias palavras do Google, como o "substituto de trabalho pesado" para gemini-3.1-flash-tts-preview, voltado para dublagem em massa, recursos de leitura em voz alta e cascatas de agentes de voz. Ambos substituem um único modelo de pré-visualização que estava na API desde abril de 2026, então, se você estava na pré-visualização, a migração é uma decisão de nível em vez de um incremento de versão.

Projetar uma voz é um prompt, e isso muda a etapa de revisão.
A superfície de criação é a coisa genuinamente nova nesta geração. Uma voz guiada por prompt é construída a partir de uma descrição em linguagem natural — papel, sotaque, caráter vocal — e retorna um identificador que você reutiliza. Na API, esta é uma chamada de criação de voz com store: true e uma entrada com prompt; nos próprios exemplos do Google, as descrições vão de um DJ de Melbourne cheio de energia a um dragão japonês. Uma vez criada, a voz é referenciada em uma solicitação de fala pelo seu identificador, e as instruções de estilo por solicitação podem então ser mínimas ou vazias, porque o caráter já está incorporado na voz.
A consequência prática é uma mudança no fluxo de trabalho, não apenas uma funcionalidade. O casting de voz costumava ser uma negociação de licença ou uma reserva de estúdio, o que significava que a seleção da voz acontecia uma única vez, logo no início, e sobrevivia à revisão porque mudá-la era caro. Quando uma voz é um parágrafo de texto, o casting se torna um design token — algo que um gerente de produto pode pedir para voltar a gerar numa terça-feira. As equipes que colocam a string de descrição no controle de versão e tratam o ID de voz gerado como um artefato de build obterão uma saída consistente em todos os ambientes. As equipes que criam vozes manualmente no AI Studio não obterão essa consistência, e a falha parecerá uma diferença inexplicável entre o áudio de staging e o de produção.
Os dois relógios
Esta é a seção que os posts de lançamento pulam. O Google permite que você mantenha uma voz projetada ou replicada em um de dois estados, e eles expiram a taxas radicalmente diferentes.
• Vozes armazenadas — criadas com o armazenamento ativado, elas ficam no seu projeto e estão sujeitas a uma cota de 200 vozes por projeto, com tempo de vida de um ano.
• Chaves sem estado — a replicação de voz pode devolver uma chave gerida pelo cliente (a forma voicekey_…) em vez de um identificador armazenado, e essa chave tem um tempo de vida de sete dias.
Lidos em conjunto, esse par é uma instrução de design. Uma voz armazenada é um compromisso de um ano e um teto rígido de 200 por projeto, o que é generoso para um produto com um elenco fixo e inútil para qualquer coisa que gere uma nova voz por cliente. A chave sem estado é o oposto: sem pressão de cota, mas uma chave que você precisa emitir novamente toda semana, o que significa que sua aplicação precisa de um caminho de atualização e sua infraestrutura precisa armazenar credenciais que rotacionam. Nenhuma das opções está errada. Escolher sem perceber qual das duas você escolheu é o que faz um agente de voz ficar silencioso no oitavo dia.
Mais duas propriedades vêm atreladas à replicação e vale a pena conhecê-las antes de prometer qualquer coisa a uma equipe jurídica. Criar uma voz replicada exige uma gravação de consentimento verbal do proprietário da voz que deve corresponder ao falante de referência — uma verificação falada, não uma caixa de seleção. E a saída carrega proveniência: cada clipe recebe marca d'água com SynthID, e as vozes replicadas também carregam credenciais de conteúdo C2PA. O caminho de design é deliberadamente o mais difícil de ser abusado, e ambas as barreiras são estruturais, não declarações de política.
Uma discrepância que vale a pena sinalizar em vez de resolver. A tabela de modelos compatíveis do Google lista design de voz e replicação de voz como disponíveis em ambos os modelos TTS 3.8. A maior parte da cobertura de lançamento descreve a replicação como parte especificamente do Flash TTS. Se a replicação for importante para sua decisão entre os níveis, verifique nos documentos do nível que você pretende implantar, em vez de confiar em qualquer um dos resumos.
Quanto custa uma hora de áudio
O Google cobra a fala em tokens, não em caracteres ou segundos, e a conversão é publicada: o áudio é medido a 25 tokens por segundo de saída, o que dá 90.000 tokens por hora. Isso torna a aritmética excepcionalmente simples, e é esse o número que se deve colocar num orçamento, e não a tarifa por milhão.
• Flash TTS padrão — US$ 0,50 por milhão de tokens de texto de entrada, US$ 9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois US$ 1,00 e US$ 18,00. Batch e Flex são US$ 0,25 e US$ 4,50; Priority é US$ 0,90 e US$ 16,20.
• Flash-Lite TTS standard — $0,50 e $6,00 até a mesma data, depois $1,00 e $12,00. Batch e Flex $0,25 e $3,00; Priority $0,90 e $10,80.
• Em segundos — o Flash TTS fica em cerca de US$ 0,81 por hora de áudio gerado durante a janela promocional e cerca de US$ 1,62 depois dela; o Flash-Lite TTS fica em cerca de US$ 0,54 e depois US$ 1,08.
• Em comparação com o modelo que substitui, gemini-3.1-flash-tts-previewcusta US$ 1,00 e US$ 20,00 por milhão, portanto a linha de saída de áudio caiu 55 por cento no Flash TTS e 70 por cento no Flash-Lite TTS.
Não planeje com base no número promocional. O Google publica as duas colunas na mesma tabela, o que significa que a tarifa de janeiro não é um boato a ser descoberto depois — ela está no cartão hoje, e qualquer estimativa por mil minutos calculada a US$ 0,81 precisa sobreviver ao fato de ser dobrada.
Um número independente, e vários que não são.
O anúncio do Google abre com resultados de benchmark, e eles devem ser lidos exatamente pelo que são. A empresa afirma que o Flash TTS ficou em primeiro lugar no Voice Design Benchmark da Hume AI, com 71,4, liderou a modelagem de sotaques com 60,8, e que o Flash TTS e o Flash-Lite TTS ficaram em primeiro e segundo lugar no Índice de Qualidade Geral da Hume, com fortes colocações em preferência cega no Voice Arena para japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e hindi. Tudo relatado pelo fornecedor, nenhuma das execuções é pública.
Há um detalhe nessa lista que vale a pena notar. Alan Cowen, creditado como autor do anúncio do Google, é o fundador da Hume AI — o laboratório cujo Voice Design Benchmark fornece o número principal. Isso não torna o número errado, e o benchmark da Hume é real, mas os dois não são independentes entre si, e um leitor que pondera o 71,4 deveria saber disso antes de repeti-lo como validação de terceiros.
O dado coletado de forma independente está no Provider Voice Arena da Artificial Analysis, capturado para este artigo em 24 de setembro de 2026: o Gemini 3.8 Flash TTS ocupa o segundo lugar, com Elo de 1.260 e intervalo de 17 pontos em 1.999 amostras, atrás do Cartesia Sonic 3.6, com 1.273. O Gemini 3.8 Flash-Lite TTS está em sexto lugar, com 1.235. O modelo que está sendo substituído, Gemini 3.1 Flash TTS, está em décimo lugar, com 1.199 em 3.430 amostras. Preferência de ouvintes cegos, não uma avaliação do próprio laboratório — e o único número de qualidade aqui que o Google não encomendou.

Onde executá-lo, e onde ainda não
Ambos os modelos estão disponíveis hoje na API Gemini e no Google AI Studio, sem lista de espera. As interfaces de consumo e corporativas estão em fase de preparação, em vez de lançadas: o Flash TTS está chegando ao Gemini Notebook e o Flash-Lite TTS ao Google Vids, o acesso ao Gemini Enterprise é descrito como "em breve", e a remixagem de voz — ajustar timbre, tom, ritmo e sotaque em uma voz existente — é listada como um recurso futuro, e não atual. Se o seu plano depende da remixagem, ela ainda não existe.
Do nosso lado, honestidade em primeiro lugar: os endpoints do Gemini 3.8 TTS não estão na tabela de roteamento da OrcaRouter. A geração que eles substituem está — google/gemini-3.1-flash-tts-previewestá no catálogo pelo mesmo $1.00 e $20.00 por milhão de tokens que o Google publica, porque o preço de tabela do provedor é repassado sem nenhuma margem, e ele responde no mesmo endpoint /v1/audio/speechque o seu SDK compatível com OpenAI já usa. Isso importa mais do que parece para uma carga de trabalho de fala, porque o que você está de fato comprando é um endpoint estável que a sua aplicação pode chamar enquanto os modelos por trás dele mudam. O seu código guarda uma string de modelo; o catálogo guarda o roteamento. Quando a janela promocional do Google fechar em 31 de dezembro e o Flash TTS dobrar de preço, o preço de um modelo roteado muda no mesmo dia, e não na próxima renovação de contrato — e um modelo que sai do ar faz failover em vez de levar a sua fila de narração junto com ele.

Se você está avaliando esta geração antes de se comprometer, o experimento barato é de dois níveis. Execute o mesmo script no Flash TTS e no Flash-Lite TTS, porque o esquema é idêntico e a diferença é um parâmetro — depois decida com o seu próprio áudio, e não com um gráfico de benchmark, e verifique no Artificial Analysis se a diferença de qualidade sobrevive às suas barras de erro antes de pagar o valor adicional. Para um projeto de narração em grande formato, o valor adicional é dinheiro de verdade; para um bot de suporte lendo um número de telefone em voz alta, não é nada óbvio que esteja comprando algo que um ouvinte consiga ouvir.
