Um cartão hero gerado para 'Gemini 3.8 TTS vs Gemini 3.1 Flash TTS' sobre um fundo branco com suaves detalhes em gradiente azul e ciano. O cartão à esquerda, 'Gemini 3.1 Flash TTS', apresenta Elo 1.199, 3.430 amostras, 7 vozes da arena e abril de 2026; o cartão à direita, 'Gemini 3.8 Flash TTS', apresenta Elo 1.260, 1.999 amostras, 8 vozes da arena e setembro de 2026. Uma linha de rodapé diz 'Elo por Artificial Analysis Provider Voice Arena, set. 2026.' O logotipo da OrcaRouter está composto no canto inferior direito.
Engineering & Research

Gemini 3.8 TTS vs Gemini 3.1 Flash TTS: A única lacuna nesta família que é real

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Fazer upgrade dentro de uma mesma família de modelos costuma ser a decisão fácil, e esta tem uma particularidade que a torna menos fácil do que parece. Gemini 3.1 Flash TTS — ainda listado na API do fornecedor como preview — ocupa a 10ª posição no Artificial Analysis Provider Voice Arena, com Elo de 1.199 e um intervalo de 12 pontos. Gemini 3.8 Flash TTS, lançado em 23 de setembro de 2026, ocupa a 2ª posição, com Elo de 1.260 e um intervalo de 17 pontos. Isso representa um ganho de 61 pontos e, ao contrário da maioria das diferenças nesse ranking, ele sobrevive às barras de erro: a faixa do 3.1 vai de 1.187 a 1.211, a do 3.8 vai de 1.243 a 1.277, e há uma zona morta de trinta e dois pontos entre elas. O upgrade de qualidade é real. A questão do preço é onde as coisas ficam estranhas.

A generated two-column scoreboard for Gemini 3.1 Flash TTS and Gemini 3.8 Flash TTS — 3.1 at Arena Elo 1,199, $20.00 per 1M audio tokens, 7 arena voices, 3,430 samples and an April 2026 release; 3.8 at Elo 1,260, $9.00 per 1M audio tokens, 8 arena voices, 1,999 samples and a September 2026 release — over the footer 'Prices per Google; Elo per Artificial Analysis, Sept 2026.'

A própria tabela de preços do Google diz que a tarifa de saída de áudio caiu de US$ 20,00 por milhão de tokens na versão 3.1 para US$ 9,00 na versão 3.8 — um corte de 55%. Artificial Analysis normaliza os mesmos dois modelos para US$ 18,30 e US$ 33,00 por milhão de caracteres, respectivamente, o que diz o contrário. Os dois números são publicados; nenhum deles está errado; eles medem coisas diferentes, e a conciliação entre eles é a parte mais útil desta comparação para quem planeja uma migração.

O que a atualização realmente mudou

A geração 3.8 não é um reajuste. Três superfícies mudaram significativamente.

• Número de vozes e criação de vozes — O 3.1 Flash TTS foi lançado com um conjunto de vozes predefinidas. O 3.8 Flash TTS chega com 30 vozes de estúdio predefinidas, incluindo Kore e Puck, além de design de voz a partir de uma descrição em linguagem natural e replicação de voz a partir de uma amostra de 30 segundos com verificação de consentimento, uma marca d'água SynthID e credenciais C2PA na saída. O remix de vozes está listado como em breve, em vez de já disponível.

• Controle de interpretação — direção linha por linha, encenação de cena com dois falantes dentro de uma única chamada, e sinais não verbais escritos diretamente no roteiro como <risadas>, <suspiro>, <arquejo>, |hum-hum| e |sim|. O material de lançamento do Google alega consistência aprimorada em formato longo e controle de roteiro com dois falantes especificamente em relação ao 3.1. Isso é uma alegação do fornecedor sem nenhuma execução pública por trás.

• Cobertura de idiomas — 130 idiomas no Flash TTS e 101 no Flash-Lite TTS, detectados automaticamente a partir do texto. A cobertura publicada do 3.1 Flash TTS é menor.

A mudança estrutural é a divisão. Não há um único sucessor para o 3.1 Flash TTS; há dois, e a documentação do Google posiciona o Flash-Lite TTS como o "substituto que faz o trabalho pesado". Isso importa porque significa que uma migração é uma decisão de nível, não um incremento de versão. O nível mais barato não é a versão mais nova do que você tem — é um ponto diferente na curva.

Por que o preço caiu e o ranking diz que subiu

Comece pelo que o Google publica, porque é isso que será efetivamente cobrado de você.

Gemini 3.1 Flash TTS Preview — $1.00 por milhão de tokens de texto de entrada, $20.00 por milhão de tokens de áudio de saída. Batch é $0.50 e $10.00.

• Gemini 3.8 Flash TTS Standard — $0,50 e $9,00 até 31 de dezembro de 2026, depois $1,00 e $18,00. Batch e Flex $0,25 e $4,50. Priority $0,90 e $16,20.

• Gemini 3.8 Flash-Lite TTS Standard — $0,50 e $6,00 até 31 de dezembro de 2026, depois $1,00 e $12,00. Batch e Flex $0,25 e $3,00. Priority $0,90 e $10,80.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Só na linha de saída de áudio, o 3.8 Flash TTS a US$ 9,00 contra o 3.1 a US$ 20,00 é um corte de 55 por cento, e o 3.8 Flash-Lite TTS a US$ 6,00 é um corte de 70 por cento. Mesmo no valor pós-promoção de US$ 18,00, o Flash TTS ainda fica abaixo do modelo que substitui. Esse é o número que aparece numa fatura, e é inequívoco.

Agora, o ranking. A Artificial Analysis publica um valor por milhão de caracteres para que modelos que cobram em unidades diferentes possam ser classificados lado a lado e, para este par, apresenta US$ 18,30 para o 3.1 Flash TTS e US$ 33,00 para o 3.8 Flash TTS. Lido isoladamente, isso indica que a atualização quase dobrou de preço.

A reconciliação é que uma tarifa por caractere é uma conversão, não um preço, e o fator de conversão não é o mesmo para os dois modelos. Converter tokens de áudio em caracteres exige assumir tanto uma taxa de fala quanto uma proporção de tokens de áudio — o Google mede o áudio a 25 tokens por segundo de saída — e exige escolher em relação a qual nível de serviço normalizar. Se o conselho normaliza 3,8 à tarifa pós-promoção de US$ 18,00 enquanto normaliza 3,1 à sua própria tarifa de US$ 20,00, os dois estão próximos o bastante para que qualquer diferença na suposição de segundos por caractere domine o resultado. Uma tarifa por caractere baseada em uma suposição generosa de taxa de fala favorece o modelo ao qual é aplicada.

A instrução prática, portanto, é: use as tarifas de tokens do Google para fins de orçamento e use as tarifas por caractere do leaderboard apenas para a proporção entre modelos que o leaderboard mediu da mesma forma. Não misture as duas, e não cite a variação de $18,30 a $33,00 como aumento de preço — ela é um artefato de uma normalização que os dois modelos não compartilham.

O custo real de migração é outro, e é a janela promocional. Ambos os novos níveis estão com a tarifa pela metade até 31 de dezembro de 2026 e dobram em 1º de janeiro. Uma migração planejada com base nos números de setembro e executada em novembro será reprecificada no primeiro trimestre. A tarifa de janeiro de 2027 para o Flash TTS, US$ 18,00 por milhão de tokens de áudio, ainda está abaixo dos US$ 20,00 da 3.1 — então o corte é real depois da promoção, apenas muito menor do que parece hoje.

O ganho de qualidade, e o que não está por trás dele

O Elo da arena é o único número aqui coletado por alguém que não o fornecedor, e é o único que ultrapassa suas barras de erro. Sessenta e um pontos, de 1.199 a 1.260, com 3.430 amostras no 3.1 e 1.999 no 3.8, e 7 vozes da arena contra 8. A contagem de amostras no modelo mais novo é menor, o que amplia seu intervalo e, ainda assim, os intervalos não se tocam.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing the top rows with Cartesia Sonic 3.6 first at Elo 1,273, Google's Gemini 3.8 Flash TTS second at 1,260, Alibaba's Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google's Gemini 3.1 Flash TTS tenth at 1,199 across 3,430 samples.

O que não está por trás disso: nenhum benchmark independente além da arena. Os números de lançamento do Google — primeiro no Hume AI Voice Design Benchmark, com 71,4, primeiro em modelagem de sotaque, com 60,8, primeiro e segundo no Hume Overall Quality Index para o Flash e o Flash-Lite, e as melhores colocações em preferência cega alegadas em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e hindi — são o fornecedor citando o benchmark de terceiros. As execuções subjacentes não são públicas. Leia-os como alegações, na mesma direção do resultado da arena, mas que não acrescentam peso independente a ele.

A questão da descontinuação, e uma lista de verificação de migração

O Google não anunciou uma data de encerramento para o Gemini 3.1 Flash TTS Preview. A empresa afirmou que o Flash-Lite TTS está posicionado como seu substituto principal, que é o tipo de linguagem que antecede um aviso de descontinuação, em vez de vir depois dele. Se você ainda está no modelo de pré-visualização, a interpretação correta é que você tem uma migração a planejar, não um prazo a cumprir — e que esperar pelo prazo é a estratégia errada para um modelo cujo substituto já está 61 pontos Elo à frente.

• Verifique de qual nível sua carga de trabalho precisa. Flash TTS para 130 idiomas e a superfície completa de entrega; Flash-Lite TTS para 101 idiomas a US$ 6,00 por milhão de tokens de áudio. A lista de idiomas é a linha divisória, não a qualidade.

• Reajuste o preço com base na tarifa de janeiro de 2027, não na promocional. $18,00 por milhão de tokens de áudio no Flash TTS, $12,00 no Flash-Lite.

• Decida se o trabalho pode ser processado em lote. Batch e Flex reduzem pela metade a tarifa de áudio nos dois níveis — US$ 4,50 e US$ 3,00 por milhão de tokens. Qualquer coisa que não seja interativa não deve estar no nível Standard.

• Confira novamente tudo que dependia do conjunto de vozes. O catálogo padrão tem 30 vozes predefinidas; a voz que você estava usando no 3.1 pode precisar ser recriada, seja por meio de design de voz, seja por meio de uma amostra de replicação de 30 segundos.

• Reveja a estruturação das requisições. Não há limite publicado de caracteres por requisição nos modelos 3.8, e o áudio é medido por segundo, e não por caractere, portanto um enunciado longo custa mais do que uma estimativa por caractere sugeriria.

• Planeje o ciclo de vida da voz personalizada. 200 vozes com estado por projeto com tempo de vida de um ano, ou sem estado voicekey_... identificadores que expiram em sete dias.

Executando ambos enquanto você decide

Uma atualização dentro da mesma família, com uma expiração promocional e uma divergência de normalização, é exatamente o caso para não migrar tudo de uma só vez. O OrcaRouter roteia o modelo mais antigo hoje — models/google/gemini-3.1-flash-tts-preview está na nossa lista de modelos —, então você pode colocar o novo modelo em paralelo e comparar com o seu próprio tráfego antes de mover o caminho de produção. Não hospedamos os endpoints do Gemini 3.8 TTS; eles vêm da própria API do Google. O que oferecemos é a chave única para mais de 200 modelos pelo preço de tabela do provedor, sem markup, de modo que uma mudança de tarifa do fornecedor chega à sua fatura no mesmo dia, e não na renovação, e failover automático para que um modelo novinho em folha seja algo que você pode testar sem apostar nele um caminho voltado ao cliente.

O que se deve observar é se o Google atribui uma data à pré-visualização do 3.1 Flash TTS. Essa única linha de documentação vale mais para um plano de migração do que qualquer um dos benchmarks neste artigo, e ainda não foi escrita.