
Gemini 3.8 TTS vs Gemini 3.1 Flash TTS: A única lacuna nesta família que é real
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Fazer upgrade dentro de uma mesma família de modelos costuma ser a decisão fácil, e esta tem uma particularidade que a torna menos fácil do que parece. Gemini 3.1 Flash TTS — ainda listado na API do fornecedor como preview — ocupa a 10ª posição no Artificial Analysis Provider Voice Arena, com Elo de 1.199 e um intervalo de 12 pontos. Gemini 3.8 Flash TTS, lançado em 23 de setembro de 2026, ocupa a 2ª posição, com Elo de 1.260 e um intervalo de 17 pontos. Isso representa um ganho de 61 pontos e, ao contrário da maioria das diferenças nesse ranking, ele sobrevive às barras de erro: a faixa do 3.1 vai de 1.187 a 1.211, a do 3.8 vai de 1.243 a 1.277, e há uma zona morta de trinta e dois pontos entre elas. O upgrade de qualidade é real. A questão do preço é onde as coisas ficam estranhas.

A própria tabela de preços do Google diz que a tarifa de saída de áudio caiu de US$ 20,00 por milhão de tokens na versão 3.1 para US$ 9,00 na versão 3.8 — um corte de 55%. Artificial Analysis normaliza os mesmos dois modelos para US$ 18,30 e US$ 33,00 por milhão de caracteres, respectivamente, o que diz o contrário. Os dois números são publicados; nenhum deles está errado; eles medem coisas diferentes, e a conciliação entre eles é a parte mais útil desta comparação para quem planeja uma migração.
O que a atualização realmente mudou
A geração 3.8 não é um reajuste. Três superfícies mudaram significativamente.
• Número de vozes e criação de vozes — O 3.1 Flash TTS foi lançado com um conjunto de vozes predefinidas. O 3.8 Flash TTS chega com 30 vozes de estúdio predefinidas, incluindo Kore e Puck, além de design de voz a partir de uma descrição em linguagem natural e replicação de voz a partir de uma amostra de 30 segundos com verificação de consentimento, uma marca d'água SynthID e credenciais C2PA na saída. O remix de vozes está listado como em breve, em vez de já disponível.
• Controle de interpretação — direção linha por linha, encenação de cena com dois falantes dentro de uma única chamada, e sinais não verbais escritos diretamente no roteiro como <risadas>, <suspiro>, <arquejo>, |hum-hum| e |sim|. O material de lançamento do Google alega consistência aprimorada em formato longo e controle de roteiro com dois falantes especificamente em relação ao 3.1. Isso é uma alegação do fornecedor sem nenhuma execução pública por trás.
• Cobertura de idiomas — 130 idiomas no Flash TTS e 101 no Flash-Lite TTS, detectados automaticamente a partir do texto. A cobertura publicada do 3.1 Flash TTS é menor.
A mudança estrutural é a divisão. Não há um único sucessor para o 3.1 Flash TTS; há dois, e a documentação do Google posiciona o Flash-Lite TTS como o "substituto que faz o trabalho pesado". Isso importa porque significa que uma migração é uma decisão de nível, não um incremento de versão. O nível mais barato não é a versão mais nova do que você tem — é um ponto diferente na curva.
Por que o preço caiu e o ranking diz que subiu
Comece pelo que o Google publica, porque é isso que será efetivamente cobrado de você.
• Gemini 3.1 Flash TTS Preview — $1.00 por milhão de tokens de texto de entrada, $20.00 por milhão de tokens de áudio de saída. Batch é $0.50 e $10.00.
• Gemini 3.8 Flash TTS Standard — $0,50 e $9,00 até 31 de dezembro de 2026, depois $1,00 e $18,00. Batch e Flex $0,25 e $4,50. Priority $0,90 e $16,20.
• Gemini 3.8 Flash-Lite TTS Standard — $0,50 e $6,00 até 31 de dezembro de 2026, depois $1,00 e $12,00. Batch e Flex $0,25 e $3,00. Priority $0,90 e $10,80.

Só na linha de saída de áudio, o 3.8 Flash TTS a US$ 9,00 contra o 3.1 a US$ 20,00 é um corte de 55 por cento, e o 3.8 Flash-Lite TTS a US$ 6,00 é um corte de 70 por cento. Mesmo no valor pós-promoção de US$ 18,00, o Flash TTS ainda fica abaixo do modelo que substitui. Esse é o número que aparece numa fatura, e é inequívoco.
Agora, o ranking. A Artificial Analysis publica um valor por milhão de caracteres para que modelos que cobram em unidades diferentes possam ser classificados lado a lado e, para este par, apresenta US$ 18,30 para o 3.1 Flash TTS e US$ 33,00 para o 3.8 Flash TTS. Lido isoladamente, isso indica que a atualização quase dobrou de preço.
A reconciliação é que uma tarifa por caractere é uma conversão, não um preço, e o fator de conversão não é o mesmo para os dois modelos. Converter tokens de áudio em caracteres exige assumir tanto uma taxa de fala quanto uma proporção de tokens de áudio — o Google mede o áudio a 25 tokens por segundo de saída — e exige escolher em relação a qual nível de serviço normalizar. Se o conselho normaliza 3,8 à tarifa pós-promoção de US$ 18,00 enquanto normaliza 3,1 à sua própria tarifa de US$ 20,00, os dois estão próximos o bastante para que qualquer diferença na suposição de segundos por caractere domine o resultado. Uma tarifa por caractere baseada em uma suposição generosa de taxa de fala favorece o modelo ao qual é aplicada.
A instrução prática, portanto, é: use as tarifas de tokens do Google para fins de orçamento e use as tarifas por caractere do leaderboard apenas para a proporção entre modelos que o leaderboard mediu da mesma forma. Não misture as duas, e não cite a variação de $18,30 a $33,00 como aumento de preço — ela é um artefato de uma normalização que os dois modelos não compartilham.
O custo real de migração é outro, e é a janela promocional. Ambos os novos níveis estão com a tarifa pela metade até 31 de dezembro de 2026 e dobram em 1º de janeiro. Uma migração planejada com base nos números de setembro e executada em novembro será reprecificada no primeiro trimestre. A tarifa de janeiro de 2027 para o Flash TTS, US$ 18,00 por milhão de tokens de áudio, ainda está abaixo dos US$ 20,00 da 3.1 — então o corte é real depois da promoção, apenas muito menor do que parece hoje.
O ganho de qualidade, e o que não está por trás dele
O Elo da arena é o único número aqui coletado por alguém que não o fornecedor, e é o único que ultrapassa suas barras de erro. Sessenta e um pontos, de 1.199 a 1.260, com 3.430 amostras no 3.1 e 1.999 no 3.8, e 7 vozes da arena contra 8. A contagem de amostras no modelo mais novo é menor, o que amplia seu intervalo e, ainda assim, os intervalos não se tocam.

O que não está por trás disso: nenhum benchmark independente além da arena. Os números de lançamento do Google — primeiro no Hume AI Voice Design Benchmark, com 71,4, primeiro em modelagem de sotaque, com 60,8, primeiro e segundo no Hume Overall Quality Index para o Flash e o Flash-Lite, e as melhores colocações em preferência cega alegadas em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e hindi — são o fornecedor citando o benchmark de terceiros. As execuções subjacentes não são públicas. Leia-os como alegações, na mesma direção do resultado da arena, mas que não acrescentam peso independente a ele.
A questão da descontinuação, e uma lista de verificação de migração
O Google não anunciou uma data de encerramento para o Gemini 3.1 Flash TTS Preview. A empresa afirmou que o Flash-Lite TTS está posicionado como seu substituto principal, que é o tipo de linguagem que antecede um aviso de descontinuação, em vez de vir depois dele. Se você ainda está no modelo de pré-visualização, a interpretação correta é que você tem uma migração a planejar, não um prazo a cumprir — e que esperar pelo prazo é a estratégia errada para um modelo cujo substituto já está 61 pontos Elo à frente.
• Verifique de qual nível sua carga de trabalho precisa. Flash TTS para 130 idiomas e a superfície completa de entrega; Flash-Lite TTS para 101 idiomas a US$ 6,00 por milhão de tokens de áudio. A lista de idiomas é a linha divisória, não a qualidade.
• Reajuste o preço com base na tarifa de janeiro de 2027, não na promocional. $18,00 por milhão de tokens de áudio no Flash TTS, $12,00 no Flash-Lite.
• Decida se o trabalho pode ser processado em lote. Batch e Flex reduzem pela metade a tarifa de áudio nos dois níveis — US$ 4,50 e US$ 3,00 por milhão de tokens. Qualquer coisa que não seja interativa não deve estar no nível Standard.
• Confira novamente tudo que dependia do conjunto de vozes. O catálogo padrão tem 30 vozes predefinidas; a voz que você estava usando no 3.1 pode precisar ser recriada, seja por meio de design de voz, seja por meio de uma amostra de replicação de 30 segundos.
• Reveja a estruturação das requisições. Não há limite publicado de caracteres por requisição nos modelos 3.8, e o áudio é medido por segundo, e não por caractere, portanto um enunciado longo custa mais do que uma estimativa por caractere sugeriria.
• Planeje o ciclo de vida da voz personalizada. 200 vozes com estado por projeto com tempo de vida de um ano, ou sem estado voicekey_... identificadores que expiram em sete dias.
Executando ambos enquanto você decide
Uma atualização dentro da mesma família, com uma expiração promocional e uma divergência de normalização, é exatamente o caso para não migrar tudo de uma só vez. O OrcaRouter roteia o modelo mais antigo hoje — models/google/gemini-3.1-flash-tts-preview está na nossa lista de modelos —, então você pode colocar o novo modelo em paralelo e comparar com o seu próprio tráfego antes de mover o caminho de produção. Não hospedamos os endpoints do Gemini 3.8 TTS; eles vêm da própria API do Google. O que oferecemos é a chave única para mais de 200 modelos pelo preço de tabela do provedor, sem markup, de modo que uma mudança de tarifa do fornecedor chega à sua fatura no mesmo dia, e não na renovação, e failover automático para que um modelo novinho em folha seja algo que você pode testar sem apostar nele um caminho voltado ao cliente.
O que se deve observar é se o Google atribui uma data à pré-visualização do 3.1 Flash TTS. Essa única linha de documentação vale mais para um plano de migração do que qualquer um dos benchmarks neste artigo, e ainda não foi escrita.
