Um cartão hero gerado para 'Gemini 3.8 TTS vs Qwen Audio 3.0 TTS' em um fundo branco com suaves acentos de gradiente azul e ciano. O cartão da esquerda, 'Qwen-Audio-3.0-TTS-Plus', lista Elo 1.259, 15 vozes de arena, 16 idiomas + 20 dialetos e US$ 27,6 por 1 milhão de caracteres; o cartão da direita, 'Gemini 3.8 Flash TTS', lista Elo 1.260, 8 vozes de arena, 130 idiomas e US$ 33,0 por 1 milhão de caracteres. Uma linha de rodapé diz: 'Elo por Artificial Analysis Provider Voice Arena, setembro de 2026.' O logotipo da OrcaRouter está composto no canto inferior direito.
Engineering & Research

Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: Duas Respostas Diferentes para "Fazer Soar Certo"

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um ponto Elo separa esses dois modelos na Artificial Analysis Provider Voice Arena, e eles chegam lá resolvendo problemas completamente diferentes. Qwen-Audio-3.0-TTS-Plus está na 3ª posição com um Elo de 1.259 em 1.447 amostras e 15 vozes da arena, lançado em setembro de 2026 e listado a US$ 27,60 por milhão de caracteres. Gemini 3.8 Flash TTS está na 2ª posição com 1.260 em 1.999 amostras e 8 vozes da arena, lançado em 23 de setembro de 2026 e listado a US$ 33,00 por milhão de caracteres. Estatisticamente indistinguíveis, vinte por cento de diferença no preço, e construídos sobre teorias opostas do que torna a fala sintética boa.

A teoria é a parte interessante. A resposta da Qwen é controle embutido: 86 etiquetas de interpretação que você espalha pelo texto para que o modelo saiba onde respirar, dar ênfase e mudar de registro. A resposta do Google é uma camada de direção: instruções linha a linha, encenação com dois falantes e um pequeno conjunto de sinais não verbais. Se você já construiu um pipeline que emite anotações semelhantes a SSML, uma dessas opções vai se encaixar e a outra não, e essa compatibilidade importa mais do que um único ponto de Elo.

Onde os dois realmente ficam no tabuleiro

Ler o Provider Voice Arena honestamente exige olhar para os intervalos, não para as classificações.

• Qwen-Audio-3.0-TTS-Plus — posição 3, Elo 1.259, 1.447 amostras, 15 vozes na arena, setembro de 2026, US$ 27,6 por 1 milhão de caracteres.

• Gemini 3.8 Flash TTS — posição 2, Elo 1.260, 1.999 amostras, 8 vozes da arena, setembro de 2026, US$ 33,0 por 1 milhão de caracteres.

• Cartesia Sonic 3.6 — posição 1, Elo 1.273, 1.757 amostras, 8 vozes de arena, agosto de 2026, US$ 49,0 por 1 milhão de caracteres.

Os três primeiros formam um único grupo. Os intervalos publicados para os dois primeiros são de dezessete pontos para cada lado, o que é mais amplo do que toda a diferença entre o primeiro e o terceiro, de modo que a ordenação entre eles não é evidência estável. O que o quadro estabelece é que todos os três estão no grupo líder e que nada abaixo deles está próximo — a 10.ª posição, Gemini 3.1 Flash TTS, está em 1.199.

A única assimetria que vale a pena notar é a contagem de vozes da arena. A Qwen apresenta 15 vozes contra as 8 da Gemini, então a pontuação da Qwen é uma média sobre uma amostra mais ampla do próprio produto do fornecedor. Isso funciona nos dois sentidos: é uma estimativa mais justa de como soa o catálogo da Qwen como um todo, e dá à Qwen mais oportunidades de apresentar uma voz fraca que puxa a média para baixo. Nenhuma das interpretações altera a conclusão de que as duas estão empatadas.

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 etiquetas de entrega contra uma camada de direção

Esta é a diferença substantiva e ela determina a maioria das integrações.

O Qwen-Audio-3.0-TTS traz 86 tags de entonação inline — anotações incorporadas no texto que controlam como um trecho é falado. É uma abordagem de marcação: seu roteiro carrega a performance. Isso é familiar para qualquer pessoa que já trabalhou com SSML, e compõe bem com ferramentas que geram texto programaticamente, porque a superfície de controle é uma transformação de string em vez de uma chamada de API.

O Gemini 3.8 Flash TTS segue o outro caminho. Você dirige uma fala como dirigiria um ator — ritmo, ênfase, registro emocional — como uma instrução separada, e não como marcação embutida no texto. Cenas com dois falantes podem ser montadas dentro de uma única chamada. E um pequeno conjunto de sinais não verbais é escrito no roteiro: <laughs>, <sigh>, <gasp> como sinais embutidos no texto, além de |mhm| e |yeah| para ruídos de retorno.

Então, ambos os modelos aceitam anotação no texto; a diferença é o tamanho do vocabulário e onde fica o resto do controle. O da Qwen é mais amplo e mais plano — 86 tags, todas no texto. O do Google é mais estreito no texto e mais amplo fora dele, com direção de entrega e encenação de locutor como parâmetros no nível da chamada. Se você está portando um sistema que já emite marcação inline rica, a Qwen é o port mais curto. Se você está construindo a lógica de direção no código da aplicação de qualquer forma, a divisão do Google é mais limpa.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Cobertura de idiomas versus cobertura de dialetos

Os números de cobertura não são comparáveis, e compará-los de forma ingênua é um erro.

Gemini 3.8 Flash TTS cobre 130 idiomas, detetados automaticamente a partir do texto; o Flash-Lite TTS cobre 101. Isso é amplitude entre famílias linguísticas, que é o que você quer para uma etapa de localização que precisa alcançar uma cauda longa de mercados.

Qwen-Audio-3.0-TTS cobre 16 idiomas, além de 20 regiões de dialeto chinês. Isso é profundidade dentro de uma única família linguística. Vinte regiões de dialeto não são um número menor que 130 idiomas como pode parecer — é um tipo diferente de alegação e, para um produto que atende usuários falantes de chinês nas regiões da China continental, é a mais útil. Um modelo com 130 idiomas e uma única voz em mandarim não atende um usuário em Sichuan da mesma forma que um modelo com 20 regiões de dialeto.

Qual deles importa depende inteiramente do seu público. Se o seu requisito é “pelo menos aceitável em vinte mercados”, Gemini. Se é “realmente correto no mercado chinês”, Qwen.

Preço, e o que o valor por caractere esconde

• Qwen-Audio-3.0-TTS-Plus — US$ 27,60 por 1 milhão de caracteres na base normalizada do leaderboard; a variante Flash fica em torno de US$ 15 por 1 milhão de caracteres, com latência declarada do primeiro pacote de cerca de 300 ms.

• Gemini 3.8 Flash TTS — US$ 33,00 por 1M de caracteres normalizados; cobrado pelo Google a US$ 0,50 por milhão de tokens de texto de entrada e US$ 9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois US$ 1,00 e US$ 18,00.

• Gemini 3.8 Flash-Lite TTS — US$ 22,10 por 1 milhão de caracteres normalizados, na 6.ª posição, com um Elo de 1.235; cobrado a US$ 6,00 por milhão de tokens de áudio até 31 de dezembro de 2026.

Ambos os números por caractere são normalizações da Artificial Analysis, não preços de lista dos fornecedores — o Qwen cobra por meio do Alibaba Cloud Model Studio e o Google cobra em tokens, e nenhum deles publica uma tarifa por caractere para esses modelos. Use-os para a razão, que é de aproximadamente 1,2x a favor do Qwen, e não como cotações.

Os níveis divergem em formato. A Qwen se divide em Plus e Flash, com o nível Flash trocando qualidade por uma promessa de primeiro pacote em ~300 ms. O Google se divide em Flash e Flash-Lite e, depois, em Standard, Batch e Flex, e Priority — US$ 4,50, US$ 9,00 e US$ 16,20 por milhão de tokens de áudio no Flash TTS. O modelo do Google recompensa classificar sua carga de trabalho; o da Qwen recompensa escolher um nível de qualidade de antemão.

A disponibilidade é a outra diferença real. O Gemini 3.8 Flash TTS está em disponibilidade geral na Gemini Developer API. O Qwen-Audio-3.0-TTS é fechado e somente hospedado, servido por meio do Alibaba Cloud Model Studio, sem pesos abertos. Se você precisa executar o modelo por conta própria, nenhum destes é para você — mas se sua infraestrutura já está na Alibaba Cloud, o modelo Qwen é o que não tem nenhuma questão de egresso para resolver.

Alegações de fornecedores de ambos os lados

Nenhum dos modelos tem um benchmark independente além da arena, e ambos os fornecedores publicaram alegações que devem ser rotuladas como tais.

Do Google, para o Gemini 3.8 Flash TTS: primeiro no Hume AI Voice Design Benchmark com 71,4; primeiro em modelagem de sotaque com 60,8; primeiro e segundo no Hume Overall Quality Index para Flash e Flash-Lite; e as melhores colocações em preferência cega alegadas em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e híndi. As execuções não são públicas.

Os da Alibaba, para o Qwen-Audio-3.0-TTS: o sistema de locução de 86 tags, as 20 regiões de dialeto e o valor de ~300 ms para o primeiro pacote na variante Flash. Também não reproduzido.

O Elo da arena é o único número de qualidade coletado de forma independente neste artigo, e ele diz que os dois estão empatados no topo do placar.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

O que o Gemini adiciona que o Qwen não

A criação de voz é a lacuna mais evidente. O Gemini 3.8 Flash TTS suporta design de voz a partir de uma descrição em linguagem natural e replicação de voz a partir de uma amostra de 30 segundos, com verificação de consentimento e uma marca d'água SynthID mais credenciais C2PA na saída. Vozes personalizadas vêm em duas formas: 200 vozes com estado por projeto com um tempo de vida de um ano, ou vozes sem estado endereçadas por um voicekey_... handle que expira após sete dias. O remix de voz está listado como em breve.

O controle do formato de saída é o segundo. WAV 24 kHz mono PCM de 16 bits com sinal no endpoint unário, PCM sem cabeçalho (audio/l16) no endpoint de streaming, além de audio/mulaw e audio/alaw e uma taxa de amostragem configurável. Para trabalhos adjacentes à telefonia, o suporte a mulaw remove uma etapa de transcodificação.

Qual chamar

Escolha o Qwen-Audio-3.0-TTS se os seus utilizadores falarem chinês e a cobertura de dialetos for o requisito, se quiser um vocabulário de marcação inline avançado que o seu gerador possa emitir diretamente, ou se já estiver na Alibaba Cloud e quiser o caminho mais curto para um endpoint funcional. É também a mais barata das duas numa base normalizada, e a variante Flash é ainda mais barata se ~300 ms para o primeiro pacote forem aceitáveis.

Escolha o Gemini 3.8 Flash TTS se você precisar de amplitude em muitos idiomas em vez de profundidade em um, se precisar criar ou replicar uma voz específica, se precisar de saída mulaw ou alaw, ou se "disponível de forma geral em vez de apenas hospedado" for um requisito de aquisição.

Nenhuma das duas é uma escolha ruim e nenhuma é claramente melhor — que é justamente o ponto de uma diferença de um ponto de Elo. A decisão é de compatibilidade, não de qualidade.

Esse também é o argumento para ainda não se comprometer firmemente com nenhum dos dois. O OrcaRouter oferece a você mais de 200 modelos por trás de uma única chave, pelo preço de tabela do provedor e sem margem adicional, então uma mudança de tarifa de qualquer um dos laboratórios chega à sua fatura no mesmo dia, e não na renovação, e o failover automático faz com que um endpoint de síntese que vacila sob carga passe para outro em vez de descartar a requisição. Não hospedamos o Qwen-Audio-3.0-TTS — ele é servido pelo Alibaba Cloud Model Studio — e não hospedamos os endpoints TTS do Gemini 3.8, que vêm da API do Google. O que oferecemos é a camada de texto e o roteamento acima dela, e é isso que permite rodar ambos com tráfego real por um mês antes de escolher.

O número a observar é a próxima revisão da arena. Com 1.447 amostras no Qwen e 1.999 no Gemini, ambos os intervalos ainda são amplos o suficiente para que um único mês de votos possa separá-los — ou confirmar que o empate é a resposta.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente