Um cartão hero gerado para ElevenLabs Eleven v4 vs. Google Gemini 3.1 Flash TTS com dois cartões de pontuação: Eleven v4 com Elo 1.319 e US$ 80,00 por 1 milhão de caracteres, e Gemini 3.1 Flash TTS com Elo 1.203 e US$ 18,31 por 1 milhão de caracteres, com a legenda '116 pontos de Elo, 4,4 vezes o preço no quadro'. Rodapé: 'Provider Voice Arena, segundo a Artificial Analysis, setembro de 2026.' O logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

Eleven v4 vs. Gemini 3.1 Flash TTS: uma diferença de 116 pontos, e o modelo mais barato do Google

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Se você procurar pela voz do Goog​le hoje, vai acabar na errada. Goog​le Gemini 3.1 Flash TTS está listado na 11ª posição no Provider Voice Arena da Artificial Analysis, com um Elo de 1.203 em 3.512 aparições, a US$ 18,31 por milhão de caracteres. ElevenLabs Eleven v4, lançado em 28 de setembro de 2026, ocupa o 1º lugar, com um Elo de 1.319 em 1.674 aparições, a US$ 80,00 por milhão. Isso parece uma diferença de 116 pontos contra um desafiante mais barato — até você notar que o próprio Gemini 3.8 Flash TTS do Goog​le ocupa o terceiro lugar no mesmo ranking, com 1.267 e um preço normalizado mais baixo, de US$ 16,49. A disputa real não é a que o confronto da manchete sugere, e o motivo é uma data de lançamento.

Um deles é dezoito meses mais novo do que parece.

O Gemini 3.1 Flash TTS tem uma data de lançamento de 15 de abril de 2026 no quadro. O Eleven v4 tem 28 de setembro de 2026. Isso é cinco meses e meio, o que não é uma geração em síntese de fala, mas é tempo suficiente para que o Google já tenha lançado um sucessor: Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS chegaram à disponibilidade geral em 23 de setembro de 2026, cinco dias antes do Eleven v4, e ambos estão classificados acima do 3.1 no mesmo quadro. Gemini 3.8 Flash-Lite TTS fica em sexto lugar com 1.241 e $11,03 por milhão.

A generated scoreboard comparing ElevenLabs Eleven v4 and Google Gemini 3.1 Flash TTS across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 11 / 1,203), samples (1,674 with an interval of plus or minus 19 against 3,512 with plus or minus 12), board price ($80.00 against $18.31 per 1M characters), rate card ($0.022 per 1K characters until October 12 against billed per token), script direction (inline audio tags against a voice set and prompting) and release date (September 28, 2026 against April 15, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis; rate meters and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

Então a comparação honesta tem três pontos, não dois, e a ordenação por preço é a parte interessante:

• 1º lugar, ElevenLabs Eleven v4 — Elo 1.319, US$ 80,00 por milhão de caracteres, 1.674 aparições, intervalo de ±19

• 3º lugar, Google Gemini 3.8 Flash TTS — Elo 1.267, US$ 16,49 por milhão de caracteres, lançado em 23 de setembro de 2026

• 6º lugar, Google Gemini 3.8 Flash-Lite TTS — Elo 1.241, US$ 11,03 por milhão de caracteres, lançado em 23 de setembro de 2026

• Classificação 11, Google Gemini 3.1 Flash TTS — Elo 1.203, $18,31 por milhão de caracteres, lançado em 15 de abril de 2026, 3.512 aparições, intervalo de ±12

Observe o que os intervalos fazem com essa ordenação. O Gemini 3.1 Flash TTS estima 1.203 com um intervalo de ±12, então seu valor verdadeiro fica em algum lugar entre 1.191 e 1.215. O Eleven v4 estima 1.319 com um intervalo de ±19 — aproximadamente de 1.300 a 1.338. As duas faixas não se tocam, e a distância entre elas tem mais de cem pontos de largura. Isso é o mais limpo que um quadro de preferências pode ser.

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard, top of the table. ElevenLabs Eleven v4 is rank 1 at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices, released Sept 2026 at $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276. Google Gemini 3.8 Flash TTS is third at 1,267 with $16.5 per 1M characters. Google Gemini 3.8 Flash-Lite TTS is sixth at 1,241 with $11.0. SpeechifyAI Simba 3.2 is seventh at 1,240 with $6.6. Google Gemini 3.1 Flash TTS is eleventh at 1,203 with an interval of plus or minus 12, 3,512 samples, seven arena voices, released Apr 2026 at $18.3 per 1M characters.

Por que as contagens de amostras importam mais do que as classificações

O Gemini 3.1 Flash TTS tem 3.512 aparições por trás de sua estimativa; o Eleven v4 tem 1.674, porque tem apenas um dia neste quadro. A estimativa de um modelo mais novo carrega mais incerteza por amostra, e o intervalo de ±19 reflete isso. Se você é o tipo de comprador que espera um número se estabilizar, a regra geral é que a ordenação acima da largura do intervalo é a parte sobre a qual você pode agir. Aqui, o ranking sobrevive confortavelmente às suas barras de erro em ambas as direções — à frente do 3.8 Flash TTS e atrás de ninguém nesta comparação.

A arena também conta vozes da arena: oito para o Eleven v4, sete para o Gemini 3.1 Flash TTS. Esse é o número de vozes distintas de fornecedores usadas nos testes cegos, e é uma aproximação grosseira de quanto de um elenco padrão um fornecedor traz. O primeiro lugar do Eleven v4 foi conquistado com oito vozes, o que significa que a vitória não é a de um único narrador sortudo.

As diferenças de capacidade que o Elo não precifica

Os rankings medem preferência, não cobertura de recursos. Quatro diferenças decidem projetos reais e nenhuma delas aparece num Elo.

• Direção de script — O Eleven v4 documenta tags de áudio inline ([laughs], [whispers], [said angrily in French accent]) e prompts de entrega em linguagem natural; a geração 3.1 do Google documenta a escolha de voz e o prompting, mas não uma sintaxe de tag equivalente para direção de performance.

• Criação de voz — a geração Gemini 3.8 adicionou design de voz a partir de uma descrição escrita e replicação de voz a partir de uma amostra de 30 segundos, com marca d'água e metadados de proveniência na saída. O Gemini 3.1 Flash TTS é anterior a isso e vem com um conjunto de vozes predefinidas.

• Clonagem a partir de áudio real — O Instant Voice Cloning do Eleven v4 funciona a partir de dez segundos de áudio, com um nível profissional acima. O caminho de replicação do Google na geração 3.8 exige 30 segundos e acrescenta verificação de consentimento. Critérios diferentes, mecanismos de consentimento diferentes.

• Limite de entrada por requisição — Eleven v documenta 10.000. O Google cobra seus modelos TTS em tokens em vez de caracteres, portanto, não há um limite de caracteres por requisição equivalente para comparar, e os dois medidores não devem ser colocados lado a lado como se fossem.

Esse último ponto é o que confunde as planilhas de compras. A ElevenLabs cota um preço por 1.000 caracteres. O Google cota um preço por milhão de tokens, de entrada e de saída. A Artificial Analysis normaliza ambos em um eixo por milhão de caracteres — é daí que vêm os $80,00 e os $18,31 —, mas a normalização é a conversão da diretoria, não a fatura de nenhum dos fornecedores. Use isso para ordenar, não para prever.

A screenshot of Google's Gemini API documentation page for text-to-speech generation, headed by a banner reading 'Gemini 3.8 Flash is now available'. The page covers single-speaker and multi-speaker TTS, states that the TTS capability differs from the Live API in being designed for exact text recitation with fine-grained control, names the gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts models, notes that TTS models accept text-only input and produce audio-only output, and shows a Python example that attaches a speech_metadata annotation with the style 'cheerful and friendly' and a voice of 'Kore' in generation_config.speech_config.

O que a tabela de preços do Eleven v4 faz a esta comparação

Durante duas semanas, a comparação de preços acima está errada em favor da ElevenLabs, e depois está errada em detrimento dela. Na página de preços da API da ElevenLabs, o Eleven v4 está listado a US$ 0,022 por 1.000 caracteres, contra um preço de tabela informado de US$ 0,08, com a indicação de 72% de desconto até 12 de outubro. O Eleven v4 Turbo está listado a US$ 0,011 contra US$ 0,04. Depois de 12 de outubro, o número promocional desaparece e o valor de tabela de US$ 80,00 por milhão passa a ser a tarifa que você realmente paga.

Faça as contas para um mês de cinco milhões de caracteres. O Eleven v4 custa US$ 110 durante a janela e US$ 400 depois dela. O Gemini 3.1 Flash TTS, com a normalização de US$ 18,31 do painel, fica em cerca de US$ 92 para o mesmo mês — mais barato que a promoção e cerca de quatro vezes mais barato que o preço de tabela. Uma equipe que faz benchmark em setembro e lança em novembro terá tomado a decisão com base em um número que não existe mais.

Onde o roteamento se encaixa, e onde não

Nenhum desses modelos está no catálogo do OrcaRouter. Não há endpoint da ElevenLabs nem endpoint do Google TTS aqui para chamar, e a resposta honesta para "como faço para acessá-los por meio de você" é que você não faz: o Eleven v4 é acessado pela própria API da ElevenLabs, e o Gemini 3.1 Flash TTS, pela do Google. Dizer qualquer outra coisa seria inventar uma integração.

O que uma única chave oferece de vantagem em uma comparação como essa é a própria decisão. Se você está comparando um endpoint de US$ 400 por mês com um de US$ 92 por mês, a resposta depende dos seus próprios scripts, das suas próprias linguagens e dos seus próprios listeners — e obter essa resposta significa chamar ambos pelo mesmo caminho de código e com o mesmo formato de requisição, em vez de montar duas integrações de fornecedores para executar um único teste. A OrcaRouter cobre essa camada: mais de 200 modelos atrás de uma única chave, com os preços de tabela dos provedores repassados com 0% de margem, de modo que uma mudança de preço de um fornecedor é refletida no dia em que entra em vigor, além de failover automático se um upstream degradar no meio da avaliação.

Quem deve escolher qual

Escolha o Eleven v4 quando a voz é o produto. Ele lidera o ranking por 116 pontos, com um intervalo mais limpo do que o modelo abaixo dele, é o único dos dois com uma sintaxe de tag inline documentada para direcionamento de desempenho, e seu limite de clonagem é de dez segundos em vez de trinta. O prêmio é real — quatro vezes o preço normalizado de tabela — e compra o topo do ranking.

Escolha o Gemini 3.1 Flash TTS apenas se já estiver comprometido com ele. É um modelo de geração de pré-visualização com cinco meses de existência, com pontuação mais baixa e preço normalizado mais alto do que o lançamento de setembro do próprio Google, e a única razão para mantê-lo é a inércia numa integração existente. Se tiver essa inércia, migrar dentro da stack Google para o 3.8 Flash TTS rende 64 pontos Elo e um preço normalizado mais baixo sem mudar de fornecedor — o que é um caso raro em que a atualização também é a opção mais barata.

Para todos os outros, a questão em aberto é Eleven v4 contra Gemini 3.8 Flash TTS, e a resposta é uma troca genuína, não um ranking: 52 pontos de Elo e a sintaxe de tags contra cerca de um quinto do custo por caractere. Rode os dois com os mesmos scripts depois de 12 de outubro, quando a promoção da ElevenLabs tiver acabado e a diferença de preço for a que você realmente vai pagar.