
Eleven v4 vs. Gemini 3.1 Flash TTS: uma diferença de 116 pontos, e o modelo mais barato do Google
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 197 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Se você procurar pela voz do Google hoje, vai acabar na errada. Google Gemini 3.1 Flash TTS está listado na 11ª posição no Provider Voice Arena da Artificial Analysis, com um Elo de 1.203 em 3.512 aparições, a US$ 18,31 por milhão de caracteres. ElevenLabs Eleven v4, lançado em 28 de setembro de 2026, ocupa o 1º lugar, com um Elo de 1.319 em 1.674 aparições, a US$ 80,00 por milhão. Isso parece uma diferença de 116 pontos contra um desafiante mais barato — até você notar que o próprio Gemini 3.8 Flash TTS do Google ocupa o terceiro lugar no mesmo ranking, com 1.267 e um preço normalizado mais baixo, de US$ 16,49. A disputa real não é a que o confronto da manchete sugere, e o motivo é uma data de lançamento.
Um deles é dezoito meses mais novo do que parece.
O Gemini 3.1 Flash TTS tem uma data de lançamento de 15 de abril de 2026 no quadro. O Eleven v4 tem 28 de setembro de 2026. Isso é cinco meses e meio, o que não é uma geração em síntese de fala, mas é tempo suficiente para que o Google já tenha lançado um sucessor: Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS chegaram à disponibilidade geral em 23 de setembro de 2026, cinco dias antes do Eleven v4, e ambos estão classificados acima do 3.1 no mesmo quadro. Gemini 3.8 Flash-Lite TTS fica em sexto lugar com 1.241 e $11,03 por milhão.

Então a comparação honesta tem três pontos, não dois, e a ordenação por preço é a parte interessante:
• 1º lugar, ElevenLabs Eleven v4 — Elo 1.319, US$ 80,00 por milhão de caracteres, 1.674 aparições, intervalo de ±19
• 3º lugar, Google Gemini 3.8 Flash TTS — Elo 1.267, US$ 16,49 por milhão de caracteres, lançado em 23 de setembro de 2026
• 6º lugar, Google Gemini 3.8 Flash-Lite TTS — Elo 1.241, US$ 11,03 por milhão de caracteres, lançado em 23 de setembro de 2026
• Classificação 11, Google Gemini 3.1 Flash TTS — Elo 1.203, $18,31 por milhão de caracteres, lançado em 15 de abril de 2026, 3.512 aparições, intervalo de ±12
Observe o que os intervalos fazem com essa ordenação. O Gemini 3.1 Flash TTS estima 1.203 com um intervalo de ±12, então seu valor verdadeiro fica em algum lugar entre 1.191 e 1.215. O Eleven v4 estima 1.319 com um intervalo de ±19 — aproximadamente de 1.300 a 1.338. As duas faixas não se tocam, e a distância entre elas tem mais de cem pontos de largura. Isso é o mais limpo que um quadro de preferências pode ser.

Por que as contagens de amostras importam mais do que as classificações
O Gemini 3.1 Flash TTS tem 3.512 aparições por trás de sua estimativa; o Eleven v4 tem 1.674, porque tem apenas um dia neste quadro. A estimativa de um modelo mais novo carrega mais incerteza por amostra, e o intervalo de ±19 reflete isso. Se você é o tipo de comprador que espera um número se estabilizar, a regra geral é que a ordenação acima da largura do intervalo é a parte sobre a qual você pode agir. Aqui, o ranking sobrevive confortavelmente às suas barras de erro em ambas as direções — à frente do 3.8 Flash TTS e atrás de ninguém nesta comparação.
A arena também conta vozes da arena: oito para o Eleven v4, sete para o Gemini 3.1 Flash TTS. Esse é o número de vozes distintas de fornecedores usadas nos testes cegos, e é uma aproximação grosseira de quanto de um elenco padrão um fornecedor traz. O primeiro lugar do Eleven v4 foi conquistado com oito vozes, o que significa que a vitória não é a de um único narrador sortudo.
As diferenças de capacidade que o Elo não precifica
Os rankings medem preferência, não cobertura de recursos. Quatro diferenças decidem projetos reais e nenhuma delas aparece num Elo.
• Direção de script — O Eleven v4 documenta tags de áudio inline ([laughs], [whispers], [said angrily in French accent]) e prompts de entrega em linguagem natural; a geração 3.1 do Google documenta a escolha de voz e o prompting, mas não uma sintaxe de tag equivalente para direção de performance.
• Criação de voz — a geração Gemini 3.8 adicionou design de voz a partir de uma descrição escrita e replicação de voz a partir de uma amostra de 30 segundos, com marca d'água e metadados de proveniência na saída. O Gemini 3.1 Flash TTS é anterior a isso e vem com um conjunto de vozes predefinidas.
• Clonagem a partir de áudio real — O Instant Voice Cloning do Eleven v4 funciona a partir de dez segundos de áudio, com um nível profissional acima. O caminho de replicação do Google na geração 3.8 exige 30 segundos e acrescenta verificação de consentimento. Critérios diferentes, mecanismos de consentimento diferentes.
• Limite de entrada por requisição — Eleven v documenta 10.000. O Google cobra seus modelos TTS em tokens em vez de caracteres, portanto, não há um limite de caracteres por requisição equivalente para comparar, e os dois medidores não devem ser colocados lado a lado como se fossem.
Esse último ponto é o que confunde as planilhas de compras. A ElevenLabs cota um preço por 1.000 caracteres. O Google cota um preço por milhão de tokens, de entrada e de saída. A Artificial Analysis normaliza ambos em um eixo por milhão de caracteres — é daí que vêm os $80,00 e os $18,31 —, mas a normalização é a conversão da diretoria, não a fatura de nenhum dos fornecedores. Use isso para ordenar, não para prever.

O que a tabela de preços do Eleven v4 faz a esta comparação
Durante duas semanas, a comparação de preços acima está errada em favor da ElevenLabs, e depois está errada em detrimento dela. Na página de preços da API da ElevenLabs, o Eleven v4 está listado a US$ 0,022 por 1.000 caracteres, contra um preço de tabela informado de US$ 0,08, com a indicação de 72% de desconto até 12 de outubro. O Eleven v4 Turbo está listado a US$ 0,011 contra US$ 0,04. Depois de 12 de outubro, o número promocional desaparece e o valor de tabela de US$ 80,00 por milhão passa a ser a tarifa que você realmente paga.
Faça as contas para um mês de cinco milhões de caracteres. O Eleven v4 custa US$ 110 durante a janela e US$ 400 depois dela. O Gemini 3.1 Flash TTS, com a normalização de US$ 18,31 do painel, fica em cerca de US$ 92 para o mesmo mês — mais barato que a promoção e cerca de quatro vezes mais barato que o preço de tabela. Uma equipe que faz benchmark em setembro e lança em novembro terá tomado a decisão com base em um número que não existe mais.
Onde o roteamento se encaixa, e onde não
Nenhum desses modelos está no catálogo do OrcaRouter. Não há endpoint da ElevenLabs nem endpoint do Google TTS aqui para chamar, e a resposta honesta para "como faço para acessá-los por meio de você" é que você não faz: o Eleven v4 é acessado pela própria API da ElevenLabs, e o Gemini 3.1 Flash TTS, pela do Google. Dizer qualquer outra coisa seria inventar uma integração.
O que uma única chave oferece de vantagem em uma comparação como essa é a própria decisão. Se você está comparando um endpoint de US$ 400 por mês com um de US$ 92 por mês, a resposta depende dos seus próprios scripts, das suas próprias linguagens e dos seus próprios listeners — e obter essa resposta significa chamar ambos pelo mesmo caminho de código e com o mesmo formato de requisição, em vez de montar duas integrações de fornecedores para executar um único teste. A OrcaRouter cobre essa camada: mais de 200 modelos atrás de uma única chave, com os preços de tabela dos provedores repassados com 0% de margem, de modo que uma mudança de preço de um fornecedor é refletida no dia em que entra em vigor, além de failover automático se um upstream degradar no meio da avaliação.
Quem deve escolher qual
Escolha o Eleven v4 quando a voz é o produto. Ele lidera o ranking por 116 pontos, com um intervalo mais limpo do que o modelo abaixo dele, é o único dos dois com uma sintaxe de tag inline documentada para direcionamento de desempenho, e seu limite de clonagem é de dez segundos em vez de trinta. O prêmio é real — quatro vezes o preço normalizado de tabela — e compra o topo do ranking.
Escolha o Gemini 3.1 Flash TTS apenas se já estiver comprometido com ele. É um modelo de geração de pré-visualização com cinco meses de existência, com pontuação mais baixa e preço normalizado mais alto do que o lançamento de setembro do próprio Google, e a única razão para mantê-lo é a inércia numa integração existente. Se tiver essa inércia, migrar dentro da stack Google para o 3.8 Flash TTS rende 64 pontos Elo e um preço normalizado mais baixo sem mudar de fornecedor — o que é um caso raro em que a atualização também é a opção mais barata.
Para todos os outros, a questão em aberto é Eleven v4 contra Gemini 3.8 Flash TTS, e a resposta é uma troca genuína, não um ranking: 52 pontos de Elo e a sintaxe de tags contra cerca de um quinto do custo por caractere. Rode os dois com os mesmos scripts depois de 12 de outubro, quando a promoção da ElevenLabs tiver acabado e a diferença de preço for a que você realmente vai pagar.
