Um cartão de destaque para 'Eleven v4 lidera a Voice Arena': uma tabela de classificação com ElevenLabs Eleven v4 em 1º lugar, com Elo 1.319, Cartesia Sonic 3.6 em 2º lugar, com Elo 1.276, Google Gemini 3.8 Flash TTS em 3º lugar, com Elo 1.267, ElevenLabs Eleven v3 em 18º lugar, com Elo 1.169, e uma faixa com os dizeres '72% de desconto até 12 de outubro'. Rodapé: 'Fornecedor Voice Arena, segundo a Artificial Analysis, set. de 2026.' O logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

Eleven v4 Lidera a Voice Arena: O Que o Novo Carro-Chefe da ElevenLabs Realmente Conquistou

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

ElevenLabs Eleven v4 chegou em 28 de setembro e foi direto para o topo da Provider Voice Arena da Artificial Analysis, com um Elo de 1.319 — 43 pontos à frente de Cartesia Sonic 3.6, com 1.276, e 52 à frente de Google Gemini 3.8 Flash TTS, com 1.267. É também, a US$ 80,00 por milhão de caracteres nesse mesmo ranking, o modelo mais caro entre os dez primeiros. E na segunda arena — aquela construída a partir de vozes clonadas, e não do conjunto de vozes de cada fornecedor — ele não vence de forma alguma: termina em segundo, atrás de um modelo que custa um quarto disso. Ambas as coisas são verdadeiras, e a parte útil deste lançamento é descobrir sob qual delas se enquadra o seu caso de uso.

O que realmente foi lançado em 28 de setembro

A ElevenLabs colocou dois modelos em disponibilidade geral, não um. ElevenLabs Eleven v4 é o modelo de síntese carro-chefe — a empresa o chama de seu mais emotivo, e sua documentação define o limite de entrada em 10.000 caracteres por solicitação e a cobertura de idiomas em mais de 90. ElevenLabs Eleven v4 Turbo é o irmão de baixa latência: os mesmos mais de 90 idiomas, um limite de 10.000 caracteres e suporte para as tags de áudio em linha que permitem escrever uma direção de entrega no próprio roteiro — uma risada, um sussurro, um zumbido na linha. Ambos estão ativos nas superfícies de agente, criação e API da empresa no primeiro dia, o que é um lançamento mais rápido do que o da geração v3.

A página de anúncio é onde está a lista de recursos e, notavelmente, não a de preços. A ElevenLabs descreve uma nova arquitetura, melhor tratamento de tom, ritmo e caráter, diálogo multi-falante mais confiável com identidade de falante estável, entrada de fonemas IPA melhorada e clones de voz instantâneos criados a partir de dez segundos de áudio, juntamente com o nível existente de clone profissional. O único número nela é uma afirmação sobre ouvintes: o fornecedor diz que comparações cegas preferiram o v4 em aproximadamente três quartos dos casos. Esse é um número do fornecedor, não reproduzido, e deve ser lido ao lado dos números do painel abaixo, em vez de no lugar deles.

Onde o preço realmente está — a página de preços da API — é o documento mais relevante, e é abordado mais abaixo. Resumindo: este lançamento não é um aumento de preço.

Duas placas, duas respostas diferentes

A Artificial Analysis executa duas arenas de fala e elas não são variações uma da outra. O Provider Voice faz com que os ouvintes comparem as próprias vozes de cada fornecedor. O Controlled Voice clona as mesmas oito vozes — quatro dos EUA, quatro do Reino Unido — para cada participante, de modo que o locutor é mantido constante e apenas o modelo varia. Um modelo com um ótimo conjunto de vozes padrão pode vencer a primeira e perder a segunda. O Eleven v4 faz exatamente isso.

Provider Voice, Eleven v4 — classificação 1, Elo 1.319, US$ 80,00 por milhão de caracteres, 1.674 amostras, oito vozes de arena, setembro de 2026

• Voz do Provedor, Cartesia Sonic 3.6 — classificação 2, Elo 1.276, $49,00

• Voz do provedor, Google Gemini 3.8 Flash TTS — posição 3, Elo 1.267, US$ 16,50

• Voz do provedor, o antigo carro-chefe ElevenLabs Eleven v3 — posição 18, Elo 1.169, US$ 100,00

• Voz controlada, Alibaba Qwen-Audio-3.1-TTS-Plus — classificação 1, Elo 1.178

Controlled Voice, Eleven v4 — posição 2, Elo 1.157, US$ 80,00

• Controlled Voice, Cartesia Sonic 3.6 — posição 4, Elo 1.138

• Voz Controlada, ElevenLabs Eleven v3 — classificação 7, Elo 1.073

• Voz Controlada, Google Gemini 3.8 Flash TTS — classificação 13, Elo 1.048

• Melhor entrada de pesos abertos no Provider Voice — Breeze TTS 2, Elo 1.206, US$ 34,00

A single-column scoreboard card for ElevenLabs Eleven v4 with six rows: 'Provider Voice rank: 1 (Elo 1,319)', 'Controlled Voice rank: 2 (Elo 1,157)', 'Board price: $80.00 per 1M characters', 'Rate card: $0.022 per 1K characters until Oct 12', 'Languages and cap: 90-plus, 10,000 characters', 'Latency: not stated for v4 itself'. Footer: 'Elo and board prices per Artificial Analysis; rate card and specs vendor-documented.'

O salto de linhagem é o grande destaque para quem já usa a ElevenLabs: em comparação com seu próprio antecessor no mesmo ranking, o Eleven v4 ganha 150 pontos Elo em Provider Voice e 84 em Controlled Voice. Trata-se de um avanço geracional, não de um ajuste fino, e a melhoria é maior no ranking em que o fornecedor escolhe as vozes — o que é a forma honesta de dizer que seu novo elenco padrão é uma parte real do ganho.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, 1,674 samples and a -19/19 confidence interval, Cartesia Sonic 3.6 second at Elo 1,276 and $49.0, Google Gemini 3.8 Flash TTS third at Elo 1,267 and $16.5, and ElevenLabs Eleven v3 eighteenth at Elo 1,169 and $100.0, under columns for samples, arena voices, release month and API pricing.

O quadro de pronúncia que não conseguimos quantificar

Artificial Analysis tem, de facto, uma secção de Pronunciation Robustness, e vale a pena descrevê-la devidamente, porque o resumo do ranking que anda a circular descreve o Eleven v4 como estando no topo. O painel mede a percentagem de trechos destacados que os avaliadores consideraram pronunciados corretamente, com até três avaliadores por clipe, e os prompts são enviados exatamente como escritos — sem expansão de números, sem normalização de texto. Está dividido em subcategorias, e o objetivo do design é que um modelo que reescreva silenciosamente "Dr." ou "$4.50" antes de falar tenha, de propósito, uma pontuação baixa.

O que o ranking não publica, na visualização que conseguimos ler, é uma pontuação numérica citável por modelo. Portanto, não há número a citar para o Eleven v4 ali, e o Elo de 1.319 pertence à preferência da arena — o quanto os ouvintes gostaram da voz —, e não à precisão de pronúncia. Se você vê as duas coisas confundidas, essa é a confusão. A afirmação defensável deste lançamento é a que vem com números: primeiro em Provider Voice com 1.319, segundo em Controlled Voice com 1.157.

O desconto de lançamento é a verdadeira notícia para a sua fatura

A ElevenLabs reajustou os preços dos novos modelos ao mesmo tempo em que os lançou, e o desconto é grande o bastante para, por si só, mudar uma decisão de compra. Na página de preços da API, o Eleven v4 aparece a US$ 0,022 por mil caracteres, em comparação com um preço de tabela informado de US$ 0,08 — uma redução de 72% — e o Eleven v4 Turbo aparece a US$ 0,011 contra US$ 0,04. Ambos têm a mesma janela: a promoção vai até 12 de outubro. Depois disso, os números voltam ao que eram, e o preço revertido do v4 é o dobro do que o próprio v3 da ElevenLabs custa hoje, a US$ 0,08. Planeje com base no valor pós-promoção, não no promocional.

A nova precificação também altera a posição do v4 em relação ao mercado com base por caractere, o que a normalização da arena já mostra a US$ 80,00 por milhão. O Sonic 3.6 está a US$ 49,00 nessa comparação, o Breeze TTS 2, a US$ 34,00, o Qwen-Audio-3.0-TTS-Plus, a US$ 19,30, e o Gemini 3.8 Flash TTS, a US$ 16,50. Na tarifa promocional, o Eleven v4, a US$ 22 por milhão, tem preço claramente inferior ao Sonic 3.6. Na tarifa de tabela, é a voz mais cara do quadro, por uma ampla margem. Quem estiver montando um orçamento para o 1º trimestre deve olhar para o segundo número.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v4 row at $0.022 per 1K characters with a struck-through $0.08 and a '72% off until Oct 12' badge, and the Eleven v4 Turbo row at $0.011 with a struck-through $0.04, alongside the v3 row at $0.08 and the Eleven v3 Conversational row at $0.04.

Um mês detalhado torna a diferença concreta. Com cinco milhões de caracteres — um produto de porte médio que lê cerca de cem horas de fala —, o Eleven v4 durante a janela custa US$ 110. Com o valor revertido de US$ 0,08, custa US$ 400. O Sonic 3.6 custa US$ 245. O Gemini 3.8 Flash TTS custa US$ 82,50. O mesmo mês na própria v3 da ElevenLabs também custa US$ 400, o que é o fato curioso por trás deste lançamento: nas próximas duas semanas, o novo carro-chefe é mais barato do que o modelo que substitui, e no dia em que a janela se fecha ele deixa de ser mais barato e passa a ser apenas melhor.

A afirmação de latência é declarada pelo fornecedor e depende do nível.

A ElevenLabs publica números de latência por nível, não por família de modelos, e são medições feitas pela própria empresa, não algo independente. O Eleven v4 Turbo é citado com aproximadamente 100 ms de inferência mediana e cerca de 150 ms de tempo mediano até a primeira fala, medidos em setembro de 2026. O Eleven v3 Conversational é citado com cerca de 280 ms, e os níveis mais antigos Flash e Turbo com cerca de 75 ms. A documentação não publica um número equivalente para o próprio Eleven v4, que é o nível que você desejaria se estivesse construindo um agente em tempo real e lendo uma ficha técnica em vez de testar.

A Cartesia afirma latência inferior a 90 ms para o Sonic e o descreve como classificado em primeiro lugar em naturalidade, com clonagem de voz a partir de dez segundos de áudio, dicionários de pronúncia personalizados e um conjunto de conformidade que abrange HIPAA, SOC 2 Type 2, GDPR e PCI. Essas são as próprias alegações do fornecedor em sua própria página de produto — a mesma categoria de evidência que os números de faixa de latência da ElevenLabs, e não intercambiáveis com o Elo da arena. O único ponto em que os dois fornecedores são diretamente comparáveis é nos rankings.

Onde isso deixa você, e como experimentar

Se você está escolhendo uma voz para um produto onde o elenco padrão é o que seus usuários ouvem, o resultado do Provider Voice é o que importa e o Eleven v4 acabou de conquistá-lo, com um desconto válido por duas semanas. Se você está clonando a voz de uma pessoa específica e todos os modelos candidatos estão sendo solicitados a reproduzir os mesmos oito locutores, o ranking Controlled Voice é o que importa e o Eleven v4 está em segundo lugar — 21 Elo atrás do líder e, a preço de tabela, mais de quatro vezes o custo por caractere. Nenhum dos resultados está errado; eles são respostas a perguntas diferentes, e a segunda é a pergunta que a maioria dos trabalhos de clonagem de voz em produção realmente está fazendo.

A OrcaRouter não aloja a ElevenLabs, a Cartesia nem qualquer um dos outros fornecedores nestes painéis, por isso não há aqui nada para chamar através de nós e não vamos insinuar o contrário. O que oferecemos é a infraestrutura envolvente caso a sua stack de voz acabe por abranger vários fornecedores: uma única chave de API para mais de 200 modelos, com os preços de tabela dos fornecedores repassados a 0% de margem, para que um corte de preço de um fornecedor — incluindo uma janela promocional como esta — fique ativo do nosso lado no próprio dia, e não no próximo ciclo de faturação. Quando um percurso de voz é crítico para a produção, o failover automático muda para um upstream saudável quando um fica degradado, que é a forma prática de testar um endpoint totalmente novo sem apostar um lançamento nele.

A data para anotar na agenda é 12 de outubro. É quando o Eleven v4 deixa de ser a voz boa mais barata do ranking e se torna a mais cara, e qualquer comparação escrita esta semana que cite US$ 22 por milhão sem mencionar isso é uma comparação que você deve refazer em três semanas.