
Eleven v4 Lidera a Voice Arena: O Que o Novo Carro-Chefe da ElevenLabs Realmente Conquistou
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 983 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
ElevenLabs Eleven v4 chegou em 28 de setembro e foi direto para o topo da Provider Voice Arena da Artificial Analysis, com um Elo de 1.319 — 43 pontos à frente de Cartesia Sonic 3.6, com 1.276, e 52 à frente de Google Gemini 3.8 Flash TTS, com 1.267. É também, a US$ 80,00 por milhão de caracteres nesse mesmo ranking, o modelo mais caro entre os dez primeiros. E na segunda arena — aquela construída a partir de vozes clonadas, e não do conjunto de vozes de cada fornecedor — ele não vence de forma alguma: termina em segundo, atrás de um modelo que custa um quarto disso. Ambas as coisas são verdadeiras, e a parte útil deste lançamento é descobrir sob qual delas se enquadra o seu caso de uso.
O que realmente foi lançado em 28 de setembro
A ElevenLabs colocou dois modelos em disponibilidade geral, não um. ElevenLabs Eleven v4 é o modelo de síntese carro-chefe — a empresa o chama de seu mais emotivo, e sua documentação define o limite de entrada em 10.000 caracteres por solicitação e a cobertura de idiomas em mais de 90. ElevenLabs Eleven v4 Turbo é o irmão de baixa latência: os mesmos mais de 90 idiomas, um limite de 10.000 caracteres e suporte para as tags de áudio em linha que permitem escrever uma direção de entrega no próprio roteiro — uma risada, um sussurro, um zumbido na linha. Ambos estão ativos nas superfícies de agente, criação e API da empresa no primeiro dia, o que é um lançamento mais rápido do que o da geração v3.
A página de anúncio é onde está a lista de recursos e, notavelmente, não a de preços. A ElevenLabs descreve uma nova arquitetura, melhor tratamento de tom, ritmo e caráter, diálogo multi-falante mais confiável com identidade de falante estável, entrada de fonemas IPA melhorada e clones de voz instantâneos criados a partir de dez segundos de áudio, juntamente com o nível existente de clone profissional. O único número nela é uma afirmação sobre ouvintes: o fornecedor diz que comparações cegas preferiram o v4 em aproximadamente três quartos dos casos. Esse é um número do fornecedor, não reproduzido, e deve ser lido ao lado dos números do painel abaixo, em vez de no lugar deles.
Onde o preço realmente está — a página de preços da API — é o documento mais relevante, e é abordado mais abaixo. Resumindo: este lançamento não é um aumento de preço.
Duas placas, duas respostas diferentes
A Artificial Analysis executa duas arenas de fala e elas não são variações uma da outra. O Provider Voice faz com que os ouvintes comparem as próprias vozes de cada fornecedor. O Controlled Voice clona as mesmas oito vozes — quatro dos EUA, quatro do Reino Unido — para cada participante, de modo que o locutor é mantido constante e apenas o modelo varia. Um modelo com um ótimo conjunto de vozes padrão pode vencer a primeira e perder a segunda. O Eleven v4 faz exatamente isso.
Provider Voice, Eleven v4 — classificação 1, Elo 1.319, US$ 80,00 por milhão de caracteres, 1.674 amostras, oito vozes de arena, setembro de 2026
• Voz do Provedor, Cartesia Sonic 3.6 — classificação 2, Elo 1.276, $49,00
• Voz do provedor, Google Gemini 3.8 Flash TTS — posição 3, Elo 1.267, US$ 16,50
• Voz do provedor, o antigo carro-chefe ElevenLabs Eleven v3 — posição 18, Elo 1.169, US$ 100,00
• Voz controlada, Alibaba Qwen-Audio-3.1-TTS-Plus — classificação 1, Elo 1.178
Controlled Voice, Eleven v4 — posição 2, Elo 1.157, US$ 80,00
• Controlled Voice, Cartesia Sonic 3.6 — posição 4, Elo 1.138
• Voz Controlada, ElevenLabs Eleven v3 — classificação 7, Elo 1.073
• Voz Controlada, Google Gemini 3.8 Flash TTS — classificação 13, Elo 1.048
• Melhor entrada de pesos abertos no Provider Voice — Breeze TTS 2, Elo 1.206, US$ 34,00

O salto de linhagem é o grande destaque para quem já usa a ElevenLabs: em comparação com seu próprio antecessor no mesmo ranking, o Eleven v4 ganha 150 pontos Elo em Provider Voice e 84 em Controlled Voice. Trata-se de um avanço geracional, não de um ajuste fino, e a melhoria é maior no ranking em que o fornecedor escolhe as vozes — o que é a forma honesta de dizer que seu novo elenco padrão é uma parte real do ganho.

O quadro de pronúncia que não conseguimos quantificar
Artificial Analysis tem, de facto, uma secção de Pronunciation Robustness, e vale a pena descrevê-la devidamente, porque o resumo do ranking que anda a circular descreve o Eleven v4 como estando no topo. O painel mede a percentagem de trechos destacados que os avaliadores consideraram pronunciados corretamente, com até três avaliadores por clipe, e os prompts são enviados exatamente como escritos — sem expansão de números, sem normalização de texto. Está dividido em subcategorias, e o objetivo do design é que um modelo que reescreva silenciosamente "Dr." ou "$4.50" antes de falar tenha, de propósito, uma pontuação baixa.
O que o ranking não publica, na visualização que conseguimos ler, é uma pontuação numérica citável por modelo. Portanto, não há número a citar para o Eleven v4 ali, e o Elo de 1.319 pertence à preferência da arena — o quanto os ouvintes gostaram da voz —, e não à precisão de pronúncia. Se você vê as duas coisas confundidas, essa é a confusão. A afirmação defensável deste lançamento é a que vem com números: primeiro em Provider Voice com 1.319, segundo em Controlled Voice com 1.157.
O desconto de lançamento é a verdadeira notícia para a sua fatura
A ElevenLabs reajustou os preços dos novos modelos ao mesmo tempo em que os lançou, e o desconto é grande o bastante para, por si só, mudar uma decisão de compra. Na página de preços da API, o Eleven v4 aparece a US$ 0,022 por mil caracteres, em comparação com um preço de tabela informado de US$ 0,08 — uma redução de 72% — e o Eleven v4 Turbo aparece a US$ 0,011 contra US$ 0,04. Ambos têm a mesma janela: a promoção vai até 12 de outubro. Depois disso, os números voltam ao que eram, e o preço revertido do v4 é o dobro do que o próprio v3 da ElevenLabs custa hoje, a US$ 0,08. Planeje com base no valor pós-promoção, não no promocional.
A nova precificação também altera a posição do v4 em relação ao mercado com base por caractere, o que a normalização da arena já mostra a US$ 80,00 por milhão. O Sonic 3.6 está a US$ 49,00 nessa comparação, o Breeze TTS 2, a US$ 34,00, o Qwen-Audio-3.0-TTS-Plus, a US$ 19,30, e o Gemini 3.8 Flash TTS, a US$ 16,50. Na tarifa promocional, o Eleven v4, a US$ 22 por milhão, tem preço claramente inferior ao Sonic 3.6. Na tarifa de tabela, é a voz mais cara do quadro, por uma ampla margem. Quem estiver montando um orçamento para o 1º trimestre deve olhar para o segundo número.

Um mês detalhado torna a diferença concreta. Com cinco milhões de caracteres — um produto de porte médio que lê cerca de cem horas de fala —, o Eleven v4 durante a janela custa US$ 110. Com o valor revertido de US$ 0,08, custa US$ 400. O Sonic 3.6 custa US$ 245. O Gemini 3.8 Flash TTS custa US$ 82,50. O mesmo mês na própria v3 da ElevenLabs também custa US$ 400, o que é o fato curioso por trás deste lançamento: nas próximas duas semanas, o novo carro-chefe é mais barato do que o modelo que substitui, e no dia em que a janela se fecha ele deixa de ser mais barato e passa a ser apenas melhor.
A afirmação de latência é declarada pelo fornecedor e depende do nível.
A ElevenLabs publica números de latência por nível, não por família de modelos, e são medições feitas pela própria empresa, não algo independente. O Eleven v4 Turbo é citado com aproximadamente 100 ms de inferência mediana e cerca de 150 ms de tempo mediano até a primeira fala, medidos em setembro de 2026. O Eleven v3 Conversational é citado com cerca de 280 ms, e os níveis mais antigos Flash e Turbo com cerca de 75 ms. A documentação não publica um número equivalente para o próprio Eleven v4, que é o nível que você desejaria se estivesse construindo um agente em tempo real e lendo uma ficha técnica em vez de testar.
A Cartesia afirma latência inferior a 90 ms para o Sonic e o descreve como classificado em primeiro lugar em naturalidade, com clonagem de voz a partir de dez segundos de áudio, dicionários de pronúncia personalizados e um conjunto de conformidade que abrange HIPAA, SOC 2 Type 2, GDPR e PCI. Essas são as próprias alegações do fornecedor em sua própria página de produto — a mesma categoria de evidência que os números de faixa de latência da ElevenLabs, e não intercambiáveis com o Elo da arena. O único ponto em que os dois fornecedores são diretamente comparáveis é nos rankings.
Onde isso deixa você, e como experimentar
Se você está escolhendo uma voz para um produto onde o elenco padrão é o que seus usuários ouvem, o resultado do Provider Voice é o que importa e o Eleven v4 acabou de conquistá-lo, com um desconto válido por duas semanas. Se você está clonando a voz de uma pessoa específica e todos os modelos candidatos estão sendo solicitados a reproduzir os mesmos oito locutores, o ranking Controlled Voice é o que importa e o Eleven v4 está em segundo lugar — 21 Elo atrás do líder e, a preço de tabela, mais de quatro vezes o custo por caractere. Nenhum dos resultados está errado; eles são respostas a perguntas diferentes, e a segunda é a pergunta que a maioria dos trabalhos de clonagem de voz em produção realmente está fazendo.
A OrcaRouter não aloja a ElevenLabs, a Cartesia nem qualquer um dos outros fornecedores nestes painéis, por isso não há aqui nada para chamar através de nós e não vamos insinuar o contrário. O que oferecemos é a infraestrutura envolvente caso a sua stack de voz acabe por abranger vários fornecedores: uma única chave de API para mais de 200 modelos, com os preços de tabela dos fornecedores repassados a 0% de margem, para que um corte de preço de um fornecedor — incluindo uma janela promocional como esta — fique ativo do nosso lado no próprio dia, e não no próximo ciclo de faturação. Quando um percurso de voz é crítico para a produção, o failover automático muda para um upstream saudável quando um fica degradado, que é a forma prática de testar um endpoint totalmente novo sem apostar um lançamento nele.
A data para anotar na agenda é 12 de outubro. É quando o Eleven v4 deixa de ser a voz boa mais barata do ranking e se torna a mais cara, e qualquer comparação escrita esta semana que cite US$ 22 por milhão sem mencionar isso é uma comparação que você deve refazer em três semanas.
