
HeyGen Voice vs ElevenLabs: Um novo nº 1 em vozes clonadas, e o fornecedor que ainda domina o ranking
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O HeyGen Voice assumiu a primeira posição na arena Controlled Voice da Artificial Analysis em 9 de outubro de 2026, com 1.202 de Elo, e o modelo que desalojou desse lugar era um nível da ElevenLabs: o Eleven v4 Turbo, agora em terceiro com 1.167. Essa é a manchete, e é exata. Também é uma afirmação muito menor do que soa, porque os modelos do mesmo fornecedor ocupam o segundo, o terceiro, o quarto, o décimo primeiro e o décimo quinto lugares nesse mesmo ranking controlado, e o Eleven v4 Turbo continua em primeiro na arena Provider Voices, muito maior, com 1.328 de Elo — 126 pontos à frente do HeyGen Voice, que não aparece nessa classificação de forma alguma. Um motor venceu um ranking. O fornecedor ainda domina a categoria.
O mesmo fornecedor agora ocupa cinco dos quinze primeiros lugares.
O quadro controlado mantém a voz constante — oito vozes de referência clonadas, quatro dos EUA e quatro do Reino Unido —, de modo que cada entrada é avaliada com base em como o mecanismo lida com uma voz que não pôde escolher. Esse quadro agora mostra: HeyGen Voice 1.202, Qwen-Audio-3.1-TTS-Plus 1.186, Eleven v4 Turbo 1.167, Eleven v4 1.160, Sonic 3.6 1.143, Realtime TTS-2 1.143. Mais abaixo, o Eleven v3 está em 1.072 e o v3 Conversational em 1.056.
Cinco das quinze primeiras entradas nesse campo têm o mesmo nome de fornecedor. O rival com o melhor modelo absoluto do ranking tem cinco bons, ao longo de duas gerações, em dois pontos de preço, além de uma variante conversacional que é um produto totalmente diferente. É assim que um incumbente se parece visto de dentro de uma liderança de ranking, e é por isso que uma estreia em #1 vale uma manchete, e não um plano de migração.
O que os modelos da ElevenLabs realmente são
O Eleven v4 Turbo é descrito na documentação do próprio fornecedor como o modelo de última geração para síntese de fala em tempo real, recomendado para agentes de suporte, assistentes de IA e personagens interativos, acessível por meio do websocket Text to Dialogue sob o identificador de modelo eleven_v4_turbo. A ElevenLabs afirma uma latência mediana de inferência de aproximadamente 100 ms — valor informado pelo fornecedor, e a nota de rodapé na mesma página exclui a latência de aplicação e de rede desse número, portanto é um número do mecanismo do modelo, não uma promessa de ida e volta.
A cobertura de idiomas da família v4 é, de longe, a mais ampla desta comparação: mais de 90 idiomas, do africâner e do árabe ao cantonês, hindi, japonês, mandarim e zulu. A própria documentação da HeyGen lista mais de 300 vozes predefinidas em "dezenas de idiomas", sem publicar uma contagem, o que é uma forma diferente de descrever um catálogo e não é diretamente comparável a um número de idiomas.
Depois há a parte que não aparece em ranking nenhum: a biblioteca de vozes, os controles de estabilidade e similaridade, o ajuste por requisição e uma década de superfície de integração. Uma comparação de modelos não é uma comparação de plataformas, e a entrada da ElevenLabs compete nas duas.

O placar
• Elo de Voz Controlada — HeyGen Voice: 1,202 (#1). Eleven v4 Turbo: 1,167 (#3). Eleven v4: 1,160 (#4).
• Elo das Vozes dos Provedores — Eleven v4 Turbo: 1.328 (nº 1 de 96). HeyGen Voice: não classificado.
• Preço publicado por 1M de caracteres — Eleven v4 Turbo: $40,00. Eleven v4: $80,00. HeyGen: $80,00 com base na conversão da própria arena dos preços da HeyGen; a própria HeyGen não publica nenhuma tarifa de voz.
• Latência declarada — Eleven v4 Turbo: ~100 ms de inferência mediana, excluindo latência de aplicação e de rede (informado pelo fornecedor). HeyGen Voice: nenhum valor publicado.
• Cobertura de idiomas — Família ElevenLabs v4: mais de 90 idiomas (documentação do fornecedor). HeyGen Voice: "dezenas de idiomas", contagem não publicada.
• Modelos no top quinze controlado — ElevenLabs: cinco níveis. HeyGen: um.

A diferença entre as duas placas é o número interessante.
Eleven v4 Turbo está 161 pontos à frente do HeyGen Voice no ranking Provider Voices e 35 pontos atrás dele no ranking controlado. Ambos os números vêm do mesmo site, do mesmo método de ouvintes cegos e do mesmo período. O que os separa é a voz.
No painel de fornecedores, cada fornecedor disponibiliza as suas próprias vozes nativas, pelo que uma empresa que passou anos a construir e a fazer curadoria de uma biblioteca de vozes pode entrar em campo com as suas melhores. No painel controlado, essa vantagem desaparece — o motor tem de renderizar uma voz clonada que não selecionou. A oscilação de 196 pontos entre os dois resultados é, na prática, uma medida de quanto da posição da ElevenLabs vem das vozes, e não do motor. É uma fração grande. Também não é zero: 1.167 ainda é o terceiro entre quarenta e dois.
Para um comprador, isso se traduz em uma pergunta concreta. Se você está escolhendo uma voz da biblioteca de um fornecedor, o quadro de provedores é o seu quadro, e a posição da ElevenLabs ali é incontestável. Se você está clonando um falante específico, o quadro controlado é o seu quadro, e esta semana ele tem um novo nome no topo.
O custo do incumbente não mudou.
O Eleven v4 Turbo custa US$ 40 por milhão de caracteres na API do fornecedor, e o Eleven v4 mais antigo custa US$ 80 — o dobro, por um modelo que pontua sete pontos Elo a menos no ranking controlado. Vale a pena parar para refletir sobre essa diferença dentro de um mesmo fornecedor: dois modelos de uma única empresa, 2× de diferença no preço e três posições de diferença no ranking.
O lado da HeyGen na comparação de preços existe, mas não em um formato que a HeyGen tenha publicado. A arena o lista a US$ 30,00 por milhão de caracteres — dez dólares abaixo do nível da ElevenLabs que ele desbancou, e 62% dos US$ 80 do Eleven v4 mais antigo —, mas esse número é uma conversão da Artificial Analysis, não uma cotação do fornecedor: a página pública de preços da HeyGen vende créditos (600 por US$ 29/mês, 1.000 por US$ 49, 1.500 por US$ 149) e documenta que o consumo varia conforme o modelo, a duração e a complexidade, sem informar uma tarifa de voz. Assim, o desafiante com a melhor pontuação de voz clonada está precificado um quarto abaixo do incumbente com base em um número que o incumbente não precisou deduzir.

Onde cada lado realmente vence
Escolha a ElevenLabs quando a amplitude for a restrição. Mais de noventa idiomas, cinco níveis classificados no painel controlado, uma biblioteca de vozes madura e uma variante conversacional com preço de US$ 50 por milhão de caracteres que o painel controlado classifica em décimo quinto lugar — essa combinação é difícil de reunir em outro lugar, e é por isso que a liderança do fornecedor sobreviveu à perda do primeiro lugar.
Teste o HeyGen Voice quando a restrição for a uniformidade. Um locutor, milhares de falas, um clone que precisa soar como esse locutor todas as vezes — essa é exatamente a carga de trabalho que a arena controlada modela, e o HeyGen Voice é atualmente o motor com a melhor pontuação nisso. O caminho de clone profissional treinado com mais de vinte minutos de áudio é o produto relevante para essa tarefa, não o clone instantâneo a partir de uma única gravação.
Não interprete o 1.202 como evidência de que o HeyGen Voice supera o ElevenLabs de modo geral. Ele supera um nível do ElevenLabs em um ranking. Outros três níveis estão a até 42 pontos dele, e o líder do outro ranking está 126 pontos à frente dele.
Testando um desafiante sem uma migração
A assimetria de custo aqui é a parte útil: trocar de voz é barato de implementar e imediatamente audível se der errado, e o fornecedor incumbente a US$ 40 por milhão de caracteres é algo caro de deixar rodando em tráfego que o desafiante trata melhor. A forma de resolver isso é executar os dois por trás de uma única integração e deixar o seu próprio áudio decidir — a OrcaRouter coloca os dois em uma única chave de API ao preço de tabela do provedor, sem markup, então uma mudança de tarifa do fornecedor é refletida na origem, e não na renovação do contrato, e o failover automático faz com que uma solicitação de voz que falha passe para o outro mecanismo em vez de ficar em silêncio. Em uma primeira passada, você pode direcionar o tráfego para o mecanismo que seu ouvido preferir em um pequeno conjunto de testes, e a DSL de roteamento permite manter um mecanismo para narração pré-renderizada e o outro para turnos interativos sem uma segunda biblioteca de cliente.
O que mudaria esta história
A entrada da HeyGen Voice na arena Provider Voices nos diria se uma liderança em voz clonada se traduz em vozes nativas competitivas — o teste que a ElevenLabs passa em 1.328. Uma tarifa de voz na própria página de preços da HeyGen transformaria os US$ 30,00 derivados da arena em uma aritmética que você pode auditar. E mais um mês de votos mostraria se 16 pontos de Elo acima do Qwen-Audio-3.1-TTS-Plus é uma ordenação estável ou um instantâneo. Qualquer uma das três poderia mudar a recomendação; nenhuma delas aconteceu ainda, e o resumo honesto até que aconteçam é que a HeyGen Voice venceu o quadro controlado e a ElevenLabs ainda domina a categoria.
