Um cartão hero gerado intitulado "Voz da HeyGen estreia em 1º lugar na Controlled Voice Arena", com a linha "1.202 Elo — à frente de Qwen-Audio-3.1-TTS-Plus e Eleven v4 Turbo" e a nota "As mesmas oito vozes de referência clonadas — Artificial Analysis, 9 de outubro de 2026". O logotipo da OrcaRouter aparece no canto inferior direito.
Guides & Insights

HeyGen Voice estreia em #1 na Controlled Voice TTS Arena — superando Qwen e ElevenLabs em vozes clonadas

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 9 de outubro de 2026, a Artificial Analysis adicionou o HeyGen Voice à sua arena Controlled Voice, e o modelo foi direto para o topo dela. O HeyGen Voice — o primeiro modelo de texto para fala da HeyGen a ser avaliado no quadro — marcou 1.202 de Elo, à frente do Qwen-Audio-3.1-TTS-Plus, com 1.186, e do Eleven v4 Turbo da ElevenLabs, com 1.167. O Cartesia Sonic 3.6, que lidera o quadro aberto Provider Voices do site, ocupa o quinto lugar aqui, com 1.143. Esse é um resultado genuíno em uma classificação criada para remover o maior fator de confusão da avaliação de voz, e também é um resultado com um significado muito específico que é fácil de superinterpretar: o HeyGen Voice é a melhor voz nesta arena com oito vozes de referência clonadas, ainda não um campeão medido do quadro com noventa e seis modelos.

O que a placa Controlled Voice mede, e por que isso importa

A Artificial Analysis mantém dois rankings de fala, e eles respondem a perguntas diferentes. A arena Provider Voices permite que cada fornecedor forneça suas próprias vozes nativas — as vozes de demonstração refinadas que uma empresa escolhe para se representar — e classifica os modelos pela qualidade com que soam. Seu ranking é amplo e maduro: noventa e seis entradas, com Eleven v4 Turbo no topo, com 1.328 Elo, e Cartesia Sonic 3.6 em quarto, com 1.280.

A Controlled Voice arena faz algo mais restrito e, para quem está lançando um produto, mais útil. Todos os modelos nela geram fala a partir das mesmas oito vozes clonadas — quatro dos EUA, quatro do Reino Unido —, então a comparação não é "qual voz de marketing é mais agradável", mas "como cada motor lida com a mesma voz, o mesmo texto e as mesmas condições de gravação". É o mais próximo que a indústria tem de um teste verdadeiramente comparável do motor, e não de um vídeo de demonstração, e é o ranking que importa se você planeja clonar uma voz e entregá-la a um modelo de TTS.

O HeyGen Voice agora está na liderança. A margem é de 16 Elo sobre o Qwen-Audio-3.1-TTS-Plus e de 35 sobre o Eleven v4 Turbo, com um intervalo de confiança de 95% relatado de aproximadamente 1.185 a 1.219 para a pontuação da HeyGen. Dezesseis Elo é uma diferença real, mas não um abismo — num ranking tão denso, é a diferença entre o primeiro e o segundo lugar, não entre utilizável e inutilizável.

A generated single-column scoreboard titled 'HeyGen Voice — the scoreboard' with rows reading 'Controlled Voice Elo: 1,202', '95% confidence interval: roughly 1,185 to 1,219', 'Rank in the controlled field: #1 of 42 ranked entries', 'Provider Voices Elo: not listed, insufficient votes', "Price on the arena's basis: $30.00 per 1M characters, derived from credit pricing" and 'Elo anchor: the board baseline is 1,000 points', with a footer reading 'Elo per Artificial Analysis, 9 October 2026. Price shown is the arena's conversion of credit pricing.' The OrcaRouter logo appears in the bottom-right corner.

Onde o HeyGen Voice ainda não está classificado

A ressalva honesta deste resultado é que o HeyGen Voice não aparece de forma alguma no painel Provider Voices, e sua ausência não é um sinal sobre a qualidade. A Artificial Analysis observa que modelos podem ser omitidos por ainda não terem votos suficientes. Um modelo com poucos dias de vida, tendo atrás de si uma única arena com pontuação diferente, simplesmente não acumulou o volume de ouvintes cegos que o painel maior exige.

Portanto, a leitura correta em 10 de outubro de 2026 é: o HeyGen Voice é a voz mais bem classificada na comparação controlada de vozes clonadas, e uma incógnita diante do campo mais amplo. Quem citar "o melhor modelo de TTS do mundo" com base nesse número está citando um placar menor do que a frase sugere.

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing the ranked model list with Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, alongside samples, release dates and API pricing columns and 8-voice arena badges.

Os dois números por trás do Elo

• Elo de Voz Controlada — HeyGen Voice: 1.202 (IC de 95% aproximadamente 1.185–1.219). Qwen-Audio-3.1-TTS-Plus: 1.186. Eleven v4 Turbo: 1.167.

• Elo das Vozes de Provedores — HeyGen Voice: não listado (votos insuficientes). Eleven v4 Turbo: 1.328 em nº 1. Sonic 3.6: 1.280 em nº 4.

• Classificação no campo controlado — HeyGen Voice: #1 de 42 entradas classificadas (#42 é OpenVoice v2 com 812).

• Preço com base no critério da arena — HeyGen Voice: $30,00 por 1M de caracteres, a conversão própria da arena do preço de créditos da HeyGen. Qwen-Audio-3.1-TTS-Plus: $19,30 por 1M de caracteres. Eleven v4 Turbo: $40,00 por 1M de caracteres.

• Âncora Elo — OpenAudio S1 é o ponto de referência fixo em 1.000, portanto o HeyGen Voice está 202 pontos acima da âncora.

• Quem mais está no top cinco — Eleven v4 com 1.160 e Sonic 3.6 com 1.143 completam o top cinco atrás dos líderes.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech, above the Realtime Video and Avatar Management groups.

O que a HeyGen realmente lançou

O mecanismo por trás da entrada é o TTS interno da HeyGen, exposto na API v3 da empresa. Uma GET /v3/voices chamada aceita um engine filtro cujos valores incluem orca — o próprio mecanismo de voz da HeyGen — ao lado de starfish e um encaminhamento para vozes da ElevenLabs. A renderização de fala passa por POST /v3/voices/speech; o ajuste por requisição expõe speed de 0,5 a 1,5 e pitch de −50 a +50 semitons, com uma localedica

O catálogo lista mais de 300 vozes pré-construídas em dezenas de idiomas. As vozes personalizadas vêm em três tipos: o design de texto para voz, que gera até três opções classificadas a partir de uma descrição limitada a 1.000 caracteres, um clone instantâneo a partir de uma única gravação, e um clone profissional treinado com vinte minutos ou mais de áudio. É esse último que o placar do Controlled Voice está, na prática, submetendo a testes de estresse — essas oito vozes de referência são clones, e é na qualidade dos clones que os motores de TTS se diferenciam.

Os motores também são indicados na documentação como selecionáveis por voz, o que significa que a HeyGen não obriga você a usar o modelo dela: você pode rotear para um motor de voz de terceiros por meio da API dela quando preferir. Isso é um fornecedor fazendo hedge do próprio modelo, e vale a pena saber disso quando você lê uma alegação de “voz nº 1” sobre a HeyGen.

O que isso muda para quem escolhe uma voz

Três consequências práticas decorrem da chegada de um resultado de voz controlada, e nenhuma delas é "mudar tudo".

Primeiro, se o seu caso de uso é uma voz de marca clonada — um falante, muitas falas —, agora é esta a tabela a consultar, e o HeyGen Voice é o modelo a testar primeiro. Uma tabela de classificação que mantém a voz constante está a medir exatamente aquilo que vai fazer na prática.

Segundo, se o seu caso de uso for um elenco amplo de personagens com sonoridade nativa em idiomas que o seu clone não cobre, o quadro Provider Voices e as suas noventa e seis entradas continuam a ser a referência relevante, e o HeyGen Voice ainda não tem classificação lá. Nada num resultado de voz clonada lhe diz como o motor lida com cem vozes distintas.

Terceiro, o preço agora tem um número, mas não um que o fornecedor tenha publicado. A arena lista o HeyGen Voice a $30,00 por 1 milhão de caracteres, uma conversão da Artificial Analysis de um sistema de créditos que a própria página da HeyGen nunca converte em uma tarifa de voz. Isso coloca o novo líder abaixo dos $40,00 do Eleven v4 Turbo e acima dos $19,30 do nível Qwen — um preço intermediário atribuído a uma pontuação de primeiro lugar, e que é derivado em vez de cotado.

A questão do roteamento

A seleção de voz tem uma propriedade que a maioria das escolhas de modelo não tem: a falha é audível para o usuário final dentro de uma sílaba. Isso torna a migração barata de testar e cara de errar em produção. Executar um novo mecanismo por trás da mesma interface do incumbente — uma única superfície de API, uma única chave, preço de tabela do provedor repassado em vez de majorado, com failover automático para um segundo provedor de voz quando uma requisição falha — é como você obtém uma resposta real sobre o seu próprio áudio, em vez da resposta de um gráfico Elo sobre oito vozes de referência. A camada de roteamento da OrcaRouter existe exatamente para esse tipo de decisão: coloque o desafiante em uma fração do tráfego, mantenha o incumbente aquecido e deixe o failover cobrir a janela em que o novo modelo ainda não foi comprovado. O ranking diz onde procurar. Ele não consegue dizer como o seu roteiro soa.

O que assistir em seguida

Dois números vão resolver esta história. O primeiro é se o HeyGen Voice acumula votos suficientes para entrar no ranking Provider Voices, e onde ele fica em relação aos 1.328 do Eleven v4 Turbo — um modelo que lidera esse ranking, mas fica atrás na arena controlada, que é exatamente a lacuna que os dois rankings existem para expor. O segundo é se a HeyGen publica uma tarifa de voz própria, para que os US$ 30,00 que a arena calculou possam ser conferidos com um número do fornecedor, em vez de inferidos a partir de créditos. Enquanto ambos não existirem, uma estreia em #1 no ranking controlado é uma afirmação forte sobre a qualidade de voz clonada e uma questão em aberto sobre todo o resto.