Um cartão de destaque gerado com o título 'HeyGen Voice vs Qwen-Audio-3.0-TTS', mostrando a diferença de 79 pontos no Elo de voz controlada em relação aos dois preços por milhão de caracteres, com uma observação de que um preço é publicado pelo fornecedor e o outro é a conversão derivada da arena a partir do preço em créditos, segundo a Artificial Analysis, 9 de outubro de 2026. O logotipo da OrcaRouter aparece no canto inferior direito.
Engineering & Research

HeyGen Voice vs Qwen-Audio-3.0-TTS: O que você paga pelo Elo e qual tier do Qwen você realmente avaliou no benchmark

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Faça a aritmética primeiro, porque é menos desequilibrado do que o placar sugere. Qwen-Audio-3.0-TTS-Plus custa US$ 19,30 por milhão de caracteres na plataforma Model Studio — uma tarifa que o fornecedor publica. HeyGen Voice está a US$ 30,00 por milhão de caracteres no próprio gráfico de preços da Artificial Analysis, um valor que o site deriva do preço de créditos da HeyGen, porque a página pública de preços da HeyGen vende créditos sem declarar o que uma geração de voz consome. Enquanto isso, a diferença de voz controlada entre eles é de 79 Elo: HeyGen Voice marcou 1.202 na arena que mantém as oito vozes de referência constantes, Qwen-Audio-3.0-TTS-Plus 1.123. Portanto, o modelo mais barato está classificado bem atrás do melhor, a proporção entre eles é de aproximadamente 1,55×, e apenas um desses dois preços é um número que o fornecedor que o vende assumiu como seu.

A armadilha no nome

Antes de tudo isso, acerte o nível, porque esta é uma família que vai tranquilamente deixar você fazer benchmark do modelo errado. Duas entradas da Alibaba importam aqui, e elas não são intercambiáveis.

O Qwen-Audio-3.0-TTS-Plus é o modelo com o qual este artigo faz a comparação. Ele obtém 1.123 pontos no quadro controlado — sétimo de quarenta e dois — e 1.264 no quadro Provider Voices, onde ocupa a sexta posição entre noventa e seis. É um produto TTS de streaming real e atual, com um preço publicado de US$ 19,30 por milhão de caracteres.

O Qwen-Audio-3.1-TTS-Plus é o seu nível sucessor, e é o que ocupa o segundo lugar no placar controlado, com 1.186 — o modelo que chegou mais perto de superar o HeyGen Voice na estreia. Seu preço está listado nos mesmos US$ 19,30, embora a documentação da Alibaba alerte que diferentes versões do modelo exigem vozes correspondentes, então "mesmo preço, categoria mais nova" não significa "substituição direta".

Quem lê “#1 à frente do Qwen” e depois faz benchmark do Qwen-Audio-3.0-TTS estará testando um modelo 63 Elo mais fraco do que aquele sobre o qual a manchete falava. A discussão sobre o tier vale 63 pontos, o que é mais do que a diferença entre HeyGen Voice e o terceiro lugar.

O placar

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• Elo de Voz Controlado (as mesmas 8 vozes clonadas) — HeyGen Voice: 1,202, nº 1 de 42. Qwen-Audio-3.0-TTS-Plus: 1,123, nº 7.

• Provider Voices Elo (vozes nativas) — Qwen-Audio-3.0-TTS-Plus: 1.264, nº 6 de 96. HeyGen Voice: não classificado.

• Preço por 1 milhão de caracteres — Qwen-Audio-3.0-TTS-Plus: $19.30, publicado pelo fornecedor no Alibaba Cloud. HeyGen Voice: $30.00 com base na conversão própria da arena do preço em créditos; a HeyGen não publica tarifa de voz.

• Custo de 100 horas de narração — Qwen-Audio-3.0-TTS-Plus: cerca de US$ 926 a ~480.000 caracteres por hora falada. HeyGen Voice: cerca de US$ 1.440 na conversão de US$ 30,00 da arena — derivado, não cotado.

• Controle de voz — Qwen-Audio-3.0-TTS-Plus: parâmetro de instrução, etiquetas de emoção e idioma, clonagem de voz e design de voz. HeyGen Voice: design de voz a partir de texto com uma descrição de ≤1.000 caracteres, clone instantâneo, clone profissional treinado com mais de 20 minutos.

• Saída — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 e Opus em até 48 kHz, com taxa, tom, volume e taxa de bits ajustáveis. HeyGen Voice: velocidade 0,5–1,5 e tom ±50 semitons por solicitação.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

O que a engenharia da Alibaba realmente oferece a você

A família Qwen-Audio-3.0-TTS é um produto de streaming e a documentação é escrita como tal. As requisições trafegam por um protocolo WebSocket compartilhado com o CosyVoice, com o executar-tarefa, continuar-tarefa e finalizar-tarefa como fluxo de eventos e tarefa-iniciada, resultado-gerado, tarefa-finalizada e tarefa-falhada como respostas ao lado deles. O cancelamento é suportado em todos os modelos Qwen-Audio-TTS tanto na região de Pequim quanto na de Singapura via cancelar_streaming(). A saída atinge 48kHz, e os formatos incluem Opus, o que importa se você estiver movendo áudio para um navegador ou uma chamada telefônica em vez de um arquivo WAV.

Dois detalhes nessa documentação são fáceis de passar despercebidos e caros de se descobrir tarde. As tags de emoção e de linguagem rica se aplicam apenas aos níveis Plus e Flash — não a toda a família — e funcionam somente no modo de streaming unidirecional. E as chaves de API são diferentes entre as regiões de Singapura e Pequim, com workspaces endereçados em URLs no formato wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Chaves regionais são um detalhe de provisionamento até o dia em que se tornam uma indisponibilidade.

O lado da HeyGen é um produto com uma forma diferente: uma API v3 ao estilo REST, onde POST /v3/voices/speech sintetiza fala, GET /v3/voices lista o catálogo por trás de um engine filtro, e o design de voz devolve até três opções ordenadas a partir de um prompt de texto, com uma seed para reprodutibilidade. A documentação também revela que o engine filtro aceita valores para além dos da própria HeyGen — por isso, a HeyGen encaminha-te alegremente para um motor de voz de terceiros através da sua API. Um fornecedor que disponibiliza o modelo de um concorrente como opção selecionável está a dizer-te algo sobre onde acredita que reside a sua própria força.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

Para onde vão os 79 de Elo

Uma diferença de 79 pontos em um placar controlado é substancial — maior do que a margem de 16 pontos que separa o HeyGen Voice do segundo lugar, e aproximadamente a distância entre o terceiro e o oitavo lugar nesse campo. Ela também é medida em um único eixo.

A arena controlada clona oito vozes e as mantém fixas. Não diz nada sobre a superfície de controle orientada por instruções que a Qwen expõe, nada sobre saída Opus de 48 kHz por meio de um WebSocket cancelável, e nada sobre implantação regional. Essas são propriedades de engenharia, e são a razão pela qual uma equipe que constrói um centro de contato em mandarim não migraria para um modelo que obtém 79 pontos a mais em oito vozes de referência em inglês.

O que o resultado controlado diz é mais restrito e ainda assim útil: quando ambos os motores recebem a mesma voz clonada, os ouvintes preferiram a renderização do HeyGen Voice. Se o seu produto clona vozes, esse é o seu eixo. Se o seu produto escolhe uma voz de um catálogo e a transmite em streaming para uma chamada, o ranking de provedores está mais próximo da sua realidade — e, aí, o HeyGen Voice não tem classificação alguma, enquanto o Qwen-Audio-3.0-TTS-Plus ocupa a sexta posição entre noventa e seis.

O argumento do preço, levado a sério

A US$ 19,30 por milhão de caracteres, o Qwen-Audio-3.0-TTS-Plus custa cerca de metade do custo do nível de US$ 40 da ElevenLabs e cerca de 40% dos US$ 49 do Cartesia Sonic 3.6. Para uma carga de trabalho de 100 horas de narração — cerca de 48 milhões de caracteres a um ritmo de fala típico — isso fica na ordem de US$ 926. O mesmo volume no Eleven v4 Turbo ficaria em cerca de US$ 1.920 e no Sonic 3.6 em cerca de US$ 2.352. O HeyGen Voice, com os US$ 30,00 da arena, fica perto de US$ 1.440: entre o nível barato e os dois incumbentes, mais perto do meio do que do topo.

Essa aritmética traz uma ressalva que as outras não exigem. US$ 19,30 é o preço publicado da própria Alibaba. US$ 30,00 é a conversão da Artificial Analysis de um sistema de créditos que a HeyGen nunca converteu em caracteres, então é uma estimativa de boa-fé, e não uma cotação. Se a proporção real de caracteres por crédito for pior do que o gráfico pressupõe, a vantagem de 79-Elo custa mais do que o 1,55× que ela implica; se for melhor, custa menos. Um modelo cujo preço você tem de inferir é um modelo no qual você faz um teste-piloto com uma fatia medida de tráfego, em vez de um modelo que você adota como padrão. Isso não é uma crítica ao motor — é uma descrição da informação disponível em 10 de outubro de 2026.

Decidindo

Escolha o Qwen-Audio-3.0-TTS-Plus quando custo e infraestrutura de streaming orientarem a decisão. Menos de US$ 20 por milhão de caracteres, um WebSocket cancelável com saída Opus de 48 kHz, um parâmetro de instrução e tags de emoção, e a sexta posição no ranking do painel de provedores fazem dele a voz bem pontuada mais econômica desta comparação. Escolha o nível 3.1 se quiser o modelo que de fato ficou em segundo lugar no painel controlado, e verifique a lista de vozes antes de presumir que a troca é gratuita.

Teste o HeyGen Voice quando a fidelidade do clone é o produto. Um locutor, muitas falas, uma voz que precisa ser *aquela* voz todas as vezes — esse é o eixo que o painel controlado mede e o eixo no qual ele lidera todo o setor. Reserve um período para medição, porque o modelo de créditos significa que você descobrirá seu custo real executando seu próprio texto, em vez de ler uma tabela de preços.

E ignore totalmente a comparação se a carga de trabalho for em chinês e em tempo real. Nenhum número Elo foi medido com as suas vozes, no seu idioma, dentro do seu orçamento de latência.

Mantendo ambos acessíveis

Este é um dos emparelhamentos em que a camada de roteamento ganha o seu lugar em vez de ser um extra. Uma única chave de API que cobre ambos os fornecedores — preço de tabela do fornecedor repassado sem margem, portanto os $19,30 publicados da Alibaba são o que paga e uma alteração de preço da Qwen entra em vigor no mesmo dia — elimina a necessidade de escolher um vencedor antes de ter evidências. O failover automático cobre o risco óbvio num pipeline de voz, onde um stream bloqueado é audível para o ouvinte, e a DSL de roteamento permite enviar narração em massa para o motor barato e linhas críticas de clonagem para aquele que tem 79 pontos a mais, sem duas bibliotecas de cliente e duas relações de cobrança. O valor da OrcaRouter aqui não está em hospedar um modelo de voz; está em tornar o custo de descobrir qual deles quer praticamente zero.

As questões em aberto

Três coisas resolveriam isso. Uma taxa de voz na própria página de preços da HeyGen transformaria os $30.00 que a arena calcula em um número que você pode auditar. Uma entrada da HeyGen no quadro Provider Voices nos diria se a liderança de voz clonada sobrevive às vozes nativas — o teste que o Qwen-Audio-3.0-TTS-Plus passa em sexto lugar entre noventa e seis. E um resultado de voz controlada para o Qwen-Audio-3.1-TTS-Plus contra o HeyGen Voice depois de mais votos nos diria se 16 Elo é uma ordenação estável. Até lá: o Qwen é a opção com preço, com streaming e bem classificada; o HeyGen Voice é a de maior pontuação e sem preço; e o nível que você usa como referência importa mais do que a manchete que você lê.