
HeyGen Voice vs Qwen-Audio-3.0-TTS: O que você paga pelo Elo e qual tier do Qwen você realmente avaliou no benchmark
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Faça a aritmética primeiro, porque é menos desequilibrado do que o placar sugere. Qwen-Audio-3.0-TTS-Plus custa US$ 19,30 por milhão de caracteres na plataforma Model Studio — uma tarifa que o fornecedor publica. HeyGen Voice está a US$ 30,00 por milhão de caracteres no próprio gráfico de preços da Artificial Analysis, um valor que o site deriva do preço de créditos da HeyGen, porque a página pública de preços da HeyGen vende créditos sem declarar o que uma geração de voz consome. Enquanto isso, a diferença de voz controlada entre eles é de 79 Elo: HeyGen Voice marcou 1.202 na arena que mantém as oito vozes de referência constantes, Qwen-Audio-3.0-TTS-Plus 1.123. Portanto, o modelo mais barato está classificado bem atrás do melhor, a proporção entre eles é de aproximadamente 1,55×, e apenas um desses dois preços é um número que o fornecedor que o vende assumiu como seu.
A armadilha no nome
Antes de tudo isso, acerte o nível, porque esta é uma família que vai tranquilamente deixar você fazer benchmark do modelo errado. Duas entradas da Alibaba importam aqui, e elas não são intercambiáveis.
O Qwen-Audio-3.0-TTS-Plus é o modelo com o qual este artigo faz a comparação. Ele obtém 1.123 pontos no quadro controlado — sétimo de quarenta e dois — e 1.264 no quadro Provider Voices, onde ocupa a sexta posição entre noventa e seis. É um produto TTS de streaming real e atual, com um preço publicado de US$ 19,30 por milhão de caracteres.
O Qwen-Audio-3.1-TTS-Plus é o seu nível sucessor, e é o que ocupa o segundo lugar no placar controlado, com 1.186 — o modelo que chegou mais perto de superar o HeyGen Voice na estreia. Seu preço está listado nos mesmos US$ 19,30, embora a documentação da Alibaba alerte que diferentes versões do modelo exigem vozes correspondentes, então "mesmo preço, categoria mais nova" não significa "substituição direta".
Quem lê “#1 à frente do Qwen” e depois faz benchmark do Qwen-Audio-3.0-TTS estará testando um modelo 63 Elo mais fraco do que aquele sobre o qual a manchete falava. A discussão sobre o tier vale 63 pontos, o que é mais do que a diferença entre HeyGen Voice e o terceiro lugar.
O placar

• Elo de Voz Controlado (as mesmas 8 vozes clonadas) — HeyGen Voice: 1,202, nº 1 de 42. Qwen-Audio-3.0-TTS-Plus: 1,123, nº 7.
• Provider Voices Elo (vozes nativas) — Qwen-Audio-3.0-TTS-Plus: 1.264, nº 6 de 96. HeyGen Voice: não classificado.
• Preço por 1 milhão de caracteres — Qwen-Audio-3.0-TTS-Plus: $19.30, publicado pelo fornecedor no Alibaba Cloud. HeyGen Voice: $30.00 com base na conversão própria da arena do preço em créditos; a HeyGen não publica tarifa de voz.
• Custo de 100 horas de narração — Qwen-Audio-3.0-TTS-Plus: cerca de US$ 926 a ~480.000 caracteres por hora falada. HeyGen Voice: cerca de US$ 1.440 na conversão de US$ 30,00 da arena — derivado, não cotado.
• Controle de voz — Qwen-Audio-3.0-TTS-Plus: parâmetro de instrução, etiquetas de emoção e idioma, clonagem de voz e design de voz. HeyGen Voice: design de voz a partir de texto com uma descrição de ≤1.000 caracteres, clone instantâneo, clone profissional treinado com mais de 20 minutos.
• Saída — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 e Opus em até 48 kHz, com taxa, tom, volume e taxa de bits ajustáveis. HeyGen Voice: velocidade 0,5–1,5 e tom ±50 semitons por solicitação.

O que a engenharia da Alibaba realmente oferece a você
A família Qwen-Audio-3.0-TTS é um produto de streaming e a documentação é escrita como tal. As requisições trafegam por um protocolo WebSocket compartilhado com o CosyVoice, com o executar-tarefa, continuar-tarefa e finalizar-tarefa como fluxo de eventos e tarefa-iniciada, resultado-gerado, tarefa-finalizada e tarefa-falhada como respostas ao lado deles. O cancelamento é suportado em todos os modelos Qwen-Audio-TTS tanto na região de Pequim quanto na de Singapura via cancelar_streaming(). A saída atinge 48kHz, e os formatos incluem Opus, o que importa se você estiver movendo áudio para um navegador ou uma chamada telefônica em vez de um arquivo WAV.
Dois detalhes nessa documentação são fáceis de passar despercebidos e caros de se descobrir tarde. As tags de emoção e de linguagem rica se aplicam apenas aos níveis Plus e Flash — não a toda a família — e funcionam somente no modo de streaming unidirecional. E as chaves de API são diferentes entre as regiões de Singapura e Pequim, com workspaces endereçados em URLs no formato wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Chaves regionais são um detalhe de provisionamento até o dia em que se tornam uma indisponibilidade.
O lado da HeyGen é um produto com uma forma diferente: uma API v3 ao estilo REST, onde POST /v3/voices/speech sintetiza fala, GET /v3/voices lista o catálogo por trás de um engine filtro, e o design de voz devolve até três opções ordenadas a partir de um prompt de texto, com uma seed para reprodutibilidade. A documentação também revela que o engine filtro aceita valores para além dos da própria HeyGen — por isso, a HeyGen encaminha-te alegremente para um motor de voz de terceiros através da sua API. Um fornecedor que disponibiliza o modelo de um concorrente como opção selecionável está a dizer-te algo sobre onde acredita que reside a sua própria força.

Para onde vão os 79 de Elo
Uma diferença de 79 pontos em um placar controlado é substancial — maior do que a margem de 16 pontos que separa o HeyGen Voice do segundo lugar, e aproximadamente a distância entre o terceiro e o oitavo lugar nesse campo. Ela também é medida em um único eixo.
A arena controlada clona oito vozes e as mantém fixas. Não diz nada sobre a superfície de controle orientada por instruções que a Qwen expõe, nada sobre saída Opus de 48 kHz por meio de um WebSocket cancelável, e nada sobre implantação regional. Essas são propriedades de engenharia, e são a razão pela qual uma equipe que constrói um centro de contato em mandarim não migraria para um modelo que obtém 79 pontos a mais em oito vozes de referência em inglês.
O que o resultado controlado diz é mais restrito e ainda assim útil: quando ambos os motores recebem a mesma voz clonada, os ouvintes preferiram a renderização do HeyGen Voice. Se o seu produto clona vozes, esse é o seu eixo. Se o seu produto escolhe uma voz de um catálogo e a transmite em streaming para uma chamada, o ranking de provedores está mais próximo da sua realidade — e, aí, o HeyGen Voice não tem classificação alguma, enquanto o Qwen-Audio-3.0-TTS-Plus ocupa a sexta posição entre noventa e seis.
O argumento do preço, levado a sério
A US$ 19,30 por milhão de caracteres, o Qwen-Audio-3.0-TTS-Plus custa cerca de metade do custo do nível de US$ 40 da ElevenLabs e cerca de 40% dos US$ 49 do Cartesia Sonic 3.6. Para uma carga de trabalho de 100 horas de narração — cerca de 48 milhões de caracteres a um ritmo de fala típico — isso fica na ordem de US$ 926. O mesmo volume no Eleven v4 Turbo ficaria em cerca de US$ 1.920 e no Sonic 3.6 em cerca de US$ 2.352. O HeyGen Voice, com os US$ 30,00 da arena, fica perto de US$ 1.440: entre o nível barato e os dois incumbentes, mais perto do meio do que do topo.
Essa aritmética traz uma ressalva que as outras não exigem. US$ 19,30 é o preço publicado da própria Alibaba. US$ 30,00 é a conversão da Artificial Analysis de um sistema de créditos que a HeyGen nunca converteu em caracteres, então é uma estimativa de boa-fé, e não uma cotação. Se a proporção real de caracteres por crédito for pior do que o gráfico pressupõe, a vantagem de 79-Elo custa mais do que o 1,55× que ela implica; se for melhor, custa menos. Um modelo cujo preço você tem de inferir é um modelo no qual você faz um teste-piloto com uma fatia medida de tráfego, em vez de um modelo que você adota como padrão. Isso não é uma crítica ao motor — é uma descrição da informação disponível em 10 de outubro de 2026.
Decidindo
Escolha o Qwen-Audio-3.0-TTS-Plus quando custo e infraestrutura de streaming orientarem a decisão. Menos de US$ 20 por milhão de caracteres, um WebSocket cancelável com saída Opus de 48 kHz, um parâmetro de instrução e tags de emoção, e a sexta posição no ranking do painel de provedores fazem dele a voz bem pontuada mais econômica desta comparação. Escolha o nível 3.1 se quiser o modelo que de fato ficou em segundo lugar no painel controlado, e verifique a lista de vozes antes de presumir que a troca é gratuita.
Teste o HeyGen Voice quando a fidelidade do clone é o produto. Um locutor, muitas falas, uma voz que precisa ser *aquela* voz todas as vezes — esse é o eixo que o painel controlado mede e o eixo no qual ele lidera todo o setor. Reserve um período para medição, porque o modelo de créditos significa que você descobrirá seu custo real executando seu próprio texto, em vez de ler uma tabela de preços.
E ignore totalmente a comparação se a carga de trabalho for em chinês e em tempo real. Nenhum número Elo foi medido com as suas vozes, no seu idioma, dentro do seu orçamento de latência.
Mantendo ambos acessíveis
Este é um dos emparelhamentos em que a camada de roteamento ganha o seu lugar em vez de ser um extra. Uma única chave de API que cobre ambos os fornecedores — preço de tabela do fornecedor repassado sem margem, portanto os $19,30 publicados da Alibaba são o que paga e uma alteração de preço da Qwen entra em vigor no mesmo dia — elimina a necessidade de escolher um vencedor antes de ter evidências. O failover automático cobre o risco óbvio num pipeline de voz, onde um stream bloqueado é audível para o ouvinte, e a DSL de roteamento permite enviar narração em massa para o motor barato e linhas críticas de clonagem para aquele que tem 79 pontos a mais, sem duas bibliotecas de cliente e duas relações de cobrança. O valor da OrcaRouter aqui não está em hospedar um modelo de voz; está em tornar o custo de descobrir qual deles quer praticamente zero.
As questões em aberto
Três coisas resolveriam isso. Uma taxa de voz na própria página de preços da HeyGen transformaria os $30.00 que a arena calcula em um número que você pode auditar. Uma entrada da HeyGen no quadro Provider Voices nos diria se a liderança de voz clonada sobrevive às vozes nativas — o teste que o Qwen-Audio-3.0-TTS-Plus passa em sexto lugar entre noventa e seis. E um resultado de voz controlada para o Qwen-Audio-3.1-TTS-Plus contra o HeyGen Voice depois de mais votos nos diria se 16 Elo é uma ordenação estável. Até lá: o Qwen é a opção com preço, com streaming e bem classificada; o HeyGen Voice é a de maior pontuação e sem preço; e o nível que você usa como referência importa mais do que a manchete que você lê.
