
Eleven v4 vs Qwen Audio 3.1: A Voz Mais Barata do Ranking Venceu
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 197 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
No ranking em que todos os participantes recebem as mesmas oito vozes clonadas, Alibaba Qwen-Audio-3.1-TTS-Plus terminou em primeiro lugar, com Elo 1.178, e ElevenLabs Eleven v4 terminou em segundo, com 1.157. O modelo vencedor custa US$ 19,30 por milhão de caracteres nesse ranking. O modelo que ficou em segundo lugar custa US$ 80,00. São 21 pontos de diferença de qualidade e uma diferença de preço de quatro vezes apontando em direções opostas, e esse é o resultado mais interessante de toda a semana de lançamento — mais interessante do que o primeiro lugar que a ElevenLabs conquistou na outra arena, porque nessa a ordenação é convencional e o vencedor é a voz mais cara entre as dez primeiras.
Os dois rankings não são intercambiáveis, e a razão pela qual este confronto tem a leitura que tem está inteiramente em qual deles você olha. No Provider Voice, os ouvintes julgam as próprias vozes de cada fornecedor. O Controlled Voice clona as mesmas oito vozes — quatro dos EUA, quatro do Reino Unido — para cada modelo, de modo que ninguém vence por causa do seu conjunto de vozes padrão. ElevenLabs vence o primeiro por 61 pontos. Alibaba vence o segundo por 21. Nenhum dos dois rankings está errado, e o segundo é o que prevê um produto que chega ao mercado com uma voz de marca clonada.

O placar de voz controlada, na íntegra
• Preferência cega, clones emparelhados — Qwen-Audio-3.1-TTS-Plus posição 1, Elo 1.178, US$ 19,30 por milhão de caracteres vs. Eleven v4 posição 2, Elo 1.157, US$ 80,00.
• Preferência cega, com as próprias vozes de cada fornecedor — Eleven v4 em 1º lugar, Elo 1.319 vs. Qwen-Audio-3.0-TTS-Plus em 4º lugar, Elo 1.258. Uma diferença de 61 pontos no sentido inverso.
• Preço, normalização da arena — Qwen US$ 19,30 vs Eleven v4 US$ 80,00. O Qwen é 76% mais barato.
• Preço, tabela de tarifas do fornecedor — Eleven v4 $0.022 por mil caracteres em promoção e $0.08 após 12 de outubro. A própria tabela de preços do Qwen Audio 3.1 não é algo que conseguimos ler, então a normalização da arena é o único preço com o qual podemos comparar.
• Versão em cada placa — 3.1 no Controlled Voice, 3.0 no Provider Voice. São modelos diferentes e as placas não são intercambiáveis.
• A entrada 3.0 no Controlled Voice — 5º lugar, Elo 1.124, mesmo preço de US$ 19,30. O lançamento 3.1 vale 54 Elo a mais que seu próprio antecessor por um preço idêntico.
• Gerações anteriores do Qwen no Provider Voice — Qwen3 TTS Flash posição 79, Elo 944; Qwen3 TTS posição 82, Elo 930.
• O antigo carro-chefe da própria ElevenLabs em Controlled Voice — Eleven v3 em 7º lugar, Elo 1.073.
• Verificação de sanidade de barras agrupadas — a amplitude de oito vias do rank 1 ao rank 10 no Controlled Voice é de 121 Elo. A vantagem de 21 pontos da Qwen sobre o Eleven v4 fica abaixo de um quinto da amplitude de todo o campo, que é a escala certa para mantê-la.

Duas linhas ali fazem a maior parte do trabalho. A primeira é a comparação entre 3.0 e 3.1: a Alibaba avançou 54 pontos Elo em um único aumento de versão sem alterar o preço em nada. Esse é um ritmo mais rápido do que o salto de 84 pontos da v3 para a v4 da ElevenLabs, e isso significa que a ordem de classificação específica neste artigo é um retrato momentâneo que ambos os fornecedores estão alterando ativamente.
O segundo é o spread total de 121 pontos. Uma diferença de 21 pontos em um quadro cujo intervalo útil é de cerca de 120 pontos é uma diferença real, mas modesta — aproximadamente da mesma magnitude que a diferença entre o próprio Qwen 3.1 e o 3.0. Se o seu caso de uso estiver em um idioma para o qual nenhum dos modelos foi ajustado, essa margem está bem dentro do intervalo que alguns scripts de teste difíceis conseguem reverter.
O problema de versão que ninguém está sinalizando
O resultado que circula como “Eleven v4 é o segundo no Controlled Voice” é preciso e incompleto, e a omissão importa para quem planeja com base nele. O modelo que está acima do Eleven v4 nesse ranking é a versão 3.1 da Alibaba. Já a entrada da Qwen no ranking Provider Voice é a versão 3.0 — o modelo 3.1 não aparece nas primeiras linhas desse ranking, da forma como o lemos. Portanto, as duas manchetes — “Eleven v4 é o número um” e “Eleven v4 é o número dois” — são afirmações sobre dois modelos Qwen diferentes em duas tarefas diferentes, e a versão do Qwen que o superou em um ranking não é a versão do Qwen que ele superou no outro.
Isto não é uma pegadinha sobre nenhum dos fornecedores; é um motivo para desconfiar de qualquer resumo de uma única frase de uma semana como esta. Se você está escolhendo entre esses dois sistemas, a comparação que você quer é a 3.1 contra a v4 na sua própria voz clonada, no seu próprio idioma, e nenhum dos fornecedores publicou isso.
O que podemos e não podemos dizer sobre Qwen Audio 3.1
A honestidade quanto às evidências vale mais aqui do que uma tabela completa de especificações, então aqui está o limite daquilo em que este artigo se baseia. Dos placares da arena, temos, para Qwen-Audio-3.1-TTS-Plus: um Elo de voz controlada de 1.178, uma normalização de preço de US$ 19,30 por milhão de caracteres, e o fato de ser o lançamento atual de uma linha cuja versão anterior obteve 54 pontos a menos pelo mesmo preço.
Não dispomos, e não vamos especular sobre: sua cobertura de idiomas, sua latência, seu limite de entrada por solicitação, se oferece suporte a diretivas de entrega inline, se oferece clonagem de voz além das oito vozes da arena, ou o que cobra em seu próprio tarifário. Tudo isso está documentado para o Eleven v4 — mais de 90 idiomas, limite de 10.000 caracteres, tags de áudio, clones instantâneos de dez segundos, suporte a fonemas IPA — e a ausência dessas informações do lado do Qwen é uma lacuna naquilo que é publicamente consultável, não um ponto contra o modelo. Uma decisão de compra tomada apenas com base neste artigo seria uma decisão tomada com base em dois números.

Um contraste sobrevive a essa limitação, porque ambos os lados são declarados pelo fornecedor ou ambos são declarados pelo painel. No preço, a normalização do painel é o denominador comum e favorece o Qwen em 76%. Na qualidade com falantes correspondentes, o mesmo painel favorece o Qwen em 21 Elo. Essas duas linhas são comparáveis. Todo o resto aqui não é, e o artigo não vai fingir o contrário.
Por que um conselho controlado deve ter mais peso do que o habitual
A maioria das comparações de voz parte por padrão daquilo que qualquer ranking coloca no topo — o modelo de que você já gosta. Neste confronto, há uma razão fundamentada para preferir o Controlled Voice, e ela é específica, e não geral.
A Alibaba e a ElevenLabs estão competindo com ativos radicalmente diferentes. A vantagem da ElevenLabs é uma biblioteca de vozes construída ao longo de anos de casting curado; a da Alibaba é uma organização de pesquisa que lança versões de modelo em ritmo acelerado. Um ranking que permite que cada participante traga suas próprias vozes mede tanto a biblioteca quanto o sintetizador, e nesse ranking a ElevenLabs vence por 61 pontos. Tire as bibliotecas da equação — os mesmos oito locutores clonados para todos — e a vantagem muda de mãos. Se a voz que seus usuários ouvem é o clone de uma pessoa específica, você não está comprando a biblioteca da ElevenLabs, então o ranking controlado é o que descreve sua compra. Se você está escolhendo em um menu de vozes padrão, o oposto é verdadeiro, e a margem de 61 pontos do Eleven v4 é o número que compensa.
Há uma segunda razão, menos confortável, para dar peso ao resultado controlado. Um painel de vozes de fornecedores recompensa um elenco padrão distintivo, e um elenco distintivo pode ser polarizador de maneiras que uma média de Elo oculta — o que para um ouvinte tem caráter, para outro é afetado. Um painel de vozes clonadas com locutores emparelhados elimina essa variável por completo, o que o torna a mais reprodutível das duas medições.
Executando qualquer um dos dois, e o que de fato roteamos
O OrcaRouter não hospeda nem os modelos de fala da ElevenLabs nem os da Alibaba. Nenhum dos fornecedores está em nosso catálogo, portanto não há como chamar qualquer um deles por meio de nós, e este artigo não sugerirá o contrário — você recorre à própria API do fornecedor e a várias plataformas de terceiros para ambos.
O que nós cobrimos é a camada acima. Se seu stack de fala é um nó em um pipeline maior, nós oferecemos mais de 200 modelos por trás de uma única chave de API, com preços de lista dos provedores repassados com 0% de markup, de modo que uma mudança de preços em qualquer ponto upstream — incluindo a janela promocional da ElevenLabs e o preço de lista muito maior que se segue a ela em 12 de outubro — é refletida na nossa ponta no dia em que acontece, em vez de no próximo ciclo de cobrança. Para uma decisão que depende de uma relação de preços de 4x, esse timing é a diferença entre uma comparação que envelhece bem e uma que parece errada em três semanas.
E onde o caminho de voz não pode cair, o failover automático move o tráfego para um upstream saudável em vez de falhar a requisição. Em um confronto tão equilibrado em qualidade e tão desequilibrado em preço, a arquitetura sensata é ter ambos os modelos atrás de um único endpoint, com o roteamento decidindo a divisão — e não uma seleção permanente feita a partir de um instantâneo de leaderboard que ambos os fornecedores invalidarão dentro de um trimestre.
O veredito, e a sua data de validade
Escolha o Qwen-Audio-3.1-TTS-Plus se você estiver clonando uma voz e de olho no custo. Ele é o primeiro no ranking que mantém os falantes constantes, custa cerca de um quarto do preço, e sua curva está avançando mais rápido — 54 pontos de Elo em um passo de versão a um preço inalterado sugerem que a próxima versão é uma aposta melhor do que a atual é no papel.
Escolha o Eleven v4 se seus usuários ouvem vozes padrão, se você precisa de cobertura em idiomas que pode verificar antes de lançar, ou se o conjunto de recursos documentado — tags de áudio, controle de fonemas, requisições de 10.000 caracteres, clones de dez segundos — está fazendo um trabalho no seu produto que os rankings da arena não medem. Sua vantagem de 61 pontos no ranking de vozes de fornecedores não é pouca coisa, e os dois recursos que você pode incluir em um roteiro são capacidades, não pontuações.
Defina uma data de revisão. A Alibaba avançou 54 pontos Elo em uma atualização de versão neste ciclo, e a ElevenLabs avançou 84 ao longo de uma geração completa, e a tarifa promocional do Eleven v4 expira em 12 de outubro. Independentemente do que esta comparação diga hoje, os dois fatos com maior probabilidade de invertê-la — um lançamento da versão 3.2 e uma reversão de preço — acontecem ambos antes do fim do trimestre.
