
Qwen-Audio-3.1 vs ElevenLabs: um corte de preço de 70% encontra o incumbente
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
O fornecedor cortou o preço de sua API Qwen-Audio-3.1-TTS em cerca de 70% em 23 de setembro de 2026, anúncio feito no palco da Apsara Conference, em Hangzhou, ao lado de outros quatro modelos de fala. Esse único número é o motivo pelo qual vale a pena escrever esta comparação: o ElevenLabs Eleven v3 tem sido a voz de produção padrão para a maioria das equipes ocidentais, a uma taxa efetiva próxima de US$ 100 por milhão de caracteres, e um concorrente confiável acabou de reprecificar o mesmo trabalho por uma fração disso, ampliando ao mesmo tempo a cobertura de idiomas. Os dois sistemas não são equivalentes — o Qwen-Audio-3.1-TTS é uma API apenas hospedada do Tongyi Lab do fornecedor, com um ecossistema de vozes menor, enquanto o ElevenLabs é uma plataforma completa de conteúdo com a biblioteca de vozes mais profunda do setor. Mas, se a sua decisão já chegou a ser determinada pela fatura, a aritmética mudou esta semana.
O que realmente foi lançado em 23 de setembro?
Qwen-Audio-3.1 não é um único modelo. É uma atualização de cinco modelos de todo o stack de fala da Alibaba, e os níveis importam porque têm preços diferentes e tarefas diferentes:
• Qwen-Audio-3.1-TTS — o sucessor direto do modelo de síntese que a maioria das equipes usa. Acrescenta sete idiomas, totalizando 16, mantém as 20 regiões de dialetos chineses, adiciona transferência natural de timbre entre idiomas (uma só voz que perpassa mandarim, cantonês, inglês e japonês), controle por instruções de emoção, ritmo e estilo de entrega, e lida com áudio de referência ruidoso, com eco ou de outra forma ruim sem um modo separado de remoção de ruído.
• Qwen-Audio-3.1-TTS-Next — um novo nível, e um produto diferente. A Alibaba o chama de modelo "Audiogen": ele gera voz, efeitos sonoros e ambiência de fundo em uma única passagem a partir de texto, timestamps e áudio de referência. Diálogo com vários locutores, podcasts, paisagens sonoras de cinema e TV, saída em 48 kHz. De acordo com a documentação do Model Studio da Alibaba Cloud, ele aceita até 3.000 caracteres de entrada, limita o áudio gerado a 240 segundos para podcasts e 120 segundos nos demais casos, opera a 3 solicitações por segundo e retorna WAV, MP3 ou PCM.
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next e Qwen-Audio-3.1-Realtime — reconhecimento, compreensão de áudio (emoção, música, som ambiente, localização de eventos) e conversa full-duplex, respectivamente. Realtime é o que a Alibaba está levando para o hardware: Qwen Office, Qoder, QwenNote A2, o robô de mesa QwenNote Eva e os óculos de IA Qwen.
Os cortes de preço abrangeram toda a linha, não apenas o TTS: síntese caiu cerca de 70%, tempo real caiu cerca de 85%, reconhecimento caiu até 95%. A Alibaba também abriu o código-fonte do Qwen-Audio-Agent, um framework para criar agentes de voz em tempo real, e lançou o Qwen3.8-LiveTranslate com latência reduzida para menos de 2,5 segundos.

O placar

• Preço — Qwen-Audio-3.1-TTS: cerca de 70% abaixo da geração anterior do Qwen-Audio, que colocava o nível 3.0 Plus perto de US$ 27,60 por 1 milhão de caracteres e o nível Flash perto de US$ 15. ElevenLabs Eleven v3: cerca de US$ 100 por 1 milhão de caracteres, conforme acompanhado pela Artificial Analysis, com o Flash em torno de US$ 50.
• Idiomas — Qwen-Audio-3.1-TTS: 16 idiomas mais 20 regiões de dialetos chineses. ElevenLabs Eleven v3: 74 idiomas.
• Pesos — Qwen-Audio-3.1-TTS: fechado, hospedado apenas no Alibaba Cloud Model Studio. ElevenLabs Eleven v3: fechado, hospedado apenas.
• Biblioteca de vozes — Qwen-Audio-3.1-TTS: clonagem nativa mais transferência de timbre entre idiomas; nenhum mercado público comparável. ElevenLabs: a maior biblioteca de vozes compartilhada do setor, além de clonagem instantânea a partir de cerca de 30 segundos de áudio.
• Controle de interpretação — Qwen-Audio-3.1-TTS: emoção, ritmo e estilo baseados em instruções, herdando as 86 tags de interpretação inline introduzidas com a 3.0. ElevenLabs Eleven v3: tags de áudio mais a plataforma ao redor (dublagem, agentes, estúdio).
• Benchmark independente — Qwen-Audio-3.1-TTS: ainda nenhum. ElevenLabs Eleven v3: 1.168 Elo no ranking Provider Voice Arena da Artificial Analysis em agosto de 2026.
Onde o desafiante realmente vence
Três coisas, e apenas uma delas é o preço.
O preço, obviamente. Um corte de 70% em relação a um fornecedor incumbente que cobra US$ 100 por milhão de caracteres não é uma diferença de arredondamento. É a diferença entre um produto com o qual você faz protótipos e um produto que você entrega a todos os usuários. Se você está gerando narração em volume, a economia anual não é um item de linha que você precisa defender internamente — ela se defende sozinha.
Chinês, sem ambiguidade. Vinte regiões dialetais chinesas são um fosso ao qual nada do que a ElevenLabs oferece chega perto. Se o seu produto atende usuários da China continental, ou falantes de cantonês, ou um público da diáspora que alterna de idioma no meio da frase, a comparação termina antes mesmo de começar.
Transferência de timbre entre idiomas. O Qwen-Audio-3.1-TTS pega numa voz e transporta-a naturalmente entre mandarim, cantonês, inglês e japonês. Esta é uma capacidade específica com um caso de uso específico — uma única voz de marca que sobrevive a uma mudança de idioma — e é um verdadeiro diferenciador para quem localiza um único apresentador em vez de escalar um novo para cada mercado.
Onde a ElevenLabs ainda vence, e não é por pouco
A amplitude de idiomas é a primeira coisa, e é a maior. Setenta e quatro idiomas contra dezesseis não é uma lacuna que se fecha com um anúncio de preços. Se você lança em polonês, turco, vietnamita e português, a ElevenLabs cobre você hoje, e o Qwen-Audio-3.1-TTS não.
O segundo é o ecossistema. A ElevenLabs não é um endpoint de síntese; é uma plataforma de conteúdo. Uma biblioteca de vozes compartilhada que você pode licenciar em vez de clonar, fluxos de trabalho de dublagem, infraestrutura de agentes, um produto de estúdio, uma superfície de API documentada com anos de bibliotecas de cliente por trás. Migrar para longe disso é um projeto, não uma mudança de configuração, e as equipes que construíram sobre isso sabem exatamente do que abririam mão.
O terceiro é algo mais difícil de nomear e que vale a pena nomear mesmo assim: a percepção de naturalidade em uma única voz em inglês. A síntese do Qwen tem sido historicamente excelente em chinês e apenas muito boa em inglês e, embora o lançamento 3.1 afirme melhorar a entrega multilíngue, ainda não existe um teste de escuta independente sobre o novo modelo. Qualquer um que lhe diga que sabe como soa a nova voz do Qwen em inglês está chutando.
O número que ninguém deveria citar ainda
Esta é a parte da história que será deturpada na cobertura, então aqui está de forma clara. O Qwen-Audio-3.1-TTS não tem nenhuma pontuação de benchmark independente. Seu antecessor, Qwen-Audio-3.0-TTS-Plus, estava com 1.234 de Elo no ranking Provider Voice Arena da Artificial Analysis em meados de agosto de 2026, ocupando entre a segunda e a quinta posição nessa lista. O Qwen-Audio-3.1-TTS ainda não foi adicionado a nenhuma arena. Toda alegação de qualidade nos materiais de lançamento da Alibaba é informada pelo fornecedor e não reproduzida.
Isso não torna as alegações falsas. Torna-as não verificadas, e significa que o enquadramento honesto deste confronto, neste momento, é: um modelo com preço e sem pontuação, contra um modelo com pontuação e um preço muito mais alto. Qualquer coisa mais forte que isso é especulação vestida com as roupas de um benchmark.

A mesma disciplina aplica-se à latência. O número de destaque da Alibaba para o primeiro token no lado ASR desta família — 92 milissegundos — vem do próprio benchmark de alta concorrência da empresa sobre uma especificação de 0,6B, e não de testes de terceiros, e as análises publicadas desde o lançamento observam que ASR e TTS são produtos separados num pipeline, e não um único modelo ponta a ponta, e que relatos da comunidade descrevem uma latência que se acumula em diálogos longos sob um padrão de pseudo-streaming. Trate os números de latência dos fornecedores em toda esta família como limites máximos, e não como experiência medida.
Quanto vale, na prática, o corte de preço
Considere uma carga de trabalho realista: um produto que sintetiza 20 milhões de caracteres de narração por mês em inglês e mandarim. Com o preço de aproximadamente US$ 100 por milhão de caracteres do ElevenLabs Eleven v3, isso dá cerca de US$ 2.000 por mês, ou US$ 24.000 por ano. À tarifa de aproximadamente US$ 27,60 por milhão do Qwen-Audio-3.0-TTS-Plus, o mesmo volume já custava cerca de US$ 552 por mês. Aplique o corte de ~70% anunciado pela Alibaba em 23 de setembro e a mesma carga de trabalho passa a custar algumas centenas de dólares por mês.
Nenhum desses valores é um preço de tabela com o qual você possa firmar um contrato — a ElevenLabs cobra em créditos por meio de níveis de assinatura, e os cortes da Alibaba são reduções percentuais sobre tarifas que variam por região e por nível. Mas a forma da comparação é inequívoca, e é essa forma que serve de base para o seu orçamento.
Uma ressalva que vale a pena sinalizar para quem modela isso com cuidado: a Alibaba Cloud mudou a cobrança de sua transcrição em tempo real no nó de Singapura de medição por duração para medição por tokens, a US$ 0,93 por milhão de tokens de entrada e US$ 0,70 por milhão de tokens de saída. A cobrança por tokens é menos previsível do que a cobrança por duração quando você não controla em quantos tokens um determinado trecho de áudio se transforma, e ruído, silêncio e contexto de vários turnos inflam o consumo de tokens. Um corte anunciado de 70% não se traduz automaticamente em uma economia de 70% no seu tráfego específico.
Como realmente executar o switch
Se estiver a avaliar isto, a coisa útil a saber é quanto uma migração lhe custa em tempo de engenharia. Ambos os modelos são APIs alojadas fechadas, por isso estará a integrar-se com um endpoint HTTP de qualquer forma, e o trabalho é um cliente, uma política de repetição e um inventário de vozes — não uma rearquitetura.
É aí que o formato do OrcaRouter ajuda, com uma ressalva honesta logo de início: não roteamos o Qwen-Audio-3.1-TTS nem qualquer modelo Qwen-Audio. Os endpoints de fala da Alibaba estão fora do nosso escopo, e o mesmo vale para a ElevenLabs. O que cobrimos é a camada de inferência ao redor deles — uma única chave de API para mais de 200 modelos de texto com 0% de markup, ou seja, o preço de tabela do provedor repassado na íntegra, de modo que um corte de preço de um fornecedor entra em vigor do nosso lado no mesmo dia, e não depois de um ciclo de reprecificação. Para equipes que constroem a aplicação que impulsiona um pipeline de fala — o sumarizador, o gerador de roteiro, o planejador de conteúdo —, isso significa um contrato em vez de vários, failover automático quando um upstream se degrada, e uma DSL de roteamento para compor modelos em uma única chamada. Isso não quer dizer que você chame a voz da Qwen por meio de nós. Quem diz o contrário não leu o catálogo.
Quem deve se mover e quem deve esperar
Mude agora se sua carga de trabalho é prioritariamente em chinês, se a cobertura de dialetos está na sua lista de requisitos, se o custo por volume é a restrição que o tem mantido numa voz mais barata, mas pior, ou se você precisa de uma única voz de marca que sobreviva a uma troca de idioma. O preço de 23 de setembro torna a economia difícil de contestar, e a qualidade do chinês já era competitiva antes disso.
Espere se você entrega em mais de cerca de dezesseis idiomas, se seu produto depende de uma biblioteca de vozes licenciável em vez de clonagem, se você está profundamente envolvido nas ferramentas de dublagem ou de agentes de uma plataforma, ou se seu processo de compras exige uma pontuação de qualidade independente antes da aprovação final. Nenhum desses é um obstáculo permanente, mas nenhum deles foi resolvido por uma redução de preço.
E observe uma coisa em particular: se o Qwen-Audio-3.1-TTS aparece numa arena de escuta cega. No momento em que aparecer, esta comparação deixa de ser sobre preço e número de idiomas e passa a ser sobre se a voz mais barata é realmente tão boa. É essa a pergunta que o lançamento não respondeu.
