
Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS: O Que Dois Meses Renderam
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 495 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 186 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
O Qwen-Audio-3.0-TTS foi lançado em 20 de julho de 2026 e foi direto para o topo dos rankings independentes de fala — o nível Plus alcançou 1.238 de Elo no ranking Provider Voice Arena da Artificial Analysis, em segundo lugar. Nove semanas depois, em 23 de setembro de 2026, o fornecedor anunciou o Qwen-Audio-3.1-TTS na Apsara Conference em Hangzhou, com um corte de preço de cerca de 70%. Esse momento torna esta uma comparação incomum: o modelo que está sendo substituído não está obsoleto; ele foi avaliado por benchmarks, tem resultados comprovados e ainda está perto do topo. Portanto, a verdadeira questão não é qual dos dois é melhor. É o que mudou especificamente, se algo disso importa para sua carga de trabalho e o que acontece com a pontuação em que você já confia quando o sucessor não recebeu nenhuma pontuação.
Dois meses, cinco endpoints, uma família
A Alibaba não lançou apenas um modelo. O lançamento 3.1 abrange cinco: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next e Qwen-Audio-3.1-Realtime. Para quem atualmente chama Qwen-Audio-3.0-TTS, apenas um deles é substituto direto — o nível TTS básico — e um é um produto genuinamente novo, em vez de uma atualização.
Vale a pena entender o segundo, mesmo que você nunca o use. O Qwen-Audio-3.1-TTS-Next é o que a Alibaba chama de modelo "Audiogen": uma única passagem que produz voz, efeitos sonoros e ambiência de fundo juntos a partir de texto, timestamps e áudio de referência. Diálogo com vários falantes, montagem de podcast, paisagens sonoras de cena, saída de 48 kHz. A documentação do Model Studio da Alibaba Cloud lista seus limites de forma clara — 3.000 caracteres de entrada, 240 segundos de áudio gerado para podcasts e 120 segundos em outros casos, 3 solicitações por segundo, saída em WAV, MP3 ou PCM, e aceita até três clipes de referência de 30 segundos cada, em WAV, MP3 ou OGG Opus. Entrada de referência em PCM bruto não é suportada. O preço é de US$ 0,848 por milhão de tokens de entrada e US$ 1,696 por milhão de tokens de saída no nó de Pequim, excluindo tarifas promocionais, e ele lida apenas com chinês e inglês.
Se você está usando o 3.0-TTS e seu trabalho é "transformar este roteiro em uma voz", nada disso muda sua integração. Se o seu trabalho é "montar um podcast com dois apresentadores e trilhas de fundo", o 3.1-TTS-Next é uma categoria de produto diferente e possivelmente a razão para sequer olhar para este lançamento.
A atualização, linha por linha

• Idiomas — Qwen-Audio-3.1-TTS: 16 idiomas informados pelo fornecedor, com sete adicionados em relação à geração anterior. Qwen-Audio-3.0-TTS: 16 idiomas, conforme listado na cobertura publicada do lançamento de julho.
• Dialetos chineses — Qwen-Audio-3.1-TTS: 20 regiões de dialeto, mantidas. Qwen-Audio-3.0-TTS: 20 regiões de dialeto.
• Transferência de timbre entre idiomas — Qwen-Audio-3.1-TTS: sim, uma única voz mantida em mandarim, cantonês, inglês e japonês. Qwen-Audio-3.0-TTS: não oferecido.
• Controle de locução — Qwen-Audio-3.1-TTS: controle de emoção, ritmo e estilo baseado em instruções. Qwen-Audio-3.0-TTS: 86 tags de locução em linha.
• Entrada de referência com ruído — Qwen-Audio-3.1-TTS: lida diretamente com áudio de referência ruidoso ou com eco, sem modo separado de redução de ruído. Qwen-Audio-3.0-TTS: espera-se áudio de referência limpo.
• Pontuação independente — Qwen-Audio-3.1-TTS: nenhuma ainda. Qwen-Audio-3.0-TTS-Plus: 1.238 Elo no ranking Provider Voice Arena da Artificial Analysis em agosto de 2026.
A contagem de idiomas não bate, e isso importa
Isto é uma coisa pequena que será amenizada em todos os outros lugares, então vale a pena dizer. O material de lançamento da Alibaba diz que o nível 3.1 de TTS adiciona sete idiomas. A cobertura publicada da geração 3.0 de julho — incluindo nossos próprios artigos comparativos daquele mês — listava 16 idiomas para o nível 3.0. Sete somados a dezesseis são vinte e três, não dezesseis, e a Alibaba não publicou uma reconciliação dos dois números.
As explicações possíveis não são nada glamourosas: o número 3.1 pode contar um conjunto diferente, o valor 3.0 pode ter sido superestimado no lançamento, ou "adiciona sete" pode descrever o nível ASR em vez do TTS. Não sabemos qual delas. O que sabemos é que a contagem de idiomas em ambos os lados dessa comparação é um número informado pelo fornecedor que nunca foi auditado de forma independente, e que qualquer pessoa que cite "16 idiomas" como fato concreto sobre qualquer um dos modelos está citando um slide de marketing. Verifique os idiomas específicos de que você precisa na documentação do Model Studio antes de planejar com base em uma contagem.

O controle de instruções é a mudança que realmente aparece no código
De tudo na versão 3.1 do TTS, esta é a que altera a forma como você escreve seus prompts. A geração 3.0 controlava a entrega por meio de 86 tags inline — um vocabulário fixo que você precisava aprender, inserir nas posições certas e que fazia exatamente o que dizia e nada mais. O nível 3.1 substitui isso por instrução em linguagem natural: você descreve a emoção, o ritmo, o estilo que deseja, e o modelo interpreta.
A diferença prática é expressividade versus previsibilidade. Um vocabulário de tags é um contrato — a mesma tag produz a mesma entrega todas as vezes, que é o que você quer em um pipeline de produção em que uma voz precisa ser consistente ao longo de dez mil clipes. A instrução em formato livre é mais ampla, mas mais solta, e herda o problema habitual de sensibilidade a prompts: duas formulações de "caloroso, mas não sentimental" não terão o mesmo efeito, e duas chamadas da mesma formulação em dias diferentes também não.
Se o seu pipeline atual foi construído sobre essas 86 tags, a atualização não é gratuita. Você está trocando uma superfície de controle determinística por uma probabilística, e o trabalho de portar não é a chamada de API — é revalidar cada template de prompt que você possui em relação à interpretação do novo modelo. Reserve orçamento para isso antes de reservar orçamento para a economia.
Transferência de timbre entre idiomas, e para que ela realmente serve
Uma voz de referência, mantida em mandarim, cantonês, inglês e japonês, preservando a sua identidade à medida que o idioma muda. No papel, isto parece um item de uma lista de funcionalidades. Na prática, resolve um problema específico e dispendioso: um único apresentador que tem de existir em mais de um idioma sem soar como uma pessoa diferente em cada um.
O contorno tradicional é escalar um ator de voz separado para cada idioma e aceitar que a voz da sua marca agora são quatro vozes que compartilham um roteiro. A alternativa tem sido clonar um único locutor em cada idioma, que é exatamente o fluxo de trabalho em que vozes clonadas tendem a se desviar — o sotaque permanece, o timbre se adelgaça, e os ouvintes percebem dentro de uma frase. A transferência de timbre entre idiomas é a afirmação de que nenhum dos dois compromissos é necessário.
Isso também está, neste momento, totalmente não verificado. Não existe nenhum teste de escuta de terceiros sobre o Qwen-Audio-3.1-TTS em nenhum idioma, e as próprias demonstrações da Alibaba são a única evidência de que a transferência se sustenta. Se essa capacidade é o motivo pelo qual você está considerando a atualização, teste-a com seu próprio áudio de referência antes de decidir — isso é um experimento de cinco minutos e é o único que responde à pergunta.
O que o corte de preço faz com um projeto 3.0
A Alibaba cortou os preços de fala em toda a linha: a síntese em cerca de 70%, o tempo real em cerca de 85% e o reconhecimento em até 95%. O ajuste entrou em vigor no Alibaba Cloud Model Studio em 22 de setembro de 2026, às 00:00, horário de Pequim, abrangendo as regiões de Pequim e Singapura, e aplica-se aos endpoints 3.1 TTS e 3.0 realtime. Após o ajuste, o nível TTS Flash é tabelado em 1,5 yuan por milhão de tokens de entrada e 12 yuan por milhão de tokens de saída; o nível Flash do realtime é tabelado em 1,5 para entrada de texto, 6 para entrada de áudio, 4,5 para saída de texto e 12 para saída combinada de texto e áudio, por milhão de tokens.
Aqui está a parte que importa se você já está usando o 3.0-TTS. O nível 3.0 Plus estava sendo cotado perto de US$ 27,60 por milhão de caracteres no Artificial Analysis ao longo de agosto, com o nível Flash perto de US$ 15. Se a redução de ~70% se aplicar ao nível que você usa, sua conta na mesma carga de trabalho cai para aproximadamente um terço do que era — sem você mudar uma linha de código. O incomum deste lançamento é que, para um cliente do 3.0, o corte de preço vale mais do que a atualização do modelo, e ele chega quer você migre ou não.
Duas ressalvas que vale a pena manter em mente. Os cortes percentuais são cotados com base em tarifas que variam por região e por nível, portanto o valor de destaque de 70% não é uma promessa sobre o seu tráfego específico. E a Alibaba Cloud mudou a cobrança de transcrição em tempo real no nó de Singapura de medição baseada em duração para medição baseada em tokens — US$ 0,93 por milhão de tokens de entrada e US$ 0,70 por milhão de tokens de saída — o que é uma base menos previsível quando silêncio, ruído e contexto de múltiplos turnos inflam o consumo de tokens. Compare a nova tabela de preços com o seu próprio áudio, não com o comunicado de imprensa.
Onde o Qwen-Audio-3.0-TTS ainda é a escolha certa
Três casos, e não são casos extremos.
Quando você precisa de um número que consiga defender. Qwen-Audio-3.0-TTS-Plus tem um Elo independente de 1.238 — o mesmo ranking mostra 1.259 para esse modelo em setembro, ainda em segundo lugar, então a pontuação derivou para cima em vez de decair — de uma arena de escuta cega com milhares de votos por trás. Qwen-Audio-3.1-TTS não tem nenhuma pontuação de arena. Se o seu processo de aprovação exige evidências de terceiros, o modelo mais antigo é o que tem isso, e um corte de preço não muda isso.

Quando o determinismo supera a expressividade. Se o seu pipeline de produção é construído sobre a superfície de controle de 86 tags, você tem um sistema sobre cuja saída pode raciocinar. O controle baseado em instruções é mais capaz e menos previsível, e o custo de migração é real.
Quando nada na atualização afeta sua carga de trabalho. Se você sintetiza mandarim e inglês em volume moderado com uma voz de referência limpa e um conjunto fixo de tags de entrega, então transferência de timbre entre idiomas, robustez a entradas ruidosas e sete idiomas adicionais estão todos resolvendo problemas que você não tem. Aceite a redução de preço, fique com o modelo.
Executando ambos sem executar duas integrações
A parte incômoda de uma troca de geração para geração é que muitas vezes você quer ambos os modelos ativos ao mesmo tempo — 3.0 para o caminho de produção com a pontuação por trás, 3.1 para os novos idiomas e o recurso de transferência, e uma maneira de mover o tráfego entre eles sem uma reimplantação. Ambos são APIs hospedadas fechadas no Alibaba Cloud Model Studio, então isso são dois endpoints, dois limites de taxa e dois modos de falha por trás de um recurso.
Uma nota honesta sobre onde nos posicionamos: a OrcaRouter não roteia o Qwen-Audio-3.1-TTS nem qualquer modelo Qwen-Audio, e não roteamos os endpoints de fala da Alibaba. O que oferecemos é a camada de inferência de texto em torno de um pipeline como este — uma única chave de API para mais de 200 modelos com 0% de markup, preço de tabela do provedor repassado diretamente, de modo que um corte de preço do fornecedor chega ao nosso lado no mesmo dia, e não depois de um ciclo de reprecificação. Se o serviço que impulsiona seu pipeline de fala é um gerador de roteiro, um sumarizador ou um planejador de conteúdo, isso significa um único contrato em vez de vários, failover automático quando um upstream se degrada, e uma DSL de roteamento para compor modelos em uma única chamada. Isso não significa que você chama a voz do Qwen por meio de nós, e qualquer página que sugira o contrário está errada sobre o nosso próprio catálogo.
O resumo honesto
O Qwen-Audio-3.1-TTS é um verdadeiro upgrade com três acréscimos que importam — controle de entrega baseado em instruções, transferência de timbre entre idiomas e robustez a áudio de referência ruim — além de uma redução de preço que vale mais do que qualquer um deles. O Qwen-Audio-3.0-TTS não foi superado da forma como um modelo de dois meses normalmente é: ele ainda detém uma pontuação de benchmark independente que seu sucessor não conquistou, e ainda cobre a gama de dialetos chineses na qual se baseia a maior parte da diferenciação desta família.
Então a decisão é mais restrita do que o marketing sugere. Se você está gerando em volume, a mudança de preços já está do seu lado. Se você precisa dos novos idiomas ou da transferência de timbre, migre e valide o recurso com seu próprio áudio primeiro. Se você precisa de um número de qualidade defensável, espere até que Qwen-Audio-3.1-TTS apareça em uma arena de escuta cega — esse é o único evento que resolveria isso, e até que aconteça, a posição honesta é que o modelo mais novo é o mais barato e o modelo mais antigo é o comprovado.
