
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: Um deles tem uma pontuação na Arena, e não é o novo
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Aqui está a comparação inteira em uma linha. Qwen-Audio-3.0-TTSestá no Text-to-Speech Arena com um Elo de 1.234 para seu nível Plus — uma pontuação obtida em 2.502 votos de audição cega. StepAudio 3 TTS, lançado pela StepFun em 15 de setembro de 2026, não figura nesse ranking de forma alguma. Seu antecessor está: o StepAudio 2.5 TTS tem um Elo de 1.209 com 1.306 votos.
Então a pergunta honesta não é "qual soa melhor". É se uma diferença de 25 pontos de Elo, medida na geração anterior, sobrevive a um lançamento que a StepFun diz ter melhorado a prosódia e cortado o preço em mais da metade. Ninguém ainda realizou essa votação, e tudo abaixo está organizado em torno dessa lacuna nas evidências, em vez de fingir que ela não existe.
O quadro, como ele realmente está hoje
Vale a pena ver a classificação real, porque vários textos que circulam citam uma versão desatualizada dela. A arena de escuta cega classifica modelos de síntese por qual amostra os votantes preferiram. Percorra a linha superior do painel de vozes do provedor:
• Cartesia Sonic 3.6 — Elo 1.277, agosto de 2026, $49,0 por milhão de caracteres
• Inworld Realtime TTS-2 — Elo 1.243, agosto de 2026, $20,8 por milhão de caracteres
• SpeechifyAI Simba 3.2 — Elo 1.238, julho de 2026, $6,6 por milhão de caracteres
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1.234, julho de 2026, US$ 27,6 por milhão de caracteres, 8 vozes da arena
• VUI Labs Luna TTS — Elo 1.229, junho de 2026, US$ 80,0 por milhão de caracteres
• Inworld Realtime TTS-2 Flash — Elo 1.213, agosto de 2026, US$ 10,4 por milhão de caracteres
• StepFun StepAudio 2.5 TTS — Elo 1.209, agosto de 2026, US$ 85,0 por milhão de caracteres, 8 vozes da arena
• Google Gemini 3.1 Flash TTS — Elo 1.204, abril de 2026, US$ 18,3 por milhão de caracteres

Duas coisas saltam imediatamente dessa lista. A primeira é que o nível Plus do Qwen não é o líder — é o quarto, atrás de Cartesia, Inworld e Speechify, e o número 1.234 que é citado como uma coroa é uma pontuação de meio de tabela em um ranking que já mudou desde então. A segunda é que o StepAudio 2.5 TTS foi rodado novamente em agosto de 2026 e ficou em sétimo, 25 pontos de Elo atrás do Qwen, a um preço mais de três vezes maior.
E uma terceira coisa que importa mais do que tudo isso: olhe para os intervalos de confiança. O nível Plus do Qwen está listado em −14/+14 em 2.502 amostras. O StepAudio 2.5 TTS está listado em −16/+16 em 1.306 amostras. Esses intervalos se sobrepõem. Uma diferença de 25 pontos entre dois modelos cujas barras de erro se estendem 14 e 16 pontos para cada lado não é uma diferença de qualidade demonstrada — são dois modelos que a arena não consegue separar no momento, classificados em uma ordem que algumas centenas de votos a mais poderiam inverter.

O que o ponto de dados ausente lhe custa
O StepAudio 3 TTS é o modelo com que a StepFun substituiu o StepAudio 2.5 TTS, e o lançamento afirma oferecer controle sobre timbre, entonação, ritmo e pausas para respiração, além de comportamento paralinguístico — riso, hesitação, gagueira, repetição, autocorreção — proporcionado por uma arquitetura de streaming em que geração e reprodução se sobrepõem.
Esse é exatamente o conjunto de qualidades que a arena mede. É também exatamente por isso que a ausência de uma pontuação é frustrante, e não fatal: o benchmark que responderia à pergunta existe, é executado publicamente e simplesmente não foi executado de novo desde que o novo modelo foi lançado. Qualquer pessoa que lhe diga que o StepAudio 3 TTS soa melhor que o Qwen-Audio-3.0-TTS está extrapolando de um predecessor que perdeu por uma margem dentro de suas próprias barras de erro.
O preço é a parte que está totalmente documentada, e ele variou muito.
O StepAudio 3 TTS cobra 2,5 yuan por 10.000 caracteres na própria plataforma da StepFun. O StepAudio 2.5 TTS cobrava 5,8. Na própria coluna de preços baseada em caracteres da arena, o modelo mais antigo custava US$ 85,00 por milhão de caracteres; 2,5 yuan por 10.000 caracteres equivale a cerca de US$ 35 por milhão nas taxas de câmbio recentes — uma conversão que é nossa, e não um valor publicado, e que vale a pena refazer de acordo com a sua própria região e câmbio. Isso representa um corte de quase 60% no mesmo item de linha.
Ele ainda está acima do Qwen. O Qwen-Audio-3.0-TTS-Plus está listado a US$ 27,6 por milhão de caracteres, e o nível Flash é ainda mais barato, com o Alibaba Cloud Model Studio cobrando a síntese por caractere de entrada em vez de pelo áudio produzido — a saída não é cobrada separadamente. Plataformas de terceiros que listam o nível Flash citam tarifas na casa dos dezessete a dezenove por milhão, embora a variação regional torne qualquer número de referência isolado não confiável.
Então, o formato disso é: a StepFun reduziu o custo de síntese aproximadamente pela metade, fechou a maior parte da distância até a Qwen, mas não a ultrapassou. Se o preço por caractere é sua restrição vinculante, o argumento fica mais restrito, mas a resposta não muda. Se não for, o preço deixou de ser o motivo para escolher qualquer um dos modelos.
O inventário de vozes e a cobertura de idiomas não estão próximos.
É aqui que a comparação deixa de ser uma questão de julgamento e se torna uma questão de especificação.
• Inventário de vozes — Qwen-Audio-3.0-TTS com mais de 1.000 vozes em seus níveis vs StepAudio 3 TTS sem contagem publicada comparável
• Idiomas — Qwen-Audio-3.0-TTS: 16 idiomas, além de 20 dialetos chineses, com o nível Flash ajustado para idiomas com poucos recursos e autenticidade dialetal, versus StepAudio 3 TTS, com prioridade para o chinês e sem alegação de cobertura equivalente
• Tamanho da solicitação — Qwen-Audio-3.0-TTS: 20.000 caracteres por solicitação vs StepAudio 3 TTS: não divulgado
• Latência — O Qwen-Audio-3.0-TTS Flash tem como meta uma latência de primeiro pacote dentro de 200 ms, segundo a própria documentação da Alibaba, em comparação com o streaming do StepAudio 3 TTS, para o qual não há número publicado
• Divisão em níveis — Qwen-Audio-3.0-TTS Plus para expressividade e Flash para tempo real; seis vozes carro-chefe fixadas em um nível ou no outro vs. StepAudio 3 TTS em um único nível
• Superfície de controle — direção de entrega em linguagem natural do Qwen-Audio-3.0-TTS mais tags de expressão inline como [excited], [laughing], [whispers] incorporadas ao texto de entrada vs. prosódia inferida pelo modelo StepAudio 3 TTS a partir do contexto
• Clonagem de voz — StepAudio 3 TTS um valor fixo de 9,9 yuans por voz clonada em todos os seus níveis de TTS vs. clonagem do Qwen-Audio-3.0-TTS via Alibaba Cloud Model Studio
• Saída — Qwen-Audio-3.0-TTS com taxa de amostragem padrão de 24 kHz vs. StepAudio 3 TTS não divulgado
Essa linha da superfície de controle é a verdadeira diferença de design, e não é uma questão de qualidade. As tags de expressão do Qwen são explícitas e síncronas: você escreve a emoção no texto e o modelo a reproduz, o que as torna testáveis e adequadas para testes de regressão. A descrição da StepFun é a de um modelo que infere a hesitação ou o riso apropriados a partir do contexto, o que soa melhor quando acerta e é muito mais difícil de definir quando erra. Escolha conforme você prefira ser o autor da performance ou delegá-la.

Como decidir sem a medição
Você não consegue chegar a uma resposta apenas raciocinando a partir de números publicados, porque o dado decisivo não existe. Resta então testar, e testar esses dois tem um formato específico que vale a pena planejar.
Ambas são APIs comerciais somente hospedadas — Qwen-Audio-3.0-TTS por meio do Alibaba Cloud Model Studio, StepAudio 3 TTS por meio da plataforma aberta da StepFun. Nenhum dos dois tem pesos abertos, então não há uma rota auto-hospedada para avaliar. Sendo preciso sobre o que a OrcaRouter cobre aqui: os modelos de conversão de texto em fala no nosso catálogo hoje são a família OpenAI tts-1, o gpt-4o-mini-tts e as prévias do Gemini TTS do Google. Nenhum dos modelos deste artigo está nele, e o Qwen-Audio-3.0-TTS também não — nada aqui deve ser lido como uma afirmação de que nós os servimos.
A parte que de fato fica no OrcaRouter é a metade de texto do pipeline. Os scripts que sua camada de síntese lê são gerados por um modelo de linguagem, e esse é o componente que muda com mais frequência, custa mais para recontratar e é mais fácil de deixar sem versão fixada — quase 200 modelos de texto atrás de uma única API, failover automático, uma DSL de roteamento que compõe vários em uma só chamada e fusão de modelos quando o julgamento de um único modelo não basta, com o preço de tabela do provedor repassado sem acréscimo. Se você fizer uma avaliação cega entre esses dois modelos de síntese, gere o corpus por um único endpoint para que ambos os candidatos leiam a mesma entrada, e mantenha a camada de síntese atrás de uma interface que você possa trocar.
Onde isso deixa a decisão
Escolha o Qwen-Audio-3.0-TTS hoje se precisar de amplitude — mais de mil vozes, 16 idiomas e 20 dialetos, um teto documentado de 20.000 caracteres por solicitação, um nível de latência e um nível de expressividade, uma meta de 200 ms para o primeiro pacote, e uma tarifa inferior à da StepFun. É o modelo com uma medição por trás de si e a superfície mais ampla, e o seu Elo de quarto lugar é um resultado real, mesmo que não seja a coroa que lhe é atribuída.
Escolha o StepAudio 3 TTS se você está construindo com foco primeiro no chinês, quer um único nível em vez de uma decisão de seleção de nível, quer clonagem por uma tarifa fixa publicada e está disposto a ser um dos primeiros em um modelo que ainda não foi testado às cegas. Você está pagando cerca de 27% mais por caractere do que no nível Plus do Qwen em troca de uma melhoria de prosódia que se alega ser de uma geração em relação a um modelo que ficou 25 Elo atrás, com barras de erro sobrepostas.
O que resolveria a questão seria uma nova rodada da arena com o StepAudio 3 TTS no conjunto. Até que essa votação aconteça, isto é um modelo medido contra um não medido, e os 25 pontos que separam seus antecessores estão dentro do ruído — o que não é um ranking, e não deve ser vendido como tal.
