Um cartão de título principal gerado para StepAudio 3 TTS vs Qwen-Audio-3.0-TTS com a chamada 'OrcaRouter · radar de modelos — frente a frente', a manchete 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS' e o subtítulo 'Um tem uma pontuação de arena de escuta às cegas. O outro foi lançado sete semanas depois da última votação', acima de dois cartões de modelo arredondados de cada lado de uma marca de versus.
Guides & Insights

StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: Um deles tem uma pontuação na Arena, e não é o novo

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Aqui está a comparação inteira em uma linha. Qwen-Audio-3.0-TTSestá no Text-to-Speech Arena com um Elo de 1.234 para seu nível Plus — uma pontuação obtida em 2.502 votos de audição cega. StepAudio 3 TTS, lançado pela StepFun em 15 de setembro de 2026, não figura nesse ranking de forma alguma. Seu antecessor está: o StepAudio 2.5 TTS tem um Elo de 1.209 com 1.306 votos.

Então a pergunta honesta não é "qual soa melhor". É se uma diferença de 25 pontos de Elo, medida na geração anterior, sobrevive a um lançamento que a StepFun diz ter melhorado a prosódia e cortado o preço em mais da metade. Ninguém ainda realizou essa votação, e tudo abaixo está organizado em torno dessa lacuna nas evidências, em vez de fingir que ela não existe.

O quadro, como ele realmente está hoje

Vale a pena ver a classificação real, porque vários textos que circulam citam uma versão desatualizada dela. A arena de escuta cega classifica modelos de síntese por qual amostra os votantes preferiram. Percorra a linha superior do painel de vozes do provedor:

• Cartesia Sonic 3.6 — Elo 1.277, agosto de 2026, $49,0 por milhão de caracteres

• Inworld Realtime TTS-2 — Elo 1.243, agosto de 2026, $20,8 por milhão de caracteres

• SpeechifyAI Simba 3.2 — Elo 1.238, julho de 2026, $6,6 por milhão de caracteres

Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1.234, julho de 2026, US$ 27,6 por milhão de caracteres, 8 vozes da arena

• VUI Labs Luna TTS — Elo 1.229, junho de 2026, US$ 80,0 por milhão de caracteres

• Inworld Realtime TTS-2 Flash — Elo 1.213, agosto de 2026, US$ 10,4 por milhão de caracteres

• StepFun StepAudio 2.5 TTS — Elo 1.209, agosto de 2026, US$ 85,0 por milhão de caracteres, 8 vozes da arena

Google Gemini 3.1 Flash TTS — Elo 1.204, abril de 2026, US$ 18,3 por milhão de caracteres

Screenshot of the Artificial Analysis Provider Voice Arena text-to-speech leaderboard, showing Cartesia Sonic 3.6 first at Elo 1,277, Alibaba Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,234 over 2,502 samples at $27.6 per million characters, and StepFun StepAudio 2.5 TTS seventh at Elo 1,209 over 1,306 samples at $85.0 per million characters, with confidence intervals of -14/+14 and -16/+16 respectively.

Duas coisas saltam imediatamente dessa lista. A primeira é que o nível Plus do Qwen não é o líder — é o quarto, atrás de Cartesia, Inworld e Speechify, e o número 1.234 que é citado como uma coroa é uma pontuação de meio de tabela em um ranking que já mudou desde então. A segunda é que o StepAudio 2.5 TTS foi rodado novamente em agosto de 2026 e ficou em sétimo, 25 pontos de Elo atrás do Qwen, a um preço mais de três vezes maior.

E uma terceira coisa que importa mais do que tudo isso: olhe para os intervalos de confiança. O nível Plus do Qwen está listado em −14/+14 em 2.502 amostras. O StepAudio 2.5 TTS está listado em −16/+16 em 1.306 amostras. Esses intervalos se sobrepõem. Uma diferença de 25 pontos entre dois modelos cujas barras de erro se estendem 14 e 16 pontos para cada lado não é uma diferença de qualidade demonstrada — são dois modelos que a arena não consegue separar no momento, classificados em uma ordem que algumas centenas de votos a mais poderiam inverter.

A generated scoreboard titled 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS — the scoreboard'. The StepAudio column reads Arena Elo 'not scored yet', Samples 'none', Price '2.5 yuan / 10,000 chars', Voices 'not published', Languages 'Chinese-first', Request size 'not published'. The Qwen column reads Arena Elo '1,234, Plus tier', Samples '2,502', Price '$27.6 / 1M chars', Voices 'over 1,000', Languages '16 + 20 dialects', Request size '20,000 chars'. Footer: 'Qwen figures per the Artificial Analysis text-to-speech arena; StepAudio 3 TTS has no arena score yet.'

O que o ponto de dados ausente lhe custa

O StepAudio 3 TTS é o modelo com que a StepFun substituiu o StepAudio 2.5 TTS, e o lançamento afirma oferecer controle sobre timbre, entonação, ritmo e pausas para respiração, além de comportamento paralinguístico — riso, hesitação, gagueira, repetição, autocorreção — proporcionado por uma arquitetura de streaming em que geração e reprodução se sobrepõem.

Esse é exatamente o conjunto de qualidades que a arena mede. É também exatamente por isso que a ausência de uma pontuação é frustrante, e não fatal: o benchmark que responderia à pergunta existe, é executado publicamente e simplesmente não foi executado de novo desde que o novo modelo foi lançado. Qualquer pessoa que lhe diga que o StepAudio 3 TTS soa melhor que o Qwen-Audio-3.0-TTS está extrapolando de um predecessor que perdeu por uma margem dentro de suas próprias barras de erro.

O preço é a parte que está totalmente documentada, e ele variou muito.

O StepAudio 3 TTS cobra 2,5 yuan por 10.000 caracteres na própria plataforma da StepFun. O StepAudio 2.5 TTS cobrava 5,8. Na própria coluna de preços baseada em caracteres da arena, o modelo mais antigo custava US$ 85,00 por milhão de caracteres; 2,5 yuan por 10.000 caracteres equivale a cerca de US$ 35 por milhão nas taxas de câmbio recentes — uma conversão que é nossa, e não um valor publicado, e que vale a pena refazer de acordo com a sua própria região e câmbio. Isso representa um corte de quase 60% no mesmo item de linha.

Ele ainda está acima do Qwen. O Qwen-Audio-3.0-TTS-Plus está listado a US$ 27,6 por milhão de caracteres, e o nível Flash é ainda mais barato, com o Alibaba Cloud Model Studio cobrando a síntese por caractere de entrada em vez de pelo áudio produzido — a saída não é cobrada separadamente. Plataformas de terceiros que listam o nível Flash citam tarifas na casa dos dezessete a dezenove por milhão, embora a variação regional torne qualquer número de referência isolado não confiável.

Então, o formato disso é: a StepFun reduziu o custo de síntese aproximadamente pela metade, fechou a maior parte da distância até a Qwen, mas não a ultrapassou. Se o preço por caractere é sua restrição vinculante, o argumento fica mais restrito, mas a resposta não muda. Se não for, o preço deixou de ser o motivo para escolher qualquer um dos modelos.

O inventário de vozes e a cobertura de idiomas não estão próximos.

É aqui que a comparação deixa de ser uma questão de julgamento e se torna uma questão de especificação.

• Inventário de vozes — Qwen-Audio-3.0-TTS com mais de 1.000 vozes em seus níveis vs StepAudio 3 TTS sem contagem publicada comparável

• Idiomas — Qwen-Audio-3.0-TTS: 16 idiomas, além de 20 dialetos chineses, com o nível Flash ajustado para idiomas com poucos recursos e autenticidade dialetal, versus StepAudio 3 TTS, com prioridade para o chinês e sem alegação de cobertura equivalente

• Tamanho da solicitação — Qwen-Audio-3.0-TTS: 20.000 caracteres por solicitação vs StepAudio 3 TTS: não divulgado

• Latência — O Qwen-Audio-3.0-TTS Flash tem como meta uma latência de primeiro pacote dentro de 200 ms, segundo a própria documentação da Alibaba, em comparação com o streaming do StepAudio 3 TTS, para o qual não há número publicado

• Divisão em níveis — Qwen-Audio-3.0-TTS Plus para expressividade e Flash para tempo real; seis vozes carro-chefe fixadas em um nível ou no outro vs. StepAudio 3 TTS em um único nível

• Superfície de controle — direção de entrega em linguagem natural do Qwen-Audio-3.0-TTS mais tags de expressão inline como [excited], [laughing], [whispers] incorporadas ao texto de entrada vs. prosódia inferida pelo modelo StepAudio 3 TTS a partir do contexto

• Clonagem de voz — StepAudio 3 TTS um valor fixo de 9,9 yuans por voz clonada em todos os seus níveis de TTS vs. clonagem do Qwen-Audio-3.0-TTS via Alibaba Cloud Model Studio

• Saída — Qwen-Audio-3.0-TTS com taxa de amostragem padrão de 24 kHz vs. StepAudio 3 TTS não divulgado

Essa linha da superfície de controle é a verdadeira diferença de design, e não é uma questão de qualidade. As tags de expressão do Qwen são explícitas e síncronas: você escreve a emoção no texto e o modelo a reproduz, o que as torna testáveis e adequadas para testes de regressão. A descrição da StepFun é a de um modelo que infere a hesitação ou o riso apropriados a partir do contexto, o que soa melhor quando acerta e é muito mais difícil de definir quando erra. Escolha conforme você prefira ser o autor da performance ou delegá-la.

Screenshot of Alibaba Cloud Model Studio documentation for qwen-audio-3.0-tts-flash, showing the model capabilities table with text input and audio output, function calling and fine-tuning unsupported, and a note that the Flash version controls first-packet latency within 200 ms.

Como decidir sem a medição

Você não consegue chegar a uma resposta apenas raciocinando a partir de números publicados, porque o dado decisivo não existe. Resta então testar, e testar esses dois tem um formato específico que vale a pena planejar.

Ambas são APIs comerciais somente hospedadas — Qwen-Audio-3.0-TTS por meio do Alibaba Cloud Model Studio, StepAudio 3 TTS por meio da plataforma aberta da StepFun. Nenhum dos dois tem pesos abertos, então não há uma rota auto-hospedada para avaliar. Sendo preciso sobre o que a OrcaRouter cobre aqui: os modelos de conversão de texto em fala no nosso catálogo hoje são a família OpenAI tts-1, o gpt-4o-mini-tts e as prévias do Gemini TTS do Google. Nenhum dos modelos deste artigo está nele, e o Qwen-Audio-3.0-TTS também não — nada aqui deve ser lido como uma afirmação de que nós os servimos.

A parte que de fato fica no OrcaRouter é a metade de texto do pipeline. Os scripts que sua camada de síntese lê são gerados por um modelo de linguagem, e esse é o componente que muda com mais frequência, custa mais para recontratar e é mais fácil de deixar sem versão fixada — quase 200 modelos de texto atrás de uma única API, failover automático, uma DSL de roteamento que compõe vários em uma só chamada e fusão de modelos quando o julgamento de um único modelo não basta, com o preço de tabela do provedor repassado sem acréscimo. Se você fizer uma avaliação cega entre esses dois modelos de síntese, gere o corpus por um único endpoint para que ambos os candidatos leiam a mesma entrada, e mantenha a camada de síntese atrás de uma interface que você possa trocar.

Onde isso deixa a decisão

Escolha o Qwen-Audio-3.0-TTS hoje se precisar de amplitude — mais de mil vozes, 16 idiomas e 20 dialetos, um teto documentado de 20.000 caracteres por solicitação, um nível de latência e um nível de expressividade, uma meta de 200 ms para o primeiro pacote, e uma tarifa inferior à da StepFun. É o modelo com uma medição por trás de si e a superfície mais ampla, e o seu Elo de quarto lugar é um resultado real, mesmo que não seja a coroa que lhe é atribuída.

Escolha o StepAudio 3 TTS se você está construindo com foco primeiro no chinês, quer um único nível em vez de uma decisão de seleção de nível, quer clonagem por uma tarifa fixa publicada e está disposto a ser um dos primeiros em um modelo que ainda não foi testado às cegas. Você está pagando cerca de 27% mais por caractere do que no nível Plus do Qwen em troca de uma melhoria de prosódia que se alega ser de uma geração em relação a um modelo que ficou 25 Elo atrás, com barras de erro sobrepostas.

O que resolveria a questão seria uma nova rodada da arena com o StepAudio 3 TTS no conjunto. Até que essa votação aconteça, isto é um modelo medido contra um não medido, e os 25 pontos que separam seus antecessores estão dentro do ruído — o que não é um ranking, e não deve ser vendido como tal.