Um cartão de título de destaque gerado com a manchete 'StepAudio 3 ASR vs Whisper Large v3 Turbo' e o subtítulo '1,7 por cento contra 4,6 por cento, e não existe teste frente a frente', acima do rodapé 'StepAudio segundo a Artificial Analysis; Whisper segundo a Hugging Face.'
Guides & Insights

StepAudio 3 ASR vs. Whisper Large v3 Turbo: 1,7% contra 4,6%, e ninguém executou o teste

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A comparação que você deseja não existe. StepAudio 3 ASR e Whisper Large v3 Turbo estão no mesmo índice Artificial Analysis AA-WER para fala para texto não-streaming — taxa de erro de palavras de 1,7% contra números na faixa de 4 a 5,5% — e até o final de setembro de 2026 ninguém publicou um confronto direto em áudio idêntico. Nem a StepFun, nem os mantenedores do Whisper, nem um laboratório independente. A própria documentação da StepFun faz benchmarks contra Doubao ASR 2.0, Seed 2.0 Lite e HY3.0 ASR Preview, todos produtos de ASR chineses. O lado do Whisper não tem nenhum fornecedor publicando comparações, porque o Whisper Large v3 Turbo está disponível para download há anos e seus números dependem de quem o está servindo.

Portanto, esta página faz a versão honesta: lê o único quadro que mede ambos, separa o que é comparável do que não é e afirma claramente onde as evidências se esgotam. A resposta curta é que a diferença na precisão é real e tem cerca de três pontos de largura, e a diferença em tudo o resto — preço, licença, capacidade de implantação — corre no sentido oposto e é maior.

O que cada um realmente é

StepAudio 3 ASR é um modelo de transcrição hospedado lançado pela StepFun em 15 de setembro de 2026 como parte da família de áudio StepAudio 3, composta por cinco modelos. Ele é acessado por meio de um único endpoint de streaming que retorna texto incremental durante a decodificação e uma transcrição final ao término. A StepFun o descreve como transcrição com um modelo de linguagem acoplado para dar contexto, ajustado para áudio médico, jurídico, financeiro, automotivo e de programação, e para entradas que quebram reconhecedores convencionais — fala sussurrada, fala rápida, fala conectada, canto e áudio com música ao fundo. Não há pesos abertos, nem caminho on-premise, nem opção de auto-hospedagem em nenhum nível. A tarifa de tabela publicada é de 2,8 yuans por hora, cerca de US$ 6,67 por 1.000 minutos no próprio eixo de preços do ranking.

Whisper Large v3 Turbo é um modelo de pesos abertos publicado pela OpenAI sob a licença MIT: 809 milhões de parâmetros, 99 idiomas, um derivado podado e ajustado do Whisper large-v3 com as camadas do decodificador reduzidas. Foi baixado milhões de vezes e é disponibilizado comercialmente por uma longa lista de plataformas, além de poder ser executado no seu próprio hardware. Essa última propriedade é toda a comparação, e é a razão pela qual a diferença de precisão não é o único número que importa.

A única placa que mede ambos

O índice AA-WER da Artificial Analysis relata a porcentagem de palavras transcritas incorretamente; quanto menor, melhor, e a versão 2 dele combina três conjuntos de dados: AA-AgentTalk com 50%, VoxPopuli-Cleaned-AA com 25% e Earnings22-Cleaned-AA com 25%. A visualização não streaming mostra 36 dos 71 modelos que ele acompanha. Ambos os modelos aparecem nela, o que é mais do que a maioria das comparações pode afirmar.

Leia como o quadro os lista:

• StepAudio 3 ASR — 1,7% AA-WER, aproximadamente US$ 6,67 por 1.000 minutos de áudio

• Whisper Large v3 Turbo, um endpoint hospedado — 4,6% AA-WER, cerca de US$ 0,67 por 1.000 minutos

• Whisper Large v3 Turbo, um segundo endpoint hospedado — 5,5% AA-WER, cerca de US$ 15,00 por 1.000 minutos

• Whisper Large v3, uma geração diferente de pesos abertos — 4,1% em um endpoint, 10,1% em outro

• StepAudio 2.5 ASR, geração anterior da StepFun — 4,7%

As duas últimas linhas do placar são as mais instrutivas, e não têm nada a ver com a StepFun. Os mesmos pesos abertos do Whisper pontuam 4,1% em um endpoint e 10,1% em outro. Essa é uma diferença de 6 pontos com parâmetros idênticos, produzida inteiramente por diferenças no serving: estratégia de divisão em blocos, hardware, configuração de decodificação e a forma como cada host lida com áudio mais longo do que seus limites internos. A própria nota de rodapé do placar diz isso, observando que, em um de seus conjuntos de dados, alguns modelos têm seu áudio dividido em blocos de cerca de nove minutos e outros em cerca de trinta segundos por causa de limites de tempo.

O que significa que a comparação "StepAudio 3 ASR vs Whisper Large v3 Turbo" é, na verdade, duas comparações sobrepostas. O modelo contra os pesos, e o modelo contra o endpoint que você acabou usando para benchmark. A segunda varia mais do que a primeira.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

De onde vem a lacuna de precisão, e quanto confiar nela

Três pontos na taxa de erro de palavras é uma diferença grande numa área em que os cinco melhores sistemas ficam dentro de 0,6 ponto uns dos outros. É também o único número desta comparação que foi medido por terceiros, e vem com ressalvas reais que cortam nos dois sentidos.

Contra o StepAudio 3 ASR: o número é um índice combinado, e a combinação é 50% AA-AgentTalk — um conjunto de dados de conversas entre agentes. Um modelo ajustado para transcrição específica de domínio com um LLM anexado para contexto é bem adequado a esse formato de áudio. Se ponderarmos o índice de outra forma, dando mais peso a fala lida ou a noticiário, a ordenação poderá ficar mais apertada. Também ainda não há relatório técnico publicado para o modelo ASR, nenhum conjunto de teste divulgado, nenhuma configuração de decodificação e nenhum protocolo reproduzível de alguém fora da StepFun.

Em comparação com o Whisper Large v3 Turbo: os 4,6% são o número de um endpoint hospedado, não uma propriedade do modelo. Os pesos são fixos e públicos; a pontuação, não. Uma equipe que executa os mesmos pesos com cuidado, com chunking adequado ao domínio e uma boa configuração de decodificador, pode alcançar um resultado significativamente melhor do que a linha do ranking — e uma equipe que os executa sem cuidado pode alcançar um resultado pior do que os 10,1% que a outra geração de pesos abertos registrou. O resumo honesto é que o lado de pesos abertos desta comparação tem um piso que você pode medir e um teto que você precisa conquistar.

O que falta é o número que resolveria a questão: ambos os sistemas, um único conjunto de áudio, um único protocolo de decodificação, publicado. Ninguém fez isso, e até que alguém o faça, "1,7% vs 4,6%" é uma comparação entre duas medições feitas sob condições diferentes, e não uma medição de dois sistemas entre si.

As outras quatro dimensões, nas quais o Whisper vence por uma margem maior

A precisão é a dimensão em que o StepFun vence. No restante da lista, o modelo de pesos abertos não chega perto, e são esses que decidem se uma implantação é sequer possível:

• Licença e pesos — pesos abertos com licença MIT com 809M de parâmetros vs uma API hospedada sem pesos publicados em nenhum nível.

• Implantação — auto-hospedada, no local, em rede isolada, ou por meio de dezenas de plataformas comerciais vs apenas a API da StepFun.

• Piso de custo — cerca de US$ 0,67 por 1.000 minutos em um endpoint hospedado, e ainda mais baixo se você mesmo o executar, em comparação com cerca de US$ 6,67 por 1.000 minutos na tarifa publicada do fornecedor.

• Residência de dados — o áudio nunca sai da infraestrutura sob seu controle vs. áudio enviado a um endpoint de terceiros.

• Risco de integração — o modelo não pode ser retirado, ter o preço reajustado ou ser marcado como obsoleto enquanto você o utiliza, porque você detém os pesos, em vez de uma tarifa de serviço hospedado que pode mudar com uma lista de preços.

• Comportamento com áudio longo — a divisão em blocos é decisão sua e pode ser ajustada por arquivo, em vez do que o endpoint do fornecedor faz internamente, o que não está documentado.

Essa diferença de preço é de cerca de dez para um em relação ao endpoint Whisper mais barato, e é a imagem espelhada do que aconteceu dentro da própria linha da StepFun: o modelo que este substitui, o StepAudio 2.5 ASR, estava listado a 0,15 yuan por hora, e o escalão atual está listado a 2,8. A StepFun aumentou a tarifa de transcrição em cerca de dezenove vezes para comprar precisão, o que o coloca num mercado diferente do de um modelo auto-hospedado de pesos abertos, em vez de uma versão mais cara dele.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Qual deles você deve escolher

A separação é mais limpa do que na maioria dos confrontos diretos:

• Escolha o Whisper Large v3 Turbo se o áudio for comum, o volume for alto, os dados não puderem sair da sua infraestrutura, ou você precisar que a implantação seja permanente e com preço estável. A licença MIT significa que a decisão de reverter é sua e ninguém pode voltar atrás.

• Opte pelo StepAudio 3 ASR se o áudio for genuinamente difícil — com sotaque, sussurrado, cantado ou com música ao fundo — ou se o domínio for um dos cinco para os quais a StepFun foi ajustada. É isso que o valor adicional proporciona, e nesse tipo de áudio uma diferença de três pontos na precisão é a diferença entre uma transcrição utilizável e uma etapa de correção manual.

• Não escolha nenhum dos dois de forma exclusiva se você não souber qual é o seu áudio. O custo de errar é assimétrico: o caminho de pesos abertos pode ser testado no seu próprio hardware pelo preço de uma hora de GPU, e o caminho hospedado não custa nada para testar, mas compromete você com uma tarifa que você não pode controlar.

O argumento a favor de um híbrido é mais forte aqui do que na maioria das comparações, e a razão é a dispersão dos endpoints no ranking. Como os mesmos pesos do Whisper obtêm pontuações que variam de 4,1% a 10,1%, dependendo de quem os serve, a medida prática é rotear o caminho de pesos abertos por mais de um host, em vez de se comprometer com um único — que é o que o failover automático oferece, e é o mesmo mecanismo que permite colocar um modelo hospedado à frente de um caminho de produção sem apostar o caminho nele.

Como isto se encaixa em uma stack, e o que servimos e o que não servimos

Independentemente do que você escolher para transcrição, a transcrição vai para algum lugar. Um sumarizador, uma extração estruturada, uma verificação de conformidade, um índice de busca — essas chamadas caem em modelos de texto comuns, e são a parte da conta que escala com o uso, e não com os minutos de áudio. O próprio modelo em tempo real da StepFun anuncia chamadas de ferramentas e execução assíncrona de tarefas longas, o que significa que até a camada de áudio está constantemente entregando trabalho a algo que não é um modelo de áudio.

Para ser explícito quanto ao escopo, porque seria fácil dar a entender o contrário: nem o StepAudio 3 ASR nem o Whisper Large v3 Turbo estão no OrcaRouter. O StepAudio é acessado pela própria API da StepFun, e os pesos do Whisper são seus para executar ou levar a uma plataforma de hospedagem. O que o OrcaRouter oferece é a camada de delegação que a transcrição alimenta — quase 200 modelos de texto por trás de uma única API, com failover automático para que uma chamada downstream não morra junto com um único provedor, uma DSL de roteamento que compõe vários modelos em uma única chamada, e fusão de modelos quando o julgamento de um único modelo não é suficiente. Onde um provedor publica uma tarifa, esse preço de tabela é repassado sem markup, de modo que uma mudança de preço chega à sua fatura no dia em que é anunciada — o que, dado que esta comparação inclui um fornecedor que aumentou sua tarifa de transcrição dezenove vezes em um único lançamento, não é um benefício hipotético.

Se você está prestes a gastar dinheiro de verdade na questão da precisão, a sequência barata é esta: rode os pesos abertos no seu próprio áudio primeiro, porque você pode, e porque o número que você obtiver será mais relevante do que o de qualquer leaderboard. Depois decida se a lacuna que resta vale dez vezes a tarifa. A maioria das equipes vai descobrir que vale a pena para uma fatia do seu tráfego e não para o resto, e isso é um problema de roteamento, não uma escolha de modelo.

O que resolveria isso

Um teste publicado. Os dois sistemas, o mesmo áudio, o mesmo protocolo de decodificação, uma divisão honesta entre fala lida, áudio conversacional e os casos difíceis para os quais a StepFun afirma ter ajustado. Enquanto isso não existir, a comparação é um índice de terceiros de um lado e um conjunto de pesos abertos com uma pontuação variável do outro, e a única forma responsável de interpretá-la é como um ponto de partida, e não como uma resposta.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.