Um cartão de título hero gerado com a manchete 'StepAudio 3 ASR vs StepAudio 3' e o subtítulo 'Um é um modelo. O outro são cinco produtos com um nome', acima do rodapé 'Números da StepFun conforme publicados em setembro de 2026.'
Guides & Insights

StepAudio 3 ASR vs StepAudio 3: Não Existe Modelo com Esse Nome

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pesquise por StepAudio 3 e você encontrará uma família, não um modelo. O lançamento de áudio da StepFun de 15 de setembro de 2026 colocou cinco produtos sob esse nome — Realtime, ASR, conversão de texto em fala, Gen e Music — e o produto de transcrição entre eles, StepAudio 3 ASR, é o que vem subindo nos rankings desde então. O nível que a própria documentação da StepFun chama de seu maior modelo ASR até hoje é StepAudio 3 ASR Max, e o irmão conversacional com o qual compartilha uma espinha dorsal é StepAudio 3 Realtime. Se você está tentando comparar "StepAudio 3 ASR" com "StepAudio 3", você está comparando um produto com uma linha de produtos, e a resposta depende inteiramente de qual dos três você realmente quis dizer.

Esta página resolve isso. Não é uma comparação de marketing — é a desambiguação de que precisa antes de conseguir ler corretamente qualquer ficha técnica do StepAudio 3, porque os três nomes acima acarretam preços, endpoints e modos de falha diferentes.

Por que o nome é ambíguo

A StepFun lançou todo o stack de áudio em um dia, e a convenção de nomenclatura fez do nome da família o radical de todos os nomes de produtos. Isso é organizado num slide de lançamento e desconfortável em todo o resto. Significa que uma busca pelo nome da família retorna uma mistura de cinco produtos diferentes, e uma linha de benchmark rotulada como "StepAudio 3" poderia plausivelmente ser qualquer um deles.

A consequência prática é que não dá para saber, a partir de uma manchete, qual coisa foi medida. Um post que diz "StepAudio 3 lidera o ranking de transcrição" está descrevendo o StepAudio 3 ASR. Um post que diz "StepAudio 3 vence em dinâmica conversacional" está descrevendo o StepAudio 3 Realtime. Ambos são verdadeiros, são produtos diferentes e não são intercambiáveis.

Há uma segunda ambiguidade especificamente dentro da linha ASR. A documentação da StepFun refere-se a um nível ASR Max como seu maior modelo ASR até o momento, com preços próprios e endpoint próprio, enquanto as linhas do ranking público trazem o rótulo mais simples. Determinar se esses são um único SKU sob dois nomes ou dois SKUs é a coisa mais útil que esta página pode fazer, e a próxima seção faz isso.

As três coisas que o nome pode significar

StepAudio 3 ASR — o produto de transcrição. Um endpoint de streaming que devolve texto incremental à medida que descodifica e uma transcrição final no fim. A StepFun descreve-o como transcrição com um modelo de linguagem associado para contexto, ajustado para áudio médico, jurídico, financeiro, automóvel e de programação, e para entradas difíceis como fala sussurrada, fala rápida, fala encadeada, canto e música de fundo. É o modelo que regista uma taxa de erro de palavras de 1,7% no índice AA-WER da Artificial Analysis para conversão de fala em texto não em streaming.

StepAudio 3 ASR Max — o nível que a documentação da StepFun chama de seu maior modelo ASR até o momento. Ele tem a tarifa de tabela publicada de 2,8 yuans por hora. Não é um transcritor mais barato; é o topo da linha ASR.

StepAudio 3 Realtime — o modelo conversacional full-duplex. Ele raciocina diretamente sobre a fala em vez de executar uma cadeia de transcrever-e-raciocinar, e transcreve como subproduto disso. Não é um produto de ASR, e sua precisão em tarefas de transcrição não é aquilo para o que foi ajustado.

Todo o resto da família — TTS, Gen, Music — é um trabalho completamente diferente e não deveria aparecer de forma alguma numa comparação de transcrição.

ASR e ASR Max são o mesmo modelo?

As evidências apontam para sim, e a verificação é aritmética. A StepFun lista a faixa ASR Max a 2,8 yuans por hora. Convertido a aproximadamente 7,1 yuans por dólar, isso dá cerca de US$ 0,39 por hora, ou aproximadamente US$ 6,6 por 1.000 minutos. Artificial Analysis lista o modelo em seu ranking a US$ 6,67 por 1.000 minutos. Dois números publicados de forma independente, um da lista de preços do fornecedor e outro do ranking de terceiros, ficando a menos de um centavo um do outro. É o que você esperaria se a linha do ranking e a tarifa de tabela do ASR Max descrevessem o mesmo SKU.

Vale a pena ser preciso sobre o que isso prova e o que não prova. Isso prova que o eixo de preços do ranking e a tabela de tarifas do fornecedor estão descrevendo o mesmo produto pelo mesmo preço. Isso não prova que os 1,7% do ranking foram medidos no endpoint exato que você chamaria, porque o ranking não publica sua configuração de decodificação nem o endpoint que acessou. Portanto: mesmo produto, muito provavelmente; mesmas condições de medição, não verificadas.

O que é certo é o salto geracional dentro da linha. O StepAudio 2.5 ASR está em 4,7% no mesmo ranking a 0,15 yuan por hora. O nível atual é de 1,7% a 2,8 yuan por hora. Isso representa uma redução de 64% na taxa de erro de palavras por aproximadamente dezenove vezes o custo — o trade-off mais acentuado da família e o que decide se vale a pena fazer a atualização.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

As dimensões que realmente diferem

Depois de a nomenclatura estar definida, a comparação resume-se a uma lista curta. Estas são as que mudam uma decisão:

• Precisão — StepAudio 3 ASR com 1,7% de AA-WER em modo não streaming vs. StepAudio 2.5 ASR com 4,7% no mesmo ranking. Medido pela Artificial Analysis, não pela StepFun.

• Preço — 2,8 yuan por hora vs. 0,15 yuan por hora. Ambas são tarifas de lista dos fornecedores, ambas vigentes. Aproximadamente 19x.

• Pesos — apenas API hospedada para ambos. Nenhum peso aberto em nenhuma parte da família, nenhum caminho on-premise, nenhuma opção de auto-hospedagem em nenhum nível.

• Formato do endpoint — um único endpoint de transcrição em streaming que retorna texto incremental e final, em comparação com o mesmo formato na geração anterior. Nada sobre o modelo de integração mudou, então uma migração é uma troca de identificador de modelo, e não uma reescrita.

• Ajuste para áudio difícil — o StepAudio 3 ASR é explicitamente ajustado para fala sussurrada, rápida, conectada e cantada, e para áudio com música ao fundo. Esse ajuste é o produto; a geração anterior não foi feita para isso.

• Ganhos de domínio alegados pelo fornecedor — a StepFun relata queda de 9,3% no chinês, 25,0% no inglês, 22,3% nos dialetos, 42,1% nos verticais e 27,9% na alternância de código, de uma geração para a outra. Relatados pelo fornecedor e não reproduzidos, portanto trate-os como indicativos.

Notavelmente ausentes dessa lista: comprimento de contexto, suporte a formatos de áudio, duração máxima de áudio e um identificador de modelo. A documentação pública da StepFun para este modelo não informa esses dados, e quem cita esses números está citando outra coisa.

ASR vs Realtime é a comparação de que as pessoas realmente precisam

Se você está escolhendo entre produtos de transcrição, e não entre gerações, o confronto interessante não é ASR contra ASR Max — é ASR contra Realtime. O próprio material técnico da StepFun diz que os dois compartilham suas etapas de pré-treinamento e de treinamento intermediário e divergem apenas durante o ajuste fino supervisionado. Mesma base, ajuste fino diferente, produto diferente.

Esse único fato tem uma leitura prática. A taxa de erro de palavras de 1,7% é uma propriedade do ajuste fino do ASR. Não é uma promessa sobre o modelo em tempo real, que otimiza para tomada de turno, tratamento de interrupções e raciocínio sobre a fala, em vez de acurácia de transcrição. Se a sua arquitetura transcreve como efeito colateral de uma conversa ao vivo, você não está comprando os 1,7% — está comprando um modelo conversacional que, por acaso, emite texto.

O inverso também é verdadeiro e menos óbvio: como compartilham uma espinha dorsal, o modelo ASR não é um pequeno modelo especialista acoplado à família. Ele é um sistema da mesma escala, com ajuste fino diferente. É por isso que a tarifa do ASR fica próxima da do restante da família, em vez de perto da ponta barata do mercado.

O que fazer com isso se você estiver escolhendo um

Três perguntas resolvem a questão. Você precisa de uma transcrição ou de uma conversa? Se for uma transcrição, o StepAudio 3 ASR é o produto e o nome da família é ruído. Se for uma conversa, você quer o StepAudio 3 Realtime e não deveria estar lendo benchmarks de ASR de forma alguma. E se você precisa de uma transcrição de áudio genuinamente difícil — com sotaque, sussurrado, cantado ou com música por baixo — o prêmio de 19x é o preço do nível que foi ajustado para isso, e o teste honesto é o seu próprio áudio, e não um índice combinado.

A decisão que é fácil errar é tratar a camada de transcrição como permanente. Independentemente do que você escolher, a transcrição é uma entrada para outra coisa — um sumarizador, uma extração estruturada, uma verificação de conformidade, um índice de busca — e essas chamadas recaem sobre modelos de texto comuns. Essa é a camada que escala com o uso, e não com os minutos de áudio, e é a camada que vale a pena manter portátil desde o início. O OrcaRouter coloca quase 200 modelos de texto por trás de uma única API com failover automático entre provedores, uma DSL de roteamento que compõe vários deles em uma única chamada e fusão de modelos quando o julgamento de um único modelo não é suficiente. Onde um provedor publica uma tarifa, esse preço de tabela é repassado sem markup, de modo que uma mudança de preço no lado do texto chega à sua fatura no dia em que é anunciada.

Deixando claro o escopo, já que esta página é sobre uma família que não atendemos: nenhum endpoint do StepAudio 3 está no OrcaRouter. Os modelos de transcrição e de voz são acessados pela própria API da StepFun. O que o OrcaRouter carrega é a camada de raciocínio a jusante da transcrição, que é onde uma decisão de troca é barata de tomar e cara de adiar.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

O que ninguém resolveu

A nomenclatura é resolvível. A alegação de desempenho ainda não. Ainda não há nenhum relatório técnico publicado para o modelo ASR, nenhum conjunto de testes divulgado, nenhuma configuração de decodificação e nenhum protocolo reproduzível de alguém fora da StepFun, e as próprias comparações do fornecedor são com outros produtos chineses de ASR, em vez de com o incumbente de pesos abertos. Os 1,7% são uma medição real de terceiros em um índice combinado de três conjuntos de dados; todo o resto sobre este modelo é uma alegação do fornecedor.

Duas coisas mudariam o cenário. Um confronto direto contra o Whisper Large v3 Turbo em áudio idêntico, que ninguém publicou. E um preço para o resto da família — quatro dos cinco modelos StepAudio 3 ainda estavam com preço de prévia gratuita por tempo limitado no lançamento, e apenas transcrição e síntese tinham preços publicados, o que significa que a lista de preços que você pode consultar hoje cobre dois dos cinco produtos.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

Essa é a camada que escala com o uso, e não com minutos de áudio, e é a camada que vale a pena manter portátil desde o início. failover automático entre provedores, uma DSL de roteamento que compõe vários em uma única chamada, e fusão de modelos quando o julgamento de um modelo não é suficiente.