Um cartão de título principal gerado para StepAudio 3 Realtime vs Sesame Preview, com o kicker 'OrcaRouter · radar de modelos — cara a cara', o título 'StepAudio 3 Realtime vs Sesame Preview' e o subtítulo 'A voz que todos elogiam contra a que tem uma pontuação de leaderboard', acima de dois cartões de modelo arredondados, um de cada lado de uma marca de versus.
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview: A voz que todos elogiam vs. a que tem uma pontuação

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Durante a maior parte de 2026, a afirmação mais forte que alguém podia fazer sobre IA de voz era uma impressão de escuta. O assistente da Sesame soava mais humano do que qualquer outro, e pessoas suficientes disseram isso para que ele se tornasse o ponto de referência — sem benchmark, sem número e sem como verificar. Em 15 de setembro de 2026, StepAudio 3 Realtimechegou da StepFun com um número atrelado à versão mais próxima e mensurável dessa qualidade: 98,9% na avaliação Conversational Dynamics da Artificial Analysis, primeiro lugar. Sesame Previewnão está nesse quadro.

O interessante não é que um tenha superado o outro. É que a qualidade pela qual a Sesame ficou famosa agora é algo que um terceiro avalia, e o modelo que tem a reputação nunca foi medido em relação a ela.

O que cada um destes realmente é

Eles não são o mesmo tipo de objeto, e isso determina mais da comparação do que qualquer pontuação.

O Sesame Preview é um assistente de voz para consumidores. Gratuito no iOS desde maio de 2026 e amplamente disponível no Android desde o início de agosto de 2026, foi criado em torno de quatro agentes nomeados — Maya, Miles, Simone e Charlie — que mantêm o contexto entre sessões, pesquisam na web e definem lembretes. Ele só está disponível em inglês. As chamadas têm um limite de 30 minutos, que cai para cinco minutos quando você está desconectado. Não há API para a voz de produção dele, nem nível empresarial, nem preços públicos.

O StepAudio 3 Realtime é uma superfície para desenvolvedores. É um dos cinco modelos da família StepAudio 3, todos lançados no mesmo dia e todos disponíveis na plataforma aberta da StepFun como APIs comerciais. Ele lida com conversação full-duplex nativa, raciocina diretamente sobre a fala em vez de transcrever primeiro e oferece suporte a chamadas de ferramentas e execução assíncrona de tarefas longas enquanto a conversa continua. Ele prioriza o chinês. Não é de pesos abertos e atualmente está em preço de prévia gratuita por tempo limitado, sem tarifa pós-prévia anunciada.

Sobre um deles, você pode construir. O outro, você pode visitar.

A coisa mensurável pela qual a Sesame é famosa

Conversational Dynamics é um benchmark específico, e vale a pena saber o que ele abrange. Ele avalia a alternância de turnos, o tratamento de pausas, a recuperação de interrupções e se um modelo interpreta corretamente um breve backchannel — "ahã", "certo", "mm" — como incentivo, em vez de como uma tentativa de tomar o turno da conversa. Esses são precisamente os comportamentos que os ouvintes descrevem quando dizem que uma voz parece humana, e não robótica, e são os comportamentos que tornam um assistente agradável de conversar, em vez de apenas preciso.

StepAudio 3 Realtime lidera esse ranking com 98,9%, à frente de Qwen Audio 3.0 Realtime Plus com 98,4% e de GPT-Realtime-2 com 95,3%. Também fica em primeiro lugar em Speech Reasoning com 99,7%, conforme citado pela StepFun, e por trás disso está a alegação arquitetural de que o raciocínio sobre áudio bruto preserva o tom e a ênfase que uma etapa de transcrição achataria — a diferença entre ouvir sarcasmo e ouvir um elogio.

Aqui está o enquadramento honesto desse resultado. O benchmark é a coisa mais próxima que a indústria tem de uma medição daquilo pelo que o Sesame é elogiado, e o Sesame não foi inscrito nele. Isso não é evidência de que o StepAudio 3 Realtime soe melhor que o Sesame. É evidência de que uma dessas alegações é verificável e a outra, até agora, não é — e de que a verificável atualmente pertence a um modelo com o qual a maioria das pessoas nunca falou.

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

A assimetria de disponibilidade, que é a verdadeira decisão

Tudo o que está acima é interessante. Esta parte é decisiva.

A voz da Sesame — aquela sobre a qual todo mundo fala maravilhas — é um modelo de produção maior e fechado que a Sesame nunca lançou como API. Você não pode comprá-la, licenciá-la nem chamá-la a partir do seu próprio produto. Se você leu que o ritmo conversacional da Sesame é o melhor disponível e concluiu que poderia ter isso, a conclusão não decorre das evidências.

O que a Sesame realmente disponibilizou como código aberto foi o CSM-1B, lançado sob a Apache-2.0. Ele é um bloco de síntese, não um assistente: um backbone Llama prevê o primeiro codebook Mimi, e um decodificador Llama menor prevê o restante, que um codec Mimi renderiza em uma forma de onda de 24 kHz. Ele funciona apenas em inglês, clona uma voz a partir de um clipe de referência de 10 a 15 segundos e não consegue gerar texto de forma alguma — você o emparelha com um modelo de linguagem separado. Pessoas que executaram os dois descrevem a voz do CSM-1B como nitidamente mais fraca do que a do aplicativo Preview, e a ficha do modelo diz o que normalmente fica nas entrelinhas: uma variante ajustada do CSM alimenta a demonstração interativa, e essa variante não é o checkpoint que você pode baixar.

StepAudio 3 Realtime não tem nada dessa ambiguidade. É uma API comercial com uma família de modelos publicada por trás, um conjunto de capacidades declarado e posicionamentos de terceiros que você pode consultar. Também é prioriza o chinês, tem preço de pré-visualização e registra um tempo até o primeiro áudio de 8,83 segundos no mesmo ranking em que vence em dinâmica conversacional — contra 1,18 segundo do Gemini 3.8 Live e 1,24 a 1,34 segundos do GPT-Live-1. Qualquer que seja a qualidade conversacional que ofereça, ainda não demonstrou que consegue entregá-la em velocidade conversacional fora da própria configuração de serviço da StepFun.

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

O que fazer com isso se você estiver escolhendo uma stack de voz

Comece separando as duas perguntas. "Que sensação uma conversa deveria transmitir?" e "o que eu consigo lançar?" têm respostas diferentes, e só uma delas é uma decisão de compra.

Se você está calibrando o gosto — decidindo quanto acolhimento seu produto deve ter, quanto silêncio é confortável, com que rapidez um agente deve ceder a palavra — o Sesame Preview é gratuito, genuinamente excelente e um bom lugar para passar uma tarde. Use-o como ponto de referência. Não planeje uma integração em torno dele, porque não há nada com que integrar.

Se você está lançando, o StepAudio 3 Realtime é um candidato real com ressalvas reais: preço de prévia, cobertura com foco primeiro no chinês, sem pontuação de índice no Artificial Analysis, e a questão da latência não resolvida. Teste a latência antes da qualidade da conversa. Um modelo que vence o benchmark de tomada de turno mas leva a maior parte do tempo de uma frase para começar a falar é um modelo cuja melhor qualidade você pode nunca conseguir demonstrar.

E se algum dia a voz de produção da Sesame tiver uma API, toda essa comparação será refeita — porque o benchmark que resolveria essa questão já existe, e a Sesame finalmente teria que aparecer nele.

Onde o roteamento se encaixa, e onde não

Agentes de voz não são um único modelo. Esteja você executando o StepAudio 3 Realtime ou qualquer outra coisa, a conversa constantemente delega trabalho a modelos de texto comuns — uma consulta, uma extração, uma chamada de raciocínio executada por trás de uma pausa mantida. É nessa camada de delegação que mora a variação de custos e onde a má hora de um provedor se torna a sua indisponibilidade.

Para ser preciso sobre nossa própria cobertura: os endpoints de transmissão ao vivo e de voz da família StepAudio 3 não estão no OrcaRouter, e o mesmo vale para qualquer coisa que a Sesame tenha construído. O que está no OrcaRouter é a camada de texto à qual um agente de voz delega — quase 200 modelos por trás de uma única API, failover automático, uma DSL de roteamento que compõe vários em uma única chamada, e fusão de modelos quando o julgamento de um único modelo não é suficiente, com o preço de lista do provedor repassado sem acréscimo.

Essa divisão é o que torna a questão da disponibilidade menos fatal do que parece. O modelo de voz é uma decisão que você pode rever; a camada de delegação é a que fica cara de desfazer, e é a que vale a pena colocar atrás de um roteador antes de você se comprometer com qualquer fornecedor de voz.

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

O veredito

Sesame Preview vence no quesito que não pode ser medido e perde em tudo o que pode ser comprado. É a voz com melhor som disponível, é gratuita, e você não pode colocá-la em produção — e agora que um terceiro pontua a qualidade pela qual ela é famosa, sua ausência nesse placar é uma lacuna nas evidências, não uma vantagem protegida.

StepAudio 3 Realtime vence em disponibilidade, mensurabilidade e capacidade, e traz questões em aberto genuínas sobre preço, cobertura de idiomas e latência. É o único dos dois sobre o qual você pode construir hoje, o que resolve a questão prática mais rápido do que qualquer benchmark.

O que observar é simples, e funciona nos dois sentidos: uma pontuação de Conversational Dynamics para a voz de produção da Sesame, ou um número de latência para o StepAudio 3 Realtime que o coloque na mesma faixa dos modelos que ele atualmente supera em qualidade. Qualquer uma das duas transformaria isto de uma comparação entre uma medição e uma reputação em um confronto direto de verdade.