
StepAudio 3 Realtime vs Sesame Preview: A voz que todos elogiam vs. a que tem uma pontuação
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Durante a maior parte de 2026, a afirmação mais forte que alguém podia fazer sobre IA de voz era uma impressão de escuta. O assistente da Sesame soava mais humano do que qualquer outro, e pessoas suficientes disseram isso para que ele se tornasse o ponto de referência — sem benchmark, sem número e sem como verificar. Em 15 de setembro de 2026, StepAudio 3 Realtimechegou da StepFun com um número atrelado à versão mais próxima e mensurável dessa qualidade: 98,9% na avaliação Conversational Dynamics da Artificial Analysis, primeiro lugar. Sesame Previewnão está nesse quadro.
O interessante não é que um tenha superado o outro. É que a qualidade pela qual a Sesame ficou famosa agora é algo que um terceiro avalia, e o modelo que tem a reputação nunca foi medido em relação a ela.
O que cada um destes realmente é
Eles não são o mesmo tipo de objeto, e isso determina mais da comparação do que qualquer pontuação.
O Sesame Preview é um assistente de voz para consumidores. Gratuito no iOS desde maio de 2026 e amplamente disponível no Android desde o início de agosto de 2026, foi criado em torno de quatro agentes nomeados — Maya, Miles, Simone e Charlie — que mantêm o contexto entre sessões, pesquisam na web e definem lembretes. Ele só está disponível em inglês. As chamadas têm um limite de 30 minutos, que cai para cinco minutos quando você está desconectado. Não há API para a voz de produção dele, nem nível empresarial, nem preços públicos.
O StepAudio 3 Realtime é uma superfície para desenvolvedores. É um dos cinco modelos da família StepAudio 3, todos lançados no mesmo dia e todos disponíveis na plataforma aberta da StepFun como APIs comerciais. Ele lida com conversação full-duplex nativa, raciocina diretamente sobre a fala em vez de transcrever primeiro e oferece suporte a chamadas de ferramentas e execução assíncrona de tarefas longas enquanto a conversa continua. Ele prioriza o chinês. Não é de pesos abertos e atualmente está em preço de prévia gratuita por tempo limitado, sem tarifa pós-prévia anunciada.
Sobre um deles, você pode construir. O outro, você pode visitar.
A coisa mensurável pela qual a Sesame é famosa
Conversational Dynamics é um benchmark específico, e vale a pena saber o que ele abrange. Ele avalia a alternância de turnos, o tratamento de pausas, a recuperação de interrupções e se um modelo interpreta corretamente um breve backchannel — "ahã", "certo", "mm" — como incentivo, em vez de como uma tentativa de tomar o turno da conversa. Esses são precisamente os comportamentos que os ouvintes descrevem quando dizem que uma voz parece humana, e não robótica, e são os comportamentos que tornam um assistente agradável de conversar, em vez de apenas preciso.
StepAudio 3 Realtime lidera esse ranking com 98,9%, à frente de Qwen Audio 3.0 Realtime Plus com 98,4% e de GPT-Realtime-2 com 95,3%. Também fica em primeiro lugar em Speech Reasoning com 99,7%, conforme citado pela StepFun, e por trás disso está a alegação arquitetural de que o raciocínio sobre áudio bruto preserva o tom e a ênfase que uma etapa de transcrição achataria — a diferença entre ouvir sarcasmo e ouvir um elogio.
Aqui está o enquadramento honesto desse resultado. O benchmark é a coisa mais próxima que a indústria tem de uma medição daquilo pelo que o Sesame é elogiado, e o Sesame não foi inscrito nele. Isso não é evidência de que o StepAudio 3 Realtime soe melhor que o Sesame. É evidência de que uma dessas alegações é verificável e a outra, até agora, não é — e de que a verificável atualmente pertence a um modelo com o qual a maioria das pessoas nunca falou.

A assimetria de disponibilidade, que é a verdadeira decisão
Tudo o que está acima é interessante. Esta parte é decisiva.
A voz da Sesame — aquela sobre a qual todo mundo fala maravilhas — é um modelo de produção maior e fechado que a Sesame nunca lançou como API. Você não pode comprá-la, licenciá-la nem chamá-la a partir do seu próprio produto. Se você leu que o ritmo conversacional da Sesame é o melhor disponível e concluiu que poderia ter isso, a conclusão não decorre das evidências.
O que a Sesame realmente disponibilizou como código aberto foi o CSM-1B, lançado sob a Apache-2.0. Ele é um bloco de síntese, não um assistente: um backbone Llama prevê o primeiro codebook Mimi, e um decodificador Llama menor prevê o restante, que um codec Mimi renderiza em uma forma de onda de 24 kHz. Ele funciona apenas em inglês, clona uma voz a partir de um clipe de referência de 10 a 15 segundos e não consegue gerar texto de forma alguma — você o emparelha com um modelo de linguagem separado. Pessoas que executaram os dois descrevem a voz do CSM-1B como nitidamente mais fraca do que a do aplicativo Preview, e a ficha do modelo diz o que normalmente fica nas entrelinhas: uma variante ajustada do CSM alimenta a demonstração interativa, e essa variante não é o checkpoint que você pode baixar.
StepAudio 3 Realtime não tem nada dessa ambiguidade. É uma API comercial com uma família de modelos publicada por trás, um conjunto de capacidades declarado e posicionamentos de terceiros que você pode consultar. Também é prioriza o chinês, tem preço de pré-visualização e registra um tempo até o primeiro áudio de 8,83 segundos no mesmo ranking em que vence em dinâmica conversacional — contra 1,18 segundo do Gemini 3.8 Live e 1,24 a 1,34 segundos do GPT-Live-1. Qualquer que seja a qualidade conversacional que ofereça, ainda não demonstrou que consegue entregá-la em velocidade conversacional fora da própria configuração de serviço da StepFun.

O que fazer com isso se você estiver escolhendo uma stack de voz
Comece separando as duas perguntas. "Que sensação uma conversa deveria transmitir?" e "o que eu consigo lançar?" têm respostas diferentes, e só uma delas é uma decisão de compra.
Se você está calibrando o gosto — decidindo quanto acolhimento seu produto deve ter, quanto silêncio é confortável, com que rapidez um agente deve ceder a palavra — o Sesame Preview é gratuito, genuinamente excelente e um bom lugar para passar uma tarde. Use-o como ponto de referência. Não planeje uma integração em torno dele, porque não há nada com que integrar.
Se você está lançando, o StepAudio 3 Realtime é um candidato real com ressalvas reais: preço de prévia, cobertura com foco primeiro no chinês, sem pontuação de índice no Artificial Analysis, e a questão da latência não resolvida. Teste a latência antes da qualidade da conversa. Um modelo que vence o benchmark de tomada de turno mas leva a maior parte do tempo de uma frase para começar a falar é um modelo cuja melhor qualidade você pode nunca conseguir demonstrar.
E se algum dia a voz de produção da Sesame tiver uma API, toda essa comparação será refeita — porque o benchmark que resolveria essa questão já existe, e a Sesame finalmente teria que aparecer nele.
Onde o roteamento se encaixa, e onde não
Agentes de voz não são um único modelo. Esteja você executando o StepAudio 3 Realtime ou qualquer outra coisa, a conversa constantemente delega trabalho a modelos de texto comuns — uma consulta, uma extração, uma chamada de raciocínio executada por trás de uma pausa mantida. É nessa camada de delegação que mora a variação de custos e onde a má hora de um provedor se torna a sua indisponibilidade.
Para ser preciso sobre nossa própria cobertura: os endpoints de transmissão ao vivo e de voz da família StepAudio 3 não estão no OrcaRouter, e o mesmo vale para qualquer coisa que a Sesame tenha construído. O que está no OrcaRouter é a camada de texto à qual um agente de voz delega — quase 200 modelos por trás de uma única API, failover automático, uma DSL de roteamento que compõe vários em uma única chamada, e fusão de modelos quando o julgamento de um único modelo não é suficiente, com o preço de lista do provedor repassado sem acréscimo.
Essa divisão é o que torna a questão da disponibilidade menos fatal do que parece. O modelo de voz é uma decisão que você pode rever; a camada de delegação é a que fica cara de desfazer, e é a que vale a pena colocar atrás de um roteador antes de você se comprometer com qualquer fornecedor de voz.

O veredito
Sesame Preview vence no quesito que não pode ser medido e perde em tudo o que pode ser comprado. É a voz com melhor som disponível, é gratuita, e você não pode colocá-la em produção — e agora que um terceiro pontua a qualidade pela qual ela é famosa, sua ausência nesse placar é uma lacuna nas evidências, não uma vantagem protegida.
StepAudio 3 Realtime vence em disponibilidade, mensurabilidade e capacidade, e traz questões em aberto genuínas sobre preço, cobertura de idiomas e latência. É o único dos dois sobre o qual você pode construir hoje, o que resolve a questão prática mais rápido do que qualquer benchmark.
O que observar é simples, e funciona nos dois sentidos: uma pontuação de Conversational Dynamics para a voz de produção da Sesame, ou um número de latência para o StepAudio 3 Realtime que o coloque na mesma faixa dos modelos que ele atualmente supera em qualidade. Qualquer uma das duas transformaria isto de uma comparação entre uma medição e uma reputação em um confronto direto de verdade.
