Um cartão hero gerado intitulado 'HeyGen Voice vs Sesame Preview' contrastando uma API de fala documentada com um Elo medido contra uma demo de consumidor sem endpoint público, marcado com a data da Artificial Analysis de 9 de outubro de 2026. O logotipo da OrcaRouter aparece no canto inferior direito.
Guides & Insights

HeyGen Voice vs Sesame Preview: A Voz Que Você Pode Comprar Contra a Voz Com a Qual Você Só Pode Conversar

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Esta não é uma comparação de modelos, e fingir o contrário seria o único erro real disponível aqui. HeyGen Voice é um motor de API — classificado em primeiro lugar na arena Controlled Voice da Artificial Analysis, com 1.202 Elo, exposto através dos endpoints v3 da HeyGen, vendido por crédito, clonável a partir de uma única gravação. Sesame Preview é um assistente de voz de consumo gratuito que você acessa abrindo uma página web e falando com uma de quatro personas nomeadas, sem endpoint público, sem identificador de modelo e sem preço pelo qual possa ser alugado. Um deles você pode lançar. O outro é a razão pela qual você sabe como soa uma boa voz conversacional, e nunca a coisa que você implanta.

O que cada um realmente é

Sesame Preview é uma demonstração de fala conversacional. Você o acessa através do site da própria empresa, conversa com Maya, Miles, Simone ou Charlie, e a experiência é deliberadamente otimizada para simpatia e expressividade — a empresa diz isso ao descrever por que os companheiros se comportam da maneira que se comportam. Hoje é apenas em inglês, com a equipe observando que a capacidade multilíngue aparece incidentalmente a partir de contaminação de dados e "não tem um bom desempenho ainda", e que expandir para além de vinte idiomas é um plano futuro. A própria formulação da empresa é um trabalho em andamento: "Ainda não chegamos lá."

Por baixo da demo está o Conversational Speech Model, uma arquitetura multimodal de texto e fala construída a partir de dois transformers autorregressivos no estilo Llama. Ele vem em três tamanhos — Tiny, com um backbone de 1B e decodificador de 100M; Small, com 3B e 250M; Medium, com 8B e 300M —, cada um treinado com comprimento de sequência de 2.048 tokens, aproximadamente dois minutos de áudio, por cinco épocas, em cerca de um milhão de horas de fala majoritariamente em inglês. Componentes-chave de pesquisa são de código aberto sob Apache 2.0, e há um repositório no GitHub para eles. A demo — aquilo que as pessoas realmente elogiam — não é isso. A demo não tem API pública.

O HeyGen Voice é o arranjo inverso. Não há um aplicativo de consumidor gratuito para experimentar; há uma API documentada com um catálogo de vozes, um endpoint de fala, caminhos de clonagem e uma fatura. O que você não pode fazer é abri-lo em um navegador e conversar com ele por impulso.

Por que os dois são comparados, afinal

Elas são comparadas porque ambas são apresentadas como evidência de que a fala sintética ultrapassou algum limite. O Sesame Preview redefiniu as expectativas sobre como o áudio conversacional poderia soar — as reações quando ele foi lançado eram sobre o quanto soava como uma pessoa, e não como um motor de conversão de texto em fala. O 1.202 do HeyGen Voice no ranking controlado é a mesma alegação em forma numérica: primeiro lugar entre quarenta e duas entradas quando todos os modelos falam as mesmas oito vozes de referência clonadas.

A diferença está no que se pode fazer com a afirmação depois. Uma posição de tabuleiro é reproduzível, testável e vinculada a um endpoint. Uma impressão de demonstração não é nada disso — e, mais importante, o Sesame Preview não aparece no tabuleiro controlado de forma alguma, então não há Elo para comparar com o 1.202. A comparação que as pessoas querem fazer não está disponível, não porque o Sesame a perdeu, mas porque o modelo nunca foi inscrito.

O placar

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Controlled Voice Elo — HeyGen Voice: 1.202, nº 1 de 42. Sesame Preview: não listado.

• Acesso — HeyGen Voice: API v3 documentada, POST /v3/voices/speech. Sesame Preview: aplicativo web para consumidores e aplicativo iOS; sem endpoint público.

• Preço — HeyGen Voice: $30,00 por 1 milhão de caracteres, com base na conversão do preço em créditos da própria arena; a HeyGen não publica nenhuma tarifa de voz. Sesame Preview: gratuito, e não é possível comprá-lo por preço algum.

• Seleção de voz — HeyGen Voice: mais de 300 vozes pré-criadas, design de voz descrito por texto, clonagem instantânea e profissional. Sesame Preview: quatro personas fixas.

• Idiomas — HeyGen Voice: "dezenas de idiomas", contagem não publicada. Sesame Preview: apenas em inglês, com o suporte multilíngue apresentando desempenho inferior atualmente, segundo a própria empresa.

• Pesos abertos — HeyGen Voice: nenhum. Sesame Preview: CSM lançado sob a Apache 2.0 nos tamanhos 1B, 3B e 8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

O detalhe do Apache 2.0 é o que importa

Por baixo do veredicto de «sem API» está o facto de a Sesame ter disponibilizado o modelo de investigação em código aberto sob a Apache 2.0 — uma licença permissiva, em três tamanhos, com uma variante de 1B suficientemente pequena para correr sem um centro de dados. Esta é uma proposta genuinamente diferente da demonstração, e é a única via pela qual algo semelhante à voz do Sesame Preview acaba num produto lançado.

Duas ressalvas mantêm a honestidade. Os componentes CSM divulgados são artefatos de pesquisa: a empresa observa que os modelos lidam com conteúdo de fala, mas não com estrutura de conversa, e aponta para modelos totalmente duplex como trabalho futuro — portanto, os pesos divulgados não são a experiência interativa. E um backbone de 8B executado localmente tem uma estrutura de custos diferente dos US$ 19,30 por milhão de caracteres de inferência hospedada, que é o que o rival de alto nível mais barato da arena cobra. A auto-hospedagem não tem cobrança por caractere e tem uma cobrança muito real por hora de GPU.

Para um construtor, isso reformula a questão. Se o que te impressionou no Sesame Preview foi a conversa, os pesos abertos não te dão isso. Se o que te impressionou foi a qualidade da voz do próprio modelo de fala, eles podem — e isso é testável de uma forma que uma demonstração não é.

Como é o lançamento no HeyGen Voice

As diferenças práticas são as comuns. A API da HeyGen aceita uma seleção de voz, texto e, opcionalmente, velocidade entre 0,5 e 1,5 e tom em uma faixa de ±50 semitons, com um BCP-47 locale como dica. Vozes personalizadas vêm de três formas: uma rota de design orientada por descrição que retorna até três opções classificadas a partir de um prompt limitado a 1.000 caracteres, um clone instantâneo a partir de uma gravação e um clone profissional treinado com vinte minutos ou mais. O filtro de mecanismo no endpoint de vozes também aceita mecanismos que não são da HeyGen, então a plataforma não é um jardim murado em torno de seu próprio modelo.

Nada disso existe do lado do Sesame, e não é uma falha do Sesame Preview — é aquilo que a coisa é. Uma demo otimizada para mostrar o que é possível não deveria ter um SLA.

A conta, porém, é a metade mais branda. A HeyGen vende créditos — 600 por US$ 29/mês, 1.000 por US$ 49, 1.500 por US$ 149 — e afirma que o consumo varia conforme o modelo, a duração e a complexidade, sem publicar uma tarifa de voz. Os US$ 30,00 por milhão de caracteres que a arena lista são uma conversão desses créditos feita pela Artificial Analysis, não uma cotação da HeyGen. Assim, o modelo que você pode lançar tem preço, mas segundo a aritmética de outra pessoa — o que é um argumento a favor de um piloto controlado, e não uma crítica ao motor.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

O que realmente fazer com uma demo que você admira

O passo útil é separar as duas coisas que o Sesame Preview demonstra. O comportamento conversacional — alternância de turnos, memória, a sensação de falar com alguém — é o produto de um sistema que ainda não foi lançado e não tem endpoint. A qualidade da fala é a parte com pesos Apache 2.0 por trás, e a parte que você pode avaliar no seu próprio áudio sem pedir permissão a ninguém.

Para tudo o que fica no meio, o caminho de migração é o prosaico: publique em um engine que tenha uma API e um ranking, e projete de modo que adotar o modelo da Sesame, caso um dia ele seja lançado comercialmente, seja uma mudança de configuração e não uma reescrita. Isso significa uma abstração sobre o provedor de voz desde o primeiro dia — uma interface, uma chave, engine selecionado por configuração. A camada de roteamento do OrcaRouter foi criada exatamente para isso: muitos provedores por trás de um único endpoint pelo preço de tabela do provedor, sem markup, failover automático quando um fornecedor trava, e uma DSL de roteamento que permite trocar o engine por trás de uma voz sem tocar no código da aplicação. O ponto não é que ele hospede um modelo da Sesame — não hospeda —, mas que, no dia em que uma voz que você admira se tornar comprável, o custo de experimentá-la deve ser uma linha em um arquivo de configuração.

O fechamento honesto

Sesame Preview não é concorrente do HeyGen Voice e não deve ser avaliado como tal. É uma demonstração gratuita, somente em inglês, com quatro personas, que por acaso redefiniu as expectativas para áudio conversacional e por acaso lançou pesos de pesquisa com licença permissiva em três tamanhos. O HeyGen Voice é o mecanismo mais bem classificado no único ranking de fala que mantém a voz constante, vendido por uma API que você pode chamar hoje, a um preço que você ainda não consegue calcular.

Se você precisa de uma voz que possa lançar neste trimestre, a decisão não é entre estas duas — é entre HeyGen Voice e os outros motores pagos na arena. Se você está esperando pelo Sesame, espere pelos pesos, não pelo aplicativo.