Um cartão de destaque para 'ElevenLabs Eleven v4 vs Sesame Preview' com dois cartões contrastados: ElevenLabs Eleven v4 descrito como 'um modelo que você pode comprar', 'API ao vivo, em uma tabela de preços publicada', 'Arena Elo 1.319, rank 1'; Sesame Preview descrito como 'uma demonstração com a qual você pode conversar', 'apenas web, nenhum endpoint para chamar', 'não está em nenhum quadro de arena'; com a legenda 'duas categorias, não duas opções'. Rodapé: 'Páginas de fornecedores e artificialanalysis.ai, setembro de 2026.' O logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

Eleven v4 vs. Sesame Preview: Esta não é a comparação que você pensa que é

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Uma pesquisa por ElevenLabs Eleven v4 versus Sesame Preview retorna várias páginas que não hesitam em colocá-los em uma tabela. Quase todas estão comparando um produto com um benchmark contra uma demo, e a tabela é a coisa menos útil da página. O Eleven v4 é um modelo de síntese de fala em disponibilidade geral com uma API, uma tabela de preços e um ranking de arena publicado. O Sesame Preview é um assistente de voz gratuito para consumidores que responde quando você toca em um link. Eles não são duas opções para a mesma compra, e a versão honesta deste artigo é sobre qual deles você realmente quer — porque a resposta depende de uma pergunta que nenhuma página de marketing dos fornecedores faz.

A two-column card for ElevenLabs Eleven v4 and Sesame Preview. Eleven v4: model identifier Eleven v4; live API; $0.022 per 1K until Oct 12; Arena Elo 1,319 at rank 1; 10,000-character input cap; 90-plus languages. Sesame Preview: no announced model identifier; web demo only; free and not purchasable; not on any arena board; sessions capped around 30 minutes; English only. Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; Sesame Preview per its own site.'

O que o Eleven v4 realmente é

A ElevenLabs lançou o Eleven v4 e o Eleven v4 Turbo em 28 de setembro como endpoints de produção. O Eleven v4 oferece mais de 90 idiomas, limite de 10.000 caracteres por solicitação, diálogo com vários locutores com identidade de locutor estável, diretivas de entrega inline, suporte aprimorado a fonemas IPA e clonagem de voz instantânea a partir de dez segundos de áudio. Ele ocupa o primeiro lugar no Provider Voice Arena da Artificial Analysis, com Elo 1.319 e 1.674 amostras por trás da estimativa, e o segundo lugar no ranking Controlled Voice, com 1.157. Na tabela de preços da API, ele aparece a US$ 0,022 por mil caracteres durante uma promoção que termina em 12 de outubro, voltando a US$ 0,08 — a mesma tarifa praticada pelo ElevenLabs Eleven v3 anterior.

Cada parte desse parágrafo é verificável. Há um identificador de modelo, um limite de entrada documentado, um preço publicado por caractere, uma nota de descontinuação para os níveis Turbo mais antigos e uma entrada independente em um ranking com um intervalo de confiança. É assim que um modelo se parece quando você pode comprá-lo.

A screenshot of ElevenLabs' blog post announcing Eleven v4, captured in English and dated Sep 28, 2026, headed 'Introducing Eleven v4, our most emotive model' and credited to Mati Staniszewski and Piotr Dabkowski, showing the site-wide 'Introducing Eleven v4, our fastest and most emotive voice model' banner, a 'Listen to this article 10:32' control, the line 'Ranked #1 by Artificial Analysis, and preferred by ~75% of listeners in blind head-to-head tests over competing models', and a left-hand section list running from 'A new architecture built for performance' to 'Hear the difference for yourself'.

O que o Sesame Preview realmente é

O Sesame Preview é uma demonstração para consumidores. É um assistente de voz que você acessa pelo próprio site da empresa, com um pequeno elenco de personas nomeadas — Maya, Miles, Simone e Charlie — memória conversacional que se mantém entre sessões, pesquisa na web, notas e lembretes, e um resumo após a chamada. É gratuito. Sessões com login duram cerca de meia hora; sessões como convidado, cerca de cinco minutos. Ele atende apenas em inglês. E a Sesame afirma claramente que ele não executa tarefas: o objetivo da demonstração é a textura conversacional, não um agente que agenda sua reunião.

A parte que importa para esta comparação é o que está faltando. Não há identificador de modelo, nem endpoint, nem tabela de preços, nem limite de entrada com o qual você possa projetar, e nenhuma data anunciada para o modelo de produção. A linha de pesquisa publicada da Sesame é uma coisa separada — um modelo de fala conversacional com pesos abertos e um contexto de 4K — e não é o mesmo sistema com o qual você conversa no Preview. Portanto, a coisa chamada "Sesame Preview" em todas as tabelas de comparação é um produto com o qual não dá para integrar, e o que você pode baixar não é o produto.

Por que eles não podem compartilhar um placar

A arena de voz controlada do Artificial Analysis é a coisa mais próxima de uma medição neutra que este campo tem, e o Sesame Preview não está nela. Também não está no painel de vozes de provedores. Não há Elo, nem contagem de votos, nem normalização de preços — e não há como produzir uma, porque uma tabela de classificação precisa de um endpoint chamável e de um preço por unidade, e o Sesame Preview não tem nenhum dos dois.

Então, qualquer tabela que coloque esses dois lado a lado está preenchendo a coluna Sesame a partir de um tour de produto. Comparar um endpoint de US$ 80 por milhão de caracteres com uma demonstração web gratuita em termos de "naturalidade" não é uma comparação; é um erro de categoria com um buraco em forma de Elo. Se uma página afirma um vencedor nesse confronto, ela inventou a base para a alegação.

O que se pode dizer honestamente é o que cada um está tentando ser. O Eleven v4 é otimizado para transformar um roteiro em uma performance, em escala, por meio de uma API, com a mesma voz todas as vezes. O Sesame Preview é otimizado para fazer um estranho sentir que está conversando com alguém, uma vez, em uma aba do navegador.

O único lugar onde a comparação é real

Há uma questão genuína subjacente à busca, e ela é sobre pesos abertos. Se o que você realmente quer é um modelo de fala que você possa baixar e executar por conta própria, nem o carro-chefe de um fornecedor nem o do outro é a resposta — a stack da ElevenLabs é fechada, e o sistema da Sesame que você pode executar é o modelo de pesquisa com contexto de 4K, não o assistente.

Para esse trabalho, o ponto de referência útil está nos rankings da arena: Breeze TTS 2 é a entrada de pesos abertos mais bem classificada no Provider Voice, com Elo 1.206 e US$ 34,00 por milhão de caracteres, com 16 modelos de pesos abertos entre os 92 daquele ranking. Isso é 113 pontos atrás do Eleven v4 e bem à frente da linha Qwen3 TTS, com 944 e 930. Se seu projeto precisa rodar no seu próprio hardware, a comparação que vale a pena fazer é Eleven v4 contra Breeze TTS 2 — não contra uma demo de navegador — e o trade-off aí é real: você abre mão de cerca de cem pontos de Elo e do fluxo de trabalho com tags de áudio, e ganha o controle de toda a stack.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276, Google Gemini 3.8 Flash TTS third at Elo 1,267, and BreezeBlue Breeze TTS 2 tenth at Elo 1,206 with $34.0 per 1M chars and an Open Weights flag, over the Open Weights and Global Leaderboard filter tabs.

Escolher, levando em conta para que serve cada um.

• Se você está construindo um produto que fala — Eleven v4, em uma API, em uma tabela de preços. Nada sobre o Sesame Preview é integrável, então ele não faz parte desta decisão.

• Se você quer uma demonstração conversacional para mostrar a alguém como é a IA de voz — Sesame Preview, e é grátis, o que é todo o argumento a favor dela.

• Se você está avaliando a amplitude emocional antes de se comprometer com um fornecedor — o Elo 1.319 do Eleven v4 no ranking de vozes de fornecedores e 1.157 no ranking de vozes clonadas são os números a considerar, com a ressalva de que o segundo é o que descreve um produto de voz de marca clonada.

• Se você precisa de fala em idiomas além do inglês — o Eleven v4 documenta mais de 90; o Sesame Preview é apenas em inglês e deixa isso claro.

• Se você precisa que o modelo realmente faça alguma coisa — neste confronto, nenhum dos dois. O Sesame Preview deliberadamente não executa tarefas, e o Eleven v4 é um motor de síntese que precisa da sua própria stack em volta dele.

• Se você precisar rodá-lo localmente — nem um nem outro. Breeze TTS 2 é o ponto de referência de pesos abertos.

• Se o custo for o fator decisivo — o Eleven v4 custa $0,022 por mil caracteres até 12 de outubro e $0,08 depois, e o Sesame Preview é gratuito porque não é um produto que se possa comprar. Uma demo gratuita não é uma opção mais barata; é uma categoria diferente.

A única coisa que ambos compartilham é um problema de data. O preço promocional do Eleven v4 expira em 12 de outubro, o que altera seu custo por um fator de quase quatro. A Sesame não deu data alguma para o modelo de produção, o que é um tipo diferente de incerteza — o Preview pode ser substituído no mês que vem ou permanecer inalterado por um ano, e não há como planejar em torno de um lançamento que ninguém agendou.

Se a sua stack acabar abrangendo mais de um fornecedor de voz

O OrcaRouter não hospeda nem a ElevenLabs nem a Sesame, portanto não há nada neste artigo para chamar por meio de nós e não vamos insinuar o contrário. O que cobrimos é a camada acima de um stack que já é multivendor. Uma única chave de API alcança mais de 200 modelos com os preços de lista dos provedores repassados com 0% de markup, de modo que uma mudança de preço no upstream — sendo a janela promocional deste lançamento um exemplo ao vivo — chega ao nosso lado no mesmo dia, em vez de na próxima fatura. Onde o caminho de voz é voltado ao cliente, o failover automático desloca o tráfego para um upstream saudável quando um deles se degrada, que é como você pode testar um novo endpoint em tráfego real sem apostar um lançamento nele.

O que levar

Eleven v4 é um modelo que você pode comprar, medir e no qual pode confiar, e atualmente ocupa o topo do ranking de voz de fornecedores, com uma redução de preço válida por duas semanas. Sesame Preview é um experimento gratuito de sensação conversacional, apenas em inglês, limitado a trinta minutos, e não é algo em que você possa se basear. O motivo de eles aparecerem nos mesmos resultados de pesquisa é que ambos são IA de voz e ambos são novos — não que um seja uma alternativa ao outro.

Se você veio aqui para escolher entre eles, a reformulação útil é esta: você não está escolhendo um modelo de voz. Você está decidindo se vai lançar um produto ou testar uma demo, e apenas uma dessas decisões tem uma tabela de preços atrelada. Se for o produto, leia os números do Eleven v4 e releia-os em 13 de outubro, quando a tarifa promocional expirar e a comparação com todos os outros fornecedores no painel mudar.