Card de título principal para 'GPT-Live-1 vs Sesame Preview', com o subtítulo 'A melhor voz aqui é a que não tem API', com um selo escrito 'Um é gratuito e fechado, o outro é pago e pode ser chamado' e três cartões: 'Sesame Preview — app gratuito, sem API, voz de produção não lançada', 'GPT-Live-1 — US$ 0,05 por minuto de voz, API pública desde 10 de setembro de 2026' e 'A parte construível da Sesame — CSM-1B, Apache-2.0, 1 bilhão de parâmetros, US$ 7 por 1 milhão de caracteres ou auto-hospedagem', acima de uma faixa de rodapé com os dizeres 'A voz de produção da Sesame não tem benchmark publicado; os números de voz do GPT-Live-1 são reportados pela OpenAI'. O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

{{1}}GPT-Live-1{{/1}} vs {{2}}Sesame Preview{{/2}}: {{3}}A Melhor Voz nesta Comparação É a Que Você Não Pode Comprar{{/3}}

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

Pergunte a qualquer pessoa que já tenha usado os dois e o ranking não chega perto: o Sesame Preview é o assistente de voz mais convincente com quem a maioria das pessoas já conversou. Também é aquele sobre o qual você não pode construir. GPT-Live-1 e Sesame Preview são comparados o tempo todo — ambos são conversacionais, ambos lidam com interrupções, ambos soam como uma pessoa, e não como um menu telefônico —, mas são oferecidos de maneiras opostas. O GPT-Live-1 é um modelo hospedado que você aluga por minuto, acessível publicamente para chamadas desde 10 de setembro de 2026. O Sesame Preview é um aplicativo de consumidor gratuito, sem API alguma, e a voz que impressiona as pessoas roda em um modelo de produção que nunca foi lançado.

O que cada um realmente é

• GPT-Live-1 — O modelo de voz full-duplex da Ope​nAI, no ChatGPT desde 8 de julho de 2026, na API desde 10 de setembro, a US$ 0,05 por minuto de voz. Doze vozes de API, sem clonagem, sem entrada de imagem ou vídeo, transcrições e texto de resposta retornados em cada sessão.

• Sesame Preview — o assistente de voz para consumidores da Sesame. Gratuito no iOS desde maio de 2026, amplamente disponível no Android desde o início de agosto de 2026, além de uma prévia web com foco em voz. Quatro agentes — Maya, Miles, Simone e Charlie — apenas em inglês, com um limite de 30 minutos por chamada que cai para 5 minutos quando desconectado.

• CSM-1B — a parte da Sesame que é aberta: um modelo de fala conversacional de 1B lançado sob a licença Apache 2.0 em 23 de abril de 2026, construído sobre um backbone de arquitetura Llama com um decodificador separado e o codec Mimi da Kyutai, produzindo fala em inglês mono em 24 kHz a partir de um contexto de aproximadamente 4K tokens.

As três linhas acima são toda a forma da decisão. Uma empresa vende um modelo por minuto. A outra distribui um aplicativo de graça e libera como código aberto um modelo menor que não é o que está no aplicativo.

A diferença entre a demo e o download

A Sesame tem sido incomumente direta sobre isso, e este é o fato mais importante para qualquer pessoa que esteja avaliando o par. A voz no aplicativo Preview — a que produziu os clipes virais e as avaliações de "modo de voz de melhor categoria" — é um modelo de produção maior e fechado. O CSM-1B é um checkpoint aberto de 1 bilhão de parâmetros do mesmo laboratório e, segundo a avaliação de pessoas que executaram ambos, é uma voz nitidamente mais fraca. As sessões no Preview também têm limite máximo e são restritas ao inglês, e não há execução de tarefas: os agentes conversam, não reservam, compram nem arquivam nada.

Isso deixa os desenvolvedores com uma oferta real, mas mais restrita: um checkpoint de fala conversacional auto-hospedável, sem taxa de licença, hospedado por um provedor terceirizado de inferência a US$ 7 por milhão de caracteres — cerca de US$ 0,35 por hora de áudio sintetizado — ou gratuito no seu próprio hardware. Ninguém publicou um benchmark independente nem da voz Preview nem do CSM-1B, então qualquer alegação de qualidade em qualquer direção é uma impressão auditiva, não uma medição. A Sesame também não publicou preços públicos, nem nível empresarial, nem plano de monetização; a direção declarada da empresa são parcerias de pesquisa e um produto de hardware planejado.

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

O que US$ 0,05 por minuto oferece que o grátis não oferece

O argumento de venda do GPT-Live-1 para um desenvolvedor não é que ele soa melhor, porque esse argumento é impossível de vencer contra um modelo fechado que ninguém consegue medir. É que a coisa pode ser chamada e tem preço. Concretamente, o que você recebe com o medidor rodando:

• Uma sessão que você controla — um ID de modelo, um endpoint de Sessões ao Vivo, o exemplo de integração publicado em execução via WebRTC, e uma sessão que você configura com instruções, vozes e um bloco de delegação.

• Tratamento de interrupções como comportamento documentado — 80,1% de interatividade no Full Duplex Bench v1.5, contra 45,4% do GPT-Realtime-2.1, com latência de troca de turno de 0,798 segundo e 87% de sucesso em chamadas de ferramentas. Todos os três são números da própria Ope​nAI, publicados junto com o lançamento e não reproduzidos por ninguém até o momento desta redação.

• Um backend de raciocínio que você escolhe — a camada de voz encaminha o trabalho pesado através de uma fronteira assíncrona para um modelo separado nomeado na configuração da sessão, que continua trabalhando enquanto a conversa prossegue. No exemplo da documentação da Ope​nAI, esse backend é o GPT-5.6 Terra; no lançamento para consumidores de julho, era o GPT-5.5.

• Transcrições, texto de resposta e faturação em formato de telefonia — US$ 3,00 por uma hora de linha aberta contínua, com cobrança ao segundo, e 15 segundos de inicialização da sessão creditados em vez de adicionados.

Sesame oferece uma conversa melhor e nenhuma dessas coisas. Se você está construindo um produto, “conversa melhor, sem API, sem preço, sem benchmark, apenas em inglês, limite de 30 minutos” não é uma comparação — é uma lista de espera.

Há agora um número no GPT-Live-1 que não existia no seu lançamento para consumidores, e ele é o contrapeso honesto para tudo o que foi dito acima. O Índice Speech to Speech da Artificial Analysis pontua o GPT-Live-1 em 69,8% — sétimo de onze modelos, atrás do GPT-Realtime-2.1, com 73,9%, e atrás do Grok Voice Think Fast 2.0, com 79,0%. Portanto, o modelo que você pode comprar também não é o melhor do ranking independente. O que o ranking não consegue avaliar é justamente aquilo em que a Sesame está de fato vencendo: nenhum dos onze modelos desse índice foi avaliado pela sensação de conversar com ele, e a voz do Sesame Preview não tem linha em lugar nenhum.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

A parte da stack que não é de nenhuma das duas empresas

É aqui que as duas opções convergem, e onde a decisão deixa de ser binária. Nem o Sesame Preview nem o GPT-Live-1 é um agente completo. Os agentes da Sesame não executam tarefas; o GPT-Live-1 delega explicitamente qualquer coisa que exija raciocínio, recuperação ou uma ferramenta a um modelo de back-end. Em ambos os designs, o trabalho interessante acontece por trás da voz, numa chamada de modelo de texto simples, e essa camada é portável de uma forma que a camada de voz não é — você pode mover um back-end sem regravar um único prompt para o modelo de fala.

Esse back-end também é onde o OrcaRouter é útil, e vale a pena ser preciso sobre o que roteamos e o que não roteamos. Não roteamos o GPT-Live-1: o endpoint Live Sessions é da OpenAI, e a camada de voz lá está fora do nosso alcance. Também não roteamos o modelo de produção da Sesame, pelo motivo mais simples de que nunca foi oferecido como API. O que roteamos é a camada para a qual ambos os produtos passam o trabalho. Aproximadamente 190 modelos de onze provedores upstream rodam atrás de uma chave pelo preço de tabela do provedor sem acréscimo, com failover automático entre provedores e uma DSL de roteamento que pode compor vários modelos em uma única chamada. Para uma equipe construindo sobre um front-end de voz não comprovado, esse é o hedge que importa: a camada de fala pode ser trocada ou abandonada sem levar consigo a camada de raciocínio, e o modelo em que você apostou em março pode ser substituído em junho editando uma linha.

O que assistir

Três coisas mudariam esta comparação, e nenhuma delas está sob o controle de alguém ainda. Uma Sesame API — mesmo paga — transformaria instantaneamente a voz mais forte da categoria numa opção que dá para construir, e colocaria um preço real ao lado dos US$ 0,05 do GPT-Live-1. Um benchmark publicado da voz Preview converteria uma impressão de escuta num número, e avaliações independentes tendem a ser severas com vozes que só competiram em demonstrações. E a primeira reprodução externa dos números de interatividade e latência da Ope​nAI definiria se full duplex é uma lacuna real de capacidade ou uma avaliação bem escolhida.

Até então, a divisão honesta é esta. Se você está escolhendo uma voz para si mesmo, use o Sesame Preview — é gratuito, é melhor, e não custa nada preferi-lo. Se você está escolhendo uma voz para um produto que você precisa lançar, vender e dar suporte, o GPT-Live-1 é o único dos dois que você pode realmente comprar, e o fato de ele não ser o que soa melhor é o preço de entrada.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente