
{{1}}GPT-Live-1{{/1}} vs {{2}}Sesame Preview{{/2}}: {{3}}A Melhor Voz nesta Comparação É a Que Você Não Pode Comprar{{/3}}
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código

Pergunte a qualquer pessoa que já tenha usado os dois e o ranking não chega perto: o Sesame Preview é o assistente de voz mais convincente com quem a maioria das pessoas já conversou. Também é aquele sobre o qual você não pode construir. GPT-Live-1 e Sesame Preview são comparados o tempo todo — ambos são conversacionais, ambos lidam com interrupções, ambos soam como uma pessoa, e não como um menu telefônico —, mas são oferecidos de maneiras opostas. O GPT-Live-1 é um modelo hospedado que você aluga por minuto, acessível publicamente para chamadas desde 10 de setembro de 2026. O Sesame Preview é um aplicativo de consumidor gratuito, sem API alguma, e a voz que impressiona as pessoas roda em um modelo de produção que nunca foi lançado.
O que cada um realmente é
• GPT-Live-1 — O modelo de voz full-duplex da OpenAI, no ChatGPT desde 8 de julho de 2026, na API desde 10 de setembro, a US$ 0,05 por minuto de voz. Doze vozes de API, sem clonagem, sem entrada de imagem ou vídeo, transcrições e texto de resposta retornados em cada sessão.
• Sesame Preview — o assistente de voz para consumidores da Sesame. Gratuito no iOS desde maio de 2026, amplamente disponível no Android desde o início de agosto de 2026, além de uma prévia web com foco em voz. Quatro agentes — Maya, Miles, Simone e Charlie — apenas em inglês, com um limite de 30 minutos por chamada que cai para 5 minutos quando desconectado.
• CSM-1B — a parte da Sesame que é aberta: um modelo de fala conversacional de 1B lançado sob a licença Apache 2.0 em 23 de abril de 2026, construído sobre um backbone de arquitetura Llama com um decodificador separado e o codec Mimi da Kyutai, produzindo fala em inglês mono em 24 kHz a partir de um contexto de aproximadamente 4K tokens.
As três linhas acima são toda a forma da decisão. Uma empresa vende um modelo por minuto. A outra distribui um aplicativo de graça e libera como código aberto um modelo menor que não é o que está no aplicativo.
A diferença entre a demo e o download
A Sesame tem sido incomumente direta sobre isso, e este é o fato mais importante para qualquer pessoa que esteja avaliando o par. A voz no aplicativo Preview — a que produziu os clipes virais e as avaliações de "modo de voz de melhor categoria" — é um modelo de produção maior e fechado. O CSM-1B é um checkpoint aberto de 1 bilhão de parâmetros do mesmo laboratório e, segundo a avaliação de pessoas que executaram ambos, é uma voz nitidamente mais fraca. As sessões no Preview também têm limite máximo e são restritas ao inglês, e não há execução de tarefas: os agentes conversam, não reservam, compram nem arquivam nada.
Isso deixa os desenvolvedores com uma oferta real, mas mais restrita: um checkpoint de fala conversacional auto-hospedável, sem taxa de licença, hospedado por um provedor terceirizado de inferência a US$ 7 por milhão de caracteres — cerca de US$ 0,35 por hora de áudio sintetizado — ou gratuito no seu próprio hardware. Ninguém publicou um benchmark independente nem da voz Preview nem do CSM-1B, então qualquer alegação de qualidade em qualquer direção é uma impressão auditiva, não uma medição. A Sesame também não publicou preços públicos, nem nível empresarial, nem plano de monetização; a direção declarada da empresa são parcerias de pesquisa e um produto de hardware planejado.

O que US$ 0,05 por minuto oferece que o grátis não oferece
O argumento de venda do GPT-Live-1 para um desenvolvedor não é que ele soa melhor, porque esse argumento é impossível de vencer contra um modelo fechado que ninguém consegue medir. É que a coisa pode ser chamada e tem preço. Concretamente, o que você recebe com o medidor rodando:
• Uma sessão que você controla — um ID de modelo, um endpoint de Sessões ao Vivo, o exemplo de integração publicado em execução via WebRTC, e uma sessão que você configura com instruções, vozes e um bloco de delegação.
• Tratamento de interrupções como comportamento documentado — 80,1% de interatividade no Full Duplex Bench v1.5, contra 45,4% do GPT-Realtime-2.1, com latência de troca de turno de 0,798 segundo e 87% de sucesso em chamadas de ferramentas. Todos os três são números da própria OpenAI, publicados junto com o lançamento e não reproduzidos por ninguém até o momento desta redação.
• Um backend de raciocínio que você escolhe — a camada de voz encaminha o trabalho pesado através de uma fronteira assíncrona para um modelo separado nomeado na configuração da sessão, que continua trabalhando enquanto a conversa prossegue. No exemplo da documentação da OpenAI, esse backend é o GPT-5.6 Terra; no lançamento para consumidores de julho, era o GPT-5.5.
• Transcrições, texto de resposta e faturação em formato de telefonia — US$ 3,00 por uma hora de linha aberta contínua, com cobrança ao segundo, e 15 segundos de inicialização da sessão creditados em vez de adicionados.
Sesame oferece uma conversa melhor e nenhuma dessas coisas. Se você está construindo um produto, “conversa melhor, sem API, sem preço, sem benchmark, apenas em inglês, limite de 30 minutos” não é uma comparação — é uma lista de espera.
Há agora um número no GPT-Live-1 que não existia no seu lançamento para consumidores, e ele é o contrapeso honesto para tudo o que foi dito acima. O Índice Speech to Speech da Artificial Analysis pontua o GPT-Live-1 em 69,8% — sétimo de onze modelos, atrás do GPT-Realtime-2.1, com 73,9%, e atrás do Grok Voice Think Fast 2.0, com 79,0%. Portanto, o modelo que você pode comprar também não é o melhor do ranking independente. O que o ranking não consegue avaliar é justamente aquilo em que a Sesame está de fato vencendo: nenhum dos onze modelos desse índice foi avaliado pela sensação de conversar com ele, e a voz do Sesame Preview não tem linha em lugar nenhum.

A parte da stack que não é de nenhuma das duas empresas
É aqui que as duas opções convergem, e onde a decisão deixa de ser binária. Nem o Sesame Preview nem o GPT-Live-1 é um agente completo. Os agentes da Sesame não executam tarefas; o GPT-Live-1 delega explicitamente qualquer coisa que exija raciocínio, recuperação ou uma ferramenta a um modelo de back-end. Em ambos os designs, o trabalho interessante acontece por trás da voz, numa chamada de modelo de texto simples, e essa camada é portável de uma forma que a camada de voz não é — você pode mover um back-end sem regravar um único prompt para o modelo de fala.
Esse back-end também é onde o OrcaRouter é útil, e vale a pena ser preciso sobre o que roteamos e o que não roteamos. Não roteamos o GPT-Live-1: o endpoint Live Sessions é da OpenAI, e a camada de voz lá está fora do nosso alcance. Também não roteamos o modelo de produção da Sesame, pelo motivo mais simples de que nunca foi oferecido como API. O que roteamos é a camada para a qual ambos os produtos passam o trabalho. Aproximadamente 190 modelos de onze provedores upstream rodam atrás de uma chave pelo preço de tabela do provedor sem acréscimo, com failover automático entre provedores e uma DSL de roteamento que pode compor vários modelos em uma única chamada. Para uma equipe construindo sobre um front-end de voz não comprovado, esse é o hedge que importa: a camada de fala pode ser trocada ou abandonada sem levar consigo a camada de raciocínio, e o modelo em que você apostou em março pode ser substituído em junho editando uma linha.
O que assistir
Três coisas mudariam esta comparação, e nenhuma delas está sob o controle de alguém ainda. Uma Sesame API — mesmo paga — transformaria instantaneamente a voz mais forte da categoria numa opção que dá para construir, e colocaria um preço real ao lado dos US$ 0,05 do GPT-Live-1. Um benchmark publicado da voz Preview converteria uma impressão de escuta num número, e avaliações independentes tendem a ser severas com vozes que só competiram em demonstrações. E a primeira reprodução externa dos números de interatividade e latência da OpenAI definiria se full duplex é uma lacuna real de capacidade ou uma avaliação bem escolhida.
Até então, a divisão honesta é esta. Se você está escolhendo uma voz para si mesmo, use o Sesame Preview — é gratuito, é melhor, e não custa nada preferi-lo. Se você está escolhendo uma voz para um produto que você precisa lançar, vender e dar suporte, o GPT-Live-1 é o único dos dois que você pode realmente comprar, e o fato de ele não ser o que soa melhor é o preço de entrada.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
