Cartão de título principal para 'Realtime-Venus vs Sesame Preview', com o subtítulo 'Dois laboratórios, a mesma armadilha, direções opostas', com três cartões que dizem 'Sesame Preview: aplicativo gratuito, quatro agentes, sem API desde maio de 2026', 'Realtime-Venus: pesos Apache-2.0, sem produto, sem anúncio' e 'Nenhum dos dois publica uma pontuação de voz verificada de forma independente', acima de uma faixa de rodapé que diz 'Recursos do Sesame conforme sua própria documentação de prévia móvel; números do Realtime-Venus de seu relatório técnico, não reproduzidos.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Realtime-Venus vs Sesame Preview: O Que Você Pode Conseguir Não É O Que É Bom

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Realtime-Venus e Sesame Preview foram criados por laboratórios com ideias completamente diferentes sobre para que serve um modelo de voz, e tropeçaram na mesma armadilha vindos de direções opostas. O Sesame Preview é um aplicativo de consumo gratuito — iOS desde maio de 2026, Android desde o início de agosto — com quatro agentes conversacionais, pesquisa na web ao vivo durante as chamadas e uma voz que os críticos chamaram de melhor da categoria. Os pesos abertos que a Sesame publicou são um modelo diferente e menor que a própria empresa não apresenta como a voz que você ouviu na demonstração. O Realtime-Venus, o sistema full-duplex de 9B da Venus Team da Ant Group e da Universidade Tsinghua, seguiu o caminho oposto: os artefatos baixáveis são o que há de real, e não há produto algum. Nos dois casos, a diferença entre o que está disponível e o que é impressionante é a coisa mais útil de se entender antes de planejar qualquer coisa em torno de qualquer um dos dois.

O que cada um realmente é

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview é um produto. A Sesame é um laboratório de São Francisco fundado em 2023 por Brendan Iribe, Ankit Kumar e Ryan Brown, com apoio da a16z, Sequoia, Spark e Matrix, e seu assistente de voz para consumidores vem com quatro personalidades — Maya, Miles, Simone e Charlie — cada uma com um temperamento e uma voz distintos. O agente pode pesquisar na web durante a conversa, fazer anotações e lembretes, e enviar um resumo após uma chamada. A memória é por agente e sincroniza entre web e celular quando você está conectado, com um modo anônimo que lê memórias passadas sem gravar novas. É gratuito, não exibe anúncios, e a empresa afirma que não vende dados.

Realtime-Venus é um lançamento de pesquisa. Dois checkpoints de 9B sob a licença Apache-2.0 no Hugging Face — Realtime-Venus-Omni para interação audiovisual e Realtime-Venus-Audio para interação falada — além de um relatório técnico submetido ao arXiv em 12 de setembro de 2026, uma página do projeto e um repositório complementar que contém o componente Realtime-Venus-Harness. Não há aplicativo, nem API, nem preço, nem anúncio do fornecedor. O repositório não é implantado por nenhum provedor de inferência, e os downloads não são rastreados.

A armadilha, em ambas as direções

A versão da Sesame é a clássica forma de open-washing, e a Sesame é mais honesta quanto a isso do que a maioria. O checkpoint do CSM que o laboratório lançou sob Apache-2.0 é um modelo base de geração de fala — um backbone Llama alimentando um decodificador Mimi-codec — e a documentação é explícita ao dizer que ele não é a voz do aplicativo nem um sistema de fala para fala ponta a ponta. Ele não consegue gerar texto e é treinado principalmente com dados em inglês, com capacidade limitada fora disso. O que alimenta o Sesame Preview é um modelo de produção maior que não foi lançado. Então, se você foi procurar a voz da demonstração, encontrou a linhagem de pesquisa dela, e não a coisa em si. Quando um dos quatro agentes atende à sua chamada, você está ouvindo algo que não pode baixar.

A versão do Realtime-Venus é a imagem espelhada e, pode-se argumentar, a mais estranha. Tudo o que foi publicado é genuíno: pesos reais, código real, relatório real, uma licença permissiva. O que falta é qualquer forma de usá-lo que não envolva possuir uma GPU. Dois checkpoints de 9B em BF16 têm cerca de dezoito gigabytes de pesos cada um, antes da memória de ativação, e ambos são projetados para executar um ciclo contínuo de streaming de um segundo com entrada de áudio e vídeo ao vivo. Isso é uma implantação de nível de servidor. Um aplicativo de consumidor que entrega a mesma capacidade a um celular está fazendo algo que esta versão não tenta fazer, e a lacuna entre um modelo baixável e um executável é exatamente onde a maioria das pessoas que o querem vai ficar presa.

A mensurabilidade é a diferença mais nítida

Nenhum dos modelos tem uma pontuação independente de qualidade de voz, mas os motivos são diferentes.

• Sesame Preview — sem entrada na arena, sem avaliação publicada da voz de produção. Sua reputação baseia-se nos avaliadores e no efeito da demo original sobre os ouvintes, o que constitui um tipo de evidência real e completamente não quantificada.

• CSM-1B — o checkpoint aberto é um modelo de geração base; ele não é avaliado em benchmarks contra sistemas conversacionais porque não o é.

• Realtime-Venus — um número de voz autorrelatado, uma pontuação de 4,81 no VoiceBench AlpacaEval que seu relatório descreve como equivalente ao melhor número de comparação. Nenhum terceiro o avaliou.

• O que nenhum dos dois lhe oferece — um número produzido por alguém sem interesse no resultado. Se a qualidade da voz é o seu critério de compra, a comparação inteira é impossível de pontuar, e a atitude honesta é ouvir os dois e decidir por si mesmo, em vez de se guiar por uma tabela.

Alternância de turnos, em que ambos têm algo a provar

A reputação da Sesame foi construída exatamente sobre isso. A demo que tornou o laboratório famoso era uma voz com respiração, hesitação e timing de interrupção convincente o suficiente para que os ouvintes presumissem que havia uma pessoa na linha. Isso é uma afirmação sobre dinâmicas conversacionais, e é nisso que o produto se baseia para ser vendido.

Realtime-Venus faz a mesma alegação, com números atrelados. No Full-Duplex-Bench v1.5, seu checkpoint de áudio relata responder a 75% das interrupções do usuário, com taxas de continuação de 97% em backchannels, 88% em fala dirigida a terceiros e 86% em fala de fundo — afirma-se que supera o Gemini 3.1 Live e o GPT-4o em todas as três métricas de continuação. Esses números vêm de seu próprio relatório, e ninguém os reproduziu.

Então, a comparação é uma demonstração sem número contra um número sem demonstração, o que é uma posição genuinamente desconfortável e uma descrição justa de como toda esta categoria fala de si mesma neste momento. A única coisa que se pode dizer com confiança é que nenhuma das afirmações passou pelo crivo de uma parte externa, e 97% de continuação em backchannels é alto o suficiente para merecer uma antes de ser citado como algo consolidado.

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

O que você pode realmente construir

O Sesame Preview não oferece nada a quem desenvolve. Não há API, nem identificador de modelo, nem tabela de preços e nenhum plano declarado para ter uma. As chamadas têm limite de trinta minutos quando se está conectado e de cinco caso contrário, o inglês é o único idioma oficialmente compatível, e o agente pesquisa e lembra, mas não executa tarefas — não reserva o voo. O nível gratuito é o produto. É uma oferta de consumidor perfeitamente boa e um beco sem saída para integração.

O Realtime-Venus dá a um desenvolvedor tudo, exceto um lugar para executá-lo. Os pesos são licenciados de forma permissiva, o código carrega com chamadas padrão do Transformers, entra-se no streaming full-duplex com a alternância de um único método, e o loop documentado é um segundo de prefill em streaming seguido de geração em streaming, repetido. A memória de vídeos longos é habilitada com um parâmetro memory-minutes e é descrita como sem necessidade de treinamento, o que é incomum para um recurso que normalmente exige fine-tuning. Duas ressalvas são documentadas em vez de deixadas para serem descobertas: um limite de quadros que trunca silenciosamente vídeos longos, a menos que uma constante seja aumentada antes da importação do utilitário, e a exigência de uma fonte CJK para legendas não latinas renderizadas em vídeo duplex.

O que nada disso muda é que o harness — o componente que executa as delegações assíncronas que são a parte mais distintiva da arquitetura — vive num repositório GitHub separado, está muito menos documentado do que o modelo, e é a parte cuja prontidão para produção é mais difícil de avaliar. Numa implantação real, a etapa de delegação é inferência de texto comum por trás de uma interface conversacional. A OrcaRouter não disponibiliza nem o Realtime-Venus nem o Sesame Preview; ambas as camadas de voz estão fora do que servimos, e dizemo-lo claramente em vez de sugerir uma relação de alojamento que não existe. Quase 200 modelos de texto atrás de uma única chave, ao preço de tabela do fornecedor e sem margem acrescida é a metade dessa arquitetura que cobrimos, com failover automático para que uma tarefa delegada sobreviva a uma indisponibilidade a montante, uma DSL de encaminhamento que compõe vários modelos numa só chamada, e fusão de modelos quando o julgamento de um só modelo não é suficiente. É a parte comprável de um desenho cuja parte interessante não está à venda.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

A recomendação honesta

Se você é um consumidor que quer a melhor voz conversacional disponível hoje e não precisa integrá-la, o Sesame Preview é gratuito, está nas duas plataformas móveis, e sua reputação é merecida o suficiente para que os avaliadores continuem dizendo isso. Use-o e aproveite.

Se você é um pesquisador ou uma equipe de engenharia com bons recursos que precisa de uma pilha aberta de áudio-visual full-duplex que possa inspecionar e ajustar, Realtime-Venus é uma das pouquíssimas opções reais, e o fato de seus benchmarks serem autorrelatados não muda o fato de que os pesos são genuinamente abertos e a arquitetura é genuinamente documentada.

Se você é uma equipe de produto em busca de uma camada de voz para lançar neste trimestre, nenhuma dessas opções é a sua resposta, e a conclusão útil dessa combinação é justamente o porquê. Um laboratório construiu algo excelente e manteve a parte boa fechada; o outro publicou tudo e deixou você responsável por fornecer a infraestrutura. A categoria provou que consegue criar uma voz que vale a pena ouvir e ainda não decidiu se essa voz deveria ser comprável em qualquer formato que não seja um aplicativo.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente