
Realtime-Venus vs Sesame Preview: O Que Você Pode Conseguir Não É O Que É Bom
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus e Sesame Preview foram criados por laboratórios com ideias completamente diferentes sobre para que serve um modelo de voz, e tropeçaram na mesma armadilha vindos de direções opostas. O Sesame Preview é um aplicativo de consumo gratuito — iOS desde maio de 2026, Android desde o início de agosto — com quatro agentes conversacionais, pesquisa na web ao vivo durante as chamadas e uma voz que os críticos chamaram de melhor da categoria. Os pesos abertos que a Sesame publicou são um modelo diferente e menor que a própria empresa não apresenta como a voz que você ouviu na demonstração. O Realtime-Venus, o sistema full-duplex de 9B da Venus Team da Ant Group e da Universidade Tsinghua, seguiu o caminho oposto: os artefatos baixáveis são o que há de real, e não há produto algum. Nos dois casos, a diferença entre o que está disponível e o que é impressionante é a coisa mais útil de se entender antes de planejar qualquer coisa em torno de qualquer um dos dois.
O que cada um realmente é

Sesame Preview é um produto. A Sesame é um laboratório de São Francisco fundado em 2023 por Brendan Iribe, Ankit Kumar e Ryan Brown, com apoio da a16z, Sequoia, Spark e Matrix, e seu assistente de voz para consumidores vem com quatro personalidades — Maya, Miles, Simone e Charlie — cada uma com um temperamento e uma voz distintos. O agente pode pesquisar na web durante a conversa, fazer anotações e lembretes, e enviar um resumo após uma chamada. A memória é por agente e sincroniza entre web e celular quando você está conectado, com um modo anônimo que lê memórias passadas sem gravar novas. É gratuito, não exibe anúncios, e a empresa afirma que não vende dados.
Realtime-Venus é um lançamento de pesquisa. Dois checkpoints de 9B sob a licença Apache-2.0 no Hugging Face — Realtime-Venus-Omni para interação audiovisual e Realtime-Venus-Audio para interação falada — além de um relatório técnico submetido ao arXiv em 12 de setembro de 2026, uma página do projeto e um repositório complementar que contém o componente Realtime-Venus-Harness. Não há aplicativo, nem API, nem preço, nem anúncio do fornecedor. O repositório não é implantado por nenhum provedor de inferência, e os downloads não são rastreados.
A armadilha, em ambas as direções
A versão da Sesame é a clássica forma de open-washing, e a Sesame é mais honesta quanto a isso do que a maioria. O checkpoint do CSM que o laboratório lançou sob Apache-2.0 é um modelo base de geração de fala — um backbone Llama alimentando um decodificador Mimi-codec — e a documentação é explícita ao dizer que ele não é a voz do aplicativo nem um sistema de fala para fala ponta a ponta. Ele não consegue gerar texto e é treinado principalmente com dados em inglês, com capacidade limitada fora disso. O que alimenta o Sesame Preview é um modelo de produção maior que não foi lançado. Então, se você foi procurar a voz da demonstração, encontrou a linhagem de pesquisa dela, e não a coisa em si. Quando um dos quatro agentes atende à sua chamada, você está ouvindo algo que não pode baixar.
A versão do Realtime-Venus é a imagem espelhada e, pode-se argumentar, a mais estranha. Tudo o que foi publicado é genuíno: pesos reais, código real, relatório real, uma licença permissiva. O que falta é qualquer forma de usá-lo que não envolva possuir uma GPU. Dois checkpoints de 9B em BF16 têm cerca de dezoito gigabytes de pesos cada um, antes da memória de ativação, e ambos são projetados para executar um ciclo contínuo de streaming de um segundo com entrada de áudio e vídeo ao vivo. Isso é uma implantação de nível de servidor. Um aplicativo de consumidor que entrega a mesma capacidade a um celular está fazendo algo que esta versão não tenta fazer, e a lacuna entre um modelo baixável e um executável é exatamente onde a maioria das pessoas que o querem vai ficar presa.
A mensurabilidade é a diferença mais nítida
Nenhum dos modelos tem uma pontuação independente de qualidade de voz, mas os motivos são diferentes.
• Sesame Preview — sem entrada na arena, sem avaliação publicada da voz de produção. Sua reputação baseia-se nos avaliadores e no efeito da demo original sobre os ouvintes, o que constitui um tipo de evidência real e completamente não quantificada.
• CSM-1B — o checkpoint aberto é um modelo de geração base; ele não é avaliado em benchmarks contra sistemas conversacionais porque não o é.
• Realtime-Venus — um número de voz autorrelatado, uma pontuação de 4,81 no VoiceBench AlpacaEval que seu relatório descreve como equivalente ao melhor número de comparação. Nenhum terceiro o avaliou.
• O que nenhum dos dois lhe oferece — um número produzido por alguém sem interesse no resultado. Se a qualidade da voz é o seu critério de compra, a comparação inteira é impossível de pontuar, e a atitude honesta é ouvir os dois e decidir por si mesmo, em vez de se guiar por uma tabela.
Alternância de turnos, em que ambos têm algo a provar
A reputação da Sesame foi construída exatamente sobre isso. A demo que tornou o laboratório famoso era uma voz com respiração, hesitação e timing de interrupção convincente o suficiente para que os ouvintes presumissem que havia uma pessoa na linha. Isso é uma afirmação sobre dinâmicas conversacionais, e é nisso que o produto se baseia para ser vendido.
Realtime-Venus faz a mesma alegação, com números atrelados. No Full-Duplex-Bench v1.5, seu checkpoint de áudio relata responder a 75% das interrupções do usuário, com taxas de continuação de 97% em backchannels, 88% em fala dirigida a terceiros e 86% em fala de fundo — afirma-se que supera o Gemini 3.1 Live e o GPT-4o em todas as três métricas de continuação. Esses números vêm de seu próprio relatório, e ninguém os reproduziu.
Então, a comparação é uma demonstração sem número contra um número sem demonstração, o que é uma posição genuinamente desconfortável e uma descrição justa de como toda esta categoria fala de si mesma neste momento. A única coisa que se pode dizer com confiança é que nenhuma das afirmações passou pelo crivo de uma parte externa, e 97% de continuação em backchannels é alto o suficiente para merecer uma antes de ser citado como algo consolidado.

O que você pode realmente construir
O Sesame Preview não oferece nada a quem desenvolve. Não há API, nem identificador de modelo, nem tabela de preços e nenhum plano declarado para ter uma. As chamadas têm limite de trinta minutos quando se está conectado e de cinco caso contrário, o inglês é o único idioma oficialmente compatível, e o agente pesquisa e lembra, mas não executa tarefas — não reserva o voo. O nível gratuito é o produto. É uma oferta de consumidor perfeitamente boa e um beco sem saída para integração.
O Realtime-Venus dá a um desenvolvedor tudo, exceto um lugar para executá-lo. Os pesos são licenciados de forma permissiva, o código carrega com chamadas padrão do Transformers, entra-se no streaming full-duplex com a alternância de um único método, e o loop documentado é um segundo de prefill em streaming seguido de geração em streaming, repetido. A memória de vídeos longos é habilitada com um parâmetro memory-minutes e é descrita como sem necessidade de treinamento, o que é incomum para um recurso que normalmente exige fine-tuning. Duas ressalvas são documentadas em vez de deixadas para serem descobertas: um limite de quadros que trunca silenciosamente vídeos longos, a menos que uma constante seja aumentada antes da importação do utilitário, e a exigência de uma fonte CJK para legendas não latinas renderizadas em vídeo duplex.
O que nada disso muda é que o harness — o componente que executa as delegações assíncronas que são a parte mais distintiva da arquitetura — vive num repositório GitHub separado, está muito menos documentado do que o modelo, e é a parte cuja prontidão para produção é mais difícil de avaliar. Numa implantação real, a etapa de delegação é inferência de texto comum por trás de uma interface conversacional. A OrcaRouter não disponibiliza nem o Realtime-Venus nem o Sesame Preview; ambas as camadas de voz estão fora do que servimos, e dizemo-lo claramente em vez de sugerir uma relação de alojamento que não existe. Quase 200 modelos de texto atrás de uma única chave, ao preço de tabela do fornecedor e sem margem acrescida é a metade dessa arquitetura que cobrimos, com failover automático para que uma tarefa delegada sobreviva a uma indisponibilidade a montante, uma DSL de encaminhamento que compõe vários modelos numa só chamada, e fusão de modelos quando o julgamento de um só modelo não é suficiente. É a parte comprável de um desenho cuja parte interessante não está à venda.

A recomendação honesta
Se você é um consumidor que quer a melhor voz conversacional disponível hoje e não precisa integrá-la, o Sesame Preview é gratuito, está nas duas plataformas móveis, e sua reputação é merecida o suficiente para que os avaliadores continuem dizendo isso. Use-o e aproveite.
Se você é um pesquisador ou uma equipe de engenharia com bons recursos que precisa de uma pilha aberta de áudio-visual full-duplex que possa inspecionar e ajustar, Realtime-Venus é uma das pouquíssimas opções reais, e o fato de seus benchmarks serem autorrelatados não muda o fato de que os pesos são genuinamente abertos e a arquitetura é genuinamente documentada.
Se você é uma equipe de produto em busca de uma camada de voz para lançar neste trimestre, nenhuma dessas opções é a sua resposta, e a conclusão útil dessa combinação é justamente o porquê. Um laboratório construiu algo excelente e manteve a parte boa fechada; o outro publicou tudo e deixou você responsável por fornecer a infraestrutura. A categoria provou que consegue criar uma voz que vale a pena ouvir e ainda não decidiu se essa voz deveria ser comprável em qualquer formato que não seja um aplicativo.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
