Cartão de título para 'Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B': título grande, subtítulo 'A voz que você não pode licenciar, e a voz que você não pode lançar', e dois cartões planos com ícones — 'Sesame Preview' com um ícone de linha de telefone e pessoa e um selo com 'App gratuito · sem API · escolha dos avaliadores', e 'NVIDIA NemotronLabs VoiceChat 11B' com um ícone de linha de download e servidor e um selo com 'Pesos abertos · somente para pesquisa · auto-hospedado'. Rodapé: 'As duas melhores vozes que não podem ser lançadas — IA de voz, agosto de 2026.' Logotipo da OrcaRouter sobreposto no canto inferior direito.
Guides & Insights

Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: A voz que você não pode licenciar, e a voz que você não pode lançar

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois dos modelos de voz mais comentados de 2026 têm algo em comum que nenhuma cobertura de lançamento vai te contar: você não pode colocar nenhum dos dois em um produto. Sesame Preview é o assistente gratuito para consumidores cuja voz conversacional levou o TestingCatalog a chamá-lo de "um dos melhores modos de voz disponíveis no mercado", e o modelo de produção por trás dele não tem API, nem ID de modelo, nem licença que você possa comprar — a empresa simplesmente não o lançou. NVIDIA NemotronLabs VoiceChat 11B é a imagem espelhada: os pesos são públicos, o design full-duplex é algo verdadeiramente inédito, e a licença diz que é apenas para fins de pesquisa, então ninguém pode distribuí-lo legalmente também. Um é uma voz que você pode ouvir, mas não alugar. O outro é uma voz que você pode segurar, mas não vender. Esta é uma comparação entre duas portas trancadas, e a pergunta útil é em frente a qual fechadura você está.

Duas portas trancadas, com fechaduras diferentes.

Comece pela forma de cada um, porque os nomes escondem o quanto esses dois produtos são diferentes. O Sesame Preview é um aplicativo, não uma API. Ele vem com quatro agentes de personalidades distintas — Maya (calorosa e criativa), Miles (descontraído e perspicaz), Simone (curiosa e intelectual), Charlie (espirituoso e caloroso) — cada um com sua própria voz e sua própria memória, que sincroniza entre web e mobile quando você está conectado. Ele pesquisa na web, faz mergulhos profundos, faz anotações e define lembretes, e envia um resumo após cada chamada. O preview é gratuito, sem plano pago, somente em inglês, com limite de 30 minutos por chamada quando conectado (cinco caso contrário), e deliberadamente não executa tarefas: ele faz brainstorming e pesquisa, mas não reserva seu voo. Não há chave de API em lugar nenhum do produto — a voz de produção é um recurso do aplicativo, não um endpoint.

Screenshot of Sesame's official Mobile Preview page (sesame.com/mobile-preview), showing 'Personal agents for curious people' and 'Preview available now on iOS and Android' with App Store and Google Play links. Captured August 6, 2026.

O NVIDIA NemotronLabs VoiceChat 11B tem a forma oposta: um checkpoint, não um produto. Ele chegou ao Hugging Face em 3 de agosto de 2026 sem anúncio — sem post de lançamento, sem relatório técnico, sem tweet; o model card é o anúncio. É um modelo de fala full-duplex de 11B parâmetros (analisamos o cabeçalho do safetensors e contamos 11,095 bilhões de parâmetros em 1.626 tensores) construído como uma pilha única: um codificador Fast Conformer que processa áudio de 16 kHz em quadros de 80 ms com zero contexto à direita, um backbone Nemotron Nano 9B v2 fazendo o raciocínio, um decodificador TTS da NVIDIA escrevendo áudio de 22,05 kHz, um decodificador RNN-T transcrevendo o usuário e um canal de saída separado que emite scripts de chamada de ferramentas sem contaminar a resposta falada. Ele ouve e fala ao mesmo tempo, pode ser interrompido no meio da palavra, e a NVIDIA o apresenta como o primeiro modelo full-duplex aberto com chamada de ferramentas. Se essa apresentação sobrevive ao contato com a realidade é o assunto da sua própria seção abaixo.

O critério em que eles divergem — dois candidatos para "melhor conversa", dois padrões de evidência falhos

Ambos os modelos apostam toda a sua reputação na mesma coisa: {{1}}qualidade conversacional{{/1}} — {{2}}alternância de turnos, interrupção, ritmo natural, a sensação de uma troca real{{/2}}. É por isso que eles pertencem a uma mesma manchete. É também {{3}}onde a comparação se torna estranha, porque nenhum dos candidatos pode ser avaliado adequadamente{{/3}}.

A Prévia do Sesame não tem número algum em lugar nenhum. O modelo de produção não foi lançado e não está listado — sem ID de modelo, sem entrada no leaderboard de fala-para-fala da Artificial Analysis, sem meta de latência, sem benchmark de qualquer tipo. A afirmação do TestingCatalog de que é "uma das melhores vozes disponíveis no mercado" é consenso entre revisores, não uma medição, e não há como fazer um teste cego A/B contra qualquer outra coisa. O único modelo da Sesame que qualquer pessoa pode executar de forma independente é o CSM-1B base de pesos abertos, e esse é um checkpoint de texto-para-fala, não a voz do aplicativo.

NVIDIA NemotronLabs VoiceChat 11B tem o problema oposto: tem números, mas os números estão divididos entre dois padrões de evidência que não concordam. A NVIDIA reporta 448 ms para fazer uma transição suave, 480 ms para ceder quando interrompida, e uma taxa perfeita de retomada de 1,0 na interrupção do usuário — tudo medido pelo fornecedor no próprio Full-Duplex-Bench 1.0 da NVIDIA, nada reproduzido de forma independente. As medições independentes dessa família estão arquivadas sob um nome e contagem de parâmetros diferentes — "Nemotron 3 VoiceChat (V1)" em 12B, um rótulo que a NVIDIA nunca reconciliou com o checkpoint de 11B no Hugging Face — e são desfavoráveis no lado da compreensão: 29,2% no Big Bench Audio segundo a Artificial Analysis, contra 37,0% na própria ficha da NVIDIA. No VoiceBench, a família pontua 58,10, o melhor resultado aberto full-duplex no quadro. Assim, o mesmo modelo é simultaneamente um líder entre os checkpoints abertos full-duplex e aproximadamente três vezes atrás dos líderes de tempo real hospedados na compreensão do que ouve.

A two-column comparison scoreboard for Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B. Sesame Preview: 'free app, 4 voice agents', 'Independent score: none — app unreleased', 'How you buy it: no API — app only', 'Callable voice: CSM-1B, $7/M chars', 'Memory: per-agent, syncs across devices', 'Latency: no published target'. NVIDIA NemotronLabs VoiceChat 11B: 'open full-duplex checkpoint', 'Independent score: VoiceBench 58.10 (V1/12B)', 'How you buy it: not buyable — research-only', 'Callable voice: none — 80 GB self-host', 'Memory: ~2 min audio context max', 'Latency: 448 ms turn-taking (NVIDIA)'. Footer: 'Nemotron figures per NVIDIA / Artificial Analysis (V1 12B lineage); Sesame app voice unmeasured; prices per vendor/OpenRouter.' OrcaRouter logo composited bottom-right.

A divergência, portanto, não é sobre qual é melhor. É que os dois candidatos à melhor conversa de 2026 estão sendo julgados com base em evidências opostas e igualmente incompletas. A voz que os revisores dizem parecer mais humana não tem nenhuma medição, e a voz com entradas reais no ranking é aquela cujas fraquezas são públicas. Você não pode comparar uma reputação a um número, e aqui há apenas um número — e não é o mais lisonjeiro.

Acesso — um download da app store, ou um build de 80 GB

Se quiser experimentar qualquer um dos dois, a linha de partida difere de uma maneira que importa mais do que qualquer especificação.

Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.

NVIDIA NemotronLabs VoiceChat 11B não é um download que você possa simplesmente executar — é uma build que você precisa montar. O Hugging Face afirma que o modelo "não é implantado por nenhum Inference Provider"; a NVIDIA não o hospedou; e o config.json no repositório é um config de treinamento NeMo, então não há um checkpoint Transformers para o qual você possa apontar o AutoModel. O caminho suportado é um ambiente conda fixado em Python 3.12, PyTorch 2.10 e Transformers 4.56, com causal-conv1d e mamba-ssm compilados a partir do código-fonte, em uma GPU de 80 GB (A100, H100, H200, B200 ou RTX 6000) executando vLLM — ou o container NGC NIM da NVIDIA, que expõe um WebSocket compatível com OpenAI Realtime em /v1/realtime quando você estiver nesse hardware. O contador de downloads conta a história de acesso: cerca de 80 downloads no primeiro mês do modelo contra 107 curtidas. As pessoas o salvaram nos favoritos; quase ninguém o executou. Uma nota honesta para o pesquisador que o fizer: o backbone de raciocínio sobre o qual este checkpoint se baseia, Nemotron Nano 9B v2, é em si um modelo hospedado que você pode acessar hoje — o modelo full-duplex ao redor dele não é, e essa lacuna é exatamente o ponto.

The Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the OpenMDW 1.1 research-only license, 'This model isn't deployed by any Inference Provider', natural turn-taking / barge-in / tool calling, ~450 ms response, 11B params, and 80 downloads in the last month with 107 likes. Captured August 6, 2026.

Preço — um aplicativo gratuito, pesos livres e a conta de 80 GB

Ambos os modelos são "gratuitos", e a palavra desempenha o mesmo papel enganoso em ambos os casos.

Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.

O critério honesto para o dia em que qualquer um destes se tornar comprável: seja qual for o modelo de voz hospedado que você escolher, o preço de tabela do provedor é o que você deve pagar, sem nenhum acréscimo de roteamento por cima — o repasse que faz um corte de preço do fornecedor aparecer na sua fatura no mesmo dia, em vez de depois de um ciclo de contrato. Nenhum dos modelos deste artigo é chamável por meio do OrcaRouter: a voz de produção da Sesame não tem API nenhuma, e o NVIDIA NemotronLabs VoiceChat 11B não é chamável por meio de nada. O critério é para a voz que você pode de fato comprar, e é exatamente o padrão que torna fácil precificar com honestidade uma base de T​TS de US$ 7 por milhão de caracteres ou uma futura API com a qualidade da Sesame.

Memory — o app que lembra vs o modelo que esquece

Aqui a lacuna é um cânion, e é a razão mais concreta pela qual os dois não são substitutos. Sesame Preview, o aplicativo, lembra: cada agente carrega memória por agente que sincroniza entre web e mobile quando você está conectado, as chamadas podem durar até 30 minutos, e o Modo Incógnito lê memórias passadas sem criar novas. O CSM-1B aberto, por outro lado, tem uma janela de contexto de 4K — aproximadamente três a quatro minutos de texto — e não tem ouvidos para ouvir você de qualquer forma.

O NVIDIA NemotronLabs VoiceChat 11B suporta no máximo cerca de dois minutos de contexto de áudio — o dataloader de treinamento limita as falas a 142,39 segundos, e o cartão avisa que conversas além de uma janela de dois minutos podem não ser retidas. Para uma chamada de suporte que precisa lembrar o que foi acordado há quatro minutos, esse teto é desqualificante por si só. Adicione uma única voz fixa (Aria) sem clonagem no checkpoint lançado, e o modelo que é aberto sobre sua arquitetura também é o modelo que não consegue lembrar de um cliente nem mudar a própria voz.

No que cada um é genuinamente ruim

Composto, porque uma comparação que se limita aos pontos fortes é marketing:

Sesame Preview: sem API — você não pode colocar essa voz em um produto, e o modelo de produção não foi lançado nem avaliado. Somente em inglês, sem execução de tarefas, um limite de 30 minutos por chamada e nenhum benchmark independente de qualquer tipo. O único modelo aberto, CSM-1B, tem uma janela de contexto de 4K, sem chamada de ferramentas, sem capacidade de escuta, e não é a voz do aplicativo.

NVIDIA NemotronLabs VoiceChat 11B: uma licença exclusiva para pesquisa (OpenMDW v1.1) — você pode baixá-lo, estudá-lo e fazer fine-tuning, mas não pode distribuí-lo, e tampouco quem o utilizar como base. Não há endpoint hospedado, então "experimentá-lo" significa ter uma GPU de 80 GB e compilar a partir do código-fonte. Apenas em inglês, com um limite de memória de ~2 minutos e uma única voz fixa. A NVIDIA afirma que ele pode ter desempenho inferior ao seu próprio backbone em conhecimento e na capacidade de seguir instruções, com o raciocínio de múltiplas etapas e a aritmética apontados como fracos. Ele pode interromper você no meio de uma frase, degradar-se em tagarelice irrecuperável ou falar sozinho após várias rodadas, omitir palavras na transcrição e é explicitamente inadequado para ambientes ruidosos ou com reverberação. A chamada de ferramentas (tool calling) funciona apenas com prompts e respostas em ASCII, limita-se a cinco ferramentas por sessão, e sua precisão de argumentos (44,2%) e taxa de sucesso na primeira tentativa (33%) significam que ele escolhe a ferramenta certa com mais confiabilidade do que preenche os argumentos da ferramenta.

Quem deve escolher qual

Como nenhum dos dois é chamável, a resposta honesta parte do que você está tentando fazer.

Experimente a voz mais bem avaliada de 2026: Sesame Preview, grátis, hoje — como aplicativo. Os quatro agentes, o gerenciamento de interrupções, a usabilidade no modo de condução que os avaliadores não param de citar: isso é um produto de consumo, e o seu valor é precisamente aquilo que não se pode medir.

Estudo da modelagem de fala full-duplex: NVIDIA NemotronLabs VoiceChat 11B é o download mais interessante da sua categoria — um checkpoint aberto de 11B com um canal funcional de chamada de ferramentas, cerca de 550.000 horas de áudio de treinamento combinado e o melhor resultado aberto de full-duplex no VoiceBench até o momento, tudo ao custo de zero dólares pelos pesos. A licença somente para pesquisa não é uma restrição para esse trabalho.

Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.

Lance um produto de voz neste trimestre: nenhuma dessas opções. Você precisa de um modelo hospedado de fala-para-fala em tempo real com licença comercial, e a maneira segura de adotar um modelo no qual você ainda não apostou o caminho de produção é rotear para ele ao lado de um modelo comprovado, com failover automático, para que uma voz não comprovada nunca derrube uma chamada ao vivo. Uma única API em 200+ modelos hospedados pelo preço de tabela do provedor, sem margem de lucro, é o que torna testar uma voz recém-disponível uma mudança de configuração em vez de uma reescrita.

O padrão merece um nome porque vai se repetir. Ambos os modelos estão a um evento de se tornarem chamáveis — Sesame no dia em que disponibilizar um ID de modelo ou API, NVIDIA NemotronLabs VoiceChat 11B no dia em que a NVIDIA publicar uma licença comercial ou alguém o hospedar. Quando isso acontecer, a atitude certa não é arrancar sua pilha de voz atual. É adicionar a nova voz ao lado da antiga e rotear com failover, exatamente como você faria com qualquer modelo novo e não comprovado. Essas são as duas melhores vozes não-lançáveis de 2026; a infraestrutura para lançar a terceira já existe.

O que mudaria esta comparação

Quatro eventos reescreveriam este artigo. Uma API ou ID de modelo para a voz de produção da Sesame — no momento em que isso acontecer, a Sesame deixa de ser um aplicativo e se torna a concorrente que o mercado de APIs de voz hospedadas esperava. Uma licença comercial ou um endpoint hospedado para o NVIDIA NemotronLabs VoiceChat 11B, o que transformaria um artefato de pesquisa em uma opção de produto real da noite para o dia. Uma pontuação independente para a voz da Sesame — uma listagem no painel speech-to-speech da Artificial Analysis daria à alegação de "melhor voz" algo com que ser confrontada. E um relatório técnico da NVIDIA reconciliando o checkpoint de 11B com as entradas de 12B "Nemotron 3 VoiceChat (V1)" que os leaderboards medem, o que é a pré-condição para confiar em qualquer um dos números da família. Até que qualquer uma dessas coisas aconteça, o resumo preciso é simples: as duas vozes conversacionais mais interessantes de 2026 estão ambas bloqueadas — uma por uma empresa que se recusa a vendê-la, a outra por uma licença que não será lançada.

Perguntas Frequentes

Posso usar a voz de qualquer um dos modelos no meu próprio aplicativo?

No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.

Qual dos dois realmente soa mais humano?

Desconhecido, por motivos diferentes para cada um. O Sesame Preview não tem nenhuma pontuação independente — a frase do TestingCatalog “um dos melhores modos de voz disponíveis no mercado” é consenso entre avaliadores, não uma medição. O tempo de conversação do NVIDIA NemotronLabs VoiceChat 11B (448 ms para tomada de turno, 480 ms para ceder à interrupção) é informado pela NVIDIA e não reproduzido, e seu número independente no Big Bench Audio (29,2%, segundo a Artificial Analysis, registrado como “Nemotron 3 VoiceChat (V1)”) mede compreensão, não o quão agradável é a voz. Um tem uma reputação que você pode ouvir; o outro tem números que respondem a uma pergunta diferente.

O NVIDIA NemotronLabs VoiceChat 11B é realmente gratuito?

Os pesos são gratuitos; o modelo não é barato. Executá-lo exige uma GPU de 80 GB (cerca de US$ 2–3 por hora sob demanda, US$ 1.500–2.200 por mês se mantida ativa continuamente) e uma compilação a partir do código-fonte, e a licença OpenMDW v1.1 o restringe apenas a fins de pesquisa — portanto, mesmo após esse gasto, você não pode legalmente disponibilizá-lo a clientes.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube