
Sesame Preview vs NVIDIA NemotronLabs VoiceChat 11B: La voz que no puedes licenciar, y la voz que no puedes lanzar
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenNUEVOQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
- tencentTencent: Hy32026-07-0642Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencia69Código60Matemáticas
Dos de los modelos de voz más comentados de 2026 tienen algo en común que ninguna de las coberturas de lanzamiento te dirá: no puedes integrar ninguno de los dos en un producto. Sesame Preview es el asistente de consumo gratuito cuya voz conversacional hizo que TestingCatalog lo llamara «uno de los mejores modos de voz disponibles en el mercado», y el modelo de producción que hay detrás no tiene API, ni ID de modelo, ni licencia que puedas comprar: la empresa simplemente no lo ha lanzado. NVIDIA NemotronLabs VoiceChat 11B es la imagen especular: los pesos son públicos, el diseño full-duplex es una auténtica primicia, y la licencia dice que solo para fines de investigación, así que tampoco nadie puede distribuirlo legalmente. Una es una voz que puedes escuchar pero no alquilar. La otra es una voz que puedes tener pero no vender. Esta es una comparación de dos puertas cerradas, y la pregunta útil es ante qué cerradura estás parado.
Dos puertas cerradas, con cerraduras distintas.
Empieza por la forma de cada uno, porque los nombres ocultan lo diferentes que son los dos productos. Sesame Preview es una aplicación, no una API. Incluye cuatro agentes con personalidades distintas — Maya (cálida y creativa), Miles (relajado y perspicaz), Simone (curiosa e intelectual), Charlie (ingenioso y cálido) — cada uno con su propia voz y su propia memoria que se sincroniza entre web y móvil cuando has iniciado sesión. Busca en la web, hace análisis en profundidad, toma notas y recordatorios, y envía un resumen después de cada llamada. La vista previa es gratuita, sin nivel de pago, solo en inglés, con un límite de 30 minutos por llamada cuando has iniciado sesión (cinco en caso contrario), y deliberadamente no ejecuta tareas: puede hacer lluvias de ideas e investigar, pero no te reservará el vuelo. No hay ninguna clave de API en el producto — la voz de producción es una función de la aplicación, no un endpoint.

NVIDIA NemotronLabs VoiceChat 11B es la forma opuesta: un checkpoint, no un producto. Llegó a Hugging Face el 3 de agosto de 2026 sin anuncio: sin publicación de lanzamiento, sin informe técnico, sin tweet; la tarjeta del modelo es el anuncio. Es un modelo de habla full-duplex de 11B parámetros (analizamos el encabezado de safetensors y contamos 11.095 mil millones de parámetros en 1.626 tensores) construido como una sola pila: un codificador Fast Conformer que procesa audio de 16 kHz en tramas de 80 ms con cero contexto a la derecha, un backbone Nemotron Nano 9B v2 que hace el razonamiento, un decodificador NVIDIA TTS que escribe audio de 22,05 kHz, un decodificador RNN-T que transcribe al usuario y un canal de salida separado que emite scripts de llamada a herramientas sin contaminar la respuesta hablada. Escucha y habla al mismo tiempo, puede ser interrumpido a mitad de palabra, y NVIDIA lo presenta como el primer modelo abierto full-duplex con llamada a herramientas. Si esa presentación sobrevive al contacto con la realidad es el tema de su propia sección más abajo.
El punto de referencia donde divergen — dos candidatos a «mejor conversación», dos estándares de evidencia rotos
Ambos modelos ponen toda su reputación en juego en lo mismo: la calidad conversacional —la alternancia de turnos, la interrupción, el ritmo natural, la sensación de un intercambio real—. Por eso merecen aparecer en un mismo titular. Y es también donde la comparación se vuelve extraña, porque ninguno de los dos candidatos puede evaluarse adecuadamente.
Sesame Preview no tiene ningún número en ninguna parte. El modelo de producción no está publicado ni listado — no hay ID de modelo, ni entrada en el leaderboard de voz a voz de Artificial Analysis, ni objetivo de latencia, ni benchmark de ningún tipo. La afirmación de TestingCatalog de "una de las mejores voces disponibles en el mercado" es consenso de revisores, no una medición, y no hay forma de hacer una prueba A/B a ciegas contra nada. El único modelo de Sesame que cualquiera puede ejecutar de forma independiente es el CSM-1B base de pesos abiertos, y eso es un checkpoint de texto a voz, no la voz de la aplicación.
NVIDIA NemotronLabs VoiceChat 11B tiene el problema opuesto: tiene números, pero los números están divididos entre dos estándares de evidencia que no coinciden. NVIDIA reporta 448 ms para tomar un turno con fluidez, 480 ms para ceder el turno al ser interrumpido, y una tasa perfecta de 1.0 en la toma de control ante la interrupción del usuario — todo medido por el proveedor en el propio Full-Duplex-Bench 1.0 de NVIDIA, nada reproducido de forma independiente. Las mediciones independientes de esta familia están registradas bajo un nombre y un número de parámetros diferentes — "Nemotron 3 VoiceChat (V1)" con 12B, una etiqueta que NVIDIA nunca ha reconciliado con el checkpoint de 11B en Hugging Face — y no son halagüeñas en el lado de la comprensión: 29.2% en Big Bench Audio según Artificial Analysis, frente al 37.0% en la propia ficha de NVIDIA. En VoiceBench, la familia obtiene 58.10, el mejor resultado abierto de full-duplex en la tabla de clasificación. Así que el mismo modelo es a la vez un líder entre los checkpoints abiertos de full-duplex y aproximadamente tres veces peor que los líderes de tiempo real alojados en comprender lo que escucha.

La divergencia, entonces, no es cuál es mejor. Es que los dos candidatos a la mejor conversación de 2026 están siendo juzgados con evidencias opuestas e igualmente incompletas. La voz que los reseñadores dicen que se siente más humana no tiene ninguna medición, y la voz que tiene entradas reales en la tabla de clasificación es aquella cuyas debilidades son públicas. No se puede comparar una reputación con un número, y aquí solo hay un número — y no es el halagador.
Access — una descarga de la tienda de aplicaciones, o una compilación de 80 GB
Si quieres probar cualquiera de los dos, la línea de salida difiere de una manera que importa más que cualquier especificación.
Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.
NVIDIA NemotronLabs VoiceChat 11B no es una descarga que puedas simplemente ejecutar — es una compilación que tienes que poner en marcha. Hugging Face afirma que el modelo «no está desplegado por ningún proveedor de inferencia»; NVIDIA no lo ha alojado; y el config.json en el repositorio es una configuración de entrenamiento de NeMo, por lo que no hay ningún checkpoint de Transformers al que puedas apuntar AutoModel. La vía compatible es un entorno conda fijado a Python 3.12, PyTorch 2.10 y Transformers 4.56, con causal-conv1d y mamba-ssm compilados desde el código fuente, en una GPU de 80 GB (A100, H100, H200, B200 o RTX 6000) ejecutando vLLM — o el contenedor NGC NIM de NVIDIA, que expone un WebSocket compatible con OpenAI Realtime en /v1/realtime una vez que estés en ese hardware. El contador de descargas cuenta la historia del acceso: aproximadamente 80 descargas en el primer mes del modelo frente a 107 me gusta. La gente lo marcó como favorito; casi nadie lo ejecutó. Una nota honesta para el investigador que sí lo haga: la columna vertebral de razonamiento sobre la que se construye este checkpoint, Nemotron Nano 9B v2, es en sí misma un modelo alojado que puedes invocar hoy — el modelo full-duplex que lo rodea no lo es, y esa brecha es precisamente el punto.

Precio — una app gratis, pesas gratis y la factura de 80 GB.
Ambos modelos son "gratis", y la palabra hace la misma cantidad de trabajo engañoso en ambos casos.
Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.
La vara de medir honesta para el día en que cualquiera de estos se vuelva comprable: sea cual sea el modelo de voz alojado que elijas, lo que debes pagar es el precio de lista del proveedor, sin margen de enrutamiento adicional — la transferencia directa que hace que un recorte de precio del proveedor se refleje en tu factura el mismo día en lugar de después de un ciclo de contrato. Ninguno de los modelos de este artículo se puede invocar a través de OrcaRouter: la voz de producción de Sesame no tiene API en absoluto, y NVIDIA NemotronLabs VoiceChat 11B no se puede invocar a través de nada. La vara es para la voz que realmente puedes comprar, y es exactamente el estándar que hace que una base TTS de $7 por millón de caracteres o una futura API de calidad Sesame sea fácil de fijar con honestidad.
Memory — la aplicación que recuerda vs el modelo que olvida
Aquí la brecha es un cañón, y es la razón más concreta por la que los dos no son sustitutos. Sesame Preview, la aplicación, recuerda: cada agente lleva una memoria por agente que se sincroniza entre web y móvil cuando has iniciado sesión, las llamadas pueden durar hasta 30 minutos, y el Modo Incógnito lee recuerdos pasados sin crear otros nuevos. El CSM-1B de código abierto, en cambio, tiene una ventana de contexto de 4K — aproximadamente tres o cuatro minutos de texto — y de todos modos no tiene oídos para escucharte.
NVIDIA NemotronLabs VoiceChat 11B admite como máximo unos dos minutos de contexto de audio: el cargador de datos de entrenamiento limita los enunciados a 142,39 segundos, y la tarjeta del modelo advierte que la conversación más allá de una ventana de dos minutos puede no conservarse. Para una llamada de soporte que necesita recordar lo que se acordó hace cuatro minutos, ese límite es descalificante por sí mismo. Añade una única voz fija (Aria) sin clonación en el checkpoint publicado, y el modelo que es abierto acerca de su arquitectura es también el modelo que no puede recordar a un cliente ni cambiar su propia voz.
En qué es realmente malo cada uno
Recopilado, porque una comparación que se detiene en las fortalezas es marketing:
• Sesame Preview:sin API — no puedes poner esta voz en un producto, y el modelo de producción no está lanzado ni puntuado. Solo inglés, sin ejecución de tareas, un límite de 30 minutos por llamada y ningún benchmark independiente de ningún tipo. El único modelo abierto, CSM-1B, tiene una ventana de contexto de 4K, no usa herramientas, no tiene capacidad de escucha y no es la voz de la aplicación.
• NVIDIA NemotronLabs VoiceChat 11B: una licencia solo para investigación (OpenMDW v1.1) — puedes descargarlo, estudiarlo y ajustarlo, pero no puedes distribuirlo, y tampoco puede hacerlo quien desarrolle a partir de él. No hay un endpoint alojado, así que «probarlo» implica una GPU de 80 GB y una compilación desde el código fuente. Solo está en inglés, con un límite de memoria de unos 2 minutos y una única voz fija. NVIDIA afirma que puede rendir por debajo de su propio backbone en conocimiento y seguimiento de instrucciones, y señala el razonamiento de varios pasos y la aritmética como puntos débiles. Puede cortarte a mitad de frase, degradarse hasta convertirse en galimatías irrecuperable o monólogo interno tras varios turnos, omitir palabras en la transcripción, y no es adecuado en absoluto para salas ruidosas o reverberantes. La llamada a herramientas solo funciona con prompts y respuestas que usen únicamente ASCII, admite un máximo de cinco herramientas por sesión, y su precisión de argumentos (44,2 %) y su tasa de éxito al primer intento (33 %) significan que acierta con la herramienta correcta con más fiabilidad que a la hora de rellenar sus argumentos.
Quién debería elegir cuál
Como ninguno es invocable, la respuesta honesta parte de lo que estás tratando de hacer.
• Experimenta la voz mejor valorada de 2026: Sesame Preview, gratis, hoy — como aplicación. Los cuatro agentes, el manejo de interrupciones, la usabilidad en modo conducción que los reseñadores no dejan de citar: eso es un producto de consumo, y su valor es precisamente lo que no se puede medir.
• Estudia el modelado de voz full-duplex: NVIDIA NemotronLabs VoiceChat 11B es la descarga más interesante en su categoría — un checkpoint abierto de 11B con un canal funcional de llamada de herramientas, aproximadamente 550.000 horas de audio de entrenamiento combinado, y el mejor resultado abierto de full-duplex en VoiceBench hasta la fecha, todo a un costo de cero dólares por los pesos. La licencia de solo investigación no es una restricción para ese trabajo.
• Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.
• Lanza un producto de voz este trimestre: ninguna de estas. Necesitas un modelo alojado de voz a voz en tiempo real con licencia comercial, y la forma segura de adoptar uno en el que no hayas basado tu ruta de producción es enrutar hacia él junto a un modelo probado, con conmutación automática por error, para que una voz no probada nunca haga caer una llamada en vivo. Una sola API para más de 200 modelos alojados al precio de lista del proveedor, sin recargo, es lo que hace que probar una voz recién disponible sea un cambio de configuración en lugar de una reescritura.
El patrón merece un nombre porque se repetirá. Ambos modelos están a un evento de ser invocables — Sesame el día que lance un ID de modelo o una API, NVIDIA NemotronLabs VoiceChat 11B el día que NVIDIA publique una licencia comercial o que alguien lo aloje. Cuando eso suceda, la decisión correcta no es eliminar tu stack de voz actual. Es agregar la nueva voz junto a la antigua y enrutar con failover, exactamente como harías con cualquier modelo nuevo y no probado. Estas son las dos mejores voces no lanzadas de 2026; la infraestructura para lanzar la tercera ya existe.
¿Qué cambiaría esta comparación?
Cuatro acontecimientos reescribirían este artículo. Una API o un ID de modelo para la voz de producción de Sesame — en el momento en que eso ocurra, Sesame dejará de ser una aplicación y se convertirá en el participante que el mercado de API de voz alojadas estaba esperando. Una licencia comercial o un endpoint alojado para NVIDIA NemotronLabs VoiceChat 11B, que convertiría de la noche a la mañana un artefacto de investigación en una opción de producto real. Una puntuación independiente para la voz de Sesame — una inclusión en el panel de voz a voz de Artificial Analysis daría a la afirmación de "mejor voz" algo contra lo que contrastarse. Y un informe técnico de NVIDIA que reconcilie el checkpoint de 11B con las entradas "Nemotron 3 VoiceChat (V1)" de 12B que miden las tablas de clasificación, que es la condición previa para confiar en cualquiera de las cifras de la familia. Hasta que algo de eso llegue, el resumen preciso es simple: las dos voces conversacionales más interesantes de 2026 están ambas bloqueadas — una por una empresa que no venderá, la otra por una licencia que no se entregará.
Preguntas frecuentes
¿Puedo usar la voz de cualquiera de los modelos dentro de mi propia aplicación?
No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.
¿Cuál de los dos suena realmente más humano?
Desconocido, por razones distintas en cada caso. Sesame Preview no tiene ninguna puntuación independiente en absoluto — que TestingCatalog lo llame "uno de los mejores modos de voz disponibles en el mercado" es consenso de los revisores, no una medición. El tiempo conversacional del NVIDIA NemotronLabs VoiceChat 11B (448 ms para tomar el turno, 480 ms para ceder ante una interrupción) es un dato reportado por NVIDIA y no reproducido de forma independiente, y su cifra independiente en Big Bench Audio (29,2 %, según Artificial Analysis, registrada como "Nemotron 3 VoiceChat (V1)") mide la comprensión, no lo agradable que resulta la voz. Uno tiene una reputación que se puede oír; el otro tiene números que responden a una pregunta distinta.
¿Es realmente gratuito NVIDIA NemotronLabs VoiceChat 11B?
Los pesos son gratuitos; el modelo no es barato. Ejecutarlo implica una GPU de 80 GB (aproximadamente $2–3 por hora bajo demanda, $1,500–2,200 al mes si se mantiene continuamente activa) y una compilación desde el código fuente, y la licencia OpenMDW v1.1 lo restringe solo a fines de investigación — así que incluso después de ese gasto, no puedes ponerlo legalmente frente a los clientes.
