Tarjeta de título principal para «Realtime-Venus vs Sesame Preview», con el subtítulo «Dos laboratorios, la misma trampa, direcciones opuestas», con tres tarjetas que dicen «Sesame Preview: app gratuita, cuatro agentes, sin API desde mayo de 2026», «Realtime-Venus: pesos Apache-2.0, sin producto, sin anuncio» y «Ninguno publica una puntuación de voz verificada de forma independiente», sobre una franja inferior que dice «Capacidades de Sesame según su propia documentación de vista previa móvil; cifras de Realtime-Venus de su informe técnico, no reproducidas». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Realtime-Venus vs. Sesame Preview: Lo que puedes conseguir no es lo que es bueno

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Realtime-Venus y Sesame Preview han sido creados por laboratorios con ideas completamente distintas sobre para qué sirve un modelo de voz, y han caído en la misma trampa desde direcciones opuestas. Sesame Preview es una aplicación de consumo gratuita —para iOS desde mayo de 2026 y para Android desde principios de agosto— con cuatro agentes conversacionales, búsqueda web en vivo durante las llamadas y una voz que los críticos han calificado como la mejor de su clase. Los pesos abiertos que publicó Sesame corresponden a un modelo distinto y más pequeño que la propia empresa no presenta como la voz que se escuchó en la demo. Realtime-Venus, el sistema full-duplex de 9B del Venus Team de Ant Group y la Universidad de Tsinghua, tomó el camino contrario: los artefactos descargables son lo auténtico, y no existe ningún producto. En ambos casos, la brecha entre lo que está disponible y lo que es impresionante es lo más útil que hay que entender antes de planear cualquier cosa en torno a uno u otro.

Lo que realmente es cada uno

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview es un producto. Sesame es un laboratorio de San Francisco fundado en 2023 por Brendan Iribe, Ankit Kumar y Ryan Brown, respaldado por a16z, Sequoia, Spark y Matrix, y su asistente de voz para consumidores incluye cuatro personalidades — Maya, Miles, Simone y Charlie — cada una con un temperamento y una voz distintos. El agente puede buscar en la web a mitad de conversación, tomar notas y recordatorios, y enviar un resumen después de una llamada. La memoria es por agente y se sincroniza entre la web y el móvil cuando has iniciado sesión, con un modo incógnito que lee memorias pasadas sin escribir nuevas. Es gratis, no muestra anuncios y la empresa afirma que no vende datos.

Realtime-Venus es una publicación de investigación. Dos checkpoints de 9B bajo Apache-2.0 en Hugging Face —Realtime-Venus-Omni para interacción audiovisual y Realtime-Venus-Audio para interacción hablada—, además de un informe técnico enviado a arXiv el 12 de septiembre de 2026, una página de proyecto y un repositorio complementario que contiene el componente Realtime-Venus-Harness. No hay aplicación, ni API, ni precio, ni anuncio por parte del proveedor. El repositorio no está desplegado por ningún proveedor de inferencia y no se registran las descargas.

La trampa, en ambas direcciones

La versión de Sesame es la clásica forma de open-washing, y Sesame es más honesto al respecto que la mayoría. El checkpoint CSM que el laboratorio publicó bajo Apache-2.0 es un modelo base de generación de voz —una columna vertebral Llama que alimenta un decodificador de Mimi-codec— y la documentación deja explícito que no es la voz de la aplicación ni un sistema de voz a voz de extremo a extremo. No puede generar texto, y está entrenado con datos principalmente en inglés con capacidad limitada fuera de eso. Lo que impulsa Sesame Preview es un modelo de producción más grande que no se ha publicado. Así que si fuiste a buscar la voz de la demo, encontraste su linaje de investigación y no la cosa en sí. Cuando uno de los cuatro agentes responde a tu llamada, estás oyendo algo que no puedes descargar.

La versión de Realtime-Venus es la imagen espejo, y podría decirse que la más extraña. Todo lo publicado es genuino: pesos reales, código real, informe real, una licencia permisiva. Lo que falta es cualquier forma de usarlo que no implique poseer una GPU. Dos checkpoints de 9B en BF16 son aproximadamente dieciocho gigabytes de pesos cada uno antes de la memoria de activación, y ambos están diseñados para ejecutar un bucle de streaming continuo de un segundo con una entrada de audio y video en vivo. Eso es un despliegue de clase servidor. Una aplicación de consumo que lleva la misma capacidad a un teléfono está haciendo algo que esta versión no intenta, y la brecha entre un modelo descargable y uno ejecutable es exactamente donde la mayoría de las personas que lo quieren se quedarán atascadas.

La medibilidad es la diferencia más nítida.

Ninguno de los dos modelos tiene una puntuación independiente de calidad de voz, pero las razones difieren.

• Sesame Preview — sin entrada en la arena, sin evaluación publicada de la voz de producción. Su reputación se apoya en los reseñadores y en el efecto del demo original sobre los oyentes, lo cual es evidencia real de algún tipo y completamente no cuantificada.

• CSM-1B — el checkpoint abierto es un modelo base de generación; no se compara con sistemas conversacionales porque no es uno.

• Realtime-Venus — una única cifra de voz autoinformada, una puntuación de 4,81 en VoiceBench AlpacaEval que su informe describe como equiparable al mejor número de comparación. Ningún tercero lo ha evaluado.

• Lo que ninguna de las dos te da: un número producido por alguien sin interés alguno en el resultado. Si la calidad de voz es tu criterio de compra, la comparación entera es imposible de puntuar, y lo honesto es escuchar ambas y decidir por tu cuenta en lugar de remitirte a una tabla.

Toma de turnos, donde ambos tienen algo que demostrar.

La reputación de Sesame se construyó exactamente sobre esto. La demo que hizo famoso al laboratorio era una voz con respiración, vacilación y tiempos de interrupción lo bastante convincentes como para que los oyentes asumieran que había una persona al otro lado de la línea. Esa es una afirmación sobre la dinámica conversacional, y es aquello con lo que se vende el producto.

Realtime-Venus hace la misma afirmación con cifras adjuntas. En Full-Duplex-Bench v1.5, su checkpoint de audio informa que responde al 75 % de las interrupciones de los usuarios, con tasas de continuación del 97 % en backchannels, del 88 % en habla dirigida a otros y del 86 % en habla de fondo — y se afirma que supera a Gemini 3.1 Live y GPT-4o en las tres métricas de continuación. Esas cifras provienen de su propio informe y nadie las ha reproducido.

Así que la comparación es una demo sin cifra frente a una cifra sin demo, lo cual es una posición verdaderamente incómoda y una descripción justa de cómo esta categoría entera informa sobre sí misma en este momento. Lo único que puede decirse con certeza es que ninguna de las dos afirmaciones ha superado la revisión de un tercero independiente, y un 97 % de continuidad en canales secundarios es lo bastante alto como para merecer uno antes de que se cite como algo resuelto.

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

Lo que realmente puedes construir

Sesame Preview no le ofrece nada a un desarrollador. No hay API, ni identificador de modelo, ni tabla de tarifas, ni un plan declarado para tener una. Las llamadas se limitan a treinta minutos cuando se ha iniciado sesión y a cinco en caso contrario, el inglés es el único idioma con soporte oficial, y el agente investigará y recordará, pero no ejecutará tareas: no reservará el vuelo. El plan gratuito es el producto. Esa es una oferta perfectamente válida para consumidores y un callejón sin salida para la integración.

Realtime-Venus le da a un desarrollador todo excepto un lugar donde ejecutarlo. Los pesos tienen licencia permisiva, el código se carga con llamadas estándar de Transformers, se entra al streaming full-duplex con un solo cambio de método, y el bucle documentado es un segundo de prefill en streaming seguido de generación en streaming, repetido. La memoria para video largo se habilita con un parámetro memory-minutes y se describe como sin entrenamiento, lo cual es inusual para una capacidad que normalmente requiere ajuste fino. Se documentan dos advertencias en lugar de dejarlas para que se descubran: un límite de fotogramas que trunca silenciosamente el video largo a menos que se aumente una constante antes de importar la utilidad, y un requisito de fuente CJK para subtítulos no latinos renderizados en video dúplex.

Lo que nada de eso cambia es que el arnés —el componente que ejecuta las delegaciones asíncronas, que son la parte más distintiva de la arquitectura— vive en un repositorio de GitHub aparte, está mucho menos documentado que el modelo y es la parte cuya preparación para producción es más difícil de juzgar. En un despliegue real, el tramo de delegación es una inferencia de texto ordinaria situada detrás de un front end conversacional. OrcaRouter no incluye ni Realtime-Venus ni Sesame Preview; ambas capas de voz quedan fuera de lo que servimos, y lo decimos con claridad en lugar de insinuar una relación de alojamiento que no existe. Casi 200 modelos de texto detrás de una sola clave al precio de lista del proveedor y sin recargo es la mitad de esa arquitectura que sí cubrimos, con conmutación automática por error para que una tarea delegada sobreviva a una interrupción del servicio upstream, un DSL de enrutamiento que compone varios modelos en una sola llamada, y fusión de modelos cuando el juicio de un solo modelo no basta. Es la parte comprable de un diseño cuya parte interesante no está a la venta.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

La recomendación honesta

Si eres un consumidor que quiere la voz conversacional con mejor sonido disponible hoy y no necesitas integrarla, Sesame Preview es gratis, está disponible en ambas plataformas móviles, y su reputación está tan merecida que los reseñadores no dejan de decirlo. Úsala y disfrútala.

Si eres un investigador o un equipo de ingeniería con amplios recursos que necesita una pila audiovisual de dúplex completo abierta que pueda inspeccionar y ajustar, Realtime-Venus es una de las muy pocas opciones reales, y el hecho de que sus benchmarks sean autodeclarados no cambia que los pesos sean genuinamente abiertos y que la arquitectura esté genuinamente documentada.

Si eres un equipo de producto que busca una capa de voz para lanzar este trimestre, ninguna de estas dos es tu respuesta, y la conclusión útil de compararlas es por qué. Un laboratorio construyó algo excelente y mantuvo cerrada la parte buena; el otro publicó todo y te dejó a ti proporcionar la infraestructura. La categoría ha demostrado que puede crear una voz que vale la pena escuchar y todavía no ha decidido si esa voz debería poder comprarse en alguna forma que no sea una app.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario