
Realtime-Venus vs. Sesame Preview: Lo que puedes conseguir no es lo que es bueno
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus y Sesame Preview han sido creados por laboratorios con ideas completamente distintas sobre para qué sirve un modelo de voz, y han caído en la misma trampa desde direcciones opuestas. Sesame Preview es una aplicación de consumo gratuita —para iOS desde mayo de 2026 y para Android desde principios de agosto— con cuatro agentes conversacionales, búsqueda web en vivo durante las llamadas y una voz que los críticos han calificado como la mejor de su clase. Los pesos abiertos que publicó Sesame corresponden a un modelo distinto y más pequeño que la propia empresa no presenta como la voz que se escuchó en la demo. Realtime-Venus, el sistema full-duplex de 9B del Venus Team de Ant Group y la Universidad de Tsinghua, tomó el camino contrario: los artefactos descargables son lo auténtico, y no existe ningún producto. En ambos casos, la brecha entre lo que está disponible y lo que es impresionante es lo más útil que hay que entender antes de planear cualquier cosa en torno a uno u otro.
Lo que realmente es cada uno

Sesame Preview es un producto. Sesame es un laboratorio de San Francisco fundado en 2023 por Brendan Iribe, Ankit Kumar y Ryan Brown, respaldado por a16z, Sequoia, Spark y Matrix, y su asistente de voz para consumidores incluye cuatro personalidades — Maya, Miles, Simone y Charlie — cada una con un temperamento y una voz distintos. El agente puede buscar en la web a mitad de conversación, tomar notas y recordatorios, y enviar un resumen después de una llamada. La memoria es por agente y se sincroniza entre la web y el móvil cuando has iniciado sesión, con un modo incógnito que lee memorias pasadas sin escribir nuevas. Es gratis, no muestra anuncios y la empresa afirma que no vende datos.
Realtime-Venus es una publicación de investigación. Dos checkpoints de 9B bajo Apache-2.0 en Hugging Face —Realtime-Venus-Omni para interacción audiovisual y Realtime-Venus-Audio para interacción hablada—, además de un informe técnico enviado a arXiv el 12 de septiembre de 2026, una página de proyecto y un repositorio complementario que contiene el componente Realtime-Venus-Harness. No hay aplicación, ni API, ni precio, ni anuncio por parte del proveedor. El repositorio no está desplegado por ningún proveedor de inferencia y no se registran las descargas.
La trampa, en ambas direcciones
La versión de Sesame es la clásica forma de open-washing, y Sesame es más honesto al respecto que la mayoría. El checkpoint CSM que el laboratorio publicó bajo Apache-2.0 es un modelo base de generación de voz —una columna vertebral Llama que alimenta un decodificador de Mimi-codec— y la documentación deja explícito que no es la voz de la aplicación ni un sistema de voz a voz de extremo a extremo. No puede generar texto, y está entrenado con datos principalmente en inglés con capacidad limitada fuera de eso. Lo que impulsa Sesame Preview es un modelo de producción más grande que no se ha publicado. Así que si fuiste a buscar la voz de la demo, encontraste su linaje de investigación y no la cosa en sí. Cuando uno de los cuatro agentes responde a tu llamada, estás oyendo algo que no puedes descargar.
La versión de Realtime-Venus es la imagen espejo, y podría decirse que la más extraña. Todo lo publicado es genuino: pesos reales, código real, informe real, una licencia permisiva. Lo que falta es cualquier forma de usarlo que no implique poseer una GPU. Dos checkpoints de 9B en BF16 son aproximadamente dieciocho gigabytes de pesos cada uno antes de la memoria de activación, y ambos están diseñados para ejecutar un bucle de streaming continuo de un segundo con una entrada de audio y video en vivo. Eso es un despliegue de clase servidor. Una aplicación de consumo que lleva la misma capacidad a un teléfono está haciendo algo que esta versión no intenta, y la brecha entre un modelo descargable y uno ejecutable es exactamente donde la mayoría de las personas que lo quieren se quedarán atascadas.
La medibilidad es la diferencia más nítida.
Ninguno de los dos modelos tiene una puntuación independiente de calidad de voz, pero las razones difieren.
• Sesame Preview — sin entrada en la arena, sin evaluación publicada de la voz de producción. Su reputación se apoya en los reseñadores y en el efecto del demo original sobre los oyentes, lo cual es evidencia real de algún tipo y completamente no cuantificada.
• CSM-1B — el checkpoint abierto es un modelo base de generación; no se compara con sistemas conversacionales porque no es uno.
• Realtime-Venus — una única cifra de voz autoinformada, una puntuación de 4,81 en VoiceBench AlpacaEval que su informe describe como equiparable al mejor número de comparación. Ningún tercero lo ha evaluado.
• Lo que ninguna de las dos te da: un número producido por alguien sin interés alguno en el resultado. Si la calidad de voz es tu criterio de compra, la comparación entera es imposible de puntuar, y lo honesto es escuchar ambas y decidir por tu cuenta en lugar de remitirte a una tabla.
Toma de turnos, donde ambos tienen algo que demostrar.
La reputación de Sesame se construyó exactamente sobre esto. La demo que hizo famoso al laboratorio era una voz con respiración, vacilación y tiempos de interrupción lo bastante convincentes como para que los oyentes asumieran que había una persona al otro lado de la línea. Esa es una afirmación sobre la dinámica conversacional, y es aquello con lo que se vende el producto.
Realtime-Venus hace la misma afirmación con cifras adjuntas. En Full-Duplex-Bench v1.5, su checkpoint de audio informa que responde al 75 % de las interrupciones de los usuarios, con tasas de continuación del 97 % en backchannels, del 88 % en habla dirigida a otros y del 86 % en habla de fondo — y se afirma que supera a Gemini 3.1 Live y GPT-4o en las tres métricas de continuación. Esas cifras provienen de su propio informe y nadie las ha reproducido.
Así que la comparación es una demo sin cifra frente a una cifra sin demo, lo cual es una posición verdaderamente incómoda y una descripción justa de cómo esta categoría entera informa sobre sí misma en este momento. Lo único que puede decirse con certeza es que ninguna de las dos afirmaciones ha superado la revisión de un tercero independiente, y un 97 % de continuidad en canales secundarios es lo bastante alto como para merecer uno antes de que se cite como algo resuelto.

Lo que realmente puedes construir
Sesame Preview no le ofrece nada a un desarrollador. No hay API, ni identificador de modelo, ni tabla de tarifas, ni un plan declarado para tener una. Las llamadas se limitan a treinta minutos cuando se ha iniciado sesión y a cinco en caso contrario, el inglés es el único idioma con soporte oficial, y el agente investigará y recordará, pero no ejecutará tareas: no reservará el vuelo. El plan gratuito es el producto. Esa es una oferta perfectamente válida para consumidores y un callejón sin salida para la integración.
Realtime-Venus le da a un desarrollador todo excepto un lugar donde ejecutarlo. Los pesos tienen licencia permisiva, el código se carga con llamadas estándar de Transformers, se entra al streaming full-duplex con un solo cambio de método, y el bucle documentado es un segundo de prefill en streaming seguido de generación en streaming, repetido. La memoria para video largo se habilita con un parámetro memory-minutes y se describe como sin entrenamiento, lo cual es inusual para una capacidad que normalmente requiere ajuste fino. Se documentan dos advertencias en lugar de dejarlas para que se descubran: un límite de fotogramas que trunca silenciosamente el video largo a menos que se aumente una constante antes de importar la utilidad, y un requisito de fuente CJK para subtítulos no latinos renderizados en video dúplex.
Lo que nada de eso cambia es que el arnés —el componente que ejecuta las delegaciones asíncronas, que son la parte más distintiva de la arquitectura— vive en un repositorio de GitHub aparte, está mucho menos documentado que el modelo y es la parte cuya preparación para producción es más difícil de juzgar. En un despliegue real, el tramo de delegación es una inferencia de texto ordinaria situada detrás de un front end conversacional. OrcaRouter no incluye ni Realtime-Venus ni Sesame Preview; ambas capas de voz quedan fuera de lo que servimos, y lo decimos con claridad en lugar de insinuar una relación de alojamiento que no existe. Casi 200 modelos de texto detrás de una sola clave al precio de lista del proveedor y sin recargo es la mitad de esa arquitectura que sí cubrimos, con conmutación automática por error para que una tarea delegada sobreviva a una interrupción del servicio upstream, un DSL de enrutamiento que compone varios modelos en una sola llamada, y fusión de modelos cuando el juicio de un solo modelo no basta. Es la parte comprable de un diseño cuya parte interesante no está a la venta.

La recomendación honesta
Si eres un consumidor que quiere la voz conversacional con mejor sonido disponible hoy y no necesitas integrarla, Sesame Preview es gratis, está disponible en ambas plataformas móviles, y su reputación está tan merecida que los reseñadores no dejan de decirlo. Úsala y disfrútala.
Si eres un investigador o un equipo de ingeniería con amplios recursos que necesita una pila audiovisual de dúplex completo abierta que pueda inspeccionar y ajustar, Realtime-Venus es una de las muy pocas opciones reales, y el hecho de que sus benchmarks sean autodeclarados no cambia que los pesos sean genuinamente abiertos y que la arquitectura esté genuinamente documentada.
Si eres un equipo de producto que busca una capa de voz para lanzar este trimestre, ninguna de estas dos es tu respuesta, y la conclusión útil de compararlas es por qué. Un laboratorio construyó algo excelente y mantuvo cerrada la parte buena; el otro publicó todo y te dejó a ti proporcionar la infraestructura. La categoría ha demostrado que puede crear una voz que vale la pena escuchar y todavía no ha decidido si esa voz debería poder comprarse en alguna forma que no sea una app.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
