
HeyGen Voice vs Sesame Preview: la voz que puedes comprar frente a la voz con la que solo puedes hablar
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Esto no es una comparación de modelos, y fingir lo contrario sería el único error real disponible aquí. HeyGen Voice es un motor de API —clasificado primero en la arena Controlled Voice de Artificial Analysis con 1.202 Elo, expuesto mediante los endpoints v3 de HeyGen, vendido por créditos, clonable a partir de una sola grabación. Sesame Preview es un asistente de voz de consumo gratuito al que accedes abriendo una página web y hablando con uno de cuatro personajes con nombre, sin endpoint público, sin identificador de modelo y sin un precio por el que se pueda alquilar. A uno lo puedes lanzar. El otro es la razón por la que sabes cómo suena una buena voz conversacional, y nunca es lo que despliegas.
Lo que realmente es cada uno
Sesame Preview es una demostración de habla conversacional. Se accede a ella a través del propio sitio de la empresa, se habla con Maya, Miles, Simone o Charlie, y la experiencia está deliberadamente optimizada para la cordialidad y la expresividad; la empresa lo dice explícitamente al describir por qué los compañeros se comportan como lo hacen. Hoy en día solo está disponible en inglés, y el equipo señala que la capacidad multilingüe surge de forma incidental a partir de la contaminación de datos y "aún no funciona bien", y que ampliar a más de veinte idiomas es un plan futuro. El propio planteamiento de la empresa es un trabajo en curso: "Todavía no hemos llegado ahí".
Debajo de la demo está el Conversational Speech Model, una arquitectura multimodal de texto y voz construida a partir de dos transformadores autorregresivos de estilo Llama. Se distribuye en tres tamaños: Tiny, con un backbone de 1B y un decodificador de 100M; Small, con 3B y 250M; Medium, con 8B y 300M; cada uno entrenado con una longitud de secuencia de 2.048 tokens, aproximadamente dos minutos de audio, durante cinco épocas sobre alrededor de un millón de horas de habla mayoritariamente en inglés. Los componentes clave de investigación son de código abierto bajo Apache 2.0, y hay un repositorio de GitHub para ellos. La demo —lo que la gente realmente elogia— no es eso. La demo no tiene API pública.
HeyGen Voice es la disposición inversa. No hay una aplicación de consumidor gratuita para probarla; hay una API documentada con un catálogo de voces, un endpoint de voz, rutas de clonación y una factura. Lo que no puedes hacer es abrirlo en un navegador y tener una conversación con él cuando te apetezca.
Por qué se comparan los dos de todos modos
Se los compara porque ambos se presentan como evidencia de que la voz sintética ha cruzado una frontera. Sesame Preview redefinió las expectativas sobre cómo podía sonar el audio conversacional: las reacciones cuando se lanzó giraron en torno a cuánto sonaba a una persona en lugar de a un motor de texto a voz. El 1.202 de HeyGen Voice en la tabla controlada es la misma afirmación en forma numérica: el primer lugar entre cuarenta y dos entradas cuando todos los modelos hablan con las mismas ocho voces de referencia clonadas.
La diferencia es lo que puedes hacer con la afirmación después. Una posición en la tabla es reproducible, verificable y está vinculada a un endpoint. Una impresión de demo no es ninguna de esas cosas y, lo que es importante, Sesame Preview no aparece en la tabla controlada en absoluto, así que no hay ningún Elo para comparar con el 1,202. La comparación que la gente quiere hacer no está disponible, no porque Sesame la haya perdido, sino porque el modelo nunca fue inscrito.
El marcador

• Elo de voz controlado — Voz de HeyGen: 1.202, n.º 1 de 42. Sesame Preview: no figura en la lista.
• Acceso — HeyGen Voice: API v3 documentada, POST /v3/voices/speech. Sesame Preview: aplicación web para consumidores y app para iOS; sin endpoint público.
• Precio — HeyGen Voice: 30,00 $ por 1 millón de caracteres según la propia conversión que hace la arena del precio de los créditos; HeyGen no publica ninguna tarifa de voz. Sesame Preview: gratis, y no se puede comprar a ningún precio.
• Selección de voz — HeyGen Voice: más de 300 voces prediseñadas, diseño de voz descrito por texto, clonación instantánea y profesional. Sesame Preview: cuatro personajes fijos.
• Idiomas — HeyGen Voice: "docenas de idiomas", cantidad sin publicar. Sesame Preview: solo en inglés, con un soporte multilingüe que, según la propia empresa, hoy no rinde como debería.
• Pesos abiertos — HeyGen Voice: ninguno. Sesame Preview: CSM publicado bajo Apache 2.0 en tamaños de 1B, 3B y 8B.

El detalle de Apache 2.0 es el que importa
Bajo el veredicto de «sin API» se esconde el hecho de que Sesame publicó como código abierto el modelo de investigación bajo Apache 2.0 —una licencia permisiva, en tres tamaños, con una variante de 1B lo suficientemente pequeña como para ejecutarse sin un centro de datos. Eso es algo genuinamente distinto de la demo, y es la única vía por la que algo que se parezca a la voz de Sesame Preview acabe en un producto comercializado.
Dos salvedades lo mantienen honesto. Los componentes CSM publicados son artefactos de investigación: la empresa señala que los modelos manejan contenido de habla, pero no la estructura de la conversación, y apunta hacia modelos totalmente dúplex como trabajo futuro; por lo tanto, los pesos publicados no son la experiencia interactiva. Y un backbone de 8B ejecutándose localmente tiene una estructura de costes distinta de 19,30 $ por millón de caracteres de inferencia alojada, que es lo que cobra el rival de primer nivel más barato de la arena. El autoalojamiento no tiene factura por carácter y sí una muy real por hora de GPU.
Para quien construye, eso replantea la pregunta. Si lo que te impresionó de Sesame Preview fue la conversación, los pesos abiertos no te la dan. Si lo que te impresionó fue la calidad de voz del modelo de habla en sí, podrían dártela —y eso es comprobable de una manera en que una demo no lo es.
Así se ve el lanzamiento en HeyGen Voice
Las diferencias prácticas son las habituales. La API de HeyGen acepta una selección de voz, texto y, de forma opcional, velocidad entre 0,5 y 1,5 y tono en un rango de ±50 semitonos, con una indicación de BCP-47 para la configuración regional sugerida. Las voces personalizadas se obtienen de tres maneras: una ruta de diseño basada en descripciones que devuelve hasta tres opciones clasificadas a partir de un prompt limitado a 1000 caracteres, un clon instantáneo a partir de una grabación, y un clon profesional entrenado con veinte minutos o más. El filtro de motor en el endpoint de voces también acepta motores que no son de HeyGen, por lo que la plataforma no es un jardín amurallado en torno a su propio modelo.
Nada de eso existe del lado de Sesame, y no es una deficiencia de Sesame Preview: es lo que es. Una demo optimizada para mostrar lo que es posible no debería llevar un SLA.
La factura, sin embargo, es la mitad más blanda. HeyGen vende créditos —600 por $29/mes, 1,000 por $49, 1,500 por $149— y afirma que el consumo varía según el modelo, la duración y la complejidad, sin publicar una tarifa de voz. Los $30.00 por millón de caracteres que la arena incluye son una conversión de esos créditos hecha por Artificial Analysis, no una cotización de HeyGen. Así que el modelo que puedes desplegar tiene precio, pero según la aritmética de otro —lo cual es un argumento a favor de una prueba piloto medida en lugar de una crítica al motor.

Qué hacer realmente con una demo que admiras
El movimiento útil es separar las dos cosas que demuestra Sesame Preview. El comportamiento conversacional —la alternancia de turnos, la memoria, la sensación de estar hablando con alguien— es el producto de un sistema que no se ha publicado y no tiene un endpoint. La calidad de voz es la parte que tiene los pesos de Apache 2.0 detrás, y la parte que puedes evaluar con tu propio audio sin pedirle permiso a nadie.
Para todo lo intermedio, la ruta de migración es la mundana: lanzar sobre un motor que tenga una API y un ranking, y diseñar de modo que adoptar el modelo de Sesame, si alguna vez se lanza comercialmente, sea un cambio de configuración y no una reescritura. Eso significa una abstracción sobre el proveedor de voz desde el primer día —una interfaz, una clave, motor seleccionado por configuración—. La capa de enrutamiento de OrcaRouter está construida precisamente para esto: muchos proveedores detrás de un único endpoint al precio de lista del proveedor y sin recargo, conmutación por error automática cuando un proveedor se estanca, y un DSL de enrutamiento que te permite cambiar el motor detrás de una voz sin tocar el código de la aplicación. El punto no es que aloje un modelo de Sesame —no lo hace—, sino que el día en que una voz que admiras se vuelva comprable, el costo de probarla debería ser una línea en un archivo de configuración.
El cierre honesto
Sesame Preview no es un competidor de HeyGen Voice y no debería evaluarse como tal. Es una demostración gratuita, solo en inglés, de cuatro personajes, que resulta que ha redefinido las expectativas para el audio conversacional y resulta que ha publicado pesos de investigación con licencia permisiva en tres tamaños. HeyGen Voice es el motor mejor clasificado en la única tabla de clasificación de voz que mantiene la voz constante, vendido por una API que puedes llamar hoy, a un precio que aún no puedes calcular.
Si necesitas una voz que puedas lanzar este trimestre, la decisión no está entre estas dos — está entre HeyGen Voice y los otros motores de pago en la arena. Si estás esperando a Sesame, espera los pesos, no la aplicación.
