Una tarjeta destacada generada titulada 'HeyGen Voice vs Sesame Preview' que contrasta una API de voz documentada que cuenta con un Elo medido frente a una demo de consumo sin endpoint público, marcada con la fecha de Artificial Analysis del 9 de octubre de 2026. El logotipo de OrcaRouter aparece en la esquina inferior derecha.
Guides & Insights

HeyGen Voice vs Sesame Preview: la voz que puedes comprar frente a la voz con la que solo puedes hablar

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Esto no es una comparación de modelos, y fingir lo contrario sería el único error real disponible aquí. HeyGen Voice es un motor de API —clasificado primero en la arena Controlled Voice de Artificial Analysis con 1.202 Elo, expuesto mediante los endpoints v3 de HeyGen, vendido por créditos, clonable a partir de una sola grabación. Sesame Preview es un asistente de voz de consumo gratuito al que accedes abriendo una página web y hablando con uno de cuatro personajes con nombre, sin endpoint público, sin identificador de modelo y sin un precio por el que se pueda alquilar. A uno lo puedes lanzar. El otro es la razón por la que sabes cómo suena una buena voz conversacional, y nunca es lo que despliegas.

Lo que realmente es cada uno

Sesame Preview es una demostración de habla conversacional. Se accede a ella a través del propio sitio de la empresa, se habla con Maya, Miles, Simone o Charlie, y la experiencia está deliberadamente optimizada para la cordialidad y la expresividad; la empresa lo dice explícitamente al describir por qué los compañeros se comportan como lo hacen. Hoy en día solo está disponible en inglés, y el equipo señala que la capacidad multilingüe surge de forma incidental a partir de la contaminación de datos y "aún no funciona bien", y que ampliar a más de veinte idiomas es un plan futuro. El propio planteamiento de la empresa es un trabajo en curso: "Todavía no hemos llegado ahí".

Debajo de la demo está el Conversational Speech Model, una arquitectura multimodal de texto y voz construida a partir de dos transformadores autorregresivos de estilo Llama. Se distribuye en tres tamaños: Tiny, con un backbone de 1B y un decodificador de 100M; Small, con 3B y 250M; Medium, con 8B y 300M; cada uno entrenado con una longitud de secuencia de 2.048 tokens, aproximadamente dos minutos de audio, durante cinco épocas sobre alrededor de un millón de horas de habla mayoritariamente en inglés. Los componentes clave de investigación son de código abierto bajo Apache 2.0, y hay un repositorio de GitHub para ellos. La demo —lo que la gente realmente elogia— no es eso. La demo no tiene API pública.

HeyGen Voice es la disposición inversa. No hay una aplicación de consumidor gratuita para probarla; hay una API documentada con un catálogo de voces, un endpoint de voz, rutas de clonación y una factura. Lo que no puedes hacer es abrirlo en un navegador y tener una conversación con él cuando te apetezca.

Por qué se comparan los dos de todos modos

Se los compara porque ambos se presentan como evidencia de que la voz sintética ha cruzado una frontera. Sesame Preview redefinió las expectativas sobre cómo podía sonar el audio conversacional: las reacciones cuando se lanzó giraron en torno a cuánto sonaba a una persona en lugar de a un motor de texto a voz. El 1.202 de HeyGen Voice en la tabla controlada es la misma afirmación en forma numérica: el primer lugar entre cuarenta y dos entradas cuando todos los modelos hablan con las mismas ocho voces de referencia clonadas.

La diferencia es lo que puedes hacer con la afirmación después. Una posición en la tabla es reproducible, verificable y está vinculada a un endpoint. Una impresión de demo no es ninguna de esas cosas y, lo que es importante, Sesame Preview no aparece en la tabla controlada en absoluto, así que no hay ningún Elo para comparar con el 1,202. La comparación que la gente quiere hacer no está disponible, no porque Sesame la haya perdido, sino porque el modelo nunca fue inscrito.

El marcador

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Elo de voz controlado — Voz de HeyGen: 1.202, n.º 1 de 42. Sesame Preview: no figura en la lista.

• Acceso — HeyGen Voice: API v3 documentada, POST /v3/voices/speech. Sesame Preview: aplicación web para consumidores y app para iOS; sin endpoint público.

• Precio — HeyGen Voice: 30,00 $ por 1 millón de caracteres según la propia conversión que hace la arena del precio de los créditos; HeyGen no publica ninguna tarifa de voz. Sesame Preview: gratis, y no se puede comprar a ningún precio.

• Selección de voz — HeyGen Voice: más de 300 voces prediseñadas, diseño de voz descrito por texto, clonación instantánea y profesional. Sesame Preview: cuatro personajes fijos.

• Idiomas — HeyGen Voice: "docenas de idiomas", cantidad sin publicar. Sesame Preview: solo en inglés, con un soporte multilingüe que, según la propia empresa, hoy no rinde como debería.

• Pesos abiertos — HeyGen Voice: ninguno. Sesame Preview: CSM publicado bajo Apache 2.0 en tamaños de 1B, 3B y 8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

El detalle de Apache 2.0 es el que importa

Bajo el veredicto de «sin API» se esconde el hecho de que Sesame publicó como código abierto el modelo de investigación bajo Apache 2.0 —una licencia permisiva, en tres tamaños, con una variante de 1B lo suficientemente pequeña como para ejecutarse sin un centro de datos. Eso es algo genuinamente distinto de la demo, y es la única vía por la que algo que se parezca a la voz de Sesame Preview acabe en un producto comercializado.

Dos salvedades lo mantienen honesto. Los componentes CSM publicados son artefactos de investigación: la empresa señala que los modelos manejan contenido de habla, pero no la estructura de la conversación, y apunta hacia modelos totalmente dúplex como trabajo futuro; por lo tanto, los pesos publicados no son la experiencia interactiva. Y un backbone de 8B ejecutándose localmente tiene una estructura de costes distinta de 19,30 $ por millón de caracteres de inferencia alojada, que es lo que cobra el rival de primer nivel más barato de la arena. El autoalojamiento no tiene factura por carácter y sí una muy real por hora de GPU.

Para quien construye, eso replantea la pregunta. Si lo que te impresionó de Sesame Preview fue la conversación, los pesos abiertos no te la dan. Si lo que te impresionó fue la calidad de voz del modelo de habla en sí, podrían dártela —y eso es comprobable de una manera en que una demo no lo es.

Así se ve el lanzamiento en HeyGen Voice

Las diferencias prácticas son las habituales. La API de HeyGen acepta una selección de voz, texto y, de forma opcional, velocidad entre 0,5 y 1,5 y tono en un rango de ±50 semitonos, con una indicación de BCP-47 para la configuración regional sugerida. Las voces personalizadas se obtienen de tres maneras: una ruta de diseño basada en descripciones que devuelve hasta tres opciones clasificadas a partir de un prompt limitado a 1000 caracteres, un clon instantáneo a partir de una grabación, y un clon profesional entrenado con veinte minutos o más. El filtro de motor en el endpoint de voces también acepta motores que no son de HeyGen, por lo que la plataforma no es un jardín amurallado en torno a su propio modelo.

Nada de eso existe del lado de Sesame, y no es una deficiencia de Sesame Preview: es lo que es. Una demo optimizada para mostrar lo que es posible no debería llevar un SLA.

La factura, sin embargo, es la mitad más blanda. HeyGen vende créditos —600 por $29/mes, 1,000 por $49, 1,500 por $149— y afirma que el consumo varía según el modelo, la duración y la complejidad, sin publicar una tarifa de voz. Los $30.00 por millón de caracteres que la arena incluye son una conversión de esos créditos hecha por Artificial Analysis, no una cotización de HeyGen. Así que el modelo que puedes desplegar tiene precio, pero según la aritmética de otro —lo cual es un argumento a favor de una prueba piloto medida en lugar de una crítica al motor.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

Qué hacer realmente con una demo que admiras

El movimiento útil es separar las dos cosas que demuestra Sesame Preview. El comportamiento conversacional —la alternancia de turnos, la memoria, la sensación de estar hablando con alguien— es el producto de un sistema que no se ha publicado y no tiene un endpoint. La calidad de voz es la parte que tiene los pesos de Apache 2.0 detrás, y la parte que puedes evaluar con tu propio audio sin pedirle permiso a nadie.

Para todo lo intermedio, la ruta de migración es la mundana: lanzar sobre un motor que tenga una API y un ranking, y diseñar de modo que adoptar el modelo de Sesame, si alguna vez se lanza comercialmente, sea un cambio de configuración y no una reescritura. Eso significa una abstracción sobre el proveedor de voz desde el primer día —una interfaz, una clave, motor seleccionado por configuración—. La capa de enrutamiento de OrcaRouter está construida precisamente para esto: muchos proveedores detrás de un único endpoint al precio de lista del proveedor y sin recargo, conmutación por error automática cuando un proveedor se estanca, y un DSL de enrutamiento que te permite cambiar el motor detrás de una voz sin tocar el código de la aplicación. El punto no es que aloje un modelo de Sesame —no lo hace—, sino que el día en que una voz que admiras se vuelva comprable, el costo de probarla debería ser una línea en un archivo de configuración.

El cierre honesto

Sesame Preview no es un competidor de HeyGen Voice y no debería evaluarse como tal. Es una demostración gratuita, solo en inglés, de cuatro personajes, que resulta que ha redefinido las expectativas para el audio conversacional y resulta que ha publicado pesos de investigación con licencia permisiva en tres tamaños. HeyGen Voice es el motor mejor clasificado en la única tabla de clasificación de voz que mantiene la voz constante, vendido por una API que puedes llamar hoy, a un precio que aún no puedes calcular.

Si necesitas una voz que puedas lanzar este trimestre, la decisión no está entre estas dos — está entre HeyGen Voice y los otros motores de pago en la arena. Si estás esperando a Sesame, espera los pesos, no la aplicación.