Una tarjeta principal generada titulada «HeyGen Voice vs Cartesia Sonic 3.6 — el marcador» que contrasta los dos motores, con una nota de que la comparación Elo mantiene constantes ocho voces de referencia clonadas según Artificial Analysis, 9 de octubre de 2026. El logotipo de OrcaRouter aparece en la esquina inferior derecha.
Engineering & Research

HeyGen Voice vs. Cartesia Sonic 3.6: el campeón de la voz clonada contra el incumbente de menos de 90 ms

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

HeyGen Voice y Cartesia Sonic 3.6 sostienen dos afirmaciones distintas de ser el número uno en Artificial Analysis, y toda la comparación reside en la brecha entre ambas. HeyGen Voice encabeza la arena Controlled Voice con 1,202 Elo, la tabla donde el modelo habla con las mismas ocho voces clonadas, cuatro de EE. UU. y cuatro del Reino Unido. Cartesia Sonic 3.6 ocupa el cuarto puesto en la arena Provider Voices con 1,280 Elo, donde cada proveedor aporta sus propias voces nativas, y el propio sitio de Cartesia luce una insignia que afirma un ranking n.º 1 tanto en la Speech Arena como en la clasificación de Speech to Text, una afirmación declarada por el proveedor que la tabla en vivo de Artificial Analysis actualmente no respalda en la primera posición. Un motor gana la prueba donde la voz se mantiene constante; el otro lidera la prueba donde el presupuesto de producción es real.

Empieza por aquello para lo que cada modelo está realmente optimizado

Sonic 3.6 está diseñado para consumirse en streaming. La propia página de producto de Cartesia encabeza con «primer audio en menos de 90 ms» —reportado por el proveedor, no reproducido— y esa misma página describe una API de TTS en tiempo real con streaming de primera clase. Cubre 44 idiomas con un solo modelo, interpreta el subtexto emocional de forma predeterminada, acepta señales no verbales como la risa escrita en la transcripción, clona una voz a partir de unos diez segundos de audio, localiza audio existente a otros idiomas y admite diccionarios de pronunciación personalizados para términos del dominio y nombres propios. Cada una de esas funciones está dirigida al mismo cliente: algo que responde, rápido, en un idioma que quien llama entiende.

HeyGen Voice está diseñado para consumirse como una actuación. Es el motor interno de HeyGen, expuesto a través de la API v3 de la empresa, con más de 300 voces prediseñadas en decenas de idiomas y tres vías hacia una voz personalizada: diseño de voz guiado por descripciones que devuelve hasta tres opciones clasificadas a partir de un prompt limitado a 1000 caracteres, un clon instantáneo a partir de una grabación y un clon profesional entrenado con veinte minutos o más. El ajuste por solicitud abarca la velocidad de 0,5 a 1,5 y el tono en un rango de ±50 semitonos. Nada en el material publicado de HeyGen promete una cifra de latencia en absoluto.

Esa asimetría es todo el artículo. Un modelo publica una cifra en milisegundos y ningún precio por carácter; el otro publica un precio y ninguna cifra de latencia.

El marcador

A generated two-column scoreboard titled 'HeyGen Voice vs Cartesia Sonic 3.6 — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', "Price: $30.00 per 1M characters, arena conversion of credit pricing", 'Latency: no figure published', 'Languages: dozens, count unpublished' and 'Custom voice: design, instant clone, professional clone'. The Cartesia Sonic 3.6 column reads 'Controlled Voice Elo: 1,143, #5 of 42', 'Provider Voices Elo: 1,280, #4 of 96', 'Price: $49.00 per 1M characters, vendor rate card', 'Latency: under 90ms to first audio, vendor-reported', 'Languages: 44 from one model' and 'Custom voice: roughly 10-second clone'. A footer distinguishes vendor-published rates from the arena's derived conversion.

• Elo de voz controlado (las mismas 8 voces clonadas) — HeyGen Voice: 1.202, n.º 1 de 42. Sonic 3.6: 1.143, n.º 5.

• Provider Voices Elo (voces nativas) — HeyGen Voice: sin clasificación, votos insuficientes. Sonic 3.6: 1.280, n.º 4 de 96.

• Precio publicado — Sonic 3.6: $49.00 por 1 millón de caracteres, tarjeta de tarifas del proveedor. HeyGen Voice: $30.00 por 1 millón de caracteres según la conversión propia de la arena del precio de créditos de HeyGen; HeyGen no publica ninguna tarifa de voz por sí misma.

• Latencia — Sonic 3.6: menos de 90 ms hasta el primer audio (según el proveedor, sin reproducir). HeyGen Voice: el proveedor no publica ninguna cifra ni Artificial Analysis la ha medido.

• Idiomas — Sonic 3.6: 44 de un solo modelo. HeyGen Voice: más de 300 voces en "docenas de idiomas", sin enumerarse como una cifra.

• Ruta de voz personalizada — Sonic 3.6: clonación de ~10 segundos. HeyGen Voice: diseño de voz a partir de una descripción de texto, clonación instantánea o clonación profesional entrenada con más de 20 minutos.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked model list with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186, Eleven v4 Turbo third at 1,167, Eleven v4 fourth at 1,160 and Sonic 3.6 fifth at 1,143, with samples, release dates and per-1M-character API pricing columns.

La brecha de Elo, leída correctamente

Una ventaja de 59 puntos en la arena controlada se invierte y pasa a ser un déficit de 137 puntos en la tabla de proveedores, y esa inversión no es una contradicción. La tabla controlada elimina la capacidad del proveedor de elegir una voz que lo favorezca y pregunta cómo maneja el motor una voz que no eligió. HeyGen Voice gana en eso. La tabla de proveedores pregunta qué tan buenas suenan las mejores voces del propio proveedor, lo que se acerca más a lo que un cliente escucha en una demostración de ventas — y a Sonic 3.6 le va bien ahí: cuarto de noventa y seis y 38 puntos por detrás del Eleven v4 Turbo, clasificado en primer lugar.

Ninguno de los dos números es el de propósito general. Si estás clonando a una persona específica y necesitas que el motor reproduzca a esa persona de forma convincente, el controlado es el mejor predictor, y HeyGen Voice actualmente lo supera. Si estás eligiendo una voz de una biblioteca para un agente que tiene que sonar distintivo a escala, el resultado del proveedor es el mejor predictor, y Sonic 3.0 tiene una posición en la que HeyGen Voice no tiene ninguna.

Vale la pena señalarlo para quien maneje cifras antiguas: ambas tablas cambian a medida que se acumulan los votos. A principios de 2026 se informó que Sonic 3.6 lideraba directamente la tabla de voz controlada; la tabla actual lo sitúa quinto allí con 1.143, con HeyGen Voice, Qwen-Audio-3.1-TTS-Plus y dos niveles de Eleven v4 por encima de él. Una cita de una tabla de clasificación es una marca temporal, no una propiedad permanente del modelo.

Dónde falla la comparación de precios

Los 49,00 $ por millón de caracteres de Sonic 3.6 son el precio de referencia de la propia arena, tomado de la tarifa de API publicada por el proveedor con la configuración predeterminada. Eso hace que una factura mensual de audio de cinco cifras pueda calcularse antes de que escribas una sola línea de código de integración.

La cifra de HeyGen es más difusa, pero existe. El gráfico de precios de la arena incluye HeyGen Voice a $30.00 por millón de caracteres —diecinueve dólares por debajo de Sonic 3.6— y esa cifra es la conversión que hace Artificial Analysis del precio por créditos de HeyGen, no una tarifa que HeyGen publique. La propia página de HeyGen vende créditos (Creator a $29/mes por 600 créditos, Pro a $49 por 1,000, Business a $149 por 1,500) y afirma claramente que el consumo varía según el modelo, la duración y la complejidad de la generación, sin traducir jamás esos créditos a caracteres. Así que el modelo que gana en la clasificación de voz controlada tiene un precio muy por debajo del que ocupa el quinto puesto, y la diferencia es una cifra derivada que querrás confirmar con tu propio texto en lugar de una tarifa que puedas auditar.

Eso no es un argumento en contra de HeyGen Voice. Es un argumento a favor de probarlo con el tráfico que puedes permitirte medir, porque la única forma de conocer su costo real en tu pipeline es pasar tu propio texto por él.

Elegir entre ellos

Elige Sonic 3.6 cuando la voz tenga que responder. Una promesa de primer audio en menos de 90 ms, una API nativa de streaming, 44 idiomas desde un solo modelo y —lo que es fundamental— una lista de tarifas publicada lo convierten en la opción de producción de menor riesgo para agentes conversacionales, IVR y cualquier caso en el que una pausa sea un error. Su puesto n.º 5 en voz controlada es respetable, no una debilidad, y su cuarto puesto en la tabla general es la señal independiente más fuerte que ofrece cualquiera de los dos modelos.

Prueba HeyGen Voice primero cuando la voz tenga que rendir. Narración, contenido leído para marcas, trabajo de personajes y cualquier proyecto en el que estés clonando a un hablante y necesites que el clon de ese hablante sea lo que mejor suene en el aire: esa es la tarea que la arena controlada fue construida para medir, y es la tarea que HeyGen Voice acaba de ganar. La ruta de clonación profesional entrenada con más de veinte minutos es un producto sustancialmente distinto de un clon instantáneo de diez segundos, y es la que se corresponde con las ocho voces de referencia clonadas en la arena.

No elijas ninguno de los dos basándote en un único número Elo. Las dos tablas no coinciden respecto a estos modelos, lo que significa que las tablas te están diciendo algo real: la calidad depende de la voz y de la carga de trabajo, no solo del motor.

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, with samples, release dates, 8-voice arena badges and API pricing columns.

Ejecutando ambos sin confirmar

La vía práctica para resolver un desacuerdo como este es dejar de tratarlo como una decisión de adquisición. Coloca los dos motores detrás de una interfaz, divide el tráfico y juzga con tu propio audio: unas pocas líneas de narración y un bucle de agente en vivo te dirán más que cincuenta puntos Elo. OrcaRouter enruta ambos a través de una única clave de API al precio de lista del proveedor sin recargo, por lo que la propia lista de precios del proveedor es lo que pagas y un cambio de precio de Sonic 3.6 se refleja el mismo día en lugar de en la renovación. La conmutación por error automática importa más aquí que en la mayoría de los cambios de modelo, porque un proveedor de voz que se detiene a mitad de frase es audible para la persona que llama, y el DSL de enrutamiento te permite fijar un motor para turnos sensibles a la latencia y el otro para narración pregenerada sin mantener dos integraciones.

¿Qué lo resolvería?

Dos cosas. Una tarifa de voz publicada por carácter o por crédito de HeyGen haría que la mitad del costo de esta comparación fuera tan concreta como la mitad de la calidad, y que HeyGen Voice acumulara suficientes votos para entrar en la arena de Provider Voices nos diría si su ventaja en voces controladas sobrevive al contacto con voces nativas —la prueba que Sonic 3.6 ya ha superado en cuarto lugar de noventa y seis. Hasta entonces, Sonic 3.6 es el titular con un precio y una cifra de latencia, y HeyGen Voice es el retador con la mejor evidencia de voz clonada y ningún costo que ponerle al lado.