
HeyGen Voice debuta en el número 1 de la Controlled Voice TTS Arena — superando a Qwen y ElevenLabs en voces clonadas
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
El 9 de octubre de 2026, Artificial Analysis añadió HeyGen Voice a su arena Controlled Voice y el modelo se situó directamente en lo más alto. HeyGen Voice —el primer modelo de texto a voz de HeyGen en aparecer en la tabla— obtuvo 1.202 Elo, por delante de Qwen-Audio-3.1-TTS-Plus con 1.186 y de Eleven v4 Turbo de ElevenLabs con 1.167. Cartesia Sonic 3.6, que lidera la tabla abierta Provider Voices del sitio, ocupa aquí el quinto puesto con 1.143. Es un resultado genuino en una clasificación creada para eliminar el mayor factor de confusión en la evaluación de voces, y también es un resultado con un significado muy concreto que es fácil sobreinterpretar: HeyGen Voice es la mejor voz de esta arena con ocho voces de referencia clonadas, pero todavía no es un campeón medido de la tabla con noventa y seis modelos.
Qué mide el panel de Controlled Voice, y por qué importa
Artificial Analysis gestiona dos tableros de voz que responden a preguntas diferentes. La arena Provider Voices permite que cada proveedor aporte sus propias voces nativas —las voces de demostración pulidas que una empresa elige para representarse— y clasifica los modelos según lo bien que suenan. Su tabla de clasificación es amplia y madura: noventa y seis entradas, con Eleven v4 Turbo en cabeza con 1.328 Elo y Cartesia Sonic 3.6 en cuarto lugar con 1.280.
La arena Controlled Voice hace algo más concreto y, para cualquiera que lance un producto, más útil. Todos los modelos que hay en ella generan habla a partir de las mismas ocho voces clonadas —cuatro de EE. UU. y cuatro del Reino Unido—, así que la comparación no es «qué voz de marketing suena mejor», sino «cómo maneja cada motor la misma voz, el mismo texto y las mismas condiciones de grabación». Es lo más parecido que tiene la industria a una prueba del motor en igualdad de condiciones en lugar de un carrete de demostración, y es la tabla que importa si piensas clonar una voz y dársela a un modelo TTS.
HeyGen Voice ahora lidera. El margen es de 16 Elo sobre Qwen-Audio-3.1-TTS-Plus y de 35 sobre Eleven v4 Turbo, con un intervalo de confianza del 95 % reportado de aproximadamente 1.185 a 1.219 en la cifra de HeyGen. Dieciséis Elo es una diferencia real, pero no un abismo: en una tabla tan apretada, es la diferencia entre el primero y el segundo, no entre usable e inutilizable.

Donde HeyGen Voice aún no está clasificado
El lado honesto de este resultado es que HeyGen Voice no aparece en absoluto en el panel de Provider Voices, y su ausencia no es una señal sobre la calidad. Artificial Analysis señala que los modelos pueden omitirse por no tener todavía suficientes votos. Un modelo con apenas días de vida, con una única arena puntuada de forma diferente detrás de él, simplemente no ha acumulado el volumen de oyentes a ciegas que exige el panel más grande.
Así que la lectura correcta el 10 de octubre de 2026 es: HeyGen Voice es la voz mejor clasificada en la comparación controlada de voces clonadas, y una incógnita frente al panorama más amplio. Cualquiera que cite «el mejor modelo TTS del mundo» a partir de este número está citando una tabla más pequeña de lo que la frase implica.

Los dos números detrás del Elo
• Elo de Voz Controlada — HeyGen Voice: 1.202 (IC del 95 %, aproximadamente 1.185–1.219). Qwen-Audio-3.1-TTS-Plus: 1.186. Eleven v4 Turbo: 1.167.
• Elo de voces de proveedores — Voz de HeyGen: no figura en la lista (votos insuficientes). Eleven v4 Turbo: 1.328 en el n.º 1. Sonic 3.6: 1.280 en el n.º 4.
• Posición en el campo controlado — HeyGen Voice: n.º 1 de 42 entradas clasificadas (el n.º 42 es OpenVoice v2, con 812).
• Precio según la base de la arena — HeyGen Voice: $30.00 por 1 millón de caracteres, la conversión propia de la arena del precio de créditos de HeyGen. Qwen-Audio-3.1-TTS-Plus: $19.30 por 1 millón de caracteres. Eleven v4 Turbo: $40.00 por 1 millón de caracteres.
• Ancla Elo — OpenAudio S1 es el punto de referencia fijo en 1.000, por lo que HeyGen Voice queda 202 puntos por encima del ancla.
• ¿Quién más está en el top cinco?— Eleven v4 con 1, y Sonic 3.6 con 1,143 completan el top cinco por detrás de los líderes.

Lo que HeyGen realmente lanzó
El motor detrás de la entrada es el TTS interno de HeyGen, expuesto en la API v3 de la compañía. Una llamada GET /v3/voices acepta un filtro engine cuyos valores incluyen orca —el propio motor de voz de HeyGen— junto con starfish y un paso directo a las voces de ElevenLabs. La renderización de voz se ejecuta mediante POST /v3/voices/speech; el ajuste por solicitud expone speed de 0.5 a 1.5 y pitch de −50 a +50 semitonos, con una indicación de locale BCP-47.
El catálogo figura como más de 300 voces preconstruidas en decenas de idiomas. Las voces personalizadas vienen en tres variantes: diseño de texto a voz que genera hasta tres opciones clasificadas a partir de una descripción limitada a 1.000 caracteres, un clon instantáneo a partir de una sola grabación, y un clon profesional entrenado con veinte minutos o más de audio. Ese último es el aspecto que la tabla de clasificación de Controlled Voice está sometiendo a prueba de estrés en la práctica: esas ocho voces de referencia son clones, y la calidad del clon es donde los motores TTS se diferencian.
Los motores también aparecen en la documentación como seleccionables para cada voz, lo que significa que HeyGen no te obliga a usar su modelo: puedes enrutar hacia un motor de voz de terceros a través de su API cuando prefieras uno. Eso es un proveedor que se cubre las espaldas con su propio modelo, y vale la pena saberlo cuando leas una afirmación de «voz n.º 1» sobre HeyGen.
Lo que esto cambia para cualquiera que elija una voz
Tres consecuencias prácticas se derivan de que se logre un resultado de voz controlada, y ninguna de ellas es «cambiarlo todo».
Primero, si tu caso de uso es una voz de marca clonada —un solo hablante, muchas líneas—, este es ahora el ranking que debes leer, y HeyGen Voice es el modelo que debes probar primero. Un ranking que mantiene la voz constante está midiendo justo lo que realmente vas a hacer.
Segundo, si tu caso de uso es un elenco amplio de personajes que suenen nativos en idiomas que tu clon no cubre, el panel Provider Voices y sus noventa y seis entradas siguen siendo la referencia pertinente, y HeyGen Voice aún no tiene ninguna posición allí. Nada en el resultado de una voz clonada te dice cómo maneja el motor cien voces distintas.
Tercero, el precio ahora tiene una cifra, pero no una que el proveedor haya publicado. La arena incluye HeyGen Voice a 30,00 $ por 1 millón de caracteres, una conversión de Artificial Analysis de un sistema de créditos que la propia página de HeyGen nunca traduce a una tarifa de voz. Eso sitúa al nuevo líder por debajo de los 40,00 $ de Eleven v4 Turbo y por encima de los 19,30 $ del nivel de Qwen — un precio de mitad de tabla asociado a una puntuación de primer lugar, y además derivado en lugar de cotizado.
La cuestión del enrutamiento
La selección de voz tiene una propiedad que la mayoría de las opciones de modelos no tienen: el fallo es audible para el usuario final en cuestión de una sílaba. Eso hace que la migración sea barata de probar y costosa de equivocar en producción. Ejecutar un nuevo motor detrás de la misma interfaz que el titular —una superficie de API, una clave, el precio de lista del proveedor pasado tal cual en lugar de con recargo, con conmutación por error automática a un segundo proveedor de voz cuando falla una solicitud— es la forma de obtener una respuesta real sobre tu propio audio en lugar de la respuesta de un gráfico Elo sobre ocho voces de referencia. La capa de enrutamiento de OrcaRouter existe exactamente para ese tipo de decisión: poner al retador en una fracción del tráfico, mantener activo al titular y dejar que la conmutación por error cubra la ventana en la que el nuevo modelo no está probado. La tabla de clasificación te dice dónde mirar. No puede decirte cómo suena tu guion.
Qué ver a continuación
Dos números resolverán esta historia. El primero es si HeyGen Voice acumula suficientes votos para entrar en el tablero Provider Voices, y en qué posición queda frente a los 1.328 de Eleven v4 Turbo — un modelo que lidera ese tablero pero va por detrás en la arena controlada, que es precisamente la brecha que los dos tableros existen para exponer. El segundo es si HeyGen publica una tarifa de voz propia, para que los $30.00 que la arena ha derivado puedan cotejarse con una cifra del proveedor en lugar de inferirse a partir de créditos. Hasta que ambos existan, un debut en el puesto n.º 1 en el tablero controlado es una afirmación sólida sobre la calidad de la voz clonada y una pregunta abierta sobre todo lo demás.
