
HeyGen Voice vs ElevenLabs: un nuevo n.º 1 en voces clonadas, y el proveedor que todavía domina el tablero
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
HeyGen Voice se hizo con el primer puesto en la arena Controlled Voice de Artificial Analysis el 9 de octubre de 2026 con 1.202 Elo, y el modelo al que desplazó de ese puesto era de la gama de ElevenLabs: Eleven v4 Turbo, ahora tercero con 1.167. Ese es el titular, y es exacto. También es una afirmación mucho menos contundente de lo que parece, porque los modelos del mismo proveedor ocupan la segunda, tercera, cuarta, undécima y decimoquinta posición en esa misma tabla controlada, y Eleven v4 Turbo sigue en primera posición en la arena Provider Voices, mucho más grande, con 1.328 Elo — 126 puntos por delante de HeyGen Voice, que no está clasificado allí en absoluto. Un motor ganó una sola tabla. El proveedor sigue siendo el dueño de la categoría.
El mismo proveedor ahora cuenta con cinco de los quince primeros puestos.
La tabla controlada mantiene la voz constante —ocho voces de referencia clonadas, cuatro de EE. UU. y cuatro del Reino Unido—, por lo que cada entrada se juzga por cómo el motor maneja una voz que no pudo elegir. Esa tabla ahora muestra: HeyGen Voice 1.202, Qwen-Audio-3.1-TTS-Plus 1.186, Eleven v4 Turbo 1.167, Eleven v4 1.160, Sonic 3.6 1.143, Realtime TTS-2 1.143. Más abajo, Eleven v3 se sitúa en 1.072 y v3 Conversational en 1.056.
Cinco de las quince entradas principales de ese campo llevan el mismo nombre de proveedor. El rival con el único mejor modelo de la tabla tiene cinco buenos, repartidos en dos generaciones, a dos precios, además de una variante conversacional que es un producto completamente distinto. Así se ve un incumbent desde dentro del liderazgo de una tabla de clasificación, y es la razón por la que un debut en el #1 merece un titular en lugar de un plan de migración.
Qué son realmente los modelos de ElevenLabs
Eleven v4 Turbo se describe en la propia documentación del proveedor como el modelo de vanguardia para la síntesis de voz en tiempo real, recomendado para agentes de soporte, asistentes de IA y personajes interactivos, y se accede a él a través del websocket Text to Dialogue con el identificador de modelo eleven_v4_turbo. ElevenLabs indica una latencia de inferencia mediana de aproximadamente 100 ms —un dato reportado por el proveedor, y la nota al pie de esa misma página excluye de esa cifra la latencia de la aplicación y de la red, por lo que es un número del motor del modelo, no una promesa de ida y vuelta.
La cobertura de idiomas de la familia v4 es, con diferencia, la más amplia de esta comparación: más de 90 idiomas, desde afrikáans y árabe hasta cantonés, hindi, japonés, mandarín y zulú. La propia documentación de HeyGen enumera más de 300 voces prediseñadas en "docenas de idiomas" sin publicar una cifra, lo que es otra forma de describir un catálogo y no es directamente comparable con una cifra de idiomas.
Luego está la parte que no aparece en una tabla de clasificación en absoluto: la biblioteca de voces, los controles de estabilidad y similitud, el ajuste por solicitud y una década de superficie de integración. Una comparación de modelos no es una comparación de plataformas, y la entrada de ElevenLabs compite en ambas.

El marcador
• Elo de Voz Controlada — Voz de HeyGen: 1.202 (n.º 1). Eleven v4 Turbo: 1.167 (n.º 3). Eleven v4: 1.160 (n.º 4).
• Elo de Voces de Proveedores — Eleven v4 Turbo: 1.328 (#1 de 96). HeyGen Voice: sin clasificar.
• Precio publicado por 1M de caracteres — Eleven v4 Turbo: $40.00. Eleven v4: $80.00. HeyGen Voice: $30.00 según la conversión propia de la arena del precio de los créditos de HeyGen; HeyGen no publica ninguna tarifa de voz por sí misma.
• Latencia declarada — Eleven v4 Turbo: ~100 ms de inferencia mediana, excluyendo la latencia de aplicación y de red (según el proveedor). HeyGen Voice: no se ha publicado ninguna cifra.
• Cobertura de idiomas — Familia ElevenLabs v4: más de 90 idiomas (documentación del proveedor). HeyGen Voice: «docenas de idiomas», recuento no publicado.
• Modelos en el top quince controlado — ElevenLabs: cinco niveles. HeyGen: uno.

La diferencia entre los dos tableros es el número interesante
Eleven v4 Turbo está 161 puntos por delante de HeyGen Voice en la tabla de Provider Voices y 35 puntos por detrás en la tabla controlada. Ambas cifras provienen del mismo sitio, del mismo método de escucha a ciegas y del mismo periodo. Lo que los separa es la voz.
En la tabla de proveedores, cada proveedor aporta sus propias voces nativas, así que una empresa que ha pasado años creando y seleccionando una biblioteca de voces puede presentar lo mejor de sí misma. En la tabla controlada, esa ventaja desaparece: el motor tiene que renderizar una voz clonada que no seleccionó. La variación de 196 puntos entre ambos resultados es, en efecto, una medida de cuánto de la posición de ElevenLabs proviene de las voces y no del motor. Es una fracción grande. Tampoco es cero: 1.167 sigue siendo tercero de cuarenta y dos.
Para un comprador, eso se traduce en una pregunta concreta. Si estás eligiendo una voz de la biblioteca de un proveedor, la tabla de proveedores es tu tabla, y la posición de ElevenLabs allí es indiscutible. Si estás clonando a un hablante concreto, la tabla controlada es tu tabla, y esta semana tiene un nuevo nombre en lo más alto.
El costo del titular no ha cambiado.
Eleven v4 Turbo cuesta $40 por millón de caracteres en la API del proveedor, y el anterior Eleven v4 cuesta $80 —el doble, por un modelo que obtiene siete puntos Elo menos en la tabla controlada. Vale la pena detenerse en esa diferencia dentro de un mismo proveedor: dos modelos de una misma empresa, con una diferencia de precio de 2× y tres puestos de diferencia en la clasificación.
El lado de HeyGen en la comparación de precios existe, pero no en una forma que HeyGen haya publicado. La arena lo lista a $30.00 por millón de caracteres —diez dólares por debajo del nivel de ElevenLabs al que desplazó, y el 62% de los $80 del antiguo Eleven v4—, pero esa cifra es una conversión de Artificial Analysis, no una cotización del proveedor: la página pública de precios de HeyGen vende créditos (600 por $29/mes, 1,000 por $49, 1,500 por $149) y documenta que el consumo varía según el modelo, la duración y la complejidad, sin indicar una tarifa de voz. Así que el retador con la mejor puntuación en voz clonada tiene un precio una cuarta parte por debajo del operador establecido, según una cifra que este no tuvo que calcular.

Dónde gana realmente cada lado
Elige ElevenLabs cuando la amplitud sea la restricción. Más de noventa idiomas, cinco niveles clasificados en la tabla controlada, una biblioteca de voces madura y una variante conversacional con un precio de 50 dólares por millón de caracteres que la tabla controlada sitúa en decimoquinto lugar —esa combinación es difícil de reunir en otro lugar, y es la razón por la que la ventaja del proveedor sobrevivió a perder el puesto número 1.
Pon a prueba HeyGen Voice cuando la restricción es la uniformidad. Un solo hablante, miles de líneas, un clon que debe sonar como ese hablante cada vez: esa es exactamente la carga de trabajo que modela la arena controlada, y HeyGen Voice es actualmente el motor con mejor puntuación en ello. La ruta de clonación profesional entrenada con más de veinte minutos de audio es el producto relevante para ese trabajo, no el clon instantáneo a partir de una sola grabación.
No leas el 1.202 como evidencia de que HeyGen Voice supera a ElevenLabs en general. Supera a un solo nivel de ElevenLabs en una clasificación. Otros tres niveles se encuentran a 42 puntos o menos de él, y el líder de la otra clasificación está 126 puntos por delante.
Probar un retador sin una migración
La asimetría de costes es aquí lo útil: un cambio de voz es barato de construir y se nota al instante si sale mal, y dejar en marcha al proveedor establecido a 40 dólares por millón de caracteres es caro para tráfico que el retador gestiona mejor. La forma de resolverlo es poner ambos detrás de una sola integración y dejar que tu propio audio decida: OrcaRouter coloca ambos bajo una única clave de API al precio de lista del proveedor sin recargo, de modo que un cambio de tarifa del proveedor se refleja en origen y no en la renovación del contrato, y el failover automático hace que una solicitud de voz que falla pase al otro motor en lugar de quedarse en silencio. Para una primera aproximación puedes ponderar el tráfico hacia el motor que prefiera tu oído en un conjunto de pruebas pequeño, y el DSL de enrutamiento te permite reservar un motor para narración pregrabada y el otro para turnos interactivos sin una segunda biblioteca cliente.
¿Qué cambiaría esta historia?
La entrada de HeyGen Voice en la arena Provider Voices nos diría si un liderazgo en voces clonadas se traduce en voces nativas competitivas — la prueba que ElevenLabs supera con 1,328. Una tarifa de voz en la propia página de precios de HeyGen convertiría los $30.00 derivados de la arena en aritmética que puedes auditar. Y otro mes de votos mostraría si 16 Elo por encima de Qwen-Audio-3.1-TTS-Plus es un ordenamiento estable o una instantánea. Cualquiera de las tres podría mover la recomendación; ninguna ha ocurrido todavía, y el resumen honesto hasta que ocurran es que HeyGen Voice ganó el tablero controlado y ElevenLabs sigue dominando la categoría.
