
HeyGen Voice vs. Cartesia Sonic 3.6: el campeón de la voz clonada contra el incumbente de menos de 90 ms
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
HeyGen Voice y Cartesia Sonic 3.6 sostienen dos afirmaciones distintas de ser el número uno en Artificial Analysis, y toda la comparación reside en la brecha entre ambas. HeyGen Voice encabeza la arena Controlled Voice con 1,202 Elo, la tabla donde el modelo habla con las mismas ocho voces clonadas, cuatro de EE. UU. y cuatro del Reino Unido. Cartesia Sonic 3.6 ocupa el cuarto puesto en la arena Provider Voices con 1,280 Elo, donde cada proveedor aporta sus propias voces nativas, y el propio sitio de Cartesia luce una insignia que afirma un ranking n.º 1 tanto en la Speech Arena como en la clasificación de Speech to Text, una afirmación declarada por el proveedor que la tabla en vivo de Artificial Analysis actualmente no respalda en la primera posición. Un motor gana la prueba donde la voz se mantiene constante; el otro lidera la prueba donde el presupuesto de producción es real.
Empieza por aquello para lo que cada modelo está realmente optimizado
Sonic 3.6 está diseñado para consumirse en streaming. La propia página de producto de Cartesia encabeza con «primer audio en menos de 90 ms» —reportado por el proveedor, no reproducido— y esa misma página describe una API de TTS en tiempo real con streaming de primera clase. Cubre 44 idiomas con un solo modelo, interpreta el subtexto emocional de forma predeterminada, acepta señales no verbales como la risa escrita en la transcripción, clona una voz a partir de unos diez segundos de audio, localiza audio existente a otros idiomas y admite diccionarios de pronunciación personalizados para términos del dominio y nombres propios. Cada una de esas funciones está dirigida al mismo cliente: algo que responde, rápido, en un idioma que quien llama entiende.
HeyGen Voice está diseñado para consumirse como una actuación. Es el motor interno de HeyGen, expuesto a través de la API v3 de la empresa, con más de 300 voces prediseñadas en decenas de idiomas y tres vías hacia una voz personalizada: diseño de voz guiado por descripciones que devuelve hasta tres opciones clasificadas a partir de un prompt limitado a 1000 caracteres, un clon instantáneo a partir de una grabación y un clon profesional entrenado con veinte minutos o más. El ajuste por solicitud abarca la velocidad de 0,5 a 1,5 y el tono en un rango de ±50 semitonos. Nada en el material publicado de HeyGen promete una cifra de latencia en absoluto.
Esa asimetría es todo el artículo. Un modelo publica una cifra en milisegundos y ningún precio por carácter; el otro publica un precio y ninguna cifra de latencia.
El marcador

• Elo de voz controlado (las mismas 8 voces clonadas) — HeyGen Voice: 1.202, n.º 1 de 42. Sonic 3.6: 1.143, n.º 5.
• Provider Voices Elo (voces nativas) — HeyGen Voice: sin clasificación, votos insuficientes. Sonic 3.6: 1.280, n.º 4 de 96.
• Precio publicado — Sonic 3.6: $49.00 por 1 millón de caracteres, tarjeta de tarifas del proveedor. HeyGen Voice: $30.00 por 1 millón de caracteres según la conversión propia de la arena del precio de créditos de HeyGen; HeyGen no publica ninguna tarifa de voz por sí misma.
• Latencia — Sonic 3.6: menos de 90 ms hasta el primer audio (según el proveedor, sin reproducir). HeyGen Voice: el proveedor no publica ninguna cifra ni Artificial Analysis la ha medido.
• Idiomas — Sonic 3.6: 44 de un solo modelo. HeyGen Voice: más de 300 voces en "docenas de idiomas", sin enumerarse como una cifra.
• Ruta de voz personalizada — Sonic 3.6: clonación de ~10 segundos. HeyGen Voice: diseño de voz a partir de una descripción de texto, clonación instantánea o clonación profesional entrenada con más de 20 minutos.

La brecha de Elo, leída correctamente
Una ventaja de 59 puntos en la arena controlada se invierte y pasa a ser un déficit de 137 puntos en la tabla de proveedores, y esa inversión no es una contradicción. La tabla controlada elimina la capacidad del proveedor de elegir una voz que lo favorezca y pregunta cómo maneja el motor una voz que no eligió. HeyGen Voice gana en eso. La tabla de proveedores pregunta qué tan buenas suenan las mejores voces del propio proveedor, lo que se acerca más a lo que un cliente escucha en una demostración de ventas — y a Sonic 3.6 le va bien ahí: cuarto de noventa y seis y 38 puntos por detrás del Eleven v4 Turbo, clasificado en primer lugar.
Ninguno de los dos números es el de propósito general. Si estás clonando a una persona específica y necesitas que el motor reproduzca a esa persona de forma convincente, el controlado es el mejor predictor, y HeyGen Voice actualmente lo supera. Si estás eligiendo una voz de una biblioteca para un agente que tiene que sonar distintivo a escala, el resultado del proveedor es el mejor predictor, y Sonic 3.0 tiene una posición en la que HeyGen Voice no tiene ninguna.
Vale la pena señalarlo para quien maneje cifras antiguas: ambas tablas cambian a medida que se acumulan los votos. A principios de 2026 se informó que Sonic 3.6 lideraba directamente la tabla de voz controlada; la tabla actual lo sitúa quinto allí con 1.143, con HeyGen Voice, Qwen-Audio-3.1-TTS-Plus y dos niveles de Eleven v4 por encima de él. Una cita de una tabla de clasificación es una marca temporal, no una propiedad permanente del modelo.
Dónde falla la comparación de precios
Los 49,00 $ por millón de caracteres de Sonic 3.6 son el precio de referencia de la propia arena, tomado de la tarifa de API publicada por el proveedor con la configuración predeterminada. Eso hace que una factura mensual de audio de cinco cifras pueda calcularse antes de que escribas una sola línea de código de integración.
La cifra de HeyGen es más difusa, pero existe. El gráfico de precios de la arena incluye HeyGen Voice a $30.00 por millón de caracteres —diecinueve dólares por debajo de Sonic 3.6— y esa cifra es la conversión que hace Artificial Analysis del precio por créditos de HeyGen, no una tarifa que HeyGen publique. La propia página de HeyGen vende créditos (Creator a $29/mes por 600 créditos, Pro a $49 por 1,000, Business a $149 por 1,500) y afirma claramente que el consumo varía según el modelo, la duración y la complejidad de la generación, sin traducir jamás esos créditos a caracteres. Así que el modelo que gana en la clasificación de voz controlada tiene un precio muy por debajo del que ocupa el quinto puesto, y la diferencia es una cifra derivada que querrás confirmar con tu propio texto en lugar de una tarifa que puedas auditar.
Eso no es un argumento en contra de HeyGen Voice. Es un argumento a favor de probarlo con el tráfico que puedes permitirte medir, porque la única forma de conocer su costo real en tu pipeline es pasar tu propio texto por él.
Elegir entre ellos
Elige Sonic 3.6 cuando la voz tenga que responder. Una promesa de primer audio en menos de 90 ms, una API nativa de streaming, 44 idiomas desde un solo modelo y —lo que es fundamental— una lista de tarifas publicada lo convierten en la opción de producción de menor riesgo para agentes conversacionales, IVR y cualquier caso en el que una pausa sea un error. Su puesto n.º 5 en voz controlada es respetable, no una debilidad, y su cuarto puesto en la tabla general es la señal independiente más fuerte que ofrece cualquiera de los dos modelos.
Prueba HeyGen Voice primero cuando la voz tenga que rendir. Narración, contenido leído para marcas, trabajo de personajes y cualquier proyecto en el que estés clonando a un hablante y necesites que el clon de ese hablante sea lo que mejor suene en el aire: esa es la tarea que la arena controlada fue construida para medir, y es la tarea que HeyGen Voice acaba de ganar. La ruta de clonación profesional entrenada con más de veinte minutos es un producto sustancialmente distinto de un clon instantáneo de diez segundos, y es la que se corresponde con las ocho voces de referencia clonadas en la arena.
No elijas ninguno de los dos basándote en un único número Elo. Las dos tablas no coinciden respecto a estos modelos, lo que significa que las tablas te están diciendo algo real: la calidad depende de la voz y de la carga de trabajo, no solo del motor.

Ejecutando ambos sin confirmar
La vía práctica para resolver un desacuerdo como este es dejar de tratarlo como una decisión de adquisición. Coloca los dos motores detrás de una interfaz, divide el tráfico y juzga con tu propio audio: unas pocas líneas de narración y un bucle de agente en vivo te dirán más que cincuenta puntos Elo. OrcaRouter enruta ambos a través de una única clave de API al precio de lista del proveedor sin recargo, por lo que la propia lista de precios del proveedor es lo que pagas y un cambio de precio de Sonic 3.6 se refleja el mismo día en lugar de en la renovación. La conmutación por error automática importa más aquí que en la mayoría de los cambios de modelo, porque un proveedor de voz que se detiene a mitad de frase es audible para la persona que llama, y el DSL de enrutamiento te permite fijar un motor para turnos sensibles a la latencia y el otro para narración pregenerada sin mantener dos integraciones.
¿Qué lo resolvería?
Dos cosas. Una tarifa de voz publicada por carácter o por crédito de HeyGen haría que la mitad del costo de esta comparación fuera tan concreta como la mitad de la calidad, y que HeyGen Voice acumulara suficientes votos para entrar en la arena de Provider Voices nos diría si su ventaja en voces controladas sobrevive al contacto con voces nativas —la prueba que Sonic 3.6 ya ha superado en cuarto lugar de noventa y seis. Hasta entonces, Sonic 3.6 es el titular con un precio y una cifra de latencia, y HeyGen Voice es el retador con la mejor evidencia de voz clonada y ningún costo que ponerle al lado.
