
HeyGen Voice vs Qwen-Audio-3.0-TTS: Lo que pagas por el Elo y qué nivel de Qwen pusiste realmente a prueba en el benchmark
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Haz primero las cuentas, porque están menos desequilibradas de lo que sugiere el marcador. Qwen-Audio-3.0-TTS-Plus cuesta $19.30 por millón de caracteres en la plataforma Model Studio — una tarifa que el proveedor publica. HeyGen Voice se sitúa en $30.00 por millón de caracteres en el propio gráfico de precios de Artificial Analysis, una cifra que el sitio deriva del precio de los créditos de HeyGen, porque la página pública de precios de HeyGen vende créditos sin indicar cuánto consume una generación de voz. Entretanto, la brecha de voz controlada entre ambos es de 79 Elo: HeyGen Voice obtuvo 1,202 en la arena que mantiene constantes las ocho voces de referencia, Qwen-Audio-3.0-TTS-Plus 1,123. Así que el modelo más barato está clasificado muy por detrás del mejor, la relación entre ambos es de aproximadamente 1.55×, y solo uno de esos dos precios es una cifra que el proveedor que lo vende puso su nombre.
La trampa en el nombre
Antes de todo eso, acierta con el nivel, porque esta es una familia que con mucho gusto te dejará evaluar el modelo equivocado. Dos entradas de Alibaba importan aquí y no son intercambiables.
Qwen-Audio-3.0-TTS-Plus es el modelo con el que se compara este artículo. Obtiene 1.123 en la tabla controlada —séptimo de cuarenta y dos— y 1.264 en la tabla Provider Voices, donde ocupa el sexto puesto de noventa y seis. Es un producto TTS de streaming real y actual con una tarifa publicada de 19,30 $ por millón de caracteres.
Qwen-Audio-3.1-TTS-Plus es su nivel sucesor, y es el que ocupa el segundo puesto en la tabla controlada con 1.186, el modelo que estuvo más cerca de superar a HeyGen Voice en su debut. Su tarifa se indica al mismo precio de 19,30 $, aunque la documentación de Alibaba advierte que las distintas versiones del modelo requieren voces compatibles, así que «mismo precio, nivel más nuevo» no significa «sustitución directa».
Cualquiera que lea «#1 por delante de Qwen» y luego evalúe Qwen-Audio-3.0-TTS con benchmarks estará probando un modelo 63 Elo más débil que aquel del que hablaba el titular. La discusión sobre el nivel vale 63 puntos, más que la diferencia entre HeyGen Voice y el tercer puesto.
El marcador

• Elo de voz controlado (las mismas 8 voces clonadas) — Voz de HeyGen: 1.202, n.º 1 de 42. Qwen-Audio-3.0-TTS-Plus: 1.123, n.º 7.
• Elo de voces del proveedor (voces nativas) — Qwen-Audio-3.0-TTS-Plus: 1.264, n.º 6 de 96. HeyGen Voice: sin clasificar.
• Precio por 1 millón de caracteres — Qwen-Audio-3.0-TTS-Plus: $19.30, publicado por el proveedor en Alibaba Cloud. HeyGen Voice: $30.00 según la conversión propia de precios por créditos de la arena; HeyGen no publica ninguna tarifa de voz.
• Coste de 100 horas de narración — Qwen-Audio-3.0-TTS-Plus: aproximadamente 926 $ a ~480.000 caracteres por hora hablada. HeyGen Voice: aproximadamente 1.440 $ según la conversión de 30,00 $ de la arena — derivado, no cotizado.
• Control de voz — Qwen-Audio-3.0-TTS-Plus: instrucción, etiquetas de emoción e idioma, clonación de voz y diseño de voz. HeyGen Voice: diseño de texto a voz a partir de una descripción de ≤1,000 caracteres, clon instantáneo, clon profesional entrenado con 20+ minutos.
• Salida — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 y Opus a hasta 48 kHz, con velocidad, tono, volumen y tasa de bits ajustables. HeyGen Voice: velocidad de 0,5 a 1,5 y tono de ±50 semitonos por solicitud.

Lo que la ingeniería de Alibaba realmente te ofrece
La familia Qwen-Audio-3.0-TTS es un producto de streaming y la documentación se lee como tal. Las solicitudes se envían a través de un protocolo WebSocket compartido con CosyVoice, con el flujo de eventos run-task, continue-task y finish-task y las respuestas task-started, result-generated, task-finished y task-failed junto con ellos. La cancelación es compatible con todos los modelos Qwen-Audio-TTS tanto en la región de Pekín como en la de Singapur mediante streaming_cancel(). La salida alcanza los 48 kHz y los formatos incluyen Opus, lo cual importa si vas a trasladar audio a un navegador o a una llamada telefónica en lugar de a un archivo WAV.
Dos detalles en esa documentación son fáciles de pasar por alto y costosos de descubrir tarde. Las etiquetas de emoción y lenguaje enriquecido se aplican solo a los niveles Plus y Flash —no a toda la familia— y funcionan solo en modo de transmisión unidireccional. Y las claves de API difieren entre las regiones de Singapur y Pekín, con espacios de trabajo direccionados en URL de la forma wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Las claves regionales son un detalle de aprovisionamiento hasta el día en que se convierten en una interrupción.
El lado de HeyGen es un producto con una forma distinta: una API v3 de estilo REST en la que POST /v3/voices/speech genera voz, GET /v3/voices enumera el catálogo tras un filtro engine, y el diseño de voz devuelve hasta tres opciones clasificadas a partir de un prompt de texto con una semilla para reproducibilidad. La documentación también revela que el filtro engine acepta valores más allá de los propios de HeyGen, así que HeyGen te enrutará sin problema a un motor de voz de terceros a través de su API. Un proveedor que ofrece el modelo de un competidor como opción seleccionable te está diciendo algo sobre dónde cree que reside su propia fortaleza.

Adónde van los 79 Elo
Una diferencia de 79 puntos en un tablero controlado es sustancial —mayor que el margen de 16 puntos que separa a HeyGen Voice del segundo puesto, y aproximadamente la distancia entre el tercer y el octavo puesto en ese campo. Además, se mide en un solo eje.
La arena controlada clona ocho voces y las mantiene fijas. No dice nada sobre la superficie de control basada en instrucciones que Qwen expone, nada sobre la salida Opus de 48 kHz a través de un WebSocket cancelable, y nada sobre el despliegue regional. Esas son propiedades de ingeniería, y son la razón por la que un equipo que construye un centro de contacto en mandarín no cambiaría a un modelo que obtiene 79 puntos más en ocho voces de referencia en inglés.
Lo que sí dice el resultado controlado es más acotado y sigue siendo útil: cuando a ambos motores se les entrega la misma voz clonada, los oyentes prefirieron el renderizado de HeyGen Voice. Si tu producto clona voces, ese es tu eje. Si tu producto elige una voz de un catálogo y la transmite en una llamada, la clasificación de proveedores está más cerca de tu realidad, y allí HeyGen Voice no tiene ninguna posición, mientras que Qwen-Audio-3.0-TTS-Plus ocupa el sexto lugar de noventa y seis.
El argumento del precio, tomado en serio
A $19,30 por millón de caracteres, Qwen-Audio-3.0-TTS-Plus cuesta aproximadamente la mitad que el nivel de $40 de ElevenLabs y alrededor del 40% de los $49 de Cartesia Sonic 3.6. Para una carga de trabajo de 100 horas de narración —alrededor de 48 millones de caracteres a una velocidad de habla típica—, eso es del orden de $926. El mismo volumen en Eleven v4 Turbo costaría alrededor de $1.920 y en Sonic 3.6, unos $2.352. HeyGen Voice, a los $30,00 de la arena, se sitúa cerca de $1.440: entre el nivel económico y los dos actores establecidos, más cerca del medio que de la parte alta.
Esa aritmética conlleva una salvedad que las otras no necesitan. $19,30 es la tarifa propia de Alibaba. Los $30 son la conversión que hace Artificial Analysis de un crédito que HeyGen nunca ha traducido a caracteres, así que es una estimación de buena fe más que una cotización. Si la relación real de caracteres por crédito es peor de lo que supone el gráfico, la ventaja de 79 Elo cuesta más que el 1,55× que implica; si es mejor, menos. Un modelo cuyo precio hay que inferir es un modelo que se prueba en un segmento medido de tráfico, no uno que se adopta como estándar. Eso no es una crítica al motor — es una descripción de la información disponible el 10 de octubre de 2026.
Decidiendo
Elige Qwen-Audio-3.0-TTS-Plus cuando el costo y la infraestructura de streaming impulsen la decisión. Menos de 20 USD por millón de caracteres, un WebSocket cancelable con salida Opus a 48 kHz, un parámetro de instrucción y etiquetas de emoción, y un sexto puesto en la tabla de proveedores lo convierten en la voz bien puntuada más económica de esta comparación. Elige el nivel 3.1 en su lugar si quieres el modelo que en realidad quedó segundo en la tabla controlada, y verifica la lista de voces antes de asumir que el cambio es gratuito.
Prueba HeyGen Voice cuando la fidelidad del clon es el producto. Un hablante, muchas líneas, una voz que debe ser *esa* voz cada vez — ese es el eje que mide el panel controlado y el eje en el que lidera todo el sector. Reserva un presupuesto para un período de medición, porque el modelo de créditos significa que conocerás tu costo real al ejecutar tu propio texto en lugar de leer una lista de tarifas.
E ignora la comparación por completo si la carga de trabajo es en chino y en tiempo real. Ninguno de los números de Elo se midió con tus voces, en tu idioma, con tu presupuesto de latencia.
Manteniendo ambos accesibles
Este es uno de los emparejamientos en los que la capa de enrutamiento se gana su lugar en lugar de ser un añadido. Una única clave de API que cubre a ambos proveedores —el precio de lista del proveedor se traslada sin margen, de modo que los 19,30 $ publicados por Alibaba son lo que pagas y un cambio de precio de Qwen se aplica el mismo día— elimina la necesidad de elegir un ganador antes de tener pruebas. La conmutación automática por error cubre el riesgo evidente en una canalización de voz, donde un flujo estancado es audible para el oyente, y el DSL de enrutamiento te permite enviar la narración masiva al motor barato y las líneas críticas para la clonación al que obtiene 79 puntos más, sin necesidad de dos bibliotecas de cliente ni dos relaciones de facturación. El valor de OrcaRouter aquí no radica en que aloje un modelo de voz, sino en que hace que el coste de averiguar cuál quieres sea prácticamente cero.
Las preguntas abiertas
Tres cosas zanjarían esto. Una tarifa de voz en la propia página de precios de HeyGen convertiría los $30.00 que la arena deriva en una cifra que puedes auditar. Una entrada de HeyGen en el tablero Provider Voices nos diría si la ventaja de la voz clonada sobrevive frente a las voces nativas — la prueba que Qwen-Audio-3.0-TTS-Plus supera en sexto lugar de noventa y seis. Y un resultado de voz controlada para Qwen-Audio-3.1-TTS-Plus frente a HeyGen Voice tras más votos nos diría si 16 Elo es un orden estable. Hasta entonces: Qwen es la opción con precio, con streaming y bien clasificada; HeyGen Voice es la de mayor puntuación, sin precio; y el nivel que evalúas importa más que el titular que lees.
