Una tarjeta principal para 'ElevenLabs Eleven v4 vs Qwen-Audio-3.1-TTS-Plus' con dos tarjetas de puntuación: Qwen-Audio-3.1-TTS-Plus con Elo 1.178, posición 1 y $19,30 por 1M de caracteres; ElevenLabs Eleven v4 con Elo 1.157, posición 2 y $80,00 por 1M de caracteres; con el título '21 puntos Elo frente a una brecha de precio de cuatro veces'. Pie de página: 'Controlled Voice Arena, según Artificial Analysis, septiembre de 2026.' El logotipo de OrcaRouter se encuentra en la esquina inferior derecha.
Engineering & Research

Eleven v4 vs Qwen Audio 3.1: La voz más barata de la tabla ganó

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En la clasificación en la que a cada participante se le dan las mismas ocho voces clonadas, Alibaba Qwen-Audio-3.1-TTS-Plus quedó primero con 1.178 de Elo y ElevenLabs Eleven v4 quedó segundo con 1.157. El modelo que ganó cuesta $19,30 por millón de caracteres en esa clasificación. El modelo que quedó segundo cuesta $80,00. Eso supone una diferencia de calidad de 21 puntos y una diferencia de precio de cuatro veces que apuntan en direcciones opuestas, y es el resultado más interesante de toda la semana de lanzamiento — más interesante que el primer puesto que ElevenLabs ocupó en la otra arena, porque en esa el orden es convencional y el ganador es la voz más cara del top ten.

Los dos paneles no son intercambiables, y la razón por la que este enfrentamiento se lee como se lee está enteramente en cuál de ellos miras. Provider Voice hace que los oyentes juzguen las voces propias de cada proveedor. Controlled Voice clona las mismas ocho voces —cuatro de EE. UU., cuatro del Reino Unido— para cada modelo, así que nadie puede ganar por su elenco de voces predeterminado. ElevenLabs gana el primero por 61 puntos. Alibaba gana el segundo por 21. Ninguno de los dos paneles está equivocado, y el segundo es el que predice un producto que lanza una voz de marca clonada.

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

El marcador de voz controlada, en su totalidad

• Preferencia a ciegas, clones emparejados — Qwen-Audio-3.1-TTS-Plus, puesto 1, Elo 1.178, $19,30 por millón de caracteres, frente a Eleven v4, puesto 2, Elo 1.157, $80,00.

• Preferencia ciega, las propias voces de cada proveedor — Eleven v4 puesto 1, Elo 1.319 vs Qwen-Audio-3.0-TTS-Plus puesto 4, Elo 1.258. Una diferencia de 61 puntos en sentido contrario.

• Precio, normalización de arena — Qwen $19.30 vs Eleven v4 $80.00. Qwen es un 76 % más barato.

• Precio, tarifa del proveedor — Eleven v4 $0,022 por mil caracteres en promoción y $0,08 después del 12 de octubre. La propia tarifa de Qwen Audio 3.1 no es algo que hayamos podido consultar, así que la normalización de la arena es el único precio con el que podemos comparar.

• Versión en cada placa — 3.1 en Controlled Voice, 3.0 en Provider Voice. Son modelos diferentes y las placas no son intercambiables.

• La entrada 3.0 en Controlled Voice — puesto 5, Elo 1,124, mismo precio de $19.30. La versión 3.1 vale 54 Elo más que su propio predecesor a un precio idéntico.

• Generaciones anteriores de Qwen en Provider Voice — Qwen3 TTS Flash ocupa el puesto 79, Elo 944; Qwen3 TTS ocupa el puesto 82, Elo 930.

• El anterior buque insignia de la propia ElevenLabs en Controlled Voice — Eleven v3, puesto 7, Elo 1,073.

• Comprobación de cordura con barras agrupadas — la dispersión de ocho vías del rango 1 al rango 10 en Controlled Voice es de 121 Elo. La ventaja de 21 puntos de Qwen sobre Eleven v4 es menos de una quinta parte del rango total del conjunto, que es la escala adecuada en la que mantenerla.

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

Dos filas ahí hacen la mayor parte del trabajo. La primera es la comparación entre 3.0 y 3.1: Alibaba movió 54 puntos Elo con un solo salto de versión sin cambiar el precio en absoluto. Esa es una cadencia más rápida que el movimiento de 84 puntos de v3 a v4 de ElevenLabs, y significa que el orden específico de clasificación en este artículo es una instantánea que ambos proveedores están cambiando activamente.

La segunda es la dispersión total de 121 puntos. Una diferencia de 21 puntos en una tabla cuyo rango útil es de unos 120 puntos es una diferencia real pero modesta — aproximadamente la misma magnitud que la brecha entre el propio 3.1 de Qwen y su 3.0. Si tu caso de uso se sitúa en un idioma para el que ninguno de los dos modelos fue ajustado, ese margen está cómodamente dentro del rango que unos pocos scripts de prueba exigentes pueden revertir.

El problema de la versión que nadie señala

El resultado que circula como «Eleven v4 es segundo en Controlled Voice» es preciso e incompleto, y la omisión es importante para cualquiera que planifique en torno a él. El modelo que se sitúa por encima de Eleven v4 en esa tabla es la versión 3.1 de Alibaba. La entrada de Qwen en la tabla de Provider Voice, mientras tanto, es la versión 3.0 — el modelo 3.1 no aparece en las primeras filas de esa tabla según nuestra lectura. Así que los dos titulares — «Eleven v4 es el número uno» y «Eleven v4 es el número dos» — son afirmaciones sobre dos modelos Qwen diferentes en dos tareas diferentes, y la versión de Qwen que le ganó en una tabla no es la versión de Qwen a la que le ganó en la otra.

Esto no es una trampa para ninguno de los dos proveedores; es una razón para desconfiar de cualquier resumen de una sola frase de una semana como esta. Si tienes que elegir entre estos dos sistemas, la comparación que quieres es 3.1 frente a v4 con tu propia voz clonada, en tu propio idioma, y ninguno de los dos proveedores ha publicado eso.

Lo que podemos y no podemos decir sobre Qwen Audio 3.1

La honestidad sobre la evidencia vale más aquí que una tabla completa de especificaciones, así que este es el límite de lo que sustenta este artículo. De los tableros de arena que tenemos, para Qwen-A-3.1-TTS-Plus: un Elo de voz controlada de 1.178, una normalización de precio de $19,30 por millón de caracteres, y el hecho de que es la versión actual de una línea cuya versión obtuvo 54 puntos menos al mismo precio.

No tenemos, y no vamos a adivinar: su cobertura de idiomas, su latencia, su límite de entrada por solicitud, si admite directivas de entrega en línea, si ofrece clonación de voz más allá de las ocho voces de la arena, o qué cobra según su propia tarjeta de tarifas. Todo eso está documentado para Eleven v4 —más de 90 idiomas, un límite de 10,000 caracteres, etiquetas de audio, clones instantáneos de diez segundos, soporte de fonemas IPA— y su ausencia en el lado de Qwen es una laguna en lo que es de lectura pública, no una desventaja del modelo. Una decisión de compra basada únicamente en este artículo sería una decisión basada en dos números.

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

Un contraste sí sobrevive a esa limitación, porque ambos lados están declarados por el proveedor o ambos están declarados por el ranking. En cuanto al precio, la normalización del ranking es el denominador común y favorece a Qwen en un 76 %. En cuanto a la calidad con hablantes emparejados, el mismo ranking favorece a Qwen por 21 Elo. Esas dos filas son comparables. Todo lo demás aquí no lo es, y el artículo no pretenderá lo contrario.

Por qué un consejo controlado debería tener más peso de lo habitual

La mayoría de las comparaciones de voz recurren por defecto a la tabla de clasificación que ponga en primer lugar al modelo que ya te gusta. En este enfrentamiento hay una razón de peso para preferir Controlled Voice, y es concreta, no general.

Alibaba y ElevenLabs compiten con activos muy diferentes. La ventaja de ElevenLabs es una biblioteca de voces construida a lo largo de años de casting cuidado; la de Alibaba es una organización de investigación que lanza versiones de modelos a un ritmo rápido. Una tabla que permite a cada participante aportar sus propias voces mide la biblioteca tanto como el sintetizador, y en esa tabla ElevenLabs gana por 61 puntos. Si se eliminan las bibliotecas —los mismos ocho hablantes clonados para todos—, la ventaja cambia de manos. Si la voz que oyen tus usuarios es el clon de una persona concreta, no estás comprando la biblioteca de ElevenLabs, así que la tabla controlada es la que describe tu compra. Si eliges de un menú de voces de catálogo, lo contrario es cierto y el margen de 61 puntos de Eleven v4 es la cifra que cuenta.

Hay una segunda razón, menos cómoda, para ponderar el resultado controlado. Un ranking con voces de proveedor premia un elenco predeterminado distintivo, y un elenco distintivo puede polarizar de formas que un Elo promedio oculta: lo que para un oyente tiene carácter, para otro resulta afectado. Un ranking con voces clonadas y hablantes emparejados elimina por completo esa variable, lo que lo convierte en la medición más reproducible de las dos.

Ejecutando cualquiera de los dos, y lo que realmente enrutamos

OrcaRouter no aloja ni los modelos de voz de ElevenLabs ni los de Alibaba. Ninguno de los dos proveedores está en nuestro catálogo, así que no hay forma de llamar a ninguno de ellos a través de nosotros, y este artículo no sugerirá lo contrario: para ambos, hay que acudir a la API del propio proveedor y a varias plataformas de terceros.

Lo que sí cubrimos es la capa superior. Si tu stack de voz es un nodo dentro de un pipeline más grande, ofrecemos más de 200 modelos detrás de una sola clave de API con los precios de lista de los proveedores transferidos con un 0 % de margen, de modo que un cambio de precios en cualquier punto de la cadena —incluida la ventana promocional de ElevenLabs y el precio de lista mucho más alto que la sigue el 12 de octubre— se refleja de nuestro lado el mismo día en que ocurre, y no en el siguiente ciclo de facturación. Para una decisión que depende de una relación de precios de 4x, ese timing marca la diferencia entre una comparación que envejece bien y una que resulta errónea en tres semanas.

Y donde la ruta de voz no puede caer, la conmutación automática por error mueve el tráfico a un origen saludable en lugar de hacer fallar la solicitud. En un enfrentamiento tan reñido en calidad y tan desigual en precio, la arquitectura sensata es tener ambos modelos detrás de un único endpoint, con el enrutamiento decidiendo el reparto, y no una selección permanente hecha a partir de una instantánea de una tabla de clasificación que ambos proveedores invalidarán en menos de un trimestre.

El veredicto, y su fecha de caducidad

Elige Qwen-Audio-3.1-TTS-Plus si estás clonando una voz y cuidando el costo. Es el primero en la tabla que mantiene constantes a los hablantes, cuesta aproximadamente una cuarta parte del precio y su línea avanza más rápido: 54 Elo en un solo paso de versión a una tarifa sin cambios sugiere que la próxima versión es una mejor apuesta que la actual sobre el papel.

Elige Eleven v4 si tus usuarios oyen voces estándar, si necesitas cobertura en idiomas que puedas verificar antes de lanzar, o si el conjunto de funciones documentado —etiquetas de audio, control de fonemas, solicitudes de 10.000 caracteres, clones de diez segundos— está haciendo un trabajo en tu producto que los tableros de la arena no miden. Su ventaja de 61 puntos en el tablero de voces de proveedores no es poca cosa, y las dos funciones que puedes escribir en un script son capacidades, no puntuaciones.

Fija una fecha de revisión. Alibaba se movió 54 puntos Elo en una actualización de versión en este ciclo, y ElevenLabs se movió 84 a lo largo de una generación completa, y la tarifa promocional de Eleven v4 vence el 12 de octubre. Diga lo que diga esta comparación hoy, los dos hechos con más probabilidades de darle la vuelta —un lanzamiento de la 3.2 y un precio revertido— llegan ambos antes de que termine el trimestre.