
Qwen-Audio-3.1 vs ElevenLabs: una reducción de precios del 70 % se enfrenta al líder establecido
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
El proveedor recortó el precio de su API Qwen-Audio-3.1-TTS en aproximadamente un 70 % el 23 de septiembre de 2026, anunciado en el escenario de la Apsara Conference en Hangzhou junto con otros cuatro modelos de voz. Ese único número es la razón por la que vale la pena escribir esta comparación: ElevenLabs Eleven v3 ha sido la voz de producción predeterminada para la mayoría de los equipos occidentales a una tarifa efectiva cercana a los 100 USD por millón de caracteres, y un competidor creíble acaba de ponerle al mismo trabajo un precio de una fracción de eso, al mismo tiempo que ampliaba la cobertura de idiomas. Los dos sistemas no son equivalentes: Qwen-Audio-3.1-TTS es una API solo alojada del Tongyi Lab del proveedor, con un ecosistema de voces más pequeño, mientras que ElevenLabs es una plataforma de contenido completa con la biblioteca de voces más amplia de la industria. Pero si tu decisión alguna vez se ha definido por la factura, la aritmética cambió esta semana.
Qué se lanzó realmente el 23 de septiembre
Qwen-Audio-3.1 no es un solo modelo. Es una actualización de cinco modelos de toda la pila de voz de Alibaba, y los niveles importan porque tienen precios y funciones diferentes:
• Qwen-Audio-3.1-TTS — el sucesor directo del modelo de síntesis que usan la mayoría de los equipos. Añade siete idiomas para un total de 16, mantiene las 20 regiones de dialectos chinos, incorpora transferencia natural de timbre entre idiomas (una misma voz que se mantiene en mandarín, cantonés, inglés y japonés), control basado en instrucciones de la emoción, el ritmo y el estilo de locución, y maneja audio de referencia ruidoso, con eco o en malas condiciones sin necesidad de un modo de eliminación de ruido aparte.
• Qwen-Audio-3.1-TTS-Next — un nuevo nivel, y un producto distinto. Alibaba lo denomina modelo "Audiogen": genera voz, efectos de sonido y ambiente de fondo en una sola pasada a partir de texto, marcas de tiempo y audio de referencia. Diálogos con varios hablantes, pódcasts, paisajes sonoros de cine y televisión, salida a 48 kHz. Según la documentación de Model Studio de Alibaba Cloud, acepta hasta 3000 caracteres de entrada, limita el audio generado a 240 segundos para pódcasts y a 120 segundos en los demás casos, funciona a 3 solicitudes por segundo y devuelve WAV, MP3 o PCM.
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next y Qwen-Audio-3.1-Realtime — reconocimiento, comprensión de audio (emoción, música, sonido ambiental, localización de eventos) y conversación full-duplex, respectivamente. Realtime es el que Alibaba está impulsando hacia el hardware: Qwen Office, Qoder, QwenNote A2, el robot de escritorio QwenNote Eva y las gafas de IA Qwen.
Los recortes de precios abarcaron toda la línea, no solo el TTS: la síntesis bajó alrededor del 70 %, el tiempo real alrededor del 85 % y el reconocimiento hasta un 95 %. Alibaba también publicó como código abierto Qwen-Audio-Agent, un framework para crear agentes de voz en tiempo real, y presentó Qwen3.8-LiveTranslate con una latencia reducida a menos de 2,5 segundos.

El marcador

• Precio — Qwen-Audio-3.1-TTS: aproximadamente un 70 % por debajo de la generación anterior de Qwen-Audio, que situaba el nivel 3.0 Plus en torno a 27,60 $ por millón de caracteres y el nivel Flash en torno a 15 $. ElevenLabs Eleven v3: unos 100 $ por millón de caracteres según el seguimiento de Artificial Analysis, con Flash en torno a 50 $.
• Idiomas — Qwen-Audio-3.1-TTS: 16 idiomas más 20 regiones dialectales chinas. ElevenLabs Eleven v3: 74 idiomas.
• Pesos — Qwen-Audio-3.1-TTS: cerrado, alojado únicamente en Alibaba Cloud Model Studio. ElevenLabs Eleven v3: cerrado, alojado únicamente.
• Biblioteca de voces — Qwen-Audio-3.1-TTS: clonación nativa más transferencia de timbre entre idiomas; no existe un mercado público comparable. ElevenLabs: la mayor biblioteca de voces compartida del sector, además de clonación instantánea a partir de unos 30 segundos de audio.
• Control de la interpretación — Qwen-Audio-3.1-TTS: emoción, ritmo y estilo basados en instrucciones, heredando las 86 etiquetas de interpretación en línea introducidas con la 3.0. ElevenLabs Eleven v3: etiquetas de audio más la plataforma que las rodea (doblaje, agentes, estudio).
• Benchmark independiente — Qwen-Audio-3.1-TTS: ninguno todavía. ElevenLabs Eleven v3: 1.168 Elo en la tabla de clasificación Provider Voice Arena de Artificial Analysis a fecha de agosto de 2026.
Donde el retador realmente gana
Tres cosas, y solo una de ellas es el precio.
El precio, obviamente. Una reducción del 70 % frente a un proveedor establecido que cobra $100 por millón de caracteres no es una diferencia de redondeo. Es la diferencia entre un producto con el que haces prototipos y un producto que lanzas a todos los usuarios. Si generas narración a gran escala, el ahorro anual no es una partida que tengas que defender internamente: se defiende por sí solo.
Chino, sin lugar a dudas.Veinte regiones dialectales chinas son un foso al que nada de lo que ofrece ElevenLabs se acerca. Si tu producto sirve a usuarios de China continental, o a hablantes de cantonés, o a un público de la diáspora que alterna idiomas a mitad de frase, la comparación termina antes de empezar.
Transferencia de timbre entre idiomas.Qwen-Audio-3.1-TTS toma una voz y la traslada con naturalidad entre el mandarín, el cantonés, el inglés y el japonés. Se trata de una capacidad específica con un caso de uso específico —una única voz de marca que se mantiene al cambiar de idioma—, y supone un verdadero diferenciador para quien localiza a un único presentador en lugar de buscar uno nuevo para cada mercado.
Donde ElevenLabs sigue ganando, y no hay punto de comparación
La amplitud de idiomas es lo primero, y es lo más importante. Setenta y cuatro idiomas frente a dieciséis no es una brecha que se cierre con un anuncio de precios. Si lanzas en polaco, turco, vietnamita y portugués, ElevenLabs te cubre hoy y Qwen-Audio-3.1-TTS no.
El segundo es el ecosistema. ElevenLabs no es un endpoint de síntesis; es una plataforma de contenido. Una biblioteca de voces compartida que puedes licenciar en lugar de clonar, flujos de trabajo de doblaje, infraestructura de agentes, un producto de estudio, una superficie de API documentada con años de bibliotecas cliente detrás. Migrar fuera de eso es un proyecto, no un cambio de configuración, y los equipos que han construido sobre ello saben exactamente a qué renunciarían.
El tercero es algo más difícil de nombrar y que vale la pena nombrar de todos modos: la percepción de naturalidad en una única voz en inglés. La síntesis de Qwen ha sido históricamente excelente en chino y solo muy buena en inglés, y aunque el lanzamiento 3.1 afirma mejorar la entrega multilingüe, aún no existe una prueba de escucha independiente sobre el nuevo modelo. Cualquiera que te diga que sabe cómo suena la nueva voz de Qwen en inglés está adivinando.
El número que nadie debería citar todavía
Esta es la parte de la historia que se verá distorsionada en la cobertura, así que aquí está sin rodeos. Qwen-Audio-3.1-TTSno tiene ninguna puntuación de referencia independiente. Su predecesor, Qwen-Audio-3.0-TTS-Plus, se situaba en 1.234 Elo en la tabla de clasificación Provider Voice Arena de Artificial Analysis a mediados de agosto de 2026, ocupando entre el segundo y el quinto puesto de esa tabla. Qwen-Audio-3.1-TTS aún no se ha añadido a ninguna arena. Todas las afirmaciones de calidad de los materiales de lanzamiento de Alibaba provienen del proveedor y no se han reproducido.
Eso no hace que las afirmaciones sean falsas. Las convierte en no verificadas, y significa que el planteamiento honesto de este enfrentamiento ahora mismo es: un modelo con un precio y sin puntuación, frente a un modelo con una puntuación y un precio mucho más alto. Cualquier cosa más contundente que eso es especulación vestida con la ropa de un benchmark.

La misma disciplina se aplica a la latencia. La cifra destacada de primer token de Alibaba para el lado de ASR de esta familia —92 milisegundos— proviene del propio benchmark de alta concurrencia de la compañía sobre una especificación de 0.6B, no de pruebas de terceros, y el análisis publicado desde el lanzamiento señala que ASR y TTS son productos separados dentro de una canalización, en lugar de un único modelo de extremo a extremo, y que los informes de la comunidad describen que la latencia se acumula en diálogos largos bajo un patrón de pseudo-streaming. Considera las cifras de latencia del proveedor para toda esta familia como techos, no como experiencia medida.
Qué valor tiene en la práctica la rebaja de precios
Tomemos una carga de trabajo realista: un producto que sintetiza 20 millones de caracteres de narración al mes en inglés y mandarín. Con la tarifa de aproximadamente 100 USD por millón de caracteres de ElevenLabs Eleven v3, eso supone unos 2000 USD al mes, o 24.000 USD al año. Con la tarifa de Qwen-Audio-3.0-TTS-Plus de aproximadamente 27,60 USD por millón, ese mismo volumen ya costaba unos 552 USD al mes. Si aplicamos la reducción del ~70 % que Alibaba anunció el 23 de septiembre, la misma carga de trabajo se queda en unos pocos cientos de dólares al mes.
Ninguna de esas cifras son precios de lista contra los que puedas firmar — ElevenLabs factura en créditos mediante niveles de suscripción, y los recortes de Alibaba son reducciones porcentuales sobre tarifas que varían según la región y el nivel. Pero la forma de la comparación es inequívoca, y esa forma es la base sobre la que presupuestas.
Una advertencia que vale la pena señalar para cualquiera que modele esto con cuidado: Alibaba Cloud trasladó su facturación de transcripción en tiempo real en el nodo de Singapur de una medición basada en la duración a una medición basada en tokens, a $0.93 por millón de tokens de entrada y $0.70 por millón de tokens de salida. La facturación por tokens es menos predecible que la facturación por duración cuando no controlas en cuántos tokens se convierte un fragmento de audio determinado, y el ruido, el silencio y el contexto de múltiples turnos aumentan el consumo de tokens. Una reducción anunciada del 70% no se traduce automáticamente en un ahorro del 70% en tu tráfico específico.
Cómo ejecutar realmente el switch
Si estás evaluando esto, lo útil que hay que saber es cuánto te cuesta una migración en tiempo de ingeniería. Ambos modelos son API alojadas y cerradas, así que en cualquier caso vas a integrarte contra un endpoint HTTP, y el trabajo consiste en un cliente, una política de reintentos y un inventario de voces, no en rehacer la arquitectura.
Ahí es donde la forma de OrcaRouter ayuda, con una advertencia honesta primero: no enrutamos Qwen-Audio-3.1-TTS ni ningún modelo Qwen-Audio. Los endpoints de voz de Alibaba quedan fuera de nuestro alcance, y lo mismo ocurre con ElevenLabs. Lo que sí cubrimos es la capa de inferencia a su alrededor — una única clave de API para más de 200 modelos de texto con 0 % de margen, es decir, el precio de lista del proveedor se pasa directamente, así que una bajada de precio de un proveedor está activa en nuestro lado el mismo día en lugar de después de un ciclo de reajuste de precios. Para los equipos que construyen la aplicación que impulsa una canalización de voz — el resumidor, el generador de guiones, el planificador de contenido — eso significa un contrato en lugar de varios, conmutación automática por error cuando un servicio upstream se degrada, y un DSL de enrutamiento para componer modelos en una sola llamada. No significa que llames a la voz de Qwen a través de nosotros. Quien te diga lo contrario no ha leído el catálogo.
Quién debería moverse, y quién debería esperar
Muévase ahora si su volumen de trabajo es principalmente en chino, si la cobertura de dialectos está en su lista de requisitos, si el costo por volumen es la limitación que lo ha mantenido con una voz más barata pero peor, o si necesita una única voz de marca que sobreviva a un cambio de idioma. El precio del 23 de septiembre hace que la economía sea difícil de discutir, y la calidad del idioma chino ya era competitiva antes de eso.
Espera si distribuyes en más de unos dieciséis idiomas, si tu producto depende de una biblioteca de voces con licencia en lugar de la clonación, si estás profundamente integrado en las herramientas de doblaje o de agentes de una plataforma, o si tu proceso de adquisición requiere una puntuación de calidad independiente antes de la aprobación. Ninguno de esos es un obstáculo permanente, pero ninguno de ellos se resolvió con una rebaja de precio.
Y fíjate en una cosa en concreto: si Qwen-Audio-3.1-TTS aparece en un ranking de escucha a ciegas. En el momento en que lo haga, esta comparación dejará de girar en torno al precio y al número de idiomas y pasará a girar en torno a si la voz más barata es realmente igual de buena. Esa es la pregunta que el lanzamiento no respondió.
