
Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS: lo que dos meses han supuesto
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 495 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 186 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Qwen-Audio-3.0-TTS se lanzó el 20 de julio de 2026 y se colocó directamente en lo más alto de las clasificaciones independientes de voz: el nivel Plus alcanzó 1.238 de Elo en la clasificación Provider Voice Arena de Artificial Analysis, en el segundo puesto del ranking. Nueve semanas después, el 23 de septiembre de 2026, el proveedor anunció Qwen-Audio-3.1-TTS en la Conferencia Apsara de Hangzhou, con una reducción de precio de aproximadamente el 70 % incluida. Ese momento hace que esta sea una comparación poco habitual: el modelo al que reemplaza no está obsoleto; está evaluado, probado y sigue cerca de lo más alto. Así que la verdadera pregunta no es cuál es mejor. Es qué cambió concretamente, si algo de eso importa para tu carga de trabajo y qué ocurre con la puntuación en la que ya confías cuando el sucesor no ha sido puntuado en absoluto.
Dos meses, cinco endpoints, una familia
Alibaba no lanzó un único modelo. La versión 3.1 abarca cinco: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next y Qwen-Audio-3.1-Realtime. Para cualquiera que actualmente invoque Qwen-Audio-3.0-TTS, solo uno de ellos es una sustitución directa —el nivel TTS básico— y uno es un producto genuinamente nuevo en lugar de una actualización.
Ese segundo vale la pena entenderlo aunque nunca lo invoques. Qwen-Audio-3.1-TTS-Next es lo que Alibaba llama un modelo «Audiogen»: una sola pasada que produce voz, efectos de sonido y ambiente de fondo juntos a partir de texto, marcas de tiempo y audio de referencia. Diálogo con varios hablantes, montaje de pódcast, paisajes sonoros de escenas, salida a 48 kHz. La documentación de Model Studio de Alibaba Cloud enumera sus límites con claridad: 3000 caracteres de entrada, 240 segundos de audio generado para pódcast y 120 segundos en los demás casos, 3 solicitudes por segundo, salida en WAV, MP3 o PCM, y acepta hasta tres clips de referencia de 30 segundos cada uno en WAV, MP3 u OGG Opus. No se admite la entrada de referencia PCM sin procesar. Su precio es de 0,848 USD por millón de tokens de entrada y 1,696 USD por millón de tokens de salida en el nodo de Pekín, excluidas las tarifas promocionales, y solo admite chino e inglés.
Si usas 3.0-TTS y tu trabajo es «convertir este guion en una voz», nada de eso cambia tu integración. Si tu trabajo es «montar un pódcast de dos presentadores con camas musicales», 3.1-TTS-Next es una categoría de producto distinta y posiblemente la razón para fijarte siquiera en este lanzamiento.
La actualización, línea por línea

• Idiomas — Qwen-Audio-3.1-TTS: 16 idiomas según el proveedor, con siete añadidos respecto a la generación anterior. Qwen-Audio-3.0-TTS: 16 idiomas según lo indicado en la cobertura publicada del lanzamiento de julio.
• Dialectos chinos — Qwen-Audio-3.1-TTS: 20 regiones dialectales, heredadas. Qwen-Audio-3.0-TTS: 20 regiones dialectales.
• Transferencia de timbre entre idiomas — Qwen-Audio-3.1-TTS: sí, una misma voz se mantiene en mandarín, cantonés, inglés y japonés. Qwen-Audio-3.0-TTS: no disponible.
• Control de la locución — Qwen-Audio-3.1-TTS: control de la emoción, el ritmo y el estilo basado en instrucciones. Qwen-Audio-3.0-TTS: 86 etiquetas de locución integradas.
• Entrada de referencia con ruido — Qwen-Audio-3.1-TTS: admite audio de referencia con ruido o eco directamente, sin modo de reducción de ruido independiente. Qwen-Audio-3.0-TTS: se espera audio de referencia limpio.
• Puntuación independiente — Qwen-Audio-3.1-TTS: aún ninguno. Qwen-Audio-3.0-TTS-Plus: 1,238 de Elo en la tabla de clasificación Provider Voice Arena de Artificial Analysis a fecha de agosto de 2026.
El número de idiomas no cuadra, y eso importa
Esto es un detalle menor que quedará diluido en todo lo demás, así que vale la pena señalarlo. El material de lanzamiento de Alibaba dice que el nivel 3.1 de TTS añade siete idiomas. La cobertura publicada de la generación 3.0 de julio —incluidos nuestros propios artículos comparativos de ese mes— enumeraba 16 idiomas para el nivel 3.0. Siete más dieciséis son veintitrés, no dieciséis, y Alibaba no ha publicado una conciliación de las dos cifras.
Las posibles explicaciones son poco glamorosas: el número 3.1 puede contar un conjunto diferente, la cifra 3.0 puede haberse exagerado en el lanzamiento, o «adds seven» puede describir el nivel de ASR en lugar de TTS. No sabemos cuál. Lo que sí sabemos es que el recuento de idiomas en ambos lados de esta comparación es una cifra reportada por el proveedor que nunca se ha auditado de forma independiente, y que cualquiera que cite «16 idiomas» como un hecho firme sobre cualquiera de los modelos está citando una diapositiva de marketing. Consulta los idiomas específicos que necesitas en la documentación de Model Studio antes de planificar en torno a un recuento.

El control de instrucciones es el cambio que realmente se manifiesta en el código
De todo lo que incluye el lanzamiento de TTS 3.1, esto es lo que cambia la forma en que escribes tus prompts. La generación 3.0 controlaba la entrega mediante 86 etiquetas en línea —un vocabulario fijo que tenías que aprender, insertar en las posiciones correctas y que hacía exactamente lo que decía y nada más. El nivel 3.1 reemplaza eso con instrucciones en lenguaje natural: describes la emoción, el ritmo, el estilo que quieres, y el modelo lo interpreta.
La diferencia práctica es la expresividad frente a la previsibilidad. Un vocabulario de etiquetas es un contrato: la misma etiqueta produce la misma interpretación cada vez, que es lo que se quiere en un pipeline de producción donde una voz tiene que ser consistente en diez mil clips. La instrucción libre es más amplia pero más laxa, y hereda el problema habitual de sensibilidad al prompt: dos formulaciones de «cálido pero no sentimental» no llegarán de forma idéntica, y tampoco lo harán dos llamadas de la misma formulación en días distintos.
Si tu pipeline actual se basa en esas 86 etiquetas, la actualización no es gratuita. Estás cambiando una superficie de control determinista por una probabilista, y el trabajo de portar no es la llamada a la API — es volver a validar cada plantilla de prompt que posees contra la interpretación del nuevo modelo. Presupuesta eso antes de presupuestar los ahorros.
Transferencia de timbre entre idiomas, y para qué sirve realmente
Una voz de referencia única, que se mantiene en mandarín, cantonés, inglés y japonés, y conserva su identidad a medida que cambia el idioma. Sobre el papel, esto se lee como una viñeta de características. En la práctica, resuelve un problema específico y costoso: un único presentador que tiene que existir en más de un idioma sin sonar como una persona distinta en cada uno.
La solución tradicional es contratar a un actor de voz distinto para cada idioma y aceptar que tu voz de marca ahora son cuatro voces que comparten un guion. La alternativa ha sido clonar a un solo hablante en cada idioma, que es exactamente el flujo de trabajo en el que las voces clonadas tienden a desviarse: el acento se arrastra, el timbre se adelgaza y los oyentes lo notan en cuestión de una frase. La transferencia de timbre entre idiomas es la afirmación de que ninguno de esos compromisos es necesario.
También está, ahora mismo, completamente sin verificar. No hay ninguna prueba de escucha de terceros sobre Qwen-Audio-3.1-TTS en ningún idioma, y las propias demos de Alibaba son la única evidencia de que la transferencia se mantiene. Si esta capacidad es la razón por la que estás considerando la actualización, pruébala con tu propio audio de referencia antes de comprometerte; ese es un experimento de cinco minutos y es el único que responde a la pregunta.
Lo que el recorte de precios le hace a una ley 3.0
Alibaba recortó los precios de voz en toda su gama: la síntesis alrededor de un 70%, el tiempo real alrededor de un 85% y el reconocimiento hasta un 95%. El ajuste entró en vigor en Alibaba Cloud Model Studio el 22 de septiembre de 2026 a las 00:00, hora de Pekín, abarca las regiones de Pekín y Singapur, y se aplica a los endpoints de TTS 3.1 y de tiempo real 3.0. Tras el ajuste, el nivel Flash de TTS tiene un precio de lista de 1,5 yuanes por millón de tokens de entrada y 12 yuanes por millón de tokens de salida; el nivel Flash de tiempo real tiene un precio de lista de 1,5 para la entrada de texto, 6 para la entrada de audio, 4,5 para la salida de texto y 12 para la salida combinada de texto y audio, por millón de tokens.
Esta es la parte que importa si ya estás ejecutando 3.0-TTS. El nivel 3.0 Plus se situaba cerca de $27.60 por millón de caracteres en Artificial Analysis durante agosto, con el nivel Flash cerca de $15. Si la reducción del ~70 % se aplica al nivel que usas, tu factura para la misma carga de trabajo cae a aproximadamente un tercio de lo que era — sin que tengas que cambiar una línea de código. Eso es lo inusual de este lanzamiento: para un cliente de 3.0, la reducción de precio vale más que la actualización del modelo, y llega tanto si migras como si no.
Dos advertencias que conviene tener en cuenta. Los recortes porcentuales se citan respecto a tarifas que difieren según la región y el nivel, por lo que el 70 % del titular no es una promesa sobre tu tráfico específico. Y Alibaba Cloud cambió la facturación de la transcripción en tiempo real en el nodo de Singapur de una tarificación por duración a una tarificación por tokens —0,93 $ por millón de tokens de entrada y 0,70 $ por millón de tokens de salida—, lo que constituye una base menos predecible cuando el silencio, el ruido y el contexto multiturno aumentan el consumo de tokens. Contrasta la nueva tarifa con tu propio audio, no con el comunicado de prensa.
Dónde Qwen-Audio-3.0-TTS sigue siendo la elección correcta
Tres casos, y no son casos límite.
Cuando necesitas un número que puedas defender. Qwen-Audio-3.0-TTS-Plus tiene un Elo independiente de 1.238, procedente de una arena de escucha a ciegas con miles de votos detrás. El mismo ranking registra 1.259 para ese modelo en septiembre, todavía en segundo lugar, así que la puntuación se ha desplazado al alza en lugar de decaer. Qwen-Audio-3.1-TTS no tiene ninguna puntuación de arena. Si tu proceso de aprobación requiere evidencia de terceros, el modelo más antiguo es el que la tiene, y un recorte de precio no cambia eso.

Cuando el determinismo supera a la expresividad.Si tu pipeline de producción se basa en la superficie de control de 86 etiquetas, tienes un sistema sobre cuyo resultado puedes razonar. El control basado en instrucciones es más capaz y menos predecible, y el costo de migración es real.
Cuando nada en la actualización afecta tu carga de trabajo. Si sintetizas mandarín e inglés a volumen moderado con una voz de referencia limpia y un conjunto fijo de etiquetas de locución, entonces la transferencia de timbre entre idiomas, la robustez ante entradas ruidosas y siete idiomas adicionales están resolviendo problemas que tú no tienes. Acepta la rebaja de precio y quédate con el modelo.
Ejecutar ambos sin ejecutar dos integraciones
La parte incómoda de un cambio de una generación a otra es que a menudo quieres que ambos modelos estén activos a la vez —3.0 para la ruta de producción con la puntuación detrás, 3.1 para los nuevos idiomas y la función de transferencia, y una forma de mover el tráfico entre ellos sin volver a desplegar. Ambos son API alojadas cerradas en Alibaba Cloud Model Studio, así que eso son dos endpoints, dos límites de velocidad y dos modos de fallo detrás de una sola funcionalidad.
Una nota honesta sobre nuestra posición: OrcaRouter no enruta Qwen-Audio-3.1-TTS ni ningún modelo Qwen-Audio, y no enrutamos los endpoints de voz de Alibaba en absoluto. Lo que ofrecemos es la capa de inferencia de texto en torno a un pipeline como este — una única clave de API para más de 200 modelos con un 0% de recargo, el precio de lista del proveedor se transmite directamente, por lo que una reducción de precio de un proveedor llega a nuestro lado el mismo día en lugar de después de un ciclo de reajuste de precios. Si el servicio que impulsa tu pipeline de voz es un generador de guiones, un resumidor o un planificador de contenido, eso significa un solo contrato en lugar de varios, conmutación por error automática cuando un servicio upstream se degrada, y un DSL de enrutamiento para componer modelos en una sola llamada. No significa que llames a la voz de Qwen a través de nosotros, y cualquier página que sugiera lo contrario se equivoca sobre nuestro propio catálogo.
El resumen honesto
Qwen-Audio-3.1-TTS es una verdadera mejora con tres añadidos que importan —control de la locución basado en instrucciones, transferencia de timbre entre idiomas y robustez ante audios de referencia deficientes—, además de una reducción de precio que vale más que cualquiera de ellos. Qwen-Audio-3.0-TTS no queda superado del modo en que normalmente lo estaría un modelo de hace dos meses: todavía mantiene una puntuación de referencia independiente que su sucesor no ha obtenido, y aún cubre la variedad de dialectos chinos en la que se basa buena parte de la diferenciación de esta familia.
Así que la decisión es más limitada de lo que sugiere el marketing. Si generas a gran escala, el cambio de precios ya te corresponde. Si necesitas los nuevos idiomas o la transferencia de timbre, migra y valida la función con tu propio audio primero. Si necesitas una cifra de calidad defendible, espera hasta que Qwen-Audio-3.1-TTS aparezca en una arena de escucha a ciegas — ese es el único evento que zanjaría esto, y hasta que ocurra, la postura honesta es que el modelo más nuevo es el más barato y el modelo más antiguo es el que está probado.
