
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: Uno de estos tiene una puntuación de Arena, y no es el nuevo
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Aquí está toda la comparación en una sola línea. Qwen-Audio-3.0-TTSse sitúa en la Text-to-Speech Arena con un Elo de 1,234 para su nivel Plus — una puntuación obtenida a lo largo de 2,502 votos de escucha a ciegas. StepAudio 3 TTS, lanzado por StepFun el 15 de septiembre de 2026, no aparece en esa tabla en absoluto. Su predecesor sí: StepAudio 2.5 TTS tiene un Elo de 1,209 con 1,306 votos.
Entonces, la pregunta honesta no es «cuál suena mejor». Es si una diferencia de 25 puntos de Elo, medida en la generación anterior, sobrevive a un lanzamiento del que StepFun dice que mejoró la prosodia y redujo el precio en más de la mitad. Nadie ha llevado a cabo todavía esa votación, y todo lo que sigue está organizado en torno a ese hueco en la evidencia en lugar de fingir que no existe.
El consejo, tal como realmente se lee hoy
Vale la pena ver las posiciones reales, porque varios artículos que circulan citan una versión desactualizada de ellas. La arena de escucha a ciegas clasifica los modelos de síntesis según qué muestra prefirieron los votantes. Lee a lo largo de la parte superior del tablero de voces de proveedores:
• Cartesia Sonic 3.6 — Elo 1.277, agosto de 2026, 49,0 $ por millón de caracteres
• Inworld Realtime TTS-2 — Elo 1.243, agosto de 2026, $20,8 por millón de caracteres
• SpeechifyAI Simba 3.2 — Elo 1.238, julio de 2026, $6,6 por millón de caracteres
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1.234, julio de 2026, $27,6 por millón de caracteres, 8 voces de la arena
• VUI Labs Luna TTS — Elo 1.229, junio de 2026, $80,0 por millón de caracteres
• Inworld Realtime TTS-2 Flash — Elo 1,213, agosto de 2026, $10.4 por millón de caracteres
• StepFun StepAudio 2.5 TTS — Elo 1,209, agosto de 2026, $85.0 por millón de caracteres, 8 voces de arena
• Google Gemini 3.1 Flash TTS — Elo 1.204, abril de 2026, $18,3 por millón de caracteres

Dos cosas se desprenden de inmediato de esa lista. La primera es que el nivel Plus de Qwen no es el líder —es el cuarto, por detrás de Cartesia, Inworld y Speechify—, y la cifra de 1.234 que se cita como una corona es una puntuación de media tabla en una clasificación que ha cambiado desde entonces. La segunda es que StepAudio 2.5 TTS se volvió a evaluar en agosto de 2026 y quedó en séptimo lugar, 25 puntos Elo por detrás de Qwen, a más del triple del precio.
Y una tercera cosa que importa más que ninguna de las anteriores: mira los intervalos de confianza. El nivel Plus de Qwen figura con −14/+14 en 2.502 muestras. StepAudio 2.5 TTS figura con −16/+16 en 1.306. Esos intervalos se superponen. Una diferencia de 25 puntos entre dos modelos cuyas barras de error abarcan 14 y 16 puntos en cualquier dirección no es una diferencia de calidad demostrada — son dos modelos que la arena no puede separar actualmente, clasificados en un orden que unos cientos de votos más podrían invertir.

Lo que te cuesta el punto de datos faltante
StepAudio 3 TTS es el modelo con el que StepFun sustituyó a StepAudio 2.5 TTS, y el lanzamiento afirma el control sobre el timbre, la entonación, el ritmo y las pausas respiratorias, además del comportamiento paralingüístico —risas, vacilación, tartamudeo, repetición, autocorrección—, ofrecido mediante una arquitectura de streaming en la que la generación y la reproducción se solapan.
Ese es exactamente el conjunto de cualidades que mide la arena. También es exactamente por lo que la ausencia de una puntuación es frustrante en lugar de fatal: el benchmark que respondería a la pregunta existe, se ejecuta públicamente y simplemente no se ha vuelto a ejecutar desde que se lanzó el nuevo modelo. Cualquiera que te diga que StepAudio 3 TTS suena mejor que Qwen-Audio-3.0-TTS está extrapolando de un predecesor que perdió por un margen dentro de sus propias barras de error.
El precio es la parte que está totalmente documentada, y se movió mucho.
StepAudio 3 TTS cobra 2,5 yuanes por cada 10.000 caracteres en la propia plataforma de StepFun. StepAudio 2.5 TTS cobraba 5,8. En la propia columna de precios basada en caracteres de la arena, el modelo anterior costaba $85.00 por millón de caracteres; 2,5 yuanes por cada 10.000 caracteres equivalen a aproximadamente $35 por millón con los tipos de cambio recientes —una conversión que es nuestra y no una cifra publicada, y que conviene rehacer con tu propia región y tipo de cambio. Eso supone una reducción de casi el 60 % en la misma partida.
Sigue estando por encima de Qwen. Qwen-Audio-3.0-TTS-Plus figura a $27,6 por millón de caracteres, y el nivel Flash es aún más barato, ya que Alibaba Cloud Model Studio factura la síntesis por carácter de entrada en lugar de por audio producido: la salida no se cobra por separado. Las plataformas de terceros que incluyen el nivel Flash cotizan tarifas de entre 17 y 19 dólares por millón, aunque la variación regional hace que no se pueda confiar en ninguna cifra única que se presente como titular.
Así que la forma de esto es: StepFun redujo aproximadamente a la mitad el costo de síntesis, cerró la mayor parte de la distancia con Qwen y no la cruzó. Si el precio por carácter es tu restricción vinculante, el argumento se estrecha, pero la respuesta no cambia. Si no lo es, el precio dejó de ser la razón para elegir cualquiera de los dos modelos.
El inventario de voces y la cobertura de idiomas no están cerca
Aquí es donde la comparación deja de ser una cuestión de criterio y pasa a ser una cuestión de especificación.
• Inventario de voces — Qwen-Audio-3.0-TTS con más de 1,000 voces en sus distintos niveles frente a StepAudio 3 TTS, sin un recuento publicado comparable
• Idiomas — Qwen-Audio-3.0-TTS: 16 idiomas más 20 dialectos chinos, con el nivel Flash optimizado para lenguas de bajos recursos y autenticidad dialectal, frente a StepAudio 3 TTS, centrado en el chino, sin una afirmación de cobertura equivalente
• Tamaño de la solicitud — Qwen-Audio-3.0-TTS 20.000 caracteres por solicitud vs StepAudio 3 TTS no publicado
• Latencia — Qwen-Audio-3.0-TTS Flash apunta a una latencia del primer paquete de menos de 200 ms según la propia documentación de Alibaba, frente al streaming de StepAudio 3 TTS, del que no se ha publicado cifra alguna
• Niveles — Qwen-Audio-3.0-TTS Plus para la expresividad y Flash para tiempo real, seis voces insignia fijadas a uno u otro nivel frente a StepAudio 3 TTS, un solo nivel
• Superficie de control — indicaciones de entrega en lenguaje natural de Qwen-Audio-3.0-TTS más etiquetas de expresión en línea como [excited], [laughing], [whispers] incrustadas en el texto de entrada frente a la prosodia inferida por el modelo StepAudio 3 TTS a partir del contexto
• Clonación de voz — StepAudio 3 TTS un precio fijo de 9,9 yuanes por voz clonada en todos sus niveles de TTS frente a la clonación de Qwen-Audio-3.0-TTS a través de Alibaba Cloud Model Studio
• Salida — Qwen-Audio-3.0-TTS: frecuencia de muestreo predeterminada de 24 kHz, frente a StepAudio 3 TTS: no publicada
Esa fila de la superficie de control es la verdadera diferencia de diseño, y no es una cuestión de calidad. Las etiquetas de expresión de Qwen son explícitas y síncronas: escribes la emoción en el texto y el modelo la representa, lo que las hace comprobables y aptas para pruebas de regresión. La descripción de StepFun corresponde a un modelo que infiere del contexto la vacilación o la risa apropiadas, lo que suena mejor cuando acierta y es mucho más difícil de precisar cuando se equivoca. Elige según prefieras crear tú la interpretación o delegarla.

Cómo decidir sin la medición
No puedes llegar razonando a una respuesta a partir de las cifras publicadas, porque la decisiva no existe. Eso deja las pruebas, y probar estas dos tiene una forma concreta que conviene planificar.
Ambas son API comerciales solo alojadas: Qwen-Audio-3.0-TTS a través de Alibaba Cloud Model Studio, y StepAudio 3 TTS a través de la plataforma abierta de StepFun. Ninguna tiene pesos abiertos, así que no hay una vía autoalojada para evaluarlas. Para ser precisos sobre lo que OrcaRouter cubre aquí: los modelos de texto a voz de nuestro catálogo actual son la familia OpenAI tts-1, gpt-4o-mini-tts y las vistas previas de Gemini TTS de Google. Ninguno de los modelos de este artículo está en él, y Qwen-Audio-3.0-TTS tampoco — nada de lo aquí expuesto debe interpretarse como una afirmación de que los servimos.
La parte que sí se ejecuta en OrcaRouter es la mitad de texto del pipeline. Los scripts que lee tu capa de síntesis los genera un modelo de lenguaje, y ese es el componente que cambia con más frecuencia, cuesta más volver a contratar y es más fácil dejar sin fijar —casi 200 modelos de texto detrás de una sola API, conmutación por error automática, un DSL de enrutamiento que compone varios en una sola llamada, y fusión de modelos cuando el criterio de un solo modelo no basta, con el precio de lista del proveedor traspasado sin margen. Si haces una evaluación ciega entre estos dos modelos de síntesis, genera el corpus a través de un único endpoint para que ambos candidatos lean una entrada idéntica, y mantén la capa de síntesis detrás de una interfaz que puedas intercambiar.
En qué situación deja esto a la decisión
Toma Qwen-Audio-3.0-TTS hoy si necesitas amplitud: más de mil voces, 16 idiomas y 20 dialectos, un límite documentado de 20.000 caracteres por solicitud, un nivel de latencia y un nivel de expresividad, un objetivo de 200 ms para el primer paquete y una tarifa inferior a la de StepFun. Es el modelo con una medición que lo respalda y la superficie más amplia, y su Elo de cuarto puesto es un resultado real aunque no sea la corona con la que se lo cita.
Elige StepAudio 3 TTS si estás construyendo con el chino como prioridad, quieres un solo nivel en lugar de tener que decidir entre niveles, quieres clonación por una tarifa fija publicada y estás dispuesto a adoptarlo pronto, aunque sea un modelo que no ha sido probado a ciegas. Estás pagando aproximadamente un 27% más por carácter que el nivel Plus de Qwen a cambio de una generación de mejora de prosodia declarada frente a un modelo que se situaba 25 Elo por detrás con barras de error solapadas.
Lo que lo zanjaría es una nueva ejecución de la arena con StepAudio 3 TTS en el grupo. Hasta que se celebre esa votación, esto es un modelo medido frente a uno no medido, y los 25 puntos que separan a sus predecesores están dentro del ruido — lo cual no es una clasificación, y no debería venderse como tal.
