Tarjeta de título principal para 'GPT-Live-1 vs Qwen-Audio-3.0-TTS', con el subtítulo 'Uno mantiene una conversación; el otro interpreta un guion', con una insignia que dice 'No son sustitutos: trabajos distintos, facturas distintas' y tres tarjetas: 'Qwen-Audio-3.0-TTS Plus — Elo 1,232, cuarto en el AA Provider Voice Arena, $27.6 por 1M de caracteres', 'GPT-Live-1 — $0.05 por minuto de voz, dúplex completo, $3.00 por hora de línea abierta' y 'El detalle — aproximadamente 16 caracteres por segundo del lado del narrador, texto de entrada y audio de salida', sobre una franja de pie de página que dice 'Cifras de Qwen según Artificial Analysis; cifras de GPT-Live-1 reportadas por OpenAI'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

GPT-Live-1 vs Qwen-Audio-3.0-TTS: Una conversación y un narrador no son la misma partida

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

Si se ponen GPT-Live-1 y Qwen-Audio-3.0-TTS uno al lado del otro en cuanto al precio por hora de audio, la diferencia parece decisiva: Qwen-Audio-3.0-TTS-Plus, de Aliba​ba, genera voz a $27,6 por millón de caracteres, aproximadamente $1,66 de audio por hora, mientras que GPT-Live-1, de Ope​nAI, cobra $3,00 por una hora de línea abierta continua. El narrador es más barato, así que el narrador gana — excepto que esta es la comparación equivocada, y la razón por la que es equivocada es lo más útil que cualquiera puede sacar de este enfrentamiento. Qwen-Audio-3.0-TTS es un modelo de texto a voz. GPT-Live-1 es un modelo conversacional full-duplex. Uno de ellos lee lo que escribiste. El otro tiene que decidir, varias veces por segundo, si ya terminaste de hablar.

Uno renderiza, otro conversa

La conversión de texto a voz toma texto y devuelve audio. No hay audio de entrada, no hay turno que tomar, no existe la noción de ser interrumpido y no hay transcripción que devolver, porque el modelo nunca escuchó nada. Su modelo de costes es una imprenta: páginas de entrada, audio de salida; la calidad y el rendimiento son los dos únicos números que importan, y puedes medir ambos antes de lanzar.

Un modelo conversacional de dúplex completo procesa el audio entrante mientras genera audio saliente. Su trabajo incluye las partes de una conversación que no tienen nada que ver con las palabras: hacer una pausa cuando el usuario hace una pausa, continuar a través de una señal de acompañamiento como «sí» en lugar de tratarla como una interrupción, ceder el turno a mitad de frase y lanzar una llamada a herramienta sin perder el hilo. GPT-Live-1 hace todo eso y devuelve transcripciones de reconocimiento de voz junto con la sesión, algo que solo puede hacer porque estuvo escuchando todo el tiempo.

Si tu producto lee artículos en voz alta, convierte documentación en audio o narra un video, GPT-Live-1 es la herramienta equivocada a cuatro veces el precio por hora. Si tu producto atiende una llamada telefónica, Qwen-Audio-3.0-TTS es un tercio de una canalización que todavía necesita un modelo ASR y un modelo de lenguaje para convertirse en una conversación.

Donde Qwen-Audio-3.0-TTS es genuinamente la mejor respuesta

El argumento a favor del modelo de Aliba​ba no es marketing. Lanzado el 20 de julio de 2026 por Tongyi Lab de Aliba​ba y ofrecido como una API cerrada y alojada a través de Aliba​ba Cloud Model Studio, el nivel Plus ocupó el primer puesto en la arena de texto a voz de Artificial Analysis cuando llegó. Sin embargo, una tabla de clasificación es un blanco móvil, y esta se ha movido: a septiembre de 2026, Qwen-Audio-3.0-TTS-Plus ocupa el cuarto puesto en la Provider Voice Arena con un Elo de 1.232 en 2.306 muestras, por detrás de Cartesia Sonic 3.6 con 1.275, Inworld Realtime TTS-2 con 1.244 y Simba 3.2 de Speechify con 1.233 — tres modelos de agosto y julio que se lanzaron después. Cuarto de más de veinte, con el liderato perdido y la ventaja de precio intacta, sigue siendo una posición fuerte. Simplemente no es la posición que describió la cobertura del lanzamiento.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

Lidera en 10 de los 16 idiomas que cubre, añade 20 regiones de dialectos del chino, admite la clonación de voz a partir de muestras cortas, incluida la clonación entre idiomas, y cuenta con 86 etiquetas integradas de emoción y estilo de locución.

Las advertencias son lo suficientemente específicas como para planificar en torno a ellas.

• Rendimiento — Plus genera aproximadamente 16 caracteres por segundo, frente a 30,2 de Simba 3.2, 27 de Gemini 3.1 Flash TTS y alrededor de 120 de Sonic 3.5. Para el renderizado por lotes, esto es invisible; para un producto en vivo, es el número que decide tu búfer.

• Documentación de precios — el ampliamente citado $27.6 por millón de caracteres no coincide con la propia página de precios de Aliba​ba en todas las instantáneas, que en ciertos momentos ha listado cifras más bajas para ambos niveles. Comprueba la cifra actual a nivel de cuenta antes de hacer tu previsión, no la de la tabla de clasificación.

• Biblioteca de voces — a pesar de los 16 idiomas compatibles, las voces predefinidas públicas son casi en su totalidad en chino e inglés. Los otros catorce idiomas existen a través del flujo de trabajo de clonación en lugar de estar disponibles de forma predefinida.

• Restricción de funcionalidades — las 86 etiquetas de emoción en línea solo funcionan en modo de transmisión unidireccional, por lo que el control expresivo no se mantiene en todas las rutas de integración.

• Niveles — Flash apunta a aproximadamente 300 ms de latencia del primer paquete para uso en tiempo real; Plus es el nivel de calidad. Son productos diferentes con el mismo nombre, y elegir el equivocado es un error común al principio.

La versión honesta del proyecto de ley de cascada

Esto es lo que omite la comparación por hora. Un producto conversacional construido sobre un modelo de TTS es una cascada: un modelo de ASR convierte el habla de quien llama en texto, un modelo de lenguaje decide qué decir y el modelo de TTS lo pronuncia. Tres proveedores, tres facturas, tres presupuestos de latencia que se suman, y un traspaso en cada límite donde muere la prosodia. El tramo de TTS puede costar $1.66 por hora de audio. Los otros dos tramos son donde están realmente el dinero y los errores —y el modelo en cascada no puede oír una pausa en medio de una frase que ya está pronunciando.

GPT-Live-1 colapsa las tres patas en una sola sesión y un solo medidor, a $0.05 por minuto de voz, con el backend de razonamiento facturado por separado. Dos detalles mantienen esa factura honesta. La inicialización de sesión factura 15 segundos de voz por adelantado, que se acreditan a la duración posterior en lugar de sumarse a ella. Y el backend es un segundo medidor: cada llamada de razonamiento delegada, cada invocación de herramienta y cada búsqueda web se factura a las tarifas normales de ese modelo, por lo que apuntar la delegación a un razonador de frontera que busca en cada turno produce una llamada costosa detrás de una capa de voz barata.

Lo que los rankings independientes dicen sobre ambos es instructivo, precisamente porque miden cosas distintas y ninguno favorece a su propio sujeto. Qwen-Audio-3.0-TTS-Plus es cuarto en calidad y está cerca del fondo en rendimiento. GPT-Live-1 es séptimo de once en el Speech to Speech Index de Artificial Analysis, con un 69,8 % —por detrás del GPT-Realtime-2.1 al que reemplaza, con un 73,9 %—, mientras que se le cobra en el extremo más bajo del rango de coste por hora de audio de entrada del índice: 4,42 $ frente a los 10,75 $ de GPT-Realtime-2.1. Ninguno de los dos modelos se lleva el primer puesto de su propia categoría. Ambos son más baratos que aquello que fueron creados para superar.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

Ese segundo medidor es donde una capa de enrutamiento se convierte en una decisión de diseño en lugar de una optimización. OrcaRouter no incluye ni GPT-Live-1 ni Qwen-Audio-3.0-TTS — la capa de voz en ambos casos está fuera de nuestro alcance, y no enrutamos nada de ella. La pata de razonamiento no lo está. Aproximadamente 190 modelos de once proveedores upstream se encuentran detrás de una sola clave al precio de lista del proveedor sin margen de ganancia, y una reducción de precio de un proveedor llega el mismo día en lugar de en la siguiente renovación de contrato. Para una cascada, eso cubre la pata intermedia de lleno: mantén dos opciones de ASR y tres motores de razonamiento detrás de un solo endpoint, compáralos entre sí con A/B sobre tráfico real, y deja que la conmutación por error automática absorba una tarde mala de un upstream sin perder una llamada.

La clonación de voz es la capacidad comercialmente más útil de Qwen-Audio-3.0-TTS y su mayor superficie de cumplimiento. Diez segundos de audio de referencia bastan para reproducir a un hablante, de forma interlingüe, lo cual es transformador para la localización y una fuente de responsabilidad en cualquier ámbito donde la identidad importe. Ope​nAI lanzó GPT-Live-1 sin clonación y sin voces personalizadas en absoluto — 12 voces de API entre las que elegir, y esa es la lista.

Esa asimetría es fácil de pasar por alto en una comparación de funciones y difícil de pasar por alto en una revisión de riesgos. Un producto que solo habla con una de doce voces de proveedores tiene una respuesta mucho más breve para "de quién es esa voz y quién dio su consentimiento para usarla" que un producto que puede reproducir cualquier voz a partir de una muestra. Si necesitas clonación, la decisión sobre el pipeline ya está tomada por ti, y la pregunta pasa a ser qué lo rige. Si no la necesitas, la limitación de GPT-Live-1 vale la pena leerla como un control que no tuviste que construir.

¿Cuál comprar?

Compra Qwen-Audio-3.0-TTS si el resultado es contenido: narración, localización, audio de accesibilidad, doblaje o cualquier flujo de trabajo donde el texto exista antes que el audio y la calidad por hora renderizada sea la métrica. Empieza en Flash si necesitas reproducción en tiempo real, pasa a Plus cuando la voz en sí sea el entregable y establece el precio del flujo de trabajo de clonación por separado de las voces predefinidas.

Compra GPT-Live-1 si la entrada es una persona. Líneas de atención, flujos de reservas, entrevistas de admisión, cualquier cosa en la que la primera sílaba del usuario llegue mientras el modelo está a mitad de frase y el sistema tenga que comportarse como un oyente en lugar de un reproductor. Cuesta más por hora de audio y es el único de los dos que puede ser interrumpido.

Los dos son complementos mucho más a menudo que rivales: muchos productos quieren que Qwen-Audio-3.0-TTS lea un documento y que un modelo dúplex gestione la llamada que sigue. Lo que no deberían compartir es un modelo de costos. La métrica por hora de audio es la correcta para exactamente uno de ellos.