
Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: Dos mitades de un stack de voz, con precios revisados con ocho días de diferencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Gemini 3.8 Live es el modelo de voz a voz de Google, lanzado el 15 de septiembre de 2026 como gemini-3.8-live y gemini-3.8-live-extended-thinking en la Live API. Qwen-Audio-3.1-TTS es el modelo de texto a voz de Alibaba, anunciado en la Conferencia Apsara de Hangzhou el 23 de septiembre de 2026, ocho días después, con una rebaja de precio de aproximadamente el 70 % en la síntesis de voz asociada. Esa diferencia de ocho días es la razón por la que merece la pena leer esta comparación ahora y no en julio. Nada cambió en el papel de los dos productos —uno escucha y habla, el otro lee texto en voz alta—, pero ambas mitades de una canalización de voz en producción se reconstruyeron o se reajustaron de precio en una sola quincena, y la aritmética que antes resolvía este enfrentamiento se desplazó sin hacer ruido.
Dos mitades, actualizadas con ocho días de diferencia
Empieza por lo que hace que este emparejamiento sea inusual: los dos modelos no compiten. Un producto de voz tiene una boca y tiene un oído, y estos son uno de cada uno. Gemini 3.8 Live cierra el bucle: audio y vídeo de entrada, audio de salida, interrupciones gestionadas, llamadas a herramientas ejecutándose por debajo de la conversación. Qwen-Audio-3.1-TTS toma una cadena y una voz de referencia y devuelve una interpretación. Es mejor boca que cualquier otra cosa, y no intenta ser un oído.
Lo que hace interesante el momento de septiembre es que los dos anuncios apuntan a extremos opuestos de la misma partida presupuestaria. El lanzamiento de Google del 15 de septiembre fue una historia de capacidades sin ningún movimiento de precios asociado; el anuncio de Alibaba del 23 de septiembre fue principalmente una historia de márgenes, con nuevas capacidades incluidas. Un equipo que construyó un pipeline híbrido en agosto ha recibido, en el lapso de ocho días, una razón para reexaminar ambas partes — y solo una de esas partes se abarató.
Qué cambió realmente la versión 3.1 en el lado de Qwen
Alibaba no lanzó un solo modelo el 23 de septiembre. La generación 3.1 cubre cinco endpoints —Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next y Qwen-Audio-3.1-Realtime— y solo uno de ellos, el nivel TTS básico, sirve como reemplazo directo para quien ya invoca el modelo TTS 3.0.
En ese nivel, cambiaron tres cosas y una de ellas es un costo de migración real. El control de la locución pasó de un vocabulario fijo de 86 etiquetas en línea a instrucciones en lenguaje natural: describes la emoción, el ritmo y el estilo que quieres en lugar de insertar el corchete correcto en la posición correcta. Llegó la transferencia de timbre entre idiomas, que permite que una voz de referencia conserve su identidad en mandarín, cantonés, inglés y japonés. Y el modelo ahora tolera directamente audio de referencia con ruido o eco, sin un paso separado de reducción de ruido. La cobertura de idiomas sigue sin cambios: 16 idiomas reportados por el proveedor más 20 regiones de dialectos chinos; y —vale la pena señalarlo porque en otros lugares se pasa por alto— el propio material de Alibaba dice que el nivel 3.1 añade siete idiomas, lo cual no concuerda con los 16 que enumeraba la cobertura publicada de la generación de julio. Trata ambas cifras como reportadas por el proveedor hasta que verifiques los idiomas específicos que necesitas en Model Studio.
El producto genuinamente nuevo de este lanzamiento es Qwen-Audio-3.1-TTS-Next, que Alibaba llama un modelo «Audiogen»: una sola pasada que produce voz, efectos de sonido y ambiente de fondo juntos, para diálogos con varios hablantes, montaje de pódcast y trabajo de escenas. Tiene un precio de $0.848 por millón de tokens de entrada y $1.696 por millón de tokens de salida en el nodo de Pekín, con un límite de 3000 caracteres de entrada, 240 segundos de audio generado para pódcast y 120 segundos en los demás casos, tres solicitudes por segundo, y acepta hasta tres clips de referencia de 30 segundos cada uno. Solo admite chino e inglés. Si tu flujo de trabajo es un solo narrador leyendo un guion, ese producto es irrelevante para ti; si son dos presentadores y una base musical, es la razón para siquiera mirar este lanzamiento.
La costura es lo que realmente estás eligiendo
Como los dos modelos no hacen el mismo trabajo, la decisión no es una comparativa. Es una cuestión de dónde sitúas el traspaso, y de cuánto estás dispuesto a pagar para que la costura sea invisible.
Hay dos arquitecturas honestas. La primera es una sola red: Gemini 3.8 Live se encarga de todo el turno, escucha a quien llama, decide qué decir y lo dice, y aceptas la voz que te da, la cual no puedes clonar ni darle tu marca. La segunda es una cascada: reconocimiento, luego razonamiento, luego Qwen-Audio-3.1-TTS como la boca, que te da mil voces, incluida una grabada por tu propio talento, a costa de la latencia entre dos o tres límites de proveedores y la prosodia que se pierde cuando una frase se divide en una llamada a la API.
La mayoría de los equipos terminan con ambos, y eso no es una falta de nervio. Usa el modelo en tiempo real donde la latencia se siente —la interrupción, el reconocimiento, el “mm-hm” que le dice a quien llama que sigues ahí— y el modelo de síntesis donde se oye la calidad: la lectura extensa de una política, el número de confirmación leído a un ritmo deliberado, la voz de marca que tiene que ser idéntica en cada llamada. El híbrido es la respuesta correcta para una gran clase de productos. También es donde el modelo de costos se complica, porque ahora estás midiendo dos unidades diferentes.

Con precio por hora de audio, que es la única unidad en la que ambos encajan.
Google factura la API Live por minuto; Alibaba factura los niveles de Qwen TTS por carácter y por token. Para compararlos hay que elegir un normalizador, y el único defendible para la voz es la hora de audio finalizado.
• Medición de entrada — Gemini 3.8 Live por minuto de audio, $0.005 de entrada y $0.018 de salida frente a Qwen-Audio-3.1-TTS por millón de caracteres, con el nivel 3.0 Plus situándose cerca de $27.60 y el nivel Flash cerca de $15 antes del recorte, y el nivel Flash de TTS cotizando a 1.5 yuanes por millón de tokens de entrada y 12 yuanes por millón de tokens de salida después de este
• Medición de salida — Una conversación bidireccional de Gemini 3.8 Live cuesta alrededor de $1.38 por una hora de conversación real a precio de lista, antes de cualquier caché, frente a Qwen-Audio-3.1-TTS, un flujo unidireccional, con el nivel 3.1-Next a $0.848 por millón de tokens de entrada y $1.696 por millón de salida en el nodo de Pekín
• Escucha a quien llama — Gemini 3.8 Live sí, entrada nativa de audio y video frente a Qwen-Audio-3.1-TTS no, texto de entrada y audio de salida
• Voces — Gemini 3.8 Live una voz, no clonable, no personalizable con marca frente a Qwen-Audio-3.1-TTS más de mil con clonación zero-shot a partir de audio de referencia con ruido
• Idiomas — Gemini 3.8 Live 97 según el proveedor, con cambio a mitad de la conversación frente a Qwen-Audio-3.1-TTS 16 según el proveedor más 20 regiones de dialectos chinos, con transferencia de timbre entre mandarín, cantonés, inglés y japonés
• Control de la locución — Gemini 3.8 Live prompt y contexto de la conversación frente a Qwen-Audio-3.1-TTS, instrucción en lenguaje natural, en sustitución de las 86 etiquetas en línea de la generación 3.0
• Puntuación independiente — Gemini 3.8 Live 82.6 en el Artificial Analysis Speech to Speech Index para la variante Extended Thinking y 76.0 para la estándar frente a Qwen-Audio-3.1-TTS, ninguna; el número de Qwen más cercano es 1,259 Elo para el nivel 3.0 Plus de la generación anterior en el Provider Voice Arena, que es una puntuación del predecesor y no de este modelo
El recorte porcentual se cotiza frente a tarifas que varían según la región y el nivel, así que el 70 % del titular no es una promesa sobre tu tráfico; además, Alibaba Cloud también pasó la transcripción en tiempo real del nodo de Singapur de una medición por duración a una por tokens —una base menos predecible, ya que tanto el silencio como el contexto multiturno inflan el consumo de tokens—. Compara la nueva tabla de tarifas con tu propio audio.

Lo que no resuelve la actualización 3.1
Esta es la parte en la que es fácil equivocarse en ambos sentidos. Las mejoras de 3.1 no convierten a Qwen-Audio-3.1-TTS en un candidato para la tarea que desempeña Gemini 3.8 Live: el control basado en instrucciones, la transferencia de timbre y la tolerancia a entradas ruidosas lo convierten en una mejor boca, y ninguna de estas cosas le da un oído. Del mismo modo, la posición de Gemini 3.8 Live en los benchmarks no te dice nada sobre si tu voz de marca sobrevive a una frase en cantonés.
También hay un hueco en la evidencia que una rebaja de precio vuelve más tentador ignorar. Qwen-Audio-3.1-TTS no tiene una puntuación independiente. Los 1.259 Elo que aparecen junto al nombre de Qwen en Provider Voice Arena pertenecen a Qwen-Audio-3.0-TTS-Plus, el modelo que está siendo reemplazado, medidos en 1.447 muestras. La propia fila del sucesor en la Arena aún no existe. Si tu proceso de aprobación requiere una cifra de terceros —y para una voz de marca probablemente debería—, el modelo más nuevo es el que no la tiene, y el nivel más económico es el que aún no puedes defender. El único evento que zanjaría esto es que Qwen-Audio-3.1-TTS aparezca en un panel de escucha a ciegas.
Dónde ayuda una clave y dónde no
Una consecuencia de la versión 3.1 es fácil de pasar por alto porque parece un detalle de ingeniería de prompts y no de infraestructura. Reemplazar 86 etiquetas codificadas de forma fija por instrucciones de forma libre convierte tus indicaciones de entrega en artefactos de texto. Ahora las generas, las versionas y vuelves a validar cada una de ellas frente a la interpretación del nuevo modelo — y el modo de fallo es la deriva, no un error, porque dos formas de decir «cálido pero no sentimental» no darán el mismo resultado.
Eso es un problema de inferencia de texto envuelto alrededor de una canalización de voz, y es donde somos útiles. OrcaRouter no enruta Qwen-Audio-3.1-TTS ni ningún modelo Qwen-Audio, y tampoco enrutamos los endpoints Gemini 3.8 Live; ninguna de las dos mitades de esta pila se puede invocar a través de nosotros, y nada de esto debe interpretarse como una afirmación de que sí se puede. Lo que sí ofrecemos es la capa que escribe y verifica el texto de dirección: qwen/qwen3.8-flash y google/gemini-3.8-flash entre más de 200 modelos desde una única clave al precio de lista del proveedor sin margen, con un DSL de enrutamiento que compone varios modelos en una sola llamada y conmutación por error automática cuando un upstream se degrada. Cuando estás a punto de volver a validar diez mil prompts de entrega contra un modelo que acaba de cambiar cómo los lee, generar las variantes y puntuarlas por consistencia es la parte que debería ser un solo contrato, no cuatro.
Qué medir antes de elegir
Tres experimentos responden más que cualquier junta directiva. Pasa una voz de referencia y un párrafo de tu propio guion por Qwen-Audio-3.1-TTS y escucha si el control basado en instrucciones te da la misma locución dos veces: ese es el riesgo de migración, y medirlo es más barato que planificar en torno a ello. Pasa una grabación real de una llamada con tu propio ruido de fondo por Gemini 3.8 Live y comprueba si la toma de turnos se mantiene cuando quien llama interrumpe a mitad de palabra: eso es lo que el índice de voz a voz intenta cuantificar, y no sobrevive al contacto con una línea telefónica real de forma lo bastante fiable como para confiar en ello sin más. Y haz las cuentas con tu propio volumen en horas de audio en lugar de en las unidades en las que facturan los dos proveedores, porque en este emparejamiento en particular la diferencia de precio esperada entre el «TTS chino barato» y el «buque insignia de Google» nunca fue tan grande como parece, y después del 23 de septiembre es aún menor.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
