Una tarjeta principal generada para 'Gemini 3.8 TTS vs Qwen Audio 3.0 TTS' sobre un fondo blanco con suaves acentos de degradado azul y cian. La tarjeta izquierda 'Qwen-Audio-3.0-TTS-Plus' enumera Elo 1,259, 15 voces de arena, 16 idiomas + 20 dialectos y $27.6 por 1M de caracteres; la tarjeta derecha 'Gemini 3.8 Flash TTS' enumera Elo 1,260, 8 voces de arena, 130 idiomas y $33.0 por 1M de caracteres. Una línea de pie de página dice 'Elo según Artificial Analysis Provider Voice Arena, sept. 2026'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Engineering & Research

Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: dos respuestas diferentes a «hacer que suene bien»

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Un punto Elo separa a estos dos modelos en la Artificial Analysis Provider Voice Arena, y llegan ahí resolviendo problemas completamente diferentes. Qwen-Audio-3.0-TTS-Plus está en el puesto 3 con un Elo de 1.259 en 1.447 muestras y 15 voces de la arena, lanzado en septiembre de 2026 y listado a 27,60 $ por millón de caracteres. Gemini 3.8 Flash TTS está en el puesto 2 con 1.260 en 1.999 muestras y 8 voces de la arena, lanzado el 23 de septiembre de 2026 y listado a 33,00 $ por millón de caracteres. Estadísticamente indistinguibles, con una diferencia de veinte por ciento en el precio, y construidos sobre teorías opuestas sobre qué hace que la voz sintética sea buena.

La teoría es la parte interesante. La respuesta de Qwen es control en línea: 86 etiquetas de locución que espolvoreas por el texto para que el modelo sepa dónde respirar, marcar el énfasis y cambiar de registro. La respuesta de Google es una capa de dirección: instrucciones línea por línea, escenificación para dos voces y un pequeño conjunto de señales no verbales. Si ya has construido un pipeline que emite anotaciones tipo SSML, una de estas encajará y la otra no, y esa compatibilidad importa más que un solo punto de Elo.

Dónde se ubican realmente los dos en el tablero

Leer el Provider Voice Arena con honestidad requiere mirar los intervalos, no los rangos.

• Qwen-Audio-3.0-TTS-Plus — puesto 3, Elo 1.259, 1.447 muestras, 15 voces de la arena, septiembre de 2026, $27,6 por 1 millón de caracteres.

• Gemini 3.8 Flash TTS — puesto 2, Elo 1.260, 1.999 muestras, 8 voces de arena, septiembre de 2026, $33,0 por 1 millón de caracteres.

• Cartesia Sonic 3.6 — puesto 1, Elo 1.273, 1.757 muestras, 8 voces de arena, agosto de 2026, $49,0 por 1 millón de caracteres.

Los tres primeros forman una misma franja. Los intervalos publicados de los dos primeros abarcan diecisiete puntos a cada lado, lo que es más ancho que toda la diferencia entre el primero y el tercero, por lo que el orden entre ellos no es evidencia estable. Lo que sí establece la clasificación es que los tres están en el grupo de cabeza y que nada por debajo de ellos está cerca —el puesto 10, Gemini 3.1 Flash TTS, está en 1.199.

La única asimetría que vale la pena señalar es el número de voces en la arena. Qwen presenta 15 voces frente a las 8 de Gemini, por lo que la puntuación de Qwen es un promedio sobre una muestra más amplia del propio producto del proveedor. Eso tiene un doble filo: es una estimación más justa de cómo suena el catálogo de Qwen en general, y le da a Qwen más oportunidades de presentar una voz débil que arrastre el promedio hacia abajo. Ninguna de las dos lecturas cambia la conclusión de que los dos están empatados.

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 etiquetas de entrega frente a una capa de dirección

Esta es la diferencia sustantiva y determina la mayoría de las integraciones.

Qwen-Audio-3.0-TTS incluye 86 etiquetas de interpretación en línea —anotaciones incrustadas en el texto que controlan cómo se locuta un fragmento. Es un enfoque de marcado: tu guion lleva la interpretación. Les resulta familiar a quienes hayan trabajado con SSML, y se combina bien con herramientas que generan texto mediante programación, porque la superficie de control es una transformación de cadenas en lugar de una llamada a una API.

Gemini 3.8 Flash TTS toma el otro camino. Diriges una línea tal como dirigirías a un actor —ritmo, énfasis, registro emocional— como una instrucción aparte, en lugar de como marcado en línea. Las escenas de dos hablantes pueden montarse dentro de una sola llamada. Y un pequeño conjunto de señales no verbales está escrito en el guion: <laughs>, <sigh>, <gasp> como señales en línea, además de |mhm| y |yeah| para sonidos de retroalimentación.

Así que ambos modelos aceptan anotación en el texto; la diferencia es el tamaño del vocabulario y dónde vive el resto del control. La de Qwen es más amplia y plana: 86 etiquetas, todas en el texto. La de Google es más estrecha en el texto y más amplia fuera de él, con la dirección de la locución y la organización de los hablantes como parámetros a nivel de llamada. Si vas a portar un sistema que ya emite un marcado en línea rico, Qwen es el port más corto. Si de todos modos vas a construir la lógica de dirección en el código de la aplicación, la división de Google es más limpia.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Cobertura de idiomas frente a cobertura de dialectos

Los números de cobertura no son comparables, y compararlos de forma ingenua es un error.

Gemini 3.8 Flash TTS cubre 130 idiomas, detectados automáticamente a partir del texto; Flash-Lite TTS cubre 101. Esa es una amplitud que abarca distintas familias lingüísticas, que es lo que necesitas para una pasada de localización que tenga que llegar a una cola larga de mercados.

Qwen-Audio-3.0-TTS cubre 16 idiomas además de 20 regiones de dialectos chinos. Eso es profundidad dentro de una misma familia lingüística. Veinte regiones dialectales no es un número menor que 130 idiomas como parece a simple vista — es un tipo diferente de afirmación, y para un producto que presta servicio a usuarios sinohablantes en las regiones de China continental, es la más útil. Un modelo con 130 idiomas y una sola voz en mandarín no sirve a un usuario en Sichuan de la forma en que lo hace un modelo con 20 regiones dialectales.

Cuál importa depende enteramente de tu audiencia. Si tu requisito es «al menos aceptable en veinte mercados», Gemini. Si es «realmente acertado en el mercado chino», Qwen.

El precio, y lo que esconde la cifra por carácter

• Qwen-Audio-3.0-TTS-Plus — 27,60 $ por 1 millón de caracteres según la base normalizada de la tabla de clasificación; la variante Flash cuesta alrededor de 15 $ por 1 millón de caracteres, con una latencia declarada del primer paquete de unos 300 ms.

• Gemini 3.8 Flash TTS — $33.00 por 1 millón de caracteres normalizados; facturado por Google a $0.50 por millón de tokens de texto de entrada y $9.00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026; después, $1.00 y $18.00.

• Gemini 3.8 Flash-Lite TTS — 22,10 $ por 1 M de caracteres normalizados en el puesto 6 con un Elo de 1.235; facturado a 6,00 $ por millón de tokens de audio hasta el 31 de diciembre de 2026.

Ambas cifras por carácter son normalizaciones de Artificial Analysis, no precios de lista de los proveedores: Qwen factura a través de Alibaba Cloud Model Studio y Google factura por tokens, y ninguno de los dos publica una tarifa por carácter para estos modelos. Úsalas para la proporción, que es de aproximadamente 1,2x a favor de Qwen, y no como cotizaciones.

Los niveles divergen en forma. Qwen se divide en Plus y Flash, con el nivel Flash sacrificando calidad por una promesa de primer paquete de ~300 ms. Google se divide en Flash y Flash-Lite, y luego se subdivide en Standard, Batch y Flex, y Priority — $4.50, $9.00 y $16.20 por millón de tokens de audio en Flash TTS. El modelo de Google recompensa clasificar tu carga de trabajo; el de Qwen recompensa elegir un nivel de calidad de antemano.

La disponibilidad es la otra diferencia real. Gemini 3.8 Flash TTS está disponible de forma general en Gemini Developer API. Qwen-Audio-3.0-TTS es cerrado y solo se ofrece alojado, servido a través de Alibaba Cloud Model Studio y sin pesos abiertos. Si necesitas ejecutar el modelo por tu cuenta, ninguno de estos es para ti, pero si tu infraestructura ya está en Alibaba Cloud, el modelo Qwen es el que no tiene ningún asunto de salida de datos que resolver.

Reclamaciones de proveedores en ambos lados

Ninguno de los dos modelos cuenta con un benchmark independiente más allá de la arena, y ambos proveedores han publicado afirmaciones que deberían etiquetarse como tales.

De Google, para Gemini 3.8 Flash TTS: primero en el Hume AI Voice Design Benchmark con 71.4, primero en modelado de acentos con 60.8, primero y segundo en el Hume Overall Quality Index para Flash y Flash-Lite, y los mejores puestos de preferencia ciega reclamados en japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi. Las ejecuciones no son públicas.

De Alibaba, para Qwen-Audio-3.0-TTS: el sistema de entrega de 86 etiquetas, las 20 regiones dialectales y la cifra de ~300 ms hasta el primer paquete en la variante Flash. También sin reproducir.

El Elo de arena es el único número de calidad recopilado de forma independiente en este artículo, y dice que los dos están empatados en lo más alto de la tabla.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Qué añade Gemini que Qwen no

La creación de voces es la carencia más evidente. Gemini 3.8 Flash TTS admite el diseño de voces a partir de una descripción en lenguaje natural y la replicación de voces a partir de una muestra de 30 segundos, con verificación del consentimiento y una marca de agua SynthID, además de credenciales C2PA en el resultado. Las voces personalizadas adoptan dos formas: 200 voces con estado por proyecto con un tiempo de vida de un año, o voces sin estado a las que se hace referencia mediante un identificador voicekey_... que caducan a los siete días. La remezcla de voces figura como próxima función.

El control del formato de salida es el segundo. WAV de 24 kHz, mono, PCM con signo de 16 bits en el endpoint unario, PCM sin encabezado (audio/l16) en el endpoint de streaming, además de audio/mulaw y audio/alaw y una frecuencia de muestreo configurable. Para trabajos relacionados con la telefonía, la compatibilidad con mulaw elimina un paso de transcodificación.

Cuál llamar

Elige Qwen-Audio-3.0-TTS si tus usuarios hablan chino y la cobertura de dialectos es el requisito, si quieres un amplio vocabulario de marcado en línea que tu generador pueda emitir directamente, o si ya estás en Alibaba Cloud y quieres la ruta más corta hacia un endpoint funcional. También es la más económica de las dos sobre una base normalizada, y la variante Flash es aún más económica si ~300 ms hasta el primer paquete es aceptable.

Elige Gemini 3.8 Flash TTS si necesitas amplitud en muchos idiomas en lugar de profundidad en uno, si necesitas crear o replicar una voz específica, si necesitas salida mulaw o alaw, o si «disponible de forma general en lugar de solo alojado» es un requisito de adquisición.

Ninguna de las dos es una mala elección y ninguna es claramente mejor — de eso se trata una diferencia de un punto de Elo. La decisión es de compatibilidad, no de calidad.

Ese es también el argumento para no comprometerse firmemente con ninguno de los dos todavía. OrcaRouter te ofrece más de 200 modelos detrás de una sola clave al precio de lista del proveedor y sin recargo, así que un cambio de tarifa de cualquiera de los dos laboratorios llega a tu factura el mismo día y no en la renovación, y la conmutación por error automática significa que un endpoint de síntesis que falla bajo carga recurre a otro en lugar de descartar la solicitud. No alojamos Qwen-Audio-3.0-TTS —eso se sirve a través de Alibaba Cloud Model Studio— y no alojamos los endpoints TTS de Gemini 3.8, que provienen de la API de Google. Lo que ofrecemos es la capa de texto y el enrutamiento por encima de ella, que es lo que te permite ejecutar ambos con tráfico real durante un mes antes de elegir.

La cifra que hay que vigilar es la próxima revisión de la arena. Con 1.447 muestras en Qwen y 1.999 en Gemini, ambos intervalos siguen siendo lo bastante amplios como para que un solo mes de votos pueda separarlos — o confirmar que el empate es la respuesta.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario