Breeze TTS 2 — El nuevo líder de TTS de pesos abiertos con 1,215 Elo
Guides & Insights

Breeze TTS 2: El nuevo líder en TTS de pesos abiertos con 1215 Elo

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Breeze TTS 2 es ahora el modelo de texto a voz de pesos abiertos mejor clasificado en el Provider Voices Speech Arena de Artificial Analysis, con 1,215 Elo — 90 puntos por delante del anterior líder de pesos abiertos, Fish Audio S2 Pro, y ubicado en el puesto #6 en general entre más de 100 sistemas evaluados. La inclusión en la lista es la primera confirmación independiente de lo que BreezeBlue ha afirmado desde que presentó el modelo a mediados de agosto de 2026: que un modelo de voz de dos semanas de antigüedad, de una startup de aproximadamente 15 personas, puede colocarse a la altura de la vanguardia del texto a voz comercial. Los pesos abiertos llegaron a Hugging Face el 25 de agosto de 2026; el resultado en la arena se conoció al día siguiente. Sea lo que sea que Breeze TTS 2 resulte ser, ya no es una promesa del proveedor: tiene un Elo que lo atestigua.

Lo que realmente sucedió, en orden.

La cronología importa aquí, porque explica por qué una publicación sobre un "leaderboard de pesos abiertos" proviene de una empresa de la que la mayoría de la gente no había oído hablar hace tres semanas. BreezeBlue fue fundada por Yang Bin, antiguo cofundador técnico de uno de los principales laboratorios de IA de China, con una ronda semilla de 6 millones de dólares liderada por Yuanjing Capital y Redpoint China. El modelo pasó por tres hitos visibles:

• 7 de agosto de 2026 — BreezeBlue publicó su propia suite de evaluación comparativa de texto a voz para diseño de voz, dirección de voz y evaluación de latencia en Hugging Face.

• 16–17 de agosto de 2026 — la empresa anunció formalmente Breeze TTS 2 como un modelo de voz insignia en tiempo real para medios interactivos, y abrió una API alojada a $34 por 1M de caracteres.

• 25 de agosto de 2026 — los pesos y el código de inferencia de PyTorch se publicaron como código abierto en Hugging Face como BreezeBlue/Breeze-TTS-2, un modelo de 3B parámetros bajo una licencia de investigación y uso no comercial.

El ranking de Artificial Analysis Provider Voices se publicó a los pocos días del lanzamiento de los pesos abiertos. Debido a que la arena evalúa los modelos mediante escucha ciega lado a lado, el Elo de 1,215 no es un benchmark que BreezeBlue haya corrido sobre sí mismo — es el juicio acumulado de los oyentes que comparan muestras reales, que es exactamente lo que más le falta a un modelo tan joven.

El marcador

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Posición en Arena — #6 en general en Provider Voices; #1 entre todos los modelos de pesos abiertos, por delante de Fish Audio S2 Pro (1.125 Elo).

• Elo — 1.215, con un IC del 95% de aproximadamente ±17 (Artificial Analysis, a fecha de finales de agosto de 2026).

• Idiomas — 50, según BreezeBlue; la tarjeta del modelo está etiquetada en inglés y chino.

• Precio — $34 por 1M de caracteres en el endpoint alojado de BreezeBlue; los pesos abiertos se pueden descargar gratis pero tienen una licencia no comercial.

• Velocidad — ~45 caracteres por segundo según las mediciones de Artificial Analysis — más lento que varios rivales, lo que importa para trabajos largos.

• Latencia — latencia de streaming inferior a 40 ms, según BreezeBlue (declarado por el proveedor, no medido de forma independiente).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Lo que Breeze TTS 2 realmente hace de manera diferente

El Elo se lleva el titular, pero la afirmación sobre el producto es más interesante que la puntuación. Breeze TTS 2 se articula en torno a dos ideas que la mayoría de los modelos de texto a voz tratan como algo secundario: el diseño de voz y la dirección de voz. El diseño de voz no requiere ejemplos ni referencias — describes una voz en lenguaje natural («un narrador de unos cuarenta y cinco años, de voz cálida, con un ligero acento sureño y un humor seco») y el modelo genera esa voz sin necesidad de una grabación de estudio ni de un clip de referencia. La dirección de voz desvincula el timbre del hablante de la intención expresiva, de modo que puedes hacer que una frase suene sarcástica, susurrada o apresurada sin que el modelo se desvíe hacia un personaje distinto. BreezeBlue afirma que la misma identidad del hablante sobrevive al cambio, y su propio benchmark de dirección de voz arroja una similitud de hablante de 0,67 SPK_SIM (reportado por el proveedor).

Esas dos capacidades apuntan al mercado previsto de Breeze TTS 2. Los materiales de prensa son explícitos: personajes de videojuegos, compañeros digitales, narración de historias, drama radiofónico y streamers virtuales — audio de formato largo, impulsado por roles y con múltiples personajes, no solo otra API de narración. La empresa incluye una biblioteca de voces complementaria llamada Voice Galaxy con más de 15 000 voces de personajes creadas por la comunidad y estudios, y el demo reel de BreezeBlue es un drama radiofónico de fans con múltiples personajes que dura más de diez minutos. En sus propios benchmarks publicados (reportados por el proveedor, no reproducidos), Breeze TTS 2 afirma el puesto n.º 1 en el benchmark de Diseño de Voz para text-to-speech con una puntuación de Role Fit de 78,02 frente a 72,78 de MiMo-V2.5-TTS, y un compuesto de Voice Direction de 4,25.

El asterisco de la licencia

Antes de que la frase «open weights» haga demasiado trabajo de marketing, lee la ficha del modelo. Breeze TTS 2 tiene 3B de parámetros, safetensors, F32/BF16, y el código fuente es Apache 2.0 — pero los pesos, los modelos derivados y las salidas autoalojadas están licenciados solo para investigación y uso no comercial, bajo la licencia breezeblue-research-and-non-commercial-license. Eso significa que «open weights» aquí no es «gratis para tu producto». El autoalojamiento comercial no está permitido por la licencia tal como está redactada; la vía comercial es la API alojada a 34 dólares por 1M de caracteres. Este es el mismo patrón que varios otros lanzamientos abiertos de 2026 — inspeccionable y autoalojable para investigación, pero con el uso generador de ingresos reservado para el endpoint del propio proveedor.

Por qué es importante un router para un modelo tan joven

El riesgo real con Breeze TTS 2 ahora mismo no es la calidad, sino su antigüedad. El modelo lleva diez días en vivo y los pesos, dos. Ningún equipo de producción debería apostar un pipeline de voz a un modelo tan joven sin una forma de salir de él, y ese es precisamente el modo de fallo que una capa de enrutamiento existe para absorber. Si evalúas Breeze TTS 2 a través de un gateway que trate el endpoint del proveedor como una ruta más entre muchas, obtienes hoy el líder del Elo, conmutación automática por error a un proveedor de respaldo cuando la API se degrada, y un cambio de una línea si un modelo de una semana muestra una regresión. Esa es la misma disciplina que el DSL de enrutamiento aplica a cualquier modelo: componerlo con alternativas, mantener estable la interfaz y dejar que el modelo demuestre su valía antes de que pase a soportar carga. Ninguno de los modelos de esta serie está aún enrutado en OrcaRouter, así que el consejo honesto es conectar Breeze TTS 2 al gateway que ya utilices — y mantener a tu proveedor actual en vivo junto a él mientras el Elo madura y se vuelve más fiable.

Qué ver a continuación

El puesto #1 de pesos abiertos en Provider Voices es la noticia de hoy, pero es la más débil de las dos arenas para este modelo. En el arena de Voz Controlada de Artificial Analysis, donde todos los modelos se comparan con las mismas voces de referencia fijas, Breeze TTS 2 ocupa el puesto #3 entre los modelos de pesos abiertos con 1,002 Elo, detrás del Voxtral de Mistral con 1,010 — y el #16 en general de 39. Esa brecha entre su puntaje de voz de proveedor (1,215, #1 en pesos abiertos) y su puntaje de voz controlada (1,002, #3 en pesos abiertos) es digna de atención: sugiere que la ventaja de Breeze TTS 2 se concentra en las voces que diseña para sí mismo, que es exactamente la afirmación del producto, y también es exactamente la afirmación que un benchmark independiente debería seguir presionando. Observa si el Elo de voz controlada se acerca al número de voz de proveedor, si la licencia comercial se endurece o se afloja y — lo más importante — si alguien reproduce los benchmarks de diseño de voz y dirección de voz fuera de la suite propia de BreezeBlue.

Para un modelo que no existía hace un mes, Breeze TTS 2 ya ha conseguido lo más útil que un modelo de texto a voz puede conseguir: una puntuación independiente que coincide con el marketing. Que se convierta en una voz predeterminada para productos interactivos depende menos de la próxima actualización de Elo que de cómo evolucionen la licencia y la historia del autoalojamiento — pero desde esta semana, el texto a voz de pesos abiertos tiene un nuevo líder, y tiene dos semanas de antigüedad.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.