Breeze TTS 2 — O novo líder de TTS de pesos abertos com 1.215 Elo. Ilustração regenerada.
Guides & Insights

Breeze TTS 2: O novo líder de TTS de pesos abertos a 1.215 Elo

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Breeze TTS 2 agora é o modelo de text-to-speech de pesos abertos melhor classificado no Provider Voices Speech Arena da Artificial Analysis, com 1.215 Elo — 90 pontos à frente do líder anterior de pesos abertos, o Fish Audio S2 Pro, e classificado em #6 no geral entre mais de 100 sistemas avaliados. A listagem é a primeira confirmação independente do que a BreezeBlue afirma desde que apresentou o modelo em meados de agosto de 2026: que um modelo de voz com duas semanas de existência, vindo de uma startup de cerca de 15 pessoas, pode se equiparar à fronteira comercial de text-to-speech. Os pesos abertos foram disponibilizados no Hugging Face em 25 de agosto de 2026; o resultado da arena veio no dia seguinte. Seja o que for que o Breeze TTS 2 venha a se tornar, ele não é mais uma promessa de fornecedor — ele tem um Elo que comprova isso.

O que realmente aconteceu, em ordem

A cronologia é importante aqui, porque explica por que um post sobre um "ranking de pesos abertos" vem de uma empresa que a maioria das pessoas não conhecia há três semanas. A BreezeBlue foi fundada por Yang Bin, ex-cofundador técnico de um dos principais laboratórios de IA da China, com uma rodada inicial de US$ 6 milhões liderada pela Yuanjing Capital e pela Redpoint China. O modelo passou por três marcos visíveis:

• 7 de agosto de 2026 — A BreezeBlue publicou sua própria suíte de benchmarks de texto para fala para design de voz, direção de voz e avaliação de latência no Hugging Face.

• 16–17 de agosto de 2026 — a empresa anunciou formalmente o Breeze TTS 2 como um modelo de voz emblemático em tempo real para mídia interativa, e abriu uma API hospedada a $34 por 1 milhão de caracteres.

• 25 de agosto de 2026 — os pesos e o código de inferência PyTorch foram disponibilizados em código aberto no Hugging Face como BreezeBlue/Breeze-TTS-2, um modelo de 3B parâmetros sob uma licença de pesquisa e uso não comercial.

O ranking Artificial Analysis Provider Voices foi ao ar poucos dias após o lançamento dos pesos abertos. Como a arena avalia modelos por meio de escuta cega lado a lado, os 1.215 de Elo não são um benchmark que a BreezeBlue executou em si mesma — é o julgamento acumulado de ouvintes comparando amostras reais, que é exatamente o que mais falta a um modelo tão jovem.

O placar

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Ranking da Arena — #6 geral no Provider Voices; #1 entre todos os modelos de pesos abertos, à frente do Fish Audio S2 Pro (1.125 Elo).

• Elo — 1.215, com um IC de 95% de aproximadamente ±17 (Artificial Analysis, no final de agosto de 2026).

• Idiomas — 50, conforme BreezeBlue; o cartão do modelo está marcado como inglês e chinês.

• Preço — $34 por 1M de caracteres no endpoint hospedado da BreezeBlue; os pesos abertos podem ser baixados gratuitamente, mas possuem licença não comercial.

• Velocidade — ~45 caracteres por segundo nas medições do Artificial Analysis — mais lenta que vários concorrentes, o que importa para trabalhos longos.

• Latência — latência de streaming abaixo de 40ms, segundo a BreezeBlue (declarado pelo fornecedor, não medido de forma independente).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

O que o Breeze TTS 2 realmente faz de diferente

O Elo ganha as manchetes, mas a alegação do produto é mais interessante do que a pontuação. O Breeze TTS 2 é construído em torno de duas ideias que a maioria dos modelos de texto para fala trata como algo secundário: design de voz e direção de voz. O design de voz é zero-shot e sem referência — você descreve uma voz em linguagem natural ("um narrador caloroso, na casa dos 45 anos, com um leve sotaque sulista e um humor seco") e o modelo gera essa voz sem gravação de estúdio nem clipe de referência. A direção de voz desacopla o timbre do falante da intenção de entrega, para que você possa fazer uma fala soar sarcástica, sussurrada ou apressada sem que o modelo se desvie para um personagem diferente. A BreezeBlue afirma que a mesma identidade do falante sobrevive à mudança, e seu próprio benchmark de direção de voz relata uma similaridade de falante de 0.67 SPK_SIM (relatado pelo fornecedor).

Essas duas capacidades apontam para o mercado-alvo do Breeze TTS 2. Os materiais de imprensa são explícitos: personagens de videogame, companheiros digitais, narrativa de histórias, drama transmitido e streamers virtuais — áudio de formato longo, orientado a papéis e com múltiplos personagens, não apenas mais uma API de narração. A empresa oferece uma biblioteca de vozes complementar chamada Voice Galaxy com mais de 15.000 vozes de personagens criadas pela comunidade e por estúdios, e o reel de demonstração da BreezeBlue é um drama de rádio de fãs com múltiplos personagens que dura mais de dez minutos. Em seus próprios benchmarks divulgados (relatados pelo fornecedor, não reproduzidos), o Breeze TTS 2 reivindica o primeiro lugar no benchmark de Design de Voz para texto-para-fala com uma pontuação de Role Fit de 78,02 contra 72,78 do MiMo-V2.5-TTS, e um composto de Direção de Voz de 4,25.

O asterisco da licença

Antes de a expressão "open weights" fazer marketing demais, leia o model card. O Breeze TTS 2 tem 3B parâmetros, safetensors, F32/BF16, e o código-fonte é Apache 2.0 — mas os pesos, modelos derivados e saídas auto-hospedadas são licenciados apenas para pesquisa e uso não comercial, sob a licença breezeblue-research-and-non-commercial-license. Isso significa que "open weights" aqui não é "grátis para o seu produto." A auto-hospedagem comercial não é permitida pela licença como está escrita; o caminho comercial é a API hospedada a US$ 34 por 1M de caracteres. Esse é o mesmo formato de vários outros lançamentos abertos de 2026 — inspecionáveis e auto-hospedáveis para pesquisa, mas com o uso gerador de receita reservado para o endpoint do próprio fornecedor.

Por que um roteador é importante para um modelo tão jovem

O verdadeiro risco com o Breeze TTS 2 neste momento não é qualidade — é idade. O modelo está no ar há {{1}}dez dias, e os pesos há dois{{/1}}. Nenhuma equipe de produção deveria apostar um pipeline de voz em um modelo tão novo sem uma forma de substituí-lo, e isso é exatamente {{2}}o modo de falha que uma camada de roteamento existe para absorver{{/2}}. Se você avaliar o Breeze TTS 2 por meio de um gateway que trata o endpoint do fornecedor como uma rota entre muitas, obtém {{3}}o líder de Elo hoje, failover automático para um provedor de fallback quando a API está degradada e uma mudança de uma linha se um modelo de uma semana apresentar regressão{{/3}}. Isso é {{4}}a mesma disciplina que o DSL de roteamento aplica a qualquer modelo: combiná-lo com alternativas, manter a interface estável e deixar o modelo provar seu valor antes de permitir que se torne estrutural{{/4}}. Nenhum dos modelos desta série está roteado no próprio OrcaRouter, então o conselho honesto é {{5}}conectar o Breeze TTS 2 ao gateway que você já opera{{/5}} — e manter seu provedor atual ativo ao lado dele {{6}}enquanto o Elo fica mais maduro e confiável{{/6}}.

O que assistir em seguida

A posição #1 em pesos abertos do Provider Voices é a manchete hoje, mas é a mais fraca das duas arenas para este modelo. Na arena Controlled Voice da Artificial Analysis, onde todos os modelos são comparados nas mesmas vozes de referência fixas, o Breeze TTS 2 fica em #3 entre os modelos de pesos abertos com 1.002 Elo, atrás do Voxtral da Mistral com 1.010 — e #16 geral entre 39. Essa diferença entre sua pontuação provider-voice (1.215, #1 em pesos abertos) e sua pontuação controlled-voice (1.002, #3 em pesos abertos) merece atenção: ela sugere que a vantagem do Breeze TTS 2 está concentrada nas vozes que ele projeta para si mesmo, o que é exatamente a alegação do produto, e é também exatamente a alegação que um benchmark independente deve continuar pressionando. Observe se o Elo da controlled-voice se aproxima do número da provider-voice, se a licença comercial se aperta ou se afrouxa e — acima de tudo — se alguém reproduz os benchmarks de design de voz e direção de voz fora do conjunto próprio da BreezeBlue.

Para um modelo que não existia há um mês, o Breeze TTS 2 já conquistou a coisa mais útil que um modelo de texto-para-fala pode conquistar: uma pontuação independente que concorda com o marketing. Se ele se tornará uma voz padrão para produtos interativos depende menos da próxima atualização do Elo do que de como a licença e a história do self-hosting evoluem — mas a partir desta semana, o texto-para-fala de pesos abertos tem um novo líder, e ele tem duas semanas.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.