
Breeze TTS 2: O novo líder de TTS de pesos abertos a 1.215 Elo
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 523 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Breeze TTS 2 agora é o modelo de text-to-speech de pesos abertos melhor classificado no Provider Voices Speech Arena da Artificial Analysis, com 1.215 Elo — 90 pontos à frente do líder anterior de pesos abertos, o Fish Audio S2 Pro, e classificado em #6 no geral entre mais de 100 sistemas avaliados. A listagem é a primeira confirmação independente do que a BreezeBlue afirma desde que apresentou o modelo em meados de agosto de 2026: que um modelo de voz com duas semanas de existência, vindo de uma startup de cerca de 15 pessoas, pode se equiparar à fronteira comercial de text-to-speech. Os pesos abertos foram disponibilizados no Hugging Face em 25 de agosto de 2026; o resultado da arena veio no dia seguinte. Seja o que for que o Breeze TTS 2 venha a se tornar, ele não é mais uma promessa de fornecedor — ele tem um Elo que comprova isso.
O que realmente aconteceu, em ordem
A cronologia é importante aqui, porque explica por que um post sobre um "ranking de pesos abertos" vem de uma empresa que a maioria das pessoas não conhecia há três semanas. A BreezeBlue foi fundada por Yang Bin, ex-cofundador técnico de um dos principais laboratórios de IA da China, com uma rodada inicial de US$ 6 milhões liderada pela Yuanjing Capital e pela Redpoint China. O modelo passou por três marcos visíveis:
• 7 de agosto de 2026 — A BreezeBlue publicou sua própria suíte de benchmarks de texto para fala para design de voz, direção de voz e avaliação de latência no Hugging Face.
• 16–17 de agosto de 2026 — a empresa anunciou formalmente o Breeze TTS 2 como um modelo de voz emblemático em tempo real para mídia interativa, e abriu uma API hospedada a $34 por 1 milhão de caracteres.
• 25 de agosto de 2026 — os pesos e o código de inferência PyTorch foram disponibilizados em código aberto no Hugging Face como BreezeBlue/Breeze-TTS-2, um modelo de 3B parâmetros sob uma licença de pesquisa e uso não comercial.
O ranking Artificial Analysis Provider Voices foi ao ar poucos dias após o lançamento dos pesos abertos. Como a arena avalia modelos por meio de escuta cega lado a lado, os 1.215 de Elo não são um benchmark que a BreezeBlue executou em si mesma — é o julgamento acumulado de ouvintes comparando amostras reais, que é exatamente o que mais falta a um modelo tão jovem.
O placar

• Ranking da Arena — #6 geral no Provider Voices; #1 entre todos os modelos de pesos abertos, à frente do Fish Audio S2 Pro (1.125 Elo).
• Elo — 1.215, com um IC de 95% de aproximadamente ±17 (Artificial Analysis, no final de agosto de 2026).
• Idiomas — 50, conforme BreezeBlue; o cartão do modelo está marcado como inglês e chinês.
• Preço — $34 por 1M de caracteres no endpoint hospedado da BreezeBlue; os pesos abertos podem ser baixados gratuitamente, mas possuem licença não comercial.
• Velocidade — ~45 caracteres por segundo nas medições do Artificial Analysis — mais lenta que vários concorrentes, o que importa para trabalhos longos.
• Latência — latência de streaming abaixo de 40ms, segundo a BreezeBlue (declarado pelo fornecedor, não medido de forma independente).

O que o Breeze TTS 2 realmente faz de diferente
O Elo ganha as manchetes, mas a alegação do produto é mais interessante do que a pontuação. O Breeze TTS 2 é construído em torno de duas ideias que a maioria dos modelos de texto para fala trata como algo secundário: design de voz e direção de voz. O design de voz é zero-shot e sem referência — você descreve uma voz em linguagem natural ("um narrador caloroso, na casa dos 45 anos, com um leve sotaque sulista e um humor seco") e o modelo gera essa voz sem gravação de estúdio nem clipe de referência. A direção de voz desacopla o timbre do falante da intenção de entrega, para que você possa fazer uma fala soar sarcástica, sussurrada ou apressada sem que o modelo se desvie para um personagem diferente. A BreezeBlue afirma que a mesma identidade do falante sobrevive à mudança, e seu próprio benchmark de direção de voz relata uma similaridade de falante de 0.67 SPK_SIM (relatado pelo fornecedor).
Essas duas capacidades apontam para o mercado-alvo do Breeze TTS 2. Os materiais de imprensa são explícitos: personagens de videogame, companheiros digitais, narrativa de histórias, drama transmitido e streamers virtuais — áudio de formato longo, orientado a papéis e com múltiplos personagens, não apenas mais uma API de narração. A empresa oferece uma biblioteca de vozes complementar chamada Voice Galaxy com mais de 15.000 vozes de personagens criadas pela comunidade e por estúdios, e o reel de demonstração da BreezeBlue é um drama de rádio de fãs com múltiplos personagens que dura mais de dez minutos. Em seus próprios benchmarks divulgados (relatados pelo fornecedor, não reproduzidos), o Breeze TTS 2 reivindica o primeiro lugar no benchmark de Design de Voz para texto-para-fala com uma pontuação de Role Fit de 78,02 contra 72,78 do MiMo-V2.5-TTS, e um composto de Direção de Voz de 4,25.
O asterisco da licença
Antes de a expressão "open weights" fazer marketing demais, leia o model card. O Breeze TTS 2 tem 3B parâmetros, safetensors, F32/BF16, e o código-fonte é Apache 2.0 — mas os pesos, modelos derivados e saídas auto-hospedadas são licenciados apenas para pesquisa e uso não comercial, sob a licença breezeblue-research-and-non-commercial-license. Isso significa que "open weights" aqui não é "grátis para o seu produto." A auto-hospedagem comercial não é permitida pela licença como está escrita; o caminho comercial é a API hospedada a US$ 34 por 1M de caracteres. Esse é o mesmo formato de vários outros lançamentos abertos de 2026 — inspecionáveis e auto-hospedáveis para pesquisa, mas com o uso gerador de receita reservado para o endpoint do próprio fornecedor.
Por que um roteador é importante para um modelo tão jovem
O verdadeiro risco com o Breeze TTS 2 neste momento não é qualidade — é idade. O modelo está no ar há {{1}}dez dias, e os pesos há dois{{/1}}. Nenhuma equipe de produção deveria apostar um pipeline de voz em um modelo tão novo sem uma forma de substituí-lo, e isso é exatamente {{2}}o modo de falha que uma camada de roteamento existe para absorver{{/2}}. Se você avaliar o Breeze TTS 2 por meio de um gateway que trata o endpoint do fornecedor como uma rota entre muitas, obtém {{3}}o líder de Elo hoje, failover automático para um provedor de fallback quando a API está degradada e uma mudança de uma linha se um modelo de uma semana apresentar regressão{{/3}}. Isso é {{4}}a mesma disciplina que o DSL de roteamento aplica a qualquer modelo: combiná-lo com alternativas, manter a interface estável e deixar o modelo provar seu valor antes de permitir que se torne estrutural{{/4}}. Nenhum dos modelos desta série está roteado no próprio OrcaRouter, então o conselho honesto é {{5}}conectar o Breeze TTS 2 ao gateway que você já opera{{/5}} — e manter seu provedor atual ativo ao lado dele {{6}}enquanto o Elo fica mais maduro e confiável{{/6}}.
O que assistir em seguida
A posição #1 em pesos abertos do Provider Voices é a manchete hoje, mas é a mais fraca das duas arenas para este modelo. Na arena Controlled Voice da Artificial Analysis, onde todos os modelos são comparados nas mesmas vozes de referência fixas, o Breeze TTS 2 fica em #3 entre os modelos de pesos abertos com 1.002 Elo, atrás do Voxtral da Mistral com 1.010 — e #16 geral entre 39. Essa diferença entre sua pontuação provider-voice (1.215, #1 em pesos abertos) e sua pontuação controlled-voice (1.002, #3 em pesos abertos) merece atenção: ela sugere que a vantagem do Breeze TTS 2 está concentrada nas vozes que ele projeta para si mesmo, o que é exatamente a alegação do produto, e é também exatamente a alegação que um benchmark independente deve continuar pressionando. Observe se o Elo da controlled-voice se aproxima do número da provider-voice, se a licença comercial se aperta ou se afrouxa e — acima de tudo — se alguém reproduz os benchmarks de design de voz e direção de voz fora do conjunto próprio da BreezeBlue.
Para um modelo que não existia há um mês, o Breeze TTS 2 já conquistou a coisa mais útil que um modelo de texto-para-fala pode conquistar: uma pontuação independente que concorda com o marketing. Se ele se tornará uma voz padrão para produtos interativos depende menos da próxima atualização do Elo do que de como a licença e a história do self-hosting evoluem — mas a partir desta semana, o texto-para-fala de pesos abertos tem um novo líder, e ele tem duas semanas.

