
Gemini 3.8 TTS vs Breeze TTS 2: A licença, não o ranking, decide esta
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Cinquenta e seis pontos de Elo separam Gemini 3.8 Flash TTS e Breeze TTS 2 na Artificial Analysis Provider Voice Arena, e eles não estão dentro das barras de erro um do outro: o modelo do fornecedor está na 2ª posição, com um Elo de 1.260 em 1.999 amostras e 8 vozes da arena, lançado em 23 de setembro de 2026; o Breeze TTS 2 está na 9ª posição, com 1.204 em 1.390 amostras, lançado em agosto de 2026. Em termos de preço, a ordem se inverte radicalmente — o Breeze está listado a US$ 34,00 por milhão de caracteres normalizados, contra US$ 16,50 do Flash TTS, então o modelo que vence no ranking perde na fatura por aproximadamente o dobro.
Se essa fosse toda a comparação, seria um texto curto e você escolheria com base em quanta confiança você tem em uma diferença de 56 pontos. Mas os dois modelos não são o mesmo tipo de objeto. O Breeze TTS 2 é um modelo de pesos abertos de 3 bilhões de parâmetros que você pode baixar, inspecionar e executar você mesmo, com uma licença que acaba importando mais do que sua posição em um ranking. O Gemini 3.8 Flash TTS é um endpoint de API com design de voz e diálogo de dois falantes e nenhum peso. Decidir entre eles é uma questão de licenciamento e implantação vestindo a roupa de um benchmark.

O que cada um realmente é
Entenda bem o perfil de cada modelo antes de comparar números, porque eles diferem em quase todos os eixos que não são o Elo.
• Distribuição — Breeze TTS 2 é baixável: pesos publicados no Hugging Face como BreezeBlue/Breeze-TTS-2 juntamente com o código PyTorch. Gemini 3.8 Flash TTS é somente via API, acessível por meio da API Gemini e das superfícies do Google citadas no anúncio de 23 de setembro.
• Tamanho — Breeze TTS 2 é um modelo de 3 bilhões de parâmetros, e é por isso que ele pode ser auto-hospedado. O Google não publicou uma contagem de parâmetros para nenhum dos dois modelos Gemini 3.8 TTS.
• Criação de voz — O Gemini 3.8 Flash TTS faz design de voz a partir de uma descrição escrita e replicação de voz a partir de uma amostra de 30 segundos. O Breeze TTS 2 vem com uma biblioteca de vozes que o fornecedor afirma contar aos milhares e a sua própria via de design de voz; as pontuações de adequação ao papel e de direção para essa via, relatadas pelo fornecedor, são da própria BreezeBlue e não têm contrapartida independente.
• Diálogo — O Gemini 3.8 Flash TTS gera diálogos com dois falantes numa única chamada, com estilização ao nível de cada turno. O Breeze TTS 2 é um modelo de voz única; uma conversa são duas execuções unidas.
• Idiomas — O Breeze TTS 2 cobre 50 idiomas segundo a contagem do fornecedor. O anúncio do Google contabiliza 130 para o modelo Flash, mas as duas contagens não estão medindo a mesma coisa e não devem ser interpretadas como 130 contra 50.
• Latência — a BreezeBlue afirma ter latência de streaming abaixo de 40 ms; o Google não publica nenhuma métrica equivalente para o Flash TTS. Nenhum dos números é verificado de forma independente, e apenas um deles existe.
A licença é a verdadeira bifurcação na estrada
Esta é a parte que o ranking não consegue lhe mostrar, e é a razão pela qual os dois modelos não são intercambiáveis mesmo nos pontos em que sua qualidade se sobrepõe.
Os pesos do Breeze TTS 2 são distribuídos sob a licença BreezeBlue de pesquisa e não comercial. O código-fonte no mesmo repositório é Apache 2.0. Esses dois fatos aparecem lado a lado no cartão do modelo e acabam reduzidos a "código aberto" na maior parte da cobertura, o que está errado na direção que custa dinheiro: o fato de o código ser Apache 2.0 não torna os pesos Apache 2.0, e o uso comercial do modelo passa pela API hospedada, e não por um checkpoint auto-hospedado.

Do lado do Google não há nenhuma questão de licença, porque não há nada para licenciar. Você está comprando inferência. Aquilo de que você abre mão é justamente o motivo pelo qual pesos abertos costumam ser comprados — a capacidade de executar o modelo onde os dados estão, de fixar uma versão e mantê-la, e de parar de pagar por caractere.
Então, o enquadramento honesto não é aberto versus fechado. É:
Se a sua implantação tiver de manter o áudio dentro da sua própria infraestrutura, o Breeze TTS 2 é o único dos dois que oferece um caminho, e o caminho é uma licença de pesquisa. Consulte o departamento jurídico antes de desenvolver um produto com base nela.
• Se a sua implantação conseguir chamar uma API, a questão da licença desaparece e a comparação volta a centrar-se na qualidade, no preço e nas funcionalidades — onde o Flash TTS está à frente em dois dos três.
• Se quiser pesos abertos que possa comercializar sem uma conversa, nenhum destes é esse modelo, e a arena tem outras linhas.
Onde a diferença de Elo significa algo e onde não
Uma diferença de 56 pontos está fora dos intervalos de confiança de ±16 e ±16 que o leaderboard informa para essas duas linhas, então a classificação não é ruído da mesma forma que, digamos, Flash TTS contra Gemini 3.8 Flash-Lite TTS é ruído. Mas um Elo de arena mede uma coisa: qual de dois clipes um ouvinte preferiu em uma comparação cega. É um sinal de preferência, agregado.
O que ele não mede é tudo o que uma pipeline de produção se importa. Ele não diz como qualquer um dos modelos lida com um roteiro de 40 minutos sem desvio de identidade, como pronuncia o nome do seu produto, como se comporta quando a entrada contém um número de telefone, ou como é seu modo de falha quando lhe pedem algo fora de seu treinamento. As 1.390 amostras do Breeze TTS 2 e as 1.999 do Flash TTS são ambas grandes o suficiente para que o agregado seja estável, e ambas pequenas o suficiente para que nenhum segmento individual do seu caso de uso esteja representado nelas.
A diferença também é menor do que parece quando se leva em conta o que se pede que cada modelo faça. O Flash TTS está lidando com dois falantes em uma única chamada, o que é uma tarefa mais difícil do que aquela em que o Breeze TTS 2 é avaliado. Se isso faz dos 56 pontos uma subestimação ou uma superestimação depende do seu caso de uso, e nenhum dos fornecedores publicou o estudo de ablação que resolveria a questão.

Quanto custa uma hora de cada
Os dois valores de preço não são diretamente comparáveis, e fingir o contrário é o erro mais comum em análises deste confronto.
Google cobra em tokens: $0,50 por milhão de tokens de texto de entrada e $9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois $18,00. Batch e Flex custam $0,25 e $4,50; Priority custa $0,90 e $16,00. O Flash-Lite TTS, o modelo irmão, custa $0,50 e $6,00, depois $12,00.
A BreezeBlue cobra em caracteres: $34,00 por milhão de caracteres através da API hospedada.
A Artificial Analysis normaliza ambos para uma base por milhão de caracteres para que possam compartilhar um mesmo ranking, e é daí que vem US$ 16,50 contra US$ 34,00. A normalização é do ranking, não de nenhum dos fornecedores — o Google não publica um preço por caractere para o Flash TTS, e tratar US$ 16,50 como uma cotação em vez de uma conversão é o que faz as pessoas acabarem surpresas com uma fatura.
Duas consequências que vale a pena levar em conta no planejamento:
• A tarifa do Flash TTS dobra em 1º de janeiro de 2027. Orçado com o valor promocional, a diferença para o Breeze TTS 2 diminui acentuadamente; orçado em US$ 18,00, ela quase se fecha.
• A auto-hospedagem do Breeze TTS 2 não o torna gratuito; torna-o um custo de capital. Um modelo 3B é pequeno o suficiente para rodar em hardware modesto, mas a aritmética só compensa em volume, e apenas para um caso de uso que a licença de pesquisa permite.
Escolhendo, sem fingir que existe uma única resposta
A árvore de decisão é curta.
Escolha o Gemini 3.8 Flash TTS se você precisar de diálogo entre dois locutores, se quiser uma voz criada a partir de uma descrição e mantida como um ID, se o seu pipeline puder chamar uma API e se a mudança de preços de 31 de dezembro for algo que você consegue planejar. É o melhor modelo no ranking independente e o mais barato na conta, e o fato de ser fechado não é um problema para um caso de uso que sempre seria uma chamada de API.
Escolha o Breeze TTS 2 se a residência de dados ou a inferência em instalações próprias (on-premises) for um requisito obrigatório, se precisar de um modelo 3B que possa realmente descarregar, ou se estiver a fazer investigação em vez de lançar um produto — que é precisamente o caso para o qual a sua licença foi escrita. Não o escolha apenas pelo rótulo de open-weights; leia primeiro a licença.
E se você está avaliando os dois, a forma barata de fazer isso é manter a escolha reversível. O OrcaRouter não hospeda nenhum desses modelos — o lugar de chamar o Gemini 3.8 Flash TTS é a própria API do Google e as superfícies que o Google indicou, e o lugar de chamar o Breeze TTS 2 é o endpoint hospedado da BreezeBlue. O que um roteador oferece de útil aqui é o resto da stack: mais de 200 modelos atrás de uma única chave ao preço de tabela do provedor, sem markup, então uma mudança de preço do fornecedor como o reajuste de janeiro entra no ar no mesmo dia, em vez de só no próximo ciclo de cobrança, failover automático para que um caminho em avaliação não precise ser um caminho em produção, e uma DSL de roteamento que compõe modelos em uma única chamada quando uma só voz não é suficiente.
A versão em uma linha: o ranking diz Google, a licença diz que depende, e o preço diz para conferir seu calendário antes de se comprometer com qualquer um dos dois.
