Cartão de título principal para 'GPT-Live-1 vs Breeze TTS 2', com o subtítulo 'Uma conversa ou uma voz — e apenas uma delas é uma fatura', contendo três cartões com os dizeres 'GPT-Live-1: $0,05 por minuto de voz, sem pesos, ouve enquanto fala', 'Breeze TTS 2: 3B de pesos abertos, 1.205 Elo, apenas licença de pesquisa', 'É a licença, não o Elo, que decide esta', acima de uma faixa de rodapé com os dizeres 'Dados da arena do Breeze TTS 2 segundo a Artificial Analysis; números do GPT-Live-1 reportados pela OpenAI.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

GPT-Live-1 vs Breeze TTS 2: O líder de voz de pesos abertos que você não pode lançar

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Breeze TTS 2 é o modelo de conversão de texto em fala de pesos abertos mais bem avaliado no Provider Voices Speech Arena da Artificial Analysis, com 1.205 de Elo e na sétima posição geral entre mais de cem sistemas avaliados — à frente de todos os motores licenciados comercialmente que publicam pesos. Seus pesos estão disponíveis para download desde 25 de agosto de 2026. Ele também é, sob a licença com que esses pesos são distribuídos, inutilizável em um produto. O GPT-Live-1 é a aposta inversa em todas as dimensões: fechado, hospedado, cobrado a US$ 0,05 por minuto de voz desde que chegou à API de desenvolvedores da OpenAI em 10 de setembro de 2026, e o único dos dois capaz de ouvir um interlocutor interrompê-lo.

Coloque essas duas frases uma ao lado da outra e a comparação se resolve mais rápido do que a maioria dos confrontos entre modelos. Não é uma briga sobre qual sintetiza melhor a fala. É uma briga sobre se você está comprando uma voz ou uma conversa, e se "aberto" significa o que você presumiu que significasse.

Não são o mesmo tipo de coisa, e é essa a questão

Breeze TTS 2, de uma startup de cerca de quinze pessoas chamada BreezeBlue, é um modelo de conversão de texto em fala de 3 bilhões de parâmetros. O texto entra, o áudio sai. Ele não ouve nada. Ele não tem opinião sobre quando um turno deve terminar, porque não tem conceito de turno. Transmitido por WebSocket, ele começa a produzir áudio antes que seu texto tenha terminado de ser gerado, o que é genuinamente útil para manter o ritmo de um agente de voz bem ajustado — mas a decisão sobre quando falar foi tomada por quem escreveu o texto.

GPT-Live-1 é um modelo de fala para fala full-duplex. Áudio e texto entram; áudio e texto saem; e o modelo decide várias vezes por segundo se continua ouvindo, faz uma pausa, assume o turno ou o cede. Os números do Full Duplex Bench v1.5 da própria OpenAI, publicados com o lançamento e não reproduzidos fora da empresa, colocam sua interatividade em 80,1% contra 45,4% do GPT-Realtime-2.1, com latência de troca de turno de 0,798 segundos contra 1,41.

Essa assimetria não é uma crítica ao Breeze TTS 2. É um alerta sobre onde cada um se encaixa em uma stack. Se você está construindo uma cascata — reconhecimento de fala alimentando um modelo de linguagem que alimenta um sintetizador —, o Breeze TTS 2 é um candidato para o último terço dela. Se você está comprando o GPT-Live-1, está comprando o loop inteiro e entregando a lógica de alternância de turnos junto com ele.

Dimensão por dimensão

• Modelo de interação — GPT-Live-1: duplex completo, interrupção nativa, escuta enquanto fala vs Breeze TTS 2: síntese de fala em streaming, sem qualquer entrada de áudio

• Pesos — GPT-Live-1: fechado, somente hospedado, um único ID de modelo e sem snapshots datados vs Breeze TTS 2: 3B parâmetros no Hugging Face desde 25 de agosto de 2026, código de inferência PyTorch Apache-2.0

• Licença — GPT-Live-1: termos comerciais via API da OpenAI, nada a revisar vs. Breeze TTS 2: uma licença de pesquisa e não comercial que abrange os pesos, ajustes finos, LoRAs, fusões, quantizações e saídas auto-hospedadas

• Unidade de preço — GPT-Live-1: US$ 0,05 por minuto de voz, cobrado por segundo, backend de raciocínio cobrado separadamente vs. Breeze TTS 2: US$ 34 por milhão de caracteres no endpoint hospedado, com redução escalonada até US$ 28 no plano publicado de nível mais alto

Evidência de qualidade — GPT-Live-1: 70,3% no Índice Speech to Speech da Artificial Analysis, sexto lugar empatado entre catorze modelos avaliados vs. Breeze TTS 2: 1.205 Elo na arena Provider Voices, sétimo no geral e primeiro entre modelos de pesos abertos, segundo a Artificial Analysis

• Idiomas — GPT-Live-1: a cobertura de lançamento sinaliza consistentemente fluência irregular fora dos principais idiomas, em comparação com o Breeze TTS 2: 50 declarados pelo fornecedor, com o cartão do modelo marcado para inglês e chinês

• Controle de voz — GPT-Live-1: doze vozes de API, tom e ritmo orientados por prompt, sem clonagem alguma vs Breeze TTS 2: clonagem por áudio de referência, design de voz sem referência, direção de voz e eventos vocais em linha

• Vazão — GPT-Live-1: medida por sessões simultâneas, limitada a 25 no nível 1 e a 500 no nível 5, sem nível gratuito, em comparação com Breeze TTS 2: cerca de 45 caracteres por segundo na medição da Artificial Analysis, o que é mais lento do que vários concorrentes comerciais e é relevante para trabalhos de formato longo

A two-column comparison scoreboard titled 'GPT-Live-1 vs Breeze TTS 2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Weights: closed, hosted only', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning'. The right column, labelled Breeze TTS 2, reads 'Kind: streaming text-to-speech', 'Price: $34 per 1M characters hosted', 'Weights: 3B on Hugging Face, research licence', 'Independent score: 1,205 Elo, 7th of 100+ on the AA Provider Voices arena', 'Latency: p50 133.6 ms time to first audio (vendor)', 'Voices: cloning, voice design, inline events'. The footer reads 'GPT-Live-1 interactivity OpenAI-reported and unreproduced; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

A licença está fazendo mais trabalho do que a tabela de classificação

O próprio cartão de modelo da BreezeBlue é invulgarmente direto quanto a isto, o que abona a favor da empresa. O código de inferência é Apache-2.0. Os pesos e quaisquer resultados que gere ao alojá-los por conta própria destinam-se a uso em investigação, e a implementação comercial exige uma subscrição paga de alojamento ou autorização escrita. Essa restrição estende-se explicitamente a modelos derivados, LoRAs, fusões e quantizações — o que fecha a brecha a que as pessoas normalmente recorrem.

Então, o enquadramento de “líder em pesos abertos” precisa de um qualificador que as manchetes raramente trazem. O Breeze TTS 2 é aberto no sentido de que você pode baixá-lo, inspecioná-lo, submetê-lo a benchmarks e executá-lo no seu próprio hardware para avaliação. Não é aberto no sentido que permite que uma startup construa um produto sobre ele sem pagar à BreezeBlue ou contratar uma revisão jurídica. Duas das três coisas que as pessoas querem dizer com pesos abertos — verificabilidade e custo — você tem. A terceira — liberdade de lançar — você não tem.

Isso é uma diferença real em relação a um modelo como o GPT-Live-1, em que a questão da licença não é "posso" mas "quanto". Ambos acabam numa fatura. Só um deles acaba primeiro num parecer de advogado.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the tags 'Text-to-Speech', Transformers, Safetensors, PyTorch, English and Chinese, the licence label 'breezeblue-research-and-non-commercial-license', the notice 'Source code is licensed under Apache 2.0. Breeze TTS 2 model weights, derivative models, and self-hosted outputs are for research and non-commercial use only', a news entry dated 2026.08.25 reading 'We release Breeze TTS 2 model weights and the PyTorch inference code', the claim that it 'ranks #1 among open-weight models on the Artificial Analysis TTS leaderboard', a model size of 3B params with F32 and BF16 tensor types, and the note 'This model isn't deployed by any inference provider'.

As duas unidades de preço não são comparáveis, então aqui está a aritmética.

$0,05 por minuto e $34 por milhão de caracteres parecem viver em universos diferentes porque de fato vivem. Para compará-los, é preciso converter. A fala flui a cerca de 150 palavras por minuto, e o inglês tem em média cerca de cinco caracteres e meio por palavra quando os espaços são contados, então um minuto de saída falada equivale a aproximadamente 800 a 900 caracteres. A $34 por milhão do Breeze TTS 2, isso dá cerca de três centavos de síntese por minuto — mais barato que os cinco do GPT-Live-1, na fala bruta.

A comparação desmorona imediatamente depois, porque os cinco centavos do GPT-Live-1 incluem a escuta. Ele também está transcrevendo o chamador, decidindo quando o turno termina e gerenciando a interrupção — trabalho que uma cascata tem de comprar em outro lugar: um modelo de reconhecimento de fala, um modelo de detecção de turno e um modelo de linguagem para produzir o texto que o Breeze TTS 2 lerá. Some isso e os três centavos de síntese da cascata ficam sob uma conta que geralmente é maior que a do modelo ponta a ponta.

O resumo honesto é que a voz mais barata é o Breeze TTS 2 e a conversa mais barata é o GPT-Live-1, e a diferença entre essas duas afirmações é tudo o que um agente de voz realmente custa.

A screenshot of the Artificial Analysis Provider Voices speech arena leaderboard, ranking text-to-speech models by blind-listener Elo. The table runs Cartesia Sonic 3.6 first on 1,275 Elo from 1,755 samples and $49.0 per million characters, then Inworld Realtime TTS-2 at 1,244, Speechify Simba 3.2 at 1,233 and Qwen-Audio-3.0-TTS-Plus at 1,232, down to BreezeBlue Breeze TTS 2 at 1,205 Elo from 1,227 samples, seventh overall, carrying the only Open Weights badge in the top ten at $34.0 per million characters with an August 2026 release date.

Onde eles realmente se encontrariam

Uma equipe que hoje esteja construindo um agente telefônico e não queira se comprometer com a stack ponta a ponta de um único fornecedor montaria exatamente esta cascata: Breeze TTS 2 ou um mecanismo comparável para a boca, outra coisa para os ouvidos e um modelo de linguagem roteado para o pensamento. O último desses três é a peça que muda com mais frequência — é onde a qualidade melhora mais rápido, onde o custo varia mais e onde o modelo que vence neste trimestre raramente é o que vencerá no próximo.

Essa camada é uma chamada de API normal, e é a única parte desta stack que vale a pena manter portável. Aproximadamente 190 modelos de onze provedores upstream ficam atrás de uma única chave do OrcaRouter pelo preço de tabela do provedor, sem markup, então trocar o modelo de raciocínio por trás de um agente de voz é uma mudança de configuração, e não um projeto de integração, e o failover automático impede que um backend que atinge timeout derrube a chamada. Nem o endpoint Live Sessions do GPT-Live-1 nem a API hospedada do Breeze TTS 2 são acessíveis dessa forma — as camadas de voz nesta comparação ficam fora do alcance de uma camada de roteamento, e vale a pena ser claro sobre isso em vez de sugerir o contrário.

Qual escolher

Escolha o GPT-Live-1 se a conversa for o produto e você puder aceitar um front end hospedado e fechado. Linhas de reservas, suporte de primeira linha, qualquer situação em que um chamador falando por cima do agente seja um evento normal em vez de uma exceção. Você está comprando o tratamento de interrupções, e está comprando a uma tarifa por minuto que permanece previsível, enquanto o raciocínio por trás disso é a parte que você ajusta.

Escolha o Breeze TTS 2 se você precisa de uma voz que possa inspecionar, se está construindo um produto em que a síntese é um componente entre muitos, ou se precisa de clonagem e design de voz que o GPT-Live-1 não oferece de forma alguma. Comece sabendo que os pesos são para pesquisa, que a alegação de 50 idiomas é uma alegação do fornecedor em contraste com um card marcado para dois idiomas, e que os números de latência são medições da própria BreezeBlue em um caminho rápido aquecido, e não uma auditoria independente.

O instinto de tratar isto como um concurso de qualidade é o instinto errado. O Breeze TTS 2 está perto do topo da tabela em que compete, e o GPT-Live-1 compete em uma tabela totalmente diferente. A decisão que realmente custa dinheiro é a que está subjacente às duas: qual modelo faz o trabalho de pensar, e se você consegue mudar de ideia sobre isso em uma tarde.