
GPT-Live-1 vs Qwen-Audio-3.0-TTS: Uma Conversa e um Narrador Não São o Mesmo Item de Linha
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código

Coloque GPT-Live-1 e Qwen-Audio-3.0-TTS lado a lado no preço por hora de áudio, e a diferença parece decisiva: o Qwen-Audio-3.0-TTS-Plus da Alibaba gera fala a US$ 27,6 por milhão de caracteres, cerca de US$ 1,66 de áudio por hora, enquanto o GPT-Live-1 da OpenAI cobra US$ 3,00 por uma hora de linha aberta contínua. O narrador é mais barato, então o narrador vence — exceto que esta é a comparação errada, e o motivo de ela estar errada é a coisa mais útil que qualquer pessoa pode tirar desse confronto. O Qwen-Audio-3.0-TTS é um modelo de texto para fala. O GPT-Live-1 é um modelo conversacional full-duplex. Um deles lê o que você escreveu. O outro precisa decidir, várias vezes por segundo, se você terminou de falar.
Um renderiza, um conversa
A conversão de texto em fala recebe texto e retorna áudio. Não há áudio de entrada, não há turno a assumir, não há noção de ser interrompido e não há transcrição a retornar, porque o modelo nunca ouviu nada. Seu modelo de custo é uma prensa tipográfica: páginas entram, áudio sai; qualidade e throughput são os únicos dois números que importam, e você pode medir ambos antes de lançar.
Um modelo conversacional full-duplex processa o áudio de entrada enquanto produz áudio de saída. Seu trabalho inclui as partes de uma conversa que não têm nada a ver com palavras — pausar quando o usuário pausa, continuar durante um backchannel como “yeah” em vez de tratá-lo como uma interrupção, ceder a palavra no meio da frase e disparar uma chamada de ferramenta sem perder o fio da conversa. O GPT-Live-1 faz tudo isso e retorna transcrições de reconhecimento de fala junto com a sessão, o que só consegue fazer porque estava ouvindo o tempo todo.
Se o seu produto lê artigos em voz alta, converte documentação em áudio ou narra um vídeo, o GPT-Live-1 é a ferramenta errada a quatro vezes o preço por hora. Se o seu produto recebe uma chamada telefônica, o Qwen-Audio-3.0-TTS é um terço de um pipeline que ainda precisa de um modelo ASR e de um modelo de linguagem para se tornar uma conversa.
Onde o Qwen-Audio-3.0-TTS é genuinamente a melhor resposta
O argumento a favor do modelo da Alibaba não é marketing. Lançado em 20 de julho de 2026 pelo Tongyi Lab da Alibaba e disponibilizado como uma API hospedada e fechada por meio do Alibaba Cloud Model Studio, o nível Plus assumiu o primeiro lugar na arena de conversão de texto em fala da Artificial Analysis quando chegou. No entanto, um ranking é um alvo móvel, e este se moveu: em setembro de 2026, o Qwen-Audio-3.0-TTS-Plus ocupa o quarto lugar na Provider Voice Arena, com um Elo de 1.232 em 2.306 amostras, atrás do Cartesia Sonic 3.6, com 1.275, do Inworld Realtime TTS-2, com 1.244, e do Simba 3.2 da Speechify, com 1.233 — três modelos de agosto e julho que foram lançados depois dele. Quarto entre mais de vinte, com a liderança perdida e a vantagem de preço intacta, ainda é uma posição forte. Só não é a posição que a cobertura do lançamento descreveu.

Ele lidera em 10 dos 16 idiomas que cobre, adiciona 20 regiões de dialetos chineses, oferece suporte à clonagem de voz a partir de amostras curtas, incluindo clonagem entre idiomas, e traz 86 tags inline de emoção e entrega.
As ressalvas são específicas o suficiente para se planejar em torno delas.
• Vazão — O Plus gera cerca de 16 caracteres por segundo, contra 30,2 do Simba 3.2, 27 do Gemini 3.1 Flash TTS e cerca de 120 do Sonic 3.5. Para renderização em lote, isso é invisível; para um produto ao vivo, é o número que determina seu buffer.
• Documentação de preços — os amplamente citados US$ 27,6 por milhão de caracteres não correspondem à própria página de preços da Alibaba em todos os instantâneos, que em determinados momentos listou valores mais baixos para ambos os planos. Verifique o número atual no nível da conta antes de fazer sua previsão, e não o do ranking.
• Biblioteca de vozes — apesar dos 16 idiomas compatíveis, as vozes predefinidas públicas são quase inteiramente em chinês e inglês. Os outros catorze idiomas existem por meio do fluxo de trabalho de clonagem, e não prontos para uso.
• Restrição de recursos — as 86 tags de emoção inline funcionam apenas no modo de streaming unidirecional, então o controle expressivo não sobrevive a todos os caminhos de integração.
• Níveis — o Flash tem como alvo cerca de 300 ms de latência do primeiro pacote para uso em tempo real; o Plus é o nível de qualidade. São produtos diferentes com o mesmo nome, e escolher o errado é um erro inicial comum.
A versão honesta do projeto de lei em cascata
Eis o que a comparação por hora deixa de fora. Um produto conversacional construído sobre um modelo de TTS é uma cascata: um modelo de ASR transforma a fala do chamador em texto, um modelo de linguagem decide o que dizer, e o modelo de TTS a pronuncia. Três fornecedores, três faturas, três orçamentos de latência que se somam, e uma transferência em cada fronteira onde a prosódia morre. A etapa de TTS pode custar US$ 1,66 por hora de áudio. As outras duas etapas são onde o dinheiro e os erros de fato estão — e o modelo em cascata não consegue ouvir uma pausa no meio de uma frase que já está falando.
O GPT-Live-1 reduz as três pernas a uma única sessão e um único medidor, a US$ 0,05 por minuto de voz, com o backend de raciocínio cobrado separadamente. Dois detalhes mantêm essa conta honesta. A inicialização da sessão cobra 15 segundos de voz antecipadamente, que são abatidos da duração posterior em vez de somados a ela. E o backend é um segundo medidor: cada chamada de raciocínio delegada, invocação de ferramenta e pesquisa na web é cobrada pelas tarifas normais desse modelo, então direcionar a delegação para um raciocinador de fronteira que pesquisa a cada turno produz uma chamada cara por trás de uma camada de voz barata.
O que os painéis independentes dizem sobre os dois é instrutivo precisamente porque medem coisas diferentes e nenhum deles favorece seu objeto. Qwen-Audio-3.0-TTS-Plus é o quarto em qualidade e está perto do fim em throughput. GPT-Live-1 é o sétimo de onze no Speech to Speech Index da Artificial Analysis, com 69,8% — atrás do GPT-Realtime-2.1 que ele substitui, com 73,9% — enquanto é cobrado na extremidade mais baixa da faixa de custo por hora de áudio de entrada do índice, $4,42 contra $10,75 do GPT-Realtime-2.1. Nenhum dos modelos conquista o primeiro lugar em sua própria categoria. Ambos são mais baratos do que aquilo que foram feitos para superar.

Esse segundo medidor é onde uma camada de roteamento se torna uma decisão de design em vez de uma otimização. O OrcaRouter não carrega nem GPT-Live-1 nem Qwen-Audio-3.0-TTS — a camada de voz, em ambos os casos, está fora do nosso alcance, e não roteamos nada dela. A perna de raciocínio não. Cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave ao preço de tabela do provedor, sem markup, e um corte de preço de um provedor chega no mesmo dia, em vez de na próxima renovação de contrato. Para uma cascata, isso cobre a perna intermediária de imediato: mantenha duas opções de ASR e três modelos de raciocínio atrás de um único endpoint, faça A/B entre eles com tráfego real e deixe o failover automático absorver uma tarde ruim de um upstream sem derrubar uma chamada.
A questão do consentimento funciona no sentido oposto.
A clonagem de voz é a capacidade comercialmente mais útil do Qwen-Audio-3.0-TTS e sua maior superfície de conformidade. Dez segundos de áudio de referência bastam para reproduzir um falante, entre idiomas, o que é transformador para a localização e um risco em qualquer contexto em que a identidade importe. A OpenAI lançou o GPT-Live-1 sem clonagem e sem vozes personalizadas — 12 vozes de API para escolher, e essa é a lista.
Essa assimetria é fácil de ignorar numa comparação de recursos e difícil de ignorar numa revisão de riscos. Um produto que só fala com uma entre doze vozes de fornecedores tem uma resposta muito mais curta para "de quem é essa voz, e quem consentiu com ela" do que um produto que consegue reproduzir qualquer voz a partir de uma amostra. Se você precisa de clonagem, a decisão de pipeline já foi tomada para você, e a questão passa a ser o que a governa. Se não precisa, a limitação do GPT-Live-1 vale a pena ser lida como um controle que você não precisou construir.
Qual comprar
Compre o Qwen-Audio-3.0-TTS se a saída for conteúdo: narração, localização, áudio de acessibilidade, dublagem, ou qualquer fluxo de trabalho em que o texto exista antes do áudio e a métrica seja a qualidade por hora renderizada. Comece no Flash se precisar de reprodução em tempo real, passe para o Plus quando a própria voz for o entregável e precifique o fluxo de trabalho de clonagem separadamente das vozes predefinidas.
Compre o GPT-Live-1 se a entrada for uma pessoa. Linhas de suporte, fluxos de agendamento, entrevistas de admissão, qualquer coisa em que a primeira sílaba do usuário chegue enquanto o modelo está no meio da frase e o sistema tenha de se comportar como ouvinte, e não como falante. Custa mais por hora de áudio, e é o único dos dois que pode ser interrompido.
Os dois são complementares muito mais frequentemente do que rivais: muitos produtos querem o Qwen-Audio-3.0-TTS lendo um documento e um modelo duplex cuidando da chamada que se segue. O que eles não devem compartilhar é um modelo de custos. Por hora de áudio é a métrica certa para exatamente um deles.
