
Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: Duas Metades de um Stack de Voz, Reprecificadas com Oito Dias de Diferença
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
O Gemini 3.8 Live é o modelo de fala para fala do Google, lançado em 15 de setembro de 2026 como gemini-3.8-live e gemini-3.8-live-extended-thinking na Live API. O Qwen-Audio-3.1-TTS é o modelo de conversão de texto em fala da Alibaba, anunciado na Apsara Conference, em Hangzhou, em 23 de setembro de 2026, oito dias depois, com um corte de preço de cerca de 70% na síntese de fala atrelado a ele. Esse intervalo de oito dias é o motivo pelo qual esta comparação vale a pena ser lida agora, e não em julho. Nada mudou nos papéis dos dois produtos — um escuta e fala, o outro lê texto em voz alta —, mas as duas metades de um pipeline de voz em produção foram reconstruídas ou tiveram seus preços reajustados dentro de uma única quinzena, e a aritmética que antes decidia esse confronto se deslocou silenciosamente.
Duas metades, renovadas com oito dias de diferença
Comece pelo que torna este pareamento incomum: os dois modelos não competem. Um produto de voz tem uma boca e tem um ouvido, e estes são um de cada. Gemini 3.8 Live fecha o ciclo — áudio e vídeo entram, áudio sai, interrupções tratadas, chamadas de ferramentas rodando por baixo da conversa. Qwen-Audio-3.1-TTS recebe uma string e uma voz de referência e retorna uma performance. Ele é mais uma boca do que qualquer outra coisa, e não está tentando ser um ouvido.
O que torna o timing de setembro interessante é que os dois anúncios miram extremos opostos da mesma linha orçamentária. O lançamento do Google em 15 de setembro foi uma história de capacidade sem nenhum movimento de preço associado; o anúncio da Alibaba em 23 de setembro foi basicamente uma história de margem, com nova capacidade vindo junto. Uma equipe que montou um pipeline híbrido em agosto recebeu, no espaço de oito dias, um motivo para reexaminar as duas pontas — e só uma dessas pontas ficou mais barata.
O que o lançamento 3.1 realmente mudou do lado do Qwen
Alibaba não lançou apenas um modelo em 23 de setembro. A geração 3.1 abrange cinco endpoints — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next e Qwen-Audio-3.1-Realtime — e apenas um deles, a camada TTS simples, é um substituto direto para quem já chama o modelo TTS 3.0.
Naquele nível, três coisas mudaram e uma delas é um custo de migração genuíno. O controle de entrega passou de um vocabulário fixo de 86 tags inline para instrução em linguagem natural: você descreve a emoção, o ritmo e o estilo que deseja em vez de inserir o colchete certo na posição correta. A transferência de timbre entre idiomas chegou, permitindo que uma única voz de referência carregue sua identidade por mandarim, cantonês, inglês e japonês. E o modelo agora tolera diretamente áudio de referência ruidoso ou com eco, sem uma etapa separada de redução de ruído. A cobertura de idiomas permanece inalterada em 16 idiomas informados pelo fornecedor, mais 20 regiões de dialetos chineses, e — vale a pena destacar, porque isso é deixado de lado em outros lugares — o próprio material da Alibaba diz que o nível 3.1 adiciona sete idiomas, o que não concilia com os 16 que a cobertura publicada da geração de julho listava. Trate ambas as contagens como informadas pelo fornecedor até verificar os idiomas específicos de que você precisa no Model Studio.
O produto genuinamente novo no lançamento é o Qwen-Audio-3.1-TTS-Next, que a Alibaba chama de modelo "Audiogen": uma única passagem que produz voz, efeitos sonoros e ambiência de fundo em conjunto, para diálogos com vários falantes, montagem de podcast e trabalho de cena. Ele custa US$ 0,848 por milhão de tokens de entrada e US$ 1,696 por milhão de tokens de saída no nó de Pequim, com limite de 3.000 caracteres de entrada, 240 segundos de áudio gerado para podcasts e 120 segundos nos demais casos, três requisições por segundo, aceitando até três clipes de referência de 30 segundos cada. Ele lida apenas com chinês e inglês. Se o seu pipeline for de um único narrador lendo um roteiro, esse produto é irrelevante para você; se for de dois apresentadores e uma base musical, é o motivo para olhar para este lançamento.
A costura é aquilo que você está realmente escolhendo.
Como os dois modelos não fazem o mesmo trabalho, a decisão não é uma competição direta. É uma questão de onde você coloca a transferência, e quanto você está disposto a pagar para que a emenda seja invisível.
Existem duas arquiteturas honestas. A primeira é uma única rede: o Gemini 3.8 Live lida com todo o turno, ouvindo o chamador, decidindo o que dizer e dizendo-o, e você aceita a voz que ele lhe dá — que você não pode clonar nem personalizar com sua marca. A segunda é uma cascata: reconhecimento, depois raciocínio, depois Qwen-Audio-3.1-TTS como a boca, oferecendo mil vozes, incluindo uma gravada pelo seu próprio talento, ao custo de latência entre duas ou três fronteiras de fornecedores e da prosódia que se perde quando uma frase é dividida em uma chamada de API.
A maioria das equipes acaba com ambos, e isso não é falta de coragem. Use o modelo em tempo real onde a latência é sentida — interrupção, confirmação, o "mm-hm" que diz ao chamador que você ainda está lá — e o modelo de síntese onde a qualidade é ouvida: a leitura longa de uma política, o número de confirmação lido num ritmo pausado, a voz da marca que tem de ser idêntica em cada chamada. A solução híbrida é a resposta correta para uma grande classe de produtos. É também aí que o modelo de custos se torna difícil, porque agora você está medindo duas unidades diferentes.

Com preço por hora de áudio, que é a única unidade em que ambos se encaixam
Google cobra a Live API por minuto; Alibaba cobra os níveis do Qwen TTS por caractere e por token. Para compará-los, é preciso escolher um normalizador, e o único defensável para voz é a hora de áudio finalizado.
• Medição de entrada — Gemini 3.8 Live por minuto de áudio, $0,005 de entrada e $0,018 de saída vs Qwen-Audio-3.1-TTS por milhão de caracteres, com o nível 3.0 Plus registrando cerca de $27,60 e o nível Flash cerca de $15 antes do corte, e o nível TTS Flash listado a 1,5 yuan por milhão de tokens de entrada e 12 yuan por milhão de tokens de saída depois dele
• Medição de saída — Gemini 3.8 Live a conversa bidirecional custa cerca de $1,38 por uma hora de conversa em tempo real na tabela, antes de qualquer cache vs Qwen-Audio-3.1-TTS um fluxo unidirecional, com o nível 3.1-Next a $0,848 por milhão de tokens de entrada e $1,696 por milhão de saída no nó de Pequim
• Ouve o interlocutor — Gemini 3.8 Live sim, entrada nativa de áudio e vídeo vs Qwen-Audio-3.1-TTS não, texto de entrada e áudio de saída
• Vozes — Gemini 3.8 Live uma voz, não clonável, não personalizável com marca vs Qwen-Audio-3.1-TTS mais de mil, com clonagem zero-shot a partir de áudio de referência ruidoso
• Idiomas — Gemini 3.8 Live 97 relatados pelo fornecedor, alternados no meio da conversa vs Qwen-Audio-3.1-TTS 16 relatados pelo fornecedor mais 20 regiões de dialetos chineses, com transferência de timbre entre mandarim, cantonês, inglês e japonês
• Controle de entrega — Gemini 3.8 Live prompt e contexto da conversa vs Qwen-Audio-3.1-TTS instrução em linguagem natural, substituindo as 86 tags embutidas da geração 3.0
• Pontuação independente — Gemini 3.8 Live 82,6 no Artificial Analysis Speech to Speech Index para a variante Extended Thinking e 76,0 para a padrão vs Qwen-Audio-3.1-TTS nenhuma; o número mais próximo do Qwen é 1.259 de Elo para o nível 3.0 Plus da geração anterior na Provider Voice Arena, que é uma pontuação do antecessor e não deste modelo
O corte percentual é cotado em relação a tarifas que variam por região e nível, então os 70% da manchete não são uma promessa sobre o seu tráfego, e a Alibaba Cloud também mudou a transcrição em tempo real no nó de Singapura de medição baseada em duração para medição baseada em tokens — que é uma base menos previsível, já que o silêncio e o contexto de múltiplos turnos aumentam o consumo de tokens. Compare a nova tabela de tarifas com o seu próprio áudio.

O que a atualização 3.1 não resolve
Aqui está a parte que é fácil de errar em ambas as direções. As melhorias da versão 3.1 não fazem do Qwen-Audio-3.1-TTS um candidato para o trabalho que o Gemini 3.8 Live faz — controlo baseado em instruções, transferência de timbre e tolerância a entradas ruidosas fazem dele uma boca melhor, e nenhuma delas lhe dá um ouvido. Da mesma forma, a posição do Gemini 3.8 Live nos benchmarks não lhe diz nada sobre se a sua voz de marca sobrevive a uma frase em cantonês.
Há também uma lacuna nas evidências que um corte de preço torna mais tentador ignorar. O Qwen-Audio-3.1-TTS não tem pontuação independente. Os 1.259 Elo que aparecem ao lado do nome Qwen no Provider Voice Arena pertencem ao Qwen-Audio-3.0-TTS-Plus, o modelo que está sendo substituído, medidos em 1.447 amostras. A própria linha do sucessor na Arena ainda não existe. Se o seu processo de aprovação final exige um número de terceiros — e, para uma voz de marca, provavelmente deveria —, o modelo mais novo é o que não o tem, e o nível mais barato é o que você ainda não consegue defender. O único evento que resolveria isto é o Qwen-Audio-3.1-TTS aparecer num painel de escuta cega.
Onde uma chave ajuda e onde não ajuda
Uma consequência do lançamento da versão 3.1 é fácil de passar despercebida, porque parece um detalhe de engenharia de prompt, e não de infraestrutura. Substituir 86 tags fixas no código por instruções em formato livre transforma suas orientações de entrega em artefatos de texto. Agora você gera, versiona e revalida cada uma delas em relação à interpretação do novo modelo — e o modo de falha é a deriva, não um erro, porque duas formulações de “caloroso, mas não sentimental” não terão o mesmo efeito.
Isso é um problema de inferência de texto em torno de um pipeline de fala, e é aí que somos úteis. O OrcaRouter não roteia o Qwen-Audio-3.1-TTS nem qualquer modelo Qwen-Audio, e também não roteamos os endpoints do Gemini 3.8 Live — nenhuma das metades dessa pilha é chamável por meio de nós, e nada aqui deve ser lido como uma afirmação de que seja. O que nós oferecemos é a camada que escreve e verifica o texto de direção: qwen/qwen3.8-flash e google/gemini-3.8-flash entre mais de 200 modelos a partir de uma única chave pelo preço de tabela do provedor, sem markup, com uma DSL de roteamento que compõe vários modelos em uma única chamada e failover automático quando um upstream se degrada. Quando você está prestes a revalidar dez mil prompts de entrega com um modelo que acabou de mudar a forma como os lê, gerar as variantes e pontuá-las para consistência é a parte que deveria ser um único contrato, não quatro.
O que medir antes de escolher
Três experimentos respondem mais do que qualquer diretoria. Pegue uma voz de referência e um parágrafo do seu próprio roteiro e passe pelo Qwen-Audio-3.1-TTS, e ouça se o controle baseado em instruções lhe dá a mesma locução duas vezes — esse é o risco de migração, e é mais barato medir do que planejar em torno dele. Pegue uma gravação de chamada real com o seu próprio ruído de fundo e passe pelo Gemini 3.8 Live, e verifique se a troca de turnos se mantém quando o interlocutor interrompe no meio da palavra — é isso que o índice de fala para fala tenta quantificar, e ele não sobrevive ao contato com uma linha telefônica real de maneira confiável o suficiente para ser aceito por fé. E faça as contas com o seu próprio volume em horas de áudio, em vez de nas unidades em que os dois fornecedores faturam, porque nesse pareamento específico a diferença de preço esperada entre "TTS chinês barato" e "carro-chefe do Google" nunca foi tão grande quanto parece, e depois de 23 de setembro ela é ainda menor.

Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
