
Realtime-Venus vs Qwen-Audio-3.0-TTS: Um lê o seu roteiro, o outro precisa ouvir você
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
A comparação tentadora entre Realtime-Venus e Qwen-Audio-3.0-TTS é o preço por hora de áudio, e ela produz uma resposta limpa que está totalmente errada. O Qwen-Audio-3.0-TTS-Plus renderiza fala a cerca de US$ 27,6 por milhão de caracteres, o que dá perto de US$ 1,66 por uma hora de áudio finalizado. O Realtime-Venus, o sistema full-duplex de 9B que a equipe Venus da Ant Group construiu com a Universidade Tsinghua, não tem preço nenhum porque não tem serviço hospedado — mas, se auto-hospedado, custaria um nó de GPU rodando continuamente, o que é pelo menos uma ordem de magnitude a mais por hora. O renderizador vence na aritmética. A aritmética está medindo dois produtos diferentes: o Qwen-Audio-3.0-TTS recebe texto e retorna áudio, e o Realtime-Venus recebe áudio e vídeo e retorna uma conversa. A pergunta que de fato os separa não é o que eles produzem. É se algo precisa responder.
A entrada faz toda a diferença
Qwen-Audio-3.0-TTS, lançado pelo Tongyi Lab da Alibaba Cloud em 20 de julho de 2026, é um modelo de conversão de texto em fala disponibilizado como uma API hospedada, sem pesos abertos. O texto entra por um endpoint HTTP e o áudio sai. Não existe caminho de entrada de áudio, nem turno a assumir, nem transcrição a retornar, e nem sequer o conceito de ser interrompido — o modelo nunca ouviu nada. Todo o seu modelo de custos é uma prensa tipográfica: caracteres entram, áudio sai.
Realtime-Venus, em contrapartida, está permanentemente à escuta. O checkpoint audiovisual contém um codificador visual SigLIP2 para frames em streaming e um codificador de áudio Whisper-Medium que alimenta um backbone Qwen3-8B, e ambos os checkpoints executam um loop de interação de um segundo que atualiza continuamente o estado da conversa e decide se deve falar ou permanecer em silêncio. Ele produz fala por meio de tokens S3 discretos e de um decodificador de flow matching em streaming, em vez de um estágio de síntese separado, e pode retornar texto junto com a forma de onda.
Isso não é uma diferença de funcionalidades. É a diferença entre um componente e um sistema. Coloque os dois lado a lado, e um deles pode ser encaixado em um pipeline que já tem um reconhecedor de fala e um modelo de linguagem antes dele. O outro substitui todos os três.
Um caso prático torna isso concreto.
Considere uma linha de suporte. Um cliente liga, descreve mal o problema, faz uma pausa no meio da frase para encontrar um número de conta, é interrompido por um anúncio de fundo e depois faz uma pergunta de acompanhamento antes que o atendente termine de responder.
Um sistema construído sobre o Qwen-Audio-3.0-TTS trata isso como três fornecedores e três faturas: um reconhecedor transforma a fala do chamador em texto, um modelo de linguagem decide o que dizer, e o Qwen-Audio-3.0-TTS a pronuncia. Cada salto adiciona latência, e cada fronteira é onde a prosódia morre. A falha crítica é estrutural — a etapa de TTS não consegue ouvir a pausa no meio de uma frase que já está pronunciando, então o barge-in precisa ser tratado por algo à sua frente.
O Realtime-Venus processa a mesma chamada como um único modelo, sem detector externo de atividade de voz, sem transferência. Os seus números no Full-Duplex-Bench v1.5 — 75% de resposta a interrupções e taxas de continuação de 97% em backchannels, 88% em fala dirigida a outros e 86% em fala de fundo — são exatamente as métricas que descrevem este cenário. São também autorreportados, do próprio relatório técnico do modelo, sem reprodução externa. Leia-os como uma alegação de design, não como uma medição.
Qualidade de voz: um tem um Elo, o outro não tem nada
Esta é a parte mais desequilibrada da comparação, e favorece a Alibaba por uma ampla margem.
• Pontuação independente — o Qwen-Audio-3.0-TTS-Plus ocupa o segundo lugar na Provider Voice Arena da Artificial Analysis, com Elo de 1.259 em 1.544 amostras, em 18 de setembro de 2026, atrás do Cartesia Sonic 3.6, com 1.277, e à frente do Inworld Realtime TTS-2, com 1.247, e do Speechify Simba 3.2, com 1.241.
• Onde começou — a própria coluna de lançamentos da arena lista este modelo como uma entrada de setembro de 2026, que é o tier conforme pontuado atualmente, e não a data de lançamento de 20 de julho de 2026. Sempre que mudou, manteve-se entre os dois primeiros o tempo todo.
• Realtime-Venus — nenhuma entrada em arena, nenhuma avaliação de voz por terceiros, nada. Sua única métrica relacionada a voz é uma pontuação VoiceBench AlpacaEval de 4,81 autorrelatada que o relatório descreve como equivalente ao melhor valor de comparação.
• O que isso significa — ninguém fora dos autores avaliou se o Realtime-Venus soa bem. Isso não é um ponto negativo contra ele; é simplesmente desconhecido, e desconhecido é diferente de ruim. Mas, se a qualidade da voz é o que se pretende entregar, comprar um modelo com classificação Elo é melhor do que aceitar um sem classificação por fé.


Idioma, vozes e controle expressivo
O modelo da Alibaba foi criado para a amplitude de entrega. Ele traz mais de mil vozes, cobre dezesseis idiomas — incluindo vinte regiões de dialetos chineses — e expõe 86 tags inline para emoção e entrega: uma superfície de controle que você escreve no próprio texto, além de instruções de entrega em linguagem natural. A saída chega a 48 kHz, contra 24 kHz da geração anterior, e uma única síntese pode durar até três minutos. O nível Flash tem como alvo cerca de 300 milissegundos até o primeiro pacote para reprodução em tempo real; o nível Plus é o nível de qualidade e gera a cerca de dezesseis caracteres por segundo, o que é lento o suficiente para importar em um produto ao vivo e imperceptível na renderização em lote.
O Realtime-Venus documenta inglês e chinês, inclui uma voz de referência junto com os pesos e oferece um decodificador de token para forma de onda, em vez de uma biblioteca de vozes. A expressividade no sentido do Qwen — tags, instruções, mil predefinições — não tem equivalente aqui. O que ele tem, em vez disso, é a capacidade de mudar sua entrega em resposta ao que está ouvindo, o que é um tipo diferente de controle expressivo e muito mais difícil de colocar em uma ficha técnica.
O custo de cada caminho, honestamente.
Há uma ressalva real quanto ao número da Alibaba antes que alguém faça orçamento com base nele. O valor amplamente citado de US$ 27,6 por milhão de caracteres não corresponde à própria página de preços da Alibaba em todas as capturas, e os níveis têm preços separados. Verifique o valor no nível da conta em vez de confiar em uma tabela de comparação, inclusive nesta.
O Realtime-Venus não tem preço de tabela porque não há nada para comprar. O custo é dois checkpoints 9B em BF16 — cerca de dezoito gigabytes de pesos cada, antes da memória de ativação — mais um loop de streaming contínuo, o que significa um nó de GPU que cobra por mês, quer alguém ligue ou não. Com volume constante, isso é mais barato por conversa do que uma API de voz medida. Com volume intermitente, é muito pior, e o ponto de cruzamento é a única questão financeira que importa.
Há um terceiro caminho pelo qual muitas equipes vão acabar optando, e vale a pena nomeá-lo porque ele muda a forma da decisão. Se você mantiver uma cascata, a única perna que precisa ser um modelo hospedado é a do meio — o raciocínio. O OrcaRouter não oferece nem o Qwen-Audio-3.0-TTS nem o Realtime-Venus; as duas camadas de voz estão fora do que servimos, e preferimos dizer isso a dar a entender o contrário. A perna de raciocínio é o que nós cobrimos: quase 200 modelos de texto atrás de uma única chave, pelo preço de tabela do provedor e sem markup, failover automático entre upstreams, para que uma tarde ruim em um provedor não derrube uma chamada ao vivo, uma DSL de roteamento que compõe vários modelos em uma única chamada, e fusão de modelos quando uma decisão merece mais de uma opinião. Em uma cascata, essa é a perna que você mais quer poder trocar sem negociar contrato, e aquela em que um corte de preço de um fornecedor chega no mesmo dia, em vez de na renovação.

A clonagem é uma faca de dois gumes
O Qwen-Audio-3.0-TTS consegue clonar uma voz a partir de uma curta amostra de referência, de forma interlinguística, e está documentado como robusto a entradas ruidosas ou reverberantes. Essa é a capacidade comercialmente mais útil da comparação e a maior superfície de conformidade. Um produto capaz de reproduzir qualquer falante a partir de dez segundos de áudio tem uma resposta muito mais longa a "de quem é essa voz, e quem consentiu com ela" do que um que só fala com as predefinições de um fornecedor.
O Realtime-Venus vem com uma voz de referência junto com os pesos. Você pode clonar com ela se tiver o áudio e a execução de treinamento, mas nada na versão foi projetado para facilitar isso — o que, para uma implantação auto-hospedada dentro de um perímetro de conformidade, é provavelmente a configuração padrão mais segura.
Qual deles você está realmente comprando?
Compre Qwen-Audio-3.0-TTS quando o áudio é o resultado. Narração, localização, acessibilidade, dublagem, qualquer fluxo de trabalho em que o texto existe antes do som e a qualidade por hora renderizada é a métrica. Comece no Flash se a reprodução for ao vivo, passe para o Plus quando a própria voz for o produto e precifique o fluxo de trabalho de clonagem separadamente da biblioteca de presets.
Recorra ao Realtime-Venus quando a entrada for uma pessoa e o sistema precisar se comportar como um ouvinte. Assistência com percepção da câmera, interação sem as mãos, qualquer coisa em que um humano vá interromper no meio da frase e esperar que o sistema lide com isso. A troca é brutal: você abre mão de uma voz com classificação Elo, de mil presets e de qualquer opção hospedada e, em troca, recebe o único dos dois que consegue ouvir você.
A maioria dos produtos quer ambos, em lugares diferentes. O que eles não devem compartilhar é um modelo de custos — preço por hora de áudio é a métrica certa para exatamente um desses dois modelos, e não é o que sustenta a conversa.
