Cartela de título com Qwen3.8-LiveTranslate e o subtítulo "O meio segundo que coloca a interpretação por IA no ritmo humano" e três chips de estatísticas: atraso médio de 2,8 s para 2,3 s, 60 idiomas de origem, 29 idiomas com saída falada.
Engineering & Research

Conheça o Qwen3.8-LiveTranslate: O meio segundo que coloca a interpretação por IA no ritmo humano

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen3.8-LiveTranslate foi lançado em 19 de setembro de 2026, e todo o anúncio se resume a uma subtração. O atraso médio — LAAL, o desvio médio entre o momento em que uma palavra sai da boca do falante e o momento em que sua tradução chega ao ouvido do ouvinte — cai de 2,8 segundos na geração anterior para 2,3 segundos. Intérpretes humanos profissionais trabalham com um intervalo ouvido-voz de cerca de 2 a 3 segundos. É toda a história: não que uma máquina tenha ficado mais rápida, mas que seu atraso agora se situa dentro da faixa em que os ouvintes deixam de perceber que se trata de uma máquina. Os números de lançamento colocam a qualidade de tradução FLEURS da geração anterior em 83,0 xCOMET-XXL; esta é declarada em 85,7. Ambos os números são do fornecedor, produzidos em seu próprio ambiente de avaliação, e nenhuma parte independente os reproduziu ainda — o que é a ressalva mais importante deste artigo.

O que faz o lançamento valer a pena ser lido além da manchete é o mecanismo. A Qwen não reduziu a latência criando um reconhecedor mais rápido ou um sintetizador mais enxuto. Ela eliminou as costuras entre eles.

O que realmente mudou: as costuras desapareceram

A interpretação simultânea clássica é um pipeline de três estágios montado da mesma forma há uma década: o reconhecimento automático de fala transcreve o fluxo, a tradução automática converte a transcrição e a síntese de voz lê o resultado em voz alta. Cada estágio é um modelo separado com seu próprio orçamento de latência, e cada passagem perde algo — prosódia no primeiro, identidade do falante no terceiro, e algumas centenas de milissegundos fixos em cada fronteira, onde um módulo precisa esperar por tokens suficientes para ter confiança.

Qwen3.8-LiveTranslate substitui essa cascata pelo que o fornecedor chama de arquitetura Interleave, construída sobre uma espinha dorsal Hybrid MoE, dividida em dois módulos cooperantes:

Thinker — organiza vídeo, áudio, texto de origem e tradução em uma única sequência causal, intercalados em ordem temporal, e produz compreensão e tradução de ponta a ponta em uma única passagem, em vez de em três.

Talker — recebe o texto traduzido junto com o áudio original e sintetiza fala que mantém o timbre do falante de origem, de modo que a voz dublada seja reconhecível como a pessoa que falou.

A alegação arquitetural é que, como reconhecimento, tradução e síntese compartilham uma mesma estrutura de modelagem de sequências, em vez de passar mensagens através dos limites dos módulos, o sistema deixa de pagar a taxa intermodular duas vezes por enunciado. Essa é uma explicação plausível para a origem dos 0,5 segundos, e também é exatamente o tipo de alegação que é barata de afirmar e cara de verificar. Trate isso como a explicação do fornecedor, não como um resultado estabelecido.

As três capacidades que são genuinamente novas

A cobertura de idiomas não mudou: 60 idiomas de origem reconhecidos, 29 disponíveis para saída falada — as mesmas contagens do Qwen3.5-LiveTranslate. Os acréscimos interessantes são todos sobre o que acontece quando mais de uma pessoa está falando.

Diarização de locutor em tempo real — cada frase é atribuída a um locutor à medida que é falada, e a replicação do timbre de voz é descrita como mais estável ao longo das mudanças de turno. A Qwen relata uma taxa de erro de diarização de 9,7% em seu próprio conjunto de teste longo com vários locutores, contra 30,6% do Seed LiveInterpret 2.0. Ambos os números vêm da Qwen.

Origem e tradução no mesmo quadro — o modelo emite a transcrição original e o texto traduzido numa mesma linha do tempo, e é isso que torna possível um par de legendas bilíngues na tela sem uma segunda passagem de alinhamento.

Desambiguação de contexto longo — o contexto anterior é transportado adiante para que nomes, honoríficos e termos de domínio permaneçam consistentes. Esta é a que mais importa na prática: a falha clássica da interpretação simultânea não é uma palavra errada, mas sim a mesma pessoa ser traduzida de três maneiras diferentes em uma reunião.

Diarização é o item genuinamente diferenciador aqui. O Gemini 3.5 Live Translate, o modelo concorrente de fala para fala em tempo real do Google, tem dificuldades documentadas com a alternância de turnos — pode ter dificuldade para saber quando um falante realmente parou. A Qwen está reivindicando a propriedade oposta como um recurso. Nenhuma das empresas publicou uma comparação direta que resolva isso.

Screenshot of Alibaba Qwen team's own announcement page for Qwen3.8-LiveTranslate, showing the release headline, the Interleave architecture description with Thinker and Talker modules, and the stated average lagging figure of 2.3 seconds.

Lendo as alegações do benchmark com honestidade

Qwen foi testado em dois conjuntos, e vale a pena separá-los porque medem coisas diferentes.

FLEURS, 70 direções linguísticas — o benchmark de áudio multilíngue público e amplamente usado. A Qwen afirma liderança tanto sobre seu antecessor quanto sobre o que chama de atuais sistemas mainstream de interpretação em tempo real em qualidade de tradução, atraso médio, precisão de reconhecimento de fala e qualidade de síntese de fala. A comparação xCOMET-XXL de 85,7 contra 83,0 está aqui.

Omnilingua-MSpeaker, 14 direções de idioma — conjunto de avaliação de áudio longo com múltiplos falantes da própria Qwen. A empresa afirma maior fidelidade, fluência e concisão, além de uma taxa de erro de diarização menor. Um benchmark criado pelo fornecedor não é inútil, mas também não é evidência: foi projetado pelas pessoas cujo modelo está sendo avaliado nele.

O resumo honesto é que o FLEURS é real e público, portanto o 85,7 é pelo menos verificável em princípio; o Omnilingua-MSpeaker não é, então a vitória na diarização é uma alegação até que alguém repita o teste. Nenhum terceiro publicou números do Qwen3.8-LiveTranslate no momento da redação, e o modelo tem apenas algumas horas.

Quanto custa a API, e um número que vai te morder

O Qwen3.8-LiveTranslate tem pesos fechados e funciona somente via API. Ele roda por meio de uma API Realtime via WebSocket sob o ID de modelo qwen3.8-livetranslate-flash-realtime, e não por um endpoint HTTP simples. O preço é por milhão de tokens e, como os tokens de áudio são densos, as tarifas anunciadas parecem assustadoras perto das dos modelos de texto, até você se lembrar do que é um token de áudio:

Região de Singapura — entrada de áudio $7,50, entrada de imagem $0,55, saída de texto $20,00, saída de áudio $30,00 por milhão de tokens.

Região de Pequim — ¥40 de entrada de áudio, ¥3,3 de entrada de imagem, ¥100 de saída de texto, ¥160 de saída de áudio por milhão de tokens, o que equivale a aproximadamente $5,65 / $0,47 / $14,13 / $22,61 nas taxas atuais.

Contexto — 53.248 tokens no total, divididos em 49.152 de entrada máxima e 4.096 de saída máxima.

Limites de taxa — 10 solicitações por minuto e 100.000 tokens por minuto, idênticos em ambas as regiões.

Esse limite de taxa é o número a sublinhar. Dez pedidos por minuto é generoso para um punhado de salas de reunião e está longe de ser suficiente para uma implementação num centro de contacto ou uma transmissão em direto com milhares de fluxos simultâneos. A Qwen manteve o preço da interface praticamente estável em relação à geração anterior — as tarifas de Pequim mantêm-se inalteradas e Singapura é ligeiramente mais barata — mas um modelo que está arquiteturalmente pronto para escalar é disponibilizado como uma pré-visualização. Quem estiver a planear tráfego de produção deve encarar o teto de 10 RPM como a restrição vinculativa, e não o preço por token.

Single-column scoreboard for Qwen3.8-LiveTranslate listing average lag (LAAL) 2.3 seconds, languages 60 source and 29 spoken, context 53,248 tokens, input audio plus image, output text plus audio, and weights closed and API-only, with a footer reading 'All figures vendor-reported; no independent replication yet.'

Chamá-lo não é como chamar um modelo de chat

A Realtime API é orientada a eventos, o que é um modelo mental diferente de um endpoint de conclusão. Você abre um socket, recebe session.created, então envia um evento session.update para configurar a sessão antes que qualquer áudio se mova.

target_language é obrigatório e deve ser definido antes do primeiro fragmento de áudio — não há destino padrão implícito.

source_language é opcional e o padrão é a detecção automática.

output_modalities seleciona ["text"] para apenas transcrição ou ["text","audio"] para fala traduzida.

input_audio_buffer.append envia blocos PCM codificados em base64; response.text.delta e response.audio.delta retornam, com response.done marcando o fim de um turno.

Duas notas práticas. Primeiro, um navegador não consegue definir um Authorization como cabeçalho em um handshake WebSocket, então a conexão precisa ser aberta no lado do servidor e o áudio retransmitido para o cliente pelo seu próprio socket — isso não é algo que você conecta diretamente a um front-end. Segundo, a Qwen adverte explicitamente que o conjunto de parâmetros e eventos difere da geração anterior do LiveTranslate, então qualquer código escrito para o Qwen3.5-LiveTranslate precisa ser reexaminado em vez de apenas reapontado. Um endpoint de teste gratuito está em execução em omni.qwen.ai/live-translate se você quiser ouvir o atraso antes de investir tempo de engenharia.

O que ele deliberadamente não faz

Qwen lista um conjunto de capacidades como indisponíveis, e a lista é esclarecedora. Sem chamada de funções. Sem saída estruturada. Sem busca na web. Sem continuação de prefixo, cache de contexto ou inferência em lote. Sem ajuste fino.

Trata-se de um especialista, não de um generalista usando o chapéu de intérprete. Não vai executar o loop do seu agente, nem será o modelo que resume a reunião. Projete de acordo com isso: o intérprete produz uma transcrição e um fluxo de áudio traduzido, e tudo o que vem depois disso — o extrator de itens de ação, o aplicador de glossário, a gravação de retorno no CRM — é tarefa de um modelo de texto separado.

Essa divisão é onde um roteador conquista seu lugar. O próprio Qwen3.8-LiveTranslate está disponível por meio da API do próprio fornecedor e de várias plataformas de terceiros; ele não está no catálogo da OrcaRouter hoje, e não vamos fingir o contrário. O que a OrcaRouter oferece é a pilha ao redor — incluindo o carro-chefe Qwen3.8-Max da própria Alibaba, um modelo de mistura esparsa de especialistas com 2,4 trilhões de parâmetros e contexto de 1M tokens a US$ 2,00 por milhão de entrada e US$ 6,00 por milhão de saída, cobrado pelo preço de tabela do provedor, sem nenhuma margem repassada. Manter o interpretador e os modelos que consomem sua saída por trás de um único endpoint e de uma única chave significa que o pipeline de transcrição não precisa de um segundo contrato quando você troca o resumidor, e o failover automático mantém viva a metade downstream do sistema quando um único provedor oscila — o que, a 10 solicitações por minuto, é um cenário que vale a pena planejar em vez de descobrir.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

O que assistir em seguida

Duas coisas transformariam este lançamento de uma afirmação bem fundamentada em um fato consolidado. A primeira é uma medição independente de latência: LAAL é uma métrica bem definida, e qualquer pessoa com o endpoint de teste e um aparato de cronometragem pode produzir um número que a Qwen não gerou. A segunda é o próprio roteiro declarado da Qwen — aproximar-se do piso de latência, memória de longo prazo entre sessões e cobertura de idiomas de cauda longa e dialetos regionais. O item de cauda longa é aquele que se deve cobrar deles, porque 60 idiomas de origem é um número respeitável que exclui silenciosamente a maioria dos falantes do mundo, e a lacuna entre uma demonstração que funciona em mandarim e inglês e uma que funciona em iorubá ou quíchua é onde os produtos de interpretação em tempo real historicamente estagnaram.

Por ora, a posição razoável é que o Qwen3.8-LiveTranslate é o primeiro modelo de interpretação simultânea cujo número principal é enquadrado em relação a intérpretes humanos, e não ao seu próprio antecessor — e esse enquadramento é um teste muito mais difícil de passar do que aquele que ele substitui. Ele ainda não o passou. Apenas se voluntariou para ele.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente