Título: 'Qwen3.8-LiveTranslate vs Qwen 3.8' com o subtítulo 'Uma colisão de nomes, não uma luta justa'.
Guides & Insights

Qwen3.8-LiveTranslate vs Qwen 3.8: Uma colisão de nomenclatura, não uma luta justa

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pesquise por um desses modelos e o outro será mostrado a você. Qwen3.8-LiveTranslate, lançado em 19 de setembro de 2026, e Qwen3.8-Max — o modelo que a maioria das pessoas quer dizer quando escreve "Qwen 3.8" sem sufixo, com disponibilidade geral desde 3 de agosto de 2026 e atualizado como Qwen3.8-Max-0902 em 2 de setembro — compartilham um prefixo de geração e quase nada mais. Um é um sistema de interpretação simultânea que recebe áudio e devolve áudio traduzido e texto, cobrado por WebSocket sob o ID qwen3.8-livetranslate-flash-realtime. O outro é um generalista de mistura esparsa de especialistas com 2,4 trilhões de parâmetros e uma janela de contexto de 1M de tokens que não consegue ouvir absolutamente nada. Colocá-los frente a frente é um erro de categoria, e o fato de tantas pessoas chegarem a esse erro é a verdadeira história aqui: o fornecedor agora disponibiliza pelo menos quatro coisas distintas sob o nome Qwen 3.8, e o esquema de nomenclatura não diz qual delas você quer.

O que cada um realmente é

A geração Qwen 3.8 foi lançada em camadas ao longo do segundo semestre de 2026, e as camadas não são intercambiáveis.

Qwen3.8-Max é o carro-chefe hospedado: um modelo MoE esparso com cerca de 2,4 trilhões de parâmetros totais e aproximadamente 95 bilhões ativos por passagem direta, contexto de 1 milhão de tokens e entrada de texto, imagem e vídeo com saída apenas de texto. Seu preço é de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com leituras de cache a US$ 0,250 por milhão. As pontuações relatadas pelo fornecedor o colocam em 86,6 no Terminal-Bench 2.1, 92,6 no GPQA Diamond, 67,7 no SWE-bench Pro e 43,6 no Humanity's Last Exam.

Qwen3.8-2.4T-A95B é o lançamento de pesos abertos da mesma geração, publicado em 12 de agosto de 2026: 512 especialistas roteados em 92 camadas, 69 dessas camadas usando atenção linear, e aproximadamente 4,89 TB de pesos. É o modelo que a maioria das pessoas quer dizer com "Qwen 3.8" quando fala de executar algo por conta própria em vez de chamar uma API.

Qwen3.8-27B é o pequeno checkpoint aberto da mesma família, e Qwen3.8-LiveTranslate é o especialista — um intérprete de arquitetura Interleave construído sobre um design híbrido MoE Thinker–Talker, com 60 idiomas de origem reconhecidos e 29 disponíveis para saída falada.

O eixo que os separa não é o tamanho. É a modalidade. O Qwen3.8-Max não tem caminho de entrada de áudio nem qualquer saída de áudio. Pedir que ele interprete uma conversa ao vivo não é uma questão de fazer um prompt melhor; a capacidade não está no modelo.

O contraste da especificação

Colocados lado a lado, os dois modelos quase não se sobrepõem em nenhuma dimensão que importa para um comprador:

Função principal — Qwen3.8-LiveTranslate: interpretação simultânea de fala para fala. Qwen3.8-Max: raciocínio geral, programação, trabalho agêntico e multimodal com texto.

Modalidade de entrada — Qwen3.8-LiveTranslate: áudio e imagem. Qwen3.8-Max: texto, imagem e vídeo.

Modalidade de saída — Qwen3.8-LiveTranslate: texto e áudio sintetizado. Qwen3.8-Max: somente texto.

Janela de contexto — Qwen3.8-LiveTranslate: 53.248 tokens (49.152 de entrada / 4.096 de saída). Qwen3.8-Max: 1.000.000 de tokens.

Pesos — Qwen3.8-LiveTranslate: fechado, somente API. Qwen3.8-Max: hospedado, com o irmão aberto Qwen3.8-2.4T-A95B publicado sob a mesma geração.

Limites de taxa — Qwen3.8-LiveTranslate: 10 requisições e 100.000 tokens por minuto. Qwen3.8-Max: throughput hospedado padrão, sem limite de tempo real por requisição.

A disparidade de contexto é o que surpreende as pessoas. O Qwen3.8-Max suporta um milhão de tokens; o intérprete suporta cerca de cinco por cento disso. Mas um intérprete em tempo real não precisa de um contexto longo — precisa de uma memória curta e muito rápida. Seu limite de entrada de 49.152 tokens é dimensionado para levar adiante os últimos minutos de uma conversa, a fim de manter nomes e terminologia consistentes, que é exatamente o trabalho que a "desambiguação de contexto longo" faz. Julgar o intérprete pelo seu número de contexto é como julgar um motor de corrida pelo seu tanque de combustível.

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: primary job live interpretation, input audio plus image, output text plus audio, context 53,248 tokens, weights closed and API-only, audio in and out $7.50 and $30.00. Qwen3.8-Max column: primary job general reasoning, input text plus image plus video, output text only, context 1,000,000 tokens, weights hosted with the open sibling 2.4T-A95B, text in and out $2.00 and $6.00. Footer reads 'LiveTranslate per Alibaba Cloud; Qwen3.8-Max per OrcaRouter. Neither independently audited.'

Por que a comparação de preços é uma armadilha

Numa base por milhão de tokens, o interpretador parece dramaticamente mais caro que o carro-chefe: US$ 7,50 por milhão de tokens de entrada de áudio contra US$ 2,00 por milhão de tokens de entrada de texto, e US$ 30,00 por milhão de saída de áudio contra US$ 6,00 por milhão de saída de texto.

Essa comparação não faz sentido, e é o erro mais comum cometido em relação a essa classe de modelo. Tokens de áudio e de texto não são a mesma unidade. A fala é codificada em tokens de áudio com uma densidade que não tem relação com o mesmo conteúdo escrito — um minuto de conversa consome muito mais tokens de áudio do que sua transcrição consome tokens de texto, e o áudio de saída acrescenta um segundo fluxo por cima. Colocar as duas taxas lado a lado implica uma razão de custo que não existe na prática.

A diferença estrutural importa mais do que a diferença de preço. A Qwen cobra o intérprete por token, enquanto boa parte do mercado de fala em tempo real cobra por minuto de sessão. Esses dois modelos de precificação se comportam de maneira completamente diferente à medida que seu áudio fica mais baixo, suas sessões ficam mais curtas ou seus falantes pausam — um medidor por minuto cobra pelo silêncio, e um medidor por token não. Se você está montando um modelo de custos, a questão não é qual tarifa é menor; é qual medidor penaliza o formato do seu uso. E observe a divisão regional: os preços de Pequim são ¥40 / ¥3,3 / ¥100 / ¥160 por milhão para entrada de áudio, entrada de imagem, saída de texto e saída de áudio, respectivamente, materialmente abaixo das tarifas de Singapura, que é o tipo de diferença que só se torna visível quando você compara as duas linha por linha.

Mais um ponto a favor do intérprete em termos de custo: a Qwen manteve estas tarifas praticamente inalteradas face ao Qwen3.5-LiveTranslate, com Pequim sem alterações e Singapura ligeiramente mais barata. Uma nova geração que chega sem aumento de preço não é a norma neste mercado.

Pesos abertos versus apenas API é a verdadeira linha divisória

Se você está escolhendo entre esses dois por princípio, e não por capacidade, o fato decisivo é o licenciamento.

O Qwen3.8-Max está disponível em modo alojado, e os pesos da classe Max desta geração foram disponibilizados em código aberto como Qwen3.8-2.4T-A95B em agosto. Esse caminho existe, mas não é um caminho trivial: 4,89 TB de pesos são hardware de datacenter, e a licença de pesos abertos exige que organizações que faturam acima de 50 milhões de dólares num período de doze meses obtenham uma licença comercial da Alibaba Cloud.

O Qwen3.8-LiveTranslate não tem esse caminho. Ele tem pesos fechados e é somente via API, acessível por meio de uma WebSocket Realtime API que exige que target_language seja definido em um session.update evento antes que qualquer áudio se mova, não oferece suporte a chamadas de função, saída estruturada, cache de contexto, inferência em lote nem ajuste fino. Se o seu requisito é executar o interpretador no seu próprio hardware, este modelo não o atende e nenhum esforço de engenharia mudará isso.

Isso importa para um tipo específico de comprador: aquele que não pode enviar áudio a um terceiro — um hospital, um escritório de advocacia, um contratado do governo. Para todos os demais, a questão prática é se o intérprete é bom o suficiente para justificar a dependência, e a resposta para isso é uma medição que o Qwen ainda não permitiu que ninguém fizesse.

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint, the required target_language session parameter, and the published per-million-token rates.

Escolher por cargo, não por nome

A resposta correta para "Qwen3.8-LiveTranslate ou Qwen 3.8" é que você provavelmente precisa da resposta para uma pergunta diferente.

• Se o trabalho for interpretação ao vivo — uma reunião, uma chamada, uma transmissão — apenas um destes consegue fazê-lo, e não é o carro-chefe.

• Se a tarefa é resumir o que foi dito, extrair itens de ação, responder a perguntas sobre a transcrição ou escrever o follow-up — só o modelo principal consegue fazer isso, e não é o intérprete.

• Se a tarefa for ambas as coisas, você estará construindo um pipeline e pagará a dois fornecedores com dois contratos e dois conjuntos de credenciais, a menos que consolide deliberadamente.

Esse terceiro caso é o mais comum, e é aí que executar as duas metades por trás de um único endpoint deixa de ser uma conveniência e passa a ser arquitetura. O Qwen3.8-Max está no OrcaRouter pelo preço de tabela do provedor de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída com markup zero repassado, então um corte de preço do Qwen chega à sua fatura no mesmo dia, em vez de só na próxima renovação de contrato, e o failover automático significa que a metade resumidora do pipeline não sai do ar quando um provedor tem uma hora ruim.

Para ser explícito quanto à outra metade, porque a distinção importa: o Qwen3.8-LiveTranslate não está no nosso catálogo. Ele está disponível pela própria API Model Studio da Alibaba e pelo endpoint de teste do fornecedor em omni.qwen.ai/live-translate, e não vamos dar a entender que roteamos um modelo que não roteamos. O que você pode colocar por trás de uma única chave hoje é a pilha downstream — os modelos que consomem o que o intérprete produz.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

O problema de nomenclatura é o verdadeiro achado

Quatro modelos, um prefixo, nenhuma convenção de sufixo com que um leitor possa contar. "Qwen 3.8" pode se referir ao carro-chefe hospedado, ao checkpoint aberto de 2,4T, ao modelo pequeno de 27B ou ao interpretador, dependendo de quem está digitando e do que leu por último. As tabelas de benchmark publicadas não ajudam, porque o carro-chefe as tem e o interpretador quase não: o Qwen3.8-Max pode ser colocado no Terminal-Bench ou no GPQA Diamond, enquanto as evidências do Qwen3.8-LiveTranslate são um average lagging de 2,3 segundos, um xCOMET-XXL de 85,7 no FLEURS relatado pelo fornecedor e uma taxa de erro de diarização autodeclarada de 9,7%, sem replicação independente.

Portanto, a comparação que esta página existe para responder é, na verdade, um alerta. Antes de comparar o Qwen 3.8 com qualquer coisa, estabeleça de qual Qwen 3.8 você está falando. Se ele recebe áudio, é o intérprete, e é um especialista que você compra para um trabalho. Se recebe vídeo, é o carro-chefe, e é um generalista que você compra para os outros vinte. Qualquer avaliação que misture os dois produzirá uma conclusão sobre nenhum dos dois.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente