
Qwen3.8-LiveTranslate vs Qwen 3.8: Uma colisão de nomenclatura, não uma luta justa
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pesquise por um desses modelos e o outro será mostrado a você. Qwen3.8-LiveTranslate, lançado em 19 de setembro de 2026, e Qwen3.8-Max — o modelo que a maioria das pessoas quer dizer quando escreve "Qwen 3.8" sem sufixo, com disponibilidade geral desde 3 de agosto de 2026 e atualizado como Qwen3.8-Max-0902 em 2 de setembro — compartilham um prefixo de geração e quase nada mais. Um é um sistema de interpretação simultânea que recebe áudio e devolve áudio traduzido e texto, cobrado por WebSocket sob o ID qwen3.8-livetranslate-flash-realtime. O outro é um generalista de mistura esparsa de especialistas com 2,4 trilhões de parâmetros e uma janela de contexto de 1M de tokens que não consegue ouvir absolutamente nada. Colocá-los frente a frente é um erro de categoria, e o fato de tantas pessoas chegarem a esse erro é a verdadeira história aqui: o fornecedor agora disponibiliza pelo menos quatro coisas distintas sob o nome Qwen 3.8, e o esquema de nomenclatura não diz qual delas você quer.
O que cada um realmente é
A geração Qwen 3.8 foi lançada em camadas ao longo do segundo semestre de 2026, e as camadas não são intercambiáveis.
Qwen3.8-Max é o carro-chefe hospedado: um modelo MoE esparso com cerca de 2,4 trilhões de parâmetros totais e aproximadamente 95 bilhões ativos por passagem direta, contexto de 1 milhão de tokens e entrada de texto, imagem e vídeo com saída apenas de texto. Seu preço é de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com leituras de cache a US$ 0,250 por milhão. As pontuações relatadas pelo fornecedor o colocam em 86,6 no Terminal-Bench 2.1, 92,6 no GPQA Diamond, 67,7 no SWE-bench Pro e 43,6 no Humanity's Last Exam.
Qwen3.8-2.4T-A95B é o lançamento de pesos abertos da mesma geração, publicado em 12 de agosto de 2026: 512 especialistas roteados em 92 camadas, 69 dessas camadas usando atenção linear, e aproximadamente 4,89 TB de pesos. É o modelo que a maioria das pessoas quer dizer com "Qwen 3.8" quando fala de executar algo por conta própria em vez de chamar uma API.
Qwen3.8-27B é o pequeno checkpoint aberto da mesma família, e Qwen3.8-LiveTranslate é o especialista — um intérprete de arquitetura Interleave construído sobre um design híbrido MoE Thinker–Talker, com 60 idiomas de origem reconhecidos e 29 disponíveis para saída falada.
O eixo que os separa não é o tamanho. É a modalidade. O Qwen3.8-Max não tem caminho de entrada de áudio nem qualquer saída de áudio. Pedir que ele interprete uma conversa ao vivo não é uma questão de fazer um prompt melhor; a capacidade não está no modelo.
O contraste da especificação
Colocados lado a lado, os dois modelos quase não se sobrepõem em nenhuma dimensão que importa para um comprador:
• Função principal — Qwen3.8-LiveTranslate: interpretação simultânea de fala para fala. Qwen3.8-Max: raciocínio geral, programação, trabalho agêntico e multimodal com texto.
• Modalidade de entrada — Qwen3.8-LiveTranslate: áudio e imagem. Qwen3.8-Max: texto, imagem e vídeo.
• Modalidade de saída — Qwen3.8-LiveTranslate: texto e áudio sintetizado. Qwen3.8-Max: somente texto.
• Janela de contexto — Qwen3.8-LiveTranslate: 53.248 tokens (49.152 de entrada / 4.096 de saída). Qwen3.8-Max: 1.000.000 de tokens.
• Pesos — Qwen3.8-LiveTranslate: fechado, somente API. Qwen3.8-Max: hospedado, com o irmão aberto Qwen3.8-2.4T-A95B publicado sob a mesma geração.
• Limites de taxa — Qwen3.8-LiveTranslate: 10 requisições e 100.000 tokens por minuto. Qwen3.8-Max: throughput hospedado padrão, sem limite de tempo real por requisição.
A disparidade de contexto é o que surpreende as pessoas. O Qwen3.8-Max suporta um milhão de tokens; o intérprete suporta cerca de cinco por cento disso. Mas um intérprete em tempo real não precisa de um contexto longo — precisa de uma memória curta e muito rápida. Seu limite de entrada de 49.152 tokens é dimensionado para levar adiante os últimos minutos de uma conversa, a fim de manter nomes e terminologia consistentes, que é exatamente o trabalho que a "desambiguação de contexto longo" faz. Julgar o intérprete pelo seu número de contexto é como julgar um motor de corrida pelo seu tanque de combustível.

Por que a comparação de preços é uma armadilha
Numa base por milhão de tokens, o interpretador parece dramaticamente mais caro que o carro-chefe: US$ 7,50 por milhão de tokens de entrada de áudio contra US$ 2,00 por milhão de tokens de entrada de texto, e US$ 30,00 por milhão de saída de áudio contra US$ 6,00 por milhão de saída de texto.
Essa comparação não faz sentido, e é o erro mais comum cometido em relação a essa classe de modelo. Tokens de áudio e de texto não são a mesma unidade. A fala é codificada em tokens de áudio com uma densidade que não tem relação com o mesmo conteúdo escrito — um minuto de conversa consome muito mais tokens de áudio do que sua transcrição consome tokens de texto, e o áudio de saída acrescenta um segundo fluxo por cima. Colocar as duas taxas lado a lado implica uma razão de custo que não existe na prática.
A diferença estrutural importa mais do que a diferença de preço. A Qwen cobra o intérprete por token, enquanto boa parte do mercado de fala em tempo real cobra por minuto de sessão. Esses dois modelos de precificação se comportam de maneira completamente diferente à medida que seu áudio fica mais baixo, suas sessões ficam mais curtas ou seus falantes pausam — um medidor por minuto cobra pelo silêncio, e um medidor por token não. Se você está montando um modelo de custos, a questão não é qual tarifa é menor; é qual medidor penaliza o formato do seu uso. E observe a divisão regional: os preços de Pequim são ¥40 / ¥3,3 / ¥100 / ¥160 por milhão para entrada de áudio, entrada de imagem, saída de texto e saída de áudio, respectivamente, materialmente abaixo das tarifas de Singapura, que é o tipo de diferença que só se torna visível quando você compara as duas linha por linha.
Mais um ponto a favor do intérprete em termos de custo: a Qwen manteve estas tarifas praticamente inalteradas face ao Qwen3.5-LiveTranslate, com Pequim sem alterações e Singapura ligeiramente mais barata. Uma nova geração que chega sem aumento de preço não é a norma neste mercado.
Pesos abertos versus apenas API é a verdadeira linha divisória
Se você está escolhendo entre esses dois por princípio, e não por capacidade, o fato decisivo é o licenciamento.
O Qwen3.8-Max está disponível em modo alojado, e os pesos da classe Max desta geração foram disponibilizados em código aberto como Qwen3.8-2.4T-A95B em agosto. Esse caminho existe, mas não é um caminho trivial: 4,89 TB de pesos são hardware de datacenter, e a licença de pesos abertos exige que organizações que faturam acima de 50 milhões de dólares num período de doze meses obtenham uma licença comercial da Alibaba Cloud.
O Qwen3.8-LiveTranslate não tem esse caminho. Ele tem pesos fechados e é somente via API, acessível por meio de uma WebSocket Realtime API que exige que target_language seja definido em um session.update evento antes que qualquer áudio se mova, não oferece suporte a chamadas de função, saída estruturada, cache de contexto, inferência em lote nem ajuste fino. Se o seu requisito é executar o interpretador no seu próprio hardware, este modelo não o atende e nenhum esforço de engenharia mudará isso.
Isso importa para um tipo específico de comprador: aquele que não pode enviar áudio a um terceiro — um hospital, um escritório de advocacia, um contratado do governo. Para todos os demais, a questão prática é se o intérprete é bom o suficiente para justificar a dependência, e a resposta para isso é uma medição que o Qwen ainda não permitiu que ninguém fizesse.

Escolher por cargo, não por nome
A resposta correta para "Qwen3.8-LiveTranslate ou Qwen 3.8" é que você provavelmente precisa da resposta para uma pergunta diferente.
• Se o trabalho for interpretação ao vivo — uma reunião, uma chamada, uma transmissão — apenas um destes consegue fazê-lo, e não é o carro-chefe.
• Se a tarefa é resumir o que foi dito, extrair itens de ação, responder a perguntas sobre a transcrição ou escrever o follow-up — só o modelo principal consegue fazer isso, e não é o intérprete.
• Se a tarefa for ambas as coisas, você estará construindo um pipeline e pagará a dois fornecedores com dois contratos e dois conjuntos de credenciais, a menos que consolide deliberadamente.
Esse terceiro caso é o mais comum, e é aí que executar as duas metades por trás de um único endpoint deixa de ser uma conveniência e passa a ser arquitetura. O Qwen3.8-Max está no OrcaRouter pelo preço de tabela do provedor de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída com markup zero repassado, então um corte de preço do Qwen chega à sua fatura no mesmo dia, em vez de só na próxima renovação de contrato, e o failover automático significa que a metade resumidora do pipeline não sai do ar quando um provedor tem uma hora ruim.
Para ser explícito quanto à outra metade, porque a distinção importa: o Qwen3.8-LiveTranslate não está no nosso catálogo. Ele está disponível pela própria API Model Studio da Alibaba e pelo endpoint de teste do fornecedor em omni.qwen.ai/live-translate, e não vamos dar a entender que roteamos um modelo que não roteamos. O que você pode colocar por trás de uma única chave hoje é a pilha downstream — os modelos que consomem o que o intérprete produz.

O problema de nomenclatura é o verdadeiro achado
Quatro modelos, um prefixo, nenhuma convenção de sufixo com que um leitor possa contar. "Qwen 3.8" pode se referir ao carro-chefe hospedado, ao checkpoint aberto de 2,4T, ao modelo pequeno de 27B ou ao interpretador, dependendo de quem está digitando e do que leu por último. As tabelas de benchmark publicadas não ajudam, porque o carro-chefe as tem e o interpretador quase não: o Qwen3.8-Max pode ser colocado no Terminal-Bench ou no GPQA Diamond, enquanto as evidências do Qwen3.8-LiveTranslate são um average lagging de 2,3 segundos, um xCOMET-XXL de 85,7 no FLEURS relatado pelo fornecedor e uma taxa de erro de diarização autodeclarada de 9,7%, sem replicação independente.
Portanto, a comparação que esta página existe para responder é, na verdade, um alerta. Antes de comparar o Qwen 3.8 com qualquer coisa, estabeleça de qual Qwen 3.8 você está falando. Se ele recebe áudio, é o intérprete, e é um especialista que você compra para um trabalho. Se recebe vídeo, é o carro-chefe, e é um generalista que você compra para os outros vinte. Qualquer avaliação que misture os dois produzirá uma conclusão sobre nenhum dos dois.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
