Cartão de título de destaque para o Qwen3.8-27B, o modelo denso de visão-linguagem de 27 bilhões de parâmetros da linha Qwen3.8 da Alibaba, com o subtítulo '27B denso - visão-linguagem nativa - Apache 2.0' e três chips de recursos com os textos 'contexto de 262.144 tokens', 'entrada de texto + imagem + vídeo' e 'saída de texto', com o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Qwen3.8-27B: O Modelo Multimodal Compacto na Linha Qwen3.8 da Alibaba

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen3.8-27B é o membro denso de nó único da geração Qwe​n3.8 da Aliba​ba: um modelo nativo de visão e linguagem de 27 bilhões de parâmetros, publicado no Hugging Face sob Apache 2.0, que aceita texto, imagens e vídeo e retorna texto com uma janela de contexto de 262.144 tokens. Esta é a página de referência para esse modelo — a descrição canônica do que ele é, de quanto custa chamá-lo e do que ele pode fazer — e vale dizer desde já por que existe uma página para um modelo cujos pesos apareceram pela primeira vez em agosto de 2026, e não nos últimos sete dias. Não estamos noticiando um lançamento. Estamos respondendo a uma pergunta recorrente: leitores chegam até nós pelo nome "Qwen3.8-27B" milhares de vezes por mês, e até agora nenhuma página nossa detinha essa resposta. O próprio lançamento do modelo, datado no card do Qwe​n e registrado como 2026-08-14 pela Artificial Analysis, é um fato que esta página usa para datar o modelo, não um evento que ela relata.

Leia isso como a exceção que é: numa leitura estrita de sete dias, um modelo de meados de agosto de 2026 não é recente, e este item seria descartado como notícia. A justificativa aqui é diferente. É uma página de referência cujos números foram verificados com base no próprio model card da Qwe​n, no arquivo de licença do repositório, na tabela de preços da Qwe​n Cloud e na Artificial Analysis em 2026-09-28, e cuja razão de existir é a demanda de busca que medimos em primeira mão no mesmo dia. Não é um segundo anúncio, e ninguém deve lê-lo como tal.

Onde o 27B se posiciona na linha Qwen3.8

A geração Qwe​n3.8 não é um único modelo, e o sufixo de tamanho é o ponto central do nome. As próprias notas de repositório da Qwe​n em toda a família tornam a divisão explícita:

• Qwen3.8-27B — 27B de parâmetros densos, entrada nativa de imagem e vídeo, Apache 2.0. O integrante fácil de implantar: um modelo dimensionado para rodar em uma única GPU ou em um nó pequeno, e o tema desta página.

• Qwen3.8-Max, construído sobre o Qwen3.8-2.4T-A95B — 2,4 trilhões de parâmetros totais com 95B ativos, o modelo da classe Qwen-Max que a Alibaba disponibilizou pela primeira vez nesta geração. Seu repositório traz uma licença personalizada qwen3.8-max em vez de Apache 2.0.

• Qwen3.8-Flash-Next — a prévia experimental da arquitetura que a Qwen diz que servirá de base para o Qwen4, lançada sob a licença qwen-community-1.0. O Qwen3.8-Flash hospedado é construído sobre ela.

Portanto, "27B" não é um nível de acabamento do modelo Max; é a classe de tamanho que uma única equipe consegue realmente atender. O que a Alibaba alega que ele herda é a receita de treinamento: a ficha descreve o Qwen3.8-27B como algo que pega os avanços da geração em programação, trabalho profissional, pesquisa e tarefas agênticas de longo horizonte e os comprime em um checkpoint denso.

Scoreboard infographic titled 'Qwen3.8-27B - the scoreboard' with six rows: Parameters 27B dense (27.8B with vision), Context 262,144 native and 1M with YaRN, Modalities text + image + video in and text out, Licence Apache 2.0 with commercial use, Terminal Bench 2.1 of 73.0 marked vendor-reported, and AA Intelligence Index 33.7 marked independent, with a footer reading 'Qwen figures vendor-reported and unreproduced; AA figures per Artificial Analysis.' and the OrcaRouter logo in the bottom-right corner.

A arquitetura que a Qwen publica

Todos os números abaixo são do cartão de modelo em Qwe​n/Qwen3.8-27B, que é a documentação do próprio fornecedor:

• Parâmetros — 27B conforme divulgado. Os próprios metadados de safetensors do repositório totalizam 27.781.427.952 parâmetros em BF16 distribuídos por 18 shards, portanto cerca de 27,8B quando a torre de visão é contabilizada. Não há mixture-of-experts aqui: todos os parâmetros estão ativos em cada token.

• Formato — 64 camadas, dimensão oculta 5.120, dimensão intermediária feed-forward 17.408, embedding de tokens e saída LM 248.320 (com padding).

• Atenção híbrida — o layout que o Qwe​n imprime é 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): três blocos de atenção linear para cada bloco de atenção completa, uma proporção de 3:1. O Gated DeltaNet executa 48 cabeças de atenção linear para V e 16 para QK com dimensão de cabeça 128; o Gated Attention executa 24 cabeças de consulta contra 4 cabeças KV com dimensão de cabeça 256, com uma dimensão rotacional de 64. É essa proporção que torna uma janela de 262K acessível em um modelo de 27B, e é a mesma linhagem que o Qwen3.8-Flash-Next estende com atenção esparsa.

• Previsão multi-token — o cartão indica que o modelo é treinado com MTP em várias etapas, o truque de rascunho que acelera a geração em pilhas de serving compatíveis com MTP.

• Controle de pensamento — o modo de pensamento está ativado por padrão e pode ser desativado por solicitação. reasoning_effort aceita xhigh (o padrão), medium ou low, e preserve_thinking está ativado por padrão, de modo que os traços de raciocínio persistam entre turnos em vez de serem regenerados.

Janela de contexto e limite de saída

O card afirma 262.144 tokens nativamente, expansível para 1.000.000 com escalonamento RoPE (YaRN). A própria orientação de serving do Qwen para execuções agênticas longas, dentro desse envelope de 1M, é permitir até 262.144 tokens para conteúdo de raciocínio e até 131.072 tokens para a resposta final — o teto é uma configuração de serving, não uma propriedade fixa do checkpoint.

Vale a pena manter duas janelas separadas, porque são fáceis de confundir. Os pesos abertos rodam nativamente a 262.144; a versão hospedada no Qwe​n Cloud, que o cartão de modelo descreve como ainda por vir ("o serviço chegará em breve"), está listada na página de modelo do Qwe​n Cloud com contexto de 1M, entrada máxima de 991K, saída máxima de 131K e orçamento máximo de raciocínio de 262K. A ficha técnica do produto hospedado não é a ficha técnica do checkpoint.

Modalidades: o que entra e o que sai

A entrada é texto, imagem e vídeo; a saída é apenas texto. O card chama o Qwen3.8-27B de "um modelo nativo de visão e linguagem que entende imagens e vídeos", e seu código de exemplo aceita os três tipos de entrada. Não há entrada de áudio, geração de imagem nem saída de fala. O registro de modelo da Artificial Analysis para o mesmo checkpoint concorda quanto ao envelope — imagem, vídeo e texto na entrada, texto na saída —, o que é uma segunda leitura útil porque não é a página da própria Alibaba.

O que a versão Apache 2.0 realmente permite

A licença não é um resumo em um post de blog; o repositório contém o próprio texto da Licença Apache, Versão 2.0, e os metadados do card declaram license: apache-2.0. O que isso concede, conforme lido no texto da licença: uma licença de direitos autorais perpétua, mundial e livre de royalties para reproduzir, preparar obras derivadas, exibir publicamente, sublicenciar e distribuir a obra e suas derivadas, e uma licença de patente concedida pelos contribuidores — uso comercial entre os propósitos permitidos e nenhuma restrição de campo de uso, nenhum limite de número de usuários e nenhum acordo comercial separado. O Apache 2.0 também é permissivo no sentido que importa para o lançamento de produtos: os pesos derivados podem ser redistribuídos sob termos diferentes, desde que você mantenha a licença e os avisos de atribuição e declare o que alterou (Seções 4–4c). A Seção 6 não concede direitos ao nome Qwe​n ou às marcas registradas, portanto um fork do Apache-2.0 não pode se promover como Qwe​n.

A comparação dentro da família é instrutiva, e é visível a partir dos repositórios, e não da cobertura: o checkpoint 2.4T-A95B se autodenomina outro com uma licença qwen3.8-max, e o Qwen3.8-Flash-Next usa qwen-community-1.0. O 27B é o que, dos três, vem sob Apache 2.0 puro.

A posição de referência independente

A Artificial Analysis executou o modelo, e o seu registro merece ser separado da tabela da própria Alibaba, porque os dois respondem a perguntas diferentes. O índice independente, medido na xhighconfiguração

• Índice de Inteligência 33,7 — valor armazenado da Artificial Analysis, que a página do modelo apresenta arredondado para 34. Publicam-se duas classificações e estas medem universos diferentes: o próprio painel de resumo dessa página coloca o modelo em 1.º de 142 modelos na sua classe de tamanho, na comparação dentro da mesma classe descrita na dica da página, ao passo que a linha do nosso catálogo proveniente da Artificial Analysis regista 45.º de 145, cerca do percentil 67. Nenhuma é uma classificação face ao mesmo universo que a outra, por isso não as leia como um único número em dois formatos.

• Índice de Programação 68.1 — registrado em nosso catálogo com artificialanalysis.ai como sua fonte nomeada, classificado em 35º de 138 no conjunto desse índice. O modelo está mais bem posicionado em programação do que em inteligência geral, o que é consistente com o formato da própria tabela do fornecedor.

• Escada de esforço, mesma estrutura de avaliação — reduzir o esforço de raciocínio move o índice consideravelmente: 33,7 em xhigh, 27,6 em médio, 26,2 em baixo, e 20,2 com o raciocínio totalmente desativado. Essa é uma variação medida de 13,5 pontos, e é o argumento mais concreto para ajustar o esforço por carga de trabalho, e não por modelo.

• Onde as duas fontes concordam e discordam — no GPQA Diamond, o cartão da Aliba​ba reporta 89,2 e a Artificial Analysis mede 90,5. No Humanity's Last Exam, o cartão reporta 30,8 e a Artificial Analysis 33,9. Próximos, mas não o mesmo número, e isso é normal: diferentes harnesses, diferentes execuções. Um alerta pertence ao artigo e não a uma nota de rodapé — nenhum terceiro publicou um confronto direto entre o Qwen3.8-27B e qualquer um dos modelos na tabela comparativa da Aliba​ba executado com esforço equivalente em um harness equivalente, portanto, toda comparação entre modelos nesta página é uma comparação de medições separadas, não um resultado.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B in its xhigh configuration showing a same-class comparison rank of 1 of 142 next to an Intelligence tile, 46.6 output tokens per second at rank 55 of 142, $0.50 per million input tokens and $3.00 per million output tokens, a 256k-token context window, 27B total parameters, an Apache 2.0 licence, an open-weights marker and a release month of August 2026, with the summary text reporting a score of 34 on the Artificial Analysis Intelligence Index.

O que o Qwen reporta, e como lê-lo

O cartão do modelo traz cerca de duas dúzias de pontuações com colunas de comparação para Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B e Opus4.6 Max. Tudo é informado pelo fornecedor e não reproduzido — avaliação da própria Aliba​ba, impressa pela Aliba​ba — e várias linhas usam um harness do Claude Code avaliado por uma build do GPT-5.4, conforme afirmam as notas de rodapé do cartão. Os números de destaque do fornecedor, com base nisso:

• Codificação agêntica em terminal — Terminal Bench 2.1 (Terminus) 73,0, contra 63,4 do Qwen3.6-27B que ele substitui, com o Opus4.6 Max liderando a linha com 78,2.

• Codificação agêntica — SWE-bench Pro 61,7, QwenSWEBench 79,0, DeepSWE 1.1 42,2, NL2Repo-Bench 42,3, LiveCodeBench v6 90,3.

• Agentes e trabalho de escritório — CoWorkBench 70.7, JobBench 33.4, Agents' Last Exam 42.9 por pontuação (Pass@1 20.4).

• Raciocínio geral — GPQA Diamond 89,2, HLE 30,8, IFBench 79,5. Opus4.6 Max lidera ambas as linhas de raciocínio na própria tabela do fornecedor, com 91,3 e 40,0.

• Visão e uso de computador — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.

O resumo honesto dessa tabela é mais restrito do que a tabela aparenta. Em comparação com seu antecessor direto, os ganhos são grandes e consistentes — QwenSWEBench 79,0 contra 49,3, DeepSWE 42,2 contra 13,3 — e isso é uma afirmação sobre uma geração de mudança de receita. Em comparação com os modelos de fronteira nas colunas vizinhas, ela vence algumas linhas e perde outras, segundo os próprios números da Alibaba, pela própria escolha de harness da Alibaba.

Executando.

Os pesos são 18 shards BF16 no formato Transformers, e o cartão lista Hugging Face Transformers, vLLM, SGLang e TokenSpeed como stacks suportadas. Escrevemos os caminhos de implantação local e de quantização separadamente, e eles são os lugares certos para esse detalhe: Qwen3.8-27B no Ollama para um daemon local, e o passo a passo dos benchmarks para o placar completo, incluindo o que mudou em relação ao Qwen3.6-27B. Esta página fica no próprio modelo.

Qwen3.8-27B no nosso catálogo

Dois cards estão ativos no OrcaRouter hoje, lado a lado, e ambos foram relidos em 2026-09-28 antes que este parágrafo fosse escrito. qwen/qwen3.8-27bestá listado a US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída com a janela completa de 262.144 tokens, entrada de texto, imagem e vídeo, e os recursos de raciocínio, ferramentas, saída estruturada e JSON expostos como parâmetros. Seu irmão obsidian/Qwen3.8-27B — os mesmos pesos servidos em block-FP8 com a torre de visão mantida em precisão total e, nas próprias palavras do card, "projetado para fornecer respostas diretas e completas em uma ampla variedade de prompts" — está listado a US$ 0,40 de entrada e US$ 4,21 de saída. Ambos respondem a chat completions e à Responses API, então uma tarefa de análise de documentos ou de captura de tela pode ser direcionada a qualquer um dos modelos sob uma única chave e um único endpoint, sem um segundo contrato e sem alteração de código.

Para se ter uma ideia da escala, nosso próprio playground movimentou 105,1 milhões de tokens pelo qwen/qwen3.8-27b nos últimos sete dias, com um tempo mediano de 3,8 segundos até o primeiro byte e uma taxa de erro de 3,3% no mesmo período. Esses são nossos números de serving, não um veredito sobre o modelo.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing a 262K-token context window, text, image and video input, text output, the vision, tools, JSON and reasoning badges, a 3.80-second p50 time to first token, 105.1M tokens served in seven days, and list pricing of $0.33 per million input tokens and $2.40 per million output tokens.

As pesquisas que levam até aqui

A demanda por trás desta página está diluída e fica logo fora do clique. Nos 28 dias até 2026-09-25, nossa propriedade recebeu 8.931 impressões e 273 cliques em 69 grafias exatas distintas do nome do modelo — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" e dezenas de outras formas de escrever os mesmos três tokens. Nossa melhor posição nas maiores grafias ficou entre 9,0 e 10,6. Essas são posições que alcançávamos por acaso, devido a outras páginas, que é exatamente o problema que uma página canônica corrige: no nono lugar, você está na página, e ninguém clica. O único lugar onde o tráfego converte é fora do inglês — uma grafia do nome em russo está na posição 1,8 para nós e converte a 14,4%.

Nada disso é evidência sobre o modelo. É evidência sobre o que as pessoas digitam, e é por isso que a página existe.

O que isso representa: um checkpoint denso de 27B com um layout de atenção genuinamente incomum, uma licença permissiva, compreensão nativa de vídeo, termos Apache-2.0 que permitem distribuir um derivado, uma classificação independente em codificação no quarto superior daquilo que a Artificial Analysis mede, e uma tabela do fornecedor que é forte em relação ao seu antecessor e mista em relação aos modelos de ponta. A questão em aberto é aquela que ninguém fora da Alibaba consegue responder ainda — como o caminho hospedado de 1M tokens se comporta em produção, e se a arquitetura Flash-Next se encaixa em um modelo deste tamanho.

O núcleo 2.4T-A95B por trás do Qwen3.8-Max já está disponível no mesmo catálogo: qwen/qwen3.8-max a $2.00 / $6.00 por milhão de tokens, caso o 27B não seja o tamanho de que você precisa.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente