
Qwen3.8-27B: O Modelo Multimodal Compacto na Linha Qwen3.8 da Alibaba
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 316 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Qwen3.8-27B é o membro denso de nó único da geração Qwen3.8 da Alibaba: um modelo nativo de visão e linguagem de 27 bilhões de parâmetros, publicado no Hugging Face sob Apache 2.0, que aceita texto, imagens e vídeo e retorna texto com uma janela de contexto de 262.144 tokens. Esta é a página de referência para esse modelo — a descrição canônica do que ele é, de quanto custa chamá-lo e do que ele pode fazer — e vale dizer desde já por que existe uma página para um modelo cujos pesos apareceram pela primeira vez em agosto de 2026, e não nos últimos sete dias. Não estamos noticiando um lançamento. Estamos respondendo a uma pergunta recorrente: leitores chegam até nós pelo nome "Qwen3.8-27B" milhares de vezes por mês, e até agora nenhuma página nossa detinha essa resposta. O próprio lançamento do modelo, datado no card do Qwen e registrado como 2026-08-14 pela Artificial Analysis, é um fato que esta página usa para datar o modelo, não um evento que ela relata.
Leia isso como a exceção que é: numa leitura estrita de sete dias, um modelo de meados de agosto de 2026 não é recente, e este item seria descartado como notícia. A justificativa aqui é diferente. É uma página de referência cujos números foram verificados com base no próprio model card da Qwen, no arquivo de licença do repositório, na tabela de preços da Qwen Cloud e na Artificial Analysis em 2026-09-28, e cuja razão de existir é a demanda de busca que medimos em primeira mão no mesmo dia. Não é um segundo anúncio, e ninguém deve lê-lo como tal.
Onde o 27B se posiciona na linha Qwen3.8
A geração Qwen3.8 não é um único modelo, e o sufixo de tamanho é o ponto central do nome. As próprias notas de repositório da Qwen em toda a família tornam a divisão explícita:
• Qwen3.8-27B — 27B de parâmetros densos, entrada nativa de imagem e vídeo, Apache 2.0. O integrante fácil de implantar: um modelo dimensionado para rodar em uma única GPU ou em um nó pequeno, e o tema desta página.
• Qwen3.8-Max, construído sobre o Qwen3.8-2.4T-A95B — 2,4 trilhões de parâmetros totais com 95B ativos, o modelo da classe Qwen-Max que a Alibaba disponibilizou pela primeira vez nesta geração. Seu repositório traz uma licença personalizada qwen3.8-max em vez de Apache 2.0.
• Qwen3.8-Flash-Next — a prévia experimental da arquitetura que a Qwen diz que servirá de base para o Qwen4, lançada sob a licença qwen-community-1.0. O Qwen3.8-Flash hospedado é construído sobre ela.
Portanto, "27B" não é um nível de acabamento do modelo Max; é a classe de tamanho que uma única equipe consegue realmente atender. O que a Alibaba alega que ele herda é a receita de treinamento: a ficha descreve o Qwen3.8-27B como algo que pega os avanços da geração em programação, trabalho profissional, pesquisa e tarefas agênticas de longo horizonte e os comprime em um checkpoint denso.

A arquitetura que a Qwen publica
Todos os números abaixo são do cartão de modelo em Qwen/Qwen3.8-27B, que é a documentação do próprio fornecedor:
• Parâmetros — 27B conforme divulgado. Os próprios metadados de safetensors do repositório totalizam 27.781.427.952 parâmetros em BF16 distribuídos por 18 shards, portanto cerca de 27,8B quando a torre de visão é contabilizada. Não há mixture-of-experts aqui: todos os parâmetros estão ativos em cada token.
• Formato — 64 camadas, dimensão oculta 5.120, dimensão intermediária feed-forward 17.408, embedding de tokens e saída LM 248.320 (com padding).
• Atenção híbrida — o layout que o Qwen imprime é 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): três blocos de atenção linear para cada bloco de atenção completa, uma proporção de 3:1. O Gated DeltaNet executa 48 cabeças de atenção linear para V e 16 para QK com dimensão de cabeça 128; o Gated Attention executa 24 cabeças de consulta contra 4 cabeças KV com dimensão de cabeça 256, com uma dimensão rotacional de 64. É essa proporção que torna uma janela de 262K acessível em um modelo de 27B, e é a mesma linhagem que o Qwen3.8-Flash-Next estende com atenção esparsa.
• Previsão multi-token — o cartão indica que o modelo é treinado com MTP em várias etapas, o truque de rascunho que acelera a geração em pilhas de serving compatíveis com MTP.
• Controle de pensamento — o modo de pensamento está ativado por padrão e pode ser desativado por solicitação. reasoning_effort aceita xhigh (o padrão), medium ou low, e preserve_thinking está ativado por padrão, de modo que os traços de raciocínio persistam entre turnos em vez de serem regenerados.
Janela de contexto e limite de saída
O card afirma 262.144 tokens nativamente, expansível para 1.000.000 com escalonamento RoPE (YaRN). A própria orientação de serving do Qwen para execuções agênticas longas, dentro desse envelope de 1M, é permitir até 262.144 tokens para conteúdo de raciocínio e até 131.072 tokens para a resposta final — o teto é uma configuração de serving, não uma propriedade fixa do checkpoint.
Vale a pena manter duas janelas separadas, porque são fáceis de confundir. Os pesos abertos rodam nativamente a 262.144; a versão hospedada no Qwen Cloud, que o cartão de modelo descreve como ainda por vir ("o serviço chegará em breve"), está listada na página de modelo do Qwen Cloud com contexto de 1M, entrada máxima de 991K, saída máxima de 131K e orçamento máximo de raciocínio de 262K. A ficha técnica do produto hospedado não é a ficha técnica do checkpoint.
Modalidades: o que entra e o que sai
A entrada é texto, imagem e vídeo; a saída é apenas texto. O card chama o Qwen3.8-27B de "um modelo nativo de visão e linguagem que entende imagens e vídeos", e seu código de exemplo aceita os três tipos de entrada. Não há entrada de áudio, geração de imagem nem saída de fala. O registro de modelo da Artificial Analysis para o mesmo checkpoint concorda quanto ao envelope — imagem, vídeo e texto na entrada, texto na saída —, o que é uma segunda leitura útil porque não é a página da própria Alibaba.
O que a versão Apache 2.0 realmente permite
A licença não é um resumo em um post de blog; o repositório contém o próprio texto da Licença Apache, Versão 2.0, e os metadados do card declaram license: apache-2.0. O que isso concede, conforme lido no texto da licença: uma licença de direitos autorais perpétua, mundial e livre de royalties para reproduzir, preparar obras derivadas, exibir publicamente, sublicenciar e distribuir a obra e suas derivadas, e uma licença de patente concedida pelos contribuidores — uso comercial entre os propósitos permitidos e nenhuma restrição de campo de uso, nenhum limite de número de usuários e nenhum acordo comercial separado. O Apache 2.0 também é permissivo no sentido que importa para o lançamento de produtos: os pesos derivados podem ser redistribuídos sob termos diferentes, desde que você mantenha a licença e os avisos de atribuição e declare o que alterou (Seções 4–4c). A Seção 6 não concede direitos ao nome Qwen ou às marcas registradas, portanto um fork do Apache-2.0 não pode se promover como Qwen.
A comparação dentro da família é instrutiva, e é visível a partir dos repositórios, e não da cobertura: o checkpoint 2.4T-A95B se autodenomina outro com uma licença qwen3.8-max, e o Qwen3.8-Flash-Next usa qwen-community-1.0. O 27B é o que, dos três, vem sob Apache 2.0 puro.
A posição de referência independente
A Artificial Analysis executou o modelo, e o seu registro merece ser separado da tabela da própria Alibaba, porque os dois respondem a perguntas diferentes. O índice independente, medido na xhighconfiguração
• Índice de Inteligência 33,7 — valor armazenado da Artificial Analysis, que a página do modelo apresenta arredondado para 34. Publicam-se duas classificações e estas medem universos diferentes: o próprio painel de resumo dessa página coloca o modelo em 1.º de 142 modelos na sua classe de tamanho, na comparação dentro da mesma classe descrita na dica da página, ao passo que a linha do nosso catálogo proveniente da Artificial Analysis regista 45.º de 145, cerca do percentil 67. Nenhuma é uma classificação face ao mesmo universo que a outra, por isso não as leia como um único número em dois formatos.
• Índice de Programação 68.1 — registrado em nosso catálogo com artificialanalysis.ai como sua fonte nomeada, classificado em 35º de 138 no conjunto desse índice. O modelo está mais bem posicionado em programação do que em inteligência geral, o que é consistente com o formato da própria tabela do fornecedor.
• Escada de esforço, mesma estrutura de avaliação — reduzir o esforço de raciocínio move o índice consideravelmente: 33,7 em xhigh, 27,6 em médio, 26,2 em baixo, e 20,2 com o raciocínio totalmente desativado. Essa é uma variação medida de 13,5 pontos, e é o argumento mais concreto para ajustar o esforço por carga de trabalho, e não por modelo.
• Onde as duas fontes concordam e discordam — no GPQA Diamond, o cartão da Alibaba reporta 89,2 e a Artificial Analysis mede 90,5. No Humanity's Last Exam, o cartão reporta 30,8 e a Artificial Analysis 33,9. Próximos, mas não o mesmo número, e isso é normal: diferentes harnesses, diferentes execuções. Um alerta pertence ao artigo e não a uma nota de rodapé — nenhum terceiro publicou um confronto direto entre o Qwen3.8-27B e qualquer um dos modelos na tabela comparativa da Alibaba executado com esforço equivalente em um harness equivalente, portanto, toda comparação entre modelos nesta página é uma comparação de medições separadas, não um resultado.

O que o Qwen reporta, e como lê-lo
O cartão do modelo traz cerca de duas dúzias de pontuações com colunas de comparação para Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B e Opus4.6 Max. Tudo é informado pelo fornecedor e não reproduzido — avaliação da própria Alibaba, impressa pela Alibaba — e várias linhas usam um harness do Claude Code avaliado por uma build do GPT-5.4, conforme afirmam as notas de rodapé do cartão. Os números de destaque do fornecedor, com base nisso:
• Codificação agêntica em terminal — Terminal Bench 2.1 (Terminus) 73,0, contra 63,4 do Qwen3.6-27B que ele substitui, com o Opus4.6 Max liderando a linha com 78,2.
• Codificação agêntica — SWE-bench Pro 61,7, QwenSWEBench 79,0, DeepSWE 1.1 42,2, NL2Repo-Bench 42,3, LiveCodeBench v6 90,3.
• Agentes e trabalho de escritório — CoWorkBench 70.7, JobBench 33.4, Agents' Last Exam 42.9 por pontuação (Pass@1 20.4).
• Raciocínio geral — GPQA Diamond 89,2, HLE 30,8, IFBench 79,5. Opus4.6 Max lidera ambas as linhas de raciocínio na própria tabela do fornecedor, com 91,3 e 40,0.
• Visão e uso de computador — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.
O resumo honesto dessa tabela é mais restrito do que a tabela aparenta. Em comparação com seu antecessor direto, os ganhos são grandes e consistentes — QwenSWEBench 79,0 contra 49,3, DeepSWE 42,2 contra 13,3 — e isso é uma afirmação sobre uma geração de mudança de receita. Em comparação com os modelos de fronteira nas colunas vizinhas, ela vence algumas linhas e perde outras, segundo os próprios números da Alibaba, pela própria escolha de harness da Alibaba.
Executando.
Os pesos são 18 shards BF16 no formato Transformers, e o cartão lista Hugging Face Transformers, vLLM, SGLang e TokenSpeed como stacks suportadas. Escrevemos os caminhos de implantação local e de quantização separadamente, e eles são os lugares certos para esse detalhe: Qwen3.8-27B no Ollama para um daemon local, e o passo a passo dos benchmarks para o placar completo, incluindo o que mudou em relação ao Qwen3.6-27B. Esta página fica no próprio modelo.
Qwen3.8-27B no nosso catálogo
Dois cards estão ativos no OrcaRouter hoje, lado a lado, e ambos foram relidos em 2026-09-28 antes que este parágrafo fosse escrito. qwen/qwen3.8-27bestá listado a US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída com a janela completa de 262.144 tokens, entrada de texto, imagem e vídeo, e os recursos de raciocínio, ferramentas, saída estruturada e JSON expostos como parâmetros. Seu irmão obsidian/Qwen3.8-27B — os mesmos pesos servidos em block-FP8 com a torre de visão mantida em precisão total e, nas próprias palavras do card, "projetado para fornecer respostas diretas e completas em uma ampla variedade de prompts" — está listado a US$ 0,40 de entrada e US$ 4,21 de saída. Ambos respondem a chat completions e à Responses API, então uma tarefa de análise de documentos ou de captura de tela pode ser direcionada a qualquer um dos modelos sob uma única chave e um único endpoint, sem um segundo contrato e sem alteração de código.
Para se ter uma ideia da escala, nosso próprio playground movimentou 105,1 milhões de tokens pelo qwen/qwen3.8-27b nos últimos sete dias, com um tempo mediano de 3,8 segundos até o primeiro byte e uma taxa de erro de 3,3% no mesmo período. Esses são nossos números de serving, não um veredito sobre o modelo.

As pesquisas que levam até aqui
A demanda por trás desta página está diluída e fica logo fora do clique. Nos 28 dias até 2026-09-25, nossa propriedade recebeu 8.931 impressões e 273 cliques em 69 grafias exatas distintas do nome do modelo — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" e dezenas de outras formas de escrever os mesmos três tokens. Nossa melhor posição nas maiores grafias ficou entre 9,0 e 10,6. Essas são posições que alcançávamos por acaso, devido a outras páginas, que é exatamente o problema que uma página canônica corrige: no nono lugar, você está na página, e ninguém clica. O único lugar onde o tráfego converte é fora do inglês — uma grafia do nome em russo está na posição 1,8 para nós e converte a 14,4%.
Nada disso é evidência sobre o modelo. É evidência sobre o que as pessoas digitam, e é por isso que a página existe.
O que isso representa: um checkpoint denso de 27B com um layout de atenção genuinamente incomum, uma licença permissiva, compreensão nativa de vídeo, termos Apache-2.0 que permitem distribuir um derivado, uma classificação independente em codificação no quarto superior daquilo que a Artificial Analysis mede, e uma tabela do fornecedor que é forte em relação ao seu antecessor e mista em relação aos modelos de ponta. A questão em aberto é aquela que ninguém fora da Alibaba consegue responder ainda — como o caminho hospedado de 1M tokens se comporta em produção, e se a arquitetura Flash-Next se encaixa em um modelo deste tamanho.
O núcleo 2.4T-A95B por trás do Qwen3.8-Max já está disponível no mesmo catálogo: qwen/qwen3.8-max a $2.00 / $6.00 por milhão de tokens, caso o 27B não seja o tamanho de que você precisa.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
