Cartão de título hero para a análise do Qwen3.8-27B, intitulada 'Qwen3.8-27B Review' com o subtítulo 'O 27B de pesos abertos que é um Opus em casa — testado contra o hype', mostrando um selo de pesos abertos, um selo Apache 2.0 e um conjunto de ícones de GPU e servidor sobre um fundo branco limpo com acentos suaves de gradiente azul.
Guides & Insights

Análise do Qwen3.8-27B: o 27B de pesos abertos que é o "Opus em casa" — testado contra o hype

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen3.8 27B é o melhor 27B de pesos abertos que você pode auto-hospedar agora — e não há nada nem perto disso. Os pesos foram lançados em 14 de agosto de 2026 sob Apache 2.0: um 27B denso (28B contando o codificador de visão) com contexto nativo de 262K, entrada nativa de imagem e vídeo, e pontuações de codificação agêntica relatadas pelo fornecedor que ficam no mesmo nível ou acima do Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. O preço de destaque é zero: baixe 55,6 GB e execute. As ressalvas também são reais — testes independentes constatam que ele é cerca de três vezes mais lento e consome mais tokens do que seu antecessor, todos os benchmarks da ficha técnica ainda são relatados pela Ali​baba, e o contexto de 1M é um recurso exclusivo da versão hospedada. Veredito: se você tem uma GPU de 24 GB+ e quer capacidade próxima da fronteira sem uma fatura por uso, auto-hospede-o — mas vá sabendo exatamente onde os números são fracos.

Veredito primeiro: você deve usar o Qwen3.8 27B?

Resposta curta — sim para cargas de trabalho locais e privadas; espere por números de terceiros antes de uma decisão de compra. Qwen3.8 27B é o modelo raro em que os pesos abertos são o produto e a API é a conveniência. Como a licença é Apache 2.0, o preço por token é permanentemente zero uma vez que você tenha o hardware, e nada do que você construir sobre ele pode ser relicenciado ou cobrado retroativamente. O que você abre mão é velocidade, verificação e conveniência.

Se você já roda o Qwen3.6-27B e está satisfeito com ele, a atualização é real, mas não é gratuita em termos de tempo de relógio. Se você chegou aqui a partir do lançamento do Qwen3.8-Max, este é o membro menor e auto-hospedável da mesma geração — uma ferramenta diferente para um trabalho diferente.

Os fatos rápidos, verificados em 15 de agosto de 2026

Lançado — os pesos ficaram disponíveis em 14 de agosto de 2026 em Qwen/Qwen3.8-27B no Hugging Face, com espelho no ModelScope; a cobertura em diferentes fusos horários também menciona 13 de agosto, e o lançamento ocorreu cerca de uma semana após o anúncio da geração Qwen3.8.

Licença — Apache 2.0: baixar, modificar, redistribuir, uso comercial, com concessão explícita de patente. Permanente.

Parâmetros — 27B denso (28B contando o encoder de visão), 64 camadas, tamanho oculto 5.120, vocabulário 248.320.

Arquitetura — atenção híbrida: 48 camadas de atenção linear Gated DeltaNet contra 16 camadas completas de Atenção Gated (uma divisão de 3:1). É por isso que um modelo denso de 27B pode carregar 262K tokens de contexto nativo.

Contexto — 262.144 tokens nativamente; extensível para 1.000.000 via YaRN na versão hospedada.

Entrada — imagem e vídeo nativos juntamente com texto; retorna texto. O codificador de visão é o motivo pelo qual a contagem de parâmetros indica 28B.

Pensamento — modo de raciocínio ativado por padrão e desativável por solicitação; reasoning_effort (baixo/médio/alto) e preserve_thinking para execuções longas de agente.

Pesos — 55.6 GB de safetensors BF16 em 18 shards; FP8 e GGUFs da comunidade também são fornecidos.

As especificações acima vêm da ficha do modelo e da configuração do Hugging Face para Qwen3.8 27B, lidas hoje. As alegações de benchmark são relatadas pela Ali​baba; até hoje, nenhum laboratório independente as reproduziu.

No que o Qwen3.8 27B é genuinamente bom

O caso mais forte é a engenharia de software agêntica. A Ali​baba relata um salto de 3x no DeepSWE 1.1 em relação ao 27B anterior (42,2 vs 13,3) e uma pontuação acima do Cla​ude Opus 4.6 Max no SWE-bench Pro (61,7 vs 53,4). Esses são os números que lhe renderam o apelido de "Opus em casa" — um 27B denso realizando trabalho de codificação próximo à fronteira em hardware que uma pessoa pode realmente possuir.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Três coisas além dos números brutos fazem dela uma compra defensável:

Multimodal nativo. Entrada de imagem e vídeo, saída de texto — um documento com diagramas ou um vídeo de demonstração não é um modelo separado. As pontuações de raciocínio visual (85.6 com o recurso de cadeia de pensamento ativado, 94.6 em matemática visual, ambos relatados pelo fornecedor) são onde o codificador de visão prova seu valor.

Contexto nativo de 262K.Tarefas de agente de longo horizonte, grandes bases de código e transcrições de várias horas cabem em uma janela. O design híbrido de atenção linear mantém o custo de KV desse contexto mais baixo do que um modelo puro de atenção total do mesmo tamanho.

Pesos gratuitos e permanentes. Este é o ponto principal da categoria: um modelo de API fechada é alugado; Qwen3.8 27B é de sua posse. Em 4 bits, roda em uma placa de 24 GB (classe RTX 3090/4090), e a AMD disponibilizou suporte Day-0 (até 24,5 tokens/s em um Ryzen AI Max+ 395 e 51,8 tokens/s em uma Radeon AI PRO R9700, segundo o blog da própria AMD).

Onde a análise fica complicada: velocidade, tokens e verificação

O teste independente até agora é o aparato de testes de um único testador, não um laboratório — mas é o melhor sinal que temos. Executando Qwen3.8 27B contra Qwen3.6-27B em dez tarefas do mundo real (avaliadas pelo GPT-5.5 por meio do harness llmcompare), o 3.8 venceu nove de dez e pontuou 8.838 contra 6.862 em média — "um dos ganhos de inteligência mais impressionantes" que o testador já tinha visto. Ele também usou quase três vezes mais tokens e foi consideravelmente mais lento; uma tarefa levou cerca de 600% mais tempo. Portanto, o salto de qualidade é real, e o preço em tempo de relógio também.

Mais quatro coisas para colocar contra isso:

Ainda sem benchmarks de terceiros. Todos os números de destaque neste artigo foram reportados pela Alibaba em 15 de agosto. A ficha do fornecedor é detalhada, mas a reprodução por um laboratório independente ainda não aconteceu. Se sua decisão depende de números verificados, espere por eles — os pesos continuarão lá.

O requisito mínimo de VRAM é real. BF16 exige uma GPU de classe 80 GB. Para caber em uma placa de 24 GB, você precisa rodar em 4 bits, e relatos da comunidade (thread de comentários no dev.to, dias após o lançamento) dizem que builds quantizados "perdem o foco após um contexto longo." Pesos oficiais se você tiver a VRAM; quantizados se não tiver.

O contexto de 1M é exclusivo da versão hospedada. Os pesos abertos têm limite de 262K. A possibilidade de estender para 1M é um recurso hospedado do Qwen Cloud, não algo que uma cópia local faça de fábrica.

"Superar a Opus" precisa de ressalvas. Benchmarks agênticos recompensam comportamentos específicos de harness, e o comentário no topo da publicação de lançamento no dev.to foi direto: "eles não superam a Opus no uso no mundo real." Trate o placar como um limite superior em um bom dia, não como uma promessa.

Como ele se enquadra na família Qwen 3.8

vs Qwen3.6-27B — a mesma classe de hardware e contexto de 262K, mas um grande salto de capacidade ao custo de velocidade e eficiência de tokens. Se você já executa o 3.6 e está limitado pelo throughput, permanecer nele é defensável.

vs Qwen3-Coder-30B-A3B — o Coder é um MoE com cerca de 3,3B de parâmetros ativos que roda muito mais rápido (~90–110 tokens/s). O denso 27B é mais lento por token, mas herda os ganhos agênticos da geração; se os resultados do 27B em engenharia de software se mantiverem em testes independentes, o papel do Coder-30B diminui.

vs Qwen3.8-Max — o carro-chefe MoE de 2,4T é um modelo de datacenter (somente API, cerca de $2/$6 por milhão de tokens na cobertura publicada) com contexto de 1M e vídeo. O 27B é o implantável. Eles respondem a perguntas diferentes.

Custo: a questão local versus API, resolvida.

Para um modelo fechado, você compara preços por token. Para o Qwen3.8 27B, o custo marginal do token é zero no seu próprio hardware — o preço real é o custo inicial da GPU e o seu tempo. Em 4 bits, isso é uma placa de 24 GB; em BF16, é uma máquina da classe de 80 GB. Se você só precisa avaliar o modelo, ou não tem o hardware, existe a rota hospedada: o OrcaRouter agora lista o Qwen3.8 27B com um nível gratuito com limite de taxa que cobra $0 e retorna HTTP 429 após exceder o limite, além de um nível pago a $0,33 por milhão de tokens de entrada e $2,40 por milhão de tokens de saída (verificado em 15 de agosto). A versão hospedada da Qwe​n Cloud, com o contexto de 1M, está marcada como "em breve."

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

O enquadramento honesto: para um modelo de pesos abertos, um provedor é uma conveniência, não uma dependência. A camada gratuita é a maneira mais barata possível de decidir se um download de 55,6 GB vale a pena. Mas, depois que você decidir, os pesos são o que importa — e eles são gratuitos.

Como realmente experimentar

Avaliação mais rápida — use o nível gratuito hospedado com limite de taxa; se ele responder o que você precisa, você está pronto e não custou nada.

Teste real no seu hardware — baixe um GGUF da comunidade (a versão Q4_K_M tem cerca de 17 GB e cabe em uma placa de 24 GB) e execute-o no llama.cpp ou Ollama. Passe o template de chat Jinja ou o modelo responde a você em tags de pensamento. Para visão a partir de um GGUF, você também precisa do arquivo mmproj separado. Nosso guia para executar Qwen3.8 27B localmente explica o passo a passo.

Precisão total — huggingface-cli download Qwen/Qwen3.8-27B em uma GPU da classe de 80 GB.

Verifique o que você baixou — verifique se o editor é a organização Qwe​n e valide os shards contra o crc32.txt; repositórios falsos apareceram antes do lançamento.

Quando esta avaliação estiver errada (e quem deve evitar o Qwen3.8 27B)

Você não tem GPU e não vai alugar uma. O nível gratuito tem limite de uso e o nível pago custa $0.33/$2.40 por milhão — um modelo pequeno de API pode atender você de forma mais barata e confiável. Este modelo é para pessoas que querem ser donas da inferência.

Você precisa de um SLA.A camada hospedada existe há apenas alguns dias; a página do modelo OrcaRouter, consultada hoje, mostra uma taxa de erro de 33,3% nos últimos sete dias e latência p50 do primeiro token de 225 ms. Esse é um modelo totalmente novo sob carga inicial, não um contrato de produção. Quem faz auto-hospedagem deve fixar o commit do download e manter um fallback.

Você precisa de benchmarks verificados para uma decisão de compra. Os números relatados pelo fornecedor são úteis como referência direcional, mas não servem para embasar uma aquisição. Aguarde a reprodução independente.

O contexto de 262K para pesos abertos não é suficiente. Atualmente, a extensão de 1M está disponível apenas na versão hospedada.

O throughput é o seu gargalo. Sumarização em massa ou grandes lotes vão sofrer: este é um 27B denso que também consome cerca de 3x mais tokens do que o seu predecessor. Para trabalho em massa barato, um modelo menor ou mais rápido vence.

Você está em um cartão de 12 GB. GGUFs de 2 bits cabem com perda visível de qualidade; este não é o modelo para você.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

O resultado final

Qwen3.8 27Bé o 27B de pesos abertos mais forte disponível hoje, e é gratuito para sempre sob Apache 2.0. Se você tem uma GPU de 24 GB+ e quer codificação agêntica, contexto de 262K e entrada nativa de imagem/vídeo sem cobrança por uso, esta é a compra certa. As razões para esperar são igualmente concretas: você precisa de confirmação independente de benchmarks, um SLA, mais de 262K de contexto de pesos abertos, ou maior throughput do que um 27B denso oferece. O modelo foi lançado, os pesos são reais e os números são bons — apenas lembre-se de quem são os números.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube