
Análise do Qwen3.8-27B: o 27B de pesos abertos que é o "Opus em casa" — testado contra o hype
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 22 tok/s
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
Qwen3.8 27B é o melhor 27B de pesos abertos que você pode auto-hospedar agora — e não há nada nem perto disso. Os pesos foram lançados em 14 de agosto de 2026 sob Apache 2.0: um 27B denso (28B contando o codificador de visão) com contexto nativo de 262K, entrada nativa de imagem e vídeo, e pontuações de codificação agêntica relatadas pelo fornecedor que ficam no mesmo nível ou acima do Claude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. O preço de destaque é zero: baixe 55,6 GB e execute. As ressalvas também são reais — testes independentes constatam que ele é cerca de três vezes mais lento e consome mais tokens do que seu antecessor, todos os benchmarks da ficha técnica ainda são relatados pela Alibaba, e o contexto de 1M é um recurso exclusivo da versão hospedada. Veredito: se você tem uma GPU de 24 GB+ e quer capacidade próxima da fronteira sem uma fatura por uso, auto-hospede-o — mas vá sabendo exatamente onde os números são fracos.
Veredito primeiro: você deve usar o Qwen3.8 27B?
Resposta curta — sim para cargas de trabalho locais e privadas; espere por números de terceiros antes de uma decisão de compra. Qwen3.8 27B é o modelo raro em que os pesos abertos são o produto e a API é a conveniência. Como a licença é Apache 2.0, o preço por token é permanentemente zero uma vez que você tenha o hardware, e nada do que você construir sobre ele pode ser relicenciado ou cobrado retroativamente. O que você abre mão é velocidade, verificação e conveniência.
Se você já roda o Qwen3.6-27B e está satisfeito com ele, a atualização é real, mas não é gratuita em termos de tempo de relógio. Se você chegou aqui a partir do lançamento do Qwen3.8-Max, este é o membro menor e auto-hospedável da mesma geração — uma ferramenta diferente para um trabalho diferente.
Os fatos rápidos, verificados em 15 de agosto de 2026
• Lançado — os pesos ficaram disponíveis em 14 de agosto de 2026 em Qwen/Qwen3.8-27B no Hugging Face, com espelho no ModelScope; a cobertura em diferentes fusos horários também menciona 13 de agosto, e o lançamento ocorreu cerca de uma semana após o anúncio da geração Qwen3.8.
• Licença — Apache 2.0: baixar, modificar, redistribuir, uso comercial, com concessão explícita de patente. Permanente.
• Parâmetros — 27B denso (28B contando o encoder de visão), 64 camadas, tamanho oculto 5.120, vocabulário 248.320.
• Arquitetura — atenção híbrida: 48 camadas de atenção linear Gated DeltaNet contra 16 camadas completas de Atenção Gated (uma divisão de 3:1). É por isso que um modelo denso de 27B pode carregar 262K tokens de contexto nativo.
• Contexto — 262.144 tokens nativamente; extensível para 1.000.000 via YaRN na versão hospedada.
• Entrada — imagem e vídeo nativos juntamente com texto; retorna texto. O codificador de visão é o motivo pelo qual a contagem de parâmetros indica 28B.
• Pensamento — modo de raciocínio ativado por padrão e desativável por solicitação; reasoning_effort (baixo/médio/alto) e preserve_thinking para execuções longas de agente.
• Pesos — 55.6 GB de safetensors BF16 em 18 shards; FP8 e GGUFs da comunidade também são fornecidos.
As especificações acima vêm da ficha do modelo e da configuração do Hugging Face para Qwen3.8 27B, lidas hoje. As alegações de benchmark são relatadas pela Alibaba; até hoje, nenhum laboratório independente as reproduziu.
No que o Qwen3.8 27B é genuinamente bom
O caso mais forte é a engenharia de software agêntica. A Alibaba relata um salto de 3x no DeepSWE 1.1 em relação ao 27B anterior (42,2 vs 13,3) e uma pontuação acima do Claude Opus 4.6 Max no SWE-bench Pro (61,7 vs 53,4). Esses são os números que lhe renderam o apelido de "Opus em casa" — um 27B denso realizando trabalho de codificação próximo à fronteira em hardware que uma pessoa pode realmente possuir.

Três coisas além dos números brutos fazem dela uma compra defensável:
• Multimodal nativo. Entrada de imagem e vídeo, saída de texto — um documento com diagramas ou um vídeo de demonstração não é um modelo separado. As pontuações de raciocínio visual (85.6 com o recurso de cadeia de pensamento ativado, 94.6 em matemática visual, ambos relatados pelo fornecedor) são onde o codificador de visão prova seu valor.
• Contexto nativo de 262K.Tarefas de agente de longo horizonte, grandes bases de código e transcrições de várias horas cabem em uma janela. O design híbrido de atenção linear mantém o custo de KV desse contexto mais baixo do que um modelo puro de atenção total do mesmo tamanho.
• Pesos gratuitos e permanentes. Este é o ponto principal da categoria: um modelo de API fechada é alugado; Qwen3.8 27B é de sua posse. Em 4 bits, roda em uma placa de 24 GB (classe RTX 3090/4090), e a AMD disponibilizou suporte Day-0 (até 24,5 tokens/s em um Ryzen AI Max+ 395 e 51,8 tokens/s em uma Radeon AI PRO R9700, segundo o blog da própria AMD).
Onde a análise fica complicada: velocidade, tokens e verificação
O teste independente até agora é o aparato de testes de um único testador, não um laboratório — mas é o melhor sinal que temos. Executando Qwen3.8 27B contra Qwen3.6-27B em dez tarefas do mundo real (avaliadas pelo GPT-5.5 por meio do harness llmcompare), o 3.8 venceu nove de dez e pontuou 8.838 contra 6.862 em média — "um dos ganhos de inteligência mais impressionantes" que o testador já tinha visto. Ele também usou quase três vezes mais tokens e foi consideravelmente mais lento; uma tarefa levou cerca de 600% mais tempo. Portanto, o salto de qualidade é real, e o preço em tempo de relógio também.
Mais quatro coisas para colocar contra isso:
• Ainda sem benchmarks de terceiros. Todos os números de destaque neste artigo foram reportados pela Alibaba em 15 de agosto. A ficha do fornecedor é detalhada, mas a reprodução por um laboratório independente ainda não aconteceu. Se sua decisão depende de números verificados, espere por eles — os pesos continuarão lá.
• O requisito mínimo de VRAM é real. BF16 exige uma GPU de classe 80 GB. Para caber em uma placa de 24 GB, você precisa rodar em 4 bits, e relatos da comunidade (thread de comentários no dev.to, dias após o lançamento) dizem que builds quantizados "perdem o foco após um contexto longo." Pesos oficiais se você tiver a VRAM; quantizados se não tiver.
• O contexto de 1M é exclusivo da versão hospedada. Os pesos abertos têm limite de 262K. A possibilidade de estender para 1M é um recurso hospedado do Qwen Cloud, não algo que uma cópia local faça de fábrica.
• "Superar a Opus" precisa de ressalvas. Benchmarks agênticos recompensam comportamentos específicos de harness, e o comentário no topo da publicação de lançamento no dev.to foi direto: "eles não superam a Opus no uso no mundo real." Trate o placar como um limite superior em um bom dia, não como uma promessa.
Como ele se enquadra na família Qwen 3.8
• vs Qwen3.6-27B — a mesma classe de hardware e contexto de 262K, mas um grande salto de capacidade ao custo de velocidade e eficiência de tokens. Se você já executa o 3.6 e está limitado pelo throughput, permanecer nele é defensável.
• vs Qwen3-Coder-30B-A3B — o Coder é um MoE com cerca de 3,3B de parâmetros ativos que roda muito mais rápido (~90–110 tokens/s). O denso 27B é mais lento por token, mas herda os ganhos agênticos da geração; se os resultados do 27B em engenharia de software se mantiverem em testes independentes, o papel do Coder-30B diminui.
• vs Qwen3.8-Max — o carro-chefe MoE de 2,4T é um modelo de datacenter (somente API, cerca de $2/$6 por milhão de tokens na cobertura publicada) com contexto de 1M e vídeo. O 27B é o implantável. Eles respondem a perguntas diferentes.
Custo: a questão local versus API, resolvida.
Para um modelo fechado, você compara preços por token. Para o Qwen3.8 27B, o custo marginal do token é zero no seu próprio hardware — o preço real é o custo inicial da GPU e o seu tempo. Em 4 bits, isso é uma placa de 24 GB; em BF16, é uma máquina da classe de 80 GB. Se você só precisa avaliar o modelo, ou não tem o hardware, existe a rota hospedada: o OrcaRouter agora lista o Qwen3.8 27B com um nível gratuito com limite de taxa que cobra $0 e retorna HTTP 429 após exceder o limite, além de um nível pago a $0,33 por milhão de tokens de entrada e $2,40 por milhão de tokens de saída (verificado em 15 de agosto). A versão hospedada da Qwen Cloud, com o contexto de 1M, está marcada como "em breve."

O enquadramento honesto: para um modelo de pesos abertos, um provedor é uma conveniência, não uma dependência. A camada gratuita é a maneira mais barata possível de decidir se um download de 55,6 GB vale a pena. Mas, depois que você decidir, os pesos são o que importa — e eles são gratuitos.
Como realmente experimentar
• Avaliação mais rápida — use o nível gratuito hospedado com limite de taxa; se ele responder o que você precisa, você está pronto e não custou nada.
• Teste real no seu hardware — baixe um GGUF da comunidade (a versão Q4_K_M tem cerca de 17 GB e cabe em uma placa de 24 GB) e execute-o no llama.cpp ou Ollama. Passe o template de chat Jinja ou o modelo responde a você em tags de pensamento. Para visão a partir de um GGUF, você também precisa do arquivo mmproj separado. Nosso guia para executar Qwen3.8 27B localmente explica o passo a passo.
• Precisão total — huggingface-cli download Qwen/Qwen3.8-27B em uma GPU da classe de 80 GB.
• Verifique o que você baixou — verifique se o editor é a organização Qwen e valide os shards contra o crc32.txt; repositórios falsos apareceram antes do lançamento.
Quando esta avaliação estiver errada (e quem deve evitar o Qwen3.8 27B)
• Você não tem GPU e não vai alugar uma. O nível gratuito tem limite de uso e o nível pago custa $0.33/$2.40 por milhão — um modelo pequeno de API pode atender você de forma mais barata e confiável. Este modelo é para pessoas que querem ser donas da inferência.
• Você precisa de um SLA.A camada hospedada existe há apenas alguns dias; a página do modelo OrcaRouter, consultada hoje, mostra uma taxa de erro de 33,3% nos últimos sete dias e latência p50 do primeiro token de 225 ms. Esse é um modelo totalmente novo sob carga inicial, não um contrato de produção. Quem faz auto-hospedagem deve fixar o commit do download e manter um fallback.
• Você precisa de benchmarks verificados para uma decisão de compra. Os números relatados pelo fornecedor são úteis como referência direcional, mas não servem para embasar uma aquisição. Aguarde a reprodução independente.
• O contexto de 262K para pesos abertos não é suficiente. Atualmente, a extensão de 1M está disponível apenas na versão hospedada.
• O throughput é o seu gargalo. Sumarização em massa ou grandes lotes vão sofrer: este é um 27B denso que também consome cerca de 3x mais tokens do que o seu predecessor. Para trabalho em massa barato, um modelo menor ou mais rápido vence.
• Você está em um cartão de 12 GB. GGUFs de 2 bits cabem com perda visível de qualidade; este não é o modelo para você.

O resultado final
Qwen3.8 27Bé o 27B de pesos abertos mais forte disponível hoje, e é gratuito para sempre sob Apache 2.0. Se você tem uma GPU de 24 GB+ e quer codificação agêntica, contexto de 262K e entrada nativa de imagem/vídeo sem cobrança por uso, esta é a compra certa. As razões para esperar são igualmente concretas: você precisa de confirmação independente de benchmarks, um SLA, mais de 262K de contexto de pesos abertos, ou maior throughput do que um 27B denso oferece. O modelo foi lançado, os pesos são reais e os números são bons — apenas lembre-se de quem são os números.
