
Benchmarks do Qwen3.8-27B: A Tabela Completa, com as Ressalvas Anexas
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
Qwen3.8-27B obtém 73,0 no Terminal-Bench 2.1, 61,7 no SWE-bench Pro, 90,3 no LiveCodeBench v6 e 84,3 no OSWorld-Verified — e cada um desses números é da própria Alibaba. O modelo de pesos abertos com 27 bilhões de parâmetros chegou ao Hugging Face em 14 de agosto de 2026 sob a licença Apache 2.0 e, a partir de 15 de agosto, ninguém fora da Alibaba avaliou independentemente sua qualidade. Esta página é o resumo completo e com fontes: todos os 25 benchmarks oficiais do model card, o que mudou em relação ao seu antecessor Qwen3.6-27B, o que um teste independente de throughput da AMD mediu e quais alegações você deve tratar como provisórias.
Um guia de leitura antes dos números: "oficial" aqui significa a avaliação da Alibaba impressa no cartão do modelo em Qwen/Qwen3.8-27B. É relatado pelo fornecedor e não reproduzido. "Independente" significa que alguém de fora do laboratório o mediu — até agora isso se aplica apenas à taxa de transferência de hardware, não a qualquer pontuação de qualidade. Benchmarks cuja estrutura de teste importa são sinalizados inline.
O modelo, uma linha por especificação
• 27B parâmetros densos (28B contando o codificador de visão), 64 camadas, tamanho oculto 5120.
• Atenção híbrida — 48 camadas de atenção linear Gated DeltaNet mais 16 camadas de atenção total, numa proporção de 3:1 — o que torna viável executar uma janela de 262 mil tokens.
• 262.144 tokens de contexto nativo, extensível para 1.000.000 com escala YaRN.
Entrada nativa de imagem e vídeo (saída de texto), pesos Apache 2.0, aproximadamente 55,6GB em BF16.
A versão curta: este é o modelo que visa pegar o que a Alibaba aprendeu construindo o Qwen3.8-Max, de 2,4 trilhões de parâmetros, e compactá-lo em algo que uma única GPU possa executar.
O scorecard: todos os benchmarks na ficha do modelo.
Todas as pontuações abaixo são relatadas pela Alibaba na ficha do modelo de 14 de agosto, com a pontuação do Qwen3.6-27B que o modelo substitui entre parênteses.
Programação. Terminal-Bench 2.1 (codificação em terminal por agentes) 73,0 (63,4); SWE-bench Pro 61,7 (53,5); QwenSWEBench 79,0 (49,3); DeepSWE 1.1 42,2 (13,3); NL2Repo-Bench 42,3 (36,2); LiveCodeBench v6 90,3 (83,9). As execuções do SWE-bench Pro e do QwenSWEBench usaram o harness do Claude Code, conforme uma nota de rodapé do model card — algo a se ter em mente antes de compará-los a um modelo avaliado com um harness diferente.
Agentes de longo horizonte e trabalho de escritório. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / pontuação 42.9 (10.6 / 27.3).
Raciocínio e conhecimento. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench de seguimento de instruções 79.5 (69.1). O HLE é avaliado pelo GPT-4o, conforme o card.
Visão e uso de computador. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 com CI / 90.0 sem (85.1); BabyVision 85.6 com CI / 65.7 sem (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" é o aprimoramento em tempo de inferência da Alibaba; a diferença entre seus estados ativado e desativado é o número mais informativo no cartão sobre quanta pontuação você pode comprar com computação de inferência adicional.

O que realmente mudou em relação ao Qwen3.6-27B
Cada benchmark no cartão subiu, mas os deltas não são uniformes — e o formato da melhoria é a história. Os ganhos se concentram em codificação agêntica e uso de computador, não em recuperação de conhecimento:
• DeepSWE 1.1 (codificação agêntica) 13.3 → 42.2, aproximadamente um salto de 3x
QwenSWEBench 49.3 → 79.0
• Pontuação do Agents' Last Exam 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 e AndroidWorld 70.3 → 81.9
• BabyVision (com IC) 28.9 → 85.6 — o maior ganho relativo da tabela
Meanwhile, GPQA Diamond {{1}}passou de 87.8 → 89.2{{/1}} e RealWorldQA {{2}}de 84.1 → 85.9{{/2}}: {{3}}melhorias reais, mas pequenas{{/3}}. {{4}}Esta não é uma versão "mais inteligente em tudo"{{/4}}. {{5}}É uma versão voltada diretamente para agentes{{/5}} {{6}}que leem telas, usam ferramentas e escrevem código{{/6}} {{7}}em muitas etapas{{/7}}.

As lacunas honestas: onde ainda perde, e as ressalvas metodológicas
Contra a fronteira, o quadro é lisonjeiro, mas não unilateral. Onde Qwen3.8-27B e Claude Opus 4.6 Max se sobrepõem, Qwen vence a maioria — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench e todo o bloco de visão. Contra o Muse Glimmer-30B da Meta, o rival natural da classe local, vence todos os oito benchmarks sobrepostos de forma inequívoca. Mas ainda perde Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) e NL2Repo-Bench (42.3 vs 47.6) para Claude Opus 4.6 Max. Se a sua carga de trabalho é o raciocínio de fronteira mais difícil — matemática de ponta, perguntas massivamente multidisciplinares — o 27B ainda não chegou lá.
Três ressalvas antes de você citar qualquer uma dessas informações. Primeiro, nada disso é verificado de forma independente; não há índice Artificial Analysis nem execução no LMArena para o 27B até 15 de agosto, e os harnesses da própria Alibaba não são os que terceiros usarão. Segundo, o model card usa o harness Claude Code para SWE-bench Pro e QwenSWEBench e um juiz GPT-4o para Humanity's Last Exam — comparações com modelos avaliados em outras configurações alterarão os números. Terceiro, a execução da MathVision da Alibaba usou um prompt fixo, enquanto os concorrentes receberam a variante de maior pontuação entre duas. Nada disso significa que os resultados estejam errados; significa que eles são um teto, não um piso, até que outra pessoa execute o modelo.
O que é preciso para executá-lo
Qwen3.8-27B é um modelo local, o que muda o significado de "desempenho": vazão no seu próprio hardware em vez de uma tabela de preços. Os pesos BF16 ocupam aproximadamente 55,6 GB; quantizados para 4 bits, cabem em uma placa de 24 GB, como uma RTX 3090 ou 4090. A AMD lançou suporte Day-0 no dia do lançamento, e suas próprias medições com llama.cpp/Vulkan — agosto de 2026, média de três ou mais execuções — situaram o modelo em 24,5 tokens/s em um Ryzen AI Max+ 395 e 51,8 tokens/s em uma Radeon AI PRO R9700 com 32 GB, em sistemas com mais de aproximadamente 24 GB de memória gráfica variável ou VRAM. Testes da comunidade com a versão FP8 em um NVIDIA GH200 sustentaram 10 solicitações simultâneas com contexto de 262K com tempo até o primeiro token inferior a 10 ms. Seus próprios números serão diferentes — essas são GPUs de outras pessoas — mas o padrão é real: este é o primeiro lançamento da Qwen nesta classe que roda, não apenas em uma análise, em uma única estação de trabalho.
Pesos gratuitos ou uma API paga?
A decisão que este modelo força é a que divide local de hospedado: os pesos não custam nada, mas suas GPUs não são gratuitas. Auto-hospedagem significa possuir o silício — uma placa de 24GB se você aceitar quantização de 4 bits e geração mais lenta, algo maior se quiser o contexto completo de 262K com qualidade total. A alternativa hospedada no OrcaRouter é de $0.33 por milhão de tokens de entrada e $2.40 por milhão de saída, com o mesmo contexto de 262K e entrada de imagem e vídeo, e um p50 de tempo até o primeiro token de 225ms medido nos últimos sete dias — sem GPU para comprar, sem VRAM para vigiar. A aritmética é a mesma que você sempre faz com pesos abertos: a taxa de transferência de tokens que você realmente precisa vezes o seu custo por token, contra o preço fixo de uma placa. Em volume pesado e sustentado, a auto-hospedagem vence; em volume intermitente ou modesto, pagar $0.33/$2.40 supera comprar silício que você deixa ocioso na maior parte do tempo.

Conclusão
Qwen3.8-27B é o modelo de pesos abertos mais forte que a Alibaba já lançou nesta classe de tamanho, segundo os próprios números da Alibaba: melhor da tabela em codificação agêntica, uso de computador e raciocínio visual, com janela de contexto de 262K e pesos sob licença Apache 2.0. A leitura correta do placar é condicional — cada número é reportado pelo fornecedor, específico de harness e ainda não reproduzido, e os modelos de fronteira ainda vencem os benchmarks de raciocínio mais difíceis. Se você está decidindo entre hospedá-lo localmente ou chamá-lo via API, trate a tabela de benchmarks como a promessa e os números de throughput da AMD como a única medição independente que existe hoje. Atualizaremos esta página no dia em que um laboratório independente publicar uma pontuação.
