Cartão de título para o resumo de benchmarks do Qwen3.8-27B, mostrando um boletim de benchmark com um selo que diz OPEN WEIGHTS e ícones para codificação, throughput, visão, contexto longo e hardware local, com chips que dizem 27B DENSE, 262K CONTEXT e APACHE 2.0.
Guides & Insights

Benchmarks do Qwen3.8-27B: A Tabela Completa, com as Ressalvas Anexas

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen3.8-27B obtém 73,0 no Terminal-Bench 2.1, 61,7 no SWE-bench Pro, 90,3 no LiveCodeBench v6 e 84,3 no OSWorld-Verified — e cada um desses números é da própria Alibaba. O modelo de pesos abertos com 27 bilhões de parâmetros chegou ao Hugging Face em 14 de agosto de 2026 sob a licença Apache 2.0 e, a partir de 15 de agosto, ninguém fora da Alibaba avaliou independentemente sua qualidade. Esta página é o resumo completo e com fontes: todos os 25 benchmarks oficiais do model card, o que mudou em relação ao seu antecessor Qwen3.6-27B, o que um teste independente de throughput da AMD mediu e quais alegações você deve tratar como provisórias.

Um guia de leitura antes dos números: "oficial" aqui significa a avaliação da Alibaba impressa no cartão do modelo em Qwen/Qwen3.8-27B. É relatado pelo fornecedor e não reproduzido. "Independente" significa que alguém de fora do laboratório o mediu — até agora isso se aplica apenas à taxa de transferência de hardware, não a qualquer pontuação de qualidade. Benchmarks cuja estrutura de teste importa são sinalizados inline.

O modelo, uma linha por especificação

• 27B parâmetros densos (28B contando o codificador de visão), 64 camadas, tamanho oculto 5120.

• Atenção híbrida — 48 camadas de atenção linear Gated DeltaNet mais 16 camadas de atenção total, numa proporção de 3:1 — o que torna viável executar uma janela de 262 mil tokens.

• 262.144 tokens de contexto nativo, extensível para 1.000.000 com escala YaRN.

Entrada nativa de imagem e vídeo (saída de texto), pesos Apache 2.0, aproximadamente 55,6GB em BF16.

A versão curta: este é o modelo que visa pegar o que a Alibaba aprendeu construindo o Qwen3.8-Max, de 2,4 trilhões de parâmetros, e compactá-lo em algo que uma única GPU possa executar.

O scorecard: todos os benchmarks na ficha do modelo.

Todas as pontuações abaixo são relatadas pela Alibaba na ficha do modelo de 14 de agosto, com a pontuação do Qwen3.6-27B que o modelo substitui entre parênteses.

Programação. Terminal-Bench 2.1 (codificação em terminal por agentes) 73,0 (63,4); SWE-bench Pro 61,7 (53,5); QwenSWEBench 79,0 (49,3); DeepSWE 1.1 42,2 (13,3); NL2Repo-Bench 42,3 (36,2); LiveCodeBench v6 90,3 (83,9). As execuções do SWE-bench Pro e do QwenSWEBench usaram o harness do Claude Code, conforme uma nota de rodapé do model card — algo a se ter em mente antes de compará-los a um modelo avaliado com um harness diferente.

Agentes de longo horizonte e trabalho de escritório. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / pontuação 42.9 (10.6 / 27.3).

Raciocínio e conhecimento. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench de seguimento de instruções 79.5 (69.1). O HLE é avaliado pelo GPT-4o, conforme o card.

Visão e uso de computador. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 com CI / 90.0 sem (85.1); BabyVision 85.6 com CI / 65.7 sem (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" é o aprimoramento em tempo de inferência da Alibaba; a diferença entre seus estados ativado e desativado é o número mais informativo no cartão sobre quanta pontuação você pode comprar com computação de inferência adicional.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

O que realmente mudou em relação ao Qwen3.6-27B

Cada benchmark no cartão subiu, mas os deltas não são uniformes — e o formato da melhoria é a história. Os ganhos se concentram em codificação agêntica e uso de computador, não em recuperação de conhecimento:

• DeepSWE 1.1 (codificação agêntica) 13.3 → 42.2, aproximadamente um salto de 3x

QwenSWEBench 49.3 → 79.0

• Pontuação do Agents' Last Exam 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 e AndroidWorld 70.3 → 81.9

• BabyVision (com IC) 28.9 → 85.6 — o maior ganho relativo da tabela

Meanwhile, GPQA Diamond {{1}}passou de 87.8 → 89.2{{/1}} e RealWorldQA {{2}}de 84.1 → 85.9{{/2}}: {{3}}melhorias reais, mas pequenas{{/3}}. {{4}}Esta não é uma versão "mais inteligente em tudo"{{/4}}. {{5}}É uma versão voltada diretamente para agentes{{/5}} {{6}}que leem telas, usam ferramentas e escrevem código{{/6}} {{7}}em muitas etapas{{/7}}.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

As lacunas honestas: onde ainda perde, e as ressalvas metodológicas

Contra a fronteira, o quadro é lisonjeiro, mas não unilateral. Onde Qwen3.8-27B e Claude Opus 4.6 Max se sobrepõem, Qwen vence a maioria — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench e todo o bloco de visão. Contra o Muse Glimmer-30B da Meta, o rival natural da classe local, vence todos os oito benchmarks sobrepostos de forma inequívoca. Mas ainda perde Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) e NL2Repo-Bench (42.3 vs 47.6) para Claude Opus 4.6 Max. Se a sua carga de trabalho é o raciocínio de fronteira mais difícil — matemática de ponta, perguntas massivamente multidisciplinares — o 27B ainda não chegou lá.

Três ressalvas antes de você citar qualquer uma dessas informações. Primeiro, nada disso é verificado de forma independente; não há índice Artificial Analysis nem execução no LMArena para o 27B até 15 de agosto, e os harnesses da própria Alibaba não são os que terceiros usarão. Segundo, o model card usa o harness Claude Code para SWE-bench Pro e QwenSWEBench e um juiz GPT-4o para Humanity's Last Exam — comparações com modelos avaliados em outras configurações alterarão os números. Terceiro, a execução da MathVision da Alibaba usou um prompt fixo, enquanto os concorrentes receberam a variante de maior pontuação entre duas. Nada disso significa que os resultados estejam errados; significa que eles são um teto, não um piso, até que outra pessoa execute o modelo.

O que é preciso para executá-lo

Qwen3.8-27B é um modelo local, o que muda o significado de "desempenho": vazão no seu próprio hardware em vez de uma tabela de preços. Os pesos BF16 ocupam aproximadamente 55,6 GB; quantizados para 4 bits, cabem em uma placa de 24 GB, como uma RTX 3090 ou 4090. A AMD lançou suporte Day-0 no dia do lançamento, e suas próprias medições com llama.cpp/Vulkan — agosto de 2026, média de três ou mais execuções — situaram o modelo em 24,5 tokens/s em um Ryzen AI Max+ 395 e 51,8 tokens/s em uma Radeon AI PRO R9700 com 32 GB, em sistemas com mais de aproximadamente 24 GB de memória gráfica variável ou VRAM. Testes da comunidade com a versão FP8 em um NVIDIA GH200 sustentaram 10 solicitações simultâneas com contexto de 262K com tempo até o primeiro token inferior a 10 ms. Seus próprios números serão diferentes — essas são GPUs de outras pessoas — mas o padrão é real: este é o primeiro lançamento da Qwen nesta classe que roda, não apenas em uma análise, em uma única estação de trabalho.

Pesos gratuitos ou uma API paga?

A decisão que este modelo força é a que divide local de hospedado: os pesos não custam nada, mas suas GPUs não são gratuitas. Auto-hospedagem significa possuir o silício — uma placa de 24GB se você aceitar quantização de 4 bits e geração mais lenta, algo maior se quiser o contexto completo de 262K com qualidade total. A alternativa hospedada no OrcaRouter é de $0.33 por milhão de tokens de entrada e $2.40 por milhão de saída, com o mesmo contexto de 262K e entrada de imagem e vídeo, e um p50 de tempo até o primeiro token de 225ms medido nos últimos sete dias — sem GPU para comprar, sem VRAM para vigiar. A aritmética é a mesma que você sempre faz com pesos abertos: a taxa de transferência de tokens que você realmente precisa vezes o seu custo por token, contra o preço fixo de uma placa. Em volume pesado e sustentado, a auto-hospedagem vence; em volume intermitente ou modesto, pagar $0.33/$2.40 supera comprar silício que você deixa ocioso na maior parte do tempo.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Conclusão

Qwen3.8-27B é o modelo de pesos abertos mais forte que a Alibaba já lançou nesta classe de tamanho, segundo os próprios números da Alibaba: melhor da tabela em codificação agêntica, uso de computador e raciocínio visual, com janela de contexto de 262K e pesos sob licença Apache 2.0. A leitura correta do placar é condicional — cada número é reportado pelo fornecedor, específico de harness e ainda não reproduzido, e os modelos de fronteira ainda vencem os benchmarks de raciocínio mais difíceis. Se você está decidindo entre hospedá-lo localmente ou chamá-lo via API, trate a tabela de benchmarks como a promessa e os números de throughput da AMD como a única medição independente que existe hoje. Atualizaremos esta página no dia em que um laboratório independente publicar uma pontuação.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube