Cartão de título para o resumo de benchmarks do Qwen3.8-27B, mostrando um boletim de benchmark com um selo que diz OPEN WEIGHTS e ícones para codificação, throughput, visão, contexto longo e hardware local, com chips que dizem 27B DENSE, 262K CONTEXT e APACHE 2.0.
Guides & Insights

Benchmarks do Qwen3.8-27B: A Tabela Completa, com as Ressalvas Anexas

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen/Qwen3.8-27B obtém 73,0 no Terminal-Bench 2.1, 61,7 no SWE-bench Pro, 90,3 no LiveCodeBench v6 e 84,3 no OSWorld-Verified — e todos esses números são da própria Alibaba. O modelo de pesos abertos de 27 bilhões de parâmetros chegou ao Hugging Face em 14 de agosto de 2026 sob licença Apache 2.0 e, nas suas duas primeiras semanas, recebeu três resultados independentes de terceiros: o primeiro lugar em pesos abertos no benchmark Harvey's Legal Agent, em um estudo conduzido pela empresa de IA jurídica Harvey e pela empresa de memória Engram; o 9º lugar geral na leaderboard WebDev do Code Arena, o único modelo da sua faixa de tamanho no top 10, segundo o anúncio da Alibaba em 25 de agosto; e, anunciado em 26 de agosto, o primeiro lugar em pesos abertos na leaderboard Image-to-WebDev do Arena.ai, classificado em 7º lugar geral com uma pontuação reportada de 1.574. Esta página é o resumo completo, com fontes: todos os 25 benchmarks oficiais do model card, o que mudou em relação ao seu antecessor Qwen3.6-27B, o que um teste independente de throughput da AMD mediu, esses resultados de agente jurídico e de arena webdev, e quais alegações você ainda deve tratar como provisórias.

Um guia de leitura antes dos números: "oficial" aqui significa a avaliação da Alibaba impressa no cartão do modelo em Qwen/Qwen3.8-27B. É relatada pelo fornecedor e não reproduzida. "Independente" significa que alguém fora do laboratório a mediu — até agora isso abrange um teste de throughput de hardware, um estudo de agente no domínio jurídico e colocações em dois dos leaderboards de desenvolvimento web da Arena.ai, o WebDev do Code Arena e o arena Image-to-WebDev. Benchmarks cujo harness importa são sinalizados inline.

O modelo, uma linha por especificação

• 27B parâmetros densos (28B contando o codificador de visão), 64 camadas, tamanho oculto 5120.

• Atenção híbrida — 48 camadas de atenção linear Gated DeltaNet mais 16 camadas de atenção total, numa proporção de 3:1 — o que torna viável executar uma janela de 262 mil tokens.

• 262.144 tokens de contexto nativo, extensível para 1.000.000 com escala YaRN.

Entrada nativa de imagem e vídeo (saída de texto), pesos Apache 2.0, aproximadamente 55,6GB em BF16.

A versão curta: este é o modelo que visa pegar o que a Alibaba aprendeu construindo o Qwen3.8-Max, de 2,4 trilhões de parâmetros, e compactá-lo em algo que uma única GPU possa executar.

O scorecard: todos os benchmarks na ficha do modelo.

Todas as pontuações abaixo são relatadas pela Alibaba na ficha do modelo de 14 de agosto, com a pontuação do Qwen3.6-27B que o modelo substitui entre parênteses.

Programação. Terminal-Bench 2.1 (codificação em terminal por agentes) 73,0 (63,4); SWE-bench Pro 61,7 (53,5); QwenSWEBench 79,0 (49,3); DeepSWE 1.1 42,2 (13,3); NL2Repo-Bench 42,3 (36,2); LiveCodeBench v6 90,3 (83,9). As execuções do SWE-bench Pro e do QwenSWEBench usaram o harness do Claude Code, conforme uma nota de rodapé do model card — algo a se ter em mente antes de compará-los a um modelo avaliado com um harness diferente.

Agentes de longo horizonte e trabalho de escritório. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / pontuação 42.9 (10.6 / 27.3).

Raciocínio e conhecimento. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench de seguimento de instruções 79.5 (69.1). O HLE é avaliado pelo GPT-4o, conforme o card.

Visão e uso de computador. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 com CI / 90.0 sem (85.1); BabyVision 85.6 com CI / 65.7 sem (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" é o aprimoramento em tempo de inferência da Alibaba; a diferença entre seus estados ativado e desativado é o número mais informativo no cartão sobre quanta pontuação você pode comprar com computação de inferência adicional.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

O que realmente mudou em relação ao Qwen3.6-27B

Cada benchmark no cartão subiu, mas os deltas não são uniformes — e o formato da melhoria é a história. Os ganhos se concentram em codificação agêntica e uso de computador, não em recuperação de conhecimento:

• DeepSWE 1.1 (codificação agêntica) 13.3 → 42.2, aproximadamente um salto de 3x

QwenSWEBench 49.3 → 79.0

• Pontuação do Agents' Last Exam 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 e AndroidWorld 70.3 → 81.9

• BabyVision (com IC) 28.9 → 85.6 — o maior ganho relativo da tabela

Meanwhile, GPQA Diamond {{1}}passou de 87.8 → 89.2{{/1}} e RealWorldQA {{2}}de 84.1 → 85.9{{/2}}: {{3}}melhorias reais, mas pequenas{{/3}}. {{4}}Esta não é uma versão "mais inteligente em tudo"{{/4}}. {{5}}É uma versão voltada diretamente para agentes{{/5}} {{6}}que leem telas, usam ferramentas e escrevem código{{/6}} {{7}}em muitas etapas{{/7}}.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Desde que esta página foi ao ar, o desenvolvimento mais importante é jurídico, não técnico. A Alibaba anunciou que o Qw​en3.8-27B é o modelo de pesos abertos nº 1 no benchmark Legal Agent da Harvey — uma alegação de ranking vinda do próprio relato do fornecedor, portanto trate-a como uma declaração da Alibaba. O resultado por trás disso é um estudo que não é da Alibaba: a Harvey, a empresa de IA jurídica, e a Engram, uma startup de memória para IA, construíram um escritório de advocacia sintético chamado Calderwood & Harkness a partir de 100M+ tokens distribuídos por cerca de 10.000 documentos e 266 casos e, em seguida, adaptaram o Qw​en3.8-27B a ele com memória paramétrica, notas compactadas e uma ferramenta de recuperação.

Em 250 tarefas jurídicas, o 27B adaptado obteve média de 67%, à frente de todos os modelos testados no estudo — incluindo o Claude Opus 4.8 — e, em critério estrito de correção tudo-ou-nada, superou o Opus 4.8 por 30% a 25%, a cerca de US$ 0,13 por consulta contra US$ 1,32 para o Opus 4.8. Esses números são relatados pela Harvey/Engram e ainda não foram reproduzidos de forma independente. Antes do treinamento com os documentos da própria firma, o mesmo modelo obteve apenas 4,7% em perguntas específicas da firma; depois de estudá-los, 72,6%.

Leia o #1 com uma grande ressalva: o modelo que ficou no topo do benchmark havia estudado o corpus de teste antecipadamente, adaptado nos 100M tokens da empresa antes de ser avaliado. Isso faz disso uma demonstração do que o 27B pode absorver com ajuste fino específico de domínio, não uma pontuação para os pesos Apache-2.0 padrão em um harness neutro — e cobre um domínio, direito, não qualidade geral. O que isso de fato apoia é a tese por trás do tweet: um 27B pequeno o suficiente para rodar em uma máquina local é forte o suficiente para trabalho de nível profissional uma vez que tenha o conhecimento certo.

O segundo resultado independente: #9 no geral na WebDev da Code Arena.

O segundo resultado independente é um resultado de codificação, e é por isso que esta página mudou em 25 de agosto. Code Arena é o leaderboard de desenvolvimento web da Arena.ai — o projeto anteriormente conhecido como WebDev Arena, no site anteriormente conhecido como LMArena — onde os usuários constroem aplicativos reais com pares anonimizados de modelos e votam em qual resultado prefeririam lançar. Nesse leaderboard público, o Qw​en3.8-27B está em #9 no geral, com uma pontuação de 1595, o único modelo em sua classe de tamanho dentro do top 10.

A colocação é a parte independente — está em um ranking de terceiros que qualquer pessoa pode abrir. O título ao redor é declarado pela Alibaba: o enquadramento de "único modelo pequeno no top 10" e as colocações complementares vêm do anúncio de 25 de agosto da Qw​en. Eles merecem ser repetidos com esse rótulo. O 27B fica seis posições abaixo do muito maior Qwen3.8-Max (que o anúncio coloca em #3 no geral) e bem à frente do Gemma 4-31B, de tamanho semelhante (que o mesmo anúncio coloca em #80). O ponto não é que um 27B supera os modelos de fronteira na criação de aplicativos web; é que um modelo pequeno o suficiente para rodar em uma GPU está entre os dez primeiros de uma arena de codificação cega cujos outros ocupantes são modelos muito maiores.

O terceiro resultado independente: #1 modelo aberto no Image-to-WebDev da Arena.ai

O terceiro resultado independente chegou em {{1}}26 de agosto{{/1}}, e é o mais forte até agora para um modelo deste porte. {{2}}Image-to-WebDev{{/2}} é o ranking irmão do {{3}}WebDev do Code Arena{{/3}} no {{4}}Arena.ai{{/4}} — a arena onde um modelo recebe uma captura de tela ou outra referência visual e precisa transformá-la em uma interface web funcional, com votantes humanos anônimos escolhendo a saída que prefeririam publicar. Nesse ranking público, {{5}}Qw​en3.8-27B{{/5}} ocupa o 1º lugar entre os modelos abertos e o 7º no geral, com uma pontuação reportada de {{6}}1.574{{/6}} na arena.

A colocação é a parte independente — está em um ranking de terceiros que qualquer pessoa pode abrir. A manchete em torno dela é uma declaração da Alibaba: o anúncio de 26 de agosto da equipe Qw​en classifica o 27B como "no mesmo nível de modelos 100x maiores" neste teste, uma comparação que o ranking não documenta. E uma classificação de preferência não é um veredito sobre qualidade de código — os votos do Image-to-WebDev medem qual resultado um humano preferiria entregar, não se o HTML é seguro, acessível ou de fácil manutenção. O que o resultado de fato estabelece é que um modelo de pesos abertos de 27B agora lidera todo o seu campo aberto em transformar uma imagem em uma página, que é a habilidade sobre a qual uma categoria crescente de produtos "screenshot to site" é construída.

As lacunas honestas: onde ainda perde, e as ressalvas metodológicas

Diante da fronteira, o quadro é lisonjeiro, mas não unilateral. Onde Qw​en3.8-27B e Claude Opus 4.6 Max se sobrepõem, a Qw​en vence a maioria — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench e todo o bloco de visão. Contra o Muse Glimmer-30B da Meta, o rival natural da classe local, vence todos os oito benchmarks sobrepostos de forma inequívoca. Mas ainda perde Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) e NL2Repo-Bench (42.3 vs 47.6) para Claude Opus 4.6 Max. Se sua carga de trabalho for o raciocínio de fronteira mais difícil — matemática de fronteira, questões massivamente multidisciplinares — o 27B ainda não chegou lá.

Três ressalvas antes de você citar qualquer coisa disso. Primeiro, a tabela do model card acima ainda é inteiramente reportada pela Alibaba — ainda não há índice Artificial Analysis para o 27B. Agora existem três resultados independentes de terceiros, mas cada um é limitado: o ranking Code Arena mede a criação de web apps a partir de prompts de texto, o ranking Image-to-WebDev mede a transformação de uma captura de tela em uma página funcional, ambos avaliados por votos cegos em saídas anonimizadas, e o estudo da Harvey sobre agente jurídico cobre um único domínio com um modelo treinado para o teste. Nenhum deles é a execução dos pesos padrão em um harness de propósito geral. Segundo, o model card usa o harness Claude Code para SWE-bench Pro e QwenSWEBench e um avaliador GPT-4o para Humanity's Last Exam — comparações com modelos avaliados em outras configurações vão alterar os números. Terceiro, a execução do MathVision da Alibaba usou um prompt fixo, enquanto concorrentes receberam o maior de duas variantes. Nada disso significa que os resultados estão errados; significa que são um teto, não um piso, até que laboratórios independentes executem o modelo em harnesses neutros de propósito geral.

O que é preciso para executá-lo

O Qw​en3.8-27B é um modelo local, o que muda o que "desempenho" significa: vazão no seu próprio hardware em vez de uma tabela de preços. Os pesos BF16 têm cerca de 55,6 GB; quantizados para 4 bits, cabem em uma placa de 24 GB, como uma RTX 3090 ou 4090. A AMD ofereceu suporte Day-0 no dia do lançamento, e suas próprias medições com llama.cpp/Vulkan — agosto de 2026, média de três ou mais execuções — colocam o modelo em 24,5 tokens/s em um Ryzen AI Max+ 395 e 51,8 tokens/s em uma Radeon AI PRO R9700 com 32 GB, em sistemas com mais de aproximadamente 24 GB de memória gráfica variável ou VRAM. Testes da comunidade da versão FP8 em um NVIDIA GH200 sustentaram 10 solicitações simultâneas com contexto de 262K e tempo até o primeiro token inferior a 10 ms. Seus próprios números serão diferentes — esses são GPUs de outra pessoa — mas o panorama é real: este é o primeiro lançamento do Qw​en nesta classe que roda, não apenas em uma análise, em uma única estação de trabalho.

Pesos gratuitos ou uma API paga?

A decisão que este modelo força é a que divide local de hospedado: os pesos não custam nada, mas suas GPUs não são gratuitas. Auto-hospedagem significa possuir o silício — uma placa de 24GB se você aceitar quantização de 4 bits e geração mais lenta, algo maior se quiser o contexto completo de 262K com qualidade total. A alternativa hospedada no OrcaRouter é de $0.33 por milhão de tokens de entrada e $2.40 por milhão de saída, com o mesmo contexto de 262K e entrada de imagem e vídeo, e um p50 de tempo até o primeiro token de 225ms medido nos últimos sete dias — sem GPU para comprar, sem VRAM para vigiar. A aritmética é a mesma que você sempre faz com pesos abertos: a taxa de transferência de tokens que você realmente precisa vezes o seu custo por token, contra o preço fixo de uma placa. Em volume pesado e sustentado, a auto-hospedagem vence; em volume intermitente ou modesto, pagar $0.33/$2.40 supera comprar silício que você deixa ocioso na maior parte do tempo.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Conclusão

Qwen3.8-27B é o modelo de pesos abertos mais forte que a Alibaba já colocou nesta classe de tamanho, segundo os próprios números da Alibaba: melhor da tabela em codificação agêntica, uso de computador e raciocínio visual, com janela de contexto de 262K e pesos Apache 2.0. A leitura correta do placar é condicional — todos os números do model card são relatados pelo fornecedor, específicos do harness e ainda não reproduzidos, e os modelos de fronteira ainda vencem os benchmarks de raciocínio mais difíceis. Se você está decidindo se deve auto-hospedar o modelo ou consumi-lo como API, trate a tabela de benchmarks como a promessa, os números de throughput da AMD como a primeira medição independente de hardware, o resultado do agente jurídico da Harvey como o primeiro sinal independente de que a capacidade do modelo sobrevive fora dos harnesses da própria Alibaba, e as duas colocações no webdev-arena — #9 no geral no WebDev do Code Arena e #1 modelo aberto no Image-to-WebDev do Arena.ai — como as primeiras confirmações independentes dessa capacidade em rankings de codificação. Atualizaremos esta página à medida que mais laboratórios independentes publicarem pontuações.