Um cartão de título em destaque para 'AesCode 32B vs Qwen3.8 27B', com o subtítulo 'o ajuste fino e o ancestral', desenhado como um diagrama de linhagem: um cartão de checkpoint Qwen3-VL-32B-Instruct à esquerda alimenta uma seta que aponta para um cartão 'ajuste fino do AesCode 32B' rotulado 'apenas auto-hospedado, 65 GB', enquanto um cartão mais novo e separado, abaixo à direita, rotulado 'Qwen3.8 27B', exibe um marcador de API ativa com a leitura 'chamável hoje'; o logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

AesCode 32B vs Qwen3.8 27B: A Microsoft o construiu sobre o Qwen, e um deles é chamável

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O detalhe que reorganiza toda esta comparação está na segunda linha do cartão do modelo: AesCode 32B parte do Qwen3-VL-32B-Instruct. O modelo de código específico para design da Microsoft é um fine-tune do Qwen3-VL, Apache 2.0, em um repositório do Hugging Face criado em 29 de setembro de 2026, com o commit intitulado "Release AesCode-32B", datado de 7 de outubro de 2026, e sem nenhum anúncio da Microsoft em lugar algum. Qwen3.8 27B é a outra ponta dessa linhagem: o próprio modelo multimodal denso de 27B com pesos abertos do fornecedor, lançado em 14 de agosto de 2026 sob Apache 2.0, a arquitetura sucessora do checkpoint VL que a Microsoft ajustou. Então isto não é um confronto entre os esforços de ponta de dois fornecedores. É um confronto entre o modelo de pesos abertos de uso geral de um laboratório e o fine-tune de pesquisa de um concorrente dessa família, e a diferença prática entre eles acaba sendo quase inteiramente sobre o que você tem permissão para fazer com o arquivo depois de tê-lo.

Mesma licença, mesma família, quantidade diferente de modelo.

Ambos são Apache 2.0, ambos aceitam tanto imagens quanto texto, e ambos retornam texto. Tudo o que vem depois disso diverge, e a linha de implantação é a que mais diverge.

• Parâmetros — AesCode 32B: 33B denso em uma base Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B denso, 28B contando o codificador de visão, 64 camadas com um tamanho oculto de 5120.

• Memória para executá-lo — AesCode 32B: o card recomenda planejar cerca de 65 GB de memória de acelerador apenas para os parâmetros em bf16, e seu próprio exemplo de serving usa paralelismo de tensores em quatro vias. Qwen3.8 27B: cerca de 55,6 GB em bf16.

• Contexto — AesCode 32B: 24.576 tokens na configuração reportada, com prompts e respostas no momento do treinamento limitados a 8.192. Qwen3.8 27B: 262.144 tokens nativos, expansíveis para 1.000.000 com escalonamento YaRN.

• Atenção — AesCode 32B: herdado do backbone Qwen3-VL. Qwen3.8 27B: híbrido, 48 camadas de atenção linear Gated DeltaNet para 16 camadas de atenção plena numa proporção de 3:1, o que torna uma janela de 262K viável de servir.

• Para que serve — AesCode 32B: gerar artefatos visuais ricos em informações como HTML e CSS editáveis, além de pesquisa sobre geração de código multimodal. Qwen3.8 27B: trabalho agêntico e multimodal geral — programação, uso de computador, compreensão de documentos e vídeos, chamada de ferramentas.

• Onde você o obtém — AesCode 32B: um download do Hugging Face; nenhum provedor de inferência o implanta. Qwen3.8 27B: pesos, ou um endpoint hospedado.

O dobro do contexto, pegada ligeiramente menor, backbone uma geração mais recente e uma licença idêntica. A única linha em que o AesCode 32B vence de forma absoluta é a primeira, e consegue isso com um fine-tune específico para a tarefa.

Com base em que cada um foi realmente medido

Os dois regimes de avaliação não se tocam, e fingir o contrário é o erro padrão em páginas como esta.

O cartão do Qwen3.8 27B é amplo e específico ao mesmo tempo. Programação: Terminal-Bench 2.1 com 73.0, SWE-bench Pro com 61.7, QwenSWEBench com 79.0, LiveCodeBench v6 com 90.3. Raciocínio: GPQA Diamond 89.2, Humanity's Last Exam 30.8. Uso de computador: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9. Visão: MathVision 94.6 com o aprimoramento em tempo de inferência do fornecedor e 90.0 sem ele, OmniDocBench 1.5 com 91.1. Tudo isso são números do próprio fornecedor em seu próprio harness — com uma nota de rodapé que vale a pena ler, de que as execuções do SWE-bench Pro e do QwenSWEBench usaram o harness do Claude Code, portanto não são diretamente comparáveis com modelos avaliados em um diferente.

AesCode 32B tem um único benchmark, e ele é de propósito único: 300 amostras de infográfico, três gerações por prompt sem seleção, renderizadas e pontuadas em sete canais. O destaque é um Overall de 85,89 com a imagem de referência fornecida, contra 81,28 para o GPT-5.5 e 80,39 para o Claude Opus 4.8 sob o mesmo harness — além da alegação de que o AesCode 32B supera seu próprio backbone Qwen3-VL-32B em 22,4 pontos na dimensão Visual e 24,8 em Overall.

Coloque esses lado a lado e nada se alinha. O Terminal-Bench mede se uma tarefa de shell é concluída; a avaliação do AesCode mede se o texto de um infográfico é legível, se o layout não ultrapassa a tela e se a sua tabela é uma tabela HTML de verdade. Não há métrica compartilhada, nem estrutura de teste compartilhada, nem tarefa compartilhada. A única afirmação honesta é que o AesCode 32B é muito melhor em artefatos de design do que o seu próprio backbone, e que o Qwen3.8 27B é um modelo geral forte — e nenhuma das duas afirmações diz nada sobre a outra.

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

A lacuna de evidências é real desta vez, em uma direção.

Os benchmarks de fornecedores são a norma neste setor, por isso é relevante que estes dois difiram quanto à proporção das suas alegações de fornecedor que foi verificada por terceiros.

O Qwen3.8 27B foi lançado com a tabela do próprio fornecedor e, em poucas semanas, acumulou resultados externos. O histórico independente do modelo inclui um estudo de agente jurídico conduzido pela empresa de IA jurídica Harvey com a startup de memória Engram, no qual um Qwen3.8 27B adaptado superou todos os modelos testados no estudo, incluindo o Claude Opus 4.8, em 250 tarefas jurídicas — com a ressalva importante de que o modelo adaptado havia estudado primeiro o corpus de 100 milhões de tokens do escritório testado, de modo que é um resultado tanto sobre a adaptação quanto sobre o modelo. Inclui uma colocação no leaderboard WebDev do Code Arena e a melhor posição entre pesos abertos no leaderboard Image-to-WebDev do Arena.ai, ambas alegações de ranking repassadas pelo fornecedor, e não uma metodologia publicada. E inclui um painel de terceiros com uma pontuação publicada: o Artificial Analysis registra o Qwen3.8 27B em 33,70 em seu Intelligence Index, com um custo por tarefa concluída em torno de US$ 1,01, e publica a discriminação de tokens por trás disso.

AesCode 32B não tem nada disso. Sem posicionamento em arena, sem listagem em ranking, sem reprodução por terceiros, sem teste independente de throughput — e não porque alguém tenha olhado e o considerado deficiente, mas porque um checkpoint que nenhum provedor disponibiliza não pode, em primeiro lugar, ser avaliado por um harness externo. Seus números são do fornecedor, computados pela mesma pilha de verificação que treinou o modelo, em amostras que o fornecedor executou, com baselines que o fornecedor executou. O lançamento é excepcionalmente transparente quanto ao método — os nomes dos kernels de recompensa, o rollout, os parâmetros de decodificação e os modos de falha estão todos publicados —, mas transparência sobre como um número foi produzido não é o mesmo que outra pessoa o produzir.

Aquele que cobra um cartão salvo

É aqui que a linhagem deixa de ser curiosidade e passa a ser a decisão.

O AesCode 32B exige de você 65 GB de memória de acelerador, um caminho de serviço multimodal e disposição para executar um modelo não anunciado como adotante inicial. Seu próprio exemplo de serviço recorre a paralelismo de tensores em quatro vias, e o modelo está documentado para um contexto de 24.576 tokens, sem opção hospedada para a qual recorrer. Se você já tem o hardware e seu pipeline realmente precisa de ajuste fino específico do design, essa é uma troca razoável. Para a maioria das equipes, é um projeto de duas semanas antes do primeiro resultado útil.

O Qwen3.8 27B está auto-hospedado na infraestrutura própria da OrcaRouter e pode ser chamado hoje mesmo a $0,33 por milhão de tokens de entrada e $2,40 por milhão de saída, com uma janela de contexto de 262.144 tokens e entrada de texto, imagem e vídeo. Essas são as tarifas de tabela repassadas sem qualquer margem acrescentada do nosso lado, e ele fica na mesma chave que mais de 200 outros modelos, de modo que a comparação com qualquer alternativa do catálogo é um parâmetro de requisição, e não um segundo contrato. É esse todo o argumento prático, e é um argumento forte: o modelo que, em termos de família, está uma geração atrás da espinha dorsal do AesCode 32B é justamente aquele que você pode avaliar esta tarde, com os seus próprios prompts, pelo preço de alguns cêntimos.

Há aqui um ponto de segunda ordem que o ângulo de roteamento torna concreto. Como o AesCode 32B é um fine-tune de um checkpoint Qwen3-VL, a família oferece uma maneira barata de testar se o lado hospedado da arquitetura funciona de fato antes de você se comprometer a hospedar qualquer coisa por conta própria. O Qwen3-VL 235B A22B Instruct está disponível a US$ 0,40 por milhão de tokens de entrada e US$ 1,60 de saída, e o Qwen3-VL 8B Instruct a US$ 0,18 e US$ 0,70. Nenhum deles é o AesCode 32B, e nenhum foi treinado para qualidade de design — mas "um modelo de linguagem visual consegue ler nossas capturas de tela e escrever a marcação de que precisamos" pode ser respondida com eles por centavos, e o failover automático sob o mesmo endpoint significa que um dia ruim de um provedor não derruba o pipeline.

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

Quem deve escolher qual?

Escolha o AesCode 32B se o artefato for o entregável. Você produz slides, dashboards, pôsteres ou relatórios em volume, precisa de saída estruturada que permaneça editável e passível de diff — o modelo emite um documento HTML completo, usa estruturas de tabela HTML reais e especificações ECharts para que ambos permaneçam inspecionáveis — e você tem o hardware ou o orçamento para alugá-lo. Entre nessa aceitando três coisas: nenhuma verificação independente de qualquer número, cerca de 65 GB para os pesos, e um contexto de 24K que vai restringir documentos longos. A taxa de 4,3% de falhas graves na fronteira do canvas que o cartão reporta, contra 34,7% do GPT-5.5, é o número isolado mais encorajador do lançamento, e também é da Microsoft.

Escolha o Qwen3.8 27B se precisar de um modelo multimodal geral de pesos abertos que consegue realmente executar e realmente servir. Contexto de 262K, extensível a um milhão; uma pegada de implantação que cabe onde o AesCode 32B não cabe; uma posição de licenciamento sem diferença; alguma medição independente tanto da sua qualidade quanto do seu custo por tarefa concluída; e uma opção hospedada que significa que pode começar hoje e hospedar por conta própria mais tarde sem reescrever a integração. O seu design de atenção faseado e camada a camada é a razão pela qual o contexto longo é acessível, e o contexto longo é aquilo de que os pipelines de design e de documentos tendem a precisar mais.

E se você precisar dos dois — um gerador de artefatos de design e um faz-tudo de uso geral —, a divisão sensata não é executar dois modelos de visão-linguagem da classe 30B no seu próprio equipamento. Encaminhe o tráfego geral para o lado hospedado e mantenha o especialista auto-hospedado, atrás de uma única chave, onde uma indisponibilidade do provedor em qualquer um dos caminhos é um evento de failover, e não um incidente.

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

A coisa a observar

A posição do AesCode 32B muda completamente se ele se tornar chamável. No momento, a única fraqueza real do modelo é o acesso, e isso é uma condição temporária — um provedor de inferência adotar o checkpoint, ou a Microsoft publicar um endpoint, transforma uma aquisição de 65 GB em uma seleção de modelo. Até então, o resumo honesto desta comparação é que o fine-tune é melhor em uma tarefa, o modelo generalista é melhor em ser utilizável, e o modelo generalista por acaso é o ancestral: a Microsoft escolheu um checkpoint do Qwen3-VL como base para desenvolver porque era a base multimodal aberta mais forte disponível, o que é, por si só, a coisa mais útil que esta comparação tem a dizer sobre o Qwen3.8 27B.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente