
AesCode 32B vs Qwen3.8 27B: A Microsoft o construiu sobre o Qwen, e um deles é chamável
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 85 tok/s
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
O detalhe que reorganiza toda esta comparação está na segunda linha do cartão do modelo: AesCode 32B parte do Qwen3-VL-32B-Instruct. O modelo de código específico para design da Microsoft é um fine-tune do Qwen3-VL, Apache 2.0, em um repositório do Hugging Face criado em 29 de setembro de 2026, com o commit intitulado "Release AesCode-32B", datado de 7 de outubro de 2026, e sem nenhum anúncio da Microsoft em lugar algum. Qwen3.8 27B é a outra ponta dessa linhagem: o próprio modelo multimodal denso de 27B com pesos abertos do fornecedor, lançado em 14 de agosto de 2026 sob Apache 2.0, a arquitetura sucessora do checkpoint VL que a Microsoft ajustou. Então isto não é um confronto entre os esforços de ponta de dois fornecedores. É um confronto entre o modelo de pesos abertos de uso geral de um laboratório e o fine-tune de pesquisa de um concorrente dessa família, e a diferença prática entre eles acaba sendo quase inteiramente sobre o que você tem permissão para fazer com o arquivo depois de tê-lo.
Mesma licença, mesma família, quantidade diferente de modelo.
Ambos são Apache 2.0, ambos aceitam tanto imagens quanto texto, e ambos retornam texto. Tudo o que vem depois disso diverge, e a linha de implantação é a que mais diverge.
• Parâmetros — AesCode 32B: 33B denso em uma base Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B denso, 28B contando o codificador de visão, 64 camadas com um tamanho oculto de 5120.
• Memória para executá-lo — AesCode 32B: o card recomenda planejar cerca de 65 GB de memória de acelerador apenas para os parâmetros em bf16, e seu próprio exemplo de serving usa paralelismo de tensores em quatro vias. Qwen3.8 27B: cerca de 55,6 GB em bf16.
• Contexto — AesCode 32B: 24.576 tokens na configuração reportada, com prompts e respostas no momento do treinamento limitados a 8.192. Qwen3.8 27B: 262.144 tokens nativos, expansíveis para 1.000.000 com escalonamento YaRN.
• Atenção — AesCode 32B: herdado do backbone Qwen3-VL. Qwen3.8 27B: híbrido, 48 camadas de atenção linear Gated DeltaNet para 16 camadas de atenção plena numa proporção de 3:1, o que torna uma janela de 262K viável de servir.
• Para que serve — AesCode 32B: gerar artefatos visuais ricos em informações como HTML e CSS editáveis, além de pesquisa sobre geração de código multimodal. Qwen3.8 27B: trabalho agêntico e multimodal geral — programação, uso de computador, compreensão de documentos e vídeos, chamada de ferramentas.
• Onde você o obtém — AesCode 32B: um download do Hugging Face; nenhum provedor de inferência o implanta. Qwen3.8 27B: pesos, ou um endpoint hospedado.
O dobro do contexto, pegada ligeiramente menor, backbone uma geração mais recente e uma licença idêntica. A única linha em que o AesCode 32B vence de forma absoluta é a primeira, e consegue isso com um fine-tune específico para a tarefa.
Com base em que cada um foi realmente medido
Os dois regimes de avaliação não se tocam, e fingir o contrário é o erro padrão em páginas como esta.
O cartão do Qwen3.8 27B é amplo e específico ao mesmo tempo. Programação: Terminal-Bench 2.1 com 73.0, SWE-bench Pro com 61.7, QwenSWEBench com 79.0, LiveCodeBench v6 com 90.3. Raciocínio: GPQA Diamond 89.2, Humanity's Last Exam 30.8. Uso de computador: OSWorld-Verified 84.3, WebArena-Verified 64.8, AndroidWorld 81.9. Visão: MathVision 94.6 com o aprimoramento em tempo de inferência do fornecedor e 90.0 sem ele, OmniDocBench 1.5 com 91.1. Tudo isso são números do próprio fornecedor em seu próprio harness — com uma nota de rodapé que vale a pena ler, de que as execuções do SWE-bench Pro e do QwenSWEBench usaram o harness do Claude Code, portanto não são diretamente comparáveis com modelos avaliados em um diferente.
AesCode 32B tem um único benchmark, e ele é de propósito único: 300 amostras de infográfico, três gerações por prompt sem seleção, renderizadas e pontuadas em sete canais. O destaque é um Overall de 85,89 com a imagem de referência fornecida, contra 81,28 para o GPT-5.5 e 80,39 para o Claude Opus 4.8 sob o mesmo harness — além da alegação de que o AesCode 32B supera seu próprio backbone Qwen3-VL-32B em 22,4 pontos na dimensão Visual e 24,8 em Overall.
Coloque esses lado a lado e nada se alinha. O Terminal-Bench mede se uma tarefa de shell é concluída; a avaliação do AesCode mede se o texto de um infográfico é legível, se o layout não ultrapassa a tela e se a sua tabela é uma tabela HTML de verdade. Não há métrica compartilhada, nem estrutura de teste compartilhada, nem tarefa compartilhada. A única afirmação honesta é que o AesCode 32B é muito melhor em artefatos de design do que o seu próprio backbone, e que o Qwen3.8 27B é um modelo geral forte — e nenhuma das duas afirmações diz nada sobre a outra.

A lacuna de evidências é real desta vez, em uma direção.
Os benchmarks de fornecedores são a norma neste setor, por isso é relevante que estes dois difiram quanto à proporção das suas alegações de fornecedor que foi verificada por terceiros.
O Qwen3.8 27B foi lançado com a tabela do próprio fornecedor e, em poucas semanas, acumulou resultados externos. O histórico independente do modelo inclui um estudo de agente jurídico conduzido pela empresa de IA jurídica Harvey com a startup de memória Engram, no qual um Qwen3.8 27B adaptado superou todos os modelos testados no estudo, incluindo o Claude Opus 4.8, em 250 tarefas jurídicas — com a ressalva importante de que o modelo adaptado havia estudado primeiro o corpus de 100 milhões de tokens do escritório testado, de modo que é um resultado tanto sobre a adaptação quanto sobre o modelo. Inclui uma colocação no leaderboard WebDev do Code Arena e a melhor posição entre pesos abertos no leaderboard Image-to-WebDev do Arena.ai, ambas alegações de ranking repassadas pelo fornecedor, e não uma metodologia publicada. E inclui um painel de terceiros com uma pontuação publicada: o Artificial Analysis registra o Qwen3.8 27B em 33,70 em seu Intelligence Index, com um custo por tarefa concluída em torno de US$ 1,01, e publica a discriminação de tokens por trás disso.
AesCode 32B não tem nada disso. Sem posicionamento em arena, sem listagem em ranking, sem reprodução por terceiros, sem teste independente de throughput — e não porque alguém tenha olhado e o considerado deficiente, mas porque um checkpoint que nenhum provedor disponibiliza não pode, em primeiro lugar, ser avaliado por um harness externo. Seus números são do fornecedor, computados pela mesma pilha de verificação que treinou o modelo, em amostras que o fornecedor executou, com baselines que o fornecedor executou. O lançamento é excepcionalmente transparente quanto ao método — os nomes dos kernels de recompensa, o rollout, os parâmetros de decodificação e os modos de falha estão todos publicados —, mas transparência sobre como um número foi produzido não é o mesmo que outra pessoa o produzir.
Aquele que cobra um cartão salvo
É aqui que a linhagem deixa de ser curiosidade e passa a ser a decisão.
O AesCode 32B exige de você 65 GB de memória de acelerador, um caminho de serviço multimodal e disposição para executar um modelo não anunciado como adotante inicial. Seu próprio exemplo de serviço recorre a paralelismo de tensores em quatro vias, e o modelo está documentado para um contexto de 24.576 tokens, sem opção hospedada para a qual recorrer. Se você já tem o hardware e seu pipeline realmente precisa de ajuste fino específico do design, essa é uma troca razoável. Para a maioria das equipes, é um projeto de duas semanas antes do primeiro resultado útil.
O Qwen3.8 27B está auto-hospedado na infraestrutura própria da OrcaRouter e pode ser chamado hoje mesmo a $0,33 por milhão de tokens de entrada e $2,40 por milhão de saída, com uma janela de contexto de 262.144 tokens e entrada de texto, imagem e vídeo. Essas são as tarifas de tabela repassadas sem qualquer margem acrescentada do nosso lado, e ele fica na mesma chave que mais de 200 outros modelos, de modo que a comparação com qualquer alternativa do catálogo é um parâmetro de requisição, e não um segundo contrato. É esse todo o argumento prático, e é um argumento forte: o modelo que, em termos de família, está uma geração atrás da espinha dorsal do AesCode 32B é justamente aquele que você pode avaliar esta tarde, com os seus próprios prompts, pelo preço de alguns cêntimos.
Há aqui um ponto de segunda ordem que o ângulo de roteamento torna concreto. Como o AesCode 32B é um fine-tune de um checkpoint Qwen3-VL, a família oferece uma maneira barata de testar se o lado hospedado da arquitetura funciona de fato antes de você se comprometer a hospedar qualquer coisa por conta própria. O Qwen3-VL 235B A22B Instruct está disponível a US$ 0,40 por milhão de tokens de entrada e US$ 1,60 de saída, e o Qwen3-VL 8B Instruct a US$ 0,18 e US$ 0,70. Nenhum deles é o AesCode 32B, e nenhum foi treinado para qualidade de design — mas "um modelo de linguagem visual consegue ler nossas capturas de tela e escrever a marcação de que precisamos" pode ser respondida com eles por centavos, e o failover automático sob o mesmo endpoint significa que um dia ruim de um provedor não derruba o pipeline.

Quem deve escolher qual?
Escolha o AesCode 32B se o artefato for o entregável. Você produz slides, dashboards, pôsteres ou relatórios em volume, precisa de saída estruturada que permaneça editável e passível de diff — o modelo emite um documento HTML completo, usa estruturas de tabela HTML reais e especificações ECharts para que ambos permaneçam inspecionáveis — e você tem o hardware ou o orçamento para alugá-lo. Entre nessa aceitando três coisas: nenhuma verificação independente de qualquer número, cerca de 65 GB para os pesos, e um contexto de 24K que vai restringir documentos longos. A taxa de 4,3% de falhas graves na fronteira do canvas que o cartão reporta, contra 34,7% do GPT-5.5, é o número isolado mais encorajador do lançamento, e também é da Microsoft.
Escolha o Qwen3.8 27B se precisar de um modelo multimodal geral de pesos abertos que consegue realmente executar e realmente servir. Contexto de 262K, extensível a um milhão; uma pegada de implantação que cabe onde o AesCode 32B não cabe; uma posição de licenciamento sem diferença; alguma medição independente tanto da sua qualidade quanto do seu custo por tarefa concluída; e uma opção hospedada que significa que pode começar hoje e hospedar por conta própria mais tarde sem reescrever a integração. O seu design de atenção faseado e camada a camada é a razão pela qual o contexto longo é acessível, e o contexto longo é aquilo de que os pipelines de design e de documentos tendem a precisar mais.
E se você precisar dos dois — um gerador de artefatos de design e um faz-tudo de uso geral —, a divisão sensata não é executar dois modelos de visão-linguagem da classe 30B no seu próprio equipamento. Encaminhe o tráfego geral para o lado hospedado e mantenha o especialista auto-hospedado, atrás de uma única chave, onde uma indisponibilidade do provedor em qualquer um dos caminhos é um evento de failover, e não um incidente.

A coisa a observar
A posição do AesCode 32B muda completamente se ele se tornar chamável. No momento, a única fraqueza real do modelo é o acesso, e isso é uma condição temporária — um provedor de inferência adotar o checkpoint, ou a Microsoft publicar um endpoint, transforma uma aquisição de 65 GB em uma seleção de modelo. Até então, o resumo honesto desta comparação é que o fine-tune é melhor em uma tarefa, o modelo generalista é melhor em ser utilizável, e o modelo generalista por acaso é o ancestral: a Microsoft escolheu um checkpoint do Qwen3-VL como base para desenvolver porque era a base multimodal aberta mais forte disponível, o que é, por si só, a coisa mais útil que esta comparação tem a dizer sobre o Qwen3.8 27B.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
