Um cartão de título gerado com o cabeçalho "AesCode-8B vs Gemma 4 12B", com dois cartões arredondados lado a lado. O cartão esquerdo AesCode-8B traz um ícone de janela de navegador e as linhas "checkpoint de pesquisa da Microsoft" e "Emite uma página HTML renderizada"; o cartão direito Gemma 4 12B traz um ícone de lupa sobre documento e as linhas "Google DeepMind, lançado em 2026-06-03" e "Responde a perguntas sobre imagens". Um divisor entre eles diz "um renderiza, outro responde" e uma faixa de legenda no topo diz "lançamento não anunciado - apenas pesos, sem endpoint hospedado". O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

AesCode-8B vs Gemma 4 12B: dois pequenos modelos de visão, duas saídas completamente diferentes

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

AesCode-8B e Gemma 4 12B recebem ambos uma imagem e uma frase, e ambos são checkpoints Apache-2.0 que você baixa em vez de alugar, e é por isso que os motores de busca vão colocá-los lado a lado sem hesitar. A semelhança é real e também é superficial. O Gemma 4 12B devolve uma resposta — uma descrição, uma transcrição, um trecho de código, um traço de raciocínio. O AesCode-8B devolve uma página renderizada: um slide, um cartaz ou um dashboard como um documento HTML e CSS completo que você pode abrir no navegador e editar à mão. Mesma forma de entrada, mesma faixa de peso aproximada, e uma saída que quase nada tem em comum com a outra. Essa única diferença decide praticamente todas as questões práticas abaixo, incluindo qual dos dois você pode colocar diante de um usuário amanhã.

Vale a pena dizer desde o início, porque isso determina o peso que os números podem ter: o Gemma 4 12B foi lançado pelo DeepMind em 2026-06-03 com um cartão de modelo, documentação e um ecossistema, e vem sendo testado desde então. O AesCode-8B não foi lançado de forma alguma. O repositório da Microsoft para ele foi criado em 2026-09-29, e os pesos chegaram em um commit intitulado "Release AesCode-8B" às 03:35 UTC de 2026-10-07, com o código de treinamento e avaliação aparecendo no GitHub. Não há publicação do Microsoft Research, nem página de produto, nem nota de lançamento e nem preprint — a citação do model card "Under review" com o ano provisório 2027. No momento em que escrevo, o repositório do 8B mostra dois downloads e um like. Tudo o que é quantitativo sobre o AesCode-8B é da própria Microsoft, e nada foi verificado por mais ninguém.

Os dois modelos, em seus próprios termos

Gemma 4 12B é um modelo aberto de porte médio, um checkpoint denso de 11,95 bilhões de parâmetros cuja escolha de design definidora é não ter um codificador separado de visão ou áudio: os patches de imagem e as formas de onda de áudio vão direto para o transformer. Ele carrega um contexto de 256 mil tokens e pede cerca de 16 GB de VRAM, com os pesos em BF16 em torno de 27 GB e versões quantizadas abaixo de 7 GB. A ficha do próprio fornecedor — relatada pelo fornecedor e rotulada como tal aqui — lista DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 e LiveCodeBench v6 72,0 no modo de pensamento. A avaliação independente é a parte que mais importa: a Artificial Analysis pontua a configuração de raciocínio com um Intelligence Index de 14, mede aproximadamente 114 tokens por segundo e precifica uma chamada típica servida perto de US$ 0,10 por milhão de tokens de entrada e US$ 0,30 por milhão de saída. Há três meses e meio de implantação por trás dele.

AesCode-8B é um fine-tune de Qwen3-VL-8B-Instruct, publicado com quatro shards safetensors que totalizam 17.543.339.408 bytes — cerca de 8,8 bilhões de parâmetros bf16, razão pela qual o campo de tamanho arredondado do Hugging Face indica 9B, enquanto o fornecedor diz 8B. A configuração publicada é uma receita direta do Qwen3-VL: 36 camadas ocultas, tamanho oculto 4.096, 32 cabeças de atenção com 8 cabeças de chave-valor, um vocabulário de 151.936 tokens e um requisito de transformers 4.57 ou mais recente. As execuções relatadas pela Microsoft usaram um contexto de 24.576 tokens com até 12.000 tokens de saída, temperatura 0,8, top-p 0,95 e três gerações por prompt sem seleção. A licença é Apache 2.0, sem restrições de acesso, sem adendo de uso aceitável. O que não vem incluído são os dados de treinamento e avaliação, nem qualquer endpoint hospedado — não conseguimos encontrar o AesCode-8B disponibilizado em lugar nenhum, e ele não está em nosso próprio catálogo.

O que os modelos foram realmente treinados para fazer

O briefing de design é citado no cartão do modelo e vale a pena lê-lo como a tese inteira: modelos de código “não conseguem ver como layout, hierarquia e cor se combinam na tela”, enquanto geradores de imagens “compõem páginas visualmente atraentes, mas muitas vezes renderizam incorretamente texto, números e relações lógicas”. AesCode é a tentativa de manter ao mesmo tempo o senso de composição e a verificabilidade.

O mecanismo é incomum de uma maneira específica. Cada prompt de treinamento é pareado com uma imagem de referência gerada a partir desse mesmo prompt, que fornece layout e estilo, enquanto o prompt de texto continua sendo a autoridade sobre o conteúdo. Então, na inferência, o modelo quase não precisa da imagem: retire a referência do AesCode-8B e sua pontuação Visual cai 1,00 ponto em uma escala de cem. Retire-a do Qwen3-VL-8B-Instruct e a queda é de 19,55. Retire-a do GPT-5.5, avaliado no mesmo ambiente de avaliação, e a queda é de 10,04. O prior visual acabou nos pesos, e não na entrada, e esse é o verdadeiro resultado de pesquisa por trás da manchete.

O alvo de treinamento do Gemma 4 12B é o multimodal comum, e não é uma crítica dizer isso: ler a imagem, responder à pergunta, seguir a instrução, chamar a ferramenta. Nada em seu card sugere que ele alguma vez tenha sido direcionado a produzir um artefato renderizado, e nenhuma avaliação publicada do Gemma 4 12B mede qualidade de layout de documento, transbordamento de canvas ou consistência de design, porque essas não são as métricas do modelo.

O placar, e de quem é a rubrica

A generated two-column scoreboard titled "AesCode-8B vs Gemma 4 12B - the scoreboard". Left column AesCode-8B reads Parameters 8.8B dense, Inputs text plus one image, Output a rendered HTML page, Context 24,576 tokens, Evidence Microsoft rubric with no outside test, Hosted nowhere we can find. Right column Gemma 4 12B reads Parameters 11.95B dense, Inputs text, image, audio, video, Output text and tool calls, Context 256K tokens, Evidence AA Intelligence Index 14, Hosted cheap served calls. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Gemma 4 12B figures per Artificial Analysis." The OrcaRouter logo is composited bottom-right.

• Parâmetros — AesCode-8B: 8,8B bf16, denso. Gemma 4 12B: 11,95B denso.

• Entradas — AesCode-8B: texto mais uma imagem de referência opcional. Gemma 4 12B: texto, imagem, áudio e vídeo.

• Saída — AesCode-8B: um documento HTML e CSS completo. Gemma 4 12B: texto, incluindo chamadas de ferramentas.

• Contexto — AesCode-8B: 24.576 tokens na configuração reportada. Gemma 4 12B: 256K tokens.

• Licença — ambas Apache 2.0, sem restrições, pesos incluídos.

• Evidência — AesCode-8B: a própria rubrica de infográfico de 300 amostras da Microsoft, três gerações por prompt, sem reprodução independente. Gemma 4 12B: uma ficha do fornecedor mais um Intelligence Index independente de 14 e throughput medido na Artificial Analysis.

Agora, a parte que o placar não consegue carregar. A Microsoft relata AesCode-8B com 82,94 Overall naquele conjunto de 300 amostras, à frente do GPT-5.5 condicionado por referência, com 81,28, e do Claude Opus 4.8, com 80,39, e 31,1 pontos em Visual à frente de seu próprio backbone Qwen3-VL-8B. Leia tudo isso como relatado pelo fornecedor e não reproduzido, em uma rubrica criada pelo fornecedor, sobre amostras escolhidas pelo fornecedor, pontuadas por um harness contra o qual o fornecedor treinou o modelo. O card é honesto o suficiente para publicar uma dimensão na qual nenhum modelo da comparação passa de 60 — Style, em que AesCode-8B está em 53,21 e GPT-5.5 lidera com 57,91 — e a própria definição da Microsoft para essa dimensão é design que não precisa de mais nenhuma revisão visual antes da entrega. No único eixo que pergunta se uma pessoa publicaria a página sem edição, o modelo 8B não é o líder. Esse é o número a guardar quando alguém citar o 82,94.

Onde eles genuinamente se sobrepõem

Há exatamente uma prateleira compartilhada, e ela é mais estreita do que parece. Se você está avaliando modelos de visão abertos de pequeno porte para um pipeline com muitos documentos, ambos são candidatos — um para ler um documento, o outro para produzir um. Uma equipe que gera dashboards internos em HTML e também precisa extrair figuras de PDFs enviados acaba usando os dois produtos na mesma semana.

A divisão dentro dessa sobreposição é clara. O Gemma 4 12B é o modelo para o qual você aponta um documento que chega. O AesCode-8B é o modelo para o qual você aponta um briefing quando o entregável é uma página. Nenhum dos dois substitui o outro, e um pipeline que quer os dois é um pipeline de dois modelos, em vez de uma escolha.

A Hugging Face screenshot of the microsoft/AesCode-32B model card showing tags for Image-Text-to-Text, Transformers, Safetensors, English and qwen3_vl, an Apache-2.0 licence badge, 1 like from the Microsoft organisation, and the card opening text that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS with output that stays structured, editable and verifiable.

A implantação, que é onde a assimetria realmente dói

A história de serving do Gemma 4 12B está concluída. Você o baixa, quantiza-o se quiser, executa-o em 16 GB de VRAM, e há uma grande base de ferramentas que já faz isso. Se você preferir não executá-lo de forma alguma, uma chamada servida é barata e precificada de forma independente.

A história de serving do AesCode-8B é uma linha de comando e um pouco de aritmética. O model card dá a rota diretamente — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, com transformers 4.57 ou mais recente para o caminho sem vLLM. 17,5 GB de pesos bf16 têm de ficar ao lado de um KV cache para 24.576 tokens e até duas imagens, então uma única placa de 24 GB é tecnicamente suficiente e desconfortavelmente apertado; 40-48 GB, ou duas placas de 24 GB, é o mínimo realista. Inclua também um renderizador no orçamento, porque toda alegação de qualidade sobre este modelo é feita renderizando a sua saída HTML num navegador em sandbox, então avaliar os seus próprios resultados significa montar algo nos moldes do Playwright com solicitações externas bloqueadas.

Depois, há o estado honesto da disponibilidade. Não roteamos o AesCode-8B e, pelo que conseguimos apurar, ninguém mais o faz; uma avaliação hoje significa pesos no seu próprio hardware. A coisa mais próxima que é chamável é a arquitetura a partir da qual o modelo foi ajustado. Qwen3-VL-8B-Instruct é roteável através do OrcaRouter agora a US$ 0,18 por milhão de tokens de entrada e US$ 0,70 por milhão de saída em um contexto de 131.072 tokens, e os dois checkpoints que de fato oferecemos têm o mesmo tipo de preço — Gemma 4 26B-A4B a US$ 0,06 e US$ 0,33, Gemma 4 31B a US$ 0,13 e US$ 0,38. O preço de tabela do provedor é repassado sem acréscimo de margem, e o failover entre provedores acontece automaticamente, então a forma barata de descobrir se seus prompts funcionam bem é testar primeiro o backbone não ajustado e gastar a semana de GPU apenas nos prompts que sobreviverem.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Featured badge, the byline "by Google - 2026-04-02", a description of Gemma 4 31B Instruct as a 30.7B dense multimodal model with text and image input and a 256K-token context window, and the pricing row reading $0.13 input and $0.38 output per million tokens with measured latency figures.

Qual deles você realmente quer

Escolha o AesCode-8B se o entregável for uma página. O modelo emite HTML estruturado e editável — tabelas como tabelas HTML, gráficos como especificações ECharts — o que significa que a saída gera diffs no Git e pode ser reestilizada por um designer sem regenerá-la. Aceite a troca: um checkpoint de pesquisa não anunciado com contagem de downloads de dois dígitos, nenhuma avaliação independente, nenhum endpoint hospedado, um contexto de 24K que só foi validado em páginas únicas de infográfico, e uma tag de idioma apenas em inglês no card.

Escolha o Gemma 4 12B para todo o resto. Ele lê documentos melhor do que a maioria dos modelos com o dobro do seu tamanho, lida com áudio, segue instruções de ferramentas, tem um quarto de milhão de tokens de contexto e conta com três meses e meio de experiência de outras pessoas por trás dele. Se você está escolhendo um desses dois para ser seu pequeno modelo de visão, e não foi especificamente solicitado a produzir apresentações de slides como código, esta é a resposta.

E, se o requisito honesto for ambos, não o trate como desempate. Encaminhe o trabalho de leitura para um modelo hospedado e mantenha o trabalho de renderização em qualquer máquina que consiga suportar os pesos.

O que mudaria esta página

Três sinais. Uma reprodução independente dos 82,94 e da queda de referência de 1,00 ponto moveria o AesCode-8B de uma alegação de fornecedor para um resultado, e tornaria a questão de tamanho 8B versus 12B genuinamente interessante em vez de apenas nominalmente. Um provedor de inferência que adote o checkpoint derrubaria a coluna de implantação, que atualmente é toda a diferença prática. E o artigo que a Microsoft cita como em revisão — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — responderia às perguntas que o model card não consegue, começando por como a rubrica visual se comporta quando o próprio grafo de design está errado. Até que um desses pontos se concretize, a leitura defensável é estreita e real: o AesCode-8B é muito bom nas partes do design visual que uma máquina consegue verificar, mediano na parte que não consegue, e o Gemma 4 12B é um produto acabado fazendo um trabalho diferente.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente