Una card di titolo generata con intestazione "AesCode-8B vs Gemma 4 12B" con due card arrotondate affiancate. La card sinistra AesCode-8B porta un'icona di una finestra del browser e le righe "checkpoint di ricerca Microsoft" e "Genera una pagina HTML renderizzata"; la card destra Gemma 4 12B porta un'icona di una lente d'ingrandimento su un documento e le righe "Google DeepMind, lanciato il 2026-06-03" e "Risponde a domande sulle immagini". Un separatore tra loro recita "uno renderizza, uno risponde" e una striscia di didascalia in alto recita "rilascio non annunciato - solo pesi, nessun endpoint ospitato". Il logo OrcaRouter è composto in basso a destra.
Guides & Insights

AesCode-8B vs Gemma 4 12B: due piccoli modelli visivi, due output completamente diversi

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

AesCode-8B e Gemma 4 12B entrambi prendono un'immagine e una frase ed entrambi sono checkpoint Apache-2.0 che scarichi anziché noleggiare, motivo per cui i motori di ricerca li metteranno volentieri fianco a fianco. La somiglianza è reale ed è anche superficiale. Gemma 4 12B restituisce una risposta — una descrizione, una trascrizione, un frammento di codice, una traccia di ragionamento. AesCode-8B restituisce una pagina renderizzata: una slide, un poster o una dashboard come documento HTML e CSS completo che puoi aprire in un browser e modificare manualmente. Stessa forma di input, stessa classe di peso approssimativa, e un output che non condivide quasi nulla con l'altro. Quella singola differenza decide quasi ogni domanda pratica di seguito, inclusa quale dei due puoi mettere davanti a un utente domani.

Vale la pena dichiararlo subito, perché determina quanto peso possono avere i numeri: Gemma 4 12B è stato lanciato da DeepMind il 2026-06-03 con una model card, documentazione e un ecosistema, ed è stato testato in modo indipendente da allora. AesCode-8B non è stato lanciato affatto. Il repository di Microsoft che lo riguarda è stato creato il 2026-09-29 e i pesi sono arrivati in un commit intitolato "Release AesCode-8B" alle 03:35 UTC del 2026-10-07, con il codice di addestramento e di valutazione comparso su GitHub il giorno successivo. Non esiste alcun post di Microsoft Research, nessuna pagina prodotto, nessuna nota di rilascio e nessun preprint — la citazione della model card riporta "Under review" con l'anno segnaposto 2027. Al momento in cui scriviamo il repository 8B mostra due download e un like. Tutto ciò che è quantitativo su AesCode-8B è quindi di Microsoft, e nulla è stato riprodotto da nessun altro.

I due modelli, alle loro condizioni

Gemma 4 12B è un modello aperto di medie dimensioni, un checkpoint denso da 11,95 miliardi di parametri la cui scelta progettuale distintiva è l'assenza di un encoder visivo o audio separato: le patch delle immagini e le forme d'onda audio entrano direttamente nel transformer. Ha una finestra di contesto di 256K token e richiede circa 16 GB di VRAM, con i pesi BF16 intorno ai 27 GB e build quantizzate sotto i 7 GB. La scheda del fornitore — riportata dal fornitore e qui etichettata come tale — elenca DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 e LiveCodeBench v6 72,0 in modalità thinking. La valutazione indipendente è la parte che conta di più: Artificial Analysis assegna alla configurazione di ragionamento un Intelligence Index di 14, misura circa 114 token al secondo e stima il prezzo di una tipica chiamata servita a circa 0,10 $ per milione di token in input e 0,30 $ per milione in output. Alle spalle ha tre mesi e mezzo di deployment.

AesCode-8B è un fine-tuning di Qwen3-VL-8B-Instruct, pubblicato con quattro shard safetensors per un totale di 17.543.339.408 byte — circa 8,8 miliardi di parametri bf16, motivo per cui il campo dimensione arrotondata di Hugging Face indica 9B mentre il fornitore dichiara 8B. La configurazione pubblicata è una ricetta Qwen3-VL pura: 36 layer nascosti, dimensione nascosta 4.096, 32 teste di attenzione con 8 teste chiave-valore, un vocabolario di 151.936 token e il requisito di transformers 4.57 o successivo. Le esecuzioni riportate da Microsoft usavano un contesto di 24.576 token con fino a 12.000 token di output, temperatura 0,8, top-p 0,95 e tre generazioni per prompt senza selezione. La licenza è Apache 2.0, senza restrizioni di accesso, senza addendum sull'uso accettabile. Ciò che non è incluso sono i dati di addestramento e valutazione, e qualsiasi endpoint ospitato — non siamo riusciti a trovare AesCode-8B servito da nessuna parte, e non è nel nostro catalogo.

Ciò che i modelli sono stati effettivamente addestrati a fare

Il brief di progettazione è citato nella scheda del modello e vale la pena leggerlo come tesi complessiva: i modelli di codice «non riescono a vedere come layout, gerarchia e colore si combinano sulla tela», mentre i generatori di immagini «compongono pagine visivamente accattivanti ma spesso rendono male testo, numeri e relazioni logiche». AesCode è il tentativo di mantenere allo stesso tempo il senso della composizione e la verificabilità.

Il meccanismo è insolito sotto un aspetto specifico. Ogni prompt di addestramento è abbinato a un'immagine di riferimento generata da quello stesso prompt, che fornisce layout e stile mentre il prompt testuale resta l'autorità sul contenuto. Poi, in fase di inferenza, il modello necessita a malapena dell'immagine: se si omette il riferimento ad AesCode-8B, il suo punteggio Visual cala di 1,00 punto su cento. Se lo si omette a Qwen3-VL-8B-Instruct, il calo è di 19,55. Se lo si omette a GPT-5.5, valutato con lo stesso harness, è di 10,04. Il prior visivo è finito nei pesi anziché nell'input, e questo è il vero risultato di ricerca sotto il titolo.

L'obiettivo di addestramento di Gemma 4 12B è quello multimodale ordinario, e non è una critica dirlo: leggere l'immagine, rispondere alla domanda, seguire l'istruzione, chiamare lo strumento. Nulla nella sua scheda suggerisce che sia mai stato indirizzato a produrre un artefatto renderizzato, e nessuna valutazione pubblicata di Gemma 4 12B misura la qualità del layout dei documenti, l'overflow della tela o la coerenza del design, perché non sono le metriche del modello.

Il tabellone, e di chi è la griglia di valutazione

A generated two-column scoreboard titled "AesCode-8B vs Gemma 4 12B - the scoreboard". Left column AesCode-8B reads Parameters 8.8B dense, Inputs text plus one image, Output a rendered HTML page, Context 24,576 tokens, Evidence Microsoft rubric with no outside test, Hosted nowhere we can find. Right column Gemma 4 12B reads Parameters 11.95B dense, Inputs text, image, audio, video, Output text and tool calls, Context 256K tokens, Evidence AA Intelligence Index 14, Hosted cheap served calls. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Gemma 4 12B figures per Artificial Analysis." The OrcaRouter logo is composited bottom-right.

• Parametri — AesCode-8B: 8,8B bf16, denso. Gemma 4 12B: 11,95B denso.

• Input — AesCode-8B: testo più un'immagine di riferimento opzionale. Gemma 4 12B: testo, immagine, audio e video.

• Output — AesCode-8B: un documento HTML e CSS completo. Gemma 4 12B: testo, incluse le chiamate agli strumenti.

• Contesto — AesCode-8B: 24,576 token nella configurazione riportata. Gemma 4 12B: 256K token.

• Licenza — entrambe Apache 2.0, senza restrizioni, pesi inclusi.

• Prove — AesCode-8B: la rubrica infografica da 300 campioni di Microsoft stessa, tre generazioni per prompt, nessuna riproduzione indipendente. Gemma 4 12B: una scheda del fornitore più un Intelligence Index indipendente di 14 e un throughput misurato su Artificial Analysis.

Ora, la parte che il tabellone non può portare. Microsoft riporta AesCode-8B a 82,94 Overall su quel set di 300 campioni, davanti a GPT-5.5 condizionato al riferimento a 81,28 e a Claude Opus 4.8 a 80,39, e con 31,1 punti Visual di vantaggio rispetto al suo stesso backbone Qwen3-VL-8B. Leggi tutto quanto come riportato dal fornitore e non riprodotto, su una rubrica costruita dal fornitore, su campioni scelti dal fornitore, valutati da un harness su cui il fornitore ha addestrato il modello. La scheda è abbastanza onesta da pubblicare una dimensione su cui nessun modello del confronto supera il 60 — Style, dove AesCode-8B si attesta a 53,21 e GPT-5.5 è in testa a 57,91 — e la definizione stessa di Microsoft di quella dimensione è design che non necessita di ulteriori revisioni visive prima della consegna. Sull'unico asse che chiede se un essere umano pubblicherebbe la pagina senza modifiche, il modello 8B non è il leader. Questo è il numero a cui tenersi quando qualcuno cita l'82,94.

Dove si sovrappongono davvero

C'è esattamente un ripiano condiviso, ed è più stretto di quanto sembri. Se stai valutando piccoli modelli di visione open per una pipeline ad alto contenuto documentale, entrambi sono candidati: uno per leggere un documento, l'altro per produrne uno. Un team che genera dashboard interne in HTML e ha anche bisogno di estrarre dati numerici dai PDF caricati entra in contatto con entrambi i prodotti nella stessa settimana.

La separazione all'interno di quella sovrapposizione è netta. Gemma 4 12B è il modello a cui indirizzi un documento in arrivo. AesCode-8B è il modello a cui indirizzi un brief quando il risultato da consegnare è una pagina. Nessuno dei due sostituisce l'altro, e una pipeline che li vuole entrambi è una pipeline a due modelli anziché una scelta.

A Hugging Face screenshot of the microsoft/AesCode-32B model card showing tags for Image-Text-to-Text, Transformers, Safetensors, English and qwen3_vl, an Apache-2.0 licence badge, 1 like from the Microsoft organisation, and the card opening text that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS with output that stays structured, editable and verifiable.

Il deployment, che è il punto in cui l'asimmetria si fa davvero sentire

La storia del serving di Gemma 4 12B è conclusa. Lo scarichi, lo quantizzi se vuoi, lo esegui su 16 GB di VRAM, e c'è un'ampia base di strumenti che lo fa già. Se preferisci non eseguirlo affatto, una chiamata a un servizio è economica e ha un prezzo indipendente.

La storia di serving di AesCode-8B è una riga di comando e un po' di aritmetica. La model card fornisce direttamente la rotta — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, con transformers 4.57 o successivo per il percorso non-vLLM. I pesi bf16 da 17,5 GB devono stare accanto a una KV cache per 24.576 token e fino a due immagini, quindi una singola scheda da 24 GB è tecnicamente sufficiente e scomodamente al limite; 40-48 GB, o due schede da 24 GB, sono il minimo realistico. Metti in budget anche un renderer, perché ogni affermazione sulla qualità di questo modello viene fatta renderizzando il suo output HTML in un browser sandbox, quindi valutare i tuoi stessi risultati significa allestire qualcosa simile a Playwright con le richieste esterne bloccate.

Poi c'è l'onesta realtà della disponibilità. Non instradiamo AesCode-8B, e nemmeno, per quanto ci risulta, lo fa qualcun altro; una valutazione oggi significa pesi sul proprio hardware. La cosa più vicina che sia richiamabile è l'architettura da cui il modello è stato messo a punto. Qwen3-VL-8B-Instruct è instradabile tramite OrcaRouter ora a $0.18 per milione di token in input e $0.70 per milione in output su un contesto di 131.072 token, e i due checkpoint che offriamo hanno lo stesso tipo di prezzo — Gemma 4 26B-A4B a $0.06 e $0.33, Gemma 4 31B a $0.13 e $0.38. Il prezzo di listino del provider viene trasferito senza alcun ricarico, e il failover tra provider avviene automaticamente, quindi il modo economico per scoprire se i tuoi prompt rendono bene è testare prima il backbone non messo a punto e spendere la settimana di GPU solo sui prompt che sopravvivono.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Featured badge, the byline "by Google - 2026-04-02", a description of Gemma 4 31B Instruct as a 30.7B dense multimodal model with text and image input and a 256K-token context window, and the pricing row reading $0.13 input and $0.38 output per million tokens with measured latency figures.

Quale vuoi davvero

Scegli AesCode-8B se il risultato è una pagina. Il modello emette HTML strutturato e modificabile — tabelle come tabelle HTML, grafici come specifiche ECharts — il che significa che l'output genera diff in Git e può essere ristilizzato da un designer senza rigenerarlo. Accetta il compromesso: un checkpoint di ricerca non annunciato con un numero di download a due cifre, nessuna valutazione indipendente, nessun endpoint ospitato, un contesto di 24K che è stato validato solo su singole pagine infografiche, e un tag di lingua solo inglese sulla scheda.

Scegli {{1}}Gemma 4 12B{{/1}} per tutto il resto. Legge i documenti meglio della maggior parte dei modelli due volte più grandi di lui, gestisce l'audio, segue le istruzioni degli strumenti, ha un quarto di milione di token di contesto e ha tre mesi e mezzo di esperienza di altre persone alle spalle. Se stai scegliendo uno di questi due come tuo piccolo modello di visione e non ti è stato specificamente chiesto di produrre presentazioni come codice, questa è la risposta.

E se il requisito autentico è entrambi, non trattarlo come uno spareggio. Instrada il lavoro di lettura verso un modello ospitato e mantieni il lavoro di rendering sulla macchina in grado di contenere i pesi.

Cosa cambierebbe questa pagina

Tre segnali. Una riproduzione indipendente del calo di riferimento di 82,94 e di quello di 1,00 punti sposterebbe AesCode-8B da una dichiarazione del fornitore a un risultato, e renderebbe la questione delle dimensioni 8B contro 12B genuinamente interessante anziché solo nominalmente. Un fornitore di inferenza che adottasse il checkpoint farebbe crollare la colonna del deployment, che attualmente costituisce l'intera differenza pratica. E il paper che Microsoft cita come in fase di revisione — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — risponderebbe alle domande a cui la scheda del modello non può rispondere, a cominciare da come si comporta la rubrica visiva quando il grafo di progettazione stesso è errato. Finché uno di questi non si concretizza, la lettura difendibile è ristretta e reale: AesCode-8B è molto bravo nelle parti del design visivo che una macchina può verificare, mediocre nella parte che non può, e Gemma 4 12B è un prodotto finito che svolge un lavoro diverso.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno