
AesCode-8B vs Qwen3-8B: sembrano padre e figlio, ma non lo sono
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token · 85 tok/s
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
I nomi invitano a un errore. AesCode-8B è un modello 8B con un backbone Qwen3-VL-8B-Instruct, Qwen3-8B è il modello 8B dello stesso fornitore, e la lettura ovvia è che il primo sia un fine-tune del secondo. Non lo è. La configurazione pubblicata di AesCode-8B dichiara Qwen3-VL-8B-Instruct come base — il fratello vision-language, un checkpoint diverso con un compito diverso — e i metadati di Hugging Face lo elencano come finetune di quel modello, non del Qwen3-8B puramente testuale. I due modelli AesCode di questa classe di peso sono cugini più che genitore e figlio, e questa distinzione è l'intera ragione per cui questa pagina è utile: ti dice che cosa ha acquistato Microsoft quando è partita da un checkpoint vision-language, quanto è costato sul fronte testuale, e perché un confronto con il semplice generalista 8B della famiglia finisce per misurare un fork anziché un upgrade.
Entrambi sono Apache 2.0 ed entrambi sono scaricabili, ma i loro percorsi di pubblicazione non potrebbero essere più diversi. Qwen3-8B è stato rilasciato nell'aprile 2025 come parte della linea Qwen3 del fornitore, con documentazione, integrazione nell'ecosistema e diciotto mesi di deployment altrui alle spalle. AesCode-8B non riporta alcuna data di rilascio in nessuno dei suoi file. Microsoft ha creato il repository Hugging Face il 2026-09-29, ha committato i pesi con il messaggio "Release AesCode-8B" alle 03:35 UTC del 2026-10-07 e ha pubblicato il codice di addestramento su GitHub il giorno successivo. Non esiste alcun post di Microsoft Research, nessuna nota di rilascio, nessuna pagina di prodotto e nessun paper — la citazione nella model card recita "Under review" con l'anno segnaposto 2027, e il repository mostrava due download al momento in cui scriviamo. Tutto ciò che di quantitativo è detto su AesCode-8B qui sotto è di Microsoft stessa e non è stato riprodotto da nessuno.
L'albero genealogico che i nomi nascondono
La linea della generazione Qwen3 contiene diversi checkpoint di classe 8B che condividono una discendenza e non molto altro. Qwen3-8B è il generalista solo testo: circa 8,2 miliardi di parametri totali, di cui circa 7 miliardi non-embedding, attenzione grouped-query, un contesto nativo di 32K token estendibile a 131K tramite YaRN e addestramento su 119 lingue e dialetti. Ragiona, conversa, scrive codice e chiama strumenti, ed è proprio per questi motivi uno dei modelli 8B più ampiamente self-hosted nell'ecosistema aperto. Qwen3-VL-8B-Instruct è il membro multimodale: la stessa generazione della famiglia, una torre di visione dedicata aggiunta sopra, immagini e testo in ingresso, testo in uscita.
Microsoft è partita dal secondo. La configurazione di AesCode-8B riporta Qwen3VLForConditionalGeneration, con 36 strati nascosti, dimensione nascosta 4.096, 32 teste di attenzione e 8 teste chiave-valore, un vocabolario di 151.936 token e posizioni mrope interlacciate, e richiede transformers 4.57 o versione successiva. Gli shard totalizzano 17.543.339.408 byte, circa 8,8 miliardi di parametri bf16, motivo per cui il campo dimensione arrotondato di Hugging Face indica 9B mentre il fornitore indica 8B. Si tratta di arrotondamento, non di una discrepanza, e il conteggio dei parametri non è il fork che conta — la modalità di input e il contesto di servizio di 24.576 token lo sono.
Quindi la formulazione onesta non è "generalista contro il suo fine-tune". È: un generalista testuale con un contesto lungo e diciotto mesi di storia produttiva, contro un checkpoint di ricerca multimodale che produce un documento e non è mai stato valutato in modo indipendente.

In cosa Microsoft ha speso il budget per la formazione
Il brief di progettazione è citato sulla scheda del modello e spiega la biforcazione: i modelli di codice "non riescono a vedere come layout, gerarchia e colore si combinano sulla tela", mentre i generatori di immagini "compongono pagine visivamente accattivanti ma spesso rendono male testo, numeri e relazioni logiche". AesCode è il tentativo di prendere il senso della composizione da uno e la verificabilità dall'altro, e la ricetta è insolita in un modo specifico.
Ogni prompt di addestramento è abbinato a un'immagine di riferimento generata da quello stesso prompt — le esecuzioni di Microsoft stessa usavano GPT-Image-2 per l'immagine e GPT-5.5 per espandere un breve brief in un prompt di contenuto dettagliato. Il riferimento contiene solo layout e stile; il prompt testuale resta autorevole sul contenuto. Poi, in inferenza, il modello ne ha a malapena bisogno: se si omette il riferimento ad AesCode-8B, il suo punteggio Visual cala di 1,00 punto su cento, contro 19,55 per il backbone e 10,04 per GPT-5.5. Un risultato correlato è che le ricompense basate sul riferimento hanno portato il Visual basato solo sul prompt da 25,17 a 69,71, quindi il prior visivo si è spostato nei pesi invece di restare nell'input.
Il resto è una storia di progettazione della ricompensa. La supervisione è un "grafo di progettazione" di nodi e archi — testo, grafici, tabelle, schede, regioni, slot immagine, con contenimento, allineamento, ordine e connessione come archi — scelto in modo che ogni proprietà sul canvas appartenga a un elemento denominato e possa quindi essere valutata singolarmente. Sette canali valutano il risultato: sei verificatori deterministici per esecuzione, testo, confini, dati di tabelle e grafici, layout semantico e spazi bianchi, più un Visual Graph Rubric specifico per il campione giudicato da un modello visione-linguaggio. I candidati vengono renderizzati in un browser Playwright in sandbox con richieste esterne bloccate, e l'harness rilegge DOM, stili calcolati, bounding box e uno screenshot, motivo per cui le tabelle devono essere tabelle HTML e i grafici devono essere specifiche ECharts. L'addestramento è stato un fine-tuning supervisionato a freddo su 3.000 dimostrazioni, poi GDPO su 7.408 prompt per 400 passi su un singolo nodo di otto NVIDIA B200, con ciascun canale di ricompensa normalizzato all'interno del proprio gruppo di rollout così che un segnale denso basato su regole non possa soffocare quello visivo sparso. Microsoft misura quella normalizzazione a 5,12 punti Visual rispetto al semplice GRPO scalare.
Niente di quell'armamentario esiste per rendere AesCode-8B un assistente generale migliore. Esiste per rendere l'output verificabile, ed è il motivo per cui il contesto del modello è quello che è.
Affiancati, con i numeri etichettati
• Base — AesCode-8B: Qwen3-VL-8B-Instruct, un checkpoint visione-linguaggio. Qwen3-8B: il generalista solo testo della stessa generazione.
• Parametri — AesCode-8B: circa 8,8B bf16 distribuiti su quattro shard. Qwen3-8B: circa 8,2B in totale, all'incirca 7B non-embedding.
• Input — AesCode-8B: testo più un'immagine di riferimento opzionale. Qwen3-8B: testo.
• Output — AesCode-8B: un documento HTML e CSS completo. Qwen3-8B: testo, chiamate di strumenti, codice.
• Contesto — AesCode-8B: 24.576 token nella configurazione riportata. Qwen3-8B: 32K nativi, 131K estesi tramite YaRN.
• Lingue — AesCode-8B: il tag della card è solo "en". Qwen3-8B: 119 lingue e dialetti.
• Prove — AesCode-8B: la rubrica per infografiche da 300 campioni di Microsoft, tre generazioni per prompt, nessuna riproduzione esterna. Qwen3-8B: diciotto mesi di benchmark indipendenti, lavoro di quantizzazione e distribuzione in produzione.
• Licenza — Apache 2.0 in entrambi i casi, senza restrizioni. Un pareggio, e non il fattore distintivo che molti immaginano.
Il divario probatorio è il vero confronto
Microsoft riporta AesCode-8B a 82,94 Overall nella sua rubrica, davanti a GPT-5.5 condizionato dal riferimento a 81,28 e a Claude Opus 4.8 a 80,39, e con 31,1 punti Visual di vantaggio rispetto al proprio backbone condizionato dal riferimento. Tre numeri in quella tabella valgono più del titolo di testa. Il primo è Style, dove AesCode-8B si attesta a 53,21 e nessun modello del confronto supera 60 — e la definizione di Style di Microsoft è design che non necessita di ulteriori revisioni visive prima della consegna, quindi sull'unica dimensione che chiede se un essere umano pubblicherebbe la pagina senza modifiche, il modello non è il leader. Il secondo è il fallimento al confine: un grave overflow della canvas ricorre sul 4,3% dei 300 campioni, contro il 34,7% di GPT-5.5. Il terzo è che la metà visiva del punteggio proviene da un giudice vision-language senza nome, il che significa che la metà deterministica è riproducibile da un esterno e l'altra metà no.
I numeri di Qwen3-8B vengono da tutt'altro ambito, e questo conta più di quale insieme sia più alto. Diciotto mesi di valutazioni indipendenti, quantizzazioni della community, benchmark di serving e deployment in produzione rappresentano un tipo diverso di prova: non è un'affermazione, è uno storico di risultati. Puoi scoprire come si comporta Qwen3-8B con la quantizzazione a quattro bit su una scheda specifica perché qualcuno ha pubblicato i risultati. Non puoi farlo per AesCode-8B, perché, arrivati a questa settimana, nessuno al di fuori di Microsoft lo ha eseguito su nulla.
E non esiste alcuna metrica condivisa tra le due tabelle. Qwen3-8B non ha un punteggio per il layout infografico; AesCode-8B non ha affatto un benchmark pubblicato di ragionamento generale. Il confronto non è questione di essere vicino o no — è indisponibile.
Che cosa comporta davvero eseguire ciascuno

Qwen3-8B è quello facile. Un modello testuale da 8,2B si quantizza su una singola scheda consumer, ha diciotto mesi di tooling alle spalle in ogni framework di serving e runtime locale, e si comporta in modo prevedibile. L'estensione del contesto a 131K è documentata anziché lasciata al folklore, e la copertura di 119 lingue è il motivo per cui compare in così tante pipeline multilingue.
AesCode-8B è un progetto di serving. Il comando indicato nella scheda stessa è vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, con transformers 4.57 o versione successiva per il percorso non-vLLM. I 17,5 GB di pesi bf16 devono trovare posto accanto a una KV cache per 24.576 token e fino a due immagini, quindi una singola scheda da 24 GB è tecnicamente sufficiente e scomodamente al limite, e 40-48 GB o due schede da 24 GB sono il minimo realistico. Prevedi anche un renderer, perché ogni affermazione sulla qualità di questo modello è stata fatta renderizzando il suo output HTML in un browser in sandbox — se vuoi sapere se i tuoi output sono buoni, quello è l'harness che devi mettere in piedi. E nota che il contesto da 24.576 token è stato esercitato su singole pagine infografiche, non sulle presentazioni multi-slide per cui il modello è proposto, quindi la pressione sul contesto su una presentazione reale è territorio non testato.
La disponibilità è l'altra metà dello stesso punto. AesCode-8B non è qualcosa che OrcaRouter instrada, e non siamo riusciti a trovarlo servito da nessun'altra parte; una valutazione oggi significa pesi sul proprio hardware. Il suo antenato è tutta un'altra storia — Qwen3-VL-8B-Instruct è richiamabile tramite OrcaRouter già adesso a 0,18 $ per milione di token in input e 0,70 $ per milione in output su un contesto di 131.072 token, il che lo rende il modo più economico per vedere cosa fa la versione non messa a punto di questa esatta architettura sui tuoi prompt per infografiche. Più in alto nella stessa linea, Qwen3.8-27B è instradabile a 0,33 $ e 2,40 $. Il prezzo di listino del provider viene applicato senza alcun ricarico aggiunto e il failover tra provider è automatico, quindi prototipare il prompt sul backbone ospitato costa una chiave invece di una settimana di GPU, e solo i prompt che si renderizzano davvero bene meritano il lavoro di riproduzione.

Quale vuoi dipende dall'artefatto
Scegli AesCode-8B quando il deliverable è una pagina e deve essere modificabile. Un output HTML strutturato che produce diff in Git, tabelle come vere tabelle e grafici come specifiche ECharts è un artefatto genuinamente diverso da un paragrafo di testo, e nessuna quantità di capacità generale può sostituirlo. Accetta lo scambio consapevolmente: un checkpoint di ricerca non annunciato con un numero di download a doppia cifra, un contesto da 24K, solo in inglese, nessuna valutazione indipendente, un tetto di Style pubblicato dal suo stesso fornitore, e un conto del serving misurato in decine di gigabyte.
Scegli Qwen3-8B per tutto il resto — che, per la maggior parte dei team, è tutto. È il generalista collaudato a questo peso, ha un contesto più lungo, parla centodiciannove lingue, gira su hardware che già possiedi, e ha diciotto mesi di esperienza produttiva di altre persone alle spalle delle decisioni che stai per prendere. Se non hai un'esigenza specifica di generare pagine renderizzate, questo confronto ha una sola risposta.
La ragione per volerli entrambi è reale, e non è un criterio di spareggio. Una pipeline che legge documenti e produce presentazioni usa due modelli con due tipi di output genuinamente diversi, e l'atteggiamento utile è mantenere il renderer di pagina su hardware in grado di supportarlo e instradare il lavoro di lettura e ragionamento verso qualcosa ospitato dietro lo stesso endpoint di tutto il resto.
Cosa renderebbe questa una pagina di chiusura?
Tre cose, e solo una di esse riguarda i benchmark. Una riproduzione indipendente del calo di riferimento di 82,94 e 1,00 punti farebbe passare AesCode-8B da affermazione del fornitore a risultato, e permetterebbe di rispondere nel merito alla questione della dimensione 8B contro 8B. Un provider che adottasse il checkpoint farebbe crollare la colonna del deployment e trasformerebbe "una settimana GPU" in "una chiamata API". E il paper che la scheda cita come in revisione — "AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards" — risponderebbe alla domanda a cui la scheda del modello non può: che cosa fa la rubrica visiva quando il grafo di design rispetto al quale assegna il punteggio è esso stesso errato.
Finché uno di quelli non arriva, l'interpretazione difendibile è quella restrittiva. AesCode-8B è il più interessante dei due modelli e il meno utilizzabile. È molto bravo nelle parti di progettazione visiva che una macchina può verificare, mediocre nella parte che non può essere automatizzata, e appartiene alla stessa famiglia della generazione Qwen3 del modello con cui viene confrontato pur non essendone un discendente. Qwen3-8B è quello che puoi mettere in una pipeline questo pomeriggio.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
