Una card di titolo hero per 'AesCode 32B vs Qwen3.8 27B' con sottotitolo 'il fine-tune e l'antenato', disegnata come un diagramma di discendenza: una scheda checkpoint Qwen3-VL-32B-Instruct sulla sinistra immette una freccia in una scheda 'fine-tune AesCode 32B' etichettata 'solo self-host, 65 GB', mentre una scheda separata più recente in basso a destra etichettata 'Qwen3.8 27B' porta un marcatore API live che recita 'chiamabile oggi'; il logo OrcaRouter si trova nell'angolo in basso a destra.
Guides & Insights

AesCode 32B vs Qwen3.8 27B: Microsoft l'ha costruito su Qwen, e uno dei due è invocabile

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il dettaglio che riorganizza l'intero confronto è sulla seconda riga della model card: AesCode 32B parte da Qwen3-VL-32B-Instruct. Il modello di codice specifico per il design di Microsoft è un fine-tune di Qwen3-VL, Apache 2.0, ospitato su un repository Hugging Face creato il 29 settembre 2026, con il commit intitolato "Release AesCode-32B" datato 7 ottobre 2026 e nessun annuncio da parte di Microsoft da nessuna parte. Qwen3.8 27B è l'altro capo di quella discendenza: il modello multimodale denso da 27B a pesi aperti dello stesso fornitore, rilasciato il 14 agosto 2026 sotto Apache 2.0, l'architettura che succede al checkpoint VL su cui Microsoft ha fatto fine-tuning. Quindi non si tratta di un confronto tra gli sforzi di punta di due fornitori. È un confronto tra il modello general-purpose a pesi aperti di un laboratorio e un fine-tune di ricerca di un concorrente della stessa famiglia, e la differenza pratica tra i due si rivela quasi interamente legata a ciò che ti è permesso fare con il file una volta che lo hai.

Stessa licenza, stessa famiglia, diversa quantità di modello

Entrambi sono Apache 2.0, entrambi accettano immagini oltre che testo ed entrambi restituiscono testo. Tutto ciò che viene dopo diverge, e la riga relativa al deployment è quella che diverge più di tutte.

• Parametri — AesCode 32B: 33B denso su una base Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B denso, 28B includendo il codificatore visivo, 64 strati con una dimensione nascosta di 5120.

• Memoria per eseguirlo — AesCode 32B: la scheda consiglia di pianificare circa 65 GB di memoria dell'acceleratore per i soli parametri bf16, e il suo esempio di serving utilizza il parallelismo tensoriale a quattro vie. Qwen3.8 27B: circa 55,6 GB in bf16.

• Contesto — AesCode 32B: 24.576 token nella configurazione riportata, con prompt e risposte in fase di addestramento limitati a 8.192. Qwen3.8 27B: 262.144 token nativi, estendibile a 1.000.000 con scaling YaRN.

• Attenzione — AsCode 32B: ereditato dal backbone Qwen3-VL. Qwen3.8 27B: ibrido, da 48 livelli di attenzione lineare Gated DeltaNet a 16 livelli di attenzione completa con un rapporto di 3:1, ed è ciò che rende sostenibile servire una finestra da 262K.

• A cosa serve — AesCode 32B: generare artefatti visivi ricchi di informazioni come HTML e CSS modificabili, oltre alla ricerca sulla generazione multimodale di codice. Qwen3.8 27B: lavoro agentico e multimodale generico — programmazione, utilizzo del computer, comprensione di documenti e video, chiamata di strumenti.

• Dove lo si ottiene — AesCode 32B: un download da Hugging Face; nessun provider di inferenza lo distribuisce. Qwen3.8 27B: i pesi, oppure un endpoint ospitato.

Il doppio del contesto, un ingombro leggermente inferiore, una backbone di una generazione più recente e una licenza identica. L'unica riga in cui AesCode 32B vince nettamente è la prima, e la vince grazie a un fine-tuning specifico per il task.

Su cosa ciascuno è stato effettivamente misurato

I due regimi di valutazione non si toccano, e fingere il contrario è l'errore tipico in pagine come questa.

La scheda di Qwen3.8 27B è ampia e specifica allo stesso tempo. Programmazione: Terminal-Bench 2.1 a 73,0, SWE-bench Pro a 61,7, QwenSWEBench a 79,0, LiveCodeBench v6 a 90,3. Ragionamento: GPQA Diamond 89,2, Humanity's Last Exam 30,8. Uso del computer: OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9. Visione: MathVision 94,6 con il potenziamento in fase di inferenza del fornitore e 90,0 senza, OmniDocBench 1.5 a 91,1. Sono tutti numeri dello stesso fornitore sul suo stesso harness — con una nota a piè di pagina che vale la pena leggere, e cioè che le esecuzioni di SWE-bench Pro e QwenSWEBench hanno utilizzato l'harness Claude Code, quindi non sono direttamente confrontabili con modelli valutati su un harness diverso.

AesCode 32B ha un unico benchmark ed è monoscopo: 300 campioni infografici, tre generazioni per prompt senza selezione, renderizzate e valutate su sette canali. Il dato principale è un Overall di 85,89 con l'immagine di riferimento fornita, rispetto a 81,28 per GPT-5.5 e 80,39 per Claude Opus 4.8 nello stesso harness — oltre all'affermazione che AesCode 32B supera il proprio backbone Qwen3-VL-32B di 22,4 punti sulla dimensione Visual e di 24,8 su Overall.

Mettili uno accanto all'altro e nulla combacia. Terminal-Bench misura se un'attività della shell viene completata; la valutazione AesCode misura se il testo di un'infografica è leggibile, se il suo layout non fuoriesce dalla tela e se la sua tabella è una vera tabella HTML. Non esiste una metrica condivisa, né un'infrastruttura condivisa, né un compito condiviso. L'unica affermazione onesta è che AesCode 32B è molto meglio con gli artefatti di design rispetto al suo stesso backbone, e che Qwen3.8 27B è un forte modello generalista — e nessuna delle due affermazioni ti dice nulla sull'altra.

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

Questa volta il divario probatorio è reale, in una sola direzione.

I benchmark dei fornitori sono la norma in questo settore, quindi conta che questi due differiscano per quanto delle loro dichiarazioni di fornitore sia stato verificato da qualcun altro.

Qwen3.8 27B è stato rilasciato con la tabella dello stesso fornitore e in poche settimane ha poi accumulato risultati esterni. Il registro indipendente del modello comprende uno studio sugli agenti legali condotto dall'azienda di AI legale Harvey insieme alla startup di memoria Engram, in cui un Qwen3.8 27B adattato ha superato ogni modello testato dallo studio, incluso Claude Opus 4.8, su 250 attività legali — con l'importante avvertenza che il modello adattato aveva prima studiato il corpus da 100 milioni di token dello studio legale sottoposto al test, quindi è un risultato tanto sull'adattamento quanto sul modello. Comprende una posizione nella classifica WebDev di Code Arena e il primo posto tra i modelli open-weight nella classifica Image-to-WebDev di Arena.ai, entrambe affermazioni di posizionamento in classifica riportate dal fornitore anziché metodologia pubblicata. E comprende una classifica di terze parti con un punteggio pubblicato: Artificial Analysis registra Qwen3.8 27B a 33,70 sul suo Intelligence Index, con un costo per attività completata di circa 1,01 $, e pubblica la ripartizione dei token alla base di quel dato.

AesCode 32B non ha nulla di tutto ciò. Nessun posizionamento nell'arena, nessuna presenza in classifica, nessuna riproduzione da parte di terzi, nessun test indipendente di throughput — e non perché qualcuno l'abbia esaminato e trovato carente, ma perché un checkpoint che nessun provider serve non può nemmeno essere valutato da un harness esterno. I suoi numeri sono del fornitore, calcolati dallo stesso stack di verifica che ha addestrato il modello, su campioni scelti dal fornitore, rispetto a baseline eseguite dal fornitore. Il rilascio è insolitamente trasparente riguardo al metodo — i nomi dei canali di ricompensa, i conteggi dei rollout, i parametri di decodifica e i tassi di errore sono tutti pubblicati — ma la trasparenza su come è stato prodotto un numero non equivale al fatto che qualcun altro lo produca.

Quello che richiede una carta salvata

È qui che il lignaggio smette di essere una curiosità e diventa la decisione.

AesCode 32B ti chiede 65 GB di memoria per acceleratori, un percorso di serving multimodale e la disponibilità a eseguire un modello non annunciato come early adopter. Il suo stesso esempio di serving ricorre al parallelismo tensoriale a quattro vie, e il modello è documentato per un contesto di 24,576 token senza alcuna opzione hosted su cui ripiegare. Se possiedi già l'hardware e la tua pipeline ha davvero bisogno di un fine-tuning specifico per il design, è uno scambio ragionevole. Per la maggior parte dei team, è un progetto di due settimane prima del primo output utile.

Qwen3.8 27B è self-hosted sull'infrastruttura propria di OrcaRouter ed è invocabile già da oggi a 0,33 $ per milione di token in input e 2,40 $ per milione in output, con una finestra di contesto di 262.144 token e input di testo, immagini e video. Queste sono tariffe di listino trasferite senza alcun ricarico aggiunto da parte nostra, e il modello si trova sulla stessa chiave di oltre 200 altri modelli, quindi il confronto con qualsiasi alternativa presente nel catalogo è un parametro della richiesta anziché un secondo contratto. Questo è tutto ciò che serve sul piano pratico, e non è poco: il modello che, in termini di famiglia, è una generazione indietro rispetto al backbone di AesCode 32B è quello che puoi valutare questo pomeriggio, sui tuoi prompt, al prezzo di pochi centesimi.

C'è qui un punto di secondo ordine che l'angolazione del routing rende concreto. Poiché AesCode 32B è un fine-tune di un checkpoint Qwen3-VL, la famiglia offre un modo economico per verificare se il lato hosted dell'architettura funziona davvero, prima di impegnarsi a ospitare qualsiasi cosa in autonomia. Qwen3-VL 235B A22B Instruct è disponibile a 0,40 $ per milione di token in input e 1,60 $ in output, e Qwen3-VL 8B Instruct a 0,18 e 0,70. Nessuno dei due è AesCode 32B e nessuno dei due è stato addestrato per la qualità progettuale — ma "un modello vision-linguaggio può leggere i nostri screenshot e scrivere il markup di cui abbiamo bisogno" è una domanda a cui si può rispondere con questi modelli per pochi centesimi, e il failover automatico sotto lo stesso endpoint significa che una brutta giornata di un provider non manda a terra la pipeline.

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

Chi dovrebbe scegliere cosa

Scegli AesCode 32B se l'artefatto è il deliverable. Produci slide, dashboard, poster o report in volume, hai bisogno di output strutturato che resti modificabile e diffabile — il modello genera un documento HTML completo, usa vere strutture di tabelle HTML e specifiche ECharts, così entrambi restano ispezionabili — e hai l'hardware o il budget per noleggiarlo. Parti accettando tre cose: nessuna verifica indipendente di alcun numero, circa 65 GB per i pesi, e un contesto da 24K che vincolerà i documenti lunghi. Il tasso di fallimenti gravi ai confini della canvas del 4,3% riportato dalla scheda, contro il 34,7% di GPT-5.5, è il singolo dato più incoraggiante del rilascio, ed è anche di Microsoft.

Scegli Qwen3.8 27B se ti serve un modello multimodale open-weight generico che puoi davvero eseguire e davvero servire. Contesto da 262K, estendibile a un milione; un'impronta di deployment che entra dove AesCode 32B non entra; una posizione di licenza non diversa; qualche misurazione indipendente sia della sua qualità sia del suo costo per attività completata; e un'opzione hosted che significa che puoi iniziare oggi e passare al self-hosting più tardi senza riscrivere l'integrazione. Il suo design dell'attenzione a stadi, per layer, è la ragione per cui il contesto lungo è economicamente sostenibile, e il contesto lungo è ciò di cui le pipeline di design e documentali tendono ad aver più bisogno.

E se vi servono entrambi — un generatore di artefatti di design e un tuttofare generico — la suddivisione sensata non è eseguire due modelli vision-language di classe 30B sul proprio hardware. Instradate il traffico generico verso il lato hosted e mantenete lo specialista self-hosted, dietro un'unica chiave, dove un'interruzione del provider su uno dei due percorsi è un evento di failover anziché un incidente.

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

La cosa da tenere d'occhio

La posizione di AesCode 32B cambierebbe completamente se diventasse invocabile. Al momento l'unica vera debolezza del modello è l'accesso, e si tratta di una condizione temporanea: un provider di inferenza che rileva il checkpoint, o Microsoft che pubblica un endpoint, trasforma un approvvigionamento da 65 GB in una scelta di modello. Fino ad allora, il riassunto onesto di questo confronto è che la versione fine-tuned è migliore in un compito, il modello generalista è migliore nell'essere utilizzabile, e il modello generalista è per giunta l'antenato: Microsoft ha scelto un checkpoint Qwen3-VL su cui costruire perché era la base multimodale aperta più forte disponibile, il che è di per sé la cosa più utile che questo confronto abbia da dire su Qwen3.8 27B.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno