Ett hero-titelkort för "AesCode 32B vs Qwen3.8 27B" med undertexten "finjusteringen och förfadern", ritat som ett härstamningsdiagram: ett Qwen3-VL-32B-Instruct-checkpointkort till vänster matar en pil in i ett "AesCode 32B fine-tune"-kort märkt "endast egen hosting, 65 GB", medan ett separat nyare kort nedanför till höger märkt "Qwen3.8 27B" bär en live-API-markör med texten "anropbar idag"; OrcaRouter-logotypen sitter i det nedre högra hörnet.
Guides & Insights

AesCode 32B vs Qwen3.8 27B: Microsoft byggde den på Qwen, och en av dem kan anropas

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Detaljen som omorganiserar hela den här jämförelsen finns på andra raden i modellkortet: AesCode 32B utgår från Qwen3-VL-32B-Instruct. Microsofts designspecifika kodmodell är en Qwen3-VL-finjustering, Apache 2.0, som ligger i ett Hugging Face-arkiv skapat den 29 september 2026, med commiten med titeln "Release AesCode-32B" daterad den 7 oktober 2026 och inget tillkännagivande någonstans från Microsoft. Qwen3.8 27B är den andra änden av den härstamningen: leverantörens egen 27B dense multimodal modell med öppna vikter, släppt den 14 augusti 2026 under Apache 2.0, efterföljararkitekturen till den VL-checkpoint som Microsoft finjusterade. Så detta är inte en matchning mellan två leverantörers flaggskeppsinsatser. Det är en matchning mellan ett labs generella modell med öppna vikter och en konkurrents forskningsfinjustering av familjen, och den praktiska skillnaden mellan dem visar sig nästan helt handla om vad du får göra med filen när du väl har den.

Samma licens, samma familj, olika mängd modell

Båda är Apache 2.0, båda tar emot såväl bilder som text, och båda returnerar text. Allt därefter skiljer sig åt, och raden om distribution skiljer sig mest.

• Parametrar — AesCode 32B: 33B dense på en bas av Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B dense, 28B med visionskodaren inräknad, 64 lager med en dold storlek på 5120.

• Minne för att köra det — AesCode 32B: modellkortet rekommenderar att man planerar ungefär 65 GB accelerator-minne enbart för bf16-parametrarna, och dess eget serveringsexempel använder fyrvägs tensor-parallellism. Qwen3.8 27B: cirka 55,6 GB i bf16.

• Kontext — AesCode 32B: 24 576 tokens i den rapporterade konfigurationen, med prompter och svar vid träningstillfället begränsade till 8 192. Qwen3.8 27B: 262 144 tokens inbyggt, kan utökas till 1 000 000 med YaRN-skalning.

• Attention – AesCode 32B: ärvd från Qwen3-VL-stommen. Qwen3.8 27B: hybrid, 48 linjära attentionlager av Gated DeltaNet-typ mot 16 fulla attentionlager i förhållandet 3:1, vilket är det som gör ett 262K-fönster överkomligt att betjäna.

• Vad den är till för — AesCode 32B: att generera informationsrika visuella artefakter som redigerbar HTML och CSS, samt forskning om multimodal kodgenerering. Qwen3.8 27B: allmänt agentiskt och multimodalt arbete — kodning, datoranvändning, dokument- och videoförståelse, verktygsanrop.

• Var du får tag i den — AesCode 32B: en nedladdning från Hugging Face; ingen inferensleverantör driftsätter den. Qwen3.8 27B: vikter, eller en hostad endpoint.

Dubbelt så mycket kontext, något mindre fotavtryck, en generation nyare stomme och en licens som är identisk. Den enda raden där AesCode 32B vinner ohotat är den första, och den vinner den tack vare en uppgiftsspecifik finjustering.

Vad var och en faktiskt mättes på

De två utvärderingsregimerna vidrör inte varandra, och att låtsas något annat är standardfelet på sidor som den här.

Modellkortet för Qwen3.8 27B är brett och specifikt på en och samma gång. Kodning: Terminal-Bench 2.1 på 73,0, SWE-bench Pro på 61,7, QwenSWEBench på 79,0, LiveCodeBench v6 på 90,3. Resonemang: GPQA Diamond 89,2, Humanity's Last Exam 30,8. Datoranvändning: OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9. Vision: MathVision 94,6 med leverantörens förbättring vid inferenstid och 90,0 utan den, OmniDocBench 1.5 på 91,1. Allt är leverantörens egna siffror i leverantörens eget testramverk – med en fotnot värd att läsa: att körningarna av SWE-bench Pro och QwenSWEBench använde Claude Code-ramverket, så de är inte direkt jämförbara med modeller som fått poäng i ett annat.

AesCode 32B har ett enda benchmark, och det är ensyftat: 300 infografiska exempel, tre genereringar per prompt utan urval, renderade och poängsatta över sju kanaler. Huvudresultatet är ett Overall på 85,89 med referensbilden angiven, mot 81,28 för GPT-5.5 och 80,39 för Claude Opus 4.8 under samma testramverk – plus påståendet att AesCode 32B slår sin egen Qwen3-VL-32B-backbone med 22,4 poäng på Visual-dimensionen och 24,8 på Overall.

Sätt dem bredvid varandra, och ingenting stämmer. Terminal-Bench mäter huruvida en shell-uppgift slutförs; AesCode-utvärderingen mäter huruvida en infografiks text är läsbar, om dess layout inte flödar över canvasen och om dess tabell är en riktig HTML-tabell. Det finns inget gemensamt mått, ingen gemensam testrigg och ingen gemensam uppgift. Det enda ärliga påståendet är att AesCode 32B är mycket bättre på designartefakter än sin egen basmodell, och att Qwen3.8 27B är en stark generell modell – och inget av påståendena säger dig något om det andra.

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

Evidensgapet är verkligt den här gången, i en riktning.

Leverantörsbenchmarks är standard i den här branschen, så det spelar roll att dessa två skiljer sig åt i hur mycket av deras leverantörspåståenden som någon annan har granskat.

Qwen3.8 27B levererades med leverantörens egen tabell och samlade sedan externa resultat inom några veckor. Modellens oberoende resultatlista omfattar en studie av juridisk agent som kördes av juridik-AI-företaget Harvey tillsammans med minnesstartupen Engram, där en anpassad Qwen3.8 27B överträffade varje modell som studien testade, inklusive Claude Opus 4.8, på 250 juridiska uppgifter — med det viktiga förbehållet att den anpassade modellen först hade studerat testföretagets 100M-tokenkorpus, så det är lika mycket ett resultat om anpassning som om modellen. Den omfattar en placering på Code Arenas WebDev-topplista och topplaceringen bland modeller med öppna vikter på Arena.ais Image-to-WebDev-topplista, vilka båda är av leverantören vidarebefordrade rankningspåståenden snarare än publicerad metodik. Och den omfattar en tredjepartstabell med en publicerad poäng: Artificial Analysis registrerar Qwen3.8 27B på 33,70 i sitt Intelligence Index med en kostnad per slutförd uppgift på omkring $1,01, och publicerar tokenuppdelningen bakom detta.

AesCode 32B har inget av det. Ingen arenaplacering, ingen listning på leaderboarden, ingen tredjepartsreproduktion, inget oberoende genomströmningstest – och inte för att någon tittade och fann det bristfälligt, utan för att en checkpoint som ingen leverantör tillhandahåller överhuvudtaget inte kan utvärderas av ett externt testramverk. Dess siffror är leverantörens, beräknade av samma verifierarstack som tränade modellen, på stickprov som leverantören valde, mot baslinjer som leverantören körde. Släppet är ovanligt öppet med metoden – namnen på belöningskanalerna, antalet rollouts, avkodningsparametrarna och felfrekvenserna publiceras alla – men öppenhet kring hur en siffra har tagits fram är inte samma sak som att någon annan tar fram den.

Den som kostar ett sparat kort

Det är här som släktlinjen slutar vara en kuriositet och börjar bli avgörandet.

AesCode 32B ber dig om 65 GB acceleratorminne, en multimodal serveringsväg och att du är villig att köra en oannonserad modell som tidig användare. Dess eget serveringsexempel tar till fyrvägs tensorparallellism, och modellen är dokumenterad för en kontext på 24 576 token utan något hostat alternativ att falla tillbaka på. Om du redan äger hårdvaran och din pipeline verkligen behöver designspecifik finjustering, är det en rimlig avvägning. För de flesta team är det ett tvåveckorsprojekt innan det första användbara resultatet.

Qwen3.8 27B är självhostad på OrcaRouters egen infrastruktur och kan anropas i dag för $0.33 per miljon indatatokens och $2.40 per miljon utdatatokens, med en kontext på 262 144 tokens samt text-, bild- och videoindata. Det är listpriser som förs vidare utan påslag från vår sida, och den ligger på samma nyckel som fler än 200 andra modeller, så jämförelsen mot vilket alternativ som helst i katalogen är en begärandeparameter i stället för ett andra avtal. Det är hela det praktiska argumentet, och det är ett stort sådant: modellen som i familjetermer ligger en generation efter AesCode 32B:s backbone är den du kan utvärdera i eftermiddag, med dina egna prompter, för priset av några cent.

Det finns en andra ordningens poäng här som routningsperspektivet gör konkret. Eftersom AesCode 32B är en finjustering av en Qwen3-VL-checkpoint ger familjen dig ett billigt sätt att testa huruvida den hostade sidan av arkitekturen fungerar överhuvudtaget innan du binder dig vid att självhosta något. Qwen3-VL 235B A22B Instruct finns tillgänglig för 0,40 USD per miljon indata-tokens och 1,60 USD utdata, och Qwen3-VL 8B Instruct för 0,18 respektive 0,70 USD. Ingen av dem är AesCode 32B och ingen av dem har tränats för designkvalitet – men ”kan en vision-språkmodell läsa våra skärmdumpar och skriva den markup vi behöver” går att besvara med dem för några cent, och automatisk failover under samma endpoint innebär att en dålig providerdag inte tar ner pipelinen.

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

Vem ska välja vilken

Välj AesCode 32B om artefakten är själva leveransen. Du producerar slides, dashboards, affischer eller rapporter i stor volym, du behöver strukturerad utdata som förblir redigerbar och diffbar — modellen skickar ut ett komplett HTML-dokument, använder riktiga HTML-tabellstrukturer och ECharts-specifikationer så att båda förblir granskningsbara — och du har hårdvaran eller budgeten för att hyra den. Utgå från tre saker: ingen oberoende verifiering av någon siffra, ungefär 65 GB för vikterna, och en kontext på 24K som kommer att begränsa långa dokument. Den svåra felkvoten på 4,3 % för canvas-gränser som kortet rapporterar, mot 34,7 % för GPT-5.5, är den mest uppmuntrande enskilda siffran i lanseringen, och den är också Microsofts.

Välj Qwen3.8 27B om du behöver en allmän multimodal modell med öppna vikter som du faktiskt kan köra och faktiskt kan servera. 262K kontext, utökningsbar till en miljon; ett driftsättningsavtryck som passar där AesCode 32B inte gör det; en licensieringsposition som inte är annorlunda; någon oberoende mätning av både dess kvalitet och dess kostnad per slutförd uppgift; och ett hostat alternativ som innebär att du kan börja idag och self-hosta senare utan att skriva om integrationen. Dess stegvisa, lagerindelade attention-design är anledningen till att den långa kontexten är överkomlig, och lång kontext är det som design- och dokumentpipelines tenderar att behöva mest.

Och om du behöver båda – en generator för designartefakter och en allmän arbetshäst – är den förnuftiga uppdelningen inte att köra två bild- och språkmodeller i 30B-klassen på din egen utrustning. Led den allmänna trafiken till den hostade sidan och håll specialisten egenhostad, bakom en enda nyckel, där ett leverantörsavbrott på endera vägen är en failover-händelse snarare än en incident.

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

Det man ska hålla ögonen på

AesCode 32B:s position förändras fullständigt om den blir anropbar. Just nu är modellens enda verkliga svaghet åtkomsten, och det är en tillfällig situation – en inferensleverantör som plockar upp checkpointen, eller Microsoft som publicerar en slutpunkt, förvandlar en anskaffning på 65 GB till ett modellval. Fram till dess är den ärliga sammanfattningen av den här jämförelsen att finjusteringen är bättre på en uppgift, att den generella modellen är bättre på att vara användbar, och att den generella modellen råkar vara förfadern: Microsoft valde en Qwen3-VL-checkpoint att bygga vidare på eftersom den var den starkaste tillgängliga öppna multimodala basen, vilket i sig är det mest användbara som den här jämförelsen har att säga om Qwen3.8 27B.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen