
AesCode 32B vs Qwen3.8 27B: Microsoft bouwde het op Qwen, en een ervan is aanroepbaar
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens · 85 tok/s
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Het detail dat deze hele vergelijking herschikt, staat op de tweede regel van de modelkaart: AesCode 32B begint bij Qwen3-VL-32B-Instruct. Microsofts ontwerpspecifieke codemodel is een fine-tune van Qwen3-VL, Apache 2.0, in een Hugging Face-repository die op 29 september 2026 is aangemaakt, met de commit getiteld "Release AesCode-32B" van 7 oktober 2026 en nergens een aankondiging van Microsoft. Qwen3.8 27B is het andere uiteinde van die afstamming: het eigen open-weight 27B dense multimodale model van de leverancier, uitgebracht op 14 augustus 2026 onder Apache 2.0, de opvolgende architectuur van het VL-checkpoint dat Microsoft heeft gefine-tuned. Dit is dus geen confrontatie tussen de vlaggenschepen van twee leveranciers. Het is een confrontatie tussen het algemene open-weights model van het ene lab en een onderzoeks-fine-tune van de familie door een concurrent, en het praktische verschil tussen beide blijkt vrijwel volledig te gaan over wat je met het bestand mag doen zodra je het hebt.
Dezelfde licentie, dezelfde familie, verschillende hoeveelheid model
Beide zijn Apache 2.0, beide accepteren zowel afbeeldingen als tekst, en beide geven tekst terug. Alles daarna loopt uiteen, en de deploymentrij wijkt het sterkst af.
• Parameters — AesCode 32B: 33B dense op een Qwen3-VL-32B-Instruct-basis. Qwen3.8 27B: 27B dense, 28B inclusief de vision-encoder, 64 lagen met een verborgen grootte van 5120.
• Geheugen om het te draaien — AesCode 32B: de kaart adviseert om ruwweg 65 GB acceleratorgeheugen te plannen voor alleen al de bf16-parameters, en het eigen serveervoorbeeld gebruikt tensorparallellisme over vier wegen. Qwen3.8 27B: ongeveer 55,6 GB in bf16.
• Context — AesCode 32B: 24.576 tokens in de gerapporteerde configuratie, waarbij prompts en responses tijdens training beperkt zijn tot 8.192. Qwen3.8 27B: 262.144 tokens native, uitbreidbaar tot 1.000.000 met YaRN-schaling.
• Attention — AesCode 32B: overgenomen van de Qwen3-VL-backbone. Qwen3.8 27B: hybride, 48 Gated DeltaNet linear-attention-lagen tegenover 16 full-attention-lagen in een verhouding van 3:1, wat het betaalbaar maakt om een 262K-venster te serveren.
• Waarvoor het dient — AesCode 32B: het genereren van informatierijke visuele artefacten als bewerkbare HTML en CSS, plus onderzoek naar multimodale codegeneratie. Qwen3.8 27B: algemeen agentisch en multimodaal werk — coderen, computergebruik, document- en videobegrip, het aanroepen van tools.
• Waar je het vandaan haalt — AesCode 32B: een download van Hugging Face; geen enkele inferentieprovider deployt het. Qwen3.8 27B: gewichten, of een gehost endpoint.
Twee keer zoveel context, een iets kleinere footprint, een generatie nieuwere backbone, en een licentie die identiek is. De enige rij waarin AesCode 32B overtuigend wint, is de eerste, en die wint het op een taakspecifieke fine-tune.
Waar elk daadwerkelijk op is gemeten
De twee evaluatieregimes raken elkaar niet, en doen alsof dat wel zo is, is de klassieke fout op pagina's zoals deze.
De kaart van Qwen3.8 27B is tegelijk breed en specifiek. Coderen: Terminal-Bench 2.1 op 73,0, SWE-bench Pro op 61,7, QwenSWEBench op 79,0, LiveCodeBench v6 op 90,3. Redeneren: GPQA Diamond 89,2, Humanity's Last Exam 30,8. Computergebruik: OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9. Visie: MathVision 94,6 met de inference-time enhancement van de leverancier en 90,0 zonder, OmniDocBench 1.5 op 91,1. Allemaal cijfers van de leverancier zelf, op de eigen testomgeving van de leverancier — met een voetnoot die het lezen waard is: bij de SWE-bench Pro- en QwenSWEBench-runs is de Claude Code-harness gebruikt, dus ze zijn niet direct vergelijkbaar met modellen die op een andere harness zijn gescoord.
AesCode 32B heeft één benchmark en die is voor één specifiek doel: 300 infographic-samples, drie generaties per prompt zonder selectie, gerenderd en gescoord over zeven kanalen. Het belangrijkste resultaat is een Overall van 85,89 met de meegeleverde referentieafbeelding, tegenover 81,28 voor GPT-5.5 en 80,39 voor Claude Opus 4.8 onder dezelfde harness — plus de bewering dat AesCode 32B zijn eigen Qwen3-VL-32B-backbone met 22,4 punten verslaat op de Visual-dimensie en met 24,8 op Overall.
Zet die naast elkaar en niets komt overeen. Terminal-Bench meet of een shell-taak wordt voltooid; de AesCode-evaluatie meet of de tekst van een infographic leesbaar is, of de lay-out niet buiten het canvas valt en of de tabel een echte HTML-tabel is. Er is geen gedeelde metriek, geen gedeelde harness en geen gedeelde taak. De enige eerlijke uitspraak is dat AesCode 32B veel beter is in ontwerpartefacten dan zijn eigen backbone, en dat Qwen3.8 27B een sterk algemeen model is — en geen van beide beweringen zegt iets over de andere.

Het bewijsgat is dit keer echt, in één richting.
Benchmarks van leveranciers zijn de norm in deze branche, dus het maakt uit dat deze twee van elkaar verschillen in hoeveel van hun leveranciersclaims door iemand anders zijn gecontroleerd.
Qwen3.8 27B werd geleverd met de eigen tabel van de leverancier en verzamelde vervolgens binnen enkele weken resultaten van buitenaf. Het onafhankelijke trackrecord van het model omvat een studie naar juridische agents, uitgevoerd door het juridische-AI-bedrijf Harvey samen met geheugenstartup Engram, waarin een aangepaste Qwen3.8 27B op 250 juridische taken elk door de studie getest model overtrof, inclusief Claude Opus 4.8 — met de belangrijke kanttekening dat het aangepaste model eerst het corpus van 100M tokens van het testkantoor had bestudeerd, dus het is net zozeer een resultaat over aanpassing als over het model. Het omvat een notering op de WebDev-ranglijst van Code Arena en de hoogste positie voor open-weight modellen op de Image-to-WebDev-ranglijst van Arena.ai, die beide door leveranciers doorgegeven rankingclaims zijn in plaats van gepubliceerde methodologie. En het omvat een ranglijst van een derde partij met een gepubliceerde score: Artificial Analysis noteert Qwen3.8 27B op 33,70 op zijn Intelligence Index, met kosten per voltooide taak van ongeveer $1,01, en publiceert de token-uitsplitsing die daaraan ten grondslag ligt.
AesCode 32B heeft niets van dat alles. Geen arena-plaatsing, geen vermelding op een ranglijst, geen reproductie door een derde partij, geen onafhankelijke doorvoertest — en niet omdat iemand ernaar heeft gekeken en het tekort vond, maar omdat een checkpoint dat door geen enkele provider wordt aangeboden in de eerste plaats niet door een externe harness kan worden geëvalueerd. De cijfers zijn van de leverancier, berekend door dezelfde verifier-stack die het model heeft getraind, op monsters die de leverancier heeft gekozen, tegen baselines die de leverancier zelf heeft gedraaid. De release is ongewoon transparant over de methode — de namen van de beloningskanalen, de aantallen rollouts, de decoderingsparameters en de faalpercentages zijn allemaal gepubliceerd — maar transparantie over hoe een cijfer tot stand is gekomen is niet hetzelfde als dat iemand anders het heeft geproduceerd.
Die waarvoor een opgeslagen kaart nodig is
Dit is het punt waarop de afstamming ophoudt trivia te zijn en de beslissing begint.
AesCode 32B vraagt je om 65 GB acceleratorgeheugen, een multimodale serveerroute, en de bereidheid om als early adopter een onaangekondigd model te draaien. Het eigen serveervoorbeeld grijpt naar vierweg-tensorparallellisme, en het model is gedocumenteerd voor een context van 24.576 tokens zonder gehoste optie om op terug te vallen. Als je de hardware al bezit en je pipeline echt behoefte heeft aan ontwerpspecifieke fine-tuning, dan is dat een redelijke ruil. Voor de meeste teams is het een project van twee weken voordat de eerste bruikbare output er is.
Qwen3.8 27B wordt zelf gehost op de eigen infrastructuur van OrcaRouter en is vandaag aanroepbaar voor $0,33 per miljoen inputtokens en $2,40 per miljoen outputtokens, met een context van 262.144 tokens en tekst-, beeld- en video-invoer. Dat zijn lijsttarieven die zonder opslag van onze kant worden doorgegeven, en het zit op dezelfde sleutel als meer dan 200 andere modellen, dus de vergelijking met elk alternatief in de catalogus is een verzoekparameter in plaats van een tweede contract. Dat is het volledige praktische argument, en het is een groot argument: het model dat in familietermen een generatie achterloopt op de backbone van AesCode 32B, is het model dat u vanmiddag kunt evalueren, met uw eigen prompts, voor de prijs van een paar cent.
Er is hier een tweedegraads punt dat de invalshoek van routing concreet maakt. Omdat AesCode 32B een fine-tune is van een Qwen3-VL-checkpoint, biedt de familie je een goedkope manier om te testen of de gehoste kant van de architectuur überhaupt werkt voordat je je vastlegt op het zelf hosten van wat dan ook. Qwen3-VL 235B A22B Instruct is beschikbaar voor $0,40 per miljoen invoer en $1,60 uitvoer, en Qwen3-VL 8B Instruct voor $0,18 en $0,70. Geen van beide is AesCode 32B en geen van beide is getraind op ontwerpkwaliteit — maar "kan een visie-taalmodel onze screenshots lezen en de markup schrijven die we nodig hebben" is met hen voor een paar cent te beantwoorden, en automatische failover onder dezelfde endpoint betekent dat een slechte providerdag de pipeline niet platlegt.

Wie moet welke kiezen
Kies AesCode 32B als het artefact het eindproduct is. Je produceert slides, dashboards, posters of rapporten op grote schaal, je hebt gestructureerde output nodig die bewerkbaar en diffbaar blijft — het model levert een compleet HTML-document op, gebruikt echte HTML-tabelstructuren en ECharts-specificaties, zodat beide inspecteerbaar blijven — en je hebt de hardware of het budget om die te huren. Accepteer vooraf drie dingen: geen onafhankelijke verificatie van enig getal, ongeveer 65 GB voor de gewichten, en een context van 24K die lange documenten zal beperken. Het percentage van 4,3% ernstige fouten op canvasgrenzen dat de kaart meldt, tegenover 34,7% voor GPT-5.5, is het meest bemoedigende afzonderlijke cijfer in de release, en het is ook nog eens van Microsoft.
Neem Qwen3.8 27B als je een algemeen open-weight multimodaal model nodig hebt dat je daadwerkelijk kunt draaien en daadwerkelijk kunt serveren. 262K context, uitbreidbaar tot een miljoen; een deployment-footprint die past waar AesCode 32B dat niet doet; een licentiepositie die niet anders is; een onafhankelijke meting van zowel de kwaliteit als de kosten per voltooide taak; en een gehoste optie waardoor je vandaag kunt beginnen en later zelf kunt hosten zonder de integratie te herschrijven. Het gefaseerde, laagsgewijze attention-ontwerp is de reden dat de lange context betaalbaar is, en lange context is wat ontwerp- en documentpipelines doorgaans het hardst nodig hebben.
En als je beide nodig hebt — een generator voor ontwerp-artefacten en een algemeen werkpaard — is de verstandige splitsing niet om twee vision-language-modellen van de 30B-klasse op je eigen kit te draaien. Leid het algemene verkeer naar de gehoste kant en houd de specialist zelfgehost, achter één sleutel, waar een providerstoring op een van beide paden een failover-gebeurtenis is in plaats van een incident.

Het ding om in de gaten te houden
De positie van AesCode 32B verandert volledig als het aanroepbaar wordt. Op dit moment is de enige echte zwakte van het model de toegang, en dat is een tijdelijke situatie — een inferenceprovider die het checkpoint oppikt, of Microsoft dat een endpoint publiceert, verandert een aankoop van 65 GB in een modelkeuze. Tot dan is de eerlijke samenvatting van deze vergelijking dat de fine-tune beter is in één taak, het algemene model beter is in bruikbaar zijn, en het algemene model toevallig de voorouder is: Microsoft koos een Qwen3-VL-checkpoint als basis omdat het de sterkste beschikbare open multimodale basis was, wat op zichzelf het nuttigste is dat deze vergelijking over Qwen3.8 27B te zeggen heeft.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
