Een gegenereerde titelkaart met als kop "AesCode-8B vs Qwen3-8B" met twee afgeronde kaarten naast elkaar. De linkerkaart AesCode-8B heeft een pictogram van een browservenster dat een posterpagina weergeeft en de regels "Basis: Qwen3-VL-8B-Instruct" en "Genereert een gerenderde pagina"; de rechterkaart Qwen3-8B heeft een documentpictogram met een tekstballon en de regels "Qwens eigen generalist" en "Tekst, 119 talen". Een scheidingslijn ertussen luidt "neven, geen ouder en kind" en een bijschriftstrook bovenin luidt "AesCode-8B is geen fine-tune van Qwen3-8B". Het OrcaRouter-logo is rechtsonder samengevoegd.
Guides & Insights

AesCode-8B vs Qwen3-8B: Ze lijken op een ouder en een kind, maar dat zijn ze niet

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De namen nodigen uit tot een vergissing. AesCode-8B is een 8B-model met een Qwen3-VL-8B-Instruct-backbone, Qwen3-8B is het eigen 8B-model van de leverancier, en de voor de hand liggende lezing is dat het eerste een fine-tune van het tweede is. Dat is niet zo. De gepubliceerde config van AesCode-8B verklaart Qwen3-VL-8B-Instruct als de basis — het vision-language-zusje, een ander checkpoint met een andere taak — en de Hugging Face-metadata vermeldt het als een finetune van dat model, niet van het tekstuele Qwen3-8B. De twee AesCode-modellen in deze gewichtsklasse zijn neven in plaats van ouder en kind, en dat onderscheid is precies de reden waarom deze pagina nuttig is: ze vertelt je wat Microsoft kocht toen het begon vanaf een vision-language-checkpoint, wat dat aan de tekstkant kostte, en waarom een vergelijking met de gewone 8B-generalist van de familie uiteindelijk een fork meet in plaats van een upgrade.

Beide zijn Apache 2.0 en beide zijn downloadbaar, maar hun publicatierecords hadden niet meer van elkaar kunnen verschillen. Qwen3-8B werd in april 2025 uitgebracht als onderdeel van de Qwen3-generatielijn van de leverancier, met documentatie, ecosysteemintegratie en achttien maanden van implementaties door anderen achter zich. AesCode-8B bevat nergens in zijn bestanden een releasedatum. Microsoft heeft de Hugging Face-repository op 2026-09-29 aangemaakt, de gewichten gecommit met het bericht "Release AesCode-8B" om 03:35 UTC op 2026-10-07, en de trainingscode de volgende dag op GitHub gezet. Er is geen Microsoft Research-bericht, geen release note, geen productpagina en geen paper — de citatie op de modelkaart luidt "Under review" met het placeholder-jaar 2027, en de repository had twee downloads op het moment van schrijven. Alle kwantitatieve gegevens over AesCode-8B hieronder zijn van Microsoft zelf en door niemand gereproduceerd.

De stamboom die de namen verbergen

De Qwen3-generatiereeks bevat verschillende checkpoints in de 8B-klasse die een afstamming delen en niet veel meer. Qwen3-8B is de tekstuele generalist: ongeveer 8,2 miljard totale parameters, waarvan ongeveer 7 miljard niet-embedding, grouped-query attention, een native context van 32K tokens die via YaRN uitbreidbaar is tot 131K, en training op 119 talen en dialecten. Het redeneert, chat, codeert en roept tools aan, en het is een van de meest zelfgehoste 8B-modellen in het open ecosysteem, precies om die redenen. Qwen3-VL-8B-Instruct is het multimodale lid: dezelfde familiegeneratie, met daarbovenop een speciale vision tower, beeld en tekst in, tekst uit.

Microsoft begon bij de tweede. In de AesCode-8B-config staat Qwen3VLForConditionalGeneration, met 36 verborgen lagen, verborgen grootte 4.096, 32 attention-heads en 8 key-value-heads, een vocabulaire van 151.936 tokens en interleaved mrope-posities, en heeft transformers 4.57 of nieuwer nodig. De shards zijn samen 17.543.339.408 bytes groot, ongeveer 8,8 miljard bf16-parameters, waardoor het afgeronde grootteveld van Hugging Face 9B aangeeft, terwijl de leverancier 8B zegt. Dat is eerder afronding dan een discrepantie, en het aantal parameters is niet de fork die ertoe doet — de invoermodaliteit en de 24.576-token serving-context zijn dat wel.

Dus de eerlijke framing is niet "generalist versus zijn fine-tune." Het is: een tekstgeneralist met een lange context en achttien maanden productiegeschiedenis, tegenover een multimodaal onderzoekscheckpoint dat een document afgeeft en nooit onafhankelijk is geëvalueerd.

A generated two-column scoreboard titled "AesCode-8B vs Qwen3-8B - the scoreboard". Left column AesCode-8B reads Base Qwen3-VL-8B-Instruct, Parameters 8.8B, Output HTML and CSS page, Context 24,576 tokens, Languages English only, Evidence vendor rubric and unreproduced. Right column Qwen3-8B reads Base Qwen3-8B itself, Parameters 8.2B, Output text and tool calls, Context 32K native and 131K extended, Languages 119, Evidence 18 months independent. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Qwen3-8B specifications are Alibaba's." The OrcaRouter logo is composited bottom-right.

Waar Microsoft het trainingsbudget aan heeft besteed

De ontwerpopdracht wordt op de modelkaart aangehaald en legt de splitsing uit: codemodellen "kunnen niet zien hoe lay-out, hiërarchie en kleur samenkomen op het canvas", terwijl beeldgeneratoren "visueel aantrekkelijke pagina's samenstellen maar vaak tekst, cijfers en logische relaties verkeerd weergeven." AesCode is de poging om compositiegevoel van de een en verifieerbaarheid van de ander te nemen, en het recept is op een specifieke manier ongewoon.

Elke trainingsprompt wordt gekoppeld aan een referentieafbeelding die uit diezelfde prompt is gegenereerd — Microsofts eigen runs gebruikten GPT-Image-2 voor de afbeelding en GPT-5.5 om een korte briefing uit te breiden tot een gedetailleerde contentprompt. De referentie bevat alleen lay-out en stijl; de tekstprompt blijft bepalend voor de inhoud. Vervolgens heeft het model die bij inferentie nauwelijks nodig: als je AesCode-8B de referentie onthoudt, daalt de Visual-score met 1,00 punt van de honderd, tegenover 19,55 voor de backbone en 10,04 voor GPT-5.5. Een gerelateerd resultaat is dat op referenties gebaseerde beloningen de Visual-score op basis van alleen de prompt verhoogden van 25,17 naar 69,71, waardoor de visuele prior in de gewichten terechtkwam in plaats van in de invoer te blijven.

De rest is een verhaal over beloningsontwerp. Supervisie is een "ontwerpgraaf" van knopen en randen — tekst, grafieken, tabellen, kaarten, regio's, afbeeldingsslots, met insluiting, uitlijning, volgorde en verbinding als de randen — gekozen zodat elke eigenschap op het canvas tot een benoemd element behoort en daarom afzonderlijk kan worden gescoord. Zeven kanalen scoren het resultaat: zes deterministische verifieerders voor uitvoering, tekst, grenzen, tabel- en grafiekgegevens, semantische lay-out en witruimte, plus één voorbeeld-specifieke Visual Graph Rubric die door een visueel-taalmodel wordt beoordeeld. Kandidaten worden gerenderd in een gesandboxte Playwright-browser met externe verzoeken geblokkeerd, en de harness leest de DOM, berekende stijlen, bounding boxes en een screenshot terug, daarom moeten tabellen HTML-tabellen zijn en grafieken ECharts-specificaties. De training bestond uit cold-start supervised fine-tuning op 3.000 demonstraties, daarna GDPO over 7.408 prompts gedurende 400 stappen op één node met acht NVIDIA B200's, waarbij elk beloningskanaal binnen zijn rolloutgroep werd genormaliseerd zodat een dicht, op regels gebaseerd signaal het schaarse visuele signaal niet kan overstemmen. Microsoft meet die normalisatie op 5,12 Visual-punten ten opzichte van gewone scalaire GRPO.

Niets van die machinerie bestaat om van AesCode-8B een betere algemene assistent te maken. Het bestaat om de uitvoer controleerbaar te maken, en daarom is de context van het model zoals die is.

Naast elkaar, met de nummers gelabeld

• Base — AesCode-8B: Qwen3-VL-8B-Instruct, een visie-taalcheckpoint. Qwen3-8B: de generalist voor uitsluitend tekst van dezelfde generatie.

• Parameters — AesCode-8B: ongeveer 8,8 miljard bf16 verdeeld over vier shards. Qwen3-8B: ongeveer 8,2 miljard in totaal, ruwweg 7 miljard niet-embedding.

• Invoer — AesCode-8B: tekst plus een optionele referentieafbeelding. Qwen3-8B: tekst.

• Uitvoer — AesCode-8B: een compleet HTML- en CSS-document. Qwen3-8B: tekst, toolaanroepen, code.

• Context — AesCode-8B: 24.576 in de gerapporteerde configuratie. Qwen3-8B: 32K native, 131K uitgebreid via YaRN.

• Talen — AesCode-8B: de tag van de kaart is alleen "en". Qwen3-8B: 119 talen en dialecten.

• Bewijs — AesCode-8B: Microsofts eigen infographic-rubric met 300 samples, drie generaties per prompt, geen externe reproductie. Qwen3-8B: achttien maanden onafhankelijke benchmarks, kwantisatiewerk en productie-implementatie.

• Licentie — Beide Apache 2.0, zonder drempels. Een gelijkspel, en niet het onderscheidende kenmerk dat mensen denken dat het is.

Het bewijsgat is de echte vergelijking.

Microsoft rapporteert AesCode-8B met 82,94 Overall op zijn beoordelingskader, vóór referentiegeconditioneerde GPT-5.5 met 81,28 en Claude Opus 4.8 met 80,39, en 31,1 Visual-punten boven zijn eigen referentiegeconditioneerde backbone. Drie cijfers in die tabel zijn meer waard dan de kop. De eerste is Style, waar AesCode-8B op 53,21 staat en geen enkel model in de vergelijking boven de 60 uitkomt — en Microsofts definitie van Style is ontwerp dat geen verdere visuele revisie nodig heeft voordat het wordt opgeleverd, dus op de enige dimensie die vraagt of een mens de pagina ongewijzigd zou opleveren, is het model niet de koploper. De tweede is de grensgevalfout: een ernstige canvas-overloop keert terug bij 4,3% van de 300 samples, tegenover 34,7% voor GPT-5.5. De derde is dat de visuele helft van de score afkomstig is van een niet bij naam genoemde vision-language-beoordelaar, wat betekent dat de deterministische helft door een buitenstaander reproduceerbaar is en de andere helft niet.

De cijfers van Qwen3-8B komen ergens heel anders vandaan, en dat is belangrijker dan welke set hoger is. Achttien maanden van onafhankelijke evaluatie, community-kwantisaties, serving-benchmarks en productie-implementaties is een ander soort bewijs: het is geen bewering, het is een trackrecord. Je kunt erachter komen hoe Qwen3-8B zich gedraagt onder vier-bits kwantisatie op een specifieke kaart, omdat iemand het heeft gepubliceerd. Dat kun je niet doen voor AesCode-8B, want vanaf deze week heeft niemand buiten Microsoft het op wat dan ook gedraaid.

En er is geen gedeelde maatstaf tussen de twee tabellen. Qwen3-8B heeft geen infographic-layoutscore; AesCode-8B heeft helemaal geen gepubliceerde benchmark voor algemeen redeneren. De vergelijking is niet dichtbij of niet dichtbij — die is niet beschikbaar.

Wat het daadwerkelijk vergt om elk ervan te draaien

A screenshot of the OrcaRouter model page for qwen/qwen3-vl-8b-instruct showing the Vision, Tools and JSON capability badges, the byline "by Qwen - 2025-10-14", the description "Qwen3-VL 8B Instruct - open-weight small vision-language model, 8B params, 128k context, no thinking mode", the pricing row reading $0.18 input and $0.70 output per million tokens, and the OpenAI-compatible code sample against the https://api.orcarouter.ai/v1 base URL.

Qwen3-8B is de makkelijke. Een 8.2B-tekstmodel quantiseert op één consumentenkaart, heeft achttien maanden tooling achter zich in elk servingframework en elke lokale runtime, en gedraagt zich voorspelbaar. De contextuitbreiding naar 131K is gedocumenteerd in plaats van folklore, en de dekking van 119 talen is de reden dat het in zoveel meertalige pipelines opduikt.

AesCode-8B is een servingproject. Het eigen commando van de kaart is vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, met transformers 4.57 of nieuwer voor het niet-vLLM-pad. De 17,5 GB aan bf16-gewichten moet naast een KV-cache voor 24.576 tokens en maximaal twee afbeeldingen passen, dus één 24 GB-kaart is technisch voldoende en onaangenaam krap, en 40-48 GB of twee 24 GB-kaarten is de realistische ondergrens. Reken ook op een renderer, want elke bewering over de kwaliteit van dit model is gedaan door de HTML-uitvoer ervan in een sandboxbrowser te renderen — als je wilt weten of je eigen uitvoer goed is, is dat de harness die je moet opzetten. En let op: de context van 24.576 tokens is getest op afzonderlijke infographicpagina's, niet op de presentaties met meerdere dia's waarvoor het model is bedoeld, dus contextdruk op een echt deck is ongetest terrein.

Beschikbaarheid is de andere helft van hetzelfde punt. AesCode-8B is niet iets dat OrcaRouter routeert, en we konden het ook nergens anders aangeboden vinden; een evaluatie vandaag betekent gewichten op je eigen hardware. De voorouder ervan is een ander verhaal — Qwen3-VL-8B-Instruct is nu aanroepbaar via OrcaRouter voor $0,18 per miljoen inputtokens en $0,70 per miljoen output bij een context van 131.072 tokens, wat het de goedkoopste manier maakt om te zien wat de niet-afgestemde versie van deze exacte architectuur doet op je eigen infographic-prompts. Verderop in dezelfde lijn is Qwen3.8-27B routeerbaar voor $0,33 en $2,40. De lijstprijs van de provider wordt één-op-één doorgegeven zonder dat er een opslag wordt toegevoegd en failover tussen providers is automatisch, dus het prototypen van de prompt tegen de gehoste backbone kost één sleutel in plaats van een GPU-week, en alleen de prompts die daadwerkelijk goed renderen verdienen het reproductiewerk.

A Hugging Face screenshot of the microsoft/AesCode-8B model card showing 0 likes at capture time, the Microsoft organisation follower count, the Image-Text-to-Text, Transformers, Safetensors and English tags with qwen3_vl and code-generation, an Apache-2.0 licence badge, and the opening card text describing AesCode as generating information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS, followed by the line that AesCode-8B starts from Qwen3-VL-8B-Instruct.

Welke je wilt, hangt af van het artefact

Kies AesCode-8B wanneer het eindproduct een pagina is en die bewerkbaar moet zijn. Gestructureerde HTML-uitvoer die in Git difft, tabellen als echte tabellen en grafieken als ECharts-specificaties, is een wezenlijk ander artefact dan een alinea tekst, en geen enkele hoeveelheid algemene capaciteit komt daarvoor in de plaats. Ga die afweging bewust aan: een onaangekondigd onderzoekscheckpoint met een downloadaantal in de dubbele cijfers, een context van 24K, alleen Engels, geen onafhankelijke evaluatie, een Style-plafond dat de eigen leverancier publiceert, en een serveerrekening gemeten in tientallen gigabytes.

Kies Qwen3-8B voor al het overige — wat voor de meeste teams alles is. Het is de bewezen generalist in deze gewichtsklasse, het heeft een langere context, het spreekt honderdnegentien talen, het draait op hardware die je al bezit, en het heeft achttien maanden productie-ervaring van anderen achter de beslissingen die je op het punt staat te nemen. Als je geen specifieke behoefte hebt om gerenderde pagina's te genereren, heeft deze vergelijking één antwoord.

Het argument om beide te willen is reëel, en het is geen tiebreak. Een pipeline die documenten leest en decks produceert, gebruikt twee modellen met twee echt verschillende uitvoertypen, en de nuttige houding is om de paginarenderaar op hardware te houden die hem aankan en het lees- en redeneerwerk te routeren naar iets dat achter hetzelfde endpoint wordt gehost als al het andere.

Wat zou deze pagina een betere closer maken?

Drie dingen, en slechts één ervan gaat over benchmarks. Een onafhankelijke reproductie van de 82,94 en de referentiedaling van 1,00 punt zou AesCode-8B van leveranciersclaim naar resultaat tillen, en zou de vraag over de 8B-versus-8B-grootte op zijn merites beantwoord kunnen worden. Een provider die het checkpoint oppakt, zou de deploymentkolom laten instorten en "een GPU-week" omzetten in "een API-call". En de paper die de kaart citeert als zijnde in review — "AesCode: A Code Generation with Decoupled Cross-Modal Rewards" — zou de vraag beantwoorden die de modelkaart niet kan: wat de visuele rubric doet wanneer de design graph waartegen hij scoort zelf verkeerd is.

Totdat een daarvan beschikbaar komt, is de verdedigbare lezing de beperkte. AesCode-8B is het interessantere van deze twee modellen en het minder bruikbare. Het is zeer goed in de delen van visueel ontwerp die een machine kan controleren, middelmatig in het deel dat niet geautomatiseerd kan worden, en het behoort tot dezelfde Qwen3-generatiefamilie als het model waarmee het wordt vergeleken, zonder ervan af te stammen. Qwen3-8B is het model dat je vanmiddag in een pipeline kunt zetten.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt